
Pourquoi c'est moi qui vous dis de lever le pied
Je construis des agents IA chez eesel, et mon travail quotidien, c'est la partie ennuyeuse que personne ne prend en capture d'écran : ce qui se passe après que le modèle a donné une réponse. On a vu un modèle au ton assuré transmettre tranquillement la mauvaise politique de remboursement à un client, et c'est précisément pour ça que chaque déploiement eesel est désormais simulé sur des tickets historiques avant de toucher une vraie boîte de réception.
Alors quand un modèle de 2 400 milliards débarque avec une bannière « juste derrière Fable 5 », mon premier réflexe n'est pas l'enthousiasme, mais : montrez-moi l'évaluation, montrez-moi les paramètres actifs, et montrez-moi ce qu'il fait sur le 200e ticket, pas sur celui de la démo. Cet avis est écrit depuis cette position. Si vous voulez la fiche technique brute, l'aperçu de Qwen l'a. Si vous voulez savoir si Qwen 3.8 Max change quelque chose pour une vraie équipe cette semaine, continuez à lire.
Ce qu'est vraiment Qwen 3.8 Max
Qwen 3.8 Max est le porte-étendard de la famille Qwen d'Alibaba, et le premier modèle multimodal de l'équipe à dépasser les 1 000 milliards de paramètres. La forme confirmée, d'après l'annonce d'Alibaba elle-même :
- 2 400 milliards de paramètres au total, construit comme un modèle Mixture-of-Experts (MoE) épars, donc seule une fraction de ces paramètres s'active pour un token donné.
- Multimodal : il traite le texte, les images, la vidéo et les documents dans un seul modèle.
- Fenêtre de contexte de 1M de tokens, héritée de Qwen 3.7 Max.
- Compatible API avec les protocoles OpenAI et Anthropic, ce qui permet de pointer les outils existants dessus sans réécriture.
- Selon Alibaba, il surpasse Qwen 3.7 Max en codage, développement full-stack, analyse de données et flux de travail bureautiques.

Le mot qui fait tout le travail ici, c'est Preview. Le nom public est Qwen3.8-Max-Preview. Le développeur Shuai Bai l'a décrit comme un modèle « en évolution continue », ce qui, en clair, signifie : c'est une cible précoce et mouvante, pas une version figée.
Le chiffre qu'Alibaba n'a pas publié
Le nombre total de paramètres fait un très bon titre. Le chiffre qui détermine réellement votre coût et votre vitesse, ce sont les paramètres actifs, c'est-à-dire combien de ces 2 400 milliards s'activent par token. Alibaba ne l'a pas communiqué. Ce n'est pas un détail. Pour un modèle MoE, les paramètres actifs sont ce qui détermine l'essentiel du coût de service, de la latence, et de la question de savoir si on pourrait un jour l'exécuter soi-même. Un modèle de 2 400 milliards avec, disons, 40 milliards de paramètres actifs se comporte très différemment sur votre facture qu'un modèle avec 200 milliards actifs. Tant que ce chiffre n'est pas public, toute affirmation du type « c'est bon marché à faire tourner » ou « c'est cher à faire tourner » n'est qu'une supposition.
L'affirmation « juste derrière Fable 5 », décortiquée
C'est la phrase que tout le monde a répétée, alors soyons précis sur ce qu'elle est et n'est pas.
Sur son compte officiel, Qwen positionne le modèle comme « l'un des modèles les plus puissants disponibles aujourd'hui... juste derrière Fable 5 ». L'action Alibaba a même grimpé après l'annonce.
Voici le hic : il n'existe aucun tableau de benchmarks publié. Aucun chiffre ne montre qu'il bat Fable 5, qu'il est derrière, qu'il bat GPT-5.1, ou qu'il bat Claude Opus. Le classement repose entièrement sur l'évaluation interne d'Alibaba, et aucun tiers (Artificial Analysis, LMArena) ne l'a encore noté. Sur Hacker News, les sceptiques ont vite fait remarquer que Qwen a la réputation d'être un spécialiste des benchmarks, et « faites-nous confiance, on est numéro 2 » est exactement le genre d'affirmation qu'un tableau de benchmarks sert à trancher.
A 2.4T-parameter multimodal preview shipped before any benchmark, model card, or license.
Voilà l'état honnête des choses. Je ne dis pas que l'affirmation est fausse, je n'en sais rien, et personne en dehors de l'équipe d'évaluation d'Alibaba n'en sait rien non plus. Ce que je dis, c'est qu'il faut traiter « juste derrière Fable 5 » comme du marketing tant qu'un tiers ne l'a pas noté, exactement comme pour n'importe quel autre lancement de modèle.
Tarifs et accès : ce qu'on peut vraiment tester aujourd'hui
Qwen3.8-Max-Preview est accessible via trois canaux : l'abonnement Token Plan d'Alibaba, ainsi que les plateformes agentiques Qoder et QoderWork. Pendant la phase d'aperçu, le prix est de 10 % du tarif standard.
Le Token Plan fonctionne par crédits, renouvelés sur une fenêtre de 7 jours :
| Palier | Prix | Crédits (par 7 jours) | À noter |
|---|---|---|---|
| Lite | 6 $ | 2 500 | Palier d'entrée pour tester l'aperçu |
| Pro | 68 $ | 40 000 | Fait tourner 6 à 8 agents en parallèle |
Quelques points à noter avant de sortir la carte bancaire :
- Aucun tarif par token n'est publié spécifiquement pour 3.8 Max. Si vous avez besoin d'un tarif par token prévisible dès aujourd'hui, les anciens paliers Qwen sont un choix plus sûr.
- Des crédits, pas des tokens. Les systèmes de crédits rendent le coût difficile à prévoir, surtout quand le modèle sous-jacent est un aperçu « en évolution continue » dont la consommation peut changer sans prévenir.
- La remise de 10 % pendant l'aperçu est temporaire par définition. Budgétez sur le tarif sans remise, pas sur le tarif promotionnel.

Le test de réalité du self-hosting
« Open-weight bientôt » est la phrase qui a enthousiasmé r/LocalLLaMA, avant que la communauté ne fasse le calcul.
Un modèle de 2 400 milliards en précision 4 bits nécessite environ 1,2 téraoctet rien que pour les poids. Une seule Nvidia H200 embarque 141 Go. Même une machine à 8 cartes laisse une arithmétique peu pratique et une liste très courte de personnes capables de réellement le charger. Le constat pratique : le self-hosting de Qwen 3.8 Max n'est pas quelque chose que les équipes classiques feront, poids disponibles ou non, tant qu'une variante distillée ou plus petite n'apparaît pas. La promesse d'open-weight compte pour la communauté de recherche et une poignée de laboratoires bien financés, pas pour l'acheteur moyen qui choisit un helpdesk IA.
Et « bientôt » n'a ni date, ni licence, ni dépôt Hugging Face pour l'instant. Si votre projet dépend de l'exécution en interne, ce projet n'est pour l'instant que du vent.
Alors, faut-il l'utiliser ? (un widget de décision honnête)
La réponse dépend vraiment de ce que vous voulez faire. Voici l'avis que je donnerais pour chaque situation :
Où ça se situe pour une équipe support
Voici la partie qui me tient le plus à cœur, parce que c'est là où j'ai vu des équipes brûler des mois.
Un modèle frontière est un moteur brut. Pour répondre à un client en toute sécurité, il faut toujours tout ce qui l'entoure : du retrieval sur votre centre d'aide et vos tickets passés, des garde-fous pour qu'il ne réponde qu'aux questions où il est sûr de lui, une transmission propre à un humain, des rapports, et un moyen de tester les changements avant qu'ils n'atteignent de vraies personnes. Qwen 3.8 Max n'offre rien de tout ça. Il offre un moteur texte-et-vision très puissant, très capable, et une clé API.
L'instinct « on va juste le construire nous-mêmes sur le tout dernier modèle » est puissant, et il sous-estime presque toujours cette couche environnante. Un client d'eesel a résumé le choix build-vs-buy avec des mots simples :
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Voilà le compromis. Vous pouvez brancher Qwen 3.8 Max vous-même dans votre helpdesk et en assumer la maintenance pour toujours, ou vous pouvez utiliser une couche qui l'a déjà fait. eesel est conçu volontairement pour être agnostique au modèle : il tourne sur des modèles frontières en coulisses, se connecte à votre helpdesk existant et à votre base de connaissances en quelques minutes, et vous permet de simuler sur de vrais tickets historiques pour voir le taux de résolution avant la mise en production, et non après qu'un client se plaigne.

Et il y a un point de contrôle que les gens oublient : la responsable CX d'une marque de compléments alimentaires DTC que je cite souvent l'a très bien résumé : « J'ai besoin d'une IA qui ne traite que les tickets où elle est sûre d'elle, et qui laisse tous les autres tranquilles. » Aucun modèle, aussi grand soit-il, ne donne ce curseur à lui seul. La couche, si.
Comment Qwen 3.8 Max se positionne face au reste
Pour quiconque compare les modèles en juillet 2026, Qwen 3.8 Max est l'une de trois grandes sorties semi-ouvertes en l'espace de deux semaines :
- Kimi K3 (Moonshot) est sorti en véritable open-weight, ce qui fait paraître le « bientôt » de Qwen assez réactif.
- GPT-5.6 et Claude restent la frontière fermée à laquelle Qwen se mesure.
- Grok, Gemini et Mistral complètent le champ des modèles qu'on évaluerait réellement.
Le facteur de différenciation sur lequel Qwen s'appuie, c'est l'échelle plus la promesse d'open-weight. Mais pour quiconque compare des agents IA pour un usage professionnel, le classement brut des modèles n'est pas le bon axe. Ce qui compte, c'est le produit construit par-dessus, et sur cet axe, un aperçu à 2 400 milliards ne rivalise encore avec rien, parce qu'il n'y a pas de produit, juste un moteur. Pour construire des agents destinés à un vrai usage, le guide des meilleurs agents IA est un bien meilleur point de départ que l'affirmation de benchmark d'un seul modèle.
Mon verdict
Qwen 3.8 Max est un aperçu intéressant et un signal clair que les laboratoires chinois s'engagent à fond dans la course à l'échelle. Mais comme quelque chose sur lequel parier cette semaine, c'est encore prématuré : pas de benchmarks, pas de nombre de paramètres actifs, pas de licence, pas de self-hosting réaliste, et une tarification d'aperçu à crédits qui va évoluer. Testez-le pour 6 $ si vous êtes curieux. Ne bâtissez pas encore votre feuille de route dessus.
Et si votre véritable objectif, c'est moins de tickets et des réponses plus rapides, le modèle n'a jamais été la partie difficile. La couche autour, elle, l'est.
Questions fréquentes
Qu'est-ce que Qwen 3.8 Max ?
Qwen 3.8 Max est le modèle IA phare d'Alibaba, dévoilé en aperçu le 19 juillet 2026 sous le nom Qwen3.8-Max-Preview. C'est un modèle multimodal Mixture-of-Experts épars de 2 400 milliards de paramètres (texte, images, vidéo, documents) avec une fenêtre de contexte de 1M de tokens. Consultez l'avis complet sur Qwen pour le contexte de toute la famille.
Combien coûte Qwen 3.8 Max ?
Pendant l'aperçu, il coûte 10 % du tarif standard via le Token Plan d'Alibaba, qui fonctionne par crédits : d'un palier Lite à 6 $ (2 500 crédits par 7 jours) à un palier Pro à 68 $ (40 000 crédits, 6 à 8 agents simultanés). Aucun tarif par token dédié à 3.8 Max n'est encore publié ; pour cela, consultez les tarifs actuels de Qwen.
Qwen 3.8 Max est-il vraiment « juste derrière Fable 5 » ?
C'est une affirmation propre à Alibaba, basée sur des évaluations internes. Aucun tiers (Artificial Analysis, LMArena) ne l'a encore noté, et aucun tableau de benchmarks n'a été publié, donc il faut la traiter comme une affirmation de positionnement, pas comme un classement vérifié, exactement comme pour n'importe quel lancement de modèle frontière.
Puis-je self-hoster Qwen 3.8 Max ?
Pas de façon réaliste aujourd'hui. Alibaba a promis des poids ouverts « bientôt », mais sans date, licence ni dépôt. Et avec environ 1,2 To de poids (en 4 bits) contre 141 Go par GPU H200, aucun déploiement pratique sur une seule machine n'est possible pour des équipes classiques tant qu'une variante plus petite ou distillée n'est pas sortie. La plupart des acheteurs sont mieux servis par un helpdesk IA géré.
En quoi Qwen 3.8 Max diffère-t-il de Qwen 3.7 Max ?
Selon Alibaba, 3.8 Max surpasse 3.7 Max en codage, développement full-stack, analyse de données et flux de travail bureautiques, et c'est le premier modèle multimodal de l'équipe à dépasser 1 000 milliards de paramètres. La fenêtre de contexte de 1M de tokens est conservée. Pour les détails de la génération précédente, voir l'aperçu de Qwen.
Qwen 3.8 Max est-il adapté au service client ?
En tant que modèle brut, il n'a aucune fonctionnalité de support, ni retrieval, garde-fous, escalade ou analytics. Il faudrait construire cette couche soi-même. Pour le support spécifiquement, un outil conçu pour ça comme eesel, qui tourne sur des modèles frontières et se connecte à votre helpdesk, est une voie plus rapide et plus sûre que de brancher soi-même une API en aperçu. Comparez les options dans le comparatif de la meilleure IA de service client.
Quelles sont les meilleures alternatives à Qwen 3.8 Max ?
Pour les modèles bruts, Kimi K3, GPT-5.x, Claude et Gemini sont les comparaisons directes. Pour un usage support, tournez-vous vers les agents IA pour le service client plutôt que vers un seul modèle. Il existe aussi une liste plus complète d'alternatives à Qwen.

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








