
Ce qu'est réellement Qwen3.8-Max
Qwen (Tongyi Qianwen) est la famille de modèles d'Alibaba Cloud, couvrant le texte, la vision, l'audio, le code et les agents. Le palier "Max" est la ligne phare propriétaire, au-dessus des paliers moins chers Plus et Turbo et au-dessus des points de contrôle à poids ouverts de Qwen3. Qwen3.8-Max est le plus récent, et Alibaba l'a présenté en aperçu sous le nom "Qwen3.8-Max-Preview" le 19 juillet 2026.
Voici la version honnête, car le lancement lui-même a été étonnamment léger. Il n'y a eu ni article de blog officiel, ni fiche modèle, ni tableau de benchmarks lors de l'aperçu, juste deux publications sur X de l'équipe Qwen et un point de terminaison d'aperçu fonctionnel et payant. Donc l'essentiel de ce qui suit est le propre récit d'Alibaba, que personne en dehors du laboratoire n'avait encore vérifié de façon indépendante.
Les spécifications qu'Alibaba annonce :
- 2,4 mille milliards de paramètres au total, une conception éparse de type Mixture-of-Experts (Qwen sur X).
- Premier Qwen multimodal au-delà de 1 000 milliards de paramètres, gérant texte, images, vidéo et documents, selon le chercheur principal Shuai Bai.
- Une fenêtre de contexte d'un million de tokens, reprise de son prédécesseur Qwen3.7-Max.
- Visant le codage, les workflows agentiques et les tâches de "collaboration professionnelle" à long horizon, où Alibaba affirme dépasser Qwen3.7-Max.
Le nombre de paramètres actifs par token, la suite complète de benchmarks et la licence manquaient tous lors de l'aperçu. Alibaba a dit qu'ils arriveraient. En attendant, il faut traiter ces caractéristiques internes comme du marketing, pas comme une mesure.
Sous le capot : comment fonctionne Qwen3.8-Max
C'est là qu'un nombre de paramètres gigantesque cesse d'être le titre. Un modèle dense de 2,4T serait bien trop coûteux à faire tourner, donc Qwen3.8-Max est un modèle Mixture-of-Experts : la plupart de ces paramètres restent inactifs sur un token donné, et seule une petite fraction s'active. C'est la même astuce qui permet aux paliers moins chers de Qwen de battre leurs rivaux sur le prix, mise à l'échelle.

La partie multimodale est le vrai saut pour la ligne Max. Les modèles Max précédents étaient d'abord centrés sur le texte ; ici, Alibaba affirme que le modèle absorbe nativement images, vidéo et documents aux côtés du texte, ce que Shuai Bai a signalé comme le détail inédit :
"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."
Le hic qui mérite d'être répété : le ratio de sparsité, le nombre d'experts et la recette d'entraînement n'ont pas été publiés. On connaît donc la forme qu'Alibaba décrit (immense, éparse, multimodale) mais pas les chiffres qui permettraient de la reproduire ou de la classer. C'est un vrai manque pour un modèle qui revendique une place dans le top deux.
Ce qu'Alibaba affirme sur les performances
Voici la phrase que tout le monde a citée. Le propre message de lancement de l'équipe Qwen la situe face au sommet du secteur :
"Qwen3.8 is launching and going open-weight soon! With a massive 2.4T parameters, this model is continuously evolving. We believe it's one of the most powerful models available today... second only to Fable 5."
"Juste derrière Fable 5" est un pari audacieux, Fable 5 étant l'actuel modèle Claude haut de gamme. Le problème, c'est qu'il n'y a rien derrière pour l'instant : aucun graphique de benchmark, aucun score d'indice indépendant, aucune fiche modèle. Pour comparer, le fleuron précédent Qwen3.7-Max a été lancé en mai 2026 avec de vrais chiffres, 80,4% sur SWE-bench Verified et le modèle chinois le mieux classé sur l'indice d'intelligence Artificial Analysis à l'époque. Qwen3.8-Max est arrivé avec l'assurance mais sans les preuves.
Il y a aussi un schéma qui mérite d'être signalé, avec prudence. Qwen a une longue habitude d'occuper la tête des classements de téléchargements des modèles ouverts et de publier de solides résultats de benchmarks, et une critique récurrente est qu'il peut paraître plus fort sur les évaluations que dans un usage réel désordonné. Une auto-déclaration de "top deux" avant tout test indépendant est donc exactement le genre d'affirmation à prendre avec des pincettes.
Le prix de Qwen3.8-Max
C'est la partie qui a vraiment retenu l'attention des développeurs. Pendant l'aperçu, Qwen3.8-Max est vendu à 10% du tarif standard via trois canaux : l'abonnement Token Plan d'Alibaba, et ses produits de codage agentique Qoder et QoderWork. Il n'y a pas encore de tarif d'API par token autonome publié, ce qui est inhabituel pour un modèle Max.
Les paliers Personal du Token Plan se présentent ainsi :
| Palier | Mensuel | Quota de crédits sur 7 jours | Quota de crédits sur 5 heures |
|---|---|---|---|
| Lite | ~6 $ (39 CNY) | 2 500 crédits | 700 crédits |
| Standard | ~20 $ (139 CNY) | 10 000 crédits | 3 000 crédits |
| Pro | ~70 $ (499 CNY) | 40 000 crédits | 12 000 crédits |
Source : Alibaba Cloud Token Plan (édition Personal). En plus du tarif d'aperçu à 10%, Alibaba ajoute une remise de nuit, soit 80% de réduction supplémentaire sur la consommation de crédits entre 22h00 et 08h00 (UTC+8), ce qui revient à environ 0,2% du tarif standard pour les exécutions en heures creuses. C'est agressif, et clairement conçu pour pousser les gens à tester l'aperçu à moindre coût.
Le modèle de crédits par abonnement est aussi exactement ce dont les utilisateurs de Qwen se sont plaints par le passé. Sur la génération précédente, des utilisateurs de Reddit ont signalé que les crédits s'épuisaient bien plus vite que prévu, et les modèles Qwen ont tendance à générer plus de tokens de sortie par tâche que leurs pairs, ce qui gonfle discrètement le coût réel même quand le tarif affiché paraît bas. La remise d'aperçu masque cela pour l'instant. Quand elle prendra fin, il faudra prévoir le budget.
Un détail utile : le point de terminaison du Token Plan parle à la fois le protocole d'API OpenAI et Anthropic, donc des clients tiers comme Claude Code, Cursor, Cline et Codex fonctionnent d'emblée dès qu'on émet une clé. Si vous vivez déjà dans l'un de ces outils, essayer l'aperçu est l'affaire de cinq minutes.
Faut-il se lancer sur Qwen3.8-Max dès maintenant ?
L'aperçu est bon marché et facile à essayer, ce qui fait de "dois-je basculer dessus" la mauvaise question, et de "qu'est-ce que je teste réellement" la bonne. Parcourez la décision ci-dessous avant de reconstruire quoi que ce soit d'important autour d'un aperçu.
La vue d'ensemble : une course aux poids ouverts entre labos chinois
En écartant les détails, voici pourquoi Qwen3.8-Max est devenu tendance : il est arrivé quelques jours après le modèle de 2,8 mille milliards de paramètres Kimi K3 de Moonshot AI, et Alibaba détient justement environ 36% de participation dans Moonshot. Deux labos de la même sphère se livrent donc désormais une course pour fixer le plafond de taille des modèles quasi frontière, et tous deux promettent des poids ouverts. Sur Hacker News, le commentaire le mieux noté a interprété ce timing exactement de cette façon :
"I assume that this announcement has been prompted by that of Moonshot AI... I wonder if Alibaba has always planned to make this big LLM open weights, or they have chosen to do this now, to better compete with Moonshot AI."
La lecture à laquelle beaucoup sont arrivés est que rendre l'intelligence de pointe une simple marchandise est en soi la stratégie, et que c'est bon pour tout le monde en aval, quel que soit le motif :
"The Chinese firms seem to be working hard to commoditize intelligence which may be the most effective way to debase American frontier labs. And yeah: it also happens to be really good for humanity."
Pour un acheteur, ce qui compte n'est pas de savoir quel labo gagne. C'est que la couche modèle devient moins chère et meilleure toutes les quelques semaines, et le geste malin consiste à construire de façon à pouvoir changer le moteur sans avoir à retuyauter tout ce qui l'entoure.
Là où un modèle de pointe s'arrête, et où le travail de support commence
Passons maintenant à la partie qui me tient le plus à cœur, parce que je construis des agents IA pour vivre. Il est tentant de lire une annonce comme celle-ci et de penser "super, je branche le meilleur modèle et ma file de support se résout toute seule." Ça ne marche pas comme ça, et c'est exactement dans cet écart que la plupart des projets de support IA échouent silencieusement.

Un modèle comme Qwen3.8-Max vous donne un raisonnement brut. Ce qu'il ne vous donne pas, c'est la moindre idée de votre politique de remboursement, de vos cas limites produit, ou du fait que le ticket #4021 est un VIP qui a déjà écrit deux fois. Il n'a aucune mémoire de vos tickets passés, aucun garde-fou pour l'empêcher d'inventer une réponse avec assurance, et aucune connexion au helpdesk où le travail se déroule réellement. Un nombre de paramètres plus élevé ne corrige rien de tout cela.
Cela fait des années que nous mettons de l'IA sur des files de support en production, et la leçon qui est restée, c'est qu'un modèle qui sonne sûr de lui en donnant une mauvaise réponse est pire que pas de réponse du tout. Le bot d'un client payant a confirmé joyeusement qu'il prenait en charge des modèles de produits qui n'étaient même pas dans sa base de données, parce que le centre d'aide disait "nous prenons en charge tous les modèles." C'est exactement le mode de défaillance qu'un modèle brut d'aperçu rend plus probable, pas moins, précisément parce qu'il paraît si sûr de lui. Comme me l'a dit un responsable support :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."
a DTC brand CX lead handling 7,000 tickets a month
C'est pourquoi eesel AI exécute une simulation sur votre historique de tickets avant que quoi que ce soit ne passe en production, pour que vous voyiez d'abord le taux de résolution et les réponses exactes sur de vraies conversations passées, pas après qu'un client se soit fait avoir. C'est aussi pourquoi les réponses sont acheminées selon la confiance : si l'agent n'est pas sûr, il rédige un brouillon pour un humain ou fait remonter le ticket plutôt que de deviner. En procédant ainsi, Gridwise a atteint 73% de résolution des tickets de niveau 1 dès le premier mois.
Et vous pourriez connecter vous-même un modèle comme Qwen3.8-Max à votre pile technique. La plupart des équipes constatent que la maintenance est le vrai coût, ce qui est exactement l'arbitrage construire-ou-acheter qu'un client a résumé avec justesse : "Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas y investir notre temps. Nous voulions quelque chose que nous n'aurions pas à maintenir." Le modèle sous-jacent compte bien moins que cette enveloppe, ce qui est la bonne nouvelle discrète concernant Qwen3.8-Max, Kimi K3, ou peu importe ce qui gagnera le mois prochain : une IA pour le service client bien conçue hérite de chaque avancée de pointe sans que vous ayez à retuyauter quoi que ce soit.
Essayer eesel AI
Si vous êtes arrivé ici parce que vous voulez un modèle d'IA qui résout réellement les tickets et ne se contente pas de discuter, c'est exactement l'objectif d'eesel AI. Il se connecte à Zendesk, Freshdesk, Slack et plus de 100 autres outils, apprend de votre centre d'aide et de vos tickets passés, et commence à rédiger ou résoudre en quelques minutes, pas en semaines.

Ce qui fait la différence, c'est la rampe de confiance : simulez sur votre historique de tickets réel, consultez les chiffres, démarrez en mode brouillon, et passez en pleine autonomie seulement quand vous êtes satisfait. Vous obtenez l'intelligence du modèle de pointe avec des garde-fous conçus pour le support. Essayez eesel gratuitement, sans carte bancaire.
Questions fréquentes
Qu'est-ce que Qwen3.8-Max ?
Combien coûte Qwen3.8-Max ?
Qwen3.8-Max est-il open source ?
Qwen3.8-Max est-il meilleur que Kimi K3 ou Claude ?
Puis-je utiliser Qwen3.8-Max avec Claude Code ou Cursor ?
Puis-je utiliser Qwen3.8-Max pour le support client ?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








