
Le tableau en 60 secondes
Tout ce qui suit provient des pages publiées par chaque fournisseur, à la date du 3 août 2026. Là où les deux fournisseurs mesurent la même chose différemment, je l'ai signalé plutôt que de gommer la différence.
| Qwen 3.8 Max | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | |
|---|---|---|---|---|
| ID du modèle | qwen3.8-max | gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna |
| Date de sortie | 2 août 2026 | 9 juil. 2026 | 9 juil. 2026 | 9 juil. 2026 |
| Entrée / 1M | $2,00 | $5,00 | $2,00 | $0,20 |
| Sortie / 1M | $6,00 | $30,00 | $12,00 | $1,20 |
| Entrée en cache / 1M | $0,25 | $0,50 | $0,20 | $0,02 |
| Surcoût contexte long | Non publié | 2x entrée, 1,5x sortie au-delà de 272K | Idem | Idem |
| Fenêtre de contexte | 1 000 000 | 1 050 000 | 1 050 000 | 1 050 000 |
| Sortie max | 131 072 | 128 000 | 128 000 | 128 000 |
| Tokens de raisonnement max | 262 144 | Non publié | Non publié | Non publié |
| Modalités d'entrée | Texte, image, vidéo | Texte, image | Texte, image | Texte, image |
| Paramètres | 2,4T au total, 95B actifs | Non publié | Non publié | Non publié |
| Date limite des connaissances | Non publiée | 16 fév. 2026 | 16 fév. 2026 | 16 fév. 2026 |
| Fiche modèle | Aucune | Oui | Oui | Oui |
| Poids ouverts | Promis, non livrés | Non | Non | Non |
| Limite de débit (palier max) | 15K RPM / 2M TPM | 15K RPM / 40M TPM | Identique à Sol | 30K RPM / 180M TPM |
| Disponible dans un chat grand public | Qwen Studio | ChatGPT | Codex et Work uniquement | Codex et Work uniquement |
| Contrôle du raisonnement | reasoning_effort : low / medium / xhigh | Effort de raisonnement, dont max | Idem | Idem |
Deux lignes méritent un second regard. Qwen est le seul des quatre à accepter la vidéo en entrée, ce qui est un véritable écart de capacité et non un simple argument de fiche technique. Et Qwen est le seul sans date limite de connaissances publiée, sans fiche modèle et sans fiche système, ce qui constitue un véritable manque de preuves.
Ce qu'est réellement Qwen 3.8 Max
Qwen est la famille de modèles d'Alibaba Cloud, et Max en est la ligne phare propriétaire, au-dessus des niveaux moins chers Plus et Turbo. Qwen 3.8 Max est le plus récent, et il est sorti en deux actes.
Pour découvrir d'abord la famille au sens large, mon test de Qwen couvre les niveaux précédents, et le test de Qwen 3.8 Max autonome approfondit ce modèle seul.
Le premier acte s'est joué le 19 juillet à la World AI Conference de Shanghai : un point d'accès en avant-première, deux publications sur X, et une déclaration orale de classement de pointe sans aucun tableau. Le second acte a eu lieu le 2 août, quand Alibaba a publié un article de lancement de 5 000 mots contenant tout ce qui manquait à l'avant-première.
L'architecture, telle que décrite par Alibaba : 2,4 billions de paramètres au total dont 95 milliards actifs, un modèle épars de type mélange d'experts construit sur la base de Qwen 3.5. Ce chiffre de 95 milliards de paramètres actifs est celui qui compte, et celui que l'avant-première avait passé sous silence. Le nombre total de paramètres fait le titre ; le nombre de paramètres actifs détermine votre latence et votre facture.
L'affirmation multimodale est la véritable nouveauté de la ligne Max. La page du modèle d'Alibaba mentionne l'image, le texte et la vidéo en entrée, et l'article de lancement donne des chiffres précis : rapports financiers et PDF de plus de 200 pages, et vidéos de « plus de 100 heures » organisées dans ce qu'Alibaba appelle un graphe de mémoire vidéo. À noter honnêtement : les deux configurations d'environnement publiées par Alibaba dans ce même article ne déclarent que le texte et l'image. La vidéo semble être une voie native de DashScope, pas quelque chose accessible via le point d'accès compatible OpenAI.

Le raisonnement se contrôle via reasoning_effort, qui accepte low, medium et xhigh, xhigh étant la valeur par défaut. Alibaba active aussi preserve_thinking par défaut « pour la meilleure expérience prête à l'emploi », une façon polie de dire que le modèle est réglé pour réfléchir longuement avant de répondre. Gardez cela en tête, car cela revient plus loin comme un problème de coût.
Ce qu'est réellement GPT-5.6
GPT-5.6 n'est pas un seul modèle. Ce sont trois niveaux de capacité devenus disponibles publiquement le 9 juillet : Sol comme fer de lance, Terra comme intermédiaire équilibré, et Luna comme option rapide et économique. J'ai détaillé chacun d'eux dans un test complet de GPT-5.6. Les trois partagent la même fenêtre de contexte de 1 050 000 tokens, le même plafond de sortie de 128 000 tokens, et la même date limite de connaissances du 16 février 2026.
Puis, le 30 juillet, OpenAI a fait quelque chose qui a discrètement remis à zéro toute cette comparaison. L'entreprise a baissé les prix sur deux des trois niveaux :
« À partir du 30 juillet, le tarif de l'API est de $2 par million de tokens en entrée et $12 par million de tokens en sortie pour Terra, et de $0,20 par million de tokens en entrée et $1,20 par million de tokens en sortie pour Luna. Le tarif de Sol reste inchangé. »
Cela représente 20 % de réduction pour Terra et 80 % pour Luna. Sol est resté à $5 et $30. Si vous lisez une comparaison des tarifs de GPT-5.6 écrite à la mi-juillet, elle se trompe jusqu'à un facteur 5 sur Luna.
La même mise à jour a renommé Priority Processing en mode Fast, qui double le prix pour une vitesse jusqu'à 2,5 fois supérieure sur Sol. Et OpenAI a ajouté quelque chose que Qwen n'a pas : un surcoût pour contexte long. Les prompts dépassant 272K tokens en entrée sont facturés à 2x en entrée et 1,5x en sortie pour la requête entière, pas seulement pour le dépassement. Franchir cette limite transforme un appel Sol à $5/$30 en un appel à $10/$45. La véritable fenêtre d'un million de tokens de Sol est donc une fenêtre d'un million de tokens que l'on paie double.
Benchmarks : deux tableaux, aucun arbitre
C'est là que la plupart des comparaisons directes se trompent. Les deux laboratoires publient désormais chacun un tableau. Aucun des deux tableaux n'a été réalisé par un tiers indépendant, et les deux ne peuvent pas être superposés.

Commençons par ce qu'Alibaba a publié, car c'est étonnamment direct : son tableau inclut GPT-5.6 Sol (max) comme colonne de comparaison. Directement issu de ce tableau :
| Benchmark | Qwen 3.8 Max | GPT-5.6 Sol (max) | Vainqueur |
|---|---|---|---|
| SWE-Pro | 67,7 | 64,6 | Qwen |
| TerminalBench-2.1 | 86,6 | 88,8 | Sol |
| PaperBench | 93,0 | 90,5 | Qwen |
| FrontierSWE | 73,5 | 88,8 | Sol, de 15,3 |
| CoWorkBench | 74,8 | 71,5 | Qwen |
| JobBench | 53,4 | 45,4 | Qwen |
| Agents' Last Exam | 52,4 | 53,6 | Sol |
| CharXiv (RQ) | 93,5 | 89,1 | Qwen |
| ERQA | 77,8 | 70,0 | Qwen |
| PerceptionBench | 63,5 | 59,7 | Qwen |
| LVBench | 81,8 | 78,8 | Qwen |
| Vision2Web | 69,0 | 62,1 | Qwen |
| OSWorld-Verified | 86,1 | 83,2 | Qwen |
Treize contre trois en faveur de Qwen, et chaque ligne liée à la vision est une victoire nette pour Qwen. C'est un résultat réel, et je ne vais pas le minimiser.
Mais lisez les notes de bas de page, ce que presque personne ne fait. Alibaba révèle que six des benchmarks de codage sont des évaluations internes maison (QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench, CoWorkBench, RecreationBench), que les scores des concurrents ont été tirés d'environnements mixtes plutôt que de conditions identiques, et que plusieurs lignes sont notées par des modèles rivaux : gemini-3.1-pro-preview évalue PLawBench, Claude Opus 4.6 évalue PaperBench. Il y a aussi une mention admettant que les résultats de Fable 5 « peuvent impliquer des solutions de repli ».
Passons maintenant aux tiers, qui partagent le verdict très nettement en deux. Sur Artificial Analysis, dont l'Intelligence Index v4.1 est un composite automatisé de neuf évaluations, GPT-5.6 Sol obtient 59 points et se classe troisième au général derrière Claude Opus 5 et Claude Fable 5, avec Terra à 55 et Luna à 51.
Sur LMArena, qui repose sur un vote de préférence humaine, qwen3.8-max se classe 5e en Texte avec 1496 points et 4e en WebDev avec 1668 points, devançant les deux fois gpt-5.6-sol-xhigh, classé 15e et 6e. Le même clivage automatisé contre humain apparaît dans ma comparaison GPT-5.6 vs Claude.
Donc : le composite automatisé dit Sol, la préférence humaine dit Qwen. Quiconque ne cite qu'un seul des deux essaie de vous vendre quelque chose.
La lecture de la communauté est plus tranchante. Extrait du fil Hacker News sur l'avant-première :
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
La comparaison de prix que tout le monde interprète à l'envers
L'histoire qui s'est écrite d'elle-même en juillet était qu'un laboratoire chinois avait cassé les prix face à OpenAI. À $2 et $6 contre $5 et $30 pour Sol, c'est vrai. Face au reste de la famille, ça ne l'est pas.

Qwen 3.8 Max égale le prix d'entrée de Terra au centime près et réduit son prix de sortie de moitié. C'est une vraie victoire. Mais Luna fait mieux que Qwen d'un facteur 10 en entrée et 5 en sortie, et il n'existait pas à ce prix quand le récit « les modèles chinois sont moins chers » s'est installé.
Il existe aussi un problème de second ordre, et c'est celui qui détermine les factures réelles. Qwen est livré avec le raisonnement xhigh activé par défaut et preserve_thinking activé. Les modèles verbeux coûtent plus cher que ce que suggère leur tarif affiché, car chaque token de raisonnement est facturé. Artificial Analysis a mesuré que Luna consommait 130 millions de tokens de sortie pour exécuter son indice, contre une médiane de 62 millions, donc cela joue dans les deux sens. Le point clé, c'est que le tarif au token et le coût par tâche sont deux chiffres différents, et un seul des deux figure sur la page tarifaire.
Entrez vos propres volumes :
Une dernière subtilité si vous regardez l'abonnement mensuel bon marché plutôt que l'API. Le point d'accès qwen3.8-max-preview n'a jamais été vendu au token du tout : il n'était disponible que via le Token Plan d'Alibaba, à $6, $18 ou $68 par mois sur les niveaux Personal. Ces forfaits fonctionnent avec des crédits soumis à des fenêtres fixes de 5 heures et 7 jours, les crédits non utilisés ne sont pas reportés, et atteindre l'un des deux plafonds suspend l'accès jusqu'à la réinitialisation de la fenêtre. Alibaba refuse également de publier le coefficient de conversion crédits/tokens, donc il est impossible de calculer son coût à l'avance. L'offre phare de l'avant-première, 10 % des tarifs normaux cumulés à 80 % de réduction supplémentaire entre 22h00 et 8h00, ce qui représente 2 % de la consommation standard, ne s'applique qu'aux forfaits Personal et disparaît avec l'avant-première. Le modèle en disponibilité générale bénéficie à la place d'une remise nocturne fixe de 50 %.
Ce qui décide réellement en pratique
Les benchmarks mesurent la capacité. La production mesure la capacité divisée par la patience. Chaque retour d'expérience concret que j'ai trouvé aboutit à la même plainte, et cela n'a rien à voir avec l'intelligence.
Un développeur a exécuté la même conversion de design riche sur les deux modèles le jour de la sortie :
"Same prompt for both for the conversion. I used OpenCode for the qwen version, but I encountered a significant amount of errors / timeouts while it was running. Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build."
Un autre, après avoir testé côte à côte quatre modèles de pointe pendant plusieurs jours :
"Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA."
Ce même développeur a publié le décompte de tokens pour une tâche d'application web, les données de coût réel les plus utiles publiées à ce jour : Kimi K3 à $5,50, Qwen 3.8 Max à $6,30, Fable 5 à $30. Le tarif bon marché de Qwen est réel, et il lui a quand même fallu 18 millions de tokens en entrée contre 9,5 millions pour Kimi pour le même travail.
Les avis sur le modèle lui-même sont partagés, ce qui mérite d'être dit clairement plutôt que d'être lissé par une moyenne. Un utilisateur a résilié son abonnement Anthropic à cause de cela. Un autre l'a qualifié de « catastrophiquement mauvais », décrivant un modèle qui « reste bloqué dans de longues boucles d'hésitation sans aucun progrès ». Les deux testaient la même version d'avant-première pendant la même quinzaine. Si cet écart vous inquiète, les listes plus sûres sont mes comparatifs d'alternatives à Qwen et d'alternatives à GPT-5.6, ainsi que le test de Kimi K3 pour le troisième prétendant de cette catégorie.
Et certaines choses ne sont tout simplement pas publiées. Il n'existe nulle part de date limite de connaissances pour Qwen 3.8 Max, ni fiche modèle, ni fiche système, ni évaluation de sécurité. Les poids ouverts promis pour « la semaine prochaine » à partir du 2 août n'ont ni licence, ni date, ni dépôt. Si votre processus d'achat exige l'un de ces éléments, la réponse aujourd'hui est qu'il n'existe pas.
Là où un modèle de pointe s'arrête et où commence le travail de support
C'est la partie qui me tient le plus à cœur, car c'est là que je vois des équipes perdre un trimestre entier.

Aucun de ces deux modèles ne connaît votre politique de remboursement. Aucun n'a lu vos 7 000 derniers tickets. Aucun n'a la moindre idée que le client qui vous écrit est sur un forfait entreprise et a déjà été escaladé deux fois. Un score de benchmark n'est pas un agent de support, et c'est dans l'écart entre les deux que la plupart des projets d'automatisation du support par l'IA meurent en silence.
Ce même écart explique pourquoi choisir un helpdesk IA est un exercice différent de choisir un modèle, et pourquoi l'automatisation des tickets repose sur la récupération d'informations plutôt que sur le raisonnement brut.
Nous avons passé des années à faire fonctionner l'IA sur des files de support réelles, et le mode d'échec spécifique est pire que « l'IA ne sait pas ». C'est l'invention avec assurance. Nous avons eu des clients payants dont les bots ont fabriqué des réponses à de vrais clients quand la recherche dans la base de connaissances revenait bredouille : le bot d'une entreprise solaire a inventé des conditions d'abonnement qui n'existaient pas, et un autre a envoyé à un client « Oxygène », tiré du tableau périodique, comme réponse. Rien dans un modèle à 2,4 billions de paramètres n'empêche cela. Un modèle plus grand ne fait que dire la mauvaise chose avec plus de fluidité.
Le levier qui résout réellement ce problème est ressorti lors d'un appel avec un responsable support gérant 7 000 tickets par mois, et cela n'a rien à voir avec le choix du modèle :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
C'est une décision produit, pas une décision de modèle. C'est pourquoi eesel AI exécute une simulation sur des tickets historiques avant que quoi que ce soit ne soit mis en production, afin que vous voyiez d'abord le taux de résolution et les réponses réelles sur de vraies conversations passées.
C'est aussi pourquoi les réponses sont acheminées selon le niveau de confiance, en rédigeant pour un humain ou en escaladant plutôt qu'en devinant. Utilisé de cette façon, Gridwise a atteint 73 % de résolution de premier niveau dès son premier mois.
La lecture stratégique de Qwen 3.8 Max face à GPT-5.6 est donc un peu décevante : construisez de manière à pouvoir changer de moteur. La couche modèle s'améliore et devient moins chère toutes les quelques semaines. Kimi K3 est arrivé quelques jours avant Qwen, le prix de Luna a chuté de 80 % en une seule après-midi, et ce qui dominera le classement en septembre n'y figure pas encore aujourd'hui. Une équipe qui s'est rigidement branchée sur une seule API en juillet est déjà en train de tout recâbler.
C'est aussi la réponse honnête à la question « devrais-je plutôt utiliser Gemini, Grok ou Mistral ? ». Probablement, éventuellement, pour certaines tâches. C'est justement l'argument pour ne pas trop se soucier du gagnant de ce mois-ci.
Alors, lequel choisir ?
Si vous lancez un produit et voulez une réponse unique :
- Travail intensif en vision, vidéo ou documents : Qwen 3.8 Max, largement. Chaque ligne liée à la vision dans le tableau d'Alibaba est une victoire de Qwen, et c'est le seul des quatre à accepter la vidéo, tout court.
- Ingénierie logicielle exigeante : GPT-5.6 Sol. Un score FrontierSWE de 88,8 contre 73,5 n'est pas une marge d'erreur, et c'est le propre chiffre d'Alibaba.
- Volume élevé, sensible à la latence et au coût : GPT-5.6 Luna, et ce n'est même pas serré sur le prix. Attention à la verbosité.
- Un cheval de bataille généraliste où l'on veut le meilleur rapport tarif/capacité : Terra et Qwen 3.8 Max se livrent le vrai combat. Qwen a un prix de sortie deux fois moindre ; Terra est plus rapide et vient avec une fiche modèle, une date limite de connaissances et un point d'accès stable.
- Toute application orientée client : aucun des deux, seul. Choisissez d'abord la couche, et laissez-la choisir le modèle. Le calcul se trouve dans mon analyse des coûts d'un agent, et la liste des meilleurs candidats dans meilleurs agents IA.
Ce que je ne ferais pas, c'est traiter le tableau du 2 août comme définitif. Six de ces benchmarks de codage sont ceux d'Alibaba lui-même, aucun tiers ne les a réexécutés, et le verdict de la communauté sur la même version va de « j'ai résilié mon abonnement Anthropic » à « catastrophiquement mauvais ». Laissez passer un mois et attendez des chiffres indépendants.
Essayer eesel
Si vous êtes arrivé ici parce que vous voulez un modèle qui résout des tickets plutôt qu'un modèle qui gagne des classements, c'est tout l'objet d'eesel AI. Il se connecte à Zendesk, Freshdesk et plus de 100 autres outils, apprend de votre centre d'aide et de vos tickets passés, et commence à rédiger des réponses en quelques minutes.

Le facteur différenciant, c'est la montée en confiance progressive, pas le moteur. Simulez sur votre historique de tickets réel, lisez les chiffres, démarrez en mode brouillon, et passez en autonome seulement une fois satisfait. Vous héritez de chaque progrès de pointe, que ce soit Qwen, GPT-5.6 ou ce qui sortira le mois prochain, sans jamais avoir à tout recâbler. Essayez eesel gratuitement, sans carte bancaire.
Questions fréquentes
Qwen 3.8 Max est-il moins cher que GPT-5.6 ?
Lequel est le meilleur pour coder, Qwen 3.8 Max ou GPT-5.6 Sol ?
Quelle est la fenêtre de contexte de Qwen 3.8 Max face à GPT-5.6 ?
Qwen 3.8 Max est-il open source ?
Puis-je utiliser Qwen 3.8 Max ou GPT-5.6 pour le service client ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








