
The comparison everyone wants does not exist yet
Commençons par le point gênant, car tous les autres articles sur ce duel passent dessus.
Une comparaison de modèles nécessite deux jeux de chiffres. Anthropic a publié les siens : une fiche système, une grille tarifaire, plus tout un mur de partenaires de lancement nommés donnant des chiffres officiels. Alibaba a publié deux posts sur X et un point d'accès payant fonctionnel. C'est toute la base de preuves pour un modèle qu'ils qualifient de deuxième meilleur au monde.

Pour mesurer à quel point c'est éloigné des standards d'Alibaba elle-même : le précédent modèle phare Qwen3.7-Max a été lancé en mai 2026 avec de vrais chiffres à l'appui, 80,4 % sur SWE-bench Verified, et le rang le plus élevé pour un modèle chinois sur l'index Artificial Analysis à cette époque. Qwen3.8-Max est arrivé avec l'assurance, mais sans aucune des preuves.
Considérez donc ce qui suit comme une comparaison de deux produits, pas de deux intelligences. C'est la seule comparaison que les preuves permettent réellement.
What Qwen3.8-Max actually is
Qwen est la famille de modèles d'Alibaba Cloud, et "Max" en est la ligne phare propriétaire, au-dessus des niveaux moins chers Plus et Turbo. Qwen3.8-Max a été présenté en préversion le 19 juillet 2026.
Les spécifications déclarées par Alibaba :
- 2,4 mille milliards de paramètres au total dans une architecture creuse de type Mixture-of-Experts, selon Qwen sur X.
- Le premier Qwen multimodal au-delà de 1 000 milliards de paramètres, traitant texte, images, vidéo et documents, selon le chercheur principal Shuai Bai.
- Une fenêtre de contexte d'1 million de tokens, reprise de Qwen3.7-Max.
- Orienté vers le code et le travail agentique, domaine où Alibaba affirme surpasser son prédécesseur.
Le nombre de paramètres actifs, le ratio de sparsité et la licence manquaient tous à l'appel. Un modèle dense de 2,4T serait bien trop coûteux à faire tourner, donc le routage MoE est ce qui rend ce chiffre viable, et c'est justement le chiffre que personne n'a publié.
"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."
What Claude Fable 5 actually is
Anthropic présente Fable 5 comme son modèle généralement disponible le plus capable, conçu pour un "travail ambitieux, de longue durée et asynchrone". Ce positionnement est étonnamment étroit pour un modèle phare. La propre vue d'ensemble des modèles d'Anthropic recommande de commencer par Claude Opus 5, et de ne passer à Fable 5 que pour les charges de travail nécessitant la capacité maximale disponible.
Plusieurs éléments en font un animal vraiment différent d'une sortie de modèle classique.
Le raisonnement est toujours actif. Fable 5 n'accepte pas l'ancien paramètre de réflexion étendue, et n'a aucun interrupteur d'arrêt publié. La profondeur est contrôlée par le niveau d'effort à la place.
Il redirige lui-même son trafic. Fable 5 embarque des garde-fous pour la cybersécurité et la biologie, et les requêtes signalées sont automatiquement redirigées vers des modèles moins capables. Les requêtes cyber retombent sur Opus 4.8, la biologie sur Opus 5. Une réponse d'Opus est littéralement ce que renvoie une requête Fable bloquée, ce qui est étrange à découvrir en plein milieu d'un workflow.
Son utilisation exige une rétention des données de 30 jours pour le suivi de sécurité. Pour un acheteur réglementé, c'est un sujet à négocier avec les achats, pas une simple case à cocher.
Les chiffres des partenaires de lancement constituent la preuve la plus solide de toute cette comparaison, et il vaut mieux les lire comme des affirmations sur les coûts plutôt que sur l'intelligence. Un partenaire rapporte que Fable 5 bat Opus 4.8 sur une suite de tableurs du quotidien à tous les niveaux d'effort, tout en terminant les exécutions 25 à 30 % plus vite. Un autre affirme avoir atteint des résultats de physique de pointe en utilisant un tiers des tokens de raisonnement.
Head to head on what is actually published
Voici toutes les dimensions où les deux parties ont dit quelque chose de concret. Les cellules vides le sont parce que le fournisseur ne les a pas publiées, pas parce que je n'ai rien trouvé.
| Qwen3.8-Max | Claude Fable 5 | |
|---|---|---|
| Vendor | Alibaba Cloud | Anthropic |
| Status | Préversion (Qwen3.8-Max-Preview) | Généralement disponible |
| Launched | 19 juillet 2026 | 9 juin 2026 |
| Model ID | non publié | claude-fable-5 |
| Architecture | Mixture-of-Experts creux de 2,4T | non publié |
| Multimodal input | Texte, images, vidéo, documents | Texte, images, diagrammes, graphiques, PDF |
| Context window | 1M tokens | 1M tokens |
| Max output | non publié | 128k tokens |
| Input price | tarif au token non publié | 10 $ / MTok |
| Output price | tarif au token non publié | 50 $ / MTok |
| How you buy it | Abonnement Token Plan, Qoder, QoderWork | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Prompt caching discount | non publié | 90 % sur les tokens en entrée |
| Benchmark table | aucune en préversion | benchmarks partenaires, pas de tableau chiffré public |
| Model / system card | aucune | fiche système publiée |
| Open weights | promis "bientôt", sans date ni licence | non |
| API protocols | compatible OpenAI et Anthropic | Anthropic |
| Data retention | non publié | 30 jours, obligatoire |
| Documented outage | n/a (préversion) | 12 juin au 1er juillet 2026 |
| Knowledge cutoff | non publié | janvier 2026 |
Deux de ces lignes méritent un second regard.
La ligne API protocol est l'avantage caché. Le point d'accès Token Plan d'Alibaba parle à la fois les protocoles OpenAI et Anthropic, si bien que Claude Code, Cursor et Cline fonctionnent tous avec Qwen3.8-Max dès qu'on dispose d'une clé. Le tester prend cinq minutes, et cette accessibilité fait une bonne partie du travail derrière l'engouement.
La ligne knowledge cutoff est la bizarrerie discrète de Fable 5. Janvier 2026 est antérieur de quatre mois à la coupure de mai 2026 d'Opus 5, alors même que Fable est le modèle le plus récent et le plus cher. Donc si votre travail dépend de faits récents, le modèle le plus cher en sait moins.
Price: two sheets that do not line up
C'est l'endroit où la comparaison s'effondre complètement, plutôt que de simplement devenir floue.

Anthropic vend des tokens. Fable 5 coûte 10$ en entrée et 50$ en sortie par million, exactement le double de Claude Opus 5 sur les deux lignes, avec la réduction de 90 % sur le prompt caching toujours applicable, et l'inférence exclusivement américaine disponible à 1,1x.
Alibaba vend un abonnement à la place. Pendant la préversion, Qwen3.8-Max fonctionne à 10 % du tarif standard via le Token Plan, avec des niveaux Personal à environ 6$, 20$ et 70$ par mois pour Lite, Standard et Pro. Ajoutez par-dessus la réduction de nuit, un rabais supplémentaire de 80 % sur la consommation de crédits entre 22h et 8h (UTC+8), et les exécutions hors heures atterrissent aux alentours de 0,2 % du tarif standard.
On ne peut pas diviser ces deux valeurs entre elles. L'une est un tarif, l'autre un quota, et le dénominateur de ce quota, ce sont des crédits dont la conversion en tokens n'a jamais été publiée.
Il y a aussi un second piège dans le modèle par abonnement, et il n'est pas hypothétique. Sur la génération précédente, des utilisateurs de Qwen ont signalé que les crédits s'épuisaient bien plus vite que prévu, et les modèles Qwen ont tendance à générer plus de tokens en sortie par tâche que leurs concurrents. Ce qui gonfle discrètement le coût réel, même quand l'étiquette de prix paraît imbattable. La réduction de préversion masque cela pour l'instant. Prévoyez un budget pour le jour où elle prendra fin, et lisez notre analyse des tarifs de Qwen3.8-Max avant d'engager une charge de travail.
Pendant ce temps, les affirmations des partenaires de Fable 5 vont dans l'autre sens sur le coût total. Moins de tours, et un tiers des tokens de raisonnement sur les tâches difficiles, signifient que l'étiquette 2x ne se traduit pas par une facture 2x. C'est la même logique que nous détaillons dans notre comparaison Opus 5 vs Sonnet 5, où le modèle le moins cher n'est pas automatiquement aussi le travail le moins cher.
Where each one actually breaks
Demandez "lequel est le meilleur" et vous obtenez un haussement d'épaules. Demandez "lequel puis-je mettre en production lundi", et les deux répondent non, pour des raisons totalement différentes.

Qwen3.8-Max est une préversion. Ni licence ni prix au token, pas non plus de fiche modèle, en plus d'un point d'accès qui peut changer sous vos pieds. Bon pour des expériences, disqualifiant pour tout ce qui implique un client.
Fable 5 a un historique de disponibilité public avec un trou en plein milieu. Anthropic a lancé le 9 juin, coupé l'accès le 12 juin, puis l'a restauré le 1er juillet. Dix-neuf jours, reconnus par le fournisseur lui-même sur son propre site. Ajoutez la rétention obligatoire de 30 jours et la redirection des garde-fous, et vous avez trois questions d'achat à résoudre avant qu'un seul ticket ne soit traité.
Aucun des deux points n'est une attaque contre le modèle sous-jacent. Ce sont tous deux des raisons pour lesquelles le choix compte moins que l'architecture que vous construisez autour.
So which one should you actually test?
La préversion est bon marché et le modèle phare est rapide, ce qui fait de "dois-je changer" la mauvaise question. Déterminez d'abord ce que vous testez réellement.
Qwen3.8-Max ou Claude Fable 5 ?
Choisissez la tâche que vous avez réellement.
What this actually means if you are buying for support
Voici maintenant la partie qui me tient à cœur, car construire des agents IA pour les files de support est mon métier au quotidien.
Toutes les quelques semaines, un lancement comme celui-ci fait croire aux gens que le modèle est le goulot d'étranglement. Ce n'est pas le cas, et cet écart est précisément l'endroit où la plupart des projets d'IA pour le support meurent en silence. Qwen3.8-Max et Fable 5 vous offrent tous les deux du raisonnement brut. Aucun des deux ne connaît votre politique de remboursement, les cas limites de votre produit, ou le fait que le ticket #4021 est un client VIP qui a déjà écrit deux fois. Aucun n'a de garde-fou l'empêchant d'inventer une réponse avec assurance, et aucun ne se connecte au helpdesk où le travail se déroule réellement.
Nous avons passé des années à déployer de l'IA sur de vraies files de support, et la leçon qui est restée est qu'une réponse assurée mais fausse est pire que pas de réponse du tout. Le bot d'un client a joyeusement confirmé prendre en charge des modèles de produits qui n'étaient pas dans sa base de données, parce que le centre d'aide disait "nous prenons en charge tous les modèles". Un nombre de paramètres plus élevé rend cette erreur plus probable, pas moins, car le modèle paraît encore plus sûr de lui. Un responsable support a formulé cette exigence mieux que je ne pourrais le faire :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."
a DTC brand CX lead handling 7,000 tickets a month
C'est une déclaration sur l'architecture, pas sur le choix du modèle. C'est la raison pour laquelle eesel AI simule sur vos tickets historiques avant que quoi que ce soit ne passe en production, afin que vous voyiez le taux de résolution et les réponses exactes sur de vraies conversations passées, plutôt que de le découvrir via un client. C'est aussi pourquoi les réponses sont routées selon la confiance : l'incertitude signifie brouillon ou escalade, jamais deviner. En procédant ainsi, Gridwise a atteint 73 % de résolution en niveau 1 dès son premier mois.
Le point plus large à retenir de tout ce duel est celui-ci. Deux labos viennent de faire bouger le plafond de taille en l'espace de deux semaines, Kimi K3 à 2,8T et Qwen3.8-Max à 2,4T, puis Anthropic a lancé un modèle qui fonctionne sans surveillance pendant des jours. La couche modèle devient meilleure et moins chère plus vite qu'aucun cycle d'achat ne peut le suivre. Construisez donc de façon à pouvoir échanger le moteur sans avoir à retoucher tout ce qui l'entoure, et chacun de ces gains vous reviendra gratuitement.
Try eesel AI
Si vous êtes venu ici pour déterminer quel modèle pointer sur votre file de support, la réponse honnête est que ce choix compte bien moins que la couche placée au-dessus. Cette couche, c'est ce qu'est eesel AI.

Il se connecte à Zendesk, Freshdesk, Slack et plus de 100 autres outils, il apprend de votre centre d'aide et de vos tickets passés, et commence à rédiger en quelques minutes. Le facteur différenciant, c'est la rampe de confiance : simulez sur votre véritable historique de tickets, lisez les chiffres, démarrez en mode brouillon, puis passez en autonome seulement une fois satisfait. Vous obtenez l'intelligence du modèle de pointe avec des garde-fous conçus pour le support, et vous n'aurez plus jamais à refaire cette comparaison vous-même. Essayez eesel gratuitement, sans carte bancaire.
Questions fréquentes
Qwen3.8-Max est-il meilleur que Claude Fable 5 ?
Quelle est la fenêtre de contexte de Qwen3.8-Max face à Claude Fable 5 ?
Qwen3.8-Max est-il open source et Claude Fable 5 ne l'est pas ?
Puis-je utiliser Qwen3.8-Max ou Claude Fable 5 pour le support client ?
Quel modèle choisir si j'ai besoin d'une disponibilité fiable ?
Quelles sont les meilleures alternatives à Qwen3.8-Max ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








Comment le prix de Qwen3.8-Max se compare-t-il à celui de Claude Fable 5 ?