Qwen3.8-Max expliqué : l'aperçu du fleuron 2,4T d'Alibaba

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 20, 2026

Vérifié par un expert
Illustration représentant l'aperçu du grand modèle de langage Qwen3.8-Max d'Alibaba

Ce qu'est réellement Qwen3.8-Max

Qwen (Tongyi Qianwen) est la famille de modèles d'Alibaba Cloud, couvrant le texte, la vision, l'audio, le code et les agents. Le palier "Max" est la ligne phare propriétaire, au-dessus des paliers moins chers Plus et Turbo et au-dessus des points de contrôle à poids ouverts de Qwen3. Qwen3.8-Max est le plus récent, et Alibaba l'a présenté en aperçu sous le nom "Qwen3.8-Max-Preview" le 19 juillet 2026.

Voici la version honnête, car le lancement lui-même a été étonnamment léger. Il n'y a eu ni article de blog officiel, ni fiche modèle, ni tableau de benchmarks lors de l'aperçu, juste deux publications sur X de l'équipe Qwen et un point de terminaison d'aperçu fonctionnel et payant. Donc l'essentiel de ce qui suit est le propre récit d'Alibaba, que personne en dehors du laboratoire n'avait encore vérifié de façon indépendante.

Les spécifications qu'Alibaba annonce :

  • 2,4 mille milliards de paramètres au total, une conception éparse de type Mixture-of-Experts (Qwen sur X).
  • Premier Qwen multimodal au-delà de 1 000 milliards de paramètres, gérant texte, images, vidéo et documents, selon le chercheur principal Shuai Bai.
  • Une fenêtre de contexte d'un million de tokens, reprise de son prédécesseur Qwen3.7-Max.
  • Visant le codage, les workflows agentiques et les tâches de "collaboration professionnelle" à long horizon, où Alibaba affirme dépasser Qwen3.7-Max.

Le nombre de paramètres actifs par token, la suite complète de benchmarks et la licence manquaient tous lors de l'aperçu. Alibaba a dit qu'ils arriveraient. En attendant, il faut traiter ces caractéristiques internes comme du marketing, pas comme une mesure.

Sous le capot : comment fonctionne Qwen3.8-Max

C'est là qu'un nombre de paramètres gigantesque cesse d'être le titre. Un modèle dense de 2,4T serait bien trop coûteux à faire tourner, donc Qwen3.8-Max est un modèle Mixture-of-Experts : la plupart de ces paramètres restent inactifs sur un token donné, et seule une petite fraction s'active. C'est la même astuce qui permet aux paliers moins chers de Qwen de battre leurs rivaux sur le prix, mise à l'échelle.

Comment fonctionne Qwen3.8-Max, de l'entrée multimodale au routage Mixture-of-Experts jusqu'à la réponse
Comment fonctionne Qwen3.8-Max, de l'entrée multimodale au routage Mixture-of-Experts jusqu'à la réponse

La partie multimodale est le vrai saut pour la ligne Max. Les modèles Max précédents étaient d'abord centrés sur le texte ; ici, Alibaba affirme que le modèle absorbe nativement images, vidéo et documents aux côtés du texte, ce que Shuai Bai a signalé comme le détail inédit :

"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."

Le hic qui mérite d'être répété : le ratio de sparsité, le nombre d'experts et la recette d'entraînement n'ont pas été publiés. On connaît donc la forme qu'Alibaba décrit (immense, éparse, multimodale) mais pas les chiffres qui permettraient de la reproduire ou de la classer. C'est un vrai manque pour un modèle qui revendique une place dans le top deux.

Ce qu'Alibaba affirme sur les performances

Voici la phrase que tout le monde a citée. Le propre message de lancement de l'équipe Qwen la situe face au sommet du secteur :

"Qwen3.8 is launching and going open-weight soon! With a massive 2.4T parameters, this model is continuously evolving. We believe it's one of the most powerful models available today... second only to Fable 5."

"Juste derrière Fable 5" est un pari audacieux, Fable 5 étant l'actuel modèle Claude haut de gamme. Le problème, c'est qu'il n'y a rien derrière pour l'instant : aucun graphique de benchmark, aucun score d'indice indépendant, aucune fiche modèle. Pour comparer, le fleuron précédent Qwen3.7-Max a été lancé en mai 2026 avec de vrais chiffres, 80,4% sur SWE-bench Verified et le modèle chinois le mieux classé sur l'indice d'intelligence Artificial Analysis à l'époque. Qwen3.8-Max est arrivé avec l'assurance mais sans les preuves.

Il y a aussi un schéma qui mérite d'être signalé, avec prudence. Qwen a une longue habitude d'occuper la tête des classements de téléchargements des modèles ouverts et de publier de solides résultats de benchmarks, et une critique récurrente est qu'il peut paraître plus fort sur les évaluations que dans un usage réel désordonné. Une auto-déclaration de "top deux" avant tout test indépendant est donc exactement le genre d'affirmation à prendre avec des pincettes.

Le prix de Qwen3.8-Max

C'est la partie qui a vraiment retenu l'attention des développeurs. Pendant l'aperçu, Qwen3.8-Max est vendu à 10% du tarif standard via trois canaux : l'abonnement Token Plan d'Alibaba, et ses produits de codage agentique Qoder et QoderWork. Il n'y a pas encore de tarif d'API par token autonome publié, ce qui est inhabituel pour un modèle Max.

Les paliers Personal du Token Plan se présentent ainsi :

PalierMensuelQuota de crédits sur 7 joursQuota de crédits sur 5 heures
Lite~6 $ (39 CNY)2 500 crédits700 crédits
Standard~20 $ (139 CNY)10 000 crédits3 000 crédits
Pro~70 $ (499 CNY)40 000 crédits12 000 crédits

Source : Alibaba Cloud Token Plan (édition Personal). En plus du tarif d'aperçu à 10%, Alibaba ajoute une remise de nuit, soit 80% de réduction supplémentaire sur la consommation de crédits entre 22h00 et 08h00 (UTC+8), ce qui revient à environ 0,2% du tarif standard pour les exécutions en heures creuses. C'est agressif, et clairement conçu pour pousser les gens à tester l'aperçu à moindre coût.

Le modèle de crédits par abonnement est aussi exactement ce dont les utilisateurs de Qwen se sont plaints par le passé. Sur la génération précédente, des utilisateurs de Reddit ont signalé que les crédits s'épuisaient bien plus vite que prévu, et les modèles Qwen ont tendance à générer plus de tokens de sortie par tâche que leurs pairs, ce qui gonfle discrètement le coût réel même quand le tarif affiché paraît bas. La remise d'aperçu masque cela pour l'instant. Quand elle prendra fin, il faudra prévoir le budget.

Un détail utile : le point de terminaison du Token Plan parle à la fois le protocole d'API OpenAI et Anthropic, donc des clients tiers comme Claude Code, Cursor, Cline et Codex fonctionnent d'emblée dès qu'on émet une clé. Si vous vivez déjà dans l'un de ces outils, essayer l'aperçu est l'affaire de cinq minutes.

Faut-il se lancer sur Qwen3.8-Max dès maintenant ?

L'aperçu est bon marché et facile à essayer, ce qui fait de "dois-je basculer dessus" la mauvaise question, et de "qu'est-ce que je teste réellement" la bonne. Parcourez la décision ci-dessous avant de reconstruire quoi que ce soit d'important autour d'un aperçu.

La vue d'ensemble : une course aux poids ouverts entre labos chinois

En écartant les détails, voici pourquoi Qwen3.8-Max est devenu tendance : il est arrivé quelques jours après le modèle de 2,8 mille milliards de paramètres Kimi K3 de Moonshot AI, et Alibaba détient justement environ 36% de participation dans Moonshot. Deux labos de la même sphère se livrent donc désormais une course pour fixer le plafond de taille des modèles quasi frontière, et tous deux promettent des poids ouverts. Sur Hacker News, le commentaire le mieux noté a interprété ce timing exactement de cette façon :

Hacker News

"I assume that this announcement has been prompted by that of Moonshot AI... I wonder if Alibaba has always planned to make this big LLM open weights, or they have chosen to do this now, to better compete with Moonshot AI."

La lecture à laquelle beaucoup sont arrivés est que rendre l'intelligence de pointe une simple marchandise est en soi la stratégie, et que c'est bon pour tout le monde en aval, quel que soit le motif :

Hacker News

"The Chinese firms seem to be working hard to commoditize intelligence which may be the most effective way to debase American frontier labs. And yeah: it also happens to be really good for humanity."

Pour un acheteur, ce qui compte n'est pas de savoir quel labo gagne. C'est que la couche modèle devient moins chère et meilleure toutes les quelques semaines, et le geste malin consiste à construire de façon à pouvoir changer le moteur sans avoir à retuyauter tout ce qui l'entoure.

Là où un modèle de pointe s'arrête, et où le travail de support commence

Passons maintenant à la partie qui me tient le plus à cœur, parce que je construis des agents IA pour vivre. Il est tentant de lire une annonce comme celle-ci et de penser "super, je branche le meilleur modèle et ma file de support se résout toute seule." Ça ne marche pas comme ça, et c'est exactement dans cet écart que la plupart des projets de support IA échouent silencieusement.

Une affirmation de benchmark n'est pas un agent de support : ce qu'un modèle brut vous donne face à ce dont a besoin un coéquipier prêt pour le support
Une affirmation de benchmark n'est pas un agent de support : ce qu'un modèle brut vous donne face à ce dont a besoin un coéquipier prêt pour le support

Un modèle comme Qwen3.8-Max vous donne un raisonnement brut. Ce qu'il ne vous donne pas, c'est la moindre idée de votre politique de remboursement, de vos cas limites produit, ou du fait que le ticket #4021 est un VIP qui a déjà écrit deux fois. Il n'a aucune mémoire de vos tickets passés, aucun garde-fou pour l'empêcher d'inventer une réponse avec assurance, et aucune connexion au helpdesk où le travail se déroule réellement. Un nombre de paramètres plus élevé ne corrige rien de tout cela.

Cela fait des années que nous mettons de l'IA sur des files de support en production, et la leçon qui est restée, c'est qu'un modèle qui sonne sûr de lui en donnant une mauvaise réponse est pire que pas de réponse du tout. Le bot d'un client payant a confirmé joyeusement qu'il prenait en charge des modèles de produits qui n'étaient même pas dans sa base de données, parce que le centre d'aide disait "nous prenons en charge tous les modèles." C'est exactement le mode de défaillance qu'un modèle brut d'aperçu rend plus probable, pas moins, précisément parce qu'il paraît si sûr de lui. Comme me l'a dit un responsable support :

"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."

a DTC brand CX lead handling 7,000 tickets a month

C'est pourquoi eesel AI exécute une simulation sur votre historique de tickets avant que quoi que ce soit ne passe en production, pour que vous voyiez d'abord le taux de résolution et les réponses exactes sur de vraies conversations passées, pas après qu'un client se soit fait avoir. C'est aussi pourquoi les réponses sont acheminées selon la confiance : si l'agent n'est pas sûr, il rédige un brouillon pour un humain ou fait remonter le ticket plutôt que de deviner. En procédant ainsi, Gridwise a atteint 73% de résolution des tickets de niveau 1 dès le premier mois.

Et vous pourriez connecter vous-même un modèle comme Qwen3.8-Max à votre pile technique. La plupart des équipes constatent que la maintenance est le vrai coût, ce qui est exactement l'arbitrage construire-ou-acheter qu'un client a résumé avec justesse : "Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas y investir notre temps. Nous voulions quelque chose que nous n'aurions pas à maintenir." Le modèle sous-jacent compte bien moins que cette enveloppe, ce qui est la bonne nouvelle discrète concernant Qwen3.8-Max, Kimi K3, ou peu importe ce qui gagnera le mois prochain : une IA pour le service client bien conçue hérite de chaque avancée de pointe sans que vous ayez à retuyauter quoi que ce soit.

Essayer eesel AI

Si vous êtes arrivé ici parce que vous voulez un modèle d'IA qui résout réellement les tickets et ne se contente pas de discuter, c'est exactement l'objectif d'eesel AI. Il se connecte à Zendesk, Freshdesk, Slack et plus de 100 autres outils, apprend de votre centre d'aide et de vos tickets passés, et commence à rédiger ou résoudre en quelques minutes, pas en semaines.

Le tableau de bord helpdesk d'eesel AI, où un coéquipier IA résout et rédige des tickets de support
Le tableau de bord helpdesk d'eesel AI, où un coéquipier IA résout et rédige des tickets de support

Ce qui fait la différence, c'est la rampe de confiance : simulez sur votre historique de tickets réel, consultez les chiffres, démarrez en mode brouillon, et passez en pleine autonomie seulement quand vous êtes satisfait. Vous obtenez l'intelligence du modèle de pointe avec des garde-fous conçus pour le support. Essayez eesel gratuitement, sans carte bancaire.

Questions fréquentes

Qu'est-ce que Qwen3.8-Max ?
Qwen3.8-Max est le tout dernier modèle phare d'Alibaba, présenté en aperçu le 19 juillet 2026. Alibaba le décrit comme un modèle Mixture-of-Experts épars de 2,4 mille milliards de paramètres et son premier modèle multimodal au-delà de 1 000 milliards de paramètres, capable de traiter texte, images, vidéo et documents en entrée. Pour en savoir plus sur toute la famille, consultez notre test de Qwen.
Combien coûte Qwen3.8-Max ?
Pendant l'aperçu, Qwen3.8-Max fonctionne à 10% du tarif standard via le Token Plan d'Alibaba, Qoder et QoderWork. Les paliers Personal du Token Plan démarrent autour de 6 $/mois (39 CNY) pour Lite, ~20 $ pour Standard et ~70 $ pour Pro. Il n'y a pas encore de tarif par token autonome. Notre guide complet des tarifs de Qwen couvre le reste de la gamme.
Qwen3.8-Max est-il open source ?
Pas encore. Alibaba affirme que Qwen3.8 passera en poids ouverts "bientôt", mais lors de l'aperçu, il n'y avait ni date, ni licence, ni dépôt Hugging Face. Cela romprait le schéma habituel d'Alibaba consistant à garder fermé son palier Max supérieur, donc mieux vaut traiter la promesse de poids ouverts comme un projet, pas un fait acquis.
Qwen3.8-Max est-il meilleur que Kimi K3 ou Claude ?
Alibaba le qualifie de "juste derrière Fable 5", mais n'a publié aucun tableau de benchmarks, fiche modèle ni chiffres indépendants lors de l'aperçu, donc cette affirmation n'est pas vérifiée. Il est arrivé quelques jours après Kimi K3, le modèle de 2,8 mille milliards de paramètres de Moonshot. Consultez nos guides de comparaison de modèles pour savoir comment évaluer ce genre d'affirmation.
Puis-je utiliser Qwen3.8-Max avec Claude Code ou Cursor ?
Oui. Le point de terminaison du Token Plan parle à la fois le protocole d'API OpenAI et Anthropic, donc des outils comme Claude Code, Cursor et Cline fonctionnent dès qu'on a une clé. Si vous voulez pointer ce genre de modèle vers de vrais tickets de support, notre sélection d'outils de codage IA et notre guide de l'IA pour le service client sont de bonnes lectures complémentaires.
Puis-je utiliser Qwen3.8-Max pour le support client ?
Oui, mais un modèle brut n'est que le moteur. Pour répondre à de vrais tickets, il lui faut vos connaissances, vos garde-fous et vos connexions helpdesk. eesel AI enveloppe un modèle de pointe exactement de cette façon et se connecte à Zendesk, Freshdesk et bien plus, pour obtenir une véritable IA pour le service client plutôt qu'une simple fenêtre de chat.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration représentant la tarification preview de Qwen3.8-Max d'Alibaba
Trending

Tarifs de Qwen3.8-Max : l'offre preview et ses coûts cachés

Un guide clair des tarifs de Qwen3.8-Max : le tarif preview à 10%, les paliers du Token Plan, la remise de nuit, et le coût de consommation de crédits que personne n'indique sur la page de tarifs.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration comparant Qwen3.8-Max aux modèles d'IA de pointe rivaux
Trending

Les 6 meilleures alternatives à Qwen3.8-Max en 2026

Les meilleures alternatives à Qwen3.8-Max en 2026, comparées honnêtement : Kimi K3, Claude, GPT-5.6, Gemini 3.5 Pro, Grok 4.5, et la couche support qui résout vraiment les tickets.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration comparant la préversion Qwen3.8-Max d'Alibaba à Claude Fable 5 d'Anthropic
Trending

Qwen3.8-Max vs Claude Fable 5 : la comparaison que personne ne peut faire

Alibaba a qualifié Qwen3.8-Max de "juste derrière Fable 5". J'ai comparé les deux modèles sur le prix, le contexte, la disponibilité et les preuves publiées pour vérifier si cela tient la route.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 3, 2026
Qwen 3.8 Max review : un aperçu à 2,4T testé en toute honnêteté
Trending

Qwen 3.8 Max review : un aperçu à 2,4T testé en toute honnêteté

Un avis honnête sur Qwen 3.8 Max : ce qu'est vraiment le porte-étendard de 2 400 milliards de paramètres d'Alibaba, pourquoi 'juste derrière Fable 5' est une affirmation et non un benchmark, et qui devrait attendre.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration d'un développeur accédant à Qwen 3.8 Max d'Alibaba via le chat, le multimodal et les surfaces d'API
Trending

Comment accéder à Qwen 3.8 Max : 5 voies et leurs tarifs

Cinq façons réelles d'atteindre le vaisseau amiral d'Alibaba à 2,4 billions de paramètres, du chat gratuit à l'API à $2/$6, plus les pièges de facturation qui attrapent les gens en chemin.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Illustration comparant le Qwen 3.8 Max d'Alibaba et le Kimi K3 de Moonshot AI
Trending

Qwen 3.8 Max vs Kimi K3 : les chiffres qu'aucun labo n'a publiés

Deux laboratoires chinois ont lancé un modèle phare de plus de 2 000 milliards de paramètres à dix-sept jours d'intervalle, et aucun n'a mis l'autre sur son tableau de benchmarks. Voici ce qui se compare réellement, ce que coûte vraiment la facture, et lequel je choisirais.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Illustration de deux personnes examinant des cartes de tarifs échelonnés sur un écran, avec le logo Qwen
Trending

Tarifs de Qwen 3.7 Flash : ce que vous payez vraiment en 2026

Le tarif de $0.03 est réel, et ce n'est qu'un des quatre compteurs sur votre facture. Voici comment le palier de prompt, le cache, la région de batch et le taux de retentatives se combinent pour former le montant qui vous est réellement facturé.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration d'un développeur travaillant avec des panneaux d'image, de vidéo et de document, avec le logo Qwen
Trending

Test de Qwen 3.7 Flash : un modèle de vision à 0,03 $ avec un piège

Qwen 3.7 Flash est le modèle de vision le moins cher du marché. J'ai creusé les paliers tarifaires, l'unique benchmark indépendant, et ce que personne ne vous dit.

Rama Adi NugrahaRama Adi NugrahaJul 31, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement