
Ce à quoi tu obtiens réellement l'accès
Je construis des intégrations chez eesel, ce qui veut dire que la majeure partie de ma semaine consiste à pointer la pile eesel vers le modèle qui vient de sortir, puis à découvrir où se cache la paperasse. Qwen 3.8 Max en porte plus que la plupart, parce qu'il existe deux produits distincts portant presque le même nom.
Alibaba a annoncé le modèle deux fois. Le 19 juillet 2026, qwen3.8-max-preview est apparu à la World AI Conference de Shanghai sans billet de blog, sans fiche modèle, ni même de tableau de benchmarks. Puis le 2 août est arrivé le vrai lancement : un billet technique de 5 068 mots, deux tableaux de benchmarks complets, des tarifs au token, plus une promesse de poids ouverts. L'ID de la version GA est qwen3.8-max.
Ces deux ID ne sont pas deux versions d'un même achat. La preview était vendue uniquement via l'abonnement Token Plan et n'a aucune fiche modèle du tout, tandis que https://www.qwencloud.com/models/qwen3.8-max-preview renvoie un 404. Le modèle GA est vendu à l'usage, et il est aussi inclus dans Token Plan. Donc quand quelqu'un te dit être "au tarif de la preview", ce qu'il décrit en réalité est une réserve de crédits, pas un tarif.
Les caractéristiques auxquelles tu achètes l'accès, selon la fiche modèle QwenCloud : 2,4 billions de paramètres au total dont 95 milliards actifs dans un MoE épars, une fenêtre de contexte de 1 000 000 tokens, 131 072 en sortie maximale, et jusqu'à 262 144 tokens de raisonnement. reasoning_effort propose trois niveaux avec xhigh par défaut, et preserve_thinking activé d'office. Si tu veux la lecture côté capacités plutôt que côté accès, la revue Qwen 3.8 Max d'eesel creuse ce que ces chiffres apportent vraiment, et le face-à-face contre Kimi K3 est l'endroit où la question de l'efficacité en tokens devient délicate.
Un petit avertissement qui m'a coûté dix minutes. Le billet de lancement se trouve à ?id=qwen3.8, pas à ?id=qwen3.8-max. Le mauvais identifiant affiche une page vide au lieu d'un 404, ce qui donne l'impression que l'annonce a été retirée.
Choisis ta voie
Cinq surfaces, et cinq factures différentes. Détermine laquelle est la tienne avant de créer le compte, car changer plus tard signifie tout recâbler.
Trouve ta voie
Quelle porte de Qwen 3.8 Max est la tienne ?
Choisis la phrase qui ressemble le plus à ta semaine.
Voie 1
Chat Qwen Studio
CoûtGratuit. Web, iOS, Android, macOS, Windows.
Mise en placeConnecte-toi. Pas de clé, pas de compte de facturation.
Le piège : le choix du modèle se trouve derrière la connexion, donc tu ne peux pas confirmer depuis l'extérieur que c'est bien 3.8-Max qui te répond.
Voie 2
API QwenCloud, au token
Coût$2 par 1M en entrée, $6 par 1M en sortie, $0,25 lecture en cache.
Mise en placeCrée une clé, définis une URL de base, modèle qwen3.8-max.
Le piège : rien n'est caché ici, et c'est précisément pour ça que c'est la voie à choisir s'il te faut prévoir une facture.
Voie 3
Crédits Token Plan
CoûtPersonal $6 / $18 / $68 par mois. Sièges d'équipe de $20 à $200.
Mise en placeAbonne-toi, puis appelle depuis la même surface API.
Le piège : le coefficient crédits-par-appel n'est pas publié, et les quotas personnels se réinitialisent sur des fenêtres fixes de 5 heures et 7 jours plutôt que de s'accumuler.
Voie 4
Qoder et harnais tiers
CoûtCe que facture la clé sous-jacente. Qoder est un produit à part entière.
Mise en placePointe Claude Code, Codex, Qwen Code ou OpenClaw vers une URL de base modifiée.
Le piège : la configuration OpenClaw publiée par Alibaba plafonne la sortie à 65 536 tokens, la moitié du plafond réel du modèle.
Voie 5
Poids ouverts, auto-hébergés
CoûtNon achetable. Non publié.
Mise en placeAucune disponible au 3 août 2026.
Le piège : promis "la semaine prochaine" depuis le 2 août, sans licence, date ni dépôt. Et 2,4 billions de paramètres dépassent les 500 Go même à 1,5 bit par poids.
Voici la même chose sous forme de tableau, puisque l'un d'entre vous voudra en faire une capture d'écran.
| Voie | Ce que tu obtiens | Prix | Idéal pour | Principal piège |
|---|---|---|---|---|
| Qwen Studio | Chat grand public, toutes plateformes | Gratuit | Prendre en main | Le sélecteur de modèle est derrière la connexion |
| QwenCloud API | Paiement à l'usage au token | $2 / $6 par 1M | Applis en production | Rien sur le prix, beaucoup sur la verbosité |
| Token Plan | Abonnement à crédits | Dès $6/mois | Boucles d'agents intensives | Coefficient de crédits non publié |
| Qoder et harnais | IDE et CLI de code agentique | Selon la clé | Travail de code | Plafonds de sortie contradictoires |
| Poids ouverts | Auto-hébergement | Indisponible | Personne, pour l'instant | Non publié |
Voie 1 : le chat gratuit
Qwen Studio est la porte la plus rapide et elle ne coûte rien. Selon qwen.ai, il existe des clients pour le web, iOS, Android, macOS et Windows.
Une réserve honnête, parce que je l'ai vérifié. La page hors connexion est un flux d'onboarding de génération d'images, et ne mentionne Qwen 3.8 Max nulle part dans son HTML public. La sélection du modèle se trouve derrière l'authentification. Le chat est donc réel et gratuit, sauf qu'il faut d'abord se connecter avant de pouvoir vérifier quel modèle te répond.
Il vaut la peine de savoir à quoi cette voie sert et à quoi elle ne sert pas. Comme moyen de vérifier rapidement si le modèle gère ton domaine, elle convient. Comme moyen d'évaluer la latence ou le coût, ou comment le modèle se comporte sous un system prompt que tu contrôles, elle est mauvaise. Pour ça, il te faut la voie 2.
Voie 2 : l'API, au token
C'est celle que je choisirais pour tout ce qui est sérieux. Tu crées une clé dans la console QwenCloud, et après ça, le tarif raconte toute l'histoire.

Remarque le compteur près de ce bouton : dix clés par compte, et chaque clé est limitée à un seul espace de travail. Si ton plan est une clé par environnement ou une clé par client, prévois ce plafond dès maintenant et pas au déploiement.
Les tarifs publiés, selon la fiche modèle :
| Compteur | Prix par 1M de tokens |
|---|---|
| Entrée | $2 |
| Sortie | $6 |
| Entrée, cache implicite | $0,25 |
| Création de cache explicite | $2,50 |
| Lecture de cache explicite | $0,17 |
Deux détails de ce tableau comptent plus que le titre. D'abord, il n'y a aucun palier selon la longueur du contexte : une seule paire plate $2/$6 sur toute la fenêtre de 1M, sans aucun sélecteur de tarif échelonné. Ce qui est inhabituel, et c'est une bonne nouvelle, car les tarifs de contexte échelonnés sont précisément l'endroit où les longues sessions d'agents deviennent discrètement coûteuses. Ensuite, ce cache implicite à $0,25 fait un vrai travail si tes prompts partagent un préfixe stable, et c'est le cas de la plupart des charges de support et de code.
Les limites de débit sont de 15 000 RPM et 2M TPM sur la même fiche. Comme référence par rapport au reste du terrain, l'article eesel sur les tarifs de Qwen 3.8 Max refait ce même calcul à côté des tarifs de GPT-5.6 et des tarifs de Kimi K3. La comparaison avec DeepSeek V4 Flash est celle à lire si le prix bas au token est ton seul critère.
La partie qui t'évite une réécriture
Tu n'as presque certainement pas besoin d'une nouvelle bibliothèque cliente pour ça. Alibaba expose le même modèle via trois protocoles dans chacune de six régions, selon la liste Model Studio : compatible OpenAI sur /compatible-mode/v1, compatible Anthropic sur /apps/anthropic, et DashScope natif sur /api/v1. Les régions sont Pékin, Hong Kong, Singapour, Tokyo, Francfort et les États-Unis (Virginie).

En pratique, cela signifie qu'une intégration existante du SDK OpenAI atteint ce modèle en changeant seulement une URL de base et une chaîne de modèle. Rien d'autre. QwenCloud prend en charge chat-completions et la Responses API, et la liste des fonctionnalités sur la fiche modèle confirme les appels de fonctions, les sorties JSON structurées, la complétion de préfixe, le cache de contexte, les traitements par lots, la recherche web et le fine-tuning. Les outils intégrés côté serveur (code_interpreter, web_extractor, web_search, t2i_search, i2i_search) se trouvent spécifiquement sur la Responses API.
Voie 3 : crédits Token Plan
La voie de l'abonnement, c'est là que je ralentirais. C'est le seul moyen d'atteindre l'ancien modèle preview, et en tant que produit économique, c'est une bête complètement différente de l'API.

À l'international, la documentation Token Plan fixe Personal à $6, $18 et $68 par mois (prix catalogue $8, $25, $80). Cela accorde 2 500, 10 000 et 40 000 crédits par fenêtre glissante de 7 jours, plus 700, 3 000 et 12 000 par fenêtre de 5 heures. Les sièges d'équipe coûtent $20 Standard, $75 Pro et $200 Max par siège et par mois, pour 25 000, 100 000 et 250 000 crédits mensuels. La Chine continentale utilise les mêmes quotas mais en yuans : ¥39, ¥139 et ¥499 en Personal, puis de ¥150 à ¥1 398 par siège d'équipe.
Vient maintenant la partie que personne ne met dans les documents marketing. Alibaba ne publie pas ce qu'achète un crédit. La documentation Personal Edition dit que le coût en crédits d'un appel est fixé dynamiquement selon le type de modèle, le volume de tokens, le mode de réflexion et les appels d'outils, puis déduit selon des coefficients échelonnés qui ne sont listés nulle part publiquement. Le seul exemple chiffré sur le site concerne un modèle différent, qwen3.6-plus, à environ 3,18 crédits pour une entrée de 8 349 tokens et une sortie de 573 tokens.

Trois autres mécaniques qui mordent :
- Les quotas sont des fenêtres, pas des soldes. Atteindre soit le plafond de 5 heures soit celui de 7 jours met le service en pause jusqu'à la réinitialisation de cette fenêtre, et les crédits inutilisés ne se reportent pas. Renouveler prolonge la durée, mais ne recharge pas le cycle en cours.
- Les sièges d'équipe sont un membre pour une clé, non partageables, sans limites de fenêtre mais avec un blocage mensuel strict quand le réservoir de sièges est vide.
- Les sessions longues coûtent plus cher par requête. La documentation Team précise que certains modèles facturent par paliers selon la longueur du contexte, et avertit que l'accumulation de contexte dans les boucles d'agents pousse les requêtes vers des paliers plus élevés.
Il y a ici une vraie remise qui vaut la peine d'être citée. Pendant la preview, la consommation de crédits tournait à 10% de la normale, et entre 22h00 et 08h00, une remise supplémentaire de 80% s'ajoutait par-dessus, aboutissant à 2% de la consommation standard. Deux nuances toutefois. La remise nocturne est réservée à Personal Edition, et la version GA qwen3.8-max obtient un tarif nocturne plat de 50% au lieu du 2% cumulé. Les deux sont explicitement révocables, et Alibaba ne mentionne jamais le fuseau horaire.
J'ai vu exactement cette forme de tarification piéger des gens de mon propre côté de la barrière. Un acheteur avec qui j'ai travaillé, une entreprise européenne de sécurité e-mail sur Freshdesk, a brûlé 200 interactions en une seule journée de test et a immédiatement commencé à s'inquiéter de ce que cela signifierait à son volume attendu. Le chiffre en lui-même était correct. Ne pas pouvoir prédire le chiffre, c'est ce qui fait qu'une équipe finance dit non. Un coefficient non publié te fait ça à une échelle bien plus grande, ce qui est tout l'argument pour prendre la voie 2 à la place.
Voie 4 : Qoder et les harnais de code
Si ta vraie question d'accès est "peut-il piloter mon dépôt", alors Alibaba a déjà fait le travail pour toi. Qoder est son IDE et CLI de code agentique, qui s'installe avec curl -fsSL https://qoder.com/install | bash, et le billet de lancement le décrit comme co-évoluant avec le modèle.
Le plus utile, c'est que le même billet fournit aussi des configurations prêtes à copier-coller pour quatre harnais que tu utilises peut-être déjà : Claude Code (via un ANTHROPIC_BASE_URL pointant vers https://dashscope-intl.aliyuncs.com/apps/anthropic), Codex sur le protocole Responses, Qwen Code (@qwen-code/qwen-code), et OpenClaw. Si tu as déjà un flux de travail avec un assistant de code, c'est un changement d'URL de base, pas une migration.
Attention à une incohérence ici. La fiche modèle indique 131 072 en sortie maximale. La configuration OpenClaw qu'Alibaba publie dans ce même billet de lancement fixe "maxTokens": 65536, exactement la moitié, et l'écart n'est jamais expliqué. Ainsi, l'outillage publié par Alibaba lui-même ne demande jamais le plafond qu'il annonce. Si tu rencontres une troncature sur une longue génération, cette valeur de configuration est la première chose à vérifier.
Pour donner une idée de ce à quoi ressemble l'accès à long horizon en pratique, Alibaba cite une exécution autonome de code de 16 jours qui a produit 265 commits, 127 PR et 151 issues dans le dépôt public oh-my-cli, au 30 juillet 2026. Prends ça comme une démo, pas comme un benchmark. Ça indique tout de même dans quelle direction Alibaba investit.
Voie 5 : les poids, que tu ne peux pas encore avoir
C'est la voie que la plupart des gens qui posent des questions sur l'accès demandent en réalité. C'est aussi celle qui n'existe pas.

Le billet de lancement s'y engage à trois reprises distinctes, le qualifiant de premier modèle à poids ouverts à l'échelle Max, avec des poids qui iront sur Hugging Face et ModelScope "la semaine prochaine". Au 3 août 2026, il n'y a ni dépôt, ni licence, ni même de date ferme. Et la page d'accueil de qwen.ai étiquette l'entrée "Open-Source" pour une sortie dont les poids ne sont pas publiés.
La réaction de la communauté portait moins sur la promesse que sur l'arithmétique :
At 1.5 bits per weight it'll still be over 500gb - that's still not running on consumer hardware.
Best case they release smaller models. 120b class of qwen 3.8 would be incredible - it fits on device for those serious about AI, but without millions of dollars in hardware for terabytes of VRAM
C'est la lecture honnête de la chose. Même un checkpoint de 2,4 billions publié est un artefact de datacenter, pas de portable. La sortie sœur que les gens attendent vraiment est Qwen3.8-27B, annoncée en poids ouverts aux côtés du vaisseau amiral :
They've also announced Qwen3.8-27B being released open-weight next week. Qwen3.6-27B is widely regarded as one of the best local models, especially since nothing else comes close to it, that isn't benchmaxxed, without being significantly larger. If 3.8 truly improves upon it that would be awesome.
Si l'inférence locale est une exigence stricte pour toi, c'est la sortie à suivre, et l'article eesel sur les petits modèles de langage explique pourquoi le bas de gamme est de toute façon souvent le bon choix en production. Pour des options à poids ouverts comparables aujourd'hui, voir les alternatives à Qwen 3.8 Max et le guide Kimi K3, qui a bien livré ses poids à la date promise.
Cinq erreurs que je t'éviterais
Les problèmes d'accès avec ce modèle ne sont presque jamais des problèmes de capacités. Ce sont surtout de la paperasse.
- Appeler
qwen3.8-max-previewen attendant un tarif. Il n'a ni fiche modèle ni prix au token. Si tu veux un chiffre, il te faut l'ID de la version GA. - Lire un article de l'époque preview comme le tarif GA. Un ensemble largement diffusé de paliers en CNY par 1K circule, revendiquant un contexte de 256K, ce qui contredit le 1M de la fiche GA. Tout tableau de paliers trouvé en dehors des propriétés d'Alibaba doit être traité comme non vérifié.
- Supposer que le tarif nocturne de 2% s'applique à toi. Il était réservé à la preview et à Personal. La GA obtient une remise nocturne plate de 50%, et Team n'a aucune remise nocturne.
- Budgétiser le palier Lite sans vérifier le stock. Le plan Lite affichait "temporairement épuisé, réapprovisionné chaque jour à 9h30" quand je l'ai consulté le 3 août 2026. Une phrase que je ne m'attendais pas à écrire à propos d'un abonnement API.
- Se fier à un verdict de qualité basé sur un seul chiffre. Le modèle n'apparaît pas du tout sur le tableau Artificial Analysis, donc tout "score d'intelligence indépendant" cité pour lui appartient à un autre Qwen. Compare plutôt dans les face-à-face avec Fable 5 et GPT-5.6.
Ce que l'accès ne te donne pas
Chacune des voies ci-dessus arrive au même endroit : un modèle qui répond aux prompts. Si tu es venu ici pour mettre de l'IA sur une file de support, c'est peut-être un cinquième du travail.
Les quatre autres cinquièmes sont les parties que personne ne te vend avec une clé. La recherche sur ton propre centre d'aide et tes tickets passés, pour que les réponses sortent fondées plutôt que simplement plausibles. Les actions, pour que l'agent puisse étiqueter, router et clôturer au lieu de seulement parler. Les règles d'escalade, avec une remise propre à un humain. Et enfin un moyen de tester l'ensemble sur des tickets historiques avant qu'il ne touche un client, ce qui est l'étape qui sépare un déploiement réussi d'un incident.
Je le dis à partir de cicatrices, pas de théorie. J'ai vu un bot au ton confiant confirmer joyeusement le support de produits qui n'étaient absolument pas dans la base de données du client, uniquement parce que la base de connaissances disait "nous prenons en charge tous les modèles". Une équipe de support technique B2B avec qui j'ai travaillé a exactement signalé cette crainte avant la mise en production, et elle avait raison. C'est pourquoi chaque déploiement eesel simule d'abord sur de vrais tickets passés, et ce n'est pas une fonctionnalité qu'on obtient d'une URL de base. Les guides eesel sur la prévention des hallucinations et sur le taux de résolution approfondissent ces deux moitiés.
Le choix du modèle compte aussi bien moins que ce que l'on attend. Que tu passes par Qwen, GLM 5.2, Gemini 3.5 Pro ou Fable 5, ce qui fait bouger ton taux de déflexion, c'est la couche de recherche et de test construite autour. Je développe cet argument longuement dans agents IA contre chatbots et dans RAG contre fine-tuning.
Essaie eesel pour le support au lieu de tout câbler toi-même
Si la raison pour laquelle tu lisais un guide d'accès à un modèle était "je veux que l'IA réponde aux tickets", alors tu peux sauter toutes les voies ci-dessus. eesel est la couche qui transforme un modèle en coéquipier de support, et ça prend des minutes au lieu d'un cycle d'achat.

Connecte Zendesk, Freshdesk, Gorgias, Front ou HubSpot, pointe-le ensuite vers ton centre d'aide, et il apprend de tes tickets passés au lieu d'un prompt que tu as écrit à minuit. Ensuite tu simules l'ensemble sur des conversations historiques, tu vois le taux de résolution avant de t'engager sur quoi que ce soit, et tu l'actives quand le chiffre est un chiffre que tu peux défendre. Pas de clés API à faire tourner, pas de coefficients de crédits à rétro-ingénierer, et pas de région à choisir. Si tu veux d'abord voir le paysage plus large, le tour d'horizon eesel du meilleur logiciel de helpdesk IA et le guide de l'automatisation des tickets de support sont de bons points de départ, et la classification des tickets couvre la moitié du tri.
Essaie eesel gratuitement, ou réserve une démo si tu préfères que ce soit moi qui conduise.
Questions fréquentes
Quel est le prix par token de l'API Qwen 3.8 Max ?
Quel est l'identifiant du modèle Qwen 3.8 Max ?
qwen3.8-max, indiqué sur la fiche modèle QwenCloud. La preview précédente était qwen3.8-max-preview, un produit commercial distinct vendu uniquement via Token Plan. Confondre les deux est la raison la plus fréquente d'un premier appel API en 404.Puis-je télécharger les poids de Qwen 3.8 Max et l'auto-héberger ?
L'abonnement Token Plan est-il moins cher que l'API Qwen 3.8 Max ?
Puis-je utiliser Qwen 3.8 Max dans Claude Code ou Codex ?
Depuis quelles régions puis-je appeler Qwen 3.8 Max ?
L'accès à Qwen 3.8 Max suffit-il pour répondre aux tickets clients ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.









Comment accéder gratuitement à Qwen 3.8 Max ?