
Le tableau en 60 secondes
Chaque chiffre ci-dessous provient des pages officielles de chaque fournisseur, vérifiées le 3 août 2026. Là où une donnée n'est pas publiée, je l'ai indiqué tel quel plutôt que d'emprunter un chiffre à un agrégateur.
| Qwen 3.8 Max | Kimi K3 | |
|---|---|---|
| ID du modèle | qwen3.8-max | kimi-k3 |
| Laboratoire | Alibaba | Moonshot AI |
| Sortie | 2 août 2026 (GA) | 16 juil. 2026 |
| Paramètres totaux | 2,4T | 2,8T |
| Paramètres actifs | 95Md | Non publié |
| Entrée / 1M | $2.00 | $3.00 |
| Sortie / 1M | $6.00 | $15.00 |
| Entrée en cache / 1M | $0.25 implicite, $0.17 lecture explicite | $0.30 |
| Fenêtre de contexte | 1 000 000 | 1 048 576 |
| Supplément contexte long | Aucun | Aucun |
| Sortie max | 131 072 | Non publié |
| Budget de raisonnement max | 262 144 | Non publié |
| Modalités d'entrée | Texte, image, vidéo | Texte, image, vidéo |
| Contrôle du raisonnement | low / medium / xhigh, xhigh par défaut | max uniquement |
| Poids ouverts | Promis, non publié | Publié le 27 juil. 2026 |
| Licence | Non publiée | Listée comme "other" |
| Fiche modèle | Aucune | Sur Hugging Face |
| Date de coupure des connaissances | Non publiée | Non publiée |
| Limite de débit (palier max) | 15K RPM / 2M TPM | Non publiée |
| Chat grand public | Qwen Studio, gratuit | Kimi.com, gratuit à $199/mois |
Trois lignes font l'essentiel du travail ici. Qwen publie un nombre de paramètres actifs et Moonshot non, ce qui compte car ce sont les paramètres actifs qui déterminent la latence et la facture, pas le total. Qwen est moins cher sur tous les indicateurs. Et Kimi est le seul des deux qu'on peut réellement télécharger.
Ce qu'est Qwen 3.8 Max
Qwen est la famille de modèles d'Alibaba, et Max est la gamme phare propriétaire au-dessus des paliers moins chers Plus et Turbo. Qwen 3.8 Max a été lancé en deux temps : un aperçu le 19 juillet lors de la World AI Conference avec une revendication orale de pointe et aucun chiffre publié, puis un article de lancement de 5 000 mots le 2 août qui apportait tout ce que l'aperçu avait passé sous silence.
L'architecture telle que décrite par Alibaba : 2,4 billions de paramètres au total avec 95 milliards actifs, une conception éparse de type Mixture-of-Experts construite sur la base de Qwen 3.5. L'histoire plus large de la famille figure dans mon test de Qwen, et l'aperçu de Qwen couvre les paliers plus anciens.
Le raisonnement se contrôle avec reasoning_effort, qui accepte low, medium et xhigh, avec xhigh par défaut. Alibaba active aussi preserve_thinking par défaut "pour la meilleure expérience prête à l'emploi". Retenez ce détail, car il revient plus loin comme un problème de coût.
Ce qu'est Kimi K3
Kimi K3 est le modèle phare de Moonshot AI, et son histoire technique est plus inhabituelle que celle de Qwen. Il compte 2,8 billions de paramètres au total, que Moonshot décrit comme activant 16 des 896 experts sous un cadre Stable LatentMoE, en plus de deux composants inédits : Kimi Delta Attention, un mécanisme d'attention linéaire hybride, et Attention Residuals, un remplacement direct des connexions résiduelles standard que Moonshot a publié en open source séparément. Il revendique une efficacité de mise à l'échelle environ 2,5 fois meilleure que Kimi K2.5.
Moonshot se montre étonnamment franc dans son propre article de lancement sur son positionnement :
"While its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol, Kimi K3 demonstrated frontier-level performance across our evaluation suite, consistently outperforming other tested models."
Comparez cela au positionnement de l'aperçu d'Alibaba, qui visait "juste derrière Fable 5" avant même de publier un seul score. Deux laboratoires, deux niveaux de confort très différents avec leurs propres preuves. Mes analyses plus poussées se trouvent dans le test de Kimi K3 et le test de Qwen 3.8 Max.
Une chose que K3 ne propose pas, c'est un curseur de raisonnement. reasoning_effort n'accepte que max, rien d'autre, avec low et high listés comme "à venir". Il n'existe pas de SKU sans réflexion moins chère. Un modèle, un prix, toujours en train de réfléchir.
Benchmarks : aucun n'a mesuré l'autre
C'est là que la plupart des comparaisons directes trichent discrètement. Alibaba a publié un tableau à seize panneaux le 2 août. Moonshot a publié le sien en juillet. Aucun des deux tableaux ne contient l'autre modèle.


Il existe pourtant un moyen de faire le pont entre les deux, et presque personne ne s'en donne la peine. Les deux tableaux partagent les mêmes modèles de référence : Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol. Donc là où les deux labos rapportent le même score pour le même modèle de référence sur le même benchmark, les deux harnais se comportent de façon comparable et leurs propres chiffres peuvent être comparés entre eux. Là où les scores de référence divergent, ce n'est pas possible.

En appliquant ce test aux deux tableaux, exactement trois lignes survivent :
| Benchmark | Accord sur les références communes | Qwen 3.8 Max | Kimi K3 | Vainqueur |
|---|---|---|---|---|
| TerminalBench-2.1 | Fable 5 84.6, Opus 4.8 84.6, Sol 88.8 dans les deux | 86.6 | 88.3 | Kimi, de 1.7 |
| CharXiv (RQ, avec Python) | Fable 5 93.5, Opus 4.8 89.9, Sol 89.1 dans les deux | 93.5 | 91.3 | Qwen, de 2.2 |
| JobBench | Fable 5 57.4, Opus 4.8 48.4 dans les deux ; Sol 45.4 vs 46.5 | 53.4 | 52.9 | Qwen, de 0.5 |
En résumé : une victoire nette chacun sur une évaluation proche du codage et une autre de raisonnement graphique, et une égalité statistique sur le travail agentique de connaissance. C'est toute la comparaison directe défendable qui existe. Quiconque vous montre un tableau de quinze lignes déclarant un vainqueur a mélangé des chiffres issus de deux harnais différents.
Et la raison d'être strict sur ce point apparaît justement dans la quatrième ligne que j'ai dû écarter. Sur FrontierSWE, le tableau d'Alibaba place GPT-5.6 Sol à 88.8 ; celui de Moonshot le place à 71.3. Même modèle, même benchmark, un écart de 17,5 points. Quel que soit le tableau correct, l'un des deux mesure quelque chose que l'autre ne mesure pas, et cet écart est plus grand que la marge revendiquée par l'un ou l'autre laboratoire.
Les notes de bas de page d'Alibaba méritent aussi d'être lues. Elles révèlent que six de ses benchmarks de codage sont internes et non publiés, que les scores des concurrents ont été repris de harnais mixtes plutôt que réexécutés, que les résultats de Fable 5 "peuvent impliquer des solutions de repli", et que plusieurs lignes sont notées par des modèles concurrents : gemini-3.1-pro-preview note PLawBench, Claude Opus 4.6 note PaperBench. Le tableau de Moonshot comporte sa propre version de la même mise en garde.
La seule lecture indépendante disponible est celle d'Artificial Analysis, qui a noté Kimi K3 à 57 sur son Intelligence Index, quatrième sur 189 modèles évalués, avec une vitesse de sortie d'environ 62 tokens par seconde. Sur son évaluation privée de travail de connaissance à long terme, K3 a atteint un Elo de 1547, ce qui, selon le même résumé, représente +732 par rapport à Kimi K2.6.
Le tarif dit Qwen. La facture dit match nul.
Qwen est moins cher sur tous les indicateurs publiés. L'entrée coûte un tiers de moins, la sortie 60% de moins, et sa lecture de cache implicite est à $0,25 contre $0,30 pour le taux de cache hit de Kimi. À nombre de tokens identique, il n'y a pas débat.
Les nombres de tokens ne sont pas identiques. Un développeur qui a fait tourner la même construction d'application web sur les deux modèles, chacun dans le harnais propre à son fournisseur, a publié le décompte :
"* Kimi K3: 9532k input (9172k cached), 114k output - cost $5.5
Qwen 3.8 Max: 18020k input (17836k cached), 114k output - cost $6.3"

Ces $6,30 datent d'avant la disponibilité générale, ils ont donc été facturés aux conditions de l'aperçu plutôt qu'à la grille publiée le 2 août. En repassant ces mêmes volumes de tokens dans les tarifs actuels, Qwen arrive à environ $5,51 (0,184M d'entrée non mise en cache à $2, 17,836M en cache à $0,25, 0,114M de sortie à $6). Kimi arrive à $5,54. Un tarif de sortie 60% moins cher, presque entièrement annulé par le besoin de 1,9 fois plus de tokens en entrée.
C'est ce chiffre qui décide réellement de votre facture, et il ne figure sur aucune des deux pages de tarifs. Qwen active le raisonnement xhigh par défaut avec preserve_thinking activé, et les tokens de raisonnement sont facturés comme des sorties. Kimi tourne aussi toujours en mode max, et sa propre communauté a été directe sur les conséquences :
"The shift from "value" models to "intelligent, huge and slow" models coming from China is an interesting change in strategy. My main issue with GLM 5.2 and Kimi 3 is that they're extremely token hungry and thus feel slow(er) to use."
Aucun des deux n'est plus l'option économique. Les deux se situent dans la même gamme de prix que Claude Sonnet, et DeepSeek V3.2 reste un ordre de grandeur en dessous des deux. L'image du "modèle chinois bon marché" appartient à la génération précédente.
Entrez vos propres volumes, y compris la part de votre entrée mise en cache et le niveau de verbosité attendu de Qwen :
Poussez le curseur de verbosité au-delà de 1,9x et Kimi l'emporte sur le coût malgré un tarif de sortie plus de deux fois supérieur. Ce point de bascule, et non le prix affiché, est ce que votre équipe finance regardera dans trois mois.
Poids ouverts : la seule différence nette
Les deux modèles ont été annoncés comme ouverts. Un seul l'est réellement.
Moonshot avait dit que les poids seraient disponibles avant le 27 juillet 2026, et ils l'ont été. Le dépôt de Kimi K3 affiche un checkpoint modifié pour la dernière fois le 27 juillet, avec un index safetensors totalisant 2 779 931 837 184 paramètres, ce qui confirme de l'extérieur la revendication de 2,8T plutôt que par un simple communiqué de presse. Il a depuis dépassé les 837 000 téléchargements et 9 700 likes, et des quantisations communautaires existent déjà. La licence n'est listée que comme "other", donc à lire avant de bâtir une activité dessus.
Qwen 3.8 Max attend toujours. L'article de lancement d'Alibaba promet les poids sur Hugging Face et ModelScope "la semaine prochaine" à trois reprises distinctes, la page d'accueil de qwen.ai qualifie la sortie d'"Open-Source", et il n'y a ni dépôt, ni licence, ni date. Depuis le 2 août, "la semaine prochaine" signifie la semaine du 9 août.
Deux mises en garde avant de s'emballer. Premièrement, un checkpoint 8 bits de 2,78 billions de paramètres est un artefact de datacenter, pas quelque chose qu'on fait tourner sur un poste de travail, donc "ouvert" signifie ici auditable et auto-hébergeable à grande échelle plutôt que local. Si le local est votre véritable besoin, les petits modèles de langage sont la catégorie honnête. Deuxièmement, la communauté des modèles locaux sur Hacker News a clairement interprété l'annonce de Qwen comme une réponse d'agenda :
"I assume that this announcement has been prompted by that of Moonshot AI, which has just announced a 2.8T parameter open-weights LLM, Kimi K3, to be published on Huggingface by 27 July. Now the response of Alibaba is that they will also publish soon a big open weights LLM, the 2.4T parameter Qwen 3.8."
Ce que disent vraiment les développeurs qui ont testé les deux
Les benchmarks mesurent la capacité. La production mesure la capacité divisée par la patience. Sur l'ensemble des fils de discussion des lancements, les retours pratiques penchent pour Kimi, et presque aucun ne concerne l'intelligence.
La phrase la plus tranchante du fil de l'aperçu Qwen était une comparaison directe :
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
Un développeur ayant testé quatre modèles de pointe côte à côte pendant plusieurs jours a abouti à un jugement plus nuancé :
"Having tested K3, Qwen 3.8 max preview, Fable and Sol for the past few days, I partially agree. Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA [...] if I had to find an alternative, I could live with both K3 and Qwen3.8 just fine."
Et un retour est allé plus loin que je ne le ferais sur la base d'une seule charge de travail, mais c'est le verdict le plus répété dans le fil, et il vaut la peine d'être lu comme un point de données plutôt que comme une conclusion :
"In my limited anecdotal experience, Kimi K3 is a bit better than Opus 4.8 and Qwen3.8 Max is disastrously bad. It can reason fine, but the moment it tries to do something it gets stuck into long second-guessing loops with no progress."
Cela vaut la peine d'être mis en balance avec le camp Kimi, où l'enthousiasme était fort le jour du lancement et où un développeur n'a pas pu le distinguer du modèle phare d'Anthropic lors d'un test à l'aveugle :
"I've been playing around with it for the past few hours, and I think it's an amazing model. I'm not sure I could tell the difference between this and Fable in a blind test."
Si cette dispersion vous préoccupe, la solution la plus sûre est une liste courte plutôt qu'un choix unique. La mienne pour ce côté du panel est les alternatives à Qwen. Le comparatif des alternatives à Kimi K3 couvre le sujet dans l'autre sens, et il existe une liste plus ciblée d'alternatives à Qwen 3.8 Max pour ce seul modèle.
Certaines informations ne sont tout simplement pas publiées pour l'un ou l'autre modèle. Aucune date de coupure des connaissances. Aucune fiche système. Aucune évaluation de sécurité côté Qwen, et aucun article d'architecture côté Kimi tant que le rapport technique n'est pas sorti. Si les achats demandent, la réponse aujourd'hui est que ça n'existe pas.
Où un modèle de pointe s'arrête et où commence le travail de support
C'est la partie qui me préoccupe le plus, car c'est là que je vois les équipes perdre un trimestre entier.

Aucun de ces modèles ne connaît votre politique de remboursement. Aucun n'a lu vos 7 000 derniers tickets. Aucun ne sait que le client qui vous écrit dispose d'un plan entreprise et a déjà escaladé deux fois. Un score de benchmark n'est pas un agent de support, et la distance entre ces deux choses est précisément là où la plupart des projets d'automatisation du support par IA s'enlisent en silence.
C'est aussi pourquoi choisir un helpdesk IA est un exercice différent de choisir un modèle, et pourquoi l'automatisation des tickets vit ou meurt selon la recherche documentaire, pas le raisonnement brut.
J'ai passé mon temps chez eesel à construire la couche agentique, et le mode de défaillance que je vois revenir sans cesse est pire que "l'IA ne sait pas". C'est l'invention avec assurance. L'histoire des marques de voitures évoquée au début de cet article en est l'exemple le plus clair que j'aie : le modèle ne s'est pas trompé sur la langue, il s'est trompé sur le périmètre, parce que le centre d'aide disait "nous prenons en charge tous les modèles" et qu'il l'a pris au pied de la lettre. Le résumé que cette équipe a fait elle-même de la mise au point correcte de leur configuration était "des essais et erreurs au début". Un modèle de 2,8 billions de paramètres aurait fait la même affirmation, en plus fluide.
Le contrôle qui règle ce problème est apparu lors d'un appel avec un responsable support gérant 7 000 tickets par mois, et il n'a rien à voir avec le choix du modèle :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
C'est une décision produit, pas une décision de modèle. C'est pourquoi eesel AI exécute une simulation sur les tickets historiques avant toute mise en production, afin de voir d'abord le taux de résolution et les réponses réelles sur de vraies conversations passées.
C'est également pourquoi les réponses sont acheminées selon le niveau de confiance, rédigées pour un humain ou escaladées plutôt que devinées, et pourquoi la classification des tickets s'exécute comme une étape à part entière plutôt que d'être noyée dans un seul prompt géant.
Ce qui rend la lecture stratégique de cette comparaison un peu anticlimatique : construisez de façon à pouvoir changer le moteur. La couche de modèle s'améliore et devient moins chère toutes les quelques semaines. Kimi K3 est arrivé dix-sept jours avant Qwen, GPT-5.6 a réduit son palier le moins cher de 80% en un seul après-midi, et ce qui dominera le classement en septembre ne figure aujourd'hui sur aucun des deux tableaux.
C'est pour la même raison que je ne miserais pas tout sur Gemini non plus, aussi bons que paraissent ses chiffres ce mois-ci. Cela s'applique tout autant à Grok. GLM 5.2 est l'autre modèle phare chinois situé exactement dans ce même segment, et je lirais son argumentaire business avec le même haussement d'épaules.
Alors, lequel choisir ?
Si vous lancez quelque chose et voulez une seule réponse :
- Longues boucles d'agents où l'efficacité en tokens décide de la facture : Kimi K3. Il a fait le même travail avec environ la moitié des tokens en entrée, et cet écart compense sa grille tarifaire plus élevée.
- Travail intensif en graphiques, documents et vidéo : Qwen 3.8 Max. Il l'emporte sur CharXiv avec un harnais comparable, et Alibaba documente l'entrée vidéo avec des plafonds concrets que Moonshot n'égale pas dans son propre matériel de lancement.
- Tout ce que vous devez auto-héberger ou auditer : Kimi K3, sans discussion possible. Les poids existent, le nombre de paramètres se vérifie à partir du checkpoint, et ceux de Qwen restent une promesse.
- Un curseur de raisonnement qu'on peut réduire : Qwen 3.8 Max, le seul des deux avec des niveaux d'effort
lowetmedium. Kimi tourne au maximum ou pas du tout. - Le coût le plus bas par token, un point c'est tout : Qwen, sur tous les indicateurs. Mesurez simplement le coût par tâche terminée avant de bâtir un budget dessus.
- Tout ce qui est destiné au client : aucun des deux seul. Choisissez d'abord la couche et laissez-la choisir le modèle. Les calculs sont dans mon détail des coûts d'agents, et la liste courte est dans les meilleurs agents IA.
Ce que je ne ferais pas, c'est traiter l'un ou l'autre tableau comme définitif. Trois lignes constituent la totalité du recoupement honnête entre les deux, six des benchmarks de codage d'Alibaba sont des évaluations internes non publiées, et aucun tiers n'a rejoué quoi que ce soit de tout cela.
Attendez-vous à ce que les deux grilles tarifaires bougent avant que des chiffres indépendants n'arrivent. Je garde le détail des tarifs de Kimi K3 comme une page vivante pour cette raison, et il en va de même pour les tarifs de Qwen 3.8 Max. Le comparatif Qwen 3.8 Max vs GPT-5.6 devra lui aussi être revu en même temps que celui-ci.
Essayer eesel
Si vous êtes arrivé ici parce que vous voulez un modèle qui clôture des tickets plutôt qu'un modèle qui gagne des classements, c'est exactement l'objet d'eesel AI. Il se connecte à Zendesk, Freshdesk, Gorgias et plus de 100 autres outils, apprend de votre centre d'aide et de vos tickets passés, et commence à rédiger des réponses en quelques minutes.

Ce qui fait la différence, c'est la rampe de confiance, pas le moteur. Simulez sur votre historique de tickets réel, lisez les chiffres, démarrez en mode brouillon, et passez en autonome seulement quand vous aimez ce que vous voyez. Vous héritez de chaque avancée de pointe, que ce soit Kimi, Qwen ou ce qui sortira en septembre, sans avoir à tout rebrancher. Essayez eesel gratuitement, sans carte bancaire.
Questions fréquentes
Qwen 3.8 Max est-il meilleur que Kimi K3 ?
Lequel est le moins cher, Qwen 3.8 Max ou Kimi K3 ?
Kimi K3 est-il open source, et les poids de Qwen 3.8 Max sont-ils disponibles ?
Quelle est la fenêtre de contexte de Qwen 3.8 Max face à Kimi K3 ?
Lequel est le meilleur pour coder, Qwen 3.8 Max ou Kimi K3 ?
Puis-je faire tourner Qwen 3.8 Max ou Kimi K3 en local ?
Qwen 3.8 Max et Kimi K3 prennent-ils en charge la vision ?
Puis-je utiliser Qwen 3.8 Max ou Kimi K3 pour le support client ?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








