Qwen 3.8 Max vs DeepSeek V4 Flash : prix, specs, vrai verdict

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 3, 2026

Vérifié par un expert
Illustration mettant en balance le Qwen 3.8 Max d'Alibaba et DeepSeek V4 Flash

Le tableau de bord en 60 secondes

Qwen 3.8 MaxDeepSeek V4 Flash
ID du modèleqwen3.8-maxdeepseek-v4-flash
Build épingléeQwen3.8-MaxDeepSeek-V4-Flash-0731
Sortie2 août 202631 juillet 2026
Entrée / 1M$2.00$0.14
Entrée en cache / 1M$0.25$0.0028
Sortie / 1M$6.00$0.28
Fenêtre de contexte1 000 0001 000 000
Sortie max131 072384 000
ArchitectureMoE 2,4T total / 95B actifsMoE 284B total / 13B actifs
PoidsPromis, non publiésOuverts, MIT
EntréesTexte, image, vidéo, documentsTexte
Raisonnement par défautxhigh, preserve_thinking activéRéflexion activée, effort high
Tokens de raisonnement max262 144Non publié
Plafond de débit2M TPM, 15K RPM2 500 requêtes simultanées
Rang LMArena Text#5, 1496#79, 1436
Indice d'intelligence AAPas encore noté50
Changement de prix à venirAucun publié2x aux heures de pointe

Deux lignes font l'essentiel du travail ici. Le plafond de sortie est celle qui passe inaperçue : Flash peut écrire 384K tokens en une seule réponse contre 131 072 pour Qwen, ce qui compte pour tout ce qui doit générer un artefact long plutôt qu'une réponse de chat. L'autre est le changement de prix à venir aux heures de pointe, que je mettrais dans un tableur, car c'est le seul mouvement de prix futur annoncé des deux côtés.

Calculez ce que vous paieriez réellement

Les ratios ci-dessus sont par token. Ce qui vous importe réellement, c'est la facture, et elle dépend davantage de la forme de votre trafic que de la grille tarifaire elle-même. Bougez les curseurs.

Ce qu'est réellement DeepSeek V4 Flash

Flash est le petit frère de la famille V4 de DeepSeek, et le mot « petit » a un vrai poids dans cette phrase. C'est un modèle Mixture-of-Experts avec 284B de paramètres au total et seulement 13B actifs, contre 1,6T au total et 49B actifs pour V4 Pro, selon le tableau de téléchargement des modèles de DeepSeek. Pour donner une échelle, la génération précédente de DeepSeek, V3.2-Base, comptait 671B au total et 37B actifs, donc Flash fait moins de la moitié de la taille totale du modèle qu'il remplace. Treize milliards de paramètres actifs rapprochent son calcul par token d'un petit modèle de langage plutôt que de tout ce qui porte l'étiquette « frontier » dans le marketing.

La build derrière l'alias de l'API est DeepSeek-V4-Flash-0731, et DeepSeek est étonnamment transparent sur le fait qu'il ne s'agit pas d'une nouvelle architecture. Le changelog dit qu'il a conservé l'architecture et la taille de la preview et « n'a été que ré-entraîné en post-training ». Cet aveu compte, car le bond de benchmarks entre la preview et 0731 est énorme. Le tableau publié par DeepSeek montre DeepSWE passant de 7.3 à 54.4 sur des poids identiques, la seule différence étant le post-training.

Trois éléments architecturaux sont cités sur la fiche modèle de V4 : un hybride de Compressed Sparse Attention et de Heavily Compressed Attention, des Manifold-Constrained Hyper-Connections pour la stabilité du signal entre les couches, et l'optimiseur Muon. L'argument d'efficacité que tout le monde cite, 27% des FLOPs d'inférence à un seul token et 10% du cache KV par rapport à V3.2, est mesuré sur Pro, pas sur Flash, donc il faut se méfier de le répéter pour ce modèle.

Deux détails m'importent, en tant que personne qui livre ce genre de choses pour vivre. Le décodage spéculatif est intégré dans le checkpoint plutôt que d'être un modèle de brouillon séparé, donc sous vLLM cela se résume à un seul flag, et DeepSeek prévient explicitement de ne pas le pointer vers un chemin de brouillon. Et les poids sont sous licence MIT, environ 167 Go en précision mixte FP4 et FP8, avec 57 quantifications déjà disponibles sur Hugging Face. Si votre plan est de faire tourner un modèle proche de la frontière sur votre propre matériel, c'est là tout l'enjeu.

Ce qu'est réellement Qwen 3.8 Max

Qwen est allé dans la direction opposée sur presque tous les axes. Le porte-étendard d'Alibaba est un MoE épars de 2,4 billions de paramètres avec 95B actifs, et son premier modèle multimodal au-dessus du billion de paramètres, acceptant texte, images, vidéo et documents. L'annonce de la preview par l'équipe Qwen affirmait qu'il était « juste derrière Fable 5 », ce qui à l'époque venait sans tableau de benchmarks, sans fiche modèle et sans licence non plus.

La disponibilité générale du 2 août a réglé le problème des chiffres. Pas celui de l'ouverture. Le billet de la GA a apporté un graphique complet de benchmarks et une fenêtre de 1 000 000 de tokens, et QwenCloud affiche désormais une vraie grille tarifaire à $2 et $6, avec des lectures de cache implicites à $0.25.

Les poids avaient été promis sur Hugging Face et ModelScope, réaffirmés à la GA comme arrivant « la semaine prochaine », et ne sont toujours pas apparus. Donc, le cadrage honnête, côté licence, est que l'un des deux est open source aujourd'hui et l'autre n'est qu'une promesse. Mon panorama des alternatives à Qwen 3.8 Max approfondit ce que cela signifie si vous avez besoin des poids, et le guide sur le prix de Qwen 3.8 Max retrace comment le tarif de la preview est devenu celui-ci.

L'autre chose à savoir concerne les réglages par défaut, pas la capacité. Qwen fonctionne avec le raisonnement xhigh activé et preserve_thinking activé, et dépensera jusqu'à 262 144 tokens de raisonnement. Chacun d'eux est facturé au tarif de sortie, donc le coût par tâche et le tarif par token commencent à diverger. C'est le même piège dont j'ai parlé dans la comparaison Opus 5 vs Sonnet 5, où le modèle le plus cher gagnait sur le coût par tâche en terminant avec moins de tokens. Il vaut la peine d'ajouter une note d'équité ici : la configuration du harnais de codage propre à Qwen déclare maxTokens: 65536, donc le plafond de sortie de 131K n'est pas ce que son propre outillage livré demande réellement.

L'écart de prix, et les deux choses qu'il cache

Voici cet écart dessiné à l'échelle, car le ratio ne se ressent pas vraiment dans une phrase.

Diagramme en barres comparant le prix de sortie par million de tokens pour Qwen 3.8 Max, DeepSeek V4 Pro et DeepSeek V4 Flash
Diagramme en barres comparant le prix de sortie par million de tokens pour Qwen 3.8 Max, DeepSeek V4 Pro et DeepSeek V4 Flash

Donc, la première chose qu'il cache. DeepSeek scinde la tarification d'entrée entre tarifs de cache hit et de cache miss, et sur Flash l'écart est de $0.0028 contre $0.14, un facteur 50. La mise en cache est activée par défaut sans modification de code, ce qui ressemble à de l'argent gratuit jusqu'à ce qu'on lise comment un hit est décidé.

Diagramme de décision montrant quand une requête DeepSeek est facturée au tarif de cache hit plutôt qu'au tarif de cache miss
Diagramme de décision montrant quand une requête DeepSeek est facturée au tarif de cache hit plutôt qu'au tarif de cache miss

Une requête n'est facturée au tarif hit que si elle correspond entièrement à une unité de préfixe de cache persistée. Un chevauchement partiel ne compte absolument pas, ce que DeepSeek attribue à son attention à fenêtre glissante. DeepSeek qualifie la mise en cache de « best-effort » sans taux de hit garanti, et les entrées inutilisées sont purgées « généralement en quelques heures à quelques jours ». On peut auditer la répartition par appel via prompt_cache_hit_tokens dans la réponse, et il faut le faire, car le tarif de $0.0028 n'est pas un état stable sur lequel on peut baser un budget.

La deuxième chose qu'il cache, c'est la direction que prendra le prochain mouvement tarifaire de DeepSeek. Il n'existe aujourd'hui aucune remise en heures creuses. En revanche, la grille tarifaire annonce que les prix aux heures de pointe « seront 2 fois les prix normaux », applicable à tous les postes de facturation, entre 9h et 12h et entre 14h et 18h heure de Pékin. En UTC, cela correspond à 01:00-04:00 et 06:00-10:00, quotidiennement. La date d'entrée en vigueur n'est pas annoncée, et aucune grille de tarifs de pointe n'est publiée non plus.

J'ai déjà observé exactement cette même anxiété se jouer lors d'appels commerciaux. Un acheteur avec qui nous avons parlé avait vu le prix d'un fournisseur précédent plus que doubler et est arrivé en demandant d'emblée des verrouillages de prix contractuels avant de discuter de quoi que ce soit d'autre. Un doublement à venir sans date de début est exactement le type de phrase qui fait qu'une équipe finance refuse de se standardiser sur un fournisseur, même si le tarif d'aujourd'hui semble excellent.

Benchmarks : le tableau de qui, exécuté sur le harnais de qui

Les deux laboratoires ont publié des chiffres. Aucun n'a fait tourner le harnais de l'autre, donc superposer les deux tableaux donne une comparaison qui n'est pas réelle.

Le tableau phare de DeepSeek pour 0731 comprend neuf benchmarks agentiques, et Flash bat V4 Pro Preview sur les neuf tout en restant derrière Claude Opus 4.8 sur les neuf. Il vaut la peine de savoir qu'Opus a depuis avancé d'une génération, ce que couvre ma revue de Claude Opus 5 :

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewOpus-4.8
Terminal Bench 2.182.761.872.185.0
NL2Repo54.239.438.569.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.858.0
Toolathlon-Verified70.349.755.976.2
Agents' Last Exam25.215.816.525.7
AutomationBench Public25.110.812.827.2
DSBench-FullStack68.737.041.871.6
DSBench-Hard59.625.831.171.7

Lisez les notes de bas de page, elles changent le poids que portent ces lignes. La fiche modèle 0731 de DeepSeek indique que les tâches d'agent de code ont tourné en « mode minimal du DeepSeek Harness (à venir) » avec un effort de raisonnement max, donc le harnais qui a produit ces scores n'est pas public et les chiffres ne peuvent pas être reproduits indépendamment aujourd'hui. Et deux des neuf lignes, DSBench-FullStack et DSBench-Hard, sont des jeux de tests internes propres à DeepSeek.

Le graphique d'Alibaba a le même type de problème, seulement vu de l'autre côté. Six de ses benchmarks de code sont des évaluations internes Qwen, et les scores des concurrents proviennent de harnais mixtes plutôt que de conditions identiques. Plusieurs lignes sont aussi notées par des modèles rivaux. J'ai passé ce graphique en revue en détail dans la comparaison Qwen 3.8 Max contre GPT-5.6.

Le seul endroit où existe un chiffre comparable à conditions égales se trouve dans le propre tableau croisé des modes de DeepSeek, et honnêtement c'est la chose la plus utile de tout cet article :

BenchmarkFlash sans réflexionFlash highFlash max
HLE (Pass@1)8.129.434.8
Apex (Pass@1)1.019.133.0
LiveCodeBench (Pass@1)55.288.491.6
GPQA Diamond (Pass@1)71.287.488.1
MRCR 1M (MMR)37.576.978.7

Mêmes poids, même grille tarifaire. Trois configurations. Flash sans réflexion obtient 8.1 sur HLE et 1.0 sur Apex ; à effort maximal, il obtient 34.8 et 33.0. Désactiver la réflexion sur ce modèle n'est pas un petit compromis, et l'activer signifie payer les tokens de raisonnement au tarif de sortie, avec un plafond de 384K à remplir. C'est la phrase que j'aimerais que quiconque cite le chiffre de $0.28 lise en premier.

DeepSeek est aussi honnête sur les points où Flash perd face à Pro, et je respecte cela. La fiche modèle indique que Flash-Max atteint une performance de raisonnement comparable avec un budget de réflexion plus important, mais reste « légèrement en retrait sur les tâches de pur savoir et les flux de travail agentiques les plus complexes ». Les chiffres le confirment : SimpleQA-Verified est à 34.1 pour Flash Max contre 57.9 pour Pro Max. Treize milliards de paramètres actifs, c'est là où le savoir général devient coûteux, et cet écart a été mesuré sur la preview, donc personne ne devrait prétendre que 0731 l'a comblé.

Ce que disent les classements indépendants, et où ils divergent

C'est là que la version facile de cette comparaison s'effondre. Il existe deux arbitres indépendants. Ils mesurent des choses différentes, et en ce moment ils pointent dans des directions opposées.

Artificial Analysis note DeepSeek V4 Flash à effort maximal avec un Indice d'Intelligence de 50, troisième parmi les modèles à poids ouverts, pour un coût par tâche de $0.03. Le même classement note la variante sans raisonnement des mêmes poids à 29. Donc mon point précédent n'est pas que le tableau interne de DeepSeek qui parle : un laboratoire externe a mesuré un écart d'intelligence de 21 points entre la configuration bon marché et la bonne.

Artificial Analysis signale aussi un point qui va à l'encontre du récit du prix. Flash a brûlé 210M de tokens de sortie pour compléter l'Indice d'Intelligence contre une médiane de classe de 100M, ce que le classement décrit lui-même comme "très verbeux en comparaison". L'exécution complète n'a tout de même coûté que $72.02, donc des tokens bon marché ont ici absorbé la verbosité. Mais le mécanisme est le même que celui que j'ai signalé sur les réglages par défaut de Qwen, et il se trouve que le modèle avec le problème de verbosité mesuré est le bon marché. C'est le chiffre que j'aimerais voir publié plus souvent dans les comparaisons d'outils de codage IA, car la verbosité est ce qui transforme une grille tarifaire en facture.

Pour ce qui est de Qwen sur ce classement : il n'y figure pas. Qwen 3.8 Max n'a aucun score Artificial Analysis à la date du 3 août 2026, un jour après sa GA. La ligne Alibaba la plus élevée est Qwen3.7 Max à 46. Quiconque cite un score d'intelligence indépendant pour Qwen 3.8 Max cette semaine cite le mauvais modèle.

LMArena, qui repose sur un vote de préférence humaine plutôt que sur des évaluations automatisées, raconte l'histoire inverse :

ClassementQwen 3.8 MaxDeepSeek V4 Flash
Texte, rang global#5#79
Elo Texte1496 ± 101436 ± 4 (48 667 votes)
WebDev#4, 1668#8, 1577 (en tant que -high)
Vision#2, 1305Non éligible

Soixante points d'Elo et soixante-quatorze places de rang, en faveur du modèle coûtant 21 fois plus cher. Deux réserves avant de capturer ce tableau en image. Les lignes WebDev et Texte de Qwen sont marquées Preliminary avec les intervalles de confiance les plus larges du classement, ±18 sur seulement 1 563 votes, contre ±4 pour Flash sur 48 667. Et le deepseek-v4-flash simple est totalement absent de WebDev, donc cette ligne compare Qwen à la variante -high de Flash.

Le tableau de bord se lit donc ainsi : le composite automatisé préfère Flash et n'a pas mesuré Qwen, tandis que les humains préfèrent Qwen avec une marge large sur des données minces. Ce même clivage automatisé contre humain est apparu dans ma comparaison GPT-5.6 contre Claude, et c'est pourquoi je ne fais pas confiance à un verdict à chiffre unique pour aucun de ces lancements.

Là où ces deux modèles ne sont pas vraiment en concurrence

Enlevez le prix et une image différente apparaît. Ces deux modèles se situent dans des quadrants différents, et la requête de recherche qui vous a amené ici aplatit cette différence.

Quadrant de positionnement plaçant Qwen 3.8 Max et DeepSeek V4 Flash selon le prix par token face à l'entrée multimodale
Quadrant de positionnement plaçant Qwen 3.8 Max et DeepSeek V4 Flash selon le prix par token face à l'entrée multimodale

DeepSeek ne publie aucune entrée image, vidéo, audio ou document pour V4 Flash. Sa configuration déclare un modèle de langage causal sans bloc d'encodeur de vision, et l'étiquette de pipeline Hugging Face est génération de texte. La ligne de fonctionnalités de la grille tarifaire liste sortie JSON, appels d'outils et FIM, sans aucune ligne d'entrée de fichier nulle part. Le travail multimodal de DeepSeek vit dans des lignes de modèles séparées au sein de la même organisation. Pour être précis, aucune entrée image n'est documentée, ce qui n'est pas la même chose qu'une affirmation qu'il ne peut pas en avoir.

Donc si vos entrées incluent des captures d'écran, cela tranche pour vous. Une file de support où les clients joignent des photos d'un produit cassé, un agent IA lisant des pages Confluence avec des diagrammes intégrés, un flux de travail traitant des factures scannées. Sur le propre graphique d'Alibaba, chaque ligne de vision est une victoire nette pour Qwen, et cette capacité n'est présente sur aucun tableau pour Flash, quel que soit le prix. C'est le même clivage sur lequel je tombe sans cesse quand les équipes évaluent le meilleur LLM pour le support client : le token le moins cher lit rarement la pièce jointe.

Si vos entrées sont du texte et que vous voulez les poids, Flash tranche tout aussi vite. Licence MIT, 167 Go, 57 quantifications communautaires, et les propres recettes vLLM et SGLang de DeepSeek publiées. Qwen 3.8 Max ne peut pas être auto-hébergé du tout pour l'instant, ce qui est tout l'argument de mon panorama des agents IA open source, et la raison pour laquelle je ne traiterais pas ces deux modèles comme des backends interchangeables pour le même agent de support IA sans code.

Ce que dit réellement la réaction

Personne n'a encore publié de test pratique côte à côte avec le même prompt pour ces deux modèles, ce qui n'a rien d'étonnant quand l'un des deux n'a que quelques heures. Ce qui existe, c'est de l'arithmétique, et la version la plus incisive est venue d'un compte IA japonais le jour de la GA, mettant côte à côte les scores DeepSWE dans un post X : Qwen 3.8 Max à 56.6, DeepSeek V4 Flash à 54.4, Kimi K3 à 69, GLM 5.2 à 44. Deux points de DeepSWE, pour un prix d'entrée 14 fois supérieur et un prix de sortie 21 fois supérieur.

Les preuves que des gens ont postées sans y être invités dans le fil de lancement de DeepSeek sont les données de coût les plus concrètes de toute la réaction :

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886" -- lionkor, Hacker News

Une réponse a fait mieux avec 2,1 milliards de tokens sur 12 jours pour $19.27, attribuant cela à ce qu'ils ont appelé le "cache d'entrée 120 fois moins cher" et admettant que la majeure partie de ce trafic était des boucles expérimentales produisant du contenu inutile.

Côté Qwen, le rapport pratique le plus marquant ne porte pas du tout sur la qualité. Il porte sur le fait de réussir à finir :

Hacker News

"Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build. For the implementation, there were signs it had good vision, but the timeouts make this very hard to use in a production setting."

Le test du pélican de Simon Willison a abouti au même constat, avec un prix en plus : selon son commentaire sur HN, cela a pris 11 minutes, oublié les roues, et coûté 17 cents. Notez aussi la réponse qui objecte que les délais d'attente venaient du harnais et non du modèle, une correction légitime qui n'a été tranchée dans aucun sens.

Le scepticisme va dans les deux sens, et le même compte qui a fait le calcul DeepSWE a été direct sur le bond de Flash douze jours plus tôt : DeepSWE passant de 7.3 à 54.4 sur des poids inchangés a suscité un soupçon de benchmaxxing, vu à quel point le modèle avait mal noté quand ce benchmark était nouveau. Cela vaut la peine de le garder en tête, car un ré-post-training produisant un écart de 47 points est soit un vrai résultat d'entraînement, soit un résultat calibré, et il n'existe aucun harnais public pour trancher.

Deux critiques envers Flash reviennent assez souvent pour compter comme des constats. La première porte sur la fiabilité sous compression :

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

Artificial Analysis met un chiffre en face de cela : le taux d'hallucination AA-Omniscience de Flash est de 84%, soit une amélioration de 12 points par rapport à son prédécesseur et encore un chiffre élevé en valeur absolue.

La deuxième porte sur la destination des données, et pour quiconque travaille dans le support, c'est celle-ci qui tranche réellement :

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models [...] But these are 3x to 5x more expensive than directly using DeepSeek."

Si vous acheminez des tickets clients, alors le tarif direct chez l'éditeur n'est pas le tarif que vous pouvez utiliser. Payer 3 à 5 fois plus pour une rétention de données nulle fait passer Flash de $0.28 en sortie à quelque part entre $0.84 et $1.40, ce qui est une tout autre discussion que celle où commence la grille tarifaire.

Sur lequel je construirais

Pour du travail textuel à fort volume où l'on peut mesurer soi-même la qualité de sortie, DeepSeek V4 Flash. Le prix est réel, les poids sont sous MIT, le plafond de concurrence de 2 500 est cinq fois celui de Pro, et la limite de sortie de 384K est la spécification la moins discutée des deux fiches. Faites-le tourner avec l'effort high plutôt que low, et budgétez pour les tokens de raisonnement plutôt que pour le tarif affiché. Traitez le taux de cache hit comme un espoir plutôt que comme une ligne budgétaire.

Pour tout ce dont l'entrée n'est pas du texte pur, Qwen 3.8 Max, et sans hésitation. Le multimodal à l'échelle de la frontière est une catégorie où Flash n'est pas présent, et $6 par million de tokens de sortie est un prix normal pour cela. Son avance en préférence humaine est l'argument le plus fort pour payer 21 fois plus, et la réserve honnête est que cette avance repose actuellement sur 1 563 votes, sans aucun score d'intelligence indépendant derrière pour l'instant.

Ce qui me ferait pencher entre les deux, c'est un chiffre qu'aucun des deux laboratoires ne publie : combien de tentatives chaque modèle nécessite sur votre travail. Flash à $0.28 qui retente trois fois coûte plus cher que Qwen à $6.00 qui réussit du premier coup. Avant de choisir, je ferais passer quelques centaines de mes propres entrées réelles dans les deux, avec un effort de raisonnement équivalent, puis je compterais les tentatives. C'est un week-end de travail, et ça bat n'importe quel classement de cet article.

Pour une file de support spécifiquement, ma réponse honnête est que cette comparaison n'est pas le bon axe. Les deux modèles peuvent produire une réponse fluide à un ticket. Aucun ne connaît votre délai de remboursement, et aucun n'escaladera quand il n'est pas sûr. Aucun des deux n'a non plus lu les 4 000 tickets que votre équipe a déjà traités. Cette dernière partie est un problème de récupération d'information, pas un problème de choix de modèle, et c'est pourquoi la prévention des hallucinations IA est une fonctionnalité produit plutôt qu'une spécification de modèle.

J'entends constamment la version en aval de tout cela : un acheteur a consommé 200 interactions en une seule journée de test et a immédiatement commencé à s'inquiéter du coût par interaction à un rythme de 9 000 par mois. Leur problème n'était en réalité jamais le tarif du token. C'était que rien dans la configuration ne leur disait si les réponses étaient correctes, ce qui est la vraie variable dans tout modèle de coût de l'IA en support client, et la raison pour laquelle je suis plutôt le taux de résolution de tickets par IA.

Essayer eesel pour le travail de support

eesel AI est délibérément agnostique au modèle, parce que le modèle gagnant change toutes les trois semaines et que la couche qui l'entoure est ce que vous possédez réellement. Il s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur un crawl générique, et maintient un seuil de confiance pour qu'une réponse incertaine devienne un transfert vers le helpdesk plutôt qu'une supposition. Et il simule sur vos tickets historiques avant de répondre à un client en direct.

La vue d'activité d'eesel AI montrant les conversations Zendesk résolues et en attente aux côtés des exécutions de skills
La vue d'activité d'eesel AI montrant les conversations Zendesk résolues et en attente aux côtés des exécutions de skills

Cette étape de simulation existe à cause de l'histoire de la marque de véhicule évoquée au début de cet article. Si vous évaluez Qwen ou DeepSeek pour une véritable tâche d'automatisation des tickets de support, la première question qui mérite une réponse n'est pas quel token est le moins cher. C'est à quoi ressemble votre taux de résolution sur vos propres tickets, avant même qu'un client n'en voie quoi que ce soit.

Il se branche directement sur le helpdesk que vous utilisez déjà, Zendesk compris, et il est gratuit à essayer sur votre propre file.

Questions fréquentes

DeepSeek V4 Flash est-il moins cher que Qwen 3.8 Max ?
Oui, et avec une marge importante sur les tarifs publiés. DeepSeek V4 Flash coûte $0.14 par million de tokens en entrée en cas de cache miss et $0.28 par million en sortie. Qwen 3.8 Max coûte $2.00 et $6.00. C'est environ 14 fois plus en entrée et 21 fois plus en sortie, avant même de prendre en compte le nombre de tokens que chaque modèle émet réellement pour terminer une tâche.
Qui est le meilleur, Qwen 3.8 Max ou DeepSeek V4 Flash ?
Cela dépend si vos entrées sont du texte. Qwen accepte les images, la vidéo et les documents ; DeepSeek ne documente aucune entrée image pour V4 Flash. Sur le raisonnement textuel, les deux sont plus proches que ne le suggère le prix, et aucun des deux laboratoires n'a fait tourner le harnais de l'autre. Ma revue complète de Qwen 3.8 Max détaille davantage le problème des tableaux internes aux fournisseurs.
DeepSeek V4 Flash a-t-il des poids ouverts ?
Oui, sous licence MIT, qui autorise l'usage commercial et la modification. Le checkpoint pèse environ 167 Go en précision mixte FP4 et FP8. Qwen 3.8 Max n'est pas comparable ici : les poids avaient été promis à la preview et n'étaient toujours pas publiés à la disponibilité générale. Voir notre panorama des agents IA open source pour ce que coûte réellement l'auto-hébergement.
Quelle est la fenêtre de contexte de Qwen 3.8 Max face à DeepSeek V4 Flash ?
Les deux sont à 1 000 000 de tokens en entrée. La différence se joue en sortie : DeepSeek V4 Flash est plafonné à 384K tokens de sortie contre 131 072 pour Qwen. Aucun des deux ne publie de surcoût pour le contexte long, un point à noter en comparant avec le prix de GPT-5.6.
DeepSeek V4 Flash peut-il lire des images comme Qwen 3.8 Max ?
Aucune entrée image n'est documentée pour DeepSeek V4 Flash. Sa configuration déclare un modèle de langage causal sans encodeur de vision, et DeepSeek garde son travail multimodal dans des lignes de modèles séparées. Qwen 3.8 Max accepte le texte, les images, la vidéo et les documents, ce qui est la raison la plus nette de payer son tarif. Notre guide sur les petits modèles de langage couvre le même compromis à des tailles de paramètres inférieures.
Combien coûte l'exploitation de DeepSeek V4 Flash à grande échelle ?
Avec 500M de tokens en entrée et 200M en sortie par mois et un taux de cache hit de 40%, les tarifs publiés donnent environ $99, contre environ $1 850 pour le même trafic sur Qwen. Deux choses font bouger ce chiffre : DeepSeek a annoncé une hausse de prix à venir de 2x aux heures de pointe, et les tokens de raisonnement sont facturés au tarif de sortie. Notre analyse du coût de l'IA en support client refait le même calcul pour le support.
Puis-je utiliser Qwen 3.8 Max ou DeepSeek V4 Flash pour le support client ?
On peut pointer l'un ou l'autre vers un ticket, mais un modèle brut n'a aucune mémoire de vos tickets passés, aucun garde-fou de confiance et aucun transfert vers le helpdesk. eesel AI apporte cette couche et se connecte à Zendesk et Freshdesk, donc vous achetez une IA pour le service client plutôt qu'un simple tarif par token.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment
Trending

DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment

DeepSeek V4 Flash coûte $0,14 en entrée et $0,28 en sortie par million de tokens, et surpasse le modèle haut de gamme, plus cher, de DeepSeek. Voici ce que la grille tarifaire ne dit pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration comparant les familles de modèles Qwen 3.8 Max d'Alibaba et GPT-5.6 d'OpenAI
Trending

Qwen 3.8 Max vs GPT-5.6 : prix, benchmarks et l'écart réel

Les deux modèles ont enfin des prix et des benchmarks publiés. Voici ce que les chiffres disent réellement, ce qu'ils ne peuvent pas dire, et lequel je choisirais pour construire.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Illustration dessinée à la main de deux personnes examinant un graphique de répartition des prix avec des symboles dollar
Trending

Tarifs de Grok 4.5 : prix de l'API, coût de SuperGrok et frais cachés

Grok 4.5 coûte 2 $/6 $ par million de tokens sur l'API et 30-300 $/mois en forfait grand public. Voici le détail complet, les frais cachés et ce que cela signifie pour votre budget.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Illustration comparant DeepSeek V4 Flash et Kimi K3 de Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3 : lequel choisir ?

Un modèle coûte 29 fois plus cher par tâche que l'autre. J'ai passé en revue tous les chiffres publiés sur les deux, et le plus intéressant est l'option intermédiaire que personne ne devrait choisir.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Deux personnes qui font un bras de fer autour d'une table pendant qu'une troisième regarde, illustrant une comparaison directe entre modèles
Trending

DeepSeek V4 Flash vs GPT-5.6 : lequel choisir pour construire ?

DeepSeek V4 Flash vs GPT-5.6 avec les chiffres d'août 2026. Le vrai duel oppose Flash à Luna, l'intelligence est à égalité, et ce qui tranche, ce sont la vitesse, la vision et les données.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration d'un développeur accédant à Qwen 3.8 Max d'Alibaba via le chat, le multimodal et les surfaces d'API
Trending

Comment accéder à Qwen 3.8 Max : 5 voies et leurs tarifs

Cinq façons réelles d'atteindre le vaisseau amiral d'Alibaba à 2,4 billions de paramètres, du chat gratuit à l'API à $2/$6, plus les pièges de facturation qui attrapent les gens en chemin.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Illustration comparant les niveaux de modèle DeepSeek V4 Flash et V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro : quel niveau utiliser ?

Le niveau bon marché de DeepSeek obtient désormais un score plus élevé que le niveau cher sur le classement indépendant. Voici précisément où cela se vérifie, et les deux endroits où ce n'est pas le cas.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Illustration comparant le Qwen 3.8 Max d'Alibaba et le Kimi K3 de Moonshot AI
Trending

Qwen 3.8 Max vs Kimi K3 : les chiffres qu'aucun labo n'a publiés

Deux laboratoires chinois ont lancé un modèle phare de plus de 2 000 milliards de paramètres à dix-sept jours d'intervalle, et aucun n'a mis l'autre sur son tableau de benchmarks. Voici ce qui se compare réellement, ce que coûte vraiment la facture, et lequel je choisirais.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Illustration de deux personnes examinant des cartes de tarifs échelonnés sur un écran, avec le logo Qwen
Trending

Tarifs de Qwen 3.7 Flash : ce que vous payez vraiment en 2026

Le tarif de $0.03 est réel, et ce n'est qu'un des quatre compteurs sur votre facture. Voici comment le palier de prompt, le cache, la région de batch et le taux de retentatives se combinent pour former le montant qui vous est réellement facturé.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement