
Les caractéristiques, côte à côte
Ces deux modèles sont sortis à moins de trois semaines d'intervalle. Tous deux issus de laboratoires chinois, tous deux avec des poids publiés, et tous deux avec une fenêtre de contexte d'un million de tokens. C'est à peu près là que s'arrête la ressemblance. Pour du contexte sur chacun séparément, il y a mon test de Kimi K3, ainsi qu'un tour d'horizon de DeepSeek V3.2, la génération dont Flash est issu.
| DeepSeek V4 Flash | Kimi K3 | |
|---|---|---|
| Sortie | build 0731, 31 juillet 2026 | 16 juillet 2026 |
| Entrée, cache miss | $0.14 / 1M | $3.00 / 1M |
| Entrée, cache hit | $0.0028 / 1M | $0.30 / 1M |
| Sortie | $0.28 / 1M | $15.00 / 1M |
| Fenêtre de contexte | 1M | 1 048 576 |
| Sortie max | 384K | 131 072 par défaut, réglable à 1 048 576 |
| Paramètres | 284B au total, 13B actifs | 2,8T au total, 104B actifs |
| Modalités d'entrée | Texte seul | Texte, image, vidéo |
| Contrôle du raisonnement | Sans réflexion ou avec, réflexion par défaut | low / high / max, jamais désactivable |
| Licence | MIT | Licence Kimi K3, avec clause commerciale |
| Limite de concurrence | 2 500 | Limitée selon le palier de compte, non publiée |
| AA Intelligence Index | 50 | 57 |
| Coût par tâche | $0.03 | $0.86 |
| Vitesse de sortie médiane | 113 tok/s | 35 tok/s |
| Temps de réponse total | 23,36 s | 73,88 s |
| Hallucination AA-Omniscience | 84% | 51% |

Une ligne mérite d'être mise en avant avant d'aller plus loin. Le tarif de cache hit de DeepSeek est à $0.0028 par million, cent fois moins cher que le $0.30 déjà réduit de Kimi. La mise en cache s'active par défaut sans que vous ayez à changer une ligne de code. DeepSeek précise cependant que c'est du best-effort, et les entrées s'effacent "généralement en quelques heures à quelques jours", donc c'est une vraie réduction, mais qu'il ne faut pas considérer comme un état permanent.
Le prix au token est le mauvais chiffre
Voici le piège de ce genre de comparaison. La grille tarifaire dit que Flash est 54 fois moins cher en sortie. La grille tarifaire n'est pas votre facture.
Artificial Analysis publie une métrique bien plus proche de la réalité, le coût par tâche, c'est-à-dire la moyenne pondérée de ce qu'il en coûte réellement pour terminer une tâche de leur index. Sur cette mesure, Flash est à $0.03 et K3 à $0.86. Un écart toujours énorme, mais de 29x et non de 54x, et la raison est que Flash consomme davantage de tokens pour arriver où que ce soit. Il a produit 210M de tokens en sortie en parcourant l'index complet, contre 130M pour K3, les deux étant mesurés sur une médiane de classe de 100M. AA qualifie Flash de "très verbeux". K3 est aussi qualifié de verbeux. Les deux sont bavards, Flash l'est simplement davantage.
Faire tourner l'index complet a coûté $72,02 sur Flash et $2 437,41 sur K3. Les mêmes neuf évaluations, le même travail. Si vous avez l'habitude de penser vos dépenses IA comme un coût de service mensuel plutôt qu'un tarif au token, ce ratio est celui à retenir.
Les tokens de raisonnement sont ce qui creuse l'écart entre le prix affiché et la facture, et c'est le point que la plupart des comparatifs de prix passent sous silence. Simon Willison a fait tourner son prompt habituel du pélican sur K3, puis a publié le ticket de caisse :
"95 input, 16,658 output = 25 cents! [...] (13,241 of those were reasoning tokens.) I think that's the most expensive pelican I've rendered through a Chinese model so far."
Quatre-vingt-quinze tokens en entrée, vingt-cinq cents en sortie, et 79% de ce qu'il a payé correspondait à une réflexion qu'il n'a jamais lue.

Les deux modèles facturent le raisonnement au tarif de sortie, et chez les deux la réflexion est activée par défaut, donc cela s'applique dans les deux cas. Il en coûte simplement 54 fois plus par token pour l'un des deux.
Il vaut mieux signaler ici une complication honnête plutôt que de prétendre que la mesure est tranchée. Un développeur ayant exécuté des prompts identiques sur les deux a constaté que la comparaison de verbosité allait dans l'autre sens :
"It says there that "Kimi K3 (Max)" would think/reason less than than deepseek-v4-flash, and a whole bunch of other models [...] but in my experience, K3 is probably the model that thinks/reasons the longest of all of these."
Les deux peuvent être vrais en même temps. L'index d'AA est un mélange particulier de tâches d'évaluation courtes, et votre charge de travail n'est pas ce mélange. Ce qui est la vraie leçon ici : faites tourner vos propres prompts sur les deux et comptez les tokens, car les chiffres de verbosité publiés ne se transposeront pas proprement à votre cas d'usage.
Sur l'argument du cache en revanche, c'est là que Flash devient difficile à battre :
"I don't understand how DeepSeek can be so cheap with their cache pricing - ~0.003 usd / 1Mtok. 100x less than Kimi K3, or similar numbers against pretty much any other decently sized model to my knowledge. I've been using it whenever possible as even longer agent sessions cost few cents."
L'option intermédiaire qui n'en est pas une
C'est la découverte que j'aurais aimé avoir si j'étais l'acheteur, et elle ne figure sur la page d'aucun des deux fournisseurs.
Kimi a introduit les niveaux de raisonnement low et high quelque temps après le lancement, donc K3 n'est plus limité à l'effort maximal. Le réflexe évident est de se tourner vers low pour conserver l'essentiel de la qualité de K3 pour une fraction de la facture. Artificial Analysis a mesuré cette configuration séparément, et ça ne fonctionne pas.
Kimi K3 en low obtient 47 points sur l'Intelligence Index, à $0.24 par tâche. DeepSeek V4 Flash obtient 50 points à $0.03. Le K3 réduit coûte huit fois plus cher que Flash et obtient trois points de moins. Il n'est même pas plus rapide, 34 tokens par seconde contre 35 pour K3-max, avec un temps de réponse total légèrement plus mauvais.

Il n'y a pas non plus de soulagement côté prix, car les niveaux sont facturés au même tarif. Le guide de démarrage de Kimi K3 est direct sur ce que fait ce curseur, en réponse à la question de savoir si on peut désactiver le raisonnement : « Impossible, K3 réfléchit toujours. Si le raisonnement prend trop de temps, réglez reasoning_effort sur low. » C'est un contrôle de latence, pas un palier de coût. L'économie se limite aux tokens de raisonnement que vous évitez.
Le choix est donc binaire. Payer $0.03 ou payer $0.86. Voici à quoi cela ressemble en volume :
Ce que facture chaque option selon votre volume
Coût par tâche d'Artificial Analysis, multiplié. Choisissez un volume mensuel de tâches.
Une « tâche » ici correspond à une tâche de l'Artificial Analysis Intelligence Index, une approximation de votre charge de travail, pas une correspondance exacte. Servez-vous-en pour comparer les trois options entre elles, pas pour prévoir une facture.
Là où chacun l'emporte réellement
Sur l'intelligence brute mesurée, K3 est en tête, et sur le classement l'écart n'est pas serré. 57 contre 50, septième rang au global, et le modèle à poids ouverts le mieux classé parmi les 99 suivis par Artificial Analysis. Flash arrive troisième parmi les poids ouverts, derrière K3 et GLM-5.2.
Les propres graphiques de lancement de Moonshot racontent une histoire cohérente, et méritent d'être lus avec une réserve en tête.

La réserve, c'est que DeepSeek n'apparaît pas du tout sur ce graphique. Moonshot a comparé K3 à Fable 5, GPT-5.6 Sol, Opus 4.8, GLM-5.2 et GPT-5.5, laissant de côté le concurrent sérieux à poids ouverts le moins cher. DeepSeek renvoie la pareille, K3 n'apparaît pas non plus sur ses graphiques. C'est l'état normal des choses avec un benchmark fournisseur, et c'est pourquoi l'index indépendant fait l'essentiel du travail dans cet article.
La vitesse et le débit sont là où Flash l'emporte nettement. Il tourne à 113 tokens par seconde contre 35 pour K3, premier fragment en 1,33 seconde contre 2,78, réponse complète en 23,36 secondes contre 73,88. Il dispose aussi d'une limite de concurrence de 2 500. Pour tout ce qui est interactif, cette différence cesse d'être une note de bas de page et devient le produit lui-même :
"Faster iterations are way better for me, I hate waiting for 5-10 minutes on small changes. I tried to use recent versions of Kimi and GLM, but they use too much thinking for no reason and are pretty slow because of it."
Et cette lenteur persiste même pour ceux qui paient le palier grand public le plus élevé :
"I'm still considering pulling the trigger on the annual subscription of Kimi for K3 but it's sometimes slower than I'd like (at least when compared to Anthropic) even on their Vivace plan"
Du côté de Flash, le retour d'expérience le plus utile que j'ai trouvé a fait tourner seize tâches de travail réelles sur quatre jours face à un modèle bien plus cher. Le résultat devrait tempérer toute hypothèse selon laquelle bon marché rime avec faible :
"I benched DS4 flash and Pro vs opus 4.8 xhigh on 16 work-related tasks a month ago across 4 days. Opus 4.8 came out as a winner by 1 task only [...] But flash performed as well or better (as in being more thorough) in 13 out if 16."
Une différence fonctionnelle nette à noter avant de continuer. K3 accepte l'entrée image et vidéo, tandis que Flash est uniquement textuel, sans entrée image documentée. Si votre charge de travail implique des captures d'écran, cela tranche à lui seul la question, car l'entrée multimodale ne s'ajoute pas après coup. Autre point à savoir, K3 n'accepte pas non plus d'URL d'image publique. Base64 ou identifiant de fichier téléversé, rien d'autre.
La précision, l'écart qui compte
Tout ce qui précède est discutable selon votre charge de travail. Ce point-ci l'est moins.
AA-Omniscience mesure si un modèle sait ce qu'il ne sait pas. Il récompense une bonne réponse, pénalise les mauvaises réponses données avec assurance, et ne pénalise pas un « je ne sais pas ». Sur cet index, Flash obtient −16 et K3 obtient 18. Traduit en taux d'hallucination, Flash invente une réponse 84% des fois où il est dépassé. K3 le fait 51% du temps.
Aucun des deux chiffres n'est bon. L'un est nettement pire. Et l'hallucination à ce niveau n'est pas une bizarrerie qu'on corrige avec un prompt, c'est une propriété du modèle de fondation autour de laquelle il faut concevoir, ou dont on subit les conséquences.
Les utilisateurs de Flash rapportent plus ou moins exactement ce qu'un tel chiffre laisse prévoir :
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
La version la plus juste vient de l'un des utilisateurs les plus intensifs du modèle, qui ne le défend pas tant qu'il ne décrit l'échafaudage qu'il a construit pour survivre avec :
"It hallucinates plenty, about the same as Codex models and all other LLMs! I review all code it writes, thoroughly, check the test coverage, write tests myself, have other models/chats cross-check the work with a review skill"
C'est la lecture honnête. Flash fonctionne bien quand un humain compétent relit chaque sortie, et un flux de travail de code dispose déjà d'un compilateur, d'une suite de tests et d'une revue de code, tout cela se plaçant entre le modèle et ce qui compte. Le modèle bon marché fonctionne parce que le filet de sécurité le rattrape. Retirez ce filet et vous vous reposez sur le jugement du modèle de base lui-même, exactement ce qu'un chiffre de 84% vous déconseille de faire. C'est aussi l'argument en faveur du RAG plutôt qu'un LLM brut dans tout contexte où la réponse doit être juste et non simplement plausible.
C'est là que je voudrais signaler ce à quoi je me heurte sans cesse dans ce métier. Je construis des agents IA chez eesel, et cela fait maintenant des années que nous les déployons sur des files de support réelles. Le mode d'échec n'est jamais que le modèle soit stupide. C'est que le modèle est sûr de lui. Un acheteur nous l'a exprimé mieux que je ne pourrais le faire, lors d'un appel sur l'acheminement des tickets vers l'IA :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
C'était un responsable CX d'une marque de compléments alimentaires en vente directe, gérant environ 7 000 tickets par mois sur Gorgias et Shopify. Nous n'avons pas remporté ce contrat, et l'objection ci-dessus en est la raison. Remarquez qu'il n'a jamais demandé quel score obtenait le modèle. Il a demandé s'il saurait s'effacer quand il ne savait pas. Un taux d'hallucination issu d'un classement ne répond pas à cette question, et aucune page de fournisseur ne le fera non plus.
En toute honnêteté, nous avons aussi observé nos propres agents faire l'erreur de l'assurance mal placée. Le pire schéma que nous ayons enregistré en production était un agent qui racontait « exécution de recherches Zendesk » pendant une dizaine de tours sans jamais réellement appeler l'API. Rien ne tue plus vite la confiance envers un coéquipier que de mentir sur ce qu'il a fait, c'est pourquoi nous simulons désormais chaque déploiement sur l'historique de tickets réel d'un client avant qu'il ne touche une file en production.
« Poids ouverts » recouvre ici deux réalités très différentes
Les deux modèles publient leurs poids. Mais le terme recouvre un travail très différent dans chaque cas.
Flash compte 284B de paramètres au total avec 13B actifs, environ 167 Go de poids, sous une simple licence MIT, et il existe 57 quantifications communautaires pour ce modèle. Cela le place dans un territoire différent de la plupart des agents open source de ce niveau de qualité, et il est assez petit pour que le fine-tuning devienne une option réelle plutôt qu'une expérience de pensée.
Les poids de K3 ont été mis en ligne sur Hugging Face le 27 juillet, exactement à la date promise par Moonshot, et l'index safetensors confirme 2 779 931 837 184 paramètres, indépendamment du communiqué de presse. Cela représente aussi 1 561 Go répartis sur 96 shards, avec 104B de paramètres actifs.

La personne qui a calculé cette empreinte a ajouté la partie qui compte :
"Most importantly, we now know that the model has 104B active parameters, which is quite a lot and will make it difficult to self-host efficiently."
La ligne pratique entre ces deux modèles a été tracée assez clairement dans le fil de lancement de V4 Flash :
"And, at least flash can be ran "at home" with <10k in hardware, which isn't really possible / feasible with glm/k3 larger models."
Et le calcul de l'auto-hébergement de K3 pour économiser de l'argent ne survit pas au contact du tableur :
"At 5 tok/second, you're talking about around $195 worth of output tokens per month. There is no way I can run a usable K3 model for $195 a month of capex, opex, or any-kind-of-ex."
Les licences diffèrent aussi, et celle-ci a du mordant. Flash est en MIT, point final. K3 est distribué sous une licence Kimi K3 personnalisée assortie de deux clauses additionnelles. Les opérateurs de services managés dépassant $20M de revenus sur douze mois ont besoin d'un accord séparé, et les produits dépassant 100M d'utilisateurs mensuels ou $20M de revenus mensuels doivent afficher « Kimi K3 » dans l'interface. La plupart des lecteurs ne rencontreront jamais l'un ou l'autre. Mais si vous construisez un produit par-dessus, lisez-la avant de présumer d'une liberté à la MIT, et intégrez-la à toute décision de développer ou acheter que vous prenez.
Ce que chaque fournisseur fait de ce que vous envoyez
Si le texte que vous envoyez est le vôtre, sautez cette partie. Si c'est le texte de vos clients, cette section décide de tout, et les deux fournisseurs se situent à des endroits assez différents.
Moonshot publie une position, et elle est permissive par défaut. Ses conditions d'utilisation, mises à jour pour la dernière fois le 27 mai 2026, indiquent qu'un client souhaitant limiter l'usage pour l'entraînement « peut contacter Moonshot AI pour discuter des accords d'entreprise disponibles ou d'accords écrits séparés », puis ceci : « Sauf accord écrit exprès contraire, le Contenu Client peut être utilisé aux fins susmentionnées. » Suffisamment clair, et l'échappatoire est un contrat qu'il faut aller négocier soi-même. Les données résident à Singapour.
DeepSeek est le cas le plus intéressant, puisqu'il publie un accord séparé pour l'API payante et que cet accord ne dit strictement rien. Les conditions Open Platform, en vigueur depuis le 29 avril 2026, comportent une section « Inputs and Outputs » qui va jusqu'au §4.2 puis s'arrête. Les conditions d'utilisation grand public comportent une clause d'entraînement au §4.3 de la même section numérotée, et le document de l'API l'omet tout simplement. Cette clause grand public précise explicitement que DeepSeek « peut, dans une mesure minimale, utiliser les Inputs et Outputs pour fournir, maintenir, exploiter, développer ou améliorer les Services », avec un interrupteur de désactivation intitulé « Améliorer le modèle pour tous ».
L'affirmation exacte concernant l'API DeepSeek est donc qu'elle garde le silence, pas qu'elle est sûre. Les conditions de l'API se décrivent elles-mêmes comme un accord spécifique relevant des conditions d'utilisation générales, et une clause spécifique ne prévaut qu'en cas de conflit. Le silence n'est pas un conflit. Aucun des deux documents ne publie d'option de retrait pour les développeurs, d'accord de traitement des données, ou d'option de rétention zéro, et les données stockées résident en République populaire de Chine sous le droit chinois.
En pratique, cela signifie qu'aucun des deux n'est une solution de première partie prête à l'emploi pour des données réglementées ou identifiant des clients sans passer d'abord par une conversation avec un commercial, ce qui pour deux API en libre-service constitue une vraie friction. C'est le même type de problème que les équipes ont rencontré avec le changement de politique IA de Slack, et si vous êtes soumis à SOC 2 ou au RGPD, c'est la première chose que votre auditeur demandera. Passer par un fournisseur qui publie des conditions de rétention zéro est le contournement habituel, et cela coûte plus cher que les grilles tarifaires ci-dessus.
Alors, lequel choisir ?
Je formulerais cette décision autour d'une seule question, et ce n'est pas le budget.
Choisissez DeepSeek V4 Flash quand un humain ou une machine vérifie la sortie avant qu'elle ne compte. Codage avec tests et revue, classification en lot, rédaction en masse, outils internes, tout ce que vous pouvez relancer à moindre coût quand le résultat est mauvais. À $0.03 par tâche avec un tarif de cache hit de $0.0028, c'est quasiment gratuit, à des volumes où K3 devient une ligne budgétaire que quelqu'un finit par questionner. C'est aussi le modèle le plus rapide, d'un facteur trois, ce qui compte plus qu'on ne l'imagine pour un travail interactif. C'est également le choix quand l'auto-hébergement est une véritable exigence, pas simplement une idée séduisante.
Choisissez Kimi K3 en effort maximal quand la sortie est le livrable et que personne ne la vérifie ligne par ligne. Exécutions d'agents sur de longs horizons, synthèse de recherche, situations où se tromper coûte cher et où vous ne le remarquerez de toute façon pas. Un taux d'hallucination de 51% n'est toujours pas un chiffre sur lequel je bâtirais des flux de travail non supervisés, mais c'est une catégorie de risque différente de 84%. C'est aussi le seul des deux à lire les images.
Évitez Kimi K3 en effort low. Il coûte huit fois plus que Flash et obtient un score inférieur. Cette option existe pour raccourcir votre attente, pas votre facture. Si K3-max dépasse le budget, la réponse est un autre modèle plutôt qu'un K3 plus silencieux, et le comparatif des alternatives à Kimi K3 est le point de départ.
Une dernière chose mérite d'être dite, car « laboratoire chinois » et « bon marché » se sont confondus dans le même mot dans une bonne partie de la couverture médiatique, et pour K3 ce n'est pas le cas. Son $0.86 par tâche est à portée de main de la pointe occidentale, et quelqu'un a fait ce calcul dans le fil de lancement :
"According to artificialanalysis, cost per task is $0.94, which is almost the same as $1.04 of gpt 5.6 sol max [...] The model certainly sounds extremely impressive for something not from openai/antrophic, but the price makes it a mediocre product."
Le chiffre de K3 s'est depuis stabilisé à $0.86, donc l'écart est un peu plus large que ce qu'il avait constaté, mais la forme de son argument tient toujours. Claude Sonnet 5 se situe exactement sur la même grille $3/$15, et GPT-5.6 Sol est dans le même voisinage par tâche. L'extrémité bon marché de ce marché, c'est Flash et ses semblables. Pas les mastodontes à 2,8T.
Pour le reste du terrain, mon comparatif Qwen 3.8 Max couvre le troisième laboratoire de cette course, tandis que l'article sur V4 Pro explique pourquoi le palier bon marché de DeepSeek surclasse actuellement son palier cher.
Mettre l'un ou l'autre devant un client
Tout ce qui précède est une décision de développeur. Mais si vous êtes arrivé ici en vous demandant si l'un des deux peut répondre à des tickets de support, la réponse honnête est que le modèle est la partie la moins importante de ce système.
Je le dis en tant que personne qui construit les agents IA chez eesel. Un modèle brut avec un taux d'hallucination de 84% et un modèle brut avec 51% échouent tous deux de la même manière sur une file de support : ils répondent à des choses auxquelles ils n'auraient pas dû répondre. Ce qui corrige cela, ce n'est pas un meilleur modèle de base. C'est le grounding de chaque réponse dans votre base de connaissances vérifiée, un filtrage via un score de confiance pour que la machine reste silencieuse sous le seuil, et le fait de savoir ce qui va se passer avant que cela ne se passe.
C'est la différence entre un agent de support IA et une simple boîte de chat branchée sur une clé API. C'est aussi une grande partie de la raison pour laquelle le construire soi-même prend plus de temps que quiconque ne le budgète.
Cette dernière partie mérite d'être reprise, que vous nous utilisiez ou non. eesel exécute des simulations sur vos vrais tickets passés avant que quoi que ce soit ne passe en production, ce qui fait que ce que vous voyez, c'est la précision réelle sur vos propres données, et non celle d'un classement, et vous ne déployez qu'une fois le seuil franchi. Acheminer d'abord une tranche fonctionne aussi. Traitez 1 000 tickets par mois, envoyez-en 200 à l'IA, vous ne payez que pour 200. La facturation est de 40 centimes par ticket résolu, il n'y a pas de frais de siège, et vous n'êtes jamais facturé pour les tickets que traitent vos humains. $50 d'utilisation gratuite pour démarrer, sans carte de crédit.

Il se connecte à Zendesk et à d'autres helpdesks, et lit vos réponses là où elles se trouvent déjà, que ce soit Confluence, un espace Notion, ou simplement votre centre d'aide public.
Choisissez le modèle qui vous plaît en dessous. Simplement, ne laissez pas un score de benchmark être la raison pour laquelle vous lui confiez un client.
Questions fréquentes
DeepSeek V4 Flash ou Kimi K3, lequel est le moins cher ?
Kimi K3 est-il meilleur que DeepSeek V4 Flash ?
Puis-je exécuter DeepSeek V4 Flash ou Kimi K3 en local ?
Dois-je utiliser DeepSeek V4 Flash pour le support client ?
Quel est le prix de l'API Kimi K3 pour une petite équipe ?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








