
The price card, side by side
Les deux modèles figurent sur une seule page, ce qui rend la comparaison remarquablement propre. Même fournisseur, même grille, même jour.

| Poste de facturation (par 1M de tokens) | deepseek-v4-flash | deepseek-v4-pro | Pro / Flash |
|---|---|---|---|
| Entrée, cache hit | $0.0028 | $0.003625 | 1,29x |
| Entrée, cache miss | $0.14 | $0.435 | 3,11x |
| Sortie | $0.28 | $0.87 | 3,11x |
Deux choses valent la peine d'être notées avant d'arriver aux benchmarks. D'abord, le ratio n'est pas uniforme : Pro coûte 3,11 fois plus que Flash sur les tarifs que l'on paie la plupart du temps, mais seulement 1,29 fois plus sur les cache hits. Ensuite il y a le tarif de cache lui-même. Le prix de cache hit de Flash est une remise de 50 fois par rapport à son propre prix de cache miss, et le cache est activé par défaut sans aucun changement de code nécessaire. Artificial Analysis a qualifié cela de remise de cache hit d'environ 98%, plus agressive que les 90% offerts par la majorité du secteur.
Le hic, c'est qu'une requête n'est facturée au tarif hit que si elle correspond entièrement à une unité de préfixe de cache persistée. Un chevauchement partiel ne compte pas, ce que DeepSeek attribue à son attention à fenêtre glissante. Le cache est aussi documenté comme du best-effort, et les entrées inutilisées s'effacent en quelques heures à quelques jours, donc il faut traiter le tarif bas comme une remise que l'on obtient parfois, et non comme un tarif sur lequel on peut planifier.
Une autre ligne de la grille change le calcul. DeepSeek annonce que l'API adoptera bientôt une tarification aux heures de pointe à 2x le tarif normal, de 9h00 à 12h00 et de 14h00 à 18h00 heure de Pékin, chaque jour. Aucune date d'entrée en vigueur n'est publiée nulle part. Les chiffres actuels sont les tarifs normaux, pas une fenêtre promotionnelle.
Same window, different brain
Les caractéristiques qui séparent habituellement un niveau bon marché d'un niveau cher sont identiques ici.
| Caractéristique | V4 Flash | V4 Pro |
|---|---|---|
| Paramètres totaux | 284B | 1.6T |
| Paramètres actifs | 13B | 49B |
| Longueur de contexte | 1M | 1M |
| Sortie maximale | 384K | 384K |
| Mode réflexion | Activé par défaut | Activé par défaut |
| Limite de concurrence | 2 500 | 500 |
| Responses API | Oui | Pas encore |
Les deux sont des modèles Mixture-of-Experts pré-entraînés sur plus de 32T de tokens. Ils partagent le même design d'attention hybride (Compressed Sparse Attention plus Heavily Compressed Attention), ainsi que les mêmes Manifold-Constrained Hyper-Connections et l'optimiseur Muon. La fenêtre de 1M est réelle dans la configuration, pas seulement dans le marketing : max_position_embeddings indique 1048576, ce qui est atteint en étendant avec YaRN une fenêtre entraînée sur 64K, 16 fois.

Donc acheter Pro ne vous achète pas une fenêtre plus grande, cela vous achète 3,8 fois les paramètres actifs. La distinction compte ici, car les paramètres actifs achètent surtout du rappel, et le rappel est exactement l'endroit où ces deux-là divergent. Si l'idée qu'un modèle plus petit tienne la comparaison est nouvelle pour vous, notre explicatif sur les petits modèles de langage couvre le cas général.
L'entrée d'image n'est documentée sur aucun des deux modèles. L'étiquette de pipeline sur les deux dépôts Hugging Face indique génération de texte, la configuration déclare DeepseekV4ForCausalLM sans aucun encodeur de vision nulle part, et la ligne de fonctionnalités de la grille tarifaire liste la sortie JSON, les appels d'outils et le FIM sans aucune ligne de vision. Le travail multimodal de DeepSeek se trouve dans une ligne de modèles séparée. Un développeur construisant un agent a branché un second modèle spécifiquement pour couvrir la vision et la recherche web.
Work out what each tier actually costs you
Ce ratio de prix de 3,11x ne tient que si les deux modèles émettent le même nombre de tokens, ce qui n'est pas le cas. Artificial Analysis signale que Flash est verbeux : il a généré 210M de tokens de sortie pour compléter l'Intelligence Index, contre une médiane de classe de 100M. Les tokens de raisonnement sont facturés au tarif de sortie, donc la verbosité devient un vrai poste de coût.
Ce qui soulève la question utile. À quel point Flash devrait-il devenir plus bavard avant que Pro ne devienne le choix le moins cher ? Entrez vos propres chiffres.
Le chiffre à retenir est celui-ci. Sur les seuls tokens de sortie, Flash doit être plus de 3,11 fois plus verbeux que Pro avant que Pro ne devienne moins cher. L'écart mesuré par AA par rapport à la médiane de classe est d'environ 2,1 fois. Les tokens d'entrée rendent la chose encore plus difficile, car la plupart des charges de travail sont lourdes en entrée et le tarif d'entrée de Flash représente le tiers de celui de Pro. En pratique, Flash gagne sur le coût par une marge que la verbosité ne comble pas.
Cela dit, il vaut la peine de calibrer ce que tout cela signifie en termes commerciaux. Même le tarif de Pro est une erreur d'arrondi à côté d'un salaire, et la comparaison intéressante pour une équipe de support est l'IA face à un agent humain, pas Flash face à Pro.
The benchmark inversion
Voici la partie qui a surpris les gens. Le 2026-07-31, DeepSeek a lancé DeepSeek-V4-Flash-0731, dont il dit qu'il a conservé la même architecture et la même taille et n'a été que ré-entraîné après coup. Donc, mêmes 284B/13B, nouveau post-entraînement. Le tableau agentique publié :
| Benchmark | Flash 0731 | Flash Preview | Pro Preview | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | – | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Flash 0731 bat la build Pro sur les neuf lignes, et reste derrière Claude Opus 4.8 sur les neuf. La même question du niveau petit qui bat le grand est vivante chez d'autres laboratoires aussi, cela vaut la peine de le signaler, et elle se résout généralement dans l'autre sens : notre comparaison Opus 5 face à Sonnet 5 a trouvé le niveau cher gagnant sur le coût par tâche, pas seulement sur la qualité.
Deux réserves que DeepSeek imprime lui-même, et je les répète ici. Les lignes marquées † sont des jeux de test internes. Et les exécutions d'agent de code utilisaient le propre harnais de DeepSeek, qui n'est pas publié, donc personne ne peut encore les reproduire de façon indépendante. Un analyste sur X a résumé la lecture équitable sans détour :
"DeepSeek is launching a very cheap, very capable coding-agent Flash model that looks surprisingly close to Claude Opus 4.8, especially considering it's the lightweight model. That said, this is DeepSeek's own benchmark selection, so it's naturally designed to highlight its strengths."
Le classement indépendant va dans le même sens. Artificial Analysis a noté Flash 0731 à 50 sur son Intelligence Index, soit six points devant DeepSeek V4 Pro à 44. Coût par tâche : $0.03 pour Flash, $0.05 pour Pro.
Un bond de DeepSWE de 7,3 à 54,4 sur une forme de poids inchangée suscite bel et bien la suspicion, et au moins un compte IA japonais réputé l'a dit directement. Le score précédent était si faible que le rebond leur semble être un ciblage de benchmark. Un point juste à garder en tête, et c'est aussi pourquoi le chiffre de l'index indépendant compte ici plus que le tableau du fournisseur.
Where Pro still wins
Le tableau cross-mode de l'ère préversion de DeepSeek est le seul endroit où les deux modèles sont mesurés avec un effort de raisonnement identique, et c'est là que réside l'argument en faveur de Pro.
| Benchmark (effort max) | Flash | Pro | Écart |
|---|---|---|---|
| SimpleQA-Verified | 34.1 | 57.9 | +23.8 |
| Chinese-SimpleQA | 78.9 | 84.4 | +5.5 |
| BrowseComp | 73.2 | 83.4 | +10.2 |
| MRCR 1M | 78.7 | 83.5 | +4.8 |
| GDPval-AA (Elo) | 1395 | 1554 | +159 |
| MMLU-Pro | 86.2 | 87.5 | +1.3 |
| LiveCodeBench | 91.6 | 93.5 | +1.9 |
L'écart de rappel est celui qui devrait trancher quoi que ce soit. Un écart de 23,8 points sur SimpleQA-Verified n'est pas une différence d'arrondi, c'est exactement ce que coûtent 13B de paramètres actifs. DeepSeek le dit lui-même, décrivant Flash comme légèrement en retrait sur les tâches de pur savoir et les flux de travail agentiques les plus complexes, avant de limiter son affirmation de parité aux tâches d'agent simples.
La récupération à contexte long penche dans le même sens. Les deux modèles annoncent 1M, mais MRCR 1M donne 83,5 sur Pro contre 78,7 sur Flash, donc la fenêtre a la même taille alors que trouver l'aiguille ne l'est pas. Si votre charge de travail consiste à "fourrer un corpus énorme et poser des questions précises dessus", c'est le terrain de Pro. C'est aussi la charge de travail où le RAG plutôt que le contexte brut gagne généralement haut la main, et le finetuning est la troisième option vers laquelle les gens se tournent, ce que couvre notre article sur les modèles IA sur mesure.
Deux astérisques comptent sur ce tableau. Ces chiffres proviennent de Flash en build de préversion, d'avant la reconstruction 0731, et DeepSeek n'a republié aucun tableau de benchmark de connaissances pour 0731, donc je ne peux pas vous dire si l'écart SimpleQA lui a survécu. Ensuite, côté préférence humaine, LMArena classe toujours deepseek-v4-pro à 1458±4 au-dessus de deepseek-v4-flash à 1436±4, sur environ 49 000 votes chacun. L'index automatisé et les votes humains pointent ici dans des directions opposées, ce qui est une bonne raison de ne pas livrer un verdict en un seul chiffre.
The reasoning-effort trap
Si j'étais sur le point de déplacer des dépenses entre les deux, c'est la section que je lirais en premier. Ce n'est pas intuitif, et ce n'est pas non plus sur la grille tarifaire. DeepSeek publie une table de correspondance entre effort demandé et effort réel :
| Vous demandez | Flash sert | Pro sert |
|---|---|---|
low | low | high |
high | high | high |
xhigh | high | max |
max | max | max |
Relisez la colonne Pro une fois de plus. Il n'y a pas de réglage économique sur Pro, puisqu'une requête low est servie en high, donc vous payez 3,11 fois le tarif du token et vous ne pouvez pas réduire le budget de raisonnement pour compenser. Flash a la bizarrerie inverse, où xhigh rétrograde silencieusement vers high, donc toucher ce paramètre n'apporte rien au-delà de high. DeepSeek annonce que la correspondance de Pro sera mise à jour début août 2026.
Le mode réflexion est activé par défaut sur les deux, avec un effort high, et les tokens de raisonnement sont facturés au tarif de sortie. Il n'existe pas de chaîne de modèle -thinking séparée, c'est un paramètre sur le même alias. Le désactiver n'est pas non plus un petit compromis. Flash sans réflexion obtient 8,1 sur HLE et 1,0 sur Apex, contre 34,8 et 33,0 en max. Donc si vous voulez la configuration bon marché, vous choisissez un modèle sensiblement différent, ce qui est la leçon à laquelle notre guide d'optimisation des LLM revient sans cesse.
Deux pièges d'échantillonnage tant qu'on y est. En mode réflexion, temperature, top_p, presence_penalty et frequency_penalty ne sont pas pris en charge, et les définir ne génère aucune erreur, cela ne fait tout simplement rien. Aussi, si le modèle a effectué un appel d'outil, vous devez renvoyer reasoning_content à chaque tour suivant.
Operational differences that decide it
Le prix et les benchmarks font les gros titres. Voici ce qui tranche réellement le choix dans un déploiement réel.
- Concurrence. Flash autorise 2 500 requêtes simultanées et Pro en autorise 500. DeepSeek ne publie aucune limite de RPM ou de TPM, donc la concurrence est tout le modèle de limitation de débit, comptée par compte quelle que soit la clé, renvoyant un HTTP 429 au-delà du plafond. Pour tout ce qui a une forme de fan-out, ce facteur 5 est décisif.
- Responses API. Prise en charge uniquement sur Flash, et DeepSeek annonce que le support de Pro arrive début août 2026. La build 0731 est aussi adaptée spécifiquement pour Codex.
- Poids ouverts. Flash est livré sous licence MIT à environ 167GB en FP4/FP8 mixte, avec 8 finetunes et 57 quantifications déjà publiées, plus un module de décodage spéculatif DSpark intégré au même checkpoint. Pro n'a pas de checkpoint public propre. Si la licence est la raison de votre visite, les plateformes de chatbot open source donnent une vue plus large.
- Versionnage. L'alias Flash suit automatiquement la build la plus récente, ce qui signifie qu'un benchmark citant « DeepSeek V4 Flash » n'est peut-être pas le modèle que vous obtenez. La plainte d'un développeur au sujet du suffixe mérite d'être entendue ici : fixez
-0731chaque fois que vous citez quelque chose.

What developers actually report
L'explication la plus utile de pourquoi le petit modèle gagne sur le travail agentique est venue d'une équipe qui a testé les deux, puis est allée chercher la raison :
"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."
Plus intelligent en un coup, moins bon avec les outils. Cela correspond presque exactement à la répartition des benchmarks, et c'est le modèle mental le plus clair que j'aie trouvé pour choisir entre les deux.
Sur ce que les gens dépensent réellement, voici deux reçus spontanés du fil de lancement :
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
Quelqu'un qui a fait tourner les deux niveaux pendant deux semaines a rapporté payer environ $1.50 par jour pour Pro, et a situé l'écart à « ~50% plus cher que Flash ». C'est nettement plus resserré que le 3,11x de la grille, ce qui montre ce que de forts cache hits combinés à un nombre de tokens Pro plus faible peuvent faire à une facture réelle. Son autre remarque est celle que je soulignerais, cependant : les deux niveaux ont besoin d'être surveillés, avec de petites tâches, des sessions fraîches et des vérifications manuelles de bon sens.
Les points négatifs sont précis, et ils se répètent. Hallucination et perte de contexte reviennent souvent :
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
Artificial Analysis mesure la même chose depuis l'autre bout. Le taux d'hallucination AA-Omniscience de Flash 0731 est de 84%, une amélioration de 12 points par rapport à son prédécesseur, portée par moins d'hallucinations plutôt que par une précision accrue. Et l'objection qui domine chaque fil DeepSeek n'a rien à voir avec la qualité :
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching."
Ce dernier point réécrit tranquillement toute la comparaison pour quiconque manipule des données clients. Chez un fournisseur à rétention de données nulle, la sortie à $0.28 de Flash devient environ $0.84–1.40, ce qui vient se poser au-dessus du tarif propriétaire de Pro. L'écart de prix entre Flash et Pro n'existe que sur l'API propriétaire, et cette API propriétaire est justement celle qu'on ne peut pas brancher sur une boîte de réception support. C'est le point où la plupart des équipes arrêtent de comparer des prix de tokens et commencent à chercher une automatisation du service client qui règle pour elles la question de la rétention.
What this changes if you point it at a support queue
Je déploie les intégrations et la plomberie des modèles chez eesel, donc c'est la question qu'on me pose le plus. Quel modèle devrait se trouver derrière l'agent IA ? Après plus de trois ans à faire tourner de l'IA sur des files de support réelles, ma réponse honnête est que le choix du niveau se situe quelque part vers la cinquième place dans la liste des choses qui déterminent si ça marche.
Voici une preuve tirée de nos propres données plutôt que d'un benchmark. Dans un essai en validation croisée sur du trafic Zendesk réel, 284 chats plus une vérification manuelle de 100 tickets chez une équipe e-commerce européenne, l'IA a atteint 93% de précision de tri et 100% de détection de spam sans aucun faux positif sur les 22% de la boîte de réception qui étaient du spam. La qualité des brouillons s'est révélée dans la bonne direction 88% du temps. Mais seuls 12% des brouillons sont partis tels quels, avec un taux d'erreur factuelle de 7%. En creusant pourquoi les agents réécrivaient le reste : environ 65% relevait de la longueur et du ton, environ 20% nécessitait des données auxquelles l'IA n'était pas connectée, et seulement environ 5% était le modèle se trompant.
Cette répartition 65/20/5 résume tout l'argument. Quatre cinquièmes de l'écart de qualité étaient réparables en connectant plus de systèmes et en entraînant sur les propres réponses envoyées par l'équipe, et un modèle plus gros ne fait ni l'un ni l'autre à votre place. Les pires échecs que nous ayons vus n'étaient d'ailleurs pas du tout des échecs d'intelligence. Nous avons eu des clients payants dont le bot fabriquait des réponses quand la récupération dans la base de connaissances ne renvoyait rien, l'un d'eux inventant des détails d'abonnement pour un client réel. La solution là-bas a été un repli strict en cas d'échec de récupération, ce qui est une décision de pipeline et non un nombre de paramètres.
Donc si le choix entre ces deux modèles concerne l'automatisation des tickets de support : choisissez Flash, dépensez l'argent économisé pour connecter vos vraies sources de données, puis mettez derrière un vrai chemin d'escalade.
Quelques éléments font davantage bouger le taux de résolution que n'importe quelle montée en gamme, à peu près dans cet ordre. D'abord bien faire la classification des tickets, pour que l'IA ne réponde qu'à ce qu'elle devrait. Ensuite construire un vrai chemin de transfert vers un agent pour tout le reste. Et s'entraîner sur ses propres données, en particulier les réponses envoyées par votre équipe, ce qui, selon les données de notre essai, ferait passer l'adoption des brouillons tels quels de 12% vers 30–40% à elle seule.
Il y a ensuite la contrainte qui se trouve au-dessus de tout cela. L'API propriétaire de DeepSeek est l'endroit où se trouvent les tarifs bas, et c'est aussi l'endroit où vos tickets deviennent des données d'entraînement, donc pour les conversations clients, vous chiffrez en réalité plutôt un fournisseur à rétention de données nulle. Cela change la liste restreinte, et notre panorama des solutions de service client IA constitue un meilleur point de départ qu'une grille de tarifs au token. Quel que soit le chemin choisi, améliorer le taux de résolution reste un problème de données bien avant de devenir un problème de modèle.
Try eesel
Vous voulez l'économie du modèle bon marché sans parier votre boîte de réception sur le benchmark de quelqu'un d'autre ? eesel se branche sur le helpdesk que vous utilisez déjà et apprend de vos tickets passés et de votre centre d'aide. La partie qui compte pour cet article : cela vous permet de simuler l'agent contre vos propres tickets historiques avant qu'un seul client ne le voie. Vous obtenez en retour un vrai taux de résolution, plus une vraie liste de ce qu'il aurait raté, sur vos données et dans votre ton, quel que soit le modèle qui gagne ce mois-ci. Gratuit à l'essai, et facturé par ticket résolu plutôt que par siège.

Cette habitude de simulation existe à cause de cicatrices, pas de marketing. Nous avons vu des bots au ton assuré donner de mauvaises réponses, et faire tourner le déploiement contre les tickets historiques en premier est la seule chose qui l'attrape avant qu'un client ne le fasse. Si vous voulez le panorama plus large avant de décider, notre tour d'horizon des meilleurs agents IA et la liste des meilleurs logiciels de helpdesk IA sont deux bons points de départ.
Which one I would pick
Pour le travail agentique et de code en août 2026 : Flash, sans hésiter. Il est 3,11 fois moins cher sur les tarifs que vous payez réellement. Il bat Pro sur chaque ligne agentique publiée par DeepSeek, obtient six points de plus sur l'index indépendant, dispose de 5 fois la concurrence, et c'est le seul des deux à avoir des poids ouverts plus le support de Responses API. Il n'existe aucune version de cette comparaison où Pro gagne sur le travail agentique aujourd'hui.
Pour le rappel factuel, la récupération précise sur un très grand contexte, ou tout ce où se tromper avec assurance coûte cher : Pro, et vérifiez si vous devriez plutôt être sur Claude Opus 5 ou GPT-5.6. Cet écart SimpleQA est assez grand pour que « prenez simplement le moins cher » soit un mauvais conseil sur le travail de connaissance, et l'avantage propre de Pro sur les modèles de pointe occidentaux sur cet axe n'est pas évident.
Le calendrier est la vraie inconnue. DeepSeek annonce que la mise à jour de V4-Pro arrive, et le même ré-entraînement après coup qui a fait passer le score DeepSWE de Flash de 7,3 à 54,4 n'a pas encore été appliqué à Pro. Un commentateur a posé la question évidente à voix haute. Si c'est un engagement sur douze mois plutôt qu'un choix pour ce sprint, c'est l'événement à surveiller.
Cela vaut la peine de comparer ceci au reste du marché tant qu'on y est. Qwen 3.8 Max se situe à $2/$6 et Kimi K3 à $3/$15, donc tous les deux se trouvent bien au-dessus de DeepSeek sur chaque indicateur.
Si vous voulez les face-à-face directs plutôt que les grilles tarifaires, j'ai déjà comparé Qwen face à Flash directement, plus Qwen face à Kimi et Qwen face à GPT-5.6.
En venant de la génération précédente, notre article sur DeepSeek V3.2 apporte le contexte de la mise à niveau, et Qwen 3.7 Flash en est le rival bon marché le plus proche. Pour la couche de harnais qui se trouve au-dessus de n'importe quel modèle choisi, voir les meilleurs assistants de code IA.
Questions fréquentes
Quelle est la différence entre DeepSeek V4 Flash et V4 Pro ?
DeepSeek V4 Flash est-il meilleur que V4 Pro ?
Combien coûte DeepSeek V4 Pro par rapport à Flash ?
DeepSeek V4 Flash dispose-t-il de poids ouverts ?
Quel modèle DeepSeek est le mieux adapté à un agent de support client ?
Puis-je faire tourner DeepSeek V4 Pro avec un effort de raisonnement faible pour économiser ?
low sur Pro est servie en high, donc ce réglage économique n'existe tout simplement pas sur ce niveau. Sur Flash, low est vraiment bas et xhigh est servi en high. DeepSeek indique que la correspondance de Pro doit changer début août 2026.Le tarif de DeepSeek V4 Flash est-il sur le point de changer ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








