
Ce que vous achetez vraiment
Le produit entier tient dans une ligne d'une page de documentation. Deux modèles, un tableau de spécifications, trois prix. D'une honnêteté rafraîchissante, comparé à la plupart des pages de lancement.

La version derrière l'alias est DeepSeek-V4-Flash-0731, rendue publique le 31/07/2026 comme un ré-entraînement de la version d'avril. Sur le plan architectural, c'est un mixture of experts épars : 284 milliards de paramètres au total, dont 13 milliards actifs pour un token donné. Les poids sont sous licence MIT et pèsent environ 167 Go. Si vous connaissez la génération précédente de DeepSeek V3.2, c'est un animal différent sur le travail agentique.
| Spécification | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrée, succès de cache (par 1M) | 0,0028 $ | 0,003625 $ |
| Entrée, échec de cache (par 1M) | 0,14 $ | 0,435 $ |
| Sortie (par 1M) | 0,28 $ | 0,87 $ |
| Fenêtre de contexte | 1M | 1M |
| Sortie maximale | 384K | 384K |
| Mode de réflexion | Sans réflexion et avec réflexion, réflexion par défaut | Sans réflexion et avec réflexion, réflexion par défaut |
| Appels d'outils / sortie JSON | Oui / Oui | Oui / Oui |
| Responses API | Oui | Non, début août 2026 |
| Limite de concurrence | 2500 | 500 |
Chaque chiffre provient de la grille tarifaire de DeepSeek elle-même. Deux détails faciles à survoler méritent qu'on s'y arrête. Le mode de réflexion est activé par défaut sur les deux paliers, et les tokens de raisonnement sont facturés au tarif de sortie. Et Flash, pas Pro, est le seul modèle à supporter la Responses API, ce qui est inhabituel : le palier économique reçoit l'interface la plus récente.
Le problème de l'évaluation : vous notez un réglage
Voici la découverte qui a recadré tout ce texte pour moi. Artificial Analysis ne liste pas un seul DeepSeek V4 Flash. Il en liste deux, parce que les mêmes poids se comportent comme deux produits différents selon reasoning_effort.

Exécutez-le sans réflexion et vous obtenez un Intelligence Index de 29, à une médiane de 107 tokens de sortie par seconde, 1,18 s jusqu'au premier fragment et 5,86 s de bout en bout. Maintenant, exécutez-le à effort maximal. L'indice grimpe à 50, et Artificial Analysis ne publie aucun chiffre de vitesse pour cette variante. Tokens de sortie par seconde : vide. Temps jusqu'au premier token : vide. Temps de réponse total : vide, le panneau récapitulatif admettant « Inconnu sur 4 unités pour la vitesse ».
Ainsi, le modèle qui domine les classements de valeur est un modèle pour lequel personne n'a publié de chiffre de latence. Pas un scandale, juste un trou de mesure. Cela signifie tout de même qu'un plan construit sur « bon marché et rapide » repose sur deux chiffres qui n'ont jamais été mesurés dans la même exécution.
Deux détails plus mineurs aggravent le tout. Le propre tableau de correspondance des efforts de DeepSeek traite une requête xhigh sur Flash comme un high, donc un bouton que vous croyiez avoir tourné ne fait rien. Et sur Pro, une requête low est traitée comme high, ce qui signifie qu'il n'existe aucune exécution Pro bon marché, ce qui explique en grande partie pourquoi la comparaison entre Flash et Pro tourne comme elle tourne.
Si vous branchez cela vous-même, les pièges se trouvent tous sur le côté discret de l'API, et je les ai détaillés séparément dans comment utiliser l'API. En résumé, presque toute mauvaise configuration renvoie un HTTP 200 et vous ignore purement et simplement.
Les deux classements ne sont pas d'accord, et les deux ont raison
C'est là que la plupart des articles choisissent le chiffre le plus flatteur et passent à la suite. La position honnête est que l'indice automatisé et le tableau de votes humains racontent des histoires différentes sur le même modèle.

Sur Artificial Analysis, l'exécution de Flash à effort maximal obtient 50 et se classe 21ᵉ sur 260 lignes de modèles, 3ᵉ sur 101 dans sa propre catégorie de taille, et 1ʳᵉ sur 101 pour le prix en cas de succès de cache. Le coût par tâche est de 0,03 $, et l'exécution de l'indice entier a coûté 72,02 $.
Sur le classement texte de LMArena, le même modèle est 79ᵉ, avec un Elo de 1436 plus ou moins 4, sur 48 667 votes. La ligne -high-preview diffère à peine avec 1438. Et V4 Pro, le modèle que Flash surpasse sur l'indice automatisé, se situe ici au-dessus de lui avec 1458. La préférence humaine et l'agrégat de benchmarks divergent vraiment sur ce modèle.
Un point positif dans les données humaines, avec une réserve : sur le classement WebDev, deepseek-v4-flash-high est 8ᵉ à 1577. Cette ligne porte l'étiquette Preliminary de LMArena sur 1 319 votes avec un intervalle de plus ou moins 18, c'est donc un signal prometteur plutôt qu'un résultat établi.
Ma lecture de la situation : l'indice automatisé mesure une exécution configurée au maximum sur des tâches qui récompensent l'usage d'outils, tandis que l'arène mesure comment une réponse est perçue par une personne assise devant une fenêtre de chat. Flash est conçu pour la première chose. Achetez-le donc pour la première chose.
Ce en quoi il excelle vraiment
Les preuves ici sont la partie la plus convaincante de toute la réaction, parce que ce sont des factures et non des opinions. C'est là que le cadre de l'agentique se justifie pleinement.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
Cost: $4.55USDAPI requests: 3,467Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek. It has not disappointed at all for coding or review tasks. For everything else, use another model."
Remarquez la dernière ligne, car c'est la phrase la plus utile du fil de discussion. Les utilisateurs les plus intensifs ne prétendent pas avoir un modèle de pointe généraliste, ils revendiquent un cheval de labour très bon et très bon marché pour un ensemble de tâches précis. Quelqu'un est immédiatement arrivé avec une facture plus élevée et la même conclusion, avec 2,1 milliards de tokens en 12 jours pour 19,27 $.
Les utilisateurs de harnais d'agents rapportent la même tendance :
"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost. [...] I haven't used our slow opus subscription for weeks."
L'explication la plus intéressante de la raison pour laquelle le palier bon marché l'emporte sur ce type de travail est venue d'une équipe qui a dû se pencher sur la question :
"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."
Cela s'applique aussi parfaitement au cas d'usage résumé-et-relecture. Un utilisateur a rapporté quatre dollars sur deux mois de travail de relecture et de résumé, « sans chute de performance dramatique par rapport aux autres modèles américains ». Pour les travaux par lots qu'il était auparavant trop coûteux d'automatiser, le prix change vraiment ce qui vaut la peine d'être construit, ce qui est l'argument que je fais à propos des coûts du support IA dans un autre domaine.
Devriez-vous l'utiliser pour cette tâche ?
Là où il flanche
Un avis qui ne liste que des forces est un communiqué de presse. Les plaintes ci-dessous sont précises et se répètent dans les fils de discussion, et quelques-unes sont la raison même pour laquelle je ne placerais pas ce modèle devant un client.
Il hallucine, et le chiffre publié est peu reluisant. Artificial Analysis place le taux d'hallucination AA-Omniscience à 84 %, et sa propre note indique que l'amélioration générationnelle vient de « moins d'hallucinations, plutôt que d'une précision plus élevée ». C'est une amélioration de 12 points sur un chiffre qui était déjà plus mauvais au départ. Les utilisateurs décrivent la même chose sans la métrique :
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
Pour être juste, l'utilisateur le plus intensif du fil de discussion l'a jaugé face à ses pairs plutôt que de le traiter comme disqualifiant, disant qu'il hallucine « à peu près autant que les modèles Codex et tous les autres LLM » et qu'il relit tout ce qu'il écrit et fait vérifier le travail par d'autres modèles. C'est la bonne posture, et c'est aussi un coût réel qui n'apparaît jamais sur la grille tarifaire.
Le travail à long horizon dans une grande base de code est le point faible, ce qui est gênant vu le discours agentique du fournisseur.
"If you believe the benchmarks Deepseek v4 is pretty shitty at long running work in large codebases, but really really good at self contained algorithmic/math reasoning - which is basically ideal for a compiler for a language with a relatively complex type system. And with its cache pricing it's very cheap."
C'est un modèle bavard, et les mots sont facturés. Artificial Analysis le signale explicitement sur la verbosité.

Il a brûlé 210M de tokens de sortie pour compléter l'indice contre une médiane de catégorie de 100M, décrit sur la page du modèle comme « très verbeux en comparaison ». L'exécution entière n'a tout de même coûté que 72,02 $, ce qui est l'important, mais 2,1 fois le volume de sortie médian est le mécanisme qui sépare discrètement le prix affiché de votre facture. Je détaille cet écart correctement dans la décomposition des prix.
Des capacités qui sont simplement absentes. Aucune entrée image n'est documentée : pas de ligne vision sur la grille tarifaire, pas d'encodeur vision dans la configuration, et le travail multimodal de DeepSeek vit dans des lignes de modèles séparées. Les équipes contournent cela, comme l'a décrit un utilisateur, en gardant un second modèle sous la main pour la vision.
Il vaut cependant la peine de corriger une affirmation qui s'est propagée avec celle-ci. Le même rapport dit que DeepSeek « ne supporte pas la recherche web », et cela n'est vrai que sur l'ancien chemin chat-completions. La Responses API, réservée à Flash, embarque bien un outil intégré côté serveur web_search, aux côtés de apply_patch. La recherche de fichiers, l'interpréteur de code, l'usage d'ordinateur et les types d'outils MCP y sont tous ignorés, donc l'ensemble des capacités reste étroit, mais la recherche web est bien sur la liste.
Un véritable dérapage de facturation est documenté, et il vaut la peine de le connaître avant de pointer un agent là-dessus :
"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."
DeepSeek ne publie non plus aucune limite de requêtes par minute ou de tokens par minute, seulement un plafond de concurrence qui est au niveau du compte plutôt qu'au niveau de la clé. Combiné à un solde prépayé qui peut renvoyer un 402 en plein milieu d'une exécution, c'est plus un problème de surveillance qu'un problème de prix, et un bon argument pour une configuration de suivi sérieuse.
Un désagrément de versioning qui touchera quiconque cite des benchmarks. Un utilisateur l'a bien formulé : sur DeepSeek, c'est désormais simplement deepseek-v4-flash, alors qu'OpenRouter l'appelle deepseek/deepseek-v4-flash-0731, donc lorsqu'un benchmark dit « DeepSeek V4 Flash », vous ne pouvez pas toujours savoir quelle version a été exécutée. Fixez le nom daté quand vous notez quelque chose.
Faire tourner les poids vous-même
La licence MIT accomplit un vrai travail ici, et les retours locaux sont la partie la mieux documentée de la réaction. C'est vraiment un modèle de fondation que vous pouvez héberger, pas un LLM uniquement hébergé.
| Matériel | Vitesse rapportée |
|---|---|
| Dual DGX Spark | 60 tokens/s en session unique, plus de 100 agrégés à une concurrence de 4 |
| Mac Studio M3 Ultra 256GB | ~30 tokens/s en décodage pour une requête unique |
| Ryzen AI MAX+ 395 (Strix Halo) | 32 tokens/s à ~2,88 bits par paramètre |
| RTX PRO 6000 96GB seul | 170 tokens/s rapportés avec un moteur de plan à 2 bits |
Un utilisateur en local a bien résumé pourquoi les gens s'en donnent la peine, et ce n'est pas l'arithmétique :
"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. Privacy is a large part of it but, I also no longer think twice about whether to send a prompt or not based on the psychology of it costing money."
Sur le plan strictement financier, les fils de discussion sont presque unanimes dans l'autre sens. Une estimation a chiffré une machine dual-Spark entre huit et neuf mille dollars et a conclu que cela « a peu ou pas de sens tant que les prix de l'API restent ce qu'ils sont. Sauf peut-être pour des raisons de confidentialité. » Un autre utilisateur a fait le calcul d'électricité et a trouvé qu'atteindre le tarif de cache de DeepSeek était moins cher que de faire tourner un modèle de 36 milliards de paramètres à la maison. Donc : hébergez-le pour le contrôle et la confidentialité, pas pour économiser de l'argent.
Mon verdict, par tâche
| Tâche | Verdict | Le facteur décisif |
|---|---|---|
| Résumé et relecture en masse | À utiliser | L'entrée à succès de cache à 0,0028 $ rend triviaux des travaux par lots jusque-là injustifiables |
| Codage agentique cadré | À utiliser, avec relecture | Domine les lignes agentiques, et l'avantage d'usage d'outils sur Pro est réel |
| Travail à long horizon, grand dépôt | Prudence | La plainte la plus constante dans tous les fils de discussion |
| Tout ce qui est visuel | À éviter | Aucune entrée image documentée, aiguillez donc vers un second modèle |
| Raisonnement ponctuel et mémorisation | Envisager Pro | Pro l'emporte encore sur la mémorisation et la recherche d'aiguille en contexte long |
| Réponses face aux clients | Pas sans supervision | Taux d'hallucination de 84 %, plus des conditions d'API muettes sur l'usage pour l'entraînement |
Face à la concurrence, trois modèles valent la peine d'être mis en regard. Pour une intelligence à peu près équivalente, GPT-5.6 Luna coûte deux à trois fois plus cher et c'est celui avec lequel on associe Flash pour la vision, détaillé dans Flash contre GPT-5.6. Si la précision compte plus que le prix, Kimi K3 hallucine beaucoup moins et coûte beaucoup plus.
Pour l'option multimodale dans la même catégorie de poids ouverts, Qwen 3.8 Max est le suivant à lire. Il existe des retours d'expérience sur chacun dans l'avis sur Qwen et l'avis sur Kimi.
Deux points de référence supplémentaires si vous tracez un axe de prix. Les prix de Claude Opus 5 marquent l'extrémité frontière. Les alternatives à Mistral couvrent la famille européenne en poids ouverts, et l'avis sur GPT-5.6 donne le verdict sur le modèle dont la plupart des équipes changent réellement.
Devrait-il un jour répondre à un client ?
C'est la section qui me préoccupe réellement, parce que c'est mon travail. Et la réponse honnête est que le modèle n'est pas le bon endroit où chercher.
Commençons par où vont les tokens. Les conditions Open Platform payantes de DeepSeek restent muettes sur l'usage pour l'entraînement, ce qui n'est pas la même chose qu'être permissif, ni la même chose qu'être sûr. Les conditions consommateur comportent une clause explicite à la section 4.3 avec une option de retrait « Améliorer le modèle pour tout le monde » ; la section équivalente du document API s'arrête avant cela. Il n'existe non plus d'accord de traitement des données publié ni d'option de rétention zéro dans les deux sens, et la politique de confidentialité indique que les données sont traitées et stockées en République populaire de Chine sous le droit chinois. Des hébergeurs à rétention zéro existent, et un utilisateur a rapporté des prix trois à cinq fois supérieurs au tarif direct, ce qui efface la plus grande partie de la réduction.
Si tout cela est nouveau pour vous, l'épisode de la politique de Slack est le précédent que les lecteurs ont déjà vécu. SOC 2 et RGPD est la checklist à suivre avant de connecter quoi que ce soit face aux clients.
Vient ensuite le chiffre de 84 %. Chaque équipe de support à laquelle je parle entend un chiffre pareil et pose la mauvaise question, à savoir « à quel point votre modèle est-il précis ». Voici un de nos clients qui a posé la bonne question bien mieux que je ne saurais le faire. Leur bot confirmait avec assurance que l'entreprise prenait en charge des modèles de voiture qui n'étaient pas dans leur base de données, parce qu'une ligne de la base de connaissances disait qu'ils prenaient en charge tous les modèles. Le modèle allait bien. L'ancrage, non.
Le résumé de l'équipe pour bien faire les choses était « des tâtonnements au début ».
Une équipe de support danoise B2B en télématique automobile sur Zendesk, traitant environ 200 tickets par mois et montant vers plus de 2 000, qui s'inquiétait que l'IA confirme avec trop de confiance des modèles de voiture non pris en charge.
C'est toute la leçon. L'hallucination dans le support est généralement un problème d'ancrage et de permissions déguisé en problème de modèle, et toute vraie solution se situe au-dessus du modèle plutôt qu'à l'intérieur.
La pile qui rend un modèle instable viable n'est pas exotique. La récupération sur des sources que vous avez réellement vérifiées. Des garde-fous sur ce qu'il est autorisé à affirmer. Un score de confiance avec un seuil que quelqu'un a choisi délibérément, et un humain sur tout ce qui se situe sous ce seuil.
Notre pire échec observé en production a été un agent IA racontant « exécution de recherches Zendesk » pendant environ dix tours sans jamais toucher l'API, puis signalant des fichiers enregistrés qui n'existaient pas. Rien ne tue plus vite la confiance envers un collègue que de mentir sur ce qu'il a fait, et aucun score de benchmark ne l'aurait détecté. Ce qui le détecte, c'est la mesure du taux de résolution après coup et la revue humaine avant.
Donc, si vous évaluez des modèles bruts pour une file de support, l'ordre pratique ressemble à peu près à ceci. Testez de façon adversariale avant de faire confiance à quoi que ce soit. Construisez une habitude d'évaluation plutôt qu'une date de lancement. Fixez des seuils de confiance délibérément.
Lisez ensuite la prévention des hallucinations avant de connecter un seul ticket, et posez-vous honnêtement la question construire ou acheter, parce qu'assembler toute cette pile vous-même est le vrai projet. Le modèle est la partie bon marché.
Essayer eesel
Si vous êtes arrivé ici depuis un tableau comparant les tarifs par token pour un cas d'usage support, ce que je vous dirais autour d'un café, c'est que le prix du token n'a jamais été la partie difficile. Câbler un modèle à votre helpdesk, l'ancrer dans vos vraies macros et vos tickets passés, et savoir ce qu'il va dire avant qu'un client ne le voie, c'est la partie difficile, et c'est ça le produit.
C'est ce qu'est eesel : un agent de support IA qui se connecte à Zendesk ou à votre helpdesk existant, ancre chaque réponse dans votre savoir vérifié, et vous laisse lancer des simulations sur vos tickets historiques pour voir exactement où il se serait trompé avant de passer en direct. Vous observez le volume de tâches, les déclencheurs, et chaque approbation ou rejet par outil, si bien que « est-ce qu'il hallucine » devient un chiffre que vous pouvez consulter plutôt qu'une inquiétude.

La tarification est basée sur la conversation résolue plutôt que sur le poste, ce qui signifie qu'un déploiement progressif est une vraie option : aiguillez 200 de vos 1 000 tickets mensuels et payez pour 200. Il y a 50 $ d'utilisation gratuite pour démarrer, aucune carte requise, et la page des prix affiche les chiffres. Lancez une simulation sur les tickets du mois dernier et vous saurez en une heure si tout cela vaut votre temps. C'est un bien meilleur usage d'un après-midi que de faire du benchmarking sur un réglage.
Questions fréquentes
DeepSeek V4 Flash est-il performant ?
Combien coûte DeepSeek V4 Flash ?
Pourquoi DeepSeek V4 Flash obtient-il un meilleur score que V4 Pro ?
DeepSeek V4 Flash peut-il lire des images ?
DeepSeek V4 Flash est-il sûr pour les données clients ?
DeepSeek V4 Flash devrait-il répondre aux tickets de support ?
Puis-je exécuter DeepSeek V4 Flash sur mon propre matériel ?
Quelles sont les meilleures alternatives à DeepSeek V4 Flash ?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.







