Tarifs DeepSeek V4 Flash : ce que vous paierez réellement

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 6, 2026

Vérifié par un expert
Tarifs DeepSeek V4 Flash : ce que vous paierez réellement

La grille tarifaire publiée, en intégralité

Sur la page Models and Pricing de DeepSeek, il y a exactement deux modèles, et deepseek-v4-flash en fait partie. Les anciennes lignes deepseek-chat et deepseek-reasoner ont disparu. Deux modèles V4, et c'est toute la gamme. J'ai revérifié la grille le matin où j'ai écrit cet article.

Par 1M de tokensdeepseek-v4-flashdeepseek-v4-pro
Entrée, cache hit$0.0028$0.003625
Entrée, cache miss$0.14$0.435
Sortie$0.28$0.87
Longueur de contexte1M1M
Sortie maximale384K384K
Mode de réflexionActivé par défautActivé par défaut
Responses APIOuiNon
Limite de concurrence2,500500
La page Models and Pricing de DeepSeek avec les colonnes deepseek-v4-flash et deepseek-v4-pro côte à côte, telle que publiée sur la documentation API de DeepSeek
La page Models and Pricing de DeepSeek avec les colonnes deepseek-v4-flash et deepseek-v4-pro côte à côte, telle que publiée sur la documentation API de DeepSeek

Deux choses valent la peine d'être signalées avant de commencer les calculs. La fenêtre de contexte et le plafond de sortie sont identiques sur les deux niveaux, donc l'écart de prix n'achète aucune marge supplémentaire. Et les deux sont livrés avec la réflexion déjà activée, ce qui compte énormément pour le coût, puisque les tokens de raisonnement sont facturés au tarif de sortie.

Calculez votre propre taux effectif

Les tarifs affichés sont par million. Ce qui vous est facturé est un mélange de trois d'entre eux, pondéré par votre taux de cache hit et par la part de votre trafic qui finit en sortie. Déplacez les curseurs et observez ce que fait le mélange.

Ce que les curseurs rendent évident, c'est ceci. Passé environ 40% de part de sortie, le cache cesse de compter vraiment. La sortie ne porte aucun tarif réduit, et sur un modèle qui raisonne par défaut, la sortie est exactement là où vont vos tokens.

Multiplicateur un : le cache décide de tout, et ce n'est pas un paramètre

Entre les deux tarifs d'entrée, l'écart est de $0.0028 contre $0.14, exactement 50x. Artificial Analysis remet cela dans le contexte du secteur, où la remise de cache de DeepSeek atteint environ 98% contre les 90% offerts par la plupart des fournisseurs. La remise de cache la plus agressive du marché, et la raison pour laquelle ces reçus ont cette allure.

Diagramme en barres opposant le tarif d'entrée en cache miss de $0.14 au tarif en cache hit de $0.0028, avec les trois conditions qui déclenchent un hit listées à côté
Diagramme en barres opposant le tarif d'entrée en cache miss de $0.14 au tarif en cache hit de $0.0028, avec les trois conditions qui déclenchent un hit listées à côté

Le cache disque est activé par défaut sur chaque compte, sans changement de code nécessaire, donc vous ne vous inscrivez à rien. Ce que vous faites, c'est vous qualifier, et les règles de qualification ici sont plus strictes que chez la plupart des fournisseurs :

  • Une requête n'est facturée au tarif de hit que si elle correspond entièrement à une unité de préfixe de cache persistée. Un chevauchement partiel ne rapporte rien. DeepSeek attribue cette exigence de correspondance complète à sa conception Sliding Window Attention, ce qui constitue un changement par rapport à la façon dont les versions précédentes faisaient correspondre.
  • Les unités sont persistées aux limites des requêtes, lors de la détection d'un préfixe commun entre requêtes, et à intervalles de tokens fixes à l'intérieur des entrées et sorties longues.
  • Le cache est en "best effort" sans taux de hit garanti, et les entrées inutilisées sont purgées "généralement en quelques heures à quelques jours".
  • Vous pouvez l'auditer par appel. Le bloc usage renvoie prompt_cache_hit_tokens et prompt_cache_miss_tokens, donc vous n'avez jamais à deviner quel tarif vous avez payé.

Ce dernier point est le seul conseil pratique de tout cet article. Enregistrez ces deux champs dès le premier jour. Chaque modèle de coût que j'ai vu échouer a échoué pour la même raison : quelqu'un a supposé un taux de hit au lieu de le mesurer.

Multiplicateur deux : il raisonne par défaut, et il est verbeux

Les deux niveaux de V4 activent par défaut le mode de réflexion, et les tokens de raisonnement sont facturés au tarif de sortie. Assez standard désormais. Ce qui est moins standard, c'est combien Flash en produit.

Artificial Analysis a eu besoin de 210 millions de tokens de sortie pour exécuter son Intelligence Index sur Flash, contre une médiane de classe d'environ 100 millions. L'exécution complète de l'index a coûté $72.02. Donc sur un travail identique, vous devriez vous attendre à environ deux fois plus de tokens de sortie qu'un modèle comparable, chacun à $0.28, ce qui divise silencieusement par deux la remise annoncée par la grille.

Diagramme en barres comparant les 210M de tokens de sortie utilisés par DeepSeek V4 Flash à une médiane de classe de 100M, annoté avec le coût de $72.02 de l'exécution de l'index
Diagramme en barres comparant les 210M de tokens de sortie utilisés par DeepSeek V4 Flash à une médiane de classe de 100M, annoté avec le coût de $72.02 de l'exécution de l'index

Il n'existe aucune façon propre d'acheter uniquement la version bon marché. Baisser le raisonnement fait baisser le modèle avec lui. Le tableau croisé des modes de DeepSeek lui-même place Flash à 8.1 sur Humanity's Last Exam en mode sans réflexion, contre 34.8 à effort maximal, et Artificial Analysis lui attribue indépendamment un score de 50 à effort maximal contre 29 sans raisonnement. La configuration bon marché et la bonne configuration sont des exécutions différentes des mêmes poids. Une bizarrerie à connaître ici : xhigh est silencieusement servi comme high sur Flash, donc vous ne pouvez pas non plus payer pour dépasser ce plafond.

Multiplicateur trois : une surtaxe 2x sans date de début

C'est là que la structure de DeepSeek s'est retournée sur elle-même. Aucune remise hors-pointe n'existe aujourd'hui. À la place, la grille porte une note de bas de page indiquant que l'API "adoptera bientôt une politique tarifaire pic/hors-pic" où les prix en heure de pointe seront le double des prix réguliers, applicable à tous les postes de facturation.

La fenêtre publiée s'étend de 9h00 à 12h00 et de 14h00 à 18h00 heure de Pékin, chaque jour. Convertie, cela tombe entre 01h00 et 04h00 UTC et 06h00 et 10h00 UTC, donc sept heures par jour. Quant à la date d'entrée en vigueur, elle est "sujette à l'annonce officielle", ce qui est une autre façon de dire qu'il n'y en a pas.

Illustration en escalier ascendant montrant les quatre multiplicateurs entre le prix affiché de $0.28 de DeepSeek et une facture réelle : raisonnement activé par défaut, verbosité 2,1x la médiane de classe, surtaxe 2x en pointe en attente, et 3-5x pour la rétention zéro
Illustration en escalier ascendant montrant les quatre multiplicateurs entre le prix affiché de $0.28 de DeepSeek et une facture réelle : raisonnement activé par défaut, verbosité 2,1x la médiane de classe, surtaxe 2x en pointe en attente, et 3-5x pour la rétention zéro

Deux lectures pratiques de cela. Si votre charge est un travail par lots dont vous contrôlez le calendrier, c'est presque anodin et vous planifiez simplement autour. Si votre charge est un trafic synchrone servant les matinées européennes ou les après-midis asiatiques, alors une grande partie tombe précisément dans ces fenêtres, et vous devriez dès maintenant modéliser votre budget au double. Ce n'est pas non plus une hypothèse que les gens ont manquée :

Hacker News

"Besides, in a few days, they'll change their pricing, doubling it during their peak hours [...] It's still cheap, but the price/performance ratio is not that good"

Les prix qui figurent aujourd'hui sur la grille sont les tarifs réguliers. DeepSeek n'a publié aucune grille de tarifs de pointe, donc doubler vous-même les chiffres publiés est la façon honnête de modéliser cela, plutôt que de citer des prix de pointe comme s'ils existaient déjà.

Multiplicateur quatre : rétention zéro, si vous en avez besoin

Celui-ci n'est absolument pas le prix de DeepSeek, et pour quiconque manipule des données clients, c'est le plus grand multiplicateur de la liste.

Les conditions Open Platform de l'API payante de DeepSeek sont silencieuses sur la question de savoir si les entrées de l'API entraînent le modèle. La section "Inputs and Outputs" va jusqu'au §4.2 puis s'arrête, omettant la clause d'entraînement que les conditions grand public portent au §4.3. Silencieux n'est pas la même chose que permissif, et cela vaut la peine d'être précis là-dessus, car de nombreux commentaires affirment carrément que DeepSeek entraîne sur les données de l'API, alors que les conditions payantes ne le disent tout simplement pas. Ce qu'elles ne disent pas non plus, c'est que ce ne sera pas le cas. Dans tous les cas, il n'y a aucun DPA publié ni option de rétention zéro en propre, et les données restent en RPC sous le droit de la RPC.

Donc les équipes soumises à une exigence de conformité passent plutôt par un hébergeur à rétention zéro, et elles le paient :

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."

Notez la parenthèse ici, car c'est la partie importante. Les hébergeurs tiers ne reproduisent pas la remise de cache de 98% de DeepSeek, donc vous perdez le tarif d'entrée bon marché au moment même où vous commencez à payer la prime de rétention. La sortie à $0.28 de Flash chez un hébergeur à rétention zéro atterrit quelque part entre $0.84 et $1.40, la même fourchette qu'un modèle occidental de milieu de gamme livré avec vision et recherche web. Si vous pesez ce compromis, mes guides sur les exigences SOC 2 et RGPD et sur la question construire ou acheter couvrent le terrain.

Comme précédent expliquant pourquoi les équipes s'en préoccupent, le changement de politique de Slack et la réaction qui a suivi est celui que la plupart des lecteurs ont vécu eux-mêmes.

Ce que les gens ont réellement payé

Les reçus publiés battent toujours la modélisation. Ceux-ci sont sortis spontanément du fil de lancement, directement des propres tableaux de bord des gens, et ce sont les données de coût les plus concrètes disponibles où que ce soit.

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886"
Hacker News

"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:

$19.27 USD
API requests: 7,877
Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache. Still incredible."

Le second auteur fait preuve d'honnêteté et signale pourquoi son chiffre est si bas. Les boucles expérimentales qui renvoient un préfixe presque identique des milliers de fois sont la forme idéale pour le cache. C'est une charge de travail réelle. Ce n'est pas non plus la plupart des charges de travail.

Par session, sur un harnais d'agent :

Hacker News

"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost."

Et puis le contre-reçu, qui est la raison pour laquelle je ne budgétiserais pas uniquement sur les bons chiffres :

Hacker News

"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."

Deux dollars par mois, et cinquante dollars en une heure. Les deux sont des rapports réels sur le même modèle. La variable, c'est la forme de la charge de travail plus la voie d'achat utilisée, et non la grille tarifaire. Si vous voulez surveiller cela correctement, les outils de suivi LLM existent exactement pour cette raison.

Le coût par tâche est le chiffre à comparer

Les prix par token ne sont comparables qu'entre des modèles qui dépensent le même nombre de tokens sur un travail, et les modèles ne font pas cela. Artificial Analysis publie un chiffre de coût par tâche qui normalise cela, et c'est la façon honnête de lire Flash face à tout le reste.

Modèle et effortAA Intelligence IndexCoût par tâche
DeepSeek V4 Flash (max)50~$0.03
GPT-5.6 Luna (high)46~$0.03
GPT-5.6 Luna (xhigh)49~$0.04
GPT-5.6 Luna (max)51~$0.07
DeepSeek V4 Pro44~$0.05
Kimi K3 (max)57~$0.86

Ce qui redéfinit toute la comparaison. Sur les prix de sortie affichés, Flash contre Kimi K3 ressort à 54x. Sur le coût par tâche, ce n'est que 29x, parce que Flash dépense plus de tokens pour y arriver. Et face au milieu de gamme d'OpenAI, l'écart se referme essentiellement :

Hacker News

"First, your direct comparison, Deepseek V4 Flash 0731 (max effort) $0.03 (rounded up) per task @ index 50. OpenAI Luna: * high effort $0.03 (rounded down) @ index 46 * xhigh effort $0.04 @ index 49 * max effort $0.07 @ index 51 So I would say a fair statement would be "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference""

Il vaut la peine d'établir précisément le pourquoi ici, car c'est l'erreur la plus courante dans les comparaisons de prix DeepSeek. Le 30 juillet 2026, OpenAI a réduit les prix de GPT-5.6, et Luna a chuté de 80%, à $0.20 en entrée et $1.20 en sortie. Tout ce qui cite encore Luna à $1.00 en entrée et $6.00 en sortie a cinq fois faux, et toute comparaison contre un gpt-5.6 non qualifié compare silencieusement Flash à Sol, qui est le niveau de pointe à $5 et $30. Le niveau qui rivalise réellement avec Flash sur le prix est Luna, et sur l'index les deux sont à égalité.

Flash contre Pro, où le ratio n'est pas ce qu'il semble

Le ratio affiché entre les niveaux est assez clair. Pro tourne à 3,11x Flash sur l'entrée en cache miss et sur la sortie, tandis que sur les cache hits ce n'est que 1,29x. Donc plus votre charge de travail utilise le cache, moins ce choix de niveau vous coûte.

Sauf que le choix de niveau est de toute façon presque tranché, et pas en faveur de Pro. Flash 0731 a été ré-entraîné le 31 juillet, tandis que deepseek-v4-pro sur la grille est toujours la version preview d'avril, sans équivalent 0731 derrière. Flash bat Pro-Preview sur les neuf lignes de benchmark agentique que publie DeepSeek, et il se situe 6 points plus haut sur l'Intelligence Index pour un tiers du prix. J'ai détaillé cette inversion dans la comparaison Flash contre Pro.

Pro conserve cependant un véritable avantage sur deux points qui valent la peine d'être payés si vous en avez besoin : le rappel et la récupération à contexte long. Sur le tableau croisé des modes de la preview, il prend SimpleQA-Verified à 57.9 contre 34.1, MRCR à contexte 1M à 83.5 contre 78.7, puis BrowseComp à 83.4 contre 73.2. C'est ce que 49B de paramètres actifs achètent par rapport à 13B. La préférence humaine diverge ici aussi de l'index automatisé, puisque LMArena classe toujours Pro au-dessus de Flash pour un nombre de votes comparable.

Un piège de facturation, si vous vous tournez vers Pro. Le tableau de correspondance d'effort publié par DeepSeek sert une requête low sur Pro comme high. Il n'existe pas d'exécution Pro bon marché. Vous payez 3,11x le tarif et vous ne pouvez pas baisser le raisonnement pour compenser. Cette correspondance doit changer début août 2026, donc vérifiez-la avant de construire quoi que ce soit autour.

Mécaniques de facturation qui mordent

Les règles de déduction de la grille sont brèves, et elles cachent deux problèmes opérationnels à l'intérieur.

C'est prépayé, et tomber à sec n'est pas élégant. La dépense correspond aux tokens multipliés par le prix, déduite de votre solde rechargé ou de votre solde accordé, celui accordé étant dépensé en premier quand les deux existent. DeepSeek recommande explicitement de recharger selon l'usage réel plutôt que de précharger, et se réserve le droit de changer les prix. La conséquence pour tout ce qui tourne longtemps, c'est qu'un 402 pour solde insuffisant arrive en plein milieu de l'exécution, pas au moment de la requête. Traitez-le comme fatal et créez une alerte à ce sujet, car réessayer un 402 n'accomplit absolument rien.

Il n'existe aucune limite de débit publiée, seulement un plafond de concurrence. Aucun RPM ni TPM nulle part dans la documentation. Ce qui est publié, c'est la concurrence, 2 500 sur Flash contre 500 sur Pro, appliquée au niveau du compte plutôt que par clé, et renvoyant 429 en cas de dépassement sans en-tête Retry-After. L'expansion passe par un formulaire de demande. Si vous dimensionnez une charge de travail de production, cette portée au niveau du compte est le détail à planifier, car un seul job incontrôlé privera tout le reste du compte de ressources.

Pour les estimations préalables, DeepSeek publie des ratios d'environ 0,3 token par caractère anglais et 0,6 par caractère chinois, et il existe aussi un package tokenizer hors ligne si vous voulez des comptes exacts avant d'envoyer quoi que ce soit.

Ce prix justifie-t-il de mettre le modèle sur votre file de support ?

C'est là que je ralentirais, car l'arithmétique qui rend Flash attrayant pour les agents de codage ne se transpose pas au travail en contact avec les clients.

Le taux d'hallucination AA-Omniscience de Flash se situe à 84%. C'est une amélioration de 12 points par rapport à son prédécesseur, et toujours très loin d'un chiffre que vous placeriez devant un client payant sans supervision. Aucune entrée image documentée non plus, ni recherche web, donc les pièces jointes photo et les vérifications de statut de commande auront toutes deux besoin d'autre chose de connecté.

Le problème plus profond, cependant, c'est qu'un taux d'hallucination de classement est simplement le mauvais critère d'achat. Une responsable CX me l'a formulé un jour mieux que je ne pourrais :

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

C'est une responsable CX dans une marque de compléments DTC sur Gorgias et Shopify, traitant environ 7 000 tickets par mois, et le routage basé sur la confiance s'est révélé être l'objection qui a décidé toute leur évaluation. Ce dont ils avaient besoin, ce n'était pas d'un meilleur score. Ils avaient besoin que le modèle sache quand rester à l'écart, et c'est un travail pour les seuils de confiance, pour l'ancrage dans des connaissances vérifiées, et pour un humain dans la boucle sur tout ce qui se situe sous la barre.

J'ai observé une version de cet même échec au sein de notre propre produit. Le pire schéma que l'équipe ait jamais capturé en production était un agent qui narrait "exécution de recherches Zendesk" pendant environ dix tours d'affilée sans jamais toucher l'API, puis rapportait des fichiers enregistrés qui n'existaient pas. Rien ne tue la confiance envers un coéquipier IA plus vite que le fait qu'il mente sur ce qu'il a fait. Et c'est un problème de supervision, pas de prix de token.

Où eesel entre en jeu

Si la raison pour laquelle vous calculez le prix de DeepSeek par million de tokens est que vous voulez un support moins coûteux, alors l'unité elle-même est erronée. Ce qu'une équipe de support dépense réellement, c'est le coût par résolution, et un prix par token ne vous en dit absolument rien, car il ne dit rien sur le nombre de tickets qui finissent résolus.

eesel est tarifé de la même façon que le résultat est mesuré. 40 cents par ticket ou conversation de helpdesk traité, sans frais par poste, et rien de facturé pour les tickets que vos humains traitent. Avant que tout cela n'arrive, vous exécutez des simulations sur vos propres tickets historiques et voyez le vrai taux de résolution sur vos propres données, ce qui, honnêtement, est le seul chiffre de précision qui compte vraiment. Et vous pouvez router seulement une tranche au début. Traitez 1 000 tickets par mois, envoyez-en 200 à l'IA, vous payez pour 200, donc $80.

Il y a $50 d'utilisation gratuite pour démarrer, sans carte de crédit, plus un plafond de dépense par défaut de $250 que les agents ne dépasseront pas. Les chiffres complets sont sur la page tarifs. Les pages sécurité et entreprise couvrent ces questions de traitement des données que les conditions DeepSeek laissent en suspens.

$0.14 et $0.28 sont-ils toujours bon marché en août 2026 ?

Oui, quoique moins que ce que le titre suggère, et la réponse honnête dépend beaucoup de ce à quoi vous comparez.

Face au niveau premium, l'écart est énorme, et réel. Claude Opus 5 et Flash sont séparés d'environ 89x en sortie. Face à Kimi K3, l'écart affiché est de 54x tandis que l'écart par tâche est de 29x. Face à Qwen 3.8 Max et Qwen 3.7 Flash, Flash reste compétitif sur le prix et prend du retard en multimodalité, étant limité au texte.

Face au niveau qui rivalise réellement avec lui, les choses sont serrées. Luna à $0.20 et $1.20 fait jeu égal avec Flash sur l'Intelligence Index, tourne plusieurs fois plus vite, et livre vision et recherche web. Ajoutez l'hébergement à rétention zéro par-dessus et la différence de prix s'évapore presque entièrement. C'est la raison pour laquelle un bon nombre d'équipes finissent par faire tourner les deux, Flash pour le gros du travail et autre chose pour les tâches que Flash ne peut pas faire. Si vous construisez ce genre de répartition, la comparaison à trois API est un point de départ raisonnable, et Mistral et Grok s'inscrivent tous les deux dans la même conversation tarifaire.

La seule option avec laquelle la grille tarifaire ne peut absolument pas rivaliser, c'est de le faire tourner soi-même. Les poids sont sous licence MIT, environ 167 Go, 284B de paramètres totaux dont 13B actifs, ce qui place un déploiement auto-hébergé dans le territoire du matériel prosumer coûteux plutôt que dans celui du datacenter. L'entrée en cache sur votre propre matériel ne coûte rien. Si c'est la direction vers laquelle vous allez, les agents IA open source et le fine-tuning sont les prochaines lectures.

FAQ

Combien coûte DeepSeek V4 Flash ? Le prix de DeepSeek V4 Flash est de $0.14 par million de tokens d'entrée en cache miss, $0.0028 par million en cache hit, et $0.28 par million de tokens de sortie. Ce sont les tarifs réguliers sur la grille tarifaire, et une politique d'heure de pointe en attente doublerait tout cela pendant les fenêtres publiées. Pour le contexte de comment cela se compare aux budgets IA de helpdesk, voyez ce que coûte le service client IA en pratique.

Comment le prix de DeepSeek V4 Flash se compare-t-il à V4 Pro ? Pro coûte 3,11x Flash sur l'entrée en cache miss et sur la sortie, et 1,29x sur les cache hits. Flash obtient aussi actuellement un score plus élevé sur l'Artificial Analysis Intelligence Index, 50 contre 44, ce qui est l'inversion que je détaille dans la comparaison Flash contre Pro. Pro conserve son avantage sur le rappel et la récupération à contexte long.

Existe-t-il un palier gratuit pour l'API DeepSeek ? Aucun palier gratuit n'apparaît sur la grille tarifaire. La facturation est prépayée, puisant dans un solde rechargé ou un solde accordé, celui accordé étant dépensé en premier. Ce modèle prépayé est la raison pour laquelle un 402 peut arriver en plein milieu de l'exécution plutôt qu'au moment de la requête. La fiche technique complète se trouve dans mon aperçu de DeepSeek V4 Flash.

Pourquoi ma facture DeepSeek est-elle plus élevée que le prix annoncé ? Presque toujours l'une de trois choses. Votre taux de hit de cache est plus bas que vous ne le pensiez, donc davantage de l'entrée est facturée à $0.14 au lieu de $0.0028. Ou le mode de réflexion génère des tokens de raisonnement qui sont facturés au tarif de sortie. Ou vous achetez via un revendeur plutôt qu'en direct, ce qui change à la fois le tarif et le comportement du cache. Enregistrez prompt_cache_hit_tokens pour distinguer les deux premiers cas.

DeepSeek entraîne-t-il son modèle sur les données de l'API ? Les conditions Open Platform payantes sont silencieuses là-dessus. La section "Inputs and Outputs" s'arrête au §4.2 et omet la clause d'entraînement que portent les conditions grand public, donc elle n'accorde ni ne refuse ce droit. Il n'y a aucun DPA publié ni option de rétention zéro en propre, et les données sont traitées en RPC. Les hébergeurs tiers à rétention zéro coûtent 3 à 5 fois plus. Mon guide SOC 2 et RGPD couvre ce qu'une équipe de support doit réellement satisfaire.

DeepSeek V4 Flash est-il assez bon marché pour faire tourner un chatbot de support client ? La contrainte n'est pas le prix du token, c'est le taux d'hallucination de 84%, ainsi que l'absence d'entrée image documentée. Un modèle brut face aux clients a besoin d'ancrage RAG, de garde-fous, et d'un routage basé sur la confiance avant d'être sûr. Mon guide sur la prévention des hallucinations dans le support détaille la mécanique, et construire un chatbot de support couvre le reste de la pile.

Quand débute la tarification de pointe 2x de DeepSeek ? Aucune date n'a été annoncée. La grille indique que la date d'entrée en vigueur est "sujette à l'annonce officielle". Les fenêtres de pointe publiées sont de 9h00 à 12h00 et de 14h00 à 18h00 heure de Pékin chaque jour, soit 01h00 à 04h00 et 06h00 à 10h00 UTC. Modélisez au double si votre trafic est synchrone et tombe dans ces heures.

Quelle est la façon la moins chère de faire tourner DeepSeek V4 Flash ? L'API en direct avec un taux de cache hit élevé, ce qui est précisément d'où viennent les taux mixtes sous le cent de cet article. Gardez les préfixes de prompt stables et en ajout pur, gardez la sortie courte, puis planifiez le travail par lots hors des fenêtres de pointe en attente. Si vos données ne peuvent pas quitter votre contrôle, des poids sous licence MIT et un déploiement auto-hébergé éliminent entièrement le coût par token, au prix du matériel. Pour une équipe de support, réduire les coûts de support avec l'IA est de toute façon un meilleur cadre que de courir après le tarif du token.

Le verdict

DeepSeek V4 Flash offre la meilleure intelligence par dollar sur le marché actuellement, et les chiffres $0.14 et $0.28 sous-estiment encore à quel point cela peut devenir bon marché. Les taux mixtes sous le cent sont réels, et documentés. Tout comme les $50 en une heure.

Ce que j'en ferais. Pour le travail par lots, les agents de codage, la relecture, le résumé, tout ce qui a un préfixe de prompt stable et des sorties courtes, utilisez-le, et mesurez votre taux de cache hit dès la toute première requête au lieu d'en supposer un. Pour le trafic de production synchrone, budgétisez au double jusqu'à ce que cette politique de pointe ait une date. Pour les données clients soumises à une exigence de conformité, chiffrez la voie à rétention zéro puis comparez-la honnêtement à Luna, car la remise y disparaît largement et Luna fait plus.

Et pour tout ce qui répond à un client, arrêtez complètement de comparer les prix par token. Comparez le coût par ticket, mesuré sur votre propre historique de tickets, car c'est le chiffre que votre équipe finance verra réellement.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment
Trending

DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment

DeepSeek V4 Flash coûte $0,14 en entrée et $0,28 en sortie par million de tokens, et surpasse le modèle haut de gamme, plus cher, de DeepSeek. Voici ce que la grille tarifaire ne dit pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration d'un chat très long qui s'étire à côté de deux personnes examinant une fiche de notation, avec le logo LongCat
Trending

Avis sur LongCat 2.0 : une bête de somme avec un vrai point bloquant

J'ai noté LongCat 2.0 sur sept critères qui comptent vraiment pour un acheteur, en m'appuyant sur les documents de Meituan lui-même et sur les témoignages de ceux qui lui ont fait traiter des milliards de tokens. Il obtient de bons résultats sur six d'entre eux.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration d'un chat très long étiré sur un bureau à côté d'une baie de serveurs, avec le logo LongCat
Trending

LongCat 2.0 : dans les coulisses du modèle ouvert de 1,6T de Meituan

LongCat 2.0 est le modèle MoE de 1,6T paramètres de Meituan, sous licence MIT, à 0,30 dollar par million de tokens en entrée. J'ai lu toutes les sources primaires pour voir ce qui est réellement livré.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Un testeur regardant une fiche de verdict avec deux cadrans d'effort étiquetés bas et max, à côté de la baleine DeepSeek
Trending

Avis sur DeepSeek V4 Flash : un modèle, deux personnalités

Un avis sur DeepSeek V4 Flash construit sur les chiffres publiés par les deux classements. L'exécution bon marché et l'exécution intelligente sont les mêmes poids, et cela change le verdict.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Deux personnes lisant un grand compteur d'utilisation et ajustant une pile de cadrans de facturation, dans le bleu de la marque Meta
Trending

Tarifs de Meta Muse Spark 1.1 : la facture repose sur quatre compteurs

Muse Spark 1.1 affiche un prix catalogue de 1,25 $ en entrée et 4,25 $ en sortie par million de tokens. Quatre compteurs distincts déterminent votre facture réelle, et le prix catalogue est le plus petit d'entre eux.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Illustration du décryptage des tarifs de PromptQL
Trending

Tarifs PromptQL : ce que ça coûte vraiment en 2026

Un décryptage des tarifs de PromptQL : l'unité facturable OLU, le tarif de lancement à 0,14 $, les crédits gratuits, le multiplicateur de modèle qui détermine vraiment la facture, et des exemples de coûts calculés.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Illustration de deux personnes examinant des cartes de tarifs échelonnés sur un écran, avec le logo Qwen
Trending

Tarifs de Qwen 3.7 Flash : ce que vous payez vraiment en 2026

Le tarif de $0.03 est réel, et ce n'est qu'un des quatre compteurs sur votre facture. Voici comment le palier de prompt, le cache, la région de batch et le taux de retentatives se combinent pour former le montant qui vous est réellement facturé.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5 : lequel utiliser réellement ?

Fable 5 coûte exactement le double d'Opus 5. J'ai passé en revue les deux system cards, la documentation et les benchmarks indépendants pour déterminer quand ce dollar supplémentaire apporte vraiment quelque chose.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Un agent IA sortant d'un écran pour manipuler des fenêtres d'applications et des documents pendant que deux collègues observent, dans la couleur de marque bleue de Meta
Trending

Meta Muse Spark 1.1 : ce que c'est, ce que ça coûte, où ça pêche

La première API de modèle payante de Meta lance un modèle agent à 1M de contexte pour $1,25/$4,25. Ce en quoi Muse Spark 1.1 est réellement bon, et les benchmarks que Meta a laissés hors de sa diapositive.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement