Les 8 meilleures alternatives à DeepSeek V4 Flash en 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Dernière modification August 6, 2026

Pourquoi je ne les classe pas par score
J'écris sur l'intention de recherche pour gagner ma vie, et « deepseek v4 flash alternatives » est une requête d'achat avec une hypothèse cachée : que vous cherchez quelque chose de meilleur. Sur les deux tableaux qui mesurent ce modèle, la plupart du temps ce n'est pas le cas.
Artificial Analysis place Flash à l'effort maximal à 50 et le décrit comme « parmi les modèles les plus performants en intelligence et bien tarifé par rapport à d'autres modèles à poids ouverts de taille similaire. » Luna obtient 51. Gemini 3.6 Flash obtient 50. Vous échangeriez latéralement en intelligence tout en payant plus cher pour ce privilège.
Ce que vous achèteriez réellement, c'est une capacité ou une réponse de conformité. C'est donc ainsi que cette liste est ordonnée : par la lacune qu'elle combre, avec le coût honnête du changement associé à chacune. Si vous voulez la lecture purement technique du modèle que vous quittez, le résumé de DeepSeek V4 Flash et le test de Flash couvrent cela, et Flash contre GPT-5.6 couvre en détail le duel le plus proche.
Les chiffres, réunis en un seul endroit
Chaque chiffre ci-dessous provient d'Artificial Analysis ou de la page tarifaire propre du fournisseur, vérifiée le 4 août 2026. « Index run » est ce qu'il a coûté à AA pour évaluer ce modèle sur l'ensemble de l'Intelligence Index, ce qui est ce qui ressemble le plus à un vrai coût par tâche que chacun publie.
| Modèle | AA Index | Entrée /1M | Sortie /1M | Index run | Vitesse de sortie | Temps au premier jeton | Jetons pour exécuter l'index | Types d'entrée | Contexte | Poids |
|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (max) | 50 | $0.14 | $0.28 | $72.02 | 113 t/s | 1,31s | 210M | text | 1M | MIT |
| GPT-5.6 Luna (max) | 51 | $0.20 | $1.20 | $174.06 | 181 t/s | 132,75s | 130M | text, image | 1.05M | closed |
| Gemini 3.6 Flash (high) | 50 | $1.50 | $7.50 | $726.70 | 213 t/s | 15,69s | 59M | text, image, speech, video | 1M | closed |
| Gemini 3.5 Flash-Lite | 36 | $0.30 | $2.50 | $153.08 | 366 t/s | 8,41s | 43M | text, image, speech, video | 1M | closed |
| Claude Haiku 4.5 (non-reasoning) | 24 | $1.00 | $5.00 | non publié | 90 t/s | 0,96s | non publié | text, image | 200K | closed |
| Kimi K3 (max) | 57 | $3.00 | $15.00 | $2,437.41 | 36 t/s | 2,85s | 130M | text, image | 1M | licence kimi-k3 |
| DeepSeek V4 Pro | 44 | $0.435 | $0.87 | non publié | non publié | non publié | non publié | text | 1M | open |
| Qwen3.7-Flash | non répertorié | $0.03–$0.20 | $0.13–$0.80 | non publié | 59 t/s | non publié | non publié | text, image, video | 1M | closed |
Deux choses ressortent de ce tableau. Flash a le premier jeton le plus rapide du groupe, avec un facteur de deux, sur tout sauf Haiku, et c'est le seul modèle ici qui soit à la fois à poids ouverts et réellement bon marché. Tout le reste est un compromis.

Choisissez selon la lacune, pas selon le score
Avant la liste : voici la décision en cinq clics. Choisissez ce qui vous bloque réellement, et vous obtenez le choix ainsi que le coût réel du changement.
Pour quoi changez-vous réellement ?
Flash est déjà le moins cher et le plus rapide pour le premier jeton. Alors choisissez la lacune.
Flash n'a pas d'entrée image documentée. Luna accepte texte et images, obtient un point de plus sur l'index AA à 51, et tourne à 181 jetons par seconde. C'est aussi le modèle capable de vision le moins cher de cette comparaison, avec $0.20 en entrée et $1.20 en sortie.
Coût du changement : environ 3 fois la facture réelle sur les scénarios riches en cache, riches en raisonnement et à prompts longs, et un temps au premier jeton de 132,75s à l'effort maximal. Ne le placez pas sur un chemin interactif sans réduire l'effort.
Vous conservez exactement le même modèle et déplacez seulement l'inférence. Les poids sont sous licence MIT, et une configuration de production publique fait déjà tourner le checkpoint 0731 sur un seul AMD MI300X à 168,6 jetons par seconde en flux unique, plus rapide que les 113 mesurés sur l'API officielle.
Coût du changement : le matériel. 156,67 GiB de poids doivent tenir dans la HBM, et une seule MI300X est difficile à acheter seule. Si vous préférez ne pas gérer de GPU, le palier payant de Gemini indique explicitement que votre contenu n'est pas utilisé pour améliorer ses produits.
366 jetons par seconde, le plus rapide ici, et le plus concis : 43M de jetons de sortie pour exécuter l'index AA contre les 210M de Flash. Accepte texte, image, voix et vidéo. Bon pour la classification et le tri à grand volume.
Coût du changement : l'intelligence. Index 36 contre 50 pour Flash, donc une catégorie de tâche différente. Et pas d'utilisation d'ordinateur à quelque prix que ce soit.
Le choix de la fiabilité. Taux d'hallucination AA-Omniscience de 51% contre 84% pour Flash, Omniscience Index de 18 contre -16 pour Flash, et l'intelligence brute la plus élevée ici à 57.
Coût du changement : environ 29 fois le coût par tâche et 36 jetons par seconde. Il n'y a pas de K3 économique non plus. La ligne K3 (low) obtient 47, trois points en dessous de Flash, pour 8 fois le coût. Le raisonnement ne peut pas être désactivé.
Restez dans la famille. Pro gagne encore clairement en rappel et en recherche de contexte long : SimpleQA-Verified 57.9 contre 34.1 pour Flash, MRCR à contexte 1M 83.5 contre 78.7, et les votants humains de LMArena le classent à 1458 contre 1436 pour Flash.
Coût du changement : 3,11x en entrée cache-miss et en sortie, et pas d'exécution économique. Le propre tableau de correspondance d'effort de DeepSeek sert une requête low sur Pro en high.
1. GPT-5.6 Luna

Idéal pour : le changement équivalent le plus proche, et la façon la moins chère d'ajouter l'entrée image.
Ce que c'est réellement
Luna est le palier économique de la famille GPT-5.6, décrit sur sa propre page modèle comme « optimisé pour les charges de travail sensibles aux coûts. » La raison pour laquelle la plupart des comparaisons avec Flash se trompent est que gpt-5.6 est un alias de Sol, le palier de pointe, donc les gens comparent accidentellement un modèle à $0.14 avec un modèle à $5. Face à Luna spécifiquement, la question d'intelligence est pratiquement une égalité : 51 contre 50 sur l'index AA.
Il dispose d'une fenêtre de contexte de 1 050 000 jetons, d'un maximum de sortie de 128 000 jetons, d'une date limite de connaissances au 16 février 2026, et d'un support des jetons de raisonnement. Entrée texte et image, sortie texte.
Tarifs
$0.20 en entrée, $0.02 en entrée cache, $1.20 en sortie par million. Il y a une véritable échelle de remises en dessous que la plupart des articles manquent :
| Palier | Entrée /1M | Cache /1M | Sortie /1M |
|---|---|---|---|
| Standard | $0.20 | $0.02 | $1.20 |
| Batch | $0.10 | $0.01 | $0.60 |
| Flex | $0.10 | $0.01 | $0.60 |
| Fast mode | $0.40 | $0.04 | $2.40 |
| Long context (>272K) | $0.40 | $0.04 | $1.80 |
En Batch ou Flex, l'entrée de Luna à $0.10 est en réalité moins chère que celle de Flash à $0.14. Si votre charge de travail se prête au traitement de nuit et est riche en entrée avec des sorties courtes, ce qui décrit beaucoup de classification de tickets, Luna peut ressortir gagnant. Flash n'a aucune remise de lot.
Où il surpasse Flash
Entrée image, latence publiée sur laquelle planifier, et une histoire de traitement des données que vous pouvez présenter à un auditeur de sécurité. Aussi la recherche web, qu'il vaut la peine de préciser : Flash dispose bien d'un outil web_search côté serveur, mais uniquement sur la Responses API exclusive à Flash, pas sur le chemin chat-completions. L'affirmation largement répétée « DeepSeek n'a pas de recherche web » est dépassée.
Où il ne le fait pas
Les données de Hacker News placent l'écart réel entre 2x et 3x, et non les 4,3x que suggère la colonne de sortie, car l'entrée en cache de Luna est aussi bon marché. Mais 3x reste 3x. Et le chiffre de latence est brutal :
"2x to 3x the price… 2 to 5 times faster inference"
Ce « faster inference » désigne le débit, pas la réactivité. À l'effort maximal, le temps au premier jeton de Luna est de 132,75 secondes. Bien pour un traitement par lots, mauvais pour un widget de chat.
Il y a aussi une falaise asymétrique à prévoir : les prompts dépassant 272K en entrée refacturent la requête entière au double du tarif d'entrée et 1,5 fois celui de sortie, pas seulement le dépassement. Les écritures en cache sont facturées à 1,25x le tarif hors cache.
Verdict
Si la raison de quitter Flash est l'entrée image ou une conversation de conformité, c'est la première chose à essayer, et le tarif par lot le rend moins cher qu'on ne le suppose. Je ne le placerais pas sur une surface interactive à l'effort maximal. Le détail complet des paliers se trouve dans le guide des tarifs GPT-5.6, et le test de GPT-5.6 couvre toute la famille.
2. Gemini 3.5 Flash-Lite

Idéal pour : la classification à grand volume, le tri, et tout ce où les jetons par seconde constituent le goulot d'étranglement.
Ce que c'est réellement
Le modèle généralement disponible le moins cher de Google dans la gamme 3.5, décrit sur sa propre page modèle comme « notre modèle 3.5 le plus rapide et le plus rentable pour l'exécution à haut débit. » Le code du modèle est gemini-3.5-flash-lite, contexte d'entrée de 1 048 576, sortie de 65 536, et il accepte texte, image, voix, vidéo et PDF.
Tarifs
$0.30 en entrée et $2.50 en sortie par million en Standard. Batch et Flex divisent les deux par deux à $0.15/$1.25. Priority est à $0.54/$4.50. La mise en cache de contexte coûte $0.03.
Où il surpasse Flash
Deux chiffres. 366 jetons par seconde, le plus rapide ici, et 43M de jetons de sortie pour exécuter l'index AA contre les 210M de Flash. AA le qualifie de « plutôt concis » et Flash de « très verbeux. » Cette concision explique pourquoi un modèle avec un tarif de sortie nominalement 9 fois plus élevé n'a coûté que $153.08 pour exécuter l'index contre $72.02 pour Flash, soit environ 2 fois, et non 9 fois.
L'entrée multimodale est native sur quatre modalités. Et le palier payant de Google est explicite là où celui de DeepSeek reste silencieux : la page tarifaire liste « Contenu non utilisé pour améliorer nos produits » comme propriété du palier payant, contre « Contenu utilisé pour améliorer nos produits » sur le palier gratuit.
Où il ne le fait pas
Intelligence Index 36 contre 50 pour Flash. Ce n'est pas un petit écart, c'est une catégorie de poids différente, et Flash-Lite sera moins bon sur tout ce qui est agentique ou multi-étapes. Pas d'utilisation d'ordinateur à quelque prix que ce soit. Le temps au premier jeton est de 8,41s, six fois celui de Flash.
Verdict
Si vous exécutez de la classification d'intention ou de l'analyse de sentiment sur un flux massif, c'est la forme adaptée et la concision permet de vraies économies. Si vous exécutez un agent, ce n'est pas le cas. Plus dans le résumé de Gemini 3.5 Flash-Lite.
3. Gemini 3.6 Flash

Idéal pour : égaler l'intelligence de Flash avec un tiers des jetons de sortie, plus l'utilisation d'ordinateur.
Ce que c'est réellement
Le palier Flash de référence de Google, lancé le 21 juillet 2026, positionné comme le modèle qui « équilibre vitesse et intelligence pour offrir une performance solide dans les tâches agentiques et multimodales. » La date limite de connaissances a été déplacée à mars 2026. L'utilisation d'ordinateur est intégrée. Contexte de 1M, sortie de 65K.
Tarifs
$1.50 en entrée, $7.50 en sortie par million. Batch divise les deux par deux à $0.75/$3.75.
Où il surpasse Flash
C'est l'entrée qui a changé ma façon de lire toute la comparaison. Gemini 3.6 Flash obtient exactement le même 50 que Flash, et y arrive avec 59M de jetons de sortie contre les 210M de Flash. Sur la grille tarifaire, c'est un écart de 26,8x en sortie. Sur la facture réelle d'exécution de l'index AA, c'est $726.70 contre $72.02, ce qui donne 10,1x.
10x reste 10x, donc ce n'est pas un modèle moins cher. Mais la direction compte : chaque comparaison de verbosité dans cet article évolue au désavantage de Flash, et si vous avez budgété selon la colonne par jeton, vous avez surestimé vos économies.

Il apporte également quatre modalités d'entrée, 213 jetons par seconde, et l'utilisation d'ordinateur, ce qu'aucun autre modèle de cette liste n'offre à ce niveau de prix.
Où il ne le fait pas
10x le coût par tâche à parité d'intelligence. Temps au premier jeton de 15,69s. Poids fermés, donc l'auto-hébergement est exclu.
Verdict
Le choix quand le modèle effectue un travail agentique sur une base de connaissances aux médias mixtes et que vous voulez réduire le nombre de jetons. Lisez le résumé de Gemini 3.6 Flash, ou le test pour le détail des évaluations.
4. Claude Haiku 4.5

Idéal pour : le premier jeton le plus rapide du groupe, et l'audit de sécurité le plus simple.
Ce que c'est réellement
Le petit modèle d'Anthropic, claude-haiku-4-5, décrit dans la documentation comme « le modèle le plus rapide avec une intelligence quasi à la pointe. » Entrée texte et image, contexte de 200K, connaissances jusqu'à juillet 2025. Disponible sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry.
Tarifs
$1.00 en entrée, $5.00 en sortie par million.
Où il surpasse Flash
0,96 seconde au premier jeton, le seul chiffre de cette page qui bat le 1,31s de Flash, à 90,2 jetons par seconde. AA qualifie ce TTFT de « très compétitif » face à une médiane de 1,43s dans sa gamme de prix.
L'autre chose sur laquelle il surpasse Flash, c'est l'approvisionnement. La disponibilité multi-cloud via Bedrock et Google Cloud signifie que la résidence des données et la contractualisation sont un problème déjà résolu par quelqu'un d'autre, pas le vôtre. D'après mon expérience, c'est plus souvent le véritable blocage que n'importe quel benchmark :
Bloqué complètement sur HIPAA/BAA pendant la démo, décrit comme un blocage dur, pas une préoccupation mineure.
Une plateforme de santé et de physiothérapie américaine sur Zendesk traitant environ 500 tickets par mois
Cette affaire ne s'est pas enlisée à cause d'un taux d'hallucination.
Où il ne le fait pas
Intelligence Index 24 sans raisonnement, le plus bas ici, et la fenêtre de contexte la plus petite à 200K contre 1M pour tous les autres. AA ne publie pas de coût d'exécution de l'index pour lui, donc le coût par tâche est inconnu. Anthropic propose aussi une variante avec raisonnement, mais le 24 est la ligne sans raisonnement, et c'est ce que les $1/$5 achètent aux réglages par défaut.
Verdict
Choisissez-le quand la réactivité et la contractualisation comptent plus que la capacité brute, ce qui est le cas de la plupart du chat destiné aux clients. Ne le choisissez pas pour du travail agentique. OpenAI API contre Anthropic API couvre le côté expérience développeur, et tarifs de Claude Sonnet 5 couvre le palier supérieur.
5. Kimi K3

Idéal pour : le seul cas où payer 29 fois plus se justifie : des réponses que vous ne pouvez pas vous permettre de voir fausses.
Ce que c'est réellement
Le modèle phare de Moonshot AI, lancé le 16 juillet 2026. 2,8T de paramètres au total dont 104B actifs, contexte de 1M, vision native pour images et vidéo. Les poids ouverts ont été publiés le 27 juillet comme promis, 1 561 Go répartis sur 96 fragments, sous une licence kimi-k3 avec des clauses pour les grands opérateurs MaaS et les produits très grande échelle.
Tarifs
$3 en entrée, $0.30 en entrée avec succès de cache, $15 en sortie par million. C'est le territoire de Claude Sonnet, pas le territoire économique.
Où il surpasse Flash
La fiabilité, et l'écart n'est pas mince. Taux d'hallucination AA-Omniscience de 51% contre 84% pour Flash. Omniscience Index de 18 contre -16 pour Flash, où un score négatif signifie plus de réponses incorrectes que correctes. Précision de 46% contre 37%. L'intelligence brute la plus élevée de cette comparaison à 57.
Si votre cas d'usage est un secteur réglementé ou un agent IA qui touche de l'argent, cet écart est tout l'argument.
Où il ne le fait pas
Le coût, et pas seulement par la marge du prix affiché. Le tarif de sortie est 54 fois celui de Flash, mais le coût par tâche d'AA est de $0.03 contre $0.86, donc l'écart réel est de 29x parce que K3 est plus verbeux par point d'intelligence. Exécution complète de l'index : $72.02 contre $2 437.41.
36 jetons par seconde, le plus lent ici. Et il n'y a pas de K3 économique : AA liste une ligne K3 (low) séparée avec un Intelligence Index de 47, trois points en dessous de Flash, coûtant $0.24 par tâche, soit 8x Flash, et pas plus rapide. Le guide de démarrage rapide de Moonshot confirme que le raisonnement ne peut pas être désactivé, donc les niveaux d'effort sont un contrôle de latence plutôt qu'un palier de coût.
Une chose de plus qui mérite d'être signalée pour quiconque compare les politiques de données : les conditions de Moonshot sont explicites et permissives là où celles de DeepSeek restent silencieuses. La Section 4 stipule que « sauf accord exprès écrit contraire, le contenu client peut être utilisé aux fins susmentionnées », avec une exclusion possible uniquement via un accord d'entreprise négocié. Les données sont hébergées à Singapour.
Verdict
Achetez-le quand une mauvaise réponse coûte plus que 29 fois la facture de jetons, ce qui est une situation réelle et plus étroite que ce que la plupart des acheteurs pensent. Sinon, les calculs ne tiennent pas. J'ai analysé ce duel en détail dans Flash contre Kimi K3, et il y a aussi un test de Kimi K3 et un guide tarifaire.
6. DeepSeek V4 Pro

Idéal pour : rester dans la famille quand vous avez besoin de rappel plutôt que de raisonnement.
Ce que c'est réellement
Le palier V4 plus grand, deepseek-v4-pro, avec 49B de paramètres actifs contre 13B pour Flash. Toujours sur la version préliminaire d'avril sans équivalent 0731, ce qui est toute la raison pour laquelle cette comparaison est étrange.
Tarifs
$0.435 en entrée cache-miss, $0.003625 en entrée cache-hit, $0.87 en sortie par million. C'est 3,11x Flash en entrée cache-miss et en sortie, mais seulement 1,29x sur les succès de cache.
Où il surpasse Flash
Le rappel et la recherche de contexte long, ce que les paramètres actifs supplémentaires permettent d'acheter. D'après le propre tableau croisé des modes de DeepSeek à l'effort maximal : SimpleQA-Verified 57.9 contre 34.1, GDPval-AA Elo 1554 contre 1395, BrowseComp 83.4 contre 73.2, et MRCR à contexte 1M 83.5 contre 78.7.
Et le vote humain est d'accord avec Pro, pas avec l'index automatisé. LMArena Text classe Pro à 1458±4 contre le 1436±4 de Flash sur environ 49 000 votes chacun. Deux tableaux, tous deux corrects, mesurant des choses différentes.
Où il ne le fait pas
Flash 0731 surpasse la version préliminaire de Pro sur les neuf lignes agentiques publiées par DeepSeek, DeepSWE 54.4 contre 12.8 étant l'écart le plus large. AA place Flash à 50 et $0.03 par tâche contre Pro à 44 et $0.05. Il faut le signaler honnêtement : deux de ces neuf lignes sont des jeux de données internes propres à DeepSeek et le harnais n'est pas publié.
Il n'y a pas non plus d'exécution économique de Pro. Le tableau de correspondance d'effort publié par DeepSeek sert une requête low sur Pro en high, donc vous payez 3,11x et ne pouvez pas réduire le raisonnement. Cette correspondance devait changer début août 2026.
Verdict
Un choix étroit mais réel : choisissez Pro pour le travail intensif en récupération sur de longs documents, restez sur Flash pour le travail agentique et le code. Détail complet dans Flash contre V4 Pro.
7. Auto-héberger les poids de Flash

Idéal pour : conserver le modèle et résoudre le problème de résidence en un seul mouvement.
Ce que c'est réellement
Pas un modèle différent. Le même checkpoint DeepSeek-V4-Flash-0731 sous licence MIT, tournant sur du matériel que vous contrôlez. Cette entrée mérite sa place car une configuration de production est devenue publique aujourd'hui et a atteint la première page de Hacker News avec 165 points.
Tarifs
Du matériel, pas des jetons. Ce qui est exactement le point si votre blocage est un audit de sécurité plutôt qu'un budget.
Où il surpasse l'API de Flash
Les chiffres publiés sur un seul AMD MI300X, à partir de la pile vLLM ROCm épinglée dans le dépôt :
| Métrique | Résultat |
|---|---|
| Décodage flux unique | 168,6 tok/s |
| Prefill avec kernels optimisés | ~7,9–8,5K tok/s |
| 8 flux simultanés | 542 tok/s agrégés, 90,3 tok/s médiane par flux |
| Rafale de 64 flux | 830 tok/s agrégés, sans OOM |
| Contexte validé | 256K (l'architecture supporte 1M) |
| Poids en HBM | 156,67 GiB, sans quantification supplémentaire |
168,6 jetons par seconde sur une seule carte dépassent les 113 tok/s qu'Artificial Analysis mesure sur l'API propre de DeepSeek. Le dépôt précise explicitement que « le checkpoint fonctionne tel que livré, sans quantification de poids supplémentaire ni décharge », donc ce n'est pas un compromis vitesse contre qualité.
Il répond aussi à l'objection que j'entends le plus souvent, qui n'a rien à voir avec le modèle :
Phil a demandé s'il utilisait « une sorte d'autre ChatGPT ou quelque chose s'il ne connaît pas la réponse » et si cela pouvait être désactivé. Gil a demandé si les connaissances restaient fermées à leur organisation.
Un évaluateur technique dans une entreprise de matériel de semi-conducteurs B2B qui avait besoin de l'assurance que l'IA ne répond qu'à partir des connaissances approuvées par son organisation, pas de données d'entraînement générales
L'auto-hébergement est la seule option de cette page qui répond à cette question avec un schéma réseau plutôt qu'avec une lecture des conditions de service.
Où il ne le fait pas
Du matériel qu'il faut se procurer, et la communauté est franche à ce sujet :
"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."
Il existe une solution de contournement dans le même fil :
"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."
Deux autres réserves honnêtes. Le dépôt décrit le checkpoint comme 304B de paramètres alors que AA publie 284B au total, donc le décompte de paramètres est incohérent dans la pratique. Et DeepSeek obtiendrait selon certaines sources 15K tok/s/gpu sur H800 dans son propre article DSpark, selon xorfish dans le même fil, donc il reste de la marge sur cette configuration.
Verdict
Si votre raison de faire vos achats est la résidence des données, cela devrait être en haut de votre liste, pas en bas. Vous ne faites aucun compromis sur la qualité du modèle. Lectures connexes : agents IA open source, modèles IA personnalisés, et construire ou acheter.
8. Qwen3.7-Flash

Idéal pour : le prix affiché le moins cher, si vos prompts sont vraiment petits.
Ce que c'est réellement
Le modèle de raisonnement vision-langage d'Alibaba, publié le 27 juillet 2026, décrit sur OpenRouter comme adapté aux « agents multimodaux, au codage visuel, à la recherche et à l'interaction avec un ordinateur. » Contexte de 1M, texte plus image plus vidéo en entrée.
Tarifs
C'est là que ça devient intéressant, et là où la collision de noms avec le « Flash » de DeepSeek crée une vraie confusion. La tarification est répartie par tranches selon la taille du prompt, donc le tarif affiché en tête et le contexte de 1M ne peuvent pas être vrais simultanément dans le même appel :
| Taille de prompt | Entrée /1M | Sortie /1M |
|---|---|---|
| Sous 32K | $0.03 | $0.13 |
| 32K–256K | $0.10 | $0.40 |
| 256K–1M | $0.20 | $0.80 |
Une variation de 6,7x en entrée. Et OpenRouter publie la moyenne glissante sur 30 jours de ce que les clients paient réellement : $0.061 en entrée et $0.163 en sortie, au-dessus du tarif affiché, ce qui indique que le trafic réel se situe dans les tranches supérieures.
Où il surpasse Flash
La tranche sous 32K à $0.03/$0.13 est réellement moins chère que le $0.14/$0.28 de Flash, environ 4,6x en entrée. Il accepte images et vidéo, là où Flash ne prend ni l'un ni l'autre. La lecture en cache coûte $0.006.
Où il ne le fait pas
Presque rien n'est vérifié de manière indépendante, et c'est ça l'histoire, pas une note de bas de page. Qwen n'a publié aucun benchmark, aucune architecture, aucun décompte de paramètres. Il n'est pas répertorié du tout sur Artificial Analysis, donc il n'y a pas de score d'index comparable dans le tableau ci-dessus. Les poids sont fermés.
La seule évaluation tierce à laquelle je fais confiance est le benchmark de vision de Roboflow, qui le place 22ᵉ sur 23 au global avec 61,7%, tout en le classant 1er sur 23 pour le coût. Il identifie bien mieux qu'il ne localise.
« Flash » signifie ici bon marché, pas rapide : 59 jetons par seconde contre 113 pour Flash et 366 pour Flash-Lite. Le taux d'erreur des appels d'outils est de 8,88%, la latence de bout en bout P99 est de 90,19 secondes, et OpenRouter note qu'il est « hébergé par un seul fournisseur » avec « aucune décision de routage à prendre », donc il n'y a pas de solution de repli si ce fournisseur a une mauvaise journée.
Verdict
Ne le prenez que si vos prompts sont vraiment sous 32K et que vous avez besoin de vision à petit budget. Au-delà, les tranches effacent l'avantage, et l'absence de données d'évaluation signifie que vous achetez sur la foi. Les calculs par tranche sont détaillés dans le guide des tarifs de Qwen 3.7 Flash, et le résumé de Qwen 3.7 Flash couvre les spécifications.
Ce qu'aucun de ces huit ne fera
Chaque modèle ici est la couche la plus basse. Cela vaut la peine de le dire clairement, car la décision de changement que les gens m'apportent est généralement présentée comme un choix de modèle et ne l'est presque jamais.
Un taux d'hallucination de 84% ne signifie pas que le modèle se trompe sur 84% des tickets. C'est un chiffre AA-Omniscience mesuré sur des questions sans contexte fourni, ce qui est exactement l'opposé de la façon dont un agent de support devrait fonctionner. Connectez le même modèle à un RAG sur un centre d'aide vérifié, et le chiffre qui compte change complètement.
C'est l'argument derrière RAG contre LLM et la prévention des hallucinations. La solution est le grounding et les garde-fous, pas un meilleur modèle de base.
L'objection de l'acheteur qui décide réellement de ces contrats n'est pas la précision dans l'abstrait. C'est le contrôle. Un responsable CX l'a formulé mieux qu'aucun benchmark ne pourrait le faire :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Un responsable CX dans une marque de compléments alimentaires DTC sur Gorgias et Shopify, avec environ 7 000 tickets et 30 000 commandes par mois
Aucune entrée du tableau ci-dessus ne résout cela. Les scores de confiance, les règles d'escalade, l'exclusion par type de ticket et un humain dans la boucle le font, et ceux-ci vivent dans la couche au-dessus de l'API.
J'ai écrit séparément sur les seuils de confiance et le taux de confinement, car ils sont la partie qui décide si tout cela fonctionne.
La deuxième chose qu'aucun d'entre eux ne fait, c'est de vous donner le chiffre que vous budgétez réellement. Les tarifs par jeton sont des intrants. Le coût par résolution est le résultat, et les deux ne sont pas proportionnels une fois que vous ajoutez la récupération, les tentatives répétées et le temps humain passé à nettoyer.
Ce que je ferais réellement avec une file de support

Acheter des modèles pour une file de support est la mauvaise première étape, et je le dis en tant que personne qui a passé cette semaine à lire huit fiches de modèles. La question n'est pas quel modèle hallucine le moins, c'est à quoi ressemble votre précision sur vos propres tickets, et vous ne pouvez pas obtenir cela d'un classement.
C'est précisément ce qu'eesel fait et qu'une API brute ne peut pas faire. Il se connecte à Zendesk, Freshdesk, Gorgias, Front ou Help Scout en quelques minutes, fonde chaque réponse sur votre centre d'aide, vos tickets passés et vos macros, puis exécute une simulation sur vos tickets historiques réels pour que vous voyiez le taux de résolution réel avant qu'un client ne le fasse. S'il n'atteint pas votre seuil, vous ne le déployez pas.
Le tarif est de 40 cents par ticket traité, sans frais par poste, et vous n'êtes jamais facturé pour les tickets pris en charge par vos humains. Acheminez 200 de vos 1 000 tickets mensuels pour commencer, et vous payez $80. Essayez eesel gratuitement avec $50 d'utilisation et sans carte de crédit.
Je n'affirme pas que eesel rend un modèle de base plus intelligent. J'affirme que ce que vous recherchez réellement, un modèle auquel vous pouvez faire confiance face aux clients, n'est pas un modèle du tout. Et la raison pour laquelle j'en suis convaincu, c'est que nous avons vu notre propre agent échouer de manières qu'aucun benchmark ne détecte : le pire schéma que nous ayons jamais enregistré était un agent racontant « exécution de recherches Zendesk » pendant environ dix tours sans jamais toucher l'API. Rien ne détruit plus vite la confiance envers un collègue que de mentir sur ce qu'il a fait, et aucun score d'index n'aurait pu le prédire.
Alors, lequel devriez-vous choisir ?
- Besoin d'entrée image → GPT-5.6 Luna. L'option capable de vision la moins chère ici, égale Flash en intelligence, coûte environ 3 fois plus en pratique. Gardez l'effort bas si la latence compte.
- Besoin de résidence des données → auto-hébergez les poids de Flash. Même modèle, licence MIT, 168,6 tok/s sur une seule MI300X. Le repli géré le moins cher est le palier payant de Gemini, qui indique par écrit que votre contenu n'est pas utilisé pour l'entraînement.
- Besoin de débit → Gemini 3.5 Flash-Lite à 366 tok/s et la sortie la plus concise du groupe. Acceptez l'index 36.
- Besoin de moins de jetons de sortie à parité → Gemini 3.6 Flash. Même score de 50 avec 59M de jetons au lieu de 210M, pour 10 fois le coût par tâche.
- Besoin de fiabilité → Kimi K3. Hallucination de 51% contre 84%, pour 29 fois le coût par tâche. Ne vous embêtez pas avec K3 (low).
- Besoin de rappel sur de longs documents → DeepSeek V4 Pro. Gagne SimpleQA-Verified 57.9 contre 34.1, et les votants de LMArena sont d'accord.
- Besoin du prix affiché le plus bas → Qwen3.7-Flash, mais uniquement sous 32K en prompts, et seulement si vous êtes à l'aise avec presque aucune évaluation indépendante.
- Besoin de rien de tout cela → restez sur Flash. C'est le moins cher, le plus rapide pour le premier jeton, et il est ouvert. Surveillez juste cette surcharge en attente en heure de pointe multipliée par 2, qui s'appliquera entre 9h00–12h00 et 14h00–18h00 heure de Pékin dès que DeepSeek annoncera une date de début.
Si vous choisissez un modèle pour répondre à des tickets clients, l'explication du meilleur agent de support IA et le coût du service client IA sont des lectures plus utiles que n'importe laquelle des pages de modèles ci-dessus. Si vous en choisissez un pour écrire, meilleur LLM pour écrire un blog est celui par lequel je commencerais.
Sources
- Pages de modèles Artificial Analysis, tous les chiffres vérifiés le 4 août 2026 : DeepSeek V4 Flash 0731
- GPT-5.6 Luna sur Artificial Analysis
- Gemini 3.6 Flash et Gemini 3.5 Flash-Lite sur Artificial Analysis
- Kimi K3 et Claude 4.5 Haiku sur Artificial Analysis
- Tarifs de l'API DeepSeek et le guide de la Responses API
- Tarifs de la plateforme OpenAI et la page du modèle GPT-5.6 Luna
- Tarifs de l'API développeurs Gemini et le catalogue de modèles
- Vue d'ensemble des modèles Claude et tarifs Claude
- Tarifs des modèles Moonshot AI
- OpenRouter, Qwen3.7 Flash et Roboflow Vision Evals
- DeepSeek V4 Flash sur un seul AMD MI300X et son fil Hacker News
- Dossier interne des appels clients d'eesel, cité sous descripteurs anonymisés
Frequently Asked Questions
Quelle est la meilleure alternative à DeepSeek V4 Flash ?
Existe-t-il une alternative moins chère à DeepSeek V4 Flash ?
Quelle alternative à DeepSeek V4 Flash prend en charge l'entrée image ?
Puis-je auto-héberger DeepSeek V4 Flash au lieu de changer de modèle ?
DeepSeek entraîne-t-il ses modèles sur les données API des clients payants ?
Combien coûte DeepSeek V4 Flash comparé aux alternatives ?
Est-il sûr de mettre DeepSeek V4 Flash face aux clients ?
Devrais-je utiliser DeepSeek V4 Pro plutôt que Flash ?
low est traitée en high. Analyse complète dans Flash contre V4 Pro.
Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








