Les 8 meilleures alternatives à DeepSeek V4 Flash en 2026

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 6, 2026

Vérifié par un expert
Un développeur choisissant entre des fiches de modèles, avec la fiche de la baleine DeepSeek au centre entourée de modèles concurrents

Pourquoi je ne les classe pas par score

J'écris sur l'intention de recherche pour gagner ma vie, et « deepseek v4 flash alternatives » est une requête d'achat avec une hypothèse cachée : que vous cherchez quelque chose de meilleur. Sur les deux tableaux qui mesurent ce modèle, la plupart du temps ce n'est pas le cas.

Artificial Analysis place Flash à l'effort maximal à 50 et le décrit comme « parmi les modèles les plus performants en intelligence et bien tarifé par rapport à d'autres modèles à poids ouverts de taille similaire. » Luna obtient 51. Gemini 3.6 Flash obtient 50. Vous échangeriez latéralement en intelligence tout en payant plus cher pour ce privilège.

Ce que vous achèteriez réellement, c'est une capacité ou une réponse de conformité. C'est donc ainsi que cette liste est ordonnée : par la lacune qu'elle combre, avec le coût honnête du changement associé à chacune. Si vous voulez la lecture purement technique du modèle que vous quittez, le résumé de DeepSeek V4 Flash et le test de Flash couvrent cela, et Flash contre GPT-5.6 couvre en détail le duel le plus proche.

Les chiffres, réunis en un seul endroit

Chaque chiffre ci-dessous provient d'Artificial Analysis ou de la page tarifaire propre du fournisseur, vérifiée le 4 août 2026. « Index run » est ce qu'il a coûté à AA pour évaluer ce modèle sur l'ensemble de l'Intelligence Index, ce qui est ce qui ressemble le plus à un vrai coût par tâche que chacun publie.

ModèleAA IndexEntrée /1MSortie /1MIndex runVitesse de sortieTemps au premier jetonJetons pour exécuter l'indexTypes d'entréeContextePoids
DeepSeek V4 Flash 0731 (max)50$0.14$0.28$72.02113 t/s1,31s210Mtext1MMIT
GPT-5.6 Luna (max)51$0.20$1.20$174.06181 t/s132,75s130Mtext, image1.05Mclosed
Gemini 3.6 Flash (high)50$1.50$7.50$726.70213 t/s15,69s59Mtext, image, speech, video1Mclosed
Gemini 3.5 Flash-Lite36$0.30$2.50$153.08366 t/s8,41s43Mtext, image, speech, video1Mclosed
Claude Haiku 4.5 (non-reasoning)24$1.00$5.00non publié90 t/s0,96snon publiétext, image200Kclosed
Kimi K3 (max)57$3.00$15.00$2,437.4136 t/s2,85s130Mtext, image1Mlicence kimi-k3
DeepSeek V4 Pro44$0.435$0.87non publiénon publiénon publiénon publiétext1Mopen
Qwen3.7-Flashnon répertorié$0.03–$0.20$0.13–$0.80non publié59 t/snon publiénon publiétext, image, video1Mclosed

Deux choses ressortent de ce tableau. Flash a le premier jeton le plus rapide du groupe, avec un facteur de deux, sur tout sauf Haiku, et c'est le seul modèle ici qui soit à la fois à poids ouverts et réellement bon marché. Tout le reste est un compromis.

Un graphique à barres horizontales dessiné à la main du temps au premier jeton à l'effort maximal, avec DeepSeek V4 Flash à 1,31 seconde et GPT-5.6 Luna à 132,75 secondes sortant du cadre
Un graphique à barres horizontales dessiné à la main du temps au premier jeton à l'effort maximal, avec DeepSeek V4 Flash à 1,31 seconde et GPT-5.6 Luna à 132,75 secondes sortant du cadre

Choisissez selon la lacune, pas selon le score

Avant la liste : voici la décision en cinq clics. Choisissez ce qui vous bloque réellement, et vous obtenez le choix ainsi que le coût réel du changement.

Pour quoi changez-vous réellement ?

Flash est déjà le moins cher et le plus rapide pour le premier jeton. Alors choisissez la lacune.

GPT-5.6 Luna

Flash n'a pas d'entrée image documentée. Luna accepte texte et images, obtient un point de plus sur l'index AA à 51, et tourne à 181 jetons par seconde. C'est aussi le modèle capable de vision le moins cher de cette comparaison, avec $0.20 en entrée et $1.20 en sortie.

Coût du changement : environ 3 fois la facture réelle sur les scénarios riches en cache, riches en raisonnement et à prompts longs, et un temps au premier jeton de 132,75s à l'effort maximal. Ne le placez pas sur un chemin interactif sans réduire l'effort.

Auto-héberger les poids de Flash

Vous conservez exactement le même modèle et déplacez seulement l'inférence. Les poids sont sous licence MIT, et une configuration de production publique fait déjà tourner le checkpoint 0731 sur un seul AMD MI300X à 168,6 jetons par seconde en flux unique, plus rapide que les 113 mesurés sur l'API officielle.

Coût du changement : le matériel. 156,67 GiB de poids doivent tenir dans la HBM, et une seule MI300X est difficile à acheter seule. Si vous préférez ne pas gérer de GPU, le palier payant de Gemini indique explicitement que votre contenu n'est pas utilisé pour améliorer ses produits.

Gemini 3.5 Flash-Lite

366 jetons par seconde, le plus rapide ici, et le plus concis : 43M de jetons de sortie pour exécuter l'index AA contre les 210M de Flash. Accepte texte, image, voix et vidéo. Bon pour la classification et le tri à grand volume.

Coût du changement : l'intelligence. Index 36 contre 50 pour Flash, donc une catégorie de tâche différente. Et pas d'utilisation d'ordinateur à quelque prix que ce soit.

Kimi K3

Le choix de la fiabilité. Taux d'hallucination AA-Omniscience de 51% contre 84% pour Flash, Omniscience Index de 18 contre -16 pour Flash, et l'intelligence brute la plus élevée ici à 57.

Coût du changement : environ 29 fois le coût par tâche et 36 jetons par seconde. Il n'y a pas de K3 économique non plus. La ligne K3 (low) obtient 47, trois points en dessous de Flash, pour 8 fois le coût. Le raisonnement ne peut pas être désactivé.

DeepSeek V4 Pro

Restez dans la famille. Pro gagne encore clairement en rappel et en recherche de contexte long : SimpleQA-Verified 57.9 contre 34.1 pour Flash, MRCR à contexte 1M 83.5 contre 78.7, et les votants humains de LMArena le classent à 1458 contre 1436 pour Flash.

Coût du changement : 3,11x en entrée cache-miss et en sortie, et pas d'exécution économique. Le propre tableau de correspondance d'effort de DeepSeek sert une requête low sur Pro en high.

1. GPT-5.6 Luna

La page du modèle GPT-5.6 Luna sur la plateforme développeurs d'OpenAI montrant $0.20 en entrée, $0.02 en entrée en cache et $1.20 en sortie par million de jetons, tel que repris sur OpenAI
La page du modèle GPT-5.6 Luna sur la plateforme développeurs d'OpenAI montrant $0.20 en entrée, $0.02 en entrée en cache et $1.20 en sortie par million de jetons, tel que repris sur OpenAI

Idéal pour : le changement équivalent le plus proche, et la façon la moins chère d'ajouter l'entrée image.

Ce que c'est réellement

Luna est le palier économique de la famille GPT-5.6, décrit sur sa propre page modèle comme « optimisé pour les charges de travail sensibles aux coûts. » La raison pour laquelle la plupart des comparaisons avec Flash se trompent est que gpt-5.6 est un alias de Sol, le palier de pointe, donc les gens comparent accidentellement un modèle à $0.14 avec un modèle à $5. Face à Luna spécifiquement, la question d'intelligence est pratiquement une égalité : 51 contre 50 sur l'index AA.

Il dispose d'une fenêtre de contexte de 1 050 000 jetons, d'un maximum de sortie de 128 000 jetons, d'une date limite de connaissances au 16 février 2026, et d'un support des jetons de raisonnement. Entrée texte et image, sortie texte.

Tarifs

$0.20 en entrée, $0.02 en entrée cache, $1.20 en sortie par million. Il y a une véritable échelle de remises en dessous que la plupart des articles manquent :

PalierEntrée /1MCache /1MSortie /1M
Standard$0.20$0.02$1.20
Batch$0.10$0.01$0.60
Flex$0.10$0.01$0.60
Fast mode$0.40$0.04$2.40
Long context (>272K)$0.40$0.04$1.80

En Batch ou Flex, l'entrée de Luna à $0.10 est en réalité moins chère que celle de Flash à $0.14. Si votre charge de travail se prête au traitement de nuit et est riche en entrée avec des sorties courtes, ce qui décrit beaucoup de classification de tickets, Luna peut ressortir gagnant. Flash n'a aucune remise de lot.

Où il surpasse Flash

Entrée image, latence publiée sur laquelle planifier, et une histoire de traitement des données que vous pouvez présenter à un auditeur de sécurité. Aussi la recherche web, qu'il vaut la peine de préciser : Flash dispose bien d'un outil web_search côté serveur, mais uniquement sur la Responses API exclusive à Flash, pas sur le chemin chat-completions. L'affirmation largement répétée « DeepSeek n'a pas de recherche web » est dépassée.

Où il ne le fait pas

Les données de Hacker News placent l'écart réel entre 2x et 3x, et non les 4,3x que suggère la colonne de sortie, car l'entrée en cache de Luna est aussi bon marché. Mais 3x reste 3x. Et le chiffre de latence est brutal :

Hacker News

"2x to 3x the price… 2 to 5 times faster inference"

Ce « faster inference » désigne le débit, pas la réactivité. À l'effort maximal, le temps au premier jeton de Luna est de 132,75 secondes. Bien pour un traitement par lots, mauvais pour un widget de chat.

Il y a aussi une falaise asymétrique à prévoir : les prompts dépassant 272K en entrée refacturent la requête entière au double du tarif d'entrée et 1,5 fois celui de sortie, pas seulement le dépassement. Les écritures en cache sont facturées à 1,25x le tarif hors cache.

Verdict

Si la raison de quitter Flash est l'entrée image ou une conversation de conformité, c'est la première chose à essayer, et le tarif par lot le rend moins cher qu'on ne le suppose. Je ne le placerais pas sur une surface interactive à l'effort maximal. Le détail complet des paliers se trouve dans le guide des tarifs GPT-5.6, et le test de GPT-5.6 couvre toute la famille.

2. Gemini 3.5 Flash-Lite

Le catalogue de modèles de l'API Gemini avec Gemini 3.5 Flash-Lite mis en avant comme le modèle 3.5 le plus rapide et le plus rentable pour l'exécution à haut débit, tel que repris sur Google
Le catalogue de modèles de l'API Gemini avec Gemini 3.5 Flash-Lite mis en avant comme le modèle 3.5 le plus rapide et le plus rentable pour l'exécution à haut débit, tel que repris sur Google

Idéal pour : la classification à grand volume, le tri, et tout ce où les jetons par seconde constituent le goulot d'étranglement.

Ce que c'est réellement

Le modèle généralement disponible le moins cher de Google dans la gamme 3.5, décrit sur sa propre page modèle comme « notre modèle 3.5 le plus rapide et le plus rentable pour l'exécution à haut débit. » Le code du modèle est gemini-3.5-flash-lite, contexte d'entrée de 1 048 576, sortie de 65 536, et il accepte texte, image, voix, vidéo et PDF.

Tarifs

$0.30 en entrée et $2.50 en sortie par million en Standard. Batch et Flex divisent les deux par deux à $0.15/$1.25. Priority est à $0.54/$4.50. La mise en cache de contexte coûte $0.03.

Où il surpasse Flash

Deux chiffres. 366 jetons par seconde, le plus rapide ici, et 43M de jetons de sortie pour exécuter l'index AA contre les 210M de Flash. AA le qualifie de « plutôt concis » et Flash de « très verbeux. » Cette concision explique pourquoi un modèle avec un tarif de sortie nominalement 9 fois plus élevé n'a coûté que $153.08 pour exécuter l'index contre $72.02 pour Flash, soit environ 2 fois, et non 9 fois.

L'entrée multimodale est native sur quatre modalités. Et le palier payant de Google est explicite là où celui de DeepSeek reste silencieux : la page tarifaire liste « Contenu non utilisé pour améliorer nos produits » comme propriété du palier payant, contre « Contenu utilisé pour améliorer nos produits » sur le palier gratuit.

Où il ne le fait pas

Intelligence Index 36 contre 50 pour Flash. Ce n'est pas un petit écart, c'est une catégorie de poids différente, et Flash-Lite sera moins bon sur tout ce qui est agentique ou multi-étapes. Pas d'utilisation d'ordinateur à quelque prix que ce soit. Le temps au premier jeton est de 8,41s, six fois celui de Flash.

Verdict

Si vous exécutez de la classification d'intention ou de l'analyse de sentiment sur un flux massif, c'est la forme adaptée et la concision permet de vraies économies. Si vous exécutez un agent, ce n'est pas le cas. Plus dans le résumé de Gemini 3.5 Flash-Lite.

3. Gemini 3.6 Flash

La page tarifaire de l'API développeurs Gemini montrant les paliers Free, Paid et Enterprise, avec le palier payant indiquant que le contenu n'est pas utilisé pour améliorer les produits de Google, tel que repris sur Google
La page tarifaire de l'API développeurs Gemini montrant les paliers Free, Paid et Enterprise, avec le palier payant indiquant que le contenu n'est pas utilisé pour améliorer les produits de Google, tel que repris sur Google

Idéal pour : égaler l'intelligence de Flash avec un tiers des jetons de sortie, plus l'utilisation d'ordinateur.

Ce que c'est réellement

Le palier Flash de référence de Google, lancé le 21 juillet 2026, positionné comme le modèle qui « équilibre vitesse et intelligence pour offrir une performance solide dans les tâches agentiques et multimodales. » La date limite de connaissances a été déplacée à mars 2026. L'utilisation d'ordinateur est intégrée. Contexte de 1M, sortie de 65K.

Tarifs

$1.50 en entrée, $7.50 en sortie par million. Batch divise les deux par deux à $0.75/$3.75.

Où il surpasse Flash

C'est l'entrée qui a changé ma façon de lire toute la comparaison. Gemini 3.6 Flash obtient exactement le même 50 que Flash, et y arrive avec 59M de jetons de sortie contre les 210M de Flash. Sur la grille tarifaire, c'est un écart de 26,8x en sortie. Sur la facture réelle d'exécution de l'index AA, c'est $726.70 contre $72.02, ce qui donne 10,1x.

10x reste 10x, donc ce n'est pas un modèle moins cher. Mais la direction compte : chaque comparaison de verbosité dans cet article évolue au désavantage de Flash, et si vous avez budgété selon la colonne par jeton, vous avez surestimé vos économies.

Un diagramme en deux étapes dessiné à la main montrant comment l'écart de prix affiché de 26,8x en sortie se comprime en un écart de 10,1x sur la facture réelle d'exécution de l'index, parce que Flash utilise 210M de jetons de sortie contre les 59M de Gemini 3.6 Flash au même score de 50
Un diagramme en deux étapes dessiné à la main montrant comment l'écart de prix affiché de 26,8x en sortie se comprime en un écart de 10,1x sur la facture réelle d'exécution de l'index, parce que Flash utilise 210M de jetons de sortie contre les 59M de Gemini 3.6 Flash au même score de 50

Il apporte également quatre modalités d'entrée, 213 jetons par seconde, et l'utilisation d'ordinateur, ce qu'aucun autre modèle de cette liste n'offre à ce niveau de prix.

Où il ne le fait pas

10x le coût par tâche à parité d'intelligence. Temps au premier jeton de 15,69s. Poids fermés, donc l'auto-hébergement est exclu.

Verdict

Le choix quand le modèle effectue un travail agentique sur une base de connaissances aux médias mixtes et que vous voulez réduire le nombre de jetons. Lisez le résumé de Gemini 3.6 Flash, ou le test pour le détail des évaluations.

4. Claude Haiku 4.5

La vue d'ensemble des modèles de la documentation de la Claude Platform comparant Fable 5, Opus 5, Sonnet 5 et Haiku 4.5, avec Haiku décrit comme le modèle le plus rapide avec une intelligence quasi à la pointe, tel que repris sur Anthropic
La vue d'ensemble des modèles de la documentation de la Claude Platform comparant Fable 5, Opus 5, Sonnet 5 et Haiku 4.5, avec Haiku décrit comme le modèle le plus rapide avec une intelligence quasi à la pointe, tel que repris sur Anthropic

Idéal pour : le premier jeton le plus rapide du groupe, et l'audit de sécurité le plus simple.

Ce que c'est réellement

Le petit modèle d'Anthropic, claude-haiku-4-5, décrit dans la documentation comme « le modèle le plus rapide avec une intelligence quasi à la pointe. » Entrée texte et image, contexte de 200K, connaissances jusqu'à juillet 2025. Disponible sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry.

Tarifs

$1.00 en entrée, $5.00 en sortie par million.

Où il surpasse Flash

0,96 seconde au premier jeton, le seul chiffre de cette page qui bat le 1,31s de Flash, à 90,2 jetons par seconde. AA qualifie ce TTFT de « très compétitif » face à une médiane de 1,43s dans sa gamme de prix.

L'autre chose sur laquelle il surpasse Flash, c'est l'approvisionnement. La disponibilité multi-cloud via Bedrock et Google Cloud signifie que la résidence des données et la contractualisation sont un problème déjà résolu par quelqu'un d'autre, pas le vôtre. D'après mon expérience, c'est plus souvent le véritable blocage que n'importe quel benchmark :

Bloqué complètement sur HIPAA/BAA pendant la démo, décrit comme un blocage dur, pas une préoccupation mineure.

Une plateforme de santé et de physiothérapie américaine sur Zendesk traitant environ 500 tickets par mois

Cette affaire ne s'est pas enlisée à cause d'un taux d'hallucination.

Où il ne le fait pas

Intelligence Index 24 sans raisonnement, le plus bas ici, et la fenêtre de contexte la plus petite à 200K contre 1M pour tous les autres. AA ne publie pas de coût d'exécution de l'index pour lui, donc le coût par tâche est inconnu. Anthropic propose aussi une variante avec raisonnement, mais le 24 est la ligne sans raisonnement, et c'est ce que les $1/$5 achètent aux réglages par défaut.

Verdict

Choisissez-le quand la réactivité et la contractualisation comptent plus que la capacité brute, ce qui est le cas de la plupart du chat destiné aux clients. Ne le choisissez pas pour du travail agentique. OpenAI API contre Anthropic API couvre le côté expérience développeur, et tarifs de Claude Sonnet 5 couvre le palier supérieur.

5. Kimi K3

La documentation tarifaire de l'inférence de modèles de la Kimi Platform montrant l'unité de facturation et la logique de facturation pour le modèle phare Kimi K3, tel que repris sur Moonshot AI
La documentation tarifaire de l'inférence de modèles de la Kimi Platform montrant l'unité de facturation et la logique de facturation pour le modèle phare Kimi K3, tel que repris sur Moonshot AI

Idéal pour : le seul cas où payer 29 fois plus se justifie : des réponses que vous ne pouvez pas vous permettre de voir fausses.

Ce que c'est réellement

Le modèle phare de Moonshot AI, lancé le 16 juillet 2026. 2,8T de paramètres au total dont 104B actifs, contexte de 1M, vision native pour images et vidéo. Les poids ouverts ont été publiés le 27 juillet comme promis, 1 561 Go répartis sur 96 fragments, sous une licence kimi-k3 avec des clauses pour les grands opérateurs MaaS et les produits très grande échelle.

Tarifs

$3 en entrée, $0.30 en entrée avec succès de cache, $15 en sortie par million. C'est le territoire de Claude Sonnet, pas le territoire économique.

Où il surpasse Flash

La fiabilité, et l'écart n'est pas mince. Taux d'hallucination AA-Omniscience de 51% contre 84% pour Flash. Omniscience Index de 18 contre -16 pour Flash, où un score négatif signifie plus de réponses incorrectes que correctes. Précision de 46% contre 37%. L'intelligence brute la plus élevée de cette comparaison à 57.

Si votre cas d'usage est un secteur réglementé ou un agent IA qui touche de l'argent, cet écart est tout l'argument.

Où il ne le fait pas

Le coût, et pas seulement par la marge du prix affiché. Le tarif de sortie est 54 fois celui de Flash, mais le coût par tâche d'AA est de $0.03 contre $0.86, donc l'écart réel est de 29x parce que K3 est plus verbeux par point d'intelligence. Exécution complète de l'index : $72.02 contre $2 437.41.

36 jetons par seconde, le plus lent ici. Et il n'y a pas de K3 économique : AA liste une ligne K3 (low) séparée avec un Intelligence Index de 47, trois points en dessous de Flash, coûtant $0.24 par tâche, soit 8x Flash, et pas plus rapide. Le guide de démarrage rapide de Moonshot confirme que le raisonnement ne peut pas être désactivé, donc les niveaux d'effort sont un contrôle de latence plutôt qu'un palier de coût.

Une chose de plus qui mérite d'être signalée pour quiconque compare les politiques de données : les conditions de Moonshot sont explicites et permissives là où celles de DeepSeek restent silencieuses. La Section 4 stipule que « sauf accord exprès écrit contraire, le contenu client peut être utilisé aux fins susmentionnées », avec une exclusion possible uniquement via un accord d'entreprise négocié. Les données sont hébergées à Singapour.

Verdict

Achetez-le quand une mauvaise réponse coûte plus que 29 fois la facture de jetons, ce qui est une situation réelle et plus étroite que ce que la plupart des acheteurs pensent. Sinon, les calculs ne tiennent pas. J'ai analysé ce duel en détail dans Flash contre Kimi K3, et il y a aussi un test de Kimi K3 et un guide tarifaire.

6. DeepSeek V4 Pro

La fiche des modèles et tarifs de l'API DeepSeek montrant deepseek-v4-flash et deepseek-v4-pro côte à côte avec leurs tarifs de succès de cache, échec de cache et sortie, tel que repris sur DeepSeek
La fiche des modèles et tarifs de l'API DeepSeek montrant deepseek-v4-flash et deepseek-v4-pro côte à côte avec leurs tarifs de succès de cache, échec de cache et sortie, tel que repris sur DeepSeek

Idéal pour : rester dans la famille quand vous avez besoin de rappel plutôt que de raisonnement.

Ce que c'est réellement

Le palier V4 plus grand, deepseek-v4-pro, avec 49B de paramètres actifs contre 13B pour Flash. Toujours sur la version préliminaire d'avril sans équivalent 0731, ce qui est toute la raison pour laquelle cette comparaison est étrange.

Tarifs

$0.435 en entrée cache-miss, $0.003625 en entrée cache-hit, $0.87 en sortie par million. C'est 3,11x Flash en entrée cache-miss et en sortie, mais seulement 1,29x sur les succès de cache.

Où il surpasse Flash

Le rappel et la recherche de contexte long, ce que les paramètres actifs supplémentaires permettent d'acheter. D'après le propre tableau croisé des modes de DeepSeek à l'effort maximal : SimpleQA-Verified 57.9 contre 34.1, GDPval-AA Elo 1554 contre 1395, BrowseComp 83.4 contre 73.2, et MRCR à contexte 1M 83.5 contre 78.7.

Et le vote humain est d'accord avec Pro, pas avec l'index automatisé. LMArena Text classe Pro à 1458±4 contre le 1436±4 de Flash sur environ 49 000 votes chacun. Deux tableaux, tous deux corrects, mesurant des choses différentes.

Où il ne le fait pas

Flash 0731 surpasse la version préliminaire de Pro sur les neuf lignes agentiques publiées par DeepSeek, DeepSWE 54.4 contre 12.8 étant l'écart le plus large. AA place Flash à 50 et $0.03 par tâche contre Pro à 44 et $0.05. Il faut le signaler honnêtement : deux de ces neuf lignes sont des jeux de données internes propres à DeepSeek et le harnais n'est pas publié.

Il n'y a pas non plus d'exécution économique de Pro. Le tableau de correspondance d'effort publié par DeepSeek sert une requête low sur Pro en high, donc vous payez 3,11x et ne pouvez pas réduire le raisonnement. Cette correspondance devait changer début août 2026.

Verdict

Un choix étroit mais réel : choisissez Pro pour le travail intensif en récupération sur de longs documents, restez sur Flash pour le travail agentique et le code. Détail complet dans Flash contre V4 Pro.

7. Auto-héberger les poids de Flash

Le dépôt GitHub pour exécuter DeepSeek V4 Flash 0731 sur un seul AMD MI300X, montrant la licence Apache-2.0 et un tableau de résultats avec 168,6 jetons par seconde en décodage flux unique, tel que repris sur GitHub
Le dépôt GitHub pour exécuter DeepSeek V4 Flash 0731 sur un seul AMD MI300X, montrant la licence Apache-2.0 et un tableau de résultats avec 168,6 jetons par seconde en décodage flux unique, tel que repris sur GitHub

Idéal pour : conserver le modèle et résoudre le problème de résidence en un seul mouvement.

Ce que c'est réellement

Pas un modèle différent. Le même checkpoint DeepSeek-V4-Flash-0731 sous licence MIT, tournant sur du matériel que vous contrôlez. Cette entrée mérite sa place car une configuration de production est devenue publique aujourd'hui et a atteint la première page de Hacker News avec 165 points.

Tarifs

Du matériel, pas des jetons. Ce qui est exactement le point si votre blocage est un audit de sécurité plutôt qu'un budget.

Où il surpasse l'API de Flash

Les chiffres publiés sur un seul AMD MI300X, à partir de la pile vLLM ROCm épinglée dans le dépôt :

MétriqueRésultat
Décodage flux unique168,6 tok/s
Prefill avec kernels optimisés~7,9–8,5K tok/s
8 flux simultanés542 tok/s agrégés, 90,3 tok/s médiane par flux
Rafale de 64 flux830 tok/s agrégés, sans OOM
Contexte validé256K (l'architecture supporte 1M)
Poids en HBM156,67 GiB, sans quantification supplémentaire

168,6 jetons par seconde sur une seule carte dépassent les 113 tok/s qu'Artificial Analysis mesure sur l'API propre de DeepSeek. Le dépôt précise explicitement que « le checkpoint fonctionne tel que livré, sans quantification de poids supplémentaire ni décharge », donc ce n'est pas un compromis vitesse contre qualité.

Il répond aussi à l'objection que j'entends le plus souvent, qui n'a rien à voir avec le modèle :

Phil a demandé s'il utilisait « une sorte d'autre ChatGPT ou quelque chose s'il ne connaît pas la réponse » et si cela pouvait être désactivé. Gil a demandé si les connaissances restaient fermées à leur organisation.

Un évaluateur technique dans une entreprise de matériel de semi-conducteurs B2B qui avait besoin de l'assurance que l'IA ne répond qu'à partir des connaissances approuvées par son organisation, pas de données d'entraînement générales

L'auto-hébergement est la seule option de cette page qui répond à cette question avec un schéma réseau plutôt qu'avec une lecture des conditions de service.

Où il ne le fait pas

Du matériel qu'il faut se procurer, et la communauté est franche à ce sujet :

Hacker News

"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."

Il existe une solution de contournement dans le même fil :

Hacker News

"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."

Deux autres réserves honnêtes. Le dépôt décrit le checkpoint comme 304B de paramètres alors que AA publie 284B au total, donc le décompte de paramètres est incohérent dans la pratique. Et DeepSeek obtiendrait selon certaines sources 15K tok/s/gpu sur H800 dans son propre article DSpark, selon xorfish dans le même fil, donc il reste de la marge sur cette configuration.

Verdict

Si votre raison de faire vos achats est la résidence des données, cela devrait être en haut de votre liste, pas en bas. Vous ne faites aucun compromis sur la qualité du modèle. Lectures connexes : agents IA open source, modèles IA personnalisés, et construire ou acheter.

8. Qwen3.7-Flash

La page du modèle OpenRouter pour Qwen3.7 Flash montrant $0.03 en entrée et $0.13 en sortie par million, un seul fournisseur Alibaba Cloud, et des prix effectifs moyens pondérés de $0.061 et $0.163, tel que repris sur OpenRouter
La page du modèle OpenRouter pour Qwen3.7 Flash montrant $0.03 en entrée et $0.13 en sortie par million, un seul fournisseur Alibaba Cloud, et des prix effectifs moyens pondérés de $0.061 et $0.163, tel que repris sur OpenRouter

Idéal pour : le prix affiché le moins cher, si vos prompts sont vraiment petits.

Ce que c'est réellement

Le modèle de raisonnement vision-langage d'Alibaba, publié le 27 juillet 2026, décrit sur OpenRouter comme adapté aux « agents multimodaux, au codage visuel, à la recherche et à l'interaction avec un ordinateur. » Contexte de 1M, texte plus image plus vidéo en entrée.

Tarifs

C'est là que ça devient intéressant, et là où la collision de noms avec le « Flash » de DeepSeek crée une vraie confusion. La tarification est répartie par tranches selon la taille du prompt, donc le tarif affiché en tête et le contexte de 1M ne peuvent pas être vrais simultanément dans le même appel :

Taille de promptEntrée /1MSortie /1M
Sous 32K$0.03$0.13
32K–256K$0.10$0.40
256K–1M$0.20$0.80

Une variation de 6,7x en entrée. Et OpenRouter publie la moyenne glissante sur 30 jours de ce que les clients paient réellement : $0.061 en entrée et $0.163 en sortie, au-dessus du tarif affiché, ce qui indique que le trafic réel se situe dans les tranches supérieures.

Où il surpasse Flash

La tranche sous 32K à $0.03/$0.13 est réellement moins chère que le $0.14/$0.28 de Flash, environ 4,6x en entrée. Il accepte images et vidéo, là où Flash ne prend ni l'un ni l'autre. La lecture en cache coûte $0.006.

Où il ne le fait pas

Presque rien n'est vérifié de manière indépendante, et c'est ça l'histoire, pas une note de bas de page. Qwen n'a publié aucun benchmark, aucune architecture, aucun décompte de paramètres. Il n'est pas répertorié du tout sur Artificial Analysis, donc il n'y a pas de score d'index comparable dans le tableau ci-dessus. Les poids sont fermés.

La seule évaluation tierce à laquelle je fais confiance est le benchmark de vision de Roboflow, qui le place 22ᵉ sur 23 au global avec 61,7%, tout en le classant 1er sur 23 pour le coût. Il identifie bien mieux qu'il ne localise.

« Flash » signifie ici bon marché, pas rapide : 59 jetons par seconde contre 113 pour Flash et 366 pour Flash-Lite. Le taux d'erreur des appels d'outils est de 8,88%, la latence de bout en bout P99 est de 90,19 secondes, et OpenRouter note qu'il est « hébergé par un seul fournisseur » avec « aucune décision de routage à prendre », donc il n'y a pas de solution de repli si ce fournisseur a une mauvaise journée.

Verdict

Ne le prenez que si vos prompts sont vraiment sous 32K et que vous avez besoin de vision à petit budget. Au-delà, les tranches effacent l'avantage, et l'absence de données d'évaluation signifie que vous achetez sur la foi. Les calculs par tranche sont détaillés dans le guide des tarifs de Qwen 3.7 Flash, et le résumé de Qwen 3.7 Flash couvre les spécifications.

Ce qu'aucun de ces huit ne fera

Chaque modèle ici est la couche la plus basse. Cela vaut la peine de le dire clairement, car la décision de changement que les gens m'apportent est généralement présentée comme un choix de modèle et ne l'est presque jamais.

Un taux d'hallucination de 84% ne signifie pas que le modèle se trompe sur 84% des tickets. C'est un chiffre AA-Omniscience mesuré sur des questions sans contexte fourni, ce qui est exactement l'opposé de la façon dont un agent de support devrait fonctionner. Connectez le même modèle à un RAG sur un centre d'aide vérifié, et le chiffre qui compte change complètement.

C'est l'argument derrière RAG contre LLM et la prévention des hallucinations. La solution est le grounding et les garde-fous, pas un meilleur modèle de base.

L'objection de l'acheteur qui décide réellement de ces contrats n'est pas la précision dans l'abstrait. C'est le contrôle. Un responsable CX l'a formulé mieux qu'aucun benchmark ne pourrait le faire :

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Un responsable CX dans une marque de compléments alimentaires DTC sur Gorgias et Shopify, avec environ 7 000 tickets et 30 000 commandes par mois

Aucune entrée du tableau ci-dessus ne résout cela. Les scores de confiance, les règles d'escalade, l'exclusion par type de ticket et un humain dans la boucle le font, et ceux-ci vivent dans la couche au-dessus de l'API.

J'ai écrit séparément sur les seuils de confiance et le taux de confinement, car ils sont la partie qui décide si tout cela fonctionne.

La deuxième chose qu'aucun d'entre eux ne fait, c'est de vous donner le chiffre que vous budgétez réellement. Les tarifs par jeton sont des intrants. Le coût par résolution est le résultat, et les deux ne sont pas proportionnels une fois que vous ajoutez la récupération, les tentatives répétées et le temps humain passé à nettoyer.

Ce que je ferais réellement avec une file de support

Le tableau de bord des rapports d'eesel AI montrant le volume total de tâches, les événements déclencheurs par type, et l'utilisation d'approbation ou de rejet par outil pour un agent Zendesk
Le tableau de bord des rapports d'eesel AI montrant le volume total de tâches, les événements déclencheurs par type, et l'utilisation d'approbation ou de rejet par outil pour un agent Zendesk

Acheter des modèles pour une file de support est la mauvaise première étape, et je le dis en tant que personne qui a passé cette semaine à lire huit fiches de modèles. La question n'est pas quel modèle hallucine le moins, c'est à quoi ressemble votre précision sur vos propres tickets, et vous ne pouvez pas obtenir cela d'un classement.

C'est précisément ce qu'eesel fait et qu'une API brute ne peut pas faire. Il se connecte à Zendesk, Freshdesk, Gorgias, Front ou Help Scout en quelques minutes, fonde chaque réponse sur votre centre d'aide, vos tickets passés et vos macros, puis exécute une simulation sur vos tickets historiques réels pour que vous voyiez le taux de résolution réel avant qu'un client ne le fasse. S'il n'atteint pas votre seuil, vous ne le déployez pas.

Le tarif est de 40 cents par ticket traité, sans frais par poste, et vous n'êtes jamais facturé pour les tickets pris en charge par vos humains. Acheminez 200 de vos 1 000 tickets mensuels pour commencer, et vous payez $80. Essayez eesel gratuitement avec $50 d'utilisation et sans carte de crédit.

Je n'affirme pas que eesel rend un modèle de base plus intelligent. J'affirme que ce que vous recherchez réellement, un modèle auquel vous pouvez faire confiance face aux clients, n'est pas un modèle du tout. Et la raison pour laquelle j'en suis convaincu, c'est que nous avons vu notre propre agent échouer de manières qu'aucun benchmark ne détecte : le pire schéma que nous ayons jamais enregistré était un agent racontant « exécution de recherches Zendesk » pendant environ dix tours sans jamais toucher l'API. Rien ne détruit plus vite la confiance envers un collègue que de mentir sur ce qu'il a fait, et aucun score d'index n'aurait pu le prédire.

Alors, lequel devriez-vous choisir ?

  • Besoin d'entrée imageGPT-5.6 Luna. L'option capable de vision la moins chère ici, égale Flash en intelligence, coûte environ 3 fois plus en pratique. Gardez l'effort bas si la latence compte.
  • Besoin de résidence des données → auto-hébergez les poids de Flash. Même modèle, licence MIT, 168,6 tok/s sur une seule MI300X. Le repli géré le moins cher est le palier payant de Gemini, qui indique par écrit que votre contenu n'est pas utilisé pour l'entraînement.
  • Besoin de débitGemini 3.5 Flash-Lite à 366 tok/s et la sortie la plus concise du groupe. Acceptez l'index 36.
  • Besoin de moins de jetons de sortie à paritéGemini 3.6 Flash. Même score de 50 avec 59M de jetons au lieu de 210M, pour 10 fois le coût par tâche.
  • Besoin de fiabilitéKimi K3. Hallucination de 51% contre 84%, pour 29 fois le coût par tâche. Ne vous embêtez pas avec K3 (low).
  • Besoin de rappel sur de longs documentsDeepSeek V4 Pro. Gagne SimpleQA-Verified 57.9 contre 34.1, et les votants de LMArena sont d'accord.
  • Besoin du prix affiché le plus basQwen3.7-Flash, mais uniquement sous 32K en prompts, et seulement si vous êtes à l'aise avec presque aucune évaluation indépendante.
  • Besoin de rien de tout cela → restez sur Flash. C'est le moins cher, le plus rapide pour le premier jeton, et il est ouvert. Surveillez juste cette surcharge en attente en heure de pointe multipliée par 2, qui s'appliquera entre 9h00–12h00 et 14h00–18h00 heure de Pékin dès que DeepSeek annoncera une date de début.

Si vous choisissez un modèle pour répondre à des tickets clients, l'explication du meilleur agent de support IA et le coût du service client IA sont des lectures plus utiles que n'importe laquelle des pages de modèles ci-dessus. Si vous en choisissez un pour écrire, meilleur LLM pour écrire un blog est celui par lequel je commencerais.

Sources

Frequently Asked Questions

Quelle est la meilleure alternative à DeepSeek V4 Flash ?
Cela dépend de la lacune que vous voulez combler. GPT-5.6 Luna est l'équivalent le plus proche en intelligence et ajoute l'entrée image pour environ 3 fois le coût réel. Gemini 3.5 Flash-Lite est le choix du débit. Kimi K3 est le choix si la fiabilité des réponses compte plus que la facture. Il n'y a pas de gagnant unique car Flash est déjà le moins cher et le plus rapide pour le premier jeton.
Existe-t-il une alternative moins chère à DeepSeek V4 Flash ?
Au prix affiché, oui : Qwen3.7-Flash démarre à $0.03 en entrée et $0.13 en sortie par million. Mais cela concerne uniquement la tranche sous 32K, et la moyenne glissante sur 30 jours d'OpenRouter de ce que les clients paient réellement est de $0.061 en entrée et $0.163 en sortie, au-dessus du prix affiché. Que cela batte Flash dépend entièrement de la taille de vos prompts. J'ai détaillé les calculs par tranche dans le guide des tarifs de Qwen 3.7 Flash.
Quelle alternative à DeepSeek V4 Flash prend en charge l'entrée image ?
Toutes sauf V4 Pro. Flash est uniquement texte en entrée et en sortie, sans entrée image documentée. Si vous devez lire une capture d'écran ou la photo d'un colis endommagé, c'est la raison la plus claire de changer. Gemini 3.6 Flash accepte texte, image, voix et vidéo. Luna, Kimi K3 et Claude Haiku 4.5 acceptent tous texte et images. Si vous connectez un agent de support à une base de connaissances contenant des captures d'écran, vérifiez cela en premier.
Puis-je auto-héberger DeepSeek V4 Flash au lieu de changer de modèle ?
Oui, et c'est l'option la plus sous-estimée de cette liste. Les poids sont sous licence MIT, 284B de paramètres au total dont 13B actifs, et une configuration de production pour un seul AMD MI300X est désormais publique. Cette voie conserve le modèle et résout le problème de résidence des données, ce que la plupart des gens recherchent en réalité. La contrepartie est le matériel qu'il faut acheter ou louer. Voir agents IA open source pour l'écosystème plus large.
DeepSeek entraîne-t-il ses modèles sur les données API des clients payants ?
Les conditions payantes de l'Open Platform restent silencieuses à ce sujet, ce qui est différent de permissif et différent de sûr. La clause d'entraînement présente dans les conditions grand public est simplement absente des conditions API, et il n'existe pas non plus de DPA publié ni d'option de rétention zéro dans un sens ou l'autre. Le palier payant Gemini de Google indique clairement que le contenu n'est pas utilisé pour améliorer ses produits. Si cette distinction compte pour vos acheteurs, lisez SOC 2 et RGPD pour les chatbots de support.
Combien coûte DeepSeek V4 Flash comparé aux alternatives ?
Flash coûte $0.14 en entrée cache-miss et $0.28 en sortie par million, contre $0.20/$1.20 pour Luna et $1.50/$7.50 pour Gemini 3.6 Flash. Mais la grille tarifaire exagère l'écart car Flash est le modèle le plus verbeux du groupe. Sur l'exécution de l'index propre d'Artificial Analysis, la facture était de $72 pour Flash et $727 pour Gemini 3.6 Flash au même score, soit 10 fois, et non les 27 fois suggérées par la colonne de sortie. Pour le travail de support, le chiffre qui compte est le coût par résolution, pas par jeton.
Est-il sûr de mettre DeepSeek V4 Flash face aux clients ?
Pas seul, et aucun modèle de cette liste ne l'est. Le taux d'hallucination AA-Omniscience de Flash est de 84%, le chiffre le plus élevé de son tableau, mais même le 51% de Kimi K3 serait inacceptable dans une réponse non supervisée. La solution n'est pas un meilleur modèle, c'est le grounding, les seuils de confiance et des tests sur votre propre historique avant la mise en production.
Devrais-je utiliser DeepSeek V4 Pro plutôt que Flash ?
Seulement pour les besoins de rappel et de recherche dans un contexte long, où Pro gagne encore clairement : SimpleQA-Verified 57.9 contre 34.1 pour Flash. Sur les neuf lignes agentiques publiées par DeepSeek, Flash 0731 surpasse la version préliminaire de Pro sur toutes. Et Pro ne peut pas être réduit en effort, car une requête low est traitée en high. Analyse complète dans Flash contre V4 Pro.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un petit modèle mis de côté tandis que cinq modèles alternatifs captent la lumière
Alternatives

8 meilleures alternatives à Inkling-Small en 2026

Inkling-Small est bon marché et rapide, mais son score de connaissance mesuré est négatif. Voici 8 alternatives à Inkling-Small, avec des prix réels et le piège de chacune.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration d'une personne comparant plusieurs super-agents d'IA comme alternatives à Skywork AI
Alternatives

7 meilleures alternatives à Skywork AI en 2026

Les meilleures alternatives à Skywork AI en 2026, des super-agents généralistes comme Manus aux outils de recherche, créateurs de présentations et une option spécialisée dans le support, avec de vrais prix.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Une personne au téléphone face à trois options d'agent vocal différentes, avec le logo Grok à gauche
Alternatives

Les 10 meilleures alternatives à Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 vient de devenir 60% plus cher sur l'alias par défaut. Dix vraies alternatives, avec coût horaire mesuré et chiffres de benchmark honnêtes.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Bannière illustrée pour un guide des meilleures alternatives à Paperclip pour les agents IA
Alternatives

8 meilleures alternatives à Paperclip pour les agents IA (2026)

Paperclip est un excellent outil open source pour faire fonctionner toute une entreprise d'agents IA, mais il n'a jamais été conçu pour répondre à une file de support. Voici 8 alternatives à Paperclip, et à qui chacune s'adresse vraiment.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Bandeau illustré pour un guide des meilleures alternatives à NemoClaw pour les agents IA et le support client
Alternatives

8 meilleures alternatives à NemoClaw pour les équipes de support (2026)

NemoClaw est l'environnement d'exécution gouverné de NVIDIA pour auto-héberger des agents IA, mais il n'a jamais été conçu pour faire tourner une file de support. Voici 8 alternatives à NemoClaw, et à qui chacune s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Bannière illustrée pour un guide des meilleures alternatives à ZeroClaw pour le support client par IA
Alternatives

Les 8 meilleures alternatives à ZeroClaw pour les équipes support (2026)

ZeroClaw est un runtime d'agents IA autohébergé brillamment conçu, mais il n'a jamais été pensé pour faire tourner une file de support. Voici 8 alternatives à ZeroClaw, et à qui chacune s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration d'un agent IA orientant des conversations client par téléphone, chat et e-mail
Alternatives

8 meilleures alternatives à Replicant pour le support client IA en 2026

Les meilleures alternatives à Replicant pour 2026, comparées sur le prix, les canaux et le délai de mise en place, de l'IA vocale pour entreprises à l'automatisation rapide du helpdesk en libre-service.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
Illustration des meilleures alternatives à Espressive pour l'IA de support informatique et employés en entreprise en 2026
Alternatives

Les 8 meilleures alternatives à Espressive en 2026

Espressive a été racheté par Resolve et la marque est en train d'être abandonnée. Voici les 8 meilleures alternatives à Espressive pour l'IA de support aux employés et aux clients en 2026.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
Bannière illustrée pour un guide des meilleures alternatives à Maven AGI pour le service client IA en 2026
Alternatives

Les 7 meilleures alternatives à Maven AGI en 2026

Un regard pratique sur les meilleures alternatives à Maven AGI pour le support client IA en 2026, des agents de helpdesk en self-service aux plateformes CX d'entreprise, avec des tarifs réels.

Rama Adi NugrahaRama Adi NugrahaJul 15, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement