
Le vrai combat oppose Flash à Luna, pas à Sol
GPT-5.6 regroupe trois modèles, pas un seul, et l'alias gpt-5.6 redirige tout simplement vers Sol. C'est pour ça que beaucoup de comparatifs sonnent bizarrement. Ils opposent le niveau bon marché de DeepSeek au niveau le plus cher d'OpenAI, puis concluent que les modèles bon marché sont bon marché.
Voici le tableau de prix complet tel qu'il est aujourd'hui, niveau standard, contexte court, par million de tokens.
| Modèle | Entrée | Entrée en cache | Sortie | AA Intelligence Index |
|---|---|---|---|---|
deepseek-v4-flash | $0,14 | $0,0028 | $0,28 | 50 |
gpt-5.6-luna | $0,20 | $0,02 | $1,20 | 51 |
gpt-5.6-terra | $2,00 | $0,20 | $12,00 | 55 |
gpt-5.6-sol | $5,00 | $0,50 | $30,00 | 59 |
deepseek-v4-pro | $0,435 | $0,003625 | $0,87 | 44 |
Prix issus du tableau de prix de DeepSeek et de la page de prix d'OpenAI ; scores d'indice d'Artificial Analysis. Remarquez la dernière ligne, qui est une histoire à part entière : le niveau cher de DeepSeek obtient désormais un score inférieur à son niveau bon marché, et j'ai creusé la question dans Flash contre Pro.

La baisse du 30 juillet est la raison d'être de cet article. OpenAI a baissé Terra de 20 % et Luna de 80 % en une seule annonce : "Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." Toute comparaison qui cite encore Luna à $1,00 et $6,00 est décalée d'un facteur 5. Pour le détail niveau par niveau, j'ai traité GPT-5.6 Sol et GPT-5.6 Terra séparément.

Ce qu'est vraiment chaque modèle
Flash est un modèle de mélange d'experts épars, 284 milliards de paramètres au total dont 13 milliards actifs, distribué sous licence MIT, ce qui signifie que les poids sont sur Hugging Face et qu'on est libre de les faire tourner soi-même. L'équipe vLLM a décrit l'architecture le jour du lancement : "A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." Ignorez le chiffre de "304B" qui apparaît sur certains widgets de modèles ; la configuration indique 284B.
GPT-5.6 est à poids fermés, en trois niveaux, avec une seule fiche technique partagée. Les trois offrent 1 050 000 de contexte, 128 000 de sortie maximale, et une date limite de connaissances au 16 février 2026, avec entrée texte et image.
| DeepSeek V4 Flash | GPT-5.6 (tous niveaux) | |
|---|---|---|
| Poids | MIT, ouvert, ~167 Go | Fermé |
| Paramètres | 284B au total / 13B actifs | Non publié |
| Contexte | 1M | 1 050 000 |
| Sortie maximale | 384K | 128 000 |
| Entrée image | Non documenté | Oui |
| Recherche web | Non documenté | Oui |
| Date limite de connaissances | Non publiée | 16 fév. 2026 |
| Mode de réflexion | Activé par défaut, trois niveaux d'effort | Tokens de raisonnement pris en charge |
| Remise sur cache | ~98 % | 90 % |
| Concurrence | 2 500 | Selon le niveau, 500 à 30 000 RPM |
Deux particularités à connaître avant d'écrire la configuration. Sur Flash, xhigh se comporte silencieusement comme high, donc au-delà d'un certain point on ne peut plus monter le niveau de raisonnement. Sur GPT-5.6, le mode Fast a remplacé Priority Processing à cette même date du 30 juillet, et double le tarif pour "up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."
Pour qui compare les poids ouverts plus largement, les petits modèles de langage et les agents open source sont les deux comparaisons dont on me parle le plus à côté de celle-ci.
Ce que disent les benchmarks : égalité en bas, écart réel en haut
Sur l'Artificial Analysis Intelligence Index v4.1, Flash se situe à 50, troisième parmi les modèles à poids ouverts, derrière Kimi K3 à 57 et GLM 5.2 à 51. Luna est à 51, Terra à 55, Sol à 59, et Sol arrive troisième au classement général, derrière deux modèles Claude. Artificial Analysis a résumé le volet coût le jour du lancement :
"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."
La préférence humaine raconte une autre histoire que l'indice composite. Sur le classement texte de LMArena, deepseek-v4-flash obtient 1436 ±4 sur 48 667 votes, au rang 79, tandis que gpt-5.6-sol-xhigh est 15e au général. Sur WebDev, deepseek-v4-flash-high est 8e avec 1577 et Sol 6e avec 1620. Le modèle ouvert bon marché est donc compétitif sur l'indice automatisé et clairement en retrait en comparaison humaine à l'aveugle, ce qui est à peu près attendu et mérite d'être dit clairement.
Trois réserves sans lesquelles je ne publierais pas cet article.
- Le graphique de DeepSeek lui-même est une sélection. Comme l'a formulé une lecture mesurée, la comparaison "is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge" (Dr. Tomislav Marinovic, X).
- Le bond a suscité la méfiance. DeepSWE est passé de 7,3 à 54,4 à nombre de paramètres inchangé, et un compte spécialisé en IA a dit sans détour qu'un bond de score isolé juste après une mise à jour ressemble à du benchmaxxing, puisque le score DeepSWE bas précédent était justement ce qui exposait les failles de la version antérieure.
- Flash est verbeux et hallucine encore. Artificial Analysis a mesuré 210 millions de tokens de sortie pour faire tourner l'indice, contre une médiane de 100 millions dans sa catégorie, et situe son taux d'hallucination AA-Omniscience à 84 %, en baisse de 12 points par rapport à son prédécesseur. Luna est lui aussi verbeux, avec 130 millions de tokens contre une médiane de 62 millions. Si l'un de ces chiffres vous préoccupe, mes notes sur la prévention des hallucinations en donnent la version pratique.
Ce que ça coûte vraiment sur votre charge de travail
Les grilles tarifaires trompent, parce que le ratio entre deux modèles évolue avec la forme du trafic, pas seulement son volume. L'entrée en cache le déplace, le raisonnement gourmand en sortie le déplace, et les prompts longs aussi. Choisissez le profil qui ressemble le plus au vôtre.
Le chiffre à retenir est le plus ennuyeux. Sur tous les profils, Flash revient environ 3 fois moins cher que Luna, et non pas 4 fois comme le suggère la colonne de sortie. Un commentateur sur Hacker News a chiffré le même compromis à partir de la colonne coût par tâche et l'a bien résumé : "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference" (spwa4, Hacker News). Un autre a mis les grilles tarifaires côte à côte et est arrivé à la même conclusion résignée :
"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."
Là où le prix affiché cesse d'être le prix réel
Quatre facteurs font bouger la facture réelle, et entre les deux fournisseurs, ils ne sont pas symétriques du tout.
GPT-5.6 a un seuil à 272K tokens d'entrée. Chaque page de modèle GPT-5.6 l'énonce à l'identique : "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." Franchir ce seuil retarifie l'appel entier, si bien qu'une requête Sol passe de $5 et $30 à $10 et $45. La fenêtre de 1M de Flash n'a pas d'équivalent publié, ce qui en fait l'option la plus stable pour les prompts couvrant un dépôt entier ou tout un historique. C'est aussi un bon argument pour préférer la recherche documentaire au bourrage de prompt, quel que soit le modèle.

DeepSeek prépare une surtaxe de 2x aux heures de pointe. La grille tarifaire indique que l'API "will soon adopt a peak/off-peak pricing policy" où "during peak hours, prices will be 2x the regular prices, applicable to all billing items", avec une fenêtre fixée de 9h à 12h et de 14h à 18h heure de Pékin, soit 01h à 04h et 06h à 10h UTC. Aucune date de mise en œuvre n'est annoncée et aucun tarif de pointe n'est publié, donc à traiter comme un risque sur le trafic synchrone plutôt que comme un chiffre.
Le cache est là où l'avantage de DeepSeek est le plus grand et le moins fiable. Sa remise d'environ 98 % sur les cache hits dépasse les 90 % offerts par OpenAI et la majorité du secteur, et elle est active par défaut sans changement de code. Le piège est dans la mécanique : une requête n'est facturée au tarif de cache que si elle correspond entièrement à une unité de préfixe de cache persistée, la mise en cache est explicitement du best effort, et les entrées s'effacent "usually within a few hours to a few days" une fois inutilisées. Ne comptez pas sur $0,0028 comme un état stable.
La facturation tierce peut surprendre. Un utilisateur a rapporté la version la plus extrême de ce phénomène : "The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff" (onlyrealcuzzo, Hacker News). Il existe 11 fournisseurs proposant Flash sur OpenRouter et DeepSeek n'est pas le moins cher d'entre eux, donc vérifier la facturation par fournisseur vaut le coup avant de faire monter une boucle en charge.
Ce que les gens paient vraiment
C'est ma partie préférée des réactions autour de DeepSeek, parce que les gens y postent des factures plutôt que des opinions. Deux exemples sont apparus spontanément dans le fil de lancement.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:
$19.27 USDAPI requests: 7,877Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."
Notez ce que le second admet : ce volume de tokens vertigineux est bon marché *parce qu'*il est riche en cache, exactement le premier profil du widget ci-dessus. Un troisième utilisateur, faisant tourner un harnais d'agent en 30 tours, a chiffré une session à "~$0.5 cost" et a dit ne pas avoir touché à son abonnement Opus depuis des semaines (kmarc, Hacker News).
De son côté, la baisse de prix de GPT-5.6 s'est accompagnée de chiffres clients rendus publics, ce qui se rapproche le plus d'une facture chez OpenAI. Le responsable produit IA de Notion a déclaré que le nouveau modèle avait "delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time", et le CTO de Blitzy a rapporté que Luna "handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini" après être passé d'un simple appel à sortie structurée à une boucle d'agent complète. Les deux proviennent des fournisseurs eux-mêmes, à lire donc comme des indications plutôt que comme une vérification indépendante.
Les écarts de capacités qui font vraiment la différence
Si vous êtes arrivé jusqu'ici en pensant que le prix allait tout trancher, voici le retournement. Les deux éléments qui décident de cette comparaison pour la plupart des équipes ne figurent pas sur la page de prix.
Flash ne peut ni voir ni chercher. Aucune entrée image n'est documentée, et la recherche web ne fait pas partie de l'API. Les utilisateurs contournent le problème en combinant les modèles plutôt qu'en en choisissant un seul, un schéma que je reprendrais volontiers : "Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly" (theturtletalks, Hacker News). Si votre file de support est pleine de captures d'écran, cet écart clôt le débat à lui seul.
La vitesse n'est pas mesurée d'un côté et publiée de l'autre. Artificial Analysis liste la variante raisonnement de Flash sans vitesse de sortie, sans délai avant premier token et sans temps de réponse total, marquant la vitesse "Unknown out of 4 units". La variante sans raisonnement a bien des chiffres, à 107 tokens par seconde. Luna tourne à 177,8 tokens par seconde et Terra à 138. Sol est le cas atypique : 67,7 tokens par seconde et 137,84s de délai avant premier token, en dessous de la médiane de son propre niveau tarifaire, à connaître avant de le placer derrière quoi que ce soit d'interactif.

Les poids ouverts sont une option réelle ici, et le calcul dit surtout non. Flash tourne en local, et les retours sont détaillés : 60 tokens par seconde en session unique sur deux DGX Spark, ~30 sur un M3 Ultra avec 256 Go, 32 sur un Ryzen AI MAX+ 395 à environ 2,88 bits par paramètre. Le problème, c'est la facture matérielle, environ 8 200 € pour la configuration à deux Spark. Le verdict consensuel de quelqu'un qui a fait les calculs : "it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons" (cmrdporcupine, Hacker News). La confidentialité n'est pourtant pas une petite exception, ce qui nous amène au dernier point.
La rétention des données est l'objection qui l'emporte toujours. La critique la plus répétée sur Flash ne porte pas sur la qualité :
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."
Passez ça dans la grille tarifaire et l'avantage principal s'évapore. Les $0,28 de sortie de Flash deviennent $0,84 à $1,40, la même fourchette que les $1,20 de Luna, et Luna arrive avec vision, recherche et un profil de latence documenté. Si vos tokens contiennent des données clients, l'histoire du modèle bon marché et celle du modèle sûr n'en font plus qu'une.

Mon verdict
Choisissez DeepSeek V4 Flash pour le traitement de texte en masse quand vous êtes propriétaire des données : agents de code, revue de code, synthèse, classification, longs préfixes en cache, tout ce que vous feriez volontiers tourner sur 30 échanges. C'est actuellement la meilleure intelligence par dollar du tableau, et les factures citées plus haut le confirment. C'est aussi le bon choix si les poids ouverts comptent pour vous, car la licence et les poids Hugging Face sont réels, pas juste promis.
Choisissez GPT-5.6 Luna s'il vous faut des images ou de la recherche, si la latence est visible pour l'utilisateur, ou si vous alliez de toute façon router via un hébergeur à rétention zéro, puisqu'à ce moment-là vous payez le prix de Luna pour moins de capacités. Choisissez Sol uniquement quand la tâche a vraiment besoin du haut du tableau, et vérifiez son délai avant premier token avant de le placer près d'une fenêtre de chat. Si aucun des deux ne convient, les alternatives à GPT-5.6 couvrent le reste du terrain, et mon avis sur GPT-5.6 détaille chaque niveau.
Ou utilisez les deux, ce que font en réalité la plupart des équipes qui écrivent sur le sujet. Envoyez le texte en masse vers Flash, les captures d'écran et la recherche vers Luna, et gardez la logique de routage dans votre propre code pour que la prochaine baisse de prix ne soit qu'un changement de configuration. C'est bien plus proche de la façon dont je le construirais qu'un pari sur un seul modèle, et c'est le même réflexe qui pousse à faire tourner la classification des tickets sur un modèle moins cher que celui qui rédige la réponse.
Essayer eesel
Voici ce à quoi cette comparaison ne peut pas répondre pour vous : le modèle représente à peu près 2 % d'un ticket de support résolu. Je développe des intégrations chez eesel, et ce qui décide vraiment si un agent IA résout un ticket ou se contente d'agacer le client, c'est la recherche documentaire sur votre propre centre d'aide, des règles d'escalade qui savent quand s'arrêter, puis un déploiement testé sur votre propre historique de tickets avant qu'un client ne le voie. Nous avons vu des bots à la voix assurée donner de mauvaises réponses, c'est pourquoi nous simulons chaque déploiement sur d'anciens tickets avant de le lancer, au lieu de nous fier à un score de benchmark.
L'économie n'est pas non plus une économie de tokens. Le coût brut en tokens d'une réponse de support sur Flash s'arrondit à presque rien ; ce qui apparaît sur votre facture, c'est le coût par résolution, et eesel facture au ticket sans frais par poste, si bien qu'un bon mois pour votre IA n'est pas une punition. Un responsable chez Gridwise a résumé le résultat sans détour : "In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." Une responsable expérience client d'une marque de compléments alimentaires vendus en direct au consommateur a formulé le volet confiance exactement comme je le ferais : "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Si vous voulez un agent IA sur Zendesk ou Freshdesk qui connaît déjà votre centre d'aide, qui se branche le temps d'une pause café, et qui peut être testé à blanc sur les tickets du trimestre précédent avant de répondre à qui que ce soit, c'est exactement ce que nous avons construit. Gratuit à essayer, et la simulation est la fonctionnalité que j'utiliserais en premier.

À lire ensuite si vous choisissez un modèle spécifiquement pour le support : quel LLM convient le mieux au support, les LLM spécifiques à un domaine, et la version honnête du coût du support par IA.
Questions fréquentes
DeepSeek V4 Flash est-il meilleur que GPT-5.6 ?
DeepSeek V4 Flash est-il beaucoup moins cher que GPT-5.6 ?
DeepSeek V4 Flash gère-t-il les images comme GPT-5.6 ?
Quelle est la fenêtre de contexte de DeepSeek V4 Flash comparée à GPT-5.6 ?
DeepSeek V4 Flash est-il sûr pour les données clients ?
Quel modèle est le plus rapide, DeepSeek V4 Flash ou GPT-5.6 ?
Faut-il utiliser DeepSeek V4 Flash ou GPT-5.6 pour le support client ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








