
Der Kampf ist Flash gegen Luna, nicht gegen Sol
GPT-5.6 sind drei Modelle, nicht eines, und der Alias gpt-5.6 leitet einfach zu Sol weiter. Deshalb lesen sich viele Vergleiche seltsam. Sie stellen DeepSeeks günstige Stufe gegen OpenAIs teuerste und schließen dann, dass günstige Modelle günstig sind.
Hier die komplette Preistabelle im aktuellen Stand, Standardstufe, kurzer Kontext, pro Million Token.
| Modell | Input | Gecachter Input | Output | AA Intelligence Index |
|---|---|---|---|---|
deepseek-v4-flash | $0,14 | $0,0028 | $0,28 | 50 |
gpt-5.6-luna | $0,20 | $0,02 | $1,20 | 51 |
gpt-5.6-terra | $2,00 | $0,20 | $12,00 | 55 |
gpt-5.6-sol | $5,00 | $0,50 | $30,00 | 59 |
deepseek-v4-pro | $0,435 | $0,003625 | $0,87 | 44 |
Preise von der Preistabelle von DeepSeek und der OpenAI-Preisseite; Indexwerte von Artificial Analysis. Achte auf die letzte Zeile, das ist eine eigene Geschichte: DeepSeeks teure Stufe schneidet inzwischen schlechter ab als die günstige, und warum das so ist, habe ich in Flash gegen Pro untersucht.

Der Preisschnitt vom 30. Juli ist der Grund, warum dieser Beitrag überhaupt existiert. OpenAI senkte Terra um 20 % und Luna um 80 % in einer einzigen Ankündigung: "Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." Jeder Vergleich, der Luna noch mit $1,00 und $6,00 zitiert, liegt um das 5-Fache daneben. Für die Aufschlüsselung nach Stufen habe ich GPT-5.6 Sol und GPT-5.6 Terra separat behandelt.

Was jedes Modell tatsächlich ist
Flash ist ein spärliches Mixture-of-Experts-Modell, 284B Parameter insgesamt und 13B aktiv, unter MIT-Lizenz veröffentlicht, was bedeutet, dass die Gewichte auf Hugging Face liegen und man sie frei selbst betreiben kann. Das vLLM-Team beschrieb die Architektur am Erscheinungstag: "A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." Ignoriere die "304B"-Angabe, die in manchen Modell-Widgets auftaucht; laut Konfiguration sind es 284B.
GPT-5.6 hat geschlossene Gewichte, drei Stufen, ein gemeinsames Datenblatt. Alle drei bieten 1.050.000 Kontext, 128.000 maximalen Output und einen Wissensstand vom 16. Februar 2026, mit Text- und Bildeingabe.
| DeepSeek V4 Flash | GPT-5.6 (alle Stufen) | |
|---|---|---|
| Gewichte | MIT, offen, ~167GB | Geschlossen |
| Parameter | 284B gesamt / 13B aktiv | Nicht veröffentlicht |
| Kontext | 1M | 1.050.000 |
| Max. Output | 384K | 128.000 |
| Bildeingabe | Nicht dokumentiert | Ja |
| Websuche | Nicht dokumentiert | Ja |
| Wissensstand | Nicht veröffentlicht | 16. Feb. 2026 |
| Denkmodus | Standardmäßig an, drei Reasoning-Stufen | Reasoning-Token unterstützt |
| Cache-Rabatt | ~98% | 90% |
| Nebenläufigkeit | 2.500 | Je nach Stufe, 500 bis 30.000 RPM |
Zwei Eigenheiten, die man vor dem Schreiben der Konfiguration kennen sollte. Bei Flash wird xhigh stillschweigend als high behandelt, sodass sich ab einem gewissen Punkt das Reasoning nicht weiter hochdrehen lässt. Bei GPT-5.6 hat Fast Mode am selben 30. Juli Priority Processing ersetzt und verdoppelt die Rate für "up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."
Wer offene Gewichte breiter abwägt: kleine Sprachmodelle und Open-Source-Agenten sind die beiden Vergleiche, nach denen ich neben diesem am häufigsten gefragt werde.
Der Benchmark-Befund: unentschieden unten, echter Abstand oben
Im Artificial Analysis Intelligence Index v4.1 liegt Flash bei 50, dem dritten Platz unter den Open-Weights-Modellen, hinter Kimi K3 mit 57 und GLM 5.2 mit 51. Luna liegt bei 51, Terra bei 55, Sol bei 59, und Sol landet in der Gesamttabelle auf Platz drei, hinter zwei Claude-Modellen. Artificial Analysis fasste die Kostenseite am Launch-Tag so zusammen:
"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."
Die menschliche Präferenz erzählt eine andere Geschichte als der Gesamtwert. Im LMArena-Text-Ranking erreicht deepseek-v4-flash 1436 ±4 bei 48.667 Stimmen auf Platz 79, während gpt-5.6-sol-xhigh insgesamt auf Platz 15 steht. Bei WebDev liegt deepseek-v4-flash-high mit 1577 auf Platz 8, Sol mit 1620 auf Platz 6. Das günstige offene Modell ist also im automatisierten Index konkurrenzfähig und im menschlichen Blindvergleich deutlich im Rückstand, was ungefähr zu erwarten war und laut ausgesprochen werden sollte.
Drei Vorbehalte, ohne die ich diesen Beitrag nicht veröffentlichen würde.
- DeepSeeks eigenes Diagramm ist eine Auswahl. Wie es eine besonnene Einschätzung formulierte, ist der Vergleich "is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge" (Dr. Tomislav Marinovic, X).
- Der Sprung weckte Misstrauen. DeepSWE stieg bei unveränderter Parameterzahl von 7,3 auf 54,4, und ein KI-Account sagte unumwunden, dass ein reiner Score-Sprung direkt nach einem Update nach Benchmaxxing aussieht, da der frühere niedrige DeepSWE-Wert genau das offenlegte, was am vorherigen Build faul war.
- Flash ist wortreich und halluziniert immer noch. Artificial Analysis maß 210M Output-Token, um den Index gegen einen Klassenmedian von 100M laufen zu lassen, und beziffert die AA-Omniscience-Halluzinationsrate mit 84 %, 12 Punkte niedriger als beim Vorgänger. Luna ist ebenfalls wortreich, mit 130M Token gegenüber einem Median von 62M. Wenn dir eine dieser Zahlen wichtig ist, sind meine Notizen zur Vermeidung von Halluzinationen die praktische Version.
Was es bei deiner Workload wirklich kostet
Preistabellen führen in die Irre, weil sich das Verhältnis zwischen zwei Modellen mit der Form des Traffics ändert, nicht nur mit seinem Volumen. Gecachter Input verschiebt es, output-lastiges Reasoning verschiebt es, und lange Prompts ebenfalls. Wähl das Profil, das deinem am ähnlichsten sieht.
Die Zahl, die ich mitnehmen würde, ist die unspektakuläre. Über alle Formen hinweg ist Flash etwa 3x günstiger als Luna, nicht das 4-Fache, das die Output-Spalte suggeriert. Ein Kommentator auf Hacker News hat denselben Trade-off aus der Kosten-pro-Aufgabe-Spalte beziffert und es gut auf den Punkt gebracht: "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference" (spwa4, Hacker News). Ein anderer stellte die Preistabellen nebeneinander und kam zum gleichen Achselzucken:
"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."
Wo der Listenpreis aufhört, der Preis zu sein
Vier Dinge bewegen die tatsächliche Rechnung, und zwischen den beiden Anbietern sind sie überhaupt nicht symmetrisch.
GPT-5.6 hat bei 272K Input-Token eine Klippe. Jede GPT-5.6-Modellseite formuliert es identisch: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." Wird die Grenze überschritten, wird der gesamte Aufruf neu bepreist, sodass eine Sol-Anfrage von $5 und $30 auf $10 und $45 springt. Für Flashs 1M-Fenster gibt es kein veröffentlichtes Äquivalent, was es zur stabileren Wahl für Prompts mit ganzen Repositories oder ganzen Verläufen macht. Das ist auch ein gutes Argument für Retrieval statt Vollstopfen bei beiden Modellen.

DeepSeek plant einen 2x-Aufschlag zur Spitzenzeit. Die Preistabelle sagt, die API "will soon adopt a peak/off-peak pricing policy", bei der "during peak hours, prices will be 2x the regular prices, applicable to all billing items" gilt, mit dem Zeitfenster von 9:00 bis 12:00 und 14:00 bis 18:00 Uhr Pekinger Zeit, also 01:00 bis 04:00 und 06:00 bis 10:00 Uhr UTC. Es gibt kein angekündigtes Startdatum und keine veröffentlichte Peak-Preistabelle, also besser als Risiko für synchronen Traffic behandeln, nicht als feste Zahl.
Caching ist dort, wo DeepSeeks Vorteil am größten und am wenigsten verlässlich ist. Der Cache-Treffer-Rabatt von ~98 % schlägt die 90 %, die OpenAI und der Großteil der Branche bieten, und ist standardmäßig ohne Codeänderung aktiv. Der Haken liegt in der Mechanik: Eine Anfrage wird nur zum Treffer-Tarif abgerechnet, wenn sie vollständig mit einer persistierten Cache-Präfix-Einheit übereinstimmt, das Caching ist ausdrücklich Best Effort, und Einträge werden "usually within a few hours to a few days" gelöscht, sobald sie nicht mehr genutzt werden. Rechne nicht mit $0,0028 als Dauerzustand.
Drittanbieter-Abrechnung kann überraschen. Ein Nutzer berichtete von der drastischsten Version davon: "The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff" (onlyrealcuzzo, Hacker News). Es gibt 11 Anbieter, die Flash über OpenRouter bereitstellen, und DeepSeek selbst ist nicht der günstigste davon, weshalb sich ein Blick auf die Abrechnung je Anbieter lohnt, bevor man einen Loop skaliert.
Was Nutzer tatsächlich zahlen
Das ist mein Lieblingsteil der DeepSeek-Reaktionen, weil dort Leute Belege statt Meinungen posten. Zwei davon tauchten unaufgefordert im Launch-Thread auf.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:
$19.27 USDAPI requests: 7,877Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."
Man beachte, was der zweite Post zugibt: Die schwindelerregende Token-Zahl ist deshalb günstig, weil sie cache-lastig ist, genau das erste Profil im Widget oben. Ein dritter Nutzer, der einen 30-Turn-Agenten-Harness laufen ließ, bezifferte eine Session mit "~$0.5 cost" und sagte, sein Opus-Abo seit Wochen nicht angerührt zu haben (kmarc, Hacker News).
Auf der anderen Seite kam GPT-5.6s Preissenkung mit öffentlich genannten Kundenzahlen, das Nächste, was OpenAI an einem solchen Beleg hat. Notions KI-Produktleiter sagte, das neuere Modell habe "delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time", und Blitzys CTO berichtete, Luna "handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini", nachdem man von einem einzelnen strukturierten Output-Call auf einen vollständigen Agenten-Loop umgestiegen war. Beides ist von den Anbietern veröffentlicht, also eher als Richtwert lesen und nicht als unabhängige Verifizierung.
Die Fähigkeitslücken, die es wirklich entscheiden
Wer bis hierhin erwartet hat, dass der Preis alles entscheidet, hier kommt die Wende. Die zwei Dinge, die diesen Vergleich für die meisten Teams entscheiden, stehen nicht auf der Preisseite.
Flash kann nicht sehen und nicht suchen. Es gibt keine dokumentierte Bildeingabe, und Websuche ist nicht Teil der API. Nutzer umgehen das, indem sie Modelle kombinieren statt eines zu wählen, ein Muster, das ich übernehmen würde: "Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly" (theturtletalks, Hacker News). Wenn deine Support-Warteschlange voller Screenshots ist, beendet diese Lücke die Diskussion von allein.
Geschwindigkeit ist auf der einen Seite ungemessen, auf der anderen veröffentlicht. Artificial Analysis listet Flashs Reasoning-Variante ohne Output-Geschwindigkeit, ohne Time-to-First-Token und ohne Gesamtantwortzeit und markiert die Geschwindigkeit mit "Unknown out of 4 units". Die Nicht-Reasoning-Variante hat Zahlen, bei 107 Token pro Sekunde. Luna läuft mit 177,8 Token pro Sekunde, Terra mit 138. Sol ist der Ausreißer: 67,7 Token pro Sekunde und 137,84s Time-to-First-Token, unter dem Median seiner eigenen Preisstufe, gut zu wissen, bevor man es hinter etwas Interaktives stellt.

Offene Gewichte sind hier eine echte Option, und die Rechnung sagt meistens: lieber nicht. Flash läuft lokal, und die Berichte sind detailliert: 60 Token pro Sekunde in einer Einzelsitzung auf zwei DGX Sparks, ~30 auf einem M3 Ultra mit 256GB, 32 auf einem Ryzen AI MAX+ 395 bei etwa 2,88 Bit pro Parameter. Das Problem ist die Hardware-Rechnung, rund 8.200 € für das Doppel-Spark-Setup. Das Konsens-Urteil von jemandem, der nachgerechnet hat: "it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons" (cmrdporcupine, Hacker News). Datenschutz ist allerdings keine kleine Ausnahme, was uns zum letzten Punkt bringt.
Datenspeicherung ist der Einwand, der immer wieder gewinnt. Die am häufigsten wiederholte Beschwerde über Flash betrifft nicht die Qualität:
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."
Rechnet man das durch die Preistabelle, verpufft der Hauptvorteil. Aus Flashs $0,28-Output werden $0,84 bis $1,40, dieselbe Bandbreite wie Lunas $1,20, und Luna kommt mit Bildverarbeitung, Suche und einem dokumentierten Latenzprofil. Wenn deine Token Kundendaten enthalten, sind die Geschichte vom günstigen Modell und die Geschichte vom sicheren Modell dieselbe Geschichte.

Mein Urteil
Wähle DeepSeek V4 Flash für Massentextarbeit, bei der du die Daten selbst besitzt: Coding-Agenten, Code-Reviews, Zusammenfassungen, Klassifizierung, lange gecachte Präfixe, alles, was du gern über 30 Turns laufen lassen würdest. Aktuell ist es die beste Intelligenz pro Dollar in der Tabelle, und die oben genannten Belege stützen das. Es ist auch die richtige Wahl, wenn dir offene Gewichte wichtig sind, weil Lizenz und Hugging-Face-Gewichte real sind statt nur versprochen.
Wähle GPT-5.6 Luna, wenn du Bilder oder Suche brauchst, wenn Latenz für Nutzer sichtbar ist, oder wenn du ohnehin über einen Zero-Retention-Host routen wolltest, denn dann zahlst du Lunas Preis für weniger Fähigkeiten. Wähle Sol nur, wenn die Aufgabe wirklich die Spitze der Tabelle braucht, und prüfe seine Time-to-First-Token, bevor es in die Nähe eines Chatfensters kommt. Passt keines davon, deckt GPT-5.6-Alternativen den Rest des Feldes ab, und meine GPT-5.6-Rezension hat die Details nach Stufen.
Oder nutze beide, was die meisten Teams, die darüber schreiben, tatsächlich tun. Route Massentext zu Flash, Screenshots und Suche zu Luna, und behalte die Routing-Logik im eigenen Code, damit der nächste Preisschnitt nur eine Konfigurationsänderung ist. Das kommt dem, wie ich es bauen würde, viel näher als eine Wette auf ein einzelnes Modell, und es ist derselbe Instinkt hinter der Ticket-Klassifizierung, die auf einem günstigeren Modell läuft als dem, das die Antwort entwirft.
eesel ausprobieren
Hier ist das, was dieser Vergleich für dich nicht beantworten kann: das Modell macht etwa 2 % eines gelösten Support-Tickets aus. Ich baue Integrationen bei eesel, und was wirklich entscheidet, ob ein KI-Agent ein Ticket löst oder den Kunden nur nervt, ist Retrieval über dein eigenes Help Center, dazu Eskalationsregeln, die wissen, wann sie aufhören müssen, und dann ein Rollout, das gegen deine eigene Ticket-Historie getestet wurde, bevor es je ein Kunde sieht. Wir haben zugesehen, wie selbstsicher klingende Bots falsche Antworten geben, deshalb simulieren wir jeden Rollout zuerst an vergangenen Tickets, statt anhand eines Benchmark-Werts auszuliefern.
Auch die Wirtschaftlichkeit ist keine Token-Wirtschaftlichkeit. Die reinen Token-Kosten einer Support-Antwort auf Flash runden sich praktisch auf null; was auf deiner Rechnung erscheint, sind die Kosten pro Lösung, und eesel berechnet pro Ticket ohne Gebühr pro Sitzplatz, sodass ein guter Monat für deine KI keine Strafe ist. Ein Gridwise-Verantwortlicher brachte das Ergebnis klar auf den Punkt: "In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." Eine CX-Verantwortliche bei einer Direct-to-Consumer-Nahrungsergänzungsmittelmarke formulierte die Vertrauensseite genau so, wie ich es tun würde: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Wenn du einen KI-Agenten auf Zendesk oder Freshdesk willst, der dein Help Center schon kennt, sich in einer Kaffeepause einbinden lässt und vor der ersten Antwort an einen Kunden im Trockentest an den Tickets des letzten Quartals laufen kann, dann ist genau das, was wir gebaut haben. Kostenlos zum Ausprobieren, und die Simulation ist der Teil, den ich zuerst nutzen würde.

Lesenswert als Nächstes, wenn du speziell für den Support ein Modell auswählst: welches LLM zum Support passt, domänenspezifische LLMs, und die ehrliche Version der Kosten von KI-Support.
Häufig gestellte Fragen
Ist DeepSeek V4 Flash besser als GPT-5.6?
Wie viel günstiger ist DeepSeek V4 Flash als GPT-5.6?
Unterstützt DeepSeek V4 Flash Bilder wie GPT-5.6?
Wie groß ist das Kontextfenster von DeepSeek V4 Flash im Vergleich zu GPT-5.6?
Ist DeepSeek V4 Flash sicher für Kundendaten?
Welches Modell ist schneller, DeepSeek V4 Flash oder GPT-5.6?
Sollte ich DeepSeek V4 Flash oder GPT-5.6 für den Kundensupport verwenden?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








