DeepSeek V4 Flash vs GPT-5.6: Worauf solltest du setzen?

Rama Adi Nugraha
Geschrieben von

Rama Adi Nugraha

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet August 4, 2026

Expertengeprüft
Zwei Menschen armdrücken sich über einen Tisch, während eine dritte Person zusieht, als Sinnbild für einen direkten Modellvergleich

Der Kampf ist Flash gegen Luna, nicht gegen Sol

GPT-5.6 sind drei Modelle, nicht eines, und der Alias gpt-5.6 leitet einfach zu Sol weiter. Deshalb lesen sich viele Vergleiche seltsam. Sie stellen DeepSeeks günstige Stufe gegen OpenAIs teuerste und schließen dann, dass günstige Modelle günstig sind.

Hier die komplette Preistabelle im aktuellen Stand, Standardstufe, kurzer Kontext, pro Million Token.

ModellInputGecachter InputOutputAA Intelligence Index
deepseek-v4-flash$0,14$0,0028$0,2850
gpt-5.6-luna$0,20$0,02$1,2051
gpt-5.6-terra$2,00$0,20$12,0055
gpt-5.6-sol$5,00$0,50$30,0059
deepseek-v4-pro$0,435$0,003625$0,8744

Preise von der Preistabelle von DeepSeek und der OpenAI-Preisseite; Indexwerte von Artificial Analysis. Achte auf die letzte Zeile, das ist eine eigene Geschichte: DeepSeeks teure Stufe schneidet inzwischen schlechter ab als die günstige, und warum das so ist, habe ich in Flash gegen Pro untersucht.

DeepSeeks Modelle- und Preisseite mit deepseek-v4-flash und deepseek-v4-pro in benachbarten Spalten, entnommen aus der DeepSeek-API-Dokumentation
DeepSeeks Modelle- und Preisseite mit deepseek-v4-flash und deepseek-v4-pro in benachbarten Spalten, entnommen aus der DeepSeek-API-Dokumentation

Der Preisschnitt vom 30. Juli ist der Grund, warum dieser Beitrag überhaupt existiert. OpenAI senkte Terra um 20 % und Luna um 80 % in einer einzigen Ankündigung: "Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." Jeder Vergleich, der Luna noch mit $1,00 und $6,00 zitiert, liegt um das 5-Fache daneben. Für die Aufschlüsselung nach Stufen habe ich GPT-5.6 Sol und GPT-5.6 Terra separat behandelt.

Output-Preis pro Million Token bei DeepSeek V4 Flash, GPT-5.6 Luna, Terra und Sol
Output-Preis pro Million Token bei DeepSeek V4 Flash, GPT-5.6 Luna, Terra und Sol

Was jedes Modell tatsächlich ist

Flash ist ein spärliches Mixture-of-Experts-Modell, 284B Parameter insgesamt und 13B aktiv, unter MIT-Lizenz veröffentlicht, was bedeutet, dass die Gewichte auf Hugging Face liegen und man sie frei selbst betreiben kann. Das vLLM-Team beschrieb die Architektur am Erscheinungstag: "A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." Ignoriere die "304B"-Angabe, die in manchen Modell-Widgets auftaucht; laut Konfiguration sind es 284B.

GPT-5.6 hat geschlossene Gewichte, drei Stufen, ein gemeinsames Datenblatt. Alle drei bieten 1.050.000 Kontext, 128.000 maximalen Output und einen Wissensstand vom 16. Februar 2026, mit Text- und Bildeingabe.

DeepSeek V4 FlashGPT-5.6 (alle Stufen)
GewichteMIT, offen, ~167GBGeschlossen
Parameter284B gesamt / 13B aktivNicht veröffentlicht
Kontext1M1.050.000
Max. Output384K128.000
BildeingabeNicht dokumentiertJa
WebsucheNicht dokumentiertJa
WissensstandNicht veröffentlicht16. Feb. 2026
DenkmodusStandardmäßig an, drei Reasoning-StufenReasoning-Token unterstützt
Cache-Rabatt~98%90%
Nebenläufigkeit2.500Je nach Stufe, 500 bis 30.000 RPM

Zwei Eigenheiten, die man vor dem Schreiben der Konfiguration kennen sollte. Bei Flash wird xhigh stillschweigend als high behandelt, sodass sich ab einem gewissen Punkt das Reasoning nicht weiter hochdrehen lässt. Bei GPT-5.6 hat Fast Mode am selben 30. Juli Priority Processing ersetzt und verdoppelt die Rate für "up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."

Wer offene Gewichte breiter abwägt: kleine Sprachmodelle und Open-Source-Agenten sind die beiden Vergleiche, nach denen ich neben diesem am häufigsten gefragt werde.

Der Benchmark-Befund: unentschieden unten, echter Abstand oben

Im Artificial Analysis Intelligence Index v4.1 liegt Flash bei 50, dem dritten Platz unter den Open-Weights-Modellen, hinter Kimi K3 mit 57 und GLM 5.2 mit 51. Luna liegt bei 51, Terra bei 55, Sol bei 59, und Sol landet in der Gesamttabelle auf Platz drei, hinter zwei Claude-Modellen. Artificial Analysis fasste die Kostenseite am Launch-Tag so zusammen:

"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."

Die menschliche Präferenz erzählt eine andere Geschichte als der Gesamtwert. Im LMArena-Text-Ranking erreicht deepseek-v4-flash 1436 ±4 bei 48.667 Stimmen auf Platz 79, während gpt-5.6-sol-xhigh insgesamt auf Platz 15 steht. Bei WebDev liegt deepseek-v4-flash-high mit 1577 auf Platz 8, Sol mit 1620 auf Platz 6. Das günstige offene Modell ist also im automatisierten Index konkurrenzfähig und im menschlichen Blindvergleich deutlich im Rückstand, was ungefähr zu erwarten war und laut ausgesprochen werden sollte.

Drei Vorbehalte, ohne die ich diesen Beitrag nicht veröffentlichen würde.

  • DeepSeeks eigenes Diagramm ist eine Auswahl. Wie es eine besonnene Einschätzung formulierte, ist der Vergleich "is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge" (Dr. Tomislav Marinovic, X).
  • Der Sprung weckte Misstrauen. DeepSWE stieg bei unveränderter Parameterzahl von 7,3 auf 54,4, und ein KI-Account sagte unumwunden, dass ein reiner Score-Sprung direkt nach einem Update nach Benchmaxxing aussieht, da der frühere niedrige DeepSWE-Wert genau das offenlegte, was am vorherigen Build faul war.
  • Flash ist wortreich und halluziniert immer noch. Artificial Analysis maß 210M Output-Token, um den Index gegen einen Klassenmedian von 100M laufen zu lassen, und beziffert die AA-Omniscience-Halluzinationsrate mit 84 %, 12 Punkte niedriger als beim Vorgänger. Luna ist ebenfalls wortreich, mit 130M Token gegenüber einem Median von 62M. Wenn dir eine dieser Zahlen wichtig ist, sind meine Notizen zur Vermeidung von Halluzinationen die praktische Version.

Was es bei deiner Workload wirklich kostet

Preistabellen führen in die Irre, weil sich das Verhältnis zwischen zwei Modellen mit der Form des Traffics ändert, nicht nur mit seinem Volumen. Gecachter Input verschiebt es, output-lastiges Reasoning verschiebt es, und lange Prompts ebenfalls. Wähl das Profil, das deinem am ähnlichsten sieht.

Monatliche API-Rechnung bei 100M Token

Gleiches Gesamtvolumen, drei unterschiedliche Traffic-Formen, Listenpreise Stand 4. August 2026.

80M gecachter Input, 15M frischer Input, 5M Output. Die Form, die entsteht, wenn ein langer System-Prompt tausendfach genutzt wird.

V4 Flash, direkte API$3.72
GPT-5.6 Luna$10.60
V4 Flash, Zero-Retention-Host$11.17
GPT-5.6 Sol$265.00

Hier ist Flash 2,8-mal günstiger als Luna, und der Vorteil verschwindet, sobald Zero Retention nötig wird.

10M gecachter Input, 20M frischer Input, 30M Output. Thinking ist bei beiden Modellen standardmäßig an, und Reasoning-Token werden als Output abgerechnet.

V4 Flash, direkte API$11.23
V4 Flash, Zero-Retention-Host$33.68
GPT-5.6 Luna$40.20
GPT-5.6 Sol$1,005.00

Bei output-lastiger Arbeit zeigt sich die 4,3-fache Lücke bei der Output-Rate: Flash ist 3,6-mal günstiger und liegt selbst bei einem privaten Host vorn.

50M frischer Input, 5M Output, jeder Prompt über 272K Token. GPT-5.6 bepreist ab dann die gesamte Anfrage neu.

V4 Flash, direkte API$8.40
V4 Flash, Zero-Retention-Host$25.20
GPT-5.6 Luna, langer Kontext$29.00
GPT-5.6 Sol, langer Kontext$725.00

Die Long-Context-Stufe ist eine Verdopplung, kein Aufschlag nur auf den Überhang, weshalb sich hier Flashs flache Preisstruktur auszahlt.

Die Zahl, die ich mitnehmen würde, ist die unspektakuläre. Über alle Formen hinweg ist Flash etwa 3x günstiger als Luna, nicht das 4-Fache, das die Output-Spalte suggeriert. Ein Kommentator auf Hacker News hat denselben Trade-off aus der Kosten-pro-Aufgabe-Spalte beziffert und es gut auf den Punkt gebracht: "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference" (spwa4, Hacker News). Ein anderer stellte die Preistabellen nebeneinander und kam zum gleichen Achselzucken:

Hacker News

"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."

Wo der Listenpreis aufhört, der Preis zu sein

Vier Dinge bewegen die tatsächliche Rechnung, und zwischen den beiden Anbietern sind sie überhaupt nicht symmetrisch.

GPT-5.6 hat bei 272K Input-Token eine Klippe. Jede GPT-5.6-Modellseite formuliert es identisch: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." Wird die Grenze überschritten, wird der gesamte Aufruf neu bepreist, sodass eine Sol-Anfrage von $5 und $30 auf $10 und $45 springt. Für Flashs 1M-Fenster gibt es kein veröffentlichtes Äquivalent, was es zur stabileren Wahl für Prompts mit ganzen Repositories oder ganzen Verläufen macht. Das ist auch ein gutes Argument für Retrieval statt Vollstopfen bei beiden Modellen.

Wie sich der Preis verhält, wenn Prompts länger werden, wobei GPT-5.6 bei 272K Input-Token stufenweise steigt und DeepSeek V4 Flash bis 1M konstant bleibt
Wie sich der Preis verhält, wenn Prompts länger werden, wobei GPT-5.6 bei 272K Input-Token stufenweise steigt und DeepSeek V4 Flash bis 1M konstant bleibt

DeepSeek plant einen 2x-Aufschlag zur Spitzenzeit. Die Preistabelle sagt, die API "will soon adopt a peak/off-peak pricing policy", bei der "during peak hours, prices will be 2x the regular prices, applicable to all billing items" gilt, mit dem Zeitfenster von 9:00 bis 12:00 und 14:00 bis 18:00 Uhr Pekinger Zeit, also 01:00 bis 04:00 und 06:00 bis 10:00 Uhr UTC. Es gibt kein angekündigtes Startdatum und keine veröffentlichte Peak-Preistabelle, also besser als Risiko für synchronen Traffic behandeln, nicht als feste Zahl.

Caching ist dort, wo DeepSeeks Vorteil am größten und am wenigsten verlässlich ist. Der Cache-Treffer-Rabatt von ~98 % schlägt die 90 %, die OpenAI und der Großteil der Branche bieten, und ist standardmäßig ohne Codeänderung aktiv. Der Haken liegt in der Mechanik: Eine Anfrage wird nur zum Treffer-Tarif abgerechnet, wenn sie vollständig mit einer persistierten Cache-Präfix-Einheit übereinstimmt, das Caching ist ausdrücklich Best Effort, und Einträge werden "usually within a few hours to a few days" gelöscht, sobald sie nicht mehr genutzt werden. Rechne nicht mit $0,0028 als Dauerzustand.

Drittanbieter-Abrechnung kann überraschen. Ein Nutzer berichtete von der drastischsten Version davon: "The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff" (onlyrealcuzzo, Hacker News). Es gibt 11 Anbieter, die Flash über OpenRouter bereitstellen, und DeepSeek selbst ist nicht der günstigste davon, weshalb sich ein Blick auf die Abrechnung je Anbieter lohnt, bevor man einen Loop skaliert.

Was Nutzer tatsächlich zahlen

Das ist mein Lieblingsteil der DeepSeek-Reaktionen, weil dort Leute Belege statt Meinungen posten. Zwei davon tauchten unaufgefordert im Launch-Thread auf.

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886"
Hacker News

"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:

$19.27 USD
API requests: 7,877
Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."

Man beachte, was der zweite Post zugibt: Die schwindelerregende Token-Zahl ist deshalb günstig, weil sie cache-lastig ist, genau das erste Profil im Widget oben. Ein dritter Nutzer, der einen 30-Turn-Agenten-Harness laufen ließ, bezifferte eine Session mit "~$0.5 cost" und sagte, sein Opus-Abo seit Wochen nicht angerührt zu haben (kmarc, Hacker News).

Auf der anderen Seite kam GPT-5.6s Preissenkung mit öffentlich genannten Kundenzahlen, das Nächste, was OpenAI an einem solchen Beleg hat. Notions KI-Produktleiter sagte, das neuere Modell habe "delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time", und Blitzys CTO berichtete, Luna "handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini", nachdem man von einem einzelnen strukturierten Output-Call auf einen vollständigen Agenten-Loop umgestiegen war. Beides ist von den Anbietern veröffentlicht, also eher als Richtwert lesen und nicht als unabhängige Verifizierung.

Die Fähigkeitslücken, die es wirklich entscheiden

Wer bis hierhin erwartet hat, dass der Preis alles entscheidet, hier kommt die Wende. Die zwei Dinge, die diesen Vergleich für die meisten Teams entscheiden, stehen nicht auf der Preisseite.

Flash kann nicht sehen und nicht suchen. Es gibt keine dokumentierte Bildeingabe, und Websuche ist nicht Teil der API. Nutzer umgehen das, indem sie Modelle kombinieren statt eines zu wählen, ein Muster, das ich übernehmen würde: "Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly" (theturtletalks, Hacker News). Wenn deine Support-Warteschlange voller Screenshots ist, beendet diese Lücke die Diskussion von allein.

Geschwindigkeit ist auf der einen Seite ungemessen, auf der anderen veröffentlicht. Artificial Analysis listet Flashs Reasoning-Variante ohne Output-Geschwindigkeit, ohne Time-to-First-Token und ohne Gesamtantwortzeit und markiert die Geschwindigkeit mit "Unknown out of 4 units". Die Nicht-Reasoning-Variante hat Zahlen, bei 107 Token pro Sekunde. Luna läuft mit 177,8 Token pro Sekunde, Terra mit 138. Sol ist der Ausreißer: 67,7 Token pro Sekunde und 137,84s Time-to-First-Token, unter dem Median seiner eigenen Preisstufe, gut zu wissen, bevor man es hinter etwas Interaktives stellt.

Ein Routing-Diagramm, das Massentext- und Cache-Arbeit an DeepSeek V4 Flash schickt und Bild-, Such- und latenzkritische Arbeit an GPT-5.6 Luna
Ein Routing-Diagramm, das Massentext- und Cache-Arbeit an DeepSeek V4 Flash schickt und Bild-, Such- und latenzkritische Arbeit an GPT-5.6 Luna

Offene Gewichte sind hier eine echte Option, und die Rechnung sagt meistens: lieber nicht. Flash läuft lokal, und die Berichte sind detailliert: 60 Token pro Sekunde in einer Einzelsitzung auf zwei DGX Sparks, ~30 auf einem M3 Ultra mit 256GB, 32 auf einem Ryzen AI MAX+ 395 bei etwa 2,88 Bit pro Parameter. Das Problem ist die Hardware-Rechnung, rund 8.200 € für das Doppel-Spark-Setup. Das Konsens-Urteil von jemandem, der nachgerechnet hat: "it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons" (cmrdporcupine, Hacker News). Datenschutz ist allerdings keine kleine Ausnahme, was uns zum letzten Punkt bringt.

Datenspeicherung ist der Einwand, der immer wieder gewinnt. Die am häufigsten wiederholte Beschwerde über Flash betrifft nicht die Qualität:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."

Rechnet man das durch die Preistabelle, verpufft der Hauptvorteil. Aus Flashs $0,28-Output werden $0,84 bis $1,40, dieselbe Bandbreite wie Lunas $1,20, und Luna kommt mit Bildverarbeitung, Suche und einem dokumentierten Latenzprofil. Wenn deine Token Kundendaten enthalten, sind die Geschichte vom günstigen Modell und die Geschichte vom sicheren Modell dieselbe Geschichte.

Drei Schritte, die zeigen, wie der Output-Preis von DeepSeek V4 Flash bei 28 Cent über einen Zero-Retention-Host auf 84 Cent bis 1,40 Dollar steigt und damit GPT-5.6 Lunas Preisband erreicht
Drei Schritte, die zeigen, wie der Output-Preis von DeepSeek V4 Flash bei 28 Cent über einen Zero-Retention-Host auf 84 Cent bis 1,40 Dollar steigt und damit GPT-5.6 Lunas Preisband erreicht

Mein Urteil

Wähle DeepSeek V4 Flash für Massentextarbeit, bei der du die Daten selbst besitzt: Coding-Agenten, Code-Reviews, Zusammenfassungen, Klassifizierung, lange gecachte Präfixe, alles, was du gern über 30 Turns laufen lassen würdest. Aktuell ist es die beste Intelligenz pro Dollar in der Tabelle, und die oben genannten Belege stützen das. Es ist auch die richtige Wahl, wenn dir offene Gewichte wichtig sind, weil Lizenz und Hugging-Face-Gewichte real sind statt nur versprochen.

Wähle GPT-5.6 Luna, wenn du Bilder oder Suche brauchst, wenn Latenz für Nutzer sichtbar ist, oder wenn du ohnehin über einen Zero-Retention-Host routen wolltest, denn dann zahlst du Lunas Preis für weniger Fähigkeiten. Wähle Sol nur, wenn die Aufgabe wirklich die Spitze der Tabelle braucht, und prüfe seine Time-to-First-Token, bevor es in die Nähe eines Chatfensters kommt. Passt keines davon, deckt GPT-5.6-Alternativen den Rest des Feldes ab, und meine GPT-5.6-Rezension hat die Details nach Stufen.

Oder nutze beide, was die meisten Teams, die darüber schreiben, tatsächlich tun. Route Massentext zu Flash, Screenshots und Suche zu Luna, und behalte die Routing-Logik im eigenen Code, damit der nächste Preisschnitt nur eine Konfigurationsänderung ist. Das kommt dem, wie ich es bauen würde, viel näher als eine Wette auf ein einzelnes Modell, und es ist derselbe Instinkt hinter der Ticket-Klassifizierung, die auf einem günstigeren Modell läuft als dem, das die Antwort entwirft.

eesel ausprobieren

Hier ist das, was dieser Vergleich für dich nicht beantworten kann: das Modell macht etwa 2 % eines gelösten Support-Tickets aus. Ich baue Integrationen bei eesel, und was wirklich entscheidet, ob ein KI-Agent ein Ticket löst oder den Kunden nur nervt, ist Retrieval über dein eigenes Help Center, dazu Eskalationsregeln, die wissen, wann sie aufhören müssen, und dann ein Rollout, das gegen deine eigene Ticket-Historie getestet wurde, bevor es je ein Kunde sieht. Wir haben zugesehen, wie selbstsicher klingende Bots falsche Antworten geben, deshalb simulieren wir jeden Rollout zuerst an vergangenen Tickets, statt anhand eines Benchmark-Werts auszuliefern.

Auch die Wirtschaftlichkeit ist keine Token-Wirtschaftlichkeit. Die reinen Token-Kosten einer Support-Antwort auf Flash runden sich praktisch auf null; was auf deiner Rechnung erscheint, sind die Kosten pro Lösung, und eesel berechnet pro Ticket ohne Gebühr pro Sitzplatz, sodass ein guter Monat für deine KI keine Strafe ist. Ein Gridwise-Verantwortlicher brachte das Ergebnis klar auf den Punkt: "In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." Eine CX-Verantwortliche bei einer Direct-to-Consumer-Nahrungsergänzungsmittelmarke formulierte die Vertrauensseite genau so, wie ich es tun würde: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Wenn du einen KI-Agenten auf Zendesk oder Freshdesk willst, der dein Help Center schon kennt, sich in einer Kaffeepause einbinden lässt und vor der ersten Antwort an einen Kunden im Trockentest an den Tickets des letzten Quartals laufen kann, dann ist genau das, was wir gebaut haben. Kostenlos zum Ausprobieren, und die Simulation ist der Teil, den ich zuerst nutzen würde.

Das eesel-AI-Dashboard, in dem ein KI-Teammitglied Support-Tickets entwirft und löst
Das eesel-AI-Dashboard, in dem ein KI-Teammitglied Support-Tickets entwirft und löst

Lesenswert als Nächstes, wenn du speziell für den Support ein Modell auswählst: welches LLM zum Support passt, domänenspezifische LLMs, und die ehrliche Version der Kosten von KI-Support.

Häufig gestellte Fragen

Ist DeepSeek V4 Flash besser als GPT-5.6?
Das hängt davon ab, welche GPT-5.6-Stufe gemeint ist, und genau das ist der Kniff dieses Vergleichs. Gegen GPT-5.6 Luna liegen beide gleichauf: Artificial Analysis vergibt 50 Punkte an Flash und 51 an Luna. Gegen GPT-5.6 Sol mit 59 Punkten verliert Flash bei der Intelligenz, gewinnt aber beim Preis um etwa das 107-Fache bei Output-Tokens. Für das breitere Bild siehe meine Notizen zur Wahl eines LLM für den Support.
Wie viel günstiger ist DeepSeek V4 Flash als GPT-5.6?
Flash kostet $0,14 pro Million Input-Token ohne Cache-Treffer und $0,28 für Output. GPT-5.6 Luna kostet $0,20 und $1,20, Terra $2 und $12, und Sol $5 und $30. Bei realen Workloads pendelt sich der Abstand zu Luna eher bei etwa 3x ein statt bei den 4x, die die Output-Rate nahelegt, weil Lunas gecachter Input ebenfalls günstig ist. Meine GPT-5.6-Preisübersicht zeigt die vollständige Tabelle.
Unterstützt DeepSeek V4 Flash Bilder wie GPT-5.6?
Für V4 Flash ist keine Bildeingabe dokumentiert, und die Konfiguration enthält keinen Vision-Encoder, es geht also nur um Text-Ein- und -Ausgabe. GPT-5.6 verarbeitet Text und Bilder in allen drei Stufen. Genau diese eine Lücke ist der Grund, warum mehrere Teams beide Modelle nutzen, Flash für Massentextarbeit und Luna für Screenshots. Siehe GPT-5.6 Luna für das, was die günstige OpenAI-Stufe abdeckt.
Wie groß ist das Kontextfenster von DeepSeek V4 Flash im Vergleich zu GPT-5.6?
Flash hat 1M Kontext mit einer Output-Obergrenze von 384K. GPT-5.6 hat in allen drei Stufen 1.050.000 Kontext und maximal 128K Output. Der Haken ist, dass jeder GPT-5.6-Prompt über 272K Input-Token für die gesamte Anfrage mit doppeltem Input- und 1,5-fachem Output-Preis abgerechnet wird, weshalb Flash bei langen Prompts die preislich stabilere Option ist. RAG statt langer Prompt ist ohnehin oft die günstigere Antwort.
Ist DeepSeek V4 Flash sicher für Kundendaten?
Nicht über die First-Party-API, und das ist der Einwand, der jede Diskussion darüber dominiert, weil DeepSeek mit dem trainiert, was man einsendet. Zero-Retention-Hoster betreiben dieselben MIT-lizenzierten Gewichte für etwa das 3- bis 5-Fache des Preises, wodurch der größte Teil des Preisvorteils gegenüber GPT-5.6 Luna verschwindet. Wenn es sich um Kundentickets handelt, sieh dir an, wie Support-Automatisierung mit der Datenspeicherung umgeht, bevor du ein Modell wählst.
Welches Modell ist schneller, DeepSeek V4 Flash oder GPT-5.6?
GPT-5.6, zumindest nach den vorhandenen Zahlen. Artificial Analysis veröffentlicht überhaupt keine Geschwindigkeitswerte für die Reasoning-Variante von Flash, während Luna mit 177,8 Token pro Sekunde läuft und Terra mit 138. Ein Kommentator auf Hacker News hat den Trade-off so beziffert: Luna kostet 2 bis 3 Mal mehr für eine 2 bis 5 Mal schnellere Inferenz. Wenn Latenz die entscheidende Größe ist, behandelt mein Leitfaden zur Übergabe, was Nutzer zuerst bemerken.
Sollte ich DeepSeek V4 Flash oder GPT-5.6 für den Kundensupport verwenden?
Für die eigentliche Antwort reicht beides, denn das Modell ist der kleinste Teil eines gelösten Tickets. Entscheidend sind die Qualität der Datenabfrage, die Eskalationsregeln und Tests gegen die eigene Historie, weshalb wir jeden Rollout zuerst an vergangenen Tickets simulieren. Fang bei der Lösungsrate an statt beim Modellblatt, und vergleiche die echten Kosten pro Lösung.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration, die die Modellstufen DeepSeek V4 Flash und V4 Pro vergleicht
Trending

DeepSeek V4 Flash vs V4 Pro: Welche Stufe solltest du nutzen?

Die günstige Stufe von DeepSeek erzielt im unabhängigen Ranking jetzt eine höhere Punktzahl als die teure. Hier siehst du genau, wo das zutrifft, und an welchen zwei Stellen nicht.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird
Trending

DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird

DeepSeek V4 Flash listet mit $0.14 Eingabe und $0.28 Ausgabe pro Million Tokens. Echte Nutzer haben Mischraten unter einem Cent gepostet. Hier ist, was entscheidet, welche davon dich trifft.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt
Trending

DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt

DeepSeek V4 Flash kostet $0,14 pro Million Input-Tokens und $0,28 pro Million Output-Tokens und übertrifft dabei DeepSeeks eigenes teureres Modell. Das steht nicht auf der Preistabelle.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration einer sehr langen Katze, die sich neben zwei Personen streckt, die eine Bewertungskarte prüfen, mit dem LongCat-Logo
Trending

LongCat 2.0 im Test: ein echtes Arbeitstier mit einem harten Blocker

Ich habe LongCat 2.0 anhand von sieben Punkten bewertet, die Käufern wirklich wichtig sind, und dabei Meituans eigene Unterlagen sowie die Erfahrungen von Leuten genutzt, die Milliarden Tokens durch das Modell geschickt haben. Bei sechs davon schneidet es gut ab.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration einer sehr langen Katze, die sich neben einem Serverrack über einen Schreibtisch streckt, mit dem LongCat-Logo
Trending

LongCat 2.0: ein Blick ins 1,6-Billionen-Open-Weight-Modell von Meituan

LongCat 2.0 ist Meituans MIT-lizenziertes 1,6T-MoE-Modell zum Preis von 0,30 US-Dollar pro Million Input-Tokens. Ich habe jede Primärquelle gelesen, um zu sehen, was wirklich geliefert wird.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration zum Vergleich von DeepSeek V4 Flash und Kimi K3 von Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: Welches solltest du nutzen?

Ein Modell kostet pro Aufgabe 29-mal mehr als das andere. Ich habe jede veröffentlichte Zahl zu beiden durchgesehen, und das Interessante ist die mittlere Option, die niemand kaufen sollte.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ein Tester blickt auf eine Bewertungskarte mit zwei Aufwand-Reglern, beschriftet mit niedrig und maximal, neben dem DeepSeek-Wal
Trending

DeepSeek V4 Flash im Test: ein Modell, zwei Persönlichkeiten

Ein DeepSeek V4 Flash Test, der auf den Zahlen beruht, die beide Scoreboards veröffentlichen. Der billige Lauf und der clevere Lauf sind dieselben Gewichte, und das verändert das Urteil.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Illustration, die Alibabas Qwen 3.8 Max gegen DeepSeek V4 Flash abwägt
Trending

Qwen 3.8 Max vs DeepSeek V4 Flash: Preis, Specs, echtes Urteil

Ein Modell kostet 21x mehr pro Output-Token als das andere. Das ist das am wenigsten interessante an diesem Vergleich, und hier ist, was die Specs tatsächlich entscheiden.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Zwei Personen lesen einen großen Nutzungszähler ab und stellen einen Stapel Abrechnungsregler ein, in Metas blauer Markenfarbe
Trending

Meta Muse Spark 1.1 Preise: Die Rechnung hat vier Zähler

Muse Spark 1.1 kostet laut Listenpreis $1,25 Eingabe und $4,25 Ausgabe pro Million Tokens. Vier separate Zähler bestimmen die tatsächliche Rechnung, und der Listenpreis ist der kleinste davon.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten