DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet August 6, 2026

Expertengeprüft
DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird

Die veröffentlichte Preisliste, vollständig

Auf DeepSeeks Models and Pricing-Seite gibt es genau zwei Modelle, und deepseek-v4-flash ist eines davon. Die alten Zeilen deepseek-chat und deepseek-reasoner sind verschwunden. Zwei V4-Modelle, und das ist die gesamte Produktpalette. Ich habe die Liste am Morgen der Erstellung dieses Artikels erneut überprüft.

Pro 1M Tokensdeepseek-v4-flashdeepseek-v4-pro
Eingabe, Cache Hit$0.0028$0.003625
Eingabe, Cache Miss$0.14$0.435
Ausgabe$0.28$0.87
Kontextlänge1M1M
Maximale Ausgabe384K384K
DenkmodusStandardmäßig anStandardmäßig an
Responses APIJaNein
Nebenläufigkeitslimit2,500500
DeepSeeks Models-and-Pricing-Seite mit den Spalten für deepseek-v4-flash und deepseek-v4-pro nebeneinander, wie in DeepSeeks API-Dokumentation veröffentlicht
DeepSeeks Models-and-Pricing-Seite mit den Spalten für deepseek-v4-flash und deepseek-v4-pro nebeneinander, wie in DeepSeeks API-Dokumentation veröffentlicht

Zwei Dinge sind erwähnenswert, bevor die Rechnerei beginnt. Das Kontextfenster und die Ausgabegrenze sind bei beiden Stufen identisch, sodass die Preisdifferenz keinen zusätzlichen Spielraum kauft. Und beide werden mit bereits aktiviertem Denkmodus ausgeliefert, was für die Kosten stark ins Gewicht fällt, da Reasoning-Tokens zur Ausgaberate abgerechnet werden.

Berechne deine eigene effektive Rate

Die aufgeführten Raten sind pro Million. Was dir in Rechnung gestellt wird, ist eine Mischung aus drei davon, gewichtet nach deiner Cache-Hit-Rate und danach, wie viel deines Traffics als Ausgabe endet. Bewege die Schieberegler und schau, was die Mischung macht.

Was die Regler deutlich machen, ist Folgendes. Irgendwo jenseits eines Ausgabeanteils von 40% spielt der Cache kaum noch eine Rolle. Ausgabe trägt überhaupt keine ermäßigte Rate, und bei einem Modell, das standardmäßig denkt, ist Ausgabe genau der Ort, an den deine Tokens fließen.

Multiplikator eins: Der Cache entscheidet alles, und er ist keine Einstellung

Zwischen den beiden Eingaberaten beträgt die Lücke $0.0028 gegen $0.14, genau 50x. Artificial Analysis setzt das in den Branchenkontext, wonach DeepSeeks Cache-Rabatt auf rund 98% kommt gegenüber den 90%, die die meisten Anbieter geben. Der aggressivste Caching-Rabatt auf dem Markt, und der Grund, warum diese Belege so aussehen, wie sie aussehen.

Balkendiagramm, das die $0.14-Cache-Miss-Eingaberate der $0.0028-Cache-Hit-Rate gegenüberstellt, mit den drei Bedingungen für einen Hit daneben aufgelistet
Balkendiagramm, das die $0.14-Cache-Miss-Eingaberate der $0.0028-Cache-Hit-Rate gegenüberstellt, mit den drei Bedingungen für einen Hit daneben aufgelistet

Disk-Caching ist standardmäßig für jedes Konto aktiviert, keine Codeänderung nötig, du entscheidest dich also nicht aktiv für irgendetwas. Was du tust, ist qualifizieren, und die Qualifikationsregeln hier sind strenger als bei den meisten Anbietern:

  • Eine Anfrage wird nur dann zur Hit-Rate abgerechnet, wenn sie vollständig mit einer gespeicherten Cache-Präfix-Einheit übereinstimmt. Teilweise Überlappung bringt nichts. DeepSeek führt diese Anforderung der vollständigen Übereinstimmung auf sein Sliding-Window-Attention-Design zurück, was eine Änderung gegenüber der Übereinstimmungslogik früherer Versionen ist.
  • Einheiten werden an Anfragegrenzen gespeichert, bei Erkennung eines gemeinsamen Präfixes über Anfragen hinweg, und in festen Token-Intervallen innerhalb langer Ein- und Ausgaben.
  • Caching ist "best effort" ohne garantierte Hit-Rate, und ungenutzte Einträge werden "normalerweise innerhalb von wenigen Stunden bis zu wenigen Tagen" gelöscht.
  • Du kannst es pro Aufruf prüfen. Der usage-Block liefert prompt_cache_hit_tokens und prompt_cache_miss_tokens, sodass du nie raten musst, welche Rate du bezahlt hast.

Der letzte Punkt ist der einzige praktische Tipp in diesem ganzen Artikel. Protokolliere diese beiden Felder von Tag eins an. Jedes Kostenmodell, das ich je scheitern sah, scheiterte aus demselben Grund, nämlich dass jemand eine Hit-Rate angenommen hat, statt sie zu messen.

Multiplikator zwei: Es denkt standardmäßig, und es ist wortreich

Beide V4-Stufen laufen standardmäßig im Denkmodus, und die Reasoning-Tokens werden zur Ausgaberate abgerechnet. Inzwischen Standard genug. Nicht ganz so Standard ist, wie viele davon Flash produziert.

Artificial Analysis benötigte 210 Millionen Ausgabe-Tokens, um den Intelligence Index auf Flash laufen zu lassen, gegenüber einem Klassenmedian von etwa 100 Millionen. Der gesamte Index-Lauf kostete $72.02. Bei identischer Arbeit solltest du also etwa doppelt so viele Ausgabe-Tokens wie bei einem vergleichbaren Modell erwarten, jedes zu $0.28, und das halbiert leise den auf der Liste angekündigten Rabatt.

Balkendiagramm, das 210M von DeepSeek V4 Flash verwendete Ausgabe-Tokens einem Klassenmedian von 100M gegenüberstellt, versehen mit den $72.02 Kosten des Index-Laufs
Balkendiagramm, das 210M von DeepSeek V4 Flash verwendete Ausgabe-Tokens einem Klassenmedian von 100M gegenüberstellt, versehen mit den $72.02 Kosten des Index-Laufs

Es gibt keine saubere Möglichkeit, einfach nur die günstige Version zu kaufen. Wenn man das Reasoning herunterdreht, dreht man das Modell gleich mit herunter. DeepSeeks eigene Cross-Mode-Tabelle zeigt Flash bei 8.1 auf Humanity's Last Exam im Nicht-Denk-Modus, gegenüber 34.8 bei maximalem Aufwand, und Artificial Analysis bewertet es unabhängig mit 50 bei maximalem Aufwand gegenüber 29 ohne Reasoning. Die günstige Konfiguration und die gute Konfiguration sind unterschiedliche Läufe derselben Gewichte. Eine Eigenheit, die man hier kennen sollte: xhigh wird bei Flash still als high bedient, sodass man sich auch nicht über diese Obergrenze hinauskaufen kann.

Multiplikator drei: Ein 2x-Zuschlag ohne Startdatum

Hier hat sich DeepSeeks Struktur selbst umgekehrt. Heute gibt es keinen Nebenzeit-Rabatt. Stattdessen trägt die Liste eine Fußnote, die besagt, dass die API "bald eine Peak/Off-Peak-Preispolitik einführen wird", bei der die Preise während der Spitzenzeiten das 2-Fache der regulären Preise betragen werden, anwendbar auf alle Abrechnungsposten.

Das veröffentlichte Fenster läuft täglich von 9:00 bis 12:00 und von 14:00 bis 18:00 Uhr Pekinger Zeit. Umgerechnet landet das bei 01:00 bis 04:00 UTC und 06:00 bis 10:00 UTC, also sieben Stunden täglich. Zum Stichdatum: es ist "abhängig von der offiziellen Ankündigung", was eine andere Art ist zu sagen, dass es keins gibt.

Aufsteigende Treppenillustration, die die vier Multiplikatoren zwischen DeepSeeks $0.28-Listenpreis und einer echten Rechnung zeigt: standardmäßig aktiviertes Reasoning, 2,1-fache Klassenmedian-Wortreichheit, der geplante 2x-Spitzenzuschlag und 3-5x für Zero Retention
Aufsteigende Treppenillustration, die die vier Multiplikatoren zwischen DeepSeeks $0.28-Listenpreis und einer echten Rechnung zeigt: standardmäßig aktiviertes Reasoning, 2,1-fache Klassenmedian-Wortreichheit, der geplante 2x-Spitzenzuschlag und 3-5x für Zero Retention

Zwei praktische Lesarten davon. Wenn deine Last Batch-Arbeit ist, deren Timing du kontrollierst, ist das nahezu harmlos, und du planst einfach darum herum. Wenn deine Last synchroner Traffic ist, der europäische Vormittage oder asiatische Nachmittage bedient, dann liegt ein großer Teil davon genau in diesen Fenstern, und du solltest dein Budget jetzt schon mit 2x kalkulieren. Auch keine Hypothese, die man übersehen hätte:

Hacker News

"Besides, in a few days, they'll change their pricing, doubling it during their peak hours [...] It's still cheap, but the price/performance ratio is not that good"

Die Preise, die heute auf der Liste stehen, sind die regulären Raten. DeepSeek hat keine Spitzenraten-Tabelle veröffentlicht, also ist es der ehrliche Weg, die veröffentlichten Zahlen selbst zu verdoppeln, statt Spitzenpreise zu zitieren, als würden sie schon existieren.

Multiplikator vier: Zero Retention, wenn du sie brauchst

Dieser hier ist überhaupt nicht DeepSeeks Preis, und für jeden, der Kundendaten verarbeitet, ist er der größte Multiplikator auf der Liste.

DeepSeeks Open-Platform-AGB für die kostenpflichtige API schweigen dazu, ob API-Eingaben das Modell trainieren. Der Abschnitt "Inputs and Outputs" reicht bis §4.2 und stoppt dann, wobei die Trainingsklausel ausgelassen wird, die die Verbraucher-AGB in §4.3 enthalten. Schweigen ist nicht dasselbe wie Erlaubnis, und es lohnt sich, hier präzise zu sein, denn viele Kommentare behaupten schlicht, dass DeepSeek mit API-Daten trainiert, und die kostenpflichtigen AGB sagen es einfach nicht. Was sie ebenfalls nicht sagen, ist, dass es das nicht tun wird. Wie dem auch sei, es gibt keine veröffentlichte DPA und keine First-Party-Zero-Retention-Option, und die Daten liegen in der VR China unter chinesischem Recht.

Also weichen Teams mit einer Compliance-Anforderung stattdessen auf einen Zero-Retention-Host aus, und dafür zahlen sie:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."

Achte auf die Klammerbemerkung dort, denn das ist der wichtige Teil. Drittanbieter-Hosts reproduzieren DeepSeeks 98%-Cache-Rabatt nicht, sodass man die günstige Eingaberate genau in dem Moment verliert, in dem man die Retention-Prämie zu zahlen beginnt. Flashs $0.28-Ausgabe landet bei einem Zero-Retention-Host irgendwo zwischen $0.84 und $1.40, derselben Bandbreite wie ein westliches Modell der Mittelklasse mit Vision und Websuche. Wenn du diesen Trade-off abwägst, decken meine Leitfäden zu SOC 2 und GDPR-Anforderungen und zur Frage selbst bauen oder kaufen das Terrain ab.

Als Präzedenzfall dafür, warum Teams sich überhaupt darum kümmern, ist die Slack-Richtlinienänderung und die darauf folgende Reaktion diejenige, die die meisten Leser selbst erlebt haben.

Was Leute tatsächlich bezahlt haben

Veröffentlichte Belege schlagen Modellierung immer. Diese kamen unaufgefordert aus dem Launch-Thread, direkt von den eigenen Dashboards der Leute, und sie sind die konkretesten verfügbaren Kostendaten überhaupt.

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886"
Hacker News

"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:

$19.27 USD
API requests: 7,877
Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache. Still incredible."

Der zweite Poster tut das Ehrliche und weist darauf hin, warum seine Zahl so niedrig ausfällt. Experimentelle Schleifen, die ein fast identisches Präfix tausendfach erneut senden, sind die ideale Cache-Form. Es ist eine echte Workload. Es ist aber auch nicht die meisten Workloads.

Pro Session, auf einem Agenten-Harness:

Hacker News

"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost."

Und dann der Gegenbeleg, der der Grund dafür ist, dass ich mein Budget nicht allein auf den guten Zahlen aufbauen würde:

Hacker News

"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."

Zwei Dollar im Monat, und fünfzig Dollar in einer Stunde. Beides sind echte Berichte über dasselbe Modell. Die Variable ist die Form der Workload plus der Weg, über den man kauft, und nicht die Preisliste. Wenn du das ordentlich im Blick behalten willst, gibt es LLM-Tracking-Tools genau aus diesem Grund.

Kosten pro Aufgabe sind die Zahl, auf die man vergleichen sollte

Preise pro Token sind nur zwischen Modellen vergleichbar, die für eine Aufgabe die gleiche Anzahl Tokens ausgeben, und das tun Modelle nicht. Artificial Analysis veröffentlicht eine Kosten-pro-Aufgabe-Zahl, die das normalisiert, und das ist die ehrliche Art, Flash gegen alles andere zu lesen.

Modell und AufwandAA Intelligence IndexKosten pro Aufgabe
DeepSeek V4 Flash (max)50~$0.03
GPT-5.6 Luna (high)46~$0.03
GPT-5.6 Luna (xhigh)49~$0.04
GPT-5.6 Luna (max)51~$0.07
DeepSeek V4 Pro44~$0.05
Kimi K3 (max)57~$0.86

Das rahmt den gesamten Vergleich neu ein. Bei Listen-Ausgabepreisen liegt Flash gegenüber Kimi K3 bei 54x. Bei den Kosten pro Aufgabe sind es nur 29x, weil Flash mehr Tokens ausgibt, um dort hinzukommen. Und gegenüber OpenAIs Mittelklasse schließt sich die Lücke im Wesentlichen:

Hacker News

"First, your direct comparison, Deepseek V4 Flash 0731 (max effort) $0.03 (rounded up) per task @ index 50. OpenAI Luna: * high effort $0.03 (rounded down) @ index 46 * xhigh effort $0.04 @ index 49 * max effort $0.07 @ index 51 So I would say a fair statement would be "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference""

Es lohnt sich, das Warum hier genau zu klären, da dies der häufigste Fehler in DeepSeek-Preisvergleichen ist. Am 30. Juli 2026 senkte OpenAI die GPT-5.6-Preise, und Luna fiel um 80% auf $0.20 Eingabe und $1.20 Ausgabe. Alles, was Luna noch bei $1.00 Eingabe und $6.00 Ausgabe zitiert, liegt um das Fünffache falsch, und jeder Vergleich gegen ein unqualifiziertes gpt-5.6 benchmarkt still Flash gegen Sol, die Frontier-Stufe zu $5 und $30. Die Stufe, die tatsächlich preislich mit Flash konkurriert, ist Luna, und im Index liegen die beiden gleichauf.

Flash gegen Pro, wo das Verhältnis nicht das ist, was es scheint

Das Titelverhältnis zwischen den Stufen ist klar genug. Pro läuft mit 3,11x Flash bei Cache-Miss-Eingabe und bei Ausgabe, während es bei Cache-Hits nur 1,29x sind. Je mehr deine Workload also cacht, desto weniger kostet dich diese Stufenwahl.

Nur ist die Stufenwahl ohnehin fast entschieden, und zwar nicht zugunsten von Pro. Flash 0731 wurde am 31. Juli nachtrainiert, während deepseek-v4-pro auf der Liste weiterhin der April-Preview-Build ist, ohne ein 0731-Äquivalent dahinter. Flash schlägt Pro-Preview in allen neun Agentic-Benchmark-Zeilen, die DeepSeek veröffentlicht, und liegt 6 Punkte höher im Intelligence Index bei einem Drittel des Preises. Diese Umkehrung habe ich im Detail im Vergleich Flash gegen Pro durchgearbeitet.

Pro behält aber einen echten Vorteil an zwei Stellen, die es wert sind, dafür zu zahlen, wenn man sie braucht: Recall und Long-Context-Retrieval. Auf der Preview-Cross-Mode-Tabelle nimmt es SimpleQA-Verified mit 57.9 gegen 34.1, MRCR bei 1M-Kontext mit 83.5 gegen 78.7, dann BrowseComp mit 83.4 gegen 73.2. Das ist es, was 49B aktive Parameter gegenüber 13B kaufen. Die menschliche Präferenz widerspricht dem automatisierten Index auch hier, da LMArena Pro bei vergleichbaren Stimmenzahlen weiterhin über Flash einordnet.

Eine Abrechnungsfalle, falls du zu Pro greifst. DeepSeeks veröffentlichte Aufwand-Zuordnungstabelle bedient eine low-Anfrage auf Pro mit high. Es gibt keinen günstigen Pro-Lauf. Man zahlt das 3,11-Fache der Rate und kann das Reasoning nicht herunterregeln, um das auszugleichen. Diese Zuordnung soll sich Anfang August 2026 ändern, also vor dem Bauen darauf prüfen.

Abrechnungsmechanik, die zubeißt

Die Abzugsregeln der Liste sind kurz gehalten, und sie verstecken darin zwei operative Probleme.

Es ist Prepaid, und ein leeres Guthaben verläuft nicht elegant. Die Ausgabe ist Tokens mal Preis, abgezogen vom aufgeladenen Guthaben oder vom gewährten Guthaben, wobei das gewährte zuerst ausgegeben wird, wenn beide existieren. DeepSeek empfiehlt ausdrücklich, entsprechend dem tatsächlichen Verbrauch aufzuladen statt vorzuladen, und behält sich das Recht vor, die Preise zu ändern. Die Konsequenz für alles Langlaufende ist, dass ein 402 wegen unzureichendem Guthaben mitten im Lauf ankommt, nicht bei der Anfrage. Behandle es als fatal und richte einen Alarm dafür ein, denn ein Retry auf einen 402 bringt absolut nichts.

Es gibt keine veröffentlichten Rate-Limits, nur eine Nebenläufigkeitsgrenze. Weder RPM noch TPM tauchen irgendwo in der Dokumentation auf. Veröffentlicht ist die Nebenläufigkeit, 2.500 bei Flash gegenüber 500 bei Pro, angewendet auf Kontoebene statt pro Schlüssel, und bei Überschreitung wird 429 zurückgegeben, ohne Retry-After-Header. Erweiterung läuft über ein Antragsformular. Wenn du eine Produktions-Workload dimensionierst, ist dieser Kontoebenen-Umfang das Detail, um das man planen muss, denn ein durchgehender Job wird allem anderen im Konto die Ressourcen entziehen.

Für Vorab-Schätzungen veröffentlicht DeepSeek Verhältnisse von etwa 0,3 Tokens pro englischem Zeichen und 0,6 pro chinesischem Zeichen, und es gibt auch ein Offline-Tokenizer-Paket, wenn man vor dem Senden genaue Zahlen möchte.

Rechtfertigt dieser Preis, das Modell in deine Support-Warteschlange zu stellen?

Hier würde ich langsamer machen, denn die Rechnung, die Flash für Coding-Agenten attraktiv macht, überträgt sich nicht auf kundengerichtete Arbeit.

Flashs AA-Omniscience-Halluzinationsrate liegt bei 84%. Das ist eine Verbesserung von 12 Punkten gegenüber dem Vorgänger, und immer noch nirgendwo nahe einer Zahl, die man einem zahlenden Kunden unüberwacht vorsetzen würde. Auch keine dokumentierte Bildeingabe und keine Websuche, sodass sowohl Foto-Anhänge als auch Bestellstatusabfragen etwas anderes benötigen, das eingebunden werden muss.

Das tiefere Problem ist jedoch, dass eine Halluzinationsrate aus einer Rangliste einfach das falsche Kriterium ist, um daran einzukaufen. Eine CX-Leiterin hat es mir einmal besser formuliert, als ich es könnte:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Das ist eine CX-Leiterin bei einer DTC-Nahrungsergänzungsmittel-Marke auf Gorgias und Shopify, mit rund 7.000 Tickets pro Monat, und vertrauensbasiertes Routing stellte sich als der Einwand heraus, der ihre gesamte Bewertung entschied. Was sie brauchten, war kein besserer Score. Sie brauchten, dass das Modell weiß, wann es sich zurückhalten sollte, und das ist eine Aufgabe für Vertrauensschwellenwerte, für Grounding in verifiziertem Wissen, und für einen Menschen im Loop bei allem, was unter der Schwelle liegt.

Ich habe eine Version genau dieses Versagens innerhalb unseres eigenen Produkts beobachtet. Das schlimmste Muster, das das Team je in Produktion gefangen hat, war ein Agent, der etwa zehn Turns lang durchgehend "führe Zendesk-Suchen aus" erzählte, ohne die API jemals zu treffen, und dann Dateien meldete, die als gespeichert galten, aber nicht existierten. Nichts tötet das Vertrauen in einen KI-Kollegen schneller, als wenn er darüber lügt, was er getan hat. Und das ist ein Überwachungsproblem, kein Token-Preis-Problem.

Wo eesel hineinpasst

Wenn der Grund, warum du DeepSeek pro Million Tokens kalkulierst, der ist, dass du günstigeren Support willst, dann ist die Einheit selbst falsch. Was ein Support-Team tatsächlich ausgibt, sind Kosten pro Lösung, und ein Token-Preis sagt darüber überhaupt nichts aus, weil er nichts darüber aussagt, wie viele Tickets am Ende gelöst werden.

eesel ist genauso bepreist, wie das Ergebnis gemessen wird. 40 Cent pro bearbeitetem Ticket oder Helpdesk-Gespräch, keine Sitzplatzgebühr, und nichts wird für Tickets berechnet, die deine Menschen bearbeiten. Bevor irgendetwas davon passiert, führst du Simulationen gegen deine eigenen historischen Tickets durch und siehst die echte Lösungsrate auf deinen eigenen Daten, was ehrlich gesagt die einzige Genauigkeitszahl ist, die überhaupt etwas bedeutet. Und man kann zunächst nur einen Teil weiterleiten. Bearbeite 1.000 Tickets im Monat, schicke 200 davon an die KI, du zahlst für 200, also $80.

Es gibt $50 kostenlose Nutzung zum Start, ohne Kreditkarte, plus eine standardmäßige Ausgabengrenze von $250, die die Agenten nicht überschreiten. Die vollständigen Zahlen stehen auf der Preisseite. Die Seiten zu Sicherheit und Enterprise behandeln jene Fragen zur Datenverarbeitung, die die DeepSeek-AGB offenlassen.

Sind $0.14 und $0.28 im August 2026 immer noch günstig?

Ja, wenn auch weniger, als die Schlagzeile suggeriert, und die ehrliche Antwort hängt stark davon ab, mit was man vergleicht.

Gegenüber der Premium-Stufe ist die Lücke enorm, und real. Claude Opus 5 und Flash liegen bei der Ausgabe etwa 89x auseinander. Gegenüber Kimi K3 beträgt die Listenlücke 54x, während die Lücke pro Aufgabe 29x beträgt. Gegenüber Qwen 3.8 Max und Qwen 3.7 Flash bleibt Flash preislich konkurrenzfähig und fällt bei der Multimodalität zurück, da es reiner Text ist.

Gegenüber der Stufe, die tatsächlich mit ihm konkurriert, liegen die Dinge nahe beieinander. Luna zu $0.20 und $1.20 liegt beim Intelligence Index gleichauf mit Flash, läuft mehrfach schneller, und liefert Vision und Websuche. Legt man Zero-Retention-Hosting darüber, verschwindet der Preisunterschied größtenteils. Das ist der Grund, warum eine ganze Reihe von Teams am Ende beides betreiben, Flash für die Masse an Arbeit und etwas anderes für die Aufgaben, die Flash nicht kann. Wenn du diese Art von Aufteilung baust, ist der Drei-Wege-API-Vergleich ein vernünftiger Ausgangspunkt, und Mistral und Grok gehören beide zur selben Preisdiskussion.

Die eine Option, mit der die Preisliste überhaupt nicht konkurrieren kann, ist, es selbst zu betreiben. Die Gewichte sind MIT-lizenziert mit rund 167GB, 284B Gesamtparametern mit 13B aktiven, was ein selbst gehostetes Deployment eher in teure Prosumer-Hardware-Gefilde als in Rechenzentrums-Gefilde rückt. Gecachte Eingabe auf eigener Hardware kostet nichts. Wenn das die Richtung ist, in die du gehst, sind Open-Source-KI-Agenten und Fine-Tuning die nächsten Dinge zum Lesen.

FAQs

Wie viel kostet DeepSeek V4 Flash? Die Preisgestaltung von DeepSeek V4 Flash beträgt $0.14 pro Million Eingabe-Tokens bei einem Cache-Miss, $0.0028 pro Million bei einem Cache-Hit, und $0.28 pro Million Ausgabe-Tokens. Das sind die regulären Raten auf der Preisliste, und eine geplante Spitzenzeit-Richtlinie würde alle davon während der veröffentlichten Zeitfenster verdoppeln. Für den Kontext, wie sich das mit Helpdesk-KI-Budgets vergleicht, sieh dir an, was KI-Kundenservice tatsächlich kostet in der Praxis.

Wie ist die Preisgestaltung von DeepSeek V4 Flash im Vergleich zu V4 Pro? Pro kostet 3,11x Flash bei Cache-Miss-Eingabe und bei Ausgabe, und 1,29x bei Cache-Hits. Flash erzielt derzeit auch einen höheren Wert im Artificial Analysis Intelligence Index, 50 gegen 44, was die Umkehrung ist, die ich im Vergleich Flash gegen Pro aufschlüssle. Pro behält seinen Vorteil bei Recall und Long-Context-Retrieval.

Gibt es eine kostenlose Stufe für die DeepSeek API? Auf der Preisliste erscheint keine kostenlose Stufe. Die Abrechnung ist Prepaid, wobei entweder vom aufgeladenen Guthaben oder vom gewährten Guthaben abgezogen wird, und das gewährte wird zuerst ausgegeben. Dieses Prepaid-Modell ist der Grund, warum ein 402 mitten im Lauf ankommen kann statt bei der Anfrage. Das vollständige Datenblatt findet sich in meiner DeepSeek V4 Flash-Übersicht.

Warum ist meine DeepSeek-Rechnung höher als der beworbene Preis? Fast immer eines von drei Dingen. Deine Cache-Hit-Rate ist niedriger, als du angenommen hast, sodass mehr von der Eingabe zu $0.14 statt zu $0.0028 abgerechnet wird. Oder der Denkmodus generiert Reasoning-Tokens, die zur Ausgaberate abgerechnet werden. Oder du kaufst über einen Reseller statt First-Party, und das ändert sowohl die Rate als auch das Caching-Verhalten. Protokolliere prompt_cache_hit_tokens, um die ersten beiden zu unterscheiden.

Trainiert DeepSeek mit API-Daten? Die kostenpflichtigen Open-Platform-AGB schweigen dazu. Der Abschnitt "Inputs and Outputs" stoppt bei §4.2 und lässt die Trainingsklausel aus, die die Verbraucher-AGB enthalten, sodass er das Recht weder einräumt noch verweigert. Es gibt keine veröffentlichte DPA oder First-Party-Zero-Retention-Option, und Daten werden in der VR China verarbeitet. Zero-Retention-Drittanbieter-Hosts kosten das 3- bis 5-Fache mehr. Mein SOC 2- und GDPR-Leitfaden behandelt, was ein Support-Team tatsächlich erfüllen muss.

Ist DeepSeek V4 Flash günstig genug, um einen Kundensupport-Chatbot zu betreiben? Der Token-Preis ist nicht die Einschränkung, es ist die Halluzinationsrate von 84%, zusammen mit keiner dokumentierten Bildeingabe. Ein rohes Modell vor Kunden braucht RAG-Grounding, Guardrails und vertrauensbasiertes Routing, bevor es sicher ist. Mein Leitfaden zum Verhindern von Halluzinationen im Support geht die Mechanik durch, und Aufbau eines Support-Chatbots deckt den Rest des Stacks ab.

Wann beginnt DeepSeeks 2x-Spitzenpreis? Es wurde kein Datum angekündigt. Die Liste sagt, dass das Stichdatum "abhängig von der offiziellen Ankündigung" ist. Die veröffentlichten Spitzenfenster sind täglich 9:00 bis 12:00 und 14:00 bis 18:00 Uhr Pekinger Zeit, was 01:00 bis 04:00 und 06:00 bis 10:00 UTC entspricht. Kalkuliere mit dem 2-Fachen, wenn dein Traffic synchron ist und in diese Stunden fällt.

Was ist der günstigste Weg, DeepSeek V4 Flash zu betreiben? First-Party-API mit einer hohen Cache-Hit-Rate, was der Ursprung der Mischraten unter einem Cent in diesem Artikel überhaupt war. Halte Prompt-Präfixe stabil und nur anhängend, halte die Ausgabe kurz, und plane Batch-Arbeit außerhalb der geplanten Spitzenfenster. Wenn deine Daten deine Kontrolle nicht verlassen dürfen, entfernen MIT-lizenzierte Gewichte und ein selbst gehostetes Deployment die Token-Kosten komplett, zum Preis der Hardware. Für ein Support-Team ist Support-Kosten mit KI senken ohnehin ein besserer Rahmen, als der Token-Rate nachzujagen.

Das Fazit

DeepSeek V4 Flash bietet derzeit die beste Intelligenz pro Dollar auf dem Markt, und die Zahlen $0.14 und $0.28 untertreiben immer noch, wie günstig es werden kann. Mischraten unter einem Cent sind real und dokumentiert. Ebenso $50 in einer Stunde.

Was ich damit tun würde. Für Batch-Arbeit, Coding-Agenten, Review, Zusammenfassung, alles mit stabilem Prompt-Präfix und kurzen Ausgaben, benutze es, und messe deine Cache-Hit-Rate von der allerersten Anfrage an, statt eine anzunehmen. Für synchronen Produktions-Traffic budgetiere mit dem 2-Fachen, bis diese Spitzenzeit-Richtlinie ein Datum hat. Für Kundendaten unter einer Compliance-Anforderung kalkuliere den Zero-Retention-Weg und vergleiche ihn dann ehrlich mit Luna, weil der Rabatt dort größtenteils verschwindet und Luna mehr kann.

Und für alles, was einem Kunden antwortet, hör auf, Preise pro Token überhaupt zu vergleichen. Vergleiche Kosten pro Ticket, gemessen an deiner eigenen Ticket-Historie, denn das ist die Zahl, die dein Finanzteam tatsächlich sehen wird.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt
Trending

DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt

DeepSeek V4 Flash kostet $0,14 pro Million Input-Tokens und $0,28 pro Million Output-Tokens und übertrifft dabei DeepSeeks eigenes teureres Modell. Das steht nicht auf der Preistabelle.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration einer sehr langen Katze, die sich neben zwei Personen streckt, die eine Bewertungskarte prüfen, mit dem LongCat-Logo
Trending

LongCat 2.0 im Test: ein echtes Arbeitstier mit einem harten Blocker

Ich habe LongCat 2.0 anhand von sieben Punkten bewertet, die Käufern wirklich wichtig sind, und dabei Meituans eigene Unterlagen sowie die Erfahrungen von Leuten genutzt, die Milliarden Tokens durch das Modell geschickt haben. Bei sechs davon schneidet es gut ab.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration einer sehr langen Katze, die sich neben einem Serverrack über einen Schreibtisch streckt, mit dem LongCat-Logo
Trending

LongCat 2.0: ein Blick ins 1,6-Billionen-Open-Weight-Modell von Meituan

LongCat 2.0 ist Meituans MIT-lizenziertes 1,6T-MoE-Modell zum Preis von 0,30 US-Dollar pro Million Input-Tokens. Ich habe jede Primärquelle gelesen, um zu sehen, was wirklich geliefert wird.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ein Tester blickt auf eine Bewertungskarte mit zwei Aufwand-Reglern, beschriftet mit niedrig und maximal, neben dem DeepSeek-Wal
Trending

DeepSeek V4 Flash im Test: ein Modell, zwei Persönlichkeiten

Ein DeepSeek V4 Flash Test, der auf den Zahlen beruht, die beide Scoreboards veröffentlichen. Der billige Lauf und der clevere Lauf sind dieselben Gewichte, und das verändert das Urteil.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Zwei Personen lesen einen großen Nutzungszähler ab und stellen einen Stapel Abrechnungsregler ein, in Metas blauer Markenfarbe
Trending

Meta Muse Spark 1.1 Preise: Die Rechnung hat vier Zähler

Muse Spark 1.1 kostet laut Listenpreis $1,25 Eingabe und $4,25 Ausgabe pro Million Tokens. Vier separate Zähler bestimmen die tatsächliche Rechnung, und der Listenpreis ist der kleinste davon.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Illustration zur Aufschlüsselung der PromptQL-Preise
Trending

PromptQL-Preise: Was es 2026 wirklich kostet

Eine Aufschlüsselung der PromptQL-Preise: die abrechenbare OLU-Einheit, der Einführungspreis von 0,14 $, kostenloses Guthaben, der Modell-Multiplikator, der die Rechnung wirklich bestimmt, und durchgerechnete Kosten.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Illustration von zwei Personen, die gestaffelte Preiskarten auf einem Bildschirm betrachten, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash Preise: Was Sie 2026 tatsächlich zahlen

Der Kurs von $0.03 ist real, und er ist nur einer von vier Zählern auf Ihrer Rechnung. Hier sehen Sie, wie sich die Prompt-Staffel, der Cache, die Batch-Region und die Retry-Rate zu der Zahl summieren, die am Ende tatsächlich berechnet wird.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5: Welches Modell solltest du wirklich einsetzen?

Fable 5 kostet genau doppelt so viel wie Opus 5. Ich habe beide System Cards, die Dokumentation und die unabhängigen Benchmarks durchgearbeitet, um herauszufinden, wann dieser zweite Dollar tatsächlich etwas bringt.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Redaktionelle Illustration eines Benchmark-Ranglisten-Diagramms mit einem hohen, hervorgehobenen Balken, der ZCode und das Modell GLM-5.2 repräsentiert
Trending

ZCode: was Z.ais neuer KI-Coding-Agent wirklich ist

Ein Praxistest zu ZCode, der kostenlosen agentischen Coding-App des GLM-Teams: das Modell GLM-5.2 dahinter, die echten Beschwerden der Launch-Woche und wer sie nutzen sollte.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten