Die 8 besten DeepSeek V4 Flash Alternativen 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Zuletzt bearbeitet August 6, 2026

Warum ich diese nicht nach Punktzahl ranke
Ich schreibe beruflich über Suchintention, und "deepseek v4 flash alternatives" ist eine Shopping-Anfrage mit einer versteckten Annahme: dass du nach etwas Besserem suchst. Auf den beiden Boards, die dieses Modell messen, ist das meistens nicht der Fall.
Artificial Analysis sieht Flash bei maximalem Aufwand bei 50 und beschreibt es als "unter den führenden Modellen in Sachen Intelligenz und gut bepreist im Vergleich zu anderen Open-Weight-Modellen ähnlicher Größe." Luna liegt bei 51. Gemini 3.6 Flash liegt bei 50. Du würdest intelligenzmäßig seitwärts tauschen und für dieses Privileg mehr zahlen.
Was du tatsächlich kaufst, ist eine Fähigkeit oder eine Compliance-Antwort. Genau danach ist diese Liste geordnet: nach der Lücke, die sie schließt, mit den ehrlichen Kosten des Wechsels bei jeder einzelnen. Wenn du die reine Spec-Einschätzung des Modells willst, das du verlässt, deckt der Überblick zu DeepSeek V4 Flash und die Flash-Review das ab, und Flash gegen GPT-5.6 behandelt den nächsten direkten Vergleich im Detail.
Die Zahlen, an einem Ort
Jede Zahl unten stammt von Artificial Analysis oder der eigenen Preisseite des Anbieters, geprüft am 4. August 2026. "Index run" ist, was es AA gekostet hat, dieses Modell über den gesamten Intelligence Index zu bewerten, das ist der nächste, was jeder von ihnen zu einer echten Kosten-pro-Aufgabe-Zahl veröffentlicht.
| Modell | AA Index | Eingabe /1M | Ausgabe /1M | Index run | Ausgabegeschwindigkeit | Zeit bis zum ersten Token | Token für Index-Lauf | Eingabetypen | Kontext | Gewichte |
|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (max) | 50 | $0.14 | $0.28 | $72.02 | 113 t/s | 1,31s | 210M | text | 1M | MIT |
| GPT-5.6 Luna (max) | 51 | $0.20 | $1.20 | $174.06 | 181 t/s | 132,75s | 130M | text, image | 1.05M | closed |
| Gemini 3.6 Flash (high) | 50 | $1.50 | $7.50 | $726.70 | 213 t/s | 15,69s | 59M | text, image, speech, video | 1M | closed |
| Gemini 3.5 Flash-Lite | 36 | $0.30 | $2.50 | $153.08 | 366 t/s | 8,41s | 43M | text, image, speech, video | 1M | closed |
| Claude Haiku 4.5 (non-reasoning) | 24 | $1.00 | $5.00 | nicht veröffentlicht | 90 t/s | 0,96s | nicht veröffentlicht | text, image | 200K | closed |
| Kimi K3 (max) | 57 | $3.00 | $15.00 | $2,437.41 | 36 t/s | 2,85s | 130M | text, image | 1M | kimi-k3-Lizenz |
| DeepSeek V4 Pro | 44 | $0.435 | $0.87 | nicht veröffentlicht | nicht veröffentlicht | nicht veröffentlicht | nicht veröffentlicht | text | 1M | open |
| Qwen3.7-Flash | nicht gelistet | $0.03–$0.20 | $0.13–$0.80 | nicht veröffentlicht | 59 t/s | nicht veröffentlicht | nicht veröffentlicht | text, image, video | 1M | closed |
Zwei Dinge fallen aus dieser Tabelle auf. Flash hat das schnellste erste Token in der Gruppe um den Faktor zwei gegenüber allem außer Haiku, und es ist das einzige Modell hier, das sowohl Open-Weight als auch tatsächlich günstig ist. Alles andere ist ein Kompromiss.

Wähle nach der Lücke, nicht nach der Punktzahl
Vor der Liste: Das ist die Entscheidung in fünf Klicks. Wähle, was dich tatsächlich blockiert, und du bekommst die Empfehlung plus die Kosten des Wechsels.
Wofür wechselst du eigentlich?
Flash ist bereits das günstigste und liefert am schnellsten das erste Token. Also wähle die Lücke.
Flash hat keine dokumentierte Bildeingabe. Luna nimmt Text und Bilder, liegt beim AA-Index einen Punkt höher bei 51 und läuft mit 181 Token pro Sekunde. Es ist außerdem das günstigste visionfähige Modell in diesem Vergleich, mit $0.20 Eingabe und $1.20 Ausgabe.
Kosten des Wechsels: etwa das 3-Fache der tatsächlichen Rechnung über cache-lastige, reasoning-lastige und lange Prompt-Formen hinweg, und eine Zeit bis zum ersten Token von 132,75s bei maximalem Aufwand. Setze es nicht auf einen interaktiven Pfad, ohne den Aufwand herunterzuregeln.
Du behältst exakt das gleiche Modell und verschiebst nur die Inferenz. Die Gewichte sind MIT-lizenziert, und eine öffentliche Produktionskonfiguration lässt den 0731-Checkpoint bereits auf einer einzelnen AMD MI300X mit 168,6 Token pro Sekunde im Single-Stream laufen, schneller als die von der First-Party-API gemessenen 113.
Kosten des Wechsels: Hardware. 156,67 GiB an Gewichten müssen in den HBM passen, und eine einzelne MI300X ist schwer allein zu kaufen. Wenn du keine GPUs betreiben willst, erklärt Geminis kostenpflichtige Stufe ausdrücklich, dass deine Inhalte nicht zur Produktverbesserung genutzt werden.
366 Token pro Sekunde, das schnellste hier, und das prägnanteste: 43M Ausgabetoken, um den AA-Index zu durchlaufen, gegenüber Flashs 210M. Nimmt Text, Bild, Sprache und Video. Gut für Klassifizierung und Triage in großem Volumen.
Kosten des Wechsels: Intelligenz. Index 36 gegenüber Flashs 50, also eine andere Gewichtsklasse an Aufgaben. Und keine Computer-Nutzung zu irgendeinem Preis.
Die Zuverlässigkeitswahl. AA-Omniscience-Halluzinationsrate von 51% gegenüber Flashs 84%, Omniscience Index von 18 gegenüber Flashs -16, und die höchste rohe Intelligenz hier mit 57.
Kosten des Wechsels: etwa das 29-Fache der Kosten pro Aufgabe und 36 Token pro Sekunde. Es gibt auch kein Budget-K3. Die K3-(low)-Zeile liegt bei 47 Punkten, drei Punkte unter Flash, bei 8-fachen Kosten. Reasoning kann nicht abgeschaltet werden.
Bleib in der Familie. Pro gewinnt weiterhin klar bei Recall und der Suche in langem Kontext: SimpleQA-Verified 57.9 gegenüber Flashs 34.1, MRCR bei 1M Kontext 83.5 gegenüber 78.7, und LMArenas menschliche Wähler ranken es bei 1458 gegenüber Flashs 1436.
Kosten des Wechsels: 3,11x bei Cache-Miss-Eingabe und Ausgabe, und kein günstiger Lauf. DeepSeeks eigene Effort-Mapping-Tabelle bedient eine low-Anfrage bei Pro mit high.
1. GPT-5.6 Luna

Am besten für: den nächstliegenden Gleich-für-Gleich-Wechsel, und den günstigsten Weg, um Bildeingabe hinzuzufügen.
Was es tatsächlich ist
Luna ist die Budget-Stufe der GPT-5.6-Familie, auf der eigenen Modellseite beschrieben als "optimiert für kostensensitive Workloads." Der Grund, warum die meisten Flash-Vergleiche das falsch machen, ist, dass gpt-5.6 auf Sol verweist, die Frontier-Stufe, sodass Leute versehentlich ein $0.14-Modell gegen ein $5-Modell benchmarken. Gegen Luna speziell ist die Intelligenzfrage praktisch ein Unentschieden: 51 zu 50 im AA-Index.
Es hat ein Kontextfenster von 1.050.000 Token, maximal 128.000 Ausgabetoken, einen Wissensstand vom 16. Februar 2026 und Unterstützung für Reasoning-Token. Text- und Bildeingabe, Textausgabe.
Preise
$0.20 Eingabe, $0.02 Cache-Eingabe, $1.20 Ausgabe pro Million. Darunter gibt es eine echte Rabattstaffel, die die meisten Berichte übersehen:
| Stufe | Eingabe /1M | Cache /1M | Ausgabe /1M |
|---|---|---|---|
| Standard | $0.20 | $0.02 | $1.20 |
| Batch | $0.10 | $0.01 | $0.60 |
| Flex | $0.10 | $0.01 | $0.60 |
| Fast mode | $0.40 | $0.04 | $2.40 |
| Long context (>272K) | $0.40 | $0.04 | $1.80 |
Bei Batch oder Flex ist Lunas Eingabe zu $0.10 tatsächlich günstiger als Flashs $0.14. Wenn deine Workload nachtfreundlich ist und eingabeschwer mit kurzen Ausgaben, was auf viel Ticket-Klassifizierung zutrifft, kann Luna vorne liegen. Flash hat überhaupt keinen Batch-Rabatt.
Wo es Flash schlägt
Bildeingabe, veröffentlichte Latenz, mit der du planen kannst, und eine Datenverarbeitungs-Story, die du einem Sicherheitsprüfer geben kannst. Auch Websuche, worüber man präzise sein sollte: Flash hat tatsächlich ein serverseitiges web_search-Tool, aber nur über die Flash-exklusive Responses API, nicht über den Chat-Completions-Pfad. Die weitverbreitete Aussage "DeepSeek hat keine Websuche" ist veraltet.
Wo es das nicht tut
Die Belege auf Hacker News setzen die tatsächliche Lücke bei 2x bis 3x an, nicht bei den 4,3x, die die Ausgabespalte suggeriert, weil Lunas Cache-Eingabe auch günstig ist. Aber 3x ist immer noch 3x. Und die Latenzzahl ist brutal:
"2x to 3x the price… 2 to 5 times faster inference"
Dieses "faster inference" ist Durchsatz, nicht Reaktionsfähigkeit. Bei maximalem Aufwand liegt Lunas Zeit bis zum ersten Token bei 132,75 Sekunden. Gut für einen Batch-Job, falsch für ein Chat-Widget.
Es gibt auch eine asymmetrische Klippe, die man einplanen sollte: Prompts über 272K Eingabe berechnen die gesamte Anfrage neu, zum doppelten Eingabe- und 1,5-fachen Ausgabepreis, nicht nur den Überhang. Cache-Schreibvorgänge werden zum 1,25-Fachen des unkomprimierten Preises abgerechnet.
Fazit
Wenn der Grund, Flash zu verlassen, Bildeingabe oder ein Compliance-Gespräch ist, ist das die erste Sache, die du probieren solltest, und die Batch-Rate macht es günstiger, als man annimmt. Ich würde es bei maximalem Aufwand nicht auf eine interaktive Fläche setzen. Die vollständige Stufen-Aufschlüsselung findest du im Leitfaden zu GPT-5.6-Preisen, und die GPT-5.6-Review deckt die gesamte Familie ab.
2. Gemini 3.5 Flash-Lite

Am besten für: hochvolumige Klassifizierung, Triage, und alles, wo Token pro Sekunde der Flaschenhals ist.
Was es tatsächlich ist
Googles günstigstes allgemein verfügbares Modell in der 3.5-Reihe, auf der eigenen Modellseite beschrieben als "unser schnellstes, kosteneffizientestes 3.5-Modell für Hochdurchsatz-Ausführung." Modellcode ist gemini-3.5-flash-lite, 1.048.576 Eingabekontext, 65.536 Ausgabe, und es nimmt Text, Bild, Sprache, Video und PDF entgegen.
Preise
$0.30 Eingabe und $2.50 Ausgabe pro Million bei Standard. Batch und Flex halbieren beides auf $0.15/$1.25. Priority liegt bei $0.54/$4.50. Kontext-Caching kostet $0.03.
Wo es Flash schlägt
Zwei Zahlen. 366 Token pro Sekunde, das schnellste hier, und 43M Ausgabetoken, um den AA-Index zu durchlaufen, gegenüber Flashs 210M. AA nennt es "recht knapp" und Flash "sehr redundant." Diese Knappheit ist der Grund, warum ein Modell mit nominell 9-fach höherer Ausgaberate den Index-Lauf nur für $153,08 gegenüber Flashs $72,02 durchführte, also etwa das 2-Fache, nicht das 9-Fache.
Multimodale Eingabe ist über vier Modalitäten hinweg nativ. Und Googles kostenpflichtige Stufe ist explizit, wo DeepSeeks schweigt: Die Preisseite listet "Inhalte werden nicht zur Verbesserung unserer Produkte genutzt" als Eigenschaft der kostenpflichtigen Stufe, gegenüber "Inhalte werden zur Verbesserung unserer Produkte genutzt" in der kostenlosen Stufe.
Wo es das nicht tut
Intelligence Index 36 gegenüber Flashs 50. Das ist keine kleine Lücke, es ist eine andere Gewichtsklasse, und Flash-Lite wird bei allem Agentischen oder Mehrschrittigen schlechter sein. Keine Computer-Nutzung zu irgendeinem Preis. Die Zeit bis zum ersten Token liegt bei 8,41s, sechsmal so viel wie Flash.
Fazit
Wenn du Intent-Klassifizierung oder Sentiment-Analyse über einen Feuerwehrschlauch betreibst, ist das die richtige Form, und die Knappheit spart echtes Geld. Wenn du einen Agenten betreibst, ist es das nicht. Mehr im Überblick zu Gemini 3.5 Flash-Lite.
3. Gemini 3.6 Flash

Am besten für: Flashs Intelligenz mit einem Drittel der Ausgabetoken zu erreichen, plus Computer-Nutzung.
Was es tatsächlich ist
Googles Flash-Arbeitspferd, gestartet am 21. Juli 2026, positioniert als das Modell, das "Geschwindigkeit mit Intelligenz ausbalanciert, um starke Leistung bei agentischen und multimodalen Aufgaben zu liefern." Der Wissensstand wurde auf März 2026 verschoben. Computer-Nutzung ist eingebaut. 1M Kontext, 65K Ausgabe.
Preise
$1.50 Eingabe, $7.50 Ausgabe pro Million. Batch halbiert beides auf $0.75/$3.75.
Wo es Flash schlägt
Das ist der Punkt, der verändert hat, wie ich den gesamten Vergleich lese. Gemini 3.6 Flash erreicht exakt die gleichen 50 Punkte wie Flash, und schafft das mit 59M Ausgabetoken gegenüber Flashs 210M. Auf der Preistabelle ist das eine 26,8-fache Lücke bei der Ausgabe. Auf AAs tatsächlicher Index-Lauf-Rechnung sind es $726,70 gegenüber $72,02, was 10,1x ergibt.
10x ist immer noch 10x, also ist das kein günstigeres Modell. Aber die Richtung ist entscheidend: jeder Verbosity-Vergleich in diesem Artikel bewegt sich zu Flashs Nachteil, und wenn du nach der Pro-Token-Spalte budgetiert hast, hast du deine Ersparnisse überschätzt.

Es bringt außerdem vier Eingabemodalitäten, 213 Token pro Sekunde und Computer-Nutzung mit, was sonst nichts auf dieser Liste in dieser Preisklasse bietet.
Wo es das nicht tut
10x die Kosten pro Aufgabe bei Intelligenz-Parität. Zeit bis zum ersten Token von 15,69s. Geschlossene Gewichte, sodass Self-Hosting keine Option ist.
Fazit
Die Wahl, wenn das Modell agentische Arbeit über eine gemischte Medien-Wissensdatenbank verrichtet und du die Token-Anzahl senken willst. Lies den Überblick zu Gemini 3.6 Flash, oder die Review für die Eval-Details.
4. Claude Haiku 4.5

Am besten für: das schnellste erste Token in der Gruppe, und die einfachste Sicherheitsprüfung.
Was es tatsächlich ist
Anthropics kleines Modell, claude-haiku-4-5, in der Dokumentation beschrieben als "das schnellste Modell mit nahezu Frontier-Intelligenz." Text- und Bildeingabe, 200K Kontext, Wissen bis Juli 2025. Verfügbar über die Claude API, Amazon Bedrock, Google Cloud und Microsoft Foundry.
Preise
$1.00 Eingabe, $5.00 Ausgabe pro Million.
Wo es Flash schlägt
0,96 Sekunden bis zum ersten Token, die einzige Zahl auf dieser Seite, die Flashs 1,31s schlägt, bei 90,2 Token pro Sekunde. AA nennt diese TTFT "sehr wettbewerbsfähig" gegenüber einem Median von 1,43s in seiner Preisklasse.
Das andere, worin es Flash schlägt, ist Beschaffung. Multi-Cloud-Verfügbarkeit über Bedrock und Google Cloud bedeutet, dass Datenresidenz und Vertragsgestaltung ein von jemand anderem gelöstes Problem sind, nicht deines. Meiner Erfahrung nach ist das häufiger der tatsächliche Blocker als jede Benchmark:
Beim HIPAA/BAA während der Demo komplett blockiert, beschrieben als harter Blocker, keine weiche Sorge.
Eine US-amerikanische Gesundheits- und Physiotherapie-Plattform auf Zendesk, die etwa 500 Tickets pro Monat bearbeitet
Dieser Deal ist nicht an einer Halluzinationsrate gescheitert.
Wo es das nicht tut
Intelligence Index 24 ohne Reasoning, der niedrigste hier, und das kleinste Kontextfenster mit 200K gegenüber dem 1M aller anderen. AA veröffentlicht keine Index-Lauf-Kosten dafür, sodass die Kosten pro Aufgabe unbekannt sind. Anthropic bietet auch eine Reasoning-Variante an, aber die 24 ist die Non-Reasoning-Zeile, und das ist es, was $1/$5 bei Standardeinstellungen bringen.
Fazit
Wähle das, wenn Reaktionsfähigkeit und Vertragsgestaltung wichtiger sind als rohe Leistungsfähigkeit, was auf den Großteil des kundenseitigen Chats zutrifft. Wähle es nicht für agentische Arbeit. OpenAI API gegen Anthropic API deckt die Entwicklererfahrungsseite ab, und Claude Sonnet 5 Preise deckt die Stufe darüber ab.
5. Kimi K3

Am besten für: den einen Fall, in dem 29-mal mehr zu zahlen vertretbar ist: Antworten, die du sich nicht leisten kannst, falsch zu haben.
Was es tatsächlich ist
Moonshot AIs Flaggschiff, gestartet am 16. Juli 2026. 2,8T Parameter insgesamt bei 104B aktiven, 1M Kontext, native Vision für Bilder und Video. Open Weights wurden am 27. Juli wie versprochen veröffentlicht, 1.561 GB über 96 Shards, unter einer kimi-k3-Lizenz mit Klauseln für große MaaS-Betreiber und sehr große Produkte.
Preise
$3 Eingabe, $0.30 Cache-Hit-Eingabe, $15 Ausgabe pro Million. Das ist Claude-Sonnet-Territorium, nicht Budget-Territorium.
Wo es Flash schlägt
Zuverlässigkeit, und das ist nicht knapp. AA-Omniscience-Halluzinationsrate 51% gegenüber Flashs 84%. Omniscience Index 18 gegenüber Flashs -16, wobei eine negative Punktzahl mehr falsche als richtige Antworten bedeutet. Genauigkeit 46% gegenüber 37%. Die höchste rohe Intelligenz in diesem Vergleich mit 57.
Wenn dein Anwendungsfall eine regulierte Branche oder ein KI-Agent ist, der mit Geld hantiert, ist dieser Unterschied das ganze Argument.
Wo es das nicht tut
Die Kosten, und nicht nur mit der Listenpreis-Marge. Die Ausgaberate liegt 54-fach über Flash, aber AAs Kosten pro Aufgabe liegen bei $0.03 gegenüber $0.86, sodass die tatsächliche Lücke 29x beträgt, weil K3 pro Intelligenzpunkt wortreicher ist. Gesamter Index-Lauf: $72.02 gegenüber $2.437,41.
36 Token pro Sekunde, das langsamste hier. Und es gibt kein Budget-K3: AA listet eine separate K3-(low)-Zeile mit einem Intelligence Index von 47, drei Punkte unter Flash, mit Kosten von $0.24 pro Aufgabe, was 8x Flash ist, und nicht schneller. Moonshots eigener Quickstart bestätigt, dass Reasoning nicht abgeschaltet werden kann, sodass die Effort-Level eine Latenzkontrolle statt einer Kostenstufe sind.
Noch etwas Erwähnenswertes für alle, die Datenrichtlinien vergleichen: Moonshots Bedingungen sind explizit und permissiv, wo DeepSeeks schweigen. Abschnitt 4 besagt, dass "sofern nicht ausdrücklich schriftlich anders vereinbart, Kundeninhalte für die genannten Zwecke verwendet werden können", mit Opt-out nur über eine ausgehandelte Enterprise-Vereinbarung. Die Daten liegen in Singapur.
Fazit
Kaufe es, wenn eine falsche Antwort mehr kostet als das 29-Fache der Token-Rechnung, was eine echte Situation ist und enger gefasst, als die meisten Käufer denken. Ansonsten geht die Rechnung nicht auf. Ich bin diesem direkten Vergleich in Flash gegen Kimi K3 gründlich nachgegangen, und es gibt auch eine Kimi K3 Review und einen Preisleitfaden.
6. DeepSeek V4 Pro

Am besten für: in der Familie zu bleiben, wenn du Recall statt Reasoning brauchst.
Was es tatsächlich ist
Die größere V4-Stufe, deepseek-v4-pro, mit 49B aktiven Parametern gegenüber Flashs 13B. Noch auf dem April-Preview-Build ohne 0731-Äquivalent, was der ganze Grund ist, warum dieser Vergleich seltsam ist.
Preise
$0.435 Cache-Miss-Eingabe, $0.003625 Cache-Hit-Eingabe, $0.87 Ausgabe pro Million. Das ist 3,11x Flash bei Cache-Miss-Eingabe und Ausgabe, aber nur 1,29x bei Cache-Hits.
Wo es Flash schlägt
Recall und die Suche in langem Kontext, was die zusätzlichen aktiven Parameter kaufen. Aus DeepSeeks eigener Cross-Mode-Tabelle bei maximalem Aufwand: SimpleQA-Verified 57.9 gegenüber 34.1, GDPval-AA Elo 1554 gegenüber 1395, BrowseComp 83.4 gegenüber 73.2, und MRCR bei 1M Kontext 83.5 gegenüber 78.7.
Und die menschliche Abstimmung stimmt Pro zu, nicht dem automatisierten Index. LMArena Text platziert Pro bei 1458±4 gegenüber Flashs 1436±4 über jeweils rund 49.000 Stimmen. Zwei Boards, beide richtig, die unterschiedliche Dinge messen.
Wo es das nicht tut
Flash 0731 schlägt den Pro-Preview bei allen neun agentischen Zeilen, die DeepSeek veröffentlicht, wobei DeepSWE 54.4 gegenüber 12.8 die größte ist. AA sieht Flash bei 50 und $0.03 pro Aufgabe gegenüber Pro bei 44 und $0.05. Es ist ehrlicherweise erwähnenswert, dass zwei dieser neun Zeilen DeepSeeks eigene interne Sätze sind und der Test-Harness unveröffentlicht ist.
Es gibt auch keinen günstigen Pro-Lauf. DeepSeeks veröffentlichte Effort-Mapping-Tabelle bedient eine low-Anfrage bei Pro mit high, sodass du 3,11x zahlst und das Reasoning nicht herunterregeln kannst. Dieses Mapping sollte Anfang August 2026 geändert werden.
Fazit
Eine enge, aber echte Wahl: wähle Pro für abrufintensive Arbeit über lange Dokumente, bleib bei Flash für agentische und Coding-Arbeit. Volles Detail in Flash gegen V4 Pro.
7. Selbst-Hosting der Flash-Gewichte

Am besten für: das Modell zu behalten und das Residenz-Problem in einem Schritt zu lösen.
Was es tatsächlich ist
Kein anderes Modell. Der gleiche MIT-lizenzierte DeepSeek-V4-Flash-0731-Checkpoint, der auf Hardware läuft, die du kontrollierst. Dieser Eintrag verdient seinen Platz, weil heute eine Produktionskonfiguration veröffentlicht wurde und auf der Hacker News Front Page mit 165 Punkten landete.
Preise
Hardware, nicht Token. Was genau der Punkt ist, wenn dein Blocker eine Sicherheitsprüfung statt eines Budgets ist.
Wo es Flashs API schlägt
Die veröffentlichten Zahlen auf einer einzelnen AMD MI300X, aus dem im Repo fixierten vLLM-ROCm-Stack:
| Metrik | Ergebnis |
|---|---|
| Single-Stream-Decode | 168,6 tok/s |
| Prefill mit optimierten Kerneln | ~7,9–8,5K tok/s |
| 8 gleichzeitige Streams | 542 tok/s aggregiert, 90,3 tok/s Median pro Stream |
| 64-Stream-Burst | 830 tok/s aggregiert, kein OOM |
| Validierter Kontext | 256K (Architektur unterstützt 1M) |
| Gewichte im HBM | 156,67 GiB, keine zusätzliche Quantisierung |
168,6 Token pro Sekunde auf einer Karte schlägt die 113 tok/s, die Artificial Analysis bei DeepSeeks eigener API misst. Das Repo ist explizit, dass "der Checkpoint so läuft, wie er ausgeliefert wird, ohne zusätzliche Gewichts-Quantisierung oder Offload", also ist das kein Tausch von Geschwindigkeit gegen Qualität.
Es beantwortet auch den Einwand, den ich am häufigsten höre, der überhaupt nichts mit dem Modell zu tun hat:
Phil fragte, ob es "irgendeine Art anderes ChatGPT oder so" verwendet, wenn es die Antwort nicht kennt, und ob sich das abschalten lässt. Gil fragte, ob das Wissen innerhalb ihrer Organisation geschlossen bleibt.
Ein technischer Prüfer bei einem B2B-Halbleiter-Hardware-Unternehmen, der Sicherheit brauchte, dass die KI nur aus dem von seiner Organisation genehmigten Wissen antwortet, nicht aus allgemeinen Trainingsdaten
Self-Hosting ist die einzige Option auf dieser Seite, die diese Frage mit einem Netzwerkdiagramm beantwortet statt mit dem Lesen von Nutzungsbedingungen.
Wo es das nicht tut
Hardware, die du beschaffen musst, und die Community ist unverblümt darüber:
"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."
Es gibt einen Workaround im selben Thread:
"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."
Noch zwei ehrliche Vorbehalte. Das Repo beschreibt den Checkpoint als 304B Parameter, während AA insgesamt 284B veröffentlicht, sodass die Parameterzahl in der Praxis widersprüchlich ist. Und DeepSeek erzielt angeblich 15K tok/s/gpu auf H800 im eigenen DSpark-Paper, laut xorfish im selben Thread, sodass in dieser Konfiguration noch Spielraum übrig ist.
Fazit
Wenn dein Grund für das Shopping Datenresidenz ist, gehört das an die Spitze deiner Liste, nicht ans Ende. Du gibst überhaupt keine Modellqualität auf. Verwandte Lektüre: Open-Source-KI-Agenten, maßgeschneiderte KI-Modelle, und Selbstbau gegen Kauf.
8. Qwen3.7-Flash

Am besten für: den günstigsten Listenpreis, wenn deine Prompts wirklich klein sind.
Was es tatsächlich ist
Alibabas Vision-Language-Reasoning-Modell, veröffentlicht am 27. Juli 2026, auf OpenRouter beschrieben als geeignet für "multimodale Agenten, visuelles Coding, Suche und Computer-Interaktion." 1M Kontext, Text plus Bild plus Video als Eingabe.
Preise
Hier wird es interessant, und hier verursacht die Namenskollision mit DeepSeeks "Flash" echte Verwirrung. Die Preise sind nach Prompt-Größe gestaffelt, sodass der Headline-Preis und der 1M-Kontext nicht beide im selben Aufruf zutreffen können:
| Prompt-Größe | Eingabe /1M | Ausgabe /1M |
|---|---|---|
| Unter 32K | $0.03 | $0.13 |
| 32K–256K | $0.10 | $0.40 |
| 256K–1M | $0.20 | $0.80 |
6,7x Schwankung bei der Eingabe. Und OpenRouter veröffentlicht den rollierenden 30-Tage-Durchschnitt dessen, was Kunden tatsächlich zahlen: $0.061 Eingabe und $0.163 Ausgabe, über dem Listenpreis, was zeigt, dass echter Traffic in den oberen Stufen landet.
Wo es Flash schlägt
Die Stufe unter 32K bei $0.03/$0.13 ist tatsächlich günstiger als Flashs $0.14/$0.28, etwa 4,6x bei der Eingabe. Es nimmt Bilder und Video, wo Flash keines von beiden kann. Cache-Lesen kostet $0.006.
Wo es das nicht tut
Fast nichts ist unabhängig verifiziert, und das ist die Geschichte, keine Fußnote. Qwen hat keine Benchmarks, keine Architektur, keine Parameterzahl veröffentlicht. Es ist überhaupt nicht auf Artificial Analysis gelistet, sodass es keinen vergleichbaren Index-Score in der obigen Tabelle gibt. Die Gewichte sind geschlossen.
Die einzige Drittanbieter-Evaluation, der ich vertraue, ist der Roboflow-Vision-Benchmark, der es auf Platz 22 von 23 insgesamt bei 61,7% einordnet, während es auf Platz 1 von 23 bei den Kosten liegt. Es identifiziert weit besser, als es lokalisiert.
"Flash" bedeutet hier günstig, nicht schnell: 59 Token pro Sekunde gegenüber Flashs 113 und Flash-Lites 366. Die Tool-Call-Fehlerrate liegt bei 8,88%, die P99-End-to-End-Latenz bei 90,19 Sekunden, und OpenRouter merkt an, dass es "von einem einzigen Anbieter gehostet" wird mit "keinen Routing-Entscheidungen zu treffen", sodass es keinen Fallback gibt, falls dieser Anbieter einen schlechten Tag hat.
Fazit
Nimm es nur, wenn deine Prompts wirklich unter 32K liegen und du Vision mit knappem Budget brauchst. Darüber löschen die Stufen den Vorteil, und die fehlenden Eval-Daten bedeuten, dass du auf Glauben kaufst. Die Stufen-Rechnung wird im Leitfaden zu Qwen 3.7 Flash Preisen durchgearbeitet, und der Überblick zu Qwen 3.7 Flash deckt die Spezifikationen ab.
Was keine dieser acht tun wird
Jedes Modell hier ist die unterste Schicht. Das ist es wert, klar gesagt zu werden, denn die Wechselentscheidung, die Leute an mich heranbringen, wird meist als Modellwahl gerahmt und ist es fast nie.
Eine 84%ige Halluzinationsrate bedeutet nicht, dass das Modell bei 84% der Tickets falsch liegt. Es ist eine AA-Omniscience-Zahl, gemessen an Fragen ohne bereitgestellten Kontext, was genau das Gegenteil davon ist, wie ein Support-Agent betrieben werden sollte. Verbinde das gleiche Modell mit RAG über ein verifiziertes Help Center, und die Zahl, die zählt, ändert sich komplett.
Das ist das Argument hinter RAG gegen LLM und Halluzinationsprävention. Die Lösung ist Grounding und Guardrails, kein besseres Basismodell.
Der Käufer-Einwand, der diese Deals wirklich entscheidet, ist nicht Genauigkeit im Abstrakten. Es ist Kontrolle. Eine CX-Führungskraft hat es besser formuliert als jede Benchmark könnte:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Eine CX-Führungskraft bei einer DTC-Nahrungsergänzungsmittel-Marke auf Gorgias und Shopify, mit rund 7.000 Tickets und 30.000 Bestellungen pro Monat
Kein Eintrag in der obigen Tabelle löst das. Konfidenz-Scores, Eskalationsregeln, Ticket-Typ-Ausschluss und ein Human in the Loop tun das, und die leben in der Schicht über der API.
Ich habe über Konfidenzschwellen und Containment-Rate separat geschrieben, weil sie der Teil sind, der entscheidet, ob das alles funktioniert.
Das zweite, was keines davon tut, ist dir die Zahl zu nennen, für die du eigentlich budgetierst. Token-Preise sind Inputs. Kosten pro Lösung ist der Output, und die beiden sind nicht proportional, sobald du Retrieval, Retries und die menschliche Zeit für Nachbereitung dazurechnest.
Was ich tatsächlich mit einer Support-Queue machen würde

Modelle für eine Support-Queue einzukaufen ist der falsche erste Schritt, und das sage ich als jemand, der diese Woche damit verbracht hat, acht Modellkarten zu lesen. Die Frage ist nicht, welches Modell am wenigsten halluziniert, sondern wie deine Genauigkeit auf deinen eigenen Tickets aussieht, und das kannst du nicht von einem Leaderboard bekommen.
Das ist genau das, was eesel tut und eine rohe API nicht kann. Es verbindet sich in wenigen Minuten mit Zendesk, Freshdesk, Gorgias, Front oder Help Scout, gründet jede Antwort in deinem Help Center, vergangenen Tickets und Makros, und führt dann eine Simulation über deine echten historischen Tickets aus, damit du die tatsächliche Lösungsrate siehst, bevor ein Kunde es tut. Wenn es deine Messlatte nicht erreicht, setzt du es nicht ein.
Die Preise liegen bei 40 Cent pro bearbeitetem Ticket, keine Sitzplatzgebühren, und du wirst nie für Tickets berechnet, die deine Menschen übernehmen. Route 200 deiner 1.000 monatlichen Tickets zum Start, und du zahlst $80. Teste eesel kostenlos mit $50 Nutzung und ohne Kreditkarte.
Ich behaupte nicht, dass eesel ein Basismodell schlauer macht. Ich behaupte, dass das, was du eigentlich suchst, ein Modell, dem du vor Kunden vertrauen kannst, gar kein Modell ist. Und der Grund, warum ich mir dessen sicher bin, ist, dass wir unseren eigenen Agenten auf Weisen versagen sehen, die keine Benchmark erfasst: das schlimmste Muster, das wir je protokolliert haben, war ein Agent, der etwa zehn Runden lang "führe Zendesk-Suchen aus" erzählte, ohne je die API zu erreichen. Nichts zerstört das Vertrauen in einen Teamkollegen schneller, als über das zu lügen, was er getan hat, und kein Index-Score hätte das vorhergesagt.
Also, welches solltest du wählen?
- Brauchst Bildeingabe → GPT-5.6 Luna. Die günstigste visionfähige Option hier, gleicht Flash bei der Intelligenz aus, kostet in der Praxis etwa das 3-Fache. Halte den Aufwand niedrig, wenn Latenz wichtig ist.
- Brauchst Datenresidenz → hoste die Flash-Gewichte selbst. Gleiches Modell, MIT-Lizenz, 168,6 tok/s auf einer MI300X. Der günstigste gemanagte Fallback ist Geminis kostenpflichtige Stufe, die schriftlich erklärt, dass deine Inhalte nicht zum Training genutzt werden.
- Brauchst Durchsatz → Gemini 3.5 Flash-Lite mit 366 tok/s und der prägnantesten Ausgabe der Gruppe. Akzeptiere Index 36.
- Brauchst weniger Ausgabetoken bei Parität → Gemini 3.6 Flash. Gleiche Punktzahl von 50 mit 59M Token statt 210M, bei 10-fachen Aufgabenkosten.
- Brauchst Zuverlässigkeit → Kimi K3. Halluzination 51% gegenüber 84%, bei 29-fachen Kosten pro Aufgabe. Bemüh dich nicht mit K3 (low).
- Brauchst Recall über lange Dokumente → DeepSeek V4 Pro. Gewinnt SimpleQA-Verified 57.9 zu 34.1, und LMArenas Wähler stimmen zu.
- Brauchst den niedrigsten Listenpreis → Qwen3.7-Flash, aber nur unter 32K-Prompts, und nur, wenn du mit fast keinen unabhängigen Evals zurechtkommst.
- Brauchst nichts davon → bleib bei Flash. Es ist das günstigste, das schnellste beim ersten Token, und es ist offen. Achte nur auf den ausstehenden 2-fachen Spitzenzeit-Zuschlag, der zwischen 9:00–12:00 und 14:00–18:00 Uhr Peking-Zeit gelten wird, sobald DeepSeek ein Startdatum ankündigt.
Wenn du ein Modell wählst, um Kundentickets zu beantworten, sind der Erklärer zum besten KI-Support-Agenten und KI-Kundenservice-Kosten nützlichere nächste Lektüren als jede der obigen Modellseiten. Wenn du eines zum Schreiben wählst, ist bestes LLM zum Blog-Schreiben der Ausgangspunkt, mit dem ich beginnen würde.
Sources
- Artificial Analysis Modellseiten, alle Zahlen geprüft am 4. August 2026: DeepSeek V4 Flash 0731
- GPT-5.6 Luna auf Artificial Analysis
- Gemini 3.6 Flash und Gemini 3.5 Flash-Lite auf Artificial Analysis
- Kimi K3 und Claude 4.5 Haiku auf Artificial Analysis
- DeepSeek API Preise und der Responses API Leitfaden
- OpenAI Platform Preise und die GPT-5.6 Luna Modellseite
- Gemini Developer API Preise und der Modellkatalog
- Claude Modelle-Überblick und Claude Preise
- Moonshot AI Modellpreise
- OpenRouter, Qwen3.7 Flash und Roboflow Vision Evals
- DeepSeek V4 Flash auf einer einzelnen AMD MI300X und dessen Hacker News Thread
- eesels internes Kundengespräch-Dossier, zitiert unter anonymisierten Deskriptoren
Frequently Asked Questions
Was ist die beste Alternative zu DeepSeek V4 Flash?
Gibt es eine günstigere Alternative zu DeepSeek V4 Flash?
Welche DeepSeek V4 Flash Alternative unterstützt Bildeingabe?
Kann ich DeepSeek V4 Flash selbst hosten, statt das Modell zu wechseln?
Trainiert DeepSeek mit API-Daten von zahlenden Kunden?
Wie viel kostet DeepSeek V4 Flash im Vergleich zu Alternativen?
Ist es sicher, DeepSeek V4 Flash direkt Kunden gegenüberzustellen?
Sollte ich DeepSeek V4 Pro statt Flash verwenden?
low-Anfrage mit high bedient wird. Vollständige Aufschlüsselung in Flash gegen V4 Pro.
Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








