DeepSeek V4 Flash vs Kimi K3: Welches solltest du nutzen?

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet August 4, 2026

Expertengeprüft
Illustration zum Vergleich von DeepSeek V4 Flash und Kimi K3 von Moonshot AI

Die Spezifikationen im Vergleich

Diese beiden Modelle erschienen innerhalb von drei Wochen zueinander. Beide aus chinesischen Labs, beide mit veröffentlichten Gewichten, und beide mit einem Kontextfenster von einer Million Token. Ungefähr dort endet auch schon die Ähnlichkeit. Hintergrund zu beiden einzeln findest du in meiner Kimi K3 Review und auch in einem Rundgang zu DeepSeek V3.2, der Generation, aus der Flash hervorgegangen ist.

DeepSeek V4 FlashKimi K3
Veröffentlicht0731-Build, 31. Juli 202616. Juli 2026
Input, Cache-Miss$0.14 / 1M$3.00 / 1M
Input, Cache-Treffer$0.0028 / 1M$0.30 / 1M
Output$0.28 / 1M$15.00 / 1M
Kontextfenster1M1.048.576
Max. Output384Kstandardmäßig 131.072, einstellbar auf 1.048.576
Parameter284B insgesamt, 13B aktiv2,8T insgesamt, 104B aktiv
Input-ModalitätenNur TextText, Bild, Video
Reasoning-SteuerungOhne oder mit Denkmodus, Denkmodus ist Standardlow / high / max, nie ausschaltbar
LizenzMITKimi K3 Lizenz, mit kommerzieller Zusatzklausel
Concurrency-Limit2.500Abhängig vom Account-Tier, nicht veröffentlicht
AA Intelligence Index5057
Kosten pro Aufgabe$0.03$0.86
Median-Output-Geschwindigkeit113 tok/s35 tok/s
Gesamtantwortzeit23,36s73,88s
AA-Omniscience-Halluzination84%51%
DeepSeek veröffentlicht beide V4-Stufen auf einer einzigen Modelle-und-Preise-Karte, mit separat aufgeschlüsselten Cache-Treffer- und Cache-Miss-Input-Raten, entnommen aus der DeepSeek API-Dokumentation
DeepSeek veröffentlicht beide V4-Stufen auf einer einzigen Modelle-und-Preise-Karte, mit separat aufgeschlüsselten Cache-Treffer- und Cache-Miss-Input-Raten, entnommen aus der DeepSeek API-Dokumentation

Eine Zeile darin lohnt sich hervorzuheben, bevor ich weitermache. DeepSeeks Cache-Treffer-Rate liegt bei $0.0028 pro Million, hundertmal günstiger als Kimis bereits rabattierte $0.30. Caching ist standardmäßig aktiv, ohne dass du Code ändern musst. DeepSeek stellt allerdings klar, dass es sich um Best-Effort handelt, und Einträge werden "normalerweise innerhalb weniger Stunden bis weniger Tage" gelöscht, also ist es ein echter Rabatt, den man nicht als Dauerzustand einplanen sollte.

Preis pro Token ist die falsche Zahl

Hier liegt die Falle bei einem Vergleich wie diesem. Die Preistabelle sagt, Flash sei beim Output 54-mal günstiger. Die Preistabelle ist nicht deine Rechnung.

Artificial Analysis veröffentlicht eine Kennzahl, die viel näher an der Realität liegt, Kosten pro Aufgabe, also der gewichtete Durchschnitt dessen, was es tatsächlich kostet, eine Aufgabe in ihrem Index abzuschließen. Nach diesem Maß kostet Flash $0.03 und K3 $0.86. Immer noch eine enorme Lücke, aber 29x und nicht 54x, und der Grund ist, dass Flash mehr Token verbraucht, um überhaupt irgendwohin zu kommen. Es produzierte 210M Output-Token beim Durchlaufen des gesamten Index, gegenüber 130M bei K3, wobei beide an einem Klassenmedian von 100M gemessen wurden. AA bezeichnet Flash als "sehr wortreich". K3 wird ebenfalls als wortreich bezeichnet. Beide sind geschwätzig, Flash nur noch mehr.

Der gesamte Indexdurchlauf kostete bei Flash $72,02 und bei K3 $2.437,41. Dieselben neun Auswertungen, dieselbe Arbeit. Wenn du gewohnt bist, KI-Ausgaben als monatliche Servicekosten statt als Preis pro Token zu betrachten, ist dieses Verhältnis das, was man sich merken sollte.

Reasoning-Token sind es, die die Lücke zwischen Preisschild und Rechnung öffnen, und das ist der Teil, den die meisten Preisvergleiche übersehen. Simon Willison ließ seinen üblichen Pelikan-Prompt durch K3 laufen und veröffentlichte dann die Quittung:

Hacker News

"95 input, 16,658 output = 25 cents! [...] (13,241 of those were reasoning tokens.) I think that's the most expensive pelican I've rendered through a Chinese model so far."

Fünfundneunzig Token rein, fünfundzwanzig Cent raus, und 79% dessen, wofür er bezahlte, war Denken, das er nie gelesen hat.

Wohin das Geld bei einer Anfrage tatsächlich fließt: 95 Input-Token erzeugen 16.658 Output-Token, davon 13.241 Reasoning-Token und nur 3.417 die eigentliche Antwort
Wohin das Geld bei einer Anfrage tatsächlich fließt: 95 Input-Token erzeugen 16.658 Output-Token, davon 13.241 Reasoning-Token und nur 3.417 die eigentliche Antwort

Beide Modelle berechnen Reasoning zum Output-Tarif, und bei beiden ist der Denkmodus standardmäßig aktiv, das gilt also für beide gleichermaßen. Nur kostet es bei einem der beiden pro Token das 54-Fache.

Es lohnt sich, hier eine ehrliche Komplikation zu benennen, statt so zu tun, als sei die Messung eindeutig geklärt. Ein Entwickler, der identische Prompts durch beide laufen ließ, stellte fest, dass der Wortreichtum-Vergleich in die andere Richtung ging:

Hacker News

"It says there that "Kimi K3 (Max)" would think/reason less than than deepseek-v4-flash, and a whole bunch of other models [...] but in my experience, K3 is probably the model that thinks/reasons the longest of all of these."

Beides kann gleichzeitig wahr sein. Der Index von AA ist eine bestimmte Mischung aus kurzen Evaluationsaufgaben, und deine Workload ist nicht diese Mischung. Die eigentliche Lehre daraus ist: Lass deine eigenen Prompts durch beide laufen und zähle die Token, denn die veröffentlichten Wortreichtum-Zahlen übertragen sich nicht sauber auf deinen Anwendungsfall.

Beim Cache-Argument allerdings ist Flash kaum zu schlagen:

Hacker News

"I don't understand how DeepSeek can be so cheap with their cache pricing - ~0.003 usd / 1Mtok. 100x less than Kimi K3, or similar numbers against pretty much any other decently sized model to my knowledge. I've been using it whenever possible as even longer agent sessions cost few cents."

Die mittlere Option, die keine ist

Das ist der Befund, den ich mir wünschen würde, wenn ich derjenige wäre, der einkauft, und er steht auf keiner Anbieterseite.

Kimi hat irgendwann nach dem Launch die Reasoning-Stufen low und high eingeführt, K3 ist also nicht mehr nur auf Höchstaufwand beschränkt. Der naheliegende Schritt ist, zu low zu greifen und den Großteil der K3-Qualität für einen Bruchteil der Rechnung zu behalten. Artificial Analysis hat diese Konfiguration separat gemessen, und sie funktioniert nicht.

Kimi K3 mit low erreicht 47 Punkte im Intelligence Index, bei $0.24 pro Aufgabe. DeepSeek V4 Flash erreicht 50 Punkte bei $0.03. Das heruntergedrehte K3 kostet achtmal so viel wie Flash und erreicht drei Punkte weniger. Es ist nicht einmal schneller, 34 Token pro Sekunde gegenüber 35 bei K3-max, mit einer leicht schlechteren Gesamtantwortzeit.

Streudiagramm von Kosten pro Aufgabe gegenüber Intelligence Index: V4 Flash günstig und hoch, K3 max teuer und hoch, K3 low eingekreist als Totzone, die mehr kostet und schlechter abschneidet
Streudiagramm von Kosten pro Aufgabe gegenüber Intelligence Index: V4 Flash günstig und hoch, K3 max teuer und hoch, K3 low eingekreist als Totzone, die mehr kostet und schlechter abschneidet

Es gibt auch keine preisliche Entlastung dabei, weil die Stufen zum gleichen Tarif abgerechnet werden. Der Kimi K3 Quickstart ist unverblümt darüber, was der Regler tut, in der Antwort auf die Frage, ob man das Reasoning ausschalten kann: "Das kannst du nicht, K3 denkt immer. Wenn das Reasoning zu lange dauert, setze reasoning_effort auf low." Es ist eine Latenzsteuerung, keine Kostenstufe. Die Ersparnis besteht nur aus den Reasoning-Token, die du vermeidest.

Die Wahl ist also binär. $0.03 zahlen oder $0.86 zahlen. So sieht das bei Volumen aus:

Was jedes Modell bei deinem Volumen abrechnet

Artificial-Analysis-Kosten pro Aufgabe, hochgerechnet. Wähle eine monatliche Aufgabenzahl.

DeepSeek V4 Flash
Am günstigsten, höhere Punktzahl
$30$300$3.000
pro Monat, bei $0.03 pro Aufgabe
Intelligence Index 50
Halluziniert bei 84%
113 Token/Sek.
Kimi K3, low-Aufwand
Diese Option meiden
$240$2.400$24.000
pro Monat, bei $0.24 pro Aufgabe
Intelligence Index 47
8x der Preis, 3 Punkte weniger
34 Token/Sek.
Kimi K3, max-Aufwand
Beste Antworten
$860$8.600$86.000
pro Monat, bei $0.86 pro Aufgabe
Intelligence Index 57
Halluziniert bei 51%
35 Token/Sek.

Eine "Aufgabe" ist hier eine Aufgabe des Artificial Analysis Intelligence Index, ein Näherungswert für deine Workload, keine exakte Entsprechung. Nutze es, um die drei Optionen gegeneinander zu vergleichen, nicht um eine Rechnung vorherzusagen.

Wo jedes Modell tatsächlich gewinnt

Bei der reinen gemessenen Intelligenz liegt K3 vorn, und auf dem Leaderboard ist das nicht knapp. 57 gegenüber 50, insgesamt siebte Zeile, und das bestplatzierte Open-Weights-Modell unter den 99, die Artificial Analysis verfolgt. Flash liegt unter den Open-Weights-Modellen auf Platz drei, hinter K3 und GLM-5.2.

Moonshots eigene Launch-Charts erzählen eine konsistente Geschichte, die man mit einer Einschränkung im Hinterkopf lesen sollte.

Moonshots Launch-Benchmark-Charts für Kimi K3 über allgemeine Agenten und visuelle Agenten hinweg, entnommen aus der Kimi K3-Ankündigung
Moonshots Launch-Benchmark-Charts für Kimi K3 über allgemeine Agenten und visuelle Agenten hinweg, entnommen aus der Kimi K3-Ankündigung

Die Einschränkung ist, dass DeepSeek in diesem Chart überhaupt nicht vorkommt. Moonshot verglich K3 mit Fable 5, GPT-5.6 Sol, Opus 4.8, GLM-5.2 und GPT-5.5, ließ dabei aber den günstigsten ernstzunehmenden Open-Weights-Konkurrenten außen vor. DeepSeek erwidert die Gefälligkeit, K3 taucht auch in dessen Charts nicht auf. Normaler Zustand bei einem Anbieter-Benchmark, und deshalb leistet der unabhängige Index in diesem Artikel den Großteil der Arbeit.

Geschwindigkeit und Durchsatz sind der Bereich, in dem Flash klar gewinnt. Es läuft mit 113 Token pro Sekunde gegenüber 35 bei K3, erstes Chunk in 1,33 Sekunden gegenüber 2,78, vollständige Antwort in 23,36 Sekunden gegenüber 73,88. Es gibt außerdem ein Concurrency-Limit von 2.500. Für alles Interaktive hört dieser Unterschied auf, eine Fußnote zu sein, und wird zum Produkt selbst:

Hacker News

"Faster iterations are way better for me, I hate waiting for 5-10 minutes on small changes. I tried to use recent versions of Kimi and GLM, but they use too much thinking for no reason and are pretty slow because of it."

Und die Langsamkeit bleibt selbst für diejenigen bestehen, die für die höchste Consumer-Stufe zahlen:

Hacker News

"I'm still considering pulling the trigger on the annual subscription of Kimi for K3 but it's sometimes slower than I'd like (at least when compared to Anthropic) even on their Vivace plan"

Auf der Flash-Seite habe ich den nützlichsten praktischen Bericht gefunden, der sechzehn echte Arbeitsaufgaben über vier Tage gegen ein deutlich teureres Modell durchführte. Das Ergebnis sollte jede Annahme dämpfen, dass günstig gleich schwach bedeutet:

Hacker News

"I benched DS4 flash and Pro vs opus 4.8 xhigh on 16 work-related tasks a month ago across 4 days. Opus 4.8 came out as a winner by 1 task only [...] But flash performed as well or better (as in being more thorough) in 13 out if 16."

Ein klarer funktionaler Unterschied, den man erwähnen sollte, bevor es weitergeht. K3 nimmt Bild- und Videoeingabe an, während Flash reiner Text ist, ohne dokumentierte Bildeingabe. Wenn deine Workload Screenshots betrifft, entscheidet das die ganze Frage von selbst, weil multimodale Eingabe nichts ist, das man nachträglich anbaut. Ebenfalls wissenswert: K3 nimmt auch keine öffentliche Bild-URL an. Base64 oder eine hochgeladene Datei-ID, sonst nichts.

Genauigkeit ist die Lücke, die zählt

Alles oben Genannte lässt sich je nach deiner Workload diskutieren. Dieser Teil weniger.

AA-Omniscience misst, ob ein Modell weiß, was es nicht weiß. Es belohnt eine korrekte Antwort, bestraft selbstsicher falsche und gibt keine Strafe für ein "Ich weiß es nicht". Bei diesem Index erreicht Flash −16 und K3 18 Punkte. In eine Halluzinationsrate übersetzt, erfindet Flash 84% der Male, in denen es an seine Grenzen kommt, eine Antwort. K3 tut das in 51% der Fälle.

Keine der beiden Zahlen ist gut. Eine ist deutlich schlechter. Und Halluzination in dieser Größenordnung ist keine Marotte, die man sich wegprompten kann, sondern eine Eigenschaft des Foundation Models, auf die man entweder sein Design ausrichtet oder von der man sich beißen lässt.

Nutzer von Flash berichten mehr oder weniger genau das, was man aus einer solchen Zahl erwarten würde:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

Die fairste Version davon kam von einem der intensivsten Nutzer des Modells, der es weniger verteidigt als vielmehr das Gerüst beschreibt, das er sich gebaut hat, um damit zurechtzukommen:

Hacker News

"It hallucinates plenty, about the same as Codex models and all other LLMs! I review all code it writes, thoroughly, check the test coverage, write tests myself, have other models/chats cross-check the work with a review skill"

Das ist die ehrliche Lesart. Flash funktioniert gut, wenn ein kompetenter Mensch jede Ausgabe prüft, und ein Coding-Workflow hat bereits einen Compiler, eine Testsuite und ein Code-Review, alles zwischen dem Modell und allem, was zählt. Das günstige Modell funktioniert, weil das Sicherheitsnetz es auffängt. Nimmt man dieses Netz weg, verlässt man sich auf das Urteilsvermögen des Basismodells selbst, was genau das ist, wovon einem eine 84%-Zahl abrät. Es ist auch das Argument für RAG statt eines rohen LLM in jedem Kontext, in dem die Antwort richtig sein muss und nicht bloß plausibel.

Hier möchte ich auf etwas hinweisen, dem ich in diesem Job immer wieder begegne. Ich baue KI-Agenten bei eesel, und wir setzen sie inzwischen seit Jahren in echten Support-Queues ein. Das Fehlermuster ist nie, dass das Modell dumm ist. Es ist, dass das Modell selbstsicher ist. Ein Kunde brachte es in einem Call über das Routen von Tickets an KI besser auf den Punkt, als ich es könnte:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Das war ein CX-Lead bei einer DTC-Nahrungsergänzungsmarke, der etwa 7.000 Tickets pro Monat über Gorgias und Shopify abwickelt. Wir haben den Deal nicht gewonnen, und der obige Einwand ist der Grund dafür. Man beachte, dass er nie danach gefragt hat, welche Punktzahl das Modell hatte. Er fragte, ob es sich zurückhält, wenn es etwas nicht weiß. Eine Halluzinationsrate aus einem Leaderboard beantwortet diese Frage nicht, und das wird auch keine Anbieterseite tun.

Fairerweise haben wir auch bei unseren eigenen Agenten gesehen, wie sie selbstsicher falschliegen. Das schlimmste Muster, das wir im Produktivbetrieb protokolliert haben, war ein Agent, der etwa zehn Runden lang "führe Zendesk-Suchen aus" erzählte, ohne die API auch nur ein einziges Mal tatsächlich aufzurufen. Nichts zerstört das Vertrauen in einen Teamkollegen schneller, als wenn er darüber lügt, was er getan hat, weshalb wir jetzt jeden Rollout gegen die tatsächliche Ticket-Historie eines Kunden simulieren, bevor er eine Live-Queue berührt.

"Offene Gewichte" bedeutet hier zwei sehr unterschiedliche Dinge

Beide Modelle veröffentlichen ihre Gewichte. Nur leistet dieses Wort in jedem Fall eine sehr unterschiedliche Arbeit.

Flash hat insgesamt 284B Parameter mit 13B aktiven, rund 167GB an Gewichten, unter einer schlichten MIT-Lizenz, und es existieren 57 Community-Quantisierungen dafür. Das bringt es in ein anderes Terrain als die meisten Open-Source-Agenten auf diesem Qualitätsniveau, und es ist klein genug, dass Fine-Tuning eine echte Option statt eines Gedankenexperiments wird.

K3s Gewichte gingen am 27. Juli auf Hugging Face online, genau an dem Datum, das Moonshot versprochen hatte, und der Safetensors-Index bestätigt 2.779.931.837.184 Parameter, unabhängig von der Pressemitteilung. Es sind außerdem 1.561 GB über 96 Shards verteilt, mit 104B aktiven Parametern.

Vergleich nebeneinander, was offene Gewichte für jedes Modell bedeuten: V4 Flash mit insgesamt 284B und 167 GB unter MIT läuft zu Hause für unter $10k, Kimi K3 mit 2,8T und 1.561 GB über 96 Shards braucht eine Maschine von etwa $100k
Vergleich nebeneinander, was offene Gewichte für jedes Modell bedeuten: V4 Flash mit insgesamt 284B und 167 GB unter MIT läuft zu Hause für unter $10k, Kimi K3 mit 2,8T und 1.561 GB über 96 Shards braucht eine Maschine von etwa $100k

Die Person, die diesen Fußabdruck ausgerechnet hat, ergänzte den entscheidenden Teil:

Hacker News

"Most importantly, we now know that the model has 104B active parameters, which is quite a lot and will make it difficult to self-host efficiently."

Die praktische Grenze zwischen den beiden wurde im V4-Flash-Launch-Thread ziemlich klar gezogen:

Hacker News

"And, at least flash can be ran "at home" with <10k in hardware, which isn't really possible / feasible with glm/k3 larger models."

Und die Rechnung, K3 zum Geldsparen selbst zu hosten, übersteht den Kontakt mit der Tabellenkalkulation nicht:

Hacker News

"At 5 tok/second, you're talking about around $195 worth of output tokens per month. There is no way I can run a usable K3 model for $195 a month of capex, opex, or any-kind-of-ex."

Die Lizenzen unterscheiden sich ebenfalls, und diese hat auch Konsequenzen. Flash ist MIT, Punkt. K3 wird unter einer angepassten Kimi K3 Lizenz mit zwei Zusatzklauseln vertrieben. Managed-Service-Betreiber mit mehr als $20M Umsatz über zwölf Monate brauchen eine separate Vereinbarung, und Produkte mit mehr als 100M monatlichen Nutzern oder $20M monatlichem Umsatz müssen "Kimi K3" in der Oberfläche anzeigen. Die meisten Leser werden nie an eine der beiden Grenzen stoßen. Wenn du aber ein Produkt darauf aufbaust, lies sie, bevor du eine MIT-ähnliche Freiheit annimmst, und beziehe sie in jede Build-versus-Buy-Entscheidung mit ein, die du triffst.

Was jeder Anbieter mit dem macht, was du sendest

Wenn der Text, den du sendest, dein eigener ist, überspringe diesen Teil. Wenn es der Text deiner Kunden ist, entscheidet dieser Abschnitt alles, und die beiden Anbieter stehen an ziemlich unterschiedlichen Stellen.

Moonshot veröffentlicht eine Position, und sie ist standardmäßig freizügig. Die Nutzungsbedingungen, zuletzt aktualisiert am 27. Mai 2026, besagen, dass ein Kunde, der Grenzen für die Trainingsnutzung wünscht, "Moonshot AI kontaktieren kann, um verfügbare Unternehmensvereinbarungen oder separate schriftliche Vereinbarungen zu besprechen", und dann dies: "Sofern nicht ausdrücklich schriftlich anders vereinbart, dürfen Kundeninhalte für die genannten Zwecke verwendet werden." Klar genug, und der Ausweg ist ein Vertrag, den man selbst aushandeln muss. Die Daten liegen in Singapur.

DeepSeek ist der interessantere Fall, da es für die kostenpflichtige API eine separate Vereinbarung veröffentlicht, die überhaupt nichts sagt. Die Open-Platform-Bedingungen, in Kraft seit dem 29. April 2026, enthalten einen Abschnitt "Inputs and Outputs", der bis §4.2 läuft und dann aufhört. Die Verbraucher-Nutzungsbedingungen haben eine Trainingsklausel in §4.3 desselben Abschnitts, und das API-Dokument lässt sie einfach weg. Diese Verbraucherklausel besagt ausdrücklich, dass DeepSeek "in minimalem Umfang Inputs und Outputs nutzen darf, um die Dienste bereitzustellen, zu warten, zu betreiben, weiterzuentwickeln oder zu verbessern", mit einem Opt-out-Schalter namens "Das Modell für alle verbessern".

Die zutreffende Aussage über die DeepSeek-API lautet also, dass sie schweigt, nicht dass sie sicher ist. Die API-Bedingungen beschreiben sich selbst als eine spezifische Vereinbarung unter den allgemeinen Nutzungsbedingungen, und ein spezifischer Begriff hat nur bei einem Konflikt Vorrang. Schweigen ist kein Konflikt. Keines der beiden Dokumente veröffentlicht ein Entwickler-Opt-out, eine Auftragsverarbeitungsvereinbarung oder eine Zero-Retention-Option, und die gespeicherten Daten liegen in der Volksrepublik China unter chinesischem Recht.

In der Praxis bedeutet das, dass keines von beiden eine sofort einsatzbereite First-Party-Lösung für regulierte oder kundenidentifizierende Daten ist, ohne dass du vorher ein Gespräch mit einem Vertriebsmitarbeiter führst, was bei zwei Self-Service-APIs echte Reibung bedeutet. Es ist dieselbe Art von Problem, auf das Teams bei der Änderung der KI-Richtlinie von Slack gestoßen sind, und wenn du SOC 2 oder DSGVO unterliegst, ist es das Erste, wonach dein Prüfer fragen wird. Der Umweg über einen Anbieter, der Zero-Retention-Bedingungen veröffentlicht, ist der übliche Workaround, und er kostet mehr als die oben genannten Preistabellen.

Welches solltest du also wählen?

Ich würde diese Entscheidung um eine einzige Frage herum aufbauen, und das ist nicht das Budget.

Wähle DeepSeek V4 Flash, wenn ein Mensch oder eine Maschine die Ausgabe prüft, bevor sie zählt. Coding mit Tests und Review, Batch-Klassifizierung, Massen-Textentwürfe, interne Tools, alles, was man günstig neu ausführen kann, wenn es falsch herauskommt. Bei $0.03 pro Aufgabe mit einer Cache-Treffer-Rate von $0.0028 ist es fast geschenkt, bei Volumina, bei denen K3 zu einem Posten wird, den jemand hinterfragt. Es ist außerdem um den Faktor drei schneller, was bei interaktiver Arbeit mehr zählt, als man erwarten würde. Das ist auch die Wahl, wenn Self-Hosting eine echte Anforderung ist und nicht nur eine nette Idee.

Wähle Kimi K3 mit maximalem Aufwand, wenn die Ausgabe das eigentliche Ergebnis ist und niemand sie Zeile für Zeile prüft. Lang laufende Agenten-Durchläufe, Recherche-Synthese, Situationen, in denen ein Fehler teuer ist und man ihn ohnehin nicht bemerken wird. Eine Halluzinationsrate von 51% ist immer noch keine Zahl, auf der ich unüberwachte Workflows aufbauen würde, aber sie ist eine andere Risikokategorie als 84%. Es ist außerdem das einzige der beiden, das Bilder liest.

Meide Kimi K3 mit low-Aufwand. Es kostet achtmal so viel wie Flash und erreicht eine niedrigere Punktzahl. Diese Option existiert, um deine Wartezeit zu verkürzen, nicht deine Rechnung. Wenn K3-max das Budget sprengt, lautet die Antwort ein anderes Modell und nicht ein leiseres K3, und die Übersicht der Kimi K3 Alternativen ist ein guter Startpunkt.

Eine letzte Sache lohnt sich zu sagen, weil "chinesisches Lab" und "günstig" in einem Großteil der Berichterstattung zu ein und demselben Wort verschmolzen sind, und für K3 stimmt das nicht. Sein $0.86 pro Aufgabe liegt in Reichweite der westlichen Spitze, und jemand hat diese Rechnung im Launch-Thread aufgemacht:

Hacker News

"According to artificialanalysis, cost per task is $0.94, which is almost the same as $1.04 of gpt 5.6 sol max [...] The model certainly sounds extremely impressive for something not from openai/antrophic, but the price makes it a mediocre product."

K3s Zahl hat sich seitdem bei $0.86 eingependelt, die Lücke ist also etwas größer als er sie damals hatte, aber die Form seines Arguments bleibt bestehen. Claude Sonnet 5 liegt auf genau derselben $3/$15-Preistabelle, und GPT-5.6 Sol liegt pro Aufgabe in derselben Nachbarschaft. Das günstige Ende dieses Marktes sind Flash und seinesgleichen. Nicht die 2,8T-Flaggschiffe.

Für den Rest des Feldes deckt mein Vergleich zu Qwen 3.8 Max das dritte Lab in diesem Rennen ab, während der V4-Pro-Artikel erklärt, warum DeepSeeks günstige Stufe derzeit ihre teure übertrifft.

Eines von beiden vor einen Kunden stellen

Alles oben Genannte ist eine Entwicklerentscheidung. Aber wenn du hier gelandet bist, weil du wissen wolltest, ob eines von beiden Support-Tickets beantworten kann, lautet die ehrliche Antwort, dass das Modell der unwichtigste Teil dieses Systems ist.

Ich sage das als jemand, der die KI-Agenten bei eesel baut. Ein rohes Modell mit 84% Halluzinationsrate und ein rohes Modell mit 51% scheitern in einer Support-Queue auf dieselbe Weise: Sie beantworten Dinge, die sie nicht hätten beantworten sollen. Was das behebt, ist kein besseres Basismodell. Es ist Grounding jeder Antwort in deinem verifizierten Wissen, ein Gate über einen Konfidenzwert, damit die Sache unterhalb der Schwelle still bleibt, und zu wissen, was passieren wird, bevor es passiert.

Das ist der Unterschied zwischen einem KI-Support-Agenten und einer Chat-Box, die einfach an einen API-Schlüssel angeschlossen ist. Es ist auch ein Großteil des Grundes, warum es selbst zu bauen länger dauert, als irgendjemand einplant.

Der letzte Teil lohnt sich zu übernehmen, egal ob du uns jemals nutzt oder nicht. eesel führt Simulationen gegen deine echten vergangenen Tickets aus, bevor irgendetwas live geht, sodass das, was du siehst, die tatsächliche Genauigkeit auf deinen eigenen Daten ist und nicht die eines Leaderboards, und du gehst erst live, wenn es deine Schwelle erreicht. Zuerst nur einen Teil zu routen funktioniert ebenfalls. Bearbeite 1.000 Tickets im Monat, schicke 200 davon an die KI, du zahlst für 200. Die Abrechnung erfolgt mit 40 Cent pro gelöstem Ticket, es gibt keine Sitzplatzgebühren, und für Tickets, die deine Menschen bearbeiten, wird nie etwas berechnet. $50 kostenlose Nutzung zum Start, und keine Kreditkarte nötig.

Die eesel-Berichtsansicht für einen Zendesk-Agenten, die Aufgabenvolumen, Auslöser jedes Durchlaufs und die Genehmigungs- oder Ablehnungsnutzung pro Tool zeigt
Die eesel-Berichtsansicht für einen Zendesk-Agenten, die Aufgabenvolumen, Auslöser jedes Durchlaufs und die Genehmigungs- oder Ablehnungsnutzung pro Tool zeigt

Es lässt sich in Zendesk und andere Helpdesks einbinden und liest von überall dort, wo deine Antworten bereits liegen, sei es Confluence, ein Notion-Space oder einfach dein öffentliches Hilfe-Center.

Wähle darunter das Modell, das dir gefällt. Nur lass keinen Benchmark-Wert der Grund dafür sein, dass du es mit einem Kunden betraust.

Häufig gestellte Fragen

Ist DeepSeek V4 Flash oder Kimi K3 günstiger?
DeepSeek V4 Flash, deutlich. Es kostet $0.14 pro Million Input-Token und $0.28 pro Million Output, gegenüber $3.00 und $15.00 bei Kimi K3. Bei der Kosten-pro-Aufgabe-Messung von Artificial Analysis liegt die tatsächliche Lücke bei 29x, nicht bei den 54x, die der Output-Preis nahelegt, weil Flash mehr Token verbraucht, um zu einer Antwort zu kommen. Vollständige Aufschlüsselungen in unserem Kimi K3 Preise-Leitfaden und unserem Vergleich V4 Flash vs V4 Pro.
Ist Kimi K3 besser als DeepSeek V4 Flash?
Bei der gemessenen Intelligenz ja: Kimi K3 erreicht 57 Punkte im Artificial Analysis Intelligence Index gegenüber 50 bei Flash und ist das bestplatzierte Open-Weights-Modell. Es halluziniert außerdem deutlich weniger, 51% gegenüber 84% im AA-Omniscience-Test. Ob das den 29-fachen Preis pro Aufgabe wert ist, hängt ganz davon ab, was dich eine falsche Antwort kostet. Unsere Kimi K3 Review geht tiefer auf die Qualitätsseite ein.
Kann ich DeepSeek V4 Flash oder Kimi K3 lokal betreiben?
Beide veröffentlichen ihre Gewichte, aber nur eines lässt sich realistisch selbst hosten. Flash hat insgesamt 284B Parameter mit 13B aktiven unter einer MIT-Lizenz, und manche betreiben es zu Hause mit Hardware unter $10.000. Kimi K3 hat insgesamt 2,8T Parameter über 1.561 GB und 96 Shards mit 104B aktiven Parametern, was es in sechsstellige Hardware-Regionen bringt. Unsere Übersicht der besten Open-Source-KI-Agenten zeigt, was praktisch selbst hostbar ist.
Sollte ich DeepSeek V4 Flash für den Kundensupport nutzen?
Nicht roh. Eine Halluzinationsrate von 84% im AA-Omniscience-Test bedeutet, dass es selbstsicher Antworten erfindet, und in einer Support-Queue wird genau das teuer. Wenn du dort ein günstiges Modell einsetzen willst, braucht es Grounding, ein Gate über einen Konfidenzwert und vorher Tests gegen deine eigene Historie. Unser Leitfaden zum Verhindern von KI-Halluzinationen erklärt die Mechanik.
Was kostet die Kimi K3 API für ein kleines Team?
Es gibt einen einheitlichen Tarif für alle: $3.00 pro Million Input-Token, $0.30 bei Cache-Treffer, und $15.00 pro Million Output, einheitlich über das gesamte 1M-Kontextfenster. Es gibt keine Kleinteam-Stufe in der API. Die Consumer-App bietet Abos von $19 bis $199 pro Monat. Wenn du pro Ergebnis statt pro Token budgetierst, ist unsere Aufschlüsselung der Kosten pro Lösung der nützlichere Rahmen.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration, die die Modellstufen DeepSeek V4 Flash und V4 Pro vergleicht
Trending

DeepSeek V4 Flash vs V4 Pro: Welche Stufe solltest du nutzen?

Die günstige Stufe von DeepSeek erzielt im unabhängigen Ranking jetzt eine höhere Punktzahl als die teure. Hier siehst du genau, wo das zutrifft, und an welchen zwei Stellen nicht.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Zwei Menschen armdrücken sich über einen Tisch, während eine dritte Person zusieht, als Sinnbild für einen direkten Modellvergleich
Trending

DeepSeek V4 Flash vs GPT-5.6: Worauf solltest du setzen?

DeepSeek V4 Flash vs GPT-5.6 mit den Preisen von August 2026. Der eigentliche Kampf ist Flash gegen Luna, bei der Intelligenz steht es unentschieden, entscheidend sind Geschwindigkeit, Bildverarbeitung und Daten.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird
Trending

DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird

DeepSeek V4 Flash listet mit $0.14 Eingabe und $0.28 Ausgabe pro Million Tokens. Echte Nutzer haben Mischraten unter einem Cent gepostet. Hier ist, was entscheidet, welche davon dich trifft.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt
Trending

DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt

DeepSeek V4 Flash kostet $0,14 pro Million Input-Tokens und $0,28 pro Million Output-Tokens und übertrifft dabei DeepSeeks eigenes teureres Modell. Das steht nicht auf der Preistabelle.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration, die Alibabas Qwen 3.8 Max gegen DeepSeek V4 Flash abwägt
Trending

Qwen 3.8 Max vs DeepSeek V4 Flash: Preis, Specs, echtes Urteil

Ein Modell kostet 21x mehr pro Output-Token als das andere. Das ist das am wenigsten interessante an diesem Vergleich, und hier ist, was die Specs tatsächlich entscheiden.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Illustration, die Alibabas Qwen 3.8 Max und Moonshot AIs Kimi K3 gegenüberstellt
Trending

Qwen 3.8 Max vs Kimi K3: die Zahlen, die kein Labor veröffentlicht hat

Zwei chinesische Labore haben mit siebzehn Tagen Abstand ein Flaggschiff mit über 2 Billionen Parametern veröffentlicht, und keines hat das andere in seiner Benchmark-Tabelle geführt. Hier ist, was wirklich vergleichbar ist, wie die Rechnung tatsächlich aussieht, und für welches Modell ich mich entscheiden würde.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Illustration zum Vergleich der besten Alternativen zum großen Sprachmodell Kimi K3
Trending

Die 8 besten Kimi-K3-Alternativen 2026

Kimi K3 ist ein echtes Frontier-Modell, aber weder das günstigste noch mit pünktlich verfügbaren Gewichten. Hier sind die 8 besten Kimi-K3-Alternativen mit echten API-Preisen.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Illustration einer sehr langen Katze, die sich neben einem Serverrack über einen Schreibtisch streckt, mit dem LongCat-Logo
Trending

LongCat 2.0: ein Blick ins 1,6-Billionen-Open-Weight-Modell von Meituan

LongCat 2.0 ist Meituans MIT-lizenziertes 1,6T-MoE-Modell zum Preis von 0,30 US-Dollar pro Million Input-Tokens. Ich habe jede Primärquelle gelesen, um zu sehen, was wirklich geliefert wird.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Zwei Personen lesen einen großen Nutzungszähler ab und stellen einen Stapel Abrechnungsregler ein, in Metas blauer Markenfarbe
Trending

Meta Muse Spark 1.1 Preise: Die Rechnung hat vier Zähler

Muse Spark 1.1 kostet laut Listenpreis $1,25 Eingabe und $4,25 Ausgabe pro Million Tokens. Vier separate Zähler bestimmen die tatsächliche Rechnung, und der Listenpreis ist der kleinste davon.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten