Qwen 3.7 Flash: Spezifikationen, Preise und was es wirklich kann

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 31, 2026

Expertengeprüft
Illustration von Bild-, Video- und Dokumentenfeldern, die ein Vision-Language-Modell speisen, mit dem Qwen-Logo

Was Qwen 3.7 Flash wirklich ist

Ich arbeite an den Agenten innerhalb von eesel, daher geht der größte Teil meiner Woche in die Schicht zwischen einem Modell und einem echten Nutzer, und das Erste, was ich bei jedem Launch tue, ist nach dem Mechanismus zu suchen. Bei Qwen 3.7 Flash dauerte diese Suche etwa vier Minuten. Es ist kaum ein Mechanismus veröffentlicht.

Es gibt keinen Qwen-Research-Post zu diesem Modell. Der Artikel-Feed hinter qwen.ai enthält Launch-Beiträge zu Qwen 3.7 Max und Qwen 3.7 Plus, und das Wort "Flash" taucht in keinem der beiden auf.

Die einzige offizielle Ankündigung ist ein einzelner Absatz im QwenCloud-Changelog, datiert auf den 25. Juli 2026. OpenRouter listet die Veröffentlichung als 27. Juli 2026 unter dem Slug qwen/qwen3.7-flash-20260727, und beide Daten sind dokumentiert, zwei Tage voneinander entfernt.

Hier ist das gesamte Pitch, wortwörtlich von der Alibaba Cloud Model Card:

"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."

Man beachte, mit wem der Vergleich gezogen wird. Nicht Gemini, nicht GPT, nicht Claude. Der eigene Vorgänger. Das ist ein Unternehmen, das ein inkrementelles Plattform-Update positioniert, kein Flaggschiff, und der Rest des Launches verhielt sich genauso: Er erschien als Listing, nicht als Ereignis.

Bei den mechanischen Fakten wird es interessant.

SpezifikationQwen 3.7 Flash
Kontextfenster1,000,000 Tokens
Max. Input991,808 Tokens
Max. Input, Thinking-Modus983,616 Tokens
Max. Output65,536 Tokens
Max. Chain of Thought262,144 Tokens
EingabemodalitätenText, Bild, Video
AusgabemodalitätText
ReasoningStandardmäßig aktiviert, mit Token-Budget
Fine-TuningNicht unterstützt, in keiner Region
GewichteGeschlossen, nur über API

Diese stammen direkt von der Model Studio Card, und die Thinking-Modus-Zeilen sind die einzige Stelle, an der die Seite zugibt, dass der Thinking-Modus existiert. Es gibt keinen dokumentierten enable_thinking-Parameter, kein Streaming-Flag, und überhaupt nichts darüber, wie das Modell trainiert wurde: keine Parameteranzahl, keine Aussage zu Dense- oder MoE-Architektur, keine Angabe zu Trainings-Tokens. Die einzige strukturelle Tatsache, die dokumentiert ist, ist die Tokenizer-Familie. Wer es gewohnt ist, eine ordentliche Model Card zu lesen, findet hier größtenteils leeren Raum.

Was Qwen behauptet hat, und was ganz bewusst nicht

Das ist der Abschnitt, den ich zweimal lesen würde, bevor ich irgendetwas darauf aufbaue, denn die Lücke zwischen dem, was das Internet über die Fähigkeiten dieses Modells sagt, und dem, was Alibaba sagt, ist groß.

Zwei Spalten, die gegenüberstellen, was Qwen für 3.7 Flash behauptet hat und was nie behauptet wurde
Zwei Spalten, die gegenüberstellen, was Qwen für 3.7 Flash behauptet hat und was nie behauptet wurde

Behauptet, in Qwens eigenen Worten: stärkere universelle Objekterkennung, verbesserte Wahrnehmung der realen Welt und räumliche Intelligenz, verbessertes multimodales Agentenverhalten für Such- und Code-Interpreter-Szenarien und optimiertes multimodales Coding. Jede dieser Aussagen ist ein Satz ohne Zahl dahinter.

Nirgendwo behauptet: OCR. Das Wort taucht auf keiner offiziellen Oberfläche auf. Ebenso wenig Dokumenten-Parsing. Wer nach einem günstigen Modell zum Lesen von Rechnungen sucht, dem hat Qwen nie gesagt, dass dies das richtige ist, und die eine unabhängige Bewertung, die OCR gemessen hat, stufte es auf Platz 23 von 23 ein.

Ebenfalls nie behauptet: GUI- und Computer-Nutzung. Das gehört zu Qwen 3.7 Plus, dessen Changelog-Eintrag vom Lesen von Bildschirmen und der durchgängigen Bedienung von GUIs spricht. OpenRouters redaktioneller Text sagt, Flash sei für "computer interaction" geeignet, was OpenRouters Formulierung ist, nicht Alibabas. Das wurde vielfach wiederholt, als wäre es eine Herstellerangabe.

Was real und dokumentiert ist: Function Calling und Structured Outputs sind beide als unterstützt gekennzeichnet, und die Menge an eingebauten Server-Tools, die über die Responses API erreichbar sind, ist wirklich nützlich und umfasst code_interpreter, web_search, web_extractor sowie zusätzlich Bild- und Textsuche. Prefix Completion funktioniert ebenfalls in jeder Region, genauso wie Context Caching, sowohl in impliziter als auch expliziter Form.

Eine Besonderheit auf Parameterebene für alle, die Code portieren: OpenRouters Liste der unterstützten Parameter für Flash enthält kein top_k, kein frequency_penalty und kein stop, alle drei akzeptiert das ältere Qwen 3.6 Flash hingegen. Ein Drop-in-Upgrade wird an jedem dieser Punkte scheitern.

Flash, Plus oder Max: Auswahl danach, was das Modell sehen kann

Die Qwen-3.7-Reihe ist nicht so sortiert, wie man es erwarten würde, daher lohnt es sich, sie durchzugehen statt Annahmen zu treffen. Wähle unten ein Modell, und die Karte füllt sich.

Welches Qwen-3.7-Modell passt
$0.03 in / $0.13 out

Verarbeitet Text, Bilder und Video. 1M Kontext, 59 Tokens pro Sekunde gemessen, 8.88% Tool-Call-Fehlerrate. Nirgendwo eine veröffentlichte Qualitätsbewertung. Greife darauf zurück, wenn der Job hochvolumig ist und die Kosten einer falschen Antwort gering sind: Massen-Tagging, erste Klassifizierung, Bild-Triage.

$0.32 in / $1.28 out

Verarbeitet Text und Bilder, kein Video. Etwa 10x der Preis von Flash. Das ist die Stufe, der Qwen das Lesen von Bildschirmen und die Bedienung von GUIs zuschreibt, und diejenige mit einem Artificial-Analysis-Intelligenzwert von 39. Greife darauf zurück, wenn nachgelagert etwas davon abhängt, dass die Antwort korrekt ist.

$1.48 in / $4.43 out

Nur Text. Das Flaggschiff kann überhaupt nichts sehen. Es erreicht 46 im Artificial-Analysis-Index bei 201 Tokens pro Sekunde, ist also die Reasoning-Stufe, nicht die Wahrnehmungsstufe. Greife darauf zurück für anspruchsvolle Textarbeit, und kombiniere es mit Flash, wenn Bilder im Spiel sind.

Preise sind OpenRouter-Listenpreise in der Sub-32K-Stufe. Intelligenzwerte sind Artificial-Analysis-Zahlen für Plus und Max; Flash ist dort nicht gelistet.

Die Besonderheit, die es hervorzuheben gilt: Das günstigste Modell ist das einzige, das ein Video ansehen kann, während das Flaggschiff überhaupt nichts sehen kann. Flash ist außerdem das schnellste der drei beim gemessenen Durchsatz, 59 Tokens pro Sekunde gegenüber 12 bei Plus. Normalerweise ist die Budget-Stufe diejenige, der Teile fehlen. Hier sitzt die Wahrnehmung am unteren Ende der Leiter und das Reasoning am oberen Ende, was bedeutet, dass viele reale Builds am Ende zwei der Modelle gleichzeitig aufrufen werden.

Die Preisstufen, kurz erklärt

Die Zahl $0.03 ist real. Sie ist auch der beste von drei Fällen, denn die Preisgestaltung ist danach gestuft, wie lang dein Prompt ist.

Prompt-GrößeInput / 1MOutput / 1M
Unter 32K$0.03$0.13
32K bis 256K$0.10$0.40
256K bis 1M$0.20$0.80

Die beiden Dinge also, für die das Modell bekannt ist, die $0.03-Rate und das 1M-Fenster, können in derselben Anfrage nicht beide zutreffen. Nutzt du den Kontext, zahlst du 6.7x die eingeplante Input-Rate. Alibabas eigene Karte druckt die identische Drei-Stufen-Struktur in CNY, es gibt also keinen Widerspruch zwischen den beiden Storefronts, nur zwei Währungen.

Der reale Traffic liegt bereits über dem Listenpreis: OpenRouters rollierender 30-Tage-Durchschnitt dessen, was Kunden tatsächlich zahlen, liegt bei $0.044 Input und $0.149 Output bei einer 51% Cache-Trefferrate. Die vollständige Bracket-Rechnung, die Cache-Ökonomie und den Vergleich mit dem Rest der günstigen Stufe habe ich im Qwen 3.7 Flash Review behandelt; die Preise der gesamten Familie stehen im Qwen-Preise-Beitrag.

Wo man es tatsächlich nutzen kann

Das ist der Teil, den niemand erwähnt, und der Teil, der tatsächlich Builds zum Scheitern gebracht hat, die ich live mitverfolgt habe. Das Modell ist nicht in jeder Region dasselbe Produkt.

Raster mit Websuche, Batch-Inferenz und Rate-Limits über Qwens vier Regionen
Raster mit Websuche, Batch-Inferenz und Rate-Limits über Qwens vier Regionen
FähigkeitPekingSingapurFrankfurtTokio
WebsucheUnterstütztUnterstütztNicht unterstütztNicht unterstützt
Batch-InferenzUnterstütztNicht unterstütztNicht unterstütztNicht unterstützt
Function CallingUnterstütztUnterstütztUnterstütztUnterstützt
Context CachingUnterstütztUnterstütztUnterstütztUnterstützt
Fine-TuningNicht unterstütztNicht unterstütztNicht unterstütztNicht unterstützt
Anfragen pro Minute30,00015,00015,00015,000

Wenn deine Data-Residency-Anforderungen dich nach Frankfurt oder Tokio zwingen, ist die eingebaute Websuche, auf die sich die Hälfte der Agent-Demos stützt, einfach nicht da, und du wirst stattdessen deine eigene Retrieval-Schicht aufbauen müssen. Wenn du geplant hast, das Modell als günstigen Batch-Job über ein Bildarchiv laufen zu lassen: Batch-Inferenz existiert in Peking und nirgendwo sonst. Und Fine-Tuning ist überall nicht verfügbar, in jeder Region, was den üblichen Ausweg ausschließt, einem günstigen Modell die eigene Domäne beizubringen. Prompting und Retrieval sind die einzigen Hebel, die du hast, was die Frage RAG gegen Fine-Tuning hier von selbst beantwortet.

Es gibt drei Eingangstüren dazu: QwenCloud, Alibaba Cloud Model Studio, und dann OpenRouter. Erwähnenswert: Hinter OpenRouter steht genau ein Anbieter, Alibaba Cloud International, und jede Anfrage wird direkt dorthin weitergeleitet. Kein Routing-Fallback, kein zweiter Host zum Ausweichen. Das ist ein ganz anderes Risikoprofil als bei einem Modell mit fünf Anbietern, die über den Preis konkurrieren.

Was gemessen wurde, und was nicht

Sehr wenig, und das Wenige, das existiert, lohnt eine genaue Lektüre.

Nichts von Qwen. Keine Bewertungstabelle, kein Eval-Name, kein Prozentwert, auf keiner Oberfläche. Das Changelog ist Fließtext. Die Model Card hat keinen Evaluations-Abschnitt. Die beiden Qwen-3.7-Research-Posts veröffentlichen Benchmark-Tabellen für Max und Plus und erwähnen Flash nie.

Nichts von den üblichen Bewertungsstellen. Artificial Analysis liefert dafür einen harten 404, während die Plus-Seite 200 zurückgibt, das Fehlen ist also real und kein Scraping-Fehler. Das LMArena-Leaderboard listet sieben Qwen-3.7-Einträge, und keiner davon ist Flash. Hugging Face hat kein Repo, weil es keine Gewichte gibt.

Eine unabhängige Bewertung existiert. Roboflow Vision Evals hat es bewertet, und die Form des Ergebnisses ist das Modell in Miniatur: Platz 22 von 23 insgesamt mit 61.7%, Platz 1 von 23 bei den Kosten mit rund $0.0001 pro Sample, Platz 10 bei der Identifikation mit 84.4%, und ganz hinten bei der OCR-Transkription. Ein einziges Eval-Haus ist kein Urteil, und es ist ein visionsspezifischer Test-Harness statt eines allgemeinen. Es ist trotzdem das einzige Qualitätssignal eines Dritten, das existiert.

Die Anbieter-Telemetrie ist die reichhaltigste Quelle. OpenRouter misst 59 Tokens pro Sekunde bei P50, 1.20s mediane Latenz, 99.99% Uptime und eine 8.88% Tool-Call-Fehlerrate. Die Zahl, die ich auf eine Folie setzen würde, ist der Tail: P99-End-to-End-Latenz von 90.19 Sekunden. In einer Agenten-Schleife ist ein Aufruf von hundert, der eineinhalb Minuten hängen bleibt, kein Rundungsfehler, das ist eine Warteschlange.

Das Bild der Community ist genauso dünn. Die Volltextsuche von Hacker News liefert null Treffer für das Modell, und es wurde nie eine Launch-Story eingereicht. Am 31. Juli, vier Tage nach dem Release, diskutierte HN in einem Thread über einen konkurrierenden Release genau die Lücke, die dieses Modell füllt, ohne von dessen Existenz zu wissen:

Hacker News

"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."

Ein weiterer Kommentator im selben Thread erklärt das Schweigen besser, als es jede Analyse könnte: Qwen hat aufgehört, offene Gewichte zu veröffentlichen, weshalb die Crowd, die normalerweise einen Qwen-Release verstärkt, aufgehört hat hinzusehen.

Hacker News

"Qwen/Alibaba have stopped doing open weights releases for a while."

Für wen dieses Modell geeignet ist

Basierend auf allem oben Genannten ist die ehrliche Einordnung unkompliziert.

Greife danach, wenn du hochvolumige multimodale Arbeit machst, bei der eine einzelne falsche Antwort billig und behebbar ist: Tagging von Produktbildern, erste Ticket-Klassifizierung, Screening von Videoframes, Massenextraktion, bei der ein Mensch die Ausgabe sowieso prüft. Die Nutzungsdaten stützen diese Lesart; die größten Verbraucher auf OpenRouter sind Agent-Harnesses, keine Chat-Produkte. Mit Platz 1 von 23 bei den Kosten kommt nichts anderes in der Vision-Stufe preislich nahe heran.

Lass es, wenn du OCR, GUI-Steuerung, eine belastbare Qualitätszahl, selbst hostbare Gewichte, Fine-Tuning, Tail-Latenz unter einer Sekunde oder einen zweiten Anbieter zum Ausweichen brauchst. Jeder einzelne dieser Punkte reicht für sich, um es auszuschließen.

Wenn du Gewichte willst, schau dir die Open-Source-Agent-Optionen an. Wenn du ein bewertetes, benchmarkgetestetes günstiges Modell suchst, veröffentlicht Gemini 3.5 Flash-Lite echte Zahlen.

Das Gleiche gilt für Gemini 3.6 Flash und für Mistral, und jedes der drei Modelle sagt dir, was du kaufst.

Denk länger nach, wenn du ein Modell auswählst, um darauf ein kundenseitiges Produkt zu bauen. Das ist der nächste Abschnitt, und dort habe ich tatsächlich Narben davon.

Wenn das in die Nähe einer Support-Warteschlange kommt

Ich baue die Agenten bei eesel, und wir haben jahrelang KI auf echten Support-Warteschlangen über Tausende echter Tickets laufen lassen. Der Fehler, den ich am häufigsten beobachtet habe, ist nicht, dass ein Modell dumm ist. Es ist, dass ein Modell selbstbewusst ungefähr richtig liegt.

Ein B2B-Technical-Support-Team, mit dem wir zusammengearbeitet haben und das Fahrzeugtelematik über Zendesk betreibt, ist genau darauf gestoßen. Ihr Bot begann, Kunden zu sagen "yes, we support your car model" für Marken, die gar nicht in ihrer Datenbank waren, weil ein Help-Center-Artikel sagte, das Unternehmen unterstütze alle Modelle. Das Modell hat nicht in irgendeinem exotischen Sinne halluziniert. Es hat ein Dokument gelesen, verallgemeinert und mit völliger Zuversicht geantwortet. Ihr Lead beschrieb die Einführungsphase als "trial and error in the beginning," was eine sehr höfliche Art ist, um zu beschreiben, dass man das erst in der Produktion herausgefunden hat.

Jetzt halte Qwen 3.7 Flash daneben. Eine 8.88% Tool-Call-Fehlerrate. Ein P99 von fast 90 Sekunden. Platz 23 von 23 bei OCR, während es im Schnitt trotzdem in 84.1% der Fälle mit der Ground Truth übereinstimmt, was genau das Profil eines Modells ist, das auf Arten falsch liegt, die sich richtig lesen. Keine veröffentlichte Qualitätszahl, über die man streiten könnte. Das sind gute Zahlen, um eine Million Bilder zu taggen. Es sind nicht die Zahlen, die ich zwischen einer Marke und einem verärgerten Kunden stehen haben will.

eesel-AI-Dashboard mit Zendesk-Ticket-Aktivität
eesel-AI-Dashboard mit Zendesk-Ticket-Aktivität

Die tiefere Falle ist die, die ein $0.03-Preisschild aufstellt: Es lässt das Modell wie das Produkt aussehen. Das war es nie. Die teuren Teile sind das Retrieval über ein Help Center, das sich selbst widerspricht, das Routing, das das Ticket an die richtige Stelle bringt, die Eskalation, die den Kunden nicht mitten im Satz fallen lässt, und zu wissen, wann man nichts sagt. Nichts davon kommt mit den Tokens mit. Der Kosten-pro-Ticket-Vergleich sieht auf einer Tabelle wunderbar aus, bis du das Gerüst mit einpreist.

Selbstbewusste Bots zu beobachten, die selbstbewusst falsche Antworten geben, ist der Grund, warum jetzt jedes Rollout, das wir durchführen, gegen historische Tickets simuliert wird, bevor es eine echte Warteschlange berührt, damit man sieht, was es echten Kunden geantwortet hätte, statt es von einem echten Kunden zu erfahren. Das ist ein Qualitätssicherungs-Problem, kein Modellauswahl-Problem, und es wird nicht einfacher, wenn Tokens günstiger werden.

Wenn du sowieso den Do-it-yourself-Weg gehst, und viele Teams tun das aus gutem Grund, würde ich als Lektüre wirklich mit Auswahl eines LLM für Support beginnen, dann Training auf deiner Knowledge Base.

Danach verbringe echte Zeit mit Halluzinations-Prävention und mit Human Handoff. Diese vier Probleme sind die eigentliche Arbeit. Das Modell ist der leichte Teil.

eesel ausprobieren

Wenn du hier gelandet bist, weil du eine Support-KI durchkalkulierst und $0.03 pro Million Tokens wie die Antwort aussahen, ist die ehrliche Version, dass der Token-Preis nie die Zahl war, die das entscheidet. eesel verbindet sich in wenigen Minuten mit Zendesk, Freshdesk, Gorgias und dem Rest, trainiert auf deinem bestehenden Help Center und vergangenen Tickets, und spielt sich dann, bevor es irgendjemandem antwortet, gegen Tausende deiner historischen Tickets durch, sodass du die tatsächlichen Antworten siehst, die es gesendet hätte, und die Resolution Rate, die es erreicht hätte. Du behältst die Kontrolle darüber, welche Tickets es genau berühren darf. Kostenlos zum Testen, und die Simulation läuft, bevor du dich auf irgendetwas festlegst.

Für mehr zu den umliegenden Entscheidungen: Der Ticket-Deflection-Guide zeigt, wohin das Volumen tatsächlich geht, und Top Customer Support Tools zeigt, was es sonst noch gibt.

Wenn du gerade auf eine Warteschlange starrst, sind die Hinweise zum Abbau eines Backlogs die dringendere Lektüre, und AI-Powered Customer Service liefert das größere Bild. Und wenn du die Billig-Modell-Logik vom anderen Ende des Marktes willst, macht der Claude-Opus-5-Vergleich denselben Punkt in umgekehrter Richtung.

Häufig gestellte Fragen

Was ist Qwen 3.7 Flash?
Qwen 3.7 Flash ist Alibabas günstigstes Qwen-3.7-Modell: ein natives Vision-Language-Reasoning-Modell, das Text, Bild und Video als Eingabe verarbeitet und Text zurückgibt. Es ist ausschließlich über eine API verfügbar und wird über QwenCloud, Alibaba Cloud Model Studio und OpenRouter angeboten, mit einem Kontextfenster von 1M Tokens und standardmäßig aktiviertem Reasoning. Für die breitere Modellfamilie zeigt unser Qwen-Überblick den Rest der Reihe.
Wie viel kostet Qwen 3.7 Flash?
Es kostet $0.03 pro 1M Input-Tokens und $0.13 pro 1M Output-Tokens, aber nur für Prompts unter 32K. Zwischen 32K und 256K werden es $0.10/$0.40, und über 256K werden es $0.20/$0.80. Die vollständige Bracket-Rechnung, einschließlich dessen, was OpenRouter-Kunden tatsächlich zahlen, steht in unserem Qwen 3.7 Flash Review, und die Preise für die gesamte Familie stehen in der Aufschlüsselung Qwen-Preise.
Wie groß ist das Kontextfenster von Qwen 3.7 Flash?
Auf dem Papier 1,000,000 Tokens. Die nutzbare Eingabe ist im Standardmodus auf 991,808 und im Thinking-Modus auf 983,616 begrenzt, die Ausgabe ist auf 65,536 begrenzt, und das Chain-of-Thought-Budget liegt bei 262,144. Alles, was dieses Fenster nutzt, fällt in die höchste Preisstufe, ein Aufruf mit 1M Kontext ist also kein $0.03-Aufruf.
Unterstützt Qwen 3.7 Flash Video?
Ja. Sein Modalitäts-String lautet Text+Bild+Video zu Text, was es zum einzigen Modell der Qwen-3.7-Familie macht, das Video akzeptiert. Plus nimmt Bilder, und Max ist reiner Text. Diese Umkehrung ist ungewöhnlich, da die günstigste Stufe normalerweise am wenigsten kann.
Ist Qwen 3.7 Flash Open Source?
Nein. Hugging Face liefert kein Repo dafür, OpenRouter verzeichnet eine leere Hugging-Face-ID, und Roboflow listet die Lizenz als proprietär. Die gesamte Qwen-3.7-Reihe ist closed-weight, was einen echten Bruch mit Qwens früherem Ruf darstellt. Wenn du Gewichte brauchst, die du selbst hosten kannst, starte mit unserer Übersicht der besten Open-Source-KI-Agenten.
Qwen 3.7 Flash vs. Qwen 3.7 Plus: Was ist der Unterschied?
Flash ist bei der Eingabe rund 10x günstiger, im gemessenen Durchsatz schneller und das einzige der beiden Modelle, das Video akzeptiert. Plus ist das Modell, dem Qwen das Lesen von Bildschirmen und die GUI-Bedienung zuschreibt, und es ist das mit einem Artificial-Analysis-Intelligenzwert. Flash hat überhaupt keine veröffentlichte Qualitätszahl.
Wo kann ich Qwen 3.7 Flash nutzen?
Vier Regionen: Peking, Singapur, Frankfurt und Tokio. Websuche funktioniert nur in Peking und Singapur, Batch-Inferenz gibt es nur in Peking, und Fine-Tuning ist nirgendwo verfügbar. Die Rate-Limits liegen bei 30,000 Anfragen pro Minute in Peking und 15,000 in den anderen drei Regionen.
Ist Qwen 3.7 Flash gut genug für den Kundensupport?
Für Massenklassifizierung und Tagging wahrscheinlich schon. Für die Beantwortung von Kundenanfragen sprechen die Zahlen dagegen: eine Tool-Call-Fehlerrate von 8.88%, eine P99-Latenz von rund 90 Sekunden und keine veröffentlichte Qualitätszahl. Unser Leitfaden zur Vermeidung von Halluzinationen und die Hinweise zur KI-Lösungsrate erklären, warum die Confidence-Schwelle wichtiger ist als der Token-Preis.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration von zwei Personen, die gestaffelte Preiskarten auf einem Bildschirm betrachten, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash Preise: Was Sie 2026 tatsächlich zahlen

Der Kurs von $0.03 ist real, und er ist nur einer von vier Zählern auf Ihrer Rechnung. Hier sehen Sie, wie sich die Prompt-Staffel, der Cache, die Batch-Region und die Retry-Rate zu der Zahl summieren, die am Ende tatsächlich berechnet wird.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Editorial-Illustration, die einen Vergleich von KI-Modellen als Alternativen zu Inkling darstellt
Trending

8 beste Inkling-Alternativen 2026

Inkling ist offen und interessant, aber für ein Open-Weights-Modell teuer und nicht das klügste Modell, das du betreiben kannst. Hier sind die 8 Alternativen, die ich tatsächlich ausprobieren würde, mit echten Preisen und dem jeweiligen Vorteil.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration von Inkling, dem im Test befindlichen offenen KI-Modell von Thinking Machines Lab
Trending

Inkling im Test: Lohnt sich das offene Modell von Thinking Machines?

Ein ehrlicher Inkling-Test: Wofür das erste offene Modell von Thinking Machines Lab wirklich gut ist, wo Preis und Benchmarks enttäuschen, und wer es tatsächlich einsetzen sollte.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration von Inkling, dem Open-Weights-KI-Modell von Thinking Machines Lab
Trending

Inkling erklärt: Thinking Machines' Open-Weights-KI-Modell

Was Inkling wirklich ist: das erste Open-Weights-Modell von Thinking Machines Lab, seine echten Benchmarks, was der Betrieb kostet und ob es überhaupt etwas in einer Support-Queue zu suchen hat.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Redaktionelle Illustration eines Benchmark-Ranglisten-Diagramms mit einem hohen, hervorgehobenen Balken, der ZCode und das Modell GLM-5.2 repräsentiert
Trending

ZCode: was Z.ais neuer KI-Coding-Agent wirklich ist

Ein Praxistest zu ZCode, der kostenlosen agentischen Coding-App des GLM-Teams: das Modell GLM-5.2 dahinter, die echten Beschwerden der Launch-Woche und wer sie nutzen sollte.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration zur Aufschlüsselung der PromptQL-Preise
Trending

PromptQL-Preise: Was es 2026 wirklich kostet

Eine Aufschlüsselung der PromptQL-Preise: die abrechenbare OLU-Einheit, der Einführungspreis von 0,14 $, kostenloses Guthaben, der Modell-Multiplikator, der die Rechnung wirklich bestimmt, und durchgerechnete Kosten.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Redaktionelle Illustration für einen Leitfaden dazu, was Claude Fable 5, Anthropics leistungsstärkstes KI-Modell, kann
Guides

Was kann Claude Fable 5? Ein Leitfaden Funktion für Funktion

Was kann Claude Fable 5? Tagelang unbeaufsichtigt arbeiten, Code schreiben und ausliefern, Dokumente mit 1 Mio. Tokens lesen und die eigene Arbeit prüfen. Hier erfahren Sie, was das in der Praxis bedeutet.

Riellvriany IndriawanRiellvriany IndriawanJun 17, 2026
Illustriertes Hero-Banner für einen Leitfaden zu Google Gemini 3.5 Pro Preisen und API-Kosten
Trending

Gemini 3.5 Pro Preise: die Kosten (und was noch fehlt)

Eine klare Antwort zu Gemini 3.5 Pro Preisen: Es ist noch nicht live. Hier erfährst du, was die aktuelle Pro-Stufe, die Verbraucher-Pläne und die echte API-Rechnung kosten.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Redaktionelle Illustration eines großen Sprachmodells, das über einen langen Dokumentenstrom nachdenkt
Trending

Kimi K3 im Test: Moonshots offenes Frontier-Modell im Praxistest

Ein praxisnaher Kimi-K3-Test: Architektur, Benchmarks, die tatsächlichen Preise und was die Community in der Launch-Woche wirklich über das offene 2,8-Billionen-Parameter-Modell denkt.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten