Qwen 3.7 Flash im Test: ein 0,03-Dollar-Vision-Modell mit Haken

Rama Adi Nugraha
Geschrieben von

Rama Adi Nugraha

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 31, 2026

Expertengeprüft
Illustration eines Entwicklers, der mit Bild-, Video- und Dokumentpanels arbeitet, mit dem Qwen-Logo

Was Qwen 3.7 Flash tatsächlich ist

Ich baue beruflich Integrationen und APIs. Mein erster Instinkt bei jedem Launch ist deshalb, die Ankündigung zu ignorieren und direkt die Modellkarte zu lesen, und bei Qwen 3.7 Flash war das einfach, weil es keine Ankündigung gab, die man hätte ignorieren müssen.

Es gibt keinen Qwen-Blogbeitrag zu diesem Modell. Der Artikel-Feed von qwen.ai enthält Launch-Beiträge zu Qwen 3.7 Max und Qwen 3.7 Plus, aber nichts zu Flash. Eine einzige Zeile im QwenCloud-Changelog, datiert auf den 25. Juli 2026, ist die einzige offizielle Mitteilung, die existiert.

Es ging am 27. Juli 2026 auf OpenRouter live, unter dem kanonischen Slug qwen/qwen3.7-flash-20260727, mit einem gepinnten Snapshot namens qwen3.7-flash-2026-07-15.

Hier ist die vollständige Positionierungsaussage, wörtlich aus der Alibaba-Cloud-Modellkarte übernommen:

"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."

Das ist der gesamte Pitch. Keine Benchmark-Tabelle, kein Eval-Name, keine Prozentzahl, keine Architektur. Qwen hat die Parameterzahl nicht veröffentlicht. Auch nicht, ob es dicht oder ein Mixture-of-Experts ist, noch wie viele Token es gesehen hat. Für ein Unternehmen, das seinen Ruf auf offenen Releases aufgebaut hat, ist das eine andere Haltung, und die Community hat es bemerkt.

Die mechanischen Fakten sind nützlicher. Text, Bild und Video rein, Text raus. Der Kontext beträgt 1.000.000 Token, mit einer nutzbaren Eingabe von maximal 991.808 und einer Ausgabe von maximal 65.536, das ist die Hälfte dessen, was Plus und Max erlauben. Das Chain-of-Thought-Budget reicht bis 262.144 Token, und Reasoning ist standardmäßig aktiviert. Function Calling funktioniert. Es gibt auch eingebaute Tools für Code-Interpretation und Web-Extraktion sowie Bild- und Textsuche.

Drei Karten, die Qwen 3.7 Flash, Plus und Max nach Preis, Durchsatz und Eingabemodalität vergleichen
Drei Karten, die Qwen 3.7 Flash, Plus und Max nach Preis, Durchsatz und Eingabemodalität vergleichen

Die Familienkarte hält eine echte Überraschung bereit. Flash ist das günstigste der drei und das schnellste der drei, 59 Token pro Sekunde gegenüber 12 bei Plus, und es ist auch das einzige, das Video akzeptiert. Qwen 3.7 Max, das Flaggschiff, ist reiner Text. Normalerweise ist die Budget-Stufe die verkrüppelte; hier sieht die Budget-Stufe am meisten.

Der Preis, und der Teil, den das Preisschild nicht verrät

Wenn ich nur einen Abschnitt dieses Beitrags lesen würde, wäre es dieser. Die 0,03-Dollar-Zahl, die alle zitieren, ist echt. Sie ist aber auch der beste von drei Fällen.

Prompt-GrößeInput / 1MOutput / 1MCache Read / 1MCache Write / 1M
Unter 32K Token$0,03$0,13$0,006$0,038
32K bis 256K$0,10$0,40$0,02$0,125
256K bis 1M$0,20$0,80$0,04$0,25

Diese Sätze stammen aus OpenRouters Modell-API, und dieselbe Drei-Stufen-Struktur taucht in Yuan auf Alibabas eigener Karte auf: 0,2, 0,6 und 1,2 CNY pro 1 Mio. Input in Peking, Frankfurt und Tokio. Zwei Ansichten desselben Preismodells, es gibt also keinen Widerspruch aufzulösen.

Drei ansteigende Stufen zeigen, wie der Preis mit wachsender Prompt-Größe von $0,03 auf $0,20 pro Million Input-Token steigt
Drei ansteigende Stufen zeigen, wie der Preis mit wachsender Prompt-Größe von $0,03 auf $0,20 pro Million Input-Token steigt

Das Marketing kombiniert also "günstigstes Vision-Modell" mit "1M-Kontext" und lässt dich annehmen, du bekommst beides gleichzeitig. Das stimmt nicht. Der 1M-Kontext und der 0,03-Dollar-Preis schließen sich gegenseitig aus. Alles, was tatsächlich ein langes Fenster braucht, landet in der obersten Stufe zum 6,7-Fachen des eingeplanten Satzes, egal ob es eine große Codebasis, ein Video oder ein Stapel Dokumente ist.

Nichts davon ist theoretisch. OpenRouter veröffentlicht, was seine Kunden nach Caching zahlen, als rollenden 30-Tage-Durchschnitt, und für dieses Modell sind das $0,044 Input und $0,149 Output bei einer Cache-Trefferquote von 51,0%. Dass dieser Durchschnitt über der Liste liegt, ist nur möglich, wenn ein erheblicher Teil des echten Traffics bereits in den 32K- und 256K-Stufen zahlt. Auch der Caching-Rabatt rettet einen nicht.

Rechne mit deinen eigenen Zahlen nach.

Kontextstufen-Rechner
Was 10M Input + 2M Output Token im Monat tatsächlich kosten
Wähle die typische Prompt-Größe für deinen Workload.
$0,56 / Monat
$0,03 Input, $0,13 Output. Das ist der Satz in jeder Schlagzeile über dieses Modell, und er gilt nur für kurze Prompts.
$1,80 / Monat
$0,10 Input, $0,40 Output. Ein einziges langes Dokument oder ein mäßiger Chat-Verlauf bringt dich hierher. Das ist das 3,2-Fache der Schlagzeilen-Rechnung.
$3,60 / Monat
$0,20 Input, $0,80 Output. Das kostet der beworbene 1M-Kontext: das 6,4-Fache der Gesamtrechnung, beim gleichen Token-Volumen.

Ein paar regionale Eigenheiten sind wissenswert, bevor man sich für einen Endpoint entscheidet. Beim selben Modell kostet Singapur etwa 22% mehr als Peking, Frankfurt und Tokio. Die Websuche funktioniert nur in Peking und Singapur. Batch-Inferenz funktioniert nur in Peking, und Fine-Tuning ist nirgends verfügbar.

Wie es sich mit dem Rest der günstigen Klasse vergleicht

Selbst wenn man die Stufen berücksichtigt, bleibt der Preis die Geschichte. Hier ist das aktuelle Feld der günstigen und vision-fähigen Modelle, alle Zahlen von den Preisseiten der jeweiligen Anbieter selbst. Frontier-Preise wie Kimi K3 fallen hier nicht in den Rahmen.

ModellInput $/1MOutput $/1MKontextVisionRelease
Qwen 3.7 Flash$0,03$0,131MText, Bild, Video27. Jul. 2026
Mistral Small 4$0,15$0,60256KText, Bild16. Mär. 2026
GPT-5.6 Luna$0,20$1,201,05MText, Bild9. Jul. 2026
Gemini 3.1 Flash-Lite$0,25$1,50Nicht veröffentlichtText, BildNicht veröffentlicht
Gemini 3.5 Flash-Lite$0,30$2,501.048.576Text, Bild, Video21. Jul. 2026
Claude Haiku 4.5$1,00$5,00200KText, Bild15. Okt. 2025
Gemini 3.6 Flash$1,50$7,501.048.576Text, Bild, Video21. Jul. 2026

Ein paar Dinge fallen auf. Qwen ist hier um eine Größenordnung günstiger, 5x unter Mistral Small 4 und 10x unter Gemini 3.5 Flash-Lite beim Input. Es ist auch das einzige Modell im Feld, das Video zu einem Input-Satz unter 0,10 Dollar verarbeitet, während GPT-5.6 Luna und Mistral Small 4 nur Bilder können.

Beim eigenständigen Vergleich gibt es eine Falle zu vermeiden. Gemini 3.1 Flash-Lite ist immer noch günstiger als 3.5 Flash-Lite, mit $0,25/$1,50 gegenüber $0,30/$2,50. Neuer ist bei Googles Modellreihe nicht automatisch günstiger, wo Gemini 3.6 Flash am oberen Ende liegt. Und GPT-5.6 Luna hat seinen Preis am 30. Juli 2026 um 80% gesenkt, einen Tag bevor ich das hier geschrieben habe, was es zu einem viel engeren Konkurrenten macht, als es vor einer Woche war.

Das Modell, das es wirklich schlägt, ist aber sein eigener Vorgänger. Gegenüber Qwen 3.6-Flash bei $0,1875/$1,125 ist die neue Basis-Stufe beim Input 6,25x und beim Output 8,65x günstiger. Alibaba hat mit einem einzigen Release seinen eigenen Vision-Preisboden um eine Größenordnung gesenkt, was auch immer sonst an diesem Launch wahr ist.

"Flash" bedeutet hier billig, nicht schnell

Hier führt der Name in die Irre. Flash bedeutet bei Google niedrige Latenz. Hier bedeutet es niedrigen Preis. Das sind sehr unterschiedliche Produkte.

OpenRouter misst den alleinigen Anbieter mit 59 Output-Token pro Sekunde bei P50, mit 1,20s Time-to-First-Token. Artificial Analysis misst Gemini 3.5 Flash-Lite mit 382 Token pro Sekunde und GPT-5.4 mini mit 177. Unterschiedliche Test-Harnesses, unterschiedliche Bedingungen, das Verhältnis also mit Vorsicht behandeln. Eine 6-fache Lücke ist trotzdem noch viel zu groß, um bloßes Messrauschen zu sein, und dass Reasoning standardmäßig aktiviert ist, drückt die Zahl weiter nach unten.

Es gibt einen abweichenden Datenpunkt. Ein Entwickler, der es in einem Coding-Tool getestet hat, berichtete von deutlich besserem Durchsatz, als OpenRouters Telemetrie zeigt:

"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."

Seine 150 TPS entsprechen etwa dem 2,5-Fachen des von OpenRouter gemessenen P50, und kurze Prompts mit warmem Cache können das bewirken. Ich würde trotzdem lieber mit den 59 als mit den 150 planen, weil OpenRouter den echten Produktions-Traffic misst.

Der Ausreißer-Bereich ist der Teil, der mir schlaflose Nächte bereiten würde. Die End-to-End-Latenz liegt bei P50 bei 3,56s und bei P75 bei 8,54s, das ist in Ordnung. Dann geht es bei P90 auf 17,96s, bei P95 auf 29,03s und bei P99 auf 90,19s.

Horizontales Balkendiagramm, das zeigt, wie die End-to-End-Latenz von 3,6 Sekunden bei P50 auf 90,2 Sekunden bei P99 ansteigt
Horizontales Balkendiagramm, das zeigt, wie die End-to-End-Latenz von 3,6 Sekunden bei P50 auf 90,2 Sekunden bei P99 ansteigt

Für einen Batch-Job ist dieser Ausreißer-Bereich unsichtbar. Für alles, worauf ein Mensch wartet, hört eine von hundert Anfragen, die anderthalb Minuten dauert, auf, nur eine Metrik zu sein, und wird zu einer Produktentscheidung. Und das potenziert sich innerhalb einer KI-Agenten-Schleife, wo ein einziger langsamer Tool-Aufruf jeden nachfolgenden Schritt blockiert.

Zwei weitere Zahlen aus demselben Panel. Die Tool-Call-Fehlerrate liegt bei 8,88%, gegenüber 6,45% bei Plus, das bedeutet, dass etwa jeder elfte Tool-Aufruf bei einem Modell fehlschlägt, das explizit für Agenten-Arbeit beworben wird. Und genau ein Anbieter stellt es bereit. Kein Fallback-Routing also, wenn Alibaba Cloud mal einen schlechten Nachmittag hat.

Es gibt auch einen kleinen Dokumentationskonflikt, den ich nicht auflösen konnte. Alibabas Modellkarte führt strukturierte Ausgaben als unterstützt auf. OpenRouters Parameterliste zeigt die Flag für strukturierte Ausgaben bei Flash nicht an, nur response_format, obwohl sie es bei Plus und Max anzeigt. Wenn strikte Schema-Durchsetzung für deine Pipeline wichtig ist, teste es, bevor du dich festlegst, statt einer der beiden Seiten zu vertrauen.

Der eine unabhängige Benchmark, der existiert

Qwen hat nichts veröffentlicht, also habe ich nach jemandem gesucht, der es tatsächlich bewertet hat. Es gibt genau einen.

Artificial Analysis listet dieses Modell nicht. Die Modellseite liefert einen 404, und ein Grep der Sitemap der Seite bestätigt, dass die einzigen Qwen-3.7-Seiten Max und Plus sind. Auch LMArena hat keinen Flash-Eintrag. Kein Intelligenz-Index von den üblichen Quellen also, kein Elo, und keine veröffentlichte Qualitätsbewertung irgendeiner Art.

Roboflows Vision-Evaluierungen sind die Ausnahme, und sie sind wenig schmeichelhaft:

AufgabeScoreRang
Gesamt61,7%#22 von 23
Identifikation84,4%#10 von 23
OCR-Transkription84,1%#23 von 23
Datenextraktion78,4%Nicht bewertet
Objekterkennung42,8% mAP@50#16 von 23
Objektzählung46% exakte ÜbereinstimmungNicht bewertet
Kosten pro Sample~$0,0001#1 von 23

Es landet insgesamt auf Rang 22 von 23 mit 61,7%, knapp hinter GPT-5.4 mini mit 63,5%, und auf Rang 1 von 23 bei den Kosten. Um fair zu sein: Das OCR-Ergebnis ist der letzte Platz in einem eng beieinanderliegenden Feld und kein Versagen, denn eine durchschnittliche Trefferquote von 84,1% ist absolut gesehen respektabel. Und Qwen hat OCR oder GUI-Steuerung nie als Stärke von Flash beansprucht. Das gehört zu Plus. "Letzter Platz bei OCR" ist also konsistent mit dem, was Alibaba gesagt hat, statt ein gebrochenes Versprechen zu sein.

Es macht aber klar, was man da eigentlich kauft. Identifikation ist mit 84,4% seine Stärke; Lokalisierung ist mit 42,8% seine Schwäche. Es kann dir viel besser sagen, was auf dem Bild ist, als wo genau. Wenn dein Workload "zehn Millionen Bilder nach Kategorie taggen" ist, passt das hervorragend zu einem Zehntel Cent pro tausend Samples. Wenn es "diese Rechnung lesen und die Positionen extrahieren" ist, greif zu etwas anderem.

Was die Community sagt, und warum es so wenig ist

Das ist das Merkwürdigste an dem Release, und ich finde es am aufschlussreichsten.

Ein Vision-Modell für 0,03 Dollar pro Million Token wurde vor vier Tagen gelauncht, und es gibt keinen einzigen Kommentar dazu auf Hacker News. Eine Volltextsuche nach qwen3.7-flash auf HN liefert über Storys und Kommentare hinweg, über die gesamte Zeit, null Treffer. Es wurde nie ein Launch-Thread eingereicht. Die einzige Qwen betitelte Story in diesem Zeitraum, "Qwen 3.7 or 3.8 30B – 100B. QWhen?", zog null Kommentare.

Es wird noch besser. HNs lebendige Qwen-Konversation in der Woche des Launches fand in einem DeepSeek-Thread statt, wo Leute fragten, ob Qwen jemals Vision ausliefern würde, vier Tage nachdem Qwen ein Vision-Modell ausgeliefert hatte.

Hacker News

"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."

Hacker News

"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."

Dieser zweite Kommentar trifft den Grund genau. Das Publikum, das früher Qwen-Releases verfolgte, ist die Local-Weights-Community, und Qwen hat aufgehört, sie zu bedienen. Derselbe Punkt kam in einem Thread über GLM 5.2 auf:

Hacker News

"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."

Flash ist ebenfalls closed. Hugging Face liefert dafür ein leeres Array, und Roboflow führt die Lizenz als proprietär. Jemand hoffte am Launch-Tag trotzdem noch auf das Gegenteil:

"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"

Übersetzt bedeutet das die Hoffnung, dass Qwen 3.7 bald für lokale KI verfügbar sein wird. Das wird es nicht sein.

Ich sollte ehrlich sein, was dieser Abschnitt ist. Keines dieser Zitate handelt von Flash, weil solche Zitate noch nicht existieren. Sie handeln von der 3.7er-Familie und der Lücke, die Flash füllen sollte. Die Urteile über die Familie gehen in beide Richtungen, von einem HN-Kommentator, der einen Monat täglicher Nutzung berichtet und 3.7 Pro als "völlig unbrauchbar" bezeichnet, bis hin zu chewz, der 3.7 Max in Sachen Geschwindigkeit über Opus-Niveau einordnet. Eine Zeile aus diesem Thread ist mir hängengeblieben, angesichts dessen, dass Qwen überhaupt keine Benchmarks für Flash veröffentlicht hat:

Hacker News

"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."

Es liegt eine gewisse Symmetrie darin, ein Modell ohne Benchmark-Werte an ein Publikum zu liefern, das aufgehört hatte, ihnen zu glauben.

Unterdessen nutzen die Leute es still und leise. OpenRouters Aktivitätspanel zeigt Hermes Agent als größten Verbraucher, noch vor Claude Code und einer Handvoll Coding-Tools. Die Nutzung ist echt; der Diskurs hat einfach nie stattgefunden.

Wer es tatsächlich nutzen sollte

Meine Einschätzung, unverblümt.

Greif zu, wenn du hochvolumige, risikoarme Vision-Arbeit betreibst, bei der gelegentlich falsch zu liegen billig ist und teuer zu sein fatal wäre. Massen-Bildtagging. Erstdurchgang-Inhaltsklassifizierung, Thumbnail-Triage, "ist eine Person in diesem Bild", Vorfilterung, bevor ein besseres Modell den sorgfältigen Durchgang macht. Bei etwa einem Hundertstel Cent pro Sample verändert das, was wirtschaftlich überhaupt lohnenswert zu verarbeiten ist, und das ist eine große Sache.

Lass es lieber, wenn du OCR oder Dokumentenextraktion, präzise Objektlokalisierung, vorhersehbare Latenz, hostbare Gewichte oder irgendein veröffentlichtes Qualitätssignal brauchst, das du einem Stakeholder zeigen kannst. Lass es auch, wenn deine Prompts routinemäßig lang sind, denn an dem Punkt sieht GPT-5.6 Luna nach seiner 80%igen Preissenkung schon vernünftig aus, ebenso Gemini 3.5 Flash-Lite. Beide sind zudem deutlich schneller.

Wenn du speziell die Qwen-Familie willst, aber mehr Leistung brauchst, ist Qwen 3.8 Max das andere Ende der Spanne, und unsere Übersicht zu Qwen-Alternativen deckt den Rest ab.

Der entscheidende Faktor ist, ob eine falsche Antwort dich etwas kostet. Das ist eher eine Produktfrage als eine Benchmark-Frage, und es ist die Frage, die ich klären würde, bevor ich irgendwelchen Integrationscode schreibe.

Wenn das in die Nähe einer Support-Queue kommt, lies erst das hier

Hier muss ich unverblümt sein, denn das ist der Teil, bei dem ich wirklich Narben davongetragen habe.

Ich baue Integrationen bei eesel, und wir betreiben seit Jahren KI in echten Support-Queues über tausende echter Tickets hinweg. Das teuerste Missverständnis, das ich sehe, ist genau das, das die Preistabelle dieses Beitrags begünstigt: dass das Modell das Produkt ist. Ein 0,03-Dollar-Modell lässt es so aussehen, als wäre der Bau eines eigenen Support-Bots fast kostenlos. Die Kosten-pro-Ticket-Rechnung sieht auf einer Tabellenkalkulation auch großartig aus. Aber das Modell war nie der teure Teil.

Die teuren Teile sind das Retrieval über ein Helpcenter, das sich selbst widerspricht, die Ticket-Klassifizierung, die an die richtige Stelle routet, und zu wissen, wann man den Mund hält. Eskalation, die den Kunden nicht fallen lässt. Ein Weg herauszufinden, dass man falsch liegt, bevor es der Kunde tut. Nichts davon ist im Token-Preis enthalten. Wir haben es auf die harte Tour gelernt, als wir zugesehen haben, wie selbstbewusst klingende Bots selbstsicher falsche Antworten gegeben haben, weshalb jetzt jedes Rollout, das wir machen, gegen historische Tickets simuliert wird, bevor es eine Live-Queue berührt.

Ich werde nicht so tun, als würde bei niemandem der Selbstbau-Weg funktionieren. Ein Teil unserer eigenen Abwanderung ist genau das: Kunden, die gegangen sind, um direkt auf einer LLM-API aufzubauen, darunter eine Firma aus dem Bereich AR/Bautechnik und eine DTC-Beauty-Marke. Es ist eine echte Option, und manchmal die richtige. Aber die Teams, die am genauesten hingeschaut haben, landeten meist woanders. Ein Engineering-Lead bei einem Hersteller von Bitcoin-ATM-Hardware, der eine 300 Artikel umfassende Wissensdatenbank über Confluence und Telegram betreibt, hat es so ausgedrückt:

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Und was tatsächlich entscheidet, ob Support-KI funktioniert, ist Zurückhaltung, und das erfasst kein Modell-Score. Ein CX-Lead bei einer Marke mit 7.000 Tickets im Monat hat es besser formuliert, als es jeder Benchmark könnte:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Halte Qwen 3.7 Flash jetzt gegen diesen Maßstab. Eine Tool-Call-Fehlerrate von 8,88%, ein P99, das sich bis auf 90 Sekunden erstreckt, und kein veröffentlichter Qualitäts-Score, dazu keine unabhängige Bewertung außer der einen, die es auf Rang 22 von 23 setzt. Das sind völlig akzeptable Zahlen, um eine Million Bilder zu taggen. Es sind nicht die Zahlen, die ich zwischen meiner Marke und einem verärgerten Kunden haben möchte. Der Leitfaden zur Ticket-Abwehr und unsere Notizen zur KI-Lösungsrate gehen tiefer darauf ein, warum der Konfidenz-Schwellenwert wichtiger ist als das rohe Modell.

Wenn du trotzdem den Selbstbau-Weg gehen willst, würde ich mit RAG versus Fine-Tuning beginnen, dann etwas über Training auf der Wissensdatenbank lesen. Dann echte Zeit in die Verhinderung von Halluzinationen investieren. Keines dieser Probleme wird billiger, wenn es die Token werden.

Probiere eesel

Wenn du dir von einem 0,03-Dollar-Modell eigentlich günstigere Support-Automatisierung erhofft hast, kannst du dir die Zusammenbau-Arbeit sparen. eesel verbindet sich mit dem Helpdesk, den du bereits nutzt, lernt aus deinen vergangenen Tickets und deinem Helpcenter und beantwortet dann die Fragen, bei denen es sich sicher ist, während es den Rest in Ruhe lässt.

Der Teil, der es wert ist, geklaut zu werden, egal worauf du aufbaust: Bevor irgendetwas live geht, lässt du es gegen deine echte Ticket-Historie laufen und bekommst einen bewerteten Bericht darüber, was es geantwortet hätte. So findest du heraus, dass ein Modell falsch liegt, bevor es ein Kunde herausfindet. Es ist die Kontrolle, die kein Token-Preis dir kaufen kann.

Das eesel-Reporting-Dashboard zeigt Task-Volumen, Trigger-Events nach Typ und die Genehmigungs- oder Ablehnungsnutzung pro Tool
Das eesel-Reporting-Dashboard zeigt Task-Volumen, Trigger-Events nach Typ und die Genehmigungs- oder Ablehnungsnutzung pro Tool

Du kannst eesel kostenlos testen, oder eine Demo buchen, wenn du es lieber erst gegen deine eigene Queue laufen sehen möchtest.

Häufig gestellte Fragen

Wie viel kostet Qwen 3.7 Flash?
Es beginnt bei $0,03 pro 1 Mio. Input-Token und $0,13 pro 1 Mio. Output-Token, aber nur für Prompts unter 32K Token. Über 32K wird es $0,10/$0,40, und über 256K wird es $0,20/$0,80. OpenRouters eigener 30-Tage-Durchschnitt dessen, was Kunden tatsächlich zahlen, liegt bei $0,044 Input und $0,149 Output, also höher als der Listenpreis. Zum Kontext für den Rest der Modellfamilie siehe unsere Aufschlüsselung der Qwen-Preise.
Ist Qwen 3.7 Flash gut für OCR?
Roboflows Vision-Evaluierungen setzen es bei der OCR-Transkription auf den letzten Platz von 23 Modellen, allerdings mit einer durchschnittlichen Trefferquote von 84,1% in einem eng beieinanderliegenden Feld. Qwen hat OCR nie als Stärke von Flash beworben, das ist also konsistent und kein gebrochenes Versprechen. Wenn es um das Lesen von Dokumenten geht, ist das nicht das Modell der Wahl.
Sind die Gewichte von Qwen 3.7 Flash Open Source?
Nein. Hugging Face liefert kein Repository dafür, und Roboflow führt die Lizenz als proprietär, es ist also nur über die API verfügbar. Die gesamte 3.7er-Reihe von Qwen ist closed weight, ein Wandel gegenüber dem früheren Ruf des Unternehmens. Wenn du selbst hostbare Gewichte brauchst, ist unsere Übersicht der besten Open-Source-KI-Agenten der bessere Ausgangspunkt.
Qwen 3.7 Flash vs. Gemini 3.5 Flash-Lite: Was ist schneller?
Gemini, mit deutlichem Abstand. Artificial Analysis misst Flash-Lite mit 382 Output-Token pro Sekunde, während OpenRouter Qwen 3.7 Flash mit 59 misst. Qwen gewinnt klar beim Preis und verliert klar bei der Geschwindigkeit. Die vollständigen Zahlen stehen in unserem Beitrag zu den Gemini 3.5 Flash-Lite Preisen.
Kann ich Qwen 3.7 Flash für den Kundensupport verwenden?
Du kannst es aufrufen, aber ein rohes Modell ist kein Support-Agent. Du brauchst weiterhin ein Retrieval über dein Helpcenter, Eskalationsregeln und eine Möglichkeit, es vor dem Live-Gang zu testen. Unser Leitfaden zur Wahl eines LLM für den Support behandelt die Kompromisse, und Halluzinationsprävention behandelt den Teil, der wirklich wehtut.
Was passiert, wenn Qwen 3.7 Flash ausfällt?
Genau ein Anbieter stellt es bereit, es gibt also kein Routing-Fallback. OpenRouter meldet 99,99% Verfügbarkeit über drei Tage, ein kurzes Fenster für ein so neues Modell. Die P99-End-to-End-Latenz von 90,2 Sekunden ist das größere praktische Risiko, besonders innerhalb einer Agenten-Schleife, wo ein langsamer Tool-Aufruf alles dahinter blockiert. Siehe KI-Eskalationsmanagement für den Umgang mit dem Ausfallpfad.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration von zwei Personen, die gestaffelte Preiskarten auf einem Bildschirm betrachten, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash Preise: Was Sie 2026 tatsächlich zahlen

Der Kurs von $0.03 ist real, und er ist nur einer von vier Zählern auf Ihrer Rechnung. Hier sehen Sie, wie sich die Prompt-Staffel, der Cache, die Batch-Region und die Retry-Rate zu der Zahl summieren, die am Ende tatsächlich berechnet wird.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Illustration von Bild-, Video- und Dokumentenfeldern, die ein Vision-Language-Modell speisen, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash: Spezifikationen, Preise und was es wirklich kann

Qwen 3.7 Flash kam ohne Blogbeitrag, ohne Benchmarks und ohne Gewichte auf den Markt. Hier ist das vollständige Datenblatt, die gestufte Preisstruktur und das, was Qwen nie behauptet hat.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Redaktionelle Illustration eines großen Sprachmodells, das über einen langen Dokumentenstrom nachdenkt
Trending

Kimi K3 im Test: Moonshots offenes Frontier-Modell im Praxistest

Ein praxisnaher Kimi-K3-Test: Architektur, Benchmarks, die tatsächlichen Preise und was die Community in der Launch-Woche wirklich über das offene 2,8-Billionen-Parameter-Modell denkt.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Illustration von Inkling, dem im Test befindlichen offenen KI-Modell von Thinking Machines Lab
Trending

Inkling im Test: Lohnt sich das offene Modell von Thinking Machines?

Ein ehrlicher Inkling-Test: Wofür das erste offene Modell von Thinking Machines Lab wirklich gut ist, wo Preis und Benchmarks enttäuschen, und wer es tatsächlich einsetzen sollte.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Eine Werkbank für Entwickler, an der ein KI-Modell eine Aufgabe sauber abschließt und bei der Aufgabe daneben ins Stocken gerät, gehalten in Metas blauer Markenfarbe
Trending

Meta Muse Spark 1.1 im Test: hohe Decke, tiefer Boden

Muse Spark 1.1 ist das schnellste Modell im Feld und gleichzeitig eines der schwächsten bei agentischen Aufgaben. Ein Test, bei welchen Jobs die billigen Tokens sich tatsächlich lohnen.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration eines kompakten Modellchips, der ein Token über zwei beleuchtete Expertenpfade unter vielen dunklen leitet, für eine Inkling-Small-Erklärung
Trending

Inkling-Small erklärt: ein 276B-Modell, bei dem 12B die Arbeit machen

Was Inkling-Small wirklich ist: ein 276B/12B Open-Weights-MoE-Modell von Thinking Machines, das Kontextfenster, bei dem sich Dokumentation und Anbieter widersprechen, was eine Million Tokens tatsächlich kostet und wo es in einem Support-Stack seinen Platz hat.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration, die einen kleinen, geordneten Modellkern mit einem viel größeren, verworrenen vergleicht, für einen Inkling-Small-Test
Trending

Inkling-Small im Test: ein Viertel der Größe, fast genauso schlau

Ein Praxistest von Inkling-Small: Es schlägt sein eigenes 975B-Elternmodell im Coding bei einem Viertel der Größe und einem Viertel des Preises, stürzt dann aber bei der Faktentreue ab. Das kostet dieser Tausch tatsächlich.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5: Welches Modell solltest du wirklich einsetzen?

Fable 5 kostet genau doppelt so viel wie Opus 5. Ich habe beide System Cards, die Dokumentation und die unabhängigen Benchmarks durchgearbeitet, um herauszufinden, wann dieser zweite Dollar tatsächlich etwas bringt.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Claude Opus 5 im Test: nahezu Spitzenniveau beim Programmieren für die Hälfte des Preises

Ein praxisnaher Claude Opus 5 Test: was die Benchmarks wirklich zeigen, die gestiegene Halluzinationsrate, und ob das Modell in eine echte Support-Warteschlange gehört.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten