
Was Qwen 3.7 Flash tatsächlich ist
Ich baue beruflich Integrationen und APIs. Mein erster Instinkt bei jedem Launch ist deshalb, die Ankündigung zu ignorieren und direkt die Modellkarte zu lesen, und bei Qwen 3.7 Flash war das einfach, weil es keine Ankündigung gab, die man hätte ignorieren müssen.
Es gibt keinen Qwen-Blogbeitrag zu diesem Modell. Der Artikel-Feed von qwen.ai enthält Launch-Beiträge zu Qwen 3.7 Max und Qwen 3.7 Plus, aber nichts zu Flash. Eine einzige Zeile im QwenCloud-Changelog, datiert auf den 25. Juli 2026, ist die einzige offizielle Mitteilung, die existiert.
Es ging am 27. Juli 2026 auf OpenRouter live, unter dem kanonischen Slug qwen/qwen3.7-flash-20260727, mit einem gepinnten Snapshot namens qwen3.7-flash-2026-07-15.
Hier ist die vollständige Positionierungsaussage, wörtlich aus der Alibaba-Cloud-Modellkarte übernommen:
"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."
Das ist der gesamte Pitch. Keine Benchmark-Tabelle, kein Eval-Name, keine Prozentzahl, keine Architektur. Qwen hat die Parameterzahl nicht veröffentlicht. Auch nicht, ob es dicht oder ein Mixture-of-Experts ist, noch wie viele Token es gesehen hat. Für ein Unternehmen, das seinen Ruf auf offenen Releases aufgebaut hat, ist das eine andere Haltung, und die Community hat es bemerkt.
Die mechanischen Fakten sind nützlicher. Text, Bild und Video rein, Text raus. Der Kontext beträgt 1.000.000 Token, mit einer nutzbaren Eingabe von maximal 991.808 und einer Ausgabe von maximal 65.536, das ist die Hälfte dessen, was Plus und Max erlauben. Das Chain-of-Thought-Budget reicht bis 262.144 Token, und Reasoning ist standardmäßig aktiviert. Function Calling funktioniert. Es gibt auch eingebaute Tools für Code-Interpretation und Web-Extraktion sowie Bild- und Textsuche.

Die Familienkarte hält eine echte Überraschung bereit. Flash ist das günstigste der drei und das schnellste der drei, 59 Token pro Sekunde gegenüber 12 bei Plus, und es ist auch das einzige, das Video akzeptiert. Qwen 3.7 Max, das Flaggschiff, ist reiner Text. Normalerweise ist die Budget-Stufe die verkrüppelte; hier sieht die Budget-Stufe am meisten.
Der Preis, und der Teil, den das Preisschild nicht verrät
Wenn ich nur einen Abschnitt dieses Beitrags lesen würde, wäre es dieser. Die 0,03-Dollar-Zahl, die alle zitieren, ist echt. Sie ist aber auch der beste von drei Fällen.
| Prompt-Größe | Input / 1M | Output / 1M | Cache Read / 1M | Cache Write / 1M |
|---|---|---|---|---|
| Unter 32K Token | $0,03 | $0,13 | $0,006 | $0,038 |
| 32K bis 256K | $0,10 | $0,40 | $0,02 | $0,125 |
| 256K bis 1M | $0,20 | $0,80 | $0,04 | $0,25 |
Diese Sätze stammen aus OpenRouters Modell-API, und dieselbe Drei-Stufen-Struktur taucht in Yuan auf Alibabas eigener Karte auf: 0,2, 0,6 und 1,2 CNY pro 1 Mio. Input in Peking, Frankfurt und Tokio. Zwei Ansichten desselben Preismodells, es gibt also keinen Widerspruch aufzulösen.

Das Marketing kombiniert also "günstigstes Vision-Modell" mit "1M-Kontext" und lässt dich annehmen, du bekommst beides gleichzeitig. Das stimmt nicht. Der 1M-Kontext und der 0,03-Dollar-Preis schließen sich gegenseitig aus. Alles, was tatsächlich ein langes Fenster braucht, landet in der obersten Stufe zum 6,7-Fachen des eingeplanten Satzes, egal ob es eine große Codebasis, ein Video oder ein Stapel Dokumente ist.
Nichts davon ist theoretisch. OpenRouter veröffentlicht, was seine Kunden nach Caching zahlen, als rollenden 30-Tage-Durchschnitt, und für dieses Modell sind das $0,044 Input und $0,149 Output bei einer Cache-Trefferquote von 51,0%. Dass dieser Durchschnitt über der Liste liegt, ist nur möglich, wenn ein erheblicher Teil des echten Traffics bereits in den 32K- und 256K-Stufen zahlt. Auch der Caching-Rabatt rettet einen nicht.
Rechne mit deinen eigenen Zahlen nach.
Ein paar regionale Eigenheiten sind wissenswert, bevor man sich für einen Endpoint entscheidet. Beim selben Modell kostet Singapur etwa 22% mehr als Peking, Frankfurt und Tokio. Die Websuche funktioniert nur in Peking und Singapur. Batch-Inferenz funktioniert nur in Peking, und Fine-Tuning ist nirgends verfügbar.
Wie es sich mit dem Rest der günstigen Klasse vergleicht
Selbst wenn man die Stufen berücksichtigt, bleibt der Preis die Geschichte. Hier ist das aktuelle Feld der günstigen und vision-fähigen Modelle, alle Zahlen von den Preisseiten der jeweiligen Anbieter selbst. Frontier-Preise wie Kimi K3 fallen hier nicht in den Rahmen.
| Modell | Input $/1M | Output $/1M | Kontext | Vision | Release |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0,03 | $0,13 | 1M | Text, Bild, Video | 27. Jul. 2026 |
| Mistral Small 4 | $0,15 | $0,60 | 256K | Text, Bild | 16. Mär. 2026 |
| GPT-5.6 Luna | $0,20 | $1,20 | 1,05M | Text, Bild | 9. Jul. 2026 |
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 | Nicht veröffentlicht | Text, Bild | Nicht veröffentlicht |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 | 1.048.576 | Text, Bild, Video | 21. Jul. 2026 |
| Claude Haiku 4.5 | $1,00 | $5,00 | 200K | Text, Bild | 15. Okt. 2025 |
| Gemini 3.6 Flash | $1,50 | $7,50 | 1.048.576 | Text, Bild, Video | 21. Jul. 2026 |
Ein paar Dinge fallen auf. Qwen ist hier um eine Größenordnung günstiger, 5x unter Mistral Small 4 und 10x unter Gemini 3.5 Flash-Lite beim Input. Es ist auch das einzige Modell im Feld, das Video zu einem Input-Satz unter 0,10 Dollar verarbeitet, während GPT-5.6 Luna und Mistral Small 4 nur Bilder können.
Beim eigenständigen Vergleich gibt es eine Falle zu vermeiden. Gemini 3.1 Flash-Lite ist immer noch günstiger als 3.5 Flash-Lite, mit $0,25/$1,50 gegenüber $0,30/$2,50. Neuer ist bei Googles Modellreihe nicht automatisch günstiger, wo Gemini 3.6 Flash am oberen Ende liegt. Und GPT-5.6 Luna hat seinen Preis am 30. Juli 2026 um 80% gesenkt, einen Tag bevor ich das hier geschrieben habe, was es zu einem viel engeren Konkurrenten macht, als es vor einer Woche war.
Das Modell, das es wirklich schlägt, ist aber sein eigener Vorgänger. Gegenüber Qwen 3.6-Flash bei $0,1875/$1,125 ist die neue Basis-Stufe beim Input 6,25x und beim Output 8,65x günstiger. Alibaba hat mit einem einzigen Release seinen eigenen Vision-Preisboden um eine Größenordnung gesenkt, was auch immer sonst an diesem Launch wahr ist.
"Flash" bedeutet hier billig, nicht schnell
Hier führt der Name in die Irre. Flash bedeutet bei Google niedrige Latenz. Hier bedeutet es niedrigen Preis. Das sind sehr unterschiedliche Produkte.
OpenRouter misst den alleinigen Anbieter mit 59 Output-Token pro Sekunde bei P50, mit 1,20s Time-to-First-Token. Artificial Analysis misst Gemini 3.5 Flash-Lite mit 382 Token pro Sekunde und GPT-5.4 mini mit 177. Unterschiedliche Test-Harnesses, unterschiedliche Bedingungen, das Verhältnis also mit Vorsicht behandeln. Eine 6-fache Lücke ist trotzdem noch viel zu groß, um bloßes Messrauschen zu sein, und dass Reasoning standardmäßig aktiviert ist, drückt die Zahl weiter nach unten.
Es gibt einen abweichenden Datenpunkt. Ein Entwickler, der es in einem Coding-Tool getestet hat, berichtete von deutlich besserem Durchsatz, als OpenRouters Telemetrie zeigt:
"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."
Seine 150 TPS entsprechen etwa dem 2,5-Fachen des von OpenRouter gemessenen P50, und kurze Prompts mit warmem Cache können das bewirken. Ich würde trotzdem lieber mit den 59 als mit den 150 planen, weil OpenRouter den echten Produktions-Traffic misst.
Der Ausreißer-Bereich ist der Teil, der mir schlaflose Nächte bereiten würde. Die End-to-End-Latenz liegt bei P50 bei 3,56s und bei P75 bei 8,54s, das ist in Ordnung. Dann geht es bei P90 auf 17,96s, bei P95 auf 29,03s und bei P99 auf 90,19s.

Für einen Batch-Job ist dieser Ausreißer-Bereich unsichtbar. Für alles, worauf ein Mensch wartet, hört eine von hundert Anfragen, die anderthalb Minuten dauert, auf, nur eine Metrik zu sein, und wird zu einer Produktentscheidung. Und das potenziert sich innerhalb einer KI-Agenten-Schleife, wo ein einziger langsamer Tool-Aufruf jeden nachfolgenden Schritt blockiert.
Zwei weitere Zahlen aus demselben Panel. Die Tool-Call-Fehlerrate liegt bei 8,88%, gegenüber 6,45% bei Plus, das bedeutet, dass etwa jeder elfte Tool-Aufruf bei einem Modell fehlschlägt, das explizit für Agenten-Arbeit beworben wird. Und genau ein Anbieter stellt es bereit. Kein Fallback-Routing also, wenn Alibaba Cloud mal einen schlechten Nachmittag hat.
Es gibt auch einen kleinen Dokumentationskonflikt, den ich nicht auflösen konnte. Alibabas Modellkarte führt strukturierte Ausgaben als unterstützt auf. OpenRouters Parameterliste zeigt die Flag für strukturierte Ausgaben bei Flash nicht an, nur response_format, obwohl sie es bei Plus und Max anzeigt. Wenn strikte Schema-Durchsetzung für deine Pipeline wichtig ist, teste es, bevor du dich festlegst, statt einer der beiden Seiten zu vertrauen.
Der eine unabhängige Benchmark, der existiert
Qwen hat nichts veröffentlicht, also habe ich nach jemandem gesucht, der es tatsächlich bewertet hat. Es gibt genau einen.
Artificial Analysis listet dieses Modell nicht. Die Modellseite liefert einen 404, und ein Grep der Sitemap der Seite bestätigt, dass die einzigen Qwen-3.7-Seiten Max und Plus sind. Auch LMArena hat keinen Flash-Eintrag. Kein Intelligenz-Index von den üblichen Quellen also, kein Elo, und keine veröffentlichte Qualitätsbewertung irgendeiner Art.
Roboflows Vision-Evaluierungen sind die Ausnahme, und sie sind wenig schmeichelhaft:
| Aufgabe | Score | Rang |
|---|---|---|
| Gesamt | 61,7% | #22 von 23 |
| Identifikation | 84,4% | #10 von 23 |
| OCR-Transkription | 84,1% | #23 von 23 |
| Datenextraktion | 78,4% | Nicht bewertet |
| Objekterkennung | 42,8% mAP@50 | #16 von 23 |
| Objektzählung | 46% exakte Übereinstimmung | Nicht bewertet |
| Kosten pro Sample | ~$0,0001 | #1 von 23 |
Es landet insgesamt auf Rang 22 von 23 mit 61,7%, knapp hinter GPT-5.4 mini mit 63,5%, und auf Rang 1 von 23 bei den Kosten. Um fair zu sein: Das OCR-Ergebnis ist der letzte Platz in einem eng beieinanderliegenden Feld und kein Versagen, denn eine durchschnittliche Trefferquote von 84,1% ist absolut gesehen respektabel. Und Qwen hat OCR oder GUI-Steuerung nie als Stärke von Flash beansprucht. Das gehört zu Plus. "Letzter Platz bei OCR" ist also konsistent mit dem, was Alibaba gesagt hat, statt ein gebrochenes Versprechen zu sein.
Es macht aber klar, was man da eigentlich kauft. Identifikation ist mit 84,4% seine Stärke; Lokalisierung ist mit 42,8% seine Schwäche. Es kann dir viel besser sagen, was auf dem Bild ist, als wo genau. Wenn dein Workload "zehn Millionen Bilder nach Kategorie taggen" ist, passt das hervorragend zu einem Zehntel Cent pro tausend Samples. Wenn es "diese Rechnung lesen und die Positionen extrahieren" ist, greif zu etwas anderem.
Was die Community sagt, und warum es so wenig ist
Das ist das Merkwürdigste an dem Release, und ich finde es am aufschlussreichsten.
Ein Vision-Modell für 0,03 Dollar pro Million Token wurde vor vier Tagen gelauncht, und es gibt keinen einzigen Kommentar dazu auf Hacker News. Eine Volltextsuche nach qwen3.7-flash auf HN liefert über Storys und Kommentare hinweg, über die gesamte Zeit, null Treffer. Es wurde nie ein Launch-Thread eingereicht. Die einzige Qwen betitelte Story in diesem Zeitraum, "Qwen 3.7 or 3.8 30B – 100B. QWhen?", zog null Kommentare.
Es wird noch besser. HNs lebendige Qwen-Konversation in der Woche des Launches fand in einem DeepSeek-Thread statt, wo Leute fragten, ob Qwen jemals Vision ausliefern würde, vier Tage nachdem Qwen ein Vision-Modell ausgeliefert hatte.
"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."
"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."
Dieser zweite Kommentar trifft den Grund genau. Das Publikum, das früher Qwen-Releases verfolgte, ist die Local-Weights-Community, und Qwen hat aufgehört, sie zu bedienen. Derselbe Punkt kam in einem Thread über GLM 5.2 auf:
"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."
Flash ist ebenfalls closed. Hugging Face liefert dafür ein leeres Array, und Roboflow führt die Lizenz als proprietär. Jemand hoffte am Launch-Tag trotzdem noch auf das Gegenteil:
"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"
Übersetzt bedeutet das die Hoffnung, dass Qwen 3.7 bald für lokale KI verfügbar sein wird. Das wird es nicht sein.
Ich sollte ehrlich sein, was dieser Abschnitt ist. Keines dieser Zitate handelt von Flash, weil solche Zitate noch nicht existieren. Sie handeln von der 3.7er-Familie und der Lücke, die Flash füllen sollte. Die Urteile über die Familie gehen in beide Richtungen, von einem HN-Kommentator, der einen Monat täglicher Nutzung berichtet und 3.7 Pro als "völlig unbrauchbar" bezeichnet, bis hin zu chewz, der 3.7 Max in Sachen Geschwindigkeit über Opus-Niveau einordnet. Eine Zeile aus diesem Thread ist mir hängengeblieben, angesichts dessen, dass Qwen überhaupt keine Benchmarks für Flash veröffentlicht hat:
"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."
Es liegt eine gewisse Symmetrie darin, ein Modell ohne Benchmark-Werte an ein Publikum zu liefern, das aufgehört hatte, ihnen zu glauben.
Unterdessen nutzen die Leute es still und leise. OpenRouters Aktivitätspanel zeigt Hermes Agent als größten Verbraucher, noch vor Claude Code und einer Handvoll Coding-Tools. Die Nutzung ist echt; der Diskurs hat einfach nie stattgefunden.
Wer es tatsächlich nutzen sollte
Meine Einschätzung, unverblümt.
Greif zu, wenn du hochvolumige, risikoarme Vision-Arbeit betreibst, bei der gelegentlich falsch zu liegen billig ist und teuer zu sein fatal wäre. Massen-Bildtagging. Erstdurchgang-Inhaltsklassifizierung, Thumbnail-Triage, "ist eine Person in diesem Bild", Vorfilterung, bevor ein besseres Modell den sorgfältigen Durchgang macht. Bei etwa einem Hundertstel Cent pro Sample verändert das, was wirtschaftlich überhaupt lohnenswert zu verarbeiten ist, und das ist eine große Sache.
Lass es lieber, wenn du OCR oder Dokumentenextraktion, präzise Objektlokalisierung, vorhersehbare Latenz, hostbare Gewichte oder irgendein veröffentlichtes Qualitätssignal brauchst, das du einem Stakeholder zeigen kannst. Lass es auch, wenn deine Prompts routinemäßig lang sind, denn an dem Punkt sieht GPT-5.6 Luna nach seiner 80%igen Preissenkung schon vernünftig aus, ebenso Gemini 3.5 Flash-Lite. Beide sind zudem deutlich schneller.
Wenn du speziell die Qwen-Familie willst, aber mehr Leistung brauchst, ist Qwen 3.8 Max das andere Ende der Spanne, und unsere Übersicht zu Qwen-Alternativen deckt den Rest ab.
Der entscheidende Faktor ist, ob eine falsche Antwort dich etwas kostet. Das ist eher eine Produktfrage als eine Benchmark-Frage, und es ist die Frage, die ich klären würde, bevor ich irgendwelchen Integrationscode schreibe.
Wenn das in die Nähe einer Support-Queue kommt, lies erst das hier
Hier muss ich unverblümt sein, denn das ist der Teil, bei dem ich wirklich Narben davongetragen habe.
Ich baue Integrationen bei eesel, und wir betreiben seit Jahren KI in echten Support-Queues über tausende echter Tickets hinweg. Das teuerste Missverständnis, das ich sehe, ist genau das, das die Preistabelle dieses Beitrags begünstigt: dass das Modell das Produkt ist. Ein 0,03-Dollar-Modell lässt es so aussehen, als wäre der Bau eines eigenen Support-Bots fast kostenlos. Die Kosten-pro-Ticket-Rechnung sieht auf einer Tabellenkalkulation auch großartig aus. Aber das Modell war nie der teure Teil.
Die teuren Teile sind das Retrieval über ein Helpcenter, das sich selbst widerspricht, die Ticket-Klassifizierung, die an die richtige Stelle routet, und zu wissen, wann man den Mund hält. Eskalation, die den Kunden nicht fallen lässt. Ein Weg herauszufinden, dass man falsch liegt, bevor es der Kunde tut. Nichts davon ist im Token-Preis enthalten. Wir haben es auf die harte Tour gelernt, als wir zugesehen haben, wie selbstbewusst klingende Bots selbstsicher falsche Antworten gegeben haben, weshalb jetzt jedes Rollout, das wir machen, gegen historische Tickets simuliert wird, bevor es eine Live-Queue berührt.
Ich werde nicht so tun, als würde bei niemandem der Selbstbau-Weg funktionieren. Ein Teil unserer eigenen Abwanderung ist genau das: Kunden, die gegangen sind, um direkt auf einer LLM-API aufzubauen, darunter eine Firma aus dem Bereich AR/Bautechnik und eine DTC-Beauty-Marke. Es ist eine echte Option, und manchmal die richtige. Aber die Teams, die am genauesten hingeschaut haben, landeten meist woanders. Ein Engineering-Lead bei einem Hersteller von Bitcoin-ATM-Hardware, der eine 300 Artikel umfassende Wissensdatenbank über Confluence und Telegram betreibt, hat es so ausgedrückt:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Und was tatsächlich entscheidet, ob Support-KI funktioniert, ist Zurückhaltung, und das erfasst kein Modell-Score. Ein CX-Lead bei einer Marke mit 7.000 Tickets im Monat hat es besser formuliert, als es jeder Benchmark könnte:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Halte Qwen 3.7 Flash jetzt gegen diesen Maßstab. Eine Tool-Call-Fehlerrate von 8,88%, ein P99, das sich bis auf 90 Sekunden erstreckt, und kein veröffentlichter Qualitäts-Score, dazu keine unabhängige Bewertung außer der einen, die es auf Rang 22 von 23 setzt. Das sind völlig akzeptable Zahlen, um eine Million Bilder zu taggen. Es sind nicht die Zahlen, die ich zwischen meiner Marke und einem verärgerten Kunden haben möchte. Der Leitfaden zur Ticket-Abwehr und unsere Notizen zur KI-Lösungsrate gehen tiefer darauf ein, warum der Konfidenz-Schwellenwert wichtiger ist als das rohe Modell.
Wenn du trotzdem den Selbstbau-Weg gehen willst, würde ich mit RAG versus Fine-Tuning beginnen, dann etwas über Training auf der Wissensdatenbank lesen. Dann echte Zeit in die Verhinderung von Halluzinationen investieren. Keines dieser Probleme wird billiger, wenn es die Token werden.
Probiere eesel
Wenn du dir von einem 0,03-Dollar-Modell eigentlich günstigere Support-Automatisierung erhofft hast, kannst du dir die Zusammenbau-Arbeit sparen. eesel verbindet sich mit dem Helpdesk, den du bereits nutzt, lernt aus deinen vergangenen Tickets und deinem Helpcenter und beantwortet dann die Fragen, bei denen es sich sicher ist, während es den Rest in Ruhe lässt.
Der Teil, der es wert ist, geklaut zu werden, egal worauf du aufbaust: Bevor irgendetwas live geht, lässt du es gegen deine echte Ticket-Historie laufen und bekommst einen bewerteten Bericht darüber, was es geantwortet hätte. So findest du heraus, dass ein Modell falsch liegt, bevor es ein Kunde herausfindet. Es ist die Kontrolle, die kein Token-Preis dir kaufen kann.

Du kannst eesel kostenlos testen, oder eine Demo buchen, wenn du es lieber erst gegen deine eigene Queue laufen sehen möchtest.
Häufig gestellte Fragen
Wie viel kostet Qwen 3.7 Flash?
Ist Qwen 3.7 Flash gut für OCR?
Sind die Gewichte von Qwen 3.7 Flash Open Source?
Qwen 3.7 Flash vs. Gemini 3.5 Flash-Lite: Was ist schneller?
Kann ich Qwen 3.7 Flash für den Kundensupport verwenden?
Was passiert, wenn Qwen 3.7 Flash ausfällt?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








