
Die Preistabelle, und die vier Zähler dahinter
Hier ist der veröffentlichte Preis, vollständig, so wie er tatsächlich gilt.
| Prompt-Größe | Eingabe / 1M | Ausgabe / 1M | Cache-Lesen / 1M | Cache-Schreiben / 1M |
|---|---|---|---|---|
| Unter 32K Token | $0.03 | $0.13 | $0.006 | $0.038 |
| 32K bis 256K | $0.10 | $0.40 | $0.02 | $0.125 |
| 256K bis 1M | $0.20 | $0.80 | $0.04 | $0.25 |
Diese Sätze stammen aus OpenRouters Modell-API, demselben Feed, aus dem sich die Qwen3.7 Flash Modellseite speist. Die Modellkarte auf Alibaba Cloud Model Studio druckt dieselbe Drei-Staffel-Struktur in CNY.
Vier Dinge bewegen die Zahl, die Ihnen in Rechnung gestellt wird, und nur eines davon steht in dieser Tabelle.

Setzen Sie Ihre eigene Arbeitslast in alle vier ein:
Der Rest dieses Beitrags erklärt, was jede dieser vier Eingaben tatsächlich bewirkt.
Zähler 1: die Prompt-Größenstaffel, und wie Agentenschleifen in sie hineindriften
Die Preisstaffelung richtet sich danach, wie groß der Prompt ist, nicht danach, wie viele Token Sie im Monat kaufen. Ein Aufruf mit 32,001 Prompt-Token wird auf jedem davon mit $0.10 pro Million abgerechnet, nicht nur für die, die über der Grenze liegen. Überschreitet man 256K, wird die gesamte Anfrage erneut zu $0.20 neu bepreist.
Das macht die oberste Staffel 6.7x so teuer wie der Richtwert für die Eingabe und 6.2x so teuer wie der Richtwert für die Ausgabe. Es bedeutet auch, dass die zwei Zahlen aus jeder Schlagzeile zu diesem Modell, „günstigstes Vision-Modell" und „1M Kontext", nicht beide im selben Aufruf zutreffen können. Mein Kollege Rama hat diesen Trade-off im Qwen 3.7 Flash Review ausführlich durchgegangen; die Spec-Sheet-Version findet sich in der Qwen 3.7 Flash Übersicht.
Weniger offensichtlich ist, wie man ohne Absicht dorthin gelangt. Agentenschleifen driften von sich aus über Staffelgrenzen:
- Ein System-Prompt mit Tool-Schemas umfasst oft schon 3K bis 8K Token, bevor der Nutzer überhaupt etwas gesagt hat.
- Abgerufene Dokumente kommen noch obendrauf. Vier Helpcenter-Artikel à 2K sind weitere 8K.
- Jede Runde sendet die gesamte Konversation erneut, sodass Runde 1 vielleicht 12K sind und Runde 6 bereits 40K.
Runde 1 wird mit $0.03 abgerechnet. Runde 6 wird mit $0.10 abgerechnet, rückwirkend auf den gesamten Prompt. An Ihrem Code hat sich nichts geändert. Das ist dasselbe Problem in anderer Form wie die Modellauswahl allein nach dem Listenpreis, weshalb Opus 5 vs. Sonnet 5 letztlich zu einer Diskussion über Kosten pro erledigter Aufgabe statt Kosten pro Token wird.
Der Beleg, dass dies echten Nutzern tatsächlich passiert, steht auf der Seite des Anbieters selbst. OpenRouter veröffentlicht einen rollierenden, gewichteten 30-Tage-Durchschnitt dessen, was Kunden nach Caching zahlen, und für dieses Modell sind das $0.044 eingehend und $0.149 ausgehend bei einer Cache-Trefferquote von 51.0%. Der effektive Preis liegt über dem Listenpreis, was rechnerisch nur möglich ist, wenn ein relevanter Anteil des Traffics in den oberen Staffeln landet.
Wer Modelle anhand von Preistabellen vergleicht, stößt anderswo auf dieselbe Falle in anderem Gewand. GPT-5.6 Preise verdoppeln die Eingabe und schlagen 50% auf die Ausgabe oberhalb von 272K Token auf, und Claude Preise verlangen einen Aufschlag für Cache-Schreibvorgänge. Nur Qwen3.7 Max bleibt über das gesamte Fenster hinweg einheitlich bepreist, und das kostet 49x mehr pro Eingabe-Token.
Zähler 2: Caching, wo das Schreiben des Caches mehr kostet als gar nicht zu cachen
Das ist der Zähler, bei dem am häufigsten falsch gerechnet wird, und es lohnt sich, die Rechnung einmal durchzugehen.
Qwen 3.7 Flash bietet zwei Arten von Cache. Implizites Caching liest zu 20% des Standard-Eingabesatzes und kostet beim Erstellen nichts. Explizites Caching ist zweigeteilt: Sie zahlen einen Erstellungssatz und danach einen deutlich niedrigeren Lesesatz. Im USD-Listing von OpenRouter erstellt der Fünf-Minuten-Cache bei explizitem Caching für $0.038 und liest für $0.003, gegenüber einem Standard-Eingabesatz von $0.03.
Lesen Sie das noch einmal. Das Schreiben eines Cache-Eintrags kostet 1.27x so viel, wie es gekostet hätte, die Token einfach zu senden.

Die Rechnung kippt schnell zu Ihren Gunsten. Einmal schreiben und einmal lesen, und Sie haben $0.041 pro Million ausgegeben gegenüber $0.060 ungecached – der Cache zahlt sich also bereits aus. Jedes weitere Lesen danach ist fast kostenlos. Schief geht die ganze Sache nur in einem einzigen Fall: Der Cache verfällt, bevor ihn jemand liest, und Sie haben einen Aufschlag von 27% für nichts bezahlt.
Und genau das ist die Form, die eine Support-Warteschlange hat. Tickets kommen nicht gebündelt gegen denselben Kontext herein, sie tröpfeln über den Tag verteilt ein. Eine Time-to-Live von fünf Minuten ist großzügig für eine Chat-Sitzung und nutzlos für einen Posteingang. Die Cache-Trefferquote von 51%, die OpenRouter über den gesamten Traffic zu diesem Modell misst, ist eine vernünftige Planungsannahme, nicht die 90%, die man in einem Benchmark-Skript bekommt.
Daraus ergeben sich zwei praktische Regeln. Verwenden Sie standardmäßig implizites Caching, da es keine Erstellungskosten hat und trotzdem zu 20% liest. Reservieren Sie explizites Caching für Präfixe, bei denen Sie sicher sind, dass sie innerhalb des Zeitfensters wiederholt getroffen werden, etwa einen langen System-Prompt auf einem Endpoint mit hohem Durchsatz. Wenn Sie darauf aufbauend Retrieval einsetzen, spielt auch hier der Trade-off RAG vs. LLM eine Rolle, denn ein kleinerer abgerufener Kontext ist sowohl pro Aufruf günstiger als auch seltener der Grund, warum man in die nächste Staffel rutscht.
Zähler 3: Der Batch-Rabatt existiert in genau einer Region
Alibabas eigene Modellkarte bepreist dieses Modell in CNY, in vier separaten Regionstabellen, und die Unterschiede sind nicht nur kosmetisch.
| Abrechnungsposten (pro 1M, Basisstaffel) | Peking | Singapur | Frankfurt | Tokio |
|---|---|---|---|---|
| Eingabe | 0.2 CNY | 0.225 CNY | 0.2 CNY | 0.2 CNY |
| Ausgabe | 0.8 CNY | 0.974 CNY | 0.8 CNY | 0.8 CNY |
| Implizites Cache-Lesen | 0.04 CNY | 0.045 CNY | 0.04 CNY | 0.04 CNY |
| Eingabe (Batch File) | 0.1 CNY | — | — | — |
| Ausgabe (Batch File) | 0.4 CNY | — | — | — |
Drei Erkenntnisse aus dieser Tabelle.
Batch-File-Preise halbieren beide Zähler, und das gibt es nur in Peking. Batch Inference ist in den Capability-Grids für Singapur, Frankfurt und Tokio als „Unsupported" markiert, sodass der 50%-Rabatt, den jeder andere Anbieter global anbietet, hier davon abhängt, wo Sie deployen. Beachten Sie auch die Falle in der Falle: Die Zeilen für Batch Chat sind mit 0.2 und 0.8 bepreist, identisch zum Standard. Nur der dateibasierte Batch-Pfad erhält den Rabatt.
Singapur kostet für dasselbe Modell mehr. Die Eingabe liegt 12.5% über dem Basissatz, die Ausgabe rund 22% darüber. Nichts im Capability-Grid erklärt das; es ist einfach eine andere Preisliste.
Auch die Websuche ist regional beschränkt, unterstützt in Peking und Singapur und nicht unterstützt in Frankfurt und Tokio. Das ist eher eine Feature- als eine Preisfrage – bis man eine separate Such-API dranhängen und dafür zweimal zahlen muss.

Noch etwas zur Währung. Die Modellkarte zeigt auf jedem Tab CNY und nirgends USD-Zahlen; die Dollarkurse, die alle zitieren, stammen aus dem Wiederverkaufs-Listing von OpenRouter. Das sind zwei Storefronts für ein Preisschema, kein Widerspruch, den man auflösen müsste, und wer zwischen ihnen umrechnet, erhält eine Zahl, die zu keiner der beiden Rechnungen passt. Kalkulieren Sie anhand des Storefronts, über den Sie tatsächlich einkaufen. Wer Anbieter vergleicht, stößt auf dasselbe Problem, was mit ein Grund ist, warum der Vergleich OpenAI vs. Anthropic vs. Gemini schwieriger ist als drei Preisseiten zu lesen.
Zähler 4: Retries, der Posten, den niemand einplant
OpenRouter misst für dieses Modell eine Fehlerrate bei Tool-Aufrufen von 8.88%, gegenüber 6.45% bei Qwen3.7 Plus. In einer Agentenschleife ist ein fehlgeschlagener Tool-Aufruf nicht kostenlos. Sie haben für den Prompt bezahlt, der ihn erzeugt hat, und Sie zahlen erneut für den Retry, der den Fehlschlag als Kontext enthält, bei einer leicht größeren Prompt-Größe.
Neun Prozent sind nicht katastrophal, aber sie gehören ins Modell, weshalb der Rechner oben sie als Multiplikator einbezieht, statt sie als Fußnote stehen zu lassen.
Der Latenz-Tail erzählt dieselbe Geschichte, nur in Zeit statt in Geld. P50 End-to-End liegt bei komfortablen 3.56 Sekunden. P99 liegt bei 90.19 Sekunden. Liegt Ihr Timeout darunter, brechen Sie ungefähr einen von hundert Aufrufen ab und stellen ihn neu, und zahlen für beide. Und weil genau ein Anbieter dieses Modell bereitstellt, gibt es keine Fallback-Route, auf die man ausweichen könnte, wenn es langsam wird.
„Flash" ist ein Preisversprechen, kein Geschwindigkeitsversprechen. Bei 59 Ausgabe-Token pro Sekunde ist dieses Modell etwa ein Sechstel so schnell wie Gemini 3.5 Flash-Lite, was eine echte Rolle spielt, wenn irgendetwas auf die Antwort wartet. Merkwürdigerweise ist es zugleich etwa fünfmal so schnell wie sein eigenes Plus-Geschwisterchen.
Wie es sich preislich gegen den Rest der günstigen Vision-Klasse schlägt
Jede Zahl unten stammt von der eigenen Preisseite des jeweiligen Anbieters, in der Standard-synchronen Stufe.
| Modell | Eingabe $/1M | Ausgabe $/1M | Kontext | Vision | Der Haken in der Preistabelle |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0.03 | $0.13 | 1M | Text, Bild, Video | Drei Staffeln; Batch nur in Peking |
| Mistral Small 4 | $0.15 | $0.60 | 256K | Text, Bild | Einheitlich, aber das kleinste Fenster hier |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05M | Text, Bild | 2x Eingabe oberhalb von 272K; Batch halbiert es |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | Nicht veröffentlicht | Text, Bild | Günstiger als das neuere 3.5 Flash-Lite |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1,048,576 | Text, Bild, Video | Cache-Speicher wird stundenweise abgerechnet |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200K | Text, Bild | Cache-Schreibvorgänge zum 1.25-fachen der Eingabe |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 | Text, Bild, Video | 5x teurer bepreist als die Lite-Stufe |
Qwen gewinnt die Top-Zeile um eine Größenordnung und ist das einzige Modell hier, das Video-Eingabe unter $0.10 verarbeitet. Der Vergleich ist jedoch enger, als die reinen Zahlen suggerieren, sobald man die jeweiligen Rabatte der Anbieter einbezieht. Mistral Preise sind einheitlich, was man sieht, ist also, was man zahlt. Der Batch-Modus halbiert beide Google-Stufen weltweit ohne Regionsbeschränkung, wie die Aufschlüsselung zu Gemini 3.5 Flash-Lite Preisen darlegt.
Und GPT-5.6 hat Lunas Preis am 30. Juli 2026 um 80% gesenkt, was diese Tabelle nur Tage vor dem Schreiben dieses Beitrags durcheinandergewirbelt hat. Die vollständige Staffelübersicht steht im Beitrag zu GPT-5.6 Preisen, und das obere Ende von Googles Angebot findet sich unter Gemini 3.6 Flash Preisen.
Zwei Zeilen lohnen einen genaueren Blick. Neuer bedeutet nicht günstiger innerhalb von Googles eigener Produktpalette, wo 3.1 Flash-Lite immer noch unter 3.5 liegt. Und offene Gewichte bedeuten nicht günstig, was Kimi K3 Preise mit $3 eingehend und $15 ausgehend demonstrieren. Wenn Sie hier auf der Suche nach offenen Gewichten sind: Qwen 3.7 ist closed, und die Übersicht beste Open-Source-KI-Agenten ist der bessere Ausgangspunkt.
Innerhalb der Qwen-Familie ist die Preisleiter steil:
| Modell | Eingabe $/1M | Ausgabe $/1M | Long-Context-Zuschlag | Modalität |
|---|---|---|---|---|
| Qwen3.7 Flash | $0.03 | $0.13 | Ja, bei 32K und 256K | Text, Bild, Video |
| Qwen3.7 Plus | $0.32 | $1.28 | Ja, bei 256K | Text, Bild |
| Qwen3.7 Max | $1.475 | $4.425 | Keiner veröffentlicht | Nur Text |
Flash ist bei der Eingabe 10.7x günstiger als Plus und 49x günstiger als Max, und es ist das einzige der drei, das Video akzeptiert. Max, das Flaggschiff, hat gar keine Vision-Fähigkeit. Einen breiteren Überblick über die Reihe gibt es in der Aufschlüsselung zu Qwen Preisen, und die neuere Preview-Stufe wird in Qwen3.8-Max Preisen behandelt.
Falls keines der drei passt, deckt Qwen Alternativen ab, was sonst noch im Rennen ist, und die Qwen Familienübersicht ist die leicht verständliche Zusammenfassung dieser Leiter.
Was die Community sagt, was fast nichts ist
Das sei klar gesagt, weil es beeinflusst, wie viel Gewicht der Preis allein tragen sollte: Es gibt keine unabhängigen Preis-Leistungs-Daten zu diesem Modell. Es ist nicht bei Artificial Analysis gelistet, hat keinen LMArena-Eintrag, und Qwen hat keine Benchmarks dazu veröffentlicht. Eine Hacker-News-Suche nach dem Modellnamen liefert über Storys und Kommentare hinweg, über die gesamte Zeit, null Ergebnisse.
Das Nächste an einer Erklärung kam aus einem unabhängigen Thread in derselben Woche:
„Qwen/Alibaba haben für eine Weile aufgehört, Open-Weights-Releases zu veröffentlichen. Kein Groll oder so, ich werde einem geschenkten Gaul sicher nicht ins Maul schauen, aber sowohl DeepSeek als auch Moonshot waren sehr konsequent bei Open Weights und dem Teilen wirklich detaillierter Forschung."
Die Community, die normalerweise einen Qwen-Release stresstestet, hat aufgehört hinzuschauen, als die Reihe auf Closed Weights umstellte, sodass ein API-only-Launch landete, ohne dass jemand ihn benchmarkte. Im selben Thread merkte ein anderer Kommentator an, dass das konkurrierende günstige Modell „keine Vision-Fähigkeiten hat, was ein großer Vorteil für agentische Aufgaben ist" — genau das Versprechen dieses Modells, geschrieben von jemandem, der nicht wusste, dass es vier Tage zuvor bereits erschienen war.
Praktisch heißt das: Dem Preis können Sie vertrauen, weil der Anbieter ihn veröffentlicht hat. Jeder Behauptung darüber, was man dafür bekommt, können Sie noch nicht vertrauen. Planen Sie ein eigenes Eval ein, bevor Sie eine Arbeitslast festlegen, genau wie bei jedem anderen Modell in der Diskussion um die besten KI-Agenten.
Was das auf einer Support-Warteschlange tatsächlich kostet
An dieser Stelle muss ich die Preistabelle verlassen, denn das ist die Frage, mit der die meisten Leser hier ankommen.
Lassen Sie den Rechner auf eine plausible Support-Arbeitslast laufen: 200,000 Konversationen im Monat, je 12K Prompt-Token, sobald man einen System-Prompt und ein paar abgerufene Artikel einbezieht, 700 Token Ausgabe, halb Cache-Treffer, mit aktiviertem Retry-Zuschlag. Das ergibt rund $67 im Monat — unter der Richtschätzung, weil der Cache bei einer Prompt-Größe, die die Basisstaffel nie verlässt, seine Arbeit macht. Das ist eine Zahl, klein genug, um wie ein Rundungsfehler zu wirken, und genau diese Zahl lässt den Eigenbau offensichtlich richtig erscheinen.
Bei eesel beobachten wir diese Entscheidung regelmäßig, und das Muster ist konsistent. Aus einer internen Churn-Analyse: Mehrere technisch versierte Kunden — darunter eine AR-Bautech-Firma und eine DTC-Beauty-Marke — sind gegangen, um direkt auf einer LLM-API aufzubauen. Was Teams in die andere Richtung treibt, ist das, was die Token nicht abdecken. Auf der Buy-Seite formulierte es ein Engineering Lead eines Bitcoin-Automaten-Hardware-Unternehmens, das eine Confluence- und Telegram-Wissensdatenbank mit über 300 Artikeln betreibt, so:
„Wir könnten versuchen, unsere eigene LLM-Anwendung zu schreiben, aber wir wollten unsere Zeit nicht darin investieren. Wir wollten etwas, das wir nicht selbst pflegen müssen."
Die Pflege ist die eigentliche Kostenstelle. Ein roher Modellaufruf hat keine Ahnung, welcher Ihrer Helpcenter-Artikel aktuell ist, keine Regel dafür, wann an einen Menschen übergeben werden soll, keine Möglichkeit, sich selbst gegen Ihre Historie zu testen, bevor er einem echten Kunden antwortet. Das falsch zu machen ist teurer als jede Token-Staffel: Wir haben schon erlebt, wie ein selbstbewusst klingender Bot still und leise falsche Antworten gibt, weshalb jedes eesel-Rollout gegen historische Tickets simuliert wird, bevor es eine echte Konversation berührt.
Wenn Sie die ehrliche Gesamtzahl wollen statt der API-Position, sind die Aufschlüsselung zu KI-Kundenservice-Kosten und der Vergleich Kosten pro Lösung bessere Ausgangspunkte als jede Pro-Token-Tabelle, und KI vs. menschliche Kosten rahmt die Zahl, nach der die Finanzabteilung tatsächlich fragt.
Die Engineering-Arbeit, die ein Kurs von $0.03 nicht mitkauft, ungefähr in der Reihenfolge, in der sie einen einholt:
- Retrieval, das aktuell bleibt, was das Ganze von KI auf einer Wissensdatenbank trainieren ist.
- Konfidenzschwellen und KI-Eskalation, damit das Modell nur beantwortet, was es beantworten sollte.
- Grounding und Guardrails, denn KI-Halluzinationen im Support sind der Fehler, der Kunden kostet.
- Triage und Ticket-Klassifizierung, bevor überhaupt eine Antwort versucht wird.
- Messung, denn die KI-Lösungsrate ist die einzige Zahl, die verrät, ob irgendetwas davon funktioniert hat.
- Laufende KI-Support-QA, die niemals abgeschlossen ist.
Nichts davon ist ein Argument gegen günstige Modelle. Es ist ein Argument dafür, zu wissen, welche Rechnung man da eigentlich liest. Ein so günstiges Modell ist eine großartige Komponente und ein schwaches Produkt, und genau darauf läuft der Unterschied zwischen KI-Agent und traditionellem Chatbot hinaus.
eesel ausprobieren
Wenn Sie hier gelandet sind, weil Sie durchgerechnet haben, ob ein Modell für $0.03 Ihre Support-Warteschlange stemmen kann: Die ehrliche Antwort ist, dass die Token nie der schwere Teil waren. eesel ist die Version dieses Projekts, die Sie nicht selbst bauen müssen: Es klinkt sich in wenigen Minuten in Zendesk, Freshdesk, Gorgias oder Ihren Posteingang ein, liest das Helpcenter und die vergangenen Tickets, die Sie bereits haben, und beantwortet nur, was es sicher weiß, während es alles andere eskaliert.
Der Teil, der für alle am wichtigsten ist, die schon einmal von einer Demo enttäuscht wurden: Sie können es gegen Tausende Ihrer eigenen historischen Tickets simulieren, bevor ein einziger Kunde es sieht, sodass Sie Lösungsrate und Kosten pro Ticket vorab kennen, statt beides erst in der Produktion zu entdecken. Kostenlos zum Testen, kein Neubau nötig.

Die Kurzfassung
Die Qwen 3.7 Flash Preise sind real und der günstigste verfügbare Vision-Kurs, vorausgesetzt Ihre Prompts bleiben unter 32K, Sie deployen in Peking, Ihr Cache wird tatsächlich gelesen, und Ihr Agent führt nicht viele Retries aus. Ändern Sie auch nur einen dieser Punkte, bewegt sich die Zahl, in einem Fall um das 6.7-fache.
Modellieren Sie es, bevor Sie migrieren. Und wenn die Arbeitslast am anderen Ende der Rechnung eine Support-Warteschlange ist, kalkulieren Sie das gesamte System, nicht die Token: Das beste LLM für den Support ist meist das, das Sie nicht selbst pflegen müssen.
Quellen
- Qwen3.7 Flash auf OpenRouter
- Öffentliche Modell-API von OpenRouter
- Qwen3.7-Flash Modellkarte, Alibaba Cloud Model Studio
- Qwen3.7-Flash auf QwenCloud
- QwenCloud Modell-Changelog
- Qwen3.7 Plus auf OpenRouter
- Qwen3.7 Max auf OpenRouter
- Gemini API Preise
- Gemini 3.5 Flash-Lite Modellseite
- Gemini 3.6 Flash Modellseite
- OpenAI API Preise
- GPT-5.6 Luna Modellseite
- Claude Preisdokumentation
- Mistral API Preise
- Hacker News, DeepSeek-V4-Flash Update Thread
Häufig gestellte Fragen
Wie viel kostet Qwen 3.7 Flash pro 1M Token?
Warum ist meine Qwen 3.7 Flash-Rechnung höher als der angegebene Preis?
Ist Qwen 3.7 Flash günstiger als Gemini 3.5 Flash-Lite?
Gibt es bei Qwen 3.7 Flash eine kostenlose Stufe?
Wie schneiden die Qwen 3.7 Flash-Preise im Vergleich zu Plus und Max ab?
Ist Qwen 3.7 Flash günstig genug, um eine Support-Warteschlange darauf zu betreiben?
Bietet Qwen 3.7 Flash einen Batch-Rabatt?
In welcher Währung wird Qwen 3.7 Flash bepreist?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








