Qwen 3.7 Flash Preise: Was Sie 2026 tatsächlich zahlen

Kurnia Kharisma Agung Samiadjie
Geschrieben von

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 31, 2026

Expertengeprüft
Illustration von zwei Personen, die gestaffelte Preiskarten auf einem Bildschirm betrachten, mit dem Qwen-Logo

Die Preistabelle, und die vier Zähler dahinter

Hier ist der veröffentlichte Preis, vollständig, so wie er tatsächlich gilt.

Prompt-GrößeEingabe / 1MAusgabe / 1MCache-Lesen / 1MCache-Schreiben / 1M
Unter 32K Token$0.03$0.13$0.006$0.038
32K bis 256K$0.10$0.40$0.02$0.125
256K bis 1M$0.20$0.80$0.04$0.25

Diese Sätze stammen aus OpenRouters Modell-API, demselben Feed, aus dem sich die Qwen3.7 Flash Modellseite speist. Die Modellkarte auf Alibaba Cloud Model Studio druckt dieselbe Drei-Staffel-Struktur in CNY.

Vier Dinge bewegen die Zahl, die Ihnen in Rechnung gestellt wird, und nur eines davon steht in dieser Tabelle.

Vier Zähler, beschriftet mit Prompt-Größenstaffel, Cache-Treffer und -Fehlversuche, Batch oder nicht, und Retries, die alle in eine einzige Rechnung einfließen
Vier Zähler, beschriftet mit Prompt-Größenstaffel, Cache-Treffer und -Fehlversuche, Batch oder nicht, und Retries, die alle in eine einzige Rechnung einfließen

Setzen Sie Ihre eigene Arbeitslast in alle vier ein:

Der Rest dieses Beitrags erklärt, was jede dieser vier Eingaben tatsächlich bewirkt.

Zähler 1: die Prompt-Größenstaffel, und wie Agentenschleifen in sie hineindriften

Die Preisstaffelung richtet sich danach, wie groß der Prompt ist, nicht danach, wie viele Token Sie im Monat kaufen. Ein Aufruf mit 32,001 Prompt-Token wird auf jedem davon mit $0.10 pro Million abgerechnet, nicht nur für die, die über der Grenze liegen. Überschreitet man 256K, wird die gesamte Anfrage erneut zu $0.20 neu bepreist.

Das macht die oberste Staffel 6.7x so teuer wie der Richtwert für die Eingabe und 6.2x so teuer wie der Richtwert für die Ausgabe. Es bedeutet auch, dass die zwei Zahlen aus jeder Schlagzeile zu diesem Modell, „günstigstes Vision-Modell" und „1M Kontext", nicht beide im selben Aufruf zutreffen können. Mein Kollege Rama hat diesen Trade-off im Qwen 3.7 Flash Review ausführlich durchgegangen; die Spec-Sheet-Version findet sich in der Qwen 3.7 Flash Übersicht.

Weniger offensichtlich ist, wie man ohne Absicht dorthin gelangt. Agentenschleifen driften von sich aus über Staffelgrenzen:

  • Ein System-Prompt mit Tool-Schemas umfasst oft schon 3K bis 8K Token, bevor der Nutzer überhaupt etwas gesagt hat.
  • Abgerufene Dokumente kommen noch obendrauf. Vier Helpcenter-Artikel à 2K sind weitere 8K.
  • Jede Runde sendet die gesamte Konversation erneut, sodass Runde 1 vielleicht 12K sind und Runde 6 bereits 40K.

Runde 1 wird mit $0.03 abgerechnet. Runde 6 wird mit $0.10 abgerechnet, rückwirkend auf den gesamten Prompt. An Ihrem Code hat sich nichts geändert. Das ist dasselbe Problem in anderer Form wie die Modellauswahl allein nach dem Listenpreis, weshalb Opus 5 vs. Sonnet 5 letztlich zu einer Diskussion über Kosten pro erledigter Aufgabe statt Kosten pro Token wird.

Der Beleg, dass dies echten Nutzern tatsächlich passiert, steht auf der Seite des Anbieters selbst. OpenRouter veröffentlicht einen rollierenden, gewichteten 30-Tage-Durchschnitt dessen, was Kunden nach Caching zahlen, und für dieses Modell sind das $0.044 eingehend und $0.149 ausgehend bei einer Cache-Trefferquote von 51.0%. Der effektive Preis liegt über dem Listenpreis, was rechnerisch nur möglich ist, wenn ein relevanter Anteil des Traffics in den oberen Staffeln landet.

Wer Modelle anhand von Preistabellen vergleicht, stößt anderswo auf dieselbe Falle in anderem Gewand. GPT-5.6 Preise verdoppeln die Eingabe und schlagen 50% auf die Ausgabe oberhalb von 272K Token auf, und Claude Preise verlangen einen Aufschlag für Cache-Schreibvorgänge. Nur Qwen3.7 Max bleibt über das gesamte Fenster hinweg einheitlich bepreist, und das kostet 49x mehr pro Eingabe-Token.

Zähler 2: Caching, wo das Schreiben des Caches mehr kostet als gar nicht zu cachen

Das ist der Zähler, bei dem am häufigsten falsch gerechnet wird, und es lohnt sich, die Rechnung einmal durchzugehen.

Qwen 3.7 Flash bietet zwei Arten von Cache. Implizites Caching liest zu 20% des Standard-Eingabesatzes und kostet beim Erstellen nichts. Explizites Caching ist zweigeteilt: Sie zahlen einen Erstellungssatz und danach einen deutlich niedrigeren Lesesatz. Im USD-Listing von OpenRouter erstellt der Fünf-Minuten-Cache bei explizitem Caching für $0.038 und liest für $0.003, gegenüber einem Standard-Eingabesatz von $0.03.

Lesen Sie das noch einmal. Das Schreiben eines Cache-Eintrags kostet 1.27x so viel, wie es gekostet hätte, die Token einfach zu senden.

Zwei Wege nach dem Schreiben eines Caches: innerhalb von fünf Minuten erneut lesen und $0.003 zahlen, oder ihn ungelesen verfallen lassen und 1.27x zahlen
Zwei Wege nach dem Schreiben eines Caches: innerhalb von fünf Minuten erneut lesen und $0.003 zahlen, oder ihn ungelesen verfallen lassen und 1.27x zahlen

Die Rechnung kippt schnell zu Ihren Gunsten. Einmal schreiben und einmal lesen, und Sie haben $0.041 pro Million ausgegeben gegenüber $0.060 ungecached – der Cache zahlt sich also bereits aus. Jedes weitere Lesen danach ist fast kostenlos. Schief geht die ganze Sache nur in einem einzigen Fall: Der Cache verfällt, bevor ihn jemand liest, und Sie haben einen Aufschlag von 27% für nichts bezahlt.

Und genau das ist die Form, die eine Support-Warteschlange hat. Tickets kommen nicht gebündelt gegen denselben Kontext herein, sie tröpfeln über den Tag verteilt ein. Eine Time-to-Live von fünf Minuten ist großzügig für eine Chat-Sitzung und nutzlos für einen Posteingang. Die Cache-Trefferquote von 51%, die OpenRouter über den gesamten Traffic zu diesem Modell misst, ist eine vernünftige Planungsannahme, nicht die 90%, die man in einem Benchmark-Skript bekommt.

Daraus ergeben sich zwei praktische Regeln. Verwenden Sie standardmäßig implizites Caching, da es keine Erstellungskosten hat und trotzdem zu 20% liest. Reservieren Sie explizites Caching für Präfixe, bei denen Sie sicher sind, dass sie innerhalb des Zeitfensters wiederholt getroffen werden, etwa einen langen System-Prompt auf einem Endpoint mit hohem Durchsatz. Wenn Sie darauf aufbauend Retrieval einsetzen, spielt auch hier der Trade-off RAG vs. LLM eine Rolle, denn ein kleinerer abgerufener Kontext ist sowohl pro Aufruf günstiger als auch seltener der Grund, warum man in die nächste Staffel rutscht.

Zähler 3: Der Batch-Rabatt existiert in genau einer Region

Alibabas eigene Modellkarte bepreist dieses Modell in CNY, in vier separaten Regionstabellen, und die Unterschiede sind nicht nur kosmetisch.

Abrechnungsposten (pro 1M, Basisstaffel)PekingSingapurFrankfurtTokio
Eingabe0.2 CNY0.225 CNY0.2 CNY0.2 CNY
Ausgabe0.8 CNY0.974 CNY0.8 CNY0.8 CNY
Implizites Cache-Lesen0.04 CNY0.045 CNY0.04 CNY0.04 CNY
Eingabe (Batch File)0.1 CNY
Ausgabe (Batch File)0.4 CNY

Drei Erkenntnisse aus dieser Tabelle.

Batch-File-Preise halbieren beide Zähler, und das gibt es nur in Peking. Batch Inference ist in den Capability-Grids für Singapur, Frankfurt und Tokio als „Unsupported" markiert, sodass der 50%-Rabatt, den jeder andere Anbieter global anbietet, hier davon abhängt, wo Sie deployen. Beachten Sie auch die Falle in der Falle: Die Zeilen für Batch Chat sind mit 0.2 und 0.8 bepreist, identisch zum Standard. Nur der dateibasierte Batch-Pfad erhält den Rabatt.

Singapur kostet für dasselbe Modell mehr. Die Eingabe liegt 12.5% über dem Basissatz, die Ausgabe rund 22% darüber. Nichts im Capability-Grid erklärt das; es ist einfach eine andere Preisliste.

Auch die Websuche ist regional beschränkt, unterstützt in Peking und Singapur und nicht unterstützt in Frankfurt und Tokio. Das ist eher eine Feature- als eine Preisfrage – bis man eine separate Such-API dranhängen und dafür zweimal zahlen muss.

Vier Regionskarten: Peking mit Websuche und Batch-Rabatt, Singapur nur mit Websuche, sowie Frankfurt und Tokio ohne beides
Vier Regionskarten: Peking mit Websuche und Batch-Rabatt, Singapur nur mit Websuche, sowie Frankfurt und Tokio ohne beides

Noch etwas zur Währung. Die Modellkarte zeigt auf jedem Tab CNY und nirgends USD-Zahlen; die Dollarkurse, die alle zitieren, stammen aus dem Wiederverkaufs-Listing von OpenRouter. Das sind zwei Storefronts für ein Preisschema, kein Widerspruch, den man auflösen müsste, und wer zwischen ihnen umrechnet, erhält eine Zahl, die zu keiner der beiden Rechnungen passt. Kalkulieren Sie anhand des Storefronts, über den Sie tatsächlich einkaufen. Wer Anbieter vergleicht, stößt auf dasselbe Problem, was mit ein Grund ist, warum der Vergleich OpenAI vs. Anthropic vs. Gemini schwieriger ist als drei Preisseiten zu lesen.

Zähler 4: Retries, der Posten, den niemand einplant

OpenRouter misst für dieses Modell eine Fehlerrate bei Tool-Aufrufen von 8.88%, gegenüber 6.45% bei Qwen3.7 Plus. In einer Agentenschleife ist ein fehlgeschlagener Tool-Aufruf nicht kostenlos. Sie haben für den Prompt bezahlt, der ihn erzeugt hat, und Sie zahlen erneut für den Retry, der den Fehlschlag als Kontext enthält, bei einer leicht größeren Prompt-Größe.

Neun Prozent sind nicht katastrophal, aber sie gehören ins Modell, weshalb der Rechner oben sie als Multiplikator einbezieht, statt sie als Fußnote stehen zu lassen.

Der Latenz-Tail erzählt dieselbe Geschichte, nur in Zeit statt in Geld. P50 End-to-End liegt bei komfortablen 3.56 Sekunden. P99 liegt bei 90.19 Sekunden. Liegt Ihr Timeout darunter, brechen Sie ungefähr einen von hundert Aufrufen ab und stellen ihn neu, und zahlen für beide. Und weil genau ein Anbieter dieses Modell bereitstellt, gibt es keine Fallback-Route, auf die man ausweichen könnte, wenn es langsam wird.

„Flash" ist ein Preisversprechen, kein Geschwindigkeitsversprechen. Bei 59 Ausgabe-Token pro Sekunde ist dieses Modell etwa ein Sechstel so schnell wie Gemini 3.5 Flash-Lite, was eine echte Rolle spielt, wenn irgendetwas auf die Antwort wartet. Merkwürdigerweise ist es zugleich etwa fünfmal so schnell wie sein eigenes Plus-Geschwisterchen.

Wie es sich preislich gegen den Rest der günstigen Vision-Klasse schlägt

Jede Zahl unten stammt von der eigenen Preisseite des jeweiligen Anbieters, in der Standard-synchronen Stufe.

ModellEingabe $/1MAusgabe $/1MKontextVisionDer Haken in der Preistabelle
Qwen 3.7 Flash$0.03$0.131MText, Bild, VideoDrei Staffeln; Batch nur in Peking
Mistral Small 4$0.15$0.60256KText, BildEinheitlich, aber das kleinste Fenster hier
GPT-5.6 Luna$0.20$1.201.05MText, Bild2x Eingabe oberhalb von 272K; Batch halbiert es
Gemini 3.1 Flash-Lite$0.25$1.50Nicht veröffentlichtText, BildGünstiger als das neuere 3.5 Flash-Lite
Gemini 3.5 Flash-Lite$0.30$2.501,048,576Text, Bild, VideoCache-Speicher wird stundenweise abgerechnet
Claude Haiku 4.5$1.00$5.00200KText, BildCache-Schreibvorgänge zum 1.25-fachen der Eingabe
Gemini 3.6 Flash$1.50$7.501,048,576Text, Bild, Video5x teurer bepreist als die Lite-Stufe

Qwen gewinnt die Top-Zeile um eine Größenordnung und ist das einzige Modell hier, das Video-Eingabe unter $0.10 verarbeitet. Der Vergleich ist jedoch enger, als die reinen Zahlen suggerieren, sobald man die jeweiligen Rabatte der Anbieter einbezieht. Mistral Preise sind einheitlich, was man sieht, ist also, was man zahlt. Der Batch-Modus halbiert beide Google-Stufen weltweit ohne Regionsbeschränkung, wie die Aufschlüsselung zu Gemini 3.5 Flash-Lite Preisen darlegt.

Und GPT-5.6 hat Lunas Preis am 30. Juli 2026 um 80% gesenkt, was diese Tabelle nur Tage vor dem Schreiben dieses Beitrags durcheinandergewirbelt hat. Die vollständige Staffelübersicht steht im Beitrag zu GPT-5.6 Preisen, und das obere Ende von Googles Angebot findet sich unter Gemini 3.6 Flash Preisen.

Zwei Zeilen lohnen einen genaueren Blick. Neuer bedeutet nicht günstiger innerhalb von Googles eigener Produktpalette, wo 3.1 Flash-Lite immer noch unter 3.5 liegt. Und offene Gewichte bedeuten nicht günstig, was Kimi K3 Preise mit $3 eingehend und $15 ausgehend demonstrieren. Wenn Sie hier auf der Suche nach offenen Gewichten sind: Qwen 3.7 ist closed, und die Übersicht beste Open-Source-KI-Agenten ist der bessere Ausgangspunkt.

Innerhalb der Qwen-Familie ist die Preisleiter steil:

ModellEingabe $/1MAusgabe $/1MLong-Context-ZuschlagModalität
Qwen3.7 Flash$0.03$0.13Ja, bei 32K und 256KText, Bild, Video
Qwen3.7 Plus$0.32$1.28Ja, bei 256KText, Bild
Qwen3.7 Max$1.475$4.425Keiner veröffentlichtNur Text

Flash ist bei der Eingabe 10.7x günstiger als Plus und 49x günstiger als Max, und es ist das einzige der drei, das Video akzeptiert. Max, das Flaggschiff, hat gar keine Vision-Fähigkeit. Einen breiteren Überblick über die Reihe gibt es in der Aufschlüsselung zu Qwen Preisen, und die neuere Preview-Stufe wird in Qwen3.8-Max Preisen behandelt.

Falls keines der drei passt, deckt Qwen Alternativen ab, was sonst noch im Rennen ist, und die Qwen Familienübersicht ist die leicht verständliche Zusammenfassung dieser Leiter.

Was die Community sagt, was fast nichts ist

Das sei klar gesagt, weil es beeinflusst, wie viel Gewicht der Preis allein tragen sollte: Es gibt keine unabhängigen Preis-Leistungs-Daten zu diesem Modell. Es ist nicht bei Artificial Analysis gelistet, hat keinen LMArena-Eintrag, und Qwen hat keine Benchmarks dazu veröffentlicht. Eine Hacker-News-Suche nach dem Modellnamen liefert über Storys und Kommentare hinweg, über die gesamte Zeit, null Ergebnisse.

Das Nächste an einer Erklärung kam aus einem unabhängigen Thread in derselben Woche:

Hacker News

„Qwen/Alibaba haben für eine Weile aufgehört, Open-Weights-Releases zu veröffentlichen. Kein Groll oder so, ich werde einem geschenkten Gaul sicher nicht ins Maul schauen, aber sowohl DeepSeek als auch Moonshot waren sehr konsequent bei Open Weights und dem Teilen wirklich detaillierter Forschung."

Die Community, die normalerweise einen Qwen-Release stresstestet, hat aufgehört hinzuschauen, als die Reihe auf Closed Weights umstellte, sodass ein API-only-Launch landete, ohne dass jemand ihn benchmarkte. Im selben Thread merkte ein anderer Kommentator an, dass das konkurrierende günstige Modell „keine Vision-Fähigkeiten hat, was ein großer Vorteil für agentische Aufgaben ist" — genau das Versprechen dieses Modells, geschrieben von jemandem, der nicht wusste, dass es vier Tage zuvor bereits erschienen war.

Praktisch heißt das: Dem Preis können Sie vertrauen, weil der Anbieter ihn veröffentlicht hat. Jeder Behauptung darüber, was man dafür bekommt, können Sie noch nicht vertrauen. Planen Sie ein eigenes Eval ein, bevor Sie eine Arbeitslast festlegen, genau wie bei jedem anderen Modell in der Diskussion um die besten KI-Agenten.

Was das auf einer Support-Warteschlange tatsächlich kostet

An dieser Stelle muss ich die Preistabelle verlassen, denn das ist die Frage, mit der die meisten Leser hier ankommen.

Lassen Sie den Rechner auf eine plausible Support-Arbeitslast laufen: 200,000 Konversationen im Monat, je 12K Prompt-Token, sobald man einen System-Prompt und ein paar abgerufene Artikel einbezieht, 700 Token Ausgabe, halb Cache-Treffer, mit aktiviertem Retry-Zuschlag. Das ergibt rund $67 im Monat — unter der Richtschätzung, weil der Cache bei einer Prompt-Größe, die die Basisstaffel nie verlässt, seine Arbeit macht. Das ist eine Zahl, klein genug, um wie ein Rundungsfehler zu wirken, und genau diese Zahl lässt den Eigenbau offensichtlich richtig erscheinen.

Bei eesel beobachten wir diese Entscheidung regelmäßig, und das Muster ist konsistent. Aus einer internen Churn-Analyse: Mehrere technisch versierte Kunden — darunter eine AR-Bautech-Firma und eine DTC-Beauty-Marke — sind gegangen, um direkt auf einer LLM-API aufzubauen. Was Teams in die andere Richtung treibt, ist das, was die Token nicht abdecken. Auf der Buy-Seite formulierte es ein Engineering Lead eines Bitcoin-Automaten-Hardware-Unternehmens, das eine Confluence- und Telegram-Wissensdatenbank mit über 300 Artikeln betreibt, so:

„Wir könnten versuchen, unsere eigene LLM-Anwendung zu schreiben, aber wir wollten unsere Zeit nicht darin investieren. Wir wollten etwas, das wir nicht selbst pflegen müssen."

Die Pflege ist die eigentliche Kostenstelle. Ein roher Modellaufruf hat keine Ahnung, welcher Ihrer Helpcenter-Artikel aktuell ist, keine Regel dafür, wann an einen Menschen übergeben werden soll, keine Möglichkeit, sich selbst gegen Ihre Historie zu testen, bevor er einem echten Kunden antwortet. Das falsch zu machen ist teurer als jede Token-Staffel: Wir haben schon erlebt, wie ein selbstbewusst klingender Bot still und leise falsche Antworten gibt, weshalb jedes eesel-Rollout gegen historische Tickets simuliert wird, bevor es eine echte Konversation berührt.

Wenn Sie die ehrliche Gesamtzahl wollen statt der API-Position, sind die Aufschlüsselung zu KI-Kundenservice-Kosten und der Vergleich Kosten pro Lösung bessere Ausgangspunkte als jede Pro-Token-Tabelle, und KI vs. menschliche Kosten rahmt die Zahl, nach der die Finanzabteilung tatsächlich fragt.

Die Engineering-Arbeit, die ein Kurs von $0.03 nicht mitkauft, ungefähr in der Reihenfolge, in der sie einen einholt:

Nichts davon ist ein Argument gegen günstige Modelle. Es ist ein Argument dafür, zu wissen, welche Rechnung man da eigentlich liest. Ein so günstiges Modell ist eine großartige Komponente und ein schwaches Produkt, und genau darauf läuft der Unterschied zwischen KI-Agent und traditionellem Chatbot hinaus.

eesel ausprobieren

Wenn Sie hier gelandet sind, weil Sie durchgerechnet haben, ob ein Modell für $0.03 Ihre Support-Warteschlange stemmen kann: Die ehrliche Antwort ist, dass die Token nie der schwere Teil waren. eesel ist die Version dieses Projekts, die Sie nicht selbst bauen müssen: Es klinkt sich in wenigen Minuten in Zendesk, Freshdesk, Gorgias oder Ihren Posteingang ein, liest das Helpcenter und die vergangenen Tickets, die Sie bereits haben, und beantwortet nur, was es sicher weiß, während es alles andere eskaliert.

Der Teil, der für alle am wichtigsten ist, die schon einmal von einer Demo enttäuscht wurden: Sie können es gegen Tausende Ihrer eigenen historischen Tickets simulieren, bevor ein einziger Kunde es sieht, sodass Sie Lösungsrate und Kosten pro Ticket vorab kennen, statt beides erst in der Produktion zu entdecken. Kostenlos zum Testen, kein Neubau nötig.

Das eesel-KI-Helpdesk-Dashboard, das KI-Aktivität über eine laufende Support-Warteschlange zeigt
Das eesel-KI-Helpdesk-Dashboard, das KI-Aktivität über eine laufende Support-Warteschlange zeigt

Die Kurzfassung

Die Qwen 3.7 Flash Preise sind real und der günstigste verfügbare Vision-Kurs, vorausgesetzt Ihre Prompts bleiben unter 32K, Sie deployen in Peking, Ihr Cache wird tatsächlich gelesen, und Ihr Agent führt nicht viele Retries aus. Ändern Sie auch nur einen dieser Punkte, bewegt sich die Zahl, in einem Fall um das 6.7-fache.

Modellieren Sie es, bevor Sie migrieren. Und wenn die Arbeitslast am anderen Ende der Rechnung eine Support-Warteschlange ist, kalkulieren Sie das gesamte System, nicht die Token: Das beste LLM für den Support ist meist das, das Sie nicht selbst pflegen müssen.

Quellen

Häufig gestellte Fragen

Wie viel kostet Qwen 3.7 Flash pro 1M Token?
Qwen 3.7 Flash kostet ab $0.03 pro 1M Eingabe-Token und $0.13 pro 1M Ausgabe-Token, und dieser Satz gilt nur für Prompts unter 32K Token. Von 32K bis 256K sind es $0.10/$0.40, und von 256K bis 1M sind es $0.20/$0.80. Die vollständige Preistabelle der gesamten Modellfamilie finden Sie in unserer Übersicht zu Qwen-Preisen.
Warum ist meine Qwen 3.7 Flash-Rechnung höher als der angegebene Preis?
Fast immer, weil Ihre Prompts eine Staffelgrenze überschritten haben. Der rollierende 30-Tage-Durchschnitt von OpenRouter, was seine Kunden tatsächlich zahlen, liegt bei $0.044 eingehend und $0.149 ausgehend, über dem Richtpreis von $0.03/$0.13, bei einer Cache-Trefferquote von 51.0%. Lange System-Prompts, abgerufene Dokumente und wachsende Agenten-Konversationen drängen Sie alle über die 32K-Grenze. Die Mechanik wird im Qwen 3.7 Flash Review behandelt.
Ist Qwen 3.7 Flash günstiger als Gemini 3.5 Flash-Lite?
Beim Listenpreis ja, und zwar um das 10x bei der Eingabe: $0.03 gegenüber $0.30 pro 1M. Der Abstand verringert sich, wenn man Googles Batch-Tarif berücksichtigt, der Flash-Lite auf $0.15 halbiert, sowie den Durchsatz, bei dem Flash-Lite pro Token um ein Vielfaches schneller ist. Die Zahlen finden Sie in unserem Beitrag zu Gemini 3.5 Flash-Lite Preisen.
Gibt es bei Qwen 3.7 Flash eine kostenlose Stufe?
Es ist kein modellspezifisches Freikontingent veröffentlicht. Die Model-Studio-Karte enthält kein kostenloses Kontingent dafür, und die Zeile „100 Millionen kostenlose Token" in der Fußzeile von Alibabas Website ist eine websiteweite Neukunden-Promotion, keine Berechtigung speziell für Qwen 3.7 Flash. Behandeln Sie es ab dem ersten Aufruf als kostenpflichtige API.
Wie schneiden die Qwen 3.7 Flash-Preise im Vergleich zu Plus und Max ab?
Flash ist bei der Eingabe 10.7x günstiger als Qwen3.7 Plus ($0.32/$1.28) und 49x günstiger als Qwen3.7 Max ($1.475/$4.425). Sowohl Flash als auch Plus haben Zuschläge für lange Kontexte; Max ist das einzige Modell, das über das gesamte 1M-Fenster einheitlich bepreist ist. Das neuere Flaggschiff finden Sie unter Qwen3.8-Max Preise.
Ist Qwen 3.7 Flash günstig genug, um eine Support-Warteschlange darauf zu betreiben?
Die Token sind günstig; das System darum herum ist die eigentliche Kostenstelle. Ein Support-Deployment braucht Retrieval über Ihr Helpcenter, Eskalationsregeln, Tests anhand vergangener Tickets und jemanden, der es am Laufen hält. Unser Leitfaden zur Auswahl eines LLM für den Support und die Aufschlüsselung der KI-Kundenservice-Kosten ordnen die Token-Position beide in einen größeren Kontext ein.
Bietet Qwen 3.7 Flash einen Batch-Rabatt?
Ja, aber nur in einer Region und nur in einem Modus. Die Batch-File-Preise in Peking halbieren Eingabe und Ausgabe auf 0.1 und 0.4 CNY pro 1M in der Basisstaffel. Batch Chat wird zum Standardsatz abgerechnet, und Batch Inference ist in Singapur, Frankfurt und Tokio als nicht unterstützt markiert.
In welcher Währung wird Qwen 3.7 Flash bepreist?
Alibaba Clouds Modellkarte bepreist es ausschließlich in CNY, über alle vier Regionen hinweg. Die USD-Zahlen, die die meisten Leute zitieren, stammen aus OpenRouters Wiederverkaufs-Listing. Beide beschreiben dieselbe Drei-Staffel-Struktur, verwenden Sie also das Storefront, über das Sie tatsächlich einkaufen, statt zwischen ihnen umzurechnen.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration von Bild-, Video- und Dokumentenfeldern, die ein Vision-Language-Modell speisen, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash: Spezifikationen, Preise und was es wirklich kann

Qwen 3.7 Flash kam ohne Blogbeitrag, ohne Benchmarks und ohne Gewichte auf den Markt. Hier ist das vollständige Datenblatt, die gestufte Preisstruktur und das, was Qwen nie behauptet hat.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
PromptQL-Alternativen Titelbild auf indigofarbenem Hintergrund
Trending

Die 8 besten PromptQL-Alternativen 2026

Die 8 besten PromptQL-Alternativen 2026, von Databricks Genie bis zum Open-Source-Tool Wren AI, mit echten Preisen, Stärken und dazu, für wen sich jede Option wirklich eignet.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026
Was ist PromptQL Cover-Banner mit dem PromptQL-Logo auf indigofarbenem Hintergrund
Trending

Was ist PromptQL? Hasuras KI-Datenagent erklärt

Was ist PromptQL? Eine klare Erklärung von Hasuras KI-Datenagent: die Plan-dann-Ausführen-Idee, womit er sich verbindet, was er kostet und für wen er gedacht ist.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
PromptQL-Test-Titelbild mit dem PromptQL-Logo auf indigofarbenem Hintergrund
Trending

PromptQL im Test (2026): Hasuras Datenagent auf dem Prüfstand

Ein Praxistest von PromptQL: wie Hasuras Datenagent Planung und Ausführung trennt, was er kostet und ob das Zuverlässigkeits-Versprechen hält.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Illustration zur Aufschlüsselung der PromptQL-Preise
Trending

PromptQL-Preise: Was es 2026 wirklich kostet

Eine Aufschlüsselung der PromptQL-Preise: die abrechenbare OLU-Einheit, der Einführungspreis von 0,14 $, kostenloses Guthaben, der Modell-Multiplikator, der die Rechnung wirklich bestimmt, und durchgerechnete Kosten.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Illustriertes Hero-Banner für einen Leitfaden zu Google Gemini 3.5 Pro Preisen und API-Kosten
Trending

Gemini 3.5 Pro Preise: die Kosten (und was noch fehlt)

Eine klare Antwort zu Gemini 3.5 Pro Preisen: Es ist noch nicht live. Hier erfährst du, was die aktuelle Pro-Stufe, die Verbraucher-Pläne und die echte API-Rechnung kosten.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Redaktionelle Illustration eines großen Sprachmodells, das über einen langen Dokumentenstrom nachdenkt
Trending

Kimi K3 im Test: Moonshots offenes Frontier-Modell im Praxistest

Ein praxisnaher Kimi-K3-Test: Architektur, Benchmarks, die tatsächlichen Preise und was die Community in der Launch-Woche wirklich über das offene 2,8-Billionen-Parameter-Modell denkt.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Illustration einer Stoppuhr, die abhebt und eine freie Startbahn zeigt, als Sinnbild für ein aufgehobenes Nutzungslimit
Trending

OpenAI hat Codex' 5-Stunden-Limit entfernt: Was sich wirklich geändert hat

OpenAI hat das 5-Stunden-Nutzungslimit für Codex und ChatGPT Work vorübergehend aufgehoben. Hier erfährst du, was sich am 12. Juli geändert hat, was geblieben ist und was das für dich bedeutet.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Editorial-Illustration, die einen Vergleich von KI-Modellen als Alternativen zu Inkling darstellt
Trending

8 beste Inkling-Alternativen 2026

Inkling ist offen und interessant, aber für ein Open-Weights-Modell teuer und nicht das klügste Modell, das du betreiben kannst. Hier sind die 8 Alternativen, die ich tatsächlich ausprobieren würde, mit echten Preisen und dem jeweiligen Vorteil.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten