
Die 60-Sekunden-Tabelle
Alles unten stammt von den eigenen veröffentlichten Seiten jedes Anbieters, Stand 3. August 2026. Wo beide Anbieter dasselbe unterschiedlich messen, habe ich das kenntlich gemacht, statt es glattzubügeln.
| Qwen 3.8 Max | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | |
|---|---|---|---|---|
| Modell-ID | qwen3.8-max | gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna |
| Veröffentlicht | 2. Aug. 2026 | 9. Jul. 2026 | 9. Jul. 2026 | 9. Jul. 2026 |
| Input / 1 Mio. | $2,00 | $5,00 | $2,00 | $0,20 |
| Output / 1 Mio. | $6,00 | $30,00 | $12,00 | $1,20 |
| Gecachter Input / 1 Mio. | $0,25 | $0,50 | $0,20 | $0,02 |
| Long-Context-Aufschlag | Nicht veröffentlicht | 2x Input, 1,5x Output über 272K | Gleich | Gleich |
| Kontextfenster | 1.000.000 | 1.050.000 | 1.050.000 | 1.050.000 |
| Max. Output | 131.072 | 128.000 | 128.000 | 128.000 |
| Max. Reasoning-Token | 262.144 | Nicht veröffentlicht | Nicht veröffentlicht | Nicht veröffentlicht |
| Input-Modalitäten | Text, Bild, Video | Text, Bild | Text, Bild | Text, Bild |
| Parameter | 2,4T gesamt, 95B aktiv | Nicht veröffentlicht | Nicht veröffentlicht | Nicht veröffentlicht |
| Wissensstand | Nicht veröffentlicht | 16. Feb. 2026 | 16. Feb. 2026 | 16. Feb. 2026 |
| Model Card | Keine | Ja | Ja | Ja |
| Offene Gewichte | Versprochen, nicht geliefert | Nein | Nein | Nein |
| Ratenlimit (Top-Stufe) | 15K RPM / 2M TPM | 15K RPM / 40M TPM | Wie Sol | 30K RPM / 180M TPM |
| Verfügbar im Consumer-Chat | Qwen Studio | ChatGPT | Nur Codex und Work | Nur Codex und Work |
| Reasoning-Steuerung | reasoning_effort: low / medium / xhigh | Reasoning-Effort inkl. max | Gleich | Gleich |
Zwei Zeilen verdienen einen zweiten Blick. Qwen ist das einzige der vier Modelle, das Video als Input akzeptiert, was eine echte Fähigkeitslücke und keine bloße Spec-Sheet-Verzierung ist. Und Qwen ist das einzige ohne veröffentlichten Wissensstand, ohne Model Card und ohne System Card, was eine echte Beleglücke ist.
Was Qwen 3.8 Max tatsächlich ist
Qwen ist die Modellfamilie von Alibaba Cloud, und Max ist die proprietäre Flaggschiff-Linie oberhalb der günstigeren Plus- und Turbo-Stufen. Qwen 3.8 Max ist das neueste Modell, und es kam in zwei Akten heraus.
Wer erst die breitere Familie kennenlernen möchte: Meine Qwen-Bewertung deckt die älteren Stufen ab, und die eigenständige Qwen 3.8 Max Bewertung geht allein auf dieses Modell tiefer ein.
Akt eins war der 19. Juli auf der World AI Conference in Shanghai: ein Vorschau-Endpoint, zwei Posts auf X und eine mündliche Behauptung zum Spitzenranking ohne jede Tabelle. Akt zwei war der 2. August, als Alibaba einen 5.000 Wörter langen Launch-Beitrag mit allem veröffentlichte, was der Vorschau fehlte.
Die Architektur, wie Alibaba sie beschreibt: 2,4 Billionen Parameter insgesamt, davon 95 Milliarden aktiv, ein spärliches Mixture-of-Experts-Modell auf der Basis von Qwen 3.5. Diese Zahl von 95B aktiven Parametern ist die entscheidende, und genau die, die die Vorschau verschwiegen hat. Die Gesamtparameter bestimmen die Schlagzeile, die aktiven Parameter bestimmen Ihre Latenz und Ihre Rechnung.
Der multimodale Anspruch ist das wirklich Neue an der Max-Linie. Alibabas Modellseite listet Bild-, Text- und Video-Input auf, und der Launch-Beitrag liefert dazu Zahlen: Finanzberichte und PDFs über 200 Seiten sowie Video „länger als 100 Stunden“, organisiert in dem, was Alibaba einen Video-Memory-Graph nennt. Ehrlichkeitshalber: Beide von Alibaba im selben Beitrag veröffentlichten Harness-Konfigurationen geben nur Text und Bild an. Video sieht nach einem nativen DashScope-Pfad aus, nicht nach etwas, das man über den OpenAI-kompatiblen Endpoint bekommt.

Reasoning wird über reasoning_effort gesteuert, mit den Werten low, medium und xhigh, wobei xhigh der Standard ist. Alibaba aktiviert außerdem preserve_thinking standardmäßig „für die beste Out-of-the-Box-Erfahrung“, was eine höfliche Umschreibung dafür ist, dass das Modell darauf getrimmt ist, vor der Antwort ausgiebig nachzudenken. Das im Hinterkopf behalten, denn es taucht später als Kostenproblem wieder auf.
Was GPT-5.6 tatsächlich ist
GPT-5.6 ist kein einzelnes Modell. Es sind drei Leistungsstufen, die am 9. Juli allgemein verfügbar wurden: Sol als Flaggschiff, Terra als ausgewogene Mitte und Luna als schnelle, günstige Variante. Ich habe jede davon in einer ausführlichen GPT-5.6-Bewertung aufgeschlüsselt. Alle drei teilen sich dasselbe Kontextfenster von 1.050.000 Token, dieselbe Output-Obergrenze von 128.000 Token und denselben Wissensstand vom 16. Februar 2026.
Dann tat OpenAI am 30. Juli etwas, das diesen ganzen Vergleich still und leise zurücksetzte. Man senkte die Preise bei zwei der drei Stufen:
„Ab dem 30. Juli beträgt der API-Preis für Terra $2 pro Million Input-Token und $12 pro Million Output-Token, und für Luna $0,20 pro Million Input-Token und $1,20 pro Million Output-Token. Der Preis für Sol bleibt unverändert.“
Das sind 20% weniger bei Terra und 80% weniger bei Luna. Sol blieb bei $5 und $30. Wer einen Mitte-Juli geschriebenen GPT-5.6-Preisvergleich liest, findet dort bei Luna Zahlen, die um das bis zu 5-Fache falsch sind.
Dasselbe Update benannte Priority Processing in Fast-Modus um, der bei Sol den Preis verdoppelt für bis zu 2,5-fache Geschwindigkeit. Und OpenAI führte etwas ein, das Qwen nicht hat: einen Long-Context-Aufschlag. Prompts über 272K Input-Token werden mit 2x Input und 1,5x Output für die gesamte Anfrage berechnet, nicht nur für den überschüssigen Teil. Diese Grenze zu überschreiten, macht aus einem $5/$30-Sol-Aufruf einen $10/$45-Aufruf. Sols echtes Ein-Millionen-Token-Fenster ist also ein Ein-Millionen-Token-Fenster, für das man den doppelten Preis zahlt.
Benchmarks: zwei Tabellen, kein Schiedsrichter
Hier gehen die meisten Kopf-an-Kopf-Vergleiche schief. Beide Labore veröffentlichen inzwischen eine Tabelle. Keine der beiden Tabellen wurde von jemand Unabhängigem erstellt, und man kann die beiden nicht einfach übereinanderlegen.

Beginnen wir mit dem, was Alibaba veröffentlicht hat, denn das ist ungewöhnlich direkt: Die Tabelle führt GPT-5.6 Sol (max) als Vergleichsspalte. Direkt aus dieser Tabelle:
| Benchmark | Qwen 3.8 Max | GPT-5.6 Sol (max) | Gewinner |
|---|---|---|---|
| SWE-Pro | 67,7 | 64,6 | Qwen |
| TerminalBench-2.1 | 86,6 | 88,8 | Sol |
| PaperBench | 93,0 | 90,5 | Qwen |
| FrontierSWE | 73,5 | 88,8 | Sol, um 15,3 |
| CoWorkBench | 74,8 | 71,5 | Qwen |
| JobBench | 53,4 | 45,4 | Qwen |
| Agents' Last Exam | 52,4 | 53,6 | Sol |
| CharXiv (RQ) | 93,5 | 89,1 | Qwen |
| ERQA | 77,8 | 70,0 | Qwen |
| PerceptionBench | 63,5 | 59,7 | Qwen |
| LVBench | 81,8 | 78,8 | Qwen |
| Vision2Web | 69,0 | 62,1 | Qwen |
| OSWorld-Verified | 86,1 | 83,2 | Qwen |
Dreizehn von sechzehn für Qwen, und jede Vision-Zeile ist ein klarer Qwen-Sieg. Das ist ein echtes Ergebnis, und ich werde es nicht kleinreden.
Aber man sollte die Fußnoten lesen, was fast niemand tut. Alibaba legt offen, dass sechs der Coding-Benchmarks hauseigene Evaluierungen sind (QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench, CoWorkBench, RecreationBench), dass die Wettbewerberwerte aus gemischten Harnessen statt unter identischen Bedingungen erhoben wurden, und dass mehrere Zeilen von konkurrierenden Modellen bewertet werden: gemini-3.1-pro-preview bewertet PLawBench, Claude Opus 4.6 bewertet PaperBench. Es gibt auch einen Hinweis, der zugibt, dass Fable 5s Ergebnisse „Fallbacks beinhalten könnten“.
Nun zu den Drittanbietern, die das Urteil sauber in zwei Hälften teilen. Bei Artificial Analysis, dessen Intelligence Index v4.1 ein automatisiertes Komposit aus neun Evaluierungen ist, erreicht GPT-5.6 Sol 59 Punkte und liegt insgesamt auf Platz drei hinter Claude Opus 5 und Claude Fable 5, mit Terra bei 55 und Luna bei 51.
Bei LMArena, das auf menschlicher Präferenzabstimmung basiert, liegt qwen3.8-max bei Platz 5 in Text mit 1496 und Platz 4 in WebDev mit 1668, beides vor gpt-5.6-sol-xhigh auf Platz 15 bzw. 6. Dieselbe Kluft zwischen automatisiert und menschlich zeigt sich auch in meinem Vergleich GPT-5.6 vs. Claude.
Also: Das automatisierte Komposit spricht für Sol, die menschliche Präferenz für Qwen. Wer nur eines von beiden zitiert, will Ihnen etwas verkaufen.
Die Community-Meinung ist deutlicher. Aus dem Hacker-News-Thread zur Vorschau:
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
Der Preisvergleich, den jeder falsch herum liest
Die Geschichte, die sich im Juli von selbst schrieb, war, dass ein chinesisches Labor OpenAI unterboten hat. Bei $2 und $6 gegen Sols $5 und $30 stimmt das. Im Vergleich zum Rest der Familie stimmt es nicht.

Qwen 3.8 Max entspricht bei den Input-Kosten Terra auf den Cent genau und halbiert dessen Output-Preis. Das ist ein echter Sieg. Aber Luna unterbietet Qwen beim Input um das 10-Fache und beim Output um das 5-Fache, und es existierte zu diesem Preis noch nicht, als sich die Erzählung „chinesische Modelle sind günstiger“ festsetzte.
Es gibt auch ein Problem zweiter Ordnung, und genau das entscheidet über die echte Rechnung. Qwen liefert standardmäßig mit xhigh-Reasoning und aktiviertem preserve_thinking aus. Geschwätzige Modelle kosten mehr, als der Listenpreis vermuten lässt, weil man für jedes Reasoning-Token bezahlt. Artificial Analysis maß, dass Luna 130 Millionen Output-Token verbrannte, um seinen Index gegenüber einem Median von 62 Millionen zu berechnen, das zieht also in beide Richtungen. Der Punkt ist: Preis pro Token und Kosten pro Aufgabe sind unterschiedliche Zahlen, und nur eine davon steht auf der Preisseite.
Setzen Sie Ihre eigenen Volumina ein:
Noch ein Vorbehalt, falls Sie eher aufs günstige Monatsabo als auf die API schauen. Der Endpoint qwen3.8-max-preview wurde nie überhaupt pro Token verkauft: Er war nur über Alibabas Token Plan verfügbar, für $6, $18 oder $68 pro Monat in den Personal-Stufen. Diese Pläne laufen mit Guthaben in festen 5-Stunden- und 7-Tage-Fenstern, ungenutztes Guthaben verfällt ohne Übertrag, und das Erreichen einer der beiden Obergrenzen pausiert den Zugriff bis zum Zurücksetzen des Fensters. Alibaba veröffentlicht zudem nicht den Umrechnungsfaktor zwischen Guthaben und Token, sodass sich die Kosten nicht im Voraus berechnen lassen. Das Vorschau-Highlight, 10% der normalen Rate plus zusätzlich 80% Rabatt zwischen 22:00 und 08:00 Uhr, was auf 2% des Standardverbrauchs hinausläuft, gilt nur für Personal-Pläne und endet mit der Vorschau. Das GA-Modell bekommt stattdessen einen pauschalen 50%-Nachtrabatt.
Was in der Praxis tatsächlich den Ausschlag gibt
Benchmarks messen Fähigkeit. Produktion misst Fähigkeit geteilt durch Geduld. Jeder Praxisbericht, den ich fand, läuft auf dieselbe Beschwerde hinaus, und die hat nichts mit Intelligenz zu tun.
Ein Entwickler, der am Release-Tag dieselbe umfangreiche Design-Konvertierung mit beiden Modellen durchführte:
"Same prompt for both for the conversion. I used OpenCode for the qwen version, but I encountered a significant amount of errors / timeouts while it was running. Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build."
Ein anderer, nach dem Testen von vier Spitzenmodellen über mehrere Tage hinweg:
"Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA."
Derselbe Entwickler veröffentlichte die Token-Abrechnung für eine Webapp-Aufgabe, die bislang nützlichsten Kostendaten überhaupt: Kimi K3 bei $5,50, Qwen 3.8 Max bei $6,30, Fable 5 bei $30. Qwens günstige Rate ist echt, und trotzdem brauchte es 18 Millionen Input-Token gegenüber Kimis 9,5 Millionen für dieselbe Aufgabe.
Die Urteile über das Modell selbst gehen auseinander, was man klar aussprechen sollte, statt es glattzurechnen. Ein Nutzer kündigte deswegen sein Anthropic-Abo. Ein anderer nannte es „katastrophal schlecht“ und beschrieb ein Modell, das „in langen Zweifelsschleifen ohne Fortschritt hängen bleibt“. Beide testeten dieselbe Vorschau-Version in derselben Zwei-Wochen-Spanne. Wenn diese Streuung Sie stört, sind die sichereren Shortlists meine Übersichten zu Qwen-Alternativen und GPT-5.6-Alternativen, plus die Kimi K3 Bewertung für den dritten Kandidaten in dieser Klasse.
Und einiges ist schlicht nicht veröffentlicht. Es gibt nirgends einen Wissensstand für Qwen 3.8 Max, keine Model Card, keine System Card, keine Sicherheitsevaluierung. Die für „nächste Woche“ ab dem 2. August versprochenen offenen Gewichte haben weder Lizenz noch Datum noch Repository. Wenn Ihr Beschaffungsprozess danach fragt, lautet die Antwort heute: Es existiert nicht.
Wo ein Spitzenmodell aufhört und Support-Arbeit beginnt
Das ist der Teil, der mir am meisten am Herzen liegt, weil ich hier zusehe, wie Teams ein ganzes Quartal verlieren.

Keines dieser Modelle kennt Ihre Rückerstattungsrichtlinie. Keines hat Ihre letzten 7.000 Tickets gelesen. Keines hat auch nur die geringste Vorstellung davon, dass der Kunde, der Ihnen gerade schreibt, einen Enterprise-Plan hat und bereits zweimal eskaliert wurde. Ein Benchmark-Score ist kein Support-Agent, und in der Lücke zwischen beiden sterben die meisten Projekte zur KI-gestützten Support-Automatisierung leise vor sich hin.
Dieselbe Lücke erklärt, warum die Wahl eines KI-Helpdesks eine andere Übung ist als die Wahl eines Modells, und warum Ticket-Automatisierung an der Informationsbeschaffung hängt und nicht an der reinen Denkleistung.
Wir haben Jahre damit verbracht, KI in echten Support-Warteschlangen laufen zu lassen, und der spezifische Fehlermodus ist schlimmer als „die KI weiß es nicht“. Es ist selbstsicheres Erfinden. Wir hatten zahlende Kunden, deren Bots echten Kunden erfundene Antworten gaben, wenn die Wissensdatenbank-Suche leer ausging: Der Bot eines Solarunternehmens erfand nicht existierende Abo-Bedingungen, und ein anderer schickte einem Kunden „Sauerstoff“, aus dem Periodensystem, als Antwort. Nichts an einem 2,4-Billionen-Parameter-Modell verhindert das. Ein größeres Modell sagt das Falsche nur flüssiger.
Die Kontrolle, die das tatsächlich behebt, kam in einem Gespräch mit einem Support-Leiter zur Sprache, der 7.000 Tickets im Monat bearbeitet, und sie hat nichts mit der Modellwahl zu tun:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
Das ist eine Produktentscheidung, keine Modellentscheidung. Deshalb führt eesel AI eine Simulation auf historischen Tickets durch, bevor irgendetwas live geht, damit Sie zuerst die Lösungsquote und die tatsächlichen Antworten auf echte vergangene Gespräche sehen.
Deshalb werden Antworten auch je nach Konfidenz weitergeleitet, als Entwurf für einen Menschen oder per Eskalation, statt zu raten. So betrieben erreichte Gridwise im ersten Monat eine Tier-1-Lösungsquote von 73%.
Die strategische Einschätzung zu Qwen 3.8 Max gegenüber GPT-5.6 ist deshalb etwas antiklimaktisch: Bauen Sie so, dass Sie die Engine austauschen können. Die Modell-Ebene wird alle paar Wochen besser und günstiger. Kimi K3 kam wenige Tage vor Qwen heraus, Lunas Preis fiel an einem einzigen Nachmittag um 80%, und was im September die Tabelle anführt, steht heute noch gar nicht drin. Ein Team, das sich im Juli fest an eine API gebunden hat, muss bereits jetzt wieder umverkabeln.
Das ist auch die ehrliche Antwort auf „sollte ich stattdessen Gemini, Grok oder Mistral nutzen“. Wahrscheinlich, irgendwann, für manche Aufgabe. Das ist genau das Argument dafür, sich nicht allzu sehr um den Gewinner dieses Monats zu kümmern.
Wofür sollten Sie sich also entscheiden?
Wer ein Produkt ausliefert und eine klare Antwort will:
- Vision-, Video- oder dokumentenlastige Arbeit: Qwen 3.8 Max, deutlich. Jede Vision-Zeile in Alibabas Tabelle ist ein Qwen-Sieg, und es ist das einzige der vier, das überhaupt Video annimmt.
- Anspruchsvolles Software-Engineering: GPT-5.6 Sol. Ein FrontierSWE-Wert von 88,8 gegenüber 73,5 ist kein Messfehler, und es ist Alibabas eigene Zahl.
- Hohes Volumen, latenz- und kostensensibel: GPT-5.6 Luna, und beim Preis ist es nicht mal knapp. Auf die Verbosität achten.
- Ein Allround-Arbeitspferd, bei dem Sie die beste Rate pro Fähigkeit wollen: Terra und Qwen 3.8 Max liefern sich das eigentliche Rennen. Qwen hat den halben Output-Preis; Terra ist schneller und kommt mit Model Card, Wissensstand und stabilem Endpoint.
- Alles Kundenorientierte: keines von beiden allein. Wählen Sie zuerst die Ebene und lassen Sie diese das Modell wählen. Die Rechnung steht in meiner Aufschlüsselung der Agenten-Kosten, die Shortlist in beste KI-Agenten.
Was ich nicht tun würde: die Tabelle vom 2. August als abschließend behandeln. Sechs dieser Coding-Benchmarks stammen von Alibaba selbst, kein Dritter hat sie erneut ausgeführt, und das Community-Urteil zur selben Version reicht von „habe mein Anthropic-Abo gekündigt“ bis „katastrophal schlecht“. Geben Sie dem Ganzen einen Monat und warten Sie auf unabhängige Zahlen.
eesel ausprobieren
Wenn Sie hier gelandet sind, weil Sie ein Modell wollen, das Tickets löst statt Tabellen zu gewinnen, dann ist genau das der Sinn von eesel AI. Es bindet sich in Zendesk, Freshdesk und über 100 weitere Tools ein, lernt aus Ihrem Helpcenter und vergangenen Tickets und beginnt innerhalb von Minuten mit dem Entwerfen von Antworten.

Der Unterscheidungsfaktor ist die Vertrauensrampe, nicht die Engine. Simulieren Sie mit Ihrer echten Ticket-Historie, lesen Sie die Zahlen, starten Sie im Entwurfsmodus, und wechseln Sie erst dann in den autonomen Modus, wenn Sie zufrieden sind. Sie erben jeden Spitzenfortschritt, egal ob das am Ende Qwen, GPT-5.6 oder etwas ist, das nächsten Monat erscheint, ohne irgendetwas umverkabeln zu müssen. eesel ausprobieren, kostenlos, keine Kreditkarte nötig.
Häufig gestellte Fragen
Ist Qwen 3.8 Max günstiger als GPT-5.6?
Was ist besser zum Programmieren, Qwen 3.8 Max oder GPT-5.6 Sol?
Wie groß ist das Kontextfenster von Qwen 3.8 Max im Vergleich zu GPT-5.6?
Ist Qwen 3.8 Max Open Source?
Kann ich Qwen 3.8 Max oder GPT-5.6 für den Kundensupport nutzen?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








