Qwen3.8-Max erklärt: Alibabas 2,4-Billionen-Flaggschiff-Vorschau

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 20, 2026

Expertengeprüft
Illustration zur Vorschau von Alibabas Sprachmodell Qwen3.8-Max

Was Qwen3.8-Max eigentlich ist

Qwen (Tongyi Qianwen) ist Alibaba Clouds Modellfamilie, die Text, Vision, Audio, Code und Agenten umfasst. Die "Max"-Stufe ist die proprietäre Flaggschifflinie, oberhalb der günstigeren Plus- und Turbo-Stufen und oberhalb der offenen Qwen3-Checkpoints. Qwen3.8-Max ist das neueste davon, und Alibaba stellte es am 19. Juli 2026 als "Qwen3.8-Max-Preview" vor.

Hier die ehrliche Version, denn der Launch selbst war ungewöhnlich dünn. Es gab keinen offiziellen Blogpost, kein Modellblatt und keine Benchmark-Tabelle zur Vorschau, nur zwei Posts des Qwen-Teams auf X und einen funktionierenden, kostenpflichtigen Vorschau-Endpunkt. Das meiste von dem, was folgt, ist also Alibabas eigene Darstellung, die außerhalb des Labors noch niemand unabhängig geprüft hat.

Die von Alibaba genannten Spezifikationen:

  • 2,4 Billionen Gesamtparameter, ein spärliches Mixture-of-Experts-Design (Qwen auf X).
  • Erstes multimodales Qwen über 1T Parametern, das Text, Bilder, Video und Dokumente verarbeitet, laut Lead-Forscher Shuai Bai.
  • Ein Kontextfenster mit 1 Million Token, übernommen vom Vorgänger Qwen3.7-Max.
  • Ausgerichtet auf Coding, agentische Workflows und langfristige "professionelle Zusammenarbeits"-Aufgaben, wo es laut Alibaba Qwen3.7-Max übertrifft.

Die Anzahl aktiver Parameter pro Token, die vollständige Benchmark-Suite und die Lizenz fehlten alle zur Vorschau. Alibaba sagte, sie kämen noch. Bis dahin sollte man die internen Angaben als Marketing behandeln, nicht als Messung.

Unter der Haube: Wie Qwen3.8-Max funktioniert

Hier hört eine gigantische Parameterzahl auf, die Schlagzeile zu sein. Ein 2,4T dichtes Modell wäre viel zu teuer im Betrieb, deshalb ist Qwen3.8-Max ein Mixture-of-Experts-Modell: Die meisten dieser Parameter liegen bei jedem gegebenen Token brach, und nur ein kleiner Teil feuert. Das ist derselbe Trick, mit dem Qwens günstigere Stufen Konkurrenten unterbieten, hier nur hochskaliert.

Wie Qwen3.8-Max funktioniert, von multimodaler Eingabe über Mixture-of-Experts-Routing bis zur Antwort
Wie Qwen3.8-Max funktioniert, von multimodaler Eingabe über Mixture-of-Experts-Routing bis zur Antwort

Der multimodale Teil ist der eigentliche Sprung für die Max-Linie. Frühere Max-Modelle waren text-first; hier sagt Alibaba, das Modell nehme Bilder, Video und Dokumente nativ neben Text auf, was Shuai Bai als das Detail hervorhob, das es zum ersten seiner Art macht:

"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."

Der Haken, den man wiederholen sollte: Das Sparsity-Verhältnis, die Anzahl der Experten und das Trainingsrezept wurden nicht veröffentlicht. Wir kennen also die Form, die Alibaba beschreibt (riesig, spärlich, multimodal), aber nicht die Zahlen, die es erlauben würden, sie nachzubilden oder einzuordnen. Das ist eine echte Lücke für ein Modell, das einen Platz unter den Top zwei beansprucht.

Was Alibaba über die Leistung behauptet

Hier ist der Satz, den alle zitiert haben. Der eigene Launch-Post des Qwen-Teams stellt ihn gegen die Spitze des Feldes:

"Qwen3.8 is launching and going open-weight soon! With a massive 2.4T parameters, this model is continuously evolving. We believe it's one of the most powerful models available today... second only to Fable 5."

"Nur von Fable 5 übertroffen" ist eine große Ansage, wobei Fable 5 das aktuelle Top-Claude-Modell ist. Das Problem: Dahinter steckt bislang nichts. Kein Benchmark-Diagramm, kein unabhängiger Index-Score, kein Modellblatt. Zum Vergleich: Das vorherige Flaggschiff Qwen3.7-Max startete im Mai 2026 mit echten Zahlen, 80,4% auf SWE-bench Verified und dem am höchsten platzierten chinesischen Modell im Artificial-Analysis-Intelligenzindex zu dieser Zeit. Qwen3.8-Max kam mit dem Selbstbewusstsein, aber ohne die Belege.

Es gibt auch ein Muster, das man vorsichtig benennen sollte. Qwen hat eine lange Geschichte, offene Modell-Download-Charts anzuführen und starke Benchmark-Ergebnisse zu erzielen, und eine wiederkehrende Kritik lautet, dass es in Evaluierungen stärker wirken kann als in unordentlicher Praxis. Ein selbst gemeldetes "Top zwei" vor jedem unabhängigen Test ist also genau die Art von Behauptung, die man locker nehmen sollte.

Was Qwen3.8-Max kostet

Das ist der Teil, der Entwickler tatsächlich hat aufhorchen lassen. Während der Vorschau wird Qwen3.8-Max zu 10% des Standardpreises über drei Kanäle verkauft: Alibabas Token Plan-Abo sowie die agentischen Coding-Produkte Qoder und QoderWork. Es gibt noch keine eigenständige API-Rate pro Token, was für ein Max-Modell ungewöhnlich ist.

Die Personal-Stufen des Token Plans sehen so aus:

StufeMonatlich7-Tage-Kreditkontingent5-Stunden-Kreditkontingent
Lite~6 $ (39 CNY)2.500 Credits700 Credits
Standard~20 $ (139 CNY)10.000 Credits3.000 Credits
Pro~70 $ (499 CNY)40.000 Credits12.000 Credits

Quelle: Alibaba Cloud Token Plan (Personal Edition). Zusätzlich zum 10%-Vorschaupreis legt Alibaba einen Nachtrabatt drauf, 80% zusätzlichen Rabatt auf den Credit-Verbrauch zwischen 22:00 und 08:00 Uhr (UTC+8), was für Läufe außerhalb der Stoßzeiten auf etwa 0,2% des Standardpreises hinausläuft. Das ist aggressiv und offensichtlich darauf ausgelegt, Leute günstig zum Testen der Vorschau zu bringen.

Das Abo-Credit-Modell ist auch genau das, worüber sich Qwen-Nutzer schon früher beschwert haben. Bei der vorherigen Generation berichteten Reddit-Nutzer, dass Credits deutlich schneller aufgebraucht waren als erwartet, und Qwen-Modelle neigen dazu, pro Aufgabe mehr Output-Token zu erzeugen als vergleichbare Modelle, was die tatsächlichen Kosten still in die Höhe treibt, selbst wenn der Listenpreis niedrig aussieht. Der Vorschaurabatt kaschiert das momentan. Wenn er endet, plane dafür ein.

Ein nützliches Detail: Der Endpunkt des Token Plans spricht sowohl das OpenAI- als auch das Anthropic-API-Protokoll, sodass Drittanbieter-Clients wie Claude Code, Cursor, Cline und Codex sofort funktionieren, sobald man einen Schlüssel ausstellt. Wenn du ohnehin eines dieser Tools nutzt, ist das Ausprobieren der Vorschau eine Sache von fünf Minuten.

Solltest du jetzt schon auf Qwen3.8-Max setzen?

Die Vorschau ist billig und leicht auszuprobieren, was "sollte ich wechseln" zur falschen Frage macht und "was teste ich hier eigentlich" zur richtigen. Geh die Entscheidung unten durch, bevor du irgendetwas Wichtiges um eine Vorschau herum umbaust.

Das größere Bild: ein Open-Weight-Rennen zwischen chinesischen Labs

Wenn man die Details beiseitelässt, ist das der Grund, warum Qwen3.8-Max Trendthema wurde: Es kam Tage nach Moonshot AIs 2,8-Billionen-Parameter-Modell Kimi K3 heraus, und Alibaba hält zufällig rund 36% Anteile an Moonshot. Zwei Labs im selben Umfeld liefern sich also gerade ein Rennen darum, die Größenobergrenze für near-frontier-Modelle zu setzen, und beide versprechen offene Gewichte. Auf Hacker News las der meistbewertete Kommentar das Timing genau so:

Hacker News

"I assume that this announcement has been prompted by that of Moonshot AI... I wonder if Alibaba has always planned to make this big LLM open weights, or they have chosen to do this now, to better compete with Moonshot AI."

Die Lesart, zu der viele kamen, ist, dass die Kommodifizierung von Spitzen-Intelligenz selbst die Strategie ist und dass es unabhängig vom Motiv für alle nachgelagert gut ist:

Hacker News

"The Chinese firms seem to be working hard to commoditize intelligence which may be the most effective way to debase American frontier labs. And yeah: it also happens to be really good for humanity."

Für einen Käufer ist die eigentliche Erkenntnis nicht, welches Lab gewinnt. Es ist, dass die Modellebene alle paar Wochen billiger und besser wird, und der kluge Zug ist, so zu bauen, dass man den Motor austauschen kann, ohne alles drumherum neu zu verrohren.

Wo ein Spitzenmodell aufhört und Supportarbeit beginnt

Jetzt zu dem Teil, der mir am wichtigsten ist, weil ich beruflich KI-Agenten baue. Es ist verlockend, einen solchen Launch zu lesen und zu denken "super, ich stecke das beste Modell rein und meine Support-Warteschlange löst sich von selbst." So funktioniert es nicht, und genau in dieser Lücke scheitern die meisten KI-Support-Projekte still und leise.

Eine Benchmark-Behauptung ist kein Support-Agent: was ein rohes Modell liefert im Vergleich zu dem, was ein support-fertiger Teamkollege braucht
Eine Benchmark-Behauptung ist kein Support-Agent: was ein rohes Modell liefert im Vergleich zu dem, was ein support-fertiger Teamkollege braucht

Ein Modell wie Qwen3.8-Max gibt dir rohe Denkfähigkeit. Was es dir nicht gibt, ist irgendeine Vorstellung von deiner Rückerstattungsrichtlinie, deinen Produkt-Sonderfällen oder der Tatsache, dass Ticket #4021 ein VIP ist, der schon zweimal geschrieben hat. Es hat keine Erinnerung an deine bisherigen Tickets, keine Leitplanke, die es davon abhält, selbstbewusst eine Antwort zu erfinden, und keine Verbindung zum Helpdesk, wo die eigentliche Arbeit stattfindet. Eine größere Parameterzahl behebt nichts davon.

Wir setzen seit Jahren KI in laufenden Support-Warteschlangen ein, und die Lehre, die hängen geblieben ist: Ein selbstbewusst klingendes Modell mit einer falschen Antwort ist schlimmer als keine Antwort. Der Bot eines zahlenden Kunden bestätigte fröhlich, dass er Produktmodelle unterstütze, die gar nicht in seiner Datenbank standen, weil im Hilfe-Center stand "wir unterstützen alle Modelle." Genau das ist das Fehlerbild, das ein rohes Vorschaumodell wahrscheinlicher macht, nicht unwahrscheinlicher, weil es so sicher klingt. Wie es mir eine Support-Leitung einmal sagte:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."

a DTC brand CX lead handling 7,000 tickets a month

Deshalb lässt eesel AI eine Simulation über deine historischen Tickets laufen, bevor irgendetwas live geht, damit du die Lösungsquote und die genauen Antworten anhand echter vergangener Konversationen zuerst siehst, nicht erst nachdem ein Kunde verärgert wurde. Deshalb werden Antworten auch nach Konfidenz geroutet: Ist sich der Agent nicht sicher, entwirft er für einen Menschen oder eskaliert, statt zu raten. So vorgegangen, erreichte Gridwise im ersten Monat 73% Tier-1-Ticketlösung.

Und du könntest ein Modell wie Qwen3.8-Max selbst in deinen Stack einbinden. Die meisten Teams stellen fest, dass die Wartung die eigentlichen Kosten sind, was genau die Build-vs-Buy-Entscheidung ist, die ein Kunde treffend zusammenfasste: "Wir hätten versuchen können, unsere eigene LLM-Anwendung zu schreiben, wollten aber unsere Zeit nicht darin investieren. Wir wollten etwas, das wir nicht warten müssen." Das zugrunde liegende Modell zählt weit weniger als dieser Wrapper, was die leise gute Nachricht zu Qwen3.8-Max, Kimi K3 oder was auch immer nächsten Monat gewinnt, ist: Eine gut gebaute KI im Kundenservice erbt jeden Spitzenfortschritt, ohne dass du irgendetwas neu verrohren musst.

eesel AI ausprobieren

Wenn du hier gelandet bist, weil du ein KI-Modell willst, das Tickets tatsächlich löst und nicht nur chattet, dann ist genau das der Sinn von eesel AI. Es bindet sich an Zendesk, Freshdesk, Slack und mehr als 100 weitere Tools an, lernt aus deinem Hilfe-Center und vergangenen Tickets und beginnt in Minuten statt Wochen mit dem Entwerfen oder Lösen.

Das Helpdesk-Dashboard von eesel AI, in dem ein KI-Teammitglied Support-Tickets löst und entwirft
Das Helpdesk-Dashboard von eesel AI, in dem ein KI-Teammitglied Support-Tickets löst und entwirft

Das Unterscheidungsmerkmal ist die Vertrauensrampe: Simuliere anhand deines echten Ticketverlaufs, sieh dir die Zahlen an, starte im Entwurfsmodus und gehe erst dann vollständig autonom, wenn du zufrieden bist. Du bekommst die Intelligenz des Spitzenmodells mit Leitplanken, die für den Support gebaut sind. Probiere eesel kostenlos aus, keine Kreditkarte nötig.

Häufig gestellte Fragen

Was ist Qwen3.8-Max?
Qwen3.8-Max ist Alibabas neuestes Flaggschiffmodell, das am 19. Juli 2026 als Vorschau vorgestellt wurde. Alibaba beschreibt es als ein spärlich besetztes Mixture-of-Experts-Modell mit 2,4 Billionen Parametern und als sein erstes multimodales Modell über 1 Billion Parametern, das Text, Bilder, Video und Dokumente als Eingabe verarbeitet. Mehr zur gesamten Familie findest du in unserem Qwen-Test.
Was kostet Qwen3.8-Max?
Während der Vorschau läuft Qwen3.8-Max zu 10% des Standardpreises über Alibabas Token Plan, Qoder und QoderWork. Die Personal-Stufen des Token Plans beginnen bei etwa 6 $/Monat (39 CNY) für Lite, ~20 $ für Standard und ~70 $ für Pro. Einen eigenständigen Preis pro Token gibt es noch nicht. Unser vollständiger Qwen-Preise-Guide deckt den Rest der Reihe ab.
Ist Qwen3.8-Max Open Source?
Noch nicht. Alibaba sagt, Qwen3.8 werde "bald" mit offenen Gewichten erscheinen, aber zum Zeitpunkt der Vorschau gab es kein Datum, keine Lizenz und kein Hugging-Face-Repository. Das würde Alibabas übliches geschlossenes Muster bei seiner obersten Max-Stufe durchbrechen, also sollte man das Versprechen offener Gewichte als Plan behandeln, nicht als Tatsache.
Ist Qwen3.8-Max besser als Kimi K3 oder Claude?
Alibaba nennt es "nur von Fable 5 übertroffen", hat aber zur Vorschau keine Benchmark-Tabelle, kein Modellblatt und keine unabhängigen Zahlen veröffentlicht, sodass diese Behauptung unbestätigt ist. Es kam Tage nach Moonshots 2,8-Billionen-Modell Kimi K3 heraus. Unsere Modellvergleichs-Guides zeigen, wie man solche Behauptungen einordnet.
Kann ich Qwen3.8-Max mit Claude Code oder Cursor nutzen?
Ja. Der Endpunkt des Token Plans spricht sowohl das OpenAI- als auch das Anthropic-API-Protokoll, sodass Tools wie Claude Code, Cursor und Cline funktionieren, sobald ein Schlüssel vorliegt. Wenn du ein solches Modell auf echte Support-Tickets ansetzen willst, sind unsere Übersicht der KI-Coding-Tools und unser Guide zu KI im Kundenservice gute nächste Lektüren.
Kann ich Qwen3.8-Max für den Kundensupport nutzen?
Kannst du, aber ein rohes Modell ist nur der Motor. Um echte Tickets zu beantworten, braucht es dein Wissen, deine Leitplanken und deine Helpdesk-Anbindung. eesel AI verpackt ein Spitzenmodell genau so und bindet Zendesk, Freshdesk und mehr an, sodass daraus echte KI im Kundenservice wird statt nur ein Chatfenster.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration zur Preview-Preisgestaltung von Alibabas Qwen3.8-Max
Trending

Qwen3.8-Max Preise: der Preview-Deal und seine versteckten Kosten

Ein verständlicher Leitfaden zu den Qwen3.8-Max Preisen: der 10%-Preview-Satz, die Token-Plan-Stufen, der Nachtrabatt und die Kosten für Credit-Verbrauch, die auf keiner Preisseite stehen.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration, die Qwen3.8-Max mit konkurrierenden Spitzen-KI-Modellen vergleicht
Trending

Die 6 besten Qwen3.8-Max-Alternativen 2026

Die besten Qwen3.8-Max-Alternativen 2026 im ehrlichen Vergleich: Kimi K3, Claude, GPT-5.6, Gemini 3.5 Pro, Grok 4.5 und die Support-Schicht, die Tickets tatsächlich löst.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration, die Alibabas Qwen3.8-Max-Preview mit Anthropics Claude Fable 5 vergleicht
Trending

Qwen3.8-Max vs. Claude Fable 5: der Vergleich, den niemand führen kann

Alibaba nannte Qwen3.8-Max "nur Fable 5 unterlegen". Ich habe beide Modelle bei Preis, Kontext, Verfügbarkeit und veröffentlichten Belegen verglichen, um zu prüfen, ob das stimmt.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 3, 2026
Qwen 3.8 Max Review: eine 2,4-Billionen-Preview ehrlich getestet
Trending

Qwen 3.8 Max Review: eine 2,4-Billionen-Preview ehrlich getestet

Eine ehrliche Qwen 3.8 Max Review: was Alibabas 2,4-Billionen-Parameter-Flaggschiff wirklich ist, warum 'nur hinter Fable 5' eine Behauptung und kein Benchmark ist, und wer besser abwartet.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration eines Entwicklers, der über Chat, Multimodal- und API-Oberflächen auf Alibabas Qwen 3.8 Max zugreift
Trending

Zugang zu Qwen 3.8 Max: 5 Wege und was jeder kostet

Fünf echte Wege zu Alibabas 2,4-Billionen-Parameter-Flaggschiff, vom kostenlosen Chat bis zur $2/$6-API, plus die Abrechnungsfallen, die dabei zuschnappen.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Illustration, die Alibabas Qwen 3.8 Max und Moonshot AIs Kimi K3 gegenüberstellt
Trending

Qwen 3.8 Max vs Kimi K3: die Zahlen, die kein Labor veröffentlicht hat

Zwei chinesische Labore haben mit siebzehn Tagen Abstand ein Flaggschiff mit über 2 Billionen Parametern veröffentlicht, und keines hat das andere in seiner Benchmark-Tabelle geführt. Hier ist, was wirklich vergleichbar ist, wie die Rechnung tatsächlich aussieht, und für welches Modell ich mich entscheiden würde.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Illustration von zwei Personen, die gestaffelte Preiskarten auf einem Bildschirm betrachten, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash Preise: Was Sie 2026 tatsächlich zahlen

Der Kurs von $0.03 ist real, und er ist nur einer von vier Zählern auf Ihrer Rechnung. Hier sehen Sie, wie sich die Prompt-Staffel, der Cache, die Batch-Region und die Retry-Rate zu der Zahl summieren, die am Ende tatsächlich berechnet wird.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Illustration von Bild-, Video- und Dokumentenfeldern, die ein Vision-Language-Modell speisen, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash: Spezifikationen, Preise und was es wirklich kann

Qwen 3.7 Flash kam ohne Blogbeitrag, ohne Benchmarks und ohne Gewichte auf den Markt. Hier ist das vollständige Datenblatt, die gestufte Preisstruktur und das, was Qwen nie behauptet hat.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration eines Entwicklers, der mit Bild-, Video- und Dokumentpanels arbeitet, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash im Test: ein 0,03-Dollar-Vision-Modell mit Haken

Qwen 3.7 Flash ist das günstigste Vision-Modell, das man kaufen kann. Ich habe mir die Preisstufen, den einzigen unabhängigen Benchmark und das angeschaut, worüber niemand spricht.

Rama Adi NugrahaRama Adi NugrahaJul 31, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten