
Warum ausgerechnet ich zur Vorsicht rate
Ich baue KI-Agenten bei eesel, und mein Alltag ist der langweilige Teil, den niemand als Screenshot postet: das, was nachdem das Modell eine Antwort gegeben hat, passiert. Wir haben erlebt, wie ein selbstbewusst klingendes Modell einem Kunden ganz beiläufig die falsche Rückerstattungsrichtlinie mitteilt, und genau deshalb wird jeder eesel-Rollout jetzt zuerst gegen historische Tickets simuliert, bevor er je einen echten Posteingang berührt.
Wenn also ein 2,4-Billionen-Modell mit einem "nur hinter Fable 5"-Banner ankommt, ist mein erster Reflex kein Hype, sondern: Zeig mir die Auswertung, zeig mir die aktiven Parameter, und zeig mir, was das Modell beim 200. Ticket macht, nicht beim Demo-Ticket. Diese Review ist aus dieser Perspektive geschrieben. Wer das reine Datenblatt will, findet es im Qwen-Überblick. Wer wissen will, ob Qwen 3.8 Max diese Woche für ein echtes Team etwas ändert, liest weiter.
Was Qwen 3.8 Max wirklich ist
Qwen 3.8 Max ist das Flaggschiff von Alibabas Qwen-Familie und das erste multimodale Modell des Teams über 1 Billion Parameter. Die bestätigten Eckdaten, direkt aus Alibabas eigener Ankündigung:
- 2,4 Billionen Parameter insgesamt, gebaut als spärliches Mixture-of-Experts-Modell (MoE), sodass bei jedem Token nur ein Bruchteil dieser Parameter aktiv wird.
- Multimodal: verarbeitet Text, Bilder, Video und Dokumente in einem Modell.
- 1-Millionen-Token-Kontextfenster, übernommen von Qwen 3.7 Max.
- API-kompatibel sowohl mit dem OpenAI- als auch dem Anthropic-Protokoll, sodass bestehende Tools ohne Umbau darauf zeigen können.
- Laut Alibaba schlägt es Qwen 3.7 Max bei Coding, Full-Stack-Entwicklung, Datenanalyse und Büro-Workflows.

Das entscheidende Wort ist Preview. Der öffentliche Name lautet Qwen3.8-Max-Preview. Entwickler Shuai Bai beschrieb es als Modell, das sich "kontinuierlich weiterentwickelt", was auf Deutsch heißt: Das ist ein frühes, bewegliches Ziel, kein fixiertes Release.
Die Zahl, die Alibaba nicht veröffentlicht hat
Die Gesamtparameterzahl macht sich gut als Schlagzeile. Die Zahl, die tatsächlich Kosten und Geschwindigkeit bestimmt, sind die aktiven Parameter, also wie viele der 2,4 Billionen pro Token tatsächlich feuern. Alibaba hat diese Zahl nicht offengelegt. Das ist keine Fußnote. Bei einem MoE-Modell sind aktive Parameter das, was Servierkosten, Latenz und die Frage, ob man es überhaupt selbst betreiben würde, größtenteils bestimmt. Ein 2,4-Billionen-Modell mit, sagen wir, 40 Milliarden aktiven Parametern verhält sich in der Rechnung völlig anders als eines mit 200 Milliarden aktiven Parametern. Solange diese Zahl nicht öffentlich ist, ist jede Einschätzung "günstig zu betreiben" oder "teuer zu betreiben" reine Spekulation.
Die "nur hinter Fable 5"-Behauptung, entwirrt
Das ist der Satz, den alle wiederholt haben, also seien wir genau, was er ist und was nicht.
Auf seinem offiziellen Account positioniert Qwen das Modell als "eines der leistungsstärksten heute verfügbaren Modelle... nur hinter Fable 5". Alibabas Aktien stiegen sogar nach der Ankündigung.
Hier der Haken: Es gibt keine veröffentlichte Benchmark-Tabelle. Keine Zahlen, die zeigen, dass es Fable 5 schlägt, dahinter zurückbleibt, GPT-5.1 schlägt oder Claude Opus schlägt. Das Ranking beruht ausschließlich auf Alibabas interner Evaluation, und noch hat kein Dritter (Artificial Analysis, LMArena) das Modell bewertet. Auf Hacker News wiesen Skeptiker schnell darauf hin, dass Qwen als Benchmark-Spezialist gilt, und "vertraut uns, wir sind Nummer 2" ist genau die Art von Behauptung, für deren Klärung eine Benchmark-Tabelle existiert.
A 2.4T-parameter multimodal preview shipped before any benchmark, model card, or license.
Das ist der ehrliche Stand der Dinge. Ich sage nicht, dass die Behauptung falsch ist, ich weiß es nicht, und außerhalb von Alibabas Eval-Team weiß es auch niemand sonst. Ich sage, man sollte "nur hinter Fable 5" als Marketing behandeln, bis ein Dritter es bewertet hat, genau wie bei jeder anderen neuen Modell-Veröffentlichung.
Preise und Zugang: Was man heute wirklich anfassen kann
Qwen3.8-Max-Preview ist über drei Wege live: Alibabas Token Plan-Abo sowie die agentischen Plattformen Qoder und QoderWork. Während der Preview läuft es zu 10 % des Standardpreises.
Der Token Plan ist kreditbasiert und erneuert sich in einem 7-Tage-Fenster:
| Stufe | Preis | Credits (pro 7 Tage) | Bemerkenswert |
|---|---|---|---|
| Lite | 6 $ | 2.500 | Einstiegsstufe zum Ausprobieren der Preview |
| Pro | 68 $ | 40.000 | Läuft mit 6–8 Agenten gleichzeitig |
Ein paar Dinge, die man beachten sollte, bevor man die Karte zückt:
- Kein Preis pro Token wurde speziell für 3.8 Max veröffentlicht. Wer heute vorhersehbare Preise pro Token braucht, ist mit den älteren Qwen-Stufen auf der sicheren Seite.
- Credits, keine Tokens. Kreditsysteme machen Kosten schwer vorhersehbar, besonders wenn das zugrundeliegende Modell eine "sich kontinuierlich weiterentwickelnde" Preview ist, deren Verbrauch sich unter der Hand ändern kann.
- Der 10-%-Preview-Rabatt ist per Definition vorübergehend. Kalkuliere mit dem Preis ohne Rabatt, nicht mit dem Aktionspreis.

Der Self-Hosting-Realitätscheck
"Open-weight bald" ist der Satz, der r/LocalLLaMA begeistert hat, und dann hat man dort nachgerechnet.
Ein 2,4-Billionen-Modell benötigt bei 4-Bit-Genauigkeit allein für die Gewichte rund 1,2 Terabyte. Eine einzelne Nvidia H200 hat 141 GB. Selbst eine 8-Karten-Box lässt einen mit unbequemer Rechnerei und einer sehr kurzen Liste von Leuten zurück, die das Modell überhaupt laden können. Die praktische Einschätzung: Self-Hosting von Qwen 3.8 Max ist nichts, was normale Teams tun werden, mit oder ohne Gewichte, bis eine destillierte oder kleinere Variante erscheint. Das Open-Weight-Versprechen ist relevant für die Forschungscommunity und eine Handvoll gut finanzierter Labs, nicht für den durchschnittlichen Käufer, der ein KI-Helpdesk auswählt.
Und "bald" hat bisher weder Datum noch Lizenz noch ein Hugging-Face-Repo. Wenn dein Plan davon abhängt, das Modell inhouse zu betreiben, ist dieser Plan momentan Luft.
Also, solltest du es nutzen? (ein ehrliches Entscheidungs-Widget)
Die Antwort hängt wirklich davon ab, was du vorhast. Hier ist die Einschätzung, die ich für jede Situation treffen würde:
Wo das für ein Support-Team hinpasst
Hier ist der Teil, der mir am wichtigsten ist, weil ich hier zusehen musste, wie Teams Monate verbrannt haben.
Ein Frontier-Modell ist ein roher Motor. Um Kunden sicher zu antworten, braucht man trotzdem alles drumherum: Retrieval über das eigene Help Center und vergangene Tickets, Guardrails, damit nur beantwortet wird, wobei sich das Modell auch sicher ist, eine saubere Übergabe an einen Menschen, Reporting und eine Möglichkeit, Änderungen zu testen, bevor sie echte Menschen erreichen. Qwen 3.8 Max liefert davon nichts. Es liefert einen sehr großen, sehr leistungsfähigen Text-und-Vision-Motor und einen API-Key.
Der Instinkt "wir bauen das einfach selbst auf dem neuesten Modell" ist stark, und er unterschätzt fast immer diese umgebende Schicht. Ein eesel-Kunde hat die Build-vs-Buy-Entscheidung klar auf den Punkt gebracht:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Das ist der Trade-off. Man kann Qwen 3.8 Max selbst in sein Helpdesk einbinden und die Wartung für immer selbst tragen, oder man nutzt eine Schicht, die das schon erledigt hat. eesel ist bewusst modellagnostisch aufgebaut: Es läuft unter der Haube auf Frontier-Modellen, verbindet sich in Minuten mit deinem bestehenden Helpdesk und Wissen, und lässt dich gegen echte historische Tickets simulieren, sodass du die Lösungsquote siehst, bevor du live gehst, nicht erst nachdem sich ein Kunde beschwert hat.

Und es gibt einen Kontrollpunkt, den man leicht vergisst: Die DTC-Supplement-CX-Leiterin, die ich oft zitiere, hat es auf den Punkt gebracht: "Ich brauche eine KI, die nur die Tickets bearbeitet, bei denen sie sich sicher ist, und alle anderen in Ruhe lässt." Kein Modell, wie groß auch immer, gibt einem diesen Regler von allein. Die Schicht drumherum schon.
Wie Qwen 3.8 Max im Vergleich zum Rest abschneidet
Wer im Juli 2026 Modelle vergleicht, für den ist Qwen 3.8 Max eines von drei großen, halboffenen Releases innerhalb eines Zwei-Wochen-Fensters:
- Kimi K3 (Moonshot) erschien als tatsächliches Open-Weight-Release, was Qwens "bald" reaktiv wirken lässt.
- GPT-5.6 und Claude bleiben die geschlossene Frontier, an der sich Qwen selbst misst.
- Grok, Gemini und Mistral runden das Feld der Modelle ab, die man realistisch bewerten würde.
Das Unterscheidungsmerkmal, auf das Qwen setzt, ist Skalierung plus das Open-Weight-Versprechen. Aber für jeden, der KI-Agenten für einen geschäftlichen Anwendungsfall vergleicht, ist das rohe Modell-Ranking die falsche Achse. Was zählt, ist das Produkt, das darauf aufgebaut wird, und auf dieser Achse konkurriert eine 2,4-Billionen-Preview bislang mit nichts, weil es kein Produkt gibt, nur einen Motor. Wer Agenten für echte Arbeit baut, findet im Leitfaden zu den besten KI-Agenten einen besseren Ausgangspunkt als die Benchmark-Behauptung eines einzelnen Modells.
Mein Fazit
Qwen 3.8 Max ist eine interessante Preview und ein klares Signal, dass die chinesischen Labs beim Thema Skalierung stark aufholen. Aber als etwas, worauf man diese Woche setzen würde, ist es noch früh: keine Benchmarks, keine aktive Parameterzahl, keine Lizenz, kein realistisches Self-Hosting und kreditbasierte Preview-Preise, die sich noch ändern werden. Probier es für 6 $ aus, wenn du neugierig bist. Bau deine Roadmap noch nicht darauf auf.
Und wenn dein eigentliches Ziel weniger Tickets und schnellere Antworten sind: Das Modell war nie der schwierige Teil. Die Schicht drumherum ist es.
Häufig gestellte Fragen
Was ist Qwen 3.8 Max?
Qwen 3.8 Max ist Alibabas Flaggschiff-KI-Modell, am 19. Juli 2026 als Qwen3.8-Max-Preview vorgestellt. Es ist ein multimodales Mixture-of-Experts-Modell mit 2,4 Billionen Parametern (Text, Bilder, Video, Dokumente) und einem 1-Millionen-Token-Kontextfenster. Die ausführliche Qwen-Review liefert den Kontext zur gesamten Modellfamilie.
Wie viel kostet Qwen 3.8 Max?
Während der Preview läuft es über Alibabas Token Plan zu 10 % des Standardpreises, der kreditbasiert ist: von einer 6-$-Lite-Stufe (2.500 Credits pro 7 Tage) bis zu einer 68-$-Pro-Stufe (40.000 Credits, 6–8 gleichzeitige Agenten). Ein eigener Preis pro Token für 3.8 Max wurde noch nicht veröffentlicht; dafür lohnt ein Blick auf die aktuellen Qwen-Preise.
Ist Qwen 3.8 Max wirklich "nur hinter Fable 5"?
Das ist Alibabas eigene Behauptung, basierend auf internen Evaluationen. Kein Dritter (Artificial Analysis, LMArena) hat das Modell bislang bewertet, und keine Benchmark-Tabelle wurde veröffentlicht, also sollte man es als Positionierungsaussage und nicht als geprüftes Ranking behandeln, genau wie bei jedem anderen Frontier-Launch.
Kann ich Qwen 3.8 Max selbst hosten?
Realistisch heute nicht. Alibaba hat offene Gewichte "bald" versprochen, aber ohne Datum, Lizenz oder Repo. Und bei rund 1,2 TB an Gewichten (4 Bit) gegenüber 141 GB pro H200-GPU gibt es für normale Teams kein praktikables Single-Box-Deployment, bis eine kleinere oder destillierte Variante erscheint. Für die meisten Käufer ist ein verwaltetes KI-Helpdesk die bessere Wahl.
Wie unterscheidet sich Qwen 3.8 Max von Qwen 3.7 Max?
Laut Alibaba schlägt 3.8 Max das 3.7-Max-Modell bei Coding, Full-Stack-Entwicklung, Datenanalyse und Büro-Workflows, und es ist das erste multimodale Modell des Teams über 1 Billion Parameter. Das 1-Millionen-Token-Kontextfenster bleibt erhalten. Details zur Vorgängergeneration finden sich im Qwen-Überblick.
Ist Qwen 3.8 Max gut für den Kundenservice?
Als rohes Modell hat es keine Support-Funktionen, kein Retrieval, keine Guardrails, keine Eskalation und keine Analytics. Diese Schicht müsste man selbst bauen. Speziell für Support ist ein zweckgebautes Tool wie eesel, das auf Frontier-Modellen läuft und sich mit dem eigenen Helpdesk verbindet, der schnellere und sicherere Weg, als selbst eine Preview-API anzubinden. Optionen lassen sich in der Übersicht zur besten KI für den Kundenservice vergleichen.
Was sind die besten Alternativen zu Qwen 3.8 Max?
Bei rohen Modellen sind Kimi K3, GPT-5.x, Claude und Gemini die direkten Vergleiche. Für einen Support-Anwendungsfall lohnt sich ein Blick auf KI-Agenten für den Kundenservice statt auf ein einzelnes Modell. Es gibt außerdem eine ausführlichere Qwen-Alternativen-Liste.

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








