
The comparison everyone wants does not exist yet
Beginnen wir mit dem unbequemen Teil, denn jeder andere Artikel zu diesem Vergleich übergeht ihn einfach.
Ein Modellvergleich braucht zwei Zahlensätze. Anthropic hat seine veröffentlicht: eine System-Karte, eine Preisliste, dazu eine ganze Wand namentlich genannter Launch-Partner mit belastbaren Zahlen. Alibaba hat zwei Posts auf X und einen funktionierenden kostenpflichtigen Endpunkt veröffentlicht. Das ist die gesamte Beweisgrundlage für ein Modell, das sie als zweitbestes der Welt bezeichnen.

Zur Einordnung, wie weit das von Alibabas eigenem Maßstab entfernt ist: Das vorherige Flaggschiff Qwen3.7-Max startete im Mai 2026 mit echten Zahlen, 80,4 % auf SWE-bench Verified und dem höchsten Platz eines chinesischen Modells im Artificial-Analysis-Index zu jener Zeit. Qwen3.8-Max kam mit dem Selbstbewusstsein, aber ohne die Belege.
Behandeln Sie das Folgende also als Vergleich zweier Produkte, nicht zweier Intelligenzen. Das ist der einzige Vergleich, den die Beweislage tatsächlich hergibt.
What Qwen3.8-Max actually is
Qwen ist die Modellfamilie von Alibaba Cloud, und "Max" ist die proprietäre Flaggschiff-Linie, oberhalb der günstigeren Stufen Plus und Turbo. Qwen3.8-Max wurde am 19. Juli 2026 als Preview vorgestellt.
Die von Alibaba genannten Spezifikationen:
- 2,4 Billionen Parameter insgesamt in einem spärlichen Mixture-of-Experts-Design, laut Qwen auf X.
- Das erste multimodale Qwen über 1T Parametern, das Text, Bilder, Video und Dokumente verarbeitet, laut Lead-Forscher Shuai Bai.
- Ein Kontextfenster von 1 Million Token, übernommen von Qwen3.7-Max.
- Auf Coding und agentische Arbeit ausgerichtet, wo Alibaba zufolge der Vorgänger übertroffen wird.
Die Anzahl aktiver Parameter, das Sparsity-Verhältnis und die Lizenz fehlten allesamt. Ein dichtes 2,4T-Modell wäre viel zu teuer im Betrieb, sodass erst das MoE-Routing diese Zahl überhaupt bezahlbar macht, und genau diese Zahl hat niemand veröffentlicht.
"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."
What Claude Fable 5 actually is
Anthropic positioniert Fable 5 als sein leistungsfähigstes allgemein verfügbares Modell, gebaut für "ambitionierte, lang laufende, asynchrone Arbeit". Diese Ausrichtung ist für ein Flaggschiff ungewöhnlich eng. Anthropics eigene Modellübersicht rät, mit Claude Opus 5 zu beginnen und erst für Workloads, die die höchste verfügbare Leistungsfähigkeit brauchen, auf Fable 5 hochzustufen.
Ein paar Dinge machen es zu einem echt anderen Tier als eine gewöhnliche Modellveröffentlichung.
Das Denken ist immer aktiv. Fable 5 akzeptiert den veralteten Extended-Thinking-Parameter nicht und hat keinen veröffentlichten Ausschalter. Die Tiefe wird stattdessen über das Effort-Level gesteuert.
Es leitet seinen eigenen Traffic um. Fable 5 kommt mit Schutzmechanismen für Cybersicherheit und Biologie, und markierte Anfragen werden automatisch zu weniger leistungsfähigen Modellen umgeleitet. Cyber-Anfragen fallen auf Opus 4.8 zurück, Biologie auf Opus 5. Eine Opus-Antwort ist buchstäblich das, was eine blockierte Fable-Anfrage zurückliefert, was mitten im Workflow ein merkwürdiges Erlebnis ist.
Die Nutzung erfordert eine 30-tägige Datenspeicherung zur Sicherheitsüberwachung. Für einen regulierten Kunden ist das ein Thema für die Beschaffung und keine simple Checkbox.
Die Zahlen der Launch-Partner sind der stärkste Beleg in diesem gesamten Vergleich, und man sollte sie eher als Kostenaussagen denn als Intelligenzaussagen lesen. Ein Partner berichtet, Fable 5 schlage Opus 4.8 in einer alltäglichen Tabellenkalkulations-Suite bei jedem Effort-Level und beende Durchläufe 25-30 % schneller. Ein anderer gibt an, mit einem Drittel der Reasoning-Token Ergebnisse auf Grenzniveau in der Physik erreicht zu haben.
Head to head on what is actually published
Hier sind alle Dimensionen, zu denen beide Seiten etwas Konkretes gesagt haben. Leere Zellen sind leer, weil der Anbieter nichts veröffentlicht hat, nicht weil ich nichts gefunden hätte.
| Qwen3.8-Max | Claude Fable 5 | |
|---|---|---|
| Vendor | Alibaba Cloud | Anthropic |
| Status | Preview (Qwen3.8-Max-Preview) | Allgemein verfügbar |
| Launched | 19. Juli 2026 | 9. Juni 2026 |
| Model ID | nicht veröffentlicht | claude-fable-5 |
| Architecture | 2,4T spärliches Mixture-of-Experts | nicht veröffentlicht |
| Multimodal input | Text, Bilder, Video, Dokumente | Text, Bilder, Diagramme, Charts, PDF |
| Context window | 1M Token | 1M Token |
| Max output | nicht veröffentlicht | 128k Token |
| Input price | kein Token-Preis veröffentlicht | 10 $ / MTok |
| Output price | kein Token-Preis veröffentlicht | 50 $ / MTok |
| How you buy it | Token-Plan-Abo, Qoder, QoderWork | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Prompt caching discount | nicht veröffentlicht | 90 % auf Input-Token |
| Benchmark table | keine zur Preview | Partner-Benchmarks, keine öffentliche Zahlentabelle |
| Model / system card | keine | System-Karte veröffentlicht |
| Open weights | "bald" versprochen, kein Datum, keine Lizenz | nein |
| API protocols | OpenAI- und Anthropic-kompatibel | Anthropic |
| Data retention | nicht veröffentlicht | 30 Tage, verpflichtend |
| Documented outage | entfällt (Preview) | 12. Juni bis 1. Juli 2026 |
| Knowledge cutoff | nicht veröffentlicht | Januar 2026 |
Zwei der Zeilen verdienen einen zweiten Blick.
Die Zeile API protocol ist der versteckte Vorteil. Alibabas Token-Plan-Endpunkt spricht sowohl das OpenAI- als auch das Anthropic-Protokoll, sodass Claude Code, Cursor und Cline mit Qwen3.8-Max funktionieren, sobald man einen Schlüssel hat. Es auszuprobieren ist eine Fünf-Minuten-Sache, und diese Zugänglichkeit leistet einen erheblichen Teil der Arbeit hinter dem Hype.
Die Zeile knowledge cutoff ist die stille Kuriosität von Fable 5. Januar 2026 liegt vier Monate früher als der Mai-2026-Cutoff von Opus 5, obwohl Fable das neuere und teurere Modell ist. Wer sich also auf aktuelle Fakten verlässt, bekommt beim teureren Modell weniger Wissen.
Price: two sheets that do not line up
Hier bricht der Vergleich vollständig zusammen, statt nur unscharf zu werden.

Anthropic verkauft Token. Fable 5 kostet 10$ Input und 50$ Output pro Million, exakt das Doppelte von Claude Opus 5 auf beiden Linien, wobei der 90%-Prompt-Caching-Rabatt weiterhin gilt und US-only-Inferenz zum 1,1-fachen verfügbar ist.
Alibaba verkauft stattdessen ein Abo. Während der Preview läuft Qwen3.8-Max über den Token-Plan zu 10 % des Standardpreises, mit Personal-Stufen für ungefähr 6$, 20$ und 70$ im Monat für Lite, Standard und Pro. Dazu kommt noch der Nachtrabatt, zusätzlich 80 % Rabatt auf den Credit-Verbrauch zwischen 22:00 und 08:00 Uhr (UTC+8), sodass Durchläufe außerhalb der Geschäftszeiten bei ungefähr 0,2 % des Standardsatzes landen.
Diese beiden Werte lassen sich nicht durcheinander teilen. Der eine ist ein Satz, der andere ein Kontingent, und der Nenner dieses Kontingents sind Credits, deren Token-Umrechnung nie veröffentlicht wurde.
Es gibt außerdem eine zweite Falle im Abo-Modell, und die ist nicht hypothetisch. Bei der Vorgängergeneration berichteten Qwen-Nutzer, dass Credits deutlich schneller aufgebraucht waren als erwartet, und Qwen-Modelle neigen tatsächlich dazu, pro Aufgabe mehr Output-Token zu erzeugen als vergleichbare Modelle. Das treibt die echten Kosten still nach oben, selbst wenn der Preisaufkleber unschlagbar aussieht. Der Preview-Rabatt kaschiert das vorerst. Planen Sie ein Budget für den Tag, an dem er endet, und lesen Sie unsere Aufschlüsselung der Qwen3.8-Max-Preise, bevor Sie eine Workload verbindlich einsetzen.
Die Aussagen der Fable-5-Partner zeigen dagegen beim Gesamtkosten-Punkt in die andere Richtung. Weniger Turns und bei schwierigen Aufgaben nur ein Drittel der Reasoning-Token bedeuten, dass der 2x-Preisaufkleber nicht zu einer 2x-Rechnung wird. Es ist dieselbe Logik, die wir in unserem Vergleich Opus 5 vs. Sonnet 5 durchgehen, wo das günstigere Modell nicht automatisch auch der günstigere Job ist.
Where each one actually breaks
Fragen Sie "welches ist besser", bekommen Sie ein Schulterzucken. Fragen Sie "welches kann ich am Montag in Produktion nehmen", antworten beide mit Nein, aus völlig unterschiedlichen Gründen.

Qwen3.8-Max ist eine Preview. Keine Lizenz und kein Token-Preis, auch keine Modellkarte, dazu ein Endpunkt, der sich unter den Füßen ändern kann. Für Experimente in Ordnung, für alles mit Kundenbezug disqualifizierend.
Fable 5 hat eine öffentliche Verfügbarkeitshistorie mit einem Loch mittendrin. Anthropic startete am 9. Juni, sperrte den Zugriff am 12. Juni und stellte ihn am 1. Juli wieder her. Neunzehn Tage, vom Anbieter auf der eigenen Seite eingeräumt. Zählt man die verpflichtende 30-tägige Speicherung und die Sicherheits-Umleitung dazu, hat man drei Beschaffungsfragen zu klären, bevor auch nur ein einziges Ticket bearbeitet wird.
Keins von beidem ist ein Schlag gegen das zugrunde liegende Modell. Beides sind Gründe, warum die Wahl weniger zählt als die Architektur, die man drumherum baut.
So which one should you actually test?
Die Preview ist günstig und das Flaggschiff ist schnell, wodurch "sollte ich wechseln" die falsche Frage wird. Klären Sie zuerst, was Sie eigentlich testen wollen.
Qwen3.8-Max oder Claude Fable 5?
Wählen Sie die Aufgabe, die Sie tatsächlich haben.
What this actually means if you are buying for support
Jetzt kommt der Teil, der mich wirklich interessiert, denn KI-Agenten für Support-Warteschlangen zu bauen ist mein Tagesgeschäft.
Alle paar Wochen bringt so ein Launch wie dieser Menschen dazu zu denken, das Modell sei der Flaschenhals. Ist es nicht, und genau diese Lücke ist der Ort, an dem die meisten KI-Support-Projekte still und leise scheitern. Sowohl Qwen3.8-Max als auch Fable 5 liefern reine Reasoning-Leistung. Keines von beiden kennt Ihre Rückerstattungsrichtlinie, Ihre produktspezifischen Sonderfälle oder die Tatsache, dass Ticket #4021 ein VIP ist, der schon zweimal geschrieben hat. Keines hat eine Leitplanke, die es davon abhält, selbstsicher eine Antwort zu erfinden, und keines ist mit dem Helpdesk verbunden, wo die eigentliche Arbeit stattfindet.
Wir haben Jahre damit verbracht, KI in echte Support-Warteschlangen einzubauen, und die Lektion, die hängen geblieben ist: Eine selbstsichere falsche Antwort ist schlimmer als gar keine Antwort. Der Bot eines Kunden bestätigte munter, dass er Produktmodelle unterstütze, die gar nicht in der Datenbank vorhanden waren, weil im Helpcenter stand "wir unterstützen alle Modelle". Eine größere Parameterzahl macht diesen Fehler wahrscheinlicher, nicht unwahrscheinlicher, weil das Modell dabei noch überzeugter klingt. Ein Support-Lead hat die Anforderung besser formuliert, als ich es könnte:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."
a DTC brand CX lead handling 7,000 tickets a month
Das ist eine Aussage über Architektur, nicht über die Modellwahl. Deshalb simuliert eesel AI, bevor überhaupt irgendetwas live geht, gegen Ihre historischen Tickets, sodass Sie die Lösungsquote und die genauen Antworten auf echte vergangene Konversationen sehen, statt es über einen Kunden herauszufinden. Deshalb werden Antworten auch nach Konfidenz geroutet: Unsicherheit bedeutet Entwurf oder Eskalation, niemals Raten. Auf diese Weise betrieben, erreichte Gridwise im ersten Monat eine Tier-1-Lösungsquote von 73 %.
Der größere Punkt, den man aus diesem ganzen Vergleich mitnehmen sollte, ist dieser: Zwei Labs haben die Größenobergrenze innerhalb von zwei Wochen verschoben, Kimi K3 auf 2,8T und Qwen3.8-Max auf 2,4T, und dann brachte Anthropic ein Modell heraus, das tagelang unbeaufsichtigt arbeitet. Die Modell-Schicht wird schneller besser und günstiger, als es irgendein Beschaffungszyklus verfolgen kann. Bauen Sie also so, dass Sie den Motor austauschen können, ohne alles drumherum neu zu verkabeln, dann landet jeder dieser Fortschritte kostenlos bei Ihnen.
Try eesel AI
Wenn Sie hierher gekommen sind, um herauszufinden, welches Modell Sie auf Ihre Support-Warteschlange ansetzen sollen, lautet die ehrliche Antwort: Diese Wahl zählt weit weniger als die Schicht darüber. Diese Schicht ist das, was eesel AI ist.

Es bindet sich an Zendesk, Freshdesk, Slack und über 100 weitere Tools an, lernt aus Ihrem Helpcenter und vergangenen Tickets und beginnt innerhalb von Minuten mit dem Entwerfen. Das Unterscheidungsmerkmal ist die Vertrauensrampe: Simulieren Sie gegen Ihre echte Ticket-Historie, lesen Sie die Zahlen, starten Sie im Entwurfsmodus und gehen Sie erst dann autonom, wenn Sie zufrieden sind. Sie bekommen die Klugheit des Frontier-Modells mit Leitplanken, die für den Support gebaut sind, und müssen diesen Vergleich nie wieder selbst durchführen. eesel testen, kostenlos, keine Kreditkarte nötig.
Häufig gestellte Fragen
Ist Qwen3.8-Max besser als Claude Fable 5?
Wie schneidet der Preis von Qwen3.8-Max im Vergleich zu Claude Fable 5 ab?
Wie groß ist das Kontextfenster von Qwen3.8-Max im Vergleich zu Claude Fable 5?
Ist Qwen3.8-Max Open Source und Claude Fable 5 nicht?
Kann ich Qwen3.8-Max oder Claude Fable 5 für den Kundensupport nutzen?
Welches Modell sollte ich wählen, wenn ich zuverlässige Verfügbarkeit brauche?
Was sind die besten Alternativen zu Qwen3.8-Max?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







