Claude Sonnet 5.5 im Test: stark bei Medium, eine Falle bei Max

Kira
Geschrieben von

Kira

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet September 29, 2026

Expertengeprüft
Handgezeichnete Illustration eines Testers am Schreibtisch mit einer Sterne-Bewertungstafel, einem Tacho und Stapeln aus Code-Büchern und Support-Tickets, für einen Test von Claude Sonnet 5.5

Mein Fazit auf einen Blick

Am Tag nach dem Launch habe ich Anthropics Ankündigung und die Modelldokumentation gelesen, dann den Migrationsleitfaden und außerdem den Hacker-News-Launch-Thread mit rund 550 Kommentaren. Meine Aufgabe ist der Bau von KI-Agenten für den Helpdesk-Kollegen von eesel, also bin ich mit einer Frage an alles herangegangen: Würde ich dieses Modell morgen unter eine echte Support-Queue setzen?

Die Claude-Platform-Dokuseite zu Claude Sonnet 5.5 mit 1M Kontextfenster, 128K maximaler Ausgabe, Preisen von 2 $ und 10 $ pro Million Tokens und einem Vergleich mit Fable 5.1, Opus 5.5 und Haiku 4.5, entnommen aus der Claude-Platform-Dokumentation
Die Claude-Platform-Dokuseite zu Claude Sonnet 5.5 mit 1M Kontextfenster, 128K maximaler Ausgabe, Preisen von 2 $ und 10 $ pro Million Tokens und einem Vergleich mit Fable 5.1, Opus 5.5 und Haiku 4.5, entnommen aus der Claude-Platform-Dokumentation

Hier die Kurzfassung, bewertet nach dem, was zählt, sobald man live geht:

Was ich geprüft habeNoteWarum
Code-Qualität9/1070,6 % bei Terminal-Bench 4.0, über Opus 5.5
Wissensarbeit8/10GDPval-AA 1844, zwei Punkte hinter Opus 5.5 mit 1846
Token-Effizienz9/10 bei Low/Medium, 4/10 bei Max~121k vs. 497k Tokens pro Antwort bei Balyasny, aber 193k pro Aufgabe bei Max
Tempo8/1030 %+ schnellere Ausgabe als Sonnet 5
Migrationsaufwand5/10Fünf Breaking Changes, einer davon heikel für Support-Bots
Eignung für Support8/10Zendesk sah 20 % schneller bearbeitete Tickets
Gesamt8/10Bestes Preis-Leistungs-Verhältnis im Lineup, mit einer teuren Einstellung, die man meiden sollte

Kurz zur Methode, damit klar ist, worauf diese Noten beruhen. Ich habe keinen monatelangen Produktivtest gemacht, da das Modell erst einen Tag alt ist. Die Noten stützen sich auf Anthropics veröffentlichte Zahlen und die namentlich genannten Kundenergebnisse im Launch-Beitrag, dazu unabhängige Benchmark-Läufe, die andere öffentlich gepostet haben, und meine eigene Lesart der API-Dokumentation im Vergleich dazu, wie eesel Modelle in Ticket-Workflows einbindet. Wo eine Zahl von Anthropic stammt, sage ich das.

Was Claude Sonnet 5.5 ist

Claude Sonnet 5.5 ist das Mittelklasse-Modell in Anthropics Claude-5.5-Familie, veröffentlicht am 28. September 2026. Es sitzt unter Claude Opus 5.5 und über Haiku 4.5, während Claude Fable 5.1 die absolute Spitze des Angebots hält. Anthropic bezeichnet es als "a faster, lower-cost complement" zu Opus, am stärksten bei "well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets."

Zu den Specs: Die Modellübersicht nennt ein Kontextfenster von 1M Tokens und 128K maximale Ausgabe (300K bei Batch), Wissensstand Juni 2026 und denselben Tokenizer wie Claude Sonnet 5. Für den vollständigen Launch-Überblick ist die Sonnet-5.5-Übersicht meines Kollegen gut. Dieser Beitrag ist eher das Urteil.

Wo Claude Sonnet 5.5 stark ist

Drei Dinge stachen in den Launch-Daten heraus, und alle drei zeigen sich in namentlich genannten Kundenergebnissen, nicht nur in Anthropics eigenen Diagrammen.

Es programmiert wie ein Opus-Modell

Die Schlagzeile ist Terminal-Bench 4.0, ein agentischer Coding-Test, der in der Kommandozeile läuft. Sonnet 5 erreichte dort 10,3 %, und Sonnet 5.5 erreicht 70,6 %, mehr als Opus 5.5 mit 66,4 %. Das ist kein Tippfehler. Es ist der größte Sprung von einer Generation zur nächsten, den ich bisher bei einem Sonnet-Modell gesehen habe.

Anthropics Launch-Benchmark-Tabelle, die Sonnet 5.5, Sonnet 5, Opus 5.5 und GPT-6 Sol bei Terminal-Bench 4.0, FrontierCode, CursorBench, GDPval-AA, AA-Briefcase, Humanity's Last Exam, OSWorld und Chartography vergleicht, entnommen aus Anthropics Ankündigung
Anthropics Launch-Benchmark-Tabelle, die Sonnet 5.5, Sonnet 5, Opus 5.5 und GPT-6 Sol bei Terminal-Bench 4.0, FrontierCode, CursorBench, GDPval-AA, AA-Briefcase, Humanity's Last Exam, OSWorld und Chartography vergleicht, entnommen aus Anthropics Ankündigung

Bei den anderen Coding-Tests liegt es etwas hinter Opus: CursorBench 4.0 steht bei 55,5 % gegenüber 57,8 %, und FrontierCode bei 52,1 % (Xhigh) gegenüber 54,4 %. Bei einem Modell zum halben Token-Preis ist eine Lücke von zwei Punkten ehrlich gesagt ein Schnäppchen. Genau deshalb haben die Leute in der Debatte Opus vs. Sonnet größtenteils aufgehört, über Qualität zu streiten, und diskutieren nun über Kosten.

Auch die Kundenzahlen stützen das. Base44 sagte, dass Sonnet 5.5 über 118 echte App-Builds "produced apps that scored level with Opus 5" lieferte, und zwar in 3,6 Iterationen pro Build, wo Opus 5 7,7 brauchte. Unity gibt an, 90 % der Aufgaben in seinem mehrstufigen Editor-Benchmark gelöst zu haben. Und wenn Sie in Claude Code programmieren, ist dies jetzt das Modell, das Sie bei Medium standardmäßig sehen.

Es kommt mit deutlich weniger Tokens ans Ziel

Der Preis pro Token hat sich nicht geändert; geändert hat sich die Zahl der Tokens. Balyasny Asset Management führte 2.441 Finanzaufgaben aus und stellte fest, dass Sonnet 5.5 etwa 121k Tokens pro Antwort nutzte, wo Sonnet 5 497k brauchte. Bei seinen Slackbot-Evals sah Slack rund 14 % weniger Output-Tokens ohne Prompt-Änderungen, und Lovable meldete ein Drittel weniger Tool-Aufrufe.

Anthropics eigene Demo zeigt dasselbe. Bei einem Prompt "wind shaping sand dunes" schrieb Sonnet 5 noch Code, als Sonnet 5.5 bereits eine laufende Animation hatte:

Sonnet 5 schreibt im Side-by-Side-Test noch mitten an seinem Sanddünen-Programm, entnommen aus Anthropics Sonnet-5.5-Ankündigung
Sonnet 5 schreibt im Side-by-Side-Test noch mitten an seinem Sanddünen-Programm, entnommen aus Anthropics Sonnet-5.5-Ankündigung
Die fertige Sanddünen-Animation von Sonnet 5.5, die im selben Side-by-Side-Test läuft, aus Anthropics Launch-Vergleich
Die fertige Sanddünen-Animation von Sonnet 5.5, die im selben Side-by-Side-Test läuft, aus Anthropics Launch-Vergleich

Diese Effizienz ist eigentlich das Produkt. Laut Anthropic ergibt sich "up to 30% less per task" gegenüber Sonnet 5. Bei den Teams, mit denen ich spreche, bedeuten weniger Tokens auch weniger Sekunden, die ein Kunde auf eine Antwort wartet, und das ist ihnen wichtiger als die Rechnung.

Es bewältigt Support-Tickets gut

Das ist der Teil, der mir am wichtigsten ist. Zendesks Director of AI sagte im Launch-Beitrag, sie hätten "fed Claude Sonnet 5.5 hundreds of real support use cases across replies and escalation requests. It made fewer wrong decisions," und Tickets wurden 20 % schneller bearbeitet. Auf Seiten von Atlassian sagt das Unternehmen, dass Rovo-Agents bis zu 30 % schneller laufen werden als mit Sonnet 5.

Für Arbeit im Stil von Zendesk AI sind diese beiden Zahlen die entscheidenden: weniger falsche Eskalationsentscheidungen und weniger Warten. Beide haben sich in die richtige Richtung bewegt.

Handgezeichnete Bewertungstafel für Claude Sonnet 5.5 mit zwei Spalten: wo es gewinnt (Terminal-Bench 4.0 mit 70,6 %, 121k vs. 497k Tokens pro Antwort und Support-Tickets 20 % schneller) und wo es patzt (Max mit 7,60 $ vs. Opus 5,98 $ pro Aufgabe, fragt beim Nutzer nach und Cyber-Aufgaben fallen auf Sonnet 5 zurück)
Handgezeichnete Bewertungstafel für Claude Sonnet 5.5 mit zwei Spalten: wo es gewinnt (Terminal-Bench 4.0 mit 70,6 %, 121k vs. 497k Tokens pro Antwort und Support-Tickets 20 % schneller) und wo es patzt (Max mit 7,60 $ vs. Opus 5,98 $ pro Aufgabe, fragt beim Nutzer nach und Cyber-Aufgaben fallen auf Sonnet 5 zurück)

Wo Claude Sonnet 5.5 schwächelt

Die Schwachstellen sind enger begrenzt, als Skeptiker behaupten, aber eine davon verändert, wie Sie das Modell betreiben sollten.

Max kostet mehr als Opus

Das ist der Befund, der mein Urteil verändert hat. Anthropics eigener Launch-Beitrag räumt ein, dass Sonnet 5.5 "complements Opus 5.5 best when running at lower effort settings" und dass es "at higher settings, it can perform comparably at a similar cost". Die unabhängigen Läufe gehen noch einen Schritt weiter.

Bei Artificial Analysis kostet, wie ein Redditor anmerkte, Sonnet 5.5 bei Max 7,60 $ pro Aufgabe gegenüber 5,98 $ für Opus 5.5 bei Max, weil es 193k Tokens pro Aufgabe nutzte, wo Opus 119k brauchte. Simon Willison ließ am Launch-Tag denselben SVG-Prompt auf jeder Effort-Stufe laufen. Low kostete 1,6 Cent und dauerte 10 Sekunden. Max kostete 1,28 $ und lief 15 Minuten 40 Sekunden, verbrannte seine vollen 128.000 Thinking-Tokens und scheiterte dann daran, das Bild zu erzeugen.

Handgezeichnete Treppe mit fünf Effort-Stufen für denselben SVG-Prompt: Low mit 1,6 Cent und 10 s, Medium mit 1,8 Cent und 11 s, High mit 2,3 Cent und 17 s als Sweet Spot markiert, Xhigh mit 5,7 Cent und 41 s und Max mit 1,28 $ und 15 Min 40 s, durchgestrichen als gescheitert, weil die Thinking-Tokens ausgingen
Handgezeichnete Treppe mit fünf Effort-Stufen für denselben SVG-Prompt: Low mit 1,6 Cent und 10 s, Medium mit 1,8 Cent und 11 s, High mit 2,3 Cent und 17 s als Sweet Spot markiert, Xhigh mit 5,7 Cent und 41 s und Max mit 1,28 $ und 15 Min 40 s, durchgestrichen als gescheitert, weil die Thinking-Tokens ausgingen

Selbst die FrontierCode-Fußnote von Anthropic hat dasselbe Muster. Sonnet 5.5 erreicht 52,1 % bei Xhigh, aber nur 46,2 % bei Max, weil es bei Max "more often ran Claude Code's code-review skill", was zu Timeouts oder Änderungen außerhalb des Aufgabenumfangs führte. Mehr Nachdenken machte das Ergebnis hier schlechter.

Die Regel ist also einfach: Behandeln Sie Max für Sonnet 5.5 als tabu. Eine Aufgabe, die so viel Reasoning braucht, gehört zu Opus 5.5, das mit weniger Tokens ans Ziel kommt.

Opus ist bei offenem Urteilsvermögen weiterhin besser

Anthropic ist hier ziemlich offen: "Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment." Die ersten Praxisberichte stimmen zu.

Hacker News

"Tried Sonnet 5.5 but worse than OPUS for thinking for sure, less error/inconsistency check. I used Opus 5.5 med vs. Sonnet 5.5 High on hermes with the same agent.md, and soul.md"

Auf den Support übertragen ist das der verärgerte Enterprise-Kunde mit einem Abrechnungsstreit und drei früheren Tickets. Dieses Ticket würde ich Sonnet 5.5 nicht unbeaufsichtigt geben. Das Zurücksetzen eines Passworts, die Abfrage des Bestellstatus oder die Frage "Wie exportiere ich meine Daten" würde ich ihm dagegen den ganzen Tag überlassen.

Es hält an, um Fragen zu stellen

Ein Entwickler betreibt einen adversarialen Benchmark auf Basis einer esoterischen Programmiersprache. Dort erreichte Sonnet 5.5 7,4 % gegenüber 17,8 % bei Sonnet 5, und seine Erklärung war, es "is more reluctant to keep going to get an answer, instead it returns to ask the user questions whether to keep going." Base44 dagegen sagte, es "rarely stopped mid-build to ask the user a question."

Meine Einschätzung: In interaktiver Arbeit ist ein Innehalten zur Rückfrage oft ohnehin das, was man will. In einer unbeaufsichtigten Pipeline ist es anders: Ein Modell, das nachfragt, kann einen Job über Nacht blockieren. Testen Sie es also in Ihrer eigenen Agent-Schleife, bevor Sie ihm headless vertrauen.

Cyber-Safeguards und fünf Breaking Changes

Sonnet 5.5 ist das erste Sonnet, das mit Cyber-Safeguards wie bei Opus 5.5 startet, sodass "higher-risk cybersecurity tasks will visibly fall back to Sonnet 5." Routinemäßige Bugfixes sind nicht betroffen. Trotzdem stammte der größte Unter-Thread auf Hacker News von Leuten, die autorisierte Sicherheitsarbeit machen und trotzdem markiert wurden.

Der Migrationsleitfaden nennt fünf Breaking Changes, die jeweils einen 400-Fehler zurückgeben:

ÄnderungWas brichtLösung
thinking: disabledAnfragen mit komplett abgeschaltetem ThinkingDie neue Einstellung between_tools verwenden
Erzwungenes tool_choice (any oder tool)Bots, die ein Klassifizierungs-Tool erzwingenDas Modell wählen lassen, dann validieren
Bearbeiteter Verlauf vor einem Thinking-BlockApps, die vergangene Turns umschreibenDen Verlauf nur anhängend führen
computer_20251124Altes Computer-Use-Tool in der API und Google Cloudcomputer_toolset_20260801 verwenden
Einige Advisor-Tool-PaarungenEin Sonnet-5- oder Opus-4.8-Advisor bei einem Sonnet-5.5-ExecutorMit Opus 5.5 oder Sonnet 5.5 paaren

Für Support-Teams ist das erzwungene tool_choice die Falle. Viele KI-Helpdesk-Integrationen erzwingen bei jeder Anfrage ein Tool "Ticket klassifizieren" für das Ticket-Triage. Tauschen Sie die Modell-ID, ohne das zu beheben, läuft jedes Ticket in einen Fehler. Es gibt auch eine leisere Änderung: Text zwischen Tool-Aufrufen kommt jetzt innerhalb von Thinking-Blöcken an, sodass ein Chat-Widget, das "Ich prüfe Ihre Bestellung..." streamt, verstummen kann. Warum diese Stille für Kunden wichtig ist, behandelt mein Leitfaden zu Übergaben bei KI-Agenten.

Was Entwickler sagen

Die Aufnahme am Launch-Tag war gemischt, aber auf nützliche Weise. Niemand bestreitet die Benchmarks; gestritten wird eher darüber, wo Sonnet 5.5 neben Opus einzuordnen ist.

Hacker News

"It appears, at least from a quick look, to be noticeably faster than Opus. If true, and you don't need xhigh/max reasoning for your use case (like a well-defined set of code changes), Sonnet might get the job done much more quickly."

Die Skeptiker konzentrieren sich auf den Preis, besonders darauf, dass Cache-Reads mit 0,20 $ genauso viel kosten wie bei Opus 5.5:

Hacker News

"I feel like sonnet is priced too close to opus right now. If Sonnet 5.5 were half its current price it would make sense to use."

Der Anwendungsfall, auf den die Leute immer wieder zurückkommen, ist Sonnet als schneller Umsetzer unter einem Opus-Planer:

Reddit

"Firmly places itself as a solid subagent for opus, great work from anthropic, for once I'm interested in what haiku turns out as."

Ein anderer Kommentator beschrieb seine eigene Aufteilung als "80% Sonnet 5.5, Opus 5.5 to finish the last 20%." Das Muster passt recht gut zu Claude-Code-Subagents, und es ist das Setup, das ich selbst übernehmen würde.

Handgezeichneter Ablauf aus drei Karten: Opus 5.5 plant die Arbeit, dann erledigt eine hervorgehobene Sonnet-5.5-Karte bei Low oder Medium etwa 80 % des Builds in drei parallelen Teilaufgaben, dann poliert Opus 5.5 die letzten 20 %
Handgezeichneter Ablauf aus drei Karten: Opus 5.5 plant die Arbeit, dann erledigt eine hervorgehobene Sonnet-5.5-Karte bei Low oder Medium etwa 80 % des Builds in drei parallelen Teilaufgaben, dann poliert Opus 5.5 die letzten 20 %

Claude Sonnet 5.5 Preise in einer Tabelle

Die Preise pro Million Tokens stammen aus Anthropics Preisdokumentation:

Preis pro 1M TokensSonnet 5.5Sonnet 5Opus 5.5Haiku 4.5
Input$2$2$4$1
Output$10$10$20$5
5-Minuten-Cache-Write$2.50$2.50$5$1.25
Cache-Read$0.20$0.20$0.20$0.10
Batch Input / Output$1 / $5$1 / $5$2 / $10$0.50 / $2.50
Kontextfenster1M1M1M200K

Thinking-Tokens werden als Output abgerechnet, und deshalb ist die Effort-Einstellung so wichtig. Eine Support-Antwort bei Medium denkt vielleicht einige hundert Tokens lang, dieselbe Antwort bei Max kann zehntausende denken, alle zu 10 $ pro Million. Die Modellzeile ist selten der größte Posten bei den Kosten eines KI-Support-Agenten, aber der Effort-Regler ist der schnellste Weg, sie dazu zu machen.

Der Zugang für Privatnutzer ist der einfachere Teil. Laut Anthropic kann jeder auf Claude.ai mit Sonnet 5.5 chatten, und die Bezahlpläne stehen in meinem Claude-Pro-Preisguide. Ab dem ersten Tag ist es auch auf Amazon Bedrock und Google Cloud sowie Microsoft Foundry verfügbar. Wenn Sie Anbieter abwägen, beginnen Sie mit dem Dreier-Vergleich der APIs. Für den direkten Vergleich mit OpenAI lesen Sie die Gegenüberstellung GPT-6 Sol vs. Opus 5.5.

Wer wechseln sollte und wer warten sollte

So würde ich entscheiden, je nachdem, was Sie heute betreiben:

Sie betreiben...Meine EmpfehlungEffort-Einstellung
Sonnet 5 in ProduktionDiese Woche wechseln, nach den MigrationsfixesMedium
Opus 5.5 für alltägliches CodingRoutineaufgaben auf Sonnet-5.5-Sub-Agents verlagernLow oder Medium
Opus 5.5 für offene PlanungBei Opus bleibenn/a
Einen Support-Bot mit erzwungenen Tool-AufrufenWarten, bis tool_choice behoben istMedium
Security- oder Pentest-WorkflowsWarten und sich für das Cyber Verification Program bewerbenn/a
Tagging und Routing in hohem VolumenBei Haiku 4.5 bleiben, bis Haiku 5.5 erscheintn/a

Laut Anthropic stößt Claude Haiku 5.5 "in the coming weeks" zur Familie, wenn also die Kosten pro Ticket Ihre Hauptsorge sind, lohnt sich das Warten. Für einen breiteren Blick auf Optionen deckt meine Übersicht zu Alternativen für den Kundenservice mit Claude supportspezifische Optionen ab. Für allgemeine Modellwechsel siehe die Liste der Sonnet-Alternativen.

Ein klügeres Modell behebt keine falsche Wissensbasis

Eines kann ein Modelltest nicht zeigen: Die meisten Ausfälle von Support-Bots, die ich gesehen habe, haben nichts mit dem Modell zu tun. Ein B2B-Telematik-Team für Fahrzeuge mit etwa 200 Zendesk-Tickets im Monat stellte fest, dass sein Bot Kunden erzählte, er unterstütze Automarken, die nicht in der Datenbank waren. Das Modell halluzinierte allerdings nicht. Die Wissensbasis sagte, man unterstütze "alle Modelle", und der Bot glaubte das einfach. Der Sprung von Sonnet 5 auf Sonnet 5.5 hätte dieselbe falsche Antwort geliefert, nur 30 % schneller.

Deshalb beurteile ich ein Modell für den Support nie allein anhand von Benchmarks. Bei eesel wird jeder Rollout gegen historische Tickets simuliert, bevor der Kollege je mit einem Kunden spricht, denn dort fängt man die Wissensprobleme ab, die ein besseres Modell nicht beheben kann.

eesel mit Claude-Klasse-Modellen in Ihrer Queue testen

Wenn Sie das Tempo von Sonnet 5.5 bei Ihren Tickets wollen, ohne die Migration selbst zu tragen, ist eesel die Abkürzung. Der KI-Helpdesk-Kollege stößt zu dem Helpdesk, den Sie schon haben, etwa Zendesk, lernt aus Ihren bisherigen Tickets und dem Help Center und entwirft oder sendet dann Antworten mit einem Frontier-Modell darunter. Das gesamte Effort-Tuning und alle Breaking Changes aus diesem Test werden zu eesels Aufgabe statt zu Ihrer.

Die Aktivitätsansicht des eesel-KI-Helpdesk-Kollegen in Zendesk, die aktuelle Web-Konversationen mit ihrem Status offen und gelöst sowie verknüpften Ticketnummern auflistet
Die Aktivitätsansicht des eesel-KI-Helpdesk-Kollegen in Zendesk, die aktuelle Web-Konversationen mit ihrem Status offen und gelöst sowie verknüpften Ticketnummern auflistet

Wenn Sie gern im Terminal arbeiten: Die eesel CLI bedient denselben Kollegen und dasselbe Workspace wie das Dashboard. Sie können sie skripten oder einen Coding-Agent wie Claude Code steuern lassen, was im Grunde dasselbe Muster "Opus plant, Sonnet baut" von oben ist, nur auf Ihr Support-Setup angewendet. Mein Beitrag zur KI-Agent-CLI geht tiefer, und der zu MCP-Servern behandelt die Connector-Seite.

Der kostenlose Plan enthält 100 Credits und braucht keine Karte, und bezahlte Pläne beginnen bei 299 $ für 500 Credits. Testen Sie eesel an einem Ausschnitt Ihrer echten Tickets und sehen Sie, ob sich das schnellere Modell tatsächlich in schnelleren Antworten zeigt.

Lohnt sich Claude Sonnet 5.5?

Ja, mit einer Regel. Bei Low oder Medium liefert Claude Sonnet 5.5 Coding und Wissensarbeit nahe an Opus zum halben Token-Preis, und es ist 30 %+ schneller bei deutlich weniger Tokens. Damit ist es der neue Standard für klar abgegrenzte Arbeit und Sub-Agents, und auch für alltägliche Support-Antworten.

Bei Max kostet es mehr als Opus und scheitert manchmal trotzdem, nutzen Sie es dort also nicht. Behalten Sie Opus 5.5 für die schweren, offenen Entscheidungen und beheben Sie Ihre erzwungenen Tool-Aufrufe vor der Migration. Danach soll der Effort-Regler Ihre Rechnung bestimmen, nicht der Modellname.

Häufig gestellte Fragen

Ist Claude Sonnet 5.5 gut?
Ja, auf der richtigen Effort-Stufe. In meinem Claude-Sonnet-5.5-Test lag es bei den meisten Launch-Benchmarks nur wenige Punkte hinter Opus 5.5 und schlug es bei Terminal-Bench 4.0 (70,6 % vs. 66,4 %). Der Haken ist Max, wo es pro Aufgabe mehr kosten kann als Opus. Die Sonnet-5.5-Übersicht behandelt den Launch ausführlich.
Ist Claude Sonnet 5.5 besser als Sonnet 5?
Eindeutig. Terminal-Bench 4.0 springt von 10,3 % auf 70,6 %, GDPval-AA von 1449 auf 1844, und laut Anthropic läuft es bei gleichem Preis von 2 $/10 $ über 30 % schneller. Meinen Sonnet-5-Test finden Sie als Vergleichsbasis.
Lohnt sich Claude Sonnet 5.5 gegenüber Opus 5.5?
Bei Low oder Medium ja, weil es pro Token die Hälfte kostet und laut Anthropic Opus bei niedrigeren Einstellungen am besten ergänzt. Ab High aufwärts nähern sich die Kosten pro Aufgabe an, und Opus 5.5 ist meist der bessere Kauf. Der Opus-5.5-Preisguide enthält die Preisliste.
Was kostet Claude Sonnet 5.5?
Claude Sonnet 5.5 kostet 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, Cache-Reads 0,20 $ und Batch 1 $/5 $. Das entspricht den Preisen von Sonnet 5. Der Anthropic-API-Preisguide zeigt die vollständige Tabelle.
Welche Effort-Stufe sollte ich mit Claude Sonnet 5.5 nutzen?
Starten Sie mit Medium, dem Standard in den Claude-Apps und in Claude Code, und gehen Sie nur höher, wenn eine Aufgabe scheitert. Die API nutzt standardmäßig High. Vermeiden Sie Max für alles Offene, denn es kann das gesamte Thinking-Budget von 128k verbrennen, ohne fertig zu werden. Der Leitfaden zur Modellauswahl zeigt, wie Sie Einstellungen festlegen.
Eignet sich Claude Sonnet 5.5 für den Kundensupport?
Es wirkt wie ein starker Motor für alltägliche Antworten. Zendesk testete es an Hunderten realer Support-Fälle und meldete weniger Fehlentscheidungen und 20 % schneller bearbeitete Tickets. Es braucht trotzdem die Verankerung in Ihrem eigenen Help Center und Ihren bisherigen Tickets, und genau das ergänzt ein KI-Helpdesk-Agent wie eesel.
Was sind die Nachteile von Claude Sonnet 5.5?
Fünf API-Änderungen liefern jetzt Fehler, darunter erzwungene Tool-Auswahl und Thinking auf disabled. Cyber-Aufgaben mit höherem Risiko fallen auf Sonnet 5 zurück, und ein Benchmark-Autor stellte fest, dass es häufiger beim Nutzer nachfragt. Der Leitfaden zur KI-Helpdesk-API erklärt, warum erzwungene Tools für Support-Bots wichtig sind.
Welche Alternativen gibt es zu Claude Sonnet 5.5?
Innerhalb von Anthropics Lineup ist Opus 5.5 der Schritt nach oben und Haiku 4.5 der günstigere Schritt nach unten. Außerhalb ist GPT-6 Sol der Hauptkonkurrent in der Launch-Tabelle. Die Übersicht der Sonnet-Alternativen deckt das weitere Feld ab.

Share this article

Kira

Article by

Kira

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Handgezeichnete Illustration eines Support-Mitarbeiters am Laptop, der schnell einen Stapel Tickets abarbeitet, zu einem Beitrag über Claude Sonnet 5.5
Trending

Claude Sonnet 5.5: gleicher Preis, weniger Tokens und 5 Breaking Changes

Claude Sonnet 5.5 behält den Preis von Sonnet 5 (2 $/10 $), erledigt dieselbe Arbeit aber mit deutlich weniger Tokens. Was sich geändert hat, was kaputtgeht und was das für den Support bedeutet.

Riellvriany IndriawanRiellvriany IndriawanSep 29, 2026
Eine Illustration, die Claude Mythos 5.1 und Fable 5.1 als dasselbe zugrunde liegende Modell hinter unterschiedlichen Sicherheitsschichten vergleicht
Trending

Claude Mythos 5.1 im Test: Lohnt sich Anthropics gesperrtes Frontier-Modell?

Ein Praxistest von Claude Mythos 5.1: was es ist, wie es sich mit Fable 5.1 vergleicht, die tatsächlichen Cache-Read-Preise, wer wirklich Zugriff bekommt und was ich statt dessen einsetzen würde.

Kurnia KharismaKurnia KharismaSep 8, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: Welches solltest du nutzen?

Claude Opus 5 kostet pro Token 1,7x so viel wie Sonnet 5 und schließt manche Aufgaben trotzdem günstiger ab. Hier der direkte Vergleich zu Preis, Benchmarks und echten Kosten pro Aufgabe.

Rama AdiRama AdiJul 27, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Claude Opus 5 im Test: nahezu Spitzenniveau beim Programmieren für die Hälfte des Preises

Ein praxisnaher Claude Opus 5 Test: was die Benchmarks wirklich zeigen, die gestiegene Halluzinationsrate, und ob das Modell in eine echte Support-Warteschlange gehört.

KiraKiraJul 27, 2026
Claude Sonnet 5 Illustration mit dem Anthropic-Zeichen und einem Support-Workflow
Guides

Claude Sonnet 5: Was das für den Kundensupport bedeutet

Claude Sonnet 5 bietet Coding- und Agenten-Qualität nahe an Opus zu Preisen der mittleren Stufe. Hier ist, was das Modell für Support-Teams tatsächlich ändert, und was nicht.

Rama AdiRama AdiJul 1, 2026
Illustration von Token-Preisen und Kostenstapeln für das Claude Mythos 5.1 Modell
Trending

Claude Mythos 5.1 Preise: jede Rate, der Cache-Read-Schnitt, und wer es wirklich nutzen kann

Eine vollständige Aufschlüsselung der Claude Mythos 5.1 Preise: Basisraten, Batch, Cache-Writes und der $0,25-Cache-Read, der die eigentliche Neuigkeit ist, plus warum Mythos genauso viel kostet wie Fable 5.1.

Kurnia KharismaKurnia KharismaSep 8, 2026
Eine Illustration einer Tresortür, die von einer kleinen, freigegebenen Liste von Forschern geöffnet wird – ein Sinnbild für den Zugang zu Claude Mythos 5.1 nur auf Einladung
Trending

Claude Mythos 5.1: was es ist, wer Zugang erhält und was du stattdessen nutzen solltest

Claude Mythos 5.1 ist am 1. September 2026 erschienen, und fast niemand kann es nutzen. Hier ist das echte Datenblatt, die beiden Zugangsprogramme und das Modell, das du eigentlich einsetzen solltest.

KiraKiraSep 2, 2026
Eine Illustration einer Person, die einen von fünf Reasoning-Effort-Reglern auf einer Bedienleiste im Claude-Opus-5-Stil auswählt
Trending

Claude Opus 5: was es ist und wie man es wirklich einsetzt

Claude Opus 5 ist nicht ein Modell, sondern fünf. Ein nüchterner Leitfaden zu den technischen Daten, dem Effort-Regler, der über deine Rechnung entscheidet, und den zwei API-Änderungen, die alten Code brechen.

Kurnia KharismaKurnia KharismaAug 5, 2026
Eine Illustration einer Person, die auf einer Claude-Opus-5-ähnlichen Bedienleiste einen von fünf Reasoning-Effort-Reglern auswählt
Trending

Claude Opus 5: was es ist und wie man es wirklich einsetzt

Claude Opus 5 ist nicht ein Modell, sondern fünf. Ein praktischer Leitfaden zu den technischen Daten, dem Effort-Regler, der über die Rechnung entscheidet, und den zwei API-Änderungen, die alten Code brechen.

Kurnia KharismaKurnia KharismaAug 5, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten