Claude Opus 5.5 im Test: das klügste Modell – und die Rechnung, die dazu passt

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet September 23, 2026

Expertengeprüft
Abstrakte schiefergraue Illustration, die ein erstklassiges Reasoning-KI-Modell darstellt, Hero-Banner für den Test

Was Claude Opus 5.5 eigentlich ist

Anthropic hat Claude Opus 5.5 am 22. September 2026 veröffentlicht, und man versteht es am besten als Effizienz-Update von Opus 5, nicht als komplett neues Modell. Die Schlagzeile ist die Umkehr: Jedes bisherige Opus startete zum Premiumpreis, und dies ist das erste, das günstiger startet als das Modell, das es ersetzt.

Die Vergleichsseite von Artificial Analysis zeigt Claude Opus 5.5 an der Spitze des Intelligence Index mit 58, GDPval-AA 1846 und Terminal-Bench 4.0 bei 60%, entnommen von Artificial Analysis

Der Preis wechselte von Opus 5s $5/$25 auf $4/$20 pro Million Tokens, ein flacher Nachlass von 20%. Das klingt klein, bis man sich erinnert, wofür Opus normalerweise gedacht ist: lange, tokenintensive, autonome Arbeit, bei der die Output-Seite der Rechnung dominiert. Ein 20%-Nachlass auf den $20-Output-Satz ist genau dort, wo die meisten Teams es spüren.

Opus 5 bei 5 Dollar Input und 25 Dollar Output fällt um 20 Prozent auf Opus 5.5 bei 4 Dollar Input und 20 Dollar Output, das erste Opus, das günstiger wird
Opus 5 bei 5 Dollar Input und 25 Dollar Output fällt um 20 Prozent auf Opus 5.5 bei 4 Dollar Input und 20 Dollar Output, das erste Opus, das günstiger wird

Neben dem Preis hat sich unter der Haube noch einiges verändert. Der Standard-Effort sank von high auf medium, Thinking ist immer aktiv, und Anthropic rät nun, für die meisten Aufgaben mit Opus 5.5 zu starten, statt Opus als Premium-Tier für den Notfall zu behandeln. Es hat ein 1M-Token-Kontextfenster, bis zu 128K Output-Tokens (300K bei Batch), native Bildverarbeitung und einen Wissensstand von Juni 2026. Es ist der Standard in Claude Max, das stärkste Modell in Claude Pro, und es treibt Claude Code für agentisches Programmieren an.

Das Effort-Rad ist der ganze Test

Ich baue KI-Agenten bei eesel, also bedeutet jeder Frontier-Launch dieselbe Routine: meine Evals erneut laufen lassen, Kosten pro abgeschlossener Aufgabe anschauen, entscheiden, was sich ändert. Was mich an Opus 5.5 am meisten überrascht hat, war nicht die Qualität, sondern wie stark die Effort-Einstellung alles andere an der Nutzung dominiert.

So funktioniert der Mechanismus: Opus 5.5 bietet eine Effort-Steuerung mit fünf Stufen: low, medium (der neue Standard), high, very high und max. Höherer Effort lässt das Modell nicht einfach vage „härter arbeiten", sondern länger nachdenken und deutlich mehr Tokens ausgeben, bevor es antwortet. Bei maximalem Effort bei einer schweren Aufgabe hat es rund 119k Output-Tokens verbraucht, gegenüber einem viel schlankeren Durchlauf bei niedrigem Effort. Da Output mit $20 pro Million abgerechnet wird, ist das Effort-Rad im Grunde ein Kosten-Rad, das ein Qualitäts-Label trägt.

Das Opus-5.5-Effort-Rad von low bis max, mit medium als Standard, zeigt, wie die Kosten von etwa 0,55 Dollar pro Aufgabe bei niedrigem Effort auf etwa 5,98 Dollar bei max steigen
Das Opus-5.5-Effort-Rad von low bis max, mit medium als Standard, zeigt, wie die Kosten von etwa 0,55 Dollar pro Aufgabe bei niedrigem Effort auf etwa 5,98 Dollar bei max steigen

Deshalb ist der Preis pro Token fast eine Ablenkung. Nach Artificial Analysis' eigener Messung kostet dieselbe schwere Aufgabe bei niedrigem Effort etwa $0,55, bei mittlerem Effort etwa $1,34 und bei maximalem Effort etwa $5,98. Die Intelligenz, für die man bezahlt, steigt mit: Der Low-Effort-Durchlauf erreicht 42 Punkte im Intelligence Index, medium erreicht 51, und erst bei max wird die Schlagzeile von 58 erreicht. Die eigentliche Frage beim Einsatz von Opus 5.5 ist also nicht „kann ich mir das leisten", sondern „welches ist die niedrigste Effort-Stufe, die für diese Aufgabe noch ausreicht". Meist ist das medium.

Das ist auch der größte Stolperstein für alle, die von Opus 5 kommen, wo der Standard-Effort high war. Wer dieselbe Arbeitslast ohne Anpassung der Einstellung auf Opus 5.5 überträgt, kann tatsächlich eine niedrigere Rechnung pro Aufgabe bekommen, weil der Standard nun eine Stufe niedriger liegt. Das ist ein wirklich durchdachter Standardwert, bedeutet aber, dass man die Kosten nicht allein vom Listenpreis ableiten kann.

Die Benchmarks: Es gewinnt fast jede Reihe

Lässt man den Preis für einen Moment außen vor, ist Opus 5.5 bei reiner Leistungsfähigkeit der klare Spitzenreiter. Im Artificial-Analysis-Intelligence-Index liegt es mit 58 Punkten auf Platz eins, vor dem gesamten Frontier-Feld. Und es ist kein Zufallstreffer bei nur einem Benchmark: Es führt bei GDPval-AA (1846), bei AutomationBench und bei den Long-Horizon-Coding-Evals, die für Agenten am wichtigsten sind.

Ein Zeugnis für Claude Opus 5.5 mit Intelligence Index Platz eins bei 58, Terminal-Bench 4.0 bei 60 Prozent, Preis 4 Dollar Input und 20 Dollar Output, 1M-Token-Kontext, und Kosten pro schwerer Aufgabe von 0,55 bis 5,98 Dollar
Ein Zeugnis für Claude Opus 5.5 mit Intelligence Index Platz eins bei 58, Terminal-Bench 4.0 bei 60 Prozent, Preis 4 Dollar Input und 20 Dollar Output, 1M-Token-Kontext, und Kosten pro schwerer Aufgabe von 0,55 bis 5,98 Dollar

Am deutlichsten zieht die Coding-Story davon. Im Terminal-Bench 4.0, ausgeführt über Artificial Analysis' Testumgebung bei maximalem Effort, erreichte Opus 5.5 60% gegenüber 44% bei seinem preislich nächsten Rivalen. Das ist die Art von Vorsprung, die sich in weniger Sackgassen bei einem langen agentischen Coding-Durchlauf zeigt, genau die Arbeitslast, auf die Anthropic es abgestimmt hat. Wer harte, autonome, mehrstufige Engineering-Arbeit macht, hat hier das Modell, das Aufgaben abschließt, an denen andere Modelle ins Stocken geraten.

Ein Vorbehalt sei angemerkt: Der Spitzenwert ist eine Max-Effort-Zahl, und maximaler Effort ist die $5,98-pro-Aufgabe-Einstellung. Die Benchmarks, die Opus 5.5 krönen, messen es an seiner teuersten Einstellung. Das ist fair, jedes Modell wird an seiner Obergrenze gemessen, aber es bedeutet, dass der Leaderboard-Sieg und die alltägliche Erfahrung nicht dasselbe sind, außer man zahlt immer für max.

Was Claude Opus 5.5 wirklich kostet

Hier die vollständige Preistabelle, denn „ab"-Preise verschleiern genau die Teile, die bei tokenintensiver Arbeit zubeißen.

PositionSatz
Input (pro 1M Tokens)$4
Output (pro 1M Tokens)$20
Cache-Read (pro 1M Tokens)$0,20
Aufpreis für lange KontexteKeiner
Kontextfenster1M Tokens
Max. Output128K Tokens (300K bei Batch)
Kosten pro schwerer Aufgabe (AA)$0,55 (low) bis $5,98 (max)

Zwei Zeilen verdienen einen zweiten Blick. Erstens gibt es keinen Aufpreis für lange Kontexte, was Opus 5.5 von Konkurrenten unterscheidet, die ihren Input-Satz ab einer Schwelle verdoppeln; bei Jobs mit riesigem Kontext schließt diese flache Preisgestaltung leise die Lücke pro Token. Zweitens bedeuten Cache-Reads für $0,20 pro Million, dass bei einer Arbeitslast aus einem großen, stabilen System-Prompt plus kurzen Fragen ein großer Teil der Input-Rechnung günstig ist.

Ein kurzes Rechenbeispiel: Angenommen, ihr fahrt 1.000 schwere Agenten-Aufgaben im Monat. Bei mittlerem Effort ($1,34 je Aufgabe) sind das etwa $1.340. Schiebt man dieselben 1.000 Aufgaben für die letzten Punkte Intelligenz auf maximalen Effort, landet man bei rund $5.980. Dieser 4x-Ausschlag ist eine Konfigurationsentscheidung, kein Tarifwechsel, und es sind die Kosten pro Aufgabe, die ich vor jedem hochvolumigen Einsatz von Opus 5.5 an die Tafel schreiben würde. Die vollständige Aufschlüsselung mit Batch und regionalen Sätzen findet ihr in meinem Leitfaden zu Opus 5.5 Preisen, und der umfassendere Vergleich OpenAI API vs. Anthropic API zeigt, wie es sich gegen die andere Frontier-Plattform schlägt.

Wo Opus 5.5 seinen Preis verdient, und wo nicht

Lasst mich konkret werden bei der Frage der Eignung, denn „es ist das beste Modell" stimmt und hilft trotzdem nicht weiter.

Es verdient seinen Preis, wenn die Aufgabe schwierig, lang und teuer ist, wenn sie schiefgeht. Ein mehrstündiger Coding-Agent, der eine echte Codebasis refaktoriert, eine Recherche-Aufgabe, die einen riesigen Kontext halten und über ihn hinweg denken muss, ein mehrdeutiges Problem, bei dem ein günstigeres Modell sich im Kreis dreht. In diesen Fällen kaufen die zusätzlichen Tokens ein fertiges Ergebnis statt einer plausibel aussehenden Sackgasse, und die Rechnung ist günstig im Vergleich zu den Ingenieurstunden, die sie spart.

Es ist das falsche Werkzeug, wenn die Aufgabe klar definiert und hochvolumig ist: Klassifizierung, kurze Antworten, Übersetzung, einfache Nachschlagevorgänge, die alltäglichen 80% der meisten Produktions-Workloads. Opus-Preise und Opus-Latenz für Arbeit zu zahlen, die ein Mittelklasse-Modell locker schafft, ist Geld und Geschwindigkeit, die man nicht zurückbekommt. Opus ist bewusst bedächtig, weshalb bei allem, worauf ein Mensch live wartet, etwa eine Chat-Antwort, die Reaktionsgeschwindigkeit mehr zählt als die letzten Punkte im Intelligence Index. Das ist das Argument für ein Zwei-Modell-Setup: die wirklich schwierigen Aufgaben an Opus 5.5 leiten und alles andere an Sonnet 5, oder zu einer der günstigeren Optionen aus meiner Übersicht der Opus-5.5-Alternativen greifen.

Das ehrliche Fazit in einem Satz: Opus 5.5 ist das beste Modell, und „bestes Modell" ist selten dieselbe Frage wie „richtiges Modell für diese Aufgabe".

Was die Leute wirklich sagen

Die Reaktionen im Launch-Thread deckten sich mit meinen eigenen Tests: echter Respekt vor der Leistungsfähigkeit, und eine wiederkehrende Erinnerung, dass das Label auf dem Effort-Rad wichtiger ist als das Leaderboard. Ein erfahrener Tester, der es mit der Frontier-Konkurrenz verglich, die am nächsten Tag erschien, kam zu diesem Schluss:

Hacker News

My initial takeaway is that GPT-6 is mostly a lower cost win, for Luna. GPT-6 Max is an upgrade on intelligence too, but its mostly a cost play (which is great, not complaining). I personally am preferring Opus 5.5 at medium over GPT-6 Sol Max, in very very early tests. Similar price range, more capability.

Dieses „at medium" leistet eine Menge Arbeit, und genau darum geht es in diesem Test. Das andere Thema, das es wert ist, hervorgehoben zu werden, ist, wie wenig ein einzelner Benchmark 2026 eure Wahl entscheiden sollte:

Hacker News

Only hands-on experience matters in the end, and these days it's very easy to switch models.

Dieser letzte Nebensatz, „very easy to switch models", ist die eigentliche Geschichte des Jahres, und er führt direkt zu der Frage, die die meisten Modell-Tests auslassen.

eesel ausprobieren: das Teammitglied, das mit jedem Modell läuft

Jeder Modell-Test geht stillschweigend davon aus, dass die Aufgabe der Leserin darin besteht, ein Modell auszuwählen, dessen API zu verdrahten, Prompt-Engineering zu betreiben, es mit den eigenen Tools zu verbinden und es davon abzuhalten, bei echten Kunden zu halluzinieren. Für die meisten Teams ist das nicht die Aufgabe. Die Aufgabe ist eine höhere Lösungsrate oder veröffentlichte Beiträge. Ein Frontier-Modell wie Opus 5.5 ist Infrastruktur; es ist der Motor, nicht die Mitarbeiterin.

Das eesel-AI-Berichte-Dashboard zeigt Lösungs- und Nutzungsanalysen über eine Support-Warteschlange hinweg
Das eesel-AI-Berichte-Dashboard zeigt Lösungs- und Nutzungsanalysen über eine Support-Warteschlange hinweg

So würde ich eesel einordnen. Es ist eine KI-Teammitglieder-Plattform, und man stellt einsatzbereite Teammitglieder für konkrete Aufgaben ein. Die aktuelle Besetzung umfasst ein KI-Helpdesk-Teammitglied, das eurer bestehenden Support-Warteschlange beitritt, und eine KI-Blog-Autorin, die recherchierte Beiträge entwirft. Jedes kommt bereits mit Wissen über seine Aufgabe, ist an eure Tools angebunden und im Kontext eures Unternehmens verankert, sodass nicht ihr zwischen Effort-Stufen wählen und einen Prompt betreuen müsst. Da das Modell unter dem Teammitglied liegt, ist ein günstigeres oder klügeres Modell, das nächsten Monat erscheint, ein kostenloses Upgrade statt eines Umbaus, und das KI-Helpdesk-Teammitglied wird pro gelöstem Ticket statt pro Token abgerechnet, sodass die Effort-Rad-Rechnung von oben nicht mehr euer Problem ist.

Wenn ihr zu den Menschen gehört, die einen Modell-Test bis zum Ende lesen, wird euch das hier gefallen: Das Ganze lässt sich vom Terminal aus steuern. Die eesel CLI (npx @eesel/cli) verbindet Integrationen, bearbeitet die Standardanweisungen des Agenten, simuliert einen Rollout gegen eure historischen Tickets, genehmigt Aktionen und liest das Aktivitätsprotokoll jedes Durchlaufs, alles als JSON, mit einem --dry-run-Flag, das den genauen Aufruf ausgibt, den ein Schreibvorgang machen würde, bevor er gesendet wird. Jeder Workspace ist zudem ein MCP-Server, sodass Coding-Agenten wie Claude Code, Codex und Cursor dasselbe Teammitglied bedienen können. Es ist dasselbe Produkt wie das Dashboard, nur offengelegt für Menschen und Agenten, die im Terminal leben. Ihr könnt eesel kostenlos testen.

Häufig gestellte Fragen

Lohnt sich Claude Opus 5.5 im Jahr 2026?
Für wirklich schwierige, lange, agentische Arbeit: ja. Es ist das Top-Modell im Artificial-Analysis-Intelligence-Index mit 58 Punkten. Für Alltagsaufgaben ist es überdimensioniert, und Claude Sonnet 5 zum halben Preis ist die klügere Standardwahl. Mein Beitrag zu Opus-5.5-Alternativen deckt die günstigeren Optionen ab.
Wie viel kostet Claude Opus 5.5?
$4 pro Million Input-Tokens und $20 pro Million Output-Tokens, ein Nachlass von 20% gegenüber Opus 5s $5/$25. Cache-Reads kosten $0,20 pro Million, und es gibt keinen Aufpreis für lange Kontexte. Die vollständige Aufschlüsselung, inklusive Batch und Rechenbeispielen, steht in meinem Leitfaden zu Claude Opus 5.5 Preisen.
Was ist das Effort-Rad bei Claude Opus 5.5?
Es ist eine Einstellung (low, medium, high, very high, max), die steuert, wie lange das Modell nachdenkt, bevor es antwortet. Höherer Effort bedeutet mehr Output-Tokens und eine höhere Rechnung, sodass dieselbe Aufgabe je nach Stufe $0,55 oder $5,98 kosten kann. Der Standardwert sank von high bei Opus 5 auf medium bei Opus 5.5.
Ist Claude Opus 5.5 gut zum Programmieren?
Es ist eines der stärksten verfügbaren Coding-Modelle, mit 60% im Terminal-Bench 4.0 in Artificial-Analysis-Tests, gebaut für lange, autonome Durchläufe in Claude Code. Wer es vom Terminal aus steuert, findet in unserer Übersicht der besten KI-Coding-Assistenten, wo es sich einordnet.
Brauche ich Claude Opus 5.5, um einen KI-Support-Agenten zu bauen?
Nein. Ein Tool wie eesel sitzt über der Modell-Ebene und übernimmt Modellwahl, Prompting und Integrationen für dich, sodass du ein KI-Teammitglied für dein Helpdesk bekommst, ohne eine rohe Modell-API zu verdrahten. Du kannst später jederzeit auf ein günstigeres Modell wechseln, ohne neu zu bauen, und es wird pro gelöstem Ticket statt pro Token abgerechnet.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Eine Illustration, die Claude Mythos 5.1 und Fable 5.1 als dasselbe zugrunde liegende Modell hinter unterschiedlichen Sicherheitsschichten vergleicht
Trending

Claude Mythos 5.1 im Test: Lohnt sich Anthropics gesperrtes Frontier-Modell?

Ein Praxistest von Claude Mythos 5.1: was es ist, wie es sich mit Fable 5.1 vergleicht, die tatsächlichen Cache-Read-Preise, wer wirklich Zugriff bekommt und was ich statt dessen einsetzen würde.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Eine Illustration einer Tresortür, die von einer kleinen, freigegebenen Liste von Forschern geöffnet wird – ein Sinnbild für den Zugang zu Claude Mythos 5.1 nur auf Einladung
Trending

Claude Mythos 5.1: was es ist, wer Zugang erhält und was du stattdessen nutzen solltest

Claude Mythos 5.1 ist am 1. September 2026 erschienen, und fast niemand kann es nutzen. Hier ist das echte Datenblatt, die beiden Zugangsprogramme und das Modell, das du eigentlich einsetzen solltest.

Alicia Kirana UtomoAlicia Kirana UtomoSep 2, 2026
Ideogram: Ein vollständiger Überblick über den KI-Bildgenerator
Guides

Ideogram im Test (2026): Best-in-Class AI Text-zu-Bild

Sie denken darüber nach, Ideogram für die KI-Bilderzeugung zu verwenden? Unser ausführlicher Testbericht behandelt alles, was Sie über seine Funktionen, Typografie, Preise und Nachteile wissen müssen.

Stevia PutriStevia PutriOct 3, 2025
Ihr Leitfaden zur vollständigen Liste der OpenAI-Modelle
Guides

Jedes OpenAI Modell in 2026: GPT-5, o3, Sora und mehr

Die Navigation durch die ständig wachsende Liste der OpenAI-Modelle kann überwältigend wirken. Von GPT-5 nano bis Sora – welches Modell ist das richtige für Ihr Unternehmen? Dieser umfassende Leitfaden vereinfacht die Auswahl, vergleicht Funktionen und erklärt die komplexen Preisstrukturen, damit Sie eine fundierte Entscheidung treffen können. Wir werden Reasoning-Modelle, Allzweck-LLMs und spezialisierte Tools aufschlüsseln, um Ihnen zu helfen, die beste Lösung für Ihre spezifischen Anforderungen zu finden, ohne sich im technischen Fachjargon zu verlieren.

Stevia PutriStevia PutriOct 12, 2025
Ein ehrlicher Blick auf Claude AI: 2025 Claude Bewertungen und eine bessere Alternative
Guides

Claude AI im Test (2026): Nach 30 Tagen Praxistest

Denken Sie darüber nach, Claude AI für Ihr Unternehmen zu nutzen? Unser detaillierter Testbericht für 2025 deckt alles ab, von seinen Konversationsfähigkeiten bis hin zu den kritischen Nutzungslimits, die Benutzer frustrieren. Wir untersuchen die Vor- und Nachteile und warum ein spezialisierter KI-Agent besser für Ihr Support-Team geeignet sein könnte.

Kenneth PanganKenneth PanganOct 8, 2025
Ausführliche Retell AI Bewertungen (2025): Preise, Funktionen & Alternativen
Guides

Retell AI Test (2026): Sprachqualität, Preise & mehr

Ziehen Sie Retell AI in Betracht? Unsere detaillierte Überprüfung deckt alles ab, von Nutzerfeedback und Latenz-Benchmarks bis hin zu seiner komplexen Preisgestaltung. Sehen Sie die Vor- und Nachteile und warum moderne Support-Teams eine ganzheitlichere, selbstbedienbare Automatisierungsplattform bevorzugen könnten.

Stevia PutriStevia PutriOct 8, 2025
Ein praktischer Leitfaden zu Ausgabestilen in Claude Code
Guides

Claude Code Output Styles: So passt du Antworten an (2026)

Anthropic's Claude Code hat kürzlich Ausgabestile eingeführt, eine leistungsstarke Funktion zur Anpassung der KI-Interaktion. Erfahren Sie, was sie sind, wie man sie verwendet und warum eine dedizierte Plattform oft die bessere Wahl für Kundensupport- und Geschäftsworkflows ist.

Stevia PutriStevia PutriOct 3, 2025
Was ist das OpenAI-Affiliate-Programm?
Guides

Was ist das OpenAI-Affiliate-Programm?

OpenAI hat kein Affiliate-Programm und wird wahrscheinlich auch nie eines haben. Aber die Sache ist die: Der Einsatz von KI in deinem Unternehmen bringt viel mehr Geld ein, als Provisionen jemals einbringen könnten.

Kenneth PanganKenneth PanganSep 8, 2025
Pabbly Connect Bewertung (2025): Preise, Funktionen & was fehlt
Guides

Pabbly Connect im Test (2026): Preise & Schwachstellen

Pabbly Connect ist kostengünstig für einfache Automatisierungen, aber ist das ausreichend? Wir analysieren Funktionen, Preise und wo KI-Tools besser abschneiden.

Kenneth PanganKenneth PanganAug 22, 2025

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten