
En résumé
Le 24 juillet 2026 était la date de sortie de Claude Opus 5. L'étiquette : $5 par million de tokens en entrée et $25 par million en sortie. Exactement ce que coûtait Opus 4.8, ce qui a pris beaucoup de monde de court. Puis le reste de la fiche technique, rapidement. ID du modèle claude-opus-5. Contexte de 1M de tokens, sortie maximale de 128k, et une date limite de connaissances située en mai 2026. La documentation d'Anthropic recommande maintenant de commencer ici, et de passer à Fable 5 seulement quand le plafond est vraiment ce dont vous avez besoin.
La plupart des articles sautent la partie suivante. « Claude Opus 5 » n'est pas un modèle, ce sont cinq. Le paramètre effort va de low à max, et Artificial Analysis évalue chaque réglage comme une entrée séparée, ce qui est plutôt juste, car c'est bien comme ça qu'il se comporte. 497 points Elo d'écart sur le travail de connaissance à long horizon. Environ 8 fois plus de tokens en sortie du bas du curseur jusqu'au sommet. Donc quand les gens se disputent en ligne pour savoir si Opus 5 est absurdement bon marché ou un four à tokens, ce dont ils discutent vraiment, c'est lequel des cinq quelqu'un a utilisé.
Une limite mérite d'être nommée tôt, et j'y suis confronté presque chaque semaine : ce modèle met 63 secondes à produire son premier token en effort max. Travailleur en arrière-plan. C'est la catégorie à laquelle il appartient. Pointez-le vers une fenêtre de chat en direct et l'attente termine à elle seule la conversation pour vous, et après quelques années à déployer des agents IA sur de vraies files de support chez eesel, la leçon que je réapprends sans cesse, c'est que le modèle n'a jamais été la partie difficile de ce travail.
Ce qu'est vraiment Claude Opus 5
En environ deux mois, Anthropic a sorti quatre versions de la génération Claude 5, et Opus 5 est la quatrième. Il se place juste au-dessus d'Opus 4.8, à un prix qui n'a pas bougé. Le discours de lancement dit qu'il « s'approche de l'intelligence de pointe de Claude Fable 5 à moitié prix ». Chose inhabituelle pour un discours de lancement, les chiffres indépendants le confirment en grande partie.
Voici les spécifications, tirées de l'aperçu des modèles :
| Spécification | Claude Opus 5 |
|---|---|
| ID du modèle sur l'API Claude | claude-opus-5 |
| ID AWS Bedrock | anthropic.claude-opus-5 |
| ID Google Cloud | claude-opus-5 |
| Fenêtre de contexte | 1M de tokens, sans en-tête bêta, sans surcoût de contexte long |
| Sortie maximale | 128k en synchrone, 300k sur l'API Batch |
| Prix | $5 / $25 par MTok |
| Thinking adaptatif | Oui, activé par défaut |
| Niveaux d'effort | low, medium, high, xhigh, max |
| Date limite de connaissances | Mai 2026 |
| Web fetch | Non pris en charge |
| Priority Tier | Non pris en charge |
Deux lignes ici surprennent souvent les gens. Premièrement, la fenêtre de contexte de 1M est facturée aux tarifs standards, donc une requête de 900k tokens facture par token au même tarif qu'une de 9k, comme le précise la documentation des tarifs. Deuxièmement, aucun Priority Tier. Opus 4.8 en conserve un, donc quiconque a un engagement de capacité doit planifier cette partie séparément.
Si votre dernier coup d'œil sur cette famille remonte à quelques versions, le rythme mérite d'être noté. Mon test d'Opus 4.5 n'a que quelques mois et il se lit déjà comme un outil d'un autre niveau, avec Opus 4.6 se situant quelque part entre les deux.
« Claude Opus 5 » est cinq modèles sous un seul nom
Tout le reste de cet article est recadré par cette seule partie, donc je veux vraiment y consacrer du temps ici.
Le paramètre effort n'est pas un curseur de qualité qu'on ajuste selon ses goûts. Dans toute l'API, c'est de loin le plus grand levier sur le coût et la latence, et aussi sur la qualité de la sortie, et l'écart entre ses deux extrémités est plus large que ce qui sépare la plupart des modèles concurrents.

Artificial Analysis a fait passer chaque réglage par AA-Briefcase. Ce benchmark couvre le travail de connaissance à long horizon, construit sur des projets de plusieurs semaines comportant des milliers de fichiers source. L'écart est l'histoire ici :
| Réglage d'effort | AA-Briefcase Elo | Coût par tâche | Minutes par tâche | Tours par tâche |
|---|---|---|---|---|
max | 1720 | $17.79 | 36.2 | 103 |
xhigh | 1693 | $14.26 | 34.3 | 91 |
high | 1606 | $10.41 | 25.7 | 76 |
medium | 1470 | non publié | – | – |
low | 1223 | non publié | – | – |
| Claude Fable 5, pour comparaison | 1574 | $22.30 | – | – |
Comparez la ligne Fable 5 à la ligne high, et ce qui en sort, c'est le meilleur rapport qualité-prix de tout le jeu de données : en effort high, Opus 5 bat Fable 5 de 32 Elo, et il le fait à $10.41 la tâche, moins de la moitié du prix de Fable. Maintenant lisez la même ligne face à low. 1223, ce qui est en dessous de GLM-5.2. Même ID de modèle, même semaine, et les deux sont vrais.
GDPval-AA v2 montre la même forme, où les niveaux d'effort couvrent 407 points Elo et l'utilisation de tokens en sortie est environ 8 fois plus élevée de low à max.

Il faut remarquer ce que le graphique admet : au bas de l'échelle, côté bon marché, GPT-5.6 Sol se situe au-dessus d'Opus 5 et non en dessous. Ce n'est qu'une fois que vous payez de l'argent réel par tâche que la courbe d'Anthropic prend l'avantage. Un simple rang affiché en tête cache exactement ce genre de détail.
Une complication de plus, et c'est le chiffre le plus étrange de tout le lancement. Sur FrontierCode 1.1 de Cognition, le meilleur score d'Opus 5 tombe en effort medium. Pas max. Anthropic explique pourquoi directement dans la system card : à effort plus élevé, le modèle « fait plus de modifications que la tâche ne le demande », et les modifications hors périmètre sont pénalisées par le correcteur. Ajouter une brève instruction de rester dans le périmètre « a restauré la performance sur la plupart de ces tâches ». Plus de thinking n'est donc pas monotonement meilleur, et sur au moins un benchmark de code réel, c'est même pire.
Choisissez votre niveau d'effort
Plutôt que de vous faire remonter à ce tableau, voici la même décision présentée sous forme de sélecteur. Choisissez le réglage que vous comptiez utiliser, puis regardez ce qu'il vous apporte.
Pourquoi personne ne s'accorde en ligne sur le fait qu'il soit bon marché
Une fois que le curseur d'effort est bien en tête, le chaos de la semaine de lancement ne semble plus du tout confus.
En 48 heures, Reddit a vu deux fils populaires qui se contredisaient totalement. Un camp a posté que l'usage de tokens est incroyable, et un utilisateur de r/ClaudeCode y a rapporté huit heures de travail pour 5% d'un quota hebdomadaire. L'autre camp a posté sur le fait de griller la limite de 5 heures 10 fois plus vite, décrivant une limite qu'ils atteignaient auparavant en six heures et qui arrive maintenant en moins de deux. Puis un fil intitulé, littéralement, so which is it a attiré plus de 150 commentaires de gens qui demandaient des explications sur ce revirement.
Hacker News est arrivé à la réponse plus vite que la couverture des benchmarks :
« Le graphique montre l'effort max, utilisé surtout par des utilisateurs entreprise peu sensibles au prix. En effort medium, ça descend à presque la moitié du coût de K3, et c'est probablement suffisant pour 95% des tâches de code. »
« Il réfléchit pas mal trop au-dessus de l'effort medium, essayez celui-là. »
Sous cette première cause se trouve une seconde, et celle-ci attrape les gens qui n'ont jamais touché au paramètre effort. Le thinking est activé par défaut sur Opus 5 et il ne l'était pas sur Opus 4.8, donc une requête que vous n'avez jamais changée dépense maintenant des tokens en raisonnement qu'elle sautait auparavant. Quelqu'un l'a repéré dans les notes de migration quelques heures après le lancement :
« Les breaking changes par rapport à Opus 4.8 sont intéressants : 1. Thinking activé par défaut : sur Claude Opus 4.8, les requêtes sans champ thinking tournent sans thinking ; sur Claude Opus 5, les mêmes requêtes tournent avec thinking adaptatif. 2. Désactiver le thinking est plafonné à l'effort high »
Les deux camps disaient donc la vérité. Juste à propos de configurations différentes du même modèle. C'est toute la dispute.
Les deux choses qui cassent quand vous migrez
Anthropic appelle Opus 5 « une mise à niveau directe de Claude Opus 4.8 au même prix », et le guide de migration liste alors exactement deux breaking changes.
Le thinking est activé par défaut. Sur 4.8, une requête sans champ thinking tournait sans thinking ; sur Opus 5, cette même requête tourne avec thinking adaptatif. Et puisque max_tokens plafonne la sortie totale, raisonnement inclus, toute charge de travail qui tournait auparavant au plus juste doit revoir son plafond avant qu'il ne commence à vous tronquer des résultats.
Désactiver le thinking est plafonné à high. Envoyer thinking: {type: "disabled"} fonctionne toujours, mais combiné avec xhigh ou max, vous obtenez une erreur 400. Cette vérification s'exécute par requête, ce qui signifie qu'augmenter l'effort en cours de conversation avec le thinking désactivé est rejeté même si les tours précédents sont passés sans problème. Anthropic prévient aussi que, thinking désactivé, le modèle « peut occasionnellement émettre des tool calls en texte brut ou inclure des balises XML internes dans sa sortie visible ».
Le reste de la mise à niveau n'apporte que des avantages, et quelques éléments valent la peine d'être activés délibérément :
- Le seuil minimal du cache de prompts est descendu à 512 tokens, contre 1 024 sur Opus 4.8 et 4 096 sur Opus 4.6. Les system prompts courts qui n'étaient jamais mis en cache auparavant le sont désormais, et aucun changement de code n'est nécessaire pour ça.
- Les changements d'outils en cours de conversation, cachés derrière l'en-tête bêta
mid-conversation-tool-changes-2026-07-01, permettent d'ajouter ou de retirer des outils entre les tours, et les cache hits des tours précédents y survivent. - Un paramètre
fallbacksrenvoie les refus du classificateur cyber vers Opus 4.8 plutôt que de retourner une erreur, si bien que les requêtes « sont toujours acheminées par défaut vers le meilleur modèle disponible plutôt que d'être bloquées ». Le hic, c'est la disponibilité : pas sur l'API Batch, pas sur Bedrock, et pas sur Google Cloud ni Microsoft Foundry. - Opus 5 a son propre bucket de limite de débit. La page des limites de débit précise clairement qu'il ne fait pas partie du pool combiné Opus 4.x, et indique le bucket à 1 000 RPM avec 2 000 000 de tokens en entrée par minute.
Deux changements de prompting sont faciles à manquer ici. Anthropic dit qu'il faut retirer toute instruction de vérification héritée, parce que « Claude Opus 5 vérifie son propre travail sans qu'on ait besoin de le lui demander », et dit aussi qu'il faut limiter la génération de sous-agents, le modèle déléguant plus volontiers que ses prédécesseurs. Claude Code a pris ce second point assez au sérieux pour livrer une instruction codée en dur disant à Opus 5 de ne pas utiliser de sous-agents. La réaction sur HN s'est divisée, sans surprise.
Où il mène, et où il ne mène pas
Le titre est bien réel. Sur son Intelligence Index, Artificial Analysis place Opus 5 en effort max à 61, rang #1 face à une médiane de classe de 32. Avant de vous emballer, lisez les suivants : Fable 5 à 60, GPT-5.6 Sol à 59, Kimi K3 à 57, puis Opus 4.8 à 56. Les propres mots d'Artificial Analysis pour Opus 5 sont « de peu, le modèle le plus intelligent », et toute la frontière tient dans une bande de cinq points.
Là où se trouvent les victoires larges et sans ambiguïté, c'est un seul endroit : le travail agentique. L'AutomationBench de Zapier place un agent dans une entreprise simulée disposant de dizaines de points de terminaison REST répartis sur 47 apps, et là Opus 5 obtient 26.0% contre 17.0 pour Opus 4.8, 17.4 pour Fable 5 et 18.1 pour GPT-5.6 Sol.

L'autre vraie exception, c'est ARC-AGI-3, à 30.16% de Relative Human Action Efficiency contre 7.78% pour GPT-5.6 Sol. Et il faut le signaler pour l'argument de cet article : ce score est sorti en effort high, pas max.

Passons maintenant à l'autre colonne, l'honnête. Artificial Analysis a mesuré 53% sur Humanity's Last Exam, « en ligne avec Fable 5 », donc une égalité et non une victoire. Côté physique de pointe de CritPt, il égale Fable 5, en restant derrière trois modèles d'OpenAI. Terminal-Bench v2.1 lui donne 89%, ce qui est « à peu près en ligne » avec le leader. Anthropic dit lui-même qu'Opus 5 reste derrière Mythos 5 en recherche biologique, et aussi en cybersécurité offensive.
Puis il y a le leaderboard qui a enfin des données. Au lancement, LMArena ne comportait aucune entrée pour Opus 5, donc personne ne pouvait dire ce que les humains en pensaient. Début août, il y figure. La réponse n'est pas celle que prédirait l'Intelligence Index.

Sur le leaderboard texte de LMArena, claude-opus-5-high se situe au rang 7 avec 1492 Elo, et claude-opus-5-max au rang 8 avec 1490. Au-dessus des deux : Fable 5 avec 1509, plus trois modèles Claude plus anciens. Les benchmarks qui mesurent l'achèvement des tâches, et les humains qui votent pour la réponse qu'ils ont préférée, mesurent deux choses différentes, et Opus 5 démontre cet écart nettement. La communauté l'a formulé plus simplement :
« J'ai comparé le style d'écriture d'Opus 5 et de Fable 5, et Opus 5 continue beaucoup des "Claude-ismes" de son prédécesseur 4.8, d'une manière dont Fable s'est détaché. »
Comment vraiment l'obtenir
Six chemins pour y arriver, et ils ne vous donnent pas tous la même chose.
| Voie | Ce que vous obtenez | Remarques |
|---|---|---|
| Claude Free, $0 | Aucun Opus | Sonnet et Haiku uniquement, contexte de 200k |
| Claude Pro, $20/mois | Opus 5 comme modèle le plus puissant disponible | $17/mois en facturation annuelle. Fable via des crédits d'usage |
| Claude Max 5x, $100/mois | Opus 5 comme modèle par défaut | Fable plafonné à 50% des limites hebdomadaires |
| Claude Max 20x, $200/mois | Pareil, 20x l'usage de Pro par session | Limites basées sur la session, pas sur le nombre de messages |
| Claude Team, $25/place/mois | Les quatre familles de modèles | $20/place en facturation annuelle, équipes de 2 à 150 |
| Claude API | claude-opus-5 à $5 / $25 | Le Batch réduit ça de moitié, les cache hits coûtent $0.50 |
Claude Code est inclus dans tous les plans payants et puise dans le même pool. Si votre sélecteur affiche encore 4.8, /model claude-opus-5 fonctionne directement, et sur les versions plus anciennes de la CLI, /model claude-opus-5[1m] vous donne la variante à contexte 1M. Bon à savoir aussi : Claude Code n'exposait au début qu'une fenêtre de 200K pour ce modèle, exactement le genre de chose pour laquelle existent mes notes sur la fenêtre de contexte de Claude Code.
Côté plateformes cloud, Bedrock et Google Cloud sont exploités par des partenaires, ils vous facturent directement, et les points de terminaison régionaux comportent une majoration de 10% par rapport aux globaux. Claude Platform sur AWS facture en Claude Consumption Units à $0.01 par CCU, et Microsoft Foundry aussi. En plus des tokens, Managed Agents ajoute $0.08 par heure de session de temps d'exécution actif.
Fast mode est la seule voie avec de vraies conditions. Jusqu'à 2.5x plus de tokens en sortie par seconde, à exactement le double du prix, $10 et $50, appliqué sur toute la fenêtre de contexte. Les conditions : encore une research preview, uniquement sur l'API Claude first-party, verrouillé derrière une liste d'attente ou un account manager, et ça ne fonctionne pas avec Batch. Par token, ces tarifs atterrissent au même endroit que Fable 5 standard, donc ce que vous achetez là, c'est de la latence et non de la capacité. Mon décryptage des tarifs de Claude Opus 5 détaille ce que ça fait à une facture mensuelle, tandis que les tarifs de Claude Code couvrent le côté CLI.
Le mur entre Opus 5 et un client en direct
Tout ce qui précède concernait le choix d'un réglage. Cette section porte sur l'endroit où aucun réglage n'aide.

En ce moment, Artificial Analysis mesure Opus 5 à 55.7 tokens en sortie par seconde, ce qui est le rang #111 sur 184, et le délai avant le premier token se situe à 63.43 secondes. Baisser l'effort ne récupère que très peu de vitesse. Les trois meilleurs réglages sur AA-Briefcase font en moyenne plus de 25 minutes par tâche. La phrase qu'Artificial Analysis a écrite à son sujet : Opus 5 est « parmi les modèles les plus intelligents, mais particulièrement coûteux par rapport à d'autres modèles de prix similaire. Il est aussi notablement lent et très verbeux ».
Le second chiffre est celui qui m'importe le plus, et il va à l'opposé du marketing. Par rapport à Opus 4.8, Opus 5 a gagné 7 points de précision sur AA-Omniscience, et en même temps son taux d'hallucination a augmenté de 14 points, à 50%, parce qu'il répond plus souvent quand il n'est pas sûr. La system card d'Anthropic le dit sans détour : « Le modèle hallucine des affirmations factuelles légèrement plus qu'Opus 4.8, malgré une précision globale supérieure ».
Pour un agent de code qui relance ses propres tests, ce compromis va très bien. Maintenant appliquez le même compromis à une réponse de support envoyée à un client payant, avec votre logo dessus. Une réponse fausse dite avec assurance est là le mode d'échec qui vous coûte le compte, et c'est pourquoi prévenir les hallucinations dans le support devient finalement un problème de conception produit plutôt qu'un problème de choix de modèle.
J'ai vu ça se dérouler assez souvent maintenant pour être direct à ce sujet. Environ 10% d'un déploiement de support qui fonctionne, c'est le modèle. Les 90% restants, c'est de la recherche documentaire qui reste à jour, plus un seuil de confiance qui décide de ce que l'IA a même le droit de toucher, une simulation sur des tickets historiques pour que le taux de réponse soit connu avant qu'un client ne le voie, puis un transfert qui ne perd pas le contexte en route. Un client eesel, qui exploite un réseau de distributeurs automatiques de crypto-monnaies, a formulé le côté construire-ou-acheter mieux que je ne pourrais le faire :
« Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas y investir notre temps. Nous voulions quelque chose que nous n'aurions pas à maintenir. »
Karel, GENERAL BYTES
Une responsable CX chez une marque de compléments alimentaires en vente directe a ensuite décrit le problème de contrôle en une phrase qui m'est restée en tête pendant des années : l'IA ne répondra jamais à 100% des questions, donc ce dont elle avait besoin, c'était une IA qui ne traite que les tickets dont elle est sûre et laisse le reste tranquille. Aucun paramètre effort ne vous donne ça. C'est une décision de routage, et elle se prend en dehors du modèle.
Essayez eesel
Si vous êtes arrivé ici parce qu'on choisit un modèle pour une file de support, le conseil honnête est celui-ci : Opus 5 est un bon moteur, et le moteur n'a jamais été votre goulot d'étranglement. eesel est la partie qui s'enroule autour. Il se connecte au helpdesk que vous utilisez déjà, il s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur un prompt collé, et il simule sur votre propre historique de tickets, si bien que le taux de résolution est devant vous avant même qu'un client ne voie l'agent. La configuration prend des minutes plutôt qu'un trimestre, et la tarification compte les tickets résolus et non les tokens, si bien qu'un modèle verbeux ne peut pas gonfler discrètement la facture.

Cette vue de rapports est la pièce qu'aucune clé API brute ne vous donne : quels tickets l'agent a réellement pris en charge, ce qui a déclenché chaque exécution, et les points où un humain est intervenu. Pour voir à quoi ressemblent vos propres chiffres, vous pouvez essayer eesel gratuitement, ou lire comment la même décision se joue à travers les outils de support de cette année et ce que coûte un agent de support IA.
Pour le reste du tableau d'Opus 5 : le test complet donne le verdict sur l'intérêt même de faire la mise à niveau, Opus 5 contre Fable 5 couvre le niveau supérieur et Opus 5 contre Sonnet 5 le niveau inférieur, et les tarifs de Sonnet 5 comptent en ce moment même, puisque ses tarifs de lancement à $2 et $10 expirent le 31 août 2026.
Questions fréquentes
Qu'est-ce que Claude Opus 5 ?
claude-opus-5, il dispose d'une fenêtre de contexte de 1M de tokens avec une sortie maximale de 128k, et il coûte $5 par million de tokens en entrée et $25 par million en sortie. La documentation d'Anthropic recommande de commencer ici pour le coding agentique et le travail en entreprise, et de passer à Fable 5 seulement quand vous avez besoin du plafond. Mon test d'Opus 5 donne le verdict complet.Combien coûte Claude Opus 5 ?
Claude Opus 5 est-il meilleur que Claude Fable 5 ?
Quelle est la différence entre les niveaux d'effort de Claude Opus 5 ?
low, medium, high, xhigh, max. Sur l'AA-Briefcase d'Artificial Analysis, ils couvrent 497 points Elo, et l'utilisation de tokens en sortie est environ 8 fois plus élevée de low à max sur GDPval-AA v2. La valeur par défaut de l'API est high. Traitez l'effort comme votre principal levier de coût avant de regarder des modèles moins chers comme Sonnet 5.Dois-je changer mon code pour passer d'Opus 4.8 à Opus 5 ?
max_tokens en raisonnement. Et envoyer thinking: disabled avec un effort xhigh ou max renvoie une erreur 400. Tout le reste est un remplacement direct au même prix. Si vous l'utilisez via la CLI, mes notes sur la sélection de modèle dans Claude Code couvrent le côté sélecteur.Où puis-je utiliser Claude Opus 5 gratuitement ?
Claude Opus 5 peut-il traiter des tickets de support client ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






