
Ce qu'est réellement Claude Opus 5
En environ deux mois, Anthropic a lancé quatre versions de la génération Claude 5, et Opus 5 est la quatrième. Il se positionne juste au-dessus d'Opus 4.8, à un prix qui n'a pas bougé. Le discours de lancement affirme qu'il « s'approche de l'intelligence de pointe de Claude Fable 5 à moitié prix ». Fait inhabituel pour un discours de lancement, les chiffres indépendants confirment cela dans l'ensemble.
Voici les spécifications, tirées de l'aperçu des modèles :
| Spécification | Claude Opus 5 |
|---|---|
| ID du modèle API Claude | claude-opus-5 |
| ID AWS Bedrock | anthropic.claude-opus-5 |
| ID Google Cloud | claude-opus-5 |
| Fenêtre de contexte | 1M de tokens, sans en-tête bêta, sans surcoût de contexte long |
| Sortie maximale | 128k en synchrone, 300k sur l'API Batch |
| Prix | 5 $ / 25 $ par MTok |
| Raisonnement adaptatif | Oui, activé par défaut |
| Niveaux d'effort | low, medium, high, xhigh, max |
| Date de coupure des connaissances | Mai 2026 |
| Web fetch | Non pris en charge |
| Priority Tier | Non pris en charge |
Deux lignes du tableau surprennent souvent. D'abord, la fenêtre de contexte de 1M est facturée aux tarifs standards, donc une requête de 900k tokens est facturée par token exactement comme une requête de 9k, ce que précise la documentation tarifaire. Ensuite, aucun Priority Tier du tout. Opus 4.8 en conserve un, donc quiconque est engagé sur une réservation de capacité doit planifier cette partie séparément.
Si votre dernier regard sur cette famille de modèles remonte à quelques versions, le rythme mérite d'être noté. Mon test d'Opus 4.5 n'a que quelques mois, et il se lit déjà comme un outil d'une catégorie différente, avec Opus 4.6 qui se situe quelque part entre les deux.
« Claude Opus 5 » ce sont cinq modèles sous un seul nom
Tout le reste de cet article se recadre autour de ce seul point, donc je veux y consacrer un vrai moment ici.
Le paramètre effort n'est pas une sorte de curseur de qualité qu'on ajuste selon ses goûts. Dans toute l'API, c'est le levier individuel qui pèse le plus sur le coût et la latence, et aussi sur la qualité de sortie, et l'écart entre ses deux extrémités est plus large que ce qui sépare la plupart des modèles concurrents entre eux.

Artificial Analysis a fait passer chaque réglage par AA-Briefcase. Ce benchmark couvre le travail de connaissance à long horizon, construit sur des projets de plusieurs semaines comportant des milliers de fichiers sources. C'est l'écart qui raconte l'histoire ici :
| Réglage d'effort | Elo AA-Briefcase | Coût par tâche | Minutes par tâche | Tours par tâche |
|---|---|---|---|---|
max | 1720 | 17,79 $ | 36,2 | 103 |
xhigh | 1693 | 14,26 $ | 34,3 | 91 |
high | 1606 | 10,41 $ | 25,7 | 76 |
medium | 1470 | non publié | – | – |
low | 1223 | non publié | – | – |
| Claude Fable 5, pour comparaison | 1574 | 22,30 $ | – | – |
Lire la ligne de Fable 5 juste à côté de la ligne high fait apparaître le meilleur point de valeur de tout le jeu de données : en effort élevé, Opus 5 dépasse Fable 5 de 32 Elo, et cela pour 10,41 dollars par tâche, moins de la moitié du prix de Fable. Maintenant, lisez cette même ligne face à low. 1223, en dessous de GLM-5.2. Même ID de modèle, même semaine, et les deux sont vrais.
GDPval-AA v2 montre la même forme, où les niveaux d'effort couvrent 407 points Elo et où la consommation de tokens en sortie va environ jusqu'à 8x en passant de low à max.

Il vaut la peine de remarquer ce que le graphique admet lui-même : à l'extrémité bon marché de l'échelle, GPT-5.6 Sol se situe au-dessus d'Opus 5, pas en dessous. Ce n'est qu'une fois qu'on paie vraiment cher par tâche que la ligne d'Anthropic prend l'avantage. Un simple classement en gros titre cache exactement ce genre de détail.
Encore une bizarrerie, et c'est le chiffre le plus étrange de tout ce lancement. Sur FrontierCode 1.1 de Cognition, le meilleur score d'Opus 5 s'obtient en effort medium. Pas max. Anthropic l'explique sans détour dans la fiche système : à effort plus élevé, le modèle « effectue plus de modifications que ce que la tâche requiert », et les modifications hors périmètre sont pénalisées par le correcteur. Ajouter une brève instruction pour rester dans le périmètre « a permis de retrouver les performances sur la plupart de ces tâches ». Réfléchir davantage n'est donc pas systématiquement meilleur, et sur au moins un benchmark de code réel, c'est même pire.
Choisissez votre niveau d'effort
Plutôt que de vous faire remonter à ce tableau, voici la même décision présentée sous forme de sélecteur. Choisissez le réglage que vous comptiez utiliser, puis regardez ce qu'il vous apporte.
Pourquoi personne ne s'accorde en ligne sur le fait qu'il soit bon marché
Une fois que le curseur d'effort est bien ancré dans la tête, le chaos de la semaine de lancement ne semble plus du tout déroutant.
Sur les mêmes 48 heures, Reddit a connu deux fils de discussion très suivis qui se contredisaient totalement. Un camp a publié que la consommation de tokens est incroyable, et un utilisateur de r/ClaudeCode y a rapporté huit heures de travail pour 5% d'un quota hebdomadaire. L'autre camp a publié à propos de l'épuisement de la limite de 5 heures 10 fois plus vite, décrivant une limite qu'ils atteignaient auparavant en six heures et qui arrive désormais en moins de deux. Puis un fil intitulé, littéralement, alors c'est quoi au juste a rassemblé plus de 150 commentaires de gens qui demandaient d'où venait ce revirement.
Hacker News est arrivé à la réponse plus vite que la couverture des benchmarks :
« Le graphique montre l'effort maximal, utilisé surtout par des utilisateurs d'entreprise peu sensibles au prix. En effort moyen, ça tombe à presque la moitié du coût de K3, et c'est probablement suffisant pour 95% des tâches de codage. »
« Ça réfléchit pas mal trop au-delà de medium, essayez plutôt ce réglage. »
Sous cette première cause s'en cache une seconde, et celle-ci piège les gens qui n'ont jamais touché au paramètre effort. Le raisonnement est activé par défaut sur Opus 5 et ne l'était pas sur Opus 4.8, donc une requête que vous n'avez jamais modifiée dépense désormais des tokens en raisonnement qu'elle sautait auparavant. Quelqu'un l'a repéré dans les notes de migration en quelques heures après le lancement :
« Les changements majeurs par rapport à Opus 4.8 sont intéressants : 1. Raisonnement activé par défaut : sur Claude Opus 4.8, les requêtes sans champ thinking s'exécutent sans raisonnement ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec un raisonnement adaptatif. 2. La désactivation du raisonnement est plafonnée à l'effort high »
Les deux camps disaient donc vrai. Ils parlaient simplement de configurations différentes du même modèle. C'est toute la dispute.
Les deux choses qui cassent lors de la migration
Anthropic présente Opus 5 comme « une mise à niveau directe pour Claude Opus 4.8 au même prix », et le guide de migration liste exactement deux changements cassants.
Le raisonnement est activé par défaut. Sur 4.8, une requête sans champ thinking s'exécutait sans raisonnement ; sur Opus 5, cette même requête s'exécute avec un raisonnement adaptatif. Et comme max_tokens plafonne la sortie totale, raisonnement compris, toute charge de travail qui tournait auparavant de manière légère devrait revoir son plafond avant de commencer à être tronquée.
La désactivation du raisonnement est plafonnée à high. Envoyer thinking: {type: "disabled"} fonctionne toujours, mais le combiner avec xhigh ou max renvoie une erreur 400. Cette vérification s'effectue par requête, ce qui signifie qu'augmenter l'effort en pleine conversation alors que le raisonnement est désactivé est refusé, même si les tours précédents sont passés sans problème. Anthropic prévient aussi que, raisonnement désactivé, le modèle « peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible ».
Le reste de la mise à niveau est purement bénéfique, et quelques éléments méritent d'être activés délibérément :
- Le seuil minimal du cache de prompts est descendu à 512 tokens, contre 1 024 pour Opus 4.8 et 4 096 pour Opus 4.6. Les courts prompts système qui n'étaient jamais mis en cache le sont désormais, sans qu'aucun changement de code soit nécessaire.
- Les changements d'outils en cours de conversation, derrière l'en-tête bêta
mid-conversation-tool-changes-2026-07-01, permettent d'ajouter ou de retirer des outils entre deux tours, et les hits de cache des tours précédents y survivent. - Un paramètre
fallbacksrenvoie les refus du classificateur cyber vers Opus 4.8 plutôt que de retourner une erreur, de sorte que les requêtes « sont toujours acheminées par défaut vers le meilleur modèle disponible plutôt que d'être bloquées ». Le hic, c'est la disponibilité : pas sur l'API Batch, pas sur Bedrock, et pas sur Google Cloud ni Microsoft Foundry. - Opus 5 dispose de son propre quota de limitation de débit. La page des limites de débit précise clairement qu'il ne fait pas partie du pool combiné Opus 4.x, et fixe ce quota à 1 000 RPM avec 2 000 000 de tokens en entrée par minute.
Deux nuances de prompt sont faciles à manquer ici. Anthropic recommande de retirer toute instruction de vérification héritée, car « Claude Opus 5 vérifie son propre travail sans qu'on le lui demande », et recommande aussi de limiter la génération de sous-agents, le modèle déléguant plus facilement que ses prédécesseurs. Claude Code a pris ce deuxième point suffisamment au sérieux pour intégrer une instruction codée en dur disant à Opus 5 de ne pas utiliser de sous-agents. La réaction sur HN s'est, sans surprise, divisée.
Là où il mène, et là où il ne mène pas
Le gros titre est bien réel. Sur son Intelligence Index, Artificial Analysis place Opus 5 en effort maximal à 61, rang #1 face à une médiane de catégorie de 32. Avant de s'enthousiasmer, il faut lire les suivants : Fable 5 à 60, GPT-5.6 Sol à 59, Kimi K3 à 57, puis Opus 4.8 à 56. Le mot propre d'Artificial Analysis pour Opus 5 est « de justesse le modèle le plus intelligent », et toute la frontière tient dans une bande de cinq points.
Là où se trouvent les victoires larges et sans ambiguïté, c'est en un seul endroit, le travail agentique. AutomationBench de Zapier place un agent dans une entreprise simulée disposant de dizaines de points de terminaison REST répartis sur 47 applications, et là, Opus 5 obtient 26,0% contre 17,0 pour Opus 4.8, 17,4 pour Fable 5 et 18,1 pour GPT-5.6 Sol.

L'autre véritable exception est ARC-AGI-3, avec 30,16% de Relative Human Action Efficiency contre 7,78% pour GPT-5.6 Sol. Et il vaut la peine de le signaler pour l'argument de cet article : ce score provient de l'effort high, pas max.

Passons maintenant à l'autre colonne, honnête. Artificial Analysis a mesuré 53% sur Humanity's Last Exam, « en ligne avec Fable 5 », donc un match nul et non une victoire. Sur CritPt, la physique de pointe, il fait jeu égal avec Fable 5, se situant derrière trois modèles d'OpenAI. Terminal-Bench v2.1 lui donne 89%, ce qui est « à peu près en ligne » avec le leader. Anthropic lui-même dit qu'Opus 5 reste derrière Mythos 5 en recherche biologique, et aussi en cybersécurité offensive.
Vient ensuite le classement qui a enfin des données. Au lancement, LMArena n'avait aucune entrée pour Opus 5, personne ne pouvait donc dire ce qu'en pensaient les humains. Début août, il y figure. La réponse n'est pas celle que prédirait l'Intelligence Index.

Sur le classement texte de LMArena, claude-opus-5-high se situe au rang 7 avec 1492 Elo, et claude-opus-5-max au rang 8 avec 1490. Au-dessus des deux : Fable 5 à 1509, plus trois modèles Claude plus anciens. Les benchmarks qui mesurent l'accomplissement des tâches, et les humains qui votent pour la réponse qu'ils préfèrent, mesurent deux choses différentes, et Opus 5 illustre clairement cet écart. La communauté l'a dit plus simplement encore :
« J'ai comparé le style d'écriture d'Opus 5 à celui de Fable 5, et Opus 5 continue de porter beaucoup des 'tics de Claude' de son prédécesseur 4.8, d'une façon dont Fable s'était détaché. »
Comment y accéder concrètement
Six voies pour y arriver, et elles n'offrent pas toutes la même chose.
| Voie | Ce que vous obtenez | Remarques |
|---|---|---|
| Claude Free, 0 $ | Aucun Opus | Sonnet et Haiku seulement, contexte de 200k |
| Claude Pro, 20 $/mois | Opus 5 comme modèle le plus puissant disponible | 17 $/mois en facturation annuelle. Fable via des crédits d'usage |
| Claude Max 5x, 100 $/mois | Opus 5 comme modèle par défaut | Fable plafonné à 50% des limites hebdomadaires |
| Claude Max 20x, 200 $/mois | Idem, 20 fois l'usage de Pro par session | Limites basées sur la session, pas sur le nombre de messages |
| Claude Team, 25 $/siège/mois | Les quatre familles de modèles | 20 $/siège en facturation annuelle, équipes de 2 à 150 |
| API Claude | claude-opus-5 à 5 $ / 25 $ | Batch le divise par deux, les hits de cache coûtent 0,50 $ |
Claude Code est inclus dans tous les forfaits payants et puise dans le même pool. Si votre sélecteur affiche encore 4.8, /model claude-opus-5 fonctionne directement, et sur les versions plus anciennes de la CLI, /model claude-opus-5[1m] donne accès à la variante à 1M de contexte. Il vaut aussi la peine de savoir que Claude Code n'exposait au départ qu'une fenêtre de 200K pour cela, exactement le genre de détail pour lequel existent mes notes sur la fenêtre de contexte de Claude Code.
Du côté des plateformes cloud, Bedrock et Google Cloud sont exploités par des partenaires, ils facturent directement, et les points de terminaison régionaux appliquent une prime de 10% par rapport aux points de terminaison globaux. Claude Platform sur AWS facture en Claude Consumption Units à 0,01 $ par CCU, tout comme Microsoft Foundry. En plus des tokens, Managed Agents ajoute 0,08 $ par heure de session de fonctionnement actif.
Le mode rapide est la seule voie qui comporte de vraies conditions. Jusqu'à 2,5 fois plus de tokens en sortie par seconde, à exactement le double du prix, 10 et 50 dollars, appliqué sur toute la fenêtre de contexte. Les conditions : toujours en aperçu de recherche, uniquement sur l'API Claude first-party, verrouillé derrière une liste d'attente ou un chargé de compte, et il ne fonctionne pas avec Batch. Par token, ces tarifs se retrouvent au même niveau que Fable 5 standard, donc ce qu'on y achète, c'est de la latence, pas de la capacité. Mon décryptage des tarifs de Claude Opus 5 détaille l'impact sur une facture mensuelle, tandis que les tarifs de Claude Code couvrent le côté CLI.
Le mur entre Opus 5 et un vrai client
Tout ce qui précède concernait le choix d'un réglage. Cette section porte sur l'endroit où aucun réglage n'aide.

Actuellement, Artificial Analysis mesure Opus 5 à 55,7 tokens de sortie par seconde, ce qui le place au rang #111 sur 184, et le temps jusqu'au premier token est de 63,43 secondes. Baisser l'effort ne récupère que très peu de vitesse. Les trois réglages les plus élevés d'AA-Briefcase demandent en moyenne plus de 25 minutes par tâche. La phrase résumée qu'Artificial Analysis lui a consacrée : Opus 5 est « parmi les modèles de tête en intelligence, mais particulièrement coûteux par rapport à d'autres modèles de prix similaire. Il est aussi remarquablement lent et très verbeux ».
Le second chiffre est celui qui me préoccupe davantage, et il va à l'inverse du discours marketing. Par rapport à Opus 4.8, Opus 5 a gagné 7 points de précision sur AA-Omniscience, et dans le même temps son taux d'hallucination a grimpé de 14 points, à 50%, la raison étant qu'il répond plus souvent lorsqu'il n'est pas sûr. La fiche système d'Anthropic elle-même le dit sans détour : « Le modèle hallucine des affirmations factuelles légèrement plus qu'Opus 4.8, malgré une précision globale supérieure. »
Pour un agent de codage qui relance ses propres tests, ce compromis n'a rien de grave. Placez maintenant le même compromis sur une réponse de support envoyée à un client payant, sous votre propre logo. Une réponse erronée mais assurée d'elle-même y devient le mode de défaillance qui vous coûte le compte, et c'est pourquoi prévenir les hallucinations dans le support finit par être un problème de conception produit plutôt qu'un problème de choix de modèle.
J'ai vu ce schéma se répéter suffisamment de fois pour pouvoir être direct à ce sujet. Le modèle représente à peu près 10% d'un déploiement de support qui fonctionne réellement. Les 90% restants sont une récupération de connaissance toujours à jour, plus un seuil de confiance qui décide de ce que l'IA a même le droit de toucher, une simulation sur les tickets historiques pour connaître le taux de réponse avant qu'aucun client ne le voie, puis une transmission qui ne perd pas le contexte en route. Un client d'eesel, qui exploite un réseau de distributeurs automatiques de cryptomonnaie, a résumé mieux que moi le dilemme entre construire soi-même et acheter :
« Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas y investir notre temps. Nous voulions quelque chose que nous n'aurions pas à maintenir. »
Karel, GENERAL BYTES
Une responsable CX dans une marque de compléments alimentaires en vente directe a ensuite décrit le problème du contrôle en une phrase qui m'est restée en tête pendant des années : l'IA ne répondra jamais à 100% des questions, donc ce dont elle avait besoin, c'était une IA qui ne traite que les tickets pour lesquels elle est confiante, en laissant le reste de côté. Aucun paramètre effort ne fournit cela. C'est une décision de routage, et elle se prend en dehors du modèle.
Essayer eesel
Si vous êtes arrivé ici en train de choisir un modèle pour une file de support, le conseil honnête est celui-ci : Opus 5 est un excellent moteur, et ce moteur n'a jamais été votre goulot d'étranglement. eesel est la partie qui s'enroule autour de ce moteur. Il s'intègre au helpdesk que vous utilisez déjà, s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur un prompt collé, et effectue une simulation sur votre propre historique de tickets, de sorte que le taux de résolution est sous vos yeux avant qu'aucun client ne voie l'agent. La mise en place prend des minutes plutôt qu'un trimestre, et la tarification compte les tickets résolus, pas les tokens, si bien qu'un modèle verbeux ne peut pas gonfler discrètement la facture.

Cette vue de rapports est l'élément qu'aucune clé API brute ne vous donne : quels tickets l'agent a réellement pris en charge, ce qui a déclenché chaque exécution, et les moments où un humain est intervenu. Pour voir à quoi ressemblent vos propres chiffres, vous pouvez essayer eesel gratuitement, ou lire comment se joue la même décision à travers les outils de support de cette année et le coût d'un agent de support IA.
Pour le reste du tableau complet sur Opus 5 : le test complet contient le verdict sur l'opportunité de mettre à niveau, Opus 5 face à Fable 5 couvre le niveau supérieur et Opus 5 face à Sonnet 5 le niveau inférieur, et les tarifs de Sonnet 5 comptent en ce moment même, puisque ses tarifs de lancement à 2 $ et 10 $ expirent le 31 août 2026.
Questions fréquentes
Qu'est-ce que Claude Opus 5 ?
claude-opus-5, il dispose d'une fenêtre de contexte de 1M de tokens avec 128k de sortie maximale, et coûte 5 dollars par million de tokens en entrée et 25 dollars par million en sortie. La documentation d'Anthropic recommande de commencer ici pour le codage agentique et le travail en entreprise, et de passer à Fable 5 seulement quand on a besoin du plafond. Mon test d'Opus 5 contient le verdict complet.Combien coûte Claude Opus 5 ?
Claude Opus 5 est-il meilleur que Claude Fable 5 ?
Quelle est la différence entre les niveaux d'effort de Claude Opus 5 ?
low, medium, high, xhigh, max. Sur AA-Briefcase d'Artificial Analysis, ils couvrent un écart de 497 points Elo, et la consommation de tokens en sortie va environ jusqu'à 8x entre low et max sur GDPval-AA v2. La valeur par défaut de l'API est high. Traitez l'effort comme votre principal levier de coût avant de vous tourner vers des modèles moins chers comme Sonnet 5.Dois-je modifier mon code pour passer d'Opus 4.8 à cette version ?
max_tokens pour cela. Et envoyer thinking: disabled en même temps qu'un effort xhigh ou max renvoie une erreur 400. Tout le reste se substitue directement, au même prix. Si vous passez par la CLI, mes notes sur la sélection de modèle dans Claude Code couvrent le côté sélecteur.Où puis-je utiliser Claude Opus 5 gratuitement ?
Claude Opus 5 peut-il gérer des tickets de support client ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






