Claude Opus 5 à l'essai : un codage quasi frontière pour moitié moins cher

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 27, 2026

Vérifié par un expert
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot

Ce qu'est vraiment Claude Opus 5

Opus 5 est le nouveau cheval de bataille d'Anthropic. Le modèle phare reste Fable 5. Mais Opus 5 est celui qu'Anthropic conseille d'essayer en premier : la documentation indique de commencer par Claude Opus 5 pour le codage agentique complexe et le travail en entreprise, et de ne monter en gamme que lorsqu'on a réellement besoin du plafond. Sur Claude Max, c'est déjà le nouveau modèle par défaut. Sur Claude Pro, selon Anthropic, c'est le modèle le plus puissant disponible.

Le billet de lancement le formule ainsi : il "s'approche de l'intelligence frontière de Claude Fable 5 pour moitié moins cher". Ça se lit d'abord comme une affirmation de positionnement. Ce qui est inhabituel, c'est que les données indépendantes confirment en grande partie cette affirmation, pour une fois.

Le rythme mérite d'être souligné, surtout si vous n'avez pas suivi cette famille depuis quelques versions. Ma critique d'Opus 4.5 date d'à peine quelques mois, et elle se lit déjà comme un modèle d'un tout autre niveau. Opus 4.6 se situait quelque part entre les deux.

Les caractéristiques, en bref. L'identifiant du modèle est claude-opus-5. Fenêtre de contexte : 1M de tokens, avec 128k de sortie maximale, selon la présentation des modèles. La date limite des connaissances se situe en mai 2026, plus récente que Fable 5 et Sonnet 5. Les requêtes en lot peuvent pousser la sortie jusqu'à 300k tokens avec un en-tête bêta. Il n'y a pas non plus de prime pour contexte long : selon la documentation tarifaire, une requête de 900k tokens est facturée au même tarif par token qu'une requête de 9k.

Where Claude Opus 5 sits against Opus 4.8 and Fable 5 on capability versus cost per task
Where Claude Opus 5 sits against Opus 4.8 and Fable 5 on capability versus cost per task

Depuis trois ans, je construis chez eesel des agents IA qui tournent sur les vraies files de support d'autres entreprises. Alors je lis les lancements de modèles avec une seule question en tête : est-ce que ça change ce que je peux mettre en toute sécurité devant un client ? Cette critique regarde d'abord les avancées en codage. Puis les deux chiffres qui décident si un modèle a sa place près d'une conversation en direct.

Le tableau des benchmarks : de vraies victoires, plus minces que le titre

Commençons par le chiffre mis en avant par Anthropic. Frontier-Bench v0.1 est le successeur de Terminal-Bench, construit par la même équipe, et Opus 5 a atteint 44,4% de récompense moyenne à l'effort xhigh. Opus 4.8 a obtenu 18,7%, selon la fiche système. Fable 5 s'est situé à 33,7%, GPT-5.6 Sol à 37,5%. Pas un bond incrémental, celui-là.

Frontier-Bench v0.1 score plotted against cost per attempt for Opus 5, Fable 5, Opus 4.8 and GPT-5.6 Sol, as taken from Anthropic
Frontier-Bench v0.1 score plotted against cost per attempt for Opus 5, Fable 5, Opus 4.8 and GPT-5.6 Sol, as taken from Anthropic

Ce qui compte ici, c'est la forme du graphique, plus que le pic. La ligne d'Opus 5 se situe au-dessus et à gauche de tout le reste. C'est la position qu'on veut, plus de score pour moins d'argent. Toute la courbe de Fable 5 vit à droite, payant deux à trois fois plus par tentative pour un plafond plus bas.

Le tableau récapitulatif ci-dessous vient directement de la fiche système, reproduit à l'identique.

EvaluationClaude Opus 5Claude Opus 4.8Claude Fable 5GPT-5.6 Sol
SWE-bench Pro79.269.28064.6
SWE-bench Multilingual89.584.486.6
SWE-bench Multimodal59.438.454.1
DeepSWE v1.168.859.069.772.7
FrontierCode 1.1 (Main)53.446.553.547.5
FrontierBench v0.143.321.133.834.4
BrowseComp90.884.387.490.4
Humanity's Last Exam (no tools)56.349.856.5
OSWorld 2.070.655.766.162.6
GDPval-AA v2 (Elo)1861159317471736
AA-Briefcase (Elo)1720134615741505
AutomationBench26.017.017.418.1
ARC-AGI-290.472.192.5
ARC-AGI-330.21.57.8

Lisez les lignes une à une, la moyenne cache trop de choses. Opus 5 perd sur SWE-bench Pro face à Fable 5 et sur DeepSWE face à GPT-5.6 Sol, et il perd aussi sur ARC-AGI-2, de deux points. Mais là où il gagne, il gagne largement : SWE-bench Multimodal bondit de 21 points par rapport à Opus 4.8. ARC-AGI-3 passe de 1,5 à 30,2, ce que la fiche système qualifie d'environ quatre fois le meilleur score précédemment rapporté.

Il y a aussi un véritable score parfait enfoui là-dedans. Tenue les 15 et 16 juillet, l'Olympiade internationale de mathématiques 2026 a vu Opus 5 obtenir un score parfait de 42 sur 42, sans harnais d'agent ni outils. Le seuil de la médaille d'or était de 29, selon la fiche système.

Si vous suivez les comparaisons directes, celle-ci les rebat toutes. Ma comparaison avec Gemini 3 Pro a désormais besoin d'une nouvelle référence, tout comme l'article Codex contre Opus 4.6.

Ce que disent les chiffres indépendants

Artificial Analysis situe Opus 5 à 61 sur son Intelligence Index. Rang un sur 190 modèles, contre une médiane de classe de 32. Le rang un est réel, certes, mais c'est aussi une avance d'un seul point : Fable 5 se situe à 60, GPT-5.6 Sol à 59, selon l'analyse d'AA, avec Opus 4.8 à la traîne à 56. Le terme même utilisé par AA est "de justesse" le modèle le plus intelligent.

Les grandes avances vivent dans quelque chose de plus spécifique que "l'intelligence". Prenez GDPval-AA v2, un ensemble de 220 tâches professionnelles réelles : Opus 5 rafle les deux premières places, à 1861 et 1827 Elo, selon la fiche système, 114 points devant Fable 5. Sur AA-Briefcase, un travail de connaissance à long horizon sur des projets de plusieurs semaines, il rafle carrément les trois premières places. Ce sont les résultats qui justifient réellement le lancement. Il s'agit de tenir la distance sur un travail long et confus, une compétence différente de répondre à une seule question difficile.

Une réserve que presque aucune couverture ne mentionne : Anthropic a exécuté ses propres chiffres Frontier-Bench avec Opus 4.8 comme solution de repli pour les refus du classificateur de sécurité, selon la fiche système, et ce repli a capté 5% des appels API. Artificial Analysis a exécuté son Index exactement de la même manière. Donc une petite portion de chaque score "Opus 5" a en réalité été produite par Opus 4.8.

C'est un modèle d'agent avant d'être un modèle de codage

Ce qui m'a le plus surpris ne figure sur aucun classement de codage. C'est AutomationBench de Zapier, qui place un agent dans une entreprise simulée avec des dizaines de points d'accès REST répartis sur 47 applications, puis évalue s'il termine un vrai flux de travail métier. Opus 5 a obtenu 26,0%, contre 17,0 pour Opus 4.8, 17,4 pour Fable 5, et aussi 18,1 pour GPT-5.6 Sol, selon la fiche système.

AutomationBench pass rate against cost per task, with Opus 5 clearing every other model at lower cost, as taken from Anthropic
AutomationBench pass rate against cost per task, with Opus 5 clearing every other model at lower cost, as taken from Anthropic

Regardez où commence la ligne orange : le réglage le plus économique d'Opus 5 dépasse déjà le meilleur réglage de tous les autres modèles, pour environ $0,75 par tâche. Anthropic rapporte 24% à effort moyen pour $0,89 par tâche, et affirme surpasser à la fois Opus 4.8 et Fable 5 à moins de la moitié du coût. C'est la vraie histoire de cette sortie : pas un chatbot plus intelligent, un agent moins cher.

Le comportement derrière ça transparaît dans les anecdotes. Sur une tâche Frontier-Bench, Opus 5 a reçu le dessin d'une pièce mécanique et devait la reconstruire dans FreeCAD, avec en plus, délibérément, aucun moyen de voir le dessin, selon le billet de lancement. Il a écrit son propre pipeline de vision par ordinateur pour extraire la géométrie des pixels bruts, et aucun modèle concurrent n'a résolu ça en cinq tentatives. JetBrains a présenté ce changement comme du jugement : le modèle repère ses propres erreurs logiques pendant la planification, plutôt qu'après coup.

Les chiffres de l'accès anticipé confirment aussi cette tendance. Box a mesuré une amélioration globale de 8% par rapport à Opus 4.8, montant à 17% sur les flux de travail de due diligence. Lovable l'a vu progresser de 22% par rapport à Opus 4.7 sur ses tâches de codage agentique les plus difficiles, avec bien moins de variance d'une exécution à l'autre. Une société de trading a rapporté avoir atteint le même résultat avec environ un septième des tokens de raisonnement, selon le billet de lancement.

Des écarts d'efficacité de ce genre comptent plus que les scores bruts, une fois qu'un modèle fait du vrai travail sans surveillance. C'est le même changement que j'ai décrit dans mon article sur les CLI de codage agentique, et dans le tour d'horizon des agents IA plus large aussi : la question intéressante n'est plus "peut-il répondre" mais "peut-il finir".

Les deux chiffres qui devraient vous faire hésiter

C'est la section que je voudrais lire en premier, donc je ne vais pas l'enterrer.

Il hallucine plus que le modèle qu'il remplace

Sur AA-Omniscience, un benchmark factuel en livre fermé, Opus 5 a amélioré la précision de 7 points par rapport à Opus 4.8, et son taux d'hallucination a lui aussi grimpé de 14 points, à 50%, selon Artificial Analysis. La propre fiche système d'Anthropic enregistre le même compromis dans ses propres termes : la précision est 11% plus élevée que celle d'Opus 4.8, mais le taux d'hallucination est aussi 6% plus élevé.

Ce n'est pas vraiment une contradiction. Le modèle répond simplement plus souvent quand il n'est pas sûr. Sur une tâche de codage avec des tests, deviner ne coûte pas cher : le test échoue, la boucle continue. Sur la question d'un client à propos d'un remboursement, une supposition faite avec assurance représente tout le mode de défaillance, et c'est l'objection qui revient dans presque tous les appels d'évaluation auxquels j'assiste.

"The AI will never be able to answer 100% of the questions. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

C'est une responsable CX d'une marque de compléments alimentaires DTC, et cette phrase résume la thèse de toute la catégorie. Une meilleure intelligence brute seule ne résout pas ça, le filtrage par confiance oui, c'est pourquoi prévenir les hallucinations dans le support est un problème de produit plutôt que de modèle.

Il est lent, et lent au pire endroit

Artificial Analysis a mesuré Opus 5 à 52,6 tokens de sortie par seconde, rang 117 sur 190, contre une médiane de classe de 76. Correct, pour du travail en arrière-plan. Ce qui le disqualifie vraiment pour un usage en temps réel, c'est le temps avant le premier jeton : 68,04 secondes à l'effort maximal, contre une médiane de classe de 2,81. C'est environ 24 fois plus lent avant même qu'un seul caractère n'apparaisse.

Baisser le niveau d'effort aide à peine : 52,8 tokens par seconde à xhigh, 56,8 à high, selon Artificial Analysis. Le mode rapide achète environ 2,5 fois la vitesse, pour le double du prix de base. Le résumé d'AA lui-même est plus tranchant que ce que j'écrirais moi-même : Opus 5 est "notablement lent et très verbeux".

Il y a un troisième chiffre à connaître avant de définir effort: "max" et d'oublier le sujet. Sur AA-Briefcase, l'effort maximal a nécessité en moyenne 36,2 minutes et 103 tours par tâche, selon Artificial Analysis, contre 24,1 minutes et 55 tours pour Opus 4.8. Pour le coût par tâche de l'Index, Opus 5 à l'effort maximal tourne à $2,03, contre $1,80 pour Opus 4.8, et aussi $1,53 pour Sonnet 5, selon l'analyse d'AA. Il ressort 26% moins cher que Fable 5, et plus cher que son propre prédécesseur.

La solution ici est simple : ne pas utiliser max par défaut. Le meilleur point de valeur de tout l'ensemble de données est Opus 5 à effort élevé, qui bat Fable 5 de 32 Elo à $10,41 par tâche, selon Artificial Analysis, moins de la moitié des $22,30 de Fable 5. Anthropic a même inversé ses propres recommandations pour s'aligner sur ça, conseillant désormais de commencer à high plutôt qu'à xhigh, selon les notes de version.

Ce que disent ceux qui l'ont utilisé en production

La semaine de lancement sur X s'est divisée d'une manière que je n'avais jamais vue. Le débat ne portait pas sur la qualité d'Opus 5, la plupart des gens pensent que c'est le meilleur modèle disponible. Le débat était qu'il s'agit du meilleur modèle disponible et désagréable à utiliser.

La version la plus acérée est venue de quelqu'un qui l'avait classé premier :

"BIG NEWS: Opus 5 is here...and I hate working with it. And yet in a blind taste test, I ranked it above every other model (even Fable and my beloved GPT-5.6)"

La part de test à l'aveugle est ce qui rend ça utile. Classer les modèles sans savoir lequel est lequel élimine la loyauté à une marque, donc "je le déteste" ne parle que de l'ergonomie, pas de la capacité. Dan Shipper, chez Every, a passé une semaine de tests avant sortie, sur le codage et l'écriture, ainsi que sur leur agent interne, et est arrivé à la même conclusion : "c'est un modèle difficile à aimer". Il "contestait les instructions, s'arrêtait avant la fin du travail", et s'accordait mal avec leurs skills et plugins existants.

La plainte la plus utile sur le plan opérationnel vient avec une solution jointe :

"Opus 5 is out now! And it broke Compound Engineering, but I also like it. Love it and hate it. I have been coding with it without many skills and it's nice at a medium effort level. Just remember to let go of you skills and big mega prompts."

Il décrit un échec précis : dans un flux autonome, le modèle rendait sans cesse le contrôle à l'humain. Le propre guide de prompting d'Anthropic dit à peu près la même chose, dans l'autre sens : il conseille aux développeurs de retirer les instructions du type "inclure une étape de vérification finale", car Opus 5 se sur-vérifie désormais de lui-même. L'échafaudage construit pour Opus 4.8 joue maintenant contre vous.

Il existe une explication mécanique claire, et elle vient du côté des benchmarks :

"Claude Opus 5 averages 103, 91, and 76 turns per task across its top three effort levels, compared to 55 for Opus 4.8 (max)"

Environ le double de la boucle d'agent. Ce seul chiffre explique "névrosé", "contestait les instructions" et aussi "rendait sans cesse le contrôle" en même temps. C'est le même comportement, vu simplement de l'extérieur.

L'unique mesure tierce et solide dans tout ce bruit de la semaine de lancement est venue de CodeRabbit, qui a fait passer Opus 5 dans son benchmark de revue de code en production. La précision a augmenté, de 35,2% à 39,3%. Le rappel a baissé, de 61,1% à 55,2%, avec en plus quatre fois plus de remarques mineures. Leur verdict était "un spécialiste de la précision, qui se marie bien avec un modèle orienté rappel", et comme ils vendent eux-mêmes de la revue de code, il faut lire cette recommandation d'ensemble en gardant ça en tête. Le compromis lui-même colle avec tout le reste ici : plus prudent et plus minutieux, et aussi plus bavard.

Un rappel qui baisse alors que la précision monte est la découverte la plus importante à retenir, si un modèle sert de relecteur. Ça change à quoi sert vraiment une passe de revue de code par IA, et il vaut la peine de recalculer ses propres chiffres avant de présumer d'une simple amélioration.

La même prudence vaut à l'intérieur d'éditeurs comme Cursor. Elle vaut aussi pour Windsurf, et dans Claude Cowork tout autant.

Le réglage d'effort est tout le débat

Le fil de lancement sur Hacker News a atteint 1 315 commentaires, et contient ce qui ressemble à une contradiction flagrante. La moitié du fil dit qu'Opus 5 est remarquablement bon marché à faire tourner, l'autre moitié dit qu'il consume leur limite de cinq heures. Les deux sont vrais. La variable, c'est le réglage d'effort.

Hacker News

"It overthinks quite a bit above medium effort, try using that."

Hacker News

"The chart shows max effort, used mostly by price-insensitive enterprise users. At medium effort it drops to almost half K3's cost, and is probably sufficient for 95% of coding tasks."

Puis le fil a trouvé mieux que des plaintes. En lisant la fiche système, plusieurs personnes ont remarqué que le score de codage d'Opus 5 chute en réalité au-dessus de l'effort moyen, ce qui ressemble à un bug, ou pire :

Hacker News

"Page 151 of the linked system card - did Opus 5 get nerfed to prevent it being better than Fable? The graph makes no sense. Huge decline in coding performance at effort levels higher than medium."

La fiche système répond clairement, et la vraie réponse est plus intéressante qu'un simple affaiblissement délibéré. Les deux meilleurs résultats de FrontierCode se situent à effort moyen, et Anthropic explique qu'à effort plus élevé, Opus 5 "apporte plus de modifications que la tâche ne le requiert", ce que l'évaluateur pénalise ensuite comme hors périmètre. Ajouter une brève instruction pour rester dans le périmètre a "restauré les performances sur la plupart de ces tâches". Le modèle ne devient donc pas plus bête à effort maximal, pas du tout. Il devient plus ambitieux, et l'ambition devient un bug quand la tâche était petite.

C'est probablement l'élément le plus exploitable de toute cette critique : augmenter l'effort n'est pas une amélioration gratuite, et sur un travail bien délimité, cela peut coûter à la fois de l'argent et du score.

Il est intéressant de noter aussi que ce même comportement se lit comme un atout pour un public différent. En déployant Opus 5 sur Copilot, l'annonce de GitHub l'a salué pour "valider son propre travail et réduire les surcharges d'exécution inutiles sur les tâches complexes". La même boucle d'auto-vérification, lue différemment : une équipe la juge minutieuse, l'autre la juge névrosée. Ce qu'on obtient dépend entièrement de si un humain attend le résultat.

Les tarifs, en détail

Rien n'a changé au niveau du token, ce qui est franchement le plus intéressant dans tout ça. Selon la documentation tarifaire, la lignée Opus est restée à $5 et $25 depuis Opus 4.5, une baisse d'un facteur trois par rapport aux $15 et $75 d'Opus 4.1.

Rate (per million tokens)Claude Opus 5Claude Fable 5Claude Sonnet 5Claude Haiku 4.5
Base input$5$10$2 (to Aug 31)$1
Output$25$50$10 (to Aug 31)$5
5-minute cache write$6.25$12.50$2.50$1.25
1-hour cache write$10$20$4$2
Cache read$0.50$1$0.20$0.10
Batch input / output$2.50 / $12.50$5 / $25$1 / $5$0.50 / $2.50
Fast mode input / output$10 / $50
Context window1M1M1M200k

Quatre choses changent votre facture discrètement :

  • Les $2 et $10 de Sonnet 5 ne sont qu'un tarif d'introduction et reviennent à $3 et $15 le 1er septembre 2026, selon la documentation tarifaire. Budgétiser Sonnet face à Opus aujourd'hui, c'est comparer avec un tarif qui expire dans environ cinq semaines.
  • Le tokenizer a changé. Selon le guide de migration, les modèles à partir de 4.7 peuvent utiliser jusqu'à 35% de tokens en plus pour le même texte. Une comparaison brute token par token avec un modèle de l'ère 4.6 sous-estimera le coût réel.
  • Le seuil de mise en cache est descendu à 512 tokens, le plus bas de la gamme, huit fois plus bas qu'Opus 4.5. Les prompts système courts qui ne pouvaient jamais être mis en cache auparavant peuvent l'être maintenant. Les prompts sous le seuil sont quand même traités, simplement sans erreur et sans mise en cache.
  • L'inférence exclusivement US coûte 1,1x sur toutes les catégories de tokens, ce qui donne $5,50 et $27,50 pour Opus 5.

Côté grand public, Pro coûte $20 par mois (ou $17 en facturation annuelle). Max coûte $100 ou $200, et les postes Team se situent aussi à $25 ou $125. Les limites d'usage sont basées sur la session, sur une fenêtre glissante de cinq heures plutôt qu'un compte de messages, et web, bureau, mobile et Claude Code puisent tous dans le même quota.

Les chiffres complets figurent dans mon détail des tarifs de Claude Code, et si vous décidez quel modèle affecter à quelle tâche, le guide de sélection de modèle et les notes sur la fenêtre de contexte sont les compléments pratiques à cette section.

Ce qui casse lors de la migration

Anthropic qualifie Opus 5 de remplacement direct d'Opus 4.8, et c'est globalement vrai. Deux choses cassent réellement :

  1. La réflexion adaptative est activée par défaut. Revoyez votre max_tokens, car les tokens de réflexion en sont désormais déduits, sur des requêtes qui n'en avaient auparavant aucun.
  2. La désactivation de la réflexion est plafonnée. thinking: {"type": "disabled"} renvoie une erreur 400 aux niveaux d'effort xhigh ou max, selon les notes de version, appliquée par requête. Opus 4.8 acceptait auparavant cette combinaison.

Deux fonctionnalités ont également disparu complètement, plutôt que de simplement changer : web fetch n'est pas disponible sur Opus 5, selon le guide de migration, et Priority Tier non plus, qu'Opus 4.8 conserve encore. Si vous avez un engagement de capacité, il faut anticiper avant de basculer le trafic.

En venant d'Opus 4.6 ou d'une version antérieure, la liste est plus longue. Les paramètres d'échantillonnage comme temperature et top_p renvoient une erreur 400 pour toute valeur non par défaut, selon le guide de migration, et les types du SDK les acceptent encore, donc votre code passe la vérification de type sans problème et l'API le rejette quand même. Le préremplissage assistant a aussi disparu. Le contenu de réflexion est omis par défaut, ce qui, pour tout ce qui diffuse le raisonnement en direct à un utilisateur, ressemble à un long silence avant l'apparition de la moindre sortie.

Côté ajouts, deux bêtas sont sorties avec le modèle : le changement d'outils en cours de conversation, qui permute les outils disponibles sans invalider le cache du prompt, et les replis automatiques côté serveur. Si vous construisez des agents à plusieurs étapes, le premier est discrètement un gros changement.

Ça change aussi la façon dont les agents sont composés. Permuter les outils en pleine exécution sans manquer le cache rend le motif de sous-agent moins coûteux. Il se place aux côtés des Claude Skills, et aussi des outils MCP, sans remplacer l'un ou l'autre.

Mon analyse skills contre sous-agents détaille quand chacun est le bon conteneur. Si vous tournez chez un fournisseur cloud plutôt que sur l'API en direct, notez que le mode rapide est réservé à la première partie, ce que mes notes sur Bedrock et Claude Code abordent en détail.

Sécurité, et le repli dont personne ne parle

L'audit d'Anthropic avant déploiement qualifie Opus 5 de modèle le mieux aligné à ce jour, avec un score de 2,3 sur le comportement globalement désaligné, le plus bas parmi ses modèles récents. Il est déployé sous protections ASL-3, le même niveau qu'Opus 4.8.

Le résultat qui m'intéresse le plus est la résistance à l'injection de prompt, car c'est ce qui casse les agents connectés à de vraies données client. Le taux de réussite des attaquants sur l'évaluation d'injection indirecte de prompt est passé de 5,5% à 2,0%, le meilleur de tous les modèles testés et loin devant les 20,0% de GPT-5.6 Sol. Le taux de réussite des attaques par usage de navigateur est tombé de 31,5% à 3,70%, puis à 0% sur 129 scénarios avec le mode automatique activé. Pour quiconque donne un accès aux outils à un agent, ça compte plus que n'importe quel score de codage.

La partie souvent négligée : Opus 5 ne répond pas toujours à votre demande.

How a flagged request quietly falls back from Opus 5 to Opus 4.8 instead of returning an error
How a flagged request quietly falls back from Opus 5 to Opus 4.8 instead of returning an error

Dans Claude.ai et Claude Code, ainsi que dans Claude Cowork, les requêtes signalées par les classificateurs cyber basculent par défaut vers Opus 4.8, selon le billet de lancement, et le même comportement est disponible via l'API également. Pas d'erreur, pas de signal évident, juste un modèle différent qui répond silencieusement. Anthropic s'attend à ce que ces classificateurs interviennent environ 85% moins souvent que pour Fable 5, selon Anthropic, ce qui constitue une réelle amélioration, mais si vous faites du benchmarking ou du débogage, sachez qu'une fraction de votre trafic pourrait ne pas être le modèle que vous croyez.

Là où Opus 5 est délibérément bridé : il reste derrière Mythos 5 à la fois en cybersécurité et en recherche biologique, selon le billet de lancement. Sur OSS-Fuzz, il trouve des vulnérabilités à peu près aussi bien que Mythos 5, mais il est très en retard pour les transformer en exploits.

OSS-Fuzz results showing Opus 5 near Mythos 5 at finding vulnerabilities and well behind on exploit development, as taken from Anthropic
OSS-Fuzz results showing Opus 5 near Mythos 5 at finding vulnerabilities and well behind on exploit development, as taken from Anthropic

Qui devrait mettre à niveau, et qui ne devrait pas

Mettez à niveau si vous faites tourner des agents : tâches longues à plusieurs étapes, boucles de codage, pipelines de recherche, utilisation d'ordinateur, tout ce où le modèle travaille vingt minutes sans surveillance. Les résultats d'AutomationBench et d'AA-Briefcase ne sont pas serrés, et le prix n'a pas bougé non plus. Si vous choisissez entre assistants, mon tour d'horizon des outils de codage IA et la critique de GPT-5.3 Codex couvrent les alternatives, avec plus de contexte dans ma liste des alternatives à Opus 4.6.

Restez où vous êtes si votre charge de travail est un chat court et sensible à la latence. Un premier jeton à 68 secondes n'est pas quelque chose qu'on peut contourner par configuration. Sonnet 5 est le bon choix là-dessus, tout comme Haiku, et à l'effort maximal, Opus 5 coûte plus cher par tâche terminée que l'un ou l'autre.

Cherchez ailleurs si vous avez besoin de connaissances factuelles actuelles sans couche de récupération. Opus 5 a une connaissance factuelle inférieure à Fable 5, selon Artificial Analysis, et le chiffre d'hallucination dit le reste.

Comparez-le à Gemini 3. Regardez aussi Kimi K3. Ou envisagez Mistral avant de vous décider.

Un écart honnête : il n'existe encore aucune donnée de préférence humaine. Opus 5 n'apparaît pas sur le classement texte de LMArena, dont l'instantané actuel précède le lancement. Il vaut la peine de noter qu'Opus 4.8 se situe au rang 13 là-bas malgré son statut de modèle top cinq sur l'Index, donc l'intelligence de benchmark et ce que les gens préfèrent réellement ne sont clairement pas la même chose.

Ce que ça signifie si vous construisez de l'IA de support

Chaque lancement de modèle frontière déclenche la même conversation, dans les appels de mon équipe. Quelqu'un de technique regarde un modèle à $5 par million de tokens qui obtient 26% sur l'automatisation de flux de travail métier, et pose la question raisonnable : pourquoi payer pour un produit de support quand on pourrait le brancher nous-mêmes ?

Je prends ça au sérieux, car je l'ai vu arriver réellement. Quelques comptes techniques, dont une marque de beauté DTC, ont quitté eesel pour construire directement sur l'API Claude. C'est l'alternative concurrente la plus courante que je rencontre, et ce n'est pas non plus un plan idiot.

What a frontier model gives you versus what a live support desk still needs
What a frontier model gives you versus what a live support desk still needs

Ce qui a tendance à se passer, c'est que le modèle n'a jamais été la partie difficile. La partie difficile, c'est tout ce qui se trouve à droite de cette flèche : s'authentifier auprès du helpdesk et garder les tickets synchronisés, s'entraîner sur votre base de connaissances, faire tourner le tout sur les tickets passés avant qu'il ne touche un ticket en direct, router selon la confiance pour qu'il reste silencieux en cas d'incertitude, transférer à un humain sans perdre le contexte, et connaître votre coût par ticket à l'avance plutôt que de réconcilier une facture de tokens après coup.

Additionnez les deux chiffres de cette critique et les garde-fous cessent d'être un simple plus. Un taux d'hallucination de 50% est exactement ce sur quoi tout chatbot de service client IA est jugé, et un premier jeton à 68 secondes est plus long que ce que la plupart des gens attendront dans une fenêtre de chat. Il y a une raison pour laquelle le taux de résolution se mesure sur les résultats plutôt que sur les scores de benchmark, et pourquoi les outils de helpdesk qui fonctionnent sont ceux qui vous laissent voir ce que l'IA aurait dit, avant qu'elle ne le dise vraiment.

Un client a résumé le choix construire-ou-acheter mieux que je ne pourrais le faire.

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Karel, GENERAL BYTES, from their case study

C'est vraiment le compromis. Opus 5 rend le moteur radicalement meilleur et moins cher, mais il ne fait rien contre les douze mois de maintenance qui l'entourent. Si vous appréciez ce genre de travail, construisez. Si vous voulez juste le résultat, ne le faites pas.

Où eesel trouve sa place

Si ce que vous voulez vraiment, c'est un raisonnement de niveau Opus qui répond à vos tickets dès demain, pas le trimestre prochain, eesel est ça. Branchez-le sur le helpdesk que vous utilisez déjà, il s'entraîne sur vos macros et documents existants, ainsi que sur vos tickets passés, et commence à rédiger ou résoudre dès le premier jour. Pas de comptabilité de tokens, pas de renforcement contre l'injection de prompt, pas de logique de repli à écrire.

The eesel AI dashboard showing live ticket activity across a connected helpdesk
The eesel AI dashboard showing live ticket activity across a connected helpdesk

L'élément que je montrerais en premier à un ingénieur sceptique, c'est la simulation. Avant qu'eesel ne réponde à un seul ticket en direct, vous pouvez le faire tourner sur vos tickets historiques et voir exactement ce qu'il aurait dit, ce qui est la seule façon honnête de savoir si la confiance d'un modèle est méritée sur vos propres données, plutôt que sur un benchmark. Après ça, le routage basé sur la confiance décide ce à quoi il répond et ce qu'il laisse tranquille, et la tarification fonctionne par tâche plutôt que par token, donc un modèle bavard ne vous surprend jamais en fin de mois.

Ce n'est pas fait pour tout le monde, pour être clair. Si votre cas d'usage, c'est le code, utilisez directement Claude Code. Mais si c'est une file de support, et que le plan consistait à passer un trimestre à reconstruire la déviation de tickets, plus l'escalade, en plus d'une nouvelle clé API, essayez eesel en premier. C'est gratuit pour commencer.

Questions fréquentes

Claude Opus 5 vaut-il le coup par rapport à Opus 4.8 ?
Pour le travail agentique, oui. Opus 5 fait plus que doubler le score Frontier-Bench d'Opus 4.8, au même prix de $5 / $25 par million de tokens, et les notes de migration d'Anthropic elles-mêmes le décrivent comme un remplacement direct avec seulement deux changements majeurs. Le hic : son taux d'hallucination a augmenté au lieu de baisser, donc tout usage orienté client nécessite toujours les garde-fous décrits dans prévenir les hallucinations de l'IA. Si vous êtes encore sur l'ancienne lignée, notre analyse d'Opus 4.6 montre à quel point la famille a évolué.
Combien coûte Claude Opus 5 ?
$5 par million de tokens en entrée et $25 par million en sortie sur l'API Claude, inchangé par rapport à Opus 4.8, avec une remise de 50% via la Batch API et aucun surcoût pour le contexte long sur la fenêtre de 1M. Le mode rapide double les deux chiffres. L'accès grand public va du plan Pro à $20/mois jusqu'à Max à $200/mois, et les tarifs de Claude Code puisent dans le même quota.
Claude Opus 5 est-il meilleur que Claude Fable 5 ?
Pas en capacité brute, mais il s'en rapproche pour beaucoup moins cher. Opus 5 se situe à 0,5% du score maximal de Fable 5 sur CursorBench pour moitié moins de coût par tâche, et le dépasse nettement sur le travail de connaissance agentique. Fable 5 reste devant sur la connaissance factuelle. Notre présentation de Fable 5 montre où le modèle phare justifie encore son prix.
Puis-je utiliser Claude Opus 5 pour le support client ?
Comme moteur de raisonnement derrière un produit de support, oui. Comme générateur de réponses directes sur un chat en direct, attention : 68 secondes avant le premier jeton à l'effort maximal, c'est bien trop lent pour un widget de chat, et le taux d'hallucination a grimpé de 14 points. La plupart des équipes obtiennent de meilleurs résultats en superposant un produit conçu spécifiquement pour ça, ce que font justement le support technique IA et les outils d'automatisation du support.
Qu'est-ce qui casse lors de la migration vers Claude Opus 5 ?
Deux choses. La réflexion adaptative est activée par défaut, donc il faut revoir votre max_tokens, et désactiver la réflexion renvoie une erreur 400 aux niveaux d'effort xhigh ou max. Web fetch et Priority Tier manquent aussi sur Opus 5. Le nouveau tokenizer compte jusqu'à 35% de tokens en plus pour le même texte, donc il faut recalculer vos coûts plutôt que réutiliser d'anciennes estimations. Quiconque l'intègre dans des agents devrait aussi lire notre guide de sélection de modèle.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5 : lequel utiliser ?

Claude Opus 5 coûte 1,7x le prix par token de Sonnet 5, et termine pourtant certaines tâches moins cher. Voici la comparaison directe sur le prix, les benchmarks et le coût réel par tâche.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Une illustration d'une personne sélectionnant l'un des cinq curseurs d'effort de raisonnement sur un panneau de contrôle façon Claude Opus 5
Trending

Claude Opus 5 : ce que c'est et comment l'utiliser vraiment

Claude Opus 5 n'est pas un modèle, ce sont cinq modèles. Un guide pratique sur les spécifications, le curseur d'effort qui décide de la facture, et les deux changements d'API qui cassent l'ancien code.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5 : lequel utiliser réellement ?

Fable 5 coûte exactement le double d'Opus 5. J'ai passé en revue les deux system cards, la documentation et les benchmarks indépendants pour déterminer quand ce dollar supplémentaire apporte vraiment quelque chose.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Texte alternatif de l'image
Guides

Un aperçu des tarifs et des capacités de Claude Opus 4.6

Explorez notre analyse approfondie des tarifs de Claude Opus 4.6. Nous détaillons les coûts, les nouvelles fonctionnalités et les cas d'utilisation concrets du dernier modèle d'IA d'Anthropic.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieFeb 6, 2026
Illustration comparant un petit noyau de modèle bien ordonné à un autre, bien plus grand et emmêlé, pour un avis sur Inkling-Small
Trending

Inkling-Small à l'essai : un quart de la taille, presque aussi malin

Un test concret d'Inkling-Small : il surpasse son propre modèle parent de 975B en code, avec un quart de la taille et un quart du prix, avant de s'effondrer sur la factualité. Voici ce que ce compromis coûte réellement.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration éditoriale d'un classement de benchmarks avec une barre haute mise en évidence, représentant ZCode et le modèle GLM-5.2
Trending

ZCode : ce qu'est vraiment le nouvel agent de codage IA de Z.ai

Un test concret de ZCode, l'application de codage agentique gratuite de l'équipe GLM : le modèle GLM-5.2 qui la fait tourner, les vraies critiques de la semaine de lancement, et à qui elle s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration éditoriale pour un guide sur ce que Claude Fable 5, le modèle d'IA le plus puissant d'Anthropic, peut faire
Guides

Que peut faire Claude Fable 5 ? Un guide capacité par capacité

Que peut faire Claude Fable 5 ? Travailler des jours sans surveillance, écrire et livrer du code, lire des documents d'un million de tokens et vérifier son propre travail. Voici ce que cela signifie en pratique.

Riellvriany IndriawanRiellvriany IndriawanJun 17, 2026
Un agent IA sortant d'un écran pour manipuler des fenêtres d'applications et des documents pendant que deux collègues observent, dans la couleur de marque bleue de Meta
Trending

Meta Muse Spark 1.1 : ce que c'est, ce que ça coûte, où ça pêche

La première API de modèle payante de Meta lance un modèle agent à 1M de contexte pour $1,25/$4,25. Ce en quoi Muse Spark 1.1 est réellement bon, et les benchmarks que Meta a laissés hors de sa diapositive.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement