Claude Opus 5レビュー:半額でフロンティア級に迫るコーディング性能

Alicia Kirana Utomo
執筆者

Alicia Kirana Utomo

Katelin Teen
レビュー者

Katelin Teen

最終更新 July 27, 2026

専門家による検証済み
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot

Claude Opus 5とは実際何か

Opus 5はAnthropicの新しい主力モデルだ。フラッグシップは依然としてFable 5である。しかしAnthropicがまず試すよう勧めているのはOpus 5だ。ドキュメントでは、複雑なエージェント的コーディングやエンタープライズ業務ではまずClaude Opus 5から始めるよう案内し、天井に届かない場合にのみ上位モデルへ移行するとしている。Claude Maxではすでに新しいデフォルトとなっており、Claude ProではAnthropicによれば利用可能な中で最も強力なモデルだという。

ローンチ記事ではこう表現されている。「半額でClaude Fable 5のフロンティア知性に迫る」。まずはポジショニング的な主張として読める。ただ珍しいことに、独立した調査データがおおむねその主張を裏付けているのだ。

このペースは特筆に値する。少し前のリリースを最後にこのファミリーを見た人ならなおさらだ。私のOpus 4.5レビューはまだ数ヶ月しか経っていないのに、すでに違う階層のモデルのように読める。Opus 4.6はその中間あたりに位置していた。

簡単にスペックを見ておこう。モデルIDはclaude-opus-5。コンテキストウィンドウは100万トークンで、最大出力は128kトークン、詳細はモデル概要を参照。ナレッジカットオフは2026年5月で、Fable 5とSonnet 5のどちらよりも新しい。バッチリクエストではベータヘッダーを使うことで出力を30万トークンまで拡張できる。ロングコンテキストの割増料金もなく、料金ドキュメントによれば90万トークンのリクエストも9千トークンのリクエストと同じトークン単価で請求される。

Where Claude Opus 5 sits against Opus 4.8 and Fable 5 on capability versus cost per task
Where Claude Opus 5 sits against Opus 4.8 and Fable 5 on capability versus cost per task

3年間、私はeeselで他社の実際のサポートキュー上で動くAIエージェントを構築してきた。だから新モデルの発表を読むときは、いつも一つの問いを持っている。これは顧客の前に安全に置けるものを変えるだろうか、と。このレビューではまずコーディング面での成果を見て、次にライブ会話の近くに置けるかどうかを決める2つの数字を見ていく。

ベンチマークの実像:本物の成果、しかし見出しほど厚くはない

まずAnthropicが最も誇る数字から見ていこう。Frontier-Bench v0.1は、同じチームが手掛けたTerminal-Benchの後継で、Opus 5はxhighエフォートで平均報酬44.4%を記録した。システムカードによれば、Opus 4.8は18.7%、Fable 5は33.7%、GPT-5.6 Solは37.5%だった。これは漸進的な伸びではない。

Frontier-Bench v0.1 score plotted against cost per attempt for Opus 5, Fable 5, Opus 4.8 and GPT-5.6 Sol, as taken from Anthropic
Frontier-Bench v0.1 score plotted against cost per attempt for Opus 5, Fable 5, Opus 4.8 and GPT-5.6 Sol, as taken from Anthropic

ここで重要なのはピーク値よりもグラフの形状だ。Opus 5の線は他のすべてより左上に位置している。これはまさに望ましいポジション、つまり少ない費用でより高いスコアが出るということだ。Fable 5の曲線全体はその右側に位置し、より低い天井のために2〜3倍のコストを払っている。

以下の見出しテーブルはシステムカードからそのまま転載したものだ。

EvaluationClaude Opus 5Claude Opus 4.8Claude Fable 5GPT-5.6 Sol
SWE-bench Pro79.269.28064.6
SWE-bench Multilingual89.584.486.6
SWE-bench Multimodal59.438.454.1
DeepSWE v1.168.859.069.772.7
FrontierCode 1.1 (Main)53.446.553.547.5
FrontierBench v0.143.321.133.834.4
BrowseComp90.884.387.490.4
Humanity's Last Exam (no tools)56.349.856.5
OSWorld 2.070.655.766.162.6
GDPval-AA v2 (Elo)1861159317471736
AA-Briefcase (Elo)1720134615741505
AutomationBench26.017.017.418.1
ARC-AGI-290.472.192.5
ARC-AGI-330.21.57.8

各行を個別に見ると、平均値だけでは見えないものが分かる。Opus 5はSWE-bench ProではFable 5に、DeepSWEではGPT-5.6 Solに負けているし、ARC-AGI-2でも2ポイント差で敗れている。しかし勝つときは大差で勝つ。SWE-bench MultimodalはOpus 4.8比で21ポイント跳ね上がった。ARC-AGI-3は1.5から30.2へと上昇し、システムカードはこれをこれまでの最高報告スコアのおよそ4倍と表現している。

本物の満点も埋もれている。7月15〜16日に開催された2026年国際数学オリンピックで、Opus 5はエージェントハーネスもツールも使わずに42点満点中42点という完璧なスコアを記録した。システムカードによれば金メダルのボーダーは29点だった。

こうした対決比較を追っているなら、この結果は序列を組み替えるものだ。私のGemini 3 Pro比較は新しい基準が必要になったし、Codex対Opus 4.6の記事も同様だ。

独立系の数字が語ること

Artificial Analysisは、Intelligence IndexでOpus 5を61と評価している。190モデル中の1位で、クラス中央値の32を大きく上回る。1位は確かに本物だが、実は1ポイント差の僅差でもある。AAの記事によればFable 5は60、GPT-5.6 Solは59、Opus 4.8は56と続く。AA自身の表現も「わずかに」最も知的なモデル、というものだ。

大きく差がついているのは「知性」よりももっと具体的な領域だ。220件の実際の職務タスクからなるGDPval-AA v2を見ると、システムカードによればOpus 5が1861と1827というElo値で上位2位を独占し、Fable 5に114ポイント差をつけている。数週間にわたる長期プロジェクトを対象とした長期的な知識作業を測るAA-Briefcaseでも、上位3位を独占している。これらの結果こそがローンチを実際に正当化するものだ。長く煩雑な作業をやり遂げることに関するもので、一つの難問に答えることとは違うスキルなのだ。

ほとんどの報道が見落としている注意点が一つある。システムカードによれば、Anthropicは安全分類器による拒否が発生した際のフォールバックとしてOpus 4.8を使ってFrontier-Benchの数字を測定しており、そのフォールバックはAPI呼び出しの5%を捕捉していた。Artificial Analysisも同じ方法でIndexを測定している。つまり「Opus 5」のスコアのごく一部は、実際にはOpus 4.8によって生み出されたものだったということだ。

コーディングモデルである前に、エージェントモデルである

私が最も驚いたのは、どのコーディングリーダーボードにも載っていない結果だった。それがZapierのAutomationBenchで、47のアプリにまたがる数十のREST APIエンドポイントを持つ模擬企業にエージェントを投入し、実際のビジネスワークフローを完了できるかを採点するものだ。システムカードによれば、Opus 5は26.0%を記録し、Opus 4.8の17.0%、Fable 5の17.4%、GPT-5.6 Solの18.1%を上回った。

AutomationBench pass rate against cost per task, with Opus 5 clearing every other model at lower cost, as taken from Anthropic
AutomationBench pass rate against cost per task, with Opus 5 clearing every other model at lower cost, as taken from Anthropic

オレンジ色の線がどこから始まっているかに注目してほしい。Opus 5の最も安価な設定が、他のすべてのモデルの最高設定をすでに上回っている、それもタスクあたり約$0.75というコストで。Anthropicはミディアムエフォートでタスクあたり$0.89で24%を達成したと報告しており、Opus 4.8とFable 5の両方を半分以下のコストで上回るとしている。これがこのリリースの本当のストーリーだ。より賢いチャットボットではなく、より安価なエージェントということである。

その挙動の裏付けはエピソードにも表れている。あるFrontier-Benchのタスクでは、Opus 5は機械部品の図面を渡され、それをFreeCADで再現するよう求められた。しかもローンチ記事によれば、図面を見る手段を意図的に与えられていなかった。Opus 5は生のピクセルから幾何情報を読み取るための独自のコンピュータビジョンパイプラインを自分で書き上げ、他のどのモデルも5回の試行で解けなかった。JetBrainsはこの変化を判断力の向上と表現している。モデルが事後ではなく計画段階で自らの論理的誤りに気づくようになった、ということだ。

アーリーアクセスの数字もこのパターンを裏付けている。BoxはOpus 4.8比で全体8%の改善を計測し、デューデリジェンスのワークフローでは17%まで上昇した。Lovableは最も難しいエージェント的コーディングタスクでOpus 4.7比22%の向上を記録し、実行ごとのばらつきも大幅に減った。ある取引会社はローンチ記事によれば、およそ7分の1の推論トークンで同じ結果に到達したと報告している。

モデルが人の監視なしで実務をこなすようになるほど、この種の効率の差は生のスコアよりも重要になる。これは私のエージェント的コーディングCLIの記事や、より広いAIエージェントまとめでも書いた変化と同じものだ。興味深い問いは「答えられるか」から「やり遂げられるか」へと変わった。

立ち止まって考えるべき2つの数字

これは最初に読んでほしいセクションなので、埋もれさせずに置いておく。

置き換える対象のモデルよりハルシネーションが多い

クローズドブックの事実性ベンチマークであるAA-Omniscienceでは、Artificial AnalysisによればOpus 5はOpus 4.8比で精度を7ポイント改善したが、ハルシネーション率も14ポイント上昇して50%になった。Anthropic自身のシステムカードも同じトレードオフを自らの言葉で記録している。精度はOpus 4.8より11%高いが、ハルシネーション率も6%高いという。

これは実のところ矛盾ではない。モデルが不確かなときにより頻繁に答えるようになった、というだけのことだ。テスト付きのコーディングタスクでは、当て推量のコストは安い。テストが失敗すれば、ループが続くだけだ。しかし顧客の返金に関する質問では、自信満々な当て推量そのものが失敗のすべてを意味する。これは私が立ち会うほぼすべての評価コールで出てくる異論でもある。

"The AI will never be able to answer 100% of the questions. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

これはDTCサプリメントブランドのCXリードの言葉であり、この一文がカテゴリ全体の主旨を要約している。生の知性を上げるだけではこの問題は解決しない、必要なのは信頼度によるゲーティングだ。だからこそサポートにおけるハルシネーション防止はモデルの問題ではなく製品の問題なのだ。

遅い、それも最悪の場所で遅い

Artificial AnalysisはOpus 5の出力速度を毎秒52.6トークンと計測しており、190モデル中117位、クラス中央値の76を下回る。バックグラウンド作業なら問題ない。しかし実際にリアルタイム用途から失格させる決定打は初回トークンまでの時間だ。最大エフォート時で68.04秒、クラス中央値の2.81秒と比べると、1文字も表示される前の段階でおよそ24倍遅いことになる。

エフォートレベルを下げてもあまり改善しない。Artificial Analysisによれば、xhighで毎秒52.8トークン、highで56.8トークンだ。Fastモードは速度をおよそ2.5倍にするが、基本価格は2倍になる。AA自身の総括は私が書くよりも率直だ。Opus 5は「際立って遅く、非常に冗長」

effort: "max"を設定してそのまま忘れてしまう前に知っておくべき3つ目の数字もある。Artificial Analysisによれば、AA-Briefcaseで最大エフォートは1タスクあたり平均36.2分、103ターンを要し、Opus 4.8の24.1分、55ターンを上回る。Index換算のタスクあたりコストでは、AAの記事によればOpus 5の最大エフォートは$2.03、Opus 4.8は$1.80、Sonnet 5は$1.53だ。Fable 5より26%安い一方で、自分自身の前世代よりは高くつく。

対策はシンプルだ。maxをデフォルトにしないこと。データセット全体で最も価値が高いポイントは、highエフォートのOpus 5で、Artificial Analysisによればタスクあたり$10.41でFable 5を32Elo上回り、これはFable 5の$22.30の半分以下だ。Anthropicも自らのガイダンスを覆し、リリースノートではxhighではなくhighから始めるよう推奨するようになった。

実際に使ってみた人たちの声

Xでのローンチウィークの議論は、これまで見たことのない形で二極化した。論点はOpus 5が良いかどうかではなかった。ほとんどの人はこれを最良のモデルだと考えている。論点は最良のモデルであると同時に、使っていて不快なモデルでもある、という点だった。

最も鋭い意見は、それでも1位にランクづけした人物から出た。

"BIG NEWS: Opus 5 is here...and I hate working with it. And yet in a blind taste test, I ranked it above every other model (even Fable and my beloved GPT-5.6)"

ブラインドテストであることが重要だ。どちらのモデルか分からない状態でランク付けすることでブランドへの思い入れが排除されるため、「嫌い」という感想は純粋に使い勝手についてのものであり、性能についてではないことになる。EveryのDan Shipperは、コーディングとライティング、さらに社内エージェントにわたって1週間のプレリリーステストに費やし、同じ結論に至った。「愛しにくいモデルだ」。「指示に反論し、作業が終わる前に止まってしまい」、既存のスキルやプラグインともうまく噛み合わなかったという。

最も実務的に役立つ不満には、対処法もセットで付いてきた。

"Opus 5 is out now! And it broke Compound Engineering, but I also like it. Love it and hate it. I have been coding with it without many skills and it's nice at a medium effort level. Just remember to let go of you skills and big mega prompts."

彼は一つの具体的な失敗を説明している。自律的なフローの中で、モデルが繰り返し制御を人間に戻してしまうというものだ。Anthropic自身のプロンプティングガイドも、逆方向からほぼ同じことを述べている。開発者に対して「最終確認ステップを入れる」という指示を取り除くよう勧めているのだ。Opus 5は自ら過剰に検証してしまうためだという。Opus 4.8向けに組んだスキャフォールディングが、今度は逆効果になる。

もっと機械的な説明もあり、それはベンチマーク側から来ている。

"Claude Opus 5 averages 103, 91, and 76 turns per task across its top three effort levels, compared to 55 for Opus 4.8 (max)"

エージェントループがおよそ2倍。この一つの数字が、「神経質」「指示に反論した」「制御を戻し続けた」という感想すべてを一度に説明している。それらは同じ挙動を外側から見ているにすぎない。

ローンチウィークの喧騒の中で唯一の確かなサードパーティ計測はCodeRabbitから来た。彼らは自社の本番コードレビューベンチマークにOpus 5を通した。適合率は35.2%から39.3%へ上昇した。一方で再現率は低下し、61.1%から55.2%になった。あら探しの指摘も4倍に増えた。彼らの評決は「適合率のスペシャリストであり、再現率型のモデルと組み合わせるのが良い」というもので、彼ら自身がコードレビュー製品を販売していることを踏まえてこのアンサンブル推奨は読むべきだろう。トレードオフ自体はここまでの内容と一致する。より慎重で、より徹底しており、そしてより饒舌だ。

再現率が下がり適合率が上がるという発見は、モデルをレビュアーとして使うなら最も長く考える価値がある。これはAIコードレビューパスが実際何のためにあるのかを変えるものであり、単純なアップグレードだと決めつける前に自分自身の数字を再計測する価値がある。

同じ慎重さはCursorのようなエディタの中にも当てはまる。Windsurfでも同様であり、Claude Coworkの中でも同じだ。

エフォート設定こそがすべての論点

Hacker Newsのローンチスレッドは1,315件のコメントに達し、一見矛盾する内容を含んでいる。スレッドの半分はOpus 5が驚くほど安く運用できると言い、もう半分は5時間制限を燃やし尽くしていると言う。どちらも真実だ。変数はエフォート設定にある。

Hacker News

"It overthinks quite a bit above medium effort, try using that."

Hacker News

"The chart shows max effort, used mostly by price-insensitive enterprise users. At medium effort it drops to almost half K3's cost, and is probably sufficient for 95% of coding tasks."

さらにスレッドは不満よりも良いものを見つけ出した。システムカードを読んだ複数の人が、Opus 5のコーディングスコアはミディアムエフォート以上でむしろ下がることに気づいた。それはバグ、あるいはそれ以上に悪いものに見える。

Hacker News

"Page 151 of the linked system card - did Opus 5 get nerfed to prevent it being better than Fable? The graph makes no sense. Huge decline in coding performance at effort levels higher than medium."

システムカードはこれに明快に答えており、実際の答えは「弱体化」よりも興味深い。FrontierCodeの最高スコアはどちらもミディアムエフォートで出ており、Anthropicの説明によれば、より高いエフォートではOpus 5は「タスクが必要とする以上の変更を加える」ため、採点者がそれをスコープ外として減点してしまうのだという。短い「スコープ内にとどまる」という指示を加えるだけで「これらのタスクのほとんどで性能が回復した」。つまりモデルは最大エフォートで愚かになっているわけではまったくない。より野心的になっているだけで、タスクが小さいときにはその野心がバグになる。

これはおそらくこのレビュー全体の中で最も実践的な示唆だろう。エフォートを上げることは無料のアップグレードではなく、スコープの定まった作業ではコストとスコアの両方を犠牲にしうる。

同じ挙動が別の観客には長所として映るのも興味深い。Copilot全体にOpus 5を展開するにあたり、GitHubの発表は、「自らの作業を検証し、複雑なタスクにおける不要な実行オーバーヘッドを減らしている」ことを評価している。同じ自己検証ループでも、受け止め方は違う。あるチームは徹底的と呼び、別のチームは神経質と呼ぶ。どちらに感じるかは、出力を待っている人間がその場にいるかどうかに完全に左右される。

料金、詳細版

トークン単位では何も変わっていない、それがある意味この件で最も興味深い点だ。料金ドキュメントによれば、Opusラインの価格はOpus 4.5以来ずっと$5と$25のまま維持されており、Opus 4.1の$15と$75から3分の1に切り下げられて以降変わっていない。

Rate (per million tokens)Claude Opus 5Claude Fable 5Claude Sonnet 5Claude Haiku 4.5
Base input$5$10$2 (to Aug 31)$1
Output$25$50$10 (to Aug 31)$5
5-minute cache write$6.25$12.50$2.50$1.25
1-hour cache write$10$20$4$2
Cache read$0.50$1$0.20$0.10
Batch input / output$2.50 / $12.50$5 / $25$1 / $5$0.50 / $2.50
Fast mode input / output$10 / $50
Context window1M1M1M200k

請求額に静かに影響する4つの点がある。

  • Sonnet 5の$2と$10はあくまで導入価格であり、料金ドキュメントによれば2026年9月1日に$3と$15へ戻る。今日Sonnet対Opusで予算を組むということは、約5週間後に失効するレートと比較していることになる。
  • トークナイザーが変更された。 移行ガイドによれば、4.7以降のモデルは同じテキストに対して最大35%多くのトークンを使う可能性がある。4.6世代のモデルとの単純なトークン単価比較では、実際のコストを過小評価してしまう。
  • キャッシュの下限が512トークンまで下がった。 ラインナップの中で最も低く、Opus 4.5より8倍低い。これまでキャッシュできなかった短いシステムプロンプトも、今ではキャッシュ対象になる。下限未満のプロンプトも処理自体は行われ、エラーもキャッシュもされないだけだ。
  • 米国限定推論は1.1倍のコストすべてのトークンカテゴリにかかり、Opus 5では$5.50と$27.50になる。

コンシューマー向けでは、Proが月額$20(年間契約なら$17)。Maxは$100または$200、Teamシートも$25または$125だ。利用上限はメッセージ数ではなくローリング5時間ウィンドウのセッションベースで、web、デスクトップ、モバイル、そしてClaude Codeもすべて同じプールから消費される。

詳細な数字は私のClaude Code料金の解説にまとめてあり、どのモデルをどのジョブに割り当てるか決める際には、モデル選択ガイドコンテキストウィンドウについてのノートがこのセクションの実践的な補足になる。

移行時に壊れるもの

AnthropicはOpus 5をOpus 4.8のドロップイン交換だとしており、おおむねその通りだ。ただ実際に壊れる点が2つある。

  1. アダプティブシンキングがデフォルトでオン。 max_tokensを見直す必要がある。シンキングトークンが今やそこから消費されるためで、以前はシンキングがまったくなかったリクエストでも同様だ。
  2. シンキングの無効化に制限がある。 リリースノートによれば、thinking: {"type": "disabled"}xhighまたはmaxエフォートで400エラーを返すようになり、リクエストごとに強制される。Opus 4.8ではこの組み合わせを受け入れていた。

まるごと姿を消した機能も2つある。単に変更されただけでなく、なくなってしまったのだ。移行ガイドによれば、Web FetchはOpus 5で利用できず、Priority Tierも同様で、こちらはOpus 4.8にはまだ残っている。キャパシティコミットメントを保有している場合は、トラフィックを切り替える前にこの点を計画に織り込む必要がある。

Opus 4.6以前から移行する場合は、リストがさらに長くなる。移行ガイドによれば、temperaturetop_pといったサンプリングパラメータはデフォルト値以外を指定すると400エラーを返すが、SDKの型定義はまだそれらを受け入れるため、コードの型チェックは通ってしまい、APIだけが拒否するという事態になる。アシスタントのプレフィルもなくなった。シンキング内容はデフォルトで省略されるため、推論過程をユーザーにストリーミング表示している場合、出力が始まるまでの長い沈黙のように見えてしまう。

追加された側では、モデルと同時に2つのベータ機能がリリースされた。プロンプトキャッシュを無効にすることなく利用可能なツールを入れ替えられる会話途中でのツール変更と、サーバーサイドの自動フォールバックだ。マルチステップのエージェントを構築しているなら、前者は静かながら大きな意味を持つ。

これはエージェントの組み方そのものも変える。キャッシュミスを起こさずに実行途中でツールを入れ替えられるようになったことで、サブエージェントパターンのコストが下がる。これはClaude SkillsMCPツールを置き換えるものではなく、それらと並んで存在するものだ。

私のスキル対サブエージェントの解説では、それぞれがどんな場面で適したコンテナになるかを取り上げている。ファーストパーティのAPIではなくクラウドプロバイダー上で運用しているなら、Fastモードはファーストパーティ限定であることに注意してほしい。この点は私のBedrockとClaude Codeのノートで詳しく扱っている。

安全性、そして誰も触れないフォールバック

Anthropicのデプロイ前監査は、Opus 5をこれまでで最も整合性の高いモデルと評しており、全体的な不整合行動のスコアは2.3で、直近のモデルの中で最も低い。ASL-3の保護レベル下で提供されており、これはOpus 4.8と同じ水準だ。

私が最も気にかけている結果はプロンプトインジェクション耐性で、これは実際の顧客データにつながるエージェントを壊す元凶だからだ。間接的プロンプトインジェクション評価における攻撃成功率は5.5%から2.0%まで低下し、テストされたモデルの中で最良で、GPT-5.6 Solの20.0%を大きく引き離している。ブラウザ利用時の攻撃成功率は31.5%から3.70%まで下がり、さらにオートモードを有効にした場合は129シナリオ中0%まで下がった。エージェントにツールアクセスを与える人にとって、これはどんなコーディングスコアよりも重要だ。

見落とされがちな点がある。Opus 5は常にリクエストに答えるわけではない。

How a flagged request quietly falls back from Opus 5 to Opus 4.8 instead of returning an error
How a flagged request quietly falls back from Opus 5 to Opus 4.8 instead of returning an error

ローンチ記事によれば、Claude.aiやClaude Code、そしてClaude Coworkの中でも、サイバー分類器にフラグを立てられたリクエストはデフォルトでOpus 4.8にフォールバックし、同じ挙動はAPI上でも利用できる。エラーもなく、目立つシグナルもなく、ただ違うモデルが静かに答えているだけだ。Anthropicによれば、これらの分類器がFable 5と比べておよそ85%少ない頻度でしか介入しないと見込まれており、これは実質的な改善ではあるが、ベンチマークやデバッグをしているなら、トラフィックの一部が想定しているモデルではない可能性があると知っておくべきだ。

Opus 5が意図的に抑えられている領域もある。ローンチ記事によれば、サイバーセキュリティと生物学研究の両方でMythos 5の後塵を拝している。OSS-Fuzzでは脆弱性の発見能力はMythos 5とほぼ同等だが、それをエクスプロイトに変える能力では大きく遅れている。

OSS-Fuzz results showing Opus 5 near Mythos 5 at finding vulnerabilities and well behind on exploit development, as taken from Anthropic
OSS-Fuzz results showing Opus 5 near Mythos 5 at finding vulnerabilities and well behind on exploit development, as taken from Anthropic

アップグレードすべき人、すべきでない人

アップグレードすべきなのは、エージェントを運用している場合だ。長時間のマルチステップタスク、コーディングループ、リサーチパイプライン、コンピュータ操作など、モデルが20分間人の手を離れて動くようなあらゆる場面が対象になる。AutomationBenchとAA-Briefcaseの結果には僅差もなく、価格も変わっていない。使うアシスタントを比較検討しているなら、私のAIコーディングツールまとめGPT-5.3 Codexレビューで選択肢を取り上げており、より詳しい文脈はOpus 4.6の代替候補のリストにある。

現状維持すべきなのは、ワークロードが短く遅延に敏感なチャットである場合だ。68秒の初回トークンは設定でどうにかできるものではない。そこではSonnet 5が正解であり、Haikuも同様で、最大エフォート時のOpus 5は完了タスクあたりのコストがどちらよりも高くつく。

他を検討すべきなのは、検索レイヤーなしで最新の事実知識が必要な場合だ。Artificial AnalysisによればOpus 5はFable 5より事実知識のスコアが低く、ハルシネーションの数字がその先を物語っている。

Gemini 3と比較してみるのもいい。Kimi K3も見ておこう。あるいは決める前にMistralを検討するのもいい。

正直に言うべき一つのギャップがある。人間の選好データがまだ一切存在しないのだ。Opus 5はLMArenaのテキストリーダーボードに登場しておらず、現在のスナップショットはローンチ以前のものだ。特筆すべきは、Opus 4.8がIndexではトップ5のモデルであるにもかかわらず、そこでは13位に位置していることで、ベンチマーク上の知性と実際に人々が好むものは明らかに同じではないということだ。

サポートAIを構築するならこれが意味すること

すべてのフロンティアモデルのローンチは、私のチームの通話で同じ会話を引き起こす。技術寄りの人物が、ビジネスワークフロー自動化で26%のスコアを出す100万トークンあたり$5のモデルを見て、こう問いかける。それなら自分たちで組み上げればいいのに、なぜサポート製品にお金を払っているのか、と。

私はこれを真剣に受け止めている。実際にそれが起きるのを見てきたからだ。DTCビューティーブランドを含む何社かの技術志向のアカウントは、eeselを離れてClaude API上に直接構築する道を選んだ。これは私が最もよく遭遇する競合の選択肢であり、決して馬鹿げた計画でもない。

What a frontier model gives you versus what a live support desk still needs
What a frontier model gives you versus what a live support desk still needs

実際に起きがちなのは、モデルの部分が難しいのではなかった、ということだ。難しいのはその矢印の右側にあるすべてだ。ヘルプデスクに認証してチケットの同期を保つこと、ナレッジベースでの学習、ライブチケットに触れる前に過去のチケットに対して実行してみること、確信度に応じてルーティングし不確かなときは黙っていること、コンテキストを失わずに人間へハンドオフすること、そして事後にトークン請求を突き合わせるのではなく事前にチケットあたりのコストを把握しておくことだ。

このレビューの2つの数字を足し合わせると、ガードレールはあれば嬉しいものではなくなる。50%のハルシネーション率は、あらゆるAIカスタマーサービスチャットボットが評価される際の判定基準そのものであり、68秒の初回トークンは、ほとんどの人がチャットウィンドウで待ち続ける時間より長い。解決率がベンチマークスコアではなく成果で測られるのには理由があるし、実際に機能するヘルプデスクツールが、AIが実際に発言する前にその発言内容を確認できるものである理由もそこにある。

ある顧客が、内製か購入かという選択を私よりうまく言い表してくれた。

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Karel, GENERAL BYTES, from their case study

それが本当のトレードオフだ。Opus 5はエンジンを劇的に良く、そして安くしてくれるが、その周りにある12ヶ月分のメンテナンスについては何もしてくれない。そういう作業を楽しめるなら、自分で作ればいい。ただ成果だけが欲しいなら、やめておくべきだ。

eeselが適している理由

もし本当に欲しいのが、来四半期ではなく明日からチケットに答えてくれるOpusクラスの推論であるなら、eeselがまさにそれだ。すでに運用しているヘルプデスクに接続すれば、既存のマクロやドキュメント、そして過去のチケットで学習し、初日からドラフト作成や解決を始める。トークンの計算も、プロンプトインジェクション対策の強化も、フォールバックロジックの実装も必要ない。

The eesel AI dashboard showing live ticket activity across a connected helpdesk
The eesel AI dashboard showing live ticket activity across a connected helpdesk

懐疑的なエンジニアにまず見せたいのはシミュレーション機能だ。eeselが実際のチケットに一件でも答える前に、過去のチケット群に対して実行し、実際に何を答えていたかをそのまま確認できる。これは、あるモデルの自信がベンチマーク上のものではなく、自分たちのデータの上で本当に裏付けられているかを知る唯一の誠実な方法だ。その後は信頼度に基づくルーティングが何に答えて何を見送るかを決め、料金はトークン単位ではなくタスク単位で発生するため、おしゃべりなモデルに月末になって驚かされることもない。

念のため言っておくと、これは誰にでも合うわけではない。ユースケースがコードであるなら、Claude Codeを直接使うべきだ。しかしそれがサポートキューであり、新しいAPIキーの上にチケット偏向エスカレーションを四半期かけて作り直す計画があるなら、まずeeselを試してほしい。無料で始められる。

よくある質問

Claude Opus 5はOpus 4.8と比べて導入する価値があるか?
エージェント的なタスクにおいては、その通りだ。Opus 5はOpus 4.8のFrontier-Benchスコアを2倍以上に伸ばしながら、100万トークンあたり$5/$25という同じ価格を維持している。Anthropic自身の移行ノートも、破壊的変更は2点のみのドロップイン交換だとしている。ただし注意点として、ハルシネーション率は下がるどころか上昇しているため、顧客対応に使う場合はAIハルシネーションの防止策で説明しているガードレールが依然として必要になる。旧世代を使っているなら、Opus 4.6の解説でこのファミリーがどこまで進化したかが分かる。
Claude Opus 5の料金はいくらか?
Claude APIでは入力トークン100万あたり$5、出力トークン100万あたり$25で、Opus 4.8から変更はない。Batch APIでは50%割引が適用され、100万トークンのロングコンテキストでも追加料金は発生しない。Fastモードは両方の数値が2倍になる。コンシューマー向けアクセスは月額$20のProプランから月額$200のMaxまであり、Claude Codeの料金も同じプールから消費される。
Claude Opus 5はClaude Fable 5より優れているか?
純粋な性能では及ばないが、はるかに低いコストでそれに肉薄する。Opus 5はCursorBenchの最高スコアでFable 5に0.5%差まで迫りながら、タスクあたりのコストは半分で済む。エージェント的な知識作業では明確に上回ってもいる。ただしFable 5は事実知識の分野で依然として優位に立つ。Fable 5の解説記事で、フラッグシップモデルがどこで価格に見合う価値を発揮しているかを取り上げている。
Claude Opus 5をカスタマーサポートに使えるか?
サポート製品の背後にある推論エンジンとしてなら、使える。しかしライブチャットで直接回答を生成する用途には注意が必要だ。最大エフォート時の初回トークンまで68秒というのはチャットウィジェットにはあまりに遅く、ハルシネーション率も14ポイント上昇している。ほとんどのチームは、その上に専用に設計された製品を重ねる方が良い結果を得ており、それがまさにAIテクニカルサポートサポート自動化ツールが構築されている理由だ。
Claude Opus 5への移行で何が壊れるか?
主に2点ある。アダプティブシンキングがデフォルトでオンになるため、max_tokensを見直す必要がある。また、xhighまたはmaxエフォートでシンキングを無効化すると400エラーが返される。さらにWeb FetchとPriority TierもOpus 5では利用できない。新しいトークナイザーは同じテキストに対して最大35%多くのトークンをカウントするため、旧来の見積もりを流用せずコストを再計算すべきだ。エージェントに組み込む場合はモデル選択ガイドも併せて読むとよい。

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5:どちらを使うべきか?

Claude Opus 5はトークン単価がSonnet 5の1.7倍でも、一部のタスクではより安く完了する。価格、ベンチマーク、実際のタスク単価を正面から比較する。

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Claude Opus 5スタイルのコントロールストリップ上で、5つの推論エフォートダイヤルの1つを選んでいる人物のイラスト
Trending

Claude Opus 5とは何か、実際にどう使うか

Claude Opus 5は1つのモデルではなく、実質5つのモデルだ。スペック、料金を左右するeffortダイヤル、そして古いコードを壊す2つのAPI変更をわかりやすく解説する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5:実際にはどちらを使うべきか?

Fable 5の価格はOpus 5のちょうど2倍。両方のシステムカード、ドキュメント、そして独立系ベンチマークを読み込み、その追加の1ドルが何をもたらすのかを検証した。

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Image alt text
Guides

Claude Opus 4.6の料金体系と機能の概要

Claude Opus 4.6の料金体系を詳しく解説します。Anthropicの最新AIモデルのコスト、新機能、実用的なユースケースを詳しく分析します。

Rama Adi NugrahaRama Adi NugrahaFeb 6, 2026
Anthropic の最も強力な AI モデルである Claude Fable 5 で何ができるかを解説するガイドのための編集イラスト
Guides

Claude Fable 5 で何ができるのか?機能別の徹底ガイド

Claude Fable 5 で何ができるのか?数日間にわたり無人で稼働し、コードを書いてリリースし、100万トークンのドキュメントを読み、自分の成果を検証する。それが実務で何を意味するのかを解説します。

Riellvriany IndriawanRiellvriany IndriawanJun 17, 2026
モニターから手を伸ばしアプリのウィンドウや文書を操作するAIエージェントを、2人の同僚が見守っている様子。Metaのブランドカラーである青を基調としたイラスト
Trending

Meta Muse Spark 1.1:概要・料金・弱点を整理

Metaが初の有料モデルAPIとして100万トークンのコンテキストを持つエージェントモデルを$1.25/$4.25で提供開始。Muse Spark 1.1が実際に得意なことと、Metaがスライドから外したベンチマークを整理する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
多数の暗い経路の中から2つの光るエキスパート経路へトークンを振り分ける小型モデルチップのイラスト。Inkling-Small の解説用
Trending

Inkling-Small解説:2760億パラメータ、実働は120億

Inkling-Smallが実際に何なのか:Thinking Machines発の2760億/120億のオープンウェイトMoEモデル、ドキュメントとプロバイダーで食い違うコンテキストウィンドウ、100万トークンの実際のコスト、そしてサポートスタックにおける位置づけ。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
整然とした小型モデルのコアと、はるかに大きく絡み合ったコアを比較するイラスト。Inkling-Small のレビュー用
Trending

Inkling-Smallレビュー:サイズは4分の1、賢さはほぼそのまま

実際に試したInkling-Smallレビュー:サイズと価格が4分の1でありながら、コーディングでは975Bの親モデルを上回る。ただし事実性は崖から落ちるように急落する。このトレードオフが実際に何を意味するのかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Inklingの代替としてのAIモデル比較を表すエディトリアルイラスト
Trending

2026年版 Inklingの代替8選

Inklingはオープンで興味深いモデルだが、オープンウェイトとしては高価で、実行できる中で最も賢いモデルというわけでもない。実際に試す価値のある8つの代替モデルを、実際の価格とそれぞれの強みとともに紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める