Claude Opus 5の代替として優れた8つのモデル(2026年版)
Rama Adi Nugraha
Katelin Teen
最終更新 August 5, 2026

なぜみんなClaude Opus 5の先を見るのか
Opus 5は2026年7月24日に登場した強力なモデルだ。インデックスで1位を取り、長文コンテキストの追加料金なしで100万トークンのコンテキストウィンドウを持ち、Anthropicは価格をOpus 4.5から変わらぬ$5/$25に据え置いた。ここに何のスキャンダルもない。Claude Opus 5の解説記事では実際に何が登場したかを、Opus 5のレビューでは見出しの数字ほど華々しくない部分をそれぞれ扱っている。
人々が他に目を向ける理由は「悪いモデルだから」よりも狭く、3つの点に集約される。
価格表は変わらないのに、タスクあたりの請求額は上がった。 AAはOpus 5の最大エフォート時のインデックスタスクあたりコストを**$2.34**と測定している。前身モデルのOpus 4.8は同じ価格表で$2.03だ。トークン単価は同じなのに、消費トークン数が増えている。これが私の観測する中で最も多い不満であり、実際に正当な不満でもある。Opus 5の料金の内訳で、これが月々の請求額にどう影響するかをモデル化している。
遅い。 AAは出力の中央値を毎秒55.7トークンと計測している。Gemini 3.6 Flashは同じ計測基準で213.5であり、3.8倍速い。人が画面を見て待っている用途では、この差がそのまま製品体験になる。
重みが公開されていない。 Anthropicは一度もOpusのチェックポイントを公開しておらず、今後も公開する兆しはない。自社ハードウェア上で、自社リージョンで、自社の保持ルールの下でモデルを動かす必要があるなら、どのClaudeモデルもどんな価格でもその要件を満たせない。これはリストの中で唯一Anthropicが値引きでは解決できない理由であり、だからこそMITライセンスの2つのモデルがこのリストに入っている。
すでにこの移行を進めている人たちがいて、彼らが語る取引は無料の勝利ではなく正直な交換だ。
"I'd assume open weight models hosted on openrouter aren't being run at a loss. As such, I've been experimenting with them lately and results are pretty promising. Requires slightly more patience and handholding than just cranking Opus 5 in Claude Code, but for the cost saving it's definitely worth it."

このリストに含まれていないものに注目してほしい。それは能力だ。私が話す相手の中で、Opus 5が仕事をこなせないという理由で離れる人はいない。
この8つをどう選んだか
このようなまとめ記事の落とし穴は、物語に都合の良いベンチマークだけで順位を決めてしまうことだ。だから私はまず測定方法を固定し、そこから順位が自然に決まるようにした。
ここに挙げたすべてのモデルはArtificial Analysisが同じハーネス上でスコアを付けているため、ベンダー発表の数字ではなく比較可能な数字になっている。この記事の数字はすべて2026年8月5日に取得した。知性スコアに加えて、モデルが実際に請求する率ではなく、実際に消費した推論トークンに価格を付けるAAの「完了タスクあたりコスト」も採用した。この2つの数字は常に食い違い、その食い違いこそが興味深い部分だ。
各モデルは今日時点で呼び出し可能であり、価格が公開されていてウェイトリストがないことも条件にした。ライセンスも読んだ。これは2つがオープンウェイトで、そのうち一つには収益しきい値が付いているからだ。ベンダーとAAの数字が食い違う場合は、都合の良い方を選ばずにその旨を明記した。この理由で今回外したモデルの一つがQwen3.8-Maxで、人間の選好リーダーボードでは強いが、AAのボードには一切載っておらず、ここにある他のモデルと同じ軸で比較できない。
やっていないこともある。8モデルすべてに6ヶ月分の本番トラフィックを流すことはしていない。ドキュメント、価格表、独立系の測定結果を読み、その裏付けの範囲内で主張をとどめている。
Claude Opus 5の代替として優れた8モデル一覧
価格は100万トークンあたりの米ドル。スコア、速度、タスクあたりコストは2026年8月5日時点のArtificial Analysisの計測値。
| モデル | 最適な用途 | インデックス | タスク単価 | 速度(t/s) | 知識 | 入力 | 出力 | コンテキスト | 重み |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5(基準) | 首位のデフォルト | 60.7 | $2.34 | 55.7 | 31.3 | $5.00 | $25.00 | 1M | クローズド |
| GPT-5.6 Sol | ほぼ同スコアで請求額は半分 | 58.9 | $1.23 | 70.6 | 21.7 | $5.00 | $30.00 | 1M | クローズド |
| Kimi K3 | 長時間のエージェント実行 | 57.1 | $0.86 | 37.1 | 18.4 | $3.00 | $15.00 | 1,048,576 | オープン、独自ライセンス |
| Claude Fable 5 | 唯一知識で上回るモデル | 59.9 | $3.15 | 73.8 | 40.2 | $10.00 | $50.00 | 1M | クローズド |
| Claude Sonnet 5 | 安くAnthropicに留まる | 53.4 | $1.72 | 83.0 | 15.3 | $2.00 | $10.00 | 1M | クローズド |
| Gemini 3.6 Flash | 人が待つあらゆる用途 | 50.1 | $0.56 | 213.5 | 23.5 | $1.50 | $7.50 | 1M | クローズド |
| Grok 4.5 | 記憶力を落とさず安く | 53.8 | $0.36 | 61.3 | 26.4 | $2.00 | $6.00 | 500K | クローズド |
| GLM-5.2 | MITの高速オープンウェイト | 51.1 | $0.57 | 182.7 | 4.0 | $1.35 | $4.29 | 1M | MIT |
| DeepSeek V4 Flash | 価格の下限 | 49.9 | $0.03 | 122.7 | 未計測 | $0.14 | $0.28 | 1M | MIT |
「知識」はAA-Omniscience Indexで、-100から100の範囲でモデルが物事を本当に知っているのか、自信満々に作り話をしているだけなのかを測る。この列は二度読んでほしい。最高スコアでも40.2しかない。
1. GPT-5.6 Sol
最適な用途: 実測コストを約半分に抑えつつ、Opus 5にわずか2ポイント差まで迫る。
OpenAIのフラッグシップは2026年7月9日に一般提供が始まり、前身モデルと同じ価格、100万トークンあたり入力$5・出力$30を維持している。紙の上ではこちらの方が高価だ。しかし実際にはAAがタスクあたり$1.23と測定しており、Opus 5の$2.34より安い。理由は同じ仕事をより少ない推論トークンで終えるからだ。私のGPT-5.6の解説記事にファミリー全体の内訳があり、料金ページではその下にあるTerraとLunaの各ティアを扱っている。
Opus 5に勝る点。 タスク単価で47%勝る。出力速度は70.6トークン/秒対55.7。ミディアムエフォート時の初回トークン到達時間は6.1秒で、推論モデルとしては速い。
Opus 5に劣る点。 インデックススコアは58.9対60.7。より大きな差は知識信頼性で、AA-Omniscienceで21.7対31.3。長時間のエージェント作業を測るAA-Briefcaseでは、Solは最大エフォート時1502 Eloに対しOpus 5は最大時1719 Eloだ。ワークロードが単発の回答ではなく長時間のエージェント実行なら、この差を重く見るべきだ。
料金。 100万トークンあたり入力$5.00、出力$30.00、キャッシュヒット$0.50。コンテキストは1M。
評価。 このページで最も無難な乗り換え先。インデックス2ポイントと引き換えに請求額が半分になる取引は、多くのチームが取るべきものだが、私の評価ではなく自社の評価で知識のギャップを確認してからにしてほしい。
2. Kimi K3
最適な用途: コストを3分の1に抑えつつ長時間のエージェント作業をこなす。
Moonshot AIのフラッグシップは2026年7月16日にローンチした。総パラメータ2.8兆、アクティブパラメータ1,040億、コンテキストウィンドウ1,048,576トークン、そして予定通り2週間後に重みが公開された。AAはスコア57.1、より実用的な指標ではタスクあたり$0.86と評価している。私のKimi K3の概要記事でさらに詳しく解説しており、これが出発点であって最終的な選択肢でなければ専用の代替まとめ記事もある。
Opus 5に勝る点。 タスク単価で2.7倍安い。重みが公開されている点はどのClaudeモデルにもない特徴だ。AA-Briefcaseでは1541 Eloを記録し、GPT-5.6 Solの1502を上回る。つまり、安いモデルなら苦戦しそうな長時間のエージェント実行でこそ実力を発揮する。
Opus 5に劣る点。 弱点は出力速度で、毎秒37.1トークンとこのまとめの中で最も遅い。知識信頼性は18.4。どのエフォートレベルでも推論をオフにできず、エントリー支出ティアは1分あたり3リクエストという制限があり、これに引っかかる人が多い。
料金。 100万トークンあたり入力$3.00、キャッシュヒット$0.30、出力$15.00。バッチティアなし。
評価。 上位4モデルの中でスコア対コストが最も優れており、エージェントが秒単位ではなく分単位で動く用途に向く。ただし、人がカーソルを見つめているような場面には使わないことだ。
3. Claude Fable 5
最適な用途: Opus 5が最も苦手とする、まさにその一点。
Anthropicの最上位ティアは、このまとめの中で唯一Opus 5より知識信頼性で高いスコアを取るモデルだ。40.2対31.3でボード最高値。タスク単価は最も高い$3.15で、インデックススコアの59.9はOpus 5の60.7よりわずかに低い。つまり単純により大きなモデルというわけではない。Opus 5対Fable 5の比較記事で、それぞれが勝る場面を扱っている。
このペアについては実務者の報告が両方向に分かれており、0.8ポイント差というのはまさにこういうことだ。
"I also have preferred Opus 5 to Fable 5 for most things. Fable is way better than Opus 4.8 for me - it just produces much more complete work in one shot reliably. But when Opus 5 came out, I found that I was getting the same results as Fable, just faster and cheaper."
Opus 5に勝る点。 知識で8.9ポイント勝る。速度は73.8トークン/秒対55.7。同じ1Mコンテキスト、同じツール群、同じSDKなので、乗り換えはモデル文字列を変えるだけだ。
Opus 5に劣る点。 コストはタスクあたり1.35倍、価格表では2倍。インデックススコアは0.8ポイント差で誤差の範囲内だが、それで2倍払う前に知っておく価値はある。AA-Briefcaseでは、最大エフォート時にFable 5が1574 Elo、Opus 5が1719 Eloだ。
料金。 100万トークンあたり入力$10.00、出力$50.00、キャッシュヒット$1.00。
評価。 コスト重視の選択肢ではなく、汎用的なアップグレードでもない。自信満々な誤答が実際のお金の損失につながり、すでに検索精度の改善を試し尽くした場面で選ぶべきモデルだ。

4. Claude Sonnet 5
最適な用途: 条件付きで、Anthropicに留まりながら安く抑える。
Sonnet 5は分かりやすいファミリー内の下位モデルだ。100万トークンあたり入力$2・出力$10、コンテキスト1M、同じAPI。同時に、なぜ価格表が嘘をつくのかを示す最も分かりやすい例でもある。出力トークンはOpus 5より60%安い。しかし完了タスクあたりのコストはわずか27%安い、$1.72対$2.34にとどまる。理由はSonnet 5が同じ結果にたどり着くまでにはるかに多くのターンを要するからだ。私のOpus 5対Sonnet 5の記事にターン数の詳細がある。
Opus 5に勝る点。 出力速度は毎秒83.0トークンで、ここで最速のClaudeだ。価格表でも実測タスクでも安い。
Opus 5に劣る点。 インデックススコア53.4対60.7は、上位半分のモデルの中で最も大きな差だ。知識信頼性は15.3でOpus 5の半分以下。AA-Briefcaseでは1385 Elo対1719 Eloだ。
料金。 100万トークンあたり入力$2.00、出力$10.00、キャッシュヒット$0.20、2026年8月31日まで。9月1日からは$3.00と$15.00になる。今日のレートで組んだコストモデルは4週間足らずで期限切れになる。
評価。 実際の能力低下と引き換えのささやかな節約であり、その節約幅は9月にさらに縮む。大量かつ低リスクな用途には十分価値がある。モデル化するなら今日ではなく9月のレートで。
5. Gemini 3.6 Flash
最適な用途: 反対側で人が待っているあらゆる用途。
Googleの主力Flashモデルは2026年7月21日にローンチし、このまとめの中で毎秒213.5トークンという圧倒的な最速を誇る。これはOpus 5の3.8倍だ。タスク単価は$0.56。詳細はGemini 3.6 Flashの解説記事に、Google製品の範囲内で探しているなら別の代替まとめ記事にある。
Opus 5に勝る点。 速度は圧倒的。タスク単価は4.2倍安い。テキスト、画像、動画、音声、PDFを横断して一律の入力料金というのは珍しく、入力が雑多な場合に有用だ。知識信頼性23.5はこの価格帯としては立派で、GPT-5.6 Solの21.7より高い。
Opus 5に劣る点。 インデックススコア50.1は10.6ポイント低い。AA-Briefcaseでは962 Eloで、長時間のエージェント実行には向かない。出力は最大65,536トークンで、1Mの入力ウィンドウに対して頭打ちになる。
料金。 100万トークンあたり入力$1.50、出力$7.50、キャッシュヒット$0.15。バッチはその半額。
評価。 レイテンシが製品そのものである場面では正解になる。ライブチャット、オートコンプリート、ユーザーへのストリーミングが絡むあらゆる用途だ。無監督のエージェントが行う多段階作業には向かない。
6. Grok 4.5
最適な用途: 記憶力を落とさずに支出を削る。
xAIのモデルはこのまとめの中で静かな価値株だ。インデックスで53.8を記録し、タスクあたり$0.36でOpus 5より6.4倍安い。知識信頼性26.4はこのページ3番目に高く、Gemini 3.6 Flash、GPT-5.6 Sol、そしてこのまとめの他のどのオープンウェイトモデルよりも上だ。私のGrok 4.5の概要記事でより広い視点を扱っている。
Opus 5に勝る点。 タスク単価6.4倍。出力速度は毎秒61.3トークン対55.7。入力$2・出力$6という価格表は、クローズドモデルの中では比較的安い部類に入る。
Opus 5に劣る点。 インデックススコア53.8は6.9ポイント低い。コンテキストは500Kが上限で、これはここにある他モデルの半分であり、リポジトリ全体や長いチケット履歴を渡す用途では重要だ。AA-Briefcaseでは1314 Eloを記録。
料金。 100万トークンあたり入力$2.00、出力$6.00、キャッシュヒット$0.30。
評価。 サポート業務で最も重要な軸において過小評価されている。ワンティア下げてモデルが事実をでっち上げないか心配なら、まず試すべきはこれだ。
7. GLM-5.2
最適な用途: 法務担当が文句を言わないライセンスの、高速なオープンウェイト。
Z.aiのフラッグシップはMITライセンスで、インデックスで51.1を記録し、Gemini 3.6 Flashに次ぐ毎秒182.7トークンで動く。タスク単価$0.57はOpus 5より4.1倍安い。デプロイに関する詳細は私のGLM-5.2 for businessの記事にある。
Opus 5に勝る点。 MITによるオープンウェイトは商用利用として最もクリーンなライセンスであり、どのClaudeモデルも満たせない要件だ。速度は3.3倍。コストは4.1倍。フルの1Mコンテキスト。
Opus 5に劣る点。 知識信頼性は4.0とこのまとめで最も低いスコアで、Opus 5の31.3を大きく下回る。インデックススコアは9.6ポイント低い。出力は128Kが上限。
料金。 ホスト型APIで100万トークンあたり入力$1.35、出力$4.29、キャッシュヒット$0.23。セルフホスティングはライセンス費用こそかからないがハードウェアコストがかさむ。私のオープンソースAIエージェントのまとめで実際に何が必要かを扱っている。
評価。 速度と寛容なライセンスを求めるなら最良のオープンウェイトの選択肢だ。ただしその知識スコアはハードな制約として扱うこと。これは質問をするモデルではなく、資料を渡すためのモデルだ。
8. DeepSeek V4 Flash
最適な用途: 価格の底値。
0731ビルドは2026年7月31日にパブリックベータに入り、ボード上で桁違いに安い本格的なモデルだ。AAはスコア49.9、Opus 5より10ポイント低く、タスクあたり$0.03と評価している。重みはMITでおよそ167GB、コミュニティによる量子化版が57種類公開されている。私のDeepSeek V4 Flashの解説記事と料金の内訳で各モードを扱っている。
Opus 5に勝る点。 価格はタスクあたり86倍安い。MITの重み。1Mコンテキストに対し384Kの出力上限はここで最大。出力速度は毎秒122.7トークンでOpus 5の2倍以上。キャッシュヒットは100万トークンあたり$0.0028。
Opus 5に劣る点。 インデックススコアは10.8ポイント低く、設定を誤るとその差はさらに広がる。DeepSeek自身の表によれば、Flashは思考なしでHLE 8.1、最大エフォートで34.8だ。同じ重みでも実行によって結果が大きく変わる。AAは0731ビルドをOmniscienceでまだスコア化しておらず、知識信頼性は良好ではなく未計測として扱うべきだ。開始時期未定のまま、ピーク時2倍のサーチャージが発表されている。
料金。 100万トークンあたり入力$0.14、キャッシュヒット$0.0028、出力$0.28。
評価。 コストでは無敵であり、注意すべき点は品質ではない。DeepSeekの有料API利用規約は学習利用について保護的というより沈黙しており、公開されたDPAやゼロ保持オプションはなく、データは中国の法律の下にある。これはエンジニアリングの前に調達の問題だ。
これらのチャートが測るものと、あなたのユーザーが尋ねることの間にあるギャップ
Anthropicはローンチ時に自社のコスト対スコアチャートを公開しており、どのベンチマークでも一貫した物語を語っている。フロンティアの傾斜は緩やかで、その最後の部分を登るために急激にコストがかかる、というものだ。

ここにあるどれも測っていないことがある。このページのすべての評価は汎用的な能力をテストしている。あなたの企業プランにSSOが含まれていることや、3月にノルウェーへの配送をやめたことをモデルが知っているかどうかは、一つもテストしていない。
だからこそ「もっと賢いモデルを使えばいい」という条件反射は、実際に試した人々をがっかりさせ続ける。
"At work I am sitting on a small pile of incomplete/wrong/missing-the-point bug reports right now, all generated by Opus 5 on High effort. Even under good conditions, LLMs are still wrong quite a lot, and confidently so."
私はこのパターンが繰り返されるのを何度も見てきた。あるオペレーターは、シフトの最中にエージェントの指示にこう書き込んだ。
"stop promising customers things we cant do. we cannot guarantee this customer's order to them by friday"
これは実際にあった修正で、ECサイトのサポートマネージャーがAIが顧客への配送日を過剰に約束していることに気づいた場面だ。そしてこの記事で引用する価値がある理由はここにある。このページにあるどのモデル切り替えも、この問題を直さない。モデルは混乱していたわけではない。流暢で、自信満々で、そして自社の業務にある事実を知らなかっただけだ。ウェイトの中にはなかった。
私が同席したもう一つのチーム、月間約200件のチケットをZendeskで処理するデンマークの車両テレマティクス系サポートデスクは、逆の方向から同じ壁にぶつかった。彼らのボットは、データベースに存在しない自動車ブランドへの対応を、平然と確約していた。理由はヘルプセンターの記事に「全モデル対応」と書かれていたからだ。モデルはドキュメントを正しく読んでいた。ドキュメントの方が間違っていた。知性インデックスで50から60に上げても、これには何の効果もない。これが、モデルではなくナレッジベースこそをテスト対象として扱うべきだという主張の根拠だ。
これこそ、サポート業務においてAA-Omniscienceの列がインデックスの列よりも重要な理由であり、そこでの最高スコアであるFable 5の40.2でさえ解決策にはならない理由だ。修正は構造的なものだ。自社ドキュメントに回答を根拠づけ、出典を示し、確信度が低いときは答えを控える。それがAIエスカレーション管理の本質であり、どのモデルを選ぶかという判断の一段上に位置する。引き継ぎそのものの仕組みについてはAIエージェントのハンドオフのベストプラクティスで扱っている。
サポートキュー向けにモデルを選んでいるなら、結果を左右するのは検索精度、確信度ゲート、そして本番前のテスト方法だ。テストの側面はAIサポート品質保証が扱っている。
グラウンディングの側面については、ハルシネーション防止から始めてほしい。この層こそが、下敷きのモデルがどれだけ優れていても、本物のエージェントとルールベースのチャットボットを分けるものでもある。
Try eesel
Opus 5とこの8つのどちらを選ぶかは実際に重要な決断であり、上の表がその決断を少しでも早めてくれればと思う。ただしそれは、あなたのAIサポートが実際にうまく機能するかどうかを決める決断ではない。
eeselはモデルの一段上に位置する。チームがすでに解決したチケットから学び、あらゆる回答をヘルプセンターと社内ドキュメントに根拠づけ、確信が持てないものについては推測せずに黙る。実際の顧客に見せる前に、過去数千件のチケットに対して走らせてテストでき、これが実際の解決率を教えてくれる唯一のテストだ。Zendesk、Freshdesk、Gorgias、HubSpotなどに数分で接続でき、料金はシート単位ではなく解決チケット単位なので、請求額が実際の仕事量に連動する。多くのチームはまずTier-1の対応削減にeeselを充て、そこがカスタマーサービスの自動化の投資回収が最も早い領域だ。
すでにモデルをタスク単価で比較しているなら、同じ計算を一段上に適用したものが解決単位あたりのコストであり、経理チームが尋ねてくる数字はこれだ。より詳しい内訳はAIカスタマーサービスのコストにあり、自律化よりもまずドラフト作成から始めたいならサポート向けAIコパイロットがリスクの低い入り口になる。

**Try eesel**は無料で試すか、デモを予約すれば、まず自社のチケット履歴に対して実際に動かしてみせる。
私の結論
三行にまとめるとこうなる。
請求額が理由でここに来たなら、GPT-5.6 Solをデフォルトにするべきだ。インデックスで1.8ポイント下がる代わりにタスク単価が47%安くなる、このページで最良の取引であり、出力単価の高さのせいで一見間違った選択に見えるが、実測を確認すればそうではないと分かる。
理由がレイテンシならGemini 3.6 Flashをデフォルトに、請求額そのものを消し去りたいならDeepSeek V4 Flashをデフォルトにするべきだ。先にDeepSeekのデータ規約を読んでほしい。その沈黙こそが実際のコストだからだ。
そしてOpus 5を探し始めた理由が「何か間違えたから」なら、Opus 5に留まるべきだ。モデルの切り替えは、最高スコアが40点しかない100点満点の尺度の上を数ポイント動くだけにすぎない。自社ドキュメントに回答を根拠づけることは、それよりはるかに大きく動かし、しかもどのモデルを最終的に使うことになっても効果がある。より広いファミリーを見たいなら私のClaudeの代替まとめを、実際に仕事をこなす層について知りたいならカスタマーサービス向けAIを参照してほしい。
よくある質問
Claude Opus 5の代替として最適なモデルは?
Claude Opus 5より安い代替はある?
Claude Opus 5と代替モデルの価格差はどれくらい?
カスタマーサポート向けに最適なClaude Opus 5の代替は?
オープンウェイトのClaude Opus 5代替はある?
2026年時点でClaude Opus 5は今でも最高のモデル?
アプリを書き直さずにClaude Opus 5から乗り換えられる?
導入前にClaude Opus 5の代替モデルをどうテストすればいい?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








