
なぜこれほど安いモデルから離れる人がいるのか
Grok 4.6は弱いモデルではありません。Artificial Analysis Intelligence Indexで61点を獲得し、GPT-5.6 Solと同水準、Claude Fable 5にわずか1点差に迫りながら、Solの出力料金の5分の1しか請求しません。書類上は、乗り換える理由はほとんど存在しません。
しかし実際に本番環境で動かすと、4つの壁のいずれかにぶつかります。
20万トークンの崖はリクエスト全体を再価格設定します。 これが人々を最も驚かせるものです。xAIの料金ページは表の下部ではっきりとこう述べています:長文コンテキスト料金を持つモデルは、プロンプトがしきい値を超えると、リクエスト内のすべてのトークンに長文料金を課金します。つまり19.9万トークンのプロンプトは入力0.40ドルですが、20.1万トークンのプロンプトは0.398ドルにわずかな上乗せではなく、0.80ドルになります。宣伝されている50万トークンのコンテキストウィンドウは本物ですが、その最初の20万トークン分だけがマーケティングが示唆する価格になっています。料金表の全体はGrok 4.6の料金の内訳記事にあります。

課金項目は1つではなく7つあります。 ウェブ検索、X検索、コード実行は1,000回あたり5ドルです。ファイル添付検索は1,000回あたり10ドルです。コレクション検索、つまり検索(リトリーバル)は1,000回あたり2.50ドルです。さらにファイルストレージがGiBあたり1日0.025ドル、コレクションストレージが0.10ドル、ダウンロードがGiBあたり0.20ドルです。毎ターン検索を行うエージェントは、誰もが予算に組み込むトークンあたりの料金に加えて、トークン料金の隣でもう一つの請求書を走らせていることになります。
バッチは主力モデルをカバーしません。 xAIの20%バッチ割引はgrok-4.3と3つのgrok-4.20バリアントに適用されます。Grok 4.6、4.5、grok-build-0.1は何も対象になりません。夜間のバックフィルの場合、2世代前の4.3をバッチで使う方が、主力モデルの半額の料金で済みます。
自社のクラウド経由では購入できません。 Azure AI FoundryはGrok-4.3までしか対応しておらず、Bedrockも同じ世代までです。もし会社がクラウドマーケットプレイス経由でモデルを調達しているなら、Grok 4.6はそもそもメニューに存在せず、どんなベンチマークの主張もそれを変えません。より広範な比較はxAIの料金ガイドにあります。
「私たちは半分のコストでうまく機能するシステムに切り替えました。しかし長期的には自前で構築するつもりです。今のAIならそれがこれほど可能になっているので。」
これは私たちが失った中堅企業の顧客の言葉であり、この直感はベンダーが認める以上に的を射ていることが多いです。問題は常に、あなたが実際に解決しようとしている制約が何かということだけです。もしまだ前世代を使っているなら、代わりにGrok 4.5の代替から始めてください。
7つの代替モデル一覧
以下の料金は各ベンダー自身が公開している1Mトークンあたりのリスト価格で、2026年8月13日に確認済みです。最も重要な働きをしているのは4列目です。
| モデル | 入力 | 出力 | 長文プロンプトのペナルティ | キャッシュ読み取り | コンテキスト | バッチ | オープンウェイト | AWS / Azure / GCP対応 | AA指数 |
|---|---|---|---|---|---|---|---|---|---|
| Grok 4.6(現行) | 2.00ドル | 6.00ドル | 20万トークン以上ですべて2倍 | 0.50ドル | 50万 | なし | なし | なし | 61 |
| Claude Opus 5 | 5.00ドル | 25.00ドル | なし | 0.50ドル | 100万 | 50% | なし | あり | 63 |
| Claude Fable 5 | 10.00ドル | 50.00ドル | なし | 1.00ドル | 100万 | 50% | なし | あり | 62 |
| Claude Sonnet 5 | 2.00ドル | 10.00ドル | なし | 0.20ドル | 100万 | 50% | なし | あり | - |
| GPT-5.6 Sol | 5.00ドル | 30.00ドル | 20万以上で2倍 | 0.50ドル | 長文ティア | あり | なし | あり(Bedrock) | 61 |
| GPT-5.6 Terra | 2.00ドル | 12.00ドル | 20万以上で2倍 | 0.20ドル | 長文ティア | あり | なし | あり(Bedrock) | - |
| GPT-5.6 Luna | 0.20ドル | 1.20ドル | 20万以上で2倍 | 0.02ドル | 長文ティア | あり | なし | あり(Bedrock) | - |
| Gemini 3.6 Flash | 1.50ドル | 7.50ドル | 公開なし | 0.15ドル | 100万 | 50% | なし | あり(Vertex) | - |
| Kimi K3 | 3.00ドル | 15.00ドル | なし | 0.30ドル | 100万 | なし | あり | なし | 57 |
| Qwen3.8 Max | 2.00ドル | 6.00ドル | なし | 0.25ドル | 100万 | なし | まだなし | なし | 未掲載 |
| DeepSeek V4 Flash | 0.14ドル | 0.28ドル | なし | 0.0028ドル | 100万 | なし | あり(MIT) | なし | 最大努力時50 |
2つの行が特に注目に値します。Qwen3.8 MaxはGrok 4.6とまったく同じ料金、2ドルと6ドルを請求し、崖もなく、ウィンドウは2倍で、価格だけで見れば最も近いドロップイン代替と言えます。そしてClaude Sonnet 5はGrokの入力料金と一致させつつ、出力を6ドルではなく10ドル請求することで、その差額で平坦な100万トークンウィンドウを手に入れています。
これらのモデルをどう選んだか
ここに挙げたすべてのモデルは、今日一般提供されており、トークンあたりの価格が公開されており、通常のAPIキーでアクセス可能である必要がありました。これはプレビュー限定モデルや見積もりのみのモデルを除外します。その上で、比較サイトではなく各ベンダー自身の料金ページを読みました。なぜなら、長文コンテキストとツール課金のルールこそが、サードパーティのまとめで失われがちな詳細だからです。
ベンチマークによるランク付けはしていません。指数の5ポイント差はあなたのアーキテクチャを決めません。請求書の形と調達経路がそれを決めます。
1. Claude Opus 5 - 長いプロンプトが問題なら最適

概要。 Anthropicの主力モデルで、2026年7月24日に出荷され、現在Artificial Analysis Intelligence Indexで63点でトップに立っています。
Grok 4.6に勝る点。 長文コンテキストの挙動で、明白に勝っています。Anthropicの料金ドキュメントは、Claude 4.6以降が100万トークンのウィンドウ全体を標準料金でカバーすると明記しており、その帰結を説明しています:90万トークンのリクエストは9千トークンのリクエストと同じトークンあたり料金で課金されます。キャッシュとバッチの割引もそのウィンドウ全体に適用されます。BedrockとVertexでも動作し、調達の壁を一気に解決します。
勝らない点。 表示価格はGrokの入力の2.5倍、出力は約4倍で、実際の差はそれよりも広がります。コミュニティのテストでは、同じ努力レベルでOpus 5がOpus 4.8の約2倍の出力トークンを使うことが示され、AA指数でのタスクあたりの独立コスト測定ではGrok 4.6の0.84ドルに対して2.03ドルという結果でした。またターン数も大幅に多く、Opus 4.8の55回に対してタスクあたり103回です。
料金。 入力5.00ドル、キャッシュ読み取り0.50ドル、出力25.00ドル。バッチで半額。高速モードで2倍。Claude Opus 5の料金ページに全体の一覧があり、Opus 5とSonnet 5の比較ではより安価な兄弟モデルを扱っています。
結論。 プロンプトが実際に長い場合、クラウドマーケットプレイスが必要な場合、あるいはタスクの失敗がタスクのコスト増より高くつく場合に、正しい乗り換え先です。指数のリードがあなたのワークロードにそのまま当てはまると思い込む前に、Claude Opus 5のレビューを読んでください。
2. Claude Fable 5 - 評価表のトップを求めるなら最適
概要。 Anthropicの最も高価なモデルで、xAI自身が公開した比較表のほとんどの項目で実際にGrok 4.6を上回るモデルです。
Grok 4.6に勝る点。 xAIのローンチ表では、Fable 5がCursorBench、FrontierCode、APEX-Agents、APEX-SWE、AA指数を明確に獲得しています。これは、現行モデルの自社マーケティングにおいて10項目中5項目が競合に渡っているということです。Claudeシリーズの他のモデルと同じ平坦な100万トークンウィンドウを備えています。
勝らない点。 入力10ドル、出力50ドルはGrokの出力料金の8倍以上です。AA-BriefcaseとGDPVal-AAでは実際にGrok 4.6が勝っており、これはどちらの方向にもきれいな一掃ではありません。
料金。 入力10.00ドル、キャッシュ読み取り1.00ドル、出力50.00ドル、バッチ50%割引。Anthropicは同じ料金で限定提供のClaude Mythos 5もリストしています。
結論。 誤った回答のコストが高く、ボリュームが低い場合に頼るモデルです。ボリュームが高くなると計算はすぐに厳しくなり、これはOpus 5とFable 5の比較記事で詳しく扱っています。
3. GPT-5.6 - 1つのベンダーから3つの価格帯が欲しいなら最適

概要。 1つのファミリー、3つのティア。トップにSol、中間にTerra、下にLuna、すべて同じAPIサーフェスの下にあります。
Grok 4.6に勝る点。 SolはGrokが最も苦手とする2つの評価で勝ちます:DeepSWEは73%対65.9%、Terminal-Benchは34.6%対26%です。ワークロードが自律的なソフトウェアエンジニアリングであれば、それが乗り換えの決め手です。ティア構造により、SDKを変えずに安いターンをGPT-5.6 TerraやLunaに振り分けることもできます。
勝らない点。 同じ崖を抱えています。OpenAIの料金ページは3つのティアすべてに長文コンテキスト列を公開しており、Solは長いプロンプトで入力が5ドルから10ドルに、出力が30ドルから45ドルになります。GrokからGPT-5.6に乗り換えて20万トークンのしきい値から逃れようとしても、問題を解決するのではなく移動させるだけです。データレジデンシーのエンドポイントは2026年3月5日以降にリリースされたモデルに10%の上乗せを課し、優先処理は2026年7月30日にFastモードに改名されました。
料金。 Sol 5.00ドル/30.00ドル、Terra 2.00ドル/12.00ドル、Luna 0.20ドル/1.20ドル、すべて1Mトークンあたり。ファミリーの残りについてはGPT-5.6の料金の内訳記事を参照してください。
結論。 コーディングが仕事であれば、フロンティアモデル間で最良の同等の乗り換え先です。崖は同じ場所にあるので、コミットする前に自社のプロンプト長の分布に対してGPT-5.6 Solの料金を確認してください。GPT-5.6のレビューには評価の詳細があり、OpenAIとAnthropicの比較では両者のAPIサーフェスを比較しています。
4. Gemini 3.6 Flash - Googleでよければ最良のコスト対性能

概要。 2026年7月21日以降のGoogleの主力実働モデルで、フロンティア級の品質を持ちながら速度重視で位置づけられています。
Grok 4.6に勝る点。 入力は1.50ドルと安く、長文コンテキストのティアが公開されていない100万トークンのウィンドウ、プロトタイピング用の本物の無料ティア、そして2026年3月の知識カットオフを持っています。ネイティブでコンピュータ操作も提供し、Google自身の比較表でも長文コンテキストとコンピュータ操作の項目で勝っています。
勝らない点。 出力はGrokの6.00ドルに対して7.50ドルなので、出力の多い作業ではより高くなり、安くはなりません。検索グラウンディングは1,000リクエストあたり14ドルで、xAIの検索課金のほぼ3倍ですが、Googleは月5,000回分をGemini 3.xモデル間で共有する無料枠として含めています。無料ティアではコンテンツがGoogle製品の改善に使われますが、有料ティアでは使われません。
料金。 入力1.50ドル、キャッシュ読み取り0.15ドル、出力7.50ドル。バッチは半額。詳細はGemini 3.6 Flashの料金にあります。
結論。 プロンプトが長く出力が短い場合、つまりリトリーバル重視のサポート業務の大部分に当てはまる場合に、最も強いコストパフォーマンスの選択肢です。Gemini 3.6 Flashのレビューにはベンチマークの詳細があり、Gemini 3.6 Flashの概要では同時にリリースされた内容を扱っています。
5. DeepSeek V4 Flash - 料金そのものが問題なら最適

概要。 総パラメータ2,840億、アクティブパラメータ130億のミクスチャー・オブ・エキスパートモデルで、MITライセンスのオープンウェイトを持ち、2026年7月31日からパブリックベータで提供されています。
Grok 4.6に勝る点。 価格が桁違いに安く、入力0.14ドル、出力0.28ドルです。キャッシュヒットは0.0028ドルです。OpenAI形式のエンドポイントに加えてAnthropic形式のエンドポイントも提供しており、移行の手間を大幅に短縮できます。MITウェイトなので、ベンダー関係がうまくいかなくなった場合は全体を自社にインハウス化することもできます。
勝らない点。 安い設定と良い設定は別の実行です。DeepSeek自身のクロスモード表では、思考なしでHLEが8.1、最大努力時では34.8となっており、推論トークンは出力料金で課金されます。Artificial AnalysisはAA-Omniscienceの幻覚率84%を計測し、そのクラスの中央値10,000万トークンに対して、指数を実行するために2億1,000万の出力トークンを必要としました。幻覚の防止ガイドでは、それが顧客対応上どういう意味を持つかを扱っています。開始日未定のピーク時2倍のサーチャージも予告されています。
顧客データについては正確を期すべきです。DeepSeekの有料API利用規約はトレーニング利用を許可するのではなく沈黙しており、公開されたDPAやゼロ保持オプションもなく、データは中国の管轄下にあります。これは解決済みの問題ではなく、実際の調達上の懸念事項です。
料金。 キャッシュミス時の入力0.14ドル、キャッシュヒット時の入力0.0028ドル、出力0.28ドル。DeepSeek V4 Flashの料金を参照してください。
結論。 分類、ルーティング、要約など、ボリュームが多くリスクの低いターンには明白な選択肢です。DeepSeek V4 Flashのレビューでは、品質のギャップが実際にどこに現れるかを扱っています。
6. Kimi K3 - フロンティア規模で最良のオープンウェイトモデル

概要。 Moonshot AIの主力モデル:総パラメータ2.8兆、アクティブパラメータ1,040億、100万コンテキスト、ネイティブビジョン対応、2026年7月16日にローンチ。
Grok 4.6に勝る点。 オープンウェイトが実際に、約束された日付通りにリリースされ、safetensorsのインデックスがプレスリリースの外側から2.8兆という数字を裏付けています。ネイティブな画像・動画入力と、平坦な100万トークンウィンドウを備えています。
勝らない点。 入力3ドル、出力15ドルはどちらの側でもGrokを上回るため、これはコスト面での勝負ではありません。推論はどの努力レベルでもオフにできず、各レベルは同じ料金で課金されるため、reasoning_effortはコストではなくレイテンシの制御です。低努力レベルでは指数で47点、タスクあたり0.24ドルとなり、これはDeepSeek V4 Flashよりも弱く、かつ高価です。公開画像URLは受け付けられず、base64かファイルIDのみです。
料金。 入力3.00ドル、キャッシュヒット0.30ドル、出力15.00ドル。コンシューマー向けティアは無料から199ドルまであります。Kimi K3の料金を参照してください。
結論。 フロンティア規模のオープンウェイトとビジョンを1つのモデルで求め、その料金を許容できる場合に選んでください。Kimi K3のレビューにはGrokとのベンチマーク比較があり、FlashとK3の比較では2つのオープンウェイト選択肢の予算問題を解決しています。
7. Qwen3.8 Max - 最も近いドロップイン代替

概要。 Alibabaの主力モデルで、2026年8月2日から一般提供:総パラメータ2.4兆、アクティブパラメータ950億、100万コンテキスト。
Grok 4.6に勝る点。 入力2ドル、出力6ドルという表示価格が全く同一で、コンテキストウィンドウは2倍、長文プロンプトのペナルティもありません。LMArenaでは強力です:テキスト5位、ビジョン2位、WebDev4位。デフォルトでxhigh推論がオンになっており、思考過程も保持されます。
勝らない点。 Artificial Analysisのランキングにはまったく登場していないため、このモデルについて引用される「独立した知能スコア」はすべて実際には別のQwenモデルを説明しているものです。自動化された複合指標と人間の好みがここでは逆方向を指しており、単一の数字による判定はどちらの方向でも不誠実になります。ウェイトは一般提供時に約束されましたが、まだ公開されていません。バッチ割引もクラウドマーケットプレイス経由の入手方法もありません。
料金。 入力2.00ドル、暗黙のキャッシュ読み取り0.25ドル、出力6.00ドル、Qwen Cloudによる。詳細はQwen3.8 Maxの料金に、実際の入手経路はQwen3.8 Maxへのアクセス方法にあります。
結論。 20万トークンの崖だけが不満で、同じ予算枠を維持したい場合に行うべき乗り換えです。決定する前にQwen3.8 MaxとKimi K3の直接比較を確認してください。
カード上の数字と、実際に支払っている額の違い
何かを移行する前に知っておく価値のある、もう一つのレイヤーがあります。OpenRouterは顧客が実際に支払っている加重平均価格をリスト価格と並べて公開しており、Grok 4.6についてはこの2つが一致しません。

| 指標 | リスト価格 | OpenRouterでの実測値 |
|---|---|---|
| 100万あたりの入力 | 2.00ドル | 0.7748ドル |
| 100万あたりの出力 | 6.00ドル | 6.249ドル |
| プロバイダー | - | SpaceXAIとSpaceXAI(ZDR) |
| スループット(P50) | - | 53と55トークン/秒 |
| レイテンシ(P50) | - | 1.23秒と0.84秒 |
| 稼働率 | - | 99.96%と100% |
入力はリストより61%低くなっています。これはキャッシュが実際のトラフィックで膨大な仕事をしているためです。出力はリストよりわずかに高くなっています。これはそのトラフィックの一部が20万トークンを超え、12ドルを支払っているためです。どちらの効果も料金表上は見えず、どちらも数日前に前回確認したとき(入力が0.7448ドルだったとき)から動いています。
この教訓はGrokを超えて一般化できます。価格を理由に移行する前に、自社のキャッシュヒット率と自社のプロンプト長の分布を計算してください。表示価格が悪くてもキャッシュの実績が良いモデルは、実際には安くなることがあり、リスト価格だけで行う乗り換えは、分析を装った推測にすぎません。
サポートにとってモデルはそもそも重要なのか
このショートリストが示唆するほどではありません。これは、まさにそのショートリストに2,000語を費やしたばかりの記事で書くには気まずいことです。
Grok 4.6はマルチターンのカスタマーサービスベンチマークで最良の2モデルのうちの1つで、50.7%のスコアです。これをそのまま読んでください:利用可能な最良のモデルでさえ、これらの会話の半分で失敗しているのです。指数の2ポイント差のためにOpus 5に乗り換えても、この失敗パターンには触れません。エスカレーションフリーのアーキテクチャでも同様です。うまくいかない半分は、いつ止めるべきか、いつ人間に引き継ぐべきか、どのマクロを発動すべきか、そして絶対に約束してはいけないことは何かを知ることでうまくいかなくなります。そのどれもモデルの能力ではありません。
私はモデルの上位レイヤーを構築する立場からこれを言っています。eeselの顧客の中には、時折、生のフロンティアAPIの上に直接構築するために離れていく人もいて、それは技術系チームで見る最も一般的な競合の選択肢です。うまくいくこともあります。彼らを戻ってこさせるものは、たいていモデルの品質ではなく、検索の品質であることも稀です。それは2か月目なのです。
誰も、チケットトリアージのルール、ブランドボイスのドリフト、ナレッジベースの権限、確信度スコアのしきい値、そしてチャットボットのためのオンコールローテーションを所有したくはありません。
冒頭で触れた買い手、テスト日に200件のやり取りを消費したその人は、モデルに関する質問をしていたわけではありません。彼らは月9,000件でいくらかかるのか、そしてその回答が正しいものになるのかを尋ねていたのです。どちらの半分にもどんな料金表も答えてくれません。だからこそ、解決あたりのコストがモデル化する価値のある数字なのです。
サポートキューのためにGrok 4.6とその代替の間で選びますか?

これが生のAPIでは提供できない部分です。eeselは1件のライブチケットに回答する前に、あなたのエージェントを過去の自社チケットに対して再現し、あなたのデータで、ナレッジベースのギャップも含めて、実際にどう答えていたかを示します。こうして「どのモデルか」はベンチマーク上の議論ではなくなり、顧客が1つの回答を目にする前に、自社のキューで測定した解決率になります。ヘルプデスクを接続し、シミュレーションを確認してから、モデルを選んでください。eeselを試す、無料です。
結論
Grok 4.6にとどまるのは、プロンプトが余裕を持って20万トークン未満に収まり、クラウド調達で行き詰まっておらず、トラフィックがうまくキャッシュされる場合です。GPT-5.6 Solと指数で並びながら出力料金はその5分の1というのは強いポジションであり、ここに挙げたどのモデルも厳密には上回っていません。
Claude Opus 5に乗り換えるのは、長いプロンプト、BedrockまたはVertexでの調達、あるいは指数トップの品質が拘束的な制約である場合です。タスクあたりおよそ2.4倍のコストを払うことになります。
Qwen3.8 Maxに乗り換えるのは、崖だけが唯一の不満である場合です。同じ2ドルと6ドル、2倍のウィンドウ、ペナルティなし、その代わりに独立した審判スコアを犠牲にします。
DeepSeek V4 Flashに乗り換えるのは、トラフィックのうちボリュームが多くリスクの低い半分についてで、難しいターンは別の場所にルーティングしてください。0.14ドルと0.28ドルなら、ルーティングを間違えても許容できます。
GPT-5.6に乗り換えるのは、自律的なコーディングがワークロードである場合で、長文コンテキストの崖もついてくることを承知の上で。
そしてどれを選ぶにせよ、顧客に届く前に自社のチケットで測定してください。キューにとっての最良のAIエージェントは、指数のトップにあるものであることは滅多になく、ヘルプデスクレイヤーの方がモデルの乗り換えよりも解決率を動かします。全体像についてはカスタマーサービス向けAIを参照してください。
よくある質問
今、Grok 4.6の代替として最も良いモデルは何ですか?
Grok 4.6よりも安い代替はありますか?
なぜGrok 4.6の料金は長いプロンプトで2倍になるのですか?
コンテキストウィンドウが最も大きいGrok 4.6の代替はどれですか?
Grok 4.6はAWSやAzureで動かせますか?
Grok 4.6の代替モデルもウェブ検索に課金しますか?
カスタマーサポートにはGrok 4.6とClaude Opus 5のどちらが良いですか?
そもそもGrok 4.6から乗り換えるべきですか?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







