Grok 4.6レビュー:評価表の負けている行を読むとわかること

Alicia Kirana Utomo
執筆者

Alicia Kirana Utomo

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 12, 2026

専門家による検証済み
Grokのロゴマークと、カテゴリーごとに星評価がまちまちなレビュースコアカードを描いた手描きイラスト

まずワークロードを選び、それから判定を読む

私があなたに提供できる最も役立つものは、もう一つのベンチマーク表ではない。「これは自分に当てはまるのか」への答えだ。Grok 4.6の判定は、何を構築しているかによって完全に変わる。

Grok 4.5から実際に何が変わったか

xAIは2026年8月12日にGrok 4.6をリリースした。Grok 4.5からおよそ5週間後だ。5週間というのは速いペースであり、何が変わり何が変わらなかったかにそれが表れている。

トレーニングに関する説明は珍しく率直だ。xAIによれば、4.5よりも長い追加トレーニングフェーズを実行し、その後Grok 4.5自身を使って推論の強度やエージェント環境をまたいでSFTの軌跡を再生成し、モデルベースのチェックで悪いトレースをフィルタリングしたという。つまり前のモデルがこのモデルを教育したということであり、RL段階はエージェント的なタスク、すなわちカーネル最適化、Web開発、コンピュータ支援設計に向けられた。

スペックシートはほとんど変わっていない。grok-4.6のモデルページによれば、コンテキストは50万トークンのままで、モデルはテキストと画像を入力とし、テキストを出力する。関数呼び出し、構造化出力、推論に対応する。レート制限は毎秒150リクエスト、毎分5,000万トークンで、us-east-1us-west-2にまたがる。

変わったのはスコアだ。Artificial AnalysisはIntelligence Indexで61点としており、Grok 4.5から5ポイント、Grok 4.3から23ポイント上昇している。5週間で5ポイントというのは本物の世代的な飛躍であり、単なるバージョン番号の変更ではない。

評価表を正しく読む

スコアカードの上に3つの長い行が並ぶ中、2つの短い行を見つめる人物を描いたイラスト
スコアカードの上に3つの長い行が並ぶ中、2つの短い行を見つめる人物を描いたイラスト

以下はxAI自身の表だ。それを取り巻くブログ記事よりも、こちらの方が示唆に富んでいると思う。太字は各行の勝者を示す。

評価Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%58.8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%

目を引く点が4つある。

Grok 4.6はナレッジワーク系の行で勝ち、ソフトウェアエンジニアリング系の行で負けている。 GDPVal-AA、AA-Briefcase、Harvey LABは文句なしに獲得している。DeepSWEでは7.1ポイント、Terminal-Benchでは8.6ポイント負けている。エージェント型コーディングを掲げたタイトルの発表記事にしては、奇妙な形だ。

Harveyの数字は表の中で最も奇妙なセルだ。 Grok 4.6はこの法律分析ベンチマークで15.8%を記録し、GPT-5.6 Solの2.5%を大きく上回る。1つの評価で6倍もの差が出るというのは、たいていその評価が何か狭い範囲を測っているか、あるいは特定のモデルがその種のタスク向けに調整されていることを意味する。私ならこの1行だけを根拠に法律関連の製品を作ることはしないが、知っておく価値はある。

Terminal-Benchには2つのバージョン番号が並行して存在し、まったく一致しない。 xAIのカードはv3.0で26%と報告している。Artificial Analysisはv2.1で88.4%と報告し、トップクラスのモデルと同水準だとしている。どちらも本当だ。v3.0の方が難しい改訂版だ。バージョンを添えずに引用されたTerminal-Benchの数字を見かけたら、それは何も教えてくれない。

4.5から4.6への伸びが最も大きいのは、まさにエージェントが活躍する領域だ。 DeepSWEは54%から65.9%へ。APEX-Agentsは47.1%から57.5%へ。AA-Briefcaseは1313から1577へ。エージェント向けのRL段階が何をしたにせよ、多くのステップを踏むタスクに対しては効果があったということだ。

xAIのチャートには載っていないもう1つの表の行がある。Artificial Analysisは𝜏³-Bankingという、ツールを使うマルチターンのカスタマーサービス評価を測定しており、Grok 4.6は50.7%を記録している。これにより、51.3%のQwen3.8 Maxと並んで上位2位に入る。この数字については後で触れるが、上位2位というのは聞こえほどの意味を持たないことがわかる。

速度とコスト、主張ではなく実測で

ここがGrok 4.6が最も強い主張をできる部分であり、実際にはベンチマークの話ではない。

xAIの価格ページによれば、表示価格はGrok 4.5から変わっていない。入力100万トークンあたり$2.00、キャッシュ時$0.50、出力$6.00だ。プロンプトが20万トークンを超えると、すべての料金が$4.00 / $1.00 / $12.00に倍増する。世代をまたいで価格を据え置くのはフロンティアでは珍しく、Artificial Analysisもそれを明確に指摘している。

重要な比較対象は、インデックスで2ポイント以内にあるモデルだ。Claude Opus 5は$5/$25。GPT-5.6 Solは$5/$30。Grok 4.6は出力料金の5分の1でSolと肩を並べており、推論負荷の高い作業では出力料金がコストを支配する。

表示価格ではなく実測で見ると、OpenRouterのGrok 4.6ページでもこの構図は変わらない。

指標xAI標準xAI(ZDR)
実質支払い入力単価$0.7249/M$0.7812/M
実質支払い出力単価$6.125/M$6.116/M
キャッシュヒット率90.3%88.0%
スループット(3日平均)94 tok/s92 tok/s
レイテンシ(3日平均)0.62秒0.96秒
ツール呼び出しエラー率0.08%0.02%
構造化出力エラー率4.00%0.00%

このうち2つは注目に値する。実質入力単価は$2ではなく$0.72だ。これは実際のトラフィックの90%がキャッシュヒットするためだ。そして標準エンドポイントでの構造化出力エラー率4.00%と、ZDRエンドポイントでの0.00%という差は、丸め誤差ではなく実質的な運用上の差である。ツール呼び出し向けにJSONスキーマを固定しているなら、両方をテストすべきだ。

Artificial Analysisはインデックス全体の評価にかかった費用をGrok 4.6の評価に$1,068.47としており、タスクあたり$0.84になる。これはKimi K3とほぼ同じで、Kimi K3の方が知能はわずかに低い。評価中に生成したトークンは7,200万で、中央値の7,100万に対してやや冗長だが、目立って過剰というわけではない。

購入者にとって不利に動いた唯一の項目はキャッシュ入力で、コミュニティは数時間のうちにそれに気づいた。

Hacker News

"Seems the cache read pricing almost doubled from $0.30 in Grok 4.5 to $0.50 in Grok 4.6. In my experience in heavy coding sessions most pricing is just cache read and cache write like 80% of my token bill."

これは正当な指摘であり、計算も合っている。長時間のエージェントセッションを支配する項目が67%も上昇したことになる。それでも、GPT-5.6 Solと同水準のモデルにおけるキャッシュ読み込み$0.50という数字であり、依然として優れた取引の中での実質的な後退と呼ぶべきだろう。xAIの価格ガイドに価格体系の全体像がある。

実際に試している人たちの声

ベンチマークは1つの入力にすぎない。以下は実際の使用初日がどのようなものだったかだ。印象論ではなく、数字の入った報告を選んでいる。

見つけた中で最も有用なデータポイントは、同じコードベース上で同じ機能を使った直接の比較だ。

Hacker News

"Tested both DS v4 pro 0813 and Grok 4.6 (all from openrouter) on Codex cli. Worked on a same new feature development on my project. Deepseek 4 pro: Worked for 12m 02s, cost $0.12, has bug. Grok 4.6: Worked for 3m 18s, cost $1.41, no bug."

これは3.6倍速く、11.75倍高価で、動く結果と壊れた結果という差になる。1人による1回きりの試行なので、結論ではなく1つのシグナルとして扱うべきだが、DeepSeek V4 Flashのような安価なオープンウェイトモデルとの実際のトレードオフを、どんなインデックススコアよりもよく捉えている。

速度についてのテーマは繰り返し語られていた。

Hacker News

"I used to be a Claude user. Since trying Grok 4.5 and especially Grok 4.6, I don't want to go back to Claude any more (I have early access to 4.6). Grok is 3x+ faster than Claude and I can't tell the diff in engineering work quality. As an engineer, speed is important to me."

そしてあるエンジニアは、ワークフローの変化を的確に描写しており、こういう詳細こそがその報告を信頼できるものにする。

Hacker News

"My go-to workflow was Sol for planning and Grok for building. But my in my first tests with Grok 4.6, I found it quite good and I'll start using it for both; assuming it's as good at is shows at benchmarks it's unbeatable at cost/time."

懐疑的な声もあり、それは主にインデックスが正しいものを測っているのかどうかについてだった。

Hacker News

"I haven't tried so it's pure speculation based on benchmarks, but I'd assume Grok 4.6 is around Opus 4.8 in real world use, but clearly below Opus 5."

これは妥当な仮説だ。インデックス上のパリティと実際の使用におけるパリティは別の話であり、発表から1日後の正直な答えは、まだ誰も十分な使用時間を積んでいないというものだ。私が言えるのは、知能1単位あたりの価格という論点は、その議論の決着を待たずとも成り立つということだ。

発表記事が省いた行

サポートエージェントが、実線と、中に疑問符のある空白の2つの同じくらい自信満々な吹き出しを見上げているイラスト
サポートエージェントが、実線と、中に疑問符のある空白の2つの同じくらい自信満々な吹き出しを見上げているイラスト

xAIの評価表には10行あるが、そのどれも「間違えること」については扱っていない。Artificial Analysisはまさにそれを測定しており、もし私が発表記事を書いていたら、これらの数字をページの一番上に置いていただろう。

AA-Omniscience正答率:48.2%。非ハルシネーション率:65.7%。

2つ目の数字は注意して読んでほしい。「34%の確率でハルシネーションを起こす」と誤読しやすいからだ。これは正答でなかった回答のうち、ハルシネーションを避けられた割合を示している。つまりGrok 4.6は、何かを知らないとき、およそ3回に2回はそう表明し、残り1回では答えをでっち上げるということだ。このベンチマークが存在するのは、まさに「答えることを拒否する」ことは「自信満々に間違える」ことと同じように罰せられるべきではないからだ。

コーディングエージェントの場合、間違った答えはテストで捕まる。顧客向けのエージェントの場合、間違った答えはそのまま送信されてしまう。

私はeeselでAIエージェントを構築しており、まさにこの失敗パターンを本番環境で何度も見てきた。よく思い出す1件がある。Zendeskを使い、月間約200件のチケットを処理しながら2,000件へと成長しつつある、ヨーロッパの車両テレマティクスチームの例だ。彼らのエージェントが、データベースのどこにも存在しない車種のサポートを、あっけらかんと確約していたことが判明した。AIが故障していたわけではない。彼らのヘルプセンターには「すべてのモデルに対応しています」と書かれていて、モデルはそれをそのまま信じたのだ。彼らのエンジニアは最初の数週間を「試行錯誤」と要約しており、それは私がこれまで聞いた中で、生のモデルを本番投入することについての最も正直な表現だ。

これは、人間向けに書かれたナレッジベースに、65.7%の非ハルシネーション率が遭遇した結果だ。Grok 4.6のトレーニング過程には、それを直すものは何もない。それを直すのは、モデルが何から情報を引き出せるかを制限し、何を送信してよいかを管理することだ。

では、Grok 4.6をサポートキューの裏側に置くべきか?

もっともな疑問だ。正直な答えは2つの部分からなり、それぞれ異なる方向を指している。

エンジンとしては、正当に良い選択だ。 𝜏³-Bankingで50.7%というのは、Artificial Analysisがテストしたすべての中で上位2位に入る成績であり、𝜏³-Bankingは実際にサポートエージェントが行っていること、すなわちマルチターンでツールを使い、顧客と直接やり取りする作業に最も近い公開ベンチマークだ。ツール呼び出しエラー率0.08%、94 tok/sという数字は、会話の途中で止まってしまうことがないことを意味する。$2/$6という価格なら、サポートチケットの自動化のユニットエコノミクスは十分に良く見える。

製品としては、そうではない。 カスタマーサービスで上位2位に入るということは、その会話のおよそ半分しか解決できないということでもある。もう半分にこそ、本当の仕事がある。いつ止めるべきか、いつ人間に引き継ぐべきか、どのマクロを発動すべきか、どの注文照会を実行すべきか、そして絶対に約束してはいけないことは何か、といったことだ。そのどれもがモデルの能力ではない。それはエスカレーションの設計であり、検索の範囲であり、自分自身の履歴データに基づいて調整した信頼度スコアのしきい値だ。

これは、まさにこの理屈のせいで契約を失っているチームに所属する者として言っている。eeselの顧客の中には、フロンティアモデルのAPIの上に直接構築するために離れていった例が複数あり、それは技術系チームから見て最も一般的な競合の選択肢だ。うまくいくこともある。だが彼らを戻らせるのは、たいていモデルの品質ではなく、2ヶ月目の問題だ。誰もチケットのトリアージルール、ブランドボイスのドリフト、ナレッジベースの権限、チャットボットのためのオンコールローテーションを自ら抱えたくはないのだ。

今週モデルを選ぶのであれば、Grok 4.6はClaude Opus 5GPT-5.6と並んでショートリストに入る価値がある。だが顧客への回答方法をどうするかを決めるのであれば、モデルの選択はあなたが下す意思決定の中で最も面白みのないものだ。

2ヶ月目の問題なしに、フロンティアモデルをヘルプデスクに導入したいなら

タスク量、種類別のトリガーイベント、ツールごとの承認利用状況を示すeesel AIのレポート画面
タスク量、種類別のトリガーイベント、ツールごとの承認利用状況を示すeesel AIのレポート画面

これこそ、生のAPIでは提供できない部分だ。eeselは実際のチケットに1件でも回答する前に、あなた自身の過去のチケットに対してあなたのエージェントを再生し、実際のデータ、ナレッジベースとその欠落部分も含めて、どのような回答をしていたかを見せる。こうして65.7%という問いは、単なるベンチマークではなく、顧客がそれを目にする前にあなたの実際のキューで測定した実数へと変わる。ヘルプデスクを接続し、シミュレーションを見て、それから決めてほしい。eeselを試す、無料で。

判定

買うべき場合: ナレッジワーク、リサーチ、分析、ドキュメント中心のタスクで長時間のエージェントセッションを実行しており、コストが重要な場合。GDPVal-AAとAA-Briefcaseで表内トップのスコアを$2/$6で出し、Claude Opus 5の半分のターン数でタスクを完了するというのは、反論しづらい組み合わせだ。純粋な速度がワークフローを変えるという場合にも買う価値がある。複数のエンジニアが独立して3倍という数字を報告しており、ある人は同じタスクで3分18秒対12分2秒という数字を測定している。

避けるべき場合: ワークロードが自律的なソフトウェアエンジニアリングやターミナル中心の運用である場合。DeepSWEの65.9%対Solの73%、Terminal-Bench v3.0の26%対34.6%は僅差の判断ではなく、しかもこれらはxAI自身が公開した数字だ。

注意すべき場合: 顧客の前に出す場合。カスタマーサービスのベンチマークで最も優れた2つのモデルの1つでありながら、それでも会話の半分は失敗しており、その裏には65.7%の非ハルシネーション率がある。これはGrok固有の問題ではなく、あらゆるフロンティアモデルがこの行の何らかのバージョンを抱えている。だからこそヘルプデスクのレイヤーの方が、モデル選びより重要になる。

総合的な評価: 2026年8月時点でフロンティアの中では最良の価格対知能比を持つが、実際の強みはナレッジワークであるにもかかわらず、コーディングリリースとして誤ってラベル付けされている。5週間でインデックス5ポイント上昇、しかも価格は据え置き、というのが本筋であり、キャッシュ料金の値上がりがその注釈だ。

より充実した比較セットが欲しいなら、Grok 4.5の代替から始めて、次にClaude Opus 5レビューを読んでほしい。

トークンの計算そのものについては、xAIの価格の価格体系がこのレビューよりも詳しく掘り下げている。

よくある質問

Grok 4.6は良いモデルか?このGrok 4.6レビューの結論は?
本物のフロンティアモデルであり、現時点でトップクラスの中では価格対知能比が最も優れている。Artificial Analysis Intelligence Indexで61点を獲得し、GPT-5.6 Solと同水準ながら、価格は$2/$6とSolの$5/$30に対して大幅に安い。このGrok 4.6レビューでの注意点は、その勝ち星がナレッジワークに偏っており、純粋なソフトウェアエンジニアリングでは劣ることだ。サポートキューの裏側に置くモデルを選んでいるなら、カスタマーサービス向け最高のAIエージェントガイドの絞り込みロジックの方が、インデックススコアより重要になる。
Grok 4.6はGrok 4.5と比べてどうか?
Grok 4.5のリリースから約5週間で、Intelligence Indexが56から61へと5ポイント上昇した。特に伸びが大きいのはエージェント系の評価で、DeepSWEは54%から65.9%へ、APEX-Agentsは47.1%から57.5%へ、AA-Briefcaseは1313から1577へと上昇している。トークンの表示価格は変わっていない。旧モデルの数値についてはGrok 4.5レビューGrok 4.5の価格の内訳を参照してほしい。
Grok 4.6の利用コストはどれくらいか?
xAIの価格ページによると、入力トークン100万あたり$2.00、キャッシュ時は$0.50、出力は$6.00で、プロンプトが20万トークンを超えると$4/$1/$12に倍増する。Artificial Analysisはインデックス全体の評価に$1,068.47を費やしており、タスクあたり$0.84となる。価格体系の全体像はxAIの価格ガイドにあり、サポートチームにとって実際に重要なのは解決あたりのコストの方だ。
Grok 4.6はハルシネーションを起こすか?
起こす。そして発表記事はそのことに触れていない。Artificial Analysisの測定では、AA-Omniscienceの正答率は48.2%、非ハルシネーション率は65.7%で、正答でない回答のおよそ3分の1が「わからない」という告白ではなく、自信満々の作り話だということになる。だからこそ、生のモデルには検索範囲の境界線が必要になる。サポートにおけるハルシネーションの防止ガイドと、サポートエージェントを正直に保つ方法の記事が、いずれも対策を扱っている。
Grok 4.6はカスタマーサービスに向いているか?
数字の上では、マルチターンのカスタマーサービスでテストされたモデルの中で上位2位に入り、𝜏³-Bankingで50.7%を記録している。だがもう一度読んでほしい。上位2位ということは、それでも会話の半分は失敗しているということだ。Grok 4.6はまずまずのエンジンではあるが、それ単体でサポート製品になるわけではない。だからこそエスカレーションルールと信頼度スコアのゲートの方が、モデルの入れ替えより解決率に効いてくる。全体像はカスタマーサービス向けAIを参照してほしい。
Grok 4.6はどこで使えるか?
xAIのAPI、Grok Build、Cursorで同時にリリースされ、さらにOpenRouter、Vercel、Cloudflareでも使える。CursorとGrok Buildはどちらもローンチ週に含まれる利用枠を2倍にした。Cursorの価格Cursorのレビューのページがその側面を扱い、Grok BotはxAIの別のエージェント製品を扱っている。
Grok 4.6のコンテキストウィンドウはどれくらいか?
grok-4.6のモデルページによると50万トークンで、Grok 4.5から変わっていない。注意点は、リクエストが20万を超えるとすべての料金が倍増することで、実質的に表示価格で使えるコンテキストウィンドウは20万トークンということになる。長いチケットのスレッドがそこまで近づくことはめったにないが、プロンプトにナレッジベースを丸ごと詰め込む場合は話が別で、これは力任せの投入より検索を使うべき理由の一つになる。
Grok 4.6と比較すべき代替モデルは?
Claude Opus 5がインデックスで63とトップに立ち、Claude Fable 5は62、GPT-5.6 SolはGrokと同じ61で並ぶ。それより下ではKimi K3がタスクあたり$0.84で並び、Qwen3.8 Maxはカスタマーサービス向けツールでわずかに上回った。まずはGrok 4.5の代替、あるいはより広いxAIの代替一覧から始めてほしい。

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
コストとチェックリストを天秤にかけながら、モデルのスコアカードを比較する3人を描いた手描きのイラスト
Trending

Grok 4.6の代替7選:請求書の「形」で比較する

Grok 4.6は入力2ドル/出力6ドルと表示されているが、リクエストが20万トークンを超えるとすべての料金が2倍になる。実際に7つの代替モデルが何を請求しているのか、そしてどれがその崖を単に移動させるのではなく取り除いているのかを確認した。

Alicia Kirana UtomoAlicia Kirana UtomoAug 13, 2026
ノートパソコンの前にいるAIチームメイトを、チェックリストと虫眼鏡を持った2人の同僚がレビューしているイラスト。左側にGrokのマークがある
Trending

Grok Botレビュー: 早期ベータで実際に使える機能とは

Grok Botは、すべてのAIチームメイトにクラウドコンピュータと実際のログイン情報を与える。ドキュメントの全ページと最初の1週間のユーザー報告を読み込み、実際に機能する部分を検証した。

Rama Adi NugrahaRama Adi NugrahaAug 13, 2026
コストの層を積み上げたものを見直す2人のイラスト。上にシート、下にトークン消費、左にGrokのロゴ
Trending

Grok Botの料金2026年版:200ドルプランと上限のないメーター

Grok Botは月額200ドル、または1シートあたり120ドルで販売されているが、表示価格は入り口の料金にすぎない。ドキュメントによれば支出上限はまだ存在せず、メーターは週単位で動く。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
Grok 4.6の料金2026年版:すべてのレートと実際にチームが支払う金額
Trending

Grok 4.6の料金2026年版:すべてのレートと実際にチームが支払う金額

Grok 4.6は100万トークンあたり入力2.00ドル、出力6.00ドルの定価。OpenRouterが計測した実効入力価格は0.74ドルだ。請求書に載るすべての項目と、どの窓口から買うべきかを解説する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
デスクで2人の同僚と並んで働くAIチームメイトのイラスト。上部にはツールのアイコン、左にはGrokのロゴが描かれている
Trending

Grok Botとは何か:xAIの常時稼働AIチームメイトが実際にすること

Grok Botは、AIチームメイト一体一体に専用のクラウドコンピューターを与え、実際のツールにサインインさせる。その仕組み、料金、そして設計の破綻点を解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 12, 2026
音声の波形を挟んで話す開発者とサポートエージェントの線画イラスト、隣にGrokのロゴ
Trending

Grok Voice Think Fast 2.0の料金:$0.08/分の内訳

Grok Voice Think Fast 2.0は音声1分あたり$0.08で、1.0より60%高い。grok-voice-latestのエイリアスは本日切り替わるため、実際の通話ごとの計算を示す。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
音声の波形を挟んで話す開発者とサポートエージェントの線画イラスト、隣にGrokのロゴ
Trending

Grok Voice Think Fast 2.0の料金:$0.08/分の本当のコスト

Grok Voice Think Fast 2.0は音声1分あたり$0.08で、1.0より60%高い。grok-voice-latestのエイリアスは本日それに切り替わるため、実際の通話単位の計算を示す。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
ヘッドセットをつけたサポート担当者のラインイラストとGrokのロゴ、吹き出しの中の音声波形
Trending

Grok Voice Think Fast 2.0の変更点と料金まとめ

Grok Voice Think Fast 2.0はArtificial Analysisのspeech-to-speech指標で82.9%を記録し、応答は0.70秒。一方で1分あたりの料金は60%上がり、8月5日にはデフォルトのエイリアスもこちらに切り替わる。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Grokのロゴ、ベンチマークバー、価格タグを描いたGrok 4.5レビューを表すエディトリアルイラスト
Trending

Grok 4.5レビュー: ベンチマーク、価格、そして評価

xAIのGrok 4.5は7月8日に登場し、Intelligence Indexで4位、リーダーボードで最高のエージェント型ツール使用スコアを記録した。ここでは実際のレビュー、ベンチマーク、価格、そして誰が実際に使うべきかを解説する。

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める