
実際に検証したこと、検証できなかったこと
ここでの根拠について正直に述べたい。「テストした」という言葉は、ボイスモデルに関してはかなり軽く使われがちだからだ。
丁寧に読み込んだもの:xAIのspeech-to-speechドキュメントを最初から最後まで、それに加えて公開されている制限が書かれたモデルカード、そして料金ページの料金表。
さらに、発表記事と、他の27モデルと比較評価した独立系のArtificial Analysisの検証。その上で、実際にこれを使って構築している人々の声も読んだ。
言えないこと:実際の電話線上で本番の通話を千件流したわけではない。xAI以外でそれをやったのは、Starlinkを除けば誰もいない。だからこの記事が負荷時の挙動について何か述べる場合、それは実戦談ではなく公開された制限値に基づくものであり、どちらに基づくかは都度明記する。
私はeeselで生業としてAIエージェントを構築しており、その大半はモデルと実際の顧客対応の間に位置する部分だ。これがここでの視点となる。問うべきは「デモとして印象的か」ではない。「火曜の午後、40人が同時に電話してきたら何が壊れるか」だ。
スコアカード
詳細に入る前に、全体の評価を一箇所にまとめておく。
| 項目 | スコア | 私の評価 |
|---|---|---|
| 会話の流暢さ | 95.1% Full Duplex Bench | 目玉の改善点。1.0は77.8%だった。割り込みと重なりはもう弱点ではない。 |
| 素の知能 | 82.9% AA指標 | 総合2位で、84.1%のQwenに次ぐ。決定的な差にはならない程度の近さ。 |
| エージェント的な振る舞い | 56.5% τ-voice | 表内で最高だが、54.6%のQwenとの差はわずか1.9ポイント。 |
| レイテンシ | 最初の音声まで0.70秒 | 3番目の速さ。電話の相手が気づかないほど十分速い。 |
| 文字起こし | 1.0の1.4倍 | 本物のアップグレードであり、xAIが最も過小評価していた点。 |
| API設計 | OpenAI Realtimeとワイヤーレベルで互換 | プロダクトで最も優れた部分。拡張機能は、まず電話エージェントを出荷した人が作ったかのように読める。 |
| コストの予測可能性 | 実測4.80ドル/時、公表値4.80ドル/時 | 分単位のフラットな課金。珍しく、見た目以上に価値がある。 |
| スケールの余裕 | 10並行セッション | 問題点。上記すべてがこの一行によって台無しになる。 |
| デプロイの選択肢 | us-east-1のみ | EUリージョンなし。多くのチームにとってはこれで話が終わる。 |
**結論:**モデルには強い推薦を、プラットフォームには「まず自分の量を確認せよ」を。これは2つの異なるプロダクトであり、レビューは前者だけを評価する傾向がある。
優れている点
目立った点は4つあり、そのうちxAIが発表時に打ち出した数字は1つだけだ。まとめると、これらは特定の種類のモデルを描き出している。利用可能な中で最も賢いわけではないが、電話線に十分な速さで応答しながら鋭さを保つモデルだ。
割り込みはもう弱点にならない
1.0からの単一最大の変化はFull Duplex Benchであり、これはモデルが実際の会話の混沌とした部分をどう処理するかを測定する:割り込み、重なり、相づち、誰かが文の途中で考えを変えるといった状況だ。1.0は77.8%だった。2.0は**95.1%**を記録する。
これは、人が我慢できるボイスエージェントと、それが機械だと忘れてしまうほどのボイスエージェントを分ける数字だ。通話録音を聞いたことがある人なら、この特有の失敗パターンを知っているはずだ:発言者が言い直そうとし始め、ボットがその上に話し続け、発言者はより大きな声で繰り返すか、人間に代わってもらうよう要求する。これは顧客が諦める原因になるチャットボットの問題のリストの上位に常に位置し、真剣な導入におけるハンドオフのパターンは主にその瞬間を捉えるために存在する。
公平を期して言うと:これはGrokがOpenAIに負けている唯一の項目だ。GPT-Realtime-2.1 Highは95.7%を記録する。0.6ポイントの差は電話の相手が知覚することは決してないだろうが、発表時の表がそれをわざわざ言及することもないだろう。
エージェント的スコアが本当の見出しだ
τ-voiceは、モデルが音声で実際にタスクを完了できるかを測る。単にそれをやっているように聞こえるだけではない。注文を確認し、ポリシーをチェックし、関数を呼び出して正しい答えを返す。Grok Voice Think Fast 2.0はここで**56.5%**を記録し、Artificial Analysisの表全体で最高の数字だ。

これは実際のエージェントを構築する人にとって、全体指標よりも重要だ。というのも、ツールを信頼して使えないボイスエージェントは、非常に高価なFAQ読み上げ機にすぎないからだ。これはテキストにおけるAIエージェントとAIチャットボットを分ける区別と同じであり、有用なAIエージェントの実例が常に、記事を読み上げるだけでなく実際のシステムに触れるものである理由と同じだ。
正直な留意点:Qwen Audio 3.0 Realtime Plusは同じベンチマークで54.6%だ。つまりGrokの優位はわずか1.9ポイントであり、それは謳われているような大きな差ではない。OpenAIの最高値45.7%との差はもっと大きく、そこから「10ポイント差」という表現が来ているが、Qwenはすぐそこにいる。
速度と知性の組み合わせ
最初の音声までは0.70秒で、1.0の1.25秒から短縮された。Deepslate Opalは0.44秒でより速く、Gemini Flashの一種も0.63秒で速いため、Grokは3位につける。しかし全体指標でGrokを上回るQwenは、最初の音声まで4.02秒かかる。電話線上でそれは、相手が「もしもし?」と言いたくなるほど長い死んだ空白だ。
その取り引きこそが実際のプロダクトなのだ。Hacker Newsの誰かが、発表記事より上手くそれを言い表していた。
"Grok voiceは最高のボイスAIアシスタントで、しかも差は圧倒的だ。
速度と知性のトレードオフがちょうどいい。一方GPT voiceは、人間らしく聞こえようと頑張っているにもかかわらず、うぬぼれた不自然な印象を与える。"
xAIはまた、推論トークンが前世代のP50の0.4倍で動作すると述べており、これがどうやって思考量を減らすことなく、より速くなおより賢くなったかを説明している。
文字起こしは過小評価されている部分だ
発表記事に埋もれている情報:文字起こしの精度は1.0の1.4倍で、24言語にわたってDeepgram Nova 3やElevenLabs Scribe v2より1.5〜2.0倍優れている。ノイズの多い音声や電話音声では、その差はおよそ10倍と主張されている。
電話音声こそ、通常文字起こしが崩れる場面だ。そしてそれは、まさにサポート電話が一日中扱う種類の音声である。これをElevenLabsや専門のspeech-to-textベンダーと比較検討しているなら、そのノイズ環境下の数字は、会話系のベンチマークよりも重く見るべきだ。これはまた、OpenAIの文字起こしエンドポイントが、主に慣性によってデフォルトの選択肢となっていた軸でもある。
2026年7月に21のボイスが追加されたことで、現在ロースターには26のボイスが揃っており、そのいずれもクローンしたボイスIDに置き換えることができる。ボットを各チャネルで自社らしい声に保つために苦労した経験があるなら、ブランドボイスの問題は出力が音声だからといって消えてなくなるわけではない。
ベンチマーク表が過大評価している部分
発表時のフレーミングが語らない3つのこと。
82.9%は2位だ。Qwen Audio 3.0 Realtime Plusは84.1%だ。Grokはこれと競争力があり、大きな差で速いが、「最先端」という言葉はマーケティング文書の中でかなりの仕事をしている。QwenのモデルファミリーやAlibabaの料金設定を最近見た人なら、彼らが本気で出荷し続けていることを知っているだろう。
**xAIの2つのτ-voiceの数字を相互比較してはいけない。**7月1日のVoice Agent Builderの記事は、Think Fast 1.0の独自のτ-voiceテストで67.3%と報告している。Artificial Analysisは同じモデルを52.1%と評価している。ハーネスが異なり、スケールも異なる。この2つの数字を「どれだけ改善したか」というグラフに積み上げる者は、何も比較していないことになる。同じ注意がVoice Agent Builderの料金に載っている数字にも当てはまり、そちらはまだ旧料金を引用している。
**Starlinkの数字は1.0のものだ。**広く引用されている20%の販売コンバージョンと70%の自律的解決率は、28個のツールが接続された+1 888 GO STARLINKの電話線から得られたもので、Think Fast 1.0の結果だ。2.0については、xAIは同じ電話線でのA/Bテストがコンバージョンとコンテインメントで「大幅な増加」を示したと述べているが、数字は公表していない。また、これは同じオーナーシップ構造内での自社導入であり、代表的な事例というより最良の事例だと言える。
その上に構築する:APIが良い部分だ
ここではドキュメントが弱点だと予想していたが、結果は正反対だった。設計に関して言えば、これは私が読んだ中で最も配慮の行き届いたリアルタイムボイスAPIだ。

wss://api.x.ai/v1/realtimeでOpenAI Realtimeとワイヤーレベルで互換性があるため、既存のアプリがある場合、移行はベースURLとキーの変更だけで済む。OpenAIのSDKをそのまま使ってhttps://api.x.ai/v1を指すようにすることも可能だ。引き継がれないものが4つある:conversation.item.done、rate_limits.updated、そして大半のoutput_audio_buffer.*イベントは発行されない。また、...input_audio_transcription.deltaは.updatedに名前が変わり、さらに累積的になるため、デルタを追記していた場合、文字起こし表示が黙って壊れることになる。
面白くなるのはxAI独自の拡張機能で、これらは電話エージェントを出荷し、痛い目に遭った経験のある人々が書いたかのように読める。
- **
force_message**はモデルを一切介さず、ハードコードされた文をTTSで発話する。interruptible: falseを設定すると、それが終わるまで発言者の音声は破棄される。これはコンプライアンス上の開示義務の問題を、システムプロンプトが持ってくれることを祈るのではなく、正しく解決する方法だ。 - **
replace**はTTSの前に適用される発音マップであり、音声は「Acme Mobull」と発話しつつ、文字起こしは「Acme Mobile」のままにできる。マッチングは大文字小文字を区別せず、単語全体の境界を尊重し、最長一致が優先される。 - **
resumption**はconversation_idごとにターンをキャッシュし、再接続時に再生する。デフォルトではオフになっており、両者ともオプトインが必要で、履歴は30分間非アクティブだと失効する。 - **
keyterms**は、最大100件、各50文字までの業界用語に向けて文字起こしを偏らせるもので、セッション中に更新可能だ。SKUやプラン名で溢れるサポート電話にとって、これは使える文字起こしと使い物にならない文字起こしの分かれ道だ。 - **
idle_timeout_ms**は各応答の後に再セットされるため、エージェントは黙り込んでいる発言者に対して、座って待つのではなく繰り返し呼びかけることができる。
reasoning.effortパラメータは正確に2つの値しか取らない:"high"(デフォルト)と"none"だ。中間の設定はなく、これは実際のギャップだ。以前のGrok voiceのリリースについて、Hacker Newsで誰かがまさにこの点を指摘していた。
"Grokのボイスモデルはシンキングモデルでもある。他のボイスモデルよりはるかに優れているという点には同意する。
応答は遅くてもいいから、もっと良いモデルを選べるオプションだけくれ…"
ドキュメントが正しくやっているもう1つの点は、多くのベンダーなら本番環境で自分で発見させられるようなことだ:ツール呼び出しの後、response.createを送る前に音声再生が終わるのを待つよう明示的に指示している。これは、サーバーがファンクションコールのイベントより先にすべての音声デルタを配信するためだ。それを飛ばすと音声が重なってしまう。彼らはその隙間の間に思考中インジケーターを表示することさえ提案している。それは苦労して得られた、しっかり書き記された知見だ。
移行ガイド自体のアドバイスは、システムプロンプトを長くするのではなく短くすることであり、これはモデルがどのように調整されたかについて何かを物語っている。
実際に導入を妨げる3つの制限
もし評価する立場なら、まず読むのはこのセクションだろう。

**チームあたり10並行セッション。**これはモデルカードに記載された公開デフォルト値で、リクエストすれば上げてもらえる。10件の同時通話というのは、小規模なサポートチームの月曜の朝そのものだ。11件目の電話がつながらなければ、上記のベンチマークはすべて無意味になる。そして「リクエストすれば上げてもらえる」というのは営業の話であり、設定フラグではない。AIコールセンターエージェントの規模を検討する人は、これを注釈ではなく最初の質問として扱うべきだ。
比較として、ヘルプデスクの上に構築されたパッケージ化されたボイスプロダクトは、そもそもセッション上限を公表していない。並行処理はベンダー側の問題であって、あなたの問題ではないからだ。これはZendeskのボイスエージェント、Freshcallerのセットアップ、Salesforceのボイスエージェントにも当てはまる。柔軟性を、キャパシティ計画を他者に任せることと引き換えにするわけだ。
**us-east-1のみ。**リージョンは1つだけで、EUの選択肢はない。データレジデンシーに関する約束がある場合、他の何かを評価する前にこれが答えを決めてしまう。
プライオリティ層もバッチ割引もなし。2倍速のプライオリティ層はChat CompletionsとResponsesのみが対象だ。20%のバッチ割引はテキストモデルのみが対象だ。Voiceには追い越し車線もボリュームディスカウントもなく、見えている料金がどのスケールでも支払う料金になる。また、最大セッション時間は120分で、サポート用としては十分だが、監視対象の電話線のような用途にはきつい。
知っておくべき小さな2点。エージェントが検索を行う場合、ストレージは別途課金される:コレクションは0.10ドル/GiB/日、ファイルは0.025ドル、ダウンロードは0.20ドル/GiBだ。そして、生成前にブロックされたResponsesリクエストごとに利用ガイドライン違反料として0.05ドルが発生する。
2.0に移るべきか、1.0を固定すべきか
8月5日のエイリアス切り替えということは、何もしないこと自体がすでに1つの決断だということだ。自分に当てはまる行を選んでほしい。
今、何を運用していますか?
1つ選んでください。どれに当てはまるかによって、結論は大きく変わります。
デモ規模の量であれば、60%の料金上昇は誤差レベルであり、Full Duplexの77.8%から95.1%への飛躍は、刺さるデモと刺さらないデモの差になる。エイリアスの切り替えに乗ってしまえばいい。
あなたの側で何もデプロイしなくても、8月5日に1分あたりのコストは0.05ドルから0.08ドルに変わる。月2,000分であれば、100ドルから160ドルへの変化だ。会話フローの改善はその価値があるが、請求書がそれを決めてしまう前に、承認者にこの数字を提示しておくべきだ。
チームあたり10並行セッションは公開されているデフォルト値であり、それを上げるのは設定変更ではなくxAIとの交渉だ。何かをベンチマークする前に、その数字を書面で合意しておくこと。95.1%のFull Duplexスコアは、11件目の通話には何の役にも立たない。
speech-to-speechはus-east-1でのみ動作し、EUリージョンは公表されていない。この記事のどのスコアもそれを変えない。xAIが2番目のリージョンを公表したら、再評価してほしい。
実際にこれで構築している人々が言っていること
XはxAIに対する反応の自然な場所だが、現在は深く読み込むのが難しいため、使える情報の多くはHacker Newsにある。2つのスレッドがその大半を占めている。
Think Fast 2.0のスレッドで最も支持されたコメントは、本質的には発表が十分に注目されていないことへの不満だ。
"この投稿がなぜもっと人気にならないのか分からない。これはElevenLabsのような専門ラボを打ち破るSOTAのボイスモデルだ"
これは能力についての公正な見方であり、価格もすでに収束したことは指摘しておく価値がある。有料のElevenLabs Agentsの各プランは、含まれる1分あたりほぼ正確に0.08ドルになり、これはGrokの新料金と1セント単位で一致する。8月5日まで、Grokはそれより37.5%安かった。
数ヶ月前に書かれた、より慎重な見方も今なお通用する。
"Grok voiceは実際、驚くほど良い。フロンティアモデルのシンキングモードよりはまだ劣るモデルだが、他社のボイスモードよりは劣化が少ない。"
私もおおよそそこに落ち着く。ボイスモデルは常に、10秒間考える余裕のあるテキストモデルとのトレードオフであり、Grokはその分野の他のどのモデルよりも上手にそのトレードオフをこなしている。消費者向けのレビューを読めば、同じ結論がもう少し雑な言葉で書かれているのが分かるだろう。
これらのスレッドで繰り返される不満は、ボイスモード中のツール利用についてであり、両方向に効いてくるので整理しておく価値がある。
"この発表に欠けていると感じるのは、コネクタやツールを使う機能だ。正直よく分からない - フロンティアのアシスタントのうち、ボイスモード中にツールやコネクタを使えるものはひとつもない"
これは消費者向けのボイスアシスタントについての話であり、APIサイドではGrokに関してそれは当たらない。セッションはfunction、file_search、web_search、x_search、そしてリモートのmcpツールをサポートし、サーバー側のものはあなたに代わって実行される。サーバーツールは呼び出しごとに課金され、Web検索とX検索は1,000回あたり5ドル、コレクションは1,000回あたり2.50ドル、添付ファイル検索は1,000回あたり10ドルだ。このコメントが述べているギャップは、消費者向けのGrokアプリにおいては現実だが、実際に構築対象となるものにおいてはそうではない。これはChatGPTのボイス展開全体に通じる同じ分断であり、APIはしばらく前からアプリよりも先を行っている。
誰が採用すべきか、誰が待つべきか
**採用すべき場合:**単に話すだけでなく、何かを実行しなければならない電話・ボイスエージェントを構築している場合。τ-voiceのスコア、ツールサポート、force_messageとkeytermsの拡張機能、そしてフラットな分単位課金を合わせると、現在提供されている中で最も開発者フレンドリーなボイススタックになる。OpenAIのリアルタイムオーディオからの移行は、ほぼ無料に近い。
**採用すべき場合:**コストの予測可能性が財務チームにとって重要な場合。Artificial Analysisは、Grokの実際のコストを入力音声1時間あたり4.80ドルと測定しており、これは公表値と同一だ。課金が分単位でフラットだからだ。GPT-Realtime-2は入力1.15ドル/時と公表しているが、実測値はオールインで4.14ドル/時だ。表示価格と一致するボイス料金は、そうあるべき頻度より珍しく、これがエージェントと人間のコストの問いに正直に答えるのがこれほど難しい理由の半分を占めている。
**採用すべき場合:**オーケストレーションを自分で構築したい場合。むしろボックスをドラッグして組み立てたい場合は、Voiceflowの料金やVoice Agent Builderの代替製品が、同じ市場のノーコード側にあたる。
**待つべき場合:**利用量が同時10通話を超え、まだ書面での上限引き上げを得ていない場合。**待つべき場合:**EUリージョンが必要な場合。**待つべき場合:**0.05ドルの料金に頼っていて、そのエイリアスが足元で切り替わることに気づいていなかった場合。その場合は今日のうちにgrok-voice-think-fast-1.0を固定し、自分のスケジュールで判断すればいい。
**サポートソリューションとして購入してはならない。**これはモデルとAPIであり、ヘルプデスクエージェントではない。あなたのチケット履歴、マクロ、エスカレーションルール、あるいはチームがすでにAIに触らせないと決めた質問について、何の概念も持っていない。上記すべてはボイス層についての話であり、ボイス層はサポート自動化を本当に機能させる要素のおそらく20%程度にすぎない。残りは地味な部分だ:自社の製品を理解すること、いつ止めるべきかを知ること、そしてきれいに引き継ぐことだ。
あるDTCサプリメントブランドのCXリーダーは、どんな仕様書よりも的確にこの制約を言い表していた。
"AIが100%の質問に答えられるようになることは決してない…私が必要としているのは、自信を持って対応できるチケットだけを処理し、それ以外のチケットには手を出さずに残しておくAIだ。"
そのようなことを測定するボイスベンチマークは存在しない。これはポリシーの問題であり、展開が最初の1ヶ月を生き延びられるかを決めるのはそこだ。
音声はサポートキューのうるさい半分だ
電話に発展するチケットの大半は、その1時間前にはテキストで回答可能だったものだ。初回対応の自動化と、AIが実際に読めるナレッジベースチャットボットは、どんなボイスモデルよりも多くの電話を未然に防ぐ。これは、ボイスモデルを買いに行く前に直しておく価値があるものだ。
eeselは、既に運用しているヘルプデスクに接続するAIエージェントで、手書きで用意するシステムプロンプトではなく過去のチケットとヘルプセンターで学習し、実際の顧客が触れる前に、実際のチケット履歴に対してその全体をシミュレーションさせることができる。この最後の部分は意図的なものだ。私は自信満々に聞こえるボットが誤った答えを出す様子を何年も見てきており、既に解決済みのチケットに対する予行演習こそが、あなたのものが何をするかを知る唯一の誠実な方法だ。これはまた、スクリプト化された経路が尽きたときに、本物のAIエージェントをルールベースのボットから分ける段階でもある。
これは、xAIのようなドキュメントページを読んで、自分たちがどれだけそれを保守しなければならないかを理解した多くのチームが行き着く、同じビルド対バイの判断だ。
"自分たちでLLMアプリケーションを書こうとすることもできたが、そこに時間を投資したくはなかった。保守する必要のないものが欲しかった。"
Karel, GENERAL BYTES
ボイス層も欲しいなら、Grokのボイスエージェントビルダーや、より広いAI音声企業の分野について読み進めてほしい。その手前のキューをまず片付けたいなら、eeselは無料で試せ、ヘルプデスクに接続するのに数分しかかからない。GorgiasやZendeskを運用しているチームは、たいてい同じ日の午後には実際のチケットに答えさせている。
どの部分で行き詰まっているかによって、次に読む価値があるものを3つ挙げる。
- モデルについてまだ決めかねている場合:Think Fast 2.0の概要が仕組みをより深く扱っている。
- 料金を計算している場合:料金の完全な解説が4つの利用量について計算している。
- 分野を比較している場合:ElevenLabsの代替製品が、同じ料金での最も近い直接比較になる。
よくある質問
Grok Voice Think Fast 2.0は本番のボイスエージェントに十分な性能ですか?
us-east-1の1つのみです。全体の仕組みについてはGrok Voice Think Fast 2.0の詳細解説を、本番導入で通常必要になるものについてはAIコールセンターエージェントを参照してください。Grok Voice Think Fast 2.0は1.0と比べて何が新しいですか?
Grok Voice Think Fast 2.0は1分あたりいくらですか?
grok-voice-latestエイリアスを呼び出すと自動的に適用されます。契約前にElevenLabsの料金や、より広いAI音声企業の分野と比較してください。OpenAI RealtimeのアプリをGrok Voiceに移行できますか?
wss://api.x.ai/v1/realtimeでOpenAI Realtimeとワイヤーレベルで互換性があるため、ベースURLとキーの切り替えでほとんどの部分がカバーされます。4種類のイベントの挙動が異なり、下の移行セクションで一覧化しています。OpenAIのオーディオAPI上に構築していたなら、スプリントではなく半日程度を見込んでください。サポート電話対応において、Grok Voice Think Fast 2.0はElevenLabsより優れていますか?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








