
私が「音声モデル」という言葉で本当に言いたいこと
ここ数年、eeselをヘルプデスクに組み込む仕事をしてきたので、顧客対応AIについてのベンダーのページはかなり読んできた。音声はアーキテクチャの主張が実際に検証可能な、数少ないカテゴリーなので、正確に見ておく価値がある。
多くの音声スタックは、トレンチコートを着た3つの製品にすぎない。音声認識、言語モデル、音声合成が、しばしば3つの異なるベンダーから提供されている。ホップが一つ増えるたびに、遅延とコストと、深夜2時に故障しうるものが一つ増える。xAI自身がVoice Agent Builderのローンチで述べていたのは、まさにこの構造を統合しようとしているということで、Think Fast 2.0はその統合を実現するモデルだ。

Think Fastモデルには、これまで製品化された例を見たことがない特徴がある。それは話しながら推論するという点だ。xAIはこれを、発話と並行して推論すると説明しており、そのため思考が最初の一言の前に立ちはだかることがない。実際には、エージェントが最初の一文を言い終える前にツール呼び出しが発火することが多い。これが0.70秒の秘密のすべてであり、通常はトレードオフの関係にある速さと複数ステップの作業の巧みさを両立できる理由でもある。
Think Fast 2.0は推論トークンも大きく削減した。xAIによれば、中央値の応答はThink Fast 1.0の0.4倍の推論トークンしか使わない。これはデモよりも、長時間の通話でこそ体感できる変化だ。
ベンチマーク表と、見落とされがちな2つの行
以下はローンチ当日にxAIが公開した数値で、出典はArtificial Analysisだ。
| ベンチマーク | Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|---|
| AA Speech-to-Speech Quality Index | 82.9% | 75.7% | 79.1% | 69.5% |
| 音声推論 (Big Bench Audio) | 97.2% | 97.1% | 96.0% | 96.6% |
| 会話のダイナミクス (Full Duplex Bench) | 95.1% | 77.8% | 95.7% | 74.3% |
| エージェント性能 (τ-voice Bench) | 56.5% | 52.1% | 45.7% | 37.7% |
| 初回音声応答までの時間 | 0.70s | 1.25s | 1.21s | 2.98s |
隣で読んでいる人がいたら指摘したい点がいくつかある。
まず、サポート用途で最も重要な行はτ-voice Benchの56.5%で、GrokはOpenAIの最良のスコアをほぼ11ポイント上回って勝っている。τ-voiceは、雑音、訛り、割り込み、話の途中で意見を変える発信者など、現実的な通話条件下でのエージェントを測定する。「本物の電話回線で本物のワークフローを実行できるか」に最も近い公開された代理指標だ。ただし56.5%という上限は、そうした難しいシナリオのおよそ5件に2件は依然として失敗することも意味しており、完全自動化を謳う相手には突きつけたい数字だ。
次に、会話のダイナミクスの行はxAIが勝てなかった行だ。GPT-Realtime-2.1 Highが95.7%対95.1%でわずかに上回っている。Grokは77.8%からの伸びなので、今回のリリースで明確に修正された点だとわかる。17ポイントの改善なので、その点は素直に評価したい。
ここでxAI自身の表が省いている文脈を見てみよう。Artificial Analysisの全体リーダーボードを開くと、Think Fast 2.0は全体1位ではなく2位だ。AlibabaのQwen Audio 3.0 Realtime Plusが84.1%で首位に立っている。ただしこちらは話し始めるまでに4.02秒かかり、0.70秒との差は、電話回線で言えば会話と無音の差に等しい。レイテンシも同様で、Deepslate Opalは0.44秒、Gemini 2.5 Flash Native Audio Dialogは0.63秒とGrokより速いが、指標全体ではGrokに大きく劣る。Grokが主張しているのは組み合わせの強さであり、その組み合わせにおいてはこの表の中で最良のものだ。
8月5日のエイリアス切り替えを金額で見る
これは実際にカレンダーにリマインダーを入れたい部分だ。

xAIの料金ページによると、音声の料金表は次の通りだ。
| モデル・モード | 料金 |
|---|---|
Speech to speech, grok-voice-think-fast-1.0 | $0.05 / 分 ($3.00 / 時間) 音声、$0.004 / テキスト入力 |
Speech to speech, grok-voice-think-fast-2.0 | $0.08 / 分 ($4.80 / 時間) 音声、$0.004 / テキスト入力 |
| Speech to text | $0.10 / 時間 (REST)、$0.20 / 時間 (ストリーミング) |
| Text to speech | $15.00 / 100万文字 |
xAIの説明では、アップグレードには何もアクションは不要で、1.0のままでいたい場合は8月5日より前にgrok-voice-think-fast-1.0を固定する、とされている。どちらも本当のことだ。ただ明言されていないのは、デフォルトの経路が高い方だということで、デプロイなしに1分あたり60%のコスト増があなたの側にやってくる。一定の量を回しているなら、その負担が来る前に計算しておくべきだ。
これに加えてもう2つの課金項目が付いてくる。Voice Agent Builderで電話番号を発行すると、1分あたり$0.01が上乗せされる。サーバー側のツールは呼び出しごとに課金され、ウェブ検索とX検索は1,000回あたり$5、ドキュメントコレクション検索は1,000回あたり$2.50、ファイル添付検索は1,000回あたり$10だ。ほぼ毎回の通話で何かを調べるサポートエージェントなら、これらを千単位で購入することになるので、モデルに組み込んでおこう。
8月5日で何がいくらになるか
月間の通話時間を選んでください。料金はxAI公表の音声料金に加え、発行済み電話番号の1分あたり$0.01を含みます。
これを他社と比較する際の注意点が一つある。xAIは固定の分単位料金を公表しているが、OpenAIとGoogleはオーディオトークン単位で課金する。Artificial Analysisはこれを入力音声1時間あたりのコストとして正規化しており、その基準ではThink Fast 2.0が$4.80、GPT-Realtime-2.1 Highが$10.75、Gemini 3.1 Flash Highが$1.75となる。Grokの数字は公表されている分単位料金のちょうど60倍なので、正真正銘の料金表だ。他の2つはあるベンチマーク実行の測定値にすぎず、エージェントがどれだけおしゃべりかによって変動する。両者を比較検討するなら、正規化された1列だけを信じるのではなく、OpenAI Realtime APIの料金をきちんと確認してほしい。
文字起こしこそ、目立たないが重要なアップグレード
ベンチマーク表は注目を集めるが、電話回線に導入するなら文字起こしの改善の方が実用面では大きいと思う。
xAIは24言語の短いフレーズ数千件で評価し、Think Fast 2.0が専用の文字起こしモデルを上回ったと報告している。Deepgram Nova 3やElevenLabs Scribe v2に対して1.5〜2.0倍優れた単語誤り率、Think Fast 1.0に対しては1.4倍だ。私がより気にしているのは、雑音下での主張の方で、背景ノイズと電話回線の圧縮下では専用の音声認識モデルとの差がおよそ10倍まで広がるとされている。
これがサポート電話の実際の環境だ。誰も録音ブースからサポートに電話をかけない。車の中から、倉庫から、子どもがいる台所からかけてくる。文字起こしが「注文をキャンセルして」を別の言葉に取り違えるのを見たことがあるなら、たった一語の誤りがまるごと違うワークフローにつながることがわかるはずだ。多言語サポートを運用している人は、平均値ではなく発表資料の言語別チャートを見てほしい。24言語間のばらつきは大きい。
残るギャップを埋めるために用意されている2つのセッションパラメータがあり、初日から知っておく価値がある。audio.input.transcription.keytermsは、最大100件・各50文字までの用語に対して文字起こしを寄せることができ、自社の商品名やプラン名を登録する場所になる。replaceは、あるフレーズを音声合成前に別の発音に置き換えるもので、音声では自社ブランド名を正しく発音させつつ、文字起こしでは元の綴りを保つことができる。ドキュメントの例では「Acme Mobile」を「Acme Mobull」に置き換えており、この機能がどれだけ地味だが必要かがよくわかる。
実際に組み込むとなると何が必要か
私は自分がサポートすることになるかもしれないAPIを読むときと同じ姿勢でspeech-to-speechのドキュメントを読んだ。つまり、後で噛みついてきそうな部分を探しながら読んだ。そのメモをいくつか紹介する。
このAPIはOpenAIのRealtime APIとワイヤー互換だ。WebSocketの接続先をwss://api.x.ai/v1/realtimeに向けてキーを差し替えれば、既存のクライアントコードの大半がそのまま動く。これは意図的に切り替えコストを下げた設計であり、xAIが持つ最も強力な商業上の主張だ。ただし完全な互換性ではない。conversation.item.done、rate_limits.updated、いくつかのoutput_audio_buffer.*イベントは発行されず、conversation.item.input_audio_transcription.deltaは.updatedに名前が変わり、差分ではなく累積のペイロードになる。これらのイベントに何か構築していたなら、それが移植作業になる。ツール呼び出しの違いも読んでおく価値がある。
ツールは5種類ある。自社APIのためのfunction、アップロードしたドキュメントコレクションを検索するfile_search、web_search、x_search、そしてリモートのmcpサーバーだ。私が使うとしたらMCPサポートで、既存の社内ツールを音声専用のシムを書かずに接続できるからだ。
推論はデフォルトでhighのエフォートになる。reasoning.effortを"none"に設定すればオフにできる。これは触れる価値がある。前世代について実際にあったHacker Newsの不満は、この逆だったからだ。
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"
サポート回線を構築する人に指摘したいxAI独自の拡張機能が3つある。
force_messageは、モデルを介さずに固定でTTS合成された文言をそのまま発話するもので、interruptibleフラグを持つ。これは「この通話は録音されています」を毎回一字一句そのまま伝える方法であり、あれば嬉しい機能ではなくコンプライアンス上の要件だ。resumptionはconversation_idに紐づけてターンをキャッシュし、再接続時に再生する。デフォルトはオフだ。これがないと、WebSocketが切断された時点で会話が失われ、モバイルの発信者は接続を頻繁に切ってしまう。idle_timeout_msは、無言の発信者にサーバー側からタイマーで再度話しかけさせるもので、応答のたびに再セットされる。これが、辛抱強いエージェントと気まずい沈黙の違いになる。
ドキュメントにある移行アドバイスは予想の逆を行く。システムプロンプトは長くではなく短くするのが正しい。xAIのガイダンスは、既存のプロンプトをそのまま移植するのではなく、Grokに既存プロンプトを一般化するよう頼み、前モデルのエッジケースをパッチするために書かれたプロンプトのハックを取り除くようにというものだ。私自身、モデルのアップグレードのたびに自社のプロンプトでこの作業をしてきた。気は進まないが、たいてい正しい。積み重なった応急処置こそが、プロンプトを徐々に保守不能にしていく原因だ。
実際に本番で機能するのか? 実証データはStarlinkだけ
ベンチマークは一つの側面にすぎない。どちらの発表でも数字が示されている唯一の導入事例は、Grok Voice上で動くStarlinkのセールス・サポート回線であり、xAIがThink Fast 1.0とともに公開した数字は、正確に引用する価値がある。
- 転換率20%。 販売問い合わせの5件に1件が、Grokとの通話中にStarlinkのサービスを購入している。
- 解決率70%。 サポート問い合わせの大部分が、人間の介入なしに自律的に解決している。
- 28個のツール。 一つのエージェントが数十種類のツールを使い、何百ものサポート・セールスのワークフローをこなしている。
- ハードウェアのトラブルシューティング、ハードウェアの交換、サービスクレジットの付与はすべて自律的に行われている。
これらは強い数字であり、同時にファーストパーティのデータであるため、両刃の剣でもある。StarlinkとxAIはオーナーを同じくしているので、これは最も多くのエンジニアリングの注意が払われた、最良ケースの導入例だ。70%の自律解決率は本物の数字だが、同時にそれは、専任のチームが1つの事業ラインのために28個のツールを構築した結果でもある。
Think Fast 2.0に固有の話として、xAIは同じStarlink回線でのA/Bテストにおいて「販売転換率とサポートの封じ込め率の両方で有意な増加」があったとしているが、どちらも数値は公表していない。その数字が欲しいところだ。数字が出るまでは、2.0はベンチマーク上で優れており、本番でもおそらく優れているが、それはベンダーの言葉に基づいた話、というのが率直な読み方になる。
コミュニティの反応は今のところ薄く、それ自体が、誰が注目しているかを物語っている。Hacker Newsのローンチスレッドはポイント5、コメント2件だった。
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
より参考になるのは、前世代を実際に使い続けてきた人たちの声だ。
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
そして、同じ見方の中でも最もバランスが取れており、私が一番信頼するのがこちらだ。
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
実際に導入を検討すべきなのは誰か
大量の電話回線を運用していて、レイテンシがボトルネックになっているなら、明確に「はい」だ。1秒未満の初回音声応答と、公開されている中で最良のエージェント性能スコアの組み合わせは、他の選択肢に対して僅差の勝負ではない。OpenAI Realtimeとの互換性により、乗り換えの検証は1スプリントではなく1日で済む。ゼロからコールセンター自動化を構築しようとしている人は、候補に入れるべきだ。
スタックを一から組みたくない開発者にとっても明確に「はい」だ。Voice Agent Builderは電話、検索、ガードレール、通話レビューをまとめて提供し、既存の電話番号にはSIPで対応する。4つのベンダーを組み合わせるより実際に時間を節約できるし、代替サービスの多くはさらにプラットフォーム利用料を上乗せしてくる。音声モデルはテキスト側のラインとは別にバージョン管理されているので、Grok 4.5のリリースがこちらに影響することはない点も覚えておいてほしい。
サポート量がメールとチャット中心なら、まだ「はい」ではない。私がよく見かける間違いはこれだ。優れた音声機能を見て、電話のデフレクションプロジェクトを計画し始めるが、実はキューの大半は誰にも電話をかけてこない。音声はチャネルの一つであって、戦略そのものではない。チケットがどこにあるかから始めるべきで、すでに電話回線がヘルプデスクに接続されているなら、Gorgiasの電話統合や同等の仕組みがすでに何をしているかを、追加のスタックを組む前に確認してほしい。
本番投入前に安全性を証明する必要があるなら、まだ「はい」ではない。Think Fast 2.0を自社の過去の通話履歴に対して事前にドライラン検証する公開された方法はない。通話録音、文字起こし、ガードレールはすべてBuilderの中で事後に存在する。それはレビューであってリハーサルではなく、エージェントが返金を実行できる場合にはこの違いが重要になる。同じギャップはカテゴリー全体で見られ、だからこそ誤ったAI回答を防ぐことは、モデルの問題というより多くはプロセスの問題になる。
今grok-voice-latestを使っているなら注意してほしい。上の計算機を見てほしい。明日までだ。
あなたのチケットキューにも同じことをしたいなら
Grok Voiceは電話に強い。問題は、多くのサポートチームにとって電話は小さなチャネルであり、実際に量が集中しているのはチケットキューの方だという点だ。
その半分をやるのがeeselだ。Zendesk、Freshdesk、Gorgias、Front、HubSpotなどに接続し、一から書くプロンプトではなく過去のチケット、マクロ、ヘルプセンターから学習し、サポート担当者がすでに開いているヘルプデスクの中で返信を下書き、あるいは送信する。誰も新しいツールを覚える必要はない。
ここまで書いてきたベンチマークと実際のキューとのギャップを踏まえて指摘したいのは、有効化する前にeeselが自社の過去のチケット履歴に対してエージェントをシミュレーションし、どう答えたか、どれくらいの頻度で答えたかを教えてくれる点だ。これが、音声スタックにはないリハーサルの工程だ。私は自信満々に見えるボットが誤った答えを返すのを見てきたから、今朝のチケットではなく先月のチケットでそれを発見したい。
この工程がなぜ重要かについての、あるお客様の見方を紹介する。DTCのサプリメント企業でCXを担当している方から聞いた話を匿名化した引用だ。
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
これは注意書きではなく、設定そのものだ。自信度に基づくルーティング、チケット種別による除外、本番投入前のシミュレーション。

無料で試すことができ、数分で自分のチケットに答えさせられるようになる。eeselを試す。
よくある質問
Grok Voice Think Fast 2.0とは何ですか?
2026年7月29日に発表された、xAIのフラッグシップとなるspeech-to-speechモデルで、3つのサービスを繋ぐのではなく、一つのモデル経路で聞き取り・推論・発話を行う。この単一経路こそが0.70秒という初回音声応答の速さの理由だ。2026年8月5日にgrok-voice-latestの対象となる。目的が通話ではなくメールやチャットであれば、AIヘルプデスクエージェントの方が適している。
Grok Voice Think Fast 2.0の1分あたりの料金はいくらですか?
音声1分あたり$0.08、1時間あたり$4.80、テキスト入力は$0.004。Think Fast 1.0は引き続き1分あたり$0.05なので、Grok Voice Think Fast 2.0の料金は1分あたり60%の値上げにあたる。発行済み番号は1分あたり$0.01追加され、ツール呼び出しは別料金だ。より広いAIカスタマーサービスのコストや、人間のエージェントのコストと比べて検討してほしい。
Grok Voice Think Fast 2.0はGPT-Realtimeより速いですか?
公表されている計測値では、その通り。初回音声応答が0.70秒で、GPT-Realtime-2.1 Highの1.21秒を上回る。ただし全体で最速のモデルではない。Deepslate Opalは0.44秒、Gemini 2.5 Flash Native Audio Dialogは0.63秒と、どちらも品質指標ではさらに下位だ。OpenAI Realtime APIの比較記事では逆側からのトレードオフを扱っており、WebRTC対WebSocketのトランスポート比較も含まれている。
Think Fast 1.0からアップグレードする必要はありますか?
何もしなければの話だ。2026年8月5日にgrok-voice-latestはgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0へと向き先を変えるので、それまでに旧バージョンを固定しておくことが、旧モデルにとどまる方法になる。本番環境でのバージョン固定はそもそも良い習慣であり、顧客に見せる前にAIの回答をテストするのと同じ発想だ。
Grok Voice Think Fast 2.0はカスタマーサポートの電話対応に使えますか?
まさにそのために設計されている。Starlinkの回線はGrok Voiceで28個のツールを使い、自律解決率70%、販売転換率20%を実現しており、モデルは関数呼び出し、ドキュメント検索、MCP、人間へのエスカレーションに対応している。現実的な視点はAIはサポートの電話に応答できるかに、運用面は電話サポートの自動化方法とAIのエスカレーション管理にまとめている。
Grok Voice Think Fast 2.0の文字起こし精度はどうですか?
xAIは、Think Fast 1.0に対して単語誤り率が1.4倍改善し、Deepgram Nova 3やElevenLabs Scribe v2に対しては24言語で1.5〜2.0倍優れていると報告しており、雑音下ではおよそ10倍まで差が広がる。多言語サポートを運用しているなら、平均値ではなく言語別チャートを確認してほしい。精度は言語によって異なり、CSATを痛めるのはその裾野の部分だからだ。
Grok VoiceはZendeskやGorgiasと連携しますか?
ネイティブには連携しない。Grok Voiceはモデルとビルダーなので、ヘルプデスクへの書き込みは自分で組む関数ツールかMCPサーバーを介することになる。ヘルプデスクの中でAIを使いたいなら、Zendesk AIやFreshdeskのFreddyから検討するとよい。電話回線側ではZendesk Talkの構成が最も近いネイティブの選択肢だ。いずれにせよ、音声は同じキューに流れ込むもう一つのチャネルとして扱うべきだ。
Grok Voice Think Fast 2.0はThink Fast 1.0より価値がありますか?
負荷の高いエージェント業務であれば、おそらくそうだ。総合スコアは75.7%対82.9%で、レイテンシはほぼ半分、会話のダイナミクスも17ポイント向上している。1.0ですでに十分解決できているシンプルなFAQ回線であれば、60%の値上げは使わないかもしれない精度に対して払うことになる。自社の解決率やコールセンターのROIに照らして検討し、エイリアス任せにしないでほしい。ラインナップ全体を比較するなら、次はxAIの料金を確認すると良い。
Sources
- Grok Voice Think Fast 2.0, xAI, July 29, 2026
- Grok Voice Think Fast 1.0, xAI, April 23, 2026
- Introducing the Voice Agent Builder, xAI, July 1, 2026
- 21 New Flagship Grok Voices, xAI, July 6, 2026
- xAI pricing, voice API rates, last updated July 3, 2026
- Speech to Speech API docs, xAI, last updated August 2, 2026
- Speech to Speech models leaderboard, Artificial Analysis
よくある質問
Grok Voice Think Fast 2.0とは何ですか?
grok-voice-latestの対象がThink Fast 1.0からこちらに置き換わります。目的が電話ではなくメールやチャットへの対応であれば、AIヘルプデスクエージェントの方が適しています。Grok Voice Think Fast 2.0の1分あたりの料金はいくらですか?
Grok Voice Think Fast 2.0はGPT-Realtimeより速いですか?
Grok Voice Think Fast 1.0からアップグレードする必要はありますか?
grok-voice-latestはgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0を指すようになります。旧モデルのままの安い料金を維持したい場合は、その日までに明示的にgrok-voice-think-fast-1.0を固定してください。バージョンの固定はxAIも本番運用で推奨しており、誤ったAI回答を防ぐための考え方と同じです。Grok Voice Think Fast 2.0はカスタマーサポートの電話対応に使えますか?
Grok Voice Think Fast 2.0の文字起こし精度はどうですか?
Grok Voice Think Fast 2.0の料金は他の音声APIと比べてどうですか?
Grok Voice Think Fast 2.0が役に立たない場面はありますか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








