Grok Voice Think Fast 2.0の変更点と料金まとめ

Rama Adi Nugraha
執筆者

Rama Adi Nugraha

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 4, 2026

専門家による検証済み
ヘッドセットをつけたサポート担当者のラインイラストとGrokのロゴ、吹き出しの中の音声波形

私が「音声モデル」という言葉で本当に言いたいこと

ここ数年、eeselをヘルプデスクに組み込む仕事をしてきたので、顧客対応AIについてのベンダーのページはかなり読んできた。音声はアーキテクチャの主張が実際に検証可能な、数少ないカテゴリーなので、正確に見ておく価値がある。

多くの音声スタックは、トレンチコートを着た3つの製品にすぎない。音声認識、言語モデル、音声合成が、しばしば3つの異なるベンダーから提供されている。ホップが一つ増えるたびに、遅延とコストと、深夜2時に故障しうるものが一つ増える。xAI自身がVoice Agent Builderのローンチで述べていたのは、まさにこの構造を統合しようとしているということで、Think Fast 2.0はその統合を実現するモデルだ。

音声認識・LLM・音声合成を繋ぎ合わせたパイプラインと、単一のspeech-to-speechモデル経路の比較
音声認識・LLM・音声合成を繋ぎ合わせたパイプラインと、単一のspeech-to-speechモデル経路の比較

Think Fastモデルには、これまで製品化された例を見たことがない特徴がある。それは話しながら推論するという点だ。xAIはこれを、発話と並行して推論すると説明しており、そのため思考が最初の一言の前に立ちはだかることがない。実際には、エージェントが最初の一文を言い終える前にツール呼び出しが発火することが多い。これが0.70秒の秘密のすべてであり、通常はトレードオフの関係にある速さと複数ステップの作業の巧みさを両立できる理由でもある。

Think Fast 2.0は推論トークンも大きく削減した。xAIによれば、中央値の応答はThink Fast 1.0の0.4倍の推論トークンしか使わない。これはデモよりも、長時間の通話でこそ体感できる変化だ。

ベンチマーク表と、見落とされがちな2つの行

以下はローンチ当日にxAIが公開した数値で、出典はArtificial Analysisだ。

ベンチマークThink Fast 2.0Think Fast 1.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82.9%75.7%79.1%69.5%
音声推論 (Big Bench Audio)97.2%97.1%96.0%96.6%
会話のダイナミクス (Full Duplex Bench)95.1%77.8%95.7%74.3%
エージェント性能 (τ-voice Bench)56.5%52.1%45.7%37.7%
初回音声応答までの時間0.70s1.25s1.21s2.98s

隣で読んでいる人がいたら指摘したい点がいくつかある。

まず、サポート用途で最も重要な行はτ-voice Benchの56.5%で、GrokはOpenAIの最良のスコアをほぼ11ポイント上回って勝っている。τ-voiceは、雑音、訛り、割り込み、話の途中で意見を変える発信者など、現実的な通話条件下でのエージェントを測定する。「本物の電話回線で本物のワークフローを実行できるか」に最も近い公開された代理指標だ。ただし56.5%という上限は、そうした難しいシナリオのおよそ5件に2件は依然として失敗することも意味しており、完全自動化を謳う相手には突きつけたい数字だ。

次に、会話のダイナミクスの行はxAIが勝てなかった行だ。GPT-Realtime-2.1 Highが95.7%対95.1%でわずかに上回っている。Grokは77.8%からの伸びなので、今回のリリースで明確に修正された点だとわかる。17ポイントの改善なので、その点は素直に評価したい。

ここでxAI自身の表が省いている文脈を見てみよう。Artificial Analysisの全体リーダーボードを開くと、Think Fast 2.0は全体1位ではなく2位だ。AlibabaのQwen Audio 3.0 Realtime Plusが84.1%で首位に立っている。ただしこちらは話し始めるまでに4.02秒かかり、0.70秒との差は、電話回線で言えば会話と無音の差に等しい。レイテンシも同様で、Deepslate Opalは0.44秒、Gemini 2.5 Flash Native Audio Dialogは0.63秒とGrokより速いが、指標全体ではGrokに大きく劣る。Grokが主張しているのは組み合わせの強さであり、その組み合わせにおいてはこの表の中で最良のものだ。

8月5日のエイリアス切り替えを金額で見る

これは実際にカレンダーにリマインダーを入れたい部分だ。

grok-voice-latestが、1分あたり$0.08のThink Fast 2.0か、固定した1分あたり$0.05のThink Fast 1.0に分岐する図
grok-voice-latestが、1分あたり$0.08のThink Fast 2.0か、固定した1分あたり$0.05のThink Fast 1.0に分岐する図

xAIの料金ページによると、音声の料金表は次の通りだ。

モデル・モード料金
Speech to speech, grok-voice-think-fast-1.0$0.05 / 分 ($3.00 / 時間) 音声、$0.004 / テキスト入力
Speech to speech, grok-voice-think-fast-2.0$0.08 / 分 ($4.80 / 時間) 音声、$0.004 / テキスト入力
Speech to text$0.10 / 時間 (REST)、$0.20 / 時間 (ストリーミング)
Text to speech$15.00 / 100万文字

xAIの説明では、アップグレードには何もアクションは不要で、1.0のままでいたい場合は8月5日より前にgrok-voice-think-fast-1.0を固定する、とされている。どちらも本当のことだ。ただ明言されていないのは、デフォルトの経路が高い方だということで、デプロイなしに1分あたり60%のコスト増があなたの側にやってくる。一定の量を回しているなら、その負担が来る前に計算しておくべきだ。

これに加えてもう2つの課金項目が付いてくる。Voice Agent Builderで電話番号を発行すると、1分あたり$0.01が上乗せされる。サーバー側のツールは呼び出しごとに課金され、ウェブ検索とX検索は1,000回あたり$5、ドキュメントコレクション検索は1,000回あたり$2.50、ファイル添付検索は1,000回あたり$10だ。ほぼ毎回の通話で何かを調べるサポートエージェントなら、これらを千単位で購入することになるので、モデルに組み込んでおこう。

移行後の請求額

8月5日で何がいくらになるか

月間の通話時間を選んでください。料金はxAI公表の音声料金に加え、発行済み電話番号の1分あたり$0.01を含みます。

平均通話4分としておおよそ500 件 / 月
1.0に固定$120音声$100 + 電話$20
2.0へ自動移行$180音声$160 + 電話$20
差額: +$60 / 月 (年間 +$720)
平均通話4分としておおよそ2,500 件 / 月
1.0に固定$600音声$500 + 電話$100
2.0へ自動移行$900音声$800 + 電話$100
差額: +$300 / 月 (年間 +$3,600)
平均通話4分としておおよそ12,500 件 / 月
1.0に固定$3,000音声$2,500 + 電話$500
2.0へ自動移行$4,500音声$4,000 + 電話$500
差額: +$1,500 / 月 (年間 +$18,000)
平均通話4分としておおよそ50,000 件 / 月
1.0に固定$12,000音声$10,000 + 電話$2,000
2.0へ自動移行$18,000音声$16,000 + 電話$2,000
差額: +$6,000 / 月 (年間 +$72,000)
サーバー側のツール呼び出し(1,000回あたり$2.50から別途課金)は含まれていません。

これを他社と比較する際の注意点が一つある。xAIは固定の分単位料金を公表しているが、OpenAIとGoogleはオーディオトークン単位で課金する。Artificial Analysisはこれを入力音声1時間あたりのコストとして正規化しており、その基準ではThink Fast 2.0が$4.80、GPT-Realtime-2.1 Highが$10.75、Gemini 3.1 Flash Highが$1.75となる。Grokの数字は公表されている分単位料金のちょうど60倍なので、正真正銘の料金表だ。他の2つはあるベンチマーク実行の測定値にすぎず、エージェントがどれだけおしゃべりかによって変動する。両者を比較検討するなら、正規化された1列だけを信じるのではなく、OpenAI Realtime APIの料金をきちんと確認してほしい。

文字起こしこそ、目立たないが重要なアップグレード

ベンチマーク表は注目を集めるが、電話回線に導入するなら文字起こしの改善の方が実用面では大きいと思う。

xAIは24言語の短いフレーズ数千件で評価し、Think Fast 2.0が専用の文字起こしモデルを上回ったと報告している。Deepgram Nova 3やElevenLabs Scribe v2に対して1.5〜2.0倍優れた単語誤り率、Think Fast 1.0に対しては1.4倍だ。私がより気にしているのは、雑音下での主張の方で、背景ノイズと電話回線の圧縮下では専用の音声認識モデルとの差がおよそ10倍まで広がるとされている。

これがサポート電話の実際の環境だ。誰も録音ブースからサポートに電話をかけない。車の中から、倉庫から、子どもがいる台所からかけてくる。文字起こしが「注文をキャンセルして」を別の言葉に取り違えるのを見たことがあるなら、たった一語の誤りがまるごと違うワークフローにつながることがわかるはずだ。多言語サポートを運用している人は、平均値ではなく発表資料の言語別チャートを見てほしい。24言語間のばらつきは大きい。

残るギャップを埋めるために用意されている2つのセッションパラメータがあり、初日から知っておく価値がある。audio.input.transcription.keytermsは、最大100件・各50文字までの用語に対して文字起こしを寄せることができ、自社の商品名やプラン名を登録する場所になる。replaceは、あるフレーズを音声合成前に別の発音に置き換えるもので、音声では自社ブランド名を正しく発音させつつ、文字起こしでは元の綴りを保つことができる。ドキュメントの例では「Acme Mobile」を「Acme Mobull」に置き換えており、この機能がどれだけ地味だが必要かがよくわかる。

実際に組み込むとなると何が必要か

私は自分がサポートすることになるかもしれないAPIを読むときと同じ姿勢でspeech-to-speechのドキュメントを読んだ。つまり、後で噛みついてきそうな部分を探しながら読んだ。そのメモをいくつか紹介する。

このAPIはOpenAIのRealtime APIとワイヤー互換だ。WebSocketの接続先をwss://api.x.ai/v1/realtimeに向けてキーを差し替えれば、既存のクライアントコードの大半がそのまま動く。これは意図的に切り替えコストを下げた設計であり、xAIが持つ最も強力な商業上の主張だ。ただし完全な互換性ではない。conversation.item.donerate_limits.updated、いくつかのoutput_audio_buffer.*イベントは発行されず、conversation.item.input_audio_transcription.delta.updatedに名前が変わり、差分ではなく累積のペイロードになる。これらのイベントに何か構築していたなら、それが移植作業になる。ツール呼び出しの違いも読んでおく価値がある。

ツールは5種類ある。自社APIのためのfunction、アップロードしたドキュメントコレクションを検索するfile_searchweb_searchx_search、そしてリモートのmcpサーバーだ。私が使うとしたらMCPサポートで、既存の社内ツールを音声専用のシムを書かずに接続できるからだ。

推論はデフォルトでhighのエフォートになる。reasoning.effort"none"に設定すればオフにできる。これは触れる価値がある。前世代について実際にあったHacker Newsの不満は、この逆だったからだ。

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"

サポート回線を構築する人に指摘したいxAI独自の拡張機能が3つある。

  • force_message は、モデルを介さずに固定でTTS合成された文言をそのまま発話するもので、interruptibleフラグを持つ。これは「この通話は録音されています」を毎回一字一句そのまま伝える方法であり、あれば嬉しい機能ではなくコンプライアンス上の要件だ。
  • resumptionconversation_idに紐づけてターンをキャッシュし、再接続時に再生する。デフォルトはオフだ。これがないと、WebSocketが切断された時点で会話が失われ、モバイルの発信者は接続を頻繁に切ってしまう。
  • idle_timeout_ms は、無言の発信者にサーバー側からタイマーで再度話しかけさせるもので、応答のたびに再セットされる。これが、辛抱強いエージェントと気まずい沈黙の違いになる。

ドキュメントにある移行アドバイスは予想の逆を行く。システムプロンプトは長くではなく短くするのが正しい。xAIのガイダンスは、既存のプロンプトをそのまま移植するのではなく、Grokに既存プロンプトを一般化するよう頼み、前モデルのエッジケースをパッチするために書かれたプロンプトのハックを取り除くようにというものだ。私自身、モデルのアップグレードのたびに自社のプロンプトでこの作業をしてきた。気は進まないが、たいてい正しい。積み重なった応急処置こそが、プロンプトを徐々に保守不能にしていく原因だ。

実際に本番で機能するのか? 実証データはStarlinkだけ

ベンチマークは一つの側面にすぎない。どちらの発表でも数字が示されている唯一の導入事例は、Grok Voice上で動くStarlinkのセールス・サポート回線であり、xAIがThink Fast 1.0とともに公開した数字は、正確に引用する価値がある。

  • 転換率20%。 販売問い合わせの5件に1件が、Grokとの通話中にStarlinkのサービスを購入している。
  • 解決率70%。 サポート問い合わせの大部分が、人間の介入なしに自律的に解決している。
  • 28個のツール。 一つのエージェントが数十種類のツールを使い、何百ものサポート・セールスのワークフローをこなしている。
  • ハードウェアのトラブルシューティング、ハードウェアの交換、サービスクレジットの付与はすべて自律的に行われている。

これらは強い数字であり、同時にファーストパーティのデータであるため、両刃の剣でもある。StarlinkとxAIはオーナーを同じくしているので、これは最も多くのエンジニアリングの注意が払われた、最良ケースの導入例だ。70%の自律解決率は本物の数字だが、同時にそれは、専任のチームが1つの事業ラインのために28個のツールを構築した結果でもある。

Think Fast 2.0に固有の話として、xAIは同じStarlink回線でのA/Bテストにおいて「販売転換率とサポートの封じ込め率の両方で有意な増加」があったとしているが、どちらも数値は公表していない。その数字が欲しいところだ。数字が出るまでは、2.0はベンチマーク上で優れており、本番でもおそらく優れているが、それはベンダーの言葉に基づいた話、というのが率直な読み方になる。

コミュニティの反応は今のところ薄く、それ自体が、誰が注目しているかを物語っている。Hacker Newsのローンチスレッドはポイント5、コメント2件だった。

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

より参考になるのは、前世代を実際に使い続けてきた人たちの声だ。

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

そして、同じ見方の中でも最もバランスが取れており、私が一番信頼するのがこちらだ。

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

実際に導入を検討すべきなのは誰か

大量の電話回線を運用していて、レイテンシがボトルネックになっているなら、明確に「はい」だ。1秒未満の初回音声応答と、公開されている中で最良のエージェント性能スコアの組み合わせは、他の選択肢に対して僅差の勝負ではない。OpenAI Realtimeとの互換性により、乗り換えの検証は1スプリントではなく1日で済む。ゼロからコールセンター自動化を構築しようとしている人は、候補に入れるべきだ。

スタックを一から組みたくない開発者にとっても明確に「はい」だ。Voice Agent Builderは電話、検索、ガードレール、通話レビューをまとめて提供し、既存の電話番号にはSIPで対応する。4つのベンダーを組み合わせるより実際に時間を節約できるし、代替サービスの多くはさらにプラットフォーム利用料を上乗せしてくる。音声モデルはテキスト側のラインとは別にバージョン管理されているので、Grok 4.5のリリースがこちらに影響することはない点も覚えておいてほしい。

サポート量がメールとチャット中心なら、まだ「はい」ではない。私がよく見かける間違いはこれだ。優れた音声機能を見て、電話のデフレクションプロジェクトを計画し始めるが、実はキューの大半は誰にも電話をかけてこない。音声はチャネルの一つであって、戦略そのものではない。チケットがどこにあるかから始めるべきで、すでに電話回線がヘルプデスクに接続されているなら、Gorgiasの電話統合や同等の仕組みがすでに何をしているかを、追加のスタックを組む前に確認してほしい。

本番投入前に安全性を証明する必要があるなら、まだ「はい」ではない。Think Fast 2.0を自社の過去の通話履歴に対して事前にドライラン検証する公開された方法はない。通話録音、文字起こし、ガードレールはすべてBuilderの中で事後に存在する。それはレビューであってリハーサルではなく、エージェントが返金を実行できる場合にはこの違いが重要になる。同じギャップはカテゴリー全体で見られ、だからこそ誤ったAI回答を防ぐことは、モデルの問題というより多くはプロセスの問題になる。

grok-voice-latestを使っているなら注意してほしい。上の計算機を見てほしい。明日までだ。

あなたのチケットキューにも同じことをしたいなら

Grok Voiceは電話に強い。問題は、多くのサポートチームにとって電話は小さなチャネルであり、実際に量が集中しているのはチケットキューの方だという点だ。

その半分をやるのがeeselだ。Zendesk、Freshdesk、Gorgias、Front、HubSpotなどに接続し、一から書くプロンプトではなく過去のチケット、マクロ、ヘルプセンターから学習し、サポート担当者がすでに開いているヘルプデスクの中で返信を下書き、あるいは送信する。誰も新しいツールを覚える必要はない。

ここまで書いてきたベンチマークと実際のキューとのギャップを踏まえて指摘したいのは、有効化する前にeeselが自社の過去のチケット履歴に対してエージェントをシミュレーションし、どう答えたか、どれくらいの頻度で答えたかを教えてくれる点だ。これが、音声スタックにはないリハーサルの工程だ。私は自信満々に見えるボットが誤った答えを返すのを見てきたから、今朝のチケットではなく先月のチケットでそれを発見したい。

この工程がなぜ重要かについての、あるお客様の見方を紹介する。DTCのサプリメント企業でCXを担当している方から聞いた話を匿名化した引用だ。

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

これは注意書きではなく、設定そのものだ。自信度に基づくルーティング、チケット種別による除外、本番投入前のシミュレーション。

サポートキューの中でAIが下書きした返信を表示するeesel AIヘルプデスクのダッシュボード
サポートキューの中でAIが下書きした返信を表示するeesel AIヘルプデスクのダッシュボード

無料で試すことができ、数分で自分のチケットに答えさせられるようになる。eeselを試す

よくある質問

Grok Voice Think Fast 2.0とは何ですか?

2026年7月29日に発表された、xAIのフラッグシップとなるspeech-to-speechモデルで、3つのサービスを繋ぐのではなく、一つのモデル経路で聞き取り・推論・発話を行う。この単一経路こそが0.70秒という初回音声応答の速さの理由だ。2026年8月5日にgrok-voice-latestの対象となる。目的が通話ではなくメールやチャットであれば、AIヘルプデスクエージェントの方が適している。

Grok Voice Think Fast 2.0の1分あたりの料金はいくらですか?

音声1分あたり$0.08、1時間あたり$4.80、テキスト入力は$0.004。Think Fast 1.0は引き続き1分あたり$0.05なので、Grok Voice Think Fast 2.0の料金は1分あたり60%の値上げにあたる。発行済み番号は1分あたり$0.01追加され、ツール呼び出しは別料金だ。より広いAIカスタマーサービスのコストや、人間のエージェントのコストと比べて検討してほしい。

Grok Voice Think Fast 2.0はGPT-Realtimeより速いですか?

公表されている計測値では、その通り。初回音声応答が0.70秒で、GPT-Realtime-2.1 Highの1.21秒を上回る。ただし全体で最速のモデルではない。Deepslate Opalは0.44秒、Gemini 2.5 Flash Native Audio Dialogは0.63秒と、どちらも品質指標ではさらに下位だ。OpenAI Realtime APIの比較記事では逆側からのトレードオフを扱っており、WebRTC対WebSocketのトランスポート比較も含まれている。

Think Fast 1.0からアップグレードする必要はありますか?

何もしなければの話だ。2026年8月5日にgrok-voice-latestgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0へと向き先を変えるので、それまでに旧バージョンを固定しておくことが、旧モデルにとどまる方法になる。本番環境でのバージョン固定はそもそも良い習慣であり、顧客に見せる前にAIの回答をテストするのと同じ発想だ。

Grok Voice Think Fast 2.0はカスタマーサポートの電話対応に使えますか?

まさにそのために設計されている。Starlinkの回線はGrok Voiceで28個のツールを使い、自律解決率70%、販売転換率20%を実現しており、モデルは関数呼び出し、ドキュメント検索、MCP、人間へのエスカレーションに対応している。現実的な視点はAIはサポートの電話に応答できるかに、運用面は電話サポートの自動化方法AIのエスカレーション管理にまとめている。

Grok Voice Think Fast 2.0の文字起こし精度はどうですか?

xAIは、Think Fast 1.0に対して単語誤り率が1.4倍改善し、Deepgram Nova 3やElevenLabs Scribe v2に対しては24言語で1.5〜2.0倍優れていると報告しており、雑音下ではおよそ10倍まで差が広がる。多言語サポートを運用しているなら、平均値ではなく言語別チャートを確認してほしい。精度は言語によって異なり、CSATを痛めるのはその裾野の部分だからだ。

Grok VoiceはZendeskやGorgiasと連携しますか?

ネイティブには連携しない。Grok Voiceはモデルとビルダーなので、ヘルプデスクへの書き込みは自分で組む関数ツールかMCPサーバーを介することになる。ヘルプデスクの中でAIを使いたいなら、Zendesk AIFreshdeskのFreddyから検討するとよい。電話回線側ではZendesk Talkの構成が最も近いネイティブの選択肢だ。いずれにせよ、音声は同じキューに流れ込むもう一つのチャネルとして扱うべきだ。

Grok Voice Think Fast 2.0はThink Fast 1.0より価値がありますか?

負荷の高いエージェント業務であれば、おそらくそうだ。総合スコアは75.7%対82.9%で、レイテンシはほぼ半分、会話のダイナミクスも17ポイント向上している。1.0ですでに十分解決できているシンプルなFAQ回線であれば、60%の値上げは使わないかもしれない精度に対して払うことになる。自社の解決率コールセンターのROIに照らして検討し、エイリアス任せにしないでほしい。ラインナップ全体を比較するなら、次はxAIの料金を確認すると良い。

Sources

よくある質問

Grok Voice Think Fast 2.0とは何ですか?
xAIのフラッグシップとなるspeech-to-speech音声モデルで、2026年7月29日に発表されました。音声認識、言語モデル、音声合成を別々に繋ぐのではなく、単一のモデル経路で聞き取り・推論・発話を行い、これが0.70秒という初回音声応答の速さにつながっています。2026年8月5日、grok-voice-latestの対象がThink Fast 1.0からこちらに置き換わります。目的が電話ではなくメールやチャットへの対応であれば、AIヘルプデスクエージェントの方が適しています。
Grok Voice Think Fast 2.0の1分あたりの料金はいくらですか?
xAIの料金ページによると、音声1分あたり$0.08(1時間あたり$4.80)、テキスト入力は$0.004です。Think Fast 1.0は引き続き1分あたり$0.05のままです。Voice Agent Builderで電話番号を発行すると1分あたり$0.01が追加され、サーバー側のツール利用は別料金です。契約前に、より広い視点でのAIカスタマーサービスのコストと比較してみてください。
Grok Voice Think Fast 2.0はGPT-Realtimeより速いですか?
Artificial Analysisのテストによれば、その通りです。初回音声応答が0.70秒で、GPT-Realtime-2.1 Highの1.21秒を上回ります。ただし計測されたモデルの中で最速というわけではありません。Deepslate Opalは0.44秒、Gemini 2.5 Flash Native Audio Dialogは0.63秒です。反対側の視点についてはOpenAI Realtime APIの比較記事も参考にしてください。
Grok Voice Think Fast 1.0からアップグレードする必要はありますか?
必須ではありませんが、何もしなければ自動的に切り替わります。2026年8月5日、grok-voice-latestgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0を指すようになります。旧モデルのままの安い料金を維持したい場合は、その日までに明示的にgrok-voice-think-fast-1.0を固定してください。バージョンの固定はxAIも本番運用で推奨しており、誤ったAI回答を防ぐための考え方と同じです。
Grok Voice Think Fast 2.0はカスタマーサポートの電話対応に使えますか?
まさにそのために作られています。Starlinkのセールス・サポート回線はGrok Voiceで28個のツールを使い、70%の自律解決率と、着信への20%の販売転換率を実現しています。関数呼び出し、ドキュメント検索、MCPサーバー、人間へのエスカレーションにも対応しています。AIはサポートの電話に応答できるかもあわせて読む価値があります。
Grok Voice Think Fast 2.0の文字起こし精度はどうですか?
xAIによれば、24言語の短いフレーズ数千件においてThink Fast 1.0比で単語誤り率が1.4倍改善し、Deepgram Nova 3やElevenLabs Scribe v2と比べても1.5〜2.0倍優れているとのことです。ノイズや電話回線の圧縮下ではその差がおよそ10倍まで広がるとされています。この点は多言語サポートを運用している人にとって、見出しの数字以上に重要です。
Grok Voice Think Fast 2.0の料金は他の音声APIと比べてどうですか?
Grokは固定の分単位料金を公表していますが、OpenAIとGoogleはオーディオトークン単位で課金するため、実際のコストはモデルがどれだけ話すかによって変動します。Artificial Analysisが計測した入力音声1時間あたりのコストは、Think Fast 2.0が$4.80、GPT-Realtime-2.1 Highが$10.75、Gemini 3.1 Flash Highが$1.75でした。AIと人間のエージェントのコスト比較で、これらの数字をさらに文脈づけています。
Grok Voice Think Fast 2.0が役に立たない場面はありますか?
あくまで音声モデルなので、電話にならなかったメールやチャットのチケットには何もしませんし、ヘルプデスクの履歴を参照する機能もありません。そこで必要になるのは、過去のチケットで学習し、本番投入前にデフレクションのシミュレーションを行えるエージェントです。両者は綺麗に組み合わさります。電話回線はGrok、キューはヘルプデスクエージェントに任せる形です。

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
音声の波形を挟んで話す開発者とサポートエージェントの線画イラスト、隣にGrokのロゴ
Trending

Grok Voice Think Fast 2.0の料金:$0.08/分の内訳

Grok Voice Think Fast 2.0は音声1分あたり$0.08で、1.0より60%高い。grok-voice-latestのエイリアスは本日切り替わるため、実際の通話ごとの計算を示す。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
xAIのGrok Voice Agent Builderの代替となる6つの音声AIエージェントプラットフォームのイラスト
Guides

2026年に試したいGrok Voice Agent Builderの代替6選

ElevenLabs、Retell AI、Vapi、Bland AI、Synthflow、DeepgramをxAIのGrok Voice Agent Builderと料金・レイテンシー・コンプライアンスの観点で比較。

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
xAIのGrok Voiceスタック上で電話に応答するノーコード音声AIエージェントのイラスト
Guides

Grok Voice Agent Builder速報:xAIのノーコード音声AIを試す

Grok Voice Agent Builderを実際に触ってみたレポート。音声から音声への一体型モデル、1分あたり0.05ドルの料金、2分で完成するビルドフロー、そして実際に向いている用途まで。

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026
3つの異なる音声エージェントの選択肢に話しかける発信者と、左側の Grok ロゴマーク
Alternatives

2026年版 Grok Voice Think Fast 2の代替ツール10選

Grok Voice Think Fast 2.0はデフォルトのエイリアス経路で60%の値上げとなった。実測の時間あたりコストと正直なベンチマーク数値で見る、10個の本物の代替ツール。

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Grokのロゴ、ベンチマークバー、価格タグを描いたGrok 4.5レビューを表すエディトリアルイラスト
Trending

Grok 4.5レビュー: ベンチマーク、価格、そして評価

xAIのGrok 4.5は7月8日に登場し、Intelligence Indexで4位、リーダーボードで最高のエージェント型ツール使用スコアを記録した。ここでは実際のレビュー、ベンチマーク、価格、そして誰が実際に使うべきかを解説する。

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
xAIのGrok Voice Agent Builderのレシートと料金ダイヤルのイラスト
Guides

Grok Voice Agent Builderの料金:実際にかかるコスト

Grok Voice Agent Builderの料金を徹底解説。1分あたり$0.05の音声料金、電話番号やツール呼び出しの追加料金、実際のコスト試算、そしてOpenAIやElevenLabsとの比較まで。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 3, 2026
音声波形を挟んで会話する2人と、上部の Grok ロゴ
AI

Grok Voice Think Fast 2.0レビュー:速くて鋭いが、上限付き

Grok Voice Think Fast 2.0を実際に検証したレビュー。ベンチマークの実態、APIの癖、そして導入可否を左右する同時10セッション上限まで解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Grok Voice Agent Builderレビューのヒーローバナー、xAIのノーコード音声AIエージェントプラットフォーム
Guides

Grok Voice Agent Builderレビュー: xAIの音声AIは使う価値があるか?

xAIのGrok Voice Agent Builderをレビュー。ノーコードのSpeech-to-Speech音声エージェントプラットフォームのアーキテクチャ、ベンチマークの注意点、料金、そして誰に向いているかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
ドル記号が入った料金内訳のグラフを二人で確認している手描きイラスト
Trending

Grok 4.5の料金:API単価、SuperGrokの費用、隠れたコスト

Grok 4.5はAPIで100万トークンあたり$2/$6、コンシューマープランでは月額$30〜$300です。料金の全体像、隠れたコスト、予算立てで気をつけるべき点をまとめました。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める