
本日公開されているGrok Voiceの料金表全体
xAIの料金表のVoice APIセクションに載っているすべての項目に加え、代わりにVoice Agent Builderの発表に載っている電話料金の行も掲載しています。多くのチームが今もつなぎ合わせたパイプラインを運用し、両方の形を比較したいと考えているため、単体の音声認識と音声合成の料金も含めました。
| 項目 | 料金 |
|---|---|
音声対音声、grok-voice-think-fast-2.0 | $0.08 / 分($4.80 / 時間) |
音声対音声、grok-voice-think-fast-1.0 | $0.05 / 分($3.00 / 時間) |
テキスト入力、conversation.item.createごと | $0.004 / メッセージ |
| 提供済みの電話番号(電話サービス) | +$0.01 / 分 |
| 音声認識、REST | $0.10 / 時間 |
| 音声認識、ストリーミング | $0.20 / 時間 |
| 音声合成 | $15.00 / 100万文字 |
web_searchまたはx_search | $5 / 1,000回 |
collections_search / file_search | $2.50 / 1,000回 |
attachment_search | $10 / 1,000回 |
code_execution | $5 / 1,000回 |
| コレクションのストレージ | $0.10 / GiB / 日 |
この表について、声を大にして言いたいことが2つあります。予算を立てる際に人々が誤解しやすい部分だからです。
音声メーターはモデルカードで「送信または受信」された音声の分単位で課金されると説明されており、これだと双方向の会話を二重に数えてしまうように読めます。しかし実際はそうではないようです。Artificial Analysisはこのモデルの入力音声1時間あたりのコストをちょうど$4.80と計測しており、これは$0.08×60です。つまり彼らの検証では、メーターは両方向を合算するのではなく、単一のセッション時間としてカウントしていたことになります。それでも、私の言葉をそのまま信じるより、最初の請求書を確認することをお勧めします。
テキスト入力メーターも見た目より狭い範囲しか対象にしていません。xAIは送信したconversation.item.createイベントごとに$0.004を課金しますが、function_call_outputの項目は課金対象外で、response.createはそもそも課金対象イベントではありません。つまり、ツールを多用する話し好きなエージェントは、返すツール結果ごとにテキスト入力費用が積み上がるわけではありません。これは私が最初に立てて、間違っていた前提でした。
8月5日の切り替え、ドル換算で
この記事が先週ではなく今日公開されている理由はこれだけです。

xAI自身のローンチノートはこの点について直接的です。2026年8月5日にgrok-voice-latestはgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0へ移行し、アップグレードに必要な操作はなく、旧モデルにとどまるにはその前にgrok-voice-think-fast-1.0を固定します。ノートがしていないのは、そこにパーセンテージを添えることで、そのパーセンテージは1分あたり60%です。
ドキュメントは現在まさに切り替えの最中で、これは密かに面白いと感じました。speech-to-speechガイドのモデル表は、依然としてこのエイリアスが1.0を指し、8月5日に更新されると記述している一方、同じページのさらに下の段落では、すでに「常に最新モデル(現在はgrok-voice-think-fast-2.0)を指す」と書かれています。どちらも異なる日には正しかったのです。しかしどちらも、それが請求書にどう影響するかは教えてくれません。
そのすべての隣に、同じローンチ記事の中で、xAIが料金セクションを開く際に使った一文があります。「私たちは料金は予測可能で透明であるべきだと考えています」。実際、これはここでは十分に擁護できる主張だと思います。彼らは1.0を旧料金のまま公開し続け、日付入りの通知を出し、オプトアウトの方法も文書化しました。これは、ほとんどのモデル料金変更が受けるよりも多くの警告です。ただ、それは請求書が予測可能であることとは違います。デフォルトの経路が変わり、そのデフォルトこそが本番トラフィックの大部分が存在する場所だからです。
表示価格が示さないもの
このカテゴリーのどの音声料金表にも同じ特徴があります。見出しの数字こそが、請求書の中で唯一驚きのない項目なのです。ここでは1件の6分間のサポート通話を1行ずつ計算してみます。

- 音声:6分 x $0.08 = $0.48
- 提供済みの電話番号:6分 x $0.01 = $0.06
- ウェブ検索2回:2 x $0.005 = $0.01
- コレクション検索1回:1 x $0.0025 = $0.0025
- テキスト入力3回:3 x $0.004 = $0.012
つまり表示価格$0.48に対して$0.5645、約18%増です。壊滅的ではなく、正直なところこのカテゴリーの中ではむしろ良い比率です。xAIのツール料金が安く、音声料金が固定だからです。しかしこれは線形にスケールし、月額$3,200の音声回線における18%は、誰も予測に入れていなかった$576になります。
最も念入りにモデル化したい項目はweb_searchです。1,000回あたり$5というのは四捨五入の誤差のように見えますが、エージェント型モデルは自分でいくつのツールを呼び出すか決めることを思い出してください。xAIは料金ページでこれを明確に述べています。コストはクエリの複雑さに応じてスケールする、というのはエージェントが選択するからです。このモデルの推論の強さはデフォルトで"high"に設定されており、推論トークンは音声メーターで別途計測されない一方で、より深く考えるモデルはより多くのツールに手を伸ばすモデルでもあります。
追加の3セントが実際にもたらすもの
私なら、より丸いベンチマークのために60%多く支払うことはしないので、実際に何が変わるのかを正直に読み解いてみます。
| 指標 | Think Fast 2.0 | Think Fast 1.0 | 変化 |
|---|---|---|---|
| 入力音声1時間あたりのコスト | $4.80 | $3.00 | +60% |
| Speech-to-speechインデックス | 82.9% | 75.7% | +7.2 pts |
| エージェント性能(τ-voice) | 56.5% | 52.1% | +4.4 pts |
| 会話のダイナミクス | 95.1% | 77.8% | +17.3 pts |
| 音声推論 | 97.2% | 97.1% | 変化なし |
| 最初の音声までの時間 | 0.70s | 1.25s | 44%高速 |
この変化の列は、スコアとしてではなく形として読んでください。音声推論は変化していないので、あなたのエージェントの仕事が文を理解して答えを読み上げることであれば、気づくことのないものに60%多く払っていることになります。動いたのは会話のダイナミクス、プラス17.3ポイントです。これは割り込み処理、バージイン、発話者が話し終えたタイミングの把握、そして0.70秒まで下がったレイテンシーのことです。これらの2つが、電話をキオスクではなく電話らしく感じさせるものです。
エージェント性能は4.4ポイント動き、56.5%になりました。これはArtificial Analysisのspeech-to-speech表で公開されている中で最も高い数字ですが、それでも難しいエージェントシナリオでの失敗率は43.5%です。これは、完全自動化を予算化しようとしている人の前に示したい数字です。また、計画の根拠とする解決率は、ランキングからではなく自分自身のトラフィックから得るべき理由でもあります。
Hacker News上の2人の開発者が、正反対の方向から同じ結論に達しました。一人は感触でモデルを評価しました。
"Grok Voiceは最高の音声AIアシスタントで、それも大差でだ。速度と知性のトレードオフがまさにちょうど良い。"
そしてThink Fast 2.0自体のスレッドでは、最も支持されたコメントがそれを既存の専門ベンダーと比較する形で書かれていました。
"なぜこの投稿がもっと話題にならないのか分からない、これはElevenLabsのような専門の研究所を上回るSOTAの音声モデルだ"
これは良い橋渡しになります。品質でElevenLabsを上回ることと価格で上回ることは別の問題であり、今日現在、その2つの答えは分かれているからです。
Grok Voiceの料金を他の競合と比較する
Artificial Analysisはspeech-to-speechカテゴリー全体について、入力音声1時間あたりの計測コストを公開しています。ベンダーの半数がトークン単位、半数が分単位で課金している中で、これが唯一の公平な比較列です。
| モデル | S2Sインデックス | 計測$/時間 | 最初の音声までの時間 |
|---|---|---|---|
| Qwen Audio 3.0 Realtime Plus | 84.1% | $4.42 | 4.02s |
| Grok Voice Think Fast 2.0 | 82.9% | $4.80 | 0.70s |
| GPT-Realtime-2.1 High | 79.1% | $10.75 | 1.21s |
| GPT-Realtime-2 High | 77.2% | $4.14 | 1.14s |
| Qwen Audio 3.0 Realtime Flash | 76.3% | $4.77 | 4.16s |
| Grok Voice Think Fast 1.0 | 75.7% | $3.00 | 1.25s |
| GPT-Realtime-2.1 Minimal | 72.5% | $11.31 | 0.97s |
| Gemini 3.1 Flash High | 69.5% | $1.75 | 2.99s |
| Deepslate Opal | 62.8% | $6.48 | 0.44s |
この表で順位よりも重要な点が4つあります。
Grokは最も安い優良モデルでもなく、最良のモデルでもありません。 AlibabaのQwen Audio 3.0 Realtime Plusはより高い84.1%のスコアを記録し、$4.42/時間とより安価に計測されています。その問題は最後の列にあります。最初の音声までに4.02秒、Grokの0.70秒に対してです。電話回線ではこれは無音状態で、発話者が話し始めてしまうでしょう。Grokの実際の強みはインデックスとレイテンシーの組み合わせであり、その組み合わせにおいて表の中に競合はいません。
固定料金は過小評価されている特徴です。 Grokの計測値$4.80は、公開価格が1分あたりの固定額であるため、公開価格と同一です。OpenAIのGPT-Realtime-2は入力音声1時間あたり$1.15、出力1時間あたり$4.61と掲載していますが、実際の計測値はすべて含めて$4.14であり、CFOに提示する入力料金は実際に支払う額のわずか約28%にすぎません。このギャップはトリックではなく、トークン単位の音声課金がもたらす結果にすぎません。それがGPT-Realtimeの予算が数字ではなく見積もりになりがちな理由です。
推論を下げても確実にコストが下がるわけではありません。 GPT-Realtime-2.1 Minimalは$11.31/時間と計測され、Highバリアントの$10.75より高いにもかかわらず、スコアは6.6ポイント低くなっています。推論の強度を下げることが音声のコストレバーになると想定していたなら、この行がその反例です。
レイテンシーには独自の価格の下限があります。 Deepslate Opalは0.44秒と計測された中で最速ですが、$6.48/時間かかり、スコアは62.8%です。速さだけなら単独で購入できますが、速さと賢さの両立こそがGrokの料金の存在意義です。
この表に含まれていないものにも注目すべきです。それはプラットフォーム層です。Retell AIのようなオーケストレーションベンダーは、ルーティングするモデルが何であれ、その上にプラットフォーム料金を課すため、彼らの1分あたりの数字と上記の数字は同種の数字ではありません。
VapiとHumeも同じ方式で課金しています。両方のコストをAI音声企業のまとめで計算しましたが、パターンは変わりません。モデル料金とプラットフォーム料金は、同じ単位をまとった異なる製品なのです。
ElevenLabsとの比較は、今日切り替わった当事者であるため独自の段落に値します。そのエージェントプランはプリペイドの分数割り当てです。75分で$6、275分で$22、1,238分で$99、3,738分で$299、12,375分で$990。どれを割ってもほぼ正確にすべての有料プランで含まれる1分あたり$0.08になり、これはGrokの新料金とセント単位で一致します。今朝まで、Grokはそれより37.5%安価でした。残るのは価格の違いではなく課金形態の違いです。ElevenLabsの分数はプリペイドで失効し、Grokは従量課金なので、変動的または季節的な利用量の回線ではGrokが依然有利であり、月中フル稼働する回線では今やコイントスになりました。Cartesia Sonic 3やその他の専門分野でも、同じ課金形態の問題が当てはまります。
料金表より高くつく制限
私はこれらを1分あたりの数字よりも重視しています。予測可能な料金の方が、ブラックフライデーの午後4時に突き当たる上限よりも付き合いやすいからです。
チームあたり同時10セッション。 これはモデルカードに公開されているデフォルトの上限で、リクエストによりさらに高い上限も利用できます。10件の同時通話は小さな受電キューにすぎません。実際の電話回線を設計するなら、同時実行数の増加申請はクレジットカードの登録より先に行うべきです。
最大セッション長120分。 サポート用途には十分ですが、長時間動作するアシスタントを考えていたなら知っておく価値があります。
音声にはバッチ割引も優先プランもありません。 xAIの20%バッチ割引は特定のテキストモデルにのみ適用され、2倍速のPriority Processingも Chat CompletionsとResponsesに限定されています。音声には割引レーンも有料の高速レーンもなく、これは固定のリアルタイムメーターとしては整合的ですが、テキスト側で使えたはずの2つのレバーがなくなります。
エージェントが検索を行う場合、ストレージは別途課金されます。 コレクションはGiBあたり1日$0.10、ファイルは$0.025、ダウンロードはGiBあたり$0.20です。小さなナレッジベースなら微々たるものですが、ヘルプセンター全体を多言語サポートのために同期させるなら、モデルに1行加える価値があります。
ブロックされたリクエストには$0.05の料金があります。 Responses APIのリクエストが生成前に利用ガイドライン違反として検出された場合、xAIは$0.05を課金します。音声特有の項目ではありませんが、大きな請求書の中で説明のつかない丸め誤差のように現れるタイプのものです。
リージョンは1つだけです。 Speech-to-speechはus-east-1でのみ動作し、これは料金というよりレイテンシーとデータ在留地に関する事実ですが、調達審査でそれを問われた瞬間に料金の問題になります。
料金の問題が実際に落ち着く場所
これらすべてを踏まえたうえで、私が下す判断はこうです。
発話者が話を遮り、意見を変え、エージェントが実際に何かをすることを期待するような受電回線を運用しているなら、$0.08の料金は妥当であり、このエイリアス切り替えは受け入れる価値のある値上げです。会話のダイナミクスがプラス17.3ポイント、レイテンシーが0.70秒というのは発話者が感じ取る2つの点であり、表の中でこれらを82.9%のインデックスと組み合わせている他のモデルはありません。
音声エージェントが注文状況を読み上げるだけなら、今日のうちにgrok-voice-think-fast-1.0を固定して$0.05の料金を維持してください。音声推論は1.0でも既に97.1%でした。実際のワークロードに対して品質を犠牲にすることはなく、月10,000分の利用であれば固定することで$300の価値があります。
まだ回線を構築していないなら、モデル化すべき数字は1分あたりの料金ではまったくありません。それは解決した課題あたりのコストであり、それには通話のどれくらいの割合が人間を介さずに終わるかを知る必要があります。これはコールセンターのROIのどの事例の背後にもある同じ算術であり、何かに署名する前にAI対人間エージェントのコストの基準と並べて検討する価値があります。
もう一つ、より柔らかい数字もそのモデルに含めるべきです。より速く、より中断されにくいエージェントはCSATを動かし、CSATは安価な自動化回線が静かに顧客を失わせることを防ぐものです。これは予測が最も難しく、一度落ち込んだときには最も気づきやすい項目です。
音声の請求書は問題の小さい方の半分
私はeeselのSEOを構築し、営業のメモを読んでいますが、うまくいかなくなる料金の会話は、1分あたりの料金が原因でうまくいかなくなることはほとんどありません。うまくいかなくなるのは単位のせいです。
私はこれを利用量カーブの両端から聞いています。Zendesk上で月に7,000から8,000件のエスカレーションチケットを処理する送金・決済フィンテックの運用リーダーは、インタラクション単位の料金はセッション単位の課金と比べて話にならないと私に語りました。1チケットあたり平均4回のやり取りがあるため、メーターがその会話を4回分としてカウントしてしまうからです。月150,000件のチケットに向けて拡大している複数企業のeコマース事業者は、チケットあたり20セントで月約$30,000になると見積もり、その電話のほとんどの時間を、単位がインタラクションなのかチケットなのかを解明しようとするのに費やしていました。どちらも料金が高すぎるかどうかについての議論ではありませんでした。どちらも、料金が実際に何を数えているのかについての議論でした。
それが私がGrokの料金表に当てはめるレンズであり、それを通すとGrokは良く見えます。1分あたりの固定音声メーターは、このカテゴリーの中で最も分かりやすい単位です。それはまた、構造的に成果ではなく時間に対して課金する単位でもあり、それは電話にとってはまさに正しい単位であり、チケットキューにとってはまさに間違った単位です。

Grok Voiceの回線のコストを計算していますか?そのスプレッドシートのもう半分は、電話を鳴らすことのないメールとチャットの量であり、それは分単位で課金されません。eeselは実際に解決したチケットごとに課金するAIヘルプデスクエージェントで、数分でFreshdeskやGorgiasに接続し、ウェブサイトのクロールではなく過去のチケットをもとに学習します。
予測にとって重要な部分はこちらです。実際の顧客に応答する前に、実際のチケット履歴に対してデフレクションシミュレーションを実行するため、スプレッドシートに入れる解決率は、ランキングから借りてきたものではなく、自分自身のキューで計測したものになります。eeselを試すのは無料ですし、あるいはまず料金を見るのもよいでしょう。結局、それがすべてを決めるページのようですから。
請求書が届く前に私がすること
実行する順に、3つの具体的な行動を挙げます。
grok-voice-latestをgrepで検索する。 それが本番コードにあれば、今日からは新しい料金になっています。それが望ましいかどうかを判断し、いずれにせよバージョンを固定してください。xAI自身のドキュメントが本番環境でのバージョン固定を推奨しているのは、まさにこの理由からです。- モデルにツール呼び出しを含めて再予測する。 先月の分数を取り、ツール呼び出しと電話サービスの分15%から20%を加え、その数字を上記の計算機と照合してください。音声の行だけが全体になることはありません。
- 必要になる前に同時実行数の増加を申請する。 同時10セッションはデフォルトであって上限ではありません。増加は申請が必要であり、申請にはトラフィックの急増よりも長い時間がかかります。
以上のことは、このモデルを避ける理由にはなりません。Think Fast 2.0は公開されている数字の中で最も強力なエージェント型音声モデルであり、計測値で1時間あたり$4.80というのは、OpenAIの最良のリアルタイムプランのコストの半分未満です。これはただ、あなたのモデル文字列のどれが動く標的であり、それが動いたときに請求書がどうなるかを知っておくべき理由にすぎません。同じ規律がエスカレーション対応や誤った回答の防止にも当てはまります。デフォルトは、あえて自分で選んだであろう設定であることはほとんどありません。
このクラスターの残りについては、Think Fast 2.0の概要がモデル自体の変更点を扱っています。Voice Agent Builderの料金の記事は、その上に乗るノーコードプラットフォームを扱っており、料金表よりワークフローを知りたい場合には実践的なBuilderレビューもあります。
音声がそもそも適切なチャネルかどうかまだ迷っていますか?まずはAIはサポート通話に応答できるかから始めて、次により広いAI電話通話の解説をご覧ください。
発話者がすでにZendesk Talkのようなヘルプデスクの電話プロダクトを通じてあなたに連絡しているなら、自社構築か購入かの問題が1分あたりの料金の問題より先に来ます。サポート自動化のまとめがその近道です。
よくある質問
なぜGrok Voiceの料金は60%上がったのですか?
grok-voice-latestが2026年8月5日に1.0から2.0へ切り替わったことで、エイリアスを使っている人は自分では何もデプロイしていないのに高い料金を引き継いだからです。バージョンを固定するのが対処法であり、それは誤ったAI回答の防止が依拠しているのと同じバージョン固定の規律です。Grok Voice Think Fast 2.0はOpenAIのRealtime APIより安いですか?
Grok Voice Think Fast 2.0に無料プランはありますか?
実際のGrok Voiceサポート通話には実際どれくらいの料金がかかりますか?
web_searchまたはx_searchは1,000回あたり$5、コレクション検索は1,000回あたり$2.50、添付ファイル検索は1,000回あたり$10です。コールセンターの自動化のコストを計算するときと同様に、分数だけでなくツール呼び出しもモデル化してください。Grok Voiceの料金はElevenLabs Agentsと比べてどうですか?
Grok Voice APIのレート制限は何ですか?
Grok Voice Think Fast 2.0は1分あたり追加の3セントに見合いますか?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








