
現在公開されているGrok Voiceの料金表全体
これはVoice APIセクションにあるxAIの料金表すべてに、代わりにVoice Agent Builderの発表に載っている電話回線の行を加えたものだ。単体の文字起こし・音声合成の料金も含めた。多くのチームが今も分離型パイプラインを運用しており、両者の形を比較したいはずだからだ。
| 項目 | 料金 |
|---|---|
Speech to speech, grok-voice-think-fast-2.0 | $0.08 / 分 ($4.80 / 時) |
Speech to speech, grok-voice-think-fast-1.0 | $0.05 / 分 ($3.00 / 時) |
テキスト入力(conversation.item.createごと) | $0.004 / メッセージ |
| 専用電話番号(テレフォニー) | +$0.01 / 分 |
| Speech to text, REST | $0.10 / 時 |
| Speech to text, ストリーミング | $0.20 / 時 |
| Text to speech | $15.00 / 100万文字 |
web_search または x_search | $5 / 1,000回 |
collections_search / file_search | $2.50 / 1,000回 |
attachment_search | $10 / 1,000回 |
code_execution | $5 / 1,000回 |
| コレクションのストレージ | $0.10 / GiB / 日 |
この表について声を大にして言いたいことが2つある。予算を組むときに人がよく間違える部分だからだ。
音声メーターはモデルカードで「送受信された」音声1分ごとに課金されると説明されており、双方向の会話で二重計上されるように読める。だが実際にはそうではないようだ。Artificial Analysisが実測した入力音声1時間あたりのコストはこのモデルでちょうど$4.80で、これは$0.08の60倍にあたる。つまり彼らの計測では、メーターは双方向を合算するのではなく、単一のセッション時間としてカウントされていたことになる。とはいえ、自分の目で最初の請求書を確認するに越したことはない。
テキスト入力メーターも見た目より狭い範囲にしか課金されない。xAIは送信したconversation.item.createイベント1件につき$0.004を課金するが、function_call_outputアイテムは課金対象外で、response.createはそもそも課金イベントですらない。つまりツールを多用するチャットボットでも、ツールの結果を返すたびにテキスト入力料金が積み上がるわけではない。これは私が最初に立てて間違っていた前提だった。
8月5日の切り替えを金額で見る
これこそ、この記事が先週ではなく今日公開されている理由そのものだ。

xAI自身の発表ノートはこの点を率直に説明している。2026年8月5日にgrok-voice-latestはgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0へ切り替わり、アップグレードに必要な操作はなく、旧モデルにとどまりたい場合は事前にgrok-voice-think-fast-1.0を固定しておく必要がある。ノートがしていないのは、その隣にパーセンテージを書くことだ。そのパーセンテージとは1分あたり60%である。
ドキュメントが現在まさに切り替えの途中にあるのが、地味に面白かった。speech-to-speechガイドのモデル表は今もエイリアスが1.0を指しており8月5日に更新されると説明しているが、同じページのさらに下の段落ではすでに「常に最新モデル(現在はgrok-voice-think-fast-2.0)を指す」と書かれている。どちらも異なる日には正しかった。ただし、どちらも請求書がどうなるかは教えてくれない。
そのすぐ隣、同じ発表記事の中でxAIは料金セクションをこう書き出している。「私たちは料金は予測可能で透明であるべきだと信じている」。この点については、私は実際に擁護できると思う。彼らは1.0を旧料金のまま公開し続け、日付入りの通知を出し、オプトアウトの方法も文書化した。これはたいていのモデル値上げよりも十分な予告だ。ただし、それは請求額が予測可能であることとは別の話だ。デフォルトの挙動が変わり、そしてほとんどの本番トラフィックはそのデフォルトの上で動いているからだ。
ステッカー価格が語らないもの
このカテゴリのすべての音声料金表には同じ特徴がある。見出しの数字こそ、請求書の中で唯一「驚きのない」項目なのだ。ここでは6分間のサポート通話1件を、行ごとに費用計算してみる。

- 音声:6分 x $0.08 = $0.48
- 専用電話番号:6分 x $0.01 = $0.06
- ウェブ検索2回:2 x $0.005 = $0.01
- コレクション検索1回:1 x $0.0025 = $0.0025
- テキスト入力3件:3 x $0.004 = $0.012
合計は$0.5645で、表示価格$0.48に対して約18%上乗せとなる。壊滅的というほどではなく、正直このカテゴリの中ではむしろ良い方の比率だ。xAIのツール料金は安く、音声料金は定額だからだ。だがこれは線形にスケールするため、月額$3,200の音声回線であれば18%は誰も予算に入れていなかった$576にあたる。
私が最も慎重にモデル化したいのはweb_searchだ。1,000回あたり$5と聞くと誤差のように見えるが、エージェント型モデルは自分自身でいくつツールを呼ぶかを判断することを思い出してほしい。xAIも料金ページではっきりと書いている。エージェントが選択するため、コストはクエリの複雑さに応じてスケールする、と。このモデルの推論負荷はデフォルトで"high"に設定されており、推論トークン自体は音声メーターで個別に課金されないものの、より深く考えるモデルは、より多くツールに手を伸ばすモデルでもある。
追加の3セントが実際に買っているもの
より丸いベンチマークのために60%も余分に払う気にはならないので、実際に何が変わったのかを正直に見てみよう。
| 指標 | Think Fast 2.0 | Think Fast 1.0 | 変化 |
|---|---|---|---|
| 入力音声1時間あたりのコスト | $4.80 | $3.00 | +60% |
| Speech-to-speechインデックス | 82.9% | 75.7% | +7.2ポイント |
| エージェント性能(τ-voice) | 56.5% | 52.1% | +4.4ポイント |
| 会話のダイナミクス | 95.1% | 77.8% | +17.3ポイント |
| 音声推論 | 97.2% | 97.1% | 横ばい |
| 最初の音声応答までの時間 | 0.70秒 | 1.25秒 | 44%高速化 |
この変化の列は、点数としてではなく形として読んでほしい。音声推論はほとんど動いていないので、エージェントの仕事が文を理解して答えを読み上げるだけなら、体感できない部分に60%多く払っていることになる。動いたのは17.3ポイント上がった会話のダイナミクスで、これは割り込み処理、バージイン、話者が話し終えたタイミングの認識、そしてレイテンシが0.70秒まで下がったことを指す。この2つこそ、電話がキオスク端末ではなく本物の電話らしく感じられるかどうかを決める要素だ。
エージェント性能は4.4ポイント動いて56.5%になった。これはArtificial Analysisのspeech-to-speech表の中で最も高い公開値であり、それでもなお難易度の高いエージェントシナリオでは43.5%の失敗率があることになる。これは完全自動化を予算計画する誰もが知っておくべき数字だ。また、これは計画に使うべき解決率を、リーダーボードから借りるのではなく自分のトラフィックから測定すべき理由でもある。
Hacker Newsの2人の開発者は、正反対の視点から同じ結論にたどり着いた。1人は感触でモデルを評価している。
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right."
そしてThink Fast 2.0のスレッド自体では、トップコメントが既存の専門ベンダーと比較する形で評していた。
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
これは良い橋渡しになる。品質でElevenLabsを上回ることと、価格でElevenLabsを上回ることは別の問題であり、今日という日を境にその2つの答えは分岐したからだ。
Grok Voiceの料金を他の選択肢と比べる
Artificial Analysisは、speech-to-speechカテゴリ全体について入力音声1時間あたりの実測コストを公開している。ベンダーの半分がトークン単位で、半分が分単位で課金する中、これが唯一の横並び比較が可能な列だ。
| モデル | S2Sインデックス | 実測$/時 | 最初の音声応答までの時間 |
|---|---|---|---|
| Qwen Audio 3.0 Realtime Plus | 84.1% | $4.42 | 4.02秒 |
| Grok Voice Think Fast 2.0 | 82.9% | $4.80 | 0.70秒 |
| GPT-Realtime-2.1 High | 79.1% | $10.75 | 1.21秒 |
| GPT-Realtime-2 High | 77.2% | $4.14 | 1.14秒 |
| Qwen Audio 3.0 Realtime Flash | 76.3% | $4.77 | 4.16秒 |
| Grok Voice Think Fast 1.0 | 75.7% | $3.00 | 1.25秒 |
| GPT-Realtime-2.1 Minimal | 72.5% | $11.31 | 0.97秒 |
| Gemini 3.1 Flash High | 69.5% | $1.75 | 2.99秒 |
| Deepslate Opal | 62.8% | $6.48 | 0.44秒 |
この表からはランキング以上に読み取るべきことが4つある。
Grokは最安の優良モデルでもなければ、最高性能のモデルでもない。 AlibabaのQwen Audio 3.0 Realtime Plusはスコアで84.1%と上回り、コストも$4.42/時と安い。問題は最後の列だ。最初の音声応答まで4.02秒かかり、Grokの0.70秒とは対照的だ。電話回線の上では、それは発信者が話し始めてしまうほどの無音時間になる。Grokの本当の強みはインデックスとレイテンシの組み合わせであり、この組み合わせにおいて表の中に競合はいない。
定額料金は過小評価されている強みだ。 Grokの実測$4.80は公開価格と同一だ。公開価格自体が1分あたりの定額だからだ。OpenAIのGPT-Realtime-2は入力音声1時間あたり$1.15、出力音声1時間あたり$4.61と掲載しているが、実測では合計$4.14になる。つまりCFOに提示する入力レートは、実際に支払う金額の約28%にすぎない。このギャップは何かの罠ではなく、トークン単位の音声課金が単にそういうものだというだけだ。だからこそGPT-Realtimeの予算は、数字というより見積もりになりがちだ。
推論を弱めても、必ずしもコストは下がらない。 GPT-Realtime-2.1 Minimalは$11.31/時と、Highバリアントの$10.75より高く実測されているのに、スコアは6.6ポイント低い。推論負荷のダイヤルを下げればコストが下がると思っていたなら、この行が反例になる。
レイテンシにも独自のコストの下限がある。 Deepslate Opalは実測で最速の0.44秒だが、時間あたり$6.48でスコアは62.8%だ。速さだけなら単体で買えるが、速くて賢いというのがGrokの料金の存在理由だ。
この表に含まれていないものにも触れておく価値がある。プラットフォーム層だ。Retell AIのようなオーケストレーションベンダーは、どのモデルにルーティングするかにかかわらずプラットフォーム料金を上乗せするため、その1分あたりの数字と上記の数字は種類の異なる数字だ。
VapiとHumeも同じ価格構造だ。私はAI音声企業のまとめで両方のコストを計算しており、パターンは変わらない。モデル料金とプラットフォーム料金は、同じ単位をまとった別々の商品なのだ。
ElevenLabsとの比較には独立した段落を割く価値がある。今日変わったのがまさにここだからだ。ElevenLabsのエージェントプランは前払いの分数枠だ。75分で$6、275分で$22、1,238分で$99、3,738分で$299、12,375分で$990。どれを割っても、含まれる1分あたりほぼ正確に$0.08になり、これはGrokの新料金と1セント単位で一致する。今朝までGrokはそれを37.5%下回っていた。残るのは価格ではなく課金の形の違いだ。ElevenLabsの分数は前払いで期限があり、Grokは純粋な従量課金なので、スパイク的あるいは季節性のある回線は依然としてGrokが有利で、月間を通じてフル稼働する回線はもはやコイントスに近い。Cartesia Sonic 3をはじめとする専門ベンダー各社にも、同じ課金形状の問いが当てはまる。
料金表より高くつく制限
私はこちらの方が1分あたりの料金より気になっている。予測できる料金の方が、ブラックフライデーの午後4時に突然ぶつかる上限よりも付き合いやすいからだ。
チームあたり同時10セッション。 モデルカードに公開されているデフォルトで、申請すればより高い上限にできる。同時10通話は小さな受電キューにすぎない。本物の電話回線を規模設計しているなら、クレジットカードより先に同時接続数の申請を出すべきだ。
最大セッション120分。 サポート用途には十分だが、長時間稼働するアシスタントを考えているなら知っておく価値がある。
音声にはバッチ割引もプライオリティ枠もない。 xAIの20%バッチ割引は特定のテキストモデルのみが対象で、2倍速のPriority Processingも Chat CompletionsとResponsesに限定されている。音声には割引レーンも有料の優先レーンもなく、これはリアルタイムの定額メーターとしては一貫しているものの、テキスト側にあるレバーが2つ失われていることになる。
エージェントが検索を行う場合、ストレージは別料金になる。 コレクションはGiBあたり1日$0.10、ファイルは$0.025、ダウンロードはGiBあたり$0.20。小さなナレッジベースなら微々たるものだが、多言語サポート向けにヘルプセンター全体を同期しているなら、モデルに一行加えておく価値がある。
ブロックされたリクエストには$0.05の手数料がある。 Responses APIのリクエストが生成前に利用規約違反として検知された場合、xAIは$0.05を課金する。音声特有の項目ではないが、大きな請求書の中で説明のつかない端数のように現れる類のものだ。
リージョンは1つだけ。 speech to speechはus-east-1でのみ稼働しており、これは料金ではなくレイテンシとデータ所在地の事実だが、調達審査でその点を聞かれた瞬間に料金の話になる。
料金の判断がどこに落ち着くか
ここまでの材料を並べた上で、私ならこう判断する。
発信者が割り込み、考えを変え、エージェントに実際に何かを実行してほしいと期待するような着信専用の電話回線を運用しているなら、$0.08という料金は妥当で、このエイリアス切り替えは受け入れる価値のある値上げだ。会話のダイナミクスが17.3ポイント上がり、レイテンシが0.70秒になったこと。この2つこそ発信者が体感するもので、表の中で82.9%のインデックスとこの2つを両立させているモデルは他にない。
音声エージェントの仕事が注文状況の読み上げ程度なら、今日のうちにgrok-voice-think-fast-1.0を固定して$0.05の料金を維持すればいい。音声推論は1.0の時点ですでに97.1%だった。今の作業量に対して品質を犠牲にしているわけではなく、月間10,000分であれば固定は$300の価値がある。
まだ回線を構築していないなら、モデル化すべき数字はそもそも1分あたりの料金ではない。解決済み案件1件あたりのコストであり、それには人手を介さずに終わる通話の割合を知る必要がある。これはコールセンターROIのケースを考えるときと同じ算数であり、何かに署名する前にAIと人間エージェントのコスト比較のベースラインと並べて検討する価値がある。
そのモデルにはもう1つ、より柔らかい数字を入れておくべきだ。速く、割り込まれにくいエージェントはCSATを動かし、CSATこそ安価な自動化回線が知らぬ間に顧客を失うのを食い止めるものだ。予測が最も難しく、下がってから初めて気づきやすい数字でもある。
音声料金は問題の小さい半分にすぎない
私はeeselのSEOを担当しつつセールスのメモにも目を通しているが、料金の話がこじれる原因は1分あたりの料金であることはほとんどない。こじれるのはいつも単位についてだ。
利用規模の両極から同じ話を聞いてきた。Zendesk上で月間7,000から8,000件のエスカレーション案件を処理している送金・決済系フィンテック企業の運用リーダーは、1インタラクションごとの課金はセッション単位課金に比べて論外だと語ってくれた。1チケットあたり平均4往復のやり取りがあるとすれば、メーターは同じ会話を4回カウントすることになるからだ。月間15万件のチケットへと拡大を目指す複数企業運営のEコマース事業者は、チケット1件あたり20セントで計算すると月額約$30,000になると試算し、その単位がインタラクションなのかチケットなのかを確かめることに通話時間の大半を費やしていた。どちらのケースも、料金が高すぎるかどうかの議論ではなかった。どちらも、その料金が何をカウントしているのかという議論だった。
その視点でGrokの料金表を見ると、実はかなり評価できる。定額の1分あたり音声メーターは、このカテゴリの中で最も分かりやすい単位だ。ただし構造上、それは成果ではなく時間に対して課金する単位でもあり、電話1本には正しくても、チケットキューには正しくない単位だ。

Grok Voiceの回線コストを計算しているところなら、そのスプレッドシートのもう半分は、電話を鳴らさずに終わるメールやチャットの件数であり、それは1分単位では課金されない。eeselはAIヘルプデスクエージェントであり、実際に解決したチケットごとに課金し、数分でFreshdeskやGorgiasに接続でき、ウェブサイトのクロールではなく過去のチケットで学習する。
予測にとって重要なのはここだ。eeselは実際の顧客に回答する前に、あなたの過去のチケット履歴に対してデフレクションシミュレーションを実行するため、スプレッドシートに入れる解決率はリーダーボードから借りたものではなく、自分のキューで測定したものになる。eeselを試すのは無料だし、先に料金を見ることもできる。結局のところ、すべてを決めるのはそのページらしいから。
請求書が届く前にやっておくこと
私ならこの順番で3つの具体的な行動を取る。
grok-voice-latestをグレップする。 本番コードにあるなら、今日の時点で新料金に乗っていることになる。それが望んだ結果かどうかを判断した上で、どちらにせよバージョンを固定すること。xAI自身のドキュメントも本番環境ではバージョン固定を推奨しており、まさにこれがその理由だ。- ツール呼び出しを織り込んで再予測する。 先月の通話分数を取り、ツール呼び出しと電話回線分として15〜20%を加算し、上の計算機と照らし合わせる。音声の行だけで全額になることは決してない。
- 必要になる前に同時接続数の引き上げを申請する。 同時10セッションはデフォルトであって上限ではない。引き上げは申請制であり、申請にはトラフィックの急増よりも時間がかかる。
だからといってこのモデルを避ける理由にはならない。Think Fast 2.0は公開されている数字の中で最も強力なエージェント型音声モデルであり、実測で1時間$4.80というのは、OpenAIの最高性能リアルタイムティアの半分未満だ。理由になるとすれば、自社のどのモデル文字列が動く標的なのかを把握し、それが動いたときに請求額がどうなるかを知っておくべきだということだけだ。同じ規律はエスカレーション処理や誤答の防止にも当てはまる。デフォルトが、あなたが意図的に選んだであろう設定であることは滅多にない。
このクラスターの残りについては、Think Fast 2.0の概要がモデル自体の変更点をカバーしている。Voice Agent Builderの料金の記事はその上に乗るノーコードプラットフォームを扱っており、料金表よりワークフローを見たいなら実際に触ったBuilderのレビューもある。
そもそも音声が適切なチャネルかまだ迷っているなら、AIはサポート電話に対応できるかから始めて、より広いAI電話対応の解説に進んでほしい。
すでにZendesk Talkのようなヘルプデスク電話プロダクト経由で発信者と接しているなら、1分あたりの料金より先に「自前で作るか、買うか」という問いがある。私のサポート自動化まとめがその近道になる。
よくある質問
なぜGrok Voiceの料金は60%も上がったのですか?
grok-voice-latestが2026年8月5日に1.0から2.0へ切り替わったためで、エイリアスを使っていた人はデプロイなしで高い料金に移行した。バージョンを固定するのが対策であり、それはAIの誤答を防ぐのと同じバージョン固定の規律だ。Grok Voice Think Fast 2.0はOpenAIのRealtime APIより安いですか?
Grok Voice Think Fast 2.0に無料プランはありますか?
実際のGrok Voiceサポート通話の請求額はいくらになりますか?
web_searchまたはx_searchは1,000回あたり$5、コレクション検索は1,000回あたり$2.50、添付ファイル検索は1,000回あたり$10だ。コールセンター自動化のコストを見積もるときと同様に、分数だけでなくツール呼び出しもモデル化すべきだ。Grok VoiceとElevenLabs Agentsの料金はどう比較されますか?
Grok Voice APIのレート制限は何ですか?
Grok Voice Think Fast 2.0は1分あたり追加3セントの価値がありますか?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








