2026年、Grok Voice Think Fast 2の代替となる10のサービス
Riellvriany Indriawan
Katelin Teen
最終更新 August 4, 2026

まとめ
2026年8月5日、grok-voice-latestというエイリアスがThink Fast 1.0から2.0へ向き先を変え、デフォルトの経路のコストが$0.05/minから$0.08/minへ上がった。デプロイを一切していないのに60%の上昇だ。他にも2つの要因が、乗り換えを検討させるきっかけになっている。同時接続の上限はチームあたり10セッションと公開されている。そして音声はus-east-1のみで稼働し、他のリージョンでは動かない。
次は少し気まずい話だ。数字だけで見ると、品質と速度の両方でGrok Voice Think Fast 2.0を上回るものは他にない。Qwen Audio 3.0 Realtime PlusはArtificial Analysisでより高いスコアを出す唯一のモデルだが、最初の音声が出るまでに4.02秒かかる。Grokの0.70秒に対してだ。つまり誠実な答えは、買い物リストではなく段階を踏むはしごのようなものになる。最も安い段はgrok-voice-think-fast-1.0を固定し、$3.00/hrを払うこと。次の段は別のモデルAPIへ乗り換えること。最後の段はプラットフォームを丸ごと購入し、電話番号とテストツールのために1分あたり30%から75%多く払うことだ。
最後にもう一つ、これは毎日サポートキューで働いている立場から言う。盤面で最良のボイスモデルでも、サポートタスクを完了できるのは56.5%だけだ。だからこの10社の中から選ぶのに四半期を費やす前に、そもそもその通話の何割が、メールやチャットが放置されたことで生まれたものかを考えてほしい。eeselはその部分を、席数課金ではなく解決件数課金で処理する。始めるにも、はるかに安い場所だ。
そもそもなぜGrok Voice Think Fast 2の代替を探すのか
まずxAIに公平を期そう。このモデルは良い。独立して測定しても、xAIが公開した数値は裏付けられる。音声推論で97.2%、Full Duplex Benchで95.1%、最初の音声が出るまでは0.70秒。2025年に電話エージェントを作っていた人なら、こんなものは他になかった。このモデルはThink Fast 2.0のレビューで詳しく分解し、その仕組みはローンチの内訳記事にまとめている。
つまり品質は、誰かが離れていく理由ではない。実際に挙げられる3つの理由はすべて構造的なもので、お金に関するものはThink Fast 2.0の価格に関する記事で一通りカバーした。
デフォルト経路の価格が60%上がった。 Speech to SpeechはxAIの価格ページで、grok-voice-think-fast-1.0が$0.05/min、2.0が$0.08/minと記載されており、いずれもテキスト入力イベント1件あたり$0.004が追加される。2.0のレート自体に秘密はない。人々を驚かせたのは、grok-voice-latestが以前は1.0を指していたことで、speech-to-speechガイドには2026年8月5日に2.0への移行があったと記載されている。つまり本番環境の文字列がこのエイリアスなら、リポジトリ側で何も変更していないのに、1分あたりのコストが一晩で60%上がったということだ。

同時10セッションは本物の上限だ。 モデルカードにはチームあたり同時10セッション、加えて1セッション最大120分と記載されている。xAIに依頼すれば引き上げてもらえる。それ自体は普通のことだが、問題はこのデフォルト値こそが、実際にローンチを計画する際の目安になる数字だという点だ。10件の同時通話は、10人のエージェントを抱えるチームにとっては忙しい火曜午後にすぎない。ストレステストの数字ではない。
リージョンは1つだけ、優先レーンもなく、割引もない。 音声はus-east-1だけで動き、それ以外では動かない。xAIの2つのコスト調整レバーの外にも置かれている。20%のバッチ割引はテキストモデル向け、2倍の優先ティアはChat CompletionsとResponsesが対象だ。音声にはどちらも適用されないので、コストを下げる方法もスループットを上げる方法もない。
これらの問題はそれぞれ解決策が異なる。多くの代替案リストはこの違いを一緒にまとめてしまっているので、ここでははっきり分けて示す。

この10社をどう選んだか
3つのルールと、隠すよりも声に出して言っておきたい留意点がひとつある。
ルール1。数字はベンダー自身のページ、またはArtificial Analysisから取っている。AAはすべてのモデルに同じ3つのベンチマークを実行する。音声推論のBig Bench Audio、ターンテイキングのFull Duplex Bench、そしてサポートタスクが実際に完了したかを問うtau-Voiceだ。この最後のtau-Voiceが最も引用されないのに、最も重要だ。だからこそボイスサポートのまとめ記事は、ベンダーが掲げるコンテインメントの主張ではなく、この指標を軸に組み立てた。
ルール2。モデルの乗り換えとプラットフォームの乗り換えは分けたままにする。これらは競合する購入ではないからだ。モデルAPIはWebSocketだけを提供し、それ以外は何もない。プラットフォームは電話番号、通話ログ、テストツールを提供し、そのぶん1分あたりの料金は30%から75%高い。両者を1つの順位付きリストに混ぜると、$0.08と$0.14を、まるで同じものを買っているかのように比較してしまうことになる。
そして留意点だ。モデル層の4つの選択肢には、見せられる製品UIが存在しない。APIエンドポイントだからだ。xAIのドキュメントやローンチ記事にはスクリーンショットが一切ない。だからモデルのセクションはベンチマークの行と文書化された動作に依拠し、プラットフォームのセクションは実際の製品キャプチャから始まる。ストック画像で4つのセクションを埋めるより、正直にそう言っておくほうがいい。
Grok Voice Think Fast 2の代替を比較する
実測コストの列は2回読んでほしい。この数字は、Artificial Analysisが固定のワークロードを実行し、実際に1時間あたりいくらかかったかを報告したものであり、価格ページに載っているリスト価格とは違うものだ。Grokは分単位の固定メーターで課金するので、実測の$4.80はリストの$4.80とそのまま一致する。トークン課金のモデルは、そこから大きくずれる。
| 選択肢 | レイヤー | AA指数 | 音声推論 | ターンテイキング | tau-Voice | 最初の音声までの時間 | 実測$/hr | 課金形態 | 公開された同時接続数 | 電話番号 | テストツール |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Grok Voice Think Fast 2.0 | モデルAPI | 82.9% | 97% | 95.1% | 56.5% | 0.70s | $4.80 | 分単位固定 | 10セッション | アドオン、+$0.01/min | Playgroundのみ |
| Grok Voice Think Fast 1.0 | モデルAPI | 75.7% | 97% | 77.8% | 52.1% | 1.25s | $3.00 | 分単位固定 | 10セッション | アドオン、+$0.01/min | Playgroundのみ |
| GPT-Realtime-2.1 High | モデルAPI | 79.1% | 96% | 95.7% | 45.7% | 1.21s | $10.75 | トークン課金 | 非公開 | なし | なし |
| Qwen Audio 3.0 Realtime Plus | モデルAPI | 84.1% | 99% | 98.4% | 54.6% | 4.02s | $4.42 | トークン課金 | 非公開 | なし | なし |
| Gemini 3.1 Flash High | モデルAPI | 69.5% | 97% | 74.3% | 37.7% | 2.99s | $1.75 | トークン課金 | 非公開 | なし | なし |
| ElevenLabs Agents | プラットフォーム | 未採点 | 未採点 | 未採点 | 未採点 | 非公開 | ~$4.80 | 事前購入分 | 40通話(Business) | あり、含まれる | あり |
| Vapi | プラットフォーム | 未採点 | 未採点 | 未採点 | 未採点 | 非公開 | ~$6.30 | 分単位で組み立て | 1回線$10 | あり | あり、実料金で課金 |
| Retell AI | プラットフォーム | 未採点 | 未採点 | 未採点 | 未採点 | 非公開 | ~$8.10 | 分単位で組み立て | 非公開 | あり | あり、+$0.10/min |
| Bland AI | プラットフォーム | 未採点 | 未採点 | 未採点 | 未採点 | 非公開 | ~$8.40 | 分単位バンドル | 非公開 | あり | あり |
| PolyAI | プラットフォーム | 未採点 | 未採点 | 未採点 | 未採点 | 非公開 | 見積もりのみ | 分単位、見積もり | 非公開 | あり、SLA 99.9% | あり |
| Parloa | プラットフォーム | 未採点 | 未採点 | 未採点 | 未採点 | 非公開 | 見積もりのみ | タスクの複雑さによる | 非公開 | あり | あり、実通話で |
ベンチマークと実測コストの列はArtificial Analysisのspeech-to-speechテーブルから取っている。プラットフォームの時間あたりの数字はこちらで算出したもので、各ベンダーが公開している分単位のレートを単純に換算しただけなので、実測結果としてではなく、同等条件での換算値として読んでほしい。
乗り換えたい理由を選んでください
バージョンを固定する。移行はしない。
文字列を1つだけgrok-voice-latestからgrok-voice-think-fast-1.0に変えれば、$0.05/minに戻る。音声推論の97%というスコアは同じまま維持できるが、ターンテイキングの品質(77.8%対95.1%)と応答時間0.5秒分を犠牲にする。
月5,000分の利用なら$400ではなく$250になる。同じクライアント、同じWebSocket、設定1行だけの変更だ。
モデルを乗り換える、または同時接続数を買う。
セッション上限はアカウントの制限であり、モデルの制限ではない。だから他のプロバイダーに乗り換えればこの制限は回避できる。GPT-Realtime-2.1はワイヤー互換なので、クライアント側の変更はほとんど不要だ。同時接続数そのものを買いたいなら、ElevenLabs Businessは40件の同時通話を公開し、Vapiは1本$10で回線を販売している。
まずxAIに上限を上げてもらえるか頼んでみること。無料で、10という数字はデフォルト値であり、厳密な上限ではない。
必要なのはモデルではなくプラットフォームだ。
稼働率の保証付きで電話番号を売ってくれるモデルAPIは存在しない。PolyAIは見積もりで99.9%の電話SLAと24時間365日の緊急対応ラインを提示し、Bland は無料プランを含む全ティアで99.9%を公開している。Parloaは唯一、自社の過去の実際の通話に対してテストを行うベンダーだ。
生モデルの$0.08に対し、オールインで1分あたり$0.105から$0.14を見込んでおくこと。
4つの直接的なモデル乗り換え先
4つとも、Grok Voiceと同じ種類の買い物だ。WebSocket、モデルの文字列、分単位の課金。移行の手間は、設定1行の変更からクライアントの書き直しまで幅がある。
個別の評価に入る前に1つチャートを見てほしい。この記事のために作った中で最も役に立つものだ。Think Fast 2.0より品質も速度も両方で優れているモデルを探した。そんなものは存在しない。

1. Grok Voice Think Fast 1.0
最適な用途: 今日の午後にでも、移行作業なしで音声代を37.5%削減したい場合。
このモデルをリストに入れる人はほとんどいない。ずるをしているように感じるからだと思う。grok-voice-think-fast-1.0は今でも価格ページで$0.05/minのままで、固定するのに必要なのは文字列1つの変更だけだ。Artificial Analysisは入力音声1時間あたり$3.00と測定しており、2.0の$4.80と比べて安い。
もちろん犠牲にするものもある。それが何なのかを正確に知っておく価値はある。音声推論は97%とほぼ同じだが、tau-Voiceは56.5%から52.1%へ下がる。つまりタスク完了率で約4ポイントの差だ。本当のギャップが開くのは会話のダイナミクスの部分だ。Full Duplex Benchは95.1%から77.8%に落ち込む。これは、割り込みやバックチャネルをきれいに処理できるモデルと、人の話に被せて話してしまうモデルの差だ。最初の音声までの時間もほぼ倍になり、0.70秒から1.25秒になる。
価格: $0.05/min($3.00/hr)にテキスト入力イベント1件あたり$0.004が加算される。同じ10セッションの上限、同じus-east-1。
評価: 台本があり、割り込みの少ないフロー(注文状況の確認、予約確認、営業時間の案内など)であれば、1.0への切り替えはほぼ無料でお金を得るようなものだ。割り込んでくる発信者や、オープンエンドなトラブルシューティングとなると話は違う。あの17ポイントのターンテイキングの差こそが、通話がまずくなるまさにその場所であり、そこでは追加の3セントを払う価値がある。ちなみに、古いVoice Agent Builder関連の記事はすべて1.0のレートを引用しているので、その価格に関する記事は今読むと低く見える。
2. GPT-Realtime-2.1
最適な用途: xAIから完全に離れたいが、クライアントの書き直しを最小限にしたいチーム。
xAIはリアルタイムエンドポイントを、意図的にOpenAIのRealtime APIとワイヤー互換になるように作った。これは両方向に効いてくる。Grokを導入するのが簡単だったのと同じ理由で、離脱するのも簡単だ。OpenAI側で最も高スコアなのはGPT-Realtime-2.1 Highで、指数は79.1%、テーブル全体で最高のターンテイキングスコア95.7%を叩き出している。
決める前に知っておくべきことが2つある。tau-Voiceは45.7%で、Grokの56.5%に対してかなり低い。つまりサポートタスクの完了を測るベンチマークでは、ほぼ11ポイント譲る形になる。そしてコストが牙をむく。Artificial AnalysisはGPT-Realtime-2.1 Highを1時間あたり$10.75と測定しており、Grok Voice 2.0の2倍以上だ。
推論の強さを調整するダイヤルにも罠が隠れている。GPT-Realtime-2.1 Minimalは$11.31/hrと測定され、Highの$10.75より高いにもかかわらず、スコアは6.6ポイント低い。トークン課金のボイスでは、推論を弱めることはコストを下げるレバーにならない。弱いモデルは同じ結果に到達するために、単に多くのトークンを消費するだけだ。
価格: トークン課金なので、料金は会話の形に沿って変動する。旧世代のGPT-Realtime-2は音声入力$1.15/hr、音声出力$4.61/hrと記載されており、実測はオールインで$4.14だった。これは、公開されている入力レートがここではあまり意味を持たないことを示している。
評価: 互換性が制約条件で、予算が制約条件でない場合には正しい選択肢だ。だがコストを下げるためにGrokから特に離れる? それは方向を誤っている。実測$4.14/hrのGPT-Realtime-2 Highのほうが、いずれにせよコスパのいい兄弟モデルだ。ベンダー層についての補足記事は電話サポートのまとめ記事にある。
3. Qwen Audio 3.0 Realtime Plus
最適な用途: 利用可能な中で最高品質の音声モデルを、電話で誰も待たされていないチャネルで使いたい場合。
このテーブルの中で、見出しの指数でGrok Voice Think Fast 2.0を上回るモデルが1つだけあり、それがこれだ。84.1%対82.9%。しかもその途中で、構成要素の両方のベンチマークでも首位に立っている。音声推論99%、ターンテイキング98.4%だ。Alibaba Cloudは音声入力1時間あたり$0.03で提供しており、このカテゴリーで公開されている入力レートの中では最安だ。
そして、電話回線としては使えないと判断させる数字が出てくる。最初の音声が出るまで4.02秒かかる。発信者が話し終えてから4秒の無音は、通話が切れたように聞こえる。相手は「もしもし?」と言って切ってしまう。しかもオールインの実測コストは、あの小さな入力レートにもかかわらず$4.42/hrに達する。つまり安いという見た目は、実際のワークロードに当たると通用しない。
Flash版が遅延を解決してくれるかもと期待していたなら、それも違う。Qwen Audio 3.0 Realtime Flashは4.16秒でわずかに遅く、指数は76.3%だ。
価格: 公表値で音声入力$0.03/hr、音声出力$0.18/hr。固定ワークロードでの実測は$4.42/hr。
評価: 非同期の音声業務であれば、ここでは最良のモデルだ。ボイスメールのトリアージ、通話の要約、録音メッセージの処理、通話品質のレビューなどに向いている。ライブのインバウンドサポートには向かない。4秒の無音は指数の優位性だけでは解決できない。
4. Gemini 3.1 Flash
最適な用途: 本当の品質低下を許容できるなら、最も安い、信頼できる時間単価を求める場合。
Googleのエントリーは、はっきりとコスト重視を掲げた選択肢だ。Gemini 3.1 Flash Highは$1.75/hrと測定されており、Grok Voice 2.0より64%安く、97%の音声推論もその価格でしっかり成立している。Minimalは$1.50/hrで、0.96秒で応答する。
弱点はターンテイキングだ。Full Duplex BenchはHighで74.3%、Minimalで72.3%となり、Grokの95.1%からは大きく差をつけられている。tau-Voiceは37.7%だ。はっきり言うと、質問は理解できるが、誰の発言の番かを判断するのが遅く、サポートタスクの完了数もおよそ3分の2にとどまる。Googleが持つ最速のネイティブオーディオオプションは別のモデルで、Gemini 2.5 Flash Native Audio Dialogは0.63秒で応答し、実測は$1.42/hrだ。3つのベンチマークすべてで実行されていないため、指数スコアはついていない。
価格: 公表値で音声入力$0.35/hr、音声出力$1.38/hr。実測はHighで$1.75/hr、Minimalで$1.50/hr。
評価: 誠実な予算重視の選択肢だ。ぞんざいな割り込みが何のコストにもならない、大量かつ低リスクな通話には向いている。ただし課金や解約対応の窓口には使わないほうがいい。Googleの広いラインアップはGemini代替記事にまとめている。

どちらの方向に乗り換えても噛みついてくる移行の落とし穴が1つある。xAIはOpenAIの...input_audio_transcription.deltaイベントを.updatedに改名し、そのペイロードは増分ではなく累積型になっている。つまりOpenAI向けに書かれ、各イベントをバッファに追記していくクライアントは、静かに、すべての単語が繰り返された文字起こしを生成してしまう。目に見えない失敗だ。最悪の種類のものだ。
6つのプラットフォーム全体の乗り換え先
これはまったく別の種類の購入だ。これらのベンダーが売っているのは、モデルの周りのオーケストレーションだ。電話回線、通話ログ、ナレッジベース、テストツール、ウォームトランスファー、そして回線が落ちたときに電話をかける先。すべて分単位で支払うことになり、生モデルに対する上乗せ幅は、多くの価格ページが見せる以上に大きい。

Sierraも検討したが、番号付きリストからは外した。分単位ではなく解決した会話単位で課金し、料金表も公開していないため、同等条件での比較ができない。ただ、公開しているtau-voiceの研究は読む価値があるので、以下で引用する。
5. ElevenLabs Agents

最適な用途: 業界最高クラスの音声とフル機能のエージェントプラットフォームを、Grokの新価格とちょうど同じ値段で使いたいチーム。
これはこの記事を書いていて面白いと感じた偶然の一致だ。ElevenLabs Agentsの有料ティアはどれも、含まれる分数で割ると、ほぼぴったり1分あたり$0.08になる。75分で$6、275分で$22、1,238分で$99、3,738分で$299、12,375分で$990。最上位ティアでは計算が正確に一致し、12,375×$0.08は$990.00になる。8月5日までは、GrokはElevenLabsより37.5%安かった。今は1セント単位まで同じ数字だ。
つまり選択の軸は価格ではなくなった。今は課金形態の話になっている。ElevenLabsの分数は事前購入で失効するが、Grokは使った分だけ払う方式だ。月500分の利用なら、Grokは$40で済むが、それをカバーするElevenLabsのティアは$99のProプランになる。だからこそ、変動の大きい利用や少量の利用では今でも使った分だけ払う方式が有利になる。安定した大量利用なら、コイントスに近い。そして月12,375分を超えると、ElevenLabsは見積もりのみになる。
同じ金額で得られるものは相当に大きい。電話回線は無料ティアを含む全ティアに含まれ、ナレッジベースとRAGもそうだ。コンソールは自らの成功率(上のキャプチャでは75.1%)を報告してくれるので、自分でそのダッシュボードを作る必要がない。Businessなら40件の同時通話が可能で、Grokのデフォルト10件を大きく上回る。同社のサイト自体にある矛盾も指摘しておく価値がある。テキスト音声変換のカタログは70以上の言語を売りにしているが、エージェント設定では31言語しか挙げられていない。
価格: Free $0で15分、Starter $6で75分、Creator $22で275分(初月半額)、Pro $99で1,238分、Scale $299で3,738分、Business $990で12,375分、Enterpriseは見積もり。テキストメッセージは1件$0.003。どのティアにも量割引はない。割り当てそのものが価格から逆算して決められているためだ。
評価: ここではプラットフォームの乗り換え先として全体的に最も強く、コンソール付きの音声品質を求めるなら私が最初に候補に入れるものだ。トラフィックに波がある場合は避けたほうがいい。失効する事前購入分数は、まさにそのパターンを罰するからだ。より広い候補はElevenLabsの代替記事にまとめている。
6. Vapi

最適な用途: スタックのすべての層を自分で選び、各コスト項目を個別に確認したいエンジニア。
Vapiは自社のホスティングに$0.05/minを課金し、そのうえで音声認識、音声合成、モデル、電話回線について選んだものをそのまま通過させて課金する。現実的なサポート構成を組み立てると約$0.105/minになる。つまりVapi自体の手数料は、現実的な1分あたりの料金のうち約48%を占める。電話回線側の安い選択肢は、Telnyxの$0.0055/minとTwilio着信の$0.008/minだ。同時接続数は1回線あたり固定$10で、これは私も好きなポイントだ。Grokの10セッション上限が制限しているものに、正確に価格をつけている唯一のベンダーだからだ。
計画しておくべきことが2つある。Visual Workflowsビルダーは2026年8月19日に廃止されるので、そこで構築したものには移行パスが必要になる。テスト通話も本番レートで課金されるため、評価を集中的に行う週があると、それが請求書にそのまま反映される。別の話として、ナレッジベースはファイルアップロードのみで、検索もGemini限定であり、チケッティング連携は一切ないため、ヘルプデスクに関わる部分はすべてカスタム開発になる。
価格: Vapiホスティング$0.05/min、SMSとチャット$0.005/メッセージ、加えてプロバイダーごとのパススルー。同時1回線あたり月$10。コンプライアンス関連のアドオンは別料金。
評価: 自分で管理したいエンジニアと、それを整理するスプレッドシートがある場合には正しい選択だ。ベンダーにスタックの判断を任せたい場合には向かない選択で、今月廃止されるビルダーにワークフローのロジックを置いている場合は本当のリスクになる。カテゴリー全体の見取り図はAI voice companiesにまとまっている。
7. Retell AI

最適な用途: QAとコンプライアンスの管理を、自前で構築するのではなくスイッチとして買いたいチーム。
Retellは$0.07から$0.31/minを掲げている。その幅よりも、構成のほうが重要だ。音声インフラは$0.055/minで避けられないコストであり、コンポーネントを1つも選ぶ前から、安く組んだ場合のコストの半分以上を占める。プラットフォーム側の音声合成$0.015/minを加え、モデルを加えると、現実的なサポートエージェントは約$0.135/minに落ち着く。5,000分の利用なら月あたり約$675だ。
面白くなるのはアドオンの部分で、良い意味でも悪い意味でもそうだ。PII除去$0.01/minと安全ガードレール$0.005/minは異例なほど細かく分かれており、規制の厳しい業種にいるなら有用だ。AIによるQAは$0.10/minで、1分あたり約74%を上乗せするので、これはチェックボックスではなく本物の予算判断になる。RetellはSOC 2 Type II、HIPAA、GDPRへの準拠をプラットフォームレベルで表明しているが、契約上のBAAとMSAはEnterprise限定だ。
正直な限界が2つある。Zendeskとの連携は提供済みではなく近日公開として掲載されており、FreshdeskやGorgiasのコネクタは一切ない。つまりヘルプデスク関連の作業はAPIでつなぎ込む作業に帰着する。メーターも転送地点で止まるという点は良心的で、この製品の責任範囲がどこで終わるかを示している。彼ら自身のFAQが「AIはコンタクトセンターのエージェントを置き換えられるか」という問いに、はっきりノーと答えている点は評価できた。
価格: 音声インフラ$0.055/min、プラットフォーム音声$0.015/min(ElevenLabsの音声を使う場合は$0.040)、これにモデルと電話回線が加わる。PII除去$0.01/min、ガードレール$0.005/min、AI QA$0.10/min。チャットエージェントは1メッセージ$0.002から。
評価: コンプライアンス管理と通話QAが必須要件で、それを構築するより買いたい場合に選ぶべきものだ。連携リストの先頭にヘルプデスクがある場合はスキップしたほうがいい。そこが弱点だからだ。Retell AIの代替記事がこの短いリストの残りをカバーしている。
8. Bland AI

最適な用途: 大量のアウトバウンドコールとインバウンドを、SLA付きの単一のバンドル料金でまとめて処理したい場合。
Blandは組み立てるのではなくバンドルする方式だ。プラットフォーム料金なしのStartは$0.14/min、月$299のBuildは$0.12/min、月$499のScaleは$0.11/min。単一のレートで、個別に価格を出す必要のあるスタックはない。買う側に確認してほしいのは、これらのプランが実際にどこから割に合ってくるかだ。Buildが月14,950分を超えて初めてStartを上回り、Scaleは16,633分を超えて初めて上回る。これらの利用量を下回ると、1分あたりのレートが高くても、料金なしのティアのほうが安くつく。12,000分の場合、実効レートはそれぞれ$0.148、$0.151、$0.156になり、両方の有料プランのほうが不利になる。
本当の差別化要因は、無料プランを含む全ティアで99.9%のアップタイムを提供している点で、ここでそれをやっているのはBlandだけだ。テストも充実している。上のPathwaysビルダーは、ハッピーパスと怒った発信者という名前付きシナリオをデプロイのゲートとして実行し、それぞれにスコアをつける。
Blandは、多くのベンダーなら隠したくなるようなものを公開している。この記事全体の中で最も有用なスクリーンショットだ。

ツール実行408件、エラー142件、エラー率34.8%、これがツール別に分解されている。ボイスエージェントが実際に取りこぼす場所はここだ。モデルは発信者の話を問題なく理解していた。カレンダーの検索がnullを返しただけだ。どのベンダーの数字もこういう形をしている。Blandだけがそれを見えるダッシュボードを提供している。
限界も2つある。ウォームトランスファーはEnterprise限定で、コネクタのディレクトリには19件のエントリがあるが、その中にヘルプデスクは1つもない。
価格: Start $0.14/min、料金なし。Build $0.12/min、月$299。Scale $0.11/min、月$499。Enterpriseは契約制。全ティアでSLA 99.9%。
評価: ボリューム重視なら最良の選択で、プランの計算からは、多くのチームが価格ページの示唆よりずっと長くStartに留まるべきだとわかる。プランを上げる前に、14,950分の計算と、コンタクトセンターのROIの計算をやってみてほしい。
9. PolyAI

最適な用途: アップタイムの保証そのものが製品価値である、エンタープライズの電話回線。
PolyAIは分単位で課金し、見積もりのみで提示するので、こちらから示せるレートはない。伝えられるのは、その見積もりに何が含まれているかだ。それはモデルAPIが構造的に売ることのできないもの、つまり99.9%の電話SLAと24時間365日の緊急対応ラインだ。Grok Voiceはアップタイムのコミットメントを一切公開しておらず、音声障害のためのサポート窓口もない。電話回線が静かになることが収益に直結する事象だと考えるなら、この差こそが決断のすべてになる。
証明書類の要件がティアで区切られていないのも、このカテゴリーでは珍しい。中規模の買い手も、大企業と同じコンプライアンス体制を得られる。上のキャプチャにあるAgent Studioは会話型のビルダーで、ノードをドラッグする代わりに、変更内容を説明し、コストカウンターが動くサンドボックスでテストする形をとる。
価格: 見積もりのみ、分単位、SLAと緊急サポートを含む。証明書類の要件はティアで区切られていない。
評価: 規制対象、あるいは高収益の電話回線であれば、この短いリストに入れるべき候補だ。今月中にリリースしたい小規模チームにとっては、営業サイクルに見合わない。公開レートがないことも予算立てを難しくする。コンタクトセンター技術がこの層の位置づけをカバーしている。
10. Parloa

最適な用途: 自社の過去の通話に対してテストしてからでなければ、電話エージェントをローンチしないチーム。
この画像については正直に注意しておく。Parloaは実際のアプリケーションのスクリーンショットを一切公開していないので、上に示したのは会話ビューについての同社独自のイラストであり、実際のキャプチャではない。買う側にとってこれは本当に注目すべき点であり、もし自分が評価する側なら、開示してほしいと思う点だ。
それでもParloaをリストに入れたのは、他社が埋められない1つの列があるからだ。ここでParloaだけが、シミュレーションで自社の実際の過去のトランスクリプトを再生する。それを合成シナリオと組み合わせ、根本原因の追跡と、行単位の修正をプラットフォーム内で適用する。他社の「シミュレーション」はすべて自分で書いたシナリオを実行するものなので、想像力をテストしているにすぎず、実際の通話量をテストしているわけではない。自分で考えたテストをすべて通過したエージェントをローンチしたのに、最初の本物の発信者で失敗したことはないだろうか? だとすれば、この違いの価値はすでに理解しているはずだ。
数字の面でもこの会社は信頼できる。2026年1月に、バリュエーション$3Bで$350MのシリーズDを実施し、ARRは$50M超、ネットレベニューリテンションは150%だ。
価格: タスクの複雑さに応じた消費量課金、見積もりのみ。価格ページは公開されていない。
評価: 大規模な移行であれば、これが最も強く推したい選択肢だ。実際の履歴に対してローンチ前にテストできるかどうかが、制御されたロールアウトと公開の失態を分ける差になるからだ。速く動く小規模チームにはうまくフィットしない。営業サイクルと料金表の欠如の間で、どっちつかずになる。何を選ぶにしても、慎重なハンドオフ設計と組み合わせてほしい。
これら10社のどれも解決していないこと
これは私が最も大切に思っている部分だ。ベンチマークの表を読んで得たものではなく、サポートキューで実際に働いた経験から来ている。
tau-Voiceはサポートのベンチマークであり、一般的な音声テストではない。シミュレートされた発信者が実際の問題を抱えてモデルに電話をかけ、スコアはデータベースが最終的に正しい状態になったかどうかで決まる。文字どおり「顧客の問題は解決したか」だ。テーブル全体で最高のスコアはGrok Voice Think Fast 2.0の56.5%。この記事に出てくるすべてのベンダーページは70%から95%のコンテインメント率を掲げている。
このギャップは2つの方向から裏付けられる。Sierraのtau-voice研究は、どのプロバイダーもクリーンなテキストから現実的な電話音声へ移ると5から14ポイント落ちること、そして最初の重大なエラーの79%が発信者ではなくエージェント側の責任であることを示している。Redditのコンタクトセンター運営者たちは、実際の完全自動化率を15%から30%程度と見積もっている。これはテキスト側での自動化されたチケット解決に関する私自身の観察とも一致する。
Grokに限って言えば、コミュニティの感触は私の数字が示すよりも温かい。以下の2つはどちらも読む価値がある。
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
どちらも本当のことだ。だが、どちらも56.5%という数字を変えるわけではない。このモデルは利用可能な中で最良のものであり、それでもサポートタスクを完了できるのはちょうど半分をわずかに超える程度にすぎない。
だから、この決断に四半期を費やす前に私が問いたいのは、その通話のうちどれだけが、上流で何かが放置されて答えられなかったことから生まれているかだ。eesel自身の顧客リサーチで繰り返し目にするパターンは、ベンダーが売っているものとは逆だ。あるチームはこう明確に言っている。
"The lack of voice recording support requires agents to summarize voice interactions for Eesel. Implementing this feature would significantly increase our usage."
eeselをZendeskのコパイロットとして使う、不動産管理サポートのアウトソーサー
もう一度読んでみてほしい。ボトルネックはボイスボットではなかった。通話内容がテキストAIに一度も届かなかったため、自動化がそこに触れる前に、人間があらゆる電話の会話を手で書き直していたのだ。これがサポート業務における音声の本当の姿だ。通話とチケットは、2つの衣装をまとった同じ1つのキューであり、最もコストがかかるチャネルこそが、誰もが最初に自動化しようとするチャネルなのだ。
たいていの場合、より安い実行順序はこうなる。テキストチャネルの自動化が電話回線より先に来る。次に初回応答、そして音声は最後だ。まだこのカテゴリー全体の規模感をつかんでいる段階なら、AIエージェント対チャットボットが最もわかりやすい出発点になる。
予算に関する問いも同じ丁寧さが必要だ。$0.08から$0.14のボイス1分間は、解決した1件のチケットと単純には比較できない。だからベンダーの計算ツールではなく、自社の実際の利用量に対してエージェントと人間のコスト比較の数字を当てはめてみてほしい。現代のAIヘルプデスクは、このリストのどの電話エージェントよりも、1ドルあたりで処理できる量が多い。そしてAIカスタマーサービスソフトウェアこそが、その支出の大部分がまず向かうべき場所だ。
通話の裏にあるチケットのために、eeselを試す

正直に言うと、eeselはこのリストには入っていない。eeselはボイスモデルや電話回線を売っていないからだ。eeselがやっているのは、あなたの電話回線に流れ込んでくる手前のチャネルの部分だ。
すでに使っているヘルプデスクに連携する。ZendeskとFreshdeskも含まれる。すでにそこにあるヘルプセンターとチケット履歴から学習し、そのうちの何かが午後4時の電話に変わってしまう前に、メールとチャットの量を解決していく。
Frontのコネクタも存在し、Slackとその他のスタックにも対応している。使っているヘルプデスクの上に乗るコンバーサショナルAIのレイヤーとして機能し、それを置き換えるものではない。
これまでの話すべてに関わる点として、すべてのロールアウトは、実際の顧客に1件でも応答する前に、自社の過去のチケットに対してシミュレーションされる。これがあるのは、自信満々に聞こえるボットが間違った答えを返すのを実際に見てきたからだ。電話の通話には見直せる草稿もなく、取り消せるものもない。Parloaがエンタープライズ料金を課している規律と同じものであり、それなしにどのチャネルもローンチしたくないと思う理由でもある。
課金は席数単位ではなく解決件数単位なので、静かな月はその分安くなり、同じ金額のままにはならない。eeselを試すのは無料で、まず自社のチケット履歴に対して動かしてみたいならデモを予約することもできる。
よくある質問
Grok Voice Think Fast 2の代替として最も良いものは?
Grok Voice Think Fast 2の価格はなぜ上がったのか?
grok-voice-latestというエイリアスが1.0から2.0へ向き先を変えたことで、そのエイリアスを使っていた全員が、コードを何も変更していないのに$0.05/minから$0.08/minへ移行してしまった。詳しい内訳はGrok Voice Think Fast 2の価格に関する記事にまとめている。Grok Voice Think Fast 2より安い代替はあるか?
grok-voice-think-fast-1.0を固定すれば$4.80/hrではなく$3.00/hrで済み、37.5%安くなる。それでいて音声推論では97%のスコアを維持できる。Gemini 3.1 Flashはさらに安く$1.75/hrだが、指数では13ポイント低い。2026年、ボイスAIエージェントは1分あたりどれくらいのコストがかかるか?
Grok Voice Think Fast 2の同時セッション数の上限は?
サポート通話を最も多く解決できるボイスモデルはどれか?
サポートがほぼメールとチャットの場合、ボイスモデルは必要か?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.







