2026年版 Grok Voice Think Fast 2の代替ツール10選
Riellvriany Indriawan
Katelin Teen
最終更新 August 4, 2026

なぜGrok Voice Think Fast 2の代替を探す人がいるのか
まずxAIに公平を期すと、このモデルは優れている。独立して計測しても、xAIが公表した数値は裏付けが取れる。音声推論で97.2%、Full Duplex Benchで95.1%、最初の音声が出るまで0.70秒。2025年に電話対応エージェントを作っていたなら、これに匹敵するものはなかった。私はThink Fast 2.0レビューでこのモデルを分解し、その仕組みはローンチの解説記事にまとめてある。
つまり、品質が理由で離れる人はいない。実際に挙がってくる3つの理由はすべて構造的なもので、お金に関する理由はThink Fast 2.0の料金記事で一通り解説した。
デフォルト経路の価格が60%上昇した。 Speech to SpeechはxAIの料金ページでgrok-voice-think-fast-1.0が1分$0.05、2.0が1分$0.08と記載されており、どちらもテキスト入力イベント1件につき$0.004が加算される。2.0の料金自体に隠し事はない。人々を驚かせたのは、grok-voice-latestがかつて1.0を指していたことで、speech-to-speechガイドには2026年8月5日に2.0へ切り替わったと明記されている。つまり本番環境の文字列がこのエイリアスのままなら、リポジトリを何も変更していないのに、1分あたりのコストが一夜にして60%上がったことになる。

同時10セッションという上限は実際に効いてくる。 モデルカードには、チームあたり同時10セッション、1セッションあたり最長120分という上限が明記されている。xAIはリクエストすれば引き上げてくれる。よくある話だが、問題はこのデフォルト値こそが実際にローンチ計画を立てる際の基準になるという点だ。10件同時通話は、10人体制のチームにとって忙しい火曜日の午後程度でしかない。負荷試験のレベルではない。
リージョンは1つだけ、優先レーンも割引もない。 音声機能はus-east-1でのみ動作する。しかもxAIが用意する2つのコスト調整レバーの対象外だ。20%のバッチ割引はテキストモデル向けで、2倍優先ティアはChat CompletionsとResponsesが対象。音声機能はどちらの対象にもならないため、コストを下げる方法もスループットを上げる方法も存在しない。
これら3つの問題には、それぞれ別の解決策がある。ほとんどの代替ツール記事はこの違いを無視してひとまとめにしているので、ここではあえて分けて説明する。

この10個をどう選んだか
ルールは3つ。それに加えて、隠すよりはっきり言っておきたい注意点がひとつある。
ルール1: 数値はベンダー自身のページか、Artificial Analysisから取っている。AAはどのモデルに対しても同じ3つのベンチマークを実行する。音声推論用のBig Bench Audio、ターンテイキング用のFull Duplex Bench、そしてサポートタスクが実際に完了したかを問うtau-Voiceだ。最後のものが最も引用されないのに、最も重要だ。だからこそ私は、ベンダーが主張する解決率ではなく、これを軸に音声サポートツールのまとめ記事を書いた。
ルール2: モデルの乗り換えとプラットフォームの乗り換えは分けて扱う。両者は競合する買い物ではないからだ。モデルAPIが渡してくるのはWebSocketだけ。プラットフォームは電話番号や通話ログ、テスト機能を渡してくる代わりに、1分あたりの料金が30%から75%高くなる。この2つを1つのランキングに混ぜてしまうと、まるで同じものを買っているかのように$0.08と$0.14を比較することになる。
そして注意点だが、モデル層の4つの選択肢はAPIエンドポイントであるため、見せられる製品UIが存在しない。xAIのドキュメントやローンチ記事にはスクリーンショットが一切ない。だからモデルのセクションはベンチマークの数値と公開されている挙動を頼りにし、プラットフォームのセクションは実際の製品キャプチャから始めている。4つのセクションをストック画像で埋めるより、こう正直に伝えるほうがいいと思う。
Grok Voice Think Fast 2の代替を比較する
実測コストの列は2回読んでほしい。この数値はArtificial Analysisが一定のワークロードを実行し、実際に1時間あたりいくらかかったかを報告したものであり、料金ページに載っているリスト価格とは別物だ。Grokは1分あたり定額の課金なので、実測の$4.80はリスト価格の$4.80と一致する。トークン課金のモデルは、リスト価格から大きくずれる。
| オプション | レイヤー | AAインデックス | 音声推論 | ターンテイキング | tau-Voice | 最初の音声までの時間 | 実測$/時間 | 課金形態 | 公開されている同時実行数 | 電話番号 | テストツール |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Grok Voice Think Fast 2.0 | モデルAPI | 82.9% | 97% | 95.1% | 56.5% | 0.70秒 | $4.80 | 1分あたり定額 | 10セッション | アドオン、+$0.01/分 | プレイグラウンドのみ |
| Grok Voice Think Fast 1.0 | モデルAPI | 75.7% | 97% | 77.8% | 52.1% | 1.25秒 | $3.00 | 1分あたり定額 | 10セッション | アドオン、+$0.01/分 | プレイグラウンドのみ |
| GPT-Realtime-2.1 High | モデルAPI | 79.1% | 96% | 95.7% | 45.7% | 1.21秒 | $10.75 | トークン課金 | 非公開 | なし | なし |
| Qwen Audio 3.0 Realtime Plus | モデルAPI | 84.1% | 99% | 98.4% | 54.6% | 4.02秒 | $4.42 | トークン課金 | 非公開 | なし | なし |
| Gemini 3.1 Flash High | モデルAPI | 69.5% | 97% | 74.3% | 37.7% | 2.99秒 | $1.75 | トークン課金 | 非公開 | なし | なし |
| ElevenLabs Agents | プラットフォーム | 未評価 | 未評価 | 未評価 | 未評価 | 非公開 | ~$4.80 | 前払い分単位 | 40通話(Business) | あり、含まれる | あり |
| Vapi | プラットフォーム | 未評価 | 未評価 | 未評価 | 未評価 | 非公開 | ~$6.30 | 1分ごとに組み立て | 1回線あたり$10 | あり | あり、実費課金 |
| Retell AI | プラットフォーム | 未評価 | 未評価 | 未評価 | 未評価 | 非公開 | ~$8.10 | 1分ごとに組み立て | 非公開 | あり | あり、+$0.10/分 |
| Bland AI | プラットフォーム | 未評価 | 未評価 | 未評価 | 未評価 | 非公開 | ~$8.40 | 1分あたり込み込み | 非公開 | あり | あり |
| PolyAI | プラットフォーム | 未評価 | 未評価 | 未評価 | 未評価 | 非公開 | 見積もりのみ | 1分あたり、見積もり | 非公開 | あり、99.9% SLA | あり |
| Parloa | プラットフォーム | 未評価 | 未評価 | 未評価 | 未評価 | 非公開 | 見積もりのみ | タスクの複雑さに応じて | 非公開 | あり | あり、実通話で |
ベンチマークと実測コストの列はArtificial Analysisのspeech-to-speechの表から取っている。プラットフォームの時間あたり数値は私自身が各ベンダーの公開されている分あたり料金から計算したものなので、実測結果ではなく、単純換算値として読んでほしい。
乗り換えたい理由を選んでください
バージョンを固定する。移行はしない。
文字列をgrok-voice-latestからgrok-voice-think-fast-1.0に1つ変えるだけで、1分$0.05に戻る。音声推論のスコアは97%のまま維持できるが、ターンテイキングの品質(77.8%対95.1%)と応答速度0.5秒分を犠牲にする。
月5,000分の利用なら、$400ではなく$250で済む。クライアントもWebSocketも同じ、変更は設定1行だけだ。
モデルを切り替えるか、同時実行数を買う。
セッション数の上限はモデルの制約ではなくアカウントの制約なので、他のプロバイダーに乗り換えれば回避できる。GPT-Realtime-2.1は通信仕様に互換性があるため、クライアントはほとんど変更しなくて済む。数字そのものを買いたいなら、ElevenLabs Businessは同時40通話を公開しており、Vapiは1回線$10で販売している。
まずはxAIに上限の引き上げを依頼してみるべきだ。無料でできるし、10というのはデフォルト値であって絶対的な上限ではない。
必要なのはモデルではなくプラットフォームだ。
稼働率保証付きの電話番号を売っているモデルAPIは存在しない。PolyAIは99.9%の電話SLAと24時間365日の緊急回線を提示しており、Blandは無料ティアを含む全プランで99.9%を公開している。Parloaだけが自社の過去の通話履歴に対してテストできる唯一の選択肢だ。
生モデルの$0.08に対して、すべて込みで1分あたり$0.105〜$0.14を見込んでおくべきだ。
そのまま差し替えられる4つのモデル
この4つはいずれもGrok Voiceと同じ形の買い物だ。WebSocket、モデル文字列、分単位の課金。移行の手間は設定1行の変更からクライアントの書き直しまで幅がある。
個別の話に入る前に、1枚のチャートを見てほしい。今回この記事のために作った中で一番役に立つものだ。Think Fast 2.0より優れていて、なおかつ速いモデルを探したが、そんなものは存在しなかった。

1. Grok Voice Think Fast 1.0
向いている用途: 移行作業なしで、今日中に音声料金を37.5%削減すること。
誰もこれを候補として挙げないのは、ズルのように感じるからだと思う。grok-voice-think-fast-1.0はいまも料金ページで1分$0.05のままで、固定するのに必要なのは文字列1つの変更だけだ。Artificial Analysisの計測では、入力音声1時間あたり$3.00で、2.0の$4.80と比べて安い。
もちろん犠牲になるものもある。それが何かを正確に知っておく価値はある。音声推論は97%でほぼ同一だが、tau-Voiceは56.5%から52.1%に下がる。つまりタスク完了率で約4ポイントの差だ。本当の差が開くのは会話のダイナミクスの部分で、Full Duplex Benchは95.1%から77.8%に落ちる。これは、割り込みや相づちをきれいに処理できるモデルと、相手の話に被せてしまうモデルの違いだ。最初の音声が出るまでの時間もほぼ倍になり、0.70秒から1.25秒になる。
料金: 1分$0.05(時間あたり$3.00)に加えて、テキスト入力イベント1件につき$0.004。同時セッション上限は同じ10、リージョンも同じus-east-1。
結論: 台本通りに進み、割り込みが少ないフロー(注文状況の確認、予約確認、営業時間案内など)であれば、1.0への切り替えはほぼタダ同然のお得な選択になる。割り込んでくる相手や、自由度の高いトラブルシューティングとなると話は別だ。あの17ポイントのターンテイキングの差こそ、通話がまずくなる原因そのものであり、そこでは追加の3セントを払う価値がある。余談だが、古いVoice Agent Builderの記事はすべて1.0の料金を引用しているため、その料金ページは今となっては割安に見える。
2. GPT-Realtime-2.1
向いている用途: クライアントの書き直しを最小限に抑えながら、xAIから完全に離れたいチーム。
xAIは自社のリアルタイムエンドポイントを、あえてOpenAIのRealtime APIと通信互換にして構築した。これは諸刃の剣だ。Grokを導入するのが簡単だったのと同じ理由で、離れるのも簡単になる。OpenAIの最高スコア構成はGPT-Realtime-2.1 Highで、インデックスは79.1%、表全体の中で最も高いターンテイキングスコア95.7%を記録している。
決める前に知っておくべきことが2つある。tau-VoiceはGrokの56.5%に対して45.7%で、サポートタスクの完了度を測るベンチマークでは11ポイント近く見劣りする。そしてコストが跳ね返ってくる。Artificial AnalysisはGPT-Realtime-2.1 Highを1時間$10.75と計測しており、Grok Voice 2.0の2倍以上だ。
推論の強さを調整するダイヤルにも罠が隠れている。GPT-Realtime-2.1 Minimalは時間あたり$11.31で、Highの$10.75より高いのに、スコアは6.6ポイント低い。トークン課金の音声モデルでは、推論を弱めることはコスト削減の手段にならない。弱いモデルは同じ結果にたどり着くのに、より多くのトークンを消費するだけだ。
料金: トークン課金なので、請求額は会話の内容次第で変わる。旧世代のGPT-Realtime-2は音声入力が時間あたり$1.15、音声出力が$4.61と表記されているが、実測の込み込み価格は$4.14になる。ここでは表示されている入力レートがいかに当てにならないかがわかる。
結論: 互換性が制約で、予算は制約にならない場合の正しい選択肢だ。コストを削減する目的でGrokから離れるのなら、方向性が違う。しかも実測$4.14/時のGPT-Realtime-2 Highのほうが、コスパの良い兄弟モデルとして存在している。ベンダー層についての関連記事は私の電話サポートまとめを参照してほしい。
3. Qwen Audio 3.0 Realtime Plus
向いている用途: 誰も回線で待っていないチャネルにおける、現時点で最高品質の音声モデル。
この表の中でGrok Voice Think Fast 2.0を総合インデックスで上回るモデルが1つだけあり、それがこれだ。84.1%対82.9%。しかも構成要素のベンチマークでも両方トップで、音声推論99%、ターンテイキング98.4%。Alibaba Cloudは音声入力1時間あたり$0.03と表記しており、このカテゴリで公開されている中では最安の入力レートだ。
だが、これを電話回線の選択肢から外させる数字がある。最初の音声が出るまでの時間は4.02秒。発信者が話し終えてから4秒の沈黙は、回線が切れたと受け取られる。相手は「もしもし?」と言って電話を切ってしまう。しかも実測の込み込みコストは、あの小さな入力レートにもかかわらず$4.42/時になり、安い値札は実際のワークロードの前では通用しない。
Flash版ならレイテンシが改善されているのではと期待していたなら、そうはならない。Qwen Audio 3.0 Realtime Flashは4.16秒とわずかに遅く、インデックスは76.3%だ。
料金: 表記上は音声入力が時間あたり$0.03、音声出力が$0.18。一定のワークロードで実測すると$4.42/時。
結論: 非同期の音声処理においては、ここに挙げた中で最高のモデルだ。ボイスメールの振り分け、通話の要約、録音メッセージの処理、通話品質のレビューなどに向いている。ライブの着信サポートには向かない。4秒の無音は、インデックスの優位性で埋め合わせできるものではない。
4. Gemini 3.1 Flash
向いている用途: 品質の実質的な低下を許容できるなら、信頼できる中で最も安い時間あたりコストを求める場合。
Googleのエントリーはコスパ狙いの選択肢であり、それを隠してもいない。Gemini 3.1 Flash Highは実測$1.75/時で、Grok Voice 2.0より64%安く、その価格で音声推論97%というスコアはよく健闘している。Minimalは$1.50/時で、0.96秒で応答する。
弱点はターンテイキングだ。Full Duplex BenchはHighが74.3%、Minimalが72.3%で、どちらもグロックの95.1%を大きく下回り、tau-Voiceは37.7%にとどまる。率直に言えば、質問の内容は理解できるが、誰が話す番かを判断するのが遅く、サポートタスクの完了数はおおよそ3分の2程度になる。Googleが持つ最速のネイティブ音声オプションは別モデルのGemini 2.5 Flash Native Audio Dialogで、0.63秒で応答し、実測$1.42/時だ。3つのベンチマークすべてで計測されていないため、こちらにインデックススコアはない。
料金: 表記は音声入力が時間あたり$0.35、音声出力が$1.38。実測ではHighが$1.75/時、Minimalが$1.50/時。
結論: 正直なところ、予算重視の選択肢だ。多少ぎこちない割り込みがあっても損失が少ない、大量かつ低リスクな通話には向いている。ただし、請求や解約対応の窓口には使わないほうがいい。Googleのラインナップ全体についてはGeminiの代替ツールにまとめてある。

どちらの方向に移行するにしても、1つ厄介な移行時の落とし穴がある。xAIはOpenAIの...input_audio_transcription.deltaイベントを.updatedに名称変更しており、しかもペイロードは差分ではなく累積になっている。そのため、OpenAI向けに書かれ、各イベントをバッファに追記していくクライアントは、単語がすべて重複した文字起こしを静かに生成してしまう。サイレント障害。最も厄介な種類の失敗だ。
丸ごと切り替えるプラットフォーム6選
こちらはまったく別種の買い物だ。これらのベンダーが売っているのは、モデルを取り巻くオーケストレーションそのものだ。電話回線、通話ログ、ナレッジベース、テストツール、温かい転送(ウォームトランスファー)、そして回線が落ちたときに連絡できる人。これらすべてに対して分単位で料金を払うことになり、生モデルに対する上乗せ幅は、たいていの料金ページが示唆する以上に大きい。

Sierraも検討したが、番号付きリストからは外した。分単位ではなく解決した会話単位で課金しており、料金表も公開していないため、同条件での比較ができないからだ。ただし同社が公開したtau-voiceの研究は読む価値があり、後述で引用している。
5. ElevenLabs Agents

向いている用途: 業界最高クラスの音声品質とフル機能のエージェントプラットフォームを、Grokの新料金とちょうど同じ価格で求めるチーム。
この記事を書いていて面白いと感じた偶然がここにある。ElevenLabs Agentsの有料ティアはどれも、含まれる1分あたりの単価がほぼ正確に$0.08になるように割り振られている。75分で$6、275分で$22、1,238分で$99、3,738分で$299、12,375分で$990。最上位ティアでは計算がぴったり合い、12,375×$0.08は$990.00になる。8月5日までは、GrokはElevenLabsより37.5%安かった。今では1セント単位で同じ数字になっている。
つまり選択の基準はもはや価格ではなくなった。今は課金の形が問題になる。ElevenLabsの分は前払いで期限切れになるが、Grokは従量課金だ。月500分の利用ならGrokは$40で済むが、ElevenLabsでそれをカバーするティアは$99のProプランになるため、利用量が波打つ場合や少量利用の場合は依然として従量課金のほうが有利だ。安定した大量利用ならどちらとも言えない。そして月12,375分を超えると、ElevenLabsは見積もりのみになる。
同じ金額で買えるものはかなり充実している。電話機能は無料ティアを含む全ティアに含まれており、ナレッジベースとRAGも同様だ。コンソールは自前で成功率のダッシュボードを作らなくても、成功率(上のキャプチャでは75.1%)を報告してくれる。Businessではグロックのデフォルト10に対して、同時40通話が可能だ。指摘しておく価値がある自己矛盾が1つある。テキスト読み上げのカタログでは70以上の言語をうたっているのに、エージェントの設定画面では31言語しか挙がっていない。
料金: Freeは$0で15分、Starterは$6で75分、Creatorは$22で275分(初月半額)、Proは$99で1,238分、Scaleは$299で3,738分、Businessは$990で12,375分、Enterpriseは見積もり。テキストメッセージは1件$0.003。どのティアにもボリューム割引はない。そもそも割り当て分数が価格から逆算されているからだ。
結論: ここに挙げた中で最も総合力のあるプラットフォームの乗り換え先であり、音声品質とコンソールの両方が欲しいなら真っ先に候補に入れる。トラフィックが波打つ場合は避けたほうがいい。期限切れになる前払い分は、まさにそのパターンを罰する仕組みだからだ。より広い比較はElevenLabsの代替ツールにまとめている。
6. Vapi

向いている用途: スタックのすべての層を自分で選び、明細を1つ1つ確認したいエンジニア。
Vapiは自社ホスティング分として1分$0.05を課金し、それとは別に選択した音声認識、音声合成、モデル、電話回線の費用がそのまま転嫁される。現実的なサポート用の構成を組むと1分あたり$0.105ほどになり、つまりVapi自身の取り分は現実的な1分あたりコストのおよそ48%を占めることになる。電話回線で安いのはTelnyx(1分$0.0055)とTwilioの着信(1分$0.008)だ。同時接続数は1回線あたり定額$10で、これは気に入っている。Grokの10セッション上限がまさに制限している対象に、正面から値段をつけているベンダーはここだけだ。
計画しておくべき点が2つある。Visual Workflowsビルダーは2026年8月19日に廃止されるため、そこで構築したものには移行の道筋が必要になる。テスト通話も本番と同じ料金で課金されるため、評価作業が多い週は請求書にはっきり反映される。別の話として、ナレッジベースはファイルアップロードのみでGemini限定の検索方式であり、チケッティング系の連携は一切ない。そのためヘルプデスクに関わる部分はすべて自前で作り込む必要がある。
料金: Vapiホスティングが1分$0.05、SMSとチャットが1メッセージ$0.005、それに加えて各プロバイダーの費用がそのまま転嫁される。同時接続回線は月額$10。コンプライアンス関連のアドオンは別料金。
結論: コントロールとスプレッドシートを求めるエンジニアがいるなら正解。ベンダーにスタックの判断を任せたいなら不正解であり、今月廃止されるビルダーにワークフローのロジックが入っているなら本当のリスクになる。カテゴリ全体の見取り図はAI音声企業にまとめている。
7. Retell AI

向いている用途: QAとコンプライアンス管理を自前で構築するのではなく、スイッチとして買いたいチーム。
Retellは1分$0.07〜$0.31とうたっているが、この範囲そのものより中身の構成のほうが重要だ。音声インフラだけで1分$0.055かかり、これは避けられないコストで、まだコンポーネントを1つも選んでいない時点で安価な構成のコストの半分以上を占める。プラットフォームの音声合成(1分$0.015)とモデルを加えると、現実的なサポートエージェントは1分あたり$0.135ほどになる。月5,000分ならおよそ月$675だ。
アドオンの部分は良くも悪くも興味深い。PII除去(1分$0.01)と安全ガードレール(1分$0.005)は珍しいほど細かく設定でき、規制の厳しい業界にいるなら役立つ。AIによるQAは1分$0.10で、1分あたりのコストを約74%押し上げるため、これはチェックボックスではなく本当に予算面で検討すべき項目だ。RetellはプラットフォームレベルでSOC 2 Type II、HIPAA、GDPR準拠をうたっているが、契約上のBAAとMSAはEnterprise限定だ。
正直に言うべき制約が2つある。Zendesk連携は「近日公開」とされていて実際にはまだ提供されておらず、FreshdeskやGorgiasのコネクタも一切ない。そのためヘルプデスク周りの作業はAPIをつなぎ合わせる作業になる。また課金メーターは転送時点で止まるという寛大な仕様になっており、プロダクトの責任範囲がどこで終わるかを教えてくれる。自社のFAQで「AIはコールセンターのオペレーターを置き換えられるか?」という問いに、はっきり「いいえ」と答えている点は好感が持てた。
料金: 音声インフラが1分$0.055、プラットフォーム音声が1分$0.015(ElevenLabs音声は$0.040)、これにモデルと電話回線の費用が加わる。PII除去は1分$0.01、ガードレールは1分$0.005、AI QAは1分$0.10。チャットエージェントは1メッセージ$0.002から。
結論: コンプライアンス管理と通話QAが必須要件で、それを自前で作るより買いたいなら選ぶべきだ。連携リストの筆頭がヘルプデスクなら避けたほうがいい。そこが弱点だからだ。Retell AIの代替ツールに残りの候補をまとめている。
8. Bland AI

向いている用途: 大量のアウトバウンド発信とインバウンドを1つの込み込み料金でまかない、どのプランにもSLAが付いていること。
Blandは組み立て式ではなく込み込み式だ。プラットフォーム料金なしのStartが1分$0.14、月額$299のBuildが1分$0.12、月額$499のScaleが1分$0.11。単一レートで、スタックの価格を個別に計算する必要はない。買い手にぜひ確認してほしいのは、これらのプランが実際にどこから元を取れるようになるかだ。Buildが月14,950分を超えて初めてStartを上回り、Scaleは16,633分を超えて初めて上回る。それを下回る利用量では、1分あたりの単価が高いにもかかわらず、料金なしのティアのほうが安く上がる。12,000分の場合、実質レートはそれぞれ$0.148、$0.151、$0.156となり、有料プランはどちらも不利になる。
本当の差別化要因は、無料ティアを含む全ティアで稼働率99.9%を保証している点で、これはここに挙げた他のどのベンダーもやっていない。テスト機能もしっかりしている。上のPathwaysビルダーでは、名前付きのシナリオ(順調なケースと怒った発信者のケース)をデプロイのゲートとして実行し、それぞれにスコアが付く。
Blandはたいていのベンダーなら隠したくなるようなものを公開している。この記事全体の中で最も有用なスクリーンショットだ。

ツール実行408件、エラー142件、エラー率34.8%、ツールごとの内訳付き。音声エージェントが実際に穴を空けている場所はここだ。モデルは発信者の話をきちんと理解できていたのに、カレンダー検索がnullを返した、というようなケースだ。どのベンダーの数字もこういう見た目になっている。それを見えるようにするダッシュボードを提供しているのは、Blandだけだ。
制約は2つある。ウォームトランスファーはEnterprise限定で、コネクタのディレクトリには19件掲載されているが、その中にヘルプデスクは1つもない。
料金: Startは1分$0.14、料金なし。Buildは1分$0.12、月額$299。Scaleは1分$0.11、月額$499。Enterpriseは契約制。全ティアで99.9% SLA。
結論: 大量処理には最適な選択肢であり、プランの計算式を見る限り、料金ページが示唆するよりもずっと長くStartにとどまるべきチームが多い。アップグレードする前に、14,950分の計算とコールセンターROIの計算をしておくべきだ。
9. PolyAI

向いている用途: 稼働率保証そのものが製品価値になるような、エンタープライズ向けの電話回線。
PolyAIは分単位の料金だが見積もり制なので、具体的な数字は出せない。伝えられるのは、その見積もりに含まれるもの、つまりモデルAPIには構造上売れないものだ。99.9%の電話SLAと、24時間365日の緊急対応回線。Grok Voiceは稼働率のコミットメントを一切公開しておらず、音声機能の障害に対するサポート窓口もない。電話回線が沈黙することが売上に直結する事態であるなら、この違いがすべてを決める。
認証関連はここではティアによって制限されておらず、このカテゴリでは珍しい。中規模の買い手であっても、大企業と同じコンプライアンス体制を得られることになる。上のキャプチャにあるAgent Studioは会話型のビルダーで、ノードをドラッグして組み立てるのではなく、変更内容を説明し、稼働中のコストカウンター付きサンドボックスでテストする方式だ。
料金: 見積もりのみ、分単位。SLAと緊急サポートを含む。認証はティアによって制限されない。
結論: 規制業界や高収益な電話回線向けの候補だ。今月中にリリースしたい小規模チームにとっては、営業サイクルに見合わない。公開レートがないため予算組みもやりにくい。この層がどこに位置づけられるかはコールセンターのテクノロジーにまとめている。
10. Parloa

向いている用途: 自社の過去の通話に対してテストしない限り、電話エージェントをローンチしたくないチーム。
先ほどの画像については、正直に断っておく。Parloaは実際のアプリケーションのスクリーンショットを一切公開しておらず、上に載せたものはキャプチャではなく、同社自身が作成した会話ビューのイラストだ。買い手にとってこれは実際に重要な発見であり、もし自分が評価する立場なら、はっきり開示してほしい情報だ。
それでもParloaがこのリストに入っているのは、他の誰も埋められない項目が1つあるからだ。自社の過去の通話履歴を実際に再生してシミュレーションできる唯一のベンダーであり、それを合成シナリオと組み合わせ、根本原因のトレースと行単位の修正までプラットフォーム内で完結できる。他社の「シミュレーション」はすべて自分で書いたシナリオを実行するだけなので、テストしているのは自分の想像力であって、実際の通話量ではない。自分で考えたテストにはすべて合格したのに、実際の最初の発信者で崩れたエージェントをローンチした経験はないだろうか。それがあるなら、この違いの価値はもうわかっているはずだ。
数字の面でも同社の信頼性は裏付けられている。2026年1月には評価額$3BでシリーズDとして$350Mを調達し、ARRは$50M超、ネット収益維持率は150%だ。
料金: タスクの複雑さに応じた従量課金で、見積もりのみ。料金ページはまだ公開されていない。
結論: 大規模な移行であれば、これを最も強く推したい。過去の実データに対するローンチ前のテストこそが、制御されたロールアウトと公になるインシデントの分かれ目になるからだ。素早く動きたい小規模チームには、営業サイクルと非公開の料金体系の両面から相性が悪い。どれを選ぶにせよ、意図的なハンドオフ設計と組み合わせるべきだ。
この10個のどれも実際には解決していないこと
ここが私が一番気にかけている部分だ。ベンチマークの表を読んで出てきた話ではなく、サポートキューで実際に働いてきた経験から来ている。
tau-Voiceは汎用的な音声テストではなく、サポート専用のベンチマークだ。シミュレートされた発信者が実際の問題を抱えてモデルに電話をかけ、スコアはデータベースが最終的に正しい状態になったかどうかで決まる。文字通り「顧客の問題は解決したのか」を測っている。表全体での最高スコアはGrok Voice Think Fast 2.0の56.5%だ。この記事に登場するどのベンダーのページも、解決率70%から95%をうたっている。
この差を裏付ける方向性は2つある。Sierraのtau-voice研究によれば、どのプロバイダーもクリーンなテキストから実際の電話音声に移ると5〜14ポイント低下し、最初の重大なエラーの79%は発信者ではなくエージェント側の責任だとしている。Reddit上のコンタクトセンター運営者は、実際の完全自動化率を15〜30%程度としている。これはテキスト側のチケット自動解決の作業で私が見てきた実感とも一致する。
特にGrokに関しては、コミュニティの評判は私の数字が示すよりも好意的だ。以下の2つはどちらも読む価値がある。
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
どちらも事実だ。だが、どちらも56.5%という数字を変えるものではない。このモデルは現時点で最良の選択肢であり、それでもサポートタスクの半分をわずかに超える程度しか完了できない。
だから、この選択に1クォーターを費やす前に私が問いたいのは、そもそもその通話のうちどれだけが、もっと上流で何かに答えていなかったせいで発生しているのかということだ。eesel自身の顧客調査の中で私が繰り返し目にするパターンは、ベンダーが売り込んでいるものとは逆だ。あるチームはこう率直に語っている。
"The lack of voice recording support requires agents to summarize voice interactions for Eesel. Implementing this feature would significantly increase our usage."
顧客対応にAIをZendeskのコパイロットとして活用している、不動産管理サポートのアウトソーシング企業
もう一度読んでほしい。ボトルネックは音声ボットではなかった。通話内容がテキストAIに届くことは一切なく、自動化がその内容に触れる前に、人間がすべての電話の会話を書き起こし直していた。それがサポート業務における音声の実態だ。通話とチケットは、2つの衣装をまとった1つのキューであり、誰もが真っ先に自動化しようとするのは、その中でも高くつくチャネルのほうだ。
たいていの場合、より安くつく手順はこうなる。テキストチャネルの自動化を電話回線より先に行い、次に一次応答、そして音声は最後にする。まだこのカテゴリの規模感をつかめていないなら、AIエージェント対チャットボットが最もわかりやすい出発点になる。
予算に関する問いも同じくらい丁寧に扱うべきだ。1分$0.08〜$0.14の音声通話は、解決済みチケット1件と単純比較できるものではないので、ベンダーの計算ツールではなく自社の利用量に対してエージェント対人間のコストの数字を計算してみてほしい。最新のAIヘルプデスクは、このリストにあるどの電話エージェントよりも、1ドルあたりずっと多くの量をさばく。そして支出の大部分は、まずAIカスタマーサービスソフトウェアに振り向けるべきものだ。
通話の裏にあるチケットにはeeselを試してほしい

正直に言うと、eeselはこのリストには入っていない。eeselは音声モデルも電話回線も売っていないからだ。eeselがやっているのは、電話回線に流れ込んでくる手前のチャネルの部分だ。
すでに使っているヘルプデスクに接続する。ZendeskやFreshdeskも対象だ。すでにそこにあるヘルプセンターとチケット履歴から学習し、それが午後4時の電話に変わってしまう前に、メールとチャットの案件を解決する。
Frontのコネクタも存在し、Slackやその他のスタックにも対応している。どのヘルプデスクを使っていても、それを置き換えるのではなく、その上に重なる会話型AIのレイヤーとして機能する。
ここまでの話すべてに関係する部分がある。実際の顧客に1件でも答える前に、あらゆるロールアウトを自社の過去のチケット履歴に対してシミュレーションしている。これは、自信ありげに話すボットが間違った答えを返すのを目にしてきたからこそ存在する仕組みだ。電話の会話には、確認できる下書きも、撤回できるものも存在しない。Parloaがエンタープライズ向けの料金を取ってでも提供している規律と同じものであり、これなしにはどのチャネルもローンチしたくない理由でもある。
課金は席数ではなく解決件数に基づくため、静かな月はコストも同じではなく、実際に少なくなる。eeselを試すのは無料だし、先に自社のチケット履歴に対して動かしてみたいならデモを予約することもできる。
よくある質問
Grok Voice Think Fast 2の代替としておすすめは?
なぜGrok Voice Think Fast 2の料金は上がったのか?
grok-voice-latestエイリアスが1.0から2.0に切り替わったことで、このエイリアスを使っていた人は、コードを一切変更しないまま1分$0.05から$0.08に移行したことになる。詳しい内訳はGrok Voice Think Fast 2の料金に関する記事にまとめている。Grok Voice Think Fast 2よりも安い代替はあるか?
grok-voice-think-fast-1.0に固定すれば、$4.80/時ではなく$3.00/時で済み、音声推論で97%のスコアを維持したまま37.5%安くなる。Gemini 3.1 Flashはさらに安く実測$1.75/時だが、インデックスは13ポイント低い。2026年、音声AIエージェントの1分あたりのコストはどれくらいか?
Grok Voice Think Fast 2の同時セッション数の上限は?
サポート通話の解決率が最も高い音声モデルはどれか?
サポートの大半がメールとチャットなら、音声モデルは必要か?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.








