2026年、音声カスタマーサポートに最適なAI(9ツールを実際に検証)

Rama Adi Nugraha
執筆者

Rama Adi Nugraha

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 4, 2026

専門家による検証済み
電話回線と音声波形、ヘッドセットを装着したサポート担当者を描いたイラスト

音声対応が復権している理由、そしてそれが今重要な理由

この10年ほど、電話サポートは廃れていくという見方が常識だった。だが実際はそうなっていない。音声はコンタクトセンターの通話量の40%まで戻り、さらに増加中だ。一方でチャットは32%の割合でそのまま音声にフェイルオーバーしている。つまり電話には、簡単な問い合わせではなく、難しい問い合わせが集まる場所になっているということであり、これは通常のコールセンター自動化とは異なる問題だ。旧世代の自動通話システムがこれをほとんど解決できなかった理由もここにある。

この選択効果こそが問題の本質だ。あるHacker Newsのコメント投稿者が、私がこれまで見てきたどのベンダーのプレゼン資料よりも的確にこう表現していた。

Hacker News

"あなたたちがやったことは称賛します。でも上質な体験という意味では、ウェブサイトにすでに書いてあることをただ伝えるだけのAIとは話したくありません。そもそも電話をかけている時点で、ウェブサイトでは答えが見つからなかったからなんです。"

ここで音声エージェントを売っているすべての企業は、自社のヘルプセンターでそれを学習させている。そして電話をかけてくる人たちは、定義上、そのヘルプセンターがすでに解決できなかった人たちだ。このことを覚えておいてほしい。がっかりするような導入事例の多くは、これで説明がつく。

選定方法と、誰も引用しないベンチマーク

2026年8月5日、私は各ベンダー自身の料金ページ、ドキュメント、ヘルプセンターをひととおり確認した。そのうえで、見出しの数字ではなく実際の分あたりの総コストを算出し、エージェントがタスクを完了できなかった瞬間に何が起きるかを確認した。ベンダーが料金表を公開していない場合は、推測せずにそう明記している。

このリストは、私が以前まとめたAI音声企業の広範な調査よりも意図的に絞り込んである。また、ベンダーの種類で並べた電話サポート向けベストAIのまとめとも異なる視点を取っている。ここでの並び順は、測定結果がそのまま反映されている。

この記事全体の読み方を変えたのがτ-Voiceという指標であり、これは汎用的な音声ベンチマークではない。シミュレートされた発信者が、フライト変更や請求の異議申し立て、時には通信障害といった実際の問題を抱えてモデルに電話をかける。スコアは、データベースが最終的に正しい状態になったかどうかで決まる。つまり、あなたがまさに買おうとしているものそのものを採点しているということだ。

70〜95%というベンダーページが謳うコール封じ込め率と、τ-Voiceサポートベンチマークで最高モデルが記録した56.5%を比較した棒グラフ
70〜95%というベンダーページが謳うコール封じ込め率と、τ-Voiceサポートベンチマークで最高モデルが記録した56.5%を比較した棒グラフ

そのリーダーボードの上位を見ると、身が引き締まる思いがする。

モデルτ-Voice(解決したサポートシナリオ)音声理解の精度最初の音声応答までの時間入力音声1時間あたりのコスト
Grok Voice Think Fast 2.0 High56.5%97%0.70秒$4.80
Qwen Audio 3.0 Realtime Plus54.6%99%4.02秒$4.42
Grok Voice Think Fast 1.052.1%97%1.25秒$3.00
GPT-Realtime-2.1 High45.7%96%1.21秒$10.75
GPT-Realtime-2 High39.8%97%1.14秒$4.14
Gemini 3.1 Flash High37.7%97%2.99秒$1.75
Deepslate Opal17.5%85%0.44秒$6.48
GPT Realtime Mini15.1%64%0.81秒$3.04

2列目と3列目を合わせて見てほしい。音声理解はほぼ解決済みの問題であり、この8モデルのうち6つが、話された質問の理解において96%以上のスコアを記録している。ところが同じモデルが、タスクを完了する段になると崖から落ちるように成績を落とす。発信者を理解することはもはや難しい部分ではない。タスクをやり遂げることこそが難しいのだ。

ベンチマークではなく実際のワークスペースでこれがどう見えるか知りたいだろうか。Bland自身のドキュメントは、どんなマーケティングページよりも正直なツール分析画面を公開している。

Blandのツール分析ダッシュボード。合計408回のツール実行、142件のエラー、34.8%のエラー率が表示され、バリデーションエラーとAPIエラーに内訳されている
Blandのツール分析ダッシュボード。合計408回のツール実行、142件のエラー、34.8%のエラー率が表示され、バリデーションエラーとAPIエラーに内訳されている

408回のツール実行、142件のエラー、エラー率34.8%。最も多い原因はカレンダー検索で、「start_time must be in the future」というエラーで81回失敗している。これはどれも音声の問題ではない。エージェントは発信者の話を完璧に聞き取ったうえで、ツール呼び出しの方で失敗している。そして、それこそがτ-Voiceのスコアが落ちる原因なのだ。

レイテンシーはもはやボトルネックではない

このカテゴリは今でもミリ秒単位のスピードで売られている。理由はわかる。何年もの間、それこそが本当の壁だったからだ。しかし今はもう違い、リーダーボードがそれをはっきりと示している。

4つのスピーチ・トゥ・スピーチモデルを、最初の音声応答までの時間と、完了したサポートタスクの割合で2×2にプロットした図。Deepslate Opalが最速だが最も能力が低い
4つのスピーチ・トゥ・スピーチモデルを、最初の音声応答までの時間と、完了したサポートタスクの割合で2×2にプロットした図。Deepslate Opalが最速だが最も能力が低い

Deepslate Opalは表全体で最速の0.44秒で応答するが、解決できるサポートシナリオは17.5%にとどまる。Grok Voice Think Fast 2.0はそれより0.25秒ほど遅いが、56.5%を解決する。260ミリ秒程度で電話を切る人などいない。人が電話を切るのは、エージェントが用件を処理できなかったときだ。

そして運用者が報告する本当の問題は、遅さではまったくない。エージェントが相手の話に被せてしまうことだ。

Reddit

"本当にひどい。最初の30秒で発信者の約40%を失っている。現在の構成はVapi + GPT-4、ターン終了検出は800ms(デフォルト)、ネットワークレイテンシーは平均120〜150ms、処理でさらに200〜300ms加わる。試したこと:無音しきい値を1.2秒に増やす→ボットがもたついて感じられ、故障していると思われる。500msに減らす→割り込みの嵐で、前より悪化。プロンプトに『顧客が話し終わるのを待って』と追加→まったく効果なし。"

これがバージイン(割り込み)処理だ。モデルの問題というよりチューニングの問題であり、音声導入において最も予算が見積もられていない項目だと言って間違いない。自前でスタックを構築したある運用者は、そのコストを「ターン検出のしきい値をきちんとチューニングするまで200〜400ms」と表現し、本番品質になるまで「なぜエージェントが発信者に被せて話すのか」と格闘する2か月を見込んでおくようこのビルド対バイのスレッドで助言している。

私が見つけた中で最も網羅的な報告は、すでに20件の導入実績を持つ人物によるものだった。バージイン、転送、そしてコストまで、一気にカバーしている。

Reddit

"これまでに約20の中小企業(配管業者、歯科医院、メディカルスパなど、主にサービス業)に音声エージェントを導入してきた。実際に本番環境で直面したことを書く。断トツで最大の問題はバージイン処理だ。エージェントがまだ話している最中に顧客が話し始めると、すべてがおかしくなる。ほとんどのプラットフォームはデモではうまく処理できるが、背景ノイズやアクセント、早口の相手が絡む実際の通話では常に壊れる。クライアントごとにカスタムの無音検出しきい値を作らなければならなかった。2番目は人間への引き継ぎだ。AIが対応できないとき、きれいに転送する必要がある。VapiもRetellも、テレフォニーの設定によってはここで苦戦する。通話が切れたり、3秒の無音区間ができて発信者が電話を切ってしまったりする。結局、エージェントが接続前に人間へブリーフィングするウォームトランスファーのフローを自前で構築した。[中略]コスト面で一番驚いたのは、通話が長引いたときのコストの大きさだ。STT+LLM+TTS+テレフォニーを合計すると、10分の通話で1.50〜2.00ドルかかることがある。小さく聞こえるかもしれないが、1クライアントで1日200件の通話を処理していると、あっという間に積み上がる。通話を4分未満に抑えるため、ハードカットオフと要約機能を自前で作らざるを得なかった。"

ここから3点を取り上げる価値がある。10分の通話は総額1.50〜2.00ドルかかるという数字は、どのホームページよりも、この後の試算と一致する。デモではバージインの問題が隠れる。デモの発信者にはアクセントも背景ノイズもないからだ。そして転送のギャップとコストの両方に対する解決策は、プラットフォームが提供していないものを自前で構築することだった。

実際に採点した4つの項目

  1. 人間への転送。 それが存在するかどうかではない。ウォームであるか、生のトランスクリプトではなく要約を引き継ぐか、そしてそのすべてがエンタープライズ契約の裏に隠れていないか。優れたエスカレーション管理は、デフレクションと不満を抱えた発信者との違いを生む。
  2. ナレッジソース。 ここに挙げたツールのほぼすべてが、公開ウェブサイトのクロールとアップロードされたファイルを取り込む。過去のチケットや認証付きのウィキに触れるものはほとんどない。この違いが、ヘルプセンターがすでに失敗した通話をどう処理するかを決める。
  3. 導入前のテスト。 自分で書いたシナリオを実行する「シミュレーション」は、自社の通話履歴を再生するものとは保証のレベルが違う。ここで後者を行うベンダーはちょうど1社だけだ。ハルシネーション防止にとって、これはどんなガードレール設定よりも重要だ。
  4. テレフォニーを含めた実際の分あたりコスト。 ホームページに書かれている数字ではない。これはまた、コールセンターのROIを左右する数字でもある。

2026年、音声カスタマーサポート向けベストAIツール9選

ツール得意分野実際の総額レート課金単位人間への転送ナレッジソース自社の通話でテスト可能同時接続数セキュリティヘルプデスク連携
ElevenLabs Agents予測可能なレート$0.08/min + キャリア料金分単位、プリペイドあり、transfer_to_numberファイル、URL、無料プランでもRAG利用可なしプランにより4〜40SOC 2、ISO 42001、PCI DSS L1、EnterpriseはBAA対応Zendesk、Salesforce
Retell AI構築チームなしのサポート運用約$0.135/min分単位、積み上げ式ウォーム、スーパーバイザー引き継ぎ付きウェブサイトクロール、ファイルアップロードなし無料20、以降$8/回線/月SOC 2 Type II、HIPAA、GDPRHubSpot、Salesforce。Zendeskは「近日対応」
Vapiモデルスタックの完全な制御約$0.105/min分単位、積み上げ式あり、テレフォニープロバイダー経由ファイルアップロードのみ、Gemini検索なし無料10、以降$10/回線/月HIPAA $2,000/月、ZDR $1,000/月プリビルトなし
PolyAI既存のCCaaS環境見積もりのみ分単位ありドキュメントと連携機能なし未公開SOC 2 Type 2、ISO 27001、PCI DSS、GDPR、HIPAA標準対応CCaaS経由のZendesk Talk
Parloa自社の通話履歴でのテスト見積もりのみ消費量課金、タスクの複雑さに応じるありエンタープライズ連携あり、実際のトランスクリプトを再生未公開ISO 27001、SOC 2 Type 1・2、PCI DSSZendesk、ServiceNow、Salesforce、Dynamics
Sierra解決件数のみへの課金見積もりのみ解決した会話単位あり、コンテキスト維持エンタープライズ連携音声シミュレーション未公開SOC 2、ISO 27001、ISO 42001、HIPAA、PCI DSS、FedRAMP未公開
Bland AI高い同時接続数とセルフホスティング$0.11〜0.14/min分単位+プラットフォーム料金Enterpriseのみファイル、テキスト、公開ウェブなし10〜100、Enterpriseは最大100万全プラン99.9% SLA、EnterpriseはBAAなし
SynthflowFreshworksネイティブな導入約$2,500/月(下限)秒単位、集計コールド、ウォーム、要約付きウォームPDF、URL、クロール、ZendeskインポートTest Center、課金対象契約で規定SOC 2、GDPR、ISO 27001Freshworks(Freshcaller)
Grok Voice Agent Builder最速の高性能モデル$0.08/min + $0.01の番号料金分単位、従量課金ツール呼び出し経由コレクション、ファイル・ウェブ検索なしチームあたり10セッション音声版は未公開なし

9つのツールに、4種類の異なる課金方法。自社の通話アーカイブに対してテストできるのはたった1社であり、それこそがスクリーンショットを撮っておくべき列だ。

個別の解説に入る前に、簡単な試算をしておこう。見出しのレートはそのままでは互いに比較できず、そのギャップは候補リストを変えるほど大きい。

1. ElevenLabs Agents

得意分野: 契約前に請求額をセント単位まで予測しなければならないチーム向け。

ElevenLabsはテキスト読み上げ(text to speech)で最もよく知られている。Agentsプラットフォームはその上に乗る会話レイヤーで、これまでに400万件以上のエージェントを送り出してきた。このリストの1位に置いた理由は地味なものだ。ここに挙げたベンダーの中で唯一、料金の算数が破綻しないからだ。

ElevenAgentsのコンソール画面。33.9Kコール、平均通話時間3分46秒、全体の成功率75.1%、平均CSAT評価3.5星が表示されている。ElevenLabsより引用
ElevenAgentsのコンソール画面。33.9Kコール、平均通話時間3分46秒、全体の成功率75.1%、平均CSAT評価3.5星が表示されている。ElevenLabsより引用

このダッシュボードには立ち止まる価値がある。この記事の中で唯一、ベンダーが自社の数字を編集せずそのまま見せている場所だからだ。全体の成功率75.1%、平均CSAT3.5星。つまり、95%といった誇張ではなく、現実味のある導入実績を示している。

実際にできること

SIP経由のテレフォニーが上位プラン限定ではなく全プランに含まれているのは珍しい。ナレッジベースとRAGは無料プランでも動作する。ツール呼び出し、バッチコール、エージェント管理用のホスト型MCPサーバー、CLI。すべて揃っている。テレフォニー面では、Genesys、Amazon Connectとの連携が明記されている。チケット管理面ではZendeskとSalesforceのみが、実際のページを持つ2つのチケットシステムだ。

構築前に知っておくべきことが2つある。まず、自社のページ同士で対応言語数の記載が食い違っており、音声カタログには70以上と書かれている一方、エージェントが実際に話せるよう設定できるのは31言語だ。次に、エージェント全体のラウンドトリップレイテンシーは公開されておらず、Flash v2.5の約75ms、Scribe v2 Realtimeの約150msというコンポーネント単位の数字があるだけだ。どちらも、実際に発信者が耳にするものとは別物だ。

料金

プラン月額含まれる分数実質$/分超過料金バースト同時通話数
Free$015該当なし$0.08$0.164
Starter$675$0.0800$0.08$0.166
Creator$22(初月は$11)275$0.0800$0.08$0.1610
Pro$991,238$0.0800$0.08$0.1620
Scale$2993,738$0.0800$0.08$0.1630
Business$99012,375$0.0800$0.08$0.1640
Enterpriseカスタムカスタム交渉次第交渉次第該当なし引き上げ可能

「実質$/分」の列を見てほしい。すべての有料プランがちょうど$0.08に割り切れる。Businessは12,375分で$990、そして12,375×$0.08はぴったり$990.00だ。つまり、分数の割り当ては価格から逆算されたものであり、どのプランにもボリューム割引が存在しないということだ。テキストメッセージは1通$0.003で、キャリアのテレフォニーはさらに「実費」で別途課金される。

良い点

  • この記事の中で唯一、分あたりのコストを実際に予測できる。
  • SIPトランキングがEnterprise限定ではないため、$6プランでも自社のキャリアが使える。
  • 本格的なコンプライアンスリスト:ISO 42001、AIUC-1、PCI DSS Level 1。
  • ナレッジベースとRAGは無料プランでも動作するため、まともなテストに一切費用がかからない。

課題

  • ボリューム割引は一切ない。50,000分でも75分のときと同じレートを支払うことになる。
  • 分数は従量課金ではなくプリペイドなので、通話量に波があると使い切れない余剰分にお金を払うことになる。
  • HIPAA用のBAAはEnterprise限定で、SSOとSLA条項も同様だ。
  • 運用者からはtransfer_to_numberツールが引き継ぎを完了できないという報告があり、このr/ElevenLabsのスレッドで詳しく議論されている。

私の見解: 通話量が予測しやすく、経理チームが納得する数字が欲しいなら、まずここから検討するといい。ただし均一レートには両面がある。月間20,000分を超えそうなら、契約前にエンタープライズ見積もりを取っておこう。ここには成長していける割引カーブが存在しないからだ。プランのさらなる内訳はElevenLabsの料金ガイドで、乗り換えの選択肢はElevenLabsの代替ツールで扱っている。

2. Retell AI

得意分野: コール分析ときれいなエスカレーションを、エンジニア採用なしで実現したいサポート運用チーム向け。

Retell AIは、開発者よりもサポートマネージャーの前に置きたいツールだ。コストの透明性は、ほとんど居心地が悪くなるレベルまで徹底している。また、「AIはコールセンターのエージェントを置き換えられるか?」という質問に、自社のFAQで率直に**「いいえ」**と答える唯一のベンダーでもある。このページに書かれているどの封じ込め率の主張よりも、私はこれに敬意を抱く。

会話フローのキャンバス、OpenAI 4o-miniに設定されたエージェントプロンプトエディタ、台本通りの予約対応をテストするTest Audioパネルを表示するRetell AIの画面。Retell AIより引用
会話フローのキャンバス、OpenAI 4o-miniに設定されたエージェントプロンプトエディタ、台本通りの予約対応をテストするTest Audioパネルを表示するRetell AIの画面。Retell AIより引用

3番目のパネルに注目してほしい。ウェルカムメッセージは「User Initiates: AI remains silent until users speak first(ユーザー起点:ユーザーが先に話すまでAIは沈黙する)」に設定されている。小さな設定だが、サポート通話の最初の3秒の印象を大きく左右する。

実際にできること

強みはエスカレーション層にある。ウォームトランスファー、IVRナビゲーション、DTMFキャプチャがすべて1つのコール転送ノードの下にまとまっており、ライブモニタリングによってスーパーバイザーが聞き取ったり、通話をそのまま引き取ったりできる。さらに良いのは、AI利用料が転送の瞬間に止まり、以降はテレフォニー料金だけが発生する点だ。これは正しいインセンティブ設計であり、他にこれをやっているベンダーはほとんどない。

通話後の分析、トランスクリプト、Webhook、APIはすべて無料の従量課金プランで利用できるため、本当の意味でテストできる。リファレンス顧客の一社であるMedical Data Systemsは、転送率30%を公開している。つまり実際の導入では、封じ込め率はおよそ70%ということになる。

ナレッジベースはウェブサイトクロールとファイルアップロードだ。過去のチケット履歴を取り込む機能は文書化されておらず、シミュレーションも自社の通話アーカイブの再生ではなく、自分で作成した採点式のテストケースを実行するものだ。

料金

項目レート備考
Retell音声インフラ$0.055/分回避不可。音声認識(STT)もここに含まれる。
テキスト読み上げ$0.015/分ElevenLabsの音声を選ぶと$0.040/分
LLM$0.003〜$0.32/分下限はGPT 5 nano、上限はGPT 5.5 Fast
テレフォニーマネージドで$0.015/分自社SIPトランクなら$0
ナレッジベース+$0.005/分最初の10個を超えると1個あたり月$8追加
ガードレール+$0.005/分PII除去は別途+$0.01/分
AIコールQA$0.10/分最初の100分は無料
同時接続$8/回線/月最初の20回線は含まれる

見出しのレンジは1分あたり$0.07〜$0.31で、$10分の無料クレジットがあり、プラットフォーム料金はない。Retell自身の計算ツールはデフォルトで$0.115/分になっているが、これはテレフォニーとすべてのアドオンをゼロにした場合の数字だ。GPT 4.1にRetell自身の音声、マネージドの米国番号、ナレッジベース有効という現実的な着信サポート構成を組むと、$0.135/分に落ち着く。これは5,000分で月額$677になる。全トラフィックでAIコールQAを有効にすると、月額約$490、74%の増加が加わる。

良い点

  • この記事の中で最も優れた人間への転送機能を持ち、発動した瞬間に課金メーターが止まる。
  • スーパーバイザーはライブ通話を聞いたり、そのまま引き取ったりできる。
  • コンポーネント単位のレートカードに至るまで、コストの透明性が高い。
  • SOC 2 Type II、HIPAA、GDPRはプランに関係なくプラットフォーム全体に適用される。

課題

  • Zendeskは提供済みではなく「近日対応」となっている。実際に稼働する連携はCal.com、HubSpot、Salesforceどまりで、ドキュメントのどこにもFreshdesk、Gorgias、Front、Help Scoutとの連携は見当たらない。
  • 約600msというレイテンシーの主張は「独立系ベンチマーク」によるものとされているが、その名称もリンクも一切示されていない。
  • どちらのページにも、対応言語数やアップタイムSLAのパーセンテージは公開されていない。
  • スピーチ・トゥ・スピーチオプションは$0.345/分で、Retell自身が示す上限の$0.31を上回っている。

私の見解: サポートチームにとって最も総合力の高い選択肢だが、大きな注意点が1つある。ZendeskやFreshdeskを使っているなら、Webhook経由でチケットの引き継ぎを自前で構築する予算を見込んでおくべきだ。Retellが自社の連携紹介の目立つ位置に何を置いているかを見てほしい。CCaaSプラットフォーム、Genesys、Five9、Avaya。これが、このツールが誰のために作られたかを物語っている。自社の構成をモデル化したいなら、Retell AIの料金の内訳をコンポーネント単位で解説している。

3. Vapi

得意分野: スタックのあらゆるコンポーネントを自分たちで選びたいエンジニアリングチーム向け。

Vapiはプロダクトではなくインフラだ。トランスポート、音声認識、モデル、音声のすべてを自分で組み合わせ、Vapiはその結果をオーケストレーションする対価として1分あたり$0.05を課金する。深夜3時にDeepgramをAssemblyに切り替えたくなるようなタイプなら、これが向いている。

Deepgram、GPT 4o-mini、Azureのプロバイダーチップが並び、分あたりコストと約450msのレイテンシーを示すメーターが表示されたVapiのアシスタントビルダー画面。Vapiより引用
Deepgram、GPT 4o-mini、Azureのプロバイダーチップが並び、分あたりコストと約450msのレイテンシーを示すメーターが表示されたVapiのアシスタントビルダー画面。Vapiより引用

この一列に並んだプロバイダーチップが、このプロダクトのすべてを1枚のスクリーンショットに凝縮している。そして各チップは、請求書上の別々の項目でもある。

実際にできること

Squadsとワークフロー、ツール呼び出し、オブザーバビリティ、本格的な評価スイート。Vapi自身のトランク経由で自前のSIPを持ち込む場合は無料で、これは実際に効くコストレバーだ。同時10通話が標準で含まれ、追加の回線は1回線あたり月$10になる。

知っておくべき厳格な期限が1つある。ビジュアルのWorkflowsビルダーは2026年8月19日をもって停止する、あと2週間だ。Vapiが示す理由は、現在のAIが自律的なノードグラフエージェントとして確実に機能しないこと、そしてSquadsの方が「一貫してより良い結果」につながったことだ。したがって、2026年半ば以前に構築されたVapi製のサポート機能は、今すぐ移行が必要になる。Vapiは、AI支援による移行が正確または完全であることを保証しないとも警告している。

料金

項目レート備考
Vapiオーケストレーション$0.05/分SMSチャット1通あたり+$0.005
トランスポート無料〜$0.014/分Vapi SIPとWebRTCは無料、Twilioの発信は$0.014
音声認識$0.000631〜$0.01733/分下限はGoogle、上限はSpeechmatics
テキスト読み上げ$0.002〜$0.24/分下限はInworld、上限はTavus
LLM100万トークンあたり$0.01〜$2.12下限は4.1-mini、上限は4.5 Preview
HIPAA月$2,000ゼロデータ保持は別途月$1,000

Vapi+Twilioの着信+Deepgram+ElevenLabs+安価なモデルという現実的な組み合わせを作ると、およそ**$0.105/分**になる。6分の通話で$0.63だ。ここも注目に値する。Vapi自体の手数料は、現実的な1分の48%、最安構成の1分の91%を占める。Enterprise条件は年間400,000分から始まる。

良い点

  • すべてのコンポーネントを完全にコントロールでき、それぞれに公開されたレートカードがある。
  • Vapi SIPまたはWebRTCならトランスポートは無料。
  • 徹底的に最適化すれば、この記事の中で最も安い下限、およそ$0.055/分を実現できる。
  • オブザーバビリティと評価ツールが実際に優れている。

課題

  • テストも本番と同じレートで課金される。Vapi自身のFAQにこうある。「テストは無料ですか?いいえ、テスト通話も通常の通話と同じ料金がかかります。」
  • ナレッジベースはファイルアップロードのみ、検索はGemini限定で、ヘルプセンターのクロール機能はなく、推奨上限は1ファイルあたり300KB未満だ。
  • ツールカタログにチケット管理系の連携はゼロ。チケットの読み書きは自分で構築するapiRequest頼みになる。
  • Vapi自身の測定手法ページによれば、「500ms未満のレイテンシー」という見出しはエンドポイント検出とトランスポートを除外した数字であり、同じページでエンドポイント検出が遅延のかなりの部分を占めうることも認めている。

私の見解: エンジニアがいて、コストの下限を追求したいなら正解だ。来週から通話に応答してほしいなら不正解だ。どちらにせよ、8月の期限前にWorkflowsの移行は済ませておこう。プラットフォームの全体像についてはVapiレビューで詳しく解説している。

4. PolyAI

得意分野: すでにGenesys、Avaya、Amazon Connectを運用している既存のコンタクトセンター向け。

PolyAIは開発者ではなくコンタクトセンターに売り込んでいる企業であり、連携リストがその証拠だ。Genesys、Avaya、Amazon Connect、Twilio、Five9、NICE、Talkdesk、Cisco、RingCentral、Zendesk Talk。すべてサポートされている。つまり、既存の環境を置き換えることを求めるのではなく、すでに持っている環境にそのまま組み込める。

サンドボックスのチャットプロンプトと、ナレッジベースのトピック追加や人間のエージェントへの通話転送を扱うスターターテンプレートを表示するPolyAI Agent Studio。PolyAIより引用
サンドボックスのチャットプロンプトと、ナレッジベースのトピック追加や人間のエージェントへの通話転送を扱うスターターテンプレートを表示するPolyAI Agent Studio。PolyAIより引用

このテンプレート一覧は、誰のために作られたツールかを雄弁に物語っている。「人間のエージェントへの通話転送を処理する」が、高度なトピックではなく最初のテンプレートとして登場する。正しい感覚だ。

実際にできること

Agent Studioが構築の場であり、セルフサーブの入口はstudio.poly.aiにある。サイト全体で公開されている導入期間は、セルフサーブなら10分未満から、Amazon Connect展開ではおよそ8週間までと幅がある。速い方の数字は割り引いて見た方がいい。対応言語数は、どのPolyAIのページを見るかによって42言語だったり45言語だったりする。

セキュリティ体制は、この記事の中で最もしっかり文書化されており、珍しいことにプランによる制限もない。SOC 2 Type 2、ISO 27001、PCI DSS、GDPR、HIPAAはすべて標準対応で「アーキテクチャに組み込まれている」と説明され、Amazon Connectパートナーページには AWS FTR認証も記載されている。有料の導入にはすべて、電話回線に対する99.9%のアップタイムSLAと、24時間365日の緊急サポートラインも含まれる。午前2時に電話応答システムが壊れたとき、これは注釈程度の話では済まない。

料金

非公開。料金ページは「スケールするシンプルな料金」と題され、透明性のある構造を約束しているにもかかわらず、実際に表示されるのは年間通話量(1万件未満から100万件超)で区切られたリード獲得フォームだ。PolyAIのどのページにも、ドル金額はいっさい記載されていない。最低契約量もない。

少なくとも課金単位は明確で、PolyAI自身の言葉によれば、継続利用は「分単位で課金され、そこには積極的なパフォーマンス改善、メンテナンス、24時間対応のサポートが含まれる」とのことだ。

良い点

  • この記事の中で最も深いCCaaS連携リストを持ち、すでに運用している環境にそのまま適合する。
  • セキュリティ認証がエンタープライズプランに限定されず、すべてのレベルで提供される。
  • 分単位のレートに99.9%の電話回線SLAと24時間対応の緊急ラインが含まれる。
  • 幅広い導入事例にわたる顧客の成果が公開されている。

課題

  • 価格は非公開。料金ページは「透明性がある」と謳いながら、実際に見せるのはフォームだ。
  • 封じ込め率はユースケースによって大きくばらつく。英国のパブチェーンでのゲストコールでは70%、Golden Nuggetの予約では34%、匿名の小売銀行では30%。レストランの数字は、サポートキューにとって公正な目安にはならない。
  • サイト内で言語数と導入期間について、それぞれ2度矛盾した記載がある。
  • サイト上のすべての見出し統計はクライアント側でアニメーションするカウンターであり、独立して検証するのが難しい。

私の見解: すでにCCaaSプラットフォームを持っているなら、PolyAIはおそらく稼働する音声エージェントへの最短ルートであり、付属のSLAはその価値に見合っている。1つだけ譲れない点がある。予約ではなくサポート導入からの封じ込め率を要求することだ。公開されている両者の差は2倍以上ある。このカテゴリの背景については、カスタマーサービス向け会話型AIの入門記事を用意している。

5. Parloa

得意分野: 実際の通話に応答する前に、自社の過去の通話でエージェントをテストしたい企業向け。

Parloaは欧州発のエンタープライズ勢だ。2026年1月に評価額30億ドルで3億5,000万ドルを調達し、純収益維持率150%でARR5,000万ドル超を突破、累計調達額は4年足らずで5億6,000万ドルを超えた。顧客にはAllianz、Booking.com、IKEA、SAPが名を連ねる。

Parloaはプロダクトのスクリーンショットをどこにも公開していないため、以下はインターフェースのキャプチャではなく、自社のアーキテクチャ図だ。通常、これはベンダーにとってマイナス材料と見なすところだが、今回に限っては、その図がまさに重要なことを率直に語っている。

設計と統合、テストと反復、デプロイと拡張、モニタリングと改善という4段階のライフサイクルを示すParloaのAI Agent Management Platformの図。Parloaより引用
設計と統合、テストと反復、デプロイと拡張、モニタリングと改善という4段階のライフサイクルを示すParloaのAI Agent Management Platformの図。Parloaより引用

このサイクルの2段階目は「テストと反復」で、デプロイやモニタリングと同等の扱いを受けている。他のベンダーはすべてテストを1つの機能として扱っているが、Parloaはそれを中心に会社を築いた。

実際にできること

Parloaがこのリストに入っている理由は、そのシミュレーション環境にある。この記事全体を通して、本当の差別化要因と呼べる唯一の機能でもある。シナリオ、言語、チャネル、エッジケースにまたがる何千もの会話をシミュレートし、決定的に重要なのは、誰かが手作業で書いたシナリオだけを実行するのではなく、実際の過去のトランスクリプトと合成テストを組み合わせている点だ。あいまいさとツール呼び出し、フォールバック、ブランドの一貫性をテストする。サブタスクを切り出し、ステージングと本番の間を切り替える。

評価はLLM-as-judgeとルールベースの基準の両方で行われ、タスクの成功、トーン、正確さ、API挙動を採点する。そして根本原因のトレーシングがあり、行単位の修正提案がプラットフォーム内でそのまま適用される。これは、ここに挙げたすべてのベンダーに備わっていてほしい仕組みだ。テキストにも私たちが適用しているのと同じ原則でもある。自分で考えた質問だけでテストされたボットは、何も有益なことを教えてくれない。

連携はAvaya、Five9、Genesys、NICE、Twilio、Verint、Salesforce、Dynamics、ServiceNow、Zendesk、SAP、そしてSIPをカバーする。70か国以上で130以上の言語に対応するが、一覧はどこにも公開されていない。データレジデンシーに関する主張は通常より厳密な表現で、ランタイムのルーティングによって、保管時だけでなくやり取りの最中も処理が管轄内にとどまるとされているが、詳細はゲート付きのトラストセンターの奥にある。

料金

非公開で、料金ページのURLは404になる。唯一の手がかりはParloa自身のFAQで、「均一料金やトークン数ではなく、タスクの複雑さと労力にコストを連動させた消費量ベースの料金モデル」と説明されており、見積もりはボリューム、ユースケース、ビジネス価値に基づいて提示される。最低利用量、無料プラン、トライアルはいずれも公開されていない。

良い点

  • シミュレーションで実際の通話履歴を再生する、この記事の中で唯一のツール。
  • 根本原因のトレーシングがあり、修正はプラットフォーム内で適用される。
  • Azure上に構築された本格的なEU体制で、ランタイムのルーティングも管轄内にとどまる。
  • 認証はISO 27001:2022、SOC 2 Type 1・Type 2、PCI DSS。

課題

  • 料金はいっさい公開されていない。「タスクの複雑さ」による消費量課金は、この記事の中で最も予測しづらい単位でもある。
  • HIPAA、GDPR、DORAは「認証」ではなく「準拠している」と表現されている。これはParloa自身の言葉であり、正確に読む価値がある。
  • ホームページの顧客パーセンテージはJSアニメーションのカウンターであり、実際の数字は事例ページの方に載っている。
  • Amazon Connectは、公開されているParloaの連携リストのどこにも登場しないため、対応していると決めつけないこと。

私の見解: エンタープライズの買い手として、ベンダーに1つだけ質問できるとしたら、シミュレーションが自社の通話を再生してくれるかどうかを聞くべきだ。この記事の中で、それに「はい」と答えられるのはParloaだけだ。この1つの能力は、他社のベンチマークにおける封じ込め率のポイントよりも価値がある。プラットフォームの詳細はParloaレビューで、商用面についてわかっていることはParloaの料金でまとめている。

6. Sierra

得意分野: 分単位の課金よりも解決単位の課金が有利になる、高付加価値なサポート向け。

Sierraは2026年5月、評価額150億ドル超で9億5,000万ドルを調達し、Fortune 50の40%以上に導入されていると謳っている。音声プロダクトは55以上の言語に対応し、会話の途中での言語切り替え、ターンごとのモデルルーティング、コンテキストを維持したエスカレーションを備える。DTMFトーンによるカードおよびACHの音声決済も、Level 1 PCI準拠のインフラを通じて受け付ける。

デモブランドSierra Spinsの9秒間の音声通話画面。発信者が届いていない自転車の返金を求めている。Sierraより引用
デモブランドSierra Spinsの9秒間の音声通話画面。発信者が届いていない自転車の返金を求めている。Sierraより引用

これはコンソールのキャプチャではなくデモ通話であり、私が示せる最大限のものだ。Sierraの音声ページに掲載されているビジュアルはすべて動画のサムネイルで、プロダクト全体のキャプチャはどこにも公開されていない。

Sierraはプロダクト以外の点でも触れる価値がある。この記事全体の見方を変えたτ-voice調査を公開している企業でもあるからだ。その調査結果によれば、フロンティアは2025年8月から2026年4月の間にpass@1で30.4%から67.3%へと進歩したが、テキスト推論の上限であるおよそ85%にはまだ及ばない。すべてのプロバイダーが現実的な電話音声で5〜14ポイント低下する。そして最初の重大なエラーの79%はエージェント自身の落ち度だ。自社のカテゴリを難しく見せる数字をあえて公開するベンダーというのは、良い兆候だ。

実際にできること

商業面での特徴は成果報酬型の料金だ。Sierra自身の言い方では「良い仕事に対して支払う」であり、単位は「解決したサポート会話、防いだ解約、アップセル、クロスセル」に紐づいており、「会話が未解決の場合、ほとんどのケースで課金されない」という。最も端的な表現はこうだ。「Sierraは、あなたのためにタスクを完了したときにのみ報酬を得る。」

ただし、この但し書きは注意深く読むべきだ。契約時に効いてくるのはまさにそこだからだ。エスカレーションは「ほとんどの場合」課金されないとされるが、例外は公開されていない。実際の請求はブレンド型であり、Sierra自身も「ルーティングや応対のみのやり取りは、成果にかかわらず会話数に基づいて支払う消費量ベースの料金の方が適している場合がある」と述べている。そして「解決」という言葉には、ここでは普遍的な定義がない。基準は契約ごとに合意される。

料金

料金ページはそもそも存在しない。sierra.ai/pricingは完全な404を返し、ドル金額はどこにも記載されていない。成果単価も、初期費用も、最低利用量も、トライアルもない。プラットフォーム料金についても一切言及がないが、否定もされていないため、存在しないと決めつけない方がいい。

良い点

  • 課金モデルが、通話時間ではなく解決件数という本当に求めているものに一致している。
  • この記事の中で最も幅広い認証リスト:SOC 2、ISO 27001、ISO 42001、HIPAA、GDPR、EU AI Act、FedRAMP、PCI DSS。
  • 55以上の言語に対応し、会話の途中でも切り替えられる。
  • 自社のカテゴリの限界について、正直な調査結果を公開している。

課題

  • 価格はいっさい公開されていないため、何かと比較するにはまず営業プロセスに入る必要がある。
  • 認証バッジには監査日も、SOC 2のType I/IIの区別も、FedRAMPの認可レベルも記載されていない。
  • 実名で公開されている音声顧客はRocket Mortgage、Guild、Nextにとどまり、いずれについても封じ込め率、解決率、対応時間の数字は公開されていない。
  • 音声のレイテンシー数値は公開されていない。τ-voiceの記事に出てくる200msという数字は、エージェントの応答時間ではなくベンチマークの音声チャンクの粒度なので、それとして引用しないこと。

私の見解: 封じ込め率が悪いほど成果報酬型の料金はより魅力的になる、これは巧妙なアラインメントだ。ただし、課金対象の単位を定義するのは自分たちだという自覚を持って交渉に臨むべきだ。「ほとんどの場合」の例外に該当するエスカレーションが何かを、文書で明確にしておこう。この料金モデルについてはSierra AIの料金で、競合勢についてはSierraの代替ツールで掘り下げている。

7. Bland AI

得意分野: 高い同時接続数、または自社クラウド内での稼働が必須の導入向け。

Bland AIは、この記事の中で最も明確なプラン体系を公開しており、同時接続数の上限も群を抜いて高い。ドキュメントのインデックスには、Enterpriseで「最大100万件の同時通話」に対応するとある。このリストの他のどのツールも、この数字に近づいていない。

エスカレーションとコールバックのノードを含むテックサポートフローを表示するBland Pathwaysエディタと、Happy Pathゲート100%、Angry Callerテスト94%と表示されているScenariosパネル。Bland AIより引用
エスカレーションとコールバックのノードを含むテックサポートフローを表示するBland Pathwaysエディタと、Happy Pathゲート100%、Angry Callerテスト94%と表示されているScenariosパネル。Bland AIより引用

これは、このカテゴリ全体で「テスト」が何を意味するのかを最もはっきり示す図だ。右側のパネルは「Angry Caller」テストで94%、「Happy Path」ゲートで100%を記録している。どちらも誰かが書いたペルソナだ。有用ではあるが、それでも自社の通話履歴ではない。

実際にできること

会話フロー(Pathways)、ツールおよびAPI呼び出し、そして3つのホスティング形態が公開されている。Bland Cloud、AWS/GCP/Azure上の自社VPC、あるいは完全オンプレミス・エアギャップ構成だ。いずれにもドル金額は付いていない。追加料金や最低利用量も公開されておらず、すべてEnterprise契約の中に含まれる。

前回確認したときからの新しい点として、実際のレイテンシー数値が示されている。ホームページには、主張される1,240msの「業界平均」に対して400msと記載され、ドキュメントには400ms未満、プロダクトページにはp50で380msと365msの数字が示されている。1,240msという比較には出典がない。測定値ではなくマーケティング表現として扱うべきだ。

1つ言葉のわながある。プロダクトページは「過去の通話に対するバックテスト」機能を打ち出しているが、文書化されているScenariosの仕組みは、あなたが書いたペルソナのプロンプトに従うシミュレートされた発信者だ。自社のアーカイブを再生するのとは異なる保証であり、直接確認する価値がある。

料金

StartBuildScaleEnterprise
通話時間$0.14/分$0.12/分$0.11/分カスタム
プラットフォーム料金$0$299/月$499/月契約に基づく
転送時間$0.05/分$0.04/分$0.03/分カスタム
同時通話数1050100通話量に応じて調整
日次/時間あたりの上限100 / 1002,000 / 1,0005,000 / 1,000無制限
ナレッジベース/音声数10 / 150 / 5100 / 15無制限
アップタイムSLA99.9%99.9%99.9%99.9%

この損益分岐点は直感に反するので知っておく価値がある。Buildが月間14,950分を超えて初めてStartを上回り、Scaleは20,000分を超えて初めてBuildを上回る。およそ15,000分未満では、無料のStartプランが算数上最も安い。ここでのアップグレードは、レートのためではなく同時接続数のためだ。

良い点

  • 無料プランを含む全プランで99.9%のアップタイムSLAがあり、これは他のどのベンダーもやっていない。
  • 自社VPCでのセルフホスティング、またはエアギャップのオンプレミスが公開されたオプションとして存在する。
  • 同時接続数の上限が、この記事の中で最も高い。
  • 自社のトランクを持ち込めば、転送分の料金は完全になくなる。

課題

  • 連携ディレクトリには7カテゴリにわたる19の連携があるが、ヘルプデスクやチケットシステムはゼロだ。それでもプロダクトの謳い文句にはチケット対応のサポートがあると書かれている。通話をZendeskやFrontに取り込むには、カスタムツールか、自前で構築する通話後のWebhookが必要になる。
  • ウォームトランスファーはEnterprise限定であり、ドキュメントにもそのゲートがはっきり明記されている。セルフサーブの導入はコールドトランスファーのみで、回答の引用元表示もない。
  • 引用元表示、ナレッジベースのギャップレポート、成果、ガードレール、アラート、SMS、ウェブチャット、BAA。これらもすべてEnterprise限定だ。
  • 料金ページには、テレフォニーは実費で別途課金されると書かれている。一方でホームページのFAQとドキュメントには、分単位のレートに含まれるとある。この点は書面で確認しておくべきだ。

私の見解: Blandはサポート製品というより音声プラットフォームであり、見出しの実績もコスト削減ではなく収益創出型のものが中心だ。同時接続数のため、あるいはセキュリティチームが譲らないホスティング要件のために選ぶといい。サポート通話への応答のために購入するのであれば、最初からEnterpriseプランの価格を確認しておくべきだ。必要な機能はすべてそちらにあるからだ。そして、チケット対応そのものが目的なら、より広範な記事でまとめたサポート自動化ツールの中の1つの方が適合度は高い。

8. Synthflow

得意分野: 音声AIをFreshcallerの中で使いたいFreshworksユーザー向け。

Actionsタブを開いた通話詳細ドロワーを表示するSynthflowの通話ログ。756ミリ秒で7件の結果を返し、最高類似度スコア0.80を記録したナレッジベース検索が示されている。Synthflowより引用
Actionsタブを開いた通話詳細ドロワーを表示するSynthflowの通話ログ。756ミリ秒で7件の結果を返し、最高類似度スコア0.80を記録したナレッジベース検索が示されている。Synthflowより引用

本文に入る前に、この開いたドロワーを見てほしい。この記事全体の中で最も有用なスクリーンショットだからだ。通話の最中に行われた実際のナレッジベース検索が示されている。発信者は「持っているのですが、製品の使い方が知りたいのですが」のようなことを言い、エージェントはそれを検索クエリに書き換え、similarity_thresholdが0の設定に対して、756ミリ秒で最高類似度スコア0.80の7件の結果が返ってきた。このしきい値こそ、エージェントが弱い一致からでも答えるか、それとも「わかりません」と認めるかを決めるつまみだ。これを見せてくれるベンダーはほとんどない。

誰もが今でもSynthflowを、手軽なノーコードの入門ツールとして説明する。しかし今月時点で、それはもう時代遅れだ。セルフサーブのプラン体系は廃止されており、ドキュメントもそれを裏付けている。以前のPro、Growth、Agencyプランは「新規契約では利用できなくなり、既存顧客向けにのみサポートを継続する」とのことだ。残っているのは、単一プラン・営業主導のエンタープライズ製品だけだ。

実際にできること

人間への転送は、ここでの最も強力なサポート機能で、コールド、メッセージ付きウォーム、要約付きウォームの3つのモードがある。30秒〜30分のタイムアウトによる人間検知、コールスクリーニング、営業時間スケジュールもある。ドキュメントも率直で、私が評価するのは「コールドトランスファーは失敗からのリカバリーができない」とはっきり書いている点だ。

ナレッジソースはPDF、テキストドキュメント、単一URL、公開ウェブサイトのクロール、Zendeskヘルプセンターのインポートだ。認証付きソースも、過去チケットの取り込みも、手動でのドキュメント優先順位付けもない。連携面では「200以上」という謳い文句は、実際には文書化されている約15の連携に落ち着き、その中でサポートスタックに深く食い込んでいるのはFreshworksだけだ。Freshcallerの中で動く音声AIで、定型的な音声リクエストの65%を自動化している。これこそが、このツールを買う理由になる。

課金の計測方法は、レートそのものよりもはるかに詳細に公開されている。奇妙な組み合わせだが役に立つ。課金は秒単位で通話をまたいで集計されるため、125秒の通話は4分ではなく2課金分になる。転送が成功すると課金メーターは止まる。no-answerやボイスメールへの切断は一律5秒課金される。チャットはAIメッセージ5通で音声1分に換算される。そしてTest Centerのシミュレーションも課金対象になりうる。

料金

プラン月額含まれる分数超過料金同時通話数
Enterprise(唯一販売されているプラン)定価なし。契約は年間$30,000から、月額約$2,500相当非公開、契約ごとに規定カスタム、契約に基づく「Synthflowとの合意による」
Pro / Growth / Agency(旧プラン)新規受付終了プロダクト内のみで確認可能プロダクト内のみで確認可能アカウント契約条件に表示
無料トライアルセルフサーブでの申込不可。両方のCTAとも営業への問い合わせ該当なし該当なし該当なし

含まれる分あたりの実質コストは、どのプランでも算出不可能だ。Synthflowが価格と分数の割り当てを同じ表の中で公開することがないからだ。唯一根拠のある公開数字は、月額$2,500相当という下限であり、それに対応する割り当て分数は契約者以外誰も知らない。今も出回っている分単位の数字はすべて、廃止されたプラン体系に由来する。

良い点

  • 3つの明確な転送モード。要約付きウォームが、実際に人間の助けになるモードだ。
  • 秒単位で通話をまたいで集計される課金は、この記事の中で最も公平な計測方法だ。
  • 転送が成功すると課金メーターが止まる。
  • Freshworksとの深い連携があり、定型的な音声リクエストの自動化率65%という数字が公開されている。

課題

  • 年間$30,000という下限のため、月間およそ20,000分未満のどの利用量でも、この記事の中で最も高額な選択肢になる。
  • 現在ではどのプランでも同時接続数は公開されていない。
  • 自社サイト内でHIPAAに関する矛盾がある。ホームページはSOC 2、HIPAA、PCI DSS、GDPRの認証を謳っているが、Enterpriseドキュメントのコンプライアンス欄にはSOC 2、GDPR、ISO 27001しか記載されていない。BAAがあると決めつけないこと。
  • レイテンシーは測定値ではなく目標値であり、「100ms未満のラウンドトリップを目指す」という表現にとどまる。リセール提供は2026年9月15日に終了し、EUのテレフォニーサーバーは「近日中」とされている。

私の見解: ノーコードという評判は、もはや料金表と一致していない。今なおこれを安価な入門オプションと呼ぶまとめ記事は、私たち自身の過去の記事も含めて無視していい。Freshworksを使っているなら、強力でネイティブな適合だ。そうでないなら、その下限を支払う主な理由はFreshcaller連携になり、一般的なカスタマーサービス自動化ツールの方がはるかに安く済む。

9. Grok Voice Agent Builder

得意分野: セッション上限さえ問題にならなければ、最速かつ本格的に高性能なモデル向け。

xAIのGrok Voice Agent Builderは、τ-Voice表で56.5%を記録して首位に立ち、0.70秒で応答するGrok Voice Think Fast 2.0上で動作する。この組み合わせこそが、このツールの売り文句のすべてだ。ベンチマーク上では、その主張に見合った実力がある。

このセクションにプロダクトのスクリーンショットがないのは、xAIが一切公開していないからで、Voice Agent Builderのドキュメントのリンクも現在404になっている。xAIが公開しているのは、まさに今日発効する料金変更だ。すでに本番環境でGrok Voiceを運用しているなら、これはこのページの中で最も重要な情報だ。

2026年8月5日、grok-voice-latestエイリアスが1分5セントのバージョン1.0から1分8セントのバージョン2.0へと再割り当てされ、デプロイ不要のまま60%の値上げが発生することを示す前後比較図
2026年8月5日、grok-voice-latestエイリアスが1分5セントのバージョン1.0から1分8セントのバージョン2.0へと再割り当てされ、デプロイ不要のまま60%の値上げが発生することを示す前後比較図

実際にできること

wss://api.x.ai/v1/realtimeでOpenAI Realtime APIとワイヤー互換性があるため、既存のリアルタイム構築の移行はほぼURLの変更だけで済む。ツールは関数呼び出し、ファイル検索、ウェブ検索、X検索、MCPをカバーする。コンプライアンス向けの拡張機能が特に有用で、force_messageは開示事項を一字一句そのまま読み上げ、replaceはトランスクリプトを変えずに発音をマッピングし、keytermsは1件あたり最大50文字の用語を最大100件まで受け付け、resumptionは再接続時にターンを再生する。番号のプロビジョニングは1分あたり$0.01追加になる。

精度面で触れておく価値があるのは、単語誤り率がバージョン1.0より1.4倍良く、24言語にわたってDeepgram Nova 3やElevenLabs Scribe v2より1.5〜2.0倍良く、ノイズの多いテレフォニー音声ではおよそ10倍良いという点だ。背景ノイズとアクセントは、運用者がまさにエージェントを壊す原因として報告しているものであり、この数字は見出しのベンチマークよりもあなたにとって関連性が高い。

料金

項目レート
Grok Voice Think Fast 2.0$0.08/分($4.80/時)
Grok Voice Think Fast 1.0$0.05/分($3.00/時)
テキスト入力会話アイテム1件あたり$0.004
番号のプロビジョニング+$0.01/分
web_search / x_search1,000回呼び出しあたり$5
file_search(コレクション)1,000回あたり$2.50
attachment_search1,000回あたり$10

今日がまさに値上げの日だ。2026年8月5日、grok-voice-latestエイリアスが1.0から2.0へ再割り当てされ、デフォルトの経路は分あたり60%高くなる、しかもこちら側でのデプロイは不要だ。旧バージョンを固定することがオプトアウトの手段になる。この切り替えによって、GrokがElevenLabsより37.5%安かったという優位性も消えた。$0.08はElevenLabsの含まれる分あたりの実質レートとちょうど一致するからだ。残るのは価格ではなく課金形態の違いだ。Grokは従量課金、ElevenLabsの分数はプリペイドなので、通話量に波がある場合や低ボリュームの場合は依然としてGrokに分がある。

良い点

  • サポートタスク完了率でτ-Voice表の首位、56.5%。
  • 最初の音声応答までの時間は0.70秒で3位の速さであり、速度と性能のバランスとしては現状最良の組み合わせ。
  • 課金は分単位のフラットレートなので、入力音声1時間あたりの実測コストは定価とぴったり一致する。
  • テレフォニー音声の書き起こしが強力で、ノイズの多い環境ではおよそ10倍良い。

課題

  • デフォルトではチームあたり10同時セッションまで。サポート回線にとってはこれが厳格な上限であり、引き上げるにはリクエストが必要になる。
  • 音声にはバッチ割引も優先プランもなく、割引も有料の優先レーンもない。us-east-1限定で、セッションの最大時間は120分。
  • ヘルプデスク連携なし。音声プロダクトのセキュリティ認証も公開されていない。
  • エージェントが検索を行うとストレージが別途課金され、コレクションは1日1GiBあたり$0.10。

私の見解: ここに挙げた中で最も高性能なモデルだが、最もサポート向けらしくないプロダクトに包まれている。決め手になるのは10同時セッションという数字だ。ピーク時にそれを超え、誰も上限を引き上げていないなら、ベンチマークがどれだけ良く見えても、これは本番のサポート回線ではなくプロトタイプだ。モデルについてはGrok Voice Think Fast 2で詳しく解説し、新しい料金はその料金内訳でまとめている。

通話の残り半分は、実際どこへ行くのか

上記のどのツールも、必ず人間への引き継ぎが発生する。欠陥ではなく、ただの算数だ。最高のモデルでもベンチマークでサポートシナリオの56.5%しか解決できず、運用者は本番環境で15〜30%と報告している。一方、ヘルプデスク全体での平均的な純一次解決率はおよそ74.3%で、95%を超えるデスクはわずか1.4%しかない。何かは必ず人間に届く。だからこそ、初回問い合わせ解決率の方が封じ込め率よりも良い目標になる。

着信通話が音声エージェントに届き、通話内で解決される経路と、転送またはメールに分岐する経路に分かれ、後者がヘルプデスクのチケットになる流れを示す図
着信通話が音声エージェントに届き、通話内で解決される経路と、転送またはメールに分岐する経路に分かれ、後者がヘルプデスクのチケットになる流れを示す図

私が最もよく耳にする失敗パターンは、ボットの会話そのものとは関係がない。それは継ぎ目で起きる。

Reddit

"誰も答えたがらないAHT(平均処理時間)の質問だよ(笑)。請求・追跡ボットをリリースして、封じ込め率はまずまずだったけど、エスカレーションされた通話のAHTは上がった。エージェントはトランスクリプトを読んで、ボットが何を試したのかを把握し、結局その半分をもう一度聞き直す羽目になった。生のトランスクリプトをそのまま渡すのではなく、構造化された引き継ぎ要約を強制することで解決した(自動化そのものより時間を節約できた)。デフレクションできたものについてはCSATも問題なかったけど、失敗したボットの試みの後に戻ってきたものについては急落した。"

最後の一節はもう一度読む価値がある。封じ込め率は良好に見えたのに、エスカレーションされた通話の処理時間は上がり、満足度は戻ってきたケースに限って崩れた。つまり音声導入は、ダッシュボード上では勝っていても、最もあなたを必要としていた顧客に対しては負けていることがありうる。これが、AIが最初に対応したかどうかでセグメント分けしたCSATを追跡すべき理由だ。

同じ論点をもっと率直に表現したのが、自分のセンターが実際どれだけ自動化されているかと聞かれたコンタクトセンター運用者の言葉だ。

Reddit

"だいたい15%くらい……それより高い数字を言ってる人は嘘をついてるか、『完全対応』の意味をわかってない。今のところAIソリューションは成熟していないか、断片化しすぎていて、それ以上にはならない。"

同じスレッドの他の返信では、ジャーニー設計によって10〜30%という帯域が示されていた。つまり15%は、ひとりの皮肉屋の意見ではなく、実際のレンジの悲観的な端だということだ。いずれにせよ、95%には遠く及ばない。

そして、封じ込め率のダッシュボードにはまったく見えないコストがある。エージェントが自信満々に間違ったことを声に出して言ったとき、何が起きるかだ。

Hacker News

"もしそれが音声版ChatGPTと話すようなものだったら、絶対に気づかれるだろう。そして今のような失敗パターンが少しでもあるなら、投稿者の兄弟は、人間の受付係や外注の受付係を使った場合と比べて得られるはずのコスト削減の多くを、『AIが今日中に車は絶対直ると言った』ようなトラブル対応で食いつぶすことになるだろう。"

これが、電話回線におけるAIハルシネーションの正しい捉え方だ。テキストでは、間違った回答は訂正できるメッセージにすぎない。声に出して言われた場合、それは顧客が聞いた「約束」になり、その後始末は、あなたが別途コストを払う新たな問い合わせになる。

私なら実際にどうするか

この順番で3つのことをする。どれも「最も高い封じ込め率の数字を買う」ではない。

まず、そもそも通話が必要なかった件数を減らす。 注文状況、パスワードリセット、営業時間。これはTier-1デフレクションの仕事であり、同じモデルでもテキストの方がやり取りあたりのコストは安く、精度も高い。ただし、発信者がすでにヘルプセンターで解決できなかった場合は、ヘルプセンターの改善が先だ。それは音声の問題ではなく、セルフサービスの問題になる。

次に、音声のチューニングよりも先に継ぎ目を直す。 上の引用にあったように、構造化された引き継ぎ要約は、節約時間の観点で自動化そのものを上回った。これは私たちがチャットのエスカレーションに適用しているのと同じ原則だ。引き継ぎを受ける人間に必要なのはトランスクリプトではなく、要約と確信度のシグナルだ。

最後に、転送された通話はチケットになると想定しておく。 実際、たいていそうなるからだ。発信者は電話を切ってメールを送るか、エージェントが後でメモを書く。ここで印象に残っているのは、私たち自身の顧客との会話から得た、電話とメールの混合キューを運用しているあるチームのディテールだ。彼らの通話に関する情報は、まったくAIに届いていなかった。音声の録音がシステムに一切入らず、すべての通話をエージェントが手動で要約していたからだ。

"電話については、後でチケットに簡単な要約を書くだけなので、AIはそれをほとんど目にすることがないんです。"

Zendeskで電話とメールの混合キューを運用する、月間およそ3,000件のチケットを扱う中規模B2B SaaS企業のサポートリード

これは誰も値段をつけないギャップだ。電話対応のために音声エージェントを買っても、それが対応できない半分はテキストの作業に姿を変え、しかもそれは音声エージェントがまったく見ることのできないシステムの中で起きる。

音声エージェントが引き継ぐ残り半分に、eeselを

率直に言おう。eeselは音声を扱わない。eeselには電話プロダクトが存在しない。鳴っている回線に応答するものが必要なら、上記の9つのうちどれかを買ってほしい。

eeselがやるのは、その後にヘルプデスクへ届く残り半分であり、出発点自体がここに挙げたどの音声ツールとも異なる。先ほどの比較表を見返してほしい。9社中8社がウェブサイトのクロールとアップロードされたファイルで学習する中、自社の会話履歴を再生できるのはちょうど1社だけだった。eeselのAIヘルプデスクエージェントは過去のチケットで学習し、実際に何かへ回答する前にそれに対してシミュレーションを行う。つまり見えているのは、誰かが考え出したシナリオではなく、自社の過去のボリュームに対する精度だ。Parloaがエンタープライズ価格で提供しているのと同じ規律を、テキストチャネルに適用している。

連携されたZendeskのチケット活動と解決状況を表示するeesel AIダッシュボード
連携されたZendeskのチケット活動と解決状況を表示するeesel AIダッシュボード

私たちがこの作り方を選んだのは、ある痛い経験があったからだ。私は自信満々に聞こえるボットが製品について事実無根の主張を作り出し、実際の顧客に送ってしまうのを目にしたことがある。だからこそ、ここでは過去のチケットに対するドライランを経ずに何かが本番稼働することはない。私たちを評価していたあるサポートリードが、すべてに答えるエージェントではなく「自信を持って対応できるチケットだけを扱う」エージェントが欲しいと要件を表現したのも、同じ理由からだ。

約束ではなく実績を挙げると、Gridwiseは導入初月でTier-1リクエストの73%を解決した。コストについては、私たちが固定料金から従量課金に移行した際、同僚のRiellがはっきりとこう言った。以前なら月額$799の固定料金を払っていたはずのチームが、今では利用量ベースでおよそ$200しか払っていない、と。

音声ツールを検討しているなら、正直な順序はこうなる。まずテキストで反復的な件数を減らす。残った分に対して音声エージェントを買う。そして、それが生み出すチケットが、あなたの履歴をすでに知っている場所に確実に届くようにする。

セットアップは、エンタープライズ系の音声ベンダーが提示する2〜8週間ではなく、数分で終わる。また、Zendesk、Freshdesk、Gorgias、Frontを含め、このページのどの音声プラットフォームよりも多くのヘルプデスクに対応している。eeselを試すことは無料でできる。

よくある質問

2026年、音声カスタマーサポートに最適なAIは何ですか?
唯一の勝者は存在しない。このカテゴリは購入方法によって性格が分かれるからだ。ElevenLabs Agentsは、セント単位まで予測できる唯一の分課金レートを持つ。Retell AIは、構築チームなしでウォームトランスファーとスーパーバイザーによる引き継ぎをサポート運用に提供する。PolyAIは、すでにGenesysやAvayaを運用しているコンタクトセンターに向いている。どれを選んでも、完了できなかった通話への備えが必要だ。それらはヘルプデスクにチケットとして届き、AIヘルプデスクエージェントが引き継ぐことになる。
音声カスタマーサポートAIの分あたりのコストはどれくらいですか?
正直な総額レンジは1分あたり0.08〜0.20ドルで、多くのホームページに書かれている0.05ドルではない。ElevenLabsはすべての有料プランで含まれる分あたりちょうど0.08ドル、Vapiはテレフォニーと音声サービスを加えると1分あたり約0.105ドル、Retellは実際のサポート構成で約0.135ドルになる。2人の運用者がそれぞれ独立に、実際のコストが広告されているヘッドライン価格の2〜4倍になると報告している。AIエージェントと人間のエージェントのコスト比較では、これが人的な座席とどう比較されるかを解説している。
AIは実際に自力でカスタマーサポートの通話を解決できますか?
部分的には可能だ。カスタマーサービスの再現シナリオを採点するτ-Voiceベンチマークでは、最高のスピーチ・トゥ・スピーチモデルでも56.5%しか解決できず、コンタクトセンターの運用者は実際の完全自動化率を15〜30%と見積もっている。つまりAIはサポートの電話に応答できるが、その約半分は依然として人間に届くことを見込んでおくべきであり、エスカレーション経路を整えておく必要がある。
カスタマーサポートには音声AIとチャットAI、どちらが優れていますか?
同じモデルであれば精度はテキストの方が勝る。Sierra自身の調査によれば、同じタスクをテキストから現実的な電話音声に移すと、すべてのプロバイダーが5〜14ポイント低下する。それでも発信者に他の選択肢がない場合は音声にも価値があるが、電話が鳴る前にAIチケットデフレクションで反復的な件数を減らし、セルフサービスを改善する方が、通常はより安価な最初の一手になる。
音声カスタマーサポート向けのAIを選ぶ際、何を確認すべきですか?
この順番で4つ確認すべきだ。人間への引き継ぎがきれいに行えるか、どのナレッジソースを受け付けるか、稼働前に自社の通話履歴に対してテストできるか、そしてテレフォニーを含めた実際の分あたりコスト。見出しのレイテンシーよりバージイン(割り込み)処理の方が重要だ。私たちはテキストにも同じ基準を適用しており、だからこそ私たちのAIヘルプデスクエージェントは過去のチケットに対してシミュレーションを行い、AIハルシネーションを注釈事項ではなく展開リスクとして扱っている。

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
NLPは教師ありか教師なしのどちらですか?サポートチームのための実践ガイド
Guides

NLPは教師ありか教師なしのどちらですか?サポートチームのための実践ガイド

サポートAIは、教師ありNLPと教師なしNLPのどちらかを選ぶわけではありません。最適なツールは両方を組み合わせて、チケットをより迅速に解決し、新たな洞察を発見します。

Kenneth PanganKenneth PanganSep 8, 2025
2025年に学ぶべき、忘れられない悪いカスタマーサービスの事例8選
Guides

教訓となるカスタマーサービス失敗談8選 (2026)

無視された苦情から機械的な返信に至るまで、劣悪なカスタマーサービスの体験談は、共感をおろそかにすると顧客ロイヤルティや信頼がどのように損なわれるかを明らかにしている。

Stevia PutriStevia PutriSep 8, 2025
AIは未来を予測できるか?今日可能なことの現実的な見方
Guides

AIは未来を予測できるか?今日可能なことの現実的な見方

AIは水晶玉のように未来を見ることはできませんが、予測AIはすでにビジネスがトレンドを予測し、リスクを見つけ、より賢く計画するのを助けています。

Kenneth PanganKenneth PanganSep 8, 2025
Ecwidの価格2025:プランと隠れたコストの完全ガイド
Guides

Ecwidの価格2025:プランと隠れたコストの完全ガイド

Ecwidはあなたのストアに適していますか?2025年のEcwid価格ガイドでは、無料プランから無制限プランまで、すべてのプランを詳しく解説します。主要な機能、制限、取引手数料やアプリの費用などの隠れたコストを発見し、より賢明な決定を下せるようにしましょう。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 15, 2025
AIにおけるインテリジェントエージェントとは何か?実践ガイド
Guides

AIにおけるインテリジェントエージェントとは何か?実践ガイド

チケットのトリアージから完全な自動化まで、インテリジェントなAIエージェントがサポートを変革しています。彼らがどのように機能するのか、異なるタイプ、そして迅速に始める方法を学びましょう。

Kenneth PanganKenneth PanganSep 15, 2025
カスタムAIモデルとは何か、そして本当にそれを構築する必要があるのか?
Guides

カスタムAIモデルとは何か、そして本当にそれを構築する必要があるのか?

カスタムAIモデルの構築は理想的に聞こえますが、博士号レベルのチーム、数ヶ月の作業、大規模なコストが必要です。スマートプラットフォームは、そのような手間をかけずにカスタム結果を提供します。

Kenneth PanganKenneth PanganSep 10, 2025
ホワイトラベルAI:2025年の完全ガイド
Guides

White label AI 2026:プラットフォーム、料金、セットアップ

ホワイトラベルのAIは魅力的に聞こえますが、ほとんどのプラットフォームが単に一般的なツールにロゴを貼り付けるだけだと気づくと、その魅力は薄れます。本当の価値は、浅いリブランディングではなく、深い統合から生まれます。

Kenneth PanganKenneth PanganSep 10, 2025
AI拡張とは何ですか? チームを強化するための実践ガイド
Guides

AI拡張とは何ですか? チームを強化するための実践ガイド

AIの拡張は、人間の専門知識とAIの効率を組み合わせます。作業負荷を軽減し、サポートを迅速化し、士気を向上させる方法を発見してください。

Kenneth PanganKenneth PanganSep 8, 2025
企業向けAIの実践ガイド:2025年におけるアーキテクチャ、セキュリティ、ユースケース
Guides

企業向けAIの実践ガイド:2025年におけるアーキテクチャ、セキュリティ、ユースケース

エンタープライズアーキテクチャに適したAIを選ぶには、全面的な再構築は必要なく、賢明な統合、明確なユースケース、そしてセキュリティへの注力が求められます。

Stevia PutriStevia PutriAug 18, 2025

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める