
En bref
Mon travail chez eesel, ce sont les intégrations et les API. Ce qui veut dire qu'une bonne partie de ma semaine se passe sur les grilles tarifaires et la documentation d'autres entreprises, et la semaine dernière, cela a signifié neuf fournisseurs vocaux les uns après les autres. Un chiffre m'est resté en tête : le meilleur modèle voix-à-voix au monde résout 56,5% des scénarios de service client reproduits sur le benchmark τ-Voice. Les pages des fournisseurs annoncent de 70% à 95% de rétention d'appels. Les opérateurs de centres de contact qui font tourner du trafic réel la situent entre 15% et 30%.
Je ne lis pas cet écart comme une critique de l'IA vocale. C'est la question d'achat elle-même. Sierra publie ses propres recherches τ-voice montrant que chaque fournisseur perd 5 à 14 points lorsque la même tâche passe du texte à un audio téléphonique réaliste, avec en plus un constat selon lequel 79% des premières erreurs critiques sont dues à l'agent lui-même. Même modèle, mesurablement moins bon au téléphone que sur un ticket.
Donc, en pratique. ElevenLabs Agents est ici le seul dont vous pouvez prévoir le coût par minute au centime près. Vous voulez un transfert à chaud et une prise de contrôle par un superviseur sans équipe de développement ? C'est Retell AI. Et PolyAI est le choix pour les centres de contact déjà installés sur Genesys ou Avaya.
Quoi que vous achetiez, environ la moitié de ces appels finissent malgré tout en e-mails et en tickets. Un agent de helpdesk IA comme eesel prend en charge cette moitié peu glorieuse, et il apprend des tickets que vous avez déjà résolus plutôt que de votre centre d'aide.
Pourquoi la voix revient, et pourquoi cela compte maintenant
Pendant près d'une décennie, le conseil raisonnable était que le support téléphonique était en train de mourir. Ce n'est pas le cas. La voix est repassée à 40% du volume des centres de contact et continue de croître. Le chat, lui, affiche un taux de retour de 32% vers la voix. Le téléphone est donc l'endroit où finissent les contacts difficiles plutôt que les faciles, ce qui est un problème différent de l'automatisation classique des centres d'appels. C'est aussi pourquoi l'ancienne génération de systèmes d'appels automatisés n'a jamais vraiment entamé ce phénomène.
Cet effet de sélection est tout le problème. Un commentateur de Hacker News l'a mieux exprimé qu'aucune présentation commerciale à laquelle j'ai assisté :
"I admire what you have done, but for a luxury experience, I do not want to talk to an AI that just tells me what is already on the website. If I have gotten to the point where I am calling you, its because I couldn't find an answer to my question on the website in the first place."
Tous ceux qui vous vendent un agent vocal l'entraînent sur votre centre d'aide. Et les personnes qui vous appellent sont, par définition, celles pour qui votre centre d'aide a déjà échoué. Gardez cela en tête, car cela explique la plupart des déploiements décevants dont j'entends parler.
Comment j'ai choisi ces outils, et le benchmark que personne ne cite
Le 5 août 2026, j'ai passé en revue la page tarifaire, la documentation et le centre d'aide de chaque fournisseur. Ensuite, j'ai calculé le coût réel tout compris par minute plutôt que le chiffre affiché, et vérifié ce que fait chacun au moment où l'agent ne peut pas terminer la tâche. Là où un fournisseur ne publie aucune grille tarifaire, je le dis plutôt que de deviner.
Cette liste est délibérément plus restreinte que mon panorama plus large des entreprises d'IA vocale. Elle adopte aussi un angle différent du comparatif meilleure IA pour le support téléphonique, qui trie par type de fournisseur. Ici, l'ordre est dicté par les mesures.
La mesure qui a changé ma façon de lire toute la catégorie est τ-Voice, et ce n'est pas un benchmark audio générique. Un appelant simulé contacte le modèle avec un vrai problème, un changement de vol ou une contestation de débit, parfois une panne télécom. Le score mesure si la base de données finit dans le bon état final. C'est-à-dire qu'il évalue exactement ce que vous achetez.

Le sommet de ce classement est glaçant :
| Modèle | τ-Voice (scénarios de support résolus) | Raisonnement vocal | Temps jusqu'au premier audio | Coût par heure d'audio en entrée |
|---|---|---|---|---|
| Grok Voice Think Fast 2.0 High | 56,5% | 97% | 0,70s | $4.80 |
| Qwen Audio 3.0 Realtime Plus | 54,6% | 99% | 4,02s | $4.42 |
| Grok Voice Think Fast 1.0 | 52,1% | 97% | 1,25s | $3.00 |
| GPT-Realtime-2.1 High | 45,7% | 96% | 1,21s | $10.75 |
| GPT-Realtime-2 High | 39,8% | 97% | 1,14s | $4.14 |
| Gemini 3.1 Flash High | 37,7% | 97% | 2,99s | $1.75 |
| Deepslate Opal | 17,5% | 85% | 0,44s | $6.48 |
| GPT Realtime Mini | 15,1% | 64% | 0,81s | $3.04 |
Lisez la deuxième et la troisième colonne ensemble. Le raisonnement vocal est globalement résolu, puisque six de ces huit modèles obtiennent 96% ou plus pour comprendre une question parlée. Puis ces mêmes modèles tombent d'une falaise au moment où ils doivent accomplir la tâche. Comprendre l'appelant n'est plus la partie difficile. Terminer le travail l'est.
Vous voulez voir à quoi cela ressemble dans un environnement de travail réel plutôt que dans un benchmark ? La propre documentation de Bland publie un écran d'analyse d'outils plus honnête que n'importe quelle page marketing :

408 exécutions d'outils, 142 erreurs, un taux d'erreur de 34,8%. Le principal coupable est une recherche de calendrier qui échoue 81 fois avec "start_time must be in the future". Rien de tout cela n'est un problème de parole. L'agent a parfaitement compris l'appelant, puis l'appel à l'outil a échoué, et c'est exactement là que le score τ-Voice se perd.
La latence a cessé d'être le goulot d'étranglement
La catégorie se vend encore sur les millisecondes. Je comprends pourquoi, car pendant des années, cela a vraiment été la barrière. Plus maintenant, et le classement le montre clairement.

Deepslate Opal répond le plus vite de tout le tableau, 0,44 seconde, et résout 17,5% des scénarios de support. Grok Voice Think Fast 2.0 prend un quart de seconde de plus et en résout 56,5%. Personne ne raccroche pour 260 millisecondes. Les gens raccrochent parce que l'agent n'a pas pu faire ce pour quoi ils appelaient.
Et ce que les opérateurs signalent comme problème réel n'est pas du tout la lenteur. C'est que l'agent parle par-dessus eux :
"It's brutal. We're losing ~40% of callers in the first 30 seconds. Current setup: Vapi with GPT-4 Turn-end detection at 800ms (their default) Network latency averaging 120-150ms Processing adds another 200-300ms What I've tried: Increased silence threshold to 1.2s → Bot feels sluggish, people think it's broken Decreased to 500ms → Interruption city, worse than before Added "please wait for customer to finish" to prompt → Literally no effect"
C'est de la gestion des interruptions (barge-in). Un problème de réglage plutôt que de modèle, et le poste de dépenses le plus sous-budgété d'un déploiement vocal, de loin. Un opérateur ayant construit sa propre infrastructure a chiffré la surtaxe à "200-400ms until you tune turn detection thresholds properly", puis a dit aux gens de se préparer à "plan for two months of 'why is my agent talking over the caller'" avant d'atteindre la qualité de production, dans ce fil sur le choix entre construire et acheter.
Le témoignage le plus complet que j'ai trouvé venait de quelqu'un avec 20 déploiements à son actif. Il couvre à la fois les interruptions, le transfert et le coût, tout en un seul message :
"deployed voice agents for about 20 small businesses now, mostly service companies like plumbers, dentists, med spas. here's what i've actually hit in production: biggest issue by far is barge-in handling. customer starts talking while the agent is still speaking and everything goes sideways. most platforms handle this okay in demos but in real calls with background noise, accents, or people who talk fast it breaks constantly. had to build custom silence detection thresholds per client. second is the handoff to human. when the ai can't handle something it needs to transfer cleanly. vapi and retell both struggle here depending on the telephony setup. the call drops, or there's a 3 second gap of silence that makes the caller hang up. we ended up building a warm transfer flow where the agent briefs the human before connecting. [...] cost wise the biggest surprise was how much it costs when calls go long. a 10 minute call can cost $1.50-2.00 when you add up stt + llm + tts + telephony. sounds small but if you're handling 200 calls a day for a client it adds up fast. we had to build hard cutoffs and summarization to keep calls under 4 minutes."
Trois éléments méritent d'être retenus ici. Un appel de dix minutes coûte 1,50 à 2,00 dollars tout compris, ce qui correspond aux calculs plus bas plutôt qu'à n'importe quelle page d'accueil. Les démos cachent les problèmes d'interruption, car les appelants de démo n'ont ni accent ni bruit de fond. Et la solution, tant pour le trou dans le transfert que pour le coût, a consisté à construire ce que la plateforme ne fournissait pas.
Les quatre choses sur lesquelles j'ai vraiment noté
- Transfert vers un humain. Pas s'il existe. Mais s'il est à chaud, s'il transmet un résumé plutôt qu'une transcription brute, et si tout cela repose sur un contrat entreprise. Une bonne gestion de l'escalade fait la différence entre un déroutement et un appelant contrarié.
- Sources de connaissances. Presque tous les outils ici ingèrent une exploration publique du site web plus des fichiers téléchargés. Presque aucun ne touche à vos tickets passés ou à un wiki authentifié. Cette distinction décide comment l'outil gère les appels que votre centre d'aide a déjà manqués.
- Tests avant le lancement. Une « simulation » qui exécute des scénarios que vous avez écrits vous-même est une garantie différente de celle qui rejoue votre propre historique d'appels. Exactement un fournisseur ici fait la seconde chose. Pour la prévention des hallucinations, cela compte plus que n'importe quel réglage de garde-fou.
- Coût réel par minute, téléphonie incluse. Jamais le chiffre de la page d'accueil. C'est aussi le chiffre qui décide de votre ROI de centre d'appels.
Les 9 meilleurs outils d'IA pour le support client vocal en 2026
| Outil | Idéal pour | Tarif réel tout compris | Unité de facturation | Transfert vers un humain | Sources de connaissances | Test contre vos propres appels | Concurrence | Sécurité | Intégrations helpdesk |
|---|---|---|---|---|---|---|---|---|---|
| ElevenLabs Agents | Un tarif prévisible | $0.08/min + opérateur | Par minute, prépayé | Oui, transfer_to_number | Fichiers, URL, RAG sur le palier gratuit | Non | 4 à 40 selon le palier | SOC 2, ISO 42001, PCI DSS L1, BAA sur Enterprise | Zendesk, Salesforce |
| Retell AI | Équipes de support sans équipe de développement | ~$0.135/min | Par minute, assemblée | À chaud, plus prise de contrôle par superviseur | Exploration de site web, upload de fichiers | Non | 20 gratuites, puis $8/ligne/mois | SOC 2 Type II, HIPAA, RGPD | HubSpot, Salesforce ; Zendesk « bientôt disponible » |
| Vapi | Contrôler soi-même la pile de modèles | ~$0.105/min | Par minute, assemblée | Oui, via le fournisseur de téléphonie | Upload de fichiers uniquement, récupération Gemini | Non | 10 gratuites, puis $10/ligne/mois | HIPAA $2 000/mois, ZDR $1 000/mois | Aucune préconstruite |
| PolyAI | Un parc CCaaS existant | Sur devis uniquement | Par minute | Oui | Docs et intégrations | Non | Non publié | SOC 2 Type 2, ISO 27001, PCI DSS, RGPD, HIPAA en standard | Zendesk Talk via CCaaS |
| Parloa | Tester contre son propre historique d'appels | Sur devis uniquement | À la consommation, selon la complexité de la tâche | Oui | Connecteurs entreprise | Oui, rejoue de vraies transcriptions | Non publié | ISO 27001, SOC 2 Type 1 et 2, PCI DSS | Zendesk, ServiceNow, Salesforce, Dynamics |
| Sierra | Ne payer que pour les résolutions | Sur devis uniquement | Par conversation résolue | Oui, en préservant le contexte | Connecteurs entreprise | Simulations vocales | Non publié | SOC 2, ISO 27001, ISO 42001, HIPAA, PCI DSS, FedRAMP | Non publié |
| Bland AI | Forte concurrence et auto-hébergement | $0.11 à $0.14/min | Par minute + frais de plateforme | Enterprise uniquement | Fichiers, texte, web public | Non | 10 à 100, Enterprise jusqu'à 1 M | SLA 99,9% sur tous les paliers, BAA sur Enterprise | Aucune |
| Synthflow | Un déploiement natif Freshworks | ~$2 500/mois plancher | Par seconde, agrégée | Froid, chaud, chaud avec résumé | PDF, URL, exploration, import Zendesk | Test Center, facturable | Fixée par contrat | SOC 2, RGPD, ISO 27001 | Freshworks (Freshcaller) |
| Grok Voice Agent Builder | Le modèle capable le plus rapide | $0.08/min + $0.01 numéro | Par minute, à l'usage | Via appels d'outils | Collections, recherche fichiers et web | Non | 10 sessions par équipe | Non publié pour la voix | Aucune |
Neuf outils et quatre façons différentes de facturer. Une seule vous laisse tester contre votre propre archive d'appels, et c'est la colonne que je capturerais en priorité.
Avant les fiches individuelles, quelques calculs. Les tarifs annoncés ne sont pas comparables entre eux, et l'écart est assez large pour changer votre présélection.
1. ElevenLabs Agents
Idéal pour : les équipes qui doivent prévoir la facture au centime près avant de s'engager.
ElevenLabs est surtout connu pour la synthèse vocale (text-to-speech). La plateforme Agents est la couche conversationnelle posée par-dessus, et elle a déjà déployé plus de 4 millions d'agents. La raison pour laquelle elle arrive en tête de cette liste est peu spectaculaire : c'est le seul fournisseur ici dont l'arithmétique tarifaire tient debout.

Ce tableau de bord vaut qu'on s'y arrête. C'est le seul endroit de ce comparatif où un fournisseur montre ses propres chiffres sans les retoucher : 75,1% de taux de succès global, 3,5 étoiles de CSAT moyen. Un déploiement d'apparence réaliste, en somme, et non une prétention à 95%.
Ce qu'il fait vraiment
La téléphonie via SIP est incluse dans tous les paliers plutôt que réservée, ce qui est inhabituel. Les bases de connaissances et le RAG fonctionnent même sur le palier gratuit. Appels d'outils, appels par lots, un serveur MCP hébergé pour la gestion des agents, une CLI : tout est là. Les intégrations nommées couvrent Genesys et Amazon Connect côté téléphonie. Pour le ticketing, ce sont Zendesk et Salesforce, les seuls deux systèmes de tickets avec de vraies pages.
Deux choses à savoir avant de construire. Ses propres pages se contredisent sur les langues, listant plus de 70 dans le catalogue vocal contre 31 sur lesquelles un agent peut réellement être configuré pour parler. Ensuite, il n'existe aucun chiffre de latence aller-retour publié pour un agent, seulement des chiffres par composant pour Flash v2.5, autour de 75 ms, et Scribe v2 Realtime, autour de 150 ms. Ni l'un ni l'autre n'équivaut à ce que votre appelant entend réellement.
Tarifs
| Palier | Mensuel | Minutes incluses | $/min effectif | Dépassement | Pic | Appels simultanés |
|---|---|---|---|---|---|---|
| Free | $0 | 15 | n/a | $0.08 | $0.16 | 4 |
| Starter | $6 | 75 | $0.0800 | $0.08 | $0.16 | 6 |
| Creator | $22 (premier mois $11) | 275 | $0.0800 | $0.08 | $0.16 | 10 |
| Pro | $99 | 1 238 | $0.0800 | $0.08 | $0.16 | 20 |
| Scale | $299 | 3 738 | $0.0800 | $0.08 | $0.16 | 30 |
| Business | $990 | 12 375 | $0.0800 | $0.08 | $0.16 | 40 |
| Enterprise | Personnalisé | Personnalisé | Négociable | Négociable | n/a | Renforcée |
Regardez cette colonne effective. Chaque palier payant se divise en exactement $0,08. Business coûte $990 pour 12 375 minutes, et 12 375 × $0,08 font exactement $990,00. Les allocations de minutes ont donc été calculées à rebours à partir du prix, ce qui signifie qu'il n'y a de remise sur volume à aucun palier. Les messages texte coûtent $0,003 chacun, et la téléphonie de l'opérateur est facturée « au coût » en plus.
Avantages
- Le seul coût par minute de ce comparatif que vous pouvez réellement prévoir.
- Le trunking SIP n'est pas réservé à Enterprise, donc votre propre opérateur fonctionne déjà sur un palier à $6.
- Une liste de conformité sérieuse : ISO 42001, AIUC-1, PCI DSS Niveau 1.
- Les bases de connaissances et le RAG fonctionnent sur le palier gratuit, donc tester correctement ne coûte rien.
Inconvénients
- Jamais de remise sur volume. À 50 000 minutes, vous payez le même tarif qu'à 75.
- Les minutes sont prépayées plutôt qu'à l'usage, donc un volume irrégulier signifie payer pour une marge inutilisée.
- Le BAA pour HIPAA se trouve derrière Enterprise, ainsi que le SSO et les conditions de SLA.
- Des opérateurs signalent que l'outil
transfer_to_numberéchoue à finaliser le transfert, longuement discuté dans ce fil r/ElevenLabs.
Notre avis : commencez ici si votre volume est prévisible et que vous voulez un chiffre que votre équipe finance acceptera. Mais le tarif fixe joue dans les deux sens. Vous dépassez les 20 000 minutes par mois ? Obtenez un devis Enterprise avant de vous engager, car il n'y a ici aucune courbe de remise dans laquelle grandir. Je détaille davantage les paliers dans mon guide sur les tarifs ElevenLabs, et je couvre les options de changement dans alternatives à ElevenLabs.
2. Retell AI
Idéal pour : les opérations de support qui veulent de l'analytique d'appels et une escalade propre, sans embaucher de développeur.
Retell AI est celui que je placerais devant un responsable de support plutôt qu'un développeur. Sa transparence tarifaire atteint un degré presque inconfortable. C'est aussi le seul fournisseur ici dont la propre FAQ répond à « l'IA peut-elle remplacer les agents de centre d'appels ? » par un « Non » catégorique. Cela me vaut plus de respect que n'importe quelle affirmation de rétention sur cette page.

Notez le troisième panneau. Le message d'accueil est réglé sur « User Initiates: AI remains silent until users speak first ». Petit réglage, grand effet sur la sensation des trois premières secondes d'un appel de support.
Ce qu'il fait vraiment
La couche d'escalade est le point fort. Transfert à chaud, navigation IVR et capture DTMF sont toutes regroupées sous un seul nœud de transfert d'appel, tandis que le suivi en direct permet à un superviseur d'écouter ou de reprendre entièrement l'appel. Mieux encore : les frais d'IA s'arrêtent au moment du transfert, seule la téléphonie continue ensuite. La bonne incitation, et presque personne d'autre ne fonctionne ainsi.
L'analyse post-appel, les transcriptions, les webhooks et l'API sont tous disponibles sur le palier gratuit à l'usage, donc vous pouvez vraiment le tester. Un client de référence, Medical Data Systems, publie un taux de transfert de 30%. Donc environ 70% de rétention sur un déploiement réel.
La base de connaissances est une exploration du site web plus un upload de fichiers. Aucune ingestion documentée de votre historique de tickets passé, et la simulation exécute des cas de test que vous avez écrits vous-même plutôt qu'une relecture de votre propre archive d'appels.
Tarifs
| Composant | Tarif | Notes |
|---|---|---|
| Infrastructure vocale Retell | $0.055/min | Incontournable. La reconnaissance vocale est absorbée ici. |
| Synthèse vocale | $0.015/min | $0,040/min si vous choisissez des voix ElevenLabs |
| LLM | $0.003 à $0.32/min | GPT 5 nano au plancher, GPT 5.5 Fast au plafond |
| Téléphonie | $0.015/min gérée | $0 sur votre propre trunk SIP |
| Base de connaissances | +$0.005/min | Plus $8/mois par base après les 10 premières |
| Garde-fous | +$0.005/min | La suppression des données personnelles est un +$0,01/min séparé |
| Contrôle qualité des appels par IA | $0.10/min | Les 100 premières minutes gratuites |
| Concurrence | $8/appel/mois | Les 20 premières lignes incluses |
La fourchette affichée va de $0,07 à $0,31 la minute, avec $10 de crédit gratuit et sans frais de plateforme. Le calculateur propre de Retell fixe par défaut $0,115/min, mais met à zéro la téléphonie et chaque option. Construisez quelque chose de réaliste pour du support entrant, GPT 4.1 avec la voix propre de Retell, un numéro géré aux États-Unis, la base de connaissances activée, et vous atteignez $0,135/min. Cela fait $677 par mois pour 5 000 minutes. Activez le contrôle qualité des appels par IA sur tout votre trafic et ajoutez environ $490 par mois, un saut de 74%.
Avantages
- La meilleure histoire de transfert vers un humain de ce comparatif, et le compteur s'arrête au moment du déclenchement.
- Les superviseurs peuvent écouter un appel en direct, ou le reprendre entièrement.
- Une transparence tarifaire jusqu'au tarif de chaque composant.
- SOC 2 Type II, HIPAA et RGPD s'appliquent sur toute la plateforme plutôt que restreints par palier.
Inconvénients
- Zendesk est marqué « bientôt disponible » plutôt que livré. Les connecteurs actifs s'arrêtent à Cal.com, HubSpot et Salesforce, et nulle part dans la documentation on ne trouve d'intégration Freshdesk, Gorgias, Front ou Help Scout.
- L'affirmation de latence d'environ 600 ms est attribuée à des « benchmarks indépendants », qui ne sont jamais nommés ni liés.
- Aucune des deux pages ne publie un nombre de langues ni un pourcentage de SLA de disponibilité.
- L'option voix-à-voix coûte $0,345/min, ce qui dépasse le plafond propre de Retell annoncé à $0,31.
Notre avis : le choix global le plus solide pour une équipe de support, avec une grande réserve. Si vous utilisez Zendesk ou Freshdesk, prévoyez de construire vous-même la remontée de tickets via des webhooks. Regardez à qui Retell donne la vedette dans sa propre présentation d'intégrations : des plateformes CCaaS, Genesys et Five9 et Avaya. Cela indique pour qui c'a été conçu. Mon analyse des tarifs Retell AI détaille composant par composant si vous voulez modéliser votre propre configuration.
3. Vapi
Idéal pour : les équipes d'ingénierie qui veulent choisir elles-mêmes chaque composant de la pile.
Vapi est de l'infrastructure, pas un produit fini. Vous assemblez vous-même le transport et la reconnaissance vocale, le modèle, la voix, tout, et Vapi facture $0,05 la minute pour orchestrer le résultat. Si échanger Deepgram contre Assembly à 3 heures du matin vous tente, c'est le bon choix.

Cette rangée de puces de fournisseurs est tout le produit en une seule capture. Chaque puce est aussi une ligne à part sur votre facture.
Ce qu'il fait vraiment
Squads et workflows, appels d'outils, observabilité, une vraie suite d'évaluation. Apporter son propre SIP sur le trunk propre de Vapi ne coûte rien, ce qui est un vrai levier de coût. Dix appels simultanés sont inclus, et les lignes supplémentaires coûtent $10 par mois chacune.
Une échéance ferme à connaître : le constructeur visuel de Workflows s'arrête le 19 août 2026, dans deux semaines. La raison donnée par Vapi est que l'IA actuelle ne peut pas agir de façon fiable comme des agents autonomes en graphe de nœuds, et que les Squads « consistently led to better results ». Donc toute construction de support Vapi datant d'avant mi-2026 doit être migrée maintenant. Vapi prévient aussi que sa migration assistée par IA n'est pas garantie correcte ou complète.
Tarifs
| Composant | Tarif | Notes |
|---|---|---|
| Orchestration Vapi | $0.05/min | Plus $0,005 par message SMS-chat |
| Transport | Gratuit à $0.014/min | Vapi SIP et WebRTC gratuits ; Twilio sortant $0,014 |
| Reconnaissance vocale | $0.000631 à $0.01733/min | Google au plancher, Speechmatics au plafond |
| Synthèse vocale | $0.002 à $0.24/min | Inworld au plancher, Tavus au plafond |
| LLM | $0.01 à $2.12 par 1M | 4.1-mini au plancher, 4.5 Preview au plafond |
| HIPAA | $2 000/mois | La rétention zéro de données est un $1 000/mois séparé |
Assemblez quelque chose de réaliste, Vapi plus Twilio entrant plus Deepgram plus ElevenLabs plus un modèle bon marché, et vous arrivez à environ $0,105/min. Cela fait $0,63 pour un appel de six minutes. À noter aussi : les frais propres de Vapi représentent 48% d'une minute réaliste et 91% de la moins chère possible. Les conditions Enterprise démarrent à 400 000 minutes par an.
Avantages
- Contrôle total sur chaque composant, et une grille tarifaire publiée pour chacun.
- Le transport est gratuit sur Vapi SIP ou WebRTC.
- Le plancher le moins cher de ce comparatif, environ $0,055/min, si vous optimisez fortement pour cela.
- Des outils d'observabilité et d'évaluation qui sont vraiment bons.
Inconvénients
- Les tests sont facturés aux tarifs de production. Directement issu de la propre FAQ de Vapi : « Is testing free? No, test calls cost you the same as regular calls. »
- La base de connaissances se limite à l'upload de fichiers, la récupération passe uniquement par Gemini, il n'y a pas d'exploration du centre d'aide, et la limite recommandée est inférieure à 300 Ko par fichier.
- Zéro intégration de ticketing dans le catalogue d'outils. Lire ou écrire un ticket est un
apiRequestque vous construisez vous-même. - Selon la propre page de méthodologie de Vapi, l'accroche « moins de 500 ms de latence » exclut l'endpointing et le transport, et cette même page admet que l'endpointing peut représenter une part importante du délai.
Notre avis : le bon choix si vous avez des ingénieurs et voulez le plancher de coût. Le mauvais choix si vous voulez quelque chose qui répond aux appels la semaine prochaine. Dans tous les cas, faites la migration des Workflows avant l'échéance d'août. Il y a plus sur la forme de la plateforme dans mon analyse de Vapi.
4. PolyAI
Idéal pour : un centre de contact établi qui exploite déjà Genesys, Avaya ou Amazon Connect.
PolyAI vend à des centres de contact, pas à des développeurs, et la liste d'intégrations le trahit. Genesys, Avaya, Amazon Connect, Twilio, Five9, NICE, Talkdesk, Cisco, RingCentral, Zendesk Talk : tout est pris en charge. Il s'insère donc dans un parc que vous possédez déjà plutôt que de vous demander de le remplacer.

La liste de modèles en dit long sur le public visé. « Handle call transfers to a human agent » apparaît comme modèle de départ plutôt que comme sujet avancé. Le bon instinct.
Ce qu'il fait vraiment
Agent Studio est la surface de construction, avec un point d'entrée en libre-service sur studio.poly.ai. Les délais de déploiement publiés sur l'ensemble du site vont de moins de dix minutes en libre-service à environ huit semaines pour un déploiement Amazon Connect, donc prenez le chiffre rapide avec précaution. La prise en charge des langues est de 42 ou 45, selon la page PolyAI que vous lisez.
La posture de sécurité est la mieux documentée ici, et de façon inhabituelle, elle n'est pas restreinte par palier. SOC 2 Type 2, ISO 27001, PCI DSS, RGPD et HIPAA sont tous décrits comme standard et « intégrés à l'architecture », avec une certification AWS FTR également sur la page partenaire Amazon Connect. Chaque déploiement payant inclut aussi un SLA de disponibilité de 99,9% sur les lignes téléphoniques plus une ligne de support d'urgence 24/7/365. Pas un détail mineur, quand ce qui répond à votre téléphone tombe en panne à 2 heures du matin.
Tarifs
Non publiés. La page tarifaire s'intitule « Simple pricing that scales » et promet une structure transparente, puis affiche un formulaire de capture de contact échelonné par volume annuel d'appels, de moins de 10 000 à plus de 1 000 000 d'appels. Aucun chiffre en dollars n'apparaît nulle part sur une propriété PolyAI. Aucun engagement minimum non plus.
Au moins l'unité de facturation est claire, dans les propres mots de PolyAI : l'usage continu « is priced on a per-minute basis, which includes proactive performance improvements, maintenance and 24/7 support. »
Avantages
- La liste d'intégrations CCaaS la plus profonde ici, donc elle s'insère dans un parc que vous exploitez déjà.
- Des certifications de sécurité à tous les niveaux plutôt que réservées à un palier Enterprise.
- Le tarif à la minute inclut un SLA de disponibilité de 99,9% sur la ligne téléphonique et une ligne d'urgence 24/7.
- Des résultats clients publiés sur un large éventail de déploiements.
Inconvénients
- Aucun prix publié. La page tarifaire se dit transparente puis affiche un formulaire.
- Les chiffres de rétention varient énormément selon le cas d'usage : 70% des appels d'hôtes chez une chaîne de pubs britannique, puis 34% pour les réservations Golden Nugget et 30% chez une banque de détail non nommée. Les chiffres de restauration ne sont pas un repère juste pour une file de support.
- Le site se contredit à deux reprises, sur le nombre de langues et sur le délai de déploiement.
- Chaque statistique phare du site est un compteur animé côté client, ce qui rend les chiffres difficiles à vérifier de façon indépendante.
Notre avis : si vous possédez déjà une plateforme CCaaS, PolyAI est probablement le chemin le plus court vers un agent vocal fonctionnel, et le SLA inclus se justifie. Une chose sur laquelle insister : des chiffres de rétention issus d'un déploiement de support, pas d'un déploiement de réservation. L'écart publié entre les deux fait plus du double. Pour du contexte sur la catégorie, il y a mon introduction à l'IA conversationnelle pour le service client.
5. Parloa
Idéal pour : quiconque veut voir l'agent testé contre son propre historique d'appels avant qu'il ne prenne un vrai appel.
Parloa est l'acteur entreprise européen. Il a levé 350 millions de dollars à une valorisation de 3 milliards en janvier 2026 et a franchi les 50 millions de dollars de revenu annuel avec 150% de rétention nette, pour un total levé dépassant désormais 560 millions de dollars en moins de quatre ans. Parmi ses clients figurent Allianz, Booking.com, IKEA et SAP.
Parloa ne publie de captures produit nulle part, donc ce qui suit est sa propre diapositive d'architecture plutôt qu'une capture de l'interface. Normalement, je considère cela comme un point négatif pour un fournisseur. Dans ce cas, la diapositive dit justement ce qui compte à voix haute.

L'étape deux de ce cercle est « tester et itérer », à égalité avec déploiement et surveillance. Tous les autres fournisseurs ici traitent les tests comme une fonctionnalité. Parloa a construit une entreprise autour de cela.
Ce qu'il fait vraiment
L'environnement de simulation est la raison pour laquelle Parloa figure sur cette liste. C'est aussi la seule fonctionnalité de tout ce comparatif que je qualifierais de véritable différenciateur. Il exécute des milliers de conversations simulées à travers des scénarios, des langues, des canaux et des cas limites, et l'élément critique est qu'il mélange vos vraies transcriptions historiques avec des tests synthétiques plutôt que d'exécuter seulement des scénarios écrits à la main. Il teste l'ambiguïté et les appels d'outils, le repli, la cohérence de marque. Il isole des sous-tâches, et bascule entre staging et production.
Les évaluations tournent avec un LLM juge et des critères basés sur des règles, les deux, sur la réussite de la tâche et le ton, la précision, le comportement de l'API. Puis un traçage des causes racines, avec des recommandations de correction ligne par ligne appliquées directement dans la plateforme. C'est le mécanisme que j'aimerais voir chez tous les fournisseurs ici. C'est aussi le même principe que nous appliquons au texte : un bot qui n'a été testé qu'avec des questions que vous avez inventées vous-même ne vous apprend rien d'utile.
Les intégrations couvrent Avaya, Five9, Genesys, NICE, Twilio, Verint, Salesforce, Dynamics, ServiceNow, Zendesk et SAP, plus SIP. Plus de 130 langues dans plus de 70 pays, bien qu'aucune liste ne soit publiée nulle part. L'affirmation sur la résidence des données vient avec une formulation plus stricte qu'à l'accoutumée, à savoir que le routage en temps réel maintient le traitement dans la juridiction pendant l'interaction et pas seulement au repos, mais le détail se trouve derrière un centre de confiance à accès restreint.
Tarifs
Non publiés, et l'URL tarifaire renvoie une erreur 404. Le seul signal réel est la propre FAQ de Parloa, qui décrit un « consumption-based pricing model that ties costs to task complexity and effort, not flat rates or token counts », établi selon le volume, les cas d'usage et la valeur business. Aucun minimum publié, aucun palier gratuit, aucun essai.
Avantages
- Le seul outil ici qui rejoue votre véritable historique d'appels dans la simulation.
- Un traçage des causes racines, avec des corrections appliquées directement dans la plateforme.
- Une véritable posture européenne, construite sur Azure, avec un routage en temps réel dans la juridiction.
- Les certifications sont ISO 27001:2022, SOC 2 Type 1 et Type 2, et PCI DSS.
Inconvénients
- Aucun prix publié d'aucune sorte. La consommation « selon la complexité de la tâche » est aussi l'unité la plus difficile à prévoir ici.
- HIPAA, RGPD et DORA sont décrits comme « aligns with » plutôt que certifiés. C'est la formulation propre de Parloa, et elle mérite d'être lue avec précision.
- Les pourcentages clients sur la page d'accueil sont des compteurs animés en JS, donc les chiffres réels se trouvent sur les pages d'études de cas.
- Amazon Connect n'apparaît sur aucune liste d'intégrations Parloa publiée, donc ne le supposez pas.
Notre avis : si vous êtes un acheteur entreprise avec une seule question à poser à un fournisseur, demandez si sa simulation rejoue vos propres appels. Parloa est celui qui, ici, répond oui. Cette seule capacité vaut plus qu'un point de pourcentage de rétention sur le benchmark d'un autre. Mon analyse de Parloa en dit plus sur la plateforme, et tarifs Parloa couvre ce qui est connu du côté commercial.
6. Sierra
Idéal pour : le support à forte valeur où payer par résolution vaut mieux que payer par minute.
Sierra a levé 950 millions de dollars à une valorisation dépassant 15 milliards en mai 2026, et affirme servir plus de 40% des Fortune 50. Le produit vocal gère plus de 55 langues avec changement en cours de conversation, routage de modèle par tour de parole et escalade préservant le contexte. Il accepte aussi les paiements vocaux, carte et ACH via des tonalités DTMF, sur une infrastructure conforme PCI Niveau 1.

C'est un appel de démonstration plutôt qu'une capture de console, et c'est le maximum que je peux vous montrer. Chaque visuel sur la page vocale de Sierra est une affiche vidéo, sans aucune capture produit complète publiée nulle part.
Sierra mérite une mention pour autre chose que son produit, aussi. Elle publie la recherche τ-voice qui a recadré tout cet article. Ses propres résultats : la frontière est passée de 30,4% à 67,3% de pass@1 entre août 2025 et avril 2026, contre un plafond de raisonnement textuel proche de 85%. Chaque fournisseur perd 5 à 14 points sur de l'audio téléphonique réaliste. Et 79% des premières erreurs critiques sont dues à l'agent lui-même. Un fournisseur qui publie les chiffres qui rendent sa propre catégorie difficile est un bon signe.
Ce qu'il fait vraiment
Commercialement, la particularité est la tarification au résultat. La formulation propre de Sierra est « Pay for a job well done », l'unité étant liée à « a resolved support conversation, a saved cancellation, an upsell, a cross-sell », et « if the conversation is unresolved, in most cases, there's no charge. » La version la plus courte qu'ils donnent : « Sierra gets paid only when we complete a task for you. »
Lisez les nuances attentivement cependant, car c'est ce qui compte au moment de signer le contrat. Les escalades ne sont pas facturées « dans la plupart des cas », et les exceptions ne sont pas publiées. La facture réelle est mixte, car Sierra dit : « routing or greeter-style interactions may align better with consumption-based pricing, where payment is based on conversation count, regardless of the outcome. » Puis il y a « résolu », qui n'a pas de définition universelle ici. Les critères sont convenus par contrat.
Tarifs
Il n'y a aucune page tarifaire du tout. sierra.ai/pricing renvoie un 404 sans appel, et aucun chiffre en dollars n'apparaît nulle part : aucun tarif par résultat, aucun frais de mise en place, aucun minimum, aucun essai. Des frais de plateforme ne sont jamais mentionnés. Ils ne sont jamais niés non plus, donc ne supposez pas qu'il n'y en a pas.
Avantages
- Le modèle de facturation s'aligne avec ce que vous voulez vraiment, à savoir des résolutions plutôt que du temps d'antenne.
- La liste de certifications la plus large ici : SOC 2, ISO 27001, ISO 42001, HIPAA, RGPD, EU AI Act et FedRAMP.
- Plus de 55 langues, et il change en cours de conversation.
- Publie une recherche honnête sur les limites de sa propre catégorie.
Inconvénients
- Zéro prix publié, donc comparer avec quoi que ce soit signifie d'abord entrer dans un cycle de vente.
- Les badges de certification ne portent aucune date d'audit, aucune distinction SOC 2 Type I/II, aucun niveau d'autorisation FedRAMP.
- Les clients vocaux nommés s'arrêtent à Rocket Mortgage, Guild et Next, et aucun chiffre de rétention, de résolution ou de temps de traitement n'est publié pour aucun d'entre eux.
- Aucun chiffre de latence vocale publié. Ce chiffre de 200 ms dans l'article τ-voice est la granularité du segment audio du benchmark plutôt que le temps de réponse de l'agent, donc ne le citez pas comme tel.
Notre avis : la tarification au résultat devient plus attractive à mesure que votre taux de rétention se dégrade, et c'est un alignement intelligent. Entrez simplement en négociation en sachant que c'est vous qui définissez l'unité facturable. Fixez par écrit quelles escalades comptent parmi les exceptions à « dans la plupart des cas ». J'approfondis le modèle dans tarifs Sierra AI, et le paysage concurrentiel dans alternatives à Sierra.
7. Bland AI
Idéal pour : une forte concurrence, ou un déploiement qui doit résider dans votre propre cloud.
Bland AI publie ici l'échelle de paliers la plus claire, plus le plafond de concurrence le plus élevé, et de loin. Son index de documentation cite un support Enterprise pour « up to 1 million concurrent calls ». Personne d'autre sur cette liste n'approche ce chiffre.

C'est l'image la plus claire de ce que signifie « tester » dans toute la catégorie. Le panneau de droite exécute un test « Angry Caller » à 94% et une porte « Happy Path » à 100%. Les deux sont des personas écrits par quelqu'un. Utile. Toujours pas votre historique d'appels.
Ce qu'il fait vraiment
Parcours conversationnels, appels d'outils et d'API, puis trois postures d'hébergement publiées : Bland Cloud, votre propre VPC sur AWS, GCP ou Azure, ou entièrement sur site et isolé (air-gapped). Aucun chiffre en dollars n'est associé à aucune de ces options. Aucun supplément ou minimum publié non plus, puisque tout cela relève du contrat Enterprise.
Nouveau depuis mon dernier examen : un vrai chiffre de latence. La page d'accueil affiche désormais 400 ms contre une « moyenne du secteur » revendiquée de 1 240 ms, la documentation parle de moins de 400 ms, et la page produit affiche des chiffres p50 de 380 ms et 365 ms. Cette comparaison à 1 240 ms n'a pas de source. Traitez-la comme du marketing, pas comme une mesure.
Un piège de formulation. La page produit met en avant la capacité à « back-test against historical calls », tandis que le mécanisme Scenarios documenté est un appelant simulé suivant un prompt de persona que vous avez écrit. Une garantie différente de rejouer votre propre archive, et cela mérite d'être demandé directement.
Tarifs
| Start | Build | Scale | Enterprise | |
|---|---|---|---|---|
| Temps de parole | $0.14/min | $0.12/min | $0.11/min | Personnalisé |
| Frais de plateforme | $0 | $299/mois | $499/mois | Sous contrat |
| Temps de transfert | $0.05/min | $0.04/min | $0.03/min | Personnalisé |
| Appels simultanés | 10 | 50 | 100 | Ajusté au volume |
| Limite quotidienne / horaire | 100 / 100 | 2 000 / 1 000 | 5 000 / 1 000 | Illimité |
| Bases de connaissances / voix | 10 / 1 | 50 / 5 | 100 / 15 | Illimité |
| SLA de disponibilité | 99,9% | 99,9% | 99,9% | 99,9% |
Les points de bascule sont assez contre-intuitifs pour être connus. Build ne dépasse Start qu'au-delà de 14 950 minutes par mois, et Scale ne dépasse Build qu'au-delà de 20 000. En dessous d'environ 15 000 minutes, le palier gratuit Start est arithmétiquement le moins cher. Ici, on monte de gamme pour la concurrence, pas pour le tarif.
Avantages
- Un SLA de disponibilité de 99,9% sur tous les paliers, y compris le gratuit, ce que personne d'autre ne fait ici.
- L'auto-hébergement dans votre propre VPC, ou totalement isolé sur site, est une option publiée.
- Le plafond de concurrence est le plus élevé de ce comparatif.
- Apportez votre propre trunk et les frais de transfert à la minute disparaissent complètement.
Inconvénients
- L'annuaire d'intégrations compte 19 connecteurs répartis sur 7 catégories et zéro système de helpdesk ou de ticketing, malgré des textes produit qui revendiquent un support de ticketing. Faire arriver un appel dans Zendesk ou Front signifie un outil sur mesure, ou un webhook post-appel que vous construisez vous-même.
- Le transfert à chaud est réservé à Enterprise, et la documentation le fixe explicitement. Les déploiements en libre-service ne font que du transfert à froid, sans citations de réponse.
- Les citations et les rapports de lacunes de base de connaissances, les résultats, les garde-fous, les alertes, le SMS, le chat web, le BAA : tout cela aussi réservé à Enterprise.
- La page tarifaire dit que la téléphonie est facturée séparément au coût de transit. La FAQ de la page d'accueil et la documentation disent que le tarif à la minute la couvre. Obtenez cela par écrit.
Notre avis : Bland est une plateforme vocale plutôt qu'un produit de support, et ses preuves phares génèrent du revenu plutôt que des économies. Choisissez-la pour la concurrence, ou pour une exigence d'hébergement sur laquelle votre équipe sécurité ne cédera pas. Vous l'achetez pour répondre à des appels de support ? Budgétez le palier Enterprise dès le départ, car les fonctionnalités dont vous avez besoin s'y trouvent toutes. Et si la gestion des tickets est l'objectif réel, l'un des outils d'automatisation du support de mon comparatif plus large convient mieux.
8. Synthflow
Idéal pour : une structure Freshworks qui veut son IA vocale à l'intérieur de Freshcaller.

Avant l'analyse, regardez ce tiroir ouvert, car c'est la capture la plus utile de tout cet article. Elle montre une vraie recherche dans la base de connaissances en cours d'appel. L'appelant a dit « I have but I I would like to know how to use the product », l'agent a reformulé cela en une recherche, et il est revenu 7 résultats en 756 ms avec un meilleur score de similarité de 0,80, contre un similarity_threshold de 0. Ce seuil est le bouton qui décide si votre agent répond à partir d'une correspondance faible ou admet qu'il ne sait pas. Presque aucun fournisseur ne vous montre cela.
Tout le monde décrit encore Synthflow comme la porte d'entrée facile sans code. Depuis ce mois-ci, c'est dépassé. L'échelle en libre-service a disparu, et la documentation le confirme : les anciens paliers Pro, Growth et Agency « are no longer available for new subscriptions and remain supported for existing customers ». Ce qui reste est un produit Enterprise à un seul palier, mené par les ventes.
Ce qu'il fait vraiment
Le transfert vers un humain est la fonctionnalité de support la plus forte ici, en trois modes : froid, chaud avec un message, chaud avec un résumé. Il y a une détection d'humain avec un délai de 30 secondes à 30 minutes, un filtrage des appels, un planning d'horaires d'ouverture. La documentation est aussi franche d'une manière que j'apprécie, à savoir que « cold transfers cannot recover from failures. »
Les sources de connaissances sont des PDF, des documents saisis, des URL individuelles, des explorations publiques de site web et un import du centre d'aide Zendesk. Aucune source authentifiée, aucune ingestion de tickets passés, et aucun classement manuel des documents. Côté intégrations, l'affirmation « 200+ » se résout en environ 15 connecteurs documentés, et la seule intégration profonde avec la pile de support parmi elles est Freshworks : l'IA vocale tournant à l'intérieur de Freshcaller, avec 65% des demandes vocales de routine automatisées. C'est la raison de l'acheter.
Le détail de la mesure est publié bien plus précisément que les tarifs, une combinaison inhabituelle mais utile. La facturation se fait à la seconde et s'agrège entre les appels, donc 125 secondes d'appels reviennent à 2 minutes facturables plutôt qu'à 4. Un transfert réussi arrête le compteur. Un no-answer ou une raccroche sur messagerie vocale est facturé à un forfait de 5 secondes. Le chat se convertit à raison de 5 messages IA pour 1 minute vocale. Et les simulations du Test Center peuvent être facturables.
Tarifs
| Palier | Mensuel | Minutes incluses | Dépassement | Appels simultanés |
|---|---|---|---|---|
| Enterprise (le seul palier vendu) | Aucun prix catalogue ; les contrats démarrent à $30 000/an, environ $2 500/mois | Non publié, selon contrat | Personnalisé, selon votre accord | « Fixé avec Synthflow » |
| Pro / Growth / Agency (héritage) | Fermé aux nouveaux clients | Uniquement dans votre compte | Uniquement dans votre compte | Affiché dans les conditions de votre compte |
| Essai gratuit | Aucun paiement en libre-service. Les deux CTA renvoient à un contact commercial | n/a | n/a | n/a |
Le coût effectif par minute incluse est incalculable à tous les paliers, car Synthflow ne publie jamais un prix et une allocation de minutes sur la même ligne. Le seul chiffre public défendable est ce plancher équivalent à $2 500 par mois, en face d'une allocation que personne hors contrat ne connaît. Tout chiffre à la minute encore en circulation remonte à l'échelle abandonnée.
Avantages
- Trois modes de transfert distincts. Chaud avec un résumé est celui qui aide vraiment l'humain.
- La facturation à la seconde, agrégée entre les appels, est la mesure la plus juste ici.
- Un transfert réussi arrête le compteur.
- Une intégration Freshworks profonde, avec un chiffre d'automatisation publié de 65% pour les demandes vocales de routine.
Inconvénients
- Ce plancher de $30 000/an en fait l'option la plus chère ici pour tout volume inférieur à environ 20 000 minutes par mois.
- Il n'y a plus aucun chiffre de concurrence publié à aucun palier.
- Une contradiction HIPAA sur son propre site. La page d'accueil revendique une certification SOC 2, HIPAA, PCI DSS et RGPD, tandis que la ligne de conformité de la documentation Enterprise ne liste que SOC 2, RGPD et ISO 27001. Ne présumez pas d'un BAA.
- La latence est un objectif et non une mesure, formulée comme « we aim for » moins de 100 ms d'aller-retour. La revente disparaît le 15 septembre 2026, et les serveurs de téléphonie UE arrivent « très bientôt ».
Notre avis : la réputation de simplicité sans code ne correspond plus à la liste de prix, donc ignorez tout comparatif qui l'appelle encore l'option d'entrée bon marché, y compris nos propres anciens articles. Si vous utilisez Freshworks, c'est un excellent choix natif. Sinon, l'intégration Freshcaller est la principale raison de payer ce plancher, et un outil général d'automatisation du service client coûte bien moins cher.
9. Grok Voice Agent Builder
Idéal pour : le modèle capable le plus rapide, si les limites de session ne vous freinent pas.
Le Grok Voice Agent Builder de xAI tourne sur Grok Voice Think Fast 2.0, qui domine le tableau τ-Voice avec 56,5% et répond en 0,70 seconde. Cette combinaison fait tout l'argumentaire. Sur le benchmark, elle tient la route.
Il n'y a pas de capture produit dans cette section car xAI n'en publie aucune, et les URL de documentation du Voice Agent Builder renvoient actuellement une erreur 404. Ce que xAI publie, c'est un changement de tarification prenant effet aujourd'hui. Si vous exploitez déjà Grok Voice en production, c'est l'élément le plus lourd de conséquences sur cette page.

Ce qu'il fait vraiment
Il est compatible au niveau du protocole avec l'API Realtime d'OpenAI sur wss://api.x.ai/v1/realtime, donc migrer une construction realtime existante revient surtout à changer une URL. Les outils couvrent les fonctions, la recherche de fichiers, la recherche web, la recherche X et le MCP. Les extensions orientées conformité sont la partie utile : force_message prononce une ligne textuelle pour les mentions obligatoires, replace mappe des prononciations sans changer la transcription, keyterms accepte jusqu'à 100 termes de 50 caractères chacun, resumption rejoue les tours de parole lors d'une reconnexion. Un numéro de téléphone attribué ajoute $0,01 par minute.
Digne d'intérêt côté précision : la transcription est 1,4 fois meilleure en taux d'erreur de mots que la version 1.0, 1,5 à 2,0 fois meilleure que Deepgram Nova 3 et ElevenLabs Scribe v2 sur 24 langues, et environ 10 fois meilleure sur de l'audio téléphonique bruyant. Le bruit de fond et les accents sont exactement ce que les opérateurs signalent comme cassant leurs agents, donc ce chiffre est plus pertinent pour vous que le benchmark phare.
Tarifs
| Élément | Tarif |
|---|---|
| Grok Voice Think Fast 2.0 | $0.08/min ($4.80/h) |
| Grok Voice Think Fast 1.0 | $0.05/min ($3.00/h) |
| Entrée texte | $0.004 par élément de conversation |
| Numéro de téléphone attribué | +$0.01/min |
web_search / x_search | $5 pour 1 000 appels |
file_search (collections) | $2.50 pour 1 000 |
attachment_search | $10 pour 1 000 |
Aujourd'hui est le jour où c'est devenu plus cher. Le 5 août 2026, l'alias grok-voice-latest se redirige de 1.0 vers 2.0, donc le chemin par défaut coûte 60% plus cher par minute, sans aucun déploiement de votre part. Épingler l'ancienne version est votre façon de vous en exclure. Ce basculement a aussi effacé l'avantage de prix de 37,5% de Grok sur ElevenLabs, car $0,08 correspond exactement au tarif effectif d'ElevenLabs par minute incluse. Ce qui reste, c'est la forme de facturation plutôt que le prix. Grok facture à l'usage, les minutes ElevenLabs sont prépayées, donc Grok continue de gagner sur un volume irrégulier ou faible.
Avantages
- En tête du tableau τ-Voice pour l'accomplissement des tâches de support, avec 56,5%.
- Troisième temps le plus rapide jusqu'au premier audio, à 0,70 seconde, ce qui est la meilleure combinaison vitesse-capacité.
- La facturation est plate à la minute, donc le coût mesuré par heure d'audio en entrée équivaut exactement au tarif catalogue.
- Une transcription solide sur l'audio téléphonique, environ 10 fois meilleure en conditions bruyantes.
Inconvénients
- 10 sessions simultanées par équipe par défaut. Pour une ligne de support, c'est un plafond dur, et l'augmenter nécessite une demande.
- Aucune remise sur lots ni palier prioritaire sur la voix, donc ni remise ni voie rapide payante. Uniquement
us-east-1, et une durée maximale de session de 120 minutes. - Aucune intégration helpdesk. Aucune certification de sécurité publiée non plus pour le produit vocal.
- Le stockage est facturé séparément lorsque l'agent fait de la récupération, $0,10/GiB/jour pour les collections.
Notre avis : le modèle le plus capable ici, emballé dans le produit le moins orienté support. Dix sessions simultanées est le chiffre décisif. Si votre pic dépasse cela et que personne n'a relevé le plafond, c'est un prototype plutôt qu'une ligne de support en production, quelle que soit la qualité du benchmark. J'ai couvert le modèle en profondeur dans Grok Voice Think Fast 2, et les nouveaux tarifs dans son analyse tarifaire.
Où va vraiment l'autre moitié de vos appels
Chacun des outils ci-dessus transférera. Pas un défaut, juste de l'arithmétique. Le meilleur modèle résout 56,5% des scénarios de support dans un benchmark, et les opérateurs rapportent 15% à 30% en production, tandis que la résolution nette moyenne au premier niveau à travers les helpdesks se situe généralement autour de 74,3%, avec seulement 1,4% des helpdesks au-dessus de 95%. Quelque chose atteint toujours une personne. C'est pourquoi la résolution au premier contact est un meilleur objectif que la rétention.

Le mode de défaillance dont j'entends le plus parler n'a rien à voir avec la conversation avec le bot. Il se produit à la jointure :
"AHT question nobody wants to answer lol. shipped a billing/tracking bot, decent containment, but AHT on escalated calls went up. agents had to read the transcript, figure out what the bot already tried, re-ask half of it anyway. fixed by forcing a structured handoff summary instead of raw transcript dump (saved more time than the automation itself). CSAT fine on deflected stuff, tanked on anything that bounced back after a failed bot attempt"
Lisez cette dernière proposition deux fois. La rétention avait l'air bonne, le temps de traitement sur les appels escaladés a augmenté, et la satisfaction s'est effondrée précisément sur les retours. Donc un déploiement vocal peut gagner sur le tableau de bord et perdre auprès des clients qui avaient le plus besoin de vous. C'est l'argument pour suivre le CSAT segmenté selon que l'IA a touché le contact en premier.
Voici la version sans détour du même point, d'un opérateur de centre de contact interrogé sur la part réellement automatisée de son centre :
"15% roughly....people quoting any higher are lying or dont understand "fully handled". AI solutions are not mature or too fragmented at the moment to go any higher."
D'autres réponses dans ce fil situent la bande entre 10% et 30%, selon la conception du parcours. Donc 15% est l'extrémité pessimiste d'une fourchette réelle plutôt que celle d'un cynique isolé. Dans tous les cas, on est loin des 95%.
Ensuite, il y a un coût que le tableau de bord de rétention ne peut absolument pas voir. Ce qui se passe quand l'agent a tort à voix haute et avec assurance :
"If it's anything like talking to ChatGPT via voice they'd definitely notice. And if it has anything like the failure modes it does, the OP's brother is going to eat into a lot of the cost savings he'd get (vs using a human receptionist or even an outsourced receptionist) dealing with fires like the AI said my car would absolutely be done today."
C'est la bonne façon de penser aux hallucinations de l'IA sur une ligne téléphonique. Par écrit, une mauvaise réponse est un message que l'on peut corriger. Dite à voix haute, c'est un engagement que le client a entendu prendre, et le nettoyage devient un contact séparé que vous payez aussi.
Ce que je ferais vraiment
Trois choses, dans cet ordre. Aucune n'est « acheter le plus haut chiffre de rétention ».
D'abord, réduire le volume qui n'avait jamais besoin d'un appel. Statut de commande, réinitialisation de mot de passe, horaires d'ouverture. C'est du travail de déroutement de niveau 1, et en texte, c'est moins cher par interaction et plus précis pour le même modèle. Cela dit, si l'appelant a déjà échoué sur votre centre d'aide, réparer le centre d'aide vient d'abord. C'est un problème de libre-service, pas un problème de voix.
Ensuite, réparer la jointure avant de peaufiner la voix. Dans la citation ci-dessus, un résumé de transfert structuré a fait gagner plus de temps que l'automatisation elle-même. Le même principe que nous appliquons à l'escalade en chat : la personne qui le reçoit a besoin d'un résumé et d'un signal de confiance, pas d'une transcription.
Enfin, supposer que l'appel transféré devient un ticket, car c'est généralement le cas. L'appelant raccroche et vous envoie un e-mail, ou l'agent rédige des notes après coup. Un détail de nos propres conversations avec des clients m'est resté en tête ici, celui d'une équipe gérant une file mixte téléphone et e-mail : rien de leurs appels n'atteignait leur IA du tout, car les enregistrements vocaux n'entraient jamais dans le système et les agents résumaient chaque appel à la main.
"For calls we just write a quick summary in the ticket after, so the AI never really sees any of that."
Responsable support dans une entreprise B2B SaaS de taille moyenne gérant une file mixte téléphone et e-mail sur Zendesk, environ 3 000 tickets par mois
C'est le trou que personne ne chiffre. Vous achetez un agent vocal pour répondre au téléphone, puis la moitié qu'il ne peut pas gérer devient du travail texte, à l'intérieur d'un système que l'agent vocal ne peut absolument pas voir.
Essayez eesel pour la moitié que votre agent vocal transfère
Soyons directs : eesel ne fait pas de voix. Il n'existe aucun produit téléphonique eesel. Si vous avez besoin de quelque chose qui répond à une ligne qui sonne, achetez l'un des neuf ci-dessus.
Ce que fait eesel, c'est la moitié qui atterrit ensuite dans votre helpdesk, et cela part d'un endroit différent de n'importe quel outil vocal ici. Regardez à nouveau le tableau comparatif. Huit des neuf s'entraînent sur une exploration de site web plus des fichiers téléchargés, et exactement un peut rejouer votre propre historique de conversations. L'agent de helpdesk IA d'eesel s'entraîne sur vos tickets passés, puis se simule contre eux avant de répondre à quoi que ce soit en direct, donc ce que vous voyez est sa précision sur votre propre volume historique plutôt que sur des scénarios inventés par quelqu'un. La même discipline pour laquelle Parloa facture des sommes d'entreprise, appliquée au canal texte.

Nous l'avons construit ainsi à cause d'une cicatrice. J'ai vu un bot au ton confiant inventer des affirmations produit et les envoyer à de vrais clients, et c'est pourquoi rien ici ne passe en direct sans d'abord un essai à blanc sur des tickets historiques. C'est aussi pourquoi un responsable support qui nous évaluait a formulé l'exigence comme voulant un agent qui « only handle tickets it's confident to handle » plutôt qu'un qui répond à tout.
Des résultats plutôt que des promesses : Gridwise a obtenu 73% des demandes de niveau 1 résolues dès son premier mois. Côté coût, mon collègue Riell l'a formulé clairement quand nous sommes passés d'un tarif fixe, disant qu'une équipe qui aurait payé $799 par mois en tarif fixe paie maintenant environ $200 à l'usage.
Si vous achetez de la voix, la séquence honnête est la suivante. Réduisez d'abord le volume répétitif en texte. Achetez l'agent vocal pour ce qu'il reste. Puis assurez-vous que les tickets qu'il génère atterrissent quelque part qui connaît déjà votre historique.
La mise en place prend des minutes, pas les deux à huit semaines citées par les fournisseurs vocaux entreprise. Elle couvre aussi plus de helpdesks que n'importe quelle plateforme vocale de cette page, y compris Zendesk et Freshdesk, Gorgias et Front. Vous pouvez essayer eesel gratuitement.
Questions fréquentes
Quelle est la meilleure IA pour le support client vocal en 2026 ?
Combien coûte le support client vocal par IA à la minute ?
L'IA peut-elle vraiment résoudre des appels de support toute seule ?
L'IA vocale ou l'IA de chat est-elle meilleure pour le support client ?
Que devrais-je rechercher en choisissant une IA pour le support client vocal ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








