
Ce que j'entends vraiment par « modèle vocal »
Je passe mon temps depuis quelques années à connecter eesel à des helpdesks, ce qui veut dire que j'ai lu beaucoup de pages d'éditeurs sur l'IA qui répond aux clients. La voix est la seule catégorie où l'argument d'architecture est réel et vérifiable, donc ça vaut le coup d'être précis à ce sujet.
La plupart des stacks vocaux sont trois produits déguisés en un seul : voix vers texte, un modèle de langage, puis texte vers voix, souvent chez trois éditeurs différents. Chaque saut ajoute de la latence, du coût, et une chose de plus qui peut tomber en panne à 2h du matin. La présentation même de xAI lors du lancement du Voice Agent Builder était que c'est précisément ce qu'ils cherchaient à unifier, et Think Fast 2.0 est le modèle qui réalise cette unification.

Les modèles Think Fast font quelque chose de spécifique que je n'avais jamais vu concrétisé auparavant : ils raisonnent pendant qu'ils parlent déjà. xAI décrit cela comme un raisonnement en parallèle de la parole, de sorte que la réflexion ne bloque pas avant la première syllabe. En pratique, un appel d'outil se déclenche souvent avant que l'agent ait fini sa première phrase. C'est tout le secret des 0,70 seconde, et cela explique pourquoi le modèle peut être à la fois rapide et étonnamment bon sur des tâches en plusieurs étapes, deux choses qui s'opposent normalement.
Think Fast 2.0 a aussi fortement réduit les tokens de raisonnement. xAI rapporte que la réponse médiane utilise 0,4 fois les tokens de raisonnement de Think Fast 1.0, le genre de changement qu'on ressent sur un appel long plutôt que sur une démo.
Le tableau des benchmarks, et les deux lignes qu'on a tendance à sauter
Voici ce que xAI a publié le jour du lancement, sourcé à partir d'Artificial Analysis.
| Benchmark | Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|---|
| AA Speech-to-Speech Quality Index | 82,9% | 75,7% | 79,1% | 69,5% |
| Raisonnement vocal (Big Bench Audio) | 97,2% | 97,1% | 96,0% | 96,6% |
| Dynamique conversationnelle (Full Duplex Bench) | 95,1% | 77,8% | 95,7% | 74,3% |
| Performance agentique (τ-voice Bench) | 56,5% | 52,1% | 45,7% | 37,7% |
| Temps avant le premier son | 0,70s | 1,25s | 1,21s | 2,98s |
Voici quelques points que je soulignerais si vous lisiez ça par-dessus mon épaule.
D'abord, la ligne la plus importante pour le support est τ-voice Bench à 56,5%, et Grok la remporte avec près de 11 points d'avance sur le meilleur score d'OpenAI. τ-voice mesure les agents dans des conditions d'appel réalistes : bruit, accents, interruptions, appelants qui changent d'avis en pleine phrase. C'est la meilleure approximation publiée de « cette chose peut-elle exécuter un vrai workflow sur une vraie ligne téléphonique ». Un plafond de 56,5% signifie aussi que environ deux de ces scénarios difficiles sur cinq échouent encore, un chiffre que je mettrais devant quiconque promet une automatisation totale.
Ensuite, la ligne sur la dynamique conversationnelle est celle que xAI ne remporte pas. GPT-Realtime-2.1 High la dépasse de peu, 95,7% contre 95,1%, et le bond de Grok part de 77,8%, donc c'était clairement le chantier corrigé lors de cette sortie. Il faut le reconnaître, c'est une progression de 17 points.
Passons maintenant au contexte que le tableau de xAI lui-même omet. Si l'on ouvre le classement complet d'Artificial Analysis, Think Fast 2.0 est deuxième au global, pas premier. Qwen Audio 3.0 Realtime Plus d'Alibaba se situe à 84,1%. Il lui faut aussi 4,02 secondes pour commencer à parler, contre 0,70, ce qui sur une ligne téléphonique fait toute la différence entre une conversation et un silence mort. Même constat côté latence : Deepslate Opal répond en 0,44s et Gemini 2.5 Flash Native Audio Dialog en 0,63s, tous deux plus rapides que Grok, et tous deux bien en retrait sur l'indice global. Ce que revendique Grok, c'est la combinaison, et sur cette combinaison, c'est le meilleur de ce tableau.
Le basculement d'alias du 5 août, en dollars
C'est la partie que je mettrais vraiment dans un rappel de calendrier.

D'après la page tarifaire de xAI, le tarif vocal se lit ainsi :
| Modèle ou mode | Tarif |
|---|---|
Speech to speech, grok-voice-think-fast-1.0 | 0,05 $ / min (3,00 $ / h) audio, 0,004 $ / entrée texte |
Speech to speech, grok-voice-think-fast-2.0 | 0,08 $ / min (4,80 $ / h) audio, 0,004 $ / entrée texte |
| Speech to text | 0,10 $ / h (REST), 0,20 $ / h (streaming) |
| Text to speech | 15,00 $ / 1M caractères |
La position de xAI sur la migration est qu'aucune action n'est nécessaire pour la mise à niveau, et que pour rester sur 1.0 il faut fixer grok-voice-think-fast-1.0 avant le 5 août. Les deux moitiés de cette affirmation sont vraies. Ce qui n'est pas dit à voix haute, c'est que le chemin par défaut est le plus cher, et qu'une hausse de 60% par minute arrive sans que vous ayez rien déployé de votre côté. Si vous traitez un volume conséquent, calculez ce que ça vous coûte avant que ça n'arrive plutôt qu'après.
Deux autres compteurs viennent avec. Un numéro de téléphone provisionné dans le Voice Agent Builder coûte 0,01 $ par minute en plus. Les outils côté serveur sont facturés à l'appel : recherche web et recherche X à 5 $ pour 1 000 appels, recherche dans les collections de documents à 2,50 $ pour 1 000, recherche de pièces jointes à 10 $ pour 1 000. Un agent de support qui vérifie quelque chose à presque chaque appel achète ces services par milliers, donc il faut les intégrer au calcul.
Ce que vous coûte le 5 août
Choisissez votre temps de parole mensuel. Les tarifs sont ceux publiés par xAI, plus 0,01 $/min pour un numéro provisionné.
Une précaution avant de comparer ça à quoi que ce soit d'autre : xAI publie un tarif fixe par minute, alors qu'OpenAI et Google facturent au jeton audio. Artificial Analysis normalise cela en coût par heure d'audio en entrée, et sur cette base, Think Fast 2.0 se situe à 4,80 $, GPT-Realtime-2.1 High à 10,75 $, et Gemini 3.1 Flash High à 1,75 $. Le chiffre de Grok est exactement 60 fois son tarif minute publié, donc c'est un vrai tarif. Les deux autres sont des mesures d'une seule exécution de benchmark, et elles varieront selon la loquacité de votre agent. Si vous choisissez entre les deux, mieux vaut lire correctement les tarifs de l'API Realtime d'OpenAI plutôt que de vous fier à une seule colonne normalisée.
La transcription est l'amélioration discrète
Le tableau des benchmarks attire l'attention, mais je pense que le travail sur la transcription est le changement le plus utile si vous mettez cela sur une ligne téléphonique.
xAI a évalué des milliers de phrases courtes dans 24 langues et rapporte que Think Fast 2.0 surpasse les modèles de transcription dédiés : 1,5x à 2,0x de meilleur taux d'erreur de mots que Deepgram Nova 3 et ElevenLabs Scribe v2, et 1,4x meilleur que Think Fast 1.0. L'affirmation qui m'importe le plus est celle sur le bruit, où l'écart avec la reconnaissance vocale dédiée s'élargirait à environ 10x sous bruit de fond et compression téléphonique.
C'est la condition réelle des appels de support. Personne n'appelle le support depuis une cabine d'enregistrement. Les gens appellent depuis une voiture, un entrepôt, une cuisine avec un enfant à côté. Si vous avez déjà vu une transcription transformer « annuler ma commande » en tout autre chose, vous savez qu'un seul mot mal transcrit peut renvoyer vers tout un mauvais workflow. Quiconque gère du support multilingue devrait regarder le graphique par langue de l'annonce plutôt que la moyenne, car l'écart entre ces 24 langues est large.
Deux paramètres de session sont là spécifiquement pour combler les lacunes restantes, et ils méritent d'être connus dès le premier jour. audio.input.transcription.keyterms oriente la transcription vers jusqu'à 100 termes de 50 caractères chacun, l'endroit où placer vos noms de SKU et de plans. replace associe une expression à une substitution parlée avant le texte-vers-voix, de sorte que l'audio prononce correctement le nom de votre marque tout en gardant l'orthographe d'origine dans la transcription. L'exemple de la documentation associe « Acme Mobile » à « Acme Mobull », ce qui montre exactement à quel point cette fonctionnalité est peu glamour et pourtant nécessaire.
Ce qu'implique réellement le développement dessus
J'ai lu la documentation speech-to-speech comme je lis toute API que je pourrais avoir à maintenir plus tard, en cherchant les parties qui pourraient poser problème ensuite. Voici quelques notes de cette lecture.
L'API est compatible au niveau du protocole avec l'API Realtime d'OpenAI. Vous pointez le WebSocket vers wss://api.x.ai/v1/realtime, remplacez la clé, et la plupart du code client existant fonctionne. C'est un coût de changement délibérément bas, et c'est l'argument commercial le plus fort de xAI ici. Ce n'est pas parfaitement compatible : conversation.item.done, rate_limits.updated et quelques événements output_audio_buffer.* ne sont pas émis, et conversation.item.input_audio_transcription.delta est renommé en .updated avec des charges utiles cumulatives plutôt qu'incrémentales. Si vous avez construit quelque chose sur ces événements, c'est votre travail de portage. Les différences dans les appels d'outils valent aussi la peine d'être lues.
Les outils se déclinent en cinq types : function pour vos propres API, file_search sur des collections de documents téléchargées, web_search, x_search, et des serveurs mcp distants. Le support MCP est celui que j'utiliserais, car il rend vos outils internes existants accessibles sans avoir à écrire une couche spécifique à la voix.
Le raisonnement est par défaut sur un effort high. Vous pouvez régler reasoning.effort sur "none" pour le désactiver. Cela vaut la peine d'être noté car une véritable plainte sur Hacker News concernant la génération précédente allait dans le sens inverse :
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"
Trois extensions spécifiques à xAI sont celles que je signalerais à quiconque construit une ligne de support :
force_messageénonce une ligne codée en dur, synthétisée par TTS, sans impliquer le modèle, avec un drapeauinterruptible. C'est ainsi qu'on délivre « cet appel est enregistré » mot pour mot, à chaque fois, ce qui est une exigence de conformité, pas un simple plus.resumptionmet en cache les tours par rapport à unconversation_idet les rejoue à la reconnexion. Désactivé par défaut. Sans cela, un WebSocket coupé perd la conversation, et les appelants mobiles perdent la connexion constamment.idle_timeout_msfait en sorte que le serveur relance un appelant silencieux via une minuterie qui se réarme après chaque réponse. C'est la différence entre un agent patient et un silence gênant.
Les conseils de migration de la documentation vont à l'inverse de ce qu'on attendrait : rendez votre prompt système plus court, pas plus long. La recommandation de xAI est de demander à Grok de généraliser votre prompt existant plutôt que de le porter tel quel, et de retirer les astuces de prompt écrites pour patcher les cas limites du modèle précédent. J'ai fait cet exercice sur nos propres prompts à travers plusieurs mises à niveau de modèle. C'est inconfortable et c'est généralement la bonne chose à faire ; les contournements accumulés sont ce qui rend un prompt progressivement ingérable.
Est-ce que ça fonctionne en production ? Starlink est la seule preuve réelle
Les benchmarks sont une chose. Le seul déploiement sur lequel l'une ou l'autre annonce donne des chiffres est la ligne commerciale et support de Starlink, qui fonctionne sur Grok Voice, et les chiffres que xAI a publiés avec Think Fast 1.0 valent la peine d'être cités exactement :
- Taux de conversion de 20%. Une demande commerciale sur cinq achète le service Starlink pendant l'appel avec Grok.
- Taux de résolution de 70%. La majorité des demandes de support se résolvent de manière autonome, sans humain dans la boucle.
- 28 outils. Un agent, des dizaines d'outils distincts, sur des centaines de workflows de support et de vente.
- Le dépannage matériel, les remplacements matériels et les avoirs de service sont tous accordés de manière autonome.
Ce sont des chiffres solides, et ils viennent directement de l'entreprise, ce qui joue dans les deux sens. Starlink et xAI partagent le même propriétaire, donc c'est le meilleur cas de déploiement possible, avec le plus d'attention technique disponible. Un taux de résolution autonome de 70% est réel, et c'est aussi ce qu'on obtient avec une équipe dédiée qui construit 28 outils pour une seule ligne d'activité.
Pour Think Fast 2.0 en particulier, xAI indique que des tests A/B sur cette même ligne Starlink ont montré « une augmentation significative du taux de conversion commercial et du taux de confinement du support », sans publier de chiffre pour l'un ou l'autre. J'aimerais bien avoir ce chiffre. En attendant, la lecture honnête est que la 2.0 est meilleure sur les benchmarks et probablement meilleure en production, mais sur la seule parole de l'éditeur.
La lecture de la communauté est mince pour l'instant, ce qui en soi en dit long sur qui y prête attention. Le fil de lancement sur Hacker News a récolté cinq points et deux commentaires :
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
Le signal le plus utile vient de ceux qui vivent avec la génération précédente depuis un moment :
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
Et la version la plus mesurée du même avis, celle à laquelle je ferais le plus confiance :
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
Qui devrait vraiment s'y intéresser
Oui, clairement, si vous gérez une ligne téléphonique à fort volume et que la latence est ce qui vous tue. Moins d'une seconde avant le premier son, plus le meilleur score agentique publié, ce n'est pas un choix serré face aux alternatives, et la compatibilité OpenAI Realtime fait que votre test coûte une journée, pas un sprint. Quiconque monte une automatisation de centre d'appels de zéro devrait le mettre sur sa liste.
Oui, clairement, si vous êtes développeur et voulez sauter la construction de la stack. Le Voice Agent Builder regroupe téléphonie, recherche, garde-fous et revue d'appels, avec du SIP pour les numéros que vous possédez déjà. C'est du temps réellement gagné par rapport à l'assemblage de quatre éditeurs, et les alternatives facturent presque toutes des frais de plateforme en plus. À noter que le modèle vocal est versionné séparément de la ligne texte, donc les sorties de Grok 4.5 ne le font pas bouger.
Pas encore, si votre volume de support est constitué d'emails et de chat. C'est l'erreur que je vois les équipes commettre : elles voient un excellent chiffre vocal et commencent à planifier un projet de déviation téléphonique, alors que la majorité de leur file n'appelle jamais personne. La voix est un canal, pas une stratégie. Commencez par où sont les tickets, et si votre ligne téléphonique est déjà connectée à un helpdesk, vérifiez ce que fait déjà votre intégration téléphonique Gorgias ou équivalent avant d'ajouter une deuxième stack.
Pas encore, si vous devez prouver la sécurité avant la mise en production. Il n'existe aucune méthode publiée pour tester Think Fast 2.0 à blanc sur vos propres appels historiques avant de lui envoyer du trafic. L'enregistrement des appels, les transcriptions et les garde-fous existent tous après coup, dans le Builder. C'est de la revue, pas une répétition générale, et cette distinction compte quand l'agent peut émettre des remboursements. Le même écart se retrouve dans toute la catégorie, ce qui explique pourquoi prévenir les mauvaises réponses IA reste surtout un problème de processus plutôt que de modèle.
Prudence si vous êtes actuellement sur grok-voice-latest. Regardez le calculateur ci-dessus. Demain.
Vous voulez la même chose pour votre file de tickets ?
Grok Voice est bon au téléphone. Le problème, c'est que pour la plupart des équipes de support, le téléphone est le petit canal, et la file de tickets est là où se trouve réellement le volume.
C'est la moitié que fait eesel. Il se connecte à Zendesk, Freshdesk, Gorgias, Front, HubSpot et le reste, s'entraîne sur vos tickets passés, macros et centre d'aide plutôt que sur un prompt à écrire de zéro, et rédige ou envoie des réponses directement dans le helpdesk que vos agents ont déjà ouvert. Aucun nouvel outil à apprendre pour qui que ce soit.
Ce que je soulignerais, compte tenu de tout ce qui précède sur l'écart entre un benchmark et une file d'attente réelle : avant de l'activer, eesel simule l'agent sur votre propre historique de tickets et vous indique ce qu'il aurait répondu et à quelle fréquence. C'est l'étape de répétition générale qui manque aux stacks vocaux. Elle existe parce que j'ai vu un bot à l'air sûr de lui répondre faux, et je préfère le découvrir sur les tickets du mois dernier plutôt que sur ceux de ce matin.
Le point de vue d'un client sur l'importance de cette étape, une citation anonymisée d'une responsable CX d'une entreprise de compléments alimentaires DTC à qui nous avons parlé :
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
C'est le paramétrage, pas une mise en garde. Routage par confiance, exclusion par type de ticket, et une simulation avant la mise en production.

Gratuit à essayer, et vous pouvez l'avoir en train de répondre sur vos propres tickets en quelques minutes. Essayer eesel.
Questions fréquentes
Qu'est-ce que Grok Voice Think Fast 2.0 ?
Le modèle speech-to-speech phare de xAI, annoncé le 29 juillet 2026, qui écoute, raisonne et parle sur un seul chemin de modèle au lieu d'enchaîner trois services. Ce chemin unique explique les 0,70 seconde avant le premier son. Il devient le modèle derrière grok-voice-latest le 5 août 2026. Si votre objectif est l'email et le chat plutôt que les appels, un agent IA pour helpdesk convient mieux.
Combien coûte Grok Voice Think Fast 2.0 par minute ?
0,08 $ par minute d'audio, soit 4,80 $ par heure, plus 0,004 $ par entrée texte. Think Fast 1.0 reste affiché à 0,05 $ par minute, donc le tarif de Grok Voice Think Fast 2.0 représente une hausse de 60% par minute. Un numéro provisionné ajoute 0,01 $ par minute, et les appels d'outils sont facturés séparément. Comparez cela à votre tableau plus large du coût du service client IA, et à ce que coûte un agent humain.
Grok Voice Think Fast 2.0 est-il plus rapide que GPT-Realtime ?
Oui, selon la mesure publiée : 0,70 seconde avant le premier son contre 1,21 seconde pour GPT-Realtime-2.1 High. Ce n'est cependant pas le modèle le plus rapide du classement. Deepslate Opal répond en 0,44s et Gemini 2.5 Flash Native Audio Dialog en 0,63s, tous deux plus bas dans l'indice de qualité. La comparaison avec l'API Realtime d'OpenAI couvre le compromis dans l'autre sens, y compris WebRTC contre WebSocket comme transport.
Dois-je passer de Think Fast 1.0 à la version 2.0 ?
Seulement si vous ne faites rien. Le 5 août 2026, grok-voice-latest cesse de pointer vers grok-voice-think-fast-1.0 pour pointer vers grok-voice-think-fast-2.0, donc fixer l'ancienne version avant cette date est ce qui vous y maintient. Fixer les versions en production est de toute façon une bonne pratique, le même réflexe qui sous-tend le test des réponses IA avant qu'elles n'atteignent les clients.
Grok Voice Think Fast 2.0 peut-il gérer les appels de support client ?
Il est conçu précisément pour ça. La ligne de Starlink fonctionne sur Grok Voice avec 28 outils, 70% de résolution autonome et 20% de conversion commerciale, et le modèle gère les appels de fonctions, la recherche documentaire, MCP et le transfert vers un humain. Le regard réaliste se trouve dans l'IA peut-elle répondre aux appels de support, et le côté opérationnel dans comment automatiser le support téléphonique et la gestion de l'escalade IA.
Quelle est la précision de transcription de Grok Voice Think Fast 2.0 ?
xAI rapporte un taux d'erreur de mots 1,4x meilleur que Think Fast 1.0 et de 1,5x à 2,0x meilleur que Deepgram Nova 3 et ElevenLabs Scribe v2 sur 24 langues, avec un écart qui s'élargit à environ 10x sur de l'audio bruyant. Vérifiez le graphique par langue plutôt que la moyenne si vous gérez du support multilingue, car la précision varie selon la langue, et c'est la queue de distribution qui pénalise votre CSAT.
Grok Voice fonctionne-t-il avec Zendesk ou Gorgias ?
Pas nativement. Grok Voice est un modèle et un builder, donc toute écriture vers le helpdesk passe par un outil fonction ou un serveur MCP que vous connectez vous-même. Si vous voulez de l'IA directement dans le helpdesk à la place, commencez par Zendesk AI ou Freddy de Freshdesk. Côté téléphonie, la configuration Zendesk Talk est l'équivalent natif le plus proche. Dans tous les cas, traitez la voix comme un canal de plus alimentant la même file.
Grok Voice Think Fast 2.0 vaut-il le coup par rapport à Think Fast 1.0 ?
Pour une charge de travail agentique exigeante, probablement oui : 82,9% contre 75,7% au global, avec près de la moitié de la latence et un bond de 17 points sur la dynamique conversationnelle. Pour une simple ligne FAQ où 1.0 résout déjà vos besoins, la hausse tarifaire de 60% achète une précision que vous n'utiliserez peut-être pas. Comparez cela à votre propre taux de résolution et au ROI du centre d'appels avant de laisser l'alias décider à votre place. Si vous comparez toute la gamme, les tarifs de xAI sont l'étape suivante.
Sources
- Grok Voice Think Fast 2.0, xAI, July 29, 2026
- Grok Voice Think Fast 1.0, xAI, April 23, 2026
- Introducing the Voice Agent Builder, xAI, July 1, 2026
- 21 New Flagship Grok Voices, xAI, July 6, 2026
- xAI pricing, voice API rates, last updated July 3, 2026
- Speech to Speech API docs, xAI, last updated August 2, 2026
- Speech to Speech models leaderboard, Artificial Analysis
Questions fréquentes
Qu'est-ce que Grok Voice Think Fast 2.0 ?
grok-voice-latest le 5 août 2026. Si votre objectif est de répondre aux emails et au chat plutôt qu'aux appels, un agent IA pour helpdesk convient mieux.Combien coûte Grok Voice Think Fast 2.0 par minute ?
Grok Voice Think Fast 2.0 est-il plus rapide que GPT-Realtime ?
Dois-je passer de Grok Voice Think Fast 1.0 à la version 2.0 ?
grok-voice-latest cesse de pointer vers grok-voice-think-fast-1.0 et pointe désormais vers grok-voice-think-fast-2.0. Pour rester sur l'ancien modèle, moins cher, il faut fixer explicitement grok-voice-think-fast-1.0 avant cette date. Fixer la version est de toute façon ce que recommande xAI en production, la même discipline sur laquelle repose la prévention des mauvaises réponses IA.Grok Voice Think Fast 2.0 peut-il gérer les appels de support client ?
Quelle est la précision de transcription de Grok Voice Think Fast 2.0 ?
Où Grok Voice Think Fast 2.0 n'aide-t-il pas ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.









Comment le prix de Grok Voice Think Fast 2.0 se compare-t-il aux autres API vocales ?