Grok Voice Think Fast 2.0 : ce qui change et le prix

Rama Adi Nugraha
Écrit par

Rama Adi Nugraha

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Illustration en ligne d'un agent de support avec un casque à côté du logo Grok, avec une forme d'onde vocale dans une bulle de dialogue

Ce que j'entends vraiment par « modèle vocal »

Je passe mon temps depuis quelques années à connecter eesel à des helpdesks, ce qui veut dire que j'ai lu beaucoup de pages d'éditeurs sur l'IA qui répond aux clients. La voix est la seule catégorie où l'argument d'architecture est réel et vérifiable, donc ça vaut le coup d'être précis à ce sujet.

La plupart des stacks vocaux sont trois produits déguisés en un seul : voix vers texte, un modèle de langage, puis texte vers voix, souvent chez trois éditeurs différents. Chaque saut ajoute de la latence, du coût, et une chose de plus qui peut tomber en panne à 2h du matin. La présentation même de xAI lors du lancement du Voice Agent Builder était que c'est précisément ce qu'ils cherchaient à unifier, et Think Fast 2.0 est le modèle qui réalise cette unification.

Comparaison entre un pipeline voix-vers-texte, LLM et texte-vers-voix assemblés à part et un seul chemin de modèle speech-to-speech
Comparaison entre un pipeline voix-vers-texte, LLM et texte-vers-voix assemblés à part et un seul chemin de modèle speech-to-speech

Les modèles Think Fast font quelque chose de spécifique que je n'avais jamais vu concrétisé auparavant : ils raisonnent pendant qu'ils parlent déjà. xAI décrit cela comme un raisonnement en parallèle de la parole, de sorte que la réflexion ne bloque pas avant la première syllabe. En pratique, un appel d'outil se déclenche souvent avant que l'agent ait fini sa première phrase. C'est tout le secret des 0,70 seconde, et cela explique pourquoi le modèle peut être à la fois rapide et étonnamment bon sur des tâches en plusieurs étapes, deux choses qui s'opposent normalement.

Think Fast 2.0 a aussi fortement réduit les tokens de raisonnement. xAI rapporte que la réponse médiane utilise 0,4 fois les tokens de raisonnement de Think Fast 1.0, le genre de changement qu'on ressent sur un appel long plutôt que sur une démo.

Le tableau des benchmarks, et les deux lignes qu'on a tendance à sauter

Voici ce que xAI a publié le jour du lancement, sourcé à partir d'Artificial Analysis.

BenchmarkThink Fast 2.0Think Fast 1.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82,9%75,7%79,1%69,5%
Raisonnement vocal (Big Bench Audio)97,2%97,1%96,0%96,6%
Dynamique conversationnelle (Full Duplex Bench)95,1%77,8%95,7%74,3%
Performance agentique (τ-voice Bench)56,5%52,1%45,7%37,7%
Temps avant le premier son0,70s1,25s1,21s2,98s

Voici quelques points que je soulignerais si vous lisiez ça par-dessus mon épaule.

D'abord, la ligne la plus importante pour le support est τ-voice Bench à 56,5%, et Grok la remporte avec près de 11 points d'avance sur le meilleur score d'OpenAI. τ-voice mesure les agents dans des conditions d'appel réalistes : bruit, accents, interruptions, appelants qui changent d'avis en pleine phrase. C'est la meilleure approximation publiée de « cette chose peut-elle exécuter un vrai workflow sur une vraie ligne téléphonique ». Un plafond de 56,5% signifie aussi que environ deux de ces scénarios difficiles sur cinq échouent encore, un chiffre que je mettrais devant quiconque promet une automatisation totale.

Ensuite, la ligne sur la dynamique conversationnelle est celle que xAI ne remporte pas. GPT-Realtime-2.1 High la dépasse de peu, 95,7% contre 95,1%, et le bond de Grok part de 77,8%, donc c'était clairement le chantier corrigé lors de cette sortie. Il faut le reconnaître, c'est une progression de 17 points.

Passons maintenant au contexte que le tableau de xAI lui-même omet. Si l'on ouvre le classement complet d'Artificial Analysis, Think Fast 2.0 est deuxième au global, pas premier. Qwen Audio 3.0 Realtime Plus d'Alibaba se situe à 84,1%. Il lui faut aussi 4,02 secondes pour commencer à parler, contre 0,70, ce qui sur une ligne téléphonique fait toute la différence entre une conversation et un silence mort. Même constat côté latence : Deepslate Opal répond en 0,44s et Gemini 2.5 Flash Native Audio Dialog en 0,63s, tous deux plus rapides que Grok, et tous deux bien en retrait sur l'indice global. Ce que revendique Grok, c'est la combinaison, et sur cette combinaison, c'est le meilleur de ce tableau.

Le basculement d'alias du 5 août, en dollars

C'est la partie que je mettrais vraiment dans un rappel de calendrier.

Diagramme de bifurcation montrant grok-voice-latest se divisant entre Think Fast 2.0 à 0,08 $ par minute ou un Think Fast 1.0 fixé à 0,05 $ par minute
Diagramme de bifurcation montrant grok-voice-latest se divisant entre Think Fast 2.0 à 0,08 $ par minute ou un Think Fast 1.0 fixé à 0,05 $ par minute

D'après la page tarifaire de xAI, le tarif vocal se lit ainsi :

Modèle ou modeTarif
Speech to speech, grok-voice-think-fast-1.00,05 $ / min (3,00 $ / h) audio, 0,004 $ / entrée texte
Speech to speech, grok-voice-think-fast-2.00,08 $ / min (4,80 $ / h) audio, 0,004 $ / entrée texte
Speech to text0,10 $ / h (REST), 0,20 $ / h (streaming)
Text to speech15,00 $ / 1M caractères

La position de xAI sur la migration est qu'aucune action n'est nécessaire pour la mise à niveau, et que pour rester sur 1.0 il faut fixer grok-voice-think-fast-1.0 avant le 5 août. Les deux moitiés de cette affirmation sont vraies. Ce qui n'est pas dit à voix haute, c'est que le chemin par défaut est le plus cher, et qu'une hausse de 60% par minute arrive sans que vous ayez rien déployé de votre côté. Si vous traitez un volume conséquent, calculez ce que ça vous coûte avant que ça n'arrive plutôt qu'après.

Deux autres compteurs viennent avec. Un numéro de téléphone provisionné dans le Voice Agent Builder coûte 0,01 $ par minute en plus. Les outils côté serveur sont facturés à l'appel : recherche web et recherche X à 5 $ pour 1 000 appels, recherche dans les collections de documents à 2,50 $ pour 1 000, recherche de pièces jointes à 10 $ pour 1 000. Un agent de support qui vérifie quelque chose à presque chaque appel achète ces services par milliers, donc il faut les intégrer au calcul.

Facture de migration

Ce que vous coûte le 5 août

Choisissez votre temps de parole mensuel. Les tarifs sont ceux publiés par xAI, plus 0,01 $/min pour un numéro provisionné.

Environ, pour un appel moyen de 4 minutes500 appels / mois
Fixé sur 1.0$120$100 voix + $20 téléphonie
Basculé auto vers 2.0$180$160 voix + $20 téléphonie
Différence : +$60 / mois (+$720 par an)
Environ, pour un appel moyen de 4 minutes2 500 appels / mois
Fixé sur 1.0$600$500 voix + $100 téléphonie
Basculé auto vers 2.0$900$800 voix + $100 téléphonie
Différence : +$300 / mois (+$3 600 par an)
Environ, pour un appel moyen de 4 minutes12 500 appels / mois
Fixé sur 1.0$3 000$2 500 voix + $500 téléphonie
Basculé auto vers 2.0$4 500$4 000 voix + $500 téléphonie
Différence : +$1 500 / mois (+$18 000 par an)
Environ, pour un appel moyen de 4 minutes50 000 appels / mois
Fixé sur 1.0$12 000$10 000 voix + $2 000 téléphonie
Basculé auto vers 2.0$18 000$16 000 voix + $2 000 téléphonie
Différence : +$6 000 / mois (+$72 000 par an)
Hors invocations d'outils côté serveur, facturées séparément à partir de 2,50 $ pour 1 000 appels.

Une précaution avant de comparer ça à quoi que ce soit d'autre : xAI publie un tarif fixe par minute, alors qu'OpenAI et Google facturent au jeton audio. Artificial Analysis normalise cela en coût par heure d'audio en entrée, et sur cette base, Think Fast 2.0 se situe à 4,80 $, GPT-Realtime-2.1 High à 10,75 $, et Gemini 3.1 Flash High à 1,75 $. Le chiffre de Grok est exactement 60 fois son tarif minute publié, donc c'est un vrai tarif. Les deux autres sont des mesures d'une seule exécution de benchmark, et elles varieront selon la loquacité de votre agent. Si vous choisissez entre les deux, mieux vaut lire correctement les tarifs de l'API Realtime d'OpenAI plutôt que de vous fier à une seule colonne normalisée.

La transcription est l'amélioration discrète

Le tableau des benchmarks attire l'attention, mais je pense que le travail sur la transcription est le changement le plus utile si vous mettez cela sur une ligne téléphonique.

xAI a évalué des milliers de phrases courtes dans 24 langues et rapporte que Think Fast 2.0 surpasse les modèles de transcription dédiés : 1,5x à 2,0x de meilleur taux d'erreur de mots que Deepgram Nova 3 et ElevenLabs Scribe v2, et 1,4x meilleur que Think Fast 1.0. L'affirmation qui m'importe le plus est celle sur le bruit, où l'écart avec la reconnaissance vocale dédiée s'élargirait à environ 10x sous bruit de fond et compression téléphonique.

C'est la condition réelle des appels de support. Personne n'appelle le support depuis une cabine d'enregistrement. Les gens appellent depuis une voiture, un entrepôt, une cuisine avec un enfant à côté. Si vous avez déjà vu une transcription transformer « annuler ma commande » en tout autre chose, vous savez qu'un seul mot mal transcrit peut renvoyer vers tout un mauvais workflow. Quiconque gère du support multilingue devrait regarder le graphique par langue de l'annonce plutôt que la moyenne, car l'écart entre ces 24 langues est large.

Deux paramètres de session sont là spécifiquement pour combler les lacunes restantes, et ils méritent d'être connus dès le premier jour. audio.input.transcription.keyterms oriente la transcription vers jusqu'à 100 termes de 50 caractères chacun, l'endroit où placer vos noms de SKU et de plans. replace associe une expression à une substitution parlée avant le texte-vers-voix, de sorte que l'audio prononce correctement le nom de votre marque tout en gardant l'orthographe d'origine dans la transcription. L'exemple de la documentation associe « Acme Mobile » à « Acme Mobull », ce qui montre exactement à quel point cette fonctionnalité est peu glamour et pourtant nécessaire.

Ce qu'implique réellement le développement dessus

J'ai lu la documentation speech-to-speech comme je lis toute API que je pourrais avoir à maintenir plus tard, en cherchant les parties qui pourraient poser problème ensuite. Voici quelques notes de cette lecture.

L'API est compatible au niveau du protocole avec l'API Realtime d'OpenAI. Vous pointez le WebSocket vers wss://api.x.ai/v1/realtime, remplacez la clé, et la plupart du code client existant fonctionne. C'est un coût de changement délibérément bas, et c'est l'argument commercial le plus fort de xAI ici. Ce n'est pas parfaitement compatible : conversation.item.done, rate_limits.updated et quelques événements output_audio_buffer.* ne sont pas émis, et conversation.item.input_audio_transcription.delta est renommé en .updated avec des charges utiles cumulatives plutôt qu'incrémentales. Si vous avez construit quelque chose sur ces événements, c'est votre travail de portage. Les différences dans les appels d'outils valent aussi la peine d'être lues.

Les outils se déclinent en cinq types : function pour vos propres API, file_search sur des collections de documents téléchargées, web_search, x_search, et des serveurs mcp distants. Le support MCP est celui que j'utiliserais, car il rend vos outils internes existants accessibles sans avoir à écrire une couche spécifique à la voix.

Le raisonnement est par défaut sur un effort high. Vous pouvez régler reasoning.effort sur "none" pour le désactiver. Cela vaut la peine d'être noté car une véritable plainte sur Hacker News concernant la génération précédente allait dans le sens inverse :

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"

Trois extensions spécifiques à xAI sont celles que je signalerais à quiconque construit une ligne de support :

  • force_message énonce une ligne codée en dur, synthétisée par TTS, sans impliquer le modèle, avec un drapeau interruptible. C'est ainsi qu'on délivre « cet appel est enregistré » mot pour mot, à chaque fois, ce qui est une exigence de conformité, pas un simple plus.
  • resumption met en cache les tours par rapport à un conversation_id et les rejoue à la reconnexion. Désactivé par défaut. Sans cela, un WebSocket coupé perd la conversation, et les appelants mobiles perdent la connexion constamment.
  • idle_timeout_ms fait en sorte que le serveur relance un appelant silencieux via une minuterie qui se réarme après chaque réponse. C'est la différence entre un agent patient et un silence gênant.

Les conseils de migration de la documentation vont à l'inverse de ce qu'on attendrait : rendez votre prompt système plus court, pas plus long. La recommandation de xAI est de demander à Grok de généraliser votre prompt existant plutôt que de le porter tel quel, et de retirer les astuces de prompt écrites pour patcher les cas limites du modèle précédent. J'ai fait cet exercice sur nos propres prompts à travers plusieurs mises à niveau de modèle. C'est inconfortable et c'est généralement la bonne chose à faire ; les contournements accumulés sont ce qui rend un prompt progressivement ingérable.

Les benchmarks sont une chose. Le seul déploiement sur lequel l'une ou l'autre annonce donne des chiffres est la ligne commerciale et support de Starlink, qui fonctionne sur Grok Voice, et les chiffres que xAI a publiés avec Think Fast 1.0 valent la peine d'être cités exactement :

  • Taux de conversion de 20%. Une demande commerciale sur cinq achète le service Starlink pendant l'appel avec Grok.
  • Taux de résolution de 70%. La majorité des demandes de support se résolvent de manière autonome, sans humain dans la boucle.
  • 28 outils. Un agent, des dizaines d'outils distincts, sur des centaines de workflows de support et de vente.
  • Le dépannage matériel, les remplacements matériels et les avoirs de service sont tous accordés de manière autonome.

Ce sont des chiffres solides, et ils viennent directement de l'entreprise, ce qui joue dans les deux sens. Starlink et xAI partagent le même propriétaire, donc c'est le meilleur cas de déploiement possible, avec le plus d'attention technique disponible. Un taux de résolution autonome de 70% est réel, et c'est aussi ce qu'on obtient avec une équipe dédiée qui construit 28 outils pour une seule ligne d'activité.

Pour Think Fast 2.0 en particulier, xAI indique que des tests A/B sur cette même ligne Starlink ont montré « une augmentation significative du taux de conversion commercial et du taux de confinement du support », sans publier de chiffre pour l'un ou l'autre. J'aimerais bien avoir ce chiffre. En attendant, la lecture honnête est que la 2.0 est meilleure sur les benchmarks et probablement meilleure en production, mais sur la seule parole de l'éditeur.

La lecture de la communauté est mince pour l'instant, ce qui en soi en dit long sur qui y prête attention. Le fil de lancement sur Hacker News a récolté cinq points et deux commentaires :

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

Le signal le plus utile vient de ceux qui vivent avec la génération précédente depuis un moment :

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

Et la version la plus mesurée du même avis, celle à laquelle je ferais le plus confiance :

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Qui devrait vraiment s'y intéresser

Oui, clairement, si vous gérez une ligne téléphonique à fort volume et que la latence est ce qui vous tue. Moins d'une seconde avant le premier son, plus le meilleur score agentique publié, ce n'est pas un choix serré face aux alternatives, et la compatibilité OpenAI Realtime fait que votre test coûte une journée, pas un sprint. Quiconque monte une automatisation de centre d'appels de zéro devrait le mettre sur sa liste.

Oui, clairement, si vous êtes développeur et voulez sauter la construction de la stack. Le Voice Agent Builder regroupe téléphonie, recherche, garde-fous et revue d'appels, avec du SIP pour les numéros que vous possédez déjà. C'est du temps réellement gagné par rapport à l'assemblage de quatre éditeurs, et les alternatives facturent presque toutes des frais de plateforme en plus. À noter que le modèle vocal est versionné séparément de la ligne texte, donc les sorties de Grok 4.5 ne le font pas bouger.

Pas encore, si votre volume de support est constitué d'emails et de chat. C'est l'erreur que je vois les équipes commettre : elles voient un excellent chiffre vocal et commencent à planifier un projet de déviation téléphonique, alors que la majorité de leur file n'appelle jamais personne. La voix est un canal, pas une stratégie. Commencez par où sont les tickets, et si votre ligne téléphonique est déjà connectée à un helpdesk, vérifiez ce que fait déjà votre intégration téléphonique Gorgias ou équivalent avant d'ajouter une deuxième stack.

Pas encore, si vous devez prouver la sécurité avant la mise en production. Il n'existe aucune méthode publiée pour tester Think Fast 2.0 à blanc sur vos propres appels historiques avant de lui envoyer du trafic. L'enregistrement des appels, les transcriptions et les garde-fous existent tous après coup, dans le Builder. C'est de la revue, pas une répétition générale, et cette distinction compte quand l'agent peut émettre des remboursements. Le même écart se retrouve dans toute la catégorie, ce qui explique pourquoi prévenir les mauvaises réponses IA reste surtout un problème de processus plutôt que de modèle.

Prudence si vous êtes actuellement sur grok-voice-latest. Regardez le calculateur ci-dessus. Demain.

Vous voulez la même chose pour votre file de tickets ?

Grok Voice est bon au téléphone. Le problème, c'est que pour la plupart des équipes de support, le téléphone est le petit canal, et la file de tickets est là où se trouve réellement le volume.

C'est la moitié que fait eesel. Il se connecte à Zendesk, Freshdesk, Gorgias, Front, HubSpot et le reste, s'entraîne sur vos tickets passés, macros et centre d'aide plutôt que sur un prompt à écrire de zéro, et rédige ou envoie des réponses directement dans le helpdesk que vos agents ont déjà ouvert. Aucun nouvel outil à apprendre pour qui que ce soit.

Ce que je soulignerais, compte tenu de tout ce qui précède sur l'écart entre un benchmark et une file d'attente réelle : avant de l'activer, eesel simule l'agent sur votre propre historique de tickets et vous indique ce qu'il aurait répondu et à quelle fréquence. C'est l'étape de répétition générale qui manque aux stacks vocaux. Elle existe parce que j'ai vu un bot à l'air sûr de lui répondre faux, et je préfère le découvrir sur les tickets du mois dernier plutôt que sur ceux de ce matin.

Le point de vue d'un client sur l'importance de cette étape, une citation anonymisée d'une responsable CX d'une entreprise de compléments alimentaires DTC à qui nous avons parlé :

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

C'est le paramétrage, pas une mise en garde. Routage par confiance, exclusion par type de ticket, et une simulation avant la mise en production.

Le tableau de bord helpdesk IA d'eesel montrant des réponses rédigées par l'IA au sein de la file de support
Le tableau de bord helpdesk IA d'eesel montrant des réponses rédigées par l'IA au sein de la file de support

Gratuit à essayer, et vous pouvez l'avoir en train de répondre sur vos propres tickets en quelques minutes. Essayer eesel.

Questions fréquentes

Qu'est-ce que Grok Voice Think Fast 2.0 ?

Le modèle speech-to-speech phare de xAI, annoncé le 29 juillet 2026, qui écoute, raisonne et parle sur un seul chemin de modèle au lieu d'enchaîner trois services. Ce chemin unique explique les 0,70 seconde avant le premier son. Il devient le modèle derrière grok-voice-latest le 5 août 2026. Si votre objectif est l'email et le chat plutôt que les appels, un agent IA pour helpdesk convient mieux.

Combien coûte Grok Voice Think Fast 2.0 par minute ?

0,08 $ par minute d'audio, soit 4,80 $ par heure, plus 0,004 $ par entrée texte. Think Fast 1.0 reste affiché à 0,05 $ par minute, donc le tarif de Grok Voice Think Fast 2.0 représente une hausse de 60% par minute. Un numéro provisionné ajoute 0,01 $ par minute, et les appels d'outils sont facturés séparément. Comparez cela à votre tableau plus large du coût du service client IA, et à ce que coûte un agent humain.

Grok Voice Think Fast 2.0 est-il plus rapide que GPT-Realtime ?

Oui, selon la mesure publiée : 0,70 seconde avant le premier son contre 1,21 seconde pour GPT-Realtime-2.1 High. Ce n'est cependant pas le modèle le plus rapide du classement. Deepslate Opal répond en 0,44s et Gemini 2.5 Flash Native Audio Dialog en 0,63s, tous deux plus bas dans l'indice de qualité. La comparaison avec l'API Realtime d'OpenAI couvre le compromis dans l'autre sens, y compris WebRTC contre WebSocket comme transport.

Dois-je passer de Think Fast 1.0 à la version 2.0 ?

Seulement si vous ne faites rien. Le 5 août 2026, grok-voice-latest cesse de pointer vers grok-voice-think-fast-1.0 pour pointer vers grok-voice-think-fast-2.0, donc fixer l'ancienne version avant cette date est ce qui vous y maintient. Fixer les versions en production est de toute façon une bonne pratique, le même réflexe qui sous-tend le test des réponses IA avant qu'elles n'atteignent les clients.

Grok Voice Think Fast 2.0 peut-il gérer les appels de support client ?

Il est conçu précisément pour ça. La ligne de Starlink fonctionne sur Grok Voice avec 28 outils, 70% de résolution autonome et 20% de conversion commerciale, et le modèle gère les appels de fonctions, la recherche documentaire, MCP et le transfert vers un humain. Le regard réaliste se trouve dans l'IA peut-elle répondre aux appels de support, et le côté opérationnel dans comment automatiser le support téléphonique et la gestion de l'escalade IA.

Quelle est la précision de transcription de Grok Voice Think Fast 2.0 ?

xAI rapporte un taux d'erreur de mots 1,4x meilleur que Think Fast 1.0 et de 1,5x à 2,0x meilleur que Deepgram Nova 3 et ElevenLabs Scribe v2 sur 24 langues, avec un écart qui s'élargit à environ 10x sur de l'audio bruyant. Vérifiez le graphique par langue plutôt que la moyenne si vous gérez du support multilingue, car la précision varie selon la langue, et c'est la queue de distribution qui pénalise votre CSAT.

Grok Voice fonctionne-t-il avec Zendesk ou Gorgias ?

Pas nativement. Grok Voice est un modèle et un builder, donc toute écriture vers le helpdesk passe par un outil fonction ou un serveur MCP que vous connectez vous-même. Si vous voulez de l'IA directement dans le helpdesk à la place, commencez par Zendesk AI ou Freddy de Freshdesk. Côté téléphonie, la configuration Zendesk Talk est l'équivalent natif le plus proche. Dans tous les cas, traitez la voix comme un canal de plus alimentant la même file.

Grok Voice Think Fast 2.0 vaut-il le coup par rapport à Think Fast 1.0 ?

Pour une charge de travail agentique exigeante, probablement oui : 82,9% contre 75,7% au global, avec près de la moitié de la latence et un bond de 17 points sur la dynamique conversationnelle. Pour une simple ligne FAQ où 1.0 résout déjà vos besoins, la hausse tarifaire de 60% achète une précision que vous n'utiliserez peut-être pas. Comparez cela à votre propre taux de résolution et au ROI du centre d'appels avant de laisser l'alias décider à votre place. Si vous comparez toute la gamme, les tarifs de xAI sont l'étape suivante.

Sources

Questions fréquentes

Qu'est-ce que Grok Voice Think Fast 2.0 ?
C'est le modèle vocal speech-to-speech phare de xAI, annoncé le 29 juillet 2026. Il écoute, raisonne et parle sur un seul chemin de modèle au lieu d'enchaîner voix-vers-texte, un LLM et texte-vers-voix, ce qui explique ses 0,70 seconde avant le premier son. Il remplace Think Fast 1.0 comme modèle derrière grok-voice-latest le 5 août 2026. Si votre objectif est de répondre aux emails et au chat plutôt qu'aux appels, un agent IA pour helpdesk convient mieux.
Combien coûte Grok Voice Think Fast 2.0 par minute ?
0,08 $ par minute d'audio, soit 4,80 $ par heure, plus 0,004 $ par entrée texte, selon la page tarifaire de xAI. Think Fast 1.0 reste affiché à 0,05 $ par minute. Un numéro de téléphone provisionné dans le Voice Agent Builder ajoute 0,01 $ par minute, et les outils côté serveur sont facturés séparément. Comparez cela au tableau plus large du coût du service client IA avant de vous engager.
Grok Voice Think Fast 2.0 est-il plus rapide que GPT-Realtime ?
Selon les tests d'Artificial Analysis, oui : 0,70 seconde avant le premier son contre 1,21 seconde pour GPT-Realtime-2.1 High. Ce n'est toutefois pas le modèle le plus rapide mesuré. Deepslate Opal est à 0,44s et Gemini 2.5 Flash Native Audio Dialog à 0,63s. Voir la comparaison avec l'API Realtime d'OpenAI pour l'autre versant.
Dois-je passer de Grok Voice Think Fast 1.0 à la version 2.0 ?
Non, mais il faut agir pour l'éviter. Le 5 août 2026, grok-voice-latest cesse de pointer vers grok-voice-think-fast-1.0 et pointe désormais vers grok-voice-think-fast-2.0. Pour rester sur l'ancien modèle, moins cher, il faut fixer explicitement grok-voice-think-fast-1.0 avant cette date. Fixer la version est de toute façon ce que recommande xAI en production, la même discipline sur laquelle repose la prévention des mauvaises réponses IA.
Grok Voice Think Fast 2.0 peut-il gérer les appels de support client ?
C'est fait pour ça. La ligne commerciale et support de Starlink fonctionne avec Grok Voice et 28 outils, un taux de résolution autonome de 70% et un taux de conversion commerciale de 20% sur les demandes entrantes. Le modèle prend en charge les appels de fonctions, la recherche documentaire, les serveurs MCP, ainsi que le transfert vers un humain. À lire aussi : l'IA peut-elle répondre aux appels de support.
Quelle est la précision de transcription de Grok Voice Think Fast 2.0 ?
xAI rapporte une amélioration de 1,4x du taux d'erreur de mots par rapport à Think Fast 1.0, et de 1,5x à 2,0x par rapport à Deepgram Nova 3 et ElevenLabs Scribe v2, sur des milliers de phrases courtes en 24 langues. L'écart annoncé s'élargit à environ 10x sur de l'audio bruyant et compressé par la téléphonie. Cela compte plus que le chiffre-titre pour quiconque gère du support multilingue.
Comment le prix de Grok Voice Think Fast 2.0 se compare-t-il aux autres API vocales ?
Grok publie un tarif fixe par minute ; OpenAI et Google facturent au jeton audio, donc leur coût réel varie selon la loquacité du modèle. Artificial Analysis a mesuré le coût par heure d'audio en entrée à 4,80 $ pour Think Fast 2.0, 10,75 $ pour GPT-Realtime-2.1 High et 1,75 $ pour Gemini 3.1 Flash High. Notre comparatif coût agent IA versus agent humain remet ces chiffres en contexte.
Où Grok Voice Think Fast 2.0 n'aide-t-il pas ?
C'est un modèle vocal, donc il ne fait rien pour les tickets email et chat qui ne deviennent jamais des appels téléphoniques, et il n'a aucune visibilité sur votre historique de helpdesk. Pour cela, il faut un agent qui s'entraîne sur les tickets passés et fait tourner une simulation de déviation de tickets avant sa mise en production. Les deux se combinent bien : Grok sur la ligne téléphonique, un agent helpdesk sur la file.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration au trait d'un développeur et d'un agent de support discutant à travers des ondes vocales, à côté du logo Grok
Trending

Tarifs Grok Voice Think Fast 2.0 : ce que $0.08/min coûte

Grok Voice Think Fast 2.0 coûte $0.08 par minute d'audio, soit 60% de plus que 1.0. L'alias grok-voice-latest bascule dessus aujourd'hui, voici donc le vrai calcul par appel.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration de six plateformes d'agents vocaux IA comme alternatives au Grok Voice Agent Builder de xAI
Guides

6 alternatives à Grok Voice Agent Builder à essayer en 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow et Deepgram comparés au Grok Voice Agent Builder de xAI sur le prix, la latence et la conformité.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Illustration d'un agent vocal IA sans code répondant à un appel sur la stack Grok Voice de xAI
Guides

Grok Voice Agent Builder : premier regard sur l'IA vocale sans code de xAI

Un test concret du Grok Voice Agent Builder : la stack speech-to-speech, le tarif de 0,05 $/min, le flux de création en deux minutes, et à qui l'outil s'adresse vraiment.

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026
Une personne au téléphone face à trois options d'agent vocal différentes, avec le logo Grok à gauche
Alternatives

Les 10 meilleures alternatives à Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 vient de devenir 60% plus cher sur l'alias par défaut. Dix vraies alternatives, avec coût horaire mesuré et chiffres de benchmark honnêtes.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Illustration éditoriale avec le logo Grok, des barres de benchmarks et une étiquette de prix représentant un avis sur Grok 4.5
Trending

Avis sur Grok 4.5 : benchmarks, prix et verdict

Grok 4.5 de xAI a été lancé le 8 juillet avec une 4e place à l'Intelligence Index et le meilleur résultat d'utilisation agentique d'outils du classement. Voici l'avis complet, les benchmarks, les prix, et qui devrait vraiment l'utiliser.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Illustration dessinée à la main avec le logo de Grok, un agent de support, et des panneaux de benchmarks et de prix
Trending

Grok 4.5 : benchmarks, prix et ce que cela change pour le support

xAI vient de lancer Grok 4.5. Nous avons étudié les vrais benchmarks, le prix des tokens, et si un modèle tout juste sorti et très médiatisé change réellement quelque chose pour votre file de support.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Illustration d'un reçu et de cadrans tarifaires pour Grok Voice Agent Builder de xAI
Guides

Tarifs de Grok Voice Agent Builder : ce que ça coûte vraiment

Le détail complet des tarifs de Grok Voice Agent Builder : le tarif vocal de 0,05 $/min, les suppléments de téléphonie et d'appels d'outils, des exemples de coûts chiffrés, et comment il se compare à OpenAI et ElevenLabs.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 3, 2026
Bannière Gemini 3.5 Flash-Lite sur un fond bleu Google
Trending

Gemini 3.5 Flash-Lite : ce que c'est, le prix et à qui ça s'adresse

Gemini 3.5 Flash-Lite est le modèle 3.5 le plus rapide et le moins cher de Google, à $0,30/$2,50 pour 1M de tokens. Voici ce que c'est, ce que ça coûte et quand l'utiliser.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Deux personnes en conversation avec des formes d'onde vocales entre elles et le logo Grok au-dessus
AI

Grok Voice Think Fast 2.0 : rapide, précis, mais plafonné

Un test pratique de Grok Voice Think Fast 2.0 : la réalité des benchmarks, les particularités de l'API, et le plafond de 10 sessions qui décide si vous pouvez le déployer en production.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement