Avis sur Grok Voice Think Fast 2.0 : rapide, affilé, plafonné

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Deux personnes en conversation avec des formes d'onde vocales entre elles et le logo Grok au-dessus

Ce que j'ai vraiment testé, et ce que je n'ai pas pu tester

Je veux être honnête sur la base de tout ceci, car "je l'ai testé" est employé assez librement avec les modèles vocaux.

Ce que j'ai passé en revue : la documentation speech-to-speech de xAI d'un bout à l'autre, plus la fiche modèle avec ses limites publiées et le tableau tarifaire sur la page de tarification.

En plus de cela, le billet de lancement et l'évaluation indépendante d'Artificial Analysis qui l'a noté face à 27 autres modèles. J'ai ensuite lu ce que disent les gens qui construisent avec.

Ce que je ne peux pas affirmer : je n'ai pas fait passer mille appels de production dedans sur une ligne téléphonique réelle. Personne en dehors de xAI ne l'a fait, à part Starlink. Donc quand cet article dit quelque chose sur le comportement en charge, cela vient d'une limite publiée plutôt que d'un vécu terrain, et je préciserai chaque fois de laquelle des deux il s'agit.

Je construis des agents IA chez eesel pour gagner ma vie, surtout les parties qui se situent entre un modèle et une vraie conversation client. C'est l'angle ici. La question n'est pas "est-ce impressionnant en démo". C'est "qu'est-ce qui casse quand c'est mardi après-midi et que 40 personnes appellent en même temps".

Le tableau de notation

Voici tout le verdict au même endroit avant les détails.

DimensionScoreMon avis
Fluidité conversationnelle95,1% Full Duplex BenchLa correction phare. La 1.0 obtenait 77,8%. Les interruptions et les chevauchements ne sont plus le point faible.
Intelligence brute82,9% indice AADeuxième au global, derrière Qwen à 84,1%. Assez proche pour que ce ne soit pas le facteur décisif.
Comportement agentique56,5% τ-voiceMeilleur du tableau, mais seulement 1,9 point devant Qwen à 54,6%.
Latence0,70s avant le premier audioTroisième plus rapide. Assez rapide pour que l'appelant ne le remarque pas.
Transcription1,4x meilleure que la 1.0Une vraie amélioration, et celle que xAI a le plus sous-vendue.
Design de l'APICompatible au niveau du protocole avec OpenAI RealtimeLa meilleure partie du produit. Les extensions donnent l'impression d'avoir été écrites par des gens qui avaient déjà lancé un agent téléphonique.
Prévisibilité des coûts4,80 $/h mesuré, 4,80 $/h au tarif publicFacturation plate par minute. Rare, et qui vaut plus que ce que cela semble.
Marge de scalabilité10 sessions simultanéesLe problème. Tout ce qui précède est miné par cette seule ligne.
Options de déploiementus-east-1 uniquementAucune région UE. Pour beaucoup d'équipes, cela met fin à la discussion.

Verdict : le modèle mérite une recommandation forte et la plateforme mérite un "vérifiez d'abord votre volume". Ce sont deux produits différents, et les avis ont tendance à ne noter que le premier.

Là où il gagne

Quatre choses se démarquent, et une seule d'entre elles est le chiffre que xAI a mis en avant au lancement. Ensemble, elles décrivent un type de modèle particulier : pas le plus intelligent disponible, mais celui qui reste affilé tout en répondant assez vite pour une ligne téléphonique.

Les interruptions ne trahissent plus rien

Le plus grand changement individuel par rapport à la 1.0 est le Full Duplex Bench, qui mesure comment un modèle gère les aspects désordonnés d'une vraie conversation : interruptions, chevauchements, signaux d'écoute, quelqu'un qui change d'avis en plein milieu d'une phrase. La 1.0 obtenait 77,8%. La 2.0 obtient 95,1%.

C'est le chiffre qui sépare un agent vocal que les gens tolèrent d'un agent dont ils oublient que c'est une machine. Quiconque a écouté des enregistrements d'appels connaît l'échec typique : l'appelant commence à se corriger, le bot continue à parler par-dessus, et l'appelant se répète plus fort ou demande un humain. Cela figure en tête de toute liste de problèmes des chatbots qui poussent les clients à abandonner, et les schémas de transfert de tout déploiement sérieux existent surtout pour capter exactement ce moment-là.

À noter, en toute honnêteté : c'est la seule ligne où Grok perd face à OpenAI. GPT-Realtime-2.1 High obtient 95,7%. Un écart de 0,6 point n'est pas quelque chose qu'un appelant percevrait jamais, mais le tableau de lancement ne va pas non plus le mentionner spontanément.

Le score agentique est le vrai titre

τ-voice mesure si un modèle peut réellement terminer une tâche par la voix, plutôt que de simplement bien sonner en la faisant. Rechercher une commande, vérifier une politique, puis appeler une fonction et revenir avec la bonne réponse. Grok Voice Think Fast 2.0 affiche 56,5% ici, le chiffre le plus élevé de tout le tableau Artificial Analysis.

Trois bandes de classement comparant Grok Voice Think Fast 2.0 à Qwen, GPT et Gemini sur l'indice global, le temps avant le premier audio et le score agentique tau-voice
Trois bandes de classement comparant Grok Voice Think Fast 2.0 à Qwen, GPT et Gemini sur l'indice global, le temps avant le premier audio et le score agentique tau-voice

Cela compte plus que l'indice global pour quiconque construit un vrai agent, car un agent vocal qui ne peut pas utiliser des outils de façon fiable est un lecteur de FAQ très coûteux. C'est la même distinction qui sépare les agents IA des chatbots IA en texte, et la même raison pour laquelle les exemples d'agents IA utiles sont toujours ceux qui touchent un vrai système plutôt que de réciter un article.

La réserve honnête : Qwen Audio 3.0 Realtime Plus se situe à 54,6% sur le même benchmark. L'avance de Grok n'est donc que de 1,9 point, pas le gouffre que le cadrage suggère. L'écart par rapport au meilleur d'OpenAI, à 45,7%, est plus large, et c'est de là que vient la formule "10 points d'avance", mais Qwen est juste derrière.

La combinaison vitesse et intelligence

0,70s avant le premier audio, contre 1,25s sur la 1.0. Deepslate Opal est plus rapide à 0,44s, ainsi qu'une variante de Gemini Flash à 0,63s, donc Grok arrive troisième. Mais Qwen, le modèle qui le devance sur l'indice global, met 4,02s avant le premier audio. Sur une ligne téléphonique, c'est une pause morte suffisamment longue pour que l'appelant dise "allô ?".

Ce compromis est le vrai produit. Quelqu'un sur Hacker News l'a mieux formulé que le billet de lancement lui-même :

Hacker News

"Grok voice est le meilleur assistant vocal IA et ce n'est même pas comparable.

Le compromis vitesse-intelligence est exactement le bon. Alors que la voix GPT paraît prétentieuse et peu naturelle malgré ses efforts pour sonner humaine."

xAI indique aussi que les tokens de raisonnement tournent à 0,4x le P50 de son prédécesseur, ce qui explique comment il est devenu plus rapide en devenant plus intelligent, plutôt qu'en réfléchissant moins.

La transcription est la partie sous-estimée

Enfoui dans le billet de lancement : la précision de transcription est 1,4x meilleure que sur la 1.0, et 1,5 à 2,0x meilleure que Deepgram Nova 3 et ElevenLabs Scribe v2 sur 24 langues. Sur de l'audio bruyant ou téléphonique, l'écart revendiqué est d'environ 10x.

L'audio téléphonique est justement là où la transcription échoue habituellement, et c'est exactement le type d'audio sur lequel tourne une ligne de support toute la journée. Si vous évaluez cela face à ElevenLabs ou un fournisseur dédié de speech-to-text, ce chiffre en audio bruyant mérite plus de poids que les benchmarks conversationnels. C'est aussi l'axe sur lequel l'endpoint de transcription d'OpenAI a été le choix par défaut, surtout par inertie.

Il y a maintenant 26 voix dans le catalogue, après l'ajout de 21 en juillet 2026, et chacune peut être remplacée par un identifiant de voix clonée. Si vous avez déjà lutté pour garder un bot qui sonne comme votre entreprise sur tous les canaux, le problème de la voix de marque ne disparaît pas juste parce que la sortie est de l'audio.

Là où le tableau de benchmarks en fait trop

Trois choses que le cadrage du lancement ne vous dit pas.

82,9%, c'est la deuxième place. Qwen Audio 3.0 Realtime Plus est à 84,1%. Grok est compétitif face à lui, et beaucoup plus rapide, mais "état de l'art" fait un peu de travail dans le texte marketing. Si vous avez regardé récemment la famille de modèles de Qwen ou ce que facture Alibaba, vous saurez qu'ils livrent à un rythme soutenu.

Ne comparez pas les deux chiffres τ-voice de xAI entre eux. Le billet Voice Agent Builder du 1er juillet indique que Think Fast 1.0 obtient 67,3% sur son propre test τ-voice. Artificial Analysis note le même modèle à 52,1%. Des méthodologies différentes, des échelles différentes. Quiconque empile ces deux chiffres dans un graphique du type "regardez à quel point ça s'est amélioré" ne compare rien du tout. La même prudence s'applique aux chiffres dans la tarification de Voice Agent Builder, qui citent encore l'ancien tarif.

Les chiffres de Starlink appartiennent à la 1.0. Les fameux 20% de conversion des ventes et 70% de résolution autonome, provenant de la ligne +1 888 GO STARLINK avec 28 outils connectés, sont des résultats de Think Fast 1.0. Pour la 2.0, xAI affirme que des tests A/B sur cette même ligne ont montré "une augmentation significative" de la conversion et du confinement, sans publier de chiffre. C'est aussi un déploiement en interne au sein de la même structure de propriété, ce qui en fait plutôt un cas idéal qu'un cas représentatif.

Développer avec : l'API est le bon côté

Je m'attendais à ce que la documentation soit le point faible ici, et c'est l'inverse qui s'est produit. En termes de conception, c'est l'API vocale temps réel la plus soignée que j'aie lue.

Une checklist en deux colonnes montrant ce qui est repris d'OpenAI Realtime et quels quatre types d'événements il faut réécrire
Une checklist en deux colonnes montrant ce qui est repris d'OpenAI Realtime et quels quatre types d'événements il faut réécrire

Elle est compatible au niveau du protocole avec OpenAI Realtime sur wss://api.x.ai/v1/realtime, donc si vous avez une application existante, la migration se limite à une URL de base et une clé. Vous pouvez même garder le SDK OpenAI et simplement le pointer vers https://api.x.ai/v1. Quatre choses ne sont pas reprises : conversation.item.done, rate_limits.updated et la plupart des événements output_audio_buffer.* ne sont pas émis, et ...input_audio_transcription.delta est renommé .updated et devient cumulatif, ce qui corrompra silencieusement votre affichage de transcription si vous concatèniez les deltas.

Là où ça devient intéressant, c'est avec les extensions propres à xAI, qui se lisent comme si elles avaient été écrites par des gens qui avaient déjà lancé un agent téléphonique et s'y étaient brûlés :

  • force_message prononce une ligne codée en dur via TTS sans impliquer le modèle du tout. Définissez interruptible: false et l'audio de l'appelant est ignoré jusqu'à la fin. Cela résout correctement le problème de la mention légale obligatoire, plutôt qu'en priant pour que votre system prompt tienne.
  • replace est une table de prononciation appliquée avant le TTS, de sorte que l'audio dit "Acme Mobull" alors que la transcription affiche toujours "Acme Mobile". La correspondance ignore la casse, respecte les limites de mots complets, et privilégie la correspondance la plus longue.
  • resumption met en cache les échanges par conversation_id et les rejoue lors de la reconnexion. Désactivé par défaut, les deux parties doivent l'activer, et l'historique expire après 30 minutes d'inactivité.
  • keyterms oriente la transcription vers jusqu'à 100 termes métier de 50 caractères chacun, modifiables en cours de session. Pour une ligne de support pleine de références produits et de noms de forfaits, c'est la différence entre une transcription utilisable et un chaos.
  • idle_timeout_ms se réarme après chaque réponse, ce qui permet à l'agent de relancer un appelant silencieux plusieurs fois plutôt que de rester sans réaction.

Le paramètre reasoning.effort accepte exactement deux valeurs : "high" (par défaut) et "none". Il n'y a pas de réglage intermédiaire, ce qui est une vraie lacune. Quelqu'un a soulevé précisément ce point sur Hacker News à propos d'une précédente version de Grok voice :

Hacker News

"Le modèle vocal de Grok est aussi un modèle de raisonnement. Je suis d'accord qu'il est bien meilleur que les autres modèles vocaux.

Donnez-moi simplement une option pour avoir une réponse plus lente mais un meilleur modèle…"

Autre chose que la documentation fait correctement et que la plupart des fournisseurs vous laissent découvrir en production : elle vous dit explicitement d'attendre que la lecture audio se termine avant d'envoyer response.create après un appel d'outil, car le serveur livre tous les deltas audio avant les événements d'appel de fonction. Sautez cette étape et vous obtenez des voix qui se chevauchent. Elle suggère même d'afficher un indicateur de réflexion pendant ce temps mort. C'est un détail durement acquis, et il est écrit noir sur blanc.

Le conseil du guide de migration lui-même est de rendre votre system prompt plus court, pas plus long, ce qui en dit quelque chose sur la façon dont le modèle a été calibré.

Les trois limites qui vous empêcheront vraiment de le déployer

Si j'étais celui qui évalue tout ça, c'est la section que je lirais en premier.

Un diagramme en entonnoir montrant les appels entrants se resserrant à travers une porte étiquetée 10 sessions simultanées par équipe, avec le reste en attente
Un diagramme en entonnoir montrant les appels entrants se resserrant à travers une porte étiquetée 10 sessions simultanées par équipe, avec le reste en attente

10 sessions simultanées par équipe. C'est le défaut publié sur la fiche modèle, relevable sur demande. Dix appels simultanés, c'est simplement le lundi matin d'une petite équipe de support. Tous les benchmarks ci-dessus sont sans importance si l'appel numéro onze ne peut pas se connecter, et "relevable sur demande" est une conversation commerciale, pas une option de configuration. Quiconque dimensionne un agent IA pour centre d'appels devrait traiter cela comme la première question, pas une note en bas de page.

Pour comparer, les produits vocaux packagés construits sur un helpdesk ne publient aucun plafond de sessions, car la concurrence est le problème du fournisseur, pas le vôtre. C'est vrai pour les agents vocaux IA de Zendesk, pour la configuration de Freshcaller, et pour l'agent vocal de Salesforce. Vous échangez de la flexibilité contre le fait que quelqu'un d'autre gère la planification des capacités.

us-east-1 uniquement. Une seule région, aucune option UE. Si vous avez des engagements de résidence des données, cela tranche la question avant même d'évaluer quoi que ce soit d'autre.

Aucun palier de priorité et aucune remise sur volume. Le palier de priorité 2x concerne uniquement Chat Completions et Responses. La remise de 20% sur le traitement par lot ne concerne que les modèles texte. La voix n'obtient ni voie rapide ni rabais sur volume, donc le tarif que vous voyez est le tarif que vous payez à toute échelle. Il y a aussi une durée maximale de session de 120 minutes, généreuse pour du support et serrée pour quelque chose comme une ligne surveillée.

Deux points plus mineurs à connaître. Le stockage est facturé séparément si votre agent fait de la récupération : les collections coûtent 0,10 $/Gio/jour, les fichiers 0,025 $, les téléchargements 0,20 $/Gio. Et il y a des frais de 0,05 $ pour violation des règles d'utilisation pour chaque requête Responses bloquée avant génération.

Devriez-vous passer à la 2.0, ou rester sur la 1.0 ?

Le basculement d'alias du 5 août signifie que ne rien faire est déjà une décision en soi. Choisissez la ligne qui vous décrit.

Qu'utilisez-vous aujourd'hui ?

Choisissez une option. Le verdict change beaucoup selon laquelle de ces situations vous correspond.

Passez à la 2.0 sans vous poser de questions

À l'échelle d'une démo, la hausse de tarif de 60% est une erreur d'arrondi, et le saut du Full Duplex de 77,8% à 95,1% fait la différence entre une démo qui marque et une qui ne marque pas. Laissez le basculement d'alias faire le travail.

Passez à la 2.0, mais budgétez le basculement

Votre coût par minute passe de 0,05 $ à 0,08 $ le 5 août sans aucun déploiement de votre part. À 2 000 minutes par mois, cela passe de 100 $ à 160 $. L'amélioration de la fluidité conversationnelle en vaut la peine, mais présentez le chiffre à qui doit valider avant que la facture ne le fasse pour vous.

Réglez d'abord le plafond de sessions, le modèle ensuite

10 sessions simultanées par équipe est le défaut publié, et le relever est une conversation avec xAI, pas un changement de configuration. Obtenez ce chiffre par écrit avant de tester quoi que ce soit. Un score de 95,1% en Full Duplex ne sert à rien pour l'appel numéro onze.

Ce n'est pas encore votre modèle

Le speech-to-speech ne tourne que sur us-east-1, sans aucune région UE publiée. Aucun score de cet article ne change cela. Réévaluez quand xAI publiera une deuxième région.

Ce que disent réellement ceux qui construisent avec

X est le lieu naturel pour les réactions à xAI, et il est actuellement difficile d'y lire en profondeur, donc le signal utilisable se trouve sur Hacker News. Deux fils portent l'essentiel.

Le commentaire le plus voté sur le fil Think Fast 2.0 est essentiellement une plainte sur le fait que le lancement soit passé sous les radars :

Hacker News

"Je ne sais pas pourquoi ce post n'est pas plus populaire, c'est un modèle vocal état de l'art, qui bat des labos spécialisés comme ElevenLabs"

C'est une lecture juste des capacités, et il vaut la peine de noter que les tarifs ont désormais convergé aussi. Chaque palier payant d'ElevenLabs Agents revient à presque exactement 0,08 $ par minute incluse, ce qui correspond au centime près au nouveau tarif de Grok. Jusqu'au 5 août, Grok était moins cher de 37,5%.

L'avis plus nuancé, datant de quelques mois plus tôt, tient toujours la route :

Hacker News

"Grok voice est étonnamment bon, en fait. C'est toujours un modèle moins intelligent que les modes de raisonnement des modèles de pointe, mais moins bête que les modes vocaux des autres fournisseurs."

C'est à peu près là où j'en suis aussi. Un modèle vocal est toujours un compromis face à un modèle texte qui a le droit de réfléchir dix secondes, et Grok fait un meilleur compromis que le reste du secteur. Lisez les avis côté consommateur et vous verrez le même verdict formulé avec moins de nuance.

La frustration récurrente dans ces fils concerne l'usage d'outils en mode vocal, et cela mérite d'être clarifié car ça joue dans les deux sens :

Hacker News

"Ce qui me manque dans cette annonce, c'est la capacité d'utiliser des connecteurs et des outils. Je ne comprends pas vraiment - AUCUN des assistants de pointe ne peut utiliser des outils/connecteurs en mode vocal"

Cela concerne les assistants vocaux grand public, et du côté de l'API, ce n'est pas vrai pour Grok : les sessions prennent en charge les outils function, file_search, web_search, x_search, et mcp distants, ceux côté serveur étant exécutés pour vous. Les outils serveur sont facturés par invocation, à 5 $ par 1 000 pour la recherche web et sur X, 2,50 $ par 1 000 pour les collections, et 10 $ par 1 000 pour la recherche de pièces jointes. L'écart que décrit ce commentaire est réel dans l'application Grok grand public, pas dans ce que vous construiriez vous-même. C'est la même fracture qui traverse le déploiement vocal de ChatGPT : l'API a de l'avance sur l'application depuis un bon moment déjà.

Qui devrait l'adopter, et qui devrait attendre

Adoptez-le si vous construisez un agent téléphonique ou vocal qui doit faire des choses, pas seulement parler. Le score τ-voice, le support d'outils, les extensions force_message et keyterms, et le compteur plat par minute s'additionnent pour former la pile vocale la plus favorable aux développeurs actuellement disponible. Migrer depuis l'audio temps réel d'OpenAI est quasiment gratuit.

Adoptez-le si la prévisibilité des coûts compte pour votre équipe finance. Artificial Analysis mesure le coût réel de Grok à 4,80 $ de l'heure d'audio en entrée, identique au tarif public, car le compteur est plat par minute. GPT-Realtime-2 affiche 1,15 $/h en entrée et mesure 4,14 $/h tout compris. Les factures vocales qui correspondent à leur étiquette sont plus rares qu'elles ne devraient l'être, ce qui explique en partie pourquoi la question du coût agent contre agent humain est si difficile à répondre honnêtement.

Adoptez-le si vous voulez construire vous-même l'orchestration. Si vous préférez glisser des blocs les uns dans les autres, les tarifs de Voiceflow et les alternatives à Voice Agent Builder sont l'extrémité sans code du même marché.

Attendez si votre volume dépasse dix appels simultanés et que vous n'avez pas déjà un plafond relevé par écrit. Attendez si vous avez besoin d'une région UE. Attendez si vous comptiez sur le tarif à 0,05 $ et n'aviez pas remarqué que l'alias bougeait sous vos pieds, dans ce cas fixez dès aujourd'hui grok-voice-think-fast-1.0 et décidez selon votre propre calendrier.

Ne l'achetez pas comme une solution de support. C'est un modèle et une API, pas un agent de helpdesk. Il n'a aucune notion de votre historique de tickets, de vos macros, de vos règles d'escalade, ou des questions que votre équipe a déjà décidé de ne pas confier à l'IA. Tout ce qui précède concerne la couche vocale, et la couche vocale ne représente peut-être que 20% de ce qui fait vraiment fonctionner une automatisation de support. Le reste, c'est la partie ennuyeuse : connaître son produit, savoir quand s'arrêter, et transférer proprement.

Une responsable CX d'une marque de compléments alimentaires en vente directe a résumé la contrainte mieux qu'aucune fiche technique :

"L'IA ne pourra jamais répondre à 100% des questions... J'ai besoin d'une IA qui ne gère que les tickets pour lesquels elle est confiante, et qui laisse tous les autres tranquilles."

Aucun benchmark vocal ne mesure cela. C'est une question de politique, et c'est elle qui décide si un déploiement survit à son premier mois.

La voix est la moitié bruyante d'une file de support

La plupart des tickets qui se transforment en appels téléphoniques auraient pu être résolus par texte une heure plus tôt. L'automatisation de première réponse et un chatbot de base de connaissances que l'IA peut réellement lire éliminent plus d'appels que n'importe quel modèle vocal. C'est ce qui vaut la peine d'être corrigé avant de chercher un modèle vocal.

eesel est un agent IA qui se connecte au helpdesk que vous utilisez déjà, s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur un system prompt que vous devez rédiger à la main, et vous permet de simuler l'ensemble sur votre historique réel de tickets avant qu'un seul client n'y soit exposé. Ce dernier point est délibéré. J'ai passé des années à observer des bots au ton assuré donner de mauvaises réponses, et un essai à blanc sur des tickets déjà résolus est la seule façon honnête de découvrir ce que le vôtre fera. C'est aussi l'étape qui distingue un vrai agent IA d'un bot basé sur des règles une fois que les parcours scriptés atteignent leurs limites.

C'est le même choix construire-ou-acheter auquel arrivent beaucoup d'équipes une fois qu'elles ont lu une page de documentation comme celle de xAI et compris tout ce qu'elles auraient à maintenir elles-mêmes :

"Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas y investir notre temps. Nous voulions quelque chose que nous n'aurions pas à maintenir."

Karel, GENERAL BYTES

Si vous voulez aussi la couche vocale, continuez votre lecture sur le Voice Agent Builder de Grok et le champ plus large des entreprises d'IA vocale. Si vous voulez d'abord régler la file d'attente en amont, eesel est gratuit à essayer et prend quelques minutes à connecter à votre helpdesk. Les équipes qui utilisent Gorgias ou Zendesk le voient généralement répondre à de vrais tickets dès l'après-midi même.

Trois lectures utiles ensuite, selon la partie sur laquelle vous êtes bloqué :

Questions fréquentes

Grok Voice Think Fast 2.0 est-il assez performant pour des agents vocaux en production ?
Pour le modèle en lui-même, oui. Il obtient 82,9% sur l'indice speech-to-speech d'Artificial Analysis et 56,5% sur le benchmark agentique τ-voice, le meilleur score agentique de ce tableau. La contrainte vient de la plateforme qui l'entoure : 10 sessions simultanées par équipe par défaut et une seule région us-east-1. Lisez l'analyse détaillée de Grok Voice Think Fast 2.0 pour le mécanisme complet, et les agents IA pour centres d'appels pour ce dont un déploiement en production a généralement besoin.
Quelles sont les nouveautés de Grok Voice Think Fast 2.0 par rapport à la version 1.0 ?
Le Full Duplex Bench est passé de 77,8% à 95,1%, le temps avant le premier audio est tombé de 1,25s à 0,70s, et l'indice global a grimpé de 75,7% à 82,9%. La précision de transcription est 1,4x meilleure que sur la 1.0. Le hic, c'est le prix : le tarif est passé de 0,05 $ à 0,08 $ par minute, ce que l'analyse des tarifs de Grok Voice détaille en dollars.
Combien coûte Grok Voice Think Fast 2.0 par minute ?
0,08 $ par minute d'audio, soit 4,80 $ de l'heure, plus 0,004 $ par message texte en entrée. C'est une hausse de 60% par rapport au tarif de la 1.0, et elle vous tombe dessus automatiquement si vous appelez l'alias grok-voice-latest. Comparez avec les tarifs d'ElevenLabs et le champ plus large des entreprises d'IA vocale avant de vous engager.
Puis-je migrer une application OpenAI Realtime vers Grok Voice ?
En grande partie, oui. Le endpoint est compatible au niveau du protocole avec OpenAI Realtime sur wss://api.x.ai/v1/realtime, donc changer l'URL de base et la clé couvre la majeure partie du travail. Quatre types d'événements se comportent différemment, listés dans la section migration ci-dessous. Si vous avez développé sur l'API audio d'OpenAI, prévoyez un après-midi plutôt qu'un sprint.
Grok Voice Think Fast 2.0 est-il meilleur qu'ElevenLabs pour les appels de support ?
Ils coûtent maintenant le même prix par minute, donc tout dépend de la forme. Grok fonctionne au paiement à l'usage et gère le raisonnement et les appels d'outils dans un seul modèle ; ElevenLabs vend des forfaits de minutes prépayées. Pour une file de support spécifiquement, aucun des deux n'est un helpdesk, c'est pourquoi les équipes associent une couche vocale à quelque chose comme un agent de helpdesk IA qui connaît déjà l'historique des tickets.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Deux personnes en conversation avec des formes d'onde vocales entre elles et le logo Grok au-dessus
AI

Grok Voice Think Fast 2.0 : rapide, précis, mais plafonné

Un test pratique de Grok Voice Think Fast 2.0 : la réalité des benchmarks, les particularités de l'API, et le plafond de 10 sessions qui décide si vous pouvez le déployer en production.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

Qu'est-ce que Buzz ? L'espace de travail IA de Jack Dorsey expliqué

Buzz est la nouvelle appli de chat d'équipe open source de Jack Dorsey, où humains et agents IA partagent les mêmes canaux. Voici ce qu'elle est, à qui elle s'adresse, et le hic.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Illustration d'un canevas de créateur d'agent IA sans code avec des nœuds de workflow
AI

Les 7 meilleurs créateurs d'agents IA sans code en 2026

J'ai testé les meilleurs créateurs d'agents IA sans code pour les équipes support en 2026, de Botpress à Copilot Studio, et j'ai classé lequel correspond vraiment à votre configuration.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026
Illustration d'un canevas IA à embranchements générant des images, des diapositives et du texte
AI

Avis Flowith : le canevas d'agent IA en vaut-il la peine ? (2026)

Un avis concret sur Flowith : ce que font vraiment le canevas IA à embranchements et Agent Neo, ce que coûte Flowith en crédits, et qui devrait passer son tour.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration éditoriale pour un test de Gemini 3.6 Flash, le modèle d'IA workhorse rapide de Google
AI

Test de Gemini 3.6 Flash : le cheval de bataille moins cher et plus rapide de Google

Un test pratique de Gemini 3.6 Flash : le nouveau prix, la baisse de 17% des tokens, où il surpasse GPT-5.6 et Claude Sonnet 5, et où il reste encore derrière.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Illustration de l'avis sur le Super Agent de Genspark AI
AI

Avis Genspark AI 2026 : le Super Agent en vaut-il la peine ?

Un avis pratique sur Genspark AI : ce que fait vraiment le Super Agent, le prix réel et le problème de consommation de crédits, et si ça vaut la peine de payer en 2026.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Bannière illustrée présentant un décryptage des tarifs Flowith, montrant les paliers d'abonnement et un modèle de facturation basé sur les crédits
AI

Tarifs Flowith (2026) : forfaits, crédits et coût réel

Un décryptage complet des tarifs Flowith : les quatre paliers basés sur les crédits, ce qu'achète réellement un crédit, les pièges qui n'apparaissent pas sur la page tarifs, et à qui s'adresse chaque forfait.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Bannière illustrée pour un guide sur Flowith, l'espace de travail créatif basé sur un agent IA construit sur un canevas infini de nœuds
AI

Qu'est-ce que Flowith ? Le canevas d'agent IA, Agent Neo et les tarifs

Flowith est un agent IA qui travaille sur un canevas infini plutôt que dans une fenêtre de chat. Voici ce que fait vraiment Agent Neo, son prix, et ce à quoi il sert.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration pour une sélection des meilleures alternatives à Google Gemini 3.6 Flash en 2026
AI

Les 6 meilleures alternatives à Gemini 3.6 Flash en 2026

Les meilleures alternatives à Gemini 3.6 Flash en 2026, avec de vrais prix et benchmarks : GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite et plus encore.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement