Tarifs Grok Voice Think Fast 2.0 : ce que $0.08/min coûte

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Illustration au trait d'un développeur et d'un agent de support discutant à travers des ondes vocales, à côté du logo Grok

La grille tarifaire complète de Grok Voice, telle que publiée aujourd'hui

Voici tout ce qui figure dans la section API vocale de la grille tarifaire xAI, plus la ligne de téléphonie qui se trouve plutôt dans l'annonce du Voice Agent Builder. J'ai aussi inclus les tarifs de transcription et de synthèse autonomes, car beaucoup d'équipes exploitent encore un pipeline en pièces détachées et veulent comparer les deux approches.

PosteTarif
Speech to speech, grok-voice-think-fast-2.0$0.08 / min ($4.80 / h)
Speech to speech, grok-voice-think-fast-1.0$0.05 / min ($3.00 / h)
Entrée texte, par conversation.item.create$0.004 / message
Numéro de téléphone provisionné (téléphonie)+$0.01 / min
Speech to text, REST$0.10 / h
Speech to text, streaming$0.20 / h
Text to speech$15.00 / 1M caractères
web_search ou x_search$5 / 1k appels
collections_search / file_search$2.50 / 1k appels
attachment_search$10 / 1k appels
code_execution$5 / 1k appels
Stockage de collections$0.10 / GiB / jour

Deux choses valent la peine d'être dites tout haut sur ce tableau, car ce sont les points où les équipes se trompent en établissant leur budget.

Le compteur audio est décrit dans la fiche du modèle comme facturant par minute d'audio « envoyé ou reçu », ce qui donne l'impression de pouvoir compter deux fois une conversation bidirectionnelle. Il semble que ce ne soit pas le cas. Artificial Analysis a mesuré le coût par heure d'audio en entrée à exactement $4.80 pour ce modèle, soit $0.08 multiplié par soixante, donc dans leur test le compteur s'est comporté comme un seul décompte de durée de session plutôt qu'une somme des deux sens. Je vérifierais quand même moi-même la première facture plutôt que de me fier à cela sur parole.

Le compteur d'entrée texte est également plus restreint qu'il n'y paraît. xAI facture $0.004 par événement conversation.item.create envoyé, mais les éléments function_call_output ne sont pas facturés et response.create n'est même pas un événement facturable. Un agent bavard qui utilise beaucoup d'outils n'accumule donc pas de frais d'entrée texte pour chaque résultat d'outil qu'il retourne, ce qui était l'hypothèse de départ, et elle était fausse.

Le basculement du 5 août, en dollars

Voici toute la raison pour laquelle cet article existe aujourd'hui plutôt que la semaine dernière.

Deux cartes de prix montrant l'alias grok-voice-latest passant de grok-voice-think-fast-1.0 à $0.05 par minute à grok-voice-think-fast-2.0 à $0.08 par minute le 5 août 2026, soit une augmentation de 60%
Deux cartes de prix montrant l'alias grok-voice-latest passant de grok-voice-think-fast-1.0 à $0.05 par minute à grok-voice-think-fast-2.0 à $0.08 par minute le 5 août 2026, soit une augmentation de 60%

La note de lancement d'xAI est directe à ce sujet : le 5 août 2026, grok-voice-latest passe de grok-voice-think-fast-1.0 à grok-voice-think-fast-2.0, aucune action nécessaire pour la mise à niveau, et pour rester sur l'ancien modèle il faut fixer grok-voice-think-fast-1.0 avant cette date. Ce que la note ne fait pas, c'est indiquer un pourcentage à côté, et ce pourcentage est de 60% par minute.

La documentation est actuellement en plein basculement, ce que j'ai trouvé discrètement amusant. Le tableau des modèles du guide speech-to-speech décrit encore l'alias comme pointant vers 1.0 et se mettant à jour le 5 août, alors qu'un paragraphe plus bas sur la même page dit déjà qu'il « pointe toujours vers le modèle le plus récent (actuellement grok-voice-think-fast-2.0) ». Les deux étaient vrais à des jours différents. Aucun des deux ne dit ce que cela fait à votre facture.

Juste à côté, dans le même billet de lancement, se trouve la phrase par laquelle xAI ouvre sa section tarifs : « Nous pensons que les prix doivent être prévisibles et transparents ». Je trouve en fait cela défendable ici. Ils ont laissé 1.0 publié à son ancien tarif, donné un avis daté et documenté l'opt-out. C'est plus d'avertissement que la plupart des révisions de prix de modèles n'en donnent. Ce n'est simplement pas la même chose qu'une facture prévisible, car le chemin par défaut a bougé, et c'est précisément là que vit l'essentiel du trafic en production.

Ce que le prix affiché ne dit pas

Toute grille tarifaire vocale de cette catégorie a la même signature : le chiffre principal est la seule chose sur la facture qui n'est pas une surprise. Voici un seul appel de support de six minutes, chiffré ligne par ligne.

Reçu dessiné à la main décomposant un appel Grok Voice de six minutes en audio, numéro de téléphone, recherches web, consultation de collections et entrées texte, pour un total de $0.5645 contre un prix affiché de $0.48
Reçu dessiné à la main décomposant un appel Grok Voice de six minutes en audio, numéro de téléphone, recherches web, consultation de collections et entrées texte, pour un total de $0.5645 contre un prix affiché de $0.48
  • Audio : 6 min x $0.08 = $0.48
  • Numéro de téléphone provisionné : 6 min x $0.01 = $0.06
  • Deux recherches web : 2 x $0.005 = $0.01
  • Une consultation de collections : 1 x $0.0025 = $0.0025
  • Trois entrées texte : 3 x $0.004 = $0.012

Cela fait $0.5645 contre un prix affiché de $0.48, soit environ 18% de plus. Pas catastrophique, et honnêtement l'un des meilleurs ratios de cette catégorie, car les tarifs d'outils d'xAI sont bon marché et son tarif vocal est fixe. Mais cela évolue de façon linéaire, et 18% sur une ligne vocale de $3 200 par mois représentent $576 que personne n'avait mis dans les prévisions.

La ligne que je modéliserais avec le plus de soin est web_search. À $5 pour 1 000 appels, ça ressemble à un arrondi, jusqu'à ce qu'on se souvienne qu'un modèle agentique décide lui-même du nombre d'outils à appeler. xAI le dit clairement sur sa page de tarifs : les coûts augmentent avec la complexité de la requête parce que c'est l'agent qui choisit. L'effort de raisonnement est réglé par défaut sur "high" sur ce modèle, et bien que les jetons de raisonnement ne soient pas mesurés séparément sur le compteur vocal, un modèle qui réfléchit davantage est un modèle qui recourt à plus d'outils.

Ce que les trois centimes supplémentaires achètent vraiment

Je ne paierais pas 60% de plus pour un benchmark plus rond, voici donc l'analyse honnête de ce qui bouge réellement.

MesureThink Fast 2.0Think Fast 1.0Évolution
Coût par heure d'audio en entrée$4.80$3.00+60%
Indice speech-to-speech82.9%75.7%+7.2 pts
Performance agentique (τ-voice)56.5%52.1%+4.4 pts
Dynamique conversationnelle95.1%77.8%+17.3 pts
Raisonnement vocal97.2%97.1%stable
Temps jusqu'au premier audio0.70s1.25s44% plus rapide

Il faut lire cette colonne de changements comme une forme, pas comme un score. Le raisonnement vocal n'a pas bougé, donc si le travail de l'agent consiste à comprendre une phrase et à relire une réponse, on paie 60% de plus pour quelque chose qu'on ne remarquera pas. Ce qui a bougé, c'est la dynamique conversationnelle, en hausse de 17.3 points, c'est-à-dire la gestion des interruptions, le barge-in, le fait de savoir quand l'interlocuteur a fini de parler, et la latence, descendue à 0.70 seconde. Ce sont les deux choses qui font qu'un appel téléphonique ressemble à un vrai appel plutôt qu'à un kiosque.

La performance agentique a bougé de 4.4 points, à 56.5%. C'est le chiffre publié le plus élevé du tableau speech-to-speech d'Artificial Analysis, et cela reste un taux d'échec de 43.5% sur des scénarios agentiques difficiles, ce qui est le chiffre que je mettrais devant quiconque budgétise une automatisation complète. C'est aussi la raison pour laquelle le taux de résolution sur lequel on planifie devrait venir de son propre trafic, pas d'un classement.

Deux développeurs sur Hacker News sont arrivés à la même lecture par des voies opposées. L'un a noté le modèle au feeling :

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right."

Et sur le fil de discussion consacré à Think Fast 2.0, le commentaire le plus voté le situait par rapport au spécialiste établi :

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

Ce qui fait une bonne transition, car surpasser ElevenLabs en qualité est une question différente de le surpasser en prix, et à partir d'aujourd'hui ces deux réponses divergent.

Le tarif de Grok Voice face au reste du marché

Artificial Analysis publie le coût mesuré par heure d'audio en entrée pour toute la catégorie speech-to-speech, la seule colonne réellement comparable quand la moitié des fournisseurs facture au jeton et l'autre moitié à la minute.

ModèleIndice S2S$/h mesuréTemps jusqu'au premier audio
Qwen Audio 3.0 Realtime Plus84.1%$4.424.02s
Grok Voice Think Fast 2.082.9%$4.800.70s
GPT-Realtime-2.1 High79.1%$10.751.21s
GPT-Realtime-2 High77.2%$4.141.14s
Qwen Audio 3.0 Realtime Flash76.3%$4.774.16s
Grok Voice Think Fast 1.075.7%$3.001.25s
GPT-Realtime-2.1 Minimal72.5%$11.310.97s
Gemini 3.1 Flash High69.5%$1.752.99s
Deepslate Opal62.8%$6.480.44s

Quatre points de ce tableau valent plus que le classement lui-même.

Grok n'est ni le meilleur modèle bon marché, ni le meilleur modèle tout court. Le Qwen Audio 3.0 Realtime Plus d'Alibaba obtient un score plus élevé à 84.1% et mesure un coût plus bas à $4.42/h. Son problème se trouve dans la dernière colonne : 4.02 secondes jusqu'au premier audio, contre 0.70. Sur une ligne téléphonique, c'est un silence mort par-dessus lequel l'appelant va parler. L'argument réel de Grok, c'est la combinaison de l'indice et de la latence, et sur cette combinaison, il n'a pas d'égal dans le tableau.

Le tarif fixe est la fonctionnalité sous-estimée. Le $4.80 mesuré de Grok est identique à son prix affiché, parce que le prix affiché est lui-même fixe par minute. GPT-Realtime-2 d'OpenAI affiche $1.15 par heure d'audio en entrée et $4.61 par heure en sortie, et mesure $4.14 tout compris, donc le tarif d'entrée qu'on présenterait à un directeur financier ne représente qu'environ 28% de ce qu'on paie réellement. Cet écart n'est pas un piège, c'est simplement ce que produit une facturation audio au jeton, et c'est pourquoi les budgets GPT-Realtime tendent à être des estimations plutôt que des chiffres.

Baisser le raisonnement ne fait pas économiser de manière fiable. GPT-Realtime-2.1 Minimal mesure $11.31/h, plus que les $10.75 de la variante High, avec un score inférieur de 6.6 points. Si on pensait qu'un curseur d'effort plus bas était un levier de coût sur la voix, cette ligne est le contre-exemple.

La latence a son propre plancher de prix. Deepslate Opal est le plus rapide mesuré à 0.44s, coûte $6.48/h et obtient un score de 62.8%. La vitesse s'achète seule ; être rapide et intelligent en même temps, c'est ce pour quoi le tarif de Grok existe.

Il vaut la peine de noter ce que ce tableau ne contient pas : la couche plateforme. Les fournisseurs d'orchestration comme Retell AI facturent des frais de plateforme en plus du modèle vers lequel ils orientent, donc leur chiffre par minute et les nombres ci-dessus ne sont pas le même type de chiffre.

Vapi et Hume tarifient de la même manière. J'ai chiffré les deux dans le comparatif des entreprises de voix IA, et le schéma se confirme : un tarif de modèle et un tarif de plateforme sont des produits différents partageant les mêmes unités.

La comparaison avec ElevenLabs mérite son propre paragraphe, car c'est elle qui a basculé aujourd'hui. Ses forfaits d'agent sont des allocations de minutes prépayées : $6 pour 75 minutes, $22 pour 275, $99 pour 1 238, $299 pour 3 738, $990 pour 12 375. En divisant chacun d'eux, on arrive à presque exactement $0.08 par minute incluse sur tous les forfaits payants, ce qui correspond au centime près au nouveau tarif de Grok. Jusqu'à ce matin, Grok était moins cher de 37.5%. Ce qui reste, c'est une différence de forme de facturation plutôt que de prix : les minutes ElevenLabs sont prépayées et expirent, celles de Grok sont au paiement à l'usage, donc une ligne au volume irrégulier ou saisonnier reste avantagée avec Grok, tandis qu'une ligne qui tourne à plein régime tout le mois est désormais un coup de pile ou face. Chez Cartesia Sonic 3 et le reste des acteurs spécialisés, la même question de forme se pose.

Les limites qui coûtent plus cher que la grille tarifaire

Celles-ci m'importent plus que le tarif à la minute, car un tarif prévisible est plus facile à vivre qu'un plafond qu'on percute à 16h un jour de Black Friday.

Dix sessions simultanées par équipe. C'est le défaut publié sur la fiche du modèle, avec des limites plus élevées sur demande. Dix appels simultanés, c'est une file d'attente entrante réduite. Pour qui dimensionne une vraie ligne téléphonique, la demande de concurrence doit être faite avant la carte bancaire, pas après.

Session maximale de 120 minutes. Suffisant pour le support, bon à savoir si l'idée était d'avoir des assistants fonctionnant sur de longues durées.

Aucune remise sur volume ni palier prioritaire pour la voix. La remise de 20% sur les lots d'xAI ne s'applique qu'à certains modèles texte spécifiques, et le Priority Processing à 2x est limité à Chat Completions et Responses. La voix n'a ni voie à remise ni voie rapide payante, ce qui est cohérent avec un compteur temps réel fixe mais supprime deux leviers qu'on pourrait avoir côté texte.

Le stockage est facturé séparément si l'agent fait de la recherche. Les collections coûtent $0.10 par GiB et par jour, les fichiers $0.025, les téléchargements $0.20 par GiB. Négligeable sur une petite base de connaissances, mais mérite une ligne dans le modèle si on synchronise tout un centre d'aide pour le support multilingue.

Il existe des frais de $0.05 pour les requêtes bloquées. Si une requête de l'API Responses est détectée comme enfreignant les règles d'utilisation avant la génération, xAI facture $0.05. Ce n'est pas une ligne spécifique à la voix, mais c'est le genre de chose qui apparaît comme une erreur d'arrondi inexpliquée sur une grosse facture.

Une seule région. Speech to speech ne fonctionne que dans us-east-1, ce qui est un fait de latence et de résidence des données plutôt que de prix, même si cela devient une question de prix dès qu'un audit d'achat pose la question.

Où la question tarifaire atterrit vraiment

Voici la décision que je prendrais avec tous ces éléments sur la table.

Pour une ligne téléphonique entrante où les appelants interrompent, changent d'avis et attendent que l'agent fasse réellement quelque chose, le tarif de $0.08 est juste et le basculement d'alias est une augmentation qui vaut la peine d'être acceptée. La dynamique conversationnelle en hausse de 17.3 points et la latence de 0.70 seconde sont les deux choses que les appelants ressentent, et aucun autre modèle du tableau ne combine cela avec un indice de 82.9%.

Si l'agent vocal se contente de lire des statuts de commande, fixez grok-voice-think-fast-1.0 dès aujourd'hui et gardez le tarif de $0.05. Le raisonnement vocal était déjà à 97.1% sur 1.0. On ne laisse pas de qualité sur la table pour la charge de travail réellement en jeu, et à 10 000 minutes par mois, fixer la version vaut $300.

Pour qui n'a pas encore construit la ligne, le chiffre à modéliser n'est pas du tout le tarif à la minute. C'est le coût par incident résolu, et cela suppose de connaître la fraction d'appels qui se termine sans humain. C'est la même arithmétique que derrière tout dossier de ROI de centre d'appels, et cela vaut la peine de la mettre en regard de la base de référence coût IA versus agent humain avant de signer quoi que ce soit.

Un chiffre plus doux mérite aussi sa place dans ce modèle. Un agent plus rapide et moins facilement interrompu fait bouger le CSAT, et le CSAT est ce qui empêche une ligne automatisée bon marché de coûter des clients en silence. C'est le chiffre le plus difficile à prévoir et le plus facile à remarquer une fois qu'il baisse.

La facture vocale n'est que la petite moitié du problème

Je m'occupe du SEO d'eesel et je lis les notes commerciales, et les conversations tarifaires qui tournent mal ne tournent presque jamais mal à cause d'un tarif à la minute. Elles tournent mal à cause de l'unité.

Je l'ai entendu des deux extrémités de la courbe de volume. Une responsable des opérations dans une fintech de paiements et de transferts d'argent sur Zendesk, traitant entre 7 000 et 8 000 tickets escaladés par mois, m'a dit que la tarification par interaction était irrecevable face à une facturation par session, car avec environ quatre échanges par ticket, le compteur compte la conversation quatre fois. Un opérateur e-commerce multi-entreprises visant 150 000 tickets par mois projetait environ $30 000 par mois à vingt centimes le ticket et a passé la majeure partie d'un appel à essayer de déterminer si l'unité était une interaction ou un ticket. Aucun des deux cas n'était un débat sur le fait que le tarif soit trop élevé. Les deux étaient des débats sur ce que le tarif comptait réellement.

C'est le prisme que j'appliquerais à la grille tarifaire de Grok, et elle s'en sort bien. Un compteur audio fixe à la minute est l'unité la plus lisible de cette catégorie. C'est aussi, structurellement, une unité qui facture le temps plutôt que le résultat, ce qui est exactement la bonne unité pour un appel téléphonique et exactement la mauvaise pour une file de tickets.

Tableau de bord de rapports eesel AI montrant des analyses de résolution sur l'ensemble des canaux de helpdesk connectés
Tableau de bord de rapports eesel AI montrant des analyses de résolution sur l'ensemble des canaux de helpdesk connectés

En train de chiffrer une ligne Grok Voice ? L'autre moitié de cette feuille de calcul, c'est le volume d'e-mails et de chat qui ne fait jamais sonner le téléphone, et il ne se facture pas à la minute. eesel est un agent IA pour helpdesk qui facture par ticket réellement résolu, se connecte à Freshdesk ou Gorgias en quelques minutes, et s'entraîne sur vos anciens tickets plutôt que sur un crawl de site web.

Ce qui compte pour une prévision : il exécute une simulation de déviation sur l'historique réel de vos tickets avant de répondre à un client en direct, donc le taux de résolution que vous mettez dans la feuille de calcul est celui que vous avez mesuré sur votre propre file, pas celui emprunté à un classement. Essayez eesel gratuitement, ou consultez d'abord les tarifs, puisque c'est apparemment la page qui décide de tout.

Ce que je ferais avant que la facture n'arrive

Trois actions concrètes, dans l'ordre où je les prendrais.

  1. Faire un grep sur grok-voice-latest. S'il est présent dans le code de production, on est déjà sur le nouveau tarif à partir d'aujourd'hui. Décider si c'est ce qu'on veut, puis fixer une version dans un cas comme dans l'autre, car la documentation d'xAI elle-même recommande de fixer les versions en production, et c'est exactement pour cette raison.
  2. Reprévoir en intégrant les appels d'outils. Prendre les minutes du mois dernier, ajouter 15 à 20% pour les invocations d'outils et la téléphonie, et vérifier le chiffre par rapport au calculateur ci-dessus. La ligne audio n'est jamais la ligne complète.
  3. Demander l'augmentation de concurrence avant d'en avoir besoin. Dix sessions simultanées, c'est le défaut, pas le plafond. L'augmenter est une demande, et les demandes prennent plus de temps que les pics de trafic.

Rien de tout cela n'est une raison d'éviter le modèle. Think Fast 2.0 est le modèle vocal agentique le plus performant avec des chiffres publiés, et à $4.80 de l'heure mesurés, il coûte moins de la moitié du meilleur palier temps réel d'OpenAI. C'est juste une raison de savoir laquelle de ses chaînes de modèle est une cible mouvante, et ce qui arrive à la facture quand elle bouge. La même discipline s'applique à la gestion des escalades et à la prévention des mauvaises réponses : le réglage par défaut est rarement celui qu'on aurait choisi délibérément.

Pour le reste de ce cluster de contenus, l'aperçu de Think Fast 2.0 couvre ce qui a changé dans le modèle lui-même. L'article sur les tarifs du Voice Agent Builder couvre la plateforme no-code qui s'appuie dessus, et il existe un test pratique du Builder si le workflow intéresse plus que la grille tarifaire.

Encore en train de décider si la voix est bien le bon canal ? Commencez par l'IA peut-elle répondre aux appels de support, puis l'explication plus large sur les appels téléphoniques IA.

Si les appelants vous joignent déjà via un produit téléphonique de helpdesk comme Zendesk Talk, la question de construire versus acheter vient avant celle du tarif à la minute. Mon comparatif d'automatisation du support est le raccourci pour y répondre.

Questions fréquentes

Combien coûte Grok Voice Think Fast 2.0 par minute ?
Le tarif de Grok Voice Think Fast 2.0 est de $0.08 par minute d'audio, affiché comme $4.80 par heure, plus $0.004 pour chaque message texte en entrée envoyé. Les deux chiffres viennent directement de la page de tarifs xAI. Think Fast 1.0 reste publié à $0.05 par minute. Si les appels passent par un numéro de téléphone provisionné par xAI, $0.01 par minute s'ajoutent. Le panorama plus large des tarifs xAI couvre aussi les modèles texte présents sur la même facture.
Pourquoi le tarif de Grok Voice a-t-il augmenté de 60% ?
Ce n'est pas exactement une augmentation. xAI a ajouté un nouveau modèle plus performant à un tarif plus élevé et a laissé l'ancien publié à son ancien tarif. Think Fast 1.0 reste à $0.05 par minute et Think Fast 2.0 est affiché à $0.08. Ce qui donne l'impression d'une hausse, c'est que grok-voice-latest est passé de 1.0 à 2.0 le 5 août 2026, donc quiconque utilisait l'alias a récupéré le tarif plus élevé sans aucun déploiement de son côté. Fixer la version est la solution, et c'est la même discipline de version figée dont dépend la prévention des mauvaises réponses de l'IA.
Grok Voice Think Fast 2.0 est-il moins cher que l'API Realtime d'OpenAI ?
En coût mesuré, oui, et avec une marge importante. Artificial Analysis situe Think Fast 2.0 à $4.80 par heure d'audio en entrée contre $10.75 pour GPT-Realtime-2.1 High. La différence structurelle compte plus que l'écart : Grok publie un tarif fixe par minute alors qu'OpenAI facture par jeton audio, donc son coût réel varie selon la quantité de parole du modèle. Voir le détail de l'API Realtime d'OpenAI pour comprendre cette facturation.
Existe-t-il un forfait gratuit pour Grok Voice Think Fast 2.0 ?
Non. La grille tarifaire xAI liste des tarifs par minute, par message et par appel sans aucune allocation vocale gratuite. Chaque compte inclut toutefois un numéro de téléphone provisionné, et il est possible de tester un agent dans le navigateur avant d'y diriger du trafic réel. À titre de comparaison, ElevenLabs inclut 15 minutes d'agent gratuites par mois sur son forfait sans coût.
Combien facture réellement un vrai appel de support Grok Voice ?
Plus que le prix affiché. Un appel de six minutes sur un numéro provisionné avec deux recherches web, une consultation de collections et trois entrées texte revient à environ $0.5645, contre $0.48 pour l'audio seul. Les outils sont facturés par invocation : $5 pour 1 000 appels à web_search ou x_search, $2.50 pour 1 000 consultations de collections, $10 pour 1 000 recherches de pièces jointes. Il faut modéliser les appels d'outils, pas seulement les minutes, tout comme pour estimer le coût de l'automatisation d'un centre d'appels.
Comment le tarif de Grok Voice se compare-t-il à celui d'ElevenLabs Agents ?
À ce jour, ils sont à peu près à égalité sur le papier. Chaque forfait payant d'ElevenLabs Agents revient à presque exactement $0.08 par minute incluse, soit le nouveau tarif de Grok Voice Think Fast 2.0. La différence tient à la forme de facturation : ElevenLabs vend des forfaits mensuels prépayés en minutes, Grok fonctionne en pur paiement à l'usage, donc Grok l'emporte sur un volume irrégulier ou faible et ElevenLabs comble l'écart sur un volume élevé et constant. Mon comparatif des alternatives à ElevenLabs couvre le reste du terrain.
Quelles sont les limites de débit sur l'API Grok Voice ?
Dix sessions simultanées par équipe et une durée de session maximale de 120 minutes, selon la fiche du modèle speech-to-speech, avec des limites plus élevées disponibles sur demande. Ce plafond de concurrence est le chiffre que je vérifierais avant le tarif par minute, car dix appels simultanés représentent une file d'attente entrante réduite. Quiconque dimensionne une ligne téléphonique devrait lire cela en parallèle de l'automatisation du support téléphonique en général.
Grok Voice Think Fast 2.0 vaut-il les 3 centimes supplémentaires par minute ?
Pour un agent qui doit mener à bien des workflows, probablement oui. Think Fast 2.0 obtient 56.5% en performance agentique contre 52.1% pour 1.0, et répond en 0.70 seconde au lieu de 1.25. Pour une ligne simple qui se contente de lire une FAQ, 1.0 à $0.05 reste le meilleur choix. Dans tous les cas, le modèle vocal n'est que la moitié de la question de coût, car les tickets email et chat qui ne sont jamais devenus des appels ont toujours besoin de résolution automatisée de tickets et entrent dans le coût du service client IA.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration en ligne d'un agent de support avec un casque à côté du logo Grok, avec une forme d'onde vocale dans une bulle de dialogue
Trending

Grok Voice Think Fast 2.0 : ce qui change et le prix

Grok Voice Think Fast 2.0 obtient 82,9% sur l'indice speech-to-speech d'Artificial Analysis et répond en 0,70s. Il coûte aussi 60% de plus par minute, et l'alias par défaut y bascule le 5 août.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration de six plateformes d'agents vocaux IA comme alternatives au Grok Voice Agent Builder de xAI
Guides

6 alternatives à Grok Voice Agent Builder à essayer en 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow et Deepgram comparés au Grok Voice Agent Builder de xAI sur le prix, la latence et la conformité.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Illustration d'un agent vocal IA sans code répondant à un appel sur la stack Grok Voice de xAI
Guides

Grok Voice Agent Builder : premier regard sur l'IA vocale sans code de xAI

Un test concret du Grok Voice Agent Builder : la stack speech-to-speech, le tarif de 0,05 $/min, le flux de création en deux minutes, et à qui l'outil s'adresse vraiment.

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026
Une personne au téléphone face à trois options d'agent vocal différentes, avec le logo Grok à gauche
Alternatives

Les 10 meilleures alternatives à Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 vient de devenir 60% plus cher sur l'alias par défaut. Dix vraies alternatives, avec coût horaire mesuré et chiffres de benchmark honnêtes.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Illustration éditoriale avec le logo Grok, des barres de benchmarks et une étiquette de prix représentant un avis sur Grok 4.5
Trending

Avis sur Grok 4.5 : benchmarks, prix et verdict

Grok 4.5 de xAI a été lancé le 8 juillet avec une 4e place à l'Intelligence Index et le meilleur résultat d'utilisation agentique d'outils du classement. Voici l'avis complet, les benchmarks, les prix, et qui devrait vraiment l'utiliser.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Illustration d'un reçu et de cadrans tarifaires pour Grok Voice Agent Builder de xAI
Guides

Tarifs de Grok Voice Agent Builder : ce que ça coûte vraiment

Le détail complet des tarifs de Grok Voice Agent Builder : le tarif vocal de 0,05 $/min, les suppléments de téléphonie et d'appels d'outils, des exemples de coûts chiffrés, et comment il se compare à OpenAI et ElevenLabs.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 3, 2026
Deux personnes en conversation avec des formes d'onde vocales entre elles et le logo Grok au-dessus
AI

Grok Voice Think Fast 2.0 : rapide, précis, mais plafonné

Un test pratique de Grok Voice Think Fast 2.0 : la réalité des benchmarks, les particularités de l'API, et le plafond de 10 sessions qui décide si vous pouvez le déployer en production.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Bannière de l'avis sur Grok Voice Agent Builder, la plateforme d'agents vocaux IA sans code de xAI
Guides

Avis sur Grok Voice Agent Builder : l'IA vocale de xAI en vaut-elle la peine ?

Mon avis sur Grok Voice Agent Builder de xAI : une plateforme d'agents vocaux speech-to-speech sans code. L'architecture, les réserves sur les benchmarks, la tarification, et à qui cet outil s'adresse.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Illustration dessinée à la main de deux personnes examinant un graphique de répartition des prix avec des symboles dollar
Trending

Tarifs de Grok 4.5 : prix de l'API, coût de SuperGrok et frais cachés

Grok 4.5 coûte 2 $/6 $ par million de tokens sur l'API et 30-300 $/mois en forfait grand public. Voici le détail complet, les frais cachés et ce que cela signifie pour votre budget.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement