Tarifs de Grok Voice Think Fast 2.0 : ce que coûtent vraiment $0.08/min

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Illustration au trait d'un développeur et d'un agent de support qui parlent à travers des ondes vocales, à côté du logo Grok

La grille tarifaire complète de Grok Voice, telle que publiée aujourd'hui

Voici tout ce qui figure dans la section API vocale de la grille tarifaire de xAI, plus la ligne de téléphonie qui se trouve à la place dans l'annonce du Voice Agent Builder. J'ai aussi inclus les tarifs autonomes de transcription et de synthèse, car de nombreuses équipes font encore tourner un pipeline assemblé et veulent comparer les deux approches.

PosteTarif
Voix à voix, grok-voice-think-fast-2.0$0.08 / min ($4.80 / h)
Voix à voix, grok-voice-think-fast-1.0$0.05 / min ($3.00 / h)
Entrée texte, par conversation.item.create$0.004 / message
Numéro de téléphone fourni (téléphonie)+$0.01 / min
Voix à texte, REST$0.10 / h
Voix à texte, streaming$0.20 / h
Texte à voix$15.00 / 1M caractères
web_search ou x_search$5 / 1k appels
collections_search / file_search$2.50 / 1k appels
attachment_search$10 / 1k appels
code_execution$5 / 1k appels
Stockage des collections$0.10 / GiB / jour

Deux choses dans ce tableau valent d'être dites clairement, car ce sont les points que les gens comprennent mal en établissant leur budget.

Le compteur audio est décrit sur la fiche du modèle comme facturant par minute d'audio « envoyé ou reçu », ce qui donne l'impression qu'il pourrait compter deux fois une conversation bidirectionnelle. Cela ne semble pas être le cas. Artificial Analysis a mesuré le coût par heure d'audio en entrée à exactement $4.80 pour ce modèle, soit $0.08 multiplié par soixante, donc dans leur test le compteur s'est comporté comme un simple décompte de durée de session plutôt qu'une somme des deux directions. Je surveillerais quand même la première facture plutôt que de me fier uniquement à ma parole.

Le compteur d'entrée texte est également plus restreint qu'il n'y paraît. xAI facture $0.004 par événement conversation.item.create envoyé, mais les éléments function_call_output ne sont pas facturés, et response.create n'est pas du tout un événement facturable. Un agent bavard qui utilise beaucoup d'outils n'accumule donc pas de frais d'entrée texte pour chaque résultat d'outil qu'il retourne, ce qui était l'hypothèse de départ que j'avais et qui s'est révélée fausse.

Le basculement du 5 août, en dollars

C'est la seule raison pour laquelle cet article existe aujourd'hui plutôt que la semaine dernière.

Deux cartes tarifaires montrant l'alias grok-voice-latest passant de grok-voice-think-fast-1.0 à $0.05 par minute à grok-voice-think-fast-2.0 à $0.08 par minute le 5 août 2026, une hausse de 60%
Deux cartes tarifaires montrant l'alias grok-voice-latest passant de grok-voice-think-fast-1.0 à $0.05 par minute à grok-voice-think-fast-2.0 à $0.08 par minute le 5 août 2026, une hausse de 60%

La note de lancement de xAI elle-même est directe à ce sujet : le 5 août 2026, grok-voice-latest passe de grok-voice-think-fast-1.0 à grok-voice-think-fast-2.0, aucune action nécessaire pour la mise à niveau, et pour rester sur l'ancien modèle, il faut fixer grok-voice-think-fast-1.0 avant cette date. Ce que la note ne fait pas, c'est mettre un pourcentage à côté, et ce pourcentage est de 60% par minute.

La documentation est actuellement en plein basculement, ce que j'ai trouvé discrètement amusant. Le tableau des modèles dans le guide voix à voix décrit encore l'alias comme pointant vers 1.0 et se mettant à jour le 5 août, tandis qu'un paragraphe plus bas sur la même page dit déjà qu'il « pointe toujours vers le modèle le plus récent (actuellement grok-voice-think-fast-2.0) ». Les deux étaient vraies à des jours différents. Ni l'une ni l'autre ne vous dit ce que cela fait à votre facture.

Juste à côté de tout cela, dans le même article de lancement, se trouve la phrase par laquelle xAI ouvre sa section tarifaire : « Nous pensons que les tarifs doivent être prévisibles et transparents. » Je trouve en réalité que c'est défendable ici. Ils ont laissé 1.0 publié à son ancien tarif, donné un avis daté et documenté l'option de retrait. C'est plus d'avertissement que ce que reçoivent la plupart des changements de tarifs de modèles. Ce n'est simplement pas la même chose que votre facture soit prévisible, car le chemin par défaut a changé, et c'est là que vit la majeure partie du trafic de production.

Ce que le prix affiché ne montre pas

Chaque grille tarifaire vocale de cette catégorie a le même indice révélateur : le chiffre principal est la seule chose sur la facture qui n'est pas une surprise. Voici un seul appel de support de six minutes, chiffré ligne par ligne.

Reçu dessiné à la main détaillant un appel Grok Voice de six minutes en audio, numéro de téléphone, recherches web, consultation de collections et entrées texte, totalisant $0.5645 contre un prix affiché de $0.48
Reçu dessiné à la main détaillant un appel Grok Voice de six minutes en audio, numéro de téléphone, recherches web, consultation de collections et entrées texte, totalisant $0.5645 contre un prix affiché de $0.48
  • Audio : 6 min x $0.08 = $0.48
  • Numéro de téléphone fourni : 6 min x $0.01 = $0.06
  • Deux recherches web : 2 x $0.005 = $0.01
  • Une consultation de collections : 1 x $0.0025 = $0.0025
  • Trois entrées texte : 3 x $0.004 = $0.012

Cela fait $0.5645 contre un prix affiché de $0.48, soit environ 18% de plus. Pas catastrophique, et honnêtement l'un des meilleurs ratios de cette catégorie, car les tarifs d'outils de xAI sont bon marché et son tarif vocal est fixe. Mais cela évolue de manière linéaire, et 18% sur une facture vocale mensuelle de $3,200 représentent $576 que personne n'avait mis dans la prévision.

La ligne que je modéliserais le plus soigneusement est web_search. À $5 pour 1,000 appels, cela ressemble à un arrondi, jusqu'à ce qu'on se rappelle qu'un modèle agentique décide lui-même du nombre d'outils à appeler. xAI le dit clairement sur la page tarifaire : les coûts évoluent avec la complexité de la requête parce que c'est l'agent qui choisit. L'effort de raisonnement est par défaut réglé sur "high" sur ce modèle, et bien que les jetons de raisonnement ne soient pas mesurés séparément sur le compteur vocal, un modèle qui réfléchit davantage est un modèle qui sollicite davantage d'outils.

Ce que les trois cents supplémentaires apportent réellement

Je ne paierais pas 60% de plus pour un benchmark plus rond, voici donc une lecture honnête de ce qui bouge vraiment.

MesureThink Fast 2.0Think Fast 1.0Évolution
Coût par heure d'audio en entrée$4.80$3.00+60%
Indice voix à voix82.9%75.7%+7.2 pts
Performance agentique (τ-voice)56.5%52.1%+4.4 pts
Dynamique conversationnelle95.1%77.8%+17.3 pts
Raisonnement vocal97.2%97.1%stable
Temps jusqu'au premier audio0.70s1.25s44% plus rapide

Lisez cette colonne d'évolutions comme une forme, pas comme un score. Le raisonnement vocal n'a pas bougé, donc si le travail de votre agent consiste à comprendre une phrase et à relire une réponse, vous payez 60% de plus pour quelque chose que vous ne remarquerez pas. Ce qui a bougé, c'est la dynamique conversationnelle, en hausse de 17.3 points, c'est-à-dire la gestion des interruptions, le barge-in, le fait de savoir quand l'appelant a fini de parler, et la latence, tombée à 0.70 seconde. Ce sont les deux choses qui font qu'un appel téléphonique ressemble à un appel téléphonique plutôt qu'à un kiosque.

La performance agentique a bougé de 4.4 points, à 56.5%. C'est le chiffre le plus élevé publié dans le tableau voix à voix d'Artificial Analysis, et cela reste un taux d'échec de 43.5% sur des scénarios agentiques difficiles, le chiffre que je mettrais devant quiconque budgétise une automatisation complète. C'est aussi la raison pour laquelle le taux de résolution sur lequel vous vous basez pour planifier devrait venir de votre propre trafic, pas d'un classement.

Deux développeurs sur Hacker News sont arrivés à la même conclusion par des chemins opposés. L'un a évalué le modèle au ressenti :

Hacker News

"Grok Voice est le meilleur assistant vocal IA, et ce n'est même pas serré. Le compromis vitesse + intelligence est tout simplement le bon."

Et sur le fil de discussion de Think Fast 2.0 lui-même, le commentaire le plus voté l'a présenté face au spécialiste en place :

Hacker News

"Je ne sais pas pourquoi cet article n'est pas plus populaire, c'est un modèle vocal de pointe (SOTA), qui bat des laboratoires spécialisés comme ElevenLabs"

Ce qui constitue une bonne transition, car battre ElevenLabs sur la qualité est une question différente de le battre sur le prix, et à ce jour ces deux réponses divergent.

Les tarifs de Grok Voice face au reste du marché

Artificial Analysis publie le coût mesuré par heure d'audio en entrée pour toute la catégorie voix à voix, la seule colonne vraiment comparable quand la moitié des fournisseurs facture par jeton et l'autre moitié par minute.

ModèleIndice S2S$/h mesuréTemps jusqu'au premier audio
Qwen Audio 3.0 Realtime Plus84.1%$4.424.02s
Grok Voice Think Fast 2.082.9%$4.800.70s
GPT-Realtime-2.1 High79.1%$10.751.21s
GPT-Realtime-2 High77.2%$4.141.14s
Qwen Audio 3.0 Realtime Flash76.3%$4.774.16s
Grok Voice Think Fast 1.075.7%$3.001.25s
GPT-Realtime-2.1 Minimal72.5%$11.310.97s
Gemini 3.1 Flash High69.5%$1.752.99s
Deepslate Opal62.8%$6.480.44s

Quatre choses dans ce tableau comptent plus que le classement.

Grok n'est ni le meilleur modèle bon marché, ni le meilleur modèle tout court. Le Qwen Audio 3.0 Realtime Plus d'Alibaba obtient un score plus élevé à 84.1% et se mesure moins cher à $4.42/h. Son problème se trouve dans la dernière colonne : 4.02 secondes avant le premier audio, contre 0.70. Sur une ligne téléphonique, c'est un silence mort que l'appelant va couvrir en parlant. La véritable force de Grok est la combinaison de l'indice et de la latence, et sur cette combinaison il n'a pas d'égal dans le tableau.

Le tarif fixe est la fonctionnalité sous-estimée. Les $4.80 mesurés de Grok sont identiques à son prix catalogue, car le prix catalogue est fixe par minute. Le GPT-Realtime-2 d'OpenAI affiche $1.15 par heure d'audio en entrée et $4.61 par heure en sortie, et se mesure à $4.14 tout compris, donc le tarif d'entrée que vous citeriez à un directeur financier ne représente qu'environ 28% de ce que vous payez réellement. Cet écart n'est pas un piège, c'est simplement ce que produit une facturation audio par jeton, et c'est pourquoi les budgets GPT-Realtime tendent à être des estimations plutôt que des chiffres.

Baisser le raisonnement ne fait pas systématiquement économiser de l'argent. GPT-Realtime-2.1 Minimal se mesure à $11.31/h, plus que les $10.75 de la variante High, tout en obtenant un score 6.6 points plus bas. Si vous pensiez qu'un niveau d'effort plus bas était un levier de coût sur la voix, cette ligne est le contre-exemple.

La latence a son propre plancher de prix. Deepslate Opal est la chose la plus rapide mesurée à 0.44s et coûte $6.48/h pour un score de 62.8%. La rapidité s'achète toute seule ; rapidité et intelligence ensemble, c'est ce pour quoi le tarif Grok existe.

Il convient de noter ce que ce tableau ne contient pas : la couche plateforme. Les fournisseurs d'orchestration comme Retell AI facturent des frais de plateforme en plus de quel que soit le modèle vers lequel ils acheminent, donc leur chiffre par minute et les chiffres ci-dessus ne sont pas le même type de chiffre.

Vapi et Hume tarifent de la même manière. J'ai chiffré les deux dans le comparatif des entreprises de voix IA, et le schéma se confirme : un tarif de modèle et un tarif de plateforme sont des produits différents portant les mêmes unités.

La comparaison avec ElevenLabs mérite son propre paragraphe car c'est celle qui a basculé aujourd'hui. Ses forfaits d'agent sont des allocations de minutes prépayées : $6 pour 75 minutes, $22 pour 275, $99 pour 1,238, $299 pour 3,738, $990 pour 12,375. Divisez n'importe lequel d'entre eux et vous arrivez à presque exactement $0.08 par minute incluse sur chaque forfait payant, ce qui est le nouveau tarif de Grok, au centime près. Jusqu'à ce matin, Grok était 37.5% moins cher que cela. Ce qui reste, c'est une différence de structure de facturation plutôt que de prix : les minutes ElevenLabs sont prépayées et expirent, celles de Grok sont en paiement à l'usage, donc une ligne à volume irrégulier ou saisonnier reste avantagée avec Grok, et une ligne qui tourne à plein régime tout le mois est désormais un coup de pile ou face. Sur Cartesia Sonic 3 et le reste du marché spécialisé, la même question de structure s'applique.

Les limites qui coûtent plus que la grille tarifaire

Je me soucie de ces éléments plus que du chiffre par minute, car un tarif que l'on peut prévoir est plus facile à vivre qu'un plafond que l'on atteint à 16h le jour du Black Friday.

Dix sessions simultanées par équipe. C'est la limite par défaut publiée sur la fiche du modèle, avec des limites plus élevées sur demande. Dix appels simultanés représentent une petite file d'attente entrante. Si vous dimensionnez une véritable ligne téléphonique, la demande de concurrence doit être faite avant la carte de crédit, pas après.

Session maximale de 120 minutes. Suffisant pour le support, mais bon à savoir si vous aviez des idées d'assistants de longue durée.

Aucune remise par lot et aucun niveau prioritaire sur la voix. La remise par lot de 20% de xAI s'applique uniquement à certains modèles texte, et le Traitement Prioritaire à 2x est limité à Chat Completions et Responses. La voix n'a ni voie de remise ni voie rapide payante, ce qui est cohérent avec un compteur temps réel fixe, mais supprime deux leviers que vous pourriez avoir côté texte.

Le stockage est facturé séparément si votre agent fait de la recherche documentaire. Les collections coûtent $0.10 par GiB et par jour, les fichiers $0.025, les téléchargements $0.20 par GiB. Faible sur une petite base de connaissances, mais mérite une ligne dans le modèle si vous synchronisez tout un centre d'aide pour le support multilingue.

Il existe des frais de $0.05 pour les requêtes bloquées. Si une requête vers la Responses API est détectée en violation des règles d'utilisation avant la génération, xAI facture $0.05. Ce n'est pas une ligne spécifique à la voix, mais c'est le genre de chose qui apparaît comme une erreur d'arrondi inexpliquée sur une grosse facture.

Une seule région. La voix à voix ne fonctionne que dans us-east-1, ce qui est un fait de latence et de résidence des données plutôt qu'un prix, même si cela devient un prix au moment où un audit d'achats s'y intéresse.

Où la question tarifaire se pose vraiment

Voici la décision que je prendrais avec tout cela sur la table.

Si vous exploitez une ligne téléphonique entrante où les appelants interrompent, changent d'avis et attendent que l'agent fasse réellement quelque chose, le tarif de $0.08 est juste et le basculement d'alias est une hausse qui vaut la peine d'être acceptée. La dynamique conversationnelle en hausse de 17.3 points et la latence de 0.70 seconde sont les deux choses que les appelants ressentent, et aucun autre modèle du tableau ne les associe à un indice de 82.9%.

Si votre agent vocal se contente de lire des statuts de commande, fixez dès aujourd'hui grok-voice-think-fast-1.0 et conservez le tarif de $0.05. Le raisonnement vocal était déjà à 97.1% sur 1.0. Vous ne perdez aucune qualité pour la charge de travail que vous avez réellement, et à 10,000 minutes par mois, fixer la version vaut $300.

Si vous n'avez pas encore construit la ligne, le chiffre à modéliser n'est pas du tout le prix par minute. C'est le coût par problème résolu, ce qui signifie savoir quelle fraction des appels se termine sans humain. C'est la même arithmétique qui sous-tend tout dossier de ROI de centre d'appels, et cela vaut la peine de la mettre en regard de la référence de coût IA contre agent humain avant de signer quoi que ce soit.

Un chiffre plus subjectif appartient aussi à ce modèle. Un agent plus rapide et moins interruptible fait bouger le CSAT, et le CSAT est ce qui empêche une ligne automatisée bon marché de vous coûter des clients en silence. C'est la ligne la plus difficile à prévoir et la plus facile à remarquer une fois qu'elle dérape.

La facture vocale est la petite moitié du problème

Je construis le SEO d'eesel et je lis les notes commerciales, et les conversations sur les tarifs qui tournent mal ne tournent presque jamais mal à cause d'un tarif par minute. Elles tournent mal à cause de l'unité.

Je l'ai entendu des deux extrémités de la courbe de volume. Un responsable des opérations d'une fintech de paiements et de transferts d'argent sur Zendesk, gérant 7,000 à 8,000 tickets escaladés par mois, m'a dit que la tarification par interaction était inenvisageable face à la facturation par session, car avec environ quatre échanges par ticket, le compteur compte la conversation quatre fois. Un opérateur e-commerce multi-entreprises visant 150,000 tickets par mois a projeté environ $30,000 par mois à 20 cents par ticket et a passé la majeure partie d'un appel à essayer de déterminer si l'unité était une interaction ou un ticket. Aucun des deux ne discutait de savoir si le tarif était trop élevé. Tous les deux discutaient de ce que le tarif comptait réellement.

C'est la grille de lecture que j'appliquerais à la tarification de Grok, et elle en sort plutôt bien. Un compteur audio fixe par minute est l'unité la plus lisible de cette catégorie. C'est aussi, structurellement, une unité qui vous facture du temps plutôt que des résultats, ce qui est exactement la bonne unité pour un appel téléphonique et exactement la mauvaise pour une file de tickets.

Tableau de bord de rapports eesel AI montrant les analyses de résolution sur les canaux de support connectés
Tableau de bord de rapports eesel AI montrant les analyses de résolution sur les canaux de support connectés

Vous chiffrez une ligne Grok Voice ? L'autre moitié de ce tableau est le volume d'e-mails et de chat qui ne fait jamais sonner le téléphone, et qui n'est pas tarifé par minute. eesel est un agent de support IA qui facture par ticket réellement résolu, se connecte à Freshdesk ou Gorgias en quelques minutes, et s'entraîne sur vos tickets passés plutôt que sur un crawl de site web.

La partie qui compte pour une prévision : il exécute une simulation de déflexion sur votre historique réel de tickets avant de répondre à un client réel, donc le taux de résolution que vous mettez dans le tableau est celui que vous avez mesuré sur votre propre file, pas celui que vous avez emprunté à un classement. Essayez eesel gratuitement, ou consultez d'abord les tarifs, puisque c'est apparemment la page qui décide de tout.

Ce que je ferais avant l'arrivée de la facture

Trois actions concrètes, dans l'ordre où je les ferais.

  1. Faites un grep sur grok-voice-latest. S'il est dans le code de production, vous êtes sur le nouveau tarif dès aujourd'hui. Décidez si c'est ce que vous voulez, puis fixez une version dans tous les cas, car la documentation de xAI recommande elle-même de fixer les versions en production, et c'est exactement pour cette raison.
  2. Refaites la prévision en incluant les appels d'outils dans le modèle. Prenez les minutes du mois dernier, ajoutez 15% à 20% pour les invocations d'outils et la téléphonie, et vérifiez le chiffre par rapport au calculateur ci-dessus. La ligne audio n'est jamais la ligne entière.
  3. Demandez l'augmentation de concurrence avant d'en avoir besoin. Dix sessions simultanées, c'est le défaut, pas le plafond. L'augmenter est une demande, et les demandes prennent plus de temps que les pics de trafic.

Rien de tout cela n'est une raison d'éviter le modèle. Think Fast 2.0 est le modèle vocal agentique le plus performant avec des chiffres publiés, et à $4.80 de l'heure mesuré, il coûte moins de la moitié du meilleur niveau temps réel d'OpenAI. C'est seulement une raison de savoir laquelle de vos chaînes de modèle est une cible mouvante, et ce que cela fait à votre facture quand elle bouge. La même discipline s'applique à la gestion des escalades et à la prévention des mauvaises réponses : le défaut est rarement le réglage que vous auriez choisi délibérément.

Pour le reste de ce cluster, l'aperçu de Think Fast 2.0 couvre ce qui a changé dans le modèle lui-même. L'article sur les tarifs du Voice Agent Builder couvre la plateforme no-code qui s'appuie dessus, et il existe une revue pratique du Builder si vous préférez le workflow à la grille tarifaire.

Encore en train de décider si la voix est même le bon canal ? Commencez par l'IA peut-elle répondre aux appels de support, puis par l'explication plus large sur les appels téléphoniques par IA.

Si vos appelants vous joignent déjà via un produit téléphonique de support comme Zendesk Talk, la question construire-versus-acheter vient avant celle du prix par minute. Mon comparatif de l'automatisation du support est le raccourci pour y répondre.

Questions fréquentes

Combien coûte Grok Voice Think Fast 2.0 par minute ?
Les tarifs de Grok Voice Think Fast 2.0 sont de $0.08 par minute audio, indiqués comme $4.80 par heure, plus $0.004 pour chaque message texte en entrée envoyé. Les deux chiffres viennent directement de la page tarifs de xAI. Think Fast 1.0 est toujours publié à $0.05 par minute. Si vous acheminez les appels via un numéro de téléphone fourni par xAI, ajoutez $0.01 par minute en plus. Le tableau plus large des tarifs xAI couvre les modèles texte sur la même facture.
Pourquoi les tarifs de Grok Voice ont-ils augmenté de 60% ?
Pas exactement. xAI a ajouté un nouveau modèle plus performant à un tarif plus élevé et a laissé l'ancien publié à son ancien tarif. Think Fast 1.0 reste à $0.05 par minute et Think Fast 2.0 est listé à $0.08. Ce qui donne l'impression d'une hausse, c'est que grok-voice-latest est passé de 1.0 à 2.0 le 5 août 2026, donc toute personne utilisant l'alias a hérité du tarif plus élevé sans aucun déploiement de son côté. Fixer la version est la solution, et c'est la même discipline de fixation de version dont dépend la prévention des mauvaises réponses IA.
Grok Voice Think Fast 2.0 est-il moins cher que l'API Realtime d'OpenAI ?
En coût mesuré, oui, et avec une large marge. Artificial Analysis situe Think Fast 2.0 à $4.80 par heure d'audio en entrée contre $10.75 pour GPT-Realtime-2.1 High. La différence structurelle compte plus que l'écart : Grok publie un tarif fixe par minute tandis qu'OpenAI facture par jeton audio, donc son coût réel évolue selon la quantité de parole du modèle. Voir le détail de l'API Realtime d'OpenAI pour comprendre comment fonctionne cette facturation.
Existe-t-il un niveau gratuit pour Grok Voice Think Fast 2.0 ?
Non. La grille tarifaire de xAI liste des tarifs par minute, par message et par appel sans aucune allocation vocale gratuite. Chaque compte reçoit néanmoins un numéro de téléphone fourni inclus, et vous pouvez tester un agent dans le navigateur avant d'y diriger du trafic réel. À titre de comparaison, ElevenLabs inclut 15 minutes d'agent gratuites par mois sur son plan gratuit.
Que facture réellement un vrai appel de support Grok Voice ?
Plus que le prix affiché. Un appel de six minutes sur un numéro fourni avec deux recherches web, une consultation de collections et trois entrées texte revient à environ $0.5645, contre un chiffre audio seul de $0.48. Les outils sont facturés par invocation : $5 pour 1,000 appels à web_search ou x_search, $2.50 pour 1,000 consultations de collections, $10 pour 1,000 recherches de pièces jointes. Modélisez les appels d'outils, pas seulement les minutes, de la même manière que vous le feriez pour calculer le coût de l'automatisation d'un centre d'appels.
Comment les tarifs de Grok Voice se comparent-ils à ElevenLabs Agents ?
À ce jour, ils sont à égalité sur le papier. Chaque forfait payant d'ElevenLabs Agents revient à presque exactement $0.08 par minute incluse, ce qui est le nouveau tarif de Grok Voice Think Fast 2.0. La différence réside dans la structure de facturation : ElevenLabs vend des forfaits mensuels de minutes prépayées, Grok fonctionne en paiement à l'usage pur, donc Grok l'emporte sur un volume irrégulier ou faible et ElevenLabs comble l'écart sur un volume élevé et constant. Mon comparatif des alternatives à ElevenLabs couvre le reste du terrain.
Quelles sont les limites de débit sur l'API Grok Voice ?
Dix sessions simultanées par équipe et une durée maximale de session de 120 minutes, selon la fiche du modèle speech-to-speech, avec des limites plus élevées disponibles sur demande. Ce plafond de concurrence est le chiffre que je vérifierais avant le tarif par minute, car dix appels simultanés représentent une petite file d'attente entrante. Quiconque dimensionne une ligne téléphonique devrait lire cela en parallèle de l'automatisation du support téléphonique en général.
Grok Voice Think Fast 2.0 vaut-il les 3 cents supplémentaires par minute ?
Pour un agent qui doit accomplir des workflows, probablement. Think Fast 2.0 obtient 56.5% en performance agentique contre 52.1% pour 1.0, et répond en 0.70 seconde au lieu de 1.25. Pour une ligne simple qui se contente de lire une FAQ, 1.0 à $0.05 reste le meilleur choix. Dans tous les cas, le modèle vocal n'est que la moitié de la question du coût, puisque les tickets email et chat qui ne sont jamais devenus des appels ont toujours besoin de résolution automatisée des tickets et relèvent du coût du service client par IA.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration au trait d'un développeur et d'un agent de support discutant à travers des ondes vocales, à côté du logo Grok
Trending

Tarifs Grok Voice Think Fast 2.0 : ce que $0.08/min coûte

Grok Voice Think Fast 2.0 coûte $0.08 par minute d'audio, soit 60% de plus que 1.0. L'alias grok-voice-latest bascule dessus aujourd'hui, voici donc le vrai calcul par appel.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration en ligne d'un agent de support avec un casque à côté du logo Grok, avec une forme d'onde vocale dans une bulle de dialogue
Trending

Grok Voice Think Fast 2.0 : ce qui change et le prix

Grok Voice Think Fast 2.0 obtient 82,9% sur l'indice speech-to-speech d'Artificial Analysis et répond en 0,70s. Il coûte aussi 60% de plus par minute, et l'alias par défaut y bascule le 5 août.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration d'un coéquipier IA à un ordinateur portable examiné par deux collègues tenant une liste de contrôle et une loupe, avec le logo Grok à gauche
Trending

Avis Grok Bot : ce qui fonctionne vraiment dans la bêta précoce

Grok Bot donne à chaque coéquipier IA un ordinateur dans le cloud et de vrais identifiants de connexion. J'ai passé en revue chaque page de la documentation et la première semaine de retours utilisateurs pour voir ce qui fonctionne réellement.

Rama Adi NugrahaRama Adi NugrahaAug 13, 2026
Illustration d'un coéquipier IA travaillant à un bureau aux côtés de deux collègues, avec des icônes d'outils au-dessus et le logo Grok à gauche
Trending

Grok Bot expliqué : ce que font vraiment les coéquipiers IA toujours actifs de xAI

Grok Bot donne à chaque coéquipier IA son propre ordinateur cloud et le connecte à vos outils réels. Voici comment ça marche, ce que ça coûte, et où le concept se fissure.

Alicia Kirana UtomoAlicia Kirana UtomoAug 12, 2026
Illustration dessinée à la main de trois personnes comparant des fiches de notation de modèles à côté d'une balance pesant le coût contre une liste de contrôle
Trending

Alternatives à Grok 4.6 : 7 modèles comparés selon la forme de la facture

Grok 4.6 est affiché à 2 $/6 $, et double chaque tarif dès qu'une requête dépasse 200k tokens. J'ai vérifié ce que sept alternatives facturent réellement, et lesquelles suppriment cette falaise plutôt que de la déplacer.

Alicia Kirana UtomoAlicia Kirana UtomoAug 13, 2026
Illustration de deux personnes examinant une pile de couches de coûts, sièges en haut et consommation de tokens en bas, avec le logo Grok à gauche
Trending

Tarifs de Grok Bot 2026 : le forfait à 200 $ et le compteur sans plafond

Grok Bot est vendu à 200 $ par mois ou 120 $ par siège, mais le prix affiché n'est que le droit d'entrée. La documentation indique qu'il n'y a pas encore de plafond de dépense, et le compteur tourne à la semaine.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
Illustration dessinée à la main avec le logo de Grok et une fiche d'évaluation montrant des notes en étoiles mitigées selon les catégories
Trending

Avis Grok 4.6 : ce que dit le tableau d'évaluation quand on lit les lignes perdantes

Grok 4.6 égale GPT-5.6 Sol pour un tiers du prix, et perd nettement deux benchmarks. J'ai lu le tableau d'évaluation de xAI ligne par ligne, puis vérifié le chiffre que le billet de lancement a omis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 13, 2026
Illustration de six plateformes d'agents vocaux IA comme alternatives au Grok Voice Agent Builder de xAI
Guides

6 alternatives à Grok Voice Agent Builder à essayer en 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow et Deepgram comparés au Grok Voice Agent Builder de xAI sur le prix, la latence et la conformité.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Illustration d'un agent vocal IA sans code répondant à un appel sur la stack Grok Voice de xAI
Guides

Grok Voice Agent Builder : premier regard sur l'IA vocale sans code de xAI

Un test concret du Grok Voice Agent Builder : la stack speech-to-speech, le tarif de 0,05 $/min, le flux de création en deux minutes, et à qui l'outil s'adresse vraiment.

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement