
La grille tarifaire complète de Grok Voice, telle que publiée aujourd'hui
Voici tout ce qui figure dans la section API vocale de la grille tarifaire de xAI, plus la ligne de téléphonie qui se trouve à la place dans l'annonce du Voice Agent Builder. J'ai aussi inclus les tarifs autonomes de transcription et de synthèse, car de nombreuses équipes font encore tourner un pipeline assemblé et veulent comparer les deux approches.
| Poste | Tarif |
|---|---|
Voix à voix, grok-voice-think-fast-2.0 | $0.08 / min ($4.80 / h) |
Voix à voix, grok-voice-think-fast-1.0 | $0.05 / min ($3.00 / h) |
Entrée texte, par conversation.item.create | $0.004 / message |
| Numéro de téléphone fourni (téléphonie) | +$0.01 / min |
| Voix à texte, REST | $0.10 / h |
| Voix à texte, streaming | $0.20 / h |
| Texte à voix | $15.00 / 1M caractères |
web_search ou x_search | $5 / 1k appels |
collections_search / file_search | $2.50 / 1k appels |
attachment_search | $10 / 1k appels |
code_execution | $5 / 1k appels |
| Stockage des collections | $0.10 / GiB / jour |
Deux choses dans ce tableau valent d'être dites clairement, car ce sont les points que les gens comprennent mal en établissant leur budget.
Le compteur audio est décrit sur la fiche du modèle comme facturant par minute d'audio « envoyé ou reçu », ce qui donne l'impression qu'il pourrait compter deux fois une conversation bidirectionnelle. Cela ne semble pas être le cas. Artificial Analysis a mesuré le coût par heure d'audio en entrée à exactement $4.80 pour ce modèle, soit $0.08 multiplié par soixante, donc dans leur test le compteur s'est comporté comme un simple décompte de durée de session plutôt qu'une somme des deux directions. Je surveillerais quand même la première facture plutôt que de me fier uniquement à ma parole.
Le compteur d'entrée texte est également plus restreint qu'il n'y paraît. xAI facture $0.004 par événement conversation.item.create envoyé, mais les éléments function_call_output ne sont pas facturés, et response.create n'est pas du tout un événement facturable. Un agent bavard qui utilise beaucoup d'outils n'accumule donc pas de frais d'entrée texte pour chaque résultat d'outil qu'il retourne, ce qui était l'hypothèse de départ que j'avais et qui s'est révélée fausse.
Le basculement du 5 août, en dollars
C'est la seule raison pour laquelle cet article existe aujourd'hui plutôt que la semaine dernière.

La note de lancement de xAI elle-même est directe à ce sujet : le 5 août 2026, grok-voice-latest passe de grok-voice-think-fast-1.0 à grok-voice-think-fast-2.0, aucune action nécessaire pour la mise à niveau, et pour rester sur l'ancien modèle, il faut fixer grok-voice-think-fast-1.0 avant cette date. Ce que la note ne fait pas, c'est mettre un pourcentage à côté, et ce pourcentage est de 60% par minute.
La documentation est actuellement en plein basculement, ce que j'ai trouvé discrètement amusant. Le tableau des modèles dans le guide voix à voix décrit encore l'alias comme pointant vers 1.0 et se mettant à jour le 5 août, tandis qu'un paragraphe plus bas sur la même page dit déjà qu'il « pointe toujours vers le modèle le plus récent (actuellement grok-voice-think-fast-2.0) ». Les deux étaient vraies à des jours différents. Ni l'une ni l'autre ne vous dit ce que cela fait à votre facture.
Juste à côté de tout cela, dans le même article de lancement, se trouve la phrase par laquelle xAI ouvre sa section tarifaire : « Nous pensons que les tarifs doivent être prévisibles et transparents. » Je trouve en réalité que c'est défendable ici. Ils ont laissé 1.0 publié à son ancien tarif, donné un avis daté et documenté l'option de retrait. C'est plus d'avertissement que ce que reçoivent la plupart des changements de tarifs de modèles. Ce n'est simplement pas la même chose que votre facture soit prévisible, car le chemin par défaut a changé, et c'est là que vit la majeure partie du trafic de production.
Ce que le prix affiché ne montre pas
Chaque grille tarifaire vocale de cette catégorie a le même indice révélateur : le chiffre principal est la seule chose sur la facture qui n'est pas une surprise. Voici un seul appel de support de six minutes, chiffré ligne par ligne.

- Audio : 6 min x $0.08 = $0.48
- Numéro de téléphone fourni : 6 min x $0.01 = $0.06
- Deux recherches web : 2 x $0.005 = $0.01
- Une consultation de collections : 1 x $0.0025 = $0.0025
- Trois entrées texte : 3 x $0.004 = $0.012
Cela fait $0.5645 contre un prix affiché de $0.48, soit environ 18% de plus. Pas catastrophique, et honnêtement l'un des meilleurs ratios de cette catégorie, car les tarifs d'outils de xAI sont bon marché et son tarif vocal est fixe. Mais cela évolue de manière linéaire, et 18% sur une facture vocale mensuelle de $3,200 représentent $576 que personne n'avait mis dans la prévision.
La ligne que je modéliserais le plus soigneusement est web_search. À $5 pour 1,000 appels, cela ressemble à un arrondi, jusqu'à ce qu'on se rappelle qu'un modèle agentique décide lui-même du nombre d'outils à appeler. xAI le dit clairement sur la page tarifaire : les coûts évoluent avec la complexité de la requête parce que c'est l'agent qui choisit. L'effort de raisonnement est par défaut réglé sur "high" sur ce modèle, et bien que les jetons de raisonnement ne soient pas mesurés séparément sur le compteur vocal, un modèle qui réfléchit davantage est un modèle qui sollicite davantage d'outils.
Ce que les trois cents supplémentaires apportent réellement
Je ne paierais pas 60% de plus pour un benchmark plus rond, voici donc une lecture honnête de ce qui bouge vraiment.
| Mesure | Think Fast 2.0 | Think Fast 1.0 | Évolution |
|---|---|---|---|
| Coût par heure d'audio en entrée | $4.80 | $3.00 | +60% |
| Indice voix à voix | 82.9% | 75.7% | +7.2 pts |
| Performance agentique (τ-voice) | 56.5% | 52.1% | +4.4 pts |
| Dynamique conversationnelle | 95.1% | 77.8% | +17.3 pts |
| Raisonnement vocal | 97.2% | 97.1% | stable |
| Temps jusqu'au premier audio | 0.70s | 1.25s | 44% plus rapide |
Lisez cette colonne d'évolutions comme une forme, pas comme un score. Le raisonnement vocal n'a pas bougé, donc si le travail de votre agent consiste à comprendre une phrase et à relire une réponse, vous payez 60% de plus pour quelque chose que vous ne remarquerez pas. Ce qui a bougé, c'est la dynamique conversationnelle, en hausse de 17.3 points, c'est-à-dire la gestion des interruptions, le barge-in, le fait de savoir quand l'appelant a fini de parler, et la latence, tombée à 0.70 seconde. Ce sont les deux choses qui font qu'un appel téléphonique ressemble à un appel téléphonique plutôt qu'à un kiosque.
La performance agentique a bougé de 4.4 points, à 56.5%. C'est le chiffre le plus élevé publié dans le tableau voix à voix d'Artificial Analysis, et cela reste un taux d'échec de 43.5% sur des scénarios agentiques difficiles, le chiffre que je mettrais devant quiconque budgétise une automatisation complète. C'est aussi la raison pour laquelle le taux de résolution sur lequel vous vous basez pour planifier devrait venir de votre propre trafic, pas d'un classement.
Deux développeurs sur Hacker News sont arrivés à la même conclusion par des chemins opposés. L'un a évalué le modèle au ressenti :
"Grok Voice est le meilleur assistant vocal IA, et ce n'est même pas serré. Le compromis vitesse + intelligence est tout simplement le bon."
Et sur le fil de discussion de Think Fast 2.0 lui-même, le commentaire le plus voté l'a présenté face au spécialiste en place :
"Je ne sais pas pourquoi cet article n'est pas plus populaire, c'est un modèle vocal de pointe (SOTA), qui bat des laboratoires spécialisés comme ElevenLabs"
Ce qui constitue une bonne transition, car battre ElevenLabs sur la qualité est une question différente de le battre sur le prix, et à ce jour ces deux réponses divergent.
Les tarifs de Grok Voice face au reste du marché
Artificial Analysis publie le coût mesuré par heure d'audio en entrée pour toute la catégorie voix à voix, la seule colonne vraiment comparable quand la moitié des fournisseurs facture par jeton et l'autre moitié par minute.
| Modèle | Indice S2S | $/h mesuré | Temps jusqu'au premier audio |
|---|---|---|---|
| Qwen Audio 3.0 Realtime Plus | 84.1% | $4.42 | 4.02s |
| Grok Voice Think Fast 2.0 | 82.9% | $4.80 | 0.70s |
| GPT-Realtime-2.1 High | 79.1% | $10.75 | 1.21s |
| GPT-Realtime-2 High | 77.2% | $4.14 | 1.14s |
| Qwen Audio 3.0 Realtime Flash | 76.3% | $4.77 | 4.16s |
| Grok Voice Think Fast 1.0 | 75.7% | $3.00 | 1.25s |
| GPT-Realtime-2.1 Minimal | 72.5% | $11.31 | 0.97s |
| Gemini 3.1 Flash High | 69.5% | $1.75 | 2.99s |
| Deepslate Opal | 62.8% | $6.48 | 0.44s |
Quatre choses dans ce tableau comptent plus que le classement.
Grok n'est ni le meilleur modèle bon marché, ni le meilleur modèle tout court. Le Qwen Audio 3.0 Realtime Plus d'Alibaba obtient un score plus élevé à 84.1% et se mesure moins cher à $4.42/h. Son problème se trouve dans la dernière colonne : 4.02 secondes avant le premier audio, contre 0.70. Sur une ligne téléphonique, c'est un silence mort que l'appelant va couvrir en parlant. La véritable force de Grok est la combinaison de l'indice et de la latence, et sur cette combinaison il n'a pas d'égal dans le tableau.
Le tarif fixe est la fonctionnalité sous-estimée. Les $4.80 mesurés de Grok sont identiques à son prix catalogue, car le prix catalogue est fixe par minute. Le GPT-Realtime-2 d'OpenAI affiche $1.15 par heure d'audio en entrée et $4.61 par heure en sortie, et se mesure à $4.14 tout compris, donc le tarif d'entrée que vous citeriez à un directeur financier ne représente qu'environ 28% de ce que vous payez réellement. Cet écart n'est pas un piège, c'est simplement ce que produit une facturation audio par jeton, et c'est pourquoi les budgets GPT-Realtime tendent à être des estimations plutôt que des chiffres.
Baisser le raisonnement ne fait pas systématiquement économiser de l'argent. GPT-Realtime-2.1 Minimal se mesure à $11.31/h, plus que les $10.75 de la variante High, tout en obtenant un score 6.6 points plus bas. Si vous pensiez qu'un niveau d'effort plus bas était un levier de coût sur la voix, cette ligne est le contre-exemple.
La latence a son propre plancher de prix. Deepslate Opal est la chose la plus rapide mesurée à 0.44s et coûte $6.48/h pour un score de 62.8%. La rapidité s'achète toute seule ; rapidité et intelligence ensemble, c'est ce pour quoi le tarif Grok existe.
Il convient de noter ce que ce tableau ne contient pas : la couche plateforme. Les fournisseurs d'orchestration comme Retell AI facturent des frais de plateforme en plus de quel que soit le modèle vers lequel ils acheminent, donc leur chiffre par minute et les chiffres ci-dessus ne sont pas le même type de chiffre.
Vapi et Hume tarifent de la même manière. J'ai chiffré les deux dans le comparatif des entreprises de voix IA, et le schéma se confirme : un tarif de modèle et un tarif de plateforme sont des produits différents portant les mêmes unités.
La comparaison avec ElevenLabs mérite son propre paragraphe car c'est celle qui a basculé aujourd'hui. Ses forfaits d'agent sont des allocations de minutes prépayées : $6 pour 75 minutes, $22 pour 275, $99 pour 1,238, $299 pour 3,738, $990 pour 12,375. Divisez n'importe lequel d'entre eux et vous arrivez à presque exactement $0.08 par minute incluse sur chaque forfait payant, ce qui est le nouveau tarif de Grok, au centime près. Jusqu'à ce matin, Grok était 37.5% moins cher que cela. Ce qui reste, c'est une différence de structure de facturation plutôt que de prix : les minutes ElevenLabs sont prépayées et expirent, celles de Grok sont en paiement à l'usage, donc une ligne à volume irrégulier ou saisonnier reste avantagée avec Grok, et une ligne qui tourne à plein régime tout le mois est désormais un coup de pile ou face. Sur Cartesia Sonic 3 et le reste du marché spécialisé, la même question de structure s'applique.
Les limites qui coûtent plus que la grille tarifaire
Je me soucie de ces éléments plus que du chiffre par minute, car un tarif que l'on peut prévoir est plus facile à vivre qu'un plafond que l'on atteint à 16h le jour du Black Friday.
Dix sessions simultanées par équipe. C'est la limite par défaut publiée sur la fiche du modèle, avec des limites plus élevées sur demande. Dix appels simultanés représentent une petite file d'attente entrante. Si vous dimensionnez une véritable ligne téléphonique, la demande de concurrence doit être faite avant la carte de crédit, pas après.
Session maximale de 120 minutes. Suffisant pour le support, mais bon à savoir si vous aviez des idées d'assistants de longue durée.
Aucune remise par lot et aucun niveau prioritaire sur la voix. La remise par lot de 20% de xAI s'applique uniquement à certains modèles texte, et le Traitement Prioritaire à 2x est limité à Chat Completions et Responses. La voix n'a ni voie de remise ni voie rapide payante, ce qui est cohérent avec un compteur temps réel fixe, mais supprime deux leviers que vous pourriez avoir côté texte.
Le stockage est facturé séparément si votre agent fait de la recherche documentaire. Les collections coûtent $0.10 par GiB et par jour, les fichiers $0.025, les téléchargements $0.20 par GiB. Faible sur une petite base de connaissances, mais mérite une ligne dans le modèle si vous synchronisez tout un centre d'aide pour le support multilingue.
Il existe des frais de $0.05 pour les requêtes bloquées. Si une requête vers la Responses API est détectée en violation des règles d'utilisation avant la génération, xAI facture $0.05. Ce n'est pas une ligne spécifique à la voix, mais c'est le genre de chose qui apparaît comme une erreur d'arrondi inexpliquée sur une grosse facture.
Une seule région. La voix à voix ne fonctionne que dans us-east-1, ce qui est un fait de latence et de résidence des données plutôt qu'un prix, même si cela devient un prix au moment où un audit d'achats s'y intéresse.
Où la question tarifaire se pose vraiment
Voici la décision que je prendrais avec tout cela sur la table.
Si vous exploitez une ligne téléphonique entrante où les appelants interrompent, changent d'avis et attendent que l'agent fasse réellement quelque chose, le tarif de $0.08 est juste et le basculement d'alias est une hausse qui vaut la peine d'être acceptée. La dynamique conversationnelle en hausse de 17.3 points et la latence de 0.70 seconde sont les deux choses que les appelants ressentent, et aucun autre modèle du tableau ne les associe à un indice de 82.9%.
Si votre agent vocal se contente de lire des statuts de commande, fixez dès aujourd'hui grok-voice-think-fast-1.0 et conservez le tarif de $0.05. Le raisonnement vocal était déjà à 97.1% sur 1.0. Vous ne perdez aucune qualité pour la charge de travail que vous avez réellement, et à 10,000 minutes par mois, fixer la version vaut $300.
Si vous n'avez pas encore construit la ligne, le chiffre à modéliser n'est pas du tout le prix par minute. C'est le coût par problème résolu, ce qui signifie savoir quelle fraction des appels se termine sans humain. C'est la même arithmétique qui sous-tend tout dossier de ROI de centre d'appels, et cela vaut la peine de la mettre en regard de la référence de coût IA contre agent humain avant de signer quoi que ce soit.
Un chiffre plus subjectif appartient aussi à ce modèle. Un agent plus rapide et moins interruptible fait bouger le CSAT, et le CSAT est ce qui empêche une ligne automatisée bon marché de vous coûter des clients en silence. C'est la ligne la plus difficile à prévoir et la plus facile à remarquer une fois qu'elle dérape.
La facture vocale est la petite moitié du problème
Je construis le SEO d'eesel et je lis les notes commerciales, et les conversations sur les tarifs qui tournent mal ne tournent presque jamais mal à cause d'un tarif par minute. Elles tournent mal à cause de l'unité.
Je l'ai entendu des deux extrémités de la courbe de volume. Un responsable des opérations d'une fintech de paiements et de transferts d'argent sur Zendesk, gérant 7,000 à 8,000 tickets escaladés par mois, m'a dit que la tarification par interaction était inenvisageable face à la facturation par session, car avec environ quatre échanges par ticket, le compteur compte la conversation quatre fois. Un opérateur e-commerce multi-entreprises visant 150,000 tickets par mois a projeté environ $30,000 par mois à 20 cents par ticket et a passé la majeure partie d'un appel à essayer de déterminer si l'unité était une interaction ou un ticket. Aucun des deux ne discutait de savoir si le tarif était trop élevé. Tous les deux discutaient de ce que le tarif comptait réellement.
C'est la grille de lecture que j'appliquerais à la tarification de Grok, et elle en sort plutôt bien. Un compteur audio fixe par minute est l'unité la plus lisible de cette catégorie. C'est aussi, structurellement, une unité qui vous facture du temps plutôt que des résultats, ce qui est exactement la bonne unité pour un appel téléphonique et exactement la mauvaise pour une file de tickets.

Vous chiffrez une ligne Grok Voice ? L'autre moitié de ce tableau est le volume d'e-mails et de chat qui ne fait jamais sonner le téléphone, et qui n'est pas tarifé par minute. eesel est un agent de support IA qui facture par ticket réellement résolu, se connecte à Freshdesk ou Gorgias en quelques minutes, et s'entraîne sur vos tickets passés plutôt que sur un crawl de site web.
La partie qui compte pour une prévision : il exécute une simulation de déflexion sur votre historique réel de tickets avant de répondre à un client réel, donc le taux de résolution que vous mettez dans le tableau est celui que vous avez mesuré sur votre propre file, pas celui que vous avez emprunté à un classement. Essayez eesel gratuitement, ou consultez d'abord les tarifs, puisque c'est apparemment la page qui décide de tout.
Ce que je ferais avant l'arrivée de la facture
Trois actions concrètes, dans l'ordre où je les ferais.
- Faites un grep sur
grok-voice-latest. S'il est dans le code de production, vous êtes sur le nouveau tarif dès aujourd'hui. Décidez si c'est ce que vous voulez, puis fixez une version dans tous les cas, car la documentation de xAI recommande elle-même de fixer les versions en production, et c'est exactement pour cette raison. - Refaites la prévision en incluant les appels d'outils dans le modèle. Prenez les minutes du mois dernier, ajoutez 15% à 20% pour les invocations d'outils et la téléphonie, et vérifiez le chiffre par rapport au calculateur ci-dessus. La ligne audio n'est jamais la ligne entière.
- Demandez l'augmentation de concurrence avant d'en avoir besoin. Dix sessions simultanées, c'est le défaut, pas le plafond. L'augmenter est une demande, et les demandes prennent plus de temps que les pics de trafic.
Rien de tout cela n'est une raison d'éviter le modèle. Think Fast 2.0 est le modèle vocal agentique le plus performant avec des chiffres publiés, et à $4.80 de l'heure mesuré, il coûte moins de la moitié du meilleur niveau temps réel d'OpenAI. C'est seulement une raison de savoir laquelle de vos chaînes de modèle est une cible mouvante, et ce que cela fait à votre facture quand elle bouge. La même discipline s'applique à la gestion des escalades et à la prévention des mauvaises réponses : le défaut est rarement le réglage que vous auriez choisi délibérément.
Pour le reste de ce cluster, l'aperçu de Think Fast 2.0 couvre ce qui a changé dans le modèle lui-même. L'article sur les tarifs du Voice Agent Builder couvre la plateforme no-code qui s'appuie dessus, et il existe une revue pratique du Builder si vous préférez le workflow à la grille tarifaire.
Encore en train de décider si la voix est même le bon canal ? Commencez par l'IA peut-elle répondre aux appels de support, puis par l'explication plus large sur les appels téléphoniques par IA.
Si vos appelants vous joignent déjà via un produit téléphonique de support comme Zendesk Talk, la question construire-versus-acheter vient avant celle du prix par minute. Mon comparatif de l'automatisation du support est le raccourci pour y répondre.
Questions fréquentes
Combien coûte Grok Voice Think Fast 2.0 par minute ?
Pourquoi les tarifs de Grok Voice ont-ils augmenté de 60% ?
grok-voice-latest est passé de 1.0 à 2.0 le 5 août 2026, donc toute personne utilisant l'alias a hérité du tarif plus élevé sans aucun déploiement de son côté. Fixer la version est la solution, et c'est la même discipline de fixation de version dont dépend la prévention des mauvaises réponses IA.Grok Voice Think Fast 2.0 est-il moins cher que l'API Realtime d'OpenAI ?
Existe-t-il un niveau gratuit pour Grok Voice Think Fast 2.0 ?
Que facture réellement un vrai appel de support Grok Voice ?
web_search ou x_search, $2.50 pour 1,000 consultations de collections, $10 pour 1,000 recherches de pièces jointes. Modélisez les appels d'outils, pas seulement les minutes, de la même manière que vous le feriez pour calculer le coût de l'automatisation d'un centre d'appels.Quelles sont les limites de débit sur l'API Grok Voice ?
Grok Voice Think Fast 2.0 vaut-il les 3 cents supplémentaires par minute ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.









Comment les tarifs de Grok Voice se comparent-ils à ElevenLabs Agents ?