
La grille tarifaire officielle de Grok 4.6
Voici le tableau en direct des modèles texte tiré de la propre page de xAI, tous les modèles, les deux tranches de contexte, sans arrondi. Le pied de page date cela du 3 juillet 2026.
| Modèle | Contexte | Entrée | Cache | Sortie | Long : entrée / cache / sortie |
|---|---|---|---|---|---|
grok-4.6 | 500k | 2,00 $ | 0,50 $ | 6,00 $ | 4,00 $ / 1,00 $ / 12,00 $ |
grok-4.5 | 500k | 2,00 $ | 0,30 $ | 6,00 $ | 4,00 $ / 0,60 $ / 12,00 $ |
grok-build-0.1 | 256k | 1,00 $ | 0,20 $ | 2,00 $ | 2,00 $ / 0,40 $ / 4,00 $ |
grok-4.3 | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
grok-4.20-multi-agent-0309 | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
grok-4.20-0309-reasoning | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
grok-4.20-0309-non-reasoning | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
Trois points de ce tableau méritent qu'on s'y arrête.
Le seuil des 200k fait basculer toute la requête. La formulation de xAI est sans ambiguïté : les modèles avec une tarification contexte long facturent les tarifs longs « pour tous les tokens d'une requête » dès que le prompt atteint le seuil. Un prompt de 201 000 tokens ne paie pas 2x uniquement sur le dernier millier. Il paie 2x sur les 201 000 tokens complets. Dans une boucle agentique qui accumule des sorties d'outils tour après tour, franchir cette ligne au neuvième tour retarife l'ensemble du neuvième tour depuis son tout premier token.
Le modèle phare n'a pas la fenêtre de contexte la plus large vendue par xAI. grok-4.3 et toute la famille 4.20 embarquent 1M ; 4.6 embarque 500k au double du tarif de sortie. Si la tâche consiste en un seul document énorme traité en un seul appel, l'ancien modèle est à la fois plus spacieux et moins cher.
L'entrée mise en cache est la seule colonne où 4.6 est plus cher que 4.5, à 0,50 $ contre 0,30 $. Il vaut la peine d'être précis sur le sens : xAI n'a pas augmenté un prix en cours de route. Le tarif de cache de Grok 4.5 a baissé à 0,30 $ après son lancement, et 4.6 est sorti avec l'ancien chiffre. L'effet sur le tableau d'aujourd'hui reste le même dans les deux cas, et il frappe le plus durement les charges de travail qui renvoient un prompt fixe. Notre article sur les tarifs de Grok 4.5 présente l'ancienne grille si vous comparez les générations, et le guide des tarifs xAI couvre toute la gamme, y compris Grok Imagine et les modèles vocaux.
Ce que les gens paient vraiment
C'est la partie que la couverture du lancement n'a jamais, parce qu'elle nécessite du trafic réel plutôt qu'un communiqué de presse. OpenRouter publie à la fois le prix affiché et le prix réellement facturé à ses utilisateurs, agrégé sur du trafic réel.

| Endpoint | Entrée effective | Sortie effective | Affiché | Taux de succès du cache | Part de tokens |
|---|---|---|---|---|---|
| SpaceXAI | 0,7249 $ | 6,125 $ | 2 $ / 6 $ | 90,3 % | 64,5 % |
| SpaceXAI (ZDR) | 0,7812 $ | 6,116 $ | 2 $ / 6 $ | 88,0 % | 35,5 % |
| Moyenne pondérée | 0,7448 $ | 6,122 $ | 2 $ / 6 $ |
Lisez les deux colonnes séparément, car elles racontent des choses différentes.
En entrée, le prix réel représente environ un tiers du tarif affiché, et la raison tient entièrement à la mise en cache. Neuf tokens d'entrée sur dix dans le trafic réel de Grok 4.6 sont servis depuis le cache à 0,50 $ plutôt que calculés à 2,00 $. Ce n'est pas une remise que xAI met en avant ; c'est une propriété émergente de la façon dont le modèle est réellement utilisé, dans de longues conversations avec un préfixe stable.
En sortie, le tarif effectif est au-dessus du prix affiché. 6,122 $ contre 6,00 $ signifie qu'une part du trafic réel franchit les 200 000 tokens et paie le tarif contexte long de 12,00 $. Faible en agrégat, mais c'est une preuve directe que le précipice n'est pas théorique.
Le corollaire compte plus que l'un ou l'autre de ces chiffres : votre taux de succès de cache est le levier le plus important sur votre facture Grok 4.6, plus précieux que n'importe quel changement de modèle. Et ce n'est pas automatique comme on pourrait le supposer. La mise en cache se produit d'elle-même, mais la documentation de mise en cache des prompts de xAI recommande de configurer l'en-tête x-grok-conv-id spécifiquement « pour maximiser votre taux de succès de cache », car cela route les requêtes d'une conversation vers le même serveur. Sautez cet en-tête et vous pourriez payer 2,00 $ là où la moyenne de la flotte paie 0,72 $.
Les praticiens qui comparent les modèles ont remarqué la même asymétrie depuis l'autre côté :
"About the cost, Grok doesn't really cost less outright. Output token is cheaper, but their cache is not that cheap. Grok use less token than Sonnet tho."
Ce commentaire porte sur Grok 4.5, dont le tarif de cache est le moins cher, à 0,30 $. Sur 4.6, le constat s'aiguise au lieu de s'atténuer.
Les postes que personne ne budgétise
Les tarifs de tokens ne représentent qu'une ligne d'une facture bien plus longue. Voici tout le reste pour lequel xAI peut vous facturer sur la même page.

Les outils côté serveur sont facturés par appel, en plus des tokens.
| Outil | Tarif |
|---|---|
| Recherche web, recherche X, exécution de code | 5 $ / 1k appels |
| Recherche de pièces jointes | 10 $ / 1k appels |
| Recherche de collections (RAG) | 2,50 $ / 1k appels |
| Compréhension d'images, vidéo X, MCP distant | Basé sur les tokens, pas de frais d'appel |
| Génération d'images | Facturée aux tarifs de l'API Imagine |
Le poste à surveiller pour toute solution de recherche documentaire est la recherche de collections à 2,50 $ pour 1 000. C'est le compteur qui se déclenche quand votre agent interroge vos propres documents importés, c'est-à-dire tout le mécanisme derrière le RAG face à un LLM brut. Chaque réponse ancrée est un appel d'outil, et chaque appel d'outil a un prix qui n'a rien à voir avec le modèle.
Le stockage est encore un compteur à part. Le stockage de fichiers coûte 0,025 $ par GiB par jour, le stockage de collections 0,10 $ par GiB par jour, et les téléchargements 0,20 $ par GiB transféré. Une collection de connaissances de 50 GiB qui dort coûte 5 $ par jour, qu'on lui pose une question ou non.
Priority Processing applique un surcoût plat de 2x sur tout. Les tokens d'entrée, de sortie, mis en cache et de raisonnement doublent tous. Deux détails équitables que xAI publie et qui méritent d'être salués : les remises de cache s'appliquent avant le multiplicateur, et vous n'êtes facturé au tarif prioritaire que lorsque la réponse confirme "service_tier": "priority". Si la requête est servie au palier par défaut, vous payez les tarifs standard.
La remise par lot exclut le modèle phare. La remise de 20 % de l'API Batch couvre grok-4.3 et les trois variantes grok-4.20. Elle ne couvre pas 4.6, 4.5 ni grok-build-0.1. Ainsi, pour un travail par lots nocturne comme la classification de tickets ou le tri du backlog, grok-4.3, vieux d'un an, se retrouve à 1,00 $ en entrée et 2,00 $ en sortie après remise, soit la moitié du tarif du modèle phare. Le tableau tarifaire principal ne vous en donne aucun indice.
Une requête bloquée coûte quand même de l'argent. Les violations détectées avant la génération dans l'API Responses entraînent des frais de 0,05 $ par requête. Vous pouvez payer cinq centimes pour une sortie que vous n'avez jamais reçue.
Reconstituez votre propre facture
Le seul calcul des tokens sous-estimera ce que vous dépensez. Activez les outils et observez le ratio évoluer.
La porte par laquelle vous achetez change le prix
Le même modèle, cinq voies d'achat, et deux d'entre elles ne le vendent pas encore.

L'API xAI est le prix de référence : 2,00 $ / 0,50 $ / 6,00 $, à l'usage, sans aucun quota gratuit publié.
OpenRouter affiche exactement le même tarif de 2,00 $ / 6,00 $ / 0,50 $ en lecture cache, et indique clairement qu'elle répercute le prix du fournisseur « sans aucune marge ». Le coût se trouve ailleurs : des frais de 5,5 % à l'achat de crédits, avec un minimum de 0,80 $, 5 % en crypto, et les crédits inutilisés expirent au bout d'un an. Si vous apportez votre propre clé xAI, l'usage au-delà de l'allocation du plan est facturé 5 % de ce que la même requête aurait coûté. Elle gère aussi deux endpoints, standard et à rétention de données nulle, au même tarif mais avec une vitesse mesurée différente : 74 contre 80 tokens par seconde en médiane, une latence de 1,02 s contre 0,81 s, tous deux avec 100 % de disponibilité sur 30 jours.
SuperGrok à 30 $/mois est le palier grand public le moins cher qui mentionne Grok 4.6 comme avantage inclus, selon la page tarifaire de xAI. SuperGrok Plus coûte 100 $/mois. Free, SuperGrok Lite, SuperGrok Heavy, Business et Enterprise apparaissent tous dans le comparatif des plans, mais seuls Free, SuperGrok et SuperGrok Plus affichent un chiffre publié ; le reste est sur devis ou non listé.
Azure AI Foundry et AWS Bedrock accusent toujours une génération de retard. La page tarifaire Grok d'Azure plafonne à Grok-4.3 Global, à 1,25 $ en entrée et 2,50 $ en sortie. C'est moins cher par token, et cela date de deux versions. Si les achats imposent que l'inférence passe par un cloud unique, Grok 4.6 n'est pas encore achetable pour vous, à quelque prix que ce soit. C'est le même schéma que nous avons observé avec Grok Bot et le créateur d'agents vocaux Grok : xAI livre d'abord sur ses propres plateformes et laisse les revendeurs rattraper leur retard.
Grok 4.6 face aux autres modèles phares
| Modèle | Contexte | Entrée /1M | Cache /1M | Sortie /1M |
|---|---|---|---|---|
| Grok 4.6 | 500k | 2,00 $ | 0,50 $ | 6,00 $ |
| Claude Sonnet 5 | 1M | 2,00 $ | 0,20 $ | 10,00 $ |
| Claude Opus 5 | 1M | 5,00 $ | 0,50 $ | 25,00 $ |
| GPT-5.6 Sol | 1.05M | 5,00 $ | 0,50 $ | 30,00 $ |
| DeepSeek V4 Flash | 1M | 0,14 $ | 0,0028 $ | 0,28 $ |
En sortie, Grok 4.6 est l'option de niveau frontière la moins chère ici parmi celles qui ne sont pas à poids ouverts. 6,00 $ contre 10, 15, 25 et 30 $, ce n'est pas serré, et cela explique pourquoi le modèle apparaît d'abord dans les agents de codage : ces charges de travail consomment beaucoup de sortie et sont flexibles en contexte.
En passant à la colonne cache, le classement s'inverse. Sonnet 5 met en cache à 0,20 $ contre 0,50 $ pour Grok 4.6, dispose d'une fenêtre de 1M sans surcoût contexte long, et bénéficie d'une remise par lot que Grok 4.6 n'a pas. Pour une charge de travail qui renvoie un grand prompt fixe et ne renvoie que trois phrases, exactement ce que fait une file de support, le tarif de sortie moins cher pèse à peine.
Une note d'équité sur cette comparaison elle-même : l'entrée mise en cache n'est pas le même produit d'un fournisseur à l'autre. Anthropic et OpenAI facturent séparément l'écriture d'une entrée de cache, Google facture le stockage de cache à l'heure, et xAI publie un tarif de lecture sans frais d'écriture séparés sur la page. Comparer uniquement la colonne cache flatte les fournisseurs qui scindent les frais. Pour un panorama plus large, les alternatives à Grok 4.5 couvrent les voisins les plus proches, et Qwen3.8 Max couvre le segment à poids ouverts.
Ce que ça coûte réellement dans une file de support
En calculant avec les valeurs par défaut du widget, Grok 4.6 coûte environ 1,5 centime de tokens par conversation, plus un centime supplémentaire dès que la recherche documentaire et la recherche web sont activées. Avec 20 000 conversations par mois, cela représente quelques centaines de dollars.
Chiffrez maintenant le reste de la solution : l'intégration au helpdesk, les règles de tri, le seuil de confiance, les chemins d'escalade, la boucle de relecture, l'astreinte quand quelque chose tourne mal. Les tokens ne sont qu'une erreur d'arrondi face à tout cela.
C'est pourquoi je continue d'orienter les acheteurs vers le coût par résolution plutôt que vers le coût par million de tokens, et pourquoi mesurer le ROI du support est un exercice plus utile que d'optimiser une grille tarifaire.
Deux erreurs récurrentes que je constate lors des échanges sur les tarifs, dont aucune tableau de tokens ne vous avertira.
La première, c'est le volume, pas le tarif. Un acheteur testant notre propre produit a atteint 200 interactions en une seule journée d'évaluation et s'est immédiatement mis à projeter 9 000 par mois. Rien n'avait changé dans le prix. Ce qui avait changé, c'était son estimation de la fréquence d'utilisation réelle, toujours plus élevée que ce que disait le tableur.
La seconde, c'est la forme même du modèle tarifaire. Un utilisateur en essai a fait douze conversations de test, a vu l'agent bien performer, a ouvert la page de facturation et a demandé la résiliation sur-le-champ. Le produit fonctionnait. C'est la structure de la facture qui posait problème. C'est pourquoi je préférerais donner à un acheteur de support un chiffre par ticket résolu plutôt qu'un chiffre par million de tokens : personne ne peut prévoir sa propre consommation de tokens, et tout le monde peut compter ses tickets.
Et ce qu'un modèle moins cher ne résout jamais : l'ancrage dans votre propre contenu. La date de coupure des connaissances de Grok 4.6 signifie qu'il ne sait rien de votre politique de retour, de vos références produits ou de la panne de la semaine dernière. Cela vient de votre base de connaissances et des tickets passés, et c'est un coût de mise en œuvre quel que soit le modèle en dessous.
Il en va de même pour les tests adversariaux et pour la mesure du taux de résolution automatisée. Des postes bien réels, qu'aucune grille tarifaire ne contient.
eesel tarifie le résultat, pas les tokens
J'ai passé ces dernières années à construire la couche entre un modèle et un helpdesk, et ce que je dirais à quiconque lit un tableau de tokens en pensant à un projet de support, c'est que vous tarifez les 5 % les moins chers du travail.
eesel, c'est les 95 % restants. Il se connecte à Zendesk, Freshdesk et le reste en quelques minutes, apprend de votre centre d'aide, de vos macros et de vos tickets résolus pour sonner déjà comme votre équipe, et simule sur vos propres tickets historiques avant de répondre au moindre client réel. Vous voyez d'abord la précision sur vos données, comblez les lacunes qu'il révèle, relancez, puis passez en production.

La facturation fonctionne au résultat plutôt qu'au compteur : 40 centimes par ticket ou chat traité, selon notre page tarifaire, facturé à la conversation et non à la réponse, sans frais de siège et sans rien facturer pour les tickets que vos humains traitent eux-mêmes. Il y a 50 $ d'utilisation gratuite sans carte, vous pouvez d'abord router une partie du volume, et vous pouvez plafonner la dépense mensuelle. Pas d'en-tête de clé de cache à oublier, pas de précipice à 200k, pas de ligne séparée pour la recherche qui a produit la réponse. Nos pages sécurité et enterprise couvrent le volet conformité.
Si vous choisissez un modèle pour une file de support plutôt que pour un agent de codage, le meilleur agent IA pour ce travail est un meilleur point de départ que n'importe quelle grille tarifaire, et les logiciels de service client IA couvrent la couche plateforme au-dessus.
Les chiffres auxquels je soumettrais un déploiement sont la résolution automatisée des tickets et le taux de résolution, pas les dollars par million de tokens. Savoir si cela tient la route sur de vraies files, c'est ce à quoi sert notre page clients.
Essayez eesel gratuitement, lancez la simulation, et tarifez le résultat plutôt que les tokens.

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








