
La tarjeta de precios oficial de Grok 4.6
Aquí está la tabla en vivo de modelos de texto de la propia página de xAI, cada modelo, ambas bandas de contexto, sin redondear. El pie de página fecha esto el 3 de julio de 2026.
| Modelo | Contexto | Entrada | En caché | Salida | Largo: entrada / caché / salida |
|---|---|---|---|---|---|
grok-4.6 | 500k | 2,00 $ | 0,50 $ | 6,00 $ | 4,00 $ / 1,00 $ / 12,00 $ |
grok-4.5 | 500k | 2,00 $ | 0,30 $ | 6,00 $ | 4,00 $ / 0,60 $ / 12,00 $ |
grok-build-0.1 | 256k | 1,00 $ | 0,20 $ | 2,00 $ | 2,00 $ / 0,40 $ / 4,00 $ |
grok-4.3 | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
grok-4.20-multi-agent-0309 | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
grok-4.20-0309-reasoning | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
grok-4.20-0309-non-reasoning | 1M | 1,25 $ | 0,20 $ | 2,50 $ | 2,50 $ / 0,40 $ / 5,00 $ |
Hay tres cosas de esta tabla que merece la pena detenerse a mirar.
El umbral de 200k es un cambio para toda la solicitud. La redacción de xAI es inequívoca: los modelos con precios de contexto largo facturan las tarifas largas "para todos los tokens de una solicitud" una vez que el prompt alcanza el umbral. Un prompt de 201.000 tokens no paga 2x solo en el último millar. Paga 2x en los 201.000 completos. En un bucle agéntico que acumula salida de herramientas turno tras turno, cruzar esa línea en el turno nueve vuelve a tarificar el turno nueve completo desde su primer token.
El buque insignia no tiene la ventana de contexto más amplia que vende xAI. grok-4.3 y toda la familia 4.20 llevan 1M; 4.6 lleva 500k al doble de tarifa de salida. Si el trabajo es un único documento enorme en una sola llamada, el modelo más antiguo es a la vez más amplio y más barato.
La entrada en caché es la única columna donde 4.6 es más cara que 4.5, con 0,50 $ frente a 0,30 $. Vale la pena ser preciso sobre la dirección: xAI no subió un precio en pleno vuelo. La tarifa de caché de Grok 4.5 bajó a 0,30 $ tras su lanzamiento, y 4.6 se lanzó con la cifra anterior. El efecto en la tabla de hoy es el mismo de cualquier forma, y golpea con más fuerza a las cargas de trabajo que reenvían un prompt fijo. Nuestra entrada de precios de Grok 4.5 tiene la escala anterior si estás comparando generaciones, y la guía de precios de xAI cubre toda la gama, incluyendo Grok Imagine y los modelos de voz.
Lo que la gente paga de verdad
Esta es la parte que la cobertura del lanzamiento nunca tiene, porque necesita tráfico real en lugar de un comunicado de prensa. OpenRouter publica tanto el precio de lista como el precio que realmente se cobra a sus usuarios, agregado en el tráfico real.

| Endpoint | Efectivo entrada | Efectivo salida | Lista | Tasa de aciertos de caché | Cuota de tokens |
|---|---|---|---|---|---|
| SpaceXAI | 0,7249 $ | 6,125 $ | 2 $ / 6 $ | 90,3 % | 64,5 % |
| SpaceXAI (ZDR) | 0,7812 $ | 6,116 $ | 2 $ / 6 $ | 88,0 % | 35,5 % |
| Promedio ponderado | 0,7448 $ | 6,122 $ | 2 $ / 6 $ |
Lee las dos columnas por separado, porque cuentan cosas distintas.
En la entrada, el precio real es aproximadamente un tercio del de lista, y la razón entera es el almacenamiento en caché. Nueve de cada diez tokens de entrada en el tráfico real de Grok 4.6 se sirven desde caché a 0,50 $ en lugar de calcularse a 2,00 $. Eso no es un descuento que anuncie xAI; es una propiedad emergente de cómo se usa realmente el modelo, en conversaciones largas con un prefijo estable.
En la salida, la tarifa efectiva está por encima de la de lista. 6,122 $ frente a 6,00 $ significa que una porción del tráfico real cruza los 200.000 tokens y paga la tarifa de contexto largo de 12,00 $. Pequeño en conjunto, pero es evidencia directa de que el precipicio no es teórico.
El corolario importa más que cualquiera de los dos números: tu tasa de aciertos de caché es la palanca más importante en tu factura de Grok 4.6, más valiosa que cualquier cambio de modelo. Y no es automático como la gente supone. El almacenamiento en caché ocurre por sí solo, pero la documentación de caché de prompts de xAI recomienda configurar la cabecera x-grok-conv-id específicamente "para maximizar tu tasa de aciertos de caché", porque enruta las solicitudes de una conversación al mismo servidor. Sáltate esa cabecera y podrías estar pagando 2,00 $ donde el promedio de la flota paga 0,72 $.
Los profesionales que comparan modelos han notado la misma asimetría desde el otro lado:
"About the cost, Grok doesn't really cost less outright. Output token is cheaper, but their cache is not that cheap. Grok use less token than Sonnet tho."
Ese comentario es sobre Grok 4.5, cuya tarifa de caché es la más barata, a 0,30 $. En 4.6 el punto se agudiza en lugar de suavizarse.
Las partidas que nadie presupuesta
Las tarifas de tokens son una línea de una factura mucho más larga. Aquí está todo lo demás por lo que xAI puede cobrarte en la misma página.

Las herramientas en el servidor se facturan por invocación, además de los tokens.
| Herramienta | Tarifa |
|---|---|
| Búsqueda web, búsqueda en X, ejecución de código | 5 $ / 1k llamadas |
| Búsqueda de archivos adjuntos | 10 $ / 1k llamadas |
| Búsqueda de colecciones (RAG) | 2,50 $ / 1k llamadas |
| Comprensión de imágenes, vídeo de X, MCP remoto | Basado en tokens, sin coste por invocación |
| Generación de imágenes | Facturado a las tarifas de la API de Imagine |
La partida a vigilar en cualquier implementación de recuperación es la búsqueda de colecciones a 2,50 $ por cada 1.000. Ese es el medidor que se activa cuando tu agente consulta tus propios documentos subidos, que es todo el mecanismo detrás de RAG frente a un LLM en bruto. Cada respuesta fundamentada es una llamada a una herramienta, y cada llamada a una herramienta tiene un precio que no tiene nada que ver con el modelo.
El almacenamiento es otro medidor aparte. El almacenamiento de archivos cuesta 0,025 $ por GiB al día, el almacenamiento de colecciones 0,10 $ por GiB al día, y las descargas 0,20 $ por GiB transferido. Una colección de conocimiento de 50 GiB inactiva cuesta 5 $ al día, se le haga o no una pregunta.
Priority Processing es un recargo plano del 2x en todo. Los tokens de entrada, salida, en caché y de razonamiento se duplican todos. Dos detalles justos que xAI publica y merecen crédito: los descuentos de caché se aplican antes del multiplicador, y solo se te cobra a la tarifa prioritaria cuando la respuesta confirma "service_tier": "priority". Si la solicitud se sirve en el nivel predeterminado, pagas las tarifas estándar.
El descuento por lotes excluye al buque insignia. El descuento del 20 % de la API de lotes cubre grok-4.3 y las tres variantes de grok-4.20. No cubre 4.6, 4.5 ni grok-build-0.1. Así que para trabajo por lotes nocturno como la clasificación de tickets o el triaje de backlog, el grok-4.3 de hace un año queda en 1,00 $ de entrada y 2,00 $ de salida tras el descuento, la mitad de la tarifa del buque insignia. La tabla principal de precios no da ninguna pista de eso.
Una solicitud bloqueada sigue costando dinero. Las infracciones detectadas antes de la generación en la API de Responses conllevan una tarifa de 0,05 $ por solicitud. Puedes pagar cinco centavos por una salida que nunca recibiste.
Arma tu propia factura
Solo las matemáticas de tokens subestimarán lo que gastas. Activa las herramientas y observa cómo se mueve la proporción.
La puerta por la que compras cambia el precio
El mismo modelo, cinco vías de compra, y dos de ellas todavía no lo venden.

La API de xAI es el precio de referencia: 2,00 $ / 0,50 $ / 6,00 $, de pago por uso, sin ninguna asignación gratuita publicada.
OpenRouter lista la misma tarifa idéntica de 2,00 $ / 6,00 $ / 0,50 $ de lectura en caché, y dice claramente que traspasa el precio del proveedor "sin ningún recargo". El coste está en otro sitio: una comisión del 5,5 % al comprar créditos, con un mínimo de 0,80 $, un 5 % en cripto, y los créditos no usados caducan al año. Si traes tu propia clave de xAI, el uso por encima de la asignación del plan lleva una comisión del 5 % de lo que habría costado esa misma solicitud. También opera dos endpoints, estándar y de retención de datos cero, a la misma tarifa pero con distinta velocidad medida: 74 frente a 80 tokens por segundo en la mediana, 1,02 s frente a 0,81 s de latencia, ambos con un 100 % de disponibilidad en 30 días.
SuperGrok a 30 $/mes es el nivel de consumo más barato que incluye Grok 4.6 como prestación, según la página de precios de xAI. SuperGrok Plus cuesta 100 $/mes. Free, SuperGrok Lite, SuperGrok Heavy, Business y Enterprise aparecen todos en la comparación de planes, pero solo Free, SuperGrok y SuperGrok Plus tienen una cifra publicada; el resto es contactar con ventas o no está listado.
Azure AI Foundry y AWS Bedrock todavía van una generación por detrás. La página de precios de Grok de Azure llega como máximo a Grok-4.3 Global, a 1,25 $ de entrada y 2,50 $ de salida. Eso es más barato por token, y son dos versiones más antiguo. Si el área de compras exige que la inferencia pase por una sola nube, Grok 4.6 no se puede comprar para ti a ningún precio todavía. Es el mismo patrón que vimos con Grok Bot y el creador de agentes de voz de Grok: xAI lanza primero en sus propias plataformas y deja que los revendedores se pongan al día.
Grok 4.6 frente a los demás buques insignia
| Modelo | Contexto | Entrada /1M | En caché /1M | Salida /1M |
|---|---|---|---|---|
| Grok 4.6 | 500k | 2,00 $ | 0,50 $ | 6,00 $ |
| Claude Sonnet 5 | 1M | 2,00 $ | 0,20 $ | 10,00 $ |
| Claude Opus 5 | 1M | 5,00 $ | 0,50 $ | 25,00 $ |
| GPT-5.6 Sol | 1.05M | 5,00 $ | 0,50 $ | 30,00 $ |
| DeepSeek V4 Flash | 1M | 0,14 $ | 0,0028 $ | 0,28 $ |
En la salida, Grok 4.6 es la opción de nivel frontera más barata aquí que no es de peso abierto. 6,00 $ frente a 10, 15, 25 y 30 $ no es una decisión reñida, y explica por qué el modelo aparece primero en los agentes de codificación: esas cargas de trabajo consumen mucha salida y son flexibles en el contexto.
Al pasar a la columna en caché, la clasificación se invierte. Sonnet 5 cachea a 0,20 $ frente a los 0,50 $ de Grok 4.6, tiene una ventana de 1M sin recargo por contexto largo y lleva un descuento por lotes que Grok 4.6 no tiene. Para una carga de trabajo que reenvía un prompt grande y fijo y devuelve tres frases, que es exactamente lo que hace una cola de soporte, la tarifa de salida más barata apenas se nota.
Una nota de equidad sobre la comparación en sí: la entrada en caché no es el mismo producto entre proveedores. Anthropic y OpenAI cobran por separado por escribir una entrada de caché, Google factura el almacenamiento de caché por hora, y xAI publica una tarifa de lectura sin coste de escritura separado en la página. Comparar solo la columna de caché favorece a los proveedores que dividen el cargo. Si quieres el panorama más amplio, alternativas a Grok 4.5 cubre a los vecinos más cercanos y Qwen3.8 Max cubre el extremo de peso abierto.
Lo que esto cuesta realmente en una cola de soporte
Al calcular con los valores predeterminados del widget, Grok 4.6 cuesta aproximadamente 1,5 centavos de tokens por conversación, más otro centavo cuando se activan la recuperación y la búsqueda. Con 20.000 conversaciones al mes, eso son unos pocos cientos de dólares.
Ahora ponle precio al resto de la implementación: la integración con el helpdesk, las reglas de triaje, la puerta de confianza, las rutas de escalado, el ciclo de revisión, la guardia cuando algo se tuerce. Los tokens son un error de redondeo frente a todo eso.
Por eso sigo señalando a los compradores hacia el coste por resolución en lugar del coste por millón de tokens, y por eso medir el ROI del soporte es un ejercicio más útil que optimizar una tarifa.
Dos fallos que veo repetidamente en las llamadas de precios, y de ninguno de los cuales te avisará una tabla de tokens.
El primero es el volumen, no la tarifa. Un comprador que probaba nuestro propio producto llegó a 200 interacciones en un solo día de evaluación y de inmediato empezó a proyectar 9.000 al mes. Nada había cambiado en el precio. Lo que cambió fue su estimación de con qué frecuencia se usa la cosa, que siempre es más alta de lo que decía la hoja de cálculo.
El segundo es la forma del propio modelo de precios. Un usuario en prueba hizo doce chats de prueba, vio que el agente funcionaba bien, abrió la página de facturación y pidió la cancelación en el acto. El producto funcionaba. La estructura de la factura era el problema. Por eso preferiría darle a un comprador de soporte un número por ticket resuelto que un número por millón de tokens: nadie puede prever su propio consumo de tokens, y todos pueden contar sus tickets.
Y lo que un modelo más barato nunca arregla: el anclaje en tu propio contenido. La fecha de corte del conocimiento de Grok 4.6 significa que no sabe nada de tu política de devoluciones, tus SKU o el incidente de la semana pasada. Eso viene de tu base de conocimiento y de tickets anteriores, y es un coste de implementación sin importar qué modelo haya debajo.
Lo mismo aplica a las pruebas adversarias y a la medición de la contención. Partidas reales, y ninguna tarifa las contiene.
eesel pone precio al resultado, no a los tokens
He pasado los últimos años construyendo la capa entre un modelo y un helpdesk, y lo que le diría a cualquiera que lea una tabla de tokens pensando en un proyecto de soporte es que está poniendo precio al 5 % más barato del trabajo.
eesel es el otro 95 %. Se conecta con Zendesk, Freshdesk y el resto en pocos minutos, aprende de tu centro de ayuda, tus macros y tickets resueltos, así que ya suena como tu equipo, y simula contra tus propios tickets históricos antes de responder a un solo cliente real. Primero ves la precisión con tus datos, cubres las lagunas que revela, lo vuelves a ejecutar, y luego lo pones en marcha.

La facturación funciona por resultados en lugar de por medidores: 40 centavos por ticket o chat gestionado, según nuestra página de precios, cobrado por conversación y no por respuesta, sin tarifas por asiento y sin nada cobrado por los tickets que tus humanos gestionan. Hay 50 $ de uso gratuito sin tarjeta, puedes enrutar primero una parte del volumen, y puedes limitar el gasto mensual. Sin cabecera de clave de caché que se te olvide, sin precipicio de 200k, sin línea aparte para la búsqueda que produjo la respuesta. Nuestras páginas de seguridad y enterprise cubren el lado del cumplimiento.
Si estás eligiendo un modelo para una cola de soporte en lugar de un agente de codificación, el mejor agente de IA para ese trabajo es un mejor punto de partida que cualquier tarifa, y el software de atención al cliente con IA cubre la capa de plataforma por encima.
Los números a los que someto un despliegue son la resolución automatizada de tickets y la tasa de resolución, no dólares por millón de tokens. Si aguanta en colas reales es para lo que está nuestra página de clientes.
Prueba eesel gratis, ejecuta la simulación, y pon precio al resultado en vez de a los tokens.

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








