
La tabla completa de tarifas de Grok Voice, tal como se publica hoy
Esto es todo lo que aparece en la sección de la API de voz de la tarifa de xAI, más la línea de telefonía que vive en el anuncio de Voice Agent Builder en su lugar. He incluido también las tarifas independientes de transcripción y síntesis, porque muchos equipos siguen ejecutando un pipeline segmentado y quieren comparar ambas formas.
| Concepto | Tarifa |
|---|---|
Speech to speech, grok-voice-think-fast-2.0 | $0.08 / min ($4.80 / h) |
Speech to speech, grok-voice-think-fast-1.0 | $0.05 / min ($3.00 / h) |
Entrada de texto, por conversation.item.create | $0.004 / mensaje |
| Número de teléfono aprovisionado (telefonía) | +$0.01 / min |
| Speech to text, REST | $0.10 / h |
| Speech to text, streaming | $0.20 / h |
| Text to speech | $15.00 / 1M caracteres |
web_search o x_search | $5 / 1k llamadas |
collections_search / file_search | $2.50 / 1k llamadas |
attachment_search | $10 / 1k llamadas |
code_execution | $5 / 1k llamadas |
| Almacenamiento de colecciones | $0.10 / GiB / día |
Vale la pena decir dos cosas en voz alta sobre esa tabla, porque son las partes en las que la gente se equivoca al presupuestar.
El medidor de audio se describe en la ficha del modelo como facturación por minuto de audio "enviado o recibido", lo cual suena como si pudiera contar doble en una conversación bidireccional. Parece que no es así. Artificial Analysis midió el coste por hora de audio de entrada en exactamente $4.80 para este modelo, que es $0.08 multiplicado por sesenta, así que en su prueba el medidor se comportó como un único conteo de duración de sesión en lugar de sumar ambas direcciones. Aun así, yo vigilaría la primera factura en vez de fiarme de mi palabra.
El medidor de entrada de texto también es más estrecho de lo que parece. xAI factura $0.004 por cada evento conversation.item.create que envías, pero los elementos de function_call_output no se facturan y response.create ni siquiera es un evento facturable. Así que un agente charlatán que usa muchas herramientas no acumula cargos de entrada de texto por cada resultado de herramienta que devuelve, que es la suposición con la que empecé y que resultó incorrecta.
El cambio del 5 de agosto, en dólares
Esta es la razón completa por la que este artículo existe hoy y no la semana pasada.

La propia nota de lanzamiento de xAI es directa al respecto: el 5 de agosto de 2026, grok-voice-latest pasa de grok-voice-think-fast-1.0 a grok-voice-think-fast-2.0, sin ninguna acción necesaria para actualizar, y para quedarte en el modelo antiguo tienes que fijar grok-voice-think-fast-1.0 antes de esa fecha. Lo que la nota no hace es poner un porcentaje al lado, y el porcentaje es 60% por minuto.
La documentación está a mitad del cambio ahora mismo, lo cual me pareció discretamente gracioso. La tabla de modelos en la guía de speech-to-speech todavía describe el alias apuntando a 1.0 y actualizándose el 5 de agosto, mientras que un párrafo más abajo en la misma página ya dice que "siempre apunta al modelo más reciente (actualmente grok-voice-think-fast-2.0)". Ambas cosas eran ciertas en días distintos. Ninguna te dice lo que hace con tu factura.
Justo al lado de todo esto, en el mismo anuncio, está la frase con la que xAI abre su sección de precios: "Creemos que los precios deben ser predecibles y transparentes". La verdad, creo que eso es defendible aquí. Dejaron 1.0 publicado a su tarifa antigua, dieron un aviso con fecha y documentaron la forma de excluirse. Eso es más advertencia de la que reciben la mayoría de las revisiones de precio de modelos. Solo que no es lo mismo que tu factura sea predecible, porque la ruta por defecto se movió y ahí es donde vive la mayor parte del tráfico en producción.
Lo que el precio de etiqueta no cuenta
Toda tarifa de voz de esta categoría tiene la misma señal: el número principal es lo único de la factura que no es una sorpresa. Aquí está una sola llamada de soporte de seis minutos, calculada línea por línea.

- Audio: 6 min x $0.08 = $0.48
- Número de teléfono aprovisionado: 6 min x $0.01 = $0.06
- Dos búsquedas web: 2 x $0.005 = $0.01
- Una consulta a colecciones: 1 x $0.0025 = $0.0025
- Tres entradas de texto: 3 x $0.004 = $0.012
Eso es $0.5645 frente a un precio de etiqueta de $0.48, alrededor de un 18% más. No es catastrófico, y honestamente es una de las mejores proporciones de esta categoría, porque las tarifas de herramientas de xAI son baratas y su tarifa de voz es plana. Pero escala de forma lineal, y un 18% sobre una línea de voz de $3.200 mensuales son $576 que nadie puso en el presupuesto.
La línea que más cuidadosamente modelaría es web_search. A $5 por 1.000 llamadas parece redondeo, y luego recuerdas que un modelo agéntico decide por sí mismo cuántas herramientas invocar. xAI lo dice claramente en su página de precios: el coste escala con la complejidad de la consulta porque el agente elige. El esfuerzo de razonamiento está en "high" por defecto en este modelo, y aunque los tokens de razonamiento no se miden por separado en el medidor de voz, un modelo que piensa más es un modelo que recurre a más herramientas.
Lo que compran los tres centavos extra
No pagaría un 60% más por una puntuación de referencia más redonda, así que aquí va la lectura honesta de qué se mueve.
| Medida | Think Fast 2.0 | Think Fast 1.0 | Cambio |
|---|---|---|---|
| Coste por hora de audio de entrada | $4.80 | $3.00 | +60% |
| Índice speech-to-speech | 82.9% | 75.7% | +7.2 pts |
| Rendimiento agéntico (τ-voice) | 56.5% | 52.1% | +4.4 pts |
| Dinámica conversacional | 95.1% | 77.8% | +17.3 pts |
| Razonamiento del habla | 97.2% | 97.1% | sin cambios |
| Tiempo hasta el primer audio | 0.70s | 1.25s | 44% más rápido |
Lee esa columna de cambios como una forma, no como una puntuación. El razonamiento del habla no se movió, así que si el trabajo de tu agente es entender una frase y leer una respuesta, estás pagando un 60% más por algo que no vas a notar. Lo que se movió fue la dinámica conversacional, subiendo 17.3 puntos, que es el manejo de interrupciones, el barge-in, saber cuándo la persona que llama ha terminado de hablar, y la latencia, bajando a 0.70 segundos. Esas son las dos cosas que hacen que una llamada telefónica se sienta como una llamada telefónica en lugar de un quiosco.
El rendimiento agéntico se movió 4.4 puntos, hasta 56.5%. Esa es la cifra publicada más alta en la tabla de speech-to-speech de Artificial Analysis y sigue siendo una tasa de fallo del 43.5% en escenarios agénticos difíciles, que es la cifra que pondría delante de cualquiera que esté presupuestando para automatización total. También es la razón por la que la tasa de resolución sobre la que planifiques debería venir de tu propio tráfico, no de una tabla de clasificación.
Dos desarrolladores en Hacker News llegaron a la misma conclusión desde direcciones opuestas. Uno calificó el modelo por sensación:
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right."
Y en el propio hilo de Think Fast 2.0, el comentario más votado lo enmarcó frente al especialista establecido:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
Lo cual es un buen puente, porque superar a ElevenLabs en calidad es una pregunta distinta a superarlo en precio, y a partir de hoy esas dos respuestas divergen.
El precio de Grok Voice frente al resto del campo
Artificial Analysis publica el coste medido por hora de audio de entrada para toda la categoría speech-to-speech, que es la única columna comparable disponible cuando la mitad de los proveedores factura por token y la otra mitad por minuto.
| Modelo | Índice S2S | $/h medido | Tiempo hasta el primer audio |
|---|---|---|---|
| Qwen Audio 3.0 Realtime Plus | 84.1% | $4.42 | 4.02s |
| Grok Voice Think Fast 2.0 | 82.9% | $4.80 | 0.70s |
| GPT-Realtime-2.1 High | 79.1% | $10.75 | 1.21s |
| GPT-Realtime-2 High | 77.2% | $4.14 | 1.14s |
| Qwen Audio 3.0 Realtime Flash | 76.3% | $4.77 | 4.16s |
| Grok Voice Think Fast 1.0 | 75.7% | $3.00 | 1.25s |
| GPT-Realtime-2.1 Minimal | 72.5% | $11.31 | 0.97s |
| Gemini 3.1 Flash High | 69.5% | $1.75 | 2.99s |
| Deepslate Opal | 62.8% | $6.48 | 0.44s |
Cuatro cosas de esa tabla valen más que la clasificación en sí.
Grok no es el mejor modelo barato, y tampoco es el mejor modelo a secas. El Qwen Audio 3.0 Realtime Plus de Alibaba puntúa más alto con 84.1% y mide más barato a $4.42/h. Su problema está en la última columna: 4.02 segundos hasta el primer audio, frente a 0.70. En una línea telefónica eso es silencio muerto sobre el que la persona que llama va a hablar. La verdadera propuesta de Grok es la combinación de índice y latencia, y en esa combinación no tiene rival en la tabla.
La tarifa plana es la característica infravalorada. El $4.80 medido de Grok es idéntico a su precio de lista, porque el precio de lista ya es plano por minuto. GPT-Realtime-2 de OpenAI lista $1.15 por hora de audio de entrada y $4.61 por hora de salida, y mide $4.14 todo incluido, así que la tarifa de entrada que le mostrarías a un director financiero es cerca del 28% de lo que realmente pagas. Esa brecha no es un truco, es simplemente lo que hace la facturación de audio por token, y por eso los presupuestos de GPT-Realtime tienden a ser estimaciones más que cifras.
Bajar el razonamiento no ahorra dinero de forma fiable. GPT-Realtime-2.1 Minimal mide $11.31/h, más que los $10.75 de la variante High, y puntúa 6.6 puntos por debajo. Si asumías que un dial de esfuerzo más bajo era una palanca de coste en voz, esa fila es el contraejemplo.
La latencia tiene su propio suelo de precio. Deepslate Opal es lo más rápido medido, a 0.44s, y cuesta $6.48/h con una puntuación de 62.8%. La velocidad se puede comprar por sí sola; rápido y a la vez inteligente es para lo que existe la tarifa de Grok.
Vale la pena señalar lo que esta tabla no contiene: la capa de plataforma. Proveedores de orquestación como Retell AI cobran una tarifa de plataforma encima de cualquier modelo al que enruten, así que su cifra por minuto y los números de arriba no son el mismo tipo de número.
Vapi y Hume tienen precios de la misma manera. He calculado el coste de ambos en el repaso de empresas de voz con IA, y el patrón se mantiene: una tarifa de modelo y una tarifa de plataforma son productos distintos que llevan las mismas unidades.
La comparación con ElevenLabs merece su propio párrafo porque es la que cambió hoy. Sus planes de agente son asignaciones de minutos prepagadas: $6 por 75 minutos, $22 por 275, $99 por 1.238, $299 por 3.738, $990 por 12.375. Divide cualquiera de ellos y llegas a casi exactamente $0.08 por minuto incluido en cada plan de pago, que es la nueva tarifa de Grok al centavo. Hasta esta mañana Grok la superaba en un 37.5% más barato. Lo que queda es una diferencia en la forma de facturación en lugar de precio: los minutos de ElevenLabs son prepagados y caducan, los de Grok son de pago por uso, así que una línea con volumen irregular o estacional sigue saliendo ganando con Grok, y una línea que funciona a máxima capacidad todo el mes ahora es una moneda al aire. En Cartesia Sonic 3 y el resto del campo especializado, aplica la misma pregunta sobre la forma.
Los límites que cuestan más que la tarifa
Estos me importan más que el número por minuto, porque una tarifa que puedes prever es más fácil de sobrellevar que un techo con el que te topas a las 4 de la tarde del Black Friday.
Diez sesiones simultáneas por equipo. Ese es el valor por defecto publicado en la ficha del modelo, con límites más altos bajo solicitud. Diez llamadas simultáneas es una cola de entrada pequeña. Si estás dimensionando una línea telefónica real, la solicitud de concurrencia va antes que la tarjeta de crédito, no después.
Sesión máxima de 120 minutos. Suficiente para soporte, vale la pena saberlo si tenías ideas sobre asistentes de larga duración.
Sin descuento por lotes ni nivel prioritario en voz. El descuento del 20% por lotes de xAI aplica solo a modelos de texto específicos, y el Priority Processing a 2x está limitado a Chat Completions y Responses. La voz no tiene ni carril de descuento ni carril rápido de pago, lo cual es coherente con un medidor plano en tiempo real pero elimina dos palancas que podrías tener en el lado de texto.
El almacenamiento se factura por separado si tu agente hace recuperación. Las colecciones cuestan $0.10 por GiB al día, los archivos $0.025, las descargas $0.20 por GiB. Pequeño en una base de conocimiento pequeña, y vale la pena una línea en el modelo si estás sincronizando un centro de ayuda entero para soporte multilingüe.
Hay una tarifa de $0.05 por solicitudes bloqueadas. Si una solicitud de la Responses API se detecta violando las políticas de uso antes de la generación, xAI cobra $0.05. No es una línea específica de voz, pero es el tipo de cosa que aparece como un error de redondeo inexplicable en una factura grande.
Una sola región. Speech to speech se ejecuta solo en us-east-1, que es un hecho de latencia y residencia de datos más que de precio, aunque se convierte en un precio en el momento en que una revisión de compras pregunta por ello.
Dónde acaba realmente la cuestión del precio
Aquí está la decisión que yo tomaría con todo esto sobre la mesa.
Si operas una línea telefónica de entrada donde quienes llaman interrumpen, cambian de opinión, y esperan que el agente realmente haga algo, la tarifa de $0.08 es justa y el cambio de alias es una subida que vale la pena aceptar. La dinámica conversacional subiendo 17.3 puntos y la latencia de 0.70 segundos son las dos cosas que las personas que llaman sienten, y ningún otro modelo de la tabla combina eso con un índice del 82.9%.
Si tu agente de voz se limita a leer estados de pedidos, fija grok-voice-think-fast-1.0 hoy mismo y mantén la tarifa de $0.05. El razonamiento del habla ya estaba en 97.1% en 1.0. No estás dejando calidad sobre la mesa para la carga de trabajo que realmente tienes, y a 10.000 minutos al mes fijar la versión vale $300.
Si aún no has construido la línea, el número que hay que modelar no es en absoluto por minuto. Es el coste por incidencia resuelta, y eso significa saber qué fracción de llamadas termina sin un humano. Esa es la misma aritmética detrás de cualquier caso de ROI de un call center, y vale la pena ponerla junto a la línea base de coste de un agente de IA frente a un agente humano antes de firmar nada.
Un número más suave también pertenece a ese modelo. Un agente más rápido y menos interrumpible mueve el CSAT, y el CSAT es lo que evita que una línea automatizada barata te cueste clientes en silencio. Es la línea más difícil de prever y la más fácil de notar una vez que baja.
La factura de voz es la mitad pequeña del problema
Escribo el SEO de eesel y leo las notas de ventas, y las conversaciones de precios que salen mal casi nunca salen mal por una tarifa por minuto. Salen mal por la unidad.
Lo he escuchado desde ambos extremos de la curva de volumen. Un responsable de operaciones de una fintech de pagos y transferencias de dinero en Zendesk, gestionando entre 7.000 y 8.000 tickets escalados al mes, me contó que el precio por interacción era un no rotundo frente a la facturación por sesión, porque con unos cuatro intercambios por ticket, el medidor cuenta la conversación cuatro veces. Un operador de comercio electrónico multiempresa que escalaba hacia 150.000 tickets al mes proyectó alrededor de $30.000 al mes a veinte centavos por ticket y pasó la mayor parte de una llamada intentando averiguar si la unidad era una interacción o un ticket. Ninguno de los dos era un argumento sobre si la tarifa era demasiado alta. Ambos eran argumentos sobre qué estaba contando la tarifa.
Esa es la lente que le aplicaría a la tarifa de Grok, y sale bien parada. Un medidor de audio plano por minuto es la unidad más legible de esta categoría. También es, estructuralmente, una unidad que te factura por tiempo en lugar de por resultados, que es exactamente la unidad correcta para una llamada telefónica y exactamente la incorrecta para una cola de tickets.

¿Estás calculando el coste de una línea de Grok Voice? La otra mitad de esa hoja de cálculo es el volumen de correo y chat que nunca hace sonar el teléfono, y ese no se factura por minuto. eesel es un agente de IA para helpdesk que factura por ticket realmente resuelto, se conecta a Freshdesk o Gorgias en pocos minutos, y entrena con tus tickets pasados en lugar de un rastreo del sitio web.
Lo que importa para una previsión: ejecuta una simulación de deflexión contra tu historial real de tickets antes de responder a un cliente en vivo, así que la tasa de resolución que pones en la hoja de cálculo es una que mediste en tu propia cola en lugar de una que tomaste prestada de una tabla de clasificación. Prueba eesel gratis, o mira los precios primero, ya que aparentemente esa es la página que lo decide todo.
Qué haría antes de que llegue la factura
Tres movimientos concretos, en el orden en que los haría.
- Buscar
grok-voice-latestcon grep. Si está en código de producción, estás en la nueva tarifa a partir de hoy. Decide si eso es lo que quieres, y luego fija una versión de cualquier manera, porque la propia documentación de xAI recomienda fijar versiones para producción y esta es exactamente la razón. - Volver a prever incluyendo las llamadas a herramientas en el modelo. Toma los minutos del mes pasado, añade entre un 15% y un 20% por invocaciones de herramientas y telefonía, y compara el número con la calculadora de arriba. La línea de audio nunca es la línea completa.
- Pedir el aumento de concurrencia antes de necesitarlo. Diez sesiones simultáneas es el valor por defecto, no el techo. Aumentarlo es una solicitud, y las solicitudes tardan más que los picos de tráfico.
Nada de esto es razón para evitar el modelo. Think Fast 2.0 es el modelo de voz agéntico más fuerte con números publicados, y a $4.80 la hora medidos cuesta menos de la mitad de lo que cuesta el mejor nivel en tiempo real de OpenAI. Es solo una razón para saber cuál de tus cadenas de modelo es un objetivo móvil, y qué le pasa a tu factura cuando se mueve. La misma disciplina aplica a la gestión de escalaciones y a prevenir respuestas incorrectas: el valor por defecto rara vez es el ajuste que habrías elegido a propósito.
Para el resto de este grupo de artículos, el resumen de Think Fast 2.0 cubre lo que cambió en el propio modelo. El artículo sobre precios de Voice Agent Builder cubre la plataforma sin código que se apoya encima, y hay una reseña práctica del Builder si prefieres el flujo de trabajo antes que la tarifa.
¿Todavía decidiendo si la voz es el canal adecuado? Empieza con puede la IA responder llamadas de soporte, y luego la explicación más amplia sobre llamadas telefónicas con IA.
Si quienes te llaman ya te alcanzan a través de un producto telefónico de helpdesk como Zendesk Talk, la pregunta de construir versus comprar viene antes que la de precio por minuto. Mi repaso de automatización de soporte es el atajo para resolverla.
Preguntas frecuentes
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
¿Por qué subió un 60% el precio de Grok Voice?
grok-voice-latest pasó de 1.0 a 2.0 el 5 de agosto de 2026, así que quien usaba el alias adoptó la tarifa más alta sin ningún despliegue propio. Fijar la versión es la solución, y es la misma disciplina de fijar versiones de la que depende prevenir respuestas incorrectas de la IA.¿Es Grok Voice Think Fast 2.0 más barato que la Realtime API de OpenAI?
¿Hay un nivel gratuito para Grok Voice Think Fast 2.0?
¿Cuánto factura realmente una llamada de soporte de Grok Voice?
web_search o x_search, $2.50 por 1.000 consultas a colecciones, $10 por 1.000 búsquedas de adjuntos. Modela las llamadas a herramientas, no solo los minutos, igual que harías al calcular el coste de la automatización de un call center.¿Cómo se compara el precio de Grok Voice con ElevenLabs Agents?
¿Cuáles son los límites de tasa en la API de Grok Voice?
¿Vale la pena Grok Voice Think Fast 2.0 por los tres centavos extra por minuto?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








