
Lo que realmente probé, y lo que no pude
Quiero ser claro sobre la base de todo esto, porque "lo he probado" se usa con bastante ligereza con los modelos de voz.
Lo que he trabajado a fondo: la documentación de speech-to-speech de xAI de principio a fin, además de la ficha del modelo con sus límites publicados y la tabla de precios en la página de precios.
Además de eso, el post de lanzamiento y la evaluación independiente de Artificial Analysis que lo puntuó frente a otros 27 modelos. Luego leí lo que dicen quienes construyen sobre él.
Lo que no puedo afirmar: no he hecho pasar mil llamadas de producción por él en una línea telefónica real. Nadie fuera de xAI lo ha hecho, excepto Starlink. Así que cuando este post dice algo sobre el comportamiento bajo carga, viene de un límite publicado y no de una historia de guerra real, y diré cuál de las dos cosas es en cada caso.
Me dedico a construir agentes de IA en eesel, sobre todo las partes que se sitúan entre un modelo y una conversación real con un cliente. Esa es la óptica aquí. La pregunta no es "¿esto impresiona en una demo?". Es "¿qué se rompe un martes por la tarde cuando llaman 40 personas a la vez?".
La tabla de puntuaciones
Aquí está todo el veredicto en un solo sitio antes de entrar en detalle.
| Dimensión | Puntuación | Mi valoración |
|---|---|---|
| Fluidez conversacional | 95,1% Full Duplex Bench | La corrección estrella. La 1.0 obtuvo 77,8%. Las interrupciones y superposiciones ya no son el punto débil. |
| Inteligencia bruta | 82,9% índice AA | Segundo puesto en general, por detrás de Qwen con 84,1%. Lo suficientemente cerca como para no ser el factor decisivo. |
| Comportamiento agéntico | 56,5% τ-voice | El mejor de la tabla, pero solo 1,9 puntos por delante de Qwen con 54,6%. |
| Latencia | 0,70s hasta el primer audio | Tercero más rápido. Suficientemente rápido como para que la persona que llama no lo note. |
| Transcripción | 1,4x mejor que la 1.0 | Una mejora real, y la que xAI vendió por debajo de lo que merece. |
| Diseño de API | Compatible a nivel de protocolo con OpenAI Realtime | La mejor parte del producto. Las extensiones parecen escritas por alguien que ya había lanzado un agente telefónico antes. |
| Previsibilidad del coste | 4,80 $/h medido, 4,80 $/h de lista | Facturación plana por minuto. Algo raro, y que vale más de lo que parece. |
| Margen de escala | 10 sesiones concurrentes | El problema. Todo lo anterior queda minado por esta única línea. |
| Opciones de despliegue | Solo us-east-1 | Sin región en la UE. Para muchos equipos, esto cierra la conversación. |
Veredicto: el modelo se gana una recomendación firme y la plataforma se gana un "revisa antes tu volumen". Son dos productos distintos, y los análisis suelen puntuar solo el primero.
Dónde gana
Destacan cuatro cosas, y solo una es la cifra con la que xAI abrió el lanzamiento. Juntas describen un tipo de modelo concreto: no el más inteligente disponible, sino el que se mantiene afilado mientras responde lo bastante rápido para una línea telefónica.
Las interrupciones dejaron de delatarlo
El cambio individual más grande respecto a la 1.0 es Full Duplex Bench, que mide cómo gestiona un modelo las partes desordenadas de una conversación real: interrupciones, superposiciones, señales de fondo, alguien que cambia de opinión a mitad de frase. La 1.0 obtuvo 77,8%. La 2.0 obtiene 95,1%.
Esa es la cifra que separa un agente de voz que la gente tolera de uno que la gente olvida que es una máquina. Cualquiera que haya escuchado grabaciones de llamadas conoce el fallo típico: la persona que llama empieza a corregirse, el bot sigue hablando por encima, y esa persona o bien se repite más alto o pide hablar con un humano. Está casi en lo más alto de cualquier lista de problemas de los chatbots que hacen que los clientes se rindan, y los patrones de derivación de todo despliegue serio existen sobre todo para atrapar ese momento exacto.
Vale la pena reconocer, en justicia: esta es la única fila donde Grok pierde frente a OpenAI. GPT-Realtime-2.1 High puntúa 95,7%. Una diferencia de 0,6 puntos es algo que ninguna persona al teléfono percibiría jamás, pero la tabla de lanzamiento tampoco se ofrecerá a mencionarlo.
La puntuación agéntica es el verdadero titular
τ-voice mide si un modelo puede realmente completar una tarea por voz, en lugar de solo sonar bien mientras la intenta. Buscar un pedido, comprobar una política, luego llamar a una función y volver con la respuesta correcta. Grok Voice Think Fast 2.0 marca 56,5% aquí, la cifra más alta de toda la tabla de Artificial Analysis.

Esto importa más que el índice general para cualquiera que construya un agente real, porque un agente de voz que no puede usar herramientas de forma confiable es un lector de FAQ muy caro. Es la misma distinción que separa a los agentes de IA de los chatbots de IA en texto, y la misma razón por la que los ejemplos de agentes de IA útiles son siempre los que tocan un sistema real en lugar de recitar un artículo.
La salvedad honesta: Qwen Audio 3.0 Realtime Plus se sitúa en 54,6% en el mismo benchmark. Así que la ventaja de Grok son 1,9 puntos, no el abismo que sugiere el planteamiento. La brecha respecto al mejor de OpenAI, con 45,7%, es más amplia, y de ahí viene la frase "10 puntos por delante", pero Qwen está justo ahí.
La combinación de velocidad e inteligencia
0,70s hasta el primer audio, frente a los 1,25s de la 1.0. Deepslate Opal es más rápido con 0,44s, y una variante de Gemini Flash con 0,63s, así que Grok queda tercero. Pero Qwen, el modelo que le gana en el índice general, tarda 4,02s hasta el primer audio. En una línea telefónica eso es una pausa muerta lo bastante larga como para que quien llama diga "¿hola?".
Ese equilibrio es el verdadero producto. Alguien en Hacker News lo expresó mejor que el propio post de lanzamiento:
"Grok voice es el mejor asistente de voz con IA y no es ni de cerca comparable.
El equilibrio entre velocidad e inteligencia es el correcto. Mientras que la voz de GPT resulta pretenciosa y poco humana a pesar de esforzarse mucho por sonar humana."
xAI también dice que los tokens de razonamiento corren a 0,4 veces el P50 de su predecesor, que es cómo se volvió más rápido mientras se volvía más inteligente, en lugar de simplemente pensar menos.
La transcripción es la parte infravalorada
Escondido en el post de lanzamiento: la precisión de transcripción es 1,4 veces mejor que en la 1.0, y de 1,5 a 2,0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas. En audio ruidoso o de telefonía, la diferencia declarada es de aproximadamente 10 veces.
El audio de telefonía es donde la transcripción suele fallar, y es exactamente el tipo de audio con el que trabaja una línea de soporte todo el día. Si estás evaluando esto frente a ElevenLabs o un proveedor dedicado de voz a texto, esa cifra de audio ruidoso merece más peso que los benchmarks conversacionales. También es el eje en el que el endpoint de transcripción de OpenAI ha sido la opción por defecto, sobre todo por inercia.
Ahora hay 26 voces en el catálogo, tras añadirse 21 en julio de 2026, y cualquiera de ellas se puede cambiar por un ID de voz clonada. Si alguna vez has luchado por mantener a un bot sonando como tu empresa en distintos canales, el problema de la voz de marca no desaparece solo porque la salida sea audio.
Dónde la tabla de benchmarks lo exagera
Tres cosas que el planteamiento del lanzamiento no cuenta.
82,9% es el segundo puesto. Qwen Audio 3.0 Realtime Plus está en 84,1%. Grok es competitivo con él, y mucho más rápido, pero "estado del arte" está haciendo bastante trabajo en el texto de marketing. Si has revisado últimamente la familia de modelos de Qwen o lo que cobra Alibaba, sabrás que están lanzando a un ritmo fuerte.
No compares entre sí las dos cifras de τ-voice de xAI. El post de Voice Agent Builder del 1 de julio reporta que Think Fast 1.0 obtiene 67,3% en su propia evaluación τ-voice. Artificial Analysis puntúa el mismo modelo con 52,1%. Metodologías distintas, escalas distintas. Cualquiera que apile esas dos cifras en un gráfico de "mira cuánto ha mejorado" no está comparando nada. Ese mismo cuidado aplica a las cifras en Voice Agent Builder pricing, que todavía citan la tarifa antigua.
Las cifras de Starlink pertenecen a la 1.0. El 20% de conversión de ventas y el 70% de resolución autónoma tan citados, de la línea +1 888 GO STARLINK con 28 herramientas conectadas, son resultados de Think Fast 1.0. Para la 2.0, xAI dice que las pruebas A/B en esa misma línea mostraron "un aumento significativo" en conversión y contención, sin publicar cifra alguna. Además es un despliegue de primera parte dentro de la misma estructura de propiedad, lo que lo convierte en un mejor caso posible más que en uno representativo.
Construir sobre él: la API es la parte buena
Esperaba que la documentación fuera el punto débil aquí y resultó ser justo lo contrario. En cuanto a diseño, es la API de voz en tiempo real más cuidada que he leído.

Es compatible a nivel de protocolo con OpenAI Realtime en wss://api.x.ai/v1/realtime, así que si tienes una app existente, la migración es cambiar la URL base y una clave. Incluso puedes conservar el SDK de OpenAI y simplemente apuntarlo a https://api.x.ai/v1. Cuatro cosas no se conservan: conversation.item.done, rate_limits.updated y la mayoría de eventos output_audio_buffer.* no se emiten, y ...input_audio_transcription.delta se renombra a .updated y se vuelve acumulativo, lo que corromperá silenciosamente tu visualización de transcripción si estabas concatenando deltas.
Donde se pone interesante es en las extensiones exclusivas de xAI, y se leen como si las hubiera escrito gente que ya había lanzado un agente telefónico y se había quemado con él:
force_messagedice una línea codificada por TTS sin involucrar al modelo en absoluto. Fijainterruptible: falsey el audio de quien llama se descarta hasta que termine. Esto resuelve correctamente el problema del aviso legal obligatorio, en lugar de rezar para que aguante tu system prompt.replacees un mapa de pronunciación aplicado antes del TTS, de modo que el audio dice "Acme Mobull" mientras la transcripción sigue mostrando "Acme Mobile". La coincidencia no distingue mayúsculas, respeta los límites de palabra completa, y gana la coincidencia más larga.resumptionalmacena en caché los turnos porconversation_idy los reproduce de nuevo al reconectar. Desactivado por defecto, ambas partes deben activarlo, y el historial caduca tras 30 minutos de inactividad.keytermssesga la transcripción hacia hasta 100 términos de dominio de 50 caracteres cada uno, actualizables a mitad de sesión. Para una línea de soporte llena de SKU y nombres de planes, esto es la diferencia entre una transcripción usable y un desastre.idle_timeout_msse rearma tras cada respuesta, de forma que el agente puede volver a interactuar con una persona que llama en silencio repetidamente, en lugar de quedarse ahí sentado.
El parámetro reasoning.effort acepta exactamente dos valores: "high" (el predeterminado) y "none". No hay un ajuste intermedio, lo cual es una carencia real. Alguien planteó exactamente esto en Hacker News sobre un lanzamiento anterior de Grok voice:
"El modelo de voz de Grok también es un modelo de razonamiento. Estoy de acuerdo en que es mucho mejor que los otros modelos de voz.
Dadme simplemente una opción de tener una respuesta más lenta pero un modelo mejor…"
Otra cosa que la documentación hace bien y que la mayoría de proveedores dejan que descubras en producción: te dicen explícitamente que esperes a que termine la reproducción de audio antes de enviar response.create tras una llamada a herramienta, porque el servidor entrega todos los deltas de audio antes de los eventos de llamada a función. Salta ese paso y obtienes voces superpuestas. Incluso sugieren mostrar un indicador de "pensando" durante ese hueco. Ese es un detalle bien ganado, y por escrito.
El propio consejo de la guía de migración es hacer tu system prompt más corto, no más largo, lo cual dice algo sobre cómo se ajustó el modelo.
Los tres límites que realmente te impedirán lanzarlo
Si yo fuera quien lo evalúa, esta es la sección que leería primero.

10 sesiones concurrentes por equipo. Este es el valor por defecto publicado en la ficha del modelo, ampliable si se solicita. Diez llamadas simultáneas es simplemente el lunes por la mañana de un pequeño equipo de soporte. Cada benchmark de arriba es irrelevante si la llamada once no puede conectar, y "ampliable si se solicita" es una conversación de ventas, no un ajuste de configuración. Cualquiera que esté dimensionando un agente de IA para centro de llamadas debería tratar esto como la primera pregunta, no como una nota al pie.
Para comparar, los productos de voz empaquetados construidos sobre un helpdesk no publican ningún tope de sesiones, porque la concurrencia es problema del proveedor y no tuyo. Eso es cierto para los agentes de voz con IA de Zendesk, para la configuración de Freshcaller, y para el agente de voz de Salesforce. Cambias flexibilidad por que otro se encargue de la planificación de capacidad.
Solo us-east-1. Una única región, sin opción en la UE. Si tienes compromisos de residencia de datos, esto lo decide todo antes de que evalúes nada más.
Sin nivel de prioridad ni descuento por lote. El nivel de prioridad de 2x es solo para Chat Completions y Responses. El descuento del 20% por lote es solo para modelos de texto. Voice no obtiene ni carril rápido ni rebaja por volumen, así que la tarifa que ves es la tarifa que pagas en cualquier escala. También hay una duración máxima de sesión de 120 minutos, que es generosa para soporte y ajustada para algo como una línea monitorizada.
Dos cosas más pequeñas que vale la pena conocer. El almacenamiento se factura por separado si tu agente hace recuperación de datos: las colecciones cuestan 0,10 $/GiB/día, los archivos 0,025 $, las descargas 0,20 $/GiB. Y hay una comisión de 0,05 $ por infracción de las directrices de uso por cada solicitud de Responses bloqueada antes de la generación.
¿Deberías pasarte a la 2.0, o quedarte fijado en la 1.0?
El cambio de alias del 5 de agosto significa que no hacer nada ya es en sí una decisión. Elige la fila que te describa.
¿Qué estás usando hoy?
Elige una opción. El veredicto cambia mucho según cuál de estas seas.
A volumen de demo, la subida del 60% en la tarifa es un error de redondeo, y el salto de Full Duplex de 77,8% a 95,1% es la diferencia entre una demo que impacta y una que no. Deja que el cambio de alias te lleve.
Tu coste por minuto pasa de 0,05 $ a 0,08 $ el 5 de agosto sin ningún despliegue de tu parte. A 2.000 minutos al mes eso sube de 100 $ a 160 $. La mejora en fluidez conversacional lo vale, pero pon la cifra delante de quien firma antes de que lo haga la factura por ti.
10 sesiones concurrentes por equipo es el valor por defecto publicado, y subirlo es una conversación con xAI, no un cambio de configuración. Consigue esa cifra acordada por escrito antes de evaluar nada. Un 95,1% en Full Duplex no hace nada por la llamada once.
El speech-to-speech corre solo en us-east-1, sin ninguna región en la UE publicada. Ninguna puntuación de este post cambia eso. Vuelve a evaluarlo cuando xAI publique una segunda región.
Lo que dice realmente quien construye sobre él
X es el hogar natural para las reacciones a xAI y actualmente es difícil leer ahí con profundidad, así que la señal útil está en Hacker News. Dos hilos aportan la mayor parte.
El comentario más votado en el hilo de Think Fast 2.0 es, esencialmente, una queja de que el lanzamiento pasó desapercibido:
"No sé por qué este post no es más popular, es un modelo de voz de última generación, que supera a laboratorios especializados como ElevenLabs"
Es una lectura justa sobre la capacidad, y vale la pena señalar que los precios también han convergido ya. Cada nivel de pago de ElevenLabs Agents sale a casi exactamente 0,08 $ por minuto incluido, que es la nueva tarifa de Grok al céntimo. Hasta el 5 de agosto, Grok lo abarataba en un 37,5%.
La visión más mesurada, de unos meses antes, se sostiene bien:
"Grok voice es sorprendentemente bueno, en realidad. Sigue siendo un modelo más torpe que los modos de razonamiento de los modelos de frontera, pero es menos torpe que los modos de voz de otros proveedores."
Ahí es donde también aterrizo yo, más o menos. Un modelo de voz siempre es un compromiso frente a un modelo de texto al que se le permite pensar durante diez segundos, y Grok hace un mejor compromiso que el resto del campo. Lee las reseñas del lado del consumidor y verás el mismo veredicto formulado con menos cuidado.
La frustración recurrente en estos hilos es el uso de herramientas en modo voz, y merece la pena aclararla porque funciona en ambos sentidos:
"Lo que me falta en este anuncio es la capacidad de usar conectores y herramientas. No lo entiendo realmente - NINGUNO de los asistentes de frontera puede usar herramientas/conectores en modo voz"
Eso se refiere a los asistentes de voz para consumidores, y en el lado de la API no es cierto para Grok: las sesiones admiten herramientas function, file_search, web_search, x_search, y mcp remotas, con las del lado del servidor ejecutándose por ti. Las herramientas de servidor se facturan por invocación, a 5 $ por 1.000 para búsqueda web y en X, 2,50 $ por 1.000 para colecciones, y 10 $ por 1.000 para búsqueda de adjuntos. La brecha que describe el comentario es real en la app de Grok para consumidores, no en lo que construirías tú. Es la misma división que recorre el lanzamiento de voz de ChatGPT: la API le lleva ventaja a la app desde hace ya un tiempo.
Quién debería adoptarlo, y quién debería esperar
Adóptalo si estás construyendo un agente telefónico o de voz que tiene que hacer cosas, no solo hablar. La puntuación τ-voice, el soporte de herramientas, las extensiones force_message y keyterms, y el medidor plano por minuto suman lo que hoy es el stack de voz más amigable para desarrolladores que se está lanzando. Migrar desde el audio en tiempo real de OpenAI es casi gratis.
Adóptalo si la previsibilidad del coste le importa a tu equipo de finanzas. Artificial Analysis mide el coste real de Grok en 4,80 $ por hora de audio de entrada, idéntico al de lista, porque el medidor es plano por minuto. GPT-Realtime-2 lista 1,15 $/h de entrada y mide 4,14 $/h todo incluido. Las facturas de voz que coinciden con su etiqueta son más raras de lo que deberían ser, lo cual es media razón de por qué la pregunta coste de agente frente a agente humano es tan difícil de responder con honestidad.
Adóptalo si quieres construir tú mismo la orquestación. Si prefieres arrastrar cajas de un lado a otro, los precios de Voiceflow y las alternativas a Voice Agent Builder son el extremo sin código del mismo mercado.
Espera si tu volumen supera las diez llamadas simultáneas y todavía no tienes un límite ampliado por escrito. Espera si necesitas una región en la UE. Espera si dependías de la tarifa de 0,05 $ y no habías notado que el alias se movía debajo de ti, en cuyo caso fija hoy grok-voice-think-fast-1.0 y decide según tu propio calendario.
No lo compres como una solución de soporte. Esto es un modelo y una API, no un agente de helpdesk. No tiene concepto de tu historial de tickets, tus macros, tus reglas de escalado, ni de qué preguntas tu equipo ya ha decidido que la IA no debe tocar. Todo lo anterior trata sobre la capa de voz, y la capa de voz es quizás el 20% de lo que hace que una automatización de soporte funcione de verdad. El resto es la parte aburrida: conocer tu producto, saber cuándo detenerse, y hacer una transferencia limpia.
Una responsable de CX en una marca de suplementos DTC planteó la limitación mejor que cualquier hoja de especificaciones:
"La IA nunca va a poder responder al 100% de las preguntas... Necesito una IA que solo gestione los tickets para los que tiene confianza, y que deje todos los demás en paz."
Ningún benchmark de voz mide eso. Es una cuestión de política, y es la que decide si un lanzamiento sobrevive a su primer mes.
La voz es la mitad ruidosa de una cola de soporte
La mayoría de los tickets que se convierten en llamadas eran respondibles por texto una hora antes. La automatización de primera respuesta y un chatbot de base de conocimiento que la IA pueda realmente leer eliminan más llamadas que cualquier modelo de voz. Eso es lo que vale la pena arreglar antes de salir a comprar uno.
eesel es un agente de IA que se conecta al helpdesk que ya usas, se entrena con tus tickets pasados y tu centro de ayuda en lugar de con un system prompt que tengas que escribir a mano, y te permite simular todo el proceso frente a tu historial real de tickets antes de que un solo cliente lo toque. Esa última parte es deliberada. He pasado años viendo a bots que suenan seguros de sí mismos dar respuestas equivocadas, y una prueba en seco sobre tickets que ya has resuelto es la única forma honesta de averiguar qué hará el tuyo. También es el paso que separa a un agente de IA real de un bot basado en reglas una vez que se acaban los caminos guionizados.
Es la misma decisión de construir frente a comprar a la que llegan muchos equipos una vez que han leído una página de documentación como la de xAI y han entendido cuánto de eso tendrían que mantener ellos mismos:
"Podríamos haber intentado escribir nuestra propia aplicación LLM, pero no queríamos invertir nuestro tiempo en eso. Queríamos algo que no tuviéramos que mantener."
Karel, GENERAL BYTES
Si también quieres la capa de voz, sigue leyendo sobre el Voice Agent Builder de Grok y el campo más amplio de empresas de IA de voz. Si quieres resolver primero la cola que hay detrás, eesel es gratis para probar y tarda unos minutos en conectarse a tu helpdesk. Los equipos que usan Gorgias o Zendesk suelen tenerlo respondiendo tickets reales la misma tarde.
Tres cosas que vale la pena leer a continuación, según en qué parte de esto estés atascado:
- Si todavía estás decidiéndote por el modelo: el resumen de Think Fast 2.0 cubre el mecanismo con más profundidad.
- Si estás calculando la factura: el desglose completo de precios hace la cuenta a cuatro volúmenes distintos.
- Si estás comparando el campo: alternativas a ElevenLabs es el enfrentamiento directo más cercano al mismo precio.
Preguntas frecuentes
¿Es Grok Voice Think Fast 2.0 lo bastante bueno para agentes de voz en producción?
us-east-1. Lee el desglose de Grok Voice Think Fast 2.0 para el mecanismo completo, y agentes de IA para centros de llamadas para lo que suele necesitar un despliegue en producción.¿Qué hay de nuevo en Grok Voice Think Fast 2.0 respecto a la versión 1.0?
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
grok-voice-latest. Compáralo con los precios de ElevenLabs y el campo más amplio de empresas de IA de voz antes de decidirte.¿Puedo migrar una app de OpenAI Realtime a Grok Voice?
wss://api.x.ai/v1/realtime, así que cambiar la URL base y la clave cubre casi todo. Cuatro tipos de eventos se comportan de forma distinta, que la sección de migración más abajo enumera. Si construiste sobre la API de audio de OpenAI, calcula una tarde en lugar de un sprint.¿Es Grok Voice Think Fast 2.0 mejor que ElevenLabs para llamadas de soporte?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








