
Lo que probé de verdad, y lo que no pude probar
Quiero ser honesto sobre la base de este análisis, porque la frase "lo he probado" se usa con bastante ligereza cuando se habla de modelos de voz.
Lo que trabajé a fondo: la documentación de voz a voz de xAI de principio a fin, además de la ficha del modelo con sus límites publicados y la tarifa de la página de precios.
Sumado a eso, el anuncio de lanzamiento y la evaluación independiente de Artificial Analysis, que lo puntuó frente a otros 27 modelos. Después leí lo que dice la gente que está construyendo con él.
Lo que no puedo afirmar: no he pasado mil llamadas reales de producción por una línea telefónica en vivo con este modelo. Nadie fuera de xAI lo ha hecho, excepto Starlink. Así que cuando este artículo diga algo sobre el comportamiento bajo carga, viene de un límite publicado y no de una experiencia de campo, y siempre indicaré de cuál se trata.
Construyo agentes de IA en eesel para vivir, sobre todo la parte que se sitúa entre un modelo y una conversación real con un cliente. Esa es la óptica de este análisis. La pregunta no es "¿impresiona en una demo?". Es "¿qué se rompe un martes por la tarde cuando 40 personas llaman a la vez?".
El marcador
Aquí está todo el veredicto en un solo sitio antes de entrar en detalle.
| Dimensión | Puntuación | Mi lectura |
|---|---|---|
| Fluidez conversacional | 95.1% Full Duplex Bench | La gran mejora. La versión 1.0 obtenía 77.8%. Las interrupciones y los solapamientos ya no son el punto débil. |
| Inteligencia bruta | 82.9% índice AA | Segundo puesto en general, por detrás de Qwen con 84.1%. Suficientemente cerca como para no ser el factor decisivo. |
| Comportamiento agéntico | 56.5% τ-voice | El mejor de la tabla, pero solo 1.9 puntos por delante de Qwen, con 54.6%. |
| Latencia | 0.70s hasta el primer audio | Tercero más rápido. Suficientemente rápido como para que la persona que llama no lo note. |
| Transcripción | 1.4 veces mejor que 1.0 | Una mejora real, y la que xAI ha promocionado menos de lo que merece. |
| Diseño de la API | Compatible a nivel de protocolo con OpenAI Realtime | Lo mejor del producto. Las extensiones parecen escritas por alguien que ya había lanzado un agente telefónico antes. |
| Previsibilidad de costes | $4.80/h medido, $4.80/h de lista | Facturación plana por minuto. Poco habitual, y vale más de lo que parece. |
| Margen de escala | 10 sesiones simultáneas | El problema. Todo lo anterior queda anulado por esta única línea. |
| Opciones de despliegue | Solo us-east-1 | Sin región en la UE. Para muchos equipos esto zanja la conversación. |
Veredicto: el modelo merece una recomendación firme y la plataforma merece un "revisa primero tu volumen". Son dos productos distintos, y las reseñas suelen puntuar solo el primero.
Dónde gana
Cuatro cosas destacaron, y solo una de ellas es la cifra con la que xAI encabezó el lanzamiento. Juntas describen un tipo de modelo muy concreto: no el más inteligente disponible, sino el que se mantiene preciso mientras responde lo bastante rápido para una línea telefónica.
Las interrupciones dejaron de delatarlo
El mayor cambio respecto a 1.0 es el Full Duplex Bench, que mide cómo maneja un modelo las partes desordenadas de una conversación real: interrupciones, solapamientos, señales de escucha, alguien que cambia de opinión a mitad de frase. La versión 1.0 obtenía 77.8%. La 2.0 obtiene 95.1%.
Esa es la cifra que separa a un agente de voz que la gente tolera de uno que hace olvidar que es una máquina. Cualquiera que haya escuchado grabaciones de llamadas conoce el fallo típico: quien llama empieza a corregirse, el bot sigue hablando por encima, y la persona termina repitiéndose más alto o pidiendo hablar con un humano. Está cerca de lo más alto en cualquier lista de problemas de los chatbots que hacen que los clientes se rindan, y los patrones de transferencia de cualquier despliegue serio existen sobre todo para capturar ese momento exacto.
Vale la pena señalar, en justicia, que esta es la única fila donde Grok pierde frente a OpenAI. GPT-Realtime-2.1 High obtiene 95.7%. Una diferencia de 0.6 puntos no es algo que ninguna persona que llame vaya a percibir jamás, pero la tabla de lanzamiento tampoco se va a molestar en aclararlo.
La puntuación agéntica es el verdadero titular
τ-voice mide si un modelo puede realmente completar una tarea por voz, en lugar de limitarse a sonar bien mientras lo intenta. Buscar un pedido, comprobar una política y luego llamar a una función y devolver la respuesta correcta. Grok Voice Think Fast 2.0 obtiene 56.5% aquí, la cifra más alta de toda la tabla de Artificial Analysis.

Esto importa más que el índice general para quien construye un agente real, porque un agente de voz que no puede usar herramientas de forma fiable es un lector de preguntas frecuentes muy caro. Es la misma distinción que separa a los agentes de IA de los chatbots de IA en texto, y la misma razón por la que los ejemplos útiles de agentes de IA son siempre aquellos que tocan un sistema real en lugar de recitar un artículo.
La salvedad honesta: Qwen Audio 3.0 Realtime Plus se sitúa en 54.6% en el mismo benchmark. Así que la ventaja de Grok es de 1.9 puntos, que no es el abismo que sugiere el enfoque publicitario. La diferencia frente al mejor resultado de OpenAI, 45.7%, es más amplia, y de ahí sale la frase de "10 puntos por delante", pero Qwen está justo ahí al lado.
La combinación de velocidad e inteligencia
0.70s hasta el primer audio, frente a los 1.25s de la versión 1.0. Deepslate Opal es más rápido, con 0.44s, y una variante de Gemini Flash llega a 0.63s, así que Grok queda tercero. Pero Qwen, el modelo que le supera en el índice general, tarda 4.02s en emitir el primer audio. En una línea telefónica eso es una pausa muerta lo bastante larga como para que quien llama diga "¿hola?".
Ese equilibrio es el producto real. Alguien en Hacker News lo expresó mejor que el propio anuncio de lanzamiento.
"Grok voice is the best voice AI voice assistant and it's not even close.
The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
xAI también afirma que los tokens de razonamiento funcionan al 0.4x del P50 de su predecesor, que es cómo se volvió más rápido volviéndose más inteligente, en lugar de pensar menos.
La transcripción es la parte infravalorada
Enterrado en el anuncio de lanzamiento: la precisión de la transcripción es 1.4 veces mejor que en 1.0, y de 1.5 a 2.0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas. En audio con ruido o de telefonía, la diferencia reclamada ronda las 10 veces.
El audio de telefonía es donde la transcripción suele fallar más, y es exactamente el tipo de audio que una línea de soporte maneja todo el día. Si estás evaluando esto frente a ElevenLabs o un proveedor especializado en voz a texto, esa cifra de audio ruidoso merece más peso que los benchmarks conversacionales. Es también el terreno en el que el endpoint de transcripción de OpenAI ha sido la opción por defecto, en gran parte por inercia.
Ahora hay 26 voces en el catálogo, tras añadirse 21 en julio de 2026, y cualquiera de ellas se puede sustituir por un identificador de voz clonada. Si alguna vez has luchado por mantener a un bot sonando como tu marca en distintos canales, el problema de la voz de marca no desaparece solo porque el resultado sea audio.
Dónde la tabla de benchmarks lo vende mejor de lo que es
Tres cosas que el enfoque del lanzamiento no cuenta.
El 82.9% es el segundo puesto. Qwen Audio 3.0 Realtime Plus tiene 84.1%. Grok es competitivo frente a él, y mucho más rápido, pero "estado del arte" está haciendo bastante trabajo en la copia de marketing. Si has seguido la familia de modelos de Qwen o lo que cobra Alibaba últimamente, sabrás que están lanzando productos a un ritmo intenso.
No compares entre sí las dos cifras de τ-voice de xAI. El artículo del Voice Agent Builder del 1 de julio reporta que Think Fast 1.0 obtuvo 67.3% en su propia medición de τ-voice. Artificial Analysis puntúa el mismo modelo con 52.1%. Arneses distintos, escalas distintas. Cualquiera que apile esas dos cifras en un gráfico de "mira cuánto ha mejorado" no está comparando nada real. La misma cautela aplica a las cifras del precio del Voice Agent Builder, que todavía cita la tarifa antigua.
Las cifras de Starlink pertenecen a 1.0. El 20% de conversión de ventas y el 70% de resolución autónoma, tan citados, provienen de la línea +1 888 GO STARLINK con 28 herramientas conectadas, y son resultados de Think Fast 1.0. Para 2.0, xAI dice que las pruebas A/B en esa misma línea mostraron "un aumento significativo" en conversión y contención, sin publicar ninguna cifra. Además, se trata de un despliegue interno dentro de la misma estructura de propiedad, lo que lo convierte más en el mejor caso posible que en algo representativo.
Construir sobre él: la API es la parte buena
Esperaba que la documentación fuera el punto débil aquí y resultó ser justo lo contrario. En cuanto a diseño, es la API de voz en tiempo real más cuidada que he leído.

Es compatible a nivel de protocolo con OpenAI Realtime en wss://api.x.ai/v1/realtime, así que si ya tienes una aplicación existente, la migración se reduce a una URL base y una clave. Incluso puedes conservar el SDK de OpenAI y apuntarlo simplemente a https://api.x.ai/v1. Hay cuatro cosas que no se conservan: conversation.item.done, rate_limits.updated y la mayoría de los eventos output_audio_buffer.* no se emiten, y ...input_audio_transcription.delta pasa a llamarse .updated y se vuelve acumulativo, lo que corromperá en silencio la visualización de tu transcripción si estabas concatenando los deltas.
Las extensiones exclusivas de xAI son donde la cosa se pone interesante, y parecen escritas por gente que ya había lanzado un agente telefónico y se había quemado con él:
force_messagedice una frase codificada mediante TTS sin involucrar al modelo en absoluto. Coninterruptible: false, el audio de quien llama se descarta hasta que termina. Esto resuelve de forma adecuada el problema del aviso de cumplimiento normativo, en lugar de confiar a ciegas en que tu prompt del sistema aguante.replacees un mapa de pronunciación que se aplica antes del TTS, de modo que el audio dice "Acme Mobull" mientras la transcripción sigue leyendo "Acme Mobile". La coincidencia no distingue mayúsculas de minúsculas, respeta los límites de palabra completa y prioriza la coincidencia más larga.resumptionguarda en caché los turnos porconversation_idy los reproduce al reconectar. Está desactivado por defecto, ambas partes deben activarlo explícitamente, y el historial caduca tras 30 minutos de inactividad.keytermssesga la transcripción hacia hasta 100 términos de dominio de 50 caracteres cada uno, actualizables durante la sesión. Para una línea de soporte llena de SKU y nombres de planes, esto marca la diferencia entre una transcripción utilizable y un desastre.idle_timeout_msse rearma después de cada respuesta, así que el agente puede volver a intentar contactar a alguien que se ha quedado en silencio repetidamente, en lugar de quedarse esperando.
El parámetro reasoning.effort acepta exactamente dos valores: "high" (el predeterminado) y "none". No hay un ajuste intermedio, y eso es una carencia real. Alguien planteó justo esto en Hacker News sobre un lanzamiento anterior de voz de Grok:
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models
Just give me a option to have a slower response but better model…"
Hay otra cosa que la documentación acierta y que la mayoría de proveedores dejan para que la descubras en producción: te indican explícitamente que esperes a que termine la reproducción del audio antes de enviar response.create tras una llamada a herramienta, porque el servidor entrega todos los deltas de audio antes que los eventos de llamada a función. Saltarte eso produce audio solapado. Incluso sugieren mostrar un indicador de "pensando" durante ese hueco. Es un detalle aprendido a base de golpes, y está escrito.
El propio consejo de la guía de migración es hacer tu prompt del sistema más corto, no más largo, lo cual dice bastante sobre cómo se ha ajustado el modelo.
Los tres límites que realmente frenarán tu lanzamiento
Si yo estuviera evaluando esto, esta sería la sección que leería primero.

10 sesiones simultáneas por equipo. Este es el valor por defecto publicado en la ficha del modelo, que se puede ampliar bajo petición. Diez llamadas simultáneas es apenas lo que supone un lunes por la mañana para un equipo pequeño de soporte. Todos los benchmarks anteriores son irrelevantes si la llamada número once no puede conectar, y "ampliable bajo petición" es una conversación comercial, no una opción de configuración. Cualquiera que esté dimensionando un agente de IA para centros de llamadas debería tratar esto como la primera pregunta, no como una nota al pie.
Como comparación, los productos de voz empaquetados que se construyen sobre un helpdesk no suelen publicar ningún techo de sesiones, porque la concurrencia es problema del proveedor y no tuyo. Eso ocurre con los agentes de voz con IA de Zendesk, con la configuración de Freshcaller, y con el agente de voz de Salesforce. Cambias flexibilidad por que otro se ocupe de la planificación de capacidad.
Solo us-east-1. Una única región, sin opción en la UE. Si tienes compromisos de residencia de datos, esto lo decide todo antes de que evalúes nada más.
Sin nivel prioritario ni descuento por lotes. El nivel prioritario 2x solo aplica a Chat Completions y Responses. El descuento del 20% por lotes solo aplica a modelos de texto. La voz no tiene ni carril rápido ni rebaja por volumen, así que la tarifa que ves es la tarifa que pagas a cualquier escala. También hay una duración máxima de sesión de 120 minutos, generosa para soporte y algo ajustada para cualquier cosa parecida a una línea monitorizada.
Dos detalles menores que conviene conocer. El almacenamiento se factura aparte si tu agente hace recuperación de información: las colecciones cuestan $0.10/GiB/día, los archivos $0.025, y las descargas $0.20/GiB. Y hay una tarifa de $0.05 por infracción de las normas de uso por cada petición de Responses bloqueada antes de generarse.
¿Deberías pasar a 2.0 o quedarte con 1.0?
El cambio de alias del 5 de agosto hace que no hacer nada sea ya, en sí mismo, una decisión. Elige la fila que te describa.
¿Qué estás usando actualmente?
Elige una opción. El veredicto cambia mucho según cuál de estas seas.
A volumen de demo, la subida del 60% es un error de redondeo, y el salto de Full Duplex de 77.8% a 95.1% marca la diferencia entre una demo que convence y una que no. Deja que el cambio de alias te lleve sin más.
Tu coste por minuto pasa de $0.05 a $0.08 el 5 de agosto sin ningún despliegue de tu parte. A 2.000 minutos al mes son entre $100 y $160 más. La mejora en la fluidez conversacional lo justifica, pero pon la cifra delante de quien tenga que aprobarla antes de que lo haga la factura.
10 sesiones simultáneas por equipo es el valor por defecto publicado, y aumentarlo es una conversación con xAI, no un cambio de configuración. Consigue ese número por escrito antes de evaluar nada más. Una puntuación de 95.1% en Full Duplex no hace nada por la llamada número once.
La voz a voz solo funciona en us-east-1, sin ninguna región de la UE publicada. Ninguna puntuación de este artículo cambia eso. Vuelve a evaluarlo cuando xAI publique una segunda región.
Lo que dice la gente que construye con él
X es el hogar natural de las reacciones a xAI y ahora mismo es difícil de leer con profundidad, así que la señal útil está en Hacker News. Dos hilos concentran casi todo.
El comentario más votado en el hilo de Think Fast 2.0 es, en esencia, una queja sobre lo poco notado que ha pasado el lanzamiento:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
Es una lectura justa sobre la capacidad, y vale la pena señalar que el precio también se ha alineado ahora. Todos los planes de pago de ElevenLabs Agents equivalen a casi exactamente $0.08 por minuto incluido, que es la nueva tarifa de Grok al céntimo. Hasta el 5 de agosto, Grok lo abarataba en un 37.5%.
La opinión más mesurada, de unos meses antes, sigue siendo válida:
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
Es más o menos donde yo también me quedo. Un modelo de voz siempre es un compromiso frente a un modelo de texto que puede pensar durante diez segundos, y Grok logra un mejor compromiso que el resto del campo. Lee las reseñas del lado del consumidor y verás el mismo veredicto expresado con menos cuidado.
La frustración recurrente en estos hilos es el uso de herramientas en modo voz, y merece la pena aclararlo porque juega en ambas direcciones:
"What I'm missing from this announcement is the capability to use connectors and tools. I don't really get it - NONE of the frontier assistants can use tools / connectors while in voice mode"
Eso se refiere a los asistentes de voz de consumo, y en el lado de la API no es cierto para Grok: las sesiones admiten herramientas function, file_search, web_search, x_search y mcp remotas, con las del lado del servidor ejecutándose por ti. Las herramientas del servidor se facturan por invocación, a $5 por cada 1.000 para búsqueda web y en X, $2.50 por cada 1.000 para colecciones, y $10 por cada 1.000 para búsqueda de archivos adjuntos. La brecha que describe el comentario es real en la aplicación de consumo de Grok, no en lo que construirías tú mismo. Es la misma división que recorre el despliegue de voz de ChatGPT: la API lleva tiempo por delante de la aplicación.
Quién debería adoptarlo, y quién debería esperar
Adóptalo si estás construyendo un agente telefónico o de voz que tiene que hacer cosas, no solo hablar. La puntuación τ-voice, el soporte de herramientas, las extensiones force_message y keyterms, y el medidor plano por minuto suman el stack de voz más amigable para desarrolladores que hay actualmente en producción. Migrar desde el audio en tiempo real de OpenAI es casi gratis.
Adóptalo si la previsibilidad de costes importa a tu departamento de finanzas. Artificial Analysis mide el coste real de Grok en $4.80 por hora de audio de entrada, idéntico al precio de lista, porque el medidor es plano por minuto. GPT-Realtime-2 tiene un precio de lista de $1.15/h de entrada y mide $4.14 todo incluido. Las facturas de voz que coinciden con su precio anunciado son más raras de lo que deberían, lo que explica en parte por qué la pregunta sobre el coste del agente frente al humano es tan difícil de responder con honestidad.
Adóptalo si quieres construir tú mismo la orquestación. Si prefieres arrastrar cajas de un lado a otro, el precio de Voiceflow y las alternativas al Voice Agent Builder son el extremo sin código del mismo mercado.
Espera si tu volumen supera las diez llamadas simultáneas y todavía no tienes un límite ampliado por escrito. Espera si necesitas una región en la UE. Espera si dependías de la tarifa de $0.05 y no te habías dado cuenta de que el alias se movía bajo tus pies, en cuyo caso fija hoy mismo grok-voice-think-fast-1.0 y decide con tu propio calendario.
No lo compres como solución de soporte. Esto es un modelo y una API, no un agente de helpdesk. No tiene ni idea de tu historial de tickets, tus macros, tus reglas de escalado, ni de qué preguntas tu equipo ya ha decidido que la IA no debe tocar. Todo lo anterior trata sobre la capa de voz, y la capa de voz es como mucho el 20% de lo que hace que una automatización de soporte funcione de verdad. El resto es la parte aburrida: conocer tu producto, saber cuándo parar, y transferir la conversación con limpieza.
Una responsable de CX en una marca DTC de suplementos expresó esa limitación mejor que cualquier ficha técnica:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Ningún benchmark de voz mide eso. Es una cuestión de política, y es la que decide si un despliegue sobrevive a su primer mes.
La voz es la mitad más ruidosa de una cola de soporte
La mayoría de los tickets que acaban convirtiéndose en llamadas telefónicas podían haberse respondido por texto una hora antes. La automatización de la primera respuesta y un chatbot de base de conocimiento que la IA pueda leer de verdad eliminan más llamadas que cualquier modelo de voz. Eso es lo que vale la pena arreglar antes de salir a comprar uno.
eesel es un agente de IA que se conecta al helpdesk que ya usas, se entrena con tus tickets pasados y tu centro de ayuda en lugar de con un prompt de sistema que tienes que escribir a mano, y te deja simular todo el proceso contra tu historial real de tickets antes de que un solo cliente lo toque. Esa última parte es deliberada. He pasado años viendo bots que suenan seguros de sí mismos dar respuestas equivocadas, y una prueba en seco sobre tickets que ya has resuelto es la única forma honesta de saber qué hará el tuyo. También es el paso que separa a un agente de IA real de un bot basado en reglas cuando se acaban las rutas predefinidas.
Es la misma decisión de construir frente a comprar a la que llegan muchos equipos después de leer una página de documentación como la de xAI y entender cuánto de eso terminarían manteniendo ellos mismos:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Si también te interesa la capa de voz, sigue leyendo sobre el Voice Agent Builder de Grok y el panorama más amplio de empresas de voz con IA. Si quieres resolver primero la cola que hay detrás, eesel es gratis para probar y se conecta a tu helpdesk en cuestión de minutos. Los equipos que usan Gorgias o Zendesk suelen tenerlo respondiendo tickets reales esa misma tarde.
Tres cosas que vale la pena leer después, según en qué punto de todo esto estés atascado:
- Si todavía estás decidiendo el modelo: la visión general de Think Fast 2.0 cubre el mecanismo con más profundidad.
- Si estás calculando la factura: el desglose completo de precios hace los números a cuatro volúmenes distintos.
- Si estás comparando el panorama: alternativas a ElevenLabs es la comparación más cercana al mismo precio.
Preguntas frecuentes
¿Es Grok Voice Think Fast 2.0 lo bastante bueno para agentes de voz en producción?
us-east-1. Lee el análisis completo de Grok Voice Think Fast 2.0 para conocer el mecanismo a fondo, y agentes de IA para centros de llamadas para saber qué suele necesitar un despliegue en producción.¿Qué hay de nuevo en Grok Voice Think Fast 2.0 respecto a 1.0?
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
grok-voice-latest. Compáralo con el precio de ElevenLabs y con el panorama más amplio de empresas de voz con IA antes de decidirte.¿Puedo migrar una aplicación de OpenAI Realtime a Grok Voice?
wss://api.x.ai/v1/realtime, así que cambiar la URL base y la clave cubre casi todo. Cuatro tipos de eventos se comportan de forma distinta, algo que se detalla en la sección de migración más abajo. Si construiste tu aplicación sobre la API de audio de OpenAI, calcula una tarde de trabajo, no un sprint entero.¿Es Grok Voice Think Fast 2.0 mejor que ElevenLabs para llamadas de soporte?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








