
A qué me refiero exactamente con "modelo de voz"
Llevo un par de años integrando eesel en helpdesks, lo que significa que he leído muchas páginas de proveedores sobre IA que responde a clientes. La voz es la única categoría donde la afirmación arquitectónica es real y verificable, así que vale la pena ser preciso al respecto.
La mayoría de los stacks de voz son tres productos disfrazados de uno solo: voz a texto, un modelo de lenguaje, y luego texto a voz, a menudo de tres proveedores distintos. Cada salto añade latencia, costo, y una cosa más que puede fallar a las 2 de la mañana. El propio planteamiento de xAI en el lanzamiento del Voice Agent Builder fue que esto es justo lo que se propusieron colapsar, y Think Fast 2.0 es el modelo que hace ese trabajo.

Los modelos Think Fast hacen algo específico que no había visto productizado antes: razonan mientras ya están hablando. xAI lo describe como razonar en paralelo con el habla, así que el pensamiento no se interpone antes de la primera sílaba. En la práctica, una llamada a herramienta suele dispararse antes de que el agente termine su primera frase. Ese es todo el truco detrás de los 0.70 segundos, y explica por qué el modelo puede ser rápido y a la vez inusualmente bueno en trabajo de varios pasos, dos cosas que normalmente van en contra la una de la otra.
Think Fast 2.0 también recortó fuerte los tokens de razonamiento. xAI reporta que la respuesta mediana usa 0.4x los tokens de razonamiento de Think Fast 1.0, el tipo de cambio que se nota en una llamada larga más que en una demo.
La tabla de benchmarks, y las dos filas que la gente se salta
Esto es lo que xAI publicó el día del lanzamiento, con fuente en Artificial Analysis.
| Benchmark | Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|---|
| AA Speech-to-Speech Quality Index | 82.9% | 75.7% | 79.1% | 69.5% |
| Razonamiento de voz (Big Bench Audio) | 97.2% | 97.1% | 96.0% | 96.6% |
| Dinámica conversacional (Full Duplex Bench) | 95.1% | 77.8% | 95.7% | 74.3% |
| Rendimiento agéntico (τ-voice Bench) | 56.5% | 52.1% | 45.7% | 37.7% |
| Tiempo hasta el primer audio | 0.70s | 1.25s | 1.21s | 2.98s |
Hay un par de cosas que señalaría si estuvieras leyendo esto por encima de mi hombro.
Primero, la fila que más importa para soporte es τ-voice Bench con 56.5%, y Grok la gana por casi 11 puntos sobre lo mejor de OpenAI. τ-voice mide agentes en condiciones de llamada realistas: ruido, acentos, interrupciones, personas que cambian de opinión a media frase. Es la aproximación publicada más cercana a "puede esto ejecutar un flujo de trabajo real en una línea telefónica real". Un techo de 56.5% también significa que aproximadamente dos de cada cinco de esos escenarios difíciles siguen fallando, la cifra que pondría delante de cualquiera que prometa automatización total.
Segundo, la fila de dinámica conversacional es la que xAI no gana. GPT-Realtime-2.1 High la supera 95.7% frente a 95.1%, y el salto de Grok viene desde 77.8%, así que este fue claramente el foco de la corrección en este lanzamiento. Hay que reconocerlo: es un avance de 17 puntos.
Ahora el contexto que la propia tabla de xAI omite. Si abres el ranking completo de Artificial Analysis, Think Fast 2.0 queda segundo en general, no primero. Qwen Audio 3.0 Realtime Plus de Alibaba está en 84.1%. También tarda 4.02 segundos en empezar a hablar, frente a 0.70, lo cual en una línea telefónica es la diferencia entre una conversación y un silencio muerto. Misma historia en latencia: Deepslate Opal responde en 0.44s y Gemini 2.5 Flash Native Audio Dialog en 0.63s, ambos más rápidos que Grok, y ambos bastante por detrás en el índice. La afirmación de Grok es la combinación, y en esa combinación es lo mejor de esa tabla.
El cambio de alias del 5 de agosto, en dólares
Esta es la parte que de verdad pondría en un recordatorio de calendario.

Según la página de precios de xAI, la tabla de tarifas de voz dice así:
| Modelo o modo | Tarifa |
|---|---|
Speech to speech, grok-voice-think-fast-1.0 | $0.05 / min ($3.00 / h) audio, $0.004 / entrada de texto |
Speech to speech, grok-voice-think-fast-2.0 | $0.08 / min ($4.80 / h) audio, $0.004 / entrada de texto |
| Speech to text | $0.10 / h (REST), $0.20 / h (streaming) |
| Text to speech | $15.00 / 1M caracteres |
La postura de xAI sobre la migración es que no hace falta hacer nada para actualizar, y que para quedarse en 1.0 hay que fijar grok-voice-think-fast-1.0 antes del 5 de agosto. Ambas partes son ciertas. Lo que no se dice en voz alta es que la ruta por defecto es la más cara, y un aumento del 60% por minuto llega sin que despliegues nada de tu lado. Si manejas algo de volumen, calcula lo que te cuesta antes de que llegue en lugar de después.
Otros dos medidores viajan junto con esto. Un número de teléfono aprovisionado en el Voice Agent Builder cuesta $0.01 por minuto adicional. Las herramientas del lado del servidor se facturan por invocación: búsqueda web y búsqueda en X a $5 por cada 1,000 llamadas, búsqueda en colecciones de documentos a $2.50 por cada 1,000, y búsqueda de archivos adjuntos a $10 por cada 1,000. Un agente de soporte que consulta algo en casi cada llamada compra esto por miles, así que hay que incluirlo en el modelo de costos.
Lo que te cuesta el 5 de agosto
Elige tu tiempo de conversación mensual. Las tarifas son las publicadas por xAI más $0.01/min por un número aprovisionado.
Una advertencia al comparar esto con cualquier otro: xAI publica un precio fijo por minuto, mientras que OpenAI y Google cobran por token de audio. Artificial Analysis lo normaliza como costo por hora de audio de entrada, y en esa base Think Fast 2.0 marca $4.80, GPT-Realtime-2.1 High marca $10.75, y Gemini 3.1 Flash High marca $1.75. La cifra de Grok es exactamente 60 veces su tarifa por minuto publicada, así que es una tarifa real. Las otras dos son mediciones de una sola corrida de benchmark, y se moverán según lo hablador que sea tu agente. Si estás eligiendo entre ellas, lee bien los precios de la API Realtime de OpenAI en lugar de confiar en una sola columna normalizada.
La transcripción es la mejora silenciosa
La tabla de benchmarks se lleva la atención, pero creo que el trabajo de transcripción es el cambio más útil si vas a poner esto en una línea telefónica.
xAI evaluó miles de frases cortas en 24 idiomas y reporta que Think Fast 2.0 supera a los modelos de transcripción dedicados: de 1.5x a 2.0x mejor tasa de error de palabras que Deepgram Nova 3 y ElevenLabs Scribe v2, y 1.4x mejor que Think Fast 1.0. La afirmación que más me importa es la del ruido, donde dicen que la brecha frente a la transcripción de voz dedicada se amplía a casi 10x bajo ruido de fondo y compresión de telefonía.
Esa es la condición real de las llamadas de soporte. Nadie llama a soporte desde una cabina de grabación. Llaman desde un coche, un almacén, una cocina con un niño de fondo. Si alguna vez viste una transcripción convertir "cancelar mi pedido" en otra cosa completamente distinta, sabes que una sola palabra mal transcrita es un flujo de trabajo entero equivocado. Cualquiera que gestione soporte multilingüe debería mirar el gráfico por idioma del anuncio en lugar del promedio, porque la dispersión entre esos 24 idiomas es amplia.
Hay dos parámetros de sesión pensados específicamente para tapar las brechas que quedan, y vale la pena conocerlos desde el primer día. audio.input.transcription.keyterms sesga la transcripción hacia hasta 100 términos de 50 caracteres cada uno, que es donde van los nombres de tus SKUs y planes. replace mapea una frase a una sustitución hablada antes del texto a voz, así el audio dice el nombre de tu marca correctamente mientras la transcripción conserva la ortografía original. El ejemplo de la documentación mapea "Acme Mobile" a "Acme Mobull", lo cual dice exactamente lo poco glamurosa y necesaria que es esa función.
Lo que implica realmente construir sobre esto
Leí la documentación de speech-to-speech de la misma forma en que leo cualquier API que podría tener que soportar después, buscando las partes que morderán más adelante. Aquí van algunas notas de esa lectura.
La API es compatible a nivel de cableado con la API Realtime de OpenAI. Apuntas el WebSocket a wss://api.x.ai/v1/realtime, cambias la clave, y la mayoría del código cliente existente funciona. Ese es un costo de cambio deliberadamente bajo, y es el argumento comercial más fuerte que tiene xAI aquí. No es una compatibilidad perfecta: conversation.item.done, rate_limits.updated y un puñado de eventos output_audio_buffer.* no se emiten, y conversation.item.input_audio_transcription.delta se renombra a .updated con cargas útiles acumulativas en lugar de incrementales. Si construiste algo sobre esos eventos, ese es tu trabajo de portabilidad. Las diferencias en la llamada a herramientas también valen la pena leerse.
Las herramientas vienen en cinco tipos: function para tus propias APIs, file_search sobre colecciones de documentos subidas, web_search, x_search, y servidores mcp remotos. El soporte de MCP es el que yo usaría, porque significa que tu herramienta interna existente es alcanzable sin escribir un shim específico para voz.
El razonamiento viene por defecto en esfuerzo high. Puedes poner reasoning.effort en "none" para desactivarlo. Vale la pena notarlo porque una queja real en Hacker News sobre la generación anterior fue justo la contraria:
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"
Hay tres extensiones específicas de xAI que señalaría a cualquiera que construya una línea de soporte:
force_messagedice una línea codificada y sintetizada por TTS sin involucrar al modelo, con una banderainterruptible. Así es como entregas "esta llamada está siendo grabada" textualmente, cada vez, lo cual es un requisito de cumplimiento, no un extra deseable.resumptionguarda en caché los turnos contra unconversation_idy los reproduce al reconectar. Está desactivado por defecto. Sin él, un WebSocket caído pierde la conversación, y los llamantes móviles pierden la conexión constantemente.idle_timeout_mshace que el servidor vuelva a interactuar con un llamante en silencio en un temporizador que se reactiva tras cada respuesta. Esa es la diferencia entre un agente paciente y un silencio incómodo.
El consejo de migración de la documentación es lo opuesto de lo que esperarías: haz tu prompt de sistema más corto, no más largo. La guía de xAI es pedirle a Grok que generalice tu prompt existente en lugar de portarlo tal cual, y quitar los trucos de prompt escritos para parchar los casos límite del modelo anterior. He hecho ese ejercicio con nuestros propios prompts en distintas actualizaciones de modelo. Es incómodo y normalmente es lo correcto; las soluciones alternativas que se van arrastrando son lo que hace que un prompt se vuelva poco a poco inmanejable.
¿Funciona en producción? Starlink es la única evidencia real
Los benchmarks son una cosa. El único despliegue sobre el que cualquiera de los dos anuncios da cifras es la línea de ventas y soporte de Starlink, que corre sobre Grok Voice, y las cifras que xAI publicó con Think Fast 1.0 vale la pena citarlas tal cual:
- 20% de tasa de conversión. Una de cada cinco consultas de venta compra el servicio de Starlink mientras habla por teléfono con Grok.
- 70% de tasa de resolución. La mayoría de las consultas de soporte se resuelven de forma autónoma sin humano en el circuito.
- 28 herramientas. Un agente, docenas de herramientas distintas, a través de cientos de flujos de trabajo de soporte y ventas.
- La resolución de problemas de hardware, los reemplazos de hardware y los créditos de servicio se conceden todos de forma autónoma.
Son cifras sólidas, y son de origen propio, lo cual funciona en ambas direcciones. Starlink y xAI comparten propietario, así que este es el mejor caso posible de despliegue, con la mayor atención de ingeniería disponible. Una tasa de resolución autónoma del 70% es real, y también es lo que obtienes con un equipo dedicado construyendo 28 herramientas para una sola línea de negocio.
Para Think Fast 2.0 en concreto, xAI dice que las pruebas A/B en esa misma línea de Starlink mostraron "un aumento significativo en la tasa de conversión de ventas y la tasa de contención de soporte" y no publica ninguna cifra para ninguna de las dos. Me gustaría tener el número. Hasta que exista, la lectura honesta es que la 2.0 es mejor en benchmarks y probablemente mejor en producción, según la palabra del proveedor.
La lectura de la comunidad es escasa por ahora, lo cual en sí mismo dice algo sobre quién está prestando atención. El hilo de lanzamiento en Hacker News reunió cinco puntos y dos comentarios:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
La señal más útil viene de gente que ha vivido con la generación anterior:
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
Y la versión más calibrada de la misma opinión, en la que más confiaría:
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
Quién debería realmente adoptarlo
Sí claro, si manejas una línea telefónica con volumen y la latencia es lo que te está matando. Menos de un segundo hasta el primer audio más la mejor puntuación agéntica publicada no es una decisión reñida frente a las alternativas, y la compatibilidad con OpenAI Realtime hace que tu prueba cueste un día, no un sprint. Cualquiera que esté montando automatización de call center desde cero debería incluirlo en su lista corta.
Sí claro, si eres desarrollador y quieres saltarte el stack. El Voice Agent Builder empaqueta telefonía, recuperación, guardarraíles y revisión de llamadas, con SIP para números que ya tienes. Eso es tiempo real ahorrado frente a ensamblar cuatro proveedores, y las alternativas casi todas cobran una tarifa de plataforma encima. Vale la pena notar que el modelo de voz tiene versión separada de la línea de texto, así que los lanzamientos de Grok 4.5 no lo mueven.
Todavía no, si tu volumen de soporte es email y chat. Este es el error que veo cometer a los equipos: ven un buen número de voz y empiezan a planificar un proyecto de desvío telefónico, cuando la mayor parte de su cola nunca marca a nadie. La voz es un canal, no una estrategia. Empieza por dónde están los tickets, y si tu línea telefónica ya está conectada a un helpdesk, revisa qué hace ya tu integración telefónica de Gorgias o equivalente antes de añadir un segundo stack.
Todavía no, si necesitas demostrar seguridad antes de salir en vivo. No hay una forma publicada de hacer un ensayo de Think Fast 2.0 contra tus propias llamadas históricas antes de dirigirle tráfico. La grabación de llamadas, las transcripciones y los guardarraíles existen todos después del hecho, en el Builder. Eso es revisión, no ensayo, y la distinción importa cuando el agente puede emitir reembolsos. La misma brecha aparece en toda la categoría, por lo que prevenir respuestas de IA incorrectas es sobre todo un problema de proceso, no de modelo.
Con cuidado si ya estás en grok-voice-latest. Mira la calculadora de arriba. Mañana.
¿Quieres lo mismo para tu cola de tickets?
Grok Voice es bueno en el teléfono. El problema es que para la mayoría de los equipos de soporte el teléfono es el canal pequeño, y la cola de tickets es donde vive realmente el volumen.
Esa es la mitad que hace eesel. Se conecta a Zendesk, Freshdesk, Gorgias, Front, HubSpot y el resto, entrena con tus tickets pasados, macros y centro de ayuda en lugar de un prompt que tienes que escribir desde cero, y redacta o envía respuestas dentro del helpdesk que tus agentes ya tienen abierto. Ninguna herramienta nueva que nadie tenga que aprender.
Lo que señalaría, dado todo lo anterior sobre la brecha entre un benchmark y una cola real: antes de activarlo, eesel simula el agente contra tu propio historial de tickets y te dice qué habría respondido y con qué frecuencia. Ese es el paso de ensayo que a los stacks de voz les falta. Existe porque he visto a un bot que suena seguro de sí mismo responder mal, y prefiero descubrirlo en los tickets del mes pasado que en los de esta mañana.
La opinión de un cliente sobre por qué ese paso importa, una cita anonimizada de un líder de CX de una empresa de suplementos DTC con la que hablamos:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Eso es la configuración, no una advertencia. Enrutamiento por confianza, exclusión por tipo de ticket, y una simulación antes de salir en vivo.

Gratis para probar, y puedes tenerlo respondiendo tus propios tickets en unos minutos. Prueba eesel.
Preguntas frecuentes
¿Qué es Grok Voice Think Fast 2.0?
El modelo de voz speech-to-speech insignia de xAI, anunciado el 29 de julio de 2026, que escucha, razona y habla en una sola ruta de modelo en lugar de encadenar tres servicios. Esa ruta única es de donde vienen los 0.70 segundos hasta el primer audio. Se convierte en el modelo detrás de grok-voice-latest el 5 de agosto de 2026. Si tu objetivo es email y chat en lugar de llamadas, un agente de IA para helpdesk encaja mejor.
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
$0.08 por minuto de audio, o $4.80 por hora, más $0.004 por entrada de texto. Think Fast 1.0 se sigue listando a $0.05 por minuto, así que el precio de Grok Voice Think Fast 2.0 supone un aumento del 60% por minuto. Un número aprovisionado añade $0.01 por minuto, y las llamadas a herramientas se facturan por separado. Sopésalo frente a tu panorama más amplio de costo de la atención al cliente con IA, y frente a lo que cuesta un agente humano.
¿Es Grok Voice Think Fast 2.0 más rápido que GPT-Realtime?
Sí, según la medición publicada: 0.70 segundos hasta el primer audio frente a 1.21 segundos de GPT-Realtime-2.1 High. No es el modelo más rápido del tablero, sin embargo. Deepslate Opal responde en 0.44s y Gemini 2.5 Flash Native Audio Dialog en 0.63s, ambos más abajo en el índice de calidad. La comparación de la API Realtime de OpenAI cubre la contrapartida desde el otro lado, incluyendo WebRTC frente a WebSocket como transporte.
¿Tengo que actualizar desde Think Fast 1.0?
Solo si no haces nada. El 5 de agosto de 2026, grok-voice-latest cambia de apuntar de grok-voice-think-fast-1.0 a grok-voice-think-fast-2.0, así que fijar la versión antigua antes de esa fecha es lo que te mantiene en ella. Fijar versiones en producción es buena práctica de todos modos, el mismo instinto detrás de probar las respuestas de IA antes de que las vean los clientes.
¿Puede Grok Voice Think Fast 2.0 gestionar llamadas de soporte al cliente?
Está diseñado exactamente para eso. La línea de Starlink corre sobre Grok Voice con 28 herramientas, 70% de resolución autónoma y 20% de conversión de ventas, y el modelo hace llamadas a funciones, búsqueda de documentos, MCP y transferencia a humanos. El planteamiento realista está en si la IA puede responder llamadas de soporte, y el lado operativo en cómo automatizar el soporte telefónico y en la gestión de escalamiento de IA.
¿Cuál es la precisión de transcripción de Grok Voice Think Fast 2.0?
xAI reporta una tasa de error de palabras 1.4x mejor que Think Fast 1.0 y de 1.5x a 2.0x mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas, ampliándose a casi 10x en audio ruidoso. Revisa el gráfico por idioma en lugar del promedio si gestionas soporte multilingüe, porque la precisión varía según el idioma y es la cola la que perjudica tu CSAT.
¿Grok Voice funciona con Zendesk o Gorgias?
No de forma nativa. Grok Voice es un modelo y un builder, así que cualquier escritura de vuelta al helpdesk es una herramienta de función o un servidor MCP que conectas tú mismo. Si quieres IA dentro del helpdesk en su lugar, empieza con Zendesk AI o Freddy de Freshdesk. Del lado de la telefonía, la configuración de Zendesk Talk es el equivalente nativo más cercano. En cualquier caso, trata la voz como un canal más que alimenta la misma cola.
¿Vale la pena Grok Voice Think Fast 2.0 frente a Think Fast 1.0?
Para una carga de trabajo agéntica exigente, probablemente sí: 82.9% frente a 75.7% en general, más casi la mitad de latencia y un salto de 17 puntos en dinámica conversacional. Para una línea de FAQ sencilla donde 1.0 ya resuelve lo que necesitas, el aumento de tarifa del 60% te compra una precisión que quizá no uses. Compáralo con tu propia tasa de resolución y el ROI del call center antes de dejar que el alias decida por ti. Si estás comparando toda la línea, los precios de xAI es la siguiente parada.
Sources
- Grok Voice Think Fast 2.0, xAI, July 29, 2026
- Grok Voice Think Fast 1.0, xAI, April 23, 2026
- Introducing the Voice Agent Builder, xAI, July 1, 2026
- 21 New Flagship Grok Voices, xAI, July 6, 2026
- xAI pricing, voice API rates, last updated July 3, 2026
- Speech to Speech API docs, xAI, last updated August 2, 2026
- Speech to Speech models leaderboard, Artificial Analysis
Preguntas frecuentes
¿Qué es Grok Voice Think Fast 2.0?
grok-voice-latest el 5 de agosto de 2026. Si tu objetivo es responder email y chat en vez de llamadas telefónicas, un agente de IA para helpdesk encaja mejor.¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
¿Es Grok Voice Think Fast 2.0 más rápido que GPT-Realtime?
¿Tengo que actualizar desde Grok Voice Think Fast 1.0?
grok-voice-latest deja de apuntar a grok-voice-think-fast-1.0 y empieza a apuntar a grok-voice-think-fast-2.0. Para quedarte en el modelo anterior, más barato, fija explícitamente grok-voice-think-fast-1.0 antes de esa fecha. Fijar la versión es justo lo que xAI recomienda para producción de todos modos, la misma disciplina de la que depende prevenir respuestas de IA incorrectas.¿Puede Grok Voice Think Fast 2.0 gestionar llamadas de soporte al cliente?
¿Cuál es la precisión de transcripción de Grok Voice Think Fast 2.0?
¿Cómo se compara el precio de Grok Voice Think Fast 2.0 con otras APIs de voz?
¿Dónde no ayuda Grok Voice Think Fast 2.0?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








