Grok Voice Think Fast 2.0: qué cambió y cuánto cuesta

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Ilustración de línea de un agente de soporte con auriculares junto al logo de Grok, con una forma de onda de voz en un globo de diálogo

A qué me refiero exactamente con "modelo de voz"

Llevo un par de años integrando eesel en helpdesks, lo que significa que he leído muchas páginas de proveedores sobre IA que responde a clientes. La voz es la única categoría donde la afirmación arquitectónica es real y verificable, así que vale la pena ser preciso al respecto.

La mayoría de los stacks de voz son tres productos disfrazados de uno solo: voz a texto, un modelo de lenguaje, y luego texto a voz, a menudo de tres proveedores distintos. Cada salto añade latencia, costo, y una cosa más que puede fallar a las 2 de la mañana. El propio planteamiento de xAI en el lanzamiento del Voice Agent Builder fue que esto es justo lo que se propusieron colapsar, y Think Fast 2.0 es el modelo que hace ese trabajo.

Comparación de un pipeline de voz a texto, LLM y texto a voz unidos entre sí frente a una única ruta de modelo speech-to-speech
Comparación de un pipeline de voz a texto, LLM y texto a voz unidos entre sí frente a una única ruta de modelo speech-to-speech

Los modelos Think Fast hacen algo específico que no había visto productizado antes: razonan mientras ya están hablando. xAI lo describe como razonar en paralelo con el habla, así que el pensamiento no se interpone antes de la primera sílaba. En la práctica, una llamada a herramienta suele dispararse antes de que el agente termine su primera frase. Ese es todo el truco detrás de los 0.70 segundos, y explica por qué el modelo puede ser rápido y a la vez inusualmente bueno en trabajo de varios pasos, dos cosas que normalmente van en contra la una de la otra.

Think Fast 2.0 también recortó fuerte los tokens de razonamiento. xAI reporta que la respuesta mediana usa 0.4x los tokens de razonamiento de Think Fast 1.0, el tipo de cambio que se nota en una llamada larga más que en una demo.

La tabla de benchmarks, y las dos filas que la gente se salta

Esto es lo que xAI publicó el día del lanzamiento, con fuente en Artificial Analysis.

BenchmarkThink Fast 2.0Think Fast 1.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82.9%75.7%79.1%69.5%
Razonamiento de voz (Big Bench Audio)97.2%97.1%96.0%96.6%
Dinámica conversacional (Full Duplex Bench)95.1%77.8%95.7%74.3%
Rendimiento agéntico (τ-voice Bench)56.5%52.1%45.7%37.7%
Tiempo hasta el primer audio0.70s1.25s1.21s2.98s

Hay un par de cosas que señalaría si estuvieras leyendo esto por encima de mi hombro.

Primero, la fila que más importa para soporte es τ-voice Bench con 56.5%, y Grok la gana por casi 11 puntos sobre lo mejor de OpenAI. τ-voice mide agentes en condiciones de llamada realistas: ruido, acentos, interrupciones, personas que cambian de opinión a media frase. Es la aproximación publicada más cercana a "puede esto ejecutar un flujo de trabajo real en una línea telefónica real". Un techo de 56.5% también significa que aproximadamente dos de cada cinco de esos escenarios difíciles siguen fallando, la cifra que pondría delante de cualquiera que prometa automatización total.

Segundo, la fila de dinámica conversacional es la que xAI no gana. GPT-Realtime-2.1 High la supera 95.7% frente a 95.1%, y el salto de Grok viene desde 77.8%, así que este fue claramente el foco de la corrección en este lanzamiento. Hay que reconocerlo: es un avance de 17 puntos.

Ahora el contexto que la propia tabla de xAI omite. Si abres el ranking completo de Artificial Analysis, Think Fast 2.0 queda segundo en general, no primero. Qwen Audio 3.0 Realtime Plus de Alibaba está en 84.1%. También tarda 4.02 segundos en empezar a hablar, frente a 0.70, lo cual en una línea telefónica es la diferencia entre una conversación y un silencio muerto. Misma historia en latencia: Deepslate Opal responde en 0.44s y Gemini 2.5 Flash Native Audio Dialog en 0.63s, ambos más rápidos que Grok, y ambos bastante por detrás en el índice. La afirmación de Grok es la combinación, y en esa combinación es lo mejor de esa tabla.

El cambio de alias del 5 de agosto, en dólares

Esta es la parte que de verdad pondría en un recordatorio de calendario.

Diagrama de bifurcación que muestra a grok-voice-latest dividiéndose entre Think Fast 2.0 a $0.08 por minuto o un Think Fast 1.0 fijado a $0.05 por minuto
Diagrama de bifurcación que muestra a grok-voice-latest dividiéndose entre Think Fast 2.0 a $0.08 por minuto o un Think Fast 1.0 fijado a $0.05 por minuto

Según la página de precios de xAI, la tabla de tarifas de voz dice así:

Modelo o modoTarifa
Speech to speech, grok-voice-think-fast-1.0$0.05 / min ($3.00 / h) audio, $0.004 / entrada de texto
Speech to speech, grok-voice-think-fast-2.0$0.08 / min ($4.80 / h) audio, $0.004 / entrada de texto
Speech to text$0.10 / h (REST), $0.20 / h (streaming)
Text to speech$15.00 / 1M caracteres

La postura de xAI sobre la migración es que no hace falta hacer nada para actualizar, y que para quedarse en 1.0 hay que fijar grok-voice-think-fast-1.0 antes del 5 de agosto. Ambas partes son ciertas. Lo que no se dice en voz alta es que la ruta por defecto es la más cara, y un aumento del 60% por minuto llega sin que despliegues nada de tu lado. Si manejas algo de volumen, calcula lo que te cuesta antes de que llegue en lugar de después.

Otros dos medidores viajan junto con esto. Un número de teléfono aprovisionado en el Voice Agent Builder cuesta $0.01 por minuto adicional. Las herramientas del lado del servidor se facturan por invocación: búsqueda web y búsqueda en X a $5 por cada 1,000 llamadas, búsqueda en colecciones de documentos a $2.50 por cada 1,000, y búsqueda de archivos adjuntos a $10 por cada 1,000. Un agente de soporte que consulta algo en casi cada llamada compra esto por miles, así que hay que incluirlo en el modelo de costos.

Factura de la migración

Lo que te cuesta el 5 de agosto

Elige tu tiempo de conversación mensual. Las tarifas son las publicadas por xAI más $0.01/min por un número aprovisionado.

Aproximadamente, con una llamada promedio de 4 minutos500 llamadas / mes
Fijado a 1.0$120$100 voz + $20 telefonía
Migrado automáticamente a 2.0$180$160 voz + $20 telefonía
Diferencia: +$60 / mes (+$720 al año)
Aproximadamente, con una llamada promedio de 4 minutos2,500 llamadas / mes
Fijado a 1.0$600$500 voz + $100 telefonía
Migrado automáticamente a 2.0$900$800 voz + $100 telefonía
Diferencia: +$300 / mes (+$3,600 al año)
Aproximadamente, con una llamada promedio de 4 minutos12,500 llamadas / mes
Fijado a 1.0$3,000$2,500 voz + $500 telefonía
Migrado automáticamente a 2.0$4,500$4,000 voz + $500 telefonía
Diferencia: +$1,500 / mes (+$18,000 al año)
Aproximadamente, con una llamada promedio de 4 minutos50,000 llamadas / mes
Fijado a 1.0$12,000$10,000 voz + $2,000 telefonía
Migrado automáticamente a 2.0$18,000$16,000 voz + $2,000 telefonía
Diferencia: +$6,000 / mes (+$72,000 al año)
No incluye las invocaciones de herramientas del lado del servidor, facturadas por separado desde $2.50 por cada 1,000 llamadas.

Una advertencia al comparar esto con cualquier otro: xAI publica un precio fijo por minuto, mientras que OpenAI y Google cobran por token de audio. Artificial Analysis lo normaliza como costo por hora de audio de entrada, y en esa base Think Fast 2.0 marca $4.80, GPT-Realtime-2.1 High marca $10.75, y Gemini 3.1 Flash High marca $1.75. La cifra de Grok es exactamente 60 veces su tarifa por minuto publicada, así que es una tarifa real. Las otras dos son mediciones de una sola corrida de benchmark, y se moverán según lo hablador que sea tu agente. Si estás eligiendo entre ellas, lee bien los precios de la API Realtime de OpenAI en lugar de confiar en una sola columna normalizada.

La transcripción es la mejora silenciosa

La tabla de benchmarks se lleva la atención, pero creo que el trabajo de transcripción es el cambio más útil si vas a poner esto en una línea telefónica.

xAI evaluó miles de frases cortas en 24 idiomas y reporta que Think Fast 2.0 supera a los modelos de transcripción dedicados: de 1.5x a 2.0x mejor tasa de error de palabras que Deepgram Nova 3 y ElevenLabs Scribe v2, y 1.4x mejor que Think Fast 1.0. La afirmación que más me importa es la del ruido, donde dicen que la brecha frente a la transcripción de voz dedicada se amplía a casi 10x bajo ruido de fondo y compresión de telefonía.

Esa es la condición real de las llamadas de soporte. Nadie llama a soporte desde una cabina de grabación. Llaman desde un coche, un almacén, una cocina con un niño de fondo. Si alguna vez viste una transcripción convertir "cancelar mi pedido" en otra cosa completamente distinta, sabes que una sola palabra mal transcrita es un flujo de trabajo entero equivocado. Cualquiera que gestione soporte multilingüe debería mirar el gráfico por idioma del anuncio en lugar del promedio, porque la dispersión entre esos 24 idiomas es amplia.

Hay dos parámetros de sesión pensados específicamente para tapar las brechas que quedan, y vale la pena conocerlos desde el primer día. audio.input.transcription.keyterms sesga la transcripción hacia hasta 100 términos de 50 caracteres cada uno, que es donde van los nombres de tus SKUs y planes. replace mapea una frase a una sustitución hablada antes del texto a voz, así el audio dice el nombre de tu marca correctamente mientras la transcripción conserva la ortografía original. El ejemplo de la documentación mapea "Acme Mobile" a "Acme Mobull", lo cual dice exactamente lo poco glamurosa y necesaria que es esa función.

Lo que implica realmente construir sobre esto

Leí la documentación de speech-to-speech de la misma forma en que leo cualquier API que podría tener que soportar después, buscando las partes que morderán más adelante. Aquí van algunas notas de esa lectura.

La API es compatible a nivel de cableado con la API Realtime de OpenAI. Apuntas el WebSocket a wss://api.x.ai/v1/realtime, cambias la clave, y la mayoría del código cliente existente funciona. Ese es un costo de cambio deliberadamente bajo, y es el argumento comercial más fuerte que tiene xAI aquí. No es una compatibilidad perfecta: conversation.item.done, rate_limits.updated y un puñado de eventos output_audio_buffer.* no se emiten, y conversation.item.input_audio_transcription.delta se renombra a .updated con cargas útiles acumulativas en lugar de incrementales. Si construiste algo sobre esos eventos, ese es tu trabajo de portabilidad. Las diferencias en la llamada a herramientas también valen la pena leerse.

Las herramientas vienen en cinco tipos: function para tus propias APIs, file_search sobre colecciones de documentos subidas, web_search, x_search, y servidores mcp remotos. El soporte de MCP es el que yo usaría, porque significa que tu herramienta interna existente es alcanzable sin escribir un shim específico para voz.

El razonamiento viene por defecto en esfuerzo high. Puedes poner reasoning.effort en "none" para desactivarlo. Vale la pena notarlo porque una queja real en Hacker News sobre la generación anterior fue justo la contraria:

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"

Hay tres extensiones específicas de xAI que señalaría a cualquiera que construya una línea de soporte:

  • force_message dice una línea codificada y sintetizada por TTS sin involucrar al modelo, con una bandera interruptible. Así es como entregas "esta llamada está siendo grabada" textualmente, cada vez, lo cual es un requisito de cumplimiento, no un extra deseable.
  • resumption guarda en caché los turnos contra un conversation_id y los reproduce al reconectar. Está desactivado por defecto. Sin él, un WebSocket caído pierde la conversación, y los llamantes móviles pierden la conexión constantemente.
  • idle_timeout_ms hace que el servidor vuelva a interactuar con un llamante en silencio en un temporizador que se reactiva tras cada respuesta. Esa es la diferencia entre un agente paciente y un silencio incómodo.

El consejo de migración de la documentación es lo opuesto de lo que esperarías: haz tu prompt de sistema más corto, no más largo. La guía de xAI es pedirle a Grok que generalice tu prompt existente en lugar de portarlo tal cual, y quitar los trucos de prompt escritos para parchar los casos límite del modelo anterior. He hecho ese ejercicio con nuestros propios prompts en distintas actualizaciones de modelo. Es incómodo y normalmente es lo correcto; las soluciones alternativas que se van arrastrando son lo que hace que un prompt se vuelva poco a poco inmanejable.

Los benchmarks son una cosa. El único despliegue sobre el que cualquiera de los dos anuncios da cifras es la línea de ventas y soporte de Starlink, que corre sobre Grok Voice, y las cifras que xAI publicó con Think Fast 1.0 vale la pena citarlas tal cual:

  • 20% de tasa de conversión. Una de cada cinco consultas de venta compra el servicio de Starlink mientras habla por teléfono con Grok.
  • 70% de tasa de resolución. La mayoría de las consultas de soporte se resuelven de forma autónoma sin humano en el circuito.
  • 28 herramientas. Un agente, docenas de herramientas distintas, a través de cientos de flujos de trabajo de soporte y ventas.
  • La resolución de problemas de hardware, los reemplazos de hardware y los créditos de servicio se conceden todos de forma autónoma.

Son cifras sólidas, y son de origen propio, lo cual funciona en ambas direcciones. Starlink y xAI comparten propietario, así que este es el mejor caso posible de despliegue, con la mayor atención de ingeniería disponible. Una tasa de resolución autónoma del 70% es real, y también es lo que obtienes con un equipo dedicado construyendo 28 herramientas para una sola línea de negocio.

Para Think Fast 2.0 en concreto, xAI dice que las pruebas A/B en esa misma línea de Starlink mostraron "un aumento significativo en la tasa de conversión de ventas y la tasa de contención de soporte" y no publica ninguna cifra para ninguna de las dos. Me gustaría tener el número. Hasta que exista, la lectura honesta es que la 2.0 es mejor en benchmarks y probablemente mejor en producción, según la palabra del proveedor.

La lectura de la comunidad es escasa por ahora, lo cual en sí mismo dice algo sobre quién está prestando atención. El hilo de lanzamiento en Hacker News reunió cinco puntos y dos comentarios:

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

La señal más útil viene de gente que ha vivido con la generación anterior:

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

Y la versión más calibrada de la misma opinión, en la que más confiaría:

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Quién debería realmente adoptarlo

Sí claro, si manejas una línea telefónica con volumen y la latencia es lo que te está matando. Menos de un segundo hasta el primer audio más la mejor puntuación agéntica publicada no es una decisión reñida frente a las alternativas, y la compatibilidad con OpenAI Realtime hace que tu prueba cueste un día, no un sprint. Cualquiera que esté montando automatización de call center desde cero debería incluirlo en su lista corta.

Sí claro, si eres desarrollador y quieres saltarte el stack. El Voice Agent Builder empaqueta telefonía, recuperación, guardarraíles y revisión de llamadas, con SIP para números que ya tienes. Eso es tiempo real ahorrado frente a ensamblar cuatro proveedores, y las alternativas casi todas cobran una tarifa de plataforma encima. Vale la pena notar que el modelo de voz tiene versión separada de la línea de texto, así que los lanzamientos de Grok 4.5 no lo mueven.

Todavía no, si tu volumen de soporte es email y chat. Este es el error que veo cometer a los equipos: ven un buen número de voz y empiezan a planificar un proyecto de desvío telefónico, cuando la mayor parte de su cola nunca marca a nadie. La voz es un canal, no una estrategia. Empieza por dónde están los tickets, y si tu línea telefónica ya está conectada a un helpdesk, revisa qué hace ya tu integración telefónica de Gorgias o equivalente antes de añadir un segundo stack.

Todavía no, si necesitas demostrar seguridad antes de salir en vivo. No hay una forma publicada de hacer un ensayo de Think Fast 2.0 contra tus propias llamadas históricas antes de dirigirle tráfico. La grabación de llamadas, las transcripciones y los guardarraíles existen todos después del hecho, en el Builder. Eso es revisión, no ensayo, y la distinción importa cuando el agente puede emitir reembolsos. La misma brecha aparece en toda la categoría, por lo que prevenir respuestas de IA incorrectas es sobre todo un problema de proceso, no de modelo.

Con cuidado si ya estás en grok-voice-latest. Mira la calculadora de arriba. Mañana.

¿Quieres lo mismo para tu cola de tickets?

Grok Voice es bueno en el teléfono. El problema es que para la mayoría de los equipos de soporte el teléfono es el canal pequeño, y la cola de tickets es donde vive realmente el volumen.

Esa es la mitad que hace eesel. Se conecta a Zendesk, Freshdesk, Gorgias, Front, HubSpot y el resto, entrena con tus tickets pasados, macros y centro de ayuda en lugar de un prompt que tienes que escribir desde cero, y redacta o envía respuestas dentro del helpdesk que tus agentes ya tienen abierto. Ninguna herramienta nueva que nadie tenga que aprender.

Lo que señalaría, dado todo lo anterior sobre la brecha entre un benchmark y una cola real: antes de activarlo, eesel simula el agente contra tu propio historial de tickets y te dice qué habría respondido y con qué frecuencia. Ese es el paso de ensayo que a los stacks de voz les falta. Existe porque he visto a un bot que suena seguro de sí mismo responder mal, y prefiero descubrirlo en los tickets del mes pasado que en los de esta mañana.

La opinión de un cliente sobre por qué ese paso importa, una cita anonimizada de un líder de CX de una empresa de suplementos DTC con la que hablamos:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Eso es la configuración, no una advertencia. Enrutamiento por confianza, exclusión por tipo de ticket, y una simulación antes de salir en vivo.

El panel de eesel AI helpdesk mostrando respuestas redactadas por IA dentro de la cola de soporte
El panel de eesel AI helpdesk mostrando respuestas redactadas por IA dentro de la cola de soporte

Gratis para probar, y puedes tenerlo respondiendo tus propios tickets en unos minutos. Prueba eesel.

Preguntas frecuentes

¿Qué es Grok Voice Think Fast 2.0?

El modelo de voz speech-to-speech insignia de xAI, anunciado el 29 de julio de 2026, que escucha, razona y habla en una sola ruta de modelo en lugar de encadenar tres servicios. Esa ruta única es de donde vienen los 0.70 segundos hasta el primer audio. Se convierte en el modelo detrás de grok-voice-latest el 5 de agosto de 2026. Si tu objetivo es email y chat en lugar de llamadas, un agente de IA para helpdesk encaja mejor.

¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?

$0.08 por minuto de audio, o $4.80 por hora, más $0.004 por entrada de texto. Think Fast 1.0 se sigue listando a $0.05 por minuto, así que el precio de Grok Voice Think Fast 2.0 supone un aumento del 60% por minuto. Un número aprovisionado añade $0.01 por minuto, y las llamadas a herramientas se facturan por separado. Sopésalo frente a tu panorama más amplio de costo de la atención al cliente con IA, y frente a lo que cuesta un agente humano.

¿Es Grok Voice Think Fast 2.0 más rápido que GPT-Realtime?

Sí, según la medición publicada: 0.70 segundos hasta el primer audio frente a 1.21 segundos de GPT-Realtime-2.1 High. No es el modelo más rápido del tablero, sin embargo. Deepslate Opal responde en 0.44s y Gemini 2.5 Flash Native Audio Dialog en 0.63s, ambos más abajo en el índice de calidad. La comparación de la API Realtime de OpenAI cubre la contrapartida desde el otro lado, incluyendo WebRTC frente a WebSocket como transporte.

¿Tengo que actualizar desde Think Fast 1.0?

Solo si no haces nada. El 5 de agosto de 2026, grok-voice-latest cambia de apuntar de grok-voice-think-fast-1.0 a grok-voice-think-fast-2.0, así que fijar la versión antigua antes de esa fecha es lo que te mantiene en ella. Fijar versiones en producción es buena práctica de todos modos, el mismo instinto detrás de probar las respuestas de IA antes de que las vean los clientes.

¿Puede Grok Voice Think Fast 2.0 gestionar llamadas de soporte al cliente?

Está diseñado exactamente para eso. La línea de Starlink corre sobre Grok Voice con 28 herramientas, 70% de resolución autónoma y 20% de conversión de ventas, y el modelo hace llamadas a funciones, búsqueda de documentos, MCP y transferencia a humanos. El planteamiento realista está en si la IA puede responder llamadas de soporte, y el lado operativo en cómo automatizar el soporte telefónico y en la gestión de escalamiento de IA.

¿Cuál es la precisión de transcripción de Grok Voice Think Fast 2.0?

xAI reporta una tasa de error de palabras 1.4x mejor que Think Fast 1.0 y de 1.5x a 2.0x mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas, ampliándose a casi 10x en audio ruidoso. Revisa el gráfico por idioma en lugar del promedio si gestionas soporte multilingüe, porque la precisión varía según el idioma y es la cola la que perjudica tu CSAT.

¿Grok Voice funciona con Zendesk o Gorgias?

No de forma nativa. Grok Voice es un modelo y un builder, así que cualquier escritura de vuelta al helpdesk es una herramienta de función o un servidor MCP que conectas tú mismo. Si quieres IA dentro del helpdesk en su lugar, empieza con Zendesk AI o Freddy de Freshdesk. Del lado de la telefonía, la configuración de Zendesk Talk es el equivalente nativo más cercano. En cualquier caso, trata la voz como un canal más que alimenta la misma cola.

¿Vale la pena Grok Voice Think Fast 2.0 frente a Think Fast 1.0?

Para una carga de trabajo agéntica exigente, probablemente sí: 82.9% frente a 75.7% en general, más casi la mitad de latencia y un salto de 17 puntos en dinámica conversacional. Para una línea de FAQ sencilla donde 1.0 ya resuelve lo que necesitas, el aumento de tarifa del 60% te compra una precisión que quizá no uses. Compáralo con tu propia tasa de resolución y el ROI del call center antes de dejar que el alias decida por ti. Si estás comparando toda la línea, los precios de xAI es la siguiente parada.

Sources

Preguntas frecuentes

¿Qué es Grok Voice Think Fast 2.0?
Es el modelo de voz speech-to-speech insignia de xAI, anunciado el 29 de julio de 2026. Escucha, razona y habla en una sola ruta de modelo en lugar de encadenar voz a texto, un LLM y texto a voz, que es de donde vienen sus 0.70 segundos hasta el primer audio. Reemplaza a Think Fast 1.0 como el modelo detrás de grok-voice-latest el 5 de agosto de 2026. Si tu objetivo es responder email y chat en vez de llamadas telefónicas, un agente de IA para helpdesk encaja mejor.
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
$0.08 por minuto de audio, o $4.80 por hora, más $0.004 por entrada de texto, según la página de precios de xAI. Think Fast 1.0 se sigue listando a $0.05 por minuto. Un número de teléfono aprovisionado en el Voice Agent Builder añade $0.01 por minuto, y las herramientas del lado del servidor se facturan por separado. Compáralo con el panorama más amplio del costo de la atención al cliente con IA antes de decidirte.
¿Es Grok Voice Think Fast 2.0 más rápido que GPT-Realtime?
Según las pruebas de Artificial Analysis, sí: 0.70 segundos hasta el primer audio frente a 1.21 segundos de GPT-Realtime-2.1 High. Sin embargo, no es el modelo más rápido medido. Deepslate Opal está en 0.44s y Gemini 2.5 Flash Native Audio Dialog en 0.63s. Consulta la comparación de la API Realtime de OpenAI para el otro lado.
¿Tengo que actualizar desde Grok Voice Think Fast 1.0?
No, pero tienes que actuar para evitarlo. El 5 de agosto de 2026, grok-voice-latest deja de apuntar a grok-voice-think-fast-1.0 y empieza a apuntar a grok-voice-think-fast-2.0. Para quedarte en el modelo anterior, más barato, fija explícitamente grok-voice-think-fast-1.0 antes de esa fecha. Fijar la versión es justo lo que xAI recomienda para producción de todos modos, la misma disciplina de la que depende prevenir respuestas de IA incorrectas.
¿Puede Grok Voice Think Fast 2.0 gestionar llamadas de soporte al cliente?
Está construido para eso. La línea de ventas y soporte de Starlink corre sobre Grok Voice con 28 herramientas, una tasa de resolución autónoma del 70% y una tasa de conversión de ventas del 20% en consultas entrantes. El modelo soporta llamadas a funciones, búsqueda de documentos y servidores MCP, además de transferencia a humanos. Vale la pena leer también si la IA puede responder llamadas de soporte.
¿Cuál es la precisión de transcripción de Grok Voice Think Fast 2.0?
xAI reporta una mejora de 1.4x en la tasa de error de palabras frente a Think Fast 1.0 y de 1.5x a 2.0x frente a Deepgram Nova 3 y ElevenLabs Scribe v2, en miles de frases cortas en 24 idiomas. La brecha declarada se amplía a casi 10x en audio ruidoso y comprimido por telefonía. Eso importa más que el titular para cualquiera que gestione soporte multilingüe.
¿Cómo se compara el precio de Grok Voice Think Fast 2.0 con otras APIs de voz?
Grok publica una tarifa fija por minuto; OpenAI y Google cobran por token de audio, así que su costo real se mueve según cuánto habla el modelo. Artificial Analysis midió el costo por hora de audio de entrada en $4.80 para Think Fast 2.0, $10.75 para GPT-Realtime-2.1 High y $1.75 para Gemini 3.1 Flash High. Nuestro desglose de costo de agente de IA frente a agente humano pone esos números en contexto.
¿Dónde no ayuda Grok Voice Think Fast 2.0?
Es un modelo de voz, así que no hace nada por los tickets de email y chat que nunca se convierten en llamadas, y no tiene visibilidad sobre tu historial de helpdesk. Para eso quieres un agente que entrene con tickets pasados y ejecute una simulación de desvío de tickets contra ellos antes de entrar en producción. Los dos encajan perfectamente: Grok en la línea telefónica, un agente de helpdesk en la cola.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración lineal de un desarrollador y un agente de soporte hablando a través de ondas de voz, junto al logo de Grok
Trending

Precio de Grok Voice Think Fast 2.0: qué cuesta $0.08/min

Grok Voice Think Fast 2.0 cuesta $0.08 por minuto de audio, un 60% más que 1.0. El alias grok-voice-latest cambia a él hoy mismo, así que aquí va la matemática real por llamada.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustración de seis plataformas de agentes de voz con IA como alternativas al Grok Voice Agent Builder de xAI
Guides

6 alternativas a Grok Voice Agent Builder para probar en 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow y Deepgram comparados con Grok Voice Agent Builder de xAI en precio, latencia y cumplimiento normativo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Ilustración de un agente de voz sin código respondiendo una llamada en el stack Grok Voice de xAI
Guides

Grok Voice Agent Builder: una primera mirada a la IA de voz sin código de xAI

Una mirada práctica al Grok Voice Agent Builder: el stack de voz a voz, el precio de $0.05/min, el flujo de creación de dos minutos y dónde encaja realmente.

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026
Una persona hablando con tres opciones distintas de agente de voz, con el logotipo de Grok a la izquierda
Alternatives

Las 10 mejores alternativas a Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 acaba de subir un 60% de precio en el alias predeterminado. Diez alternativas reales, con coste por hora medido y cifras de benchmark honestas.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Ilustración editorial con el logo de Grok, barras de benchmarks y una etiqueta de precio que representa un análisis de Grok 4.5
Trending

Análisis de Grok 4.5: benchmarks, precios y el veredicto

Grok 4.5 de xAI se lanzó el 8 de julio con un puesto #4 en el Intelligence Index y el mejor resultado de uso de herramientas agenticas de la tabla. Aquí está el análisis real, los benchmarks, los precios y quién debería usarlo realmente.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Ilustración de un recibo y diales de precios para Grok Voice Agent Builder de xAI
Guides

Precios de Grok Voice Agent Builder: lo que realmente cuesta

Un desglose completo de los precios de Grok Voice Agent Builder: la tarifa de voz de $0.05/min, los extras de telefonía y llamadas a herramientas, ejemplos de costes calculados y cómo se compara con OpenAI y ElevenLabs.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 3, 2026
Un agente de IA saliendo de un monitor para operar ventanas de aplicaciones y documentos mientras dos colegas observan, en el color azul de marca de Meta
Trending

Meta Muse Spark 1.1: qué es, cuánto cuesta y dónde falla

La primera API de modelos de pago de Meta lanza un modelo agente con 1M de contexto a $1.25/$4.25. En qué es realmente bueno Muse Spark 1.1, y los benchmarks que Meta dejó fuera de la diapositiva.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Dos personas conversando con formas de onda de voz entre ellas y el logo de Grok arriba
AI

Grok Voice Think Fast 2.0: análisis rápido, preciso y con límites

Un análisis práctico de Grok Voice Think Fast 2.0: la realidad de los benchmarks, las particularidades de la API y el límite de 10 sesiones que decide si puedes lanzarlo a producción.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Banner principal del análisis de Grok Voice Agent Builder, la plataforma de agentes de voz sin código de xAI
Guides

Análisis de Grok Voice Agent Builder: ¿vale la pena la IA de voz de xAI?

Mi análisis de Grok Voice Agent Builder de xAI: una plataforma de agentes de voz sin código, de voz a voz. La arquitectura, las salvedades de los benchmarks, el precio y quién debería usarla.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis