Análisis de Grok Voice Think Fast 2.0: rápido, afilado, limitado

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Dos personas conversando con formas de onda de voz entre ellas y el logo de Grok arriba

Lo que realmente probé, y lo que no pude

Quiero ser claro sobre la base de todo esto, porque "lo he probado" se usa con bastante ligereza con los modelos de voz.

Lo que he trabajado a fondo: la documentación de speech-to-speech de xAI de principio a fin, además de la ficha del modelo con sus límites publicados y la tabla de precios en la página de precios.

Además de eso, el post de lanzamiento y la evaluación independiente de Artificial Analysis que lo puntuó frente a otros 27 modelos. Luego leí lo que dicen quienes construyen sobre él.

Lo que no puedo afirmar: no he hecho pasar mil llamadas de producción por él en una línea telefónica real. Nadie fuera de xAI lo ha hecho, excepto Starlink. Así que cuando este post dice algo sobre el comportamiento bajo carga, viene de un límite publicado y no de una historia de guerra real, y diré cuál de las dos cosas es en cada caso.

Me dedico a construir agentes de IA en eesel, sobre todo las partes que se sitúan entre un modelo y una conversación real con un cliente. Esa es la óptica aquí. La pregunta no es "¿esto impresiona en una demo?". Es "¿qué se rompe un martes por la tarde cuando llaman 40 personas a la vez?".

La tabla de puntuaciones

Aquí está todo el veredicto en un solo sitio antes de entrar en detalle.

DimensiónPuntuaciónMi valoración
Fluidez conversacional95,1% Full Duplex BenchLa corrección estrella. La 1.0 obtuvo 77,8%. Las interrupciones y superposiciones ya no son el punto débil.
Inteligencia bruta82,9% índice AASegundo puesto en general, por detrás de Qwen con 84,1%. Lo suficientemente cerca como para no ser el factor decisivo.
Comportamiento agéntico56,5% τ-voiceEl mejor de la tabla, pero solo 1,9 puntos por delante de Qwen con 54,6%.
Latencia0,70s hasta el primer audioTercero más rápido. Suficientemente rápido como para que la persona que llama no lo note.
Transcripción1,4x mejor que la 1.0Una mejora real, y la que xAI vendió por debajo de lo que merece.
Diseño de APICompatible a nivel de protocolo con OpenAI RealtimeLa mejor parte del producto. Las extensiones parecen escritas por alguien que ya había lanzado un agente telefónico antes.
Previsibilidad del coste4,80 $/h medido, 4,80 $/h de listaFacturación plana por minuto. Algo raro, y que vale más de lo que parece.
Margen de escala10 sesiones concurrentesEl problema. Todo lo anterior queda minado por esta única línea.
Opciones de despliegueSolo us-east-1Sin región en la UE. Para muchos equipos, esto cierra la conversación.

Veredicto: el modelo se gana una recomendación firme y la plataforma se gana un "revisa antes tu volumen". Son dos productos distintos, y los análisis suelen puntuar solo el primero.

Dónde gana

Destacan cuatro cosas, y solo una es la cifra con la que xAI abrió el lanzamiento. Juntas describen un tipo de modelo concreto: no el más inteligente disponible, sino el que se mantiene afilado mientras responde lo bastante rápido para una línea telefónica.

Las interrupciones dejaron de delatarlo

El cambio individual más grande respecto a la 1.0 es Full Duplex Bench, que mide cómo gestiona un modelo las partes desordenadas de una conversación real: interrupciones, superposiciones, señales de fondo, alguien que cambia de opinión a mitad de frase. La 1.0 obtuvo 77,8%. La 2.0 obtiene 95,1%.

Esa es la cifra que separa un agente de voz que la gente tolera de uno que la gente olvida que es una máquina. Cualquiera que haya escuchado grabaciones de llamadas conoce el fallo típico: la persona que llama empieza a corregirse, el bot sigue hablando por encima, y esa persona o bien se repite más alto o pide hablar con un humano. Está casi en lo más alto de cualquier lista de problemas de los chatbots que hacen que los clientes se rindan, y los patrones de derivación de todo despliegue serio existen sobre todo para atrapar ese momento exacto.

Vale la pena reconocer, en justicia: esta es la única fila donde Grok pierde frente a OpenAI. GPT-Realtime-2.1 High puntúa 95,7%. Una diferencia de 0,6 puntos es algo que ninguna persona al teléfono percibiría jamás, pero la tabla de lanzamiento tampoco se ofrecerá a mencionarlo.

La puntuación agéntica es el verdadero titular

τ-voice mide si un modelo puede realmente completar una tarea por voz, en lugar de solo sonar bien mientras la intenta. Buscar un pedido, comprobar una política, luego llamar a una función y volver con la respuesta correcta. Grok Voice Think Fast 2.0 marca 56,5% aquí, la cifra más alta de toda la tabla de Artificial Analysis.

Tres franjas de clasificación que comparan Grok Voice Think Fast 2.0 con Qwen, GPT y Gemini en índice general, tiempo hasta el primer audio y puntuación agéntica tau-voice
Tres franjas de clasificación que comparan Grok Voice Think Fast 2.0 con Qwen, GPT y Gemini en índice general, tiempo hasta el primer audio y puntuación agéntica tau-voice

Esto importa más que el índice general para cualquiera que construya un agente real, porque un agente de voz que no puede usar herramientas de forma confiable es un lector de FAQ muy caro. Es la misma distinción que separa a los agentes de IA de los chatbots de IA en texto, y la misma razón por la que los ejemplos de agentes de IA útiles son siempre los que tocan un sistema real en lugar de recitar un artículo.

La salvedad honesta: Qwen Audio 3.0 Realtime Plus se sitúa en 54,6% en el mismo benchmark. Así que la ventaja de Grok son 1,9 puntos, no el abismo que sugiere el planteamiento. La brecha respecto al mejor de OpenAI, con 45,7%, es más amplia, y de ahí viene la frase "10 puntos por delante", pero Qwen está justo ahí.

La combinación de velocidad e inteligencia

0,70s hasta el primer audio, frente a los 1,25s de la 1.0. Deepslate Opal es más rápido con 0,44s, y una variante de Gemini Flash con 0,63s, así que Grok queda tercero. Pero Qwen, el modelo que le gana en el índice general, tarda 4,02s hasta el primer audio. En una línea telefónica eso es una pausa muerta lo bastante larga como para que quien llama diga "¿hola?".

Ese equilibrio es el verdadero producto. Alguien en Hacker News lo expresó mejor que el propio post de lanzamiento:

Hacker News

"Grok voice es el mejor asistente de voz con IA y no es ni de cerca comparable.

El equilibrio entre velocidad e inteligencia es el correcto. Mientras que la voz de GPT resulta pretenciosa y poco humana a pesar de esforzarse mucho por sonar humana."

xAI también dice que los tokens de razonamiento corren a 0,4 veces el P50 de su predecesor, que es cómo se volvió más rápido mientras se volvía más inteligente, en lugar de simplemente pensar menos.

La transcripción es la parte infravalorada

Escondido en el post de lanzamiento: la precisión de transcripción es 1,4 veces mejor que en la 1.0, y de 1,5 a 2,0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas. En audio ruidoso o de telefonía, la diferencia declarada es de aproximadamente 10 veces.

El audio de telefonía es donde la transcripción suele fallar, y es exactamente el tipo de audio con el que trabaja una línea de soporte todo el día. Si estás evaluando esto frente a ElevenLabs o un proveedor dedicado de voz a texto, esa cifra de audio ruidoso merece más peso que los benchmarks conversacionales. También es el eje en el que el endpoint de transcripción de OpenAI ha sido la opción por defecto, sobre todo por inercia.

Ahora hay 26 voces en el catálogo, tras añadirse 21 en julio de 2026, y cualquiera de ellas se puede cambiar por un ID de voz clonada. Si alguna vez has luchado por mantener a un bot sonando como tu empresa en distintos canales, el problema de la voz de marca no desaparece solo porque la salida sea audio.

Dónde la tabla de benchmarks lo exagera

Tres cosas que el planteamiento del lanzamiento no cuenta.

82,9% es el segundo puesto. Qwen Audio 3.0 Realtime Plus está en 84,1%. Grok es competitivo con él, y mucho más rápido, pero "estado del arte" está haciendo bastante trabajo en el texto de marketing. Si has revisado últimamente la familia de modelos de Qwen o lo que cobra Alibaba, sabrás que están lanzando a un ritmo fuerte.

No compares entre sí las dos cifras de τ-voice de xAI. El post de Voice Agent Builder del 1 de julio reporta que Think Fast 1.0 obtiene 67,3% en su propia evaluación τ-voice. Artificial Analysis puntúa el mismo modelo con 52,1%. Metodologías distintas, escalas distintas. Cualquiera que apile esas dos cifras en un gráfico de "mira cuánto ha mejorado" no está comparando nada. Ese mismo cuidado aplica a las cifras en Voice Agent Builder pricing, que todavía citan la tarifa antigua.

Las cifras de Starlink pertenecen a la 1.0. El 20% de conversión de ventas y el 70% de resolución autónoma tan citados, de la línea +1 888 GO STARLINK con 28 herramientas conectadas, son resultados de Think Fast 1.0. Para la 2.0, xAI dice que las pruebas A/B en esa misma línea mostraron "un aumento significativo" en conversión y contención, sin publicar cifra alguna. Además es un despliegue de primera parte dentro de la misma estructura de propiedad, lo que lo convierte en un mejor caso posible más que en uno representativo.

Construir sobre él: la API es la parte buena

Esperaba que la documentación fuera el punto débil aquí y resultó ser justo lo contrario. En cuanto a diseño, es la API de voz en tiempo real más cuidada que he leído.

Una lista de comprobación en dos columnas que muestra qué se conserva de OpenAI Realtime y qué cuatro tipos de eventos hay que reescribir
Una lista de comprobación en dos columnas que muestra qué se conserva de OpenAI Realtime y qué cuatro tipos de eventos hay que reescribir

Es compatible a nivel de protocolo con OpenAI Realtime en wss://api.x.ai/v1/realtime, así que si tienes una app existente, la migración es cambiar la URL base y una clave. Incluso puedes conservar el SDK de OpenAI y simplemente apuntarlo a https://api.x.ai/v1. Cuatro cosas no se conservan: conversation.item.done, rate_limits.updated y la mayoría de eventos output_audio_buffer.* no se emiten, y ...input_audio_transcription.delta se renombra a .updated y se vuelve acumulativo, lo que corromperá silenciosamente tu visualización de transcripción si estabas concatenando deltas.

Donde se pone interesante es en las extensiones exclusivas de xAI, y se leen como si las hubiera escrito gente que ya había lanzado un agente telefónico y se había quemado con él:

  • force_message dice una línea codificada por TTS sin involucrar al modelo en absoluto. Fija interruptible: false y el audio de quien llama se descarta hasta que termine. Esto resuelve correctamente el problema del aviso legal obligatorio, en lugar de rezar para que aguante tu system prompt.
  • replace es un mapa de pronunciación aplicado antes del TTS, de modo que el audio dice "Acme Mobull" mientras la transcripción sigue mostrando "Acme Mobile". La coincidencia no distingue mayúsculas, respeta los límites de palabra completa, y gana la coincidencia más larga.
  • resumption almacena en caché los turnos por conversation_id y los reproduce de nuevo al reconectar. Desactivado por defecto, ambas partes deben activarlo, y el historial caduca tras 30 minutos de inactividad.
  • keyterms sesga la transcripción hacia hasta 100 términos de dominio de 50 caracteres cada uno, actualizables a mitad de sesión. Para una línea de soporte llena de SKU y nombres de planes, esto es la diferencia entre una transcripción usable y un desastre.
  • idle_timeout_ms se rearma tras cada respuesta, de forma que el agente puede volver a interactuar con una persona que llama en silencio repetidamente, en lugar de quedarse ahí sentado.

El parámetro reasoning.effort acepta exactamente dos valores: "high" (el predeterminado) y "none". No hay un ajuste intermedio, lo cual es una carencia real. Alguien planteó exactamente esto en Hacker News sobre un lanzamiento anterior de Grok voice:

Hacker News

"El modelo de voz de Grok también es un modelo de razonamiento. Estoy de acuerdo en que es mucho mejor que los otros modelos de voz.

Dadme simplemente una opción de tener una respuesta más lenta pero un modelo mejor…"

Otra cosa que la documentación hace bien y que la mayoría de proveedores dejan que descubras en producción: te dicen explícitamente que esperes a que termine la reproducción de audio antes de enviar response.create tras una llamada a herramienta, porque el servidor entrega todos los deltas de audio antes de los eventos de llamada a función. Salta ese paso y obtienes voces superpuestas. Incluso sugieren mostrar un indicador de "pensando" durante ese hueco. Ese es un detalle bien ganado, y por escrito.

El propio consejo de la guía de migración es hacer tu system prompt más corto, no más largo, lo cual dice algo sobre cómo se ajustó el modelo.

Los tres límites que realmente te impedirán lanzarlo

Si yo fuera quien lo evalúa, esta es la sección que leería primero.

Un diagrama de embudo que muestra llamadas entrantes estrechándose a través de una puerta etiquetada como 10 sesiones concurrentes por equipo, con el resto en cola
Un diagrama de embudo que muestra llamadas entrantes estrechándose a través de una puerta etiquetada como 10 sesiones concurrentes por equipo, con el resto en cola

10 sesiones concurrentes por equipo. Este es el valor por defecto publicado en la ficha del modelo, ampliable si se solicita. Diez llamadas simultáneas es simplemente el lunes por la mañana de un pequeño equipo de soporte. Cada benchmark de arriba es irrelevante si la llamada once no puede conectar, y "ampliable si se solicita" es una conversación de ventas, no un ajuste de configuración. Cualquiera que esté dimensionando un agente de IA para centro de llamadas debería tratar esto como la primera pregunta, no como una nota al pie.

Para comparar, los productos de voz empaquetados construidos sobre un helpdesk no publican ningún tope de sesiones, porque la concurrencia es problema del proveedor y no tuyo. Eso es cierto para los agentes de voz con IA de Zendesk, para la configuración de Freshcaller, y para el agente de voz de Salesforce. Cambias flexibilidad por que otro se encargue de la planificación de capacidad.

Solo us-east-1. Una única región, sin opción en la UE. Si tienes compromisos de residencia de datos, esto lo decide todo antes de que evalúes nada más.

Sin nivel de prioridad ni descuento por lote. El nivel de prioridad de 2x es solo para Chat Completions y Responses. El descuento del 20% por lote es solo para modelos de texto. Voice no obtiene ni carril rápido ni rebaja por volumen, así que la tarifa que ves es la tarifa que pagas en cualquier escala. También hay una duración máxima de sesión de 120 minutos, que es generosa para soporte y ajustada para algo como una línea monitorizada.

Dos cosas más pequeñas que vale la pena conocer. El almacenamiento se factura por separado si tu agente hace recuperación de datos: las colecciones cuestan 0,10 $/GiB/día, los archivos 0,025 $, las descargas 0,20 $/GiB. Y hay una comisión de 0,05 $ por infracción de las directrices de uso por cada solicitud de Responses bloqueada antes de la generación.

¿Deberías pasarte a la 2.0, o quedarte fijado en la 1.0?

El cambio de alias del 5 de agosto significa que no hacer nada ya es en sí una decisión. Elige la fila que te describa.

¿Qué estás usando hoy?

Elige una opción. El veredicto cambia mucho según cuál de estas seas.

Pásate a la 2.0 y no le den más vueltas

A volumen de demo, la subida del 60% en la tarifa es un error de redondeo, y el salto de Full Duplex de 77,8% a 95,1% es la diferencia entre una demo que impacta y una que no. Deja que el cambio de alias te lleve.

Pásate a la 2.0, pero presupuesta el cambio

Tu coste por minuto pasa de 0,05 $ a 0,08 $ el 5 de agosto sin ningún despliegue de tu parte. A 2.000 minutos al mes eso sube de 100 $ a 160 $. La mejora en fluidez conversacional lo vale, pero pon la cifra delante de quien firma antes de que lo haga la factura por ti.

Resuelve primero el límite de sesiones, el modelo después

10 sesiones concurrentes por equipo es el valor por defecto publicado, y subirlo es una conversación con xAI, no un cambio de configuración. Consigue esa cifra acordada por escrito antes de evaluar nada. Un 95,1% en Full Duplex no hace nada por la llamada once.

Este todavía no es tu modelo

El speech-to-speech corre solo en us-east-1, sin ninguna región en la UE publicada. Ninguna puntuación de este post cambia eso. Vuelve a evaluarlo cuando xAI publique una segunda región.

Lo que dice realmente quien construye sobre él

X es el hogar natural para las reacciones a xAI y actualmente es difícil leer ahí con profundidad, así que la señal útil está en Hacker News. Dos hilos aportan la mayor parte.

El comentario más votado en el hilo de Think Fast 2.0 es, esencialmente, una queja de que el lanzamiento pasó desapercibido:

Hacker News

"No sé por qué este post no es más popular, es un modelo de voz de última generación, que supera a laboratorios especializados como ElevenLabs"

Es una lectura justa sobre la capacidad, y vale la pena señalar que los precios también han convergido ya. Cada nivel de pago de ElevenLabs Agents sale a casi exactamente 0,08 $ por minuto incluido, que es la nueva tarifa de Grok al céntimo. Hasta el 5 de agosto, Grok lo abarataba en un 37,5%.

La visión más mesurada, de unos meses antes, se sostiene bien:

Hacker News

"Grok voice es sorprendentemente bueno, en realidad. Sigue siendo un modelo más torpe que los modos de razonamiento de los modelos de frontera, pero es menos torpe que los modos de voz de otros proveedores."

Ahí es donde también aterrizo yo, más o menos. Un modelo de voz siempre es un compromiso frente a un modelo de texto al que se le permite pensar durante diez segundos, y Grok hace un mejor compromiso que el resto del campo. Lee las reseñas del lado del consumidor y verás el mismo veredicto formulado con menos cuidado.

La frustración recurrente en estos hilos es el uso de herramientas en modo voz, y merece la pena aclararla porque funciona en ambos sentidos:

Hacker News

"Lo que me falta en este anuncio es la capacidad de usar conectores y herramientas. No lo entiendo realmente - NINGUNO de los asistentes de frontera puede usar herramientas/conectores en modo voz"

Eso se refiere a los asistentes de voz para consumidores, y en el lado de la API no es cierto para Grok: las sesiones admiten herramientas function, file_search, web_search, x_search, y mcp remotas, con las del lado del servidor ejecutándose por ti. Las herramientas de servidor se facturan por invocación, a 5 $ por 1.000 para búsqueda web y en X, 2,50 $ por 1.000 para colecciones, y 10 $ por 1.000 para búsqueda de adjuntos. La brecha que describe el comentario es real en la app de Grok para consumidores, no en lo que construirías tú. Es la misma división que recorre el lanzamiento de voz de ChatGPT: la API le lleva ventaja a la app desde hace ya un tiempo.

Quién debería adoptarlo, y quién debería esperar

Adóptalo si estás construyendo un agente telefónico o de voz que tiene que hacer cosas, no solo hablar. La puntuación τ-voice, el soporte de herramientas, las extensiones force_message y keyterms, y el medidor plano por minuto suman lo que hoy es el stack de voz más amigable para desarrolladores que se está lanzando. Migrar desde el audio en tiempo real de OpenAI es casi gratis.

Adóptalo si la previsibilidad del coste le importa a tu equipo de finanzas. Artificial Analysis mide el coste real de Grok en 4,80 $ por hora de audio de entrada, idéntico al de lista, porque el medidor es plano por minuto. GPT-Realtime-2 lista 1,15 $/h de entrada y mide 4,14 $/h todo incluido. Las facturas de voz que coinciden con su etiqueta son más raras de lo que deberían ser, lo cual es media razón de por qué la pregunta coste de agente frente a agente humano es tan difícil de responder con honestidad.

Adóptalo si quieres construir tú mismo la orquestación. Si prefieres arrastrar cajas de un lado a otro, los precios de Voiceflow y las alternativas a Voice Agent Builder son el extremo sin código del mismo mercado.

Espera si tu volumen supera las diez llamadas simultáneas y todavía no tienes un límite ampliado por escrito. Espera si necesitas una región en la UE. Espera si dependías de la tarifa de 0,05 $ y no habías notado que el alias se movía debajo de ti, en cuyo caso fija hoy grok-voice-think-fast-1.0 y decide según tu propio calendario.

No lo compres como una solución de soporte. Esto es un modelo y una API, no un agente de helpdesk. No tiene concepto de tu historial de tickets, tus macros, tus reglas de escalado, ni de qué preguntas tu equipo ya ha decidido que la IA no debe tocar. Todo lo anterior trata sobre la capa de voz, y la capa de voz es quizás el 20% de lo que hace que una automatización de soporte funcione de verdad. El resto es la parte aburrida: conocer tu producto, saber cuándo detenerse, y hacer una transferencia limpia.

Una responsable de CX en una marca de suplementos DTC planteó la limitación mejor que cualquier hoja de especificaciones:

"La IA nunca va a poder responder al 100% de las preguntas... Necesito una IA que solo gestione los tickets para los que tiene confianza, y que deje todos los demás en paz."

Ningún benchmark de voz mide eso. Es una cuestión de política, y es la que decide si un lanzamiento sobrevive a su primer mes.

La voz es la mitad ruidosa de una cola de soporte

La mayoría de los tickets que se convierten en llamadas eran respondibles por texto una hora antes. La automatización de primera respuesta y un chatbot de base de conocimiento que la IA pueda realmente leer eliminan más llamadas que cualquier modelo de voz. Eso es lo que vale la pena arreglar antes de salir a comprar uno.

eesel es un agente de IA que se conecta al helpdesk que ya usas, se entrena con tus tickets pasados y tu centro de ayuda en lugar de con un system prompt que tengas que escribir a mano, y te permite simular todo el proceso frente a tu historial real de tickets antes de que un solo cliente lo toque. Esa última parte es deliberada. He pasado años viendo a bots que suenan seguros de sí mismos dar respuestas equivocadas, y una prueba en seco sobre tickets que ya has resuelto es la única forma honesta de averiguar qué hará el tuyo. También es el paso que separa a un agente de IA real de un bot basado en reglas una vez que se acaban los caminos guionizados.

Es la misma decisión de construir frente a comprar a la que llegan muchos equipos una vez que han leído una página de documentación como la de xAI y han entendido cuánto de eso tendrían que mantener ellos mismos:

"Podríamos haber intentado escribir nuestra propia aplicación LLM, pero no queríamos invertir nuestro tiempo en eso. Queríamos algo que no tuviéramos que mantener."

Karel, GENERAL BYTES

Si también quieres la capa de voz, sigue leyendo sobre el Voice Agent Builder de Grok y el campo más amplio de empresas de IA de voz. Si quieres resolver primero la cola que hay detrás, eesel es gratis para probar y tarda unos minutos en conectarse a tu helpdesk. Los equipos que usan Gorgias o Zendesk suelen tenerlo respondiendo tickets reales la misma tarde.

Tres cosas que vale la pena leer a continuación, según en qué parte de esto estés atascado:

Preguntas frecuentes

¿Es Grok Voice Think Fast 2.0 lo bastante bueno para agentes de voz en producción?
Para el modelo en sí, sí. Obtiene 82,9% en el índice speech-to-speech de Artificial Analysis y 56,5% en el benchmark agéntico τ-voice, la puntuación agéntica más alta de esa tabla. La limitación está en la plataforma que lo rodea: 10 sesiones concurrentes por equipo por defecto y una única región us-east-1. Lee el desglose de Grok Voice Think Fast 2.0 para el mecanismo completo, y agentes de IA para centros de llamadas para lo que suele necesitar un despliegue en producción.
¿Qué hay de nuevo en Grok Voice Think Fast 2.0 respecto a la versión 1.0?
Full Duplex Bench pasó de 77,8% a 95,1%, el tiempo hasta el primer audio bajó de 1,25s a 0,70s, y el índice general subió de 75,7% a 82,9%. La precisión de transcripción es 1,4 veces mejor que en la 1.0. La pega es el precio: la tarifa pasó de 0,05 $ a 0,08 $ por minuto, algo que el desglose de precios de Grok Voice desarrolla en dólares.
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
0,08 $ por minuto de audio, o 4,80 $ por hora, más 0,004 $ por mensaje de texto de entrada. Eso es un aumento del 60% sobre la tarifa de la 1.0, y te cae encima automáticamente si llamas al alias grok-voice-latest. Compáralo con los precios de ElevenLabs y el campo más amplio de empresas de IA de voz antes de decidirte.
¿Puedo migrar una app de OpenAI Realtime a Grok Voice?
En su mayoría, sí. El endpoint es compatible a nivel de protocolo con OpenAI Realtime en wss://api.x.ai/v1/realtime, así que cambiar la URL base y la clave cubre casi todo. Cuatro tipos de eventos se comportan de forma distinta, que la sección de migración más abajo enumera. Si construiste sobre la API de audio de OpenAI, calcula una tarde en lugar de un sprint.
¿Es Grok Voice Think Fast 2.0 mejor que ElevenLabs para llamadas de soporte?
Ahora cuestan lo mismo por minuto, así que todo depende de la forma. Grok es de pago por uso y gestiona el razonamiento y las llamadas a herramientas en un solo modelo; ElevenLabs vende paquetes de minutos prepagados. Para una cola de soporte en concreto, ninguno de los dos es un helpdesk, por eso los equipos combinan una capa de voz con algo como un agente de helpdesk con IA que ya conoce el historial de tickets.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Dos personas conversando con formas de onda de voz entre ellas y el logo de Grok arriba
AI

Grok Voice Think Fast 2.0: análisis rápido, preciso y con límites

Un análisis práctico de Grok Voice Think Fast 2.0: la realidad de los benchmarks, las particularidades de la API y el límite de 10 sesiones que decide si puedes lanzarlo a producción.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

¿Qué es Buzz? El espacio de trabajo con IA de Jack Dorsey, explicado

Buzz es la nueva app de chat de equipo de código abierto de Jack Dorsey, donde personas y agentes de IA comparten los mismos canales. Esto es lo que es, para quién es y cuál es el truco.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Ilustración de un lienzo de constructor de agentes de IA sin código con nodos de flujo de trabajo
AI

Los 7 mejores constructores de agentes de IA sin código en 2026

Probé los principales constructores de agentes de IA sin código para equipos de soporte en 2026, desde Botpress hasta Copilot Studio, y ordené cuál encaja realmente con tu configuración.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026
Ilustración editorial para un análisis de Gemini 3.6 Flash, el modelo de IA workhorse rápido de Google
AI

Análisis de Gemini 3.6 Flash: el nuevo caballo de batalla de Google, más barato y rápido

Un análisis práctico de Gemini 3.6 Flash: el nuevo precio, el recorte del 17% en tokens, dónde supera a GPT-5.6 y Claude Sonnet 5, y dónde todavía se queda atrás.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Banner ilustrado para un desglose de los precios de Flowith, mostrando los niveles de suscripción y un modelo de facturación basado en créditos
AI

Precios de Flowith (2026): planes, créditos y el coste real

Un desglose completo de los precios de Flowith: los cuatro niveles basados en créditos, lo que realmente compra un crédito, los detalles que no aparecen en la página de precios y para quién es cada plan.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración de un lienzo de IA ramificado generando imágenes, diapositivas y texto
AI

Flowith review: ¿vale la pena el lienzo con agentes de IA? (2026)

Una review práctica de Flowith: qué hacen realmente el lienzo ramificado y Agent Neo, cuánto cuesta Flowith en créditos, y quién debería evitarlo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Banner ilustrado para una guía sobre Flowith, el espacio de trabajo creativo con agentes de IA construido sobre un lienzo infinito de nodos
AI

¿Qué es Flowith? El lienzo de agentes IA, Agent Neo y sus precios

Flowith es un agente de IA que funciona sobre un lienzo infinito en lugar de una caja de chat. Esto es lo que hace realmente Agent Neo, cuánto cuesta y para qué sirve.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración para una recopilación de las mejores alternativas a Google Gemini 3.6 Flash en 2026
AI

Las 6 mejores alternativas a Gemini 3.6 Flash en 2026

Las mejores alternativas a Gemini 3.6 Flash en 2026, con precios y benchmarks reales: GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite y más.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Ilustración editorial de portada para Muse Image de Meta, un modelo agéntico de generación de imágenes con IA, en azul de Meta
AI

Muse Image de Meta: qué hace y qué tan bueno es

Muse Image de Meta es un modelo de imagen agéntico y gratuito que busca en la web y escribe código a mitad de la generación. Esto es lo que puede hacer y qué tan bueno es en realidad.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis