Grok Voice Think Fast 2.0: análisis rápido, preciso y con límites

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Dos personas conversando con formas de onda de voz entre ellas y el logo de Grok arriba

Lo que probé de verdad, y lo que no pude probar

Quiero ser honesto sobre la base de este análisis, porque la frase "lo he probado" se usa con bastante ligereza cuando se habla de modelos de voz.

Lo que trabajé a fondo: la documentación de voz a voz de xAI de principio a fin, además de la ficha del modelo con sus límites publicados y la tarifa de la página de precios.

Sumado a eso, el anuncio de lanzamiento y la evaluación independiente de Artificial Analysis, que lo puntuó frente a otros 27 modelos. Después leí lo que dice la gente que está construyendo con él.

Lo que no puedo afirmar: no he pasado mil llamadas reales de producción por una línea telefónica en vivo con este modelo. Nadie fuera de xAI lo ha hecho, excepto Starlink. Así que cuando este artículo diga algo sobre el comportamiento bajo carga, viene de un límite publicado y no de una experiencia de campo, y siempre indicaré de cuál se trata.

Construyo agentes de IA en eesel para vivir, sobre todo la parte que se sitúa entre un modelo y una conversación real con un cliente. Esa es la óptica de este análisis. La pregunta no es "¿impresiona en una demo?". Es "¿qué se rompe un martes por la tarde cuando 40 personas llaman a la vez?".

El marcador

Aquí está todo el veredicto en un solo sitio antes de entrar en detalle.

DimensiónPuntuaciónMi lectura
Fluidez conversacional95.1% Full Duplex BenchLa gran mejora. La versión 1.0 obtenía 77.8%. Las interrupciones y los solapamientos ya no son el punto débil.
Inteligencia bruta82.9% índice AASegundo puesto en general, por detrás de Qwen con 84.1%. Suficientemente cerca como para no ser el factor decisivo.
Comportamiento agéntico56.5% τ-voiceEl mejor de la tabla, pero solo 1.9 puntos por delante de Qwen, con 54.6%.
Latencia0.70s hasta el primer audioTercero más rápido. Suficientemente rápido como para que la persona que llama no lo note.
Transcripción1.4 veces mejor que 1.0Una mejora real, y la que xAI ha promocionado menos de lo que merece.
Diseño de la APICompatible a nivel de protocolo con OpenAI RealtimeLo mejor del producto. Las extensiones parecen escritas por alguien que ya había lanzado un agente telefónico antes.
Previsibilidad de costes$4.80/h medido, $4.80/h de listaFacturación plana por minuto. Poco habitual, y vale más de lo que parece.
Margen de escala10 sesiones simultáneasEl problema. Todo lo anterior queda anulado por esta única línea.
Opciones de despliegueSolo us-east-1Sin región en la UE. Para muchos equipos esto zanja la conversación.

Veredicto: el modelo merece una recomendación firme y la plataforma merece un "revisa primero tu volumen". Son dos productos distintos, y las reseñas suelen puntuar solo el primero.

Dónde gana

Cuatro cosas destacaron, y solo una de ellas es la cifra con la que xAI encabezó el lanzamiento. Juntas describen un tipo de modelo muy concreto: no el más inteligente disponible, sino el que se mantiene preciso mientras responde lo bastante rápido para una línea telefónica.

Las interrupciones dejaron de delatarlo

El mayor cambio respecto a 1.0 es el Full Duplex Bench, que mide cómo maneja un modelo las partes desordenadas de una conversación real: interrupciones, solapamientos, señales de escucha, alguien que cambia de opinión a mitad de frase. La versión 1.0 obtenía 77.8%. La 2.0 obtiene 95.1%.

Esa es la cifra que separa a un agente de voz que la gente tolera de uno que hace olvidar que es una máquina. Cualquiera que haya escuchado grabaciones de llamadas conoce el fallo típico: quien llama empieza a corregirse, el bot sigue hablando por encima, y la persona termina repitiéndose más alto o pidiendo hablar con un humano. Está cerca de lo más alto en cualquier lista de problemas de los chatbots que hacen que los clientes se rindan, y los patrones de transferencia de cualquier despliegue serio existen sobre todo para capturar ese momento exacto.

Vale la pena señalar, en justicia, que esta es la única fila donde Grok pierde frente a OpenAI. GPT-Realtime-2.1 High obtiene 95.7%. Una diferencia de 0.6 puntos no es algo que ninguna persona que llame vaya a percibir jamás, pero la tabla de lanzamiento tampoco se va a molestar en aclararlo.

La puntuación agéntica es el verdadero titular

τ-voice mide si un modelo puede realmente completar una tarea por voz, en lugar de limitarse a sonar bien mientras lo intenta. Buscar un pedido, comprobar una política y luego llamar a una función y devolver la respuesta correcta. Grok Voice Think Fast 2.0 obtiene 56.5% aquí, la cifra más alta de toda la tabla de Artificial Analysis.

Three ranking strips comparing Grok Voice Think Fast 2.0 against Qwen, GPT and Gemini on overall index, time to first audio, and agentic tau-voice score
Three ranking strips comparing Grok Voice Think Fast 2.0 against Qwen, GPT and Gemini on overall index, time to first audio, and agentic tau-voice score

Esto importa más que el índice general para quien construye un agente real, porque un agente de voz que no puede usar herramientas de forma fiable es un lector de preguntas frecuentes muy caro. Es la misma distinción que separa a los agentes de IA de los chatbots de IA en texto, y la misma razón por la que los ejemplos útiles de agentes de IA son siempre aquellos que tocan un sistema real en lugar de recitar un artículo.

La salvedad honesta: Qwen Audio 3.0 Realtime Plus se sitúa en 54.6% en el mismo benchmark. Así que la ventaja de Grok es de 1.9 puntos, que no es el abismo que sugiere el enfoque publicitario. La diferencia frente al mejor resultado de OpenAI, 45.7%, es más amplia, y de ahí sale la frase de "10 puntos por delante", pero Qwen está justo ahí al lado.

La combinación de velocidad e inteligencia

0.70s hasta el primer audio, frente a los 1.25s de la versión 1.0. Deepslate Opal es más rápido, con 0.44s, y una variante de Gemini Flash llega a 0.63s, así que Grok queda tercero. Pero Qwen, el modelo que le supera en el índice general, tarda 4.02s en emitir el primer audio. En una línea telefónica eso es una pausa muerta lo bastante larga como para que quien llama diga "¿hola?".

Ese equilibrio es el producto real. Alguien en Hacker News lo expresó mejor que el propio anuncio de lanzamiento.

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close.

The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

xAI también afirma que los tokens de razonamiento funcionan al 0.4x del P50 de su predecesor, que es cómo se volvió más rápido volviéndose más inteligente, en lugar de pensar menos.

La transcripción es la parte infravalorada

Enterrado en el anuncio de lanzamiento: la precisión de la transcripción es 1.4 veces mejor que en 1.0, y de 1.5 a 2.0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas. En audio con ruido o de telefonía, la diferencia reclamada ronda las 10 veces.

El audio de telefonía es donde la transcripción suele fallar más, y es exactamente el tipo de audio que una línea de soporte maneja todo el día. Si estás evaluando esto frente a ElevenLabs o un proveedor especializado en voz a texto, esa cifra de audio ruidoso merece más peso que los benchmarks conversacionales. Es también el terreno en el que el endpoint de transcripción de OpenAI ha sido la opción por defecto, en gran parte por inercia.

Ahora hay 26 voces en el catálogo, tras añadirse 21 en julio de 2026, y cualquiera de ellas se puede sustituir por un identificador de voz clonada. Si alguna vez has luchado por mantener a un bot sonando como tu marca en distintos canales, el problema de la voz de marca no desaparece solo porque el resultado sea audio.

Dónde la tabla de benchmarks lo vende mejor de lo que es

Tres cosas que el enfoque del lanzamiento no cuenta.

El 82.9% es el segundo puesto. Qwen Audio 3.0 Realtime Plus tiene 84.1%. Grok es competitivo frente a él, y mucho más rápido, pero "estado del arte" está haciendo bastante trabajo en la copia de marketing. Si has seguido la familia de modelos de Qwen o lo que cobra Alibaba últimamente, sabrás que están lanzando productos a un ritmo intenso.

No compares entre sí las dos cifras de τ-voice de xAI. El artículo del Voice Agent Builder del 1 de julio reporta que Think Fast 1.0 obtuvo 67.3% en su propia medición de τ-voice. Artificial Analysis puntúa el mismo modelo con 52.1%. Arneses distintos, escalas distintas. Cualquiera que apile esas dos cifras en un gráfico de "mira cuánto ha mejorado" no está comparando nada real. La misma cautela aplica a las cifras del precio del Voice Agent Builder, que todavía cita la tarifa antigua.

Las cifras de Starlink pertenecen a 1.0. El 20% de conversión de ventas y el 70% de resolución autónoma, tan citados, provienen de la línea +1 888 GO STARLINK con 28 herramientas conectadas, y son resultados de Think Fast 1.0. Para 2.0, xAI dice que las pruebas A/B en esa misma línea mostraron "un aumento significativo" en conversión y contención, sin publicar ninguna cifra. Además, se trata de un despliegue interno dentro de la misma estructura de propiedad, lo que lo convierte más en el mejor caso posible que en algo representativo.

Construir sobre él: la API es la parte buena

Esperaba que la documentación fuera el punto débil aquí y resultó ser justo lo contrario. En cuanto a diseño, es la API de voz en tiempo real más cuidada que he leído.

A two-column checklist showing what carries over from OpenAI Realtime and which four event types you rewrite
A two-column checklist showing what carries over from OpenAI Realtime and which four event types you rewrite

Es compatible a nivel de protocolo con OpenAI Realtime en wss://api.x.ai/v1/realtime, así que si ya tienes una aplicación existente, la migración se reduce a una URL base y una clave. Incluso puedes conservar el SDK de OpenAI y apuntarlo simplemente a https://api.x.ai/v1. Hay cuatro cosas que no se conservan: conversation.item.done, rate_limits.updated y la mayoría de los eventos output_audio_buffer.* no se emiten, y ...input_audio_transcription.delta pasa a llamarse .updated y se vuelve acumulativo, lo que corromperá en silencio la visualización de tu transcripción si estabas concatenando los deltas.

Las extensiones exclusivas de xAI son donde la cosa se pone interesante, y parecen escritas por gente que ya había lanzado un agente telefónico y se había quemado con él:

  • force_message dice una frase codificada mediante TTS sin involucrar al modelo en absoluto. Con interruptible: false, el audio de quien llama se descarta hasta que termina. Esto resuelve de forma adecuada el problema del aviso de cumplimiento normativo, en lugar de confiar a ciegas en que tu prompt del sistema aguante.
  • replace es un mapa de pronunciación que se aplica antes del TTS, de modo que el audio dice "Acme Mobull" mientras la transcripción sigue leyendo "Acme Mobile". La coincidencia no distingue mayúsculas de minúsculas, respeta los límites de palabra completa y prioriza la coincidencia más larga.
  • resumption guarda en caché los turnos por conversation_id y los reproduce al reconectar. Está desactivado por defecto, ambas partes deben activarlo explícitamente, y el historial caduca tras 30 minutos de inactividad.
  • keyterms sesga la transcripción hacia hasta 100 términos de dominio de 50 caracteres cada uno, actualizables durante la sesión. Para una línea de soporte llena de SKU y nombres de planes, esto marca la diferencia entre una transcripción utilizable y un desastre.
  • idle_timeout_ms se rearma después de cada respuesta, así que el agente puede volver a intentar contactar a alguien que se ha quedado en silencio repetidamente, en lugar de quedarse esperando.

El parámetro reasoning.effort acepta exactamente dos valores: "high" (el predeterminado) y "none". No hay un ajuste intermedio, y eso es una carencia real. Alguien planteó justo esto en Hacker News sobre un lanzamiento anterior de voz de Grok:

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models

Just give me a option to have a slower response but better model…"

Hay otra cosa que la documentación acierta y que la mayoría de proveedores dejan para que la descubras en producción: te indican explícitamente que esperes a que termine la reproducción del audio antes de enviar response.create tras una llamada a herramienta, porque el servidor entrega todos los deltas de audio antes que los eventos de llamada a función. Saltarte eso produce audio solapado. Incluso sugieren mostrar un indicador de "pensando" durante ese hueco. Es un detalle aprendido a base de golpes, y está escrito.

El propio consejo de la guía de migración es hacer tu prompt del sistema más corto, no más largo, lo cual dice bastante sobre cómo se ha ajustado el modelo.

Los tres límites que realmente frenarán tu lanzamiento

Si yo estuviera evaluando esto, esta sería la sección que leería primero.

A funnel diagram showing inbound calls narrowing through a gate labelled 10 concurrent sessions per team, with the rest queued
A funnel diagram showing inbound calls narrowing through a gate labelled 10 concurrent sessions per team, with the rest queued

10 sesiones simultáneas por equipo. Este es el valor por defecto publicado en la ficha del modelo, que se puede ampliar bajo petición. Diez llamadas simultáneas es apenas lo que supone un lunes por la mañana para un equipo pequeño de soporte. Todos los benchmarks anteriores son irrelevantes si la llamada número once no puede conectar, y "ampliable bajo petición" es una conversación comercial, no una opción de configuración. Cualquiera que esté dimensionando un agente de IA para centros de llamadas debería tratar esto como la primera pregunta, no como una nota al pie.

Como comparación, los productos de voz empaquetados que se construyen sobre un helpdesk no suelen publicar ningún techo de sesiones, porque la concurrencia es problema del proveedor y no tuyo. Eso ocurre con los agentes de voz con IA de Zendesk, con la configuración de Freshcaller, y con el agente de voz de Salesforce. Cambias flexibilidad por que otro se ocupe de la planificación de capacidad.

Solo us-east-1. Una única región, sin opción en la UE. Si tienes compromisos de residencia de datos, esto lo decide todo antes de que evalúes nada más.

Sin nivel prioritario ni descuento por lotes. El nivel prioritario 2x solo aplica a Chat Completions y Responses. El descuento del 20% por lotes solo aplica a modelos de texto. La voz no tiene ni carril rápido ni rebaja por volumen, así que la tarifa que ves es la tarifa que pagas a cualquier escala. También hay una duración máxima de sesión de 120 minutos, generosa para soporte y algo ajustada para cualquier cosa parecida a una línea monitorizada.

Dos detalles menores que conviene conocer. El almacenamiento se factura aparte si tu agente hace recuperación de información: las colecciones cuestan $0.10/GiB/día, los archivos $0.025, y las descargas $0.20/GiB. Y hay una tarifa de $0.05 por infracción de las normas de uso por cada petición de Responses bloqueada antes de generarse.

¿Deberías pasar a 2.0 o quedarte con 1.0?

El cambio de alias del 5 de agosto hace que no hacer nada sea ya, en sí mismo, una decisión. Elige la fila que te describa.

¿Qué estás usando actualmente?

Elige una opción. El veredicto cambia mucho según cuál de estas seas.

Adopta 2.0 sin pensarlo más

A volumen de demo, la subida del 60% es un error de redondeo, y el salto de Full Duplex de 77.8% a 95.1% marca la diferencia entre una demo que convence y una que no. Deja que el cambio de alias te lleve sin más.

Adopta 2.0, pero presupuesta el cambio

Tu coste por minuto pasa de $0.05 a $0.08 el 5 de agosto sin ningún despliegue de tu parte. A 2.000 minutos al mes son entre $100 y $160 más. La mejora en la fluidez conversacional lo justifica, pero pon la cifra delante de quien tenga que aprobarla antes de que lo haga la factura.

Resuelve primero el límite de sesiones, el modelo después

10 sesiones simultáneas por equipo es el valor por defecto publicado, y aumentarlo es una conversación con xAI, no un cambio de configuración. Consigue ese número por escrito antes de evaluar nada más. Una puntuación de 95.1% en Full Duplex no hace nada por la llamada número once.

Todavía no es tu modelo

La voz a voz solo funciona en us-east-1, sin ninguna región de la UE publicada. Ninguna puntuación de este artículo cambia eso. Vuelve a evaluarlo cuando xAI publique una segunda región.

Lo que dice la gente que construye con él

X es el hogar natural de las reacciones a xAI y ahora mismo es difícil de leer con profundidad, así que la señal útil está en Hacker News. Dos hilos concentran casi todo.

El comentario más votado en el hilo de Think Fast 2.0 es, en esencia, una queja sobre lo poco notado que ha pasado el lanzamiento:

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

Es una lectura justa sobre la capacidad, y vale la pena señalar que el precio también se ha alineado ahora. Todos los planes de pago de ElevenLabs Agents equivalen a casi exactamente $0.08 por minuto incluido, que es la nueva tarifa de Grok al céntimo. Hasta el 5 de agosto, Grok lo abarataba en un 37.5%.

La opinión más mesurada, de unos meses antes, sigue siendo válida:

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Es más o menos donde yo también me quedo. Un modelo de voz siempre es un compromiso frente a un modelo de texto que puede pensar durante diez segundos, y Grok logra un mejor compromiso que el resto del campo. Lee las reseñas del lado del consumidor y verás el mismo veredicto expresado con menos cuidado.

La frustración recurrente en estos hilos es el uso de herramientas en modo voz, y merece la pena aclararlo porque juega en ambas direcciones:

Hacker News

"What I'm missing from this announcement is the capability to use connectors and tools. I don't really get it - NONE of the frontier assistants can use tools / connectors while in voice mode"

Eso se refiere a los asistentes de voz de consumo, y en el lado de la API no es cierto para Grok: las sesiones admiten herramientas function, file_search, web_search, x_search y mcp remotas, con las del lado del servidor ejecutándose por ti. Las herramientas del servidor se facturan por invocación, a $5 por cada 1.000 para búsqueda web y en X, $2.50 por cada 1.000 para colecciones, y $10 por cada 1.000 para búsqueda de archivos adjuntos. La brecha que describe el comentario es real en la aplicación de consumo de Grok, no en lo que construirías tú mismo. Es la misma división que recorre el despliegue de voz de ChatGPT: la API lleva tiempo por delante de la aplicación.

Quién debería adoptarlo, y quién debería esperar

Adóptalo si estás construyendo un agente telefónico o de voz que tiene que hacer cosas, no solo hablar. La puntuación τ-voice, el soporte de herramientas, las extensiones force_message y keyterms, y el medidor plano por minuto suman el stack de voz más amigable para desarrolladores que hay actualmente en producción. Migrar desde el audio en tiempo real de OpenAI es casi gratis.

Adóptalo si la previsibilidad de costes importa a tu departamento de finanzas. Artificial Analysis mide el coste real de Grok en $4.80 por hora de audio de entrada, idéntico al precio de lista, porque el medidor es plano por minuto. GPT-Realtime-2 tiene un precio de lista de $1.15/h de entrada y mide $4.14 todo incluido. Las facturas de voz que coinciden con su precio anunciado son más raras de lo que deberían, lo que explica en parte por qué la pregunta sobre el coste del agente frente al humano es tan difícil de responder con honestidad.

Adóptalo si quieres construir tú mismo la orquestación. Si prefieres arrastrar cajas de un lado a otro, el precio de Voiceflow y las alternativas al Voice Agent Builder son el extremo sin código del mismo mercado.

Espera si tu volumen supera las diez llamadas simultáneas y todavía no tienes un límite ampliado por escrito. Espera si necesitas una región en la UE. Espera si dependías de la tarifa de $0.05 y no te habías dado cuenta de que el alias se movía bajo tus pies, en cuyo caso fija hoy mismo grok-voice-think-fast-1.0 y decide con tu propio calendario.

No lo compres como solución de soporte. Esto es un modelo y una API, no un agente de helpdesk. No tiene ni idea de tu historial de tickets, tus macros, tus reglas de escalado, ni de qué preguntas tu equipo ya ha decidido que la IA no debe tocar. Todo lo anterior trata sobre la capa de voz, y la capa de voz es como mucho el 20% de lo que hace que una automatización de soporte funcione de verdad. El resto es la parte aburrida: conocer tu producto, saber cuándo parar, y transferir la conversación con limpieza.

Una responsable de CX en una marca DTC de suplementos expresó esa limitación mejor que cualquier ficha técnica:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Ningún benchmark de voz mide eso. Es una cuestión de política, y es la que decide si un despliegue sobrevive a su primer mes.

La voz es la mitad más ruidosa de una cola de soporte

La mayoría de los tickets que acaban convirtiéndose en llamadas telefónicas podían haberse respondido por texto una hora antes. La automatización de la primera respuesta y un chatbot de base de conocimiento que la IA pueda leer de verdad eliminan más llamadas que cualquier modelo de voz. Eso es lo que vale la pena arreglar antes de salir a comprar uno.

eesel es un agente de IA que se conecta al helpdesk que ya usas, se entrena con tus tickets pasados y tu centro de ayuda en lugar de con un prompt de sistema que tienes que escribir a mano, y te deja simular todo el proceso contra tu historial real de tickets antes de que un solo cliente lo toque. Esa última parte es deliberada. He pasado años viendo bots que suenan seguros de sí mismos dar respuestas equivocadas, y una prueba en seco sobre tickets que ya has resuelto es la única forma honesta de saber qué hará el tuyo. También es el paso que separa a un agente de IA real de un bot basado en reglas cuando se acaban las rutas predefinidas.

Es la misma decisión de construir frente a comprar a la que llegan muchos equipos después de leer una página de documentación como la de xAI y entender cuánto de eso terminarían manteniendo ellos mismos:

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Karel, GENERAL BYTES

Si también te interesa la capa de voz, sigue leyendo sobre el Voice Agent Builder de Grok y el panorama más amplio de empresas de voz con IA. Si quieres resolver primero la cola que hay detrás, eesel es gratis para probar y se conecta a tu helpdesk en cuestión de minutos. Los equipos que usan Gorgias o Zendesk suelen tenerlo respondiendo tickets reales esa misma tarde.

Tres cosas que vale la pena leer después, según en qué punto de todo esto estés atascado:

Preguntas frecuentes

¿Es Grok Voice Think Fast 2.0 lo bastante bueno para agentes de voz en producción?
En cuanto al modelo en sí, sí. Obtiene un 82.9% en el índice de voz a voz de Artificial Analysis y un 56.5% en el benchmark agéntico τ-voice, la puntuación agéntica más alta de esa tabla. La limitación está en la plataforma que lo rodea: 10 sesiones simultáneas por equipo por defecto y una única región, us-east-1. Lee el análisis completo de Grok Voice Think Fast 2.0 para conocer el mecanismo a fondo, y agentes de IA para centros de llamadas para saber qué suele necesitar un despliegue en producción.
¿Qué hay de nuevo en Grok Voice Think Fast 2.0 respecto a 1.0?
Full Duplex Bench pasó de 77.8% a 95.1%, el tiempo hasta el primer audio bajó de 1.25s a 0.70s, y el índice general subió de 75.7% a 82.9%. La precisión de la transcripción es 1.4 veces mejor que en 1.0. La pega está en el precio: la tarifa pasó de $0.05 a $0.08 por minuto, algo que el desglose de precios de Grok Voice explica en cifras concretas.
¿Cuánto cuesta Grok Voice Think Fast 2.0 por minuto?
$0.08 por minuto de audio, o $4.80 por hora, más $0.004 por cada mensaje de texto de entrada. Eso supone un aumento del 60% sobre la tarifa de 1.0, y se aplica automáticamente si llamas al alias grok-voice-latest. Compáralo con el precio de ElevenLabs y con el panorama más amplio de empresas de voz con IA antes de decidirte.
¿Puedo migrar una aplicación de OpenAI Realtime a Grok Voice?
En su mayor parte, sí. El endpoint es compatible a nivel de protocolo con OpenAI Realtime en wss://api.x.ai/v1/realtime, así que cambiar la URL base y la clave cubre casi todo. Cuatro tipos de eventos se comportan de forma distinta, algo que se detalla en la sección de migración más abajo. Si construiste tu aplicación sobre la API de audio de OpenAI, calcula una tarde de trabajo, no un sprint entero.
¿Es Grok Voice Think Fast 2.0 mejor que ElevenLabs para llamadas de soporte?
Ahora tienen el mismo precio por minuto, así que todo depende de la forma del producto. Grok funciona con pago por uso y gestiona razonamiento y llamadas a herramientas en un solo modelo; ElevenLabs vende paquetes de minutos prepagados. Para una cola de soporte en concreto, ninguno de los dos es un helpdesk, por eso los equipos combinan una capa de voz con algo como un agente de IA para helpdesk que ya conoce el historial de tickets.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

¿Qué es Buzz? El espacio de trabajo con IA de Jack Dorsey, explicado

Buzz es la nueva app de chat de equipo de código abierto de Jack Dorsey, donde personas y agentes de IA comparten los mismos canales. Esto es lo que es, para quién es y cuál es el truco.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Ilustración de un lienzo de constructor de agentes de IA sin código con nodos de flujo de trabajo
AI

Los 7 mejores constructores de agentes de IA sin código en 2026

Probé los principales constructores de agentes de IA sin código para equipos de soporte en 2026, desde Botpress hasta Copilot Studio, y ordené cuál encaja realmente con tu configuración.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026
Ilustración editorial para un análisis de Gemini 3.6 Flash, el modelo de IA workhorse rápido de Google
AI

Análisis de Gemini 3.6 Flash: el nuevo caballo de batalla de Google, más barato y rápido

Un análisis práctico de Gemini 3.6 Flash: el nuevo precio, el recorte del 17% en tokens, dónde supera a GPT-5.6 y Claude Sonnet 5, y dónde todavía se queda atrás.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Banner ilustrado para un desglose de los precios de Flowith, mostrando los niveles de suscripción y un modelo de facturación basado en créditos
AI

Precios de Flowith (2026): planes, créditos y el coste real

Un desglose completo de los precios de Flowith: los cuatro niveles basados en créditos, lo que realmente compra un crédito, los detalles que no aparecen en la página de precios y para quién es cada plan.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración de un lienzo de IA ramificado generando imágenes, diapositivas y texto
AI

Flowith review: ¿vale la pena el lienzo con agentes de IA? (2026)

Una review práctica de Flowith: qué hacen realmente el lienzo ramificado y Agent Neo, cuánto cuesta Flowith en créditos, y quién debería evitarlo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Banner ilustrado para una guía sobre Flowith, el espacio de trabajo creativo con agentes de IA construido sobre un lienzo infinito de nodos
AI

¿Qué es Flowith? El lienzo de agentes IA, Agent Neo y sus precios

Flowith es un agente de IA que funciona sobre un lienzo infinito en lugar de una caja de chat. Esto es lo que hace realmente Agent Neo, cuánto cuesta y para qué sirve.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración para una recopilación de las mejores alternativas a Google Gemini 3.6 Flash en 2026
AI

Las 6 mejores alternativas a Gemini 3.6 Flash en 2026

Las mejores alternativas a Gemini 3.6 Flash en 2026, con precios y benchmarks reales: GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite y más.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Ilustración editorial de portada para Muse Image de Meta, un modelo agéntico de generación de imágenes con IA, en azul de Meta
AI

Muse Image de Meta: qué hace y qué tan bueno es

Muse Image de Meta es un modelo de imagen agéntico y gratuito que busca en la web y escribe código a mitad de la generación. Esto es lo que puede hacer y qué tan bueno es en realidad.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Ilustración de una ficha del modelo Kimi K3 junto a una fila de tarjetas de planes de precios, en azul Kimi
AI

Precios de Kimi K3: lo que realmente cuesta el modelo de frontera de Moonshot

Los precios de Kimi K3, descifrados: la tarifa de API de 3/15 dólares, los planes de app de 19 a 199 dólares, cómo el descuento del 90% por caché cambia las cuentas, y cómo se compara con Claude, GPT y DeepSeek.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 17, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis