La mejor IA para soporte telefónico al cliente en 2026 (9 herramientas probadas)

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Ilustración de una línea telefónica, una forma de onda de sonido y un agente de soporte con auriculares

Por qué la voz ha vuelto, y por qué eso importa ahora

Durante casi una década el consejo sensato fue que el soporte telefónico estaba muriendo. No es así. La voz ha repuntado hasta el 40% del volumen de los contact centers y sigue creciendo. El chat, mientras tanto, tiene una tasa de retorno del 32% directo a la voz. Así que el teléfono es donde acaban los contactos difíciles en lugar de los fáciles, lo cual es un problema distinto de la automatización de call centers habitual. También es por eso que la generación anterior de sistemas de llamadas automatizados nunca hizo mella real en esto.

Ese efecto de selección es todo el problema. Un comentarista de Hacker News lo expresó mejor que cualquier presentación de ventas que haya visto:

Hacker News

"I admire what you have done, but for a luxury experience, I do not want to talk to an AI that just tells me what is already on the website. If I have gotten to the point where I am calling you, its because I couldn't find an answer to my question on the website in the first place."

Todo el que te vende un agente de voz lo entrena con tu centro de ayuda. Y las personas que te llaman son, por definición, aquellas a las que tu centro de ayuda ya ha fallado. Ten esto presente, porque explica la mayoría de los lanzamientos decepcionantes de los que oigo hablar.

Cómo elegí estas herramientas, y el benchmark que nadie cita

El 5 de agosto de 2026 revisé la página de precios, la documentación y el centro de ayuda de cada proveedor. Después calculé el coste real todo incluido por minuto en lugar del anunciado, y comprobé qué hace cada uno en el momento en que el agente no puede terminar la tarea. Cuando un proveedor no publica una tarifa, lo digo en lugar de adivinar.

Esta lista es deliberadamente más estrecha que mi encuesta más amplia sobre empresas de IA de voz. También adopta un ángulo distinto al de la lista de mejor IA para soporte telefónico, que ordena por tipo de proveedor. Aquí el orden lo dictan las mediciones.

La medición que cambió cómo leo toda la categoría es τ-Voice, y no es un benchmark de audio genérico. Un usuario simulado llama al modelo con un problema real, un cambio de vuelo o un cargo disputado, a veces una avería de telecomunicaciones. La puntuación es si la base de datos termina en el estado final correcto. Es decir, puntúa exactamente lo que estás comprando.

Gráfico de barras que compara el 70 al 95 por ciento de contención de llamadas anunciado en las páginas de los proveedores frente al 56,5 por ciento logrado por el mejor modelo en el benchmark de soporte tau-Voice
Gráfico de barras que compara el 70 al 95 por ciento de contención de llamadas anunciado en las páginas de los proveedores frente al 56,5 por ciento logrado por el mejor modelo en el benchmark de soporte tau-Voice

La cabecera de esa clasificación es aleccionadora:

Modeloτ-Voice (escenarios de soporte resueltos)Razonamiento del hablaTiempo al primer audioCoste por hora de audio de entrada
Grok Voice Think Fast 2.0 High56,5%97%0,70s$4.80
Qwen Audio 3.0 Realtime Plus54,6%99%4,02s$4.42
Grok Voice Think Fast 1.052,1%97%1,25s$3.00
GPT-Realtime-2.1 High45,7%96%1,21s$10.75
GPT-Realtime-2 High39,8%97%1,14s$4.14
Gemini 3.1 Flash High37,7%97%2,99s$1.75
Deepslate Opal17,5%85%0,44s$6.48
GPT Realtime Mini15,1%64%0,81s$3.04

Lee la segunda y la tercera columna juntas. El razonamiento del habla está básicamente resuelto, ya que seis de estos ocho modelos puntúan un 96% o más al entender una pregunta hablada. Después esos mismos modelos se caen por un precipicio en el momento en que tienen que completar la tarea. Entender a quien llama ya no es la parte difícil. Terminar el trabajo lo es.

¿Quieres ver cómo se ve eso en un entorno de trabajo real en lugar de en un benchmark? La propia documentación de Bland publica una pantalla de análisis de herramientas que es más honesta que cualquier página de marketing:

El panel de análisis de herramientas de Bland reportando 408 ejecuciones de herramientas totales, 142 errores totales y una tasa de error del 34,8%, desglosado en errores de validación y de API
El panel de análisis de herramientas de Bland reportando 408 ejecuciones de herramientas totales, 142 errores totales y una tasa de error del 34,8%, desglosado en errores de validación y de API

408 ejecuciones de herramientas, 142 errores, una tasa de error del 34,8%. El principal culpable es una búsqueda en el calendario que falla 81 veces con "start_time must be in the future". Nada de eso es un problema de habla. El agente entendió a la persona que llamaba perfectamente, y después la llamada a la herramienta falló, y ahí es exactamente donde se pierde la puntuación de τ-Voice.

La latencia dejó de ser el cuello de botella

La categoría todavía se vende con milisegundos. Entiendo por qué, porque durante años esa fue realmente la barrera. Ya no, y la clasificación lo muestra con claridad.

Cuadrante de dos por dos que sitúa cuatro modelos de voz a voz según el tiempo al primer audio frente a la proporción de tareas de soporte que completan, con Deepslate Opal como el más rápido y el menos capaz
Cuadrante de dos por dos que sitúa cuatro modelos de voz a voz según el tiempo al primer audio frente a la proporción de tareas de soporte que completan, con Deepslate Opal como el más rápido y el menos capaz

Deepslate Opal responde más rápido en toda la tabla, 0,44 segundos, y resuelve el 17,5% de los escenarios de soporte. Grok Voice Think Fast 2.0 tarda un cuarto de segundo más y resuelve el 56,5%. Nadie cuelga por 260 milisegundos. La gente cuelga porque el agente no pudo hacer aquello por lo que llamaban.

Y lo que los operadores informan que va mal no es lentitud en absoluto. Es que el agente habla por encima de ellos:

Reddit

"It's brutal. We're losing ~40% of callers in the first 30 seconds. Current setup: Vapi with GPT-4 Turn-end detection at 800ms (their default) Network latency averaging 120-150ms Processing adds another 200-300ms What I've tried: Increased silence threshold to 1.2s → Bot feels sluggish, people think it's broken Decreased to 500ms → Interruption city, worse than before Added "please wait for customer to finish" to prompt → Literally no effect"

Eso es gestión de interrupciones (barge-in). Un problema de ajuste más que de modelo, y la partida más subestimada en un despliegue de voz, con diferencia. Un operador que construyó su propia infraestructura cifró el sobrecoste en "200-400ms until you tune turn detection thresholds properly", y luego dijo a la gente que se preparara para "plan for two months of 'why is my agent talking over the caller'" antes de que fuera de calidad de producción, en este hilo de construir frente a comprar.

El relato más completo que encontré vino de alguien con 20 despliegues a sus espaldas. Cubre tanto las interrupciones como la transferencia, y también el coste, todo en un mismo mensaje:

Reddit

"deployed voice agents for about 20 small businesses now, mostly service companies like plumbers, dentists, med spas. here's what i've actually hit in production: biggest issue by far is barge-in handling. customer starts talking while the agent is still speaking and everything goes sideways. most platforms handle this okay in demos but in real calls with background noise, accents, or people who talk fast it breaks constantly. had to build custom silence detection thresholds per client. second is the handoff to human. when the ai can't handle something it needs to transfer cleanly. vapi and retell both struggle here depending on the telephony setup. the call drops, or there's a 3 second gap of silence that makes the caller hang up. we ended up building a warm transfer flow where the agent briefs the human before connecting. [...] cost wise the biggest surprise was how much it costs when calls go long. a 10 minute call can cost $1.50-2.00 when you add up stt + llm + tts + telephony. sounds small but if you're handling 200 calls a day for a client it adds up fast. we had to build hard cutoffs and summarization to keep calls under 4 minutes."

Merece la pena destacar tres cosas de ahí. Una llamada de diez minutos cuesta entre 1,50 y 2,00 dólares todo incluido, y eso coincide con las cuentas de más abajo, no con ninguna página de inicio. Las demos ocultan los problemas de interrupciones, porque quienes llaman en una demo no tienen acentos ni ruido de fondo. Y la solución, tanto para el vacío de la transferencia como para el coste, fue construir algo que la plataforma no ofrecía.

Las cuatro cosas por las que realmente puntué

  1. Transferencia a una persona. No si existe. Sino si es en caliente, si entrega un resumen en lugar de una transcripción bruta, y si todo esto está detrás de un contrato empresarial. Una buena gestión de escalado es la diferencia entre un desvío y una persona que llama molesta.
  2. Fuentes de conocimiento. Casi todas las herramientas de aquí ingieren un rastreo público del sitio web más archivos subidos. Casi ninguna toca tus tickets pasados ni una wiki autenticada. Esa distinción es lo que decide cómo maneja las llamadas que tu centro de ayuda ya ha fallado.
  3. Pruebas antes del lanzamiento. Una "simulación" que ejecuta escenarios que has escrito tú mismo es una garantía distinta de una que reproduce tu propio historial de llamadas. Exactamente un proveedor de aquí hace lo segundo. Para la prevención de alucinaciones eso importa más que cualquier ajuste de guardarraíles.
  4. Coste real por minuto, con telefonía incluida. Nunca la cifra de la página de inicio. Es también la cifra que decide tu ROI de call center.

Las 9 mejores herramientas de IA para soporte telefónico al cliente en 2026

HerramientaMejor paraTarifa real todo incluidoUnidad de facturaciónTransferencia a humanoFuentes de conocimientoPrueba contra tus propias llamadasConcurrenciaSeguridadIntegraciones de helpdesk
ElevenLabs AgentsUna tarifa que puedes prever$0.08/min + operadorPor minuto, prepagoSí, transfer_to_numberArchivos, URLs, RAG en el plan gratuitoNo4 a 40 según el planSOC 2, ISO 42001, PCI DSS L1, BAA en EnterpriseZendesk, Salesforce
Retell AIEquipos de soporte sin equipo de desarrollo~$0.135/minPor minuto, ensambladaEn caliente, más toma de control por supervisorRastreo de sitio web, subida de archivosNo20 gratis, luego $8/línea/mesSOC 2 Type II, HIPAA, RGPDHubSpot, Salesforce; Zendesk "próximamente"
VapiControlar tú mismo la pila del modelo~$0.105/minPor minuto, ensambladaSí, vía proveedor de telefoníaSolo subida de archivos, recuperación con GeminiNo10 gratis, luego $10/línea/mesHIPAA $2.000/mes, ZDR $1.000/mesNinguna preconstruida
PolyAIUn parque CCaaS ya existenteSolo bajo presupuestoPor minutoDocumentación e integracionesNoNo publicadoSOC 2 Type 2, ISO 27001, PCI DSS, RGPD, HIPAA de serieZendesk Talk vía CCaaS
ParloaProbar contra tu historial de llamadasSolo bajo presupuestoPor consumo, según complejidad de la tareaConectores empresarialesSí, reproduce transcripciones realesNo publicadoISO 27001, SOC 2 Type 1 y 2, PCI DSSZendesk, ServiceNow, Salesforce, Dynamics
SierraPagar solo por resolucionesSolo bajo presupuestoPor conversación resueltaSí, conservando el contextoConectores empresarialesSimulaciones de vozNo publicadoSOC 2, ISO 27001, ISO 42001, HIPAA, PCI DSS, FedRAMPNo publicado
Bland AIAlta concurrencia y autoalojamiento$0.11 a $0.14/minPor minuto + cuota de plataformaSolo EnterpriseArchivos, texto, web públicaNo10 a 100, Enterprise hasta 1 millónSLA del 99,9% en todos los planes, BAA en EnterpriseNinguna
SynthflowUn despliegue nativo de Freshworks~$2.500/mes de mínimoPor segundo, agregadaFría, cálida, cálida con resumenPDFs, URLs, rastreo, importación de ZendeskTest Center, facturableFijada por contratoSOC 2, RGPD, ISO 27001Freshworks (Freshcaller)
Grok Voice Agent BuilderEl modelo capaz más rápido$0.08/min + $0.01 númeroPor minuto, según usoVía llamadas a herramientasColecciones, búsqueda de archivos y webNo10 sesiones por equipoNo publicado para vozNinguna

Nueve herramientas y cuatro formas distintas de cobrar. Solo una te deja probar contra tu propio archivo de llamadas, y esa es la columna que yo capturaría.

Antes de las fichas individuales, algunas cuentas. Las tarifas anunciadas no son comparables entre sí, y la brecha es lo bastante amplia como para cambiar tu lista corta.

1. ElevenLabs Agents

Mejor para: equipos que necesitan prever la factura hasta el céntimo antes de comprometerse.

ElevenLabs es más conocida por la conversión de texto a voz. La plataforma Agents es la capa conversacional que se apoya en eso, y ya ha lanzado más de 4 millones de agentes. La razón por la que encabeza esta lista es aburrida: es el único proveedor aquí cuya aritmética de precios cierra.

La consola de ElevenAgents mostrando 33,9K llamadas, 3:46 de duración media, una tasa de éxito global del 75,1% y una valoración media de CSAT de 3,5 estrellas, tomado de ElevenLabs
La consola de ElevenAgents mostrando 33,9K llamadas, 3:46 de duración media, una tasa de éxito global del 75,1% y una valoración media de CSAT de 3,5 estrellas, tomado de ElevenLabs

Merece la pena detenerse en ese panel. Es el único lugar de este repaso donde un proveedor muestra sus propios números sin editar: 75,1% de tasa de éxito global, 3,5 estrellas de CSAT medio. Un despliegue de aspecto realista, en otras palabras, y no una afirmación del 95%.

Lo que realmente hace

La telefonía por SIP está incluida en todos los planes en lugar de reservada, lo cual es inusual. Las bases de conocimiento y el RAG funcionan incluso en el plan gratuito. Llamadas a herramientas, llamadas por lotes, un servidor MCP alojado para gestión de agentes, una CLI: todo está ahí. Las integraciones con nombre cubren Genesys y Amazon Connect en el lado de la telefonía. Para ticketing son Zendesk y Salesforce, los únicos dos sistemas de tickets con páginas propias.

Dos cosas que debes saber antes de construir. Sus propias páginas se contradicen sobre los idiomas, listando 70+ en el catálogo de voces frente a 31 en los que un agente realmente se puede configurar para hablar. Segundo, no existe una cifra publicada de latencia de ida y vuelta para un agente, solo cifras de componentes para Flash v2.5 de unos 75ms y Scribe v2 Realtime de unos 150ms. Ninguna de las dos es lo mismo que lo que oye tu persona que llama.

Precios

PlanMensualMinutos incluidos$/min efectivoExcesoRáfagaLlamadas concurrentes
Free$015n/a$0.08$0.164
Starter$675$0.0800$0.08$0.166
Creator$22 (primer mes $11)275$0.0800$0.08$0.1610
Pro$991.238$0.0800$0.08$0.1620
Scale$2993.738$0.0800$0.08$0.1630
Business$99012.375$0.0800$0.08$0.1640
EnterprisePersonalizadoPersonalizadoNegociableNegociablen/aAmpliada

Mira esa columna de efectivo. Cada plan de pago se divide en exactamente $0,08. Business cuesta $990 por 12.375 minutos, y 12.375 × $0,08 son exactamente $990,00. Así que las asignaciones de minutos se calcularon a la inversa a partir del precio, lo que significa que no hay descuento por volumen en ningún plan. Los mensajes de texto cuestan $0,003 cada uno, y la telefonía del operador se cobra "al coste" aparte.

Ventajas

  • El único coste por minuto de este repaso que realmente puedes prever.
  • El troncal SIP no está bloqueado para Enterprise, así que tu propio operador funciona en un plan de $6.
  • Una lista de cumplimiento seria: ISO 42001, AIUC-1, PCI DSS Nivel 1.
  • Las bases de conocimiento y el RAG funcionan en el plan gratuito, así que probar de verdad no cuesta nada.

Desventajas

  • Nunca hay descuento por volumen. A 50.000 minutos pagas la misma tarifa que a 75.
  • Los minutos se prepagan en lugar de pagarse según el uso, así que un volumen irregular significa pagar por un margen que desperdicias.
  • El BAA para HIPAA está detrás de Enterprise, y también el SSO y las condiciones del SLA.
  • Los operadores informan de que la herramienta transfer_to_number no completa la transferencia, discutido extensamente en este hilo de r/ElevenLabs.

Nuestra valoración: empieza aquí si tu volumen es predecible y quieres una cifra que tu equipo financiero acepte. Pero la tarifa plana corta en ambos sentidos. ¿Vas a superar los 20.000 minutos al mes? Consigue un presupuesto Enterprise antes de comprometerte, porque aquí no hay curva de descuento en la que crecer. Desgloso los planes con más detalle en mi guía de precios de ElevenLabs, y cubro las opciones de cambio en alternativas a ElevenLabs.

2. Retell AI

Mejor para: operaciones de soporte que quieren analítica de llamadas y escalado limpio, sin contratar a un desarrollador.

Retell AI es la que pondría delante de un responsable de soporte en lugar de un desarrollador. Su transparencia de costes llega a un grado casi incómodo. También es el único proveedor aquí cuyas propias preguntas frecuentes responden "¿puede la IA sustituir a los agentes de call center?" con un rotundo "No". Eso me merece más respeto que cualquier afirmación de contención en esta página.

Paneles de Retell AI mostrando un lienzo de flujo de conversación, un editor de prompts del agente configurado en OpenAI 4o-mini, y un panel de audio de prueba ejecutando un intercambio de reserva con guion, tomado de Retell AI
Paneles de Retell AI mostrando un lienzo de flujo de conversación, un editor de prompts del agente configurado en OpenAI 4o-mini, y un panel de audio de prueba ejecutando un intercambio de reserva con guion, tomado de Retell AI

Fíjate en el tercer panel. El mensaje de bienvenida está configurado como "User Initiates: AI remains silent until users speak first". Un ajuste pequeño, un efecto grande en cómo se sienten los primeros tres segundos de una llamada de soporte.

Lo que realmente hace

La capa de escalado es la parte fuerte. Transferencia en caliente, navegación IVR y captura DTMF están todas bajo un único nodo de transferencia de llamada, mientras que la monitorización en vivo permite a un supervisor escuchar o tomar el control de la llamada por completo. Mejor aún: la cuota de la IA se detiene en el momento de la transferencia, así que después solo sigue corriendo la telefonía. El incentivo correcto, y casi nadie más lo hace así.

El análisis posterior a la llamada, las transcripciones, los webhooks y la API están todos disponibles en el plan gratuito de pago según uso, así que puedes probarlo de verdad. Un cliente de referencia, Medical Data Systems, publica una tasa de transferencia del 30%. Así que alrededor del 70% de contención en un despliegue real.

La base de conocimiento es un rastreo del sitio web más subida de archivos. No hay ingesta documentada de tu historial de tickets pasado, y la simulación ejecuta casos de prueba que has escrito tú mismo en lugar de una reproducción de tu propio archivo de llamadas.

Precios

ComponenteTarifaNotas
Infraestructura de voz de Retell$0.055/minIneludible. La conversión de voz a texto está absorbida aquí.
Texto a voz$0.015/min$0,040/min si eliges voces de ElevenLabs
LLM$0.003 a $0.32/minGPT 5 nano en el suelo, GPT 5.5 Fast en el techo
Telefonía$0.015/min gestionada$0 en tu propio troncal SIP
Base de conocimiento+$0.005/minMás $8/mes por base tras las primeras 10
Guardarraíles+$0.005/minLa eliminación de PII es un +$0,01/min aparte
Control de calidad de llamadas con IA$0.10/minLos primeros 100 minutos gratis
Concurrencia$8/llamada/mesLas primeras 20 líneas incluidas

El rango anunciado es de $0,07 a $0,31 por minuto, con $10 de crédito gratis y sin cuota de plataforma. La propia calculadora de Retell fija por defecto $0,115/min, pero pone a cero la telefonía y todos los complementos. Construye algo realista para soporte entrante, GPT 4.1 con la propia voz de Retell, un número gestionado en EE. UU., la base de conocimiento activada, y llegas a $0,135/min. Eso son $677 al mes con 5.000 minutos. Activa el control de calidad de llamadas con IA en todo tu tráfico y se suman unos $490 al mes más, un salto del 74%.

Ventajas

  • La mejor propuesta de transferencia a humano de este repaso, y el contador se detiene en el momento en que se activa.
  • Los supervisores pueden escuchar una llamada en vivo, o tomar el control.
  • Transparencia de costes hasta la tarifa de cada componente.
  • SOC 2 Type II, HIPAA y RGPD vienen en toda la plataforma en lugar de restringirse por plan.

Desventajas

  • Zendesk está marcado como "próximamente" en lugar de disponible. Los conectores activos llegan hasta Cal.com, HubSpot y Salesforce, y en ningún sitio de la documentación hay una integración con Freshdesk, Gorgias, Front o Help Scout.
  • La afirmación de latencia de ~600ms se atribuye a "benchmarks independientes", que nunca se nombran ni se enlazan.
  • Ninguna de las dos páginas publica un número de idiomas ni un porcentaje de SLA de disponibilidad.
  • La opción de voz a voz cuesta $0,345/min, lo que está por encima del propio techo declarado de Retell de $0,31.

Nuestra valoración: la opción más sólida en general para un equipo de soporte, con una gran salvedad. Si usas Zendesk o Freshdesk, deberías prever construir tú mismo el traspaso de tickets vía webhooks. Mira a quién pone Retell en su propia vitrina de integraciones: plataformas CCaaS, Genesys y Five9 y Avaya. Eso indica para quién se construyó. Mi desglose de precios de Retell AI va componente por componente si quieres modelar tu propia configuración.

3. Vapi

Mejor para: equipos de ingeniería que quieren elegir cada componente de la pila por sí mismos.

Vapi es infraestructura, no un producto. Ensamblas tú mismo el transporte y la conversión de voz a texto, el modelo, la voz, todo, y Vapi cobra $0,05 por minuto por orquestar el resultado. Si te atrae cambiar Deepgram por Assembly a las 3 de la madrugada, esta es la opción.

El constructor de asistentes de Vapi con chips de proveedores para Deepgram, GPT 4o-mini y Azure, mostrando medidores de coste por minuto y una latencia de unos 450 ms, tomado de Vapi
El constructor de asistentes de Vapi con chips de proveedores para Deepgram, GPT 4o-mini y Azure, mostrando medidores de coste por minuto y una latencia de unos 450 ms, tomado de Vapi

Esa fila de chips de proveedores es todo el producto en una captura. Cada chip es también una línea aparte en tu factura.

Lo que realmente hace

Squads y workflows, llamadas a herramientas, observabilidad, un conjunto de evaluación de verdad. Traer tu propio SIP sobre el troncal propio de Vapi no cuesta nada, lo cual es una palanca de coste real. Diez llamadas concurrentes vienen incluidas, y las líneas extra cuestan $10 al mes cada una.

Una fecha límite dura que debes conocer: el constructor visual de Workflows deja de funcionar el 19 de agosto de 2026, dentro de dos semanas. La razón que da Vapi es que la IA actual no puede actuar de forma fiable como agentes autónomos de grafo de nodos, y que Squads "consistently led to better results". Así que cualquier construcción de soporte de Vapi de antes de mediados de 2026 necesita migrarse ahora. Vapi también advierte de que su migración asistida por IA no está garantizada como correcta o completa.

Precios

ComponenteTarifaNotas
Orquestación de Vapi$0.05/minMás $0,005 por mensaje de SMS-chat
TransporteGratis a $0.014/minVapi SIP y WebRTC gratis; Twilio saliente $0,014
Voz a texto$0.000631 a $0.01733/minGoogle en el suelo, Speechmatics en el techo
Texto a voz$0.002 a $0.24/minInworld en el suelo, Tavus en el techo
LLM$0.01 a $2.12 por 1M4.1-mini en el suelo, 4.5 Preview en el techo
HIPAA$2.000/mesLa retención cero de datos es un $1.000/mes aparte

Ensambla algo realista, Vapi más Twilio entrante más Deepgram más ElevenLabs más un modelo barato, y sale en torno a $0,105/min. Eso son $0,63 por una llamada de seis minutos. Digno de notar también: la propia cuota de Vapi supone el 48% de un minuto realista y el 91% del más barato posible. Las condiciones Enterprise empiezan en 400.000 minutos al año.

Ventajas

  • Control total sobre cada componente, y una tarifa publicada para cada uno.
  • El transporte es gratis en Vapi SIP o WebRTC.
  • El suelo más barato de este repaso, alrededor de $0,055/min, si optimizas al máximo por ello.
  • Herramientas de observabilidad y evaluación que son realmente buenas.

Desventajas

  • Las pruebas se facturan a tarifas de producción. Directamente de las propias preguntas frecuentes de Vapi: "Is testing free? No, test calls cost you the same as regular calls."
  • La base de conocimiento es solo subida de archivos, la recuperación es solo con Gemini, no hay rastreo del centro de ayuda, y el límite recomendado está por debajo de 300KB por archivo.
  • Cero integraciones de ticketing en el catálogo de herramientas. Leer o escribir un ticket es un apiRequest que construyes tú.
  • Según la propia página de metodología de Vapi, el titular de "menos de 500ms de latencia" excluye el endpointing y el transporte, y esa misma página admite que el endpointing puede suponer una parte significativa del retraso.

Nuestra valoración: la opción correcta si tienes ingenieros y quieres el suelo de coste. La incorrecta si quieres algo que responda llamadas la semana que viene. En cualquier caso, haz la migración de Workflows antes de la fecha límite de agosto. Hay más sobre la forma de la plataforma en mi análisis de Vapi.

4. PolyAI

Mejor para: un contact center establecido que ya opera con Genesys, Avaya o Amazon Connect.

PolyAI vende a contact centers, no a desarrolladores, y la lista de integraciones lo delata. Genesys, Avaya, Amazon Connect, Twilio, Five9, NICE, Talkdesk, Cisco, RingCentral, Zendesk Talk: todo compatible. Así que se integra en un parque que ya tienes en lugar de pedirte que lo sustituyas.

PolyAI Agent Studio con un prompt de chat de prueba y plantillas iniciales para añadir un tema de base de conocimiento y gestionar transferencias de llamadas a un agente humano, tomado de PolyAI
PolyAI Agent Studio con un prompt de chat de prueba y plantillas iniciales para añadir un tema de base de conocimiento y gestionar transferencias de llamadas a un agente humano, tomado de PolyAI

La lista de plantillas dice mucho sobre para quién es esto. "Handle call transfers to a human agent" aparece como plantilla inicial en lugar de tema avanzado. El instinto correcto.

Lo que realmente hace

Agent Studio es la superficie de construcción, con un punto de entrada de autoservicio en studio.poly.ai. Los plazos de despliegue publicados en todo el sitio van de menos de diez minutos para autoservicio hasta unas ocho semanas para un despliegue de Amazon Connect, así que toma la cifra rápida con cautela. El soporte de idiomas es de 42 o 45, según qué página de PolyAI leas.

La postura de seguridad es la mejor documentada aquí, y de forma inusual no está restringida por plan. SOC 2 Type 2, ISO 27001, PCI DSS, RGPD y HIPAA se describen todos como estándar y "integrados en la arquitectura", con certificación AWS FTR también en la página de socios de Amazon Connect. Cada despliegue de pago también incluye un SLA de disponibilidad del 99,9% en las líneas telefónicas más una línea de soporte de emergencia 24/7/365. No es una nota al margen, eso, cuando lo que responde tu teléfono se rompe a las 2 de la madrugada.

Precios

No publicados. La página de precios se titula "Simple pricing that scales" y promete una estructura transparente, y luego muestra un formulario de captación de contactos escalonado por volumen anual de llamadas, de menos de 10.000 a más de 1.000.000 de llamadas. Ninguna cifra en dólares aparece en ninguna propiedad de PolyAI. Tampoco hay compromiso mínimo.

Al menos la unidad de facturación está clara, en las propias palabras de PolyAI: el uso continuado "is priced on a per-minute basis, which includes proactive performance improvements, maintenance and 24/7 support."

Ventajas

  • La lista de integraciones CCaaS más profunda aquí, así que encaja en un parque que ya operas.
  • Certificaciones de seguridad en todos los niveles en lugar de detrás de un plan Enterprise.
  • La tarifa por minuto incluye un SLA de disponibilidad del 99,9% en la línea telefónica y una línea de emergencia 24/7.
  • Resultados de clientes publicados en un amplio abanico de despliegues.

Desventajas

  • Sin precio publicado. La página de precios se llama a sí misma transparente y luego muestra un formulario.
  • Las cifras de contención varían enormemente según el caso de uso: 70% de las llamadas de huéspedes en una cadena de pubs del Reino Unido, luego 34% en reservas de Golden Nugget y 30% en un banco minorista sin nombre. Las cifras de restaurantes no son una guía justa para una cola de soporte.
  • El sitio se contradice dos veces, en el número de idiomas y en el plazo de despliegue.
  • Cada estadística destacada del sitio es un contador animado en el cliente, lo que hace difícil verificar las cifras de forma independiente.

Nuestra valoración: si ya tienes una plataforma CCaaS, PolyAI es probablemente tu camino más corto hacia un agente de voz que funcione, y el SLA incluido se justifica. Una cosa en la que deberías insistir: cifras de contención de un despliegue de soporte, no de uno de reservas. La diferencia publicada entre los dos es más del doble. Para más contexto sobre la categoría, está mi introducción a la IA conversacional para atención al cliente.

5. Parloa

Mejor para: cualquiera que quiera que el agente se pruebe contra su propio historial de llamadas antes de que atienda una llamada real.

Parloa es la entrada empresarial europea. Levantó 350 millones de dólares con una valoración de 3.000 millones en enero de 2026 y ha superado los 50 millones de dólares de ingresos anuales con una retención neta del 150%, con un total captado que ya supera los 560 millones de dólares en menos de cuatro años. Entre sus clientes están Allianz, Booking.com, IKEA y SAP.

Parloa no publica capturas de producto en ningún sitio, así que lo que sigue es su propia diapositiva de arquitectura en lugar de una captura de la interfaz. Normalmente considero eso un punto en contra de un proveedor. En este caso la diapositiva dice lo importante en voz alta.

La diapositiva de Parloa sobre la AI Agent Management Platform mostrando un ciclo de vida de cuatro etapas: diseñar e integrar, probar e iterar, desplegar y escalar, monitorizar y mejorar, tomado de Parloa
La diapositiva de Parloa sobre la AI Agent Management Platform mostrando un ciclo de vida de cuatro etapas: diseñar e integrar, probar e iterar, desplegar y escalar, monitorizar y mejorar, tomado de Parloa

La etapa dos de ese círculo es "probar e iterar", con el mismo peso que desplegar y monitorizar. Todos los demás proveedores de aquí tratan las pruebas como una función. Parloa construyó una empresa alrededor de eso.

Lo que realmente hace

El entorno de simulación es la razón por la que Parloa está en esta lista. También es la única función de todo este repaso que llamaría un diferenciador real. Ejecuta miles de conversaciones simuladas a través de escenarios, idiomas, canales y casos extremos, y la parte crítica es que mezcla tus transcripciones históricas reales con pruebas sintéticas en lugar de ejecutar solo escenarios escritos a mano por alguien. Prueba la ambigüedad y las llamadas a herramientas, el fallback, la consistencia de marca. Aísla subtareas, y alterna entre staging y producción.

Las evaluaciones se ejecutan con LLM-como-juez y criterios basados en reglas, ambos, sobre éxito de tarea y tono, precisión, comportamiento de la API. Después trazado de causa raíz, con recomendaciones de arreglo a nivel de línea aplicadas dentro de la propia plataforma. Este es el mecanismo que desearía que todos los proveedores de aquí tuvieran. También es el mismo principio que aplicamos al texto: un bot que solo se ha probado con preguntas que has inventado tú mismo no te enseña nada útil.

Las integraciones cubren Avaya, Five9, Genesys, NICE, Twilio, Verint, Salesforce, Dynamics, ServiceNow, Zendesk y SAP, más SIP. Más de 130 idiomas en más de 70 países, aunque no se publica ninguna lista en ningún sitio. La afirmación sobre residencia de datos viene con una redacción más estricta de lo habitual: que el enrutamiento en tiempo de ejecución mantiene el procesamiento dentro de la jurisdicción durante la interacción y no solo en reposo, pero el detalle está detrás de un centro de confianza con acceso restringido.

Precios

No publicados, y la URL de precios devuelve un error 404. La única señal real es la propia lista de preguntas frecuentes de Parloa, que describe un "consumption-based pricing model that ties costs to task complexity and effort, not flat rates or token counts", cotizado según volumen, casos de uso y valor de negocio. No se publica ningún mínimo, ningún plan gratuito, ninguna prueba.

Ventajas

  • La única herramienta aquí que reproduce tu historial real de llamadas en la simulación.
  • Trazado de causa raíz, con los arreglos aplicados dentro de la propia plataforma.
  • Una postura europea real, construida sobre Azure, con enrutamiento en tiempo de ejecución dentro de la jurisdicción.
  • Las certificaciones son ISO 27001:2022, SOC 2 Type 1 y Type 2, y PCI DSS.

Desventajas

  • Ningún precio publicado de ningún tipo. El consumo "según complejidad de la tarea" es además la unidad más difícil de prever aquí.
  • HIPAA, RGPD y DORA se describen como "aligns with" en lugar de certificado. Esa es la redacción propia de Parloa, y merece la pena leerla con precisión.
  • Los porcentajes de clientes en la página de inicio son contadores animados con JS, así que las cifras reales están en las páginas de casos de estudio.
  • Amazon Connect no aparece en ninguna lista de integraciones de Parloa publicada, así que no lo asumas.

Nuestra valoración: si eres un comprador empresarial con solo una pregunta que hacerle a un proveedor, pregunta si su simulación reproduce tus propias llamadas. Parloa es el que aquí responde que sí. Esa única capacidad vale más que un punto porcentual de contención en el benchmark de otro. Mi análisis de Parloa tiene más sobre la plataforma, y precios de Parloa cubre lo que se sabe del lado comercial.

6. Sierra

Mejor para: soporte de alto valor donde pagar por resolución vence a pagar por minuto.

Sierra levantó 950 millones de dólares con una valoración superior a 15.000 millones en mayo de 2026, y dice servir a más del 40% de las Fortune 50. El producto de voz maneja más de 55 idiomas con cambio a mitad de conversación, enrutamiento de modelo por turno y escalado que conserva el contexto. También acepta pagos por voz, tarjeta y ACH mediante tonos DTMF, a través de infraestructura conforme con PCI Nivel 1.

Una vista de llamada de voz de Sierra cronometrada en 9 segundos para la marca de demostración Sierra Spins, con la persona que llama pidiendo un reembolso por una bicicleta que no ha llegado, tomado de Sierra
Una vista de llamada de voz de Sierra cronometrada en 9 segundos para la marca de demostración Sierra Spins, con la persona que llama pidiendo un reembolso por una bicicleta que no ha llegado, tomado de Sierra

Eso es una llamada de demostración en lugar de una captura de consola, y es lo más que puedo mostrarte. Cada elemento visual en la página de voz de Sierra es un póster de vídeo, sin ninguna captura completa del producto publicada en ningún sitio.

Sierra merece una mención por algo distinto a su producto, también. Publica la investigación de τ-voice que replanteó todo este artículo. Sus propios hallazgos: la frontera se movió del 30,4% al 67,3% de pass@1 entre agosto de 2025 y abril de 2026, frente a un techo de razonamiento de texto cercano al 85%. Todos los proveedores pierden entre 5 y 14 puntos con audio telefónico realista. Y el 79% de los primeros errores críticos son responsabilidad del propio agente. Un proveedor que publica las cifras que hacen que su propia categoría parezca difícil es una buena señal.

Lo que realmente hace

Comercialmente, lo distintivo es el precio por resultado. El planteamiento propio de Sierra es "Pay for a job well done", con la unidad ligada a "a resolved support conversation, a saved cancellation, an upsell, a cross-sell", y "if the conversation is unresolved, in most cases, there's no charge." La versión más corta que dan: "Sierra gets paid only when we complete a task for you."

Lee las matizaciones con atención, sin embargo, porque son lo que importa a la hora de firmar el contrato. Las escaladas no se facturan "en la mayoría de los casos", y las excepciones no se publican. La factura real es mixta, porque Sierra dice: "routing or greeter-style interactions may align better with consumption-based pricing, where payment is based on conversation count, regardless of the outcome." Después está "resuelto", que no tiene una definición universal aquí. Los criterios se acuerdan por contrato.

Precios

No hay página de precios en absoluto. sierra.ai/pricing devuelve un 404 rotundo, y no aparece ninguna cifra en dólares en ningún sitio: ni tarifa por resultado, ni cuota de configuración, ni mínimo, ni prueba. Nunca se menciona una cuota de plataforma. Tampoco se niega nunca, así que no asumas que no existe.

Ventajas

  • El modelo de facturación se alinea con lo que realmente quieres, que son resoluciones en lugar de tiempo al aire.
  • La lista de certificaciones más amplia aquí: SOC 2, ISO 27001, ISO 42001, HIPAA, RGPD, EU AI Act y FedRAMP.
  • Más de 55 idiomas, y cambia a mitad de conversación.
  • Publica investigación honesta sobre los límites de su propia categoría.

Desventajas

  • Cero precios publicados, así que comparar con cualquier otra cosa significa entrar antes en un ciclo de ventas.
  • Los distintivos de certificación no llevan fecha de auditoría, ni distinción SOC 2 Type I/II, ni nivel de autorización FedRAMP.
  • Los clientes de voz nombrados se detienen en Rocket Mortgage, Guild y Next, y no se publica ninguna cifra de contención, resolución o tiempo de gestión para ninguno de ellos.
  • Ninguna cifra de latencia de voz publicada. Esa cifra de 200ms en el artículo de τ-voice es la granularidad del fragmento de audio del benchmark, no el tiempo de respuesta del agente, así que no la cites como tal.

Nuestra valoración: el precio por resultado se vuelve más atractivo cuanto peor es tu tasa de contención, y eso es un alineamiento inteligente. Solo entra en la negociación sabiendo que eres tú quien define la unidad facturable. Fija por escrito qué escaladas cuentan como las excepciones a "en la mayoría de los casos". Profundizo en el modelo en precios de Sierra AI, y el panorama competitivo en alternativas a Sierra.

7. Bland AI

Mejor para: alta concurrencia, o un despliegue que tenga que residir en tu propia nube.

Bland AI publica aquí la escala de planes más clara, más el techo de concurrencia más alto por un margen amplio. Su índice de documentación cita soporte Enterprise para "up to 1 million concurrent calls". Nadie más en esta lista se acerca a esa cifra.

El editor de Pathways de Bland mostrando un flujo de soporte técnico con nodos de escalado y devolución de llamada, y un panel de Scenarios reportando una puerta de Happy Path al 100% y una prueba de Angry Caller al 94%, tomado de Bland AI
El editor de Pathways de Bland mostrando un flujo de soporte técnico con nodos de escalado y devolución de llamada, y un panel de Scenarios reportando una puerta de Happy Path al 100% y una prueba de Angry Caller al 94%, tomado de Bland AI

Esta es la imagen más clara de lo que significa "probar" en toda la categoría. El panel de la derecha ejecuta una prueba de "Angry Caller" al 94% y una puerta de "Happy Path" al 100%. Ambas son personas ficticias escritas por alguien. Útil. Sigue sin ser tu historial de llamadas.

Lo que realmente hace

Rutas conversacionales, llamadas a herramientas y APIs, y luego tres posturas de alojamiento publicadas: Bland Cloud, tu propia VPC en AWS, GCP o Azure, o completamente on-premise y con aislamiento total (air-gapped). Ninguna cifra en dólares se asocia a ninguna de esas opciones. Tampoco se publica ningún recargo o mínimo, ya que todo eso está dentro del contrato Enterprise.

Nuevo desde la última vez que miré: una cifra de latencia real. La página de inicio ahora anuncia 400ms frente a una "media de la industria" declarada de 1.240ms, la documentación habla de menos de 400ms, y la página de producto muestra cifras p50 de 380ms y 365ms. Esa comparación de 1.240ms no tiene fuente. Trátala como marketing, no como medición.

Una trampa en la redacción. La página de producto anuncia la capacidad de "back-test against historical calls", mientras que el mecanismo documentado de Scenarios es una persona que llama simulada siguiendo un prompt de persona que has escrito tú. Una garantía distinta de reproducir tu propio archivo, y merece la pena preguntarlo directamente.

Precios

StartBuildScaleEnterprise
Tiempo de conversación$0.14/min$0.12/min$0.11/minPersonalizado
Cuota de plataforma$0$299/mes$499/mesContratado
Tiempo de transferencia$0.05/min$0.04/min$0.03/minPersonalizado
Llamadas concurrentes1050100Ajustado al volumen
Límite diario / por hora100 / 1002.000 / 1.0005.000 / 1.000Ilimitado
Bases de conocimiento / voces10 / 150 / 5100 / 15Ilimitado
SLA de disponibilidad99,9%99,9%99,9%99,9%

Los puntos de cruce son lo bastante contraintuitivos como para merecer conocerlos. Build solo vence a Start por encima de 14.950 minutos al mes, y Scale solo vence a Build por encima de 20.000. Por debajo de unos 15.000 minutos, el plan gratuito Start es aritméticamente el más barato. Aquí actualizas por concurrencia, no por la tarifa.

Ventajas

  • Un SLA de disponibilidad del 99,9% en todos los planes, incluido el gratuito, algo que nadie más aquí hace.
  • El autoalojamiento en tu propia VPC, o con aislamiento total on-premise, es una opción publicada.
  • El techo de concurrencia es el más alto de este repaso.
  • Trae tu propio troncal y el cargo por minuto de transferencia desaparece por completo.

Desventajas

  • El directorio de integraciones tiene 19 conectores en 7 categorías y cero sistemas de helpdesk o ticketing, a pesar de que los textos del producto afirman soporte de ticketing. Llevar una llamada a Zendesk o Front significa una herramienta a medida, o un webhook posterior a la llamada que construyes tú.
  • La transferencia en caliente es solo Enterprise, y la documentación fija esa restricción de forma explícita. Los despliegues de autoservicio son solo de transferencia en frío, sin citas de respuesta.
  • Las citas y los informes de vacíos de la base de conocimiento, los resultados, los guardarraíles, las alertas, el SMS, el chat web, el BAA: todo también solo Enterprise.
  • La página de precios dice que la telefonía se cobra aparte al coste de tránsito. Las preguntas frecuentes de la página de inicio y la documentación dicen que la tarifa por minuto lo cubre. Consigue eso por escrito.

Nuestra valoración: Bland es una plataforma de voz más que un producto de soporte, y sus pruebas destacadas son de generación de ingresos más que de ahorro de costes. Elígela por concurrencia, o por un requisito de alojamiento en el que tu equipo de seguridad no va a ceder. ¿La compras para responder llamadas de soporte? Presupuesta el plan Enterprise desde el principio, porque las funciones que necesitas viven todas ahí arriba. Y si gestionar tickets es el objetivo real, una de las herramientas de automatización de soporte de mi repaso más amplio encaja mejor.

8. Synthflow

Mejor para: una tienda de Freshworks que quiere su IA de voz dentro de Freshcaller.

Registros de llamadas de Synthflow con un cajón de detalles de llamada abierto en la pestaña Actions, mostrando una búsqueda en la base de conocimiento que devuelve 7 resultados en 756ms con una mejor puntuación de similitud de 0,80, tomado de Synthflow
Registros de llamadas de Synthflow con un cajón de detalles de llamada abierto en la pestaña Actions, mostrando una búsqueda en la base de conocimiento que devuelve 7 resultados en 756ms con una mejor puntuación de similitud de 0,80, tomado de Synthflow

Antes del análisis, mira ese cajón abierto, porque es la captura más útil de todo este artículo. Muestra una búsqueda real en la base de conocimiento a mitad de la llamada. La persona que llamaba dijo "I have but I I would like to know how to use the product", el agente lo reescribió como una búsqueda, y volvieron 7 resultados en 756ms con una mejor puntuación de similitud de 0,80, frente a un similarity_threshold de 0. Ese umbral es el dial que decide si tu agente responde desde una coincidencia débil o admite que no lo sabe. Casi ningún proveedor te muestra esto.

Todo el mundo sigue describiendo Synthflow como la entrada fácil sin código. Desde este mes eso está desactualizado. La escalera de autoservicio ha desaparecido, y la documentación lo confirma: los antiguos planes Pro, Growth y Agency "are no longer available for new subscriptions and remain supported for existing customers." Lo que queda es un producto Enterprise de un solo nivel, guiado por ventas.

Lo que realmente hace

La transferencia a humano es la función de soporte más fuerte aquí, en tres modos: fría, cálida con un mensaje, cálida con un resumen. Hay detección de humanos con un tiempo de espera de 30 segundos a 30 minutos, filtrado de llamadas, un horario de atención. La documentación también es directa de una forma que aprecio: "cold transfers cannot recover from failures."

Las fuentes de conocimiento son PDFs, documentos escritos, URLs individuales, rastreos públicos del sitio web y una importación del centro de ayuda de Zendesk. Sin fuentes autenticadas, sin ingesta de tickets pasados, y sin clasificación manual de documentos. En integraciones, la afirmación "200+" se resuelve en unos 15 conectores documentados, y la única integración profunda con la pila de soporte entre ellos es Freshworks: la IA de voz corriendo dentro de Freshcaller, con un 65% de las solicitudes de voz rutinarias automatizadas. Esa es la razón para comprarlo.

El detalle de la medición se publica mucho con más precisión que las tarifas, una combinación inusual pero útil. La facturación es por segundo y se agrega entre llamadas, así que 125 segundos de llamadas se convierten en 2 minutos facturables en lugar de 4. Una transferencia exitosa detiene el contador. Un no-answer o un colgado de buzón de voz se facturan a un tanto alzado de 5 segundos. El chat se convierte a razón de 5 mensajes de IA por minuto de voz. Y las simulaciones del Test Center pueden ser facturables.

Precios

PlanMensualMinutos incluidosExcesoLlamadas concurrentes
Enterprise (el único plan vendido)Sin precio de lista; los contratos empiezan en $30.000/año, unos $2.500/mesNo publicado, según contratoPersonalizado, según tu acuerdo"Fijado con Synthflow"
Pro / Growth / Agency (legado)Cerrado a nuevos clientesSolo dentro de tu cuentaSolo dentro de tu cuentaMostrado en las condiciones de tu cuenta
Prueba gratuitaSin registro de autoservicio. Ambos CTA llevan a contactar con ventasn/an/an/a

El coste efectivo por minuto incluido es incalculable en todos los planes, porque Synthflow nunca publica un precio y una asignación de minutos en la misma fila. La única cifra pública defendible es ese mínimo equivalente a $2.500 al mes, frente a una asignación que nadie fuera del contrato conoce. Cualquier cifra por minuto que aún circule se remonta a la escalera retirada.

Ventajas

  • Tres modos de transferencia distintos. Cálida con un resumen es el que realmente ayuda al humano.
  • La facturación por segundo, agregada entre llamadas, es la medición más justa aquí.
  • Una transferencia exitosa detiene el contador.
  • Una integración profunda con Freshworks, con una cifra publicada de automatización del 65% para solicitudes de voz rutinarias.

Desventajas

  • Ese mínimo de $30.000/año la convierte en la opción más cara aquí a cualquier volumen por debajo de unos 20.000 minutos al mes.
  • Ya no hay ninguna cifra de concurrencia publicada en ningún plan.
  • Una contradicción sobre HIPAA en su propio sitio web. La página de inicio afirma certificación en SOC 2, HIPAA, PCI DSS y RGPD, mientras que la fila de cumplimiento de la documentación Enterprise solo lista SOC 2, RGPD e ISO 27001. No asumas un BAA.
  • La latencia es un objetivo y no una medición, formulada como "we aim for" menos de 100ms de ida y vuelta. La reventa desaparece el 15 de septiembre de 2026, y los servidores de telefonía en la UE están "muy pronto".

Nuestra valoración: la reputación de sin código ya no coincide con la lista de precios, así que ignora cualquier repaso que todavía la llame la opción barata de entrada, incluidos los nuestros más antiguos. Si usas Freshworks, es un encaje fuerte y nativo. En caso contrario, la integración con Freshcaller es el principal motivo por el que pagarías ese mínimo, y una herramienta general de automatización de atención al cliente cuesta muchísimo menos.

9. Grok Voice Agent Builder

Mejor para: el modelo capaz más rápido, si los límites de sesión no te frenan.

El Grok Voice Agent Builder de xAI corre sobre Grok Voice Think Fast 2.0, que encabeza la tabla τ-Voice con un 56,5% y responde en 0,70 segundos. Esa combinación es todo el argumento de venta. En el benchmark se sostiene.

No hay captura de producto en esta sección porque xAI no publica ninguna, y las URLs de documentación del Voice Agent Builder devuelven actualmente un 404. Lo que xAI sí publica es un cambio de precios que entra en vigor hoy. Si ya usas Grok Voice en producción, eso es lo más consecuente de esta página.

Diagrama de antes y después mostrando cómo el alias grok-voice-latest se redirige de la versión 1.0 a cinco céntimos por minuto hacia la versión 2.0 a ocho céntimos por minuto el 5 de agosto de 2026, una subida del 60 por ciento sin necesidad de despliegue
Diagrama de antes y después mostrando cómo el alias grok-voice-latest se redirige de la versión 1.0 a cinco céntimos por minuto hacia la versión 2.0 a ocho céntimos por minuto el 5 de agosto de 2026, una subida del 60 por ciento sin necesidad de despliegue

Lo que realmente hace

Es compatible a nivel de protocolo con la API Realtime de OpenAI en wss://api.x.ai/v1/realtime, así que migrar una construcción realtime existente es sobre todo un cambio de URL. Las herramientas cubren funciones, búsqueda de archivos, búsqueda web, búsqueda en X y MCP. Las extensiones con forma de cumplimiento normativo son la parte útil: force_message dice una línea textual para avisos legales, replace mapea pronunciaciones sin cambiar la transcripción, keyterms acepta hasta 100 términos de 50 caracteres cada uno, resumption reproduce turnos al reconectar. Un número de teléfono asignado añade $0,01 por minuto.

Digno de destacar en el lado de la precisión: la transcripción es 1,4 veces mejor en tasa de error de palabras que la versión 1.0, de 1,5 a 2,0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas, y unas 10 veces mejor en audio telefónico con ruido. El ruido de fondo y los acentos son exactamente lo que los operadores informan que rompe sus agentes, así que esa cifra es más relevante para ti que el benchmark destacado.

Precios

ElementoTarifa
Grok Voice Think Fast 2.0$0.08/min ($4.80/h)
Grok Voice Think Fast 1.0$0.05/min ($3.00/h)
Entrada de texto$0.004 por elemento de conversación
Número de teléfono asignado+$0.01/min
web_search / x_search$5 por 1.000 invocaciones
file_search (colecciones)$2.50 por 1.000
attachment_search$10 por 1.000

Hoy es el día en que esto se volvió más caro. El 5 de agosto de 2026 el alias grok-voice-latest se redirige de 1.0 a 2.0, así que la ruta por defecto cuesta un 60% más por minuto, sin ningún despliegue de tu parte. Fijar la versión antigua es tu forma de excluirte. Ese cambio también borró la ventaja del 37,5% de Grok sobre ElevenLabs, porque $0,08 es exactamente la tarifa efectiva de ElevenLabs por minuto incluido. Lo que queda es la forma de facturación en lugar del precio. Grok es de pago según uso, los minutos de ElevenLabs se prepagan, así que Grok sigue ganando en volumen irregular o bajo.

Ventajas

  • La cima de la tabla τ-Voice en la finalización de tareas de soporte, con un 56,5%.
  • La tercera latencia más rápida al primer audio, con 0,70 segundos, lo que es la mejor combinación de velocidad y capacidad.
  • La medición es plana por minuto, así que el coste medido por hora de audio de entrada equivale exactamente a la tarifa de lista.
  • Transcripción sólida en audio telefónico, unas 10 veces mejor en condiciones ruidosas.

Desventajas

  • 10 sesiones concurrentes por equipo por defecto. Para una línea de soporte eso es un techo duro, y subirlo requiere una solicitud.
  • Sin descuento por lotes ni nivel prioritario en voz, así que no hay ni descuento ni carril rápido de pago. Solo us-east-1, y una duración máxima de sesión de 120 minutos.
  • Sin integraciones de helpdesk. Tampoco certificaciones de seguridad publicadas para el producto de voz.
  • El almacenamiento se factura aparte cuando el agente hace recuperación, $0,10/GiB/día para colecciones.

Nuestra valoración: el modelo más capaz aquí, envuelto en el producto menos orientado al soporte. Diez sesiones concurrentes es la cifra que lo decide. Si tu pico está por encima de eso y nadie ha subido el límite, esto es un prototipo más que una línea de soporte en producción, sin importar lo bien que se vea el benchmark. Cubrí el modelo en profundidad en Grok Voice Think Fast 2, y las nuevas tarifas en su desglose de precios.

A dónde va realmente la otra mitad de tus llamadas

Todas las herramientas de arriba transferirán. No es un defecto, es aritmética. El mejor modelo resuelve el 56,5% de los escenarios de soporte en un benchmark, y los operadores informan de un 15% a un 30% en producción, mientras que la resolución neta media de primer nivel en los helpdesks se sitúa generalmente en torno al 74,3%, con solo un 1,4% de los helpdesks por encima del 95%. Algo siempre llega a una persona. Por eso la resolución en el primer contacto es un objetivo mejor que la contención.

Diagrama de flujo mostrando una llamada entrante llegando a un agente de voz, dividiéndose entre resuelta en la llamada y transferida o enviada por correo, con el segundo camino convirtiéndose en un ticket de helpdesk
Diagrama de flujo mostrando una llamada entrante llegando a un agente de voz, dividiéndose entre resuelta en la llamada y transferida o enviada por correo, con el segundo camino convirtiéndose en un ticket de helpdesk

El patrón de fallo del que más oigo hablar no tiene nada que ver con la conversación con el bot. Ocurre en la costura:

Reddit

"AHT question nobody wants to answer lol. shipped a billing/tracking bot, decent containment, but AHT on escalated calls went up. agents had to read the transcript, figure out what the bot already tried, re-ask half of it anyway. fixed by forcing a structured handoff summary instead of raw transcript dump (saved more time than the automation itself). CSAT fine on deflected stuff, tanked on anything that bounced back after a failed bot attempt"

Lee dos veces esa última cláusula. La contención se veía bien, el tiempo de gestión en las llamadas escaladas subió, y la satisfacción se desplomó específicamente en los rebotes. Así que un despliegue de voz puede ganar en el panel de control y perder con los clientes que más te necesitaban. Ese es el argumento para hacer seguimiento del CSAT segmentado según si la IA tocó primero el contacto.

Aquí va la versión sin rodeos del mismo punto, de un operador de contact center al que preguntaron cuánto de su centro está realmente automatizado:

Reddit

"15% roughly....people quoting any higher are lying or dont understand "fully handled". AI solutions are not mature or too fragmented at the moment to go any higher."

Otras respuestas en ese hilo sitúan la banda entre el 10% y el 30%, según el diseño del recorrido. Así que el 15% es el extremo pesimista de una banda real en lugar de un cínico solitario. En cualquier caso, no está ni cerca del 95%.

Después hay un coste que el panel de contención no puede ver en absoluto. Qué pasa cuando el agente se equivoca en voz alta y con total confianza:

Hacker News

"If it's anything like talking to ChatGPT via voice they'd definitely notice. And if it has anything like the failure modes it does, the OP's brother is going to eat into a lot of the cost savings he'd get (vs using a human receptionist or even an outsourced receptionist) dealing with fires like the AI said my car would absolutely be done today."

Así es como hay que pensar en las alucinaciones de IA en una línea telefónica. En texto, una respuesta equivocada es un mensaje que puedes corregir. Dicha en voz alta, es un compromiso que el cliente ha oído que hacías, y la limpieza se convierte en un contacto aparte que también pagas.

Lo que yo haría en realidad

Tres cosas, en este orden. Ninguna de ellas es "comprar la cifra de contención más alta".

Primero, recortar el volumen que nunca necesitó una llamada. Estado del pedido, restablecimiento de contraseñas, horarios de apertura. Ese es trabajo de desvío de nivel 1, y en texto es más barato por interacción y más preciso con el mismo modelo. Aunque, si la persona que llama ya ha fallado en tu centro de ayuda, arreglar el centro de ayuda va primero. Eso es un problema de autoservicio, no uno de voz.

Segundo, arreglar la costura antes de ajustar la voz. En la cita de arriba, un resumen de traspaso estructurado venció a la propia automatización en tiempo ahorrado. El mismo principio que aplicamos al escalado de chat: la persona que lo recibe necesita un resumen y una señal de confianza, no una transcripción.

Tercero, asume que la llamada transferida se convierte en un ticket, porque suele ser así. La persona que llama cuelga y te escribe un correo, o el agente escribe notas después. Un detalle de nuestras propias conversaciones con clientes se me quedó grabado aquí, de un equipo que gestiona una cola mixta de teléfono y correo: nada de sus llamadas llegaba a su IA en absoluto, porque las grabaciones de voz nunca entraban en el sistema y los agentes resumían cada llamada a mano.

"For calls we just write a quick summary in the ticket after, so the AI never really sees any of that."

Responsable de soporte en una empresa B2B SaaS mediana con una cola mixta de teléfono y correo en Zendesk, unos 3.000 tickets al mes

Ese es el vacío que nadie tiene en cuenta al calcular el precio. Compras un agente de voz para atender el teléfono, y luego la mitad que no puede gestionar se convierte en trabajo de texto, dentro de un sistema que el agente de voz no puede ver en absoluto.

Prueba eesel para la mitad que tu agente de voz transfiere

Déjame ser directo: eesel no hace voz. No hay ningún producto telefónico de eesel. Si necesitas algo que responda una línea que suena, compra una de las nueve de arriba.

Lo que hace eesel es la mitad que aterriza después en tu helpdesk, y parte desde un lugar distinto al de cualquier herramienta de voz de aquí. Vuelve a mirar la tabla comparativa. Ocho de las nueve entrenan con un rastreo del sitio web más archivos subidos, y exactamente una puede reproducir tu propio historial de conversaciones. El agente de helpdesk con IA de eesel entrena con tus tickets pasados, después se simula contra ellos antes de responder nada en directo, así que lo que ves es su precisión sobre tu propio volumen histórico en lugar de sobre escenarios que ha inventado alguien. La misma disciplina por la que Parloa cobra dinero empresarial, aplicada al canal de texto.

Panel de eesel AI mostrando actividad de tickets de Zendesk conectada y estadísticas de resolución
Panel de eesel AI mostrando actividad de tickets de Zendesk conectada y estadísticas de resolución

Lo construimos así por una cicatriz. He visto a un bot de sonido confiado inventar afirmaciones sobre el producto y enviarlas a clientes reales, y por eso nada aquí sale en vivo sin pasar antes por un ensayo sobre tickets históricos. También es por qué un responsable de soporte que nos evaluó formuló el requisito como querer un agente que "only handle tickets it's confident to handle" en lugar de uno que lo responda todo.

Resultados en lugar de promesas: Gridwise logró que se resolviera el 73% de las solicitudes de nivel 1 en su primer mes. En cuanto al coste, mi compañero Riell lo dijo claramente cuando dejamos atrás el precio plano, que un equipo que habría pagado $799 al mes de forma fija ahora paga alrededor de $200 según el uso.

Si estás comprando voz, la secuencia honesta es esta. Recorta primero el volumen repetitivo en texto. Compra el agente de voz para lo que quede. Después asegúrate de que los tickets que genera aterrizan en algún sitio que ya conoce tu historial.

La configuración lleva minutos, no las dos a ocho semanas que citan los proveedores de voz empresariales. También cubre más helpdesks que cualquier plataforma de voz de esta página, incluidos Zendesk y Freshdesk, Gorgias y Front. Puedes probar eesel gratis.

Preguntas frecuentes

¿Cuál es la mejor IA para soporte telefónico al cliente en 2026?
No hay un único ganador, porque la categoría se divide según cómo compres. ElevenLabs Agents tiene la única tarifa por minuto que puedes prever hasta el céntimo. Retell AI ofrece a los equipos de soporte transferencia en caliente y toma de control por un supervisor sin necesitar un equipo de desarrollo. PolyAI encaja en un contact center que ya usa Genesys o Avaya. Sea cual sea tu elección, prevé las llamadas que no pueda terminar, porque esas acaban como tickets en tu helpdesk para que las recoja un agente de helpdesk con IA.
¿Cuánto cuesta el soporte telefónico con IA por minuto?
El rango real todo incluido es de 0,08 a 0,20 dólares por minuto, no los 0,05 dólares de la mayoría de las páginas de inicio. ElevenLabs cuesta exactamente 0,08 dólares por minuto incluido en todos los planes de pago, Vapi se sitúa cerca de 0,105 dólares al sumar telefonía y servicios de voz, y Retell alrededor de 0,135 dólares para una configuración de soporte real. Dos operadores informan de forma independiente de que el coste real es de dos a cuatro veces la cifra publicitada. Nuestro desglose de coste de agente de IA frente a agente humano muestra cómo se compara eso con un puesto de trabajo.
¿Puede la IA resolver realmente llamadas de soporte por sí sola?
En parte. En el benchmark τ-Voice, que puntúa escenarios replicados de atención al cliente, el mejor modelo de voz a voz resuelve el 56,5% de ellos, y los operadores de contact centers sitúan la automatización completa real entre el 15% y el 30%. Así que la IA puede responder llamadas de soporte, pero deberías contar con que aproximadamente la mitad de ellas todavía llegue a una persona, y asegurarte de que tu camino de escalado sea limpio.
¿Es mejor la IA de voz o la IA de chat para el soporte al cliente?
El texto gana en precisión con el mismo modelo. La propia investigación de Sierra muestra que todos los proveedores pierden entre 5 y 14 puntos cuando la misma tarea pasa de texto a audio telefónico realista. La voz sigue mereciendo la pena donde el usuario no tiene otra opción, pero el primer paso más barato suele ser reducir el volumen repetitivo con desvío de tickets con IA y mejor autoservicio antes de que suene el teléfono.
¿Qué debería buscar al elegir una IA para soporte telefónico al cliente?
Cuatro cosas, en este orden: si puede transferir a una persona de forma limpia, qué fuentes de conocimiento acepta, si puedes probarla contra tu propio historial de llamadas antes de lanzarla, y el coste real por minuto con la telefonía incluida. La gestión de interrupciones (barge-in) importa más que la latencia publicitada. Aplicamos el mismo criterio al texto, por eso nuestro agente de helpdesk con IA se simula contra tickets pasados y tratamos las alucinaciones de IA como un riesgo de lanzamiento, no como una nota al margen.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración de agentes de voz con IA gestionando llamadas de soporte telefónico al cliente
Guides

La mejor IA para soporte telefónico en 2026 (9 herramientas en las que realmente confiaría)

La mejor IA para soporte telefónico en 2026, comparada: 9 agentes de voz y herramientas de desvío clasificadas por precio, latencia, controles de precisión y para quién sirve cada una.

Riellvriany IndriawanRiellvriany IndriawanJun 22, 2026
Ilustración de una línea telefónica, una forma de onda de sonido y un agente de soporte con auriculares
Guides

La mejor IA para atención al cliente por voz en 2026 (9 herramientas probadas)

Nueve agentes de voz con IA para atención al cliente, con el coste real por minuto de cada uno y el benchmark que muestra por qué la voz sigue resolviendo menos casos que el texto.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Ilustración de un agente de soporte de ecommerce con auriculares ayudando a un cliente por teléfono, con iconos de chat, paquete y tienda
Guides

Soporte telefónico con IA para ecommerce: qué puede hacer y cómo empezar

Una guía práctica sobre soporte telefónico con IA para ecommerce: qué gestionan realmente los agentes de voz con IA, dónde fallan y la solución más económica que la mayoría de las tiendas pasan por alto.

Riellvriany IndriawanRiellvriany IndriawanJun 22, 2026
Ilustración de un agente de soporte con auriculares en una llamada, con un interlocutor y un agente de voz de IA en globos de diálogo
Guides

¿Puede la IA responder llamadas de soporte? Una respuesta honesta para 2026

¿Puede la IA responder llamadas de soporte? Sí, los agentes de voz ya mantienen conversaciones reales y resuelven llamadas repetitivas, pero aquí te explicamos dónde funcionan, dónde fallan y la ventaja más económica que la mayoría de los equipos pasan por alto.

Alicia Kirana UtomoAlicia Kirana UtomoJun 22, 2026
Ilustración de una IA gestionando conversaciones de soporte al cliente por mensaje de texto
Guides

La mejor IA para soporte por SMS en 2026

Comparé las mejores IA para soporte por SMS en 2026 en 8 herramientas, con precios reales, el coste oculto del operador telefónico y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJun 23, 2026
Mejor IA para Gladly: una comparación de agentes de IA para servicio al cliente en 2026
Guides

Mejor IA para Gladly: 7 herramientas top para mejorar tu servicio al cliente en 2026

La mejor IA para Gladly en 2026, desde su agente nativo Sidekick hasta las plataformas AI-first que vale la pena mirar, con precios reales, pros, contras y una recomendación clara para cada equipo.

Alicia Kirana UtomoAlicia Kirana UtomoJun 11, 2026
Mejor IA para Kustomer: una comparación de agentes de IA de servicio al cliente en 2026
Guides

Mejor IA para Kustomer: 7 herramientas top para escalar el servicio al cliente en 2026

La mejor IA para Kustomer en 2026, desde sus agentes nativos Concierge y Envoy hasta las plataformas AI-first que vale la pena considerar, con precios reales, pros, contras y una recomendación clara para cada equipo.

Riellvriany IndriawanRiellvriany IndriawanJun 11, 2026
Firecrawl vs Scrapy: ¿Cuál es mejor para la extracción de datos de IA en 2025?
Guides

Firecrawl vs Scrapy: ¿Cuál es mejor para la extracción de datos de IA en 2025?

La elección entre Firecrawl vs Scrapy depende de tu objetivo. Mientras que Scrapy ofrece un control granular para desarrolladores, Firecrawl proporciona un enfoque moderno y centrado en la IA para obtener datos listos para LLM con un mantenimiento mínimo. Descubre qué herramienta es la adecuada para construir aplicaciones de IA confiables.

Stevia PutriStevia PutriOct 29, 2025
El auge de la llamada telefónica con IA: Qué es y cómo funciona
Guides

Llamadas telefónicas con AI: Qué son y cómo funcionan (2026)

Desde el alcance de ventas hasta los recordatorios de citas, las llamadas telefónicas con IA están transformando la comunicación empresarial. Pero no son una solución perfecta en todos los casos.

Kenneth PanganKenneth PanganAug 22, 2025

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis