
Por qué la voz ha vuelto, y por qué eso importa ahora
Durante casi una década el consejo sensato fue que el soporte telefónico estaba muriendo. No es así. La voz ha repuntado hasta el 40% del volumen de los contact centers y sigue creciendo. El chat, mientras tanto, tiene una tasa de retorno del 32% directo a la voz. Así que el teléfono es donde acaban los contactos difíciles en lugar de los fáciles, lo cual es un problema distinto de la automatización de call centers habitual. También es por eso que la generación anterior de sistemas de llamadas automatizados nunca hizo mella real en esto.
Ese efecto de selección es todo el problema. Un comentarista de Hacker News lo expresó mejor que cualquier presentación de ventas que haya visto:
"I admire what you have done, but for a luxury experience, I do not want to talk to an AI that just tells me what is already on the website. If I have gotten to the point where I am calling you, its because I couldn't find an answer to my question on the website in the first place."
Todo el que te vende un agente de voz lo entrena con tu centro de ayuda. Y las personas que te llaman son, por definición, aquellas a las que tu centro de ayuda ya ha fallado. Ten esto presente, porque explica la mayoría de los lanzamientos decepcionantes de los que oigo hablar.
Cómo elegí estas herramientas, y el benchmark que nadie cita
El 5 de agosto de 2026 revisé la página de precios, la documentación y el centro de ayuda de cada proveedor. Después calculé el coste real todo incluido por minuto en lugar del anunciado, y comprobé qué hace cada uno en el momento en que el agente no puede terminar la tarea. Cuando un proveedor no publica una tarifa, lo digo en lugar de adivinar.
Esta lista es deliberadamente más estrecha que mi encuesta más amplia sobre empresas de IA de voz. También adopta un ángulo distinto al de la lista de mejor IA para soporte telefónico, que ordena por tipo de proveedor. Aquí el orden lo dictan las mediciones.
La medición que cambió cómo leo toda la categoría es τ-Voice, y no es un benchmark de audio genérico. Un usuario simulado llama al modelo con un problema real, un cambio de vuelo o un cargo disputado, a veces una avería de telecomunicaciones. La puntuación es si la base de datos termina en el estado final correcto. Es decir, puntúa exactamente lo que estás comprando.

La cabecera de esa clasificación es aleccionadora:
| Modelo | τ-Voice (escenarios de soporte resueltos) | Razonamiento del habla | Tiempo al primer audio | Coste por hora de audio de entrada |
|---|---|---|---|---|
| Grok Voice Think Fast 2.0 High | 56,5% | 97% | 0,70s | $4.80 |
| Qwen Audio 3.0 Realtime Plus | 54,6% | 99% | 4,02s | $4.42 |
| Grok Voice Think Fast 1.0 | 52,1% | 97% | 1,25s | $3.00 |
| GPT-Realtime-2.1 High | 45,7% | 96% | 1,21s | $10.75 |
| GPT-Realtime-2 High | 39,8% | 97% | 1,14s | $4.14 |
| Gemini 3.1 Flash High | 37,7% | 97% | 2,99s | $1.75 |
| Deepslate Opal | 17,5% | 85% | 0,44s | $6.48 |
| GPT Realtime Mini | 15,1% | 64% | 0,81s | $3.04 |
Lee la segunda y la tercera columna juntas. El razonamiento del habla está básicamente resuelto, ya que seis de estos ocho modelos puntúan un 96% o más al entender una pregunta hablada. Después esos mismos modelos se caen por un precipicio en el momento en que tienen que completar la tarea. Entender a quien llama ya no es la parte difícil. Terminar el trabajo lo es.
¿Quieres ver cómo se ve eso en un entorno de trabajo real en lugar de en un benchmark? La propia documentación de Bland publica una pantalla de análisis de herramientas que es más honesta que cualquier página de marketing:

408 ejecuciones de herramientas, 142 errores, una tasa de error del 34,8%. El principal culpable es una búsqueda en el calendario que falla 81 veces con "start_time must be in the future". Nada de eso es un problema de habla. El agente entendió a la persona que llamaba perfectamente, y después la llamada a la herramienta falló, y ahí es exactamente donde se pierde la puntuación de τ-Voice.
La latencia dejó de ser el cuello de botella
La categoría todavía se vende con milisegundos. Entiendo por qué, porque durante años esa fue realmente la barrera. Ya no, y la clasificación lo muestra con claridad.

Deepslate Opal responde más rápido en toda la tabla, 0,44 segundos, y resuelve el 17,5% de los escenarios de soporte. Grok Voice Think Fast 2.0 tarda un cuarto de segundo más y resuelve el 56,5%. Nadie cuelga por 260 milisegundos. La gente cuelga porque el agente no pudo hacer aquello por lo que llamaban.
Y lo que los operadores informan que va mal no es lentitud en absoluto. Es que el agente habla por encima de ellos:
"It's brutal. We're losing ~40% of callers in the first 30 seconds. Current setup: Vapi with GPT-4 Turn-end detection at 800ms (their default) Network latency averaging 120-150ms Processing adds another 200-300ms What I've tried: Increased silence threshold to 1.2s → Bot feels sluggish, people think it's broken Decreased to 500ms → Interruption city, worse than before Added "please wait for customer to finish" to prompt → Literally no effect"
Eso es gestión de interrupciones (barge-in). Un problema de ajuste más que de modelo, y la partida más subestimada en un despliegue de voz, con diferencia. Un operador que construyó su propia infraestructura cifró el sobrecoste en "200-400ms until you tune turn detection thresholds properly", y luego dijo a la gente que se preparara para "plan for two months of 'why is my agent talking over the caller'" antes de que fuera de calidad de producción, en este hilo de construir frente a comprar.
El relato más completo que encontré vino de alguien con 20 despliegues a sus espaldas. Cubre tanto las interrupciones como la transferencia, y también el coste, todo en un mismo mensaje:
"deployed voice agents for about 20 small businesses now, mostly service companies like plumbers, dentists, med spas. here's what i've actually hit in production: biggest issue by far is barge-in handling. customer starts talking while the agent is still speaking and everything goes sideways. most platforms handle this okay in demos but in real calls with background noise, accents, or people who talk fast it breaks constantly. had to build custom silence detection thresholds per client. second is the handoff to human. when the ai can't handle something it needs to transfer cleanly. vapi and retell both struggle here depending on the telephony setup. the call drops, or there's a 3 second gap of silence that makes the caller hang up. we ended up building a warm transfer flow where the agent briefs the human before connecting. [...] cost wise the biggest surprise was how much it costs when calls go long. a 10 minute call can cost $1.50-2.00 when you add up stt + llm + tts + telephony. sounds small but if you're handling 200 calls a day for a client it adds up fast. we had to build hard cutoffs and summarization to keep calls under 4 minutes."
Merece la pena destacar tres cosas de ahí. Una llamada de diez minutos cuesta entre 1,50 y 2,00 dólares todo incluido, y eso coincide con las cuentas de más abajo, no con ninguna página de inicio. Las demos ocultan los problemas de interrupciones, porque quienes llaman en una demo no tienen acentos ni ruido de fondo. Y la solución, tanto para el vacío de la transferencia como para el coste, fue construir algo que la plataforma no ofrecía.
Las cuatro cosas por las que realmente puntué
- Transferencia a una persona. No si existe. Sino si es en caliente, si entrega un resumen en lugar de una transcripción bruta, y si todo esto está detrás de un contrato empresarial. Una buena gestión de escalado es la diferencia entre un desvío y una persona que llama molesta.
- Fuentes de conocimiento. Casi todas las herramientas de aquí ingieren un rastreo público del sitio web más archivos subidos. Casi ninguna toca tus tickets pasados ni una wiki autenticada. Esa distinción es lo que decide cómo maneja las llamadas que tu centro de ayuda ya ha fallado.
- Pruebas antes del lanzamiento. Una "simulación" que ejecuta escenarios que has escrito tú mismo es una garantía distinta de una que reproduce tu propio historial de llamadas. Exactamente un proveedor de aquí hace lo segundo. Para la prevención de alucinaciones eso importa más que cualquier ajuste de guardarraíles.
- Coste real por minuto, con telefonía incluida. Nunca la cifra de la página de inicio. Es también la cifra que decide tu ROI de call center.
Las 9 mejores herramientas de IA para soporte telefónico al cliente en 2026
| Herramienta | Mejor para | Tarifa real todo incluido | Unidad de facturación | Transferencia a humano | Fuentes de conocimiento | Prueba contra tus propias llamadas | Concurrencia | Seguridad | Integraciones de helpdesk |
|---|---|---|---|---|---|---|---|---|---|
| ElevenLabs Agents | Una tarifa que puedes prever | $0.08/min + operador | Por minuto, prepago | Sí, transfer_to_number | Archivos, URLs, RAG en el plan gratuito | No | 4 a 40 según el plan | SOC 2, ISO 42001, PCI DSS L1, BAA en Enterprise | Zendesk, Salesforce |
| Retell AI | Equipos de soporte sin equipo de desarrollo | ~$0.135/min | Por minuto, ensamblada | En caliente, más toma de control por supervisor | Rastreo de sitio web, subida de archivos | No | 20 gratis, luego $8/línea/mes | SOC 2 Type II, HIPAA, RGPD | HubSpot, Salesforce; Zendesk "próximamente" |
| Vapi | Controlar tú mismo la pila del modelo | ~$0.105/min | Por minuto, ensamblada | Sí, vía proveedor de telefonía | Solo subida de archivos, recuperación con Gemini | No | 10 gratis, luego $10/línea/mes | HIPAA $2.000/mes, ZDR $1.000/mes | Ninguna preconstruida |
| PolyAI | Un parque CCaaS ya existente | Solo bajo presupuesto | Por minuto | Sí | Documentación e integraciones | No | No publicado | SOC 2 Type 2, ISO 27001, PCI DSS, RGPD, HIPAA de serie | Zendesk Talk vía CCaaS |
| Parloa | Probar contra tu historial de llamadas | Solo bajo presupuesto | Por consumo, según complejidad de la tarea | Sí | Conectores empresariales | Sí, reproduce transcripciones reales | No publicado | ISO 27001, SOC 2 Type 1 y 2, PCI DSS | Zendesk, ServiceNow, Salesforce, Dynamics |
| Sierra | Pagar solo por resoluciones | Solo bajo presupuesto | Por conversación resuelta | Sí, conservando el contexto | Conectores empresariales | Simulaciones de voz | No publicado | SOC 2, ISO 27001, ISO 42001, HIPAA, PCI DSS, FedRAMP | No publicado |
| Bland AI | Alta concurrencia y autoalojamiento | $0.11 a $0.14/min | Por minuto + cuota de plataforma | Solo Enterprise | Archivos, texto, web pública | No | 10 a 100, Enterprise hasta 1 millón | SLA del 99,9% en todos los planes, BAA en Enterprise | Ninguna |
| Synthflow | Un despliegue nativo de Freshworks | ~$2.500/mes de mínimo | Por segundo, agregada | Fría, cálida, cálida con resumen | PDFs, URLs, rastreo, importación de Zendesk | Test Center, facturable | Fijada por contrato | SOC 2, RGPD, ISO 27001 | Freshworks (Freshcaller) |
| Grok Voice Agent Builder | El modelo capaz más rápido | $0.08/min + $0.01 número | Por minuto, según uso | Vía llamadas a herramientas | Colecciones, búsqueda de archivos y web | No | 10 sesiones por equipo | No publicado para voz | Ninguna |
Nueve herramientas y cuatro formas distintas de cobrar. Solo una te deja probar contra tu propio archivo de llamadas, y esa es la columna que yo capturaría.
Antes de las fichas individuales, algunas cuentas. Las tarifas anunciadas no son comparables entre sí, y la brecha es lo bastante amplia como para cambiar tu lista corta.
1. ElevenLabs Agents
Mejor para: equipos que necesitan prever la factura hasta el céntimo antes de comprometerse.
ElevenLabs es más conocida por la conversión de texto a voz. La plataforma Agents es la capa conversacional que se apoya en eso, y ya ha lanzado más de 4 millones de agentes. La razón por la que encabeza esta lista es aburrida: es el único proveedor aquí cuya aritmética de precios cierra.

Merece la pena detenerse en ese panel. Es el único lugar de este repaso donde un proveedor muestra sus propios números sin editar: 75,1% de tasa de éxito global, 3,5 estrellas de CSAT medio. Un despliegue de aspecto realista, en otras palabras, y no una afirmación del 95%.
Lo que realmente hace
La telefonía por SIP está incluida en todos los planes en lugar de reservada, lo cual es inusual. Las bases de conocimiento y el RAG funcionan incluso en el plan gratuito. Llamadas a herramientas, llamadas por lotes, un servidor MCP alojado para gestión de agentes, una CLI: todo está ahí. Las integraciones con nombre cubren Genesys y Amazon Connect en el lado de la telefonía. Para ticketing son Zendesk y Salesforce, los únicos dos sistemas de tickets con páginas propias.
Dos cosas que debes saber antes de construir. Sus propias páginas se contradicen sobre los idiomas, listando 70+ en el catálogo de voces frente a 31 en los que un agente realmente se puede configurar para hablar. Segundo, no existe una cifra publicada de latencia de ida y vuelta para un agente, solo cifras de componentes para Flash v2.5 de unos 75ms y Scribe v2 Realtime de unos 150ms. Ninguna de las dos es lo mismo que lo que oye tu persona que llama.
Precios
| Plan | Mensual | Minutos incluidos | $/min efectivo | Exceso | Ráfaga | Llamadas concurrentes |
|---|---|---|---|---|---|---|
| Free | $0 | 15 | n/a | $0.08 | $0.16 | 4 |
| Starter | $6 | 75 | $0.0800 | $0.08 | $0.16 | 6 |
| Creator | $22 (primer mes $11) | 275 | $0.0800 | $0.08 | $0.16 | 10 |
| Pro | $99 | 1.238 | $0.0800 | $0.08 | $0.16 | 20 |
| Scale | $299 | 3.738 | $0.0800 | $0.08 | $0.16 | 30 |
| Business | $990 | 12.375 | $0.0800 | $0.08 | $0.16 | 40 |
| Enterprise | Personalizado | Personalizado | Negociable | Negociable | n/a | Ampliada |
Mira esa columna de efectivo. Cada plan de pago se divide en exactamente $0,08. Business cuesta $990 por 12.375 minutos, y 12.375 × $0,08 son exactamente $990,00. Así que las asignaciones de minutos se calcularon a la inversa a partir del precio, lo que significa que no hay descuento por volumen en ningún plan. Los mensajes de texto cuestan $0,003 cada uno, y la telefonía del operador se cobra "al coste" aparte.
Ventajas
- El único coste por minuto de este repaso que realmente puedes prever.
- El troncal SIP no está bloqueado para Enterprise, así que tu propio operador funciona en un plan de $6.
- Una lista de cumplimiento seria: ISO 42001, AIUC-1, PCI DSS Nivel 1.
- Las bases de conocimiento y el RAG funcionan en el plan gratuito, así que probar de verdad no cuesta nada.
Desventajas
- Nunca hay descuento por volumen. A 50.000 minutos pagas la misma tarifa que a 75.
- Los minutos se prepagan en lugar de pagarse según el uso, así que un volumen irregular significa pagar por un margen que desperdicias.
- El BAA para HIPAA está detrás de Enterprise, y también el SSO y las condiciones del SLA.
- Los operadores informan de que la herramienta
transfer_to_numberno completa la transferencia, discutido extensamente en este hilo de r/ElevenLabs.
Nuestra valoración: empieza aquí si tu volumen es predecible y quieres una cifra que tu equipo financiero acepte. Pero la tarifa plana corta en ambos sentidos. ¿Vas a superar los 20.000 minutos al mes? Consigue un presupuesto Enterprise antes de comprometerte, porque aquí no hay curva de descuento en la que crecer. Desgloso los planes con más detalle en mi guía de precios de ElevenLabs, y cubro las opciones de cambio en alternativas a ElevenLabs.
2. Retell AI
Mejor para: operaciones de soporte que quieren analítica de llamadas y escalado limpio, sin contratar a un desarrollador.
Retell AI es la que pondría delante de un responsable de soporte en lugar de un desarrollador. Su transparencia de costes llega a un grado casi incómodo. También es el único proveedor aquí cuyas propias preguntas frecuentes responden "¿puede la IA sustituir a los agentes de call center?" con un rotundo "No". Eso me merece más respeto que cualquier afirmación de contención en esta página.

Fíjate en el tercer panel. El mensaje de bienvenida está configurado como "User Initiates: AI remains silent until users speak first". Un ajuste pequeño, un efecto grande en cómo se sienten los primeros tres segundos de una llamada de soporte.
Lo que realmente hace
La capa de escalado es la parte fuerte. Transferencia en caliente, navegación IVR y captura DTMF están todas bajo un único nodo de transferencia de llamada, mientras que la monitorización en vivo permite a un supervisor escuchar o tomar el control de la llamada por completo. Mejor aún: la cuota de la IA se detiene en el momento de la transferencia, así que después solo sigue corriendo la telefonía. El incentivo correcto, y casi nadie más lo hace así.
El análisis posterior a la llamada, las transcripciones, los webhooks y la API están todos disponibles en el plan gratuito de pago según uso, así que puedes probarlo de verdad. Un cliente de referencia, Medical Data Systems, publica una tasa de transferencia del 30%. Así que alrededor del 70% de contención en un despliegue real.
La base de conocimiento es un rastreo del sitio web más subida de archivos. No hay ingesta documentada de tu historial de tickets pasado, y la simulación ejecuta casos de prueba que has escrito tú mismo en lugar de una reproducción de tu propio archivo de llamadas.
Precios
| Componente | Tarifa | Notas |
|---|---|---|
| Infraestructura de voz de Retell | $0.055/min | Ineludible. La conversión de voz a texto está absorbida aquí. |
| Texto a voz | $0.015/min | $0,040/min si eliges voces de ElevenLabs |
| LLM | $0.003 a $0.32/min | GPT 5 nano en el suelo, GPT 5.5 Fast en el techo |
| Telefonía | $0.015/min gestionada | $0 en tu propio troncal SIP |
| Base de conocimiento | +$0.005/min | Más $8/mes por base tras las primeras 10 |
| Guardarraíles | +$0.005/min | La eliminación de PII es un +$0,01/min aparte |
| Control de calidad de llamadas con IA | $0.10/min | Los primeros 100 minutos gratis |
| Concurrencia | $8/llamada/mes | Las primeras 20 líneas incluidas |
El rango anunciado es de $0,07 a $0,31 por minuto, con $10 de crédito gratis y sin cuota de plataforma. La propia calculadora de Retell fija por defecto $0,115/min, pero pone a cero la telefonía y todos los complementos. Construye algo realista para soporte entrante, GPT 4.1 con la propia voz de Retell, un número gestionado en EE. UU., la base de conocimiento activada, y llegas a $0,135/min. Eso son $677 al mes con 5.000 minutos. Activa el control de calidad de llamadas con IA en todo tu tráfico y se suman unos $490 al mes más, un salto del 74%.
Ventajas
- La mejor propuesta de transferencia a humano de este repaso, y el contador se detiene en el momento en que se activa.
- Los supervisores pueden escuchar una llamada en vivo, o tomar el control.
- Transparencia de costes hasta la tarifa de cada componente.
- SOC 2 Type II, HIPAA y RGPD vienen en toda la plataforma en lugar de restringirse por plan.
Desventajas
- Zendesk está marcado como "próximamente" en lugar de disponible. Los conectores activos llegan hasta Cal.com, HubSpot y Salesforce, y en ningún sitio de la documentación hay una integración con Freshdesk, Gorgias, Front o Help Scout.
- La afirmación de latencia de ~600ms se atribuye a "benchmarks independientes", que nunca se nombran ni se enlazan.
- Ninguna de las dos páginas publica un número de idiomas ni un porcentaje de SLA de disponibilidad.
- La opción de voz a voz cuesta $0,345/min, lo que está por encima del propio techo declarado de Retell de $0,31.
Nuestra valoración: la opción más sólida en general para un equipo de soporte, con una gran salvedad. Si usas Zendesk o Freshdesk, deberías prever construir tú mismo el traspaso de tickets vía webhooks. Mira a quién pone Retell en su propia vitrina de integraciones: plataformas CCaaS, Genesys y Five9 y Avaya. Eso indica para quién se construyó. Mi desglose de precios de Retell AI va componente por componente si quieres modelar tu propia configuración.
3. Vapi
Mejor para: equipos de ingeniería que quieren elegir cada componente de la pila por sí mismos.
Vapi es infraestructura, no un producto. Ensamblas tú mismo el transporte y la conversión de voz a texto, el modelo, la voz, todo, y Vapi cobra $0,05 por minuto por orquestar el resultado. Si te atrae cambiar Deepgram por Assembly a las 3 de la madrugada, esta es la opción.

Esa fila de chips de proveedores es todo el producto en una captura. Cada chip es también una línea aparte en tu factura.
Lo que realmente hace
Squads y workflows, llamadas a herramientas, observabilidad, un conjunto de evaluación de verdad. Traer tu propio SIP sobre el troncal propio de Vapi no cuesta nada, lo cual es una palanca de coste real. Diez llamadas concurrentes vienen incluidas, y las líneas extra cuestan $10 al mes cada una.
Una fecha límite dura que debes conocer: el constructor visual de Workflows deja de funcionar el 19 de agosto de 2026, dentro de dos semanas. La razón que da Vapi es que la IA actual no puede actuar de forma fiable como agentes autónomos de grafo de nodos, y que Squads "consistently led to better results". Así que cualquier construcción de soporte de Vapi de antes de mediados de 2026 necesita migrarse ahora. Vapi también advierte de que su migración asistida por IA no está garantizada como correcta o completa.
Precios
| Componente | Tarifa | Notas |
|---|---|---|
| Orquestación de Vapi | $0.05/min | Más $0,005 por mensaje de SMS-chat |
| Transporte | Gratis a $0.014/min | Vapi SIP y WebRTC gratis; Twilio saliente $0,014 |
| Voz a texto | $0.000631 a $0.01733/min | Google en el suelo, Speechmatics en el techo |
| Texto a voz | $0.002 a $0.24/min | Inworld en el suelo, Tavus en el techo |
| LLM | $0.01 a $2.12 por 1M | 4.1-mini en el suelo, 4.5 Preview en el techo |
| HIPAA | $2.000/mes | La retención cero de datos es un $1.000/mes aparte |
Ensambla algo realista, Vapi más Twilio entrante más Deepgram más ElevenLabs más un modelo barato, y sale en torno a $0,105/min. Eso son $0,63 por una llamada de seis minutos. Digno de notar también: la propia cuota de Vapi supone el 48% de un minuto realista y el 91% del más barato posible. Las condiciones Enterprise empiezan en 400.000 minutos al año.
Ventajas
- Control total sobre cada componente, y una tarifa publicada para cada uno.
- El transporte es gratis en Vapi SIP o WebRTC.
- El suelo más barato de este repaso, alrededor de $0,055/min, si optimizas al máximo por ello.
- Herramientas de observabilidad y evaluación que son realmente buenas.
Desventajas
- Las pruebas se facturan a tarifas de producción. Directamente de las propias preguntas frecuentes de Vapi: "Is testing free? No, test calls cost you the same as regular calls."
- La base de conocimiento es solo subida de archivos, la recuperación es solo con Gemini, no hay rastreo del centro de ayuda, y el límite recomendado está por debajo de 300KB por archivo.
- Cero integraciones de ticketing en el catálogo de herramientas. Leer o escribir un ticket es un
apiRequestque construyes tú. - Según la propia página de metodología de Vapi, el titular de "menos de 500ms de latencia" excluye el endpointing y el transporte, y esa misma página admite que el endpointing puede suponer una parte significativa del retraso.
Nuestra valoración: la opción correcta si tienes ingenieros y quieres el suelo de coste. La incorrecta si quieres algo que responda llamadas la semana que viene. En cualquier caso, haz la migración de Workflows antes de la fecha límite de agosto. Hay más sobre la forma de la plataforma en mi análisis de Vapi.
4. PolyAI
Mejor para: un contact center establecido que ya opera con Genesys, Avaya o Amazon Connect.
PolyAI vende a contact centers, no a desarrolladores, y la lista de integraciones lo delata. Genesys, Avaya, Amazon Connect, Twilio, Five9, NICE, Talkdesk, Cisco, RingCentral, Zendesk Talk: todo compatible. Así que se integra en un parque que ya tienes en lugar de pedirte que lo sustituyas.

La lista de plantillas dice mucho sobre para quién es esto. "Handle call transfers to a human agent" aparece como plantilla inicial en lugar de tema avanzado. El instinto correcto.
Lo que realmente hace
Agent Studio es la superficie de construcción, con un punto de entrada de autoservicio en studio.poly.ai. Los plazos de despliegue publicados en todo el sitio van de menos de diez minutos para autoservicio hasta unas ocho semanas para un despliegue de Amazon Connect, así que toma la cifra rápida con cautela. El soporte de idiomas es de 42 o 45, según qué página de PolyAI leas.
La postura de seguridad es la mejor documentada aquí, y de forma inusual no está restringida por plan. SOC 2 Type 2, ISO 27001, PCI DSS, RGPD y HIPAA se describen todos como estándar y "integrados en la arquitectura", con certificación AWS FTR también en la página de socios de Amazon Connect. Cada despliegue de pago también incluye un SLA de disponibilidad del 99,9% en las líneas telefónicas más una línea de soporte de emergencia 24/7/365. No es una nota al margen, eso, cuando lo que responde tu teléfono se rompe a las 2 de la madrugada.
Precios
No publicados. La página de precios se titula "Simple pricing that scales" y promete una estructura transparente, y luego muestra un formulario de captación de contactos escalonado por volumen anual de llamadas, de menos de 10.000 a más de 1.000.000 de llamadas. Ninguna cifra en dólares aparece en ninguna propiedad de PolyAI. Tampoco hay compromiso mínimo.
Al menos la unidad de facturación está clara, en las propias palabras de PolyAI: el uso continuado "is priced on a per-minute basis, which includes proactive performance improvements, maintenance and 24/7 support."
Ventajas
- La lista de integraciones CCaaS más profunda aquí, así que encaja en un parque que ya operas.
- Certificaciones de seguridad en todos los niveles en lugar de detrás de un plan Enterprise.
- La tarifa por minuto incluye un SLA de disponibilidad del 99,9% en la línea telefónica y una línea de emergencia 24/7.
- Resultados de clientes publicados en un amplio abanico de despliegues.
Desventajas
- Sin precio publicado. La página de precios se llama a sí misma transparente y luego muestra un formulario.
- Las cifras de contención varían enormemente según el caso de uso: 70% de las llamadas de huéspedes en una cadena de pubs del Reino Unido, luego 34% en reservas de Golden Nugget y 30% en un banco minorista sin nombre. Las cifras de restaurantes no son una guía justa para una cola de soporte.
- El sitio se contradice dos veces, en el número de idiomas y en el plazo de despliegue.
- Cada estadística destacada del sitio es un contador animado en el cliente, lo que hace difícil verificar las cifras de forma independiente.
Nuestra valoración: si ya tienes una plataforma CCaaS, PolyAI es probablemente tu camino más corto hacia un agente de voz que funcione, y el SLA incluido se justifica. Una cosa en la que deberías insistir: cifras de contención de un despliegue de soporte, no de uno de reservas. La diferencia publicada entre los dos es más del doble. Para más contexto sobre la categoría, está mi introducción a la IA conversacional para atención al cliente.
5. Parloa
Mejor para: cualquiera que quiera que el agente se pruebe contra su propio historial de llamadas antes de que atienda una llamada real.
Parloa es la entrada empresarial europea. Levantó 350 millones de dólares con una valoración de 3.000 millones en enero de 2026 y ha superado los 50 millones de dólares de ingresos anuales con una retención neta del 150%, con un total captado que ya supera los 560 millones de dólares en menos de cuatro años. Entre sus clientes están Allianz, Booking.com, IKEA y SAP.
Parloa no publica capturas de producto en ningún sitio, así que lo que sigue es su propia diapositiva de arquitectura en lugar de una captura de la interfaz. Normalmente considero eso un punto en contra de un proveedor. En este caso la diapositiva dice lo importante en voz alta.

La etapa dos de ese círculo es "probar e iterar", con el mismo peso que desplegar y monitorizar. Todos los demás proveedores de aquí tratan las pruebas como una función. Parloa construyó una empresa alrededor de eso.
Lo que realmente hace
El entorno de simulación es la razón por la que Parloa está en esta lista. También es la única función de todo este repaso que llamaría un diferenciador real. Ejecuta miles de conversaciones simuladas a través de escenarios, idiomas, canales y casos extremos, y la parte crítica es que mezcla tus transcripciones históricas reales con pruebas sintéticas en lugar de ejecutar solo escenarios escritos a mano por alguien. Prueba la ambigüedad y las llamadas a herramientas, el fallback, la consistencia de marca. Aísla subtareas, y alterna entre staging y producción.
Las evaluaciones se ejecutan con LLM-como-juez y criterios basados en reglas, ambos, sobre éxito de tarea y tono, precisión, comportamiento de la API. Después trazado de causa raíz, con recomendaciones de arreglo a nivel de línea aplicadas dentro de la propia plataforma. Este es el mecanismo que desearía que todos los proveedores de aquí tuvieran. También es el mismo principio que aplicamos al texto: un bot que solo se ha probado con preguntas que has inventado tú mismo no te enseña nada útil.
Las integraciones cubren Avaya, Five9, Genesys, NICE, Twilio, Verint, Salesforce, Dynamics, ServiceNow, Zendesk y SAP, más SIP. Más de 130 idiomas en más de 70 países, aunque no se publica ninguna lista en ningún sitio. La afirmación sobre residencia de datos viene con una redacción más estricta de lo habitual: que el enrutamiento en tiempo de ejecución mantiene el procesamiento dentro de la jurisdicción durante la interacción y no solo en reposo, pero el detalle está detrás de un centro de confianza con acceso restringido.
Precios
No publicados, y la URL de precios devuelve un error 404. La única señal real es la propia lista de preguntas frecuentes de Parloa, que describe un "consumption-based pricing model that ties costs to task complexity and effort, not flat rates or token counts", cotizado según volumen, casos de uso y valor de negocio. No se publica ningún mínimo, ningún plan gratuito, ninguna prueba.
Ventajas
- La única herramienta aquí que reproduce tu historial real de llamadas en la simulación.
- Trazado de causa raíz, con los arreglos aplicados dentro de la propia plataforma.
- Una postura europea real, construida sobre Azure, con enrutamiento en tiempo de ejecución dentro de la jurisdicción.
- Las certificaciones son ISO 27001:2022, SOC 2 Type 1 y Type 2, y PCI DSS.
Desventajas
- Ningún precio publicado de ningún tipo. El consumo "según complejidad de la tarea" es además la unidad más difícil de prever aquí.
- HIPAA, RGPD y DORA se describen como "aligns with" en lugar de certificado. Esa es la redacción propia de Parloa, y merece la pena leerla con precisión.
- Los porcentajes de clientes en la página de inicio son contadores animados con JS, así que las cifras reales están en las páginas de casos de estudio.
- Amazon Connect no aparece en ninguna lista de integraciones de Parloa publicada, así que no lo asumas.
Nuestra valoración: si eres un comprador empresarial con solo una pregunta que hacerle a un proveedor, pregunta si su simulación reproduce tus propias llamadas. Parloa es el que aquí responde que sí. Esa única capacidad vale más que un punto porcentual de contención en el benchmark de otro. Mi análisis de Parloa tiene más sobre la plataforma, y precios de Parloa cubre lo que se sabe del lado comercial.
6. Sierra
Mejor para: soporte de alto valor donde pagar por resolución vence a pagar por minuto.
Sierra levantó 950 millones de dólares con una valoración superior a 15.000 millones en mayo de 2026, y dice servir a más del 40% de las Fortune 50. El producto de voz maneja más de 55 idiomas con cambio a mitad de conversación, enrutamiento de modelo por turno y escalado que conserva el contexto. También acepta pagos por voz, tarjeta y ACH mediante tonos DTMF, a través de infraestructura conforme con PCI Nivel 1.

Eso es una llamada de demostración en lugar de una captura de consola, y es lo más que puedo mostrarte. Cada elemento visual en la página de voz de Sierra es un póster de vídeo, sin ninguna captura completa del producto publicada en ningún sitio.
Sierra merece una mención por algo distinto a su producto, también. Publica la investigación de τ-voice que replanteó todo este artículo. Sus propios hallazgos: la frontera se movió del 30,4% al 67,3% de pass@1 entre agosto de 2025 y abril de 2026, frente a un techo de razonamiento de texto cercano al 85%. Todos los proveedores pierden entre 5 y 14 puntos con audio telefónico realista. Y el 79% de los primeros errores críticos son responsabilidad del propio agente. Un proveedor que publica las cifras que hacen que su propia categoría parezca difícil es una buena señal.
Lo que realmente hace
Comercialmente, lo distintivo es el precio por resultado. El planteamiento propio de Sierra es "Pay for a job well done", con la unidad ligada a "a resolved support conversation, a saved cancellation, an upsell, a cross-sell", y "if the conversation is unresolved, in most cases, there's no charge." La versión más corta que dan: "Sierra gets paid only when we complete a task for you."
Lee las matizaciones con atención, sin embargo, porque son lo que importa a la hora de firmar el contrato. Las escaladas no se facturan "en la mayoría de los casos", y las excepciones no se publican. La factura real es mixta, porque Sierra dice: "routing or greeter-style interactions may align better with consumption-based pricing, where payment is based on conversation count, regardless of the outcome." Después está "resuelto", que no tiene una definición universal aquí. Los criterios se acuerdan por contrato.
Precios
No hay página de precios en absoluto. sierra.ai/pricing devuelve un 404 rotundo, y no aparece ninguna cifra en dólares en ningún sitio: ni tarifa por resultado, ni cuota de configuración, ni mínimo, ni prueba. Nunca se menciona una cuota de plataforma. Tampoco se niega nunca, así que no asumas que no existe.
Ventajas
- El modelo de facturación se alinea con lo que realmente quieres, que son resoluciones en lugar de tiempo al aire.
- La lista de certificaciones más amplia aquí: SOC 2, ISO 27001, ISO 42001, HIPAA, RGPD, EU AI Act y FedRAMP.
- Más de 55 idiomas, y cambia a mitad de conversación.
- Publica investigación honesta sobre los límites de su propia categoría.
Desventajas
- Cero precios publicados, así que comparar con cualquier otra cosa significa entrar antes en un ciclo de ventas.
- Los distintivos de certificación no llevan fecha de auditoría, ni distinción SOC 2 Type I/II, ni nivel de autorización FedRAMP.
- Los clientes de voz nombrados se detienen en Rocket Mortgage, Guild y Next, y no se publica ninguna cifra de contención, resolución o tiempo de gestión para ninguno de ellos.
- Ninguna cifra de latencia de voz publicada. Esa cifra de 200ms en el artículo de τ-voice es la granularidad del fragmento de audio del benchmark, no el tiempo de respuesta del agente, así que no la cites como tal.
Nuestra valoración: el precio por resultado se vuelve más atractivo cuanto peor es tu tasa de contención, y eso es un alineamiento inteligente. Solo entra en la negociación sabiendo que eres tú quien define la unidad facturable. Fija por escrito qué escaladas cuentan como las excepciones a "en la mayoría de los casos". Profundizo en el modelo en precios de Sierra AI, y el panorama competitivo en alternativas a Sierra.
7. Bland AI
Mejor para: alta concurrencia, o un despliegue que tenga que residir en tu propia nube.
Bland AI publica aquí la escala de planes más clara, más el techo de concurrencia más alto por un margen amplio. Su índice de documentación cita soporte Enterprise para "up to 1 million concurrent calls". Nadie más en esta lista se acerca a esa cifra.

Esta es la imagen más clara de lo que significa "probar" en toda la categoría. El panel de la derecha ejecuta una prueba de "Angry Caller" al 94% y una puerta de "Happy Path" al 100%. Ambas son personas ficticias escritas por alguien. Útil. Sigue sin ser tu historial de llamadas.
Lo que realmente hace
Rutas conversacionales, llamadas a herramientas y APIs, y luego tres posturas de alojamiento publicadas: Bland Cloud, tu propia VPC en AWS, GCP o Azure, o completamente on-premise y con aislamiento total (air-gapped). Ninguna cifra en dólares se asocia a ninguna de esas opciones. Tampoco se publica ningún recargo o mínimo, ya que todo eso está dentro del contrato Enterprise.
Nuevo desde la última vez que miré: una cifra de latencia real. La página de inicio ahora anuncia 400ms frente a una "media de la industria" declarada de 1.240ms, la documentación habla de menos de 400ms, y la página de producto muestra cifras p50 de 380ms y 365ms. Esa comparación de 1.240ms no tiene fuente. Trátala como marketing, no como medición.
Una trampa en la redacción. La página de producto anuncia la capacidad de "back-test against historical calls", mientras que el mecanismo documentado de Scenarios es una persona que llama simulada siguiendo un prompt de persona que has escrito tú. Una garantía distinta de reproducir tu propio archivo, y merece la pena preguntarlo directamente.
Precios
| Start | Build | Scale | Enterprise | |
|---|---|---|---|---|
| Tiempo de conversación | $0.14/min | $0.12/min | $0.11/min | Personalizado |
| Cuota de plataforma | $0 | $299/mes | $499/mes | Contratado |
| Tiempo de transferencia | $0.05/min | $0.04/min | $0.03/min | Personalizado |
| Llamadas concurrentes | 10 | 50 | 100 | Ajustado al volumen |
| Límite diario / por hora | 100 / 100 | 2.000 / 1.000 | 5.000 / 1.000 | Ilimitado |
| Bases de conocimiento / voces | 10 / 1 | 50 / 5 | 100 / 15 | Ilimitado |
| SLA de disponibilidad | 99,9% | 99,9% | 99,9% | 99,9% |
Los puntos de cruce son lo bastante contraintuitivos como para merecer conocerlos. Build solo vence a Start por encima de 14.950 minutos al mes, y Scale solo vence a Build por encima de 20.000. Por debajo de unos 15.000 minutos, el plan gratuito Start es aritméticamente el más barato. Aquí actualizas por concurrencia, no por la tarifa.
Ventajas
- Un SLA de disponibilidad del 99,9% en todos los planes, incluido el gratuito, algo que nadie más aquí hace.
- El autoalojamiento en tu propia VPC, o con aislamiento total on-premise, es una opción publicada.
- El techo de concurrencia es el más alto de este repaso.
- Trae tu propio troncal y el cargo por minuto de transferencia desaparece por completo.
Desventajas
- El directorio de integraciones tiene 19 conectores en 7 categorías y cero sistemas de helpdesk o ticketing, a pesar de que los textos del producto afirman soporte de ticketing. Llevar una llamada a Zendesk o Front significa una herramienta a medida, o un webhook posterior a la llamada que construyes tú.
- La transferencia en caliente es solo Enterprise, y la documentación fija esa restricción de forma explícita. Los despliegues de autoservicio son solo de transferencia en frío, sin citas de respuesta.
- Las citas y los informes de vacíos de la base de conocimiento, los resultados, los guardarraíles, las alertas, el SMS, el chat web, el BAA: todo también solo Enterprise.
- La página de precios dice que la telefonía se cobra aparte al coste de tránsito. Las preguntas frecuentes de la página de inicio y la documentación dicen que la tarifa por minuto lo cubre. Consigue eso por escrito.
Nuestra valoración: Bland es una plataforma de voz más que un producto de soporte, y sus pruebas destacadas son de generación de ingresos más que de ahorro de costes. Elígela por concurrencia, o por un requisito de alojamiento en el que tu equipo de seguridad no va a ceder. ¿La compras para responder llamadas de soporte? Presupuesta el plan Enterprise desde el principio, porque las funciones que necesitas viven todas ahí arriba. Y si gestionar tickets es el objetivo real, una de las herramientas de automatización de soporte de mi repaso más amplio encaja mejor.
8. Synthflow
Mejor para: una tienda de Freshworks que quiere su IA de voz dentro de Freshcaller.

Antes del análisis, mira ese cajón abierto, porque es la captura más útil de todo este artículo. Muestra una búsqueda real en la base de conocimiento a mitad de la llamada. La persona que llamaba dijo "I have but I I would like to know how to use the product", el agente lo reescribió como una búsqueda, y volvieron 7 resultados en 756ms con una mejor puntuación de similitud de 0,80, frente a un similarity_threshold de 0. Ese umbral es el dial que decide si tu agente responde desde una coincidencia débil o admite que no lo sabe. Casi ningún proveedor te muestra esto.
Todo el mundo sigue describiendo Synthflow como la entrada fácil sin código. Desde este mes eso está desactualizado. La escalera de autoservicio ha desaparecido, y la documentación lo confirma: los antiguos planes Pro, Growth y Agency "are no longer available for new subscriptions and remain supported for existing customers." Lo que queda es un producto Enterprise de un solo nivel, guiado por ventas.
Lo que realmente hace
La transferencia a humano es la función de soporte más fuerte aquí, en tres modos: fría, cálida con un mensaje, cálida con un resumen. Hay detección de humanos con un tiempo de espera de 30 segundos a 30 minutos, filtrado de llamadas, un horario de atención. La documentación también es directa de una forma que aprecio: "cold transfers cannot recover from failures."
Las fuentes de conocimiento son PDFs, documentos escritos, URLs individuales, rastreos públicos del sitio web y una importación del centro de ayuda de Zendesk. Sin fuentes autenticadas, sin ingesta de tickets pasados, y sin clasificación manual de documentos. En integraciones, la afirmación "200+" se resuelve en unos 15 conectores documentados, y la única integración profunda con la pila de soporte entre ellos es Freshworks: la IA de voz corriendo dentro de Freshcaller, con un 65% de las solicitudes de voz rutinarias automatizadas. Esa es la razón para comprarlo.
El detalle de la medición se publica mucho con más precisión que las tarifas, una combinación inusual pero útil. La facturación es por segundo y se agrega entre llamadas, así que 125 segundos de llamadas se convierten en 2 minutos facturables en lugar de 4. Una transferencia exitosa detiene el contador. Un no-answer o un colgado de buzón de voz se facturan a un tanto alzado de 5 segundos. El chat se convierte a razón de 5 mensajes de IA por minuto de voz. Y las simulaciones del Test Center pueden ser facturables.
Precios
| Plan | Mensual | Minutos incluidos | Exceso | Llamadas concurrentes |
|---|---|---|---|---|
| Enterprise (el único plan vendido) | Sin precio de lista; los contratos empiezan en $30.000/año, unos $2.500/mes | No publicado, según contrato | Personalizado, según tu acuerdo | "Fijado con Synthflow" |
| Pro / Growth / Agency (legado) | Cerrado a nuevos clientes | Solo dentro de tu cuenta | Solo dentro de tu cuenta | Mostrado en las condiciones de tu cuenta |
| Prueba gratuita | Sin registro de autoservicio. Ambos CTA llevan a contactar con ventas | n/a | n/a | n/a |
El coste efectivo por minuto incluido es incalculable en todos los planes, porque Synthflow nunca publica un precio y una asignación de minutos en la misma fila. La única cifra pública defendible es ese mínimo equivalente a $2.500 al mes, frente a una asignación que nadie fuera del contrato conoce. Cualquier cifra por minuto que aún circule se remonta a la escalera retirada.
Ventajas
- Tres modos de transferencia distintos. Cálida con un resumen es el que realmente ayuda al humano.
- La facturación por segundo, agregada entre llamadas, es la medición más justa aquí.
- Una transferencia exitosa detiene el contador.
- Una integración profunda con Freshworks, con una cifra publicada de automatización del 65% para solicitudes de voz rutinarias.
Desventajas
- Ese mínimo de $30.000/año la convierte en la opción más cara aquí a cualquier volumen por debajo de unos 20.000 minutos al mes.
- Ya no hay ninguna cifra de concurrencia publicada en ningún plan.
- Una contradicción sobre HIPAA en su propio sitio web. La página de inicio afirma certificación en SOC 2, HIPAA, PCI DSS y RGPD, mientras que la fila de cumplimiento de la documentación Enterprise solo lista SOC 2, RGPD e ISO 27001. No asumas un BAA.
- La latencia es un objetivo y no una medición, formulada como "we aim for" menos de 100ms de ida y vuelta. La reventa desaparece el 15 de septiembre de 2026, y los servidores de telefonía en la UE están "muy pronto".
Nuestra valoración: la reputación de sin código ya no coincide con la lista de precios, así que ignora cualquier repaso que todavía la llame la opción barata de entrada, incluidos los nuestros más antiguos. Si usas Freshworks, es un encaje fuerte y nativo. En caso contrario, la integración con Freshcaller es el principal motivo por el que pagarías ese mínimo, y una herramienta general de automatización de atención al cliente cuesta muchísimo menos.
9. Grok Voice Agent Builder
Mejor para: el modelo capaz más rápido, si los límites de sesión no te frenan.
El Grok Voice Agent Builder de xAI corre sobre Grok Voice Think Fast 2.0, que encabeza la tabla τ-Voice con un 56,5% y responde en 0,70 segundos. Esa combinación es todo el argumento de venta. En el benchmark se sostiene.
No hay captura de producto en esta sección porque xAI no publica ninguna, y las URLs de documentación del Voice Agent Builder devuelven actualmente un 404. Lo que xAI sí publica es un cambio de precios que entra en vigor hoy. Si ya usas Grok Voice en producción, eso es lo más consecuente de esta página.

Lo que realmente hace
Es compatible a nivel de protocolo con la API Realtime de OpenAI en wss://api.x.ai/v1/realtime, así que migrar una construcción realtime existente es sobre todo un cambio de URL. Las herramientas cubren funciones, búsqueda de archivos, búsqueda web, búsqueda en X y MCP. Las extensiones con forma de cumplimiento normativo son la parte útil: force_message dice una línea textual para avisos legales, replace mapea pronunciaciones sin cambiar la transcripción, keyterms acepta hasta 100 términos de 50 caracteres cada uno, resumption reproduce turnos al reconectar. Un número de teléfono asignado añade $0,01 por minuto.
Digno de destacar en el lado de la precisión: la transcripción es 1,4 veces mejor en tasa de error de palabras que la versión 1.0, de 1,5 a 2,0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas, y unas 10 veces mejor en audio telefónico con ruido. El ruido de fondo y los acentos son exactamente lo que los operadores informan que rompe sus agentes, así que esa cifra es más relevante para ti que el benchmark destacado.
Precios
| Elemento | Tarifa |
|---|---|
| Grok Voice Think Fast 2.0 | $0.08/min ($4.80/h) |
| Grok Voice Think Fast 1.0 | $0.05/min ($3.00/h) |
| Entrada de texto | $0.004 por elemento de conversación |
| Número de teléfono asignado | +$0.01/min |
web_search / x_search | $5 por 1.000 invocaciones |
file_search (colecciones) | $2.50 por 1.000 |
attachment_search | $10 por 1.000 |
Hoy es el día en que esto se volvió más caro. El 5 de agosto de 2026 el alias grok-voice-latest se redirige de 1.0 a 2.0, así que la ruta por defecto cuesta un 60% más por minuto, sin ningún despliegue de tu parte. Fijar la versión antigua es tu forma de excluirte. Ese cambio también borró la ventaja del 37,5% de Grok sobre ElevenLabs, porque $0,08 es exactamente la tarifa efectiva de ElevenLabs por minuto incluido. Lo que queda es la forma de facturación en lugar del precio. Grok es de pago según uso, los minutos de ElevenLabs se prepagan, así que Grok sigue ganando en volumen irregular o bajo.
Ventajas
- La cima de la tabla τ-Voice en la finalización de tareas de soporte, con un 56,5%.
- La tercera latencia más rápida al primer audio, con 0,70 segundos, lo que es la mejor combinación de velocidad y capacidad.
- La medición es plana por minuto, así que el coste medido por hora de audio de entrada equivale exactamente a la tarifa de lista.
- Transcripción sólida en audio telefónico, unas 10 veces mejor en condiciones ruidosas.
Desventajas
- 10 sesiones concurrentes por equipo por defecto. Para una línea de soporte eso es un techo duro, y subirlo requiere una solicitud.
- Sin descuento por lotes ni nivel prioritario en voz, así que no hay ni descuento ni carril rápido de pago. Solo
us-east-1, y una duración máxima de sesión de 120 minutos. - Sin integraciones de helpdesk. Tampoco certificaciones de seguridad publicadas para el producto de voz.
- El almacenamiento se factura aparte cuando el agente hace recuperación, $0,10/GiB/día para colecciones.
Nuestra valoración: el modelo más capaz aquí, envuelto en el producto menos orientado al soporte. Diez sesiones concurrentes es la cifra que lo decide. Si tu pico está por encima de eso y nadie ha subido el límite, esto es un prototipo más que una línea de soporte en producción, sin importar lo bien que se vea el benchmark. Cubrí el modelo en profundidad en Grok Voice Think Fast 2, y las nuevas tarifas en su desglose de precios.
A dónde va realmente la otra mitad de tus llamadas
Todas las herramientas de arriba transferirán. No es un defecto, es aritmética. El mejor modelo resuelve el 56,5% de los escenarios de soporte en un benchmark, y los operadores informan de un 15% a un 30% en producción, mientras que la resolución neta media de primer nivel en los helpdesks se sitúa generalmente en torno al 74,3%, con solo un 1,4% de los helpdesks por encima del 95%. Algo siempre llega a una persona. Por eso la resolución en el primer contacto es un objetivo mejor que la contención.

El patrón de fallo del que más oigo hablar no tiene nada que ver con la conversación con el bot. Ocurre en la costura:
"AHT question nobody wants to answer lol. shipped a billing/tracking bot, decent containment, but AHT on escalated calls went up. agents had to read the transcript, figure out what the bot already tried, re-ask half of it anyway. fixed by forcing a structured handoff summary instead of raw transcript dump (saved more time than the automation itself). CSAT fine on deflected stuff, tanked on anything that bounced back after a failed bot attempt"
Lee dos veces esa última cláusula. La contención se veía bien, el tiempo de gestión en las llamadas escaladas subió, y la satisfacción se desplomó específicamente en los rebotes. Así que un despliegue de voz puede ganar en el panel de control y perder con los clientes que más te necesitaban. Ese es el argumento para hacer seguimiento del CSAT segmentado según si la IA tocó primero el contacto.
Aquí va la versión sin rodeos del mismo punto, de un operador de contact center al que preguntaron cuánto de su centro está realmente automatizado:
"15% roughly....people quoting any higher are lying or dont understand "fully handled". AI solutions are not mature or too fragmented at the moment to go any higher."
Otras respuestas en ese hilo sitúan la banda entre el 10% y el 30%, según el diseño del recorrido. Así que el 15% es el extremo pesimista de una banda real en lugar de un cínico solitario. En cualquier caso, no está ni cerca del 95%.
Después hay un coste que el panel de contención no puede ver en absoluto. Qué pasa cuando el agente se equivoca en voz alta y con total confianza:
"If it's anything like talking to ChatGPT via voice they'd definitely notice. And if it has anything like the failure modes it does, the OP's brother is going to eat into a lot of the cost savings he'd get (vs using a human receptionist or even an outsourced receptionist) dealing with fires like the AI said my car would absolutely be done today."
Así es como hay que pensar en las alucinaciones de IA en una línea telefónica. En texto, una respuesta equivocada es un mensaje que puedes corregir. Dicha en voz alta, es un compromiso que el cliente ha oído que hacías, y la limpieza se convierte en un contacto aparte que también pagas.
Lo que yo haría en realidad
Tres cosas, en este orden. Ninguna de ellas es "comprar la cifra de contención más alta".
Primero, recortar el volumen que nunca necesitó una llamada. Estado del pedido, restablecimiento de contraseñas, horarios de apertura. Ese es trabajo de desvío de nivel 1, y en texto es más barato por interacción y más preciso con el mismo modelo. Aunque, si la persona que llama ya ha fallado en tu centro de ayuda, arreglar el centro de ayuda va primero. Eso es un problema de autoservicio, no uno de voz.
Segundo, arreglar la costura antes de ajustar la voz. En la cita de arriba, un resumen de traspaso estructurado venció a la propia automatización en tiempo ahorrado. El mismo principio que aplicamos al escalado de chat: la persona que lo recibe necesita un resumen y una señal de confianza, no una transcripción.
Tercero, asume que la llamada transferida se convierte en un ticket, porque suele ser así. La persona que llama cuelga y te escribe un correo, o el agente escribe notas después. Un detalle de nuestras propias conversaciones con clientes se me quedó grabado aquí, de un equipo que gestiona una cola mixta de teléfono y correo: nada de sus llamadas llegaba a su IA en absoluto, porque las grabaciones de voz nunca entraban en el sistema y los agentes resumían cada llamada a mano.
"For calls we just write a quick summary in the ticket after, so the AI never really sees any of that."
Responsable de soporte en una empresa B2B SaaS mediana con una cola mixta de teléfono y correo en Zendesk, unos 3.000 tickets al mes
Ese es el vacío que nadie tiene en cuenta al calcular el precio. Compras un agente de voz para atender el teléfono, y luego la mitad que no puede gestionar se convierte en trabajo de texto, dentro de un sistema que el agente de voz no puede ver en absoluto.
Prueba eesel para la mitad que tu agente de voz transfiere
Déjame ser directo: eesel no hace voz. No hay ningún producto telefónico de eesel. Si necesitas algo que responda una línea que suena, compra una de las nueve de arriba.
Lo que hace eesel es la mitad que aterriza después en tu helpdesk, y parte desde un lugar distinto al de cualquier herramienta de voz de aquí. Vuelve a mirar la tabla comparativa. Ocho de las nueve entrenan con un rastreo del sitio web más archivos subidos, y exactamente una puede reproducir tu propio historial de conversaciones. El agente de helpdesk con IA de eesel entrena con tus tickets pasados, después se simula contra ellos antes de responder nada en directo, así que lo que ves es su precisión sobre tu propio volumen histórico en lugar de sobre escenarios que ha inventado alguien. La misma disciplina por la que Parloa cobra dinero empresarial, aplicada al canal de texto.

Lo construimos así por una cicatriz. He visto a un bot de sonido confiado inventar afirmaciones sobre el producto y enviarlas a clientes reales, y por eso nada aquí sale en vivo sin pasar antes por un ensayo sobre tickets históricos. También es por qué un responsable de soporte que nos evaluó formuló el requisito como querer un agente que "only handle tickets it's confident to handle" en lugar de uno que lo responda todo.
Resultados en lugar de promesas: Gridwise logró que se resolviera el 73% de las solicitudes de nivel 1 en su primer mes. En cuanto al coste, mi compañero Riell lo dijo claramente cuando dejamos atrás el precio plano, que un equipo que habría pagado $799 al mes de forma fija ahora paga alrededor de $200 según el uso.
Si estás comprando voz, la secuencia honesta es esta. Recorta primero el volumen repetitivo en texto. Compra el agente de voz para lo que quede. Después asegúrate de que los tickets que genera aterrizan en algún sitio que ya conoce tu historial.
La configuración lleva minutos, no las dos a ocho semanas que citan los proveedores de voz empresariales. También cubre más helpdesks que cualquier plataforma de voz de esta página, incluidos Zendesk y Freshdesk, Gorgias y Front. Puedes probar eesel gratis.
Preguntas frecuentes
¿Cuál es la mejor IA para soporte telefónico al cliente en 2026?
¿Cuánto cuesta el soporte telefónico con IA por minuto?
¿Puede la IA resolver realmente llamadas de soporte por sí sola?
¿Es mejor la IA de voz o la IA de chat para el soporte al cliente?
¿Qué debería buscar al elegir una IA para soporte telefónico al cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








