
Por qué la voz ha vuelto, y por qué eso importa ahora
Durante casi una década, el consejo razonable era que el soporte telefónico estaba muriendo. No es así. La voz ha vuelto a representar el 40% del volumen de los contact centers y sigue creciendo. El chat, mientras tanto, tiene una tasa de derivación del 32% directamente hacia la voz. Así que el teléfono es donde acaban los contactos difíciles, no los fáciles, lo cual es un problema distinto de la automatización de call centers habitual. También explica por qué la generación anterior de sistemas de llamadas automatizados nunca llegó a hacer mella de verdad.
Ese efecto de selección es todo el problema. Un comentarista de Hacker News lo expresó mejor que cualquier presentación de ventas que haya visto:
"Admiro lo que habéis hecho, pero para una experiencia de lujo, no quiero hablar con una IA que solo me repite lo que ya está en la web. Si he llegado al punto de llamaros, es porque no he podido encontrar la respuesta a mi pregunta en la web."
Todo el que te vende un agente de voz lo entrena con tu centro de ayuda. Y las personas que te llaman son, por definición, aquellas a las que ese centro de ayuda ya ha fallado. Ten esto presente, porque explica la mayoría de los despliegues decepcionantes de los que oigo hablar.
Cómo los elegí, y el benchmark que nadie cita
El 5 de agosto de 2026 revisé la página de precios, la documentación y el centro de ayuda propios de cada proveedor. Después calculé el coste real por minuto, todo incluido, en lugar del anunciado, y comprobé qué hace cada uno en el momento en que el agente no puede completar la tarea. Cuando un proveedor no publica tarifario, lo digo en vez de suponer.
Esta lista es deliberadamente más reducida que mi análisis más amplio de empresas de IA de voz. También adopta un enfoque distinto al del análisis de mejor IA para soporte telefónico, que ordena por tipo de proveedor. Aquí el orden lo dictan las mediciones.
La medición que cambió mi forma de leer toda la categoría es τ-Voice, y no es un benchmark de audio genérico. Una persona que llama simulada telefonea al modelo con un problema real, un cambio de vuelo o un cargo disputado, a veces una avería de telecomunicaciones. La puntuación mide si la base de datos acaba en el estado final correcto. Es decir, puntúa exactamente lo que estás comprando.

La parte alta de esa clasificación resulta aleccionadora:
| Modelo | τ-Voice (escenarios de soporte resueltos) | Comprensión del habla | Tiempo hasta el primer audio | Coste por hora de audio de entrada |
|---|---|---|---|---|
| Grok Voice Think Fast 2.0 High | 56,5% | 97% | 0,70s | $4,80 |
| Qwen Audio 3.0 Realtime Plus | 54,6% | 99% | 4,02s | $4,42 |
| Grok Voice Think Fast 1.0 | 52,1% | 97% | 1,25s | $3,00 |
| GPT-Realtime-2.1 High | 45,7% | 96% | 1,21s | $10,75 |
| GPT-Realtime-2 High | 39,8% | 97% | 1,14s | $4,14 |
| Gemini 3.1 Flash High | 37,7% | 97% | 2,99s | $1,75 |
| Deepslate Opal | 17,5% | 85% | 0,44s | $6,48 |
| GPT Realtime Mini | 15,1% | 64% | 0,81s | $3,04 |
Lee juntas la segunda y la tercera columna. La comprensión del habla está prácticamente resuelta, ya que seis de estos ocho modelos puntúan un 96% o más al entender una pregunta hablada. Después esos mismos modelos se desploman en cuanto tienen que completar la tarea. Entender a quien llama ya no es la parte difícil. Terminar el trabajo, sí lo es.
¿Quieres ver cómo se traduce eso en un entorno de trabajo real y no en un benchmark? La propia documentación de Bland publica una pantalla de analítica de herramientas más honesta que cualquier página de marketing:

408 ejecuciones de herramientas, 142 errores, una tasa de error del 34,8%. El principal culpable es una consulta de calendario que falla 81 veces con "start_time must be in the future". Nada de eso es un problema de voz. El agente entendió perfectamente a quien llamaba, y luego falló la llamada a la herramienta, y ahí es exactamente donde cae la puntuación de τ-Voice.
La latencia dejó de ser el cuello de botella
La categoría sigue vendiéndose en milisegundos. Entiendo por qué, ya que durante años esa fue de verdad la barrera. Ya no lo es, y la clasificación lo muestra con claridad.

Deepslate Opal responde más rápido que nadie en toda la tabla, 0,44 segundos, y resuelve el 17,5% de los escenarios de soporte. Grok Voice Think Fast 2.0 tarda un cuarto de segundo más y resuelve el 56,5%. Nadie cuelga por 260 milisegundos. La gente cuelga porque el agente no pudo hacer aquello para lo que llamaba.
Y lo que los operadores dicen que falla no es en absoluto la lentitud. Es que el agente habla por encima de ellos:
"Es brutal. Estamos perdiendo cerca del 40% de las llamadas en los primeros 30 segundos. Configuración actual: Vapi con detección de fin de turno de GPT-4 a 800ms (su valor por defecto), latencia de red de media entre 120-150ms, el procesamiento añade otros 200-300ms. Lo que he probado: aumentar el umbral de silencio a 1,2s → el bot se siente lento, la gente cree que está roto. Reducirlo a 500ms → ciudad de interrupciones, peor que antes. Añadir «espera a que el cliente termine» al prompt → literalmente ningún efecto."
Eso es la gestión del barge-in (las interrupciones). Un problema de ajuste más que de modelo, y con diferencia la partida peor presupuestada en un despliegue de voz. Un operador que construyó su propia pila cifró ese coste en «200-400ms hasta que ajustas bien los umbrales de detección de turno», y luego avisó de que había que «contar con dos meses de "por qué mi agente habla por encima de quien llama"» antes de llegar a nivel de producción, en este hilo sobre construir frente a comprar.
El relato más completo que encontré vino de alguien con 20 despliegues a sus espaldas. Cubre el barge-in y la transferencia, y también el coste, todo de una vez:
"he desplegado agentes de voz para unos 20 negocios pequeños ya, sobre todo empresas de servicios como fontaneros, dentistas, spas médicos. esto es lo que me he encontrado de verdad en producción: el mayor problema, con diferencia, es la gestión del barge-in. el cliente empieza a hablar mientras el agente todavía está hablando y todo se va al garete. la mayoría de las plataformas lo llevan bien en demos, pero en llamadas reales con ruido de fondo, acentos o gente que habla rápido, se rompe constantemente. tuve que construir umbrales de detección de silencio a medida para cada cliente. lo segundo es la transferencia a un humano. cuando la ia no puede con algo, necesita transferir limpiamente. tanto vapi como retell tienen problemas aquí según la configuración de telefonía. la llamada se cae, o hay un hueco de silencio de 3 segundos que hace que quien llama cuelgue. acabamos construyendo un flujo de transferencia asistida donde el agente pone al día al humano antes de conectar. [...] en cuanto al coste, la mayor sorpresa fue cuánto cuesta cuando las llamadas se alargan. una llamada de 10 minutos puede costar entre 1,50 y 2,00 dólares sumando stt + llm + tts + telefonía. suena poco, pero si gestionas 200 llamadas al día para un cliente, se acumula rápido. tuvimos que construir cortes duros y resúmenes para mantener las llamadas por debajo de 4 minutos."
Merece la pena destacar tres cosas de ahí. Una llamada de diez minutos cuesta de 1,50 a 2,00 dólares, todo incluido, y eso encaja con las cuentas que veremos más abajo, no con ninguna página de inicio. Las demos ocultan los problemas de barge-in, porque quien llama en una demo no tiene acento ni ruido de fondo. Y la solución, tanto para el hueco de la transferencia como para el coste, fue construir algo que la plataforma no ofrecía.
Las cuatro cosas que realmente evalué
- Transferencia a una persona. No si existe. Si es asistida, si entrega un resumen en lugar de una transcripción en bruto, y si todo eso está detrás de un contrato empresarial. Una buena gestión del escalado marca la diferencia entre una desviación y una persona molesta al teléfono.
- Fuentes de conocimiento. Casi todas las herramientas de esta lista ingieren un rastreo de la web pública más archivos subidos. Casi ninguna toca tus tickets pasados ni una wiki con autenticación. Esa diferencia decide cómo gestionará las llamadas que tu centro de ayuda ya falló.
- Pruebas antes del lanzamiento. Una «simulación» que ejecuta escenarios que tú mismo escribiste es una garantía distinta de una que reproduce tu propio historial de llamadas. Exactamente un proveedor de esta lista hace lo segundo. Para la prevención de alucinaciones, eso importa más que cualquier ajuste de guardarraíles.
- Coste real por minuto, telefonía incluida. Nunca el número de la página de inicio. También es el número que decide tu ROI del call center.
Las 9 mejores herramientas de IA para atención al cliente por voz en 2026
| Herramienta | Mejor para | Tarifa real todo incluido | Unidad de facturación | Transferencia a humano | Fuentes de conocimiento | Prueba con tus propias llamadas | Concurrencia | Seguridad | Integraciones con helpdesks |
|---|---|---|---|---|---|---|---|---|---|
| ElevenLabs Agents | Una tarifa previsible | $0,08/min + operador | Por minuto, prepago | Sí, transfer_to_number | Archivos, URLs, RAG en el plan gratuito | No | 4 a 40 según el plan | SOC 2, ISO 42001, PCI DSS L1, BAA en Enterprise | Zendesk, Salesforce |
| Retell AI | Operaciones de soporte sin equipo de desarrollo | ~$0,135/min | Por minuto, ensamblado | Asistida, más toma de control por supervisor | Rastreo de la web, subida de archivos | No | 20 gratis, luego $8/línea/mes | SOC 2 Type II, HIPAA, GDPR | HubSpot, Salesforce; Zendesk "próximamente" |
| Vapi | Controlar toda la pila del modelo | ~$0,105/min | Por minuto, ensamblado | Sí, vía proveedor de telefonía | Solo subida de archivos, recuperación con Gemini | No | 10 gratis, luego $10/línea/mes | HIPAA $2.000/mes, ZDR $1.000/mes | Ninguna preconstruida |
| PolyAI | Un parque CCaaS ya existente | Solo bajo presupuesto | Por minuto | Sí | Documentación e integraciones | No | No publicado | SOC 2 Type 2, ISO 27001, PCI DSS, GDPR, HIPAA de serie | Zendesk Talk vía CCaaS |
| Parloa | Probar contra tu historial de llamadas | Solo bajo presupuesto | Por consumo, según complejidad de la tarea | Sí | Conectores empresariales | Sí, reproduce transcripciones reales | No publicado | ISO 27001, SOC 2 Type 1 y 2, PCI DSS | Zendesk, ServiceNow, Salesforce, Dynamics |
| Sierra | Pagar solo por resoluciones | Solo bajo presupuesto | Por conversación resuelta | Sí, preservando el contexto | Conectores empresariales | Simulaciones de voz | No publicado | SOC 2, ISO 27001, ISO 42001, HIPAA, PCI DSS, FedRAMP | No publicado |
| Bland AI | Alta concurrencia y autoalojamiento | $0,11 a $0,14/min | Por minuto + cuota de plataforma | Solo Enterprise | Archivos, texto, web pública | No | 10 a 100, Enterprise hasta 1M | SLA del 99,9% en todos los planes, BAA en Enterprise | Ninguna |
| Synthflow | Un despliegue nativo de Freshworks | ~$2.500/mes de suelo | Por segundo, agregado | Fría, asistida, asistida con resumen | PDFs, URLs, rastreo, importación desde Zendesk | Test Center, facturable | Según contrato | SOC 2, GDPR, ISO 27001 | Freshworks (Freshcaller) |
| Grok Voice Agent Builder | El modelo capaz más rápido | $0,08/min + $0,01 por número | Por minuto, pago por uso | Vía llamadas a herramientas | Colecciones, búsqueda en archivos y en la web | No | 10 sesiones por equipo | No publicado para voz | Ninguna |
Nueve herramientas y cuatro formas distintas de cobrar. Solo una te deja probar contra tu propio archivo de llamadas, y esa es la columna que yo capturaría en pantalla.
Antes de las reseñas individuales, unas cuentas. Las tarifas anunciadas no son comparables entre sí, y la diferencia es lo bastante grande como para cambiar tu lista de finalistas.
1. ElevenLabs Agents
Mejor para: equipos que necesitan prever la factura hasta el céntimo antes de comprometerse.
ElevenLabs es más conocida por la conversión de texto a voz. La plataforma Agents es la capa conversacional que se apoya sobre eso, y ya ha lanzado más de 4 millones de agentes. La razón por la que encabeza esta lista es aburrida: es el único proveedor de esta lista cuyas cuentas de precios cuadran.

Merece la pena detenerse en ese panel. Es el único lugar de todo este análisis en el que un proveedor muestra sus propias cifras sin editar: 75,1% de tasa de éxito global, 3,5 estrellas de CSAT medio. Un despliegue con pinta realista, en otras palabras, no una promesa del 95%.
Lo que hace en realidad
La telefonía sobre SIP está incluida en todos los planes en lugar de estar restringida, algo poco habitual. Las bases de conocimiento y el RAG funcionan incluso en el plan gratuito. Llamadas a herramientas, llamadas por lotes, un servidor MCP alojado para la gestión de agentes, una CLI: todo está ahí. Las integraciones con nombre propio cubren Genesys y Amazon Connect en el lado de la telefonía. Para ticketing son Zendesk y Salesforce, los dos únicos sistemas de tickets con páginas reales.
Hay dos cosas que conviene saber antes de construir. Sus propias páginas no coinciden en cuanto a idiomas, listando más de 70 en el catálogo de voces frente a 31 que un agente puede configurarse realmente para hablar. En segundo lugar, no existe una cifra publicada de latencia de ida y vuelta para un agente, solo cifras por componente para Flash v2.5, en torno a 75ms, y Scribe v2 Realtime, en torno a 150ms. Ninguna de las dos es lo mismo que lo que oye quien llama.
Precios
| Plan | Mensual | Minutos incluidos | $/min efectivo | Exceso | Ráfaga | Llamadas concurrentes |
|---|---|---|---|---|---|---|
| Free | $0 | 15 | n/a | $0,08 | $0,16 | 4 |
| Starter | $6 | 75 | $0,0800 | $0,08 | $0,16 | 6 |
| Creator | $22 (primer mes $11) | 275 | $0,0800 | $0,08 | $0,16 | 10 |
| Pro | $99 | 1.238 | $0,0800 | $0,08 | $0,16 | 20 |
| Scale | $299 | 3.738 | $0,0800 | $0,08 | $0,16 | 30 |
| Business | $990 | 12.375 | $0,0800 | $0,08 | $0,16 | 40 |
| Enterprise | A medida | A medida | Negociable | Negociable | n/a | Elevada |
Fíjate en esa columna de coste efectivo. Todos los planes de pago se reducen exactamente a $0,08. Business cuesta $990 por 12.375 minutos, y 12.375 × $0,08 son exactamente $990,00. Así que las asignaciones de minutos se han diseñado a partir del precio, lo que significa que no hay descuento por volumen en ningún plan. Los mensajes de texto cuestan $0,003 cada uno, y la telefonía del operador se factura "al coste" aparte.
Ventajas
- El único coste por minuto de todo este análisis que se puede prever de verdad.
- El uso de tu propia troncal SIP no está restringido a Enterprise, así que funciona incluso en un plan de $6.
- Una lista de cumplimiento seria: ISO 42001, AIUC-1, PCI DSS Level 1.
- Las bases de conocimiento y el RAG funcionan en el plan gratuito, así que probar bien no cuesta nada.
Inconvenientes
- Nunca hay descuento por volumen. A 50.000 minutos pagas la misma tarifa que a 75.
- Los minutos son de prepago en lugar de pago por uso, así que un volumen irregular significa pagar por margen que desperdicias.
- El BAA para HIPAA está detrás de Enterprise, y también el SSO y las condiciones del SLA.
- Los operadores informan de que la herramienta
transfer_to_numberfalla al completar la transferencia, algo discutido en detalle en este hilo de r/ElevenLabs.
Mi valoración: empieza aquí si tu volumen es predecible y quieres una cifra que tu equipo financiero acepte. Aun así, la tarifa fija corta en ambos sentidos. ¿Vas camino de superar los 20.000 minutos al mes? Consigue un presupuesto empresarial antes de comprometerte, porque aquí no hay curva de descuento en la que crecer. Desgloso los planes con más detalle en mi guía de precios de ElevenLabs, y las opciones de cambio en alternativas a ElevenLabs.
2. Retell AI
Mejor para: operaciones de soporte que quieren analítica de llamadas y un escalado limpio, sin contratar a un ingeniero.
Retell AI es el que pondría delante de un responsable de soporte antes que de un desarrollador. Su transparencia de costes llega a un grado casi incómodo. También es el único proveedor de esta lista cuyas propias preguntas frecuentes responden a "¿puede la IA sustituir a los agentes de call center?" con un rotundo "No." Eso me merece más respeto que cualquier promesa de contención de esta página.

Fíjate en el tercer panel. El mensaje de bienvenida está configurado como "User Initiates: AI remains silent until users speak first" (el usuario inicia: la IA permanece en silencio hasta que el usuario habla primero). Un ajuste pequeño, con un gran efecto en cómo se sienten los primeros tres segundos de una llamada de soporte.
Lo que hace en realidad
La capa de escalado es lo más fuerte. Transferencia asistida, navegación por IVR y captura de DTMF conviven bajo un único nodo de transferencia de llamada, mientras que la monitorización en directo permite a un supervisor escuchar o tomar el control de la llamada por completo. Mejor aún: la cuota de IA se detiene en el momento de la transferencia, así que solo sigue corriendo la telefonía. El incentivo correcto, y casi nadie más lo hace.
El análisis posterior a la llamada, las transcripciones, los webhooks y la API están todos disponibles en el plan gratuito de pago por uso, así que puedes probarlo de verdad. Un cliente de referencia, Medical Data Systems, publica una tasa de transferencia del 30%. Aproximadamente un 70% de contención en un despliegue real, entonces.
La base de conocimiento es un rastreo de la web más subida de archivos. No hay ingesta documentada de tu historial de tickets, y la simulación ejecuta casos de prueba puntuados que tú mismo escribes en lugar de una reproducción de tu propio archivo de llamadas.
Precios
| Componente | Tarifa | Notas |
|---|---|---|
| Infraestructura de voz de Retell | $0,055/min | Ineludible. El reconocimiento de voz se absorbe aquí. |
| Texto a voz | $0,015/min | $0,040/min si eliges voces de ElevenLabs |
| LLM | $0,003 a $0,32/min | GPT 5 nano en el suelo, GPT 5.5 Fast en el techo |
| Telefonía | $0,015/min gestionada | $0 con tu propia troncal SIP |
| Base de conocimiento | +$0,005/min | Más $8/mes por base a partir de la décima |
| Guardarraíles | +$0,005/min | La eliminación de PII es un +$0,01/min aparte |
| Control de calidad de llamadas por IA | $0,10/min | Los primeros 100 minutos son gratis |
| Concurrencia | $8/llamada/mes | Las primeras 20 líneas están incluidas |
El rango anunciado es de $0,07 a $0,31 por minuto, con $10 de crédito gratis y sin cuota de plataforma. La propia calculadora de Retell muestra por defecto $0,115/min, salvo que pone a cero la telefonía y todos los complementos. Construye algo realista para soporte entrante, GPT 4.1 con la voz propia de Retell, un número gestionado en EE. UU., la base de conocimiento activada, y llegas a $0,135/min. Eso son $677 al mes a 5.000 minutos. Activa el control de calidad de llamadas por IA en todo tu tráfico y añade unos $490 al mes, un salto del 74%.
Ventajas
- La mejor propuesta de transferencia a humano de todo este análisis, y el contador se detiene en el momento en que se activa.
- Los supervisores pueden escuchar una llamada en directo, o tomar el control.
- Transparencia de costes hasta el nivel de una tarifa por componente.
- SOC 2 Type II, HIPAA y GDPR vienen incluidos en toda la plataforma en lugar de restringidos por plan.
Inconvenientes
- Zendesk está marcado como "próximamente" en lugar de ya disponible. Los conectores en vivo se quedan en Cal.com, HubSpot y Salesforce, y en ningún lugar de la documentación hay integración con Freshdesk, Gorgias, Front o Help Scout.
- La cifra de latencia de ~600ms se atribuye a "benchmarks independientes", que nunca se nombran ni se enlazan.
- Ninguna de las dos páginas publica un número de idiomas ni un porcentaje de SLA de disponibilidad.
- La opción de voz a voz cuesta $0,345/min, por encima del propio techo declarado de $0,31 de Retell.
Mi valoración: la opción más sólida en general para un equipo de soporte, con una gran salvedad. Si usas Zendesk o Freshdesk, deberías presupuestar construir tú mismo el traspaso de tickets, vía webhooks. Fíjate a quién pone Retell en el escaparate de sus propias integraciones: plataformas CCaaS, Genesys, Five9 y Avaya. Eso te dice para quién se construyó. Mi desglose de precios de Retell AI va componente por componente si quieres modelar tu propia configuración.
3. Vapi
Mejor para: equipos de ingeniería que quieren elegir ellos mismos cada componente de la pila.
Vapi es infraestructura, no un producto. Tú ensamblas el transporte y el reconocimiento de voz, el modelo, la voz, todo tú mismo, y Vapi cobra $0,05 por minuto por orquestar el resultado. Si te resulta atractivo cambiar Deepgram por Assembly a las 3 de la madrugada, esta es tu opción.

Esa fila de chips de proveedores es todo el producto en una sola captura. Cada chip es también una línea distinta en tu factura.
Lo que hace en realidad
Squads y workflows, llamadas a herramientas, observabilidad, un conjunto de evaluación de verdad. Traer tu propio SIP sobre la troncal propia de Vapi no cuesta nada, lo cual es una palanca de coste real. Diez llamadas concurrentes vienen incluidas, y las líneas extra cuestan $10 cada una al mes.
Hay una fecha límite estricta que conviene conocer: el constructor visual de Workflows deja de funcionar el 19 de agosto de 2026, dentro de dos semanas. El motivo declarado por Vapi es que la IA actual no puede actuar de forma fiable como agentes autónomos de grafo de nodos, y que Squads "llevó de forma consistente a mejores resultados". Así que cualquier construcción de soporte con Vapi anterior a mediados de 2026 necesita migrarse ya. Vapi también advierte de que su migración asistida por IA no está garantizada como correcta o completa.
Precios
| Componente | Tarifa | Notas |
|---|---|---|
| Orquestación de Vapi | $0,05/min | Más $0,005 por mensaje de chat SMS |
| Transporte | Gratis a $0,014/min | SIP y WebRTC de Vapi gratis; salida Twilio $0,014 |
| Reconocimiento de voz | $0,000631 a $0,01733/min | Google en el suelo, Speechmatics en el techo |
| Texto a voz | $0,002 a $0,24/min | Inworld en el suelo, Tavus en el techo |
| LLM | $0,01 a $2,12 por 1M | 4.1-mini en el suelo, 4.5 Preview en el techo |
| HIPAA | $2.000/mes | La retención cero de datos es un $1.000/mes aparte |
Ensambla algo realista, Vapi más entrada de Twilio más Deepgram más ElevenLabs más un modelo barato, y sale a aproximadamente $0,105/min. Eso son $0,63 por una llamada de seis minutos. También merece la pena notarlo: la propia cuota de Vapi supone el 48% de un minuto realista y el 91% del más barato posible. Las condiciones Enterprise empiezan en 400.000 minutos al año.
Ventajas
- Control total sobre cada componente, y un tarifario publicado para cada uno.
- El transporte es gratis con SIP o WebRTC de Vapi.
- El suelo más barato de este análisis, en torno a $0,055/min, si optimizas mucho para conseguirlo.
- Herramientas de observabilidad y evaluación realmente buenas.
Inconvenientes
- Las pruebas se facturan a tarifa de producción. Directo de las propias preguntas frecuentes de Vapi: "¿Son gratis las pruebas? No, las llamadas de prueba cuestan lo mismo que las llamadas normales."
- La base de conocimiento es solo subida de archivos, la recuperación es exclusiva de Gemini, no hay rastreo de centro de ayuda, y el límite recomendado está por debajo de 300KB por archivo.
- Cero integraciones de ticketing en el catálogo de herramientas. Leer o escribir un ticket es un
apiRequestque construyes tú. - Según la propia página de metodología de Vapi, el titular de "latencia por debajo de 500ms" excluye el endpointing y el transporte, y esa misma página reconoce que el endpointing puede suponer una parte considerable del retraso.
Mi valoración: la opción correcta si tienes ingenieros y quieres el suelo de coste. La equivocada si quieres algo que responda llamadas la semana que viene. En cualquier caso, haz la migración de Workflows antes del plazo de agosto. Hay más sobre la forma de la plataforma en mi reseña de Vapi.
4. PolyAI
Mejor para: un contact center consolidado que ya funciona con Genesys, Avaya o Amazon Connect.
PolyAI vende a contact centers, no a desarrolladores, y la lista de integraciones lo delata. Genesys, Avaya, Amazon Connect, Twilio, Five9, NICE, Talkdesk, Cisco, RingCentral, Zendesk Talk: todo compatible. Así que encaja en un parque que ya tienes en lugar de pedirte que lo sustituyas.

La lista de plantillas dice mucho sobre para quién es esto. "Gestionar transferencias de llamadas a un agente humano" aparece como plantilla inicial en lugar de tema avanzado. El instinto correcto.
Lo que hace en realidad
Agent Studio es la superficie de construcción, con un punto de entrada de autoservicio en studio.poly.ai. Los plazos de despliegue publicados en toda la web van desde menos de diez minutos para autoservicio hasta unas ocho semanas para un despliegue de Amazon Connect, así que toma la cifra rápida con cautela. El soporte de idiomas es de 42 o 45, según qué página de PolyAI leas.
La postura de seguridad es la mejor documentada aquí, y de forma poco habitual no está restringida por plan. SOC 2 Type 2, ISO 27001, PCI DSS, GDPR y HIPAA se describen todos como estándar y "integrados en la arquitectura", con certificación AWS FTR también en la página de socio de Amazon Connect. Todo despliegue de pago incluye además un SLA de disponibilidad del 99,9% en las líneas telefónicas más una línea de soporte de emergencia 24/7/365. Eso no es una nota a pie de página cuando lo que responde tu teléfono se rompe a las 2 de la madrugada.
Precios
No publicados. La página de precios se titula "Precios simples que escalan" y promete una estructura transparente, y luego te muestra un formulario de captación de contactos organizado por volumen anual de llamadas, desde menos de 10.000 hasta más de 1.000.000. No aparece ninguna cifra en dólares en ninguna propiedad de PolyAI. Tampoco hay compromiso mínimo.
Al menos la unidad de facturación está clara, en palabras de la propia PolyAI: el uso continuado "se cobra por minuto, lo que incluye mejoras proactivas de rendimiento, mantenimiento y soporte 24/7."
Ventajas
- La lista de integraciones CCaaS más profunda de aquí, así que encaja en un parque que ya operas.
- Certificaciones de seguridad en todos los niveles en lugar de restringidas a un plan empresarial.
- La tarifa por minuto incluye un SLA del 99,9% en la línea telefónica y una línea de emergencia 24/7.
- Resultados de clientes publicados en una amplia variedad de despliegues.
Inconvenientes
- Sin precio publicado. La página de precios se autodenomina transparente mientras te muestra un formulario.
- Las cifras de contención varían muchísimo según el caso de uso: 70% de las llamadas de huéspedes en una cadena de pubs del Reino Unido, luego 34% en reservas de Golden Nugget y 30% en un banco minorista sin nombrar. Las cifras de restauración no son una guía justa para una cola de soporte.
- El sitio se contradice a sí mismo dos veces, en el número de idiomas y en el plazo de despliegue.
- Cada estadística destacada del sitio es un contador animado en el navegador, lo que dificulta verificar las cifras de forma independiente.
Mi valoración: si ya tienes una plataforma CCaaS, PolyAI probablemente sea tu camino más corto hacia un agente de voz funcionando, y el SLA incluido se lo gana. Una cosa en la que insistir: cifras de contención de un despliegue de soporte, no de reservas. La diferencia publicada entre ambos es más del doble. Para más contexto sobre la categoría en la que se sitúa, tengo mi introducción a la IA conversacional para atención al cliente.
5. Parloa
Mejor para: cualquiera que quiera que el agente se pruebe contra sus propias llamadas históricas antes de responder a una real.
Parloa es la apuesta europea de nivel empresarial. Levantó 350M$ con una valoración de 3.000M$ en enero de 2026 y ha superado los 50M$+ de ARR con una retención neta de ingresos del 150%, con un total captado que ya supera los 560M$ en menos de cuatro años. Entre sus clientes están Allianz, Booking.com, IKEA y SAP.
Parloa no publica capturas de producto en ningún sitio, así que lo que sigue es su propia diapositiva de arquitectura y no una captura de la interfaz. Normalmente trato eso como un punto en contra de un proveedor. En este caso, la diapositiva dice justo lo importante en voz alta.

La segunda etapa de ese ciclo es "probar e iterar", con el mismo peso que desplegar y monitorizar. Todos los demás proveedores de esta lista tratan las pruebas como una función. Parloa construyó una empresa alrededor de eso.
Lo que hace en realidad
El entorno de simulación es la razón por la que Parloa está en esta lista. También es la única función de todo este análisis a la que llamaría un diferenciador real. Ejecuta miles de conversaciones simuladas a través de escenarios, idiomas, canales y casos límite, y lo crítico es que combina tus transcripciones históricas reales con pruebas sintéticas en lugar de ejecutar solo escenarios que alguien escribió a mano. Prueba la ambigüedad y las llamadas a herramientas, el fallback, la consistencia de marca. Aísla subtareas, y cambia entre staging y producción.
Puntuaciones de evaluación con LLM-como-juez y criterios basados en reglas, sobre el éxito de la tarea, el tono, la precisión, el comportamiento de la API. Después, trazabilidad de la causa raíz, con recomendaciones de corrección a nivel de línea aplicadas dentro de la plataforma. Este es el mecanismo que desearía que tuviera cada proveedor de esta lista. También es el mismo principio que aplicamos al texto: un bot que solo se ha probado con preguntas que tú mismo inventaste no te enseña nada útil.
Las integraciones cubren Avaya, Five9, Genesys, NICE, Twilio, Verint, Salesforce, Dynamics, ServiceNow, Zendesk y SAP, además de SIP. Más de 130 idiomas en más de 70 países, aunque no se publica ninguna lista en ningún sitio. La afirmación sobre residencia de datos viene con un lenguaje más estricto de lo habitual, que el enrutamiento en tiempo de ejecución mantiene el procesamiento dentro de la jurisdicción durante la interacción y no solo en reposo, pero el detalle está detrás de un centro de confianza con acceso restringido.
Precios
No publicados, y la URL de precios da error 404. La única señal real está en las propias preguntas frecuentes de Parloa, que describen un "modelo de precios basado en consumo que vincula los costes a la complejidad y el esfuerzo de la tarea, no tarifas fijas ni recuento de tokens", presupuestado según el volumen, los casos de uso y el valor de negocio. No se publica mínimo, ni plan gratuito, ni prueba.
Ventajas
- La única herramienta aquí que reproduce tu historial real de llamadas en la simulación.
- Trazabilidad de la causa raíz, con las correcciones aplicadas dentro de la plataforma.
- Una postura europea real, construida sobre Azure, con enrutamiento en tiempo de ejecución dentro de la jurisdicción.
- Las certificaciones son ISO 27001:2022, SOC 2 Type 1 y Type 2, y PCI DSS.
Inconvenientes
- Ningún precio publicado de ningún tipo. El consumo "según complejidad de la tarea" es también la unidad más difícil de prever aquí.
- HIPAA, GDPR y DORA se describen como "alineado con" en lugar de certificado. Esa es la propia redacción de Parloa, y merece la pena leerla con precisión.
- Los porcentajes de clientes en la página de inicio son contadores animados con JS, así que las cifras reales están en las páginas de casos de estudio.
- Amazon Connect no aparece en ninguna lista de integraciones publicada de Parloa, así que no lo des por hecho.
Mi valoración: si eres un comprador empresarial con solo una pregunta que hacerle a un proveedor, pregunta si su simulación reproduce tus propias llamadas. Parloa es el único aquí que responde que sí. Esa única capacidad vale más que un punto porcentual de contención en el benchmark de otro. Mi reseña de Parloa tiene más sobre la plataforma, y precios de Parloa cubre lo que se sabe del lado comercial.
6. Sierra
Mejor para: soporte de alto valor donde pagar por resolución supera a pagar por minuto.
Sierra levantó 950M$ con una valoración de más de 15.000M$ en mayo de 2026, y dice atender a más del 40% del Fortune 50. El producto de voz cubre más de 55 idiomas con cambio a mitad de conversación, enrutamiento del modelo por turno y escalado que preserva el contexto. También acepta pagos por voz, tarjeta y ACH vía tonos DTMF, a través de infraestructura conforme con PCI de Nivel 1.

Eso es una llamada de demostración y no una captura de consola, y es lo máximo que puedo mostrarte. Todos los elementos visuales de la página de voz de Sierra son pósteres de vídeo, sin ninguna captura completa de producto publicada en ningún sitio.
Sierra también merece una mención por algo distinto de su producto. Publica la investigación de τ-voice que replanteó todo este artículo. Sus propios hallazgos: la frontera pasó del 30,4% al 67,3% de pass@1 entre agosto de 2025 y abril de 2026, frente a un techo de razonamiento en texto cercano al 85%. Todos los proveedores pierden entre 5 y 14 puntos con audio telefónico realista. Y el 79% de los primeros errores críticos son responsabilidad del propio agente. Un proveedor que publica las cifras que hacen ver difícil a su propia categoría es una buena señal.
Lo que hace en realidad
Comercialmente, lo distintivo es el precio por resultado. El propio planteamiento de Sierra es "Paga por un trabajo bien hecho", con la unidad ligada a "una conversación de soporte resuelta, una cancelación evitada, una venta adicional, una venta cruzada", y "si la conversación no se resuelve, en la mayoría de los casos, no hay cargo." La versión más breve que dan: "Sierra cobra solo cuando completamos una tarea para ti."
Aun así, lee las matizaciones con atención, porque son lo que importa en el momento del contrato. Las escaladas no se facturan "en la mayoría de los casos", y las excepciones no se publican. La factura real es mixta, porque Sierra dice que "las interacciones de enrutamiento o de mera recepción pueden encajar mejor con un precio basado en consumo, donde el pago se basa en el número de conversaciones, independientemente del resultado." Y luego está "resuelto", que aquí no tiene una definición universal. Los criterios se acuerdan por contrato.
Precios
No hay página de precios en absoluto. sierra.ai/pricing devuelve un 404 rotundo, y no aparece ninguna cifra en dólares en ningún sitio: ni tarifa por resultado, ni cuota de configuración, ni mínimo, ni prueba. Nunca se menciona una cuota de plataforma. Tampoco se niega, así que no des por hecho que no existe.
Ventajas
- El modelo de facturación encaja con lo que realmente quieres, que son resoluciones y no tiempo al aire.
- La lista de certificaciones más amplia de aquí: SOC 2, ISO 27001, ISO 42001, HIPAA, GDPR, EU AI Act, FedRAMP y PCI DSS.
- Más de 55 idiomas, y cambia a mitad de conversación.
- Publica investigación honesta sobre los límites de su propia categoría.
Inconvenientes
- Cero precios publicados, así que compararlo con cualquier cosa significa entrar primero en un ciclo de ventas.
- Las insignias de certificación no llevan fechas de auditoría, ni distinción entre SOC 2 Type I/II, ni nivel de autorización FedRAMP.
- Los clientes de voz nombrados se quedan en Rocket Mortgage, Guild y Next, y no se publica ninguna cifra de contención, resolución o tiempo de gestión para ninguno de ellos.
- No hay cifra de latencia de voz publicada. Esos 200ms que aparecen en el artículo de τ-voice son la granularidad del fragmento de audio del benchmark y no el tiempo de respuesta del agente, así que no lo cites como tal.
Mi valoración: el precio por resultado se vuelve más atractivo cuanto peor sea tu tasa de contención, y eso es un alineamiento inteligente. Solo entra a negociar sabiendo que eres tú quien define la unidad facturable. Deja por escrito qué escaladas cuentan como las excepciones a "en la mayoría de los casos". Profundizo en el modelo en precios de Sierra AI, y en el conjunto competitivo en alternativas a Sierra.
7. Bland AI
Mejor para: alta concurrencia, o un despliegue que tiene que vivir dentro de tu propia nube.
Bland AI publica la escala de planes más clara de aquí, además del techo de concurrencia más alto por un margen amplio. Su índice de documentación cita soporte Enterprise para "hasta 1 millón de llamadas concurrentes". Nadie más en esta lista se acerca a esa cifra.

Esta es la imagen más clara de lo que significa "probar" en toda la categoría. El panel de la derecha ejecuta una prueba "Angry Caller" al 94% y una puerta "Happy Path" al 100%. Ambas son personajes que alguien escribió. Útil. Aun así, no es tu historial de llamadas.
Lo que hace en realidad
Flujos conversacionales (Pathways), llamadas a herramientas y a la API, y luego tres posturas de alojamiento publicadas: Bland Cloud, tu propia VPC en AWS, GCP o Azure, o completamente on-premise y air-gapped. No hay cifras en dólares asociadas a ninguna de ellas. Tampoco se publica ningún incremento o mínimo, ya que todo eso vive dentro del contrato Enterprise.
Nuevo desde la última vez que lo revisé: una cifra de latencia real. La página de inicio ahora muestra 400ms frente a un supuesto "promedio de la industria" de 1.240ms, la documentación dice por debajo de 400ms, y la página de producto muestra cifras p50 de 380ms y 365ms. Esa comparación de 1.240ms no tiene fuente. Trátala como marketing, no como medición.
Hay una trampa de redacción. La página de producto anuncia la capacidad de "hacer backtesting contra llamadas históricas", mientras que el mecanismo documentado de Scenarios es un llamante simulado que sigue un prompt de personaje que tú escribes. Es una garantía distinta a reproducir tu propio archivo, y merece la pena preguntarlo directamente.
Precios
| Start | Build | Scale | Enterprise | |
|---|---|---|---|---|
| Tiempo de conversación | $0,14/min | $0,12/min | $0,11/min | A medida |
| Cuota de plataforma | $0 | $299/mes | $499/mes | Contratada |
| Tiempo de transferencia | $0,05/min | $0,04/min | $0,03/min | A medida |
| Llamadas concurrentes | 10 | 50 | 100 | Dimensionada al volumen |
| Límite diario / por hora | 100 / 100 | 2.000 / 1.000 | 5.000 / 1.000 | Ilimitado |
| Bases de conocimiento / voces | 10 / 1 | 50 / 5 | 100 / 15 | Ilimitado |
| SLA de disponibilidad | 99,9% | 99,9% | 99,9% | 99,9% |
Los puntos de cruce son lo bastante contraintuitivos como para merecer conocerse. Build solo supera a Start por encima de 14.950 minutos al mes, y Scale solo supera a Build por encima de 20.000. Por debajo de unos 15.000 minutos, el plan gratuito Start es aritméticamente el más barato. Aquí subes de plan por la concurrencia, no por la tarifa.
Ventajas
- Un SLA de disponibilidad del 99,9% en todos los planes, incluido el gratuito, algo que nadie más aquí ofrece.
- El autoalojamiento en tu propia VPC, o air-gapped on-premise, es una opción publicada.
- El techo de concurrencia es el más alto de todo este análisis.
- Trae tu propia troncal y el cargo por minuto de transferencia desaparece por completo.
Inconvenientes
- El directorio de integraciones tiene 19 conectores en 7 categorías y cero sistemas de helpdesk o ticketing, a pesar de que el texto del producto afirma tener soporte de ticketing. Llevar una llamada a Zendesk o Front implica una herramienta a medida, o un webhook posterior a la llamada que construyes tú.
- La transferencia asistida es solo para Enterprise, y la documentación lo declara sin rodeos. Los despliegues autoservicio son solo de transferencia fría, sin citas de respuesta.
- Las citas y los informes de vacíos en la base de conocimiento, los resultados, los guardarraíles, las alertas, el SMS, el chat web, el BAA: todo eso también está detrás de Enterprise.
- La página de precios dice que la telefonía se factura por separado al coste de traspaso. Las preguntas frecuentes de la página de inicio y la documentación dicen que la tarifa por minuto la cubre. Consigue eso por escrito.
Mi valoración: Bland es una plataforma de voz más que un producto de soporte, y sus principales pruebas destacadas generan ingresos en lugar de ahorrar costes. Elígela por la concurrencia, o por un requisito de alojamiento en el que tu equipo de seguridad no va a ceder. ¿La compras para responder llamadas de soporte? Cotiza el plan Enterprise desde el principio, porque las funciones que necesitas viven todas ahí arriba. Y si la gestión de tickets es el objetivo real, una de las herramientas de automatización de soporte de mi análisis más amplio encaja mejor.
8. Synthflow
Mejor para: una empresa con Freshworks que quiere su IA de voz dentro de Freshcaller.

Antes de la reseña, fíjate en ese panel abierto, porque es la captura más útil de todo este artículo. Muestra una búsqueda real en la base de conocimiento en mitad de una llamada. Quien llamaba dijo algo como "tengo pero me gustaría saber cómo usar el producto", el agente lo reescribió como una búsqueda, y volvieron 7 resultados en 756ms con una mejor puntuación de similitud de 0,80, frente a un similarity_threshold de 0. Ese umbral es el mando que decide si tu agente responde desde una coincidencia débil o admite que no lo sabe. Casi ningún proveedor te lo muestra.
Todo el mundo sigue describiendo a Synthflow como la vía de entrada sencilla sin código. A partir de este mes, eso está desactualizado. La escala de autoservicio ha desaparecido, y la documentación lo confirma: los antiguos planes Pro, Growth y Agency "ya no están disponibles para nuevas suscripciones y se mantienen para los clientes existentes." Lo que queda es un producto empresarial de un único plan y guiado por ventas.
Lo que hace en realidad
La transferencia a humano es la función de soporte más fuerte aquí, en tres modos: fría, asistida con mensaje, asistida con resumen. Hay detección de humano con un tiempo de espera de 30 segundos a 30 minutos, filtrado de llamadas, un horario laboral. La documentación también es directa de una forma que aprecio: que "las transferencias frías no pueden recuperarse de los fallos."
Las fuentes de conocimiento son PDFs, documentos escritos, URLs individuales, rastreos de web pública y una importación del centro de ayuda de Zendesk. No hay fuentes autenticadas, ni ingesta de tickets pasados, ni clasificación manual de documentos. En integraciones, la afirmación de "200+" se reduce a unos 15 conectores documentados, y la única integración profunda con la pila de soporte entre ellos es Freshworks: IA de voz corriendo dentro de Freshcaller, con un 65% de las solicitudes de voz rutinarias automatizadas. Esa es la razón para comprarla.
El detalle de la medición se publica con mucha más precisión que las tarifas, una combinación rara pero útil. La facturación es por segundo y se agrega entre llamadas, así que 125 segundos de llamadas equivalen a 2 minutos facturables en lugar de 4. Una transferencia exitosa detiene el contador. Un no-answer o un cuelgue de buzón de voz factura un fijo de 5 segundos. El chat se convierte a razón de 5 mensajes de IA por 1 minuto de voz. Y las simulaciones de Test Center pueden ser facturables.
Precios
| Plan | Mensual | Minutos incluidos | Exceso | Llamadas concurrentes |
|---|---|---|---|---|
| Enterprise (el único plan que se vende) | Sin precio de lista; los contratos empiezan en $30.000/año, unos $2.500/mes | No publicado, según el acuerdo | A medida, según tu acuerdo | "Según lo acordado con Synthflow" |
| Pro / Growth / Agency (heredado) | Cerrado a nuevos clientes | Solo dentro del producto | Solo dentro del producto | Mostrado en las condiciones de tu cuenta |
| Prueba gratuita | Sin proceso de compra autoservicio. Ambas llamadas a la acción son contactar con ventas | n/a | n/a | n/a |
El coste efectivo por minuto incluido es imposible de calcular en cualquier plan, porque Synthflow nunca publica un precio y una asignación de minutos en la misma fila. La única cifra pública defendible es ese suelo equivalente a $2.500 al mes, frente a una asignación que nadie fuera del contrato conoce. Cualquier cifra por minuto que aún circule se remonta a la escala ya retirada.
Ventajas
- Tres modos de transferencia distintos. Asistida con resumen es el que de verdad ayuda a la persona.
- La facturación por segundo, agregada entre llamadas, es la medición más justa de aquí.
- Una transferencia exitosa detiene el contador.
- Una integración profunda con Freshworks, con una cifra publicada de automatización del 65% para solicitudes de voz rutinarias.
Inconvenientes
- Ese suelo de $30.000/año lo convierte en la opción más cara de aquí en cualquier volumen por debajo de unos 20.000 minutos al mes.
- Ya no hay ninguna cifra de concurrencia publicada en ningún plan.
- Hay un conflicto sobre HIPAA en su propio sitio. La página de inicio afirma certificación en SOC 2, HIPAA, PCI DSS y GDPR, mientras que la fila de cumplimiento del documento Enterprise lista solo SOC 2, GDPR e ISO 27001. No des por hecho que hay un BAA.
- La latencia es un objetivo y no una medición, expresada como "aspiramos a" un tiempo de ida y vuelta por debajo de 100ms. La reventa desaparece el 15 de septiembre de 2026, y los servidores de telefonía en la UE están "muy próximos".
Mi valoración: la reputación de sin código ya no encaja con el tarifario, así que ignora cualquier análisis que todavía la llame la opción barata para empezar, incluidos los nuestros más antiguos. Si usas Freshworks, es un encaje sólido y nativo. Si no, la integración con Freshcaller es lo principal por lo que estarías pagando ese suelo, y una herramienta general de automatización de atención al cliente cuesta mucho menos.
9. Grok Voice Agent Builder
Mejor para: el modelo más rápido de verdad capaz, si los límites de sesión no te lo impiden.
El Grok Voice Agent Builder de xAI funciona sobre Grok Voice Think Fast 2.0, que encabeza la tabla de τ-Voice con un 56,5% y responde en 0,70 segundos. Esa combinación es toda la propuesta. En el benchmark, se sostiene.
No hay captura de producto en esta sección porque xAI no publica ninguna, y las URLs de documentación de Voice Agent Builder dan actualmente 404. Lo que xAI sí publica es un cambio de precios que entra en vigor hoy mismo. Si ya tienes Grok voice en producción, eso es lo más consecuente de toda esta página.

Lo que hace en realidad
Es compatible a nivel de protocolo con la API Realtime de OpenAI en wss://api.x.ai/v1/realtime, así que migrar una construcción realtime existente es sobre todo un cambio de URL. Las herramientas cubren funciones, búsqueda de archivos, búsqueda web, búsqueda en X y MCP. Las extensiones con forma de cumplimiento normativo son la parte útil: force_message pronuncia una línea literal para avisos legales, replace mapea pronunciaciones sin cambiar la transcripción, keyterms acepta hasta 100 términos de 50 caracteres cada uno, resumption reproduce turnos al reconectar. Un número de teléfono aprovisionado añade $0,01 por minuto.
Merece la pena señalar en el lado de la precisión: la transcripción es 1,4 veces mejor en tasa de error de palabras que la versión 1.0, de 1,5 a 2,0 veces mejor que Deepgram Nova 3 y ElevenLabs Scribe v2 en 24 idiomas, y aproximadamente 10 veces mejor en audio telefónico con ruido. El ruido de fondo y los acentos son exactamente lo que los operadores reportan que rompe sus agentes, así que esa cifra es más relevante para ti que el benchmark destacado.
Precios
| Elemento | Tarifa |
|---|---|
| Grok Voice Think Fast 2.0 | $0,08/min ($4,80/h) |
| Grok Voice Think Fast 1.0 | $0,05/min ($3,00/h) |
| Entrada de texto | $0,004 por elemento de conversación |
| Número aprovisionado | +$0,01/min |
web_search / x_search | $5 por 1.000 invocaciones |
file_search (colecciones) | $2,50 por 1.000 |
attachment_search | $10 por 1.000 |
Hoy es el día en que esto se ha vuelto más caro. El 5 de agosto de 2026 el alias grok-voice-latest pasa de apuntar de 1.0 a 2.0, así que la ruta por defecto cuesta un 60% más por minuto, sin ningún despliegue por tu parte. Fijar la versión antigua es tu forma de optar por quedarte fuera. Ese cambio también borró la ventaja del 37,5% de Grok frente a ElevenLabs, porque $0,08 es exactamente la tarifa efectiva por minuto incluido de ElevenLabs. Lo que queda es la forma de facturación, no el precio. Grok es de pago por uso, los minutos de ElevenLabs son de prepago, así que Grok sigue ganando en volumen irregular o bajo.
Ventajas
- La cima de la tabla τ-Voice en finalización de tareas de soporte, con un 56,5%.
- El tercer tiempo más rápido hasta el primer audio, 0,70 segundos, la mejor combinación de velocidad y capacidad disponible.
- La medición es a tarifa fija por minuto, así que el coste medido por hora de audio de entrada coincide exactamente con la tarifa de lista.
- Transcripción fuerte en audio telefónico, aproximadamente 10 veces mejor en condiciones ruidosas.
Inconvenientes
- 10 sesiones concurrentes por equipo por defecto. Para una línea de soporte, eso es un techo estricto, y elevarlo requiere una solicitud.
- Sin descuento por lote y sin nivel prioritario en voz, así que no hay ni descuento ni un carril rápido de pago. Solo
us-east-1, y un máximo de 120 minutos por sesión. - Sin integraciones de helpdesk. Tampoco hay certificaciones de seguridad publicadas para el producto de voz.
- El almacenamiento se factura aparte cuando el agente hace recuperación, $0,10/GiB/día para colecciones.
Mi valoración: el modelo más capaz de aquí, envuelto en el producto con menos forma de soporte. Diez sesiones concurrentes es la cifra que lo decide. Si tu pico supera eso y nadie ha elevado el límite, esto es un prototipo y no una línea de soporte en producción, por bien que se vea el benchmark. Cubrí el modelo en profundidad en Grok Voice Think Fast 2, y las nuevas tarifas en su desglose de precios.
A dónde va realmente la otra mitad de tus llamadas
Todas las herramientas anteriores acabarán transfiriendo. No es un defecto, es pura aritmética. El mejor modelo resuelve el 56,5% de los escenarios de soporte en un benchmark y los operadores reportan entre el 15% y el 30% en producción, mientras que la resolución neta media de primer nivel en los helpdesks se sitúa generalmente en torno al 74,3%, y solo el 1,4% de los helpdesks supera el 95%. Algo siempre acaba llegando a una persona. Por eso la resolución en el primer contacto es un objetivo mejor que la contención.

El patrón de fallo del que más oigo hablar no tiene nada que ver con la conversación del bot. Ocurre en la costura:
"La pregunta del AHT que nadie quiere responder, jaja. lanzamos un bot de facturación/seguimiento, contención decente, pero el AHT en las llamadas escaladas subió. los agentes tenían que leer la transcripción, averiguar qué había probado ya el bot, y volver a preguntar la mitad de todos modos. lo arreglamos forzando un resumen de traspaso estructurado en lugar de volcar la transcripción en bruto (eso ahorró más tiempo que la propia automatización). el csat bien en lo desviado, se hundió en todo lo que volvió después de un intento fallido del bot"
Lee dos veces esa última frase. La contención parecía correcta, el tiempo de gestión en las llamadas escaladas subió, y la satisfacción se derrumbó específicamente en los casos que rebotaron. Así que un despliegue de voz puede ganar en el panel de control y perder con los clientes que más te necesitaban. Ese es el argumento para seguir el CSAT segmentado según si la IA tocó primero el contacto.
Aquí está la versión más directa del mismo punto, de un operador de contact center al que le preguntaron cuánto de su centro está realmente automatizado:
"15% aproximadamente... la gente que dice cifras más altas o miente o no entiende qué significa "gestionado por completo". Las soluciones de IA no son lo bastante maduras, o están demasiado fragmentadas ahora mismo, para llegar más alto."
Otras respuestas en ese hilo situaban la franja entre el 10% y el 30%, según el diseño del recorrido. Así que el 15% es el extremo pesimista de un rango real y no la opinión de un único cínico. En cualquier caso, no está ni cerca del 95%.
Y luego hay un coste que el panel de contención no puede ver en absoluto. Qué pasa cuando el agente se equivoca en voz alta con total confianza:
"Si se parece en algo a hablar con ChatGPT por voz, sin duda lo notarían. Y si tiene algo parecido a los fallos que tiene, el hermano del autor del post va a comerse buena parte del ahorro de costes que obtendría (frente a usar una recepcionista humana o incluso una externalizada) lidiando con incendios del tipo "la IA me dijo que mi coche estaría listo hoy sin falta"."
Esa es la forma correcta de pensar sobre las alucinaciones de IA en una línea telefónica. En texto, una respuesta equivocada es un mensaje que se puede corregir. Dicha en voz alta, es un compromiso que el cliente oyó que hacías, y la limpieza se convierte en un contacto aparte que también pagas.
Lo que yo haría en realidad
Tres cosas, en este orden. Ninguna es "comprar la cifra de contención más alta".
Primero, recorta el volumen que nunca necesitó una llamada. Estado del pedido, restablecimiento de contraseñas, horario de apertura. Eso es trabajo de desviación de nivel 1, y en texto es más barato por interacción y más preciso con el mismo modelo. Aunque si quien llama ya falló en tu centro de ayuda, arreglar el centro de ayuda va primero. Eso es un problema de autoservicio, no de voz.
Segundo, arregla la costura antes de afinar la voz. En la cita de arriba, un resumen de traspaso estructurado superó a la propia automatización en tiempo ahorrado. El mismo principio que aplicamos al escalado de chat: la persona que lo recibe necesita un resumen y una señal de confianza, no una transcripción.
Tercero, asume que la llamada transferida se convierte en un ticket, porque normalmente lo hace. Quien llama cuelga y te envía un correo, o el agente escribe notas después. Un detalle de nuestras propias conversaciones con clientes se me quedó grabado, de un equipo que gestiona una cola mixta de teléfono y correo: nada de sus llamadas llegaba a su IA en absoluto, porque las grabaciones de voz nunca entraban en el sistema y los agentes resumían cada llamada a mano.
"Con las llamadas simplemente escribimos un resumen rápido en el ticket después, así que la IA en realidad nunca ve nada de eso."
Responsable de soporte en una empresa B2B SaaS de tamaño medio que gestiona una cola mixta de teléfono y correo en Zendesk, unos 3.000 tickets al mes
Ese es el hueco que nadie tasa. Compras un agente de voz para gestionar el teléfono, y luego la mitad que no puede gestionar se convierte en trabajo de texto, dentro de un sistema que el agente de voz no puede ver en absoluto.
Prueba eesel para la mitad que tu agente de voz transfiere
Seamos directos: eesel no hace voz. No existe un producto telefónico de eesel. Si necesitas algo que responda una línea que está sonando, compra una de las nueve anteriores.
Lo que hace eesel es la mitad que después aterriza en tu helpdesk, y parte de un lugar distinto al de cualquier herramienta de voz de esta lista. Vuelve a mirar esa tabla comparativa. Ocho de las nueve entrenan con un rastreo de la web más archivos subidos, y exactamente una puede reproducir tu propio historial de conversaciones. El agente de IA para helpdesk de eesel entrena con tus tickets pasados, y luego simula contra ellos antes de responder nada en real, así que lo que ves es su precisión sobre tu propio volumen histórico y no sobre escenarios que alguien se inventó. La misma disciplina que Parloa cobra a precio empresarial, aplicada al canal de texto.

Lo construimos así por una cicatriz. He visto a un bot que suena seguro inventarse afirmaciones sobre el producto y enviárselas a clientes reales, y por eso nada sale a producción aquí sin pasar antes por un ensayo sobre tickets históricos. También es la razón por la que un responsable de soporte que nos evaluaba planteó el requisito como querer un agente que "solo gestione los tickets que tiene la confianza de gestionar" en lugar de uno que responde a todo.
Resultados en lugar de promesas: Gridwise consiguió resolver el 73% de las solicitudes de nivel 1 en su primer mes. En cuanto al coste, mi compañera Riell lo expresó con claridad cuando dejamos atrás el precio fijo: un equipo que habría pagado $799 al mes fijo ahora paga alrededor de $200 según el uso.
Si estás valorando la voz, la secuencia honesta es esta. Primero, recorta el volumen repetitivo en texto. Compra el agente de voz para lo que quede. Después, asegúrate de que los tickets que genera llegan a un sitio que ya conoce tu historial.
La configuración tarda minutos, no las dos a ocho semanas que cotizan los proveedores de voz empresariales. También cubre más helpdesks que cualquier plataforma de voz de esta página, incluyendo Zendesk y Freshdesk, Gorgias y Front. Puedes probar eesel gratis.
Preguntas frecuentes
¿Cuál es la mejor IA para atención al cliente por voz en 2026?
¿Cuánto cuesta por minuto la atención al cliente por voz con IA?
¿Puede la IA resolver por sí sola llamadas de atención al cliente?
¿Es mejor la IA de voz o la IA de chat para atención al cliente?
¿Qué debo buscar al elegir una IA para atención al cliente por voz?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








