
Por que a voz voltou, e por que isso importa agora
Por quase uma década, o conselho sensato era que o suporte por telefone estava morrendo. Não está. A voz voltou a representar 40% do volume dos contact centers e continua crescendo. O chat, por sua vez, tem uma taxa de failover de 32% direto de volta para a voz. Ou seja, o telefone é onde os contatos difíceis acabam, não os fáceis, o que é um problema diferente da automação de call center comum. Também explica por que a geração anterior de sistemas automatizados de ligações nunca conseguiu reduzir isso de verdade.
Esse efeito de seleção é todo o problema. Um comentarista no Hacker News colocou isso melhor do que qualquer apresentação de vendas que já vi:
"Admiro o que vocês fizeram, mas para uma experiência de luxo, eu não quero falar com uma IA que só me diz o que já está no site. Se cheguei ao ponto de ligar, é porque não consegui encontrar a resposta para minha pergunta no site em primeiro lugar."
Todo mundo que vende um agente de voz o treina com a própria central de ajuda. E as pessoas que ligam são, por definição, aquelas para quem essa central de ajuda já falhou. Vale a pena guardar isso, porque explica a maioria das implantações decepcionantes de que ouço falar.
Como escolhi essas ferramentas, e o benchmark que ninguém cita
Em 5 de agosto de 2026, passei pela página de preços, documentação e central de ajuda de cada fornecedor. Depois calculei o custo real total por minuto em vez do valor anunciado, e verifiquei o que cada um faz no momento em que o agente não consegue concluir a tarefa. Quando um fornecedor não publica tabela de preços, eu digo isso em vez de adivinhar.
Esta lista é deliberadamente mais enxuta do que meu levantamento mais amplo de empresas de IA de voz. Ela também adota um ângulo diferente do compilado melhor IA para suporte telefônico, que ordena por tipo de fornecedor. Aqui a ordem é ditada pelo que as medições dizem.
A medição que mudou minha forma de ler toda essa categoria é o τ-Voice, e não é um benchmark de áudio genérico. Um chamador simulado liga para o modelo com um problema real, uma mudança de voo ou uma cobrança contestada, às vezes uma falha de telecom. A pontuação avalia se o banco de dados termina no estado final correto. Ou seja, ela pontua exatamente o que você está comprando.

O topo desse ranking é preocupante:
| Modelo | τ-Voice (cenários de suporte resolvidos) | Compreensão de fala | Tempo até o primeiro áudio | Custo por hora de áudio de entrada |
|---|---|---|---|---|
| Grok Voice Think Fast 2.0 High | 56,5% | 97% | 0,70s | $4,80 |
| Qwen Audio 3.0 Realtime Plus | 54,6% | 99% | 4,02s | $4,42 |
| Grok Voice Think Fast 1.0 | 52,1% | 97% | 1,25s | $3,00 |
| GPT-Realtime-2.1 High | 45,7% | 96% | 1,21s | $10,75 |
| GPT-Realtime-2 High | 39,8% | 97% | 1,14s | $4,14 |
| Gemini 3.1 Flash High | 37,7% | 97% | 2,99s | $1,75 |
| Deepslate Opal | 17,5% | 85% | 0,44s | $6,48 |
| GPT Realtime Mini | 15,1% | 64% | 0,81s | $3,04 |
Vale ler juntas a segunda e a terceira coluna. A compreensão de fala está praticamente resolvida, já que seis desses oito modelos pontuam 96% ou mais ao entender uma pergunta falada. Depois esses mesmos modelos despencam assim que precisam concluir a tarefa. Entender quem está ligando não é mais a parte difícil. Terminar o trabalho, sim.
Quer ver como isso aparece em um ambiente de trabalho real em vez de um benchmark? A própria documentação da Bland publica uma tela de análise de ferramentas mais honesta do que qualquer página de marketing:

408 execuções de ferramentas, 142 erros, uma taxa de erro de 34,8%. O principal culpado é uma consulta de calendário que falha 81 vezes com "start_time must be in the future". Nada disso é um problema de voz. O agente entendeu perfeitamente quem ligou, e então a chamada da ferramenta falhou, e é exatamente aí que a pontuação do τ-Voice despenca.
A latência deixou de ser o gargalo
A categoria ainda se vende em milissegundos. Entendo o motivo, já que por anos essa foi realmente a barreira. Não é mais, e o ranking mostra isso claramente.

O Deepslate Opal responde mais rápido do que todos na tabela, 0,44 segundo, e resolve 17,5% dos cenários de suporte. O Grok Voice Think Fast 2.0 leva um quarto de segundo a mais e resolve 56,5%. Ninguém desliga por causa de 260 milissegundos. As pessoas desligam porque o agente não conseguiu resolver o motivo da ligação.
E o que os operadores relatam como problema não é a lentidão. É o agente falando por cima deles:
"É brutal. Estamos perdendo cerca de 40% dos chamadores nos primeiros 30 segundos. Configuração atual: Vapi com detecção de fim de turno do GPT-4 em 800ms (padrão deles), latência de rede em média de 120-150ms, o processamento adiciona mais 200-300ms. O que já tentei: aumentar o limiar de silêncio para 1,2s → o bot parece lento, as pessoas acham que está quebrado. Reduzir para 500ms → cidade das interrupções, pior do que antes. Adicionar "espere o cliente terminar" ao prompt → literalmente nenhum efeito."
Isso é o tratamento de barge-in (interrupções). Um problema de ajuste, não de modelo, e de longe o item menos orçado em uma implantação de voz. Um operador que construiu sua própria stack calculou esse custo em "200-400ms até ajustar corretamente os limiares de detecção de turno", e depois avisou para "prever dois meses de 'por que meu agente está falando por cima de quem liga'" antes de chegar ao nível de produção, em este tópico sobre construir versus comprar.
O relato mais completo que encontrei veio de alguém com 20 implantações no currículo. Ele cobre barge-in e transferência, e também custo, tudo de uma vez:
"já implantei agentes de voz para cerca de 20 pequenas empresas, principalmente empresas de serviços como encanadores, dentistas, spas médicos. aqui está o que realmente encontrei em produção: o maior problema, de longe, é o tratamento de barge-in. o cliente começa a falar enquanto o agente ainda está falando e tudo desanda. a maioria das plataformas lida bem com isso em demos, mas em ligações reais com ruído de fundo, sotaques, ou gente que fala rápido, quebra o tempo todo. tive que construir limiares de detecção de silêncio personalizados por cliente. o segundo é a transferência para um humano. quando a ia não consegue lidar com algo, precisa transferir de forma limpa. tanto o vapi quanto o retell enfrentam problemas aqui dependendo da configuração de telefonia. a ligação cai, ou há um intervalo de silêncio de 3 segundos que faz quem ligou desligar. acabamos construindo um fluxo de transferência assistida onde o agente atualiza o humano antes de conectar. [...] em termos de custo, a maior surpresa foi o quanto custa quando as ligações se estendem. uma ligação de 10 minutos pode custar de 1,50 a 2,00 dólares somando stt + llm + tts + telefonia. parece pouco, mas se você atende 200 ligações por dia para um cliente, isso soma rápido. tivemos que construir cortes rígidos e resumos para manter as ligações abaixo de 4 minutos."
Três pontos daí valem a pena destacar. Uma ligação de dez minutos custa de 1,50 a 2,00 dólares, tudo incluído, e isso bate mais com a conta lá embaixo do que com qualquer página inicial. As demos escondem os problemas de barge-in, porque quem liga em uma demo não tem sotaque nem ruído de fundo. E a solução, tanto para o intervalo de transferência quanto para o custo, foi construir algo que a plataforma não oferecia.
As quatro coisas que eu realmente avaliei
- Transferência para um humano. Não se ela existe. Se é assistida, se entrega um resumo em vez de uma transcrição bruta, e se tudo isso está atrás de um contrato empresarial. Um bom gerenciamento de escalonamento é a diferença entre um desvio e um chamador irritado.
- Fontes de conhecimento. Quase todas as ferramentas aqui ingerem um rastreamento do site público mais arquivos enviados. Quase nenhuma toca em tickets antigos ou em uma wiki autenticada. Essa diferença decide como cada uma lida com as ligações que sua central de ajuda já falhou em resolver.
- Testes antes do lançamento. Uma "simulação" que executa cenários que você mesmo escreveu é uma garantia diferente de uma que reproduz o seu próprio histórico de ligações. Exatamente um fornecedor aqui faz a segunda coisa. Para a prevenção de alucinações, isso importa mais do que qualquer configuração de guardrail.
- Custo real por minuto, com telefonia incluída. Nunca o número da página inicial. Também é o número que decide o ROI do call center.
As 9 melhores ferramentas de IA para suporte ao cliente por voz em 2026
| Ferramenta | Melhor para | Tarifa real total | Unidade de cobrança | Transferência para humano | Fontes de conhecimento | Teste com suas próprias ligações | Concorrência | Segurança | Integrações com helpdesks |
|---|---|---|---|---|---|---|---|---|---|
| ElevenLabs Agents | Uma tarifa previsível | $0,08/min + operadora | Por minuto, pré-pago | Sim, transfer_to_number | Arquivos, URLs, RAG no plano gratuito | Não | 4 a 40 conforme o plano | SOC 2, ISO 42001, PCI DSS L1, BAA no Enterprise | Zendesk, Salesforce |
| Retell AI | Operações de suporte sem equipe de desenvolvimento | ~$0,135/min | Por minuto, montado | Assistida, mais retomada por supervisor | Rastreamento do site, upload de arquivos | Não | 20 grátis, depois $8/linha/mês | SOC 2 Type II, HIPAA, GDPR | HubSpot, Salesforce; Zendesk "em breve" |
| Vapi | Controlar toda a stack do modelo | ~$0,105/min | Por minuto, montado | Sim, via provedor de telefonia | Apenas upload de arquivos, recuperação via Gemini | Não | 10 grátis, depois $10/linha/mês | HIPAA $2.000/mês, ZDR $1.000/mês | Nenhuma pré-construída |
| PolyAI | Um parque CCaaS já existente | Somente sob consulta | Por minuto | Sim | Documentação e integrações | Não | Não publicado | SOC 2 Type 2, ISO 27001, PCI DSS, GDPR, HIPAA como padrão | Zendesk Talk via CCaaS |
| Parloa | Testar com seu histórico de ligações | Somente sob consulta | Por consumo, conforme complexidade da tarefa | Sim | Conectores empresariais | Sim, reproduz transcrições reais | Não publicado | ISO 27001, SOC 2 Type 1 e 2, PCI DSS | Zendesk, ServiceNow, Salesforce, Dynamics |
| Sierra | Pagar só por resoluções | Somente sob consulta | Por conversa resolvida | Sim, preservando contexto | Conectores empresariais | Simulações de voz | Não publicado | SOC 2, ISO 27001, ISO 42001, HIPAA, PCI DSS, FedRAMP | Não publicado |
| Bland AI | Alta concorrência e auto-hospedagem | $0,11 a $0,14/min | Por minuto + taxa de plataforma | Somente Enterprise | Arquivos, texto, web pública | Não | 10 a 100, Enterprise até 1M | SLA de 99,9% em todos os planos, BAA no Enterprise | Nenhuma |
| Synthflow | Uma implantação nativa Freshworks | ~$2.500/mês de piso | Por segundo, agregado | Fria, assistida, assistida com resumo | PDFs, URLs, rastreamento, importação do Zendesk | Test Center, cobrável | Definido em contrato | SOC 2, GDPR, ISO 27001 | Freshworks (Freshcaller) |
| Grok Voice Agent Builder | O modelo capaz mais rápido | $0,08/min + $0,01 por número | Por minuto, pague conforme o uso | Via chamadas de ferramentas | Coleções, busca em arquivos e na web | Não | 10 sessões por equipe | Não publicado para voz | Nenhuma |
Nove ferramentas e quatro formas diferentes de cobrar. Só uma permite testar com o seu próprio arquivo de ligações, e essa é a coluna que eu capturaria em tela.
Antes das análises individuais, algumas contas. As tarifas anunciadas não são comparáveis entre si, e a diferença é grande o suficiente para mudar sua lista de finalistas.
1. ElevenLabs Agents
Melhor para: equipes que precisam prever a fatura até o centavo antes de se comprometer.
O ElevenLabs é mais conhecido por conversão de texto em voz. A plataforma Agents é a camada conversacional montada sobre isso, e já lançou mais de 4 milhões de agentes. O motivo de liderar esta lista é banal: é o único fornecedor aqui cuja conta de preços realmente fecha.

Vale a pena parar nesse painel. É o único lugar em toda esta análise em que um fornecedor mostra seus próprios números sem editar: 75,1% de taxa de sucesso geral, 3,5 estrelas de CSAT médio. Uma implantação com cara realista, em outras palavras, não uma promessa de 95%.
O que ele realmente faz
A telefonia via SIP está incluída em todos os planos em vez de restrita, o que é incomum. Bases de conhecimento e RAG funcionam até no plano gratuito. Chamadas de ferramentas, chamadas em lote, um servidor MCP hospedado para gestão de agentes, uma CLI: tudo está lá. As integrações nomeadas cobrem Genesys e Amazon Connect no lado da telefonia. Para ticketing, são Zendesk e Salesforce, os únicos dois sistemas de tickets com páginas de verdade.
Duas coisas para saber antes de construir. As próprias páginas divergem quanto a idiomas, listando mais de 70 no catálogo de vozes contra 31 que um agente pode realmente ser configurado para falar. Segundo, não existe latência de ida e volta publicada para um agente, apenas números por componente para o Flash v2.5, cerca de 75ms, e o Scribe v2 Realtime, cerca de 150ms. Nenhum dos dois é a mesma coisa que aquilo que quem liga realmente ouve.
Preços
| Plano | Mensal | Minutos incluídos | $/min efetivo | Excedente | Pico | Ligações simultâneas |
|---|---|---|---|---|---|---|
| Free | $0 | 15 | n/a | $0,08 | $0,16 | 4 |
| Starter | $6 | 75 | $0,0800 | $0,08 | $0,16 | 6 |
| Creator | $22 (primeiro mês $11) | 275 | $0,0800 | $0,08 | $0,16 | 10 |
| Pro | $99 | 1.238 | $0,0800 | $0,08 | $0,16 | 20 |
| Scale | $299 | 3.738 | $0,0800 | $0,08 | $0,16 | 30 |
| Business | $990 | 12.375 | $0,0800 | $0,08 | $0,16 | 40 |
| Enterprise | Personalizado | Personalizado | Negociável | Negociável | n/a | Elevada |
Vale olhar essa coluna do custo efetivo. Todo plano pago se divide exatamente em $0,08. O Business custa $990 por 12.375 minutos, e 12.375 × $0,08 dá exatamente $990,00. Ou seja, as cotas de minutos foram calculadas de trás para frente a partir do preço, o que significa que não há desconto por volume em nenhum plano. Mensagens de texto custam $0,003 cada, e a telefonia da operadora é cobrada "ao custo" à parte.
Vantagens
- O único custo por minuto de toda esta análise que dá para prever de verdade.
- O tronco SIP não fica restrito ao Enterprise, então sua própria operadora funciona já no plano de $6.
- Uma lista séria de conformidade: ISO 42001, AIUC-1, PCI DSS Level 1.
- Bases de conhecimento e RAG funcionam no plano gratuito, então testar direito não custa nada.
Desvantagens
- Nunca há desconto por volume. Em 50.000 minutos, você paga a mesma tarifa de 75.
- Os minutos são pré-pagos em vez de pague-conforme-o-uso, então volume irregular significa pagar por folga que você desperdiça.
- O BAA para HIPAA fica atrás do Enterprise, assim como o SSO e as condições de SLA.
- Operadores relatam que a ferramenta
transfer_to_numberfalha ao concluir a transferência, discutido em detalhes neste tópico do r/ElevenLabs.
Nossa avaliação: comece por aqui se o seu volume é previsível e você quer um número que sua equipe financeira aceite. A tarifa fixa, porém, corta dos dois lados. Está caminhando para além de 20.000 minutos por mês? Consiga uma proposta empresarial antes de se comprometer, porque não há curva de desconto aqui para crescer. Detalho ainda mais os planos no guia de preços do ElevenLabs, e cubro as opções de troca em alternativas ao ElevenLabs.
2. Retell AI
Melhor para: operações de suporte que querem analítica de ligações e escalonamento limpo, sem contratar um engenheiro.
O Retell AI é o que eu colocaria na frente de um gestor de suporte em vez de um desenvolvedor. Sua transparência de custos chega a um nível quase desconfortável. Também é o único fornecedor aqui cujo próprio FAQ responde "a IA pode substituir agentes de call center?" com um "Não" categórico. Isso me rende mais respeito do que qualquer promessa de contenção nesta página.

Vale notar o terceiro painel. A mensagem de boas-vindas está configurada como "User Initiates: AI remains silent until users speak first" (o usuário inicia: a IA fica em silêncio até o usuário falar primeiro). Uma configuração pequena, com grande efeito em como se sentem os primeiros três segundos de uma ligação de suporte.
O que ele realmente faz
A camada de escalonamento é o ponto forte. Transferência assistida, navegação por IVR e captura de DTMF ficam todas sob um único nó de transferência de ligação, enquanto o monitoramento ao vivo permite que um supervisor escute ou assuma a ligação completamente. Melhor ainda: a taxa de IA para no momento da transferência, então só a telefonia continua rodando. O incentivo certo, e quase ninguém mais faz assim.
Análise pós-ligação, transcrições, webhooks e a API estão todos disponíveis no plano gratuito pague-conforme-o-uso, então dá para testar de verdade. Um cliente de referência, Medical Data Systems, publica uma taxa de transferência de 30%. Cerca de 70% de contenção em uma implantação real, então.
A base de conhecimento é um rastreamento do site mais upload de arquivos. Não há ingestão documentada do seu histórico de tickets, e a simulação roda casos de teste avaliados que você mesmo escreve, em vez de reproduzir seu próprio arquivo de ligações.
Preços
| Componente | Tarifa | Notas |
|---|---|---|
| Infraestrutura de voz Retell | $0,055/min | Inevitável. O reconhecimento de fala é absorvido aqui. |
| Texto em voz | $0,015/min | $0,040/min se você escolher vozes ElevenLabs |
| LLM | $0,003 a $0,32/min | GPT 5 nano no piso, GPT 5.5 Fast no teto |
| Telefonia | $0,015/min gerenciada | $0 com seu próprio tronco SIP |
| Base de conhecimento | +$0,005/min | Mais $8/mês por base após a décima |
| Guardrails | +$0,005/min | Remoção de PII é um +$0,01/min à parte |
| Controle de qualidade de ligações por IA | $0,10/min | Os primeiros 100 minutos são gratuitos |
| Concorrência | $8/ligação/mês | As primeiras 20 linhas estão incluídas |
A faixa anunciada é de $0,07 a $0,31 por minuto, com $10 de créditos grátis e sem taxa de plataforma. A própria calculadora do Retell mostra por padrão $0,115/min, mas zera a telefonia e todos os complementos. Ao montar algo realista para suporte de entrada, GPT 4.1 com a voz própria do Retell, um número gerenciado nos EUA, base de conhecimento ativada, você chega a $0,135/min. Isso são $677 por mês em 5.000 minutos. Ativar o controle de qualidade de ligações por IA em todo o tráfego soma cerca de $490 por mês, um salto de 74%.
Vantagens
- A melhor proposta de transferência para humano de toda esta análise, e o medidor para exatamente no momento em que ela é acionada.
- Supervisores podem escutar uma ligação ao vivo, ou assumi-la.
- Transparência de custos até o nível de uma tarifa por componente.
- SOC 2 Type II, HIPAA e GDPR vêm em toda a plataforma em vez de restritos por plano.
Desvantagens
- O Zendesk está marcado como "em breve" em vez de disponível. Os conectores ativos param em Cal.com, HubSpot e Salesforce, e em nenhum lugar da documentação há integração com Freshdesk, Gorgias, Front ou Help Scout.
- A alegação de latência de ~600ms é atribuída a "benchmarks independentes", que nunca são nomeados ou linkados.
- Nenhuma das duas páginas publica número de idiomas ou porcentagem de SLA de disponibilidade.
- A opção voz para voz custa $0,345/min, acima do próprio teto declarado de $0,31 do Retell.
Nossa avaliação: a escolha mais sólida no geral para uma equipe de suporte, com uma grande ressalva. Se você usa Zendesk ou Freshdesk, deve orçar a construção própria da transferência de tickets, via webhooks. Vale ver quem o Retell coloca em destaque na própria vitrine de integrações: plataformas CCaaS, Genesys, Five9 e Avaya. Isso diz para quem foi construído. Meu detalhamento de preços do Retell AI passa por componente para quem quiser modelar a própria configuração.
3. Vapi
Melhor para: equipes de engenharia que querem escolher elas mesmas cada componente da stack.
O Vapi é infraestrutura, não um produto. Você monta o transporte e o reconhecimento de fala, o modelo, a voz, tudo sozinho, e o Vapi cobra $0,05 por minuto para orquestrar o resultado. Se trocar o Deepgram pelo Assembly às 3 da manhã parece atraente, esse é o seu.

Essa fileira de chips de provedores é o produto inteiro em uma única captura de tela. Cada chip também é uma linha separada na sua fatura.
O que ele realmente faz
Squads e workflows, chamadas de ferramentas, observabilidade, uma suíte de avaliação de verdade. Trazer seu próprio SIP pelo tronco próprio do Vapi não custa nada, o que é uma alavanca de custo real. Dez ligações simultâneas vêm incluídas, e linhas extras custam $10 cada por mês.
Há um prazo rígido que vale a pena conhecer: o construtor visual de Workflows para de funcionar em 19 de agosto de 2026, daqui a duas semanas. O motivo declarado pelo Vapi é que a IA atual não consegue atuar de forma confiável como agentes autônomos de grafo de nós, e que os Squads "levaram consistentemente a resultados melhores". Então qualquer construção de suporte no Vapi de antes de meados de 2026 precisa ser migrada agora. O Vapi também avisa que sua migração assistida por IA não tem garantia de estar correta ou completa.
Preços
| Componente | Tarifa | Notas |
|---|---|---|
| Orquestração Vapi | $0,05/min | Mais $0,005 por mensagem de chat SMS |
| Transporte | Grátis a $0,014/min | SIP e WebRTC do Vapi grátis; saída Twilio $0,014 |
| Reconhecimento de fala | $0,000631 a $0,01733/min | Google no piso, Speechmatics no teto |
| Texto em voz | $0,002 a $0,24/min | Inworld no piso, Tavus no teto |
| LLM | $0,01 a $2,12 por 1M | 4.1-mini no piso, 4.5 Preview no teto |
| HIPAA | $2.000/mês | Retenção zero de dados é um $1.000/mês à parte |
Ao montar algo realista, Vapi mais entrada Twilio mais Deepgram mais ElevenLabs mais um modelo barato, chega-se a aproximadamente $0,105/min. Isso são $0,63 por uma ligação de seis minutos. Também vale notar: a própria taxa do Vapi representa 48% de um minuto realista e 91% do minuto mais barato possível. As condições Enterprise começam em 400.000 minutos por ano.
Vantagens
- Controle total sobre cada componente, com uma tabela de preços publicada para cada um.
- O transporte é gratuito com SIP ou WebRTC do Vapi.
- O piso mais barato desta análise, cerca de $0,055/min, se você otimizar bastante para isso.
- Ferramentas de observabilidade e avaliação que são realmente boas.
Desvantagens
- Os testes são cobrados às tarifas de produção. Direto do próprio FAQ do Vapi: "Os testes são gratuitos? Não, as ligações de teste custam o mesmo que ligações normais."
- A base de conhecimento é só upload de arquivo, a recuperação é exclusiva do Gemini, não há rastreamento de central de ajuda, e o limite recomendado fica abaixo de 300KB por arquivo.
- Zero integrações de ticketing no catálogo de ferramentas. Ler ou escrever um ticket é um
apiRequestque você constrói. - Segundo a própria página de metodologia do Vapi, o título "latência abaixo de 500ms" exclui endpointing e transporte, e essa mesma página admite que o endpointing pode representar uma parcela significativa do atraso.
Nossa avaliação: a escolha certa se você tem engenheiros e quer o piso de custo. A errada se você quer algo atendendo ligações na semana que vem. De qualquer forma, faça a migração do Workflows antes do prazo de agosto. Há mais sobre o formato da plataforma na minha análise do Vapi.
4. PolyAI
Melhor para: um contact center estabelecido que já roda em Genesys, Avaya ou Amazon Connect.
O PolyAI vende para contact centers, não para desenvolvedores, e a lista de integrações denuncia isso. Genesys, Avaya, Amazon Connect, Twilio, Five9, NICE, Talkdesk, Cisco, RingCentral, Zendesk Talk: tudo suportado. Ou seja, ele se encaixa em um parque que você já tem em vez de pedir para substituí-lo.

A lista de templates diz muito sobre para quem isso é feito. "Lidar com transferências de ligações para um agente humano" aparece como template inicial em vez de tópico avançado. O instinto certo.
O que ele realmente faz
O Agent Studio é a superfície de construção, com um ponto de entrada self-service em studio.poly.ai. Os prazos de implantação publicados em todo o site vão de menos de dez minutos para self-service até cerca de oito semanas para uma implantação Amazon Connect, então vale desconfiar do número rápido. O suporte a idiomas é de 42 ou 45, dependendo de qual página do PolyAI você lê.
A postura de segurança é a melhor documentada aqui, e de forma incomum não é restrita por plano. SOC 2 Type 2, ISO 27001, PCI DSS, GDPR e HIPAA são todos descritos como padrão e "incorporados à arquitetura", com certificação AWS FTR também na página de parceiro Amazon Connect. Toda implantação paga também inclui um SLA de disponibilidade de 99,9% nas linhas telefônicas mais uma linha de suporte de emergência 24/7/365. Isso não é detalhe menor quando o que atende seu telefone quebra às 2 da manhã.
Preços
Não publicados. A página de preços se intitula "Preços simples que escalam" e promete uma estrutura transparente, mas mostra um formulário de captação de leads dividido por volume anual de ligações, de menos de 10.000 a mais de 1.000.000. Nenhum valor em dólares aparece em nenhuma propriedade do PolyAI. Também não há compromisso mínimo.
Pelo menos a unidade de cobrança é clara, nas próprias palavras do PolyAI: o uso contínuo "é cobrado por minuto, o que inclui melhorias proativas de desempenho, manutenção e suporte 24/7."
Vantagens
- A lista de integrações CCaaS mais profunda aqui, então se encaixa em um parque que você já opera.
- Certificações de segurança em todos os níveis em vez de restritas a um plano empresarial.
- A tarifa por minuto inclui um SLA de 99,9% na linha telefônica e uma linha de emergência 24/7.
- Resultados de clientes publicados em uma ampla variedade de implantações.
Desvantagens
- Nenhum preço publicado. A página de preços se autodenomina transparente enquanto mostra um formulário.
- Os números de contenção variam muito conforme o caso de uso: 70% das ligações de hóspedes em uma rede de pubs do Reino Unido, depois 34% nas reservas do Golden Nugget e 30% em um banco de varejo não nomeado. Números de restaurante não são uma referência justa para uma fila de suporte.
- O site se contradiz duas vezes, no número de idiomas e no prazo de implantação.
- Toda estatística em destaque no site é um contador animado no lado do cliente, o que dificulta uma verificação independente.
Nossa avaliação: se você já tem uma plataforma CCaaS, o PolyAI provavelmente é o caminho mais curto para um agente de voz funcionando, e o SLA incluído se justifica. Uma coisa a exigir: números de contenção de uma implantação de suporte, não de reservas. A diferença publicada entre os dois é mais do que o dobro. Para contexto sobre a categoria em que ele se encaixa, tenho minha introdução sobre IA conversacional para atendimento ao cliente.
5. Parloa
Melhor para: quem quer que o agente seja testado com o próprio histórico de ligações antes de atender uma ligação real.
O Parloa é o competidor empresarial europeu. A empresa levantou $350M com uma avaliação de $3B em janeiro de 2026 e ultrapassou $50M+ de ARR com retenção líquida de receita de 150%, com o total captado já passando de $560M em menos de quatro anos. Entre os clientes estão Allianz, Booking.com, IKEA e SAP.
O Parloa não publica capturas de tela de produto em lugar nenhum, então o que segue é o próprio slide de arquitetura da empresa, não uma captura da interface. Normalmente eu trato isso como um ponto negativo para um fornecedor. Neste caso, o slide acontece de dizer justamente o que importa, em voz alta.

O estágio dois desse ciclo é "testar e iterar", em pé de igualdade com implantar e monitorar. Todo outro fornecedor aqui trata testes como um recurso. O Parloa construiu uma empresa em torno disso.
O que ele realmente faz
O ambiente de simulação é o motivo pelo qual o Parloa está nesta lista. Também é o único recurso de toda esta análise que eu chamaria de diferencial de verdade. Ele executa milhares de conversas simuladas em cenários, idiomas, canais e casos extremos, e o ponto crítico é que combina suas transcrições históricas reais com testes sintéticos em vez de rodar apenas cenários escritos à mão. Testa ambiguidade e chamadas de ferramentas, fallback, consistência de marca. Isola subtarefas, e alterna entre staging e produção.
Pontuações de avaliação com LLM como juiz e critérios baseados em regras, ambos, sobre sucesso da tarefa e tom, precisão, comportamento da API. Depois, rastreamento de causa raiz, com recomendações de correção no nível da linha aplicadas dentro da plataforma. Esse é o mecanismo que eu gostaria que todo fornecedor aqui tivesse. Também é o mesmo princípio que aplicamos ao texto: um bot que só foi testado com perguntas que você mesmo inventou não ensina nada útil.
As integrações cobrem Avaya, Five9, Genesys, NICE, Twilio, Verint, Salesforce, Dynamics, ServiceNow, Zendesk e SAP, mais SIP. Mais de 130 idiomas em mais de 70 países, embora nenhuma lista seja publicada em lugar nenhum. A alegação sobre residência de dados vem com uma linguagem mais rígida do que o habitual, de que o roteamento em tempo de execução mantém o processamento dentro da jurisdição durante a interação e não só em repouso, mas o detalhe fica atrás de um centro de confiança com acesso restrito.
Preços
Não publicados, e a URL de preços dá erro 404. O único sinal real está no próprio FAQ do Parloa, que descreve um "modelo de precificação baseado em consumo que vincula custos à complexidade e ao esforço da tarefa, não a tarifas fixas ou contagem de tokens", cotado conforme volume, casos de uso e valor de negócio. Nenhum mínimo publicado, nenhum plano gratuito, nenhum teste.
Vantagens
- A única ferramenta aqui que reproduz seu próprio histórico real de ligações na simulação.
- Rastreamento de causa raiz, com correções aplicadas dentro da plataforma.
- Uma postura europeia de verdade, construída sobre Azure, com roteamento em tempo de execução dentro da jurisdição.
- As certificações são ISO 27001:2022, SOC 2 Type 1 e Type 2, e PCI DSS.
Desvantagens
- Nenhum preço publicado de forma alguma. O consumo "conforme a complexidade da tarefa" é também a unidade mais difícil de prever aqui.
- HIPAA, GDPR e DORA são descritos como "alinhado com" em vez de certificado. Essa é a própria formulação do Parloa, e vale a pena ler com precisão.
- As porcentagens de clientes na página inicial são contadores animados com JS, então os números reais ficam nas páginas de estudos de caso.
- O Amazon Connect não aparece em nenhuma lista de integrações do Parloa publicada, então não presuma que existe.
Nossa avaliação: se você é um comprador empresarial com apenas uma pergunta para fazer a um fornecedor, pergunte se a simulação dele reproduz suas próprias ligações. O Parloa é o único aqui que responde que sim. Essa única capacidade vale mais do que um ponto percentual de contenção no benchmark de outra empresa. Minha análise do Parloa traz mais sobre a plataforma, e preços do Parloa cobre o que se sabe sobre o lado comercial.
6. Sierra
Melhor para: suporte de alto valor onde pagar por resolução supera pagar por minuto.
A Sierra levantou $950M em uma avaliação acima de $15B em maio de 2026, e diz atender mais de 40% da Fortune 50. O produto de voz cobre mais de 55 idiomas com troca no meio da conversa, roteamento de modelo por turno e escalonamento que preserva o contexto. Também aceita pagamentos por voz, cartão e ACH via tons DTMF, através de infraestrutura compatível com PCI Nível 1.

Essa é uma ligação de demonstração e não uma captura de console, e é o máximo que posso mostrar. Todo elemento visual na página de voz da Sierra é um pôster de vídeo, sem nenhuma captura completa do produto publicada em lugar nenhum.
A Sierra também merece menção por algo além do próprio produto. Ela publica a pesquisa τ-voice que reformulou este artigo inteiro. Seus próprios achados: a fronteira avançou de 30,4% para 67,3% de pass@1 entre agosto de 2025 e abril de 2026, contra um teto de raciocínio em texto perto de 85%. Todo provedor perde de 5 a 14 pontos com áudio telefônico realista. E 79% dos primeiros erros críticos são culpa do próprio agente. Um fornecedor que publica números que fazem a própria categoria parecer difícil é um bom sinal.
O que ele realmente faz
Comercialmente, o diferencial é a precificação por resultado. O próprio posicionamento da Sierra é "Pague por um trabalho bem feito", com a unidade ligada a "uma conversa de suporte resolvida, um cancelamento evitado, um upsell, uma venda cruzada", e "se a conversa não for resolvida, na maioria dos casos, não há cobrança." A versão mais curta que eles dão: "A Sierra só é paga quando concluímos uma tarefa para você."
Vale ler as ressalvas com cuidado, porém, já que são elas que importam na hora do contrato. Escalonamentos não são cobrados "na maioria dos casos", e as exceções não são publicadas. A conta real é mista, porque a própria Sierra diz que "interações de roteamento ou de mera recepção podem se alinhar melhor a uma precificação baseada em consumo, em que o pagamento se baseia na contagem de conversas, independentemente do resultado." Depois há "resolvido", que não tem uma definição universal aqui. Os critérios são acordados por contrato.
Preços
Não existe página de preços alguma. sierra.ai/pricing retorna um 404 direto, e nenhum valor em dólares aparece em lugar nenhum: nenhuma tarifa por resultado, nenhuma taxa de configuração, nenhum mínimo, nenhum teste. Uma taxa de plataforma nunca é mencionada. Também nunca é negada, então não presuma que não existe.
Vantagens
- O modelo de cobrança se alinha com o que você realmente quer, que são resoluções em vez de tempo de fala.
- A lista de certificações mais ampla aqui: SOC 2, ISO 27001, ISO 42001, HIPAA, GDPR, EU AI Act, FedRAMP e PCI DSS.
- Mais de 55 idiomas, e troca no meio da conversa.
- Publica pesquisa honesta sobre os limites da própria categoria.
Desvantagens
- Zero preços publicados, então comparar com qualquer coisa significa entrar primeiro em um ciclo de vendas.
- Os selos de certificação não trazem datas de auditoria, nenhuma distinção SOC 2 Type I/II, nenhum nível de autorização FedRAMP.
- Os clientes de voz nomeados param em Rocket Mortgage, Guild e Next, e nenhum número de contenção, resolução ou tempo de atendimento é publicado para qualquer um deles.
- Nenhum número de latência de voz publicado. Aquele número de 200ms no artigo sobre τ-voice é a granularidade do fragmento de áudio do benchmark, não o tempo de resposta do agente, então não deve ser citado como tal.
Nossa avaliação: a precificação por resultado fica mais atraente quanto pior for a sua taxa de contenção, e esse é um alinhamento inteligente. Só entre na negociação sabendo que é você quem define a unidade cobrável. Deixe por escrito quais escalonamentos contam como as exceções a "na maioria dos casos". Aprofundo o modelo em preços da Sierra AI, e o conjunto competitivo em alternativas à Sierra.
7. Bland AI
Melhor para: alta concorrência, ou uma implantação que precisa ficar dentro da sua própria nuvem.
A Bland AI publica aqui a escala de planos mais clara, além do teto de concorrência mais alto por uma margem ampla. O índice de documentação cita suporte Enterprise para "até 1 milhão de ligações simultâneas". Ninguém mais nesta lista chega perto desse número.

Essa é a imagem mais clara do que "testar" significa em toda a categoria. O painel à direita roda um teste "Angry Caller" em 94% e um gate "Happy Path" em 100%. Ambos são personas que alguém escreveu. Útil. Mesmo assim, não é seu histórico de ligações.
O que ele realmente faz
Fluxos conversacionais (Pathways), chamadas de ferramentas e API, além de três posturas de hospedagem publicadas: Bland Cloud, sua própria VPC na AWS, GCP ou Azure, ou totalmente on-premise e air-gapped. Nenhuma delas tem valores em dólares associados. Também não é publicado nenhum adicional ou mínimo, já que tudo isso fica dentro do contrato Enterprise.
Novo desde a última vez que verifiquei: um número real de latência. A página inicial agora exibe 400ms contra uma "média do setor" alegada de 1.240ms, a documentação diz abaixo de 400ms, e a página do produto mostra números p50 de 380ms e 365ms. Essa comparação de 1.240ms não tem fonte. Vale tratá-la como marketing, não como medição.
Uma armadilha de redação: a página do produto anuncia a capacidade de "fazer backtest contra ligações históricas", enquanto o mecanismo documentado de Scenarios é um chamador simulado seguindo um prompt de persona que você escreve. É uma garantia diferente de reproduzir seu próprio arquivo, e vale a pena perguntar diretamente sobre isso.
Preços
| Start | Build | Scale | Enterprise | |
|---|---|---|---|---|
| Tempo de conversa | $0,14/min | $0,12/min | $0,11/min | Personalizado |
| Taxa de plataforma | $0 | $299/mês | $499/mês | Contratual |
| Tempo de transferência | $0,05/min | $0,04/min | $0,03/min | Personalizado |
| Ligações simultâneas | 10 | 50 | 100 | Dimensionado pelo volume |
| Limite diário / por hora | 100 / 100 | 2.000 / 1.000 | 5.000 / 1.000 | Ilimitado |
| Bases de conhecimento / vozes | 10 / 1 | 50 / 5 | 100 / 15 | Ilimitado |
| SLA de disponibilidade | 99,9% | 99,9% | 99,9% | 99,9% |
Os pontos de cruzamento são contraintuitivos o suficiente para valer a pena conhecer. O Build só supera o Start acima de 14.950 minutos por mês, e o Scale só supera o Build acima de 20.000. Abaixo de cerca de 15.000 minutos, o plano gratuito Start é aritmeticamente o mais barato. Aqui você faz upgrade pela concorrência, não pela tarifa.
Vantagens
- Um SLA de disponibilidade de 99,9% em todo plano, incluindo o gratuito, o que ninguém mais aqui faz.
- Auto-hospedagem na própria VPC, ou air-gapped on-premise, é uma opção publicada.
- O teto de concorrência é o mais alto desta análise.
- Trazendo seu próprio tronco, a cobrança por minuto de transferência desaparece completamente.
Desvantagens
- O diretório de integrações tem 19 conectores em 7 categorias e zero sistemas de helpdesk ou ticketing, apesar de o texto do produto alegar suporte a ticketing. Levar uma ligação para o Zendesk ou Front significa uma ferramenta sob medida, ou um webhook pós-ligação que você constrói.
- A transferência assistida é exclusiva do Enterprise, e a documentação declara essa restrição sem rodeios. Implantações self-service só permitem transferência fria, sem citações de resposta.
- Citações e relatórios de lacunas na base de conhecimento, resultados, guardrails, alertas, SMS, chat web, o BAA: tudo isso também está atrás do Enterprise.
- A página de preços diz que a telefonia é cobrada separadamente ao custo de repasse. O FAQ da página inicial e a documentação dizem que a tarifa por minuto a cobre. Vale conseguir isso por escrito.
Nossa avaliação: a Bland é mais uma plataforma de voz do que um produto de suporte, e seus principais pontos de prova geram receita em vez de economizar custos. Escolha-a pela concorrência, ou por uma exigência de hospedagem que sua equipe de segurança não vai flexibilizar. Comprando para atender ligações de suporte? Cote o plano Enterprise desde o início, porque os recursos necessários vivem todos lá em cima. E se lidar com tickets é o objetivo real, uma das ferramentas de automação de suporte da minha análise mais ampla se encaixa melhor.
8. Synthflow
Melhor para: uma empresa Freshworks que quer sua IA de voz dentro do Freshcaller.

Antes da análise, vale olhar essa gaveta aberta, porque é a captura de tela mais útil de todo este artigo. Ela mostra uma busca real na base de conhecimento no meio de uma ligação. Quem ligou disse algo como "eu tenho mas eu gostaria de saber como usar o produto", o agente reescreveu isso como uma busca, e voltaram 7 resultados em 756ms com uma melhor pontuação de similaridade de 0,80, para um similarity_threshold de 0. Esse limiar é o controle que decide se o agente responde a partir de uma correspondência fraca ou admite que não sabe. Quase nenhum fornecedor mostra isso.
Todo mundo ainda descreve o Synthflow como a porta de entrada fácil e sem código. A partir deste mês, isso está desatualizado. A escada self-service desapareceu, e a documentação confirma: os antigos planos Pro, Growth e Agency "não estão mais disponíveis para novas assinaturas e permanecem suportados para clientes existentes." O que resta é um produto empresarial de plano único, conduzido por vendas.
O que ele realmente faz
A transferência para humano é o recurso de suporte mais forte aqui, em três modos: fria, assistida com mensagem, assistida com resumo. Há detecção humana com timeout de 30 segundos a 30 minutos, triagem de ligações, um horário comercial. A documentação também é direta de um jeito que aprecio, ao dizer que "transferências frias não conseguem se recuperar de falhas."
As fontes de conhecimento são PDFs, documentos digitados, URLs únicas, rastreamentos de sites públicos e uma importação da central de ajuda do Zendesk. Nenhuma fonte autenticada, nenhuma ingestão de tickets passados, nenhuma classificação manual de documentos. Em integrações, a alegação de "200+" se reduz a cerca de 15 conectores documentados, e a única integração profunda com a stack de suporte entre eles é o Freshworks: IA de voz rodando dentro do Freshcaller, com 65% das solicitações de voz rotineiras automatizadas. Esse é o motivo para comprá-lo.
O detalhe da medição é publicado com muito mais precisão do que as tarifas, uma combinação estranha mas útil. A cobrança é por segundo e agregada entre ligações, então 125 segundos de ligações equivalem a 2 minutos cobráveis em vez de 4. Uma transferência bem-sucedida para o medidor. Um no-answer ou um desligamento na caixa postal é cobrado em um fixo de 5 segundos. O chat se converte na proporção de 5 mensagens de IA por 1 minuto de voz. E simulações do Test Center podem ser cobráveis.
Preços
| Plano | Mensal | Minutos incluídos | Excedente | Ligações simultâneas |
|---|---|---|---|---|
| Enterprise (o único plano vendido) | Sem preço de tabela; contratos começam em $30.000/ano, cerca de $2.500/mês | Não publicado, definido em contrato | Personalizado, conforme o acordo | "Definido com o Synthflow" |
| Pro / Growth / Agency (legado) | Fechado para novos clientes | Visível só dentro do produto | Visível só dentro do produto | Mostrado nos termos da sua conta |
| Teste gratuito | Sem checkout self-service. Ambos os CTAs levam a contato com vendas | n/a | n/a | n/a |
O custo efetivo por minuto incluído é impossível de calcular em qualquer plano, porque o Synthflow nunca publica um preço e uma cota de minutos na mesma linha. O único número público defensável é esse piso equivalente a $2.500 por mês, contra uma cota que ninguém fora do contrato conhece. Qualquer número por minuto ainda circulando remonta à escada já descontinuada.
Vantagens
- Três modos distintos de transferência. Assistida com resumo é o que realmente ajuda o humano.
- Cobrança por segundo, agregada entre ligações, é a medição mais justa aqui.
- Uma transferência bem-sucedida para o medidor.
- Uma integração profunda com o Freshworks, com um número publicado de automação de 65% para solicitações de voz rotineiras.
Desvantagens
- Esse piso de $30.000/ano o torna a opção mais cara aqui em qualquer volume abaixo de cerca de 20.000 minutos por mês.
- Não há mais nenhum número de concorrência publicado em nenhum plano.
- Um conflito de HIPAA no próprio site. A página inicial alega certificação em SOC 2, HIPAA, PCI DSS e GDPR, enquanto a linha de conformidade do documento Enterprise lista só SOC 2, GDPR e ISO 27001. Não presuma um BAA.
- A latência é uma meta, não uma medição, formulada como "buscamos" um tempo de ida e volta abaixo de 100ms. A revenda acaba em 15 de setembro de 2026, e os servidores de telefonia da UE estão "muito em breve".
Nossa avaliação: a reputação de sem código não bate mais com a tabela de preços, então vale ignorar qualquer análise que ainda o chame de opção barata inicial, incluindo as nossas mais antigas. Se você usa Freshworks, é um encaixe forte e nativo. Caso contrário, a integração com Freshcaller é o principal motivo para pagar esse piso, e uma ferramenta geral de automação de atendimento ao cliente custa bem menos.
9. Grok Voice Agent Builder
Melhor para: o modelo realmente capaz mais rápido, se os limites de sessão não te impedirem.
O Grok Voice Agent Builder da xAI roda sobre o Grok Voice Think Fast 2.0, que lidera a tabela τ-Voice em 56,5% e responde em 0,70 segundos. Essa combinação é toda a proposta de venda. No benchmark, ela se sustenta.
Não há captura de tela de produto nesta seção porque a xAI não publica nenhuma, e as URLs de documentação do Voice Agent Builder atualmente dão erro 404. O que a xAI publica é uma mudança de preços que entra em vigor hoje mesmo. Se você já roda o Grok voice em produção, esse é o item mais consequente de toda esta página.

O que ele realmente faz
É compatível ao nível de protocolo com a OpenAI Realtime API em wss://api.x.ai/v1/realtime, então migrar uma construção realtime existente é principalmente uma troca de URL. As ferramentas cobrem funções, busca de arquivos, busca na web, busca no X e MCP. As extensões voltadas para conformidade são a parte útil: force_message fala uma linha literal para avisos legais, replace mapeia pronúncias sem alterar a transcrição, keyterms aceita até 100 termos de 50 caracteres cada, resumption reproduz turnos ao reconectar. Um número de telefone provisionado soma $0,01 por minuto.
Vale destacar no lado da precisão: a transcrição é 1,4x melhor na taxa de erro de palavras do que a versão 1.0, de 1,5 a 2,0x melhor do que o Deepgram Nova 3 e o ElevenLabs Scribe v2 em 24 idiomas, e cerca de 10x melhor em áudio telefônico com ruído. Ruído de fundo e sotaques são exatamente o que os operadores relatam como causa de agentes quebrados, então esse número é mais relevante para você do que o benchmark em destaque.
Preços
| Item | Tarifa |
|---|---|
| Grok Voice Think Fast 2.0 | $0,08/min ($4,80/h) |
| Grok Voice Think Fast 1.0 | $0,05/min ($3,00/h) |
| Entrada de texto | $0,004 por item de conversa |
| Número provisionado | +$0,01/min |
web_search / x_search | $5 por 1.000 invocações |
file_search (coleções) | $2,50 por 1.000 |
attachment_search | $10 por 1.000 |
Hoje é o dia em que isso ficou mais caro. Em 5 de agosto de 2026, o alias grok-voice-latest é redirecionado de 1.0 para 2.0, então o caminho padrão custa 60% a mais por minuto, sem nenhuma implantação da sua parte. Fixar a versão antiga é a forma de sair disso. Essa mudança também apagou a vantagem de preço de 37,5% do Grok sobre o ElevenLabs, porque $0,08 é exatamente a tarifa efetiva por minuto incluído do ElevenLabs. O que resta é a forma de cobrança, não o preço. O Grok é pague-conforme-o-uso, os minutos do ElevenLabs são pré-pagos, então o Grok ainda vence em volume irregular ou baixo.
Vantagens
- No topo da tabela τ-Voice em conclusão de tarefas de suporte, com 56,5%.
- Terceiro tempo mais rápido até o primeiro áudio, 0,70 segundos, a melhor combinação de velocidade e capacidade disponível atualmente.
- A medição é em tarifa fixa por minuto, então o custo medido por hora de áudio de entrada é exatamente igual à tarifa de tabela.
- Transcrição forte em áudio telefônico, cerca de 10x melhor em condições ruidosas.
Desvantagens
- 10 sessões simultâneas por equipe por padrão. Para uma linha de suporte, isso é um teto rígido, e aumentá-lo exige uma solicitação.
- Sem desconto em lote e sem nível prioritário em voz, então não há nem desconto nem uma via rápida paga. Só
us-east-1, e uma duração máxima de sessão de 120 minutos. - Nenhuma integração com helpdesk. Também nenhuma certificação de segurança publicada para o produto de voz.
- O armazenamento é cobrado separadamente quando o agente faz recuperação, $0,10/GiB/dia para coleções.
Nossa avaliação: o modelo mais capaz aqui, embrulhado no produto menos formatado para suporte. Dez sessões simultâneas é o número que decide tudo. Se o seu pico fica acima disso e ninguém aumentou o limite, isso é um protótipo, não uma linha de suporte em produção, por melhor que o benchmark pareça. Cobri o modelo em profundidade em Grok Voice Think Fast 2, e as novas tarifas no detalhamento de preços dele.
Para onde vai de fato a outra metade das suas ligações
Toda ferramenta acima vai transferir. Não é um defeito, é só aritmética. O melhor modelo resolve 56,5% dos cenários de suporte em um benchmark, e operadores relatam de 15% a 30% em produção, enquanto a resolução líquida média de primeiro nível entre helpdesks fica geralmente em torno de 74,3%, com apenas 1,4% dos helpdesks acima de 95%. Algo sempre chega a uma pessoa. Por isso a resolução no primeiro contato é uma meta melhor do que a contenção.

O padrão de falha do qual mais ouço falar não tem nada a ver com a conversa do bot em si. Ele acontece na costura:
"Pergunta de AHT que ninguém quer responder, kkk. lançamos um bot de faturamento/rastreamento, contenção decente, mas o AHT nas ligações escalonadas subiu. os agentes tinham que ler a transcrição, descobrir o que o bot já tinha tentado, e reperguntar metade de qualquer forma. resolvemos forçando um resumo estruturado de transferência em vez de despejar a transcrição bruta (isso economizou mais tempo do que a própria automação). o csat ficou bem no que foi desviado, despencou em tudo que voltou depois de uma tentativa fracassada do bot"
Vale ler essa última frase duas vezes. A contenção parecia boa, o tempo de atendimento nas ligações escalonadas subiu, e a satisfação despencou especificamente nos casos que voltaram. Ou seja, uma implantação de voz pode vencer no painel e perder justamente com os clientes que mais precisavam de você. Esse é o argumento para acompanhar o CSAT segmentado por se a IA tocou o contato primeiro.
Aqui está a versão mais direta do mesmo ponto, de um operador de contact center questionado sobre quanto do seu centro é realmente automatizado:
"15% mais ou menos... quem fala números mais altos ou está mentindo ou não entende o que significa "totalmente resolvido". as soluções de ia não são maduras o suficiente, ou estão fragmentadas demais no momento, para ir mais alto."
Outras respostas nesse tópico colocavam a faixa entre 10% e 30%, dependendo do design da jornada. Ou seja, 15% é a extremidade pessimista de uma faixa real, não a opinião de um cínico isolado. De qualquer forma, está longe dos 95%.
Depois há um custo que o painel de contenção não consegue ver de jeito nenhum. O que acontece quando o agente erra com confiança em voz alta:
"Se for parecido com falar com o ChatGPT por voz, com certeza vão perceber. E se tiver algo parecido com os modos de falha que tem, o irmão do autor do post vai consumir boa parte da economia de custos que teria (comparado a usar uma recepcionista humana ou até terceirizada) apagando incêndios do tipo a IA disse que meu carro estaria pronto hoje sem falta."
Essa é a forma certa de pensar sobre alucinações de IA em uma linha telefônica. Em texto, uma resposta errada é uma mensagem que dá para corrigir. Dita em voz alta, é um compromisso que o cliente ouviu você assumir, e a limpeza vira um contato separado que você também paga.
O que eu realmente faria
Três coisas, nesta ordem. Nenhuma delas é "comprar o maior número de contenção".
Primeiro, corte o volume que nunca precisou de uma ligação. Status de pedido, redefinição de senha, horário de funcionamento. Isso é trabalho de desvio de nível 1, e em texto é mais barato por interação e mais preciso com o mesmo modelo. Ainda que, se quem liga já falhou na sua central de ajuda, consertar a central de ajuda vem primeiro. Isso é um problema de autoatendimento, não de voz.
Segundo, conserte a costura antes de ajustar a voz. Na citação acima, um resumo estruturado de transferência superou a própria automação em tempo economizado. O mesmo princípio que aplicamos ao escalonamento de chat: o humano que recebe precisa de um resumo e um sinal de confiança, não de uma transcrição.
Terceiro, presuma que a ligação transferida vira um ticket, porque geralmente vira. Quem liga desliga e manda um e-mail, ou o agente escreve notas depois. Um detalhe das nossas próprias conversas com clientes ficou na minha cabeça, de uma equipe que roda uma fila mista de telefone e e-mail: nada das ligações deles chegava à IA de jeito nenhum, porque as gravações de voz nunca entravam no sistema e os agentes resumiam cada ligação à mão.
"Para as ligações, a gente simplesmente escreve um resumo rápido no ticket depois, então a IA nunca chega a ver nada daquilo, na real."
Líder de suporte em uma empresa B2B SaaS de médio porte rodando uma fila mista de telefone e e-mail no Zendesk, cerca de 3.000 tickets por mês
Essa é a lacuna que ninguém precifica. Você compra um agente de voz para lidar com o telefone, e então a metade que ele não consegue lidar vira trabalho de texto, dentro de um sistema que o agente de voz não consegue ver de jeito nenhum.
Experimente o eesel para a metade que seu agente de voz transfere
Vamos ser diretos: o eesel não faz voz. Não existe um produto de telefone eesel. Se você precisa de algo para atender uma linha que está tocando, compre um dos nove acima.
O que o eesel faz é a metade que depois cai no seu helpdesk, e ele parte de um lugar diferente de qualquer ferramenta de voz desta lista. Vale olhar de novo para aquela tabela comparativa. Oito das nove treinam com um rastreamento do site mais arquivos enviados, e exatamente uma consegue reproduzir seu próprio histórico de conversas. O agente de IA para helpdesk do eesel treina com seus tickets antigos, depois simula contra eles antes de responder qualquer coisa ao vivo, então o que você vê é a precisão dele no seu próprio volume histórico, não em cenários que alguém inventou. A mesma disciplina pela qual o Parloa cobra preço empresarial, aplicada ao canal de texto.

Construímos assim por causa de uma cicatriz. Já vi um bot com tom confiante inventar alegações sobre o produto e enviá-las a clientes reais, e é por isso que nada entra em produção aqui sem antes passar por um teste seco em tickets históricos. Também é o motivo pelo qual um líder de suporte que nos avaliava formulou o requisito como querer um agente que "só lida com os tickets sobre os quais tem confiança" em vez de um que responde a tudo.
Resultados em vez de promessas: a Gridwise conseguiu 73% das solicitações de nível 1 resolvidas no primeiro mês. Sobre custo, minha colega Riell colocou isso de forma direta quando saímos do preço fixo: uma equipe que teria pago $799 por mês fixo agora paga cerca de $200 por uso.
Se você está buscando voz, a sequência honesta é esta. Primeiro, corte o volume repetitivo em texto. Compre o agente de voz para o que sobrar. Depois, garanta que os tickets que ele cria caiam em algum lugar que já conheça o seu histórico.
A configuração leva minutos, não as duas a oito semanas que os fornecedores de voz empresariais cotam. Também cobre mais helpdesks do que qualquer plataforma de voz nesta página, incluindo Zendesk e Freshdesk, Gorgias e Front. Você pode experimentar o eesel de graça.
Perguntas frequentes
Qual é a melhor IA para suporte ao cliente por voz em 2026?
Quanto custa por minuto o suporte ao cliente por voz com IA?
A IA consegue realmente resolver ligações de suporte ao cliente sozinha?
IA por voz ou IA por chat é melhor para suporte ao cliente?
O que devo procurar ao escolher uma IA para suporte ao cliente por voz?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








