As 10 melhores alternativas ao Grok Voice Think Fast 2 em 2026

Riellvriany Indriawan
Escrito por

Riellvriany Indriawan

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Uma pessoa ao telefone diante de três opções diferentes de agente de voz, com o logotipo da Grok à esquerda

Por que alguém procuraria uma alternativa ao Grok Voice Think Fast 2

Primeiro, justiça à xAI: o modelo é bom. Medidos de forma independente, os números publicados pela xAI se confirmam. 97,2% em raciocínio de fala e 95,1% no Full Duplex Bench, com o primeiro áudio chegando em 0,70 segundos. Quem construía um agente telefônico em 2025 não tinha nada parecido. Eu desmontei o modelo na minha análise do Think Fast 2.0, e o mecanismo está detalhado no resumo do lançamento.

Qualidade, então, não é o motivo pelo qual alguém sai. Os três motivos que realmente aparecem são todos estruturais, e o motivo financeiro eu cobri de ponta a ponta no meu artigo sobre os preços do Think Fast 2.0.

O preço do caminho padrão subiu 60%. O Speech to Speech aparece na página de preços da xAI a $0.05/min para grok-voice-think-fast-1.0 e $0.08/min para 2.0, ambos mais $0.004 por evento de entrada de texto. Não há segredo na tarifa da 2.0. O que pegou as pessoas de surpresa foi que o grok-voice-latest costumava apontar para a 1.0, e o guia de speech-to-speech situa a mudança para a 2.0 em 5 de agosto de 2026. Então, se a sua string em produção é esse alias, o custo por minuto subiu 60% da noite para o dia sem que nada mudasse no seu repositório.

Diagrama de antes e depois mostrando o alias grok-voice-latest mudando da versão 1.0 a cinco centavos o minuto para a versão 2.0 a oito centavos o minuto em 5 de agosto de 2026, um aumento de 60 por cento sem necessidade de deploy
Diagrama de antes e depois mostrando o alias grok-voice-latest mudando da versão 1.0 a cinco centavos o minuto para a versão 2.0 a oito centavos o minuto em 5 de agosto de 2026, um aumento de 60 por cento sem necessidade de deploy

Dez sessões simultâneas é um teto real. A ficha do modelo publica 10 sessões simultâneas por equipe, mais um máximo de 120 minutos por sessão. A xAI aumenta isso se você pedir. Bastante normal, exceto que esse valor padrão é justamente o número em torno do qual você realmente planeja um lançamento. Dez chamadas ao mesmo tempo são uma terça-feira à tarde movimentada para uma equipe de dez agentes. Não é um teste de estresse.

Uma única região, sem via rápida, sem desconto. A voz roda em us-east-1, e só ali. Também fica fora das duas alavancas de custo da xAI. O desconto de 20% por lote é para modelos de texto; o nível de prioridade 2x cobre Chat Completions e Responses. A voz não tem acesso a nenhum dos dois, o que não deixa nenhuma forma de reduzir o custo ou aumentar a taxa de transferência.

Cada um desses problemas tem uma solução diferente. A maioria das listas de alternativas ignora essa distinção, então aqui ela é detalhada.

Uma escada de três degraus rotulada como fixar a versão, trocar o modelo e trocar a plataforma, com o que cada degrau resolve e o que custa
Uma escada de três degraus rotulada como fixar a versão, trocar o modelo e trocar a plataforma, com o que cada degrau resolve e o que custa

Como escolhi essas dez opções

Três regras. Além de uma ressalva que prefiro dizer em voz alta a esconder.

Regra um: os números vêm das próprias páginas dos fornecedores ou da Artificial Analysis. A AA roda os mesmos três benchmarks em todos os modelos. Big Bench Audio para raciocínio de fala, Full Duplex Bench para a alternância de turnos, e então tau-Voice, que pergunta se uma tarefa de suporte realmente foi concluída. Esse último é o menos citado e o mais importante. Por isso construí meu comparativo de suporte por voz em torno dele, em vez das alegações de contenção dos fornecedores.

Regra dois: trocas de modelo e trocas de plataforma ficam separadas, porque não são compras concorrentes. Uma API de modelo entrega um WebSocket e nada mais. Uma plataforma entrega números de telefone, registros de chamadas e ferramentas de teste, por uma conta 30% a 75% mais alta por minuto. Misturar os dois numa única lista classificada faz você acabar comparando $0.08 com $0.14 como se comprassem a mesma coisa.

E então a ressalva: as quatro opções em nível de modelo não têm interface de produto para mostrar, porque são endpoints de API. A documentação e os posts de lançamento da xAI não trazem nenhuma captura de tela. Por isso as seções de modelos se apoiam em linhas de benchmark e comportamento documentado, enquanto as seções de plataforma começam com capturas reais do produto. Melhor te contar isso do que preencher quatro seções com imagens de banco de imagens.

Comparativo de alternativas ao Grok Voice Think Fast 2

Leia a coluna de custo medido duas vezes. Esse número é a Artificial Analysis executando uma carga de trabalho fixa e reportando quanto a hora realmente custou, algo diferente do preço de tabela numa página de preços. O Grok cobra uma tarifa fixa por minuto, então seu $4.80 medido bate com seu $4.80 de tabela. Modelos cobrados por token se afastam bastante do valor de tabela.

OpçãoCamadaÍndice AARaciocínio de falaAlternância de turnostau-VoiceTempo até o primeiro áudio$/h medidoFormato de cobrançaConcorrência publicadaNúmeros de telefoneFerramentas de teste
Grok Voice Think Fast 2.0API de modelo82,9%97%95,1%56,5%0,70s$4.80Fixo por minuto10 sessõesAdicional, +$0.01/minSomente playground
Grok Voice Think Fast 1.0API de modelo75,7%97%77,8%52,1%1,25s$3.00Fixo por minuto10 sessõesAdicional, +$0.01/minSomente playground
GPT-Realtime-2.1 HighAPI de modelo79,1%96%95,7%45,7%1,21s$10.75Baseado em tokenNão publicadoNãoNão
Qwen Audio 3.0 Realtime PlusAPI de modelo84,1%99%98,4%54,6%4,02s$4.42Baseado em tokenNão publicadoNãoNão
Gemini 3.1 Flash HighAPI de modelo69,5%97%74,3%37,7%2,99s$1.75Baseado em tokenNão publicadoNãoNão
ElevenLabs AgentsPlataformaSem pontuaçãoSem pontuaçãoSem pontuaçãoSem pontuaçãoNão publicado~$4.80Minutos pré-pagos40 chamadas (Business)Sim, inclusoSim
VapiPlataformaSem pontuaçãoSem pontuaçãoSem pontuaçãoSem pontuaçãoNão publicado~$6.30Montado por minuto$10 por linhaSimSim, cobrado ao vivo
Retell AIPlataformaSem pontuaçãoSem pontuaçãoSem pontuaçãoSem pontuaçãoNão publicado~$8.10Montado por minutoNão publicadoSimSim, +$0.10/min
Bland AIPlataformaSem pontuaçãoSem pontuaçãoSem pontuaçãoSem pontuaçãoNão publicado~$8.40Pacote por minutoNão publicadoSimSim
PolyAIPlataformaSem pontuaçãoSem pontuaçãoSem pontuaçãoSem pontuaçãoNão publicadoSomente sob consultaPor minuto, sob consultaNão publicadoSim, SLA de 99,9%Sim
ParloaPlataformaSem pontuaçãoSem pontuaçãoSem pontuaçãoSem pontuaçãoNão publicadoSomente sob consultaConforme complexidade da tarefaNão publicadoSimSim, com chamadas reais

As colunas de benchmark e custo medido vêm da tabela de speech-to-speech da Artificial Analysis. Os valores por hora das plataformas são meus, calculados a partir da tarifa por minuto publicada de cada fornecedor, então leia-os como uma conversão equivalente e não como um resultado medido.

Escolha o motivo da sua troca

Fixe a versão. Não migre.

Mude uma única string de grok-voice-latest para grok-voice-think-fast-1.0 e você volta a $0.05/min. Você mantém a mesma pontuação de 97% em raciocínio de fala e abre mão da qualidade na alternância de turnos (77,8% contra 95,1%) e de meio segundo no tempo de resposta.

Com 5.000 minutos por mês, isso são $250 em vez de $400. Mesmo cliente, mesmo WebSocket, uma linha de configuração.

Troque o modelo, ou compre concorrência.

Os limites de sessão são um limite de conta, não de modelo, então qualquer outro fornecedor escapa disso. O GPT-Realtime-2.1 é compatível a nível de protocolo, então o cliente muda muito pouco. Se preferir comprar o número diretamente, o ElevenLabs Business publica 40 chamadas simultâneas e a Vapi vende linhas a $10 cada.

Peça primeiro à xAI para aumentar o limite. É de graça, e 10 é um valor padrão, não um limite rígido.

Você precisa de uma plataforma, não de um modelo.

Nenhuma API de modelo vende um número de telefone com garantia de disponibilidade anexada. A PolyAI cotiza um SLA telefônico de 99,9% mais uma linha de emergência 24/7, e a Bland publica 99,9% em todos os planos, incluindo o gratuito. A Parloa é a única que testa contra suas próprias chamadas históricas.

Reserve de $0.105 a $0.14 por minuto tudo incluso, contra $0.08 do modelo puro.

Quatro trocas diretas de modelo

As quatro são o mesmo tipo de compra que o Grok Voice. Um WebSocket, uma string de modelo, uma conta por minuto. O esforço de migração vai de uma linha de configuração até uma reescrita completa do cliente.

Um gráfico antes das análises individuais, e é a coisa mais útil que fiz para este artigo. Procurei um modelo que fosse melhor e mais rápido do que o Think Fast 2.0 ao mesmo tempo. Não existe.

Três colunas comparando o que supera o Grok Voice Think Fast 2.0 em qualidade, em velocidade e em ambos, com a coluna de ambos vazia
Três colunas comparando o que supera o Grok Voice Think Fast 2.0 em qualidade, em velocidade e em ambos, com a coluna de ambos vazia

1. Grok Voice Think Fast 1.0

Melhor para: cortar 37,5% da conta de voz ainda hoje à tarde, sem nenhuma migração.

Ninguém lista essa opção, acho que porque parece trapaça. O grok-voice-think-fast-1.0 continua na página de preços a $0.05/min, e fixá-lo é uma mudança de uma única string. A Artificial Analysis mede $3.00 por hora de áudio de entrada, contra $4.80 da 2.0.

Você abre mão de algo, sim. Vale a pena saber exatamente do quê. O raciocínio de fala é praticamente idêntico, em 97%, e o tau-Voice cai de 56,5% para 52,1%, cerca de quatro pontos de conclusão de tarefas. A diferença real se abre na dinâmica conversacional. O Full Duplex Bench cai de 95,1% para 77,8%, a diferença entre um modelo que lida bem com interrupções e sinais de retorno e um que fala por cima das pessoas. O tempo até o primeiro áudio também quase dobra, de 0,70s para 1,25s.

Preço: $0.05/min ($3.00/h) mais $0.004 por evento de entrada de texto. Mesmo teto de 10 sessões, mesma região us-east-1.

Veredito: um fluxo roteirizado com poucas interrupções (status de pedido, confirmação de agendamento, horário de funcionamento) torna a troca para a 1.0 quase um dinheiro de graça. Com chamadores que interrompem, ou resolução de problemas aberta, é outra história. Essa lacuna de 17 pontos na alternância de turnos é exatamente onde uma chamada dá errado, e ali eu pagaria os três centavos a mais. Uma nota à parte: os posts mais antigos sobre o Voice Agent Builder citam todos a tarifa da 1.0, então a página de preços dele parece barata agora.

2. GPT-Realtime-2.1

Melhor para: equipes que querem sair da xAI por completo com a menor reescrita de cliente possível.

A xAI construiu seu endpoint em tempo real para ser compatível a nível de protocolo com a Realtime API da OpenAI, deliberadamente. Isso corta dos dois lados. Adotar o Grok foi fácil; deixá-lo é fácil pelo mesmo motivo. A configuração de melhor pontuação da OpenAI é o GPT-Realtime-2.1 High, 79,1% no índice, com a maior pontuação de alternância de turnos de toda a tabela, 95,7%.

Duas coisas para saber antes de se comprometer. O tau-Voice fica em 45,7% contra os 56,5% do Grok, então no benchmark que mede tarefas de suporte concluídas você perde quase 11 pontos. E então o custo se volta contra você. A Artificial Analysis mede o GPT-Realtime-2.1 High em $10.75 por hora, mais do dobro do Grok Voice 2.0.

O ajuste de esforço também esconde uma armadilha. O GPT-Realtime-2.1 Minimal mede $11.31/h, mais que os $10.75 do High, pontuando 6,6 pontos a menos. Diminuir o raciocínio não é uma alavanca de custo em voz cobrada por token. Um modelo mais fraco simplesmente gasta mais tokens para chegar ao mesmo lugar.

Preço: baseado em token, então a conta segue a forma da conversa. O GPT-Realtime-2 mais antigo lista $1.15/h de áudio de entrada e $4.61/h de áudio de saída, e mede $4.14 tudo incluso. Mostra o quanto a tarifa de entrada anunciada significa pouco aqui.

Veredito: a escolha certa quando compatibilidade é a restrição e orçamento não é. Sair do Grok especificamente para economizar dinheiro? Direção errada, e o GPT-Realtime-2 High, com $4.14/h medido, é de qualquer forma o irmão de melhor custo-benefício. O texto complementar sobre a camada de fornecedores é meu comparativo de suporte telefônico.

3. Qwen Audio 3.0 Realtime Plus

Melhor para: o modelo de voz de mais alta qualidade disponível, em canais onde ninguém está esperando na linha.

Um único modelo na tabela supera o Grok Voice Think Fast 2.0 no índice principal, e é esse, 84,1% contra 82,9%. Ele também lidera os dois benchmarks de componentes, 99% em raciocínio de fala e 98,4% em alternância de turnos. A Alibaba Cloud lista a $0.03 por hora de áudio de entrada, a tarifa de entrada publicada mais barata da categoria.

Depois vem o número que o exclui de uma linha telefônica. O tempo até o primeiro áudio é de 4,02 segundos. Quatro segundos de silêncio depois que o chamador para de falar soa como uma ligação caída. As pessoas dizem "alô?" e desligam. E o custo total medido fica em $4.42/h apesar dessa tarifa de entrada tão pequena, então o preço barato não sobrevive ao contato com uma carga de trabalho real.

Se você esperava que a variante Flash resolvesse a latência, não resolve. O Qwen Audio 3.0 Realtime Flash leva 4,16 segundos, um pouco mais lento, e marca 76,3% no índice.

Preço: conforme listado, $0.03/h de áudio de entrada e $0.18/h de áudio de saída. Medido com carga de trabalho fixa, $4.42/h.

Veredito: para trabalho de voz assíncrono, esse é o melhor modelo aqui. Triagem de correio de voz, resumo de chamadas, tratamento de mensagens gravadas, revisão de qualidade de chamadas. Suporte de entrada ao vivo, não: quatro segundos de silêncio morto não são compensados por uma vantagem de índice.

4. Gemini 3.1 Flash

Melhor para: o menor custo por hora crível quando você pode aceitar uma queda real de qualidade.

A entrada do Google é a aposta em custo-benefício, e não finge o contrário. O Gemini 3.1 Flash High mede $1.75/h, 64% abaixo do Grok Voice 2.0, e seus 97% em raciocínio de fala se sustentam bem nesse preço. O Minimal custa $1.50/h e responde em 0,96 segundos.

A alternância de turnos é o ponto fraco. O Full Duplex Bench fica em 74,3% para o High e 72,3% para o Minimal, ambos bem atrás dos 95,1% do Grok, com o tau-Voice em 37,7%. Dito claramente: ele entende a pergunta, é mais lento para descobrir de quem é a vez de falar, e conclui aproximadamente dois terços das tarefas de suporte. A opção de áudio nativo mais rápida do Google é um modelo diferente, o Gemini 2.5 Flash Native Audio Dialog, que responde em 0,63 segundos com $1.42/h medido. Sem pontuação de índice para esse, já que não foi testado nos três benchmarks.

Preço: listado a $0.35/h de áudio de entrada e $1.38/h de áudio de saída. Medido, $1.75/h no High e $1.50/h no Minimal.

Veredito: a escolha honesta para orçamento apertado. Chamadas de alto volume e baixo risco, onde uma interrupção desajeitada não custa nada, combinam bem com ele. Ainda assim, eu o manteria fora de uma linha de cobrança ou cancelamento. A linha mais ampla do Google está em alternativas ao Gemini.

Gráfico de barras horizontal do custo medido por hora de áudio de entrada para cinco modelos speech-to-speech, mostrando o GPT-Realtime-2.1 High como o mais caro, a dez dólares e setenta e cinco, e não o de melhor pontuação
Gráfico de barras horizontal do custo medido por hora de áudio de entrada para cinco modelos speech-to-speech, mostrando o GPT-Realtime-2.1 High como o mais caro, a dez dólares e setenta e cinco, e não o de melhor pontuação

Um detalhe de migração incomoda independentemente da direção escolhida. A xAI renomeou o evento ...input_audio_transcription.delta da OpenAI para .updated, e o payload é cumulativo em vez de incremental. Então um cliente escrito para a OpenAI, que anexa cada evento a um buffer, produz silenciosamente uma transcrição com cada palavra repetida. Uma falha silenciosa. O pior tipo.

Seis trocas completas de plataforma

Um tipo de compra completamente diferente. O que esses fornecedores vendem é a orquestração ao redor do modelo. Telefonia, registros de chamadas, bases de conhecimento, ferramentas de teste, transferências assistidas, e alguém para ligar quando a linha cair. Você paga por minuto por tudo isso, e o prêmio sobre o modelo puro é maior do que a maioria das páginas de preços deixa transparecer.

Cinco torres de blocos empilhados comparando quanto custa um minuto de voz no Grok Voice, ElevenLabs, Vapi, Retell AI e Bland AI, com uma nota de que Vapi e Retell são montados em vez de empacotados
Cinco torres de blocos empilhados comparando quanto custa um minuto de voz no Grok Voice, ElevenLabs, Vapi, Retell AI e Bland AI, com uma nota de que Vapi e Retell são montados em vez de empacotados

Também olhei para a Sierra, e depois a deixei fora da lista numerada. Ela cobra por conversa resolvida em vez de por minuto e não publica tabela de preços, então uma comparação equivalente não é possível. A pesquisa sobre tau-voice que ela publicou vale a leitura, porém, e eu a cito mais abaixo.

5. ElevenLabs Agents

O console do ElevenLabs Agents mostrando 27 chamadas ativas, 33,9 mil chamadas no total, uma taxa de sucesso geral de 75,1% e um CSAT médio de 3,5, conforme reproduzido de ElevenLabs
O console do ElevenLabs Agents mostrando 27 chamadas ativas, 33,9 mil chamadas no total, uma taxa de sucesso geral de 75,1% e um CSAT médio de 3,5, conforme reproduzido de ElevenLabs

Melhor para: equipes que querem as melhores vozes do mercado mais uma plataforma completa de agentes, exatamente no novo preço do Grok.

Essa é a coincidência que tornou este artigo interessante de escrever. Cada plano pago do ElevenLabs Agents se divide em quase exatamente $0.08 por minuto incluído: $6 por 75 minutos, $22 por 275, $99 por 1.238, $299 por 3.738, $990 por 12.375. No plano mais alto, a conta bate exatamente, 12.375 vezes $0.08 é igual a $990.00. Até 5 de agosto, o Grok era 37,5% mais barato que o ElevenLabs. Agora são o mesmo número, ao centavo.

Então a escolha deixou de ser sobre preço. Agora é sobre o formato de cobrança. Os minutos do ElevenLabs são pré-pagos e expiram; o Grok é pago conforme o uso. Com 500 minutos por mês, o Grok custa $40, enquanto o plano do ElevenLabs que cobre isso é o Pro de $99, o que explica por que tráfego irregular ou de baixo volume ainda favorece o pagamento por uso. Volume alto e estável, é cara ou coroa. E acima de 12.375 minutos por mês, o ElevenLabs passa a ser somente sob consulta.

O que o mesmo dinheiro compra é substancial. Telefonia está em todos os planos, incluindo o gratuito, assim como bases de conhecimento e RAG, e o console reporta sua própria taxa de sucesso (75,1% na captura acima) em vez de te forçar a construir esse painel sozinho. O Business permite 40 chamadas simultâneas contra o padrão de 10 do Grok. Uma contradição no próprio site deles vale a pena mencionar: o catálogo de texto para fala anuncia mais de 70 idiomas enquanto a configuração de agentes lista 31.

Preço: Free $0 por 15 minutos, Starter $6 por 75, Creator $22 por 275 (metade do preço no primeiro mês), Pro $99 por 1.238, Scale $299 por 3.738, Business $990 por 12.375, Enterprise sob consulta. Mensagens de texto $0.003 cada. Não há desconto por volume em nenhum plano, porque as cotas foram derivadas do preço, e não o contrário.

Veredito: a troca de plataforma mais forte no geral aqui, e a primeira que eu colocaria na lista curta se quisesse qualidade de voz com um console integrado. Tráfego irregular, evite: minutos pré-pagos que expiram punem exatamente esse padrão. O campo mais amplo está em alternativas ao ElevenLabs.

6. Vapi

O construtor de assistentes do painel da Vapi mostrando um assistente Appointment setter na aba Model com medidores de custo e latência, conforme reproduzido de Vapi
O construtor de assistentes do painel da Vapi mostrando um assistente Appointment setter na aba Model com medidores de custo e latência, conforme reproduzido de Vapi

Melhor para: engenheiros que querem escolher cada camada da stack eles mesmos e ver cada item da conta.

A Vapi cobra $0.05/min por sua própria hospedagem, e depois repassa o que você escolher para reconhecimento de voz, síntese de voz, o modelo e telefonia. Monte uma implementação de suporte realista e você chega perto de $0.105/min, o que significa que a taxa própria da Vapi é cerca de 48% de um minuto realista. Em telefonia, as opções baratas são Telnyx a $0.0055/min e Twilio de entrada a $0.008/min. A concorrência é uma tarifa fixa de $10 por linha, o que eu gosto. É o único fornecedor aqui que coloca um preço exatamente no que o teto de 10 sessões do Grok limita.

Duas coisas para planejar. O construtor Visual Workflows se aposenta em 19 de agosto de 2026, então qualquer coisa construída ali precisa de um caminho de migração. As chamadas de teste também são cobradas nas tarifas de produção, o que significa que uma semana de avaliação intensa aparece na fatura. Separadamente: a base de conhecimento é apenas upload de arquivo com recuperação exclusiva do Gemini, e não há integrações de ticketing de forma alguma, então qualquer coisa que toque seu helpdesk vira trabalho sob medida.

Preço: $0.05/min hospedagem Vapi, $0.005/mensagem em SMS e chat, mais o repasse por provedor. $10/mês por linha simultânea. Adicionais de compliance com preço à parte.

Veredito: a escolha certa quando você tem um engenheiro que quer controle e uma planilha. A escolha errada quando você quer que o fornecedor tome as decisões de stack por você, e um risco real se a lógica do seu fluxo estiver no construtor que se aposenta este mês. Para o mapa da categoria, empresas de IA de voz tem o campo completo.

7. Retell AI

O painel da Retell AI mostrando um agente de produção Doordash com uma tela de fluxo, editor de prompt e um painel de teste rodando uma conversa de reserva, conforme reproduzido de Retell AI
O painel da Retell AI mostrando um agente de produção Doordash com uma tela de fluxo, editor de prompt e um painel de teste rodando uma conversa de reserva, conforme reproduzido de Retell AI

Melhor para: equipes que querem controles de QA e compliance vendidos como interruptores em vez de construídos internamente.

A Retell anuncia $0.07 a $0.31/min. A composição importa mais do que a faixa em si. A infraestrutura de voz custa $0.055/min e é inevitável, mais da metade do custo de uma implementação barata antes mesmo de você ter escolhido um único componente. Adicione texto para fala da plataforma a $0.015/min, adicione um modelo, e um agente de suporte realista fica em torno de $0.135/min. Com 5.000 minutos, isso são cerca de $675 por mês.

Os adicionais são onde fica interessante, nas duas direções. Remoção de PII a $0.01/min e proteções de segurança a $0.005/min são incomumente granulares, e úteis se você está num setor regulado. QA com IA custa $0.10/min, adicionando cerca de 74% ao minuto, então essa é uma decisão de orçamento real, não uma caixinha para marcar. A Retell declara conformidade SOC 2 Type II, HIPAA e GDPR em nível de plataforma; o BAA e o MSA contratuais são restritos ao Enterprise.

Duas limitações honestas. A integração com Zendesk está listada como em breve, não entregue, e não há conector de Freshdesk ou Gorgias de forma alguma, então o trabalho com helpdesk se resume a colar APIs. O medidor também para na transferência, o que é generoso, e indica onde termina a responsabilidade do produto. Gostei que o próprio FAQ deles responda "a IA pode substituir agentes de call center?" com um não categórico.

Preço: $0.055/min infraestrutura de voz, $0.015/min vozes da plataforma ($0.040 para vozes ElevenLabs), mais modelo e telefonia. Remoção de PII $0.01/min, proteções $0.005/min, QA com IA $0.10/min. Agentes de chat a partir de $0.002/mensagem.

Veredito: escolha quando controles de compliance e QA de chamadas forem o requisito, e você preferir comprar isso em vez de construir. Pule quando sua lista de integrações começar por um helpdesk, já que essa é a lacuna. Alternativas à Retell AI cobre o resto dessa lista curta.

8. Bland AI

O construtor de fluxo Pathways da Bland AI mostrando um pathway de suporte técnico com um painel Scenarios reportando dois testes aprovados e uma pontuação Angry Caller de 94%, conforme reproduzido de Bland AI
O construtor de fluxo Pathways da Bland AI mostrando um pathway de suporte técnico com um painel Scenarios reportando dois testes aprovados e uma pontuação Angry Caller de 94%, conforme reproduzido de Bland AI

Melhor para: chamadas de saída de alto volume e chamadas de entrada numa única tarifa empacotada, com SLA em todos os planos.

A Bland empacota em vez de montar: $0.14/min no Start sem taxa de plataforma, $0.12/min no Build a $299/mês, $0.11/min no Scale a $499/mês. Uma única tarifa, sem stack para precificar separadamente. O que eu gostaria que um comprador verificasse é onde esses planos realmente começam a compensar. O Build só supera o Start acima de 14.950 minutos por mês, e o Scale só acima de 16.633. Abaixo desses volumes, o plano sem taxa sai mais barato, mesmo com tarifa por minuto mais alta. Em 12.000 minutos, as tarifas efetivas ficam em $0.148, $0.151 e $0.156, então os dois planos pagos saem piores.

O verdadeiro diferencial: 99,9% de disponibilidade em todos os planos, incluindo o gratuito, algo que nenhum outro aqui faz. Os testes também se sustentam. O construtor Pathways acima roda cenários nomeados como portões de deploy, um caminho tranquilo e um chamador irritado, cada um com sua pontuação.

A Bland publica algo que a maioria dos fornecedores prefeririam esconder. É a captura de tela mais útil deste artigo inteiro.

O painel de análise de ferramentas da Bland reportando 408 execuções totais de ferramentas, 142 erros totais e uma taxa de erro de 34,8%, discriminados em erros de validação e erros de API
O painel de análise de ferramentas da Bland reportando 408 execuções totais de ferramentas, 142 erros totais e uma taxa de erro de 34,8%, discriminados em erros de validação e erros de API

408 execuções de ferramentas, 142 erros, uma taxa de erro de 34,8%, discriminados por ferramenta. É aqui que os agentes de voz realmente vazam. O modelo entendeu o chamador perfeitamente; a consulta ao calendário retornou nulo. Os números de todo fornecedor se parecem com isso. Só a Bland te entrega o painel para ver isso.

Duas limitações. A transferência assistida é exclusiva do Enterprise, e o diretório de conectores tem 19 entradas sem nenhum helpdesk entre elas.

Preço: Start $0.14/min, $0 de taxa. Build $0.12/min, $299/mês. Scale $0.11/min, $499/mês. Enterprise contratado. SLA de 99,9% em todos os planos.

Veredito: a melhor escolha para volume, e a matemática dos planos diz que a maioria das equipes deveria ficar no Start bem mais tempo do que a página de preços sugere. Faça o cálculo dos 14.950 minutos, mais a matemática do ROI de call center, antes de fazer upgrade.

9. PolyAI

A tela inicial do PolyAI Agent Studio mostrando um espaço de trabalho de agente de voz com um botão de teste, chat de sandbox e templates para construir, testar e analisar, conforme reproduzido de PolyAI
A tela inicial do PolyAI Agent Studio mostrando um espaço de trabalho de agente de voz com um botão de teste, chat de sandbox e templates para construir, testar e analisar, conforme reproduzido de PolyAI

Melhor para: linhas telefônicas corporativas onde a garantia de disponibilidade é o produto.

A PolyAI cobra por minuto e só faz orçamento sob consulta, então não tenho uma tarifa para te dar. O que posso dizer é o que o orçamento inclui, que é justamente o que APIs de modelo estruturalmente não conseguem vender: um SLA telefônico de 99,9% e uma linha de emergência 24/7. O Grok Voice não publica nenhum compromisso de disponibilidade, nem canal de suporte para uma queda de voz. Quando sua linha telefônica ficar em silêncio conta como um evento de receita, essa diferença é toda a decisão.

Certificações não são restritas por plano aqui, o que é incomum nessa categoria. Um comprador de porte médio acaba com a mesma postura de compliance de um grande. O Agent Studio, na captura acima, é um construtor conversacional: você descreve a mudança, depois testa num sandbox com um contador de custo rodando, em vez de arrastar nós.

Preço: somente sob consulta, por minuto, SLA e suporte de emergência inclusos. Certificações não restritas por plano.

Veredito: a entrada da lista curta para uma linha telefônica regulada ou de alta receita. Não vale o ciclo de vendas para uma equipe pequena que espera lançar este mês, e a tarifa não publicada dificulta o orçamento. Tecnologia de call center cobre onde essa camada se encaixa.

10. Parloa

Ilustração própria da Parloa da visão de conversa de sua AI Agent Management Platform, mostrando um chamador autenticado com o perfil sendo atualizado no meio da ligação, conforme reproduzido de Parloa
Ilustração própria da Parloa da visão de conversa de sua AI Agent Management Platform, mostrando um chamador autenticado com o perfil sendo atualizado no meio da ligação, conforme reproduzido de Parloa

Melhor para: equipes que não vão lançar um agente telefônico sem antes testá-lo contra suas próprias chamadas passadas.

Aviso justo sobre essa imagem. A Parloa não publica capturas de tela do aplicativo real, então o que aparece acima é a ilustração da própria empresa da visão de conversa, não uma captura. Para um comprador, isso é um achado real, e eu gostaria que fosse divulgado se fosse eu que estivesse avaliando.

A Parloa está na lista mesmo assim por causa de uma coluna que ninguém mais consegue preencher. É o único fornecedor aqui cuja simulação reproduz suas transcrições históricas reais, misturadas com cenários sintéticos, e com rastreamento de causa raiz mais correções em nível de linha aplicadas diretamente na plataforma. A "simulação" de todos os outros roda cenários que você mesmo escreveu, então testa sua imaginação, não seu volume de chamadas. Já lançou um agente que passou em todos os testes que você inventou e depois quebrou na primeira ligação real? Então você já sabe o que vale essa distinção.

Em números, a empresa também é confiável. Uma Série D de $350M com avaliação de $3B em janeiro de 2026, mais de $50M de ARR, 150% de retenção líquida de receita.

Preço: baseado em consumo conforme a complexidade da tarefa, somente sob consulta. A página de preços não está no ar.

Veredito: numa migração grande, essa é a que eu mais defenderia, porque testar contra o histórico real antes do lançamento é a diferença entre um rollout controlado e um incidente público. Para uma equipe pequena que quer se mover rápido, encaixa mal, entre o ciclo de vendas e a tarifa ausente. Seja qual for sua escolha, combine com um design de handoff deliberado.

O que nenhuma dessas dez realmente resolve

Essa é a parte que mais me importa. Ela vem de trabalhar numa fila de suporte, não de ler tabelas de benchmark.

tau-Voice é um benchmark de suporte, não um teste de áudio genérico. Um chamador simulado liga para o modelo com um problema real, e a pontuação é se o banco de dados terminou no estado final correto. Literalmente "o problema do cliente foi resolvido". Melhor pontuação de toda a tabela: Grok Voice Think Fast 2.0, 56,5%. Toda página de fornecedor neste artigo anuncia de 70% a 95% de contenção.

Duas direções corroboram essa lacuna. A pesquisa da Sierra sobre tau-voice constata que todo fornecedor cai de 5 a 14 pontos percentuais na mudança de texto limpo para áudio telefônico realista, e atribui 79% dos primeiros erros críticos ao agente, não ao chamador. Operadores de contact center no Reddit colocam a automação completa real entre 15% e 30%. O que bate com o que vejo no trabalho de resolução automatizada de tickets no lado do texto.

Sobre o Grok especificamente, o sentimento da comunidade é mais caloroso do que meus números sugerem. As duas citações a seguir valem a leitura:

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

As duas são verdadeiras. Nenhuma muda os 56,5%. O modelo é o melhor disponível, e ainda assim conclui pouco mais da metade das tarefas de suporte.

Então, antes de gastar um trimestre nessa decisão, a pergunta que eu faria é quantas dessas chamadas existem porque algo mais acima no fluxo nunca foi respondido. Na própria pesquisa de clientes da eesel, o padrão que continuo encontrando é o inverso do que os fornecedores vendem. Uma equipe colocou isso claramente:

"The lack of voice recording support requires agents to summarize voice interactions for Eesel. Implementing this feature would significantly increase our usage."

Uma terceirizada de suporte para gestão de propriedades que usa a IA como copiloto do Zendesk

Leia de novo. O gargalo não era o bot de voz. O conteúdo das chamadas nunca chegava à IA de texto, então uma pessoa tinha que redigitar cada conversa telefônica antes que a automação pudesse tocá-la. Essa é a forma real da voz no trabalho de suporte. Chamadas e tickets são uma única fila usando duas fantasias, e o canal caro é o que todo mundo tenta automatizar primeiro.

Uma ordem de operações mais barata, geralmente: automatizar os canais de texto vem antes da linha telefônica. Depois a primeira resposta, e voz por último. Ainda dimensionando a categoria? Agentes de IA versus chatbots é o ponto de partida mais claro.

A questão do orçamento merece o mesmo cuidado. Um minuto de voz a $0.08–$0.14 não se compara a um ticket resolvido, então calcule os números de custo de agente versus humano sobre o seu próprio volume, não sobre uma calculadora de fornecedor. Um helpdesk de IA moderno fecha muito mais volume por dólar do que qualquer agente telefônico desta lista. E software de atendimento ao cliente com IA é onde a maior parte desse gasto deveria ir primeiro.

Experimente a eesel para os tickets por trás das chamadas

Painel da eesel AI mostrando a atividade de tickets do Zendesk conectados e estatísticas de resolução
Painel da eesel AI mostrando a atividade de tickets do Zendesk conectados e estatísticas de resolução

Direto ao ponto: a eesel não está nesta lista, porque a eesel não vende um modelo de voz nem uma linha telefônica. O que ela faz é o canal que alimenta sua linha telefônica.

Ela se conecta ao helpdesk que você já usa, Zendesk e Freshdesk incluídos. Aprende com a central de ajuda e o histórico de tickets já existentes, e então resolve o volume de e-mail e chat antes que qualquer coisa disso vire uma ligação às 16h.

Também existe um conector Front, além de Slack e o resto da stack. Ela atua como uma camada de IA conversacional sobre qualquer helpdesk que você use, não como um substituto dele.

A parte relevante para tudo o que foi dito acima: simulamos cada rollout contra seus próprios tickets históricos antes que ele responda a um único cliente real. Isso existe porque já vimos um bot de tom confiante dar uma resposta errada. Numa ligação telefônica não há rascunho para revisar, nada para retratar. A mesma disciplina pela qual a Parloa cobra preços de enterprise, e o motivo pelo qual eu não lançaria nenhum canal sem ela.

A cobrança é por resolução em vez de por assento, então um mês tranquilo custa menos em vez de custar o mesmo. Experimente a eesel de graça, ou agende uma demo se preferir ver antes rodando contra seu próprio histórico de tickets.

Perguntas frequentes

Quais são as melhores alternativas ao Grok Voice Think Fast 2?
Para uma simples troca de modelo, Grok Voice Think Fast 1.0 a $3.00/h e GPT-Realtime-2.1 são as duas opções mais próximas, e o Qwen Audio 3.0 Realtime Plus pontua acima do Grok no índice da Artificial Analysis. Para uma plataforma completa, veja ElevenLabs Agents, Vapi, Retell AI, Bland AI, PolyAI e Parloa. Comparo as dez em meu comparativo de ferramentas de suporte por voz.
Por que o preço do Grok Voice Think Fast 2 subiu?
Tecnicamente, não subiu. A versão 2.0 sempre custou $0.08/min. O que mudou em 5 de agosto de 2026 foi que o alias grok-voice-latest passou a apontar de 1.0 para 2.0, então quem usava esse alias passou de $0.05/min para $0.08/min sem fazer deploy de uma única linha de código. O detalhamento completo está no meu artigo sobre os preços do Grok Voice Think Fast 2.
Existe uma alternativa mais barata ao Grok Voice Think Fast 2?
Sim, e a mais barata é outro modelo da Grok. Fixar o grok-voice-think-fast-1.0 mantém você em $3.00/h em vez de $4.80/h, 37,5% a menos por um modelo que continua pontuando 97% em raciocínio de fala. O Gemini 3.1 Flash mede ainda mais barato, a $1.75/h, mas 13 pontos abaixo no índice.
Quanto custa um agente de voz com IA por minuto em 2026?
O modelo puro é a parte barata. O Grok Voice Think Fast 2.0 custa $0.08/min fixo, enquanto uma implementação de suporte realista com Retell AI fica em torno de $0.135/min e com Vapi em torno de $0.105/min depois de somar reconhecimento de voz, síntese de voz, um LLM e telefonia. Para o lado dos tickets do mesmo orçamento, veja custo de um agente de IA versus um agente humano.
Qual é o limite de sessões simultâneas no Grok Voice Think Fast 2?
Dez sessões simultâneas por equipe por padrão, com um teto de 120 minutos por sessão, ambos publicados na ficha do modelo. A xAI aumenta esse limite se você pedir. Se precisar de concorrência publicada maior, o ElevenLabs Business permite 40 chamadas simultâneas e a Vapi vende linhas a $10 cada. Minha análise do Grok Voice Think Fast 2 aprofunda esse teto.
Qual modelo de voz resolve mais chamadas de suporte?
O Grok Voice Think Fast 2.0, com 56,5% no benchmark tau-Voice, que mede se o problema de um chamador simulado realmente foi resolvido. O Qwen fica em segundo com 54,6%. Esse é o teto real da automação por voz hoje, bem abaixo dos 70% a 95% de contenção anunciados pelas páginas dos fornecedores, e a razão pela qual o design do handoff importa mais do que a escolha do modelo.
Preciso de um modelo de voz se meu suporte é majoritariamente e-mail e chat?
Provavelmente ainda não. Voz é o canal mais difícil de automatizar e o mais caro por interação, então a maioria das equipes avança mais automatizando primeiro os canais de texto e deixando que a linha telefônica carregue só o que realmente precisa de uma pessoa. A eesel se conecta ao Zendesk, Freshdesk e Gorgias e cobra por resolução, não por assento.

Share this article

Riellvriany Indriawan

Article by

Riellvriany Indriawan

Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.

Related Posts

All posts →
As melhores alternativas ao GPT-Live em 2026, um panorama de ferramentas de IA de voz em tempo real
Alternatives

As 8 melhores alternativas ao GPT-Live em 2026

O GPT-Live impressiona, mas não é a única IA de voz em tempo real que vale a pena conhecer. Aqui estão 8 alternativas ao GPT-Live em 2026, do Gemini Live aos construtores de agentes de voz.

Rama Adi NugrahaRama Adi NugrahaJul 13, 2026
Ilustração de seis plataformas de agentes de voz com IA como alternativas ao Grok Voice Agent Builder da xAI
Guides

6 alternativas ao Grok Voice Agent Builder para experimentar em 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow e Deepgram comparados com o Grok Voice Agent Builder da xAI em preço, latência e conformidade.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Ilustração editorial representando uma comparação de modelos de chat de IA como alternativas ao Grok 4.5
Alternatives

9 melhores alternativas ao Grok 4.5 em 2026

O Grok 4.5 é rápido e barato, mas está em 4º lugar no Intelligence Index e carrega uma bagagem real de confiança. Aqui estão 9 alternativas reais, e exatamente para quem cada uma serve.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Ilustração em linha de um desenvolvedor e um agente de suporte conversando por ondas de voz, ao lado do logotipo da Grok
Trending

Preço do Grok Voice Think Fast 2.0: o que $0.08/min custa

Grok Voice Think Fast 2.0 custa $0.08 por minuto de áudio, 60% acima do 1.0. O alias grok-voice-latest muda para ele hoje, então aqui está a matemática real por chamada.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustração em linha de um agente de suporte com fone de ouvido ao lado do logo do Grok, com uma forma de onda de voz em um balão de fala
Trending

Grok Voice Think Fast 2.0: o que mudou e quanto custa

O Grok Voice Think Fast 2.0 alcança 82,9% no índice speech-to-speech da Artificial Analysis e responde em 0,70s. Também custa 60% a mais por minuto, e o alias padrão passa a apontar para ele em 5 de agosto.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Um desenvolvedor escolhendo entre cartões de modelos, com o cartão da baleia DeepSeek no centro rodeado por modelos rivais
Alternatives

As 8 melhores alternativas ao DeepSeek V4 Flash em 2026

Oito alternativas reais ao DeepSeek V4 Flash, comparadas pelos números. Ninguém troca por preço ou velocidade, então eu as classifico pelas quatro lacunas reais que o Flash tem.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Ilustração de uma pessoa avaliando vários super-agentes de IA como alternativas ao Skywork AI
Alternatives

7 melhores alternativas ao Skywork AI em 2026

As melhores alternativas ao Skywork AI em 2026, de super-agentes gerais como Manus a ferramentas de pesquisa, criadores de apresentações e uma opção focada apenas em suporte, com preços reais.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Uma coluna alta e ornamentada ao lado de oito colunas menores de design variado
Alternatives

8 melhores alternativas ao Claude Opus 5 em 2026

O Claude Opus 5 lidera o índice independente por 1,8 pontos e custa 86 vezes mais por tarefa do que o modelo dez pontos abaixo. Oito alternativas, com preço baseado no custo medido por tarefa.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Um modelo pequeno posto de lado enquanto cinco modelos alternativos captam a luz
Alternatives

8 melhores alternativas ao Inkling-Small em 2026

O Inkling-Small é barato e rápido, mas sua pontuação de conhecimento medida é negativa. Aqui estão 8 alternativas ao Inkling-Small, com preços reais e a pegadinha de cada uma.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis