
O que eu realmente quero dizer com "modelo de voz"
Passei os últimos anos integrando o eesel a helpdesks, o que significa que li muitas páginas de fornecedores sobre IA que responde a clientes. Voz é a única categoria em que a afirmação de arquitetura é real e verificável, então vale a pena ser preciso sobre isso.
A maioria das stacks de voz é composta por três produtos disfarçados de um só: fala para texto, um modelo de linguagem, depois texto para fala, muitas vezes de três fornecedores diferentes. Cada salto adiciona latência, custo, e mais uma coisa que pode falhar às 2 da manhã. O próprio posicionamento da xAI no lançamento do Voice Agent Builder foi que isso é exatamente o que eles se propuseram a unificar, e o Think Fast 2.0 é o modelo que faz essa unificação.

Os modelos Think Fast fazem algo específico que eu não tinha visto virar produto antes: eles raciocinam enquanto já estão falando. A xAI descreve isso como raciocinar em paralelo com a fala, então o pensamento não fica na frente da primeira sílaba. Na prática, uma chamada de ferramenta geralmente dispara antes de o agente terminar a primeira frase. Esse é todo o truque por trás dos 0,70 segundo, e explica por que o modelo consegue ser rápido e, ao mesmo tempo, incomumente bom em trabalhos de múltiplas etapas, duas coisas que normalmente se contrapõem.
O Think Fast 2.0 também cortou bastante os tokens de raciocínio. A xAI relata que a resposta mediana usa 0,4x os tokens de raciocínio do Think Fast 1.0, o tipo de mudança que se sente numa ligação longa, não numa demo.
A tabela de benchmarks, e as duas linhas que costumam passar batido
Aqui está o que a xAI publicou no dia do lançamento, com fonte na Artificial Analysis.
| Benchmark | Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|---|
| AA Speech-to-Speech Quality Index | 82,9% | 75,7% | 79,1% | 69,5% |
| Raciocínio de voz (Big Bench Audio) | 97,2% | 97,1% | 96,0% | 96,6% |
| Dinâmica conversacional (Full Duplex Bench) | 95,1% | 77,8% | 95,7% | 74,3% |
| Desempenho agêntico (τ-voice Bench) | 56,5% | 52,1% | 45,7% | 37,7% |
| Tempo até o primeiro áudio | 0,70s | 1,25s | 1,21s | 2,98s |
Há algumas coisas que eu apontaria se você estivesse lendo isso por cima do meu ombro.
Primeiro, a linha mais importante para suporte é o τ-voice Bench com 56,5%, e o Grok vence por quase 11 pontos sobre o melhor da OpenAI. O τ-voice mede agentes em condições realistas de ligação: ruído, sotaques, interrupções, quem liga mudando de ideia no meio da frase. É a aproximação publicada mais próxima de "isso consegue rodar um fluxo de trabalho real numa linha telefônica real". Um teto de 56,5% também significa que cerca de dois em cada cinco desses cenários difíceis ainda falham, o número que eu colocaria na frente de qualquer um que prometa automação total.
Segundo, a linha de dinâmica conversacional é a que a xAI não vence. O GPT-Realtime-2.1 High supera por pouco, 95,7% contra 95,1%, e o salto do Grok vem de 77,8%, então esse foi claramente o ponto corrigido nesta versão. Convenhamos, é um avanço de 17 pontos.
Agora o contexto que a própria tabela da xAI deixa de fora. Ao abrir o ranking completo da Artificial Analysis, o Think Fast 2.0 fica em segundo no geral, não em primeiro. O Qwen Audio 3.0 Realtime Plus, da Alibaba, está em 84,1%. Ele também leva 4,02 segundos para começar a falar, contra 0,70, o que numa linha telefônica é a diferença entre uma conversa e silêncio morto. Mesma história na latência: o Deepslate Opal responde em 0,44s e o Gemini 2.5 Flash Native Audio Dialog em 0,63s, ambos mais rápidos que o Grok, e ambos bem atrás no índice. O que o Grok reivindica é a combinação, e nessa combinação ele é o melhor da tabela.
A troca de alias de 5 de agosto, em dólares
Essa é a parte que eu realmente colocaria num lembrete de calendário.

Segundo a página de preços da xAI, a tabela de tarifas de voz é assim:
| Modelo ou modo | Tarifa |
|---|---|
Speech to speech, grok-voice-think-fast-1.0 | $0,05 / min ($3,00 / h) áudio, $0,004 / entrada de texto |
Speech to speech, grok-voice-think-fast-2.0 | $0,08 / min ($4,80 / h) áudio, $0,004 / entrada de texto |
| Speech to text | $0,10 / h (REST), $0,20 / h (streaming) |
| Text to speech | $15,00 / 1M caracteres |
A posição da xAI sobre a migração é que nenhuma ação é necessária para atualizar, e que para permanecer na 1.0 é preciso fixar grok-voice-think-fast-1.0 antes de 5 de agosto. As duas metades disso são verdadeiras. O que não é dito em voz alta é que o caminho padrão é o mais caro, e um aumento de 60% por minuto chega sem que você precise fazer nenhum deploy do seu lado. Se você lida com algum volume, calcule quanto isso custa antes que aconteça, não depois.
Dois outros medidores acompanham isso. Um número de telefone provisionado no Voice Agent Builder custa $0,01 por minuto a mais. As ferramentas do lado do servidor são cobradas por invocação: busca na web e busca no X a $5 por 1.000 chamadas, busca em coleções de documentos a $2,50 por 1.000, busca de anexos de arquivo a $10 por 1.000. Um agente de suporte que consulta algo em quase toda ligação compra esses serviços aos milhares, então é preciso incluí-los na conta.
O que 5 de agosto custa para você
Escolha o seu tempo de conversa mensal. As tarifas são as publicadas pela xAI mais $0,01/min por um número provisionado.
Um alerta ao comparar isso com qualquer outro fornecedor: a xAI publica um preço fixo por minuto, enquanto OpenAI e Google cobram por token de áudio. A Artificial Analysis normaliza isso como custo por hora de áudio de entrada, e nessa base o Think Fast 2.0 marca $4,80, o GPT-Realtime-2.1 High marca $10,75, e o Gemini 3.1 Flash High marca $1,75. O número do Grok é exatamente 60 vezes sua tarifa por minuto publicada, então é uma tabela de preços real. Os outros dois são medições de uma única rodada de benchmark, e vão variar conforme o quanto o agente fala. Se você está escolhendo entre eles, leia bem os preços da API Realtime da OpenAI em vez de confiar numa única coluna normalizada.
A transcrição é o upgrade discreto
A tabela de benchmarks chama a atenção, mas acho que o trabalho de transcrição é a mudança mais útil se você for colocar isso numa linha telefônica.
A xAI avaliou milhares de frases curtas em 24 idiomas e relata que o Think Fast 2.0 supera modelos de transcrição dedicados: de 1,5x a 2,0x melhor taxa de erro de palavras do que o Deepgram Nova 3 e o ElevenLabs Scribe v2, e 1,4x melhor que o Think Fast 1.0. A afirmação que mais me interessa é a do ruído, em que dizem que a diferença para a transcrição de voz dedicada aumenta para cerca de 10x sob ruído de fundo e compressão de telefonia.
Essa é a condição real das ligações de suporte. Ninguém liga para o suporte de uma cabine de gravação. As pessoas ligam de um carro, de um depósito, de uma cozinha com uma criança por perto. Se você já viu uma transcrição transformar "cancelar meu pedido" em outra coisa completamente diferente, sabe que uma única palavra errada vira um fluxo de trabalho inteiro errado. Quem opera suporte multilíngue deveria olhar o gráfico por idioma do anúncio em vez da média, porque a variação entre esses 24 idiomas é grande.
Há dois parâmetros de sessão pensados especificamente para tapar as lacunas restantes, e vale a pena conhecê-los desde o primeiro dia. audio.input.transcription.keyterms inclina a transcrição para até 100 termos de 50 caracteres cada, onde entram os nomes dos seus SKUs e planos. replace mapeia uma frase para uma substituição falada antes do texto-para-fala, de modo que o áudio pronuncie corretamente o nome da sua marca enquanto a transcrição mantém a grafia original. O exemplo da documentação mapeia "Acme Mobile" para "Acme Mobull", o que mostra exatamente o quanto essa função é pouco glamorosa e, ainda assim, necessária.
O que realmente envolve construir sobre ele
Li a documentação de speech-to-speech da mesma forma que leio qualquer API que talvez eu tenha que dar suporte depois, procurando as partes que vão morder mais tarde. Aqui vão algumas notas dessa leitura.
A API é compatível a nível de protocolo com a API Realtime da OpenAI. Você aponta o WebSocket para wss://api.x.ai/v1/realtime, troca a chave, e a maior parte do código cliente existente funciona. Esse é um custo de troca deliberadamente baixo, e é o argumento comercial mais forte que a xAI tem aqui. Não é uma compatibilidade perfeita: conversation.item.done, rate_limits.updated e alguns eventos output_audio_buffer.* não são emitidos, e conversation.item.input_audio_transcription.delta é renomeado para .updated com payloads cumulativos em vez de incrementais. Se você construiu algo em cima desses eventos, esse é o seu trabalho de portabilidade. As diferenças nas chamadas de ferramentas também vale a pena ler.
As ferramentas vêm em cinco tipos: function para suas próprias APIs, file_search sobre coleções de documentos enviadas, web_search, x_search, e servidores mcp remotos. O suporte a MCP é o que eu usaria, porque significa que sua ferramenta interna existente fica acessível sem precisar escrever uma camada específica para voz.
O raciocínio vem por padrão com esforço high. Você pode definir reasoning.effort como "none" para desativá-lo. Vale a pena notar porque uma reclamação real no Hacker News sobre a geração anterior era exatamente o oposto:
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"
Três extensões específicas da xAI são as que eu apontaria para quem está construindo uma linha de suporte:
force_messagefala uma linha codificada e sintetizada por TTS sem envolver o modelo, com uma flaginterruptible. É assim que você entrega "esta ligação está sendo gravada" ao pé da letra, todas as vezes, o que é um requisito de conformidade, não um recurso legal de se ter.resumptionarmazena em cache os turnos em relação a umconversation_ide os reproduz na reconexão. Desativado por padrão. Sem isso, um WebSocket que cai perde a conversa, e quem liga do celular derruba a conexão o tempo todo.idle_timeout_msfaz o servidor voltar a interagir com quem está em silêncio por meio de um temporizador que se rearma a cada resposta. Essa é a diferença entre um agente paciente e um silêncio constrangedor.
O conselho de migração na documentação é o oposto do que você esperaria: deixe o prompt de sistema mais curto, não mais longo. A orientação da xAI é pedir ao Grok que generalize seu prompt existente em vez de portá-lo ao pé da letra, e remover truques de prompt escritos para corrigir casos extremos do modelo anterior. Já fiz esse exercício com nossos próprios prompts ao longo de várias atualizações de modelo. É desconfortável e geralmente é a coisa certa a fazer; as soluções alternativas acumuladas são o que faz um prompt ficar, aos poucos, impossível de manter.
Funciona em produção? A Starlink é a única evidência real
Benchmarks são uma coisa. O único caso de implantação para o qual qualquer um dos dois anúncios traz números é a linha de vendas e suporte da Starlink, que roda no Grok Voice, e os números que a xAI publicou junto com o Think Fast 1.0 valem a pena serem citados exatamente:
- Taxa de conversão de 20%. Uma em cada cinco consultas de vendas compra o serviço da Starlink enquanto está ao telefone com o Grok.
- Taxa de resolução de 70%. A maioria das consultas de suporte é resolvida de forma autônoma, sem humano no processo.
- 28 ferramentas. Um agente, dezenas de ferramentas distintas, em centenas de fluxos de trabalho de suporte e vendas.
- Solução de problemas de hardware, substituições de hardware e créditos de serviço são todos concedidos de forma autônoma.
São números fortes, e são de primeira mão, o que funciona nos dois sentidos. Starlink e xAI têm o mesmo dono, então essa é a melhor implantação possível, com a maior atenção de engenharia disponível. Uma taxa de resolução autônoma de 70% é real, e também é o que se obtém com uma equipe dedicada construindo 28 ferramentas para uma única linha de negócio.
Para o Think Fast 2.0 especificamente, a xAI diz que testes A/B nessa mesma linha da Starlink mostraram "um aumento significativo na taxa de conversão de vendas e na taxa de contenção de suporte" e não publica nenhum número para nenhum dos dois. Eu gostaria de ter o número. Até que exista, a leitura honesta é que a 2.0 é melhor em benchmarks e provavelmente melhor em produção, com base na palavra do fornecedor.
A repercussão na comunidade ainda é escassa, o que por si só já diz algo sobre quem está prestando atenção. O tópico de lançamento no Hacker News reuniu cinco pontos e dois comentários:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
O sinal mais útil vem de quem já convive com a geração anterior:
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
E a versão mais calibrada da mesma opinião, na qual eu mais confiaria:
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
Quem deveria realmente adotar isso
Sim, claramente, se você opera uma linha telefônica de alto volume e a latência é o que está te matando. Menos de um segundo até o primeiro áudio somado à melhor pontuação agêntica publicada não é uma decisão apertada contra as alternativas, e a compatibilidade com o OpenAI Realtime faz com que o seu teste custe um dia, não um sprint. Quem está montando automação de call center do zero deveria colocá-lo na lista curta.
Sim, claramente, se você é desenvolvedor e quer pular a montagem da stack. O Voice Agent Builder empacota telefonia, recuperação de dados, guardrails e revisão de ligações, com SIP para números que você já possui. Isso é tempo real economizado em comparação com montar quatro fornecedores, e as alternativas quase todas cobram uma taxa de plataforma a mais. Vale notar que o modelo de voz tem versionamento separado da linha de texto, então lançamentos como o do Grok 4.5 não o afetam.
Ainda não, se o seu volume de suporte é e-mail e chat. Esse é o erro que vejo equipes cometerem: veem um ótimo número de voz e começam a planejar um projeto de desvio telefônico, quando a maior parte da fila deles nunca liga para ninguém. Voz é um canal, não uma estratégia. Comece por onde estão os tickets, e se sua linha telefônica já está conectada a um helpdesk, verifique o que sua integração telefônica do Gorgias ou equivalente já faz antes de adicionar uma segunda stack.
Ainda não, se você precisa provar segurança antes de ir ao ar. Não existe uma forma publicada de fazer um ensaio do Think Fast 2.0 contra suas próprias ligações históricas antes de direcionar tráfego para ele. Gravação de chamadas, transcrições e guardrails existem depois do fato, no Builder. Isso é revisão, não ensaio, e a distinção importa quando o agente pode emitir reembolsos. A mesma lacuna aparece em toda a categoria, e é por isso que prevenir respostas erradas da IA é, na maior parte, um problema de processo, não de modelo.
Cuidado se você já está no grok-voice-latest. Veja a calculadora acima. Amanhã.
Quer o mesmo para sua fila de tickets?
O Grok Voice é bom no telefone. O problema é que, para a maioria das equipes de suporte, o telefone é o canal pequeno, e a fila de tickets é onde realmente está o volume.
Essa é a metade que o eesel faz. Ele se conecta a Zendesk, Freshdesk, Gorgias, Front, HubSpot e outros, treina com seus tickets passados, macros e central de ajuda em vez de um prompt que você teria que escrever do zero, e redige ou envia respostas dentro do helpdesk que seus agentes já têm aberto. Nenhuma ferramenta nova para ninguém aprender.
O que eu apontaria, considerando tudo o que foi dito acima sobre a lacuna entre um benchmark e uma fila real: antes de ativar, o eesel simula o agente contra o seu próprio histórico de tickets e informa o que ele teria respondido e com que frequência. Essa é a etapa de ensaio que falta às stacks de voz. Ela existe porque já vi um bot com jeito confiante responder errado, e prefiro descobrir isso nos tickets do mês passado do que nos de hoje de manhã.
A visão de um cliente sobre por que essa etapa importa, uma citação anonimizada de uma responsável por CX de uma empresa de suplementos DTC com quem conversamos:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Essa é a configuração, não uma ressalva. Roteamento por confiança, exclusão por tipo de ticket, e uma simulação antes de ir ao ar.

Grátis para testar, e você pode ter ele respondendo seus próprios tickets em poucos minutos. Experimente o eesel.
Perguntas frequentes
O que é o Grok Voice Think Fast 2.0?
O modelo de voz speech-to-speech principal da xAI, anunciado em 29 de julho de 2026, que ouve, raciocina e fala em um único caminho de modelo em vez de encadear três serviços. Esse caminho único é de onde vêm os 0,70 segundo até o primeiro áudio. Ele se torna o modelo por trás do grok-voice-latest em 5 de agosto de 2026. Se o seu objetivo é e-mail e chat em vez de ligações, um agente de IA para helpdesk se encaixa melhor.
Quanto custa o Grok Voice Think Fast 2.0 por minuto?
$0,08 por minuto de áudio, ou $4,80 por hora, mais $0,004 por entrada de texto. O Think Fast 1.0 continua listado a $0,05 por minuto, então o preço do Grok Voice Think Fast 2.0 representa um salto de 60% por minuto. Um número provisionado adiciona $0,01 por minuto, e as chamadas de ferramentas são cobradas separadamente. Pese isso contra seu panorama mais amplo de custo de atendimento ao cliente com IA, e contra o que custa um agente humano.
O Grok Voice Think Fast 2.0 é mais rápido que o GPT-Realtime?
Sim, segundo a medição publicada: 0,70 segundo até o primeiro áudio contra 1,21 segundo do GPT-Realtime-2.1 High. Porém, não é o modelo mais rápido do ranking. O Deepslate Opal responde em 0,44s e o Gemini 2.5 Flash Native Audio Dialog em 0,63s, ambos mais abaixo no índice de qualidade. A comparação com a API Realtime da OpenAI cobre a troca do outro lado, incluindo WebRTC versus WebSocket como transporte.
Preciso atualizar do Think Fast 1.0?
Só se você não fizer nada. Em 5 de agosto de 2026, o grok-voice-latest deixa de apontar para grok-voice-think-fast-1.0 e passa a apontar para grok-voice-think-fast-2.0, então fixar a versão antiga antes disso é o que te mantém nela. Fixar versões em produção é uma boa prática de qualquer forma, o mesmo instinto por trás de testar as respostas da IA antes que os clientes as vejam.
O Grok Voice Think Fast 2.0 consegue lidar com ligações de suporte ao cliente?
Ele foi projetado exatamente para isso. A linha da Starlink roda no Grok Voice com 28 ferramentas, 70% de resolução autônoma e 20% de conversão de vendas, e o modelo faz chamadas de função, busca em documentos, MCP e transferência para humanos. A visão realista está em se a IA consegue atender ligações de suporte, e o lado operacional em como automatizar o suporte por telefone e na gestão de escalonamento com IA.
Qual é a precisão de transcrição do Grok Voice Think Fast 2.0?
A xAI relata uma taxa de erro de palavras 1,4x melhor do que o Think Fast 1.0 e de 1,5x a 2,0x melhor do que o Deepgram Nova 3 e o ElevenLabs Scribe v2 em 24 idiomas, com a diferença aumentando para cerca de 10x em áudio com ruído. Verifique o gráfico por idioma em vez da média se você opera suporte multilíngue, porque a precisão varia por idioma, e é a cauda que prejudica o seu CSAT.
O Grok Voice funciona com Zendesk ou Gorgias?
Não nativamente. O Grok Voice é um modelo e um builder, então qualquer escrita de volta ao helpdesk é uma ferramenta de função ou um servidor MCP que você mesmo conecta. Se você quer IA dentro do helpdesk em vez disso, comece pelo Zendesk AI ou pelo Freddy do Freshdesk. No lado da telefonia, a configuração do Zendesk Talk é o equivalente nativo mais próximo. De qualquer forma, trate a voz como mais um canal alimentando a mesma fila.
O Grok Voice Think Fast 2.0 vale a pena em relação ao Think Fast 1.0?
Para uma carga de trabalho agêntica exigente, provavelmente sim: 82,9% contra 75,7% no geral, além de quase metade da latência e um salto de 17 pontos na dinâmica conversacional. Para uma linha de FAQ simples em que a 1.0 já resolve o que você precisa, o aumento de 60% na tarifa compra uma precisão que talvez você não use. Compare isso com sua própria taxa de resolução e com o ROI do call center antes de deixar o alias decidir por você. Se você está comparando toda a linha, os preços da xAI são o próximo passo.
Sources
- Grok Voice Think Fast 2.0, xAI, July 29, 2026
- Grok Voice Think Fast 1.0, xAI, April 23, 2026
- Introducing the Voice Agent Builder, xAI, July 1, 2026
- 21 New Flagship Grok Voices, xAI, July 6, 2026
- xAI pricing, voice API rates, last updated July 3, 2026
- Speech to Speech API docs, xAI, last updated August 2, 2026
- Speech to Speech models leaderboard, Artificial Analysis
Perguntas frequentes
O que é o Grok Voice Think Fast 2.0?
grok-voice-latest em 5 de agosto de 2026. Se o seu objetivo é responder e-mail e chat em vez de ligações, um agente de IA para helpdesk se encaixa melhor.Quanto custa o Grok Voice Think Fast 2.0 por minuto?
O Grok Voice Think Fast 2.0 é mais rápido que o GPT-Realtime?
Preciso atualizar do Grok Voice Think Fast 1.0?
grok-voice-latest deixa de apontar para grok-voice-think-fast-1.0 e passa a apontar para grok-voice-think-fast-2.0. Para permanecer no modelo antigo, mais barato, fixe explicitamente grok-voice-think-fast-1.0 antes dessa data. Fixar a versão é, de qualquer forma, o que a xAI recomenda para produção, a mesma disciplina por trás de prevenir respostas erradas da IA.O Grok Voice Think Fast 2.0 consegue lidar com ligações de suporte ao cliente?
Qual é a precisão de transcrição do Grok Voice Think Fast 2.0?
Como o preço do Grok Voice Think Fast 2.0 se compara a outras APIs de voz?
Onde o Grok Voice Think Fast 2.0 não ajuda?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








