
O que eu realmente testei, e o que não consegui
Quero ser direto sobre a base disso, porque "eu testei" é uma frase usada de forma bem solta quando o assunto é modelo de voz.
O que estudei a fundo: a documentação de fala para fala da xAI de ponta a ponta, além da ficha do modelo com seus limites publicados e a tabela de preços da página de preços.
Além disso, o post de lançamento e a avaliação independente da Artificial Analysis, que o comparou com outros 27 modelos. Depois li o que quem está construindo com ele está dizendo.
O que não posso afirmar: não rodei mil chamadas reais de produção por uma linha telefônica em uso com ele. Fora a xAI, ninguém fez isso, exceto a Starlink. Então, quando este texto disser algo sobre o comportamento sob carga, isso vem de um limite publicado e não de uma experiência real, e sempre vou indicar qual dos dois é.
Eu construo agentes de IA na eesel para viver, principalmente a parte que fica entre um modelo e uma conversa real com o cliente. Essa é a lente usada aqui. A pergunta não é "isso impressiona numa demonstração?". É "o que quebra numa terça-feira à tarde quando 40 pessoas ligam ao mesmo tempo?".
O placar
Aqui está todo o veredito reunido antes de entrar nos detalhes.
| Dimensão | Pontuação | Minha leitura |
|---|---|---|
| Fluxo conversacional | 95,1% Full Duplex Bench | A grande correção. A versão 1.0 marcava 77,8%. Interrupções e sobreposições deixaram de ser o ponto fraco. |
| Inteligência bruta | 82,9% índice AA | Segundo lugar geral, atrás do Qwen com 84,1%. Próximo o suficiente para não ser o fator decisivo. |
| Comportamento agêntico | 56,5% τ-voice | O melhor da tabela, mas apenas 1,9 ponto à frente do Qwen, com 54,6%. |
| Latência | 0,70s até o primeiro áudio | Terceiro mais rápido. Rápido o suficiente para quem liga não perceber. |
| Transcrição | 1,4 vez melhor que a 1.0 | Um avanço real, e o que a xAI menos divulgou. |
| Design da API | Compatível a nível de protocolo com o OpenAI Realtime | A melhor parte do produto. As extensões parecem escritas por alguém que já lançou um agente telefônico antes. |
| Previsibilidade de custo | $4,80/h medido, $4,80/h de tabela | Cobrança fixa por minuto. Raro, e vale mais do que parece. |
| Margem de escala | 10 sessões simultâneas | O problema. Tudo acima é minado por essa única linha. |
| Opções de implantação | Apenas us-east-1 | Sem região na UE. Para muitas equipes, isso encerra a conversa. |
Veredito: o modelo merece uma recomendação forte, e a plataforma merece um "confira seu volume primeiro". São dois produtos diferentes, e as análises costumam avaliar só o primeiro.
Onde ele se destaca
Quatro coisas se destacaram, e só uma delas é o número com que a xAI abriu o lançamento. Juntas, elas descrevem um tipo específico de modelo: não o mais inteligente disponível, mas o que se mantém afiado enquanto responde rápido o suficiente para uma linha telefônica.
As interrupções deixaram de ser o ponto fraco
A maior mudança em relação à 1.0 é o Full Duplex Bench, que mede como um modelo lida com as partes bagunçadas de uma conversa real: interrupções, sobreposições, sinais de escuta, alguém mudando de ideia no meio de uma frase. A 1.0 marcava 77,8%. A 2.0 marca 95,1%.
Esse é o número que separa um agente de voz que as pessoas toleram de um que faz esquecerem que é uma máquina. Quem já ouviu gravações de chamadas conhece a falha típica: quem liga começa a se corrigir, o bot continua falando por cima, e a pessoa acaba repetindo mais alto ou pedindo para falar com um humano. Isso aparece perto do topo de qualquer lista de problemas de chatbot que fazem os clientes desistirem, e os padrões de transferência em qualquer implantação séria existem principalmente para capturar exatamente esse momento.
Vale destacar, para ser justo: essa é a única linha em que o Grok perde para a OpenAI. O GPT-Realtime-2.1 High marca 95,7%. Uma diferença de 0,6 ponto não é algo que quem liga perceberia, mas a tabela de lançamento também não vai se dar ao trabalho de mencionar isso.
A pontuação agêntica é a verdadeira manchete
O τ-voice mede se um modelo consegue de fato concluir uma tarefa por voz, em vez de apenas soar bem enquanto tenta. Consultar um pedido, verificar uma política, depois chamar uma função e voltar com a resposta correta. O Grok Voice Think Fast 2.0 marca 56,5% aqui, o número mais alto de toda a tabela da Artificial Analysis.

Isso importa mais que o índice geral para quem constrói um agente de verdade, porque um agente de voz que não consegue usar ferramentas de forma confiável é apenas um leitor de FAQ muito caro. É a mesma distinção que separa agentes de IA de chatbots de IA no texto, e a mesma razão pela qual os exemplos úteis de agentes de IA são sempre os que tocam um sistema real em vez de apenas recitar um artigo.
A ressalva honesta: o Qwen Audio 3.0 Realtime Plus fica em 54,6% no mesmo benchmark. Então a vantagem do Grok é de 1,9 ponto, o que não é o abismo que a apresentação sugere. A diferença em relação ao melhor resultado da OpenAI, 45,7%, é maior, e é daí que vem a frase "10 pontos à frente", mas o Qwen está bem ali ao lado.
A combinação de velocidade e inteligência
0,70s até o primeiro áudio, contra os 1,25s da versão 1.0. O Deepslate Opal é mais rápido, com 0,44s, e uma variante do Gemini Flash chega a 0,63s, então o Grok fica em terceiro. Mas o Qwen, o modelo que o supera no índice geral, leva 4,02s até o primeiro áudio. Numa linha telefônica isso é uma pausa morta longa o suficiente para quem liga dizer "alô?".
Essa troca é o verdadeiro produto. Alguém no Hacker News colocou isso melhor do que o próprio post de lançamento:
"Grok voice is the best voice AI voice assistant and it's not even close.
The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
A xAI também afirma que os tokens de raciocínio rodam a 0,4x o P50 do antecessor, que é como o modelo ficou mais rápido ao ficar mais inteligente, em vez de pensar menos.
A transcrição é a parte subestimada
Enterrado no post de lançamento: a precisão da transcrição é 1,4 vez melhor que na 1.0, e de 1,5 a 2,0 vezes melhor que o Deepgram Nova 3 e o ElevenLabs Scribe v2 em 24 idiomas. Em áudio com ruído ou de telefonia, a diferença alegada gira em torno de 10 vezes.
O áudio de telefonia é onde a transcrição costuma falhar mais, e é exatamente o tipo de áudio que uma linha de suporte lida o dia todo. Se você está avaliando isso frente ao ElevenLabs ou a um fornecedor dedicado de voz para texto, esse número de áudio ruidoso merece mais peso do que os benchmarks conversacionais. É também o eixo em que o endpoint de transcrição da OpenAI tem sido a escolha padrão, em grande parte por inércia.
Agora há 26 vozes no catálogo, depois de 21 terem sido adicionadas em julho de 2026, e qualquer uma delas pode ser trocada por um ID de voz clonada. Se você já lutou para manter um bot soando como sua marca em vários canais, o problema da voz da marca não desaparece só porque a saída agora é áudio.
Onde a tabela de benchmarks exagera
Três coisas que a narrativa do lançamento não conta.
82,9% é o segundo lugar. O Qwen Audio 3.0 Realtime Plus está em 84,1%. O Grok é competitivo com ele, e bem mais rápido, mas "estado da arte" faz bastante trabalho no texto de marketing. Se você acompanhou a família de modelos do Qwen ou o que a Alibaba cobra recentemente, sabe que eles vêm lançando produtos num ritmo forte.
Não compare diretamente os dois números de τ-voice da xAI. O post do Voice Agent Builder de 1º de julho relata que a Think Fast 1.0 marcou 67,3% em sua própria medição de τ-voice. A Artificial Analysis avalia o mesmo modelo em 52,1%. Metodologias diferentes, escalas diferentes. Empilhar esses dois números num gráfico de "olha quanto melhorou" não compara nada de fato. O mesmo cuidado se aplica aos números do preço do Voice Agent Builder, que ainda citam a tarifa antiga.
Os números da Starlink pertencem à 1.0. A taxa de conversão de vendas de 20% e a taxa de resolução autônoma de 70%, amplamente citadas, vindas da linha +1 888 GO STARLINK com 28 ferramentas conectadas, são resultados da Think Fast 1.0. Para a 2.0, a xAI diz que testes A/B na mesma linha mostraram "um aumento significativo" na conversão e na contenção, sem publicar nenhum número. Também é uma implantação interna dentro da mesma estrutura de propriedade, o que a torna mais um melhor caso possível do que um exemplo representativo.
Construindo com ele: a API é a parte boa
Eu esperava que a documentação fosse o ponto fraco aqui, e foi exatamente o contrário. Em termos de design, essa é a API de voz em tempo real mais bem pensada que já li.

É compatível a nível de protocolo com o OpenAI Realtime em wss://api.x.ai/v1/realtime, então se você já tem um aplicativo existente, a migração se resume a uma URL base e uma chave. Você pode até manter o SDK da OpenAI e apenas apontá-lo para https://api.x.ai/v1. Quatro coisas não são mantidas: conversation.item.done, rate_limits.updated e a maioria dos eventos output_audio_buffer.* não são emitidos, e ...input_audio_transcription.delta é renomeado para .updated e passa a ser cumulativo, o que vai corromper silenciosamente a exibição da sua transcrição se você estava concatenando os deltas.
As extensões exclusivas da xAI são onde fica interessante, e parecem escritas por gente que já lançou um agente telefônico e se queimou com isso:
force_messagefala uma linha fixa via TTS sem envolver o modelo de forma alguma. Cominterruptible: false, o áudio de quem liga é descartado até o fim da fala. Isso resolve de forma adequada o problema da divulgação de conformidade, em vez de torcer para que o prompt do sistema se sustente.replaceé um mapa de pronúncia aplicado antes do TTS, de modo que o áudio diga "Acme Mobull" enquanto a transcrição continua lendo "Acme Mobile". A correspondência ignora maiúsculas e minúsculas, respeita limites de palavra inteira, e prioriza a correspondência mais longa.resumptionarmazena em cache os turnos porconversation_ide os reproduz ao reconectar. Desativado por padrão, ambos os lados precisam aderir, e o histórico expira após 30 minutos de inatividade.keytermsdireciona a transcrição para até 100 termos de domínio de 50 caracteres cada, atualizáveis durante a sessão. Para uma linha de suporte cheia de SKUs e nomes de planos, isso é a diferença entre uma transcrição usável e uma bagunça.idle_timeout_msse rearma após cada resposta, então o agente pode tentar contato de novo com quem ficou em silêncio repetidamente, em vez de simplesmente esperar.
O parâmetro reasoning.effort aceita exatamente dois valores: "high" (o padrão) e "none". Não há um meio-termo, e essa é uma lacuna real. Alguém levantou exatamente esse ponto no Hacker News sobre um lançamento anterior de voz do Grok:
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models
Just give me a option to have a slower response but better model…"
Outra coisa que a documentação acerta, e que a maioria dos fornecedores deixa você descobrir na prática: eles orientam explicitamente a esperar o áudio terminar de tocar antes de enviar response.create depois de uma chamada de ferramenta, porque o servidor entrega todos os deltas de áudio antes dos eventos de chamada de função. Pular isso gera fala sobreposta. Eles até sugerem mostrar um indicador de "pensando" durante essa lacuna. Esse é um detalhe conquistado com dificuldade, e está documentado.
O próprio guia de migração aconselha deixar o prompt do sistema mais curto, não mais longo, o que diz bastante sobre como o modelo foi ajustado.
Os três limites que realmente vão impedir você de colocar em produção
Se eu fosse a pessoa avaliando isso, essa seria a seção que eu leria primeiro.

10 sessões simultâneas por equipe. Esse é o padrão publicado na ficha do modelo, que pode ser aumentado sob solicitação. Dez chamadas simultâneas é apenas uma segunda-feira de manhã comum para uma equipe pequena de suporte. Todos os benchmarks acima são irrelevantes se a décima primeira chamada não conseguir se conectar, e "aumentável sob solicitação" é uma conversa comercial, não uma opção de configuração. Quem estiver dimensionando um agente de IA para call center deveria tratar isso como a primeira pergunta, não como uma nota de rodapé.
Para efeito de comparação, os produtos de voz empacotados construídos sobre um helpdesk geralmente não publicam nenhum teto de sessões, porque a concorrência é problema do fornecedor, e não seu. Isso vale para os agentes de voz com IA da Zendesk, para a configuração do Freshcaller, e para o agente de voz da Salesforce. Você troca flexibilidade por deixar outra empresa cuidar do planejamento de capacidade.
Apenas us-east-1. Uma única região, sem opção de UE. Se você tem compromissos de residência de dados, isso já decide a questão antes mesmo de avaliar qualquer outra coisa.
Sem nível prioritário nem desconto por lote. O nível prioritário 2x é exclusivo para Chat Completions e Responses. O desconto de 20% em lote é só para modelos de texto. A voz não tem nem faixa rápida nem desconto por volume, então a tarifa que você vê é a tarifa que você paga em qualquer escala. Também há uma duração máxima de sessão de 120 minutos, generosa para suporte e um pouco apertada para algo como uma linha monitorada.
Dois detalhes menores que vale conhecer. O armazenamento é cobrado separadamente se o seu agente fizer buscas: coleções custam $0,10/GiB/dia, arquivos $0,025, downloads $0,20/GiB. E há uma taxa de $0,05 por violação das diretrizes de uso para cada requisição de Responses bloqueada antes de ser gerada.
Migrar para a 2.0 ou fixar a 1.0?
A troca de alias em 5 de agosto faz com que não fazer nada já seja, por si só, uma decisão. Escolha a linha que descreve você.
O que você está usando hoje?
Escolha uma opção. O veredito muda bastante dependendo de qual delas é você.
No volume de uma demonstração, o aumento de 60% é um erro de arredondamento, e o salto do Full Duplex de 77,8% para 95,1% é a diferença entre uma demonstração que convence e uma que não convence. Deixe a troca de alias te levar junto.
Seu custo por minuto vai de $0,05 para $0,08 em 5 de agosto sem nenhuma ação do seu lado. Com 2.000 minutos por mês, isso é de $100 a $160 a mais. A melhora no fluxo conversacional vale a pena, mas mostre o número para quem precisa aprovar antes que a fatura faça isso por você.
10 sessões simultâneas por equipe é o padrão publicado, e aumentar isso é uma conversa com a xAI, não uma mudança de configuração. Consiga esse número por escrito antes de avaliar qualquer outra coisa. Uma pontuação de 95,1% no Full Duplex não faz nada pela décima primeira chamada.
A fala para fala roda apenas em us-east-1, sem nenhuma região da UE publicada. Nenhuma pontuação neste texto muda isso. Reavalie quando a xAI publicar uma segunda região.
O que quem constrói com ele realmente diz
O X é o lugar natural para reações à xAI, mas hoje está difícil de ler com profundidade, então o sinal útil está no Hacker News. Dois tópicos concentram a maior parte disso.
O comentário mais votado no tópico da Think Fast 2.0 é, em essência, uma reclamação sobre o lançamento ter passado despercebido:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
Essa é uma leitura justa sobre a capacidade, e vale notar que os preços também convergiram agora. Todo plano pago Agents do ElevenLabs sai a quase exatamente $0,08 por minuto incluído, o que bate centavo a centavo com a nova tarifa do Grok. Até 5 de agosto, o Grok era 37,5% mais barato.
A visão mais ponderada, de alguns meses antes, ainda se sustenta:
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
É basicamente onde eu também chego. Um modelo de voz é sempre um compromisso em relação a um modelo de texto que tem o luxo de pensar por dez segundos, e o Grok faz um compromisso melhor do que o resto do mercado. Leia as análises do lado do consumidor e você vai ver o mesmo veredito dito com menos cuidado.
A frustração recorrente nesses tópicos é o uso de ferramentas no modo de voz, e vale esclarecer isso porque funciona nos dois sentidos:
"What I'm missing from this announcement is the capability to use connectors and tools. I don't really get it - NONE of the frontier assistants can use tools / connectors while in voice mode"
Isso se refere a assistentes de voz de consumo, e do lado da API isso não é verdade para o Grok: as sessões suportam ferramentas function, file_search, web_search, x_search, e mcp remotas, com as do lado do servidor sendo executadas para você. As ferramentas de servidor são cobradas por chamada, a $5 por 1.000 para busca na web e no X, $2,50 por 1.000 para coleções, e $10 por 1.000 para busca em anexos. A lacuna que o comentário descreve é real no aplicativo Grok de consumo, não no que você construiria. É a mesma divisão que atravessa o lançamento de voz do ChatGPT: a API está à frente do aplicativo já há um tempo.
Quem deveria adotar, e quem deveria esperar
Adote se você está construindo um agente telefônico ou de voz que precisa fazer coisas, não só falar. A pontuação τ-voice, o suporte a ferramentas, as extensões force_message e keyterms, e o medidor fixo por minuto somam a pilha de voz mais amigável a desenvolvedores atualmente em produção. Migrar do áudio em tempo real da OpenAI é quase gratuito.
Adote se a previsibilidade de custo importa para o seu financeiro. A Artificial Analysis mede o custo real do Grok em $4,80 por hora de áudio de entrada, idêntico ao preço de tabela, porque o medidor é fixo por minuto. O GPT-Realtime-2 lista $1,15/h de entrada e mede $4,14 tudo incluído. Faturas de voz que batem com o preço anunciado são mais raras do que deveriam ser, o que explica em parte por que a pergunta sobre o custo do agente versus humano é tão difícil de responder com honestidade.
Adote se você quer construir a orquestração sozinho. Se preferir arrastar caixas de um lado para outro, o preço do Voiceflow e as alternativas ao Voice Agent Builder são o lado sem código do mesmo mercado.
Espere se seu volume ultrapassa dez chamadas simultâneas e você ainda não tem um limite ampliado por escrito. Espere se você precisa de uma região na UE. Espere se você dependia da tarifa de $0,05 e não tinha percebido que o alias estava mudando debaixo dos seus pés — nesse caso, fixe grok-voice-think-fast-1.0 hoje mesmo e decida no seu próprio ritmo.
Não compre isso como solução de suporte. Isso é um modelo e uma API, não um agente de helpdesk. Não tem noção do seu histórico de tickets, das suas macros, das suas regras de escalonamento, ou de quais perguntas sua equipe já decidiu que a IA não deve tocar. Tudo acima é sobre a camada de voz, e essa camada de voz é talvez 20% do que faz uma automação de suporte realmente funcionar. O resto é a parte chata: conhecer seu produto, saber quando parar, e transferir de forma limpa.
Uma líder de CX numa marca de suplementos DTC resumiu essa limitação melhor do que qualquer ficha técnica:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Nenhum benchmark de voz mede isso. É uma questão de política, e é ela que decide se uma implantação sobrevive ao primeiro mês.
A voz é a metade barulhenta de uma fila de suporte
A maioria dos tickets que viram ligações telefônicas poderia ter sido respondida por texto uma hora antes. A automação da primeira resposta e um chatbot de base de conhecimento que a IA consegue realmente ler eliminam mais ligações do que qualquer modelo de voz. É isso que vale a pena consertar antes de sair procurando um.
O eesel é um agente de IA que se conecta ao helpdesk que você já usa, treina com seus tickets passados e sua central de ajuda em vez de um prompt de sistema que você precisa escrever à mão, e permite simular tudo isso contra o seu histórico real de tickets antes que um único cliente encoste nele. Essa última parte é proposital. Passei anos vendo bots com aparência confiante darem respostas erradas, e um teste a seco sobre tickets que você já resolveu é a única forma honesta de descobrir o que o seu vai fazer. É também a etapa que separa um agente de IA de verdade de um bot baseado em regras quando os caminhos programados se esgotam.
É a mesma decisão entre construir e comprar a que muitas equipes chegam depois de ler uma página de documentação como a da xAI e entender quanto disso elas mesmas teriam que manter:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Se a camada de voz também te interessa, continue lendo sobre o Voice Agent Builder do Grok e o mercado mais amplo de empresas de voz com IA. Se você quer resolver primeiro a fila por trás disso, o eesel é gratuito para testar e leva poucos minutos para se conectar ao seu helpdesk. Equipes que usam Gorgias ou Zendesk costumam colocá-lo respondendo tickets reais na mesma tarde.
Três leituras que valem a pena a seguir, dependendo de em qual parte disso você está travado:
- Ainda decidindo o modelo: a visão geral da Think Fast 2.0 cobre o mecanismo com mais profundidade.
- Calculando a conta: a análise completa de preços faz as contas em quatro volumes diferentes.
- Comparando o mercado: alternativas ao ElevenLabs é o comparativo mais próximo na mesma faixa de preço.
Perguntas frequentes
O Grok Voice Think Fast 2.0 é bom o suficiente para agentes de voz em produção?
us-east-1. Leia a análise completa do Grok Voice Think Fast 2.0 para entender o mecanismo, e agentes de IA para call center para saber o que uma implantação em produção costuma exigir.O que há de novo no Grok Voice Think Fast 2.0 em comparação com o 1.0?
Quanto custa o Grok Voice Think Fast 2.0 por minuto?
grok-voice-latest. Compare com o preço do ElevenLabs e com o mercado mais amplo de empresas de voz com IA antes de decidir.Posso migrar um aplicativo OpenAI Realtime para o Grok Voice?
wss://api.x.ai/v1/realtime, então trocar a URL base e a chave cobre a maior parte. Quatro tipos de evento se comportam de forma diferente, o que a seção de migração abaixo detalha. Se você construiu sobre a API de áudio da OpenAI, planeje uma tarde de trabalho, não um sprint inteiro.O Grok Voice Think Fast 2.0 é melhor que o ElevenLabs para chamadas de suporte?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








