Grok Voice Think Fast 2.0: o que mudou e quanto custa

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Ilustração em linha de um agente de suporte com fone de ouvido ao lado do logo do Grok, com uma forma de onda de voz em um balão de fala

O que eu realmente quero dizer com "modelo de voz"

Passei os últimos anos integrando o eesel a helpdesks, o que significa que li muitas páginas de fornecedores sobre IA que responde a clientes. Voz é a única categoria em que a afirmação de arquitetura é real e verificável, então vale a pena ser preciso sobre isso.

A maioria das stacks de voz é composta por três produtos disfarçados de um só: fala para texto, um modelo de linguagem, depois texto para fala, muitas vezes de três fornecedores diferentes. Cada salto adiciona latência, custo, e mais uma coisa que pode falhar às 2 da manhã. O próprio posicionamento da xAI no lançamento do Voice Agent Builder foi que isso é exatamente o que eles se propuseram a unificar, e o Think Fast 2.0 é o modelo que faz essa unificação.

Comparação entre um pipeline costurado de fala-para-texto, LLM e texto-para-fala e um único caminho de modelo speech-to-speech
Comparação entre um pipeline costurado de fala-para-texto, LLM e texto-para-fala e um único caminho de modelo speech-to-speech

Os modelos Think Fast fazem algo específico que eu não tinha visto virar produto antes: eles raciocinam enquanto já estão falando. A xAI descreve isso como raciocinar em paralelo com a fala, então o pensamento não fica na frente da primeira sílaba. Na prática, uma chamada de ferramenta geralmente dispara antes de o agente terminar a primeira frase. Esse é todo o truque por trás dos 0,70 segundo, e explica por que o modelo consegue ser rápido e, ao mesmo tempo, incomumente bom em trabalhos de múltiplas etapas, duas coisas que normalmente se contrapõem.

O Think Fast 2.0 também cortou bastante os tokens de raciocínio. A xAI relata que a resposta mediana usa 0,4x os tokens de raciocínio do Think Fast 1.0, o tipo de mudança que se sente numa ligação longa, não numa demo.

A tabela de benchmarks, e as duas linhas que costumam passar batido

Aqui está o que a xAI publicou no dia do lançamento, com fonte na Artificial Analysis.

BenchmarkThink Fast 2.0Think Fast 1.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82,9%75,7%79,1%69,5%
Raciocínio de voz (Big Bench Audio)97,2%97,1%96,0%96,6%
Dinâmica conversacional (Full Duplex Bench)95,1%77,8%95,7%74,3%
Desempenho agêntico (τ-voice Bench)56,5%52,1%45,7%37,7%
Tempo até o primeiro áudio0,70s1,25s1,21s2,98s

Há algumas coisas que eu apontaria se você estivesse lendo isso por cima do meu ombro.

Primeiro, a linha mais importante para suporte é o τ-voice Bench com 56,5%, e o Grok vence por quase 11 pontos sobre o melhor da OpenAI. O τ-voice mede agentes em condições realistas de ligação: ruído, sotaques, interrupções, quem liga mudando de ideia no meio da frase. É a aproximação publicada mais próxima de "isso consegue rodar um fluxo de trabalho real numa linha telefônica real". Um teto de 56,5% também significa que cerca de dois em cada cinco desses cenários difíceis ainda falham, o número que eu colocaria na frente de qualquer um que prometa automação total.

Segundo, a linha de dinâmica conversacional é a que a xAI não vence. O GPT-Realtime-2.1 High supera por pouco, 95,7% contra 95,1%, e o salto do Grok vem de 77,8%, então esse foi claramente o ponto corrigido nesta versão. Convenhamos, é um avanço de 17 pontos.

Agora o contexto que a própria tabela da xAI deixa de fora. Ao abrir o ranking completo da Artificial Analysis, o Think Fast 2.0 fica em segundo no geral, não em primeiro. O Qwen Audio 3.0 Realtime Plus, da Alibaba, está em 84,1%. Ele também leva 4,02 segundos para começar a falar, contra 0,70, o que numa linha telefônica é a diferença entre uma conversa e silêncio morto. Mesma história na latência: o Deepslate Opal responde em 0,44s e o Gemini 2.5 Flash Native Audio Dialog em 0,63s, ambos mais rápidos que o Grok, e ambos bem atrás no índice. O que o Grok reivindica é a combinação, e nessa combinação ele é o melhor da tabela.

A troca de alias de 5 de agosto, em dólares

Essa é a parte que eu realmente colocaria num lembrete de calendário.

Diagrama de bifurcação mostrando o grok-voice-latest se dividindo entre o Think Fast 2.0 a $0,08 por minuto ou um Think Fast 1.0 fixado a $0,05 por minuto
Diagrama de bifurcação mostrando o grok-voice-latest se dividindo entre o Think Fast 2.0 a $0,08 por minuto ou um Think Fast 1.0 fixado a $0,05 por minuto

Segundo a página de preços da xAI, a tabela de tarifas de voz é assim:

Modelo ou modoTarifa
Speech to speech, grok-voice-think-fast-1.0$0,05 / min ($3,00 / h) áudio, $0,004 / entrada de texto
Speech to speech, grok-voice-think-fast-2.0$0,08 / min ($4,80 / h) áudio, $0,004 / entrada de texto
Speech to text$0,10 / h (REST), $0,20 / h (streaming)
Text to speech$15,00 / 1M caracteres

A posição da xAI sobre a migração é que nenhuma ação é necessária para atualizar, e que para permanecer na 1.0 é preciso fixar grok-voice-think-fast-1.0 antes de 5 de agosto. As duas metades disso são verdadeiras. O que não é dito em voz alta é que o caminho padrão é o mais caro, e um aumento de 60% por minuto chega sem que você precise fazer nenhum deploy do seu lado. Se você lida com algum volume, calcule quanto isso custa antes que aconteça, não depois.

Dois outros medidores acompanham isso. Um número de telefone provisionado no Voice Agent Builder custa $0,01 por minuto a mais. As ferramentas do lado do servidor são cobradas por invocação: busca na web e busca no X a $5 por 1.000 chamadas, busca em coleções de documentos a $2,50 por 1.000, busca de anexos de arquivo a $10 por 1.000. Um agente de suporte que consulta algo em quase toda ligação compra esses serviços aos milhares, então é preciso incluí-los na conta.

Fatura da migração

O que 5 de agosto custa para você

Escolha o seu tempo de conversa mensal. As tarifas são as publicadas pela xAI mais $0,01/min por um número provisionado.

Aproximadamente, com uma ligação média de 4 minutos500 ligações / mês
Fixado em 1.0$120$100 voz + $20 telefonia
Migrado automaticamente para 2.0$180$160 voz + $20 telefonia
Diferença: +$60 / mês (+$720 ao ano)
Aproximadamente, com uma ligação média de 4 minutos2.500 ligações / mês
Fixado em 1.0$600$500 voz + $100 telefonia
Migrado automaticamente para 2.0$900$800 voz + $100 telefonia
Diferença: +$300 / mês (+$3.600 ao ano)
Aproximadamente, com uma ligação média de 4 minutos12.500 ligações / mês
Fixado em 1.0$3.000$2.500 voz + $500 telefonia
Migrado automaticamente para 2.0$4.500$4.000 voz + $500 telefonia
Diferença: +$1.500 / mês (+$18.000 ao ano)
Aproximadamente, com uma ligação média de 4 minutos50.000 ligações / mês
Fixado em 1.0$12.000$10.000 voz + $2.000 telefonia
Migrado automaticamente para 2.0$18.000$16.000 voz + $2.000 telefonia
Diferença: +$6.000 / mês (+$72.000 ao ano)
Não inclui invocações de ferramentas do lado do servidor, cobradas separadamente a partir de $2,50 por 1.000 chamadas.

Um alerta ao comparar isso com qualquer outro fornecedor: a xAI publica um preço fixo por minuto, enquanto OpenAI e Google cobram por token de áudio. A Artificial Analysis normaliza isso como custo por hora de áudio de entrada, e nessa base o Think Fast 2.0 marca $4,80, o GPT-Realtime-2.1 High marca $10,75, e o Gemini 3.1 Flash High marca $1,75. O número do Grok é exatamente 60 vezes sua tarifa por minuto publicada, então é uma tabela de preços real. Os outros dois são medições de uma única rodada de benchmark, e vão variar conforme o quanto o agente fala. Se você está escolhendo entre eles, leia bem os preços da API Realtime da OpenAI em vez de confiar numa única coluna normalizada.

A transcrição é o upgrade discreto

A tabela de benchmarks chama a atenção, mas acho que o trabalho de transcrição é a mudança mais útil se você for colocar isso numa linha telefônica.

A xAI avaliou milhares de frases curtas em 24 idiomas e relata que o Think Fast 2.0 supera modelos de transcrição dedicados: de 1,5x a 2,0x melhor taxa de erro de palavras do que o Deepgram Nova 3 e o ElevenLabs Scribe v2, e 1,4x melhor que o Think Fast 1.0. A afirmação que mais me interessa é a do ruído, em que dizem que a diferença para a transcrição de voz dedicada aumenta para cerca de 10x sob ruído de fundo e compressão de telefonia.

Essa é a condição real das ligações de suporte. Ninguém liga para o suporte de uma cabine de gravação. As pessoas ligam de um carro, de um depósito, de uma cozinha com uma criança por perto. Se você já viu uma transcrição transformar "cancelar meu pedido" em outra coisa completamente diferente, sabe que uma única palavra errada vira um fluxo de trabalho inteiro errado. Quem opera suporte multilíngue deveria olhar o gráfico por idioma do anúncio em vez da média, porque a variação entre esses 24 idiomas é grande.

Há dois parâmetros de sessão pensados especificamente para tapar as lacunas restantes, e vale a pena conhecê-los desde o primeiro dia. audio.input.transcription.keyterms inclina a transcrição para até 100 termos de 50 caracteres cada, onde entram os nomes dos seus SKUs e planos. replace mapeia uma frase para uma substituição falada antes do texto-para-fala, de modo que o áudio pronuncie corretamente o nome da sua marca enquanto a transcrição mantém a grafia original. O exemplo da documentação mapeia "Acme Mobile" para "Acme Mobull", o que mostra exatamente o quanto essa função é pouco glamorosa e, ainda assim, necessária.

O que realmente envolve construir sobre ele

Li a documentação de speech-to-speech da mesma forma que leio qualquer API que talvez eu tenha que dar suporte depois, procurando as partes que vão morder mais tarde. Aqui vão algumas notas dessa leitura.

A API é compatível a nível de protocolo com a API Realtime da OpenAI. Você aponta o WebSocket para wss://api.x.ai/v1/realtime, troca a chave, e a maior parte do código cliente existente funciona. Esse é um custo de troca deliberadamente baixo, e é o argumento comercial mais forte que a xAI tem aqui. Não é uma compatibilidade perfeita: conversation.item.done, rate_limits.updated e alguns eventos output_audio_buffer.* não são emitidos, e conversation.item.input_audio_transcription.delta é renomeado para .updated com payloads cumulativos em vez de incrementais. Se você construiu algo em cima desses eventos, esse é o seu trabalho de portabilidade. As diferenças nas chamadas de ferramentas também vale a pena ler.

As ferramentas vêm em cinco tipos: function para suas próprias APIs, file_search sobre coleções de documentos enviadas, web_search, x_search, e servidores mcp remotos. O suporte a MCP é o que eu usaria, porque significa que sua ferramenta interna existente fica acessível sem precisar escrever uma camada específica para voz.

O raciocínio vem por padrão com esforço high. Você pode definir reasoning.effort como "none" para desativá-lo. Vale a pena notar porque uma reclamação real no Hacker News sobre a geração anterior era exatamente o oposto:

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"

Três extensões específicas da xAI são as que eu apontaria para quem está construindo uma linha de suporte:

  • force_message fala uma linha codificada e sintetizada por TTS sem envolver o modelo, com uma flag interruptible. É assim que você entrega "esta ligação está sendo gravada" ao pé da letra, todas as vezes, o que é um requisito de conformidade, não um recurso legal de se ter.
  • resumption armazena em cache os turnos em relação a um conversation_id e os reproduz na reconexão. Desativado por padrão. Sem isso, um WebSocket que cai perde a conversa, e quem liga do celular derruba a conexão o tempo todo.
  • idle_timeout_ms faz o servidor voltar a interagir com quem está em silêncio por meio de um temporizador que se rearma a cada resposta. Essa é a diferença entre um agente paciente e um silêncio constrangedor.

O conselho de migração na documentação é o oposto do que você esperaria: deixe o prompt de sistema mais curto, não mais longo. A orientação da xAI é pedir ao Grok que generalize seu prompt existente em vez de portá-lo ao pé da letra, e remover truques de prompt escritos para corrigir casos extremos do modelo anterior. Já fiz esse exercício com nossos próprios prompts ao longo de várias atualizações de modelo. É desconfortável e geralmente é a coisa certa a fazer; as soluções alternativas acumuladas são o que faz um prompt ficar, aos poucos, impossível de manter.

Benchmarks são uma coisa. O único caso de implantação para o qual qualquer um dos dois anúncios traz números é a linha de vendas e suporte da Starlink, que roda no Grok Voice, e os números que a xAI publicou junto com o Think Fast 1.0 valem a pena serem citados exatamente:

  • Taxa de conversão de 20%. Uma em cada cinco consultas de vendas compra o serviço da Starlink enquanto está ao telefone com o Grok.
  • Taxa de resolução de 70%. A maioria das consultas de suporte é resolvida de forma autônoma, sem humano no processo.
  • 28 ferramentas. Um agente, dezenas de ferramentas distintas, em centenas de fluxos de trabalho de suporte e vendas.
  • Solução de problemas de hardware, substituições de hardware e créditos de serviço são todos concedidos de forma autônoma.

São números fortes, e são de primeira mão, o que funciona nos dois sentidos. Starlink e xAI têm o mesmo dono, então essa é a melhor implantação possível, com a maior atenção de engenharia disponível. Uma taxa de resolução autônoma de 70% é real, e também é o que se obtém com uma equipe dedicada construindo 28 ferramentas para uma única linha de negócio.

Para o Think Fast 2.0 especificamente, a xAI diz que testes A/B nessa mesma linha da Starlink mostraram "um aumento significativo na taxa de conversão de vendas e na taxa de contenção de suporte" e não publica nenhum número para nenhum dos dois. Eu gostaria de ter o número. Até que exista, a leitura honesta é que a 2.0 é melhor em benchmarks e provavelmente melhor em produção, com base na palavra do fornecedor.

A repercussão na comunidade ainda é escassa, o que por si só já diz algo sobre quem está prestando atenção. O tópico de lançamento no Hacker News reuniu cinco pontos e dois comentários:

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

O sinal mais útil vem de quem já convive com a geração anterior:

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

E a versão mais calibrada da mesma opinião, na qual eu mais confiaria:

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Quem deveria realmente adotar isso

Sim, claramente, se você opera uma linha telefônica de alto volume e a latência é o que está te matando. Menos de um segundo até o primeiro áudio somado à melhor pontuação agêntica publicada não é uma decisão apertada contra as alternativas, e a compatibilidade com o OpenAI Realtime faz com que o seu teste custe um dia, não um sprint. Quem está montando automação de call center do zero deveria colocá-lo na lista curta.

Sim, claramente, se você é desenvolvedor e quer pular a montagem da stack. O Voice Agent Builder empacota telefonia, recuperação de dados, guardrails e revisão de ligações, com SIP para números que você já possui. Isso é tempo real economizado em comparação com montar quatro fornecedores, e as alternativas quase todas cobram uma taxa de plataforma a mais. Vale notar que o modelo de voz tem versionamento separado da linha de texto, então lançamentos como o do Grok 4.5 não o afetam.

Ainda não, se o seu volume de suporte é e-mail e chat. Esse é o erro que vejo equipes cometerem: veem um ótimo número de voz e começam a planejar um projeto de desvio telefônico, quando a maior parte da fila deles nunca liga para ninguém. Voz é um canal, não uma estratégia. Comece por onde estão os tickets, e se sua linha telefônica já está conectada a um helpdesk, verifique o que sua integração telefônica do Gorgias ou equivalente já faz antes de adicionar uma segunda stack.

Ainda não, se você precisa provar segurança antes de ir ao ar. Não existe uma forma publicada de fazer um ensaio do Think Fast 2.0 contra suas próprias ligações históricas antes de direcionar tráfego para ele. Gravação de chamadas, transcrições e guardrails existem depois do fato, no Builder. Isso é revisão, não ensaio, e a distinção importa quando o agente pode emitir reembolsos. A mesma lacuna aparece em toda a categoria, e é por isso que prevenir respostas erradas da IA é, na maior parte, um problema de processo, não de modelo.

Cuidado se você já está no grok-voice-latest. Veja a calculadora acima. Amanhã.

Quer o mesmo para sua fila de tickets?

O Grok Voice é bom no telefone. O problema é que, para a maioria das equipes de suporte, o telefone é o canal pequeno, e a fila de tickets é onde realmente está o volume.

Essa é a metade que o eesel faz. Ele se conecta a Zendesk, Freshdesk, Gorgias, Front, HubSpot e outros, treina com seus tickets passados, macros e central de ajuda em vez de um prompt que você teria que escrever do zero, e redige ou envia respostas dentro do helpdesk que seus agentes já têm aberto. Nenhuma ferramenta nova para ninguém aprender.

O que eu apontaria, considerando tudo o que foi dito acima sobre a lacuna entre um benchmark e uma fila real: antes de ativar, o eesel simula o agente contra o seu próprio histórico de tickets e informa o que ele teria respondido e com que frequência. Essa é a etapa de ensaio que falta às stacks de voz. Ela existe porque já vi um bot com jeito confiante responder errado, e prefiro descobrir isso nos tickets do mês passado do que nos de hoje de manhã.

A visão de um cliente sobre por que essa etapa importa, uma citação anonimizada de uma responsável por CX de uma empresa de suplementos DTC com quem conversamos:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Essa é a configuração, não uma ressalva. Roteamento por confiança, exclusão por tipo de ticket, e uma simulação antes de ir ao ar.

O painel do helpdesk de IA do eesel mostrando respostas redigidas por IA dentro da fila de suporte
O painel do helpdesk de IA do eesel mostrando respostas redigidas por IA dentro da fila de suporte

Grátis para testar, e você pode ter ele respondendo seus próprios tickets em poucos minutos. Experimente o eesel.

Perguntas frequentes

O que é o Grok Voice Think Fast 2.0?

O modelo de voz speech-to-speech principal da xAI, anunciado em 29 de julho de 2026, que ouve, raciocina e fala em um único caminho de modelo em vez de encadear três serviços. Esse caminho único é de onde vêm os 0,70 segundo até o primeiro áudio. Ele se torna o modelo por trás do grok-voice-latest em 5 de agosto de 2026. Se o seu objetivo é e-mail e chat em vez de ligações, um agente de IA para helpdesk se encaixa melhor.

Quanto custa o Grok Voice Think Fast 2.0 por minuto?

$0,08 por minuto de áudio, ou $4,80 por hora, mais $0,004 por entrada de texto. O Think Fast 1.0 continua listado a $0,05 por minuto, então o preço do Grok Voice Think Fast 2.0 representa um salto de 60% por minuto. Um número provisionado adiciona $0,01 por minuto, e as chamadas de ferramentas são cobradas separadamente. Pese isso contra seu panorama mais amplo de custo de atendimento ao cliente com IA, e contra o que custa um agente humano.

O Grok Voice Think Fast 2.0 é mais rápido que o GPT-Realtime?

Sim, segundo a medição publicada: 0,70 segundo até o primeiro áudio contra 1,21 segundo do GPT-Realtime-2.1 High. Porém, não é o modelo mais rápido do ranking. O Deepslate Opal responde em 0,44s e o Gemini 2.5 Flash Native Audio Dialog em 0,63s, ambos mais abaixo no índice de qualidade. A comparação com a API Realtime da OpenAI cobre a troca do outro lado, incluindo WebRTC versus WebSocket como transporte.

Preciso atualizar do Think Fast 1.0?

Só se você não fizer nada. Em 5 de agosto de 2026, o grok-voice-latest deixa de apontar para grok-voice-think-fast-1.0 e passa a apontar para grok-voice-think-fast-2.0, então fixar a versão antiga antes disso é o que te mantém nela. Fixar versões em produção é uma boa prática de qualquer forma, o mesmo instinto por trás de testar as respostas da IA antes que os clientes as vejam.

O Grok Voice Think Fast 2.0 consegue lidar com ligações de suporte ao cliente?

Ele foi projetado exatamente para isso. A linha da Starlink roda no Grok Voice com 28 ferramentas, 70% de resolução autônoma e 20% de conversão de vendas, e o modelo faz chamadas de função, busca em documentos, MCP e transferência para humanos. A visão realista está em se a IA consegue atender ligações de suporte, e o lado operacional em como automatizar o suporte por telefone e na gestão de escalonamento com IA.

Qual é a precisão de transcrição do Grok Voice Think Fast 2.0?

A xAI relata uma taxa de erro de palavras 1,4x melhor do que o Think Fast 1.0 e de 1,5x a 2,0x melhor do que o Deepgram Nova 3 e o ElevenLabs Scribe v2 em 24 idiomas, com a diferença aumentando para cerca de 10x em áudio com ruído. Verifique o gráfico por idioma em vez da média se você opera suporte multilíngue, porque a precisão varia por idioma, e é a cauda que prejudica o seu CSAT.

O Grok Voice funciona com Zendesk ou Gorgias?

Não nativamente. O Grok Voice é um modelo e um builder, então qualquer escrita de volta ao helpdesk é uma ferramenta de função ou um servidor MCP que você mesmo conecta. Se você quer IA dentro do helpdesk em vez disso, comece pelo Zendesk AI ou pelo Freddy do Freshdesk. No lado da telefonia, a configuração do Zendesk Talk é o equivalente nativo mais próximo. De qualquer forma, trate a voz como mais um canal alimentando a mesma fila.

O Grok Voice Think Fast 2.0 vale a pena em relação ao Think Fast 1.0?

Para uma carga de trabalho agêntica exigente, provavelmente sim: 82,9% contra 75,7% no geral, além de quase metade da latência e um salto de 17 pontos na dinâmica conversacional. Para uma linha de FAQ simples em que a 1.0 já resolve o que você precisa, o aumento de 60% na tarifa compra uma precisão que talvez você não use. Compare isso com sua própria taxa de resolução e com o ROI do call center antes de deixar o alias decidir por você. Se você está comparando toda a linha, os preços da xAI são o próximo passo.

Sources

Perguntas frequentes

O que é o Grok Voice Think Fast 2.0?
É o modelo de voz speech-to-speech principal da xAI, anunciado em 29 de julho de 2026. Ele ouve, raciocina e fala em um único caminho de modelo em vez de encadear fala-para-texto, um LLM e texto-para-fala, e é daí que vêm seus 0,70 segundo até o primeiro áudio. Ele substitui o Think Fast 1.0 como modelo por trás do grok-voice-latest em 5 de agosto de 2026. Se o seu objetivo é responder e-mail e chat em vez de ligações, um agente de IA para helpdesk se encaixa melhor.
Quanto custa o Grok Voice Think Fast 2.0 por minuto?
$0,08 por minuto de áudio, ou $4,80 por hora, mais $0,004 por entrada de texto, segundo a página de preços da xAI. O Think Fast 1.0 continua listado a $0,05 por minuto. Um número de telefone provisionado no Voice Agent Builder adiciona $0,01 por minuto, e as ferramentas do lado do servidor são cobradas separadamente. Compare isso com o panorama mais amplo do custo de atendimento ao cliente com IA antes de decidir.
O Grok Voice Think Fast 2.0 é mais rápido que o GPT-Realtime?
Segundo os testes da Artificial Analysis, sim: 0,70 segundo até o primeiro áudio contra 1,21 segundo do GPT-Realtime-2.1 High. No entanto, não é o modelo mais rápido medido. O Deepslate Opal está em 0,44s e o Gemini 2.5 Flash Native Audio Dialog em 0,63s. Veja a comparação com a API Realtime da OpenAI para o outro lado.
Preciso atualizar do Grok Voice Think Fast 1.0?
Não, mas você precisa agir para evitar a mudança. Em 5 de agosto de 2026, o grok-voice-latest deixa de apontar para grok-voice-think-fast-1.0 e passa a apontar para grok-voice-think-fast-2.0. Para permanecer no modelo antigo, mais barato, fixe explicitamente grok-voice-think-fast-1.0 antes dessa data. Fixar a versão é, de qualquer forma, o que a xAI recomenda para produção, a mesma disciplina por trás de prevenir respostas erradas da IA.
O Grok Voice Think Fast 2.0 consegue lidar com ligações de suporte ao cliente?
Foi construído exatamente para isso. A linha de vendas e suporte da Starlink roda no Grok Voice com 28 ferramentas, uma taxa de resolução autônoma de 70% e uma taxa de conversão de vendas de 20% em consultas recebidas. O modelo suporta chamadas de função, busca em documentos e servidores MCP, além de transferência para humanos. Vale a pena ler também sobre se a IA consegue atender ligações de suporte.
Qual é a precisão de transcrição do Grok Voice Think Fast 2.0?
A xAI relata uma melhoria de 1,4x na taxa de erro de palavras em relação ao Think Fast 1.0 e de 1,5x a 2,0x em relação ao Deepgram Nova 3 e ao ElevenLabs Scribe v2, em milhares de frases curtas em 24 idiomas. A diferença alegada chega a cerca de 10x em áudio com ruído e comprimido por telefonia. Isso importa mais do que a manchete para quem opera suporte multilíngue.
Como o preço do Grok Voice Think Fast 2.0 se compara a outras APIs de voz?
A Grok publica uma tarifa fixa por minuto; a OpenAI e o Google cobram por token de áudio, então o custo real deles varia conforme quanto o modelo fala. A Artificial Analysis mediu o custo por hora de áudio de entrada em $4,80 para o Think Fast 2.0, $10,75 para o GPT-Realtime-2.1 High e $1,75 para o Gemini 3.1 Flash High. Nosso comparativo de custo de agente de IA versus agente humano coloca esses números em contexto.
Onde o Grok Voice Think Fast 2.0 não ajuda?
É um modelo de voz, então não faz nada pelos tickets de e-mail e chat que nunca viram ligação, e não tem visão do histórico do seu helpdesk. Para isso você precisa de um agente que treine com tickets passados e rode uma simulação de desvio de tickets contra eles antes de entrar em produção. Os dois se encaixam perfeitamente: o Grok na linha telefônica, um agente de helpdesk na fila.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração em linha de um desenvolvedor e um agente de suporte conversando por ondas de voz, ao lado do logotipo da Grok
Trending

Preço do Grok Voice Think Fast 2.0: o que $0.08/min custa

Grok Voice Think Fast 2.0 custa $0.08 por minuto de áudio, 60% acima do 1.0. O alias grok-voice-latest muda para ele hoje, então aqui está a matemática real por chamada.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustração de seis plataformas de agentes de voz com IA como alternativas ao Grok Voice Agent Builder da xAI
Guides

6 alternativas ao Grok Voice Agent Builder para experimentar em 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow e Deepgram comparados com o Grok Voice Agent Builder da xAI em preço, latência e conformidade.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Ilustração de um agente de voz de IA sem código atendendo uma chamada na stack Grok Voice da xAI
Guides

Grok Voice Agent Builder: um primeiro olhar sobre a IA de voz sem código da xAI

Um olhar prático sobre o Grok Voice Agent Builder: a stack speech-to-speech, o preço de $0,05/min, o fluxo de criação de dois minutos e onde ele realmente se encaixa.

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026
Uma pessoa ao telefone diante de três opções diferentes de agente de voz, com o logotipo da Grok à esquerda
Alternatives

As 10 melhores alternativas ao Grok Voice Think Fast 2 em 2026

O Grok Voice Think Fast 2.0 ficou 60% mais caro no alias padrão. Dez alternativas reais, com custo por hora medido e números de benchmark honestos.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Ilustração de um recibo e mostradores de preços do Grok Voice Agent Builder da xAI
Guides

Preços do Grok Voice Agent Builder: quanto ele realmente custa

Uma análise completa dos preços do Grok Voice Agent Builder: a tarifa de $0,05/min por voz, os complementos de telefonia e chamadas de ferramentas, exemplos de custo detalhados e como ele se compara à OpenAI e à ElevenLabs.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 3, 2026
Ilustração editorial com o logo do Grok, barras de benchmark e uma etiqueta de preço representando uma análise do Grok 4.5
Trending

Análise do Grok 4.5: benchmarks, preços e o veredito

O Grok 4.5 da xAI foi lançado em 8 de julho com uma pontuação #4 no Intelligence Index e o melhor resultado de uso agentico de ferramentas do ranking. Aqui está a análise real, os benchmarks, os preços e quem deveria realmente usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Banner principal do Gemini 3.6 Flash em fundo azul do Google
Trending

Gemini 3.6 Flash: o que é, quanto custa e para quem é indicado

Gemini 3.6 Flash é o novo modelo de trabalho do Google: 17% menos tokens de saída, saída mais barata e um contexto de 1M. Veja o que é e quem deveria usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Um agente de IA saindo de um monitor para operar janelas de aplicativos e documentos enquanto dois colegas observam, na cor azul de marca da Meta
Trending

Meta Muse Spark 1.1: o que é, quanto custa, onde falha

A primeira API de modelo paga da Meta lança um modelo agente com 1M de contexto por $1,25/$4,25. No que Muse Spark 1.1 é realmente bom, e os benchmarks que a Meta deixou de fora do slide.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Duas pessoas em conversa com formas de onda de voz entre elas e o logótipo Grok por cima
AI

Grok Voice Think Fast 2.0: rápido, afiado, mas limitado

Uma análise prática do Grok Voice Think Fast 2.0: a realidade dos benchmarks, as particularidades da API e o limite de 10 sessões que decide se você pode colocá-lo em produção.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis