Análise do Grok Voice Think Fast 2.0: rápido, afiado, limitado

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Duas pessoas conversando com formas de onda de voz entre elas e o logotipo do Grok acima

O que eu realmente testei, e o que não consegui

Quero ser direto sobre a base disso tudo, porque "eu testei" é usado com bastante liberdade quando se trata de modelos de voz.

O que eu explorei a fundo: a documentação de speech-to-speech da xAI de ponta a ponta, além da ficha do modelo com seus limites publicados e a tabela de preços na página de preços.

Além disso, o post de lançamento e a avaliação independente da Artificial Analysis, que o pontuou contra outros 27 modelos. Depois li o que as pessoas que constroem sobre ele estão dizendo.

O que não posso afirmar: não fiz mil chamadas de produção passarem por ele em uma linha telefônica real. Ninguém fora da xAI fez isso, exceto a Starlink. Então, quando este post disser algo sobre comportamento sob carga, isso vem de um limite publicado, e não de uma história real de guerra, e eu vou dizer qual das duas coisas é, caso a caso.

Eu construo agentes de IA na eesel para viver, principalmente as partes que ficam entre um modelo e uma conversa real com o cliente. Essa é a lente aqui. A pergunta não é "isso impressiona em uma demo". É "o que quebra quando é terça-feira à tarde e 40 pessoas ligam ao mesmo tempo".

O placar

Aqui está todo o veredito em um só lugar, antes dos detalhes.

DimensãoPontuaçãoMinha leitura
Fluidez conversacional95,1% Full Duplex BenchA correção principal. O 1.0 obteve 77,8%. Interrupções e sobreposições já não são o ponto fraco.
Inteligência bruta82,9% índice AASegundo lugar geral, atrás do Qwen com 84,1%. Próximo o suficiente para não ser o fator decisivo.
Comportamento agêntico56,5% τ-voiceO melhor da tabela, mas apenas 1,9 ponto acima do Qwen, com 54,6%.
Latência0,70s até o primeiro áudioTerceiro mais rápido. Rápido o suficiente para quem liga não notar.
Transcrição1,4x melhor que o 1.0Um upgrade real, e aquele que a xAI mais subestimou na divulgação.
Design de APICompatível a nível de protocolo com o OpenAI RealtimeA melhor parte do produto. As extensões parecem escritas por quem já lançou um agente de telefone antes.
Previsibilidade de custo4,80 $/h medido, 4,80 $/h de tabelaCobrança fixa por minuto. Raro, e vale mais do que parece.
Margem de escala10 sessões simultâneasO problema. Tudo acima é minado por essa única linha.
Opções de implantaçãoSomente us-east-1Sem região na UE. Para muitas equipes, isso encerra a conversa.

Veredito: o modelo merece uma recomendação forte, e a plataforma merece um "verifique seu volume primeiro". São dois produtos diferentes, e as análises tendem a pontuar só o primeiro.

Onde ele vence

Quatro coisas se destacaram, e apenas uma delas é o número que a xAI usou para abrir o lançamento. Juntas, elas descrevem um tipo específico de modelo: não o mais inteligente disponível, mas o que se mantém afiado enquanto responde rápido o suficiente para uma linha telefônica.

Interrupções deixaram de ser o ponto fraco

A maior mudança única em relação ao 1.0 é o Full Duplex Bench, que mede como um modelo lida com as partes confusas de uma conversa real: interrupções, sobreposições, sinais de escuta, alguém que muda de ideia no meio de uma frase. O 1.0 obteve 77,8%. O 2.0 obtém 95,1%.

Esse é o número que separa um agente de voz que as pessoas toleram de um que elas esquecem ser uma máquina. Qualquer pessoa que já ouviu gravações de chamadas conhece essa falha específica: quem liga começa a se corrigir, o bot continua falando por cima, e essa pessoa acaba se repetindo mais alto ou pedindo para falar com um humano. Isso fica próximo do topo de qualquer lista de problemas de chatbots que fazem os clientes desistirem, e os padrões de transferência em toda implantação séria existem principalmente para capturar esse momento exato.

Vale reconhecer, com justiça: esta é a única linha em que o Grok perde para a OpenAI. O GPT-Realtime-2.1 High pontua 95,7%. Uma diferença de 0,6 ponto não é algo que quem liga jamais perceberia, mas a tabela de lançamento também não vai se oferecer para mencionar isso.

A pontuação agêntica é a manchete real

O τ-voice mede se um modelo consegue de fato concluir uma tarefa por voz, em vez de apenas parecer bom enquanto tenta. Consultar um pedido, verificar uma política, depois chamar uma função e voltar com a resposta correta. O Grok Voice Think Fast 2.0 marca 56,5% aqui, o número mais alto de toda a tabela da Artificial Analysis.

Três faixas de classificação comparando o Grok Voice Think Fast 2.0 com Qwen, GPT e Gemini em índice geral, tempo até o primeiro áudio e pontuação agêntica tau-voice
Três faixas de classificação comparando o Grok Voice Think Fast 2.0 com Qwen, GPT e Gemini em índice geral, tempo até o primeiro áudio e pontuação agêntica tau-voice

Isso importa mais que o índice geral para quem constrói um agente real, porque um agente de voz que não consegue usar ferramentas de forma confiável é um leitor de FAQ muito caro. É a mesma distinção que separa agentes de IA de chatbots de IA em texto, e a mesma razão pela qual os exemplos de agentes de IA úteis são sempre aqueles que tocam um sistema real em vez de recitar um artigo.

A ressalva honesta: o Qwen Audio 3.0 Realtime Plus fica em 54,6% no mesmo benchmark. Então a vantagem do Grok é de 1,9 ponto, não o abismo que o enquadramento sugere. A diferença em relação ao melhor da OpenAI, com 45,7%, é maior, e é daí que vem a frase "10 pontos de vantagem", mas o Qwen está bem ali atrás.

A combinação de velocidade e inteligência

0,70s até o primeiro áudio, abaixo dos 1,25s do 1.0. O Deepslate Opal é mais rápido, com 0,44s, e uma variante do Gemini Flash com 0,63s, então o Grok fica em terceiro. Mas o Qwen, o modelo que o vence no índice geral, leva 4,02s até o primeiro áudio. Em uma linha telefônica, isso é uma pausa morta longa o suficiente para quem liga dizer "alô?".

Essa troca é o verdadeiro produto. Alguém no Hacker News resumiu isso melhor do que o próprio post de lançamento:

Hacker News

"O Grok voice é o melhor assistente de voz com IA e nem é por pouco.

A relação entre velocidade e inteligência está exatamente certa. Enquanto a voz do GPT parece presunçosa e artificial, mesmo se esforçando muito para parecer humana."

A xAI também afirma que os tokens de raciocínio rodam a 0,4x o P50 do antecessor, o que explica como ele se tornou mais rápido ao mesmo tempo em que ficou mais inteligente, em vez de simplesmente pensar menos.

A transcrição é a parte subestimada

Escondido no post de lançamento: a precisão de transcrição é 1,4x melhor que a do 1.0, e de 1,5 a 2,0x melhor que a do Deepgram Nova 3 e do ElevenLabs Scribe v2 em 24 idiomas. Em áudio ruidoso ou de telefonia, a diferença alegada é de aproximadamente 10x.

Áudio de telefonia é justamente onde a transcrição costuma falhar, e é exatamente o tipo de áudio que uma linha de suporte enfrenta o dia inteiro. Se você está avaliando isso contra o ElevenLabs ou um fornecedor dedicado de speech-to-text, esse número de áudio ruidoso merece mais peso do que os benchmarks conversacionais. Esse também é o eixo em que o endpoint de transcrição da OpenAI tem sido a escolha padrão, principalmente por inércia.

Agora há 26 vozes no catálogo, depois que 21 foram adicionadas em julho de 2026, e qualquer uma delas pode ser substituída por um ID de voz clonada. Se você já teve que lutar para manter um bot com a mesma cara da sua empresa em diferentes canais, o problema da voz de marca não desaparece só porque a saída é áudio.

Onde a tabela de benchmarks exagera

Três coisas que o enquadramento do lançamento não conta.

82,9% é o segundo lugar. O Qwen Audio 3.0 Realtime Plus está em 84,1%. O Grok é competitivo com ele, e bem mais rápido, mas "estado da arte" está fazendo bastante trabalho no texto de marketing. Se você olhou recentemente para a família de modelos do Qwen ou o que a Alibaba cobra, vai saber que eles têm entregado forte.

Não compare entre si os dois números de τ-voice da xAI. O post de Voice Agent Builder de 1º de julho relata que o Think Fast 1.0 obtém 67,3% em sua própria avaliação τ-voice. A Artificial Analysis pontua o mesmo modelo em 52,1%. Metodologias diferentes, escalas diferentes. Quem empilhar esses dois números em um gráfico de "olha quanto melhorou" não está comparando nada. O mesmo cuidado se aplica aos números em Voice Agent Builder pricing, que ainda citam a tarifa antiga.

Os números da Starlink pertencem ao 1.0. Os amplamente citados 20% de conversão de vendas e 70% de resolução autônoma, da linha +1 888 GO STARLINK com 28 ferramentas conectadas, são resultados do Think Fast 1.0. Para o 2.0, a xAI diz que testes A/B na mesma linha mostraram "um aumento significativo" em conversão e contenção, sem publicar um número. Também é uma implantação interna dentro da mesma estrutura de propriedade, o que a torna mais um melhor cenário possível do que um caso representativo.

Construindo sobre ele: a API é a parte boa

Eu esperava que a documentação fosse o ponto fraco aqui, e aconteceu o contrário. Em termos de design, é a API de voz em tempo real mais bem pensada que já li.

Uma lista de verificação em duas colunas mostrando o que é mantido do OpenAI Realtime e quais quatro tipos de evento você precisa reescrever
Uma lista de verificação em duas colunas mostrando o que é mantido do OpenAI Realtime e quais quatro tipos de evento você precisa reescrever

Ela é compatível a nível de protocolo com o OpenAI Realtime em wss://api.x.ai/v1/realtime, então, se você tem uma aplicação existente, a migração se resume a uma URL base e uma chave. Você pode até manter o SDK da OpenAI e simplesmente apontá-lo para https://api.x.ai/v1. Quatro coisas não são mantidas: conversation.item.done, rate_limits.updated e a maioria dos eventos output_audio_buffer.* não são emitidos, e ...input_audio_transcription.delta é renomeado para .updated e passa a ser cumulativo, o que vai corromper silenciosamente sua exibição de transcrição se você estava concatenando os deltas.

Onde a coisa fica interessante é nas extensões exclusivas da xAI, e elas parecem escritas por gente que já tinha lançado um agente de telefone e se queimado com isso:

  • force_message fala uma linha fixa via TTS sem envolver o modelo de forma alguma. Ao definir interruptible: false, o áudio de quem liga é descartado até que a fala termine. Isso resolve corretamente o problema da divulgação obrigatória de conformidade, em vez de simplesmente rezar para que o system prompt aguente.
  • replace é um mapa de pronúncia aplicado antes do TTS, de forma que o áudio diz "Acme Mobull" enquanto a transcrição continua mostrando "Acme Mobile". A correspondência não diferencia maiúsculas de minúsculas, respeita limites de palavra completa, e a correspondência mais longa prevalece.
  • resumption armazena em cache os turnos por conversation_id e os reproduz de novo na reconexão. Desativado por padrão, as duas partes precisam optar por ativá-lo, e o histórico expira após 30 minutos de inatividade.
  • keyterms direciona a transcrição para até 100 termos de domínio de 50 caracteres cada, atualizáveis no meio da sessão. Para uma linha de suporte repleta de SKUs e nomes de planos, essa é a diferença entre uma transcrição utilizável e um caos.
  • idle_timeout_ms se rearma após cada resposta, permitindo que o agente volte a engajar quem liga e está em silêncio repetidamente, em vez de simplesmente ficar ali parado.

O parâmetro reasoning.effort aceita exatamente dois valores: "high" (o padrão) e "none". Não existe uma configuração intermediária, o que é uma lacuna real. Alguém trouxe exatamente esse ponto no Hacker News sobre um lançamento anterior do Grok voice:

Hacker News

"O modelo de voz do Grok também é um modelo de raciocínio. Concordo que é muito melhor que os outros modelos de voz.

Só me deem uma opção de ter uma resposta mais lenta mas um modelo melhor…"

Outra coisa que a documentação faz corretamente e que a maioria dos fornecedores deixa você descobrir em produção: eles dizem explicitamente para esperar a reprodução do áudio terminar antes de enviar response.create após uma chamada de ferramenta, porque o servidor entrega todos os deltas de áudio antes dos eventos de chamada de função. Pule essa etapa e você terá falas se sobrepondo. Eles até sugerem mostrar um indicador de "pensando" durante essa lacuna. Esse é um detalhe conquistado com esforço, e registrado por escrito.

O próprio conselho do guia de migração é tornar seu system prompt mais curto, não mais longo, o que diz algo sobre como o modelo foi ajustado.

Os três limites que realmente vão te impedir de lançar

Se eu fosse quem está avaliando, esta é a seção que eu leria primeiro.

Um diagrama de funil mostrando chamadas entrantes se estreitando através de um portão rotulado como 10 sessões simultâneas por equipe, com o restante em fila de espera
Um diagrama de funil mostrando chamadas entrantes se estreitando através de um portão rotulado como 10 sessões simultâneas por equipe, com o restante em fila de espera

10 sessões simultâneas por equipe. Este é o padrão publicado na ficha do modelo, passível de aumento sob solicitação. Dez chamadas simultâneas é simplesmente a manhã de segunda-feira de uma pequena equipe de suporte. Todo benchmark acima é irrelevante se a chamada de número onze não conseguir se conectar, e "passível de aumento sob solicitação" é uma conversa de vendas, não um botão de configuração. Quem estiver dimensionando um agente de IA para call center deveria tratar isso como a primeira pergunta, não como uma nota de rodapé.

Para comparação, os produtos de voz empacotados construídos sobre um helpdesk não publicam nenhum teto de sessões, porque a concorrência é problema do fornecedor, não seu. Isso vale para os agentes de voz com IA do Zendesk, para a configuração do Freshcaller, e para o agente de voz da Salesforce. Você troca flexibilidade por deixar outra pessoa cuidar do planejamento de capacidade.

Somente us-east-1. Uma única região, sem opção na UE. Se você tem compromissos de residência de dados, isso decide a questão antes mesmo de você avaliar qualquer outra coisa.

Sem nível de prioridade e sem desconto por lote. O nível de prioridade 2x é apenas para Chat Completions e Responses. O desconto de 20% por lote é apenas para modelos de texto. A voz não recebe nem uma via expressa nem uma redução por volume, então a tarifa que você vê é a tarifa que você paga em qualquer escala. Também há uma duração máxima de sessão de 120 minutos, generosa para suporte e apertada para algo como uma linha monitorada.

Duas coisas menores que vale a pena saber. O armazenamento é cobrado separadamente se seu agente fizer recuperação de dados: coleções custam 0,10 $/GiB/dia, arquivos 0,025 $, downloads 0,20 $/GiB. E há uma taxa de 0,05 $ por violação das diretrizes de uso para cada solicitação de Responses bloqueada antes da geração.

Você deve migrar para o 2.0, ou fixar o 1.0?

A troca de alias em 5 de agosto significa que não fazer nada já é, em si, uma decisão. Escolha a linha que descreve você.

O que você está usando hoje?

Escolha uma opção. O veredito muda bastante dependendo de qual dessas descreve você.

Vá para o 2.0 e não pense muito nisso

Em volume de demonstração, o aumento de 60% na tarifa é um erro de arredondamento, e o salto do Full Duplex de 77,8% para 95,1% é a diferença entre uma demo que impressiona e uma que não impressiona. Deixe a troca de alias te levar.

Vá para o 2.0, mas planeje a troca no orçamento

Seu custo por minuto passa de 0,05 $ para 0,08 $ em 5 de agosto sem nenhuma implantação da sua parte. A 2.000 minutos por mês, isso sobe de 100 $ para 160 $. O upgrade de fluidez conversacional vale a pena, mas apresente o número a quem precisa aprovar antes que a fatura faça isso por você.

Resolva primeiro o limite de sessões, o modelo depois

10 sessões simultâneas por equipe é o padrão publicado, e aumentá-lo é uma conversa com a xAI, não uma mudança de configuração. Consiga esse número acordado por escrito antes de fazer qualquer benchmark. Uma pontuação de 95,1% no Full Duplex não faz nada pela chamada de número onze.

Este ainda não é o seu modelo

O speech-to-speech roda apenas em us-east-1, sem nenhuma região na UE publicada. Nenhuma pontuação deste post muda isso. Avalie de novo quando a xAI publicar uma segunda região.

O que quem constrói sobre ele realmente diz

O X é o lar natural para reações à xAI, e atualmente é difícil ler por lá com profundidade, então o sinal útil está no Hacker News. Dois tópicos carregam a maior parte disso.

O comentário mais votado no tópico do Think Fast 2.0 é, basicamente, uma reclamação de que o lançamento passou despercebido:

Hacker News

"Não sei por que este post não é mais popular, é um modelo de voz estado da arte, superando laboratórios especializados como o ElevenLabs"

Essa é uma leitura justa sobre capacidade, e vale notar que os preços também convergiram agora. Cada nível pago do ElevenLabs Agents dá quase exatamente 0,08 $ por minuto incluído, o que corresponde ao centavo com a nova tarifa do Grok. Até 5 de agosto, o Grok era mais barato em 37,5%.

A visão mais ponderada, de alguns meses antes, ainda se sustenta bem:

Hacker News

"O Grok voice é surpreendentemente bom, na verdade. Ainda é um modelo mais burro que os modos de raciocínio dos modelos de fronteira, mas é menos burro que os modos de voz de outros fornecedores."

É mais ou menos onde eu também caio. Um modelo de voz sempre é um compromisso frente a um modelo de texto que tem o luxo de pensar por dez segundos, e o Grok faz um compromisso melhor do que o resto do campo. Leia as análises do lado do consumidor e você verá o mesmo veredito formulado com menos cuidado.

A frustração recorrente nesses tópicos é o uso de ferramentas no modo de voz, e vale esclarecer porque isso corta dos dois lados:

Hacker News

"O que sinto falta neste anúncio é a capacidade de usar conectores e ferramentas. Eu realmente não entendo - NENHUM dos assistentes de fronteira consegue usar ferramentas/conectores no modo de voz"

Isso é sobre assistentes de voz para consumidores, e no lado da API isso não é verdade para o Grok: as sessões suportam ferramentas function, file_search, web_search, x_search, e mcp remotas, com as do lado do servidor sendo executadas para você. As ferramentas de servidor cobram por invocação, a 5 $ por 1.000 para busca na web e no X, 2,50 $ por 1.000 para coleções, e 10 $ por 1.000 para busca de anexos. A lacuna que o comentário descreve é real no app do Grok para consumidores, não no que você construiria. É a mesma divisão que percorre o lançamento de voz do ChatGPT: a API está na frente do aplicativo já há um bom tempo.

Quem deveria adotar isso, e quem deveria esperar

Adote se você está construindo um agente de telefone ou de voz que precisa fazer coisas, não apenas falar. A pontuação τ-voice, o suporte a ferramentas, as extensões force_message e keyterms, e o medidor fixo por minuto se somam ao stack de voz mais amigável para desenvolvedores disponível atualmente. Migrar do áudio em tempo real da OpenAI é quase de graça.

Adote se a previsibilidade de custo importa para sua equipe de finanças. A Artificial Analysis mede o custo real do Grok em 4,80 $ por hora de áudio de entrada, idêntico ao de tabela, porque o medidor é fixo por minuto. O GPT-Realtime-2 lista 1,15 $/h de entrada e mede 4,14 $/h no total. Faturas de voz que correspondem à etiqueta de preço são mais raras do que deveriam ser, o que é metade do motivo pelo qual a pergunta sobre custo de agente versus agente humano é tão difícil de responder honestamente.

Adote se você quer construir a orquestração você mesmo. Se você prefere arrastar caixas de um lado para o outro, os preços do Voiceflow e as alternativas ao Voice Agent Builder são a ponta sem código do mesmo mercado.

Espere se seu volume passar de dez chamadas simultâneas e você ainda não tiver um limite ampliado por escrito. Espere se você precisa de uma região na UE. Espere se você dependia da tarifa de 0,05 $ e não tinha notado o alias mudando debaixo dos seus pés; nesse caso, fixe hoje mesmo o grok-voice-think-fast-1.0 e decida no seu próprio ritmo.

Não compre isso como uma solução de suporte. Isso é um modelo e uma API, não um agente de helpdesk. Não tem noção do seu histórico de tickets, suas macros, suas regras de escalonamento, ou de quais perguntas sua equipe já decidiu que a IA não deve tocar. Tudo acima é sobre a camada de voz, e a camada de voz é talvez 20% do que faz uma automação de suporte realmente funcionar. O resto é a parte chata: conhecer seu produto, saber quando parar, e fazer a transferência de forma limpa.

Uma líder de CX de uma marca de suplementos DTC colocou a restrição melhor do que qualquer ficha técnica:

"A IA nunca vai conseguir responder 100% das perguntas... Eu preciso de uma IA que só lide com os tickets nos quais ela tem confiança e deixe todos os outros de lado."

Nenhum benchmark de voz mede isso. É uma questão de política, e é ela que decide se uma implantação sobrevive ao primeiro mês.

A voz é a metade ruidosa de uma fila de suporte

A maioria dos tickets que se tornam ligações já eram respondíveis por texto uma hora antes. A automação de primeira resposta e um chatbot de base de conhecimento que a IA consegue realmente ler evitam mais chamadas do que qualquer modelo de voz. É isso que vale a pena corrigir antes de sair comprando um.

A eesel é um agente de IA que se conecta ao helpdesk que você já usa, treina com seus tickets anteriores e sua central de ajuda em vez de um system prompt que você tem que escrever à mão, e permite simular todo o processo contra seu histórico real de tickets antes de um único cliente entrar em contato com ele. Essa última parte é intencional. Passei anos observando bots que soam confiantes darem respostas erradas, e um teste a seco sobre tickets que você já resolveu é a única forma honesta de descobrir o que o seu vai fazer. Também é a etapa que separa um agente de IA real de um bot baseado em regras quando os caminhos roteirizados se esgotam.

É a mesma decisão de construir versus comprar à qual muitas equipes chegam depois de ler uma página de documentação como a da xAI e entender o quanto disso teriam que manter sozinhas:

"Poderíamos ter tentado escrever nossa própria aplicação de LLM, mas não queríamos investir nosso tempo nisso. Queríamos algo que não precisássemos manter."

Karel, GENERAL BYTES

Se você também quer a camada de voz, continue lendo sobre o Voice Agent Builder do Grok e o campo mais amplo de empresas de IA de voz. Se você quer resolver primeiro a fila que fica atrás disso, a eesel é gratuita para testar e leva apenas alguns minutos para se conectar ao seu helpdesk. Equipes que usam Gorgias ou Zendesk geralmente a têm respondendo tickets reais na mesma tarde.

Três leituras que vale a pena fazer a seguir, dependendo de em qual parte disso você está travado:

Perguntas frequentes

O Grok Voice Think Fast 2.0 é bom o suficiente para agentes de voz em produção?
Para o modelo em si, sim. Ele obtém 82,9% no índice speech-to-speech da Artificial Analysis e 56,5% no benchmark agêntico τ-voice, a maior pontuação agêntica dessa tabela. A limitação está na plataforma ao redor: 10 sessões simultâneas por equipe por padrão e uma única região us-east-1. Leia a análise completa do Grok Voice Think Fast 2.0 para entender o mecanismo por inteiro, e agentes de IA para call center para o que uma implantação em produção geralmente exige.
O que há de novo no Grok Voice Think Fast 2.0 em relação ao 1.0?
O Full Duplex Bench passou de 77,8% para 95,1%, o tempo até o primeiro áudio caiu de 1,25s para 0,70s, e o índice geral subiu de 75,7% para 82,9%. A precisão da transcrição é 1,4x melhor que na versão 1.0. A pegadinha é o preço: a tarifa passou de 0,05 $ para 0,08 $ por minuto, o que a análise de preços do Grok Voice detalha em dólares.
Quanto custa o Grok Voice Think Fast 2.0 por minuto?
0,08 $ por minuto de áudio, ou 4,80 $ por hora, mais 0,004 $ por mensagem de texto de entrada. Isso é um aumento de 60% sobre a tarifa da versão 1.0, e ele recai automaticamente sobre você caso utilize o alias grok-voice-latest. Compare com os preços do ElevenLabs e o campo mais amplo de empresas de IA de voz antes de se comprometer.
Posso migrar um app do OpenAI Realtime para o Grok Voice?
Em grande parte, sim. O endpoint é compatível a nível de protocolo com o OpenAI Realtime em wss://api.x.ai/v1/realtime, então a troca de URL base e chave cobre a maior parte do trabalho. Quatro tipos de evento se comportam de forma diferente, listados na seção de migração abaixo. Se você construiu sobre a API de áudio da OpenAI, planeje uma tarde em vez de um sprint.
O Grok Voice Think Fast 2.0 é melhor que o ElevenLabs para chamadas de suporte?
Agora eles custam o mesmo por minuto, então tudo se resume ao formato. O Grok é pré-pago por uso e trata raciocínio e chamadas de ferramentas em um único modelo; o ElevenLabs vende pacotes de minutos pré-pagos. Para uma fila de suporte especificamente, nenhum dos dois é um helpdesk, por isso as equipes combinam uma camada de voz com algo como um agente de helpdesk com IA que já conhece o histórico de tickets.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Duas pessoas em conversa com formas de onda de voz entre elas e o logótipo Grok por cima
AI

Grok Voice Think Fast 2.0: rápido, afiado, mas limitado

Uma análise prática do Grok Voice Think Fast 2.0: a realidade dos benchmarks, as particularidades da API e o limite de 10 sessões que decide se você pode colocá-lo em produção.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

O que é o Buzz? O workspace de agentes de IA de Jack Dorsey

Buzz é o novo app de chat de equipe, de código aberto, criado por Jack Dorsey, onde pessoas e agentes de IA compartilham os mesmos canais. O que é, para quem serve e qual é a pegadinha.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Ilustração de um canvas de construtor de agentes de IA sem código com nós de fluxo de trabalho
AI

Os 7 melhores construtores de agentes de IA sem código em 2026

Testei os principais construtores de agentes de IA sem código para equipes de suporte em 2026, do Botpress ao Copilot Studio, e classifiquei qual realmente se encaixa na sua configuração.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026
Ilustração editorial para uma análise do Gemini 3.6 Flash, o modelo de IA workhorse rápido do Google
AI

Análise do Gemini 3.6 Flash: o cavalo de batalha mais barato e rápido do Google

Uma análise prática do Gemini 3.6 Flash: o novo preço, o corte de 17% em tokens, onde ele supera o GPT-5.6 e o Claude Sonnet 5, e onde ainda fica atrás.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Ilustração da análise do Super Agent do Genspark AI
AI

Análise do Genspark AI 2026: o Super Agent vale a pena?

Uma análise prática do Genspark AI: o que o Super Agent realmente faz, o preço real e o problema do consumo de créditos, e se vale a pena pagar em 2026.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração editorial abstrata de um espaço de trabalho de geração de imagem precisa
AI

Análise do Seedream 5.0 Pro: preciso, poderoso, difícil de acessar

O Seedream 5.0 Pro foca em composição de imagem precisa, texto multilíngue e fusão de referências. Esta análise cobre seus pontos fortes, limites, preço e acesso.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 13, 2026
Ilustração de uma tela de IA ramificada gerando imagens, slides e texto
AI

Flowith review: vale a pena a tela de agentes de IA? (2026)

Uma review prática do Flowith: o que a tela ramificada de IA e o Agent Neo realmente fazem, quanto custa o Flowith em créditos e quem deve pular essa.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Banner ilustrado para um guia sobre o Flowith, o espaço de trabalho criativo com agente de IA construído sobre um canvas infinito de nós
AI

O que é o Flowith? O canvas de agentes de IA, o Agent Neo e os preços

O Flowith é um agente de IA que trabalha num canvas infinito em vez de uma caixa de chat. Veja o que o Agent Neo realmente faz, quanto custa e onde se encaixa.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração para uma seleção das melhores alternativas ao Google Gemini 3.6 Flash em 2026
AI

As 6 melhores alternativas ao Gemini 3.6 Flash em 2026

As melhores alternativas ao Gemini 3.6 Flash em 2026, com preços e benchmarks reais: GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite e mais.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis