
A tabela completa de tarifas do Grok Voice, como publicada hoje
Aqui está tudo o que consta na seção de API de voz da tabela de tarifas da xAI, mais a linha de telefonia que fica no anúncio do Voice Agent Builder em vez disso. Também incluí as tarifas independentes de transcrição e síntese, porque muitas equipes ainda operam um pipeline segmentado e querem comparar os dois formatos.
| Item | Tarifa |
|---|---|
Speech to speech, grok-voice-think-fast-2.0 | $0.08 / min ($4.80 / h) |
Speech to speech, grok-voice-think-fast-1.0 | $0.05 / min ($3.00 / h) |
Entrada de texto, por conversation.item.create | $0.004 / mensagem |
| Número de telefone provisionado (telefonia) | +$0.01 / min |
| Speech to text, REST | $0.10 / h |
| Speech to text, streaming | $0.20 / h |
| Text to speech | $15.00 / 1M caracteres |
web_search ou x_search | $5 / 1k chamadas |
collections_search / file_search | $2.50 / 1k chamadas |
attachment_search | $10 / 1k chamadas |
code_execution | $5 / 1k chamadas |
| Armazenamento de coleções | $0.10 / GiB / dia |
Vale a pena dizer duas coisas em voz alta sobre essa tabela, porque são os pontos em que as pessoas erram ao orçar.
O medidor de áudio é descrito na ficha do modelo como cobrando por minuto de áudio "enviado ou recebido", o que soa como se pudesse contar em dobro numa conversa bidirecional. Parece que não é o caso. A Artificial Analysis mediu o custo por hora de áudio de entrada exatamente em $4.80 para esse modelo, que é $0.08 multiplicado por sessenta, então no teste deles o medidor se comportou como uma única contagem de duração de sessão, em vez de somar as duas direções. Ainda assim, eu conferiria a primeira fatura por conta própria em vez de confiar apenas nisso.
O medidor de entrada de texto também é mais restrito do que parece. A xAI cobra $0.004 por cada evento conversation.item.create enviado, mas itens de function_call_output não são cobrados, e response.create nem sequer é um evento cobrável. Então um agente tagarela que usa muitas ferramentas não acumula cobranças de entrada de texto para cada resultado de ferramenta que devolve, o que era a suposição com a qual comecei e que estava errada.
A virada de 5 de agosto, em dólares
Esse é o motivo inteiro pelo qual este artigo existe hoje, e não na semana passada.

A própria nota de lançamento da xAI é direta sobre isso: em 5 de agosto de 2026, o grok-voice-latest muda de grok-voice-think-fast-1.0 para grok-voice-think-fast-2.0, sem nenhuma ação necessária para atualizar, e para permanecer no modelo antigo é preciso fixar grok-voice-think-fast-1.0 antes dessa data. O que a nota não faz é colocar uma porcentagem ao lado, e essa porcentagem é de 60% por minuto.
A documentação está atualmente no meio da virada, o que achei discretamente engraçado. A tabela de modelos no guia de speech-to-speech ainda descreve o alias apontando para 1.0 e sendo atualizado em 5 de agosto, enquanto um parágrafo mais abaixo na mesma página já diz que ele "sempre aponta para o modelo mais recente (atualmente grok-voice-think-fast-2.0)". Ambos eram verdadeiros em dias diferentes. Nenhum dos dois conta o que isso faz com a sua fatura.
Bem ao lado disso tudo, no mesmo post de lançamento, está a frase com que a xAI abre sua seção de preços: "Acreditamos que os preços devem ser previsíveis e transparentes." Eu de fato acho isso defensável aqui. Eles deixaram o 1.0 publicado na tarifa antiga, deram um aviso datado e documentaram a forma de optar por não migrar. Isso é mais aviso do que a maioria das repactuações de preço de modelo costuma dar. Só que não é a mesma coisa que sua fatura ser previsível, porque o caminho padrão mudou, e é ali que vive a maior parte do tráfego em produção.
O que o preço de tabela deixa de fora
Toda tabela de tarifas de voz nessa categoria tem a mesma marca registrada: o número principal é a única coisa na fatura que não é surpresa. Aqui está uma única chamada de suporte de seis minutos, calculada linha por linha.

- Áudio: 6 min x $0.08 = $0.48
- Número de telefone provisionado: 6 min x $0.01 = $0.06
- Duas buscas na web: 2 x $0.005 = $0.01
- Uma consulta a coleções: 1 x $0.0025 = $0.0025
- Três entradas de texto: 3 x $0.004 = $0.012
Isso dá $0.5645 contra um preço de tabela de $0.48, cerca de 18% acima. Não é catastrófico, e honestamente é uma das melhores proporções nessa categoria, porque as tarifas de ferramentas da xAI são baratas e sua tarifa de voz é fixa. Mas isso escala de forma linear, e 18% sobre uma linha de voz de $3.200 mensais são $576 que ninguém colocou na previsão.
A linha que eu modelaria com mais cuidado é a do web_search. A $5 por 1.000 chamadas, parece arredondamento, até você lembrar que um modelo agêntico decide sozinho quantas ferramentas chamar. A própria xAI diz isso claramente na página de preços: os custos escalam com a complexidade da consulta porque é o agente que escolhe. O esforço de raciocínio vem por padrão em "high" nesse modelo, e embora os tokens de raciocínio não sejam medidos separadamente no medidor de voz, um modelo que pensa mais é um modelo que recorre a mais ferramentas.
O que os três centavos extras realmente compram
Eu não pagaria 60% a mais por um benchmark mais redondo, então aqui vai a leitura honesta do que realmente muda.
| Medida | Think Fast 2.0 | Think Fast 1.0 | Mudança |
|---|---|---|---|
| Custo por hora de áudio de entrada | $4.80 | $3.00 | +60% |
| Índice speech-to-speech | 82.9% | 75.7% | +7.2 pts |
| Desempenho agêntico (τ-voice) | 56.5% | 52.1% | +4.4 pts |
| Dinâmica conversacional | 95.1% | 77.8% | +17.3 pts |
| Raciocínio de fala | 97.2% | 97.1% | estável |
| Tempo até o primeiro áudio | 0.70s | 1.25s | 44% mais rápido |
Leia essa coluna de mudanças como um formato, não como uma pontuação. O raciocínio de fala praticamente não mudou, então, se o trabalho do seu agente é entender uma frase e ler uma resposta de volta, você está pagando 60% a mais por algo que não vai notar. O que se moveu foi a dinâmica conversacional, subindo 17.3 pontos, que é o tratamento de interrupções, o barge-in, saber quando quem ligou terminou de falar, e a latência, caindo para 0.70 segundo. Essas são as duas coisas que fazem uma chamada telefônica parecer uma chamada de verdade, e não um quiosque.
O desempenho agêntico subiu 4.4 pontos, para 56.5%. Esse é o número publicado mais alto na tabela de speech-to-speech da Artificial Analysis, e ainda assim é uma taxa de falha de 43.5% em cenários agênticos difíceis, que é o número que eu colocaria na frente de qualquer pessoa que esteja orçando automação total. É também o motivo pelo qual a taxa de resolução sobre a qual você planeja deveria vir do seu próprio tráfego, não de um ranking.
Dois desenvolvedores no Hacker News chegaram à mesma leitura por caminhos opostos. Um avaliou o modelo pela sensação:
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right."
E no próprio tópico do Think Fast 2.0, o comentário mais votado o comparava com o especialista já estabelecido:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
O que é uma boa ponte, porque superar a ElevenLabs em qualidade é uma pergunta diferente de superá-la em preço, e a partir de hoje essas duas respostas divergem.
O preço do Grok Voice frente ao resto do campo
A Artificial Analysis publica o custo medido por hora de áudio de entrada para toda a categoria speech-to-speech, a única coluna comparável de fato quando metade dos fornecedores cobra por token e a outra metade por minuto.
| Modelo | Índice S2S | $/h medido | Tempo até o primeiro áudio |
|---|---|---|---|
| Qwen Audio 3.0 Realtime Plus | 84.1% | $4.42 | 4.02s |
| Grok Voice Think Fast 2.0 | 82.9% | $4.80 | 0.70s |
| GPT-Realtime-2.1 High | 79.1% | $10.75 | 1.21s |
| GPT-Realtime-2 High | 77.2% | $4.14 | 1.14s |
| Qwen Audio 3.0 Realtime Flash | 76.3% | $4.77 | 4.16s |
| Grok Voice Think Fast 1.0 | 75.7% | $3.00 | 1.25s |
| GPT-Realtime-2.1 Minimal | 72.5% | $11.31 | 0.97s |
| Gemini 3.1 Flash High | 69.5% | $1.75 | 2.99s |
| Deepslate Opal | 62.8% | $6.48 | 0.44s |
Quatro coisas nessa tabela valem mais do que o ranking em si.
A Grok não é o melhor modelo barato, e também não é o melhor modelo, sem mais. O Qwen Audio 3.0 Realtime Plus da Alibaba pontua mais alto, 84.1%, e mede um custo mais barato, $4.42/h. O problema dele está na última coluna: 4.02 segundos até o primeiro áudio, contra 0.70. Numa linha telefônica, isso é silêncio morto sobre o qual quem ligou vai começar a falar. A verdadeira proposta da Grok é a combinação de índice e latência, e nessa combinação ela não tem rival na tabela.
A tarifa fixa é o recurso subestimado. O $4.80 medido da Grok é idêntico ao seu preço de lista, porque o próprio preço de lista já é fixo por minuto. O GPT-Realtime-2 da OpenAI lista $1.15 por hora de áudio de entrada e $4.61 por hora de saída, e mede $4.14 no total, então a tarifa de entrada que você mostraria a um CFO é cerca de 28% do que você realmente paga. Essa diferença não é um truque, é simplesmente o que a cobrança de áudio por token faz, e é por isso que os orçamentos do GPT-Realtime tendem a ser estimativas em vez de números.
Reduzir o raciocínio não economiza dinheiro de forma confiável. O GPT-Realtime-2.1 Minimal mede $11.31/h, mais que os $10.75 da variante High, com uma pontuação 6.6 pontos menor. Se você presumia que um esforço menor era uma alavanca de custo em voz, essa linha é o contraexemplo.
A latência tem seu próprio piso de preço. O Deepslate Opal é o mais rápido medido, a 0.44s, e custa $6.48/h com pontuação de 62.8%. Velocidade se compra sozinha; rápido e inteligente ao mesmo tempo é para o que existe a tarifa da Grok.
Vale notar o que essa tabela não contém: a camada de plataforma. Fornecedores de orquestração como o Retell AI cobram uma taxa de plataforma além de qualquer modelo para o qual roteiem, então o número por minuto deles e os números acima não são o mesmo tipo de número.
Vapi e Hume cobram da mesma forma. Eu calculei o custo de ambos no resumo de empresas de voz com IA, e o padrão se mantém: uma tarifa de modelo e uma tarifa de plataforma são produtos diferentes usando as mesmas unidades.
A comparação com a ElevenLabs merece parágrafo próprio, porque foi ela que virou hoje. Os planos de agente da ElevenLabs são cotas de minutos pré-pagas: $6 por 75 minutos, $22 por 275, $99 por 1.238, $299 por 3.738, $990 por 12.375. Dividindo qualquer um deles, você chega a quase exatamente $0.08 por minuto incluído em todos os planos pagos, que é a nova tarifa da Grok até o centavo. Até esta manhã, a Grok era 37.5% mais barata. O que resta é uma diferença na forma de cobrança, não no preço: os minutos da ElevenLabs são pré-pagos e expiram, os da Grok são pagamento por uso, então uma linha com volume irregular ou sazonal ainda sai ganhando com a Grok, e uma linha rodando a todo vapor o mês inteiro agora é uma moeda no ar. No Cartesia Sonic 3 e no restante do campo especializado, a mesma questão de formato se aplica.
Os limites que custam mais que a tabela de tarifas
Estes me importam mais que o número por minuto, porque uma tarifa que dá para prever é mais fácil de conviver do que um teto no qual você esbarra às 16h de uma Black Friday.
Dez sessões simultâneas por equipe. Esse é o padrão publicado na ficha do modelo, com limites maiores disponíveis sob solicitação. Dez chamadas simultâneas são uma fila de entrada pequena. Quem estiver dimensionando uma linha telefônica de verdade deve fazer o pedido de concorrência antes do cartão de crédito, não depois.
Sessão máxima de 120 minutos. Suficiente para suporte, vale saber se havia ideias de assistentes de longa duração.
Sem desconto por lote e sem nível prioritário na voz. O desconto de 20% por lote da xAI aplica-se apenas a modelos de texto específicos, e o Priority Processing a 2x é limitado a Chat Completions e Responses. A voz não tem nem faixa de desconto nem faixa rápida paga, o que é coerente com um medidor plano em tempo real, mas remove duas alavancas que você poderia ter do lado de texto.
O armazenamento é cobrado separadamente se o agente fizer recuperação. As coleções custam $0.10 por GiB ao dia, os arquivos $0.025, os downloads $0.20 por GiB. Pequeno numa base de conhecimento pequena, e vale uma linha no modelo se você estiver sincronizando uma central de ajuda inteira para suporte multilíngue.
Há uma taxa de $0.05 para solicitações bloqueadas. Se uma solicitação da Responses API for identificada como violação das diretrizes de uso antes da geração, a xAI cobra $0.05. Não é uma linha específica de voz, mas é o tipo de coisa que aparece como um erro de arredondamento inexplicável numa fatura grande.
Uma única região. O speech to speech roda apenas em us-east-1, o que é um fato de latência e residência de dados, mais do que de preço, embora vire uma questão de preço no momento em que uma revisão de compras pergunta sobre isso.
Onde a questão do preço realmente pousa
Aqui está a decisão que eu tomaria com tudo isso na mesa.
Se você opera uma linha telefônica de entrada em que quem liga interrompe, muda de ideia, e espera que o agente realmente faça algo, a tarifa de $0.08 é justa e a virada de alias é um aumento que vale a pena aceitar. A dinâmica conversacional subindo 17.3 pontos e a latência de 0.70 segundo são as duas coisas que quem liga sente, e nenhum outro modelo na tabela combina isso com um índice de 82.9%.
Se seu agente de voz só lê status de pedidos, fixe o grok-voice-think-fast-1.0 hoje mesmo e mantenha a tarifa de $0.05. O raciocínio de fala já estava em 97.1% no 1.0. Você não está deixando qualidade na mesa para a carga de trabalho que realmente tem, e a 10.000 minutos por mês, fixar a versão vale $300.
Se você ainda não construiu a linha, o número a modelar não é por minuto de jeito nenhum. É o custo por incidente resolvido, e isso significa saber que fração das chamadas termina sem um humano. É a mesma aritmética por trás de qualquer caso de ROI de call center, e vale a pena colocá-la ao lado da referência de custo de IA versus agente humano antes de assinar qualquer coisa.
Um número mais suave também pertence a esse modelo. Um agente mais rápido e menos interrompível movimenta o CSAT, e o CSAT é o que impede que uma linha automatizada barata custe clientes em silêncio. É o número mais difícil de prever e o mais fácil de notar depois que cai.
A conta de voz é a metade pequena do problema
Eu cuido do SEO da eesel e leio as notas de vendas, e as conversas sobre preço que dão errado quase nunca dão errado por causa de uma tarifa por minuto. Elas dão errado por causa da unidade.
Já ouvi isso dos dois extremos da curva de volume. Uma líder de operações numa fintech de pagamentos e transferências de dinheiro no Zendesk, lidando com 7.000 a 8.000 tickets escalados por mês, me disse que preço por interação era descartável frente a cobrança por sessão, porque com cerca de quatro trocas por ticket, o medidor conta a conversa quatro vezes. Um operador de e-commerce multiempresa, crescendo em direção a 150.000 tickets por mês, projetou cerca de $30.000 por mês a vinte centavos por ticket e passou a maior parte de uma ligação tentando descobrir se a unidade era uma interação ou um ticket. Nenhum dos dois casos era um argumento sobre a tarifa ser alta demais. Ambos eram argumentos sobre o que a tarifa estava contando.
Essa é a lente que eu aplicaria à tabela de tarifas da Grok, e ela sai bem na foto. Um medidor de áudio fixo por minuto é a unidade mais legível dessa categoria. Também é, estruturalmente, uma unidade que cobra por tempo em vez de resultado, que é exatamente a unidade certa para uma chamada telefônica e exatamente a errada para uma fila de tickets.

Calculando o custo de uma linha de Grok Voice? A outra metade dessa planilha é o volume de e-mail e chat que nunca faz o telefone tocar, e ele não é cobrado por minuto. A eesel é um agente de IA para helpdesk que cobra por ticket realmente resolvido, se conecta ao Freshdesk ou ao Gorgias em poucos minutos, e treina com seus tickets passados em vez de um rastreamento do site.
O que importa para uma previsão: a eesel roda uma simulação de deflexão contra o histórico real dos seus tickets antes de responder a um cliente ao vivo, então a taxa de resolução que você coloca na planilha é uma que você mediu na sua própria fila, não uma emprestada de um ranking. Experimente a eesel de graça, ou veja os preços primeiro, já que aparentemente é essa a página que decide tudo.
O que eu faria antes de a fatura chegar
Três movimentos concretos, na ordem em que eu os faria.
- Faça um grep por
grok-voice-latest. Se estiver em código de produção, você já está na nova tarifa a partir de hoje. Decida se é isso que você quer, e então fixe uma versão de qualquer forma, porque a própria documentação da xAI recomenda fixar versões em produção, e é exatamente por isso. - Refaça a previsão incluindo chamadas de ferramentas no modelo. Pegue os minutos do mês passado, adicione de 15% a 20% para invocações de ferramentas e telefonia, e confira o número na calculadora acima. A linha de áudio nunca é a linha inteira.
- Peça o aumento de concorrência antes de precisar dele. Dez sessões simultâneas é o padrão, não o teto. Aumentar isso é uma solicitação, e solicitações demoram mais do que picos de tráfego.
Nada disso é motivo para evitar o modelo. O Think Fast 2.0 é o modelo de voz agêntico mais forte com números publicados, e a $4.80 por hora medidos, custa menos da metade do melhor nível em tempo real da OpenAI. É apenas um motivo para saber qual das suas strings de modelo é um alvo móvel, e o que acontece com sua fatura quando ele se move. A mesma disciplina se aplica ao gerenciamento de escalonamento e à prevenção de respostas erradas: o padrão raramente é a configuração que você teria escolhido de propósito.
Para o restante desse conjunto de artigos, a visão geral do Think Fast 2.0 cobre o que mudou no modelo em si. O artigo sobre preços do Voice Agent Builder cobre a plataforma sem código que fica em cima dele, e há uma análise prática do Builder se você preferir o fluxo de trabalho em vez da tabela de tarifas.
Ainda decidindo se voz é o canal certo? Comece com a IA consegue atender chamadas de suporte, depois a explicação mais ampla sobre chamadas telefônicas com IA.
Se quem liga já chega até você por um produto de telefone de helpdesk como o Zendesk Talk, a pergunta de construir versus comprar vem antes da de preço por minuto. Meu resumo de automação de suporte é o atalho para chegar lá.
Perguntas frequentes
Quanto custa o Grok Voice Think Fast 2.0 por minuto?
Por que o preço do Grok Voice subiu 60%?
grok-voice-latest mudou de 1.0 para 2.0 em 5 de agosto de 2026, então quem usava o alias passou a pagar a tarifa mais alta sem nenhum deploy próprio. Fixar a versão é a solução, e é a mesma disciplina de fixação de versão da qual depende prevenir respostas erradas da IA.O Grok Voice Think Fast 2.0 é mais barato que a Realtime API da OpenAI?
Existe um plano gratuito para o Grok Voice Think Fast 2.0?
Quanto uma chamada de suporte real do Grok Voice realmente cobra?
web_search ou x_search, $2.50 por 1.000 consultas a coleções, $10 por 1.000 buscas de anexos. Modele as chamadas de ferramentas, não só os minutos, assim como faria ao calcular o custo da automação de call center.Como o preço do Grok Voice se compara ao do ElevenLabs Agents?
Quais são os limites de taxa da API do Grok Voice?
O Grok Voice Think Fast 2.0 vale os 3 centavos extras por minuto?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








