Preços do Gemini 3.8 Flash TTS: o que uma hora de voz de IA realmente custa

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição September 23, 2026

Verificado por especialista
Ilustração de ondas sonoras e etiquetas de preço representando os preços do Gemini 3.8 Flash TTS

Resumo rápido

O Gemini 3.8 Flash TTS custa US$ 0,50 por milhão de tokens de entrada de texto e US$ 9,00 por milhão de tokens de saída de áudio no nível pago padrão, até 31 de dezembro de 2026. O áudio é cobrado a 25 tokens por segundo, então uma hora inteira de fala gerada sai por cerca de US$ 0,81. Também há um nível realmente gratuito no Google AI Studio.

Duas coisas para guardar. Primeiro, ambas as taxas dobram em 1º de janeiro de 2027, então qualquer orçamento construído com os números de hoje precisa ser dobrado para o ano que vem. Segundo, a cerca de US$ 0,81 por hora, este é um dos modelos de voz expressiva mais baratos que existem, bem abaixo da ElevenLabs e dos níveis generativos premium da Amazon e da Deepgram.

A pegadinha é a que se aplica a qualquer modelo bruto: áudio barato não é o mesmo que um produto funcional. Um endpoint de TTS fala; ele não conhece sua base de conhecimento, não chama suas ferramentas nem é testado antes contra conversas reais. Se você está colocando um modelo de voz de frente para o atendimento ao cliente, essa lacuna é tudo, e é exatamente o que um agente de helpdesk de IA existe para fechar.

O que o Gemini 3.8 Flash TTS realmente é

O Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) é o atual modelo de texto para voz do Google, e ao contrário de muitos modelos de áudio por aí, ele é estável, não uma prévia. O id não carrega sufixo -preview, e o Google o lista como o substituto recomendado do antigo gemini-3.1-flash-tts-preview. Ele recebe texto e produz áudio, nada mais, exatamente o que se espera de um modelo de voz dedicado.

A ficha técnica é generosa. Você tem 30 vozes de estúdio pré-construídas (Zephyr, Puck, Kore, Fenrir e companhia), cada uma com um descritor como Bright ou Firm, além de uma Extended Voice Library com centenas de outras que podem ser obtidas com client.voices.list(). Ele fala 130 idiomas com detecção automática de entrada, e você pode direcionar estilo, sotaque, ritmo e tom com prompts em linguagem natural, ou inserir tags inline como <laugh> e <sigh> para eventos vocais pontuais. Ele também traz design de voz (construir uma persona a partir de uma descrição em texto) e clonagem de voz a partir de um clipe de referência.

O detalhe técnico que pega no dia a dia: multi-locutor é limitado a dois locutores por requisição. Um podcast de três pessoas ou uma cena em grupo significa sintetizar cada fala separadamente e costurar o áudio você mesmo. A saída padrão é WAV mono a 24 kHz, com mulaw e alaw disponíveis para telefonia. Isso convive com o modelo somente texto Gemini 3.8 Flash, e os dois são cobrados de forma completamente diferente, que é de onde vem a maior parte da confusão.

Preços do Gemini 3.8 Flash TTS: a tabela completa

Aqui está cada nível, em USD por milhão de tokens, nas taxas promocionais de 2026. A taxa de 2027 está entre parênteses porque, como veremos, tudo dobra.

NívelEntrada de texto / 1MSaída de áudio / 1MNotas
StandardUS$ 0,50 (US$ 1,00)US$ 9,00 (US$ 18,00)A taxa padrão
BatchUS$ 0,25 (US$ 0,50)US$ 4,50 (US$ 9,00)~50% de desconto, tarefas assíncronas
FlexUS$ 0,25 (US$ 0,50)US$ 4,50 (US$ 9,00)Mesma taxa, cache mais barato
PriorityUS$ 0,90 (US$ 1,80)US$ 16,20 (US$ 32,40)~1,8x, sensível à latência
FreeGrátisGrátisStandard/priority via AI Studio

Tudo isso vem diretamente da página de preços da API Gemini do Google. Cache de contexto é suportado e começa em US$ 0,125 por milhão de tokens de cache de entrada no nível padrão, mais uma taxa de armazenamento de US$ 0,50 por milhão por hora. O número de saída de áudio é o que importa, porque é o que escala com o quanto de fala você gera. A entrada de texto é quase um arredondamento em comparação.

O que é curiosamente interessante é onde os US$ 9,00 ficam na própria linha do Google. É mais barato que o Gemini 2.5 Flash TTS que ele substitui (US$ 10 de saída de áudio), e menos da metade do preço dos modelos preview 2.5 Pro e 3.1 Flash TTS (US$ 20 de saída de áudio). Há também um irmão mais barato, o Flash-Lite TTS, a US$ 6 de saída de áudio se você puder viver com 101 idiomas em vez de 130.

Gráfico de barras comparando o custo de saída de áudio por milhão de tokens entre modelos de texto para voz do Gemini, com o 3.8 Flash TTS destacado em US$ 9
Gráfico de barras comparando o custo de saída de áudio por milhão de tokens entre modelos de texto para voz do Gemini, com o 3.8 Flash TTS destacado em US$ 9

O que isso custa na prática

O preço por token é difícil de sentir, então vamos transformar em dinheiro de verdade. O áudio é cobrado a 25 tokens por segundo, o que dá 1.500 tokens por minuto e 90.000 tokens por hora. Na taxa padrão de 2026 de US$ 9,00 por milhão, uma hora de fala gerada custa cerca de US$ 0,81. Somando o texto inserido (uma hora inteira de narração são apenas cerca de 12.000 tokens de entrada), o acréscimo é bem menos de um centavo.

Pipeline mostrando 25 tokens de áudio por segundo virando 1.500 por minuto, US$ 0,0135 por minuto e cerca de US$ 0,81 por hora na taxa padrão de 2026
Pipeline mostrando 25 tokens de áudio por segundo virando 1.500 por minuto, US$ 0,0135 por minuto e cerca de US$ 0,81 por hora na taxa padrão de 2026

Alguns exemplos práticos na taxa padrão:

  • Um episódio de podcast de 30 minutos: cerca de US$ 0,41 em áudio.
  • Um audiobook de 8 horas: aproximadamente US$ 6,48.
  • 10.000 mensagens de URA de suporte de 15 segundos cada: 3,75 milhões de tokens de áudio, então cerca de US$ 33,75.

Rode qualquer um desses como um job batch noturno e você reduz pela metade, o que deixa o audiobook mais perto de US$ 3,24. Para geração de alto volume e não interativa, batch é a jogada óbvia. O único lugar onde o preço de etiqueta não conta a história toda é qualquer coisa que um humano espera em tempo real, onde você paga a taxa priority e arca com uma latência que não consegue controlar totalmente.

A pegadinha: os preços dobram em 1º de janeiro de 2027

Esta é a parte para anotar num post-it. Os valores de US$ 0,50 e US$ 9,00 são taxas promocionais de lançamento. Em 1º de janeiro de 2027, a entrada de texto padrão sobe para US$ 1,00 por milhão e a saída de áudio para US$ 18,00 por milhão. Todos os outros níveis dobram junto: saída de áudio de batch e flex para US$ 9,00, saída de áudio de priority para US$ 32,40.

Comparação antes e depois mostrando as taxas padrão do Gemini 3.8 Flash TTS dobrando de US$ 9 para US$ 18 na saída de áudio e de US$ 0,50 para US$ 1,00 na entrada de texto em 1º de janeiro de 2027
Comparação antes e depois mostrando as taxas padrão do Gemini 3.8 Flash TTS dobrando de US$ 9 para US$ 18 na saída de áudio e de US$ 0,50 para US$ 1,00 na entrada de texto em 1º de janeiro de 2027

Então aquela hora de áudio de US$ 0,81 vira cerca de US$ 1,62 em 2027, e o audiobook de 8 horas passa de US$ 6,48 para US$ 12,96. É o mesmo movimento que o Google fez com os modelos de texto, e é justo desde que você o veja chegando. Se você está orçando algo além deste ano, dobre os números deste post e planeje a partir daí. Isso também empurra para travar agora qualquer economia de cache e batch que der.

Como ele se compara com ElevenLabs, OpenAI e o resto

Comparar modelos de voz é genuinamente complicado, porque os fornecedores não cobram do mesmo jeito. Amazon, Azure e Deepgram cobram por caractere de texto de entrada. OpenAI e Google cobram por token de saída de áudio, que escala com a duração da fala gerada, não com o roteiro. A ElevenLabs vende créditos de assinatura. Para colocar todos no mesmo eixo, converti tudo em um custo estimado por hora de fala, usando a própria âncora da Amazon de que 1 milhão de caracteres são aproximadamente 23 horas de áudio. Trate os valores por hora como estimativas, não como termos de contrato, porque eles mudam com o ritmo de fala.

FornecedorModelo principalPreço nativo~ US$/hora de áudioNível gratuito
Gemini 3.8 Flash TTSgemini-3.8-flash-ttsUS$ 9 / 1M tokens de áudio~US$ 0,81Grátis no AI Studio
Amazon Polly (Neural)NeuralUS$ 16 / 1M caracteres~US$ 0,701M caracteres/mês (12 meses)
Azure AI SpeechNeural / HD FlashUS$ 15 / 1M caracteres~US$ 0,650,5M caracteres/mês
OpenAIgpt-4o-mini-ttsUS$ 12 / 1M tokens de áudio~US$ 0,90Nenhum
Amazon Polly (Generative)GenerativeUS$ 30 / 1M caracteres~US$ 1,30100 mil caracteres/mês
DeepgramAura-2US$ 30 / 1M caracteres~US$ 1,30US$ 200 de crédito
ElevenLabsEleven v3 / Flash~5c/min (Business)~US$ 3,0010 mil créditos/mês

O detalhe que mais me surpreendeu: o Gemini 3.8 Flash TTS tem preço de voz neural padrão sendo, na verdade, um dos modelos generativos mais expressivos. As linhas mais baratas da Amazon e da Azure são suas vozes neurais mais antigas; o nível de qualidade generativa delas (Polly Generative) fica em US$ 1,30 por hora, e o principal da Deepgram cai no mesmo patamar. A ElevenLabs, que continua sendo a referência em qualidade de voz, custa cerca de quatro vezes mais por hora. Se custo por hora é o seu fator decisivo e você quer saída expressiva, o Gemini é difícil de bater agora, ao menos até o reajuste de 2027 levá-lo a cerca de US$ 1,62.

Para o lado da OpenAI dessa comparação, meus artigos sobre a API Realtime da OpenAI e os preços do gpt-realtime-mini aprofundam onde a voz cobrada por token faz sentido.

A voz é boa mesmo?

O preço só importa se o resultado for utilizável, e é aqui que as primeiras reações ficam mais divididas. O lançamento gerou certa reclamação sobre a qualidade. Um desenvolvedor no Hacker News colocou de forma direta:

Hacker News

"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."

Isso é a opinião de uma pessoa só, e preferência de voz é subjetiva, mas bate com um padrão: o TTS do Google é barato e amplo, enquanto a ElevenLabs ainda vence o teste de "essa voz específica soa marcante" para muita gente. Alguns usuários continuam com o que já conhecem por enquanto:

Hacker News

"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."

Então a leitura honesta é esta. Se você precisa de narração barata, multilíngue e boa o suficiente em escala, o Gemini 3.8 Flash TTS tem um ótimo custo-benefício. Se uma voz única, marcante e que define a marca é o produto, teste com cuidado contra a ElevenLabs, e não presuma que a diferença de preço significa uma diferença de qualidade a seu favor.

Onde um modelo de voz barato se encaixa, e onde não

Aqui vai a reformulação com a qual eu gostaria que um comprador saísse. Um modelo de TTS é infraestrutura. É uma forma fantástica e barata de dar voz a um app: um pipeline de audiobook, um narrador dentro do produto, uma camada de acessibilidade, mensagens de URA. Para isso, US$ 0,81 por hora é um ótimo negócio de verdade.

Mas no momento em que o caso de uso é atendimento ao cliente, o modelo é os 10% fáceis do problema. A parte difícil é tudo ao redor: extrair a resposta certa da sua base de conhecimento, chamar as ferramentas que realmente resolvem um chamado, e ser testado contra seu histórico real antes de falar com um cliente. Essa é a diferença entre infraestrutura e um funcionário. O Gemini TTS é a primeira coisa. Ele não vai conhecer sua política de reembolso nem fazer triagem de chamado, e montar tudo isso sozinho é um projeto, não uma chamada de API.

Esse é o quadro em que trabalhamos todos os dias. Passamos anos colocando IA em filas de suporte reais, e o que separa uma demo de um lançamento de verdade nunca é o modelo, é sempre o encanamento e os testes. É por isso que um agente de helpdesk de IA é uma compra bem diferente de um endpoint de voz, mesmo quando os dois dizem "IA" na embalagem. Se você está pesando de forma mais geral a conta humano versus automação, nossa análise de custo de agente de IA vs. agente humano é um ponto de partida melhor do que uma taxa por token.

Experimente o eesel

O eesel é uma plataforma de colegas de equipe de IA, e a escalação atual inclui um agente de helpdesk de IA pronto para trabalhar que entra na sua fila de suporte já existente. Enquanto o Gemini TTS é um modelo em torno do qual você precisa construir, o eesel chega já sabendo se conectar ao seu helpdesk, aprender com seus chamados passados e ser simulado contra conversas históricas reais para que você saiba a taxa de resolução dele antes de entrar no ar.

Tela de onboarding do eesel AI mostrando um colega de equipe de IA conectado a um helpdesk e pronto para redigir respostas
Tela de onboarding do eesel AI mostrando um colega de equipe de IA conectado a um helpdesk e pronto para redigir respostas

Se você prefere trabalhar em um terminal, a CLI do eesel opera o mesmo colega de equipe e workspace de forma programática. Você pode operá-la manualmente, integrá-la a scripts ou deixar que um agente de codificação como Claude Code ou Cursor a rode sem interface, de modo que a IA que você compra esteja disponível tanto no painel quanto pela API, do mesmo jeito que você recorreria a um modelo como o Gemini TTS. Você pode testar o eesel de graça e simulá-lo primeiro contra seus próprios chamados.

Perguntas frequentes

Quanto custa o Gemini 3.8 Flash TTS?
Os preços do Gemini 3.8 Flash TTS são US$ 0,50 por milhão de tokens de entrada de texto e US$ 9,00 por milhão de tokens de saída de áudio no nível pago padrão, até 31 de dezembro de 2026. Como o áudio é cobrado a 25 tokens por segundo, isso dá cerca de US$ 0,81 por uma hora inteira de fala gerada. A partir de 1º de janeiro de 2027, ambas as taxas dobram. Para o panorama mais amplo, veja meu guia de preços do Google Gemini 3.
Existe um nível gratuito para o Gemini 3.8 Flash TTS?
Sim. Entrada e saída são gratuitas nos níveis padrão e priority pelo Google AI Studio, embora os níveis batch e flex sejam apenas pagos. O nível gratuito é bom para testar vozes, mas o Google usa o conteúdo do nível gratuito para melhorar seus produtos, então leia os termos antes de colocar algo sensível ali. Os recursos de voz para consumidores no app Gemini exigem uma assinatura do Google AI.
Como os preços do Gemini 3.8 Flash TTS se comparam ao ElevenLabs?
Normalizado pela duração do áudio, o Gemini 3.8 Flash TTS fica em torno de US$ 0,81 por hora de fala, enquanto a ElevenLabs anuncia TTS de baixa latência a partir de cerca de 5 centavos por minuto (aproximadamente US$ 3 por hora) no plano Business. O Gemini é bem mais barato por hora, mas a ElevenLabs ainda lidera em variedade de vozes e maturidade de clonagem de voz. A pegadinha de qualquer modelo bruto é que preço por hora não é o mesmo que preço por conversa de atendimento ao cliente resolvida.
Por que o preço do Gemini 3.8 Flash TTS dobra em janeiro de 2027?
As taxas de US$ 0,50 e US$ 9,00 são promocionais, o mesmo padrão que o Google usou em modelos Gemini anteriores. Em 1º de janeiro de 2027, a entrada padrão sobe para US$ 1,00 por milhão e a saída de áudio para US$ 18,00 por milhão, e os multiplicadores de batch, flex e priority dobram junto. Se você está planejando um orçamento para 2027, dobre os números de hoje. Para a versão disso no modelo de texto, veja minha análise de preços do Gemini 3.8 Flash.
O Gemini 3.8 Flash TTS é bom o suficiente para voz de atendimento ao cliente?
Ele é barato e expressivo, mas um modelo de voz só cuida da fala. A voz de suporte também precisa de recuperação de informação, ferramentas e testes antes de tocar em um chamador ao vivo, e é aí que a maioria dos projetos realmente quebra. Esse é o trabalho de um agente de helpdesk de IA, não de um endpoint de TTS. Se você quer especificamente a camada de voz, combine-a com algo como Zendesk voice AI ou uma stack feita sob medida.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração de ondas sonoras e etiquetas de preço representando os preços do Gemini 3.8 Flash TTS
Trending

Preços do Gemini 3.8 Flash TTS: o que uma hora de voz com IA realmente custa

O Gemini 3.8 Flash TTS custa US$ 9 por 1M de tokens de áudio, cerca de US$ 0,81 por hora de fala. Veja todos os níveis, a pegadinha de 2027 e a comparação com ElevenLabs e OpenAI.

Rama Adi NugrahaRama Adi NugrahaSep 24, 2026
Ilustração de ondas sonoras, um painel de controle de design de voz e um botão de reprodução representando o Gemini 3.8 Flash TTS
Trending

Análise do Gemini 3.8 Flash TTS: o novo modelo de voz do Google vale a pena?

Uma análise prática do Gemini 3.8 Flash TTS: como ele realmente soa, o que dá para controlar, onde vence o ElevenLabs em preço, e o único benchmark em que o Google não liderou.

Alicia Kirana UtomoAlicia Kirana UtomoSep 24, 2026
Ilustração de uma equipe analisando o Gemini 3.8 Flash, com um medidor de velocidade, um foguete e uma marca de verificação como veredito
Trending

Análise do Gemini 3.8 Flash: rápido, prolixo e não é o upgrade que o número sugere

Uma análise prática do Gemini 3.8 Flash: onde ele se destaca, onde falha, a pegadinha dos 13 segundos que ninguém mencionou, e se vale a pena migrar do 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Ilustração de duas pessoas analisando gráficos e mostradores de velocidade em torno de uma centelha do Gemini, representando os preços do Gemini 3.8 Flash
Trending

Preços do Gemini 3.8 Flash: cada tarifa, o custo oculto e a pegadinha

O Gemini 3.8 Flash custa US$ 0,75/US$ 3,75 por 1 milhão de tokens, exatamente o mesmo que o 3.7 Flash. Mas o preço de tabela esconde uma taxa de verbosidade, e os dois valores dobram em 1º de janeiro de 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Ilustração de um robô veloz programando em um laptop enquanto uma pessoa observa, representando o Gemini 3.8 Flash
Trending

Gemini 3.8 Flash: o que é, benchmarks honestos e minha análise

O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas depois do 3.7. Mesmo preço, notas melhores e uma linha nas letras pequenas que muda a resposta.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Ilustração principal do preço do GPT-Live, a IA de voz full-duplex em tempo real da OpenAI nos planos do ChatGPT
Trending

Preço do GPT-Live: o que a IA de voz da OpenAI realmente custa

O GPT-Live não tem preço próprio. Veja quanto você realmente paga pela IA de voz full-duplex da OpenAI nos planos Free, Go, Plus e Pro do ChatGPT, e por que ainda não existe preço de API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 13, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Banner ilustrado para um guia sobre os preços e custos de API do Google Gemini 3.5 Pro
Trending

Preços do Gemini 3.5 Pro: quanto custa (e o que ainda falta)

Uma resposta direta sobre os preços do Gemini 3.5 Pro: ele ainda não está disponível. Veja quanto custa o nível Pro atual, os planos para consumidores e a conta real da API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustração de preços por token e pilhas de custo para o modelo Claude Mythos 5.1
Trending

Preços do Claude Mythos 5.1: cada tarifa, o corte na leitura de cache e quem realmente pode usá-lo

Um detalhamento completo dos preços do Claude Mythos 5.1: tarifas base, batch, escritas de cache e a leitura de cache de US$ 0,25 que é a verdadeira novidade, além de por que o Mythos custa o mesmo que o Fable 5.1.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis