
Resumo rápido
O Gemini 3.8 Flash TTS custa US$ 0,50 por milhão de tokens de entrada de texto e US$ 9,00 por milhão de tokens de saída de áudio no nível pago padrão, até 31 de dezembro de 2026. O áudio é cobrado a 25 tokens por segundo, então uma hora inteira de fala gerada sai por cerca de US$ 0,81. Também há um nível realmente gratuito no Google AI Studio.
Duas coisas para guardar. Primeiro, ambas as taxas dobram em 1º de janeiro de 2027, então qualquer orçamento construído com os números de hoje precisa ser dobrado para o ano que vem. Segundo, a cerca de US$ 0,81 por hora, este é um dos modelos de voz expressiva mais baratos que existem, bem abaixo da ElevenLabs e dos níveis generativos premium da Amazon e da Deepgram.
A pegadinha é a que se aplica a qualquer modelo bruto: áudio barato não é o mesmo que um produto funcional. Um endpoint de TTS fala; ele não conhece sua base de conhecimento, não chama suas ferramentas nem é testado antes contra conversas reais. Se você está colocando um modelo de voz de frente para o atendimento ao cliente, essa lacuna é tudo, e é exatamente o que um agente de helpdesk de IA existe para fechar.
O que o Gemini 3.8 Flash TTS realmente é
O Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) é o atual modelo de texto para voz do Google, e ao contrário de muitos modelos de áudio por aí, ele é estável, não uma prévia. O id não carrega sufixo -preview, e o Google o lista como o substituto recomendado do antigo gemini-3.1-flash-tts-preview. Ele recebe texto e produz áudio, nada mais, exatamente o que se espera de um modelo de voz dedicado.
A ficha técnica é generosa. Você tem 30 vozes de estúdio pré-construídas (Zephyr, Puck, Kore, Fenrir e companhia), cada uma com um descritor como Bright ou Firm, além de uma Extended Voice Library com centenas de outras que podem ser obtidas com client.voices.list(). Ele fala 130 idiomas com detecção automática de entrada, e você pode direcionar estilo, sotaque, ritmo e tom com prompts em linguagem natural, ou inserir tags inline como <laugh> e <sigh> para eventos vocais pontuais. Ele também traz design de voz (construir uma persona a partir de uma descrição em texto) e clonagem de voz a partir de um clipe de referência.
O detalhe técnico que pega no dia a dia: multi-locutor é limitado a dois locutores por requisição. Um podcast de três pessoas ou uma cena em grupo significa sintetizar cada fala separadamente e costurar o áudio você mesmo. A saída padrão é WAV mono a 24 kHz, com mulaw e alaw disponíveis para telefonia. Isso convive com o modelo somente texto Gemini 3.8 Flash, e os dois são cobrados de forma completamente diferente, que é de onde vem a maior parte da confusão.
Preços do Gemini 3.8 Flash TTS: a tabela completa
Aqui está cada nível, em USD por milhão de tokens, nas taxas promocionais de 2026. A taxa de 2027 está entre parênteses porque, como veremos, tudo dobra.
| Nível | Entrada de texto / 1M | Saída de áudio / 1M | Notas |
|---|---|---|---|
| Standard | US$ 0,50 (US$ 1,00) | US$ 9,00 (US$ 18,00) | A taxa padrão |
| Batch | US$ 0,25 (US$ 0,50) | US$ 4,50 (US$ 9,00) | ~50% de desconto, tarefas assíncronas |
| Flex | US$ 0,25 (US$ 0,50) | US$ 4,50 (US$ 9,00) | Mesma taxa, cache mais barato |
| Priority | US$ 0,90 (US$ 1,80) | US$ 16,20 (US$ 32,40) | ~1,8x, sensível à latência |
| Free | Grátis | Grátis | Standard/priority via AI Studio |
Tudo isso vem diretamente da página de preços da API Gemini do Google. Cache de contexto é suportado e começa em US$ 0,125 por milhão de tokens de cache de entrada no nível padrão, mais uma taxa de armazenamento de US$ 0,50 por milhão por hora. O número de saída de áudio é o que importa, porque é o que escala com o quanto de fala você gera. A entrada de texto é quase um arredondamento em comparação.
O que é curiosamente interessante é onde os US$ 9,00 ficam na própria linha do Google. É mais barato que o Gemini 2.5 Flash TTS que ele substitui (US$ 10 de saída de áudio), e menos da metade do preço dos modelos preview 2.5 Pro e 3.1 Flash TTS (US$ 20 de saída de áudio). Há também um irmão mais barato, o Flash-Lite TTS, a US$ 6 de saída de áudio se você puder viver com 101 idiomas em vez de 130.

O que isso custa na prática
O preço por token é difícil de sentir, então vamos transformar em dinheiro de verdade. O áudio é cobrado a 25 tokens por segundo, o que dá 1.500 tokens por minuto e 90.000 tokens por hora. Na taxa padrão de 2026 de US$ 9,00 por milhão, uma hora de fala gerada custa cerca de US$ 0,81. Somando o texto inserido (uma hora inteira de narração são apenas cerca de 12.000 tokens de entrada), o acréscimo é bem menos de um centavo.

Alguns exemplos práticos na taxa padrão:
- Um episódio de podcast de 30 minutos: cerca de US$ 0,41 em áudio.
- Um audiobook de 8 horas: aproximadamente US$ 6,48.
- 10.000 mensagens de URA de suporte de 15 segundos cada: 3,75 milhões de tokens de áudio, então cerca de US$ 33,75.
Rode qualquer um desses como um job batch noturno e você reduz pela metade, o que deixa o audiobook mais perto de US$ 3,24. Para geração de alto volume e não interativa, batch é a jogada óbvia. O único lugar onde o preço de etiqueta não conta a história toda é qualquer coisa que um humano espera em tempo real, onde você paga a taxa priority e arca com uma latência que não consegue controlar totalmente.
A pegadinha: os preços dobram em 1º de janeiro de 2027
Esta é a parte para anotar num post-it. Os valores de US$ 0,50 e US$ 9,00 são taxas promocionais de lançamento. Em 1º de janeiro de 2027, a entrada de texto padrão sobe para US$ 1,00 por milhão e a saída de áudio para US$ 18,00 por milhão. Todos os outros níveis dobram junto: saída de áudio de batch e flex para US$ 9,00, saída de áudio de priority para US$ 32,40.

Então aquela hora de áudio de US$ 0,81 vira cerca de US$ 1,62 em 2027, e o audiobook de 8 horas passa de US$ 6,48 para US$ 12,96. É o mesmo movimento que o Google fez com os modelos de texto, e é justo desde que você o veja chegando. Se você está orçando algo além deste ano, dobre os números deste post e planeje a partir daí. Isso também empurra para travar agora qualquer economia de cache e batch que der.
Como ele se compara com ElevenLabs, OpenAI e o resto
Comparar modelos de voz é genuinamente complicado, porque os fornecedores não cobram do mesmo jeito. Amazon, Azure e Deepgram cobram por caractere de texto de entrada. OpenAI e Google cobram por token de saída de áudio, que escala com a duração da fala gerada, não com o roteiro. A ElevenLabs vende créditos de assinatura. Para colocar todos no mesmo eixo, converti tudo em um custo estimado por hora de fala, usando a própria âncora da Amazon de que 1 milhão de caracteres são aproximadamente 23 horas de áudio. Trate os valores por hora como estimativas, não como termos de contrato, porque eles mudam com o ritmo de fala.
| Fornecedor | Modelo principal | Preço nativo | ~ US$/hora de áudio | Nível gratuito |
|---|---|---|---|---|
| Gemini 3.8 Flash TTS | gemini-3.8-flash-tts | US$ 9 / 1M tokens de áudio | ~US$ 0,81 | Grátis no AI Studio |
| Amazon Polly (Neural) | Neural | US$ 16 / 1M caracteres | ~US$ 0,70 | 1M caracteres/mês (12 meses) |
| Azure AI Speech | Neural / HD Flash | US$ 15 / 1M caracteres | ~US$ 0,65 | 0,5M caracteres/mês |
| OpenAI | gpt-4o-mini-tts | US$ 12 / 1M tokens de áudio | ~US$ 0,90 | Nenhum |
| Amazon Polly (Generative) | Generative | US$ 30 / 1M caracteres | ~US$ 1,30 | 100 mil caracteres/mês |
| Deepgram | Aura-2 | US$ 30 / 1M caracteres | ~US$ 1,30 | US$ 200 de crédito |
| ElevenLabs | Eleven v3 / Flash | ~5c/min (Business) | ~US$ 3,00 | 10 mil créditos/mês |
O detalhe que mais me surpreendeu: o Gemini 3.8 Flash TTS tem preço de voz neural padrão sendo, na verdade, um dos modelos generativos mais expressivos. As linhas mais baratas da Amazon e da Azure são suas vozes neurais mais antigas; o nível de qualidade generativa delas (Polly Generative) fica em US$ 1,30 por hora, e o principal da Deepgram cai no mesmo patamar. A ElevenLabs, que continua sendo a referência em qualidade de voz, custa cerca de quatro vezes mais por hora. Se custo por hora é o seu fator decisivo e você quer saída expressiva, o Gemini é difícil de bater agora, ao menos até o reajuste de 2027 levá-lo a cerca de US$ 1,62.
Para o lado da OpenAI dessa comparação, meus artigos sobre a API Realtime da OpenAI e os preços do gpt-realtime-mini aprofundam onde a voz cobrada por token faz sentido.
A voz é boa mesmo?
O preço só importa se o resultado for utilizável, e é aqui que as primeiras reações ficam mais divididas. O lançamento gerou certa reclamação sobre a qualidade. Um desenvolvedor no Hacker News colocou de forma direta:
"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."
Isso é a opinião de uma pessoa só, e preferência de voz é subjetiva, mas bate com um padrão: o TTS do Google é barato e amplo, enquanto a ElevenLabs ainda vence o teste de "essa voz específica soa marcante" para muita gente. Alguns usuários continuam com o que já conhecem por enquanto:
"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."
Então a leitura honesta é esta. Se você precisa de narração barata, multilíngue e boa o suficiente em escala, o Gemini 3.8 Flash TTS tem um ótimo custo-benefício. Se uma voz única, marcante e que define a marca é o produto, teste com cuidado contra a ElevenLabs, e não presuma que a diferença de preço significa uma diferença de qualidade a seu favor.
Onde um modelo de voz barato se encaixa, e onde não
Aqui vai a reformulação com a qual eu gostaria que um comprador saísse. Um modelo de TTS é infraestrutura. É uma forma fantástica e barata de dar voz a um app: um pipeline de audiobook, um narrador dentro do produto, uma camada de acessibilidade, mensagens de URA. Para isso, US$ 0,81 por hora é um ótimo negócio de verdade.
Mas no momento em que o caso de uso é atendimento ao cliente, o modelo é os 10% fáceis do problema. A parte difícil é tudo ao redor: extrair a resposta certa da sua base de conhecimento, chamar as ferramentas que realmente resolvem um chamado, e ser testado contra seu histórico real antes de falar com um cliente. Essa é a diferença entre infraestrutura e um funcionário. O Gemini TTS é a primeira coisa. Ele não vai conhecer sua política de reembolso nem fazer triagem de chamado, e montar tudo isso sozinho é um projeto, não uma chamada de API.
Esse é o quadro em que trabalhamos todos os dias. Passamos anos colocando IA em filas de suporte reais, e o que separa uma demo de um lançamento de verdade nunca é o modelo, é sempre o encanamento e os testes. É por isso que um agente de helpdesk de IA é uma compra bem diferente de um endpoint de voz, mesmo quando os dois dizem "IA" na embalagem. Se você está pesando de forma mais geral a conta humano versus automação, nossa análise de custo de agente de IA vs. agente humano é um ponto de partida melhor do que uma taxa por token.
Experimente o eesel
O eesel é uma plataforma de colegas de equipe de IA, e a escalação atual inclui um agente de helpdesk de IA pronto para trabalhar que entra na sua fila de suporte já existente. Enquanto o Gemini TTS é um modelo em torno do qual você precisa construir, o eesel chega já sabendo se conectar ao seu helpdesk, aprender com seus chamados passados e ser simulado contra conversas históricas reais para que você saiba a taxa de resolução dele antes de entrar no ar.

Se você prefere trabalhar em um terminal, a CLI do eesel opera o mesmo colega de equipe e workspace de forma programática. Você pode operá-la manualmente, integrá-la a scripts ou deixar que um agente de codificação como Claude Code ou Cursor a rode sem interface, de modo que a IA que você compra esteja disponível tanto no painel quanto pela API, do mesmo jeito que você recorreria a um modelo como o Gemini TTS. Você pode testar o eesel de graça e simulá-lo primeiro contra seus próprios chamados.
Perguntas frequentes
Quanto custa o Gemini 3.8 Flash TTS?
Existe um nível gratuito para o Gemini 3.8 Flash TTS?
Como os preços do Gemini 3.8 Flash TTS se comparam ao ElevenLabs?
Por que o preço do Gemini 3.8 Flash TTS dobra em janeiro de 2027?
O Gemini 3.8 Flash TTS é bom o suficiente para voz de atendimento ao cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








