Preços do Gemini 3.8 Flash TTS: o que uma hora de voz com IA realmente custa

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição September 23, 2026

Verificado por especialista
Ilustração de ondas sonoras e etiquetas de preço representando os preços do Gemini 3.8 Flash TTS

O que o Gemini 3.8 Flash TTS realmente é

O Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) é o atual modelo de texto para voz do Google e, ao contrário de muitos modelos de áudio por aí, é estável em vez de preview. O id não carrega o sufixo -preview, e o Google o lista como o substituto recomendado para o antigo gemini-3.1-flash-tts-preview. Ele recebe texto e produz áudio, nada mais, exatamente o que se espera de um modelo de voz dedicado.

A ficha técnica é generosa. Você tem 30 vozes de estúdio pré-construídas (Zephyr, Puck, Kore, Fenrir e companhia), cada uma com um descritor como Bright ou Firm, além de uma Extended Voice Library com centenas de outras que você pode obter com client.voices.list(). Ele fala 130 idiomas com detecção automática de entrada, e você pode direcionar estilo, sotaque, ritmo e tom com prompts em linguagem natural, ou inserir tags como <laugh> e <sigh> para eventos vocais pontuais. Também vem com design de voz (criar uma persona a partir de uma descrição em texto) e clonagem de voz a partir de um clipe de referência.

O ponto da especificação que mais incomoda em produção: multi-speaker é limitado a dois falantes por requisição. Um podcast de três pessoas ou uma cena em grupo significa sintetizar cada fala separadamente e costurar o áudio você mesmo. A saída padrão é WAV mono em 24 kHz, com mulaw e alaw disponíveis para telefonia. Isso convive com o modelo somente texto Gemini 3.8 Flash, e os dois são cobrados de formas completamente diferentes, que é onde começa a maior parte da confusão.

Preços do Gemini 3.8 Flash TTS: a tabela completa

Aqui estão todos os níveis, em USD por 1M de tokens, nas taxas promocionais de 2026. A taxa de 2027 está entre parênteses porque, como veremos, tudo dobra.

NívelEntrada de texto / 1MSaída de áudio / 1MObservações
StandardUS$ 0,50 (US$ 1,00)US$ 9,00 (US$ 18,00)A taxa padrão
BatchUS$ 0,25 (US$ 0,50)US$ 4,50 (US$ 9,00)~50% de desconto, jobs assíncronos
FlexUS$ 0,25 (US$ 0,50)US$ 4,50 (US$ 9,00)Mesma taxa, cache mais barato
PriorityUS$ 0,90 (US$ 1,80)US$ 16,20 (US$ 32,40)~1,8x, sensível à latência
FreeGrátisGrátisStandard/priority via AI Studio

Tudo isso vem direto da página de preços da API do Gemini do Google. O cache de contexto é suportado e começa em US$ 0,125 por 1M de tokens de cache de entrada no nível standard, mais uma taxa de armazenamento de US$ 0,50 por 1M por hora. O número de saída de áudio é o que importa, porque é ele que escala com a quantidade de fala que você gera. A entrada de texto é quase um erro de arredondamento em comparação.

O que é sutilmente interessante é onde os US$ 9,00 ficam na própria linha de produtos do Google. É mais barato que o Gemini 2.5 Flash TTS que ele sucede (US$ 10 de saída de áudio), e menos da metade do preço dos modelos preview 2.5 Pro e 3.1 Flash TTS (US$ 20 de saída de áudio). Também existe um irmão mais barato, o Flash-Lite TTS, a US$ 6 de saída de áudio, se você puder viver com 101 idiomas em vez de 130.

Gráfico de barras comparando o custo de saída de áudio por 1M de tokens entre modelos de texto para voz do Gemini, com o 3.8 Flash TTS em US$ 9 destacado
Gráfico de barras comparando o custo de saída de áudio por 1M de tokens entre modelos de texto para voz do Gemini, com o 3.8 Flash TTS em US$ 9 destacado

O que isso realmente custa

O preço por token é difícil de sentir, então vamos transformá-lo em dinheiro de verdade. O áudio é cobrado a 25 tokens por segundo, o que dá 1.500 tokens por minuto e 90.000 tokens por hora. Na taxa padrão de 2026 de US$ 9,00 por 1M, uma hora de fala gerada custa cerca de US$ 0,81. Some o texto que você inseriu (uma hora inteira de narração são apenas cerca de 12.000 tokens de entrada) e o acréscimo fica bem abaixo de um centavo.

Pipeline mostrando como 25 tokens de áudio por segundo se tornam 1.500 por minuto, US$ 0,0135 por minuto e cerca de US$ 0,81 por hora na taxa padrão de 2026
Pipeline mostrando como 25 tokens de áudio por segundo se tornam 1.500 por minuto, US$ 0,0135 por minuto e cerca de US$ 0,81 por hora na taxa padrão de 2026

Alguns exemplos calculados na taxa padrão:

  • Um episódio de podcast de 30 minutos: cerca de US$ 0,41 em áudio.
  • Um audiobook de 8 horas: cerca de US$ 6,48.
  • 10.000 mensagens de URA de suporte de 15 segundos cada: 3,75M de tokens de áudio, cerca de US$ 33,75.

Rode qualquer um desses como um job em batch noturno e você reduz pela metade, o que deixa o audiobook mais perto de US$ 3,24. Para geração de alto volume e não interativa, batch é a jogada óbvia. O único lugar onde o preço da etiqueta não conta toda a história é qualquer coisa que um humano espere em tempo real, onde você paga a taxa priority e arca com uma latência que não consegue controlar totalmente.

A pegadinha: os preços dobram em 1º de janeiro de 2027

Esta é a parte para anotar num post-it. Os valores de US$ 0,50 e US$ 9,00 são taxas promocionais introdutórias. Em 1º de janeiro de 2027, a entrada de texto padrão sobe para US$ 1,00 por 1M e a saída de áudio para US$ 18,00 por 1M. Todos os outros níveis dobram no mesmo ritmo: saída de áudio batch e flex para US$ 9,00, saída de áudio priority para US$ 32,40.

Comparação antes e depois mostrando as taxas padrão do Gemini 3.8 Flash TTS dobrando de US$ 9 para US$ 18 de saída de áudio e de US$ 0,50 para US$ 1,00 de entrada de texto em 1º de janeiro de 2027
Comparação antes e depois mostrando as taxas padrão do Gemini 3.8 Flash TTS dobrando de US$ 9 para US$ 18 de saída de áudio e de US$ 0,50 para US$ 1,00 de entrada de texto em 1º de janeiro de 2027

Então aquela hora de áudio de US$ 0,81 vira cerca de US$ 1,62 em 2027, e o audiobook de 8 horas sobe de US$ 6,48 para US$ 12,96. É o mesmo movimento que o Google fez com os modelos de texto, e é justo desde que você o veja chegando. Se você está orçando algo além deste ano, dobre os números deste post e planeje a partir daí. Isso também empurra você a garantir agora toda a economia de cache e batch que puder.

Como ele se compara ao ElevenLabs, OpenAI e o resto

Comparar modelos de voz é realmente complicado, porque os fornecedores não cobram da mesma forma. Amazon, Azure e Deepgram cobram por caractere de texto de entrada. OpenAI e Google cobram por token de saída de áudio, que escala com a duração da fala gerada, não com o roteiro. O ElevenLabs vende créditos de assinatura. Para colocar todos em um mesmo eixo, converti tudo em um custo estimado por hora de fala, usando a própria referência da Amazon de que 1M de caracteres equivale a cerca de 23 horas de áudio. Trate os números por hora como estimativas, não como termos contratuais, porque eles variam conforme o ritmo da fala.

FornecedorModelo principalPreço nativo~ $/hora de áudioNível gratuito
Gemini 3.8 Flash TTSgemini-3.8-flash-ttsUS$ 9 / 1M tokens de áudio~US$ 0,81Grátis no AI Studio
Amazon Polly (Neural)NeuralUS$ 16 / 1M caracteres~US$ 0,701M caracteres/mês (12 meses)
Azure AI SpeechNeural / HD FlashUS$ 15 / 1M caracteres~US$ 0,650,5M caracteres/mês
OpenAIgpt-4o-mini-ttsUS$ 12 / 1M tokens de áudio~US$ 0,90Nenhum
Amazon Polly (Generative)GenerativeUS$ 30 / 1M caracteres~US$ 1,30100k caracteres/mês
DeepgramAura-2US$ 30 / 1M caracteres~US$ 1,30US$ 200 de crédito
ElevenLabsEleven v3 / Flash~5c/min (Business)~US$ 3,0010k créditos/mês

O que mais me surpreendeu: o Gemini 3.8 Flash TTS tem o preço de uma voz neural genérica, mesmo sendo um dos modelos generativos mais expressivos. As linhas mais baratas da Amazon e da Azure são suas vozes neurais mais antigas; o nível de qualidade generativa delas (Polly Generative) fica em US$ 1,30 por hora, e o modelo principal da Deepgram cai no mesmo patamar. O ElevenLabs, ainda a referência em qualidade de voz, custa cerca de quatro vezes mais por hora. Se o custo por hora é o seu fator decisivo e você ainda quer output expressivo, o Gemini é difícil de superar agora, pelo menos até o reajuste de 2027 elevá-lo para cerca de US$ 1,62.

Para o lado da OpenAI nessa comparação, meus textos sobre a API realtime da OpenAI e os preços do gpt-realtime-mini aprofundam onde a voz cobrada por token faz sentido.

A voz é boa de verdade?

O preço só importa se o resultado for utilizável, e é aqui que as primeiras reações ficam mais divididas. O lançamento gerou certa insatisfação quanto à qualidade. Um desenvolvedor no Hacker News foi direto ao ponto:

Hacker News

"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."

Essa é a opinião de uma única pessoa, e preferência de voz é subjetiva, mas ela combina com um padrão: o TTS do Google é barato e amplo, enquanto o ElevenLabs ainda vence o teste "essa voz específica soa marcante" para muita gente. Alguns usuários estão ficando com o que já conhecem por enquanto:

Hacker News

"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."

Então a leitura honesta é esta. Se você precisa de narração barata, multilíngue e boa o suficiente em escala, o Gemini 3.8 Flash TTS tem um custo-benefício excelente. Se uma voz única, distintiva e que define a marca é o produto, teste-a com cuidado contra o ElevenLabs antes de se comprometer, e não presuma que a diferença de preço significa uma diferença de qualidade a seu favor.

Onde um modelo de voz barato se encaixa, e onde não

Aqui está o reenquadramento que eu gostaria que um comprador levasse consigo. Um modelo de TTS é infraestrutura. É uma forma fantástica e barata de dar voz a um app: um pipeline de audiobook, um narrador dentro do produto, uma camada de acessibilidade, prompts de URA. Para isso, US$ 0,81 por hora é um ótimo negócio de verdade.

Mas no momento em que o caso de uso é atendimento ao cliente, o modelo é os 10% fáceis do problema. A parte difícil é tudo ao redor: extrair a resposta certa da sua base de conhecimento, chamar as ferramentas que de fato resolvem um ticket, e ser testado contra seu histórico real antes de falar com um cliente pela primeira vez. Essa é a diferença entre infraestrutura e um funcionário. O Gemini TTS é a primeira. Ele não vai conhecer sua política de reembolso nem triar um ticket, e montar tudo isso sozinho é um projeto, não uma chamada de API.

Este é o quadro em que trabalhamos todos os dias. Passamos anos colocando IA em filas de suporte ao vivo, e o que separa uma demo de um lançamento real nunca é o modelo, é sempre a canalização e os testes. É por isso que um agente de helpdesk com IA é uma compra muito diferente de um endpoint de voz, mesmo quando ambos dizem "IA" na embalagem. Se você está pesando de forma geral a conta entre humano e automação, nossa análise de custo de agente de IA vs. agente humano é um ponto de partida melhor do que uma taxa por token.

Experimente o eesel

O eesel é uma plataforma de colegas de equipe de IA, e o time atual inclui um agente de helpdesk com IA pronto para trabalhar que entra na sua fila de suporte existente. Enquanto o Gemini TTS é um modelo em torno do qual você precisa construir, o eesel chega já sabendo se conectar ao seu helpdesk, aprender com seus tickets passados e ser simulado contra conversas históricas reais para que você saiba sua taxa de resolução antes de entrar no ar.

Tela de onboarding do eesel AI mostrando um colega de equipe de IA conectado a um helpdesk e pronto para redigir respostas
Tela de onboarding do eesel AI mostrando um colega de equipe de IA conectado a um helpdesk e pronto para redigir respostas

Se você gosta de trabalhar no terminal, a CLI do eesel controla o mesmo colega de equipe e workspace de forma programática. Você pode operá-la manualmente, integrá-la a scripts ou deixar um agente de código como Claude Code ou Cursor rodá-la sem interface, de modo que a IA que você compra fica disponível tanto no painel quanto pela API, da mesma forma que você acessaria um modelo como o Gemini TTS. Você pode testar o eesel de graça e simulá-lo primeiro com seus próprios tickets.

Perguntas frequentes

Quanto custa o Gemini 3.8 Flash TTS?
Os preços do Gemini 3.8 Flash TTS são US$ 0,50 por 1M de tokens de entrada de texto e US$ 9,00 por 1M de tokens de saída de áudio no nível padrão pago, até 31 de dezembro de 2026. Como o áudio é cobrado a 25 tokens por segundo, isso equivale a cerca de US$ 0,81 por uma hora inteira de fala gerada. A partir de 1º de janeiro de 2027, ambas as taxas dobram. Para um panorama mais amplo, veja meu guia de preços do Google Gemini 3.
Existe um nível gratuito para o Gemini 3.8 Flash TTS?
Sim. A entrada e a saída são gratuitas nos níveis standard e priority pelo Google AI Studio, embora os níveis batch e flex sejam apenas pagos. O nível gratuito é bom para testar vozes, mas o Google usa o conteúdo do nível gratuito para melhorar seus produtos, então leia os termos antes de colocar algo sensível ali. Os recursos de voz para consumidores no app Gemini exigem uma assinatura do Google AI.
Como os preços do Gemini 3.8 Flash TTS se comparam ao ElevenLabs?
Normalizado pela duração do áudio, o Gemini 3.8 Flash TTS fica em torno de US$ 0,81 por hora de fala, enquanto o ElevenLabs anuncia TTS de baixa latência a partir de cerca de 5 centavos por minuto (aproximadamente US$ 3 por hora) no plano Business. O Gemini é bem mais barato por hora, mas o ElevenLabs ainda lidera em variedade de vozes e maturidade de clonagem. A pegadinha de qualquer modelo puro é que o preço por hora não é o mesmo que o preço por conversa de atendimento ao cliente resolvida.
Por que o preço do Gemini 3.8 Flash TTS dobra em janeiro de 2027?
As taxas de US$ 0,50 e US$ 9,00 são promocionais, o mesmo padrão que o Google usou em modelos Gemini anteriores. Em 1º de janeiro de 2027, a entrada padrão sobe para US$ 1,00 por 1M e a saída de áudio para US$ 18,00 por 1M, e os multiplicadores de batch, flex e priority dobram junto. Se você está dimensionando um orçamento para 2027, dobre os números de hoje. Para a versão desse mesmo salto no modelo de texto, veja minha análise dos preços do Gemini 3.8 Flash.
O Gemini 3.8 Flash TTS é bom o suficiente para voz de atendimento ao cliente?
É barato e expressivo, mas um modelo de voz só cuida da fala. Voz de suporte também precisa de recuperação de informações, ferramentas e testes antes de atender uma ligação real, e é aí que a maioria dos projetos realmente falha. Essa é a tarefa de um agente de helpdesk com IA, não de um endpoint de TTS. Se você quer especificamente a camada de voz, combine-a com algo como Zendesk voice AI ou uma stack feita sob medida.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração de ondas sonoras e etiquetas de preço representando os preços do Gemini 3.8 Flash TTS
Trending

Preços do Gemini 3.8 Flash TTS: o que uma hora de voz de IA realmente custa

O Gemini 3.8 Flash TTS custa US$ 9 por 1 milhão de tokens de áudio, cerca de US$ 0,81 por hora de fala. Aqui estão todos os níveis, a pegadinha de 2027 e a comparação com ElevenLabs e OpenAI.

Rama Adi NugrahaRama Adi NugrahaSep 24, 2026
Ilustração de ondas sonoras, um painel de controle de design de voz e um botão de reprodução representando o Gemini 3.8 Flash TTS
Trending

Análise do Gemini 3.8 Flash TTS: o novo modelo de voz do Google vale a pena?

Uma análise prática do Gemini 3.8 Flash TTS: como ele realmente soa, o que dá para controlar, onde vence o ElevenLabs em preço, e o único benchmark em que o Google não liderou.

Alicia Kirana UtomoAlicia Kirana UtomoSep 24, 2026
Ilustração de uma equipe analisando o Gemini 3.8 Flash, com um medidor de velocidade, um foguete e uma marca de verificação como veredito
Trending

Análise do Gemini 3.8 Flash: rápido, prolixo e não é o upgrade que o número sugere

Uma análise prática do Gemini 3.8 Flash: onde ele se destaca, onde falha, a pegadinha dos 13 segundos que ninguém mencionou, e se vale a pena migrar do 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Ilustração de duas pessoas analisando gráficos e mostradores de velocidade em torno de uma centelha do Gemini, representando os preços do Gemini 3.8 Flash
Trending

Preços do Gemini 3.8 Flash: cada tarifa, o custo oculto e a pegadinha

O Gemini 3.8 Flash custa US$ 0,75/US$ 3,75 por 1 milhão de tokens, exatamente o mesmo que o 3.7 Flash. Mas o preço de tabela esconde uma taxa de verbosidade, e os dois valores dobram em 1º de janeiro de 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Ilustração de um robô veloz programando em um laptop enquanto uma pessoa observa, representando o Gemini 3.8 Flash
Trending

Gemini 3.8 Flash: o que é, benchmarks honestos e minha análise

O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas depois do 3.7. Mesmo preço, notas melhores e uma linha nas letras pequenas que muda a resposta.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Ilustração principal do preço do GPT-Live, a IA de voz full-duplex em tempo real da OpenAI nos planos do ChatGPT
Trending

Preço do GPT-Live: o que a IA de voz da OpenAI realmente custa

O GPT-Live não tem preço próprio. Veja quanto você realmente paga pela IA de voz full-duplex da OpenAI nos planos Free, Go, Plus e Pro do ChatGPT, e por que ainda não existe preço de API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 13, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Banner ilustrado para um guia sobre os preços e custos de API do Google Gemini 3.5 Pro
Trending

Preços do Gemini 3.5 Pro: quanto custa (e o que ainda falta)

Uma resposta direta sobre os preços do Gemini 3.5 Pro: ele ainda não está disponível. Veja quanto custa o nível Pro atual, os planos para consumidores e a conta real da API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustração de preços por token e pilhas de custo para o modelo Claude Mythos 5.1
Trending

Preços do Claude Mythos 5.1: cada tarifa, o corte na leitura de cache e quem realmente pode usá-lo

Um detalhamento completo dos preços do Claude Mythos 5.1: tarifas base, batch, escritas de cache e a leitura de cache de US$ 0,25 que é a verdadeira novidade, além de por que o Mythos custa o mesmo que o Fable 5.1.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis