Preços do Gemini 3.8 Flash: cada tarifa, o custo oculto e a pegadinha

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição September 8, 2026

Verificado por especialista
Ilustração de duas pessoas analisando gráficos e mostradores de velocidade em torno de uma centelha do Gemini, representando os preços do Gemini 3.8 Flash

Preços do Gemini 3.8 Flash em resumo

Aqui estão todas as tarifas publicadas para gemini-3.8-flash na API do Gemini, nível padrão pago, por 1 milhão de tokens. Coloquei a coluna de 2027 logo ao lado da de hoje para que a promoção seja impossível de não notar.

MedidaAté 31 dez 2026A partir de 1º jan 2027
EntradaUS$ 0,75US$ 1,50
Saída (inclui raciocínio)US$ 3,75US$ 7,50
Cache de contexto, leituraUS$ 0,075US$ 0,15
Cache de contexto, armazenamento (por 1M/hora)US$ 0,50US$ 1,00
Batch e Flex, entradaUS$ 0,375US$ 0,75
Batch e Flex, saídaUS$ 1,875US$ 3,75
Prioridade, entradaUS$ 1,35US$ 2,70
Prioridade, saídaUS$ 6,75US$ 13,50

Algumas coisas fáceis de não notar ao ler a página do Google de cima a baixo:

  • O preço da saída inclui os tokens de raciocínio. Você paga a tarifa de US$ 3,75 pelo raciocínio do modelo, mesmo que a API só devolva um resumo dele. Em um modelo ajustado para raciocinar mais, essa é a linha que move sua fatura.
  • Batch e Flex custam exatamente a metade. Se seu trabalho não é interativo, um job em batch durante a noite reduz à metade cada token gasto.
  • O grounding é cobrado separadamente. O Google Search como ferramenta dá 5.000 solicitações gratuitas por mês, compartilhadas entre todos os modelos Gemini 3.x que você usa, depois US$ 14 por 1.000. O grounding do Google Maps usa a mesma cota.
  • Existe um nível gratuito de verdade. Entrada, saída e cache são gratuitos para uso padrão, o suficiente para prototipar antes de gastar qualquer coisa.

Teste os números na sua própria carga de trabalho

A tarifa de manchete só conta parte da história. O que importa é o seu volume mensal, sua proporção de entrada para saída e em qual nível você opera. Insira seus próprios números abaixo para ver o custo mensal de hoje comparado ao que a mesma carga de trabalho custaria após o aumento de janeiro de 2027.

O custo oculto: o 3.8 Flash é verboso de propósito

O número que muda a decisão de compra não está na página de preços. Está em quantos tokens o modelo gasta para fazer uma tarefa.

O Google expõe essa troca abertamente no post de lançamento: o 3.8 Flash "trabalha mais", executando etapas de raciocínio extras e chamando ferramentas iterativamente, e "às vezes, o modelo pode usar mais tokens para maximizar o desempenho". Isso é um recurso para a qualidade, e um custo para sua fatura, porque os tokens de raciocínio são cobrados à tarifa de saída de US$ 3,75.

A medição independente confirma isso. A Artificial Analysis precisou de 120 milhões de tokens de saída para executar todo o seu Intelligence Index no 3.8 Flash, contra uma mediana de 71 milhões para a classe. O veredito de uma palavra da própria AA foi "very verbose" (muito verboso).

Gráfico de barras comparando o Gemini 3.8 Flash, com 120 milhões de tokens de saída, contra uma mediana de 71 milhões, com a observação de que os tokens de raciocínio são cobrados como saída
Gráfico de barras comparando o Gemini 3.8 Flash, com 120 milhões de tokens de saída, contra uma mediana de 71 milhões, com a observação de que os tokens de raciocínio são cobrados como saída

No Hacker News, um comentarista apresentou um número mais contundente do que o marketing:

Hacker News

"On artificial analysis it's only equal to opus 5 medium effort. Opus 5 max scores 63. Further, opus 5 medium outputs 4x fewer tokens to achieve the same result, negating a lot of the speed difference."

Portanto, o custo real por unidade de trabalho é mais alto do que os US$ 3,75 por 1 milhão sugerem, porque o 3.8 Flash gasta mais unidades por tarefa. A Artificial Analysis situou o custo combinado em US$ 0,58 por tarefa em seu índice, o que o coloca na 59ª posição entre 195 modelos em eficiência de custo, longe do topo que a tarifa bruta por token sugeriria. Se você quiser acompanhar isso no seu próprio tráfego, é exatamente para isso que servem as ferramentas de rastreamento de LLM.

Mesmo preço do 3.7 Flash, então qual comprar?

Essa é a decisão real, e o Google a responde por você. Como o 3.8 e o 3.7 Flash custam exatamente o mesmo, o preço não pode ser o critério de decisão. A orientação do próprio Google é: para cargas de trabalho "em que a eficiência computacional é a principal restrição", os desenvolvedores devem "continuar confiando no Gemini 3.7 Flash, que permanece totalmente suportado para cargas de trabalho focadas em eficiência".

Em termos simples:

  • Codificação agêntica longa, qualidade acima do custo: 3.8 Flash. Ele supera o 3.7 em todos os benchmarks publicados pelo Google, e a troca é gratuita. Se você está pesquisando a categoria mais ampla, meu levantamento de assistentes de codificação com IA cobre o campo todo.
  • Alto volume, sensível à latência, custo em primeiro lugar: fique com o 3.7 Flash. Ele consome menos tokens pelo mesmo preço, e um funcionário do Google confirmou, na thread de lançamento, que o maior consumo de tokens do 3.8 é um comportamento intencional, não um bug.

Há também uma pegadinha de latência. O 3.8 Flash ocupa a 3ª posição entre 195 em velocidade bruta de saída, mas seu tempo até o primeiro token é de 13,30 segundos, contra uma mediana de 2,99 segundos. Para qualquer coisa que um humano espera, o modelo "rápido" é o que demora mais para começar a responder. Isso é throughput, não responsividade, e é fácil interpretar mal isso a partir da manchete de velocidade.

Como a tarifa se compara a outros modelos de ponta

Se você está comparando opções, aqui está onde o Gemini 3.8 Flash se posiciona em relação aos modelos com os quais realmente compete em preço, por 1 milhão de tokens, nível padrão, hoje.

ModeloEntradaSaídaObservação
Gemini 3.8 Flash$0.75$3.75Dobra em jan. 2027
Gemini 3.7 Flash$0.75$3.75Idêntico, menos tokens por tarefa
Claude Opus 5~$5.00~$25.004x menos tokens de saída por tarefa
Claude Sonnet 5menor que o Opusmenor que o OpusNível Claude mais barato

A abordagem honesta da mesma thread do HN: um desenvolvedor observou que o Gemini Flash, junto com alguns outros modelos baratos, entrega "90% do desempenho por uma pequena fração do custo" do nível de ponta. Esse é o verdadeiro apelo, e é justo. Só lembre que essa fração é medida na tarifa bruta, antes de você somar a taxa de verbosidade e o aumento de janeiro. Meu levantamento de alternativas ao Gemini cobre o resto do campo, e se você está pesando Google contra OpenAI, a comparação ChatGPT vs. Gemini é o ponto de partida, com a lista completa de modelos da OpenAI para o outro lado dessa comparação.

Onde você pode realmente usá-lo

  • Nível gratuito: entrada, saída e cache gratuitos pelo Google AI Studio. Suficiente para prototipar.
  • Padrão no Antigravity: o 3.8 Flash é o modelo padrão no Google Antigravity, com cotas generosas, algo que vários desenvolvedores no HN apontaram como a forma mais barata de submetê-lo a trabalho real.
  • Apps para consumidores: o app Gemini, o AI Mode na Busca e o Gemini no Sheets, mas somente com Google AI Pro ou Ultra. Se você está decidindo entre eles, veja os planos do Google AI.
  • Como ativar ou desativar: se você gerencia o acesso ao Gemini em um Workspace, aqui está como ativar e desativar o Gemini.

O que isso significa se você está precificando um bot de suporte

Passo a maior parte do meu tempo pensando em como os compradores buscam e precificam a IA para o helpdesk, então aqui está a parte que importa se o motivo pelo qual você está lendo uma página de preços de modelo é automatizar o atendimento ao cliente.

Uma tarifa de US$ 0,75 por token parece irresistível ao lado de um complemento de helpdesk cobrado por resolução. Mas três coisas quebram essa comparação. Um modelo de suporte responde a tickets curtos e de alto volume, em que o tempo até o primeiro token de 13,30 segundos é sentido em cada resposta. A verbosidade que faz o 3.8 Flash ser bom em tarefas longas de codificação é o formato errado para desviar tickets (ticket deflection), e ela é cobrada na tarifa de saída. E a tarifa por token é apenas uma pequena fração do custo real de operar a automação de suporte, que é dominado pelo trabalho de recuperação e testes em torno do modelo, não pela chamada ao modelo em si.

Passei os últimos três anos e meio observando agentes de IA operando em filas de suporte reais, e o padrão é consistente: um modelo que soa confiante pode, discretamente, dar respostas erradas, e nenhum preço por token resolve isso. É por isso que todo rollout da eesel é simulado com seus tickets reais anteriores antes de responder a qualquer cliente, para que você veja a taxa de resolução e o custo por ticket antecipadamente, em vez de descobrir os dois na fatura.

Se você está escolhendo um modelo para construir a automação de suporte por conta própria, precifique-o honestamente, já incluindo a taxa de verbosidade e a tarifa de 2027. Se você preferir não conectar um modelo manualmente ao seu helpdesk, a eesel oferece um parceiro de IA para helpdesk que se integra às suas ferramentas existentes, aprende com seus tickets anteriores e é gratuito para testar, sem necessidade de cálculos de tokens. É a diferença entre comprar um motor e contratar alguém que já sabe dirigir.

Perguntas frequentes

Quanto custa o Gemini 3.8 Flash?
O Gemini 3.8 Flash custa US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída, no nível padrão pago, até 31 de dezembro de 2026. Em 1º de janeiro de 2027, as duas tarifas dobram, para US$ 1,50 e US$ 7,50. A saída inclui os tokens de raciocínio, então um modelo que raciocina mais cobra mais de você. Também existe um nível gratuito. Para conhecer a gama mais ampla do Gemini, veja minha análise dos preços do Google Gemini 3.
Os preços do Gemini 3.8 Flash são iguais aos do 3.7 Flash?
Sim, ponto por ponto. As tarifas de entrada, saída, cache, batch, flex e prioridade são idênticas entre os dois modelos, e a própria ficha técnica do Google diz que o 3.8 Flash é construído sobre o 3.7 Flash em vez de um novo modelo base. Como o preço é o mesmo, a verdadeira decisão de compra é se o consumo extra de tokens do 3.8 vale a pena para a sua carga de trabalho. Para tarefas sensíveis à latência, como a classificação de tickets, o 3.7 Flash costuma ser a melhor opção.
Por que o preço do Gemini 3.8 Flash dobra em janeiro de 2027?
As tarifas de US$ 0,75 e US$ 3,75 são de lançamento, o mesmo preço promocional que o Google aplicou primeiro ao 3.7 Flash. A partir de 1º de janeiro de 2027, a entrada padrão sobe para US$ 1,50 por 1 milhão e a saída para US$ 7,50 por 1 milhão. Se você está calculando um orçamento para 2027 com os números de hoje, dobre-os. Os multiplicadores de batch, flex e prioridade permanecem os mesmos, então essas tarifas também dobram.
Quais são os preços de batch e prioridade do Gemini 3.8 Flash?
Os níveis batch e flex custam exatamente 50% menos que o padrão, então hoje são US$ 0,375 de entrada e US$ 1,875 de saída por 1 milhão. O nível prioridade é 1,8 vezes o padrão, a US$ 1,35 de entrada e US$ 6,75 de saída. As leituras de cache de contexto custam US$ 0,075 por 1 milhão mais US$ 0,50 por 1 milhão por hora de armazenamento. Todos esses valores dobram em 1º de janeiro de 2027 junto com a tarifa padrão.
O Gemini 3.8 Flash é mais barato que o Claude Opus 5?
No preço de tabela, sim, por uma margem ampla. O Gemini 3.8 Flash custa US$ 0,75/US$ 3,75 contra o Claude Opus 5, com cerca de US$ 5/US$ 25 por 1 milhão. Mas o Opus 5 medium atinge a mesma pontuação de inteligência de 59 usando cerca de 4 vezes menos tokens de saída por tarefa, o que reduz parte dessa diferença na prática. Minha comparação entre Gemini e Claude Opus aprofunda esse trade-off.
Existe um nível gratuito para o Gemini 3.8 Flash?
Sim. O nível gratuito da API do Gemini cobre entrada, saída e cache de contexto sem custo, acessível pelo Google AI Studio, e o 3.8 Flash é o modelo padrão no Google Antigravity. O acesso para consumidores no app Gemini, no AI Mode e no Google Sheets exige uma assinatura Google AI Pro ou Ultra, então confira primeiro os planos do Google AI.
Os preços do Gemini 3.8 Flash são bons para o atendimento ao cliente?
A tarifa por token é barata, mas o custo total de um modelo de suporte não é só a tarifa. O trabalho de suporte é curto, de alto volume e sensível à latência, e o 3.8 Flash é ajustado para pensar por mais tempo e consumir mais tokens de saída, com um tempo até o primeiro token de 13,30 segundos. Esse consumo de tokens aparece na fatura. O ponto mais importante é que o preço do modelo raramente é o que faz a IA para atendimento ao cliente funcionar — recuperação de informação e testes importam mais, que é exatamente o que um agente de IA para helpdesk cuida.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Ilustração de uma equipe analisando o Gemini 3.8 Flash, com um medidor de velocidade, um foguete e uma marca de verificação como veredito
Trending

Análise do Gemini 3.8 Flash: rápido, prolixo e não é o upgrade que o número sugere

Uma análise prática do Gemini 3.8 Flash: onde ele se destaca, onde falha, a pegadinha dos 13 segundos que ninguém mencionou, e se vale a pena migrar do 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Ilustração de um robô veloz programando em um laptop enquanto uma pessoa observa, representando o Gemini 3.8 Flash
Trending

Gemini 3.8 Flash: o que é, benchmarks honestos e minha análise

O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas depois do 3.7. Mesmo preço, notas melhores e uma linha nas letras pequenas que muda a resposta.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Duas pessoas fazendo queda de braço sobre uma mesa enquanto uma terceira observa, ilustrando um confronto direto entre modelos
Trending

DeepSeek V4 Flash vs GPT-5.6: em qual você deve apostar?

DeepSeek V4 Flash vs GPT-5.6 com os números de agosto de 2026. A verdadeira disputa é Flash contra Luna, a inteligência empata, e o que decide é velocidade, visão e dados.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração comparando os planos de modelo DeepSeek V4 Flash e V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro: qual plano usar?

O plano barato da DeepSeek agora pontua mais alto que o caro no ranking independente. Veja exatamente onde isso se confirma, e os dois pontos em que não.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat
Trending

Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Avaliei o LongCat 2.0 em sete pontos que realmente importam para um comprador, usando os próprios documentos da Meituan e os relatos de quem já passou bilhões de tokens por ele. Ele sai bem em seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat
Trending

LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

LongCat 2.0 é o modelo MoE de 1,6T parâmetros da Meituan, sob licença MIT, a 0,30 dólares por milhão de tokens de entrada. Li todas as fontes primárias para ver o que realmente é entregue.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis