Preços do Gemini 3.5 Flash-Lite: quanto custa e para quem é indicado

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição July 22, 2026

Verificado por especialista
Banner principal dos preços do Gemini 3.5 Flash-Lite em fundo azul Google

O que o Gemini 3.5 Flash-Lite realmente é

O Google divide sua família Gemini em duas faixas. Os modelos Pro são o nível superior para raciocínio difícil. Os modelos Flash são os cavalos de batalha: mais baratos, mais rápidos, ajustados para aplicações de produção que fazem milhares de chamadas por dia. O Flash-Lite é o mais enxuto entre eles, posicionado pelo Google para tarefas agênticas de alto volume, tradução e processamento simples de dados.

As especificações são surpreendentemente generosas para um modelo econômico. Ele processa texto, imagem, vídeo, áudio e PDF como entrada, tem uma janela de contexto de 1.048.576 tokens (~1M de tokens, ou cerca de 1.500 páginas), e suporta raciocínio, chamadas de função, saídas estruturadas, execução de código e grounding via busca. Ele não suporta uso de computador, geração de imagem ou áudio, nem a Live API, então é um motor de texto para texto voltado a volume, não um modelo que faz tudo.

Na Artificial Analysis, ele alcança um Intelligence Index de 36 (#12 entre 152 modelos, bem acima da média para sua classe), rodando a cerca de 490 tokens de saída por segundo, o segundo modelo mais rápido que já mediram. Para um modelo tão barato, essa combinação de inteligência por dólar é todo o argumento de venda.

Preços do Gemini 3.5 Flash-Lite

Aqui está o quadro completo. Os preços são por 1M de tokens nos níveis pagos, e a saída inclui os tokens de raciocínio.

ModoEntrada (por 1M)Saída (incl. raciocínio)Cache de contexto
Padrão$0,30$2,50$0,03
Batch (50% de desconto)$0,15$1,25$0,02
Flex$0,15$1,25$0,02
Priority$0,54$4,50$0,05
Nível gratuitoGrátisGrátisNão disponível

Alguns pontos a destacar antes de colocar isso numa planilha:

  • O nível gratuito treina com seus dados. No nível gratuito, o Google usa seu conteúdo para melhorar seus produtos; em qualquer nível pago, não. Para qualquer coisa que envolva dados de clientes, isso já descarta o nível gratuito por si só.
  • O modo batch é 50% de desconto fixo. Se o trabalho não precisa ser em tempo real (processamento de documentos durante a noite, tradução em massa), o Batch reduz o custo para $0,15 / $1,25.
  • O grounding via busca é cobrado separadamente. Você tem 5.000 prompts com grounding grátis por mês em toda a família Gemini 3, e depois disso são $14 a cada 1.000 buscas, e uma única requisição pode disparar várias buscas cobráveis.

Para entender como isso se compara aos planos de consumo do Gemini e ao restante da API, nosso guia de preços do Gemini traz o detalhamento completo, e os preços do Gemini Workspace cobrem os planos empresariais.

O que isso custa de verdade

Preços de tabela não dizem muita coisa até você calcular um número real. Digamos que você use o Flash-Lite para a triagem inicial de tickets em 50.000 tickets por mês, com cerca de 1.000 tokens de entrada e 200 de saída por ticket.

Um exemplo de custo real para o Gemini 3.5 Flash-Lite: 50.000 tickets por mês resultam em cerca de $40 em custo de tokens
Um exemplo de custo real para o Gemini 3.5 Flash-Lite: 50.000 tickets por mês resultam em cerca de $40 em custo de tokens

Isso dá 50M de tokens de entrada ($15) e 10M de tokens de saída ($25), então cerca de $40 por mês em custo bruto de modelo. Rode o mesmo volume no 3.6 Flash e você chega perto de $150. Essa diferença é exatamente o motivo de existir o Flash-Lite, e por que escolher o nível certo de modelo importa mais do que a maioria das equipes percebe ao orçar IA de suporte ou tentar reduzir custos de suporte com automação.

Como o Flash-Lite se compara

O Google publicou uma tabela comparativa, e a linha de preços é o que mais conta. A $0,30 / $2,50, o Flash-Lite fica abaixo do GPT-5.4 mini ($0,75 / $4,50) e do Claude Haiku 4.5 ($1,00 / $5,00), enquanto se mantém na mesma faixa geral de qualidade na maioria dos benchmarks agênticos.

Tabela comparativa do Google mostrando o Gemini 3.5 Flash-Lite contra o 3.1 Flash-Lite, GPT-5.4 mini e Claude Haiku 4.5 em preço e benchmarks, as taken from Google via 9to5Google
Tabela comparativa do Google mostrando o Gemini 3.5 Flash-Lite contra o 3.1 Flash-Lite, GPT-5.4 mini e Claude Haiku 4.5 em preço e benchmarks, as taken from Google via 9to5Google

Leia essa tabela com uma ressalva: o GPT-5.4 mini fica um pouco à frente em alguns escores de código e conhecimento. Mas em preço por capacidade para trabalho de alto volume, o Flash-Lite é difícil de superar, e vence de longe em recall de contexto longo. O único número que não é favorável é a latência: o tempo até o primeiro token fica em torno de 6 segundos (incluindo o tempo de raciocínio), no lado alto para sua categoria, então se encaixa melhor em tarefas em segundo plano do que em um chat ao vivo ágil.

Contra seu próprio antecessor, o salto de geração é evidente:

Gemini 3.5 Flash-Lite supera o 3.1 Flash-Lite em programação agêntica de terminal (54% vs 31%) e trabalho de conhecimento (1140 vs 642), as taken from Google via 9to5Google
Gemini 3.5 Flash-Lite supera o 3.1 Flash-Lite em programação agêntica de terminal (54% vs 31%) e trabalho de conhecimento (1140 vs 642), as taken from Google via 9to5Google

A programação agêntica de terminal salta de 31% para 54% no Terminal-Bench 2.1, e o trabalho de conhecimento quase dobra, de 642 para 1140 no GDPval-AA v2. O Google afirma que ele até supera o antigo 3 Flash em SWE-Bench Pro e tarefas de uso de computador, então você não está sacrificando muita qualidade pelo preço baixo. Se você está pesando o Gemini contra o restante do mercado, detalhamos isso em Gemini vs Claude, Gemini vs ChatGPT e no panorama mais amplo de alternativas ao Gemini.

Qual modelo você realmente deve escolher?

O Flash-Lite foi lançado ao lado do Gemini 3.6 Flash, e escolher o errado tanto desperdiça dinheiro quanto coloca no ar um bot que não dá conta do recado. A regra prática é simples.

Uma bifurcação de decisão: escolha o Gemini 3.6 Flash para raciocínio de várias etapas, programação e tickets complexos; escolha o Gemini 3.5 Flash-Lite para triagem de alto volume, tradução e desvio de tickets
Uma bifurcação de decisão: escolha o Gemini 3.6 Flash para raciocínio de várias etapas, programação e tickets complexos; escolha o Gemini 3.5 Flash-Lite para triagem de alto volume, tradução e desvio de tickets

Recorra ao 3.6 Flash quando o trabalho exigir raciocínio de verdade: agentes de várias etapas, programação, tickets de suporte complexos que envolvem vários sistemas. Recorra ao Flash-Lite quando estiver processando volume em que cada item é simples, como a triagem inicial, o desvio de chat ao vivo de perguntas rotineiras, ou respostas multilíngues em massa. Construir um agente de IA de verdade ou um bot com script é uma decisão separada da escolha do modelo, e costuma importar mais. Se você opera um produto SaaS, nossa análise da melhor IA para suporte SaaS mostra onde cada modelo se encaixa.

O que isso significa se você está construindo IA para suporte

Aqui é onde preciso ser direto com você, porque essa é a parte que todo artigo sobre preços de modelo pula quando o assunto é equipes de suporte.

Um modelo mais barato e rápido é uma boa notícia. Mas trocar para o Flash-Lite não te dá um agente de suporte funcional, assim como um motor mais barato não te dá um carro. Já são mais de três anos colocando IA em filas de suporte reais, e a falha que vi repetidamente não é o modelo ser burro, é um bot que soa confiante dando uma resposta errada a um cliente real porque ninguém construiu as camadas ao redor do modelo. O modelo é a camada mais básica da pilha.

O modelo é a camada mais básica de um agente de suporte, com recuperação de informações, guardrails e integração com o helpdesk empilhados por cima
O modelo é a camada mais básica de um agente de suporte, com recuperação de informações, guardrails e integração com o helpdesk empilhados por cima

Essas camadas são o trabalho de verdade. Recuperação de informações, para que o modelo responda a partir da sua central de ajuda e tickets anteriores em vez de chutar. Guardrails e escopo, para que ele escale corretamente em vez de inventar uma política de reembolso. Integração, para que possa agir dentro do seu sistema de tickets. E testes, para que você saiba como ele se comporta antes de ele tocar em um cliente. Essa é exatamente a diferença entre uma API bruta e um verdadeiro software de atendimento ao cliente com IA, e é por isso que os problemas de chatbot de IA quase sempre remontam ao encanamento, não ao modelo.

É também por isso que eu recomendaria cautela em conectar você mesmo a API bruta do Gemini ao seu helpdesk. Você estaria reconstruindo recuperação de informações, guardrails contra alucinação, simulação e cada integração de helpdesk do zero, e depois mantendo isso à medida que os modelos mudam a cada poucas semanas. O Flash-Lite ser barato não muda essa conta. Esse é todo o argumento a favor de uma IA de helpdesk construída para isso em vez de uma pilha DIY: o nível do modelo é apenas um item de custo, o sistema ao redor é que é o produto. E quando você treina o agente corretamente, o modelo por baixo pouco importa para o resultado.

Experimente o eesel

É exatamente essa a camada que o eesel foi construído para ser. Você o conecta ao seu helpdesk existente, ele aprende com seus tickets anteriores e base de conhecimento desde o início, e roda em cima de modelos de ponta, então você ganha a eficiência sem precisar conectar a API você mesmo.

Visão geral do painel do helpdesk de IA do eesel
Visão geral do painel do helpdesk de IA do eesel

O diferencial que um modelo barato não consegue te dar sozinho: o eesel permite simular o agente contra seus tickets históricos antes que ele responda a um cliente real, então você vê a taxa de resolução e as respostas exatas que ele teria enviado, e pode vincular isso ao ROI real da IA de suporte. E como é precificado pelo trabalho que faz, não por token, você evita a conta de tokens em cada ticket. Se você está calculando o preço do Flash-Lite para construir automação de suporte, comece pelo resultado que quer e deixe a plataforma cuidar do encanamento. É grátis para testar.

Perguntas frequentes

Quanto custa o Gemini 3.5 Flash-Lite?
No nível pago padrão, o preço do Gemini 3.5 Flash-Lite é de $0,30 por 1M de tokens de entrada e $2,50 por 1M de tokens de saída, o que o torna o modelo mais barato da linha 3.5 do Google. O modo batch reduz ambos pela metade, para $0,15 / $1,25. Para conhecer o restante da família, veja nosso detalhamento dos preços do Gemini.
O Gemini 3.5 Flash-Lite é mais barato que o Gemini 3.6 Flash?
Sim, e por uma boa margem. O Flash-Lite é cerca de 5x mais barato na entrada e 3x mais barato na saída que o Gemini 3.6 Flash ($1,50/$7,50). A troca é a profundidade de raciocínio: o 3.6 Flash é a melhor escolha para trabalhos complexos e de várias etapas.
Para que serve o Gemini 3.5 Flash-Lite?
O Google posiciona o Flash-Lite para tarefas de alto volume e baixa latência: busca agêntica, processamento de documentos, tradução e triagem simples. É o modelo escolhido quando cada tarefa é fácil, mas você a executa milhões de vezes, como na triagem inicial de tickets.
O Gemini 3.5 Flash-Lite tem nível gratuito?
Sim, mas com uma ressalva: no nível gratuito, o Google pode usar seu conteúdo para melhorar seus produtos, o que o torna inviável para qualquer coisa que envolva dados de clientes. Os níveis pagos não treinam com seus dados. Pese isso contra o custo real do atendimento ao cliente com IA antes de construir algo.
Devo usar o Gemini 3.5 Flash-Lite para suporte ao cliente?
O modelo é capaz o suficiente para tarefas simples de suporte, mas um modelo sozinho não é um agente de suporte. Você ainda precisa de recuperação de informações, guardrails e testes por cima. Uma plataforma como um software de atendimento ao cliente com IA cuida dessa camada para que você não precise conectar a API bruta você mesmo.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Banner principal do Gemini 3.6 Flash em fundo azul do Google
Trending

Gemini 3.6 Flash: o que é, quanto custa e para quem é indicado

Gemini 3.6 Flash é o novo modelo de trabalho do Google: 17% menos tokens de saída, saída mais barata e um contexto de 1M. Veja o que é e quem deveria usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Banner do Gemini 3.5 Flash-Lite sobre um fundo azul Google
Trending

Gemini 3.5 Flash-Lite: o que é, preço e para quem serve

O Gemini 3.5 Flash-Lite é o modelo 3.5 mais rápido e barato do Google, a $0,30/$2,50 por 1M de tokens. Veja o que é, quanto custa e quando usar.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber: o que é e quem pode usar

Gemini 3.5 Flash Cyber é o modelo de segurança do Google para encontrar e corrigir vulnerabilidades de código. Veja o que ele faz, como o CodeMender o utiliza e por que você provavelmente ainda não pode acessá-lo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Banner principal de preços do Gemini 3.6 Flash em fundo azul do Google
Trending

Preços do Gemini 3.6 Flash: o detalhamento completo de custos para 2026

O Gemini 3.6 Flash custa $1.50 de entrada e $7.50 de saída por 1M de tokens. Aqui está a tabela de preços completa, os custos ocultos e quanto custa realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Texto alternativo da imagem
Guides

Visão geral do Gemini Agentic Vision: Como funciona e o que significa para a IA

O Gemini Agentic Vision do Google é um novo recurso no modelo Gemini 3 Flash que muda a forma como a IA interage com imagens, transformando a visualização passiva em uma investigação ativa de várias etapas para maior precisão.

Stevia PutriStevia PutriJan 30, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis