Gemini 3.5 Flash-Lite: o que é, preço e para quem serve

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Banner do Gemini 3.5 Flash-Lite sobre um fundo azul Google

O que o Gemini 3.5 Flash-Lite realmente é

O Google divide sua família Gemini em duas faixas. Os modelos Pro são o nível superior para raciocínio difícil. Os modelos Flash são os cavalos de trabalho: mais baratos, mais rápidos, ajustados para apps que fazem milhares de chamadas por dia. O Flash-Lite é o mais leve desses cavalos de trabalho, posicionado pelo Google para tarefas agênticas de alto volume, tradução e processamento de dados simples.

Pense nele como o modelo que você usa em trabalhos onde a tarefa individual é fácil mas o volume é brutal: classificar um ticket de suporte, extrair campos de um PDF, traduzir uma mensagem de chat, fazer uma busca de primeira passagem. Ele processa entrada de texto, imagem, vídeo, áudio e PDF, suporta function calling, saídas estruturadas, execução de código, cache e grounding com busca, e carrega a mesma janela de contexto de ~1M de tokens que seus irmãos maiores (cerca de 1.500 páginas A4 de entrada).

O que ele deixa de fora deliberadamente diz para quem ele é. O Flash-Lite não suporta computer use, geração de imagens, geração de áudio ou a Live API. Se seu agente precisa controlar um navegador ou gerar mídia, essa é a função do Gemini 3.6 Flash ou de um modelo Pro, não deste. O Flash-Lite se mantém estreito de propósito: ler texto, decidir, escrever texto, fazer isso rápido e barato.

Preços do Gemini 3.5 Flash-Lite

Aqui está o quadro completo. Esse é o motivo pelo qual o modelo existe, então vale a pena ler com atenção antes de colocá-lo em uma planilha.

Modo de consumoEntrada (por 1M)Saída (incl. raciocínio)Cache de contexto
Padrão$0,30$2,50$0,03
Batch (50% de desconto)$0,15$1,25$0,02
Flex$0,15$1,25$0,02
Priority$0,54$4,50$0,05
Nível gratuitoGratuitoGratuitoGratuito

Algumas coisas que vale a pena destacar:

  • O nível gratuito tem uma pegadinha. No nível gratuito, o Google usa seu conteúdo para melhorar seus produtos; em qualquer nível pago, ele não faz isso. Para qualquer coisa que envolva dados de clientes, isso por si só elimina o nível gratuito.
  • O modo batch tem um desconto fixo de 50%, que é o nível em que a maioria dos trabalhos de alto volume deveria realmente rodar. O mesmo vale para a inferência flex. Se o trabalho não precisa ser em tempo real, você paga $0,15/$1,25.
  • Os acertos de cache são baratos. Um token de entrada em cache custa $0,03 por 1M, um corte de 90%, então o contexto repetido (seu prompt de sistema, um trecho de conhecimento) quase não aparece na conta.
  • O grounding com busca é medido separadamente. Você tem 5.000 prompts com grounding gratuitos por mês em toda a família Gemini 3, e depois disso $14 por 1.000 buscas.

Uma observação honesta da Artificial Analysis: a $0,30/$2,50, ele fica em #87 de 152 em preço bruto, então "Lite" não significa "o mais barato do mercado". Significa o mais barato dentro da linha Gemini 3.5, mantendo ao mesmo tempo uma pontuação de inteligência de primeira linha. Para ver como isso se compara aos planos Gemini para consumidores e às outras camadas da API, nosso guia de preços do Gemini tem o detalhamento completo e os preços do Gemini Workspace cobrem os planos empresariais.

A velocidade é o destaque

Se o preço é o motivo para colocar o Flash-Lite na lista, a velocidade é o motivo para ficar com ele. A Artificial Analysis cronometrou cerca de 490 tokens por segundo, colocando-o em #2 de 152 modelos testados; o Google cita 350 tokens por segundo em seu próprio benchmark. De qualquer forma, ele fica perto do topo do campo.

Tabela de benchmark do Gemini 3.5 Flash-Lite mostrando pontuações de codificação agêntica em terminal e trabalho de conhecimento, as shared by Google
Tabela de benchmark do Gemini 3.5 Flash-Lite mostrando pontuações de codificação agêntica em terminal e trabalho de conhecimento, as shared by Google

Há uma ressalva que vale a pena conhecer antes de prometer a um product manager respostas em menos de um segundo. O tempo até o primeiro token fica em torno de 6 segundos na mediana, no topo da sua categoria, porque a etapa de raciocínio do modelo roda antes de o primeiro token visível aparecer. Então o streaming é extremamente rápido depois que começa, mas o início pode atrasar em um prompt difícil. Para a maior parte do trabalho de suporte (respostas curtas, classificação simples) esse orçamento de raciocínio é pequeno e o atraso é insignificante; para qualquer coisa que você cronometre no milissegundo, teste primeiro com seus próprios prompts.

Contra seu próprio antecessor, o salto de geração é claro nos benchmarks de codificação agêntica e trabalho de conhecimento:

Gemini 3.5 Flash-Lite supera o 3.1 Flash-Lite em codificação agêntica em terminal e trabalho de conhecimento, as shared by Google
Gemini 3.5 Flash-Lite supera o 3.1 Flash-Lite em codificação agêntica em terminal e trabalho de conhecimento, as shared by Google

Flash-Lite ou 3.6 Flash? Escolha o certo

Essa é a decisão que a maioria das equipes erra, porque os dois foram lançados no mesmo dia e os nomes quase não se diferenciam. Eles foram construídos para extremos opostos do mesmo trabalho. Percorra o seletor abaixo.

Qual modelo Gemini eu deveria usar?
Escolha a afirmação que melhor combina com sua carga de trabalho.
Gemini 3.5 Flash-Lite. O mais barato da linha 3.5 ($0,30/$2,50, a metade em batch) e perto do topo do campo em velocidade. É exatamente para isso que serve o "Lite".
Gemini 3.6 Flash. É o cavalo de trabalho com computer use integrado e raciocínio em várias etapas mais forte. O Flash-Lite deixa isso de fora de propósito.
O modelo é a parte fácil. Qualquer um dos dois modelos funciona, mas você ainda precisa de recuperação de informação, guardrails e testes ao redor. Continue lendo, ou vá direto para a seção abaixo.

A regra geral: recorra ao Flash-Lite quando cada item for simples e o volume for o desafio, como uma primeira triagem de tickets, desvio de nível 1 ou desvio de chat em tempo real de rotina. Recorra ao 3.6 Flash quando o trabalho realmente precisar raciocinar em vários sistemas. Construir um agente de IA de verdade ou um bot com script é uma decisão separada da escolha do modelo.

Os outros modelos que saíram naquele dia

O Flash-Lite não foi lançado sozinho. O Google lançou três modelos em 21 de julho e guardou um, e conhecer esse conjunto evita que você escolha o nível errado.

O Gemini 3.6 Flash é o novo cavalo de trabalho principal, a $1,50 de entrada / $7,50 de saída, com computer use integrado e cerca de 17% menos tokens de saída que o 3.5 Flash. O Gemini 3.5 Flash Cyber é um especialista em segurança ajustado para encontrar e corrigir vulnerabilidades dentro do agente CodeMender do Google, e está disponível apenas para governos e parceiros de confiança em um piloto limitado.

A ausência notável: o carro-chefe Gemini 3.5 Pro. A Bloomberg informou que ele sofreu atrasos internos depois de não atingir suas próprias metas de desempenho, e Logan Kilpatrick, do DeepMind, disse que ele ainda está em testes com parceiros. Então o movimento do Google aqui é revelador: manter o nível barato e de alto volume atualizado enquanto o carro-chefe ainda está sendo preparado. Se você precisa de um modelo de ponta hoje, nosso resumo de alternativas ao Gemini é o ponto de partida honesto, Gemini vs Claude e Gemini vs ChatGPT cobrem os confrontos diretos, e empresas de atendimento ao cliente com IA mapeia os fornecedores que constroem sobre esses modelos.

O que isso significa se você está construindo IA para suporte

Aqui eu preciso ser direto com você, porque essa é a parte que todo artigo de lançamento de modelo pula para as equipes de suporte.

Um modelo mais rápido e mais barato é uma boa notícia. Mas trocar para o Flash-Lite não te dá um agente de suporte funcional, assim como uma CPU mais rápida não te dá um aplicativo. Eu passo meus dias conectando integrações e APIs à eesel, e ao longo de mais de três anos colocando IA em filas de suporte reais, a falha que vimos repetidamente não é o modelo ser burro, é um bot que parece confiante dando uma resposta errada a um cliente real porque ninguém construiu as camadas em torno do modelo. O modelo é a base da pilha, não ela toda.

Essas camadas são o trabalho real. Recuperação de informação, para que o modelo responda a partir da sua base de conhecimento e de tickets anteriores em vez de adivinhar. Guardrails e escopo, para que ele transfira de forma limpa em vez de inventar uma política de reembolso. Integração, para que ele possa agir dentro do seu sistema de tickets. E testes, para que você saiba como ele se comporta antes de tocar em um cliente, não depois. Essa é a diferença entre uma API bruta e um software de atendimento ao cliente com IA de verdade, e é por isso que os problemas de chatbots de IA quase sempre remetem ao encanamento, não ao modelo.

É também por isso que eu contestaria conectar você mesmo a API bruta do Gemini ao seu helpdesk. Você estaria reconstruindo do zero a recuperação de informação, os guardrails contra alucinações, a simulação e cada integração de helpdesk, e depois mantendo tudo isso enquanto o Google lança um novo modelo a cada poucas semanas (três em um dia, dessa vez). Essa rotatividade é todo o argumento para escolher uma IA de helpdesk feita sob medida em vez de uma pilha caseira: o nível do modelo é um item substituível, o sistema em torno dele é o produto.

Experimente a eesel

Essa é exatamente a camada que a eesel foi construída para ser. Você a conecta ao seu helpdesk existente, ela aprende com seus tickets passados e sua base de conhecimento desde o início, e roda sobre modelos de ponta como o Gemini, então você obtém a velocidade e a economia de custos de um modelo como o Flash-Lite sem conectar a API você mesmo.

Visão geral do painel de helpdesk da eesel AI
Visão geral do painel de helpdesk da eesel AI

O diferencial que mais importa aqui é o que o Flash-Lite não pode te dar por conta própria: a eesel permite simular o agente contra seus tickets históricos antes que ele responda a um cliente real, então você vê a taxa de resolução e as respostas exatas que ele teria enviado. E como ela tem preço baseado em resultados, não por token, você evita a conta de tokens em cada ticket. Se você está avaliando modelos para construir automação de suporte, comece pelo resultado que você quer e deixe a plataforma escolher o encanamento. É gratuito para experimentar.

Frequently Asked Questions

O que é o Gemini 3.5 Flash-Lite?
O Gemini 3.5 Flash-Lite é o modelo mais rápido e barato da linha Gemini 3.5 do Google, lançado em 21 de julho de 2026 junto com o Gemini 3.6 Flash. Ele foi feito para tarefas de alto volume e baixa latência, como busca agêntica, processamento de documentos e tradução. Para uma visão mais ampla da família, veja nosso resumo do Gemini AI.
Quanto custa o Gemini 3.5 Flash-Lite?
No nível pago padrão, o preço do Gemini 3.5 Flash-Lite é de $0,30 por 1M de tokens de entrada e $2,50 por 1M de tokens de saída, com os modos batch e flex pela metade ($0,15/$1,25). Também existe um nível gratuito no qual o Google pode usar seu conteúdo para melhorar os produtos. Compare com o detalhamento completo de preços do Gemini.
O Gemini 3.5 Flash-Lite é bom para atendimento ao cliente?
Para tarefas simples e de alto volume, como a primeira triagem de tickets, é uma ótima opção, mas o modelo é apenas a camada mais baixa de um agente de suporte. Você ainda precisa de recuperação de informação sobre sua central de ajuda, guardrails e testes antes de ir ao ar. Uma plataforma como um software de atendimento ao cliente com IA cuida dessa camada para que você não precise conectar a API bruta você mesmo.
Qual é o preço do Gemini 3.5 Flash-Lite para uso de alto volume?
O modo batch tem um desconto fixo de 50% sobre o padrão, então trabalhos de alto volume e sem necessidade de tempo real rodam a $0,15 de entrada / $1,25 de saída por 1M de tokens. Os acertos de cache caem para $0,03 por 1M. Para um trabalho que você executa milhões de vezes, essa diferença é todo o motivo para escolher o Flash-Lite em vez do 3.6 Flash.
Gemini 3.5 Flash-Lite vs 3.6 Flash: qual devo usar?
Use o Flash-Lite quando cada item for simples e você estiver processando volume, como triagem de tickets ou desvio de chat em tempo real de rotina. Use o 3.6 Flash quando o trabalho precisar de raciocínio real em várias etapas. Veja o resumo de alternativas ao Gemini se nenhum dos dois encaixar.
Qual é a velocidade do Gemini 3.5 Flash-Lite?
A Artificial Analysis mediu cerca de 490 tokens de saída por segundo, colocando-o em #2 de 152 modelos testados. O Google cita 350 tokens por segundo em seu próprio benchmark. De qualquer forma, ele está entre os modelos mais rápidos disponíveis, que é justamente o objetivo de um modelo Lite. Ele tem, porém, um tempo até o primeiro token mais alto, porque o raciocínio ocorre antes de o primeiro token aparecer.
O Gemini 3.5 Flash-Lite suporta computer use?
Não. Computer use, geração de imagens, geração de áudio e a Live API não são suportados no Flash-Lite. Ele suporta function calling, saídas estruturadas, execução de código, cache e grounding com busca. Se você precisa de computer use, essa é a função do Gemini 3.6 Flash.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Banner principal dos preços do Gemini 3.5 Flash-Lite em fundo azul Google
Trending

Preços do Gemini 3.5 Flash-Lite: quanto custa e para quem é indicado

O Gemini 3.5 Flash-Lite é o modelo mais barato do Google, a $0,30/$2,50 por 1M de tokens. Veja a tabela completa de preços, um exemplo de custo real e para quem ele é indicado.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Banner principal do Gemini 3.6 Flash em fundo azul do Google
Trending

Gemini 3.6 Flash: o que é, quanto custa e para quem é indicado

Gemini 3.6 Flash é o novo modelo de trabalho do Google: 17% menos tokens de saída, saída mais barata e um contexto de 1M. Veja o que é e quem deveria usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber: o que é e quem pode usar

Gemini 3.5 Flash Cyber é o modelo de segurança do Google para encontrar e corrigir vulnerabilidades de código. Veja o que ele faz, como o CodeMender o utiliza e por que você provavelmente ainda não pode acessá-lo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Banner principal de preços do Gemini 3.6 Flash em fundo azul do Google
Trending

Preços do Gemini 3.6 Flash: o detalhamento completo de custos para 2026

O Gemini 3.6 Flash custa $1.50 de entrada e $7.50 de saída por 1M de tokens. Aqui está a tabela de preços completa, os custos ocultos e quanto custa realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Texto alternativo da imagem
Guides

Visão geral do Gemini Agentic Vision: Como funciona e o que significa para a IA

O Gemini Agentic Vision do Google é um novo recurso no modelo Gemini 3 Flash que muda a forma como a IA interage com imagens, transformando a visualização passiva em uma investigação ativa de várias etapas para maior precisão.

Stevia PutriStevia PutriJan 30, 2026
Ilustração de um colega de equipe de IA em um laptop sendo revisado por dois colegas segurando uma lista de verificação e uma lupa, com a marca Grok à esquerda
Trending

Análise do Grok Bot: o que realmente funciona no beta inicial

O Grok Bot dá a cada colega de equipe de IA um computador na nuvem e credenciais reais. Passei por todas as páginas da documentação e pela primeira semana de relatos de usuários para ver o que realmente funciona.

Rama Adi NugrahaRama Adi NugrahaAug 13, 2026
Ilustração de um colega de IA a trabalhar numa secretária ao lado de dois colegas, com ícones de ferramentas por cima e o logótipo do Grok à esquerda
Trending

Grok Bot explicado: o que os colegas de IA sempre ativos da xAI realmente fazem

O Grok Bot dá a cada colega de IA o seu próprio computador na nuvem e faz login nas suas ferramentas reais. Eis como funciona, quanto custa, e onde o design falha.

Alicia Kirana UtomoAlicia Kirana UtomoAug 12, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis