
Os preços do Gemini 3.6 Flash em resumo
Aqui está a tabela completa do nível padrão, direto da página de preços do Google. O modo de consumo escolhido muda a tarifa mais do que qualquer outra coisa.
| Modo de consumo | Entrada (por 1M) | Saída (incl. raciocínio) | Cache de contexto |
|---|---|---|---|
| Standard | $1.50 | $7.50 | $0.15 |
| Batch (50% de desconto) | $0.75 | $3.75 | $0.075 |
| Flex | $0.75 | $3.75 | $0.075 |
| Priority | $2.70 | $13.50 | $0.27 |
| Nível gratuito | Gratuito | Gratuito | Gratuito |
Em resumo: o Standard é o padrão, Batch e Flex compartilham a mesma tarifa com 50% de desconto para trabalho que não precisa ser em tempo real, e o Priority custa 1.8 vezes mais para garantir baixa latência. O cache de contexto a $0.15 por 1M é a alavanca que a maioria das equipes subutiliza, ele evita pagar novamente pela entrada do mesmo prompt de sistema ou trecho de conhecimento em cada chamada. É o novo carro-chefe da família Gemini, e ocupa o lugar onde antes você recorreria ao 3.5 Flash.
Calcule quanto isso vai realmente custar
As tarifas anunciadas só fazem sentido quando multiplicadas pelo seu tráfego real. Informe seu volume mensal e a contagem média de tokens para ver o custo mensal no nível padrão e no nível batch, além do custo por solicitação.
A lição que a maioria das equipes aprende aqui: em qualquer volume real, os tokens de saída dominam a conta, e é exatamente por isso que o corte de $9.00 para $7.50 na saída é a mudança principal, e por que um modelo que termina com menos tokens vale mais do que um que é alguns centavos mais barato por milhão.
O que mudou desde o Gemini 3.5 Flash
A mudança de uma geração para a outra é uma vitória de custo pura exatamente no lado que mais dói. Veja como os dois modelos se comparam no nível padrão, ao lado da opção econômica.
| Modelo | Entrada (por 1M) | Saída (por 1M) | Posicionamento |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | O Flash mais inteligente, feito para velocidade |
| Gemini 3.5 Flash | $1.50 | $9.00 | Flash principal da geração anterior |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Modelo GA mais barato, para trabalho de alto volume |

Na verdade, há duas economias se acumulando uma sobre a outra. A primeira é a tarifa de saída ~17% mais baixa. A segunda é a eficiência de tokens: segundo o Artificial Analysis Index, o 3.6 Flash usa 17% menos tokens de saída para fazer o mesmo trabalho, e em benchmarks agênticos como o DeepSWE a diferença chegou a 65% (a saída média caiu de 276K para 97K tokens por tarefa). Menos tokens a uma tarifa mais baixa se combinam, então a economia efetiva em uma carga de trabalho real é maior do que o corte de preço sugere. O nível Batch conta a mesma história: o batch do 3.6 Flash é $0.75/$3.75 contra $0.75/$4.50 do 3.5 Flash.
Entre fornecedores, essa tarifa de saída de $7.50 fica bem abaixo do Claude Sonnet 5 (cerca de $15 de saída na tabela), ao mesmo tempo em que se mantém em uma faixa de qualidade semelhante para a maior parte do trabalho agêntico. Se o que você realmente busca é o nível principal, vale a pena olhar as próprias alternativas ao Gemini do Google enquanto o 3.5 Pro continua atrasado.
Os custos ocultos que a tabela de preços não mostra
É aqui que uma conta real se distancia do valor anunciado de $1.50/$7.50. Quatro itens costumam pegar as equipes de surpresa.
- Os tokens de raciocínio são cobrados como saída. O 3.6 Flash oferece suporte a raciocínio, e esses tokens de raciocínio contam para a tarifa de saída de $7.50. Os ganhos de eficiência de tokens ajudam aqui, mas um prompt com muito raciocínio ainda cobra mais do que o tamanho visível da resposta sugere.
- O grounding de busca é medido separadamente. Você tem 5.000 prompts com grounding gratuitos por mês em toda a família Gemini 3, e depois disso custa $14 por 1.000 consultas de busca, e uma única solicitação de cliente pode disparar várias consultas cobráveis.
- O nível gratuito treina com seus dados. No nível gratuito, o Google usa seu conteúdo para melhorar seus produtos. Em qualquer nível pago, isso não acontece. Para qualquer coisa que envolva dados de clientes, isso já é suficiente para descartar o nível gratuito.
- O modo Priority tem uma sobretaxa de 1.8 vezes. Se você precisa de baixa latência garantida, o Priority custa $2.70/$13.50, quase o dobro do padrão. A maioria das equipes não precisa disso, mas é fácil ativar e esquecer que está ligado.
Gemini 3.6 Flash vs. 3.5 Flash-Lite: quando o modelo mais barato vence
A forma mais eficaz de reduzir uma conta do Gemini muitas vezes não é usar o 3.6 Flash, e sim direcionar o trabalho simples para o Gemini 3.5 Flash-Lite. A $0.30/$2.50, o Flash-Lite é cerca de 5 vezes mais barato na entrada e 3 vezes mais barato na saída, e roda a cerca de 350 tokens de saída por segundo.
A regra prática é sobre profundidade de raciocínio, não fidelidade a uma marca. Use o 3.6 Flash quando o trabalho precisa de raciocínio real em várias etapas: programação, agentes que tocam vários sistemas, tickets de suporte complexos. Use o Flash-Lite quando cada item é simples e o volume é alto, como a triagem de tickets de primeira linha ou o desvio de chat em tempo real para perguntas rotineiras. Muitas pilhas em produção usam os dois, direcionando pela dificuldade, o que é a configuração mais barata de todas. Construir um agente de verdade ou um bot baseado em regras é uma decisão separada da escolha do modelo.
Níveis de conta, limites de gastos e limites de taxa
O preço do Gemini também é determinado pelo nível de uso em que sua conta de cobrança está, segundo a página de limites de taxa.
| Nível de uso | Como se qualificar | Limite de cobrança |
|---|---|---|
| Gratuito | Projeto ativo ou teste gratuito | N/A |
| Tier 1 | Conta de cobrança ativa vinculada | $250 |
| Tier 2 | Pago $100 + 3 dias | $2,000 |
| Tier 3 | Pago $1,000 + 30 dias | $20,000+ |
Duas observações práticas. Primeiro, os limites de taxa baseados em gasto funcionam em uma janela móvel de 10 minutos (o Tier 1 tem limite de $10, os Tiers 2 e 3 de $200), e ultrapassar isso retorna um erro 429 RESOURCE_EXHAUSTED, então um pico de tráfego pode te limitar antes de você chegar ao orçamento mensal. Segundo, se você opera em escala real, o nível Enterprise do Google adiciona capacidade provisionada e descontos por volume que não aparecem na tabela pública. Para ver como isso se compara aos planos Gemini para consumidores, nosso guia de preços do Gemini e os preços do Gemini Workspace cobrem o resto.
O que realmente custa executar um agente de suporte
Esta é a parte que todo artigo sobre preços de modelos pula, e o motivo pelo qual eu diria para você não dar tanta importância à tarifa do token se seu objetivo é atendimento ao cliente.
Um modelo mais barato e mais rápido é uma boa notícia. Mas o $1.50/$7.50 é o custo do motor puro, não do carro inteiro. Passei os últimos três anos e meio colocando IA em filas de suporte reais, e a falha que vi repetidas vezes não é o modelo ser caro demais, é um bot que soa confiante dando uma resposta errada porque ninguém construiu e pagou pelas camadas em torno do modelo. Essas camadas são o custo real.

Recuperação de informações sobre o seu centro de ajuda, para que ele responda a partir da sua documentação em vez de adivinhar. Salvaguardas contra alucinações, para que ele faça um handoff limpo em vez de inventar uma política de reembolso. Integração, para que possa agir dentro do seu sistema de tickets. E testes, para que você saiba como ele se comporta antes de tocar em um cliente. Construa isso você mesmo sobre a API pura e você não estará pagando $7.50 por 1M de tokens, estará pagando uma equipe de engenharia para reconstruir a recuperação de informações, a simulação e cada integração com o helpdesk do zero, e depois mantê-la conforme os modelos mudam a cada poucas semanas. Esse é o argumento a favor de uma IA de helpdesk feita sob medida em vez de uma pilha construída internamente, e é por isso que os problemas de chatbots de IA quase sempre remetem à encanação por trás, não ao nível do modelo.
Experimente a eesel
Essa é exatamente a camada que a eesel foi construída para ser. Você a conecta ao seu helpdesk existente, ela aprende com seus tickets passados e sua base de conhecimento desde o início, e roda sobre modelos de ponta como o Gemini, então você ganha a eficiência sem conectar a API ou fazer contas de tokens sozinho.

As duas coisas que mais importam para o preço são justamente aquelas que a tarifa do token não pode te dar. Primeiro, a eesel permite que você simule o agente contra seus tickets históricos antes de responder a um cliente real, então você vê a taxa de resolução e as respostas exatas que ele teria enviado, sem precisar adivinhar no que o gasto se traduz. Segundo, ela cobra pelo trabalho que faz, por resolução em vez de por token, então um mês agitado não se transforma em uma conta surpresa de API. Se você está calculando o custo de modelos para construir automação de suporte, comece pelo resultado que você quer e deixe a plataforma cuidar da encanação. É grátis para testar.
Frequently Asked Questions
Quanto custa o Gemini 3.6 Flash?
Como o preço do Gemini 3.6 Flash se compara ao do 3.5 Flash?
O Gemini 3.6 Flash é mais barato que o Gemini 3.5 Flash-Lite?
O Gemini 3.6 Flash tem nível gratuito?
Quais são os custos ocultos no preço do Gemini 3.6 Flash?
Quanto custa executar um agente de atendimento ao cliente com o Gemini 3.6 Flash?
Como o preço do Gemini 3.6 Flash se compara ao do GPT-5.6 e do Claude?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







