Gemini 3.6 Flash: o que é, quanto custa e para quem é indicado

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Banner principal do Gemini 3.6 Flash em fundo azul do Google

O que o Gemini 3.6 Flash realmente é

Arte do título do Gemini 3.6 Flash, compartilhada pelo Google
Arte do título do Gemini 3.6 Flash, compartilhada pelo Google

O Google divide sua família Gemini em duas linhas. Os modelos Pro são o nível de maior capacidade para raciocínio e programação difíceis. Os modelos Flash são os cavalos de batalha: custo menor, respostas mais rápidas, ajustados para aplicativos em produção que fazem milhares de chamadas por dia. O Gemini 3.6 Flash é o mais recente desses cavalos de batalha, e é uma iteração direta do 3.5 Flash moldada pelo feedback de desenvolvedores desde o lançamento do I/O 2026.

A proposta, nas palavras do próprio Google, é um modelo construído "para velocidade, combinando inteligência de fronteira com busca e grounding superiores". Na prática, isso significa que é o modelo ao qual você recorre quando está conectando um agente de IA que precisa funcionar de forma confiável e barata, não aquele que você usa para resolver um único problema de pesquisa complicado. Ele lida com texto, imagens, vídeo, áudio e PDFs como entrada, suporta chamadas de função e saídas estruturadas, e agora inclui uso do computador como ferramenta integrada.

Aqui está o enquadramento honesto que a maior parte da cobertura do lançamento ignora: para a grande maioria dos casos de uso em produção, um modelo da classe Flash já é mais do que suficiente. A pergunta interessante em 2026 não é "o modelo é inteligente o suficiente", é "quanto custa executar isso um milhão de vezes". Essa é exatamente a pergunta que o 3.6 Flash foi construído para responder.

A manchete: mais trabalho, menos tokens

O número que o Google destaca é a eficiência de tokens. Segundo o Artificial Analysis Index, o 3.6 Flash usa 17% menos tokens de saída que o 3.5 Flash para fazer o mesmo trabalho. Em alguns benchmarks agênticos a diferença é maior: no DeepSWE, o Google mediu até 65% menos tokens de saída, reduzindo a saída média de 276K para 97K tokens por tarefa.

O Gemini 3.6 Flash usa muito menos tokens de saída por tarefa do que o 3.5 Flash no DeepSWE e no Artificial Analysis Index, conforme compartilhado pelo Google
O Gemini 3.6 Flash usa muito menos tokens de saída por tarefa do que o 3.5 Flash no DeepSWE e no Artificial Analysis Index, conforme compartilhado pelo Google

Por que isso importa mais do que uma pontuação de qualidade bruta? Porque os tokens de saída são o lado caro da conta, e um agente que chega à resposta em menos etapas de raciocínio e chamadas de ferramentas também é mais rápido e menos propenso a se desviar. O Google diz que o 3.6 Flash precisa de menos etapas de raciocínio e chamadas de ferramentas para concluir fluxos de trabalho de várias etapas, com menos daquela verborragia que infla os custos silenciosamente. Quando você multiplica isso em uma fila de suporte que processa dezenas de milhares de tickets por mês, a economia acumulada é a história toda.

Preços do Gemini 3.6 Flash

Aqui está o panorama completo. O preço de saída é a mudança significativa: a entrada permanece em $1,50, a saída cai para $7,50 por 1M de tokens.

Modo de consumoEntrada (por 1M)Saída (incl. raciocínio)Cache de contexto
Padrão$1.50$7.50$0.15
Lote (50% de desconto)$0.75$3.75$0.075
Flex$0.75$3.75$0.075
Prioridade$2.70$13.50$0.27
Plano gratuitoGratuitoGratuitoGratuito

Algumas coisas que vale a pena observar antes de colocar isso em uma planilha:

  • O plano gratuito tem uma pegadinha. No plano gratuito, o Google usa seu conteúdo para melhorar seus produtos. Em qualquer plano pago, não faz isso. Para qualquer coisa que envolva dados de clientes, só isso já descarta o plano gratuito.
  • O grounding de busca é medido separadamente. Você tem 5.000 prompts com grounding grátis por mês em toda a família Gemini 3, depois custa $14 por 1.000 consultas de busca, e uma única solicitação de cliente pode disparar várias consultas cobráveis.
  • O modo em lote é um desconto fixo de 50% para trabalho que não precisa ser em tempo real.

Para ver como isso se compara aos planos do Gemini para consumidores e ao resto dos níveis da API, nosso guia de preços do Gemini tem o detalhamento completo, e os preços do Gemini Workspace cobrem os planos empresariais.

Como ele se compara ao GPT-5.6 e ao Claude

O Google publicou uma tabela comparativa direta, e é surpreendentemente honesta sobre onde o 3.6 Flash não vence. Ele lidera em uso do computador (OSWorld-Verified 83,0%), raciocínio sobre gráficos, compreensão de vídeos longos e recuperação de contexto longo (54,0% no brutal teste GDM-MRCR de 1M de tokens, onde os rivais não apresentam nada). Mas o GPT-5.6 Luna e o Claude Sonnet 5 ainda lideram em vários benchmarks de programação e trabalho de conhecimento.

Tabela comparativa do Google mostrando o Gemini 3.6 Flash contra o GPT-5.6 Luna, o Grok 4.5 e o Claude Sonnet 5 em preço e benchmarks, conforme compartilhado pelo Google
Tabela comparativa do Google mostrando o Gemini 3.6 Flash contra o GPT-5.6 Luna, o Grok 4.5 e o Claude Sonnet 5 em preço e benchmarks, conforme compartilhado pelo Google

A leitura mais útil é o preço por capacidade. A $1,50/$7,50, o 3.6 Flash fica bem abaixo do Claude Sonnet 5 (aproximadamente $3/$15 no preço de tabela) na saída, por uma margem ampla, enquanto se posiciona na mesma faixa de qualidade para a maior parte do trabalho agêntico. Essa é a aposta que a linha Flash foi construída para ganhar: não "o modelo mais inteligente do ranking", mas "a maior capacidade por dólar para o trabalho que você executa em volume". Se você está avaliando os dois diretamente, detalhamos isso em Gemini vs Claude e Gemini vs ChatGPT.

Em relação aos seus próprios antecessores, o salto de geração para geração é claro em todos os benchmarks agênticos:

O Gemini 3.6 Flash supera o 3.1 Pro e o 3.5 Flash no DeepSWE, MLE-Bench, trabalho de conhecimento e uso do computador, conforme compartilhado pelo Google
O Gemini 3.6 Flash supera o 3.1 Pro e o 3.5 Flash no DeepSWE, MLE-Bench, trabalho de conhecimento e uso do computador, conforme compartilhado pelo Google

A programação sobe de 37% para 49% no DeepSWE, a engenharia de aprendizado de máquina de 49,7% para 63,9% no MLE-Bench, e o trabalho de conhecimento de 1349 para 1421 no GDPval-AA. O corte de conhecimento também avança de janeiro de 2025 para março de 2026, o que importa se seu agente responde perguntas sobre algo recente.

Os outros dois modelos lançados junto com ele

O 3.6 Flash não estava só. O Google lançou três modelos no mesmo dia, e saber qual é qual evita que você escolha o errado.

A linha do Gemini de julho de 2026: 3.6 Flash e 3.5 Flash-Lite lançados, 3.5 Flash Cyber em piloto, 3.5 Pro atrasado, e Gemini 4 anunciado
A linha do Gemini de julho de 2026: 3.6 Flash e 3.5 Flash-Lite lançados, 3.5 Flash Cyber em piloto, 3.5 Pro atrasado, e Gemini 4 anunciado

O Gemini 3.5 Flash-Lite é o modelo mais rápido e barato da classe 3.5, a $0,30 de entrada / $2,50 de saída e 350 tokens de saída por segundo. Foi construído para trabalhos de alto volume e baixa latência, como busca agêntica, processamento de documentos e tradução, e está sendo implantado dentro da Busca do Google. O salto sobre seu antecessor é grande:

O Gemini 3.5 Flash-Lite supera o 3.1 Flash-Lite em programação agêntica de terminal e trabalho de conhecimento, conforme compartilhado pelo Google
O Gemini 3.5 Flash-Lite supera o 3.1 Flash-Lite em programação agêntica de terminal e trabalho de conhecimento, conforme compartilhado pelo Google

O Gemini 3.5 Flash Cyber é um especialista ajustado para encontrar e corrigir vulnerabilidades de segurança, funcionando dentro do agente CodeMender do Google. Dada sua natureza de uso duplo, está disponível apenas para governos e parceiros de confiança em um piloto limitado, então a maioria das equipes não terá contato direto com ele.

Então, qual dos dois modelos de propósito geral escolher, na prática? A regra geral é simples.

Uma bifurcação de decisão: Gemini 3.6 Flash para raciocínio em várias etapas, programação e tickets complexos; Gemini 3.5 Flash-Lite para alto volume, triagem simples e tradução
Uma bifurcação de decisão: Gemini 3.6 Flash para raciocínio em várias etapas, programação e tickets complexos; Gemini 3.5 Flash-Lite para alto volume, triagem simples e tradução

Recorra ao 3.6 Flash quando o trabalho exigir raciocínio real: agentes de várias etapas, programação, tickets de suporte complexos que envolvem vários sistemas. Recorra ao Flash-Lite quando estiver processando volume em que cada item é simples, como a triagem de tickets de primeira linha ou o desvio de chat em tempo real de perguntas de rotina. Construir um agente real ou um bot baseado em regras é uma decisão separada da escolha do modelo.

O elefante na sala: nenhum Gemini 3.5 Pro

O aspecto mais revelador desse lançamento é o que não estava nele. O modelo principal Pro do Google foi atualizado por último em fevereiro de 2026, e o 3.5 Pro foi anunciado em maio como "já em uso interno". Ainda não foi lançado. A Bloomberg informou que o Google sofreu atrasos internos porque o modelo teve dificuldade para atingir suas próprias metas de desempenho.

Isso está acontecendo enquanto a OpenAI lançou o GPT-5.6 e a Anthropic lançou o Claude Sonnet 5 e expandiu o Fable 5. A leitura do Google sobre o momento: manter o nível Flash de alto volume, gerador de receita, atualizado e barato enquanto o modelo principal ainda está sendo desenvolvido. Logan Kilpatrick, do DeepMind, disse que o 3.5 Pro está em testes com parceiros e deve "chegar em breve", e que a equipe já começou sua "execução de pré-treinamento mais ambiciosa até agora" para o Gemini 4. Se você precisa de um modelo de ponta hoje, nosso resumo de alternativas ao Gemini é o lugar honesto para procurar enquanto espera.

O que isso significa se você está construindo IA para suporte

Aqui é onde eu preciso ser sincero com você, porque essa é a parte que quase todo artigo de lançamento de modelo erra para equipes de suporte.

Um modelo mais barato e rápido é uma boa notícia. Mas trocar para o Gemini 3.6 Flash não te dá um agente de suporte funcional, assim como comprar um motor mais rápido não te dá um carro. Passei os últimos três anos e meio colocando IA em filas de suporte reais, e a falha que vi se repetir não é o modelo ser burro, é um bot de tom confiante dando uma resposta errada a um cliente real porque ninguém construiu as camadas em volta do modelo. O modelo é a base da pilha, não a história toda.

O modelo é a camada mais baixa de um agente de suporte, com recuperação de informações, salvaguardas, simulação e integração com o helpdesk empilhadas acima
O modelo é a camada mais baixa de um agente de suporte, com recuperação de informações, salvaguardas, simulação e integração com o helpdesk empilhadas acima

Essas camadas são o trabalho real. Recuperação de informações, para que o modelo responda a partir da sua central de ajuda e tickets passados em vez de adivinhar. Salvaguardas e escopo, para que ele faça a transferência de forma limpa em vez de inventar uma política de reembolso. Integração, para que ele consiga realmente agir dentro do seu sistema de tickets. E testes, para que você saiba como ele se comporta antes de tocar em um cliente, não depois. Essa é a mesma lacuna que separa uma API bruta de um verdadeiro software de atendimento ao cliente com IA, e é por isso que os problemas de chatbots de IA quase sempre remontam à parte estrutural, não ao modelo.

É também por isso que eu desencorajaria conectar a API bruta do Gemini ao seu helpdesk sozinho. Você estaria reconstruindo a recuperação de informações, as salvaguardas contra alucinações, a simulação e cada integração de helpdesk do zero, e depois mantendo isso à medida que os modelos mudam a cada poucas semanas. Esse é todo o argumento para uma IA de helpdesk construída para esse fim em vez de uma pilha feita por conta própria: o nível do modelo é apenas um item de custo, o sistema em volta é o produto.

Experimente o eesel

Essa é exatamente a camada que o eesel foi construído para ser. Você o conecta ao seu helpdesk existente, ele aprende com seus tickets passados e sua base de conhecimento desde o início, e funciona sobre modelos de fronteira como o Gemini, para que você obtenha os ganhos de eficiência sem conectar a API você mesmo.

Visão geral do painel do helpdesk do eesel AI
Visão geral do painel do helpdesk do eesel AI

O diferencial que mais importa aqui é aquele que o 3.6 Flash não pode te dar por conta própria: o eesel permite simular o agente contra seus tickets históricos antes que ele responda a um cliente real, então você vê a taxa de resolução e as respostas exatas que ele teria enviado. E como ele tem preço baseado no trabalho realizado, não por token, você não fica fazendo cálculo de tokens em cada ticket. Se você está avaliando modelos para construir automação de suporte, comece pelo resultado que você quer e deixe a plataforma escolher a parte estrutural. É gratuito para testar.

Frequently Asked Questions

O que é o Gemini 3.6 Flash?
O Gemini 3.6 Flash é o mais novo modelo de trabalho do Google, lançado em 21 de julho de 2026. Foi criado para velocidade e eficiência na execução de agentes de IA em produção, e usa cerca de 17% menos tokens de saída do que seu antecessor, o Gemini 3 Flash, além de custar menos por token de saída. Para uma visão mais ampla da família de modelos do Google, veja nosso resumo do Gemini AI.
Quanto custa o Gemini 3.6 Flash?
No plano pago padrão, o preço do Gemini 3.6 Flash é de $1,50 por 1M de tokens de entrada e $7,50 por 1M de tokens de saída, abaixo dos $9,00 de saída do 3.5 Flash. O modo em lote reduz ambos à metade. Também há um plano gratuito (no qual o Google pode usar seu conteúdo para melhorar seus produtos). Compare com o detalhamento completo de preços do Gemini.
O Gemini 3.6 Flash é bom para atendimento ao cliente?
O modelo é capaz o suficiente, mas o modelo é apenas a camada mais baixa de um agente de suporte. Você ainda precisa de recuperação de informações sobre sua central de ajuda, salvaguardas e testes antes de ir ao ar. Uma plataforma como software de atendimento ao cliente com IA cuida dessa camada para que você não precise conectar a API bruta você mesmo.
Como o Gemini 3.6 Flash se compara ao GPT-5.6 e ao Claude?
No próprio gráfico do Google, o 3.6 Flash lidera em uso do computador e tarefas de contexto longo, enquanto o GPT-5.6 e o Claude Sonnet 5 lideram em alguns benchmarks de programação e trabalho de conhecimento. Veja nossas comparações Gemini vs Claude e Gemini vs ChatGPT para o quadro completo.
Por que o Google não lançou o Gemini 3.5 Pro?
O Google lançou três modelos da classe Flash, mas reteve o modelo principal, o 3.5 Pro, que ainda estaria em testes com parceiros depois de, segundo relatos, não atingir as metas internas de desempenho. Se você está avaliando opções enquanto espera, nosso resumo de alternativas ao Gemini cobre o cenário.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Banner principal dos preços do Gemini 3.5 Flash-Lite em fundo azul Google
Trending

Preços do Gemini 3.5 Flash-Lite: quanto custa e para quem é indicado

O Gemini 3.5 Flash-Lite é o modelo mais barato do Google, a $0,30/$2,50 por 1M de tokens. Veja a tabela completa de preços, um exemplo de custo real e para quem ele é indicado.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Banner do Gemini 3.5 Flash-Lite sobre um fundo azul Google
Trending

Gemini 3.5 Flash-Lite: o que é, preço e para quem serve

O Gemini 3.5 Flash-Lite é o modelo 3.5 mais rápido e barato do Google, a $0,30/$2,50 por 1M de tokens. Veja o que é, quanto custa e quando usar.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber: o que é e quem pode usar

Gemini 3.5 Flash Cyber é o modelo de segurança do Google para encontrar e corrigir vulnerabilidades de código. Veja o que ele faz, como o CodeMender o utiliza e por que você provavelmente ainda não pode acessá-lo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Banner principal de preços do Gemini 3.6 Flash em fundo azul do Google
Trending

Preços do Gemini 3.6 Flash: o detalhamento completo de custos para 2026

O Gemini 3.6 Flash custa $1.50 de entrada e $7.50 de saída por 1M de tokens. Aqui está a tabela de preços completa, os custos ocultos e quanto custa realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Texto alternativo da imagem
Guides

Visão geral do Gemini Agentic Vision: Como funciona e o que significa para a IA

O Gemini Agentic Vision do Google é um novo recurso no modelo Gemini 3 Flash que muda a forma como a IA interage com imagens, transformando a visualização passiva em uma investigação ativa de várias etapas para maior precisão.

Stevia PutriStevia PutriJan 30, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis