Gemini 3.6 Flash : ce que c'est, ce que ça coûte et à qui c'est destiné

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 6, 2026

Vérifié par un expert
Bannière hero de Gemini 3.6 Flash sur fond bleu Google

Ce qu'est vraiment Gemini 3.6 Flash

Illustration du titre de Gemini 3.6 Flash, partagée par Google
Illustration du titre de Gemini 3.6 Flash, partagée par Google

Google répartit sa famille Gemini en deux voies. Les modèles Pro sont le niveau le plus performant pour le raisonnement et le code difficiles. Les modèles Flash sont les chevaux de trait : coût plus faible, réponses plus rapides, ajustés pour les applications en production qui font des milliers d'appels par jour. Gemini 3.6 Flash est le plus récent de ces chevaux de trait, une itération directe de 3.5 Flash façonnée par les retours des développeurs depuis la sortie d'I/O 2026.

L'argument, selon les mots mêmes de Google, est un modèle conçu « pour la vitesse, combinant intelligence de pointe et recherche et grounding supérieurs ». En pratique, cela signifie que c'est le modèle vers lequel on se tourne quand on connecte un agent IA qui doit fonctionner de façon fiable et bon marché, pas celui qu'on utilise pour résoudre un unique problème de recherche coriace. Il traite le texte, les images, la vidéo, l'audio et les PDF en entrée, prend en charge l'appel de fonctions et les sorties structurées, et inclut désormais l'utilisation de l'ordinateur comme outil intégré.

Voici le cadrage honnête que la plupart des couvertures de lancement passent sous silence : pour la grande majorité des cas d'usage en production, un modèle de classe Flash est déjà plus que suffisant. La question intéressante en 2026 n'est pas « le modèle est-il assez intelligent », c'est « combien ça coûte de faire tourner ce truc un million de fois ». C'est exactement à cette question que 3.6 Flash est censé répondre.

Le chiffre clé : plus de travail, moins de jetons

Le chiffre que Google met en avant est l'efficacité en jetons. Selon l'Artificial Analysis Index, 3.6 Flash utilise 17 % de jetons de sortie en moins que 3.5 Flash pour effectuer le même travail. Sur certains benchmarks agentiques, l'écart est encore plus grand : sur DeepSWE, Google a mesuré jusqu'à 65 % de jetons de sortie en moins, faisant passer la sortie moyenne de 276K à 97K jetons par tâche.

Gemini 3.6 Flash utilise bien moins de jetons de sortie par tâche que 3.5 Flash sur DeepSWE et l'Artificial Analysis Index, partagé par Google
Gemini 3.6 Flash utilise bien moins de jetons de sortie par tâche que 3.5 Flash sur DeepSWE et l'Artificial Analysis Index, partagé par Google

Pourquoi cela compte-t-il plus qu'un score de qualité brut ? Parce que les jetons de sortie sont le côté cher de la facture, et un agent qui parvient à sa réponse en moins d'étapes de raisonnement et d'appels d'outils est aussi plus rapide et moins susceptible de s'égarer. Google affirme que 3.6 Flash nécessite moins d'étapes de raisonnement et d'appels d'outils pour terminer des flux de travail à plusieurs étapes, avec moins de ce bavardage verbeux qui gonfle silencieusement les coûts. Quand on multiplie cela sur une file de support qui traite des dizaines de milliers de tickets par mois, l'économie qui s'accumule est toute l'histoire.

Tarification de Gemini 3.6 Flash

Voici le tableau complet. Le prix de sortie est le changement significatif : l'entrée reste à 1,50 $, la sortie descend à 7,50 $ par million de jetons.

Mode de consommationEntrée (par million)Sortie (raisonnement inclus)Cache de contexte
Standard$1.50$7.50$0.15
Batch (50 % de remise)$0.75$3.75$0.075
Flex$0.75$3.75$0.075
Priority$2.70$13.50$0.27
Palier gratuitGratuitGratuitGratuit

Quelques points à noter avant de mettre ça dans un tableau :

  • Le palier gratuit a un piège. Sur le palier gratuit, Google utilise votre contenu pour améliorer ses produits. Sur n'importe quel palier payant, ce n'est pas le cas. Pour tout ce qui touche aux données clients, cela seul écarte le palier gratuit.
  • Le grounding par recherche est facturé à part. Vous disposez de 5 000 requêtes avec grounding gratuites par mois sur toute la famille Gemini 3, puis c'est 14 $ par tranche de 1 000 requêtes de recherche, et une seule demande de client peut déclencher plusieurs requêtes facturables.
  • Le mode batch est une remise fixe de 50 % pour le travail qui n'a pas besoin d'être en temps réel.

Pour voir comment cela se positionne par rapport aux forfaits Gemini grand public et au reste des paliers de l'API, notre guide des prix de Gemini propose le détail complet, et les prix de Gemini Workspace couvrent les forfaits professionnels.

Comment il se compare à GPT-5.6 et Claude

Google a publié un tableau comparatif face à face, et il est étonnamment honnête sur les points où 3.6 Flash ne gagne pas. Il est en tête sur l'utilisation de l'ordinateur (OSWorld-Verified 83,0 %), le raisonnement sur graphiques, la compréhension de vidéos longues et la mémorisation à contexte long (54,0 % sur le test brutal GDM-MRCR à 1M de jetons, où les rivaux n'affichent rien). Mais GPT-5.6 Luna et Claude Sonnet 5 restent en tête sur plusieurs benchmarks de code et de travail de connaissance.

Tableau comparatif de Google montrant Gemini 3.6 Flash face à GPT-5.6 Luna, Grok 4.5 et Claude Sonnet 5 sur le prix et les benchmarks, partagé par Google
Tableau comparatif de Google montrant Gemini 3.6 Flash face à GPT-5.6 Luna, Grok 4.5 et Claude Sonnet 5 sur le prix et les benchmarks, partagé par Google

La lecture la plus utile est le prix par capacité. À 1,50 $/7,50 $, 3.6 Flash sous-cote largement Claude Sonnet 5 (environ 3 $/15 $ au tarif catalogue) sur la sortie, tout en se situant dans la même fourchette de qualité pour la plupart des travaux agentiques. C'est le pari que la ligne Flash est construite pour gagner : pas « le modèle le plus intelligent du classement », mais « le plus de capacité par dollar pour du travail exécuté en volume ». Si vous comparez les deux directement, on a détaillé ça dans Gemini vs Claude et Gemini vs ChatGPT.

Face à ses propres prédécesseurs, le saut de génération en génération est net sur l'ensemble des benchmarks agentiques :

Gemini 3.6 Flash dépasse 3.1 Pro et 3.5 Flash sur DeepSWE, MLE-Bench, le travail de connaissance et l'utilisation de l'ordinateur, partagé par Google
Gemini 3.6 Flash dépasse 3.1 Pro et 3.5 Flash sur DeepSWE, MLE-Bench, le travail de connaissance et l'utilisation de l'ordinateur, partagé par Google

Le code passe de 37 % à 49 % sur DeepSWE, l'ingénierie en machine learning de 49,7 % à 63,9 % sur MLE-Bench, et le travail de connaissance de 1349 à 1421 sur GDPval-AA. La date limite de connaissance avance aussi de janvier 2025 à mars 2026, ce qui compte si votre agent répond à des questions sur des événements récents.

Les deux modèles lancés en même temps

3.6 Flash n'était pas seul. Google a lancé trois modèles le même jour, et savoir lequel est lequel vous évite de choisir le mauvais.

La gamme Gemini de juillet 2026 : 3.6 Flash et 3.5 Flash-Lite lancés, 3.5 Flash Cyber en pilote, 3.5 Pro retardé, et Gemini 4 annoncé
La gamme Gemini de juillet 2026 : 3.6 Flash et 3.5 Flash-Lite lancés, 3.5 Flash Cyber en pilote, 3.5 Pro retardé, et Gemini 4 annoncé

Gemini 3.5 Flash-Lite est le modèle le plus rapide et le moins cher de la classe 3.5, à 0,30 $ en entrée / 2,50 $ en sortie et 350 jetons de sortie par seconde. Il est conçu pour des tâches à fort volume et faible latence comme la recherche agentique, le traitement de documents et la traduction, et il est en cours de déploiement dans la Recherche Google. Le bond par rapport à son prédécesseur est important :

Gemini 3.5 Flash-Lite dépasse 3.1 Flash-Lite sur le code agentique en terminal et le travail de connaissance, partagé par Google
Gemini 3.5 Flash-Lite dépasse 3.1 Flash-Lite sur le code agentique en terminal et le travail de connaissance, partagé par Google

Gemini 3.5 Flash Cyber est un modèle spécialisé ajusté pour trouver et corriger des vulnérabilités de sécurité, fonctionnant au sein de l'agent CodeMender de Google. Étant donné sa nature à double usage, il est disponible uniquement pour les gouvernements et les partenaires de confiance dans un pilote limité, donc la plupart des équipes ne le manipuleront pas directement.

Alors, lequel des deux modèles généralistes choisir réellement ? La règle de base est simple.

Un embranchement de décision : Gemini 3.6 Flash pour le raisonnement multi-étapes, le code et les tickets complexes ; Gemini 3.5 Flash-Lite pour le fort volume, le triage simple et la traduction
Un embranchement de décision : Gemini 3.6 Flash pour le raisonnement multi-étapes, le code et les tickets complexes ; Gemini 3.5 Flash-Lite pour le fort volume, le triage simple et la traduction

Choisissez 3.6 Flash quand le travail exige un vrai raisonnement : agents à plusieurs étapes, code, tickets de support complexes touchant plusieurs systèmes. Choisissez Flash-Lite quand vous traitez du volume où chaque élément est simple, comme le triage de tickets de premier niveau ou la déviation du chat en direct pour les questions courantes. Construire un vrai agent ou un bot basé sur des règles est une décision distincte du choix du modèle.

L'éléphant dans la pièce : pas de Gemini 3.5 Pro

Ce qui frappe le plus dans ce lancement, c'est ce qui n'y figurait pas. Le modèle phare Pro de Google a été mis à jour pour la dernière fois en février 2026, et 3.5 Pro avait été annoncé en mai comme « déjà utilisé en interne ». Il n'est toujours pas sorti. Bloomberg a rapporté que Google avait subi des retards internes, le modèle ayant du mal à atteindre ses propres objectifs de performance.

Cela se produit alors qu'OpenAI a déployé GPT-5.6 et qu'Anthropic a lancé Claude Sonnet 5 et étendu Fable 5. La lecture de Google du moment : garder le palier Flash à fort volume et générateur de revenus frais et bon marché tant que le modèle phare mijote encore. Logan Kilpatrick de DeepMind a déclaré que 3.5 Pro est en test avec des partenaires et devrait « arriver bientôt », et que l'équipe a déjà entamé sa « run de pré-entraînement la plus ambitieuse à ce jour » pour Gemini 4. Si vous avez besoin d'un modèle haut de gamme dès aujourd'hui, notre comparatif des alternatives à Gemini est l'endroit honnête où regarder en attendant.

Ce que cela signifie si vous construisez de l'IA pour le support

Voici où je dois être franc avec vous, car c'est la partie que presque tous les articles de lancement de modèles ratent pour les équipes de support.

Un modèle moins cher et plus rapide, c'est une bonne nouvelle. Mais passer à Gemini 3.6 Flash ne vous donne pas un agent de support fonctionnel, tout comme acheter un moteur plus rapide ne vous donne pas une voiture. Cela fait plus de trois ans que je mets de l'IA sur des files d'attente de support réelles, et l'échec que j'ai vu se répéter n'est jamais que le modèle soit bête, c'est un bot au ton assuré qui donne une mauvaise réponse à un vrai client parce que personne n'a construit les couches autour du modèle. Le modèle est le bas de la pile, pas la totalité.

Le modèle est la couche la plus basse d'un agent de support, avec la recherche documentaire, les garde-fous, la simulation et l'intégration au helpdesk empilés au-dessus
Le modèle est la couche la plus basse d'un agent de support, avec la recherche documentaire, les garde-fous, la simulation et l'intégration au helpdesk empilés au-dessus

Ces couches sont le vrai travail. La recherche documentaire, pour que le modèle réponde depuis votre centre d'aide et vos tickets passés plutôt que de deviner. Les garde-fous et le périmètre, pour qu'il transmette proprement plutôt que d'inventer une politique de remboursement. L'intégration, pour qu'il puisse réellement agir au sein de votre système de tickets. Et les tests, pour que vous sachiez comment il se comporte avant qu'il ne touche un client, pas après. C'est le même écart qui sépare une API brute d'un vrai logiciel de service client IA, et c'est pourquoi les problèmes des chatbots IA remontent presque toujours à la plomberie, pas au modèle.

C'est aussi pourquoi je déconseillerais de connecter vous-même l'API brute de Gemini à votre helpdesk. Vous devriez reconstruire la recherche documentaire, les garde-fous contre les hallucinations, la simulation et chaque intégration au helpdesk à partir de zéro, puis les maintenir à mesure que les modèles changent toutes les quelques semaines. C'est tout l'argument en faveur d'une IA de helpdesk conçue pour cela plutôt qu'une pile maison : le niveau du modèle n'est qu'une ligne de coût, le système qui l'entoure est le produit.

Essayer eesel

C'est exactement la couche que eesel est conçu pour être. Vous le branchez sur votre helpdesk existant, il apprend de vos tickets passés et de votre base de connaissances dès le départ, et il tourne sur des modèles de pointe comme Gemini, si bien que vous obtenez les gains d'efficacité sans connecter l'API vous-même.

Aperçu du tableau de bord du helpdesk eesel AI
Aperçu du tableau de bord du helpdesk eesel AI

Le facteur de différenciation qui compte le plus ici est celui que 3.6 Flash seul ne peut pas vous offrir : eesel vous permet de simuler l'agent sur vos tickets historiques avant qu'il ne réponde à un vrai client, si bien que vous voyez le taux de résolution et les réponses exactes qu'il aurait envoyées. Et comme il est tarifé selon le travail effectué, pas par jeton, vous ne faites pas de calcul de jetons à chaque ticket. Si vous évaluez des modèles pour construire de l'automatisation de support, partez du résultat que vous voulez et laissez la plateforme choisir la plomberie. C'est gratuit à essayer.

Frequently Asked Questions

Qu'est-ce que Gemini 3.6 Flash ?
Gemini 3.6 Flash est le tout dernier modèle de travail de Google, lancé le 21 juillet 2026. Il est conçu pour la rapidité et l'efficacité lors de l'exécution d'agents IA en production, et utilise environ 17 % de jetons de sortie en moins que son prédécesseur Gemini 3 Flash, tout en coûtant moins cher par jeton de sortie. Pour une vue plus large de la famille de modèles de Google, consultez notre aperçu de Gemini AI.
Combien coûte Gemini 3.6 Flash ?
Sur le palier payant standard, le prix de Gemini 3.6 Flash est de 1,50 $ par million de jetons en entrée et 7,50 $ par million de jetons en sortie, contre 9,00 $ en sortie pour 3.5 Flash. Le mode batch divise les deux par deux. Il existe aussi un palier gratuit (où Google peut utiliser votre contenu pour améliorer ses produits). Comparez avec le détail complet des prix de Gemini.
Gemini 3.6 Flash est-il adapté au service client ?
Le modèle est suffisamment performant, mais il n'est que la couche la plus basse d'un agent de support. Il faut encore de la recherche documentaire sur votre centre d'aide, des garde-fous et des tests avant la mise en production. Une plateforme comme le logiciel de service client IA se charge de cette couche pour que vous n'ayez pas à connecter vous-même l'API brute.
Comment Gemini 3.6 Flash se compare-t-il à GPT-5.6 et Claude ?
Selon le tableau publié par Google lui-même, 3.6 Flash est en tête sur l'utilisation de l'ordinateur et les tâches à contexte long, tandis que GPT-5.6 et Claude Sonnet 5 dominent certains benchmarks de code et de travail de connaissance. Consultez nos comparatifs Gemini vs Claude et Gemini vs ChatGPT pour la vue complète.
Pourquoi Google n'a-t-il pas lancé Gemini 3.5 Pro ?
Google a lancé trois modèles de classe Flash mais a retenu son modèle phare, 3.5 Pro, qui serait toujours en test avec des partenaires après n'avoir apparemment pas atteint ses objectifs de performance internes. Si vous pesez vos options en attendant, notre comparatif des alternatives à Gemini couvre le terrain.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Bannière Gemini 3.5 Flash-Lite sur un fond bleu Google
Trending

Gemini 3.5 Flash-Lite : ce que c'est, le prix et à qui ça s'adresse

Gemini 3.5 Flash-Lite est le modèle 3.5 le plus rapide et le moins cher de Google, à $0,30/$2,50 pour 1M de tokens. Voici ce que c'est, ce que ça coûte et quand l'utiliser.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber : ce que c'est et qui peut l'utiliser

Gemini 3.5 Flash Cyber est le modèle de sécurité de Google pour trouver et corriger les vulnérabilités du code. Voici ce qu'il fait, comment CodeMender l'utilise, et pourquoi vous ne pouvez probablement pas encore y accéder.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Bannière principale des tarifs de Gemini 3.5 Flash-Lite sur fond bleu Google
Trending

Tarifs de Gemini 3.5 Flash-Lite : ce qu'il coûte et à qui il s'adresse

Gemini 3.5 Flash-Lite est le modèle le moins cher de Google, à $0.30/$2.50 par million de tokens. Voici le tableau tarifaire complet, un exemple de coût réel et à qui il s'adresse.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Bannière principale des tarifs de Gemini 3.6 Flash sur un fond bleu Google
Trending

Tarifs de Gemini 3.6 Flash : le détail complet des coûts pour 2026

Gemini 3.6 Flash coûte $1.50 en entrée et $7.50 en sortie par 1M de tokens. Voici la grille tarifaire complète, les coûts cachés et ce que ça coûte réellement à faire fonctionner.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Illustration d'un modèle de contrôle de robot humanoïde, représentant Gemini Robotics 2
Trending

Gemini Robotics 2 : ce que montrent les chiffres de DeepMind

Gemini Robotics 2 lance trois modèles et un tableau de réussite par tâche où la plupart des scores restent sous 80%. Ce tableau est ce qu'il y a de plus utile dans toute cette sortie.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Image alt text
Guides

Un aperçu de Gemini Agentic Vision : fonctionnement et enjeux pour l'IA

Gemini Agentic Vision de Google est une nouvelle fonctionnalité du modèle Gemini 3 Flash qui change la façon dont l'IA interagit avec les images, transformant le visionnage passif en une enquête active en plusieurs étapes pour une plus grande précision.

Stevia PutriStevia PutriJan 30, 2026
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration comparant un petit noyau de modèle bien ordonné à un autre, bien plus grand et emmêlé, pour un avis sur Inkling-Small
Trending

Inkling-Small à l'essai : un quart de la taille, presque aussi malin

Un test concret d'Inkling-Small : il surpasse son propre modèle parent de 975B en code, avec un quart de la taille et un quart du prix, avant de s'effondrer sur la factualité. Voici ce que ce compromis coûte réellement.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement