
Ce qu'est vraiment Gemini 3.6 Flash

Google divise Gemini en paliers : Pro pour le raisonnement le plus difficile, Flash pour le travail quotidien et Flash-Lite pour les tâches à gros volume peu coûteuses. Gemini 3.6 Flash est le palier du milieu, et Google l'appelle volontairement le "workhorse". C'est le modèle vers lequel on se tourne quand on exécute quelque chose des milliers de fois par jour et que le coût et la latence comptent autant que l'intelligence brute.
Il s'appuie directement sur 3.5 Flash et sur les retours des développeurs qui l'utilisent. L'argument central est l'efficacité : moins d'étapes de raisonnement et d'appels d'outils pour terminer une tâche à plusieurs étapes, moins de digressions dans ses réponses, et un prix plus bas par token de sortie. Il arrive aussi avec une date de connaissance plus récente, avancée de janvier 2025 à mars 2026.
Sous le capot, on retrouve ce qu'on attend d'un modèle moderne : une fenêtre de contexte de 1 048 576 tokens, une entrée multimodale en texte, image, vidéo, audio et PDF, plus l'appel de fonctions, la sortie structurée, l'exécution de code, la mise en cache de contexte et le grounding par recherche. L'utilisation d'ordinateur, où le modèle pilote un navigateur ou un bureau, est désormais un outil intégré côté client en préversion.
La vraie histoire, c'est l'efficacité
Voici le chiffre qui m'a fait redresser la tête. Sur le benchmark de code DeepSWE, 3.6 Flash termine la tâche moyenne avec 97 000 tokens de sortie, là où 3.5 Flash en brûlait 276 000, une baisse d'environ 65%. Sur l'Artificial Analysis Index, plus large, l'écart est plus petit mais reste réel, passant de 28K à 23K.

Pourquoi le nombre de tokens compte-t-il plus que le prix affiché ? Parce que c'est sur les tokens de sortie que la facture s'accumule réellement, et un agent est une machine qui consomme des tokens. Un seul ticket de support traité par un agent n'est pas un seul appel au modèle, c'est une chaîne : lire le ticket, chercher dans la base de connaissances, décider, éventuellement appeler un outil, rédiger, vérifier. Chaque étape consomme des tokens. Réduire les tokens par étape réduit le coût de toute la chaîne, en plus du tarif par token déjà plus bas.
C'est aussi pourquoi le positionnement "workhorse" est honnête. Dans un vrai flux de travail d'agent, la plupart des étapes sont routinières et sont dirigées vers le modèle bon marché, tandis que seules les étapes vraiment difficiles ont besoin d'un modèle de pointe, si tant est qu'elles en aient besoin. La majeure partie de votre facture vit donc dans la voie du workhorse, et rendre cette voie 17% moins chère par token et bien plus efficace par tâche est plus important qu'un lancement plus tape-à-l'œil d'un Pro l'aurait été.

Benchmarks : où il gagne, où il perd
Face à sa propre famille, 3.6 Flash est un net progrès. Le graphique de Google montre qu'il devance à la fois 3.5 Flash et le 3.1 Pro de l'an dernier sur le code long terme, l'ingénierie ML, le travail de connaissance et l'utilisation d'ordinateur.

La question la plus utile est de savoir comment il se compare aux modèles entre lesquels on choisirait réellement. Google a publié un tableau comparatif, et il faut lui reconnaître qu'il ne cache pas les défaites.

En lisant ce tableau honnêtement, une forme claire apparaît. Sur les tests de code agentique les plus difficiles, 3.6 Flash reste derrière la pointe : 58,7% sur SWE-Bench Pro contre 64,7% pour Grok 4.5 et 63,2% pour Claude Sonnet 5, et 49% sur DeepSWE contre 67% pour GPT-5.6 Luna. Sur le travail de connaissance (GDPval-AA v2), son score Elo de 1421 se situe bien au-dessous de GPT-5.6 (1584) et Claude Sonnet 5 (1607).
Mais en se tournant vers les tâches qui correspondent au travail réel des agents, il prend la tête sur tout le tableau : 83,0% sur OSWorld-Verified (utilisation d'ordinateur), 89,4% sur le raisonnement sur graphiques CharXiv, 83,2% sur les vidéos longues LVBench, et un énorme 91,8% sur la mémorisation de contexte long GDM-MRCR, où le rival le plus proche est dans les 70%. Pour un modèle qui coûte un cinquième de Claude Sonnet 5 en sortie, c'est une très bonne performance, exactement sur les dimensions qui comptent pour le travail agentique.
Mon avis : c'est un cheval de bataille, pas un champion. Si votre travail est de l'ingénierie logicielle profonde et inédite, les modèles de pointe ont encore l'avantage. Si votre travail consiste à exécuter beaucoup de tâches ancrées, utilisant des outils, riches en documents, à moindre coût, 3.6 Flash est actuellement l'un des meilleurs choix du marché en termes de rapport qualité-prix.
Le prix en détail
Voici la vue côté budget. Tous les chiffres sont par million de tokens sur le palier Standard payant, d'après la page de tarification de l'API Gemini.
| Modèle | Entrée | Sortie | Batch (entrée / sortie) | Cache de contexte |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | $0.75 / $3.75 | $0.15/1M + $1.00/1M/hr |
| Gemini 3.5 Flash (précédent) | $1.50 | $9.00 | $0.75 / $4.50 | $0.15/1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | $0.15 / $1.25 | $0.075/1M |
Quelques points méritent d'être soulignés. Le prix d'entrée reste stable, donc toute l'économie porte sur la sortie, qui est, comme on l'a vu, ce que consomment les agents. Le mode batch offre une réduction fixe de 50% si vous pouvez tolérer un traitement asynchrone. La sortie inclut les tokens de raisonnement, donc une réponse "réfléchie" facture son brouillon comme de la sortie, une raison de plus pour laquelle le gain d'efficacité des tokens s'additionne. Et il existe un vrai palier gratuit pour tester, même si sur le palier gratuit votre contenu peut être utilisé pour améliorer les produits de Google, donc gardez vos données de production sur le palier payant.
Pour rendre ce compromis concret, entrez votre propre volume :
Avec 50 millions de tokens de sortie par mois, passer de 3.5 Flash à 3.6 Flash économise 75 $, sans même compter le gain d'efficacité des tokens en plus. Au volume réel d'un agent, cet écart s'élargit vite.
Les deux modèles compagnons
3.6 Flash n'est pas arrivé seul. Gemini 3.5 Flash-Lite est le palier économique, à 0,30 $ en entrée / 2,50 $ en sortie, et Google affirme qu'il surpasse désormais confortablement l'ancien 3.1 Flash-Lite sur le code en terminal et le travail de connaissance, tout en restant assez rapide pour des tâches à haut débit comme la classification et le routage.

Le troisième modèle, Gemini 3.5 Flash Cyber, est un spécialiste ajusté pour la cybersécurité, et il est réservé aux gouvernements et partenaires de confiance plutôt que disponible au grand public. La plupart des équipes n'y toucheront jamais, mais cela indique où Google pense qu'une bonne partie de la valeur des agents se situe à court terme.
Ce qui manque : pas de Pro, et un teaser Gemini 4
L'éléphant dans la pièce est le modèle que Google n'a pas lancé. La ligne phare Gemini Pro a été mise à jour pour la dernière fois en février 2026, Google avait teasé un 3.5 Pro en mai, puis il a glissé. Le responsable produit Logan Kilpatrick a présenté cela comme un travail en cours plutôt qu'une annulation :
"3.5 Pro is testing with partners and we hope to land it soon."
En même temps, l'équipe regarde déjà plus loin :
"We've kicked off the pre-training run for Gemini 4, our most ambitious yet."
TechCrunch a lu cette sortie comme le signe que Google maintient le rythme sur le segment bon marché et à gros volume du marché, tandis que sa réponse de pointe à GPT-5.6 et Claude Sonnet 5 est encore en chantier. C'est une lecture juste, à mon avis. Cela signifie aussi que si vous avez besoin d'un raisonnement de pointe aujourd'hui, ce n'est pas chez Gemini que vous le trouverez cette semaine.
Alors, Gemini 3.6 Flash en vaut-il la peine ?
Si vous construisez déjà sur Gemini Flash, c'est un oui facile. Il est moins cher, plus efficace et meilleur sur presque tous les benchmarks que le modèle qu'il remplace, sans réel inconvénient. Basculez et passez à autre chose.
Si vous choisissez entre les familles, il faut être honnête sur la nature du travail. Pour de l'ingénierie profonde et inédite, les modèles de pointe ont encore l'avantage. Pour du travail ancré, riche en outils, orienté documents et écrans, à grande échelle, 3.6 Flash se distingue par son rapport qualité-prix.

Le seul point sur lequel je nuancerais l'enthousiasme, c'est le raccourci que certains font entre "super modèle bon marché" et "super bot de support". Ce n'est pas la même chose, et l'écart entre les deux est précisément là où la plupart des projets de support IA échouent en silence.
Un modèle n'est pas un agent de support
Je construis les intégrations qui mettent des modèles comme celui-ci dans de vraies files de support, alors laissez-moi être direct sur ce qu'un lancement de modèle change et ne change pas pour ce travail. Le modèle est la couche de base, une commodité, au fond de la pile. Tout ce qui rend un agent IA réellement sûr à mettre face aux clients se trouve au-dessus.

J'ai vu un modèle au ton assuré donner à un client une réponse propre, bien écrite, et complètement fausse. C'est pourquoi chaque déploiement eesel est simulé sur vos tickets historiques avant de jamais répondre à une vraie personne, pour que vous voyiez la couverture et la précision par sujet et puissiez combler les lacunes d'abord. C'est aussi pourquoi nous misons sur le routage basé sur la confiance : les réponses à faible confiance deviennent des brouillons, pas des réponses automatiques.
Cette couche, c'est ce qui transforme "il existe un modèle rapide" en le fait que smava fasse tourner un agent Zendesk entièrement automatisé sur plus de 100 000 tickets en allemand par mois, ou que Gridwise résolve 73% des demandes de niveau 1 dès son premier mois. Rien de tout cela n'est le modèle. C'est l'ancrage, la simulation, les garde-fous et les intégrations avec le helpdesk qui l'entourent.
La bonne nouvelle pour quiconque utilise eesel : comme c'est agnostique au modèle, un Flash moins cher et plus efficace en coulisses est un gain gratuit. Vous obtenez les économies sans avoir à décider en quel modèle faire confiance ni à réécrire quoi que ce soit. C'est la bonne manière de profiter d'un lancement comme celui-ci, comme une amélioration de l'ingrédient, pas comme un produit qu'on déploie à l'état brut.
Essayer eesel
Gemini 3.6 Flash est un cheval de bataille vraiment bon, mais si la raison pour laquelle cela vous intéresse est "je veux automatiser ma file de support", le modèle représente les 10% faciles de ce projet. eesel est les 90% restants : il apprend de vos tickets passés et de vos documents d'aide, simule le déploiement sur votre historique réel pour que vous connaissiez les chiffres avant de passer en production, et se connecte à Zendesk, Freshdesk, Gorgias et plus de 100 outils en quelques minutes.

Comme c'est agnostique au modèle, des améliorations comme celle-ci arrivent comme un gain de coût silencieux plutôt qu'une migration. La tarification est basée sur l'usage, à 0,40 $ par conversation sans frais par siège, et il existe un essai gratuit sans carte bancaire. Si vous préférez le voir sur vos propres tickets plutôt que lire un graphique de benchmark de plus, c'est exactement à cela que sert la simulation.
Frequently Asked Questions
Combien coûte Gemini 3.6 Flash ?
Gemini 3.6 Flash est-il meilleur que 3.5 Flash ?
Gemini 3.6 Flash est-il adapté au service client ?
Qu'est devenu Gemini 3.5 Pro ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.









Comment Gemini 3.6 Flash se compare-t-il à GPT-5.6 et Claude ?