Test de Gemini 3.6 Flash : le cheval de bataille moins cher et plus rapide de Google

Rama Adi Nugraha
Écrit par

Rama Adi Nugraha

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 6, 2026

Vérifié par un expert
Illustration éditoriale pour un test de Gemini 3.6 Flash, le modèle d'IA workhorse rapide de Google

Ce qu'est vraiment Gemini 3.6 Flash

Le logo de Google Gemini, tiré de TechCrunch
Le logo de Google Gemini, tiré de TechCrunch

Google divise Gemini en paliers : Pro pour le raisonnement le plus difficile, Flash pour le travail quotidien et Flash-Lite pour les tâches à gros volume peu coûteuses. Gemini 3.6 Flash est le palier du milieu, et Google l'appelle volontairement le "workhorse". C'est le modèle vers lequel on se tourne quand on exécute quelque chose des milliers de fois par jour et que le coût et la latence comptent autant que l'intelligence brute.

Il s'appuie directement sur 3.5 Flash et sur les retours des développeurs qui l'utilisent. L'argument central est l'efficacité : moins d'étapes de raisonnement et d'appels d'outils pour terminer une tâche à plusieurs étapes, moins de digressions dans ses réponses, et un prix plus bas par token de sortie. Il arrive aussi avec une date de connaissance plus récente, avancée de janvier 2025 à mars 2026.

Sous le capot, on retrouve ce qu'on attend d'un modèle moderne : une fenêtre de contexte de 1 048 576 tokens, une entrée multimodale en texte, image, vidéo, audio et PDF, plus l'appel de fonctions, la sortie structurée, l'exécution de code, la mise en cache de contexte et le grounding par recherche. L'utilisation d'ordinateur, où le modèle pilote un navigateur ou un bureau, est désormais un outil intégré côté client en préversion.

La vraie histoire, c'est l'efficacité

Voici le chiffre qui m'a fait redresser la tête. Sur le benchmark de code DeepSWE, 3.6 Flash termine la tâche moyenne avec 97 000 tokens de sortie, là où 3.5 Flash en brûlait 276 000, une baisse d'environ 65%. Sur l'Artificial Analysis Index, plus large, l'écart est plus petit mais reste réel, passant de 28K à 23K.

Gemini 3.6 Flash utilise beaucoup moins de tokens de sortie par tâche que 3.5 Flash, tiré de 9to5Google
Gemini 3.6 Flash utilise beaucoup moins de tokens de sortie par tâche que 3.5 Flash, tiré de 9to5Google

Pourquoi le nombre de tokens compte-t-il plus que le prix affiché ? Parce que c'est sur les tokens de sortie que la facture s'accumule réellement, et un agent est une machine qui consomme des tokens. Un seul ticket de support traité par un agent n'est pas un seul appel au modèle, c'est une chaîne : lire le ticket, chercher dans la base de connaissances, décider, éventuellement appeler un outil, rédiger, vérifier. Chaque étape consomme des tokens. Réduire les tokens par étape réduit le coût de toute la chaîne, en plus du tarif par token déjà plus bas.

C'est aussi pourquoi le positionnement "workhorse" est honnête. Dans un vrai flux de travail d'agent, la plupart des étapes sont routinières et sont dirigées vers le modèle bon marché, tandis que seules les étapes vraiment difficiles ont besoin d'un modèle de pointe, si tant est qu'elles en aient besoin. La majeure partie de votre facture vit donc dans la voie du workhorse, et rendre cette voie 17% moins chère par token et bien plus efficace par tâche est plus important qu'un lancement plus tape-à-l'œil d'un Pro l'aurait été.

Comment un agent IA dirige la plupart de ses étapes vers un modèle workhorse bon marché et seulement quelques-unes vers un modèle de pointe plus coûteux
Comment un agent IA dirige la plupart de ses étapes vers un modèle workhorse bon marché et seulement quelques-unes vers un modèle de pointe plus coûteux

Benchmarks : où il gagne, où il perd

Face à sa propre famille, 3.6 Flash est un net progrès. Le graphique de Google montre qu'il devance à la fois 3.5 Flash et le 3.1 Pro de l'an dernier sur le code long terme, l'ingénierie ML, le travail de connaissance et l'utilisation d'ordinateur.

Gemini 3.6 Flash surpasse les générations précédentes sur les benchmarks agentiques, tiré de Google
Gemini 3.6 Flash surpasse les générations précédentes sur les benchmarks agentiques, tiré de Google

La question la plus utile est de savoir comment il se compare aux modèles entre lesquels on choisirait réellement. Google a publié un tableau comparatif, et il faut lui reconnaître qu'il ne cache pas les défaites.

Gemini 3.6 Flash comparé à GPT-5.6 Luna, Grok 4.5 et Claude Sonnet 5, tiré de 9to5Google
Gemini 3.6 Flash comparé à GPT-5.6 Luna, Grok 4.5 et Claude Sonnet 5, tiré de 9to5Google

En lisant ce tableau honnêtement, une forme claire apparaît. Sur les tests de code agentique les plus difficiles, 3.6 Flash reste derrière la pointe : 58,7% sur SWE-Bench Pro contre 64,7% pour Grok 4.5 et 63,2% pour Claude Sonnet 5, et 49% sur DeepSWE contre 67% pour GPT-5.6 Luna. Sur le travail de connaissance (GDPval-AA v2), son score Elo de 1421 se situe bien au-dessous de GPT-5.6 (1584) et Claude Sonnet 5 (1607).

Mais en se tournant vers les tâches qui correspondent au travail réel des agents, il prend la tête sur tout le tableau : 83,0% sur OSWorld-Verified (utilisation d'ordinateur), 89,4% sur le raisonnement sur graphiques CharXiv, 83,2% sur les vidéos longues LVBench, et un énorme 91,8% sur la mémorisation de contexte long GDM-MRCR, où le rival le plus proche est dans les 70%. Pour un modèle qui coûte un cinquième de Claude Sonnet 5 en sortie, c'est une très bonne performance, exactement sur les dimensions qui comptent pour le travail agentique.

Mon avis : c'est un cheval de bataille, pas un champion. Si votre travail est de l'ingénierie logicielle profonde et inédite, les modèles de pointe ont encore l'avantage. Si votre travail consiste à exécuter beaucoup de tâches ancrées, utilisant des outils, riches en documents, à moindre coût, 3.6 Flash est actuellement l'un des meilleurs choix du marché en termes de rapport qualité-prix.

Le prix en détail

Voici la vue côté budget. Tous les chiffres sont par million de tokens sur le palier Standard payant, d'après la page de tarification de l'API Gemini.

ModèleEntréeSortieBatch (entrée / sortie)Cache de contexte
Gemini 3.6 Flash$1.50$7.50$0.75 / $3.75$0.15/1M + $1.00/1M/hr
Gemini 3.5 Flash (précédent)$1.50$9.00$0.75 / $4.50$0.15/1M
Gemini 3.5 Flash-Lite$0.30$2.50$0.15 / $1.25$0.075/1M

Quelques points méritent d'être soulignés. Le prix d'entrée reste stable, donc toute l'économie porte sur la sortie, qui est, comme on l'a vu, ce que consomment les agents. Le mode batch offre une réduction fixe de 50% si vous pouvez tolérer un traitement asynchrone. La sortie inclut les tokens de raisonnement, donc une réponse "réfléchie" facture son brouillon comme de la sortie, une raison de plus pour laquelle le gain d'efficacité des tokens s'additionne. Et il existe un vrai palier gratuit pour tester, même si sur le palier gratuit votre contenu peut être utilisé pour améliorer les produits de Google, donc gardez vos données de production sur le palier payant.

Pour rendre ce compromis concret, entrez votre propre volume :

Avec 50 millions de tokens de sortie par mois, passer de 3.5 Flash à 3.6 Flash économise 75 $, sans même compter le gain d'efficacité des tokens en plus. Au volume réel d'un agent, cet écart s'élargit vite.

Les deux modèles compagnons

3.6 Flash n'est pas arrivé seul. Gemini 3.5 Flash-Lite est le palier économique, à 0,30 $ en entrée / 2,50 $ en sortie, et Google affirme qu'il surpasse désormais confortablement l'ancien 3.1 Flash-Lite sur le code en terminal et le travail de connaissance, tout en restant assez rapide pour des tâches à haut débit comme la classification et le routage.

Benchmarks de Gemini 3.5 Flash-Lite face à 3.1 Flash-Lite, tiré de Google
Benchmarks de Gemini 3.5 Flash-Lite face à 3.1 Flash-Lite, tiré de Google

Le troisième modèle, Gemini 3.5 Flash Cyber, est un spécialiste ajusté pour la cybersécurité, et il est réservé aux gouvernements et partenaires de confiance plutôt que disponible au grand public. La plupart des équipes n'y toucheront jamais, mais cela indique où Google pense qu'une bonne partie de la valeur des agents se situe à court terme.

Ce qui manque : pas de Pro, et un teaser Gemini 4

L'éléphant dans la pièce est le modèle que Google n'a pas lancé. La ligne phare Gemini Pro a été mise à jour pour la dernière fois en février 2026, Google avait teasé un 3.5 Pro en mai, puis il a glissé. Le responsable produit Logan Kilpatrick a présenté cela comme un travail en cours plutôt qu'une annulation :

"3.5 Pro is testing with partners and we hope to land it soon."

En même temps, l'équipe regarde déjà plus loin :

"We've kicked off the pre-training run for Gemini 4, our most ambitious yet."

TechCrunch a lu cette sortie comme le signe que Google maintient le rythme sur le segment bon marché et à gros volume du marché, tandis que sa réponse de pointe à GPT-5.6 et Claude Sonnet 5 est encore en chantier. C'est une lecture juste, à mon avis. Cela signifie aussi que si vous avez besoin d'un raisonnement de pointe aujourd'hui, ce n'est pas chez Gemini que vous le trouverez cette semaine.

Alors, Gemini 3.6 Flash en vaut-il la peine ?

Si vous construisez déjà sur Gemini Flash, c'est un oui facile. Il est moins cher, plus efficace et meilleur sur presque tous les benchmarks que le modèle qu'il remplace, sans réel inconvénient. Basculez et passez à autre chose.

Si vous choisissez entre les familles, il faut être honnête sur la nature du travail. Pour de l'ingénierie profonde et inédite, les modèles de pointe ont encore l'avantage. Pour du travail ancré, riche en outils, orienté documents et écrans, à grande échelle, 3.6 Flash se distingue par son rapport qualité-prix.

Une carte de positionnement des modèles Gemini de Google selon le coût et la profondeur de raisonnement, avec 3.6 Flash au point idéal
Une carte de positionnement des modèles Gemini de Google selon le coût et la profondeur de raisonnement, avec 3.6 Flash au point idéal

Le seul point sur lequel je nuancerais l'enthousiasme, c'est le raccourci que certains font entre "super modèle bon marché" et "super bot de support". Ce n'est pas la même chose, et l'écart entre les deux est précisément là où la plupart des projets de support IA échouent en silence.

Un modèle n'est pas un agent de support

Je construis les intégrations qui mettent des modèles comme celui-ci dans de vraies files de support, alors laissez-moi être direct sur ce qu'un lancement de modèle change et ne change pas pour ce travail. Le modèle est la couche de base, une commodité, au fond de la pile. Tout ce qui rend un agent IA réellement sûr à mettre face aux clients se trouve au-dessus.

Ce qui transforme un modèle de fondation brut en agent de support déployé : ancrage, simulation, garde-fous et intégrations
Ce qui transforme un modèle de fondation brut en agent de support déployé : ancrage, simulation, garde-fous et intégrations

J'ai vu un modèle au ton assuré donner à un client une réponse propre, bien écrite, et complètement fausse. C'est pourquoi chaque déploiement eesel est simulé sur vos tickets historiques avant de jamais répondre à une vraie personne, pour que vous voyiez la couverture et la précision par sujet et puissiez combler les lacunes d'abord. C'est aussi pourquoi nous misons sur le routage basé sur la confiance : les réponses à faible confiance deviennent des brouillons, pas des réponses automatiques.

Cette couche, c'est ce qui transforme "il existe un modèle rapide" en le fait que smava fasse tourner un agent Zendesk entièrement automatisé sur plus de 100 000 tickets en allemand par mois, ou que Gridwise résolve 73% des demandes de niveau 1 dès son premier mois. Rien de tout cela n'est le modèle. C'est l'ancrage, la simulation, les garde-fous et les intégrations avec le helpdesk qui l'entourent.

La bonne nouvelle pour quiconque utilise eesel : comme c'est agnostique au modèle, un Flash moins cher et plus efficace en coulisses est un gain gratuit. Vous obtenez les économies sans avoir à décider en quel modèle faire confiance ni à réécrire quoi que ce soit. C'est la bonne manière de profiter d'un lancement comme celui-ci, comme une amélioration de l'ingrédient, pas comme un produit qu'on déploie à l'état brut.

Essayer eesel

Gemini 3.6 Flash est un cheval de bataille vraiment bon, mais si la raison pour laquelle cela vous intéresse est "je veux automatiser ma file de support", le modèle représente les 10% faciles de ce projet. eesel est les 90% restants : il apprend de vos tickets passés et de vos documents d'aide, simule le déploiement sur votre historique réel pour que vous connaissiez les chiffres avant de passer en production, et se connecte à Zendesk, Freshdesk, Gorgias et plus de 100 outils en quelques minutes.

Vue d'ensemble du tableau de bord du helpdesk IA d'eesel
Vue d'ensemble du tableau de bord du helpdesk IA d'eesel

Comme c'est agnostique au modèle, des améliorations comme celle-ci arrivent comme un gain de coût silencieux plutôt qu'une migration. La tarification est basée sur l'usage, à 0,40 $ par conversation sans frais par siège, et il existe un essai gratuit sans carte bancaire. Si vous préférez le voir sur vos propres tickets plutôt que lire un graphique de benchmark de plus, c'est exactement à cela que sert la simulation.

Frequently Asked Questions

Combien coûte Gemini 3.6 Flash ?
Sur le palier Standard payant, Gemini 3.6 Flash coûte 1,50 $ par million de tokens en entrée et 7,50 $ par million de tokens en sortie. Le prix d'entrée est inchangé par rapport à 3.5 Flash, mais celui de sortie baisse par rapport à 9,00 $, soit une réduction d'environ 17%. Le mode batch réduit les deux prix de moitié, et il existe un palier gratuit pour tester. Pour l'option la moins chère, Gemini 3.5 Flash-Lite coûte 0,30 $ en entrée / 2,50 $ en sortie. Si vous préférez payer par ticket résolu plutôt que par token, la tarification à l'usage d'eesel démarre à 0,40 $ par conversation.
Gemini 3.6 Flash est-il meilleur que 3.5 Flash ?
Oui, sur presque tous les axes. Selon les propres chiffres de Google, il utilise 17% de tokens de sortie en moins, passe de 37% à 49% sur DeepSWE et de 49,7% à 63,9% sur MLE-Bench, et coûte moins par token de sortie. C'est une mise à niveau évidente pour quiconque utilise déjà Gemini.
Gemini 3.6 Flash est-il adapté au service client ?
Un modèle rapide et peu coûteux est un bon ingrédient, mais un modèle brut n'est pas un agent de support à lui seul. Il doit encore être ancré dans vos documents d'aide et vos tickets passés, testé avant sa mise en production, et connecté à votre helpdesk. C'est la couche que gère un agent IA pour helpdesk, et c'est pourquoi nous simulons chaque déploiement sur des tickets historiques au préalable.
Comment Gemini 3.6 Flash se compare-t-il à GPT-5.6 et Claude ?
Sur les benchmarks de code et de travail de connaissance les plus difficiles, il reste derrière GPT-5.6 d'OpenAI et Claude Sonnet 5, mais il les devance tous les deux sur l'utilisation d'ordinateur, le raisonnement sur graphiques et la mémorisation de contexte long, et il est bien moins cher que Sonnet 5. Consultez notre comparatif Claude vs ChatGPT pour une vue d'ensemble des modèles de pointe.
Qu'est devenu Gemini 3.5 Pro ?
Google a lancé Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber, mais pas de 3.5 Pro. Le responsable produit Logan Kilpatrick a déclaré que Pro est en cours de test avec des partenaires après avoir apparemment manqué des objectifs internes, tandis que l'équipe a déjà entamé le pré-entraînement de Gemini 4.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration pour une sélection des meilleures alternatives à Google Gemini 3.6 Flash en 2026
AI

Les 6 meilleures alternatives à Gemini 3.6 Flash en 2026

Les meilleures alternatives à Gemini 3.6 Flash en 2026, avec de vrais prix et benchmarks : GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite et plus encore.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Illustration d'une tuile du modèle Kimi K3 à côté d'une rangée de cartes de paliers tarifaires, en bleu Kimi
AI

Tarifs de Kimi K3 : ce que coûte vraiment le modèle de pointe de Moonshot

Les tarifs de Kimi K3, décryptés : le tarif API de 3/15 $, les paliers d'application de 19 à 199 $, comment la remise de 90% sur le cache change la donne, et comment il se compare à Claude, GPT et DeepSeek.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 17, 2026
Deux personnes en conversation avec des formes d'onde vocales entre elles et le logo Grok au-dessus
AI

Grok Voice Think Fast 2.0 : rapide, précis, mais plafonné

Un test pratique de Grok Voice Think Fast 2.0 : la réalité des benchmarks, les particularités de l'API, et le plafond de 10 sessions qui décide si vous pouvez le déployer en production.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Bannière illustrée présentant un décryptage des tarifs Flowith, montrant les paliers d'abonnement et un modèle de facturation basé sur les crédits
AI

Tarifs Flowith (2026) : forfaits, crédits et coût réel

Un décryptage complet des tarifs Flowith : les quatre paliers basés sur les crédits, ce qu'achète réellement un crédit, les pièges qui n'apparaissent pas sur la page tarifs, et à qui s'adresse chaque forfait.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration d'un canevas IA à embranchements générant des images, des diapositives et du texte
AI

Avis Flowith : le canevas d'agent IA en vaut-il la peine ? (2026)

Un avis concret sur Flowith : ce que font vraiment le canevas IA à embranchements et Agent Neo, ce que coûte Flowith en crédits, et qui devrait passer son tour.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Bannière illustrée pour un guide sur Flowith, l'espace de travail créatif basé sur un agent IA construit sur un canevas infini de nœuds
AI

Qu'est-ce que Flowith ? Le canevas d'agent IA, Agent Neo et les tarifs

Flowith est un agent IA qui travaille sur un canevas infini plutôt que dans une fenêtre de chat. Voici ce que fait vraiment Agent Neo, son prix, et ce à quoi il sert.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration éditoriale d'ouverture pour Muse Image de Meta, un modèle de génération d'images agentique, en bleu Meta
AI

Muse Image de Meta : ce qu'il fait et ce qu'il vaut vraiment

Muse Image de Meta est un modèle d'image agentique et gratuit qui parcourt le web et écrit du code en pleine génération. Voici ce qu'il sait faire, et ce qu'il vaut vraiment.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

Qu'est-ce que Buzz ? L'espace de travail IA de Jack Dorsey expliqué

Buzz est la nouvelle appli de chat d'équipe open source de Jack Dorsey, où humains et agents IA partagent les mêmes canaux. Voici ce qu'elle est, à qui elle s'adresse, et le hic.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Illustration d'un canevas de créateur d'agent IA sans code avec des nœuds de workflow
AI

Les 7 meilleurs créateurs d'agents IA sans code en 2026

J'ai testé les meilleurs créateurs d'agents IA sans code pour les équipes support en 2026, de Botpress à Copilot Studio, et j'ai classé lequel correspond vraiment à votre configuration.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement