Gemini 3.5 Flash-Lite : ce que c'est, le prix et à qui ça s'adresse

Rama Adi Nugraha
Écrit par

Rama Adi Nugraha

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 6, 2026

Vérifié par un expert
Bannière Gemini 3.5 Flash-Lite sur un fond bleu Google

Ce qu'est vraiment Gemini 3.5 Flash-Lite

Google divise sa famille Gemini en deux voies. Les modèles Pro sont le niveau supérieur pour le raisonnement difficile. Les modèles Flash sont les chevaux de trait : moins chers, plus rapides, calibrés pour des apps qui font des milliers d'appels par jour. Flash-Lite est le plus léger de ces chevaux de trait, positionné par Google pour des tâches agentiques à fort volume, la traduction et le traitement de données simple.

Pensez-y comme le modèle à utiliser pour un travail où la tâche individuelle est facile mais le volume est brutal : classer un ticket de support, extraire des champs d'un PDF, traduire un message de chat, faire une première recherche. Il gère les entrées texte, image, vidéo, audio et PDF, prend en charge le function calling, les sorties structurées, l'exécution de code, le cache et le grounding par recherche, et il embarque la même fenêtre de contexte d'environ 1M de tokens que ses grands frères (environ 1 500 pages A4 en entrée).

Ce qu'il omet délibérément vous dit à qui il s'adresse. Flash-Lite ne prend pas en charge le computer use, la génération d'images, la génération audio ni la Live API. Si votre agent doit piloter un navigateur ou générer des médias, c'est le rôle de Gemini 3.6 Flash ou d'un modèle Pro, pas de celui-ci. Flash-Lite reste étroit volontairement : lire du texte, décider, écrire du texte, le faire vite et à moindre coût.

Prix de Gemini 3.5 Flash-Lite

Voici le tableau complet. C'est la raison d'être du modèle, donc ça vaut le coup de le lire attentivement avant de l'insérer dans un tableur.

Mode de consommationEntrée (pour 1M)Sortie (raisonnement inclus)Cache de contexte
Standard$0,30$2,50$0,03
Batch (50% de réduction)$0,15$1,25$0,02
Flex$0,15$1,25$0,02
Priority$0,54$4,50$0,05
Palier gratuitGratuitGratuitGratuit

Quelques points à souligner :

  • Le palier gratuit a un piège. Sur le palier gratuit, Google utilise votre contenu pour améliorer ses produits ; sur n'importe quel palier payant, ce n'est pas le cas. Pour tout ce qui touche des données clients, ce seul point écarte le palier gratuit.
  • Le mode batch offre une réduction fixe de 50%, ce qui est le palier sur lequel la plupart des tâches à fort volume devraient tourner. Même chose pour l'inférence flex. Si le travail n'a pas besoin d'être en temps réel, vous payez $0,15/$1,25.
  • Les accès au cache sont bon marché. Un token d'entrée mis en cache coûte $0,03 pour 1M, une réduction de 90%, donc le contexte répété (votre prompt système, un fragment de connaissance) pèse à peine sur la facture.
  • Le grounding par recherche est facturé séparément. Vous avez 5 000 prompts avec grounding gratuits par mois sur toute la famille Gemini 3, puis $14 pour 1 000 requêtes de recherche.

Une note honnête d'Artificial Analysis : à $0,30/$2,50, il se classe #87 sur 152 en prix brut, donc "Lite" ne signifie pas "le moins cher du marché". Cela signifie le moins cher dans la gamme Gemini 3.5 tout en affichant un score d'intelligence de premier plan. Pour voir comment cela se positionne face aux offres Gemini grand public et aux autres paliers de l'API, notre guide des prix Gemini présente le détail complet et les prix de Gemini Workspace couvrent les offres entreprise.

La vitesse est la fonctionnalité phare

Si le prix est la raison de présélectionner Flash-Lite, la vitesse est la raison de le garder. Artificial Analysis l'a chronométré à environ 490 tokens par seconde, classé #2 sur 152 modèles testés ; Google cite 350 tokens par seconde sur son propre banc d'essai. Les deux chiffres le placent près du sommet du classement.

Tableau de benchmark de Gemini 3.5 Flash-Lite montrant les scores de codage agentique en terminal et de travail de connaissance, as shared by Google
Tableau de benchmark de Gemini 3.5 Flash-Lite montrant les scores de codage agentique en terminal et de travail de connaissance, as shared by Google

Il y a un bémol à connaître avant de promettre à un product manager des réponses en moins d'une seconde. Le délai avant le premier token se situe autour de 6 secondes en médiane, dans le haut de sa catégorie, car l'étape de raisonnement du modèle s'exécute avant que le premier token visible n'apparaisse. Donc le flux est extrêmement rapide une fois lancé, mais le démarrage peut traîner sur un prompt difficile. Pour la plupart des tâches de support (réponses courtes, classification simple), ce budget de raisonnement est faible et le retard négligeable ; pour tout ce que vous chronométrez à la milliseconde, testez d'abord avec vos propres prompts.

Face à son propre prédécesseur, le saut de génération est net sur les benchmarks de codage agentique et de travail de connaissance :

Gemini 3.5 Flash-Lite dépasse 3.1 Flash-Lite en codage agentique en terminal et en travail de connaissance, as shared by Google
Gemini 3.5 Flash-Lite dépasse 3.1 Flash-Lite en codage agentique en terminal et en travail de connaissance, as shared by Google

Flash-Lite ou 3.6 Flash ? Choisir le bon

C'est la décision que la plupart des équipes prennent mal, parce que les deux sont sortis le même jour et que les noms se ressemblent à peine. Ils sont construits pour les deux extrémités opposées du même travail. Parcourez le sélecteur ci-dessous.

Quel modèle Gemini devrais-je utiliser ?
Choisissez l'affirmation qui correspond le mieux à votre charge de travail.
Gemini 3.5 Flash-Lite. Le moins cher de la gamme 3.5 ($0,30/$2,50, moitié moins en batch) et proche du sommet du classement en vitesse. C'est exactement à ça que sert "Lite".
Gemini 3.6 Flash. C'est le cheval de trait avec computer use intégré et un raisonnement en plusieurs étapes plus solide. Flash-Lite laisse ça de côté volontairement.
Le modèle est la partie facile. Les deux modèles fonctionnent, mais il vous faut quand même de la recherche documentaire, des garde-fous et des tests autour. Continuez à lire, ou passez directement à la section ci-dessous.

La règle générale : tournez-vous vers Flash-Lite quand chaque élément est simple et que le volume est le défi, comme un premier tri de tickets, une déviation de niveau 1 ou une déviation de chat en direct de routine. Tournez-vous vers 3.6 Flash quand le travail nécessite vraiment de raisonner sur plusieurs systèmes. Construire un vrai agent IA ou un bot scripté est une décision distincte de celle du modèle.

Les autres modèles sortis ce jour-là

Flash-Lite n'est pas sorti seul. Google a lancé trois modèles le 21 juillet et en a gardé un en réserve, et connaître cette gamme vous évite de choisir le mauvais palier.

Gemini 3.6 Flash est le nouveau cheval de trait phare, à $1,50 en entrée / $7,50 en sortie, avec computer use intégré et environ 17% de tokens de sortie en moins que 3.5 Flash. Gemini 3.5 Flash Cyber est un spécialiste de la sécurité affiné pour trouver et corriger des vulnérabilités au sein de l'agent CodeMender de Google, et il n'est disponible que pour les gouvernements et les partenaires de confiance dans le cadre d'un pilote limité.

L'absence notable : le vaisseau amiral Gemini 3.5 Pro. Bloomberg a rapporté qu'il a subi des retards internes après avoir manqué ses propres objectifs de performance, et Logan Kilpatrick de DeepMind a déclaré qu'il est encore en test avec des partenaires. Le geste de Google ici est donc révélateur : garder frais le palier bon marché et à fort volume pendant que le vaisseau amiral mijote. Si vous avez besoin d'un modèle de premier plan dès aujourd'hui, notre comparatif alternatives à Gemini est le point de départ honnête, Gemini contre Claude et Gemini contre ChatGPT couvrent les face-à-face, et entreprises de service client IA cartographie les fournisseurs qui construisent sur ces modèles.

Ce que ça implique si vous construisez de l'IA pour le support

Ici, je dois être franc avec vous, car c'est la partie que tout article de lancement de modèle passe sous silence pour les équipes de support.

Un modèle plus rapide et moins cher, c'est une bonne nouvelle. Mais adopter Flash-Lite ne vous donne pas un agent de support fonctionnel, pas plus qu'un CPU plus rapide ne vous donne une application. Je passe mes journées à connecter des intégrations et des API à eesel, et sur plus de trois ans à faire tourner de l'IA sur des files de support réelles, l'échec que nous avons observé encore et encore n'est pas un modèle stupide, c'est un bot qui semble sûr de lui et qui donne une mauvaise réponse à un vrai client parce que personne n'a construit les couches autour du modèle. Le modèle est la base de la pile, pas l'ensemble.

Ces couches sont le vrai travail. La recherche documentaire, pour que le modèle réponde à partir de votre base de connaissances et des tickets passés plutôt que de deviner. Les garde-fous et le périmètre, pour qu'il transfère proprement plutôt que d'inventer une politique de remboursement. L'intégration, pour qu'il puisse agir dans votre système de tickets. Et les tests, pour que vous sachiez comment il se comporte avant qu'il ne touche un client, pas après. C'est l'écart entre une API brute et un vrai logiciel de service client IA, et c'est pourquoi les problèmes des chatbots IA se ramènent presque toujours à la plomberie, pas au modèle.

C'est aussi pourquoi je déconseillerais de connecter vous-même l'API brute de Gemini à votre helpdesk. Vous reconstruiriez de zéro la recherche documentaire, les garde-fous contre les hallucinations, la simulation et chaque intégration de helpdesk, puis vous devriez la maintenir tandis que Google sort un nouveau modèle toutes les quelques semaines (trois en une journée, cette fois). Ce rythme de renouvellement est tout l'argument pour choisir une IA de helpdesk conçue sur mesure plutôt qu'une pile bricolée maison : le palier du modèle est une ligne interchangeable, le système qui l'entoure est le produit.

Essayer eesel

C'est exactement la couche que eesel est conçu pour être. Vous le connectez à votre helpdesk existant, il apprend de vos tickets passés et de votre base de connaissances dès le départ, et il tourne sur des modèles de pointe comme Gemini, donc vous obtenez la vitesse et les économies de coûts d'un modèle comme Flash-Lite sans connecter l'API vous-même.

Vue d'ensemble du tableau de bord helpdesk d'eesel AI
Vue d'ensemble du tableau de bord helpdesk d'eesel AI

Le différenciateur qui compte le plus ici est celui que Flash-Lite ne peut pas vous donner seul : eesel vous permet de simuler l'agent sur vos tickets historiques avant qu'il ne réponde à un vrai client, donc vous voyez le taux de résolution et les réponses exactes qu'il aurait envoyées. Et comme il est tarifé selon les résultats, pas par token, vous évitez le calcul de tokens à chaque ticket. Si vous évaluez des modèles pour construire de l'automatisation du support, partez du résultat que vous voulez et laissez la plateforme choisir la plomberie. C'est gratuit à essayer.

Frequently Asked Questions

Qu'est-ce que Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite est le modèle le plus rapide et le moins cher de la gamme Gemini 3.5 de Google, lancé le 21 juillet 2026 en même temps que Gemini 3.6 Flash. Il est conçu pour des tâches à fort volume et faible latence comme la recherche agentique, le traitement de documents et la traduction. Pour une vue plus large de la famille, voir notre aperçu de Gemini AI.
Combien coûte Gemini 3.5 Flash-Lite ?
Sur le palier payant standard, le prix de Gemini 3.5 Flash-Lite est de $0,30 pour 1M de tokens en entrée et $2,50 pour 1M de tokens en sortie, avec les modes batch et flex à moitié prix ($0,15/$1,25). Il existe aussi un palier gratuit où Google peut utiliser votre contenu pour améliorer ses produits. Comparez avec le détail complet des prix de Gemini.
Gemini 3.5 Flash-Lite est-il adapté au service client ?
Pour des tâches simples à fort volume comme un premier tri de tickets, c'est un excellent choix, mais le modèle n'est que la couche la plus basse d'un agent de support. Il faut encore de la recherche documentaire sur votre centre d'aide, des garde-fous et des tests avant la mise en production. Une plateforme comme un logiciel de service client IA gère cette couche pour que vous n'ayez pas à connecter l'API brute vous-même.
Quel est le tarif de Gemini 3.5 Flash-Lite pour un usage à fort volume ?
Le mode batch offre une réduction fixe de 50% sur le tarif standard, donc les tâches à fort volume et non temps réel tournent à $0,15 en entrée / $1,25 en sortie pour 1M de tokens. Les accès au cache tombent à $0,03 pour 1M. Pour un travail exécuté des millions de fois, cet écart est toute la raison de choisir Flash-Lite plutôt que 3.6 Flash.
Gemini 3.5 Flash-Lite contre 3.6 Flash : lequel utiliser ?
Choisissez Flash-Lite quand chaque tâche est simple et que vous traitez du volume, comme le tri de tickets ou la déviation de chat en direct de routine. Choisissez 3.6 Flash quand le travail a besoin d'un vrai raisonnement en plusieurs étapes. Consultez le comparatif alternatives à Gemini si aucun des deux ne convient.
Quelle est la vitesse de Gemini 3.5 Flash-Lite ?
Artificial Analysis a mesuré environ 490 tokens de sortie par seconde, le classant #2 sur 152 modèles testés. Google cite 350 tokens par seconde sur son propre banc d'essai. Dans les deux cas, il figure parmi les modèles les plus rapides disponibles, ce qui est justement le but d'un modèle Lite. Il a en revanche un délai avant le premier token plus élevé, car le raisonnement s'exécute avant l'apparition du premier token.
Gemini 3.5 Flash-Lite prend-il en charge le computer use ?
Non. Le computer use, la génération d'images, la génération audio et la Live API ne sont pas prises en charge sur Flash-Lite. Il prend en charge le function calling, les sorties structurées, l'exécution de code, le cache et le grounding par recherche. Si vous avez besoin du computer use, c'est Gemini 3.6 Flash.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Bannière principale des tarifs de Gemini 3.5 Flash-Lite sur fond bleu Google
Trending

Tarifs de Gemini 3.5 Flash-Lite : ce qu'il coûte et à qui il s'adresse

Gemini 3.5 Flash-Lite est le modèle le moins cher de Google, à $0.30/$2.50 par million de tokens. Voici le tableau tarifaire complet, un exemple de coût réel et à qui il s'adresse.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Bannière hero de Gemini 3.6 Flash sur fond bleu Google
Trending

Gemini 3.6 Flash : ce que c'est, ce que ça coûte et à qui c'est destiné

Gemini 3.6 Flash est le nouveau modèle de travail de Google : 17 % de jetons de sortie en moins, une sortie moins chère et un contexte de 1M. Voici ce que c'est et à qui il s'adresse.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber : ce que c'est et qui peut l'utiliser

Gemini 3.5 Flash Cyber est le modèle de sécurité de Google pour trouver et corriger les vulnérabilités du code. Voici ce qu'il fait, comment CodeMender l'utilise, et pourquoi vous ne pouvez probablement pas encore y accéder.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Bannière principale des tarifs de Gemini 3.6 Flash sur un fond bleu Google
Trending

Tarifs de Gemini 3.6 Flash : le détail complet des coûts pour 2026

Gemini 3.6 Flash coûte $1.50 en entrée et $7.50 en sortie par 1M de tokens. Voici la grille tarifaire complète, les coûts cachés et ce que ça coûte réellement à faire fonctionner.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Illustration d'un modèle de contrôle de robot humanoïde, représentant Gemini Robotics 2
Trending

Gemini Robotics 2 : ce que montrent les chiffres de DeepMind

Gemini Robotics 2 lance trois modèles et un tableau de réussite par tâche où la plupart des scores restent sous 80%. Ce tableau est ce qu'il y a de plus utile dans toute cette sortie.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration dessinée à la main avec le logo de Grok, un agent de support, et des panneaux de benchmarks et de prix
Trending

Grok 4.5 : benchmarks, prix et ce que cela change pour le support

xAI vient de lancer Grok 4.5. Nous avons étudié les vrais benchmarks, le prix des tokens, et si un modèle tout juste sorti et très médiatisé change réellement quelque chose pour votre file de support.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Image alt text
Guides

Un aperçu de Gemini Agentic Vision : fonctionnement et enjeux pour l'IA

Gemini Agentic Vision de Google est une nouvelle fonctionnalité du modèle Gemini 3 Flash qui change la façon dont l'IA interagit avec les images, transformant le visionnage passif en une enquête active en plusieurs étapes pour une plus grande précision.

Stevia PutriStevia PutriJan 30, 2026
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement