
Ce qu'est vraiment Gemini 3.5 Flash-Lite
Google divise sa famille Gemini en deux voies. Les modèles Pro sont le niveau supérieur pour le raisonnement difficile. Les modèles Flash sont les chevaux de trait : moins chers, plus rapides, calibrés pour des apps qui font des milliers d'appels par jour. Flash-Lite est le plus léger de ces chevaux de trait, positionné par Google pour des tâches agentiques à fort volume, la traduction et le traitement de données simple.
Pensez-y comme le modèle à utiliser pour un travail où la tâche individuelle est facile mais le volume est brutal : classer un ticket de support, extraire des champs d'un PDF, traduire un message de chat, faire une première recherche. Il gère les entrées texte, image, vidéo, audio et PDF, prend en charge le function calling, les sorties structurées, l'exécution de code, le cache et le grounding par recherche, et il embarque la même fenêtre de contexte d'environ 1M de tokens que ses grands frères (environ 1 500 pages A4 en entrée).
Ce qu'il omet délibérément vous dit à qui il s'adresse. Flash-Lite ne prend pas en charge le computer use, la génération d'images, la génération audio ni la Live API. Si votre agent doit piloter un navigateur ou générer des médias, c'est le rôle de Gemini 3.6 Flash ou d'un modèle Pro, pas de celui-ci. Flash-Lite reste étroit volontairement : lire du texte, décider, écrire du texte, le faire vite et à moindre coût.
Prix de Gemini 3.5 Flash-Lite
Voici le tableau complet. C'est la raison d'être du modèle, donc ça vaut le coup de le lire attentivement avant de l'insérer dans un tableur.
| Mode de consommation | Entrée (pour 1M) | Sortie (raisonnement inclus) | Cache de contexte |
|---|---|---|---|
| Standard | $0,30 | $2,50 | $0,03 |
| Batch (50% de réduction) | $0,15 | $1,25 | $0,02 |
| Flex | $0,15 | $1,25 | $0,02 |
| Priority | $0,54 | $4,50 | $0,05 |
| Palier gratuit | Gratuit | Gratuit | Gratuit |
Quelques points à souligner :
- Le palier gratuit a un piège. Sur le palier gratuit, Google utilise votre contenu pour améliorer ses produits ; sur n'importe quel palier payant, ce n'est pas le cas. Pour tout ce qui touche des données clients, ce seul point écarte le palier gratuit.
- Le mode batch offre une réduction fixe de 50%, ce qui est le palier sur lequel la plupart des tâches à fort volume devraient tourner. Même chose pour l'inférence flex. Si le travail n'a pas besoin d'être en temps réel, vous payez $0,15/$1,25.
- Les accès au cache sont bon marché. Un token d'entrée mis en cache coûte $0,03 pour 1M, une réduction de 90%, donc le contexte répété (votre prompt système, un fragment de connaissance) pèse à peine sur la facture.
- Le grounding par recherche est facturé séparément. Vous avez 5 000 prompts avec grounding gratuits par mois sur toute la famille Gemini 3, puis $14 pour 1 000 requêtes de recherche.
Une note honnête d'Artificial Analysis : à $0,30/$2,50, il se classe #87 sur 152 en prix brut, donc "Lite" ne signifie pas "le moins cher du marché". Cela signifie le moins cher dans la gamme Gemini 3.5 tout en affichant un score d'intelligence de premier plan. Pour voir comment cela se positionne face aux offres Gemini grand public et aux autres paliers de l'API, notre guide des prix Gemini présente le détail complet et les prix de Gemini Workspace couvrent les offres entreprise.
La vitesse est la fonctionnalité phare
Si le prix est la raison de présélectionner Flash-Lite, la vitesse est la raison de le garder. Artificial Analysis l'a chronométré à environ 490 tokens par seconde, classé #2 sur 152 modèles testés ; Google cite 350 tokens par seconde sur son propre banc d'essai. Les deux chiffres le placent près du sommet du classement.

Il y a un bémol à connaître avant de promettre à un product manager des réponses en moins d'une seconde. Le délai avant le premier token se situe autour de 6 secondes en médiane, dans le haut de sa catégorie, car l'étape de raisonnement du modèle s'exécute avant que le premier token visible n'apparaisse. Donc le flux est extrêmement rapide une fois lancé, mais le démarrage peut traîner sur un prompt difficile. Pour la plupart des tâches de support (réponses courtes, classification simple), ce budget de raisonnement est faible et le retard négligeable ; pour tout ce que vous chronométrez à la milliseconde, testez d'abord avec vos propres prompts.
Face à son propre prédécesseur, le saut de génération est net sur les benchmarks de codage agentique et de travail de connaissance :

Flash-Lite ou 3.6 Flash ? Choisir le bon
C'est la décision que la plupart des équipes prennent mal, parce que les deux sont sortis le même jour et que les noms se ressemblent à peine. Ils sont construits pour les deux extrémités opposées du même travail. Parcourez le sélecteur ci-dessous.
La règle générale : tournez-vous vers Flash-Lite quand chaque élément est simple et que le volume est le défi, comme un premier tri de tickets, une déviation de niveau 1 ou une déviation de chat en direct de routine. Tournez-vous vers 3.6 Flash quand le travail nécessite vraiment de raisonner sur plusieurs systèmes. Construire un vrai agent IA ou un bot scripté est une décision distincte de celle du modèle.
Les autres modèles sortis ce jour-là
Flash-Lite n'est pas sorti seul. Google a lancé trois modèles le 21 juillet et en a gardé un en réserve, et connaître cette gamme vous évite de choisir le mauvais palier.
Gemini 3.6 Flash est le nouveau cheval de trait phare, à $1,50 en entrée / $7,50 en sortie, avec computer use intégré et environ 17% de tokens de sortie en moins que 3.5 Flash. Gemini 3.5 Flash Cyber est un spécialiste de la sécurité affiné pour trouver et corriger des vulnérabilités au sein de l'agent CodeMender de Google, et il n'est disponible que pour les gouvernements et les partenaires de confiance dans le cadre d'un pilote limité.
L'absence notable : le vaisseau amiral Gemini 3.5 Pro. Bloomberg a rapporté qu'il a subi des retards internes après avoir manqué ses propres objectifs de performance, et Logan Kilpatrick de DeepMind a déclaré qu'il est encore en test avec des partenaires. Le geste de Google ici est donc révélateur : garder frais le palier bon marché et à fort volume pendant que le vaisseau amiral mijote. Si vous avez besoin d'un modèle de premier plan dès aujourd'hui, notre comparatif alternatives à Gemini est le point de départ honnête, Gemini contre Claude et Gemini contre ChatGPT couvrent les face-à-face, et entreprises de service client IA cartographie les fournisseurs qui construisent sur ces modèles.
Ce que ça implique si vous construisez de l'IA pour le support
Ici, je dois être franc avec vous, car c'est la partie que tout article de lancement de modèle passe sous silence pour les équipes de support.
Un modèle plus rapide et moins cher, c'est une bonne nouvelle. Mais adopter Flash-Lite ne vous donne pas un agent de support fonctionnel, pas plus qu'un CPU plus rapide ne vous donne une application. Je passe mes journées à connecter des intégrations et des API à eesel, et sur plus de trois ans à faire tourner de l'IA sur des files de support réelles, l'échec que nous avons observé encore et encore n'est pas un modèle stupide, c'est un bot qui semble sûr de lui et qui donne une mauvaise réponse à un vrai client parce que personne n'a construit les couches autour du modèle. Le modèle est la base de la pile, pas l'ensemble.
Ces couches sont le vrai travail. La recherche documentaire, pour que le modèle réponde à partir de votre base de connaissances et des tickets passés plutôt que de deviner. Les garde-fous et le périmètre, pour qu'il transfère proprement plutôt que d'inventer une politique de remboursement. L'intégration, pour qu'il puisse agir dans votre système de tickets. Et les tests, pour que vous sachiez comment il se comporte avant qu'il ne touche un client, pas après. C'est l'écart entre une API brute et un vrai logiciel de service client IA, et c'est pourquoi les problèmes des chatbots IA se ramènent presque toujours à la plomberie, pas au modèle.
C'est aussi pourquoi je déconseillerais de connecter vous-même l'API brute de Gemini à votre helpdesk. Vous reconstruiriez de zéro la recherche documentaire, les garde-fous contre les hallucinations, la simulation et chaque intégration de helpdesk, puis vous devriez la maintenir tandis que Google sort un nouveau modèle toutes les quelques semaines (trois en une journée, cette fois). Ce rythme de renouvellement est tout l'argument pour choisir une IA de helpdesk conçue sur mesure plutôt qu'une pile bricolée maison : le palier du modèle est une ligne interchangeable, le système qui l'entoure est le produit.
Essayer eesel
C'est exactement la couche que eesel est conçu pour être. Vous le connectez à votre helpdesk existant, il apprend de vos tickets passés et de votre base de connaissances dès le départ, et il tourne sur des modèles de pointe comme Gemini, donc vous obtenez la vitesse et les économies de coûts d'un modèle comme Flash-Lite sans connecter l'API vous-même.

Le différenciateur qui compte le plus ici est celui que Flash-Lite ne peut pas vous donner seul : eesel vous permet de simuler l'agent sur vos tickets historiques avant qu'il ne réponde à un vrai client, donc vous voyez le taux de résolution et les réponses exactes qu'il aurait envoyées. Et comme il est tarifé selon les résultats, pas par token, vous évitez le calcul de tokens à chaque ticket. Si vous évaluez des modèles pour construire de l'automatisation du support, partez du résultat que vous voulez et laissez la plateforme choisir la plomberie. C'est gratuit à essayer.
Frequently Asked Questions
Qu'est-ce que Gemini 3.5 Flash-Lite ?
Combien coûte Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite est-il adapté au service client ?
Quel est le tarif de Gemini 3.5 Flash-Lite pour un usage à fort volume ?
Gemini 3.5 Flash-Lite contre 3.6 Flash : lequel utiliser ?
Quelle est la vitesse de Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite prend-il en charge le computer use ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







