Tarifs de Gemini 3.5 Flash-Lite : ce qu'il coûte et à qui il s'adresse

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 22, 2026

Vérifié par un expert
Bannière principale des tarifs de Gemini 3.5 Flash-Lite sur fond bleu Google

Ce qu'est vraiment Gemini 3.5 Flash-Lite

Google divise sa famille Gemini en deux voies. Les modèles Pro sont le niveau supérieur pour le raisonnement difficile. Les modèles Flash sont les chevaux de trait : moins chers, plus rapides, calibrés pour des applications de production qui font des milliers d'appels par jour. Flash-Lite est le plus léger de tous, positionné par Google pour les tâches agentiques à fort volume, la traduction et le traitement simple de données.

Les spécifications sont étonnamment généreuses pour un modèle économique. Il accepte le texte, l'image, la vidéo, l'audio et le PDF en entrée, dispose d'une fenêtre de contexte de 1 048 576 tokens (~1M de tokens, soit environ 1 500 pages), et prend en charge le raisonnement, l'appel de fonctions, les sorties structurées, l'exécution de code et l'ancrage par recherche. Il ne prend pas en charge l'utilisation d'ordinateur, la génération d'image ou d'audio, ni la Live API : c'est un moteur texte-vers-texte pour le volume, pas un modèle qui fait tout.

Sur Artificial Analysis, il obtient un Intelligence Index de 36 (#12 sur 152 modèles, bien au-dessus de la moyenne de sa catégorie) tout en tournant à environ 490 tokens de sortie par seconde, le deuxième modèle le plus rapide qu'ils aient mesuré. Pour un modèle aussi peu cher, cette combinaison intelligence-prix est tout l'argument de vente.

Tarifs de Gemini 3.5 Flash-Lite

Voici le tableau complet. Les prix sont par million de tokens sur les paliers payants, et la sortie inclut les tokens de raisonnement.

ModeEntrée (par million)Sortie (raisonnement inclus)Mise en cache du contexte
Standard$0.30$2.50$0.03
Batch (50 % de réduction)$0.15$1.25$0.02
Flex$0.15$1.25$0.02
Priority$0.54$4.50$0.05
Palier gratuitGratuitGratuitNon disponible

Quelques points à signaler avant de le mettre dans un tableur :

  • Le palier gratuit entraîne le modèle sur vos données. Sur le palier gratuit, Google utilise votre contenu pour améliorer ses produits ; sur les paliers payants, non. Pour tout ce qui touche des données clients, cela suffit à exclure le palier gratuit.
  • Le mode batch, c'est 50 % de réduction fixe. Si le travail n'a pas besoin d'être en temps réel (traitement de documents la nuit, traduction en masse), Batch fait tomber le prix à $0.15 / $1.25.
  • L'ancrage par recherche est facturé séparément. Vous avez 5 000 prompts ancrés par mois gratuits sur l'ensemble de la famille Gemini 3, puis c'est $14 pour 1 000 requêtes de recherche, et une seule requête API peut déclencher plusieurs requêtes de recherche facturables.

Pour voir comment cela se positionne face aux forfaits Gemini grand public et au reste de l'API, notre guide des tarifs de Gemini offre le décryptage complet, et les tarifs de Gemini Workspace couvrent les forfaits entreprise.

Ce que ça coûte vraiment

Les prix affichés ne veulent pas dire grand-chose tant qu'on n'a pas calculé un chiffre réel. Disons que vous utilisez Flash-Lite pour le tri initial des tickets sur 50 000 tickets par mois, avec environ 1 000 tokens en entrée et 200 tokens en sortie par ticket.

Un exemple de coût réel pour Gemini 3.5 Flash-Lite : 50 000 tickets par mois représentent environ $40 de coût en tokens
Un exemple de coût réel pour Gemini 3.5 Flash-Lite : 50 000 tickets par mois représentent environ $40 de coût en tokens

Cela représente 50M de tokens en entrée ($15) et 10M de tokens en sortie ($25), soit environ $40 par mois de coût de modèle brut. Faites tourner le même volume sur 3.6 Flash et vous vous rapprochez de $150. Cet écart, c'est exactement la raison d'être de Flash-Lite, et pourquoi choisir le bon palier de modèle compte plus que ce que la plupart des équipes réalisent quand elles budgètent leur IA de support ou tentent de réduire les coûts de support grâce à l'automatisation.

Comment Flash-Lite se compare

Google a publié un tableau comparatif, et la ligne des prix est ce qui compte le plus. À $0.30 / $2.50, Flash-Lite bat GPT-5.4 mini ($0.75 / $4.50) et Claude Haiku 4.5 ($1.00 / $5.00) tout en restant dans la même tranche de qualité globale sur la plupart des benchmarks agentiques.

Le tableau comparatif de Google montrant Gemini 3.5 Flash-Lite face à 3.1 Flash-Lite, GPT-5.4 mini et Claude Haiku 4.5 sur le prix et les benchmarks, as taken from Google via 9to5Google
Le tableau comparatif de Google montrant Gemini 3.5 Flash-Lite face à 3.1 Flash-Lite, GPT-5.4 mini et Claude Haiku 4.5 sur le prix et les benchmarks, as taken from Google via 9to5Google

Lisez ce tableau avec une réserve : GPT-5.4 mini devance légèrement sur quelques scores de code et de connaissances. Mais sur le rapport prix-capacité pour le travail à fort volume, Flash-Lite est difficile à battre, et il l'emporte franchement sur le rappel de contexte long. Le seul chiffre qui ne joue pas en sa faveur, c'est la latence : le temps jusqu'au premier token tourne autour de 6 secondes (temps de raisonnement inclus), plutôt élevé pour sa catégorie, donc il convient mieux aux tâches en arrière-plan qu'à un chat en direct réactif.

Face à son propre prédécesseur, le saut générationnel est net :

Gemini 3.5 Flash-Lite bat 3.1 Flash-Lite sur le codage agentique en terminal (54 % contre 31 %) et le travail de connaissance (1140 contre 642), as taken from Google via 9to5Google
Gemini 3.5 Flash-Lite bat 3.1 Flash-Lite sur le codage agentique en terminal (54 % contre 31 %) et le travail de connaissance (1140 contre 642), as taken from Google via 9to5Google

Le codage agentique en terminal passe de 31 % à 54 % sur Terminal-Bench 2.1, et le travail de connaissance fait presque le doublé, de 642 à 1140 sur GDPval-AA v2. Google affirme même qu'il surpasse l'ancien 3 Flash sur SWE-Bench Pro et les tâches d'utilisation d'ordinateur, donc vous ne sacrifiez pas grand-chose en qualité pour ce prix bas. Si vous mettez Gemini en balance avec le reste du marché, nous avons détaillé cela dans Gemini vs Claude, Gemini vs ChatGPT et le tour d'horizon plus large des alternatives à Gemini.

Quel modèle choisir réellement ?

Flash-Lite est sorti en même temps que Gemini 3.6 Flash, et se tromper de modèle soit gaspille de l'argent, soit met en production un bot dépassé. La règle générale est simple.

Une bifurcation de décision : choisir Gemini 3.6 Flash pour le raisonnement en plusieurs étapes, le code et les tickets complexes ; choisir Gemini 3.5 Flash-Lite pour le tri à fort volume, la traduction et la déviation
Une bifurcation de décision : choisir Gemini 3.6 Flash pour le raisonnement en plusieurs étapes, le code et les tickets complexes ; choisir Gemini 3.5 Flash-Lite pour le tri à fort volume, la traduction et la déviation

Tournez-vous vers 3.6 Flash quand le travail demande un vrai raisonnement : agents en plusieurs étapes, code, tickets de support complexes qui touchent plusieurs systèmes. Tournez-vous vers Flash-Lite quand vous traitez un volume dont chaque élément est simple, comme le premier tri, la déviation en chat en direct des questions courantes, ou les réponses multilingues en masse. Construire un vrai agent IA ou un bot scripté est une décision distincte de celle du modèle, et elle compte généralement davantage. Si vous gérez un produit SaaS, notre analyse de la meilleure IA pour le support SaaS détaille où chaque modèle trouve sa place.

Ce que cela signifie si vous construisez de l'IA pour le support

Voici le moment d'être direct avec vous, parce que c'est le passage que tous les articles sur les prix des modèles sautent pour les équipes de support.

Un modèle moins cher et plus rapide, c'est une bonne nouvelle. Mais passer à Flash-Lite ne vous donne pas un agent de support qui fonctionne, pas plus qu'un moteur moins cher ne fait une voiture. Cela fait plus de trois ans que je mets de l'IA sur de vraies files de support, et l'échec que j'ai observé encore et encore n'est pas que le modèle soit bête, c'est un bot qui sonne sûr de lui en donnant une mauvaise réponse à un vrai client parce que personne n'a construit les couches autour du modèle. Le modèle est la couche de base de la pile.

Le modèle est la couche de base d'un agent de support, avec la recherche documentaire, les garde-fous et l'intégration au helpdesk empilés par-dessus
Le modèle est la couche de base d'un agent de support, avec la recherche documentaire, les garde-fous et l'intégration au helpdesk empilés par-dessus

Ces couches, c'est le vrai travail. La recherche documentaire, pour que le modèle réponde à partir de votre centre d'aide et des tickets passés au lieu de deviner. Les garde-fous et le périmètre, pour qu'il transfère proprement au lieu d'inventer une politique de remboursement. L'intégration, pour qu'il puisse agir au sein de votre système de tickets. Et les tests, pour que vous sachiez comment il se comporte avant qu'il touche un client. C'est exactement l'écart entre une API brute et un vrai logiciel de service client IA, et c'est pourquoi les problèmes de chatbot IA remontent presque toujours à la plomberie, pas au modèle.

C'est aussi pourquoi je déconseillerais de connecter vous-même l'API Gemini brute à votre helpdesk. Vous reconstruiriez la recherche documentaire, les garde-fous anti-hallucination, la simulation et chaque intégration helpdesk depuis zéro, puis vous devriez les maintenir à mesure que les modèles changent toutes les quelques semaines. Que Flash-Lite soit bon marché ne change rien à ce calcul. C'est tout l'argument en faveur d'une IA helpdesk conçue pour ça plutôt qu'une pile maison : le palier de modèle est une simple ligne budgétaire, le système qui l'entoure est le produit. Et quand vous entraînez correctement l'agent, le modèle en dessous compte à peine pour le résultat.

Essayer eesel

C'est exactement la couche qu'eesel est conçu pour être. Vous le branchez sur votre helpdesk existant, il apprend de vos tickets passés et de votre base de connaissances dès le départ, et il fonctionne au-dessus de modèles de pointe, donc vous obtenez l'efficacité sans connecter l'API vous-même.

Vue d'ensemble du tableau de bord du helpdesk IA eesel
Vue d'ensemble du tableau de bord du helpdesk IA eesel

L'élément différenciant qu'un modèle bon marché ne peut pas vous offrir seul : eesel vous permet de simuler l'agent sur vos tickets historiques avant qu'il ne réponde jamais à un client en direct, donc vous voyez le taux de résolution et les réponses exactes qu'il aurait envoyées, et vous pouvez le rattacher à un vrai ROI du support IA. Et comme c'est facturé selon le travail effectué, pas au token, vous évitez le calcul de tokens à chaque ticket. Si vous évaluez Flash-Lite pour construire de l'automatisation du support, partez du résultat que vous voulez et laissez la plateforme gérer la plomberie. C'est gratuit à essayer.

Questions fréquentes

Combien coûte Gemini 3.5 Flash-Lite ?
Sur le palier payant standard, les tarifs de Gemini 3.5 Flash-Lite sont de $0.30 par million de tokens en entrée et $2.50 par million de tokens en sortie, ce qui en fait le modèle le moins cher de la gamme 3.5 de Google. Le mode batch réduit les deux de moitié, à $0.15 / $1.25. Pour le reste de la famille, consultez notre décryptage des tarifs de Gemini.
Gemini 3.5 Flash-Lite est-il moins cher que Gemini 3.6 Flash ?
Oui, et de loin. Flash-Lite est environ 5 fois moins cher en entrée et 3 fois moins cher en sortie que Gemini 3.6 Flash ($1.50/$7.50). La contrepartie, c'est la profondeur de raisonnement : 3.6 Flash reste le meilleur choix pour les tâches complexes en plusieurs étapes.
À quoi sert Gemini 3.5 Flash-Lite ?
Google positionne Flash-Lite pour les tâches à fort volume et faible latence : recherche agentique, traitement de documents, traduction et tri simple. C'est le modèle à choisir quand chaque tâche est facile mais que vous l'exécutez des millions de fois, comme le premier tri des tickets.
Gemini 3.5 Flash-Lite a-t-il un palier gratuit ?
Oui, mais avec un bémol : sur le palier gratuit, Google peut utiliser votre contenu pour améliorer ses produits, ce qui exclut d'office toute utilisation touchant des données clients. Les paliers payants n'entraînent pas leurs modèles sur vos données. Mettez cela en balance avec le coût réel du service client IA avant de vous lancer.
Dois-je utiliser Gemini 3.5 Flash-Lite pour le support client ?
Le modèle est assez performant pour des tâches de support simples, mais un modèle seul ne fait pas un agent de support. Il vous faut encore la recherche documentaire, des garde-fous et des tests par-dessus. Une plateforme comme un logiciel de service client IA gère cette couche pour que vous n'ayez pas à connecter l'API brute vous-même.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Bannière Gemini 3.5 Flash-Lite sur un fond bleu Google
Trending

Gemini 3.5 Flash-Lite : ce que c'est, le prix et à qui ça s'adresse

Gemini 3.5 Flash-Lite est le modèle 3.5 le plus rapide et le moins cher de Google, à $0,30/$2,50 pour 1M de tokens. Voici ce que c'est, ce que ça coûte et quand l'utiliser.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Bannière hero de Gemini 3.6 Flash sur fond bleu Google
Trending

Gemini 3.6 Flash : ce que c'est, ce que ça coûte et à qui c'est destiné

Gemini 3.6 Flash est le nouveau modèle de travail de Google : 17 % de jetons de sortie en moins, une sortie moins chère et un contexte de 1M. Voici ce que c'est et à qui il s'adresse.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber : ce que c'est et qui peut l'utiliser

Gemini 3.5 Flash Cyber est le modèle de sécurité de Google pour trouver et corriger les vulnérabilités du code. Voici ce qu'il fait, comment CodeMender l'utilise, et pourquoi vous ne pouvez probablement pas encore y accéder.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Bannière principale des tarifs de Gemini 3.6 Flash sur un fond bleu Google
Trending

Tarifs de Gemini 3.6 Flash : le détail complet des coûts pour 2026

Gemini 3.6 Flash coûte $1.50 en entrée et $7.50 en sortie par 1M de tokens. Voici la grille tarifaire complète, les coûts cachés et ce que ça coûte réellement à faire fonctionner.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Illustration d'un modèle de contrôle de robot humanoïde, représentant Gemini Robotics 2
Trending

Gemini Robotics 2 : ce que montrent les chiffres de DeepMind

Gemini Robotics 2 lance trois modèles et un tableau de réussite par tâche où la plupart des scores restent sous 80%. Ce tableau est ce qu'il y a de plus utile dans toute cette sortie.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Image alt text
Guides

Un aperçu de Gemini Agentic Vision : fonctionnement et enjeux pour l'IA

Gemini Agentic Vision de Google est une nouvelle fonctionnalité du modèle Gemini 3 Flash qui change la façon dont l'IA interagit avec les images, transformant le visionnage passif en une enquête active en plusieurs étapes pour une plus grande précision.

Stevia PutriStevia PutriJan 30, 2026
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration comparant un petit noyau de modèle bien ordonné à un autre, bien plus grand et emmêlé, pour un avis sur Inkling-Small
Trending

Inkling-Small à l'essai : un quart de la taille, presque aussi malin

Un test concret d'Inkling-Small : il surpasse son propre modèle parent de 975B en code, avec un quart de la taille et un quart du prix, avant de s'effondrer sur la factualité. Voici ce que ce compromis coûte réellement.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement