
Qué es realmente Gemini 3.5 Flash-Lite
Google divide su familia Gemini en dos carriles. Los modelos Pro son el nivel superior para razonamiento difícil. Los modelos Flash son los caballos de batalla: más baratos, más rápidos, afinados para aplicaciones de producción que hacen miles de llamadas al día. Flash-Lite es el más ligero de todos, posicionado por Google para tareas agénticas de gran volumen, traducción y procesamiento sencillo de datos.
Las especificaciones son sorprendentemente generosas para un modelo económico. Acepta texto, imagen, vídeo, audio y PDF como entrada, tiene una ventana de contexto de 1.048.576 tokens (~1M de tokens, o unas 1.500 páginas), y admite razonamiento, llamadas a funciones, salidas estructuradas, ejecución de código y anclaje con búsqueda. Lo que no admite es uso de ordenador, generación de imagen o audio, ni la Live API, así que es un motor de texto a texto para volumen, no un modelo que lo hace todo.
En Artificial Analysis, obtiene un Intelligence Index de 36 (#12 de 152 modelos, muy por encima de la media de su clase) mientras funciona a unos 490 tokens de salida por segundo, el segundo modelo más rápido que han medido. Para un modelo tan barato, esa combinación de inteligencia por dólar es todo el argumento de venta.
Precios de Gemini 3.5 Flash-Lite
Este es el panorama completo. Los precios son por 1M de tokens en los niveles de pago, y la salida incluye los tokens de razonamiento.
| Modo | Entrada (por 1M) | Salida (incl. razonamiento) | Caché de contexto |
|---|---|---|---|
| Estándar | $0.30 | $2.50 | $0.03 |
| Lotes (50% descuento) | $0.15 | $1.25 | $0.02 |
| Flex | $0.15 | $1.25 | $0.02 |
| Priority | $0.54 | $4.50 | $0.05 |
| Nivel gratuito | Gratis | Gratis | No disponible |
Algunas cosas que conviene señalar antes de meterlo en una hoja de cálculo:
- El nivel gratuito entrena con tus datos. En el nivel gratuito, Google usa tu contenido para mejorar sus productos; en cualquier nivel de pago, no lo hace. Para cualquier cosa que toque datos de clientes, esto descarta el nivel gratuito por sí solo.
- El modo por lotes es un 50% de descuento fijo. Si el trabajo no necesita ser en tiempo real (procesamiento de documentos nocturno, traducción masiva), Batch te baja a $0.15 / $1.25.
- El anclaje con búsqueda se factura por separado. Tienes 5.000 prompts anclados al mes gratis en toda la familia Gemini 3, y después son $14 por cada 1.000 consultas de búsqueda, y una sola petición puede disparar varias consultas facturables.
Para ver cómo se posiciona frente a los planes de Gemini para consumidores y el resto de la API, nuestra guía de precios de Gemini tiene el desglose completo, y los precios de Gemini Workspace cubren los planes de empresa.
Lo que realmente te cuesta
Los precios de lista no significan mucho hasta que calculas un número real. Digamos que usas Flash-Lite para el triaje de tickets en primera instancia sobre 50.000 tickets al mes, con aproximadamente 1.000 tokens de entrada y 200 tokens de salida por ticket.

Eso son 50M de tokens de entrada ($15) y 10M de tokens de salida ($25), así que unos $40 al mes en coste de modelo en bruto. Ejecuta el mismo volumen en 3.6 Flash y estarás más cerca de $150. Esa diferencia es exactamente por qué existe Flash-Lite, y por qué elegir el nivel de modelo correcto importa más de lo que la mayoría de los equipos se dan cuenta cuando presupuestan la IA de soporte o intentan reducir los costes de soporte con automatización.
Cómo se compara Flash-Lite
Google publicó una tabla comparativa, y la fila de precios es la que cuenta la historia. A $0.30 / $2.50, Flash-Lite queda por debajo de GPT-5.4 mini ($0.75 / $4.50) y de Claude Haiku 4.5 ($1.00 / $5.00) mientras se sitúa en la misma franja de calidad aproximada en la mayoría de los benchmarks agénticos.

Lee esa tabla con una salvedad: GPT-5.4 mini se adelanta ligeramente en algunas puntuaciones de programación y conocimiento. Pero en precio por capacidad para trabajo de gran volumen, Flash-Lite es difícil de superar, y gana claramente en recuerdo de contexto largo. El único número que no queda bien parado es la latencia: el tiempo hasta el primer token ronda los 6 segundos (incluye el tiempo de razonamiento), en la parte alta para su categoría, así que encaja mejor con trabajos en segundo plano que con un chat en vivo ágil.
Frente a su propio predecesor, el salto generacional es claro:

La programación agéntica de terminal salta del 31% al 54% en Terminal-Bench 2.1, y el trabajo de conocimiento casi se duplica de 642 a 1140 en GDPval-AA v2. Google afirma que incluso supera al antiguo 3 Flash en SWE-Bench Pro y en tareas de uso de ordenador, así que no estás sacrificando mucha calidad por el precio bajo. Si estás sopesando Gemini frente al resto del mercado, lo desglosamos en Gemini vs Claude, Gemini vs ChatGPT y en el resumen más amplio de alternativas a Gemini.
¿Qué modelo eliges en realidad?
Flash-Lite se lanzó junto a Gemini 3.6 Flash, y elegir el equivocado o bien desperdicia dinero o lanza un bot que se queda corto. La regla general es sencilla.

Recurre a 3.6 Flash cuando el trabajo necesita razonamiento real: agentes de varios pasos, programación, tickets de soporte complejos que tocan varios sistemas. Recurre a Flash-Lite cuando procesas volumen en el que cada elemento es sencillo, como el triaje en primera instancia, la desviación de chat en vivo de preguntas rutinarias, o respuestas multilingües masivas. Si construyes un agente de IA real o un bot con guion es una decisión aparte de la del modelo, y normalmente importa más. Si tienes un producto SaaS, nuestro análisis sobre la mejor IA para soporte SaaS repasa dónde encaja cada modelo.
Qué significa esto si estás construyendo IA para soporte
Aquí es donde tengo que ser directo contigo, porque esta es la parte que todo artículo sobre precios de modelos se salta para los equipos de soporte.
Un modelo más barato y rápido son buenas noticias. Pero cambiar a Flash-Lite no te da un agente de soporte que funcione, igual que un motor más barato no te da un coche. Llevo los últimos tres años y pico poniendo IA en colas de soporte reales, y el fallo que he visto una y otra vez no es que el modelo sea torpe, es un bot que suena seguro de sí mismo dando una respuesta incorrecta a un cliente real porque nadie construyó las capas alrededor del modelo. El modelo es la base de la pila.

Esas capas son el trabajo de verdad. Recuperación de información, para que el modelo responda a partir de tu centro de ayuda y tickets pasados en lugar de adivinar. Barreras de seguridad y alcance, para que derive limpiamente en lugar de inventarse una política de reembolso. Integración, para que pueda actuar dentro de tu sistema de tickets. Y pruebas, para que sepas cómo se comporta antes de que toque a un cliente. Esta es la misma brecha que hay entre una API en bruto y un software de atención al cliente con IA de verdad, y por eso los problemas de los chatbots de IA casi siempre se remontan a la fontanería, no al modelo.
Por eso también me resisto a que conectes tú mismo la API en bruto de Gemini a tu helpdesk. Estarías reconstruyendo la recuperación de información, las barreras contra alucinaciones, la simulación y cada integración con el helpdesk desde cero, y luego manteniéndolo a medida que los modelos cambian cada pocas semanas. Que Flash-Lite sea barato no cambia esa cuenta. Ese es todo el argumento a favor de una IA de helpdesk creada específicamente para ello frente a una pila hecha en casa: el nivel del modelo es una línea más del presupuesto, el sistema que lo rodea es el producto. Y cuando entrenas bien al agente, el modelo que hay debajo apenas influye en el resultado.
Prueba eesel
Esto es exactamente la capa que eesel está construido para ser. Lo conectas a tu helpdesk existente, aprende de tus tickets pasados y de tu base de conocimiento desde el primer momento, y funciona sobre modelos de vanguardia para que obtengas la eficiencia sin conectar la API tú mismo.

El diferenciador que un modelo barato no te puede dar por sí solo: eesel te permite simular el agente contra tus tickets históricos antes de que responda nunca a un cliente en vivo, así que ves la tasa de resolución y las respuestas exactas que habría enviado, y puedes vincularlo con el ROI real de la IA de soporte. Y como tiene un precio basado en el trabajo que hace, no por token, te ahorras las cuentas de tokens en cada ticket. Si estás calculando el precio de Flash-Lite para construir automatización de soporte, empieza por el resultado que quieres y deja que la plataforma se encargue de la fontanería. Es gratis probarlo.
Preguntas frecuentes
¿Cuánto cuesta Gemini 3.5 Flash-Lite?
¿Es Gemini 3.5 Flash-Lite más barato que Gemini 3.6 Flash?
¿Para qué sirve Gemini 3.5 Flash-Lite?
¿Gemini 3.5 Flash-Lite tiene nivel gratuito?
¿Debería usar Gemini 3.5 Flash-Lite para atención al cliente?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







