Precios de Gemini 3.5 Flash-Lite: qué cuesta y para quién es

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición July 22, 2026

Verificado por expertos
Banner principal de precios de Gemini 3.5 Flash-Lite sobre fondo azul de Google

Qué es realmente Gemini 3.5 Flash-Lite

Google divide su familia Gemini en dos carriles. Los modelos Pro son el nivel superior para razonamiento difícil. Los modelos Flash son los caballos de batalla: más baratos, más rápidos, afinados para aplicaciones de producción que hacen miles de llamadas al día. Flash-Lite es el más ligero de todos, posicionado por Google para tareas agénticas de gran volumen, traducción y procesamiento sencillo de datos.

Las especificaciones son sorprendentemente generosas para un modelo económico. Acepta texto, imagen, vídeo, audio y PDF como entrada, tiene una ventana de contexto de 1.048.576 tokens (~1M de tokens, o unas 1.500 páginas), y admite razonamiento, llamadas a funciones, salidas estructuradas, ejecución de código y anclaje con búsqueda. Lo que no admite es uso de ordenador, generación de imagen o audio, ni la Live API, así que es un motor de texto a texto para volumen, no un modelo que lo hace todo.

En Artificial Analysis, obtiene un Intelligence Index de 36 (#12 de 152 modelos, muy por encima de la media de su clase) mientras funciona a unos 490 tokens de salida por segundo, el segundo modelo más rápido que han medido. Para un modelo tan barato, esa combinación de inteligencia por dólar es todo el argumento de venta.

Precios de Gemini 3.5 Flash-Lite

Este es el panorama completo. Los precios son por 1M de tokens en los niveles de pago, y la salida incluye los tokens de razonamiento.

ModoEntrada (por 1M)Salida (incl. razonamiento)Caché de contexto
Estándar$0.30$2.50$0.03
Lotes (50% descuento)$0.15$1.25$0.02
Flex$0.15$1.25$0.02
Priority$0.54$4.50$0.05
Nivel gratuitoGratisGratisNo disponible

Algunas cosas que conviene señalar antes de meterlo en una hoja de cálculo:

  • El nivel gratuito entrena con tus datos. En el nivel gratuito, Google usa tu contenido para mejorar sus productos; en cualquier nivel de pago, no lo hace. Para cualquier cosa que toque datos de clientes, esto descarta el nivel gratuito por sí solo.
  • El modo por lotes es un 50% de descuento fijo. Si el trabajo no necesita ser en tiempo real (procesamiento de documentos nocturno, traducción masiva), Batch te baja a $0.15 / $1.25.
  • El anclaje con búsqueda se factura por separado. Tienes 5.000 prompts anclados al mes gratis en toda la familia Gemini 3, y después son $14 por cada 1.000 consultas de búsqueda, y una sola petición puede disparar varias consultas facturables.

Para ver cómo se posiciona frente a los planes de Gemini para consumidores y el resto de la API, nuestra guía de precios de Gemini tiene el desglose completo, y los precios de Gemini Workspace cubren los planes de empresa.

Lo que realmente te cuesta

Los precios de lista no significan mucho hasta que calculas un número real. Digamos que usas Flash-Lite para el triaje de tickets en primera instancia sobre 50.000 tickets al mes, con aproximadamente 1.000 tokens de entrada y 200 tokens de salida por ticket.

Un ejemplo de coste real para Gemini 3.5 Flash-Lite: 50.000 tickets al mes suponen unos $40 en coste de tokens
Un ejemplo de coste real para Gemini 3.5 Flash-Lite: 50.000 tickets al mes suponen unos $40 en coste de tokens

Eso son 50M de tokens de entrada ($15) y 10M de tokens de salida ($25), así que unos $40 al mes en coste de modelo en bruto. Ejecuta el mismo volumen en 3.6 Flash y estarás más cerca de $150. Esa diferencia es exactamente por qué existe Flash-Lite, y por qué elegir el nivel de modelo correcto importa más de lo que la mayoría de los equipos se dan cuenta cuando presupuestan la IA de soporte o intentan reducir los costes de soporte con automatización.

Cómo se compara Flash-Lite

Google publicó una tabla comparativa, y la fila de precios es la que cuenta la historia. A $0.30 / $2.50, Flash-Lite queda por debajo de GPT-5.4 mini ($0.75 / $4.50) y de Claude Haiku 4.5 ($1.00 / $5.00) mientras se sitúa en la misma franja de calidad aproximada en la mayoría de los benchmarks agénticos.

Tabla comparativa de Google que muestra Gemini 3.5 Flash-Lite frente a 3.1 Flash-Lite, GPT-5.4 mini y Claude Haiku 4.5 en precio y benchmarks, as taken from Google via 9to5Google
Tabla comparativa de Google que muestra Gemini 3.5 Flash-Lite frente a 3.1 Flash-Lite, GPT-5.4 mini y Claude Haiku 4.5 en precio y benchmarks, as taken from Google via 9to5Google

Lee esa tabla con una salvedad: GPT-5.4 mini se adelanta ligeramente en algunas puntuaciones de programación y conocimiento. Pero en precio por capacidad para trabajo de gran volumen, Flash-Lite es difícil de superar, y gana claramente en recuerdo de contexto largo. El único número que no queda bien parado es la latencia: el tiempo hasta el primer token ronda los 6 segundos (incluye el tiempo de razonamiento), en la parte alta para su categoría, así que encaja mejor con trabajos en segundo plano que con un chat en vivo ágil.

Frente a su propio predecesor, el salto generacional es claro:

Gemini 3.5 Flash-Lite supera a 3.1 Flash-Lite en programación agéntica de terminal (54% frente a 31%) y trabajo de conocimiento (1140 frente a 642), as taken from Google via 9to5Google
Gemini 3.5 Flash-Lite supera a 3.1 Flash-Lite en programación agéntica de terminal (54% frente a 31%) y trabajo de conocimiento (1140 frente a 642), as taken from Google via 9to5Google

La programación agéntica de terminal salta del 31% al 54% en Terminal-Bench 2.1, y el trabajo de conocimiento casi se duplica de 642 a 1140 en GDPval-AA v2. Google afirma que incluso supera al antiguo 3 Flash en SWE-Bench Pro y en tareas de uso de ordenador, así que no estás sacrificando mucha calidad por el precio bajo. Si estás sopesando Gemini frente al resto del mercado, lo desglosamos en Gemini vs Claude, Gemini vs ChatGPT y en el resumen más amplio de alternativas a Gemini.

¿Qué modelo eliges en realidad?

Flash-Lite se lanzó junto a Gemini 3.6 Flash, y elegir el equivocado o bien desperdicia dinero o lanza un bot que se queda corto. La regla general es sencilla.

Una bifurcación de decisión: elige Gemini 3.6 Flash para razonamiento de varios pasos, programación y tickets complejos; elige Gemini 3.5 Flash-Lite para triaje de gran volumen, traducción y desviación
Una bifurcación de decisión: elige Gemini 3.6 Flash para razonamiento de varios pasos, programación y tickets complejos; elige Gemini 3.5 Flash-Lite para triaje de gran volumen, traducción y desviación

Recurre a 3.6 Flash cuando el trabajo necesita razonamiento real: agentes de varios pasos, programación, tickets de soporte complejos que tocan varios sistemas. Recurre a Flash-Lite cuando procesas volumen en el que cada elemento es sencillo, como el triaje en primera instancia, la desviación de chat en vivo de preguntas rutinarias, o respuestas multilingües masivas. Si construyes un agente de IA real o un bot con guion es una decisión aparte de la del modelo, y normalmente importa más. Si tienes un producto SaaS, nuestro análisis sobre la mejor IA para soporte SaaS repasa dónde encaja cada modelo.

Qué significa esto si estás construyendo IA para soporte

Aquí es donde tengo que ser directo contigo, porque esta es la parte que todo artículo sobre precios de modelos se salta para los equipos de soporte.

Un modelo más barato y rápido son buenas noticias. Pero cambiar a Flash-Lite no te da un agente de soporte que funcione, igual que un motor más barato no te da un coche. Llevo los últimos tres años y pico poniendo IA en colas de soporte reales, y el fallo que he visto una y otra vez no es que el modelo sea torpe, es un bot que suena seguro de sí mismo dando una respuesta incorrecta a un cliente real porque nadie construyó las capas alrededor del modelo. El modelo es la base de la pila.

El modelo es la capa base de un agente de soporte, con recuperación de información, barreras de seguridad e integración con el helpdesk apiladas encima
El modelo es la capa base de un agente de soporte, con recuperación de información, barreras de seguridad e integración con el helpdesk apiladas encima

Esas capas son el trabajo de verdad. Recuperación de información, para que el modelo responda a partir de tu centro de ayuda y tickets pasados en lugar de adivinar. Barreras de seguridad y alcance, para que derive limpiamente en lugar de inventarse una política de reembolso. Integración, para que pueda actuar dentro de tu sistema de tickets. Y pruebas, para que sepas cómo se comporta antes de que toque a un cliente. Esta es la misma brecha que hay entre una API en bruto y un software de atención al cliente con IA de verdad, y por eso los problemas de los chatbots de IA casi siempre se remontan a la fontanería, no al modelo.

Por eso también me resisto a que conectes tú mismo la API en bruto de Gemini a tu helpdesk. Estarías reconstruyendo la recuperación de información, las barreras contra alucinaciones, la simulación y cada integración con el helpdesk desde cero, y luego manteniéndolo a medida que los modelos cambian cada pocas semanas. Que Flash-Lite sea barato no cambia esa cuenta. Ese es todo el argumento a favor de una IA de helpdesk creada específicamente para ello frente a una pila hecha en casa: el nivel del modelo es una línea más del presupuesto, el sistema que lo rodea es el producto. Y cuando entrenas bien al agente, el modelo que hay debajo apenas influye en el resultado.

Prueba eesel

Esto es exactamente la capa que eesel está construido para ser. Lo conectas a tu helpdesk existente, aprende de tus tickets pasados y de tu base de conocimiento desde el primer momento, y funciona sobre modelos de vanguardia para que obtengas la eficiencia sin conectar la API tú mismo.

Vista general del panel del helpdesk de IA de eesel
Vista general del panel del helpdesk de IA de eesel

El diferenciador que un modelo barato no te puede dar por sí solo: eesel te permite simular el agente contra tus tickets históricos antes de que responda nunca a un cliente en vivo, así que ves la tasa de resolución y las respuestas exactas que habría enviado, y puedes vincularlo con el ROI real de la IA de soporte. Y como tiene un precio basado en el trabajo que hace, no por token, te ahorras las cuentas de tokens en cada ticket. Si estás calculando el precio de Flash-Lite para construir automatización de soporte, empieza por el resultado que quieres y deja que la plataforma se encargue de la fontanería. Es gratis probarlo.

Preguntas frecuentes

¿Cuánto cuesta Gemini 3.5 Flash-Lite?
En el nivel de pago estándar, el precio de Gemini 3.5 Flash-Lite es de $0.30 por 1M de tokens de entrada y $2.50 por 1M de tokens de salida, lo que lo convierte en el modelo más barato de la línea 3.5 de Google. El modo por lotes reduce ambos a la mitad, hasta $0.15 / $1.25. Para conocer el resto de la familia, consulta nuestro desglose de precios de Gemini.
¿Es Gemini 3.5 Flash-Lite más barato que Gemini 3.6 Flash?
Sí, y por mucho. Flash-Lite es aproximadamente 5 veces más barato en entrada y 3 veces más barato en salida que Gemini 3.6 Flash ($1.50/$7.50). La contrapartida es la profundidad de razonamiento: 3.6 Flash es mejor opción para trabajos complejos de varios pasos.
¿Para qué sirve Gemini 3.5 Flash-Lite?
Google posiciona Flash-Lite para tareas de gran volumen y baja latencia: búsqueda agéntica, procesamiento de documentos, traducción y triaje sencillo. Es el modelo que eliges cuando cada tarea es fácil pero la ejecutas millones de veces, como la desviación de tickets en primera instancia.
¿Gemini 3.5 Flash-Lite tiene nivel gratuito?
Sí, pero con una salvedad: en el nivel gratuito, Google puede usar tu contenido para mejorar sus productos, así que no es una opción viable para nada que toque datos de clientes. Los niveles de pago no entrenan con tus datos. Compara eso con el coste real de la atención al cliente con IA antes de construir nada.
¿Debería usar Gemini 3.5 Flash-Lite para atención al cliente?
El modelo es suficientemente capaz para tareas de soporte sencillas, pero un modelo por sí solo no es un agente de soporte. Sigues necesitando recuperación de información, barreras de seguridad y pruebas por encima. Una plataforma como un software de atención al cliente con IA se encarga de esa capa para que no tengas que conectar la API en bruto tú mismo.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Banner de Gemini 3.5 Flash-Lite sobre un fondo azul Google
Trending

Gemini 3.5 Flash-Lite: qué es, precio y para quién es

Gemini 3.5 Flash-Lite es el modelo 3.5 más rápido y barato de Google, a $0,30/$2,50 por 1M de tokens. Aquí te explico qué es, cuánto cuesta y cuándo usarlo.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Banner de Gemini 3.6 Flash sobre un fondo azul de Google
Trending

Gemini 3.6 Flash: qué es, qué cuesta y para quién es

Gemini 3.6 Flash es el nuevo modelo de trabajo de Google: 17% menos tokens de salida, salida más barata y un contexto de 1M. Esto es lo que es y quién debería usarlo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber: qué es y quién puede usarlo

Gemini 3.5 Flash Cyber es el modelo de seguridad de Google para encontrar y corregir vulnerabilidades de código. Esto es lo que hace, cómo lo usa CodeMender y por qué probablemente todavía no puedas acceder a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Banner principal de precios de Gemini 3.6 Flash sobre un fondo azul de Google
Trending

Precios de Gemini 3.6 Flash: el desglose completo de costes para 2026

Gemini 3.6 Flash cuesta $1.50 de entrada y $7.50 de salida por 1M de tokens. Aquí tienes la tabla de precios completa, los costes ocultos y lo que realmente cuesta usarlo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de paneles de imagen, video y documentos alimentando un modelo de visión y lenguaje, con el logo de Qwen
Trending

Qwen 3.7 Flash: especificaciones, precios y qué hace realmente

Qwen 3.7 Flash se lanzó sin entrada de blog, sin benchmarks y sin pesos. Aquí está la hoja de especificaciones completa, los precios escalonados y lo que Qwen nunca afirmó.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Texto alternativo de la imagen
Guides

Una visión general de Gemini Agentic Vision: Cómo funciona y qué significa para la IA

Gemini Agentic Vision de Google es una nueva función del modelo Gemini 3 Flash que cambia la forma en que la IA interactúa con las imágenes, transformando la visualización pasiva en una investigación activa de varios pasos para una mayor precisión.

Stevia PutriStevia PutriJan 30, 2026
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis