Gemini 3.5 Flash-Lite: qué es, precio y para quién es

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 6, 2026

Verificado por expertos
Banner de Gemini 3.5 Flash-Lite sobre un fondo azul Google

Qué es realmente Gemini 3.5 Flash-Lite

Google divide su familia Gemini en dos carriles. Los modelos Pro son la gama alta para razonamiento difícil. Los modelos Flash son los caballos de batalla: más baratos, más rápidos, afinados para apps que hacen miles de llamadas al día. Flash-Lite es el más ligero de esos caballos de batalla, posicionado por Google para tareas agénticas de alto volumen, traducción y procesamiento de datos simple.

Piensa en él como el modelo que apuntas a trabajos donde la tarea individual es fácil pero el volumen es brutal: clasificar un ticket de soporte, extraer campos de un PDF, traducir un mensaje de chat, hacer una búsqueda de primera pasada. Maneja entrada de texto, imagen, video, audio y PDF, admite function calling, salidas estructuradas, ejecución de código, caché y grounding con búsqueda, y lleva la misma ventana de contexto de ~1M de tokens que sus hermanos mayores (unas 1.500 páginas A4 de entrada).

Lo que deja fuera a propósito te dice para quién es. Flash-Lite no admite uso del ordenador, generación de imágenes, generación de audio ni la Live API. Si tu agente necesita manejar un navegador o generar medios, eso es tarea de Gemini 3.6 Flash o de un modelo Pro, no de este. Flash-Lite se mantiene estrecho a propósito: leer texto, decidir, escribir texto, hacerlo rápido y barato.

Precio de Gemini 3.5 Flash-Lite

Aquí está el panorama completo. Esta es la razón por la que existe el modelo, así que vale la pena leerlo con atención antes de meterlo en una hoja de cálculo.

Modo de consumoEntrada (por 1M)Salida (incl. razonamiento)Caché de contexto
Estándar$0,30$2,50$0,03
Batch (50% de descuento)$0,15$1,25$0,02
Flex$0,15$1,25$0,02
Priority$0,54$4,50$0,05
Nivel gratuitoGratisGratisGratis

Algunas cosas que vale la pena señalar:

  • El nivel gratuito tiene una trampa. En el nivel gratuito, Google usa tu contenido para mejorar sus productos; en cualquier nivel de pago, no lo hace. Para cualquier cosa que toque datos de clientes, eso por sí solo descarta el nivel gratuito.
  • El modo batch tiene un 50% de descuento fijo, que es el nivel en el que la mayoría de los trabajos de alto volumen deberían correr en realidad. Lo mismo para la inferencia flex. Si el trabajo no necesita ser en tiempo real, pagas $0,15/$1,25.
  • Los aciertos de caché son baratos. Un token de entrada en caché cuesta $0,03 por 1M, un recorte del 90%, así que el contexto repetido (tu system prompt, un fragmento de conocimiento) apenas se nota en la factura.
  • El grounding con búsqueda se mide por separado. Tienes 5.000 prompts con grounding gratis al mes en toda la familia Gemini 3, y después $14 por cada 1.000 búsquedas.

Una nota honesta de Artificial Analysis: a $0,30/$2,50 está en el puesto #87 de 152 en precio bruto, así que "Lite" no significa "el más barato del mercado". Significa el más barato dentro de la línea Gemini 3.5 mientras mantiene una puntuación de inteligencia de primer nivel. Para ver cómo se sitúa frente a los planes de consumo de Gemini y las otras capas de la API, nuestra guía de precios de Gemini tiene el desglose completo y los precios de Gemini Workspace cubren los planes de negocio.

La velocidad es la característica estrella

Si el precio es la razón para preseleccionar Flash-Lite, la velocidad es la razón para quedarte con él. Artificial Analysis lo cronometró en unos 490 tokens por segundo, en el puesto #2 de 152 modelos probados; Google cita 350 tokens por segundo en su propio banco de pruebas. Cualquiera de las dos cifras lo pone cerca de la cima del campo.

Tabla de referencia de Gemini 3.5 Flash-Lite con puntuaciones de codificación agéntica en terminal y trabajo de conocimiento, as shared by Google
Tabla de referencia de Gemini 3.5 Flash-Lite con puntuaciones de codificación agéntica en terminal y trabajo de conocimiento, as shared by Google

Hay un asterisco que vale la pena conocer antes de prometerle a un product manager respuestas en menos de un segundo. El tiempo hasta el primer token se sitúa en torno a 6 segundos de mediana, en el extremo alto de su categoría, porque el paso de razonamiento del modelo corre antes de que aparezca el primer token visible. Así que el streaming es brutalmente rápido una vez que empieza, pero el inicio puede tardar en un prompt difícil. Para la mayoría del trabajo de soporte (respuestas cortas, clasificación simple) ese presupuesto de razonamiento es pequeño y el retraso es insignificante; para cualquier cosa que midas al milisegundo, pruébalo primero con tus propios prompts.

Frente a su propio predecesor, el salto de generación es claro en los benchmarks de codificación agéntica y trabajo de conocimiento:

Gemini 3.5 Flash-Lite supera a 3.1 Flash-Lite en codificación agéntica en terminal y trabajo de conocimiento, as shared by Google
Gemini 3.5 Flash-Lite supera a 3.1 Flash-Lite en codificación agéntica en terminal y trabajo de conocimiento, as shared by Google

¿Flash-Lite o 3.6 Flash? Elige el correcto

Esta es la decisión que la mayoría de los equipos se equivocan, porque ambos se lanzaron el mismo día y los nombres apenas se diferencian. Están construidos para extremos opuestos del mismo trabajo. Recorre el selector de abajo.

¿Qué modelo de Gemini debería usar?
Elige la afirmación que mejor encaje con tu carga de trabajo.
Gemini 3.5 Flash-Lite. El más barato de la línea 3.5 ($0,30/$2,50, la mitad en batch) y cerca de la cima del campo en velocidad. Esto es exactamente para lo que sirve "Lite".
Gemini 3.6 Flash. Es el caballo de batalla con uso del ordenador integrado y razonamiento de varios pasos más fuerte. Flash-Lite deja eso fuera a propósito.
El modelo es la parte fácil. Cualquiera de los dos modelos funciona, pero de todas formas necesitas recuperación de información, barreras de seguridad y pruebas alrededor. Sigue leyendo, o salta a la sección de abajo.

La regla general: recurre a Flash-Lite cuando cada elemento sea simple y el volumen sea el reto, como la primera pasada de clasificación de tickets, desvío de nivel 1 o desvío de chat en vivo rutinario. Recurre a 3.6 Flash cuando el trabajo realmente necesite razonar a través de varios sistemas. Si construyes un agente de IA de verdad o un bot con guion es una decisión separada de la del modelo.

Los otros modelos que se lanzaron ese día

Flash-Lite no se lanzó solo. Google lanzó tres modelos el 21 de julio y guardó uno, y conocer la formación te evita elegir el nivel equivocado.

Gemini 3.6 Flash es el nuevo caballo de batalla estrella, a $1,50 de entrada / $7,50 de salida con uso del ordenador integrado y unos 17% menos tokens de salida que 3.5 Flash. Gemini 3.5 Flash Cyber es un especialista en seguridad afinado para encontrar y corregir vulnerabilidades dentro del agente CodeMender de Google, y solo está disponible para gobiernos y socios de confianza en un piloto limitado.

La ausencia notable: el buque insignia Gemini 3.5 Pro. Bloomberg informó que sufrió retrasos internos tras no alcanzar sus propios objetivos de rendimiento, y Logan Kilpatrick de DeepMind dijo que todavía está en pruebas con socios. Así que el movimiento de Google aquí es revelador: mantener fresco el nivel barato y de alto volumen mientras el buque insignia se cocina. Si necesitas un modelo de primer nivel hoy, nuestro resumen de alternativas a Gemini es el lugar honesto para mirar, Gemini frente a Claude y Gemini frente a ChatGPT cubren los enfrentamientos directos, y empresas de atención al cliente con IA mapea a los proveedores que construyen sobre estos modelos.

Lo que esto significa si estás construyendo IA para soporte

Aquí tengo que ser sincero contigo, porque esta es la parte que todo artículo de lanzamiento de modelo se salta para los equipos de soporte.

Un modelo más rápido y más barato es una buena noticia. Pero cambiar a Flash-Lite no te da un agente de soporte funcional, igual que una CPU más rápida no te da una app. Yo paso mis días conectando integraciones y APIs a eesel, y a lo largo de más de tres años poniendo IA en colas de soporte reales, el fallo que hemos visto una y otra vez no es que el modelo sea tonto, es un bot que suena seguro de sí mismo dando una respuesta equivocada a un cliente real porque nadie construyó las capas alrededor del modelo. El modelo es la base de la pila, no toda ella.

Esas capas son el trabajo real. Recuperación de información, para que el modelo responda desde tu base de conocimiento y tickets anteriores en lugar de adivinar. Barreras de seguridad y alcance, para que escale limpiamente en lugar de inventarse una política de reembolso. Integración, para que pueda actuar dentro de tu sistema de tickets. Y pruebas, para que sepas cómo se comporta antes de tocar a un cliente, no después. Esta es la brecha entre una API en crudo y un software de atención al cliente con IA real, y es por lo que los problemas de los chatbots de IA casi siempre se remontan a la fontanería, no al modelo.

También es por lo que me opondría a conectar tú mismo la API en crudo de Gemini a tu helpdesk. Estarías reconstruyendo desde cero la recuperación de información, las barreras contra alucinaciones, la simulación y cada integración de helpdesk, y luego mantenerlo mientras Google lanza un modelo nuevo cada pocas semanas (tres en un día, esta vez). Ese ritmo de cambio es todo el argumento para elegir IA de helpdesk hecha a medida por encima de una pila casera: el nivel del modelo es una línea intercambiable, el sistema que lo rodea es el producto.

Prueba eesel

Esta es exactamente la capa que eesel está construido para ser. Lo conectas a tu helpdesk existente, aprende de tus tickets pasados y tu base de conocimiento desde el primer momento, y corre sobre modelos de frontera como Gemini, así que obtienes la velocidad y el ahorro de costes de un modelo como Flash-Lite sin conectar la API tú mismo.

Vista general del panel de eesel AI para el helpdesk
Vista general del panel de eesel AI para el helpdesk

El diferenciador que más importa aquí es el que Flash-Lite no puede darte por sí solo: eesel te permite simular el agente contra tus tickets históricos antes de que responda a un cliente real, así que ves la tasa de resolución y las respuestas exactas que habría enviado. Y como tiene precios por resultados, no por token, te ahorras las cuentas de tokens en cada ticket. Si estás evaluando modelos para construir automatización de soporte, empieza por el resultado que quieres y deja que la plataforma elija la fontanería. Es gratis probarlo.

Frequently Asked Questions

¿Qué es Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite es el modelo más rápido y barato de la línea Gemini 3.5 de Google, lanzado el 21 de julio de 2026 junto con Gemini 3.6 Flash. Está pensado para trabajos de alto volumen y baja latencia como búsqueda agéntica, procesamiento de documentos y traducción. Para una visión más amplia de la familia, consulta nuestro resumen de Gemini AI.
¿Cuánto cuesta Gemini 3.5 Flash-Lite?
En el nivel de pago estándar, el precio de Gemini 3.5 Flash-Lite es de $0,30 por 1M de tokens de entrada y $2,50 por 1M de tokens de salida, con los modos batch y flex a la mitad ($0,15/$1,25). También hay un nivel gratuito en el que Google puede usar tu contenido para mejorar sus productos. Compáralo con el desglose completo de precios de Gemini.
¿Es Gemini 3.5 Flash-Lite bueno para atención al cliente?
Para tareas simples y de alto volumen, como la primera clasificación de tickets, es una gran opción, pero el modelo es solo la capa inferior de un agente de soporte. Sigues necesitando recuperación de información sobre tu centro de ayuda, barreras de seguridad y pruebas antes de lanzarlo. Una plataforma como software de atención al cliente con IA se encarga de esa capa para que no tengas que conectar la API en crudo tú mismo.
¿Cuál es el precio de Gemini 3.5 Flash-Lite para uso de alto volumen?
El modo batch tiene un 50% de descuento fijo sobre el estándar, así que los trabajos de alto volumen y no en tiempo real corren a $0,15 de entrada / $1,25 de salida por 1M de tokens. Los aciertos de caché bajan a $0,03 por 1M. Para trabajo que ejecutas millones de veces, esa diferencia es toda la razón para elegir Flash-Lite en lugar de 3.6 Flash.
Gemini 3.5 Flash-Lite frente a 3.6 Flash: ¿cuál debería usar?
Elige Flash-Lite cuando cada elemento sea simple y estés procesando volumen, como clasificación de tickets o desvío de chat en vivo rutinario. Elige 3.6 Flash cuando el trabajo necesite razonamiento real de varios pasos. Consulta el resumen de alternativas a Gemini si ninguno de los dos te encaja.
¿Qué tan rápido es Gemini 3.5 Flash-Lite?
Artificial Analysis midió unos 490 tokens de salida por segundo, ubicándolo en el puesto #2 de 152 modelos probados. Google cita 350 tokens por segundo en su propio banco de pruebas. Cualquiera de las dos cifras lo sitúa entre los modelos más rápidos disponibles, que es justamente el objetivo de un modelo Lite. Sí tiene un tiempo hasta el primer token más alto, porque el razonamiento se ejecuta antes de que aparezca el primer token.
¿Gemini 3.5 Flash-Lite admite el uso del ordenador (computer use)?
No. El uso del ordenador, la generación de imágenes, la generación de audio y la Live API no están disponibles en Flash-Lite. Sí admite function calling, salidas estructuradas, ejecución de código, caché y grounding con búsqueda. Si necesitas uso del ordenador, esa es tarea de Gemini 3.6 Flash.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Banner principal de precios de Gemini 3.5 Flash-Lite sobre fondo azul de Google
Trending

Precios de Gemini 3.5 Flash-Lite: qué cuesta y para quién es

Gemini 3.5 Flash-Lite es el modelo más barato de Google, a $0.30/$2.50 por 1M de tokens. Aquí tienes la tabla de precios completa, un ejemplo de coste real y para quién es.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Banner de Gemini 3.6 Flash sobre un fondo azul de Google
Trending

Gemini 3.6 Flash: qué es, qué cuesta y para quién es

Gemini 3.6 Flash es el nuevo modelo de trabajo de Google: 17% menos tokens de salida, salida más barata y un contexto de 1M. Esto es lo que es y quién debería usarlo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyber: qué es y quién puede usarlo

Gemini 3.5 Flash Cyber es el modelo de seguridad de Google para encontrar y corregir vulnerabilidades de código. Esto es lo que hace, cómo lo usa CodeMender y por qué probablemente todavía no puedas acceder a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Banner principal de precios de Gemini 3.6 Flash sobre un fondo azul de Google
Trending

Precios de Gemini 3.6 Flash: el desglose completo de costes para 2026

Gemini 3.6 Flash cuesta $1.50 de entrada y $7.50 de salida por 1M de tokens. Aquí tienes la tabla de precios completa, los costes ocultos y lo que realmente cuesta usarlo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de paneles de imagen, video y documentos alimentando un modelo de visión y lenguaje, con el logo de Qwen
Trending

Qwen 3.7 Flash: especificaciones, precios y qué hace realmente

Qwen 3.7 Flash se lanzó sin entrada de blog, sin benchmarks y sin pesos. Aquí está la hoja de especificaciones completa, los precios escalonados y lo que Qwen nunca afirmó.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Texto alternativo de la imagen
Guides

Una visión general de Gemini Agentic Vision: Cómo funciona y qué significa para la IA

Gemini Agentic Vision de Google es una nueva función del modelo Gemini 3 Flash que cambia la forma en que la IA interactúa con las imágenes, transformando la visualización pasiva en una investigación activa de varios pasos para una mayor precisión.

Stevia PutriStevia PutriJan 30, 2026
Ilustración dibujada a mano con el logo de Grok, un agente de soporte y paneles de benchmarks y precios
Trending

Grok 4.5: benchmarks, precios y lo que significa para el soporte

xAI acaba de lanzar Grok 4.5. Analizamos los benchmarks reales, el precio por token y si un modelo nuevo y de moda realmente cambia algo para tu cola de soporte.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis