
Qué es realmente Gemini 3.5 Flash-Lite
Google divide su familia Gemini en dos carriles. Los modelos Pro son la gama alta para razonamiento difícil. Los modelos Flash son los caballos de batalla: más baratos, más rápidos, afinados para apps que hacen miles de llamadas al día. Flash-Lite es el más ligero de esos caballos de batalla, posicionado por Google para tareas agénticas de alto volumen, traducción y procesamiento de datos simple.
Piensa en él como el modelo que apuntas a trabajos donde la tarea individual es fácil pero el volumen es brutal: clasificar un ticket de soporte, extraer campos de un PDF, traducir un mensaje de chat, hacer una búsqueda de primera pasada. Maneja entrada de texto, imagen, video, audio y PDF, admite function calling, salidas estructuradas, ejecución de código, caché y grounding con búsqueda, y lleva la misma ventana de contexto de ~1M de tokens que sus hermanos mayores (unas 1.500 páginas A4 de entrada).
Lo que deja fuera a propósito te dice para quién es. Flash-Lite no admite uso del ordenador, generación de imágenes, generación de audio ni la Live API. Si tu agente necesita manejar un navegador o generar medios, eso es tarea de Gemini 3.6 Flash o de un modelo Pro, no de este. Flash-Lite se mantiene estrecho a propósito: leer texto, decidir, escribir texto, hacerlo rápido y barato.
Precio de Gemini 3.5 Flash-Lite
Aquí está el panorama completo. Esta es la razón por la que existe el modelo, así que vale la pena leerlo con atención antes de meterlo en una hoja de cálculo.
| Modo de consumo | Entrada (por 1M) | Salida (incl. razonamiento) | Caché de contexto |
|---|---|---|---|
| Estándar | $0,30 | $2,50 | $0,03 |
| Batch (50% de descuento) | $0,15 | $1,25 | $0,02 |
| Flex | $0,15 | $1,25 | $0,02 |
| Priority | $0,54 | $4,50 | $0,05 |
| Nivel gratuito | Gratis | Gratis | Gratis |
Algunas cosas que vale la pena señalar:
- El nivel gratuito tiene una trampa. En el nivel gratuito, Google usa tu contenido para mejorar sus productos; en cualquier nivel de pago, no lo hace. Para cualquier cosa que toque datos de clientes, eso por sí solo descarta el nivel gratuito.
- El modo batch tiene un 50% de descuento fijo, que es el nivel en el que la mayoría de los trabajos de alto volumen deberían correr en realidad. Lo mismo para la inferencia flex. Si el trabajo no necesita ser en tiempo real, pagas $0,15/$1,25.
- Los aciertos de caché son baratos. Un token de entrada en caché cuesta $0,03 por 1M, un recorte del 90%, así que el contexto repetido (tu system prompt, un fragmento de conocimiento) apenas se nota en la factura.
- El grounding con búsqueda se mide por separado. Tienes 5.000 prompts con grounding gratis al mes en toda la familia Gemini 3, y después $14 por cada 1.000 búsquedas.
Una nota honesta de Artificial Analysis: a $0,30/$2,50 está en el puesto #87 de 152 en precio bruto, así que "Lite" no significa "el más barato del mercado". Significa el más barato dentro de la línea Gemini 3.5 mientras mantiene una puntuación de inteligencia de primer nivel. Para ver cómo se sitúa frente a los planes de consumo de Gemini y las otras capas de la API, nuestra guía de precios de Gemini tiene el desglose completo y los precios de Gemini Workspace cubren los planes de negocio.
La velocidad es la característica estrella
Si el precio es la razón para preseleccionar Flash-Lite, la velocidad es la razón para quedarte con él. Artificial Analysis lo cronometró en unos 490 tokens por segundo, en el puesto #2 de 152 modelos probados; Google cita 350 tokens por segundo en su propio banco de pruebas. Cualquiera de las dos cifras lo pone cerca de la cima del campo.

Hay un asterisco que vale la pena conocer antes de prometerle a un product manager respuestas en menos de un segundo. El tiempo hasta el primer token se sitúa en torno a 6 segundos de mediana, en el extremo alto de su categoría, porque el paso de razonamiento del modelo corre antes de que aparezca el primer token visible. Así que el streaming es brutalmente rápido una vez que empieza, pero el inicio puede tardar en un prompt difícil. Para la mayoría del trabajo de soporte (respuestas cortas, clasificación simple) ese presupuesto de razonamiento es pequeño y el retraso es insignificante; para cualquier cosa que midas al milisegundo, pruébalo primero con tus propios prompts.
Frente a su propio predecesor, el salto de generación es claro en los benchmarks de codificación agéntica y trabajo de conocimiento:

¿Flash-Lite o 3.6 Flash? Elige el correcto
Esta es la decisión que la mayoría de los equipos se equivocan, porque ambos se lanzaron el mismo día y los nombres apenas se diferencian. Están construidos para extremos opuestos del mismo trabajo. Recorre el selector de abajo.
La regla general: recurre a Flash-Lite cuando cada elemento sea simple y el volumen sea el reto, como la primera pasada de clasificación de tickets, desvío de nivel 1 o desvío de chat en vivo rutinario. Recurre a 3.6 Flash cuando el trabajo realmente necesite razonar a través de varios sistemas. Si construyes un agente de IA de verdad o un bot con guion es una decisión separada de la del modelo.
Los otros modelos que se lanzaron ese día
Flash-Lite no se lanzó solo. Google lanzó tres modelos el 21 de julio y guardó uno, y conocer la formación te evita elegir el nivel equivocado.
Gemini 3.6 Flash es el nuevo caballo de batalla estrella, a $1,50 de entrada / $7,50 de salida con uso del ordenador integrado y unos 17% menos tokens de salida que 3.5 Flash. Gemini 3.5 Flash Cyber es un especialista en seguridad afinado para encontrar y corregir vulnerabilidades dentro del agente CodeMender de Google, y solo está disponible para gobiernos y socios de confianza en un piloto limitado.
La ausencia notable: el buque insignia Gemini 3.5 Pro. Bloomberg informó que sufrió retrasos internos tras no alcanzar sus propios objetivos de rendimiento, y Logan Kilpatrick de DeepMind dijo que todavía está en pruebas con socios. Así que el movimiento de Google aquí es revelador: mantener fresco el nivel barato y de alto volumen mientras el buque insignia se cocina. Si necesitas un modelo de primer nivel hoy, nuestro resumen de alternativas a Gemini es el lugar honesto para mirar, Gemini frente a Claude y Gemini frente a ChatGPT cubren los enfrentamientos directos, y empresas de atención al cliente con IA mapea a los proveedores que construyen sobre estos modelos.
Lo que esto significa si estás construyendo IA para soporte
Aquí tengo que ser sincero contigo, porque esta es la parte que todo artículo de lanzamiento de modelo se salta para los equipos de soporte.
Un modelo más rápido y más barato es una buena noticia. Pero cambiar a Flash-Lite no te da un agente de soporte funcional, igual que una CPU más rápida no te da una app. Yo paso mis días conectando integraciones y APIs a eesel, y a lo largo de más de tres años poniendo IA en colas de soporte reales, el fallo que hemos visto una y otra vez no es que el modelo sea tonto, es un bot que suena seguro de sí mismo dando una respuesta equivocada a un cliente real porque nadie construyó las capas alrededor del modelo. El modelo es la base de la pila, no toda ella.
Esas capas son el trabajo real. Recuperación de información, para que el modelo responda desde tu base de conocimiento y tickets anteriores en lugar de adivinar. Barreras de seguridad y alcance, para que escale limpiamente en lugar de inventarse una política de reembolso. Integración, para que pueda actuar dentro de tu sistema de tickets. Y pruebas, para que sepas cómo se comporta antes de tocar a un cliente, no después. Esta es la brecha entre una API en crudo y un software de atención al cliente con IA real, y es por lo que los problemas de los chatbots de IA casi siempre se remontan a la fontanería, no al modelo.
También es por lo que me opondría a conectar tú mismo la API en crudo de Gemini a tu helpdesk. Estarías reconstruyendo desde cero la recuperación de información, las barreras contra alucinaciones, la simulación y cada integración de helpdesk, y luego mantenerlo mientras Google lanza un modelo nuevo cada pocas semanas (tres en un día, esta vez). Ese ritmo de cambio es todo el argumento para elegir IA de helpdesk hecha a medida por encima de una pila casera: el nivel del modelo es una línea intercambiable, el sistema que lo rodea es el producto.
Prueba eesel
Esta es exactamente la capa que eesel está construido para ser. Lo conectas a tu helpdesk existente, aprende de tus tickets pasados y tu base de conocimiento desde el primer momento, y corre sobre modelos de frontera como Gemini, así que obtienes la velocidad y el ahorro de costes de un modelo como Flash-Lite sin conectar la API tú mismo.

El diferenciador que más importa aquí es el que Flash-Lite no puede darte por sí solo: eesel te permite simular el agente contra tus tickets históricos antes de que responda a un cliente real, así que ves la tasa de resolución y las respuestas exactas que habría enviado. Y como tiene precios por resultados, no por token, te ahorras las cuentas de tokens en cada ticket. Si estás evaluando modelos para construir automatización de soporte, empieza por el resultado que quieres y deja que la plataforma elija la fontanería. Es gratis probarlo.
Frequently Asked Questions
¿Qué es Gemini 3.5 Flash-Lite?
¿Cuánto cuesta Gemini 3.5 Flash-Lite?
¿Es Gemini 3.5 Flash-Lite bueno para atención al cliente?
¿Cuál es el precio de Gemini 3.5 Flash-Lite para uso de alto volumen?
Gemini 3.5 Flash-Lite frente a 3.6 Flash: ¿cuál debería usar?
¿Qué tan rápido es Gemini 3.5 Flash-Lite?
¿Gemini 3.5 Flash-Lite admite el uso del ordenador (computer use)?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







