
Qué es realmente Gemini 3.6 Flash

Google divide Gemini en niveles: Pro para el razonamiento más difícil, Flash para el trabajo cotidiano y Flash-Lite para tareas baratas de alto volumen. Gemini 3.6 Flash es el nivel intermedio, y Google lo llama a propósito el "workhorse". Es el modelo al que recurres cuando ejecutas algo miles de veces al día y te importa tanto el coste y la latencia como la inteligencia bruta.
Se construye directamente sobre 3.5 Flash y sobre los comentarios de los desarrolladores que lo usan. El mensaje principal es la eficiencia: menos pasos de razonamiento y llamadas a herramientas para terminar un trabajo de varios pasos, menos divagación en sus respuestas y un precio más bajo por token de salida. También llega con un corte de conocimiento más reciente, que avanza de enero de 2025 a marzo de 2026.
Por debajo tienes lo que esperarías de un modelo moderno: una ventana de contexto de 1.048.576 tokens, entrada multimodal de texto, imagen, vídeo, audio y PDF, además de llamadas a funciones, salida estructurada, ejecución de código, caché de contexto y fundamentación mediante búsqueda. El uso del ordenador, donde el modelo maneja un navegador o un escritorio, es ahora una herramienta integrada del lado del cliente en vista previa.
La verdadera historia es la eficiencia
Aquí está el número que me hizo prestar atención. En el benchmark de programación DeepSWE, 3.6 Flash termina la tarea media con 97.000 tokens de salida frente a los 276.000 que consumía 3.5 Flash, un recorte de alrededor del 65%. En el Artificial Analysis Index más amplio, la diferencia es menor pero sigue siendo real, de 28K a 23K.

¿Por qué importa más el número de tokens que el precio de lista? Porque los tokens de salida son donde realmente se acumula la factura, y un agente es una máquina que gasta tokens. Un solo ticket de soporte gestionado por un agente no es una sola llamada al modelo, es una cadena: leer el ticket, buscar en la base de conocimiento, decidir, quizá llamar a una herramienta, redactar, comprobar. Cada paso gasta tokens. Reduce los tokens por paso y reduces el coste de toda la cadena, además de la tarifa por token más baja.
Esto también es por lo que el enfoque de "workhorse" es honesto. En un flujo de trabajo real de agentes, la mayoría de los pasos son rutinarios y se dirigen al modelo barato, mientras que solo los pasos realmente difíciles necesitan un modelo puntero, si es que lo necesitan. Así que la mayor parte de tu factura vive en el carril del workhorse, y hacer ese carril un 17% más barato por token y mucho más eficiente por tarea es más importante que un lanzamiento más vistoso de un Pro.

Benchmarks: dónde gana, dónde pierde
Frente a su propia familia, 3.6 Flash es un salto claro. El gráfico de Google muestra que supera tanto a 3.5 Flash como al 3.1 Pro del año pasado en programación de largo horizonte, ingeniería de ML, trabajo de conocimiento y uso del ordenador.

La pregunta más útil es cómo se compara con los modelos entre los que realmente elegirías. Google publicó una tabla comparativa, y hay que reconocerle que no esconde las derrotas.

Si lees esa tabla con honestidad, aparece una forma clara. En las pruebas más duras de programación con agentes, 3.6 Flash se queda por detrás de los modelos punteros: 58,7% en SWE-Bench Pro frente al 64,7% de Grok 4.5 y el 63,2% de Claude Sonnet 5, y 49% en DeepSWE frente al 67% de GPT-5.6 Luna. En trabajo de conocimiento (GDPval-AA v2) su Elo de 1421 queda muy por debajo de GPT-5.6 (1584) y Claude Sonnet 5 (1607).
Pero si nos fijamos en las tareas que se corresponden con el trabajo real de agentes, lidera todo el tablero: 83,0% en OSWorld-Verified (uso del ordenador), 89,4% en razonamiento con gráficos de CharXiv, 83,2% en vídeo largo de LVBench, y un enorme 91,8% en la memoria de contexto largo de GDM-MRCR, donde el rival más cercano está en los 70. Para un modelo que cuesta una quinta parte de Claude Sonnet 5 en salida, es un resultado muy sólido justo en las dimensiones que importan para el trabajo con agentes.
Mi lectura: esto es un caballo de batalla, no un campeón. Si tu trabajo es ingeniería de software profunda y novedosa, los modelos punteros todavía tienen ventaja. Si tu trabajo es ejecutar muchas tareas fundamentadas, con uso de herramientas y con mucho documento, de forma barata, 3.6 Flash es una de las mejores opciones de valor del mercado ahora mismo.
El precio en detalle
Aquí está la visión del dinero. Todas las cifras son por 1M de tokens en el nivel Standard de pago, de la página de precios de la API de Gemini.
| Modelo | Entrada | Salida | Lote (entrada / salida) | Caché de contexto |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | $0.75 / $3.75 | $0.15/1M + $1.00/1M/hr |
| Gemini 3.5 Flash (anterior) | $1.50 | $9.00 | $0.75 / $4.50 | $0.15/1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | $0.15 / $1.25 | $0.075/1M |
Hay unas cosas que merece la pena señalar. El precio de entrada se mantiene igual, así que todo el ahorro está en la salida, que como vimos es donde gastan los agentes. El modo por lotes es un 50% de descuento plano si puedes tolerar el procesamiento asíncrono. La salida incluye los tokens de razonamiento, así que una respuesta de "razonamiento" factura su trabajo de borrador como salida, otra razón por la que la ganancia de eficiencia de tokens se acumula. Y hay un nivel gratuito genuino para pruebas, aunque en el nivel gratuito tu contenido puede usarse para mejorar los productos de Google, así que mantén los datos de producción en el nivel de pago.
Para hacer tangible la relación coste-beneficio, introduce tu propio volumen:
Con 50M de tokens de salida al mes, pasar de 3.5 Flash a 3.6 Flash ahorra 75 $, sin contar todavía la ganancia de eficiencia de tokens. Al volumen real de un agente, esa diferencia se amplía rápido.
Los dos modelos compañeros
3.6 Flash no llegó solo. Gemini 3.5 Flash-Lite es el nivel económico, a 0,30 $ de entrada / 2,50 $ de salida, y Google dice que ahora supera cómodamente al antiguo 3.1 Flash-Lite en programación de terminal y trabajo de conocimiento, mientras funciona lo bastante rápido para trabajos de alto rendimiento como clasificación y enrutamiento.

El tercer modelo, Gemini 3.5 Flash Cyber, es un especialista ajustado para trabajos de ciberseguridad, y está restringido a gobiernos y socios de confianza en lugar de estar disponible de forma general. La mayoría de los equipos nunca lo tocarán, pero señala dónde cree Google que se concentra buena parte del valor de los agentes a corto plazo.
Lo que falta: sin Pro, y un adelanto de Gemini 4
El elefante en la habitación es el modelo que Google no lanzó. La línea insignia Gemini Pro se actualizó por última vez en febrero de 2026, Google adelantó un 3.5 Pro en mayo, y luego se retrasó. El responsable de producto Logan Kilpatrick lo planteó como un trabajo en curso y no como una cancelación:
"3.5 Pro is testing with partners and we hope to land it soon."
Al mismo tiempo, el equipo ya está mirando más allá:
"We've kicked off the pre-training run for Gemini 4, our most ambitious yet."
TechCrunch interpretó el lanzamiento como que Google mantiene el ritmo en el extremo barato y de alto volumen del mercado mientras su respuesta puntera a GPT-5.6 y Claude Sonnet 5 sigue en el taller. Me parece una lectura justa. También significa que, si necesitas razonamiento de nivel puntero hoy mismo, Gemini no es donde lo vas a encontrar esta semana.
Entonces, ¿merece la pena Gemini 3.6 Flash?
Si ya estás construyendo sobre Gemini Flash, es un sí fácil. Es más barato, más eficiente y mejor en casi todos los benchmarks que el modelo al que sustituye, sin ninguna desventaja real. Cambia y sigue adelante.
Si estás eligiendo entre familias, hay que ser honesto sobre el trabajo. Para ingeniería profunda y novedosa, los modelos punteros todavía tienen ventaja. Para trabajo fundamentado, intensivo en herramientas, orientado a documentos y pantallas, a gran escala, 3.6 Flash destaca en relación calidad-precio.

El único punto en el que discreparía del entusiasmo es el salto que hace algunas personas de "modelo barato genial" a "bot de soporte genial". No son lo mismo, y la brecha entre ambos es donde la mayoría de los proyectos de soporte con IA fallan en silencio.
Un modelo no es un agente de soporte
Yo construyo las integraciones que ponen modelos como este en colas de soporte reales, así que déjame ser directo sobre lo que un lanzamiento de modelo cambia y no cambia para ese trabajo. El modelo es la capa de materia prima en la base de la pila. Todo lo que hace que un agente de IA sea realmente seguro para poner frente a los clientes está por encima de él.

He visto a un modelo con aspecto seguro dar a un cliente una respuesta limpia, bien escrita y completamente equivocada. Por eso cada despliegue de eesel se simula contra tus tickets históricos antes de responder nunca a una persona real, para que veas la cobertura y la precisión por tema y puedas arreglar los huecos primero. También es por lo que confiamos en el enrutamiento basado en confianza: las respuestas de baja confianza se convierten en borradores, no en respuestas automáticas.
Esa capa es lo que convierte "existe un modelo rápido" en que smava ejecute un agente de Zendesk totalmente automatizado sobre más de 100.000 tickets en alemán al mes, o que Gridwise resuelva el 73% de las solicitudes de nivel 1 en su primer mes. Nada de eso es el modelo. Es la fundamentación, la simulación, las barreras de seguridad y las integraciones con el helpdesk que lo rodean.
La buena noticia para quien use eesel: como es independiente del modelo, un Flash más barato y eficiente por debajo es una ganancia gratuita. Obtienes el ahorro sin decidir en qué modelo confiar ni reescribir nada. Esa es la forma correcta de disfrutar un lanzamiento como este, como una mejora del ingrediente, no como un producto que despliegas en bruto.
Prueba eesel
Gemini 3.6 Flash es un caballo de batalla realmente bueno, pero si la razón por la que te importa es "quiero automatizar mi cola de soporte", el modelo es el 10% fácil de ese proyecto. eesel es el otro 90%: aprende de tus tickets pasados y documentos de ayuda, simula el despliegue sobre tu historial real para que conozcas los números antes de salir a producción, y se conecta a Zendesk, Freshdesk, Gorgias y más de 100 herramientas en minutos.

Como es independiente del modelo, mejoras como esta llegan como una ganancia silenciosa de coste en lugar de una migración. El precio es basado en uso a 0,40 $ por conversación sin cuotas por asiento, y hay una prueba gratuita sin tarjeta. Si prefieres verlo con tus propios tickets antes que leer otro gráfico de benchmarks, para eso está exactamente la simulación.
Frequently Asked Questions
¿Cuánto cuesta Gemini 3.6 Flash?
¿Es Gemini 3.6 Flash mejor que 3.5 Flash?
¿Es Gemini 3.6 Flash bueno para atención al cliente?
¿Cómo se compara Gemini 3.6 Flash con GPT-5.6 y Claude?
¿Qué pasó con Gemini 3.5 Pro?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








