Análisis de Gemini 3.6 Flash: el nuevo caballo de batalla de Google, más barato y rápido

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 6, 2026

Verificado por expertos
Ilustración editorial para un análisis de Gemini 3.6 Flash, el modelo de IA workhorse rápido de Google

Qué es realmente Gemini 3.6 Flash

El logo de Google Gemini, tomado de TechCrunch
El logo de Google Gemini, tomado de TechCrunch

Google divide Gemini en niveles: Pro para el razonamiento más difícil, Flash para el trabajo cotidiano y Flash-Lite para tareas baratas de alto volumen. Gemini 3.6 Flash es el nivel intermedio, y Google lo llama a propósito el "workhorse". Es el modelo al que recurres cuando ejecutas algo miles de veces al día y te importa tanto el coste y la latencia como la inteligencia bruta.

Se construye directamente sobre 3.5 Flash y sobre los comentarios de los desarrolladores que lo usan. El mensaje principal es la eficiencia: menos pasos de razonamiento y llamadas a herramientas para terminar un trabajo de varios pasos, menos divagación en sus respuestas y un precio más bajo por token de salida. También llega con un corte de conocimiento más reciente, que avanza de enero de 2025 a marzo de 2026.

Por debajo tienes lo que esperarías de un modelo moderno: una ventana de contexto de 1.048.576 tokens, entrada multimodal de texto, imagen, vídeo, audio y PDF, además de llamadas a funciones, salida estructurada, ejecución de código, caché de contexto y fundamentación mediante búsqueda. El uso del ordenador, donde el modelo maneja un navegador o un escritorio, es ahora una herramienta integrada del lado del cliente en vista previa.

La verdadera historia es la eficiencia

Aquí está el número que me hizo prestar atención. En el benchmark de programación DeepSWE, 3.6 Flash termina la tarea media con 97.000 tokens de salida frente a los 276.000 que consumía 3.5 Flash, un recorte de alrededor del 65%. En el Artificial Analysis Index más amplio, la diferencia es menor pero sigue siendo real, de 28K a 23K.

Gemini 3.6 Flash usa muchos menos tokens de salida por tarea que 3.5 Flash, tomado de 9to5Google
Gemini 3.6 Flash usa muchos menos tokens de salida por tarea que 3.5 Flash, tomado de 9to5Google

¿Por qué importa más el número de tokens que el precio de lista? Porque los tokens de salida son donde realmente se acumula la factura, y un agente es una máquina que gasta tokens. Un solo ticket de soporte gestionado por un agente no es una sola llamada al modelo, es una cadena: leer el ticket, buscar en la base de conocimiento, decidir, quizá llamar a una herramienta, redactar, comprobar. Cada paso gasta tokens. Reduce los tokens por paso y reduces el coste de toda la cadena, además de la tarifa por token más baja.

Esto también es por lo que el enfoque de "workhorse" es honesto. En un flujo de trabajo real de agentes, la mayoría de los pasos son rutinarios y se dirigen al modelo barato, mientras que solo los pasos realmente difíciles necesitan un modelo puntero, si es que lo necesitan. Así que la mayor parte de tu factura vive en el carril del workhorse, y hacer ese carril un 17% más barato por token y mucho más eficiente por tarea es más importante que un lanzamiento más vistoso de un Pro.

Cómo un agente de IA dirige la mayoría de sus pasos a un modelo workhorse barato y solo unos pocos a un modelo puntero más caro
Cómo un agente de IA dirige la mayoría de sus pasos a un modelo workhorse barato y solo unos pocos a un modelo puntero más caro

Benchmarks: dónde gana, dónde pierde

Frente a su propia familia, 3.6 Flash es un salto claro. El gráfico de Google muestra que supera tanto a 3.5 Flash como al 3.1 Pro del año pasado en programación de largo horizonte, ingeniería de ML, trabajo de conocimiento y uso del ordenador.

Gemini 3.6 Flash supera a las generaciones anteriores en los benchmarks de agentes, tomado de Google
Gemini 3.6 Flash supera a las generaciones anteriores en los benchmarks de agentes, tomado de Google

La pregunta más útil es cómo se compara con los modelos entre los que realmente elegirías. Google publicó una tabla comparativa, y hay que reconocerle que no esconde las derrotas.

Gemini 3.6 Flash comparado con GPT-5.6 Luna, Grok 4.5 y Claude Sonnet 5, tomado de 9to5Google
Gemini 3.6 Flash comparado con GPT-5.6 Luna, Grok 4.5 y Claude Sonnet 5, tomado de 9to5Google

Si lees esa tabla con honestidad, aparece una forma clara. En las pruebas más duras de programación con agentes, 3.6 Flash se queda por detrás de los modelos punteros: 58,7% en SWE-Bench Pro frente al 64,7% de Grok 4.5 y el 63,2% de Claude Sonnet 5, y 49% en DeepSWE frente al 67% de GPT-5.6 Luna. En trabajo de conocimiento (GDPval-AA v2) su Elo de 1421 queda muy por debajo de GPT-5.6 (1584) y Claude Sonnet 5 (1607).

Pero si nos fijamos en las tareas que se corresponden con el trabajo real de agentes, lidera todo el tablero: 83,0% en OSWorld-Verified (uso del ordenador), 89,4% en razonamiento con gráficos de CharXiv, 83,2% en vídeo largo de LVBench, y un enorme 91,8% en la memoria de contexto largo de GDM-MRCR, donde el rival más cercano está en los 70. Para un modelo que cuesta una quinta parte de Claude Sonnet 5 en salida, es un resultado muy sólido justo en las dimensiones que importan para el trabajo con agentes.

Mi lectura: esto es un caballo de batalla, no un campeón. Si tu trabajo es ingeniería de software profunda y novedosa, los modelos punteros todavía tienen ventaja. Si tu trabajo es ejecutar muchas tareas fundamentadas, con uso de herramientas y con mucho documento, de forma barata, 3.6 Flash es una de las mejores opciones de valor del mercado ahora mismo.

El precio en detalle

Aquí está la visión del dinero. Todas las cifras son por 1M de tokens en el nivel Standard de pago, de la página de precios de la API de Gemini.

ModeloEntradaSalidaLote (entrada / salida)Caché de contexto
Gemini 3.6 Flash$1.50$7.50$0.75 / $3.75$0.15/1M + $1.00/1M/hr
Gemini 3.5 Flash (anterior)$1.50$9.00$0.75 / $4.50$0.15/1M
Gemini 3.5 Flash-Lite$0.30$2.50$0.15 / $1.25$0.075/1M

Hay unas cosas que merece la pena señalar. El precio de entrada se mantiene igual, así que todo el ahorro está en la salida, que como vimos es donde gastan los agentes. El modo por lotes es un 50% de descuento plano si puedes tolerar el procesamiento asíncrono. La salida incluye los tokens de razonamiento, así que una respuesta de "razonamiento" factura su trabajo de borrador como salida, otra razón por la que la ganancia de eficiencia de tokens se acumula. Y hay un nivel gratuito genuino para pruebas, aunque en el nivel gratuito tu contenido puede usarse para mejorar los productos de Google, así que mantén los datos de producción en el nivel de pago.

Para hacer tangible la relación coste-beneficio, introduce tu propio volumen:

Con 50M de tokens de salida al mes, pasar de 3.5 Flash a 3.6 Flash ahorra 75 $, sin contar todavía la ganancia de eficiencia de tokens. Al volumen real de un agente, esa diferencia se amplía rápido.

Los dos modelos compañeros

3.6 Flash no llegó solo. Gemini 3.5 Flash-Lite es el nivel económico, a 0,30 $ de entrada / 2,50 $ de salida, y Google dice que ahora supera cómodamente al antiguo 3.1 Flash-Lite en programación de terminal y trabajo de conocimiento, mientras funciona lo bastante rápido para trabajos de alto rendimiento como clasificación y enrutamiento.

Benchmarks de Gemini 3.5 Flash-Lite frente a 3.1 Flash-Lite, tomado de Google
Benchmarks de Gemini 3.5 Flash-Lite frente a 3.1 Flash-Lite, tomado de Google

El tercer modelo, Gemini 3.5 Flash Cyber, es un especialista ajustado para trabajos de ciberseguridad, y está restringido a gobiernos y socios de confianza en lugar de estar disponible de forma general. La mayoría de los equipos nunca lo tocarán, pero señala dónde cree Google que se concentra buena parte del valor de los agentes a corto plazo.

Lo que falta: sin Pro, y un adelanto de Gemini 4

El elefante en la habitación es el modelo que Google no lanzó. La línea insignia Gemini Pro se actualizó por última vez en febrero de 2026, Google adelantó un 3.5 Pro en mayo, y luego se retrasó. El responsable de producto Logan Kilpatrick lo planteó como un trabajo en curso y no como una cancelación:

"3.5 Pro is testing with partners and we hope to land it soon."

Al mismo tiempo, el equipo ya está mirando más allá:

"We've kicked off the pre-training run for Gemini 4, our most ambitious yet."

TechCrunch interpretó el lanzamiento como que Google mantiene el ritmo en el extremo barato y de alto volumen del mercado mientras su respuesta puntera a GPT-5.6 y Claude Sonnet 5 sigue en el taller. Me parece una lectura justa. También significa que, si necesitas razonamiento de nivel puntero hoy mismo, Gemini no es donde lo vas a encontrar esta semana.

Entonces, ¿merece la pena Gemini 3.6 Flash?

Si ya estás construyendo sobre Gemini Flash, es un sí fácil. Es más barato, más eficiente y mejor en casi todos los benchmarks que el modelo al que sustituye, sin ninguna desventaja real. Cambia y sigue adelante.

Si estás eligiendo entre familias, hay que ser honesto sobre el trabajo. Para ingeniería profunda y novedosa, los modelos punteros todavía tienen ventaja. Para trabajo fundamentado, intensivo en herramientas, orientado a documentos y pantallas, a gran escala, 3.6 Flash destaca en relación calidad-precio.

Un mapa de posicionamiento de los modelos Gemini de Google por coste y profundidad de razonamiento, con 3.6 Flash en el punto óptimo
Un mapa de posicionamiento de los modelos Gemini de Google por coste y profundidad de razonamiento, con 3.6 Flash en el punto óptimo

El único punto en el que discreparía del entusiasmo es el salto que hace algunas personas de "modelo barato genial" a "bot de soporte genial". No son lo mismo, y la brecha entre ambos es donde la mayoría de los proyectos de soporte con IA fallan en silencio.

Un modelo no es un agente de soporte

Yo construyo las integraciones que ponen modelos como este en colas de soporte reales, así que déjame ser directo sobre lo que un lanzamiento de modelo cambia y no cambia para ese trabajo. El modelo es la capa de materia prima en la base de la pila. Todo lo que hace que un agente de IA sea realmente seguro para poner frente a los clientes está por encima de él.

Qué convierte a un modelo fundacional en bruto en un agente de soporte desplegado: fundamentación, simulación, barreras de seguridad e integraciones
Qué convierte a un modelo fundacional en bruto en un agente de soporte desplegado: fundamentación, simulación, barreras de seguridad e integraciones

He visto a un modelo con aspecto seguro dar a un cliente una respuesta limpia, bien escrita y completamente equivocada. Por eso cada despliegue de eesel se simula contra tus tickets históricos antes de responder nunca a una persona real, para que veas la cobertura y la precisión por tema y puedas arreglar los huecos primero. También es por lo que confiamos en el enrutamiento basado en confianza: las respuestas de baja confianza se convierten en borradores, no en respuestas automáticas.

Esa capa es lo que convierte "existe un modelo rápido" en que smava ejecute un agente de Zendesk totalmente automatizado sobre más de 100.000 tickets en alemán al mes, o que Gridwise resuelva el 73% de las solicitudes de nivel 1 en su primer mes. Nada de eso es el modelo. Es la fundamentación, la simulación, las barreras de seguridad y las integraciones con el helpdesk que lo rodean.

La buena noticia para quien use eesel: como es independiente del modelo, un Flash más barato y eficiente por debajo es una ganancia gratuita. Obtienes el ahorro sin decidir en qué modelo confiar ni reescribir nada. Esa es la forma correcta de disfrutar un lanzamiento como este, como una mejora del ingrediente, no como un producto que despliegas en bruto.

Prueba eesel

Gemini 3.6 Flash es un caballo de batalla realmente bueno, pero si la razón por la que te importa es "quiero automatizar mi cola de soporte", el modelo es el 10% fácil de ese proyecto. eesel es el otro 90%: aprende de tus tickets pasados y documentos de ayuda, simula el despliegue sobre tu historial real para que conozcas los números antes de salir a producción, y se conecta a Zendesk, Freshdesk, Gorgias y más de 100 herramientas en minutos.

Vista general del panel del helpdesk de IA de eesel
Vista general del panel del helpdesk de IA de eesel

Como es independiente del modelo, mejoras como esta llegan como una ganancia silenciosa de coste en lugar de una migración. El precio es basado en uso a 0,40 $ por conversación sin cuotas por asiento, y hay una prueba gratuita sin tarjeta. Si prefieres verlo con tus propios tickets antes que leer otro gráfico de benchmarks, para eso está exactamente la simulación.

Frequently Asked Questions

¿Cuánto cuesta Gemini 3.6 Flash?
En el nivel Standard de pago, Gemini 3.6 Flash cuesta 1,50 $ por 1M de tokens de entrada y 7,50 $ por 1M de tokens de salida. La entrada no cambia respecto a 3.5 Flash, pero la salida baja desde 9,00 $, un recorte de aproximadamente el 17%. El modo por lotes reduce ambos precios a la mitad, y existe un nivel gratuito para pruebas. Como opción más económica, Gemini 3.5 Flash-Lite cuesta 0,30 $ de entrada / 2,50 $ de salida. Si prefieres pagar por ticket resuelto en lugar de por token, el precio basado en uso de eesel empieza en 0,40 $ por conversación.
¿Es Gemini 3.6 Flash mejor que 3.5 Flash?
Sí, en casi todos los aspectos. Según las propias cifras de Google, usa un 17% menos de tokens de salida, pasa de 37% a 49% en DeepSWE y de 49,7% a 63,9% en MLE-Bench, y cuesta menos por token de salida. Es una actualización directa para cualquiera que ya use Gemini.
¿Es Gemini 3.6 Flash bueno para atención al cliente?
Un modelo rápido y barato es un buen ingrediente, pero un modelo en bruto no es un agente de soporte por sí solo. Todavía necesita basarse en tus documentos de ayuda y tickets pasados, probarse antes de salir a producción y conectarse a tu helpdesk. Esa es la capa que gestiona un agente de IA para helpdesk, y por eso simulamos cada despliegue sobre tickets históricos primero.
¿Cómo se compara Gemini 3.6 Flash con GPT-5.6 y Claude?
En los benchmarks más difíciles de programación y trabajo de conocimiento se queda por detrás de GPT-5.6 de OpenAI y de Claude Sonnet 5, pero lidera a ambos en uso del ordenador, razonamiento con gráficos y memoria de contexto largo, y es mucho más barato que Sonnet 5. Consulta nuestra comparación Claude vs ChatGPT para ver el panorama de los modelos punteros.
¿Qué pasó con Gemini 3.5 Pro?
Google lanzó Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber, pero no 3.5 Pro. El responsable de producto Logan Kilpatrick dijo que Pro está en pruebas con socios después de, según se informa, no cumplir los objetivos internos, mientras el equipo ya ha empezado el preentrenamiento de Gemini 4.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración para una recopilación de las mejores alternativas a Google Gemini 3.6 Flash en 2026
AI

Las 6 mejores alternativas a Gemini 3.6 Flash en 2026

Las mejores alternativas a Gemini 3.6 Flash en 2026, con precios y benchmarks reales: GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite y más.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Ilustración de una ficha del modelo Kimi K3 junto a una fila de tarjetas de planes de precios, en azul Kimi
AI

Precios de Kimi K3: lo que realmente cuesta el modelo de frontera de Moonshot

Los precios de Kimi K3, descifrados: la tarifa de API de 3/15 dólares, los planes de app de 19 a 199 dólares, cómo el descuento del 90% por caché cambia las cuentas, y cómo se compara con Claude, GPT y DeepSeek.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 17, 2026
Dos personas conversando con formas de onda de voz entre ellas y el logo de Grok arriba
AI

Grok Voice Think Fast 2.0: análisis rápido, preciso y con límites

Un análisis práctico de Grok Voice Think Fast 2.0: la realidad de los benchmarks, las particularidades de la API y el límite de 10 sesiones que decide si puedes lanzarlo a producción.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Banner ilustrado para un desglose de los precios de Flowith, mostrando los niveles de suscripción y un modelo de facturación basado en créditos
AI

Precios de Flowith (2026): planes, créditos y el coste real

Un desglose completo de los precios de Flowith: los cuatro niveles basados en créditos, lo que realmente compra un crédito, los detalles que no aparecen en la página de precios y para quién es cada plan.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración de un lienzo de IA ramificado generando imágenes, diapositivas y texto
AI

Flowith review: ¿vale la pena el lienzo con agentes de IA? (2026)

Una review práctica de Flowith: qué hacen realmente el lienzo ramificado y Agent Neo, cuánto cuesta Flowith en créditos, y quién debería evitarlo.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Banner ilustrado para una guía sobre Flowith, el espacio de trabajo creativo con agentes de IA construido sobre un lienzo infinito de nodos
AI

¿Qué es Flowith? El lienzo de agentes IA, Agent Neo y sus precios

Flowith es un agente de IA que funciona sobre un lienzo infinito en lugar de una caja de chat. Esto es lo que hace realmente Agent Neo, cuánto cuesta y para qué sirve.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración editorial de portada para Muse Image de Meta, un modelo agéntico de generación de imágenes con IA, en azul de Meta
AI

Muse Image de Meta: qué hace y qué tan bueno es

Muse Image de Meta es un modelo de imagen agéntico y gratuito que busca en la web y escribe código a mitad de la generación. Esto es lo que puede hacer y qué tan bueno es en realidad.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

¿Qué es Buzz? El espacio de trabajo con IA de Jack Dorsey, explicado

Buzz es la nueva app de chat de equipo de código abierto de Jack Dorsey, donde personas y agentes de IA comparten los mismos canales. Esto es lo que es, para quién es y cuál es el truco.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Ilustración de un lienzo de constructor de agentes de IA sin código con nodos de flujo de trabajo
AI

Los 7 mejores constructores de agentes de IA sin código en 2026

Probé los principales constructores de agentes de IA sin código para equipos de soporte en 2026, desde Botpress hasta Copilot Studio, y ordené cuál encaja realmente con tu configuración.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis