
La pelea es Flash contra Luna, no contra Sol
GPT-5.6 son tres modelos, no uno, y el alias gpt-5.6 simplemente enruta a Sol. Por eso muchos enfrentamientos se leen raro. Ponen el nivel barato de DeepSeek contra el caro de OpenAI y luego concluyen que los modelos baratos son baratos.
Aquí está la tabla de precios completa tal como está hoy, nivel estándar, contexto corto, por millón de tokens.
| Modelo | Entrada | Entrada en caché | Salida | AA Intelligence Index |
|---|---|---|---|---|
deepseek-v4-flash | $0,14 | $0,0028 | $0,28 | 50 |
gpt-5.6-luna | $0,20 | $0,02 | $1,20 | 51 |
gpt-5.6-terra | $2,00 | $0,20 | $12,00 | 55 |
gpt-5.6-sol | $5,00 | $0,50 | $30,00 | 59 |
deepseek-v4-pro | $0,435 | $0,003625 | $0,87 | 44 |
Precios de la tabla de precios de DeepSeek y de la página de precios de OpenAI; puntuaciones del índice de Artificial Analysis. Fíjate en la última fila, que es toda una historia aparte: el nivel caro de DeepSeek ahora puntúa por debajo de su nivel barato, y expliqué por qué en Flash contra Pro.

El recorte del 30 de julio es la razón por la que existe este post. OpenAI bajó Terra un 20% y Luna un 80% en un solo anuncio: "Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." Cualquier comparación que todavía cite a Luna en $1,00 y $6,00 está desfasada por 5x. Si quieres el análisis nivel por nivel, cubrí GPT-5.6 Sol y GPT-5.6 Terra por separado.

Qué es realmente cada modelo
Flash es un modelo disperso de mezcla de expertos, 284B de parámetros totales y 13B activos, distribuido bajo licencia MIT, lo que significa que los pesos están en Hugging Face y eres libre de correrlos tú mismo. El equipo de vLLM describió la arquitectura el día del lanzamiento: "A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." Ignora la cifra de "304B" que aparece en algunos widgets de modelos; la configuración dice 284B.
GPT-5.6 tiene pesos cerrados, tres niveles, una única ficha técnica compartida. Los tres cargan 1.050.000 de contexto, 128.000 de salida máxima, y un corte de conocimiento del 16 de febrero de 2026, con entrada de texto e imágenes.
| DeepSeek V4 Flash | GPT-5.6 (todos los niveles) | |
|---|---|---|
| Pesos | MIT, abierto, ~167GB | Cerrado |
| Parámetros | 284B totales / 13B activos | No publicado |
| Contexto | 1M | 1.050.000 |
| Salida máxima | 384K | 128.000 |
| Entrada de imagen | No documentado | Sí |
| Búsqueda web | No documentado | Sí |
| Corte de conocimiento | No publicado | 16 feb 2026 |
| Modo de razonamiento | Activo por defecto, tres niveles de esfuerzo | Tokens de razonamiento compatibles |
| Descuento por caché | ~98% | 90% |
| Concurrencia | 2.500 | Según nivel, 500 a 30.000 RPM |
Dos particularidades que vale la pena conocer antes de escribir la configuración. En Flash, xhigh sirve en silencio como high, así que a partir de cierto punto no puedes subir más el razonamiento. En GPT-5.6, Fast mode reemplazó a Priority Processing en esa misma fecha del 30 de julio, y duplica la tarifa por "up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."
Si estás evaluando pesos abiertos de forma más amplia, los modelos de lenguaje pequeños y los agentes de código abierto son las dos comparaciones que más me preguntan junto a esta.
La lectura de los benchmarks: empate abajo, brecha real arriba
En el Artificial Analysis Intelligence Index v4.1, Flash se sitúa en 50, tercero entre los modelos de pesos abiertos, detrás de Kimi K3 con 57 y GLM 5.2 con 51. Luna está en 51, Terra en 55, Sol en 59, y Sol queda tercero en la tabla completa, detrás de dos modelos de Claude. Artificial Analysis resumió el lado del costo el día del lanzamiento:
"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."
La preferencia humana cuenta una historia distinta a la del índice compuesto. En el tablero de texto de LMArena, deepseek-v4-flash obtiene 1436 ±4 con 48.667 votos en el puesto 79, mientras que gpt-5.6-sol-xhigh es 15º en general. En WebDev, deepseek-v4-flash-high es 8º con 1577 y Sol es 6º con 1620. Así que el modelo abierto barato es competitivo en el índice automatizado y claramente inferior en comparación humana a ciegas, algo bastante esperable y que vale la pena decir en voz alta.
Tres advertencias sin las que no publicaría este post.
- El propio gráfico de DeepSeek es una selección. Como lo puso una lectura mesurada, la comparación "is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge" (Dr. Tomislav Marinovic, X).
- El salto despertó sospechas. DeepSWE pasó de 7,3 a 54,4 con el mismo número de parámetros, y una cuenta de IA dijo sin rodeos que un salto de puntuación justo después de una actualización huele a benchmaxxing, ya que la baja puntuación anterior de DeepSWE fue lo que expuso la versión previa.
- Flash es verboso y todavía alucina. Artificial Analysis midió 210M de tokens de salida para correr el índice frente a una mediana de 100M en su clase, y sitúa su tasa de alucinación de AA-Omniscience en 84%, 12 puntos menos que su predecesor. Luna también es verboso, con 130M de tokens frente a una mediana de 62M. Si alguna de estas cifras te importa, mis notas sobre cómo prevenir alucinaciones son la versión práctica.
Lo que realmente cuesta en tu carga de trabajo
Las tablas de precios engañan, porque la proporción entre dos modelos se mueve con la forma de tu tráfico, no solo con su volumen. La entrada en caché la cambia, el razonamiento intensivo en salida la cambia, y los prompts largos también. Elige el perfil que más se parezca al tuyo.
El número que me llevaría es el aburrido. En todas las formas de tráfico, Flash resulta unas 3x más barato que Luna, no el 4x que sugiere la columna de salida. Un comentarista de Hacker News resumió la misma disyuntiva desde la columna de costo por tarea y lo dijo bien: "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference" (spwa4, Hacker News). Otro publicó las tablas de precios lado a lado y llegó al mismo encogimiento de hombros:
"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."
Dónde el precio de lista deja de ser el precio
Cuatro cosas mueven la factura real, y entre los dos proveedores no son nada simétricas.
GPT-5.6 tiene un salto en 272K tokens de entrada. Cada página de modelo de GPT-5.6 lo dice igual: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." Cruzar ese límite retarifica toda la llamada, así que una solicitud a Sol pasa de $5 y $30 a $10 y $45. La ventana de 1M de Flash no tiene un equivalente publicado, lo que la convierte en la opción más estable para prompts de repositorios o historiales completos. También es un buen argumento para usar recuperación en lugar de rellenar el prompt en cualquiera de los dos modelos.

DeepSeek tiene pendiente un recargo de 2x en horas pico. La tabla de precios dice que la API "will soon adopt a peak/off-peak pricing policy" donde "during peak hours, prices will be 2x the regular prices, applicable to all billing items", con la ventana fijada de 9:00 a 12:00 y de 14:00 a 18:00 hora de Beijing, es decir de 01:00 a 04:00 y de 06:00 a 10:00 UTC. No hay fecha de inicio anunciada ni tabla de tarifas pico publicada, así que trátalo como un riesgo sobre el tráfico síncrono más que como un número.
El caché es donde la ventaja de DeepSeek es mayor y menos fiable. Su descuento de ~98% por acierto de caché supera el 90% que ofrecen OpenAI y la mayor parte de la industria, y está activo por defecto sin cambiar código. La trampa está en la mecánica: una solicitud solo se factura a la tarifa de acierto si coincide por completo con una unidad de prefijo en caché persistida, el caché es explícitamente best-effort, y las entradas se limpian "usually within a few hours to a few days" una vez que no se usan. No des por sentado el $0,0028 como un estado estable.
La facturación de terceros puede sorprenderte. Un usuario reportó la versión más extrema de esto: "The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff" (onlyrealcuzzo, Hacker News). Hay 11 proveedores sirviendo Flash en OpenRouter y DeepSeek no es el más barato de todos ellos, así que vale la pena revisar la medición por proveedor antes de escalar un bucle.
Lo que la gente reporta pagar de verdad
Esta es mi parte favorita de la reacción a DeepSeek, porque ahí la gente publica recibos en lugar de opiniones. Dos aparecieron sin que nadie los pidiera en el hilo de lanzamiento.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:
$19.27 USDAPI requests: 7,877Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."
Fíjate en lo que admite el segundo: el conteo de tokens que marea es barato porque es intensivo en caché, que es exactamente el primer perfil del widget de arriba. Un tercer usuario, corriendo un arnés de agente de 30 turnos, situó una sesión en "~$0.5 cost" y dijo que no había tocado su suscripción de Opus en semanas (kmarc, Hacker News).
Por otro lado, el recorte de precio de GPT-5.6 vino con cifras de clientes publicadas, lo más parecido a un recibo que tiene OpenAI. El líder de producto de IA de Notion dijo que el modelo más nuevo "delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time", y el CTO de Blitzy reportó que Luna "handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini" tras pasar de una única llamada de salida estructurada a un bucle de agente completo. Ambas son publicadas por los proveedores, así que léelas como orientativas y no como verificación independiente.
Las brechas de capacidad que realmente deciden
Si llegaste hasta aquí esperando que el precio lo resolviera todo, aquí viene el giro. Las dos cosas que deciden esta comparación para la mayoría de los equipos no están en la página de precios.
Flash no puede ver ni buscar. No hay entrada de imágenes documentada, y la búsqueda web no forma parte de la API. La gente lo resuelve combinando modelos en lugar de elegir uno, un patrón que yo copiaría: "Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly" (theturtletalks, Hacker News). Si tu cola de soporte está llena de capturas de pantalla, esa brecha termina la discusión por sí sola.
La velocidad no está medida en un lado y sí en el otro. Artificial Analysis lista la variante de razonamiento de Flash sin velocidad de salida, sin tiempo al primer token y sin tiempo total de respuesta, marcando la velocidad como "Unknown out of 4 units". La variante sin razonamiento sí tiene números, a 107 tokens por segundo. Luna corre a 177,8 tokens por segundo y Terra a 138. Sol es el caso raro: 67,7 tokens por segundo y 137,84s de tiempo al primer token, por debajo de la mediana de su propio nivel de precio, y algo que conviene saber antes de ponerlo detrás de cualquier cosa interactiva.

Los pesos abiertos son una opción real aquí, y las cuentas casi siempre dicen que no. Flash corre localmente, y los reportes son detallados: 60 tokens por segundo en sesión única sobre dos DGX Spark, ~30 en un M3 Ultra con 256GB, 32 en un Ryzen AI MAX+ 395 a unos 2,88 bits por parámetro. El problema es la factura de hardware, unos €8.200 para el montaje de dos Spark. El veredicto de consenso de alguien que hizo las cuentas: "it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons" (cmrdporcupine, Hacker News). La privacidad, sin embargo, no es una excepción pequeña, lo que nos lleva al último punto.
La retención de datos es la objeción que sigue ganando. La queja más repetida sobre Flash no es la calidad:
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."
Si pasas eso por la tabla de tarifas, la ventaja principal se evapora. El $0,28 de salida de Flash se convierte en $0,84 a $1,40, la misma franja que el $1,20 de Luna, y Luna viene con visión, búsqueda y un perfil de latencia documentado. Si tus tokens contienen datos de clientes, la historia del modelo barato y la historia del modelo seguro son la misma historia.

Mi veredicto
Elige DeepSeek V4 Flash para trabajo masivo de texto donde tú controlas los datos: agentes de código, revisión de código, resumen, clasificación, prefijos largos en caché, cualquier cosa que corrieras felizmente durante 30 turnos. Ahora mismo es la mejor inteligencia por dólar del tablero, y los recibos de arriba lo respaldan. También es la opción si los pesos abiertos te importan, porque la licencia y los pesos en Hugging Face son reales, no una promesa.
Elige GPT-5.6 Luna si necesitas imágenes o búsqueda, si la latencia es visible para el usuario, o si de todas formas ibas a enrutar por un host de retención cero, porque en ese punto estás pagando el precio de Luna por menos capacidad. Elige Sol solo cuando la tarea realmente necesite lo más alto del tablero, y revisa su tiempo al primer token antes de ponerlo cerca de una ventana de chat. Si ninguno encaja, las alternativas a GPT-5.6 cubren el resto del panorama, y mi reseña de GPT-5.6 tiene el detalle nivel por nivel.
O usa los dos, que es lo que en realidad hacen la mayoría de los equipos que escriben sobre esto. Enruta el texto masivo a Flash, las capturas de pantalla y la búsqueda a Luna, y mantén la lógica de enrutamiento en tu propio código para que el próximo recorte de precio sea solo un cambio de configuración. Eso está mucho más cerca de cómo lo construiría yo que apostar por un solo modelo, y es el mismo instinto detrás de correr la clasificación de tickets en un modelo más barato que el que redacta la respuesta.
Prueba eesel
Aquí está lo que esta comparación no puede responder por ti: el modelo es apenas el 2% de un ticket de soporte resuelto. Yo desarrollo integraciones en eesel, y lo que de verdad decide si un agente de IA resuelve un ticket o solo molesta al cliente es la recuperación de información sobre tu propio centro de ayuda, más reglas de escalado que saben cuándo detenerse, y luego una implementación probada contra tu propio historial de tickets antes de que un cliente la vea. Hemos visto bots con voz segura dar respuestas equivocadas, por eso simulamos cada implementación sobre tickets pasados antes de lanzarla, en vez de basarnos en una puntuación de benchmark.
La economía tampoco es economía de tokens. El costo bruto en tokens de una respuesta de soporte en Flash se redondea a casi nada; lo que aparece en tu factura es el costo por resolución, y eesel cobra por ticket sin cuota por asiento, así que un buen mes para tu IA no es un castigo. Un líder de Gridwise lo resumió sin rodeos: "In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." Una líder de experiencia de cliente en una marca de suplementos directa al consumidor planteó el lado de la confianza tal como yo lo haría: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Si quieres un agente de IA en Zendesk o Freshdesk que ya conozca tu centro de ayuda, se conecte durante una pausa para el café, y pueda probarse en seco con los tickets del trimestre pasado antes de responderle a nadie, eso es lo que construimos. Gratis para probar, y la simulación es la parte que yo usaría primero.

Vale la pena leer a continuación si estás eligiendo un modelo para soporte específicamente: qué LLM le va mejor al soporte, LLM específicos de dominio, y la versión honesta de cuánto cuesta la IA de soporte.
Preguntas frecuentes
¿Es DeepSeek V4 Flash mejor que GPT-5.6?
¿Cuánto más barato es DeepSeek V4 Flash que GPT-5.6?
¿DeepSeek V4 Flash admite imágenes como GPT-5.6?
¿Cómo es la ventana de contexto de DeepSeek V4 Flash comparada con GPT-5.6?
¿Es seguro DeepSeek V4 Flash para datos de clientes?
¿Qué modelo es más rápido, DeepSeek V4 Flash o GPT-5.6?
¿Debo usar DeepSeek V4 Flash o GPT-5.6 para atención al cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








