
La tabla de 60 segundos
Todo lo siguiente proviene de las páginas publicadas por cada proveedor, a fecha de 3 de agosto de 2026. Donde ambos proveedores miden lo mismo de forma diferente, lo he señalado en vez de suavizarlo.
| Qwen 3.8 Max | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | |
|---|---|---|---|---|
| ID del modelo | qwen3.8-max | gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna |
| Lanzamiento | 2 ago 2026 | 9 jul 2026 | 9 jul 2026 | 9 jul 2026 |
| Entrada / 1M | $2.00 | $5.00 | $2.00 | $0.20 |
| Salida / 1M | $6.00 | $30.00 | $12.00 | $1.20 |
| Entrada en caché / 1M | $0.25 | $0.50 | $0.20 | $0.02 |
| Recargo por contexto largo | No publicado | 2x entrada, 1.5x salida por encima de 272K | Igual | Igual |
| Ventana de contexto | 1.000.000 | 1.050.000 | 1.050.000 | 1.050.000 |
| Salida máxima | 131.072 | 128.000 | 128.000 | 128.000 |
| Tokens de razonamiento máximos | 262.144 | No publicado | No publicado | No publicado |
| Modalidades de entrada | Texto, imagen, video | Texto, imagen | Texto, imagen | Texto, imagen |
| Parámetros | 2.4T total, 95B activos | No publicado | No publicado | No publicado |
| Fecha límite de conocimiento | No publicado | 16 feb 2026 | 16 feb 2026 | 16 feb 2026 |
| Ficha del modelo | Ninguna | Sí | Sí | Sí |
| Pesos abiertos | Prometido, no entregado | No | No | No |
| Límite de tasa (nivel superior) | 15K RPM / 2M TPM | 15K RPM / 40M TPM | Igual que Sol | 30K RPM / 180M TPM |
| Disponible en chat de consumo | Qwen Studio | ChatGPT | Solo Codex y Work | Solo Codex y Work |
| Control de razonamiento | reasoning_effort: low / medium / xhigh | Esfuerzo de razonamiento incl. max | Igual | Igual |
Dos filas merecen una segunda mirada. Qwen es el único de los cuatro que acepta video como entrada, lo cual es una brecha de capacidad real y no un simple adorno en la ficha técnica. Y Qwen es el único sin fecha límite de conocimiento publicada, sin ficha de modelo y sin ficha de sistema, lo cual es una brecha de evidencia real.
Qué es realmente Qwen 3.8 Max
Qwen es la familia de modelos de Alibaba Cloud, y Max es la línea insignia propietaria que se sitúa por encima de los niveles más baratos Plus y Turbo. Qwen 3.8 Max es el más reciente, y se lanzó en dos actos.
Si quieres conocer primero la familia completa, mi reseña de Qwen cubre los niveles anteriores, y la reseña independiente de Qwen 3.8 Max profundiza solo en este modelo.
El primer acto fue el 19 de julio en la Conferencia Mundial de IA en Shanghái: un endpoint de vista previa, dos publicaciones en X, y una afirmación oral de ranking de vanguardia sin ninguna tabla. El segundo acto fue el 2 de agosto, cuando Alibaba publicó una entrada de lanzamiento de 5.000 palabras con todo lo que faltaba en la vista previa.
La arquitectura, tal como la describe Alibaba: 2,4 billones de parámetros totales con 95.000 millones activos, un modelo disperso de mezcla de expertos construido sobre la base de Qwen 3.5. Esa cifra de 95B activos es la que importa y la que se omitió en la vista previa. Los parámetros totales fijan el titular; los parámetros activos fijan tu latencia y tu factura.
La afirmación multimodal es lo genuinamente nuevo para la línea Max. La página del modelo de Alibaba enumera entrada de imagen, texto y video, y la entrada de lanzamiento pone cifras concretas: informes financieros y PDFs de más de 200 páginas, y video "de más de 100 horas" organizado en lo que Alibaba llama un grafo de memoria de video. Vale la pena señalarlo con honestidad: ambas configuraciones de arnés que Alibaba publica en esa misma entrada declaran solo texto e imagen. El video parece ser una ruta nativa de DashScope, no algo que se obtenga a través del endpoint compatible con OpenAI.

El razonamiento se controla con reasoning_effort, que acepta low, medium y xhigh, siendo xhigh el valor predeterminado. Alibaba también activa preserve_thinking por defecto "para la mejor experiencia lista para usar", que es una forma educada de decir que el modelo está ajustado para pensar mucho antes de responder. Ten esto presente, porque más adelante reaparece como un problema de coste.
Qué es realmente GPT-5.6
GPT-5.6 no es un solo modelo. Son tres niveles de capacidad que se lanzaron de forma general el 9 de julio: Sol como buque insignia, Terra como el intermedio equilibrado, y Luna como el rápido y barato. Desglosé cada uno en una reseña completa de GPT-5.6. Los tres comparten la misma ventana de contexto de 1.050.000 tokens, el mismo límite de salida de 128.000 tokens, y la misma fecha límite de conocimiento del 16 de febrero de 2026.
Luego, el 30 de julio, OpenAI hizo algo que reseteó silenciosamente toda esta comparación. Bajó los precios en dos de los tres niveles:
"A partir del 30 de julio, el precio de la API es de $2 por millón de tokens de entrada y $12 por millón de tokens de salida para Terra, y $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida para Luna. El precio de Sol permanece sin cambios."
Eso es un 20% de descuento en Terra y un 80% en Luna. Sol se mantuvo en $5 y $30. Si lees una comparación de precios de GPT-5.6 escrita a mediados de julio, está equivocada por hasta 5 veces en el caso de Luna.
La misma actualización renombró Priority Processing a modo Fast, que duplica el precio a cambio de hasta 2,5 veces la velocidad en Sol. Y OpenAI añadió algo que Qwen no tiene: un recargo por contexto largo. Los prompts de más de 272K tokens de entrada se cobran a 2x en entrada y 1.5x en salida para toda la solicitud, no solo para el excedente. Cruzar esa línea convierte una llamada de $5/$30 en Sol en una de $10/$45. Así que la ventana real de un millón de tokens de Sol es una ventana de un millón de tokens por la que pagas el doble.
Benchmarks: dos tablas, ningún árbitro
Aquí es donde la mayoría de las comparaciones cara a cara se equivocan. Ambos laboratorios publican ahora una tabla. Ninguna tabla fue ejecutada por alguien independiente, y las dos no se pueden superponer.

Empecemos con lo que publicó Alibaba, porque es inusualmente directo: su tabla incluye GPT-5.6 Sol (max) como columna de comparación. Directamente de esa tabla:
| Benchmark | Qwen 3.8 Max | GPT-5.6 Sol (max) | Ganador |
|---|---|---|---|
| SWE-Pro | 67.7 | 64.6 | Qwen |
| TerminalBench-2.1 | 86.6 | 88.8 | Sol |
| PaperBench | 93.0 | 90.5 | Qwen |
| FrontierSWE | 73.5 | 88.8 | Sol, por 15.3 |
| CoWorkBench | 74.8 | 71.5 | Qwen |
| JobBench | 53.4 | 45.4 | Qwen |
| Agents' Last Exam | 52.4 | 53.6 | Sol |
| CharXiv (RQ) | 93.5 | 89.1 | Qwen |
| ERQA | 77.8 | 70.0 | Qwen |
| PerceptionBench | 63.5 | 59.7 | Qwen |
| LVBench | 81.8 | 78.8 | Qwen |
| Vision2Web | 69.0 | 62.1 | Qwen |
| OSWorld-Verified | 86.1 | 83.2 | Qwen |
Trece de dieciséis para Qwen, y cada fila de visión es una victoria limpia de Qwen. Ese es un resultado real y no voy a restarle importancia.
Pero lee las notas al pie, algo que casi nadie hace. Alibaba revela que seis de los benchmarks de codificación son evaluaciones internas propias (QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench, CoWorkBench, RecreationBench), que las puntuaciones de la competencia se tomaron de arneses mixtos en lugar de condiciones idénticas, y que varias filas son evaluadas por modelos rivales: gemini-3.1-pro-preview evalúa PLawBench, Claude Opus 4.6 evalúa PaperBench. También hay una línea que admite que los resultados de Fable 5 "pueden implicar recursos alternativos".
Ahora los terceros, que dividen el veredicto claramente por la mitad. En Artificial Analysis, cuyo Intelligence Index v4.1 es un compuesto automatizado de nueve evaluaciones, GPT-5.6 Sol puntúa 59 y ocupa el tercer lugar general, por detrás de Claude Opus 5 y Claude Fable 5, con Terra en 55 y Luna en 51.
En LMArena, que es votación por preferencia humana, qwen3.8-max se sitúa en el puesto #5 en Texto con 1496 y #4 en WebDev con 1668, ambos por delante de gpt-5.6-sol-xhigh en los puestos #15 y #6. La misma división entre lo automatizado y lo humano aparece en mi comparación de GPT-5.6 vs Claude.
Así que: el compuesto automatizado dice Sol, la preferencia humana dice Qwen. Cualquiera que cite solo uno de los dos te está vendiendo algo.
La lectura de la comunidad es más directa. Del hilo de Hacker News sobre la vista previa:
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
La comparación de precios que todos entienden al revés
La historia que se escribió sola en julio fue que un laboratorio chino había superado a OpenAI en precio. A $2 y $6 frente a los $5 y $30 de Sol, eso es cierto. Frente al resto de la familia, no lo es.

Qwen 3.8 Max iguala el precio de entrada de Terra al céntimo y reduce a la mitad su precio de salida. Eso es una victoria genuina. Pero Luna supera a Qwen por 10 veces en entrada y 5 veces en salida, y no existía a ese precio cuando se fijó el relato de "los modelos chinos son más baratos".
También hay un problema de segundo orden, y es el que determina las facturas reales. Qwen se envía con el razonamiento xhigh activado por defecto y preserve_thinking habilitado. Los modelos verbosos cuestan más de lo que sugiere su tarifa de etiqueta, porque pagas por cada token de razonamiento. Artificial Analysis midió que Luna consumió 130 millones de tokens de salida para ejecutar su índice frente a una mediana de 62 millones, así que esto corta en ambas direcciones. El punto es que la tarifa por token y el coste por tarea son cifras diferentes, y solo una de ellas aparece en la página de precios.
Prueba con tus propios volúmenes:
Una advertencia más si estás mirando la suscripción mensual barata en lugar de la API. El endpoint qwen3.8-max-preview nunca se vendió por token en absoluto: solo estaba disponible a través del Plan de Tokens de Alibaba, a $6, $18 o $68 al mes en los niveles Personal. Esos planes funcionan con créditos con ventanas fijas de 5 horas y 7 días, los créditos no usados no se acumulan, y alcanzar cualquiera de los dos límites te pausa hasta que la ventana se reinicia. Alibaba tampoco publica el coeficiente de créditos por token, así que no puedes calcular tu coste de antemano. La oferta estelar de la vista previa, un 10% de las tarifas normales sumado a un 80% adicional de descuento entre las 22:00 y las 08:00, equivale a un 2% del consumo estándar, se aplica solo a los planes Personal, y desaparece con la vista previa. El modelo GA recibe en su lugar un descuento nocturno fijo del 50%.
Lo que realmente decide en la práctica
Los benchmarks miden capacidad. La producción mide capacidad dividida por paciencia. Todos los informes prácticos que encontré llegan a la misma queja, y no tiene que ver con la inteligencia.
Un desarrollador que ejecutó la misma conversión de diseño enriquecido en ambos modelos el día del lanzamiento:
"Same prompt for both for the conversion. I used OpenCode for the qwen version, but I encountered a significant amount of errors / timeouts while it was running. Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build."
Otro, tras probar cuatro modelos de vanguardia lado a lado durante varios días:
"Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA."
Ese mismo desarrollador publicó la contabilidad de tokens para una tarea de aplicación web, que es el dato de coste más útil que se ha publicado hasta ahora: Kimi K3 con $5.50, Qwen 3.8 Max con $6.30, Fable 5 con $30. La tarifa barata de Qwen es real, y aun así necesitó 18 millones de tokens de entrada frente a los 9,5 millones de Kimi para el mismo trabajo.
Los veredictos sobre el modelo en sí están divididos, algo que vale la pena decir claramente en lugar de promediarlo. Un usuario canceló su suscripción de Anthropic por esto. Otro lo calificó de "desastrosamente malo", describiendo un modelo que "se atasca en largos bucles de dudas sin ningún progreso". Ambos estaban probando la misma versión preliminar en las mismas dos semanas. Si esa disparidad te preocupa, las listas más seguras son mis resúmenes de alternativas a Qwen y alternativas a GPT-5.6, además de la reseña de Kimi K3 para el tercer contendiente en esta categoría.
Y algunas cosas simplemente no están publicadas. No hay fecha límite de conocimiento para Qwen 3.8 Max en ninguna parte, ni ficha de modelo, ni ficha de sistema, ni evaluación de seguridad. Los pesos abiertos prometidos para "la próxima semana" a partir del 2 de agosto no tienen licencia, ni fecha, ni repositorio. Si tu proceso de compras exige algo de eso, la respuesta hoy es que no existe.
Dónde termina un modelo de vanguardia y empieza el trabajo de soporte
Esta es la parte que más me importa, porque es donde veo a los equipos perder un trimestre entero.

Ninguno de estos modelos conoce tu política de reembolsos. Ninguno ha leído tus últimos 7.000 tickets. Ninguno tiene el más mínimo concepto de que el cliente que te está escribiendo tiene un plan empresarial y ya ha sido escalado dos veces. Una puntuación de benchmark no es un agente de soporte, y la brecha entre ambos es donde la mayoría de los proyectos de automatización de soporte con IA mueren en silencio.
La misma brecha explica por qué elegir un helpdesk con IA es un ejercicio distinto a elegir un modelo, y por qué la automatización de tickets depende de la recuperación de información y no del razonamiento en bruto.
Hemos pasado años ejecutando IA en colas de soporte reales, y el modo de fallo específico es peor que "la IA no lo sabe". Es la invención con confianza. Hemos tenido clientes de pago cuyos bots fabricaron respuestas a clientes reales cuando la búsqueda en la base de conocimiento no arrojó resultados: el bot de una empresa solar inventó condiciones de suscripción que no existían, y otro le envió a un cliente "Oxígeno", de la tabla periódica, como respuesta. Nada en un modelo de 2,4 billones de parámetros evita eso. Un modelo más grande simplemente dice lo incorrecto con más fluidez.
El control que realmente lo soluciona surgió en una llamada con un responsable de soporte que gestiona 7.000 tickets al mes, y no tiene nada que ver con la elección del modelo:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
Esa es una decisión de producto, no una decisión de modelo. Por eso eesel AI ejecuta una simulación sobre tickets históricos antes de que nada se ponga en marcha, para que veas la tasa de resolución y las respuestas reales sobre conversaciones pasadas reales primero.
También es la razón por la que las respuestas se enrutan según la confianza, redactando para un humano o escalando en lugar de adivinar. Funcionando así, Gridwise alcanzó un 73% de resolución de primer nivel en su primer mes.
La lectura estratégica sobre Qwen 3.8 Max frente a GPT-5.6 es, por tanto, un poco anticlimática: construye de forma que puedas intercambiar el motor. La capa de modelo mejora y se abarata cada pocas semanas. Kimi K3 llegó días antes que Qwen, el precio de Luna cayó un 80% en una sola tarde, y lo que lidere la tabla en septiembre aún no está en ella hoy. Un equipo que se conectó rígidamente a una sola API en julio ya está teniendo que rehacer todo el cableado.
Esa es también la respuesta honesta a "¿debería usar Gemini, Grok o Mistral en su lugar?". Probablemente, con el tiempo, para alguna tarea. Lo cual es precisamente el argumento para no preocuparse demasiado por quién gana este mes.
Entonces, ¿cuál deberías elegir?
Si estás lanzando un producto y quieres una sola respuesta:
- Trabajo intensivo en visión, video o documentos: Qwen 3.8 Max, sin lugar a dudas. Cada fila de visión en la tabla de Alibaba es una victoria de Qwen, y es el único de los cuatro que acepta video.
- Ingeniería de software difícil: GPT-5.6 Sol. Un 88.8 en FrontierSWE frente a 73.5 no es un margen de error, y es la propia cifra de Alibaba.
- Alto volumen, sensible a la latencia y al coste: GPT-5.6 Luna, y no hay comparación en precio. Vigila la verbosidad.
- Un caballo de batalla general donde quieres la mejor relación tarifa-capacidad: Terra y Qwen 3.8 Max son la verdadera pelea. Qwen tiene la mitad del precio de salida; Terra es más rápido y viene con ficha de modelo, fecha límite de conocimiento y un endpoint estable.
- Cualquier cosa de cara al cliente: ninguno de los dos por sí solo. Elige primero la capa y deja que ella elija el modelo. Las cuentas están en mi desglose de costes de agentes, y la lista de candidatos en mejores agentes de IA.
Lo que yo no haría es tratar la tabla del 2 de agosto como algo definitivo. Seis de esos benchmarks de codificación son de Alibaba, ningún tercero los ha vuelto a ejecutar, y el veredicto de la comunidad sobre la misma versión va desde "cancelé mi suscripción a Anthropic" hasta "desastrosamente malo". Dale un mes y espera cifras independientes.
Prueba eesel
Si llegaste aquí porque quieres un modelo que resuelva tickets en lugar de ganar tablas, ese es todo el sentido de eesel AI. Se conecta con Zendesk, Freshdesk y más de 100 herramientas más, aprende de tu centro de ayuda y de tus tickets pasados, y empieza a redactar en minutos.

El factor diferenciador es la rampa de confianza, no el motor. Simula sobre tu historial real de tickets, lee las cifras, empieza en modo borrador, y pasa a autónomo solo cuando estés satisfecho. Heredas cada avance de vanguardia, ya sea Qwen, GPT-5.6 o lo que se lance el próximo mes, sin tener que rehacer nada. Prueba eesel gratis, sin tarjeta de crédito.
Preguntas frecuentes
¿Es Qwen 3.8 Max más barato que GPT-5.6?
¿Cuál es mejor para programar, Qwen 3.8 Max o GPT-5.6 Sol?
¿Cuál es la ventana de contexto de Qwen 3.8 Max frente a GPT-5.6?
¿Es Qwen 3.8 Max de código abierto?
¿Puedo usar Qwen 3.8 Max o GPT-5.6 para atención al cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








