
Por qué soy yo quien te dice que frenes
Construyo agentes de IA en eesel, y mi trabajo diario es la parte aburrida que nadie capturaz en un screenshot: lo que pasa después de que el modelo da una respuesta. Hemos visto a un modelo con tono confiado entregarle a un cliente, tranquilamente, la política de reembolso equivocada, y por eso cada despliegue de eesel se simula ahora contra tickets históricos antes de que toque una bandeja de entrada real.
Así que cuando aterriza un modelo de 2,4T con un cartel de "solo por detrás de Fable 5", mi primer instinto no es el hype, sino: enséñame la evaluación, enséñame los parámetros activos, y enséñame qué hace en el ticket número 200, no en el de la demo. Esta review está escrita desde ese lugar. Si quieres la ficha técnica en crudo, el resumen de Qwen la tiene. Si quieres saber si Qwen 3.8 Max cambia algo para un equipo real esta semana, sigue leyendo.
Qué es en realidad Qwen 3.8 Max
Qwen 3.8 Max es el buque insignia de la familia Qwen de Alibaba, y el primer modelo multimodal del equipo por encima de 1 billón de parámetros. La forma confirmada, según el propio anuncio de Alibaba:
- 2,4 billones de parámetros totales, construido como un modelo disperso de Mixture-of-Experts (MoE), así que solo una fracción de esos parámetros se activa en cada token.
- Multimodal: procesa texto, imágenes, vídeo y documentos en un único modelo.
- Ventana de contexto de 1M de tokens, heredada de Qwen 3.7 Max.
- Compatible con las API tanto de OpenAI como de Anthropic, así que puedes apuntar tus herramientas actuales sin reescribirlas.
- Alibaba dice que supera a Qwen 3.7 Max en programación, desarrollo full-stack, análisis de datos y flujos de trabajo de oficina.

La palabra que hace todo el trabajo aquí es Preview. El nombre público es Qwen3.8-Max-Preview. El desarrollador Shuai Bai lo describió como un modelo "en evolución continua", que en cristiano significa: esto es un objetivo temprano y en movimiento, no una versión cerrada.
El número que Alibaba no publicó
El total de parámetros hace un gran titular. El número que en realidad decide tu coste y velocidad son los parámetros activos, cuántos de esos 2,4T se disparan por token. Alibaba no lo ha revelado. Eso no es una nota al pie. Para un modelo MoE, los parámetros activos son la mayor parte de lo que determina el coste de servir el modelo, la latencia y si algún día lo ejecutarías tú mismo. Un modelo de 2,4T con, digamos, 40B activos se comporta de forma muy distinta en tu factura que uno con 200B activos. Hasta que ese número sea público, cualquier afirmación de "es barato de ejecutar" o "es caro de ejecutar" es solo una suposición.
La afirmación de "solo por detrás de Fable 5", desglosada
Esta es la frase que todo el mundo repitió, así que seamos precisos sobre qué es y qué no es.
En su cuenta oficial, Qwen posiciona el modelo como "uno de los modelos más potentes disponibles hoy... solo por detrás de Fable 5". Las acciones de Alibaba incluso subieron con el anuncio.
Aquí está la trampa: no hay tabla de benchmarks publicada. No hay cifras que demuestren que le gana a Fable 5, que le pierde, que le gana a GPT-5.1 o que le gana a Claude Opus. El ranking descansa por completo en la evaluación interna de Alibaba, y ningún tercero (Artificial Analysis, LMArena) le ha puesto puntuación todavía. En Hacker News, los escépticos señalaron rápido que Qwen tiene fama de ser especialista en benchmarks, y "confía en nosotros, es el número 2" es exactamente el tipo de afirmación para la que existe una tabla de benchmarks.
A 2.4T-parameter multimodal preview shipped before any benchmark, model card, or license.
Ese es el estado honesto de las cosas. No estoy diciendo que la afirmación sea falsa, no lo sé, y tampoco lo sabe nadie fuera del equipo de evaluación de Alibaba. Lo que digo es que deberías tratar "solo por detrás de Fable 5" como marketing hasta que un tercero le ponga puntuación, igual que harías con cualquier lanzamiento de modelo nuevo.
Precios y acceso: qué puedes tocar de verdad hoy
Qwen3.8-Max-Preview está disponible a través de tres vías: la suscripción Token Plan de Alibaba, y las plataformas agénticas Qoder y QoderWork. Durante la preview funciona al 10% del precio estándar.
Token Plan funciona por créditos, que se renuevan en una ventana de 7 días:
| Plan | Precio | Créditos (por 7 días) | A destacar |
|---|---|---|---|
| Lite | $6 | 2.500 | Nivel de entrada para probar la preview |
| Pro | $68 | 40.000 | Ejecuta de 6 a 8 agentes en paralelo |
Algunas cosas que conviene señalar antes de sacar la tarjeta:
- No hay una tarifa por token publicada específicamente para 3.8 Max. Si necesitas precios por token predecibles hoy mismo, los niveles antiguos de Qwen son la apuesta más segura.
- Créditos, no tokens. Los sistemas de créditos hacen que el coste sea difícil de prever, sobre todo cuando el modelo subyacente es una preview "en evolución continua" cuyo consumo podría cambiar sin que te des cuenta.
- El descuento del 10% de la preview es temporal por definición. Presupuesta con la cifra sin descuento, no con la de promoción.

La comprobación de realidad del self-hosting
"Open-weight pronto" es la frase que emocionó a r/LocalLLaMA, y después la comunidad hizo las cuentas.
Un modelo de 2,4T con precisión de 4 bits necesita aproximadamente 1,2 terabytes solo para los pesos. Una única Nvidia H200 tiene 141GB. Incluso una caja con 8 tarjetas te deja con una aritmética incómoda y una lista muy corta de gente que realmente puede cargarlo. La lectura práctica: hacer self-hosting de Qwen 3.8 Max no es algo que vaya a hacer un equipo normal, haya pesos o no, hasta que aparezca una variante destilada o más pequeña. La promesa de open-weight importa para la comunidad investigadora y para un puñado de laboratorios bien financiados, no para el comprador medio que elige un helpdesk con IA.
Y "pronto" no tiene fecha, ni licencia, ni repositorio de Hugging Face todavía. Si tu plan depende de ejecutar esto internamente, ese plan es de momento vapor.
Entonces, ¿deberías usarlo? (un widget de decisión honesto)
La respuesta depende de verdad de lo que estés intentando hacer. Aquí va la decisión que yo tomaría para cada situación:
Dónde encaja esto para un equipo de soporte
Aquí está la parte que más me importa, porque es donde he visto a equipos quemar meses.
Un modelo de frontera es un motor en crudo. Para responder a un cliente de forma segura, sigues necesitando todo lo que hay alrededor: retrieval sobre tu centro de ayuda y tickets pasados, guardrails para que solo responda aquello de lo que está seguro, un traspaso limpio a un humano, reportes, y una forma de probar los cambios antes de que lleguen a personas reales. Qwen 3.8 Max no te da nada de eso. Te da un motor de texto y visión muy grande y muy capaz, y una API key.
El instinto de "simplemente lo construiremos sobre el modelo más nuevo" es fuerte, y casi siempre subestima esa capa que lo rodea. Un cliente de eesel lo resumió sin rodeos al hablar de la decisión de construir versus comprar:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Ese es el intercambio. Puedes conectar Qwen 3.8 Max tú mismo a tu helpdesk y quedarte con el mantenimiento para siempre, o puedes usar una capa que ya lo hizo. eesel está diseñado a propósito para ser agnóstico al modelo: funciona sobre modelos de frontera por debajo, se conecta a tu helpdesk actual y a tu conocimiento en minutos, y te deja simular sobre tickets históricos reales para que veas la tasa de resolución antes de salir en vivo, no después de que un cliente se queje.

Y hay un punto de control que la gente olvida: la responsable de CX de una marca de suplementos DTC que suelo citar lo clavó: "necesito una IA que solo gestione los tickets de los que está segura y que deje en paz a todos los demás". Ningún modelo, por grande que sea, te da ese control por sí solo. La capa sí lo hace.
Cómo se compara Qwen 3.8 Max con el resto
Si estás comparando modelos en julio de 2026, Qwen 3.8 Max es uno de tres grandes lanzamientos semi-abiertos en una ventana de dos semanas:
- Kimi K3 (Moonshot) se lanzó como un release realmente open-weight, lo que hace que el "pronto" de Qwen parezca reactivo.
- GPT-5.6 y Claude siguen siendo la frontera cerrada frente a la que Qwen se mide a sí mismo.
- Grok, Gemini y Mistral completan el campo de modelos que realmente evaluarías.
El diferenciador en el que se apoya Qwen es la escala más la promesa de open-weight. Pero para cualquiera que esté comparando agentes de IA para un caso de uso de negocio, el ranking en crudo del modelo es el eje equivocado. Lo que importa es el producto construido encima, y en ese eje una preview de 2,4T todavía no compite con nada, porque no hay producto, solo un motor. Si estás construyendo agentes para trabajo real, la guía de los mejores agentes de IA es mejor punto de partida que la afirmación de benchmark de cualquier modelo suelto.
Mi veredicto
Qwen 3.8 Max es una preview interesante y una señal clara de que los laboratorios chinos están corriendo duro en escala. Pero como algo a lo que apostarías esta semana, es prematuro: sin benchmarks, sin número de parámetros activos, sin licencia, sin self-hosting realista, y con precios de preview basados en créditos que van a cambiar. Pruébalo por $6 si tienes curiosidad. No construyas tu roadmap sobre él todavía.
Y si tu objetivo real son menos tickets y respuestas más rápidas, el modelo nunca fue la parte difícil. La capa que lo rodea sí lo es.
Preguntas frecuentes
¿Qué es Qwen 3.8 Max?
Qwen 3.8 Max es el modelo insignia de Alibaba, presentado como preview el 19 de julio de 2026 con el nombre Qwen3.8-Max-Preview. Es un modelo multimodal disperso de tipo Mixture-of-Experts con 2,4 billones de parámetros (texto, imágenes, vídeo, documentos) y una ventana de contexto de 1M de tokens. Consulta la review de Qwen más completa para el contexto de toda la familia.
¿Cuánto cuesta Qwen 3.8 Max?
Durante la preview funciona al 10% del precio estándar a través del Token Plan de Alibaba, que es por créditos: desde un nivel Lite de $6 (2.500 créditos cada 7 días) hasta un nivel Pro de $68 (40.000 créditos, 6-8 agentes en paralelo). Todavía no se ha publicado una tarifa dedicada por token para 3.8 Max; para eso, revisa los precios actuales de Qwen.
¿De verdad Qwen 3.8 Max está "solo por detrás de Fable 5"?
Esa es una afirmación del propio Alibaba, basada en evaluaciones internas. Ningún tercero (Artificial Analysis, LMArena) le ha puesto puntuación todavía, y no se ha publicado ninguna tabla de benchmarks, así que trátalo como una afirmación de posicionamiento y no como un ranking verificado, igual que harías con cualquier lanzamiento de frontera.
¿Puedo hacer self-hosting de Qwen 3.8 Max?
Hoy por hoy, no de forma realista. Alibaba ha prometido pesos abiertos "pronto", pero sin fecha, licencia ni repositorio. Y con aproximadamente 1,2TB de pesos (en 4 bits) frente a 141GB por GPU H200, no hay un despliegue práctico en una sola caja para equipos normales hasta que salga una variante más pequeña o destilada. A la mayoría de compradores les conviene más un helpdesk con IA gestionado.
¿En qué se diferencia Qwen 3.8 Max de Qwen 3.7 Max?
Alibaba dice que 3.8 Max supera a 3.7 Max en programación, desarrollo full-stack, análisis de datos y flujos de trabajo de oficina, y es el primer modelo multimodal del equipo por encima de 1 billón de parámetros. La ventana de contexto de 1M se mantiene. Para los detalles de la generación anterior, consulta el resumen de Qwen.
¿Es Qwen 3.8 Max bueno para atención al cliente?
Como modelo en crudo no tiene funciones de soporte, ni retrieval, guardrails, escalado ni analítica. Tendrías que construir esa capa tú mismo. Para soporte específicamente, una herramienta hecha a propósito como eesel, que funciona sobre modelos de frontera y se conecta a tu helpdesk, es un camino más rápido y seguro que conectar tú mismo una API en preview. Compara opciones en el resumen de la mejor IA de atención al cliente.
¿Cuáles son las mejores alternativas a Qwen 3.8 Max?
Como modelos en crudo, Kimi K3, GPT-5.x, Claude y Gemini son las comparaciones directas. Para un caso de uso de soporte, mira los agentes de IA para atención al cliente en lugar de un modelo suelto. También hay una lista más completa de alternativas a Qwen.

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








