
Lo que realmente estás obteniendo
Yo construyo integraciones en eesel, lo que significa que la mayor parte de mi semana se va en apuntar la pila de eesel hacia el modelo que acaba de salir y luego averiguar dónde está el papeleo. Qwen 3.8 Max carga con más papeleo que la mayoría, porque hay dos productos distintos con casi el mismo nombre.
Alibaba anunció el modelo dos veces. El 19 de julio de 2026, qwen3.8-max-preview apareció en la World AI Conference de Shanghái sin entrada de blog, sin ficha de modelo, ni siquiera con tabla de benchmarks. Luego, el 2 de agosto llegó el lanzamiento real: una publicación técnica de 5.068 palabras, dos tablas completas de benchmarks, precios por token, además de una promesa de pesos abiertos. El ID de GA es qwen3.8-max.
Esos dos ID no son dos versiones de una misma compra. La preview se vendió únicamente a través de la suscripción de Token Plan y no tiene ninguna ficha de modelo, mientras que https://www.qwencloud.com/models/qwen3.8-max-preview devuelve un 404. El modelo GA se vende por uso, y también está incluido en Token Plan. Así que cuando alguien te diga que está "con el precio de la preview", lo que en realidad describe es una bolsa de créditos, no una tarifa.
Las especificaciones a las que estás comprando acceso, según la ficha de modelo de QwenCloud: 2,4 billones de parámetros totales con 95.000 millones activos en un MoE disperso, una ventana de contexto de 1.000.000 de tokens, 131.072 de salida máxima y hasta 262.144 tokens de razonamiento. reasoning_effort viene con tres niveles y por defecto usa xhigh, con preserve_thinking activado de fábrica. Si lo que quieres es la lectura de capacidad en vez de la de acceso, la reseña de Qwen 3.8 Max de eesel profundiza en lo que realmente compran esos números, y el cara a cara contra Kimi K3 es donde la cuestión de la eficiencia de tokens se pone fea.
Un pequeño aviso que me costó diez minutos. La publicación de lanzamiento vive en ?id=qwen3.8, no en ?id=qwen3.8-max. El ID equivocado muestra una página vacía en lugar de un 404, así que parece que el anuncio se hubiera retirado.
Elige tu vía
Cinco superficies, y cinco facturas distintas. Averigua cuál eres antes de crear la cuenta, porque cambiar más tarde significa volver a cablear todo.
Buscador de vía
¿Cuál es tu puerta de entrada a Qwen 3.8 Max?
Elige la frase que más se parezca a tu semana.
Vía 1
Chat de Qwen Studio
CosteGratis. Web, iOS, Android, macOS, Windows.
ConfiguraciónInicia sesión. Sin clave, sin cuenta de facturación.
La pega: la selección de modelo está detrás del inicio de sesión, así que no puedes confirmar desde fuera que es 3.8-Max quien te responde.
Vía 2
API de QwenCloud, por token
Coste$2 por 1M de entrada, $6 por 1M de salida, $0,25 lectura en caché.
ConfiguraciónCrea una clave, define una URL base, modelo qwen3.8-max.
La pega: aquí no hay nada oculto, y precisamente por eso es la vía a elegir si necesitas prever una factura.
Vía 3
Créditos de Token Plan
CostePersonal $6 / $18 / $68 al mes. Asientos de equipo de $20 a $200.
ConfiguraciónSuscríbete y luego llama desde la misma superficie de API.
La pega: el coeficiente de créditos por llamada no se publica, y las cuotas personales se reinician en ventanas fijas de 5 horas y 7 días en lugar de acumularse.
Vía 4
Qoder y entornos de terceros
CosteLo que facture la clave subyacente. Qoder es un producto propio.
ConfiguraciónApunta Claude Code, Codex, Qwen Code u OpenClaw a una URL base sustituida.
La pega: la configuración de OpenClaw que publica Alibaba limita la salida a 65.536 tokens, la mitad del límite real del modelo.
Vía 5
Pesos abiertos, autoalojado
CosteNo se puede comprar. No publicado.
ConfiguraciónNinguna disponible a fecha del 3 de agosto de 2026.
La pega: prometido para "la semana que viene" desde el 2 de agosto, sin licencia, fecha ni repositorio. Y 2,4 billones de parámetros superan los 500GB incluso a 1,5 bits por peso.
Aquí está lo mismo en forma de tabla, porque alguno de vosotros querrá hacerle una captura de pantalla.
| Vía | Qué obtienes | Precio | Mejor para | Principal pega |
|---|---|---|---|---|
| Qwen Studio | Chat de consumo, todas las plataformas | Gratis | Probar sin compromiso | El selector de modelo está tras el login |
| QwenCloud API | Pago por uso por token | $2 / $6 por 1M | Apps en producción | Ninguna en precio, bastante en verbosidad |
| Token Plan | Suscripción de créditos | Desde $6/mes | Bucles de agentes intensivos | Coeficiente de créditos no publicado |
| Qoder y entornos | IDE y CLI de codificación agéntica | Depende de la clave | Trabajo de codificación | Límites de salida contradictorios |
| Pesos abiertos | Autoalojamiento | No disponible | Nadie, todavía | No publicado |
Vía 1: el chat gratuito
Qwen Studio es la puerta más rápida y no cuesta nada. Según qwen.ai hay clientes para web, iOS, Android, macOS y Windows.
Una advertencia honesta, porque sí lo comprobé. La página sin iniciar sesión es un flujo de incorporación de generación de imágenes, y no menciona a Qwen 3.8 Max en ninguna parte de su HTML público. La selección de modelo vive detrás de la autenticación. Así que el chat es real y es gratis, solo que primero tienes que iniciar sesión antes de poder verificar qué modelo te está respondiendo.
Vale la pena saber para qué sirve esta vía y para qué no. Como forma de comprobar rápidamente si el modelo maneja tu dominio, está bien. Como forma de evaluar la latencia o el coste, o cómo se comporta el modelo bajo un system prompt que tú controlas, es mala. Para eso necesitas la vía 2.
Vía 2: la API, por token
Esta es la que yo elegiría para cualquier cosa real. Creas una clave en la consola de QwenCloud, y después de eso la tarifa lo cuenta todo.

Fíjate en el contador junto a ese botón: diez claves por cuenta, y cada clave está limitada a un solo espacio de trabajo. Si tu plan es una clave por entorno o una clave por cliente, ten en cuenta ese límite ahora y no en el despliegue.
Los medidores publicados, según la ficha de modelo:
| Medidor | Precio por 1M de tokens |
|---|---|
| Entrada | $2 |
| Salida | $6 |
| Entrada, caché implícita | $0,25 |
| Creación de caché explícita | $2,50 |
| Lectura de caché explícita | $0,17 |
Dos detalles de esa tabla importan más que el titular. Primero, no hay ningún tramo por longitud de contexto: un único par plano de $2/$6 en toda la ventana de 1M, sin ningún selector de precios escalonado. Lo cual es inusual, y es una buena noticia, porque el precio escalonado por contexto es precisamente donde las sesiones largas de agentes se encarecen calladamente. Segundo, esa caché implícita a $0,25 hace un trabajo real si tus prompts comparten un prefijo estable, y la mayoría de las cargas de soporte y codificación lo hacen.
Los límites de tasa están en 15.000 RPM y 2M TPM en la misma ficha. Como referencia frente al resto del campo, el artículo de eesel sobre precios de Qwen 3.8 Max hace esta misma cuenta junto a los precios de GPT-5.6 y los precios de Kimi K3. La comparación con DeepSeek V4 Flash es la que hay que leer si el criterio único es el precio barato por token.
La parte que te ahorra una reescritura
Casi con toda seguridad no necesitas una nueva librería cliente para esto. Alibaba expone el mismo modelo mediante tres protocolos en cada una de seis regiones, según la lista de Model Studio: compatible con OpenAI en /compatible-mode/v1, compatible con Anthropic en /apps/anthropic, y DashScope nativo en /api/v1. Las regiones son Pekín, Hong Kong, Singapur, Tokio, Fráncfort y EE. UU. (Virginia).

En la práctica eso significa que una integración existente del SDK de OpenAI llega a este modelo cambiando una URL base más una cadena de modelo. Nada más. QwenCloud admite chat-completions y la Responses API, y la lista de funciones de la ficha de modelo confirma llamadas a funciones, salidas JSON estructuradas, finalización de prefijos, caché de contexto, procesamiento por lotes, búsqueda web y ajuste fino. Las herramientas integradas del lado del servidor (code_interpreter, web_extractor, web_search, t2i_search, i2i_search) residen específicamente en la Responses API.
Vía 3: créditos de Token Plan
La vía de suscripción es donde yo bajaría el ritmo. Es la única forma de llegar al modelo preview más antiguo, y como producto económico es un animal completamente distinto de la API.

A nivel internacional, la documentación de Token Plan fija Personal en $6, $18 y $68 al mes (precio de lista $8, $25, $80). Eso otorga 2.500, 10.000 y 40.000 créditos por ventana móvil de 7 días, y además 700, 3.000 y 12.000 por ventana de 5 horas. Los asientos de equipo cuestan $20 Standard, $75 Pro y $200 Max por asiento al mes, con 25.000, 100.000 y 250.000 créditos mensuales. China continental usa las mismas cuotas pero en yuanes: ¥39, ¥139 y ¥499 en Personal, y de ¥150 a ¥1.398 por asiento de equipo.
Ahora la parte que nadie pone en los materiales de marketing. Alibaba no publica qué compra un crédito. La documentación de Personal Edition dice que el coste en créditos de una llamada se fija dinámicamente según el tipo de modelo, el volumen de tokens, el modo de pensamiento y las llamadas a herramientas, y luego se descuenta con coeficientes escalonados que no aparecen publicados en ningún sitio. El único ejemplo resuelto en el sitio es para un modelo distinto, qwen3.6-plus, con aproximadamente 3,18 créditos por una entrada de 8.349 tokens y una salida de 573 tokens.

Tres mecánicas más que muerden:
- Las cuotas son ventanas, no saldos. Alcanzar el límite de 5 horas o de 7 días pausa el servicio hasta que esa ventana se reinicia, y los créditos no usados no se acumulan. Renovar extiende el plazo, pero no recarga el ciclo actual.
- Los asientos de equipo son de un miembro por clave, no compartibles, sin límites de ventana pero con un bloqueo mensual estricto cuando se agota el conjunto de asientos.
- Las sesiones largas cuestan más por solicitud. La documentación de Team afirma claramente que algunos modelos facturan por tramos según la longitud del contexto, y advierte que acumular contexto dentro de bucles de agentes empuja las solicitudes hacia tramos más altos.
Aquí hay un descuento real que vale la pena nombrar. Durante la preview, el consumo de créditos funcionaba al 10% de lo normal, y entre las 22:00 y las 08:00 se sumaba otro 80% de descuento encima, quedando en el 2% del consumo estándar. Aunque hay dos matices. El descuento nocturno es solo para Personal Edition, y el GA qwen3.8-max recibe una tarifa nocturna plana del 50% en lugar del 2% acumulado. Ambos son explícitamente revocables, y además Alibaba nunca menciona la zona horaria.
He visto exactamente esta forma de precios pillar a gente en mi propio lado del negocio. Un comprador con el que trabajé, una empresa europea de seguridad de correo sobre Freshdesk, quemó 200 interacciones en un solo día de prueba y de inmediato empezó a preocuparse por lo que eso significaría a su volumen esperado. El número en sí estaba bien. No poder predecir el número es lo que hace que un departamento financiero diga que no. Un coeficiente no publicado te hace eso a una escala mucho mayor, que es todo el argumento para elegir la vía 2 en su lugar.
Vía 4: Qoder y los entornos de codificación
Si tu pregunta de acceso es realmente "¿puede manejar mi repositorio?", entonces Alibaba ya ha hecho el trabajo por ti. Qoder es su IDE y CLI de codificación agéntica, instalable con curl -fsSL https://qoder.com/install | bash, y la publicación de lanzamiento lo describe como coevolucionando con el modelo.
La parte más útil es que la misma publicación también trae configuraciones listas para copiar y pegar para cuatro entornos que quizás ya uses: Claude Code (mediante un ANTHROPIC_BASE_URL apuntando a https://dashscope-intl.aliyuncs.com/apps/anthropic), Codex sobre el protocolo Responses, Qwen Code (@qwen-code/qwen-code), y OpenClaw. Si ya tienes un flujo de trabajo de asistente de codificación, esto es un cambio de URL base y no una migración.
Presta atención a una inconsistencia aquí. La ficha de modelo dice 131.072 de salida máxima. La configuración de OpenClaw que Alibaba publica en esa misma publicación de lanzamiento fija "maxTokens": 65536, exactamente la mitad, y la diferencia nunca se explica. Así que las propias herramientas publicadas por Alibaba nunca piden el límite que anuncian. Si te encuentras con truncamiento en una generación larga, ese valor de configuración es lo primero que hay que revisar.
Como muestra de cómo se ve el acceso de largo horizonte en la práctica, Alibaba señala una ejecución autónoma de codificación de 16 días que produjo 265 commits, 127 PR y 151 issues en el repositorio público oh-my-cli a fecha del 30 de julio de 2026. Tómalo como una demo y no como un benchmark. Aunque sí te dice en qué dirección está invirtiendo Alibaba.
Vía 5: los pesos, que todavía no puedes tener
Esta es la vía por la que en realidad pregunta la mayoría de la gente cuando pregunta sobre el acceso. Y también es la que no existe.

La publicación de lanzamiento se compromete con ello tres veces por separado, llamándolo el primer modelo de pesos abiertos a escala Max, con los pesos yendo a Hugging Face y ModelScope "la semana que viene". A fecha del 3 de agosto de 2026 no hay repositorio, ni licencia, ni tampoco una fecha firme. Y la página de inicio de qwen.ai etiqueta la entrada como "Open-Source" para un lanzamiento cuyos pesos no han salido.
La reacción de la comunidad tuvo menos que ver con la promesa y más con la aritmética:
At 1.5 bits per weight it'll still be over 500gb - that's still not running on consumer hardware.
Best case they release smaller models. 120b class of qwen 3.8 would be incredible - it fits on device for those serious about AI, but without millions of dollars in hardware for terabytes of VRAM
Esa es la lectura honesta. Incluso un checkpoint de 2,4 billones ya publicado es un artefacto de centro de datos, no de portátil. El lanzamiento hermano que la gente realmente está esperando es Qwen3.8-27B, anunciado como pesos abiertos junto con el buque insignia:
They've also announced Qwen3.8-27B being released open-weight next week. Qwen3.6-27B is widely regarded as one of the best local models, especially since nothing else comes close to it, that isn't benchmaxxed, without being significantly larger. If 3.8 truly improves upon it that would be awesome.
Si la inferencia local es un requisito imprescindible para ti, ese es el lanzamiento a seguir, y el artículo de eesel sobre modelos de lenguaje pequeños explica por qué el extremo pequeño suele ser, de todos modos, el correcto para producción. Para opciones de pesos abiertos comparables hoy, consulta las alternativas a Qwen 3.8 Max y el explicador de Kimi K3, que sí publicó sus pesos en la fecha prometida.
Cinco errores de los que te salvaría
Los problemas de acceso con este modelo casi nunca son problemas de capacidad. En su mayoría son papeleo.
- Llamar a
qwen3.8-max-previewesperando una tarifa. No tiene ficha de modelo ni precio por token. Si quieres un número, necesitas el ID de GA. - Leer un artículo de la era preview como si fuera precio de GA. Circula ampliamente un conjunto de tramos en CNY por 1K que afirma un contexto de 256K, y eso contradice el 1M de la ficha de GA. Cualquier tabla de tramos que encuentres fuera de las propias propiedades de Alibaba, trátala como no verificada.
- Suponer que la tarifa nocturna del 2% se aplica a ti. Era solo para preview y solo para Personal. GA obtiene un descuento nocturno plano del 50%, y Team no tiene ningún descuento nocturno.
- Presupuestar el nivel Lite sin comprobar el stock. El plan Lite mostraba "agotado temporalmente, se repone a diario a las 9:30" cuando lo miré el 3 de agosto de 2026. Una frase que no esperaba escribir sobre una suscripción de API.
- Confiar en un veredicto de calidad basado en un solo número. El modelo no aparece en absoluto en el tablero de Artificial Analysis, así que cualquier "puntuación de inteligencia independiente" que veas citada para él pertenece a algún otro Qwen. Compara en su lugar en los cara a cara con Fable 5 y GPT-5.6.
Lo que el acceso no te da
Todas las vías anteriores llegan al mismo sitio: un modelo que responde prompts. Si viniste aquí para poner IA en una cola de soporte, eso es quizás una quinta parte del trabajo.
Las otras cuatro quintas partes son las piezas que nadie te vende con una clave. Recuperación sobre tu propio centro de ayuda y tus tickets pasados, para que las respuestas salgan fundamentadas y no solo plausibles. Acciones, para que el agente pueda etiquetar, enrutar y cerrar en lugar de solo hablar. Reglas de escalado, con un traspaso limpio a un humano. Y luego una forma de probar todo el conjunto sobre tickets históricos antes de que toque a un cliente, que es el paso que separa un despliegue que funciona de un incidente.
Lo digo desde las cicatrices y no desde la teoría. He visto a un bot de sonido confiado confirmar alegremente soporte para productos que no estaban en absoluto en la base de datos del cliente, simplemente porque la base de conocimiento decía "damos soporte a todos los modelos". Un equipo de soporte técnico B2B con el que trabajé señaló exactamente ese temor antes de salir a producción, y tenían razón. Por eso todos los despliegues de eesel simulan primero contra tickets pasados reales, y eso no es una función que se obtenga de una URL base. Las guías de eesel sobre prevención de alucinaciones y sobre tasa de resolución profundizan en ambas mitades de esto.
La elección de modelo también importa mucho menos de lo que la gente espera. Ya sea que enrutes a través de Qwen, GLM 5.2, Gemini 3.5 Pro o Fable 5, lo que mueve tu tasa de desviación es la capa de recuperación y pruebas que lo envuelve. Desarrollo este argumento con detalle en agentes de IA frente a chatbots y en RAG frente a fine-tuning.
Prueba eesel para soporte en vez de cablearlo tú mismo
Si tu razón para leer una guía de acceso a modelos era "quiero que la IA responda tickets", entonces puedes saltarte todas las vías anteriores. eesel es la capa que convierte un modelo en un compañero de soporte, y toma minutos en lugar de un ciclo de compras.

Conecta Zendesk, Freshdesk, Gorgias, Front o HubSpot, luego apúntalo a tu centro de ayuda, y aprende de tus tickets pasados en lugar de un prompt que escribiste a medianoche. Después simulas todo el conjunto sobre conversaciones históricas, ves la tasa de resolución antes de comprometerte con nada, y lo activas cuando el número es uno que puedes defender. Sin claves de API que rotar, sin coeficientes de créditos que hacer ingeniería inversa, y sin región que elegir. Si primero quieres ver el panorama más amplio, el resumen de eesel sobre el mejor software de helpdesk con IA y la guía de automatización de tickets de soporte son los lugares por donde empezar, y clasificación de tickets cubre la mitad de la clasificación.
Prueba eesel gratis, o reserva una demo si prefieres que yo conduzca.
Preguntas frecuentes
¿Cómo accedo a Qwen 3.8 Max gratis?
¿Cuál es el precio por token de la API de Qwen 3.8 Max?
¿Cuál es el ID de modelo de Qwen 3.8 Max?
qwen3.8-max, impreso en la ficha de modelo de QwenCloud. La preview anterior era qwen3.8-max-preview, un producto comercial distinto vendido solo a través de Token Plan. Confundir ambos es la razón más común por la que una primera llamada a la API da 404.¿Puedo descargar los pesos de Qwen 3.8 Max y autoalojarlo?
¿Es la suscripción de Token Plan más barata que la API de Qwen 3.8 Max?
¿Puedo usar Qwen 3.8 Max dentro de Claude Code o Codex?
¿Desde qué regiones puedo llamar a Qwen 3.8 Max?
¿Es el acceso a Qwen 3.8 Max suficiente para responder tickets de clientes?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








