
La tabla de 60 segundos
Todos los números de abajo provienen de las propias páginas publicadas por cada proveedor, verificadas el 3 de agosto de 2026. Cuando un dato no está publicado, lo he indicado así en lugar de tomar una cifra de un agregador.
| Qwen 3.8 Max | Kimi K3 | |
|---|---|---|
| ID del modelo | qwen3.8-max | kimi-k3 |
| Laboratorio | Alibaba | Moonshot AI |
| Lanzamiento | 2 ago 2026 (GA) | 16 jul 2026 |
| Parámetros totales | 2.4T | 2.8T |
| Parámetros activos | 95B | No publicado |
| Entrada / 1M | $2.00 | $3.00 |
| Salida / 1M | $6.00 | $15.00 |
| Entrada en caché / 1M | $0.25 implícito, $0.17 lectura explícita | $0.30 |
| Ventana de contexto | 1,000,000 | 1,048,576 |
| Recargo por contexto largo | Ninguno | Ninguno |
| Salida máxima | 131,072 | No publicado |
| Presupuesto máximo de razonamiento | 262,144 | No publicado |
| Modalidades de entrada | Texto, imagen, vídeo | Texto, imagen, vídeo |
| Control de razonamiento | low / medium / xhigh, xhigh por defecto | Solo max |
| Pesos abiertos | Prometido, no publicado | Publicado el 27 jul 2026 |
| Licencia | No publicada | Listada como "other" |
| Ficha del modelo | Ninguna | En Hugging Face |
| Corte de conocimiento | No publicado | No publicado |
| Límite de tasa (nivel superior) | 15K RPM / 2M TPM | No publicado |
| Chat para consumidores | Qwen Studio, gratis | Kimi.com, gratis a $199/mes |
Tres filas hacen la mayor parte del trabajo aquí. Qwen publica un recuento de parámetros activos y Moonshot no, algo que importa porque los parámetros activos determinan tu latencia y tu factura, no los totales. Qwen es más barato en todos los indicadores. Y Kimi es el único de los dos que realmente puedes descargar.
Qué es Qwen 3.8 Max
Qwen es la familia de modelos de Alibaba, y Max es la línea insignia propietaria por encima de los niveles más baratos Plus y Turbo. Qwen 3.8 Max se lanzó en dos actos: una vista previa el 19 de julio en la World AI Conference con una afirmación verbal de frontera y sin números publicados, seguida de una entrada de lanzamiento de 5,000 palabras el 2 de agosto que traía todo lo que la vista previa había ocultado.
La arquitectura, tal como la describe Alibaba: 2.4 billones de parámetros totales con 95 mil millones activos, un diseño disperso de Mixture-of-Experts construido sobre la base de Qwen 3.5. La historia más amplia de la familia está en mi reseña de Qwen, y el resumen de Qwen cubre los niveles anteriores.
El razonamiento se controla con reasoning_effort, que acepta low, medium y xhigh, con xhigh como valor por defecto. Alibaba también activa preserve_thinking por defecto "para la mejor experiencia lista para usar". Guarda ese detalle, porque reaparece como un problema de coste más adelante.
Qué es Kimi K3
Kimi K3 es el modelo insignia de Moonshot AI, y su historia técnica es más inusual que la de Qwen. Tiene 2.8 billones de parámetros totales, que Moonshot describe como la activación de 16 de 896 expertos bajo un marco Stable LatentMoE, sobre dos piezas novedosas: Kimi Delta Attention, un mecanismo híbrido de atención lineal, y Attention Residuals, un sustituto directo de las conexiones residuales estándar que Moonshot publicó como código abierto por separado. Afirma tener aproximadamente 2.5 veces mejor eficiencia de escalado que Kimi K2.5.
Moonshot es inusualmente franco en su propia entrada de lanzamiento sobre dónde se ubica:
"While its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol, Kimi K3 demonstrated frontier-level performance across our evaluation suite, consistently outperforming other tested models."
Compáralo con el posicionamiento de la vista previa de Alibaba, que apuntó a "solo por detrás de Fable 5" antes de publicar una sola puntuación. Dos laboratorios, dos niveles de comodidad muy distintos con su propia evidencia. Mis análisis más profundos están en la reseña de Kimi K3 y la reseña de Qwen 3.8 Max.
Algo que K3 no te da es un dial de razonamiento. reasoning_effort acepta max y nada más, con low y high listados como "próximamente". No hay una SKU más barata sin razonamiento. Un modelo, un precio, siempre pensando.
Benchmarks: ninguno midió al otro
Aquí es donde la mayoría de las comparaciones cara a cara hacen trampa en silencio. Alibaba publicó una tabla de dieciséis paneles el 2 de agosto. Moonshot publicó la suya en julio. Ninguna tabla contiene al otro modelo.


Sin embargo, hay una forma de conectarlas, y casi nadie se molesta en hacerlo. Ambas tablas comparten los mismos modelos de referencia: Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol. Así que donde ambos laboratorios reportan la misma puntuación para el mismo modelo de referencia en el mismo benchmark, ambos harnesses se comportan de forma equivalente y sus propias cifras se pueden comparar entre sí. Donde las puntuaciones de referencia difieren, no se puede.

Al aplicar esa prueba a ambas tablas, sobreviven exactamente tres filas:
| Benchmark | Coincidencia de referencia compartida | Qwen 3.8 Max | Kimi K3 | Ganador |
|---|---|---|---|---|
| TerminalBench-2.1 | Fable 5 84.6, Opus 4.8 84.6, Sol 88.8 en ambas | 86.6 | 88.3 | Kimi, por 1.7 |
| CharXiv (RQ, con Python) | Fable 5 93.5, Opus 4.8 89.9, Sol 89.1 en ambas | 93.5 | 91.3 | Qwen, por 2.2 |
| JobBench | Fable 5 57.4, Opus 4.8 48.4 en ambas; Sol 45.4 frente a 46.5 | 53.4 | 52.9 | Qwen, por 0.5 |
Así que: una victoria clara para cada uno en una evaluación cercana a codificación y otra de razonamiento con gráficos, y un empate estadístico en trabajo agéntico de conocimiento. Eso es toda la comparación defendible que existe. Cualquiera que te muestre una tabla de quince filas declarando un ganador ha mezclado cifras de dos harnesses distintos.
Y la razón para ser estricto con esto está justo ahí, en la cuarta fila que tuve que descartar. En FrontierSWE, la tabla de Alibaba pone a GPT-5.6 Sol en 88.8; la de Moonshot lo pone en 71.3. El mismo modelo, el mismo benchmark, una diferencia de 17.5 puntos. Sea cual sea la tabla correcta, una de las dos está midiendo algo que la otra no, y esa brecha es mayor que el margen que cualquiera de los dos laboratorios afirma tener sobre el otro.
Las notas al pie de Alibaba también vale la pena leerlas. Revela que seis de sus benchmarks de codificación son internos y no publicados, que las puntuaciones de los competidores se extrajeron de harnesses mixtos en lugar de volver a ejecutarlas, que los resultados de Fable 5 "pueden implicar fallbacks", y que varias filas son calificadas por modelos rivales: gemini-3.1-pro-preview califica PLawBench, Claude Opus 4.6 califica PaperBench. La tabla de Moonshot tiene su propia versión de la misma advertencia.
La única lectura independiente disponible es la de Artificial Analysis, que puntuó a Kimi K3 con un 57 en su Intelligence Index, cuarto de 189 modelos evaluados, con una velocidad de salida de alrededor de 62 tokens por segundo. En su evaluación privada de trabajo de conocimiento a largo plazo, K3 alcanzó un Elo de 1547, que ese mismo resumen sitúa +732 por encima de Kimi K2.6.
La tarifa dice Qwen. La factura dice empate.
Qwen es más barato en todos los indicadores publicados. La entrada cuesta un tercio menos, la salida un 60% menos, y su lectura implícita de caché es de $0.25 frente a la tarifa de acierto de caché de Kimi de $0.30. Con recuentos de tokens idénticos, no hay discusión.
Los recuentos de tokens no son idénticos. Un desarrollador que ejecutó la misma construcción de una app web en ambos modelos, cada uno en el harness propio de su proveedor, publicó la contabilidad:
"* Kimi K3: 9532k input (9172k cached), 114k output - cost $5.5
Qwen 3.8 Max: 18020k input (17836k cached), 114k output - cost $6.3"

Ese $6.30 es previo a la disponibilidad general, así que se facturó con las condiciones de la vista previa y no con la tarifa publicada el 2 de agosto. Al pasar esos mismos recuentos de tokens por las tarifas actuales, Qwen sale a unos $5.51 (0.184M de entrada sin caché a $2, 17.836M en caché a $0.25, 0.114M de salida a $6). Kimi sale a $5.54. Una tarifa de salida un 60% más barata, casi anulada por completo por necesitar 1.9 veces más tokens de entrada.
Este es el número que realmente decide tu factura, y no está en ninguna de las dos páginas de precios. Qwen activa el razonamiento xhigh por defecto con preserve_thinking habilitado, y los tokens de razonamiento se facturan como salida. Kimi también está siempre al máximo, y su propia comunidad fue clara sobre la consecuencia:
"The shift from "value" models to "intelligent, huge and slow" models coming from China is an interesting change in strategy. My main issue with GLM 5.2 and Kimi 3 is that they're extremely token hungry and thus feel slow(er) to use."
Ninguno de los dos es ya la opción económica. Ambos están en el rango de precios de Claude Sonnet, y DeepSeek V3.2 sigue estando un orden de magnitud por debajo de ambos. El marco de "modelo chino barato" pertenece a la generación anterior.
Introduce tus propios volúmenes, incluyendo cuánta de tu entrada está en caché y cuánto más verboso esperas que sea Qwen:
Mueve el deslizador de verbosidad más allá de 1.9x y Kimi gana en coste a pesar de cobrar más del doble por token de salida. Ese punto de cruce, no el precio de lista, es lo que tu equipo de finanzas estará mirando dentro de tres meses.
Pesos abiertos: la única diferencia clara
Ambos modelos se anunciaron como abiertos. Solo uno lo es.
Moonshot dijo que los pesos estarían listos para el 27 de julio de 2026, y lo cumplió. El repositorio de Kimi K3 muestra un checkpoint modificado por última vez el 27 de julio, con un índice de safetensors que suma 2,779,931,837,184 parámetros, lo que confirma la afirmación de 2.8T desde fuera y no desde un comunicado de prensa. Ya ha superado las 837,000 descargas y 9,700 me gusta, y ya existen cuantizaciones hechas por la comunidad. La licencia figura solo como "other", así que léela antes de construir un negocio sobre ella.
Qwen 3.8 Max sigue esperando. La entrada de lanzamiento de Alibaba promete los pesos en Hugging Face y ModelScope "la próxima semana" tres veces distintas, la página de inicio de qwen.ai etiqueta el lanzamiento como "Open-Source", y no hay repositorio, ni licencia, ni fecha. Desde el 2 de agosto, "la próxima semana" significa la semana del 9 de agosto.
Dos advertencias antes de emocionarse. Primero, un checkpoint de 8 bits y 2.78 billones de parámetros es un artefacto de centro de datos, no algo que se ejecute en una estación de trabajo, así que "abierto" aquí significa auditable y autoalojable a escala, no local. Si lo local es tu requisito real, los modelos de lenguaje pequeños son la categoría honesta. Segundo, la comunidad de modelos locales en Hacker News dejó claro que leyó el anuncio de Qwen como una respuesta de calendario:
"I assume that this announcement has been prompted by that of Moonshot AI, which has just announced a 2.8T parameter open-weights LLM, Kimi K3, to be published on Huggingface by 27 July. Now the response of Alibaba is that they will also publish soon a big open weights LLM, the 2.4T parameter Qwen 3.8."
Lo que dicen realmente los desarrolladores que probaron ambos
Los benchmarks miden capacidad. La producción mide la capacidad dividida entre la paciencia. En los hilos de lanzamiento, los informes prácticos se inclinan por Kimi, y casi ninguno tiene que ver con inteligencia.
La frase más afilada en el hilo de vista previa de Qwen fue una comparación directa:
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
Un desarrollador que probó cuatro modelos de frontera lado a lado durante varios días llegó a una conclusión más equilibrada:
"Having tested K3, Qwen 3.8 max preview, Fable and Sol for the past few days, I partially agree. Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA [...] if I had to find an alternative, I could live with both K3 and Qwen3.8 just fine."
Y un informe fue más lejos de lo que yo iría basándome en una sola carga de trabajo, pero es el veredicto más repetido en el hilo y vale la pena leerlo como un dato, no como una conclusión:
"In my limited anecdotal experience, Kimi K3 is a bit better than Opus 4.8 and Qwen3.8 Max is disastrously bad. It can reason fine, but the moment it tries to do something it gets stuck into long second-guessing loops with no progress."
Vale la pena contrastarlo con el lado de Kimi, donde el entusiasmo fue alto el día del lanzamiento y un desarrollador no pudo distinguirlo del modelo insignia de Anthropic en una prueba a ciegas:
"I've been playing around with it for the past few hours, and I think it's an amazing model. I'm not sure I could tell the difference between this and Fable in a blind test."
Si esta dispersión te preocupa, la opción más segura es una lista corta en lugar de una única elección. La mía para este lado de la comparación es alternativas a Qwen. El resumen de alternativas a Kimi K3 lo cubre desde la otra dirección, y existe una lista más específica de alternativas a Qwen 3.8 Max solo para este modelo.
Hay varias cosas que simplemente no están publicadas para ninguno de los dos modelos. Ningún corte de conocimiento. Ninguna ficha de sistema. Ninguna evaluación de seguridad por parte de Qwen, y ningún artículo de arquitectura por parte de Kimi hasta que llegue el informe técnico. Si tu equipo de compras pregunta, hoy la respuesta es que no existe.
Dónde termina un modelo de frontera y empieza el trabajo de soporte
Esta es la parte que más me importa, porque es donde veo a los equipos perder un trimestre entero.

Ninguno de estos modelos conoce tu política de reembolsos. Ninguno ha leído tus últimos 7,000 tickets. Ninguno sabe que el cliente que te escribe tiene un plan enterprise y ya ha escalado dos veces. Una puntuación de benchmark no es un agente de soporte, y la distancia entre esas dos cosas es donde la mayoría de los proyectos de automatización de soporte con IA se estancan en silencio.
Por eso elegir un helpdesk con IA es un ejercicio distinto a elegir un modelo, y por eso la automatización de tickets vive o muere según la recuperación de datos, no el razonamiento en bruto.
He pasado mi tiempo en eesel construyendo la capa de agentes, y el modo de fallo que sigo viendo es peor que "la IA no lo sabe". Es la invención con confianza. La historia de la marca de coches al principio de este artículo es el ejemplo más claro que tengo: el modelo no se equivocó en el idioma, se equivocó en el alcance, porque el centro de ayuda decía "soportamos todos los modelos" y lo tomó al pie de la letra. El resumen que hizo ese equipo sobre cómo llegaron a configurarlo bien fue "prueba y error al principio". Un modelo de 2.8 billones de parámetros habría hecho la misma afirmación, con más fluidez.
El control que lo soluciona salió en una llamada con un responsable de soporte que gestiona 7,000 tickets al mes, y no tiene nada que ver con la elección del modelo:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
Eso es una decisión de producto, no una decisión de modelo. Por eso eesel AI ejecuta una simulación sobre tickets históricos antes de que nada salga en vivo, para que veas la tasa de resolución y las respuestas reales sobre conversaciones pasadas reales primero.
También es por eso que las respuestas se enrutan según la confianza, redactando para un humano o escalando en lugar de adivinar, y por eso la clasificación de tickets se ejecuta como un paso propio en lugar de meterse en un único prompt gigante.
Lo cual convierte la lectura estratégica de esta comparación en algo un poco anticlimático: construye de forma que puedas cambiar el motor. La capa de modelos mejora y se abarata cada pocas semanas. Kimi K3 llegó diecisiete días antes que Qwen, GPT-5.6 recortó su nivel más barato un 80% en una sola tarde, y lo que lidere la tabla en septiembre no está en ninguna de las dos tablas hoy.
Esa es la misma razón por la que no me casaría con Gemini tampoco, por bien que se vean las cifras de este mes. Se aplica igual a Grok. GLM 5.2 es el otro modelo insignia chino que se sitúa en este mismo rango, y leería su caso de negocio con el mismo encogimiento de hombros.
Entonces, ¿cuál deberías elegir?
Si estás lanzando algo y quieres una sola respuesta:
- Bucles de agentes largos donde la eficiencia de tokens decide la factura: Kimi K3. Hizo el mismo trabajo con aproximadamente la mitad de tokens de entrada, y esa diferencia supera su tarifa más alta.
- Trabajo intensivo en gráficos, documentos y vídeo: Qwen 3.8 Max. Gana en CharXiv con un harness comparable, y Alibaba documenta entrada de vídeo con límites concretos que Moonshot no iguala en su propio material de lanzamiento.
- Cualquier cosa que necesites autoalojar o auditar: Kimi K3, y no es debate. Los pesos existen, el recuento de parámetros se verifica desde el propio checkpoint, y los de Qwen siguen siendo una promesa.
- Un dial de razonamiento que puedas bajar: Qwen 3.8 Max, el único de los dos con niveles de esfuerzo
lowymedium. Kimi funciona al máximo o no funciona en absoluto. - El coste más bajo por token, sin más: Qwen, en todos los indicadores. Solo mide el coste por tarea terminada antes de planificar un presupuesto en torno a eso.
- Cualquier cosa de cara al cliente: ninguno, por sí solo. Elige primero la capa y deja que ella elija el modelo. Las cuentas están en mi desglose de coste de agentes, y la lista corta está en mejores agentes de IA.
Lo que no haría es tratar ninguna de las dos tablas como algo cerrado. Tres filas es toda la superposición honesta entre ambas, seis de los benchmarks de codificación de Alibaba son evaluaciones propias no publicadas, y ningún tercero ha vuelto a ejecutar nada de esto.
Espera que ambas tarifas cambien antes de que lleguen cifras independientes. Mantengo el desglose de precios de Kimi K3 como una página viva por esa razón, y lo mismo ocurre con precios de Qwen 3.8 Max. La comparación de Qwen 3.8 Max vs GPT-5.6 también necesitará revisarse junto con esta.
Prueba eesel
Si llegaste aquí porque quieres un modelo que cierre tickets en lugar de ganar tablas, ese es exactamente el sentido de eesel AI. Se conecta con Zendesk, Freshdesk, Gorgias y más de 100 herramientas más, aprende de tu centro de ayuda y de tus tickets pasados, y empieza a redactar en cuestión de minutos.

El diferenciador es la rampa de confianza, no el motor. Simula sobre tu historial real de tickets, lee los números, empieza en modo borrador, y pasa a autónomo solo cuando te guste lo que veas. Heredas cada avance de frontera, sea Kimi, Qwen o lo que sea que se lance en septiembre, sin tener que rehacer nada. Prueba eesel gratis, sin tarjeta de crédito.
Preguntas frecuentes
¿Es Qwen 3.8 Max mejor que Kimi K3?
¿Cuál es más barato, Qwen 3.8 Max o Kimi K3?
¿Kimi K3 es de código abierto y están disponibles los pesos de Qwen 3.8 Max?
¿Cuál es la ventana de contexto de Qwen 3.8 Max frente a Kimi K3?
¿Cuál es mejor para programar, Qwen 3.8 Max o Kimi K3?
¿Puedo ejecutar Qwen 3.8 Max o Kimi K3 en local?
¿Qwen 3.8 Max y Kimi K3 admiten visión?
¿Puedo usar Qwen 3.8 Max o Kimi K3 para atención al cliente?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








