Qwen 3.8 Max vs DeepSeek V4 Flash: precio, specs y veredicto real

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición August 3, 2026

Verificado por expertos
Ilustración que compara el Qwen 3.8 Max de Alibaba con DeepSeek V4 Flash

El marcador en 60 segundos

Qwen 3.8 MaxDeepSeek V4 Flash
ID del modeloqwen3.8-maxdeepseek-v4-flash
Build fijadaQwen3.8-MaxDeepSeek-V4-Flash-0731
Lanzamiento2 de agosto de 202631 de julio de 2026
Entrada / 1M$2.00$0.14
Entrada en caché / 1M$0.25$0.0028
Salida / 1M$6.00$0.28
Ventana de contexto1,000,0001,000,000
Salida máxima131,072384,000
ArquitecturaMoE 2.4T total / 95B activosMoE 284B total / 13B activos
PesosPrometidos, sin publicarAbiertos, MIT
EntradasTexto, imagen, video, documentosTexto
Razonamiento por defectoxhigh, preserve_thinking activadoRazonamiento activado, esfuerzo high
Tokens de razonamiento máx.262,144No publicado
Tope de throughput2M TPM, 15K RPM2,500 solicitudes concurrentes
Rango en LMArena Text#5, 1496#79, 1436
Índice de Inteligencia de AAAún sin puntuar50
Cambio de precio pendienteNinguno publicado2x en horas pico

Dos filas hacen la mayor parte del trabajo aquí. El tope de salida es la silenciosa: Flash escribirá 384K tokens en una sola respuesta frente a los 131,072 de Qwen, lo cual importa para cualquier cosa que tenga que generar un artefacto largo en lugar de una respuesta de chat. La otra es el cambio de precio pendiente en horas pico, que yo pondría en una hoja de cálculo, porque es el único movimiento de precio futuro anunciado en cualquiera de los dos lados.

Calcula lo que realmente pagarías

Las proporciones de arriba son por token. Lo que realmente te importa es la factura, y eso depende más de la forma de tu tráfico que de la propia tarjeta de precios. Mueve los diales.

Qué es realmente DeepSeek V4 Flash

Flash es el hermano pequeño en la familia V4 de DeepSeek, y la palabra "pequeño" tiene un peso real en esa frase. Es un modelo Mixture-of-Experts con 284B de parámetros totales y solo 13B activos, frente a los 1.6T totales y 49B activos de V4 Pro, según la tabla de descargas de modelos de DeepSeek. Para dar escala, la generación anterior de DeepSeek, V3.2-Base, tenía 671B totales y 37B activos, así que Flash tiene menos de la mitad del tamaño total del modelo que reemplaza. Trece mil millones de parámetros activos acercan su cómputo por token al de un modelo de lenguaje pequeño más que a cualquier cosa que lleve "frontera" en el marketing.

La build detrás del alias de la API es DeepSeek-V4-Flash-0731, y DeepSeek es inusualmente honesto al decir que no fue una nueva arquitectura. El changelog dice que mantuvo la arquitectura y el tamaño de la preview y que "solo se volvió a post-entrenar". Esa admisión importa, porque el salto de benchmarks entre la preview y 0731 es enorme. La tabla publicada por DeepSeek muestra que DeepSWE pasó de 7.3 a 54.4 con pesos idénticos, con la única diferencia siendo el post-entrenamiento.

Se nombran tres piezas arquitectónicas en la tarjeta de modelo de V4: un híbrido de Compressed Sparse Attention y Heavily Compressed Attention, Manifold-Constrained Hyper-Connections para la estabilidad de la señal entre capas, y el optimizador Muon. La afirmación de eficiencia que todos citan, 27% de los FLOPs de inferencia de un solo token y 10% de la caché KV frente a V3.2, está medida en Pro, no en Flash, así que hay que tener cuidado al repetirla para este modelo.

Dos detalles me importan como alguien que se dedica a esto para vivir. La decodificación especulativa viene dentro del checkpoint en lugar de como un modelo de borrador separado, así que en vLLM se reduce a una sola bandera, y DeepSeek advierte explícitamente que no la apuntes a una ruta de borrador. Y los pesos tienen licencia MIT, unos 167GB en precisión mixta FP4 y FP8, con 57 cuantizaciones ya en Hugging Face. Si tu plan es correr un modelo cercano a la frontera en tu propio hardware, ese es todo el juego.

Qué es realmente Qwen 3.8 Max

Qwen fue en la dirección contraria en casi todos los ejes. El buque insignia de Alibaba es un MoE disperso de 2.4 billones de parámetros con 95B activos, y su primer modelo multimodal por encima de un billón de parámetros, que acepta texto, imágenes, video y documentos. La afirmación de la preview del equipo de Qwen fue que era "segundo solo a Fable 5", algo que en ese momento venía sin tabla de benchmarks, sin tarjeta de modelo y sin licencia tampoco.

La disponibilidad general del 2 de agosto arregló el problema de los números. No el de la apertura. La publicación de GA trajo un gráfico completo de benchmarks y una ventana de 1,000,000 de tokens, y QwenCloud ahora tiene una tarjeta de precios real de $2 y $6, con lecturas de caché implícitas a $0.25.

Se prometieron pesos en Hugging Face y ModelScope, se reafirmó en la GA que llegarían "la próxima semana", y no han aparecido. Así que el planteamiento honesto, en cuanto a licencia, es que uno de los dos es de código abierto hoy y el otro es una promesa. Mi resumen de alternativas a Qwen 3.8 Max profundiza en lo que eso significa si necesitas los pesos, y la guía de precios de Qwen 3.8 Max sigue cómo la tarifa de la preview se convirtió en esta.

Lo otro que hay que saber es sobre los valores por defecto, no sobre la capacidad. Qwen viene con el razonamiento xhigh activado y preserve_thinking habilitado, y gastará hasta 262,144 tokens de razonamiento. Cada uno de esos se factura a la tarifa de salida, así que el coste por tarea y la tarifa por token empiezan a separarse. Es la misma trampa que describí en la comparación Opus 5 vs Sonnet 5, donde el modelo más caro ganaba en coste por tarea al terminar con menos tokens. Vale la pena añadir una nota de justicia aquí: la propia configuración del harness de código de Qwen declara maxTokens: 65536, así que el tope de salida de 131K no es lo que realmente pide su propia herramienta.

La brecha de precio, y las dos cosas que oculta

Aquí está esa brecha dibujada a escala, porque la proporción no se entiende bien solo en una frase.

Gráfico de barras comparando el precio de salida por millón de tokens para Qwen 3.8 Max, DeepSeek V4 Pro y DeepSeek V4 Flash
Gráfico de barras comparando el precio de salida por millón de tokens para Qwen 3.8 Max, DeepSeek V4 Pro y DeepSeek V4 Flash

Entonces, lo primero que oculta. DeepSeek divide el precio de entrada en tarifas de acierto y fallo de caché, y en Flash la diferencia es de $0.0028 frente a $0.14, un salto de 50 veces. La caché está activada por defecto sin cambiar código, lo que suena a dinero gratis hasta que lees cómo se decide un acierto.

Diagrama de decisión que muestra cuándo una solicitud de DeepSeek se factura a la tarifa de acierto de caché frente a la de fallo de caché
Diagrama de decisión que muestra cuándo una solicitud de DeepSeek se factura a la tarifa de acierto de caché frente a la de fallo de caché

Una solicitud solo se factura a la tarifa de acierto si coincide por completo con una unidad de prefijo de caché persistida. La coincidencia parcial no cuenta en absoluto, algo que DeepSeek atribuye a su atención de ventana deslizante. DeepSeek llama a la caché "best-effort" sin tasa de acierto garantizada, y las entradas sin usar se limpian "normalmente en unas horas o unos días". Puedes auditar el desglose por llamada mediante prompt_cache_hit_tokens en la respuesta, y deberías hacerlo, porque la tarifa de $0.0028 no es un estado estable sobre el que puedas presupuestar.

Lo segundo que oculta es hacia dónde va el próximo movimiento de precio de DeepSeek. Hoy no hay ningún descuento en horas valle activo. En cambio, la tarjeta de precios anuncia que los precios en hora pico "serán 2 veces los precios normales", aplicable a todos los elementos de facturación, entre las 9:00 y las 12:00 y entre las 14:00 y las 18:00 hora de Pekín. En UTC eso es de 01:00 a 04:00 y de 06:00 a 10:00, a diario. La fecha de entrada en vigor no está anunciada, y tampoco hay ninguna tabla de tarifas pico publicada.

He visto exactamente esta misma ansiedad en llamadas de ventas antes. Un comprador con el que hablamos había visto el precio de un proveedor anterior más que duplicarse y llegó preguntando sobre bloqueos de precio contractuales antes de discutir cualquier otra cosa. Un 2x pendiente sin fecha de inicio es exactamente el tipo de frase que hace que un equipo financiero se niegue a estandarizar en un proveedor, por muy buena que parezca la tarifa de hoy.

Benchmarks: la tabla de quién, ejecutada en el harness de quién

Ambos laboratorios publicaron cifras. Ninguno ejecutó el harness del otro, así que apilar las dos tablas una sobre la otra da como resultado una comparación que no es real.

La tabla principal de DeepSeek para 0731 son nueve benchmarks de agentes, y Flash supera a V4 Pro Preview en los nueve mientras queda por detrás de Claude Opus 4.8 en los nueve. Vale la pena saber que Opus ha avanzado una generación más desde entonces, algo que cubre mi reseña de Claude Opus 5:

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewOpus-4.8
Terminal Bench 2.182.761.872.185.0
NL2Repo54.239.438.569.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.858.0
Toolathlon-Verified70.349.755.976.2
Agents' Last Exam25.215.816.525.7
AutomationBench Public25.110.812.827.2
DSBench-FullStack68.737.041.871.6
DSBench-Hard59.625.831.171.7

Lee las notas al pie, porque cambian el peso que tienen esas filas. La tarjeta de modelo de 0731 de DeepSeek dice que las tareas de agente de código se ejecutaron en "el modo mínimo de DeepSeek Harness (por publicar)" con esfuerzo de razonamiento max, así que el harness que produjo estas puntuaciones no es público y las cifras no pueden reproducirse de forma independiente hoy. Y dos de las nueve filas, DSBench-FullStack y DSBench-Hard, son conjuntos de prueba internos del propio DeepSeek.

El gráfico de Alibaba tiene el mismo tipo de problema, solo que desde el otro lado. Seis de sus benchmarks de código son evaluaciones internas de Qwen, y las puntuaciones de la competencia vinieron de harnesses mixtos en lugar de condiciones idénticas. Varias filas también las califican modelos rivales. Recorrí ese gráfico a fondo en la comparación Qwen 3.8 Max frente a GPT-5.6.

El único lugar donde existe una cifra comparable en igualdad de condiciones está dentro de la propia tabla de DeepSeek entre modos, y honestamente es lo más útil de todo este artículo:

BenchmarkFlash sin pensarFlash highFlash max
HLE (Pass@1)8.129.434.8
Apex (Pass@1)1.019.133.0
LiveCodeBench (Pass@1)55.288.491.6
GPQA Diamond (Pass@1)71.287.488.1
MRCR 1M (MMR)37.576.978.7

Los mismos pesos, la misma tarjeta de precios. Tres configuraciones. Flash sin pensar puntúa 8.1 en HLE y 1.0 en Apex; con el máximo esfuerzo puntúa 34.8 y 33.0. Apagar el pensamiento en este modelo no es un intercambio menor, y encenderlo significa pagar los tokens de razonamiento a la tarifa de salida, con un tope de 384K por llenar. Esa es la frase que me gustaría que leyera primero cualquiera que cite la cifra de $0.28.

DeepSeek también es honesto sobre dónde pierde Flash frente a Pro, y eso lo respeto. La tarjeta de modelo afirma que Flash-Max alcanza un rendimiento de razonamiento comparable dado un presupuesto de pensamiento mayor, pero queda "ligeramente por detrás en tareas de puro conocimiento y los flujos de trabajo agénticos más complejos". Las cifras lo respaldan: SimpleQA-Verified es 34.1 para Flash Max frente a 57.9 para Pro Max. Trece mil millones de parámetros activos es donde el conocimiento del mundo se vuelve caro, y esa brecha se midió en la preview, así que nadie debería afirmar que 0731 la cerró.

Qué dicen los tableros independientes, y en qué no están de acuerdo

Aquí es donde se cae la versión fácil de esta comparación. Hay dos árbitros independientes. Miden cosas distintas, y ahora mismo apuntan en direcciones opuestas.

Artificial Analysis puntúa a DeepSeek V4 Flash con el máximo esfuerzo con un Índice de Inteligencia de 50, tercero entre los modelos de pesos abiertos, con un coste por tarea de $0.03. El mismo tablero puntúa la variante sin razonamiento de los mismos pesos con 29. Así que mi punto anterior no es solo la tabla interna de DeepSeek hablando: un laboratorio externo midió un vaivén de inteligencia de 21 puntos entre la configuración barata y la buena.

Artificial Analysis también señala algo que va en contra de la narrativa del precio. Flash quemó 210M de tokens de salida para completar el Índice de Inteligencia frente a una mediana de clase de 100M, algo que el tablero describe con sus propias palabras como "muy verboso en comparación". La ejecución completa aun así costó solo $72.02, así que los tokens baratos absorbieron aquí la verbosidad. Pero el mecanismo aquí es el mismo que señalé sobre los valores por defecto de Qwen, y resulta que el modelo con el problema de verbosidad medido es el barato. Este es el número que me gustaría que publicaran más comparaciones de herramientas de codificación con IA, porque la verbosidad es lo que convierte una tarjeta de tarifas en una factura.

En cuanto a Qwen en ese tablero: no está. Qwen 3.8 Max no tiene puntuación de Artificial Analysis a fecha del 3 de agosto de 2026, un día después de su GA. La fila más alta de Alibaba es Qwen3.7 Max con 46. Cualquiera que cite un número de inteligencia independiente para Qwen 3.8 Max esta semana está citando el modelo equivocado.

LMArena, que es votación de preferencia humana en lugar de evaluaciones automatizadas, cuenta la historia contraria:

TableroQwen 3.8 MaxDeepSeek V4 Flash
Texto, rango general#5#79
Elo de Texto1496 ± 101436 ± 4 (48,667 votos)
WebDev#4, 1668#8, 1577 (como -high)
Vision#2, 1305No elegible

Sesenta puntos de Elo y setenta y cuatro puestos de rango, a favor del modelo que cuesta 21 veces más. Dos advertencias antes de que alguien capture esa tabla. Las filas de WebDev y Texto de Qwen están marcadas como Preliminares con los intervalos de confianza más amplios del tablero, ±18 con solo 1,563 votos, frente a los ±4 de Flash con 48,667. Y el deepseek-v4-flash normal falta por completo en WebDev, así que esa fila compara a Qwen contra la variante -high de Flash.

Así que el marcador se lee así: el compuesto automatizado prefiere a Flash y no ha medido a Qwen, mientras que los humanos prefieren a Qwen por un margen amplio sobre datos escasos. Esa misma división automatizado contra humano apareció en mi comparación GPT-5.6 frente a Claude, y es la razón por la que no confío en un veredicto de un solo número para ninguno de estos lanzamientos.

Dónde estos dos en realidad no compiten

Quita el precio de en medio y aparece una imagen distinta. Estos dos ocupan cuadrantes diferentes, y la búsqueda que te trajo aquí aplana esa diferencia.

Cuadrante de posicionamiento que sitúa a Qwen 3.8 Max y DeepSeek V4 Flash según precio por token frente a entrada multimodal
Cuadrante de posicionamiento que sitúa a Qwen 3.8 Max y DeepSeek V4 Flash según precio por token frente a entrada multimodal

DeepSeek no publica entrada de imagen, video, audio ni documentos para V4 Flash. Su configuración declara un modelo de lenguaje causal sin bloque de encoder de visión, y la etiqueta de pipeline en Hugging Face es generación de texto. La fila de funciones en la tarjeta de precios enumera salida JSON, llamadas a herramientas y FIM, sin ninguna fila de entrada de archivos en ningún lado. El trabajo multimodal de DeepSeek vive en líneas de modelos separadas dentro de la misma organización. Para ser precisos, no hay entrada de imagen documentada, y eso no es lo mismo que una afirmación de que no puede.

Así que si tus entradas incluyen capturas de pantalla, eso lo decide por ti. Una cola de soporte donde los clientes adjuntan fotos de un producto averiado, un agente de IA leyendo páginas de Confluence con diagramas incrustados, un flujo de trabajo que procesa facturas escaneadas. En el propio gráfico de Alibaba, cada fila de visión es una victoria clara para Qwen, y esa capacidad no está en el tablero para Flash a ningún precio. Es la misma división con la que sigo topándome cuando los equipos evalúan el mejor LLM para atención al cliente: el token más barato rara vez lee el adjunto.

Si tus entradas son texto y quieres los pesos, Flash lo decide igual de rápido. Licencia MIT, 167GB, 57 cuantizaciones de la comunidad, y las propias recetas de vLLM y SGLang de DeepSeek publicadas. Qwen 3.8 Max no se puede autoalojar en absoluto ahora mismo, que es todo el argumento de mi resumen de agentes de IA de código abierto, y la razón por la que no trataría a estos dos como backends intercambiables para el mismo agente de soporte de IA sin código.

Lo que realmente dice la reacción

Nadie ha publicado todavía una prueba práctica lado a lado con el mismo prompt para estos dos, lo cual no sorprende cuando uno de ellos tiene apenas horas. Lo que sí existe es aritmética, y la versión más aguda vino de una cuenta japonesa de IA el día de la GA, poniendo las puntuaciones de DeepSWE una junto a otra en una publicación de X: Qwen 3.8 Max en 56.6, DeepSeek V4 Flash en 54.4, Kimi K3 en 69, GLM 5.2 en 44. Dos puntos de DeepSWE, con un precio de entrada 14 veces mayor y un precio de salida 21 veces mayor.

Los recibos que la gente publicó sin que nadie se los pidiera en el hilo de lanzamiento de DeepSeek son los datos de coste más concretos de toda la reacción:

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886" -- lionkor, Hacker News

Una respuesta lo superó con 2.1 mil millones de tokens en 12 días por $19.27, atribuyéndolo a lo que llamaron la "caché de entrada 120 veces más barata" y admitiendo que la mayor parte de ese tráfico eran bucles experimentales que producían basura.

Del lado de Qwen, el reporte práctico más contundente no trata de calidad en absoluto. Trata de lograr que la cosa termine:

Hacker News

"Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build. For the implementation, there were signs it had good vision, but the timeouts make this very hard to use in a production setting."

La prueba del pelícano de Simon Willison llegó al mismo lugar, con un precio adjunto: según su comentario en HN, tardó 11 minutos, olvidó las ruedas, y costó 17 centavos. Vale la pena notar también la respuesta que contraargumenta que los timeouts eran del harness y no del modelo, una corrección justa que no se ha resuelto de ninguna manera.

El escepticismo va en ambas direcciones, y la misma cuenta que hizo la aritmética de DeepSWE fue tajante sobre el salto de Flash doce días antes: que DeepSWE pasara de 7.3 a 54.4 con pesos sin cambiar invitó a sospechas de "benchmaxxing", dado lo mal que había puntuado el modelo cuando ese benchmark era nuevo. Vale la pena tenerlo presente, porque un re-post-entrenamiento que produce un vaivén de 47 puntos es o bien un resultado de entrenamiento real o uno ajustado, y no hay ningún harness público que te diga cuál.

Dos quejas sobre Flash se repiten lo suficiente como para contar como hallazgos. La primera es la fiabilidad bajo compresión:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

Artificial Analysis pone una cifra junto a eso: la tasa de alucinación de AA-Omniscience de Flash es del 84%, lo cual es una mejora de 12 puntos respecto a su predecesor y sigue siendo una cifra alta en términos absolutos.

La segunda es sobre a dónde van los tokens, y para cualquiera en soporte esta es la que realmente lo decide:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models [...] But these are 3x to 5x more expensive than directly using DeepSeek."

Si estás enrutando tickets de clientes, entonces la tarifa de primera parte no es la tarifa que puedes usar. Pagar de 3 a 5 veces más por retención cero de datos mueve a Flash de $0.28 de salida a algo entre $0.84 y $1.40, que es una conversación distinta a la que empieza la tarjeta de precios.

Con cuál construiría

Para trabajo de texto de alto volumen donde puedas medir tú mismo la calidad de la salida, DeepSeek V4 Flash. El precio es real, los pesos son MIT, el tope de concurrencia de 2,500 es cinco veces el de Pro, y el límite de salida de 384K es la especificación menos discutida de cualquiera de las dos tarjetas. Ejecútalo con esfuerzo high en lugar de low, y presupuesta para los tokens de razonamiento en lugar de la tarifa de la etiqueta. Trata la tasa de acierto de caché como una esperanza en lugar de una partida presupuestaria.

Para cualquier cosa donde la entrada no sea texto plano, Qwen 3.8 Max, y no a regañadientes. Lo multimodal a escala de frontera es una categoría en la que Flash no está, y $6 por millón de tokens de salida es un precio normal para eso. Su ventaja en preferencia humana es el argumento más fuerte para pagar 21 veces más, y la advertencia honesta es que esa ventaja hoy se apoya en 1,563 votos, sin ninguna puntuación de inteligencia independiente detrás todavía.

Lo que me haría cambiar entre ambos es un número que ninguno de los dos laboratorios publica: cuántos intentos necesita cada modelo en tu trabajo. Flash a $0.28 que reintenta tres veces cuesta más que Qwen a $6.00 que acierta a la primera. Antes de elegir, yo pasaría unos cientos de mis propias entradas reales por ambos, con el mismo esfuerzo de razonamiento, y luego contaría los reintentos. Eso es un fin de semana de trabajo, y le gana a cualquier leaderboard de este artículo.

Para una cola de soporte en concreto, mi respuesta honesta es que esta comparación es el eje equivocado. Ambos modelos pueden producir una respuesta fluida a un ticket. Ninguno conoce tu ventana de reembolso, y ninguno va a escalar cuando no está seguro. Tampoco ninguno de los dos ha leído los 4,000 tickets que tu equipo ya respondió. Esa última parte es un problema de recuperación de información, no un problema de elección de modelo, y es la razón por la que la prevención de alucinaciones de IA es una función de producto y no una especificación de modelo.

Escucho constantemente la versión posterior de esto: un comprador quemó 200 interacciones en un solo día de prueba y de inmediato empezó a preocuparse por el coste por interacción a un ritmo de 9,000 al mes. Su problema nunca fue realmente la tarifa por token. Era que nada en la configuración le decía si las respuestas eran correctas, que es la variable real en cualquier modelo de coste de IA para atención al cliente, y la razón por la que yo sigo, en cambio, la tasa de resolución de tickets con IA.

Prueba eesel para trabajo de soporte

eesel AI es deliberadamente agnóstico al modelo, porque el modelo ganador cambia cada tres semanas y la capa que lo rodea es lo que realmente posees. Se entrena con tus tickets pasados y tu centro de ayuda en lugar de un rastreo genérico, y mantiene un umbral de confianza para que una respuesta insegura se convierta en un traspaso al helpdesk en lugar de una adivinanza. Y simula contra tus tickets históricos antes de responder a un cliente real.

La vista de actividad de eesel AI mostrando conversaciones resueltas y pendientes de Zendesk junto con ejecuciones de skills
La vista de actividad de eesel AI mostrando conversaciones resueltas y pendientes de Zendesk junto con ejecuciones de skills

Ese paso de simulación existe por la historia de la marca de vehículos al principio de este artículo. Si estás evaluando Qwen o DeepSeek para un trabajo real de automatización de tickets de soporte, la primera pregunta que vale la pena responder no es qué token es más barato. Es cómo se ve tu tasa de resolución en tus propios tickets, antes de que un cliente vea cualquiera de ellos.

Se conecta directamente al helpdesk que ya usas, incluido Zendesk, y es gratis probarlo en tu propia cola.

Preguntas frecuentes

¿Es DeepSeek V4 Flash más barato que Qwen 3.8 Max?
Sí, y por un margen amplio según las tarifas publicadas. DeepSeek V4 Flash cuesta $0.14 por millón de tokens de entrada en caso de fallo de caché y $0.28 por millón de salida. Qwen 3.8 Max cuesta $2.00 y $6.00. Eso es aproximadamente 14 veces más en entrada y 21 veces más en salida, antes de contar cuántos tokens emite realmente cada modelo para terminar una tarea.
¿Cuál es mejor, Qwen 3.8 Max o DeepSeek V4 Flash?
Depende de si tus entradas son de texto. Qwen acepta imágenes, video y documentos; DeepSeek no documenta entrada de imagen para V4 Flash. En razonamiento de texto los dos están más cerca de lo que sugiere el precio, y ninguno de los dos laboratorios ejecutó el harness del otro. Mi reseña completa de Qwen 3.8 Max cubre el problema de las tablas del propio vendedor con más detalle.
¿DeepSeek V4 Flash tiene pesos abiertos?
Sí, bajo licencia MIT, que permite uso comercial y modificación. El checkpoint pesa unos 167GB en precisión mixta FP4 y FP8. Qwen 3.8 Max no es comparable aquí: los pesos se prometieron en la preview y seguían sin publicarse en la disponibilidad general. Consulta nuestro resumen de agentes de IA de código abierto para ver cuánto cuesta realmente el autoalojamiento.
¿Cuál es la ventana de contexto de Qwen 3.8 Max frente a DeepSeek V4 Flash?
Ambos tienen 1,000,000 de tokens de entrada. La diferencia está en la salida: DeepSeek V4 Flash tiene un tope de 384K tokens de salida frente a los 131,072 de Qwen. Ninguno publica un recargo por contexto largo, algo a tener en cuenta al comparar con el precio de GPT-5.6.
¿Puede DeepSeek V4 Flash leer imágenes como Qwen 3.8 Max?
No hay entrada de imagen documentada para DeepSeek V4 Flash. Su configuración declara un modelo de lenguaje causal sin encoder de visión, y DeepSeek mantiene su trabajo multimodal en líneas de modelos separadas. Qwen 3.8 Max acepta texto, imágenes, video y documentos, que es la razón más clara para pagar su tarifa. Nuestra guía de modelos de lenguaje pequeños cubre la misma disyuntiva con menos parámetros.
¿Cuánto cuesta operar DeepSeek V4 Flash a gran escala?
Con 500M de tokens de entrada y 200M de salida al mes y una tasa de acierto de caché del 40%, las tarifas publicadas dan un total de unos $99, frente a unos $1,850 para el mismo tráfico en Qwen. Dos cosas mueven esa cifra: DeepSeek ha anunciado un precio pendiente de 2x en horas pico, y los tokens de razonamiento se facturan a la tarifa de salida. Nuestro desglose de coste de IA para atención al cliente recorre las mismas cuentas para trabajo de soporte.
¿Puedo usar Qwen 3.8 Max o DeepSeek V4 Flash para atención al cliente?
Puedes apuntar cualquiera de los dos a un ticket, pero un modelo sin capas adicionales no tiene memoria de tus tickets pasados, ninguna barrera de confianza y ningún traspaso al helpdesk. eesel AI aporta esa capa y se conecta con Zendesk y Freshdesk, así que compras una IA para atención al cliente en lugar de una tarifa por token.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustración que compara las familias de modelos Qwen 3.8 Max de Alibaba y GPT-5.6 de OpenAI
Trending

Qwen 3.8 Max vs GPT-5.6: precio, benchmarks y la diferencia real

Ambos modelos por fin tienen precios y benchmarks publicados. Esto es lo que dicen realmente las cifras, lo que no pueden decir, y cuál elegiría yo para construir.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
DeepSeek V4 Flash: precios y lo que pagarás realmente
Trending

DeepSeek V4 Flash: precios y lo que pagarás realmente

DeepSeek V4 Flash figura a $0.14 de entrada y $0.28 de salida por millón de tokens. Usuarios reales han publicado tarifas combinadas por debajo de un centavo. Esto es lo que decide cuál te toca a ti.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente
Trending

DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente

DeepSeek V4 Flash cuesta $0.14 de entrada y $0.28 de salida por millón de tokens, y supera a la propia gama alta de DeepSeek. Esto es lo que la tabla de precios no cuenta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración comparando DeepSeek V4 Flash y Kimi K3 de Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: ¿cuál deberías usar?

Un modelo cuesta 29 veces más por tarea que el otro. Revisé todos los números publicados de ambos, y lo interesante es la opción intermedia que nadie debería comprar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Dos personas haciendo pulseadas en una mesa mientras una tercera observa, ilustrando una comparación directa entre modelos
Trending

DeepSeek V4 Flash vs GPT-5.6: ¿cuál eliges para construir?

DeepSeek V4 Flash vs GPT-5.6 con los precios de agosto de 2026. La verdadera pelea es Flash contra Luna, la inteligencia queda empatada, y lo que decide es velocidad, visión y datos.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de un desarrollador accediendo a Qwen 3.8 Max de Alibaba a través del chat, lo multimodal y las superficies de API
Trending

Cómo acceder a Qwen 3.8 Max: 5 vías y qué cobra cada una

Cinco formas reales de llegar al buque insignia de 2,4 billones de parámetros de Alibaba, desde el chat gratuito hasta la API de $2/$6, además de las trampas de facturación que atrapan a la gente por el camino.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustración que compara los planes de modelo DeepSeek V4 Flash y V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro: ¿qué plan deberías usar?

El plan barato de DeepSeek ahora puntúa más alto que el caro en el ranking independiente. Aquí está exactamente dónde eso se cumple, y los dos sitios donde no.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustración que compara el Qwen 3.8 Max de Alibaba y el Kimi K3 de Moonshot AI
Trending

Qwen 3.8 Max vs Kimi K3: los números que ningún laboratorio publicó

Dos laboratorios chinos lanzaron un modelo insignia de más de 2 billones de parámetros con diecisiete días de diferencia, y ninguno incluyó al otro en su tabla de benchmarks. Esto es lo que realmente se compara, cuánto cuesta de verdad, y cuál elegiría yo.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Ilustración de dos personas revisando tarjetas de precios escalonados en una pantalla, con el logo de Qwen
Trending

Precios de Qwen 3.7 Flash: lo que realmente pagas en 2026

La tarifa de $0.03 es real, y es solo uno de los cuatro medidores de tu factura. Aquí te explicamos cómo el tramo del prompt, la caché, la región de batch y la tasa de reintentos se combinan en la cifra que realmente te cobran.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis