Las 8 mejores alternativas a DeepSeek V4 Flash en 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición August 6, 2026

Verificado por expertos
Un desarrollador eligiendo entre tarjetas de modelos, con la tarjeta de la ballena de DeepSeek en el centro rodeada de modelos rivales

Por qué no las ordeno por puntuación

Escribo sobre intención de búsqueda para vivir, y "deepseek v4 flash alternatives" es una consulta de compra con una suposición oculta: que buscas algo mejor. En los dos tableros que miden este modelo, en la mayoría de los casos no es así.

Artificial Analysis sitúa a Flash con el máximo esfuerzo en 50 y lo describe como "entre los modelos líderes en inteligencia y con buen precio comparado con otros modelos de pesos abiertos de tamaño similar." Luna puntúa 51. Gemini 3.6 Flash puntúa 50. Estarías intercambiando lateralmente en inteligencia y pagando más por ese privilegio.

Lo que en realidad estarías comprando es una capacidad o una respuesta de cumplimiento. Así que así está ordenada esta lista: por la carencia que resuelve, con el coste honesto del cambio adjunto a cada una. Si quieres la lectura pura de especificaciones del modelo que estás dejando, el resumen de DeepSeek V4 Flash y la reseña de Flash lo cubren, y Flash frente a GPT-5.6 cubre en detalle el enfrentamiento más cercano.

Los números, en un solo lugar

Cada cifra a continuación proviene de Artificial Analysis o de la propia página de precios del proveedor, verificada el 4 de agosto de 2026. "Index run" es lo que le costó a AA evaluar ese modelo en todo el Intelligence Index, que es lo más parecido a una cifra real de coste por tarea que cualquiera de ellos publica.

ModeloAA IndexEntrada /1MSalida /1MIndex runVelocidad de salidaTiempo al primer tokenTokens para ejecutar el índiceTipos de entradaContextoPesos
DeepSeek V4 Flash 0731 (max)50$0.14$0.28$72.02113 t/s1.31s210Mtext1MMIT
GPT-5.6 Luna (max)51$0.20$1.20$174.06181 t/s132.75s130Mtext, image1.05Mclosed
Gemini 3.6 Flash (high)50$1.50$7.50$726.70213 t/s15.69s59Mtext, image, speech, video1Mclosed
Gemini 3.5 Flash-Lite36$0.30$2.50$153.08366 t/s8.41s43Mtext, image, speech, video1Mclosed
Claude Haiku 4.5 (non-reasoning)24$1.00$5.00no publicado90 t/s0.96sno publicadotext, image200Kclosed
Kimi K3 (max)57$3.00$15.00$2,437.4136 t/s2.85s130Mtext, image1Mlicencia kimi-k3
DeepSeek V4 Pro44$0.435$0.87no publicadono publicadono publicadono publicadotext1Mopen
Qwen3.7-Flashno listado$0.03–$0.20$0.13–$0.80no publicado59 t/sno publicadono publicadotext, image, video1Mclosed

De esa tabla destacan dos cosas. Flash tiene el primer token más rápido del grupo por un factor de dos sobre todo excepto Haiku, y es el único modelo aquí que es a la vez de pesos abiertos y realmente barato. Todo lo demás es un intercambio.

Un gráfico de barras horizontales dibujado a mano del tiempo al primer token con máximo esfuerzo, con DeepSeek V4 Flash en 1.31 segundos y GPT-5.6 Luna en 132.75 segundos saliéndose del marco
Un gráfico de barras horizontales dibujado a mano del tiempo al primer token con máximo esfuerzo, con DeepSeek V4 Flash en 1.31 segundos y GPT-5.6 Luna en 132.75 segundos saliéndose del marco

Elige por la carencia, no por la puntuación

Antes de la lista: esta es la decisión en cinco clics. Elige lo que realmente te está bloqueando y obtienes la opción más el coste real del cambio.

¿Para qué estás cambiando realmente?

Flash ya es el más barato y el más rápido en dar el primer token. Así que elige la carencia.

GPT-5.6 Luna

Flash no tiene entrada de imagen documentada. Luna acepta texto e imágenes, puntúa un punto más en el índice de AA con 51, y funciona a 181 tokens por segundo. También es el modelo con capacidad de visión más barato de esta comparación, con $0.20 de entrada y $1.20 de salida.

Coste del cambio: alrededor de 3 veces la factura real en escenarios con mucha caché, mucho razonamiento y prompts largos, y un tiempo al primer token de 132.75s con máximo esfuerzo. No lo pongas en una vía interactiva sin reducir el esfuerzo.

Autoalojar los pesos de Flash

Conservas exactamente el mismo modelo y trasladas la inferencia. Los pesos tienen licencia MIT, y una configuración de producción pública ya ejecuta el checkpoint 0731 en una sola AMD MI300X a 168.6 tokens por segundo en flujo único, más rápido que los 113 medidos en la API oficial.

Coste del cambio: hardware. 156.67 GiB de pesos deben caber en HBM, y una sola MI300X es difícil de comprar por sí sola. Si prefieres no gestionar GPUs, el plan de pago de Gemini afirma explícitamente que tu contenido no se usa para mejorar sus productos.

Gemini 3.5 Flash-Lite

366 tokens por segundo, el más rápido de este grupo, y el más conciso: 43M de tokens de salida para ejecutar el índice de AA frente a los 210M de Flash. Acepta texto, imagen, voz y video. Bueno para clasificación y triaje a gran volumen.

Coste del cambio: inteligencia. Índice 36 frente al 50 de Flash, así que es una clase de tarea distinta. Y sin uso de computadora a ningún precio.

Kimi K3

La opción de fiabilidad. Tasa de alucinación AA-Omniscience del 51% frente al 84% de Flash, Omniscience Index de 18 frente al -16 de Flash, y la inteligencia bruta más alta aquí con 57.

Coste del cambio: unas 29 veces el coste por tarea y 36 tokens por segundo. Tampoco hay una K3 económica. La fila K3 (low) puntúa 47, tres puntos por debajo de Flash, a 8 veces el coste. El razonamiento no se puede desactivar.

DeepSeek V4 Pro

Quédate en la familia. Pro sigue ganando claramente en recuperación y búsqueda de datos en contexto largo: SimpleQA-Verified 57.9 frente al 34.1 de Flash, MRCR en contexto de 1M 83.5 frente a 78.7, y los votantes humanos de LMArena lo clasifican en 1458 frente al 1436 de Flash.

Coste del cambio: 3.11x en entrada y salida con fallo de caché, y sin ejecución económica. La propia tabla de mapeo de esfuerzo de DeepSeek sirve una solicitud low en Pro como high.

1. GPT-5.6 Luna

La página del modelo GPT-5.6 Luna en la plataforma de desarrolladores de OpenAI, mostrando $0.20 de entrada, $0.02 de entrada en caché y $1.20 de salida por millón de tokens, tomado de OpenAI
La página del modelo GPT-5.6 Luna en la plataforma de desarrolladores de OpenAI, mostrando $0.20 de entrada, $0.02 de entrada en caché y $1.20 de salida por millón de tokens, tomado de OpenAI

Ideal para: el cambio más equivalente, y la forma más barata de añadir entrada de imagen.

Qué es realmente

Luna es el nivel económico de la familia GPT-5.6, descrito en su propia página de modelo como "optimizado para cargas de trabajo sensibles al coste." La razón por la que la mayoría de las comparaciones con Flash se equivocan es que gpt-5.6 es un alias de Sol, el nivel de vanguardia, así que la gente termina comparando por accidente un modelo de $0.14 con uno de $5. Contra Luna específicamente, la cuestión de inteligencia es prácticamente un empate: 51 frente a 50 en el índice de AA.

Tiene una ventana de contexto de 1,050,000 tokens, un máximo de salida de 128,000 tokens, un corte de conocimiento del 16 de febrero de 2026 y soporte de tokens de razonamiento. Entrada de texto e imagen, salida de texto.

Precios

$0.20 de entrada, $0.02 de entrada en caché, $1.20 de salida por millón. Hay una escala real de descuentos que la mayoría de los artículos pasa por alto:

NivelEntrada /1MCaché /1MSalida /1M
Standard$0.20$0.02$1.20
Batch$0.10$0.01$0.60
Flex$0.10$0.01$0.60
Fast mode$0.40$0.04$2.40
Long context (>272K)$0.40$0.04$1.80

En Batch o Flex, la entrada de Luna a $0.10 es en realidad más barata que la de Flash a $0.14. Si tu carga de trabajo es apta para procesarse de noche y tiene mucha entrada con salidas cortas, algo que describe buena parte de la clasificación de tickets, Luna puede salir ganando. Flash no tiene ningún descuento por lote.

Dónde supera a Flash

Entrada de imagen, latencia publicada sobre la que puedes planificar, y una historia de manejo de datos que puedes entregar a un revisor de seguridad. También búsqueda web, algo que vale la pena precisar: Flash tiene una herramienta web_search del lado del servidor, pero solo en la Responses API exclusiva de Flash, no en la vía chat-completions. La afirmación repetida de "DeepSeek no tiene búsqueda web" está desactualizada.

Dónde no lo supera

Los datos de Hacker News sitúan la diferencia real entre 2x y 3x, no las 4.3x que sugiere la columna de salida, porque la entrada en caché de Luna también es barata. Pero 3x sigue siendo 3x. Y la cifra de latencia es brutal:

Hacker News

"2x to 3x the price… 2 to 5 times faster inference"

Ese "faster inference" es rendimiento, no capacidad de respuesta. Con máximo esfuerzo, el tiempo al primer token de Luna es de 132.75 segundos. Bien para un trabajo por lotes, mal para un widget de chat.

También hay un abismo asimétrico a tener en cuenta: los prompts que superan 272K de entrada vuelven a tarificar toda la solicitud al doble de entrada y 1.5 veces de salida, no solo el excedente. Las escrituras en caché se cobran a 1.25x la tarifa sin caché.

Veredicto

Si el motivo para dejar Flash es la entrada de imagen o una conversación de cumplimiento, esto es lo primero que hay que probar, y la tarifa de lote lo hace más barato de lo que la gente asume. No lo pondría en una superficie interactiva con máximo esfuerzo. El desglose completo de niveles está en la guía de precios de GPT-5.6, y la reseña de GPT-5.6 cubre toda la familia.

2. Gemini 3.5 Flash-Lite

El catálogo de modelos de la API de Gemini con Gemini 3.5 Flash-Lite destacado como el modelo 3.5 más rápido y rentable para ejecución de alto rendimiento, tomado de Google
El catálogo de modelos de la API de Gemini con Gemini 3.5 Flash-Lite destacado como el modelo 3.5 más rápido y rentable para ejecución de alto rendimiento, tomado de Google

Ideal para: clasificación de gran volumen, triaje y cualquier caso donde los tokens por segundo sean el cuello de botella.

Qué es realmente

El modelo generalmente disponible más barato de Google en la línea 3.5, descrito en su propia página de modelo como "nuestro modelo 3.5 más rápido y rentable para ejecución de alto rendimiento." El código del modelo es gemini-3.5-flash-lite, con contexto de entrada de 1,048,576, salida de 65,536, y acepta texto, imagen, voz, video y PDF.

Precios

$0.30 de entrada y $2.50 de salida por millón en Standard. Batch y Flex reducen ambos a la mitad, $0.15/$1.25. Priority es $0.54/$4.50. El almacenamiento en caché de contexto cuesta $0.03.

Dónde supera a Flash

Dos cifras. 366 tokens por segundo, el más rápido aquí, y 43M de tokens de salida para ejecutar el índice de AA frente a los 210M de Flash. AA lo describe como "bastante conciso" y a Flash como "muy verboso." Esa concisión es la razón de que un modelo con una tarifa de salida nominalmente 9 veces mayor solo costara $153.08 en ejecutar el índice frente a los $72.02 de Flash, aproximadamente 2 veces, no 9.

La entrada multimodal es nativa en cuatro modalidades. Y el nivel de pago de Google es explícito donde el de DeepSeek guarda silencio: la página de precios enumera "Contenido no utilizado para mejorar nuestros productos" como propiedad del nivel de pago, frente a "Contenido utilizado para mejorar nuestros productos" en el nivel gratuito.

Dónde no lo supera

Intelligence Index de 36 frente al 50 de Flash. No es una diferencia pequeña, es otra categoría de peso, y Flash-Lite va a ser peor en cualquier cosa agéntica o de varios pasos. Sin uso de computadora a ningún precio. El tiempo al primer token es de 8.41s, seis veces el de Flash.

Veredicto

Si estás ejecutando clasificación de intención o análisis de sentimiento sobre un torrente de datos, esta es la forma correcta y la concisión ahorra dinero real. Si estás ejecutando un agente, no lo es. Más en el resumen de Gemini 3.5 Flash-Lite.

3. Gemini 3.6 Flash

La página de precios de la API de desarrolladores de Gemini mostrando los niveles Free, Paid y Enterprise, con el nivel de pago afirmando que el contenido no se usa para mejorar los productos de Google, tomado de Google
La página de precios de la API de desarrolladores de Gemini mostrando los niveles Free, Paid y Enterprise, con el nivel de pago afirmando que el contenido no se usa para mejorar los productos de Google, tomado de Google

Ideal para: igualar la inteligencia de Flash con un tercio de los tokens de salida, además de uso de computadora.

Qué es realmente

El nivel Flash de referencia de Google, lanzado el 21 de julio de 2026, posicionado como el modelo que "equilibra velocidad e inteligencia para ofrecer un rendimiento sólido en tareas agénticas y multimodales." El corte de conocimiento se movió a marzo de 2026. El uso de computadora viene integrado. Contexto de 1M, salida de 65K.

Precios

$1.50 de entrada, $7.50 de salida por millón. Batch reduce ambos a la mitad, $0.75/$3.75.

Dónde supera a Flash

Este es el punto que cambió cómo leo toda la comparación. Gemini 3.6 Flash puntúa exactamente el mismo 50 que Flash, y lo consigue con 59M de tokens de salida frente a los 210M de Flash. En la tabla de precios eso es una brecha de 26.8x en salida. En la factura real de ejecución del índice de AA es $726.70 frente a $72.02, lo que da 10.1x.

10x sigue siendo 10x, así que esto no es un modelo más barato. Pero la dirección importa: toda comparación de verbosidad en este artículo se mueve en contra de Flash, y si has estado presupuestando según la columna por token, has estado sobreestimando tu ahorro.

Un diagrama de dos etapas dibujado a mano mostrando cómo la brecha de precio de lista en salida de 26.8x se comprime a una brecha de 10.1x en la factura real de ejecución del índice, porque Flash usa 210M de tokens de salida frente a los 59M de Gemini 3.6 Flash con la misma puntuación de 50
Un diagrama de dos etapas dibujado a mano mostrando cómo la brecha de precio de lista en salida de 26.8x se comprime a una brecha de 10.1x en la factura real de ejecución del índice, porque Flash usa 210M de tokens de salida frente a los 59M de Gemini 3.6 Flash con la misma puntuación de 50

También aporta cuatro modalidades de entrada, 213 tokens por segundo y uso de computadora, algo que nada más en esta lista ofrece en este nivel.

Dónde no lo supera

10x el coste por tarea con paridad en inteligencia. Tiempo al primer token de 15.69s. Pesos cerrados, así que el autoalojamiento queda descartado.

Veredicto

La opción cuando el modelo hace trabajo agéntico sobre una base de conocimiento con medios mixtos y quieres reducir el conteo de tokens. Lee el resumen de Gemini 3.6 Flash, o la reseña para el detalle de las evaluaciones.

4. Claude Haiku 4.5

La visión general de modelos de la documentación de la Claude Platform comparando Fable 5, Opus 5, Sonnet 5 y Haiku 4.5, con Haiku descrito como el modelo más rápido con inteligencia casi de vanguardia, tomado de Anthropic
La visión general de modelos de la documentación de la Claude Platform comparando Fable 5, Opus 5, Sonnet 5 y Haiku 4.5, con Haiku descrito como el modelo más rápido con inteligencia casi de vanguardia, tomado de Anthropic

Ideal para: el primer token más rápido del grupo, y la revisión de seguridad más sencilla.

Qué es realmente

El modelo pequeño de Anthropic, claude-haiku-4-5, descrito en la documentación como "el modelo más rápido con inteligencia casi de vanguardia." Entrada de texto e imagen, contexto de 200K, conocimiento hasta julio de 2025. Disponible en la API de Claude, Amazon Bedrock, Google Cloud y Microsoft Foundry.

Precios

$1.00 de entrada, $5.00 de salida por millón.

Dónde supera a Flash

0.96 segundos al primer token, la única cifra en esta página que supera el 1.31s de Flash, a 90.2 tokens por segundo. AA califica ese TTFT como "muy competitivo" frente a una mediana de 1.43s en su rango de precio.

Lo otro en que supera a Flash es en adquisición. La disponibilidad multicloud a través de Bedrock y Google Cloud significa que la residencia de datos y la contratación son un problema ya resuelto por otro, no por ti. En mi experiencia ese es el bloqueo real con más frecuencia que cualquier benchmark:

Bloqueado por completo por HIPAA/BAA durante la demo, descrito como un bloqueo duro, no una preocupación menor.

Una plataforma de salud y fisioterapia en EE. UU. sobre Zendesk que gestiona alrededor de 500 tickets al mes

Ese trato no se estancó por una tasa de alucinación.

Dónde no lo supera

Intelligence Index de 24 sin razonamiento, el más bajo aquí, y la ventana de contexto más pequeña con 200K frente al 1M de todos los demás. AA no publica un coste de ejecución del índice para él, así que el coste por tarea es desconocido. Anthropic también ofrece una variante con razonamiento, pero el 24 es la fila sin razonamiento, y eso es lo que compran los $1/$5 en la configuración por defecto.

Veredicto

Elígelo cuando la capacidad de respuesta y la contratación importen más que la capacidad bruta, que es la mayoría del chat de cara al cliente. No lo elijas para trabajo agéntico. OpenAI API frente a Anthropic API cubre el lado de la experiencia de desarrollador, y precios de Claude Sonnet 5 cubre el nivel superior.

5. Kimi K3

La documentación de precios de inferencia de modelos de la Kimi Platform mostrando la unidad de facturación y la lógica de facturación para el modelo insignia Kimi K3, tomado de Moonshot AI
La documentación de precios de inferencia de modelos de la Kimi Platform mostrando la unidad de facturación y la lógica de facturación para el modelo insignia Kimi K3, tomado de Moonshot AI

Ideal para: el único caso en el que pagar 29 veces más se justifica: respuestas que no puedes permitirte que sean incorrectas.

Qué es realmente

El buque insignia de Moonshot AI, lanzado el 16 de julio de 2026. 2.8T de parámetros totales con 104B activos, contexto de 1M, visión nativa para imágenes y video. Los pesos abiertos se publicaron el 27 de julio como se prometió, 1,561 GB en 96 fragmentos, bajo una licencia kimi-k3 con cláusulas para operadores de MaaS a gran escala y productos muy grandes.

Precios

$3 de entrada, $0.30 de entrada con acierto de caché, $15 de salida por millón. Eso es territorio de Claude Sonnet, no territorio económico.

Dónde supera a Flash

Fiabilidad, y no por poco. Tasa de alucinación AA-Omniscience del 51% frente al 84% de Flash. Omniscience Index de 18 frente al -16 de Flash, donde una puntuación negativa significa más respuestas incorrectas que correctas. Precisión del 46% frente al 37%. La inteligencia bruta más alta de esta comparación con 57.

Si tu caso de uso es un sector regulado o un agente de IA que toca dinero, esa diferencia lo es todo.

Dónde no lo supera

El coste, y no por el margen del precio de lista. La tarifa de salida es 54 veces la de Flash, pero el coste por tarea de AA es de $0.03 frente a $0.86, así que la brecha real es de 29x porque K3 es más verboso por punto de inteligencia. Ejecución completa del índice: $72.02 frente a $2,437.41.

36 tokens por segundo, el más lento aquí. Y no hay una K3 económica: AA lista una fila separada K3 (low) con un Intelligence Index de 47, tres puntos por debajo de Flash, con un coste de $0.24 por tarea, que es 8 veces Flash, y no es más rápido. La guía de inicio rápido de Moonshot confirma que el razonamiento no se puede desactivar, así que los niveles de esfuerzo son un control de latencia y no un nivel de coste.

Una cosa más digna de mencionar para quien compara políticas de datos: los términos de Moonshot son explícitos y permisivos donde los de DeepSeek callan. La Sección 4 dice que "salvo acuerdo expreso por escrito en contrario, el Contenido del Cliente puede utilizarse para los fines mencionados", con la exclusión voluntaria solo mediante un acuerdo empresarial negociado. Los datos se alojan en Singapur.

Veredicto

Compra esto cuando una respuesta equivocada cueste más de 29 veces la factura de tokens, algo que sí ocurre en la realidad y en un rango más estrecho de lo que la mayoría de los compradores piensa. De lo contrario, las cuentas no salen. Analicé este enfrentamiento a fondo en Flash frente a Kimi K3, y también hay una reseña de Kimi K3 y una guía de precios.

6. DeepSeek V4 Pro

La tarjeta de modelos y precios de la API de DeepSeek mostrando deepseek-v4-flash y deepseek-v4-pro lado a lado con sus tarifas de acierto de caché, fallo de caché y salida, tomado de DeepSeek
La tarjeta de modelos y precios de la API de DeepSeek mostrando deepseek-v4-flash y deepseek-v4-pro lado a lado con sus tarifas de acierto de caché, fallo de caché y salida, tomado de DeepSeek

Ideal para: quedarse en la familia cuando necesitas recuperación de datos en lugar de razonamiento.

Qué es realmente

El nivel V4 más grande, deepseek-v4-pro, con 49B de parámetros activos frente a los 13B de Flash. Todavía en la versión preliminar de abril sin equivalente 0731, que es la razón por la que esta comparación resulta extraña.

Precios

$0.435 de entrada con fallo de caché, $0.003625 de entrada con acierto de caché, $0.87 de salida por millón. Eso es 3.11x Flash en entrada con fallo de caché y salida, pero solo 1.29x en aciertos de caché.

Dónde supera a Flash

Recuperación y búsqueda de datos en contexto largo, que es lo que compran los parámetros activos adicionales. De la propia tabla de modos cruzados de DeepSeek con máximo esfuerzo: SimpleQA-Verified 57.9 frente a 34.1, GDPval-AA Elo 1554 frente a 1395, BrowseComp 83.4 frente a 73.2, y MRCR en contexto de 1M 83.5 frente a 78.7.

Y el voto humano coincide con Pro, no con el índice automatizado. LMArena Text clasifica a Pro con 1458±4 frente al 1436±4 de Flash sobre unos 49,000 votos cada uno. Dos tableros, ambos correctos, midiendo cosas distintas.

Dónde no lo supera

Flash 0731 supera a la versión preliminar de Pro en las nueve filas agénticas que publica DeepSeek, siendo DeepSWE 54.4 frente a 12.8 la más amplia. AA sitúa a Flash en 50 y $0.03 por tarea frente a Pro en 44 y $0.05. Vale la pena señalar con honestidad que dos de esas nueve filas son conjuntos internos propios de DeepSeek y el arnés de evaluación no se ha publicado.

Tampoco hay una ejecución económica de Pro. La tabla de mapeo de esfuerzo publicada por DeepSeek sirve una solicitud low en Pro como high, así que pagas 3.11x y no puedes reducir el razonamiento. Ese mapeo estaba previsto que cambiara a principios de agosto de 2026.

Veredicto

Una opción estrecha pero real: elige Pro para trabajo intensivo en recuperación sobre documentos largos, quédate en Flash para trabajo agéntico y de código. Detalle completo en Flash frente a V4 Pro.

7. Autoalojar los pesos de Flash

El repositorio de GitHub para ejecutar DeepSeek V4 Flash 0731 en una sola AMD MI300X, mostrando la licencia Apache-2.0 y una tabla de resultados con 168.6 tokens por segundo en decodificación de flujo único, tomado de GitHub
El repositorio de GitHub para ejecutar DeepSeek V4 Flash 0731 en una sola AMD MI300X, mostrando la licencia Apache-2.0 y una tabla de resultados con 168.6 tokens por segundo en decodificación de flujo único, tomado de GitHub

Ideal para: conservar el modelo y resolver el problema de residencia en un solo movimiento.

Qué es realmente

No es un modelo diferente. El mismo checkpoint DeepSeek-V4-Flash-0731 con licencia MIT, ejecutándose en hardware que tú controlas. Esta entrada se ganó su lugar porque hoy se publicó una configuración de producción y llegó a la portada de Hacker News con 165 puntos.

Precios

Hardware, no tokens. Que es exactamente el punto si tu bloqueo es una revisión de seguridad en lugar de un presupuesto.

Dónde supera a la API de Flash

Las cifras publicadas en una sola AMD MI300X, del stack vLLM ROCm fijado en el repositorio:

MétricaResultado
Decodificación de flujo único168.6 tok/s
Prefill con kernels ajustados~7.9–8.5K tok/s
8 flujos concurrentes542 tok/s agregados, 90.3 tok/s mediana por flujo
Ráfaga de 64 flujos830 tok/s agregados, sin OOM
Contexto validado256K (la arquitectura soporta 1M)
Pesos en HBM156.67 GiB, sin cuantización adicional

168.6 tokens por segundo en una tarjeta superan los 113 tok/s que mide Artificial Analysis en la propia API de DeepSeek. El repositorio es explícito en que "el checkpoint funciona tal como se distribuye, sin cuantización de pesos adicional ni descarga", así que no es un intercambio de velocidad por calidad.

También responde a la objeción que más escucho, que no tiene nada que ver con el modelo:

Phil preguntó si usa "algún tipo de otro ChatGPT o algo si no sabe la respuesta" y si eso se puede desactivar. Gil preguntó si el conocimiento se mantiene cerrado dentro de su organización.

Un evaluador técnico en una empresa de hardware de semiconductores B2B que necesitaba garantías de que la IA responde solo a partir del conocimiento aprobado por su organización, no de datos de entrenamiento generales

El autoalojamiento es la única opción en esta página que responde esa pregunta con un diagrama de red en lugar de con una lectura de términos de servicio.

Dónde no lo supera

Hardware que hay que conseguir, y la comunidad es directa al respecto:

Hacker News

"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."

Hay una solución alternativa en el mismo hilo:

Hacker News

"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."

Dos advertencias honestas más. El repositorio describe el checkpoint como de 304B de parámetros, mientras que AA publica 284B totales, así que el conteo de parámetros en la práctica es inconsistente. Y DeepSeek supuestamente obtiene 15K tok/s/gpu en H800 en su propio paper de DSpark, según xorfish en el mismo hilo, así que a esta configuración le queda margen por explotar.

Veredicto

Si tu razón para comprar es la residencia de datos, esto debería estar en la cima de tu lista, no en el fondo. No estás sacrificando calidad de modelo en absoluto. Lectura relacionada: agentes de IA de código abierto, modelos de IA personalizados y construir frente a comprar.

8. Qwen3.7-Flash

La página del modelo de OpenRouter para Qwen3.7 Flash mostrando $0.03 de entrada y $0.13 de salida por millón, un único proveedor de Alibaba Cloud, y precios efectivos promedio ponderados de $0.061 y $0.163, tomado de OpenRouter
La página del modelo de OpenRouter para Qwen3.7 Flash mostrando $0.03 de entrada y $0.13 de salida por millón, un único proveedor de Alibaba Cloud, y precios efectivos promedio ponderados de $0.061 y $0.163, tomado de OpenRouter

Ideal para: el precio de lista más bajo, si tus prompts realmente son pequeños.

Qué es realmente

El modelo de razonamiento visión-lenguaje de Alibaba, publicado el 27 de julio de 2026, descrito en OpenRouter como apto para "agentes multimodales, codificación visual, búsqueda e interacción con computadora." Contexto de 1M, texto más imagen y video como entrada.

Precios

Aquí es donde se pone interesante, y donde la coincidencia de nombre con el "Flash" de DeepSeek genera confusión real. Los precios están escalonados por tamaño de prompt, así que la tarifa titular y el contexto de 1M no pueden ser ciertos a la vez en la misma llamada:

Tamaño de promptEntrada /1MSalida /1M
Menos de 32K$0.03$0.13
32K–256K$0.10$0.40
256K–1M$0.20$0.80

Un vaivén de 6.7x en la entrada. Y OpenRouter publica el promedio real de 30 días de lo que pagan los clientes: $0.061 de entrada y $0.163 de salida, por encima del precio de lista, lo que indica que el tráfico real está cayendo en los tramos superiores.

Dónde supera a Flash

El tramo por debajo de 32K a $0.03/$0.13 es realmente más barato que el $0.14/$0.28 de Flash, aproximadamente 4.6x en entrada. Acepta imágenes y video, algo que Flash no admite en absoluto. La lectura en caché es de $0.006.

Dónde no lo supera

Casi nada está verificado de forma independiente, y eso es la historia, no una nota al pie. Qwen no publicó benchmarks, arquitectura ni conteo de parámetros. No aparece en Artificial Analysis en absoluto, así que no hay una puntuación de índice comparable en la tabla de arriba. Los pesos son cerrados.

La única evaluación de terceros en la que confío es el benchmark de visión de Roboflow, que lo sitúa en el puesto 22 de 23 en general con un 61.7%, mientras lo clasifica #1 de 23 en coste. Identifica mucho mejor de lo que localiza.

"Flash" aquí significa barato, no rápido: 59 tokens por segundo frente a los 113 de Flash y los 366 de Flash-Lite. La tasa de error en llamadas a herramientas es del 8.88%, la latencia P99 de extremo a extremo es de 90.19 segundos, y OpenRouter señala que está "alojado por un solo proveedor" con "sin decisiones de enrutamiento que tomar", así que no hay respaldo si ese proveedor tiene un mal día.

Veredicto

Elígelo solo si tus prompts realmente están por debajo de 32K y necesitas visión con presupuesto ajustado. Por encima de eso, los tramos borran la ventaja, y la falta de datos de evaluación significa que compras por fe. Las matemáticas de los tramos se desarrollan en la guía de precios de Qwen 3.7 Flash, y el resumen de Qwen 3.7 Flash cubre las especificaciones.

Lo que ninguno de estos ocho hará

Todos los modelos aquí son la capa inferior. Vale la pena decirlo con claridad, porque la decisión de cambio que la gente me trae normalmente se enmarca como una elección de modelo y casi nunca lo es.

Una tasa de alucinación del 84% no significa que el modelo se equivoque en el 84% de los tickets. Es una cifra de AA-Omniscience medida en preguntas sin contexto proporcionado, que es exactamente lo opuesto a cómo debería operarse un agente de soporte. Conecta el mismo modelo a un RAG sobre un centro de ayuda verificado y la cifra que importa cambia por completo.

Ese es el argumento detrás de RAG frente a LLM y prevención de alucinaciones. La solución es fundamentación y barreras de seguridad, no un mejor modelo base.

La objeción del comprador que realmente decide estos acuerdos no es la precisión en abstracto. Es el control. Un líder de CX lo expresó mejor que cualquier benchmark:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Un líder de CX en una marca DTC de suplementos sobre Gorgias y Shopify, con unos 7,000 tickets y 30,000 pedidos al mes

Ninguna entrada de la tabla anterior resuelve eso. Las puntuaciones de confianza, las reglas de escalado, la exclusión por tipo de ticket y un humano en el bucle sí lo hacen, y esos viven en la capa por encima de la API.

He escrito sobre los umbrales de confianza y la tasa de contención por separado, porque son la parte que decide si todo esto funciona.

Lo segundo que ninguno de estos hace es decirte la cifra que realmente estás presupuestando. Las tarifas de tokens son entradas. El coste por resolución es la salida, y las dos no son proporcionales una vez que añades recuperación, reintentos y el tiempo humano dedicado a limpiar después.

Lo que yo haría realmente con una cola de soporte

El panel de reportes de eesel AI mostrando el volumen total de tareas, eventos disparadores por tipo, y el uso de aprobación o rechazo por herramienta para un agente de Zendesk
El panel de reportes de eesel AI mostrando el volumen total de tareas, eventos disparadores por tipo, y el uso de aprobación o rechazo por herramienta para un agente de Zendesk

Comprar modelos para una cola de soporte es el primer paso equivocado, y lo digo como alguien que pasó esta semana leyendo ocho tarjetas de modelo. La pregunta no es qué modelo alucina menos, es cómo se ve tu precisión en tus propios tickets, y eso no se obtiene de una tabla de clasificación.

Eso es lo específico que eesel hace y una API pura no puede. Se conecta a Zendesk, Freshdesk, Gorgias, Front o Help Scout en pocos minutos, fundamenta cada respuesta en tu centro de ayuda, tickets pasados y macros, y luego ejecuta una simulación sobre tus tickets históricos reales para que veas la tasa de resolución real antes de que la vea un cliente. Si no supera tu umbral, no lo despliegas.

El precio es 40 centavos por ticket gestionado, sin cuotas por asiento, y nunca se te cobra por los tickets que gestionan tus humanos. Enruta 200 de tus 1,000 tickets mensuales para empezar y pagas $80. Prueba eesel gratis con $50 de uso y sin tarjeta de crédito.

No estoy afirmando que eesel haga más inteligente a un modelo base. Estoy afirmando que lo que realmente estás buscando, un modelo en el que puedas confiar frente a los clientes, no es un modelo en absoluto. Y la razón por la que estoy seguro de eso es que hemos visto fallar a nuestro propio agente de formas que ningún benchmark detecta: el peor patrón que registramos fue un agente narrando "ejecutando búsquedas en Zendesk" durante unos diez turnos sin llegar nunca a tocar la API. Nada destruye la confianza en un compañero de equipo más rápido que mentir sobre lo que hizo, y ninguna puntuación de índice lo habría predicho.

Entonces, ¿cuál deberías elegir?

  • Necesitas entrada de imagenGPT-5.6 Luna. La opción con visión más barata aquí, iguala a Flash en inteligencia, cuesta unas 3 veces más en la práctica. Mantén el esfuerzo bajo si la latencia importa.
  • Necesitas residencia de datos → autoaloja los pesos de Flash. El mismo modelo, licencia MIT, 168.6 tok/s en una sola MI300X. La alternativa gestionada más barata es el nivel de pago de Gemini, que afirma por escrito que tu contenido no se usa para entrenamiento.
  • Necesitas rendimientoGemini 3.5 Flash-Lite a 366 tok/s y la salida más concisa del grupo. Acepta el índice 36.
  • Necesitas menos tokens de salida con la misma puntuaciónGemini 3.6 Flash. La misma puntuación de 50 con 59M de tokens en lugar de 210M, a 10 veces el coste por tarea.
  • Necesitas fiabilidadKimi K3. Alucinación del 51% frente al 84%, a 29 veces el coste por tarea. No te molestes con K3 (low).
  • Necesitas recuperación sobre documentos largosDeepSeek V4 Pro. Gana en SimpleQA-Verified 57.9 a 34.1, y los votantes de LMArena coinciden.
  • Necesitas el precio de lista más bajoQwen3.7-Flash, pero solo con prompts por debajo de 32K, y solo si te sientes cómodo con casi ninguna evaluación independiente.
  • No necesitas nada de lo anterior → quédate con Flash. Es el más barato, el más rápido en dar el primer token, y es abierto. Solo vigila ese recargo pendiente del doble en hora pico, que se aplicará entre las 9:00–12:00 y las 14:00–18:00 hora de Pekín en cuanto DeepSeek anuncie una fecha de inicio.

Si estás elegiendo un modelo para responder tickets de clientes, la explicación de mejor agente de soporte con IA y coste del servicio al cliente con IA son lecturas más útiles que cualquiera de las páginas de modelos anteriores. Si estás elegiendo uno para escribir, mejor LLM para escribir blogs es por donde yo empezaría.

Sources

Frequently Asked Questions

¿Cuál es la mejor alternativa a DeepSeek V4 Flash?
Depende de qué carencia quieras resolver. GPT-5.6 Luna es el equivalente más cercano en inteligencia y añade entrada de imagen por unas 3 veces el coste real. Gemini 3.5 Flash-Lite es la opción de rendimiento. Kimi K3 es la opción si la fiabilidad de las respuestas importa más que la factura. No hay un único ganador porque Flash ya es el más barato y el más rápido en dar el primer token.
¿Hay una alternativa más barata que DeepSeek V4 Flash?
En el precio de lista, sí: Qwen3.7-Flash empieza en $0.03 de entrada y $0.13 de salida por millón. Pero eso es solo en el tramo por debajo de 32K, y el promedio real de 30 días de OpenRouter de lo que pagan los clientes es $0.061 de entrada y $0.163 de salida, por encima del precio de lista. Que supere a Flash depende totalmente del tamaño de tus prompts. Desgloso las matemáticas del tramo en la guía de precios de Qwen 3.7 Flash.
¿Qué alternativa a DeepSeek V4 Flash admite entrada de imagen?
Todas excepto V4 Pro. Flash solo acepta texto como entrada y salida, sin entrada de imagen documentada. Si necesitas leer una captura de pantalla o una foto de un paquete dañado, esa es la razón más clara para cambiar. Gemini 3.6 Flash acepta texto, imagen, voz y video. Luna, Kimi K3 y Claude Haiku 4.5 aceptan texto e imágenes. Si vas a conectar un agente de soporte a una base de conocimiento que incluye capturas de pantalla, revisa esto primero.
¿Puedo autoalojar DeepSeek V4 Flash en lugar de cambiar de modelo?
Sí, y es la opción más subestimada de esta lista. Los pesos tienen licencia MIT, con 284B de parámetros totales y 13B activos, y ya hay pública una configuración de producción para una sola AMD MI300X. Ese camino conserva el modelo y resuelve el problema de residencia de datos, que es lo que la mayoría realmente busca. La contrapartida es el hardware que hay que comprar o alquilar. Consulta agentes de IA de código abierto para ver el ecosistema más amplio.
¿DeepSeek entrena con los datos de la API de clientes de pago?
Los términos de pago de Open Platform no dicen nada al respecto, lo cual es distinto de permisivo y distinto de seguro. La cláusula de entrenamiento que sí incluyen los términos para consumidores simplemente no aparece en los términos de la API, y no hay tampoco un DPA publicado ni una opción de retención cero en ningún sentido. El plan de pago de Gemini de Google afirma claramente que el contenido no se usa para mejorar sus productos. Si esa distinción importa a tus clientes, lee SOC 2 y GDPR para chatbots de soporte.
¿Cuánto cuesta DeepSeek V4 Flash comparado con las alternativas?
Flash cuesta $0.14 de entrada con fallo de caché y $0.28 de salida por millón, frente a Luna con $0.20/$1.20 y Gemini 3.6 Flash con $1.50/$7.50. Pero la tabla de precios exagera la diferencia porque Flash es el modelo más verboso del grupo. En la propia ejecución del índice de Artificial Analysis, la factura fue de $72 para Flash y $727 para Gemini 3.6 Flash con la misma puntuación, lo que supone 10 veces, no las 27 veces que sugiere la columna de salida. Para el trabajo de soporte, la cifra que importa es el coste por resolución, no por token.
¿Es seguro poner DeepSeek V4 Flash frente a los clientes?
No por sí solo, y ningún modelo de esta lista lo es. La tasa de alucinación AA-Omniscience de Flash es del 84%, la cifra más alta de su tabla, pero incluso el 51% de Kimi K3 sería inaceptable en una respuesta sin supervisión. La solución no es un mejor modelo, es fundamentación, umbrales de confianza y pruebas con tu propio historial antes de salir en producción.
¿Debería usar DeepSeek V4 Pro en lugar de Flash?
Solo para necesidades de recuperación y búsqueda de datos en contexto largo, donde Pro sigue ganando claramente: SimpleQA-Verified 57.9 frente al 34.1 de Flash. En las nueve filas agénticas que publica DeepSeek, Flash 0731 supera a la versión preliminar de Pro en todas ellas, y Pro no se puede reducir en esfuerzo porque una solicitud low se sirve como high. Desglose completo en Flash frente a V4 Pro.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un modelo pequeño apartado mientras cinco modelos alternativos captan la luz
Alternatives

8 mejores alternativas a Inkling-Small en 2026

Inkling-Small es barato y rápido, pero su puntuación de conocimiento medida es negativa. Aquí tienes 8 alternativas a Inkling-Small, con precios reales y el problema que trae cada una.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustracion de una persona sopesando varios superagentes de IA como alternativas a Skywork AI
Alternatives

7 mejores alternativas a Skywork AI en 2026

Las mejores alternativas a Skywork AI en 2026, desde superagentes generales como Manus hasta herramientas de investigacion, creadores de presentaciones y una opcion solo para soporte, con precios reales.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Una persona hablando con tres opciones distintas de agente de voz, con el logotipo de Grok a la izquierda
Alternatives

Las 10 mejores alternativas a Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 acaba de subir un 60% de precio en el alias predeterminado. Diez alternativas reales, con coste por hora medido y cifras de benchmark honestas.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Banner ilustrado para una guía de las mejores alternativas a Paperclip para agentes de IA
Alternatives

Las 8 mejores alternativas a Paperclip para agentes de IA (2026)

Paperclip es una forma brillante y de código abierto de gestionar toda una empresa de agentes de IA, pero nunca se diseñó para responder una cola de soporte. Aquí tienes 8 alternativas a Paperclip y para quién es realmente cada una.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Banner ilustrado para una guia de las mejores alternativas a NemoClaw para agentes de IA y atencion al cliente
Alternatives

8 mejores alternativas a NemoClaw para equipos de soporte (2026)

NemoClaw es el entorno de ejecución gobernado de NVIDIA para autoalojar agentes de IA, pero nunca se diseñó para gestionar una cola de soporte. Aquí tienes 8 alternativas a NemoClaw, y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Banner ilustrado para una guía de las mejores alternativas a ZeroClaw para el soporte al cliente con IA
Alternatives

Las 8 mejores alternativas a ZeroClaw para equipos de soporte (2026)

ZeroClaw es un runtime de agentes de IA autoalojado brillantemente construido, pero nunca se diseñó para gestionar una cola de soporte. Aquí tienes 8 alternativas a ZeroClaw y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración de un agente de IA dirigiendo conversaciones con clientes por teléfono, chat y correo electrónico
Alternatives

8 mejores alternativas a Replicant para soporte con IA en 2026

Las mejores alternativas a Replicant para 2026, comparadas por precio, canales y tiempo de implementación, desde IA de voz para empresas hasta automatización de helpdesk de autoservicio rápida.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
Ilustración de las mejores alternativas a Espressive para IA de TI empresarial y soporte a empleados en 2026
Alternatives

Las 8 mejores alternativas a Espressive en 2026

Espressive fue adquirida por Resolve y la marca está siendo descontinuada. Aquí están las 8 mejores alternativas a Espressive para IA de soporte a empleados y clientes en 2026.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
Banner ilustrado para una guía de las mejores alternativas a Maven AGI para atención al cliente con IA en 2026
Alternatives

Las 7 mejores alternativas a Maven AGI en 2026

Una mirada práctica a las mejores alternativas a Maven AGI para atención al cliente con IA en 2026, desde agentes de helpdesk autoservicio hasta plataformas CX empresariales, con precios reales.

Rama Adi NugrahaRama Adi NugrahaJul 15, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis