Las 8 mejores alternativas a DeepSeek V4 Flash en 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edición August 6, 2026

Por qué no las ordeno por puntuación
Escribo sobre intención de búsqueda para vivir, y "deepseek v4 flash alternatives" es una consulta de compra con una suposición oculta: que buscas algo mejor. En los dos tableros que miden este modelo, en la mayoría de los casos no es así.
Artificial Analysis sitúa a Flash con el máximo esfuerzo en 50 y lo describe como "entre los modelos líderes en inteligencia y con buen precio comparado con otros modelos de pesos abiertos de tamaño similar." Luna puntúa 51. Gemini 3.6 Flash puntúa 50. Estarías intercambiando lateralmente en inteligencia y pagando más por ese privilegio.
Lo que en realidad estarías comprando es una capacidad o una respuesta de cumplimiento. Así que así está ordenada esta lista: por la carencia que resuelve, con el coste honesto del cambio adjunto a cada una. Si quieres la lectura pura de especificaciones del modelo que estás dejando, el resumen de DeepSeek V4 Flash y la reseña de Flash lo cubren, y Flash frente a GPT-5.6 cubre en detalle el enfrentamiento más cercano.
Los números, en un solo lugar
Cada cifra a continuación proviene de Artificial Analysis o de la propia página de precios del proveedor, verificada el 4 de agosto de 2026. "Index run" es lo que le costó a AA evaluar ese modelo en todo el Intelligence Index, que es lo más parecido a una cifra real de coste por tarea que cualquiera de ellos publica.
| Modelo | AA Index | Entrada /1M | Salida /1M | Index run | Velocidad de salida | Tiempo al primer token | Tokens para ejecutar el índice | Tipos de entrada | Contexto | Pesos |
|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (max) | 50 | $0.14 | $0.28 | $72.02 | 113 t/s | 1.31s | 210M | text | 1M | MIT |
| GPT-5.6 Luna (max) | 51 | $0.20 | $1.20 | $174.06 | 181 t/s | 132.75s | 130M | text, image | 1.05M | closed |
| Gemini 3.6 Flash (high) | 50 | $1.50 | $7.50 | $726.70 | 213 t/s | 15.69s | 59M | text, image, speech, video | 1M | closed |
| Gemini 3.5 Flash-Lite | 36 | $0.30 | $2.50 | $153.08 | 366 t/s | 8.41s | 43M | text, image, speech, video | 1M | closed |
| Claude Haiku 4.5 (non-reasoning) | 24 | $1.00 | $5.00 | no publicado | 90 t/s | 0.96s | no publicado | text, image | 200K | closed |
| Kimi K3 (max) | 57 | $3.00 | $15.00 | $2,437.41 | 36 t/s | 2.85s | 130M | text, image | 1M | licencia kimi-k3 |
| DeepSeek V4 Pro | 44 | $0.435 | $0.87 | no publicado | no publicado | no publicado | no publicado | text | 1M | open |
| Qwen3.7-Flash | no listado | $0.03–$0.20 | $0.13–$0.80 | no publicado | 59 t/s | no publicado | no publicado | text, image, video | 1M | closed |
De esa tabla destacan dos cosas. Flash tiene el primer token más rápido del grupo por un factor de dos sobre todo excepto Haiku, y es el único modelo aquí que es a la vez de pesos abiertos y realmente barato. Todo lo demás es un intercambio.

Elige por la carencia, no por la puntuación
Antes de la lista: esta es la decisión en cinco clics. Elige lo que realmente te está bloqueando y obtienes la opción más el coste real del cambio.
¿Para qué estás cambiando realmente?
Flash ya es el más barato y el más rápido en dar el primer token. Así que elige la carencia.
Flash no tiene entrada de imagen documentada. Luna acepta texto e imágenes, puntúa un punto más en el índice de AA con 51, y funciona a 181 tokens por segundo. También es el modelo con capacidad de visión más barato de esta comparación, con $0.20 de entrada y $1.20 de salida.
Coste del cambio: alrededor de 3 veces la factura real en escenarios con mucha caché, mucho razonamiento y prompts largos, y un tiempo al primer token de 132.75s con máximo esfuerzo. No lo pongas en una vía interactiva sin reducir el esfuerzo.
Conservas exactamente el mismo modelo y trasladas la inferencia. Los pesos tienen licencia MIT, y una configuración de producción pública ya ejecuta el checkpoint 0731 en una sola AMD MI300X a 168.6 tokens por segundo en flujo único, más rápido que los 113 medidos en la API oficial.
Coste del cambio: hardware. 156.67 GiB de pesos deben caber en HBM, y una sola MI300X es difícil de comprar por sí sola. Si prefieres no gestionar GPUs, el plan de pago de Gemini afirma explícitamente que tu contenido no se usa para mejorar sus productos.
366 tokens por segundo, el más rápido de este grupo, y el más conciso: 43M de tokens de salida para ejecutar el índice de AA frente a los 210M de Flash. Acepta texto, imagen, voz y video. Bueno para clasificación y triaje a gran volumen.
Coste del cambio: inteligencia. Índice 36 frente al 50 de Flash, así que es una clase de tarea distinta. Y sin uso de computadora a ningún precio.
La opción de fiabilidad. Tasa de alucinación AA-Omniscience del 51% frente al 84% de Flash, Omniscience Index de 18 frente al -16 de Flash, y la inteligencia bruta más alta aquí con 57.
Coste del cambio: unas 29 veces el coste por tarea y 36 tokens por segundo. Tampoco hay una K3 económica. La fila K3 (low) puntúa 47, tres puntos por debajo de Flash, a 8 veces el coste. El razonamiento no se puede desactivar.
Quédate en la familia. Pro sigue ganando claramente en recuperación y búsqueda de datos en contexto largo: SimpleQA-Verified 57.9 frente al 34.1 de Flash, MRCR en contexto de 1M 83.5 frente a 78.7, y los votantes humanos de LMArena lo clasifican en 1458 frente al 1436 de Flash.
Coste del cambio: 3.11x en entrada y salida con fallo de caché, y sin ejecución económica. La propia tabla de mapeo de esfuerzo de DeepSeek sirve una solicitud low en Pro como high.
1. GPT-5.6 Luna

Ideal para: el cambio más equivalente, y la forma más barata de añadir entrada de imagen.
Qué es realmente
Luna es el nivel económico de la familia GPT-5.6, descrito en su propia página de modelo como "optimizado para cargas de trabajo sensibles al coste." La razón por la que la mayoría de las comparaciones con Flash se equivocan es que gpt-5.6 es un alias de Sol, el nivel de vanguardia, así que la gente termina comparando por accidente un modelo de $0.14 con uno de $5. Contra Luna específicamente, la cuestión de inteligencia es prácticamente un empate: 51 frente a 50 en el índice de AA.
Tiene una ventana de contexto de 1,050,000 tokens, un máximo de salida de 128,000 tokens, un corte de conocimiento del 16 de febrero de 2026 y soporte de tokens de razonamiento. Entrada de texto e imagen, salida de texto.
Precios
$0.20 de entrada, $0.02 de entrada en caché, $1.20 de salida por millón. Hay una escala real de descuentos que la mayoría de los artículos pasa por alto:
| Nivel | Entrada /1M | Caché /1M | Salida /1M |
|---|---|---|---|
| Standard | $0.20 | $0.02 | $1.20 |
| Batch | $0.10 | $0.01 | $0.60 |
| Flex | $0.10 | $0.01 | $0.60 |
| Fast mode | $0.40 | $0.04 | $2.40 |
| Long context (>272K) | $0.40 | $0.04 | $1.80 |
En Batch o Flex, la entrada de Luna a $0.10 es en realidad más barata que la de Flash a $0.14. Si tu carga de trabajo es apta para procesarse de noche y tiene mucha entrada con salidas cortas, algo que describe buena parte de la clasificación de tickets, Luna puede salir ganando. Flash no tiene ningún descuento por lote.
Dónde supera a Flash
Entrada de imagen, latencia publicada sobre la que puedes planificar, y una historia de manejo de datos que puedes entregar a un revisor de seguridad. También búsqueda web, algo que vale la pena precisar: Flash sí tiene una herramienta web_search del lado del servidor, pero solo en la Responses API exclusiva de Flash, no en la vía chat-completions. La afirmación repetida de "DeepSeek no tiene búsqueda web" está desactualizada.
Dónde no lo supera
Los datos de Hacker News sitúan la diferencia real entre 2x y 3x, no las 4.3x que sugiere la columna de salida, porque la entrada en caché de Luna también es barata. Pero 3x sigue siendo 3x. Y la cifra de latencia es brutal:
"2x to 3x the price… 2 to 5 times faster inference"
Ese "faster inference" es rendimiento, no capacidad de respuesta. Con máximo esfuerzo, el tiempo al primer token de Luna es de 132.75 segundos. Bien para un trabajo por lotes, mal para un widget de chat.
También hay un abismo asimétrico a tener en cuenta: los prompts que superan 272K de entrada vuelven a tarificar toda la solicitud al doble de entrada y 1.5 veces de salida, no solo el excedente. Las escrituras en caché se cobran a 1.25x la tarifa sin caché.
Veredicto
Si el motivo para dejar Flash es la entrada de imagen o una conversación de cumplimiento, esto es lo primero que hay que probar, y la tarifa de lote lo hace más barato de lo que la gente asume. No lo pondría en una superficie interactiva con máximo esfuerzo. El desglose completo de niveles está en la guía de precios de GPT-5.6, y la reseña de GPT-5.6 cubre toda la familia.
2. Gemini 3.5 Flash-Lite

Ideal para: clasificación de gran volumen, triaje y cualquier caso donde los tokens por segundo sean el cuello de botella.
Qué es realmente
El modelo generalmente disponible más barato de Google en la línea 3.5, descrito en su propia página de modelo como "nuestro modelo 3.5 más rápido y rentable para ejecución de alto rendimiento." El código del modelo es gemini-3.5-flash-lite, con contexto de entrada de 1,048,576, salida de 65,536, y acepta texto, imagen, voz, video y PDF.
Precios
$0.30 de entrada y $2.50 de salida por millón en Standard. Batch y Flex reducen ambos a la mitad, $0.15/$1.25. Priority es $0.54/$4.50. El almacenamiento en caché de contexto cuesta $0.03.
Dónde supera a Flash
Dos cifras. 366 tokens por segundo, el más rápido aquí, y 43M de tokens de salida para ejecutar el índice de AA frente a los 210M de Flash. AA lo describe como "bastante conciso" y a Flash como "muy verboso." Esa concisión es la razón de que un modelo con una tarifa de salida nominalmente 9 veces mayor solo costara $153.08 en ejecutar el índice frente a los $72.02 de Flash, aproximadamente 2 veces, no 9.
La entrada multimodal es nativa en cuatro modalidades. Y el nivel de pago de Google es explícito donde el de DeepSeek guarda silencio: la página de precios enumera "Contenido no utilizado para mejorar nuestros productos" como propiedad del nivel de pago, frente a "Contenido utilizado para mejorar nuestros productos" en el nivel gratuito.
Dónde no lo supera
Intelligence Index de 36 frente al 50 de Flash. No es una diferencia pequeña, es otra categoría de peso, y Flash-Lite va a ser peor en cualquier cosa agéntica o de varios pasos. Sin uso de computadora a ningún precio. El tiempo al primer token es de 8.41s, seis veces el de Flash.
Veredicto
Si estás ejecutando clasificación de intención o análisis de sentimiento sobre un torrente de datos, esta es la forma correcta y la concisión ahorra dinero real. Si estás ejecutando un agente, no lo es. Más en el resumen de Gemini 3.5 Flash-Lite.
3. Gemini 3.6 Flash

Ideal para: igualar la inteligencia de Flash con un tercio de los tokens de salida, además de uso de computadora.
Qué es realmente
El nivel Flash de referencia de Google, lanzado el 21 de julio de 2026, posicionado como el modelo que "equilibra velocidad e inteligencia para ofrecer un rendimiento sólido en tareas agénticas y multimodales." El corte de conocimiento se movió a marzo de 2026. El uso de computadora viene integrado. Contexto de 1M, salida de 65K.
Precios
$1.50 de entrada, $7.50 de salida por millón. Batch reduce ambos a la mitad, $0.75/$3.75.
Dónde supera a Flash
Este es el punto que cambió cómo leo toda la comparación. Gemini 3.6 Flash puntúa exactamente el mismo 50 que Flash, y lo consigue con 59M de tokens de salida frente a los 210M de Flash. En la tabla de precios eso es una brecha de 26.8x en salida. En la factura real de ejecución del índice de AA es $726.70 frente a $72.02, lo que da 10.1x.
10x sigue siendo 10x, así que esto no es un modelo más barato. Pero la dirección importa: toda comparación de verbosidad en este artículo se mueve en contra de Flash, y si has estado presupuestando según la columna por token, has estado sobreestimando tu ahorro.

También aporta cuatro modalidades de entrada, 213 tokens por segundo y uso de computadora, algo que nada más en esta lista ofrece en este nivel.
Dónde no lo supera
10x el coste por tarea con paridad en inteligencia. Tiempo al primer token de 15.69s. Pesos cerrados, así que el autoalojamiento queda descartado.
Veredicto
La opción cuando el modelo hace trabajo agéntico sobre una base de conocimiento con medios mixtos y quieres reducir el conteo de tokens. Lee el resumen de Gemini 3.6 Flash, o la reseña para el detalle de las evaluaciones.
4. Claude Haiku 4.5

Ideal para: el primer token más rápido del grupo, y la revisión de seguridad más sencilla.
Qué es realmente
El modelo pequeño de Anthropic, claude-haiku-4-5, descrito en la documentación como "el modelo más rápido con inteligencia casi de vanguardia." Entrada de texto e imagen, contexto de 200K, conocimiento hasta julio de 2025. Disponible en la API de Claude, Amazon Bedrock, Google Cloud y Microsoft Foundry.
Precios
$1.00 de entrada, $5.00 de salida por millón.
Dónde supera a Flash
0.96 segundos al primer token, la única cifra en esta página que supera el 1.31s de Flash, a 90.2 tokens por segundo. AA califica ese TTFT como "muy competitivo" frente a una mediana de 1.43s en su rango de precio.
Lo otro en que supera a Flash es en adquisición. La disponibilidad multicloud a través de Bedrock y Google Cloud significa que la residencia de datos y la contratación son un problema ya resuelto por otro, no por ti. En mi experiencia ese es el bloqueo real con más frecuencia que cualquier benchmark:
Bloqueado por completo por HIPAA/BAA durante la demo, descrito como un bloqueo duro, no una preocupación menor.
Una plataforma de salud y fisioterapia en EE. UU. sobre Zendesk que gestiona alrededor de 500 tickets al mes
Ese trato no se estancó por una tasa de alucinación.
Dónde no lo supera
Intelligence Index de 24 sin razonamiento, el más bajo aquí, y la ventana de contexto más pequeña con 200K frente al 1M de todos los demás. AA no publica un coste de ejecución del índice para él, así que el coste por tarea es desconocido. Anthropic también ofrece una variante con razonamiento, pero el 24 es la fila sin razonamiento, y eso es lo que compran los $1/$5 en la configuración por defecto.
Veredicto
Elígelo cuando la capacidad de respuesta y la contratación importen más que la capacidad bruta, que es la mayoría del chat de cara al cliente. No lo elijas para trabajo agéntico. OpenAI API frente a Anthropic API cubre el lado de la experiencia de desarrollador, y precios de Claude Sonnet 5 cubre el nivel superior.
5. Kimi K3

Ideal para: el único caso en el que pagar 29 veces más se justifica: respuestas que no puedes permitirte que sean incorrectas.
Qué es realmente
El buque insignia de Moonshot AI, lanzado el 16 de julio de 2026. 2.8T de parámetros totales con 104B activos, contexto de 1M, visión nativa para imágenes y video. Los pesos abiertos se publicaron el 27 de julio como se prometió, 1,561 GB en 96 fragmentos, bajo una licencia kimi-k3 con cláusulas para operadores de MaaS a gran escala y productos muy grandes.
Precios
$3 de entrada, $0.30 de entrada con acierto de caché, $15 de salida por millón. Eso es territorio de Claude Sonnet, no territorio económico.
Dónde supera a Flash
Fiabilidad, y no por poco. Tasa de alucinación AA-Omniscience del 51% frente al 84% de Flash. Omniscience Index de 18 frente al -16 de Flash, donde una puntuación negativa significa más respuestas incorrectas que correctas. Precisión del 46% frente al 37%. La inteligencia bruta más alta de esta comparación con 57.
Si tu caso de uso es un sector regulado o un agente de IA que toca dinero, esa diferencia lo es todo.
Dónde no lo supera
El coste, y no por el margen del precio de lista. La tarifa de salida es 54 veces la de Flash, pero el coste por tarea de AA es de $0.03 frente a $0.86, así que la brecha real es de 29x porque K3 es más verboso por punto de inteligencia. Ejecución completa del índice: $72.02 frente a $2,437.41.
36 tokens por segundo, el más lento aquí. Y no hay una K3 económica: AA lista una fila separada K3 (low) con un Intelligence Index de 47, tres puntos por debajo de Flash, con un coste de $0.24 por tarea, que es 8 veces Flash, y no es más rápido. La guía de inicio rápido de Moonshot confirma que el razonamiento no se puede desactivar, así que los niveles de esfuerzo son un control de latencia y no un nivel de coste.
Una cosa más digna de mencionar para quien compara políticas de datos: los términos de Moonshot son explícitos y permisivos donde los de DeepSeek callan. La Sección 4 dice que "salvo acuerdo expreso por escrito en contrario, el Contenido del Cliente puede utilizarse para los fines mencionados", con la exclusión voluntaria solo mediante un acuerdo empresarial negociado. Los datos se alojan en Singapur.
Veredicto
Compra esto cuando una respuesta equivocada cueste más de 29 veces la factura de tokens, algo que sí ocurre en la realidad y en un rango más estrecho de lo que la mayoría de los compradores piensa. De lo contrario, las cuentas no salen. Analicé este enfrentamiento a fondo en Flash frente a Kimi K3, y también hay una reseña de Kimi K3 y una guía de precios.
6. DeepSeek V4 Pro

Ideal para: quedarse en la familia cuando necesitas recuperación de datos en lugar de razonamiento.
Qué es realmente
El nivel V4 más grande, deepseek-v4-pro, con 49B de parámetros activos frente a los 13B de Flash. Todavía en la versión preliminar de abril sin equivalente 0731, que es la razón por la que esta comparación resulta extraña.
Precios
$0.435 de entrada con fallo de caché, $0.003625 de entrada con acierto de caché, $0.87 de salida por millón. Eso es 3.11x Flash en entrada con fallo de caché y salida, pero solo 1.29x en aciertos de caché.
Dónde supera a Flash
Recuperación y búsqueda de datos en contexto largo, que es lo que compran los parámetros activos adicionales. De la propia tabla de modos cruzados de DeepSeek con máximo esfuerzo: SimpleQA-Verified 57.9 frente a 34.1, GDPval-AA Elo 1554 frente a 1395, BrowseComp 83.4 frente a 73.2, y MRCR en contexto de 1M 83.5 frente a 78.7.
Y el voto humano coincide con Pro, no con el índice automatizado. LMArena Text clasifica a Pro con 1458±4 frente al 1436±4 de Flash sobre unos 49,000 votos cada uno. Dos tableros, ambos correctos, midiendo cosas distintas.
Dónde no lo supera
Flash 0731 supera a la versión preliminar de Pro en las nueve filas agénticas que publica DeepSeek, siendo DeepSWE 54.4 frente a 12.8 la más amplia. AA sitúa a Flash en 50 y $0.03 por tarea frente a Pro en 44 y $0.05. Vale la pena señalar con honestidad que dos de esas nueve filas son conjuntos internos propios de DeepSeek y el arnés de evaluación no se ha publicado.
Tampoco hay una ejecución económica de Pro. La tabla de mapeo de esfuerzo publicada por DeepSeek sirve una solicitud low en Pro como high, así que pagas 3.11x y no puedes reducir el razonamiento. Ese mapeo estaba previsto que cambiara a principios de agosto de 2026.
Veredicto
Una opción estrecha pero real: elige Pro para trabajo intensivo en recuperación sobre documentos largos, quédate en Flash para trabajo agéntico y de código. Detalle completo en Flash frente a V4 Pro.
7. Autoalojar los pesos de Flash

Ideal para: conservar el modelo y resolver el problema de residencia en un solo movimiento.
Qué es realmente
No es un modelo diferente. El mismo checkpoint DeepSeek-V4-Flash-0731 con licencia MIT, ejecutándose en hardware que tú controlas. Esta entrada se ganó su lugar porque hoy se publicó una configuración de producción y llegó a la portada de Hacker News con 165 puntos.
Precios
Hardware, no tokens. Que es exactamente el punto si tu bloqueo es una revisión de seguridad en lugar de un presupuesto.
Dónde supera a la API de Flash
Las cifras publicadas en una sola AMD MI300X, del stack vLLM ROCm fijado en el repositorio:
| Métrica | Resultado |
|---|---|
| Decodificación de flujo único | 168.6 tok/s |
| Prefill con kernels ajustados | ~7.9–8.5K tok/s |
| 8 flujos concurrentes | 542 tok/s agregados, 90.3 tok/s mediana por flujo |
| Ráfaga de 64 flujos | 830 tok/s agregados, sin OOM |
| Contexto validado | 256K (la arquitectura soporta 1M) |
| Pesos en HBM | 156.67 GiB, sin cuantización adicional |
168.6 tokens por segundo en una tarjeta superan los 113 tok/s que mide Artificial Analysis en la propia API de DeepSeek. El repositorio es explícito en que "el checkpoint funciona tal como se distribuye, sin cuantización de pesos adicional ni descarga", así que no es un intercambio de velocidad por calidad.
También responde a la objeción que más escucho, que no tiene nada que ver con el modelo:
Phil preguntó si usa "algún tipo de otro ChatGPT o algo si no sabe la respuesta" y si eso se puede desactivar. Gil preguntó si el conocimiento se mantiene cerrado dentro de su organización.
Un evaluador técnico en una empresa de hardware de semiconductores B2B que necesitaba garantías de que la IA responde solo a partir del conocimiento aprobado por su organización, no de datos de entrenamiento generales
El autoalojamiento es la única opción en esta página que responde esa pregunta con un diagrama de red en lugar de con una lectura de términos de servicio.
Dónde no lo supera
Hardware que hay que conseguir, y la comunidad es directa al respecto:
"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."
Hay una solución alternativa en el mismo hilo:
"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."
Dos advertencias honestas más. El repositorio describe el checkpoint como de 304B de parámetros, mientras que AA publica 284B totales, así que el conteo de parámetros en la práctica es inconsistente. Y DeepSeek supuestamente obtiene 15K tok/s/gpu en H800 en su propio paper de DSpark, según xorfish en el mismo hilo, así que a esta configuración le queda margen por explotar.
Veredicto
Si tu razón para comprar es la residencia de datos, esto debería estar en la cima de tu lista, no en el fondo. No estás sacrificando calidad de modelo en absoluto. Lectura relacionada: agentes de IA de código abierto, modelos de IA personalizados y construir frente a comprar.
8. Qwen3.7-Flash

Ideal para: el precio de lista más bajo, si tus prompts realmente son pequeños.
Qué es realmente
El modelo de razonamiento visión-lenguaje de Alibaba, publicado el 27 de julio de 2026, descrito en OpenRouter como apto para "agentes multimodales, codificación visual, búsqueda e interacción con computadora." Contexto de 1M, texto más imagen y video como entrada.
Precios
Aquí es donde se pone interesante, y donde la coincidencia de nombre con el "Flash" de DeepSeek genera confusión real. Los precios están escalonados por tamaño de prompt, así que la tarifa titular y el contexto de 1M no pueden ser ciertos a la vez en la misma llamada:
| Tamaño de prompt | Entrada /1M | Salida /1M |
|---|---|---|
| Menos de 32K | $0.03 | $0.13 |
| 32K–256K | $0.10 | $0.40 |
| 256K–1M | $0.20 | $0.80 |
Un vaivén de 6.7x en la entrada. Y OpenRouter publica el promedio real de 30 días de lo que pagan los clientes: $0.061 de entrada y $0.163 de salida, por encima del precio de lista, lo que indica que el tráfico real está cayendo en los tramos superiores.
Dónde supera a Flash
El tramo por debajo de 32K a $0.03/$0.13 es realmente más barato que el $0.14/$0.28 de Flash, aproximadamente 4.6x en entrada. Acepta imágenes y video, algo que Flash no admite en absoluto. La lectura en caché es de $0.006.
Dónde no lo supera
Casi nada está verificado de forma independiente, y eso es la historia, no una nota al pie. Qwen no publicó benchmarks, arquitectura ni conteo de parámetros. No aparece en Artificial Analysis en absoluto, así que no hay una puntuación de índice comparable en la tabla de arriba. Los pesos son cerrados.
La única evaluación de terceros en la que confío es el benchmark de visión de Roboflow, que lo sitúa en el puesto 22 de 23 en general con un 61.7%, mientras lo clasifica #1 de 23 en coste. Identifica mucho mejor de lo que localiza.
"Flash" aquí significa barato, no rápido: 59 tokens por segundo frente a los 113 de Flash y los 366 de Flash-Lite. La tasa de error en llamadas a herramientas es del 8.88%, la latencia P99 de extremo a extremo es de 90.19 segundos, y OpenRouter señala que está "alojado por un solo proveedor" con "sin decisiones de enrutamiento que tomar", así que no hay respaldo si ese proveedor tiene un mal día.
Veredicto
Elígelo solo si tus prompts realmente están por debajo de 32K y necesitas visión con presupuesto ajustado. Por encima de eso, los tramos borran la ventaja, y la falta de datos de evaluación significa que compras por fe. Las matemáticas de los tramos se desarrollan en la guía de precios de Qwen 3.7 Flash, y el resumen de Qwen 3.7 Flash cubre las especificaciones.
Lo que ninguno de estos ocho hará
Todos los modelos aquí son la capa inferior. Vale la pena decirlo con claridad, porque la decisión de cambio que la gente me trae normalmente se enmarca como una elección de modelo y casi nunca lo es.
Una tasa de alucinación del 84% no significa que el modelo se equivoque en el 84% de los tickets. Es una cifra de AA-Omniscience medida en preguntas sin contexto proporcionado, que es exactamente lo opuesto a cómo debería operarse un agente de soporte. Conecta el mismo modelo a un RAG sobre un centro de ayuda verificado y la cifra que importa cambia por completo.
Ese es el argumento detrás de RAG frente a LLM y prevención de alucinaciones. La solución es fundamentación y barreras de seguridad, no un mejor modelo base.
La objeción del comprador que realmente decide estos acuerdos no es la precisión en abstracto. Es el control. Un líder de CX lo expresó mejor que cualquier benchmark:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Un líder de CX en una marca DTC de suplementos sobre Gorgias y Shopify, con unos 7,000 tickets y 30,000 pedidos al mes
Ninguna entrada de la tabla anterior resuelve eso. Las puntuaciones de confianza, las reglas de escalado, la exclusión por tipo de ticket y un humano en el bucle sí lo hacen, y esos viven en la capa por encima de la API.
He escrito sobre los umbrales de confianza y la tasa de contención por separado, porque son la parte que decide si todo esto funciona.
Lo segundo que ninguno de estos hace es decirte la cifra que realmente estás presupuestando. Las tarifas de tokens son entradas. El coste por resolución es la salida, y las dos no son proporcionales una vez que añades recuperación, reintentos y el tiempo humano dedicado a limpiar después.
Lo que yo haría realmente con una cola de soporte

Comprar modelos para una cola de soporte es el primer paso equivocado, y lo digo como alguien que pasó esta semana leyendo ocho tarjetas de modelo. La pregunta no es qué modelo alucina menos, es cómo se ve tu precisión en tus propios tickets, y eso no se obtiene de una tabla de clasificación.
Eso es lo específico que eesel hace y una API pura no puede. Se conecta a Zendesk, Freshdesk, Gorgias, Front o Help Scout en pocos minutos, fundamenta cada respuesta en tu centro de ayuda, tickets pasados y macros, y luego ejecuta una simulación sobre tus tickets históricos reales para que veas la tasa de resolución real antes de que la vea un cliente. Si no supera tu umbral, no lo despliegas.
El precio es 40 centavos por ticket gestionado, sin cuotas por asiento, y nunca se te cobra por los tickets que gestionan tus humanos. Enruta 200 de tus 1,000 tickets mensuales para empezar y pagas $80. Prueba eesel gratis con $50 de uso y sin tarjeta de crédito.
No estoy afirmando que eesel haga más inteligente a un modelo base. Estoy afirmando que lo que realmente estás buscando, un modelo en el que puedas confiar frente a los clientes, no es un modelo en absoluto. Y la razón por la que estoy seguro de eso es que hemos visto fallar a nuestro propio agente de formas que ningún benchmark detecta: el peor patrón que registramos fue un agente narrando "ejecutando búsquedas en Zendesk" durante unos diez turnos sin llegar nunca a tocar la API. Nada destruye la confianza en un compañero de equipo más rápido que mentir sobre lo que hizo, y ninguna puntuación de índice lo habría predicho.
Entonces, ¿cuál deberías elegir?
- Necesitas entrada de imagen → GPT-5.6 Luna. La opción con visión más barata aquí, iguala a Flash en inteligencia, cuesta unas 3 veces más en la práctica. Mantén el esfuerzo bajo si la latencia importa.
- Necesitas residencia de datos → autoaloja los pesos de Flash. El mismo modelo, licencia MIT, 168.6 tok/s en una sola MI300X. La alternativa gestionada más barata es el nivel de pago de Gemini, que afirma por escrito que tu contenido no se usa para entrenamiento.
- Necesitas rendimiento → Gemini 3.5 Flash-Lite a 366 tok/s y la salida más concisa del grupo. Acepta el índice 36.
- Necesitas menos tokens de salida con la misma puntuación → Gemini 3.6 Flash. La misma puntuación de 50 con 59M de tokens en lugar de 210M, a 10 veces el coste por tarea.
- Necesitas fiabilidad → Kimi K3. Alucinación del 51% frente al 84%, a 29 veces el coste por tarea. No te molestes con K3 (low).
- Necesitas recuperación sobre documentos largos → DeepSeek V4 Pro. Gana en SimpleQA-Verified 57.9 a 34.1, y los votantes de LMArena coinciden.
- Necesitas el precio de lista más bajo → Qwen3.7-Flash, pero solo con prompts por debajo de 32K, y solo si te sientes cómodo con casi ninguna evaluación independiente.
- No necesitas nada de lo anterior → quédate con Flash. Es el más barato, el más rápido en dar el primer token, y es abierto. Solo vigila ese recargo pendiente del doble en hora pico, que se aplicará entre las 9:00–12:00 y las 14:00–18:00 hora de Pekín en cuanto DeepSeek anuncie una fecha de inicio.
Si estás elegiendo un modelo para responder tickets de clientes, la explicación de mejor agente de soporte con IA y coste del servicio al cliente con IA son lecturas más útiles que cualquiera de las páginas de modelos anteriores. Si estás elegiendo uno para escribir, mejor LLM para escribir blogs es por donde yo empezaría.
Sources
- Páginas de modelos de Artificial Analysis, todas las cifras verificadas el 4 de agosto de 2026: DeepSeek V4 Flash 0731
- GPT-5.6 Luna en Artificial Analysis
- Gemini 3.6 Flash y Gemini 3.5 Flash-Lite en Artificial Analysis
- Kimi K3 y Claude 4.5 Haiku en Artificial Analysis
- Precios de la API de DeepSeek y la guía de la Responses API
- Precios de la plataforma de OpenAI y la página del modelo GPT-5.6 Luna
- Precios de la API de desarrolladores de Gemini y el catálogo de modelos
- Visión general de modelos de Claude y precios de Claude
- Precios de modelos de Moonshot AI
- OpenRouter, Qwen3.7 Flash y Roboflow Vision Evals
- DeepSeek V4 Flash en una sola AMD MI300X y su hilo de Hacker News
- Archivo interno de llamadas con clientes de eesel, citado bajo descriptores anonimizados
Frequently Asked Questions
¿Cuál es la mejor alternativa a DeepSeek V4 Flash?
¿Hay una alternativa más barata que DeepSeek V4 Flash?
¿Qué alternativa a DeepSeek V4 Flash admite entrada de imagen?
¿Puedo autoalojar DeepSeek V4 Flash en lugar de cambiar de modelo?
¿DeepSeek entrena con los datos de la API de clientes de pago?
¿Cuánto cuesta DeepSeek V4 Flash comparado con las alternativas?
¿Es seguro poner DeepSeek V4 Flash frente a los clientes?
¿Debería usar DeepSeek V4 Pro en lugar de Flash?
low se sirve como high. Desglose completo en Flash frente a V4 Pro.
Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








