
Lo que realmente estás comprando
Todo el producto cabe en una fila de una página de documentación. Dos modelos, una tabla de especificaciones, tres precios. Refrescantemente honesto, comparado con la mayoría de las páginas de lanzamiento.

La versión detrás del alias es DeepSeek-V4-Flash-0731, que se hizo pública el 31/07/2026 como un re-post-entrenamiento del lanzamiento de abril. Arquitectónicamente es una mezcla de expertos dispersa: 284B de parámetros totales, de los cuales 13B están activos en cualquier token dado. Los pesos tienen licencia MIT y pesan unos 167GB. Si conoces la generación anterior de DeepSeek V3.2, esto es un animal distinto en trabajo agéntico.
| Especificación | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrada, acierto de caché (por 1M) | $0.0028 | $0.003625 |
| Entrada, fallo de caché (por 1M) | $0.14 | $0.435 |
| Salida (por 1M) | $0.28 | $0.87 |
| Ventana de contexto | 1M | 1M |
| Salida máxima | 384K | 384K |
| Modo de razonamiento | Sin pensar y pensando, pensando por defecto | Sin pensar y pensando, pensando por defecto |
| Llamadas a herramientas / salida JSON | Sí / Sí | Sí / Sí |
| Responses API | Sí | No, a principios de agosto de 2026 |
| Límite de concurrencia | 2500 | 500 |
Todas las cifras provienen de la propia ficha de precios de DeepSeek. Hay dos detalles fáciles de pasar por alto y que merece la pena detenerse. El modo de razonamiento es el predeterminado en ambos niveles, y los tokens de razonamiento se cobran a la tarifa de salida. Y Flash, no Pro, es el único modelo que soporta la Responses API, lo cual es inusual: el nivel económico obtiene la interfaz más nueva.
El problema de la revisión: estás calificando un ajuste
Aquí está el hallazgo que reformuló todo este texto para mí. Artificial Analysis no lista un solo DeepSeek V4 Flash. Lista dos, porque los mismos pesos se comportan como dos productos distintos según reasoning_effort.

Ejecútalo con el pensamiento apagado y obtienes un Índice de Inteligencia de 29, a una mediana de 107 tokens de salida por segundo, 1.18s hasta el primer fragmento y 5.86s de extremo a extremo. Ahora ejecútalo a esfuerzo máximo. El índice sube a 50, y Artificial Analysis no publica ningún número de velocidad para esa variante. Tokens de salida por segundo, en blanco. Tiempo hasta el primer token, en blanco. Tiempo de respuesta total, en blanco, con el panel de resumen admitiendo "Desconocido de 4 unidades para Velocidad".
Así que el modelo que encabeza las tablas de valor es un modelo del que nadie ha publicado una cifra de latencia. No es un escándalo, solo una laguna de medición. Sí significa que un plan construido sobre "barato y rápido" descansa en dos números que nunca se midieron en la misma ejecución.
Dos peculiaridades menores lo agravan. La propia tabla de mapeo de esfuerzo de DeepSeek atiende una solicitud xhigh en Flash como si fuera high, así que un dial que crees haber girado no hace nada. Y en Pro, una solicitud low se atiende como high, lo que significa que no existe ninguna ejecución barata de Pro, y esa es buena parte de la razón por la que la comparación entre Flash y Pro resulta como resulta.
Si estás configurando esto tú mismo, las trampas están todas en el lado silencioso de la API, y las documenté por separado en cómo usar la API. La versión corta es que casi cualquier mala configuración devuelve HTTP 200 y simplemente te ignora.
Los dos marcadores no coinciden, y ambos tienen razón
Aquí es donde la mayoría de los análisis elige el número más favorecedor y sigue adelante. La postura honesta es que el índice automatizado y el tablero de votos humanos cuentan historias distintas sobre el mismo modelo.

En Artificial Analysis, la ejecución de Flash a esfuerzo máximo puntúa 50 y se ubica 21ª de 260 filas de modelos, tercera de 101 en su propia clase de tamaño, y primera de 101 en precio con acierto de caché. El costo por tarea es de $0.03, y ejecutar todo el índice costó $72.02.
En el tablero de texto de LMArena, el mismo modelo está en el puesto 79, con un Elo de 1436 más o menos 4, sobre 48,667 votos. La fila -high-preview es apenas distinta con 1438. Y V4 Pro, el modelo al que Flash supera en el índice automatizado, está por encima de él aquí con 1458. La preferencia humana y el agregado de benchmarks se separan de verdad en este caso.
Un punto brillante en los datos humanos, con una advertencia adjunta: en el tablero de WebDev, deepseek-v4-flash-high está 8º con 1577. Esa fila lleva la etiqueta Preliminar de LMArena sobre 1,319 votos con un intervalo de más o menos 18, así que es una señal prometedora más que un resultado asentado.
Mi lectura sobre esto: el índice automatizado mide una ejecución configurada al máximo en tareas que premian el uso de herramientas, mientras que la arena mide cómo se siente una respuesta para una persona sentada frente a una caja de chat. Flash está construido para lo primero. Así que cómpralo para lo primero.
En qué es realmente bueno
Los comprobantes aquí son la parte más convincente de toda la reacción, porque son facturas y no opiniones. Aquí es donde el marco de agéntico se gana su lugar.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
Cost: $4.55USDAPI requests: 3,467Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek. It has not disappointed at all for coding or review tasks. For everything else, use another model."
Fíjate en la última línea, porque es la frase más útil del hilo. Los usuarios más intensivos no están reclamando un modelo de frontera de propósito general, están reclamando un caballo de batalla muy bueno y muy barato para un conjunto específico de tareas. Alguien apareció enseguida con una factura mayor y la misma conclusión, con 2.1 mil millones de tokens en 12 días por $19.27.
Los usuarios de arneses de agentes reportan la misma tendencia:
"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost. [...] I haven't used our slow opus subscription for weeks."
La explicación más interesante sobre por qué el nivel barato gana en este tipo de trabajo vino de un equipo que tuvo que averiguarlo por sí mismo:
"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."
Eso se aplica igual de bien al caso de uso de resumir y revisar. Un usuario reportó cuatro dólares en dos meses de trabajo de revisión y resumen, "sin caída dramática de rendimiento frente a otros modelos de EE.UU.". Para trabajos por lotes que antes eran demasiado caros de automatizar, el precio cambia de verdad lo que vale la pena construir, que es el mismo argumento que hago sobre los costos de soporte con IA en otro dominio.
¿Deberías usarlo para este trabajo?
Dónde se cae
Un análisis que solo enumera fortalezas es un comunicado de prensa. Las quejas de abajo son específicas y se repiten en los hilos, y un par de ellas son la razón completa por la que no pondría este modelo frente a un cliente.
Alucina, y el número publicado es feo. Artificial Analysis pone la tasa de alucinación AA-Omniscience en 84%, y su propia nota indica que la mejora generacional vino de "menos alucinaciones, en lugar de mayor precisión". Eso es una mejora de 12 puntos sobre un número que empezó peor. Los usuarios describen lo mismo sin la métrica:
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
Para ser justos, el usuario más intensivo del hilo lo calibró frente a sus pares en lugar de tratarlo como descalificante, diciendo que alucina "más o menos igual que los modelos Codex y todos los demás LLM" y que revisa todo lo que escribe y hace que otros modelos verifiquen el trabajo cruzado. Esa es la postura correcta, y también es un costo real que nunca aparece en la ficha de precios.
El trabajo de largo horizonte en una base de código grande es el punto débil, lo cual resulta incómodo dado el discurso agéntico del proveedor.
"If you believe the benchmarks Deepseek v4 is pretty shitty at long running work in large codebases, but really really good at self contained algorithmic/math reasoning - which is basically ideal for a compiler for a language with a relatively complex type system. And with its cache pricing it's very cheap."
Es un modelo verboso, y las palabras se cobran. Artificial Analysis lo señala explícitamente sobre la verbosidad.

Quemó 210M de tokens de salida para completar el índice frente a una mediana de clase de 100M, descrito en la página del modelo como "muy verboso en comparación". Toda la ejecución solo costó $72.02, que es lo importante, pero 2.1 veces el volumen de salida mediano es el mecanismo que separa silenciosamente el precio de etiqueta de tu factura. Desgloso esa brecha con detalle en el desglose de precios.
Capacidades que simplemente están ausentes. No hay entrada de imagen documentada: sin fila de visión en la ficha de precios, sin codificador de visión en la configuración, y el trabajo multimodal de DeepSeek vive en líneas de modelo separadas. Los equipos lo rodean, como describió un usuario, manteniendo un segundo modelo a mano para visión.
Vale la pena corregir una afirmación que se ha propagado junto con esa. El mismo reporte dice que DeepSeek "no soporta búsqueda web", y eso solo es cierto en la ruta más antigua de chat-completions. La Responses API, exclusiva de Flash, sí incluye una herramienta integrada web_search del lado del servidor, junto a apply_patch. Los tipos de herramienta de búsqueda de archivos, intérprete de código, uso de computadora y MCP se ignoran todos ahí, así que el conjunto de capacidades es estrecho, pero la búsqueda web está en la lista.
Hay un caso real de facturación descontrolada registrado, y vale la pena saberlo antes de apuntar un agente a esto:
"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."
DeepSeek tampoco publica ningún límite de solicitudes por minuto o tokens por minuto, solo un tope de concurrencia que es a nivel de cuenta y no de clave. Combinado con un saldo prepago que puede devolver un 402 a mitad de una ejecución, eso es más un problema de monitoreo que de precio, y un buen argumento para una configuración de seguimiento adecuada.
Una queja de versionado que le pasará factura a cualquiera que cite benchmarks. Un usuario lo expresó bien: en DeepSeek ahora es simplemente deepseek-v4-flash, mientras que OpenRouter lo llama deepseek/deepseek-v4-flash-0731, así que cuando un benchmark dice "DeepSeek V4 Flash" no siempre puedes saber qué versión se ejecutó. Fija el nombre con fecha cuando anotes algo.
Ejecutar los pesos tú mismo
La licencia MIT hace un trabajo real aquí, y los reportes locales son la parte mejor documentada de la reacción. Esto es genuinamente un modelo fundacional que puedes alojar, no un LLM solo alojado.
| Hardware | Velocidad reportada |
|---|---|
| DGX Spark doble | 60 tokens/s en sesión única, 100+ agregados con concurrencia 4 |
| Mac Studio M3 Ultra 256GB | ~30 tokens/s de decodificación en solicitud única |
| Ryzen AI MAX+ 395 (Strix Halo) | 32 tokens/s a ~2.88 bits por parámetro |
| RTX PRO 6000 96GB individual | 170 tokens/s reportados con un motor de plano de 2 bits |
Un usuario que lo ejecuta localmente captó por qué la gente se toma la molestia, y no es la aritmética:
"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. Privacy is a large part of it but, I also no longer think twice about whether to send a prompt or not based on the psychology of it costing money."
En pura relación de costos, los hilos están casi unánimes en el sentido contrario. Una estimación situó una máquina Spark doble en ocho o nueve mil dólares y concluyó que "tiene poco o ningún sentido mientras los precios de la API sean lo que son. Excepto quizás por razones de privacidad." Otro usuario hizo las cuentas de electricidad y encontró que llegar a la tarifa de caché de DeepSeek era más barato que ejecutar un modelo de 36B en casa. Así que: aloja el modelo por control y privacidad, no para ahorrar dinero.
Mi veredicto, por tarea
| Tarea | Veredicto | El factor decisivo |
|---|---|---|
| Resumen y revisión en masa | Úsalo | La entrada con acierto de caché a $0.0028 hace trivial un trabajo por lotes antes injustificable |
| Programación agéntica acotada | Úsalo, con revisión | Encabeza las filas agénticas, y la ventaja de uso de herramientas sobre Pro es real |
| Trabajo de largo horizonte, repositorio grande | Ten cuidado | La queja más constante en todos los hilos |
| Cualquier cosa visual | Evítalo | No hay entrada de imagen documentada, así que dirígelo a un segundo modelo |
| Razonamiento y memoria de una sola vez | Considera Pro | Pro todavía gana en memoria y en búsqueda de aguja en contexto largo |
| Respuestas de cara al cliente | No sin supervisión | Tasa de alucinación del 84%, más términos de la API que callan sobre el uso para entrenamiento |
Frente al resto del campo, hay tres modelos que merecen compararse con él. Con aproximadamente la misma inteligencia, GPT-5.6 Luna cuesta dos o tres veces más y es con el que la gente combina Flash para visión, desarrollado en Flash frente a GPT-5.6. Si la precisión importa más que el precio, Kimi K3 alucina mucho menos y cuesta mucho más.
Para la opción multimodal en el mismo rango de pesos abiertos, Qwen 3.8 Max es el que hay que leer a continuación. Hay análisis prácticos de cada uno en la reseña de Qwen y la reseña de Kimi.
Dos puntos de referencia adicionales si estás trazando un eje de precios. Los precios de Claude Opus 5 marcan el extremo de frontera. Las alternativas de Mistral cubren la familia europea de pesos abiertos, y la reseña de GPT-5.6 tiene el veredicto sobre el modelo del que la mayoría de equipos realmente se están cambiando.
¿Debería alguna vez responder a un cliente?
Esta es la sección que realmente me importa, porque es mi trabajo. Y la respuesta honesta es que el modelo es el lugar equivocado donde mirar.
Empieza por dónde van los tokens. Los términos de Open Platform de pago de DeepSeek no dicen nada sobre el uso para entrenamiento, lo cual no es lo mismo que ser permisivo ni lo mismo que ser seguro. Los términos para consumidores tienen una cláusula explícita en la sección 4.3 con una opción de exclusión de "Mejorar el modelo para todos"; la sección equivalente del documento de la API se detiene antes de eso. No hay tampoco un acuerdo de procesamiento de datos publicado ni una opción de retención cero en ninguna dirección, y la política de privacidad indica que los datos se procesan y almacenan en la República Popular China bajo la ley china. Existen proveedores de retención cero, y un usuario los reportó a tres o cinco veces el precio directo, lo que borra la mayor parte del descuento.
Si algo de esto es nuevo para ti, el episodio de la política de Slack es el precedente que los lectores ya vivieron. SOC 2 y GDPR es la lista de verificación que hay que seguir antes de conectar algo de cara al cliente.
Después está la cifra del 84%. Cada equipo de soporte con el que hablo escucha un número así y hace la pregunta equivocada, que es "qué tan preciso es tu modelo". Aquí hay un cliente nuestro que planteó la pregunta correcta mucho mejor que yo. Su bot había estado confirmando con confianza que la empresa soportaba modelos de coche que no estaban en su base de datos, porque una línea de la base de conocimiento decía que soportaban todos los modelos. El modelo estaba bien. El anclaje no lo estaba.
El resumen del equipo sobre cómo lograrlo bien fue "ensayo y error al principio".
Un equipo de soporte de telemática vehicular B2B danés en Zendesk, gestionando alrededor de 200 tickets al mes y escalando hacia más de 2,000, que temía que la IA confirmara con exceso de confianza modelos de coche no soportados.
Esa es toda la lección. La alucinación en soporte suele ser un problema de anclaje y permisos disfrazado de modelo, y toda solución real vive por encima del modelo y no dentro de él.
La pila que hace que un modelo inestable sea manejable no es exótica. Recuperación sobre fuentes que realmente has verificado. Barreras de seguridad sobre lo que se le permite afirmar. Una puntuación de confianza con un umbral que alguien elegió a propósito, y una persona en todo lo que quede por debajo.
Nuestro peor fallo observado en producción fue un agente de IA narrando "ejecutando búsquedas en Zendesk" durante unos diez turnos sin llegar a tocar la API, y luego reportando archivos guardados que no existían. Nada mata la confianza en un compañero de equipo más rápido que mentir sobre lo que hizo, y ningún puntaje de benchmark lo habría detectado. Lo que lo detecta es la medición de contención después de los hechos y la revisión humana antes.
Así que si estás evaluando modelos en crudo para una cola de soporte, el orden práctico es más o menos este. Pruébalo de forma adversarial antes de confiar en algo. Construye un hábito de evaluación en lugar de una fecha de lanzamiento. Fija umbrales de confianza deliberadamente.
Después lee sobre prevención de alucinaciones antes de conectar un solo ticket, y pregúntate con honestidad la cuestión de construir versus comprar, porque montar toda esa pila tú mismo es el verdadero proyecto. El modelo es la parte barata.
Prueba eesel
Si llegaste aquí desde una hoja de cálculo comparando tarifas por token para un caso de uso de soporte, lo que te diría frente a un café es que el precio del token nunca fue la parte difícil. Conectar un modelo a tu mesa de ayuda, anclarlo en tus macros reales y tus tickets pasados, y saber qué va a decir antes de que un cliente lo vea, esa es la parte difícil, y eso es el producto.
Eso es eesel: un agente de soporte con IA que se conecta a Zendesk o a tu mesa de ayuda existente, ancla cada respuesta en tu conocimiento verificado, y te deja ejecutar simulaciones sobre tus propios tickets históricos para que veas exactamente dónde se habría equivocado antes de salir en vivo. Ves el volumen de tareas, los disparadores, y cada aprobación o rechazo por herramienta, así que "¿está alucinando?" se convierte en un número que puedes mirar en lugar de una preocupación.

El precio es por conversación resuelta en lugar de por asiento, lo que significa que una implementación gradual es una opción real: dirige 200 de tus 1,000 tickets mensuales y paga por 200. Hay $50 de uso gratuito para empezar, sin tarjeta requerida, y la página de precios tiene las cifras. Ejecuta una simulación sobre los tickets del mes pasado y sabrás en una hora si algo de esto vale tu tiempo. Es un uso mucho mejor de una tarde que hacer benchmarking de un dial.
Preguntas frecuentes
¿Es bueno DeepSeek V4 Flash?
¿Cuánto cuesta DeepSeek V4 Flash?
¿Por qué DeepSeek V4 Flash puntúa mejor que V4 Pro?
¿Puede DeepSeek V4 Flash leer imágenes?
¿Es DeepSeek V4 Flash seguro para los datos de clientes?
¿Debería DeepSeek V4 Flash responder tickets de soporte?
¿Puedo ejecutar DeepSeek V4 Flash en mi propio hardware?
¿Cuáles son las mejores alternativas a DeepSeek V4 Flash?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.







