DeepSeek V4 Flash vs V4 Pro: ¿qué plan deberías usar?

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición August 3, 2026

Verificado por expertos
Ilustración que compara los planes de modelo DeepSeek V4 Flash y V4 Pro

The price card, side by side

Ambos modelos viven en una sola página, lo que hace que la comparación sea inusualmente limpia. Mismo proveedor, misma tabla, mismo día.

Página de modelos y precios de DeepSeek mostrando deepseek-v4-flash y deepseek-v4-pro en columnas adyacentes, tomada de la documentación de la API de DeepSeek
Página de modelos y precios de DeepSeek mostrando deepseek-v4-flash y deepseek-v4-pro en columnas adyacentes, tomada de la documentación de la API de DeepSeek
Concepto de facturación (por 1M de tokens)deepseek-v4-flashdeepseek-v4-proPro / Flash
Entrada, acierto de caché$0.0028$0.0036251.29x
Entrada, fallo de caché$0.14$0.4353.11x
Salida$0.28$0.873.11x

Vale la pena notar dos cosas antes de llegar a los benchmarks. Primero, la proporción no es uniforme: Pro cuesta 3.11 veces más que Flash en las tarifas que se pagan la mayor parte del tiempo, pero solo 1.29 veces más en aciertos de caché. Luego está la propia tarifa de caché. El precio de acierto de caché de Flash es un descuento de 50 veces frente a su propio precio de fallo de caché, y el cacheo está activado por defecto sin necesidad de cambiar código. Artificial Analysis llamó a eso un descuento de ~98% en aciertos de caché, más agresivo que el 90% que ofrece la mayor parte de la industria.

El truco es que una solicitud solo se factura a la tarifa de acierto cuando coincide por completo con una unidad de prefijo de caché persistida. La coincidencia parcial no cuenta, algo que DeepSeek atribuye a su atención de ventana deslizante. El cacheo también está documentado como de mejor esfuerzo, y las entradas no usadas se borran en cuestión de horas o días, así que trata la tarifa barata como un descuento que a veces consigues, no como una tarifa con la que puedas planificar.

Otra línea de la tabla cambia la aritmética. DeepSeek dice que la API pronto adoptará precios de hora pico al doble de la tarifa normal, entre las 9:00 y las 12:00 y entre las 14:00 y las 18:00 hora de Beijing, todos los días. No hay fecha de entrada en vigor publicada en ningún sitio. Las cifras de hoy son las tarifas normales, no una ventana de descuento.

Same window, different brain

Las especificaciones que normalmente separan un plan barato de uno caro son idénticas aquí.

EspecificaciónV4 FlashV4 Pro
Parámetros totales284B1.6T
Parámetros activos13B49B
Longitud de contexto1M1M
Salida máxima384K384K
Modo de pensamientoActivado por defectoActivado por defecto
Límite de concurrencia2,500500
Responses APITodavía no

Ambos son modelos Mixture-of-Experts preentrenados con más de 32T de tokens. Comparten el mismo diseño de atención híbrida (Compressed Sparse Attention más Heavily Compressed Attention), y también el mismo Manifold-Constrained Hyper-Connections y el optimizador Muon. La ventana de 1M es real en la configuración y no solo en el marketing: max_position_embeddings marca 1048576, algo que se alcanza extendiendo con YaRN una ventana entrenada de 64K, 16 veces.

Figura de eficiencia de contexto largo de V4 de DeepSeek mostrando la reducción de FLOPs y de caché KV, publicada en la nota de lanzamiento de V4 de DeepSeek
Figura de eficiencia de contexto largo de V4 de DeepSeek mostrando la reducción de FLOPs y de caché KV, publicada en la nota de lanzamiento de V4 de DeepSeek

Así que comprar Pro no te compra una ventana más grande, te compra 3.8 veces los parámetros activos. La distinción importa aquí, porque los parámetros activos sobre todo compran capacidad de recuerdo, y el recuerdo es exactamente el punto donde estos dos divergen. Si la idea de que un modelo más pequeño se defienda por sí mismo es nueva para ti, nuestra explicación de modelos de lenguaje pequeños cubre el caso general.

La entrada de imagen no está documentada en ninguno de los dos modelos. La etiqueta de pipeline en ambos repositorios de Hugging Face dice generación de texto, la configuración declara DeepseekV4ForCausalLM sin ningún codificador de visión en ninguna parte, y la fila de funciones de la tabla de precios lista salida JSON, llamadas a herramientas y FIM sin ninguna fila de visión. El trabajo multimodal de DeepSeek está en una línea de modelos separada. Un desarrollador que construía un agente conectó un segundo modelo específicamente para cubrir visión y búsqueda web.

Work out what each tier actually costs you

Esa proporción de precio de 3.11x solo se sostiene si ambos modelos emiten el mismo número de tokens, y no lo hacen. Artificial Analysis marca a Flash como verboso: generó 210M de tokens de salida para completar el Intelligence Index, frente a una mediana de la clase de 100M. Los tokens de razonamiento se facturan a la tarifa de salida, así que la verbosidad se convierte en una partida real de gasto.

Lo que plantea la pregunta útil. ¿Cuánto más hablador tendría que ser Flash antes de que Pro se convierta en la opción más barata? Introduce tus propias cifras.

El número que hay que quedarse es este. Solo con tokens de salida, Flash tiene que ser más de 3.11 veces más verboso que Pro antes de que Pro salga más barato. La brecha medida por AA frente a la mediana de la clase es de unas 2.1 veces. Los tokens de entrada lo hacen aún más difícil, ya que la mayoría de las cargas de trabajo consumen mucha entrada y la tarifa de entrada de Flash es un tercio de la de Pro. En la práctica, Flash gana en costo por un margen que la verbosidad no cierra.

Vale la pena calibrar qué significa todo esto en términos de negocio, eso sí. Incluso la tarifa de Pro es un error de redondeo al lado de un salario, y la comparación interesante para un equipo de soporte es IA frente a un agente humano, no Flash frente a Pro.

The benchmark inversion

Aquí está la parte que sorprendió a la gente. El 2026-07-31, DeepSeek lanzó DeepSeek-V4-Flash-0731, del que dice que mantuvo la misma arquitectura y tamaño y solo recibió un nuevo post-entrenamiento. Es decir, los mismos 284B/13B, con post-entrenamiento nuevo. La tabla agéntica publicada:

BenchmarkFlash 0731Flash PreviewPro PreviewGLM-5.2Opus 4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents' Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

Flash 0731 supera a la build de Pro en las nueve filas, y queda por detrás de Claude Opus 4.8 en las nueve. La misma pregunta de "el plan pequeño gana al grande" también está viva en otros laboratorios, vale la pena señalarlo, y normalmente se resuelve al revés: nuestra comparación de Opus 5 frente a Sonnet 5 encontró que el plan caro ganaba en costo por tarea, no solo en calidad.

Dos advertencias que el propio DeepSeek imprime, y que voy a repetir. Las filas con † son conjuntos de prueba internos. Y las ejecuciones de agente de código usaron el propio harness de DeepSeek, que no está publicado, así que nadie puede reproducirlo de forma independiente todavía. Un analista de X lo resumió con claridad:

"DeepSeek is launching a very cheap, very capable coding-agent Flash model that looks surprisingly close to Claude Opus 4.8, especially considering it's the lightweight model. That said, this is DeepSeek's own benchmark selection, so it's naturally designed to highlight its strengths."

El ranking independiente coincide en la dirección. Artificial Analysis puntuó a Flash 0731 con 50 en su Intelligence Index, seis puntos por delante de DeepSeek V4 Pro que tiene 44. Costo por tarea: $0.03 para Flash, $0.05 para Pro.

Un salto de DeepSWE de 7.3 a 54.4 con una forma de pesos sin cambios sí invita a la sospecha, y al menos una cuenta japonesa de IA de prestigio lo dijo directamente. La puntuación anterior era tan débil que el rebote les parece un ajuste a la medida del benchmark. Es justo tenerlo en cuenta, y también es la razón por la que el número del índice independiente importa aquí más que la tabla del proveedor.

Where Pro still wins

La tabla cruzada de la era de vista previa de DeepSeek es el único sitio donde ambos modelos se miden con el mismo esfuerzo de razonamiento, y es donde vive el caso a favor de Pro.

Benchmark (esfuerzo máximo)FlashProDiferencia
SimpleQA-Verified34.157.9+23.8
Chinese-SimpleQA78.984.4+5.5
BrowseComp73.283.4+10.2
MRCR 1M78.783.5+4.8
GDPval-AA (Elo)13951554+159
MMLU-Pro86.287.5+1.3
LiveCodeBench91.693.5+1.9

La brecha de recuerdo es la que debería decidir cualquier cosa. Una diferencia de 23.8 puntos en SimpleQA-Verified no es un error de redondeo, y es exactamente lo que cuestan 13B de parámetros activos. DeepSeek lo dice con sus propias palabras, describiendo a Flash como ligeramente por detrás en tareas de conocimiento puro y en los flujos de trabajo agénticos más complejos, y luego limita su afirmación de paridad a tareas de agente simples.

La recuperación de contexto largo se inclina en la misma dirección. Ambos modelos anuncian 1M, pero MRCR 1M da 83.5 en Pro frente a 78.7 en Flash, así que la ventana tiene el mismo tamaño mientras que encontrar la aguja no es igual. Si tu carga de trabajo es "meter un corpus enorme y hacer preguntas precisas sobre él", ese es el terreno de Pro. También es la carga de trabajo donde RAG en lugar de contexto crudo suele ganar de forma clara, y el ajuste fino es la tercera opción a la que recurre la gente, algo que cubre nuestro artículo de modelos de IA personalizados.

Dos asteriscos importan en esa tabla. Estas cifras son de Flash en build de vista previa, de antes de la reconstrucción 0731, y DeepSeek no ha vuelto a publicar ninguna tabla de benchmarks de conocimiento para 0731, así que no puedo decirte si la brecha de SimpleQA sobrevivió. Luego, en preferencia humana, LMArena sigue clasificando a deepseek-v4-pro en 1458±4, por encima de deepseek-v4-flash en 1436±4, con unos 49,000 votos cada uno. El índice automatizado y los votos humanos apuntan aquí en direcciones opuestas, lo cual es una buena razón para no dar un veredicto de un solo número.

The reasoning-effort trap

Si estuviera a punto de mover gasto entre los dos, esta es la sección que leería primero. No es intuitiva, y tampoco está en la tabla de precios. DeepSeek publica un mapeo de esfuerzo solicitado a esfuerzo real:

SolicitasFlash sirvePro sirve
lowlowhigh
highhighhigh
xhighhighmax
maxmaxmax

Lee la columna de Pro una vez más. No hay configuración barata en Pro, ya que una solicitud low se sirve como high, así que pagas 3.11 veces la tarifa por token y no puedes bajar el presupuesto de razonamiento para compensarlo. Flash tiene la peculiaridad contraria, donde xhigh se degrada en silencio a high, así que tocar ese parámetro no compra nada por encima de high. DeepSeek dice que el mapeo de Pro se actualizará a principios de agosto de 2026.

El pensamiento está activado por defecto en ambos, con esfuerzo high, y los tokens de razonamiento se facturan a la tarifa de salida. No hay una cadena de modelo -thinking separada, es un parámetro sobre el mismo alias. Desactivarlo tampoco es un intercambio menor. Flash sin pensamiento puntúa 8.1 en HLE y 1.0 en Apex, frente a 34.8 y 33.0 en max. Así que si quieres la configuración barata, estás eligiendo un modelo materialmente distinto, que es la lección a la que sigue llegando nuestra guía de optimización de LLM.

Dos trampas de muestreo mientras estás ahí. En modo de pensamiento, temperature, top_p, presence_penalty y frequency_penalty no son compatibles, y configurarlos no da ningún error, simplemente no hace nada. Además, si el modelo realizó una llamada a herramienta, debes devolver reasoning_content en cada turno posterior.

Operational differences that decide it

El precio y los benchmarks se llevan los titulares. Estas son las cosas que realmente deciden la elección en un despliegue real.

  • Concurrencia. Flash permite 2,500 solicitudes simultáneas y Pro permite 500. DeepSeek no publica ningún límite de RPM ni de TPM, así que la concurrencia es todo el modelo de límite de tasa, contada por cuenta sin importar la clave, y devuelve HTTP 429 por encima del tope. Para cualquier cosa con forma de fan-out, esa diferencia de 5 veces es decisiva.
  • Responses API. Solo compatible con Flash, y DeepSeek dice que el soporte de Pro llega a principios de agosto de 2026. La build 0731 también está adaptada específicamente para Codex.
  • Pesos abiertos. Flash se publica con licencia MIT en ~167GB de FP4/FP8 mixto, con 8 ajustes finos y 57 cuantizaciones ya publicadas, además de un módulo de decodificación especulativa DSpark integrado en el mismo checkpoint. Pro no tiene ningún checkpoint público propio. Si el licenciamiento es lo que te trajo aquí, plataformas de chatbot de código abierto da la visión más amplia.
  • Versionado. El alias de Flash sigue automáticamente la build más reciente, lo que significa que un benchmark que cita "DeepSeek V4 Flash" puede no ser el modelo que tú obtienes. La queja de un desarrollador sobre el sufijo vale la pena tenerla en cuenta aquí: fija -0731 siempre que cites algo.
Hoja de especificaciones de DeepSeek V4 de la nota de lanzamiento de la vista previa de V4, publicada por DeepSeek
Hoja de especificaciones de DeepSeek V4 de la nota de lanzamiento de la vista previa de V4, publicada por DeepSeek

What developers actually report

La explicación más útil de por qué el modelo pequeño gana en trabajo agéntico vino de un equipo que probó ambos y luego se puso a buscar la razón:

Hacker News

"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."

Más listo en un solo intento, peor con las herramientas. Coincide casi exactamente con la división de los benchmarks, y es el modelo mental más limpio que he encontrado para elegir entre estos dos.

Sobre lo que la gente realmente gasta, aquí hay dos recibos espontáneos del hilo de lanzamiento:

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886"

Alguien que ejecutó ambos planes durante quince días reportó pagar cerca de $1.50 al día por Pro, y situó la diferencia en "~50% más caro que Flash". Eso es notablemente más estrecho que el 3.11x de la tabla, que es lo que hacen los aciertos de caché intensos más un recuento de tokens de Pro más bajo a una factura real. Su otra nota es la que yo subrayaría, sin embargo: ambos planes necesitan supervisión, tareas pequeñas, sesiones frescas y comprobaciones manuales de cordura.

Los aspectos negativos son específicos, y se repiten. La alucinación y la pérdida de contexto aparecen a menudo:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

Artificial Analysis mide lo mismo desde el otro lado. La tasa de alucinación AA-Omniscience de Flash 0731 es del 84%, una mejora de 12 puntos sobre su predecesor, impulsada por menos alucinaciones y no por mayor precisión. Y la objeción que domina cada hilo de DeepSeek no tiene nada que ver con la calidad:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching."

Ese último punto reescribe en silencio toda la comparación para cualquiera que maneje datos de clientes. En un proveedor de retención de datos cero, la salida de $0.28 de Flash se convierte en aproximadamente $0.84–1.40, lo que se sitúa por encima de la tarifa de primera parte de Pro. La diferencia de precio entre Flash y Pro solo existe en la API de primera parte, y esa API de primera parte es la que no puedes apuntar a una bandeja de soporte. Ahí es donde la mayoría de los equipos dejan de comparar precios de tokens y empiezan a buscar automatización de atención al cliente que resuelva por ellos la cuestión de la retención.

What this changes if you point it at a support queue

Yo despliego integraciones e infraestructura de modelos en eesel, así que esta es la pregunta que más me hacen. ¿Qué modelo debería estar detrás del agente de IA? Después de más de tres años ejecutando IA en colas de soporte reales, mi respuesta honesta es que la elección de plan queda alrededor del quinto lugar en la lista de cosas que deciden si funciona.

Aquí va evidencia de nuestros propios datos en lugar de un benchmark. En una prueba con validación cruzada sobre tráfico real de Zendesk, 284 chats más una revisión manual de 100 tickets en un equipo europeo de comercio electrónico, la IA alcanzó 93% de precisión en triaje y 100% de detección de spam con cero falsos positivos en el 22% de la bandeja que era spam. La calidad del borrador salió direccionalmente correcta el 88% de las veces. Pero solo el 12% de los borradores se envió tal cual, con una tasa de error factual del 7%. Cuando investigamos por qué los agentes reescribían el resto: cerca del 65% era longitud y tono, cerca del 20% necesitaba datos a los que la IA no estaba conectada, y solo alrededor del 5% era el modelo equivocándose.

Esa división 65/20/5 es todo el argumento. Cuatro quintas partes de la brecha de calidad eran solucionables conectando más sistemas y entrenando con las respuestas ya enviadas del propio equipo, y un modelo más grande no hace ninguna de las dos cosas por ti. Tampoco los peores fallos que hemos visto fueron fallos de inteligencia en absoluto. Hemos tenido clientes de pago cuyo bot fabricó respuestas cuando la recuperación de la base de conocimiento no devolvió nada, uno de ellos inventando detalles de suscripción para un cliente real. La solución allí fue un respaldo estricto ante el fallo de recuperación, que es una decisión de pipeline y no un número de parámetros.

Así que si la elección entre estos dos es para la automatización de tickets de soporte: elige Flash, gasta el dinero ahorrado en conectar tus fuentes de datos reales, y luego pon detrás una ruta de escalado adecuada.

Hay unas cuantas cosas que mueven el número de resolución mucho más que cualquier mejora de plan, más o menos en este orden. Primero, acertar con la clasificación de tickets, para que la IA solo responda lo que debería. Luego, construir una ruta real de traspaso a un agente para todo lo demás. Y entrenar con tus propios datos, específicamente las respuestas ya enviadas por tu equipo, que según los datos de nuestra prueba llevaría la adopción de borradores tal cual del 12% hacia el 30–40% por sí sola.

Luego está la restricción que se sitúa por encima de todo eso. La API de primera parte de DeepSeek es donde viven las tarifas baratas, y también es donde tus tickets se convierten en datos de entrenamiento, así que para conversaciones con clientes en realidad estás calculando el precio de un proveedor de retención de datos cero. Eso cambia la lista corta, y nuestro resumen de soluciones de atención al cliente con IA es un mejor punto de partida que una tabla de tarifas por token. Sea cual sea el camino que elijas, mejorar la tasa de resolución sigue siendo un problema de datos mucho antes de convertirse en un problema de modelo.

Try eesel

¿Quieres la economía del modelo barato sin apostar tu bandeja de entrada al benchmark de alguien? eesel se conecta al helpdesk que ya usas y aprende de tus tickets pasados y de tu centro de ayuda. La parte que importa para este artículo: te permite simular al agente contra tus propios tickets históricos antes de que un solo cliente lo vea. Obtienes una tasa de resolución real, más una lista real de lo que se habría equivocado, con tus datos y en tu tono, sea cual sea el modelo que esté ganando este mes. Gratis para probar, y con precio por ticket resuelto en lugar de por asiento.

Vista de ejecución de una skill de eesel AI, mostrando un agente de IA ejecutando una acción configurada sobre un ticket real
Vista de ejecución de una skill de eesel AI, mostrando un agente de IA ejecutando una acción configurada sobre un ticket real

Ese hábito de simulación existe por cicatrices, no por marketing. Hemos visto bots que suenan seguros dar respuestas equivocadas, y ejecutar el despliegue contra tickets históricos primero es lo único que lo detecta antes de que lo haga un cliente. Si quieres el panorama más amplio antes de decidir, nuestro resumen de mejores agentes de IA y la lista de mejor software de helpdesk con IA son dos buenos puntos de partida.

Which one I would pick

Para trabajo agéntico y de programación en agosto de 2026: Flash, sin dudarlo. Es 3.11 veces más barato en las tarifas que realmente pagas. Supera a Pro en cada fila agéntica que publica DeepSeek, puntúa seis puntos más alto en el índice independiente, tiene 5 veces la concurrencia, y es el único de los dos con pesos abiertos más soporte de Responses API. No existe ninguna versión de esta comparación donde Pro gane en trabajo agéntico hoy.

Para recuerdo factual, recuperación precisa sobre un contexto muy grande, o cualquier cosa donde equivocarse con confianza salga caro: Pro, y comprueba si deberías estar en Claude Opus 5 o GPT-5.6 en su lugar. Esa brecha de SimpleQA es lo bastante grande como para que "usa simplemente el barato" sea un mal consejo en trabajo de conocimiento, y la propia ventaja de Pro sobre los modelos de frontera occidentales en ese eje no es evidente.

El tiempo es el comodín. DeepSeek dice que la actualización de V4-Pro está en camino, y el mismo nuevo post-entrenamiento que llevó la puntuación de DeepSWE de Flash de 7.3 a 54.4 todavía no se ha aplicado a Pro. Un comentarista hizo la pregunta obvia en voz alta. Si esto es un compromiso de doce meses en lugar de una decisión de este sprint, ese es el evento que hay que vigilar.

Vale la pena comparar esto con el resto del panorama ya que estamos aquí. Qwen 3.8 Max se sitúa en $2/$6 y Kimi K3 en $3/$15, así que ambos quedan muy por encima de DeepSeek en todos los indicadores.

Si quieres los enfrentamientos directos en lugar de las tablas de tarifas, ya he comparado Qwen contra Flash directamente, más Qwen contra Kimi y Qwen contra GPT-5.6.

Viniendo de la generación anterior, nuestro artículo sobre DeepSeek V3.2 lleva el contexto de la actualización, y Qwen 3.7 Flash es el rival de plan barato más cercano. Para la capa de harness que se sitúa encima de cualquier modelo que elijas, consulta mejores asistentes de IA para programar.

Preguntas frecuentes

¿Cuál es la diferencia entre DeepSeek V4 Flash y V4 Pro?
Sobre todo tamaño y precio. Flash tiene 284B de parámetros totales con 13B activos; Pro tiene 1.6T totales con 49B activos. Ambos llevan una ventana de contexto de 1M y un límite de salida de 384K, así que la diferencia no es un intercambio de contexto. Flash cuesta $0.14 por millón de tokens de entrada en un fallo de caché y $0.28 de salida, frente a $0.435 y $0.87 de Pro. Para un panorama más amplio, consulta cómo elegir un LLM para trabajo de soporte.
¿Es DeepSeek V4 Flash mejor que V4 Pro?
En trabajo agéntico y de programación, a agosto de 2026, sí. La reconstrucción 0731 de Flash supera a la build actual de Pro en los nueve benchmarks agénticos que publica DeepSeek, y Artificial Analysis le da 50 puntos frente a 44 de Pro. Pro sigue liderando en recuerdo factual y recuperación de contexto largo. Mi comparación con Qwen 3.8 Max cubre cómo queda Flash frente a un rival que no es de DeepSeek.
¿Cuánto cuesta DeepSeek V4 Pro comparado con Flash?
Alrededor de 3.1 veces más tanto en entrada por fallo de caché como en salida: $0.435 frente a $0.14 de entrada, $0.87 frente a $0.28 de salida, por millón de tokens. Las tarifas de acierto de caché están mucho más cerca, $0.003625 frente a $0.0028. Si estás comparando eso con tarifas occidentales, nuestros desgloses de precios de GPT-5.6 y precios de Claude Opus 5 son las referencias más cercanas.
¿DeepSeek V4 Flash tiene pesos abiertos?
Sí, bajo licencia MIT, con aproximadamente 167GB en precisión mixta FP4 y FP8, con 57 cuantizaciones publicadas. Hugging Face también lista un checkpoint base y ocho ajustes finos. Si el autoalojamiento es la razón por la que estás aquí, nuestro resumen de agentes de IA de código abierto cubre lo que realmente cuesta ese camino.
¿Qué modelo de DeepSeek es mejor para un agente de atención al cliente?
Ninguno por sí solo. La precisión de un agente de soporte depende mucho más de la calidad de la recuperación y del comportamiento de respaldo que del plan del modelo, por eso prevenir alucinaciones es un problema de pipeline. La elección del modelo importa en el margen; consulta cómo se arma un agente de IA para helpdesk antes de elegir un plan.
¿Puedo ejecutar DeepSeek V4 Pro con un esfuerzo de razonamiento bajo para ahorrar dinero?
Hoy no. DeepSeek publica una tabla de mapeo de esfuerzo donde una solicitud low en Pro se sirve como high, así que esa configuración económica simplemente no existe en ese plan. En Flash, low es realmente bajo y xhigh se sirve como high. DeepSeek dice que el mapeo de Pro cambiará a principios de agosto de 2026.
¿Está a punto de cambiar el precio de DeepSeek V4 Flash?
DeepSeek ha anunciado una política pendiente de precios en horas pico al doble de la tarifa normal, entre las 9:00 y las 12:00 y entre las 14:00 y las 18:00 hora de Beijing, todos los días, sin fecha de inicio establecida. Los $0.14 y $0.28 de hoy son las tarifas normales. Presupuesta el recargo si tu tráfico es síncrono, y lee nuestra guía de costo de atención al cliente con IA para ver cómo las tarifas por token se traducen en un número por ticket.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
DeepSeek V4 Flash: precios y lo que pagarás realmente
Trending

DeepSeek V4 Flash: precios y lo que pagarás realmente

DeepSeek V4 Flash figura a $0.14 de entrada y $0.28 de salida por millón de tokens. Usuarios reales han publicado tarifas combinadas por debajo de un centavo. Esto es lo que decide cuál te toca a ti.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente
Trending

DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente

DeepSeek V4 Flash cuesta $0.14 de entrada y $0.28 de salida por millón de tokens, y supera a la propia gama alta de DeepSeek. Esto es lo que la tabla de precios no cuenta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Dos personas haciendo pulseadas en una mesa mientras una tercera observa, ilustrando una comparación directa entre modelos
Trending

DeepSeek V4 Flash vs GPT-5.6: ¿cuál eliges para construir?

DeepSeek V4 Flash vs GPT-5.6 con los precios de agosto de 2026. La verdadera pelea es Flash contra Luna, la inteligencia queda empatada, y lo que decide es velocidad, visión y datos.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración comparando DeepSeek V4 Flash y Kimi K3 de Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: ¿cuál deberías usar?

Un modelo cuesta 29 veces más por tarea que el otro. Revisé todos los números publicados de ambos, y lo interesante es la opción intermedia que nadie debería comprar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de un gato muy largo estirándose junto a dos personas revisando una tarjeta de puntuación, con el logo de LongCat
Trending

Review de LongCat 2.0: un caballo de batalla con un bloqueo real

Evalué LongCat 2.0 en siete aspectos que realmente le importan a un comprador, usando los propios archivos de Meituan y los testimonios de quienes le hicieron pasar miles de millones de tokens. Sale bien en seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de un gato muy largo estirado sobre un escritorio junto a un rack de servidores, con el logo de LongCat
Trending

LongCat 2.0: dentro del modelo abierto de 1,6T parámetros de Meituan

LongCat 2.0 es el modelo MoE de 1,6T parámetros de Meituan, con licencia MIT, a 0,30 dólares por millón de tokens de entrada. Leí todas las fuentes primarias para ver qué se entrega realmente.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Un revisor mirando una tarjeta de veredicto con dos diales de esfuerzo etiquetados como bajo y máximo, junto a la ballena de DeepSeek
Trending

Revisión de DeepSeek V4 Flash: un modelo, dos personalidades

Una revisión de DeepSeek V4 Flash basada en los números que publican ambos marcadores. La ejecución barata y la ejecución inteligente son los mismos pesos, y eso cambia el veredicto.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustración que compara el Qwen 3.8 Max de Alibaba con DeepSeek V4 Flash
Trending

Qwen 3.8 Max vs DeepSeek V4 Flash: precio, specs y veredicto real

Un modelo cuesta 21 veces más por token de salida que el otro. Eso es lo menos interesante de esta comparación, y esto es lo que realmente deciden las especificaciones.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Dos personas leyendo un gran medidor de uso y ajustando una pila de diales de facturación, en el color de marca azul de Meta
Trending

Precios de Meta Muse Spark 1.1: la factura tiene cuatro medidores

Muse Spark 1.1 tiene un precio de lista de $1.25 de entrada y $4.25 de salida por millón de tokens. Cuatro medidores separados determinan tu factura real, y el precio de lista es el más pequeño de todos.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis