Revisión de DeepSeek V4 Flash: un modelo, dos personalidades

Riellvriany Indriawan
Escrito por

Riellvriany Indriawan

Katelin Teen
Revisado por

Katelin Teen

Última edición August 6, 2026

Verificado por expertos
Un revisor mirando una tarjeta de veredicto con dos diales de esfuerzo etiquetados como bajo y máximo, junto a la ballena de DeepSeek

Lo que realmente estás comprando

Todo el producto cabe en una fila de una página de documentación. Dos modelos, una tabla de especificaciones, tres precios. Refrescantemente honesto, comparado con la mayoría de las páginas de lanzamiento.

La página de Modelos y Precios de DeepSeek mostrando los dos modelos V4 lado a lado con tarifas de acierto de caché, fallo de caché y salida, tal como aparece en DeepSeek
La página de Modelos y Precios de DeepSeek mostrando los dos modelos V4 lado a lado con tarifas de acierto de caché, fallo de caché y salida, tal como aparece en DeepSeek

La versión detrás del alias es DeepSeek-V4-Flash-0731, que se hizo pública el 31/07/2026 como un re-post-entrenamiento del lanzamiento de abril. Arquitectónicamente es una mezcla de expertos dispersa: 284B de parámetros totales, de los cuales 13B están activos en cualquier token dado. Los pesos tienen licencia MIT y pesan unos 167GB. Si conoces la generación anterior de DeepSeek V3.2, esto es un animal distinto en trabajo agéntico.

Especificacióndeepseek-v4-flashdeepseek-v4-pro
Entrada, acierto de caché (por 1M)$0.0028$0.003625
Entrada, fallo de caché (por 1M)$0.14$0.435
Salida (por 1M)$0.28$0.87
Ventana de contexto1M1M
Salida máxima384K384K
Modo de razonamientoSin pensar y pensando, pensando por defectoSin pensar y pensando, pensando por defecto
Llamadas a herramientas / salida JSONSí / SíSí / Sí
Responses APINo, a principios de agosto de 2026
Límite de concurrencia2500500

Todas las cifras provienen de la propia ficha de precios de DeepSeek. Hay dos detalles fáciles de pasar por alto y que merece la pena detenerse. El modo de razonamiento es el predeterminado en ambos niveles, y los tokens de razonamiento se cobran a la tarifa de salida. Y Flash, no Pro, es el único modelo que soporta la Responses API, lo cual es inusual: el nivel económico obtiene la interfaz más nueva.

El problema de la revisión: estás calificando un ajuste

Aquí está el hallazgo que reformuló todo este texto para mí. Artificial Analysis no lista un solo DeepSeek V4 Flash. Lista dos, porque los mismos pesos se comportan como dos productos distintos según reasoning_effort.

Un archivo de pesos, dos modelos distintos: la ejecución con el pensamiento apagado puntúa índice 29 a 107 tokens por segundo, la ejecución de esfuerzo máximo puntúa 50 sin velocidad publicada
Un archivo de pesos, dos modelos distintos: la ejecución con el pensamiento apagado puntúa índice 29 a 107 tokens por segundo, la ejecución de esfuerzo máximo puntúa 50 sin velocidad publicada

Ejecútalo con el pensamiento apagado y obtienes un Índice de Inteligencia de 29, a una mediana de 107 tokens de salida por segundo, 1.18s hasta el primer fragmento y 5.86s de extremo a extremo. Ahora ejecútalo a esfuerzo máximo. El índice sube a 50, y Artificial Analysis no publica ningún número de velocidad para esa variante. Tokens de salida por segundo, en blanco. Tiempo hasta el primer token, en blanco. Tiempo de respuesta total, en blanco, con el panel de resumen admitiendo "Desconocido de 4 unidades para Velocidad".

Así que el modelo que encabeza las tablas de valor es un modelo del que nadie ha publicado una cifra de latencia. No es un escándalo, solo una laguna de medición. Sí significa que un plan construido sobre "barato y rápido" descansa en dos números que nunca se midieron en la misma ejecución.

Dos peculiaridades menores lo agravan. La propia tabla de mapeo de esfuerzo de DeepSeek atiende una solicitud xhigh en Flash como si fuera high, así que un dial que crees haber girado no hace nada. Y en Pro, una solicitud low se atiende como high, lo que significa que no existe ninguna ejecución barata de Pro, y esa es buena parte de la razón por la que la comparación entre Flash y Pro resulta como resulta.

Si estás configurando esto tú mismo, las trampas están todas en el lado silencioso de la API, y las documenté por separado en cómo usar la API. La versión corta es que casi cualquier mala configuración devuelve HTTP 200 y simplemente te ignora.

Los dos marcadores no coinciden, y ambos tienen razón

Aquí es donde la mayoría de los análisis elige el número más favorecedor y sigue adelante. La postura honesta es que el índice automatizado y el tablero de votos humanos cuentan historias distintas sobre el mismo modelo.

Dos tableros, dos veredictos, el mismo modelo: puntuación de índice automatizado 50 en el puesto 21, elo de votos humanos 1436 en el puesto 79 sobre 48,667 votos
Dos tableros, dos veredictos, el mismo modelo: puntuación de índice automatizado 50 en el puesto 21, elo de votos humanos 1436 en el puesto 79 sobre 48,667 votos

En Artificial Analysis, la ejecución de Flash a esfuerzo máximo puntúa 50 y se ubica 21ª de 260 filas de modelos, tercera de 101 en su propia clase de tamaño, y primera de 101 en precio con acierto de caché. El costo por tarea es de $0.03, y ejecutar todo el índice costó $72.02.

En el tablero de texto de LMArena, el mismo modelo está en el puesto 79, con un Elo de 1436 más o menos 4, sobre 48,667 votos. La fila -high-preview es apenas distinta con 1438. Y V4 Pro, el modelo al que Flash supera en el índice automatizado, está por encima de él aquí con 1458. La preferencia humana y el agregado de benchmarks se separan de verdad en este caso.

Un punto brillante en los datos humanos, con una advertencia adjunta: en el tablero de WebDev, deepseek-v4-flash-high está 8º con 1577. Esa fila lleva la etiqueta Preliminar de LMArena sobre 1,319 votos con un intervalo de más o menos 18, así que es una señal prometedora más que un resultado asentado.

Mi lectura sobre esto: el índice automatizado mide una ejecución configurada al máximo en tareas que premian el uso de herramientas, mientras que la arena mide cómo se siente una respuesta para una persona sentada frente a una caja de chat. Flash está construido para lo primero. Así que cómpralo para lo primero.

En qué es realmente bueno

Los comprobantes aquí son la parte más convincente de toda la reacción, porque son facturas y no opiniones. Aquí es donde el marco de agéntico se gana su lugar.

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek. It has not disappointed at all for coding or review tasks. For everything else, use another model."

Fíjate en la última línea, porque es la frase más útil del hilo. Los usuarios más intensivos no están reclamando un modelo de frontera de propósito general, están reclamando un caballo de batalla muy bueno y muy barato para un conjunto específico de tareas. Alguien apareció enseguida con una factura mayor y la misma conclusión, con 2.1 mil millones de tokens en 12 días por $19.27.

Los usuarios de arneses de agentes reportan la misma tendencia:

Hacker News

"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost. [...] I haven't used our slow opus subscription for weeks."

La explicación más interesante sobre por qué el nivel barato gana en este tipo de trabajo vino de un equipo que tuvo que averiguarlo por sí mismo:

Hacker News

"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."

Eso se aplica igual de bien al caso de uso de resumir y revisar. Un usuario reportó cuatro dólares en dos meses de trabajo de revisión y resumen, "sin caída dramática de rendimiento frente a otros modelos de EE.UU.". Para trabajos por lotes que antes eran demasiado caros de automatizar, el precio cambia de verdad lo que vale la pena construir, que es el mismo argumento que hago sobre los costos de soporte con IA en otro dominio.

¿Deberías usarlo para este trabajo?

Elige tu tarea
¿Es V4 Flash la decisión correcta?
Sí, este es el punto óptimo
Los prefijos repetidos aciertan la caché a $0.0028 por millón, y hay gente ejecutando cientos de millones de tokens por unos pocos dólares. La verbosidad no perjudica mucho cuando la salida es corta.
Ejecútalo con esfuerzo bajo y mide antes de subir el pensamiento.
Sí, con supervisión
Encabeza las filas de benchmarks agénticos y los usuarios reportan sesiones de 30 turnos por unos cincuenta céntimos. La queja repetida es el trabajo de largo horizonte en bases de código grandes, así que divide las tareas en partes pequeñas, dale tipos y pruebas, y empieza sesiones nuevas.
Esfuerzo máximo, y presupuesta que los tokens de razonamiento se cobran como salida.
No, combínalo con otra cosa
No hay entrada de imagen documentada en ninguna parte de la ficha de precios ni de la configuración. Los equipos conectan un segundo modelo para visión y mantienen Flash para el trabajo de texto y herramientas.
Encamina por tipo de entrada, no por preferencia de modelo.
No por su cuenta
Una tasa de alucinación del 84% y unos términos de la API que no dicen nada sobre el uso para entrenamiento son dos razones independientes para mantenerlo detrás de anclaje, un umbral de confianza y una persona. El modelo es la parte barata de esa pila.
Simula primero sobre tus propios tickets pasados, luego encamina una parte.

Dónde se cae

Un análisis que solo enumera fortalezas es un comunicado de prensa. Las quejas de abajo son específicas y se repiten en los hilos, y un par de ellas son la razón completa por la que no pondría este modelo frente a un cliente.

Alucina, y el número publicado es feo. Artificial Analysis pone la tasa de alucinación AA-Omniscience en 84%, y su propia nota indica que la mejora generacional vino de "menos alucinaciones, en lugar de mayor precisión". Eso es una mejora de 12 puntos sobre un número que empezó peor. Los usuarios describen lo mismo sin la métrica:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

Para ser justos, el usuario más intensivo del hilo lo calibró frente a sus pares en lugar de tratarlo como descalificante, diciendo que alucina "más o menos igual que los modelos Codex y todos los demás LLM" y que revisa todo lo que escribe y hace que otros modelos verifiquen el trabajo cruzado. Esa es la postura correcta, y también es un costo real que nunca aparece en la ficha de precios.

El trabajo de largo horizonte en una base de código grande es el punto débil, lo cual resulta incómodo dado el discurso agéntico del proveedor.

Hacker News

"If you believe the benchmarks Deepseek v4 is pretty shitty at long running work in large codebases, but really really good at self contained algorithmic/math reasoning - which is basically ideal for a compiler for a language with a relatively complex type system. And with its cache pricing it's very cheap."

Es un modelo verboso, y las palabras se cobran. Artificial Analysis lo señala explícitamente sobre la verbosidad.

Muy verboso, aun así barato: V4 Flash usó 210M de tokens de salida para ejecutar el Índice de Inteligencia frente a una mediana de clase de 100M, por $72.02 en total
Muy verboso, aun así barato: V4 Flash usó 210M de tokens de salida para ejecutar el Índice de Inteligencia frente a una mediana de clase de 100M, por $72.02 en total

Quemó 210M de tokens de salida para completar el índice frente a una mediana de clase de 100M, descrito en la página del modelo como "muy verboso en comparación". Toda la ejecución solo costó $72.02, que es lo importante, pero 2.1 veces el volumen de salida mediano es el mecanismo que separa silenciosamente el precio de etiqueta de tu factura. Desgloso esa brecha con detalle en el desglose de precios.

Capacidades que simplemente están ausentes. No hay entrada de imagen documentada: sin fila de visión en la ficha de precios, sin codificador de visión en la configuración, y el trabajo multimodal de DeepSeek vive en líneas de modelo separadas. Los equipos lo rodean, como describió un usuario, manteniendo un segundo modelo a mano para visión.

Vale la pena corregir una afirmación que se ha propagado junto con esa. El mismo reporte dice que DeepSeek "no soporta búsqueda web", y eso solo es cierto en la ruta más antigua de chat-completions. La Responses API, exclusiva de Flash, sí incluye una herramienta integrada web_search del lado del servidor, junto a apply_patch. Los tipos de herramienta de búsqueda de archivos, intérprete de código, uso de computadora y MCP se ignoran todos ahí, así que el conjunto de capacidades es estrecho, pero la búsqueda web está en la lista.

Hay un caso real de facturación descontrolada registrado, y vale la pena saberlo antes de apuntar un agente a esto:

Hacker News

"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."

DeepSeek tampoco publica ningún límite de solicitudes por minuto o tokens por minuto, solo un tope de concurrencia que es a nivel de cuenta y no de clave. Combinado con un saldo prepago que puede devolver un 402 a mitad de una ejecución, eso es más un problema de monitoreo que de precio, y un buen argumento para una configuración de seguimiento adecuada.

Una queja de versionado que le pasará factura a cualquiera que cite benchmarks. Un usuario lo expresó bien: en DeepSeek ahora es simplemente deepseek-v4-flash, mientras que OpenRouter lo llama deepseek/deepseek-v4-flash-0731, así que cuando un benchmark dice "DeepSeek V4 Flash" no siempre puedes saber qué versión se ejecutó. Fija el nombre con fecha cuando anotes algo.

Ejecutar los pesos tú mismo

La licencia MIT hace un trabajo real aquí, y los reportes locales son la parte mejor documentada de la reacción. Esto es genuinamente un modelo fundacional que puedes alojar, no un LLM solo alojado.

HardwareVelocidad reportada
DGX Spark doble60 tokens/s en sesión única, 100+ agregados con concurrencia 4
Mac Studio M3 Ultra 256GB~30 tokens/s de decodificación en solicitud única
Ryzen AI MAX+ 395 (Strix Halo)32 tokens/s a ~2.88 bits por parámetro
RTX PRO 6000 96GB individual170 tokens/s reportados con un motor de plano de 2 bits

Un usuario que lo ejecuta localmente captó por qué la gente se toma la molestia, y no es la aritmética:

Hacker News

"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. Privacy is a large part of it but, I also no longer think twice about whether to send a prompt or not based on the psychology of it costing money."

En pura relación de costos, los hilos están casi unánimes en el sentido contrario. Una estimación situó una máquina Spark doble en ocho o nueve mil dólares y concluyó que "tiene poco o ningún sentido mientras los precios de la API sean lo que son. Excepto quizás por razones de privacidad." Otro usuario hizo las cuentas de electricidad y encontró que llegar a la tarifa de caché de DeepSeek era más barato que ejecutar un modelo de 36B en casa. Así que: aloja el modelo por control y privacidad, no para ahorrar dinero.

Mi veredicto, por tarea

TareaVeredictoEl factor decisivo
Resumen y revisión en masaÚsaloLa entrada con acierto de caché a $0.0028 hace trivial un trabajo por lotes antes injustificable
Programación agéntica acotadaÚsalo, con revisiónEncabeza las filas agénticas, y la ventaja de uso de herramientas sobre Pro es real
Trabajo de largo horizonte, repositorio grandeTen cuidadoLa queja más constante en todos los hilos
Cualquier cosa visualEvítaloNo hay entrada de imagen documentada, así que dirígelo a un segundo modelo
Razonamiento y memoria de una sola vezConsidera ProPro todavía gana en memoria y en búsqueda de aguja en contexto largo
Respuestas de cara al clienteNo sin supervisiónTasa de alucinación del 84%, más términos de la API que callan sobre el uso para entrenamiento

Frente al resto del campo, hay tres modelos que merecen compararse con él. Con aproximadamente la misma inteligencia, GPT-5.6 Luna cuesta dos o tres veces más y es con el que la gente combina Flash para visión, desarrollado en Flash frente a GPT-5.6. Si la precisión importa más que el precio, Kimi K3 alucina mucho menos y cuesta mucho más.

Para la opción multimodal en el mismo rango de pesos abiertos, Qwen 3.8 Max es el que hay que leer a continuación. Hay análisis prácticos de cada uno en la reseña de Qwen y la reseña de Kimi.

Dos puntos de referencia adicionales si estás trazando un eje de precios. Los precios de Claude Opus 5 marcan el extremo de frontera. Las alternativas de Mistral cubren la familia europea de pesos abiertos, y la reseña de GPT-5.6 tiene el veredicto sobre el modelo del que la mayoría de equipos realmente se están cambiando.

¿Debería alguna vez responder a un cliente?

Esta es la sección que realmente me importa, porque es mi trabajo. Y la respuesta honesta es que el modelo es el lugar equivocado donde mirar.

Empieza por dónde van los tokens. Los términos de Open Platform de pago de DeepSeek no dicen nada sobre el uso para entrenamiento, lo cual no es lo mismo que ser permisivo ni lo mismo que ser seguro. Los términos para consumidores tienen una cláusula explícita en la sección 4.3 con una opción de exclusión de "Mejorar el modelo para todos"; la sección equivalente del documento de la API se detiene antes de eso. No hay tampoco un acuerdo de procesamiento de datos publicado ni una opción de retención cero en ninguna dirección, y la política de privacidad indica que los datos se procesan y almacenan en la República Popular China bajo la ley china. Existen proveedores de retención cero, y un usuario los reportó a tres o cinco veces el precio directo, lo que borra la mayor parte del descuento.

Si algo de esto es nuevo para ti, el episodio de la política de Slack es el precedente que los lectores ya vivieron. SOC 2 y GDPR es la lista de verificación que hay que seguir antes de conectar algo de cara al cliente.

Después está la cifra del 84%. Cada equipo de soporte con el que hablo escucha un número así y hace la pregunta equivocada, que es "qué tan preciso es tu modelo". Aquí hay un cliente nuestro que planteó la pregunta correcta mucho mejor que yo. Su bot había estado confirmando con confianza que la empresa soportaba modelos de coche que no estaban en su base de datos, porque una línea de la base de conocimiento decía que soportaban todos los modelos. El modelo estaba bien. El anclaje no lo estaba.

El resumen del equipo sobre cómo lograrlo bien fue "ensayo y error al principio".

Un equipo de soporte de telemática vehicular B2B danés en Zendesk, gestionando alrededor de 200 tickets al mes y escalando hacia más de 2,000, que temía que la IA confirmara con exceso de confianza modelos de coche no soportados.

Esa es toda la lección. La alucinación en soporte suele ser un problema de anclaje y permisos disfrazado de modelo, y toda solución real vive por encima del modelo y no dentro de él.

La pila que hace que un modelo inestable sea manejable no es exótica. Recuperación sobre fuentes que realmente has verificado. Barreras de seguridad sobre lo que se le permite afirmar. Una puntuación de confianza con un umbral que alguien elegió a propósito, y una persona en todo lo que quede por debajo.

Nuestro peor fallo observado en producción fue un agente de IA narrando "ejecutando búsquedas en Zendesk" durante unos diez turnos sin llegar a tocar la API, y luego reportando archivos guardados que no existían. Nada mata la confianza en un compañero de equipo más rápido que mentir sobre lo que hizo, y ningún puntaje de benchmark lo habría detectado. Lo que lo detecta es la medición de contención después de los hechos y la revisión humana antes.

Así que si estás evaluando modelos en crudo para una cola de soporte, el orden práctico es más o menos este. Pruébalo de forma adversarial antes de confiar en algo. Construye un hábito de evaluación en lugar de una fecha de lanzamiento. Fija umbrales de confianza deliberadamente.

Después lee sobre prevención de alucinaciones antes de conectar un solo ticket, y pregúntate con honestidad la cuestión de construir versus comprar, porque montar toda esa pila tú mismo es el verdadero proyecto. El modelo es la parte barata.

Prueba eesel

Si llegaste aquí desde una hoja de cálculo comparando tarifas por token para un caso de uso de soporte, lo que te diría frente a un café es que el precio del token nunca fue la parte difícil. Conectar un modelo a tu mesa de ayuda, anclarlo en tus macros reales y tus tickets pasados, y saber qué va a decir antes de que un cliente lo vea, esa es la parte difícil, y eso es el producto.

Eso es eesel: un agente de soporte con IA que se conecta a Zendesk o a tu mesa de ayuda existente, ancla cada respuesta en tu conocimiento verificado, y te deja ejecutar simulaciones sobre tus propios tickets históricos para que veas exactamente dónde se habría equivocado antes de salir en vivo. Ves el volumen de tareas, los disparadores, y cada aprobación o rechazo por herramienta, así que "¿está alucinando?" se convierte en un número que puedes mirar en lugar de una preocupación.

Vista de Reportes de eesel AI para un agente de Zendesk, mostrando el total de tareas, eventos de activación por tipo, y el uso de aprobación o rechazo por herramienta
Vista de Reportes de eesel AI para un agente de Zendesk, mostrando el total de tareas, eventos de activación por tipo, y el uso de aprobación o rechazo por herramienta

El precio es por conversación resuelta en lugar de por asiento, lo que significa que una implementación gradual es una opción real: dirige 200 de tus 1,000 tickets mensuales y paga por 200. Hay $50 de uso gratuito para empezar, sin tarjeta requerida, y la página de precios tiene las cifras. Ejecuta una simulación sobre los tickets del mes pasado y sabrás en una hora si algo de esto vale tu tiempo. Es un uso mucho mejor de una tarde que hacer benchmarking de un dial.

Preguntas frecuentes

¿Es bueno DeepSeek V4 Flash?
Para resumir en masa, revisar código y programación agéntica en tareas bien acotadas, sí, y el costo es difícil de rebatir. Es más débil en trabajo de largo horizonte en bases de código grandes, no tiene entrada de imagen documentada, y su tasa de alucinación es el número más alto de su ficha. Mi análisis completo está en esta revisión de DeepSeek V4 Flash, y la cuestión de los niveles se trata en Flash frente a V4 Pro.
¿Cuánto cuesta DeepSeek V4 Flash?
La ficha indica $0.14 por millón de tokens de entrada, $0.0028 en un acierto de caché, y $0.28 de salida. Lo que aparece en la factura es un número distinto, porque el razonamiento está activado por defecto y se cobra a la tarifa de salida. Los detalles están en el desglose de precios, y tokens explica la unidad facturable.
¿Por qué DeepSeek V4 Flash puntúa mejor que V4 Pro?
Flash fue re-post-entrenado el 31/07/2026 y la versión Pro de la ficha de precios no lo fue, así que el nivel más barato registra actualmente mejores puntuaciones agénticas. Repaso las nueve filas y las advertencias en Flash frente a V4 Pro.
¿Puede DeepSeek V4 Flash leer imágenes?
No hay entrada de imagen documentada. La ficha de precios no tiene fila de visión y la configuración no incluye un codificador de visión, así que trátalo como solo texto y combínalo con un modelo multimodal cuando lo necesites. Flash frente a GPT-5.6 explica cómo dividen ese trabajo los equipos.
¿Es DeepSeek V4 Flash seguro para los datos de clientes?
Los términos de la API de pago no dicen nada sobre el uso para entrenamiento en lugar de ser permisivos, no hay un DPA publicado ni opción de retención cero, y los datos residen en la RPC bajo la ley china. Si hay datos de clientes involucrados, lee primero SOC 2 y GDPR y trata el cambio de política de Slack como el precedente.
¿Debería DeepSeek V4 Flash responder tickets de soporte?
No sin supervisión. Una tasa de alucinación del 84% no es un número al que dirigir clientes, aunque es manejable con anclaje y una puntuación de confianza. Consulta cómo evitar que un agente alucine.
¿Puedo ejecutar DeepSeek V4 Flash en mi propio hardware?
Sí, los pesos son MIT y pesan unos 167GB, y hay gente logrando entre 30 y 60 tokens por segundo en equipos de gama prosumer. El consenso en los hilos es que tiene sentido por privacidad más que por costo. Agentes de IA de código abierto ofrece la visión más amplia del ecosistema.
¿Cuáles son las mejores alternativas a DeepSeek V4 Flash?
Con la misma inteligencia y aproximadamente dos a tres veces el precio, GPT-5.6 Luna es la opción más cercana, y Kimi K3 es la opción de pesos abiertos centrada en precisión. Los comparo en Flash frente a Kimi K3 y Qwen 3.8 Max frente a Flash.

Share this article

Riellvriany Indriawan

Article by

Riellvriany Indriawan

Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.

Related Posts

All posts →
DeepSeek V4 Flash: precios y lo que pagarás realmente
Trending

DeepSeek V4 Flash: precios y lo que pagarás realmente

DeepSeek V4 Flash figura a $0.14 de entrada y $0.28 de salida por millón de tokens. Usuarios reales han publicado tarifas combinadas por debajo de un centavo. Esto es lo que decide cuál te toca a ti.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente
Trending

DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente

DeepSeek V4 Flash cuesta $0.14 de entrada y $0.28 de salida por millón de tokens, y supera a la propia gama alta de DeepSeek. Esto es lo que la tabla de precios no cuenta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de un gato muy largo estirado sobre un escritorio junto a un rack de servidores, con el logo de LongCat
Trending

LongCat 2.0: dentro del modelo abierto de 1,6T parámetros de Meituan

LongCat 2.0 es el modelo MoE de 1,6T parámetros de Meituan, con licencia MIT, a 0,30 dólares por millón de tokens de entrada. Leí todas las fuentes primarias para ver qué se entrega realmente.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de un gato muy largo estirándose junto a dos personas revisando una tarjeta de puntuación, con el logo de LongCat
Trending

Review de LongCat 2.0: un caballo de batalla con un bloqueo real

Evalué LongCat 2.0 en siete aspectos que realmente le importan a un comprador, usando los propios archivos de Meituan y los testimonios de quienes le hicieron pasar miles de millones de tokens. Sale bien en seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración editorial de agentes de codificación en paralelo y ventanas de terminal, que representa el panorama de alternativas a ZCode
Trending

Las 8 mejores alternativas a ZCode en 2026

ZCode es impresionante y tosco a la vez. Aquí tienes las 8 mejores alternativas a ZCode en 2026, con precios reales, contrapartidas honestas y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración editorial de una tabla de clasificación de benchmarks con una barra alta destacada, que representa a ZCode y el modelo GLM-5.2
Trending

ZCode: qué es realmente el nuevo agente de codificación con IA de Z.ai

Un análisis práctico de ZCode, la app gratuita de codificación agéntica del equipo de GLM: el modelo GLM-5.2 que hay detrás, las quejas reales de la semana de lanzamiento y quién debería usarla.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis