
Las especificaciones, una junto a la otra
Estos dos modelos salieron con tres semanas de diferencia entre sí. Ambos de laboratorios chinos, ambos con pesos publicados, y ambos con una ventana de contexto de un millón de tokens. Ahí es más o menos donde termina el parecido. Para más contexto sobre cada uno por separado, está mi reseña de Kimi K3, y también un repaso de DeepSeek V3.2, la generación de la que salió Flash.
| DeepSeek V4 Flash | Kimi K3 | |
|---|---|---|
| Lanzamiento | build 0731, 31 de julio de 2026 | 16 de julio de 2026 |
| Entrada, fallo de caché | $0.14 / 1M | $3.00 / 1M |
| Entrada, acierto de caché | $0.0028 / 1M | $0.30 / 1M |
| Salida | $0.28 / 1M | $15.00 / 1M |
| Ventana de contexto | 1M | 1.048.576 |
| Salida máxima | 384K | 131.072 por defecto, ajustable a 1.048.576 |
| Parámetros | 284B en total, 13B activos | 2.8T en total, 104B activos |
| Modalidades de entrada | Solo texto | Texto, imagen, video |
| Control de razonamiento | Sin pensar o pensando, por defecto pensando | low / high / max, nunca apagado |
| Licencia | MIT | Licencia Kimi K3, con cláusula comercial |
| Límite de concurrencia | 2.500 | Limitado por nivel de cuenta, no publicado |
| AA Intelligence Index | 50 | 57 |
| Costo por tarea | $0.03 | $0.86 |
| Velocidad de salida mediana | 113 tok/s | 35 tok/s |
| Tiempo de respuesta total | 23.36s | 73.88s |
| Alucinación en AA-Omniscience | 84% | 51% |

Hay una fila ahí que merece la pena destacar antes de seguir. La tarifa de acierto de caché de DeepSeek está en $0.0028 por millón, cien veces más barata que el ya descontado $0.30 de Kimi. El caché se activa por defecto sin que tengas que cambiar nada en tu código. Aun así, DeepSeek es explícito en que funciona con mejor esfuerzo, y las entradas se vacían "normalmente en unas horas o unos días", así que es un descuento real que no deberías modelar como algo constante.
El precio por token es el número equivocado
Aquí está la trampa de una comparación como esta. La tarifa dice que Flash es 54 veces más barato en salida. La tarifa no es tu factura.
Artificial Analysis publica una métrica que se acerca mucho más, el costo por tarea, que es el promedio ponderado de lo que realmente cuesta terminar un trabajo en su índice. En esa medida, Flash cuesta $0.03 y K3 cuesta $0.86. Sigue siendo una brecha enorme, pero de 29x y no de 54x, y la razón es que Flash consume más tokens para llegar a cualquier parte. Produjo 210M de tokens de salida al ejecutar el índice completo, frente a los 130M de K3, con ambos medidos sobre una mediana de clase de 100M. AA describe a Flash como "muy verboso". También describe a K3 como verboso. Ambos son habladores, Flash simplemente lo es más.
Ejecutar el índice completo costó $72.02 en Flash y $2.437,41 en K3. Las mismas nueve evaluaciones, el mismo trabajo. Si tienes el hábito de pensar en el gasto de IA como un costo de servicio mensual en lugar de una tarifa por token, esa proporción es la que vale la pena recordar.
Los tokens de razonamiento son lo que abre la brecha entre el precio de etiqueta y la factura, y esta es la parte que la mayoría de las comparaciones de precios se saltan. Simon Willison hizo pasar su prompt estándar del pelícano por K3 y luego publicó el recibo:
"95 input, 16,658 output = 25 cents! [...] (13,241 of those were reasoning tokens.) I think that's the most expensive pelican I've rendered through a Chinese model so far."
Noventa y cinco tokens de entrada, veinticinco centavos de salida, y el 79% de lo que pagó fue por un pensamiento que nunca leyó.

Ambos modelos facturan el razonamiento a la tarifa de salida, y en ambos el pensamiento está activado por defecto, así que esto aplica en ambos casos. Solo cuesta 54 veces más por token en uno de ellos.
Vale la pena señalar una complicación honesta aquí en lugar de fingir que la medición está zanjada. Un desarrollador que ejecutó prompts idénticos en ambos encontró que la comparación de verbosidad iba en la dirección contraria:
"It says there that "Kimi K3 (Max)" would think/reason less than than deepseek-v4-flash, and a whole bunch of other models [...] but in my experience, K3 is probably the model that thinks/reasons the longest of all of these."
Ambas cosas pueden ser ciertas a la vez. El índice de AA es una mezcla particular de tareas de evaluación cortas, y tu carga de trabajo no es esa mezcla. Lo cual es la lección real aquí: pasa tus propios prompts por ambos modelos y cuenta los tokens, porque las cifras de verbosidad publicadas no se van a trasladar limpiamente a tu caso de uso.
En el argumento del caché, sin embargo, aquí es donde Flash es difícil de superar:
"I don't understand how DeepSeek can be so cheap with their cache pricing - ~0.003 usd / 1Mtok. 100x less than Kimi K3, or similar numbers against pretty much any other decently sized model to my knowledge. I've been using it whenever possible as even longer agent sessions cost few cents."
La opción intermedia que no lo es
Este es el hallazgo que yo querría si fuera quien está comprando, y no está en la página de ningún proveedor.
Kimi lanzó los niveles de razonamiento low y high en algún momento tras el lanzamiento, así que K3 ya no es solo de máximo esfuerzo. El movimiento obvio es recurrir a low y conservar la mayor parte de la calidad de K3 por una fracción de la factura. Artificial Analysis midió esa configuración por separado, y no funciona.
Kimi K3 en low puntúa 47 en el Intelligence Index, a $0.24 por tarea. DeepSeek V4 Flash puntúa 50 a $0.03. El K3 rebajado cuesta ocho veces más que Flash y puntúa tres puntos menos. Ni siquiera es más rápido, 34 tokens por segundo frente a los 35 de K3-max, con un tiempo de respuesta total ligeramente peor.

Tampoco hay alivio de precio en ello, porque los niveles se facturan a la misma tarifa. La guía rápida de Kimi K3 es directa sobre lo que hace ese ajuste, al responder si se puede apagar el razonamiento: "No puedes, K3 siempre piensa. Si el razonamiento tarda demasiado, configura reasoning_effort en low." Es un control de latencia, no un nivel de costo. El ahorro es únicamente los tokens de razonamiento que evites.
Así que la elección es binaria. Pagar $0.03 o pagar $0.86. Así se ve eso a volumen:
Lo que factura cada uno según tu volumen
Costo por tarea de Artificial Analysis, multiplicado. Elige un número de tareas mensuales.
Una "tarea" aquí es una tarea del Artificial Analysis Intelligence Index, que es una aproximación de tu carga de trabajo, no una coincidencia exacta con ella. Úsalo para comparar las tres opciones entre sí, no para pronosticar una factura.
Dónde gana realmente cada uno
En inteligencia medida en bruto, K3 va por delante, y en la clasificación no es algo reñido. 57 frente a 50, séptima fila en general, y el modelo de pesos abiertos mejor clasificado de los 99 que rastrea Artificial Analysis. Flash queda tercero entre los de pesos abiertos, detrás de K3 y GLM-5.2.
Las propias gráficas de lanzamiento de Moonshot cuentan una historia consistente, y merece la pena leerlas con una advertencia en mente.

La advertencia es que DeepSeek no aparece en ese gráfico en absoluto. Moonshot comparó a K3 con Fable 5, GPT-5.6 Sol, Opus 4.8, GLM-5.2 y GPT-5.5, y dejó fuera al competidor de pesos abiertos más barato y serio. DeepSeek le devuelve el favor: K3 tampoco aparece en sus gráficas. Es el estado normal de las cosas con un benchmark de proveedor, y por eso el índice independiente hace la mayor parte del trabajo en este artículo.
La velocidad y el rendimiento son donde Flash gana claramente. Funciona a 113 tokens por segundo frente a los 35 de K3, primer fragmento en 1.33 segundos frente a 2.78, respuesta completa en 23.36 segundos frente a 73.88. También tiene un límite de concurrencia de 2.500. Para cualquier cosa interactiva, esa diferencia deja de ser una nota al pie y se convierte en el producto:
"Faster iterations are way better for me, I hate waiting for 5-10 minutes on small changes. I tried to use recent versions of Kimi and GLM, but they use too much thinking for no reason and are pretty slow because of it."
Y la lentitud se mantiene incluso para quienes pagan un nivel de consumidor superior:
"I'm still considering pulling the trigger on the annual subscription of Kimi for K3 but it's sometimes slower than I'd like (at least when compared to Anthropic) even on their Vivace plan"
Del lado de Flash, el informe práctico más útil que encontré ejecutó dieciséis tareas reales de trabajo a lo largo de cuatro días contra un modelo mucho más caro. El resultado debería moderar cualquier suposición de que barato significa débil:
"I benched DS4 flash and Pro vs opus 4.8 xhigh on 16 work-related tasks a month ago across 4 days. Opus 4.8 came out as a winner by 1 task only [...] But flash performed as well or better (as in being more thorough) in 13 out if 16."
Una diferencia funcional clara que anotar antes de seguir. K3 acepta entrada de imagen y video, mientras que Flash es solo texto y no documenta entrada de imagen. Si tu carga de trabajo implica capturas de pantalla, eso decide todo por sí solo, porque la entrada multimodal no es algo que se añada después. También vale la pena saber que K3 tampoco acepta una URL de imagen pública. Base64 o un id de archivo subido, nada más.
La precisión es la brecha que importa
Todo lo anterior es discutible según la carga de trabajo que tengas. Esta parte lo es menos.
AA-Omniscience mide si un modelo sabe lo que no sabe. Premia una respuesta correcta, penaliza las incorrectas dichas con confianza, y no penaliza decir "no lo sé". En ese índice, Flash puntúa −16 y K3 puntúa 18. Traducido a una tasa de alucinación, Flash inventa una respuesta el 84% de las veces que está fuera de su alcance. K3 lo hace el 51% de las veces.
Ninguna de las dos cifras es buena. Una es mucho peor. Y la alucinación a este tipo de tasa no es una manía que se resuelva con un buen prompt, es una propiedad del modelo fundacional que tienes que diseñar teniéndola en cuenta o sufrirla.
La gente que usa Flash reporta más o menos exactamente lo que predecirías a partir de una cifra así:
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
La versión más justa vino de uno de los usuarios más intensivos del modelo, que no lo está defendiendo tanto como describiendo el andamiaje que construyó para sobrevivirlo:
"It hallucinates plenty, about the same as Codex models and all other LLMs! I review all code it writes, thoroughly, check the test coverage, write tests myself, have other models/chats cross-check the work with a review skill"
Esa es la lectura honesta. Flash funciona bien cuando un humano competente revisa cada salida, y un flujo de trabajo de código ya tiene un compilador, una batería de pruebas y una revisión de código, todo interponiéndose entre el modelo y cualquier cosa que importe. El modelo barato funciona porque el andamiaje lo atrapa. Quita ese andamiaje y estás confiando en el propio juicio del modelo base, que es exactamente lo que una cifra del 84% te dice que no hagas. También es el argumento a favor de RAG sobre un LLM en crudo en cualquier contexto donde la respuesta tenga que ser correcta y no solo plausible.
Ahí es donde señalaría lo que sigo encontrándome en este trabajo. Construyo agentes de IA en eesel, y llevamos años ya poniéndolos en colas de soporte reales. El fallo nunca es que el modelo sea tonto. Es que el modelo tiene confianza. Un comprador lo expresó mejor de lo que yo podría, en una llamada sobre enrutar tickets a la IA:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Era un responsable de CX en una marca de suplementos DTC, gestionando alrededor de 7.000 tickets al mes en Gorgias y Shopify. No ganamos ese acuerdo y la objeción anterior es la razón. Fíjate en que nunca preguntó qué puntuación tenía el modelo. Preguntó si se apartaría cuando no supiera. Una tasa de alucinación de una clasificación no responde a esa pregunta, y tampoco lo hará la página de ningún proveedor.
Para ser justos, también hemos visto a nuestros propios agentes hacer lo mismo, equivocarse con confianza. El peor patrón que hemos registrado en producción fue un agente narrando "ejecutando búsquedas en Zendesk" durante unos diez turnos sin llegar a llamar a la API ni una sola vez. Nada mata la confianza en un compañero de equipo más rápido que mentir sobre lo que hizo, por lo que ahora simulamos cada lanzamiento contra el historial de tickets real de un cliente antes de que toque una cola en vivo.
"Pesos abiertos" significa dos cosas muy distintas aquí
Ambos modelos publican sus pesos. Pero la expresión hace un trabajo muy distinto en cada caso.
Flash tiene 284B en total con 13B activos, alrededor de 167GB de pesos, bajo una simple licencia MIT, y existen 57 cuantizaciones hechas por la comunidad. Eso lo sitúa en un territorio diferente al de la mayoría de los agentes de código abierto de este nivel de calidad, y es lo bastante pequeño como para que el ajuste fino sea una opción real y no un experimento mental.
Los pesos de K3 se subieron a Hugging Face el 27 de julio, exactamente la fecha que Moonshot había prometido, y el índice de safetensors confirma 2.779.931.837.184 parámetros al margen del comunicado de prensa. También son 1.561 GB repartidos en 96 fragmentos, con 104B de parámetros activos.

La persona que calculó ese tamaño añadió la parte que importa:
"Most importantly, we now know that the model has 104B active parameters, which is quite a lot and will make it difficult to self-host efficiently."
La línea práctica entre estos dos quedó bastante clara en el hilo de lanzamiento de V4 Flash:
"And, at least flash can be ran "at home" with <10k in hardware, which isn't really possible / feasible with glm/k3 larger models."
Y las cuentas de autoalojar K3 para ahorrar dinero no sobreviven al contacto con la hoja de cálculo:
"At 5 tok/second, you're talking about around $195 worth of output tokens per month. There is no way I can run a usable K3 model for $195 a month of capex, opex, or any-kind-of-ex."
Las licencias también difieren, y esta tiene dientes. Flash es MIT, punto. K3 se distribuye bajo una Licencia Kimi K3 personalizada con dos cláusulas adicionales. Los operadores de servicios gestionados con más de $20M en ingresos en doce meses necesitan un acuerdo aparte, y los productos con más de 100M de usuarios mensuales o $20M de ingresos mensuales tienen que mostrar "Kimi K3" en la interfaz. La mayoría de los lectores nunca va a tropezar con ninguna de las dos. Pero si estás construyendo un producto encima, léela antes de asumir una libertad estilo MIT, y factorízala en cualquier decisión de construir versus comprar que estés tomando.
Qué hace cada proveedor con lo que envías
Si el texto que envías es tuyo, sáltate esta parte. Si es texto de tus clientes, esta es la sección que decide todo, y los dos proveedores están en lugares bastante distintos.
Moonshot publica una postura, y es permisiva por defecto. Sus términos de servicio, actualizados por última vez el 27 de mayo de 2026, dicen que un cliente que quiera límites en el uso para entrenamiento "puede contactar a Moonshot AI para discutir acuerdos empresariales disponibles o contratos escritos separados", y luego esto: "A menos que se acuerde expresamente por escrito lo contrario, el Contenido del Cliente puede usarse para los fines antes mencionados." Suficientemente claro, y la salida de emergencia es un contrato que tienes que ir a negociar tú mismo. Los datos residen en Singapur.
DeepSeek es el caso más interesante, ya que publica un acuerdo separado para la API de pago y ese acuerdo no dice absolutamente nada. Los términos de Open Platform, vigentes desde el 29 de abril de 2026, incluyen una sección de "Entradas y Salidas" que llega hasta el §4.2 y ahí se detiene. Los Términos de Uso para consumidores tienen una cláusula de entrenamiento en el §4.3 de la misma sección numerada, y el documento de la API simplemente la omite. Esa cláusula para consumidores es explícita en que DeepSeek "puede, en medida mínima, usar las Entradas y Salidas para proporcionar, mantener, operar, desarrollar o mejorar los Servicios", con un interruptor de exclusión etiquetado "Mejorar el modelo para todos".
Así que la afirmación precisa sobre la API de DeepSeek es que guarda silencio, no que sea segura. Los términos de la API se describen a sí mismos como un acuerdo específico bajo los Términos de Uso generales, y un término específico prevalece solo donde hay conflicto. El silencio no es un conflicto. Ninguno de los dos documentos publica una opción de exclusión para desarrolladores, un acuerdo de tratamiento de datos ni una opción de retención cero, y los datos almacenados residen en la República Popular China bajo la ley de la RPC.
En la práctica, eso significa que ninguno de los dos es una opción de primera parte lista para usar con datos regulados o que identifiquen a clientes sin que antes tengas una conversación con un comercial, lo cual, para dos APIs de autoservicio, es una fricción real. Es el mismo tipo de problema que enfrentaron los equipos con el cambio en la política de IA de Slack, y si estás sujeto a SOC 2 o GDPR, es lo primero que preguntará tu revisor. Enrutar a través de un proveedor que publique términos de retención cero es el rodeo habitual, y cuesta más que las tarifas de arriba.
Entonces, ¿cuál deberías elegir?
Yo enmarcaría esta decisión en torno a una sola pregunta, y no es el presupuesto.
Elige DeepSeek V4 Flash cuando un humano o una máquina revisa la salida antes de que cuente. Código con pruebas y revisión, clasificación por lotes, redacción masiva, herramientas internas, cualquier cosa que puedas volver a ejecutar barato cuando sale mal. A $0.03 por tarea con una tarifa de acierto de caché de $0.0028, está cerca de ser gratis, a volúmenes en los que K3 se convierte en una línea de gasto que alguien cuestiona. También es el modelo más rápido por un factor de tres, algo que importa más de lo que la gente espera en trabajo interactivo. Este es también el que elegir cuando autoalojar es un requisito real y no solo una idea agradable.
Elige Kimi K3 con esfuerzo máximo cuando la salida es el entregable y nadie la revisa línea por línea. Ejecuciones de agentes de largo alcance, síntesis de investigación, situaciones donde equivocarse es caro y de todos modos no lo vas a detectar. Una tasa de alucinación del 51% sigue sin ser un número sobre el que yo construiría flujos de trabajo sin supervisión, pero es una categoría de riesgo distinta a un 84%. También es el único de los dos que lee imágenes.
Evita Kimi K3 con esfuerzo low. Cuesta ocho veces más que Flash y puntúa más bajo. Esta opción existe para acortar tu espera, no tu factura. Si K3-max se sale del presupuesto, la respuesta es un modelo diferente, no un K3 más silencioso, y el resumen de alternativas a Kimi K3 es el lugar por donde empezar.
Una última cosa vale la pena decir, porque "laboratorio chino" y "barato" se han fundido en la misma palabra en gran parte de la cobertura mediática, y para K3 no lo son. Su $0.86 por tarea queda a un paso de la frontera occidental, y alguien hizo esas cuentas en el hilo de lanzamiento:
"According to artificialanalysis, cost per task is $0.94, which is almost the same as $1.04 of gpt 5.6 sol max [...] The model certainly sounds extremely impressive for something not from openai/antrophic, but the price makes it a mediocre product."
La cifra de K3 se ha estabilizado desde entonces en $0.86, así que la brecha es algo más amplia de lo que él tenía, pero la forma de su argumento sigue siendo válida. Claude Sonnet 5 está exactamente en la misma tarifa de $3/$15, y GPT-5.6 Sol está en el mismo vecindario por tarea. El extremo barato de este mercado es Flash y sus semejantes. No los buques insignia de 2.8T.
Para el resto del campo, mi comparación de Qwen 3.8 Max cubre al tercer laboratorio de esta carrera, mientras que el artículo sobre V4 Pro explica por qué el nivel barato de DeepSeek está superando actualmente al caro.
Poner a cualquiera de los dos frente a un cliente
Todo lo anterior es una decisión de desarrollador. Pero si llegaste aquí preguntándote si alguno de estos puede responder tickets de soporte, la respuesta honesta es que el modelo es la parte menos importante de ese sistema.
Digo esto como alguien que construye los agentes de IA en eesel. Un modelo en crudo con una tasa de alucinación del 84% y uno con el 51% fallan de la misma manera en una cola de soporte: responden cosas que no deberían haber respondido. Lo que lo arregla no es un mejor modelo base. Es hacer grounding de cada respuesta en tu conocimiento verificado, poner un filtro con una puntuación de confianza para que la cosa se calle por debajo del umbral, y saber qué va a pasar antes de que pase.
Esa es la diferencia entre un agente de soporte con IA y una caja de chat conectada a una clave de API. También es gran parte de por qué construirlo tú mismo toma más tiempo del que nadie presupuesta.
Esa última parte es la que vale la pena tomar prestada la uses o no. eesel ejecuta simulaciones contra tus tickets pasados reales antes de que nada salga en vivo, así que lo que ves es la precisión real sobre tus propios datos, no la de una clasificación, y despliegas solo cuando supera tu umbral. Enrutar una parte primero también funciona. Gestiona 1.000 tickets al mes, envía 200 de ellos a la IA, pagas por 200. La facturación es de 40 centavos por ticket resuelto, no hay tarifas por asiento, y nunca se te cobra por los tickets que gestionan tus humanos. Hay $50 de uso gratis para empezar, y no se necesita tarjeta de crédito.

Se conecta con Zendesk y otras mesas de ayuda, y lee de donde sea que ya vivan tus respuestas, ya sea Confluence, un espacio de Notion, o simplemente tu centro de ayuda público.
Elige el modelo que prefieras por debajo. Solo que no dejes que una puntuación de benchmark sea la razón por la que confías en él con un cliente.
Preguntas frecuentes
¿Qué es más barato, DeepSeek V4 Flash o Kimi K3?
¿Es Kimi K3 mejor que DeepSeek V4 Flash?
¿Puedo ejecutar DeepSeek V4 Flash o Kimi K3 en local?
¿Debería usar DeepSeek V4 Flash para atención al cliente?
¿Cuál es el precio de la API de Kimi K3 para un equipo pequeño?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








