
¿Qué es Kimi K3?
Kimi K3 es el modelo insignia de Moonshot AI, el laboratorio chino detrás del anterior modelo de pesos abiertos Kimi K2. Moonshot describe a K3 como "el primer modelo abierto de clase 3T del mundo, diseñado para una inteligencia de frontera en programación de largo horizonte, trabajo de conocimiento y razonamiento".
Lo que destaca es que Moonshot es inusualmente honesto sobre dónde se sitúa K3. El blog de lanzamiento dice sin rodeos que "si bien su rendimiento general todavía queda por detrás de los modelos propietarios más potentes, Claude Fable 5 y GPT 5.6 Sol, Kimi K3 demostró un rendimiento de nivel de frontera en toda nuestra suite de evaluación, superando de forma consistente a los demás modelos probados". Pocas veces se ve a un laboratorio empezar por lo que su modelo no es, y eso hace que el resto de sus afirmaciones sea más fácil de creer.
Hay una trampa que conviene señalar de entrada. Moonshot llama a esto un modelo abierto, pero en el lanzamiento solo estaba disponible por API. El blog oficial dice que "los pesos completos del modelo se publicarán antes del 27 de julio de 2026", y en la semana de lanzamiento el repositorio de HuggingFace todavía devolvía un error 404. Así que si tu plan era alojarlo tú mismo desde el primer día, ese plan tendrá que esperar un par de semanas.
Cómo funciona realmente Kimi K3
Si ya has construido con estos modelos antes, la parte interesante de K3 no es el número de parámetros, sino cómo llegó Moonshot hasta ahí sin que el coste se disparara. Aquí está el flujo completo en una sola imagen.

Unas cuantas piezas están haciendo el trabajo pesado:
- Una mezcla de expertos muy dispersa. K3 tiene 2,8 billones de parámetros en total, pero solo "activa de forma efectiva 16 de los 896 expertos" por token, usando lo que Moonshot llama un framework Stable LatentMoE. El enrutamiento disperso es cómo se consigue un modelo enorme que sigue siendo asequible de ejecutar: solo una pequeña porción se activa para cada token.
- Kimi Delta Attention (KDA). Un mecanismo de atención lineal híbrido que mantiene la ventana de contexto de 1M de tokens práctica en lugar de ruinosamente cara.
- Attention Residuals (AttnRes). Un reemplazo directo para las conexiones residuales estándar, que Moonshot publicó como código abierto por separado en github.com/MoonshotAI/Attention-Residuals.
- Razonamiento siempre activo. K3 siempre "piensa", no hay un modo sin razonamiento más barato. El esfuerzo se configura con un campo
reasoning_effortque por ahora solo aceptamax, con niveles más bajos "próximamente".
En conjunto, Moonshot afirma "una mejora aproximada del 2,5x en la eficiencia de escalado general en comparación con Kimi K2". Esa es la verdadera historia aquí: no solo más grande, sino mucho más resultado por unidad de cómputo de entrenamiento. Un vacío honesto: el informe técnico completo y el número exacto de parámetros activos todavía no se han publicado, así que parte del cómo sigue siendo una promesa.
Cómo puntúa Kimi K3 en los benchmarks
Aquí es donde K3 se gana la etiqueta de "frontera". Moonshot publicó gráficos comparativos directos frente a Fable 5, GPT-5.6 Sol, Opus 4.8 y GPT-5.5, y las pruebas independientes han empezado a corroborarlos.

El patrón es constante. K3 suele quedar un escalón por detrás de Fable 5 y GPT-5.6 Sol, pero cómodamente por delante del nivel insignia anterior. Algunas lecturas concretas de los gráficos de Moonshot:
- Tareas agénticas web (BrowseComp): K3 lidera con 91,2, por delante de GPT-5.6 Sol (90,4) y Fable 5 (88,0).
- Automation Bench: K3 en primer lugar con 30,8, superando por poco a GPT-5.6 Sol (29,7) y Fable 5 (29,1).
- SWE Marathon (programación de largo horizonte): K3 encabeza la tabla con 42,0, por encima de Opus 4.8 (40,0) y GPT-5.6 Sol (39,0).
- GDPval-AA v2 (trabajo de conocimiento): aquí cae al tercer puesto con 1668, por detrás de Fable 5 (1760) y GPT-5.6 Sol (1748).
Las pruebas independientes cuentan la misma historia. En Artificial Analysis, K3 obtiene un Intelligence Index de 57, en el puesto #4 de 189 modelos, y en su evaluación privada de trabajo de conocimiento de largo horizonte, "en su mayoría supera a Claude Opus 4.8 max y GPT-5.5 high, mientras pierde frente a Claude Fable 5 y GPT-5.6 Sol". La velocidad de salida es más ordinaria, unos ~62 tokens por segundo. Mi valoración: trata a K3 como un número dos sólido y fiable, no como un matagigantes, y lee cualquier titular de "supera a Opus 4.8" como algo específico de la tarea, porque en muchas tareas eso es exactamente lo que hace.
Qué cambió de Kimi K2 a K3
Si conocías a Kimi como el modelo chino barato y capaz, K3 reescribe dos de esos supuestos. Es mucho más grande y mucho más eficiente por unidad de cómputo, pero también ha dejado de ser barato.

Esa fila del precio es la que cambió toda la narrativa. "Kimi es el matagigantes ultrabarato" era una historia de la era K2. Con K3, Moonshot subió el precio a territorio insignia y está apostando a que la inteligencia lo justifica.
Precios de Kimi K3
Pongamos las cifras reales sobre la mesa, porque "modelo abierto asequible" ya no describe lo que realmente vas a pagar. El precio oficial de la API de K3 es refrescantemente simple: un modelo, un precio, fijo en toda la ventana de contexto.
| Modelo | Unidad | Entrada (acierto de caché) | Entrada (fallo de caché) | Salida | Ventana de contexto |
|---|---|---|---|---|---|
kimi-k3 | 1M tokens | $0.30 | $3.00 | $15.00 | 1,048,576 (1M) |
Hay dos cosas que me gustan aquí. No hay ningún nivel premium para prompts largos, la ventana de 1M tiene el mismo precio de principio a fin, a diferencia de algunos rivales que cobran más al superar un umbral de tokens. Y el descuento por almacenamiento en caché de contexto es real: un acierto de caché baja la entrada a $0.30/M, un ahorro del 90%. Para trabajo con documentos largos o agentes de largo horizonte donde la mayor parte de la entrada es un contexto estable y cacheado, ahí es donde K3 se vuelve genuinamente competitivo.
Si usas la aplicación para consumidores en lugar de la API, Kimi cobra cuatro niveles de suscripción, con nombres de tempos musicales, además de un plan gratuito:
| Nivel | Mensual | Anual (por mes) | Incluye destacado |
|---|---|---|---|
| Gratis | $0 | - | Chat básico |
| Moderato | $19 | $15 | Deep Research, Docs/Sheets/Slides, acceso a Kimi Code |
| Allegretto | $39 | $31 | 2x créditos de agente, 5x créditos de Kimi Code |
| Allegro | $99 | $79 | 5x créditos de agente, agentes paralelos Swarm |
| Vivace | $199 | $159 | 10x créditos de agente, concurrencia Swarm máxima |
Fuente: precios de membresía de Kimi. Vale la pena saber que esa página lleva un banner diciendo que se acercan nuevos planes y que los beneficios de Kimi chat y Kimi Code se dividirán en productos separados, así que esta escala de precios podría verse diferente pronto.
Entonces, ¿cómo se compara realmente 3 $ / 15 $? El único contraste sólido y de primera parte es DeepSeek, cuyo V4 Flash cuesta 0,14 $ / 0,28 $ por millón, aproximadamente 21 veces más barato en salida que K3. DeepSeek sigue siendo la verdadera opción de frontera económica; K3 ya no compite en ese eje. La lectura de la comunidad en la semana de lanzamiento fue más directa, como lo expresó alguien en Hacker News: el cambio va de "es totalmente barato" a un modelo que cuesta más o menos lo mismo que el nivel Sonnet de Claude. La ventaja de precio de K3 no está en la tarifa por token del titular, sino en la ventana fija de 1M más ese descuento del 90% por caché.
Lo que la gente piensa de verdad
La semana de lanzamiento de un modelo de frontera abierto es ruidosa, y la reacción a K3 se dividió claramente entre el entusiasmo por su capacidad y el escepticismo sobre el coste. La señal más útil vino de personas que realmente lo pusieron a prueba en trabajo real.
Las opiniones sobre la paridad en programación fueron el elogio más contundente:
"Llevo unas horas jugando con él, y creo que es un modelo increíble. No estoy seguro de poder notar la diferencia entre este y Fable en una prueba a ciegas. La cuota del plan Kimi Coding de 100 $ parece alinearse más o menos con lo que obtengo del plan de Anthropic de 200 $ cuando uso principalmente Fable."
También hay un momento genuinamente emotivo sobre un modelo abierto midiéndose de tú a tú con los laboratorios cerrados:
"¡Kimi K3 ha sido lanzado oficialmente! Miren este juego de vóxeles creado con este prompt básico: 'Voxel star wars pod-racers run'. ¡Los modelos chinos han llenado el vacío! Estamos entrando en una nueva fase de la IA."
El hype previo al lanzamiento había puesto el listón todavía más alto:
"K3 es un animal diferente. Los rumores dicen que Kimi K3 es un modelo mucho más grande, a la par de Claude Opus 4.7."
Y el bando más calmado lo situó justo donde lo hacen los números, un poco por debajo de la cima absoluta:
"Mmm, Fable en realidad solo salió hace 2 semanas, y GPT-5.6 Sol hace solo 1 semana. Sí, Kimi K3 parece quedar un poco por debajo de ambos, pero por encima de todos los demás modelos. Así que yo diría que ahora va unas semanas por detrás, no meses..."
La mayor queja no era la calidad, era el coste, además de una queja recurrente de que K3 quema más tokens que Fable para terminar la misma tarea. Esa cuestión de eficiencia de tokens es la que realmente decide tu factura, y vale la pena seguirla de cerca a medida que maduren las pruebas independientes.
Qué puede construir Kimi K3
La presentación de lanzamiento es genuinamente divertida, y es la demostración más clara de la programación de largo horizonte que Moonshot está vendiendo. En una única ejecución autónoma de 48 horas, K3 diseñó un chip (Nangate 45nm, 4mm², simulado a más de 8.700 tokens por segundo de decodificación). También construyó "MiniTriton", un compilador de GPU al estilo Triton con su propia IR, igualando o superando a torch.compile en algunas cargas de trabajo. Y generó juegos 3D jugables a partir de prompts individuales:

La reacción de la comunidad al compilador de GPU resumió el ambiente, a partes iguales asombro y "enséñame los recibos":
"¿Alguien vio en la entrada del blog que fue capaz de programar un compilador de GPU entero desde cero? Parece que incluso superó a triton en algunos kernels de GPU. Eso me parece una locura. Me pregunto si abrirán esto como código abierto y mostrarán cuántos tokens costó."
Demostraciones como estas son reales, y también son las ejecuciones de mejor caso, muy asistidas, que cualquier laboratorio muestra en su lanzamiento. La brecha entre "lo hizo una vez en un sandbox" y "lo hace de forma fiable para mi caso de uso" es todo el juego, lo que me lleva a la parte que más me importa.
Una puntuación de benchmark no es un agente de soporte
Esto es lo que cada entrada de lanzamiento de modelo pasa por alto, y lo que importa si llegaste aquí intentando elegir un modelo para atención al cliente. Un 57 en el Intelligence Index te dice que el motor en bruto es potente. No te dice nada sobre si responderá de forma segura a tus clientes.

Construyo agentes de IA en eesel, y lo que aprendimos por las malas es que la calidad del modelo es quizás un tercio del problema. Hemos visto bots que suenan seguros dar respuestas incorrectas sin darse cuenta, que es exactamente por qué ahora simulamos cada implementación contra los tickets históricos de una empresa antes de que hable con un cliente. Una clave de API de K3 en bruto no te da nada de eso. Para pasar de un gran modelo a un compañero de equipo en el que confiarías en la cola, todavía necesitas entrenarlo con tu base de conocimiento, envolverlo en un enrutamiento que escale cuando no está seguro, y ponerlo donde tu equipo ya trabaja. Esa es la brecha, y es la misma brecha sea el modelo subyacente K3, Claude Opus, o cualquier otro.
Prueba eesel
Si estás leyendo un análisis de Kimi K3 porque quieres mejor IA en tu cola de soporte, el modelo es la parte fácil. eesel es la capa que convierte un modelo de frontera en un agente de soporte real: se entrena con tu centro de ayuda y tickets pasados, redacta o resuelve por completo las respuestas dentro de tu helpdesk actual y, de forma crucial, te permite simular todo el proceso contra tu historial de tickets real para que veas la tasa de resolución y el coste antes de que salga en vivo.

Como eesel es agnóstico respecto al modelo, puedes cabalgar la frontera: ejecutar el modelo líder que sea mejor este mes, sin reescribir prompts ni cuidar una API en bruto. Y el precio está pensado para la economía del soporte: basado en uso, sin cuotas por asiento, así que un mes ajetreado no te penaliza por tener un equipo más grande. Puedes probar eesel gratis y simularlo con tus propios tickets en unos minutos.
Preguntas frecuentes
¿Qué es Kimi K3?
¿Cuánto cuesta Kimi K3?
¿Kimi K3 es de código abierto?
¿Cómo se compara Kimi K3 con Claude Fable 5 y GPT-5.6?
¿Puedo usar Kimi K3 para soporte al cliente?
¿Qué puede construir realmente Kimi K3?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







