Análisis de Kimi K3: el modelo de frontera abierto de Moonshot, puesto a prueba

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición July 21, 2026

Verificado por expertos
Ilustración editorial de un modelo de lenguaje grande razonando sobre un largo flujo de documentos

¿Qué es Kimi K3?

Kimi K3 es el modelo insignia de Moonshot AI, el laboratorio chino detrás del anterior modelo de pesos abiertos Kimi K2. Moonshot describe a K3 como "el primer modelo abierto de clase 3T del mundo, diseñado para una inteligencia de frontera en programación de largo horizonte, trabajo de conocimiento y razonamiento".

Lo que destaca es que Moonshot es inusualmente honesto sobre dónde se sitúa K3. El blog de lanzamiento dice sin rodeos que "si bien su rendimiento general todavía queda por detrás de los modelos propietarios más potentes, Claude Fable 5 y GPT 5.6 Sol, Kimi K3 demostró un rendimiento de nivel de frontera en toda nuestra suite de evaluación, superando de forma consistente a los demás modelos probados". Pocas veces se ve a un laboratorio empezar por lo que su modelo no es, y eso hace que el resto de sus afirmaciones sea más fácil de creer.

Hay una trampa que conviene señalar de entrada. Moonshot llama a esto un modelo abierto, pero en el lanzamiento solo estaba disponible por API. El blog oficial dice que "los pesos completos del modelo se publicarán antes del 27 de julio de 2026", y en la semana de lanzamiento el repositorio de HuggingFace todavía devolvía un error 404. Así que si tu plan era alojarlo tú mismo desde el primer día, ese plan tendrá que esperar un par de semanas.

Cómo funciona realmente Kimi K3

Si ya has construido con estos modelos antes, la parte interesante de K3 no es el número de parámetros, sino cómo llegó Moonshot hasta ahí sin que el coste se disparara. Aquí está el flujo completo en una sola imagen.

Cómo funciona Kimi K3: la entrada de texto e imagen alimenta un enrutador Stable LatentMoE que elige 16 de 896 expertos, pasando por Kimi Delta Attention y razonamiento siempre activo hasta llegar a una respuesta
Cómo funciona Kimi K3: la entrada de texto e imagen alimenta un enrutador Stable LatentMoE que elige 16 de 896 expertos, pasando por Kimi Delta Attention y razonamiento siempre activo hasta llegar a una respuesta

Unas cuantas piezas están haciendo el trabajo pesado:

  • Una mezcla de expertos muy dispersa. K3 tiene 2,8 billones de parámetros en total, pero solo "activa de forma efectiva 16 de los 896 expertos" por token, usando lo que Moonshot llama un framework Stable LatentMoE. El enrutamiento disperso es cómo se consigue un modelo enorme que sigue siendo asequible de ejecutar: solo una pequeña porción se activa para cada token.
  • Kimi Delta Attention (KDA). Un mecanismo de atención lineal híbrido que mantiene la ventana de contexto de 1M de tokens práctica en lugar de ruinosamente cara.
  • Attention Residuals (AttnRes). Un reemplazo directo para las conexiones residuales estándar, que Moonshot publicó como código abierto por separado en github.com/MoonshotAI/Attention-Residuals.
  • Razonamiento siempre activo. K3 siempre "piensa", no hay un modo sin razonamiento más barato. El esfuerzo se configura con un campo reasoning_effort que por ahora solo acepta max, con niveles más bajos "próximamente".

En conjunto, Moonshot afirma "una mejora aproximada del 2,5x en la eficiencia de escalado general en comparación con Kimi K2". Esa es la verdadera historia aquí: no solo más grande, sino mucho más resultado por unidad de cómputo de entrenamiento. Un vacío honesto: el informe técnico completo y el número exacto de parámetros activos todavía no se han publicado, así que parte del cómo sigue siendo una promesa.

Cómo puntúa Kimi K3 en los benchmarks

Aquí es donde K3 se gana la etiqueta de "frontera". Moonshot publicó gráficos comparativos directos frente a Fable 5, GPT-5.6 Sol, Opus 4.8 y GPT-5.5, y las pruebas independientes han empezado a corroborarlos.

Gráficos de benchmarks de Kimi K3 de Moonshot en agentes generales y agentes visuales, con K3 destacado, tomados del blog de lanzamiento de Moonshot
Gráficos de benchmarks de Kimi K3 de Moonshot en agentes generales y agentes visuales, con K3 destacado, tomados del blog de lanzamiento de Moonshot

El patrón es constante. K3 suele quedar un escalón por detrás de Fable 5 y GPT-5.6 Sol, pero cómodamente por delante del nivel insignia anterior. Algunas lecturas concretas de los gráficos de Moonshot:

  • Tareas agénticas web (BrowseComp): K3 lidera con 91,2, por delante de GPT-5.6 Sol (90,4) y Fable 5 (88,0).
  • Automation Bench: K3 en primer lugar con 30,8, superando por poco a GPT-5.6 Sol (29,7) y Fable 5 (29,1).
  • SWE Marathon (programación de largo horizonte): K3 encabeza la tabla con 42,0, por encima de Opus 4.8 (40,0) y GPT-5.6 Sol (39,0).
  • GDPval-AA v2 (trabajo de conocimiento): aquí cae al tercer puesto con 1668, por detrás de Fable 5 (1760) y GPT-5.6 Sol (1748).

Las pruebas independientes cuentan la misma historia. En Artificial Analysis, K3 obtiene un Intelligence Index de 57, en el puesto #4 de 189 modelos, y en su evaluación privada de trabajo de conocimiento de largo horizonte, "en su mayoría supera a Claude Opus 4.8 max y GPT-5.5 high, mientras pierde frente a Claude Fable 5 y GPT-5.6 Sol". La velocidad de salida es más ordinaria, unos ~62 tokens por segundo. Mi valoración: trata a K3 como un número dos sólido y fiable, no como un matagigantes, y lee cualquier titular de "supera a Opus 4.8" como algo específico de la tarea, porque en muchas tareas eso es exactamente lo que hace.

Qué cambió de Kimi K2 a K3

Si conocías a Kimi como el modelo chino barato y capaz, K3 reescribe dos de esos supuestos. Es mucho más grande y mucho más eficiente por unidad de cómputo, pero también ha dejado de ser barato.

Qué cambió de Kimi K2 a K3: el tamaño pasó de 1 billón a 2,8 billones de parámetros, una eficiencia de escalado 2,5 veces mejor, el precio pasó de ultrabarato a un nivel premium de 3 $/15 $, y los pesos abiertos ahora llegan semanas después del lanzamiento
Qué cambió de Kimi K2 a K3: el tamaño pasó de 1 billón a 2,8 billones de parámetros, una eficiencia de escalado 2,5 veces mejor, el precio pasó de ultrabarato a un nivel premium de 3 $/15 $, y los pesos abiertos ahora llegan semanas después del lanzamiento

Esa fila del precio es la que cambió toda la narrativa. "Kimi es el matagigantes ultrabarato" era una historia de la era K2. Con K3, Moonshot subió el precio a territorio insignia y está apostando a que la inteligencia lo justifica.

Precios de Kimi K3

Pongamos las cifras reales sobre la mesa, porque "modelo abierto asequible" ya no describe lo que realmente vas a pagar. El precio oficial de la API de K3 es refrescantemente simple: un modelo, un precio, fijo en toda la ventana de contexto.

ModeloUnidadEntrada (acierto de caché)Entrada (fallo de caché)SalidaVentana de contexto
kimi-k31M tokens$0.30$3.00$15.001,048,576 (1M)

Hay dos cosas que me gustan aquí. No hay ningún nivel premium para prompts largos, la ventana de 1M tiene el mismo precio de principio a fin, a diferencia de algunos rivales que cobran más al superar un umbral de tokens. Y el descuento por almacenamiento en caché de contexto es real: un acierto de caché baja la entrada a $0.30/M, un ahorro del 90%. Para trabajo con documentos largos o agentes de largo horizonte donde la mayor parte de la entrada es un contexto estable y cacheado, ahí es donde K3 se vuelve genuinamente competitivo.

Si usas la aplicación para consumidores en lugar de la API, Kimi cobra cuatro niveles de suscripción, con nombres de tempos musicales, además de un plan gratuito:

NivelMensualAnual (por mes)Incluye destacado
Gratis$0-Chat básico
Moderato$19$15Deep Research, Docs/Sheets/Slides, acceso a Kimi Code
Allegretto$39$312x créditos de agente, 5x créditos de Kimi Code
Allegro$99$795x créditos de agente, agentes paralelos Swarm
Vivace$199$15910x créditos de agente, concurrencia Swarm máxima

Fuente: precios de membresía de Kimi. Vale la pena saber que esa página lleva un banner diciendo que se acercan nuevos planes y que los beneficios de Kimi chat y Kimi Code se dividirán en productos separados, así que esta escala de precios podría verse diferente pronto.

Entonces, ¿cómo se compara realmente 3 $ / 15 $? El único contraste sólido y de primera parte es DeepSeek, cuyo V4 Flash cuesta 0,14 $ / 0,28 $ por millón, aproximadamente 21 veces más barato en salida que K3. DeepSeek sigue siendo la verdadera opción de frontera económica; K3 ya no compite en ese eje. La lectura de la comunidad en la semana de lanzamiento fue más directa, como lo expresó alguien en Hacker News: el cambio va de "es totalmente barato" a un modelo que cuesta más o menos lo mismo que el nivel Sonnet de Claude. La ventaja de precio de K3 no está en la tarifa por token del titular, sino en la ventana fija de 1M más ese descuento del 90% por caché.

Lo que la gente piensa de verdad

La semana de lanzamiento de un modelo de frontera abierto es ruidosa, y la reacción a K3 se dividió claramente entre el entusiasmo por su capacidad y el escepticismo sobre el coste. La señal más útil vino de personas que realmente lo pusieron a prueba en trabajo real.

Las opiniones sobre la paridad en programación fueron el elogio más contundente:

Hacker News

"Llevo unas horas jugando con él, y creo que es un modelo increíble. No estoy seguro de poder notar la diferencia entre este y Fable en una prueba a ciegas. La cuota del plan Kimi Coding de 100 $ parece alinearse más o menos con lo que obtengo del plan de Anthropic de 200 $ cuando uso principalmente Fable."

También hay un momento genuinamente emotivo sobre un modelo abierto midiéndose de tú a tú con los laboratorios cerrados:

LinkedIn

"¡Kimi K3 ha sido lanzado oficialmente! Miren este juego de vóxeles creado con este prompt básico: 'Voxel star wars pod-racers run'. ¡Los modelos chinos han llenado el vacío! Estamos entrando en una nueva fase de la IA."

El hype previo al lanzamiento había puesto el listón todavía más alto:

"K3 es un animal diferente. Los rumores dicen que Kimi K3 es un modelo mucho más grande, a la par de Claude Opus 4.7."

Y el bando más calmado lo situó justo donde lo hacen los números, un poco por debajo de la cima absoluta:

Hacker News

"Mmm, Fable en realidad solo salió hace 2 semanas, y GPT-5.6 Sol hace solo 1 semana. Sí, Kimi K3 parece quedar un poco por debajo de ambos, pero por encima de todos los demás modelos. Así que yo diría que ahora va unas semanas por detrás, no meses..."

La mayor queja no era la calidad, era el coste, además de una queja recurrente de que K3 quema más tokens que Fable para terminar la misma tarea. Esa cuestión de eficiencia de tokens es la que realmente decide tu factura, y vale la pena seguirla de cerca a medida que maduren las pruebas independientes.

Qué puede construir Kimi K3

La presentación de lanzamiento es genuinamente divertida, y es la demostración más clara de la programación de largo horizonte que Moonshot está vendiendo. En una única ejecución autónoma de 48 horas, K3 diseñó un chip (Nangate 45nm, 4mm², simulado a más de 8.700 tokens por segundo de decodificación). También construyó "MiniTriton", un compilador de GPU al estilo Triton con su propia IR, igualando o superando a torch.compile en algunas cargas de trabajo. Y generó juegos 3D jugables a partir de prompts individuales:

Un juego 3D de mundo abierto generado por Kimi K3 a partir de un solo prompt, mostrando a un jinete a caballo en un paisaje otoñal, tomado del blog de Kimi K3 de Moonshot
Un juego 3D de mundo abierto generado por Kimi K3 a partir de un solo prompt, mostrando a un jinete a caballo en un paisaje otoñal, tomado del blog de Kimi K3 de Moonshot

La reacción de la comunidad al compilador de GPU resumió el ambiente, a partes iguales asombro y "enséñame los recibos":

Hacker News

"¿Alguien vio en la entrada del blog que fue capaz de programar un compilador de GPU entero desde cero? Parece que incluso superó a triton en algunos kernels de GPU. Eso me parece una locura. Me pregunto si abrirán esto como código abierto y mostrarán cuántos tokens costó."

Demostraciones como estas son reales, y también son las ejecuciones de mejor caso, muy asistidas, que cualquier laboratorio muestra en su lanzamiento. La brecha entre "lo hizo una vez en un sandbox" y "lo hace de forma fiable para mi caso de uso" es todo el juego, lo que me lleva a la parte que más me importa.

Una puntuación de benchmark no es un agente de soporte

Esto es lo que cada entrada de lanzamiento de modelo pasa por alto, y lo que importa si llegaste aquí intentando elegir un modelo para atención al cliente. Un 57 en el Intelligence Index te dice que el motor en bruto es potente. No te dice nada sobre si responderá de forma segura a tus clientes.

Una puntuación de benchmark no es un agente de soporte: un modelo de frontera en bruto te da un número alto, una clave de API y un prompt en blanco, mientras que un compañero de equipo listo para soporte se entrena con tu centro de ayuda y tickets pasados, usa enrutamiento basado en confianza, se prueba con tickets reales antes de salir en vivo, y vive dentro de tu helpdesk
Una puntuación de benchmark no es un agente de soporte: un modelo de frontera en bruto te da un número alto, una clave de API y un prompt en blanco, mientras que un compañero de equipo listo para soporte se entrena con tu centro de ayuda y tickets pasados, usa enrutamiento basado en confianza, se prueba con tickets reales antes de salir en vivo, y vive dentro de tu helpdesk

Construyo agentes de IA en eesel, y lo que aprendimos por las malas es que la calidad del modelo es quizás un tercio del problema. Hemos visto bots que suenan seguros dar respuestas incorrectas sin darse cuenta, que es exactamente por qué ahora simulamos cada implementación contra los tickets históricos de una empresa antes de que hable con un cliente. Una clave de API de K3 en bruto no te da nada de eso. Para pasar de un gran modelo a un compañero de equipo en el que confiarías en la cola, todavía necesitas entrenarlo con tu base de conocimiento, envolverlo en un enrutamiento que escale cuando no está seguro, y ponerlo donde tu equipo ya trabaja. Esa es la brecha, y es la misma brecha sea el modelo subyacente K3, Claude Opus, o cualquier otro.

Prueba eesel

Si estás leyendo un análisis de Kimi K3 porque quieres mejor IA en tu cola de soporte, el modelo es la parte fácil. eesel es la capa que convierte un modelo de frontera en un agente de soporte real: se entrena con tu centro de ayuda y tickets pasados, redacta o resuelve por completo las respuestas dentro de tu helpdesk actual y, de forma crucial, te permite simular todo el proceso contra tu historial de tickets real para que veas la tasa de resolución y el coste antes de que salga en vivo.

Vista general del panel del helpdesk de IA de eesel
Vista general del panel del helpdesk de IA de eesel

Como eesel es agnóstico respecto al modelo, puedes cabalgar la frontera: ejecutar el modelo líder que sea mejor este mes, sin reescribir prompts ni cuidar una API en bruto. Y el precio está pensado para la economía del soporte: basado en uso, sin cuotas por asiento, así que un mes ajetreado no te penaliza por tener un equipo más grande. Puedes probar eesel gratis y simularlo con tus propios tickets en unos minutos.

Preguntas frecuentes

¿Qué es Kimi K3?
Kimi K3 es el modelo más reciente de Moonshot AI, lanzado el 16 de julio de 2026. Es un modelo de mezcla de expertos de 2,8 billones de parámetros con visión nativa y una ventana de contexto de 1 millón de tokens, presentado como el primer modelo abierto a escala de 3 billones de parámetros. Si estás evaluando modelos para trabajo de soporte, nuestro repaso de los mejores agentes de IA es mejor punto de partida que un solo modelo.
¿Cuánto cuesta Kimi K3?
La API de Kimi K3 cuesta 3,00 $ por millón de tokens de entrada (sin acierto de caché), 0,30 $ con acierto de caché, y 15,00 $ por millón de tokens de salida, con precio fijo en toda la ventana de contexto de 1M. La aplicación para consumidores suma cuatro niveles de suscripción desde 19 $ hasta 199 $ al mes. Es un precio de nivel Sonnet, no la ganga por la que se conocía a Kimi K2.
¿Kimi K3 es de código abierto?
Moonshot lo llama "el primer modelo abierto de clase 3T del mundo", pero los pesos no estaban disponibles en el lanzamiento. Moonshot afirma que los pesos completos se publicarán antes del 27 de julio de 2026, junto con un informe técnico. Hasta entonces, solo está disponible por API. Para los equipos que necesitan ejecutar agentes en producción, un modelo de API que todavía no se puede alojar uno mismo es algo que conviene planificar con antelación.
¿Cómo se compara Kimi K3 con Claude Fable 5 y GPT-5.6?
Según los propios benchmarks de Moonshot y las pruebas independientes de Artificial Analysis, K3 queda justo por debajo de Claude Fable 5 y GPT-5.6 Sol, mientras supera a Claude Opus 4.8 y GPT-5.5 en la mayoría de las tareas. Incluso lidera claramente algunos benchmarks de tareas agénticas y de programación. Léelo como un sólido número dos, no como el nuevo modelo líder.
¿Puedo usar Kimi K3 para soporte al cliente?
Puedes llamarlo a través de la API, pero un modelo en bruto no es un agente de soporte. Necesita entrenarse con tu centro de ayuda y tus tickets pasados, envolverse en un enrutamiento basado en confianza, y probarse antes de responder a clientes reales. Eso es exactamente lo que gestiona eesel, que además es agnóstico respecto al modelo, así que funciona con modelos de frontera como este sin que tengas que gestionar prompts. Mira cómo pensamos sobre prevenir las alucinaciones de la IA en soporte.
¿Qué puede construir realmente Kimi K3?
En la presentación de lanzamiento de Moonshot, K3 diseñó de forma autónoma un chip a lo largo de 48 horas, escribió un compilador para GPU que superó a Triton en algunos kernels, y generó juegos 3D jugables a partir de un solo prompt. Demostraciones impresionantes, aunque la respuesta justa de la comunidad fue "enséñennos la factura de tokens".

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustración que representa el gran modelo de lenguaje Kimi K3 de Moonshot AI
Trending

Kimi K3 explicado: el modelo de frontera abierto de Moonshot

Una guía clara sobre Kimi K3, el modelo abierto de 2,8 billones de parámetros de Moonshot AI: qué es, cómo rinde, cuánto cuesta y si vale la pena cambiarse a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Banner principal del análisis de PromptQL con el logo de PromptQL sobre un fondo índigo
Trending

Análisis de PromptQL (2026): el agente de datos de Hasura, puesto a prueba

Un análisis práctico de PromptQL: cómo el agente de datos de Hasura separa la planificación de la ejecución, cuánto cuesta y si su promesa de fiabilidad se sostiene.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Banner principal del análisis de Gemini 3.5 Pro en azul Google
Trending

Análisis de Gemini 3.5 Pro: el estado honesto del buque insignia de Google

Un análisis honesto de Gemini 3.5 Pro: todavía no ha salido. Esto es lo que Google ha confirmado, por qué llega tarde, los benchmarks que sí existen y qué usar hoy.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración comparando las mejores alternativas al modelo de lenguaje grande Kimi K3
Trending

Las 8 mejores alternativas a Kimi K3 en 2026

Kimi K3 es un modelo de frontera real, pero no es el más barato y sus pesos llegan tarde. Aquí tienes las 8 mejores alternativas a Kimi K3, con precios reales de API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Ilustración editorial con el logo de Grok, barras de benchmarks y una etiqueta de precio que representa un análisis de Grok 4.5
Trending

Análisis de Grok 4.5: benchmarks, precios y el veredicto

Grok 4.5 de xAI se lanzó el 8 de julio con un puesto #4 en el Intelligence Index y el mejor resultado de uso de herramientas agenticas de la tabla. Aquí está el análisis real, los benchmarks, los precios y quién debería usarlo realmente.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración de portada para un análisis práctico de NemoClaw, el runtime de agentes de IA gobernados de NVIDIA
Trending

Análisis de NemoClaw: el runtime de agentes de IA gobernados de NVIDIA, puesto a prueba

Un análisis honesto de NemoClaw: qué hace brillantemente el runtime de agentes gobernados de código abierto de NVIDIA, dónde flaquea su historia de seguridad en fase alfa, y quién debería usarlo de verdad.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis