Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición July 20, 2026

Verificado por expertos
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab

¿Qué es Inkling?

Inkling es el primer modelo público de Thinking Machines Lab, y el laboratorio es refrescantemente honesto al decir que no busca ganar el leaderboard. La propuesta es una base abierta amplia y equilibrada que haces fine-tuning para tu propio uso, usando la plataforma Tinker del laboratorio. En otras palabras, Inkling está pensado como un punto de partida que moldeas, no un chatbot al que te suscribes.

Las especificaciones que importan, directo de la model card:

  • Arquitectura: un transformer Mixture-of-Experts (MoE), 975B de parámetros totales con 41B activos por token (enruta cada token a través de 6 de 256 expertos, más 2 expertos compartidos). Por eso un modelo de aproximadamente un billón de parámetros puede servirse a una velocidad razonable: solo una fracción de él se ejecuta en cada token.
  • Entradas: texto, imágenes y audio (WAV a 16 kHz, idealmente menos de unos 20 minutos). La salida es solo texto.
  • Ventana de contexto: hasta 1M de tokens, lo que lo empata con el nivel superior de modelos en longitud.
  • Licencia: Apache 2.0, así que se permite uso comercial y los pesos están en Hugging Face.
  • Lanzamiento: 15 de julio de 2026.

La parte de audio es lo novedoso. Como lo puso el comentario más votado del hilo de lanzamiento, este es el "modelo de pesos abiertos más grande que admite audio", algo relevante si alguna vez quieres que un modelo escuche una llamada de soporte en lugar de solo leer su transcripción.

Cómo está construido Inkling

Si te gusta la parte técnica, Inkling toma un par de decisiones de arquitectura poco habituales. En lugar de los ya estándar rotary position embeddings (RoPE), el propio informe del equipo describe un esquema de posición relativa incrustado en los logits de atención, más convoluciones cortas sobre las keys y values antes de que lleguen a la caché. El objetivo práctico es el mismo que persigue todo modelo de contexto largo: mantener la atención estable y barata cuando el contexto se acerca a un millón de tokens.

Ruta de atención relativa de Inkling: el estado oculto se proyecta a Q, K, V y R, con una convolución corta sobre K/V hacia la caché y un sesgo de posición relativa sumado a los logits de atención, tal como lo diagrama Thinking Machines en el blog de lanzamiento de Hugging Face
Ruta de atención relativa de Inkling: el estado oculto se proyecta a Q, K, V y R, con una convolución corta sobre K/V hacia la caché y un sesgo de posición relativa sumado a los logits de atención, tal como lo diagrama Thinking Machines en el blog de lanzamiento de Hugging Face

No hace falta interpretar el diagrama para captar la idea: Inkling está diseñado en torno al contexto largo y al razonamiento eficiente, no para encabezar un único benchmark. Eso se nota de nuevo en cómo "piensa".

El dial de esfuerzo de razonamiento

Inkling es un modelo de razonamiento y expone un ajuste de "esfuerzo de pensamiento" controlable. En la integración de Hugging Face eso es un nivel reasoning_effort que va de none y minimal hasta low, medium, high, xhigh y max. Bájalo y el modelo responde rápido y barato; súbelo y gasta más tokens pensando antes de responder.

La afirmación en la que se apoya Thinking Machines aquí es la eficiencia de tokens: dicen que Inkling alcanza el mismo puntaje en Terminal-Bench que Nemotron 3 Ultra gastando cerca de un tercio de los tokens para llegar ahí. Para quien paga por token o alquila una GPU, "misma respuesta, menos tokens" es una cifra más útil que una victoria fraccional en un benchmark.

Los benchmarks: fuerte, pero no rey

Aquí hay que separar el discurso del proveedor de la lectura independiente. Las propias tablas de Thinking Machines muestran números favorecedores con el esfuerzo al máximo, pero la señal más limpia viene de Artificial Analysis, que evalúa a todos con el mismo criterio.

Su veredicto: Inkling obtiene 41 puntos en el AA Intelligence Index, que es el #10 de 97 en su leaderboard curado, muy por encima del promedio de ~25 para modelos de pesos abiertos de su tamaño. Así que es un modelo inteligente. Pero se sitúa por debajo de los líderes de frontera (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5, GLM-5.2) y cae en un grupo con pares como DeepSeek V4 Flash. Los rastreadores de la comunidad que incluyen más modelos lo ubican todavía más abajo, cerca del #41, de donde viene el debate de si "competitivo" es una etiqueta justa.

Evaluación (Artificial Analysis)InklingQué mide
GPQA Diamond87%Razonamiento científico
AA-LCR63%Razonamiento de contexto largo
Terminal-Bench v2.155%Codificación agéntica + uso de terminal
SciCode46%Codificación
AA-Omniscience (precisión)40%Conocimiento
GDPval-AA v237%Tareas de trabajo del mundo real
Humanity's Last Exam30%Razonamiento + conocimiento
CritPt5%Razonamiento en física

Leyendo esa tabla con honestidad se obtiene una personalidad real: Inkling es fuerte en razonamiento científico y de contexto largo, y notablemente débil en física y fiabilidad de conocimiento en bruto (su índice de fiabilidad de conocimiento AA-Omniscience es un pobre 2 en una escala de −100 a 100). Es un modelo con aristas marcadas, no un todoterreno uniforme.

El hilo de lanzamiento captó lo mismo. Elogio y escepticismo convivieron:

Hacker News

"Acabo de ver los benchmarks y me decepcionó un poco que parece estar entre KimiK2.6 y KimiK2.7 en la mayoría de las pruebas."

Y la respuesta más útil de todo el hilo, la que vale la pena pegar en el monitor antes de confiar en cualquier comparación de modelos:

Hacker News

"¿Quieres saber qué tan bueno es un modelo? Ejecútalo con tu propio benchmark no público, básicamente la única forma de obtener respuestas fiables en las que puedas confiar algo; todo lo demás está manipulado, malinterpretado o sobrevalorado."

Ese instinto, que el único benchmark que cuenta son tus propios datos, es exactamente el que conviene conservar si alguna vez apuntas un modelo a tu cola de soporte. Más sobre eso a continuación.

Cuadrante de posicionamiento que muestra a Inkling en la esquina de alta inteligencia y alto precio, mientras que pares de pesos abiertos como GLM, Qwen y DeepSeek están en la esquina de alta inteligencia y bajo precio
Cuadrante de posicionamiento que muestra a Inkling en la esquina de alta inteligencia y alto precio, mientras que pares de pesos abiertos como GLM, Qwen y DeepSeek están en la esquina de alta inteligencia y bajo precio

¿Cuánto cuesta Inkling?

Esta es la parte que me sorprendió. Inkling es de pesos abiertos, y sin embargo en la API propia de Thinking Machines tiene el precio de un modelo de frontera propietario. Según Artificial Analysis, se ubica en el #81 de 97 en precio, es decir, entre los más caros de su clase.

Vía de accesoLo que pagasNotas
API de Thinking Machines - entrada1,87 $ / 1M de tokensEl promedio de la clase es ~0,43 $; esto es caro
API de Thinking Machines - salida4,68 $ / 1M de tokensEl promedio de la clase es ~1,25 $
Tarifa mixta~1,10 $ / 1M de tokensCon una mezcla de 7:2:1 caché:entrada:salida
Lectura/escritura de caché0,374 $ / 1M de tokensUn acierto de caché es −80% frente a la entrada
Autoalojar los pesos0 $ por el modeloApache 2.0; pagas hardware en su lugar
Fine-tuning con TinkerServicio de pagoEl verdadero modelo de negocio del laboratorio

Dos cosas destacan. Primero, actualmente hay un solo proveedor de API, el propio Thinking Machines, así que todavía no hay un anfitrión tercero más barato que los esté superando. Segundo, "pesos abiertos" solo lo hace gratis si estás dispuesto a ejecutarlo, y eso es una decisión real, no una nota al pie.

Escalera descendente de tres formas de ejecutar Inkling: los pesos completos en BF16 necesitan unos 2 TB de VRAM, la cuantización NVFP4 necesita unos 600 GB, y el GGUF de 1 bit necesita alrededor de un 95% menos y funciona en una estación de trabajo
Escalera descendente de tres formas de ejecutar Inkling: los pesos completos en BF16 necesitan unos 2 TB de VRAM, la cuantización NVFP4 necesita unos 600 GB, y el GGUF de 1 bit necesita alrededor de un 95% menos y funciona en una estación de trabajo

Ejecutar Inkling tú mismo

Como los pesos son abiertos, la comunidad ya lo tenía corriendo localmente el primer día. El blog de lanzamiento de Hugging Face plantea tres niveles aproximados, que resume la escalera de arriba: el checkpoint completo en BF16 quiere alrededor de 2 TB de VRAM (territorio de centro de datos), la cuantización NVFP4 lo baja a unos 600 GB en hardware Blackwell, y las versiones de la comunidad en GGUF de 1 bit lo recortan cerca de un 95%, suficiente para ejecutar una versión muy cuantizada en una estación de trabajo potente.

El soporte también llegó rápido: integración desde el día cero en transformers 5.14, SGLang, vLLM y llama.cpp/Unsloth, más capas de borrador de decodificación especulativa para una aceleración sin pérdidas. Aquí hay una versión de 1 bit corriendo de verdad en el estudio de Unsloth, escribiendo un juego HTML completo y "pensando" durante 321 segundos con una ventana de un millón de tokens:

Una versión GGUF de 1 bit de Inkling corriendo localmente en el estudio de Unsloth, escribiendo un juego de Sudoku en HTML autocontenido tras pensar durante 321 segundos, con un medidor de contexto de 12.6k / 1.048.6k tokens, como se muestra en el blog de lanzamiento de Hugging Face
Una versión GGUF de 1 bit de Inkling corriendo localmente en el estudio de Unsloth, escribiendo un juego de Sudoku en HTML autocontenido tras pensar durante 321 segundos, con un medidor de contexto de 12.6k / 1.048.6k tokens, como se muestra en el blog de lanzamiento de Hugging Face

Esa historia de "ejecútalo tú mismo" es la verdadera razón para interesarse en Inkling. Si estás sopesando un modelo abierto frente a uno cerrado, la disyuntiva es control frente a comodidad: eres dueño de los pesos, tus datos nunca salen de tu infraestructura, y nadie puede descontinuarte el modelo debajo de los pies, pero ahora te toca a ti cargar con las GPU.

El ángulo empresarial

Para equipos que quieren el control sin cuidar un clúster de GPU, Inkling apareció en Databricks desde el día cero, accesible a través del Unity AI Gateway con gobernanza integrada. El argumento empresarial que plantean es el mismo que hace atractivos a los pesos abiertos: hacer fine-tuning con tus propios datos, mantenerlo dentro de tu perímetro de gobernanza y evitar el precio por token.

Panel "Integrate external agents" de Databricks que muestra a Inkling accesible a través del Unity AI Gateway con un solo comando, funcionando junto a agentes de codificación como Codex, Gemini, Copilot, OpenCode y Pi, como se muestra en el blog de Databricks
Panel "Integrate external agents" de Databricks que muestra a Inkling accesible a través del Unity AI Gateway con un solo comando, funcionando junto a agentes de codificación como Codex, Gemini, Copilot, OpenCode y Pi, como se muestra en el blog de Databricks

¿Deberías usar Inkling?

En lugar de la salida fácil de "depende de tus necesidades", aquí hay un camino de decisión directo basado en aquello en lo que Inkling realmente es bueno y malo.

¿Es Inkling la opción correcta para ti?
Quieres autoalojar un modelo abierto y ser dueño de los pesos
Inkling encaja bien. Apache 2.0, descargable, y funciona localmente hasta una versión de 1 bit. Presupuesta las GPU.
Necesitas audio nativo o una ventana de 1M de tokens en pesos abiertos
Pocos modelos abiertos igualan esto. Inkling es uno de los pocos. Úsalo.
Solo quieres la API capaz más barata
Busca en otro lado. A 1,87 $ de entrada / 4,68 $ de salida, pares de pesos abiertos más baratos (GLM, Qwen, DeepSeek) ganan en precio.
Quieres un agente de IA que funcione para soporte, no un modelo en bruto
Un modelo solo no responde tickets con seguridad. Quieres una plataforma que envuelva un modelo con tu conocimiento, tus guardarraíles y pruebas. Sigue leyendo.

Lo que la comunidad realmente piensa

El hilo de lanzamiento en Hacker News (1.214 puntos, ~292 comentarios) es la instantánea más clara de cómo recibieron los desarrolladores a Inkling. El ánimo fue entusiasta pero mesurado, y la emoción giró menos en torno a los puntajes y más en torno a quién lo lanzó:

Hacker News

"Y no olvidemos, es estadounidense. Este es el primer modelo de pesos abiertos competitivo no chino desde, ¿qué, Llama 3?"

Ese encuadre recibió objeciones (la gente mencionó a Mistral, North de Cohere, Gemma y otros como contraejemplos), pero el sentimiento de fondo, que un modelo de pesos abiertos occidental y creíble llevaba tiempo tardando, recorrió todo el hilo. También hubo una buena dosis de "¿cómo sobrevive una empresa que regala su modelo?", con la respuesta apuntando a Tinker, el negocio de fine-tuning alojado:

Hacker News

"La historia de la tecnología está llena de cadáveres de servicios de 'código abierto, pero vendemos el hosting'. Los modelos son tan caros de entrenar que no puedes permitirte perder a los grandes clientes una vez que se vuelven realmente rentables."

Si ese modelo aguanta es la pregunta abierta que ronda a Inkling. Pero por ahora, los desarrolladores obtuvieron un modelo capaz, multimodal y totalmente abierto para explorar, y la mayoría quedó contenta con eso.

Lo que un modelo como Inkling significa para la atención al cliente

Aquí es donde he pasado los últimos años, así que déjame ser directo. Yo construyo la capa de agente que se sienta encima de modelos como Inkling, y lo que he aprendido observando implementaciones reales es esto: un modelo base mejor rara vez cambia lo que realmente termina saliendo a una cola de soporte.

Un modelo en bruto, por inteligente que sea, no conoce tu política de reembolsos, no puede ver los últimos 40.000 tickets que tu equipo ya resolvió, y no tiene idea de cuándo debería callarse y pasarle el caso a un humano. Apúntalo directo a los clientes y responderá con confianza y de forma incorrecta, lo cual es peor que no responder. Ese modo de fallo, el bot confiado pero equivocado, es exactamente la razón por la que las alucinaciones de IA en soporte queman a los equipos, y por la que el modelo siempre es solo el motor.

El auto es la capa que lo rodea. Eso es eesel: aprende de tus tickets resueltos y de tu documentación de ayuda (no solo de una página de marketing), enruta según la confianza para que las respuestas de baja certeza se redacten en borrador en vez de enviarse y, la parte que más me importa, te deja simular al agente contra tus propios tickets pasados antes de que un solo cliente lo vea. Esa simulación es el consejo de "ejecútalo con tu propio benchmark" de Hacker News, convertido en un paso del producto.

Flujo que muestra a un modelo de pesos abiertos como el motor, una capa de eesel que aprende de tickets resueltos, enruta según la confianza y simula con tickets pasados, y el compañero de soporte funcional que resulta
Flujo que muestra a un modelo de pesos abiertos como el motor, una capa de eesel que aprende de tickets resueltos, enruta según la confianza y simula con tickets pasados, y el compañero de soporte funcional que resulta

Esto también significa que no necesitas apostar tu pila de soporte a un único modelo. El mejor modelo cambia cada pocas semanas (hoy Inkling, otro distinto el mes que viene), así que eesel se mantiene independiente del modelo y usa el que sea más fuerte en cada momento, mientras que la parte que le importa a tus clientes, el conocimiento, los guardarraíles, la triage de tickets, se mantiene firme.

Prueba eesel

Inkling es un lanzamiento interesante, pero una model card no es un agente de soporte. Si tu objetivo real es automatizar el soporte de nivel 1, lo que necesitas es la capa que convierte cualquier modelo fuerte en un compañero de equipo: eesel se conecta a tu helpdesk actual (Zendesk, Freshdesk, Gorgias, HubSpot, Front y más de 100 otros), aprende de tu historial y te deja simular con tickets pasados reales antes de salir en vivo, para que veas cobertura y precisión primero, no después de que un cliente detecte una mala respuesta. Gridwise usó exactamente ese enfoque para resolver el 73% de las solicitudes de nivel 1 en su primer mes.

Los precios son según el uso, alrededor de 0,40 $ por ticket resuelto, sin tarifas por asiento, y puedes empezar gratis. Es la diferencia entre admirar un gran motor y realmente ir a alguna parte.

Preguntas frecuentes

¿Qué es Inkling?
Inkling es el primer modelo de IA de pesos abiertos de Thinking Machines Lab, la startup de Mira Murati. Es un modelo Mixture-of-Experts nativamente multimodal (975B de parámetros totales / 41B activos) que recibe texto, imagen y audio como entrada y genera texto, publicado el 15 de julio de 2026 bajo licencia Apache 2.0. Está construido para hacerle fine-tuning, no para usarlo como producto terminado, y ahí es donde entra una capa como el agente de IA para helpdesk de eesel.
¿Inkling es gratuito y de código abierto?
Los pesos son de descarga gratuita bajo Apache 2.0, así que sí, puedes autoalojar Inkling y usarlo comercialmente. Pero "modelo gratuito" no significa "gratis de ejecutar": el hardware es la factura real, desde unos 2 TB de VRAM para los pesos completos hasta una estación de trabajo para la versión cuantizada a 1 bit. Thinking Machines también ofrece una API propia de pago si no quieres alojarlo tú mismo.
¿Cuánto cuesta usar Inkling?
En la API propia de Thinking Machines, Inkling cuesta alrededor de 1,87 $ por 1M de tokens de entrada y 4,68 $ por 1M de tokens de salida, según Artificial Analysis. Eso es caro para un modelo de pesos abiertos de su tamaño (el promedio de su clase ronda los 0,43 $ de entrada / 1,25 $ de salida), y es la particularidad más llamativa del modelo. Autoalojarlo cambia ese costo por token por un costo de hardware.
¿Cómo se compara Inkling con GLM, Kimi y DeepSeek?
Inkling se ubica en el mismo grupo de inteligencia de primer nivel que modelos como DeepSeek V4 Flash, pero por debajo de los líderes de frontera, y probadores de la comunidad en Hacker News señalan que sus benchmarks quedan aproximadamente entre Kimi K2.6 y K2.7. Sus rasgos distintivos son la entrada nativa de audio y una ventana de contexto de 1M de tokens, más que un puntaje de benchmark líder.
¿Puedo usar Inkling para atención al cliente?
Puedes, pero un modelo sin más no es un agente de soporte, por buenos que sean sus benchmarks. Para responder tickets reales necesitas una capa que aprenda de tus tickets resueltos, enrute según la confianza y pueda probarse antes de salir en vivo. Eso es exactamente lo que ofrece una plataforma de atención al cliente con IA como eesel, y se mantiene independiente del modelo para poder usar siempre el que sea mejor.
¿Quién hace Inkling y qué es Tinker?
Inkling lo hace Thinking Machines Lab, fundada por la exdirectora de tecnología de OpenAI, Mira Murati. El laboratorio regala el modelo gratis y gana dinero con Tinker, su plataforma de fine-tuning alojada, el modelo de "pesos abiertos, vender las herramientas" que Hacker News debatió a fondo durante buena parte del hilo de lanzamiento.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración editorial de agentes de codificación en paralelo y ventanas de terminal, que representa el panorama de alternativas a ZCode
Trending

Las 8 mejores alternativas a ZCode en 2026

ZCode es impresionante y tosco a la vez. Aquí tienes las 8 mejores alternativas a ZCode en 2026, con precios reales, contrapartidas honestas y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración editorial de una tabla de clasificación de benchmarks con una barra alta destacada, que representa a ZCode y el modelo GLM-5.2
Trending

ZCode: qué es realmente el nuevo agente de codificación con IA de Z.ai

Un análisis práctico de ZCode, la app gratuita de codificación agéntica del equipo de GLM: el modelo GLM-5.2 que hay detrás, las quejas reales de la semana de lanzamiento y quién debería usarla.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración que representa el gran modelo de lenguaje Kimi K3 de Moonshot AI
Trending

Kimi K3 explicado: el modelo de frontera abierto de Moonshot

Una guía clara sobre Kimi K3, el modelo abierto de 2,8 billones de parámetros de Moonshot AI: qué es, cómo rinde, cuánto cuesta y si vale la pena cambiarse a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Ilustración editorial de un modelo de lenguaje grande razonando sobre un largo flujo de documentos
Trending

Análisis de Kimi K3: el modelo de frontera abierto de Moonshot, puesto a prueba

Un análisis práctico de Kimi K3: la arquitectura del modelo abierto de 2,8 billones de parámetros, sus benchmarks, el precio real y lo que piensa realmente la comunidad en la semana de lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Banner de portada de qué es PromptQL con el logo de PromptQL sobre un fondo índigo
Trending

¿Qué es PromptQL? El agente de datos con IA de Hasura, explicado

¿Qué es PromptQL? Una explicación clara del agente de datos con IA de Hasura: la idea de planificar y luego ejecutar, con qué se conecta, cuánto cuesta y para quién es.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustración comparando las mejores alternativas al modelo de lenguaje grande Kimi K3
Trending

Las 8 mejores alternativas a Kimi K3 en 2026

Kimi K3 es un modelo de frontera real, pero no es el más barato y sus pesos llegan tarde. Aquí tienes las 8 mejores alternativas a Kimi K3, con precios reales de API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Portada de alternativas a PromptQL sobre un fondo índigo
Trending

Las 8 mejores alternativas a PromptQL en 2026

Las 8 mejores alternativas a PromptQL en 2026, desde Databricks Genie hasta el proyecto open source Wren AI, con precios reales, puntos fuertes y para quién es realmente cada una.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis