
¿Qué es Inkling?
Inkling es el primer modelo público de Thinking Machines Lab, y el laboratorio es refrescantemente honesto al decir que no busca ganar el leaderboard. La propuesta es una base abierta amplia y equilibrada que haces fine-tuning para tu propio uso, usando la plataforma Tinker del laboratorio. En otras palabras, Inkling está pensado como un punto de partida que moldeas, no un chatbot al que te suscribes.
Las especificaciones que importan, directo de la model card:
- Arquitectura: un transformer Mixture-of-Experts (MoE), 975B de parámetros totales con 41B activos por token (enruta cada token a través de 6 de 256 expertos, más 2 expertos compartidos). Por eso un modelo de aproximadamente un billón de parámetros puede servirse a una velocidad razonable: solo una fracción de él se ejecuta en cada token.
- Entradas: texto, imágenes y audio (WAV a 16 kHz, idealmente menos de unos 20 minutos). La salida es solo texto.
- Ventana de contexto: hasta 1M de tokens, lo que lo empata con el nivel superior de modelos en longitud.
- Licencia: Apache 2.0, así que se permite uso comercial y los pesos están en Hugging Face.
- Lanzamiento: 15 de julio de 2026.
La parte de audio es lo novedoso. Como lo puso el comentario más votado del hilo de lanzamiento, este es el "modelo de pesos abiertos más grande que admite audio", algo relevante si alguna vez quieres que un modelo escuche una llamada de soporte en lugar de solo leer su transcripción.
Cómo está construido Inkling
Si te gusta la parte técnica, Inkling toma un par de decisiones de arquitectura poco habituales. En lugar de los ya estándar rotary position embeddings (RoPE), el propio informe del equipo describe un esquema de posición relativa incrustado en los logits de atención, más convoluciones cortas sobre las keys y values antes de que lleguen a la caché. El objetivo práctico es el mismo que persigue todo modelo de contexto largo: mantener la atención estable y barata cuando el contexto se acerca a un millón de tokens.

No hace falta interpretar el diagrama para captar la idea: Inkling está diseñado en torno al contexto largo y al razonamiento eficiente, no para encabezar un único benchmark. Eso se nota de nuevo en cómo "piensa".
El dial de esfuerzo de razonamiento
Inkling es un modelo de razonamiento y expone un ajuste de "esfuerzo de pensamiento" controlable. En la integración de Hugging Face eso es un nivel reasoning_effort que va de none y minimal hasta low, medium, high, xhigh y max. Bájalo y el modelo responde rápido y barato; súbelo y gasta más tokens pensando antes de responder.
La afirmación en la que se apoya Thinking Machines aquí es la eficiencia de tokens: dicen que Inkling alcanza el mismo puntaje en Terminal-Bench que Nemotron 3 Ultra gastando cerca de un tercio de los tokens para llegar ahí. Para quien paga por token o alquila una GPU, "misma respuesta, menos tokens" es una cifra más útil que una victoria fraccional en un benchmark.
Los benchmarks: fuerte, pero no rey
Aquí hay que separar el discurso del proveedor de la lectura independiente. Las propias tablas de Thinking Machines muestran números favorecedores con el esfuerzo al máximo, pero la señal más limpia viene de Artificial Analysis, que evalúa a todos con el mismo criterio.
Su veredicto: Inkling obtiene 41 puntos en el AA Intelligence Index, que es el #10 de 97 en su leaderboard curado, muy por encima del promedio de ~25 para modelos de pesos abiertos de su tamaño. Así que es un modelo inteligente. Pero se sitúa por debajo de los líderes de frontera (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5, GLM-5.2) y cae en un grupo con pares como DeepSeek V4 Flash. Los rastreadores de la comunidad que incluyen más modelos lo ubican todavía más abajo, cerca del #41, de donde viene el debate de si "competitivo" es una etiqueta justa.
| Evaluación (Artificial Analysis) | Inkling | Qué mide |
|---|---|---|
| GPQA Diamond | 87% | Razonamiento científico |
| AA-LCR | 63% | Razonamiento de contexto largo |
| Terminal-Bench v2.1 | 55% | Codificación agéntica + uso de terminal |
| SciCode | 46% | Codificación |
| AA-Omniscience (precisión) | 40% | Conocimiento |
| GDPval-AA v2 | 37% | Tareas de trabajo del mundo real |
| Humanity's Last Exam | 30% | Razonamiento + conocimiento |
| CritPt | 5% | Razonamiento en física |
Leyendo esa tabla con honestidad se obtiene una personalidad real: Inkling es fuerte en razonamiento científico y de contexto largo, y notablemente débil en física y fiabilidad de conocimiento en bruto (su índice de fiabilidad de conocimiento AA-Omniscience es un pobre 2 en una escala de −100 a 100). Es un modelo con aristas marcadas, no un todoterreno uniforme.
El hilo de lanzamiento captó lo mismo. Elogio y escepticismo convivieron:
"Acabo de ver los benchmarks y me decepcionó un poco que parece estar entre KimiK2.6 y KimiK2.7 en la mayoría de las pruebas."
Y la respuesta más útil de todo el hilo, la que vale la pena pegar en el monitor antes de confiar en cualquier comparación de modelos:
"¿Quieres saber qué tan bueno es un modelo? Ejecútalo con tu propio benchmark no público, básicamente la única forma de obtener respuestas fiables en las que puedas confiar algo; todo lo demás está manipulado, malinterpretado o sobrevalorado."
Ese instinto, que el único benchmark que cuenta son tus propios datos, es exactamente el que conviene conservar si alguna vez apuntas un modelo a tu cola de soporte. Más sobre eso a continuación.

¿Cuánto cuesta Inkling?
Esta es la parte que me sorprendió. Inkling es de pesos abiertos, y sin embargo en la API propia de Thinking Machines tiene el precio de un modelo de frontera propietario. Según Artificial Analysis, se ubica en el #81 de 97 en precio, es decir, entre los más caros de su clase.
| Vía de acceso | Lo que pagas | Notas |
|---|---|---|
| API de Thinking Machines - entrada | 1,87 $ / 1M de tokens | El promedio de la clase es ~0,43 $; esto es caro |
| API de Thinking Machines - salida | 4,68 $ / 1M de tokens | El promedio de la clase es ~1,25 $ |
| Tarifa mixta | ~1,10 $ / 1M de tokens | Con una mezcla de 7:2:1 caché:entrada:salida |
| Lectura/escritura de caché | 0,374 $ / 1M de tokens | Un acierto de caché es −80% frente a la entrada |
| Autoalojar los pesos | 0 $ por el modelo | Apache 2.0; pagas hardware en su lugar |
| Fine-tuning con Tinker | Servicio de pago | El verdadero modelo de negocio del laboratorio |
Dos cosas destacan. Primero, actualmente hay un solo proveedor de API, el propio Thinking Machines, así que todavía no hay un anfitrión tercero más barato que los esté superando. Segundo, "pesos abiertos" solo lo hace gratis si estás dispuesto a ejecutarlo, y eso es una decisión real, no una nota al pie.

Ejecutar Inkling tú mismo
Como los pesos son abiertos, la comunidad ya lo tenía corriendo localmente el primer día. El blog de lanzamiento de Hugging Face plantea tres niveles aproximados, que resume la escalera de arriba: el checkpoint completo en BF16 quiere alrededor de 2 TB de VRAM (territorio de centro de datos), la cuantización NVFP4 lo baja a unos 600 GB en hardware Blackwell, y las versiones de la comunidad en GGUF de 1 bit lo recortan cerca de un 95%, suficiente para ejecutar una versión muy cuantizada en una estación de trabajo potente.
El soporte también llegó rápido: integración desde el día cero en transformers 5.14, SGLang, vLLM y llama.cpp/Unsloth, más capas de borrador de decodificación especulativa para una aceleración sin pérdidas. Aquí hay una versión de 1 bit corriendo de verdad en el estudio de Unsloth, escribiendo un juego HTML completo y "pensando" durante 321 segundos con una ventana de un millón de tokens:

Esa historia de "ejecútalo tú mismo" es la verdadera razón para interesarse en Inkling. Si estás sopesando un modelo abierto frente a uno cerrado, la disyuntiva es control frente a comodidad: eres dueño de los pesos, tus datos nunca salen de tu infraestructura, y nadie puede descontinuarte el modelo debajo de los pies, pero ahora te toca a ti cargar con las GPU.
El ángulo empresarial
Para equipos que quieren el control sin cuidar un clúster de GPU, Inkling apareció en Databricks desde el día cero, accesible a través del Unity AI Gateway con gobernanza integrada. El argumento empresarial que plantean es el mismo que hace atractivos a los pesos abiertos: hacer fine-tuning con tus propios datos, mantenerlo dentro de tu perímetro de gobernanza y evitar el precio por token.

¿Deberías usar Inkling?
En lugar de la salida fácil de "depende de tus necesidades", aquí hay un camino de decisión directo basado en aquello en lo que Inkling realmente es bueno y malo.
Inkling encaja bien. Apache 2.0, descargable, y funciona localmente hasta una versión de 1 bit. Presupuesta las GPU.
Pocos modelos abiertos igualan esto. Inkling es uno de los pocos. Úsalo.
Busca en otro lado. A 1,87 $ de entrada / 4,68 $ de salida, pares de pesos abiertos más baratos (GLM, Qwen, DeepSeek) ganan en precio.
Un modelo solo no responde tickets con seguridad. Quieres una plataforma que envuelva un modelo con tu conocimiento, tus guardarraíles y pruebas. Sigue leyendo.
Lo que la comunidad realmente piensa
El hilo de lanzamiento en Hacker News (1.214 puntos, ~292 comentarios) es la instantánea más clara de cómo recibieron los desarrolladores a Inkling. El ánimo fue entusiasta pero mesurado, y la emoción giró menos en torno a los puntajes y más en torno a quién lo lanzó:
"Y no olvidemos, es estadounidense. Este es el primer modelo de pesos abiertos competitivo no chino desde, ¿qué, Llama 3?"
Ese encuadre recibió objeciones (la gente mencionó a Mistral, North de Cohere, Gemma y otros como contraejemplos), pero el sentimiento de fondo, que un modelo de pesos abiertos occidental y creíble llevaba tiempo tardando, recorrió todo el hilo. También hubo una buena dosis de "¿cómo sobrevive una empresa que regala su modelo?", con la respuesta apuntando a Tinker, el negocio de fine-tuning alojado:
"La historia de la tecnología está llena de cadáveres de servicios de 'código abierto, pero vendemos el hosting'. Los modelos son tan caros de entrenar que no puedes permitirte perder a los grandes clientes una vez que se vuelven realmente rentables."
Si ese modelo aguanta es la pregunta abierta que ronda a Inkling. Pero por ahora, los desarrolladores obtuvieron un modelo capaz, multimodal y totalmente abierto para explorar, y la mayoría quedó contenta con eso.
Lo que un modelo como Inkling significa para la atención al cliente
Aquí es donde he pasado los últimos años, así que déjame ser directo. Yo construyo la capa de agente que se sienta encima de modelos como Inkling, y lo que he aprendido observando implementaciones reales es esto: un modelo base mejor rara vez cambia lo que realmente termina saliendo a una cola de soporte.
Un modelo en bruto, por inteligente que sea, no conoce tu política de reembolsos, no puede ver los últimos 40.000 tickets que tu equipo ya resolvió, y no tiene idea de cuándo debería callarse y pasarle el caso a un humano. Apúntalo directo a los clientes y responderá con confianza y de forma incorrecta, lo cual es peor que no responder. Ese modo de fallo, el bot confiado pero equivocado, es exactamente la razón por la que las alucinaciones de IA en soporte queman a los equipos, y por la que el modelo siempre es solo el motor.
El auto es la capa que lo rodea. Eso es eesel: aprende de tus tickets resueltos y de tu documentación de ayuda (no solo de una página de marketing), enruta según la confianza para que las respuestas de baja certeza se redacten en borrador en vez de enviarse y, la parte que más me importa, te deja simular al agente contra tus propios tickets pasados antes de que un solo cliente lo vea. Esa simulación es el consejo de "ejecútalo con tu propio benchmark" de Hacker News, convertido en un paso del producto.

Esto también significa que no necesitas apostar tu pila de soporte a un único modelo. El mejor modelo cambia cada pocas semanas (hoy Inkling, otro distinto el mes que viene), así que eesel se mantiene independiente del modelo y usa el que sea más fuerte en cada momento, mientras que la parte que le importa a tus clientes, el conocimiento, los guardarraíles, la triage de tickets, se mantiene firme.
Prueba eesel
Inkling es un lanzamiento interesante, pero una model card no es un agente de soporte. Si tu objetivo real es automatizar el soporte de nivel 1, lo que necesitas es la capa que convierte cualquier modelo fuerte en un compañero de equipo: eesel se conecta a tu helpdesk actual (Zendesk, Freshdesk, Gorgias, HubSpot, Front y más de 100 otros), aprende de tu historial y te deja simular con tickets pasados reales antes de salir en vivo, para que veas cobertura y precisión primero, no después de que un cliente detecte una mala respuesta. Gridwise usó exactamente ese enfoque para resolver el 73% de las solicitudes de nivel 1 en su primer mes.
Los precios son según el uso, alrededor de 0,40 $ por ticket resuelto, sin tarifas por asiento, y puedes empezar gratis. Es la diferencia entre admirar un gran motor y realmente ir a alguna parte.
Preguntas frecuentes
¿Qué es Inkling?
¿Inkling es gratuito y de código abierto?
¿Cuánto cuesta usar Inkling?
¿Cómo se compara Inkling con GLM, Kimi y DeepSeek?
¿Puedo usar Inkling para atención al cliente?
¿Quién hace Inkling y qué es Tinker?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








