
Inkling-Small en 30 segundos
| Lanzamiento | 30 de julio de 2026, quince días después de Inkling |
| Fabricante | Thinking Machines Lab (Mira Murati) |
| Tamaño | 276B total, 12B activos, 42 capas |
| Licencia | Apache 2.0, pesos en Hugging Face |
| Contexto | 1M de tokens según la ficha, 524K vía OpenRouter |
| Entradas | Texto, imagen, audio (WAV a 16 kHz) |
| Precio de API | De $0.30 a $0.50 de entrada, $1.20 de salida por 1M |
| Suelo para autoalojarlo | 89 GB con cuantización de 2 bits |
| Mejor en | Programación, uso de herramientas, bucles de agentes, contexto largo |
| Más débil en | Recuperación factual sin retrieval |
Qué es en realidad Inkling-Small
Lo interesante está en la arquitectura, y eso explica ambas mitades de los resultados.
Inkling-Small es un transformador solo de decodificador de 42 capas con una estructura feed-forward dispersa de mezcla de expertos (mixture-of-experts). Cada token se enruta a 6 de 256 expertos, más 2 expertos compartidos que se activan en todos y cada uno de los tokens. El total de parámetros llega a 276B; solo 12B de esos están activos por token. La ficha del modelo confirma capas de atención híbridas locales y globales, numérica en BF16 y NVFP4, y entrenamiento en sistemas NVIDIA GB300 NVL72.
Compáralo con el padre. Inkling tiene 975B en total y 41B activos repartidos en 66 capas, así que la forma del enrutado es la misma, pero con aproximadamente una cuarta parte de la masa total y menos de un tercio de la masa activa. Thinking Machines describe el resultado como "un rendimiento comparable a Inkling con una cuarta parte de su tamaño."
Esa proporción es toda la historia aquí. Una gran proporción de total frente a activo es lo que hace que un modelo sea barato de servir, y un total de parámetros pequeño es lo que lo vuelve olvidadizo. Inkling-Small apostó fuerte por lo primero y pagó el precio en lo segundo. Para la versión general de ese mecanismo, modelos de IA personalizados recorre el mismo intercambio sin todas las tablas de benchmarks.
Toma texto, luego imágenes (entre 40 y 4096 píxeles funciona mejor), y audio en WAV a 16 kHz, idealmente de menos de dos minutos. La salida es solo texto. El esfuerzo de razonamiento es un dial de 0 a 0.99, donde bajo es 0.2, medio se sitúa en 0.7 y máximo es 0.99, así que por cada llamada puedes intercambiar tokens de pensamiento por latencia.
La entrada de audio nativa es lo más raro de esa lista, por lo que este modelo sigue apareciendo en conversaciones sobre voz. Vale la pena señalar el límite: entra audio, sale texto, así que aquí no hay síntesis de voz en absoluto. Los proveedores que sí cierran ese círculo están cubiertos en empresas de voz con IA.
¿Para qué tarea es adecuado Inkling-Small?
La respuesta cambia mucho según la carga de trabajo, y para cada una la propia tabla del fabricante aporta la evidencia. Elige la tarea que realmente tienes:
Los benchmarks: de verdad supera a su padre
Un modelo destilado o reducido normalmente queda un poco por detrás del buque insignia del que proviene. Inkling-Small no, al menos no en las categorías por las que la mayoría de la gente elige un modelo.

En programación se lleva SWEBench Verified con 80.2% frente a 77.6%, luego SWEBench Pro con 55.9% frente a 54.3%, con Terminal Bench 2.1 en 64.7% frente a 63.8%. En el lado agéntico se lleva Toolathlon Verified con 54.4% frente a 45.5% y MCP Atlas con 79.6% frente a 76.0%, además de un Elo de GDPval-AA v2 de 1269 frente a 1238. En razonamiento general se lleva GPQA Diamond con 89.5% frente a 87.2%, y Humanity's Last Exam con 31.6% frente a 29.7% en la versión solo de texto.
También publica cifras que la ficha del padre ni siquiera reporta. SciCode 48.7%, CritPt 8.3%, y luego ARC-AGI-1 con 84.0% y ARC-AGI-2 con 40.1%. En seguimiento de instrucciones, IFBench llega a 82.2% frente a 79.8%, y eso importa más de lo que parece para cualquier cosa que tenga que obedecer un prompt de sistema de forma fiable. Si ese es el eje que te importa, agente de IA frente a chatbot basado en reglas explica por qué en producción la obediencia gana a la inteligencia bruta.
Las pérdidas en el lado del razonamiento son reales, pero estrechas. AIME 2026 baja a 95.5% desde 97.1%. Tau 3 Banking baja a 15.5% desde 23.7%, que es el retroceso más marcado de todo el bloque agéntico, y vale la pena tenerlo en cuenta si tu carga de trabajo se parece a flujos financieros estructurados.
Otro resultado merece una advertencia, porque es fácil pasarlo por alto. Global-MMLU-Lite, la prueba multilingüe, baja a 86.7% desde 88.7%. Una caída de dos puntos, así que nada dramático, pero apunta en la misma dirección que las cifras de factualidad: el recorte salió de la amplitud del conocimiento. Si atiendes a varios idiomas, prueba en cada uno de ellos en lugar de fiarte del agregado, y agentes de soporte multilingües explica cómo se ve esa prueba en la práctica.
De forma independiente, Artificial Analysis lo puntúa con 40 en su Intelligence Index, en el puesto #15 de 101, frente a 41 y el puesto #13 del Inkling completo. Un punto de índice de diferencia, con un cuarto del tamaño. Que la puntuación del fabricante y la de un tercero independiente lleguen a la misma conclusión es poco habitual, y es lo más contundente de todo este análisis.
El número que debería hacerte parar
Aquí está la parte que no apareció en la publicación de lanzamiento.
SimpleQA Verified, que comprueba si un modelo conoce respuestas factuales breves, marca 20.6% para Inkling-Small frente a 43.9% para Inkling. Menos de la mitad. Y AA Omniscience, que compensa las respuestas correctas contra las incorrectas dichas con confianza, marca -9.0 frente al +2.1 del modelo padre.
Una puntuación negativa en Omniscience significa que el modelo afirma más cosas incorrectas con confianza que cosas correctas. Este no es un modelo que dice "no estoy seguro". Es un modelo que rellena el hueco. Thinking Machines lo enumera ellos mismos entre las limitaciones conocidas, nombrando "alucinación (generar contenido plausible pero factualmente incorrecto o sin respaldo)" y "rendimiento degradado en conversaciones largas de varios turnos", y recomiendan no desplegarlo en contextos médicos, legales o de seguridad crítica sin un ajuste fino adicional. Hay que reconocerles el mérito: es una sección de limitaciones más franca que la que la mayoría de laboratorios se molesta en publicar.
Para un agente de programación esto apenas importa, ya que el compilador hace de verificador de hechos. Para cualquier cosa de cara al cliente sí importa, y mucho, y yo mismo he visto este fallo en producción. Un equipo de soporte con el que trabajé tenía una base de conocimiento que decía que daban soporte a todos los modelos de vehículos, así que su bot confirmaba alegremente cobertura para marcas de coches que ni siquiera estaban en su base de datos. Nada alucinado en el sentido dramático. El modelo simplemente rellenó un hueco con algo plausible. Ese equipo describió su configuración inicial como "prueba y error al principio."
Un modelo con -9.0 en Omniscience es ese mismo fallo con el volumen subido. Las mitigaciones son conocidas y poco vistosas: retrieval sobre fuentes que controlas, citas que una persona puede verificar, y una ruta de rechazo. Alucinaciones de IA en soporte cubre el conjunto completo, y la versión práctica más corta es prevención de alucinaciones de IA.
Precio y velocidad: la razón real para prestarle atención
Aquí es donde el modelo pequeño se gana su lugar en el mundo.
| Inkling-Small | Inkling | |
|---|---|---|
| Entrada por 1M | $0.30 a $0.50 | $1.00 |
| Salida por 1M | $1.20 | $4.05 |
| Mixto (AA) | $0.22 | $0.72 |
| Velocidad de salida | 131.1 tok/s | 84.8 tok/s |
| Tiempo al primer token | 1.65 s | 1.82 s |
| Proveedores | 2 | 4 |
| AA Intelligence Index | 40 | 41 |
Los tokens de salida cuestan 3,4 veces menos y llegan 1,5 veces más rápido, a cambio de un punto de índice de inteligencia. Para bucles de agentes, donde los tokens de salida dominan la factura y la latencia se acumula a lo largo de docenas de turnos, esa no es una diferencia marginal. También se refleja en las cifras que un equipo de soporte realmente reporta, porque los primeros tokens más rápidos mueven la resolución en el primer contacto junto con el resto de las métricas de atención al cliente que se derivan de ella.
Dos advertencias antes de que te pongas a presupuestar con esto. El precio de entrada aún no está cerrado: Artificial Analysis indica $0.30 por 1M, mientras que el listado de OpenRouter muestra $0.45 y su API devuelve $0.50, así que comprueba tu propia ruta. Además, por ahora solo hay dos proveedores, frente a cuatro del padre, y eso es escaso si necesitas redundancia.
La segunda advertencia es la más sorprendente. La ficha del modelo dice 1M de contexto. OpenRouter lo sirve actualmente a 524.288 tokens, exactamente la mitad. Los pesos soportan la ventana completa, la API enrutada simplemente todavía no la expone. Si el millón de tokens es la razón por la que elegiste este modelo, aloja tú mismo o verifica con tu proveedor primero. Tamaño de la ventana de contexto explica por qué el número anunciado y el número realmente usable divergen tan a menudo.
El negocio real de Thinking Machines es Tinker, su plataforma alojada de ajuste fino con LoRA, y Inkling-Small está soportado en ella. El almacenamiento de checkpoints cuesta $0.10 por GB al mes; las tarifas de entrenamiento por token no están publicadas en la página de resumen.
Cómo ejecutar Inkling-Small por tu cuenta
Autoalojarlo es la mejora más clara frente al modelo padre, y aquí las cifras no están reñidas.

Las cifras de Unsloth sitúan a Inkling-Small en 543 GB en BF16, luego entre 132 y 170 GB a 4 bits, 128 GB a 3 bits, y 89 GB a 2 bits. El Inkling completo necesita 1.900 GB en BF16 y aun así pide entre 270 y 285 GB incluso con una cuantización de 1 bit. La ficha del modelo enmarca lo mismo en términos de hardware: 600 GB de VRAM agregada para BF16 (4x B300 u 8x H200), que bajan a 180 GB para el checkpoint en NVFP4, es decir, un B300 o un par de H200.
La cifra de 89 GB es la que cambia quién puede ejecutar esto. Eso cabe dentro de una máquina con 128 GB de memoria unificada, que es la compra de una estación de trabajo y no la de un centro de datos. Y como solo 12B de parámetros están activos por token, una compilación fuertemente cuantizada se mantiene utilizable en lugar de arrastrarse.
Los ajustes de muestreo recomendados son temperatura 1.0, top_p 1.0 y min_p 0.0, en un contexto de 1.048.576 tokens. El soporte del primer día cubre transformers, vLLM, SGLang, TokenSpeed, Unsloth y Docker Model Runner, con compilaciones cuantizadas a través de llama.cpp, Ollama, LM Studio y Jan. Una cosa a vigilar: llama.cpp necesita que se integre el PR #25731. Las opciones más amplias de autoalojamiento están en los mejores agentes de IA de código abierto.
Pros y contras
Lo bueno
- Supera a un modelo 3,5 veces mayor en programación y uso de herramientas, además de en seguimiento de instrucciones
- $1.20 por millón de tokens de salida, 3,4 veces más barato que el padre
- 131 tokens por segundo, una velocidad notablemente mayor
- Apache 2.0, así que el autoalojamiento comercial no tiene restricciones
- Funciona con 89 GB cuantizado, dentro del rango de una estación de trabajo
- Entrada nativa de audio e imagen, algo todavía poco común a este precio
- Una sección de limitaciones franca por parte del propio fabricante
Lo que no lo es
- SimpleQA Verified en 20.6%, menos de la mitad que el padre
- AA Omniscience en -9.0, más respuestas incorrectas con confianza que correctas
- Contexto de 1M sobre el papel, pero 524K a través de OpenRouter hoy
- Solo dos proveedores de API, lo que deja la redundancia escasa
- Tau 3 Banking baja a 15.5% desde 23.7%
- Las puntuaciones de audio quedan ligeramente por detrás del padre en las tres pruebas
- Solo salida de texto, así que no genera imagen ni audio
Lo que dice la comunidad
La reacción fue bastante más discreta que el lanzamiento del buque insignia, que atrajo más de 1.200 puntos en Hacker News. El propio hilo de Inkling-Small se quedó en 33. Compararlo con el resto del panorama fue el primer instinto:
"better than haiku 4.5 smaller than nemotron 3 ultra"
El otro comentario lo situaba frente al rival obvio de pesos abiertos, señalando que es "About the same size as DeepSeek Flash 4, but also supports audio and image input." Un encuadre justo. DeepSeek V4 Flash es más barato por token y solo de texto, así que el soporte de audio e imagen es el verdadero factor diferenciador aquí, y el detalle del enfrentamiento directo está en el análisis de Flash.
El comentario más agudo llegó incluso antes de que se publicaran las cuantizaciones, en el envío a Hugging Face:
"I didn't see a gguf yet, going to be most interesting if there's a quant that fits nicely into about 90 [GB] so it can run in 128GB unified memory. It's 12B active so should hopefully be pretty fast at 2 bit quant if it fits"
La compilación de 2 bits de Unsloth acabó en 89 GB. La comunidad de inferencia local acertó la cifra objetivo antes de que existiera el lanzamiento, y dio en el clavo. En su primer mes, el repositorio de Hugging Face acumuló 15.500 descargas.
Una cosa que noté: nadie en esos hilos mencionó en absoluto el retroceso en factualidad. El encuadre del lanzamiento fue velocidad y tamaño, así que de eso se habló.
Qué significa esto si quieres que responda tickets
Aquí seré directo, porque esta parte es literalmente mi trabajo.
Un modelo barato y rápido parece una victoria obvia para el soporte. El volumen de tickets es alto, las respuestas son cortas, y 1.20 dólares por millón de tokens de salida frente a 4.05 son dinero de verdad a escala. Esa es la aritmética detrás de coste de la atención al cliente con IA, y es la misma cuenta que impulsa la comparación con agentes humanos. Los equipos que lo siguen como tarifa unitaria suelen terminar en el coste por resolución.
Pero el soporte es la única carga de trabajo donde el -9.0 en Omniscience se convierte en el número descalificador en lugar de en una nota al pie. Un agente de programación que se inventa una API recibe de vuelta un stack trace. Un agente de soporte que se inventa un plazo de devolución se lo envía en cambio al cliente, por escrito, con tu logo puesto. Los compradores con los que hablo ya lo saben, y es la objeción que sale primero. Un responsable de CX de una marca de suplementos DTC lo dijo de forma bastante directa:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a DTC supplements CX lead, from an eesel sales call
Eso es una petición para una capa, no para un modelo. Hay cuatro cosas que tienen que colocarse entre cualquier modelo y tu cola.
- Retrieval sobre fuentes que tú posees, de modo que las respuestas salgan de tu centro de ayuda y de tickets pasados en lugar de los pesos. Chatbot de base de conocimiento con IA cubre el patrón; en el lado de las herramientas está las mejores herramientas de base de conocimiento con IA.
- Enrutamiento por confianza, de modo que el modelo responda lo que tiene seguro y escale el resto. El lado del enrutamiento es gestión de escalamiento con IA; el traspaso limpio a una persona es traspaso de agente.
- Una prueba en seco antes de salir a producción, simulada contra tus propios tickets históricos y no contra la suite de benchmark de otro. Este es el paso que los equipos se saltan, y también el que atrapa las respuestas incorrectas dichas con confianza.
- Autonomía acotada, empezando como copiloto que redacta borradores antes de responder por su cuenta. Copiloto de IA es la rampa de entrada; deflexión de nivel 1 es a donde se llega, medido según la tasa de deflexión.
Haz esas cuatro cosas y la brecha de factualidad de Inkling-Small deja de ser un pasivo, porque los hechos dejan de salir del modelo. Sáltatelas y lo que has comprado es una fuente rápida, barata y confiada de respuestas plausibles. Esa es la diferencia entre un agente de IA para helpdesk y una clave de API en bruto, y es la misma conclusión a la que llega agentes de IA frente a chatbots de IA desde otra dirección.
También es la razón por la que una buena capa de soporte se mantiene agnóstica respecto al modelo. Inkling-Small no es el primer modelo de este año en convertirse en la opción barata obvia, ni será el último. Cualquier cosa que quede fija a un solo modelo tiene que reconstruirse cada vez que se mueve la clasificación, lo cual es una mala forma de gestionar la automatización de la atención al cliente.
Veredicto
Para la mayoría de tareas, Inkling-Small es la mejor compra frente a su propio padre, y en precio no hay comparación. El mismo nivel de inteligencia según la puntuación independiente. Mejor en programación y en uso de herramientas según las propias cifras del fabricante, 3,4 veces más barato en salida, 1,5 veces más rápido, Apache 2.0, y lo bastante pequeño como para autoalojarlo en una estación de trabajo. Quince días después del buque insignia, el modelo pequeño hizo que el buque insignia fuera difícil de justificar.
El matiz es concreto y fácil de expresar: sabe mediblemente menos, y no se comporta como tal. Dale un compilador, un bucle de herramientas o una capa de retrieval y es excelente. Pídele que sea la fuente de la verdad y se equivocará con confianza.
Si lo quieres para código o agentes, adóptalo hoy mismo. Si lo quieres cerca de los clientes, presupuesta la capa que va encima de él, no solo los tokens.
Para el panorama más amplio de qué más encaja en este hueco, empieza con alternativas a Inkling. El rival más cercano en precio y tamaño tiene su propio desglose en análisis de Kimi K3.
Y si el trabajo real es ordenar una bandeja de entrada en lugar de escribir código, triaje de tickets de soporte es la lectura más útil, con deflexión de tickets cubriendo lo que ocurre después de ese triaje.
Prueba eesel
¿Elegiste Inkling-Small y ahora necesitas que responda tickets reales con seguridad? Ese hueco es exactamente lo que eesel cierra. Se conecta a Zendesk, Freshdesk, Gorgias o el helpdesk que uses en cuestión de minutos, aprende de tus tickets resueltos y de tu centro de ayuda en lugar de los pesos del modelo, y luego responde solo aquello de lo que está seguro y deja el resto para tu equipo. Antes de que toque una cola real puedes simularlo contra tu propio historial de tickets y ver las respuestas reales que habría enviado, que es la comprobación que una puntuación de factualidad de -9.0 hace innegociable. También se mantiene agnóstico respecto al modelo, así que el próximo modelo barato es un cambio de configuración y no una reconstrucción.

Gratis para probar, y con facturación según el uso, así que puedes revisar los precios antes de comprometerte. Prueba eesel o mira cómo encaja como software de atención al cliente con IA.
Sources
- Inkling-Small model card
- Introducing Inkling-Small
- Inkling model card
- Inkling-Small on Hugging Face
- Artificial Analysis: Inkling-Small
- Artificial Analysis: Inkling
- Unsloth: running Inkling locally
- OpenRouter: Inkling-Small
- Tinker fine-tuning platform
- Hacker News: Inkling-Small
- Hacker News: Hugging Face submission
Preguntas frecuentes
¿Vale la pena Inkling-Small?
¿Es Inkling-Small mejor que Inkling?
¿Cuánto cuesta Inkling-Small?
¿Se puede ejecutar Inkling-Small en local?
¿Es Inkling-Small bueno para la atención al cliente?
¿Cuál es la ventana de contexto de Inkling-Small?
¿Es Inkling-Small gratuito y de código abierto?
thinkingmachines/Inkling-Small, así que puedes alojarlo tú mismo y usarlo comercialmente. Descargarlo gratis no significa que ejecutarlo sea gratis, y la factura del hardware sustituye a la de los tokens. Thinking Machines también vende acceso a través de Tinker, su plataforma alojada de ajuste fino.¿Quién crea Inkling-Small y cuándo se lanzó?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







