
Qué es realmente Inkling-Small
Thinking Machines Lab es la empresa de Mira Murati, y su modelo de negocio consiste en regalar los pesos y vender las herramientas alrededor. Inkling-Small es el segundo modelo que sale a la calle: Apache 2.0, publicado en Hugging Face como thinkingmachines/Inkling-Small, y descargado unas 15.500 veces en su primer mes.
El proveedor lo llama "un cuarto del tamaño" del original, y por una vez la cifra de marketing se sostiene. El padre tiene 975B totales / 41B activos en 66 capas. Este tiene 276B totales / 12B activos en 42 capas. Eso está realmente cerca de un cuarto en ambos aspectos.

La arquitectura es un Mixture-of-Experts bastante agresivo. Cada capa contiene 256 expertos, y el enrutador elige 6 de ellos por token, más 2 expertos compartidos que siempre están activos. La atención es híbrida, alternando capas locales y globales, y los pesos se distribuyen tanto en BF16 como en NVFP4. El entrenamiento se ejecutó en hardware NVIDIA GB300 NVL72.
La consecuencia práctica de esta forma: pagas 276B en memoria y 12B en cómputo. Ese es todo el truco, y por eso un modelo con un cuarto de billón de parámetros puede servir más rápido que un modelo denso de una décima parte de su tamaño. Si el vocabulario de MoE es nuevo para ti, la mecánica se generaliza a la mayoría de los agentes de IA de código abierto actuales.
También hay un dial de esfuerzo de razonamiento que va de 0 a 0,99, con los puntos sugeridos por el proveedor en 0,2 para bajo, 0,7 para medio y 0,99 para máximo. Es un control sobre cuánto tiempo piensa el modelo antes de responder, y mueve tu factura de tokens más que cualquier otro ajuste que toques.
Qué entra, y qué sale
Esta es la parte que la gente entiende peor con más frecuencia, así que vale la pena ser directo.

Las entradas son texto, imágenes entre 40 y 4096 píxeles, y audio como WAV de 16kHz de menos de dos minutos. La salida es solo texto. No hay síntesis de voz en este modelo.
Eso importa si estabas planeando una línea telefónica. Un modelo que oye audio pero no puede hablar es solo la mitad de un pipeline de voz, y aún necesitas texto a voz, telefonía, gestión de barge-in y detección de turnos por encima. Si ese es el proyecto, el panorama de proveedores en empresas de voz con IA es un mejor punto de partida que un modelo en crudo.
La comprensión de audio es también la única capacidad en la que el modelo pequeño perdió terreno frente a su padre en todos los frentes: VoiceBench 90,1 frente a 91,4, Audio MC 54,9 frente a 56,6, MMAU 77,0 frente a 77,2. Las brechas son pequeñas, pero todas apuntan en la misma dirección.
La ventana de contexto en la que nadie se pone de acuerdo
Aquí hay un hallazgo verificable que llevó dos minutos y ahorra una tarde entera.
La ficha del modelo dice que la ventana de contexto es de 1M de tokens. OpenRouter, uno de los únicos dos proveedores que lo ofrecen, lo aloja a 524.288 tokens. Eso es exactamente la mitad, lo que indica que es una decisión de alojamiento deliberada y no una errata.
Ninguna de las dos cifras es mentira. Una describe lo que la arquitectura puede direccionar, la otra describe lo que un endpoint concreto aceptará hoy. El patrón de fallo es diseñar un pipeline de relleno de documentos contra la cifra de la ficha y chocar con un muro en producción. Si estás construyendo algo que se apoya en una ventana larga, lee el límite en el endpoint que realmente estás llamando. La misma trampa atrapa a la gente que usa agentes de codificación, por lo que escribí sobre el tamaño de la ventana de contexto por separado.
El número de proveedores es el otro punto débil: 2 proveedores, frente a 4 del modelo padre. Para un modelo que va cinco días en su segunda semana, es de esperar, pero significa menos margen para fallar sin quedarse sin servicio.
Cuánto cuesta
El precio de la salida está asentado. 1,20 $ por 1M de tokens de salida, confirmado por el proveedor, Artificial Analysis y OpenRouter. Frente a los 4,05 $ del padre, ese es el titular.
El precio de la entrada no está asentado, y prefiero decírtelo así que elegir una cifra y parecer seguro:
| Fuente | Entrada por 1M | Salida por 1M |
|---|---|---|
| Artificial Analysis | 0,30 $ | 1,20 $ |
| Página del modelo en OpenRouter | 0,45 $ | 1,20 $ |
| Respuesta de la API de OpenRouter | 0,50 $ | 1,20 $ |
| Modelo padre (Inkling) | referencia | 4,05 $ |
Presupuesta contra 0,50 $ y nada te sorprenderá. En base combinada, Artificial Analysis sitúa a Inkling-Small en 0,22 $ por 1M frente a 0,72 $ del padre, así que aproximadamente un tercio del coste para el mismo nivel de inteligencia.
La velocidad es la mitad menos valorada del trato. 131,1 tokens de salida por segundo frente a los 84,8 del padre, con un tiempo hasta el primer token de 1,65 s frente a 1,82 s. En su Intelligence Index, el modelo pequeño puntúa 40 y se clasifica 15º de 101, frente a 41 y 13º del padre. Mismo nivel, más rápido, más barato. Es una combinación inusual y la razón principal para prestarle atención a este lanzamiento.
El ajuste fino se ejecuta a través de la propia plataforma Tinker de Thinking Machines, que soporta el modelo. Las tarifas de entrenamiento por token no están publicadas en ningún sitio que haya podido encontrar, y la página de precios en tinker-docs.thinkingmachines.ai/pricing actualmente devuelve un 404. El almacenamiento de checkpoints cuesta 0,10 $ por GB al mes. Si el ajuste fino es el plan, el compromiso frente a la recuperación (retrieval) está explicado en RAG versus fine-tuning.
Ejecutarlo tú mismo
Aquí es donde se pone a prueba lo "gratis" de los pesos gratuitos. Las compilaciones cuantizadas de Unsloth ponen cifras reales sobre esto, y la cifra de 2 bits es la interesante: 89 GB, que encaja en una caja de 128 GB de memoria unificada.
Hay un detalle bonito en la discusión de lanzamiento. Un comentarista de Hacker News, andy99, dijo que esperaba algo alrededor de 90 GB antes de que se publicara ninguna cuantización. Unsloth aterrizó en 89.
Justo en el límite: 3 bits (128 GB)
Demasiado grande: 4 bits (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Demasiado grande: 4 bits empieza en 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Demasiado grande: BF16 (543 GB)
Sugerencia de la ficha: 4x B300 u 8x H200 para BF16
Entrada: 0,30 $ a 0,50 $ por 1M, según la fuente
Proveedores: 2 hoy
Dos notas de mantenimiento si vas a lo local. El muestreo debería ser temperatura 1,0, top_p 1,0, min_p 0,0, lo cual es lo bastante inusual como para merecer anotarlo. Y el soporte de llama.cpp llegó vía el PR #25731, así que comprueba que tu build lo incluya antes de depurar problemas fantasma.
Dónde encaja, y dónde realmente no
En la propia tabla comparativa de su fabricante, el modelo pequeño supera a su padre de 975B en la mayoría de lo que llamarías ejecución. SWEBench Verified 80,2 frente a 77,6, SWEBench Pro 55,9 frente a 54,3, Terminal Bench 2.1 en 64,7 frente a 63,8, Toolathlon 54,4 frente a 45,5, MCP Atlas 79,6 frente a 76,0, GPQA 89,5 frente a 87,2, IFBench 82,2 frente a 79,8.
Luego está la otra columna. AIME baja a 95,5 desde 97,1. Global-MMLU-Lite cae a 86,7 desde 88,7, lo que vale la pena señalar si estabas planeando un agente de soporte multilingüe sobre él. Y Tau 3 Banking cae a 15,5 desde 23,7, la regresión individual más pronunciada de la hoja, en un benchmark específicamente sobre uso de herramientas en múltiples turnos en un entorno de cara al cliente.
El par que más importa para cualquiera que piense en trabajo de soporte es SimpleQA Verified en 20,6% frente al 43,9% del padre, junto con una puntuación de Omniscience de -9,0 frente a +2,1 del padre. Una puntuación de Omniscience negativa significa que el modelo se equivoca con más confianza de la que tiene razón. Nadie en los hilos de lanzamiento lo mencionó, lo cual es una pena, porque es el número más relevante para la decisión en todo el lanzamiento.
Quiero ser justo aquí, porque esto es una decisión de diseño y no un defecto. Un modelo con 12B activos tiene menos espacio para memorizar el mundo que uno con 41B activos, y Thinking Machines claramente gastó ese espacio en razonamiento y uso de herramientas en su lugar. Si tu modelo va a buscar información de todos modos, el trivial memorizado es peso muerto. Esa es la apuesta correcta para un agente.
Es la apuesta equivocada para un bot que responde preguntas de memoria. Esta es exactamente la forma de fallo que he visto ocurrir en vivo. Un equipo de soporte técnico B2B con el que trabajé descubrió que su bot confirmaba "sí, soportamos su modelo de vehículo" para vehículos que no estaban en su base de datos, porque el centro de ayuda decía que la empresa soportaba todos los modelos. El modelo no estaba roto. Estaba haciendo inferencia confiada sobre una fuente vaga, que es lo que predice una puntuación de Omniscience negativa. Escribí el patrón completo en prevención de alucinaciones.
Así que la lectura honesta: usa Inkling-Small donde una capa de recuperación suministre los hechos y el modelo suministre el razonamiento. No lo uses como fuente de verdad.
Lo que significa que la calidad de tus fuentes se convierte en el límite de la precisión del modelo, y elegirlas bien es una palanca mayor que elegir el checkpoint. Mi repaso de herramientas de base de conocimiento es el punto de partida práctico.
Qué significa esto si vas a poner IA en una cola de soporte
Un modelo es un motor, no un coche. Esa distinción es el núcleo de agentes de IA frente a chatbots, y por eso una tabla de benchmarks te dice tan poco sobre una cola.
La brecha entre "esto puntúa bien en benchmarks" y "esto responde a mis clientes" es el producto entero, y está formada en su mayoría por partes poco glamurosas:
- Fundamentación (grounding). El modelo necesita leer tu centro de ayuda, tus macros y tus tickets resueltos, no sus datos de entrenamiento. Ese es el trabajo de una capa como un chatbot de base de conocimiento con IA.
- Enrutamiento por confianza. Algo tiene que decidir cuándo el modelo no debería responder en absoluto, que es el núcleo de la gestión de escalado con IA.
- Un ensayo (dry run). Quieres conocer la tasa de resolución antes de que la conozcan los clientes, no después. La simulación contra tu propio historial de tickets es la única forma honesta de obtener esa cifra.
- Traspaso (handoff). Cuando la IA se detiene, un humano continúa la conversación con contexto completo, según las mejores prácticas de traspaso. La versión más suave de esto es un copiloto de IA, donde el modelo redacta y un humano envía.
- Medición. La tasa de desvío (deflection) es la cifra que decide si todo esto funcionó. Tradúcela a dinero con el coste por resolución.
- Cobertura. Saber qué temas debería asumir la IA en absoluto es su propio ejercicio, explicado en esta guía de desvío de tickets.
Una responsable de CX de suplementos DTC con la que hablé formuló el requisito en una frase: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone." Ningún checkpoint de modelo te da eso. Un umbral de confianza y una regla de enrutamiento sí, dentro de cualquier sistema de tickets con IA que ya uses.
El lado de las métricas de esta decisión merece leerse por separado, porque "resuelto" significa cosas distintas para equipos distintos. Empieza con métricas de soporte, luego resolución en el primer contacto.
Esa es también la respuesta a la pregunta de construir versus comprar que un checkpoint gratuito Apache 2.0 plantea de forma natural. Los pesos son la parte más barata del proyecto. Los 0,50 $ por millón de tokens de entrada son la parte más barata del proyecto. Las partes caras son el pipeline de recuperación, el arnés de evaluación, la lógica de escalado y la persona que mantiene las tres el próximo trimestre.

¿Quieres usar un modelo así en tickets reales?
Si el precio y la velocidad de Inkling-Small te llamaron la atención, lo que realmente quieres es esa economía envuelta en barreras de seguridad. eesel se conecta a Zendesk, Freshdesk y el resto de tu stack, entrena con tus tickets pasados y tu centro de ayuda en lugar de con la memoria de un modelo, y te deja simular todo el proceso contra tu historial de tickets antes de que un solo cliente lo vea. Tú fijas el umbral de confianza; todo lo que quede por debajo va a un humano con contexto adjunto. Gratis para probar, y verás tu propia tasa de resolución antes de comprometerte.
Cómo se compara con las otras opciones de pesos abiertos
El nivel de pesos abiertos está abarrotado y las diferencias son más estrechas de lo que sugieren los posts de lanzamiento.
| Inkling-Small | Inkling (padre) | DeepSeek V4 Flash | |
|---|---|---|---|
| Parámetros | 276B / 12B activos | 975B / 41B activos | tamaño comparable |
| Entradas | texto, imagen, audio | texto, imagen, audio | solo texto |
| Salida por 1M | 1,20 $ | 4,05 $ | menor |
| Velocidad | 131,1 tok/s | 84,8 tok/s | muy rápida |
| AA Intelligence Index | 40 (#15) | 41 (#13) | ver review |
La lectura de la comunidad fue corta y razonablemente acertada. El hilo principal de Hacker News atrajo solo 33 puntos y dos comentarios, uno de los cuales señaló que es "About the same size as DeepSeek Flash 4, but also supports audio and image input." Ese es el diferenciador en una línea: entrada multimodal a precio de modelo pequeño.
El vecino más cercano en precio y forma es DeepSeek V4 Flash, que lo supera en precio por token pero solo acepta texto.
En el otro extremo del rango, Kimi K3 cobra tarifas de frontera por pesos abiertos, lo que hace que los 1,20 $ de Inkling-Small parezcan generosos en comparación.
Si quieres la versión en forma de veredicto de este artículo en lugar de la explicativa, esa es la review de Inkling-Small. El padre de 975B tiene también su propio artículo explicativo de Inkling.
Otros dos que vale la pena revisar antes de decidir: mi review de Inkling cubre el problema de precios del padre, y alternativas a Inkling mapea el campo más amplio.
Cifras de seguridad, para completar: StrongREJECT 98,4, FORTRESS 71,6 y 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 frente a 1238 del padre.
Mi conclusión
Inkling-Small es el más interesante de los dos lanzamientos de Inkling, y lo digo como alguien que quedó poco impresionado con el precio del primero. Es más rápido y cuesta aproximadamente un tercio de un modelo al que en su mayoría supera, acepta audio e imágenes, y con 89 GB cuantizado es el primer modelo de esta clase que un equipo pequeño puede poseer por completo.
Las salvedades son específicas, no vagas. Lee el límite de contexto real de tu proveedor en lugar del de la ficha. Presupuesta la entrada a 0,50 $. Y no lo trates como fuente de conocimiento, porque una puntuación de Omniscience de -9,0 te está diciendo, por adelantado, que se equivocará con confianza.
Para cualquier cosa de cara al cliente, el modelo es la decisión fácil. La capa de automatización alrededor de él es la que determina si funciona, y eso sigue siendo cierto sea cual sea el checkpoint que gane el mes que viene.
Si este artículo te tiene sopesando un despliegue en lugar de una descarga, empieza con desvío de tier 1. Luego resuelve dónde el modelo no debería responder en absoluto, que es el trabajo del triaje de tickets.
Fuentes
- Ficha del modelo de Thinking Machines Lab,
thinkingmachines/Inkling-Smallen Hugging Face (arquitectura, tabla de benchmarks, recomendaciones de hardware, ajustes de muestreo) - Artificial Analysis (Intelligence Index, rendimiento, TTFT, precios combinados, Omniscience)
- Página del modelo y API de OpenRouter (ventana de contexto servida, precios de entrada, número de proveedores)
- Tamaños de las compilaciones cuantizadas de Unsloth
- Hilo de lanzamiento en Hacker News
- eesel Customer Voice Dossier (GENERAL BYTES, con permiso; extractos anonimizados de soporte técnico B2B y de suplementos DTC)
Preguntas frecuentes
¿Qué es Inkling-Small?
¿Inkling-Small es gratuito y de código abierto?
¿Cuánto cuesta Inkling-Small?
¿Cuál es la ventana de contexto de Inkling-Small?
¿Puedo ejecutar Inkling-Small localmente?
¿Es Inkling-Small bueno para atención al cliente?
¿Cómo se compara Inkling-Small con DeepSeek V4 Flash y Kimi K3?
¿Qué hardware necesita Inkling-Small?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







