Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small

Inkling-Small en 30 segundos

Lanzamiento30 de julio de 2026, quince días después de Inkling
FabricanteThinking Machines Lab (Mira Murati)
Tamaño276B total, 12B activos, 42 capas
LicenciaApache 2.0, pesos en Hugging Face
Contexto1M de tokens según la ficha, 524K vía OpenRouter
EntradasTexto, imagen, audio (WAV a 16 kHz)
Precio de APIDe $0.30 a $0.50 de entrada, $1.20 de salida por 1M
Suelo para autoalojarlo89 GB con cuantización de 2 bits
Mejor enProgramación, uso de herramientas, bucles de agentes, contexto largo
Más débil enRecuperación factual sin retrieval

Qué es en realidad Inkling-Small

Lo interesante está en la arquitectura, y eso explica ambas mitades de los resultados.

Inkling-Small es un transformador solo de decodificador de 42 capas con una estructura feed-forward dispersa de mezcla de expertos (mixture-of-experts). Cada token se enruta a 6 de 256 expertos, más 2 expertos compartidos que se activan en todos y cada uno de los tokens. El total de parámetros llega a 276B; solo 12B de esos están activos por token. La ficha del modelo confirma capas de atención híbridas locales y globales, numérica en BF16 y NVFP4, y entrenamiento en sistemas NVIDIA GB300 NVL72.

Compáralo con el padre. Inkling tiene 975B en total y 41B activos repartidos en 66 capas, así que la forma del enrutado es la misma, pero con aproximadamente una cuarta parte de la masa total y menos de un tercio de la masa activa. Thinking Machines describe el resultado como "un rendimiento comparable a Inkling con una cuarta parte de su tamaño."

Esa proporción es toda la historia aquí. Una gran proporción de total frente a activo es lo que hace que un modelo sea barato de servir, y un total de parámetros pequeño es lo que lo vuelve olvidadizo. Inkling-Small apostó fuerte por lo primero y pagó el precio en lo segundo. Para la versión general de ese mecanismo, modelos de IA personalizados recorre el mismo intercambio sin todas las tablas de benchmarks.

Toma texto, luego imágenes (entre 40 y 4096 píxeles funciona mejor), y audio en WAV a 16 kHz, idealmente de menos de dos minutos. La salida es solo texto. El esfuerzo de razonamiento es un dial de 0 a 0.99, donde bajo es 0.2, medio se sitúa en 0.7 y máximo es 0.99, así que por cada llamada puedes intercambiar tokens de pensamiento por latencia.

La entrada de audio nativa es lo más raro de esa lista, por lo que este modelo sigue apareciendo en conversaciones sobre voz. Vale la pena señalar el límite: entra audio, sale texto, así que aquí no hay síntesis de voz en absoluto. Los proveedores que sí cierran ese círculo están cubiertos en empresas de voz con IA.

¿Para qué tarea es adecuado Inkling-Small?

La respuesta cambia mucho según la carga de trabajo, y para cada una la propia tabla del fabricante aporta la evidencia. Elige la tarea que realmente tienes:

¿Inkling-Small o el Inkling completo?

Elige tu carga de trabajo. Los números vienen de las fichas de modelo de Thinking Machines para ambos modelos.

Elige el modelo pequeño

Gana claramente, y además te quedas con tokens de salida 3,4 veces más baratos. Aquí no hay ninguna razón para pagar por el modelo grande.

BenchmarkSmallInkling
SWEBench Verified80.2%77.6%
SWEBench Pro55.9%54.3%
Terminal Bench 2.164.7%63.8%
Elige el modelo pequeño

La diferencia en Toolathlon es de casi nueve puntos, mucho para un modelo tan barato. Los bucles de agentes largos son donde esa diferencia de precio se acumula.

BenchmarkSmallInkling
Toolathlon Verified54.4%45.5%
MCP Atlas79.6%76.0%
GDPval-AA v2 (Elo)12691238
Anclarlo, o ir a por el grande

Este es el único sitio donde el recorte de tamaño realmente se nota. Una puntuación negativa en Omniscience significa que las respuestas incorrectas con confianza superan a las correctas, así que dale acceso a retrieval sobre tus propias fuentes o usa el modelo más grande.

BenchmarkSmallInkling
SimpleQA Verified20.6%43.9%
AA Omniscience-9.0+2.1
Global-MMLU-Lite86.7%88.7%
Suficientemente cerca como para no importar

El padre supera por poco en AIME, el pequeño supera por poco en GPQA. Ambos son lo bastante altos como para que la diferencia de precio decida.

BenchmarkSmallInkling
AIME 202695.5%97.1%
GPQA Diamond89.5%87.2%
HLE (text only)31.6%29.7%
Ligera ventaja para el padre

El audio es la única modalidad donde reducir el tamaño costó algo medible pero pequeño. Ambos modelos aceptan WAV a 16 kHz de forma nativa, algo todavía poco habitual.

BenchmarkSmallInkling
VoiceBench90.1%91.4%
Audio MC54.9%56.6%
MMAU77.0%77.2%

Los benchmarks: de verdad supera a su padre

Un modelo destilado o reducido normalmente queda un poco por detrás del buque insignia del que proviene. Inkling-Small no, al menos no en las categorías por las que la mayoría de la gente elige un modelo.

Scorecard showing where Inkling-Small beats and trails its larger parent model
Scorecard showing where Inkling-Small beats and trails its larger parent model

En programación se lleva SWEBench Verified con 80.2% frente a 77.6%, luego SWEBench Pro con 55.9% frente a 54.3%, con Terminal Bench 2.1 en 64.7% frente a 63.8%. En el lado agéntico se lleva Toolathlon Verified con 54.4% frente a 45.5% y MCP Atlas con 79.6% frente a 76.0%, además de un Elo de GDPval-AA v2 de 1269 frente a 1238. En razonamiento general se lleva GPQA Diamond con 89.5% frente a 87.2%, y Humanity's Last Exam con 31.6% frente a 29.7% en la versión solo de texto.

También publica cifras que la ficha del padre ni siquiera reporta. SciCode 48.7%, CritPt 8.3%, y luego ARC-AGI-1 con 84.0% y ARC-AGI-2 con 40.1%. En seguimiento de instrucciones, IFBench llega a 82.2% frente a 79.8%, y eso importa más de lo que parece para cualquier cosa que tenga que obedecer un prompt de sistema de forma fiable. Si ese es el eje que te importa, agente de IA frente a chatbot basado en reglas explica por qué en producción la obediencia gana a la inteligencia bruta.

Las pérdidas en el lado del razonamiento son reales, pero estrechas. AIME 2026 baja a 95.5% desde 97.1%. Tau 3 Banking baja a 15.5% desde 23.7%, que es el retroceso más marcado de todo el bloque agéntico, y vale la pena tenerlo en cuenta si tu carga de trabajo se parece a flujos financieros estructurados.

Otro resultado merece una advertencia, porque es fácil pasarlo por alto. Global-MMLU-Lite, la prueba multilingüe, baja a 86.7% desde 88.7%. Una caída de dos puntos, así que nada dramático, pero apunta en la misma dirección que las cifras de factualidad: el recorte salió de la amplitud del conocimiento. Si atiendes a varios idiomas, prueba en cada uno de ellos en lugar de fiarte del agregado, y agentes de soporte multilingües explica cómo se ve esa prueba en la práctica.

De forma independiente, Artificial Analysis lo puntúa con 40 en su Intelligence Index, en el puesto #15 de 101, frente a 41 y el puesto #13 del Inkling completo. Un punto de índice de diferencia, con un cuarto del tamaño. Que la puntuación del fabricante y la de un tercero independiente lleguen a la misma conclusión es poco habitual, y es lo más contundente de todo este análisis.

El número que debería hacerte parar

Aquí está la parte que no apareció en la publicación de lanzamiento.

SimpleQA Verified, que comprueba si un modelo conoce respuestas factuales breves, marca 20.6% para Inkling-Small frente a 43.9% para Inkling. Menos de la mitad. Y AA Omniscience, que compensa las respuestas correctas contra las incorrectas dichas con confianza, marca -9.0 frente al +2.1 del modelo padre.

Una puntuación negativa en Omniscience significa que el modelo afirma más cosas incorrectas con confianza que cosas correctas. Este no es un modelo que dice "no estoy seguro". Es un modelo que rellena el hueco. Thinking Machines lo enumera ellos mismos entre las limitaciones conocidas, nombrando "alucinación (generar contenido plausible pero factualmente incorrecto o sin respaldo)" y "rendimiento degradado en conversaciones largas de varios turnos", y recomiendan no desplegarlo en contextos médicos, legales o de seguridad crítica sin un ajuste fino adicional. Hay que reconocerles el mérito: es una sección de limitaciones más franca que la que la mayoría de laboratorios se molesta en publicar.

Para un agente de programación esto apenas importa, ya que el compilador hace de verificador de hechos. Para cualquier cosa de cara al cliente sí importa, y mucho, y yo mismo he visto este fallo en producción. Un equipo de soporte con el que trabajé tenía una base de conocimiento que decía que daban soporte a todos los modelos de vehículos, así que su bot confirmaba alegremente cobertura para marcas de coches que ni siquiera estaban en su base de datos. Nada alucinado en el sentido dramático. El modelo simplemente rellenó un hueco con algo plausible. Ese equipo describió su configuración inicial como "prueba y error al principio."

Un modelo con -9.0 en Omniscience es ese mismo fallo con el volumen subido. Las mitigaciones son conocidas y poco vistosas: retrieval sobre fuentes que controlas, citas que una persona puede verificar, y una ruta de rechazo. Alucinaciones de IA en soporte cubre el conjunto completo, y la versión práctica más corta es prevención de alucinaciones de IA.

Precio y velocidad: la razón real para prestarle atención

Aquí es donde el modelo pequeño se gana su lugar en el mundo.

Inkling-SmallInkling
Entrada por 1M$0.30 a $0.50$1.00
Salida por 1M$1.20$4.05
Mixto (AA)$0.22$0.72
Velocidad de salida131.1 tok/s84.8 tok/s
Tiempo al primer token1.65 s1.82 s
Proveedores24
AA Intelligence Index4041

Los tokens de salida cuestan 3,4 veces menos y llegan 1,5 veces más rápido, a cambio de un punto de índice de inteligencia. Para bucles de agentes, donde los tokens de salida dominan la factura y la latencia se acumula a lo largo de docenas de turnos, esa no es una diferencia marginal. También se refleja en las cifras que un equipo de soporte realmente reporta, porque los primeros tokens más rápidos mueven la resolución en el primer contacto junto con el resto de las métricas de atención al cliente que se derivan de ella.

Dos advertencias antes de que te pongas a presupuestar con esto. El precio de entrada aún no está cerrado: Artificial Analysis indica $0.30 por 1M, mientras que el listado de OpenRouter muestra $0.45 y su API devuelve $0.50, así que comprueba tu propia ruta. Además, por ahora solo hay dos proveedores, frente a cuatro del padre, y eso es escaso si necesitas redundancia.

La segunda advertencia es la más sorprendente. La ficha del modelo dice 1M de contexto. OpenRouter lo sirve actualmente a 524.288 tokens, exactamente la mitad. Los pesos soportan la ventana completa, la API enrutada simplemente todavía no la expone. Si el millón de tokens es la razón por la que elegiste este modelo, aloja tú mismo o verifica con tu proveedor primero. Tamaño de la ventana de contexto explica por qué el número anunciado y el número realmente usable divergen tan a menudo.

El negocio real de Thinking Machines es Tinker, su plataforma alojada de ajuste fino con LoRA, y Inkling-Small está soportado en ella. El almacenamiento de checkpoints cuesta $0.10 por GB al mes; las tarifas de entrenamiento por token no están publicadas en la página de resumen.

Cómo ejecutar Inkling-Small por tu cuenta

Autoalojarlo es la mejora más clara frente al modelo padre, y aquí las cifras no están reñidas.

Memory ladder showing Inkling-Small quantization sizes against a 128 GB workstation limit
Memory ladder showing Inkling-Small quantization sizes against a 128 GB workstation limit

Las cifras de Unsloth sitúan a Inkling-Small en 543 GB en BF16, luego entre 132 y 170 GB a 4 bits, 128 GB a 3 bits, y 89 GB a 2 bits. El Inkling completo necesita 1.900 GB en BF16 y aun así pide entre 270 y 285 GB incluso con una cuantización de 1 bit. La ficha del modelo enmarca lo mismo en términos de hardware: 600 GB de VRAM agregada para BF16 (4x B300 u 8x H200), que bajan a 180 GB para el checkpoint en NVFP4, es decir, un B300 o un par de H200.

La cifra de 89 GB es la que cambia quién puede ejecutar esto. Eso cabe dentro de una máquina con 128 GB de memoria unificada, que es la compra de una estación de trabajo y no la de un centro de datos. Y como solo 12B de parámetros están activos por token, una compilación fuertemente cuantizada se mantiene utilizable en lugar de arrastrarse.

Los ajustes de muestreo recomendados son temperatura 1.0, top_p 1.0 y min_p 0.0, en un contexto de 1.048.576 tokens. El soporte del primer día cubre transformers, vLLM, SGLang, TokenSpeed, Unsloth y Docker Model Runner, con compilaciones cuantizadas a través de llama.cpp, Ollama, LM Studio y Jan. Una cosa a vigilar: llama.cpp necesita que se integre el PR #25731. Las opciones más amplias de autoalojamiento están en los mejores agentes de IA de código abierto.

Pros y contras

Lo bueno

  • Supera a un modelo 3,5 veces mayor en programación y uso de herramientas, además de en seguimiento de instrucciones
  • $1.20 por millón de tokens de salida, 3,4 veces más barato que el padre
  • 131 tokens por segundo, una velocidad notablemente mayor
  • Apache 2.0, así que el autoalojamiento comercial no tiene restricciones
  • Funciona con 89 GB cuantizado, dentro del rango de una estación de trabajo
  • Entrada nativa de audio e imagen, algo todavía poco común a este precio
  • Una sección de limitaciones franca por parte del propio fabricante

Lo que no lo es

  • SimpleQA Verified en 20.6%, menos de la mitad que el padre
  • AA Omniscience en -9.0, más respuestas incorrectas con confianza que correctas
  • Contexto de 1M sobre el papel, pero 524K a través de OpenRouter hoy
  • Solo dos proveedores de API, lo que deja la redundancia escasa
  • Tau 3 Banking baja a 15.5% desde 23.7%
  • Las puntuaciones de audio quedan ligeramente por detrás del padre en las tres pruebas
  • Solo salida de texto, así que no genera imagen ni audio

Lo que dice la comunidad

La reacción fue bastante más discreta que el lanzamiento del buque insignia, que atrajo más de 1.200 puntos en Hacker News. El propio hilo de Inkling-Small se quedó en 33. Compararlo con el resto del panorama fue el primer instinto:

Hacker News

"better than haiku 4.5 smaller than nemotron 3 ultra"

El otro comentario lo situaba frente al rival obvio de pesos abiertos, señalando que es "About the same size as DeepSeek Flash 4, but also supports audio and image input." Un encuadre justo. DeepSeek V4 Flash es más barato por token y solo de texto, así que el soporte de audio e imagen es el verdadero factor diferenciador aquí, y el detalle del enfrentamiento directo está en el análisis de Flash.

El comentario más agudo llegó incluso antes de que se publicaran las cuantizaciones, en el envío a Hugging Face:

Hacker News

"I didn't see a gguf yet, going to be most interesting if there's a quant that fits nicely into about 90 [GB] so it can run in 128GB unified memory. It's 12B active so should hopefully be pretty fast at 2 bit quant if it fits"

La compilación de 2 bits de Unsloth acabó en 89 GB. La comunidad de inferencia local acertó la cifra objetivo antes de que existiera el lanzamiento, y dio en el clavo. En su primer mes, el repositorio de Hugging Face acumuló 15.500 descargas.

Una cosa que noté: nadie en esos hilos mencionó en absoluto el retroceso en factualidad. El encuadre del lanzamiento fue velocidad y tamaño, así que de eso se habló.

Qué significa esto si quieres que responda tickets

Aquí seré directo, porque esta parte es literalmente mi trabajo.

Un modelo barato y rápido parece una victoria obvia para el soporte. El volumen de tickets es alto, las respuestas son cortas, y 1.20 dólares por millón de tokens de salida frente a 4.05 son dinero de verdad a escala. Esa es la aritmética detrás de coste de la atención al cliente con IA, y es la misma cuenta que impulsa la comparación con agentes humanos. Los equipos que lo siguen como tarifa unitaria suelen terminar en el coste por resolución.

Pero el soporte es la única carga de trabajo donde el -9.0 en Omniscience se convierte en el número descalificador en lugar de en una nota al pie. Un agente de programación que se inventa una API recibe de vuelta un stack trace. Un agente de soporte que se inventa un plazo de devolución se lo envía en cambio al cliente, por escrito, con tu logo puesto. Los compradores con los que hablo ya lo saben, y es la objeción que sale primero. Un responsable de CX de una marca de suplementos DTC lo dijo de forma bastante directa:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

a DTC supplements CX lead, from an eesel sales call

Eso es una petición para una capa, no para un modelo. Hay cuatro cosas que tienen que colocarse entre cualquier modelo y tu cola.

  1. Retrieval sobre fuentes que tú posees, de modo que las respuestas salgan de tu centro de ayuda y de tickets pasados en lugar de los pesos. Chatbot de base de conocimiento con IA cubre el patrón; en el lado de las herramientas está las mejores herramientas de base de conocimiento con IA.
  2. Enrutamiento por confianza, de modo que el modelo responda lo que tiene seguro y escale el resto. El lado del enrutamiento es gestión de escalamiento con IA; el traspaso limpio a una persona es traspaso de agente.
  3. Una prueba en seco antes de salir a producción, simulada contra tus propios tickets históricos y no contra la suite de benchmark de otro. Este es el paso que los equipos se saltan, y también el que atrapa las respuestas incorrectas dichas con confianza.
  4. Autonomía acotada, empezando como copiloto que redacta borradores antes de responder por su cuenta. Copiloto de IA es la rampa de entrada; deflexión de nivel 1 es a donde se llega, medido según la tasa de deflexión.

Haz esas cuatro cosas y la brecha de factualidad de Inkling-Small deja de ser un pasivo, porque los hechos dejan de salir del modelo. Sáltatelas y lo que has comprado es una fuente rápida, barata y confiada de respuestas plausibles. Esa es la diferencia entre un agente de IA para helpdesk y una clave de API en bruto, y es la misma conclusión a la que llega agentes de IA frente a chatbots de IA desde otra dirección.

También es la razón por la que una buena capa de soporte se mantiene agnóstica respecto al modelo. Inkling-Small no es el primer modelo de este año en convertirse en la opción barata obvia, ni será el último. Cualquier cosa que quede fija a un solo modelo tiene que reconstruirse cada vez que se mueve la clasificación, lo cual es una mala forma de gestionar la automatización de la atención al cliente.

Veredicto

Para la mayoría de tareas, Inkling-Small es la mejor compra frente a su propio padre, y en precio no hay comparación. El mismo nivel de inteligencia según la puntuación independiente. Mejor en programación y en uso de herramientas según las propias cifras del fabricante, 3,4 veces más barato en salida, 1,5 veces más rápido, Apache 2.0, y lo bastante pequeño como para autoalojarlo en una estación de trabajo. Quince días después del buque insignia, el modelo pequeño hizo que el buque insignia fuera difícil de justificar.

El matiz es concreto y fácil de expresar: sabe mediblemente menos, y no se comporta como tal. Dale un compilador, un bucle de herramientas o una capa de retrieval y es excelente. Pídele que sea la fuente de la verdad y se equivocará con confianza.

Si lo quieres para código o agentes, adóptalo hoy mismo. Si lo quieres cerca de los clientes, presupuesta la capa que va encima de él, no solo los tokens.

Para el panorama más amplio de qué más encaja en este hueco, empieza con alternativas a Inkling. El rival más cercano en precio y tamaño tiene su propio desglose en análisis de Kimi K3.

Y si el trabajo real es ordenar una bandeja de entrada en lugar de escribir código, triaje de tickets de soporte es la lectura más útil, con deflexión de tickets cubriendo lo que ocurre después de ese triaje.

Prueba eesel

¿Elegiste Inkling-Small y ahora necesitas que responda tickets reales con seguridad? Ese hueco es exactamente lo que eesel cierra. Se conecta a Zendesk, Freshdesk, Gorgias o el helpdesk que uses en cuestión de minutos, aprende de tus tickets resueltos y de tu centro de ayuda en lugar de los pesos del modelo, y luego responde solo aquello de lo que está seguro y deja el resto para tu equipo. Antes de que toque una cola real puedes simularlo contra tu propio historial de tickets y ver las respuestas reales que habría enviado, que es la comprobación que una puntuación de factualidad de -9.0 hace innegociable. También se mantiene agnóstico respecto al modelo, así que el próximo modelo barato es un cambio de configuración y no una reconstrucción.

eesel AI helpdesk dashboard showing live ticket activity and AI resolutions
eesel AI helpdesk dashboard showing live ticket activity and AI resolutions

Gratis para probar, y con facturación según el uso, así que puedes revisar los precios antes de comprometerte. Prueba eesel o mira cómo encaja como software de atención al cliente con IA.

Sources

Preguntas frecuentes

¿Vale la pena Inkling-Small?
Para código, agentes y uso de herramientas, sí. Obtiene un 80.2% en SWEBench Verified frente al 77.6% de su modelo padre, funciona a 131 tokens de salida por segundo y cuesta 1.20 dólares por cada millón de tokens de salida. Para cualquier cosa que deba ser correcta a nivel factual sin una capa de recuperación (retrieval), hay que tener cuidado: SimpleQA Verified cae a 20.6% desde el 43.9% del modelo padre. Mi resumen del análisis de Inkling-Small es que es un ejecutor excelente y una enciclopedia mediocre.
¿Es Inkling-Small mejor que Inkling?
Según la propia tabla de su fabricante, gana en programación, uso agéntico de herramientas y seguimiento de instrucciones, y pierde en matemáticas, factualidad y audio. De forma independiente, Artificial Analysis sitúa a Inkling-Small en 40 puntos en su Intelligence Index frente a 41 de Inkling, así que quedan en el mismo nivel. El modelo pequeño es más rápido y mucho más barato, así que para la mayoría de tareas es la mejor compra.
¿Cuánto cuesta Inkling-Small?
La salida cuesta 1.20 dólares por millón de tokens, frente a 4.05 dólares del modelo completo. La entrada oscila entre 0.30 y 0.50 dólares por millón según el proveedor por el que la enrutes. Los pesos en sí son gratuitos bajo la licencia Apache 2.0. Si estás calculando esto contra un presupuesto de soporte y no de desarrollo, las cifras que importan están en coste de la atención al cliente con IA y en coste por resolución.
¿Se puede ejecutar Inkling-Small en local?
Sí, y esta es la parte más sólida de la historia. Unsloth indica 543 GB en BF16, que bajan hasta 89 GB con una cuantización de 2 bits, lo cual cabe dentro de una estación de trabajo con 128 GB de memoria unificada. El Inkling completo de 975B necesita 1.900 GB en BF16 para comparar. Si el objetivo es alojarlo tú mismo, el panorama más amplio está cubierto en los mejores agentes de IA de código abierto.
¿Es Inkling-Small bueno para la atención al cliente?
No por sí solo, y las cifras de factualidad son exactamente la razón. Un modelo que obtiene -9.0 en AA Omniscience está respondiendo con confianza más allá del límite de lo que realmente sabe, lo que en una cola de soporte se traduce en prometer una política de reembolso que no existe. Necesita anclarse en tu propia documentación además de un sistema de enrutamiento por confianza, que es justo lo que añade una plataforma de atención al cliente con IA. La mecánica está en alucinaciones de IA en soporte.
¿Cuál es la ventana de contexto de Inkling-Small?
La ficha del modelo indica 1M de tokens, y Unsloth confirma 1.048.576. Vale la pena saberlo antes de planificar en torno a ello: OpenRouter lo expone actualmente a 524.288 tokens, así que la API enrutada te da la mitad de lo que soportan los pesos. El comportamiento con contextos largos en general se trata en tamaño de la ventana de contexto.
¿Es Inkling-Small gratuito y de código abierto?
Los pesos son Apache 2.0 en Hugging Face bajo thinkingmachines/Inkling-Small, así que puedes alojarlo tú mismo y usarlo comercialmente. Descargarlo gratis no significa que ejecutarlo sea gratis, y la factura del hardware sustituye a la de los tokens. Thinking Machines también vende acceso a través de Tinker, su plataforma alojada de ajuste fino.
¿Quién crea Inkling-Small y cuándo se lanzó?
Thinking Machines Lab, fundada por la exdirectora de tecnología de OpenAI Mira Murati, lo lanzó el 30 de julio de 2026, quince días después del Inkling completo. Es su segundo lanzamiento con pesos abiertos, y el listado de con qué compite está en alternativas a Inkling.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Reseña de Claude Opus 5: programación casi de nivel frontera a mitad de precio

Una reseña práctica de Claude Opus 5: lo que realmente dicen los benchmarks, la tasa de alucinaciones que subió, y si tiene sentido en una cola de soporte en producción.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de un modelo que genera paneles de imagen, vídeo y audio, en representación de FLUX 3 de Black Forest Labs
Trending

FLUX 3: lo que Black Forest Labs realmente lanzó

FLUX 3 es un solo modelo para imagen, video, audio y acciones de robots. Tampoco tiene API, ni precio, ni pesos abiertos todavía. Esto es lo que puedes y no puedes conseguir.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de paneles de imagen, video y documentos alimentando un modelo de visión y lenguaje, con el logo de Qwen
Trending

Qwen 3.7 Flash: especificaciones, precios y qué hace realmente

Qwen 3.7 Flash se lanzó sin entrada de blog, sin benchmarks y sin pesos. Aquí está la hoja de especificaciones completa, los precios escalonados y lo que Qwen nunca afirmó.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: ¿cuál deberías usar?

Claude Opus 5 cuesta 1.7x lo que Sonnet 5 por token y aun así termina algunos trabajos más barato. Aquí va el cara a cara sobre precio, benchmarks y coste real por tarea.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis