Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición July 20, 2026

Verificado por expertos
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo

¿Vale la pena Inkling para ti? (Comprobación de 30 segundos)

Antes de entrar en detalle, elige lo que más te importa y obtén una respuesta directa. Es la misma decisión que tomaría en un proyecto real.

Qué es Inkling en realidad

Un poco de contexto antes del análisis propiamente dicho. Inkling es el primer modelo público de Thinking Machines Lab, y el laboratorio es refrescantemente honesto en que no persigue el ranking. La propuesta es una base abierta amplia y equilibrada que ajustas con fine-tuning para tu propio uso en la plataforma Tinker del laboratorio. Es un punto de partida que moldeas, no un chatbot al que te suscribes.

Las especificaciones que importan, según la ficha del modelo:

  • Arquitectura: un transformer Mixture-of-Experts, 975B en total con 41B activos por token (6 de 256 expertos enrutados, más 2 compartidos). Así es como un modelo de casi un billón de parámetros puede servirse a una velocidad razonable.
  • Entradas: texto, imágenes y audio (WAV a 16 kHz, ideal bajo ~20 minutos). La salida es solo texto.
  • Ventana de contexto: hasta 1M de tokens.
  • Licencia: Apache 2.0, así que el uso comercial no tiene problema y los pesos están en Hugging Face.
  • Lanzamiento: 15 de julio de 2026.

El audio es lo más destacado. Como lo describió el comentario más votado del hilo de lanzamiento called it, este es el "largest open weight model that supports audio", algo que importa justo cuando quieres que un modelo escuche una llamada de soporte en lugar de leer su transcripción.

Ruta de atención relativa de Inkling: el estado oculto se proyecta a Q, K, V y R, con una convolución corta en K/V hacia la caché y un sesgo de posición relativa sumado a los logits de atención, según el diagrama de Thinking Machines en el blog de lanzamiento de Hugging Face
Ruta de atención relativa de Inkling: el estado oculto se proyecta a Q, K, V y R, con una convolución corta en K/V hacia la caché y un sesgo de posición relativa sumado a los logits de atención, según el diagrama de Thinking Machines en el blog de lanzamiento de Hugging Face

Los benchmarks: inteligente, con aristas marcadas

Aquí es donde se separa el discurso del proveedor de la lectura independiente. Las propias tablas de Thinking Machines muestran cifras favorecedoras con esfuerzo máximo, pero la señal más limpia viene de Artificial Analysis, que evalúa a todos con el mismo criterio.

Su veredicto: Inkling obtiene 41 en el AA Intelligence Index, puesto 10 de 97, muy por encima del promedio de ~25 para modelos abiertos de su tamaño. Así que es un modelo inteligente. Pero queda por debajo de los líderes de vanguardia y se ubica en un grupo con modelos como DeepSeek V4 Flash. Rastreadores más amplios de la comunidad lo sitúan más cerca del puesto 41, de donde salió el debate de si es justo llamarlo "competitivo".

Evaluación (Artificial Analysis)InklingQué mide
GPQA Diamond87%Razonamiento científico
AA-LCR63%Razonamiento de contexto largo
Terminal-Bench v2.155%Codificación agéntica + uso de terminal
SciCode46%Programación
AA-Omniscience (accuracy)40%Conocimiento
GDPval-AA v237%Tareas de trabajo del mundo real
Humanity's Last Exam30%Razonamiento + conocimiento
CritPt5%Razonamiento de física

Leído con honestidad, Inkling tiene una personalidad real: fuerte en razonamiento científico y de contexto largo, notablemente débil en física y en fiabilidad de conocimiento en bruto (su índice de fiabilidad AA-Omniscience es un pobre 2 en una escala de −100 a 100). Aristas marcadas, no un todoterreno parejo.

Debajo de los puntajes también hay una afirmación de eficiencia genuinamente útil. Inkling expone un dial controlable de esfuerzo de razonamiento (none hasta max en la integración de Hugging Face), y el laboratorio dice que alcanza el mismo puntaje de Terminal-Bench que Nemotron 3 Ultra gastando cerca de un tercio de los tokens. Para quien paga por token o alquila una GPU, "misma respuesta, menos tokens" vale más que una ganancia fraccional en un benchmark.

El hilo de lanzamiento reflejó el mismo panorama mixto que yo veo:

Hacker News

"I just looked at the benchmarks and was kinda disappointed that it seems to be between KimiK2.6 and KimiK2.7 on most of the benchmarks."

El precio: el único reproche real

Esta es la parte que más me sorprendió en el análisis. Inkling tiene pesos abiertos, y sin embargo en la propia API de Thinking Machines tiene el precio de un modelo propietario de vanguardia. Según Artificial Analysis, queda en el puesto 81 de 97 en precio, entre los más caros de su categoría.

Vía de accesoLo que pagasNotas
API de Thinking Machines — entrada1,87 $ / 1M tokensPromedio de la categoría ~0,43 $; caro
API de Thinking Machines — salida4,68 $ / 1M tokensPromedio de la categoría ~1,25 $
Tarifa combinada~1,10 $ / 1M tokensCon una mezcla de 7:2:1 caché:entrada:salida
Lectura/escritura de caché0,374 $ / 1M tokensUn acierto de caché es −80% frente a la entrada
Autoalojar los pesos0 $ por el modeloApache 2.0; pagas el hardware
Fine-tuning de TinkerServicio de pagoEl verdadero modelo de negocio del laboratorio

Destacan dos cosas. Primero, actualmente hay un solo proveedor de API, la propia Thinking Machines, así que ningún proveedor externo más barato la está superando todavía. Segundo, "pesos abiertos" solo lo hace gratis si estás dispuesto a ejecutarlo, y eso es una decisión real, no una nota al pie. Así que el veredicto de precio es simple: alquilar Inkling es difícil de justificar; poseerlo puede ser una ganga.

Una build GGUF de 1 bit de Inkling corriendo localmente en el estudio de Unsloth, escribiendo un juego de Sudoku en HTML autocontenido tras pensar durante 321 segundos, con un medidor de contexto de 12,6k / 1.048,6k tokens, tal como se muestra en el blog de lanzamiento de Hugging Face
Una build GGUF de 1 bit de Inkling corriendo localmente en el estudio de Unsloth, escribiendo un juego de Sudoku en HTML autocontenido tras pensar durante 321 segundos, con un medidor de contexto de 12,6k / 1.048,6k tokens, tal como se muestra en el blog de lanzamiento de Hugging Face

Ejecutarlo tú mismo: el verdadero punto a favor

Como los pesos son abiertos, la comunidad tuvo Inkling corriendo localmente desde el primer día. El blog de lanzamiento de Hugging Face describe tres niveles: el checkpoint completo en BF16 necesita alrededor de 2 TB de VRAM (territorio de centro de datos), la cuantización NVFP4 lo baja a aproximadamente 600 GB en hardware Blackwell, y las builds de GGUF de 1 bit de la comunidad lo recortan ~95%, suficiente para una workstation potente.

El soporte de herramientas también llegó rápido: integración desde el día cero en transformers 5.14, SGLang, vLLM y llama.cpp/Unsloth, además de capas de borrador para decodificación especulativa para una aceleración sin pérdidas. Esa historia de "ejecútalo tú mismo" es la verdadera razón para prestarle atención. El trade-off es control frente a comodidad: posees los pesos, tus datos nunca salen de tu infraestructura, y nadie puede descontinuarte el modelo bajo los pies, pero ahora tú eres responsable de las GPUs.

Para los equipos que quieren ese control sin tener que cuidar un clúster, Inkling apareció en Databricks desde el día cero, accesible a través del Unity AI Gateway con gobernanza incorporada y sin precios por token.

Ventajas y desventajas

Aquí está el balance del análisis, sin rodeos.

Lo que Inkling hace bien

  • Verdaderamente abierto — pesos bajo Apache 2.0, uso comercial, autoalojable hasta una build de 1 bit.
  • Entrada de audio nativa — el modelo abierto más grande que escucha, no solo lee.
  • Contexto de 1M de tokens — a la par del nivel más alto en longitud.
  • Razonamiento eficiente en tokens — el dial de esfuerzo aporta ahorros reales, no solo una frase de marketing.
  • Fuerte razonamiento científico + de contexto largo — 87% en GPQA Diamond, 63% en AA-LCR.

Dónde se queda corto

  • Caro de alquilar — puesto 81 de 97 en precio de API, un lugar raro para unos pesos abiertos.
  • No es líder del ranking — queda por debajo de los líderes de vanguardia, a mitad de tabla entre los modelos abiertos.
  • Fiabilidad de conocimiento débil — índice AA-Omniscience de 2, más un flojo 5% en razonamiento de física.
  • Un solo proveedor de API — aún sin competencia de terceros en precio.
  • Hardware serio para autoalojarlo — modelo "gratis", ~2 TB de VRAM para la build completa.

Qué piensa realmente la comunidad

El hilo de lanzamiento en Hacker News (1.214 puntos, ~292 comentarios) es la lectura más clara de la recepción. El ánimo fue entusiasta pero moderado, y el entusiasmo tenía menos que ver con los puntajes y más con quién lo lanzó:

Hacker News

"Not to mention - it is American. This is the first competitive non-Chinese open weights model since what, Llama 3?"

Ese enfoque recibió críticas (la gente mencionó Mistral, North de Cohere, Gemma), pero el sentimiento de fondo de que "una opción occidental creíble de pesos abiertos ya se estaba tardando" recorrió todo el hilo. También hubo un sano "¿cómo sobrevive una empresa que regala su modelo?", cuya respuesta terminó en Tinker, el negocio alojado de fine-tuning. Pero la línea más útil para quien hace su propio análisis fue el recordatorio de que ningún benchmark público es la prueba real:

Hacker News

"want to know how good a model is? Run it with your own non-public benchmark, basically the only way to get proper answers you can somewhat rely on, everything else is manipulated, misunderstood or over-relied on."

Aférrate a ese instinto, porque es exactamente el que importa en el momento en que apuntas un modelo a tu cola de soporte.

Qué significa un modelo de la clase de Inkling para el soporte

Aquí es donde he pasado los últimos años, así que seré directo. Construyo la capa de agente que se sitúa encima de modelos como Inkling, y lo que he aprendido viendo despliegues reales es esto: un mejor modelo base rara vez cambia lo que realmente termina en una cola de soporte.

Un modelo en bruto, por muy inteligente que sea, no conoce tu política de reembolsos, no puede ver los últimos 40.000 tickets que tu equipo ya resolvió, y no tiene idea de cuándo debería callarse y pasarle el caso a un humano. Apúntalo directo a los clientes y responderá con confianza y de forma incorrecta, lo cual es peor que no responder. Ese modo de fallo es exactamente la razón por la que las alucinaciones de IA en soporte queman a los equipos, y por eso el modelo siempre es solo el motor.

El coche es la capa que lo rodea. Eso es eesel: aprende de tus tickets resueltos y de tus documentos de ayuda (no solo de una página de marketing), deriva según el nivel de confianza para que las respuestas de baja certeza queden como borrador en vez de enviarse, y, la parte que más me importa, te deja simular el agente contra tus propios tickets pasados antes de que un solo cliente lo vea. Esa simulación es el consejo de "pruébalo con tu propio benchmark" de Hacker News, convertido en un paso del producto.

Diagrama que muestra un modelo de pesos abiertos como motor, una capa de eesel que aprende de tickets resueltos, deriva según confianza y simula con tickets pasados, y el compañero de soporte funcional que resulta de todo eso
Diagrama que muestra un modelo de pesos abiertos como motor, una capa de eesel que aprende de tickets resueltos, deriva según confianza y simula con tickets pasados, y el compañero de soporte funcional que resulta de todo eso

También significa que no apuestas tu stack de soporte a un solo modelo. El mejor modelo cambia cada pocas semanas (hoy Inkling, el mes que viene otra cosa), así que eesel se mantiene agnóstico de modelo y aprovecha el que sea más fuerte en cada momento, mientras que la parte que le importa al cliente -el conocimiento, las barreras de seguridad, la triaje de tickets- se mantiene estable.

Veredicto

Inkling es un modelo de pesos abiertos genuinamente bueno con una rareza de precio que hay que planificar. Si quieres poseer los pesos, necesitas audio o contexto largo y puedes correr el hardware, es uno de los lanzamientos abiertos más interesantes de 2026 y vale mucho la pena descargarlo. Si solo quieres la API capaz más barata, o el puntaje de benchmark más alto, no es la elección, y no deberías forzarla.

Y si tu verdadero objetivo es responder tickets de soporte, recuerda a lo que este análisis vuelve una y otra vez: una ficha de modelo no es un agente de soporte. El motor es solo la mitad del trabajo.

Prueba eesel

Inkling es un lanzamiento divertido, pero una ficha de modelo no es un agente de soporte. Si tu verdadero objetivo es automatizar el soporte de nivel 1, lo que necesitas es la capa que convierte cualquier modelo potente (abierto o cerrado) en un compañero de equipo: eesel se conecta con tu helpdesk actual (Zendesk, Freshdesk, Gorgias, HubSpot, Front y más de 100 otros), aprende de tu historial y te deja simular con tickets pasados reales antes de salir en vivo, para que veas primero la cobertura y la precisión, no después de que un cliente detecte una mala respuesta. Gridwise usó exactamente ese enfoque para resolver el 73% de las solicitudes de nivel 1 en su primer mes.

El precio es basado en uso, de alrededor de 0,40 $ por ticket resuelto, sin cargos por asiento, y puedes empezar gratis. Es la diferencia entre admirar un gran motor y realmente llegar a alguna parte.

Preguntas frecuentes

¿Vale la pena Inkling?
Depende de para qué lo quieras. Como modelo abierto que puedes descargar, alojar tú mismo y ajustar con fine-tuning, Inkling es una gran opción, sobre todo si necesitas entrada de audio nativa o un contexto de 1M de tokens. Como la API capaz más barata, no vale la pena: con unos 1,87 $ de entrada / 4,68 $ de salida tiene el precio de un modelo propietario de vanguardia, así que otros modelos abiertos más baratos ganan en costo. Mi resumen del análisis de Inkling: excelente para poseer, caro para alquilar.
¿Inkling es bueno comparado con Kimi y GLM?
Es realmente inteligente - Artificial Analysis le da 41 puntos en su Intelligence Index, puesto 10 de 97 - pero no lidera el grupo de modelos abiertos. Testers de la comunidad en Hacker News encontraron que sus benchmarks quedan más o menos entre Kimi K2.6 y K2.7. Sus verdaderas ventajas son el audio nativo y el contexto largo, no ganar el ranking.
¿Cuánto cuesta Inkling?
En la API propia de Thinking Machines, Inkling cuesta unos 1,87 $ por 1M de tokens de entrada y 4,68 $ por 1M de tokens de salida, según Artificial Analysis, que lo ubica en el puesto 81 de 97 en precio - caro para un modelo abierto de su tamaño. Los pesos en sí son gratuitos bajo Apache 2.0, así que autoalojarlo cambia la factura por token por una factura de hardware.
¿Inkling es gratis y de código abierto?
Los pesos se pueden descargar gratis bajo Apache 2.0, así que puedes autoalojar Inkling y usarlo comercialmente. Pero "gratis" no es "gratis de ejecutar": la build completa en BF16 necesita cerca de 2 TB de VRAM, y solo baja a una workstation con un GGUF de 1 bit muy cuantizado. También existe una API oficial de pago si no quieres lidiar con el hardware.
¿Puedo usar Inkling para atención al cliente?
Puedes conectarlo, pero un modelo en bruto no es un agente de soporte, por muy bien que se vean los números de este análisis de Inkling. Para responder tickets reales con seguridad necesitas una capa que aprenda de tus tickets resueltos, derive según el nivel de confianza y se pueda simular antes de salir en vivo. Eso es justo lo que aporta una plataforma de atención al cliente con IA como eesel, que además es agnóstica de modelo, así que puede aprovechar el que sea mejor en cada momento.
¿Quién hace Inkling y qué es Tinker?
Inkling es el primer modelo de pesos abiertos de Thinking Machines Lab, fundado por la exCTO de OpenAI Mira Murati. El laboratorio regala el modelo y gana dinero con Tinker, su plataforma alojada de fine-tuning: el modelo de negocio "regala los pesos, vende las herramientas" que Hacker News debatió durante todo el día del lanzamiento.
¿Cuáles son los resultados de Inkling en los benchmarks?
Según Artificial Analysis: AA Intelligence Index 41 (puesto 10 de 97), GPQA Diamond 87%, contexto largo AA-LCR 63%, Terminal-Bench 55%, SciCode 46% y Humanity's Last Exam 30%. Es débil en razonamiento de física (CritPt 5%) y en fiabilidad del conocimiento (índice AA-Omniscience de 2 en una escala de -100 a 100). Tiene aristas marcadas, no es un todoterreno parejo.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración editorial de un modelo de lenguaje grande razonando sobre un largo flujo de documentos
Trending

Análisis de Kimi K3: el modelo de frontera abierto de Moonshot, puesto a prueba

Un análisis práctico de Kimi K3: la arquitectura del modelo abierto de 2,8 billones de parámetros, sus benchmarks, el precio real y lo que piensa realmente la comunidad en la semana de lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Ilustración editorial de agentes de codificación en paralelo y ventanas de terminal, que representa el panorama de alternativas a ZCode
Trending

Las 8 mejores alternativas a ZCode en 2026

ZCode es impresionante y tosco a la vez. Aquí tienes las 8 mejores alternativas a ZCode en 2026, con precios reales, contrapartidas honestas y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración editorial de una tabla de clasificación de benchmarks con una barra alta destacada, que representa a ZCode y el modelo GLM-5.2
Trending

ZCode: qué es realmente el nuevo agente de codificación con IA de Z.ai

Un análisis práctico de ZCode, la app gratuita de codificación agéntica del equipo de GLM: el modelo GLM-5.2 que hay detrás, las quejas reales de la semana de lanzamiento y quién debería usarla.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración que representa el gran modelo de lenguaje Kimi K3 de Moonshot AI
Trending

Kimi K3 explicado: el modelo de frontera abierto de Moonshot

Una guía clara sobre Kimi K3, el modelo abierto de 2,8 billones de parámetros de Moonshot AI: qué es, cómo rinde, cuánto cuesta y si vale la pena cambiarse a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Banner principal del análisis de PromptQL con el logo de PromptQL sobre un fondo índigo
Trending

Análisis de PromptQL (2026): el agente de datos de Hasura, puesto a prueba

Un análisis práctico de PromptQL: cómo el agente de datos de Hasura separa la planificación de la ejecución, cuánto cuesta y si su promesa de fiabilidad se sostiene.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Ilustración comparando las mejores alternativas al modelo de lenguaje grande Kimi K3
Trending

Las 8 mejores alternativas a Kimi K3 en 2026

Kimi K3 es un modelo de frontera real, pero no es el más barato y sus pesos llegan tarde. Aquí tienes las 8 mejores alternativas a Kimi K3, con precios reales de API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Ilustración principal del análisis de GPT-Live, la IA de voz full-duplex en tiempo real de OpenAI para ChatGPT
Trending

Análisis de GPT-Live: ¿vale la pena la nueva IA de voz de OpenAI?

Un análisis práctico de GPT-Live, el nuevo modelo de voz full-duplex de OpenAI para ChatGPT: qué está bien, qué falta y si vale la pena para los equipos de soporte.

Riellvriany IndriawanRiellvriany IndriawanJul 13, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis