
¿Vale la pena Inkling para ti? (Comprobación de 30 segundos)
Antes de entrar en detalle, elige lo que más te importa y obtén una respuesta directa. Es la misma decisión que tomaría en un proyecto real.
Qué es Inkling en realidad
Un poco de contexto antes del análisis propiamente dicho. Inkling es el primer modelo público de Thinking Machines Lab, y el laboratorio es refrescantemente honesto en que no persigue el ranking. La propuesta es una base abierta amplia y equilibrada que ajustas con fine-tuning para tu propio uso en la plataforma Tinker del laboratorio. Es un punto de partida que moldeas, no un chatbot al que te suscribes.
Las especificaciones que importan, según la ficha del modelo:
- Arquitectura: un transformer Mixture-of-Experts, 975B en total con 41B activos por token (6 de 256 expertos enrutados, más 2 compartidos). Así es como un modelo de casi un billón de parámetros puede servirse a una velocidad razonable.
- Entradas: texto, imágenes y audio (WAV a 16 kHz, ideal bajo ~20 minutos). La salida es solo texto.
- Ventana de contexto: hasta 1M de tokens.
- Licencia: Apache 2.0, así que el uso comercial no tiene problema y los pesos están en Hugging Face.
- Lanzamiento: 15 de julio de 2026.
El audio es lo más destacado. Como lo describió el comentario más votado del hilo de lanzamiento called it, este es el "largest open weight model that supports audio", algo que importa justo cuando quieres que un modelo escuche una llamada de soporte en lugar de leer su transcripción.

Los benchmarks: inteligente, con aristas marcadas
Aquí es donde se separa el discurso del proveedor de la lectura independiente. Las propias tablas de Thinking Machines muestran cifras favorecedoras con esfuerzo máximo, pero la señal más limpia viene de Artificial Analysis, que evalúa a todos con el mismo criterio.
Su veredicto: Inkling obtiene 41 en el AA Intelligence Index, puesto 10 de 97, muy por encima del promedio de ~25 para modelos abiertos de su tamaño. Así que es un modelo inteligente. Pero queda por debajo de los líderes de vanguardia y se ubica en un grupo con modelos como DeepSeek V4 Flash. Rastreadores más amplios de la comunidad lo sitúan más cerca del puesto 41, de donde salió el debate de si es justo llamarlo "competitivo".
| Evaluación (Artificial Analysis) | Inkling | Qué mide |
|---|---|---|
| GPQA Diamond | 87% | Razonamiento científico |
| AA-LCR | 63% | Razonamiento de contexto largo |
| Terminal-Bench v2.1 | 55% | Codificación agéntica + uso de terminal |
| SciCode | 46% | Programación |
| AA-Omniscience (accuracy) | 40% | Conocimiento |
| GDPval-AA v2 | 37% | Tareas de trabajo del mundo real |
| Humanity's Last Exam | 30% | Razonamiento + conocimiento |
| CritPt | 5% | Razonamiento de física |
Leído con honestidad, Inkling tiene una personalidad real: fuerte en razonamiento científico y de contexto largo, notablemente débil en física y en fiabilidad de conocimiento en bruto (su índice de fiabilidad AA-Omniscience es un pobre 2 en una escala de −100 a 100). Aristas marcadas, no un todoterreno parejo.
Debajo de los puntajes también hay una afirmación de eficiencia genuinamente útil. Inkling expone un dial controlable de esfuerzo de razonamiento (none hasta max en la integración de Hugging Face), y el laboratorio dice que alcanza el mismo puntaje de Terminal-Bench que Nemotron 3 Ultra gastando cerca de un tercio de los tokens. Para quien paga por token o alquila una GPU, "misma respuesta, menos tokens" vale más que una ganancia fraccional en un benchmark.
El hilo de lanzamiento reflejó el mismo panorama mixto que yo veo:
"I just looked at the benchmarks and was kinda disappointed that it seems to be between KimiK2.6 and KimiK2.7 on most of the benchmarks."
El precio: el único reproche real
Esta es la parte que más me sorprendió en el análisis. Inkling tiene pesos abiertos, y sin embargo en la propia API de Thinking Machines tiene el precio de un modelo propietario de vanguardia. Según Artificial Analysis, queda en el puesto 81 de 97 en precio, entre los más caros de su categoría.
| Vía de acceso | Lo que pagas | Notas |
|---|---|---|
| API de Thinking Machines — entrada | 1,87 $ / 1M tokens | Promedio de la categoría ~0,43 $; caro |
| API de Thinking Machines — salida | 4,68 $ / 1M tokens | Promedio de la categoría ~1,25 $ |
| Tarifa combinada | ~1,10 $ / 1M tokens | Con una mezcla de 7:2:1 caché:entrada:salida |
| Lectura/escritura de caché | 0,374 $ / 1M tokens | Un acierto de caché es −80% frente a la entrada |
| Autoalojar los pesos | 0 $ por el modelo | Apache 2.0; pagas el hardware |
| Fine-tuning de Tinker | Servicio de pago | El verdadero modelo de negocio del laboratorio |
Destacan dos cosas. Primero, actualmente hay un solo proveedor de API, la propia Thinking Machines, así que ningún proveedor externo más barato la está superando todavía. Segundo, "pesos abiertos" solo lo hace gratis si estás dispuesto a ejecutarlo, y eso es una decisión real, no una nota al pie. Así que el veredicto de precio es simple: alquilar Inkling es difícil de justificar; poseerlo puede ser una ganga.

Ejecutarlo tú mismo: el verdadero punto a favor
Como los pesos son abiertos, la comunidad tuvo Inkling corriendo localmente desde el primer día. El blog de lanzamiento de Hugging Face describe tres niveles: el checkpoint completo en BF16 necesita alrededor de 2 TB de VRAM (territorio de centro de datos), la cuantización NVFP4 lo baja a aproximadamente 600 GB en hardware Blackwell, y las builds de GGUF de 1 bit de la comunidad lo recortan ~95%, suficiente para una workstation potente.
El soporte de herramientas también llegó rápido: integración desde el día cero en transformers 5.14, SGLang, vLLM y llama.cpp/Unsloth, además de capas de borrador para decodificación especulativa para una aceleración sin pérdidas. Esa historia de "ejecútalo tú mismo" es la verdadera razón para prestarle atención. El trade-off es control frente a comodidad: posees los pesos, tus datos nunca salen de tu infraestructura, y nadie puede descontinuarte el modelo bajo los pies, pero ahora tú eres responsable de las GPUs.
Para los equipos que quieren ese control sin tener que cuidar un clúster, Inkling apareció en Databricks desde el día cero, accesible a través del Unity AI Gateway con gobernanza incorporada y sin precios por token.
Ventajas y desventajas
Aquí está el balance del análisis, sin rodeos.
Lo que Inkling hace bien
- Verdaderamente abierto — pesos bajo Apache 2.0, uso comercial, autoalojable hasta una build de 1 bit.
- Entrada de audio nativa — el modelo abierto más grande que escucha, no solo lee.
- Contexto de 1M de tokens — a la par del nivel más alto en longitud.
- Razonamiento eficiente en tokens — el dial de esfuerzo aporta ahorros reales, no solo una frase de marketing.
- Fuerte razonamiento científico + de contexto largo — 87% en GPQA Diamond, 63% en AA-LCR.
Dónde se queda corto
- Caro de alquilar — puesto 81 de 97 en precio de API, un lugar raro para unos pesos abiertos.
- No es líder del ranking — queda por debajo de los líderes de vanguardia, a mitad de tabla entre los modelos abiertos.
- Fiabilidad de conocimiento débil — índice AA-Omniscience de 2, más un flojo 5% en razonamiento de física.
- Un solo proveedor de API — aún sin competencia de terceros en precio.
- Hardware serio para autoalojarlo — modelo "gratis", ~2 TB de VRAM para la build completa.
Qué piensa realmente la comunidad
El hilo de lanzamiento en Hacker News (1.214 puntos, ~292 comentarios) es la lectura más clara de la recepción. El ánimo fue entusiasta pero moderado, y el entusiasmo tenía menos que ver con los puntajes y más con quién lo lanzó:
"Not to mention - it is American. This is the first competitive non-Chinese open weights model since what, Llama 3?"
Ese enfoque recibió críticas (la gente mencionó Mistral, North de Cohere, Gemma), pero el sentimiento de fondo de que "una opción occidental creíble de pesos abiertos ya se estaba tardando" recorrió todo el hilo. También hubo un sano "¿cómo sobrevive una empresa que regala su modelo?", cuya respuesta terminó en Tinker, el negocio alojado de fine-tuning. Pero la línea más útil para quien hace su propio análisis fue el recordatorio de que ningún benchmark público es la prueba real:
"want to know how good a model is? Run it with your own non-public benchmark, basically the only way to get proper answers you can somewhat rely on, everything else is manipulated, misunderstood or over-relied on."
Aférrate a ese instinto, porque es exactamente el que importa en el momento en que apuntas un modelo a tu cola de soporte.
Qué significa un modelo de la clase de Inkling para el soporte
Aquí es donde he pasado los últimos años, así que seré directo. Construyo la capa de agente que se sitúa encima de modelos como Inkling, y lo que he aprendido viendo despliegues reales es esto: un mejor modelo base rara vez cambia lo que realmente termina en una cola de soporte.
Un modelo en bruto, por muy inteligente que sea, no conoce tu política de reembolsos, no puede ver los últimos 40.000 tickets que tu equipo ya resolvió, y no tiene idea de cuándo debería callarse y pasarle el caso a un humano. Apúntalo directo a los clientes y responderá con confianza y de forma incorrecta, lo cual es peor que no responder. Ese modo de fallo es exactamente la razón por la que las alucinaciones de IA en soporte queman a los equipos, y por eso el modelo siempre es solo el motor.
El coche es la capa que lo rodea. Eso es eesel: aprende de tus tickets resueltos y de tus documentos de ayuda (no solo de una página de marketing), deriva según el nivel de confianza para que las respuestas de baja certeza queden como borrador en vez de enviarse, y, la parte que más me importa, te deja simular el agente contra tus propios tickets pasados antes de que un solo cliente lo vea. Esa simulación es el consejo de "pruébalo con tu propio benchmark" de Hacker News, convertido en un paso del producto.

También significa que no apuestas tu stack de soporte a un solo modelo. El mejor modelo cambia cada pocas semanas (hoy Inkling, el mes que viene otra cosa), así que eesel se mantiene agnóstico de modelo y aprovecha el que sea más fuerte en cada momento, mientras que la parte que le importa al cliente -el conocimiento, las barreras de seguridad, la triaje de tickets- se mantiene estable.
Veredicto
Inkling es un modelo de pesos abiertos genuinamente bueno con una rareza de precio que hay que planificar. Si quieres poseer los pesos, necesitas audio o contexto largo y puedes correr el hardware, es uno de los lanzamientos abiertos más interesantes de 2026 y vale mucho la pena descargarlo. Si solo quieres la API capaz más barata, o el puntaje de benchmark más alto, no es la elección, y no deberías forzarla.
Y si tu verdadero objetivo es responder tickets de soporte, recuerda a lo que este análisis vuelve una y otra vez: una ficha de modelo no es un agente de soporte. El motor es solo la mitad del trabajo.
Prueba eesel
Inkling es un lanzamiento divertido, pero una ficha de modelo no es un agente de soporte. Si tu verdadero objetivo es automatizar el soporte de nivel 1, lo que necesitas es la capa que convierte cualquier modelo potente (abierto o cerrado) en un compañero de equipo: eesel se conecta con tu helpdesk actual (Zendesk, Freshdesk, Gorgias, HubSpot, Front y más de 100 otros), aprende de tu historial y te deja simular con tickets pasados reales antes de salir en vivo, para que veas primero la cobertura y la precisión, no después de que un cliente detecte una mala respuesta. Gridwise usó exactamente ese enfoque para resolver el 73% de las solicitudes de nivel 1 en su primer mes.
El precio es basado en uso, de alrededor de 0,40 $ por ticket resuelto, sin cargos por asiento, y puedes empezar gratis. Es la diferencia entre admirar un gran motor y realmente llegar a alguna parte.
Preguntas frecuentes
¿Vale la pena Inkling?
¿Inkling es bueno comparado con Kimi y GLM?
¿Cuánto cuesta Inkling?
¿Inkling es gratis y de código abierto?
¿Puedo usar Inkling para atención al cliente?
¿Quién hace Inkling y qué es Tinker?
¿Cuáles son los resultados de Inkling en los benchmarks?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








