
Por qué la gente mira más allá de Inkling
Déjame ser justo con Inkling primero, porque el argumento para cambiar solo tiene sentido una vez que ves lo que realmente tiene de bueno.
Inkling es algo poco común: un modelo grande, creíble y totalmente de pesos abiertos, con entrada de audio nativa y un contexto de 1M de tokens, publicado bajo Apache 2.0 con los pesos en Hugging Face desde el primer día. Eso último importa, porque su rival más cercano, Kimi K3, se lanzó solo como API, con los pesos retenidos. Si tu única razón para querer Inkling es "necesito ser dueño del modelo y ejecutarlo yo mismo, y puede que le pase audio", cumple. Para la explicación completa de qué es, mira mi explicación de Inkling y mi análisis práctico.
Así que las razones para mirar hacia otro lado no tienen que ver realmente con si Inkling es bueno. Tienen que ver con el ajuste y el coste.
Es caro para ser de pesos abiertos. Esta es la peculiaridad principal. En la propia API de Thinking Machines, Inkling ocupa el puesto 81 de 97 en precio, según Artificial Analysis, a 1,87 $ de entrada / 4,68 $ de salida por millón de tokens. La media de su categoría ronda los 0,43 $ / 1,25 $. Peor aún, actualmente solo hay un proveedor de API (la propia Thinking Machines), así que ningún proveedor externo más barato lo está abaratando.
No es el modelo más inteligente que puedes usar. Inkling obtiene 41 puntos en el Intelligence Index de Artificial Analysis. Está bien, pero GLM-5.2 (51), Kimi K3 (57) y todos los modelos de frontera cerrados lo superan. Los rankings de la comunidad que incluyen más modelos sitúan a Inkling más cerca del puesto 41 en general, de ahí el debate del hilo de lanzamiento sobre si "competitivo" es un término justo.
Tiene aristas afiladas. Si lees honestamente la tabla de evaluaciones, Inkling es fuerte en razonamiento científico y de contexto largo, pero flojo en fiabilidad de conocimiento puro (su índice AA-Omniscience es un pobre 2) y en física (CritPt 5%). Es un modelo con picos, no un todoterreno uniforme.
Autoalojarlo es un trabajo de centro de datos. "Abierto" solo significa "gratis" si puedes ejecutarlo. Los pesos completos en BF16 necesitan unos 2 TB de VRAM; incluso la versión cuantizada NVFP4 necesita unos 600 GB. Los modelos abiertos más baratos son mucho más ligeros de servir.
El hilo de lanzamiento capturó esa misma tensión, y el comentario más útil allí merece pegarse en el monitor antes de fiarte de ninguna de las puntuaciones de abajo:
"want to know how good a model is? Run it with your own non-public benchmark, basically the only way to get proper answers you can somewhat rely on, everything else is manipulated, misunderstood or over-relied on."
Así queda el panorama al cruzar inteligencia con precio.

Cómo elegí estos
Trabajo con estas APIs, así que este repaso se apoya en lo que realmente dicen las páginas de precios y documentación de cada proveedor, leídas la semana en que escribí esto, no en un gráfico de marketing. Cada precio de abajo es por millón de tokens y viene de la propia página del creador del modelo o de Artificial Analysis, que evalúa a todos con el mismo criterio. Cuando no pude confirmar una licencia, un precio o una ventana de contexto en una página de primera mano, lo digo en vez de adivinar. El ranking tiene mi opinión, pero los números los puedes comprobar tú mismo, y si quieres seguir viendo cómo cambian estos modelos, mi repaso de herramientas para seguir LLMs cubre eso.
Las mejores alternativas a Inkling de un vistazo
| Modelo | Creador | ¿Pesos abiertos? | Entrada / Salida (por 1M) | Contexto | Mejor para |
|---|---|---|---|---|---|
| Inkling (base) | Thinking Machines | Sí (Apache 2.0) | 1,87 $ / 4,68 $ | 1M | Modelo abierto con entrada de audio para poseer |
| GLM-5.2 | Zhipu / Z.ai | Sí (MIT) | 1,40 $ / 4,40 $ | 1M | Código abierto que puedes usar hoy |
| DeepSeek V4 Flash | DeepSeek | Sí (MIT) | 0,14 $ / 0,28 $ | 1M | Coste mínimo, frontera económica |
| Kimi K3 | Moonshot AI | Pesos el 27 de julio | 3,00 $ / 15,00 $ | 1M | Techo agéntico abierto de frontera |
| MiniMax M3 | MiniMax | Sí | 0,30 $ / 1,20 $ (promo) | 1M | Multimodal abierto barato + ejecuciones largas |
| Qwen3.7-Max | Alibaba | No (nivel Max) | 2,50 $ / 7,50 $ | 1M | Ajuste agéntico de Alibaba |
| Claude Fable 5 / Opus 4.8 | Anthropic | No | 10 $ / 50 $ · 5 $ / 25 $ | Amplio | Techo de fiabilidad |
| GPT-5.6 Sol | OpenAI | No | 5,00 $ / 30,00 $ | Amplio | Ecosistema más profundo |
| Gemini 3.5 Pro | No | Aún no público | 2M multimodal | Contexto más largo + multimodalidad más rica |
Dos cosas llaman la atención. Primero, Inkling queda alto en la escala de precios para ser un modelo abierto, no bajo. Segundo, los modelos que lo superan en precio son en su mayoría los de pesos abiertos. Así que si "abierto" era tu razón para mirar Inkling, las alternativas abiertas también le ganan en precio la mayoría de las veces.
Ahora las ocho, en el orden en que realmente las consideraría.
1. GLM-5.2
Mejor para: código y agentes de pesos abiertos que puedes descargar y usar hoy mismo.
Esta es la alternativa que responde de forma más directa a los mayores problemas de Inkling a la vez: es más inteligente, más barata y abierta. GLM-5.2 de Zhipu AI (comercializado bajo la marca Z.ai) es un modelo de mezcla de expertos de unos 753.000 millones de parámetros cuyos pesos completos están en Hugging Face bajo licencia MIT, gratis para descargar, ajustar, autoalojar y usar comercialmente.
En números, supera a Inkling en las dos líneas que importan. Obtiene 51 en el índice de Artificial Analysis, el modelo de pesos abiertos número 1 del mundo, frente al 41 de Inkling. Y es más barato: 1,40 $ de entrada / 4,40 $ de salida por millón según la documentación de Z.ai, con el mismo contexto de 1M. Zhipu lo ajusta para código y agentes y reporta un 62,1 en SWE-bench Pro, lo que lo sitúa entre los modelos de código abiertos más fuertes, una base natural para construir agentes de IA en tu propio hardware.
Veredicto: si tu lista de requisitos es "pesos abiertos, disponible ya, fuerte en código, más barato que Inkling", GLM-5.2 gana en todas las líneas. Mi primera recomendación para cualquiera que quisiera Inkling porque se suponía que era abierto.
2. DeepSeek V4 Flash
Mejor para: la factura más baja posible con razonamiento de nivel frontera.
Si tu razón para dejar Inkling es el coste, para aquí. La línea V4 de DeepSeek es, por un amplio margen, el modelo capaz más barato de esta lista. DeepSeek V4 Flash cuesta 0,14 $ de entrada / 0,28 $ de salida por millón de tokens, según los precios de DeepSeek, con una tarifa de entrada en caché de casi un cuarto de centavo. Es un MoE de 284.000 millones de parámetros (13.000 millones activos), tiene un contexto de 1M de tokens y mantiene un modo de pensamiento activado por defecto, así que no cambias razonamiento por precio.
Pon eso al lado de Inkling: 0,28 $ frente a 4,68 $ en salida es aproximadamente 17 veces. Para cargas de trabajo de alto volumen donde la mayor parte de la entrada está en caché, DeepSeek está en otro universo en cuanto a coste. Además publica pesos abiertos en Hugging Face bajo licencia MIT, lanzados en abril de 2026, así que la historia de autoalojamiento que vende Inkling también está aquí, a una fracción del coste de servirlo. Por estas mismas razones aparece fuerte en la mayoría de repasos de herramientas de código con IA.
Veredicto: la opción económica por defecto. Si estás cambiando de Inkling para reducir gasto y no necesitas lo más alto de las tablas de calidad, DeepSeek V4 Flash es el primero que deberías probar.
3. Kimi K3
Mejor para: el techo abierto de frontera en trabajo agéntico, cuando estás dispuesto a pagarlo.
Kimi K3 de Moonshot es el modelo que supera a casi todo lo demás de esta lista. Es el primer modelo abierto en alcanzar la clase de 3 billones de parámetros, y en el índice de Artificial Analysis llega a 57, suficiente para un top cuatro en general, muy por delante del 41 de Inkling. Si lo que buscas es capacidad en bruto y aun así quieres un modelo que eventualmente sea abierto, K3 es el techo. Para la visión completa, mira mi explicación de Kimi K3.

Dos pegas frente a Inkling. Primero, es más caro, no menos: K3 llega a costar 3 $ / 15 $, al nivel de Claude Sonnet, así que no es una opción económica. Segundo, sus pesos llegaron tarde; Moonshot prometió el lanzamiento abierto completo para el 27 de julio de 2026, mientras que los de Inkling ya se podían descargar en el lanzamiento. Así que si autoalojarlo hoy es el factor decisivo, Inkling en realidad supera a K3 en disponibilidad, aunque K3 gane en puntuación.
Veredicto: elige K3 cuando quieras la mayor inteligencia de nivel abierto y no te asusten el precio ni la espera. Si querías Inkling por barato y abierto, K3 es la dirección equivocada; si lo querías por inteligente y eventualmente abierto, K3 es la mejora.
4. MiniMax M3
Mejor para: el modelo abierto más barato, nativamente multimodal, con resistencia para ejecuciones largas.
MiniMax M3 es el punto dulce entre valor y apertura, y responde de frente a la propuesta multimodal de Inkling. Es un modelo de pesos abiertos con contexto de 1M de tokens que es nativamente multimodal, y cuesta una fracción de Inkling: 0,60 $ / 2,40 $ de pago por uso según su página de precios, con un descuento permanente del 50% que lo deja cerca de 0,30 $ / 1,20 $.
La apuesta en la que se apoya MiniMax es la estabilidad de agentes en horizontes largos: su demo de lanzamiento mostró al modelo funcionando de forma autónoma durante unas 12 horas, produciendo 18 commits mientras reproducía un artículo académico. Es el mismo terreno de "ejecuciones de agente de varios días" al que apuntan los modelos de frontera, por céntimos. La propuesta multimodal de Inkling es audio de entrada nativo; la de MiniMax es multimodalidad más amplia por una factura mucho menor.
Veredicto: la mejor opción si quieres pesos abiertos y multimodalidad y una factura pequeña. Si el atractivo de Inkling para ti era "abierto y multimodal", M3 lo consigue por una fracción del coste.
5. Qwen3.7-Max
Mejor para: equipos que quieren el ajuste agéntico de Alibaba y no necesitan pesos abiertos.
Qwen3.7-Max es el buque insignia de Alibaba, y es más un vecino de Inkling en capacidad y precio que una opción económica. Cuesta 2,50 $ de entrada / 7,50 $ de salida por millón según la página de precios de Qwen Cloud (con una promoción limitada del 50%), tiene un contexto de 1M y está ajustado directamente para trabajo centrado en agentes: programación, tareas de oficina y ejecución autónoma de larga duración. Obtiene 46 en el índice de Artificial Analysis, un punto por encima de Inkling.
La pega para quien busca pesos abiertos: el nivel Max es cerrado y solo por API. Los modelos más pequeños de la familia Qwen3 son de pesos abiertos, pero el buque insignia con el que se compararía Inkling no es algo que puedas autoalojar. Así que Qwen3.7-Max se lee mejor como alternativa a Inkling en capacidad y enfoque agéntico, no como sustituto "abierto como Inkling". Si estás valorando la familia más amplia, mis guías de alternativas a Qwen y precios de Qwen profundizan más.
Veredicto: una buena alternativa si te gusta el ajuste agéntico de Alibaba y te encaja la banda de unos 2,50 $ / 7,50 $. No es la opción si los pesos abiertos eran el motivo entero para mirar Inkling.
6. Claude (Fable 5 y Opus 4.8)
Mejor para: el techo de fiabilidad en trabajo agéntico y de código, cuando acertar importa más que la factura.
Claude de Anthropic es adonde acudir cuando la corrección importa más que el coste. Claude Fable 5 lidera el índice de Artificial Analysis con 60, la puntuación más alta de cualquier modelo aquí, y está ajustado para ejecuciones autónomas de varios días; Opus 4.8 queda justo por debajo. Este es el extremo de corrección del espectro que un modelo con picos y conocimiento inestable como Inkling no puede alcanzar.
Pagas por ese techo. Fable 5 cuesta 10 $ de entrada / 50 $ de salida por millón según la página de precios de Anthropic, y Opus 4.8 está en 5 $ / 25 $, ambos muy por encima de Inkling. Claude es totalmente cerrado, así que no hay autoalojamiento ni pesos que poseer, exactamente el cambio que asumes al dejar Inkling. Si quieres el detalle cara a cara, mi comparativa de ChatGPT vs Claude y mi repaso de alternativas a Claude ayudan.
Veredicto: la elección de calidad ante todo. Elige Claude cuando una respuesta equivocada te cueste más que los dólares de más, y cuando poseer los pesos nunca fue el punto.
7. GPT-5.6 Sol
Mejor para: el ecosistema más profundo y las herramientas de terceros más amplias.
GPT-5.6 Sol de OpenAI es el todoterreno. Es un modelo de frontera para razonamiento y código que puntúa en los altos 50 en el índice de Artificial Analysis, y su verdadera ventaja sobre Inkling no es una línea de benchmark, es el ecosistema: el conjunto más amplio de SDKs, integraciones y herramientas de terceros de todos los de aquí. Si tu stack ya habla OpenAI, Sol es el cambio con menos fricción.
El precio es de 5 $ de entrada / 30 $ de salida por millón en el nivel estándar, según la documentación de OpenAI, con un nivel por lotes a 2,50 $ / 15 $ para trabajo no urgente. Eso está por encima de Inkling, y Sol es cerrado (los modelos de pesos abiertos gpt-oss de OpenAI son una línea aparte). Mis guías de ChatGPT vs Gemini y ChatGPT vs Mistral ayudan si esos son tus finalistas.
Veredicto: elige Sol por amplitud de integración y una plataforma madura, no para ahorrar dinero. Si el ecosistema es tu cuello de botella, vale la pena el sobreprecio frente a Inkling.
8. Gemini 3.5 Pro
Mejor para: el contexto más largo y la entrada multimodal más rica.
Gemini 3.5 Pro de Google es la opción si lo que te atraía de Inkling era el audio y el contexto largo, porque Gemini hace ambas cosas, y mejor. Ofrece un contexto de 2M de tokens, el doble del 1M de Inkling, y admite texto, imagen, audio y video en una sola llamada nativa, un paso más allá de la multimodalidad de solo audio de Inkling. Alcanzó la disponibilidad general a finales de junio de 2026 con un modo de razonamiento Deep Think.
Una advertencia honesta: Google todavía no ha publicado precios finales por token para 3.5 Pro al escribir esto, así que trata cualquier cifra que circule como una estimación, no como un hecho. Espera un nivel premium; si el presupuesto es ajustado y quieres una opción de Google ahora, el Gemini 3.1 Pro ya disponible cuesta 2 $ / 12 $ según los precios de Google. Gemini es cerrado (la familia abierta de Google es Gemma, algo aparte), así que, como con Claude y GPT, cambias la historia de propiedad de Inkling por capacidad.
Veredicto: la mejor opción cuando tu carga de trabajo es multimodal o exige mucho contexto. Si solo querías Inkling para leer audio y mantener una ventana larga, Gemini hace ambas cosas mejor, una vez que aceptas un modelo cerrado.
¿Qué alternativa encaja realmente contigo?
Los precios y las puntuaciones son solo la mitad de la decisión. La otra mitad es para qué estás optimizando. Esto te da un punto de partida en un clic.
El modelo es solo el motor
Ahora la parte que más me importa, porque me dedico a construir agentes de IA. Es tentador leer una comparativa como esta, elegir el modelo que lidera la tabla este mes, conectarlo y esperar que tu cola de atención al cliente se resuelva sola. No funciona así, y ahí es donde la mayoría de los proyectos de soporte con IA fallan en silencio.
Un modelo en bruto, Inkling o cualquier alternativa de esta lista, te da razonamiento. Lo que no te da es ninguna idea de tu política de devoluciones, los casos límite de tu producto, o el hecho de que el ticket #4021 es un VIP que ya ha escrito dos veces. No tiene memoria de tus tickets pasados, ninguna salvaguarda contra inventar respuestas con confianza, y ninguna conexión con el helpdesk donde ocurre el trabajo de verdad. Una puntuación de benchmark más alta no arregla nada de eso.

He pasado años poniendo IA en colas de soporte en producción, y la lección que se me quedó es que un modelo que suena seguro dando una respuesta equivocada es peor que ninguna respuesta. Por eso eesel AI ejecuta una simulación sobre tu historial de tickets antes de que nada se active, para que veas primero la tasa de resolución y las respuestas exactas sobre conversaciones pasadas reales, no después de que un cliente salga perjudicado. También es por eso que las respuestas se enrutan según la confianza: si el agente de IA no está seguro, redacta un borrador para un humano o escala en vez de adivinar, la diferencia entre un chatbot de IA basado en reglas y una automatización de soporte de verdad.
La buena noticia silenciosa de todo este repaso: como una buena IA para atención al cliente trata al modelo como un motor intercambiable, que la frontera se vuelva más barata y mejor (Inkling hoy, GLM o lo que sea que gane el mes que viene) es un viento a favor que heredas sin tener que recablear nada.
Prueba eesel AI
Si llegaste hasta aquí porque quieres un modelo de IA que resuelva tickets de verdad, no solo que chatee, ese es exactamente el sentido de eesel AI. Se conecta con Zendesk, Freshdesk, Slack y más de 100 herramientas, aprende de tu centro de ayuda y tus tickets pasados, y empieza a redactar o resolver en minutos, no en semanas.

El diferenciador es la rampa de confianza: simula sobre tu historial real de tickets, observa los números, empieza en modo borrador y pasa a totalmente autónomo solo cuando estés contento. Así es como los equipos de mis historias de clientes se sintieron cómodos entregando el volumen de nivel 1, uno de ellos, Gridwise, resolvió el 73% de las solicitudes de nivel 1 en el primer mes. Obtienes la inteligencia de un modelo de frontera envuelta en salvaguardas pensadas para soporte, y nunca quedas atado al modelo que resultó ganar la semana en que te registraste. Los precios son según uso, en torno a 0,40 $ por ticket resuelto, sin tarifas por puesto. Prueba eesel gratis, sin tarjeta de crédito.
Preguntas frecuentes
¿Cuál es la mejor alternativa a Inkling?
¿Hay alguna alternativa más barata a Inkling?
¿Cuáles son las mejores alternativas de pesos abiertos a Inkling?
¿Cómo se compara Inkling con Kimi K3 y GLM-5.2?
¿Debería elegir un modelo cerrado como Claude o GPT-5.6 en lugar de Inkling?
¿Qué alternativa a Inkling es mejor para atención al cliente?
¿Puedo alojar yo mismo una alternativa a Inkling de forma gratuita?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







