Las 8 mejores alternativas a Inkling-Small en 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edición August 4, 2026

Por qué la gente ya está mirando más allá de Inkling-Small
Thinking Machines Lab lanzó Inkling-Small el 30-07-2026 bajo licencia Apache 2.0, quince días después que su modelo padre. La propuesta era razonable y el modelo la cumple. Un cuarto del tamaño del padre, más rápido y también más barato, y en la propia ficha del proveedor incluso supera al padre en SWE-bench Verified, 80,2 frente a 77,6.
La recepción en r/LocalLLaMA tuvo mucho que decir sobre esa palabra "small". El tercer comentario más votado del hilo de lanzamiento no habla de benchmarks en absoluto:
"Pronto, con todos estos modelos de 2-3T, van a llamar 'small' a modelos de 500-700B... llorando con 12 GB de VRAM"
Justo. Pero el nombre no es lo que aleja a nadie del modelo. Lo que sabe, sí.
Artificial Analysis lo sitúa en un Intelligence Index de 40, puesto #15 de 101, que es bastante respetable. Luego la misma página informa la prueba de conocimiento AA-Omniscience: un índice de -9,0, precisión del 30,5 %, tasa de alucinación del 56,9 %. AA describe esa evaluación como una medida de "fiabilidad de conocimiento y alucinación" en un rango de -100 a 100. Así que un número negativo ahí no es ningún artefacto de redondeo. Es el modelo alcanzando una respuesta que no tiene.
El desglose de AA-Briefcase es la parte a la que sigo volviendo. Un Elo general de 917,13, que dice poco hasta que lo separas: presentación 1067,99 frente a calidad analítica de 797,13. El modelo escribe una respuesta mejor de lo que realmente sabe.
La gente que ejecuta estos modelos en su propio hardware lo notó rápido, y en un eje más afilado que el que usan las tablas de benchmarks:
"Pero peor que GPT 5.5 Luna en el índice Omniscience, porque se inventa demasiadas respuestas. 84 % de tasa de alucinación, por eso prefiero otros modelos abiertos, son mejores 'detectando' su propia incertidumbre."
Esa cifra del 84 % es más alta que el 56,9 % que aparece hoy en la página de AA, así que toma el número exacto como su lectura y no la mía. De cualquier forma el punto se mantiene, y es el punto correcto. Están eligiendo un modelo según si sabe cuándo no sabe, en lugar de por lo bien que escribe código.

Otras tres cosas alejan a la gente de él. El precio no es una de ellas.
La ventana de contexto no es la ventana de contexto. AA lista el modelo con 1M de tokens. Lo que realmente sirven sus dos proveedores es 256.000 (Thinking Machines) y 524.288 (DeepInfra). Así que cualquiera que leyera "1M" en la ficha y construyera sobre esa cifra no lo está consiguiendo. El mismo problema existe en el modelo padre, donde la mejor cifra servida es 524k entre tres proveedores, y la fila más barata y rápida de DeepInfra tope en 131k.
Dos proveedores es poco. El padre tiene tres, y el grupo que sirve DeepSeek o GLM es aún mayor. El día del lanzamiento el modelo ni siquiera estaba en OpenRouter, una carencia que un comentarista señaló en Hacker News junto con las cifras de parámetros. Los dos proveedores que sí tienes también se comportan de forma distinta. DeepInfra corre 1,43 veces más rápido en una carga de 10k, y luego se queda por detrás del primer proveedor en 100k, 82,36 tokens por segundo frente a 113,36. Tu perfil de latencia cambia según la longitud del prompt, y eso es algo horrible de descubrir en producción.
Una cobertura pobre también te deja menos margen para buscar otras opciones cuando un proveedor empieza a recortar en algo, lo que pasa más de lo que dejan ver los benchmarks publicados:
"De hecho, descubrimos que muchos proveedores de inferencia están cuantizando los pesos o incluso la caché KV, y debido a los precios bajos con los que sirven en lotes masivos, el resultado es un rendimiento inestable."
El precio no es una sola cifra. El primer proveedor está en 0,30 $ de entrada y 1,20 $ de salida. DeepInfra pide 0,58 $ y 1,44 $ por el contexto más largo. Mezclado, AA muestra 0,222 $ con su ratio por defecto de 7:2:1, mientras que la mezcla clásica de 3:1 llega a 0,525 $. Así que cualquiera que sea la cifra única que termines citando en realidad es una decisión sobre proporciones, y esa decisión importa en cuanto empiezas a modelar el coste del servicio de atención al cliente con IA a volumen.
Para ser justos, nada de esto suma a un mal modelo. El razonamiento se lleva el 95,5 % de su factura de salida, que es exactamente de donde viene la inteligencia, y GPQA Diamond con un 89,5 % más razonamiento de contexto largo al 63 % son cifras reales. Esto es un ejecutor. Los problemas empiezan solo cuando le pides a un ejecutor que sea un sabedor.
Cómo elegí estas ocho
Escribo muchos de estos repasos y la trampa nunca cambia. Rankear por benchmark, publicar, seguir adelante. Así que mantuve el filtro más estrecho aquí.
Cada una de las ocho tenía que ser algo a lo que un usuario de Inkling-Small pudiera cambiarse esta misma semana, así que una API pública en producción con precios publicados, sin listas de espera. Cada precio salió de la propia página de facturación del proveedor el 05-08-2026 en lugar de un sitio comparador, porque las cifras de esos sitios se quedan viejas en menos de dos semanas. Donde un proveedor publica tanto el contexto servido como el anunciado, comprobé uno contra el otro. Las licencias también las leí, y eso importó, porque dos modelos aquí tienen umbrales de ingresos escondidos en las suyas.
Lo que no hice fue simular que seis meses de tráfico de producción pasaron por las ocho. Leí la documentación y las páginas de facturación, las fichas del modelo, las mediciones de AA, y luego dije solo lo que eso respalda.
Las mejores alternativas a Inkling-Small de un vistazo
Todos los precios de abajo son por millón de tokens en USD, comprobados el 05-08-2026.
| Modelo | Mejor para | Pesos | Parámetros | Entrada | Salida | Contexto real | Modalidades de entrada | La trampa |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (base) | Ejecución agéntica barata | Apache 2.0 | 276B / 12B activos (266B según AA) | 0,30 $ | 1,20 $ | 256K primer proveedor, 524.288 en DeepInfra | Texto, imagen, audio | Índice de conocimiento -9,0 |
| DeepSeek V4 Flash | Mismo trabajo, un cuarto del coste | MIT | 284B / 13B | 0,14 $ | 0,28 $ | 1M | Texto | Se ha anunciado un recargo 2x en horas punta |
| Inkling, el padre | Quedarse en la familia, sabiendo más | Apache 2.0 | 975B / 41B | 1,00 $ | 4,05 $ | 524K en el mejor caso, 131K en el más barato | Texto, imagen, audio | Dos páginas de AA citan precios distintos |
| GLM-5.2 | Los pesos abiertos más fuertes que puedes alojar | MIT | ~753B total | 1,40 $ | 4,40 $ | 1M | Texto | Tope de salida de 128K |
| MiniMax M3 | Entrada de vídeo, al precio de Inkling-Small | Licencia comunitaria propia | 428B / 23B | 0,30 $ | 1,20 $ | 1M, 512K garantizado | Texto, imagen, vídeo | No comercial por defecto |
| Kimi K3 | Trabajo de agente a largo plazo | Licencia propia (Kimi K3 Licence) | 2,8T | 3,00 $ | 15,00 $ | 1.048.576 | Texto | Sin nivel batch, 3 RPM en el nivel de entrada |
| Qwen3.8-Max | Modelo cerrado, ventana generosa | Cerrado | No revelado | 2,00 $ | 6,00 $ | 1M | Texto | Dos precios para un modelo |
| Gemini 3.6 Flash | Entrada de audio sin sobreprecio | Cerrado | No revelado | 1,50 $ | 7,50 $ | 1.048.576 | Texto, imagen, vídeo, audio, PDF | Techo de salida de 65.536 |
| Claude Opus 5 | Cuando las respuestas equivocadas cuestan dinero | Cerrado | No revelado | 5,00 $ | 25,00 $ | 1M, sin recargo | Texto, imagen | El tokenizador más nuevo emite ~30 % más tokens |
1. DeepSeek V4 Flash
Mejor para: hacer lo que hace Inkling-Small, a aproximadamente un cuarto del coste de salida.
Esta es la comparación a la que recurre primero un usuario real de Inkling-Small, y también fue el comentario sustantivo más votado en el hilo de lanzamiento de r/LocalLLaMA:
"Me pregunto cómo se compara con DSV4 Flash. Comparable en el benchmark de inteligencia de Artificial Analysis (ambos 40). Parece hacerlo algo mejor en codificación / flujos de trabajo agénticos, eso sí."
Esa es la forma que tiene. DeepSeek V4 Flash corre con 284B totales y 13B activos, junto a los 12B de Inkling-Small, y AA pone a ambos en 40. Motor parecido. Factura no tan parecida.
Hay una cosa que las cifras de parámetros esconden, y que importa si el auto-alojamiento está en tu lista. DeepSeek se distribuye de forma nativa en FP4 y FP8 mixtos, mientras que Inkling-Small se distribuye en bf16, así que a precisión nativa un ejecutor local puso a uno en unos 160 GB frente a 540 GB del otro. Sobre el papel, el mismo tamaño aproximado. En la práctica, el triple de memoria.
Características. Pesos con licencia MIT en Hugging Face, más una ventana de contexto de 1M y una salida máxima de 384K, la mayor de esta lista por un margen amplio. La limitación de tasa se basa en concurrencia en lugar de solicitudes por minuto, con un tope publicado de 2.500 solicitudes simultáneas por cuenta.
Ventajas. La economía de caché es la verdadera historia. Un acierto de caché cuesta 0,0028 $ por millón de tokens de entrada, 50 veces por debajo de la tasa de fallo de caché de 0,14 $, así que cualquier cosa con un prompt de sistema estable se vuelve absurdamente barata. Y MIT es la licencia más limpia del grupo, sin umbral de ingresos, sin cláusula de atribución.
Desventajas. Solo texto, así que cualquier audio que le estuvieras enviando a Inkling-Small no tiene dónde ir. También hay una nota en la página de precios que anuncia un futuro recargo 2x en horas punta entre las 09:00 y las 12:00 y las 14:00 y las 18:00 hora de Pekín, con fecha de entrada en vigor "sujeta al anuncio oficial". Una incógnita conocida dentro de tu modelo de costes.
Precios. 0,14 $ de entrada y 0,28 $ de salida por millón, aciertos de caché a 0,0028 $. Pro está en 0,435 $ y 0,87 $, exactamente 3,1 veces Flash en ambos lados. Los ejemplos calculados están en nuestro desglose de precios de DeepSeek V4 Flash, y lo comparamos contra Kimi K3 por separado.
Mi opinión: si el dinero es tu razón para irte, deja de leer aquí. Si es la precisión, sigue leyendo, porque volverse más barato nunca ha hecho que un modelo sepa más.
2. Inkling, el padre
Mejor para: quedarte con los mismos pesos, herramientas y licencia mientras recompras la precisión factual.

A menudo la alternativa más interesante a un modelo pequeño es el modelo grande del que se destiló, y aquí las cifras lo demuestran con claridad. Bajo la misma metodología de AA, Inkling puntúa 41 en el Intelligence Index frente al 40 de Small, así que ahí queda igualado. AA-Omniscience es donde se separan: 2,05 con 39,95 % de precisión, frente a -9,0 y 30,5 %. Casi un tercio más de las preguntas vuelven correctas.
Características. 975B totales con 41B activos en 66 capas, Apache 2.0, y texto más imagen más audio de entrada. Ahora tres proveedores de servicio, cuando en el lanzamiento había solo uno: DeepInfra, Together AI y Thinking Machines.
Ventajas. Misma licencia, misma familia, así que la migración es sobre todo cambiar una cadena de texto del modelo. La fila FP8 de DeepInfra es rápida, 201,5 tokens por segundo, y el coste por tarea de Intelligence Index ahí sale en 0,4296 $, barato para este nivel.
Desventajas. Dos páginas de AA discrepan actualmente en el precio, así que conviene saber cuál estás citando. La página del modelo dice 1,87 $ de entrada y 4,68 $ de salida. Las filas de proveedores todas dicen 1,00 $ y 4,05 $. Esas cifras de proveedores se mantienen consistentes entre las tres, así que ese es el par contra el que yo planificaría. El contexto servido también es confuso. Es 524k en el mejor caso, y la fila barata y rápida de DeepInfra topa en 131k, o el 13,1 % del millón anunciado.
Precios. Según los datos de los proveedores, 1,00 $ de entrada y 4,05 $ de salida, con 0,17 $ por un acierto de caché y 0,724 $ mezclado. Llamémoslo 3,4 veces la tarifa de salida de Small. Si es el padre lo que estás comprando, el artículo de alternativas a Inkling cubre la gama más amplia.
Mi opinión: la elección obvia, y la que la mayoría se salta, porque "subir al hermano mayor" se siente como admitir que el pequeño fue un error. No lo fue. Solo era la herramienta equivocada para un trabajo de conocimiento.
3. GLM-5.2
Mejor para: los pesos abiertos más fuertes de esta lista que puedes alojar de forma realista tú mismo.
GLM-5.2 es el escalón que te mantiene en territorio con licencia MIT. Alrededor de 753B parámetros totales, con un contexto de 1M que su API realmente sirve, y 2,23 millones de descargas en el repositorio zai-org/GLM-5.2. Ese número de descargas dice que la comunidad de auto-alojamiento ya lo ha puesto a prueba a fondo.
Características. Pesos MIT con un contexto de 1M y una salida máxima de 128K, luego entrada en caché a 0,26 $, con almacenamiento de caché listado como gratuito por ahora. Z.ai también vende una vía de suscripción. El Coding Plan empieza en 18 $ al mes, con descuento a 12,60 $, e incluye 10.000 créditos por semana.
Z.ai publica su propia curva de nivel de esfuerzo, y mirarla es mejor que tomar la puntuación destacada al pie de la letra:

Ventajas. GLM-5.2 cuesta lo mismo que costaba GLM-5.1, 1,40 $ y 4,40 $, y mientras tanto la ventana de contexto pasó de 200K a 1M. Una mejora gratis, sin más. Una licencia MIT sin cláusula de ingresos también vale más que uno o dos puntos de benchmark en cuanto lo estás lanzando dentro de un producto.
Desventajas. Ese tope de salida de 128K es el más ajustado entre las opciones de pesos abiertos aquí, frente a los 384K de DeepSeek. Los créditos del Coding Plan se queman a 3x en hora punta y 2x fuera de ella, con la tarifa fuera de hora punta temporalmente en 1x hasta finales de septiembre, así que las cuentas de la suscripción necesitan vigilancia.
Precios. 1,40 $ de entrada, 4,40 $ de salida, 0,26 $ en caché. Hay hermanos más baratos si puedes vivir con menos. GLM-4.7 y GLM-4.6 van ambos a 0,60 $ y 2,20 $, mientras que GLM-4.7-FlashX está en 0,07 $ y 0,40 $.
Mi opinión: el mejor equilibrio licencia-capacidad de la lista. Si tu equipo legal alguna vez ha preguntado qué pasa el día en que un proveedor cambia los términos, señala esta fila.
4. MiniMax M3
Mejor para: igualar el precio exacto de Inkling-Small mientras añade entrada de vídeo.
Este es un empate directo de precio, y eso hace la comparación inusualmente clara. Por debajo de 512K de entrada, MiniMax M3 cobra 0,30 $ de entrada y 1,20 $ de salida, idéntico a la tarifa de primer proveedor de Inkling-Small, saliendo de un modelo de 428B con 23B activos. Lo que te deja eligiendo por todo excepto el coste.
Características. Un contexto de 1M con 512K garantizado como mínimo, lecturas de caché a 0,06 $, y entrada de texto más imagen más vídeo llegando a través de partes de contenido image_url y video_url. El modo de pensamiento cuesta lo mismo activado o desactivado. Los pesos están disponibles en Hugging Face en MiniMaxAI/MiniMax-M3, con 170.353 descargas hasta ahora.
Ventajas. Casi el doble de los parámetros activos de Inkling-Small por el mismo dinero, y entrada de vídeo encima, algo que nada más a este precio en la lista ofrece. La página de precios etiqueta la tarifa actual como "50 % de descuento permanente", y no hay ninguna fecha de caducidad impresa en ningún sitio.
Desventajas. La licencia es la verdadera trampa aquí. La MINIMAX COMMUNITY LICENSE es no comercial por defecto, el uso comercial pide un crédito visible de "Built with MiniMax M3", y por encima de 20 millones $ de ingresos anuales necesitas autorización por escrito. Al pasar los 512K de entrada, ambas tarifas se duplican, así que 0,60 $ y 2,40 $. También existe un nivel Priority, a 1,5x, si te merece la pena la cola más rápida.
Precios. 0,30 $ y 1,20 $ hasta 512K de entrada, luego 0,60 $ y 2,40 $ por encima, lecturas de caché a 0,06 $. Priority corre a 0,45 $ y 1,80 $, o 0,90 $ y 3,60 $ una vez superado el umbral.
Mi opinión: buen motor, licencia que hay que sentarse a leer. Una startup por debajo de la línea de ingresos, contenta con imprimir el crédito, consigue aquí más modelo por dólar que del modelo que está dejando.
5. Kimi K3
Mejor para: trabajo de agente a largo plazo donde la ejecución importa más que el precio del token.
Kimi K3 es un salto mucho mayor que cualquier cosa de arriba, y en su propia documentación de precios Moonshot lo llama el buque insignia para "codificación a largo plazo y trabajo de conocimiento de extremo a extremo". Con 2,8 billones de parámetros servidos en mxfp4 de 4-bit, es también el modelo más grande aquí cuyos pesos puedes descargar.
Características. Un contexto de 1.048.576 tokens, razonamiento siempre activo detrás de un ajuste reasoning_effort de low, high o max (max por defecto), y un repositorio moonshotai/Kimi-K3 sin restricciones. La búsqueda web se facturan por separado, 0,005 $ por llamada exitosa.
Ventajas. Pesos abiertos a esta escala es inusual. La tarifa de acierto de caché de 0,30 $ frente a 3,00 $ de entrada por fallo de caché es también un ahorro de 10 veces cuando el contexto se repite. Y el rango medio está cubierto por hermanos más baratos, con kimi-k2.7-code a 0,95 $ y 4,00 $.
Desventajas. Dos trampas operativas aquí, y ambas muerden. K3 no está soportado en el nivel batch, así que el descuento del 60 % que tienen otros modelos Kimi no le llega. El sistema de niveles también está condicionado al gasto: el nivel 0, con 1 $ de recarga acumulada, permite 1 solicitud simultánea y 3 solicitudes por minuto, subiendo a 1.000 simultáneas y 10.000 RPM al alcanzar el nivel 5 con 3.000 $. La licencia parece de estilo MIT, pero luego añade una cláusula que exige un acuerdo aparte para negocios de modelo-como-servicio por encima de 20 millones $ de ingresos en cualquier periodo de doce meses consecutivos.
Precios. 3,00 $ de entrada y 15,00 $ de salida, con 0,30 $ en un acierto de caché. A 12,5 veces la tarifa de salida de Inkling-Small, nadie debería confundir esto con un cambio lateral. Las tablas completas de niveles están en precios de Kimi K3.
Mi opinión: la elección cuando la carga es una ejecución larga de agente en lugar de miles de respuestas cortas. Para tráfico con forma de ticket, se vuelve difícil justificarlo frente a GLM-5.2 a un tercio del precio.
6. Qwen3.8-Max
Mejor para: un modelo cerrado con una ventana verdaderamente generosa y una asignación de prueba gratuita.
Qwen3.8-Max es donde llegas una vez que has decidido que los pesos abiertos no son el objetivo y sí lo es el nivel comercial más alto de Alibaba. La sorpresa agradable en la página de facturación es que Max finalmente eliminó los tramos por longitud de entrada. Una sola banda, que cubre toda la ventana de un millón de tokens.
Características. Un contexto de 1M, salida máxima de 131K y razonamiento máximo de 262K, con TPM de 2 millones frente a RPM de 15.000. El caché implícito cuesta 0,25 $. También hay una cuota gratuita de 1 millón de tokens, válida durante 90 días.
Ventajas. No tener tramos por longitud de entrada es un cambio más grande de lo que suena. La regla de tramos de Alibaba funciona de todo o nada, así que en el antiguo qwen3-max, cruzar un límite reprecificaba toda la solicitud, y un prompt de 33K tokens saltaba de 1,20 $ a 2,40 $ en entrada. Aquí esa trampa desaparece. El millón de tokens gratuitos también te da margen real para evaluar en condiciones.
Desventajas. Un solo ID de modelo, dos precios, según el alcance del despliegue: 2,00 $ y 6,00 $ en las tablas International y Singapore, 1,65 $ y 4,951 $ en las Global. Una diferencia del 18 % sin ninguna diferencia de comportamiento detrás es confusa para presupuestar. La cuota gratuita es solo para Singapur, su reloj no se pausa por inactividad, y lo que quede se anula al expirar. El batch tiene un 50 % de descuento pero no se combina con los descuentos de caché. Max también es cerrado, y los pesos publicados de Qwen van dos generaciones por detrás, el más reciente del 24-04-2026.
Precios. 2,00 $ de entrada y 6,00 $ de salida en International y Singapore, luego 1,65 $ y 4,951 $ en Global. La creación explícita de caché cuesta 2,50 $, un 125 % de la entrada. El detalle completo está en nuestro artículo de precios de Qwen3.8-Max, y está la recopilación de alternativas a Qwen3.8-Max si estás comprando en la otra dirección.
Mi opinión: sólido, y algo caro frente a GLM-5.2, que pide menos y te da los pesos. La cuota gratuita sigue siendo una razón para probarlo.
7. Gemini 3.6 Flash
Mejor para: entrada de audio y multimedia sin pagar una prima por el formato.
¿Estabas en Inkling-Small específicamente por la entrada de audio? Entonces este es el sustituto más cercano con un nivel de servicio real detrás. Gemini 3.6 Flash cobra una única tarifa de entrada plana de 1,50 $ que cubre texto, imagen, vídeo, audio y PDF, y eso rompe un patrón que Google mismo había fijado. En Gemini 2.5 Flash, la entrada de audio costaba 1,00 $ frente a 0,30 $ de texto, y en 2.0 Flash el múltiplo llegaba a 7x.
Características. 1.048.576 tokens de entrada frente a 65.536 de salida, caché a 0,15 $ por millón más 1,00 $ por millón por hora de almacenamiento, con los niveles Batch y Flex ambos a mitad de precio, 0,75 $ y 3,75 $.
Ventajas. La tarifa plana de multimedia es lo destacado aquí, y un nivel Batch a 0,75 $ y 3,75 $ hace asequible el trabajo masivo. La página de precios de Google lo lista como estable en lugar de vista previa, y eso importa si esto va a acercarse a clientes.
Desventajas. Ese techo de salida de 65.536 es el más ajustado aquí, así que las generaciones largas hay que fragmentarlas. La facturación de caché basada en almacenamiento funciona como un medidor en lugar de un cargo único, a diferencia de las tarifas planas de lectura de caché de otros modelos. Los pesos son cerrados, así que no hay auto-alojamiento. El grounding en Gemini 3.x tampoco está disponible en el nivel gratuito, lo que significa que evaluar cuesta dinero.
Precios. Estándar es 1,50 $ de entrada y 7,50 $ de salida, Batch o Flex 0,75 $ y 3,75 $, Priority 2,70 $ y 13,50 $. Donde el presupuesto es la limitación, Gemini 3.5 Flash-Lite llega a 0,30 $ y 2,50 $, y tampoco tiene distinción de audio. La escala completa está en precios de Gemini 3.6 Flash.
Mi opinión: la elección de audio. También el único modelo aquí al que enviaría multimedia mixta a volumen sin pensarlo dos veces.
8. Claude Opus 5
Mejor para: los casos en los que una respuesta equivocada dicha con seguridad cuesta dinero real.
Este es el extremo final de la escalera, y una razón para incluirlo en la lista. Responde al problema específico que tiene Inkling-Small. Claude Opus 5 cuesta 5,00 $ de entrada y 25,00 $ de salida, aproximadamente 21 veces la tarifa de salida de Inkling-Small, y lo compras cuando el coste de una respuesta equivocada supera la factura de tokens.
Características. El contexto completo de 1M al precio estándar, con ningún nivel de recargo por contexto largo, algo inusual. La documentación de precios de Anthropic lo detalla: una solicitud de 900k tokens se factura a la misma tarifa por token que una de 9k. Las lecturas de caché cuestan 0,50 $. La API Batch aplica un 50 % de descuento plano en ambos lados, 2,50 $ y 12,50 $, y se combina con el caché.
Ventajas. Sin un acantilado de longitud de contexto, toda una categoría de sorpresas de facturación desaparece. El pensamiento extendido no tiene precio aparte y se factura como salida estándar. Batch junto con caché también baja mucho las cargas pesadas y repetidas respecto al precio de etiqueta.
Desventajas. En cualquier comparación de costes, el tokenizador es la trampa. Anthropic señala que Claude 4.7 y posteriores "producen aproximadamente un 30 % más de tokens para el mismo texto" que el tokenizador anterior, así que esa etiqueta de 25,00 $ subestima la verdadera brecha por tarea frente a un rival que aún use uno más antiguo. El modo rápido duplica ambos lados a 10,00 $ y 50,00 $, funciona solo en la API de primer proveedor y no se combina con Batch. Los pesos son cerrados.
Precios. Estándar 5,00 $ y 25,00 $, Batch 2,50 $ y 12,50 $, modo rápido 10,00 $ y 50,00 $, lectura de caché 0,50 $. La parada más barata es Sonnet 5 a 2,00 $ y 10,00 $ hasta el 31 de agosto de 2026, que pasa a 3,00 $ y 15,00 $ el 1 de septiembre. Cuándo merece la pena pagar esa diferencia se cubre en nuestra comparación Opus 5 frente a Sonnet 5.
Mi opinión: excesivo para la mayoría del tráfico de tickets, exactamente adecuado para el 5 % que toca dinero, políticas o un contrato. Enruta por tipo de pregunta en lugar de elegir un modelo para todo.
La escalera de precios, en una sola imagen
Alinea las ocho una junto a otra por precio de salida, y la forma de la decisión se vuelve obvia.

Inkling-Small ya está cerca del suelo. Existe exactamente un escalón significativo hacia abajo, DeepSeek V4 Flash a 0,28 $, más un movimiento lateral al mismo precio en MiniMax M3. Todo lo demás aquí es un escalón hacia arriba, y lo que compra un escalón hacia arriba nunca es velocidad.
Merece la pena hacer los números de lo que cuesta cualquiera de esto a volumen de tickets. Toma mil tickets en un mes, y calcula 2.000 tokens de salida por respuesta, que es generoso para una respuesta de soporte. Así que 2 millones de tokens de salida.
| Modelo | Coste de salida, 2M tokens | Frente a Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | 0,56 $ | 1,84 $ más barato |
| Inkling-Small | 2,40 $ | base |
| MiniMax M3 | 2,40 $ | idéntico |
| GLM-5.2 | 8,80 $ | 6,40 $ más |
| Inkling | 8,10 $ | 5,70 $ más |
| Gemini 3.6 Flash | 15,00 $ | 12,60 $ más |
| Kimi K3 | 30,00 $ | 27,60 $ más |
| Claude Opus 5 | 50,00 $ | 47,60 $ más |
A este volumen, toda la diferencia entre el más barato y el más caro es de unos 50 $ al mes. Una sola escalada gestionada mal te cuesta más que eso. Que es el verdadero argumento para subir la escalera, y también por qué la elección de modelo no es donde está la mayor palanca.
Lo que nada de esto arregla en una cola de soporte
Ninguna de las ocho filas de arriba resuelve la siguiente parte, y por eso sigo insistiendo cuando alguien me dice que ha encontrado un modelo más barato.
He visto este fallo exacto ocurrir en cuentas de pago. Un modelo no se detiene cuando la recuperación vuelve vacía. Rellena el hueco con lo que aprendió en el entrenamiento. Un cliente, un proveedor danés de energía solar, tuvo un bot que se inventó afirmaciones sobre suscripciones y las envió a clientes reales. Otro le preguntó algo a su bot y recibió "Oxígeno (tabla periódica)" como respuesta. Ninguno de los dos casos fue un mal modelo. Ambos fueron un modelo sin nada contra lo que anclarse, y sin nada que le impidiera adivinar.
Un gerente de soporte de nuestras cuentas puso la misma preocupación en términos más claros, diciéndole a la IA lo que no debía hacer:
"deja de decirle a los clientes que lo vamos a solucionar. No lo sabes"
Un gerente de soporte de e-commerce, preocupado por que un bot prometiera de más las fechas de entrega. El mismo tipo de problema. El modelo suena seguro, y ese sonar seguro es la parte peligrosa. El propio desglose AA-Briefcase de Inkling-Small lo dice sin rodeos: 270,86 puntos Elo mejor presentando que analizando.

Un modelo más grande no es la solución. Dos cosas con las que un modelo no viene equipado, sí lo son. Primero el grounding, para que la respuesta salga de tu centro de ayuda y de tus tickets pasados en lugar de la memoria paramétrica. Luego una barrera de confianza, para que todo lo que esté por debajo del umbral vaya a una persona en lugar de salir. Esas dos cosas convierten un motor en crudo en algo que puedes apuntar a una cola en vivo, y son todo el tema de la prevención de alucinaciones de IA.
La otra razón por la que la gente deja de comparar modelos es más mundana que eso. Un desarrollador con el que hablamos, montando una base de conocimiento de incidentes de TI, ya había dado toda la vuelta. Probó la API de un proveedor y la encontró demasiado cara, probó otra y la encontró poco fiable, y al final solo quería algo que funcionara. Comparar modelos es divertido. Mantener una capa de modelo no lo es.
Prueba eesel
Si el modelo que estás eligiendo va a responder preguntas de clientes, el consejo honesto viene en dos partes. Toma cualquiera de los ocho de arriba que se ajuste a tu presupuesto y a tu licencia. Y luego no construyas tú mismo la capa por encima.
Esa capa es lo que es eesel. Se conecta a Zendesk, Freshdesk o lo que ya estés usando, aprende de tus tickets resueltos pasados y tu centro de ayuda en lugar de los datos de entrenamiento de un modelo, y solo responde una vez que supera un umbral de confianza que tú mismo defines. Todo lo que quede por debajo escala. Y antes de que toque tráfico en vivo puedes simularlo contra tu propio historial de tickets, así aprendes qué habría respondido mal antes de que lo haga un cliente.

Pongo nuestra propia tasa de error factual medida del 7 % al principio en lugar de enterrarla, porque esa es la cifra que importa mientras eliges un modelo. Salió del tráfico real de Zendesk de una joyería alemana, alrededor de mil tickets al mes, validada de forma cruzada en 284 chats y 100 tickets, con recuperación sobre su centro de ayuda real. El grounding no te va a llevar a cero. Te da una cifra que puedes medir, sobre la que puedes poner una barrera, y luego mejorar, y eso es una categoría distinta de cosa a un modelo que adivina con seguridad.
El enfoque comercial deliberadamente no es por asiento. La facturación va por ticket resuelto, así que los precios siguen el trabajo hecho y no la plantilla. Gratis para probar. Si prefieres comprobar los números primero, la guía de deflexión de tickets es un buen punto de partida.
Mi opinión
Inkling-Small es un buen modelo pequeño al que la gente sigue pidiéndole que haga un trabajo para el que no fue construido. Ejecuta bien y a un precio ya cerca del suelo, y su fiabilidad de conocimiento mide -9,0. Esos dos hechos no están en tensión. Juntos describen una herramienta.
¿Te vas por el coste? Toma DeepSeek V4 Flash y ya está hecho. Si lo que te empuja a salir son las respuestas equivocadas, sube al Inkling padre para la solución barata, o a Claude Opus 5 para la cara, y entra sabiendo que ninguna de las dos te lleva a cero.
Y si la razón es que la ventana de contexto no coincide con la ficha, GLM-5.2 sirve lo que anuncia, bajo MIT. Esa es la fila que elegiría si me obligaran a quedarme con una sola.
El veredicto honesto sobre las ocho sigue siendo el mismo. Cambiar de motor mueve tu factura y tus puntuaciones de benchmark. No cambia lo que pasa cuando un cliente pregunta algo que tu documentación nunca respondió. Cerrar esa brecha necesita recuperación, un umbral de confianza, un traspaso. Ninguna mejora de modelo lo hace por ti, y merece la pena resolverlo antes de que pases otra tarde leyendo benchmarks de clasificación de tickets con IA.
Preguntas frecuentes
¿Cuáles son las mejores alternativas a Inkling-Small?
¿Existe una alternativa más barata a Inkling-Small?
¿Por qué cambiar de Inkling-Small?
¿De verdad tiene Inkling-Small una ventana de contexto de 1M?
¿Qué alternativa a Inkling-Small tiene la mejor licencia abierta?
¿Cuánto cuesta ejecutar una alternativa a Inkling-Small en tickets de soporte?
¿Puedo alojar yo mismo una alternativa a Inkling-Small en lugar de pagar por token?
¿Es Inkling-Small lo bastante bueno para atención al cliente por sí solo?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






