Las 8 mejores alternativas a Inkling-Small en 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Un modelo pequeño apartado mientras cinco modelos alternativos reciben la luz

Por qué la gente ya está mirando más allá de Inkling-Small

Thinking Machines Lab lanzó Inkling-Small el 30-07-2026 bajo licencia Apache 2.0, quince días después que su modelo padre. La propuesta era razonable y el modelo la cumple. Un cuarto del tamaño del padre, más rápido y también más barato, y en la propia ficha del proveedor incluso supera al padre en SWE-bench Verified, 80,2 frente a 77,6.

La recepción en r/LocalLLaMA tuvo mucho que decir sobre esa palabra "small". El tercer comentario más votado del hilo de lanzamiento no habla de benchmarks en absoluto:

Reddit

"Pronto, con todos estos modelos de 2-3T, van a llamar 'small' a modelos de 500-700B... llorando con 12 GB de VRAM"

Justo. Pero el nombre no es lo que aleja a nadie del modelo. Lo que sabe, sí.

Artificial Analysis lo sitúa en un Intelligence Index de 40, puesto #15 de 101, que es bastante respetable. Luego la misma página informa la prueba de conocimiento AA-Omniscience: un índice de -9,0, precisión del 30,5 %, tasa de alucinación del 56,9 %. AA describe esa evaluación como una medida de "fiabilidad de conocimiento y alucinación" en un rango de -100 a 100. Así que un número negativo ahí no es ningún artefacto de redondeo. Es el modelo alcanzando una respuesta que no tiene.

El desglose de AA-Briefcase es la parte a la que sigo volviendo. Un Elo general de 917,13, que dice poco hasta que lo separas: presentación 1067,99 frente a calidad analítica de 797,13. El modelo escribe una respuesta mejor de lo que realmente sabe.

La gente que ejecuta estos modelos en su propio hardware lo notó rápido, y en un eje más afilado que el que usan las tablas de benchmarks:

Reddit

"Pero peor que GPT 5.5 Luna en el índice Omniscience, porque se inventa demasiadas respuestas. 84 % de tasa de alucinación, por eso prefiero otros modelos abiertos, son mejores 'detectando' su propia incertidumbre."

Esa cifra del 84 % es más alta que el 56,9 % que aparece hoy en la página de AA, así que toma el número exacto como su lectura y no la mía. De cualquier forma el punto se mantiene, y es el punto correcto. Están eligiendo un modelo según si sabe cuándo no sabe, en lugar de por lo bien que escribe código.

Tres razones por las que los equipos abandonan Inkling-Small, cada una apuntando a un modelo de recambio distinto
Tres razones por las que los equipos abandonan Inkling-Small, cada una apuntando a un modelo de recambio distinto

Otras tres cosas alejan a la gente de él. El precio no es una de ellas.

La ventana de contexto no es la ventana de contexto. AA lista el modelo con 1M de tokens. Lo que realmente sirven sus dos proveedores es 256.000 (Thinking Machines) y 524.288 (DeepInfra). Así que cualquiera que leyera "1M" en la ficha y construyera sobre esa cifra no lo está consiguiendo. El mismo problema existe en el modelo padre, donde la mejor cifra servida es 524k entre tres proveedores, y la fila más barata y rápida de DeepInfra tope en 131k.

Dos proveedores es poco. El padre tiene tres, y el grupo que sirve DeepSeek o GLM es aún mayor. El día del lanzamiento el modelo ni siquiera estaba en OpenRouter, una carencia que un comentarista señaló en Hacker News junto con las cifras de parámetros. Los dos proveedores que sí tienes también se comportan de forma distinta. DeepInfra corre 1,43 veces más rápido en una carga de 10k, y luego se queda por detrás del primer proveedor en 100k, 82,36 tokens por segundo frente a 113,36. Tu perfil de latencia cambia según la longitud del prompt, y eso es algo horrible de descubrir en producción.

Una cobertura pobre también te deja menos margen para buscar otras opciones cuando un proveedor empieza a recortar en algo, lo que pasa más de lo que dejan ver los benchmarks publicados:

Hacker News

"De hecho, descubrimos que muchos proveedores de inferencia están cuantizando los pesos o incluso la caché KV, y debido a los precios bajos con los que sirven en lotes masivos, el resultado es un rendimiento inestable."

El precio no es una sola cifra. El primer proveedor está en 0,30 $ de entrada y 1,20 $ de salida. DeepInfra pide 0,58 $ y 1,44 $ por el contexto más largo. Mezclado, AA muestra 0,222 $ con su ratio por defecto de 7:2:1, mientras que la mezcla clásica de 3:1 llega a 0,525 $. Así que cualquiera que sea la cifra única que termines citando en realidad es una decisión sobre proporciones, y esa decisión importa en cuanto empiezas a modelar el coste del servicio de atención al cliente con IA a volumen.

Para ser justos, nada de esto suma a un mal modelo. El razonamiento se lleva el 95,5 % de su factura de salida, que es exactamente de donde viene la inteligencia, y GPQA Diamond con un 89,5 % más razonamiento de contexto largo al 63 % son cifras reales. Esto es un ejecutor. Los problemas empiezan solo cuando le pides a un ejecutor que sea un sabedor.

Cómo elegí estas ocho

Escribo muchos de estos repasos y la trampa nunca cambia. Rankear por benchmark, publicar, seguir adelante. Así que mantuve el filtro más estrecho aquí.

Cada una de las ocho tenía que ser algo a lo que un usuario de Inkling-Small pudiera cambiarse esta misma semana, así que una API pública en producción con precios publicados, sin listas de espera. Cada precio salió de la propia página de facturación del proveedor el 05-08-2026 en lugar de un sitio comparador, porque las cifras de esos sitios se quedan viejas en menos de dos semanas. Donde un proveedor publica tanto el contexto servido como el anunciado, comprobé uno contra el otro. Las licencias también las leí, y eso importó, porque dos modelos aquí tienen umbrales de ingresos escondidos en las suyas.

Lo que no hice fue simular que seis meses de tráfico de producción pasaron por las ocho. Leí la documentación y las páginas de facturación, las fichas del modelo, las mediciones de AA, y luego dije solo lo que eso respalda.

Las mejores alternativas a Inkling-Small de un vistazo

Todos los precios de abajo son por millón de tokens en USD, comprobados el 05-08-2026.

ModeloMejor paraPesosParámetrosEntradaSalidaContexto realModalidades de entradaLa trampa
Inkling-Small (base)Ejecución agéntica barataApache 2.0276B / 12B activos (266B según AA)0,30 $1,20 $256K primer proveedor, 524.288 en DeepInfraTexto, imagen, audioÍndice de conocimiento -9,0
DeepSeek V4 FlashMismo trabajo, un cuarto del costeMIT284B / 13B0,14 $0,28 $1MTextoSe ha anunciado un recargo 2x en horas punta
Inkling, el padreQuedarse en la familia, sabiendo másApache 2.0975B / 41B1,00 $4,05 $524K en el mejor caso, 131K en el más baratoTexto, imagen, audioDos páginas de AA citan precios distintos
GLM-5.2Los pesos abiertos más fuertes que puedes alojarMIT~753B total1,40 $4,40 $1MTextoTope de salida de 128K
MiniMax M3Entrada de vídeo, al precio de Inkling-SmallLicencia comunitaria propia428B / 23B0,30 $1,20 $1M, 512K garantizadoTexto, imagen, vídeoNo comercial por defecto
Kimi K3Trabajo de agente a largo plazoLicencia propia (Kimi K3 Licence)2,8T3,00 $15,00 $1.048.576TextoSin nivel batch, 3 RPM en el nivel de entrada
Qwen3.8-MaxModelo cerrado, ventana generosaCerradoNo revelado2,00 $6,00 $1MTextoDos precios para un modelo
Gemini 3.6 FlashEntrada de audio sin sobreprecioCerradoNo revelado1,50 $7,50 $1.048.576Texto, imagen, vídeo, audio, PDFTecho de salida de 65.536
Claude Opus 5Cuando las respuestas equivocadas cuestan dineroCerradoNo revelado5,00 $25,00 $1M, sin recargoTexto, imagenEl tokenizador más nuevo emite ~30 % más tokens

¿Qué alternativa a Inkling-Small se ajusta a tu razón para irte?

Elige la frase que más se parezca a tu semana.

Ve con Claude Opus 5, o con el Inkling padre si el presupuesto está ajustado

5,00 $ / 25,00 $Opus 5, por 1M de tokens 1,00 $ / 4,05 $Inkling, por 1M de tokens 2,05 vs -9,0Inkling vs Small, AA-Omniscience

El índice de conocimiento de Inkling-Small es negativo y el de su padre es positivo, así que la solución real más barata es subir un escalón dentro de la misma familia: misma licencia, mismas herramientas, aproximadamente 3,4 veces el precio de salida. Opus 5 cuesta mucho más y es al que recurrir cuando una respuesta equivocada significa un reembolso, un problema de cumplimiento o un cliente perdido.

Ningún modelo de esta lista llega a cero. El grounding en tus propios documentos más una barrera de confianza hacen más por la precisión que cualquier mejora aquí.

Ve con DeepSeek V4 Flash

0,14 $ / 0,28 $por 1M de tokens 4,3xsalida más barata que Inkling-Small MITlicencia sobre los pesos

Los aciertos de caché caen en 0,0028 $ por millón, que es 50 veces por debajo de su propia tasa de fallo de caché, así que una carga de trabajo repetitiva se vuelve muy barata muy rápido. Pesos MIT, contexto de 1M, 2.500 solicitudes simultáneas según los límites publicados. MiniMax M3 es el subcampeón, exactamente a la tarifa de Inkling-Small, con entrada de vídeo incluida.

DeepSeek ha anunciado un recargo 2x en horas punta de 09:00 a 12:00 y de 14:00 a 18:00 hora de Pekín. Todavía sin fecha de inicio, así que modela tu pico contra la tarifa duplicada.

Ve con DeepSeek V4 Flash o GLM-5.2

1Mservido, ambos modelos 256KInkling-Small, primer proveedor 384K / 128Ksalida máxima, DeepSeek / GLM

Ambos anuncian una ventana de 1M y ambos realmente la sirven, que es la diferencia que importa. GLM-5.2 cuesta lo mismo que costaba GLM-5.1 a 200K, así que la ventana salió gratis. Aun así, vigila los techos de salida: DeepSeek permite 384K de salida, GLM topa en 128K.

Contexto largo y razonamiento de contexto largo son cosas distintas. Inkling-Small puntúa 63 % en la prueba de razonamiento de contexto largo de AA, así que una ventana más grande por sí sola no arreglará un problema de memoria.

Ve con Kimi K3, o Gemini 3.6 Flash si necesitas audio

3,00 $ / 15,00 $Kimi K3, por 1M 1,50 $ / 7,50 $Gemini 3.6 Flash, por 1M 2,8Tparámetros de Kimi K3

Kimi K3 está construido para ejecuciones de agente a largo plazo y sus pesos son públicos, con 2,8 billones de parámetros en 4-bit. Gemini 3.6 Flash cobra una tarifa de entrada plana en texto, imagen, vídeo, audio y PDF, algo inusual y útil si tus entradas son variadas.

Kimi K3 no tiene nivel batch y el nivel de gasto de entrada permite 3 solicitudes por minuto. Comprueba los límites de tasa contra tu tráfico antes de decidirte.

1. DeepSeek V4 Flash

Mejor para: hacer lo que hace Inkling-Small, a aproximadamente un cuarto del coste de salida.

La interfaz de chat web gratuita de DeepSeek, tomada de DeepSeek

Esta es la comparación a la que recurre primero un usuario real de Inkling-Small, y también fue el comentario sustantivo más votado en el hilo de lanzamiento de r/LocalLLaMA:

Reddit

"Me pregunto cómo se compara con DSV4 Flash. Comparable en el benchmark de inteligencia de Artificial Analysis (ambos 40). Parece hacerlo algo mejor en codificación / flujos de trabajo agénticos, eso sí."

Esa es la forma que tiene. DeepSeek V4 Flash corre con 284B totales y 13B activos, junto a los 12B de Inkling-Small, y AA pone a ambos en 40. Motor parecido. Factura no tan parecida.

Hay una cosa que las cifras de parámetros esconden, y que importa si el auto-alojamiento está en tu lista. DeepSeek se distribuye de forma nativa en FP4 y FP8 mixtos, mientras que Inkling-Small se distribuye en bf16, así que a precisión nativa un ejecutor local puso a uno en unos 160 GB frente a 540 GB del otro. Sobre el papel, el mismo tamaño aproximado. En la práctica, el triple de memoria.

Características. Pesos con licencia MIT en Hugging Face, más una ventana de contexto de 1M y una salida máxima de 384K, la mayor de esta lista por un margen amplio. La limitación de tasa se basa en concurrencia en lugar de solicitudes por minuto, con un tope publicado de 2.500 solicitudes simultáneas por cuenta.

Ventajas. La economía de caché es la verdadera historia. Un acierto de caché cuesta 0,0028 $ por millón de tokens de entrada, 50 veces por debajo de la tasa de fallo de caché de 0,14 $, así que cualquier cosa con un prompt de sistema estable se vuelve absurdamente barata. Y MIT es la licencia más limpia del grupo, sin umbral de ingresos, sin cláusula de atribución.

Desventajas. Solo texto, así que cualquier audio que le estuvieras enviando a Inkling-Small no tiene dónde ir. También hay una nota en la página de precios que anuncia un futuro recargo 2x en horas punta entre las 09:00 y las 12:00 y las 14:00 y las 18:00 hora de Pekín, con fecha de entrada en vigor "sujeta al anuncio oficial". Una incógnita conocida dentro de tu modelo de costes.

Precios. 0,14 $ de entrada y 0,28 $ de salida por millón, aciertos de caché a 0,0028 $. Pro está en 0,435 $ y 0,87 $, exactamente 3,1 veces Flash en ambos lados. Los ejemplos calculados están en nuestro desglose de precios de DeepSeek V4 Flash, y lo comparamos contra Kimi K3 por separado.

Mi opinión: si el dinero es tu razón para irte, deja de leer aquí. Si es la precisión, sigue leyendo, porque volverse más barato nunca ha hecho que un modelo sepa más.

2. Inkling, el padre

Mejor para: quedarte con los mismos pesos, herramientas y licencia mientras recompras la precisión factual.

Inkling corriendo localmente en Unsloth Studio con un contador de contexto de 1.048,6k, tomado de Unsloth
Inkling corriendo localmente en Unsloth Studio con un contador de contexto de 1.048,6k, tomado de Unsloth

A menudo la alternativa más interesante a un modelo pequeño es el modelo grande del que se destiló, y aquí las cifras lo demuestran con claridad. Bajo la misma metodología de AA, Inkling puntúa 41 en el Intelligence Index frente al 40 de Small, así que ahí queda igualado. AA-Omniscience es donde se separan: 2,05 con 39,95 % de precisión, frente a -9,0 y 30,5 %. Casi un tercio más de las preguntas vuelven correctas.

Características. 975B totales con 41B activos en 66 capas, Apache 2.0, y texto más imagen más audio de entrada. Ahora tres proveedores de servicio, cuando en el lanzamiento había solo uno: DeepInfra, Together AI y Thinking Machines.

Ventajas. Misma licencia, misma familia, así que la migración es sobre todo cambiar una cadena de texto del modelo. La fila FP8 de DeepInfra es rápida, 201,5 tokens por segundo, y el coste por tarea de Intelligence Index ahí sale en 0,4296 $, barato para este nivel.

Desventajas. Dos páginas de AA discrepan actualmente en el precio, así que conviene saber cuál estás citando. La página del modelo dice 1,87 $ de entrada y 4,68 $ de salida. Las filas de proveedores todas dicen 1,00 $ y 4,05 $. Esas cifras de proveedores se mantienen consistentes entre las tres, así que ese es el par contra el que yo planificaría. El contexto servido también es confuso. Es 524k en el mejor caso, y la fila barata y rápida de DeepInfra topa en 131k, o el 13,1 % del millón anunciado.

Precios. Según los datos de los proveedores, 1,00 $ de entrada y 4,05 $ de salida, con 0,17 $ por un acierto de caché y 0,724 $ mezclado. Llamémoslo 3,4 veces la tarifa de salida de Small. Si es el padre lo que estás comprando, el artículo de alternativas a Inkling cubre la gama más amplia.

Mi opinión: la elección obvia, y la que la mayoría se salta, porque "subir al hermano mayor" se siente como admitir que el pequeño fue un error. No lo fue. Solo era la herramienta equivocada para un trabajo de conocimiento.

3. GLM-5.2

Mejor para: los pesos abiertos más fuertes de esta lista que puedes alojar de forma realista tú mismo.

El material de lanzamiento de GLM-5.2 de Z.ai, tomado de Z.ai

GLM-5.2 es el escalón que te mantiene en territorio con licencia MIT. Alrededor de 753B parámetros totales, con un contexto de 1M que su API realmente sirve, y 2,23 millones de descargas en el repositorio zai-org/GLM-5.2. Ese número de descargas dice que la comunidad de auto-alojamiento ya lo ha puesto a prueba a fondo.

Características. Pesos MIT con un contexto de 1M y una salida máxima de 128K, luego entrada en caché a 0,26 $, con almacenamiento de caché listado como gratuito por ahora. Z.ai también vende una vía de suscripción. El Coding Plan empieza en 18 $ al mes, con descuento a 12,60 $, e incluye 10.000 créditos por semana.

Z.ai publica su propia curva de nivel de esfuerzo, y mirarla es mejor que tomar la puntuación destacada al pie de la letra:

Gráfico de Z.ai de la puntuación de codificación agéntica frente a los tokens de salida promedio por tarea, comparando GLM-5.2 y GLM-5.1 con dos versiones de Claude Opus, tomado de Z.ai
Gráfico de Z.ai de la puntuación de codificación agéntica frente a los tokens de salida promedio por tarea, comparando GLM-5.2 y GLM-5.1 con dos versiones de Claude Opus, tomado de Z.ai

Ventajas. GLM-5.2 cuesta lo mismo que costaba GLM-5.1, 1,40 $ y 4,40 $, y mientras tanto la ventana de contexto pasó de 200K a 1M. Una mejora gratis, sin más. Una licencia MIT sin cláusula de ingresos también vale más que uno o dos puntos de benchmark en cuanto lo estás lanzando dentro de un producto.

Desventajas. Ese tope de salida de 128K es el más ajustado entre las opciones de pesos abiertos aquí, frente a los 384K de DeepSeek. Los créditos del Coding Plan se queman a 3x en hora punta y 2x fuera de ella, con la tarifa fuera de hora punta temporalmente en 1x hasta finales de septiembre, así que las cuentas de la suscripción necesitan vigilancia.

Precios. 1,40 $ de entrada, 4,40 $ de salida, 0,26 $ en caché. Hay hermanos más baratos si puedes vivir con menos. GLM-4.7 y GLM-4.6 van ambos a 0,60 $ y 2,20 $, mientras que GLM-4.7-FlashX está en 0,07 $ y 0,40 $.

Mi opinión: el mejor equilibrio licencia-capacidad de la lista. Si tu equipo legal alguna vez ha preguntado qué pasa el día en que un proveedor cambia los términos, señala esta fila.

4. MiniMax M3

Mejor para: igualar el precio exacto de Inkling-Small mientras añade entrada de vídeo.

La página del modelo MiniMax M3, tomada de MiniMax

Este es un empate directo de precio, y eso hace la comparación inusualmente clara. Por debajo de 512K de entrada, MiniMax M3 cobra 0,30 $ de entrada y 1,20 $ de salida, idéntico a la tarifa de primer proveedor de Inkling-Small, saliendo de un modelo de 428B con 23B activos. Lo que te deja eligiendo por todo excepto el coste.

Características. Un contexto de 1M con 512K garantizado como mínimo, lecturas de caché a 0,06 $, y entrada de texto más imagen más vídeo llegando a través de partes de contenido image_url y video_url. El modo de pensamiento cuesta lo mismo activado o desactivado. Los pesos están disponibles en Hugging Face en MiniMaxAI/MiniMax-M3, con 170.353 descargas hasta ahora.

Ventajas. Casi el doble de los parámetros activos de Inkling-Small por el mismo dinero, y entrada de vídeo encima, algo que nada más a este precio en la lista ofrece. La página de precios etiqueta la tarifa actual como "50 % de descuento permanente", y no hay ninguna fecha de caducidad impresa en ningún sitio.

Desventajas. La licencia es la verdadera trampa aquí. La MINIMAX COMMUNITY LICENSE es no comercial por defecto, el uso comercial pide un crédito visible de "Built with MiniMax M3", y por encima de 20 millones $ de ingresos anuales necesitas autorización por escrito. Al pasar los 512K de entrada, ambas tarifas se duplican, así que 0,60 $ y 2,40 $. También existe un nivel Priority, a 1,5x, si te merece la pena la cola más rápida.

Precios. 0,30 $ y 1,20 $ hasta 512K de entrada, luego 0,60 $ y 2,40 $ por encima, lecturas de caché a 0,06 $. Priority corre a 0,45 $ y 1,80 $, o 0,90 $ y 3,60 $ una vez superado el umbral.

Mi opinión: buen motor, licencia que hay que sentarse a leer. Una startup por debajo de la línea de ingresos, contenta con imprimir el crédito, consigue aquí más modelo por dólar que del modelo que está dejando.

5. Kimi K3

Mejor para: trabajo de agente a largo plazo donde la ejecución importa más que el precio del token.

La interfaz de chat de Kimi, el asistente y frontend de agente de Moonshot AI, tomado de Moonshot AI

Kimi K3 es un salto mucho mayor que cualquier cosa de arriba, y en su propia documentación de precios Moonshot lo llama el buque insignia para "codificación a largo plazo y trabajo de conocimiento de extremo a extremo". Con 2,8 billones de parámetros servidos en mxfp4 de 4-bit, es también el modelo más grande aquí cuyos pesos puedes descargar.

Características. Un contexto de 1.048.576 tokens, razonamiento siempre activo detrás de un ajuste reasoning_effort de low, high o max (max por defecto), y un repositorio moonshotai/Kimi-K3 sin restricciones. La búsqueda web se facturan por separado, 0,005 $ por llamada exitosa.

Ventajas. Pesos abiertos a esta escala es inusual. La tarifa de acierto de caché de 0,30 $ frente a 3,00 $ de entrada por fallo de caché es también un ahorro de 10 veces cuando el contexto se repite. Y el rango medio está cubierto por hermanos más baratos, con kimi-k2.7-code a 0,95 $ y 4,00 $.

Desventajas. Dos trampas operativas aquí, y ambas muerden. K3 no está soportado en el nivel batch, así que el descuento del 60 % que tienen otros modelos Kimi no le llega. El sistema de niveles también está condicionado al gasto: el nivel 0, con 1 $ de recarga acumulada, permite 1 solicitud simultánea y 3 solicitudes por minuto, subiendo a 1.000 simultáneas y 10.000 RPM al alcanzar el nivel 5 con 3.000 $. La licencia parece de estilo MIT, pero luego añade una cláusula que exige un acuerdo aparte para negocios de modelo-como-servicio por encima de 20 millones $ de ingresos en cualquier periodo de doce meses consecutivos.

Precios. 3,00 $ de entrada y 15,00 $ de salida, con 0,30 $ en un acierto de caché. A 12,5 veces la tarifa de salida de Inkling-Small, nadie debería confundir esto con un cambio lateral. Las tablas completas de niveles están en precios de Kimi K3.

Mi opinión: la elección cuando la carga es una ejecución larga de agente en lugar de miles de respuestas cortas. Para tráfico con forma de ticket, se vuelve difícil justificarlo frente a GLM-5.2 a un tercio del precio.

6. Qwen3.8-Max

Mejor para: un modelo cerrado con una ventana verdaderamente generosa y una asignación de prueba gratuita.

La interfaz de chat de Qwen, el asistente y frontend de API de Alibaba Cloud, tomado de Alibaba Cloud

Qwen3.8-Max es donde llegas una vez que has decidido que los pesos abiertos no son el objetivo y sí lo es el nivel comercial más alto de Alibaba. La sorpresa agradable en la página de facturación es que Max finalmente eliminó los tramos por longitud de entrada. Una sola banda, que cubre toda la ventana de un millón de tokens.

Características. Un contexto de 1M, salida máxima de 131K y razonamiento máximo de 262K, con TPM de 2 millones frente a RPM de 15.000. El caché implícito cuesta 0,25 $. También hay una cuota gratuita de 1 millón de tokens, válida durante 90 días.

Ventajas. No tener tramos por longitud de entrada es un cambio más grande de lo que suena. La regla de tramos de Alibaba funciona de todo o nada, así que en el antiguo qwen3-max, cruzar un límite reprecificaba toda la solicitud, y un prompt de 33K tokens saltaba de 1,20 $ a 2,40 $ en entrada. Aquí esa trampa desaparece. El millón de tokens gratuitos también te da margen real para evaluar en condiciones.

Desventajas. Un solo ID de modelo, dos precios, según el alcance del despliegue: 2,00 $ y 6,00 $ en las tablas International y Singapore, 1,65 $ y 4,951 $ en las Global. Una diferencia del 18 % sin ninguna diferencia de comportamiento detrás es confusa para presupuestar. La cuota gratuita es solo para Singapur, su reloj no se pausa por inactividad, y lo que quede se anula al expirar. El batch tiene un 50 % de descuento pero no se combina con los descuentos de caché. Max también es cerrado, y los pesos publicados de Qwen van dos generaciones por detrás, el más reciente del 24-04-2026.

Precios. 2,00 $ de entrada y 6,00 $ de salida en International y Singapore, luego 1,65 $ y 4,951 $ en Global. La creación explícita de caché cuesta 2,50 $, un 125 % de la entrada. El detalle completo está en nuestro artículo de precios de Qwen3.8-Max, y está la recopilación de alternativas a Qwen3.8-Max si estás comprando en la otra dirección.

Mi opinión: sólido, y algo caro frente a GLM-5.2, que pide menos y te da los pesos. La cuota gratuita sigue siendo una razón para probarlo.

7. Gemini 3.6 Flash

Mejor para: entrada de audio y multimedia sin pagar una prima por el formato.

La aplicación web de Gemini de Google, tomada de Google

¿Estabas en Inkling-Small específicamente por la entrada de audio? Entonces este es el sustituto más cercano con un nivel de servicio real detrás. Gemini 3.6 Flash cobra una única tarifa de entrada plana de 1,50 $ que cubre texto, imagen, vídeo, audio y PDF, y eso rompe un patrón que Google mismo había fijado. En Gemini 2.5 Flash, la entrada de audio costaba 1,00 $ frente a 0,30 $ de texto, y en 2.0 Flash el múltiplo llegaba a 7x.

Características. 1.048.576 tokens de entrada frente a 65.536 de salida, caché a 0,15 $ por millón más 1,00 $ por millón por hora de almacenamiento, con los niveles Batch y Flex ambos a mitad de precio, 0,75 $ y 3,75 $.

Ventajas. La tarifa plana de multimedia es lo destacado aquí, y un nivel Batch a 0,75 $ y 3,75 $ hace asequible el trabajo masivo. La página de precios de Google lo lista como estable en lugar de vista previa, y eso importa si esto va a acercarse a clientes.

Desventajas. Ese techo de salida de 65.536 es el más ajustado aquí, así que las generaciones largas hay que fragmentarlas. La facturación de caché basada en almacenamiento funciona como un medidor en lugar de un cargo único, a diferencia de las tarifas planas de lectura de caché de otros modelos. Los pesos son cerrados, así que no hay auto-alojamiento. El grounding en Gemini 3.x tampoco está disponible en el nivel gratuito, lo que significa que evaluar cuesta dinero.

Precios. Estándar es 1,50 $ de entrada y 7,50 $ de salida, Batch o Flex 0,75 $ y 3,75 $, Priority 2,70 $ y 13,50 $. Donde el presupuesto es la limitación, Gemini 3.5 Flash-Lite llega a 0,30 $ y 2,50 $, y tampoco tiene distinción de audio. La escala completa está en precios de Gemini 3.6 Flash.

Mi opinión: la elección de audio. También el único modelo aquí al que enviaría multimedia mixta a volumen sin pensarlo dos veces.

8. Claude Opus 5

Mejor para: los casos en los que una respuesta equivocada dicha con seguridad cuesta dinero real.

La aplicación web de Claude, tomada de Anthropic

Este es el extremo final de la escalera, y una razón para incluirlo en la lista. Responde al problema específico que tiene Inkling-Small. Claude Opus 5 cuesta 5,00 $ de entrada y 25,00 $ de salida, aproximadamente 21 veces la tarifa de salida de Inkling-Small, y lo compras cuando el coste de una respuesta equivocada supera la factura de tokens.

Características. El contexto completo de 1M al precio estándar, con ningún nivel de recargo por contexto largo, algo inusual. La documentación de precios de Anthropic lo detalla: una solicitud de 900k tokens se factura a la misma tarifa por token que una de 9k. Las lecturas de caché cuestan 0,50 $. La API Batch aplica un 50 % de descuento plano en ambos lados, 2,50 $ y 12,50 $, y se combina con el caché.

Ventajas. Sin un acantilado de longitud de contexto, toda una categoría de sorpresas de facturación desaparece. El pensamiento extendido no tiene precio aparte y se factura como salida estándar. Batch junto con caché también baja mucho las cargas pesadas y repetidas respecto al precio de etiqueta.

Desventajas. En cualquier comparación de costes, el tokenizador es la trampa. Anthropic señala que Claude 4.7 y posteriores "producen aproximadamente un 30 % más de tokens para el mismo texto" que el tokenizador anterior, así que esa etiqueta de 25,00 $ subestima la verdadera brecha por tarea frente a un rival que aún use uno más antiguo. El modo rápido duplica ambos lados a 10,00 $ y 50,00 $, funciona solo en la API de primer proveedor y no se combina con Batch. Los pesos son cerrados.

Precios. Estándar 5,00 $ y 25,00 $, Batch 2,50 $ y 12,50 $, modo rápido 10,00 $ y 50,00 $, lectura de caché 0,50 $. La parada más barata es Sonnet 5 a 2,00 $ y 10,00 $ hasta el 31 de agosto de 2026, que pasa a 3,00 $ y 15,00 $ el 1 de septiembre. Cuándo merece la pena pagar esa diferencia se cubre en nuestra comparación Opus 5 frente a Sonnet 5.

Mi opinión: excesivo para la mayoría del tráfico de tickets, exactamente adecuado para el 5 % que toca dinero, políticas o un contrato. Enruta por tipo de pregunta en lugar de elegir un modelo para todo.

La escalera de precios, en una sola imagen

Alinea las ocho una junto a otra por precio de salida, y la forma de la decisión se vuelve obvia.

Gráfico de barras del precio de salida por millón de tokens en siete modelos, con Inkling-Small destacado cerca del extremo inferior del rango
Gráfico de barras del precio de salida por millón de tokens en siete modelos, con Inkling-Small destacado cerca del extremo inferior del rango

Inkling-Small ya está cerca del suelo. Existe exactamente un escalón significativo hacia abajo, DeepSeek V4 Flash a 0,28 $, más un movimiento lateral al mismo precio en MiniMax M3. Todo lo demás aquí es un escalón hacia arriba, y lo que compra un escalón hacia arriba nunca es velocidad.

Merece la pena hacer los números de lo que cuesta cualquiera de esto a volumen de tickets. Toma mil tickets en un mes, y calcula 2.000 tokens de salida por respuesta, que es generoso para una respuesta de soporte. Así que 2 millones de tokens de salida.

ModeloCoste de salida, 2M tokensFrente a Inkling-Small
DeepSeek V4 Flash0,56 $1,84 $ más barato
Inkling-Small2,40 $base
MiniMax M32,40 $idéntico
GLM-5.28,80 $6,40 $ más
Inkling8,10 $5,70 $ más
Gemini 3.6 Flash15,00 $12,60 $ más
Kimi K330,00 $27,60 $ más
Claude Opus 550,00 $47,60 $ más

A este volumen, toda la diferencia entre el más barato y el más caro es de unos 50 $ al mes. Una sola escalada gestionada mal te cuesta más que eso. Que es el verdadero argumento para subir la escalera, y también por qué la elección de modelo no es donde está la mayor palanca.

Lo que nada de esto arregla en una cola de soporte

Ninguna de las ocho filas de arriba resuelve la siguiente parte, y por eso sigo insistiendo cuando alguien me dice que ha encontrado un modelo más barato.

He visto este fallo exacto ocurrir en cuentas de pago. Un modelo no se detiene cuando la recuperación vuelve vacía. Rellena el hueco con lo que aprendió en el entrenamiento. Un cliente, un proveedor danés de energía solar, tuvo un bot que se inventó afirmaciones sobre suscripciones y las envió a clientes reales. Otro le preguntó algo a su bot y recibió "Oxígeno (tabla periódica)" como respuesta. Ninguno de los dos casos fue un mal modelo. Ambos fueron un modelo sin nada contra lo que anclarse, y sin nada que le impidiera adivinar.

Un gerente de soporte de nuestras cuentas puso la misma preocupación en términos más claros, diciéndole a la IA lo que no debía hacer:

"deja de decirle a los clientes que lo vamos a solucionar. No lo sabes"

Un gerente de soporte de e-commerce, preocupado por que un bot prometiera de más las fechas de entrega. El mismo tipo de problema. El modelo suena seguro, y ese sonar seguro es la parte peligrosa. El propio desglose AA-Briefcase de Inkling-Small lo dice sin rodeos: 270,86 puntos Elo mejor presentando que analizando.

Dos caminos para una misma pregunta de cliente: un modelo en crudo respondiendo de memoria frente a un modelo con grounding que puntúa su confianza y escala
Dos caminos para una misma pregunta de cliente: un modelo en crudo respondiendo de memoria frente a un modelo con grounding que puntúa su confianza y escala

Un modelo más grande no es la solución. Dos cosas con las que un modelo no viene equipado, sí lo son. Primero el grounding, para que la respuesta salga de tu centro de ayuda y de tus tickets pasados en lugar de la memoria paramétrica. Luego una barrera de confianza, para que todo lo que esté por debajo del umbral vaya a una persona en lugar de salir. Esas dos cosas convierten un motor en crudo en algo que puedes apuntar a una cola en vivo, y son todo el tema de la prevención de alucinaciones de IA.

La otra razón por la que la gente deja de comparar modelos es más mundana que eso. Un desarrollador con el que hablamos, montando una base de conocimiento de incidentes de TI, ya había dado toda la vuelta. Probó la API de un proveedor y la encontró demasiado cara, probó otra y la encontró poco fiable, y al final solo quería algo que funcionara. Comparar modelos es divertido. Mantener una capa de modelo no lo es.

Prueba eesel

Si el modelo que estás eligiendo va a responder preguntas de clientes, el consejo honesto viene en dos partes. Toma cualquiera de los ocho de arriba que se ajuste a tu presupuesto y a tu licencia. Y luego no construyas tú mismo la capa por encima.

Esa capa es lo que es eesel. Se conecta a Zendesk, Freshdesk o lo que ya estés usando, aprende de tus tickets resueltos pasados y tu centro de ayuda en lugar de los datos de entrenamiento de un modelo, y solo responde una vez que supera un umbral de confianza que tú mismo defines. Todo lo que quede por debajo escala. Y antes de que toque tráfico en vivo puedes simularlo contra tu propio historial de tickets, así aprendes qué habría respondido mal antes de que lo haga un cliente.

El panel del helpdesk de IA de eesel, donde un compañero de equipo de IA resuelve y redacta tickets de soporte
El panel del helpdesk de IA de eesel, donde un compañero de equipo de IA resuelve y redacta tickets de soporte

Pongo nuestra propia tasa de error factual medida del 7 % al principio en lugar de enterrarla, porque esa es la cifra que importa mientras eliges un modelo. Salió del tráfico real de Zendesk de una joyería alemana, alrededor de mil tickets al mes, validada de forma cruzada en 284 chats y 100 tickets, con recuperación sobre su centro de ayuda real. El grounding no te va a llevar a cero. Te da una cifra que puedes medir, sobre la que puedes poner una barrera, y luego mejorar, y eso es una categoría distinta de cosa a un modelo que adivina con seguridad.

El enfoque comercial deliberadamente no es por asiento. La facturación va por ticket resuelto, así que los precios siguen el trabajo hecho y no la plantilla. Gratis para probar. Si prefieres comprobar los números primero, la guía de deflexión de tickets es un buen punto de partida.

Mi opinión

Inkling-Small es un buen modelo pequeño al que la gente sigue pidiéndole que haga un trabajo para el que no fue construido. Ejecuta bien y a un precio ya cerca del suelo, y su fiabilidad de conocimiento mide -9,0. Esos dos hechos no están en tensión. Juntos describen una herramienta.

¿Te vas por el coste? Toma DeepSeek V4 Flash y ya está hecho. Si lo que te empuja a salir son las respuestas equivocadas, sube al Inkling padre para la solución barata, o a Claude Opus 5 para la cara, y entra sabiendo que ninguna de las dos te lleva a cero.

Y si la razón es que la ventana de contexto no coincide con la ficha, GLM-5.2 sirve lo que anuncia, bajo MIT. Esa es la fila que elegiría si me obligaran a quedarme con una sola.

El veredicto honesto sobre las ocho sigue siendo el mismo. Cambiar de motor mueve tu factura y tus puntuaciones de benchmark. No cambia lo que pasa cuando un cliente pregunta algo que tu documentación nunca respondió. Cerrar esa brecha necesita recuperación, un umbral de confianza, un traspaso. Ninguna mejora de modelo lo hace por ti, y merece la pena resolverlo antes de que pases otra tarde leyendo benchmarks de clasificación de tickets con IA.

Preguntas frecuentes

¿Cuáles son las mejores alternativas a Inkling-Small?
Para la mayoría de los equipos se reduce a tres: DeepSeek V4 Flash si quieres el mismo trabajo más barato, Inkling si quieres quedarte en la misma familia con mejor precisión factual, y Claude Opus 5 si una respuesta equivocada cuesta dinero real. La lista completa de este artículo también cubre GLM-5.2, MiniMax M3, Kimi K3, Qwen3.8-Max y Gemini 3.6 Flash.
¿Existe una alternativa más barata a Inkling-Small?
Sí. Los precios de DeepSeek V4 Flash son de 0,14 $ de entrada y 0,28 $ de salida por millón de tokens, frente a los 0,30 $ y 1,20 $ de Inkling-Small, así que la salida sale unas cuatro veces más barata. MiniMax M3 igual el precio exacto de Inkling-Small por debajo de 512K de entrada. Si estás intentando bajar tu coste por resolución, la línea del modelo casi nunca es la más grande.
¿Por qué cambiar de Inkling-Small?
Por su fiabilidad de conocimiento. Artificial Analysis puntúa a Inkling-Small con -9,0 en el índice AA-Omniscience, con un 30,5 % de precisión, mientras que su modelo padre está en 2,05 con un 39,95 %. Esa diferencia es lo que se manifiesta como alucinaciones de IA en soporte cuando se le hace al modelo una pregunta que tu base de conocimiento no cubre.
¿De verdad tiene Inkling-Small una ventana de contexto de 1M?
La ficha del modelo dice 1M y ninguno de sus dos proveedores lo sirve. Thinking Machines sirve 256.000 tokens y DeepInfra 524.288, según Artificial Analysis. La misma diferencia existe en el modelo padre. Si el contexto largo es la razón por la que lo elegiste, revisa el explicativo de Inkling-Small antes de construir sobre el 1M.
¿Qué alternativa a Inkling-Small tiene la mejor licencia abierta?
DeepSeek V4 Flash y GLM-5.2 se publican bajo licencia MIT, la posición comercial más limpia del grupo. Inkling-Small y su modelo padre son Apache 2.0. Kimi K3 y MiniMax M3 llevan ambos licencias propias con umbrales de ingresos, y la de MiniMax es no comercial por defecto. Para un repaso más completo, mira nuestra recopilación de agentes de IA de código abierto.
¿Cuánto cuesta ejecutar una alternativa a Inkling-Small en tickets de soporte?
Los tokens son el número pequeño. A 1,20 $ por millón de tokens de salida, un mes con mil tickets cuesta un par de dólares en inferencia. Lo que cuesta dinero es la capa de recuperación, la lógica de escalado y el control de calidad, por lo que los equipos suelen comprar esa capa en lugar de construirla. Nuestra página de precios cobra por ticket resuelto en lugar de por asiento, y el coste del servicio de atención al cliente con IA desglosa las cuentas.
¿Puedo alojar yo mismo una alternativa a Inkling-Small en lugar de pagar por token?
Puedes, y los pesos de DeepSeek V4 Flash, GLM-5.2, Kimi K3 y MiniMax M3 están todos publicados. La factura se traslada al hardware en lugar de desaparecer, y heredas el servicio, las evaluaciones y las actualizaciones. Los equipos que toman esta vía para la atención al cliente con IA suelen descubrir que el modelo nunca fue la parte difícil.
¿Es Inkling-Small lo bastante bueno para atención al cliente por sí solo?
No por sí solo, y tampoco nada más de esta lista. Un modelo en crudo responde con los datos de entrenamiento cuando la recuperación vuelve vacía, que es exactamente así como llega al cliente una respuesta equivocada dicha con seguridad. La solución es el grounding más una barrera de confianza que escala, que es de lo que trata la gestión de escalado con IA y el traspaso a un agente.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un modelo pequeño apartado mientras cinco modelos alternativos captan la luz
Alternatives

8 mejores alternativas a Inkling-Small en 2026

Inkling-Small es barato y rápido, pero su puntuación de conocimiento medida es negativa. Aquí tienes 8 alternativas a Inkling-Small, con precios reales y el problema que trae cada una.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Una columna alta y ornamentada junto a ocho columnas más pequeñas de diseño variado
Alternatives

Las 8 mejores alternativas a Claude Opus 5 en 2026

Claude Opus 5 lidera el índice independiente por 1,8 puntos y cuesta 86 veces más por tarea que el modelo diez puntos por debajo. Ocho alternativas, valoradas según el coste medido por tarea.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Una columna alta y ornamentada junto a ocho columnas más pequeñas de diseño variado
Alternatives

8 mejores alternativas a Claude Opus 5 en 2026

Claude Opus 5 encabeza el índice independiente por 1,8 puntos y cuesta 86 veces más por tarea que el modelo diez puntos por debajo. Ocho alternativas, con precios basados en el coste medido por tarea.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Un desarrollador eligiendo entre tarjetas de modelos, con la tarjeta de la ballena de DeepSeek en el centro rodeada de modelos rivales
Alternatives

Las 8 mejores alternativas a DeepSeek V4 Flash en 2026

Ocho alternativas reales a DeepSeek V4 Flash, comparadas con datos. Nadie cambia de modelo por precio o velocidad, así que las ordeno según las cuatro carencias reales de Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Ilustracion de una persona sopesando varios superagentes de IA como alternativas a Skywork AI
Alternatives

7 mejores alternativas a Skywork AI en 2026

Las mejores alternativas a Skywork AI en 2026, desde superagentes generales como Manus hasta herramientas de investigacion, creadores de presentaciones y una opcion solo para soporte, con precios reales.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Un usuario hablando con tres opciones distintas de agente de voz, con el logotipo de Grok a la izquierda
Alternatives

Las 10 mejores alternativas a Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 acaba de subir un 60% de precio en el alias por defecto. Diez alternativas reales, con coste medido por hora y cifras honestas de benchmark.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Una persona hablando con tres opciones distintas de agente de voz, con el logotipo de Grok a la izquierda
Alternatives

Las 10 mejores alternativas a Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 acaba de subir un 60% de precio en el alias predeterminado. Diez alternativas reales, con coste por hora medido y cifras de benchmark honestas.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Ilustración editorial de portada para un resumen de alternativas a Google Gemini 3.5 Pro
Alternatives

Las 8 mejores alternativas a Gemini 3.5 Pro en 2026

¿Buscas alternativas a Gemini 3.5 Pro? El problema: 3.5 Pro todavía no se ha lanzado. Aquí tienes 8 modelos que sí puedes usar hoy, con precios reales y recomendaciones.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA insignia como alternativas a GPT-5.6 Sol
Alternatives

9 mejores alternativas a GPT-5.6 Sol en 2026

GPT-5.6 Sol es el buque insignia de OpenAI a precio de buque insignia: 5$/30$ por 1M de tokens, la misma tarifa que GPT-5.5. Aquí tienes 9 alternativas reales a Sol y para quién encaja cada una.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis