8 mejores alternativas a Inkling-Small en 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Un modelo pequeño apartado mientras cinco modelos alternativos captan la luz

Por qué la gente ya mira más allá de Inkling-Small

Thinking Machines Lab lanzó Inkling-Small el 30-07-2026 bajo Apache 2.0, quince días después que el modelo padre. La propuesta era razonable y el modelo sí la cumple. Un cuarto del tamaño del padre y más rápido, además de más barato, e incluso según la propia ficha del proveedor supera al padre en SWE-bench Verified, 80.2 frente a 77.6.

La recepción en r/LocalLLaMA tuvo algo que decir sobre esa palabra "small". El tercer comentario más votado en el hilo de lanzamiento no trata de benchmarks en absoluto:

Reddit

"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"

Justo. Pero el nombre no es lo que empuja a nadie fuera del modelo. Lo que sabe, sí.

Artificial Analysis lo sitúa en un Intelligence Index de 40, puesto #15 de 101, que es bastante respetable. Luego la misma página reporta la prueba de conocimiento AA-Omniscience: un índice de -9.0, precisión del 30.5%, tasa de alucinación del 56.9%. AA describe esa evaluación como una medida de "fiabilidad de conocimiento y alucinación" en un rango de -100 a 100. Así que un número negativo ahí no es ningún artefacto de redondeo. Es el modelo alcanzando una respuesta que no tiene.

El desglose de AA-Briefcase es la parte a la que sigo volviendo. Elo general de 917.13, que dice poco hasta que lo divides: presentación de 1067.99 frente a calidad analítica de 797.13. El modelo escribe una respuesta mejor de lo que realmente sabe.

La gente que ejecuta estos modelos en su propio hardware lo detectó rápido, y en un eje más agudo que el de las tablas de benchmarks:

Reddit

"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."

Esa cifra del 84% es más alta que el 56.9% que hoy figura en la página de AA, así que toma el número exacto como su lectura, no la mía. De cualquier forma el punto se sostiene, y es el punto correcto a señalar. Están eligiendo un modelo por si sabe cuándo no sabe, en lugar de por lo bien que escribe código.

Three reasons teams leave Inkling-Small, each pointing at a different replacement model
Three reasons teams leave Inkling-Small, each pointing at a different replacement model

Otras tres cosas alejan a la gente del modelo. El precio no está entre ellas.

La ventana de contexto no es la ventana de contexto. AA lista el modelo en 1M tokens. Lo que sus dos proveedores realmente sirven es 256.000 (Thinking Machines) y 524.288 (DeepInfra). Así que cualquiera que leyera "1M" en la ficha y construyera contra ese número no lo está obteniendo. Mismo problema en el modelo padre, donde la mejor cifra servida es 524k entre tres proveedores y la fila más barata y rápida de DeepInfra tope en 131k.

Dos proveedores es poco. El padre tiene tres, y el grupo que sirve a DeepSeek o GLM es aún mayor. El día del lanzamiento el modelo ni siquiera estaba en OpenRouter, una brecha que un comentarista señaló en Hacker News junto con los conteos de parámetros. Los dos proveedores que sí tienes también se comportan de forma distinta. DeepInfra corre 1.43x más rápido en una carga de 10k, y luego se queda atrás del proveedor original en 100k, 82.36 tokens por segundo frente a 113.36. Tu perfil de latencia cambia según la longitud del prompt, y eso es algo horrible de descubrir en producción.

Una cobertura escasa también deja menos margen para buscar alternativas cuando un proveedor empieza a recortar esquinas, lo que ocurre más de lo que dejan ver los benchmarks publicados:

Hacker News

"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."

El precio no es un solo número. El proveedor original está en $0.30 de entrada y $1.20 de salida. DeepInfra pide $0.58 y $1.44 por el contexto más largo. En una mezcla, AA muestra $0.222 en su proporción por defecto de 7:2:1, mientras que la mezcla clásica 3:1 llega a $0.525. Así que sea cual sea la única cifra que termines citando, en realidad es una elección sobre proporciones, y esa elección importa cuando estás modelando el coste del servicio de atención al cliente con IA a volumen.

Para ser justos, nada de esto suma un mal modelo. El razonamiento se lleva el 95.5% de su factura de salida, que es exactamente de donde viene la inteligencia, y GPQA Diamond al 89.5% más un 63% en razonamiento de contexto largo son cifras reales. El modelo es un ejecutor. El problema empieza solo cuando le pides a un ejecutor que sea un conocedor.

Cómo elegí estos ocho

Escribo muchos de estos repasos y la trampa nunca cambia. Clasificar por benchmark, publicar, seguir adelante. Así que aquí mantuve el filtro más estrecho que eso.

Cada uno de los ocho tenía que ser algo a lo que un usuario de Inkling-Small pudiera mudarse esta misma semana, así que una API pública en vivo con precios publicados, sin listas de espera. Cada precio salió de la propia página de facturación del proveedor el 05-08-2026, no de un sitio comparador, porque esas cifras se quedan obsoletas en quince días. Cuando un proveedor publica tanto el contexto servido como el anunciado, comprobé uno contra el otro. Las licencias también las leí, y eso importó, porque dos modelos aquí tienen umbrales de ingresos escondidos en las suyas.

Lo que no he hecho es fingir que seis meses de tráfico de producción pasaron por los ocho. Leí la documentación y las páginas de facturación, las fichas de los modelos, las mediciones de AA, y luego dije solo lo que eso respalda.

Las mejores alternativas a Inkling-Small de un vistazo

Todos los precios siguientes son por millón de tokens en USD, comprobados el 05-08-2026.

ModelBest forWeightsParamsInputOutputReal contextModalities inThe catch
Inkling-Small (baseline)Cheap agentic executionApache 2.0276B / 12B active (266B per AA)$0.30$1.20256K first-party, 524,288 on DeepInfraText, image, audioKnowledge index -9.0
DeepSeek V4 FlashSame job, a quarter the costMIT284B / 13B$0.14$0.281MTextA 2x peak surcharge is announced
InklingStaying in the family, knowing moreApache 2.0975B / 41B$1.00$4.05524K best, 131K cheapestText, image, audioTwo AA pages quote different prices
GLM-5.2Strongest open weights you can hostMIT~753B total$1.40$4.401MText128K output cap
MiniMax M3Video in, at Inkling-Small's priceCustom community licence428B / 23B$0.30$1.201M, 512K guaranteedText, image, videoNon-commercial by default
Kimi K3Long-horizon agent workCustom (Kimi K3 Licence)2.8T$3.00$15.001,048,576TextNo batch tier, 3 RPM on entry tier
Qwen3.8-MaxClosed model, generous windowClosedUndisclosed$2.00$6.001MTextTwo prices for one model
Gemini 3.6 FlashAudio in with no premiumClosedUndisclosed$1.50$7.501,048,576Text, image, video, audio, PDF65,536 output ceiling
Claude Opus 5When wrong answers cost moneyClosedUndisclosed$5.00$25.001M, no surchargeText, imageNewer tokenizer emits ~30% more tokens

¿Qué alternativa a Inkling-Small encaja con tu motivo para irte?

Elige la frase que más se parezca a tu semana.

Ve con Claude Opus 5, o con el Inkling padre si el presupuesto aprieta

$5.00 / $25.00Opus 5, por 1M de tokens $1.00 / $4.05Inkling, por 1M de tokens 2.05 vs -9.0Inkling vs Small, AA-Omniscience

El índice de conocimiento de Inkling-Small es negativo y el de su padre es positivo, así que el arreglo real más barato es subir un escalón dentro de la misma familia: misma licencia, mismas herramientas, aproximadamente 3.4x el precio de salida. Opus 5 cuesta mucho más y es al que recurrir cuando una respuesta equivocada significa un reembolso, un problema de cumplimiento o un cliente perdido.

Ningún modelo de esta lista llega a cero. Fundamentar en tus propios documentos más una compuerta de confianza hace más por la precisión que cualquier subida aquí.

Ve con DeepSeek V4 Flash

$0.14 / $0.28por 1M de tokens 4.3xmás barato en salida que Inkling-Small MITlicencia sobre los pesos

Los aciertos de caché caen en $0.0028 por millón, 50 veces por debajo de su propia tasa de fallo de caché, así que una carga de trabajo repetitiva se vuelve muy barata muy rápido. Pesos MIT, contexto de 1M, 2.500 solicitudes concurrentes según los límites publicados. MiniMax M3 es el subcampeón, con exactamente la tarifa de Inkling-Small y entrada de vídeo de propina.

DeepSeek ha anunciado un recargo de 2x en horas pico, de 09:00 a 12:00 y de 14:00 a 18:00 hora de Pekín. Sin fecha de inicio todavía, así que modela tu pico contra la tarifa duplicada.

Ve con DeepSeek V4 Flash o GLM-5.2

1Mservido, ambos modelos 256KInkling-Small, proveedor original 384K / 128Ksalida máxima, DeepSeek / GLM

Ambos publican una ventana de 1M y ambos realmente la sirven, que es la diferencia que importa. GLM-5.2 cuesta lo mismo que costaba GLM-5.1 a 200K, así que la ventana llegó gratis. Eso sí, vigila los topes de salida: DeepSeek permite 384K de salida, GLM tope en 128K.

Contexto largo y razonamiento de contexto largo son cosas distintas. Inkling-Small puntúa 63% en la prueba de razonamiento de contexto largo de AA, así que una ventana más grande por sí sola no arreglará un problema de recuerdo.

Ve con Kimi K3, o Gemini 3.6 Flash si necesitas audio

$3.00 / $15.00Kimi K3, por 1M $1.50 / $7.50Gemini 3.6 Flash, por 1M 2.8Tparámetros de Kimi K3

Kimi K3 está construido para ejecuciones de agente de largo alcance y sus pesos son públicos, con 2.8 billones de parámetros en 4 bits. Gemini 3.6 Flash cobra una única tarifa de entrada plana para texto, imagen, vídeo, audio y PDF, algo poco común y útil si tus entradas son variadas.

Kimi K3 no tiene nivel por lotes y el nivel de gasto de entrada permite 3 solicitudes por minuto. Comprueba los límites de tasa contra tu tráfico antes de comprometerte.

1. DeepSeek V4 Flash

Best for: hacer lo que hace Inkling-Small, a aproximadamente un cuarto del coste de salida.

DeepSeek's free web chat interface, as taken from DeepSeek

Esta es la comparación a la que recurre primero un usuario real de Inkling-Small, y también fue el comentario sustancial más votado en el hilo de lanzamiento de r/LocalLLaMA:

Reddit

"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."

Esa es la forma del asunto. DeepSeek V4 Flash corre con 284B en total y 13B activos, junto a los 12B de Inkling-Small, y AA pone a ambos en 40. Motor similar. Factura no tan similar.

Hay algo que los conteos de parámetros esconden, y que importa si el autoalojamiento está en tu lista. DeepSeek se distribuye nativamente en una mezcla de FP4 y FP8, mientras que Inkling-Small se distribuye en bf16, así que a precisión nativa un operador local los situó en aproximadamente 160GB frente a 540GB. Sobre el papel, un tamaño similar. En la práctica, el triple de memoria.

Features. Pesos con licencia MIT en Hugging Face, más una ventana de contexto de 1M y una salida máxima de 384K, la mayor de esta lista con diferencia. La limitación de tasa funciona por concurrencia en lugar de solicitudes por minuto, con el tope publicado en 2.500 solicitudes concurrentes por cuenta.

Pros. La economía de la caché es la verdadera historia. Un acierto de caché cuesta $0.0028 por millón de tokens de entrada, 50 veces por debajo de la tasa de fallo de caché de $0.14, así que cualquier cosa con un prompt de sistema estable se vuelve absurdamente barata. Y MIT es la licencia más limpia del grupo, sin umbral de ingresos, sin cláusula de atribución.

Cons. Solo texto, así que cualquier audio que le dieras a Inkling-Small no tiene adónde ir. También hay una nota a pie en la página de precios anunciando un futuro recargo de 2x en horas pico de 09:00 a 12:00 y de 14:00 a 18:00 hora de Pekín, con fecha efectiva "sujeta al anuncio oficial". Una incógnita conocida, sentada dentro de tu modelo de costes.

Pricing. $0.14 de entrada y $0.28 de salida por millón, aciertos de caché a $0.0028. Pro está en $0.435 y $0.87, exactamente 3.1x Flash en ambos lados. Los ejemplos trabajados están en nuestro desglose de precios de DeepSeek V4 Flash, y lo comparamos con Kimi K3 por separado.

My take: si el dinero es tu razón para irte, deja de leer aquí. Si es la precisión, sigue leyendo, porque abaratarse nunca ha hecho que un modelo sepa más.

2. Inkling, the parent

Best for: quedarte con los mismos pesos, herramientas y licencia mientras recuperas el recuerdo factual.

Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth
Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth

A menudo la alternativa más interesante a un modelo pequeño es el grande del que se destiló, y aquí los números lo demuestran con limpieza. Bajo la misma metodología de AA, Inkling puntúa 41 en el Intelligence Index frente al 40 de Small, así que un empate. AA-Omniscience es donde se separan: 2.05 con 39.95% de precisión, frente a -9.0 y 30.5%. Casi un tercio más de preguntas vuelven correctas.

Features. 975B en total con 41B activos en 66 capas, Apache 2.0, y entrada de texto más imagen más audio. Tres proveedores de servicio ahora, donde el lanzamiento tenía uno, siendo estos DeepInfra, Together AI y Thinking Machines.

Pros. Misma licencia, misma familia, así que la migración es sobre todo cambiar una cadena de modelo. La fila FP8 de DeepInfra es rápida, 201.5 tokens por segundo, y el coste por tarea de Intelligence Index ahí sale a $0.4296, barato para esta categoría.

Cons. Dos páginas de AA discrepan ahora mismo en el precio, así que conviene saber cuál estás citando. La página del modelo dice $1.87 de entrada y $4.68 de salida. Todas las filas de proveedores dicen $1.00 y $4.05. Esas cifras de proveedor se mantienen internamente consistentes entre los tres, así que ese es el par contra el que yo planificaría. El contexto servido también es desordenado. Es 524k como mejor caso, y la fila barata y rápida de DeepInfra tope en 131k, o el 13.1% del millón anunciado.

Pricing. Según los datos del proveedor, $1.00 de entrada y $4.05 de salida, con $0.17 por acierto de caché y $0.724 en mezcla. Llámalo 3.4x la tarifa de salida de Small. Si es el padre lo que buscas, el artículo de alternativas a Inkling cubre la lista más amplia.

My take: la elección obvia, y la que más gente se salta, porque "subir al hermano mayor" se siente como admitir que el pequeño fue un error. No lo fue. Solo era la herramienta equivocada para un trabajo de conocimiento.

3. GLM-5.2

Best for: los pesos abiertos más fuertes de esta lista que puedes alojar de forma realista tú mismo.

GLM-5.2's launch material from Z.ai, as taken from Z.ai

GLM-5.2 es el escalón hacia arriba que te mantiene dentro del territorio con licencia MIT. Unos 753B de parámetros en total, con un contexto de 1M que su API realmente sirve, y 2.23 millones de descargas en el repositorio zai-org/GLM-5.2. Ese número de descargas dice que la comunidad de autoalojamiento ya lo ha puesto a prueba a fondo.

Features. Pesos MIT con un contexto de 1M y una salida máxima de 128K, luego entrada en caché a $0.26, con el almacenamiento de caché listado como gratis por ahora. Z.ai también vende una vía de suscripción. El Coding Plan empieza en $18 al mes, con descuento a $12.60, y trae 10.000 créditos a la semana.

Z.ai publica su propia curva de nivel de esfuerzo, y mirar eso vale más que tomar la puntuación titular al pie de la letra:

Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai
Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai

Pros. GLM-5.2 cuesta lo mismo que costaba GLM-5.1, $1.40 y $4.40, y mientras tanto la ventana de contexto pasó de 200K a 1M. Una mejora gratis, sin más. Una licencia MIT sin cláusula de ingresos también vale más que uno o dos puntos de benchmark una vez que estás enviando esto dentro de un producto.

Cons. Ese tope de salida de 128K es el más ajustado de las opciones de pesos abiertos aquí, frente a los 384K de DeepSeek. Los créditos del Coding Plan se queman a 3x en hora pico y 2x fuera de ella, con la hora valle temporalmente a 1x hasta finales de septiembre, así que las cuentas de la suscripción necesitan vigilancia.

Pricing. $1.40 de entrada, $4.40 de salida, $0.26 en caché. Hay hermanos más baratos si puedes vivir con menos. GLM-4.7 y GLM-4.6 van ambos a $0.60 y $2.20, mientras que GLM-4.7-FlashX está en $0.07 y $0.40.

My take: el mejor trato licencia-por-capacidad de la lista. Si tu equipo legal alguna vez ha preguntado qué pasa el día que un proveedor cambia los términos, señala esta fila.

4. MiniMax M3

Best for: igualar el precio exacto de Inkling-Small añadiendo entrada de vídeo.

The MiniMax M3 model page, as taken from MiniMax

Este es un empate directo de precio, y eso hace la comparación inusualmente limpia. Por debajo de 512K de entrada MiniMax M3 cobra $0.30 de entrada y $1.20 de salida, idéntico a la tarifa de proveedor original de Inkling-Small, saliendo de un modelo de 428B con 23B activos. Lo que te deja eligiendo por todo menos el coste.

Features. Un contexto de 1M con 512K garantizados como mínimo, lecturas de caché a $0.06, y entrada de texto más imagen más vídeo llegando por partes de contenido image_url y video_url. El modo de pensamiento cuesta lo mismo activado o no. Los pesos están en Hugging Face bajo MiniMaxAI/MiniMax-M3, con 170.353 descargas hasta ahora.

Pros. Casi el doble de parámetros activos de Inkling-Small por el mismo dinero, y vídeo de entrada encima, algo que nada más a este precio en la lista ofrece. La página de precios etiqueta la tarifa actual como "Permanent 50% off", y no hay fecha de expiración impresa en ninguna parte.

Cons. La licencia es la verdadera trampa aquí. MINIMAX COMMUNITY LICENSE es no comercial por defecto, el uso comercial pide un crédito visible "Built with MiniMax M3", y pasados los $20M en ingresos anuales necesitas autorización por escrito. Cruzar 512K de entrada duplica ambas tarifas, así que $0.60 y $2.40. También existe un nivel Priority, a 1.5x, si la cola más rápida te merece la pena.

Pricing. $0.30 y $1.20 hasta 512K de entrada, luego $0.60 y $2.40 por encima, lecturas de caché a $0.06. Priority va a $0.45 y $1.80, o $0.90 y $3.60 una vez superado el umbral.

My take: buen motor, licencia que hay que sentarse a leer. Una startup por debajo de la línea de ingresos, dispuesta a poner el crédito, obtiene aquí más modelo por dólar que en lo que está dejando.

5. Kimi K3

Best for: trabajo de agente de largo alcance donde la ejecución importa más que el precio del token.

Kimi's chat interface, Moonshot AI's assistant and agent front end, as taken from Moonshot AI

Kimi K3 es un salto mucho mayor que cualquier cosa anterior, y en su propia documentación de precios Moonshot lo llama el buque insignia para "codificación de largo alcance y trabajo de conocimiento de extremo a extremo". Con 2.8 billones de parámetros servidos en 4 bits mxfp4, también es el modelo más grande aquí cuyos pesos puedes descargar.

Features. Un contexto de 1.048.576 tokens, razonamiento siempre activo tras un ajuste reasoning_effort de low, high o max (siendo max el predeterminado), y un repositorio sin puertas moonshotai/Kimi-K3. La búsqueda web se factura aparte, $0.005 por llamada exitosa.

Pros. Pesos abiertos a esta escala es poco común. La tasa de acierto de caché de $0.30 frente al $3.00 de entrada por fallo de caché es un ahorro de 10x siempre que el contexto se repite, además. Y el rango medio está cubierto por hermanos más baratos, con kimi-k2.7-code a $0.95 y $4.00.

Cons. Aquí hay dos trampas operativas, y ambas muerden. K3 no está soportado en el nivel de lotes, así que el descuento de 60% por lotes que reciben otros modelos Kimi no llega a este. El sistema de niveles también se controla por gasto: el Tier 0, con $1 de recarga acumulada, permite 1 solicitud concurrente y 3 solicitudes por minuto, subiendo a 1.000 concurrentes y 10.000 RPM al alcanzar los $3.000 del Tier 5. La licencia luce como MIT, pero añade una cláusula que exige un acuerdo aparte para negocios de modelo-como-servicio por encima de $20M de ingresos en cualquier periodo consecutivo de doce meses.

Pricing. $3.00 de entrada y $15.00 de salida, con $0.30 en un acierto de caché. A 12.5x la tarifa de salida de Inkling-Small, nadie debería confundir esto con un movimiento lateral. Las tablas completas de niveles están en precios de Kimi K3.

My take: la elección cuando la carga de trabajo es una ejecución de agente larga en lugar de miles de respuestas cortas. Para tráfico con forma de ticket, justificarlo frente a GLM-5.2 a un tercio del precio se vuelve difícil.

6. Qwen3.8-Max

Best for: un modelo cerrado con una ventana verdaderamente generosa y una asignación de prueba gratuita.

Qwen's chat interface, Alibaba Cloud's assistant and API front end, as taken from Alibaba Cloud

Qwen3.8-Max es donde aterrizas una vez que has decidido que los pesos abiertos no son lo importante y sí lo es el nivel comercial top de Alibaba. La sorpresa agradable en la página de facturación es que Max por fin eliminó los tramos por longitud de entrada. Una sola banda, cubriendo toda la ventana de un millón de tokens.

Features. Un contexto de 1M, salida máxima de 131K y razonamiento máximo de 262K, con TPM de 2 millones frente a RPM de 15.000. La caché implícita cuesta $0.25. También hay una cuota gratuita de 1 millón de tokens, válida durante 90 días.

Pros. No tener tramos por longitud de entrada es un asunto más grande de lo que parece. En el qwen3-max anterior, la regla de tramos de Alibaba funcionaba todo o nada, así que cruzar un límite recalculaba toda la solicitud y un prompt de 33K tokens saltaba de $1.20 a $2.40 en entrada. Aquí esa trampa desapareció. El millón de tokens gratis también te da margen real para evaluar como es debido.

Cons. Un solo ID de modelo, dos precios, según el ámbito de despliegue: $2.00 y $6.00 en las tablas International y Singapore, $1.65 y $4.951 en las Global. Una diferencia del 18% sin ninguna diferencia de comportamiento detrás resulta confusa a la hora de presupuestar. La cuota gratuita es solo para Singapore, su reloj no se pausa por inactividad, y lo que quede se anula al expirar. El lote quita un 50% pero no se acumula con los descuentos de caché. Max también es cerrado, y los pesos de Qwen publicados van dos generaciones por detrás, el más nuevo fechado el 24-04-2026.

Pricing. $2.00 de entrada y $6.00 de salida en International y Singapore, luego $1.65 y $4.951 en Global. La creación explícita de caché va a $2.50, que es el 125% de la entrada. El detalle completo está en nuestra entrada de precios de Qwen3.8-Max, y hay un repaso de alternativas a Qwen3.8-Max si buscas en la otra dirección.

My take: sólido, y algo caro frente a GLM-5.2, que pide menos y te da los pesos. La cuota gratuita sigue siendo una razón para probarlo.

7. Gemini 3.6 Flash

Best for: entrada de audio y multimedia mixta sin pagar una prima por el medio.

Google's Gemini web app, as taken from Google

¿Estabas en Inkling-Small específicamente por la entrada de audio? Entonces este es el reemplazo más cercano con un nivel de servicio real detrás. Gemini 3.6 Flash cobra una única tarifa plana de entrada de $1.50 que cubre texto, imagen, vídeo, audio y PDF, y eso rompe un patrón que el propio Google había establecido. En Gemini 2.5 Flash, la entrada de audio costaba $1.00 frente a $0.30 de texto, y en 2.0 Flash el múltiplo llegaba a 7x.

Features. 1.048.576 tokens de entrada frente a 65.536 de salida, caché a $0.15 por millón más $1.00 por millón por hora de almacenamiento, con los niveles Batch y Flex ambos a mitad de precio, $0.75 y $3.75.

Pros. La tarifa plana de medios es lo destacado aquí, y un nivel Batch a $0.75 y $3.75 hace asequible el trabajo masivo. La página de precios de Google lo lista como estable en lugar de en vista previa, y eso importa si esto va a ir cerca de clientes.

Cons. Ese tope de salida de 65.536 es el más ajustado aquí, así que las generaciones largas hay que trocearlas. La facturación de caché basada en almacenamiento funciona como un medidor en lugar de un cargo único, a diferencia de las tarifas planas de lectura de caché de otros sitios. Los pesos son cerrados, así que no hay autoalojamiento. La fundamentación (grounding) en Gemini 3.x tampoco está disponible en el nivel gratuito, lo que significa que evaluar cuesta dinero.

Pricing. Estándar es $1.50 de entrada y $7.50 de salida, Batch o Flex $0.75 y $3.75, Priority $2.70 y $13.50. Donde el presupuesto es la restricción, Gemini 3.5 Flash-Lite entra a $0.30 y $2.50, y tampoco lleva división por audio. La escala completa está en precios de Gemini 3.6 Flash.

My take: la elección para audio. También el único modelo aquí al que enviaría medios mixtos a volumen sin pensarlo dos veces.

8. Claude Opus 5

Best for: los casos donde una respuesta equivocada y segura de sí misma cuesta dinero de verdad.

Claude's web app, as taken from Anthropic

Este es el extremo lejano de la escala, y una razón lo puso en la lista. Responde al problema específico que tiene Inkling-Small. Claude Opus 5 cuesta $5.00 de entrada y $25.00 de salida, aproximadamente 21x la tarifa de salida de Inkling-Small, y lo compras cuando el riesgo de una respuesta equivocada supera la factura de tokens.

Features. El contexto completo de 1M a precio estándar, con sin nivel de recargo por contexto largo, algo poco habitual. Los documentos de precios de Anthropic lo dejan claro: una solicitud de 900k tokens factura a la misma tarifa por token que una de 9k. Las lecturas de caché cuestan $0.50. La Batch API se lleva un 50% plano en ambos lados, $2.50 y $12.50, y se acumula con la caché.

Pros. Sin un precipicio por longitud de contexto, toda una categoría de sorpresa en la factura desaparece. El pensamiento extendido no lleva precio aparte y se factura como salida estándar. Batch junto con caché también empuja las cargas de trabajo pesadas y repetidas bastante por debajo del precio de etiqueta.

Cons. En cualquier comparación de costes, el tokenizador es la trampa. Anthropic señala que Claude 4.7 y posteriores "producen aproximadamente un 30% más de tokens para el mismo texto" que el tokenizador anterior, así que ese precio de etiqueta de $25.00 subestima la verdadera brecha por tarea frente a un rival que todavía usa uno más antiguo. El modo Fast duplica ambos lados a $10.00 y $50.00, funciona solo en la API de proveedor original, y no se acumula con Batch. Los pesos son cerrados.

Pricing. Estándar $5.00 y $25.00, Batch $2.50 y $12.50, modo Fast $10.00 y $50.00, lectura de caché $0.50. La parada más barata es Sonnet 5 a $2.00 y $10.00 hasta el 31 de agosto de 2026, que pasa a $3.00 y $15.00 el 1 de septiembre. Cuándo vale la pena pagar esa diferencia se trata en nuestra comparación Opus 5 frente a Sonnet 5.

My take: excesivo para la mayoría del tráfico de tickets, exactamente adecuado para el 5% que toca dinero, política o un contrato. Enruta por tipo de pregunta en lugar de elegir un modelo para todo.

The price ladder, in one picture

Pon los ocho uno junto a otro por precio de salida y la forma de la decisión se vuelve obvia.

Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range
Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range

Inkling-Small ya está cerca del suelo. Existe exactamente un escalón hacia abajo con sentido, DeepSeek V4 Flash a $0.28, más un movimiento lateral al mismo precio en MiniMax M3. Todo lo demás aquí es un escalón hacia arriba, y lo que un escalón hacia arriba compra nunca es velocidad.

Vale la pena hacer las cuentas de lo que cualquiera de esto cuesta a volumen de tickets. Toma mil tickets en un mes, luego cuenta 2.000 tokens de salida por respuesta, que es generoso para una respuesta de soporte. Así que 2 millones de tokens de salida.

ModelOutput cost, 2M tokensAgainst Inkling-Small
DeepSeek V4 Flash$0.56$1.84 cheaper
Inkling-Small$2.40baseline
MiniMax M3$2.40identical
GLM-5.2$8.80$6.40 more
Inkling$8.10$5.70 more
Gemini 3.6 Flash$15.00$12.60 more
Kimi K3$30.00$27.60 more
Claude Opus 5$50.00$47.60 more

A este volumen, todo el rango de más barato a más caro es de unos $50 al mes. Una escalada manejada mal te cuesta más que eso. Que es el argumento real para subir la escalera, y también por qué la elección de modelo no es donde se concentra la mayor parte de la palanca.

Lo que ninguno de estos arregla en una cola de soporte

Ninguna de las ocho filas de arriba resuelve la siguiente parte, y por eso sigo insistiendo cuando alguien me dice que ha encontrado un modelo más barato.

He visto este fallo exacto aterrizar en cuentas de pago. Un modelo no se detiene cuando la recuperación vuelve vacía. Rellena el hueco con lo que aprendió en el entrenamiento. Un cliente, un proveedor danés de energía solar, tuvo su bot inventando afirmaciones sobre suscripciones y enviándolas a clientes reales. Otro le preguntó algo a su bot y recibió como respuesta "Oxygen (periodic table)". Ningún caso fue un mal modelo. Ambos fueron un modelo sin nada contra qué fundamentarse, y sin nada que le impidiera adivinar.

Un gerente de soporte en nuestras cuentas expresó la misma preocupación en términos más llanos, diciéndole a la IA qué no hacer:

"stop telling customers that we will get them sorted. You dont know that"

Un gerente de soporte de comercio electrónico, preocupado por un bot que prometía demasiado sobre fechas de entrega. La misma forma de problema. El modelo suena seguro, y ese sonar seguro es la parte peligrosa. El propio desglose de AA-Briefcase de Inkling-Small lo dice sin rodeos, presentando 270.86 puntos Elo mejor de lo que analiza.

Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates
Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates

Un modelo más grande no es el arreglo. Dos cosas que un modelo no trae de fábrica sí lo son. Primero la fundamentación, para que la respuesta salga de tu centro de ayuda y de tus tickets pasados en lugar de la memoria paramétrica. Luego una compuerta de confianza, para que cualquier cosa por debajo del listón vaya a una persona en lugar de salir. Esas dos cosas convierten un motor en bruto en algo que puedes apuntar a una cola en vivo, y son todo el tema de la prevención de alucinaciones de IA.

La otra razón por la que la gente deja de comparar modelos es más mundana que eso. Un desarrollador con el que hablamos, montando una base de conocimiento de incidentes de TI, ya había dado la vuelta al círculo. Probó la API de un proveedor y la encontró demasiado cara, probó otra y la encontró poco fiable, y al final solo quería algo que funcionara. Comparar modelos es divertido. Mantener una capa de modelo no lo es.

Try eesel

Si el modelo que estás eligiendo va a responder preguntas de clientes, el consejo honesto viene en dos partes. Toma el que de los ocho de arriba encaje con tu presupuesto y tu licencia. Luego no construyas tú mismo la capa que va encima.

Esa capa es lo que es eesel. Se conecta con Zendesk, Freshdesk o lo que sea que ya uses, aprende de tus tickets resueltos y tu centro de ayuda en lugar de los datos de entrenamiento de un modelo, y solo responde una vez que supera un umbral de confianza que tú mismo fijas. Todo lo que esté por debajo se escala. Y antes de que toque tráfico en vivo puedes simularlo contra tu propio historial de tickets, que es cómo descubres lo que se equivocaría antes de que lo haga un cliente.

The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets
The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets

Puse nuestra propia tasa medida de error factual del 7% al principio en lugar de enterrarla, porque es el número que importa mientras eliges un modelo. Salió del tráfico real de Zendesk de un minorista alemán de joyería, unos mil tickets al mes, con validación cruzada en 284 chats y 100 tickets, con recuperación sobre su centro de ayuda real. La fundamentación no te llevará a cero. Te da un número que puedes medir, controlar y mejorar, y eso es una categoría distinta a un modelo adivinando con confianza.

El enfoque comercial también es deliberadamente no por asiento. La facturación va por ticket resuelto, así que el precio sigue el trabajo hecho y no la plantilla de personal. Gratis para probar. Si prefieres verificar antes los números, la guía de desvío de tickets es un buen punto de partida.

My take

Inkling-Small es un buen modelo pequeño al que se le sigue pidiendo un trabajo para el que no fue construido. Ejecuta bien y a un precio ya cerca del suelo, y su fiabilidad de conocimiento mide -9.0. Esos dos hechos no están en tensión. Juntos describen una herramienta.

¿Te vas por coste? Toma DeepSeek V4 Flash y listo. Si lo que te empuja fuera es que las respuestas están mal, sube al Inkling padre para el arreglo barato, o a Claude Opus 5 para el caro, y ve sabiendo que ninguno de los dos te lleva a cero.

Y si la razón es que la ventana de contexto no coincide con la ficha, GLM-5.2 sirve lo que anuncia, bajo MIT. Esa es la fila que elegiría si me obligaran a una sola.

El veredicto honesto sobre los ocho sigue siendo el mismo, sin embargo. Cambiar de motor mueve tu factura y tus puntuaciones de benchmark. No toca lo que pasa cuando un cliente pregunta algo que tu documentación nunca respondió. Cerrar esa brecha requiere recuperación, un umbral de confianza, un traspaso. Ninguna mejora de modelo lo hace por ti, y vale la pena resolverlo antes de gastar otra tarde leyendo benchmarks de clasificación de tickets con IA.

Preguntas frecuentes

¿Cuáles son las mejores alternativas a Inkling-Small?
Para la mayoría de equipos se reduce a tres: DeepSeek V4 Flash si quieres hacer el mismo trabajo más barato, Inkling mismo si quieres la misma familia con mejor recuerdo factual, y Claude Opus 5 si una respuesta equivocada cuesta dinero de verdad. La lista completa en este artículo también cubre GLM-5.2, MiniMax M3, Kimi K3, Qwen3.8-Max y Gemini 3.6 Flash.
¿Existe una alternativa más barata a Inkling-Small?
Sí. El precio de DeepSeek V4 Flash es de $0.14 de entrada y $0.28 de salida por millón de tokens, frente a los $0.30 y $1.20 de Inkling-Small, así que la salida es aproximadamente cuatro veces más barata. MiniMax M3 iguala exactamente a Inkling-Small en $0.30 y $1.20 por debajo de 512K de entrada. Si estás intentando bajar tu coste por resolución, la partida del modelo rara vez es la más grande.
¿Por qué cambiarías de Inkling-Small?
Por su fiabilidad de conocimiento. Artificial Analysis puntúa a Inkling-Small con -9.0 en el AA-Omniscience Index con un 30.5% de precisión, mientras que su modelo padre está en 2.05 con un 39.95%. Esa brecha es lo que se convierte en alucinaciones de IA en soporte cuando se le pregunta al modelo algo que tu base de conocimiento no cubre.
¿De verdad Inkling-Small tiene una ventana de contexto de 1M?
La ficha del modelo dice 1M y ninguno de sus dos proveedores lo sirve. Thinking Machines sirve 256.000 tokens y DeepInfra sirve 524.288, según Artificial Analysis. La misma brecha existe en el modelo padre. Si el contexto largo es la razón por la que lo elegiste, revisa el explicador de Inkling-Small antes de construir contra 1M.
¿Qué alternativa a Inkling-Small tiene la mejor licencia abierta?
DeepSeek V4 Flash y GLM-5.2 se distribuyen bajo MIT, la postura comercial más limpia del grupo. Inkling-Small y su modelo padre son Apache 2.0. Kimi K3 y MiniMax M3 llevan licencias personalizadas con umbrales de ingresos, y la de MiniMax es no comercial por defecto. Para una visión más completa consulta nuestro repaso de agentes de IA de código abierto.
¿Cuánto cuesta ejecutar una alternativa a Inkling-Small en tickets de soporte?
Los tokens son la cifra pequeña. A $1.20 por millón de tokens de salida, un mes de mil tickets cuesta un par de dólares en inferencia. Lo que cuesta dinero es la capa de recuperación (retrieval), la lógica de escalado y el control de calidad, por lo que la mayoría de equipos compran esa capa en lugar de construirla. Nuestra página de precios cobra por ticket resuelto en lugar de por asiento, y el coste del servicio de atención al cliente con IA desglosa las cuentas.
¿Puedo alojar yo mismo una alternativa a Inkling-Small en lugar de pagar por token?
Puedes, y los pesos de DeepSeek V4 Flash, GLM-5.2, Kimi K3 y MiniMax M3 están todos publicados. La factura pasa al hardware en lugar de desaparecer, y heredas también el servicio, las evaluaciones y las actualizaciones. Los equipos que toman esta vía para atención al cliente con IA suelen descubrir que el modelo nunca fue la parte difícil.
¿Es Inkling-Small lo bastante bueno para soporte al cliente por sí solo?
No por sí solo, y ninguno de esta lista tampoco lo es. Un modelo en bruto responde desde los datos de entrenamiento cuando la recuperación vuelve vacía, que es exactamente cómo una respuesta equivocada y segura de sí misma llega a un cliente. La solución es la fundamentación (grounding) más una compuerta de confianza que deriva el caso, que es de lo que tratan la gestión de escalado con IA y el traspaso a un agente.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un desarrollador eligiendo entre tarjetas de modelos, con la tarjeta de la ballena de DeepSeek en el centro rodeada de modelos rivales
Alternatives

Las 8 mejores alternativas a DeepSeek V4 Flash en 2026

Ocho alternativas reales a DeepSeek V4 Flash, comparadas con datos. Nadie cambia de modelo por precio o velocidad, así que las ordeno según las cuatro carencias reales de Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Ilustracion de una persona sopesando varios superagentes de IA como alternativas a Skywork AI
Alternatives

7 mejores alternativas a Skywork AI en 2026

Las mejores alternativas a Skywork AI en 2026, desde superagentes generales como Manus hasta herramientas de investigacion, creadores de presentaciones y una opcion solo para soporte, con precios reales.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Una persona hablando con tres opciones distintas de agente de voz, con el logotipo de Grok a la izquierda
Alternatives

Las 10 mejores alternativas a Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 acaba de subir un 60% de precio en el alias predeterminado. Diez alternativas reales, con coste por hora medido y cifras de benchmark honestas.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Ilustración editorial de portada para un resumen de alternativas a Google Gemini 3.5 Pro
Alternatives

Las 8 mejores alternativas a Gemini 3.5 Pro en 2026

¿Buscas alternativas a Gemini 3.5 Pro? El problema: 3.5 Pro todavía no se ha lanzado. Aquí tienes 8 modelos que sí puedes usar hoy, con precios reales y recomendaciones.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración editorial que representa una comparación de modelos de IA insignia como alternativas a GPT-5.6 Sol
Alternatives

9 mejores alternativas a GPT-5.6 Sol en 2026

GPT-5.6 Sol es el buque insignia de OpenAI a precio de buque insignia: 5$/30$ por 1M de tokens, la misma tarifa que GPT-5.5. Aquí tienes 9 alternativas reales a Sol y para quién encaja cada una.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Las mejores alternativas a GPT-Live en 2026, un resumen de herramientas de IA de voz en tiempo real
Alternatives

Las 8 mejores alternativas a GPT-Live en 2026

GPT-Live deslumbra, pero no es la única IA de voz en tiempo real que merece tu atención. Aquí tienes 8 alternativas a GPT-Live en 2026, desde Gemini Live hasta los creadores de agentes de voz.

Rama Adi NugrahaRama Adi NugrahaJul 13, 2026
Ilustración editorial que representa una comparación de modelos de chat de IA como alternativas a GPT-5.6
Alternatives

Las 9 mejores alternativas a GPT-5.6 en 2026

GPT-5.6 pasó hoy de una vista previa restringida por el gobierno a un lanzamiento global, al mismo precio exacto que GPT-5.5. Aquí tienes 9 alternativas reales, y para quién es cada una.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Ilustración editorial que representa una comparación de modelos de chat de IA como alternativas a Grok 4.5
Alternatives

9 mejores alternativas a Grok 4.5 en 2026

Grok 4.5 es rápido y barato, pero ocupa el puesto #4 en el Intelligence Index y carga con problemas reales de confianza. Aquí tienes 9 alternativas reales, y para quién es exactamente cada una.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Cuadrícula de mosaicos visuales generados por IA en tonos azules que representan alternativas a Meta Muse Image
Alternatives

Las 8 mejores alternativas a Meta Muse Image en 2026

Meta Muse Image acaba de lanzarse, pero Nano Banana Pro, GPT Image 2, Midjourney y otros cinco generadores de imágenes con IA ya lo superan en calidad, precio o control.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis