8 melhores alternativas ao Inkling-Small em 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edição August 4, 2026

Por que as pessoas já estão olhando além do Inkling-Small
A Thinking Machines Lab lançou o Inkling-Small em 30-07-2026 sob Apache 2.0, quinze dias depois do modelo pai. A proposta era razoável e o modelo realmente entrega. Um quarto do tamanho do pai e mais rápido, além de mais barato, e segundo a própria ficha do fornecedor ele até supera o pai no SWE-bench Verified, 80,2 contra 77,6.
A recepção no r/LocalLLaMA teve algo a dizer sobre essa palavra "small". O terceiro comentário mais votado no tópico de lançamento nem trata de benchmarks:
"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"
Justo. Mas o nome não é o que afasta ninguém do modelo. O que ele sabe, sim.
A Artificial Analysis o coloca em um Intelligence Index de 40, posição #15 de 101, o que já é bem respeitável. Depois a mesma página traz o teste de conhecimento AA-Omniscience: um índice de -9,0, precisão de 30,5%, taxa de alucinação de 56,9%. A AA descreve essa avaliação como uma medida de "confiabilidade de conhecimento e alucinação" numa faixa de -100 a 100. Então um número negativo ali não é nenhum artefato de arredondamento. É o modelo alcançando uma resposta que ele não tem.
O detalhamento do AA-Briefcase é a parte para a qual eu sempre volto. Elo geral de 917,13, que diz pouco até você dividir: apresentação de 1067,99 contra qualidade analítica de 797,13. O modelo escreve uma resposta melhor do que realmente sabe.
Quem roda esses modelos no próprio hardware percebeu isso rápido, e num eixo mais afiado do que o das tabelas de benchmark:
"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."
Esse número de 84% é mais alto que os 56,9% que aparecem hoje na página da AA, então trate o número exato como a leitura deles, não a minha. De todo modo o ponto se sustenta, e é o ponto certo a ser feito. Eles estão escolhendo um modelo por saber quando não sabe, em vez de por quão bem ele escreve código.

Outras três coisas afastam as pessoas dele. Preço não está entre elas.
A janela de contexto não é a janela de contexto. A AA lista o modelo em 1M tokens. O que seus dois provedores realmente entregam é 256.000 (Thinking Machines) e 524.288 (DeepInfra). Então quem leu "1M" na ficha e construiu em cima desse número não está recebendo isso. Mesmo problema no modelo pai, onde o melhor valor servido é 524k entre três provedores e a linha mais barata e rápida da DeepInfra tem teto de 131k.
Dois provedores é pouco. O pai tem três, e o grupo que serve DeepSeek ou GLM é ainda maior. No dia do lançamento o modelo nem estava no OpenRouter, uma lacuna que um comentarista apontou no Hacker News junto com as contagens de parâmetros. Os dois provedores que você de fato tem também se comportam de forma diferente. A DeepInfra roda 1,43x mais rápido numa carga de 10k, depois fica atrás do provedor original em 100k, 82,36 tokens por segundo contra 113,36. Seu perfil de latência muda conforme o tamanho do prompt, e isso é uma coisa horrível de descobrir em produção.
Cobertura escassa também deixa menos espaço para trocar de provedor quando um deles começa a cortar custos, o que acontece mais do que os benchmarks publicados deixam transparecer:
"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."
O preço não é um único número. O provedor original está em $0,30 de entrada e $1,20 de saída. A DeepInfra pede $0,58 e $1,44 pelo contexto mais longo. Em mistura, a AA mostra $0,222 na proporção padrão de 7:2:1, enquanto a mistura clássica 3:1 chega a $0,525. Então, seja qual for o número único que você acabar citando, isso é na verdade uma escolha sobre proporções, e essa escolha importa quando você está modelando o custo do atendimento ao cliente com IA em volume.
Para ser justo, nada disso soma um modelo ruim. O raciocínio consome 95,5% da conta de saída, exatamente de onde vem a inteligência, e GPQA Diamond em 89,5% mais raciocínio de contexto longo em 63% são números reais. A coisa é uma executora. O problema só começa quando você pede a uma executora que seja uma conhecedora.
Como escolhi esses oito
Escrevo muitos desses apanhados e a armadilha nunca muda. Rankear por benchmark, publicar, seguir em frente. Então mantive o filtro aqui mais restrito.
Cada um dos oito precisava ser algo para o qual um usuário do Inkling-Small pudesse migrar ainda esta semana, ou seja, uma API pública ativa com preços publicados, sem listas de espera. Cada preço veio da própria página de cobrança do fornecedor em 05-08-2026, não de um site comparador, porque os números desses ficam desatualizados em duas semanas. Onde um provedor publica tanto o contexto servido quanto o anunciado, conferi um contra o outro. As licenças também li, e isso importou, porque dois modelos aqui têm limites de receita escondidos nas suas.
O que eu não fiz foi fingir que seis meses de tráfego de produção passaram pelos oito. Li a documentação e as páginas de cobrança, as fichas dos modelos, as medições da AA, e depois disse apenas o que isso sustenta.
As melhores alternativas ao Inkling-Small de relance
Todos os preços abaixo são por milhão de tokens em USD, conferidos em 05-08-2026.
| Model | Best for | Weights | Params | Input | Output | Real context | Modalities in | The catch |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (baseline) | Cheap agentic execution | Apache 2.0 | 276B / 12B active (266B per AA) | $0.30 | $1.20 | 256K first-party, 524,288 on DeepInfra | Text, image, audio | Knowledge index -9.0 |
| DeepSeek V4 Flash | Same job, a quarter the cost | MIT | 284B / 13B | $0.14 | $0.28 | 1M | Text | A 2x peak surcharge is announced |
| Inkling | Staying in the family, knowing more | Apache 2.0 | 975B / 41B | $1.00 | $4.05 | 524K best, 131K cheapest | Text, image, audio | Two AA pages quote different prices |
| GLM-5.2 | Strongest open weights you can host | MIT | ~753B total | $1.40 | $4.40 | 1M | Text | 128K output cap |
| MiniMax M3 | Video in, at Inkling-Small's price | Custom community licence | 428B / 23B | $0.30 | $1.20 | 1M, 512K guaranteed | Text, image, video | Non-commercial by default |
| Kimi K3 | Long-horizon agent work | Custom (Kimi K3 Licence) | 2.8T | $3.00 | $15.00 | 1,048,576 | Text | No batch tier, 3 RPM on entry tier |
| Qwen3.8-Max | Closed model, generous window | Closed | Undisclosed | $2.00 | $6.00 | 1M | Text | Two prices for one model |
| Gemini 3.6 Flash | Audio in with no premium | Closed | Undisclosed | $1.50 | $7.50 | 1,048,576 | Text, image, video, audio, PDF | 65,536 output ceiling |
| Claude Opus 5 | When wrong answers cost money | Closed | Undisclosed | $5.00 | $25.00 | 1M, no surcharge | Text, image | Newer tokenizer emits ~30% more tokens |
1. DeepSeek V4 Flash
Best for: fazer o que o Inkling-Small faz, por cerca de um quarto do custo de saída.
Essa é a comparação que um usuário real do Inkling-Small busca primeiro, e também foi o comentário mais substancial no tópico de lançamento no r/LocalLLaMA:
"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."
É esse o formato da coisa. O DeepSeek V4 Flash roda com 284B no total e 13B ativos, ao lado dos 12B do Inkling-Small, e a AA coloca os dois em 40. Motor parecido. Conta não tão parecida.
Há uma coisa que as contagens de parâmetros escondem, e ela importa se hospedar você mesmo estiver na sua lista. O DeepSeek é distribuído nativamente em uma mistura de FP4 e FP8, enquanto o Inkling-Small é distribuído em bf16, então, em precisão nativa, um operador local os estimou em cerca de 160GB contra 540GB. No papel, tamanho parecido. Na prática, o triplo de memória.
Features. Pesos com licença MIT no Hugging Face, além de uma janela de contexto de 1M e uma saída máxima de 384K, a maior desta lista por larga margem. A limitação de taxa funciona por concorrência em vez de requisições por minuto, com o teto publicado em 2.500 requisições simultâneas por conta.
Pros. A economia de cache é a verdadeira história aqui. Um acerto de cache custa $0,0028 por milhão de tokens de entrada, 50x abaixo da taxa de erro de cache de $0,14, então qualquer coisa com um prompt de sistema estável fica absurdamente barata. E MIT é a licença mais limpa do grupo, sem limite de receita, sem cláusula de atribuição.
Cons. Apenas texto, então qualquer áudio que você desse ao Inkling-Small não tem para onde ir. Também há uma nota na página de preços anunciando uma futura sobretaxa de 2x em horários de pico das 09h00 às 12h00 e das 14h00 às 18h00, horário de Pequim, com data efetiva "sujeita ao anúncio oficial". Uma incógnita conhecida, sentada dentro do seu modelo de custos.
Pricing. $0,14 de entrada e $0,28 de saída por milhão, acertos de cache a $0,0028. O Pro fica em $0,435 e $0,87, exatamente 3,1x o Flash nos dois lados. Os exemplos calculados estão no nosso detalhamento de preços do DeepSeek V4 Flash, e o testamos contra o Kimi K3 separadamente.
My take: se dinheiro é o seu motivo para sair, pare de ler aqui. Se é precisão, continue, porque ficar mais barato nunca fez um modelo saber mais.
2. Inkling, the parent
Best for: ficar nos mesmos pesos, ferramentas e licença enquanto recompra a recuperação factual.

Muitas vezes a alternativa mais interessante a um modelo pequeno é o grande do qual ele foi destilado, e aqui os números provam isso com clareza. Sob a mesma metodologia da AA, o Inkling pontua 41 no Intelligence Index contra 40 do Small, ou seja, praticamente empate. É no AA-Omniscience que eles se separam: 2,05 com 39,95% de precisão, contra -9,0 e 30,5%. Quase um terço a mais de perguntas voltam corretas.
Features. 975B no total com 41B ativos em 66 camadas, Apache 2.0, e texto mais imagem mais áudio na entrada. Três provedores de serviço agora, onde o lançamento tinha um, sendo eles DeepInfra, Together AI e Thinking Machines.
Pros. Mesma licença, mesma família, então a migração é basicamente trocar uma string de modelo. A linha FP8 da DeepInfra é rápida, 201,5 tokens por segundo, e o custo por tarefa de Intelligence Index ali sai a $0,4296, barato para essa categoria.
Cons. Duas páginas da AA divergem atualmente no preço, então convém saber qual delas você está citando. A página do modelo diz $1,87 de entrada e $4,68 de saída. Todas as linhas de provedores dizem $1,00 e $4,05. Esses valores de provedor se mantêm internamente consistentes nos três, então esse é o par com o qual eu planejaria. O contexto servido também é bagunçado. É 524k no melhor caso, e a linha barata e rápida da DeepInfra tem teto em 131k, ou 13,1% do milhão anunciado.
Pricing. Segundo os dados dos provedores, $1,00 de entrada e $4,05 de saída, com $0,17 por acerto de cache e $0,724 em mistura. Chame de 3,4x a tarifa de saída do Small. Se é o pai que você está buscando, o artigo de alternativas ao Inkling cobre a lista mais ampla.
My take: a escolha óbvia, e a que a maioria das pessoas pula, porque "fazer upgrade para o irmão maior" parece admitir que o pequeno foi um erro. Não foi. Era só a ferramenta errada para um trabalho de conhecimento.
3. GLM-5.2
Best for: os pesos abertos mais fortes desta lista que você consegue hospedar de forma realista.
O GLM-5.2 é o degrau acima que mantém você dentro do território de licença MIT. Cerca de 753B de parâmetros no total, com um contexto de 1M que sua API realmente entrega, e 2,23 milhões de downloads no repositório zai-org/GLM-5.2. Esse número de downloads mostra que a comunidade de auto-hospedagem já testou bastante o modelo.
Features. Pesos MIT com contexto de 1M e saída máxima de 128K, depois entrada em cache a $0,26, com armazenamento de cache listado como gratuito por enquanto. A Z.ai também vende um caminho por assinatura. O Coding Plan começa em $18 por mês, com desconto para $12,60, e traz 10.000 créditos por semana.
A Z.ai publica sua própria curva de nível de esforço, e olhar para ela vale mais do que aceitar a pontuação de manchete pelo valor de face:

Pros. O GLM-5.2 custa o mesmo que o GLM-5.1 custava, $1,40 e $4,40, e enquanto isso a janela de contexto foi de 200K para 1M. Um upgrade gratuito, sem enrolação. Uma licença MIT sem cláusula de receita também vale mais do que um ou dois pontos de benchmark quando você está lançando isso dentro de um produto.
Cons. Esse teto de saída de 128K é o mais apertado entre as opções de pesos abertos aqui, contra os 384K do DeepSeek. Os créditos do Coding Plan queimam a 3x no pico e 2x fora do pico, com o fora do pico temporariamente em 1x até o fim de setembro, então as contas da assinatura precisam de atenção.
Pricing. $1,40 de entrada, $4,40 de saída, $0,26 em cache. Existem irmãos mais baratos se você conseguir viver com menos. GLM-4.7 e GLM-4.6 ficam ambos em $0,60 e $2,20, enquanto o GLM-4.7-FlashX está em $0,07 e $0,40.
My take: a melhor troca licença-capacidade da lista. Se a sua equipe jurídica já perguntou o que acontece no dia em que um fornecedor muda os termos, aponte para esta linha.
4. MiniMax M3
Best for: igualar exatamente o preço do Inkling-Small e ainda adicionar entrada de vídeo.
Esse aqui é um empate de preço direto, e isso torna a comparação incomumente limpa. Abaixo de 512K de entrada, o MiniMax M3 cobra $0,30 de entrada e $1,20 de saída, idêntico à tarifa de provedor original do Inkling-Small, saindo de um modelo de 428B com 23B ativos. O que deixa você escolhendo por tudo, menos o custo.
Features. Um contexto de 1M com 512K garantidos como mínimo, leituras de cache a $0,06, e texto mais imagem mais vídeo na entrada, chegando por partes de conteúdo image_url e video_url. O modo de pensamento custa o mesmo ligado ou desligado. Os pesos estão no Hugging Face em MiniMaxAI/MiniMax-M3, com 170.353 downloads até agora.
Pros. Quase o dobro dos parâmetros ativos do Inkling-Small pelo mesmo dinheiro, e entrada de vídeo de quebra, algo que nada mais nesse preço nesta lista oferece. A página de preços rotula a tarifa atual como "Permanent 50% off", e nenhuma data de expiração está impressa em lugar nenhum.
Cons. A licença é a verdadeira pegadinha aqui. A MINIMAX COMMUNITY LICENSE é não comercial por padrão, o uso comercial pede um crédito visível "Built with MiniMax M3", e acima de $20M em receita anual você precisa de autorização por escrito. Passar de 512K de entrada dobra as duas tarifas, então $0,60 e $2,40. Também existe um nível Priority, a 1,5x, se a fila mais rápida valer a pena para você.
Pricing. $0,30 e $1,20 até 512K de entrada, depois $0,60 e $2,40 acima disso, leituras de cache a $0,06. O Priority fica em $0,45 e $1,80, ou $0,90 e $3,60 acima do limite.
My take: bom motor, licença que você precisa sentar e ler. Uma startup abaixo da linha de receita, disposta a colocar o crédito, consegue mais modelo por dólar aqui do que naquilo que está deixando para trás.
5. Kimi K3
Best for: trabalho de agente de longo alcance onde a execução importa mais do que o preço do token.
O Kimi K3 é um salto muito maior do que qualquer coisa acima dele, e em sua própria documentação de preços a Moonshot o chama de carro-chefe para "codificação de longo alcance e trabalho de conhecimento de ponta a ponta". Com 2,8 trilhões de parâmetros servidos em 4 bits mxfp4, também é o maior modelo aqui cujos pesos podem ser baixados.
Features. Um contexto de 1.048.576 tokens, raciocínio sempre ativo por trás de uma configuração reasoning_effort de low, high ou max (max sendo o padrão), e um repositório moonshotai/Kimi-K3 sem restrições. A busca na web é cobrada separadamente, $0,005 por chamada bem-sucedida.
Pros. Pesos abertos nessa escala é incomum. A taxa de acerto de cache de $0,30 contra os $3,00 de entrada por erro de cache também é uma economia de 10x sempre que o contexto se repete. E a faixa intermediária é coberta por um irmão mais barato, o kimi-k2.7-code, a $0,95 e $4,00.
Cons. Há duas pegadinhas operacionais aqui, e as duas mordem. O K3 não é suportado no nível de lote, então o desconto de 60% no lote que outros modelos Kimi recebem não chega até ele. O sistema de níveis também é controlado por gasto: o Tier 0, com $1 de recarga acumulada, permite 1 requisição simultânea e 3 requisições por minuto, subindo para 1.000 simultâneas e 10.000 RPM ao atingir os $3.000 do Tier 5. A licença parece MIT à primeira vista, mas acrescenta uma cláusula exigindo um acordo separado para negócios de modelo como serviço acima de $20M de receita em quaisquer doze meses consecutivos.
Pricing. $3,00 de entrada e $15,00 de saída, com $0,30 num acerto de cache. A 12,5x a tarifa de saída do Inkling-Small, ninguém deveria confundir isso com um movimento lateral. As tabelas completas de níveis estão em preços do Kimi K3.
My take: a escolha para quando a carga de trabalho é uma longa execução de agente em vez de milhares de respostas curtas. Para tráfego no formato de tickets, justificá-lo contra o GLM-5.2 a um terço do preço fica difícil.
6. Qwen3.8-Max
Best for: um modelo fechado com uma janela verdadeiramente generosa e uma cota de teste gratuita.
O Qwen3.8-Max é onde você chega assim que decide que pesos abertos não são o ponto e que o nível comercial mais alto da Alibaba é. A surpresa boa na página de cobrança é que o Max finalmente abandonou as faixas por tamanho de entrada. Uma única faixa, cobrindo a janela inteira de um milhão de tokens.
Features. Um contexto de 1M, saída máxima de 131K e raciocínio máximo de 262K, com TPM de 2 milhões contra RPM de 15.000. O cache implícito custa $0,25. Também há uma cota gratuita de 1 milhão de tokens, válida por 90 dias.
Pros. Não ter faixas por tamanho de entrada é uma questão maior do que parece. No antigo qwen3-max, a regra de faixas da Alibaba funcionava no tudo ou nada, então cruzar um limite recobrava a requisição inteira, e um prompt de 33K tokens saltava de $1,20 para $2,40 na entrada. Aqui essa armadilha sumiu. O milhão de tokens gratuito também dá espaço real para avaliar direito.
Cons. Um único ID de modelo, dois preços, dependendo do escopo de implantação: $2,00 e $6,00 nas tabelas International e Singapore, $1,65 e $4,951 nas tabelas Global. Uma diferença de 18% sem nenhuma diferença de comportamento por trás é confusa para orçar. A cota gratuita é só para Singapore, seu relógio não pausa por inatividade, e o que sobrar é anulado na expiração. O lote tira 50%, mas não se acumula com descontos de cache. O Max também é fechado, e os pesos Qwen publicados estão duas gerações atrás, o mais novo datado de 24-04-2026.
Pricing. $2,00 de entrada e $6,00 de saída em International e Singapore, depois $1,65 e $4,951 em Global. A criação explícita de cache custa $2,50, que é 125% da entrada. O detalhe completo está no nosso post de preços do Qwen3.8-Max, e há o apanhado de alternativas ao Qwen3.8-Max se você estiver buscando na direção contrária.
My take: sólido, e um pouco caro demais frente ao GLM-5.2, que pede menos e ainda entrega os pesos. A cota gratuita continua sendo um motivo para experimentar.
7. Gemini 3.6 Flash
Best for: entrada de áudio e mídia mista sem pagar um prêmio pela mídia.
Você estava no Inkling-Small especificamente pela entrada de áudio? Então este é o substituto mais próximo com um nível de serviço real por trás. O Gemini 3.6 Flash cobra uma única tarifa de entrada plana de $1,50 cobrindo texto, imagem, vídeo, áudio e PDF, e isso quebra um padrão que o próprio Google havia estabelecido. No Gemini 2.5 Flash, a entrada de áudio custava $1,00 contra $0,30 de texto, e no 2.0 Flash o múltiplo chegava a 7x.
Features. 1.048.576 tokens de entrada contra 65.536 de saída, cache a $0,15 por milhão mais $1,00 por milhão por hora de armazenamento, com os níveis Batch e Flex ambos pela metade do preço, $0,75 e $3,75.
Pros. A tarifa plana de mídia é o destaque aqui, e um nível Batch a $0,75 e $3,75 torna o trabalho em massa acessível. A página de preços do Google o lista como estável em vez de prévia, e isso importa se isso for chegar perto de clientes.
Cons. Esse teto de saída de 65.536 é o mais apertado aqui, então gerações longas precisam ser divididas em partes. A cobrança de cache baseada em armazenamento funciona como um medidor em vez de uma cobrança única, ao contrário das tarifas planas de leitura de cache em outros lugares. Os pesos são fechados, então não há auto-hospedagem. A fundamentação (grounding) no Gemini 3.x também não está disponível no nível gratuito, o que significa que avaliar custa dinheiro.
Pricing. O padrão é $1,50 de entrada e $7,50 de saída, Batch ou Flex $0,75 e $3,75, Priority $2,70 e $13,50. Onde o orçamento é a restrição, o Gemini 3.5 Flash-Lite entra a $0,30 e $2,50, e também não tem divisão de áudio. A escala completa está em preços do Gemini 3.6 Flash.
My take: a escolha para áudio. Também o único modelo aqui para o qual eu enviaria mídia mista em volume sem pensar duas vezes.
8. Claude Opus 5
Best for: os casos em que uma resposta confiante e errada custa dinheiro de verdade.
Este é o extremo mais distante da escala, e um motivo o colocou na lista. Ele responde ao problema específico que o Inkling-Small tem. O Claude Opus 5 custa $5,00 de entrada e $25,00 de saída, cerca de 21x a tarifa de saída do Inkling-Small, e você compra isso quando a desvantagem de uma resposta errada supera a conta de tokens.
Features. O contexto completo de 1M no preço padrão, com nenhum nível de sobretaxa para contexto longo, o que é incomum. Os documentos de preços da Anthropic deixam isso claro: uma requisição de 900 mil tokens é cobrada na mesma tarifa por token que uma de 9 mil. Leituras de cache custam $0,50. A API Batch tira um plano de 50% dos dois lados, $2,50 e $12,50, e se acumula com o cache.
Pros. Sem um precipício de comprimento de contexto, uma categoria inteira de surpresa na fatura desaparece. O pensamento estendido não tem preço separado e é cobrado como saída padrão. Batch junto com cache também puxa cargas de trabalho pesadas e repetidas bem para baixo do preço de tabela.
Cons. Em qualquer comparação de custo, o tokenizador é a armadilha. A Anthropic observa que o Claude 4.7 e versões posteriores "produzem aproximadamente 30% mais tokens para o mesmo texto" do que o tokenizador mais antigo, então esse preço de tabela de $25,00 subestima a real diferença por tarefa contra um rival ainda usando um tokenizador mais antigo. O modo Fast dobra os dois lados para $10,00 e $50,00, funciona apenas na API do provedor original, e não se acumula com Batch. Os pesos são fechados.
Pricing. Padrão $5,00 e $25,00, Batch $2,50 e $12,50, modo Fast $10,00 e $50,00, leitura de cache $0,50. A parada mais barata é o Sonnet 5 a $2,00 e $10,00 até 31 de agosto de 2026, que passa para $3,00 e $15,00 em 1º de setembro. Quando vale a pena pagar essa diferença é abordado na nossa comparação Opus 5 versus Sonnet 5.
My take: exagero para a maior parte do tráfego de tickets, exatamente certo para os 5% que envolvem dinheiro, política ou contrato. Direcione por tipo de pergunta em vez de escolher um modelo para tudo.
The price ladder, in one picture
Coloque os oito lado a lado pelo preço de saída, e o formato da decisão fica óbvio.

O Inkling-Small já está perto do piso. Existe exatamente um degrau significativo abaixo, o DeepSeek V4 Flash a $0,28, mais um movimento lateral no mesmo preço com o MiniMax M3. Tudo o mais aqui é um degrau acima, e o que um degrau acima compra nunca é velocidade.
Vale a pena fazer a conta do que qualquer um desses custa em volume de tickets. Pegue mil tickets em um mês, depois considere 2.000 tokens de saída por resposta, o que é generoso para uma resposta de suporte. Então 2 milhões de tokens de saída.
| Model | Output cost, 2M tokens | Against Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | $0.56 | $1.84 cheaper |
| Inkling-Small | $2.40 | baseline |
| MiniMax M3 | $2.40 | identical |
| GLM-5.2 | $8.80 | $6.40 more |
| Inkling | $8.10 | $5.70 more |
| Gemini 3.6 Flash | $15.00 | $12.60 more |
| Kimi K3 | $30.00 | $27.60 more |
| Claude Opus 5 | $50.00 | $47.60 more |
Nesse volume, toda a diferença do mais barato ao mais caro é de cerca de $50 por mês. Uma escalada mal resolvida custa mais do que isso. O que é o verdadeiro argumento para subir a escada, e também por que a escolha do modelo não é onde está a maior alavancagem.
O que nenhum destes resolve numa fila de suporte
Nenhuma das oito linhas acima resolve a próxima parte, e é por isso que continuo insistindo quando alguém me diz que encontrou um modelo mais barato.
Já vi exatamente essa falha acontecer em contas pagantes. Um modelo não para quando a recuperação volta vazia. Ele preenche a lacuna com o que aprendeu no treinamento. Um cliente, uma fornecedora dinamarquesa de energia solar, teve o bot fabricando alegações sobre assinaturas e enviando isso a clientes reais. Outro perguntou algo ao bot e recebeu "Oxygen (periodic table)" de volta. Nenhum dos casos foi um modelo ruim. Ambos foram um modelo sem nada contra o que se fundamentar, e nada no caminho para impedi-lo de chutar.
Um gerente de suporte em nossas contas colocou a mesma preocupação em termos mais diretos, dizendo à IA o que não fazer:
"stop telling customers that we will get them sorted. You dont know that"
Um gerente de suporte de e-commerce, preocupado com um bot prometendo demais sobre prazos de entrega. Mesmo formato de problema. O modelo soa confiante, e esse soar confiante é a parte perigosa. O próprio detalhamento AA-Briefcase do Inkling-Small diz isso claramente, apresentando 270,86 pontos Elo melhor do que analisa.

Um modelo maior não é a solução. Duas coisas que um modelo não traz de fábrica são. Primeiro, fundamentação, para que a resposta saia da sua central de ajuda e dos seus tickets passados em vez da memória paramétrica. Depois, uma barreira de confiança, para que tudo abaixo do limite vá para uma pessoa em vez de sair. Essas duas coisas transformam um motor bruto em algo que você pode apontar para uma fila em produção, e são todo o assunto da prevenção de alucinações de IA.
O outro motivo pelo qual as pessoas param de comparar modelos é mais mundano do que isso. Um desenvolvedor com quem conversamos, montando uma base de conhecimento de incidentes de TI, já tinha dado a volta completa. Testou a API de um fornecedor e achou cara demais, testou outra e achou pouco confiável, e no fim só queria algo que funcionasse. Comparar modelos é divertido. Manter uma camada de modelo não é.
Try eesel
Se o modelo que você está escolhendo vai responder perguntas de clientes, o conselho honesto vem em duas partes. Pegue o que, dos oito acima, se encaixa no seu orçamento e na sua licença. Depois não construa você mesmo a camada acima dele.
Essa camada é o que é a eesel. Ela se conecta ao Zendesk, Freshdesk ou o que quer que você já use, aprende com seus tickets resolvidos e sua central de ajuda em vez dos dados de treinamento de um modelo, e só responde depois de passar por um limite de confiança que você mesmo define. Tudo abaixo disso é escalonado. E antes de tocar no tráfego real, você pode simulá-la contra o seu próprio histórico de tickets, que é como você descobre o que ela erraria antes de um cliente descobrir.

Coloquei nossa própria taxa medida de erro factual de 7% logo no início em vez de escondê-la, porque esse é o número que importa enquanto você está escolhendo um modelo. Ele veio do tráfego real do Zendesk de uma varejista alemã de joias, cerca de mil tickets por mês, validado de forma cruzada em 284 chats e 100 tickets, com recuperação sobre a central de ajuda real deles. Fundamentação não vai te levar a zero. Ela dá um número que você pode medir, controlar e então melhorar, e isso é uma categoria diferente de um modelo chutando com confiança.
O modelo comercial também é deliberadamente não por assento. A cobrança é por ticket resolvido, então o preço acompanha o trabalho feito e não o quadro de pessoal. Grátis para testar. Se preferir checar os números primeiro, o guia de desvio de tickets é um bom ponto de partida.
My take
O Inkling-Small é um bom modelo pequeno para o qual as pessoas continuam pedindo um trabalho que ele não foi feito para fazer. Ele executa bem e a um preço já perto do piso, e sua confiabilidade de conhecimento mede -9,0. Esses dois fatos não estão em tensão. Juntos, descrevem uma ferramenta.
Está saindo pelo custo? Pegue o DeepSeek V4 Flash e pronto. Se as respostas erradas são o que está te empurrando para fora, suba para o Inkling pai para o conserto barato, ou para o Claude Opus 5 para o caro, sabendo que nenhum dos dois te leva a zero.
E se o motivo é a janela de contexto não bater com a ficha, o GLM-5.2 entrega o que anuncia, sob MIT. Essa é a linha que eu escolheria se fosse obrigado a apenas uma.
O veredito honesto sobre os oito continua o mesmo, porém. Trocar de motor mexe na sua conta e nas suas pontuações de benchmark. Não muda o que acontece quando um cliente pergunta algo que sua documentação nunca respondeu. Fechar essa lacuna exige recuperação, um limite de confiança, uma transferência. Nenhum upgrade de modelo faz isso por você, e vale a pena resolver isso antes de gastar mais uma tarde lendo benchmarks de classificação de tickets com IA.
Perguntas frequentes
Quais são as melhores alternativas ao Inkling-Small?
Existe uma alternativa mais barata ao Inkling-Small?
Por que trocar de Inkling-Small?
O Inkling-Small realmente tem uma janela de contexto de 1M?
Qual alternativa ao Inkling-Small tem a melhor licença aberta?
Quanto custa rodar uma alternativa ao Inkling-Small em tickets de suporte?
Posso hospedar eu mesmo uma alternativa ao Inkling-Small em vez de pagar por token?
O Inkling-Small é bom o suficiente para suporte ao cliente sozinho?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








