As 8 melhores alternativas ao Inkling-Small em 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edição August 4, 2026

Por que as pessoas já estão olhando além do Inkling-Small
A Thinking Machines Lab lançou o Inkling-Small em 30/07/2026 sob a licença Apache 2.0, quinze dias depois do modelo pai. A proposta era razoável e o modelo realmente entrega isso. Um quarto do tamanho do pai, mais rápido e mais barato também, e na própria ficha do fornecedor ele até supera o pai no SWE-bench Verified, 80,2 contra 77,6.
A recepção no r/LocalLLaMA teve muito a dizer sobre essa palavra "small". O terceiro comentário mais votado no tópico de lançamento não fala nada sobre benchmarks:
"Em breve, depois de todos esses modelos de 2-3T, vão chamar de 'small' modelos de 500-700B... chorando com 12GB de VRAM"
Justo. Mas o nome não é o que afasta ninguém do modelo. O que ele sabe, sim.
A Artificial Analysis o coloca em um Intelligence Index de 40, posição #15 de 101, o que é bem respeitável. Depois a mesma página reporta o teste de conhecimento AA-Omniscience: um índice de -9,0, precisão de 30,5%, taxa de alucinação de 56,9%. A AA descreve essa avaliação como uma medida de "confiabilidade de conhecimento e alucinação" em uma faixa de -100 a 100. Então um número negativo ali não é nenhum artefato de arredondamento. É o modelo alcançando uma resposta que ele não tem.
A análise detalhada do AA-Briefcase é a parte à qual eu continuo voltando. Um Elo geral de 917,13, que diz pouco até você separar: apresentação 1067,99 contra qualidade analítica de 797,13. O modelo escreve uma resposta melhor do que realmente sabe.
As pessoas que executam esses modelos no próprio hardware notaram isso rapidamente, e em um eixo mais afiado do que o usado nas tabelas de benchmark:
"Mas pior que o GPT 5.5 Luna no índice Omniscience, porque ele inventa demais as respostas. 84% de taxa de alucinação, por isso prefiro outros modelos abertos, eles são melhores em 'detectar' sua própria incerteza."
Esse número de 84% está mais alto do que os 56,9% que aparecem hoje na página da AA, então considere o número exato como a leitura deles, não a minha. De qualquer forma o ponto se mantém, e é o ponto certo a ser feito. Eles estão escolhendo um modelo com base em se ele sabe quando não sabe, em vez de em quão bem ele escreve código.

Outras três coisas afastam as pessoas dele. O preço não é uma delas.
A janela de contexto não é a janela de contexto. A AA lista o modelo com 1M de tokens. O que seus dois provedores realmente entregam é 256.000 (Thinking Machines) e 524.288 (DeepInfra). Então quem leu "1M" na ficha e construiu em torno desse número não está recebendo isso. Mesmo problema no modelo pai, onde o melhor número entregue é 524k entre três provedores, e a linha mais barata e rápida da DeepInfra tem um limite de 131k.
Dois provedores é pouco. O pai tem três, e o grupo que serve DeepSeek ou GLM é ainda maior. No dia do lançamento, o modelo nem estava no OpenRouter, uma lacuna que um comentarista apontou no Hacker News junto com os números de parâmetros. Os dois provedores que você de fato tem também se comportam de forma diferente. A DeepInfra roda 1,43 vez mais rápido em uma carga de 10k, e depois fica atrás do fornecedor original em 100k, 82,36 tokens por segundo contra 113,36. Seu perfil de latência muda conforme o tamanho do prompt, e isso é uma coisa horrível de descobrir em produção.
Cobertura escassa também deixa menos espaço para procurar outras opções quando um provedor começa a economizar em coisas importantes, o que acontece com mais frequência do que os benchmarks publicados deixam transparecer:
"Na verdade, descobrimos que muitos provedores de inferência estão quantizando os pesos ou até o cache KV, e devido aos preços baixos com que atendem em lotes enormes, isso resulta em uma vazão instável."
O preço não é um único número. O fornecedor original cobra $0,30 de entrada e $1,20 de saída. A DeepInfra pede $0,58 e $1,44 pelo contexto mais longo. Misturado, a AA mostra $0,222 na proporção padrão de 7:2:1, enquanto a mistura clássica de 3:1 fica em $0,525. Então, qualquer número único que você acabe citando é, na verdade, uma escolha sobre proporções, e essa escolha importa quando você está modelando o custo do atendimento ao cliente com IA em volume.
Para ser justo, nada disso soma a um modelo ruim. O raciocínio consome 95,5% da sua conta de saída, que é exatamente de onde vem a inteligência, e o GPQA Diamond em 89,5% mais o raciocínio de contexto longo em 63% são números reais. A coisa é um executor. O problema só começa quando você pede a um executor para ser um conhecedor.
Como escolhi estes oito
Escrevo muitos desses apanhados e a armadilha nunca muda. Classificar por benchmark, publicar, seguir adiante. Então mantive o filtro mais estreito aqui.
Cada um dos oito precisava ser algo para o qual um usuário do Inkling-Small pudesse migrar nesta semana, então uma API pública ativa com preços publicados, sem listas de espera. Cada preço veio da própria página de faturamento do fornecedor em 05/08/2026, em vez de um site de comparação, já que os números desses sites ficam desatualizados em menos de duas semanas. Onde um provedor publica tanto o contexto entregue quanto o anunciado, verifiquei um contra o outro. As licenças também li, e isso importou, porque dois modelos aqui têm limiares de receita escondidos nas suas.
O que eu não fiz foi fingir que seis meses de tráfego de produção passaram pelos oito. Li a documentação e as páginas de faturamento, as fichas dos modelos, as medições da AA, e então só disse o que isso sustenta.
As melhores alternativas ao Inkling-Small em resumo
Todos os preços abaixo são por milhão de tokens em USD, verificados em 05/08/2026.
| Modelo | Melhor para | Pesos | Parâmetros | Entrada | Saída | Contexto real | Modalidades de entrada | A pegadinha |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (base) | Execução agêntica barata | Apache 2.0 | 276B / 12B ativos (266B segundo a AA) | $0,30 | $1,20 | 256K no fornecedor original, 524.288 na DeepInfra | Texto, imagem, áudio | Índice de conhecimento -9,0 |
| DeepSeek V4 Flash | Mesmo trabalho, um quarto do custo | MIT | 284B / 13B | $0,14 | $0,28 | 1M | Texto | Uma sobretaxa de 2x no horário de pico foi anunciada |
| Inkling, o pai | Ficar na família, sabendo mais | Apache 2.0 | 975B / 41B | $1,00 | $4,05 | 524K no melhor caso, 131K no mais barato | Texto, imagem, áudio | Duas páginas da AA citam preços diferentes |
| GLM-5.2 | Os pesos abertos mais fortes que você pode hospedar | MIT | ~753B no total | $1,40 | $4,40 | 1M | Texto | Limite de saída de 128K |
| MiniMax M3 | Entrada de vídeo, pelo preço do Inkling-Small | Licença comunitária própria | 428B / 23B | $0,30 | $1,20 | 1M, 512K garantido | Texto, imagem, vídeo | Não comercial por padrão |
| Kimi K3 | Trabalho de agente de longo prazo | Licença própria (Kimi K3 Licence) | 2,8T | $3,00 | $15,00 | 1.048.576 | Texto | Sem nível batch, 3 RPM no nível de entrada |
| Qwen3.8-Max | Modelo fechado, janela generosa | Fechado | Não divulgado | $2,00 | $6,00 | 1M | Texto | Dois preços para um modelo |
| Gemini 3.6 Flash | Entrada de áudio sem sobretaxa | Fechado | Não divulgado | $1,50 | $7,50 | 1.048.576 | Texto, imagem, vídeo, áudio, PDF | Teto de saída de 65.536 |
| Claude Opus 5 | Quando respostas erradas custam dinheiro | Fechado | Não divulgado | $5,00 | $25,00 | 1M, sem sobretaxa | Texto, imagem | Tokenizador mais novo emite ~30% mais tokens |
1. DeepSeek V4 Flash
Melhor para: fazer o que o Inkling-Small faz, por cerca de um quarto do custo de saída.
Esta é a comparação à qual um usuário real do Inkling-Small recorre primeiro, e também foi o comentário mais substancial no tópico de lançamento no r/LocalLLaMA:
"Fico pensando como ele se compara ao DSV4 Flash. Comparável no benchmark de inteligência da Artificial Analysis (ambos 40). Parece se sair um pouco melhor em codificação / fluxos agênticos, porém."
É essa a proporção. O DeepSeek V4 Flash roda com 284B no total e 13B ativos, ao lado dos 12B do Inkling-Small, e a AA coloca os dois em 40. Motor parecido. Conta não tão parecida.
Há uma coisa que os números de parâmetros escondem, e ela importa se a auto-hospedagem estiver na sua lista. O DeepSeek é distribuído nativamente em FP4 e FP8 mistos, enquanto o Inkling-Small é distribuído em bf16, então em precisão nativa um executor local colocou um em cerca de 160GB contra 540GB. No papel, o mesmo tamanho aproximado. Na prática, o triplo de memória.
Recursos. Pesos com licença MIT no Hugging Face, mais uma janela de contexto de 1M e uma saída máxima de 384K, a maior desta lista, com uma boa margem. A limitação de taxa é feita por concorrência em vez de requisições por minuto, com um limite publicado de 2.500 requisições simultâneas por conta.
Vantagens. A economia de cache é a verdadeira história aqui. Um acerto de cache custa $0,0028 por milhão de tokens de entrada, 50x abaixo da taxa de erro de cache de $0,14, então qualquer coisa com um prompt de sistema estável fica absurdamente barata. E MIT é a licença mais limpa do grupo, sem limiar de receita, sem cláusula de atribuição.
Desvantagens. Apenas texto, então qualquer áudio que você estivesse alimentando ao Inkling-Small não tem mais para onde ir. Há também uma nota de rodapé na página de preços anunciando uma futura sobretaxa de 2x no horário de pico entre 09h00 e 12h00 e 14h00 e 18h00, horário de Pequim, com data de entrada em vigor "sujeita ao anúncio oficial". Uma incógnita conhecida dentro do seu modelo de custos.
Preços. $0,14 de entrada e $0,28 de saída por milhão, acertos de cache a $0,0028. O Pro fica em $0,435 e $0,87, exatamente 3,1x o Flash em ambos os lados. Os exemplos calculados estão em nossa análise de preços do DeepSeek V4 Flash, e o comparamos com o Kimi K3 separadamente.
Minha opinião: se o dinheiro é o seu motivo para sair, pare de ler aqui. Se é a precisão, continue lendo, porque ficar mais barato nunca fez um modelo saber mais.
2. Inkling, o pai
Melhor para: ficar nos mesmos pesos, ferramentas e licença enquanto recompra a precisão factual.

Muitas vezes a alternativa mais interessante a um modelo pequeno é o grande do qual ele foi destilado, e aqui os números comprovam isso claramente. Sob a mesma metodologia da AA, o Inkling marca 41 no Intelligence Index contra 40 do Small, então empata. O AA-Omniscience é onde eles se separam: 2,05 com 39,95% de precisão, contra -9,0 e 30,5%. Quase um terço mais de perguntas voltam corretas.
Recursos. 975B no total com 41B ativos em 66 camadas, Apache 2.0, e texto mais imagem mais áudio na entrada. Agora três provedores de serviço, onde no lançamento havia apenas um: DeepInfra, Together AI e Thinking Machines.
Vantagens. Mesma licença, mesma família, então a migração é basicamente trocar uma string de modelo. A linha FP8 da DeepInfra é rápida, 201,5 tokens por segundo, e o custo por tarefa de Intelligence Index ali dá $0,4296, barato para esse nível.
Desvantagens. Duas páginas da AA atualmente discordam sobre o preço, então você quer saber qual está citando. A página do modelo diz $1,87 de entrada e $4,68 de saída. As linhas de provedores todas dizem $1,00 e $4,05. Esses números de provedores permanecem consistentes entre si nos três, então esse é o par contra o qual eu planejaria. O contexto entregue também é confuso. É 524k no melhor caso, e a linha barata e rápida da DeepInfra tem um limite de 131k, ou 13,1% do milhão anunciado.
Preços. Segundo os dados dos provedores, $1,00 de entrada e $4,05 de saída, com $0,17 para um acerto de cache e $0,724 misturado. Vamos chamar isso de 3,4x a tarifa de saída do Small. Se é o pai que você está comprando, o artigo sobre alternativas ao Inkling cobre a lista mais ampla.
Minha opinião: a escolha óbvia, e a que a maioria pula, porque "subir para o irmão maior" parece admitir que o pequeno foi um erro. Não foi. Era só a ferramenta errada para um trabalho de conhecimento.
3. GLM-5.2
Melhor para: os pesos abertos mais fortes desta lista que você pode hospedar de forma realista.
O GLM-5.2 é o passo acima que mantém você em território com licença MIT. Cerca de 753B parâmetros no total, com um contexto de 1M que sua API realmente entrega, e 2,23 milhões de downloads no repositório zai-org/GLM-5.2. Esse número de downloads mostra que a comunidade de auto-hospedagem já testou bastante o modelo.
Recursos. Pesos MIT com um contexto de 1M e uma saída máxima de 128K, depois entrada em cache a $0,26, com armazenamento de cache listado como gratuito por enquanto. A Z.ai também vende uma via de assinatura. O Coding Plan começa em $18 por mês, com desconto para $12,60, e traz 10.000 créditos por semana.
A Z.ai publica sua própria curva de nível de esforço, e olhar para ela vale mais do que aceitar a pontuação de destaque ao pé da letra:

Vantagens. O GLM-5.2 custa o que o GLM-5.1 custava, $1,40 e $4,40, e enquanto isso a janela de contexto foi de 200K para 1M. Um upgrade de graça, sem mais nem menos. Uma licença MIT sem cláusula de receita também vale mais do que um ou dois pontos de benchmark quando você está lançando isso dentro de um produto.
Desvantagens. Esse teto de saída de 128K é o mais apertado entre as opções de pesos abertos aqui, contra os 384K do DeepSeek. Os créditos do Coding Plan são consumidos a 3x no horário de pico e 2x fora dele, com a tarifa fora de pico temporariamente em 1x até o final de setembro, então as contas da assinatura precisam de atenção.
Preços. $1,40 de entrada, $4,40 de saída, $0,26 em cache. Existem irmãos mais baratos se você puder viver com menos. GLM-4.7 e GLM-4.6 estão ambos a $0,60 e $2,20, enquanto o GLM-4.7-FlashX está a $0,07 e $0,40.
Minha opinião: a melhor relação licença-capacidade da lista. Se sua equipe jurídica já perguntou o que acontece no dia em que um fornecedor muda os termos, aponte para esta linha.
4. MiniMax M3
Melhor para: igualar o preço exato do Inkling-Small enquanto adiciona entrada de vídeo.
Este é um empate direto de preço, e isso torna a comparação incomumente clara. Abaixo de 512K de entrada, o MiniMax M3 cobra $0,30 de entrada e $1,20 de saída, idêntico à tarifa do fornecedor original do Inkling-Small, saindo de um modelo de 428B com 23B ativos. O que deixa você escolhendo com base em tudo, exceto o custo.
Recursos. Um contexto de 1M com 512K garantido como mínimo, leituras de cache a $0,06, e entrada de texto mais imagem mais vídeo chegando por meio de partes de conteúdo image_url e video_url. O modo de pensamento custa o mesmo ligado ou desligado. Os pesos estão disponíveis no Hugging Face em MiniMaxAI/MiniMax-M3, com 170.353 downloads até agora.
Vantagens. Quase o dobro dos parâmetros ativos do Inkling-Small pelo mesmo dinheiro, e entrada de vídeo por cima, algo que mais nenhum modelo nesse preço na lista oferece. A página de preços rotula a tarifa atual como "50% de desconto permanente", e nenhuma data de expiração está impressa em lugar nenhum.
Desvantagens. A licença é a verdadeira pegadinha aqui. A MINIMAX COMMUNITY LICENSE é não comercial por padrão, o uso comercial exige um crédito visível de "Built with MiniMax M3", e além de $20 milhões de receita anual você precisa de autorização por escrito. Ao passar de 512K de entrada, ambas as tarifas dobram, então $0,60 e $2,40. Também existe um nível Priority, a 1,5x, se a fila mais rápida valer a pena para você.
Preços. $0,30 e $1,20 até 512K de entrada, depois $0,60 e $2,40 acima disso, leituras de cache a $0,06. O Priority roda a $0,45 e $1,80, ou $0,90 e $3,60 depois do limite.
Minha opinião: bom motor, licença que você precisa se sentar para ler. Uma startup abaixo da linha de receita, feliz em exibir o crédito, consegue mais modelo por dólar aqui do que no que está deixando.
5. Kimi K3
Melhor para: trabalho de agente de longo prazo onde a execução importa mais do que o preço do token.
O Kimi K3 é um salto muito maior do que qualquer coisa acima dele, e em sua própria documentação de preços a Moonshot o chama de carro-chefe para "codificação de longo prazo e trabalho de conhecimento de ponta a ponta". Com 2,8 trilhões de parâmetros servidos em mxfp4 de 4 bits, é também o maior modelo aqui cujos pesos você pode baixar.
Recursos. Um contexto de 1.048.576 tokens, raciocínio sempre ativo por trás de uma configuração reasoning_effort de low, high ou max (sendo max o padrão), e um repositório moonshotai/Kimi-K3 sem restrições. A busca web é cobrada separadamente, $0,005 por chamada bem-sucedida.
Vantagens. Pesos abertos nessa escala é raro. A taxa de acerto de cache de $0,30 contra $3,00 de entrada em erro de cache também é uma economia de 10x sempre que o contexto se repete. E a faixa intermediária é coberta por irmãos mais baratos, com o kimi-k2.7-code a $0,95 e $4,00.
Desvantagens. Duas pegadinhas operacionais aqui, e ambas mordem. O K3 não é suportado no nível batch, então o desconto de 60% que outros modelos Kimi recebem não chega até ele. O sistema de níveis também é limitado por gasto: o nível 0, com $1 de recarga acumulada, permite 1 requisição simultânea e 3 requisições por minuto, subindo para 1.000 simultâneas e 10.000 RPM ao atingir o nível 5 com $3.000. A licença parece ter o formato MIT, mas depois adiciona uma cláusula exigindo um acordo separado para negócios de modelo como serviço acima de $20 milhões de receita em qualquer período de doze meses consecutivos.
Preços. $3,00 de entrada e $15,00 de saída, com $0,30 em um acerto de cache. A 12,5x a tarifa de saída do Inkling-Small, ninguém deveria confundir isso com uma mudança lateral. As tabelas completas de níveis estão em preços do Kimi K3.
Minha opinião: a escolha quando a carga é uma execução longa de agente em vez de milhares de respostas curtas. Para tráfego em formato de ticket, justificá-lo contra o GLM-5.2 a um terço do preço fica difícil.
6. Qwen3.8-Max
Melhor para: um modelo fechado com uma janela de fato generosa e uma cota de teste gratuita.
O Qwen3.8-Max é aonde você chega quando decide que pesos abertos não são o ponto e o nível comercial máximo da Alibaba é. A surpresa agradável na página de faturamento é que o Max finalmente eliminou as faixas de comprimento de entrada. Uma única faixa, cobrindo toda a janela de um milhão de tokens.
Recursos. Um contexto de 1M, saída máxima de 131K e raciocínio máximo de 262K, com TPM de 2 milhões contra RPM de 15.000. O cache implícito custa $0,25. Também há uma cota gratuita de 1 milhão de tokens, válida por 90 dias.
Vantagens. A ausência de faixas por comprimento de entrada é uma mudança maior do que parece. A regra de faixas da Alibaba funciona no tudo ou nada, então no antigo qwen3-max, cruzar um limite refazia o preço da requisição inteira, e um prompt de 33K tokens saltava de $1,20 para $2,40 na entrada. Aqui essa armadilha desapareceu. O milhão de tokens gratuitos também te dá margem real para avaliar direito.
Desvantagens. Um único ID de modelo, dois preços, dependendo do escopo de implantação: $2,00 e $6,00 nas tabelas International e Singapore, $1,65 e $4,951 nas tabelas Global. Uma diferença de 18% sem nenhuma diferença de comportamento por trás é confusa para orçar. A cota gratuita é exclusiva de Singapura, seu relógio não pausa por inatividade, e o que sobra é anulado no vencimento. O batch dá 50% de desconto, mas não se acumula com os descontos de cache. O Max também é fechado, e os pesos publicados do Qwen estão duas gerações atrás, o mais recente datado de 24/04/2026.
Preços. $2,00 de entrada e $6,00 de saída em International e Singapore, depois $1,65 e $4,951 em Global. A criação explícita de cache custa $2,50, que é 125% da entrada. Os detalhes completos estão em nosso artigo sobre preços do Qwen3.8-Max, e há o apanhado de alternativas ao Qwen3.8-Max se você estiver comprando na outra direção.
Minha opinião: sólido, e um pouco caro demais contra o GLM-5.2, que pede menos e te entrega os pesos. A cota gratuita ainda é um motivo para experimentá-lo.
7. Gemini 3.6 Flash
Melhor para: entrada de áudio e mídia mista sem pagar um adicional de mídia.
Você estava no Inkling-Small especificamente pela entrada de áudio? Então este é o substituto mais próximo com um nível de serviço real por trás. O Gemini 3.6 Flash cobra uma única tarifa de entrada fixa de $1,50 cobrindo texto, imagem, vídeo, áudio e PDF, e isso quebra um padrão que o próprio Google havia estabelecido. No Gemini 2.5 Flash, a entrada de áudio custava $1,00 contra $0,30 do texto, e no 2.0 Flash o múltiplo chegava a 7x.
Recursos. 1.048.576 tokens de entrada contra 65.536 de saída, cache a $0,15 por milhão mais $1,00 por milhão por hora de armazenamento, com os níveis Batch e Flex ambos pela metade do preço, $0,75 e $3,75.
Vantagens. A tarifa de mídia fixa é o destaque aqui, e um nível Batch a $0,75 e $3,75 torna o trabalho em massa acessível. A página de preços do Google o lista como estável em vez de prévia, e isso importa se isso for se aproximar de clientes.
Desvantagens. Esse teto de saída de 65.536 é o mais apertado aqui, então gerações longas precisam ser divididas em partes. A cobrança de cache baseada em armazenamento funciona como um medidor contínuo em vez de uma cobrança única, diferente das tarifas fixas de leitura de cache em outros lugares. Os pesos são fechados, então não há auto-hospedagem. O grounding no Gemini 3.x também não está disponível no nível gratuito, o que significa que avaliar custa dinheiro.
Preços. O padrão é $1,50 de entrada e $7,50 de saída, Batch ou Flex $0,75 e $3,75, Priority $2,70 e $13,50. Onde o orçamento é a restrição, o Gemini 3.5 Flash-Lite chega a $0,30 e $2,50, e também não tem divisão de áudio. A escada completa está em preços do Gemini 3.6 Flash.
Minha opinião: a escolha para áudio. Também o único modelo aqui para o qual eu enviaria mídia mista em volume sem pensar duas vezes.
8. Claude Opus 5
Melhor para: os casos em que uma resposta errada dita com confiança custa dinheiro real.
Esta é a extremidade mais distante da escada, e um motivo para colocá-la na lista. Ela responde ao problema específico que o Inkling-Small tem. O Claude Opus 5 custa $5,00 de entrada e $25,00 de saída, cerca de 21x a tarifa de saída do Inkling-Small, e você compra isso quando a desvantagem de uma resposta errada supera a conta de tokens.
Recursos. O contexto completo de 1M no preço padrão, com nenhum nível de sobretaxa para contexto longo, o que é raro. A documentação de preços da Anthropic detalha isso: uma requisição de 900 mil tokens é cobrada na mesma tarifa por token que uma de 9 mil. As leituras de cache custam $0,50. A API Batch aplica um desconto fixo de 50% em ambos os lados, $2,50 e $12,50, e se acumula com o cache.
Vantagens. Sem um penhasco de comprimento de contexto, uma categoria inteira de surpresas de faturamento desaparece. O pensamento estendido não tem preço separado e é cobrado como saída padrão. O batch junto com o cache também reduz bastante cargas pesadas e repetidas em relação ao preço de etiqueta.
Desvantagens. Em qualquer comparação de custo, o tokenizador é a armadilha. A Anthropic observa que o Claude 4.7 e versões posteriores "produzem aproximadamente 30% mais tokens para o mesmo texto" do que o tokenizador mais antigo, então esse rótulo de $25,00 subestima a diferença real por tarefa contra um rival que ainda usa um tokenizador mais antigo. O modo rápido dobra ambos os lados para $10,00 e $50,00, funciona apenas na API do fornecedor original e não se acumula com o Batch. Os pesos são fechados.
Preços. Padrão $5,00 e $25,00, Batch $2,50 e $12,50, modo rápido $10,00 e $50,00, leitura de cache $0,50. A opção mais barata é o Sonnet 5 a $2,00 e $10,00 até 31 de agosto de 2026, que muda para $3,00 e $15,00 em 1 de setembro. Quando essa diferença vale a pena pagar é abordado em nossa comparação Opus 5 versus Sonnet 5.
Minha opinião: exagero para a maior parte do tráfego de tickets, exatamente certo para os 5% que envolvem dinheiro, política ou um contrato. Direcione pelo tipo de pergunta em vez de escolher um único modelo para tudo.
A escada de preços, em uma imagem
Coloque os oito lado a lado pelo preço de saída, e a forma da decisão fica óbvia.

O Inkling-Small já está próximo do fundo. Existe exatamente um passo significativo para baixo, o DeepSeek V4 Flash a $0,28, mais um movimento lateral ao mesmo preço no MiniMax M3. Tudo o mais aqui é um passo para cima, e o que um passo para cima compra nunca é velocidade.
Vale a pena fazer a conta do que qualquer um disso custa em volume de tickets. Considere mil tickets em um mês, e conte 2.000 tokens de saída por resposta, o que é generoso para uma resposta de suporte. Então 2 milhões de tokens de saída.
| Modelo | Custo de saída, 2M tokens | Contra o Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | $0,56 | $1,84 mais barato |
| Inkling-Small | $2,40 | base |
| MiniMax M3 | $2,40 | idêntico |
| GLM-5.2 | $8,80 | $6,40 mais |
| Inkling | $8,10 | $5,70 mais |
| Gemini 3.6 Flash | $15,00 | $12,60 mais |
| Kimi K3 | $30,00 | $27,60 mais |
| Claude Opus 5 | $50,00 | $47,60 mais |
Nesse volume, toda a diferença entre o mais barato e o mais caro é de cerca de $50 por mês. Uma única escalação mal tratada custa mais do que isso. Que é o verdadeiro argumento para subir a escada, e também por que a escolha do modelo não é onde está a maior alavancagem.
O que nenhum destes resolve em uma fila de suporte
Nenhuma das oito linhas acima resolve a próxima parte, e é por isso que continuo insistindo quando alguém me diz que encontrou um modelo mais barato.
Já vi essa falha exata acontecer em contas pagantes. Um modelo não para quando a recuperação volta vazia. Ele preenche a lacuna com o que aprendeu no treinamento. Um cliente, um provedor dinamarquês de energia solar, teve o bot dele inventar alegações de assinatura e enviá-las a clientes reais. Outro fez uma pergunta ao bot e recebeu "Oxigênio (tabela periódica)" de volta. Nenhum dos casos foi um modelo ruim. Ambos foram um modelo sem nada contra o que se ancorar, e nada para impedi-lo de adivinhar.
Um gerente de suporte em nossas contas colocou a mesma preocupação em termos mais diretos, dizendo à IA o que ela não deveria fazer:
"pare de dizer aos clientes que vamos resolver isso pra eles. Você não sabe disso"
Um gerente de suporte de e-commerce, preocupado com um bot prometendo demais nas datas de entrega. O mesmo tipo de problema. O modelo parece seguro, e esse parecer seguro é a parte perigosa. O próprio detalhamento AA-Briefcase do Inkling-Small diz isso sem rodeios: 270,86 pontos Elo melhor apresentando do que analisando.

Um modelo maior não é a solução. Duas coisas com as quais nenhum modelo vem equipado são. Primeiro o grounding, para que a resposta saia da sua central de ajuda e dos seus tickets anteriores em vez da memória paramétrica. Depois um limite de confiança, para que tudo abaixo da barra vá para uma pessoa em vez de sair. Essas duas coisas transformam um motor bruto em algo que você pode apontar para uma fila em tempo real, e são o assunto inteiro da prevenção de alucinações de IA.
O outro motivo pelo qual as pessoas deixam de comparar modelos é mais mundano do que isso. Um desenvolvedor com quem falamos, montando uma base de conhecimento de incidentes de TI, já tinha dado a volta completa. Ele testou a API de um fornecedor e achou muito cara, testou outra e achou pouco confiável, e no fim só queria algo que funcionasse. Comparar modelos é divertido. Manter uma camada de modelo não é.
Experimente o eesel
Se o modelo que você está escolhendo vai responder perguntas de clientes, o conselho honesto vem em duas partes. Escolha o que dos oito acima se encaixa no seu orçamento e na sua licença. Depois não construa você mesmo a camada acima dele.
Essa camada é o que o eesel é. Ele se conecta ao Zendesk, Freshdesk ou qualquer outra coisa que você já use, aprende com seus tickets resolvidos anteriores e sua central de ajuda em vez dos dados de treinamento de um modelo, e só responde depois de passar um limite de confiança que você mesmo define. Tudo abaixo disso escalona. E antes de tocar no tráfego real, você pode simulá-lo contra o seu próprio histórico de tickets, é assim que você aprende o que ele teria errado antes que um cliente descubra.

Coloco nossa própria taxa de erro factual medida de 7% no topo em vez de escondê-la, porque esse é o número que importa enquanto você escolhe um modelo. Ela veio do tráfego real do Zendesk de uma joalheria alemã, cerca de mil tickets por mês, validada de forma cruzada em 284 conversas e 100 tickets, com recuperação sobre a central de ajuda real deles. O grounding não vai te levar a zero. Ele te dá um número que você pode medir, aplicar um limite e depois melhorar, e isso é uma categoria de coisa diferente de um modelo adivinhando com confiança.
O posicionamento comercial deliberadamente não é por assento. A cobrança é feita por ticket resolvido, então os preços acompanham o trabalho feito, não o quadro de funcionários. Gratuito para testar. Se você preferir verificar os números primeiro, o guia de deflexão de tickets é um bom ponto de partida.
Minha opinião
O Inkling-Small é um bom modelo pequeno a quem continuam pedindo para fazer um trabalho para o qual não foi feito. Ele executa bem e a um preço já perto do fundo, e sua confiabilidade de conhecimento mede -9,0. Esses dois fatos não estão em tensão. Juntos, eles descrevem uma ferramenta.
Está saindo pelo custo? Escolha o DeepSeek V4 Flash e está resolvido. Se as respostas erradas são o que está te empurrando para fora, suba para o Inkling pai pela solução barata, ou para o Claude Opus 5 pela cara, e entre sabendo que nenhuma das duas te leva a zero.
E se o motivo é a janela de contexto não corresponder à ficha, o GLM-5.2 entrega o que anuncia, sob MIT. Essa é a linha que eu escolheria se fosse forçado a ficar com uma só.
O veredito honesto sobre os oito, porém, continua o mesmo. Trocar de motor move sua conta e suas pontuações de benchmark. Não muda o que acontece quando um cliente pergunta algo que sua documentação nunca respondeu. Fechar essa lacuna exige recuperação, um limite de confiança, um handoff. Nenhum upgrade de modelo faz isso por você, e vale a pena resolver isso antes de gastar mais uma tarde lendo benchmarks de classificação de tickets com IA.
Perguntas frequentes
Quais são as melhores alternativas ao Inkling-Small?
Existe uma alternativa mais barata ao Inkling-Small?
Por que trocar o Inkling-Small por outra opção?
O Inkling-Small realmente tem uma janela de contexto de 1M?
Qual alternativa ao Inkling-Small tem a melhor licença aberta?
Quanto custa executar uma alternativa ao Inkling-Small em tickets de suporte?
Posso hospedar eu mesmo uma alternativa ao Inkling-Small em vez de pagar por token?
O Inkling-Small é bom o suficiente para atendimento ao cliente por conta própria?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







