8 melhores alternativas ao Inkling-Small em 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Um modelo pequeno posto de lado enquanto cinco modelos alternativos captam a luz

Por que as pessoas já estão olhando além do Inkling-Small

A Thinking Machines Lab lançou o Inkling-Small em 30-07-2026 sob Apache 2.0, quinze dias depois do modelo pai. A proposta era razoável e o modelo realmente entrega. Um quarto do tamanho do pai e mais rápido, além de mais barato, e segundo a própria ficha do fornecedor ele até supera o pai no SWE-bench Verified, 80,2 contra 77,6.

A recepção no r/LocalLLaMA teve algo a dizer sobre essa palavra "small". O terceiro comentário mais votado no tópico de lançamento nem trata de benchmarks:

Reddit

"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"

Justo. Mas o nome não é o que afasta ninguém do modelo. O que ele sabe, sim.

A Artificial Analysis o coloca em um Intelligence Index de 40, posição #15 de 101, o que já é bem respeitável. Depois a mesma página traz o teste de conhecimento AA-Omniscience: um índice de -9,0, precisão de 30,5%, taxa de alucinação de 56,9%. A AA descreve essa avaliação como uma medida de "confiabilidade de conhecimento e alucinação" numa faixa de -100 a 100. Então um número negativo ali não é nenhum artefato de arredondamento. É o modelo alcançando uma resposta que ele não tem.

O detalhamento do AA-Briefcase é a parte para a qual eu sempre volto. Elo geral de 917,13, que diz pouco até você dividir: apresentação de 1067,99 contra qualidade analítica de 797,13. O modelo escreve uma resposta melhor do que realmente sabe.

Quem roda esses modelos no próprio hardware percebeu isso rápido, e num eixo mais afiado do que o das tabelas de benchmark:

Reddit

"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."

Esse número de 84% é mais alto que os 56,9% que aparecem hoje na página da AA, então trate o número exato como a leitura deles, não a minha. De todo modo o ponto se sustenta, e é o ponto certo a ser feito. Eles estão escolhendo um modelo por saber quando não sabe, em vez de por quão bem ele escreve código.

Three reasons teams leave Inkling-Small, each pointing at a different replacement model
Three reasons teams leave Inkling-Small, each pointing at a different replacement model

Outras três coisas afastam as pessoas dele. Preço não está entre elas.

A janela de contexto não é a janela de contexto. A AA lista o modelo em 1M tokens. O que seus dois provedores realmente entregam é 256.000 (Thinking Machines) e 524.288 (DeepInfra). Então quem leu "1M" na ficha e construiu em cima desse número não está recebendo isso. Mesmo problema no modelo pai, onde o melhor valor servido é 524k entre três provedores e a linha mais barata e rápida da DeepInfra tem teto de 131k.

Dois provedores é pouco. O pai tem três, e o grupo que serve DeepSeek ou GLM é ainda maior. No dia do lançamento o modelo nem estava no OpenRouter, uma lacuna que um comentarista apontou no Hacker News junto com as contagens de parâmetros. Os dois provedores que você de fato tem também se comportam de forma diferente. A DeepInfra roda 1,43x mais rápido numa carga de 10k, depois fica atrás do provedor original em 100k, 82,36 tokens por segundo contra 113,36. Seu perfil de latência muda conforme o tamanho do prompt, e isso é uma coisa horrível de descobrir em produção.

Cobertura escassa também deixa menos espaço para trocar de provedor quando um deles começa a cortar custos, o que acontece mais do que os benchmarks publicados deixam transparecer:

Hacker News

"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."

O preço não é um único número. O provedor original está em $0,30 de entrada e $1,20 de saída. A DeepInfra pede $0,58 e $1,44 pelo contexto mais longo. Em mistura, a AA mostra $0,222 na proporção padrão de 7:2:1, enquanto a mistura clássica 3:1 chega a $0,525. Então, seja qual for o número único que você acabar citando, isso é na verdade uma escolha sobre proporções, e essa escolha importa quando você está modelando o custo do atendimento ao cliente com IA em volume.

Para ser justo, nada disso soma um modelo ruim. O raciocínio consome 95,5% da conta de saída, exatamente de onde vem a inteligência, e GPQA Diamond em 89,5% mais raciocínio de contexto longo em 63% são números reais. A coisa é uma executora. O problema só começa quando você pede a uma executora que seja uma conhecedora.

Como escolhi esses oito

Escrevo muitos desses apanhados e a armadilha nunca muda. Rankear por benchmark, publicar, seguir em frente. Então mantive o filtro aqui mais restrito.

Cada um dos oito precisava ser algo para o qual um usuário do Inkling-Small pudesse migrar ainda esta semana, ou seja, uma API pública ativa com preços publicados, sem listas de espera. Cada preço veio da própria página de cobrança do fornecedor em 05-08-2026, não de um site comparador, porque os números desses ficam desatualizados em duas semanas. Onde um provedor publica tanto o contexto servido quanto o anunciado, conferi um contra o outro. As licenças também li, e isso importou, porque dois modelos aqui têm limites de receita escondidos nas suas.

O que eu não fiz foi fingir que seis meses de tráfego de produção passaram pelos oito. Li a documentação e as páginas de cobrança, as fichas dos modelos, as medições da AA, e depois disse apenas o que isso sustenta.

As melhores alternativas ao Inkling-Small de relance

Todos os preços abaixo são por milhão de tokens em USD, conferidos em 05-08-2026.

ModelBest forWeightsParamsInputOutputReal contextModalities inThe catch
Inkling-Small (baseline)Cheap agentic executionApache 2.0276B / 12B active (266B per AA)$0.30$1.20256K first-party, 524,288 on DeepInfraText, image, audioKnowledge index -9.0
DeepSeek V4 FlashSame job, a quarter the costMIT284B / 13B$0.14$0.281MTextA 2x peak surcharge is announced
InklingStaying in the family, knowing moreApache 2.0975B / 41B$1.00$4.05524K best, 131K cheapestText, image, audioTwo AA pages quote different prices
GLM-5.2Strongest open weights you can hostMIT~753B total$1.40$4.401MText128K output cap
MiniMax M3Video in, at Inkling-Small's priceCustom community licence428B / 23B$0.30$1.201M, 512K guaranteedText, image, videoNon-commercial by default
Kimi K3Long-horizon agent workCustom (Kimi K3 Licence)2.8T$3.00$15.001,048,576TextNo batch tier, 3 RPM on entry tier
Qwen3.8-MaxClosed model, generous windowClosedUndisclosed$2.00$6.001MTextTwo prices for one model
Gemini 3.6 FlashAudio in with no premiumClosedUndisclosed$1.50$7.501,048,576Text, image, video, audio, PDF65,536 output ceiling
Claude Opus 5When wrong answers cost moneyClosedUndisclosed$5.00$25.001M, no surchargeText, imageNewer tokenizer emits ~30% more tokens

Qual alternativa ao Inkling-Small combina com o seu motivo para trocar?

Escolha a frase que mais parece com a sua semana.

Vá com Claude Opus 5, ou o Inkling pai se o orçamento for apertado

$5.00 / $25.00Opus 5, por 1M de tokens $1.00 / $4.05Inkling, por 1M de tokens 2.05 vs -9.0Inkling vs Small, AA-Omniscience

O índice de conhecimento do Inkling-Small é negativo e o do pai é positivo, então o conserto real mais barato é subir um degrau dentro da mesma família: mesma licença, mesmas ferramentas, cerca de 3,4x o preço de saída. O Opus 5 custa bem mais e é para quando uma resposta errada significa reembolso, um problema de conformidade ou um cliente perdido.

Nenhum modelo desta lista chega a zero. Fundamentar nos seus próprios documentos mais uma barreira de confiança faz mais pela precisão do que qualquer upgrade aqui.

Vá com DeepSeek V4 Flash

$0.14 / $0.28por 1M de tokens 4,3xmais barato em saída que o Inkling-Small MITlicença sobre os pesos

Acertos de cache caem para $0,0028 por milhão, 50 vezes abaixo da própria taxa de erro de cache, então uma carga de trabalho repetitiva fica muito barata muito rápido. Pesos MIT, contexto de 1M, 2.500 requisições simultâneas segundo os limites publicados. O MiniMax M3 é o vice, com exatamente a tarifa do Inkling-Small e entrada de vídeo de brinde.

A DeepSeek anunciou uma sobretaxa de 2x em horários de pico, das 09h00 às 12h00 e das 14h00 às 18h00, horário de Pequim. Ainda sem data de início, então modele seu pico contra a tarifa dobrada.

Vá com DeepSeek V4 Flash ou GLM-5.2

1Mservido, ambos os modelos 256KInkling-Small, provedor original 384K / 128Ksaída máxima, DeepSeek / GLM

Ambos anunciam uma janela de 1M e ambos realmente a entregam, que é a diferença que importa. O GLM-5.2 custa o mesmo que o GLM-5.1 custava com 200K, então a janela veio de graça. Ainda assim, fique de olho nos tetos de saída: o DeepSeek permite 384K de saída, o GLM tem teto de 128K.

Contexto longo e raciocínio de contexto longo são coisas diferentes. O Inkling-Small marca apenas 63% no teste de raciocínio de contexto longo da AA, então uma janela maior sozinha não vai resolver um problema de memória.

Vá com Kimi K3, ou Gemini 3.6 Flash se precisar de áudio

$3.00 / $15.00Kimi K3, por 1M $1.50 / $7.50Gemini 3.6 Flash, por 1M 2,8Tparâmetros do Kimi K3

O Kimi K3 foi feito para execuções de agente de longo alcance e seus pesos são públicos, com 2,8 trilhões de parâmetros em 4 bits. O Gemini 3.6 Flash cobra uma única tarifa de entrada plana para texto, imagem, vídeo, áudio e PDF, o que é incomum e útil se suas entradas forem variadas.

O Kimi K3 não tem nível de lote e o nível de gasto inicial permite 3 requisições por minuto. Confira os limites de taxa contra o seu tráfego antes de se comprometer.

1. DeepSeek V4 Flash

Best for: fazer o que o Inkling-Small faz, por cerca de um quarto do custo de saída.

DeepSeek's free web chat interface, as taken from DeepSeek

Essa é a comparação que um usuário real do Inkling-Small busca primeiro, e também foi o comentário mais substancial no tópico de lançamento no r/LocalLLaMA:

Reddit

"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."

É esse o formato da coisa. O DeepSeek V4 Flash roda com 284B no total e 13B ativos, ao lado dos 12B do Inkling-Small, e a AA coloca os dois em 40. Motor parecido. Conta não tão parecida.

Há uma coisa que as contagens de parâmetros escondem, e ela importa se hospedar você mesmo estiver na sua lista. O DeepSeek é distribuído nativamente em uma mistura de FP4 e FP8, enquanto o Inkling-Small é distribuído em bf16, então, em precisão nativa, um operador local os estimou em cerca de 160GB contra 540GB. No papel, tamanho parecido. Na prática, o triplo de memória.

Features. Pesos com licença MIT no Hugging Face, além de uma janela de contexto de 1M e uma saída máxima de 384K, a maior desta lista por larga margem. A limitação de taxa funciona por concorrência em vez de requisições por minuto, com o teto publicado em 2.500 requisições simultâneas por conta.

Pros. A economia de cache é a verdadeira história aqui. Um acerto de cache custa $0,0028 por milhão de tokens de entrada, 50x abaixo da taxa de erro de cache de $0,14, então qualquer coisa com um prompt de sistema estável fica absurdamente barata. E MIT é a licença mais limpa do grupo, sem limite de receita, sem cláusula de atribuição.

Cons. Apenas texto, então qualquer áudio que você desse ao Inkling-Small não tem para onde ir. Também há uma nota na página de preços anunciando uma futura sobretaxa de 2x em horários de pico das 09h00 às 12h00 e das 14h00 às 18h00, horário de Pequim, com data efetiva "sujeita ao anúncio oficial". Uma incógnita conhecida, sentada dentro do seu modelo de custos.

Pricing. $0,14 de entrada e $0,28 de saída por milhão, acertos de cache a $0,0028. O Pro fica em $0,435 e $0,87, exatamente 3,1x o Flash nos dois lados. Os exemplos calculados estão no nosso detalhamento de preços do DeepSeek V4 Flash, e o testamos contra o Kimi K3 separadamente.

My take: se dinheiro é o seu motivo para sair, pare de ler aqui. Se é precisão, continue, porque ficar mais barato nunca fez um modelo saber mais.

2. Inkling, the parent

Best for: ficar nos mesmos pesos, ferramentas e licença enquanto recompra a recuperação factual.

Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth
Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth

Muitas vezes a alternativa mais interessante a um modelo pequeno é o grande do qual ele foi destilado, e aqui os números provam isso com clareza. Sob a mesma metodologia da AA, o Inkling pontua 41 no Intelligence Index contra 40 do Small, ou seja, praticamente empate. É no AA-Omniscience que eles se separam: 2,05 com 39,95% de precisão, contra -9,0 e 30,5%. Quase um terço a mais de perguntas voltam corretas.

Features. 975B no total com 41B ativos em 66 camadas, Apache 2.0, e texto mais imagem mais áudio na entrada. Três provedores de serviço agora, onde o lançamento tinha um, sendo eles DeepInfra, Together AI e Thinking Machines.

Pros. Mesma licença, mesma família, então a migração é basicamente trocar uma string de modelo. A linha FP8 da DeepInfra é rápida, 201,5 tokens por segundo, e o custo por tarefa de Intelligence Index ali sai a $0,4296, barato para essa categoria.

Cons. Duas páginas da AA divergem atualmente no preço, então convém saber qual delas você está citando. A página do modelo diz $1,87 de entrada e $4,68 de saída. Todas as linhas de provedores dizem $1,00 e $4,05. Esses valores de provedor se mantêm internamente consistentes nos três, então esse é o par com o qual eu planejaria. O contexto servido também é bagunçado. É 524k no melhor caso, e a linha barata e rápida da DeepInfra tem teto em 131k, ou 13,1% do milhão anunciado.

Pricing. Segundo os dados dos provedores, $1,00 de entrada e $4,05 de saída, com $0,17 por acerto de cache e $0,724 em mistura. Chame de 3,4x a tarifa de saída do Small. Se é o pai que você está buscando, o artigo de alternativas ao Inkling cobre a lista mais ampla.

My take: a escolha óbvia, e a que a maioria das pessoas pula, porque "fazer upgrade para o irmão maior" parece admitir que o pequeno foi um erro. Não foi. Era só a ferramenta errada para um trabalho de conhecimento.

3. GLM-5.2

Best for: os pesos abertos mais fortes desta lista que você consegue hospedar de forma realista.

GLM-5.2's launch material from Z.ai, as taken from Z.ai

O GLM-5.2 é o degrau acima que mantém você dentro do território de licença MIT. Cerca de 753B de parâmetros no total, com um contexto de 1M que sua API realmente entrega, e 2,23 milhões de downloads no repositório zai-org/GLM-5.2. Esse número de downloads mostra que a comunidade de auto-hospedagem já testou bastante o modelo.

Features. Pesos MIT com contexto de 1M e saída máxima de 128K, depois entrada em cache a $0,26, com armazenamento de cache listado como gratuito por enquanto. A Z.ai também vende um caminho por assinatura. O Coding Plan começa em $18 por mês, com desconto para $12,60, e traz 10.000 créditos por semana.

A Z.ai publica sua própria curva de nível de esforço, e olhar para ela vale mais do que aceitar a pontuação de manchete pelo valor de face:

Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai
Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai

Pros. O GLM-5.2 custa o mesmo que o GLM-5.1 custava, $1,40 e $4,40, e enquanto isso a janela de contexto foi de 200K para 1M. Um upgrade gratuito, sem enrolação. Uma licença MIT sem cláusula de receita também vale mais do que um ou dois pontos de benchmark quando você está lançando isso dentro de um produto.

Cons. Esse teto de saída de 128K é o mais apertado entre as opções de pesos abertos aqui, contra os 384K do DeepSeek. Os créditos do Coding Plan queimam a 3x no pico e 2x fora do pico, com o fora do pico temporariamente em 1x até o fim de setembro, então as contas da assinatura precisam de atenção.

Pricing. $1,40 de entrada, $4,40 de saída, $0,26 em cache. Existem irmãos mais baratos se você conseguir viver com menos. GLM-4.7 e GLM-4.6 ficam ambos em $0,60 e $2,20, enquanto o GLM-4.7-FlashX está em $0,07 e $0,40.

My take: a melhor troca licença-capacidade da lista. Se a sua equipe jurídica já perguntou o que acontece no dia em que um fornecedor muda os termos, aponte para esta linha.

4. MiniMax M3

Best for: igualar exatamente o preço do Inkling-Small e ainda adicionar entrada de vídeo.

The MiniMax M3 model page, as taken from MiniMax

Esse aqui é um empate de preço direto, e isso torna a comparação incomumente limpa. Abaixo de 512K de entrada, o MiniMax M3 cobra $0,30 de entrada e $1,20 de saída, idêntico à tarifa de provedor original do Inkling-Small, saindo de um modelo de 428B com 23B ativos. O que deixa você escolhendo por tudo, menos o custo.

Features. Um contexto de 1M com 512K garantidos como mínimo, leituras de cache a $0,06, e texto mais imagem mais vídeo na entrada, chegando por partes de conteúdo image_url e video_url. O modo de pensamento custa o mesmo ligado ou desligado. Os pesos estão no Hugging Face em MiniMaxAI/MiniMax-M3, com 170.353 downloads até agora.

Pros. Quase o dobro dos parâmetros ativos do Inkling-Small pelo mesmo dinheiro, e entrada de vídeo de quebra, algo que nada mais nesse preço nesta lista oferece. A página de preços rotula a tarifa atual como "Permanent 50% off", e nenhuma data de expiração está impressa em lugar nenhum.

Cons. A licença é a verdadeira pegadinha aqui. A MINIMAX COMMUNITY LICENSE é não comercial por padrão, o uso comercial pede um crédito visível "Built with MiniMax M3", e acima de $20M em receita anual você precisa de autorização por escrito. Passar de 512K de entrada dobra as duas tarifas, então $0,60 e $2,40. Também existe um nível Priority, a 1,5x, se a fila mais rápida valer a pena para você.

Pricing. $0,30 e $1,20 até 512K de entrada, depois $0,60 e $2,40 acima disso, leituras de cache a $0,06. O Priority fica em $0,45 e $1,80, ou $0,90 e $3,60 acima do limite.

My take: bom motor, licença que você precisa sentar e ler. Uma startup abaixo da linha de receita, disposta a colocar o crédito, consegue mais modelo por dólar aqui do que naquilo que está deixando para trás.

5. Kimi K3

Best for: trabalho de agente de longo alcance onde a execução importa mais do que o preço do token.

Kimi's chat interface, Moonshot AI's assistant and agent front end, as taken from Moonshot AI

O Kimi K3 é um salto muito maior do que qualquer coisa acima dele, e em sua própria documentação de preços a Moonshot o chama de carro-chefe para "codificação de longo alcance e trabalho de conhecimento de ponta a ponta". Com 2,8 trilhões de parâmetros servidos em 4 bits mxfp4, também é o maior modelo aqui cujos pesos podem ser baixados.

Features. Um contexto de 1.048.576 tokens, raciocínio sempre ativo por trás de uma configuração reasoning_effort de low, high ou max (max sendo o padrão), e um repositório moonshotai/Kimi-K3 sem restrições. A busca na web é cobrada separadamente, $0,005 por chamada bem-sucedida.

Pros. Pesos abertos nessa escala é incomum. A taxa de acerto de cache de $0,30 contra os $3,00 de entrada por erro de cache também é uma economia de 10x sempre que o contexto se repete. E a faixa intermediária é coberta por um irmão mais barato, o kimi-k2.7-code, a $0,95 e $4,00.

Cons. Há duas pegadinhas operacionais aqui, e as duas mordem. O K3 não é suportado no nível de lote, então o desconto de 60% no lote que outros modelos Kimi recebem não chega até ele. O sistema de níveis também é controlado por gasto: o Tier 0, com $1 de recarga acumulada, permite 1 requisição simultânea e 3 requisições por minuto, subindo para 1.000 simultâneas e 10.000 RPM ao atingir os $3.000 do Tier 5. A licença parece MIT à primeira vista, mas acrescenta uma cláusula exigindo um acordo separado para negócios de modelo como serviço acima de $20M de receita em quaisquer doze meses consecutivos.

Pricing. $3,00 de entrada e $15,00 de saída, com $0,30 num acerto de cache. A 12,5x a tarifa de saída do Inkling-Small, ninguém deveria confundir isso com um movimento lateral. As tabelas completas de níveis estão em preços do Kimi K3.

My take: a escolha para quando a carga de trabalho é uma longa execução de agente em vez de milhares de respostas curtas. Para tráfego no formato de tickets, justificá-lo contra o GLM-5.2 a um terço do preço fica difícil.

6. Qwen3.8-Max

Best for: um modelo fechado com uma janela verdadeiramente generosa e uma cota de teste gratuita.

Qwen's chat interface, Alibaba Cloud's assistant and API front end, as taken from Alibaba Cloud

O Qwen3.8-Max é onde você chega assim que decide que pesos abertos não são o ponto e que o nível comercial mais alto da Alibaba é. A surpresa boa na página de cobrança é que o Max finalmente abandonou as faixas por tamanho de entrada. Uma única faixa, cobrindo a janela inteira de um milhão de tokens.

Features. Um contexto de 1M, saída máxima de 131K e raciocínio máximo de 262K, com TPM de 2 milhões contra RPM de 15.000. O cache implícito custa $0,25. Também há uma cota gratuita de 1 milhão de tokens, válida por 90 dias.

Pros. Não ter faixas por tamanho de entrada é uma questão maior do que parece. No antigo qwen3-max, a regra de faixas da Alibaba funcionava no tudo ou nada, então cruzar um limite recobrava a requisição inteira, e um prompt de 33K tokens saltava de $1,20 para $2,40 na entrada. Aqui essa armadilha sumiu. O milhão de tokens gratuito também dá espaço real para avaliar direito.

Cons. Um único ID de modelo, dois preços, dependendo do escopo de implantação: $2,00 e $6,00 nas tabelas International e Singapore, $1,65 e $4,951 nas tabelas Global. Uma diferença de 18% sem nenhuma diferença de comportamento por trás é confusa para orçar. A cota gratuita é só para Singapore, seu relógio não pausa por inatividade, e o que sobrar é anulado na expiração. O lote tira 50%, mas não se acumula com descontos de cache. O Max também é fechado, e os pesos Qwen publicados estão duas gerações atrás, o mais novo datado de 24-04-2026.

Pricing. $2,00 de entrada e $6,00 de saída em International e Singapore, depois $1,65 e $4,951 em Global. A criação explícita de cache custa $2,50, que é 125% da entrada. O detalhe completo está no nosso post de preços do Qwen3.8-Max, e há o apanhado de alternativas ao Qwen3.8-Max se você estiver buscando na direção contrária.

My take: sólido, e um pouco caro demais frente ao GLM-5.2, que pede menos e ainda entrega os pesos. A cota gratuita continua sendo um motivo para experimentar.

7. Gemini 3.6 Flash

Best for: entrada de áudio e mídia mista sem pagar um prêmio pela mídia.

Google's Gemini web app, as taken from Google

Você estava no Inkling-Small especificamente pela entrada de áudio? Então este é o substituto mais próximo com um nível de serviço real por trás. O Gemini 3.6 Flash cobra uma única tarifa de entrada plana de $1,50 cobrindo texto, imagem, vídeo, áudio e PDF, e isso quebra um padrão que o próprio Google havia estabelecido. No Gemini 2.5 Flash, a entrada de áudio custava $1,00 contra $0,30 de texto, e no 2.0 Flash o múltiplo chegava a 7x.

Features. 1.048.576 tokens de entrada contra 65.536 de saída, cache a $0,15 por milhão mais $1,00 por milhão por hora de armazenamento, com os níveis Batch e Flex ambos pela metade do preço, $0,75 e $3,75.

Pros. A tarifa plana de mídia é o destaque aqui, e um nível Batch a $0,75 e $3,75 torna o trabalho em massa acessível. A página de preços do Google o lista como estável em vez de prévia, e isso importa se isso for chegar perto de clientes.

Cons. Esse teto de saída de 65.536 é o mais apertado aqui, então gerações longas precisam ser divididas em partes. A cobrança de cache baseada em armazenamento funciona como um medidor em vez de uma cobrança única, ao contrário das tarifas planas de leitura de cache em outros lugares. Os pesos são fechados, então não há auto-hospedagem. A fundamentação (grounding) no Gemini 3.x também não está disponível no nível gratuito, o que significa que avaliar custa dinheiro.

Pricing. O padrão é $1,50 de entrada e $7,50 de saída, Batch ou Flex $0,75 e $3,75, Priority $2,70 e $13,50. Onde o orçamento é a restrição, o Gemini 3.5 Flash-Lite entra a $0,30 e $2,50, e também não tem divisão de áudio. A escala completa está em preços do Gemini 3.6 Flash.

My take: a escolha para áudio. Também o único modelo aqui para o qual eu enviaria mídia mista em volume sem pensar duas vezes.

8. Claude Opus 5

Best for: os casos em que uma resposta confiante e errada custa dinheiro de verdade.

Claude's web app, as taken from Anthropic

Este é o extremo mais distante da escala, e um motivo o colocou na lista. Ele responde ao problema específico que o Inkling-Small tem. O Claude Opus 5 custa $5,00 de entrada e $25,00 de saída, cerca de 21x a tarifa de saída do Inkling-Small, e você compra isso quando a desvantagem de uma resposta errada supera a conta de tokens.

Features. O contexto completo de 1M no preço padrão, com nenhum nível de sobretaxa para contexto longo, o que é incomum. Os documentos de preços da Anthropic deixam isso claro: uma requisição de 900 mil tokens é cobrada na mesma tarifa por token que uma de 9 mil. Leituras de cache custam $0,50. A API Batch tira um plano de 50% dos dois lados, $2,50 e $12,50, e se acumula com o cache.

Pros. Sem um precipício de comprimento de contexto, uma categoria inteira de surpresa na fatura desaparece. O pensamento estendido não tem preço separado e é cobrado como saída padrão. Batch junto com cache também puxa cargas de trabalho pesadas e repetidas bem para baixo do preço de tabela.

Cons. Em qualquer comparação de custo, o tokenizador é a armadilha. A Anthropic observa que o Claude 4.7 e versões posteriores "produzem aproximadamente 30% mais tokens para o mesmo texto" do que o tokenizador mais antigo, então esse preço de tabela de $25,00 subestima a real diferença por tarefa contra um rival ainda usando um tokenizador mais antigo. O modo Fast dobra os dois lados para $10,00 e $50,00, funciona apenas na API do provedor original, e não se acumula com Batch. Os pesos são fechados.

Pricing. Padrão $5,00 e $25,00, Batch $2,50 e $12,50, modo Fast $10,00 e $50,00, leitura de cache $0,50. A parada mais barata é o Sonnet 5 a $2,00 e $10,00 até 31 de agosto de 2026, que passa para $3,00 e $15,00 em 1º de setembro. Quando vale a pena pagar essa diferença é abordado na nossa comparação Opus 5 versus Sonnet 5.

My take: exagero para a maior parte do tráfego de tickets, exatamente certo para os 5% que envolvem dinheiro, política ou contrato. Direcione por tipo de pergunta em vez de escolher um modelo para tudo.

The price ladder, in one picture

Coloque os oito lado a lado pelo preço de saída, e o formato da decisão fica óbvio.

Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range
Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range

O Inkling-Small já está perto do piso. Existe exatamente um degrau significativo abaixo, o DeepSeek V4 Flash a $0,28, mais um movimento lateral no mesmo preço com o MiniMax M3. Tudo o mais aqui é um degrau acima, e o que um degrau acima compra nunca é velocidade.

Vale a pena fazer a conta do que qualquer um desses custa em volume de tickets. Pegue mil tickets em um mês, depois considere 2.000 tokens de saída por resposta, o que é generoso para uma resposta de suporte. Então 2 milhões de tokens de saída.

ModelOutput cost, 2M tokensAgainst Inkling-Small
DeepSeek V4 Flash$0.56$1.84 cheaper
Inkling-Small$2.40baseline
MiniMax M3$2.40identical
GLM-5.2$8.80$6.40 more
Inkling$8.10$5.70 more
Gemini 3.6 Flash$15.00$12.60 more
Kimi K3$30.00$27.60 more
Claude Opus 5$50.00$47.60 more

Nesse volume, toda a diferença do mais barato ao mais caro é de cerca de $50 por mês. Uma escalada mal resolvida custa mais do que isso. O que é o verdadeiro argumento para subir a escada, e também por que a escolha do modelo não é onde está a maior alavancagem.

O que nenhum destes resolve numa fila de suporte

Nenhuma das oito linhas acima resolve a próxima parte, e é por isso que continuo insistindo quando alguém me diz que encontrou um modelo mais barato.

Já vi exatamente essa falha acontecer em contas pagantes. Um modelo não para quando a recuperação volta vazia. Ele preenche a lacuna com o que aprendeu no treinamento. Um cliente, uma fornecedora dinamarquesa de energia solar, teve o bot fabricando alegações sobre assinaturas e enviando isso a clientes reais. Outro perguntou algo ao bot e recebeu "Oxygen (periodic table)" de volta. Nenhum dos casos foi um modelo ruim. Ambos foram um modelo sem nada contra o que se fundamentar, e nada no caminho para impedi-lo de chutar.

Um gerente de suporte em nossas contas colocou a mesma preocupação em termos mais diretos, dizendo à IA o que não fazer:

"stop telling customers that we will get them sorted. You dont know that"

Um gerente de suporte de e-commerce, preocupado com um bot prometendo demais sobre prazos de entrega. Mesmo formato de problema. O modelo soa confiante, e esse soar confiante é a parte perigosa. O próprio detalhamento AA-Briefcase do Inkling-Small diz isso claramente, apresentando 270,86 pontos Elo melhor do que analisa.

Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates
Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates

Um modelo maior não é a solução. Duas coisas que um modelo não traz de fábrica são. Primeiro, fundamentação, para que a resposta saia da sua central de ajuda e dos seus tickets passados em vez da memória paramétrica. Depois, uma barreira de confiança, para que tudo abaixo do limite vá para uma pessoa em vez de sair. Essas duas coisas transformam um motor bruto em algo que você pode apontar para uma fila em produção, e são todo o assunto da prevenção de alucinações de IA.

O outro motivo pelo qual as pessoas param de comparar modelos é mais mundano do que isso. Um desenvolvedor com quem conversamos, montando uma base de conhecimento de incidentes de TI, já tinha dado a volta completa. Testou a API de um fornecedor e achou cara demais, testou outra e achou pouco confiável, e no fim só queria algo que funcionasse. Comparar modelos é divertido. Manter uma camada de modelo não é.

Try eesel

Se o modelo que você está escolhendo vai responder perguntas de clientes, o conselho honesto vem em duas partes. Pegue o que, dos oito acima, se encaixa no seu orçamento e na sua licença. Depois não construa você mesmo a camada acima dele.

Essa camada é o que é a eesel. Ela se conecta ao Zendesk, Freshdesk ou o que quer que você já use, aprende com seus tickets resolvidos e sua central de ajuda em vez dos dados de treinamento de um modelo, e só responde depois de passar por um limite de confiança que você mesmo define. Tudo abaixo disso é escalonado. E antes de tocar no tráfego real, você pode simulá-la contra o seu próprio histórico de tickets, que é como você descobre o que ela erraria antes de um cliente descobrir.

The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets
The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets

Coloquei nossa própria taxa medida de erro factual de 7% logo no início em vez de escondê-la, porque esse é o número que importa enquanto você está escolhendo um modelo. Ele veio do tráfego real do Zendesk de uma varejista alemã de joias, cerca de mil tickets por mês, validado de forma cruzada em 284 chats e 100 tickets, com recuperação sobre a central de ajuda real deles. Fundamentação não vai te levar a zero. Ela dá um número que você pode medir, controlar e então melhorar, e isso é uma categoria diferente de um modelo chutando com confiança.

O modelo comercial também é deliberadamente não por assento. A cobrança é por ticket resolvido, então o preço acompanha o trabalho feito e não o quadro de pessoal. Grátis para testar. Se preferir checar os números primeiro, o guia de desvio de tickets é um bom ponto de partida.

My take

O Inkling-Small é um bom modelo pequeno para o qual as pessoas continuam pedindo um trabalho que ele não foi feito para fazer. Ele executa bem e a um preço já perto do piso, e sua confiabilidade de conhecimento mede -9,0. Esses dois fatos não estão em tensão. Juntos, descrevem uma ferramenta.

Está saindo pelo custo? Pegue o DeepSeek V4 Flash e pronto. Se as respostas erradas são o que está te empurrando para fora, suba para o Inkling pai para o conserto barato, ou para o Claude Opus 5 para o caro, sabendo que nenhum dos dois te leva a zero.

E se o motivo é a janela de contexto não bater com a ficha, o GLM-5.2 entrega o que anuncia, sob MIT. Essa é a linha que eu escolheria se fosse obrigado a apenas uma.

O veredito honesto sobre os oito continua o mesmo, porém. Trocar de motor mexe na sua conta e nas suas pontuações de benchmark. Não muda o que acontece quando um cliente pergunta algo que sua documentação nunca respondeu. Fechar essa lacuna exige recuperação, um limite de confiança, uma transferência. Nenhum upgrade de modelo faz isso por você, e vale a pena resolver isso antes de gastar mais uma tarde lendo benchmarks de classificação de tickets com IA.

Perguntas frequentes

Quais são as melhores alternativas ao Inkling-Small?
Para a maioria das equipes, tudo se resume a três: DeepSeek V4 Flash se você quer o mesmo trabalho mais barato, o próprio Inkling se você quer a mesma família com melhor recuperação factual, e Claude Opus 5 se uma resposta errada custa dinheiro de verdade. A lista completa deste artigo também cobre GLM-5.2, MiniMax M3, Kimi K3, Qwen3.8-Max e Gemini 3.6 Flash.
Existe uma alternativa mais barata ao Inkling-Small?
Sim. O preço do DeepSeek V4 Flash é de $0,14 de entrada e $0,28 de saída por milhão de tokens, contra $0,30 e $1,20 do Inkling-Small, então a saída é cerca de quatro vezes mais barata. O MiniMax M3 iguala exatamente o Inkling-Small em $0,30 e $1,20 abaixo de 512K de entrada. Se você está tentando reduzir seu custo por resolução, o item de modelo raramente é o maior.
Por que trocar de Inkling-Small?
Pela confiabilidade de conhecimento. A Artificial Analysis pontua o Inkling-Small em -9,0 no AA-Omniscience Index com 30,5% de precisão, enquanto seu modelo pai fica em 2,05 com 39,95%. Essa diferença é o que aparece como alucinações de IA no suporte quando o modelo recebe uma pergunta que sua base de conhecimento não cobre.
O Inkling-Small realmente tem uma janela de contexto de 1M?
A ficha do modelo diz 1M e nenhum de seus dois provedores entrega isso. A Thinking Machines serve 256.000 tokens e a DeepInfra serve 524.288, segundo a Artificial Analysis. A mesma diferença existe no modelo pai. Se contexto longo foi o motivo da escolha, confira o explicador do Inkling-Small antes de construir em cima de 1M.
Qual alternativa ao Inkling-Small tem a melhor licença aberta?
DeepSeek V4 Flash e GLM-5.2 são distribuídos sob MIT, a posição comercial mais limpa do grupo. Inkling-Small e seu modelo pai são Apache 2.0. Kimi K3 e MiniMax M3 carregam licenças personalizadas com limites de receita, e a da MiniMax é não comercial por padrão. Para um panorama mais completo, veja nosso apanhado de agentes de IA de código aberto.
Quanto custa rodar uma alternativa ao Inkling-Small em tickets de suporte?
Os tokens são o número pequeno. A $1,20 por milhão de tokens de saída, um mês com mil tickets custa alguns dólares em inferência. O que custa dinheiro de verdade é a camada de recuperação (retrieval), a lógica de escalonamento e o controle de qualidade, por isso a maioria das equipes compra essa camada em vez de construí-la. Nossa página de preços cobra por ticket resolvido em vez de por assento, e o custo do atendimento ao cliente com IA detalha essa conta.
Posso hospedar eu mesmo uma alternativa ao Inkling-Small em vez de pagar por token?
Pode, e os pesos de DeepSeek V4 Flash, GLM-5.2, Kimi K3 e MiniMax M3 estão todos publicados. A conta muda para o hardware em vez de desaparecer, e você também herda o serviço, as avaliações e as atualizações. Equipes que seguem esse caminho para atendimento ao cliente com IA costumam descobrir que o modelo nunca foi a parte difícil.
O Inkling-Small é bom o suficiente para suporte ao cliente sozinho?
Sozinho não, e nenhum outro desta lista também não é. Um modelo bruto responde a partir dos dados de treinamento quando a recuperação volta vazia, que é exatamente como uma resposta confiante e errada chega a um cliente. A solução é fundamentação (grounding) mais uma barreira de confiança que encaminha o caso, que é o assunto de gestão de escalonamento com IA e transferência para um agente.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Um desenvolvedor escolhendo entre cartões de modelos, com o cartão da baleia DeepSeek no centro rodeado por modelos rivais
Alternatives

As 8 melhores alternativas ao DeepSeek V4 Flash em 2026

Oito alternativas reais ao DeepSeek V4 Flash, comparadas pelos números. Ninguém troca por preço ou velocidade, então eu as classifico pelas quatro lacunas reais que o Flash tem.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Ilustração de uma pessoa avaliando vários super-agentes de IA como alternativas ao Skywork AI
Alternatives

7 melhores alternativas ao Skywork AI em 2026

As melhores alternativas ao Skywork AI em 2026, de super-agentes gerais como Manus a ferramentas de pesquisa, criadores de apresentações e uma opção focada apenas em suporte, com preços reais.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Uma pessoa ao telefone diante de três opções diferentes de agente de voz, com o logotipo da Grok à esquerda
Alternatives

As 10 melhores alternativas ao Grok Voice Think Fast 2 em 2026

O Grok Voice Think Fast 2.0 ficou 60% mais caro no alias padrão. Dez alternativas reais, com custo por hora medido e números de benchmark honestos.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Ilustração editorial de capa para uma seleção de alternativas ao Google Gemini 3.5 Pro
Alternatives

8 melhores alternativas ao Gemini 3.5 Pro em 2026

Procurando alternativas ao Gemini 3.5 Pro? O problema: o 3.5 Pro ainda não foi lançado. Aqui estão 8 modelos que você pode usar hoje, com preços reais e recomendações.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA de ponta como alternativas ao GPT-5.6 Sol
Alternatives

9 melhores alternativas ao GPT-5.6 Sol em 2026

O GPT-5.6 Sol é o topo de linha da OpenAI a preço de topo de linha: 5$/30$ por 1M de tokens, a mesma tarifa do GPT-5.5. Aqui estão 9 alternativas reais ao Sol e para quem cada uma serve.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
As melhores alternativas ao GPT-Live em 2026, um panorama de ferramentas de IA de voz em tempo real
Alternatives

As 8 melhores alternativas ao GPT-Live em 2026

O GPT-Live impressiona, mas não é a única IA de voz em tempo real que vale a pena conhecer. Aqui estão 8 alternativas ao GPT-Live em 2026, do Gemini Live aos construtores de agentes de voz.

Rama Adi NugrahaRama Adi NugrahaJul 13, 2026
Ilustração editorial representando uma comparação de modelos de chat de IA como alternativas ao GPT-5.6
Alternatives

As 9 melhores alternativas ao GPT-5.6 em 2026

O GPT-5.6 passou hoje de uma prévia restrita pelo governo para um lançamento global, exatamente ao mesmo preço do GPT-5.5. Aqui estão 9 alternativas reais, e para quem cada uma serve.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Ilustração editorial representando uma comparação de modelos de chat de IA como alternativas ao Grok 4.5
Alternatives

9 melhores alternativas ao Grok 4.5 em 2026

O Grok 4.5 é rápido e barato, mas está em 4º lugar no Intelligence Index e carrega uma bagagem real de confiança. Aqui estão 9 alternativas reais, e exatamente para quem cada uma serve.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Grade de blocos visuais gerados por IA em tons de azul representando alternativas ao Meta Muse Image
Alternatives

As 8 melhores alternativas ao Meta Muse Image em 2026

O Meta Muse Image acabou de ser lançado, mas o Nano Banana Pro, o GPT Image 2, o Midjourney e mais cinco geradores de imagens com IA já o superam em qualidade, preço ou controle.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis