As 8 melhores alternativas ao Inkling-Small em 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Um modelo pequeno deixado de lado enquanto cinco modelos alternativos recebem a luz

Por que as pessoas já estão olhando além do Inkling-Small

A Thinking Machines Lab lançou o Inkling-Small em 30/07/2026 sob a licença Apache 2.0, quinze dias depois do modelo pai. A proposta era razoável e o modelo realmente entrega isso. Um quarto do tamanho do pai, mais rápido e mais barato também, e na própria ficha do fornecedor ele até supera o pai no SWE-bench Verified, 80,2 contra 77,6.

A recepção no r/LocalLLaMA teve muito a dizer sobre essa palavra "small". O terceiro comentário mais votado no tópico de lançamento não fala nada sobre benchmarks:

Reddit

"Em breve, depois de todos esses modelos de 2-3T, vão chamar de 'small' modelos de 500-700B... chorando com 12GB de VRAM"

Justo. Mas o nome não é o que afasta ninguém do modelo. O que ele sabe, sim.

A Artificial Analysis o coloca em um Intelligence Index de 40, posição #15 de 101, o que é bem respeitável. Depois a mesma página reporta o teste de conhecimento AA-Omniscience: um índice de -9,0, precisão de 30,5%, taxa de alucinação de 56,9%. A AA descreve essa avaliação como uma medida de "confiabilidade de conhecimento e alucinação" em uma faixa de -100 a 100. Então um número negativo ali não é nenhum artefato de arredondamento. É o modelo alcançando uma resposta que ele não tem.

A análise detalhada do AA-Briefcase é a parte à qual eu continuo voltando. Um Elo geral de 917,13, que diz pouco até você separar: apresentação 1067,99 contra qualidade analítica de 797,13. O modelo escreve uma resposta melhor do que realmente sabe.

As pessoas que executam esses modelos no próprio hardware notaram isso rapidamente, e em um eixo mais afiado do que o usado nas tabelas de benchmark:

Reddit

"Mas pior que o GPT 5.5 Luna no índice Omniscience, porque ele inventa demais as respostas. 84% de taxa de alucinação, por isso prefiro outros modelos abertos, eles são melhores em 'detectar' sua própria incerteza."

Esse número de 84% está mais alto do que os 56,9% que aparecem hoje na página da AA, então considere o número exato como a leitura deles, não a minha. De qualquer forma o ponto se mantém, e é o ponto certo a ser feito. Eles estão escolhendo um modelo com base em se ele sabe quando não sabe, em vez de em quão bem ele escreve código.

Três razões pelas quais as equipes abandonam o Inkling-Small, cada uma apontando para um modelo substituto diferente
Três razões pelas quais as equipes abandonam o Inkling-Small, cada uma apontando para um modelo substituto diferente

Outras três coisas afastam as pessoas dele. O preço não é uma delas.

A janela de contexto não é a janela de contexto. A AA lista o modelo com 1M de tokens. O que seus dois provedores realmente entregam é 256.000 (Thinking Machines) e 524.288 (DeepInfra). Então quem leu "1M" na ficha e construiu em torno desse número não está recebendo isso. Mesmo problema no modelo pai, onde o melhor número entregue é 524k entre três provedores, e a linha mais barata e rápida da DeepInfra tem um limite de 131k.

Dois provedores é pouco. O pai tem três, e o grupo que serve DeepSeek ou GLM é ainda maior. No dia do lançamento, o modelo nem estava no OpenRouter, uma lacuna que um comentarista apontou no Hacker News junto com os números de parâmetros. Os dois provedores que você de fato tem também se comportam de forma diferente. A DeepInfra roda 1,43 vez mais rápido em uma carga de 10k, e depois fica atrás do fornecedor original em 100k, 82,36 tokens por segundo contra 113,36. Seu perfil de latência muda conforme o tamanho do prompt, e isso é uma coisa horrível de descobrir em produção.

Cobertura escassa também deixa menos espaço para procurar outras opções quando um provedor começa a economizar em coisas importantes, o que acontece com mais frequência do que os benchmarks publicados deixam transparecer:

Hacker News

"Na verdade, descobrimos que muitos provedores de inferência estão quantizando os pesos ou até o cache KV, e devido aos preços baixos com que atendem em lotes enormes, isso resulta em uma vazão instável."

O preço não é um único número. O fornecedor original cobra $0,30 de entrada e $1,20 de saída. A DeepInfra pede $0,58 e $1,44 pelo contexto mais longo. Misturado, a AA mostra $0,222 na proporção padrão de 7:2:1, enquanto a mistura clássica de 3:1 fica em $0,525. Então, qualquer número único que você acabe citando é, na verdade, uma escolha sobre proporções, e essa escolha importa quando você está modelando o custo do atendimento ao cliente com IA em volume.

Para ser justo, nada disso soma a um modelo ruim. O raciocínio consome 95,5% da sua conta de saída, que é exatamente de onde vem a inteligência, e o GPQA Diamond em 89,5% mais o raciocínio de contexto longo em 63% são números reais. A coisa é um executor. O problema só começa quando você pede a um executor para ser um conhecedor.

Como escolhi estes oito

Escrevo muitos desses apanhados e a armadilha nunca muda. Classificar por benchmark, publicar, seguir adiante. Então mantive o filtro mais estreito aqui.

Cada um dos oito precisava ser algo para o qual um usuário do Inkling-Small pudesse migrar nesta semana, então uma API pública ativa com preços publicados, sem listas de espera. Cada preço veio da própria página de faturamento do fornecedor em 05/08/2026, em vez de um site de comparação, já que os números desses sites ficam desatualizados em menos de duas semanas. Onde um provedor publica tanto o contexto entregue quanto o anunciado, verifiquei um contra o outro. As licenças também li, e isso importou, porque dois modelos aqui têm limiares de receita escondidos nas suas.

O que eu não fiz foi fingir que seis meses de tráfego de produção passaram pelos oito. Li a documentação e as páginas de faturamento, as fichas dos modelos, as medições da AA, e então só disse o que isso sustenta.

As melhores alternativas ao Inkling-Small em resumo

Todos os preços abaixo são por milhão de tokens em USD, verificados em 05/08/2026.

ModeloMelhor paraPesosParâmetrosEntradaSaídaContexto realModalidades de entradaA pegadinha
Inkling-Small (base)Execução agêntica barataApache 2.0276B / 12B ativos (266B segundo a AA)$0,30$1,20256K no fornecedor original, 524.288 na DeepInfraTexto, imagem, áudioÍndice de conhecimento -9,0
DeepSeek V4 FlashMesmo trabalho, um quarto do custoMIT284B / 13B$0,14$0,281MTextoUma sobretaxa de 2x no horário de pico foi anunciada
Inkling, o paiFicar na família, sabendo maisApache 2.0975B / 41B$1,00$4,05524K no melhor caso, 131K no mais baratoTexto, imagem, áudioDuas páginas da AA citam preços diferentes
GLM-5.2Os pesos abertos mais fortes que você pode hospedarMIT~753B no total$1,40$4,401MTextoLimite de saída de 128K
MiniMax M3Entrada de vídeo, pelo preço do Inkling-SmallLicença comunitária própria428B / 23B$0,30$1,201M, 512K garantidoTexto, imagem, vídeoNão comercial por padrão
Kimi K3Trabalho de agente de longo prazoLicença própria (Kimi K3 Licence)2,8T$3,00$15,001.048.576TextoSem nível batch, 3 RPM no nível de entrada
Qwen3.8-MaxModelo fechado, janela generosaFechadoNão divulgado$2,00$6,001MTextoDois preços para um modelo
Gemini 3.6 FlashEntrada de áudio sem sobretaxaFechadoNão divulgado$1,50$7,501.048.576Texto, imagem, vídeo, áudio, PDFTeto de saída de 65.536
Claude Opus 5Quando respostas erradas custam dinheiroFechadoNão divulgado$5,00$25,001M, sem sobretaxaTexto, imagemTokenizador mais novo emite ~30% mais tokens

Qual alternativa ao Inkling-Small combina com o seu motivo para sair?

Escolha a frase que mais parece a sua semana.

Vá com Claude Opus 5, ou com o Inkling pai se o orçamento estiver apertado

$5,00 / $25,00Opus 5, por 1M de tokens $1,00 / $4,05Inkling, por 1M de tokens 2,05 vs -9,0Inkling vs Small, AA-Omniscience

O índice de conhecimento do Inkling-Small é negativo e o do seu pai é positivo, então a solução real mais barata é subir um nível dentro da mesma família: mesma licença, mesmas ferramentas, aproximadamente 3,4x o preço de saída. O Opus 5 custa muito mais e é a opção certa quando uma resposta errada significa um reembolso, um problema de conformidade ou um cliente perdido.

Nenhum modelo desta lista chega a zero. O grounding nos seus próprios documentos somado a um limite de confiança fazem mais pela precisão do que qualquer upgrade aqui.

Vá com DeepSeek V4 Flash

$0,14 / $0,28por 1M de tokens 4,3xsaída mais barata que o Inkling-Small MITlicença sobre os pesos

Os acertos de cache caem para $0,0028 por milhão, o que é 50x abaixo da própria taxa de erro de cache, então uma carga de trabalho repetitiva fica muito barata muito rápido. Pesos MIT, contexto de 1M, 2.500 requisições simultâneas nos limites publicados. O MiniMax M3 é o vice, exatamente na tarifa do Inkling-Small, com entrada de vídeo incluída.

A DeepSeek anunciou uma sobretaxa de 2x no horário de pico das 09h00 às 12h00 e das 14h00 às 18h00, horário de Pequim. Ainda sem data de início, então modele seu pico contra a tarifa dobrada.

Vá com DeepSeek V4 Flash ou GLM-5.2

1Mentregue, ambos os modelos 256KInkling-Small, fornecedor original 384K / 128Ksaída máxima, DeepSeek / GLM

Ambos anunciam uma janela de 1M e ambos realmente a entregam, que é a diferença que importa. O GLM-5.2 custa o mesmo que o GLM-5.1 custava a 200K, então a janela veio de graça. Ainda assim, fique atento aos tetos de saída: o DeepSeek permite 384K de saída, o GLM limita em 128K.

Contexto longo e raciocínio de contexto longo são coisas diferentes. O Inkling-Small marca 63% no teste de raciocínio de contexto longo da AA, então uma janela maior por si só não vai resolver um problema de memória.

Vá com Kimi K3, ou Gemini 3.6 Flash se precisar de áudio

$3,00 / $15,00Kimi K3, por 1M $1,50 / $7,50Gemini 3.6 Flash, por 1M 2,8Tparâmetros do Kimi K3

O Kimi K3 é feito para execuções de agente de longo prazo e seus pesos são públicos, com 2,8 trilhões de parâmetros em 4 bits. O Gemini 3.6 Flash cobra uma tarifa de entrada fixa única em texto, imagem, vídeo, áudio e PDF, o que é raro e útil se suas entradas forem variadas.

O Kimi K3 não tem nível batch e o nível de gasto de entrada permite 3 requisições por minuto. Verifique os limites de taxa contra o seu tráfego antes de se comprometer.

1. DeepSeek V4 Flash

Melhor para: fazer o que o Inkling-Small faz, por cerca de um quarto do custo de saída.

A interface de chat web gratuita da DeepSeek, capturada de DeepSeek

Esta é a comparação à qual um usuário real do Inkling-Small recorre primeiro, e também foi o comentário mais substancial no tópico de lançamento no r/LocalLLaMA:

Reddit

"Fico pensando como ele se compara ao DSV4 Flash. Comparável no benchmark de inteligência da Artificial Analysis (ambos 40). Parece se sair um pouco melhor em codificação / fluxos agênticos, porém."

É essa a proporção. O DeepSeek V4 Flash roda com 284B no total e 13B ativos, ao lado dos 12B do Inkling-Small, e a AA coloca os dois em 40. Motor parecido. Conta não tão parecida.

Há uma coisa que os números de parâmetros escondem, e ela importa se a auto-hospedagem estiver na sua lista. O DeepSeek é distribuído nativamente em FP4 e FP8 mistos, enquanto o Inkling-Small é distribuído em bf16, então em precisão nativa um executor local colocou um em cerca de 160GB contra 540GB. No papel, o mesmo tamanho aproximado. Na prática, o triplo de memória.

Recursos. Pesos com licença MIT no Hugging Face, mais uma janela de contexto de 1M e uma saída máxima de 384K, a maior desta lista, com uma boa margem. A limitação de taxa é feita por concorrência em vez de requisições por minuto, com um limite publicado de 2.500 requisições simultâneas por conta.

Vantagens. A economia de cache é a verdadeira história aqui. Um acerto de cache custa $0,0028 por milhão de tokens de entrada, 50x abaixo da taxa de erro de cache de $0,14, então qualquer coisa com um prompt de sistema estável fica absurdamente barata. E MIT é a licença mais limpa do grupo, sem limiar de receita, sem cláusula de atribuição.

Desvantagens. Apenas texto, então qualquer áudio que você estivesse alimentando ao Inkling-Small não tem mais para onde ir. Há também uma nota de rodapé na página de preços anunciando uma futura sobretaxa de 2x no horário de pico entre 09h00 e 12h00 e 14h00 e 18h00, horário de Pequim, com data de entrada em vigor "sujeita ao anúncio oficial". Uma incógnita conhecida dentro do seu modelo de custos.

Preços. $0,14 de entrada e $0,28 de saída por milhão, acertos de cache a $0,0028. O Pro fica em $0,435 e $0,87, exatamente 3,1x o Flash em ambos os lados. Os exemplos calculados estão em nossa análise de preços do DeepSeek V4 Flash, e o comparamos com o Kimi K3 separadamente.

Minha opinião: se o dinheiro é o seu motivo para sair, pare de ler aqui. Se é a precisão, continue lendo, porque ficar mais barato nunca fez um modelo saber mais.

2. Inkling, o pai

Melhor para: ficar nos mesmos pesos, ferramentas e licença enquanto recompra a precisão factual.

Inkling rodando localmente no Unsloth Studio com um contador de contexto de 1.048,6k, capturado de Unsloth
Inkling rodando localmente no Unsloth Studio com um contador de contexto de 1.048,6k, capturado de Unsloth

Muitas vezes a alternativa mais interessante a um modelo pequeno é o grande do qual ele foi destilado, e aqui os números comprovam isso claramente. Sob a mesma metodologia da AA, o Inkling marca 41 no Intelligence Index contra 40 do Small, então empata. O AA-Omniscience é onde eles se separam: 2,05 com 39,95% de precisão, contra -9,0 e 30,5%. Quase um terço mais de perguntas voltam corretas.

Recursos. 975B no total com 41B ativos em 66 camadas, Apache 2.0, e texto mais imagem mais áudio na entrada. Agora três provedores de serviço, onde no lançamento havia apenas um: DeepInfra, Together AI e Thinking Machines.

Vantagens. Mesma licença, mesma família, então a migração é basicamente trocar uma string de modelo. A linha FP8 da DeepInfra é rápida, 201,5 tokens por segundo, e o custo por tarefa de Intelligence Index ali dá $0,4296, barato para esse nível.

Desvantagens. Duas páginas da AA atualmente discordam sobre o preço, então você quer saber qual está citando. A página do modelo diz $1,87 de entrada e $4,68 de saída. As linhas de provedores todas dizem $1,00 e $4,05. Esses números de provedores permanecem consistentes entre si nos três, então esse é o par contra o qual eu planejaria. O contexto entregue também é confuso. É 524k no melhor caso, e a linha barata e rápida da DeepInfra tem um limite de 131k, ou 13,1% do milhão anunciado.

Preços. Segundo os dados dos provedores, $1,00 de entrada e $4,05 de saída, com $0,17 para um acerto de cache e $0,724 misturado. Vamos chamar isso de 3,4x a tarifa de saída do Small. Se é o pai que você está comprando, o artigo sobre alternativas ao Inkling cobre a lista mais ampla.

Minha opinião: a escolha óbvia, e a que a maioria pula, porque "subir para o irmão maior" parece admitir que o pequeno foi um erro. Não foi. Era só a ferramenta errada para um trabalho de conhecimento.

3. GLM-5.2

Melhor para: os pesos abertos mais fortes desta lista que você pode hospedar de forma realista.

O material de lançamento do GLM-5.2 pela Z.ai, capturado de Z.ai

O GLM-5.2 é o passo acima que mantém você em território com licença MIT. Cerca de 753B parâmetros no total, com um contexto de 1M que sua API realmente entrega, e 2,23 milhões de downloads no repositório zai-org/GLM-5.2. Esse número de downloads mostra que a comunidade de auto-hospedagem já testou bastante o modelo.

Recursos. Pesos MIT com um contexto de 1M e uma saída máxima de 128K, depois entrada em cache a $0,26, com armazenamento de cache listado como gratuito por enquanto. A Z.ai também vende uma via de assinatura. O Coding Plan começa em $18 por mês, com desconto para $12,60, e traz 10.000 créditos por semana.

A Z.ai publica sua própria curva de nível de esforço, e olhar para ela vale mais do que aceitar a pontuação de destaque ao pé da letra:

Gráfico da Z.ai da pontuação de codificação agêntica em relação aos tokens de saída médios por tarefa, comparando GLM-5.2 e GLM-5.1 com duas versões do Claude Opus, capturado de Z.ai
Gráfico da Z.ai da pontuação de codificação agêntica em relação aos tokens de saída médios por tarefa, comparando GLM-5.2 e GLM-5.1 com duas versões do Claude Opus, capturado de Z.ai

Vantagens. O GLM-5.2 custa o que o GLM-5.1 custava, $1,40 e $4,40, e enquanto isso a janela de contexto foi de 200K para 1M. Um upgrade de graça, sem mais nem menos. Uma licença MIT sem cláusula de receita também vale mais do que um ou dois pontos de benchmark quando você está lançando isso dentro de um produto.

Desvantagens. Esse teto de saída de 128K é o mais apertado entre as opções de pesos abertos aqui, contra os 384K do DeepSeek. Os créditos do Coding Plan são consumidos a 3x no horário de pico e 2x fora dele, com a tarifa fora de pico temporariamente em 1x até o final de setembro, então as contas da assinatura precisam de atenção.

Preços. $1,40 de entrada, $4,40 de saída, $0,26 em cache. Existem irmãos mais baratos se você puder viver com menos. GLM-4.7 e GLM-4.6 estão ambos a $0,60 e $2,20, enquanto o GLM-4.7-FlashX está a $0,07 e $0,40.

Minha opinião: a melhor relação licença-capacidade da lista. Se sua equipe jurídica já perguntou o que acontece no dia em que um fornecedor muda os termos, aponte para esta linha.

4. MiniMax M3

Melhor para: igualar o preço exato do Inkling-Small enquanto adiciona entrada de vídeo.

A página do modelo MiniMax M3, capturada de MiniMax

Este é um empate direto de preço, e isso torna a comparação incomumente clara. Abaixo de 512K de entrada, o MiniMax M3 cobra $0,30 de entrada e $1,20 de saída, idêntico à tarifa do fornecedor original do Inkling-Small, saindo de um modelo de 428B com 23B ativos. O que deixa você escolhendo com base em tudo, exceto o custo.

Recursos. Um contexto de 1M com 512K garantido como mínimo, leituras de cache a $0,06, e entrada de texto mais imagem mais vídeo chegando por meio de partes de conteúdo image_url e video_url. O modo de pensamento custa o mesmo ligado ou desligado. Os pesos estão disponíveis no Hugging Face em MiniMaxAI/MiniMax-M3, com 170.353 downloads até agora.

Vantagens. Quase o dobro dos parâmetros ativos do Inkling-Small pelo mesmo dinheiro, e entrada de vídeo por cima, algo que mais nenhum modelo nesse preço na lista oferece. A página de preços rotula a tarifa atual como "50% de desconto permanente", e nenhuma data de expiração está impressa em lugar nenhum.

Desvantagens. A licença é a verdadeira pegadinha aqui. A MINIMAX COMMUNITY LICENSE é não comercial por padrão, o uso comercial exige um crédito visível de "Built with MiniMax M3", e além de $20 milhões de receita anual você precisa de autorização por escrito. Ao passar de 512K de entrada, ambas as tarifas dobram, então $0,60 e $2,40. Também existe um nível Priority, a 1,5x, se a fila mais rápida valer a pena para você.

Preços. $0,30 e $1,20 até 512K de entrada, depois $0,60 e $2,40 acima disso, leituras de cache a $0,06. O Priority roda a $0,45 e $1,80, ou $0,90 e $3,60 depois do limite.

Minha opinião: bom motor, licença que você precisa se sentar para ler. Uma startup abaixo da linha de receita, feliz em exibir o crédito, consegue mais modelo por dólar aqui do que no que está deixando.

5. Kimi K3

Melhor para: trabalho de agente de longo prazo onde a execução importa mais do que o preço do token.

A interface de chat do Kimi, o assistente e frontend de agente da Moonshot AI, capturada de Moonshot AI

O Kimi K3 é um salto muito maior do que qualquer coisa acima dele, e em sua própria documentação de preços a Moonshot o chama de carro-chefe para "codificação de longo prazo e trabalho de conhecimento de ponta a ponta". Com 2,8 trilhões de parâmetros servidos em mxfp4 de 4 bits, é também o maior modelo aqui cujos pesos você pode baixar.

Recursos. Um contexto de 1.048.576 tokens, raciocínio sempre ativo por trás de uma configuração reasoning_effort de low, high ou max (sendo max o padrão), e um repositório moonshotai/Kimi-K3 sem restrições. A busca web é cobrada separadamente, $0,005 por chamada bem-sucedida.

Vantagens. Pesos abertos nessa escala é raro. A taxa de acerto de cache de $0,30 contra $3,00 de entrada em erro de cache também é uma economia de 10x sempre que o contexto se repete. E a faixa intermediária é coberta por irmãos mais baratos, com o kimi-k2.7-code a $0,95 e $4,00.

Desvantagens. Duas pegadinhas operacionais aqui, e ambas mordem. O K3 não é suportado no nível batch, então o desconto de 60% que outros modelos Kimi recebem não chega até ele. O sistema de níveis também é limitado por gasto: o nível 0, com $1 de recarga acumulada, permite 1 requisição simultânea e 3 requisições por minuto, subindo para 1.000 simultâneas e 10.000 RPM ao atingir o nível 5 com $3.000. A licença parece ter o formato MIT, mas depois adiciona uma cláusula exigindo um acordo separado para negócios de modelo como serviço acima de $20 milhões de receita em qualquer período de doze meses consecutivos.

Preços. $3,00 de entrada e $15,00 de saída, com $0,30 em um acerto de cache. A 12,5x a tarifa de saída do Inkling-Small, ninguém deveria confundir isso com uma mudança lateral. As tabelas completas de níveis estão em preços do Kimi K3.

Minha opinião: a escolha quando a carga é uma execução longa de agente em vez de milhares de respostas curtas. Para tráfego em formato de ticket, justificá-lo contra o GLM-5.2 a um terço do preço fica difícil.

6. Qwen3.8-Max

Melhor para: um modelo fechado com uma janela de fato generosa e uma cota de teste gratuita.

A interface de chat do Qwen, o assistente e frontend de API da Alibaba Cloud, capturada de Alibaba Cloud

O Qwen3.8-Max é aonde você chega quando decide que pesos abertos não são o ponto e o nível comercial máximo da Alibaba é. A surpresa agradável na página de faturamento é que o Max finalmente eliminou as faixas de comprimento de entrada. Uma única faixa, cobrindo toda a janela de um milhão de tokens.

Recursos. Um contexto de 1M, saída máxima de 131K e raciocínio máximo de 262K, com TPM de 2 milhões contra RPM de 15.000. O cache implícito custa $0,25. Também há uma cota gratuita de 1 milhão de tokens, válida por 90 dias.

Vantagens. A ausência de faixas por comprimento de entrada é uma mudança maior do que parece. A regra de faixas da Alibaba funciona no tudo ou nada, então no antigo qwen3-max, cruzar um limite refazia o preço da requisição inteira, e um prompt de 33K tokens saltava de $1,20 para $2,40 na entrada. Aqui essa armadilha desapareceu. O milhão de tokens gratuitos também te dá margem real para avaliar direito.

Desvantagens. Um único ID de modelo, dois preços, dependendo do escopo de implantação: $2,00 e $6,00 nas tabelas International e Singapore, $1,65 e $4,951 nas tabelas Global. Uma diferença de 18% sem nenhuma diferença de comportamento por trás é confusa para orçar. A cota gratuita é exclusiva de Singapura, seu relógio não pausa por inatividade, e o que sobra é anulado no vencimento. O batch dá 50% de desconto, mas não se acumula com os descontos de cache. O Max também é fechado, e os pesos publicados do Qwen estão duas gerações atrás, o mais recente datado de 24/04/2026.

Preços. $2,00 de entrada e $6,00 de saída em International e Singapore, depois $1,65 e $4,951 em Global. A criação explícita de cache custa $2,50, que é 125% da entrada. Os detalhes completos estão em nosso artigo sobre preços do Qwen3.8-Max, e há o apanhado de alternativas ao Qwen3.8-Max se você estiver comprando na outra direção.

Minha opinião: sólido, e um pouco caro demais contra o GLM-5.2, que pede menos e te entrega os pesos. A cota gratuita ainda é um motivo para experimentá-lo.

7. Gemini 3.6 Flash

Melhor para: entrada de áudio e mídia mista sem pagar um adicional de mídia.

O aplicativo web Gemini do Google, capturado de Google

Você estava no Inkling-Small especificamente pela entrada de áudio? Então este é o substituto mais próximo com um nível de serviço real por trás. O Gemini 3.6 Flash cobra uma única tarifa de entrada fixa de $1,50 cobrindo texto, imagem, vídeo, áudio e PDF, e isso quebra um padrão que o próprio Google havia estabelecido. No Gemini 2.5 Flash, a entrada de áudio custava $1,00 contra $0,30 do texto, e no 2.0 Flash o múltiplo chegava a 7x.

Recursos. 1.048.576 tokens de entrada contra 65.536 de saída, cache a $0,15 por milhão mais $1,00 por milhão por hora de armazenamento, com os níveis Batch e Flex ambos pela metade do preço, $0,75 e $3,75.

Vantagens. A tarifa de mídia fixa é o destaque aqui, e um nível Batch a $0,75 e $3,75 torna o trabalho em massa acessível. A página de preços do Google o lista como estável em vez de prévia, e isso importa se isso for se aproximar de clientes.

Desvantagens. Esse teto de saída de 65.536 é o mais apertado aqui, então gerações longas precisam ser divididas em partes. A cobrança de cache baseada em armazenamento funciona como um medidor contínuo em vez de uma cobrança única, diferente das tarifas fixas de leitura de cache em outros lugares. Os pesos são fechados, então não há auto-hospedagem. O grounding no Gemini 3.x também não está disponível no nível gratuito, o que significa que avaliar custa dinheiro.

Preços. O padrão é $1,50 de entrada e $7,50 de saída, Batch ou Flex $0,75 e $3,75, Priority $2,70 e $13,50. Onde o orçamento é a restrição, o Gemini 3.5 Flash-Lite chega a $0,30 e $2,50, e também não tem divisão de áudio. A escada completa está em preços do Gemini 3.6 Flash.

Minha opinião: a escolha para áudio. Também o único modelo aqui para o qual eu enviaria mídia mista em volume sem pensar duas vezes.

8. Claude Opus 5

Melhor para: os casos em que uma resposta errada dita com confiança custa dinheiro real.

O aplicativo web do Claude, capturado de Anthropic

Esta é a extremidade mais distante da escada, e um motivo para colocá-la na lista. Ela responde ao problema específico que o Inkling-Small tem. O Claude Opus 5 custa $5,00 de entrada e $25,00 de saída, cerca de 21x a tarifa de saída do Inkling-Small, e você compra isso quando a desvantagem de uma resposta errada supera a conta de tokens.

Recursos. O contexto completo de 1M no preço padrão, com nenhum nível de sobretaxa para contexto longo, o que é raro. A documentação de preços da Anthropic detalha isso: uma requisição de 900 mil tokens é cobrada na mesma tarifa por token que uma de 9 mil. As leituras de cache custam $0,50. A API Batch aplica um desconto fixo de 50% em ambos os lados, $2,50 e $12,50, e se acumula com o cache.

Vantagens. Sem um penhasco de comprimento de contexto, uma categoria inteira de surpresas de faturamento desaparece. O pensamento estendido não tem preço separado e é cobrado como saída padrão. O batch junto com o cache também reduz bastante cargas pesadas e repetidas em relação ao preço de etiqueta.

Desvantagens. Em qualquer comparação de custo, o tokenizador é a armadilha. A Anthropic observa que o Claude 4.7 e versões posteriores "produzem aproximadamente 30% mais tokens para o mesmo texto" do que o tokenizador mais antigo, então esse rótulo de $25,00 subestima a diferença real por tarefa contra um rival que ainda usa um tokenizador mais antigo. O modo rápido dobra ambos os lados para $10,00 e $50,00, funciona apenas na API do fornecedor original e não se acumula com o Batch. Os pesos são fechados.

Preços. Padrão $5,00 e $25,00, Batch $2,50 e $12,50, modo rápido $10,00 e $50,00, leitura de cache $0,50. A opção mais barata é o Sonnet 5 a $2,00 e $10,00 até 31 de agosto de 2026, que muda para $3,00 e $15,00 em 1 de setembro. Quando essa diferença vale a pena pagar é abordado em nossa comparação Opus 5 versus Sonnet 5.

Minha opinião: exagero para a maior parte do tráfego de tickets, exatamente certo para os 5% que envolvem dinheiro, política ou um contrato. Direcione pelo tipo de pergunta em vez de escolher um único modelo para tudo.

A escada de preços, em uma imagem

Coloque os oito lado a lado pelo preço de saída, e a forma da decisão fica óbvia.

Gráfico de barras do preço de saída por milhão de tokens em sete modelos, com o Inkling-Small destacado perto da parte inferior da faixa
Gráfico de barras do preço de saída por milhão de tokens em sete modelos, com o Inkling-Small destacado perto da parte inferior da faixa

O Inkling-Small já está próximo do fundo. Existe exatamente um passo significativo para baixo, o DeepSeek V4 Flash a $0,28, mais um movimento lateral ao mesmo preço no MiniMax M3. Tudo o mais aqui é um passo para cima, e o que um passo para cima compra nunca é velocidade.

Vale a pena fazer a conta do que qualquer um disso custa em volume de tickets. Considere mil tickets em um mês, e conte 2.000 tokens de saída por resposta, o que é generoso para uma resposta de suporte. Então 2 milhões de tokens de saída.

ModeloCusto de saída, 2M tokensContra o Inkling-Small
DeepSeek V4 Flash$0,56$1,84 mais barato
Inkling-Small$2,40base
MiniMax M3$2,40idêntico
GLM-5.2$8,80$6,40 mais
Inkling$8,10$5,70 mais
Gemini 3.6 Flash$15,00$12,60 mais
Kimi K3$30,00$27,60 mais
Claude Opus 5$50,00$47,60 mais

Nesse volume, toda a diferença entre o mais barato e o mais caro é de cerca de $50 por mês. Uma única escalação mal tratada custa mais do que isso. Que é o verdadeiro argumento para subir a escada, e também por que a escolha do modelo não é onde está a maior alavancagem.

O que nenhum destes resolve em uma fila de suporte

Nenhuma das oito linhas acima resolve a próxima parte, e é por isso que continuo insistindo quando alguém me diz que encontrou um modelo mais barato.

Já vi essa falha exata acontecer em contas pagantes. Um modelo não para quando a recuperação volta vazia. Ele preenche a lacuna com o que aprendeu no treinamento. Um cliente, um provedor dinamarquês de energia solar, teve o bot dele inventar alegações de assinatura e enviá-las a clientes reais. Outro fez uma pergunta ao bot e recebeu "Oxigênio (tabela periódica)" de volta. Nenhum dos casos foi um modelo ruim. Ambos foram um modelo sem nada contra o que se ancorar, e nada para impedi-lo de adivinhar.

Um gerente de suporte em nossas contas colocou a mesma preocupação em termos mais diretos, dizendo à IA o que ela não deveria fazer:

"pare de dizer aos clientes que vamos resolver isso pra eles. Você não sabe disso"

Um gerente de suporte de e-commerce, preocupado com um bot prometendo demais nas datas de entrega. O mesmo tipo de problema. O modelo parece seguro, e esse parecer seguro é a parte perigosa. O próprio detalhamento AA-Briefcase do Inkling-Small diz isso sem rodeios: 270,86 pontos Elo melhor apresentando do que analisando.

Dois caminhos para uma mesma pergunta de cliente: um modelo bruto respondendo de memória contra um modelo com grounding que avalia sua confiança e escalona
Dois caminhos para uma mesma pergunta de cliente: um modelo bruto respondendo de memória contra um modelo com grounding que avalia sua confiança e escalona

Um modelo maior não é a solução. Duas coisas com as quais nenhum modelo vem equipado são. Primeiro o grounding, para que a resposta saia da sua central de ajuda e dos seus tickets anteriores em vez da memória paramétrica. Depois um limite de confiança, para que tudo abaixo da barra vá para uma pessoa em vez de sair. Essas duas coisas transformam um motor bruto em algo que você pode apontar para uma fila em tempo real, e são o assunto inteiro da prevenção de alucinações de IA.

O outro motivo pelo qual as pessoas deixam de comparar modelos é mais mundano do que isso. Um desenvolvedor com quem falamos, montando uma base de conhecimento de incidentes de TI, já tinha dado a volta completa. Ele testou a API de um fornecedor e achou muito cara, testou outra e achou pouco confiável, e no fim só queria algo que funcionasse. Comparar modelos é divertido. Manter uma camada de modelo não é.

Experimente o eesel

Se o modelo que você está escolhendo vai responder perguntas de clientes, o conselho honesto vem em duas partes. Escolha o que dos oito acima se encaixa no seu orçamento e na sua licença. Depois não construa você mesmo a camada acima dele.

Essa camada é o que o eesel é. Ele se conecta ao Zendesk, Freshdesk ou qualquer outra coisa que você já use, aprende com seus tickets resolvidos anteriores e sua central de ajuda em vez dos dados de treinamento de um modelo, e só responde depois de passar um limite de confiança que você mesmo define. Tudo abaixo disso escalona. E antes de tocar no tráfego real, você pode simulá-lo contra o seu próprio histórico de tickets, é assim que você aprende o que ele teria errado antes que um cliente descubra.

O painel do helpdesk de IA do eesel, onde um colega de equipe de IA resolve e redige tickets de suporte
O painel do helpdesk de IA do eesel, onde um colega de equipe de IA resolve e redige tickets de suporte

Coloco nossa própria taxa de erro factual medida de 7% no topo em vez de escondê-la, porque esse é o número que importa enquanto você escolhe um modelo. Ela veio do tráfego real do Zendesk de uma joalheria alemã, cerca de mil tickets por mês, validada de forma cruzada em 284 conversas e 100 tickets, com recuperação sobre a central de ajuda real deles. O grounding não vai te levar a zero. Ele te dá um número que você pode medir, aplicar um limite e depois melhorar, e isso é uma categoria de coisa diferente de um modelo adivinhando com confiança.

O posicionamento comercial deliberadamente não é por assento. A cobrança é feita por ticket resolvido, então os preços acompanham o trabalho feito, não o quadro de funcionários. Gratuito para testar. Se você preferir verificar os números primeiro, o guia de deflexão de tickets é um bom ponto de partida.

Minha opinião

O Inkling-Small é um bom modelo pequeno a quem continuam pedindo para fazer um trabalho para o qual não foi feito. Ele executa bem e a um preço já perto do fundo, e sua confiabilidade de conhecimento mede -9,0. Esses dois fatos não estão em tensão. Juntos, eles descrevem uma ferramenta.

Está saindo pelo custo? Escolha o DeepSeek V4 Flash e está resolvido. Se as respostas erradas são o que está te empurrando para fora, suba para o Inkling pai pela solução barata, ou para o Claude Opus 5 pela cara, e entre sabendo que nenhuma das duas te leva a zero.

E se o motivo é a janela de contexto não corresponder à ficha, o GLM-5.2 entrega o que anuncia, sob MIT. Essa é a linha que eu escolheria se fosse forçado a ficar com uma só.

O veredito honesto sobre os oito, porém, continua o mesmo. Trocar de motor move sua conta e suas pontuações de benchmark. Não muda o que acontece quando um cliente pergunta algo que sua documentação nunca respondeu. Fechar essa lacuna exige recuperação, um limite de confiança, um handoff. Nenhum upgrade de modelo faz isso por você, e vale a pena resolver isso antes de gastar mais uma tarde lendo benchmarks de classificação de tickets com IA.

Perguntas frequentes

Quais são as melhores alternativas ao Inkling-Small?
Para a maioria das equipes, tudo se resume a três: DeepSeek V4 Flash se você quer o mesmo trabalho mais barato, Inkling em si se você quer ficar na mesma família com melhor precisão factual, e Claude Opus 5 se uma resposta errada custa dinheiro real. A lista completa deste artigo também cobre GLM-5.2, MiniMax M3, Kimi K3, Qwen3.8-Max e Gemini 3.6 Flash.
Existe uma alternativa mais barata ao Inkling-Small?
Sim. Os preços do DeepSeek V4 Flash são de $0,14 de entrada e $0,28 de saída por milhão de tokens, contra $0,30 e $1,20 do Inkling-Small, então a saída sai cerca de quatro vezes mais barata. O MiniMax M3 iguala exatamente o preço do Inkling-Small abaixo de 512K de entrada. Se você está tentando reduzir seu custo por resolução, o item do modelo raramente é o maior.
Por que trocar o Inkling-Small por outra opção?
Pela confiabilidade de conhecimento. A Artificial Analysis dá ao Inkling-Small uma nota de -9,0 no índice AA-Omniscience, com 30,5% de precisão, enquanto seu modelo pai está em 2,05 com 39,95%. Essa diferença aparece como alucinações de IA no suporte quando o modelo recebe uma pergunta que sua base de conhecimento não cobre.
O Inkling-Small realmente tem uma janela de contexto de 1M?
A ficha do modelo diz 1M e nenhum dos dois provedores entrega isso. A Thinking Machines entrega 256.000 tokens e a DeepInfra 524.288, segundo a Artificial Analysis. A mesma diferença existe no modelo pai. Se o contexto longo foi o motivo da sua escolha, confira o explicador do Inkling-Small antes de construir em torno de 1M.
Qual alternativa ao Inkling-Small tem a melhor licença aberta?
DeepSeek V4 Flash e GLM-5.2 são lançados sob a licença MIT, a posição comercial mais limpa do grupo. Inkling-Small e seu modelo pai são Apache 2.0. Kimi K3 e MiniMax M3 carregam licenças próprias com limiares de receita, e a da MiniMax é não comercial por padrão. Para um panorama mais completo, veja nosso apanhado de agentes de IA de código aberto.
Quanto custa executar uma alternativa ao Inkling-Small em tickets de suporte?
Os tokens são o número pequeno. A $1,20 por milhão de tokens de saída, um mês com mil tickets custa alguns dólares em inferência. O que custa dinheiro é a camada de recuperação, a lógica de escalonamento e a garantia de qualidade, por isso as equipes costumam comprar essa camada em vez de construí-la. Nossa página de preços cobra por ticket resolvido em vez de por assento, e o custo do atendimento ao cliente com IA detalha as contas.
Posso hospedar eu mesmo uma alternativa ao Inkling-Small em vez de pagar por token?
Pode, e os pesos de DeepSeek V4 Flash, GLM-5.2, Kimi K3 e MiniMax M3 estão todos publicados. A conta se move para o hardware em vez de desaparecer, e você herda o serviço, as avaliações e as atualizações. Equipes que seguem esse caminho para o atendimento ao cliente com IA costumam descobrir que o modelo nunca foi a parte difícil.
O Inkling-Small é bom o suficiente para atendimento ao cliente por conta própria?
Não por conta própria, e nada mais nesta lista também não é. Um modelo bruto responde a partir dos dados de treinamento quando a recuperação volta vazia, que é exatamente como uma resposta errada dita com confiança chega a um cliente. A solução é o grounding somado a um limite de confiança que faz o encaminhamento, que é o que tratam a gestão de escalonamento com IA e o handoff para um agente.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Um modelo pequeno posto de lado enquanto cinco modelos alternativos captam a luz
Alternatives

8 melhores alternativas ao Inkling-Small em 2026

O Inkling-Small é barato e rápido, mas sua pontuação de conhecimento medida é negativa. Aqui estão 8 alternativas ao Inkling-Small, com preços reais e a pegadinha de cada uma.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Uma coluna alta e ornamentada ao lado de oito colunas menores de design variado
Alternatives

8 melhores alternativas ao Claude Opus 5 em 2026

O Claude Opus 5 lidera o índice independente por 1,8 pontos e custa 86 vezes mais por tarefa do que o modelo dez pontos abaixo. Oito alternativas, com preço baseado no custo medido por tarefa.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Um desenvolvedor escolhendo entre cartões de modelos, com o cartão da baleia DeepSeek no centro rodeado por modelos rivais
Alternatives

As 8 melhores alternativas ao DeepSeek V4 Flash em 2026

Oito alternativas reais ao DeepSeek V4 Flash, comparadas pelos números. Ninguém troca por preço ou velocidade, então eu as classifico pelas quatro lacunas reais que o Flash tem.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Ilustração de uma pessoa avaliando vários super-agentes de IA como alternativas ao Skywork AI
Alternatives

7 melhores alternativas ao Skywork AI em 2026

As melhores alternativas ao Skywork AI em 2026, de super-agentes gerais como Manus a ferramentas de pesquisa, criadores de apresentações e uma opção focada apenas em suporte, com preços reais.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Um usuário falando com três opções diferentes de agente de voz, com o logotipo da Grok à esquerda
Alternatives

As 10 melhores alternativas ao Grok Voice Think Fast 2 em 2026

O Grok Voice Think Fast 2.0 acabou de ficar 60% mais caro no alias padrão. Dez alternativas reais, com custo medido por hora e números honestos de benchmark.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Uma pessoa ao telefone diante de três opções diferentes de agente de voz, com o logotipo da Grok à esquerda
Alternatives

As 10 melhores alternativas ao Grok Voice Think Fast 2 em 2026

O Grok Voice Think Fast 2.0 ficou 60% mais caro no alias padrão. Dez alternativas reais, com custo por hora medido e números de benchmark honestos.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Ilustração editorial de capa para uma seleção de alternativas ao Google Gemini 3.5 Pro
Alternatives

8 melhores alternativas ao Gemini 3.5 Pro em 2026

Procurando alternativas ao Gemini 3.5 Pro? O problema: o 3.5 Pro ainda não foi lançado. Aqui estão 8 modelos que você pode usar hoje, com preços reais e recomendações.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA de ponta como alternativas ao GPT-5.6 Sol
Alternatives

9 melhores alternativas ao GPT-5.6 Sol em 2026

O GPT-5.6 Sol é o topo de linha da OpenAI a preço de topo de linha: 5$/30$ por 1M de tokens, a mesma tarifa do GPT-5.5. Aqui estão 9 alternativas reais ao Sol e para quem cada uma serve.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
As melhores alternativas ao GPT-Live em 2026, um panorama de ferramentas de IA de voz em tempo real
Alternatives

As 8 melhores alternativas ao GPT-Live em 2026

O GPT-Live impressiona, mas não é a única IA de voz em tempo real que vale a pena conhecer. Aqui estão 8 alternativas ao GPT-Live em 2026, do Gemini Live aos construtores de agentes de voz.

Rama Adi NugrahaRama Adi NugrahaJul 13, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis