
Inkling-Small em 30 segundos
| Lançamento | 30 de julho de 2026, quinze dias após o Inkling |
| Fabricante | Thinking Machines Lab (Mira Murati) |
| Tamanho | 276B no total, 12B ativos, 42 camadas |
| Licença | Apache 2.0, pesos no Hugging Face |
| Contexto | 1M de tokens na ficha, 524K via OpenRouter |
| Entradas | Texto, imagem, áudio (WAV a 16 kHz) |
| Preço da API | $0,30 a $0,50 de entrada, $1,20 de saída por 1M |
| Piso para auto-hospedagem | 89 GB em quantização de 2 bits |
| Melhor em | Codificação, uso de ferramentas, loops de agentes, contexto longo |
| Mais fraco em | Recall factual sem retrieval |
O que o Inkling-Small realmente é
A parte interessante está na arquitetura, e ela explica os dois lados dos resultados.
O Inkling-Small é um transformer somente-decodificador de 42 camadas, com uma pilha feed-forward esparsa do tipo mixture-of-experts. Cada token é roteado para 6 de 256 especialistas, além de 2 especialistas compartilhados que disparam em todo e qualquer token. O total de parâmetros chega a 276B; apenas 12B deles ficam ativos por token. A ficha do modelo confirma camadas de atenção híbridas locais e globais, numérica em BF16 e NVFP4, e treinamento em sistemas NVIDIA GB300 NVL72.
Compare com o modelo pai. O Inkling tem 975B no total e 41B ativos ao longo de 66 camadas, então o formato do roteamento é o mesmo, mas com aproximadamente um quarto da massa total e menos de um terço da massa ativa. A Thinking Machines descreve o resultado como "desempenho comparável ao Inkling com um quarto do seu tamanho".
Essa proporção é toda a história aqui. Uma grande proporção entre total e ativo é o que torna um modelo barato de servir, e um total de parâmetros pequeno é o que o torna esquecido. O Inkling-Small apostou forte no primeiro ponto e pagou o preço no segundo. Para a versão geral desse mecanismo, modelos de IA personalizados percorre a mesma troca sem todas as tabelas de benchmark.
Ele recebe texto, depois imagens (entre 40 e 4096 pixels funciona melhor), e áudio como WAV a 16 kHz, idealmente com menos de dois minutos. A saída é somente texto. O esforço de raciocínio é um controle de 0 a 0,99, onde baixo é 0,2, médio fica em 0,7 e máximo é 0,99, então a cada chamada é possível trocar tokens de pensamento por latência.
A entrada de áudio nativa é o item mais raro dessa lista, motivo pelo qual esse modelo continua aparecendo em conversas sobre voz. Vale sinalizar a limitação: áudio entra, texto sai, então não há nenhuma síntese de fala aqui. Fornecedores que fecham esse ciclo são cobertos em empresas de voz com IA.
Para qual tarefa o Inkling-Small é indicado?
A resposta muda bastante dependendo da carga de trabalho, e para cada uma delas a própria tabela do fabricante traz as evidências. Escolha a tarefa que você realmente tem:
Os benchmarks: ele realmente supera o pai
Um modelo destilado ou reduzido normalmente fica um pouco atrás do carro-chefe do qual se originou. O Inkling-Small não fica, pelo menos não nas categorias pelas quais a maioria das pessoas compra um modelo.

Em codificação, ele vence o SWEBench Verified com 80,2% contra 77,6%, depois o SWEBench Pro com 55,9% contra 54,3%, com o Terminal Bench 2.1 em 64,7% contra 63,8%. No lado agêntico, ele vence o Toolathlon Verified com 54,4% contra 45,5% e o MCP Atlas com 79,6% contra 76,0%, além de um Elo do GDPval-AA v2 de 1269 contra 1238. No raciocínio geral, ele vence o GPQA Diamond com 89,5% contra 87,2%, e o Humanity's Last Exam com 31,6% contra 29,7% na versão só de texto.
Ele também publica números que a ficha do modelo pai nem sequer reporta. SciCode 48,7%, CritPt 8,3%, depois ARC-AGI-1 com 84,0% e ARC-AGI-2 com 40,1%. No seguimento de instruções, o IFBench chega a 82,2% contra 79,8%, e isso importa mais do que parece para qualquer coisa que precise obedecer a um prompt de sistema de forma confiável. Se esse é o eixo que importa para você, agente de IA versus chatbot baseado em regras explica por que, na produção, obediência supera inteligência bruta.
As perdas no lado do raciocínio são reais, mas estreitas. O AIME 2026 cai para 95,5% partindo de 97,1%. O Tau 3 Banking cai para 15,5% partindo de 23,7%, a regressão mais acentuada de todo o bloco agêntico, e vale notar se sua carga de trabalho se parece com fluxos financeiros estruturados.
Outro resultado merece um alerta, porque é fácil de passar despercebido. O Global-MMLU-Lite, o teste multilíngue, cai para 86,7% partindo de 88,7%. Uma queda de dois pontos, então nada dramático, mas aponta na mesma direção dos números de factualidade: o corte saiu da amplitude do conhecimento. Se você atende vários idiomas, teste em cada um deles em vez de confiar no agregado, e agentes de suporte multilíngues cobre como esse teste é feito na prática.
De forma independente, a Artificial Analysis dá a ele 40 pontos no Intelligence Index, na posição #15 de 101, contra 41 e a posição #13 do Inkling completo. Apenas um ponto de índice de diferença, com um quarto do tamanho. Pontuação do fabricante e de terceiros independentes chegarem à mesma conclusão é incomum, e é o ponto mais forte de toda esta análise.
O único número que deveria fazer você parar
Aqui está a parte que não entrou no post de lançamento.
O SimpleQA Verified, que testa se um modelo conhece respostas factuais curtas, marca 20,6% para o Inkling-Small contra 43,9% para o Inkling. Menos da metade. E o AA Omniscience, que compensa respostas corretas contra respostas erradas ditas com confiança, marca -9,0 onde o modelo pai obtém +2,1.
Uma pontuação negativa no Omniscience significa que o modelo afirma mais coisas erradas com confiança do que coisas certas. Este não é um modelo que diz "não tenho certeza". É um modelo que preenche a lacuna. A própria Thinking Machines lista isso entre as limitações conhecidas, citando "alucinação (gerar conteúdo plausível, mas factualmente incorreto ou sem suporte)" e "desempenho degradado em conversas longas com múltiplos turnos", e recomenda não implantá-lo em contextos médicos, jurídicos ou de segurança crítica sem fine-tuning adicional. Vale o crédito: essa é uma seção de limitações mais franca do que a maioria dos laboratórios se dá ao trabalho de publicar.
Para um agente de código isso quase não importa, já que o compilador funciona como verificador de fatos. Para qualquer coisa voltada ao cliente, importa muito, e eu mesmo já vi esse modo de falha em produção. Uma equipe de suporte com quem trabalhei tinha uma base de conhecimento dizendo que davam suporte a todos os modelos de veículos, e por isso o bot confirmava alegremente cobertura para marcas de carros que nem sequer estavam no banco de dados deles. Nada alucinado no sentido dramático. O modelo simplesmente preencheu uma lacuna com algo plausível. Essa equipe descreveu sua configuração inicial como "tentativa e erro no começo".
Um modelo com -9,0 no Omniscience é esse mesmo modo de falha com o volume no máximo. As mitigações são conhecidas e nada empolgantes: retrieval sobre fontes que você controla, citações que uma pessoa pode verificar, e um caminho de recusa. Alucinações de IA no suporte cobre o conjunto completo, e a versão prática mais curta é prevenção de alucinações de IA.
Preço e velocidade: o verdadeiro motivo para se importar
É aqui que o modelo pequeno conquista seu lugar no mundo.
| Inkling-Small | Inkling | |
|---|---|---|
| Entrada por 1M | $0,30 a $0,50 | $1,00 |
| Saída por 1M | $1,20 | $4,05 |
| Misto (AA) | $0,22 | $0,72 |
| Velocidade de saída | 131,1 tok/s | 84,8 tok/s |
| Tempo até o primeiro token | 1,65 s | 1,82 s |
| Provedores | 2 | 4 |
| AA Intelligence Index | 40 | 41 |
Os tokens de saída custam 3,4 vezes menos e chegam 1,5 vez mais rápido, em troca de um ponto de índice de inteligência. Para loops de agentes, onde os tokens de saída dominam a conta e a latência se acumula ao longo de dezenas de turnos, essa não é uma diferença marginal. Isso também aparece nos números que uma equipe de suporte realmente reporta, porque primeiros tokens mais rápidos movem a resolução no primeiro contato junto com o restante das métricas de atendimento ao cliente que derivam dela.
Duas ressalvas antes de sair orçando em cima disso. O preço de entrada ainda não está definido: a Artificial Analysis lista $0,30 por 1M, enquanto a listagem da OpenRouter mostra $0,45 e a API dela retorna $0,50, então confira sua própria rota. Além disso, há apenas dois provedores até agora, contra quatro do modelo pai, o que é pouco se você precisa de failover.
A segunda ressalva é a mais surpreendente. A ficha do modelo diz 1M de contexto. A OpenRouter atualmente o serve a 524.288 tokens, exatamente a metade. Os pesos suportam a janela completa, a API roteada simplesmente ainda não a expõe. Se um milhão de tokens era o motivo para escolher esse modelo, auto-hospede ou verifique com seu provedor antes. Tamanho da janela de contexto explica por que o número anunciado e o número realmente utilizável divergem tão frequentemente.
O negócio real da Thinking Machines é o Tinker, sua plataforma hospedada de fine-tuning com LoRA, e o Inkling-Small é suportado nele. O armazenamento de checkpoints custa $0,10 por GB ao mês; as tarifas de treinamento por token não são publicadas na página de visão geral.
Rodando o Inkling-Small por conta própria
Auto-hospedar é a melhoria mais clara em relação ao modelo pai, e aqui os números não estão nem perto de empatar.

Os números da Unsloth colocam o Inkling-Small em 543 GB em BF16, depois entre 132 e 170 GB em 4 bits, 128 GB em 3 bits, e 89 GB em 2 bits. O Inkling completo precisa de 1.900 GB em BF16 e ainda exige entre 270 e 285 GB mesmo com quantização de 1 bit. A ficha do modelo enquadra a mesma coisa em termos de hardware: 600 GB de VRAM agregada para BF16 (4x B300 ou 8x H200), caindo para 180 GB no checkpoint NVFP4, ou seja, um B300 ou um par de H200.
O número de 89 GB é o que muda quem consegue rodar isso. Isso cabe dentro de uma máquina com 128 GB de memória unificada, o que é uma compra de estação de trabalho, não de data center. E como apenas 12B de parâmetros ficam ativos por token, uma build fortemente quantizada continua utilizável em vez de arrastar.
As configurações de amostragem recomendadas são temperatura 1,0, top_p 1,0 e min_p 0,0, em um contexto de 1.048.576 tokens. O suporte desde o primeiro dia cobre transformers, vLLM, SGLang, TokenSpeed, Unsloth e Docker Model Runner, com builds quantizadas via llama.cpp, Ollama, LM Studio e Jan. Um ponto de atenção: o llama.cpp precisa do PR #25731 mesclado. Opções mais amplas de auto-hospedagem estão em melhores agentes de IA open source.
Prós e contras
O que é bom
- Supera um modelo 3,5 vezes maior em codificação e uso de ferramentas, além de seguimento de instruções
- $1,20 por milhão de tokens de saída, ou seja, 3,4 vezes mais barato que o pai
- 131 tokens por segundo, uma velocidade significativamente maior
- Apache 2.0, então a auto-hospedagem comercial não é restrita
- Roda com 89 GB quantizado, dentro da faixa de uma workstation
- Entrada nativa de áudio e imagem, ainda incomum nesse preço
- Uma seção de limitações franca vinda do próprio fabricante
O que não é
- SimpleQA Verified em 20,6%, menos da metade do modelo pai
- AA Omniscience em -9,0, ou seja, mais respostas erradas ditas com confiança do que corretas
- Contexto de 1M no papel, mas 524K via OpenRouter hoje
- Apenas dois provedores de API, o que deixa o failover escasso
- Tau 3 Banking cai para 15,5% partindo de 23,7%
- As pontuações de áudio ficam levemente atrás do modelo pai nos três testes
- Saída somente em texto, então não gera imagem nem áudio
O que a comunidade diz
A reação foi bem mais discreta do que o lançamento do carro-chefe, que atraiu mais de 1.200 pontos no Hacker News. O próprio tópico do Inkling-Small ficou com 33 deles. Compará-lo com o resto do cenário foi o primeiro instinto:
"better than haiku 4.5 smaller than nemotron 3 ultra"
O outro comentário o colocava contra o rival óbvio de pesos abertos, observando que ele é "About the same size as DeepSeek Flash 4, but also supports audio and image input." Um enquadramento justo. O DeepSeek V4 Flash é mais barato por token e só texto, então o suporte a áudio e imagem é o verdadeiro diferencial aqui, e o detalhe do confronto direto está na análise do Flash.
O comentário mais afiado veio antes mesmo de as quantizações serem lançadas, na submissão ao Hugging Face:
"I didn't see a gguf yet, going to be most interesting if there's a quant that fits nicely into about 90 [GB] so it can run in 128GB unified memory. It's 12B active so should hopefully be pretty fast at 2 bit quant if it fits"
A build de 2 bits da Unsloth chegou a 89 GB. A comunidade de inferência local acertou o número-alvo antes mesmo de o lançamento existir, e acertou em cheio. No primeiro mês, o repositório no Hugging Face registrou 15.500 downloads.
Uma coisa que notei: ninguém naqueles tópicos mencionou a regressão de factualidade. O enquadramento do lançamento foi velocidade e tamanho, então foi disso que se falou.
O que isso significa se você quer que ele responda tickets
Aqui vou ser direto, porque essa parte é literalmente o meu trabalho.
Um modelo barato e rápido parece uma vitória óbvia para o suporte. O volume de tickets é alto, as respostas são curtas, e 1,20 dólar por milhão de tokens de saída contra 4,05 é dinheiro de verdade em escala. Essa é a aritmética por trás de custo do atendimento ao cliente com IA, e é a mesma conta que move a comparação com agente humano. Equipes que acompanham isso como custo unitário costumam chegar ao custo por resolução.
Mas o suporte é a única carga de trabalho em que -9,0 no Omniscience se torna o número desqualificador, e não uma nota de rodapé. Um agente de código que inventa uma API recebe de volta um stack trace. Um agente de suporte que inventa um prazo de devolução, em vez disso, envia isso a um cliente, por escrito, com a sua logo estampada. Os compradores com quem converso já sabem disso, e é a objeção que surge primeiro. Uma líder de CX de uma marca de suplementos DTC colocou isso da forma mais direta possível:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a DTC supplements CX lead, from an eesel sales call
Isso é um pedido por uma camada, não por um modelo. Quatro coisas precisam ficar entre qualquer modelo e a sua fila.
- Retrieval sobre fontes que você possui, para que as respostas venham da sua central de ajuda e de tickets passados, e não dos pesos. Chatbot de base de conhecimento com IA cobre o padrão; do lado das ferramentas há melhores ferramentas de base de conhecimento com IA.
- Roteamento por confiança, para que o modelo responda ao que tem certeza e escale o resto. O lado do roteamento é gestão de escalonamento com IA; a transferência limpa para um humano é transferência de agente.
- Um teste seco antes de ir ao ar, simulado contra seus próprios tickets históricos, e não contra a suíte de benchmark de outra pessoa. Essa é a etapa que as equipes costumam pular, e também a que pega as respostas erradas ditas com confiança.
- Autonomia delimitada, começando como copiloto que escreve rascunhos antes de responder por conta própria. Copiloto de IA é a rampa de entrada; a deflexão de nível 1 é aonde se chega, medida pela taxa de deflexão.
Faça essas quatro coisas e a lacuna de factualidade do Inkling-Small deixa de ser um passivo, porque os fatos param de sair do modelo. Pule-as e o que você comprou é uma fonte rápida, barata e confiante de respostas plausíveis. Essa é a diferença entre um agente de IA para helpdesk e uma chave de API crua, e é a mesma conclusão a que agentes de IA versus chatbots de IA chega pela outra direção.
Esse também é o motivo pelo qual uma boa camada de suporte permanece agnóstica em relação ao modelo. O Inkling-Small não é o primeiro modelo deste ano a se tornar a opção barata óbvia, e não será o último. Qualquer coisa fixada em um único modelo precisa ser refeita toda vez que o ranking se mexe, o que é uma péssima forma de rodar a automação de atendimento ao cliente.
Veredito
Para a maioria das tarefas, o Inkling-Small é a melhor compra em relação ao próprio modelo pai, e no preço nem é perto. Mesmo patamar de inteligência segundo a pontuação independente. Melhor em codificação e uso de ferramentas segundo os próprios números do fabricante, 3,4 vezes mais barato na saída, 1,5 vez mais rápido, Apache 2.0, e pequeno o suficiente para ser auto-hospedado em uma workstation. Quinze dias depois do carro-chefe, o modelo pequeno tornou o carro-chefe difícil de justificar.
A ressalva é específica e fácil de enunciar: ele sabe mensuravelmente menos, e não se comporta como tal. Dê a ele um compilador, um loop de ferramentas ou uma camada de retrieval e ele é excelente. Peça para ele ser a fonte da verdade e ele vai errar com confiança.
Se você quer para código ou agentes, adote hoje mesmo. Se quer perto de clientes, orce a camada acima dele, não só os tokens.
Para o panorama mais amplo do que mais se encaixa nesse espaço, comece por alternativas ao Inkling. O rival mais próximo em preço e tamanho tem seu próprio detalhamento em análise do Kimi K3.
E se o trabalho real é organizar uma caixa de entrada em vez de escrever código, triagem de tickets de suporte é a leitura mais útil, com a deflexão de tickets cobrindo o que acontece depois dessa triagem.
Try eesel
Escolheu o Inkling-Small e agora precisa que ele responda tickets reais com segurança? Essa lacuna é exatamente o que a eesel fecha. Ela se conecta ao Zendesk, Freshdesk, Gorgias ou qualquer helpdesk que você use em poucos minutos, aprende com seus tickets resolvidos e com sua central de ajuda em vez dos pesos do modelo, e então só responde àquilo de que tem certeza, deixando o resto para a sua equipe. Antes de tocar em uma fila real, você pode simulá-la contra o seu próprio histórico de tickets e ver as respostas reais que ela teria enviado, que é a verificação que uma pontuação de factualidade de -9,0 torna inegociável. Ela também permanece agnóstica em relação ao modelo, então o próximo modelo barato é uma mudança de configuração, não uma reconstrução.

Gratuito para testar, e cobrado por uso, então dá para conferir os preços antes de se comprometer. Try eesel ou veja como ele se encaixa como software de atendimento ao cliente com IA.
Sources
- Inkling-Small model card
- Introducing Inkling-Small
- Inkling model card
- Inkling-Small on Hugging Face
- Artificial Analysis: Inkling-Small
- Artificial Analysis: Inkling
- Unsloth: running Inkling locally
- OpenRouter: Inkling-Small
- Tinker fine-tuning platform
- Hacker News: Inkling-Small
- Hacker News: Hugging Face submission
Perguntas frequentes
Vale a pena usar o Inkling-Small?
O Inkling-Small é melhor que o Inkling?
Quanto custa o Inkling-Small?
É possível rodar o Inkling-Small localmente?
O Inkling-Small é bom para atendimento ao cliente?
Qual é a janela de contexto do Inkling-Small?
O Inkling-Small é gratuito e de código aberto?
thinkingmachines/Inkling-Small, então é possível auto-hospedar e usar comercialmente. Gratuito para baixar não significa gratuito para rodar, e a conta de hardware substitui a conta de tokens. A Thinking Machines também vende acesso via Tinker, sua plataforma hospedada de fine-tuning.Quem cria o Inkling-Small e quando ele foi lançado?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







