
O que o Inkling-Small realmente é
A Thinking Machines Lab é a empresa de Mira Murati, e seu modelo de negócio é distribuir os pesos de graça e vender as ferramentas em torno deles. O Inkling-Small é o segundo modelo a sair pela porta: Apache 2.0, publicado no Hugging Face como thinkingmachines/Inkling-Small, e baixado cerca de 15.500 vezes em seu primeiro mês.
O fornecedor o chama de "um quarto do tamanho" do original, e, por uma vez, o número de marketing se confirma. O pai tem 975B totais / 41B ativos em 66 camadas. Este tem 276B totais / 12B ativos em 42 camadas. Isso é realmente próximo de um quarto em ambos os aspectos.

A arquitetura é um Mixture-of-Experts bastante agressivo. Cada camada contém 256 especialistas, e o roteador escolhe 6 deles por token, mais 2 especialistas compartilhados que ficam sempre ativos. A atenção é híbrida, alternando camadas locais e globais, e os pesos são distribuídos tanto em BF16 quanto em NVFP4. O treinamento foi executado em hardware NVIDIA GB300 NVL72.
A consequência prática dessa forma: você paga 276B em memória e 12B em computação. Esse é todo o truque, e é por isso que um modelo com um quarto de trilhão de parâmetros pode servir mais rápido que um modelo denso com um décimo de seu tamanho. Se o vocabulário de MoE for novo para você, a mecânica se generaliza para a maioria dos agentes de IA de código aberto atuais.
Também existe um controle de esforço de raciocínio que vai de 0 a 0,99, com os pontos sugeridos pelo fornecedor em 0,2 para baixo, 0,7 para médio e 0,99 para máximo. É um botão sobre quanto tempo o modelo pensa antes de responder, e ele move sua conta de tokens mais do que qualquer outra configuração que você ajustar.
O que entra e o que sai
Esta é a parte que as pessoas erram com mais frequência, então vale a pena ser direto.

As entradas são texto, imagens entre 40 e 4096 pixels, e áudio como WAV de 16kHz com menos de dois minutos. A saída é apenas texto. Não há síntese de voz neste modelo.
Isso importa se você estava planejando uma linha telefônica. Um modelo que ouve áudio mas não pode falar é apenas metade de um pipeline de voz, e você ainda precisa de texto-para-fala, telefonia, tratamento de barge-in e detecção de turno por cima. Se esse for o projeto, o panorama de fornecedores em empresas de voz com IA é um ponto de partida melhor do que um modelo cru.
A compreensão de áudio também é a única capacidade em que o modelo pequeno perdeu terreno para o pai em todos os aspectos: VoiceBench 90,1 contra 91,4, Audio MC 54,9 contra 56,6, MMAU 77,0 contra 77,2. As diferenças são pequenas, mas todas apontam na mesma direção.
A janela de contexto em que ninguém concorda
Aqui está uma constatação verificável que levou dois minutos e economiza uma tarde.
A ficha do modelo diz que a janela de contexto é de 1M de tokens. A OpenRouter, uma de apenas duas provedoras que o oferecem, o hospeda com 524.288 tokens. Isso é exatamente a metade, o que indica uma decisão de hospedagem deliberada, não um erro de digitação.
Nenhum dos dois números é mentira. Um descreve o que a arquitetura pode endereçar, o outro descreve o que um endpoint específico aceitará hoje. O padrão de falha é projetar um pipeline de recheio de documentos com base no número da ficha e bater numa parede em produção. Se você está construindo algo que depende de uma janela longa, leia o limite no endpoint que você está realmente chamando. A mesma armadilha pega quem usa agentes de codificação, motivo pelo qual escrevi sobre o tamanho da janela de contexto separadamente.
O número de provedores é o outro ponto fraco: 2 provedores, contra 4 do modelo pai. Para um modelo em seu quinto dia da segunda semana, isso é esperado, mas significa menos margem em caso de falha.
Quanto custa
O preço da saída está definido. US$ 1,20 por 1M de tokens de saída, confirmado pelo fornecedor, pela Artificial Analysis e pela OpenRouter. Contra os US$ 4,05 do pai, essa é a manchete.
O preço da entrada não está definido, e prefiro dizer isso do que escolher um número e parecer confiante:
| Fonte | Entrada por 1M | Saída por 1M |
|---|---|---|
| Artificial Analysis | US$ 0,30 | US$ 1,20 |
| Página do modelo na OpenRouter | US$ 0,45 | US$ 1,20 |
| Resposta da API da OpenRouter | US$ 0,50 | US$ 1,20 |
| Modelo pai (Inkling) | referência | US$ 4,05 |
Se você planejar o orçamento com base em US$ 0,50, nada vai te surpreender. Em base combinada (blended), a Artificial Analysis posiciona o Inkling-Small em US$ 0,22 por 1M contra US$ 0,72 do pai, ou seja, aproximadamente um terço do custo para o mesmo nível de inteligência.
A velocidade é a metade subestimada do negócio. 131,1 tokens de saída por segundo contra os 84,8 do pai, com tempo até o primeiro token de 1,65s contra 1,82s. No Intelligence Index dele, o modelo pequeno marca 40 pontos e fica em 15º de 101, contra 41 pontos e 13º lugar do pai. Mesma categoria, mais rápido, mais barato. Essa é uma combinação incomum e o principal motivo para se interessar por este lançamento.
O fine-tuning passa pela própria plataforma Tinker da Thinking Machines, que dá suporte ao modelo. As taxas de treinamento por token não estão publicadas em nenhum lugar que eu tenha conseguido encontrar, e a página de preços em tinker-docs.thinkingmachines.ai/pricing atualmente retorna 404. O armazenamento de checkpoints custa US$ 0,10 por GB ao mês. Se o fine-tuning for o plano, a comparação com retrieval está detalhada em RAG versus fine-tuning.
Executando por conta própria
É aqui que o "grátis" dos pesos gratuitos é testado. As builds quantizadas da Unsloth trazem números reais para isso, e o número de 2 bits é o interessante: 89 GB, o que cabe numa máquina de 128 GB de memória unificada.
Há um detalhe bacana na discussão de lançamento. Um comentarista do Hacker News, andy99, disse que esperava algo em torno de 90 GB antes de qualquer quantização ter sido lançada. A Unsloth chegou a 89.
Bem no limite: 3 bits (128 GB)
Grande demais: 4 bits (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Grande demais: 4 bits começa em 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Grande demais: BF16 (543 GB)
Sugestão da ficha: 4x B300 ou 8x H200 para BF16
Entrada: US$ 0,30 a US$ 0,50 por 1M, dependendo da fonte
Provedores: 2 hoje
Duas observações práticas se você for para o local. A amostragem deve ser temperature 1,0, top_p 1,0, min_p 0,0, o que é incomum o suficiente para valer a pena anotar. E o suporte no llama.cpp chegou via PR #25731, então verifique se seu build o inclui antes de depurar problemas fantasmas.
Onde ele se encaixa, e onde realmente não se encaixa
Na própria tabela comparativa do fabricante, o modelo pequeno supera seu pai de 975B na maior parte do que se chamaria de execução. SWEBench Verified 80,2 contra 77,6, SWEBench Pro 55,9 contra 54,3, Terminal Bench 2.1 em 64,7 contra 63,8, Toolathlon 54,4 contra 45,5, MCP Atlas 79,6 contra 76,0, GPQA 89,5 contra 87,2, IFBench 82,2 contra 79,8.
Depois há a outra coluna. O AIME cai para 95,5 a partir de 97,1. O Global-MMLU-Lite cai para 86,7 a partir de 88,7, algo que vale a pena destacar se você estava planejando um agente de suporte multilíngue sobre ele. E o Tau 3 Banking cai de 23,7 para 15,5, a regressão isolada mais acentuada da tabela, num benchmark especificamente sobre uso de ferramentas em múltiplos turnos num cenário voltado ao cliente.
O par que mais importa para quem pensa em trabalho de suporte é o SimpleQA Verified em 20,6% contra os 43,9% do pai, junto com uma pontuação de Omniscience de -9,0 contra +2,1 do pai. Uma pontuação de Omniscience negativa significa que o modelo erra com mais confiança do que acerta. Ninguém nas threads de lançamento mencionou isso, o que é uma pena, porque é o número mais relevante para a decisão em todo o lançamento.
Quero ser justo aqui, porque isso é uma escolha de design, não um defeito. Um modelo com 12B ativos tem menos espaço para memorizar o mundo do que um com 41B ativos, e a Thinking Machines claramente gastou esse espaço em raciocínio e uso de ferramentas em vez disso. Se seu modelo vai consultar informações de qualquer forma, conhecimento trivial memorizado é peso morto. Essa é a aposta certa para um agente.
É a aposta errada para um bot que responde perguntas de memória. É exatamente o tipo de falha que já vi acontecer em tempo real. Uma equipe de suporte técnico B2B com quem trabalhei descobriu que seu bot confirmava "sim, oferecemos suporte ao seu modelo de veículo" para veículos que não estavam no banco de dados deles, porque a central de ajuda dizia que a empresa dava suporte a todos os modelos. O modelo não estava quebrado. Ele estava fazendo inferência confiante sobre uma fonte vaga, exatamente o que uma pontuação de Omniscience negativa prevê. Escrevi o padrão completo em prevenção de alucinações.
Então a leitura honesta: use o Inkling-Small onde uma camada de retrieval fornece os fatos e o modelo fornece o raciocínio. Não o use como fonte de verdade.
O que significa que a qualidade das suas fontes se torna o teto da precisão do modelo, e escolhê-las bem é uma palanca maior do que escolher o checkpoint. Meu apanhado de ferramentas de base de conhecimento é o ponto de partida prático.
O que isso significa se você for colocar IA numa fila de suporte
Um modelo é um motor, não um carro. Essa distinção é o cerne de agentes de IA versus chatbots, e é por isso que uma tabela de benchmarks te diz tão pouco sobre uma fila.
A lacuna entre "isso tem bom desempenho em benchmarks" e "isso responde aos meus clientes" é o produto inteiro, e é composta majoritariamente por partes nada glamurosas:
- Grounding. O modelo precisa ler sua central de ajuda, suas macros e seus tickets resolvidos, não os dados de treinamento dele. Esse é o trabalho de uma camada como um chatbot de base de conhecimento com IA.
- Roteamento por confiança. Algo precisa decidir quando o modelo não deveria responder de forma alguma, o que é o cerne da gestão de escalonamento com IA.
- Um teste (dry run). Você quer saber a taxa de resolução antes dos clientes, não depois. A simulação contra o seu próprio histórico de tickets é a única forma honesta de obter esse número.
- Handoff. Quando a IA para, um humano assume no meio da conversa com contexto completo, conforme as melhores práticas de handoff. A versão mais suave disso é um copiloto de IA, em que o modelo redige e um humano envia.
- Medição. A taxa de deflection é o número que decide se tudo isso funcionou. Traduza-a em dinheiro com o custo por resolução.
- Cobertura. Saber quais tópicos a IA deveria assumir é um exercício próprio, detalhado neste guia de deflection de tickets.
Uma líder de CX de suplementos DTC com quem falei resumiu o requisito numa frase: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone." Nenhum checkpoint de modelo te dá isso. Um limite de confiança e uma regra de roteamento dão, dentro de qualquer sistema de tickets com IA que você já use.
O lado das métricas dessa decisão vale a pena ler separadamente, porque "resolvido" significa coisas diferentes para equipes diferentes. Comece com métricas de suporte, depois resolução no primeiro contato.
Essa é também a resposta para a questão de construir versus comprar que um checkpoint gratuito Apache 2.0 naturalmente suscita. Os pesos são a parte mais barata do projeto. Os US$ 0,50 por milhão de tokens de entrada são a parte mais barata do projeto. As partes caras são o pipeline de retrieval, o arcabouço de avaliação (eval harness), a lógica de escalonamento e a pessoa que mantém os três no próximo trimestre.

Quer usar um modelo assim em tickets reais?
Se o preço e a velocidade do Inkling-Small chamaram sua atenção, o que você realmente quer é essa economia envolta em guardrails. A eesel se conecta ao Zendesk, Freshdesk e o resto da sua stack, treina com seus tickets passados e sua central de ajuda em vez da memória de um modelo, e permite que você simule todo o processo contra seu histórico de tickets antes de qualquer cliente ver isso. Você define o limite de confiança; tudo abaixo dele vai para um humano com contexto anexado. Grátis para testar, e você verá sua própria taxa de resolução antes de se comprometer.
Como ele se compara às outras opções de pesos abertos
A categoria de pesos abertos está lotada e as diferenças são menores do que os posts de lançamento sugerem.
| Inkling-Small | Inkling (pai) | DeepSeek V4 Flash | |
|---|---|---|---|
| Parâmetros | 276B / 12B ativos | 975B / 41B ativos | tamanho comparável |
| Entradas | texto, imagem, áudio | texto, imagem, áudio | apenas texto |
| Saída por 1M | US$ 1,20 | US$ 4,05 | menor |
| Velocidade | 131,1 tok/s | 84,8 tok/s | muito rápida |
| AA Intelligence Index | 40 (#15) | 41 (#13) | ver review |
A leitura da comunidade foi curta e razoavelmente precisa. A thread principal no Hacker News atraiu apenas 33 pontos e dois comentários, um dos quais observou que ele é "About the same size as DeepSeek Flash 4, but also supports audio and image input." Esse é o diferencial em uma frase: entrada multimodal a preço de modelo pequeno.
O vizinho mais próximo em preço e formato é o DeepSeek V4 Flash, que fica mais barato por token, mas aceita apenas texto.
No outro extremo, o Kimi K3 cobra preços de ponta por pesos abertos, o que faz os US$ 1,20 do Inkling-Small parecerem generosos em comparação.
Se você quiser a versão em formato de veredito deste artigo em vez do explicativo, é a review do Inkling-Small. O pai de 975B também tem seu próprio artigo explicativo do Inkling.
Mais dois que vale a pena olhar antes de decidir: minha review do Inkling cobre o problema de preços do pai, e alternativas ao Inkling mapeia o campo mais amplo.
Números de segurança, para completar: StrongREJECT 98,4, FORTRESS 71,6 e 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contra 1238 do pai.
Minha opinião
O Inkling-Small é o mais interessante dos dois lançamentos da Inkling, e digo isso como alguém que ficou pouco impressionado com o preço do primeiro. Ele é mais rápido e custa cerca de um terço de um modelo que ele supera na maioria dos casos, aceita áudio e imagens, e com 89 GB quantizado é o primeiro modelo dessa classe que uma equipe pequena pode possuir por completo.
As ressalvas são específicas, não vagas. Leia o teto de contexto real do seu provedor em vez do da ficha. Faça o orçamento da entrada com base em US$ 0,50. E não o trate como fonte de conhecimento, porque uma pontuação de Omniscience de -9,0 está te dizendo, de antemão, que ele vai errar com confiança.
Para qualquer coisa voltada ao cliente, o modelo é a decisão fácil. A camada de automação em torno dele é a que determina se funciona, e isso continua verdadeiro seja qual for o checkpoint que ganhar no mês seguinte.
Se este artigo te deixou pensando em um rollout em vez de um download, comece com deflection de tier 1. Depois, defina onde o modelo não deveria responder de forma alguma, o que é o trabalho da triagem de tickets.
Fontes
- Ficha do modelo da Thinking Machines Lab,
thinkingmachines/Inkling-Smallno Hugging Face (arquitetura, tabela de benchmarks, orientação de hardware, configurações de amostragem) - Artificial Analysis (Intelligence Index, throughput, TTFT, preços combinados, Omniscience)
- Página do modelo e API da OpenRouter (janela de contexto servida, preços de entrada, número de provedores)
- Tamanhos das builds quantizadas da Unsloth
- Thread de lançamento no Hacker News
- eesel Customer Voice Dossier (GENERAL BYTES, com permissão; extratos anonimizados de suporte técnico B2B e de suplementos DTC)
Perguntas frequentes
O que é o Inkling-Small?
O Inkling-Small é gratuito e de código aberto?
Quanto custa o Inkling-Small?
Qual é a janela de contexto do Inkling-Small?
Posso executar o Inkling-Small localmente?
O Inkling-Small é bom para atendimento ao cliente?
Como o Inkling-Small se compara ao DeepSeek V4 Flash e ao Kimi K3?
Que hardware o Inkling-Small exige?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







