
O que o Inkling-Small realmente é
Thinking Machines Lab é a empresa de Mira Murati, e seu modelo de negócio consiste em dar os pesos de graça e vender as ferramentas ao redor deles. Inkling-Small é o segundo modelo lançado: Apache 2.0, publicado no Hugging Face como thinkingmachines/Inkling-Small, e baixado cerca de 15.500 vezes em seu primeiro mês.
O fornecedor o chama de "um quarto do tamanho" do original, e por uma vez o número de marketing se confirma. O modelo pai tem 975B total / 41B ativos em 66 camadas. Este tem 276B total / 12B ativos em 42 camadas. Isso realmente chega perto de um quarto em ambas as contagens.

A arquitetura é um Mixture-of-Experts bastante agressivo. Cada camada tem 256 especialistas, e o roteador escolhe 6 deles por token, mais 2 especialistas compartilhados que estão sempre ativos. A atenção é híbrida, alternando entre camadas locais e globais, e os pesos são disponibilizados tanto em BF16 quanto em NVFP4. O treinamento rodou em hardware NVIDIA GB300 NVL72.
A consequência prática dessa forma: você paga 276B em memória e 12B em computação. Esse é todo o truque, e é por isso que um modelo com um quarto de trilhão de parâmetros pode atender mais rápido do que um modelo denso com um décimo do seu tamanho. Se o vocabulário de MoE for novo para você, a mecânica se generaliza para a maioria dos agentes de IA de código aberto atuais.
Também há um botão de esforço de raciocínio que vai de 0 a 0,99, com os pontos sugeridos pelo fornecedor em 0,2 para baixo, 0,7 para médio e 0,99 para máximo. É um controle de quanto tempo o modelo pensa antes de responder, e ele move sua conta de tokens mais do que qualquer outra configuração que você mexer.
O que entra e o que sai
Essa é a parte que as pessoas mais frequentemente entendem errado, então vale a pena ser direto.

As entradas são texto, imagens entre 40 e 4096 pixels, e áudio em WAV de 16kHz com menos de dois minutos. A saída é apenas texto. Não há síntese de fala neste modelo.
Isso importa se você estava planejando uma linha telefônica. Um modelo que ouve áudio mas não consegue falar é apenas metade de um pipeline de voz, e você ainda precisa de texto para fala, telefonia, tratamento de interrupções (barge-in) e detecção de turnos por cima. Se esse é o projeto, o panorama de fornecedores em empresas de IA de voz é um ponto de partida melhor do que um modelo puro.
A compreensão de áudio também é a única capacidade em que o modelo pequeno perdeu terreno para seu pai em todos os aspectos: VoiceBench 90,1 contra 91,4, Audio MC 54,9 contra 56,6, MMAU 77,0 contra 77,2. As diferenças são pequenas, mas todas apontam na mesma direção.
A janela de contexto sobre a qual ninguém concorda
Aqui está uma descoberta verificável que levou dois minutos e economiza uma tarde inteira.
A ficha do modelo diz que a janela de contexto é de 1M de tokens. A OpenRouter, um dos únicos dois provedores que o oferecem, o hospeda em 524.288 tokens. Isso é exatamente a metade, o que indica uma decisão de hospedagem deliberada, e não um erro de digitação.
Nenhum dos dois números é mentira. Um descreve o que a arquitetura pode endereçar, o outro descreve o que um endpoint específico aceita hoje. O modo de falha típico é projetar um pipeline de preenchimento de documentos com base no número da ficha e esbarrar em uma parede na produção. Se você está construindo algo que depende de uma janela longa, leia o teto no endpoint que você realmente está chamando. A mesma armadilha pega quem usa agentes de codificação, por isso escrevi sobre o tamanho da janela de contexto separadamente.
O número de provedores é o outro ponto fraco: 2 provedores, contra 4 do modelo pai. Para um modelo que está há apenas cinco dias em sua segunda semana, isso é esperado, mas significa menos margem para tolerância a falhas.
O que custa
O preço de saída está definido. $1,20 por 1M de tokens de saída, confirmado pelo fornecedor, pelo Artificial Analysis e pela OpenRouter. Contra os $4,05 do modelo pai, essa é a manchete.
O preço de entrada não está definido, e prefiro te dizer isso a escolher um número e parecer confiante:
| Fonte | Entrada por 1M | Saída por 1M |
|---|---|---|
| Artificial Analysis | $0.30 | $1.20 |
| Página do modelo na OpenRouter | $0.45 | $1.20 |
| Resposta da API da OpenRouter | $0.50 | $1.20 |
| Modelo pai (Inkling) | referência | $4.05 |
Planeje o orçamento com base em $0,50 e nada vai te surpreender. Em base combinada (blended), o Artificial Analysis coloca o Inkling-Small em $0,22 por 1M contra $0,72 do modelo pai, então cerca de um terço do custo pelo mesmo nível de inteligência.
A velocidade é a metade subestimada do negócio. 131,1 tokens de saída por segundo contra os 84,8 do modelo pai, com tempo até o primeiro token (TTFT) de 1,65s contra 1,82s. No seu Intelligence Index, o modelo pequeno pontua 40 e fica em 15º lugar entre 101, contra 41 e 13º lugar do modelo pai. Mesmo nível, mais rápido, mais barato. Essa é uma combinação incomum e a principal razão para prestar atenção a este lançamento.
O fine-tuning passa pela própria plataforma Tinker da Thinking Machines, que suporta o modelo. As taxas de treinamento por token não estão publicadas em nenhum lugar que eu tenha encontrado, e a página de preços em tinker-docs.thinkingmachines.ai/pricing atualmente retorna 404. O armazenamento de checkpoints custa $0,10 por GB por mês. Se o fine-tuning é o plano, a troca em relação ao retrieval está detalhada em RAG versus fine-tuning.
Rodando você mesmo
É aqui que o "grátis" dos pesos gratuitos é posto à prova. Os builds quantizados da Unsloth trazem números reais, e o número de 2-bit é o interessante: 89 GB, que cabem em uma máquina de 128 GB de memória unificada.
Há um detalhe interessante na discussão do lançamento. Um comentarista do Hacker News, andy99, disse que esperava algo em torno de 90 GB antes de qualquer versão quantizada ser lançada. A Unsloth chegou a 89.
Bem no limite: 3-bit (128 GB)
Grande demais: 4-bit (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Grande demais: o 4-bit começa em 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Grande demais: BF16 (543 GB)
Sugestão da ficha: 4x B300 ou 8x H200 para BF16
Entrada: de $0,30 a $0,50 por 1M, dependendo da fonte
Provedores: 2 hoje
Duas notas práticas se você for rodar localmente. A amostragem deve ser temperature 1.0, top_p 1.0, min_p 0.0, o que é incomum o suficiente para valer a pena anotar. E o suporte ao llama.cpp chegou pelo PR #25731, então verifique se o seu build o inclui antes de depurar problemas fantasmas.
Onde ele se encaixa e onde realmente não se encaixa
Na própria tabela comparativa de seu criador, o modelo pequeno supera seu pai de 975B na maioria do que se poderia chamar de execução. SWEBench Verified 80,2 contra 77,6, SWEBench Pro 55,9 contra 54,3, Terminal Bench 2.1 em 64,7 contra 63,8, Toolathlon 54,4 contra 45,5, MCP Atlas 79,6 contra 76,0, GPQA 89,5 contra 87,2, IFBench 82,2 contra 79,8.
Depois há a outra coluna. O AIME cai para 95,5 partindo de 97,1. O Global-MMLU-Lite cai para 86,7 partindo de 88,7, algo que vale a pena sinalizar se você estava planejando um agente de suporte multilíngue sobre ele. E o Tau 3 Banking cai de 23,7 para 15,5, a regressão individual mais acentuada da planilha, em um benchmark especificamente sobre uso de ferramentas em múltiplos turnos em um ambiente voltado ao cliente.
O par que mais importa para quem pensa em trabalho de suporte é o SimpleQA Verified em 20,6% contra 43,9% do modelo pai, junto com uma pontuação de Omniscience de -9,0 contra +2,1 do pai. Uma pontuação de Omniscience negativa significa que o modelo erra com mais confiança do que acerta. Ninguém nos threads de lançamento mencionou isso, o que é uma pena, porque é o número mais relevante para a tomada de decisão em todo o lançamento.
Quero ser justo aqui, porque isso é uma escolha de design, e não um defeito. Um modelo com 12B ativos tem menos espaço para memorizar o mundo do que um com 41B ativos, e a Thinking Machines claramente investiu esse espaço em raciocínio e uso de ferramentas em vez disso. Se o seu modelo vai buscar informações de qualquer forma, trivialidades memorizadas são peso morto. Essa é a aposta certa para um agente.
É a aposta errada para um bot que responde de memória. Este é exatamente o tipo de falha que já vi acontecer ao vivo. Uma equipe de suporte técnico B2B com quem trabalhei descobriu que seu bot confirmava "sim, damos suporte ao seu modelo de veículo" para veículos que não estavam no banco de dados deles, porque a central de ajuda dizia que a empresa dava suporte a todos os modelos. O modelo não estava quebrado. Ele estava fazendo uma inferência confiante sobre uma fonte vaga, exatamente o que uma pontuação de Omniscience negativa prevê. Escrevi o padrão completo em prevenção de alucinações.
Então a leitura honesta é: use o Inkling-Small onde uma camada de retrieval fornece os fatos e o modelo fornece o raciocínio. Não o use como fonte da verdade.
O que significa que a qualidade das suas fontes se torna o teto da precisão do modelo, e escolhê-las bem é uma alavanca maior do que escolher o checkpoint. Meu resumo de ferramentas de base de conhecimento é o ponto de partida prático.
O que isso significa se você vai colocar IA em uma fila de suporte
Um modelo é um motor, não um carro. Essa distinção é o cerne de agentes de IA versus chatbots, e é por isso que uma tabela de benchmarks te diz tão pouco sobre uma fila.
A lacuna entre "isso pontua bem em benchmarks" e "isso responde aos meus clientes" é o produto inteiro, e é composta em sua maioria por partes nada glamorosas:
- Grounding (fundamentação). O modelo precisa ler sua central de ajuda, suas macros e seus tickets resolvidos, não seus dados de treinamento. Esse é o trabalho de uma camada de chatbot de base de conhecimento com IA.
- Roteamento por confiança. Algo precisa decidir quando o modelo não deveria responder de jeito nenhum, o que é o núcleo da gestão de escalonamento com IA.
- Um teste seco (dry run). Você quer saber a taxa de resolução antes dos clientes, não depois. Simular contra seu próprio histórico de tickets é a única forma honesta de obter esse número.
- Transferência (handoff). Quando a IA para, uma pessoa assume no meio da conversa com contexto completo, conforme as melhores práticas de transferência. A versão mais suave disso é um copiloto de IA, em que o modelo redige e uma pessoa envia.
- Medição. A taxa de deflection é o número que decide se tudo isso funcionou. Traduza-a em dinheiro com o custo por resolução.
- Cobertura. Saber quais tópicos a IA deveria sequer assumir é um exercício em si, detalhado neste guia de deflection de tickets.
Uma líder de CX de suplementos de uma marca DTC com quem conversei resumiu o requisito em uma frase: "Preciso de uma IA que só lide com os tickets em que tem confiança e deixe todos os outros em paz". Nenhum checkpoint de modelo te dá isso. Um limiar de confiança e uma regra de roteamento dão, dentro de qualquer sistema de tickets com IA que você já use.
O lado das métricas dessa decisão vale a pena ler separadamente, porque "resolvido" significa coisas diferentes para equipes diferentes. Comece com métricas de suporte, depois resolução no primeiro contato.
Essa também é a resposta para a pergunta de construir versus comprar que um checkpoint gratuito Apache 2.0 naturalmente levanta. Os pesos são a parte mais barata do projeto. Os $0,50 por milhão de tokens de entrada são a parte mais barata do projeto. As partes caras são o pipeline de retrieval, o arcabouço de avaliação, a lógica de escalonamento, e a pessoa que mantém os três no próximo trimestre.

Quer usar um modelo assim em tickets reais?
Se o preço e a velocidade do Inkling-Small chamaram sua atenção, o que você realmente quer é essa economia envolvida em guardrails. A eesel se conecta ao Zendesk, Freshdesk e ao resto da sua stack, treina com seus tickets passados e sua central de ajuda em vez da memória de um modelo, e permite simular tudo contra seu histórico de tickets antes que um único cliente veja. Você define o limiar de confiança; tudo abaixo disso vai para um humano com contexto anexado. Grátis para testar, e você verá sua própria taxa de resolução antes de se comprometer.
Como ele se compara às outras opções de pesos abertos
A faixa de pesos abertos está lotada, e as diferenças são mais estreitas do que os posts de lançamento sugerem.
| Inkling-Small | Inkling (pai) | DeepSeek V4 Flash | |
|---|---|---|---|
| Parâmetros | 276B / 12B ativos | 975B / 41B ativos | tamanho comparável |
| Entradas | texto, imagem, áudio | texto, imagem, áudio | apenas texto |
| Saída por 1M | $1.20 | $4.05 | menor |
| Velocidade | 131,1 tok/s | 84,8 tok/s | muito rápido |
| AA Intelligence Index | 40 (#15) | 41 (#13) | ver review |
A leitura da comunidade foi breve e razoavelmente precisa. O thread principal no Hacker News atraiu apenas 33 pontos e dois comentários, um dos quais observou que é "mais ou menos do mesmo tamanho que o DeepSeek Flash 4, mas também suporta entrada de áudio e imagem". Esse é o diferencial em uma frase: entrada multimodal a um preço de modelo pequeno.
O vizinho mais próximo em preço e formato é o DeepSeek V4 Flash, que fica mais barato por token, mas só aceita texto.
No outro extremo da faixa, o Kimi K3 cobra preços de fronteira por pesos abertos, o que faz os $1,20 do Inkling-Small parecerem generosos em comparação.
Se você quer a versão com veredito deste artigo em vez da explicativa, essa é a review do Inkling-Small. O pai de 975B também tem seu próprio artigo explicativo do Inkling.
Mais dois valem a pena conferir antes de decidir: minha review do Inkling cobre o problema de preços do modelo pai, e alternativas ao Inkling mapeia o campo mais amplo.
Números de segurança, para completar: StrongREJECT 98,4, FORTRESS 71,6 e 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contra 1238 do pai.
Minha opinião
O Inkling-Small é o mais interessante dos dois lançamentos da Inkling, e digo isso como alguém que ficou desapontado com o preço do primeiro. Ele é mais rápido e custa cerca de um terço de um modelo que ele majoritariamente supera, aceita áudio e imagens, e com 89 GB quantizado é o primeiro modelo dessa classe que uma equipe pequena pode possuir totalmente.
As ressalvas são específicas, não vagas. Leia o teto de contexto real do seu provedor, não o da ficha. Faça o orçamento de entrada com base em $0,50. E não o trate como fonte de conhecimento, porque uma pontuação de Omniscience de -9,0 é o modelo te dizendo, de antemão, que ele vai errar com confiança.
Para qualquer coisa voltada ao cliente, o modelo é a decisão fácil. A camada de automação ao redor dele é o que determina se funciona, e isso continua verdadeiro independentemente de qual checkpoint vencer no próximo mês.
Se este artigo te fez considerar uma implantação em vez de um download, comece com deflection de tier 1. Depois descubra onde o modelo não deveria responder de jeito nenhum, que é o trabalho da triagem de tickets.
Fontes
- Ficha do modelo da Thinking Machines Lab,
thinkingmachines/Inkling-Smallno Hugging Face (arquitetura, tabela de benchmarks, orientação de hardware, configurações de amostragem) - Artificial Analysis (Intelligence Index, throughput, TTFT, preços combinados, Omniscience)
- Página do modelo e API da OpenRouter (janela de contexto oferecida, preço de entrada, número de provedores)
- Tamanhos dos builds quantizados da Unsloth
- Thread de lançamento no Hacker News
- eesel Customer Voice Dossier (GENERAL BYTES, com permissão; trechos anonimizados de suporte técnico B2B e de suplementos DTC)
Perguntas frequentes
O que é Inkling-Small?
Inkling-Small é gratuito e de código aberto?
Quanto custa o Inkling-Small?
Qual é a janela de contexto do Inkling-Small?
Posso rodar o Inkling-Small localmente?
O Inkling-Small é bom para atendimento ao cliente?
Como o Inkling-Small se compara ao DeepSeek V4 Flash e ao Kimi K3?
Que hardware o Inkling-Small precisa?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







