
O que é o Inkling?
O Inkling é o primeiro modelo público da Thinking Machines Lab, e o laboratório é surpreendentemente direto ao dizer que não está tentando vencer o leaderboard. A proposta é uma base aberta ampla e equilibrada que você ajusta (fine-tune) para o seu próprio uso, usando a plataforma Tinker do laboratório. Em outras palavras, o Inkling é pensado como um ponto de partida que você molda, não um chatbot ao qual você assina.
As especificações que importam, direto do model card:
- Arquitetura: um transformer Mixture-of-Experts (MoE), 975B de parâmetros totais com 41B ativos por token (ele roteia cada token por 6 dos 256 especialistas, além de 2 especialistas compartilhados). É por isso que um modelo com quase um trilhão de parâmetros pode ser servido em velocidade razoável - só uma fatia dele roda em cada token.
- Entradas: texto, imagens e áudio (WAV a 16 kHz, de preferência com menos de cerca de 20 minutos). A saída é apenas texto.
- Janela de contexto: até 1M de tokens, o que o coloca no nível mais alto entre os modelos em termos de comprimento.
- Licença: Apache 2.0, então o uso comercial é permitido e os pesos estão no Hugging Face.
- Lançamento: 15 de julho de 2026.
A parte de áudio é a novidade. Como colocou o comentário mais votado da thread de lançamento, este é o "maior modelo de pesos abertos que suporta áudio", o que importa se você algum dia quiser que um modelo ouça uma ligação de suporte em vez de apenas ler a transcrição dela.
Como o Inkling é construído
Se você curte a parte técnica, o Inkling faz algumas escolhas de arquitetura incomuns. Em vez do já padrão rotary position embeddings (RoPE), o relatório da própria equipe descreve um esquema de posição relativa embutido nos logits de atenção, além de convoluções curtas sobre as keys e values antes de irem para o cache. O objetivo prático é o mesmo que todo modelo de contexto longo persegue: manter a atenção estável e barata quando o contexto se estende rumo a um milhão de tokens.

Você não precisa decifrar o diagrama para captar a ideia: o Inkling é projetado em torno de contexto longo e raciocínio eficiente, não para liderar um único benchmark. Isso aparece de novo em como ele "pensa".
O botão de esforço de raciocínio
O Inkling é um modelo de raciocínio e expõe uma configuração de "esforço de pensamento" controlável. Na integração do Hugging Face, isso é um nível reasoning_effort que vai de none e minimal até low, medium, high, xhigh e max. Diminua e o modelo responde rápido e barato; aumente e ele gasta mais tokens pensando antes de responder.
A afirmação em que a Thinking Machines se apoia aqui é a eficiência de tokens: eles dizem que o Inkling atinge o mesmo score no Terminal-Bench que o Nemotron 3 Ultra gastando cerca de um terço dos tokens para chegar lá. Para quem paga por token ou aluga uma GPU, "mesma resposta, menos tokens" é um número mais útil do que uma vitória fracionária em benchmark.
Os benchmarks: forte, mas não rei
Aqui é preciso separar o discurso do fornecedor da leitura independente. As próprias tabelas da Thinking Machines mostram números favoráveis no esforço máximo, mas o sinal mais limpo vem da Artificial Analysis, que faz benchmark de todos da mesma forma.
O veredito deles: o Inkling pontua 41 no AA Intelligence Index, o que é #10 de 97 no leaderboard selecionado deles, bem acima da média de ~25 para modelos de pesos abertos desse porte. Então é um modelo inteligente. Mas fica abaixo dos líderes de fronteira (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5, GLM-5.2) e cai em um grupo com pares como o DeepSeek V4 Flash. Rastreadores da comunidade que incluem mais modelos o colocam ainda mais baixo, mais perto do #41, de onde vem o debate sobre se "competitivo" é um rótulo justo.
| Avaliação (Artificial Analysis) | Inkling | O que testa |
|---|---|---|
| GPQA Diamond | 87% | Raciocínio científico |
| AA-LCR | 63% | Raciocínio de contexto longo |
| Terminal-Bench v2.1 | 55% | Codificação agêntica + uso de terminal |
| SciCode | 46% | Codificação |
| AA-Omniscience (precisão) | 40% | Conhecimento |
| GDPval-AA v2 | 37% | Tarefas de trabalho do mundo real |
| Humanity's Last Exam | 30% | Raciocínio + conhecimento |
| CritPt | 5% | Raciocínio em física |
Lendo essa tabela com honestidade, você tem uma personalidade real: o Inkling é forte em raciocínio científico e de contexto longo e nitidamente fraco em física e confiabilidade bruta de conhecimento (o índice de confiabilidade de conhecimento AA-Omniscience dele é um baixo 2 numa escala de −100 a 100). É um modelo com arestas afiadas, não um bom generalista.
A thread de lançamento captou a mesma coisa. Elogio e ceticismo lado a lado:
"Acabei de olhar os benchmarks e fiquei meio decepcionado por parecer estar entre o KimiK2.6 e o KimiK2.7 na maioria dos benchmarks."
E a resposta mais útil de toda a thread, aquela que vale a pena colar no monitor antes de confiar em qualquer comparação de modelos:
"Quer saber o quão bom um modelo é? Rode-o com seu próprio benchmark não público, basicamente a única forma de ter respostas confiáveis nas quais você pode meio que confiar, todo o resto é manipulado, mal compreendido ou usado em excesso."
Esse instinto, de que o único benchmark que conta são os seus próprios dados, é exatamente o que vale a pena guardar se algum dia você apontar um modelo para sua fila de suporte. Mais sobre isso abaixo.

Quanto custa o Inkling?
Essa é a parte que me surpreendeu. O Inkling é de pesos abertos, e mesmo assim, na API própria da Thinking Machines, é precificado como um modelo de fronteira proprietário. Segundo a Artificial Analysis, ele fica em #81 de 97 em preço, ou seja, entre os mais caros da categoria.
| Via de acesso | O que você paga | Notas |
|---|---|---|
| API da Thinking Machines - entrada | US$ 1,87 / 1M de tokens | A média da categoria é ~US$ 0,43; isso é caro |
| API da Thinking Machines - saída | US$ 4,68 / 1M de tokens | A média da categoria é ~US$ 1,25 |
| Taxa combinada | ~US$ 1,10 / 1M de tokens | Numa mistura de 7:2:1 cache:entrada:saída |
| Leitura/escrita de cache | US$ 0,374 / 1M de tokens | Um acerto de cache é −80% em relação à entrada |
| Hospedar você mesmo | US$ 0 pelo modelo | Apache 2.0; você paga o hardware no lugar disso |
| Fine-tuning com o Tinker | Serviço pago | O verdadeiro modelo de negócio do laboratório |
Duas coisas chamam atenção. Primeiro, atualmente há apenas um provedor de API, a própria Thinking Machines, então ainda não existe um host terceiro mais barato para competir. Segundo, "pesos abertos" só torna o modelo gratuito se você estiver disposto a rodá-lo, o que é uma decisão real, não uma nota de rodapé.

Rodando o Inkling você mesmo
Como os pesos são abertos, a comunidade já tinha ele rodando localmente no primeiro dia. O blog de lançamento do Hugging Face apresenta três níveis aproximados, que a escada acima resume: o checkpoint completo em BF16 exige cerca de 2 TB de VRAM (território de data center), a quantização NVFP4 reduz isso para cerca de 600 GB em hardware Blackwell, e as versões GGUF de 1 bit da comunidade cortam isso em cerca de 95%, o suficiente para rodar uma versão fortemente quantizada em uma workstation robusta.
O suporte também chegou rápido: integração no dia zero em transformers 5.14, SGLang, vLLM e llama.cpp/Unsloth, além de camadas de rascunho de decodificação especulativa para um ganho de velocidade sem perdas. Aqui está uma versão de 1 bit rodando de verdade no estúdio da Unsloth, escrevendo um jogo em HTML completo e "pensando" por 321 segundos com uma janela de um milhão de tokens:

Essa história de "rode você mesmo" é o verdadeiro motivo para se interessar pelo Inkling. Se você está pesando um modelo aberto contra um fechado, a troca é entre controle e conveniência: você é dono dos pesos, seus dados nunca saem da sua infraestrutura, e ninguém pode descontinuar o modelo debaixo de você, mas agora você é responsável pelas GPUs.
O ângulo empresarial
Para times que querem o controle sem cuidar de um cluster de GPU, o Inkling apareceu na Databricks no dia zero, acessível pelo Unity AI Gateway com governança embutida. O argumento empresarial que eles fazem é o mesmo que torna os pesos abertos atraentes: fazer fine-tuning com seus próprios dados, manter tudo dentro do seu perímetro de governança e pular o preço por token.

Você deveria usar o Inkling?
Em vez da saída fácil de "depende das suas necessidades", aqui está um caminho de decisão direto baseado no que o Inkling realmente é bom e ruim.
O Inkling se encaixa bem. Apache 2.0, para download, e roda localmente até uma versão de 1 bit. Reserve orçamento para as GPUs.
Poucos modelos abertos igualam isso. O Inkling é um dos poucos. Vá com ele.
Procure em outro lugar. A US$ 1,87 de entrada / US$ 4,68 de saída, pares de pesos abertos mais baratos (GLM, Qwen, DeepSeek) ganham em preço.
Um modelo sozinho não responde tickets com segurança. Você quer uma plataforma que envolva um modelo com seu conhecimento, suas proteções e testes. Continue lendo.
O que a comunidade realmente acha
A thread de lançamento no Hacker News (1.214 pontos, ~292 comentários) é o retrato mais claro de como os desenvolvedores receberam o Inkling. O clima foi animado, mas comedido, e a empolgação girou menos em torno dos scores e mais em torno de quem o lançou:
"E não esqueça, é americano. Este é o primeiro modelo de pesos abertos competitivo não chinês desde, sei lá, o Llama 3?"
Esse enquadramento recebeu contestações (pessoas citaram Mistral, o North da Cohere, Gemma e outros como contraexemplos), mas o sentimento de fundo, de que uma opção ocidental confiável de pesos abertos já era esperada há tempos, percorreu a thread inteira. Também houve uma boa dose de "como uma empresa que dá o modelo de graça sobrevive?", com a resposta recaindo no Tinker, o negócio de fine-tuning hospedado:
"A história da tecnologia está cheia de cadáveres de serviços de 'código aberto, mas vendemos hospedagem'. Modelos são tão caros de treinar que você não pode se dar ao luxo de perder os grandes clientes assim que eles se tornam realmente lucrativos."
Se esse modelo se sustenta é a pergunta em aberto que paira sobre o Inkling. Mas, por enquanto, os desenvolvedores ganharam um modelo capaz, multimodal e totalmente aberto para explorar, e a maioria ficou satisfeita com isso.
O que um modelo como o Inkling significa para o atendimento ao cliente
É aqui que passei os últimos anos, então deixe-me ser direto. Eu construo a camada de agente que fica sobre modelos como o Inkling, e o que aprendi observando implantações reais é isto: um modelo base melhor raramente muda o que realmente vai para uma fila de suporte.
Um modelo bruto, por mais inteligente que seja, não conhece sua política de reembolso, não consegue ver os últimos 40 mil tickets que seu time já resolveu, e não faz ideia de quando deveria se calar e passar o caso para um humano. Aponte-o direto para os clientes e ele responderá com confiança e de forma errada, o que é pior do que não responder. Esse modo de falha, o bot confiante mas errado, é exatamente o motivo pelo qual as alucinações de IA no suporte queimam times, e por que o modelo é sempre só o motor.
O carro é a camada ao redor dele. É isso que a eesel é: ela aprende com seus tickets resolvidos e documentos de ajuda (não apenas uma página de marketing), roteia por confiança para que respostas de baixa certeza sejam rascunhadas em vez de enviadas e, a parte que mais me importa, permite simular o agente contra seus próprios tickets anteriores antes que um único cliente o veja. Essa simulação é o conselho "rode com seu próprio benchmark" do Hacker News, transformado em uma etapa do produto.

Isso também significa que você não precisa apostar sua pilha de suporte em um único modelo. O melhor modelo muda a cada poucas semanas (Inkling hoje, outro no mês que vem), então a eesel permanece independente de modelo e acompanha o mais forte de cada vez, enquanto a parte que importa para seus clientes, o conhecimento, as proteções, a triagem de tickets, permanece firme.
Experimente a eesel
O Inkling é um lançamento interessante, mas um model card não é um agente de suporte. Se seu objetivo real é automatizar o suporte de nível 1, o que você precisa é da camada que transforma qualquer modelo forte em uma colega de equipe: a eesel se conecta ao seu helpdesk atual (Zendesk, Freshdesk, Gorgias, HubSpot, Front e mais de 100 outros), aprende com seu histórico e permite simular com tickets reais anteriores antes de entrar no ar, para que você veja cobertura e precisão antes, não depois que um cliente perceber uma resposta ruim. A Gridwise usou exatamente essa abordagem para resolver 73% das solicitações de nível 1 no primeiro mês.
O preço é baseado em uso, em torno de US$ 0,40 por ticket resolvido, sem taxas por assento, e você pode começar de graça. É a diferença entre admirar um ótimo motor e realmente ir a algum lugar.
Perguntas frequentes
O que é o Inkling?
O Inkling é gratuito e de código aberto?
Quanto custa usar o Inkling?
Como o Inkling se compara ao GLM, Kimi e DeepSeek?
Posso usar o Inkling para atendimento ao cliente?
Quem faz o Inkling e o que é o Tinker?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








