Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição July 20, 2026

Verificado por especialista
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab

O que é o Inkling?

O Inkling é o primeiro modelo público da Thinking Machines Lab, e o laboratório é surpreendentemente direto ao dizer que não está tentando vencer o leaderboard. A proposta é uma base aberta ampla e equilibrada que você ajusta (fine-tune) para o seu próprio uso, usando a plataforma Tinker do laboratório. Em outras palavras, o Inkling é pensado como um ponto de partida que você molda, não um chatbot ao qual você assina.

As especificações que importam, direto do model card:

  • Arquitetura: um transformer Mixture-of-Experts (MoE), 975B de parâmetros totais com 41B ativos por token (ele roteia cada token por 6 dos 256 especialistas, além de 2 especialistas compartilhados). É por isso que um modelo com quase um trilhão de parâmetros pode ser servido em velocidade razoável - só uma fatia dele roda em cada token.
  • Entradas: texto, imagens e áudio (WAV a 16 kHz, de preferência com menos de cerca de 20 minutos). A saída é apenas texto.
  • Janela de contexto: até 1M de tokens, o que o coloca no nível mais alto entre os modelos em termos de comprimento.
  • Licença: Apache 2.0, então o uso comercial é permitido e os pesos estão no Hugging Face.
  • Lançamento: 15 de julho de 2026.

A parte de áudio é a novidade. Como colocou o comentário mais votado da thread de lançamento, este é o "maior modelo de pesos abertos que suporta áudio", o que importa se você algum dia quiser que um modelo ouça uma ligação de suporte em vez de apenas ler a transcrição dela.

Como o Inkling é construído

Se você curte a parte técnica, o Inkling faz algumas escolhas de arquitetura incomuns. Em vez do já padrão rotary position embeddings (RoPE), o relatório da própria equipe descreve um esquema de posição relativa embutido nos logits de atenção, além de convoluções curtas sobre as keys e values antes de irem para o cache. O objetivo prático é o mesmo que todo modelo de contexto longo persegue: manter a atenção estável e barata quando o contexto se estende rumo a um milhão de tokens.

Caminho de atenção relativa do Inkling: o estado oculto é projetado em Q, K, V e R, com convolução curta em K/V para o cache e um viés de posição relativa somado aos logits de atenção, conforme diagramado pela Thinking Machines no blog de lançamento do Hugging Face
Caminho de atenção relativa do Inkling: o estado oculto é projetado em Q, K, V e R, com convolução curta em K/V para o cache e um viés de posição relativa somado aos logits de atenção, conforme diagramado pela Thinking Machines no blog de lançamento do Hugging Face

Você não precisa decifrar o diagrama para captar a ideia: o Inkling é projetado em torno de contexto longo e raciocínio eficiente, não para liderar um único benchmark. Isso aparece de novo em como ele "pensa".

O botão de esforço de raciocínio

O Inkling é um modelo de raciocínio e expõe uma configuração de "esforço de pensamento" controlável. Na integração do Hugging Face, isso é um nível reasoning_effort que vai de none e minimal até low, medium, high, xhigh e max. Diminua e o modelo responde rápido e barato; aumente e ele gasta mais tokens pensando antes de responder.

A afirmação em que a Thinking Machines se apoia aqui é a eficiência de tokens: eles dizem que o Inkling atinge o mesmo score no Terminal-Bench que o Nemotron 3 Ultra gastando cerca de um terço dos tokens para chegar lá. Para quem paga por token ou aluga uma GPU, "mesma resposta, menos tokens" é um número mais útil do que uma vitória fracionária em benchmark.

Os benchmarks: forte, mas não rei

Aqui é preciso separar o discurso do fornecedor da leitura independente. As próprias tabelas da Thinking Machines mostram números favoráveis no esforço máximo, mas o sinal mais limpo vem da Artificial Analysis, que faz benchmark de todos da mesma forma.

O veredito deles: o Inkling pontua 41 no AA Intelligence Index, o que é #10 de 97 no leaderboard selecionado deles, bem acima da média de ~25 para modelos de pesos abertos desse porte. Então é um modelo inteligente. Mas fica abaixo dos líderes de fronteira (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5, GLM-5.2) e cai em um grupo com pares como o DeepSeek V4 Flash. Rastreadores da comunidade que incluem mais modelos o colocam ainda mais baixo, mais perto do #41, de onde vem o debate sobre se "competitivo" é um rótulo justo.

Avaliação (Artificial Analysis)InklingO que testa
GPQA Diamond87%Raciocínio científico
AA-LCR63%Raciocínio de contexto longo
Terminal-Bench v2.155%Codificação agêntica + uso de terminal
SciCode46%Codificação
AA-Omniscience (precisão)40%Conhecimento
GDPval-AA v237%Tarefas de trabalho do mundo real
Humanity's Last Exam30%Raciocínio + conhecimento
CritPt5%Raciocínio em física

Lendo essa tabela com honestidade, você tem uma personalidade real: o Inkling é forte em raciocínio científico e de contexto longo e nitidamente fraco em física e confiabilidade bruta de conhecimento (o índice de confiabilidade de conhecimento AA-Omniscience dele é um baixo 2 numa escala de −100 a 100). É um modelo com arestas afiadas, não um bom generalista.

A thread de lançamento captou a mesma coisa. Elogio e ceticismo lado a lado:

Hacker News

"Acabei de olhar os benchmarks e fiquei meio decepcionado por parecer estar entre o KimiK2.6 e o KimiK2.7 na maioria dos benchmarks."

E a resposta mais útil de toda a thread, aquela que vale a pena colar no monitor antes de confiar em qualquer comparação de modelos:

Hacker News

"Quer saber o quão bom um modelo é? Rode-o com seu próprio benchmark não público, basicamente a única forma de ter respostas confiáveis nas quais você pode meio que confiar, todo o resto é manipulado, mal compreendido ou usado em excesso."

Esse instinto, de que o único benchmark que conta são os seus próprios dados, é exatamente o que vale a pena guardar se algum dia você apontar um modelo para sua fila de suporte. Mais sobre isso abaixo.

Quadrante de posicionamento mostrando o Inkling no canto de alta inteligência e alto preço, enquanto pares de pesos abertos como GLM, Qwen e DeepSeek ficam no canto de alta inteligência e baixo preço
Quadrante de posicionamento mostrando o Inkling no canto de alta inteligência e alto preço, enquanto pares de pesos abertos como GLM, Qwen e DeepSeek ficam no canto de alta inteligência e baixo preço

Quanto custa o Inkling?

Essa é a parte que me surpreendeu. O Inkling é de pesos abertos, e mesmo assim, na API própria da Thinking Machines, é precificado como um modelo de fronteira proprietário. Segundo a Artificial Analysis, ele fica em #81 de 97 em preço, ou seja, entre os mais caros da categoria.

Via de acessoO que você pagaNotas
API da Thinking Machines - entradaUS$ 1,87 / 1M de tokensA média da categoria é ~US$ 0,43; isso é caro
API da Thinking Machines - saídaUS$ 4,68 / 1M de tokensA média da categoria é ~US$ 1,25
Taxa combinada~US$ 1,10 / 1M de tokensNuma mistura de 7:2:1 cache:entrada:saída
Leitura/escrita de cacheUS$ 0,374 / 1M de tokensUm acerto de cache é −80% em relação à entrada
Hospedar você mesmoUS$ 0 pelo modeloApache 2.0; você paga o hardware no lugar disso
Fine-tuning com o TinkerServiço pagoO verdadeiro modelo de negócio do laboratório

Duas coisas chamam atenção. Primeiro, atualmente há apenas um provedor de API, a própria Thinking Machines, então ainda não existe um host terceiro mais barato para competir. Segundo, "pesos abertos" só torna o modelo gratuito se você estiver disposto a rodá-lo, o que é uma decisão real, não uma nota de rodapé.

Escada descendente com três formas de rodar o Inkling: os pesos completos em BF16 precisam de cerca de 2 TB de VRAM, a quantização NVFP4 precisa de cerca de 600 GB, e o GGUF de 1 bit precisa de cerca de 95% a menos e roda em uma workstation
Escada descendente com três formas de rodar o Inkling: os pesos completos em BF16 precisam de cerca de 2 TB de VRAM, a quantização NVFP4 precisa de cerca de 600 GB, e o GGUF de 1 bit precisa de cerca de 95% a menos e roda em uma workstation

Rodando o Inkling você mesmo

Como os pesos são abertos, a comunidade já tinha ele rodando localmente no primeiro dia. O blog de lançamento do Hugging Face apresenta três níveis aproximados, que a escada acima resume: o checkpoint completo em BF16 exige cerca de 2 TB de VRAM (território de data center), a quantização NVFP4 reduz isso para cerca de 600 GB em hardware Blackwell, e as versões GGUF de 1 bit da comunidade cortam isso em cerca de 95%, o suficiente para rodar uma versão fortemente quantizada em uma workstation robusta.

O suporte também chegou rápido: integração no dia zero em transformers 5.14, SGLang, vLLM e llama.cpp/Unsloth, além de camadas de rascunho de decodificação especulativa para um ganho de velocidade sem perdas. Aqui está uma versão de 1 bit rodando de verdade no estúdio da Unsloth, escrevendo um jogo em HTML completo e "pensando" por 321 segundos com uma janela de um milhão de tokens:

Uma versão GGUF de 1 bit do Inkling rodando localmente no estúdio da Unsloth, escrevendo um jogo de Sudoku em HTML autocontido após pensar por 321 segundos, com um medidor de contexto de 12,6k / 1.048,6k tokens, conforme mostrado no blog de lançamento do Hugging Face
Uma versão GGUF de 1 bit do Inkling rodando localmente no estúdio da Unsloth, escrevendo um jogo de Sudoku em HTML autocontido após pensar por 321 segundos, com um medidor de contexto de 12,6k / 1.048,6k tokens, conforme mostrado no blog de lançamento do Hugging Face

Essa história de "rode você mesmo" é o verdadeiro motivo para se interessar pelo Inkling. Se você está pesando um modelo aberto contra um fechado, a troca é entre controle e conveniência: você é dono dos pesos, seus dados nunca saem da sua infraestrutura, e ninguém pode descontinuar o modelo debaixo de você, mas agora você é responsável pelas GPUs.

O ângulo empresarial

Para times que querem o controle sem cuidar de um cluster de GPU, o Inkling apareceu na Databricks no dia zero, acessível pelo Unity AI Gateway com governança embutida. O argumento empresarial que eles fazem é o mesmo que torna os pesos abertos atraentes: fazer fine-tuning com seus próprios dados, manter tudo dentro do seu perímetro de governança e pular o preço por token.

Painel "Integrate external agents" da Databricks mostrando o Inkling acessível pelo Unity AI Gateway com um comando, funcionando junto com agentes de codificação como Codex, Gemini, Copilot, OpenCode e Pi, conforme mostrado no blog da Databricks
Painel "Integrate external agents" da Databricks mostrando o Inkling acessível pelo Unity AI Gateway com um comando, funcionando junto com agentes de codificação como Codex, Gemini, Copilot, OpenCode e Pi, conforme mostrado no blog da Databricks

Você deveria usar o Inkling?

Em vez da saída fácil de "depende das suas necessidades", aqui está um caminho de decisão direto baseado no que o Inkling realmente é bom e ruim.

O Inkling é a escolha certa para você?
Você quer hospedar você mesmo um modelo aberto e ser dono dos pesos
O Inkling se encaixa bem. Apache 2.0, para download, e roda localmente até uma versão de 1 bit. Reserve orçamento para as GPUs.
Você precisa de áudio nativo ou de uma janela de 1M de tokens em pesos abertos
Poucos modelos abertos igualam isso. O Inkling é um dos poucos. Vá com ele.
Você só quer a API capaz mais barata
Procure em outro lugar. A US$ 1,87 de entrada / US$ 4,68 de saída, pares de pesos abertos mais baratos (GLM, Qwen, DeepSeek) ganham em preço.
Você quer um agente de IA que funcione para suporte, não um modelo bruto
Um modelo sozinho não responde tickets com segurança. Você quer uma plataforma que envolva um modelo com seu conhecimento, suas proteções e testes. Continue lendo.

O que a comunidade realmente acha

A thread de lançamento no Hacker News (1.214 pontos, ~292 comentários) é o retrato mais claro de como os desenvolvedores receberam o Inkling. O clima foi animado, mas comedido, e a empolgação girou menos em torno dos scores e mais em torno de quem o lançou:

Hacker News

"E não esqueça, é americano. Este é o primeiro modelo de pesos abertos competitivo não chinês desde, sei lá, o Llama 3?"

Esse enquadramento recebeu contestações (pessoas citaram Mistral, o North da Cohere, Gemma e outros como contraexemplos), mas o sentimento de fundo, de que uma opção ocidental confiável de pesos abertos já era esperada há tempos, percorreu a thread inteira. Também houve uma boa dose de "como uma empresa que dá o modelo de graça sobrevive?", com a resposta recaindo no Tinker, o negócio de fine-tuning hospedado:

Hacker News

"A história da tecnologia está cheia de cadáveres de serviços de 'código aberto, mas vendemos hospedagem'. Modelos são tão caros de treinar que você não pode se dar ao luxo de perder os grandes clientes assim que eles se tornam realmente lucrativos."

Se esse modelo se sustenta é a pergunta em aberto que paira sobre o Inkling. Mas, por enquanto, os desenvolvedores ganharam um modelo capaz, multimodal e totalmente aberto para explorar, e a maioria ficou satisfeita com isso.

O que um modelo como o Inkling significa para o atendimento ao cliente

É aqui que passei os últimos anos, então deixe-me ser direto. Eu construo a camada de agente que fica sobre modelos como o Inkling, e o que aprendi observando implantações reais é isto: um modelo base melhor raramente muda o que realmente vai para uma fila de suporte.

Um modelo bruto, por mais inteligente que seja, não conhece sua política de reembolso, não consegue ver os últimos 40 mil tickets que seu time já resolveu, e não faz ideia de quando deveria se calar e passar o caso para um humano. Aponte-o direto para os clientes e ele responderá com confiança e de forma errada, o que é pior do que não responder. Esse modo de falha, o bot confiante mas errado, é exatamente o motivo pelo qual as alucinações de IA no suporte queimam times, e por que o modelo é sempre só o motor.

O carro é a camada ao redor dele. É isso que a eesel é: ela aprende com seus tickets resolvidos e documentos de ajuda (não apenas uma página de marketing), roteia por confiança para que respostas de baixa certeza sejam rascunhadas em vez de enviadas e, a parte que mais me importa, permite simular o agente contra seus próprios tickets anteriores antes que um único cliente o veja. Essa simulação é o conselho "rode com seu próprio benchmark" do Hacker News, transformado em uma etapa do produto.

Fluxo mostrando um modelo de pesos abertos como o motor, uma camada da eesel que aprende com tickets resolvidos, roteia por confiança e simula com tickets anteriores, e a colega de suporte funcional resultante
Fluxo mostrando um modelo de pesos abertos como o motor, uma camada da eesel que aprende com tickets resolvidos, roteia por confiança e simula com tickets anteriores, e a colega de suporte funcional resultante

Isso também significa que você não precisa apostar sua pilha de suporte em um único modelo. O melhor modelo muda a cada poucas semanas (Inkling hoje, outro no mês que vem), então a eesel permanece independente de modelo e acompanha o mais forte de cada vez, enquanto a parte que importa para seus clientes, o conhecimento, as proteções, a triagem de tickets, permanece firme.

Experimente a eesel

O Inkling é um lançamento interessante, mas um model card não é um agente de suporte. Se seu objetivo real é automatizar o suporte de nível 1, o que você precisa é da camada que transforma qualquer modelo forte em uma colega de equipe: a eesel se conecta ao seu helpdesk atual (Zendesk, Freshdesk, Gorgias, HubSpot, Front e mais de 100 outros), aprende com seu histórico e permite simular com tickets reais anteriores antes de entrar no ar, para que você veja cobertura e precisão antes, não depois que um cliente perceber uma resposta ruim. A Gridwise usou exatamente essa abordagem para resolver 73% das solicitações de nível 1 no primeiro mês.

O preço é baseado em uso, em torno de US$ 0,40 por ticket resolvido, sem taxas por assento, e você pode começar de graça. É a diferença entre admirar um ótimo motor e realmente ir a algum lugar.

Perguntas frequentes

O que é o Inkling?
Inkling é o primeiro modelo de IA de pesos abertos da Thinking Machines Lab, a startup de Mira Murati. É um modelo Mixture-of-Experts nativamente multimodal (975B de parâmetros totais / 41B ativos) que recebe texto, imagem e áudio como entrada e gera texto, lançado em 15 de julho de 2026 sob licença Apache 2.0. Foi construído para passar por fine-tuning, não para ser usado como produto pronto, e é aí que entra uma camada como o agente de IA para helpdesk da eesel.
O Inkling é gratuito e de código aberto?
Os pesos são gratuitos para baixar sob a Apache 2.0, então sim, você pode hospedar o Inkling você mesmo e usá-lo comercialmente. Mas "modelo gratuito" não é o mesmo que "gratuito para rodar" - o hardware é a conta de verdade, indo de cerca de 2 TB de VRAM para os pesos completos até uma workstation para a versão quantizada em 1 bit. A Thinking Machines também opera uma API própria paga, caso você não queira hospedá-lo sozinho.
Quanto custa usar o Inkling?
Na API própria da Thinking Machines, o Inkling custa cerca de US$ 1,87 por 1M de tokens de entrada e US$ 4,68 por 1M de tokens de saída, segundo a Artificial Analysis. Isso é caro para um modelo de pesos abertos desse porte (a média da categoria fica mais perto de US$ 0,43 de entrada / US$ 1,25 de saída), o que é a maior peculiaridade do modelo. Hospedar você mesmo troca esse custo por token por um custo de hardware.
Como o Inkling se compara ao GLM, Kimi e DeepSeek?
O Inkling fica no mesmo grupo de inteligência de ponta que modelos como o DeepSeek V4 Flash, mas abaixo dos líderes de fronteira, e testadores da comunidade no Hacker News observam que ele fica com benchmarks entre o Kimi K2.6 e o K2.7, aproximadamente. Seus traços marcantes são a entrada nativa de áudio e uma janela de contexto de 1M de tokens, e não um score de benchmark no topo.
Posso usar o Inkling para atendimento ao cliente?
Pode, mas um modelo bruto não é um agente de suporte, por melhores que sejam os benchmarks. Para responder tickets reais, você precisa de uma camada que aprenda com seus tickets resolvidos, roteie por confiança e possa ser testada antes de entrar no ar. É exatamente isso que uma plataforma de atendimento ao cliente com IA como a eesel oferece, e ela permanece independente de modelo para acompanhar sempre o melhor disponível.
Quem faz o Inkling e o que é o Tinker?
O Inkling é feito pela Thinking Machines Lab, fundada pela ex-CTO da OpenAI, Mira Murati. O laboratório distribui o modelo de graça e ganha dinheiro com o Tinker, sua plataforma hospedada de fine-tuning - o modelo "pesos abertos, venda de ferramentas" que o Hacker News debateu bastante durante boa parte da thread de lançamento.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração editorial de agentes de codificação em paralelo e janelas de terminal, representando o campo de alternativas ao ZCode
Trending

As 8 melhores alternativas ao ZCode em 2026

O ZCode é impressionante e tosco ao mesmo tempo. Aqui estão as 8 melhores alternativas ao ZCode em 2026, com preços reais, trocas honestas e para quem cada uma é indicada.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustração editorial de um ranking de benchmarks com uma barra alta em destaque, representando o ZCode e o modelo GLM-5.2
Trending

ZCode: o que a nova agente de codificação de IA da Z.ai realmente é

Uma análise prática do ZCode, o aplicativo de codificação agêntica gratuito da equipe GLM: o modelo GLM-5.2 por trás dele, as reclamações reais da semana de lançamento e quem deveria usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustração representando o modelo de linguagem grande Kimi K3 da Moonshot AI
Trending

Kimi K3 explicado: o modelo de fronteira aberto da Moonshot

Um guia direto sobre o Kimi K3, o modelo aberto de 2,8 trilhões de parâmetros da Moonshot AI: o que é, como se sai, quanto custa e se vale a pena migrar para ele.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Ilustração editorial de um modelo de linguagem grande raciocinando sobre um longo fluxo de documentos
Trending

Análise do Kimi K3: o modelo de fronteira aberto da Moonshot, testado

Uma análise prática do Kimi K3: a arquitetura do modelo aberto de 2,8T, os benchmarks, os preços reais e o que a comunidade realmente pensa na semana de lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Banner de capa o que é PromptQL com o logotipo do PromptQL sobre um fundo índigo
Trending

O que é PromptQL? O agente de dados de IA da Hasura, explicado

O que é PromptQL? Uma explicação clara do agente de dados de IA da Hasura: a ideia de planejar e depois executar, com o que ele se conecta, quanto custa e para quem é indicado.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Banner ilustrado para um guia sobre os preços e custos de API do Google Gemini 3.5 Pro
Trending

Preços do Gemini 3.5 Pro: quanto custa (e o que ainda falta)

Uma resposta direta sobre os preços do Gemini 3.5 Pro: ele ainda não está disponível. Veja quanto custa o nível Pro atual, os planos para consumidores e a conta real da API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustração comparando as melhores alternativas ao modelo de linguagem de grande porte Kimi K3
Trending

As 8 melhores alternativas ao Kimi K3 em 2026

O Kimi K3 é um modelo de fronteira de verdade, mas não é o mais barato e os pesos chegam atrasados. Aqui estão as 8 melhores alternativas ao Kimi K3, com preços reais de API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis