Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição July 20, 2026

Verificado por especialista
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab

O que é o Inkling?

O Inkling é o primeiro modelo público da Thinking Machines Lab, e o laboratório é surpreendentemente direto ao dizer que não está tentando vencer o leaderboard. A proposta é uma base aberta ampla e equilibrada que você ajusta (fine-tune) para o seu próprio uso, usando a plataforma Tinker do laboratório. Em outras palavras, o Inkling é pensado como um ponto de partida que você molda, não um chatbot ao qual você assina.

As especificações que importam, direto do model card:

  • Arquitetura: um transformer Mixture-of-Experts (MoE), 975B de parâmetros totais com 41B ativos por token (ele roteia cada token por 6 dos 256 especialistas, além de 2 especialistas compartilhados). É por isso que um modelo com quase um trilhão de parâmetros pode ser servido em velocidade razoável - só uma fatia dele roda em cada token.
  • Entradas: texto, imagens e áudio (WAV a 16 kHz, de preferência com menos de cerca de 20 minutos). A saída é apenas texto.
  • Janela de contexto: até 1M de tokens, o que o coloca no nível mais alto entre os modelos em termos de comprimento.
  • Licença: Apache 2.0, então o uso comercial é permitido e os pesos estão no Hugging Face.
  • Lançamento: 15 de julho de 2026.

A parte de áudio é a novidade. Como colocou o comentário mais votado da thread de lançamento, este é o "maior modelo de pesos abertos que suporta áudio", o que importa se você algum dia quiser que um modelo ouça uma ligação de suporte em vez de apenas ler a transcrição dela.

Como o Inkling é construído

Se você curte a parte técnica, o Inkling faz algumas escolhas de arquitetura incomuns. Em vez do já padrão rotary position embeddings (RoPE), o relatório da própria equipe descreve um esquema de posição relativa embutido nos logits de atenção, além de convoluções curtas sobre as keys e values antes de irem para o cache. O objetivo prático é o mesmo que todo modelo de contexto longo persegue: manter a atenção estável e barata quando o contexto se estende rumo a um milhão de tokens.

Caminho de atenção relativa do Inkling: o estado oculto é projetado em Q, K, V e R, com convolução curta em K/V para o cache e um viés de posição relativa somado aos logits de atenção, conforme diagramado pela Thinking Machines no blog de lançamento do Hugging Face
Caminho de atenção relativa do Inkling: o estado oculto é projetado em Q, K, V e R, com convolução curta em K/V para o cache e um viés de posição relativa somado aos logits de atenção, conforme diagramado pela Thinking Machines no blog de lançamento do Hugging Face

Você não precisa decifrar o diagrama para captar a ideia: o Inkling é projetado em torno de contexto longo e raciocínio eficiente, não para liderar um único benchmark. Isso aparece de novo em como ele "pensa".

O botão de esforço de raciocínio

O Inkling é um modelo de raciocínio e expõe uma configuração de "esforço de pensamento" controlável. Na integração do Hugging Face, isso é um nível reasoning_effort que vai de none e minimal até low, medium, high, xhigh e max. Diminua e o modelo responde rápido e barato; aumente e ele gasta mais tokens pensando antes de responder.

A afirmação em que a Thinking Machines se apoia aqui é a eficiência de tokens: eles dizem que o Inkling atinge o mesmo score no Terminal-Bench que o Nemotron 3 Ultra gastando cerca de um terço dos tokens para chegar lá. Para quem paga por token ou aluga uma GPU, "mesma resposta, menos tokens" é um número mais útil do que uma vitória fracionária em benchmark.

Os benchmarks: forte, mas não rei

Aqui é preciso separar o discurso do fornecedor da leitura independente. As próprias tabelas da Thinking Machines mostram números favoráveis no esforço máximo, mas o sinal mais limpo vem da Artificial Analysis, que faz benchmark de todos da mesma forma.

O veredito deles: o Inkling pontua 41 no AA Intelligence Index, o que é #10 de 97 no leaderboard selecionado deles, bem acima da média de ~25 para modelos de pesos abertos desse porte. Então é um modelo inteligente. Mas fica abaixo dos líderes de fronteira (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5, GLM-5.2) e cai em um grupo com pares como o DeepSeek V4 Flash. Rastreadores da comunidade que incluem mais modelos o colocam ainda mais baixo, mais perto do #41, de onde vem o debate sobre se "competitivo" é um rótulo justo.

Avaliação (Artificial Analysis)InklingO que testa
GPQA Diamond87%Raciocínio científico
AA-LCR63%Raciocínio de contexto longo
Terminal-Bench v2.155%Codificação agêntica + uso de terminal
SciCode46%Codificação
AA-Omniscience (precisão)40%Conhecimento
GDPval-AA v237%Tarefas de trabalho do mundo real
Humanity's Last Exam30%Raciocínio + conhecimento
CritPt5%Raciocínio em física

Lendo essa tabela com honestidade, você tem uma personalidade real: o Inkling é forte em raciocínio científico e de contexto longo e nitidamente fraco em física e confiabilidade bruta de conhecimento (o índice de confiabilidade de conhecimento AA-Omniscience dele é um baixo 2 numa escala de −100 a 100). É um modelo com arestas afiadas, não um bom generalista.

A thread de lançamento captou a mesma coisa. Elogio e ceticismo lado a lado:

Hacker News

"Acabei de olhar os benchmarks e fiquei meio decepcionado por parecer estar entre o KimiK2.6 e o KimiK2.7 na maioria dos benchmarks."

E a resposta mais útil de toda a thread, aquela que vale a pena colar no monitor antes de confiar em qualquer comparação de modelos:

Hacker News

"Quer saber o quão bom um modelo é? Rode-o com seu próprio benchmark não público, basicamente a única forma de ter respostas confiáveis nas quais você pode meio que confiar, todo o resto é manipulado, mal compreendido ou usado em excesso."

Esse instinto, de que o único benchmark que conta são os seus próprios dados, é exatamente o que vale a pena guardar se algum dia você apontar um modelo para sua fila de suporte. Mais sobre isso abaixo.

Quadrante de posicionamento mostrando o Inkling no canto de alta inteligência e alto preço, enquanto pares de pesos abertos como GLM, Qwen e DeepSeek ficam no canto de alta inteligência e baixo preço
Quadrante de posicionamento mostrando o Inkling no canto de alta inteligência e alto preço, enquanto pares de pesos abertos como GLM, Qwen e DeepSeek ficam no canto de alta inteligência e baixo preço

Quanto custa o Inkling?

Essa é a parte que me surpreendeu. O Inkling é de pesos abertos, e mesmo assim, na API própria da Thinking Machines, é precificado como um modelo de fronteira proprietário. Segundo a Artificial Analysis, ele fica em #81 de 97 em preço, ou seja, entre os mais caros da categoria.

Via de acessoO que você pagaNotas
API da Thinking Machines - entradaUS$ 1,87 / 1M de tokensA média da categoria é ~US$ 0,43; isso é caro
API da Thinking Machines - saídaUS$ 4,68 / 1M de tokensA média da categoria é ~US$ 1,25
Taxa combinada~US$ 1,10 / 1M de tokensNuma mistura de 7:2:1 cache:entrada:saída
Leitura/escrita de cacheUS$ 0,374 / 1M de tokensUm acerto de cache é −80% em relação à entrada
Hospedar você mesmoUS$ 0 pelo modeloApache 2.0; você paga o hardware no lugar disso
Fine-tuning com o TinkerServiço pagoO verdadeiro modelo de negócio do laboratório

Duas coisas chamam atenção. Primeiro, atualmente há apenas um provedor de API, a própria Thinking Machines, então ainda não existe um host terceiro mais barato para competir. Segundo, "pesos abertos" só torna o modelo gratuito se você estiver disposto a rodá-lo, o que é uma decisão real, não uma nota de rodapé.

Escada descendente com três formas de rodar o Inkling: os pesos completos em BF16 precisam de cerca de 2 TB de VRAM, a quantização NVFP4 precisa de cerca de 600 GB, e o GGUF de 1 bit precisa de cerca de 95% a menos e roda em uma workstation
Escada descendente com três formas de rodar o Inkling: os pesos completos em BF16 precisam de cerca de 2 TB de VRAM, a quantização NVFP4 precisa de cerca de 600 GB, e o GGUF de 1 bit precisa de cerca de 95% a menos e roda em uma workstation

Rodando o Inkling você mesmo

Como os pesos são abertos, a comunidade já tinha ele rodando localmente no primeiro dia. O blog de lançamento do Hugging Face apresenta três níveis aproximados, que a escada acima resume: o checkpoint completo em BF16 exige cerca de 2 TB de VRAM (território de data center), a quantização NVFP4 reduz isso para cerca de 600 GB em hardware Blackwell, e as versões GGUF de 1 bit da comunidade cortam isso em cerca de 95%, o suficiente para rodar uma versão fortemente quantizada em uma workstation robusta.

O suporte também chegou rápido: integração no dia zero em transformers 5.14, SGLang, vLLM e llama.cpp/Unsloth, além de camadas de rascunho de decodificação especulativa para um ganho de velocidade sem perdas. Aqui está uma versão de 1 bit rodando de verdade no estúdio da Unsloth, escrevendo um jogo em HTML completo e "pensando" por 321 segundos com uma janela de um milhão de tokens:

Uma versão GGUF de 1 bit do Inkling rodando localmente no estúdio da Unsloth, escrevendo um jogo de Sudoku em HTML autocontido após pensar por 321 segundos, com um medidor de contexto de 12,6k / 1.048,6k tokens, conforme mostrado no blog de lançamento do Hugging Face
Uma versão GGUF de 1 bit do Inkling rodando localmente no estúdio da Unsloth, escrevendo um jogo de Sudoku em HTML autocontido após pensar por 321 segundos, com um medidor de contexto de 12,6k / 1.048,6k tokens, conforme mostrado no blog de lançamento do Hugging Face

Essa história de "rode você mesmo" é o verdadeiro motivo para se interessar pelo Inkling. Se você está pesando um modelo aberto contra um fechado, a troca é entre controle e conveniência: você é dono dos pesos, seus dados nunca saem da sua infraestrutura, e ninguém pode descontinuar o modelo debaixo de você, mas agora você é responsável pelas GPUs.

O ângulo empresarial

Para times que querem o controle sem cuidar de um cluster de GPU, o Inkling apareceu na Databricks no dia zero, acessível pelo Unity AI Gateway com governança embutida. O argumento empresarial que eles fazem é o mesmo que torna os pesos abertos atraentes: fazer fine-tuning com seus próprios dados, manter tudo dentro do seu perímetro de governança e pular o preço por token.

Painel "Integrate external agents" da Databricks mostrando o Inkling acessível pelo Unity AI Gateway com um comando, funcionando junto com agentes de codificação como Codex, Gemini, Copilot, OpenCode e Pi, conforme mostrado no blog da Databricks
Painel "Integrate external agents" da Databricks mostrando o Inkling acessível pelo Unity AI Gateway com um comando, funcionando junto com agentes de codificação como Codex, Gemini, Copilot, OpenCode e Pi, conforme mostrado no blog da Databricks

Você deveria usar o Inkling?

Em vez da saída fácil de "depende das suas necessidades", aqui está um caminho de decisão direto baseado no que o Inkling realmente é bom e ruim.

O Inkling é a escolha certa para você?
Você quer hospedar você mesmo um modelo aberto e ser dono dos pesos
O Inkling se encaixa bem. Apache 2.0, para download, e roda localmente até uma versão de 1 bit. Reserve orçamento para as GPUs.
Você precisa de áudio nativo ou de uma janela de 1M de tokens em pesos abertos
Poucos modelos abertos igualam isso. O Inkling é um dos poucos. Vá com ele.
Você só quer a API capaz mais barata
Procure em outro lugar. A US$ 1,87 de entrada / US$ 4,68 de saída, pares de pesos abertos mais baratos (GLM, Qwen, DeepSeek) ganham em preço.
Você quer um agente de IA que funcione para suporte, não um modelo bruto
Um modelo sozinho não responde tickets com segurança. Você quer uma plataforma que envolva um modelo com seu conhecimento, suas proteções e testes. Continue lendo.

O que a comunidade realmente acha

A thread de lançamento no Hacker News (1.214 pontos, ~292 comentários) é o retrato mais claro de como os desenvolvedores receberam o Inkling. O clima foi animado, mas comedido, e a empolgação girou menos em torno dos scores e mais em torno de quem o lançou:

Hacker News

"E não esqueça, é americano. Este é o primeiro modelo de pesos abertos competitivo não chinês desde, sei lá, o Llama 3?"

Esse enquadramento recebeu contestações (pessoas citaram Mistral, o North da Cohere, Gemma e outros como contraexemplos), mas o sentimento de fundo, de que uma opção ocidental confiável de pesos abertos já era esperada há tempos, percorreu a thread inteira. Também houve uma boa dose de "como uma empresa que dá o modelo de graça sobrevive?", com a resposta recaindo no Tinker, o negócio de fine-tuning hospedado:

Hacker News

"A história da tecnologia está cheia de cadáveres de serviços de 'código aberto, mas vendemos hospedagem'. Modelos são tão caros de treinar que você não pode se dar ao luxo de perder os grandes clientes assim que eles se tornam realmente lucrativos."

Se esse modelo se sustenta é a pergunta em aberto que paira sobre o Inkling. Mas, por enquanto, os desenvolvedores ganharam um modelo capaz, multimodal e totalmente aberto para explorar, e a maioria ficou satisfeita com isso.

O que um modelo como o Inkling significa para o atendimento ao cliente

É aqui que passei os últimos anos, então deixe-me ser direto. Eu construo a camada de agente que fica sobre modelos como o Inkling, e o que aprendi observando implantações reais é isto: um modelo base melhor raramente muda o que realmente vai para uma fila de suporte.

Um modelo bruto, por mais inteligente que seja, não conhece sua política de reembolso, não consegue ver os últimos 40 mil tickets que seu time já resolveu, e não faz ideia de quando deveria se calar e passar o caso para um humano. Aponte-o direto para os clientes e ele responderá com confiança e de forma errada, o que é pior do que não responder. Esse modo de falha, o bot confiante mas errado, é exatamente o motivo pelo qual as alucinações de IA no suporte queimam times, e por que o modelo é sempre só o motor.

O carro é a camada ao redor dele. É isso que a eesel é: ela aprende com seus tickets resolvidos e documentos de ajuda (não apenas uma página de marketing), roteia por confiança para que respostas de baixa certeza sejam rascunhadas em vez de enviadas e, a parte que mais me importa, permite simular o agente contra seus próprios tickets anteriores antes que um único cliente o veja. Essa simulação é o conselho "rode com seu próprio benchmark" do Hacker News, transformado em uma etapa do produto.

Fluxo mostrando um modelo de pesos abertos como o motor, uma camada da eesel que aprende com tickets resolvidos, roteia por confiança e simula com tickets anteriores, e a colega de suporte funcional resultante
Fluxo mostrando um modelo de pesos abertos como o motor, uma camada da eesel que aprende com tickets resolvidos, roteia por confiança e simula com tickets anteriores, e a colega de suporte funcional resultante

Isso também significa que você não precisa apostar sua pilha de suporte em um único modelo. O melhor modelo muda a cada poucas semanas (Inkling hoje, outro no mês que vem), então a eesel permanece independente de modelo e acompanha o mais forte de cada vez, enquanto a parte que importa para seus clientes, o conhecimento, as proteções, a triagem de tickets, permanece firme.

Experimente a eesel

O Inkling é um lançamento interessante, mas um model card não é um agente de suporte. Se seu objetivo real é automatizar o suporte de nível 1, o que você precisa é da camada que transforma qualquer modelo forte em uma colega de equipe: a eesel se conecta ao seu helpdesk atual (Zendesk, Freshdesk, Gorgias, HubSpot, Front e mais de 100 outros), aprende com seu histórico e permite simular com tickets reais anteriores antes de entrar no ar, para que você veja cobertura e precisão antes, não depois que um cliente perceber uma resposta ruim. A Gridwise usou exatamente essa abordagem para resolver 73% das solicitações de nível 1 no primeiro mês.

O preço é baseado em uso, em torno de US$ 0,40 por ticket resolvido, sem taxas por assento, e você pode começar de graça. É a diferença entre admirar um ótimo motor e realmente ir a algum lugar.

Perguntas frequentes

O que é o Inkling?
Inkling é o primeiro modelo de IA de pesos abertos da Thinking Machines Lab, a startup de Mira Murati. É um modelo Mixture-of-Experts nativamente multimodal (975B de parâmetros totais / 41B ativos) que recebe texto, imagem e áudio como entrada e gera texto, lançado em 15 de julho de 2026 sob licença Apache 2.0. Foi construído para passar por fine-tuning, não para ser usado como produto pronto, e é aí que entra uma camada como o agente de IA para helpdesk da eesel.
O Inkling é gratuito e de código aberto?
Os pesos são gratuitos para baixar sob a Apache 2.0, então sim, você pode hospedar o Inkling você mesmo e usá-lo comercialmente. Mas "modelo gratuito" não é o mesmo que "gratuito para rodar" - o hardware é a conta de verdade, indo de cerca de 2 TB de VRAM para os pesos completos até uma workstation para a versão quantizada em 1 bit. A Thinking Machines também opera uma API própria paga, caso você não queira hospedá-lo sozinho.
Quanto custa usar o Inkling?
Na API própria da Thinking Machines, o Inkling custa cerca de US$ 1,87 por 1M de tokens de entrada e US$ 4,68 por 1M de tokens de saída, segundo a Artificial Analysis. Isso é caro para um modelo de pesos abertos desse porte (a média da categoria fica mais perto de US$ 0,43 de entrada / US$ 1,25 de saída), o que é a maior peculiaridade do modelo. Hospedar você mesmo troca esse custo por token por um custo de hardware.
Como o Inkling se compara ao GLM, Kimi e DeepSeek?
O Inkling fica no mesmo grupo de inteligência de ponta que modelos como o DeepSeek V4 Flash, mas abaixo dos líderes de fronteira, e testadores da comunidade no Hacker News observam que ele fica com benchmarks entre o Kimi K2.6 e o K2.7, aproximadamente. Seus traços marcantes são a entrada nativa de áudio e uma janela de contexto de 1M de tokens, e não um score de benchmark no topo.
Posso usar o Inkling para atendimento ao cliente?
Pode, mas um modelo bruto não é um agente de suporte, por melhores que sejam os benchmarks. Para responder tickets reais, você precisa de uma camada que aprenda com seus tickets resolvidos, roteie por confiança e possa ser testada antes de entrar no ar. É exatamente isso que uma plataforma de atendimento ao cliente com IA como a eesel oferece, e ela permanece independente de modelo para acompanhar sempre o melhor disponível.
Quem faz o Inkling e o que é o Tinker?
O Inkling é feito pela Thinking Machines Lab, fundada pela ex-CTO da OpenAI, Mira Murati. O laboratório distribui o modelo de graça e ganha dinheiro com o Tinker, sua plataforma hospedada de fine-tuning - o modelo "pesos abertos, venda de ferramentas" que o Hacker News debateu bastante durante boa parte da thread de lançamento.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração de um chip de modelo compacto direcionando um token por dois caminhos de especialistas iluminados entre muitos apagados, para um artigo explicativo sobre o Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B em que 12B fazem o trabalho

O que o Inkling-Small realmente é: um MoE de pesos abertos 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, quanto custa de fato um milhão de tokens e onde ele se encaixa numa stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração do workspace super-agente da Skywork AI
Trending

O que é a Skywork AI? O workspace "super-agente" explicado

Skywork AI é um super-agente de IA de propósito geral que cria slides, documentos, planilhas, sites e vídeos. Veja o que ela faz, como funciona e quanto custa.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Um agente de IA saindo de um monitor para operar janelas de aplicativos e documentos enquanto dois colegas observam, na cor azul de marca da Meta
Trending

Meta Muse Spark 1.1: o que é, quanto custa, onde falha

A primeira API de modelo paga da Meta lança um modelo agente com 1M de contexto por $1,25/$4,25. No que Muse Spark 1.1 é realmente bom, e os benchmarks que a Meta deixou de fora do slide.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Ilustração de um modelo a produzir painéis de imagem, vídeo e áudio, representando o FLUX 3 da Black Forest Labs
Trending

FLUX 3: o que a Black Forest Labs realmente lançou

FLUX 3 é um único modelo para imagem, vídeo, áudio e ações de robôs. Mas também não tem API, preço nem pesos abertos ainda. Aqui está o que você pode e não pode obter.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis