Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição July 20, 2026

Verificado por especialista
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise

O Inkling vale a pena para você? (Teste de 30 segundos)

Antes de mergulhar de vez, escolha o que mais importa para você e obtenha uma resposta direta. É a mesma decisão que eu tomaria em um projeto real.

O que o Inkling realmente é

Um contexto rápido antes da análise propriamente dita. O Inkling é o primeiro modelo público da Thinking Machines Lab, e o laboratório é surpreendentemente franco ao dizer que não está atrás do ranking. A proposta é uma base aberta ampla e equilibrada que você ajusta com fine-tuning para seu próprio uso na plataforma Tinker do laboratório. É um ponto de partida que você molda, não um chatbot ao qual você assina.

As especificações que importam, de acordo com o model card:

  • Arquitetura: um transformer Mixture-of-Experts, 975B no total com 41B ativos por token (6 de 256 especialistas roteados, mais 2 compartilhados). É assim que um modelo de quase um trilhão de parâmetros consegue funcionar em uma velocidade sensata.
  • Entradas: texto, imagens e áudio (WAV a 16 kHz, melhor com menos de ~20 minutos). A saída é somente texto.
  • Janela de contexto: até 1M de tokens.
  • Licença: Apache 2.0, então o uso comercial é permitido, e os pesos estão no Hugging Face.
  • Lançamento: 15 de julho de 2026.

O áudio é o destaque. Como descreveu o comentário mais votado na discussão de lançamento called it, este é o "largest open weight model that supports audio" - o que importa no momento em que você quer que um modelo ouça uma ligação de suporte em vez de ler uma transcrição dela.

Caminho de atenção relativa do Inkling: o estado oculto é projetado em Q, K, V e R, com uma convolução curta em K/V para o cache e um viés de posição relativa somado aos logits de atenção, conforme diagramado pela Thinking Machines no blog de lançamento do Hugging Face
Caminho de atenção relativa do Inkling: o estado oculto é projetado em Q, K, V e R, com uma convolução curta em K/V para o cache e um viés de posição relativa somado aos logits de atenção, conforme diagramado pela Thinking Machines no blog de lançamento do Hugging Face

Os benchmarks: inteligente, com arestas afiadas

É aqui que se separa o discurso do fornecedor da leitura independente. As próprias tabelas da Thinking Machines mostram números lisonjeiros no esforço máximo, mas o sinal mais limpo vem da Artificial Analysis, que avalia todo mundo do mesmo jeito.

O veredito deles: o Inkling pontua 41 no AA Intelligence Index, posição 10 de 97, bem acima da média de ~25 para modelos abertos desse tamanho. Então é um modelo inteligente. Mas fica abaixo dos líderes de ponta e cai em um agrupamento com concorrentes como o DeepSeek V4 Flash. Rastreadores mais amplos da comunidade o colocam mais perto da posição 41, de onde veio o debate sobre se é justo chamá-lo de "competitivo".

Avaliação (Artificial Analysis)InklingO que testa
GPQA Diamond87%Raciocínio científico
AA-LCR63%Raciocínio de contexto longo
Terminal-Bench v2.155%Codificação agêntica + uso de terminal
SciCode46%Programação
AA-Omniscience (accuracy)40%Conhecimento
GDPval-AA v237%Tarefas de trabalho do mundo real
Humanity's Last Exam30%Raciocínio + conhecimento
CritPt5%Raciocínio de física

Lendo isso com honestidade, o Inkling ganha uma personalidade real: forte em raciocínio científico e de contexto longo, visivelmente fraco em física e em confiabilidade de conhecimento bruto (seu índice de confiabilidade AA-Omniscience é um modesto 2 em uma escala de −100 a 100). Arestas afiadas, não um modelo parelho em tudo.

Por baixo dos placares também existe uma afirmação de eficiência genuinamente útil. O Inkling expõe um controle de esforço de raciocínio (de none a max na integração com o Hugging Face), e o laboratório diz que ele atinge o mesmo placar de Terminal-Bench que o Nemotron 3 Ultra gastando cerca de um terço dos tokens. Para quem paga por token ou aluga uma GPU, "mesma resposta, menos tokens" vale mais do que uma vitória fracionária em benchmark.

A discussão de lançamento capturou o mesmo retrato misto que eu vi:

Hacker News

"I just looked at the benchmarks and was kinda disappointed that it seems to be between KimiK2.6 and KimiK2.7 on most of the benchmarks."

O preço: a única crítica real

Esta é a parte que mais me surpreendeu nesta análise. O Inkling tem pesos abertos, e mesmo assim, na própria API da Thinking Machines, ele tem o preço de um modelo proprietário de ponta. Segundo a Artificial Analysis, ele fica na posição 81 de 97 em preço, entre os mais caros da categoria.

Caminho de acessoO que você pagaObservações
API da Thinking Machines — entradaUS$ 1,87 / 1M tokensMédia da categoria ~US$ 0,43; caro
API da Thinking Machines — saídaUS$ 4,68 / 1M tokensMédia da categoria ~US$ 1,25
Taxa combinada~US$ 1,10 / 1M tokensEm uma mistura de 7:2:1 cache:entrada:saída
Leitura/escrita de cacheUS$ 0,374 / 1M tokensUm acerto de cache é −80% em relação à entrada
Autohospedar os pesosUS$ 0 pelo modeloApache 2.0; você paga pelo hardware
Fine-tuning do TinkerServiço pagoO verdadeiro modelo de negócio do laboratório

Duas coisas se destacam. Primeiro, atualmente existe um único provedor de API, a própria Thinking Machines, então nenhum host terceirizado mais barato ainda está cobrando menos. Segundo, "pesos abertos" só torna o modelo gratuito se você estiver disposto a rodá-lo, o que é uma decisão real, não uma nota de rodapé. Então o veredito sobre o preço é simples: alugar o Inkling é difícil de justificar; possuí-lo pode ser uma pechincha.

Uma build GGUF de 1 bit do Inkling rodando localmente no estúdio da Unsloth, escrevendo um jogo de Sudoku em HTML autocontido depois de pensar por 321 segundos, com um medidor de contexto de 12,6k / 1.048,6k tokens, conforme mostrado no blog de lançamento do Hugging Face
Uma build GGUF de 1 bit do Inkling rodando localmente no estúdio da Unsloth, escrevendo um jogo de Sudoku em HTML autocontido depois de pensar por 321 segundos, com um medidor de contexto de 12,6k / 1.048,6k tokens, conforme mostrado no blog de lançamento do Hugging Face

Rodar você mesmo: o verdadeiro diferencial

Como os pesos são abertos, a comunidade já tinha o Inkling rodando localmente no primeiro dia. O blog de lançamento do Hugging Face descreve três níveis: o checkpoint completo em BF16 exige cerca de 2 TB de VRAM (território de data center), a quantização NVFP4 reduz isso para aproximadamente 600 GB em hardware Blackwell, e as builds GGUF de 1 bit da comunidade cortam isso em ~95%, o suficiente para uma workstation robusta.

O suporte de ferramentas também chegou rápido: integração desde o dia zero em transformers 5.14, SGLang, vLLM e llama.cpp/Unsloth, além de camadas de rascunho de decodificação especulativa para uma aceleração sem perdas. Essa história de "rodar você mesmo" é o verdadeiro motivo para se importar. O trade-off é controle contra conveniência: você possui os pesos, seus dados nunca saem da sua infraestrutura, e ninguém pode descontinuar o modelo debaixo dos seus pés, mas agora você é responsável pelas GPUs.

Para times que querem esse controle sem precisar cuidar de um cluster, o Inkling apareceu no Databricks desde o dia zero, acessível pelo Unity AI Gateway com governança embutida e sem preços por token.

Prós e contras

Aqui está o balanço desta análise, sem rodeios.

O que o Inkling acerta

  • Genuinamente aberto — pesos sob Apache 2.0, uso comercial, autohospedável até uma build de 1 bit.
  • Entrada nativa de áudio — o maior modelo de pesos abertos que ouve, não só lê.
  • Contexto de 1M de tokens — empata com o nível mais alto em extensão.
  • Raciocínio eficiente em tokens — o controle de esforço traz economias reais, não só uma frase de marketing.
  • Forte raciocínio científico + de contexto longo — 87% no GPQA Diamond, 63% no AA-LCR.

Onde ele decepciona

  • Caro para alugar — posição 81 de 97 em preço de API, um lugar estranho para pesos abertos.
  • Não é vencedor do ranking — fica abaixo dos líderes de ponta, no meio do pelotão entre os modelos abertos.
  • Confiabilidade de conhecimento fraca — índice AA-Omniscience de 2, além de um fraco 5% em raciocínio de física.
  • Apenas um provedor de API — ainda sem concorrência de terceiros em preço.
  • Hardware sério para autohospedar — modelo "gratuito", ~2 TB de VRAM para a build completa.

O que a comunidade realmente pensa

A discussão de lançamento no Hacker News (1.214 pontos, ~292 comentários) é a leitura mais clara sobre a recepção. O clima foi entusiasmado mas comedido, e a empolgação tinha menos a ver com os placares e mais com quem lançou o modelo:

Hacker News

"Not to mention - it is American. This is the first competitive non-Chinese open weights model since what, Llama 3?"

Esse enquadramento recebeu contestações (as pessoas citaram Mistral, o North da Cohere, o Gemma), mas o sentimento de fundo de que "uma opção ocidental confiável de pesos abertos já estava atrasada" percorreu toda a discussão. Também houve um saudável "como uma empresa que dá seu modelo de graça sobrevive?", cuja resposta caiu no Tinker, o negócio hospedado de fine-tuning. Mas a linha mais útil para quem faz sua própria análise foi o lembrete de que nenhum benchmark público é o teste de verdade:

Hacker News

"want to know how good a model is? Run it with your own non-public benchmark, basically the only way to get proper answers you can somewhat rely on, everything else is manipulated, misunderstood or over-relied on."

Guarde esse instinto, porque é exatamente ele que importa no momento em que você aponta um modelo para sua fila de suporte.

O que um modelo da classe do Inkling significa para o suporte

É aqui que passei os últimos anos, então vou ser direto. Eu construo a camada de agente que fica em cima de modelos como o Inkling, e a coisa que aprendi observando implantações reais é esta: um modelo base melhor raramente muda o que realmente chega a uma fila de suporte.

Um modelo puro, por mais inteligente que seja, não conhece sua política de reembolso, não consegue ver os últimos 40.000 tickets que seu time já resolveu, e não faz ideia de quando deveria ficar quieto e passar para um humano. Aponte-o direto para os clientes e ele vai responder com confiança e de forma errada, o que é pior do que não responder. Esse modo de falha é exatamente o motivo pelo qual as alucinações de IA no suporte queimam os times, e por isso o modelo é sempre só o motor.

O carro é a camada ao redor disso. É isso que a eesel é: ela aprende com seus tickets resolvidos e documentos de ajuda (não só uma página de marketing), encaminha por confiança para que respostas de baixa certeza virem rascunho em vez de serem enviadas, e, a parte que mais me importa, permite que você simule o agente contra seus próprios tickets passados antes que um único cliente o veja. Essa simulação é o conselho de "teste no seu próprio benchmark" do Hacker News, transformado em uma etapa do produto.

Fluxo mostrando um modelo de pesos abertos como o motor, uma camada da eesel que aprende com tickets resolvidos, encaminha por confiança e simula em tickets passados, e o colega de suporte funcional que resulta disso
Fluxo mostrando um modelo de pesos abertos como o motor, uma camada da eesel que aprende com tickets resolvidos, encaminha por confiança e simula em tickets passados, e o colega de suporte funcional que resulta disso

Isso também significa que você não aposta sua stack de suporte em um único modelo. O melhor modelo muda a cada poucas semanas (hoje o Inkling, no mês que vem outra coisa), então a eesel continua agnóstica em relação ao modelo e aproveita o que for mais forte a cada momento, enquanto a parte que importa para o cliente - o conhecimento, as barreiras de segurança, a triagem de tickets - permanece constante.

Veredito

O Inkling é um modelo de pesos abertos genuinamente bom, com uma peculiaridade de preço que você precisa planejar. Se você quer possuir os pesos, precisa de áudio ou contexto longo e consegue bancar o hardware, é um dos lançamentos abertos mais interessantes de 2026 e vale muito a pena baixar. Se você só quer a API capaz mais barata, ou o maior placar de benchmark, ele não é a escolha certa, e você não deveria forçar isso.

E se o seu objetivo real é responder tickets de suporte, lembre-se do que esta análise não para de repetir: um model card não é um agente de suporte. O motor é só metade do trabalho.

Experimente a eesel

O Inkling é um lançamento divertido, mas um model card não é um agente de suporte. Se seu objetivo real é automatizar o suporte de nível 1, o que você precisa é da camada que transforma qualquer modelo forte (aberto ou fechado) em um colega de equipe: a eesel se conecta ao seu helpdesk atual (Zendesk, Freshdesk, Gorgias, HubSpot, Front e mais de 100 outros), aprende com seu histórico e permite que você simule em tickets passados reais antes de entrar no ar, para que você veja cobertura e precisão primeiro, não depois que um cliente pegar uma resposta ruim. A Gridwise usou exatamente essa abordagem para resolver 73% das solicitações de nível 1 no primeiro mês.

O preço é baseado em uso, em torno de US$ 0,40 por ticket resolvido, sem taxas por assento, e você pode começar de graça. É a diferença entre admirar um ótimo motor e realmente dirigir para algum lugar.

Perguntas frequentes

O Inkling vale a pena?
Depende do motivo pelo qual você o quer. Como modelo aberto que você pode baixar, hospedar você mesmo e ajustar com fine-tuning, o Inkling é uma ótima escolha, principalmente se você precisa de entrada nativa de áudio ou de um contexto de 1M de tokens. Como a API capaz mais barata, não vale a pena - a cerca de US$ 1,87 de entrada / US$ 4,68 de saída, o preço é o de um modelo proprietário de ponta, então concorrentes abertos mais baratos ganham em custo. Meu resumo desta análise do Inkling: ótimo para possuir, caro para alugar.
O Inkling é bom comparado ao Kimi e ao GLM?
Ele é genuinamente inteligente - a Artificial Analysis dá 41 pontos no Intelligence Index, posição 10 de 97 - mas não lidera o grupo de modelos abertos. Testadores da comunidade no Hacker News constataram que ele fica com benchmarks mais ou menos entre o Kimi K2.6 e o K2.7. Suas vantagens reais são o áudio nativo e o contexto longo, não uma vitória no ranking.
Quanto custa o Inkling?
Na própria API da Thinking Machines, o Inkling custa cerca de US$ 1,87 por 1M de tokens de entrada e US$ 4,68 por 1M de tokens de saída, segundo a Artificial Analysis, que o coloca na posição 81 de 97 em preço - caro para um modelo aberto desse tamanho. Os próprios pesos são gratuitos sob Apache 2.0, então a autohospedagem troca a conta por token por uma conta de hardware.
O Inkling é gratuito e de código aberto?
Os pesos podem ser baixados gratuitamente sob Apache 2.0, então você pode autohospedar o Inkling e usá-lo comercialmente. Mas "gratuito" não é "gratuito para rodar": a build completa em BF16 exige cerca de 2 TB de VRAM, caindo para uma workstation só com um GGUF de 1 bit fortemente quantizado. Também existe uma API paga própria caso você não queira lidar com o hardware.
Posso usar o Inkling para atendimento ao cliente?
Você pode conectá-lo, mas um modelo puro não é um agente de suporte, por melhor que pareçam os números desta análise do Inkling. Para responder tickets reais com segurança, você precisa de uma camada que aprenda com seus tickets resolvidos, encaminhe por confiança e possa ser simulada antes de entrar no ar. É isso que uma plataforma de atendimento ao cliente com IA como a eesel acrescenta, e ela continua agnóstica em relação ao modelo, podendo aproveitar o que for melhor a cada momento.
Quem cria o Inkling e o que é o Tinker?
O Inkling é o primeiro modelo de pesos abertos da Thinking Machines Lab, fundada pela ex-CTO da OpenAI Mira Murati. O laboratório distribui o modelo de graça e ganha dinheiro com o Tinker, sua plataforma hospedada de fine-tuning - o modelo de negócio "pesos abertos, venda as ferramentas" que o Hacker News debateu o dia inteiro do lançamento.
Quais são os resultados do Inkling nos benchmarks?
Segundo a Artificial Analysis: AA Intelligence Index 41 (posição 10 de 97), GPQA Diamond 87%, contexto longo AA-LCR 63%, Terminal-Bench 55%, SciCode 46% e Humanity's Last Exam 30%. Ele é fraco em raciocínio de física (CritPt 5%) e em confiabilidade de conhecimento (índice AA-Omniscience de 2 em uma escala de -100 a 100). Arestas afiadas, não um modelo parelho em tudo.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab
Trending

Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

O que o Inkling realmente é: o primeiro modelo de pesos abertos da Thinking Machines Lab, seus benchmarks reais, quanto custa rodá-lo e se ele tem algo a ver com uma fila de suporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração editorial de um modelo de linguagem grande raciocinando sobre um longo fluxo de documentos
Trending

Análise do Kimi K3: o modelo de fronteira aberto da Moonshot, testado

Uma análise prática do Kimi K3: a arquitetura do modelo aberto de 2,8T, os benchmarks, os preços reais e o que a comunidade realmente pensa na semana de lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Ilustração editorial de agentes de codificação em paralelo e janelas de terminal, representando o campo de alternativas ao ZCode
Trending

As 8 melhores alternativas ao ZCode em 2026

O ZCode é impressionante e tosco ao mesmo tempo. Aqui estão as 8 melhores alternativas ao ZCode em 2026, com preços reais, trocas honestas e para quem cada uma é indicada.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustração editorial de um ranking de benchmarks com uma barra alta em destaque, representando o ZCode e o modelo GLM-5.2
Trending

ZCode: o que a nova agente de codificação de IA da Z.ai realmente é

Uma análise prática do ZCode, o aplicativo de codificação agêntica gratuito da equipe GLM: o modelo GLM-5.2 por trás dele, as reclamações reais da semana de lançamento e quem deveria usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustração representando o modelo de linguagem grande Kimi K3 da Moonshot AI
Trending

Kimi K3 explicado: o modelo de fronteira aberto da Moonshot

Um guia direto sobre o Kimi K3, o modelo aberto de 2,8 trilhões de parâmetros da Moonshot AI: o que é, como se sai, quanto custa e se vale a pena migrar para ele.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Banner principal da análise do PromptQL com o logo do PromptQL sobre um fundo índigo
Trending

Análise do PromptQL (2026): o agente de dados da Hasura, testado

Uma análise prática do PromptQL: como o agente de dados da Hasura separa planejamento de execução, quanto custa e se a promessa de confiabilidade se sustenta.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Texto alternativo da imagem
Guides

Nossa análise completa do GPT 5.3 Codex: Uma nova era para a IA agêntica

Uma análise aprofundada do GPT 5.3 Codex. Detalhamos as novas capacidades agênticas, o desempenho em benchmarks, preços e limitações, como a ausência de acesso à API.

Stevia PutriStevia PutriFeb 6, 2026
Banner ilustrado para um guia sobre os preços e custos de API do Google Gemini 3.5 Pro
Trending

Preços do Gemini 3.5 Pro: quanto custa (e o que ainda falta)

Uma resposta direta sobre os preços do Gemini 3.5 Pro: ele ainda não está disponível. Veja quanto custa o nível Pro atual, os planos para consumidores e a conta real da API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis