Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small

Inkling-Small em 30 segundos

Lançamento30 de julho de 2026, quinze dias após o Inkling
FabricanteThinking Machines Lab (Mira Murati)
Tamanho276B no total, 12B ativos, 42 camadas
LicençaApache 2.0, pesos no Hugging Face
Contexto1M de tokens na ficha, 524K via OpenRouter
EntradasTexto, imagem, áudio (WAV a 16 kHz)
Preço da API$0,30 a $0,50 de entrada, $1,20 de saída por 1M
Piso para auto-hospedagem89 GB em quantização de 2 bits
Melhor emCodificação, uso de ferramentas, loops de agentes, contexto longo
Mais fraco emRecall factual sem retrieval

O que o Inkling-Small realmente é

A parte interessante está na arquitetura, e ela explica os dois lados dos resultados.

O Inkling-Small é um transformer somente-decodificador de 42 camadas, com uma pilha feed-forward esparsa do tipo mixture-of-experts. Cada token é roteado para 6 de 256 especialistas, além de 2 especialistas compartilhados que disparam em todo e qualquer token. O total de parâmetros chega a 276B; apenas 12B deles ficam ativos por token. A ficha do modelo confirma camadas de atenção híbridas locais e globais, numérica em BF16 e NVFP4, e treinamento em sistemas NVIDIA GB300 NVL72.

Compare com o modelo pai. O Inkling tem 975B no total e 41B ativos ao longo de 66 camadas, então o formato do roteamento é o mesmo, mas com aproximadamente um quarto da massa total e menos de um terço da massa ativa. A Thinking Machines descreve o resultado como "desempenho comparável ao Inkling com um quarto do seu tamanho".

Essa proporção é toda a história aqui. Uma grande proporção entre total e ativo é o que torna um modelo barato de servir, e um total de parâmetros pequeno é o que o torna esquecido. O Inkling-Small apostou forte no primeiro ponto e pagou o preço no segundo. Para a versão geral desse mecanismo, modelos de IA personalizados percorre a mesma troca sem todas as tabelas de benchmark.

Ele recebe texto, depois imagens (entre 40 e 4096 pixels funciona melhor), e áudio como WAV a 16 kHz, idealmente com menos de dois minutos. A saída é somente texto. O esforço de raciocínio é um controle de 0 a 0,99, onde baixo é 0,2, médio fica em 0,7 e máximo é 0,99, então a cada chamada é possível trocar tokens de pensamento por latência.

A entrada de áudio nativa é o item mais raro dessa lista, motivo pelo qual esse modelo continua aparecendo em conversas sobre voz. Vale sinalizar a limitação: áudio entra, texto sai, então não há nenhuma síntese de fala aqui. Fornecedores que fecham esse ciclo são cobertos em empresas de voz com IA.

Para qual tarefa o Inkling-Small é indicado?

A resposta muda bastante dependendo da carga de trabalho, e para cada uma delas a própria tabela do fabricante traz as evidências. Escolha a tarefa que você realmente tem:

Inkling-Small ou o Inkling completo?

Escolha sua carga de trabalho. Os números vêm das fichas de modelo da Thinking Machines para os dois modelos.

Escolha o modelo pequeno

Ele vence de forma clara, e você ainda fica com tokens de saída 3,4 vezes mais baratos. Não há motivo para pagar pelo modelo grande aqui.

BenchmarkSmallInkling
SWEBench Verified80.2%77.6%
SWEBench Pro55.9%54.3%
Terminal Bench 2.164.7%63.8%
Escolha o modelo pequeno

A diferença no Toolathlon é de quase nove pontos, muito para um modelo tão mais barato. Loops de agentes longos são onde essa diferença de preço se acumula.

BenchmarkSmallInkling
Toolathlon Verified54.4%45.5%
MCP Atlas79.6%76.0%
GDPval-AA v2 (Elo)12691238
Embase-o, ou vá para o maior

Este é o único lugar onde o corte de tamanho realmente aparece. Uma pontuação negativa no Omniscience significa que respostas erradas ditas com confiança superam as corretas, então ou você dá a ele retrieval sobre suas próprias fontes, ou usa o modelo maior.

BenchmarkSmallInkling
SimpleQA Verified20.6%43.9%
AA Omniscience-9.0+2.1
Global-MMLU-Lite86.7%88.7%
Perto demais para importar

O modelo pai leva vantagem por pouco no AIME, o pequeno leva vantagem por pouco no GPQA. Os dois são altos o suficiente para que a diferença de preço decida.

BenchmarkSmallInkling
AIME 202695.5%97.1%
GPQA Diamond89.5%87.2%
HLE (text only)31.6%29.7%
Leve vantagem para o modelo pai

Áudio é a única modalidade em que a redução custou algo mensurável, mas pequeno. Os dois modelos aceitam WAV a 16 kHz nativamente, o que ainda é raro.

BenchmarkSmallInkling
VoiceBench90.1%91.4%
Audio MC54.9%56.6%
MMAU77.0%77.2%

Os benchmarks: ele realmente supera o pai

Um modelo destilado ou reduzido normalmente fica um pouco atrás do carro-chefe do qual se originou. O Inkling-Small não fica, pelo menos não nas categorias pelas quais a maioria das pessoas compra um modelo.

Scorecard showing where Inkling-Small beats and trails its larger parent model
Scorecard showing where Inkling-Small beats and trails its larger parent model

Em codificação, ele vence o SWEBench Verified com 80,2% contra 77,6%, depois o SWEBench Pro com 55,9% contra 54,3%, com o Terminal Bench 2.1 em 64,7% contra 63,8%. No lado agêntico, ele vence o Toolathlon Verified com 54,4% contra 45,5% e o MCP Atlas com 79,6% contra 76,0%, além de um Elo do GDPval-AA v2 de 1269 contra 1238. No raciocínio geral, ele vence o GPQA Diamond com 89,5% contra 87,2%, e o Humanity's Last Exam com 31,6% contra 29,7% na versão só de texto.

Ele também publica números que a ficha do modelo pai nem sequer reporta. SciCode 48,7%, CritPt 8,3%, depois ARC-AGI-1 com 84,0% e ARC-AGI-2 com 40,1%. No seguimento de instruções, o IFBench chega a 82,2% contra 79,8%, e isso importa mais do que parece para qualquer coisa que precise obedecer a um prompt de sistema de forma confiável. Se esse é o eixo que importa para você, agente de IA versus chatbot baseado em regras explica por que, na produção, obediência supera inteligência bruta.

As perdas no lado do raciocínio são reais, mas estreitas. O AIME 2026 cai para 95,5% partindo de 97,1%. O Tau 3 Banking cai para 15,5% partindo de 23,7%, a regressão mais acentuada de todo o bloco agêntico, e vale notar se sua carga de trabalho se parece com fluxos financeiros estruturados.

Outro resultado merece um alerta, porque é fácil de passar despercebido. O Global-MMLU-Lite, o teste multilíngue, cai para 86,7% partindo de 88,7%. Uma queda de dois pontos, então nada dramático, mas aponta na mesma direção dos números de factualidade: o corte saiu da amplitude do conhecimento. Se você atende vários idiomas, teste em cada um deles em vez de confiar no agregado, e agentes de suporte multilíngues cobre como esse teste é feito na prática.

De forma independente, a Artificial Analysis dá a ele 40 pontos no Intelligence Index, na posição #15 de 101, contra 41 e a posição #13 do Inkling completo. Apenas um ponto de índice de diferença, com um quarto do tamanho. Pontuação do fabricante e de terceiros independentes chegarem à mesma conclusão é incomum, e é o ponto mais forte de toda esta análise.

O único número que deveria fazer você parar

Aqui está a parte que não entrou no post de lançamento.

O SimpleQA Verified, que testa se um modelo conhece respostas factuais curtas, marca 20,6% para o Inkling-Small contra 43,9% para o Inkling. Menos da metade. E o AA Omniscience, que compensa respostas corretas contra respostas erradas ditas com confiança, marca -9,0 onde o modelo pai obtém +2,1.

Uma pontuação negativa no Omniscience significa que o modelo afirma mais coisas erradas com confiança do que coisas certas. Este não é um modelo que diz "não tenho certeza". É um modelo que preenche a lacuna. A própria Thinking Machines lista isso entre as limitações conhecidas, citando "alucinação (gerar conteúdo plausível, mas factualmente incorreto ou sem suporte)" e "desempenho degradado em conversas longas com múltiplos turnos", e recomenda não implantá-lo em contextos médicos, jurídicos ou de segurança crítica sem fine-tuning adicional. Vale o crédito: essa é uma seção de limitações mais franca do que a maioria dos laboratórios se dá ao trabalho de publicar.

Para um agente de código isso quase não importa, já que o compilador funciona como verificador de fatos. Para qualquer coisa voltada ao cliente, importa muito, e eu mesmo já vi esse modo de falha em produção. Uma equipe de suporte com quem trabalhei tinha uma base de conhecimento dizendo que davam suporte a todos os modelos de veículos, e por isso o bot confirmava alegremente cobertura para marcas de carros que nem sequer estavam no banco de dados deles. Nada alucinado no sentido dramático. O modelo simplesmente preencheu uma lacuna com algo plausível. Essa equipe descreveu sua configuração inicial como "tentativa e erro no começo".

Um modelo com -9,0 no Omniscience é esse mesmo modo de falha com o volume no máximo. As mitigações são conhecidas e nada empolgantes: retrieval sobre fontes que você controla, citações que uma pessoa pode verificar, e um caminho de recusa. Alucinações de IA no suporte cobre o conjunto completo, e a versão prática mais curta é prevenção de alucinações de IA.

Preço e velocidade: o verdadeiro motivo para se importar

É aqui que o modelo pequeno conquista seu lugar no mundo.

Inkling-SmallInkling
Entrada por 1M$0,30 a $0,50$1,00
Saída por 1M$1,20$4,05
Misto (AA)$0,22$0,72
Velocidade de saída131,1 tok/s84,8 tok/s
Tempo até o primeiro token1,65 s1,82 s
Provedores24
AA Intelligence Index4041

Os tokens de saída custam 3,4 vezes menos e chegam 1,5 vez mais rápido, em troca de um ponto de índice de inteligência. Para loops de agentes, onde os tokens de saída dominam a conta e a latência se acumula ao longo de dezenas de turnos, essa não é uma diferença marginal. Isso também aparece nos números que uma equipe de suporte realmente reporta, porque primeiros tokens mais rápidos movem a resolução no primeiro contato junto com o restante das métricas de atendimento ao cliente que derivam dela.

Duas ressalvas antes de sair orçando em cima disso. O preço de entrada ainda não está definido: a Artificial Analysis lista $0,30 por 1M, enquanto a listagem da OpenRouter mostra $0,45 e a API dela retorna $0,50, então confira sua própria rota. Além disso, há apenas dois provedores até agora, contra quatro do modelo pai, o que é pouco se você precisa de failover.

A segunda ressalva é a mais surpreendente. A ficha do modelo diz 1M de contexto. A OpenRouter atualmente o serve a 524.288 tokens, exatamente a metade. Os pesos suportam a janela completa, a API roteada simplesmente ainda não a expõe. Se um milhão de tokens era o motivo para escolher esse modelo, auto-hospede ou verifique com seu provedor antes. Tamanho da janela de contexto explica por que o número anunciado e o número realmente utilizável divergem tão frequentemente.

O negócio real da Thinking Machines é o Tinker, sua plataforma hospedada de fine-tuning com LoRA, e o Inkling-Small é suportado nele. O armazenamento de checkpoints custa $0,10 por GB ao mês; as tarifas de treinamento por token não são publicadas na página de visão geral.

Rodando o Inkling-Small por conta própria

Auto-hospedar é a melhoria mais clara em relação ao modelo pai, e aqui os números não estão nem perto de empatar.

Memory ladder showing Inkling-Small quantization sizes against a 128 GB workstation limit
Memory ladder showing Inkling-Small quantization sizes against a 128 GB workstation limit

Os números da Unsloth colocam o Inkling-Small em 543 GB em BF16, depois entre 132 e 170 GB em 4 bits, 128 GB em 3 bits, e 89 GB em 2 bits. O Inkling completo precisa de 1.900 GB em BF16 e ainda exige entre 270 e 285 GB mesmo com quantização de 1 bit. A ficha do modelo enquadra a mesma coisa em termos de hardware: 600 GB de VRAM agregada para BF16 (4x B300 ou 8x H200), caindo para 180 GB no checkpoint NVFP4, ou seja, um B300 ou um par de H200.

O número de 89 GB é o que muda quem consegue rodar isso. Isso cabe dentro de uma máquina com 128 GB de memória unificada, o que é uma compra de estação de trabalho, não de data center. E como apenas 12B de parâmetros ficam ativos por token, uma build fortemente quantizada continua utilizável em vez de arrastar.

As configurações de amostragem recomendadas são temperatura 1,0, top_p 1,0 e min_p 0,0, em um contexto de 1.048.576 tokens. O suporte desde o primeiro dia cobre transformers, vLLM, SGLang, TokenSpeed, Unsloth e Docker Model Runner, com builds quantizadas via llama.cpp, Ollama, LM Studio e Jan. Um ponto de atenção: o llama.cpp precisa do PR #25731 mesclado. Opções mais amplas de auto-hospedagem estão em melhores agentes de IA open source.

Prós e contras

O que é bom

  • Supera um modelo 3,5 vezes maior em codificação e uso de ferramentas, além de seguimento de instruções
  • $1,20 por milhão de tokens de saída, ou seja, 3,4 vezes mais barato que o pai
  • 131 tokens por segundo, uma velocidade significativamente maior
  • Apache 2.0, então a auto-hospedagem comercial não é restrita
  • Roda com 89 GB quantizado, dentro da faixa de uma workstation
  • Entrada nativa de áudio e imagem, ainda incomum nesse preço
  • Uma seção de limitações franca vinda do próprio fabricante

O que não é

  • SimpleQA Verified em 20,6%, menos da metade do modelo pai
  • AA Omniscience em -9,0, ou seja, mais respostas erradas ditas com confiança do que corretas
  • Contexto de 1M no papel, mas 524K via OpenRouter hoje
  • Apenas dois provedores de API, o que deixa o failover escasso
  • Tau 3 Banking cai para 15,5% partindo de 23,7%
  • As pontuações de áudio ficam levemente atrás do modelo pai nos três testes
  • Saída somente em texto, então não gera imagem nem áudio

O que a comunidade diz

A reação foi bem mais discreta do que o lançamento do carro-chefe, que atraiu mais de 1.200 pontos no Hacker News. O próprio tópico do Inkling-Small ficou com 33 deles. Compará-lo com o resto do cenário foi o primeiro instinto:

Hacker News

"better than haiku 4.5 smaller than nemotron 3 ultra"

O outro comentário o colocava contra o rival óbvio de pesos abertos, observando que ele é "About the same size as DeepSeek Flash 4, but also supports audio and image input." Um enquadramento justo. O DeepSeek V4 Flash é mais barato por token e só texto, então o suporte a áudio e imagem é o verdadeiro diferencial aqui, e o detalhe do confronto direto está na análise do Flash.

O comentário mais afiado veio antes mesmo de as quantizações serem lançadas, na submissão ao Hugging Face:

Hacker News

"I didn't see a gguf yet, going to be most interesting if there's a quant that fits nicely into about 90 [GB] so it can run in 128GB unified memory. It's 12B active so should hopefully be pretty fast at 2 bit quant if it fits"

A build de 2 bits da Unsloth chegou a 89 GB. A comunidade de inferência local acertou o número-alvo antes mesmo de o lançamento existir, e acertou em cheio. No primeiro mês, o repositório no Hugging Face registrou 15.500 downloads.

Uma coisa que notei: ninguém naqueles tópicos mencionou a regressão de factualidade. O enquadramento do lançamento foi velocidade e tamanho, então foi disso que se falou.

O que isso significa se você quer que ele responda tickets

Aqui vou ser direto, porque essa parte é literalmente o meu trabalho.

Um modelo barato e rápido parece uma vitória óbvia para o suporte. O volume de tickets é alto, as respostas são curtas, e 1,20 dólar por milhão de tokens de saída contra 4,05 é dinheiro de verdade em escala. Essa é a aritmética por trás de custo do atendimento ao cliente com IA, e é a mesma conta que move a comparação com agente humano. Equipes que acompanham isso como custo unitário costumam chegar ao custo por resolução.

Mas o suporte é a única carga de trabalho em que -9,0 no Omniscience se torna o número desqualificador, e não uma nota de rodapé. Um agente de código que inventa uma API recebe de volta um stack trace. Um agente de suporte que inventa um prazo de devolução, em vez disso, envia isso a um cliente, por escrito, com a sua logo estampada. Os compradores com quem converso já sabem disso, e é a objeção que surge primeiro. Uma líder de CX de uma marca de suplementos DTC colocou isso da forma mais direta possível:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

a DTC supplements CX lead, from an eesel sales call

Isso é um pedido por uma camada, não por um modelo. Quatro coisas precisam ficar entre qualquer modelo e a sua fila.

  1. Retrieval sobre fontes que você possui, para que as respostas venham da sua central de ajuda e de tickets passados, e não dos pesos. Chatbot de base de conhecimento com IA cobre o padrão; do lado das ferramentas há melhores ferramentas de base de conhecimento com IA.
  2. Roteamento por confiança, para que o modelo responda ao que tem certeza e escale o resto. O lado do roteamento é gestão de escalonamento com IA; a transferência limpa para um humano é transferência de agente.
  3. Um teste seco antes de ir ao ar, simulado contra seus próprios tickets históricos, e não contra a suíte de benchmark de outra pessoa. Essa é a etapa que as equipes costumam pular, e também a que pega as respostas erradas ditas com confiança.
  4. Autonomia delimitada, começando como copiloto que escreve rascunhos antes de responder por conta própria. Copiloto de IA é a rampa de entrada; a deflexão de nível 1 é aonde se chega, medida pela taxa de deflexão.

Faça essas quatro coisas e a lacuna de factualidade do Inkling-Small deixa de ser um passivo, porque os fatos param de sair do modelo. Pule-as e o que você comprou é uma fonte rápida, barata e confiante de respostas plausíveis. Essa é a diferença entre um agente de IA para helpdesk e uma chave de API crua, e é a mesma conclusão a que agentes de IA versus chatbots de IA chega pela outra direção.

Esse também é o motivo pelo qual uma boa camada de suporte permanece agnóstica em relação ao modelo. O Inkling-Small não é o primeiro modelo deste ano a se tornar a opção barata óbvia, e não será o último. Qualquer coisa fixada em um único modelo precisa ser refeita toda vez que o ranking se mexe, o que é uma péssima forma de rodar a automação de atendimento ao cliente.

Veredito

Para a maioria das tarefas, o Inkling-Small é a melhor compra em relação ao próprio modelo pai, e no preço nem é perto. Mesmo patamar de inteligência segundo a pontuação independente. Melhor em codificação e uso de ferramentas segundo os próprios números do fabricante, 3,4 vezes mais barato na saída, 1,5 vez mais rápido, Apache 2.0, e pequeno o suficiente para ser auto-hospedado em uma workstation. Quinze dias depois do carro-chefe, o modelo pequeno tornou o carro-chefe difícil de justificar.

A ressalva é específica e fácil de enunciar: ele sabe mensuravelmente menos, e não se comporta como tal. Dê a ele um compilador, um loop de ferramentas ou uma camada de retrieval e ele é excelente. Peça para ele ser a fonte da verdade e ele vai errar com confiança.

Se você quer para código ou agentes, adote hoje mesmo. Se quer perto de clientes, orce a camada acima dele, não só os tokens.

Para o panorama mais amplo do que mais se encaixa nesse espaço, comece por alternativas ao Inkling. O rival mais próximo em preço e tamanho tem seu próprio detalhamento em análise do Kimi K3.

E se o trabalho real é organizar uma caixa de entrada em vez de escrever código, triagem de tickets de suporte é a leitura mais útil, com a deflexão de tickets cobrindo o que acontece depois dessa triagem.

Try eesel

Escolheu o Inkling-Small e agora precisa que ele responda tickets reais com segurança? Essa lacuna é exatamente o que a eesel fecha. Ela se conecta ao Zendesk, Freshdesk, Gorgias ou qualquer helpdesk que você use em poucos minutos, aprende com seus tickets resolvidos e com sua central de ajuda em vez dos pesos do modelo, e então só responde àquilo de que tem certeza, deixando o resto para a sua equipe. Antes de tocar em uma fila real, você pode simulá-la contra o seu próprio histórico de tickets e ver as respostas reais que ela teria enviado, que é a verificação que uma pontuação de factualidade de -9,0 torna inegociável. Ela também permanece agnóstica em relação ao modelo, então o próximo modelo barato é uma mudança de configuração, não uma reconstrução.

eesel AI helpdesk dashboard showing live ticket activity and AI resolutions
eesel AI helpdesk dashboard showing live ticket activity and AI resolutions

Gratuito para testar, e cobrado por uso, então dá para conferir os preços antes de se comprometer. Try eesel ou veja como ele se encaixa como software de atendimento ao cliente com IA.

Sources

Perguntas frequentes

Vale a pena usar o Inkling-Small?
Para código, agentes e uso de ferramentas, sim. Ele marca 80,2% no SWEBench Verified contra 77,6% do seu modelo pai, roda a 131 tokens de saída por segundo e cobra 1,20 dólar por milhão de tokens de saída. Para qualquer coisa que precise ser factualmente correta sem uma camada de retrieval, tenha cuidado: o SimpleQA Verified cai para 20,6% em relação aos 43,9% do modelo pai. Meu resumo da análise do Inkling-Small é que ele é um excelente executor e uma enciclopédia fraca.
O Inkling-Small é melhor que o Inkling?
Na própria tabela do fabricante, ele ganha em codificação, uso agêntico de ferramentas e seguimento de instruções, e perde em matemática, factualidade e áudio. De forma independente, a Artificial Analysis coloca o Inkling-Small em 40 no seu Intelligence Index contra 41 do Inkling, então eles ficam no mesmo patamar. O modelo pequeno é mais rápido e bem mais barato, então para a maioria das tarefas ele é a melhor escolha.
Quanto custa o Inkling-Small?
A saída custa 1,20 dólar por milhão de tokens, contra 4,05 dólares do modelo completo. A entrada fica entre 0,30 e 0,50 dólar por milhão, dependendo do provedor usado. Os pesos em si são gratuitos sob a licença Apache 2.0. Se você está calculando isso contra um orçamento de suporte, e não de desenvolvimento, os números que importam estão em custo do atendimento ao cliente com IA e custo por resolução.
É possível rodar o Inkling-Small localmente?
Sim, e essa é a parte mais forte da história. A Unsloth aponta 543 GB em BF16, que caem para 89 GB com quantização de 2 bits, o que cabe dentro de uma workstation com 128 GB de memória unificada. O Inkling completo, de 975B, precisa de 1.900 GB em BF16, para efeito de comparação. Se o objetivo é auto-hospedar, o panorama mais amplo é coberto em melhores agentes de IA open source.
O Inkling-Small é bom para atendimento ao cliente?
Não sozinho, e os números de factualidade são exatamente o motivo. Um modelo que marca -9,0 no AA Omniscience responde com confiança além dos limites do que realmente sabe, o que, numa fila de suporte, se traduz em prometer uma política de reembolso que não existe. Ele precisa de embasamento na sua própria documentação, mais roteamento por confiança, que é justamente o que uma plataforma de atendimento ao cliente com IA adiciona. A mecânica está em alucinações de IA no suporte.
Qual é a janela de contexto do Inkling-Small?
A ficha do modelo indica 1M de tokens, e a Unsloth confirma 1.048.576. Vale saber antes de planejar em cima disso: a OpenRouter atualmente expõe apenas 524.288 tokens, então a API roteada entrega metade do que os pesos suportam. O comportamento em contextos longos, de forma geral, é discutido em tamanho da janela de contexto.
O Inkling-Small é gratuito e de código aberto?
Os pesos são Apache 2.0 no Hugging Face, sob thinkingmachines/Inkling-Small, então é possível auto-hospedar e usar comercialmente. Gratuito para baixar não significa gratuito para rodar, e a conta de hardware substitui a conta de tokens. A Thinking Machines também vende acesso via Tinker, sua plataforma hospedada de fine-tuning.
Quem cria o Inkling-Small e quando ele foi lançado?
A Thinking Machines Lab, fundada pela ex-CTO da OpenAI Mira Murati, lançou-o em 30 de julho de 2026, quinze dias depois do Inkling completo. É o segundo lançamento de pesos abertos da empresa, e a lista de concorrentes está em alternativas ao Inkling.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab
Trending

Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

O que o Inkling realmente é: o primeiro modelo de pesos abertos da Thinking Machines Lab, seus benchmarks reais, quanto custa rodá-lo e se ele tem algo a ver com uma fila de suporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Análise do Claude Opus 5: programação quase de ponta pela metade do preço

Uma análise prática do Claude Opus 5: o que os benchmarks realmente mostram, a taxa de alucinação que subiu, e se ele tem lugar numa fila de suporte em produção.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um modelo a produzir painéis de imagem, vídeo e áudio, representando o FLUX 3 da Black Forest Labs
Trending

FLUX 3: o que a Black Forest Labs realmente lançou

FLUX 3 é um único modelo para imagem, vídeo, áudio e ações de robôs. Mas também não tem API, preço nem pesos abertos ainda. Aqui está o que você pode e não pode obter.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: qual usar?

O Claude Opus 5 custa 1,7x o preço por token do Sonnet 5 e ainda assim termina algumas tarefas mais barato. Aqui está o confronto direto sobre preço, benchmarks e custo real por tarefa.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis