Inkling-Small explicado: um modelo de 276B em que 12B fazem o trabalho

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Ilustração de um chip de modelo compacto direcionando um token por dois caminhos de especialistas iluminados entre muitos apagados, para um artigo explicativo sobre o Inkling-Small

O que o Inkling-Small realmente é

A Thinking Machines Lab é a empresa de Mira Murati, e seu modelo de negócio é distribuir os pesos de graça e vender as ferramentas em torno deles. O Inkling-Small é o segundo modelo a sair pela porta: Apache 2.0, publicado no Hugging Face como thinkingmachines/Inkling-Small, e baixado cerca de 15.500 vezes em seu primeiro mês.

O fornecedor o chama de "um quarto do tamanho" do original, e, por uma vez, o número de marketing se confirma. O pai tem 975B totais / 41B ativos em 66 camadas. Este tem 276B totais / 12B ativos em 42 camadas. Isso é realmente próximo de um quarto em ambos os aspectos.

Ilustração do roteamento mixture-of-experts no Inkling-Small, mostrando 6 de muitos especialistas iluminados mais 2 especialistas compartilhados, com 276B totais e 12B ativos por token
Ilustração do roteamento mixture-of-experts no Inkling-Small, mostrando 6 de muitos especialistas iluminados mais 2 especialistas compartilhados, com 276B totais e 12B ativos por token

A arquitetura é um Mixture-of-Experts bastante agressivo. Cada camada contém 256 especialistas, e o roteador escolhe 6 deles por token, mais 2 especialistas compartilhados que ficam sempre ativos. A atenção é híbrida, alternando camadas locais e globais, e os pesos são distribuídos tanto em BF16 quanto em NVFP4. O treinamento foi executado em hardware NVIDIA GB300 NVL72.

A consequência prática dessa forma: você paga 276B em memória e 12B em computação. Esse é todo o truque, e é por isso que um modelo com um quarto de trilhão de parâmetros pode servir mais rápido que um modelo denso com um décimo de seu tamanho. Se o vocabulário de MoE for novo para você, a mecânica se generaliza para a maioria dos agentes de IA de código aberto atuais.

Também existe um controle de esforço de raciocínio que vai de 0 a 0,99, com os pontos sugeridos pelo fornecedor em 0,2 para baixo, 0,7 para médio e 0,99 para máximo. É um botão sobre quanto tempo o modelo pensa antes de responder, e ele move sua conta de tokens mais do que qualquer outra configuração que você ajustar.

O que entra e o que sai

Esta é a parte que as pessoas erram com mais frequência, então vale a pena ser direto.

Diagrama mostrando o Inkling-Small aceitando entrada de texto, imagem e áudio, mas produzindo apenas saída em texto, sem síntese de voz
Diagrama mostrando o Inkling-Small aceitando entrada de texto, imagem e áudio, mas produzindo apenas saída em texto, sem síntese de voz

As entradas são texto, imagens entre 40 e 4096 pixels, e áudio como WAV de 16kHz com menos de dois minutos. A saída é apenas texto. Não há síntese de voz neste modelo.

Isso importa se você estava planejando uma linha telefônica. Um modelo que ouve áudio mas não pode falar é apenas metade de um pipeline de voz, e você ainda precisa de texto-para-fala, telefonia, tratamento de barge-in e detecção de turno por cima. Se esse for o projeto, o panorama de fornecedores em empresas de voz com IA é um ponto de partida melhor do que um modelo cru.

A compreensão de áudio também é a única capacidade em que o modelo pequeno perdeu terreno para o pai em todos os aspectos: VoiceBench 90,1 contra 91,4, Audio MC 54,9 contra 56,6, MMAU 77,0 contra 77,2. As diferenças são pequenas, mas todas apontam na mesma direção.

A janela de contexto em que ninguém concorda

Aqui está uma constatação verificável que levou dois minutos e economiza uma tarde.

A ficha do modelo diz que a janela de contexto é de 1M de tokens. A OpenRouter, uma de apenas duas provedoras que o oferecem, o hospeda com 524.288 tokens. Isso é exatamente a metade, o que indica uma decisão de hospedagem deliberada, não um erro de digitação.

Nenhum dos dois números é mentira. Um descreve o que a arquitetura pode endereçar, o outro descreve o que um endpoint específico aceitará hoje. O padrão de falha é projetar um pipeline de recheio de documentos com base no número da ficha e bater numa parede em produção. Se você está construindo algo que depende de uma janela longa, leia o limite no endpoint que você está realmente chamando. A mesma armadilha pega quem usa agentes de codificação, motivo pelo qual escrevi sobre o tamanho da janela de contexto separadamente.

O número de provedores é o outro ponto fraco: 2 provedores, contra 4 do modelo pai. Para um modelo em seu quinto dia da segunda semana, isso é esperado, mas significa menos margem em caso de falha.

Quanto custa

O preço da saída está definido. US$ 1,20 por 1M de tokens de saída, confirmado pelo fornecedor, pela Artificial Analysis e pela OpenRouter. Contra os US$ 4,05 do pai, essa é a manchete.

O preço da entrada não está definido, e prefiro dizer isso do que escolher um número e parecer confiante:

FonteEntrada por 1MSaída por 1M
Artificial AnalysisUS$ 0,30US$ 1,20
Página do modelo na OpenRouterUS$ 0,45US$ 1,20
Resposta da API da OpenRouterUS$ 0,50US$ 1,20
Modelo pai (Inkling)referênciaUS$ 4,05

Se você planejar o orçamento com base em US$ 0,50, nada vai te surpreender. Em base combinada (blended), a Artificial Analysis posiciona o Inkling-Small em US$ 0,22 por 1M contra US$ 0,72 do pai, ou seja, aproximadamente um terço do custo para o mesmo nível de inteligência.

A velocidade é a metade subestimada do negócio. 131,1 tokens de saída por segundo contra os 84,8 do pai, com tempo até o primeiro token de 1,65s contra 1,82s. No Intelligence Index dele, o modelo pequeno marca 40 pontos e fica em 15º de 101, contra 41 pontos e 13º lugar do pai. Mesma categoria, mais rápido, mais barato. Essa é uma combinação incomum e o principal motivo para se interessar por este lançamento.

O fine-tuning passa pela própria plataforma Tinker da Thinking Machines, que dá suporte ao modelo. As taxas de treinamento por token não estão publicadas em nenhum lugar que eu tenha conseguido encontrar, e a página de preços em tinker-docs.thinkingmachines.ai/pricing atualmente retorna 404. O armazenamento de checkpoints custa US$ 0,10 por GB ao mês. Se o fine-tuning for o plano, a comparação com retrieval está detalhada em RAG versus fine-tuning.

Executando por conta própria

É aqui que o "grátis" dos pesos gratuitos é testado. As builds quantizadas da Unsloth trazem números reais para isso, e o número de 2 bits é o interessante: 89 GB, o que cabe numa máquina de 128 GB de memória unificada.

Há um detalhe bacana na discussão de lançamento. Um comentarista do Hacker News, andy99, disse que esperava algo em torno de 90 GB antes de qualquer quantização ter sido lançada. A Unsloth chegou a 89.

Verificação de compatibilidade para self-host
O que realmente cabe no seu hardware?
Escolha a máquina que você tem. Os números vêm das builds quantizadas da Unsloth e da própria ficha da Thinking Machines.
2 bits cabe, com 89 GB
Cabe: 2 bits (89 GB)
Bem no limite: 3 bits (128 GB)
Grande demais: 4 bits (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Este é o resultado de destaque do lançamento: um modelo de um quarto de trilhão de parâmetros numa única máquina de mesa. Espere perda de qualidade em 2 bits, e teste com seus próprios prompts em vez de confiar nos benchmarks.
3 bits cabe, 4 bits quase não cabe
Cabe: 2 bits (89 GB), 3 bits (128 GB)
Grande demais: 4 bits começa em 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Frustrantemente perto. O limite inferior do 4 bits é 132 GB contra seus 141 GB de VRAM bruta, e o cache KV para um contexto longo consome a diferença.
NVFP4 cabe, e o 4 bits também, com folga
Cabe: NVFP4 (180 GB+ necessários), 4 bits (132-170 GB), 3 bits, 2 bits
Grande demais: BF16 (543 GB)
Este é o ponto ideal para servir o modelo. O NVFP4 aqui é um formato entregue de primeira classe, não uma conversão da comunidade, então é o que vale a pena usar.
Os pesos completos em BF16 cabem
Cabe: BF16 (543 GB), e tudo abaixo dele
Sugestão da ficha: 4x B300 ou 8x H200 para BF16
Se você possui tanto silício, já sabe a resposta. Vale notar que o modelo pai precisa de cerca de 2 TB em BF16, então o pequeno é o primeiro dos dois a caber num único nó.
Use a API hospedada
Saída: US$ 1,20 por 1M de tokens
Entrada: US$ 0,30 a US$ 0,50 por 1M, dependendo da fonte
Provedores: 2 hoje
Nesses preços, você precisaria de muito volume antes que possuir hardware valha a pena, e o número de dois provedores significa failover limitado. Configurações de amostragem: temperature 1,0, top_p 1,0, min_p 0,0.

Duas observações práticas se você for para o local. A amostragem deve ser temperature 1,0, top_p 1,0, min_p 0,0, o que é incomum o suficiente para valer a pena anotar. E o suporte no llama.cpp chegou via PR #25731, então verifique se seu build o inclui antes de depurar problemas fantasmas.

Onde ele se encaixa, e onde realmente não se encaixa

Na própria tabela comparativa do fabricante, o modelo pequeno supera seu pai de 975B na maior parte do que se chamaria de execução. SWEBench Verified 80,2 contra 77,6, SWEBench Pro 55,9 contra 54,3, Terminal Bench 2.1 em 64,7 contra 63,8, Toolathlon 54,4 contra 45,5, MCP Atlas 79,6 contra 76,0, GPQA 89,5 contra 87,2, IFBench 82,2 contra 79,8.

Depois há a outra coluna. O AIME cai para 95,5 a partir de 97,1. O Global-MMLU-Lite cai para 86,7 a partir de 88,7, algo que vale a pena destacar se você estava planejando um agente de suporte multilíngue sobre ele. E o Tau 3 Banking cai de 23,7 para 15,5, a regressão isolada mais acentuada da tabela, num benchmark especificamente sobre uso de ferramentas em múltiplos turnos num cenário voltado ao cliente.

O par que mais importa para quem pensa em trabalho de suporte é o SimpleQA Verified em 20,6% contra os 43,9% do pai, junto com uma pontuação de Omniscience de -9,0 contra +2,1 do pai. Uma pontuação de Omniscience negativa significa que o modelo erra com mais confiança do que acerta. Ninguém nas threads de lançamento mencionou isso, o que é uma pena, porque é o número mais relevante para a decisão em todo o lançamento.

Quero ser justo aqui, porque isso é uma escolha de design, não um defeito. Um modelo com 12B ativos tem menos espaço para memorizar o mundo do que um com 41B ativos, e a Thinking Machines claramente gastou esse espaço em raciocínio e uso de ferramentas em vez disso. Se seu modelo vai consultar informações de qualquer forma, conhecimento trivial memorizado é peso morto. Essa é a aposta certa para um agente.

É a aposta errada para um bot que responde perguntas de memória. É exatamente o tipo de falha que já vi acontecer em tempo real. Uma equipe de suporte técnico B2B com quem trabalhei descobriu que seu bot confirmava "sim, oferecemos suporte ao seu modelo de veículo" para veículos que não estavam no banco de dados deles, porque a central de ajuda dizia que a empresa dava suporte a todos os modelos. O modelo não estava quebrado. Ele estava fazendo inferência confiante sobre uma fonte vaga, exatamente o que uma pontuação de Omniscience negativa prevê. Escrevi o padrão completo em prevenção de alucinações.

Então a leitura honesta: use o Inkling-Small onde uma camada de retrieval fornece os fatos e o modelo fornece o raciocínio. Não o use como fonte de verdade.

O que significa que a qualidade das suas fontes se torna o teto da precisão do modelo, e escolhê-las bem é uma palanca maior do que escolher o checkpoint. Meu apanhado de ferramentas de base de conhecimento é o ponto de partida prático.

O que isso significa se você for colocar IA numa fila de suporte

Um modelo é um motor, não um carro. Essa distinção é o cerne de agentes de IA versus chatbots, e é por isso que uma tabela de benchmarks te diz tão pouco sobre uma fila.

A lacuna entre "isso tem bom desempenho em benchmarks" e "isso responde aos meus clientes" é o produto inteiro, e é composta majoritariamente por partes nada glamurosas:

  • Grounding. O modelo precisa ler sua central de ajuda, suas macros e seus tickets resolvidos, não os dados de treinamento dele. Esse é o trabalho de uma camada como um chatbot de base de conhecimento com IA.
  • Roteamento por confiança. Algo precisa decidir quando o modelo não deveria responder de forma alguma, o que é o cerne da gestão de escalonamento com IA.
  • Um teste (dry run). Você quer saber a taxa de resolução antes dos clientes, não depois. A simulação contra o seu próprio histórico de tickets é a única forma honesta de obter esse número.
  • Handoff. Quando a IA para, um humano assume no meio da conversa com contexto completo, conforme as melhores práticas de handoff. A versão mais suave disso é um copiloto de IA, em que o modelo redige e um humano envia.
  • Medição. A taxa de deflection é o número que decide se tudo isso funcionou. Traduza-a em dinheiro com o custo por resolução.
  • Cobertura. Saber quais tópicos a IA deveria assumir é um exercício próprio, detalhado neste guia de deflection de tickets.

Uma líder de CX de suplementos DTC com quem falei resumiu o requisito numa frase: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone." Nenhum checkpoint de modelo te dá isso. Um limite de confiança e uma regra de roteamento dão, dentro de qualquer sistema de tickets com IA que você já use.

O lado das métricas dessa decisão vale a pena ler separadamente, porque "resolvido" significa coisas diferentes para equipes diferentes. Comece com métricas de suporte, depois resolução no primeiro contato.

Essa é também a resposta para a questão de construir versus comprar que um checkpoint gratuito Apache 2.0 naturalmente suscita. Os pesos são a parte mais barata do projeto. Os US$ 0,50 por milhão de tokens de entrada são a parte mais barata do projeto. As partes caras são o pipeline de retrieval, o arcabouço de avaliação (eval harness), a lógica de escalonamento e a pessoa que mantém os três no próximo trimestre.

O painel de helpdesk da eesel AI, mostrando respostas redigidas por IA e roteamento por confiança sobre uma fila de tickets em tempo real
O painel de helpdesk da eesel AI, mostrando respostas redigidas por IA e roteamento por confiança sobre uma fila de tickets em tempo real

Quer usar um modelo assim em tickets reais?

Se o preço e a velocidade do Inkling-Small chamaram sua atenção, o que você realmente quer é essa economia envolta em guardrails. A eesel se conecta ao Zendesk, Freshdesk e o resto da sua stack, treina com seus tickets passados e sua central de ajuda em vez da memória de um modelo, e permite que você simule todo o processo contra seu histórico de tickets antes de qualquer cliente ver isso. Você define o limite de confiança; tudo abaixo dele vai para um humano com contexto anexado. Grátis para testar, e você verá sua própria taxa de resolução antes de se comprometer.

Testar a eesel

Como ele se compara às outras opções de pesos abertos

A categoria de pesos abertos está lotada e as diferenças são menores do que os posts de lançamento sugerem.

Inkling-SmallInkling (pai)DeepSeek V4 Flash
Parâmetros276B / 12B ativos975B / 41B ativostamanho comparável
Entradastexto, imagem, áudiotexto, imagem, áudioapenas texto
Saída por 1MUS$ 1,20US$ 4,05menor
Velocidade131,1 tok/s84,8 tok/smuito rápida
AA Intelligence Index40 (#15)41 (#13)ver review

A leitura da comunidade foi curta e razoavelmente precisa. A thread principal no Hacker News atraiu apenas 33 pontos e dois comentários, um dos quais observou que ele é "About the same size as DeepSeek Flash 4, but also supports audio and image input." Esse é o diferencial em uma frase: entrada multimodal a preço de modelo pequeno.

O vizinho mais próximo em preço e formato é o DeepSeek V4 Flash, que fica mais barato por token, mas aceita apenas texto.

No outro extremo, o Kimi K3 cobra preços de ponta por pesos abertos, o que faz os US$ 1,20 do Inkling-Small parecerem generosos em comparação.

Se você quiser a versão em formato de veredito deste artigo em vez do explicativo, é a review do Inkling-Small. O pai de 975B também tem seu próprio artigo explicativo do Inkling.

Mais dois que vale a pena olhar antes de decidir: minha review do Inkling cobre o problema de preços do pai, e alternativas ao Inkling mapeia o campo mais amplo.

Números de segurança, para completar: StrongREJECT 98,4, FORTRESS 71,6 e 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contra 1238 do pai.

Minha opinião

O Inkling-Small é o mais interessante dos dois lançamentos da Inkling, e digo isso como alguém que ficou pouco impressionado com o preço do primeiro. Ele é mais rápido e custa cerca de um terço de um modelo que ele supera na maioria dos casos, aceita áudio e imagens, e com 89 GB quantizado é o primeiro modelo dessa classe que uma equipe pequena pode possuir por completo.

As ressalvas são específicas, não vagas. Leia o teto de contexto real do seu provedor em vez do da ficha. Faça o orçamento da entrada com base em US$ 0,50. E não o trate como fonte de conhecimento, porque uma pontuação de Omniscience de -9,0 está te dizendo, de antemão, que ele vai errar com confiança.

Para qualquer coisa voltada ao cliente, o modelo é a decisão fácil. A camada de automação em torno dele é a que determina se funciona, e isso continua verdadeiro seja qual for o checkpoint que ganhar no mês seguinte.

Se este artigo te deixou pensando em um rollout em vez de um download, comece com deflection de tier 1. Depois, defina onde o modelo não deveria responder de forma alguma, o que é o trabalho da triagem de tickets.

Fontes

  • Ficha do modelo da Thinking Machines Lab, thinkingmachines/Inkling-Small no Hugging Face (arquitetura, tabela de benchmarks, orientação de hardware, configurações de amostragem)
  • Artificial Analysis (Intelligence Index, throughput, TTFT, preços combinados, Omniscience)
  • Página do modelo e API da OpenRouter (janela de contexto servida, preços de entrada, número de provedores)
  • Tamanhos das builds quantizadas da Unsloth
  • Thread de lançamento no Hacker News
  • eesel Customer Voice Dossier (GENERAL BYTES, com permissão; extratos anonimizados de suporte técnico B2B e de suplementos DTC)

Perguntas frequentes

O que é o Inkling-Small?
O Inkling-Small é o segundo modelo de pesos abertos da Thinking Machines Lab, lançado em 30 de julho de 2026 sob a licença Apache 2.0. É um modelo Mixture-of-Experts com 276B de parâmetros totais e 12B ativos por token, então custa para executar aproximadamente como um modelo de 12B enquanto carrega o conhecimento equivalente a um modelo de 276B. Ele recebe texto, imagens e áudio como entrada e produz texto como saída. É o irmão menor do Inkling, que tem 975B totais / 41B ativos.
O Inkling-Small é gratuito e de código aberto?
Os pesos são Apache 2.0, então você pode baixar, fazer fine-tuning e usá-los comercialmente sem taxa de licença. Pesos gratuitos, porém, não significam inferência gratuita: a menor build quantizada utilizável tem cerca de 89 GB, e os pesos completos em BF16 são 543 GB. Se preferir não possuir esse hardware, dois provedores hospedados o oferecem. Mais opções estão no meu apanhado dos melhores agentes de IA de código aberto.
Quanto custa o Inkling-Small?
A saída custa US$ 1,20 por 1M de tokens, algo em que todas as fontes concordam. A entrada é onde fica nebuloso: a Artificial Analysis lista US$ 0,30, a página do modelo na OpenRouter diz US$ 0,45, e a própria API da OpenRouter retorna US$ 0,50. Se planejar o orçamento com base em US$ 0,50, você não terá surpresas. Para o que isso significa na economia do suporte, e não na do desenvolvimento, veja AI customer service cost.
Qual é a janela de contexto do Inkling-Small?
A ficha do modelo diz 1M de tokens. A OpenRouter o serve com 524.288, exatamente a metade. Os dois números são reais, apenas descrevem coisas diferentes: o que a arquitetura suporta versus o que um provedor escolheu hospedar. Verifique o limite no endpoint que você realmente vai chamar antes de projetar algo em torno dele. A mesma lacuna pega quem usa agentes de codificação, algo que cobri em a janela de contexto do Claude Code.
Posso executar o Inkling-Small localmente?
Sim, se você tiver memória suficiente. As builds quantizadas da Unsloth vão de 543 GB em BF16 até 89 GB em 2 bits, e esse número de 89 GB é o que torna viável uma estação de trabalho com 128 GB de memória unificada. A própria ficha da Thinking Machines pede pelo menos 600 GB de VRAM para BF16 e 180 GB para NVFP4. O suporte no llama.cpp exige que o PR #25731 esteja integrado ao seu build.
O Inkling-Small é bom para atendimento ao cliente?
É um excelente executor e uma péssima enciclopédia. O SimpleQA Verified cai para 20,6% em relação aos 43,9% do modelo pai, e sua pontuação de Omniscience na Artificial Analysis é -9,0, o que significa que ele dá mais respostas erradas com confiança do que certas. Envolvido em retrieval e roteamento por confiança, ele funciona bem. Aponte-o cru para uma fila de tickets e você obtém o padrão de falha descrito em AI hallucination prevention.
Como o Inkling-Small se compara ao DeepSeek V4 Flash e ao Kimi K3?
Ele está na mesma categoria de pesos abertos, e as vantagens e desvantagens variam conforme a tarefa. O DeepSeek V4 Flash é mais barato por token e apenas texto; o Kimi K3 tem preços de ponta (frontier). O diferencial do Inkling-Small é a entrada nativa de áudio e imagem a preço de modelo pequeno. Um comentarista do Hacker News resumiu assim: "About the same size as DeepSeek Flash 4, but also supports audio and image input."
Que hardware o Inkling-Small exige?
Para os pesos completos em BF16, a Thinking Machines sugere 4x B300 ou 8x H200. O NVFP4 precisa de pelo menos 180 GB. Quantizado, a escala é 132-170 GB em 4 bits, 128 GB em 3 bits e 89 GB em 2 bits. Se nada disso estiver disponível para você, a API hospedada é o caminho prático, e a conta de construir versus comprar está em custom AI models.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab
Trending

Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

O que o Inkling realmente é: o primeiro modelo de pesos abertos da Thinking Machines Lab, seus benchmarks reais, quanto custa rodá-lo e se ele tem algo a ver com uma fila de suporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração do workspace super-agente da Skywork AI
Trending

O que é a Skywork AI? O workspace "super-agente" explicado

Skywork AI é um super-agente de IA de propósito geral que cria slides, documentos, planilhas, sites e vídeos. Veja o que ela faz, como funciona e quanto custa.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Um agente de IA saindo de um monitor para operar janelas de aplicativos e documentos enquanto dois colegas observam, na cor azul de marca da Meta
Trending

Meta Muse Spark 1.1: o que é, quanto custa, onde falha

A primeira API de modelo paga da Meta lança um modelo agente com 1M de contexto por $1,25/$4,25. No que Muse Spark 1.1 é realmente bom, e os benchmarks que a Meta deixou de fora do slide.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Ilustração de um modelo a produzir painéis de imagem, vídeo e áudio, representando o FLUX 3 da Black Forest Labs
Trending

FLUX 3: o que a Black Forest Labs realmente lançou

FLUX 3 é um único modelo para imagem, vídeo, áudio e ações de robôs. Mas também não tem API, preço nem pesos abertos ainda. Aqui está o que você pode e não pode obter.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis