Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small

O que o Inkling-Small realmente é

Thinking Machines Lab é a empresa de Mira Murati, e seu modelo de negócio consiste em dar os pesos de graça e vender as ferramentas ao redor deles. Inkling-Small é o segundo modelo lançado: Apache 2.0, publicado no Hugging Face como thinkingmachines/Inkling-Small, e baixado cerca de 15.500 vezes em seu primeiro mês.

O fornecedor o chama de "um quarto do tamanho" do original, e por uma vez o número de marketing se confirma. O modelo pai tem 975B total / 41B ativos em 66 camadas. Este tem 276B total / 12B ativos em 42 camadas. Isso realmente chega perto de um quarto em ambas as contagens.

Ilustração do roteamento mixture-of-experts no Inkling-Small, mostrando 6 de muitos especialistas ativados mais 2 especialistas compartilhados, com 276B de parâmetros totais e 12B ativos por token
Ilustração do roteamento mixture-of-experts no Inkling-Small, mostrando 6 de muitos especialistas ativados mais 2 especialistas compartilhados, com 276B de parâmetros totais e 12B ativos por token

A arquitetura é um Mixture-of-Experts bastante agressivo. Cada camada tem 256 especialistas, e o roteador escolhe 6 deles por token, mais 2 especialistas compartilhados que estão sempre ativos. A atenção é híbrida, alternando entre camadas locais e globais, e os pesos são disponibilizados tanto em BF16 quanto em NVFP4. O treinamento rodou em hardware NVIDIA GB300 NVL72.

A consequência prática dessa forma: você paga 276B em memória e 12B em computação. Esse é todo o truque, e é por isso que um modelo com um quarto de trilhão de parâmetros pode atender mais rápido do que um modelo denso com um décimo do seu tamanho. Se o vocabulário de MoE for novo para você, a mecânica se generaliza para a maioria dos agentes de IA de código aberto atuais.

Também há um botão de esforço de raciocínio que vai de 0 a 0,99, com os pontos sugeridos pelo fornecedor em 0,2 para baixo, 0,7 para médio e 0,99 para máximo. É um controle de quanto tempo o modelo pensa antes de responder, e ele move sua conta de tokens mais do que qualquer outra configuração que você mexer.

O que entra e o que sai

Essa é a parte que as pessoas mais frequentemente entendem errado, então vale a pena ser direto.

Diagrama mostrando o Inkling-Small aceitando entrada de texto, imagem e áudio, mas produzindo apenas saída de texto, sem síntese de fala
Diagrama mostrando o Inkling-Small aceitando entrada de texto, imagem e áudio, mas produzindo apenas saída de texto, sem síntese de fala

As entradas são texto, imagens entre 40 e 4096 pixels, e áudio em WAV de 16kHz com menos de dois minutos. A saída é apenas texto. Não há síntese de fala neste modelo.

Isso importa se você estava planejando uma linha telefônica. Um modelo que ouve áudio mas não consegue falar é apenas metade de um pipeline de voz, e você ainda precisa de texto para fala, telefonia, tratamento de interrupções (barge-in) e detecção de turnos por cima. Se esse é o projeto, o panorama de fornecedores em empresas de IA de voz é um ponto de partida melhor do que um modelo puro.

A compreensão de áudio também é a única capacidade em que o modelo pequeno perdeu terreno para seu pai em todos os aspectos: VoiceBench 90,1 contra 91,4, Audio MC 54,9 contra 56,6, MMAU 77,0 contra 77,2. As diferenças são pequenas, mas todas apontam na mesma direção.

A janela de contexto sobre a qual ninguém concorda

Aqui está uma descoberta verificável que levou dois minutos e economiza uma tarde inteira.

A ficha do modelo diz que a janela de contexto é de 1M de tokens. A OpenRouter, um dos únicos dois provedores que o oferecem, o hospeda em 524.288 tokens. Isso é exatamente a metade, o que indica uma decisão de hospedagem deliberada, e não um erro de digitação.

Nenhum dos dois números é mentira. Um descreve o que a arquitetura pode endereçar, o outro descreve o que um endpoint específico aceita hoje. O modo de falha típico é projetar um pipeline de preenchimento de documentos com base no número da ficha e esbarrar em uma parede na produção. Se você está construindo algo que depende de uma janela longa, leia o teto no endpoint que você realmente está chamando. A mesma armadilha pega quem usa agentes de codificação, por isso escrevi sobre o tamanho da janela de contexto separadamente.

O número de provedores é o outro ponto fraco: 2 provedores, contra 4 do modelo pai. Para um modelo que está há apenas cinco dias em sua segunda semana, isso é esperado, mas significa menos margem para tolerância a falhas.

O que custa

O preço de saída está definido. $1,20 por 1M de tokens de saída, confirmado pelo fornecedor, pelo Artificial Analysis e pela OpenRouter. Contra os $4,05 do modelo pai, essa é a manchete.

O preço de entrada não está definido, e prefiro te dizer isso a escolher um número e parecer confiante:

FonteEntrada por 1MSaída por 1M
Artificial Analysis$0.30$1.20
Página do modelo na OpenRouter$0.45$1.20
Resposta da API da OpenRouter$0.50$1.20
Modelo pai (Inkling)referência$4.05

Planeje o orçamento com base em $0,50 e nada vai te surpreender. Em base combinada (blended), o Artificial Analysis coloca o Inkling-Small em $0,22 por 1M contra $0,72 do modelo pai, então cerca de um terço do custo pelo mesmo nível de inteligência.

A velocidade é a metade subestimada do negócio. 131,1 tokens de saída por segundo contra os 84,8 do modelo pai, com tempo até o primeiro token (TTFT) de 1,65s contra 1,82s. No seu Intelligence Index, o modelo pequeno pontua 40 e fica em 15º lugar entre 101, contra 41 e 13º lugar do modelo pai. Mesmo nível, mais rápido, mais barato. Essa é uma combinação incomum e a principal razão para prestar atenção a este lançamento.

O fine-tuning passa pela própria plataforma Tinker da Thinking Machines, que suporta o modelo. As taxas de treinamento por token não estão publicadas em nenhum lugar que eu tenha encontrado, e a página de preços em tinker-docs.thinkingmachines.ai/pricing atualmente retorna 404. O armazenamento de checkpoints custa $0,10 por GB por mês. Se o fine-tuning é o plano, a troca em relação ao retrieval está detalhada em RAG versus fine-tuning.

Rodando você mesmo

É aqui que o "grátis" dos pesos gratuitos é posto à prova. Os builds quantizados da Unsloth trazem números reais, e o número de 2-bit é o interessante: 89 GB, que cabem em uma máquina de 128 GB de memória unificada.

Há um detalhe interessante na discussão do lançamento. Um comentarista do Hacker News, andy99, disse que esperava algo em torno de 90 GB antes de qualquer versão quantizada ser lançada. A Unsloth chegou a 89.

Verificação de encaixe para autoinstalação
O que realmente cabe no seu hardware?
Escolha a máquina que você tem. Os números são dos builds quantizados da Unsloth mais a própria ficha da Thinking Machines.
O 2-bit cabe, com 89 GB
Cabe: 2-bit (89 GB)
Bem no limite: 3-bit (128 GB)
Grande demais: 4-bit (132-170 GB), NVFP4 (180 GB+), BF16 (543 GB)
Este é o resultado principal do lançamento: um modelo de um quarto de trilhão de parâmetros em uma única máquina do tamanho de uma mesa. Espere perda de qualidade em 2-bit, e teste com seus próprios prompts em vez de confiar nos benchmarks.
O 3-bit cabe, o 4-bit não cabe direito
Cabe: 2-bit (89 GB), 3-bit (128 GB)
Grande demais: o 4-bit começa em 132 GB, NVFP4 (180 GB+), BF16 (543 GB)
Frustrantemente perto. O limite inferior do 4-bit é 132 GB contra seus 141 GB de VRAM bruta, e o cache KV para um contexto longo consome a diferença.
O NVFP4 cabe, e o 4-bit também, com folga
Cabe: NVFP4 (180 GB+ necessários), 4-bit (132-170 GB), 3-bit, 2-bit
Grande demais: BF16 (543 GB)
Este é o ponto ideal para servir o modelo. O NVFP4 é um formato lançado oficialmente aqui, e não uma conversão da comunidade, então é a opção a escolher.
Os pesos completos em BF16 cabem
Cabe: BF16 (543 GB), e tudo abaixo disso
Sugestão da ficha: 4x B300 ou 8x H200 para BF16
Se você possui tanto silício assim, já sabe a resposta. Vale notar que o modelo pai precisa de cerca de 2 TB em BF16, então o pequeno é o primeiro do par a caber em um único nó.
Use a API hospedada
Saída: $1,20 por 1M de tokens
Entrada: de $0,30 a $0,50 por 1M, dependendo da fonte
Provedores: 2 hoje
Nesses preços, você precisaria de muito volume antes que possuir hardware próprio compense, e o número de dois provedores significa tolerância a falhas limitada. Configurações de amostragem: temperature 1.0, top_p 1.0, min_p 0.0.

Duas notas práticas se você for rodar localmente. A amostragem deve ser temperature 1.0, top_p 1.0, min_p 0.0, o que é incomum o suficiente para valer a pena anotar. E o suporte ao llama.cpp chegou pelo PR #25731, então verifique se o seu build o inclui antes de depurar problemas fantasmas.

Onde ele se encaixa e onde realmente não se encaixa

Na própria tabela comparativa de seu criador, o modelo pequeno supera seu pai de 975B na maioria do que se poderia chamar de execução. SWEBench Verified 80,2 contra 77,6, SWEBench Pro 55,9 contra 54,3, Terminal Bench 2.1 em 64,7 contra 63,8, Toolathlon 54,4 contra 45,5, MCP Atlas 79,6 contra 76,0, GPQA 89,5 contra 87,2, IFBench 82,2 contra 79,8.

Depois há a outra coluna. O AIME cai para 95,5 partindo de 97,1. O Global-MMLU-Lite cai para 86,7 partindo de 88,7, algo que vale a pena sinalizar se você estava planejando um agente de suporte multilíngue sobre ele. E o Tau 3 Banking cai de 23,7 para 15,5, a regressão individual mais acentuada da planilha, em um benchmark especificamente sobre uso de ferramentas em múltiplos turnos em um ambiente voltado ao cliente.

O par que mais importa para quem pensa em trabalho de suporte é o SimpleQA Verified em 20,6% contra 43,9% do modelo pai, junto com uma pontuação de Omniscience de -9,0 contra +2,1 do pai. Uma pontuação de Omniscience negativa significa que o modelo erra com mais confiança do que acerta. Ninguém nos threads de lançamento mencionou isso, o que é uma pena, porque é o número mais relevante para a tomada de decisão em todo o lançamento.

Quero ser justo aqui, porque isso é uma escolha de design, e não um defeito. Um modelo com 12B ativos tem menos espaço para memorizar o mundo do que um com 41B ativos, e a Thinking Machines claramente investiu esse espaço em raciocínio e uso de ferramentas em vez disso. Se o seu modelo vai buscar informações de qualquer forma, trivialidades memorizadas são peso morto. Essa é a aposta certa para um agente.

É a aposta errada para um bot que responde de memória. Este é exatamente o tipo de falha que já vi acontecer ao vivo. Uma equipe de suporte técnico B2B com quem trabalhei descobriu que seu bot confirmava "sim, damos suporte ao seu modelo de veículo" para veículos que não estavam no banco de dados deles, porque a central de ajuda dizia que a empresa dava suporte a todos os modelos. O modelo não estava quebrado. Ele estava fazendo uma inferência confiante sobre uma fonte vaga, exatamente o que uma pontuação de Omniscience negativa prevê. Escrevi o padrão completo em prevenção de alucinações.

Então a leitura honesta é: use o Inkling-Small onde uma camada de retrieval fornece os fatos e o modelo fornece o raciocínio. Não o use como fonte da verdade.

O que significa que a qualidade das suas fontes se torna o teto da precisão do modelo, e escolhê-las bem é uma alavanca maior do que escolher o checkpoint. Meu resumo de ferramentas de base de conhecimento é o ponto de partida prático.

O que isso significa se você vai colocar IA em uma fila de suporte

Um modelo é um motor, não um carro. Essa distinção é o cerne de agentes de IA versus chatbots, e é por isso que uma tabela de benchmarks te diz tão pouco sobre uma fila.

A lacuna entre "isso pontua bem em benchmarks" e "isso responde aos meus clientes" é o produto inteiro, e é composta em sua maioria por partes nada glamorosas:

  • Grounding (fundamentação). O modelo precisa ler sua central de ajuda, suas macros e seus tickets resolvidos, não seus dados de treinamento. Esse é o trabalho de uma camada de chatbot de base de conhecimento com IA.
  • Roteamento por confiança. Algo precisa decidir quando o modelo não deveria responder de jeito nenhum, o que é o núcleo da gestão de escalonamento com IA.
  • Um teste seco (dry run). Você quer saber a taxa de resolução antes dos clientes, não depois. Simular contra seu próprio histórico de tickets é a única forma honesta de obter esse número.
  • Transferência (handoff). Quando a IA para, uma pessoa assume no meio da conversa com contexto completo, conforme as melhores práticas de transferência. A versão mais suave disso é um copiloto de IA, em que o modelo redige e uma pessoa envia.
  • Medição. A taxa de deflection é o número que decide se tudo isso funcionou. Traduza-a em dinheiro com o custo por resolução.
  • Cobertura. Saber quais tópicos a IA deveria sequer assumir é um exercício em si, detalhado neste guia de deflection de tickets.

Uma líder de CX de suplementos de uma marca DTC com quem conversei resumiu o requisito em uma frase: "Preciso de uma IA que só lide com os tickets em que tem confiança e deixe todos os outros em paz". Nenhum checkpoint de modelo te dá isso. Um limiar de confiança e uma regra de roteamento dão, dentro de qualquer sistema de tickets com IA que você já use.

O lado das métricas dessa decisão vale a pena ler separadamente, porque "resolvido" significa coisas diferentes para equipes diferentes. Comece com métricas de suporte, depois resolução no primeiro contato.

Essa também é a resposta para a pergunta de construir versus comprar que um checkpoint gratuito Apache 2.0 naturalmente levanta. Os pesos são a parte mais barata do projeto. Os $0,50 por milhão de tokens de entrada são a parte mais barata do projeto. As partes caras são o pipeline de retrieval, o arcabouço de avaliação, a lógica de escalonamento, e a pessoa que mantém os três no próximo trimestre.

O painel do helpdesk de IA da eesel, mostrando respostas redigidas por IA e roteamento por confiança sobre uma fila de tickets ao vivo
O painel do helpdesk de IA da eesel, mostrando respostas redigidas por IA e roteamento por confiança sobre uma fila de tickets ao vivo

Quer usar um modelo assim em tickets reais?

Se o preço e a velocidade do Inkling-Small chamaram sua atenção, o que você realmente quer é essa economia envolvida em guardrails. A eesel se conecta ao Zendesk, Freshdesk e ao resto da sua stack, treina com seus tickets passados e sua central de ajuda em vez da memória de um modelo, e permite simular tudo contra seu histórico de tickets antes que um único cliente veja. Você define o limiar de confiança; tudo abaixo disso vai para um humano com contexto anexado. Grátis para testar, e você verá sua própria taxa de resolução antes de se comprometer.

Try eesel

Como ele se compara às outras opções de pesos abertos

A faixa de pesos abertos está lotada, e as diferenças são mais estreitas do que os posts de lançamento sugerem.

Inkling-SmallInkling (pai)DeepSeek V4 Flash
Parâmetros276B / 12B ativos975B / 41B ativostamanho comparável
Entradastexto, imagem, áudiotexto, imagem, áudioapenas texto
Saída por 1M$1.20$4.05menor
Velocidade131,1 tok/s84,8 tok/smuito rápido
AA Intelligence Index40 (#15)41 (#13)ver review

A leitura da comunidade foi breve e razoavelmente precisa. O thread principal no Hacker News atraiu apenas 33 pontos e dois comentários, um dos quais observou que é "mais ou menos do mesmo tamanho que o DeepSeek Flash 4, mas também suporta entrada de áudio e imagem". Esse é o diferencial em uma frase: entrada multimodal a um preço de modelo pequeno.

O vizinho mais próximo em preço e formato é o DeepSeek V4 Flash, que fica mais barato por token, mas só aceita texto.

No outro extremo da faixa, o Kimi K3 cobra preços de fronteira por pesos abertos, o que faz os $1,20 do Inkling-Small parecerem generosos em comparação.

Se você quer a versão com veredito deste artigo em vez da explicativa, essa é a review do Inkling-Small. O pai de 975B também tem seu próprio artigo explicativo do Inkling.

Mais dois valem a pena conferir antes de decidir: minha review do Inkling cobre o problema de preços do modelo pai, e alternativas ao Inkling mapeia o campo mais amplo.

Números de segurança, para completar: StrongREJECT 98,4, FORTRESS 71,6 e 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contra 1238 do pai.

Minha opinião

O Inkling-Small é o mais interessante dos dois lançamentos da Inkling, e digo isso como alguém que ficou desapontado com o preço do primeiro. Ele é mais rápido e custa cerca de um terço de um modelo que ele majoritariamente supera, aceita áudio e imagens, e com 89 GB quantizado é o primeiro modelo dessa classe que uma equipe pequena pode possuir totalmente.

As ressalvas são específicas, não vagas. Leia o teto de contexto real do seu provedor, não o da ficha. Faça o orçamento de entrada com base em $0,50. E não o trate como fonte de conhecimento, porque uma pontuação de Omniscience de -9,0 é o modelo te dizendo, de antemão, que ele vai errar com confiança.

Para qualquer coisa voltada ao cliente, o modelo é a decisão fácil. A camada de automação ao redor dele é o que determina se funciona, e isso continua verdadeiro independentemente de qual checkpoint vencer no próximo mês.

Se este artigo te fez considerar uma implantação em vez de um download, comece com deflection de tier 1. Depois descubra onde o modelo não deveria responder de jeito nenhum, que é o trabalho da triagem de tickets.

Fontes

  • Ficha do modelo da Thinking Machines Lab, thinkingmachines/Inkling-Small no Hugging Face (arquitetura, tabela de benchmarks, orientação de hardware, configurações de amostragem)
  • Artificial Analysis (Intelligence Index, throughput, TTFT, preços combinados, Omniscience)
  • Página do modelo e API da OpenRouter (janela de contexto oferecida, preço de entrada, número de provedores)
  • Tamanhos dos builds quantizados da Unsloth
  • Thread de lançamento no Hacker News
  • eesel Customer Voice Dossier (GENERAL BYTES, com permissão; trechos anonimizados de suporte técnico B2B e de suplementos DTC)

Perguntas frequentes

O que é Inkling-Small?
Inkling-Small é o segundo modelo de pesos abertos da Thinking Machines Lab, lançado em 30 de julho de 2026 sob a licença Apache 2.0. É um modelo Mixture-of-Experts com 276B de parâmetros totais e 12B ativos por token, então custa para rodar como um modelo de 12B enquanto carrega o conhecimento de um modelo de 276B. Ele recebe texto, imagens e áudio, e produz texto. É o irmão menor do Inkling, que tem 975B total / 41B ativos.
Inkling-Small é gratuito e de código aberto?
Os pesos são Apache 2.0, então você pode baixar, fazer fine-tuning e lançar comercialmente sem taxa de licença. Mas pesos gratuitos não significam inferência gratuita: o menor build quantizado utilizável tem cerca de 89 GB, e os pesos completos em BF16 chegam a 543 GB. Se você preferir não ter esse hardware, dois provedores hospedados o oferecem. Mais opções estão no meu resumo dos melhores agentes de IA de código aberto.
Quanto custa o Inkling-Small?
A saída custa $1,20 por 1M de tokens, algo em que todas as fontes concordam. A entrada é onde fica confuso: Artificial Analysis lista $0,30, a página do modelo na OpenRouter diz $0,45, e a própria API da OpenRouter retorna $0,50. Planeje o orçamento com base em $0,50 e você não terá surpresas. Para o que isso significa em economia de suporte, e não de desenvolvimento, veja o custo do atendimento ao cliente com IA.
Qual é a janela de contexto do Inkling-Small?
A ficha do modelo diz 1M de tokens. A OpenRouter o disponibiliza em 524.288, exatamente a metade. Ambos os números são reais, apenas descrevem coisas diferentes: o que a arquitetura suporta versus o que um provedor optou por hospedar. Verifique o teto do endpoint que você realmente usa antes de projetar em torno dele. A mesma lacuna pega desprevenidas pessoas que usam agentes de codificação, algo que abordei em a janela de contexto do Claude Code.
Posso rodar o Inkling-Small localmente?
Sim, se você tiver a memória necessária. Os builds quantizados da Unsloth vão de 543 GB em BF16 até 89 GB em 2-bit, e esse número de 89 GB é o que torna viável uma estação de trabalho com 128 GB de memória unificada. A própria ficha da Thinking Machines pede pelo menos 600 GB de VRAM para BF16 e 180 GB para NVFP4. O suporte no llama.cpp exige que o PR #25731 esteja mesclado no seu build.
O Inkling-Small é bom para atendimento ao cliente?
É um excelente executor e uma enciclopédia fraca. O SimpleQA Verified cai para 20,6% em relação aos 43,9% do modelo pai, e sua pontuação de Omniscience no Artificial Analysis é de -9,0, o que significa que ele dá respostas erradas com mais confiança do que respostas certas. Envolvido com retrieval e roteamento por confiança, funciona bem. Apontado direto para uma fila de tickets, você obtém o padrão de falha descrito em prevenção de alucinações de IA.
Como o Inkling-Small se compara ao DeepSeek V4 Flash e ao Kimi K3?
Está na mesma faixa de pesos abertos, e as trocas variam conforme a tarefa. O DeepSeek V4 Flash é mais barato por token e apenas texto; o Kimi K3 tem preços de fronteira. O diferencial do Inkling-Small é a entrada nativa de áudio e imagem a um preço de modelo pequeno. Um comentarista do Hacker News resumiu assim: "Mais ou menos do mesmo tamanho que o DeepSeek Flash 4, mas também suporta entrada de áudio e imagem".
Que hardware o Inkling-Small precisa?
Para os pesos completos em BF16, a Thinking Machines sugere 4x B300 ou 8x H200. O NVFP4 precisa de pelo menos 180 GB. Quantizado, a escala é de 132-170 GB em 4-bit, 128 GB em 3-bit e 89 GB em 2-bit. Se nada disso está à sua disposição, a API hospedada é o caminho prático, e a conta de construir versus comprar está em modelos de IA personalizados.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab
Trending

Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

O que o Inkling realmente é: o primeiro modelo de pesos abertos da Thinking Machines Lab, seus benchmarks reais, quanto custa rodá-lo e se ele tem algo a ver com uma fila de suporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração de um modelo de controle de robô humanoide, representando o Gemini Robotics 2
Trending

Gemini Robotics 2: o que os números da DeepMind mostram

Gemini Robotics 2 lança três modelos e uma tabela de sucesso por tarefa em que a maioria das pontuações fica abaixo de 80%. Essa tabela é a parte mais útil de todo o lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um modelo a produzir painéis de imagem, vídeo e áudio, representando o FLUX 3 da Black Forest Labs
Trending

FLUX 3: o que a Black Forest Labs realmente lançou

FLUX 3 é um único modelo para imagem, vídeo, áudio e ações de robôs. Mas também não tem API, preço nem pesos abertos ainda. Aqui está o que você pode e não pode obter.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: qual usar?

O Claude Opus 5 custa 1,7x o preço por token do Sonnet 5 e ainda assim termina algumas tarefas mais barato. Aqui está o confronto direto sobre preço, benchmarks e custo real por tarefa.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Análise do Claude Opus 5: programação quase de ponta pela metade do preço

Uma análise prática do Claude Opus 5: o que os benchmarks realmente mostram, a taxa de alucinação que subiu, e se ele tem lugar numa fila de suporte em produção.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis