
Por que as pessoas estão olhando além do Inkling
Deixe-me ser justo com o Inkling primeiro, porque o argumento para trocar só faz sentido quando você vê o que ele realmente tem de bom.
O Inkling é algo raro: um modelo grande, confiável e totalmente de pesos abertos, com entrada de áudio nativa e contexto de 1M de tokens, lançado sob a licença Apache 2.0 com os pesos no Hugging Face desde o primeiro dia. Isso importa, porque seu rival mais próximo, o Kimi K3, foi lançado apenas como API, com os pesos retidos. Se toda a sua razão para querer o Inkling é "preciso possuir e rodar o modelo, e talvez alimentá-lo com áudio", ele entrega isso. Para o panorama completo do que ele é, veja meu artigo explicativo sobre o Inkling e minha análise prática.
Então as razões para olhar para outro lugar não são realmente sobre o Inkling ser bom. São sobre encaixe e custo.
É caro para um modelo de pesos abertos. Essa é a peculiaridade principal. Na própria API da Thinking Machines, o Inkling fica em 81º lugar de 97 em preço, segundo a Artificial Analysis, a 1,87 $ de entrada / 4,68 $ de saída por milhão de tokens. A média da categoria para um modelo desse porte fica mais perto de 0,43 $ / 1,25 $. Pior, atualmente há apenas um provedor de API (a própria Thinking Machines), então nenhum provedor terceiro mais barato está reduzindo o preço.
Não é o modelo mais inteligente que você pode usar. O Inkling pontua 41 no Intelligence Index da Artificial Analysis. Isso é bom, mas o GLM-5.2 (51), o Kimi K3 (57) e todo modelo de fronteira fechado o superam. Rankings da comunidade que incluem mais modelos colocam o Inkling mais perto do 41º lugar geral, de onde veio o debate do tópico de lançamento sobre se "competitivo" é um termo justo.
Tem arestas afiadas. Ler a tabela de avaliações com honestidade mostra que o Inkling é forte em raciocínio científico e de contexto longo, mas fraco em confiabilidade de conhecimento puro (seu índice AA-Omniscience é um baixo 2) e física (CritPt 5%). É um modelo com picos, não um "faz tudo" uniforme.
Auto-hospedar é trabalho de data center. "Aberto" só significa "grátis" se você conseguir rodá-lo. Os pesos completos em BF16 exigem ~2 TB de VRAM; mesmo a versão quantizada NVFP4 precisa de ~600 GB. Modelos abertos mais baratos são muito mais leves de servir.
O tópico de lançamento captou essa mesma tensão, e o comentário mais útil ali vale a pena colar no monitor antes de confiar em qualquer uma das pontuações abaixo:
"want to know how good a model is? Run it with your own non-public benchmark, basically the only way to get proper answers you can somewhat rely on, everything else is manipulated, misunderstood or over-relied on."
Veja como o campo se organiza quando cruzamos inteligência contra preço.

Como escolhi estes
Eu construo com essas APIs, então este panorama se apoia no que as próprias páginas de preços e documentação dos fornecedores realmente dizem, lidas na semana em que escrevi isto, não em um gráfico de marketing. Cada preço abaixo é por milhão de tokens e vem da própria página do criador do modelo ou da Artificial Analysis, que avalia todos com o mesmo critério. Quando uma licença, preço ou janela de contexto não puderam ser confirmados em uma página oficial, eu digo isso em vez de adivinhar. O ranking é opinativo, mas os números você pode conferir por conta própria, e se quiser continuar acompanhando como esses modelos mudam, meu panorama de ferramentas de acompanhamento de LLMs cobre isso.
As melhores alternativas ao Inkling em um relance
| Modelo | Criador | Pesos abertos? | Entrada / Saída (por 1M) | Contexto | Melhor para |
|---|---|---|---|---|---|
| Inkling (base) | Thinking Machines | Sim (Apache 2.0) | 1,87 $ / 4,68 $ | 1M | Modelo aberto de entrada de áudio para possuir |
| GLM-5.2 | Zhipu / Z.ai | Sim (MIT) | 1,40 $ / 4,40 $ | 1M | Código aberto que você pode rodar hoje |
| DeepSeek V4 Flash | DeepSeek | Sim (MIT) | 0,14 $ / 0,28 $ | 1M | Custo mínimo, fronteira econômica |
| Kimi K3 | Moonshot AI | Pesos em 27 de julho | 3,00 $ / 15,00 $ | 1M | Teto agêntico aberto de fronteira |
| MiniMax M3 | MiniMax | Sim | 0,30 $ / 1,20 $ (promo) | 1M | Multimodal aberto barato + execuções longas |
| Qwen3.7-Max | Alibaba | Não (nível Max) | 2,50 $ / 7,50 $ | 1M | Ajuste agêntico da Alibaba |
| Claude Fable 5 / Opus 4.8 | Anthropic | Não | 10 $ / 50 $ · 5 $ / 25 $ | Grande | Teto de confiabilidade |
| GPT-5.6 Sol | OpenAI | Não | 5,00 $ / 30,00 $ | Grande | Ecossistema mais profundo |
| Gemini 3.5 Pro | Não | Ainda não público | 2M multimodal | Contexto mais longo + multimodal mais rico |
Duas coisas chamam atenção. Primeiro, o Inkling fica alto na escada de preços para um modelo aberto, não baixo. Segundo, os modelos que o superam em preço são majoritariamente os de pesos abertos. Então, se "aberto" era sua razão para olhar o Inkling, as alternativas abertas em geral também ganham dele no preço.
Agora os oito, na ordem em que eu realmente consideraria.
1. GLM-5.2
Melhor para: código e agentes de pesos abertos que você pode baixar e rodar hoje.
Essa é a alternativa que responde mais diretamente aos maiores problemas do Inkling ao mesmo tempo: é mais inteligente, mais barata e aberta. O GLM-5.2 da Zhipu AI (comercializado sob a marca Z.ai) é um modelo de mistura de especialistas com cerca de 753 bilhões de parâmetros, cujos pesos completos estão no Hugging Face sob licença MIT, livres para baixar, ajustar, auto-hospedar e usar comercialmente.
Nos números, ele supera o Inkling nas duas linhas que importam. Pontua 51 no índice da Artificial Analysis, o modelo de pesos abertos número 1 do mundo, contra os 41 do Inkling. E é mais barato: 1,40 $ de entrada / 4,40 $ de saída por milhão segundo a documentação da Z.ai, com o mesmo contexto de 1M. A Zhipu o ajusta para código e agentes e reporta 62,1 no SWE-bench Pro, o que o coloca entre os modelos de código abertos mais fortes, uma base natural para construir agentes de IA no seu próprio hardware.
Veredito: se sua lista de requisitos é "pesos abertos, disponível agora, forte em código, mais barato que o Inkling", o GLM-5.2 vence em todas as linhas. Minha primeira recomendação para quem queria o Inkling porque ele era supostamente aberto.
2. DeepSeek V4 Flash
Melhor para: a conta mais baixa possível com raciocínio de nível de fronteira.
Se sua razão para deixar o Inkling é custo, pare aqui. A linha V4 da DeepSeek é, de longe, o modelo capaz mais barato desta lista. O DeepSeek V4 Flash custa 0,14 $ de entrada / 0,28 $ de saída por milhão de tokens, segundo os preços da DeepSeek, com uma taxa de entrada em cache-hit perto de um quarto de centavo. É um MoE de 284 bilhões de parâmetros (13 bilhões ativos), tem contexto de 1M de tokens e mantém um modo de pensamento ativado por padrão, então você não troca raciocínio por preço.
Compare com o Inkling: 0,28 $ contra 4,68 $ na saída é aproximadamente 17 vezes. Para cargas de trabalho de alto volume onde a maior parte da entrada está em cache, a DeepSeek está em um universo diferente em custo. Ela também disponibiliza pesos abertos no Hugging Face sob licença MIT, lançados em abril de 2026, então a história de auto-hospedagem que o Inkling vende também está aqui, por uma fração do custo de servir. Por essas mesmas razões, aparece forte na maioria dos panoramas de ferramentas de codificação com IA.
Veredito: a escolha econômica padrão. Se você está trocando o Inkling para cortar gastos e não precisa do topo absoluto das tabelas de qualidade, o DeepSeek V4 Flash é o primeiro a experimentar.
3. Kimi K3
Melhor para: o teto aberto de fronteira em trabalho agêntico, quando você vai pagar por isso.
O Kimi K3 da Moonshot é o modelo que supera quase tudo o mais nesta lista. É o primeiro modelo aberto a alcançar a classe de 3 trilhões de parâmetros, e no índice da Artificial Analysis atinge 57, suficiente para um top quatro geral, bem à frente dos 41 do Inkling. Se capacidade bruta é o que você busca e ainda quer um modelo que eventualmente seja aberto, o K3 é o teto. Para o panorama completo, veja meu artigo explicativo sobre o Kimi K3.

Duas pegadinhas em relação ao Inkling. Primeiro, é mais caro, não menos: o K3 custa até 3 $ / 15 $, no nível do Claude Sonnet, então não é uma jogada econômica. Segundo, seus pesos vieram atrasados; a Moonshot prometeu o lançamento aberto completo até 27 de julho de 2026, enquanto os do Inkling já estavam disponíveis para download no lançamento. Então, se auto-hospedar hoje é o fator decisivo, o Inkling na verdade vence o K3 em disponibilidade, mesmo que o K3 vença em pontuação.
Veredito: escolha o K3 quando quiser a maior inteligência de nível aberto e o preço e a espera não assustarem. Se você queria o Inkling por barato e aberto, o K3 é a direção errada; se queria por inteligente e eventualmente aberto, o K3 é o upgrade.
4. MiniMax M3
Melhor para: o modelo aberto mais barato, nativamente multimodal, com fôlego para execuções longas.
O MiniMax M3 é o ponto ideal entre valor e abertura, e responde diretamente à proposta multimodal do Inkling. É um modelo de pesos abertos com contexto de 1M de tokens que é nativamente multimodal, e custa uma fração do Inkling: 0,60 $ / 2,40 $ pay-as-you-go na sua página de preços, com um desconto permanente de 50% que o leva a cerca de 0,30 $ / 1,20 $.
A aposta da MiniMax é a estabilidade de agentes em horizontes longos: a demo de lançamento mostrou o modelo rodando de forma autônoma por cerca de 12 horas, produzindo 18 commits enquanto reproduzia um artigo acadêmico. É o mesmo território de "execuções de agente de vários dias" que os modelos de fronteira almejam, por centavos. A proposta multimodal do Inkling é entrada de áudio nativa; a da MiniMax é multimodalidade mais ampla por uma conta bem menor.
Veredito: a melhor escolha se você quer pesos abertos e multimodalidade e uma conta pequena. Se o apelo do Inkling para você era "aberto e multimodal", o M3 entrega isso por uma fração do custo.
5. Qwen3.7-Max
Melhor para: equipes que querem o ajuste agêntico da Alibaba e não precisam de pesos abertos.
O Qwen3.7-Max é o carro-chefe da Alibaba, e é mais um vizinho do Inkling em capacidade e preço do que uma jogada econômica. Custa 2,50 $ de entrada / 7,50 $ de saída por milhão na página de preços da Qwen Cloud (com uma promoção limitada de 50%), tem contexto de 1M e é ajustado diretamente para trabalho centrado em agentes: programação, tarefas de escritório e execução autônoma de longo prazo. Pontua 46 no índice da Artificial Analysis, um degrau acima do Inkling.
A pegadinha para quem busca pesos abertos: o nível Max é fechado e só via API. Modelos menores da família Qwen3 são de pesos abertos, mas o carro-chefe que se compararia ao Inkling não é algo que você possa auto-hospedar. Então o Qwen3.7-Max se lê melhor como alternativa ao Inkling em capacidade e foco agêntico, não como substituto "aberto como o Inkling". Se você está avaliando a família mais ampla, meus guias de alternativas ao Qwen e preços do Qwen vão mais fundo.
Veredito: uma boa alternativa se você gosta do ajuste agêntico da Alibaba e a faixa de ~2,50 $ / 7,50 $ funciona. Não é a escolha se pesos abertos eram todo o motivo para olhar o Inkling.
6. Claude (Fable 5 e Opus 4.8)
Melhor para: o teto de confiabilidade em trabalho agêntico e de código, quando acertar importa mais do que a conta.
O Claude da Anthropic é para onde ir quando correção importa mais do que custo. O Claude Fable 5 lidera o índice da Artificial Analysis com 60, a maior pontuação de qualquer modelo aqui, e é ajustado para execuções autônomas de vários dias; o Opus 4.8 fica logo abaixo. Esse é o extremo de correção do espectro que um modelo com picos e conhecimento instável como o Inkling não alcança.
Você paga por esse teto. O Fable 5 custa 10 $ de entrada / 50 $ de saída por milhão na página de preços da Anthropic, e o Opus 4.8 fica em 5 $ / 25 $, ambos bem acima do Inkling. O Claude é totalmente fechado, então não há auto-hospedagem nem pesos para possuir, exatamente a troca que você faria ao deixar o Inkling. Se quiser o detalhe cara a cara, minha comparação ChatGPT vs Claude e meu panorama de alternativas ao Claude ajudam.
Veredito: a escolha de qualidade em primeiro lugar. Escolha o Claude quando uma resposta errada custar mais do que os dólares extras, e quando possuir os pesos nunca foi o ponto.
7. GPT-5.6 Sol
Melhor para: o ecossistema mais profundo e as ferramentas de terceiros mais amplas.
O GPT-5.6 Sol da OpenAI é o modelo faz-tudo. É um modelo de fronteira para raciocínio e código que pontua na casa dos 50 altos no índice da Artificial Analysis, e sua vantagem real sobre o Inkling não é uma linha de benchmark, é o ecossistema: o conjunto mais amplo de SDKs, integrações e ferramentas de terceiros de todos aqui. Se seu stack já fala OpenAI, o Sol é a mudança com menos atrito.
O preço é 5 $ de entrada / 30 $ de saída por milhão no nível padrão, segundo a documentação da OpenAI, com um nível de lote a 2,50 $ / 15 $ para trabalho não urgente. Isso está acima do Inkling, e o Sol é fechado (os modelos de pesos abertos gpt-oss da OpenAI são uma linha separada). Meus guias ChatGPT vs Gemini e ChatGPT vs Mistral ajudam se esses forem seus finalistas.
Veredito: escolha o Sol pela amplitude de integração e uma plataforma madura, não para economizar dinheiro. Se o ecossistema é seu gargalo, vale o prêmio sobre o Inkling.
8. Gemini 3.5 Pro
Melhor para: o contexto mais longo e a entrada multimodal mais rica.
O Gemini 3.5 Pro do Google é a escolha se o que te atraiu no Inkling foi o áudio e o contexto longo, porque o Gemini faz as duas coisas, e melhor. Ele traz um contexto de 2M de tokens, o dobro do 1M do Inkling, e aceita texto, imagem, áudio e vídeo em uma única chamada nativa, um passo além da multimodalidade apenas de áudio do Inkling. Chegou à disponibilidade geral no final de junho de 2026 com um modo de raciocínio Deep Think.
Uma ressalva honesta: o Google ainda não publicou os preços finais por token para o 3.5 Pro no momento em que escrevo isto, então trate qualquer número circulando como estimativa, não como fato. Espere um nível premium; se o orçamento é apertado e você quer uma opção do Google agora, o Gemini 3.1 Pro, já disponível, custa 2 $ / 12 $ segundo os preços do Google. O Gemini é fechado (a família aberta do Google é a Gemma, algo separado), então, como com Claude e GPT, você troca a história de propriedade do Inkling por capacidade.
Veredito: a melhor escolha quando sua carga de trabalho é multimodal ou exige muito contexto. Se você só queria o Inkling para ler áudio e manter uma janela longa, o Gemini faz as duas coisas melhor, uma vez que você aceite um modelo fechado.
Qual alternativa realmente combina com você?
Preços e pontuações são só metade da decisão. A outra metade é o que você está otimizando. Isto te dá um ponto de partida em um clique.
O modelo é só o motor
Agora a parte com que mais me importo, porque construo agentes de IA para viver. É tentador ler uma comparação como essa, escolher o modelo que lidera a tabela neste mês, plugá-lo e esperar que sua fila de atendimento ao cliente se resolva sozinha. Não funciona assim, e é aí que a maioria dos projetos de suporte com IA fracassa silenciosamente.
Um modelo puro, Inkling ou qualquer alternativa desta lista, te dá raciocínio. O que ele não te dá é qualquer noção da sua política de reembolso, dos casos extremos do seu produto, ou do fato de que o ticket #4021 é um VIP que já escreveu duas vezes. Ele não tem memória dos seus tickets passados, nenhuma proteção contra inventar respostas com confiança, e nenhuma conexão com o helpdesk onde o trabalho realmente acontece. Uma pontuação de benchmark maior não conserta nada disso.

Passei anos colocando IA em filas de suporte ao vivo, e a lição que ficou é que um modelo com aparência confiante dando uma resposta errada é pior do que nenhuma resposta. É por isso que a eesel AI roda uma simulação sobre o seu histórico de tickets antes de qualquer coisa entrar no ar, para que você veja a taxa de resolução e as respostas exatas em conversas passadas reais primeiro, não depois que um cliente se queime. É também por isso que as respostas roteiam por confiança: se o agente de IA não tem certeza, ele rascunha para um humano ou escala em vez de adivinhar, a diferença entre um chatbot de IA baseado em regras e automação de suporte de verdade.
A boa notícia silenciosa em todo esse panorama: como uma IA para atendimento ao cliente bem construída trata o modelo como um motor substituível, a fronteira ficar mais barata e melhor (Inkling hoje, GLM ou o que quer que vença no mês que vem) é um vento a favor que você herda sem precisar reconectar nada.
Experimente a eesel AI
Se você chegou até aqui porque quer um modelo de IA que realmente resolva tickets, não só converse, esse é o ponto inteiro da eesel AI. Ela se conecta ao Zendesk, Freshdesk, Slack e mais de 100 outras ferramentas, aprende com sua central de ajuda e tickets passados, e começa a rascunhar ou resolver em minutos, não semanas.

O diferencial é a rampa de confiança: simule no seu histórico real de tickets, observe os números, comece no modo rascunho e vá para totalmente autônomo só quando estiver satisfeito. É assim que equipes nas minhas histórias de clientes ficaram confortáveis entregando o volume de nível 1, uma delas, a Gridwise, resolveu 73% das solicitações de nível 1 no primeiro mês. Você ganha a inteligência de um modelo de fronteira envolta em proteções construídas para suporte, e nunca fica preso ao modelo que por acaso venceu na semana em que você se cadastrou. Os preços são baseados em uso, em torno de 0,40 $ por ticket resolvido, sem taxas por assento. Experimente a eesel grátis, sem cartão de crédito.
Perguntas frequentes
Qual é a melhor alternativa ao Inkling?
Existe uma alternativa mais barata ao Inkling?
Quais são as melhores alternativas de pesos abertos ao Inkling?
Como o Inkling se compara ao Kimi K3 e ao GLM-5.2?
Devo escolher um modelo fechado como o Claude ou o GPT-5.6 em vez do Inkling?
Qual alternativa ao Inkling é melhor para atendimento ao cliente?
Posso hospedar uma alternativa ao Inkling gratuitamente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







