Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat

Como avaliei esta análise

Sete dimensões, cada uma avaliada a partir de uma fonte primária, não de um resumo de imprensa: o arquivo de licença, a página de preços, o config.json entregue, a referência da API, a própria tabela de benchmarks do blog técnico, o FAQ da plataforma e as receitas de implantação. Quando uso um julgamento baseado em experiência prática, ele vem de uma pessoa identificada em um tópico público, não de um palpite meu.

Cartão de avaliação do LongCat 2.0 desenhado à mão, com notas de licença A, preço promocional A, preço de tabela C, benchmarks de codificação B, janela de contexto real C, ferramentas e harnesses C, e governança de dados F
Cartão de avaliação do LongCat 2.0 desenhado à mão, com notas de licença A, preço promocional A, preço de tabela C, benchmarks de codificação B, janela de contexto real C, ferramentas e harnesses C, e governança de dados F

Para a análise completa do que vem na caixa, escrevi um artigo complementar sobre o próprio LongCat 2.0. Esta análise é a decisão de compra que se constrói sobre aquele.

Você consegue realmente acessá-lo? Escolha sua rota

O incomum ao analisar este modelo é que "ele é bom" e "posso usá-lo" têm respostas diferentes dependendo de como você o acessa. Existem três rotas, e cada uma tem uma barreira diferente. Escolha a sua:

Três formas de entrar, três barreiras diferentes

Todos os fatos abaixo vêm da própria documentação da Meituan ou da página do provedor, verificados em 4 de agosto de 2026.

A mais barata, a mais difícil de pagar

O cadastro fora da China continental funciona por e-mail, e a tarifa promocional é $0,30 de entrada / $1,20 de saída por milhão de tokens. Os Token Packs saem como ofertas relâmpago no horário de Pequim, às 10h00, 16h00, 21h00 e 23h00, e expiram 30 dias após a compra.

A barreira: os únicos canais de recarga documentados são Alipay e WeChat Pay. Sem cartão. A emissão de notas por autoatendimento é restrita à China continental. O conselho dado em um tópico a usuários ocidentais foi vincular primeiro um cartão ao WeChat, o que gerou a resposta "oof. lot of effort for access to an api."

A mais fácil de conectar, a peor em dados

Roteamento padrão compatível com OpenAI, sem necessidade de meios de pagamento chineses, e se encaixa em qualquer harness que você já use. É assim que a maioria das equipes ocidentais vai conhecer este modelo.

A barreira: a AtlasCloud é a única provedora, não exibe nenhum selo de retenção zero de dados, e sua própria página de política indica 7 dias de retenção de conteúdo. Você trocou uma situação de dados incerta por uma retenção de 7 dias documentada.

Controle total, orçamento de datacenter

Pesos com licença MIT pura, sem política de uso aceitável nem limite de usuários, então o uso comercial não tem restrições. Se você conseguir servi-lo, nada na licença o impede.

A barreira: 3,55 TB divididos em 194 shards em BF16, 2,05 TB em FP8. A única receita verificada usa 8x B300 em um único nó; B200, H200 e H20 precisam de 16 GPUs distribuídas em dois nós. Não existe GGUF, então o Ollama e o LM Studio não conseguem carregá-lo de forma alguma.

Essa terceira coluna é o motivo pelo qual a licença MIT, que no papel é o melhor atributo do modelo, não serve para quase nada para a maioria dos leitores. Uma licença MIT pura em um checkpoint que você não consegue fazer rodar é uma licença para admirar.

No que ele é realmente bom

O dado mais útil desta análise inteira não é um benchmark. É o relato de um desenvolvedor que passou 3,6 bilhões de tokens pelo modelo durante os dois meses em que ele esteve no OpenRouter como um modelo furtivo chamado owl-alpha:

Reddit

I used this for over 3.6 billion tokens when it was owl-alpha on Openrouter (with Hermes Agent). It was a very good experience.

It's not as 'smart' as other frontier models when it comes to benchmark style tests (one shots, riddles, etc) but it was very good at (1) following instructions, (2) making a plan, (3) following that plan, and (4) staying coherent at very high contexts. I built a number of apps from start to finish and it performed very well.

Essa é uma descrição precisa de um bom modelo agêntico e de um modelo de chat mediano, e coincide com o segundo melhor relato prático, de alguém que comprou um pacote de tokens após o lançamento:

Hacker News

As an aside, I also nabbed a 50m token pack for LongCat 2.0 to give it a whirl. Not free, but it's so cheap they're basically giving it away. Very impressed too [...] Not frontier-level intelligence, but a dependable workhorse that can navigate a codebase well and can reliably execute what you tell it to do.

Dois usuários independentes, com dois meses de diferença, usando rotas de acesso diferentes, chegam ao mesmo veredito: executor confiável, não um gênio. Isso é mais valioso de saber do que qualquer diferença no SWE-bench, e é o perfil que você quer se está construindo agentes de codificação personalizados em que o harness pensa e o modelo trabalha.

Resumo em duas colunas, desenhado à mão, de relatos práticos, comparando o que se confirmou com o que ficou abaixo do esperado
Resumo em duas colunas, desenhado à mão, de relatos práticos, comparando o que se confirmou com o que ficou abaixo do esperado

Vale a pena destacar a ressalva feita pelo mesmo usuário, porque ela muda a forma de ler a tabela de benchmarks: o LongCat 2.0 não é um modelo de raciocínio. Suas pontuações foram definidas sem um orçamento de pensamento estendido, enquanto vários dos modelos com os quais é comparado tinham um. Isso funciona nos dois sentidos, e é o tipo de assimetria que torna as comparações entre fornecedores em CLIs de codificação agêntica mais difíceis do que os gráficos de marketing sugerem.

No que ele não é bom

A divergência é real e não vou escondê-la. De alguém que o usa em produção:

Reddit

I was using Owl Alpha a lot for my project. Thats not gpt 5.5 level model. it not even close to flash 2.5 model - its not gollowing promts.

E uma mais dura, especificamente sobre código:

Reddit

I have been trying to use longcat 2 but its bad model, it cant follow orders for example. Its coding is terrible, buggy as hell, stay away. Deepseek is way better.

Ambos são comentários com poucos votos e ambos contradizem os relatos de alto volume de tokens, então eu os pondero de acordo. Mas o padrão em todos eles é consistente: a qualidade deste modelo depende fortemente do harness que o conduz. As pessoas que relataram sucesso o executavam dentro de um loop de agente real. As que relataram falhas, em sua maioria, o promptavam diretamente.

No quesito raciocínio, o teste público mais discutido no Hacker News o colocou em terceiro lugar:

Hacker News

Overall I rate Gemini Flash the best, Qwen 3.7 Plus an acceptable second, and LongCat-2.0. an ok'ish third, if you have nothing better.

Eu citaria isso com cuidado, porque o próprio teste foi desmontado no tópico por três comentaristas distintos que argumentaram que a pergunta era tendenciosa ou não tinha uma única resposta correta. É um único prompt, não uma avaliação.

Duas falhas de integração relatadas no dia do lançamento são mais úteis do que tudo acima. Um usuário não conseguiu fazer as chamadas de ferramentas funcionarem porque o modelo emite um wrapper <longcat_tool_call> que seu harness não reconhecia, e outro fez uma pergunta em inglês com a busca ativada e recebeu as respostas em chinês. Nenhum dos dois é um problema de qualidade. Ambos são do tipo que consome uma tarde inteira.

Os benchmarks, lidos com honestidade

A Meituan publica o SWE-bench Pro, não o Verified, e rodou os números internamente no Claude Code com um sandbox 4c8g em temperatura 1.0, afirmando ter "corrigido tarefas problemáticas". Aqui está o quadro, com a origem de cada pontuação indicada, porque diferenças de poucos pontos são ruído:

ModeloSWE-bench ProQuem executouNota
Claude Fable 580.0reportado pela OpenAInão consta em uma página da Anthropic
Claude Opus 4.869.2reportado por quatro fornecedoreso número mais consistente do conjunto
Qwen3.8-Max67.7Qwen, internamentetambém afirma ter corrigido o conjunto de tarefas
GPT-5.6 Sol64.6OpenAI, internamenten/a
GPT-5.6 Terra63.4OpenAI, internamenten/a
GPT-5.6 Luna62.7OpenAI, internamenten/a
GLM-5.262.1Z.ai, OpenHands, contexto de 400Kprompt personalizado
LongCat 2.059.5Meituan, internamente, Claude Codesem modo de raciocínio; conjunto de tarefas corrigido
GPT-5.559.4OpenAI, internamentea própria ficha do LongCat lista isso como 58.6
MiniMax-M359.0MiniMax, internamenten/a
DeepSeek-V4-Pro (Max)55.4DeepSeek, internamentequase gêmeo arquitetônico do LongCat
Gemini 3.1 Pro Preview54.2reportado pela OpenAIn/a
DeepSeek-V4-Flash (Max)52.6DeepSeek, internamentemodelo de 284B

Lido sem rodeios: 59,5 coloca o LongCat 2.0 no mesmo nível do GPT-5.5 do ano passado, alguns pontos atrás do GLM-5.2 e de toda a família GPT-5.6, e cerca de dez pontos atrás do Opus 4.8. Ele supera seu gêmeo arquitetônico mais próximo, o DeepSeek V4 Pro, por quatro pontos, que é a comparação que eu realmente faria.

Há duas coisas que a tabela não mostra. O próprio conjunto de comparação da Meituan não inclui nenhum rival de pesos abertos, algo que a r/LocalLLaMA notou imediatamente:

Reddit

I don't know why they won't line up their benchmark to other Chinese and open models, you know, they have DeepSeekV4Pro, KimiK2.7-Coder, GLM5.2, MiniMaxM3, Qwen3.5-397B, MiMoV2.5-Pro.

Isso é uma crítica justa. Um fornecedor que se compara apenas a modelos que supera está dizendo onde escolheu se posicionar. E a Meituan não publica nenhuma pontuação de SWE-bench Verified, então qualquer comparação com a faixa de 79 a 81 que a DeepSeek V4 e a MiniMax reportam no Verified não é uma comparação que se possa fazer.

O preço é a coluna mais forte, com uma ressalva

TabelaPromoVariação
Entrada, sem cache$0.75 / 1M$0.30 / 1M-60%
Leitura de cache$0.015 / 1M$0.006 / 1M-60%
Saída$2.95 / 1M$1.20 / 1M-59%

Dois detalhes da página de preços importam mais do que o número principal. Primeiro, não há escalonamento de preço por tamanho de contexto em nenhum patamar, o que é inusual: Gemini, GPT-5.6 e MiniMax todos aumentam o preço a partir de um limiar, e aqui uma requisição de 200K tokens custa o mesmo por token que uma de 2K. Segundo, o preço de escrita em cache está ausente da página, o que não é a mesma coisa que gratuito.

A ressalva é a própria promoção. Ela é rotulada como por tempo limitado, sem data de término publicada. No preço de tabela, o modelo é mais caro do que os $0,435 e $0,87 do DeepSeek V4 Pro para o que, no papel, é o mesmo tipo de modelo: 1,6T no total, cerca de 48 contra 49 bilhões de parâmetros ativos, licença MIT. Então todo o argumento de custo depende de um desconto que o fornecedor pode encerrar quando quiser. Alguém no Reddit já havia definido o limiar antes do lançamento, e a promoção o superou:

Reddit

as long as it stays below .40 input and .80 output it will have a use.

Note que, no preço de tabela, ele não supera esse limiar. E a afirmação de "o modelo de contexto de 1M mais barato", que circulou no lançamento, foi corrigida no tópico quase imediatamente, porque o DeepSeek V4 Flash custa $0,14 e $0,28. Se seu único critério é o preço por token, o LongCat 2.0 não é o vencedor, nem mesmo dentro do campo chinês de pesos abertos. Para o campo mais amplo, as páginas de preços do GPT-5.6 e de preços do Claude Opus 5 definem o teto, e o preço do Kimi K3, de $3 e $15, mostra que pesos abertos e tokens baratos nem sempre andam juntos.

Três barreiras que o marketing não menciona

A janela de contexto é de 256K, não de 1M

Todos os textos de lançamento dizem 1M. O config.json entregue no Hugging Face limita max_position_embeddings a 262.144, com o YaRN previsto até 983.040 atrás desse limite. A API hospedada adiciona um teto de saída separado de 131.072 tokens, e max_tokens conta contra seu contexto. Então o número honesto é 256K de entrada, 128K de saída, e o número de 1M descreve os dados de treinamento.

Essa é uma lacuna menor do que parece, já que 256K é bastante, mas é a diferença entre "cabe no monorepo" e "não cabe". Se contexto longo é sua exigência real, compare como a janela de contexto do Claude Code se comporta na prática, em vez de confiar em uma folha de especificações.

O contrato de ferramentas não está documentado

Esta é a nota que mais me surpreendeu. A referência da API publica um punhado de parâmetros de requisição e nenhum array tools no esquema do corpo, seja no formato OpenAI, seja no formato Anthropic. Não há tool_choice, nem parallel_tool_calls, nem stop_sequences, nem metadata, e content é documentado como uma string simples, então não há blocos de conteúdo, nem imagens, nem tool_result. O temperature vai de 0 a 1, em vez do 0 a 2 da OpenAI, o que vai cortar silenciosamente requisições portadas de outro fornecedor.

A página de "ferramentas" da plataforma não é de forma alguma um catálogo de ferramentas. É uma lista de compatibilidade com doze clientes de codificação de terceiros que podem ser apontados para a API. Não há busca na web do lado do servidor, nem interpretador de código, nem armazenamento de recuperação, nem superfície MCP, nem loop de agente hospedado. Tudo o que é agêntico acontece do lado do cliente, por design. Essa é uma arquitetura legítima, e é a mesma aposta de "traga seu próprio harness" do GPT-5.1-Codex-Max em outra forma, mas significa que a história de IA agêntica deste modelo é inteiramente a história do seu harness.

Não há artigo técnico, e quase não há repositório

O meituan-longcat/LongCat-2.0 no GitHub é um README, uma licença e três figuras, cerca de 1 MB, zero releases. Os pesos estão no Hugging Face. Não há relatório técnico, apenas um post de blog, o que significa que as duas novas peças de arquitetura não têm metodologia publicada. A ficha do modelo omite model_type, então o AutoModel do Transformers falha diretamente, e o SGLang é o único motor, com seu PR de suporte fechado sem merge e uma wheel nightly necessária.

Para um modelo cujo argumento de venda inteiro é a abertura, isso é escasso. A comparação que deixa isso evidente é o próprio Hugging Face: 3.240 downloads por mês e zero provedores de inferência no hub não é a marca de um modelo que as pessoas estão implantando.

A nota que trava os compradores empresariais

Aqui está a descoberta que eu colocaria na frente de qualquer revisor de segurança. O FAQ da plataforma da Meituan é silencioso sobre retenção de dados, treinamento com prompts, residência de dados e SLA. A palavra "treinamento" não aparece em nenhum lugar dele.

Esse silêncio não é um detalhe técnico. É exatamente a pergunta que todo comprador faz, e eu a escuto em quase todas as chamadas. Um avaliador técnico de uma empresa de hardware B2B com quem falei em março não avançaria sem uma resposta clara sobre se a IA conseguia acessar algo fora de sua base de conhecimento aprovada; outro comprador, condicionado por uma revisão interna de segurança, precisava de uma garantia por escrito de que dados de tickets contendo números de cartão e senhas permaneceriam dentro do ambiente dele. Não são pedidos exóticos. São o mínimo. Uma página de fornecedor que não menciona retenção não consegue superar esse mínimo, seja qual for sua pontuação em benchmarks.

Desenvolvedores chegaram à mesma conclusão de forma independente. Um deles evitou o modelo completamente durante seu período furtivo gratuito por motivos de política, e depois descobriu o que havia perdido:

Reddit

Wait, this is Owl Alpha? Now I wish I had tried it when it was available. I stayed away from it back then because of their privacy policy

E o desvio via OpenRouter não resolve isso, apenas documenta a exposição: a AtlasCloud é a única provedora, não exibe nenhum selo de retenção zero de dados, e sua política declara 7 dias de retenção de conteúdo. Se você está em meio a uma revisão de SOC 2 e GDPR, ou próximo dos requisitos de IA compatível com HIPAA, é aí que isso termina. Hospedar você mesmo é a única rota que elimina a questão, e hospedar você mesmo significa oito B300.

Para ser justo com o modelo, nada disso diz que a Meituan faz algo indevido com seus dados. Diz que a Meituan não publicou o que faz. Para um projeto pessoal, essa distinção não importa. Para um pipeline de automação de atendimento ao cliente que lida com tickets reais, é toda a decisão.

Quem deveria usá-lo

Bom encaixe. Desenvolvedores solo e equipes pequenas fazendo codificação agêntica de alto volume dentro de um harness que controlam, onde tokens são o custo que importa e os dados não são sensíveis. Conversão de documentos, scraping, navegação em bases de código, refatorações longas. A capacidade de seguir instruções e a coerência em contextos longos são reais, e a $0,30 por milhão de tokens de entrada, a conta é difícil de contestar. Se você está avaliando agentes de IA de código aberto ou escolhendo um modelo para trabalho de otimização de LLM, ele merece estar na lista.

Mau encaixe. Qualquer pessoa que precise de qualidade de raciocínio em uma única tentativa, um contrato de function calling documentado, uma janela real de 1M, um método de pagamento com cartão, ou uma resposta por escrito sobre o tratamento de dados. Isso cobre a maioria dos compradores corporativos, e todos os casos de uso de melhor agente de IA para atendimento ao cliente com os quais trabalho. Não porque o modelo é ruim, mas porque um modelo bruto é a unidade de compra errada para uma fila de suporte. O modelo é talvez 20% do problema; recuperação de informações, grounding, regras de escalada, guardrails e testes são os outros 80%, e nada disso vem embutido em um checkpoint. É a mesma conclusão a que chego em construir ou comprar IA de suporte, e o motivo pelo qual o número de custo por resolução se move muito menos com o preço do token do que as pessoas esperam.

Experimente a eesel

Ler uma análise como esta é, na verdade, uma tentativa de responder a outra pergunta: isso vai dar uma resposta errada aos meus clientes? O preço por token não conta isso. A alucinação de IA não é uma linha em uma página de preços.

Esse é o problema em que trabalho. A eesel simula seu agente de IA contra seus próprios tickets históricos antes que ele responda a um cliente real, então você vê as respostas que ele teria enviado, para suas perguntas reais, com sua base de conhecimento real por trás. Cada resposta é registrada, revisável e reversível, e você define exatamente quais tópicos ele pode tocar. Ela se conecta ao seu stack de IA de helpdesk existente em poucos minutos, e a escolha do modelo passa a ser problema da eesel, não seu. Gratuito para testar.

O registro de atividades da eesel mostrando cada ação de IA com os status aprovado, rejeitado e pendente, ao lado dos tickets do Zendesk que resolveram
O registro de atividades da eesel mostrando cada ação de IA com os status aprovado, rejeitado e pendente, ao lado dos tickets do Zendesk que resolveram

O veredito

O LongCat 2.0 merece uma recomendação para exatamente um trabalho: codificação agêntica barata e de alto volume em um harness que você controla, com dados que não lhe importam se saírem do seu ambiente. No preço promocional, é uma das melhores opções de valor por token na sua categoria, a licença MIT é real, e os relatos práticos de quem passou bilhões de tokens por ele são mais positivos do que sua linha na tabela de benchmarks.

Tudo o que bloqueia uma recomendação mais ampla é uma lacuna de documentação, não de modelagem: um número de contexto que não coincide com a configuração, um contrato de function calling que nunca foi publicado, uma promoção sem data de término, e uma política de dados que não existe. A Meituan poderia resolver essas quatro coisas com uma semana de redação. Até que isso aconteça, é um ótimo modelo para experimentar e um modelo difícil de colocar em produção.

Se seu objetivo real é IA em uma fila de suporte, e não um agente de codificação, comece em vez disso pelo melhor LLM para atendimento ao cliente, e trate o modelo como a última coisa que você escolhe, não a primeira.

Frequently Asked Questions

O LongCat 2.0 é realmente bom?
Para trabalho de codificação agêntica, sim, com ressalvas. As pessoas que passaram mais tokens por ele o descrevem como um cavalo de batalha confiável que planeja, segue instruções e permanece coerente em contextos longos, em vez de um raciocinador de nível fronteira. Não é um modelo de raciocínio, então se sua carga de trabalho envolve quebra-cabeças lógicos de uma única tentativa, você vai preferir algo da família GPT-5.6 ou Claude Opus 5.
O que esta análise do LongCat 2.0 conclui sobre o preço?
O preço promocional de $0,30 por milhão de tokens de entrada e $1,20 de saída é o melhor atributo do modelo. O preço de tabela é $0,75 e $2,95, mais do que a DeepSeek V4 Pro cobra por uma arquitetura quase idêntica. Não há data de término publicada para a promoção, então todo o argumento de custo depende de um desconto que a Meituan pode retirar quando quiser.
O LongCat 2.0 realmente tem uma janela de contexto de 1M?
Não como é entregue. O arquivo config.json no Hugging Face limita max_position_embeddings a 262.144, então a janela de contexto real oferecida é de 256K. O número de 1M descreve os dados de treinamento. A saída tem um limite separado de 131.072 tokens.
Como o LongCat 2.0 se compara ao Kimi K3 e ao Qwen3.8-Max?
É muito mais barato que o preço do Kimi K3, de $3 e $15, e pontua mais baixo no SWE-bench Pro do que o Qwen3.8 Max: 67,7 contra 59,5. Ambos os fornecedores dizem ter corrigido o conjunto de tarefas, então essa diferença não é uma comparação direta e limpa. Veja minha comparação entre Qwen3.8 Max e Kimi K3 para o mesmo problema em outra dupla.
Posso executar o LongCat 2.0 localmente?
Somente em hardware de datacenter. O checkpoint em BF16 tem 3,55 TB divididos em 194 shards, e a única receita verificada usa 8x NVIDIA B300. Nenhum GGUF foi publicado, então o Ollama e o LM Studio não conseguem carregá-lo, o que o deixa fora do alcance da maioria das pessoas em busca de agentes de IA de código aberto.
O LongCat 2.0 é seguro para uso em atendimento ao cliente?
Não nos termos publicados atualmente. O FAQ da plataforma nunca aborda retenção de dados, treinamento com prompts ou residência de dados, que é a primeira barreira em qualquer revisão de SOC 2 e GDPR. Se você quer o mesmo perfil de custo sem a exposição, uma camada gerenciada sobre o seu sistema de tickets com IA é o caminho mais seguro.
Qual é a melhor alternativa ao LongCat 2.0 para equipes de suporte?
Para uma fila em produção, eu não conectaria um modelo bruto diretamente. Compare primeiro as opções do melhor LLM para atendimento ao cliente e depois avalie um software de helpdesk com IA que cuide da recuperação de informações, dos testes e da escalada para você.
O LongCat 2.0 suporta chamadas de ferramentas e MCP?
A documentação nunca publica um contrato de function calling. Não há nenhum array tools no esquema do corpo de nenhum dos dois endpoints, nenhuma superfície MCP, e usuários do dia de lançamento relataram um wrapper não padronizado <longcat_tool_call> que seus harnesses não conseguiam interpretar. O uso de ferramentas é possível por meio de clientes, mas não é um contrato documentado.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat
Trending

LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

LongCat 2.0 é o modelo MoE de 1,6T parâmetros da Meituan, sob licença MIT, a 0,30 dólares por milhão de tokens de entrada. Li todas as fontes primárias para ver o que realmente é entregue.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustração do detalhamento de preços do PromptQL
Trending

Preço do PromptQL: quanto custa de verdade em 2026

Um detalhamento do preço do PromptQL: a unidade cobrável OLU, a tarifa promocional de US$ 0,14, créditos gratuitos, o multiplicador de modelo que realmente define sua fatura e exemplos reais de custo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Análise do Claude Opus 5: programação quase de ponta pela metade do preço

Uma análise prática do Claude Opus 5: o que os benchmarks realmente mostram, a taxa de alucinação que subiu, e se ele tem lugar numa fila de suporte em produção.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Banner principal da análise do PromptQL com o logo do PromptQL sobre um fundo índigo
Trending

Análise do PromptQL (2026): o agente de dados da Hasura, testado

Uma análise prática do PromptQL: como o agente de dados da Hasura separa planejamento de execução, quanto custa e se a promessa de confiabilidade se sustenta.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis