
Como avaliei esta análise
Sete dimensões, cada uma avaliada a partir de uma fonte primária, não de um resumo de imprensa: o arquivo de licença, a página de preços, o config.json entregue, a referência da API, a própria tabela de benchmarks do blog técnico, o FAQ da plataforma e as receitas de implantação. Quando uso um julgamento baseado em experiência prática, ele vem de uma pessoa identificada em um tópico público, não de um palpite meu.

Para a análise completa do que vem na caixa, escrevi um artigo complementar sobre o próprio LongCat 2.0. Esta análise é a decisão de compra que se constrói sobre aquele.
Você consegue realmente acessá-lo? Escolha sua rota
O incomum ao analisar este modelo é que "ele é bom" e "posso usá-lo" têm respostas diferentes dependendo de como você o acessa. Existem três rotas, e cada uma tem uma barreira diferente. Escolha a sua:
Essa terceira coluna é o motivo pelo qual a licença MIT, que no papel é o melhor atributo do modelo, não serve para quase nada para a maioria dos leitores. Uma licença MIT pura em um checkpoint que você não consegue fazer rodar é uma licença para admirar.
No que ele é realmente bom
O dado mais útil desta análise inteira não é um benchmark. É o relato de um desenvolvedor que passou 3,6 bilhões de tokens pelo modelo durante os dois meses em que ele esteve no OpenRouter como um modelo furtivo chamado owl-alpha:
I used this for over 3.6 billion tokens when it was owl-alpha on Openrouter (with Hermes Agent). It was a very good experience.
It's not as 'smart' as other frontier models when it comes to benchmark style tests (one shots, riddles, etc) but it was very good at (1) following instructions, (2) making a plan, (3) following that plan, and (4) staying coherent at very high contexts. I built a number of apps from start to finish and it performed very well.
Essa é uma descrição precisa de um bom modelo agêntico e de um modelo de chat mediano, e coincide com o segundo melhor relato prático, de alguém que comprou um pacote de tokens após o lançamento:
As an aside, I also nabbed a 50m token pack for LongCat 2.0 to give it a whirl. Not free, but it's so cheap they're basically giving it away. Very impressed too [...] Not frontier-level intelligence, but a dependable workhorse that can navigate a codebase well and can reliably execute what you tell it to do.
Dois usuários independentes, com dois meses de diferença, usando rotas de acesso diferentes, chegam ao mesmo veredito: executor confiável, não um gênio. Isso é mais valioso de saber do que qualquer diferença no SWE-bench, e é o perfil que você quer se está construindo agentes de codificação personalizados em que o harness pensa e o modelo trabalha.

Vale a pena destacar a ressalva feita pelo mesmo usuário, porque ela muda a forma de ler a tabela de benchmarks: o LongCat 2.0 não é um modelo de raciocínio. Suas pontuações foram definidas sem um orçamento de pensamento estendido, enquanto vários dos modelos com os quais é comparado tinham um. Isso funciona nos dois sentidos, e é o tipo de assimetria que torna as comparações entre fornecedores em CLIs de codificação agêntica mais difíceis do que os gráficos de marketing sugerem.
No que ele não é bom
A divergência é real e não vou escondê-la. De alguém que o usa em produção:
I was using Owl Alpha a lot for my project. Thats not gpt 5.5 level model. it not even close to flash 2.5 model - its not gollowing promts.
E uma mais dura, especificamente sobre código:
I have been trying to use longcat 2 but its bad model, it cant follow orders for example. Its coding is terrible, buggy as hell, stay away. Deepseek is way better.
Ambos são comentários com poucos votos e ambos contradizem os relatos de alto volume de tokens, então eu os pondero de acordo. Mas o padrão em todos eles é consistente: a qualidade deste modelo depende fortemente do harness que o conduz. As pessoas que relataram sucesso o executavam dentro de um loop de agente real. As que relataram falhas, em sua maioria, o promptavam diretamente.
No quesito raciocínio, o teste público mais discutido no Hacker News o colocou em terceiro lugar:
Overall I rate Gemini Flash the best, Qwen 3.7 Plus an acceptable second, and LongCat-2.0. an ok'ish third, if you have nothing better.
Eu citaria isso com cuidado, porque o próprio teste foi desmontado no tópico por três comentaristas distintos que argumentaram que a pergunta era tendenciosa ou não tinha uma única resposta correta. É um único prompt, não uma avaliação.
Duas falhas de integração relatadas no dia do lançamento são mais úteis do que tudo acima. Um usuário não conseguiu fazer as chamadas de ferramentas funcionarem porque o modelo emite um wrapper <longcat_tool_call> que seu harness não reconhecia, e outro fez uma pergunta em inglês com a busca ativada e recebeu as respostas em chinês. Nenhum dos dois é um problema de qualidade. Ambos são do tipo que consome uma tarde inteira.
Os benchmarks, lidos com honestidade
A Meituan publica o SWE-bench Pro, não o Verified, e rodou os números internamente no Claude Code com um sandbox 4c8g em temperatura 1.0, afirmando ter "corrigido tarefas problemáticas". Aqui está o quadro, com a origem de cada pontuação indicada, porque diferenças de poucos pontos são ruído:
| Modelo | SWE-bench Pro | Quem executou | Nota |
|---|---|---|---|
| Claude Fable 5 | 80.0 | reportado pela OpenAI | não consta em uma página da Anthropic |
| Claude Opus 4.8 | 69.2 | reportado por quatro fornecedores | o número mais consistente do conjunto |
| Qwen3.8-Max | 67.7 | Qwen, internamente | também afirma ter corrigido o conjunto de tarefas |
| GPT-5.6 Sol | 64.6 | OpenAI, internamente | n/a |
| GPT-5.6 Terra | 63.4 | OpenAI, internamente | n/a |
| GPT-5.6 Luna | 62.7 | OpenAI, internamente | n/a |
| GLM-5.2 | 62.1 | Z.ai, OpenHands, contexto de 400K | prompt personalizado |
| LongCat 2.0 | 59.5 | Meituan, internamente, Claude Code | sem modo de raciocínio; conjunto de tarefas corrigido |
| GPT-5.5 | 59.4 | OpenAI, internamente | a própria ficha do LongCat lista isso como 58.6 |
| MiniMax-M3 | 59.0 | MiniMax, internamente | n/a |
| DeepSeek-V4-Pro (Max) | 55.4 | DeepSeek, internamente | quase gêmeo arquitetônico do LongCat |
| Gemini 3.1 Pro Preview | 54.2 | reportado pela OpenAI | n/a |
| DeepSeek-V4-Flash (Max) | 52.6 | DeepSeek, internamente | modelo de 284B |
Lido sem rodeios: 59,5 coloca o LongCat 2.0 no mesmo nível do GPT-5.5 do ano passado, alguns pontos atrás do GLM-5.2 e de toda a família GPT-5.6, e cerca de dez pontos atrás do Opus 4.8. Ele supera seu gêmeo arquitetônico mais próximo, o DeepSeek V4 Pro, por quatro pontos, que é a comparação que eu realmente faria.
Há duas coisas que a tabela não mostra. O próprio conjunto de comparação da Meituan não inclui nenhum rival de pesos abertos, algo que a r/LocalLLaMA notou imediatamente:
I don't know why they won't line up their benchmark to other Chinese and open models, you know, they have DeepSeekV4Pro, KimiK2.7-Coder, GLM5.2, MiniMaxM3, Qwen3.5-397B, MiMoV2.5-Pro.
Isso é uma crítica justa. Um fornecedor que se compara apenas a modelos que supera está dizendo onde escolheu se posicionar. E a Meituan não publica nenhuma pontuação de SWE-bench Verified, então qualquer comparação com a faixa de 79 a 81 que a DeepSeek V4 e a MiniMax reportam no Verified não é uma comparação que se possa fazer.
O preço é a coluna mais forte, com uma ressalva
| Tabela | Promo | Variação | |
|---|---|---|---|
| Entrada, sem cache | $0.75 / 1M | $0.30 / 1M | -60% |
| Leitura de cache | $0.015 / 1M | $0.006 / 1M | -60% |
| Saída | $2.95 / 1M | $1.20 / 1M | -59% |
Dois detalhes da página de preços importam mais do que o número principal. Primeiro, não há escalonamento de preço por tamanho de contexto em nenhum patamar, o que é inusual: Gemini, GPT-5.6 e MiniMax todos aumentam o preço a partir de um limiar, e aqui uma requisição de 200K tokens custa o mesmo por token que uma de 2K. Segundo, o preço de escrita em cache está ausente da página, o que não é a mesma coisa que gratuito.
A ressalva é a própria promoção. Ela é rotulada como por tempo limitado, sem data de término publicada. No preço de tabela, o modelo é mais caro do que os $0,435 e $0,87 do DeepSeek V4 Pro para o que, no papel, é o mesmo tipo de modelo: 1,6T no total, cerca de 48 contra 49 bilhões de parâmetros ativos, licença MIT. Então todo o argumento de custo depende de um desconto que o fornecedor pode encerrar quando quiser. Alguém no Reddit já havia definido o limiar antes do lançamento, e a promoção o superou:
as long as it stays below .40 input and .80 output it will have a use.
Note que, no preço de tabela, ele não supera esse limiar. E a afirmação de "o modelo de contexto de 1M mais barato", que circulou no lançamento, foi corrigida no tópico quase imediatamente, porque o DeepSeek V4 Flash custa $0,14 e $0,28. Se seu único critério é o preço por token, o LongCat 2.0 não é o vencedor, nem mesmo dentro do campo chinês de pesos abertos. Para o campo mais amplo, as páginas de preços do GPT-5.6 e de preços do Claude Opus 5 definem o teto, e o preço do Kimi K3, de $3 e $15, mostra que pesos abertos e tokens baratos nem sempre andam juntos.
Três barreiras que o marketing não menciona
A janela de contexto é de 256K, não de 1M
Todos os textos de lançamento dizem 1M. O config.json entregue no Hugging Face limita max_position_embeddings a 262.144, com o YaRN previsto até 983.040 atrás desse limite. A API hospedada adiciona um teto de saída separado de 131.072 tokens, e max_tokens conta contra seu contexto. Então o número honesto é 256K de entrada, 128K de saída, e o número de 1M descreve os dados de treinamento.
Essa é uma lacuna menor do que parece, já que 256K é bastante, mas é a diferença entre "cabe no monorepo" e "não cabe". Se contexto longo é sua exigência real, compare como a janela de contexto do Claude Code se comporta na prática, em vez de confiar em uma folha de especificações.
O contrato de ferramentas não está documentado
Esta é a nota que mais me surpreendeu. A referência da API publica um punhado de parâmetros de requisição e nenhum array tools no esquema do corpo, seja no formato OpenAI, seja no formato Anthropic. Não há tool_choice, nem parallel_tool_calls, nem stop_sequences, nem metadata, e content é documentado como uma string simples, então não há blocos de conteúdo, nem imagens, nem tool_result. O temperature vai de 0 a 1, em vez do 0 a 2 da OpenAI, o que vai cortar silenciosamente requisições portadas de outro fornecedor.
A página de "ferramentas" da plataforma não é de forma alguma um catálogo de ferramentas. É uma lista de compatibilidade com doze clientes de codificação de terceiros que podem ser apontados para a API. Não há busca na web do lado do servidor, nem interpretador de código, nem armazenamento de recuperação, nem superfície MCP, nem loop de agente hospedado. Tudo o que é agêntico acontece do lado do cliente, por design. Essa é uma arquitetura legítima, e é a mesma aposta de "traga seu próprio harness" do GPT-5.1-Codex-Max em outra forma, mas significa que a história de IA agêntica deste modelo é inteiramente a história do seu harness.
Não há artigo técnico, e quase não há repositório
O meituan-longcat/LongCat-2.0 no GitHub é um README, uma licença e três figuras, cerca de 1 MB, zero releases. Os pesos estão no Hugging Face. Não há relatório técnico, apenas um post de blog, o que significa que as duas novas peças de arquitetura não têm metodologia publicada. A ficha do modelo omite model_type, então o AutoModel do Transformers falha diretamente, e o SGLang é o único motor, com seu PR de suporte fechado sem merge e uma wheel nightly necessária.
Para um modelo cujo argumento de venda inteiro é a abertura, isso é escasso. A comparação que deixa isso evidente é o próprio Hugging Face: 3.240 downloads por mês e zero provedores de inferência no hub não é a marca de um modelo que as pessoas estão implantando.
A nota que trava os compradores empresariais
Aqui está a descoberta que eu colocaria na frente de qualquer revisor de segurança. O FAQ da plataforma da Meituan é silencioso sobre retenção de dados, treinamento com prompts, residência de dados e SLA. A palavra "treinamento" não aparece em nenhum lugar dele.
Esse silêncio não é um detalhe técnico. É exatamente a pergunta que todo comprador faz, e eu a escuto em quase todas as chamadas. Um avaliador técnico de uma empresa de hardware B2B com quem falei em março não avançaria sem uma resposta clara sobre se a IA conseguia acessar algo fora de sua base de conhecimento aprovada; outro comprador, condicionado por uma revisão interna de segurança, precisava de uma garantia por escrito de que dados de tickets contendo números de cartão e senhas permaneceriam dentro do ambiente dele. Não são pedidos exóticos. São o mínimo. Uma página de fornecedor que não menciona retenção não consegue superar esse mínimo, seja qual for sua pontuação em benchmarks.
Desenvolvedores chegaram à mesma conclusão de forma independente. Um deles evitou o modelo completamente durante seu período furtivo gratuito por motivos de política, e depois descobriu o que havia perdido:
Wait, this is Owl Alpha? Now I wish I had tried it when it was available. I stayed away from it back then because of their privacy policy
E o desvio via OpenRouter não resolve isso, apenas documenta a exposição: a AtlasCloud é a única provedora, não exibe nenhum selo de retenção zero de dados, e sua política declara 7 dias de retenção de conteúdo. Se você está em meio a uma revisão de SOC 2 e GDPR, ou próximo dos requisitos de IA compatível com HIPAA, é aí que isso termina. Hospedar você mesmo é a única rota que elimina a questão, e hospedar você mesmo significa oito B300.
Para ser justo com o modelo, nada disso diz que a Meituan faz algo indevido com seus dados. Diz que a Meituan não publicou o que faz. Para um projeto pessoal, essa distinção não importa. Para um pipeline de automação de atendimento ao cliente que lida com tickets reais, é toda a decisão.
Quem deveria usá-lo
Bom encaixe. Desenvolvedores solo e equipes pequenas fazendo codificação agêntica de alto volume dentro de um harness que controlam, onde tokens são o custo que importa e os dados não são sensíveis. Conversão de documentos, scraping, navegação em bases de código, refatorações longas. A capacidade de seguir instruções e a coerência em contextos longos são reais, e a $0,30 por milhão de tokens de entrada, a conta é difícil de contestar. Se você está avaliando agentes de IA de código aberto ou escolhendo um modelo para trabalho de otimização de LLM, ele merece estar na lista.
Mau encaixe. Qualquer pessoa que precise de qualidade de raciocínio em uma única tentativa, um contrato de function calling documentado, uma janela real de 1M, um método de pagamento com cartão, ou uma resposta por escrito sobre o tratamento de dados. Isso cobre a maioria dos compradores corporativos, e todos os casos de uso de melhor agente de IA para atendimento ao cliente com os quais trabalho. Não porque o modelo é ruim, mas porque um modelo bruto é a unidade de compra errada para uma fila de suporte. O modelo é talvez 20% do problema; recuperação de informações, grounding, regras de escalada, guardrails e testes são os outros 80%, e nada disso vem embutido em um checkpoint. É a mesma conclusão a que chego em construir ou comprar IA de suporte, e o motivo pelo qual o número de custo por resolução se move muito menos com o preço do token do que as pessoas esperam.
Experimente a eesel
Ler uma análise como esta é, na verdade, uma tentativa de responder a outra pergunta: isso vai dar uma resposta errada aos meus clientes? O preço por token não conta isso. A alucinação de IA não é uma linha em uma página de preços.
Esse é o problema em que trabalho. A eesel simula seu agente de IA contra seus próprios tickets históricos antes que ele responda a um cliente real, então você vê as respostas que ele teria enviado, para suas perguntas reais, com sua base de conhecimento real por trás. Cada resposta é registrada, revisável e reversível, e você define exatamente quais tópicos ele pode tocar. Ela se conecta ao seu stack de IA de helpdesk existente em poucos minutos, e a escolha do modelo passa a ser problema da eesel, não seu. Gratuito para testar.

O veredito
O LongCat 2.0 merece uma recomendação para exatamente um trabalho: codificação agêntica barata e de alto volume em um harness que você controla, com dados que não lhe importam se saírem do seu ambiente. No preço promocional, é uma das melhores opções de valor por token na sua categoria, a licença MIT é real, e os relatos práticos de quem passou bilhões de tokens por ele são mais positivos do que sua linha na tabela de benchmarks.
Tudo o que bloqueia uma recomendação mais ampla é uma lacuna de documentação, não de modelagem: um número de contexto que não coincide com a configuração, um contrato de function calling que nunca foi publicado, uma promoção sem data de término, e uma política de dados que não existe. A Meituan poderia resolver essas quatro coisas com uma semana de redação. Até que isso aconteça, é um ótimo modelo para experimentar e um modelo difícil de colocar em produção.
Se seu objetivo real é IA em uma fila de suporte, e não um agente de codificação, comece em vez disso pelo melhor LLM para atendimento ao cliente, e trate o modelo como a última coisa que você escolhe, não a primeira.
Frequently Asked Questions
O LongCat 2.0 é realmente bom?
O que esta análise do LongCat 2.0 conclui sobre o preço?
O LongCat 2.0 realmente tem uma janela de contexto de 1M?
config.json no Hugging Face limita max_position_embeddings a 262.144, então a janela de contexto real oferecida é de 256K. O número de 1M descreve os dados de treinamento. A saída tem um limite separado de 131.072 tokens.Como o LongCat 2.0 se compara ao Kimi K3 e ao Qwen3.8-Max?
Posso executar o LongCat 2.0 localmente?
O LongCat 2.0 é seguro para uso em atendimento ao cliente?
Qual é a melhor alternativa ao LongCat 2.0 para equipes de suporte?
O LongCat 2.0 suporta chamadas de ferramentas e MCP?
tools no esquema do corpo de nenhum dos dois endpoints, nenhuma superfície MCP, e usuários do dia de lançamento relataram um wrapper não padronizado <longcat_tool_call> que seus harnesses não conseguiam interpretar. O uso de ferramentas é possível por meio de clientes, mas não é um contrato documentado.
Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








