LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat

O que o LongCat 2.0 realmente é

A Meituan é a gigante chinesa de entrega de comida e serviços locais, e a LongCat é sua equipe interna de modelos. O LongCat 2.0 chegou em 30 de junho de 2026 como sucessor da linha LongCat-Flash, e a Meituan havia retirado seis modelos Flash um mês antes para abrir espaço.

A arquitetura, segundo a ficha do modelo, é uma mixture of experts de 1,6T de parâmetros com cerca de 48B ativados por token. Ela carrega 135B de parâmetros de N-gram Embedding herdados do LongCat-Flash-Lite, que a Meituan descreve como uma forma de expandir a capacidade ao longo de dimensões esparsas ortogonais ao roteamento do MoE. O pré-treinamento passou por mais de 35 trilhões de tokens ao longo de "milhões de dias-acelerador", sem rollbacks ou picos de perda irrecuperáveis.

A peça arquitetônica principal é a LongCat Sparse Attention, que a Meituan apresenta como uma correção para dois problemas específicos do Lightning Indexer usado no DeepSeek V3.2: discontinuidade na saída e um gargalo quadrático na pontuação. Ela tem três partes. O Streaming-aware Indexing reformula o orçamento de seleção de tokens para leituras de memória contíguas. O Cross-Layer Indexing reaproveita uma mesma passagem de indexação em duas camadas adjacentes. O Hierarchical Indexing faz uma recuperação grosseira em nível de bloco antes da seleção fina de tokens.

Esse terceiro ponto merece uma nota. Uma versão anterior da documentação de implantação dizia que o Hierarchical Indexing "não é suportado por simplicidade", e o commit 5ced4db removeu essa linha, junto com outras 41 linhas de instruções concretas de lançamento, em vez de corrigi-la. O post de lançamento diz separadamente que o recurso está "habilitado para tarefas selecionadas de contexto ultralongo", não em toda requisição.

Quatro afirmações anunciadas sobre o LongCat 2.0 ao lado do que os arquivos disponibilizados realmente mostram: 1M de contexto contra um limite de 256K na configuração, pesos abertos no GitHub contra um repositório só com README, GPUs padrão contra 8x B300, e um relatório técnico contra um post de blog
Quatro afirmações anunciadas sobre o LongCat 2.0 ao lado do que os arquivos disponibilizados realmente mostram: 1M de contexto contra um limite de 256K na configuração, pesos abertos no GitHub contra um repositório só com README, GPUs padrão contra 8x B300, e um relatório técnico contra um post de blog

Passei os últimos anos construindo integrações e conexões de API na eesel, e meu instinto diante de qualquer lançamento assim é pular o anúncio e ir direto aos arquivos. Quatro afirmações não sobreviveram a isso.

A janela de contexto de 1M é 256K na configuração

O README da Meituan promove uma janela nativa de 1M de tokens, e o changelog repete isso. O config.json disponibilizado define max_position_embeddings em 262.144. O YaRN está previsto para chegar a 983.040 além desse limite, então o número de 1M descreve o que foi usado para treinar o modelo, e não o que a configuração publicada vai realmente servir.

A própria API hospedada da Meituan adiciona um segundo limite: máximo de 128K de tokens de saída, e o max_tokens conta contra a janela de contexto. Isso não é um escândalo, e 256K é uma janela grande por qualquer critério. Só não é o número do marketing.

O repositório no GitHub é um README

O github.com/meituan-longcat/LongCat-2.0 contém README.md, LICENSE e uma pasta figures/ com três imagens. Isso é o repositório inteiro, cerca de 1 MB, nenhuma linguagem detectada, zero tags ou releases. Os pesos ficam no Hugging Face, a inferência acontece no SGLang, e não há nenhum harness de avaliação ou implementação de referência em lugar nenhum.

Também não há artigo científico. A Meituan publicou um post de blog de lançamento e nada mais, o que a comunidade notou imediatamente:

"The description of LSA and N-Gram in that blog is imo quite surface-level. Thats why i was asking whether there is/will be a full paper."

Essa thread está aberta desde 5 de julho, sem resposta de ninguém da meituan-longcat. O lançamento irmão LongCat-Flash-Omni teve, sim, um artigo de verdade, então isso é uma escolha, não uma limitação de capacidade.

Não há um caminho funcional para Transformers

O config.json disponibilizado não tem a chave model_type, o que faz tanto AutoConfig quanto AutoModelForCausalLM falharem. Você obtém o tokenizador e nada mais. Isso é a issue aberta #4, que ainda estava aberta quando verifiquei.

O SGLang é o único motor suportado, e mesmo assim de forma tosca: a entrada do cookbook instrui a instalar um wheel nightly porque o PR do SGLang foi fechado sem ser mesclado. Não há caminho para vLLM nem para TensorRT-LLM.

A história do hardware, verificada contra as próprias palavras da Meituan

Essa é a parte do lançamento que se espalhou mais, e a parte em que a cobertura e a fonte primária mais se distanciam.

O número de chips é real. A Meituan escreve isso claramente no post de lançamento:

"LongCat-2.0 is pre-trained on over 50K AI ASICs, introducing significant system-level challenges due to both model and cluster scale. We address these challenges through systematic optimizations, achieving over 35% training throughput improvement while also enhancing reliability compared to a naive implementation."

O que não está no post é o resto da história tal como foi contado depois. As palavras "domestic", "China" e "Chinese" nunca aparecem. Nenhum fornecedor de chips é citado, nem Huawei, nem Cambricon, nem Hygon, e nenhum número de peça interno. O próprio enquadramento da Meituan é "plataformas de hardware alternativas". A Nvidia aparece exatamente duas vezes, ambas como ponto de referência, não como negação: uma observando que "comparado ao ecossistema maduro de GPU da Nvidia, a comunidade de software de apoio ainda está menos desenvolvida", e outra observando que "nossos aceleradores têm significativamente menos memória por dispositivo do que uma H800 (80 GB)".

Hardware que não é da Nvidia é a leitura natural. Ainda assim, é apenas uma leitura. A identificação do Ascend 910C que ancorou a thread do Hacker News veio de um comentarista, não da Meituan:

Hacker News

"This is the real news story. It looks like they may have used Huawei Ascend 910C chips"

Essa thread chegou a 281 pontos e 88 comentários, e o contra-argumento mais afiado nela é sobre escala, não sobre autenticidade:

Hacker News

"1024 Huawei Ascend superpods = 50K 910C chips.

That is a tiny tiny system. OpenAI uses milions of GPUs for training"

Há mais uma inconsistência nos próprios números da Meituan. Uma frase diz "mais de 50K ASICs de IA". A seção seguinte diz "dezenas de milhares de superpods de ASIC de IA", enquanto o post define um superpod como "até 48 máquinas cada". As duas coisas não podem ser literais ao mesmo tempo. Se for citar um número, cite a frase sobre o pré-treinamento, que é a mais precisa.

Os dois meses em que foi o Owl Alpha

Antes de qualquer anúncio, o LongCat 2.0 já vinha servindo tráfego silenciosamente no OpenRouter como um modelo stealth gratuito chamado owl-alpha, aproximadamente desde o final de abril de 2026 até ser retirado em 30 de junho, o mesmo dia em que a Meituan publicou o post de lançamento. A Meituan nunca reconheceu isso, e nem a ficha do modelo nem o post de lançamento mencionam o Owl Alpha em nenhum momento.

A comunidade descobriu de qualquer forma, e as evidências ainda estão no Reddit. A primeira pista foi geopolítica, no comentário mais votado da thread original sobre o modelo stealth:

Reddit

I think I can confirm Chinese model, it affirmed that Taiwan is part of China.

Depois alguém testou os dois endpoints lado a lado:

Reddit

I am ABSOLUTELY certain it's Longcat. I tried both the Longcat 2.0 preview via the Longcat API and the Owl Alfa via Openrouter.

It has the same 10-second response time, the same dialogue, and both has 1M of context

Há uma pequena confirmação escondida na própria documentação da Meituan, e é meu detalhe favorito em todo o conjunto de documentos. O exemplo oficial de reasoning_content na página de referência da API mostra o modelo se referindo a si mesmo como "OWL", um resquício de um prompt de sistema que ninguém removeu.

Menciono a fase stealth porque ela muda a forma de ler as análises. Boa parte da experiência prática que as pessoas tiveram com esse modelo foi acumulada de graça, em um harness que estavam testando, antes de qualquer pessoa saber o que estava avaliando. Isso é um feedback de usuário incomumente limpo, e significa que os relatos abaixo não são impressões do dia de lançamento.

O que os benchmarks dizem, e o que não dizem

A Meituan publica dez linhas de benchmark contra seis modelos de comparação. A ressalva está na própria ficha: a menos que marcada com asterisco, todas as pontuações são medidas internamente, e a maioria das pontuações dos concorrentes é retirada diretamente dos próprios relatórios desses fornecedores. Então isso não é um único teste controlado.

Gráfico de barras horizontais das pontuações do SWE-bench Pro: Claude Opus 4.8 com 69,2, Claude Opus 4.7 com 64,3, LongCat 2.0 com 59,5, GPT-5.5 com 58,6, Gemini 3.1 Pro com 54,2, com uma nota dizendo que supera a geração anterior, não a atual
Gráfico de barras horizontais das pontuações do SWE-bench Pro: Claude Opus 4.8 com 69,2, Claude Opus 4.7 com 64,3, LongCat 2.0 com 59,5, GPT-5.5 com 58,6, Gemini 3.1 Pro com 54,2, com uma nota dizendo que supera a geração anterior, não a atual
BenchmarkLongCat 2.0Gemini 3.1 ProGPT-5.5Claude Opus 4.7Claude Opus 4.8
Terminal-Bench 2.170.870.773.871.778.9
SWE-bench Pro59.554.258.664.369.2
SWE-bench Multilingual77.376.9-80.584.8
FORTE73.270.377.877.677.2
BrowseComp79.985.984.479.384.3
RWSearch78.876.385.379.377.3
IFEval90.096.195.088.786.0
Writing Bench83.883.784.785.385.2
IMO-AnswerBench81.890.079.581.875.3
GPQA-diamond88.994.393.694.292.4

Lendo as colunas de cima a baixo, o padrão é claro. O LongCat 2.0 supera o Gemini 3.1 Pro nas três linhas de agentes de código, e ultrapassa o GPT-5.5 no SWE-bench Pro por 0,9. Ele também fica atrás do Claude Opus 4.8 em todas as linhas em que o 4.8 tem pontuação, por 9,7 no SWE-bench Pro e 8,1 no Terminal-Bench 2.1. Minha leitura: este é um modelo de codificação real, próximo da fronteira, que supera a geração anterior e não supera a atual.

Duas coisas dessa tabela merecem ser destacadas antes que alguém a cite. A Meituan observa que o SWE-bench foi executado com "tarefas problemáticas corrigidas", e o RWSearch é descrito como "um benchmark objetivo interno", então duas das dez linhas são parcialmente instrumento próprio da Meituan. E o conjunto de comparação não contém nenhum rival de pesos abertos: nem DeepSeek, nem Qwen3.8 Max, nem Kimi K3, nem GLM-5.2. Esses são os modelos entre os quais uma equipe que escolhe pesos abertos realmente está decidindo.

Mais uma correção enquanto estou nisso, porque está circulando amplamente. A Anthropic não publica nenhuma pontuação de SWE-bench para o Claude Opus 5 ou o Sonnet 5. O número 69,2 é do Opus 4.8. Se você vir 69,2 atribuído ao Opus 5, está errado.

O que dizem quem realmente usou

Os veredictos se dividem fortemente, e quero ser claro que isso é uma discordância real, não um consenso favorável com algumas reclamações pontuais. O padrão geral é que quem usou como agente dentro de um harness avaliou bem, e quem julgou como modelo "inteligente" avaliou mal, mas esse padrão não se sustenta de forma limpa: pelo menos um desenvolvedor que usava só para código o chamou de cheio de bugs e recomendou evitar.

O relato mais substancial vem de alguém que passou 3,6 bilhões de tokens por ele durante o período stealth gratuito:

Reddit

I used this for over 3.6 billion tokens when it was owl-alpha on Openrouter (with Hermes Agent). It was a very good experience.

It's not as 'smart' as other frontier models when it comes to benchmark style tests (one shots, riddles, etc) but it was very good at (1) following instructions, (2) making a plan, (3) following that plan, and (4) staying coherent at very high contexts. I built a number of apps from start to finish and it performed very well.

Alguém que comprou um pacote de tokens depois do lançamento chega à mesma conclusão:

Hacker News

"Not free, but it's so cheap they're basically giving it away. Very impressed too... Not frontier-level intelligence, but a dependable workhorse that can navigate a codebase well and can reliably execute what you tell it to do."

E a discordância mais afiada vem de alguém que usa isso em produção, contestando diretamente o enquadramento que esse lançamento recebeu:

Reddit

I was using Owl Alpha a lot for my project. Thats not gpt 5.5 level model. it not even close to flash 2.5 model - its not gollowing promts.

Minha leitura de tudo isso: "cavalo de trabalho confiável" é o rótulo honesto, e ele se encaixa tanto na tabela de benchmarks quanto nas pessoas que registraram bilhões de tokens. Seguir instruções e coerência em contextos longos aparecem repetidamente como os pontos fortes. Raciocínio puro, não, e a qualidade do código continua contestada, não resolvida.

Vale destacar mais uma reação, porque é o único lugar onde vi alguém precificar exatamente aquilo a que eu continuo voltando.

Reddit

Wait, this is Owl Alpha? Now I wish I had tried it when it was available. I stayed away from it back then because of their privacy policy

É um desenvolvedor que leu a política, tomou uma decisão e perdeu dois meses de acesso gratuito a um modelo decente por causa disso. Se essa foi a troca certa depende inteiramente do que ele planejava enviar para o modelo.

Preços: a tabela real

A Meituan publica tanto um preço de tabela quanto um desconto de lançamento. A coluna de desconto está rotulada como "por tempo limitado", sem nenhuma data de término em lugar nenhum, e a página em chinês chama isso de oferta de lançamento para o primeiro lançamento da plataforma. As duas moedas são tarifas publicadas separadamente, não uma conversão de câmbio.

ItemList USD / 1MPromo USD / 1MList CNY / 1MPromo CNY / 1M
Uncached input$0.75$0.30¥5¥2
Cached input (read)$0.015$0.006¥0.10¥0.04
Output$2.95$1.20¥20¥8
Cache writenot publishednot publishednot publishednot published
Context tieringnone, flat rate to 1M inputnonenonenone

Dois detalhes nessa tabela são mais interessantes do que o número de destaque.

Não há nenhum escalonamento por comprimento de contexto. Todos os outros modelos com janela de 1M que verifiquei cobram mais acima de algum limite: o preço do Gemini 3.1 Pro dobra acima de 200K, o GPT-5.6 Sol dobra acima de 272K, e o MiniMax-M3 dobra acima de 512K. O LongCat 2.0 é fixo, o que torna o trabalho com contexto longo desproporcionalmente barato nele. Esse é o fato menos noticiado da página de preços.

Também vale notar o que um preço fixo não resolve. Uma tarifa barata em um modelo que precisa de mais tokens para chegar à mesma resposta não é barata, e essa é a armadilha de toda comparação de manchete. A mesma ressalva me pegou trabalhando com o preço do GPT-5.6. Ela se aplica com a mesma força ao preço do Gemini 3.6 Flash, e a este também.

E leituras em cache custam 1/50 da entrada sem cache, o que parece ótimo até você olhar o corpo da resposta. Não há o campo prompt_tokens_details.cached_tokens no caminho compatível com OpenAI, nem cache_read_input_tokens no caminho compatível com Anthropic, e não há parâmetro cache_control para controlar isso. O cache é totalmente implícito, e você não consegue verificar pelo que realmente foi cobrado.

O aviso da Meituan merece ser citado exatamente como está: "Prices are subject to change. The prices shown on the LongCat API Platform and your billing records are authoritative."

Como ele se compara na prática

Aqui é onde o preço promocional faz a maior parte do trabalho. Insira seus próprios números.

Movimente os números um pouco e o cenário fica evidente. No preço promocional, o LongCat 2.0 custa cerca de um vigésimo do Opus 5 e cerca de um quinto do preço do Sonnet 5, que foi a comparação que todo mundo fez no dia do lançamento.

Depois arraste o controle de cache para cima. Acima de cerca de 80% de taxa de acerto de cache, o DeepSeek V4 Pro supera o LongCat 2.0 mesmo no preço promocional, porque sua leitura em cache custa 0,003625 dólares contra os 0,006 dólares do LongCat. Entrada sem cache barata não é a mesma coisa que barato em produção, e trabalho de agentes em escala de repositório é exatamente o tipo de carga em que as taxas de acerto de cache tendem a ser altas.

No preço de tabela, o quadro se inverte. 0,75 dólares na entrada e 2,95 na saída é mais caro do que o DeepSeek V4 Pro, a 0,435 e 0,87 dólares, que é o gêmeo arquitetônico mais próximo do LongCat 2.0: também 1,6T de parâmetros totais, 49B ativos, contexto de 1M, também MIT. Ele também perde na entrada para o GPT-5.6 Luna, a 0,20 dólares, que é um modelo proprietário hospedado que você pode pagar com cartão de crédito. Então a promoção é toda a história do preço, e essa promoção não tem data de término divulgada.

Há um segundo multiplicador de custo que o preço na etiqueta esconde. O raciocínio vem ativado por padrão, e os tokens de raciocínio são cobrados pela tarifa de saída. No próprio painel de uso do OpenRouter, 2,03M dos 2,16M de tokens de conclusão para esse modelo eram tokens de raciocínio. Cerca de 94% do que você paga na saída é o modelo "pensando", e não a resposta que você de fato mantém. Isso é normal para um modelo de raciocínio, e ainda assim é um número que você quer ter na sua previsão, em vez de descobrir em uma fatura. Quem já passou por esse exercício com Opus 5 versus Sonnet 5 já sabe o quanto isso move o custo por tarefa.

A parte que realmente vai te travar

A Meituan documenta exatamente dois canais de pagamento, e ambos aparecem apenas dentro das regras de reembolso: WeChat e Alipay. Sem cartão, sem PayPal, sem transferência bancária. A emissão de faturas em autoatendimento está disponível "somente para usuários na China continental", e todos os demais precisam enviar um e-mail à equipe.

O cadastro em si é aberto: usuários fora da China continental podem se inscrever com um endereço de e-mail. Colocar saldo na conta é outra questão, e a API rejeita requisições assim que o saldo chega a zero. Os Token Packs, a alternativa pré-paga, são vendidos em promoções relâmpago programadas para 10h, 16h, 21h e 23h no horário de Pequim, com estoque limitado, e vencem após 30 dias corridos.

A resposta prática para a maioria das equipes fora da China é, portanto, o OpenRouter, o que explica em parte por que o tráfego público do modelo passa mais por harnesses de codificação do que pela própria plataforma da Meituan. Volto a essa troca em um momento.

A API: sete parâmetros e nenhuma ferramenta

Li a documentação da API da mesma forma que a leria antes de conectar algo em produção, e essa é a seção em que uma opinião moldada por benchmarks se transforma em uma opinião de engenharia.

Há duas superfícies disponíveis: um caminho compatível com OpenAI e um caminho compatível com Anthropic Messages, ambos em api.longcat.chat, ambos aceitando a mesma chave bearer. Trocar a URL base de qualquer um dos dois SDKs é uma mudança de uma linha só, que é a coisa mais agradável dessa plataforma. Quem já comparou as APIs da OpenAI, Anthropic e Gemini sabe o quanto isso é raro.

Depois disso, fica escasso rápido. Apenas sete parâmetros são suportados no total: max_tokens, temperature, top_p, stream, tools, tool_choice e thinking. Sem sequências stop. Sem seed. Sem response_format nem modo JSON. Sem logprobs, sem n, sem penalidades, sem top_k. O temperature vai de 0 a 1 em vez de 0 a 2 como na OpenAI, então uma configuração portada diretamente pode ficar fora da faixa sem aviso. O thinking é binário, ativado ou desativado, sem orçamento e sem nível de esforço.

tools e tool_choice aparecem na lista de parâmetros e não estão documentados em lugar nenhum. Sem esquema, sem formato de resposta de chamada de ferramenta, sem exemplo, apesar de o changelog anunciar chamadas de ferramentas nativas. No dia do lançamento, essa lacuna apareceu exatamente onde se esperaria:

Hacker News

"I can't get any tool calls working. Seems to use a <longcat_tool_call> wrapper which the current harnesses I'm using don't support"

A ficha do modelo confirma uma quebra relacionada: o LongCat espera os arguments de uma chamada de ferramenta como um dicionário, e não como a string JSON que o esquema da OpenAI especifica. Qualquer coisa escrita conforme o formato padrão precisa de um adaptador.

As duas camadas de compatibilidade também têm um formato sutilmente errado, de um jeito que quebra parsers estritos. O raciocínio chega como message.reasoning_content no caminho da OpenAI, que é um campo do DeepSeek, e não da OpenAI. No caminho da Anthropic, ele chega como uma chave thinking dentro de um bloco de conteúdo de texto, em vez de um bloco de raciocínio propriamente dito, e o stream SSE documentado omite content_block_start, content_block_stop e ping.

Não há nenhuma ferramenta hospedada de qualquer tipo. Sem busca na web, sem interpretador de código, sem armazenamento de recuperação, sem endpoints de arquivos, sem embeddings, sem API em lote. O MCP não é mencionado nenhuma vez, e não há loop de agente no lado do servidor, então o comportamento agêntico é inteiramente uma afirmação sobre o modelo, e fazer isso funcionar é inteiramente trabalho do seu harness.

O que a Meituan documenta são integrações de cliente: doze delas, incluindo Claude Code, Codex, Cline, Kilo Code, OpenCode e Cherry Studio, cada uma com a troca exata de URL base. Cursor e Roo não estão nessa lista. Se você já vive dentro de uma CLI de codificação agêntica, esse é o caminho de menor resistência, e é para onde vai o tráfego real do modelo.

Existem limites de taxa e nenhum número é publicado sobre eles. O único número concreto em todo o conjunto é retry_after: 60 no corpo da resposta 429. Requisições que falham não são cobradas, o que é um detalhe simpático, e o saldo pré-pago por uso nunca expira.

Meu detalhe favorito em todo o conjunto de documentos é pequeno: o exemplo oficial de reasoning_content tem o modelo se referindo a si mesmo como "OWL", um resquício de um prompt de sistema diferente. A documentação é escrita por humanos com pressa, e isso aparece.

Auto-hospedagem: a parede

Pesos MIT em um modelo de escala de fronteira é um presente real, e ele vem com uma conta de hardware que decide para quem esse presente realmente é.

Quatro cartões de rack de servidor comparando a implantação mínima para o LongCat 2.0: o B300, com 288 GB cada, precisa de 8 GPUs em um único nó, enquanto o B200, com 192 GB, o H200, com 141 GB, e o H20, com 96 GB, precisam cada um de 16 GPUs distribuídas em dois nós, com uma nota de rodapé mencionando 141 shards FP8 e apenas SGLang nightly
Quatro cartões de rack de servidor comparando a implantação mínima para o LongCat 2.0: o B300, com 288 GB cada, precisa de 8 GPUs em um único nó, enquanto o B200, com 192 GB, o H200, com 141 GB, e o H20, com 96 GB, precisam cada um de 16 GPUs distribuídas em dois nós, com uma nota de rodapé mencionando 141 shards FP8 e apenas SGLang nightly

O lançamento em BF16, segundo a API de blobs do Hugging Face, tem 3,55 TB distribuídos em 194 shards safetensors. O build FP8 tem 2,05 TB em 141 shards. Toda receita do SGLang carrega FP8, então o arquivo mestre de 3,55 TB funciona mais como fonte de quantização do que como alvo de servição, e o BF16 não tem topologia publicada alguma.

HardwareHBM per GPUGPUsNodesParallelism
NVIDIA B300288 GB81TP=8, EP=8
NVIDIA B200192 GB162TP=16, EP=16
NVIDIA H200141 GB162TP=16, EP=16
NVIDIA H2096 GB162TP=16, EP=16
Ascend Atlas A2not published1921264 prefill, 128 decode

A linha 8x B300 é a única que o SGLang marca como verificada, e a conta explica por que o B200 de 192 GB ainda precisa de dois nós: 2,05 TB de pesos FP8 não cabem em 8 x 192 GB. A receita do H20 é ainda mais estranha, porque 16 x 96 GB dá 1.536 GB contra 2.051 GB de pesos, o que só funciona se as tabelas N-gram e os módulos MTP ficarem fora da HBM, e nenhum documento diz que isso acontece.

Depois vem o cache KV. A 43.776 bytes por token e com --mem-fraction-static 0.92 em 8x B300, sobram aproximadamente 69 GB de margem de KV depois de carregar os pesos. Isso equivale a cerca de seis sequências simultâneas na janela completa de 256K, ou 64 slots com uma média de 24K tokens cada. A janela de contexto e a concorrência estão disputando a mesma memória, e com 1M de contexto, 64 slots precisariam de 2.802 GB só de KV, mais do que todo o pool de 2.304 GB.

Runtimes para consumidor são um não categórico. O llama.cpp não tem nenhum suporte mesclado para o LongCat, e não existe GGUF para nenhuma variante, então Ollama e LM Studio não conseguem carregá-lo. As quantizações da comunidade que existem são apenas para MLX, precisam de um PR do mlx-lm ainda não mesclado, e a menor versão com todos os experts pesa 512 GB, o que excede um Mac de 512 GB. A aba de discussão do Hugging Face é basicamente um único pedido longo e contínuo:

"GGUF Version please!!!"

O r/LocalLLaMA chegou lá mais rápido, e o comentário mais votado na thread de lançamento dos pesos resume isso melhor do que qualquer outro:

Reddit

Damn, that's a really long Cat!

3.55 TB in all its BF16 glory. 2.05 TB in FP8.

A versão mais sóbria do mesmo ponto, na mesma thread: pesos abertos e acesso aberto não são a mesma coisa. Para qualquer pessoa com uma 4090, uma 5090 ou até uma RTX PRO 6000 de 96 GB, esse lançamento é algo para ler sobre, não para executar. O que ele de fato viabiliza é o trabalho de ecossistema: inspeção, destilação, quantizações da comunidade e, eventualmente, uma versão Lite ou destilada que hardware comum consiga realmente carregar.

Os downloads contam a mesma história: 3.240 no último mês, com zero provedores de inferência listados no Hugging Face e 24 pessoas que clicaram em "Ask for provider support". Para um modelo que liderou a conversa sobre modelos de codificação por um mês, esse é um número pequeno, e é o número que se esperaria quando o ingresso de entrada é um nó 8x B300. Pesos gratuitos não tornam a inferência gratuita, e o preço do Hugging Face é uma verificação de realidade útil sobre onde a conta realmente acaba caindo.

Para onde vão seus dados, que é a decisão que realmente importa

Essa é a seção que eu leria primeiro se dirigisse suporte em vez de um repositório, e é a mais curta porque há muito pouco a relatar.

O FAQ da plataforma da Meituan não aborda retenção de dados. Não aborda se prompts ou respostas são usados para treinamento. A palavra "training" não aparece na página. Nenhum país de servidor é citado, e a única linha próxima do tema geográfico é "carga do servidor e localização geográfica", sob um tópico sobre latência. Não há SLA, nenhum número de uptime, nenhum crédito de serviço e nenhum caminho de implantação corporativa ou privada além de um endereço de e-mail.

Nada disso significa que algo ruim esteja acontecendo. Significa que as perguntas continuam sem resposta, e não ter resposta já é, por si só, uma resposta em uma revisão de segurança.

Passar pelo OpenRouter também não resolve totalmente isso. Exatamente um fornecedor serve esse modelo, a AtlasCloud, que carrega um selo de "No training", mas nenhum selo de retenção zero de dados, enquanto NovitaAI, Tencent Cloud e Fireworks carregam ZDR na mesma página de diretório. A própria política da AtlasCloud retém conteúdo do cliente, definido como incluindo prompts, resultados gerados e payloads de API, por até sete dias, com ZDR reservado a um aditivo empresarial separado. Com apenas um fornecedor, uma requisição filtrada por ZDR não tem para onde ir.

Não preciso especular se isso importa comercialmente, porque vejo isso todas as semanas nas chamadas de vendas da eesel. Um comprador dinamarquês de telemática B2B, travado por uma revisão de segurança interna rigorosa, não começaria um teste até ter garantia de que os dados de tickets contendo números de cartão e senhas ficavam dentro do próprio ambiente dele. Uma empresa de mídia que processa cerca de 1.000 tickets por semana fez da redação de cartões de crédito e dados pessoais a principal objeção de toda a avaliação, antes até da precisão e do preço. A resposta que dou nessas reuniões é específica: nenhum dado de cliente é usado para treinar modelos, os provedores de modelo subjacentes retêm dados por no máximo 30 dias para monitoramento de abuso, e os dados são isolados por conta. Você não pode dar essa resposta sobre uma página que nunca menciona treinamento.

Isso não é uma crítica ao LongCat 2.0 como modelo de codificação. É a diferença entre um modelo que você aponta para o seu próprio repositório e um modelo que você aponta para os dados pessoais de outra pessoa. A mesma barreira aparece em toda avaliação de IA para helpdesk que já vi, e uma resposta errada com o número do cartão de um cliente no prompt é um tipo de alucinação pior do que uma resposta errada sobre um trecho de código.

Quem deveria realmente usar isso

Recorra ao LongCat 2.0 se você faz trabalho de codificação de alto volume e contexto longo dentro de um harness que você controla, consegue pagar via OpenRouter, e o código que você fornece a ele não é sensível. O preço fixo até 1M de entrada é uma vantagem real para prompts em escala de repositório, a licença MIT não tem cláusula de uso aceitável nem limite de usuários, e "cavalo de trabalho confiável" é uma descrição justa do que as pessoas relatam.

Evite se você precisa de modo JSON, sequências stop ou um contrato documentado de chamada de ferramentas, se planejava hospedar isso sozinho em algo menor que um nó 8x B300, ou se um questionário de tratamento de dados faz parte do seu processo de compra. Se você quer pesos abertos especificamente, o DeepSeek V4 Pro é a comparação mais próxima a um preço de tabela mais baixo, e o GLM-5.2 também é MIT. Se você quer tokens baratos especificamente e não se importa com pesos abertos, o GPT-5.6 Luna é mais barato na entrada e aceita pagamento por cartão de crédito. Vale a pena ler como DeepSeek Flash e K3 se comparam em custo por tarefa concluída antes de se comprometer, porque as tarifas de destaque e as faturas reais se distanciam bastante nesse segmento.

E se você está escolhendo um modelo porque quer que a IA responda aos tickets dos seus clientes, eu diria que o modelo é a camada errada onde procurar. Isso merece sua própria seção.

Try eesel

Se você chegou até aqui comparando preços de tokens porque quer que a IA cuide da sua fila de suporte, o que eu diria é que escolher o modelo é a parte fácil, os 5% desse projeto. A parte difícil é saber o que a IA vai dizer aos seus clientes antes que ela diga, e conseguir responder depois à sua própria equipe de segurança.

A eesel é uma colega de equipe com IA que você conecta ao helpdesk que você já usa, Zendesk, Freshdesk, Gorgias, Front, Help Scout ou Salesforce, e ela aprende com seus tickets e central de ajuda existentes em vez de precisar de uma base de conhecimento do zero. Nós cuidamos da camada de modelo, então você não precisa reprecificar sua pilha de suporte a cada vez que um post de lançamento promete 60% de desconto sem data de término. Antes de qualquer coisa entrar em produção, você pode simular o agente contra seus tickets históricos reais e ver as respostas que ele teria enviado, um passo que construímos depois de ver bots de aparência confiante errarem silenciosamente. E nas perguntas que o FAQ do LongCat deixa em aberto, temos respostas específicas: seus dados não são usados para treinar modelos, e são isolados por conta.

O fluxo de configuração da eesel, mostrando as três etapas de onboarding, uma integração com o Zendesk já conectada, e a escolha de responder pelo helpdesk, Slack ou Teams, ou por um link compartilhável
O fluxo de configuração da eesel, mostrando as três etapas de onboarding, uma integração com o Zendesk já conectada, e a escolha de responder pelo helpdesk, Slack ou Teams, ou por um link compartilhável

Você pode conectar um helpdesk e assistir à primeira resposta sendo redigida em poucos minutos, em um plano self-service com preços da eesel por tarefa e sem taxas por assento. Se você quiser ver como as peças se encaixam antes disso, nossa análise sobre o melhor LLM para suporte cobre as trocas envolvidas, e o detalhamento de construir versus comprar coloca números reais sobre quanto custa operar sua própria pilha quando você inclui as GPUs. Experimente a eesel de graça, ou agende uma demonstração e traga seu ticket mais difícil.

Perguntas frequentes

O que é o LongCat 2.0?
O LongCat 2.0 é um modelo de linguagem mixture-of-experts de 1,6 trilhão de parâmetros, lançado pela Meituan em 30 de junho de 2026 sob licença MIT, com cerca de 48 bilhões de parâmetros ativos por token. É voltado para codificação agêntica e trabalho em nível de repositório, não para chat, o que o coloca na mesma categoria de Kimi K2.7 Code e GPT-5.1-Codex-Max.
Quanto custa o LongCat 2.0 por milhão de tokens?
O preço de tabela da Meituan é de 0,75 dólares por milhão de tokens de entrada e 2,95 dólares por milhão de tokens de saída, atualmente com desconto para 0,30 e 1,20 dólares como promoção de lançamento sem data de término divulgada. Isso fica bem abaixo do preço do Opus 5, mas o preço de tabela fica acima do DeepSeek V4 Flash e de sua versão Pro.
O LongCat 2.0 é realmente um modelo com 1M de contexto?
A Meituan o treinou com dados de 1M de tokens, mas o config.json disponibilizado limita o max_position_embeddings a 262.144. Ou seja, a janela de contexto realmente servida é de 256K, a menos que você configure a extensão por conta própria, uma diferença menor do que parece diante da janela de contexto do Claude Code, mas que ainda assim não é o número anunciado.
Posso hospedar o LongCat 2.0 eu mesmo?
Só com hardware sério. O checkpoint em BF16 tem 3,55 TB distribuídos em 194 shards, e a única receita de servição verificada é 8 NVIDIA B300 executando a versão FP8. Não existe GGUF, então Ollama e LM Studio não conseguem carregá-lo, o que o torna uma proposta bem diferente da maioria dos agentes de IA de código aberto que podem ser executados localmente.
Devo usar o LongCat 2.0 para atendimento ao cliente?
Eu ainda não colocaria isso em uma fila de suporte real. O FAQ da plataforma nunca aborda retenção de dados, treinamento com prompts ou localização dos servidores, que é a primeira pergunta que qualquer comprador faz em uma revisão de SOC 2 e GDPR. Para trabalho de suporte, uma camada gerenciada que cuida da escolha do modelo para você é um caminho mais seguro do que conectar um modelo bruto diretamente ao seu sistema de tickets com IA.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat
Trending

Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Avaliei o LongCat 2.0 em sete pontos que realmente importam para um comprador, usando os próprios documentos da Meituan e os relatos de quem já passou bilhões de tokens por ele. Ele sai bem em seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustração do detalhamento de preços do PromptQL
Trending

Preço do PromptQL: quanto custa de verdade em 2026

Um detalhamento do preço do PromptQL: a unidade cobrável OLU, a tarifa promocional de US$ 0,14, créditos gratuitos, o multiplicador de modelo que realmente define sua fatura e exemplos reais de custo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab
Trending

Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

O que o Inkling realmente é: o primeiro modelo de pesos abertos da Thinking Machines Lab, seus benchmarks reais, quanto custa rodá-lo e se ele tem algo a ver com uma fila de suporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis