
Comment j'ai noté cet avis
Sept dimensions, chacune notée à partir d'une source primaire plutôt qu'un résumé de presse : le fichier de licence, la page de tarifs, le config.json livré, la référence de l'API, le propre tableau de benchmarks du blog technique, la FAQ de la plateforme et les procédures de déploiement. Quand j'utilise un jugement issu d'une expérience pratique, il provient d'une personne identifiée dans un fil de discussion public, pas d'une supposition de ma part.

Pour le démontage complet de ce que contient la boîte, j'ai écrit un article complémentaire sur LongCat 2.0 lui-même. Cet avis est la décision d'achat qui se construit par-dessus.
Peut-on vraiment y accéder ? Choisissez votre voie
Ce qui est inhabituel en évaluant ce modèle, c'est que « est-il bon » et « peut-on l'utiliser » ont des réponses différentes selon la manière dont on y accède. Il existe trois voies, et chacune a un obstacle différent. Choisissez la vôtre :
Cette troisième colonne explique pourquoi la licence MIT, qui est sur le papier la meilleure caractéristique du modèle, ne sert presque à rien pour la plupart des lecteurs. Une licence MIT pure sur un checkpoint qu'on ne peut pas faire fonctionner est une licence à admirer.
Ce qu'il fait vraiment bien
La donnée la plus utile de tout cet avis n'est pas un benchmark. C'est le témoignage d'un développeur qui a fait passer 3,6 milliards de tokens dans le modèle pendant les deux mois où il était sur OpenRouter sous le nom de modèle furtif owl-alpha :
I used this for over 3.6 billion tokens when it was owl-alpha on Openrouter (with Hermes Agent). It was a very good experience.
It's not as 'smart' as other frontier models when it comes to benchmark style tests (one shots, riddles, etc) but it was very good at (1) following instructions, (2) making a plan, (3) following that plan, and (4) staying coherent at very high contexts. I built a number of apps from start to finish and it performed very well.
C'est une description précise d'un bon modèle agentique et d'un modèle de chat médiocre, et cela correspond au deuxième meilleur témoignage pratique, celui d'une personne qui a acheté un pack de tokens après le lancement :
As an aside, I also nabbed a 50m token pack for LongCat 2.0 to give it a whirl. Not free, but it's so cheap they're basically giving it away. Very impressed too [...] Not frontier-level intelligence, but a dependable workhorse that can navigate a codebase well and can reliably execute what you tell it to do.
Deux utilisateurs indépendants, à deux mois d'écart, via des voies d'accès différentes, arrivent au même verdict : un exécutant fiable, pas un génie. C'est plus précieux à savoir que n'importe quel écart de SWE-bench, et c'est le profil recherché si vous construisez des agents de codage personnalisés où le harness pense et le modèle travaille.

Il vaut la peine de signaler la réserve émise par le même utilisateur, car elle change la façon de lire le tableau de benchmarks : LongCat 2.0 n'est pas un modèle de raisonnement. Ses scores ont été établis sans budget de réflexion étendue, alors que plusieurs des modèles auxquels il est comparé en avaient un. Cela joue dans les deux sens, et c'est le type d'asymétrie qui rend les comparaisons entre fournisseurs dans les CLI de codage agentique plus difficiles que ne le laissent croire les graphiques marketing.
Ce qu'il ne fait pas bien
La contestation est réelle et je ne vais pas l'enterrer. Venant de quelqu'un qui l'utilise en production :
I was using Owl Alpha a lot for my project. Thats not gpt 5.5 level model. it not even close to flash 2.5 model - its not gollowing promts.
Et un avis plus tranché encore, spécifiquement sur le code :
I have been trying to use longcat 2 but its bad model, it cant follow orders for example. Its coding is terrible, buggy as hell, stay away. Deepseek is way better.
Les deux sont des commentaires peu votés et contredisent tous deux les témoignages à fort volume de tokens, donc je les pondère en conséquence. Mais le schéma qui se répète dans tous ces cas est cohérent : la qualité de ce modèle dépend fortement du harness qui le pilote. Les personnes qui ont signalé des succès l'exécutaient dans une vraie boucle d'agent. Celles qui ont signalé des échecs le sollicitaient surtout directement par des prompts.
Côté raisonnement, le test public le plus discuté sur Hacker News le classe troisième :
Overall I rate Gemini Flash the best, Qwen 3.7 Plus an acceptable second, and LongCat-2.0. an ok'ish third, if you have nothing better.
Je citerais cela avec précaution, car le test lui-même a été démonté dans le fil par trois commentateurs distincts qui ont soutenu que la question était orientée ou n'avait pas de réponse unique correcte. C'est un seul prompt, pas une évaluation.
Deux échecs d'intégration signalés le jour du lancement sont plus exploitables que tout ce qui précède. Un utilisateur n'a pas pu faire fonctionner les appels d'outils du tout parce que le modèle émet un wrapper <longcat_tool_call> que son harness ne reconnaissait pas, et un autre a posé une question en anglais avec la recherche activée et a reçu les réponses en chinois. Aucun des deux n'est un problème de qualité. Les deux sont le genre de chose qui fait perdre une après-midi entière.
Les benchmarks, lus honnêtement
Meituan publie SWE-bench Pro, pas Verified, et a exécuté les chiffres en interne sur Claude Code avec un bac à sable 4c8g à température 1.0, en indiquant avoir « corrigé les tâches problématiques ». Voici le tableau, avec l'origine de chaque score indiquée, car les écarts de quelques points ne sont que du bruit :
| Modèle | SWE-bench Pro | Qui l'a exécuté | Remarque |
|---|---|---|---|
| Claude Fable 5 | 80.0 | rapporté par OpenAI | ne figure pas sur une page Anthropic |
| Claude Opus 4.8 | 69.2 | rapporté par quatre fournisseurs | le chiffre le plus cohérent de l'ensemble |
| Qwen3.8-Max | 67.7 | Qwen, en interne | affirme aussi avoir corrigé le jeu de tâches |
| GPT-5.6 Sol | 64.6 | OpenAI, en interne | n/a |
| GPT-5.6 Terra | 63.4 | OpenAI, en interne | n/a |
| GPT-5.6 Luna | 62.7 | OpenAI, en interne | n/a |
| GLM-5.2 | 62.1 | Z.ai, OpenHands, contexte 400K | prompt adapté sur mesure |
| LongCat 2.0 | 59.5 | Meituan, en interne, Claude Code | pas de mode raisonnement ; jeu de tâches corrigé |
| GPT-5.5 | 59.4 | OpenAI, en interne | la propre fiche de LongCat indique 58.6 |
| MiniMax-M3 | 59.0 | MiniMax, en interne | n/a |
| DeepSeek-V4-Pro (Max) | 55.4 | DeepSeek, en interne | quasi-jumeau architectural de LongCat |
| Gemini 3.1 Pro Preview | 54.2 | rapporté par OpenAI | n/a |
| DeepSeek-V4-Flash (Max) | 52.6 | DeepSeek, en interne | modèle de 284B |
Lu franchement : 59,5 place LongCat 2.0 au niveau du GPT-5.5 de l'année passée, à quelques points derrière GLM-5.2 et toute la famille GPT-5.6, et à environ dix points derrière Opus 4.8. Il devance son quasi-jumeau architectural le plus proche, DeepSeek V4 Pro, de quatre points, ce qui est la comparaison que je ferais réellement.
Le tableau ne montre pas deux choses. L'ensemble de comparaison de Meituan lui-même ne contient aucun rival à poids ouverts, ce que r/LocalLLaMA a immédiatement remarqué :
I don't know why they won't line up their benchmark to other Chinese and open models, you know, they have DeepSeekV4Pro, KimiK2.7-Coder, GLM5.2, MiniMaxM3, Qwen3.5-397B, MiMoV2.5-Pro.
C'est une critique juste. Un fournisseur qui ne se compare qu'à des modèles qu'il bat vous dit où il a choisi de se positionner. Et Meituan ne publie aucun score SWE-bench Verified, donc toute comparaison avec la fourchette de 79 à 81 que DeepSeek V4 et MiniMax rapportent sur Verified n'est pas une comparaison qu'on peut faire.
Le prix est la colonne la plus forte, avec une note en bas de page
| Catalogue | Promo | Variation | |
|---|---|---|---|
| Entrée, sans cache | $0.75 / 1M | $0.30 / 1M | -60% |
| Lecture du cache | $0.015 / 1M | $0.006 / 1M | -60% |
| Sortie | $2.95 / 1M | $1.20 / 1M | -59% |
Deux détails de la page de tarifs comptent plus que le chiffre principal. D'abord, il n'y a aucun palier de prix selon la longueur du contexte, quelle que soit la longueur, ce qui est inhabituel : Gemini, GPT-5.6 et MiniMax augmentent tous le prix passé un certain seuil, alors qu'ici une requête de 200K tokens coûte le même prix par token qu'une requête de 2K. Ensuite, le prix d'écriture en cache est absent de la page, ce qui n'équivaut pas à gratuit.
La note en bas de page, c'est la promotion elle-même. Elle est étiquetée comme limitée dans le temps, sans date de fin publiée. Au prix catalogue, le modèle est plus cher que les 0,435 et 0,87 dollar de DeepSeek V4 Pro, pour ce qui est, sur le papier, la même forme de modèle : 1,6T au total, environ 48 contre 49 milliards de paramètres actifs, licence MIT. Tout l'argument de coût repose donc sur une remise que le fournisseur peut arrêter quand il le souhaite. Quelqu'un sur Reddit avait déjà fixé le seuil avant le lancement, et la promotion l'a franchi :
as long as it stays below .40 input and .80 output it will have a use.
Notez qu'au prix catalogue, il ne franchit pas ce seuil. Et l'affirmation « le modèle à contexte 1M le moins cher », qui a circulé au lancement, a été corrigée presque immédiatement dans le fil, parce que DeepSeek V4 Flash est à 0,14 et 0,28 dollar. Si votre seul critère est le prix par token, LongCat 2.0 n'est pas le gagnant, même au sein du champ chinois des poids ouverts. Pour le champ plus large, les pages de tarifs de GPT-5.6 et de tarifs de Claude Opus 5 fixent le plafond, et le tarif de Kimi K3, à 3 et 15 dollars, montre que poids ouverts et tokens bon marché ne vont pas toujours de pair.
Trois obstacles que le marketing ne mentionne pas
La fenêtre de contexte est de 256K, pas de 1M
Tous les articles de lancement annoncent 1M. Le config.json livré sur Hugging Face limite max_position_embeddings à 262 144, avec YaRN prévu jusqu'à 983 040 derrière cette limite. L'API hébergée ajoute un plafond de sortie séparé de 131 072 tokens, et max_tokens compte dans votre contexte. Le chiffre honnête est donc 256K en entrée, 128K en sortie, et le chiffre de 1M décrit les données d'entraînement.
C'est un écart plus petit qu'il ne paraît, puisque 256K représente beaucoup, mais c'est la différence entre « rentre dans le monorepo » et « n'y rentre pas ». Si le contexte long est votre besoin réel, comparez le comportement pratique de la fenêtre de contexte de Claude Code plutôt que de vous fier à une fiche technique.
Le contrat d'outillage n'est pas écrit
C'est la note qui m'a le plus surpris. La référence de l'API publie une poignée de paramètres de requête et aucun tableau tools dans le schéma du corps, ni au format OpenAI ni au format Anthropic. Il n'y a ni tool_choice, ni parallel_tool_calls, ni stop_sequences, ni metadata, et content est documenté comme une simple chaîne de texte, donc aucun bloc de contenu, aucune image, aucun tool_result. temperature va de 0 à 1 au lieu du 0 à 2 d'OpenAI, ce qui tronquera silencieusement les requêtes portées depuis un autre fournisseur.
La page « outils » de la plateforme n'est absolument pas un catalogue d'outils. C'est une liste de compatibilité de douze clients de codage tiers que l'on peut pointer vers l'API. Il n'y a ni recherche web côté serveur, ni interpréteur de code, ni stockage de récupération, ni surface MCP, ni boucle d'agent hébergée. Tout ce qui est agentique se passe côté client, par conception. C'est une architecture légitime, et c'est le même pari « apportez votre propre harness » que GPT-5.1-Codex-Max sous une autre forme, mais cela signifie que l'histoire d'IA agentique de ce modèle est entièrement celle de votre harness.
Il n'y a pas de papier de recherche, et à peine un dépôt
meituan-longcat/LongCat-2.0 sur GitHub, c'est un README, une licence et trois figures, environ 1 Mo, zéro release. Les poids sont sur Hugging Face. Il n'y a pas de rapport technique, seulement un billet de blog, ce qui signifie que les deux nouveaux éléments d'architecture n'ont aucune méthodologie publiée. La fiche du modèle omet model_type, ce qui fait échouer directement AutoModel de Transformers, et SGLang est le seul moteur, avec sa PR de support fermée sans fusion et une wheel nightly requise.
Pour un modèle dont tout l'argument de vente est l'ouverture, c'est mince. La comparaison qui le rend évident, c'est Hugging Face lui-même : 3 240 téléchargements par mois et zéro fournisseur d'inférence sur le hub, ce n'est pas l'empreinte d'un modèle que les gens déploient réellement.
La note qui arrête les acheteurs entreprise
Voici la découverte que je mettrais devant n'importe quel évaluateur sécurité. La FAQ de la plateforme de Meituan est silencieuse sur la rétention des données, l'entraînement sur les prompts, la résidence des données et le SLA. Le mot « entraînement » n'y apparaît nulle part.
Ce silence n'est pas un détail technique. C'est exactement la question que pose chaque acheteur, et je l'entends dans presque tous les appels. Un évaluateur technique d'une entreprise de matériel B2B à qui j'ai parlé en mars ne voulait pas avancer avant d'avoir une réponse claire sur la possibilité pour l'IA d'accéder à des informations hors de sa base de connaissances approuvée ; un autre acheteur, contraint par une revue de sécurité interne, avait besoin d'une garantie écrite que les données de tickets contenant des numéros de carte et des mots de passe resteraient dans son environnement. Ce ne sont pas des demandes exotiques. C'est le plancher minimal. Une page de fournisseur qui ne mentionne pas la rétention ne peut pas franchir ce plancher, quel que soit son score aux benchmarks.
Des développeurs ont tiré la même conclusion, indépendamment. L'un a complètement évité le modèle pendant sa période furtive gratuite, par principe, et a découvert après coup ce qu'il avait manqué :
Wait, this is Owl Alpha? Now I wish I had tried it when it was available. I stayed away from it back then because of their privacy policy
Et le contournement par OpenRouter ne résout rien, il ne fait que documenter l'exposition : AtlasCloud est le seul fournisseur, il n'affiche aucun badge de rétention de données zéro, et sa politique indique 7 jours de rétention du contenu. Si vous êtes en train de mener une revue SOC 2 et RGPD, ou proche des exigences d'une IA conforme HIPAA, c'est là que ça se termine. L'auto-hébergement est la seule voie qui élimine la question, et l'auto-hébergement signifie huit B300.
Pour être juste envers le modèle, rien de tout cela ne dit que Meituan fait quelque chose de mal avec vos données. Cela dit que Meituan n'a pas publié ce qu'il en fait. Pour un projet personnel, cette distinction n'a pas d'importance. Pour un pipeline d'automatisation du service client qui traite de vrais tickets, c'est toute la décision.
Qui devrait l'utiliser
Bon choix. Les développeurs solo et les petites équipes qui font du codage agentique à fort volume dans un harness qu'ils contrôlent, où les tokens sont le coût qui compte et où les données ne sont pas sensibles. Conversion de documents, scraping, navigation dans des bases de code, refactorisations longues. Le respect des instructions et la cohérence sur de longs contextes sont réels, et à 0,30 dollar par million de tokens en entrée, le calcul est difficile à contester. Si vous étudiez les agents IA open source ou que vous choisissez un modèle pour un travail d'optimisation LLM, il a sa place sur la liste.
Mauvais choix. Quiconque a besoin d'une qualité de raisonnement en une seule passe, d'un contrat de function calling documenté, d'une vraie fenêtre de 1M, d'un moyen de paiement par carte, ou d'une réponse écrite sur le traitement des données. Cela couvre la plupart des acheteurs professionnels, et tous les cas d'usage de meilleur agent IA pour le service client sur lesquels je travaille. Pas parce que le modèle est mauvais, mais parce qu'un modèle brut est la mauvaise unité d'achat pour une file de support. Le modèle représente peut-être 20 % du problème ; la récupération d'information, l'ancrage, les règles d'escalade, les guardrails et les tests représentent les 80 % restants, et rien de tout cela ne vient dans un checkpoint. C'est la même conclusion à laquelle j'arrive dans construire ou acheter une IA de support, et c'est la raison pour laquelle le chiffre du coût par résolution bouge bien moins avec le prix du token qu'on ne le pense.
Essayer eesel
Lire un avis comme celui-ci, c'est en réalité tenter de répondre à une autre question : ce modèle va-t-il donner une mauvaise réponse à mes clients ? Le prix du token ne vous le dit pas. L'hallucination de l'IA n'est pas une ligne sur une page de tarifs.
C'est le problème sur lequel je travaille. eesel simule votre agent IA sur vos propres tickets historiques avant qu'il ne réponde jamais à un client réel, ce qui vous permet de voir les réponses qu'il aurait envoyées, sur vos vraies questions, avec votre véritable base de connaissances derrière. Chaque réponse est enregistrée, révisable et réversible, et vous définissez exactement les sujets qu'il est autorisé à aborder. Il se connecte à votre stack IA de helpdesk existant en quelques minutes, et le choix du modèle devient le problème d'eesel plutôt que le vôtre. Gratuit à essayer.

Le verdict
LongCat 2.0 mérite une recommandation pour exactement un usage : du codage agentique bon marché et à fort volume dans un harness que vous pilotez, sur des données qui ne vous dérangent pas de voir sortir de vos murs. Au tarif promotionnel, c'est l'une des meilleures options de valeur par token de sa catégorie, la licence MIT est bien réelle, et les témoignages pratiques de ceux qui lui ont fait traiter des milliards de tokens sont plus positifs que sa ligne dans le tableau de benchmarks.
Tout ce qui bloque une recommandation plus large est un manque de documentation, pas de modélisation : un chiffre de contexte qui ne correspond pas à la configuration, un contrat de function calling jamais publié, une promotion sans date de fin, et une politique de données qui n'existe pas. Meituan pourrait combler ces quatre lacunes avec une semaine de rédaction. Jusqu'à ce que ce soit fait, c'est un excellent modèle pour expérimenter et un modèle difficile à mettre en production.
Si votre objectif réel est de l'IA dans une file de support plutôt qu'un agent de codage, commencez plutôt par le meilleur LLM pour le support client, et traitez le modèle comme la dernière chose que vous choisissez, pas la première.
Frequently Asked Questions
LongCat 2.0 est-il vraiment bon ?
Que conclut cet avis sur LongCat 2.0 concernant le prix ?
LongCat 2.0 a-t-il vraiment une fenêtre de contexte de 1M ?
config.json sur Hugging Face limite max_position_embeddings à 262 144, donc la fenêtre de contexte réellement servie est de 256K. Le chiffre de 1M décrit les données d'entraînement. La sortie est limitée séparément à 131 072 tokens.Puis-je exécuter LongCat 2.0 en local ?
LongCat 2.0 est-il sûr pour un usage de support client ?
Quelle est la meilleure alternative à LongCat 2.0 pour les équipes support ?
LongCat 2.0 prend-il en charge l'appel d'outils et le MCP ?
tools dans le schéma du corps de requête d'aucun des deux endpoints, aucune surface MCP, et des utilisateurs du jour de lancement ont signalé un wrapper non standard <longcat_tool_call> que leurs harnesses ne pouvaient pas analyser. L'usage d'outils est possible via des clients, mais ce n'est pas un contrat documenté.
Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.









Comment LongCat 2.0 se compare-t-il à Kimi K3 et Qwen3.8-Max ?