
Cómo evalué esta review
Siete dimensiones, cada una evaluada a partir de una fuente primaria y no de un resumen de prensa: el archivo de licencia, la página de precios, el config.json desplegado, la referencia de la API, la propia tabla de benchmarks del blog técnico, las preguntas frecuentes de la plataforma y las recetas de despliegue. Cuando uso un juicio basado en la experiencia práctica, proviene de una persona identificada en un hilo público, no de una suposición mía.

Para el desmontaje completo de lo que trae la caja, escribí un artículo complementario sobre LongCat 2.0 en sí. Esta review es la decisión de compra que se construye encima de aquel.
¿Puedes acceder realmente a él? Elige tu ruta
Lo inusual de revisar este modelo es que "¿es bueno?" y "¿puedo usarlo?" tienen respuestas distintas según cómo llegues a él. Existen tres rutas y cada una tiene un muro diferente. Elige la tuya:
Esa tercera columna es la razón por la que la licencia MIT, que sobre el papel es la mejor característica del modelo, no le sirve de casi nada a la mayoría de los lectores. Una licencia MIT pura sobre un checkpoint que no puedes hacer funcionar es una licencia para admirar.
En qué es realmente bueno
El dato más útil de toda esta review no es un benchmark. Es el testimonio de un desarrollador que hizo pasar 3.600 millones de tokens por el modelo durante los dos meses en que estuvo en OpenRouter como modelo sigiloso llamado owl-alpha:
I used this for over 3.6 billion tokens when it was owl-alpha on Openrouter (with Hermes Agent). It was a very good experience.
It's not as 'smart' as other frontier models when it comes to benchmark style tests (one shots, riddles, etc) but it was very good at (1) following instructions, (2) making a plan, (3) following that plan, and (4) staying coherent at very high contexts. I built a number of apps from start to finish and it performed very well.
Esa es una descripción precisa de un buen modelo agéntico y un modelo de chat mediocre, y coincide con el segundo testimonio práctico más relevante, de alguien que compró un paquete de tokens tras el lanzamiento:
As an aside, I also nabbed a 50m token pack for LongCat 2.0 to give it a whirl. Not free, but it's so cheap they're basically giving it away. Very impressed too [...] Not frontier-level intelligence, but a dependable workhorse that can navigate a codebase well and can reliably execute what you tell it to do.
Dos usuarios independientes, con dos meses de diferencia, usando rutas de acceso distintas, llegan al mismo veredicto: ejecutor fiable, no un genio. Eso es más valioso de saber que cualquier diferencia en SWE-bench, y es el perfil que quieres si estás construyendo agentes de codificación personalizados donde el harness piensa y el modelo trabaja.

Vale la pena señalar la advertencia que planteó el mismo usuario, porque cambia cómo hay que leer la tabla de benchmarks: LongCat 2.0 no es un modelo de razonamiento. Sus puntuaciones se fijaron sin un presupuesto de pensamiento extendido, mientras que varios de los modelos con los que se compara sí lo tenían. Eso funciona en ambos sentidos, y es el tipo de asimetría que hace que las comparaciones entre proveedores en CLIs de codificación agéntica sean más difíciles de lo que sugieren los gráficos de marketing.
En qué no es bueno
La discrepancia es real y no voy a ocultarla. De alguien que lo usa en producción:
I was using Owl Alpha a lot for my project. Thats not gpt 5.5 level model. it not even close to flash 2.5 model - its not gollowing promts.
Y una más contundente, específica sobre código:
I have been trying to use longcat 2 but its bad model, it cant follow orders for example. Its coding is terrible, buggy as hell, stay away. Deepseek is way better.
Ambos son comentarios con pocos votos y ambos contradicen los testimonios de alto volumen de tokens, así que los sopeso en consecuencia. Pero el patrón en todos ellos es consistente: la calidad de este modelo depende en gran medida del harness que lo maneja. Quienes reportaron éxito lo ejecutaban dentro de un bucle de agente real. Quienes reportaron fallos, en su mayoría, le escribían prompts directamente.
En cuanto al razonamiento, la prueba pública más comentada en Hacker News lo situó en tercer lugar:
Overall I rate Gemini Flash the best, Qwen 3.7 Plus an acceptable second, and LongCat-2.0. an ok'ish third, if you have nothing better.
Citaría eso con cuidado, porque la propia prueba fue cuestionada en el hilo por tres comentaristas distintos que argumentaron que la pregunta era tendenciosa o no tenía una única respuesta correcta. Es un solo prompt, no una evaluación.
Dos fallos de integración reportados el día del lanzamiento son más útiles que todo lo anterior. Un usuario no pudo hacer que funcionaran las llamadas a herramientas porque el modelo emite un wrapper <longcat_tool_call> que su harness no reconocía, y otro hizo una pregunta en inglés con la búsqueda activada y recibió las respuestas en chino. Ninguno de los dos es un problema de calidad. Ambos son del tipo que te hace perder una tarde entera.
Los benchmarks, leídos con honestidad
Meituan publica SWE-bench Pro, no Verified, y ejecutó los números internamente en Claude Code con un sandbox 4c8g a temperatura 1.0, afirmando que "corrigieron tareas problemáticas". Aquí está el panorama, con el origen de cada puntuación indicado, porque las diferencias de pocos puntos son ruido:
| Modelo | SWE-bench Pro | Quién lo ejecutó | Nota |
|---|---|---|---|
| Claude Fable 5 | 80.0 | reportado por OpenAI | no aparece en una página de Anthropic |
| Claude Opus 4.8 | 69.2 | reportado por cuatro proveedores | la cifra más consistente del conjunto |
| Qwen3.8-Max | 67.7 | Qwen, internamente | también afirma haber corregido el conjunto de tareas |
| GPT-5.6 Sol | 64.6 | OpenAI, internamente | n/a |
| GPT-5.6 Terra | 63.4 | OpenAI, internamente | n/a |
| GPT-5.6 Luna | 62.7 | OpenAI, internamente | n/a |
| GLM-5.2 | 62.1 | Z.ai, OpenHands, contexto de 400K | prompt adaptado a medida |
| LongCat 2.0 | 59.5 | Meituan, internamente, Claude Code | sin modo de razonamiento; conjunto de tareas corregido |
| GPT-5.5 | 59.4 | OpenAI, internamente | la propia ficha de LongCat indica 58.6 |
| MiniMax-M3 | 59.0 | MiniMax, internamente | n/a |
| DeepSeek-V4-Pro (Max) | 55.4 | DeepSeek, internamente | casi gemelo arquitectónico de LongCat |
| Gemini 3.1 Pro Preview | 54.2 | reportado por OpenAI | n/a |
| DeepSeek-V4-Flash (Max) | 52.6 | DeepSeek, internamente | modelo de 284B |
Leído sin rodeos: un 59.5 sitúa a LongCat 2.0 al nivel de GPT-5.5 del año pasado, unos puntos por detrás de GLM-5.2 y de toda la familia GPT-5.6, y unos diez puntos por detrás de Opus 4.8. Supera a su gemelo arquitectónico más cercano, DeepSeek V4 Pro, por cuatro puntos, que es la comparación que realmente haría.
Hay dos cosas que la tabla no muestra. El propio conjunto de comparación de Meituan no incluye ningún rival de weights abiertos, algo que r/LocalLLaMA notó de inmediato:
I don't know why they won't line up their benchmark to other Chinese and open models, you know, they have DeepSeekV4Pro, KimiK2.7-Coder, GLM5.2, MiniMaxM3, Qwen3.5-397B, MiMoV2.5-Pro.
Es una crítica justa. Un proveedor que solo se compara con modelos a los que gana te está diciendo dónde decidió colocarse. Y Meituan no publica ninguna puntuación de SWE-bench Verified, así que cualquier comparación con la franja de 79 a 81 que reportan DeepSeek V4 y MiniMax en Verified no es una comparación que se pueda hacer.
El precio es la columna más fuerte, con una salvedad
| Lista | Promo | Cambio | |
|---|---|---|---|
| Entrada, sin caché | $0.75 / 1M | $0.30 / 1M | -60% |
| Lectura de caché | $0.015 / 1M | $0.006 / 1M | -60% |
| Salida | $2.95 / 1M | $1.20 / 1M | -59% |
Dos detalles de la página de precios importan más que el titular. Primero, no hay escalonamiento de precio por longitud de contexto en ningún tramo, algo inusual: Gemini, GPT-5.6 y MiniMax suben el precio a partir de un umbral, y aquí una solicitud de 200K tokens cuesta lo mismo por token que una de 2K. Segundo, el precio de escritura en caché no aparece en la página, lo que no es lo mismo que gratis.
La salvedad es la propia promoción. Está etiquetada como algo por tiempo limitado sin fecha de fin publicada. Al precio de lista, el modelo es más caro que los $0.435 y $0.87 de DeepSeek V4 Pro para lo que, sobre el papel, es el mismo tipo de modelo: 1.6T en total, alrededor de 48 frente a 49 mil millones de parámetros activos, licencia MIT. Así que todo el argumento de coste depende de un descuento que el proveedor puede terminar cuando quiera. Alguien en Reddit ya había fijado el umbral antes del lanzamiento, y la promoción lo superó:
as long as it stays below .40 input and .80 output it will have a use.
Nótese que, al precio de lista, no lo supera. Y la frase "el modelo de contexto de 1M más barato", que circuló en el lanzamiento, se corrigió en el hilo casi de inmediato, porque DeepSeek V4 Flash cuesta $0.14 y $0.28. Si tu único criterio es el precio por token, LongCat 2.0 no es el ganador ni siquiera dentro del campo chino de weights abiertos. Para el campo más amplio, las páginas de precio de GPT-5.6 y precio de Claude Opus 5 marcan el techo, y el precio de Kimi K3, de $3 y $15, demuestra que los weights abiertos y los tokens baratos no siempre van de la mano.
Tres muros que el marketing no menciona
La ventana de contexto es de 256K, no de 1M
Todos los artículos de lanzamiento dicen 1M. El config.json desplegado en Hugging Face limita max_position_embeddings a 262.144, con YaRN previsto hasta 983.040 por detrás de ese límite. La API alojada añade un tope de salida separado de 131.072 tokens, y max_tokens cuenta contra tu contexto. Así que la cifra honesta es 256K de entrada, 128K de salida, y la cifra de 1M describe los datos de entrenamiento.
Esto es una brecha más pequeña de lo que parece, ya que 256K es mucho, pero es la diferencia entre "entra en el monorepo" y "no entra". Si el contexto largo es tu requisito real, compara cómo se comporta en la práctica la ventana de contexto de Claude Code en lugar de fiarte de una hoja de especificaciones.
El contrato de herramientas no está escrito
Esta es la nota que más me sorprendió. La referencia de la API publica un puñado de parámetros de solicitud y ningún array tools en el esquema del cuerpo, ni en formato OpenAI ni en formato Anthropic. No hay tool_choice, ni parallel_tool_calls, ni stop_sequences, ni metadata, y content está documentado como una cadena de texto simple, así que no hay bloques de contenido, ni imágenes, ni tool_result. temperature va de 0 a 1 en lugar del 0 a 2 de OpenAI, lo que recortará silenciosamente las solicitudes portadas de otro proveedor.
La página de "herramientas" de la plataforma no es en absoluto un catálogo de herramientas. Es una lista de compatibilidad de doce clientes de codificación de terceros que puedes apuntar hacia la API. No hay búsqueda web del lado del servidor, ni interpretador de código, ni almacén de recuperación, ni superficie MCP, ni bucle de agente alojado. Todo lo agéntico ocurre del lado del cliente por diseño. Es una arquitectura legítima, y es la misma apuesta de "trae tu propio harness" que GPT-5.1-Codex-Max en otra forma, pero significa que la historia de IA agéntica de este modelo es enteramente la historia de tu harness.
No hay paper, y apenas hay repositorio
meituan-longcat/LongCat-2.0 en GitHub es un README, una licencia y tres figuras, alrededor de 1 MB, cero releases. Los weights están en Hugging Face. No hay informe técnico, solo una entrada de blog, lo que significa que las dos nuevas piezas de arquitectura no tienen metodología publicada. La ficha del modelo omite model_type, así que AutoModel de Transformers falla directamente, y SGLang es el único motor, con su PR de soporte cerrado sin fusionar y una wheel nightly requerida.
Para un modelo cuyo argumento de venta es la apertura, eso es escaso. La comparación que lo deja claro es la propia Hugging Face: 3.240 descargas al mes y cero proveedores de inferencia en el hub no es la huella de un modelo que la gente esté desplegando.
La nota que detiene a los compradores empresariales
Aquí está el hallazgo que pondría delante de cualquier revisor de seguridad. Las preguntas frecuentes de la plataforma de Meituan callan sobre la retención de datos, el entrenamiento con prompts, la residencia de datos y el SLA. La palabra "entrenamiento" no aparece en ninguna parte.
Ese silencio no es un tecnicismo. Es exactamente la pregunta que hace todo comprador, y la escucho en casi todas las llamadas. Un evaluador técnico de una empresa de hardware B2B con quien hablé en marzo no quería avanzar hasta tener una respuesta clara sobre si la IA podía acceder fuera de su base de conocimiento aprobada; otro comprador, sujeto a una revisión interna de seguridad, necesitaba una garantía por escrito de que los datos de tickets con números de tarjeta y contraseñas se quedaran dentro de su entorno. No son peticiones exóticas. Son el mínimo. Una página de proveedor que no menciona la retención no puede superar ese mínimo, sea cual sea su puntuación en los benchmarks.
Los desarrolladores llegaron a la misma conclusión de forma independiente. Uno se saltó el modelo por completo durante su periodo sigiloso gratuito por motivos de política, y luego descubrió lo que se había perdido:
Wait, this is Owl Alpha? Now I wish I had tried it when it was available. I stayed away from it back then because of their privacy policy
Y el rodeo por OpenRouter no lo soluciona, solo documenta la exposición: AtlasCloud es el único proveedor, no tiene ningún distintivo de retención de datos cero, y su política indica 7 días de retención de contenido. Si estás en medio de una revisión de SOC 2 y GDPR, o cerca de los requisitos de IA compatible con HIPAA, ahí termina todo. Autoalojarlo es la única vía que elimina la pregunta, y autoalojarlo significa ocho B300.
Para ser justos con el modelo, nada de esto dice que Meituan haga algo indebido con tus datos. Dice que Meituan no ha publicado qué hace. Para un proyecto personal, esa distinción no importa. Para un pipeline de automatización de atención al cliente que maneja tickets reales, es toda la decisión.
Quién debería usarlo
Buen ajuste. Desarrolladores independientes y equipos pequeños que hacen codificación agéntica de alto volumen dentro de un harness que controlan, donde los tokens son el coste que importa y los datos no son sensibles. Conversión de documentos, scraping, navegación por bases de código, refactorizaciones largas. La capacidad de seguir instrucciones y la coherencia en contextos largos son reales, y a $0.30 por millón de tokens de entrada la cuenta es difícil de rebatir. Si estás explorando agentes de IA de código abierto o eligiendo un modelo para trabajo de optimización de LLM, merece estar en la lista.
Mal ajuste. Cualquiera que necesite calidad de razonamiento en una sola pasada, un contrato de function calling documentado, una ventana real de 1M, un método de pago con tarjeta o una respuesta por escrito sobre el tratamiento de datos. Eso cubre a la mayoría de compradores empresariales, y a todos los casos de uso de mejor agente de IA para atención al cliente en los que trabajo. No porque el modelo sea malo, sino porque un modelo en bruto es la unidad de compra equivocada para una cola de soporte. El modelo es quizás el 20% del problema; la recuperación de información, el anclaje, las reglas de escalada, los guardrails y las pruebas son el otro 80%, y nada de eso viene incluido en un checkpoint. Es la misma conclusión a la que llego en construir o comprar IA de soporte, y la razón por la que la cifra de coste por resolución se mueve mucho menos con el precio del token de lo que la gente espera.
Prueba eesel
Leer una review como esta es en realidad un intento de responder a otra pregunta: ¿esto va a darle una respuesta equivocada a mis clientes? El precio por token no te lo dice. La alucinación de IA no es una línea en una página de precios.
Ese es el problema en el que trabajo. eesel simula tu agente de IA contra tus propios tickets históricos antes de que responda a un cliente real, así que ves las respuestas que habría enviado, sobre tus preguntas reales, con tu base de conocimiento real detrás. Cada respuesta queda registrada, es revisable y reversible, y tú decides exactamente qué temas puede tocar. Se conecta a tu stack de IA de helpdesk existente en unos minutos, y la elección del modelo pasa a ser problema de eesel, no tuyo. Gratis para probar.

El veredicto
LongCat 2.0 se gana una recomendación para exactamente un trabajo: codificación agéntica barata y de alto volumen en un harness que tú controlas, con datos que no te importa que salgan de tu edificio. Al precio promocional es una de las mejores opciones de valor por token en su categoría, la licencia MIT es real, y los testimonios prácticos de quienes le han hecho pasar miles de millones de tokens son más positivos que su fila en la tabla de benchmarks.
Todo lo que bloquea una recomendación más amplia es una carencia de documentación, no de modelado: una cifra de contexto que no coincide con la configuración, un contrato de function calling que nunca se publicó, una promoción sin fecha de fin, y una política de datos que no existe. Meituan podría cerrar las cuatro con una semana de redacción. Hasta que lo haga, es un gran modelo para experimentar y uno difícil de poner en producción.
Si tu objetivo real es IA en una cola de soporte y no un agente de codificación, empieza en cambio por el mejor LLM para atención al cliente, y trata al modelo como lo último que eliges, no lo primero.
Frequently Asked Questions
¿LongCat 2.0 es realmente bueno?
¿Qué concluye esta review de LongCat 2.0 sobre el precio?
¿LongCat 2.0 tiene realmente una ventana de contexto de 1M?
config.json en Hugging Face limita max_position_embeddings a 262.144, así que la ventana de contexto real que se sirve es de 256K. La cifra de 1M describe los datos de entrenamiento. La salida tiene un límite aparte de 131.072 tokens.¿Cómo se compara LongCat 2.0 con Kimi K3 y Qwen3.8-Max?
¿Puedo ejecutar LongCat 2.0 en local?
¿Es seguro usar LongCat 2.0 para atención al cliente?
¿Cuál es la mejor alternativa a LongCat 2.0 para equipos de soporte?
¿LongCat 2.0 admite llamadas a herramientas y MCP?
tools en el esquema del cuerpo de ninguno de los dos endpoints, ninguna superficie MCP, y los usuarios del día de lanzamiento reportaron un wrapper no estándar <longcat_tool_call> que sus harnesses no podían interpretar. El uso de herramientas es posible a través de clientes, pero no es un contrato documentado.
Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








