LongCat 2.0とは:Meituanの1.6Tオープンウェイトモデルを徹底解剖

Rama Adi Nugraha
執筆者

Rama Adi Nugraha

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 6, 2026

専門家による検証済み
サーバーラックの隣でデスクいっぱいに伸びた長い猫と、LongCatのロゴを描いたイラスト

LongCat 2.0の実像

Meituanは中国のフードデリバリー・ローカルサービスの大手企業で、LongCatはその社内モデルチームだ。LongCat 2.0はLongCat-Flashラインの後継として2026年6月30日に登場し、Meituanはその1か月前に6つのFlashモデルを退役させて場所を空けていた。

モデルカードによれば、アーキテクチャは1.6兆パラメータのmixture of expertsで、トークンあたり約480億パラメータが活性化する。LongCat-Flash-Liteから継承した1350億のN-gram埋め込みパラメータも搭載しており、Meituanはこれを、MoEのルーティングとは直交するスパースな次元に沿って容量を拡張するものだと説明している。事前学習は35兆超のトークンにわたって「数百万アクセラレータ日」規模で行われ、ロールバックや回復不能な損失スパイクは一度もなかったという。

アーキテクチャ面での目玉はLongCat Sparse Attentionで、MeituanはこれをDeepSeek V3.2で使われているLightning Indexerにある2つの明示的な問題への対処だと位置づけている。出力の不連続性と、二次関数的なスコアリングのボトルネックだ。仕組みは3つの要素からなる。Streaming-aware Indexingは連続したメモリ読み出しに合わせてトークン選択の予算を再構成する。Cross-Layer Indexingは隣接する2つの層で1回のインデックス処理を再利用する。Hierarchical Indexingは細かいトークン選択の前に粗いブロック単位の再取得を行う。

3つ目のHierarchical Indexingについては注釈が必要だ。以前のデプロイ用ドキュメントには「簡略化のためサポートしていない」と書かれていたが、コミット5ced4dbはその一文を、具体的な起動手順を記した他の41行とともに、修正するのではなく削除した。一方で発表記事は別途、この機能は「一部の超長文コンテキストタスクで有効になっている」と述べており、すべてのリクエストで有効というわけではない。

LongCat 2.0について発表された4つの主張と、実際に公開されたファイルが示す内容の対比:100万トークンのコンテキストに対して256Kという設定上の上限、GitHub上のオープンウェイトに対してREADMEのみのリポジトリ、標準的なGPUに対して8基のB300、技術レポートに対してブログ記事という構成
LongCat 2.0について発表された4つの主張と、実際に公開されたファイルが示す内容の対比:100万トークンのコンテキストに対して256Kという設定上の上限、GitHub上のオープンウェイトに対してREADMEのみのリポジトリ、標準的なGPUに対して8基のB300、技術レポートに対してブログ記事という構成

私はここ数年、eeselでインテグレーションやAPIの接続部分を作り続けてきたので、こういう発表があるとまず発表文を読み飛ばして、いきなりファイルそのものを見に行くのが習慣になっている。今回はその習慣で4つの主張が持ちこたえられなかった。

100万トークンのコンテキストウィンドウは、設定上は256K

Meituanは公式READMEでネイティブ100万トークンのウィンドウを宣伝しており、変更履歴も同じことを繰り返している。しかし公開されたconfig.jsonではmax_position_embeddingsが262,144に設定されている。YaRNはこの上限の先、983,040まで用意されているため、100万という数字は公開された設定が実際に提供する内容ではなく、モデルが学習された規模を表していると考えられる。

Meituan自身のホスト型APIには、もう一つの上限がある。出力トークンの最大値は128Kで、max_tokensはコンテキストウィンドウに対して消費される扱いだ。これはスキャンダルというほどのものではなく、どの尺度で見ても256Kは大きなウィンドウだ。ただ、マーケティングで謳われている数字とは違う。

GitHubリポジトリの実態はREADMEのみ

github.com/meituan-longcat/LongCat-2.0にはREADME.mdLICENSE、3枚の画像が入ったfigures/フォルダしかない。それがリポジトリの全体で、サイズは約1MB、言語は検出されず、タグやリリースもゼロだ。ウェイトはHugging Face上にあり、推論はSGLangで行われ、評価用ハーネスや参照実装はどこにも存在しない。

論文もない。Meituanは発表用のブログ記事を公開しただけで、それ以上は何もなく、コミュニティはすぐにそれに気づいた。

"The description of LSA and N-Gram in that blog is imo quite surface-level. Thats why i was asking whether there is/will be a full paper."

このスレッドは7月5日から開いたままで、meituan-longcatの誰からも返信がない。姉妹モデルであるLongCat-Flash-Omniのリリースには実際に論文が付いていたので、これは能力上の限界ではなく選択の結果だ。

まともに動くTransformersの経路がない

公開されたconfig.jsonにはmodel_typeキーがなく、そのためAutoConfigAutoModelForCausalLMはどちらも失敗する。手に入るのはトークナイザーだけで、それ以外は何もない。これは未解決のissue #4として報告されており、確認した時点でも未解決だった。

SGLangが唯一サポートされているエンジンだが、それすら扱いが荒い。cookbookの記事ではnightlyビルドのwheelをインストールするよう指示されており、その理由はSGLangのPRがマージされずにクローズされたからだ。vLLM向けの経路もTensorRT-LLM向けの経路もない。

ハードウェアの話を、Meituan自身の言葉と照らし合わせる

これは発表の中で最も広く伝わった部分であり、報道と一次資料の食い違いが最も大きい部分でもある。

チップの枚数自体は本物だ。Meituanは発表記事の中で明確にそう書いている。

"LongCat-2.0 is pre-trained on over 50K AI ASICs, introducing significant system-level challenges due to both model and cluster scale. We address these challenges through systematic optimizations, achieving over 35% training throughput improvement while also enhancing reliability compared to a naive implementation."

その記事に書かれていないのは、その後で語り直された話の残りの部分だ。「国内(domestic)」「中国(China)」「Chinese」という言葉は一度も出てこない。チップベンダーの名前は、Huawei、Cambricon、Hygonのいずれも挙がっておらず、社内製の型番も出てこない。Meituan自身の表現は「代替のハードウェアプラットフォーム」だ。Nvidiaという名前はちょうど2回登場するが、いずれも否定ではなく参照点としてだ。一度は「成熟したNvidia GPUのエコシステムと比べると、対応するソフトウェアコミュニティはまだ発展が進んでいない」という文脈で、もう一度は「われわれのアクセラレータはH800(80GB)よりデバイスあたりのメモリがかなり少ない」という文脈でだ。

Nvidia以外のハードウェアだと読むのは自然な解釈ではある。ただ、それはあくまで解釈にすぎない。Hacker Newsのスレッドで議論の起点になったAscend 910Cという特定は、Meituan自身ではなく、あるコメント投稿者によるものだ。

Hacker News

"This is the real news story. It looks like they may have used Huawei Ascend 910C chips"

このスレッドは281ポイント、88コメントまで伸び、その中で最も鋭い反論は真偽ではなく規模についてのものだ。

Hacker News

"1024 Huawei Ascend superpods = 50K 910C chips.

That is a tiny tiny system. OpenAI uses milions of GPUs for training"

Meituan自身の数字にも、もう一つ引っかかる点がある。ある一文には「5万枚超のAI ASIC」とあり、別の節には「数万個のAI ASICスーパーポッド」とあり、記事はスーパーポッドを「最大48台のマシン」と定義している。両方が文字通り正しいということはあり得ない。数字を引用するなら、事前学習について述べた一文、つまり正確な方を引用すべきだ。

Owl Alphaとして過ごした2か月間

発表される前、LongCat 2.0はowl-alphaという無料のステルスモデルとしてOpenRouter上で静かにトラフィックを処理していた。おおよそ2026年4月末から始まり、Meituanが発表記事を公開した6月30日に取り下げられている。Meituanはこれを一度も公表しておらず、モデルカードにも発表記事にもOwl Alphaへの言及は一切ない。

それでもコミュニティは正体を突き止め、その証拠は今もRedditに残っている。最初の手がかりは地政学的なものだった。元のステルスモデルのスレッドで最も評価されたコメントがこれだ。

Reddit

I think I can confirm Chinese model, it affirmed that Taiwan is part of China.

その後、誰かが両方のエンドポイントを並べて試した。

Reddit

I am ABSOLUTELY certain it's Longcat. I tried both the Longcat 2.0 preview via the Longcat API and the Owl Alfa via Openrouter.

It has the same 10-second response time, the same dialogue, and both has 1M of context

Meituan自身のドキュメントの中に、この裏付けとなる小さな痕跡が一つ隠れていて、私はこの文書一式の中でこれが一番気に入っている。APIリファレンスページに載っている公式のreasoning_contentの例では、モデルが自分自身を「OWL」と呼んでいる。誰も片付け忘れたシステムプロンプトの名残だ。

このステルス運用のことを取り上げるのは、それによってレビューの読み方が変わるからだ。このモデルについて多くの人が実際に触った経験は、何を試しているのか誰も知らない状態で、実験用のハーネス上で無料で積み上げられたものだ。ユーザーからのフィードバックとしてはかなり珍しく素性の良いものであり、以下で紹介する感想が発表初日の印象ではないことを意味している。

ベンチマークが語っていること、語っていないこと

Meituanは6つの比較対象モデルに対して10行分のベンチマークを公開している。ただし、そのカード自体にも注記がある。アスタリスクの付いていないスコアはすべて自社内で測定したもので、競合モデルのスコアの大半は各ベンダー自身の報告からそのまま引用したものだ。つまり、これは一つの統一された条件下での実験結果ではない。

SWE-bench Proのスコアを示す横棒グラフ:Claude Opus 4.8が69.2、Claude Opus 4.7が64.3、LongCat 2.0が59.5、GPT-5.5が58.6、Gemini 3.1 Proが54.2で、「前世代には勝つが今世代には勝てない」という注記付き
SWE-bench Proのスコアを示す横棒グラフ:Claude Opus 4.8が69.2、Claude Opus 4.7が64.3、LongCat 2.0が59.5、GPT-5.5が58.6、Gemini 3.1 Proが54.2で、「前世代には勝つが今世代には勝てない」という注記付き
BenchmarkLongCat 2.0Gemini 3.1 ProGPT-5.5Claude Opus 4.7Claude Opus 4.8
Terminal-Bench 2.170.870.773.871.778.9
SWE-bench Pro59.554.258.664.369.2
SWE-bench Multilingual77.376.9-80.584.8
FORTE73.270.377.877.677.2
BrowseComp79.985.984.479.384.3
RWSearch78.876.385.379.377.3
IFEval90.096.195.088.786.0
Writing Bench83.883.784.785.385.2
IMO-AnswerBench81.890.079.581.875.3
GPQA-diamond88.994.393.694.292.4

列を縦に読んでいくと、傾向ははっきりしている。LongCat 2.0はコードエージェント関連の3行すべてでGemini 3.1 Proを上回り、SWE-bench Proでは0.9点差でGPT-5.5もわずかに上回る。一方で、Claude Opus 4.8がスコアを出している行すべてで4.8に負けている。SWE-bench Proでは9.7点差、Terminal-Bench 2.1では8.1点差だ。私の見立てはこうだ。これは前世代には勝つが現行世代には勝てない、本物のフロンティア級に近いコーディングモデルだということだ。

この表を引用する前に、フラグを立てておくべき点が2つある。Meituanは「問題のあるタスクを修正した」状態でSWE-benchを実行したと述べており、RWSearchは「社内の独自ベンチマーク」と説明されているため、10行のうち2行は部分的にMeituan自身の測定器によるものだ。そして比較対象には、オープンウェイトの競合が一つも含まれていない。DeepSeekも、Qwen3.8 Maxも、Kimi K3も、GLM-5.2も入っていない。これらこそ、オープンウェイトを選ぶチームが実際に比較検討している相手だ。

もう一つ、ここで訂正しておきたいことがある。広く流通している話なので触れておく。AnthropicはClaude Opus 5やSonnet 5についてSWE-benchのスコアを公表していない。69.2という数字はOpus 4.8のものだ。もしOpus 5に69.2という数字が結び付けられているのを見たら、それは誤りだ。

実際に使ってみた人たちの声

評価は大きく分かれており、これは少数の不満を伴う大勢一致の勝利ではなく、本当に意見が対立している状態だと正直に言っておきたい。おおまかな傾向としては、ハーネスの中でエージェントとして動かした人は好意的に評価し、頭の良いモデルとして評価した人は低く評価する、という構図だが、この傾向はきれいには成立していない。少なくとも一人、コード専用に使っていた開発者は「バグが多い、避けたほうがいい」と評している。

これまでで一番内容の濃いレポートは、無料のステルス期間中にこのモデルへ36億トークンを流し込んだという人物のものだ。

Reddit

I used this for over 3.6 billion tokens when it was owl-alpha on Openrouter (with Hermes Agent). It was a very good experience.

It's not as 'smart' as other frontier models when it comes to benchmark style tests (one shots, riddles, etc) but it was very good at (1) following instructions, (2) making a plan, (3) following that plan, and (4) staying coherent at very high contexts. I built a number of apps from start to finish and it performed very well.

発表後にトークンパックを購入した人も、同じような結論に達している。

Hacker News

"Not free, but it's so cheap they're basically giving it away. Very impressed too... Not frontier-level intelligence, but a dependable workhorse that can navigate a codebase well and can reliably execute what you tell it to do."

そして最も鋭い異論は、実際に本番環境で使っている人物から、この発表が作り出した枠組みに真っ向から反発する形で出ている。

Reddit

I was using Owl Alpha a lot for my project. Thats not gpt 5.5 level model. it not even close to flash 2.5 model - its not gollowing promts.

全体を通した私の見立てはこうだ。「頼れる作業馬」というのが誠実な評価で、これはベンチマーク表とも、何十億トークンも使い込んだ人たちの声とも一致している。指示に従う能力と長いコンテキストでの一貫性は繰り返し強みとして挙がる。純粋な推論力についてはそうした声はなく、コード品質は決着がついていない論点のままだ。

もう一つ拾っておきたい反応がある。私がずっと引っかかっている点をわざわざ価格に結び付けているのを見たのは、これが唯一だったからだ。

Reddit

Wait, this is Owl Alpha? Now I wish I had tried it when it was available. I stayed away from it back then because of their privacy policy

これはポリシーを読んで判断を下し、その結果、まともなモデルへの2か月分の無料アクセスを失った開発者だ。その判断が正しかったかどうかは、当時何を投げ込むつもりだったかに完全に依存する。

料金:実際の一覧表

Meituanは定価と発売時割引の両方を公開している。割引欄には「期間限定」と書かれているが、終了日はどこにも記載がなく、中国語版のページではこれをプラットフォームの初回リリースに向けたローンチオファーと呼んでいる。両方の通貨はFX換算ではなく、それぞれ別々に設定された価格だ。

ItemList USD / 1MPromo USD / 1MList CNY / 1MPromo CNY / 1M
Uncached input$0.75$0.30¥5¥2
Cached input (read)$0.015$0.006¥0.10¥0.04
Output$2.95$1.20¥20¥8
Cache writenot publishednot publishednot publishednot published
Context tieringnone, flat rate to 1M inputnonenonenone

この表の中には、見出しの数字よりも興味深い点が2つある。

まず、コンテキスト長による段階課金が一切ない。私が確認した他の100万トークンウィンドウのモデルはすべて、ある閾値を超えると値段が上がる。Gemini 3.1 Proの料金は200Kを超えると倍になり、GPT-5.6 Solは272Kを超えると倍になり、MiniMax-M3は512Kを超えると倍になる。LongCat 2.0はフラットレートで、これは長いコンテキストを使う作業にとって不釣り合いに安くなることを意味する。この料金ページの中で、いちばん報道されていない事実がこれだ。

フラットな価格設定が解決しないことにも触れておく価値がある。同じ答えに至るのにより多くのトークンを必要とするモデルは、単価が安くても実質的には安くない。これはあらゆる見出し比較に潜む罠だ。GPT-5.6の料金を検討していたときに私自身も同じ落とし穴に引っかかった。この落とし穴はGemini 3.6 Flashの料金にも、そしてこのモデルにも同じくらい強く当てはまる。

そしてキャッシュされた読み取りは、キャッシュされていない入力の50分の1のコストで、これはレスポンスの本体を見るまでは魅力的に見える。OpenAI互換パスにはprompt_tokens_details.cached_tokensフィールドがなく、Anthropic互換パスにもcache_read_input_tokensがなく、cache_controlパラメータで制御する手段もない。キャッシュは完全に暗黙的に処理され、実際に何に対して課金されたのかを検証することができない。

Meituanの免責事項はそのまま引用しておく価値がある。「価格は変更される場合があります。LongCat APIプラットフォームに表示される価格およびお客様の請求記録が正式なものとなります。」

実際にどう比較になるか

ここからは、プロモ価格が仕事の大半を担う部分だ。自分の数字を入力してみてほしい。

数字をしばらく動かしてみると、その構図がはっきり見えてくる。プロモ価格ではLongCat 2.0はOpus 5のおよそ20分の1、Sonnet 5の料金のおよそ5分の1で、これが発表日に誰もが比較していた対象だ。

次にキャッシュのスライダーを上げていくと、キャッシュヒット率がおよそ80%を超えたところで、プロモ価格のLongCat 2.0をDeepSeek V4 Proが逆転する。理由は、DeepSeekのキャッシュ読み取りが0.003625ドルで、LongCatの0.006ドルより安いからだ。キャッシュされていない入力が安いことと、本番環境で安いことは同じではないし、リポジトリ規模のエージェント作業はまさにキャッシュヒット率が高くなりやすいワークロードだ。

定価で見ると構図は逆転する。入力0.75ドル、出力2.95ドルは、DeepSeek V4 Proの0.435ドルと0.87ドルよりも高く、しかもDeepSeek V4 ProはLongCat 2.0のアーキテクチャ上いちばん近い双子だ。総パラメータ1.6兆、アクティブ490億、コンテキスト100万、そしてMITライセンスという点まで共通している。入力コストではGPT-5.6 Lunaの0.20ドルにも負けており、これはクレジットカードで支払えるホスト型のプロプライエタリモデルだ。つまりプロモ価格こそが価格ストーリーのすべてであり、そのプロモには終了日が公開されていない。

見出しの数字が隠しているもう一つのコスト倍率がある。reasoningはデフォルトで有効になっており、reasoningトークンは出力レートで課金される。OpenRouter自身の使用状況パネルでは、このモデルで発生した216万の完了トークンのうち203万がreasoningトークンだった。出力に払っている金額のおよそ94%は、返ってくる答えそのものではなく、モデルが「考えている」部分に対する支払いだ。これはreasoningモデルとしては普通のことだが、それでも請求書で発見するのではなく、事前に予算に入れておきたい数字だ。Opus 5とSonnet 5を比較する作業を一度でも通した人なら、これがタスクあたりのコストをどれだけ動かすか、すでに実感しているはずだ。

実際にあなたを止めるであろう部分

Meituanが文書化している決済手段は正確に2つで、いずれも返金ルールの中にしか登場しない。WeChatとAlipayだ。カードもPayPalも銀行振込もない。セルフサービスでの請求書発行は「中国本土のユーザーのみ」利用可能で、それ以外の全員はメールでチームに連絡する必要がある。

登録自体はオープンで、中国本土以外のユーザーもメールアドレスでサインアップできる。しかしアカウントに資金を入れる方法は別問題で、残高がゼロになるとAPIはリクエストを拒否する。プリペイド方式の代替であるToken Packsは、北京時間の10:00、16:00、21:00、23:00に在庫限定のフラッシュセールとして販売され、30日間で失効する。

したがって、中国国外のほとんどのチームにとって現実的な選択肢はOpenRouterであり、これがこのモデルの公開トラフィックがMeituan自身のプラットフォームよりもコーディング用ハーネス経由に流れている理由の一つだ。そこのトレードオフについては、もう少し後で触れる。

API:パラメータは7つ、ツールはなし

私はこのAPIドキュメントを、実際に本番に組み込む前に読むのと同じ姿勢で読んだ。この節は、ベンチマーク寄りの意見がエンジニアリング寄りの意見に切り替わる場所だ。

用意されている面は2つ。OpenAI互換パスとAnthropic Messages互換パスで、どちらもapi.longcat.chat上にあり、同じベアラーキーを受け付ける。どちらのSDKでもベースURLを書き換えるだけの一行変更で済み、これはこのプラットフォームでいちばん気に入っている点だ。OpenAI、Anthropic、GeminiのAPIを比較したことがある人なら、これがどれだけ珍しいことか分かるはずだ。

そこから先は途端に薄くなる。サポートされているパラメータは合計7つだけで、max_tokenstemperaturetop_pstreamtoolstool_choicethinkingだ。stopシーケンスはない。seedもない。response_formatもJSONモードもない。logprobsもなく、nもなく、ペナルティ系のパラメータもなく、top_kもない。temperatureはOpenAIの0〜2ではなく0〜1の範囲で動くため、そのまま移植した設定が知らないうちに範囲外になることがある。thinkingは有効・無効の二択で、予算指定もeffortレベルの指定もない。

toolstool_choiceはパラメータ一覧に載っているが、どこにも文書化されていない。スキーマもなく、ツール呼び出しのレスポンス形式もなく、例もない。それにもかかわらず、変更履歴ではネイティブなツール呼び出しが宣伝されている。発表当日、その空白はまさに予想通りの場所で表面化した。

Hacker News

"I can't get any tool calls working. Seems to use a <longcat_tool_call> wrapper which the current harnesses I'm using don't support"

モデルカードは、これに関連するもう一つの破綻を認めている。LongCatはツール呼び出しのargumentsを、OpenAIのスキーマが規定するJSON文字列ではなく、辞書型として期待する。標準の形式に沿って書かれたものは、そのままでは動かず、変換用のシムが必要になる。

両方の互換レイヤーも、厳格なパーサーを壊すような形で微妙に形が違う。reasoningはOpenAI側ではmessage.reasoning_contentとして届くが、これはOpenAIのフィールドではなくDeepSeekのフィールドだ。Anthropic側では、正式なthinkingブロックとしてではなく、テキストコンテンツブロック内のthinkingキーとして届き、文書化されているSSEストリームにはcontent_block_startcontent_block_stoppingが含まれていない。

ホスト型のツールは一切ない。ウェブ検索も、コードインタプリタも、検索用のストアも、ファイル用のエンドポイントも、embeddingsも、バッチAPIもない。MCPについては一言も触れられておらず、サーバー側のエージェントループも存在しないため、エージェント型の振る舞いはあくまでモデルについての主張であり、それを実際に動かすのは完全にあなたのハーネス側の仕事になる。

Meituanが文書化しているのはクライアント側の連携だ。Claude Code、Codex、Cline、Kilo Code、OpenCode、Cherry Studioなど12件について、それぞれベースURLの書き換え方法が具体的に示されている。CursorとRooはそのリストに入っていない。すでにエージェント型コーディングCLIを日常的に使っているなら、これが最も抵抗の少ない導入路であり、実際このモデルの本当のトラフィックもそこに流れている。

レート制限は存在するが、数値は公開されていない。どこかに明記された唯一の具体的な数字は、429レスポンスの本体にあるretry_after: 60だけだ。失敗したリクエストには課金されないのはうれしい配慮で、従量課金の残高に有効期限はない。

この文書一式の中で私が一番気に入っている細部は小さなものだ。公式のreasoning_contentの例では、モデルが自分自身を「OWL」と呼んでいて、これは別のシステムプロンプトの名残だ。ドキュメントは慌てて書いた人間の手によるもので、それがそのまま出てしまっている。

セルフホスティング:立ちはだかる壁

フロンティア級のモデルにMITライセンスのウェイトが付くのは本当にありがたいことだが、それには誰がその恩恵を受けられるかを決めてしまうハードウェアの請求書が付いてくる。

LongCat 2.0の最小構成デプロイを比較する4枚のサーバーラック図:各288GBのB300は1ノードに8基のGPUで済むが、192GBのB200、141GBのH200、96GBのH20はそれぞれ2ノードに16基のGPUが必要。フッターには141個のFP8シャードとSGLangのnightlyビルド限定という注記
LongCat 2.0の最小構成デプロイを比較する4枚のサーバーラック図:各288GBのB300は1ノードに8基のGPUで済むが、192GBのB200、141GBのH200、96GBのH20はそれぞれ2ノードに16基のGPUが必要。フッターには141個のFP8シャードとSGLangのnightlyビルド限定という注記

Hugging FaceのblobAPIによれば、BF16版は194個のsafetensorsシャードにわたって3.55TBある。FP8版は141個にわたって2.05TBだ。SGLangのすべてのレシピはFP8を読み込む前提なので、3.55TBのマスターは提供用ではなく量子化の元データという位置づけであり、BF16には公開されたトポロジーが一切ない。

HardwareHBM per GPUGPUsNodesParallelism
NVIDIA B300288 GB81TP=8, EP=8
NVIDIA B200192 GB162TP=16, EP=16
NVIDIA H200141 GB162TP=16, EP=16
NVIDIA H2096 GB162TP=16, EP=16
Ascend Atlas A2not published1921264 prefill, 128 decode

8基のB300による構成だけがSGLangで検証済みとされている行で、その計算をたどると192GBのB200がなぜ2ノード必要になるのかが分かる。2.05TBのFP8ウェイトは8×192GBには収まらない。H20のレシピはさらに奇妙で、16×96GBは1,536GBにしかならず、2,051GBのウェイトに対して不足する。これはN-gramテーブルとMTPモジュールがHBMの外に置かれている場合にしか成立せず、それを明記したドキュメントはどこにもない。

さらにKVキャッシュの問題がある。トークンあたり43,776バイト、8基のB300で--mem-fraction-static 0.92という設定の場合、ウェイトを載せた後に残るKV用の余裕はおよそ69GBだ。これは256Kのフルウィンドウで同時に処理できるシーケンスがおよそ6本、あるいは平均24Kトークンのスロットが64個に相当する。コンテキストウィンドウと同時実行数は同じメモリを奪い合っているのであり、コンテキストが100万トークンの場合、64スロット分だけでKVに2,802GBが必要になり、これは2,304GBというプール全体を上回ってしまう。

コンシューマー向けのランタイムは完全に不可だ。llama.cppにはLongCatへのサポートがマージされておらず、どのバリアントにもGGUFが存在しないため、OllamaやLM Studioでは読み込めない。存在するコミュニティ製の量子化版もMLX専用で、まだマージされていないmlx-lmのPRが必要な上、最小のフルエキスパート版でも512GBあり、これは512GBのMacをそのまま超えてしまう。Hugging Faceのディスカッションタブは、基本的にひたすら同じ要望が続くだけの状態だ。

"GGUF Version please!!!"

r/LocalLLaMAのほうが反応は速く、ウェイト公開スレッドのトップコメントがいちばん的確にまとめている。

Reddit

Damn, that's a really long Cat!

3.55 TB in all its BF16 glory. 2.05 TB in FP8.

同じスレッドにある、もう少し冷静な言い換えがこうだ。オープンウェイトであることと、実際にアクセスできることは同じではない。4090や5090、あるいは96GBのRTX PRO 6000を持っている人にとって、このリリースは動かすものではなく読み物として消費するものだ。とはいえ、それが可能にするのはエコシステム側の作業、つまり検証、蒸留、コミュニティによる量子化版、そしていずれ普通のハードウェアでも実際に読み込めるLite版や蒸留版の派生モデルだ。

ダウンロード数もそれを裏付けている。直近1か月で3,240件、Hugging Face上で推論プロバイダーはゼロ、「Ask for provider support」をクリックした人は24人だ。1か月間コーディングモデルの話題を独占していたモデルとしては小さい数字であり、参入のハードルが8基のB300ノードであることを考えれば、まさに予想通りの数字でもある。ウェイトが無料であることは、推論も無料であることを意味しない。その点でHugging Faceの料金は、実際の費用がどこに落ち着くのかを確認する上で役に立つ現実チェックになる。

データがどこへ行くのか、それが本当の判断材料

もし私がリポジトリではなくサポートを運営する立場だったら、まずここを読むはずだ。そして、報告できることがあまりに少ないので、この節はいちばん短い。

MeituanのプラットフォームFAQは、データの保持期間について触れていない。プロンプトや生成結果が学習に使われるかどうかについても触れていない。「training(学習)」という単語はページ上に一度も出てこない。サーバーの設置国も記載されておらず、地理に関連する唯一の記述は、レイテンシーの見出しの下にある「サーバーの負荷と地理的な位置」という一文だけだ。SLAもなく、稼働率の数字もなく、サービスクレジットもなく、メールアドレス以外にエンタープライズ向けやプライベートデプロイへの道も示されていない。

だからといって何か悪いことが起きているというわけではない。ただ、質問への答えがないだけであり、セキュリティレビューにおいては「答えがない」こと自体が一つの答えになる。

OpenRouterを経由しても、この問題が完全に解決するわけではない。このモデルを提供しているプロバイダーはAtlasCloud一社だけで、「学習に使用しない」というバッジは付いているものの、ゼロデータリテンションのバッジは付いていない。一方、同じディレクトリページ上のNovitaAI、Tencent Cloud、FireworksにはいずれもZDRのバッジが付いている。AtlasCloud自身のポリシーでは、プロンプトや生成結果、APIペイロードを含む顧客コンテンツを最長7日間保持するとされており、ZDRは別途エンタープライズ向けの追加条項の中に置かれている。プロバイダーが一社しかない状態では、ZDRを条件に絞ったリクエストには行き場がない。

これが商業的にどれほど重要かについて、私は推測するまでもない。それはeeselの商談の中で毎週目にしていることだからだ。厳格な社内セキュリティレビューによって足止めされていたデンマークのB2Bテレマティクス企業の担当者は、カード番号やパスワードを含むチケットデータが自社の環境の外に出ないという保証がない限り、トライアルさえ始めようとしなかった。週に約1,000件のチケットを処理しているメディア企業では、クレジットカードやPII情報の削除が評価全体の中で最大の懸念事項となり、精度よりも価格よりも優先された。そうした場で私が伝える答えは具体的だ。顧客データがモデルの学習に使われることはなく、基盤となるモデルプロバイダーが不正利用の監視のために保持するデータは最長30日間であり、データはアカウントごとに分離されている。「学習」という言葉が一度も出てこないページについて、この答えを口にすることはできない

これはLongCat 2.0をコーディングモデルとして貶める話ではない。自分自身のリポジトリに向けるモデルと、他人の個人情報に向けるモデルとの違いの話だ。同じ関門は、私が見てきたあらゆるヘルプデスクAIの評価にも登場する。顧客のカード番号がプロンプトに含まれた状態での誤答は、あるコードパスについての誤答よりもたちの悪い種類のハルシネーションだ。

実際に使うべき人は誰か

もしあなたが自分でコントロールできるハーネスの中で、大量かつ長いコンテキストのコーディング作業をしていて、OpenRouterを通じて支払いができ、投げ込むコードが機密性の高いものではないのなら、LongCat 2.0は手を伸ばす価値がある。入力100万トークンまでフラットな価格設定は、リポジトリ規模のプロンプトにとって本物の優位性であり、MITライセンスには利用範囲の制限やユーザー数の上限もなく、「頼れる作業馬」という評価も、実際に人々が報告している内容にほぼ合っている。

一方で、JSONモードやstopシーケンス、文書化されたツール呼び出しの契約が必要な場合、8基のB300ノード未満でセルフホストする予定だった場合、あるいはデータ処理に関する質問票が購入プロセスの一部になっている場合は避けたほうがいい。オープンウェイトそのものを重視するなら、より低い定価で比較になるのはDeepSeek V4 Proで、GLM-5.2もMITライセンスだ。オープンウェイトにはこだわらず、単に安いトークンが欲しいなら、GPT-5.6 Lunaのほうが入力コストは安く、クレジットカードで決済もできる。踏み切る前に、この価格帯では見出しの料率と実際の請求額がどれだけ違ってくるかを知っておく価値があり、DeepSeek FlashとK3がタスク単位のコストでどう決着しているかを読んでおくといい。

そして、もしAIに顧客チケットへの対応をさせたいという理由でモデルを選んでいるのなら、私はそもそもモデルという層で買い物をしているのが間違いだと言いたい。それについては節を分けて話す価値がある。

Try eesel

トークンの価格を比較しながらここに来たのが、AIにサポートキューを任せたいという理由からなら、私が伝えたいのは、モデル選びはそのプロジェクトの中でいちばん簡単な、全体の5%程度の部分だということだ。難しいのは、AIが顧客に何を言うのかを、言ってしまう前に把握することであり、その後で自社のセキュリティチームにきちんと説明できることだ。

eeselは、すでに運用しているヘルプデスク、Zendesk、Freshdesk、Gorgias、Front、Help Scout、Salesforceに接続するAIチームメイトで、新しいナレッジベースを一から作る必要はなく、既存のチケットとヘルプセンターから学習する。モデルレイヤーはこちらで管理するので、発表記事が終了日未定の60%オフを謳うたびに、サポートスタックの料金設計をやり直す必要はない。何かを本番投入する前に、実際の過去チケットに対してエージェントをシミュレーションし、それが送っていたであろう回答を確認できる。これは、自信満々に見えるボットが静かに間違いを犯すのを見てきたうえで、私たちが作ったステップだ。そしてLongCatのFAQが答えないまま残している問いについても、こちらには具体的な答えがある。あなたのデータはモデルの学習に使われず、アカウントごとに分離されている。

eeselのセットアップフロー。3つのオンボーディングステップ、接続済みのZendesk連携、そしてヘルプデスク・Slack・Teamsのいずれから返信するか、あるいは共有可能なリンクを使うかを選ぶ画面を示す
eeselのセットアップフロー。3つのオンボーディングステップ、接続済みのZendesk連携、そしてヘルプデスク・Slack・Teamsのいずれから返信するか、あるいは共有可能なリンクを使うかを選ぶ画面を示す

ヘルプデスクを接続すれば、数分で最初の返信案が作られるところを見ることができ、タスク単位のeeselの料金によるセルフサーブプランにはシート課金もない。その前に全体像を確認したいなら、サポート向けに最適なLLMについての記事でトレードオフを扱っており、自社構築か購入かの記事では、GPUのコストまで含めて自前のスタックを運用するとどれだけかかるのか、実際の数字を示している。eeselを無料で試す、あるいはデモを予約して、いちばん手強いチケットを持ってきてほしい。

よくある質問

LongCat 2.0とは何ですか?
LongCat 2.0は、Meituanが2026年6月30日にMITライセンスで公開した1.6兆パラメータのmixture-of-experts型大規模言語モデルで、トークンあたり約480億パラメータがアクティブになる。チャットではなくエージェント型のコーディングやリポジトリ規模の作業を対象としており、その点でKimi K2.7 CodeGPT-5.1-Codex-Maxと同じ枠に入る。
LongCat 2.0の100万トークンあたりの料金はどのくらいですか?
Meituanの定価は入力100万トークンあたり0.75ドル、出力100万トークンあたり2.95ドルだが、終了日未定の発売プロモーションにより現在は0.30ドルと1.20ドルに割引されている。これはOpus 5の料金を大きく下回るが、定価ではDeepSeek V4 FlashとそのPro版よりも高い。
LongCat 2.0は本当に100万トークンのコンテキストモデルなのですか?
Meituanは100万トークンのデータで学習させているが、公開されたconfig.jsonではmax_position_embeddingsが262,144に制限されている。つまり実際に提供されるコンテキストウィンドウは256Kであり、自分で拡張設定をしない限り、これはClaude Codeのコンテキストウィンドウと比べると見た目より小さな差だが、それでも宣伝されている数字とは異なる。
LongCat 2.0はセルフホストできますか?
本格的なハードウェアがある場合のみ可能だ。BF16版のチェックポイントは194個のシャードに分かれた3.55TBあり、検証済みの提供方法はFP8ビルドを動かすNVIDIA B300×8基のみとなっている。GGUF形式は存在しないため、OllamaやLM Studioでは読み込めず、ローカルで動かせる大半のオープンソースAIエージェントとはまったく事情が異なる。
カスタマーサポートにLongCat 2.0を使うべきですか?
今の時点では実運用のキューに投入することはお勧めしない。プラットフォームのFAQはデータの保持期間、プロンプトを学習に使うかどうか、サーバーの設置場所について一切触れておらず、これはSOC 2やGDPRの審査でどの購入者も最初に尋ねる項目だ。サポート業務では、生のモデルをAIチケッティングシステムに直接組み込むより、モデル選定を代わりに担ってくれる管理レイヤーを使うほうが安全な道になる。

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
とても長い猫が伸びをしている横で、2人がスコアカードを確認しているイラスト。LongCatのロゴが入っている
Trending

LongCat 2.0レビュー:頼れる働き者、ただし一つの大きな壁

私はLongCat 2.0を、買い手が実際に気にする7つの観点で採点した。使ったのはMeituan自身の資料と、数十億トークンをこのモデルに流した人たちの声だ。6項目は良好な結果だった。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flashの料金:実際の請求額はどうなるか
Trending

DeepSeek V4 Flashの料金:実際の請求額はどうなるか

DeepSeek V4 Flashの公式価格は100万トークンあたり入力$0.14、出力$0.28。実際のユーザーは1セント未満の混合レートを報告している。どちらになるかを決める要因を解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flashのスペックと価格、実際の使い道
Trending

DeepSeek V4 Flashのスペックと価格、実際の使い道

DeepSeek V4 Flashは100万トークンあたり入力$0.14、出力$0.28で、DeepSeek自身の高価な上位モデルより高いスコアを記録している。価格表からは見えてこないポイントを解説する。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
低とマックスというラベルの付いた2つのエフォートダイヤルとDeepSeekのクジラの横で、判定スコアカードを見ているレビュアー
Trending

DeepSeek V4 Flashレビュー: 1つのモデル、2つの人格

両方のスコアボードが公開する数値に基づくDeepSeek V4 Flashレビュー。安価な実行と賢い実行は同じ重みファイルであり、それが評価を変えてしまう。

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
巨大な使用量メーターを見ながら、請求ダイヤルの束を調整する二人の人物。Metaのブランドカラーである青で描かれている
Trending

Meta Muse Spark 1.1の料金:請求額を決める4つのメーター

Muse Spark 1.1は100万トークンあたり入力$1.25、出力$4.25で提供される。実際の請求額を左右するのは4つの個別メーターで、表示価格はそのうち最小のものにすぎない。

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
PromptQLの料金内訳を示すイラスト
Trending

PromptQLの料金:2026年に実際いくらかかるのか

PromptQLの料金を分解して解説:課金単位OLU、導入価格0.14ドル、無料クレジット、実際の請求額を左右するモデル倍率、そして実際のコスト計算例。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
モニターから手を伸ばしアプリのウィンドウや文書を操作するAIエージェントを、2人の同僚が見守っている様子。Metaのブランドカラーである青を基調としたイラスト
Trending

Meta Muse Spark 1.1:概要・料金・弱点を整理

Metaが初の有料モデルAPIとして100万トークンのコンテキストを持つエージェントモデルを$1.25/$4.25で提供開始。Muse Spark 1.1が実際に得意なことと、Metaがスライドから外したベンチマークを整理する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
多数の暗い経路の中から2つの光るエキスパート経路へトークンを振り分ける小型モデルチップのイラスト。Inkling-Small の解説用
Trending

Inkling-Small解説:2760億パラメータ、実働は120億

Inkling-Smallが実際に何なのか:Thinking Machines発の2760億/120億のオープンウェイトMoEモデル、ドキュメントとプロバイダーで食い違うコンテキストウィンドウ、100万トークンの実際のコスト、そしてサポートスタックにおける位置づけ。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
整然とした小型モデルのコアと、はるかに大きく絡み合ったコアを比較するイラスト。Inkling-Small のレビュー用
Trending

Inkling-Smallレビュー:サイズは4分の1、賢さはほぼそのまま

実際に試したInkling-Smallレビュー:サイズと価格が4分の1でありながら、コーディングでは975Bの親モデルを上回る。ただし事実性は崖から落ちるように急落する。このトレードオフが実際に何を意味するのかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める