Kimi K3レビュー:Moonshotのオープンフロンティアモデルを徹底検証

Alicia Kirana Utomo
執筆者

Alicia Kirana Utomo

Katelin Teen
レビュー者

Katelin Teen

最終更新 July 21, 2026

専門家による検証済み
大量のドキュメントを処理しながら推論する大規模言語モデルのエディトリアルイラスト

Kimi K3とは何か

Kimi K3は、以前のオープンウェイトモデルKimi K2を手掛けた中国の研究機関Moonshot AIのフラッグシップモデルです。Moonshotは、K3を「長期にわたるコーディング、知的作業、推論全般にわたるフロンティアインテリジェンスのために設計された、世界初のオープンな3Tクラスモデル」と説明しています。

際立っているのは、MoonshotがK3の立ち位置について異例なほど正直だという点です。ローンチ時のブログには率直に、「全体的な性能は最も強力なプロプライエタリモデルであるClaude Fable 5やGPT 5.6 Solにはまだ及ばないものの、Kimi K3は評価スイート全体でフロンティアレベルの性能を示し、他のテスト対象モデルを一貫して上回った」と書かれています。研究機関が自社モデルの「できないこと」を先に語る例は珍しく、それによって他の主張も信じやすくなります。

最初に触れておくべき注意点が1つあります。Moonshotはこれをオープンモデルと呼んでいますが、ローンチ時点ではAPI経由のみの提供でした。公式ブログには「完全なモデルウェイトは2026年7月27日までに公開される」とあり、ローンチ週の時点ではHuggingFaceのリポジトリはまだ404を返していました。つまり、初日にセルフホストするつもりだったなら、その計画は数週間待つことになります。

Kimi K3の仕組み

こうしたモデルで開発した経験があるなら、K3の面白い部分はパラメータ数そのものではなく、コストを爆発させずにそこへ到達した方法にあります。そのパイプラインを1枚の図にまとめました。

Kimi K3の仕組み:テキストと画像の入力がStable LatentMoEルーターに渡され、896人のエキスパートから16人を選択し、Kimi Delta Attentionと常時オンの推論を経て回答に至る
Kimi K3の仕組み:テキストと画像の入力がStable LatentMoEルーターに渡され、896人のエキスパートから16人を選択し、Kimi Delta Attentionと常時オンの推論を経て回答に至る

いくつかの要素が重要な役割を果たしています。

  • 非常にスパースなMixture of Experts。 K3は合計2.8兆パラメータですが、Moonshotが「Stable LatentMoEフレームワーク」と呼ぶ仕組みを使い、1トークンあたり「896人中16人のエキスパートを実質的に活性化」するだけです。スパースなルーティングこそが、巨大でありながら実行コストを抑えられるモデルを実現する方法であり、どのトークンに対してもごく一部しか動作しません。
  • Kimi Delta Attention(KDA)。 ハイブリッドな線形アテンション機構で、100万トークンのコンテキストウィンドウを、法外なコストをかけずに実用的なものにしています。
  • Attention Residuals(AttnRes)。 標準的な残差接続の代替として組み込めるもので、Moonshotはgithub.com/MoonshotAI/Attention-Residualsで別途オープンソース化しています。
  • 常時オンの推論。 K3は常に「考え」ており、より安価な非推論モードはありません。推論の強さはreasoning_effortフィールドで設定しますが、現時点ではmaxのみ受け付け、それより低い設定は「近日公開」とされています。

これらを組み合わせることで、Moonshotは「Kimi K2と比較して全体的なスケーリング効率が約2.5倍向上した」と主張しています。ここで本当に重要なのは、単に大きくなっただけでなく、トレーニング計算量あたりの出力がはるかに増えているという点です。正直に言うべきギャップが1つあります。完全な技術レポートと正確なアクティブパラメータ数はまだ公開されておらず、「どのように」の部分の一部はまだ約束の段階にとどまっています。

Kimi K3のベンチマークスコア

ここがK3が「フロンティア」の称号を得ている部分です。Moonshotは、Fable 5、GPT-5.6 Sol、Opus 4.8、GPT-5.5との直接比較チャートを公開しており、独立した検証もそれを裏付け始めています。

Moonshotのローンチブログから引用した、汎用エージェントとビジュアルエージェントにわたるKimi K3のベンチマークチャート(K3がハイライトされている)
Moonshotのローンチブログから引用した、汎用エージェントとビジュアルエージェントにわたるKimi K3のベンチマークチャート(K3がハイライトされている)

パターンは一貫しています。K3は通常Fable 5とGPT-5.6 Solの一歩後ろに位置しますが、前世代のフラッグシップクラスは余裕を持って上回っています。Moonshotのチャートから具体的な数値をいくつか見てみましょう。

  • エージェントによるWebタスク(BrowseComp): K3が91.2でトップに立ち、GPT-5.6 Sol(90.4)、Fable 5(88.0)を上回っています。
  • Automation Bench: K3が30.8で首位、GPT-5.6 Sol(29.7)とFable 5(29.1)にわずかに勝っています。
  • SWE Marathon(長期にわたるコーディング): K3が42.0でトップ、Opus 4.8(40.0)とGPT-5.6 Sol(39.0)を上回っています。
  • GDPval-AA v2(知的作業): ここでは1668で3位に後退し、Fable 5(1760)とGPT-5.6 Sol(1748)の後塵を拝しています。

独立した検証でも同じ傾向が見られます。Artificial Analysisでは、K3のIntelligence Indexは57で、189モデル中4位となっており、同社独自の長期にわたる知的作業の評価では「Claude Opus 4.8 maxとGPT-5.5 highにはほぼ勝つ一方、Claude Fable 5とGPT-5.6 Solには負ける」という結果です。出力速度は毎秒約62トークンとごく平凡です。私の見立てでは、K3は「巨人殺し」というより、信頼できる強力な2番手として扱うべきです。「Opus 4.8に勝つ」という見出しはタスク次第だと捉えてください。実際、多くのタスクではその通りになっているのですから。

Kimi K2からK3への変化

Kimiを「安くて有能な中国製モデル」として知っていたなら、K3はその前提のうち2つを書き換えます。はるかに大きく、計算量あたりの効率も大幅に向上していますが、その一方でもはや安くはありません。

Kimi K2からK3への変化:規模は1兆から2.8兆パラメータへ、スケーリング効率は2.5倍向上、価格は底値の安さからプレミアムな$3/$15へ、そしてオープンウェイトはローンチから数週間後に到着するように変わった
Kimi K2からK3への変化:規模は1兆から2.8兆パラメータへ、スケーリング効率は2.5倍向上、価格は底値の安さからプレミアムな$3/$15へ、そしてオープンウェイトはローンチから数週間後に到着するように変わった

全体の物語を変えたのは、この価格の行です。「Kimiは超激安のフロンティアキラー」というのはK2時代の話でした。K3ではMoonshotはフラッグシップ級の価格帯へと引き上げ、その知能の高さが価格を正当化できると賭けています。

Kimi K3の料金

実際の数字を並べてみましょう。「手頃な価格のオープンモデル」というのは、もはや実際に支払う金額を表す言葉ではないからです。K3の公式API料金は、驚くほどシンプルです。1つのモデル、1つの価格、コンテキストウィンドウ全体を通じて一定です。

モデル単位入力(キャッシュヒット)入力(キャッシュミス)出力コンテキストウィンドウ
kimi-k3100万トークン$0.30$3.00$15.001,048,576(1M)

ここで気に入っている点が2つあります。長いプロンプトに対するプレミアム階層がないことです。一部の競合はトークン数がある閾値を超えると料金が上がりますが、K3では100万トークンのウィンドウ全体を通じて料金が同じです。そしてコンテキストキャッシュの割引も本物です。キャッシュヒット時には入力コストが$0.30/Mまで下がり、90%の節約になります。入力の大部分が安定してキャッシュされるコンテキストである長文書や長期にわたるエージェント作業では、K3は本当に競争力を発揮します。

APIではなくコンシューマー向けアプリを使う場合、Kimiは無料プランに加えて、音楽のテンポにちなんで名付けられた4つのサブスクリプション階層を用意しています。

階層月額年払い(月あたり)主な内容
Free$0-基本チャット
Moderato$19$15Deep Research、Docs/Sheets/Slides、Kimi Codeへのアクセス
Allegretto$39$31エージェントクレジット2倍、Kimi Codeクレジット5倍
Allegro$99$79エージェントクレジット5倍、Swarm並列エージェント
Vivace$199$159エージェントクレジット10倍、Swarm最大並列数

出典:Kimiのメンバーシップ料金。知っておくべき点として、このページには新しいプランが登場予定であり、Kimi ChatとKimi Codeの特典が別々の製品に分割されるというバナーが表示されているため、この価格体系は近いうちに変わるかもしれません。

では$3/$15は実際どの程度のものなのでしょうか。確かな第一者同士の比較対象となるのがDeepSeekで、そのV4 Flashは100万トークンあたり$0.14/$0.28で動作し、K3より出力で約21倍安くなっています。DeepSeekは依然として本当の意味での低価格フロンティアの選択肢であり、K3はもはやその軸で競争していません。ローンチ週のコミュニティの受け止め方はもっと率直で、あるコメント投稿者がHacker Newsで述べたように、その変化は「とにかく安い」というものから、Claude Sonnetクラスとほぼ同じ費用がかかるモデルへというものでした。K3の価格面での強みは、見出しになりがちな1トークンあたりの料金ではなく、100万トークン全体を通じて一定の料金と、あの90%のキャッシュ割引にあります。

実際のコミュニティの声

オープンなフロンティアモデルのローンチ週は騒がしいもので、K3への反応も、性能への興奮とコストへの懐疑という2つにきれいに分かれました。最も参考になったシグナルは、実際の業務でK3を動かした人たちからのものでした。

コーディング性能の同等性についての意見が、最も強い称賛でした。

Hacker News

この数時間触ってみましたが、素晴らしいモデルだと思います。ブラインドテストでFableとの違いを見分けられるか自信がありません。$100のKimi Codingプランのクォータは、主にFableを使っているときの$200のAnthropicプランとだいたい同じくらいに感じます。

オープンなモデルがクローズドな研究機関と互角に渡り合っているという、本物の感情の高まりも見られました。

LinkedIn

Kimi K3が正式にリリースされた!このシンプルなプロンプト「Voxel star wars pod-racers run」で作られたボクセルゲームを見てくれ。中国のモデルがギャップを埋めた!私たちはAIの新しい局面に入りつつある。

ローンチ前の期待は、さらにハードルを上げていました。

K3はまったく別次元のものだ。噂によれば、Kimi K3ははるかに大きなモデルで、Claude Opus 4.7に匹敵するらしい。

そして冷静な意見は、まさに数字が示す通りの評価に落ち着きました。最上位よりわずかに下、というものです。

Hacker News

うーん、Fableが本当に出たのはまだ2週間前で、GPT-5.6 Solはたった1週間前だ。確かにKimi K3は両方よりわずかに下に見えるが、他のすべてのモデルよりは上だ。だから今では「数か月遅れ」ではなく「数週間遅れ」と言うべきだと思う……

最大の不満は品質ではなくコストでした。加えて、K3は同じタスクを終えるのにFableより多くのトークンを消費するという指摘も繰り返し出ていました。このトークン効率の問題こそが実際の請求額を左右するものであり、独立した検証が進むにつれて注視する価値があります。

Kimi K3で作れるもの

ローンチ時のショーケースは純粋に楽しく、Moonshotが売り込んでいる長期にわたるコーディング能力を最もわかりやすく示すものです。48時間の単一の自律実行の中で、K3はチップを設計しました(Nangate 45nm、4mm²、毎秒8,700トークン超のデコードでシミュレーション)。また、独自のIRを持つTritonのようなGPUコンパイラ「MiniTriton」を構築し、一部のワークロードではtorch.compileと同等かそれを上回る性能を示しました。さらに、単一のプロンプトからプレイ可能な3Dゲームを生成しました。

MoonshotのKimi K3ブログから引用した、単一のプロンプトからKimi K3が生成した3Dオープンワールドゲーム。秋の風景の中を馬に乗った人物が映っている
MoonshotのKimi K3ブログから引用した、単一のプロンプトからKimi K3が生成した3Dオープンワールドゲーム。秋の風景の中を馬に乗った人物が映っている

GPUコンパイラに対するコミュニティの反応は、その場の空気を象徴していました。畏敬の念と「証拠を見せてくれ」という気持ちが半々でした。

Hacker News

ブログ記事で、GPUコンパイラを丸ごとゼロから書き上げたというのを見た人はいる?一部のGPUカーネルではtritonを上回ったようにも見える。これは本当にすごいと思う。これをオープンソース化して、何トークン使ったのか見せてくれるといいんだけど。

こうしたデモは本物ですが、同時に、どの研究機関もローンチ時に見せる最良のケース、大がかりに足場を組んだ実行結果でもあります。「サンドボックスで一度やってみせた」ことと「自分のユースケースで確実にやってくれる」ことの間にあるギャップこそが本質であり、ここからが私が最も気にかけている部分の話になります。

ベンチマークスコアはサポートエージェントではない

ここが、モデルのローンチを紹介するあらゆる記事がさらっと流してしまう部分であり、カスタマーサービス向けにモデルを選ぼうとしてこの記事にたどり着いたなら、実際に重要な部分です。Intelligence Indexの57というスコアは、素のエンジンが強力であることを教えてくれます。しかし、それが顧客に安全に回答できるかどうかについては何も教えてくれません。

ベンチマークスコアはサポートエージェントではない:素のフロンティアモデルが与えてくれるのは高い数値、APIキー、空のプロンプトだけである一方、サポートに対応できるチームメイトは、ヘルプセンターや過去のチケットでトレーニングされ、確信度に基づくルーティングを使い、本番稼働前に実際のチケットでテストされ、ヘルプデスクの中で機能する
ベンチマークスコアはサポートエージェントではない:素のフロンティアモデルが与えてくれるのは高い数値、APIキー、空のプロンプトだけである一方、サポートに対応できるチームメイトは、ヘルプセンターや過去のチケットでトレーニングされ、確信度に基づくルーティングを使い、本番稼働前に実際のチケットでテストされ、ヘルプデスクの中で機能する

私はeeselでAIエージェントを開発しており、苦労して学んだのは、モデルの品質は問題全体のせいぜい3分の1にすぎないということです。自信ありげに聞こえるボットが、静かに間違った回答をする場面を何度も見てきました。だからこそ私たちは今、実際の展開のすべてを、顧客と話す前にその企業の過去のチケットに対してシミュレーションしています。素のK3のAPIキーだけでは、そのどれも得られません。優れたモデルを、キューの上で信頼できるチームメイトに変えるには、自社のナレッジベースでトレーニングし、不確かなときにエスカレーションするルーティングで包み、チームがすでに使っている場所に置く必要があります。それがそのギャップであり、根底にあるモデルがK3であろうとClaude Opusであろうと、他の何であろうと同じギャップです。

eeselを試す

サポートキューでより優れたAIを使いたくてKimi K3レビューを読んでいるなら、モデルの部分はむしろ簡単なほうです。eeselは、フロンティアモデルを実際のサポートエージェントへと変えるレイヤーです。ヘルプセンターや過去のチケットでトレーニングし、既存のヘルプデスク内で返信の下書きや完全な解決を行い、そして何より重要な点として、本番稼働前に実際のチケット履歴に対して全体をシミュレーションし、解決率とコストを事前に確認できます。

eesel AIヘルプデスクダッシュボードの概要
eesel AIヘルプデスクダッシュボードの概要

eeselはモデルに依存しない設計になっているため、プロンプトを書き直したり素のAPIの面倒を見たりすることなく、フロンティアの波に乗り、その月ごとに最も優れたトップモデルで運用できます。そして料金体系はサポートの経済性に合わせて設計されています。利用量ベースで、シート課金はないため、忙しい月にチームが大きいからといって不利になることはありません。eeselを試して、数分で自社のチケットに対してシミュレーションできます。

よくある質問

Kimi K3とは何ですか?
Kimi K3は、Moonshot AIが2026年7月16日にローンチした最新モデルです。ネイティブビジョン対応、100万トークンのコンテキストウィンドウを備えた2.8兆パラメータのMixture-of-Expertsモデルで、3兆パラメータ規模として初のオープンモデルと位置づけられています。サポート業務向けにモデルを検討しているなら、単一モデルよりも最適なAIエージェントのまとめ記事から始めるほうがよいでしょう。
Kimi K3の料金はいくらですか?
Kimi K3のAPIは、入力トークン100万あたり$3.00(キャッシュミス時)、キャッシュヒット時は$0.30、出力トークンは100万あたり$15.00で、100万トークンのコンテキストウィンドウ全体でこの料金は一定です。コンシューマー向けアプリでは、月額$19〜$199の4つのサブスクリプション階層が追加されています。これはSonnetクラスの料金であり、Kimi K2が知られていたようなお買い得価格ではありません。
Kimi K3はオープンソースですか?
Moonshotはこれを「世界初のオープンな3Tクラスモデル」と呼んでいますが、ローンチ時点ではウェイトは公開されていませんでした。Moonshotによれば、2026年7月27日までに技術レポートとともに完全なウェイトが公開される予定です。それまではAPI経由でのみ利用可能です。本番環境でエージェントを運用する必要があるチームにとっては、まだセルフホストできないAPIモデルであることを踏まえて計画する価値があります。
Kimi K3はClaude Fable 5やGPT-5.6と比べてどうですか?
Moonshot自身のベンチマークとArtificial Analysisによる独立検証の両方で、K3はClaude Fable 5とGPT-5.6 Solのわずかに下に位置する一方、ほとんどのタスクでClaude Opus 4.8やGPT-5.5を上回っています。一部のエージェント系・コーディング系ベンチマークでは完全にトップに立っています。新たなトップモデルとしてではなく、強力な2番手として捉えるべきでしょう。
Kimi K3をカスタマーサポートに使えますか?
APIを通じて呼び出すことはできますが、素のモデルはサポートエージェントではありません。ヘルプセンターや過去のチケットでトレーニングし、確信度に基づくルーティングで包み、実際の顧客に回答する前にテストする必要があります。これはまさにeeselが担っている領域で、モデルに依存しない設計になっているため、プロンプトを管理することなくこのようなフロンティアモデル上で動作します。サポートにおけるAIハルシネーションの防止についての考え方もご覧ください。
Kimi K3は実際に何を作れますか?
Moonshotのローンチ時のショーケースでは、K3が48時間かけて自律的にチップを設計し、一部のカーネルでTritonを上回るGPUコンパイラを書き上げ、単一のプロンプトからプレイ可能な3Dゲームを生成する様子が披露されました。印象的なデモではあるものの、コミュニティからの公正な指摘は「トークン代を見せてくれ」というものでした。

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Moonshot AIの大規模言語モデルKimi K3を表すイラスト
Trending

Kimi K3とは:Moonshotのオープンフロンティアモデルを解説

Moonshot AIの2.8兆パラメータのオープンモデル、Kimi K3を分かりやすく解説。何ができるのか、性能はどうか、料金はいくらか、乗り換える価値はあるのかをまとめました。

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
大規模言語モデルKimi K3の代替候補を比較したイラスト
Trending

2026年、Kimi K3の代替として最適な8選

Kimi K3は本物のフロンティアモデルだが、最安ではなく、重みの公開も遅れている。実際のAPI価格とともに、Kimi K3の代替として最適な8つのモデルを紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Google ブルーで描かれたGemini 3.5 Proレビューのヒーローバナー
Trending

Gemini 3.5 Pro レビュー:Googleのフラッグシップの正直な現状

Gemini 3.5 Proの正直なレビュー:まだリリースされていない。Googleが確認したこと、遅れている理由、実在するベンチマーク、そして今使うべきモデルをまとめた。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Inklingの代替としてのAIモデル比較を表すエディトリアルイラスト
Trending

2026年版 Inklingの代替8選

Inklingはオープンで興味深いモデルだが、オープンウェイトとしては高価で、実行できる中で最も賢いモデルというわけでもない。実際に試す価値のある8つの代替モデルを、実際の価格とそれぞれの強みとともに紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
レビュー対象であるThinking Machines Labのオープンウェイト AI モデル「Inkling」のイラスト
Trending

Inklingレビュー:Thinking Machinesのオープンモデルは購入する価値があるか?

Inklingの本音レビュー:Thinking Machines Labの最初のオープンウェイトモデルが本当に得意なこと、価格とベンチマークでがっかりする点、そして実際に誰が使うべきかを解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Thinking Machines Labのオープンウェイトモデル、Inklingのイラスト
Trending

Inklingとは:Thinking Machinesのオープンウェイトモデルを解説

Inklingが実際に何なのか:Thinking Machines Labによる初のオープンウェイトモデル、その本当のベンチマーク、運用コスト、そしてサポート業務の近くに置いていいものかどうか。

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
並行して動くコーディングエージェントとターミナルウィンドウを描いたエディトリアルイラスト。ZCode代替の全体像を表している
Trending

2026年、ZCodeの代替として最適な8選

ZCodeは印象的であると同時に粗削りでもある。実際の価格、正直なトレードオフ、誰に向いているかを踏まえた、2026年におけるZCodeの代替8選を紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
ベンチマークのリーダーボードで1本だけ高く強調されたバーを描いたエディトリアルイラスト。ZCodeとGLM-5.2モデルを表している
Trending

ZCode:Z.aiの新しいAIコーディングエージェントの正体

GLMチームによる無料のエージェント型コーディングアプリ、ZCodeを実際に使って検証。背後にあるGLM-5.2モデル、リリース週に出たリアルな不満の声、そして誰に向いているアプリなのかを解説する。

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
インディゴ背景のPromptQL代替まとめカバー画像
Trending

2026年版 PromptQLの代替8選

2026年に選ぶべきPromptQLの代替8選。Databricks GenieからオープンソースのWren AIまで、実際の料金と強み、それぞれがどんなチームに向いているかをまとめました。

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める