Inklingとは:Thinking Machinesのオープンウェイトモデルを解説

Alicia Kirana Utomo
執筆者

Alicia Kirana Utomo

Katelin Teen
レビュー者

Katelin Teen

最終更新 July 20, 2026

専門家による検証済み
Thinking Machines Labのオープンウェイトモデル、Inklingのイラスト

Inklingとは何か

Inklingは、Thinking Machines Labの初の公開モデルであり、同ラボは自らリーダーボード首位を狙っているわけではないと潔く述べています。売りは、Tinkerというラボのプラットフォームを使って自分の用途にファインチューニングする、幅広くバランスの取れたオープンな基盤であることです。つまりInklingは、購読するチャットボットではなく、自分で形作る出発点として設計されています。

モデルカードから重要なスペックを挙げます。

  • アーキテクチャ: Mixture-of-Experts(MoE)型のTransformerで、総パラメータ975Bのうち41Bがアクティブ(各トークンを256人のエキスパートのうち6人、それに加えて共有エキスパート2人にルーティングします)。これにより、約1兆パラメータ規模のモデルでも妥当な速度で提供でき、あるトークンで実際に動くのはそのごく一部だけです。
  • 入力: テキスト、画像、そして音声(16kHz WAV、目安として約20分以内が望ましい)。出力はテキストのみです。
  • コンテキストウィンドウ: 最大100万トークンで、長さに関してはトップクラスのモデル群と並びます。
  • ライセンス: Apache 2.0のため商用利用が可能で、重みはHugging Faceで公開されています。
  • 公開日: 2026年7月15日。

音声の部分が新しい点です。ローンチスレッドのトップコメントが述べているように、これは「音声に対応した最大のオープンウェイトモデル」であり、サポート通話の書き起こしを読ませるのではなく、通話そのものを聞かせたい場合に意味を持ちます。

Inklingの構造

技術的な仕組みが気になる方向けに言うと、Inklingはいくつか珍しいアーキテクチャ上の選択をしています。今や標準となったRotary Position Embeddings(RoPE)の代わりに、チーム自身のレポートでは、アテンションのロジットに組み込まれた相対位置スキームと、キャッシュに入る前のキー・バリューへの短い畳み込み(convolution)が説明されています。実用上の目的は、長いコンテキストを扱うモデルすべてが目指すものと同じで、コンテキストが100万トークンに近づいてもアテンションを安定的かつ低コストに保つことです。

Inklingの相対アテンション経路:隠れ状態がQ、K、V、Rに射影され、K/Vへの短い畳み込みがキャッシュに入り、相対位置バイアスがアテンションのロジットに加算される様子。Hugging Faceのローンチブログ上でThinking Machinesが図示
Inklingの相対アテンション経路:隠れ状態がQ、K、V、Rに射影され、K/Vへの短い畳み込みがキャッシュに入り、相対位置バイアスがアテンションのロジットに加算される様子。Hugging Faceのローンチブログ上でThinking Machinesが図示

図の細部を読み解く必要はありません。要点はこうです。Inklingは単一のベンチマークで首位を取るためではなく、長いコンテキストと効率的な推論を中心に設計されています。これは「考え方」にも表れています。

思考努力ダイヤル

Inklingは推論モデルであり、「思考努力(thinking effort)」を調整できる設定を公開しています。Hugging Faceの統合では、これはnoneminimalからlowmediumhighxhighmaxまで続くreasoning_effortレベルです。下げれば速く安く回答し、上げれば回答前によりトークンを費やして考えます。

ここでThinking Machinesが強調しているのはトークン効率です。彼らによれば、InklingはNemotron 3 Ultraと同じTerminal-Benchスコアを、そこに到達するまでのトークン数の約3分の1で達成するといいます。トークン単位で課金されている人やGPUをレンタルしている人にとって、「同じ答えをより少ないトークンで」は、僅差のベンチマーク勝利よりも実用的な指標です。

ベンチマーク:強いが王者ではない

ここでベンダーの売り込みと独立した評価を切り分ける必要があります。Thinking Machines自身の表は最大の思考努力での見栄えの良い数字を示していますが、より整理されたシグナルは、全モデルを同じ基準でベンチマークするArtificial Analysisから得られます。

彼らの評価では、InklingはAA Intelligence Indexで41点を獲得し、これは彼らの厳選リーダーボードで97モデル中10位にあたり、同規模のオープンウェイトモデルの平均である約25を大きく上回ります。つまり賢いモデルです。しかしフロンティアのリーダー勢(Claude Fable 5、GPT-5.6、Kimi K3、Grok 4.5、GLM-5.2)よりはにあり、DeepSeek V4 Flashのような同格モデルのグループに位置します。より多くのモデルを含むコミュニティのトラッカーでは順位はさらに下がり、41位近くになることもあり、そこから「『競争力がある』は正しい表現か」という議論が生まれました。

評価項目(Artificial Analysis)Inkling何をテストするか
GPQA Diamond87%科学的推論
AA-LCR63%長文脈での推論
Terminal-Bench v2.155%エージェント的コーディング+ターミナル操作
SciCode46%コーディング
AA-Omniscience(精度)40%知識
GDPval-AA v237%実務タスク
Humanity's Last Exam30%推論+知識
CritPt5%物理学的推論

この表を素直に読むと、はっきりした個性が見えてきます。Inklingは科学的推論と長文脈推論に強く、物理学と知識の生の信頼性に明らかに弱い(AA-Omnisicenceの知識信頼性指標は−100〜100のスケールでわずか2という低さです)。角の立った尖ったモデルであり、なめらかなオールラウンダーではありません。

ローンチスレッドも同じ点を捉えていました。称賛と懐疑が隣り合わせでした。

Hacker News

「ベンチマークを見たところ、ほとんどの項目でKimiK2.6とKimiK2.7の間くらいに見えて、少しがっかりした。」

そしてスレッド全体で最も役に立つ返信は、モデル比較を信用する前にモニターに貼っておく価値があるものでした。

Hacker News

「あるモデルがどれくらい良いか知りたい?自分だけの非公開ベンチマークで走らせろ。それがまともに信頼できる答えを得る基本的に唯一の方法で、それ以外は操作されているか、誤解されているか、過信されているかのどれかだ。」

唯一意味のあるベンチマークは自分自身のデータだ、というこの直感は、いつかモデルを自社のサポート業務に向けるときにこそ持っておくべきものです。詳しくは後述します。

Inklingが高知能・高価格のコーナーに位置し、GLM、Qwen、DeepSeekのようなオープンウェイトの同格モデルが高知能・低価格のコーナーに位置することを示すポジショニングの象限図
Inklingが高知能・高価格のコーナーに位置し、GLM、Qwen、DeepSeekのようなオープンウェイトの同格モデルが高知能・低価格のコーナーに位置することを示すポジショニングの象限図

Inklingの利用コストはいくらか

これが私にとって意外だった点です。Inklingはオープンウェイトでありながら、Thinking Machines自身のAPIでは独占的なフロンティアモデルのような価格設定になっています。Artificial Analysisによれば、価格面では97モデル中81位、つまり同クラスで最も高価な部類に入ります。

利用方法支払う金額備考
Thinking Machines API - 入力100万トークンあたり1.87ドルクラス平均は約0.43ドルで、これは高額
Thinking Machines API - 出力100万トークンあたり4.68ドルクラス平均は約1.25ドル
ブレンドレート100万トークンあたり約1.10ドルキャッシュ:入力:出力が7:2:1の比率の場合
キャッシュの読み書き100万トークンあたり0.374ドルキャッシュヒットは入力に対し−80%
重みを自前でホストモデル自体は0ドルApache 2.0のため、代わりにハードウェア代を支払う
Tinkerでのファインチューニング有料サービスラボの実質的なビジネスモデル

2点際立っています。第一に、現時点でAPIプロバイダーは1社のみ、Thinking Machines自身であり、まだそれより安い第三者ホストが価格競争を仕掛けていません。第二に、「オープンウェイト」が無料になるのは、自分でモデルを動かす意思がある場合だけで、それは注釈事項ではなく実質的な決断です。

Inklingを動かす3つの方法を示す降順のはしご図:フルBF16の重みは約2TBのVRAMが必要、NVFP4量子化は約600GBが必要、1ビットGGUFは約95%削減されワークステーションで動作可能
Inklingを動かす3つの方法を示す降順のはしご図:フルBF16の重みは約2TBのVRAMが必要、NVFP4量子化は約600GBが必要、1ビットGGUFは約95%削減されワークステーションで動作可能

Inklingを自分で動かす

重みがオープンであるため、コミュニティは公開初日からローカルでInklingを動かしていました。Hugging Faceのローンチブログは、上記のはしご図がまとめている大まかな3段階を示しています。フルのBF16チェックポイントには約2TBのVRAM(データセンター級)が必要で、NVFP4量子化ならBlackwellハードウェア上で約600GBまで下がり、コミュニティによる1ビットGGUF版は約95%削減され、強力なワークステーションで大きく量子化されたバージョンを動かすには十分です。

サポートも素早く整いました。transformers 5.14、SGLang、vLLM、llama.cpp/Unslothへのデイゼロ統合に加え、無損失の高速化のための投機的デコーディング用ドラフト層も用意されています。以下は1ビット版が実際にUnslothのスタジオで動作し、完全なHTMLゲームを書きながら、100万トークンのウィンドウに対して321秒間「考えている」様子です。

Inklingの1ビットGGUF版がUnslothのスタジオでローカルに動作し、321秒間考えた後に自己完結型のSudoku HTMLゲームを書いている様子。12.6k/1,048.6kトークンのコンテキストメーターとともにHugging Faceのローンチブログで示されている
Inklingの1ビットGGUF版がUnslothのスタジオでローカルに動作し、321秒間考えた後に自己完結型のSudoku HTMLゲームを書いている様子。12.6k/1,048.6kトークンのコンテキストメーターとともにHugging Faceのローンチブログで示されている

この「自分で動かせる」という話こそ、Inklingに注目する本当の理由です。オープンモデルとクローズドモデルを天秤にかけているなら、トレードオフはコントロールと利便性の間にあります。重みを自分が所有し、データが自社インフラの外に出ることはなく、誰かに勝手にモデルを廃止されることもありませんが、代わりにGPUの面倒は自分で見る必要があります。

エンタープライズの視点

GPUクラスタの面倒を見ることなくコントロールを得たいチーム向けに、InklingはDatabricksでもデイゼロで登場し、ガバナンスが組み込まれたUnity AI Gateway経由で利用できます。彼らが挙げるエンタープライズ向けの主張は、オープンウェイトを魅力的にしているのと同じもの、つまり自社データでファインチューニングし、ガバナンス境界の内側にとどめ、トークン単位の課金を回避できるという点です。

Databricksの「Integrate external agents」パネルが、Unity AI Gatewayを通じて1つのコマンドでInklingにアクセスできることを示し、Codex、Gemini、Copilot、OpenCode、Piなどのコーディングエージェントと連携する様子。Databricksのブログで示されている
Databricksの「Integrate external agents」パネルが、Unity AI Gatewayを通じて1つのコマンドでInklingにアクセスできることを示し、Codex、Gemini、Copilot、OpenCode、Piなどのコーディングエージェントと連携する様子。Databricksのブログで示されている

Inklingを選ぶべきか

「ニーズ次第」という逃げの結論の代わりに、Inklingが実際に得意なこと・不得意なことに基づいた、はっきりした判断基準を示します。

Inklingはあなたにとって正しい選択か?
オープンモデルを自前でホストし、重みを所有したい
Inklingは非常に向いています。Apache 2.0でダウンロード可能、1ビット版まで含めローカルで動作します。GPU予算を確保しておきましょう。
オープンウェイトでネイティブ音声や100万トークンのコンテキストが必要
これに匹敵するオープンモデルはほとんどありません。Inklingは数少ないその一つです。選ぶ価値があります。
とにかく最も安い高性能APIが欲しい
他を探しましょう。入力1.87ドル/出力4.68ドルでは、より安いオープンウェイトの同格モデル(GLM、Qwen、DeepSeek)の方が価格で勝ります。
生のモデルではなく、実際に機能するサポート向けAIエージェントが欲しい
モデル単体では安全にチケットに答えられません。モデルを自社の知識、ガードレール、テストで包み込むプラットフォームが必要です。続きをお読みください。

コミュニティは実際どう見ているか

Hacker Newsのローンチスレッド(1,214ポイント、約292コメント)は、開発者がInklingをどう受け止めたかを最もよく映すスナップショットです。ムードは熱狂的だが冷静であり、盛り上がりはスコアそのものよりも、誰が出したモデルなのかという点に向けられていました。

Hacker News

「言うまでもなく、これはアメリカ製だ。Llama 3以来、初の競争力ある非中国製オープンウェイトモデルじゃないか?」

この見立てには反論もありました(Mistral、CohereのNorth、Gemmaなどを反例として挙げる人もいました)が、信頼できる西側のオープンウェイトの選択肢が待たれていたという根底の感覚は、スレッド全体に流れていました。また「モデルを無料で配るような会社がどう生き残るのか」という健全な疑問も多く、その答えはホスト型ファインチューニング事業であるTinkerに行き着きました。

Hacker News

「テック業界の歴史は『オープンソースだがホスティングを売る』というサービスの死骸だらけだ。モデルの訓練にはあまりに金がかかるので、本当に儲かる大口顧客を失うわけにはいかない。」

このモデルが持続するかどうかは、Inklingにまつわる未解決の問いとして残っています。ただ今のところ、開発者たちは触って試せる有能でマルチモーダル、かつ完全にオープンなモデルを手に入れ、その多くが満足していました。

Inklingのようなモデルがカスタマーサポートにとって意味すること

私がここ数年取り組んできたテーマなので、率直に述べさせてください。私はInklingのようなモデルの上に乗るエージェントレイヤーを作っており、実際の導入を観察して学んだのはこういうことです。ベースモデルが良くなっても、実際にサポート業務に投入される内容が変わることはほとんどありません。

生のモデルは、どれほど賢くても、自社の返金ポリシーを知らず、チームがすでに解決した直近4万件のチケットを見ることもできず、いつ黙って人間に引き継ぐべきかも分かりません。顧客に直接向けると、自信満々に間違った回答をしてしまい、これは何も答えないよりも悪い結果です。この「自信満々だが間違っている」という失敗パターンこそ、サポートにおけるAIハルシネーションがチームを痛い目に遭わせる正体であり、モデルが常にエンジンにすぎない理由です。

車にあたるのが、その周りを包むレイヤーです。それがeeselです。マーケティングページだけでなく解決済みのチケットやヘルプ文書から学習し、確信度に応じてルーティングして確信度の低い回答は送信せず下書きにとどめ、そして私が最も大切にしている部分として、たった一人の顧客に見られる前に過去の自社チケットに対してエージェントをシミュレートできます。このシミュレーションこそ、Hacker Newsの「自分のベンチマークで走らせろ」というアドバイスを、製品のステップとして具現化したものです。

オープンウェイトモデルをエンジンとして示し、解決済みチケットから学習し確信度でルーティングし過去のチケットでシミュレートするeeselレイヤー、そしてその結果生まれる実際に機能するサポートチームの一員を示すフロー図
オープンウェイトモデルをエンジンとして示し、解決済みチケットから学習し確信度でルーティングし過去のチケットでシミュレートするeeselレイヤー、そしてその結果生まれる実際に機能するサポートチームの一員を示すフロー図

これはまた、サポートスタックを単一のモデルに賭ける必要がないことも意味します。最良のモデルは数週間ごとに変わります(今日はInkling、来月は別のモデル)。そのためeeselはモデルにとらわれず、その時点で最も強いモデルに乗り換えられる一方で、顧客にとって本当に大事な部分、つまり知識、ガードレール、チケットのトリアージはそのまま維持されます。

eeselを試す

Inklingは興味深いリリースですが、モデルカードはサポートエージェントではありません。実際の目標がTier-1サポートの自動化であるなら、必要なのはどんな強力なモデルもチームの一員に変えるレイヤーです。eeselは既存のヘルプデスク(Zendesk、Freshdesk、Gorgias、HubSpot、Frontほか100以上)に接続し、自社の履歴から学習し、本番稼働前に実際の過去チケットに対してシミュレーションできるため、顧客が悪い回答に気づいた後ではなく、事前にカバレッジと精度を確認できます。Gridwiseはまさにこのアプローチを使い、開始1か月目でTier-1リクエストの73%を解決しました。

料金は利用量ベースで、解決したチケット1件あたり約0.40ドル、席数課金はなく、無料で始めることができます。優れたエンジンを眺めているだけの状態と、実際にどこかへ走り出す状態との違いがそこにあります。

よくある質問

Inklingとは何ですか?
Inklingは、Mira MuratiのスタートアップであるThinking Machines Labによる初のオープンウェイトAIモデルです。テキスト・画像・音声を入力として受け取りテキストを生成する、ネイティブにマルチモーダルなMixture-of-Expertsモデル(総パラメータ975B/アクティブ41B)で、2026年7月15日にApache 2.0ライセンスで公開されました。完成品として使うのではなくファインチューニングされることを前提に作られており、そこにeeselのAIヘルプデスクエージェントのようなレイヤーが必要になります。
Inklingは無料でオープンソースですか?
重み(ウェイト)はApache 2.0のもとで無料でダウンロードできるため、Inklingを自前でホストし商用利用することが可能です。ただし「無料モデル」は「運用が無料」という意味ではありません。実際にかかるのはハードウェア代で、フルウェイトなら約2TBのVRAM、1ビット量子化版でもワークステーション相当が必要です。自前でホストしたくない場合に備え、Thinking Machinesは有料の公式APIも提供しています。
Inklingの利用にはいくらかかりますか?
Artificial Analysisによると、Thinking Machinesの公式APIでInklingは入力100万トークンあたり約1.87ドル、出力100万トークンあたり約4.68ドルです。同規模のオープンウェイトモデルとしては高額で(このクラスの平均は入力約0.43ドル/出力約1.25ドルに近い)、これがこのモデル最大の特異点です。自前ホストならこのトークン単価がハードウェアコストに置き換わります。
InklingはGLM、Kimi、DeepSeekと比べてどうですか?
InklingはDeepSeek V4 Flashのようなモデルと同じトップクラスの知性グループに位置しますが、フロンティアのリーダー勢よりは下にあり、Hacker Newsのコミュニティテスターは、ベンチマーク上おおよそKimi K2.6とK2.7の間に位置すると指摘しています。際立つ特徴はトップのベンチマークスコアではなく、ネイティブな音声入力と100万トークンのコンテキストウィンドウです。
Inklingをカスタマーサポートに使えますか?
使うことはできますが、どれほどベンチマークが優れていても、生のモデルはサポートエージェントではありません。実際のチケットに答えるには、解決済みチケットから学習し、確信度でルーティングし、公開前にテストできるレイヤーが必要です。それこそがeeselのようなAIカスタマーサービスプラットフォームが提供するものであり、モデルにとらわれないため常に最良のモデルに乗り換えられます。
Inklingを作っているのは誰で、Tinkerとは何ですか?
Inklingは、OpenAIの元CTOであるMira Muratiが設立したThinking Machines Labによって作られています。同ラボはモデルを無料で公開し、ホスト型ファインチューニングプラットフォームのTinkerで収益を上げています。「重みは公開し、ツールを売る」というこのモデルは、Hacker Newsのローンチスレッドでもかなりの時間をかけて議論されました。

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
レビュー対象であるThinking Machines Labのオープンウェイト AI モデル「Inkling」のイラスト
Trending

Inklingレビュー:Thinking Machinesのオープンモデルは購入する価値があるか?

Inklingの本音レビュー:Thinking Machines Labの最初のオープンウェイトモデルが本当に得意なこと、価格とベンチマークでがっかりする点、そして実際に誰が使うべきかを解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Inklingの代替としてのAIモデル比較を表すエディトリアルイラスト
Trending

2026年版 Inklingの代替8選

Inklingはオープンで興味深いモデルだが、オープンウェイトとしては高価で、実行できる中で最も賢いモデルというわけでもない。実際に試す価値のある8つの代替モデルを、実際の価格とそれぞれの強みとともに紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
並行して動くコーディングエージェントとターミナルウィンドウを描いたエディトリアルイラスト。ZCode代替の全体像を表している
Trending

2026年、ZCodeの代替として最適な8選

ZCodeは印象的であると同時に粗削りでもある。実際の価格、正直なトレードオフ、誰に向いているかを踏まえた、2026年におけるZCodeの代替8選を紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
ベンチマークのリーダーボードで1本だけ高く強調されたバーを描いたエディトリアルイラスト。ZCodeとGLM-5.2モデルを表している
Trending

ZCode:Z.aiの新しいAIコーディングエージェントの正体

GLMチームによる無料のエージェント型コーディングアプリ、ZCodeを実際に使って検証。背後にあるGLM-5.2モデル、リリース週に出たリアルな不満の声、そして誰に向いているアプリなのかを解説する。

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Google Gemini 3.5 Proの料金とAPIコストのガイドを紹介するイラスト付きヒーローバナー
Trending

Gemini 3.5 Proの料金:実際のコストと、まだ足りないもの

Gemini 3.5 Proの料金についての率直な答え:まだ提供されていません。現行のProティア、コンシューマープラン、そして実際のAPIコスト計算をまとめました。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
大量のドキュメントを処理しながら推論する大規模言語モデルのエディトリアルイラスト
Trending

Kimi K3レビュー:Moonshotのオープンフロンティアモデルを徹底検証

Kimi K3の実践レビュー:2.8兆パラメータのオープンモデルのアーキテクチャ、ベンチマーク、実際の料金、そしてローンチ週のコミュニティの本音を検証する。

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
大規模言語モデルKimi K3の代替候補を比較したイラスト
Trending

2026年、Kimi K3の代替として最適な8選

Kimi K3は本物のフロンティアモデルだが、最安ではなく、重みの公開も遅れている。実際のAPI価格とともに、Kimi K3の代替として最適な8つのモデルを紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Moonshot AIの大規模言語モデルKimi K3を表すイラスト
Trending

Kimi K3とは:Moonshotのオープンフロンティアモデルを解説

Moonshot AIの2.8兆パラメータのオープンモデル、Kimi K3を分かりやすく解説。何ができるのか、性能はどうか、料金はいくらか、乗り換える価値はあるのかをまとめました。

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
インディゴ背景のPromptQL代替まとめカバー画像
Trending

2026年版 PromptQLの代替8選

2026年に選ぶべきPromptQLの代替8選。Databricks GenieからオープンソースのWren AIまで、実際の料金と強み、それぞれがどんなチームに向いているかをまとめました。

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める