
Inkling-Smallの正体
Thinking Machines LabはMira Muratiの会社であり、そのビジネスモデルはウェイトを無償公開し、その周辺のツール群を販売するというものだ。Inkling-Smallは2番目にリリースされたモデルで、Apache 2.0のもとHugging Faceにthinkingmachines/Inkling-Smallとして公開され、公開から1か月でおよそ15,500回ダウンロードされた。
提供元はこれを元モデルの「4分の1のサイズ」と呼んでおり、珍しくマーケティング上の数字が実態と合っている。親モデルは66層にわたって総パラメータ9750億/アクティブ410億。こちらは42層にわたって総パラメータ2760億/アクティブ120億だ。どちらの指標でも本当に4分の1に近い。

アーキテクチャはかなり積極的なMixture-of-Expertsだ。各層は256のエキスパートを持ち、ルーターはトークンごとにそのうち6つを選び、さらに常時アクティブな共有エキスパート2つが加わる。アテンションはハイブリッドで、ローカル層とグローバル層を交互に切り替え、ウェイトはBF16とNVFP4の両方で提供される。学習にはNVIDIA GB300 NVL72ハードウェアが使われた。
この形の実際的な帰結はこうだ。メモリでは2760億分を、計算では120億分を払う。それがすべての仕掛けであり、だからこそ4分の1兆パラメータのモデルが、その10分の1の規模の密なモデルより高速に応答できる。MoEという用語が初耳なら、その仕組みは現在のオープンソースAIエージェントの大半に当てはまる。
さらに0から0.99まで動く推論努力量(reasoning-effort)のダイヤルがあり、提供元が推奨する目安は低で0.2、中で0.7、最大で0.99だ。これは回答前にモデルがどれだけ長く考えるかを決めるノブであり、あなたが触るどの設定よりもトークン代を動かす。
何が入り、何が出るのか
これは人々が最も誤解しやすい部分なので、はっきり述べる価値がある。

入力はテキスト、40〜4096ピクセルの画像、そして2分未満の16kHz WAV音声だ。出力はテキストのみ。このモデルに音声合成は存在しない。
電話回線を計画していたなら、これは重要だ。音声を聞けても話せないモデルは音声パイプラインの半分にすぎず、テキスト読み上げ、テレフォニー、割り込み(バージイン)処理、話者交代検出をその上に別途用意する必要がある。それがプロジェクトなら、生のモデルよりもAI音声企業のベンダー地図の方が良い出発点になる。
音声理解は、小型モデルが親モデルに対して全面的に後退した唯一の能力でもある。VoiceBenchは90.1対91.4、Audio MCは54.9対56.6、MMAUは77.0対77.2。差は小さいが、すべて同じ方向を指している。
誰も一致しないコンテキストウィンドウ
ここに、確認に2分かかっただけで午後1日分の手間を省ける発見がある。
モデルカードはコンテキストウィンドウを100万トークンとしている。提供する2社のプロバイダーのうち一方であるOpenRouterは、524,288トークンでホストしている。これはちょうど半分であり、タイプミスではなく意図的なホスティング判断だと分かる。
どちらの数字も嘘ではない。一方はアーキテクチャがアドレス可能な範囲を表し、他方は特定のエンドポイントが今日受け入れる範囲を表している。よくある失敗パターンは、カードの数字を前提にドキュメント詰め込み型のパイプラインを設計し、本番で壁にぶつかることだ。長いウィンドウに依存するものを構築するなら、実際に呼び出すエンドポイント側の上限を読み取ってほしい。同じ罠はコーディングエージェントを使う人も引っかけるもので、そのためコンテキストウィンドウのサイズについては別に取り上げた。
プロバイダー数もまた薄い部分だ。親モデルの4社に対して、2社。2週目5日目のモデルとしては予想の範囲内だが、フェイルオーバーの余地が少ないことを意味する。
コストについて
出力の価格は定まっている。出力100万トークンあたり1.20ドルで、提供元、Artificial Analysis、OpenRouterのいずれも一致している。親モデルの4.05ドルに対して、これが見出しとなる数字だ。
入力の価格は定まっておらず、数字を選んで自信ありげに見せるより、そう伝える方が良いと思う。
| 情報源 | 入力/100万 | 出力/100万 |
|---|---|---|
| Artificial Analysis | 0.30ドル | 1.20ドル |
| OpenRouterモデルページ | 0.45ドル | 1.20ドル |
| OpenRouter API応答 | 0.50ドル | 1.20ドル |
| 親モデル(Inkling) | 参照値 | 4.05ドル |
0.50ドルで予算を組んでおけば何も驚かない。ブレンド価格ベースでは、Artificial AnalysisはInkling-Smallを100万あたり0.22ドルとし、親モデルの0.72ドルに対して、同じ知能クラスでおよそ3分の1のコストになる。
速度はこの取引の過小評価された半分だ。出力131.1トークン/秒、親モデルの84.8に対して、最初のトークンまでの時間(TTFT)は1.65秒対1.82秒。Intelligence Indexでは小型モデルが40点で101モデル中15位、親モデルは41点で13位。同じクラスで、速く、安い。これは珍しい組み合わせであり、このリリースに注目すべき最大の理由だ。
ファインチューニングはThinking Machines自身のTinkerプラットフォーム経由で、モデルをサポートしている。トークンあたりの学習料金は私が見つけられた限りどこにも公開されておらず、tinker-docs.thinkingmachines.ai/pricingの価格ページは現在404を返す。チェックポイントの保存は1GBあたり月0.10ドルだ。ファインチューニングを予定しているなら、リトリーバルとのトレードオフはRAG versus fine-tuningにまとめている。
自分で動かす
ここで、無料のウェイトの「無料」が試される。Unslothの量子化ビルドがこれに実際の数字を与えており、興味深いのは2-bitの値だ。89GBで、128GBユニファイドメモリのマシンに収まる。
ローンチ時の議論には良いエピソードがある。Hacker Newsのコメント投稿者andy99は、量子化版が出る前に90GB前後を期待していたと述べていた。Unslothは89に落ち着いた。
ぎりぎり: 3-bit(128GB)
大きすぎる: 4-bit(132〜170GB)、NVFP4(180GB以上)、BF16(543GB)
大きすぎる: 4-bitは132GBから始まる、NVFP4(180GB以上)、BF16(543GB)
大きすぎる: BF16(543GB)
カードの推奨: BF16には4x B300または8x H200
入力: 情報源によって0.30〜0.50ドル/100万
プロバイダー: 現在2社
ローカルで動かすなら、2つ実務上の注意点がある。サンプリングはtemperature 1.0、top_p 1.0、min_p 0.0にすべきで、これは書き留めておくに値するほど珍しい設定だ。そしてllama.cppサポートはPR #25731経由で追加されたので、幻の不具合をデバッグする前に、あなたのビルドにそれが含まれているか確認してほしい。
どこに向いていて、どこに本当に向いていないか
提供元自身の比較表では、小型モデルは実行と呼べる項目の大半で9750億の親モデルを上回っている。SWEBench Verifiedは80.2対77.6、SWEBench Proは55.9対54.3、Terminal Bench 2.1は64.7対63.8、Toolathlonは54.4対45.5、MCP Atlasは79.6対76.0、GPQAは89.5対87.2、IFBenchは82.2対79.8。
そしてもう一つの列がある。AIMEは97.1から95.5に落ちる。Global-MMLU-Liteは88.7から86.7に落ち、その上に多言語対応サポートエージェントを構築する予定なら注意すべき点だ。そしてTau 3 Bankingは23.7から15.5まで落ちる。これはこの表の中で最も鋭い単独の後退であり、顧客対応の場面での複数ターンにわたるツール利用を専門的に測るベンチマークでのことだ。
サポート業務を検討する誰にとっても最も重要な組み合わせは、親モデルの43.9%に対して20.6%というSimpleQA Verifiedと、親モデルの+2.1に対して**-9.0**というOmniscienceスコアだ。負のOmniscienceスコアは、モデルが正しいときより自信満々に間違っているときの方が多いことを意味する。ローンチ時のスレッドで誰もこれに言及していなかったのは残念で、これはこのリリース全体で最も意思決定に関わる数字だからだ。
ここでは公平でありたい。これは欠陥ではなく設計上の選択だからだ。アクティブ120億のモデルは、アクティブ410億のモデルに比べて世界を記憶する余地が少なく、Thinking Machinesはその余地を明らかに推論とツール利用に使った。どうせ調べ物をするモデルなら、記憶された雑学知識は無駄な重みだ。それはエージェントにとって正しい賭けだ。
それは記憶から質問に答えるボットにとっては誤った賭けだ。これはまさに、私が現場で目にしてきた失敗の形だ。私が関わったあるB2Bテクニカルサポートチームは、ヘルプセンターが「全モデルをサポートしている」と書いていたために、データベースに存在しない車種に対しても自社のボットが「はい、そのモデルはサポートしています」と回答していることに気づいた。モデルは壊れていたわけではない。曖昧なソースに対して自信を持って推論していただけで、それこそが負のOmniscienceスコアが予測する事態だ。このパターンの全体像はハルシネーションの防止に書いた。
つまり率直な結論はこうだ。リトリーバル層が事実を供給し、モデルが推論を供給する場面でInkling-Smallを使うこと。真実の源として使わないこと。
つまり、あなたが持つ情報源の質がモデルの精度の上限になるということであり、その源をうまく選ぶことはチェックポイントを選ぶことよりも大きなレバーだ。ナレッジベースツールのまとめが実務的な出発点になる。
サポートキューにAIを載せるなら何を意味するか
モデルはエンジンであって、車ではない。この区別こそがAIエージェント対チャットボットの核心であり、ベンチマーク表がキューについてほとんど何も語らない理由でもある。
「これはベンチマークで良い成績を取る」と「これは私の顧客に答えられる」の間のギャップこそがプロダクトそのものであり、その大半は地味な部品でできている。
- **グラウンディング。**モデルは学習データではなく、あなたのヘルプセンター、マクロ、解決済みチケットを読む必要がある。それはAIナレッジベースチャットボット層の仕事だ。
- **確信度ルーティング。**モデルがまったく答えるべきでないタイミングを、何かが判断する必要がある。これはAIエスカレーション管理の核心だ。
- **ドライラン。**解決率を、顧客が知る前にあなたが知っておきたい。自分のチケット履歴に対するシミュレーションこそが、その数字を得る唯一の誠実な方法だ。
- **ハンドオフ。**AIが止まったとき、人間がフルコンテキストを持って会話を途中から引き継ぐ。ハンドオフのベストプラクティスに従ってのことだ。これのより穏やかな版がAIコパイロットで、モデルが下書きを作り、人間が送信する。
- 測定。偏向率(デフレクション率)が、これ全体がうまくいったかどうかを決める数字だ。それを解決あたりコストでお金に翻訳しよう。
- **カバレッジ。**AIがそもそもどのトピックを担うべきかを知ることは独立した作業で、このチケットデフレクションガイドにまとめている。
私が話を聞いたDTCサプリメント企業のCXリーダーは、要件を一文でこう表現した。「I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone.」どのモデルのチェックポイントもそれを与えてはくれない。確信度のしきい値とルーティングルールがそれを与えてくれる。それは、あなたが既に運用しているAIチケットシステムの中に組み込まれる。
この判断の指標側は別に読む価値がある。「解決」という言葉がチームによって異なる意味を持つからだ。サポート指標から始めて、次に初回対応解決率へ。
これもまた、無料のApache 2.0チェックポイントが自然に呼び起こす自前構築か購入かという問いへの答えでもある。ウェイトはプロジェクトの中で最も安い部分だ。100万入力トークンあたり0.50ドルもプロジェクトの中で最も安い部分だ。高くつく部分は、リトリーバルパイプライン、評価ハーネス、エスカレーションロジック、そして来四半期にその3つ全てを保守する人材だ。

こういうモデルを実際のチケットで使いたいですか?
Inkling-Smallの価格と速度が気になったのなら、あなたが本当に求めているのは、その経済性をガードレールで包んだものだ。eeselはZendesk、Freshdesk、その他あなたのスタックの残りに接続し、モデルの記憶ではなくあなたの過去のチケットとヘルプセンターで学習し、実際の顧客の目に触れる前にプロセス全体をシミュレーションさせてくれる。あなたが確信度のしきい値を設定し、それを下回るものはすべてコンテキスト付きで人間に渡る。無料で試せて、コミットする前に自分の解決率を確認できる。
他のオープンウェイトの選択肢との比較
オープンウェイト階層は混雑していて、その差はローンチ記事が示唆するよりも小さい。
| Inkling-Small | Inkling(親) | DeepSeek V4 Flash | |
|---|---|---|---|
| パラメータ | 2760億/アクティブ120億 | 9750億/アクティブ410億 | 同程度のサイズ |
| 入力 | テキスト、画像、音声 | テキスト、画像、音声 | テキストのみ |
| 出力/100万 | 1.20ドル | 4.05ドル | より低価格 |
| 速度 | 131.1トークン/秒 | 84.8トークン/秒 | 非常に高速 |
| AA Intelligence Index | 40(#15位) | 41(#13位) | レビュー参照 |
コミュニティの反応は短く、それなりに正確だった。メインのHacker Newsスレッドはわずか33ポイントと2件のコメントしか集めなかったが、そのうち1件が「About the same size as DeepSeek Flash 4, but also supports audio and image input.」と指摘していた。差別化要因を一言でまとめるならこうだ。小型モデルの価格でマルチモーダル入力ができる。
価格と形状で最も近い競合はDeepSeek V4 Flashで、トークンあたりの価格ではこちらを下回るが、テキストのみしか扱えない。
対極では、Kimi K3がオープンウェイトでありながらフロンティア価格を課しており、その比較においてInkling-Smallの1.20ドルは寛大に見える。
解説記事ではなく判定型のバージョンが欲しいなら、それがInkling-Smallレビューだ。9750億の親モデルにも独自のInkling解説記事がある。
決める前に見る価値があるものが2つある。私のInklingレビューは親モデルの価格の問題を扱っており、Inklingの代替はより広い分野を整理している。
安全性に関する数字も、参考として:StrongREJECT 98.4、FORTRESS 71.6と96.9、MMMU Pro 74.0、ARC-AGI-1 84.0、ARC-AGI-2 40.1、SciCode 48.7、CritPt 8.3、AA-Briefcase 917、GDPval-AA v2は親モデルの1238に対して1269。
私の見解
Inkling-Smallは2つのInklingリリースのうちより興味深い方だ。最初のモデルの価格設定にはあまり感心しなかった立場からそう言っている。速く、そしてほぼ上回っている対象モデルのおよそ3分の1のコストであり、音声と画像を受け付け、量子化89GBで、この規模のモデルとして初めて小さなチームが完全に所有できるものだ。
留意点はあいまいではなく具体的だ。カードの数字ではなく、あなたのプロバイダーの実際のコンテキスト上限を読むこと。入力は0.50ドルで予算を組むこと。そしてそれを知識源として扱わないこと。-9.0というOmniscienceスコアは、それが自信を持って間違うだろうと事前に告げているからだ。
顧客対応に関わるあらゆることについて、モデル選びは容易な決定だ。その周りのオートメーション層こそがうまくいくかどうかを決めるものであり、それは来月どのチェックポイントが勝とうと変わらない真実だ。
この記事を読んで、ダウンロードではなく本格導入を検討する気になったなら、Tier-1デフレクションから始めよう。次に、モデルがまったく答えるべきでない範囲を洗い出す。それがチケットトリアージの仕事だ。
出典
- Thinking Machines Labのモデルカード、Hugging Face上の
thinkingmachines/Inkling-Small(アーキテクチャ、ベンチマーク表、ハードウェア指針、サンプリング設定) - Artificial Analysis(Intelligence Index、スループット、TTFT、ブレンド価格、Omniscience)
- OpenRouterのモデルページとAPI(提供されるコンテキストウィンドウ、入力価格、プロバイダー数)
- Unslothの量子化ビルドサイズ
- Hacker Newsローンチスレッド
- eesel Customer Voice Dossier(GENERAL BYTES、許可済み。B2BテクニカルサポートおよびDTCサプリメントの匿名化された抜粋)
よくある質問
Inkling-Smallとは何ですか?
Inkling-Smallは無料でオープンソースですか?
Inkling-Smallの料金はどのくらいですか?
Inkling-Smallのコンテキストウィンドウはどのくらいですか?
Inkling-Smallをローカルで動かせますか?
Inkling-Smallはカスタマーサポートに向いていますか?
Inkling-SmallはDeepSeek V4 FlashやKimi K3とどう比較されますか?
Inkling-Smallにはどのハードウェアが必要ですか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







