
Inkling-Smallの正体
Thinking Machines LabはMira Muratiの会社で、ビジネスモデルはウェイトを無償公開し、その周辺のツールを販売することです。Inkling-Smallは2番目に出たモデルです。Apache 2.0ライセンスで、Hugging Faceにthinkingmachines/Inkling-Smallとして公開され、初月で約15,500回ダウンロードされました。
ベンダーはこれを最初のモデルの「4分の1のサイズ」と呼んでおり、珍しくマーケティング上の数字がそのまま裏付けられています。親モデルは66層にわたり総9750億/実働410億です。こちらは42層にわたり総2760億/実働120億。両方の数字とも本当にほぼ4分の1です。

アーキテクチャはかなり積極的なMixture-of-Expertsです。各層は256のエキスパートを持ち、ルーターはトークンごとにそのうち6つを選び、さらに常時オンの共有エキスパートが2つ加わります。アテンションはハイブリッドで、ローカル層とグローバル層を交互に配置し、ウェイトはBF16とNVFP4の両方で提供されます。学習はNVIDIA GB300 NVL72ハードウェア上で行われました。
この形状がもたらす実践的な帰結:メモリでは2760億分、演算では120億分のコストを払うことになります。それがすべての仕掛けであり、1兆の4分の1のパラメータを持つモデルが、その10分の1のサイズの密なモデルより高速に処理できる理由です。MoE用語が初耳なら、その仕組みは現在の大半のオープンソースAIエージェントにも一般化できます。
また0から0.99まで動く推論エフォートのダイヤルもあり、ベンダー推奨の設定値は低が0.2、中が0.7、最大が0.99です。これは答えを出す前にモデルがどれだけ「考える」かを調整するノブで、他のどの設定よりもトークン料金を動かします。
入力されるもの、出力されるもの
これは最もよく誤解されがちな部分なので、はっきり言っておく価値があります。

入力はテキスト、40〜4096ピクセルの画像、そして2分未満の16kHz WAV形式の音声です。出力はテキストのみ。このモデルには音声合成機能はありません。
電話回線を計画しているなら、これは重要です。音声を聞き取れても話せないモデルは、音声パイプラインの半分にすぎず、テキスト読み上げ、電話網、割り込み処理、発話区切り検出を上に重ねる必要があります。それが目的のプロジェクトなら、生のモデルよりもAI音声企業のベンダー一覧の方が良い出発点です。
音声理解は、小型モデルが親モデルに対して全面的に後退している唯一の能力でもあります。VoiceBenchは90.1対91.4、Audio MCは54.9対56.6、MMAUは77.0対77.2。差は小さいものの、いずれも同じ方向を指しています。
誰も意見が一致しないコンテキストウィンドウ
ここに、確認するのに2分しかかからず、後で1日分の手間を省ける発見があります。
モデルカードはコンテキストウィンドウを100万トークンとしています。提供している2社のプロバイダーの1つであるOpenRouterは、524,288トークンでホストしています。これはちょうど半分で、タイプミスではなく意図的なホスティング判断であることを示しています。
どちらの数字も嘘ではありません。片方はアーキテクチャがアドレスできる範囲を、もう片方は特定のエンドポイントが今日受け付ける範囲を表しているだけです。よくある失敗は、モデルカードの数字を基準に長文詰め込みパイプラインを設計し、本番で壁にぶつかることです。長いウィンドウに依存するものを作るなら、実際に呼び出しているエンドポイントから上限を読み取ってください。同じ罠はコーディングエージェントを使う人も引っかけるため、コンテキストウィンドウのサイズとして別記事にまとめました。
プロバイダー数もまだ薄い部分です。親モデルの4社に対し2社。公開から2週目に入ったばかりのモデルとしては想定内ですが、フェイルオーバーの余地は少ないということでもあります。
コスト
出力価格は確定しています。100万出力トークンあたり1.20ドル、ベンダー、Artificial Analysis、OpenRouterの三者が確認しています。親モデルの4.05ドルと比べると、これが見出しになります。
入力価格は確定していません。自信ありげに数字を選ぶより、そう伝えておいた方がいいでしょう。
| ソース | 入力(100万あたり) | 出力(100万あたり) |
|---|---|---|
| Artificial Analysis | $0.30 | $1.20 |
| OpenRouterモデルページ | $0.45 | $1.20 |
| OpenRouter APIレスポンス | $0.50 | $1.20 |
| 親モデル(Inkling) | 参考値 | $4.05 |
0.50ドルを基準に予算を組めば驚くことはありません。ブレンドベースで見ると、Artificial AnalysisはInkling-Smallを100万あたり0.22ドル、親モデルを0.72ドルとしており、同じ知能レベルでおよそ3分の1のコストということになります。
速度は過小評価されがちなもう半分の魅力です。出力は毎秒131.1トークンで、親モデルの84.8を上回り、TTFT(最初のトークンまでの時間)は1.65秒対1.82秒。Intelligence Indexでは小型モデルが40点で101モデル中15位、親モデルは41点で13位。同じ階層でありながら、より速く、より安い。これは珍しい組み合わせであり、このリリースに注目すべき主な理由です。
ファインチューニングはThinking Machines自身のTinkerプラットフォームを通じて行われ、このモデルに対応しています。トークンあたりの学習料金はどこにも公開されておらず、tinker-docs.thinkingmachines.ai/pricingの料金ページは現在404を返します。チェックポイントのストレージは1GB・月あたり0.10ドルです。ファインチューニングを検討しているなら、検索との比較はRAG対ファインチューニングにまとめています。
自分で実行する
ここで「無料」のウェイトという言葉が試されます。Unslothの量子化ビルドが実際の数字を示しており、興味深いのは2ビットの数字です。89GBで、128GBのユニファイドメモリ搭載マシンに収まります。
ローンチ時の議論には気の利いた小話があります。Hacker Newsのコメント投稿者andy99は、量子化版が出る前に90GB前後を期待していると書いていました。Unslothは89GBに着地しました。
ギリギリ: 3ビット(128GB)
大きすぎる: 4ビット(132〜170GB)、NVFP4(180GB以上)、BF16(543GB)
大きすぎる: 4ビットは132GBから、NVFP4(180GB以上)、BF16(543GB)
大きすぎる: BF16(543GB)
カードの推奨: BF16には4x B300または8x H200
入力: ソースによって100万あたり$0.30〜$0.50
プロバイダー: 現在2社
ローカルで動かすなら、事務的な注意点が2つあります。サンプリングはtemperature 1.0、top_p 1.0、min_p 0.0にすべきで、これは書き留めておく価値があるほど珍しい設定です。またllama.cpp対応はPR #25731で実現したものなので、幻のような不具合をデバッグする前に、自分のビルドにそれが含まれているか確認してください。
どこに向いていて、どこにはっきり向いていないか
作成元自身の比較表では、小型モデルは「実行力」と呼べる項目のほとんどで9750億の親モデルを上回っています。SWEBench Verifiedは80.2対77.6、SWEBench Proは55.9対54.3、Terminal Bench 2.1は64.7対63.8、Toolathlonは54.4対45.5、MCP Atlasは79.6対76.0、GPQAは89.5対87.2、IFBenchは82.2対79.8。
一方でもう一つの列もあります。AIMEは97.1から95.5に下がります。Global-MMLU-Liteは88.7から86.7に下がり、これは多言語サポートエージェントをその上に構築するつもりなら気に留めておく価値があります。そしてTau 3 Bankingは23.7から15.5に落ち込み、これは表の中で最も大きな単一の後退であり、顧客対応の場での複数ターンにわたるツール利用を専門に測るベンチマークです。
サポート業務を考えている人にとって最も重要な組み合わせは、SimpleQA Verifiedが親モデルの43.9%に対して20.6%、Omniscienceスコアが親モデルの+2.1に対して**-9.0**という点です。負のOmniscienceスコアは、モデルが正しいときより自信満々に間違っているときの方が多いことを意味します。ローンチ時のスレッドで誰もこれに触れていなかったのは残念です。このリリースの中で最も意思決定に関わる数字だからです。
ここは公平でありたいところです。というのもこれは欠陥ではなく設計上の選択だからです。実働120億のモデルは、実働410億のモデルほど世界を記憶する余地がありません。Thinking Machinesは明らかにその余地を、記憶ではなく推論とツール利用に振り向けました。どうせ調べ物をするモデルなら、暗記した雑学は死重にしかなりません。エージェントにとっては正しい賭けです。
記憶から答えるボットにとっては間違った賭けです。これはまさに私が実際に目撃してきた失敗の形です。ある協業先のB2Bテクニカルサポートチームは、ヘルプセンターに「全モデルに対応」と書かれていたために、データベースに存在しない車種に対しても自社のボットが「はい、そのモデルには対応しています」と確認してしまう事態を発見しました。モデルが壊れていたわけではありません。曖昧なソースに対して自信満々の推論を行っていただけで、それはまさに負のOmniscienceスコアが予測する通りの挙動です。この全体のパターンはハルシネーションの防止にまとめました。
つまり正直な読み方はこうです。事実は検索レイヤーが供給し、モデルは推論を供給する場面でInkling-Smallを使ってください。事実の情報源として使わないことです。
ということは、ソースの質がモデルの精度の天井になるということです。それをきちんと選ぶことは、どのチェックポイントを選ぶかよりも大きなレバーです。私がまとめたナレッジベースツールが実践的な出発点になります。
サポートキューにAIを導入するなら、これが意味すること
モデルはエンジンであって車ではありません。この区別がAIエージェント対チャットボットの話のすべてであり、ベンチマーク表がキューについてほとんど何も教えてくれない理由です。
「ベンチマークの成績が良い」ことと「顧客に答えられる」ことの間のギャップこそが製品そのものであり、その大部分は地味な部品でできています。
- グラウンディング。 モデルは学習データではなく、あなたのヘルプセンター、マクロ、解決済みチケットを読む必要があります。それはAIナレッジベースチャットボットレイヤーの仕事です。
- Confidence routing(自信度によるルーティング)。 モデルが一切答えるべきでないタイミングを何かが判断する必要があり、それがAIエスカレーション管理の核心です。
- ドライラン。 解決率は、顧客が知る前にこちらが知っておきたいものです。自社のチケット履歴に対するシミュレーションだけが、その数字を正直に得る方法です。
- ハンドオフ。 AIが止まったとき、人間が文脈を丸ごと引き継いで会話の途中から対応します。ハンドオフのベストプラクティスの通りです。もう少し柔らかいバージョンがAIコパイロットで、モデルが下書きし人間が送信します。
- 測定。 デフレクション率は、これらすべてがうまくいったかどうかを決める数字です。解決あたりのコストでお金に換算してください。
- カバレッジ。 AIがそもそもどのトピックを担当すべきかを知ることは、それ自体が一つの作業であり、このチケットデフレクションガイドにまとめています。
あるDTC企業のサプリメント担当CXリーダーは、要件を一文で言い表しました。「自信を持って対応できるチケットだけをAIに扱わせ、それ以外は一切触らせたくない」。どのモデルのチェックポイントもそれを与えてはくれません。それを与えるのはconfidence thresholdとルーティングルールであり、それはすでに運用しているAIチケッティングシステムの中に収まります。
その判断の指標面は別に読む価値があります。「解決」の意味はチーム次第で変わるからです。まずサポート指標から、次に初回解決率へ進んでください。
それが、無料のApache 2.0チェックポイントが自然に呼び起こす、自前構築か購入かという問いへの答えでもあります。ウェイトはプロジェクトの中で最も安い部分です。100万入力トークンあたり0.50ドルも、プロジェクトの中で最も安い部分です。コストがかかるのは、検索パイプライン、評価ハーネス、エスカレーションロジック、そして来四半期もそれら3つを維持し続ける担当者です。

実際のチケットにこうしたモデルを使いたいですか?
Inkling-Smallの価格と速度が目を引いたなら、本当に欲しいのはその経済性をガードレールで包んだものです。eeselはZendesk、Freshdesk、その他あなたのスタックに接続し、モデルの記憶ではなく過去のチケットとヘルプセンターで学習し、顧客に見せる前に丸ごとシミュレーションできるようにします。自信度のしきい値はあなたが設定し、それを下回るものはすべて文脈付きで人間に渡ります。無料で試せますし、コミットする前に自分自身の解決率を確認できます。
他のオープンウェイトの選択肢と比べると
オープンウェイト階層は混み合っていて、違いはローンチ記事が示唆するよりも小さいものです。
| Inkling-Small | Inkling(親モデル) | DeepSeek V4 Flash | |
|---|---|---|---|
| パラメータ | 2760億/実働120億 | 9750億/実働410億 | 同程度のサイズ |
| 入力 | テキスト、画像、音声 | テキスト、画像、音声 | テキストのみ |
| 出力(100万あたり) | $1.20 | $4.05 | より低い |
| 速度 | 131.1トークン/秒 | 84.8トークン/秒 | 非常に高速 |
| AA Intelligence Index | 40(15位) | 41(13位) | レビュー参照 |
コミュニティの反応は短くも、それなりに的確でした。メインのHacker Newsスレッドはわずか33ポイントとコメント2件しか集めませんでしたが、そのうちの1件は「DeepSeek Flash 4とほぼ同じサイズだが、音声と画像入力にも対応している」と評していました。それが一言で言った差別化要因です。小型モデルの価格でのマルチモーダル入力です。
価格と形状で最も近い相手はDeepSeek V4 Flashで、トークンあたりの価格ではこちらを下回りますが、テキストのみの対応です。
レンジの反対側では、Kimi K3がオープンウェイトにフロンティア並みの価格を課しており、それと比べるとInkling-Smallの1.20ドルは気前が良く見えます。
この記事のような解説版ではなく結論版が欲しいなら、Inkling-Smallレビューをどうぞ。9750億の親モデルにも独自のInkling解説記事があります。
コミットする前に見ておく価値のあるものがもう2つあります。私のInklingレビューは親モデルの価格の問題を扱い、Inklingの代替はより広い分野をマッピングしています。
参考までに安全性の数字も挙げておきます。StrongREJECT 98.4、FORTRESS 71.6と96.9、MMMU Pro 74.0、ARC-AGI-1 84.0、ARC-AGI-2 40.1、SciCode 48.7、CritPt 8.3、AA-Briefcase 917、GDPval-AA v2は親モデルの1238に対して1269。
私の見解
Inkling-Smallは、2つあるInkling系リリースのうちより興味深い方であり、最初のモデルの価格設定にはがっかりさせられた立場から言っています。ほとんどの点で自分より優れているモデルに対して速く、コストはおよそ3分の1で、音声と画像を受け付け、量子化した89GBという数字は、小さなチームがまるごと所有できる、このクラス初のモデルにしています。
注意点は曖昧ではなく具体的です。モデルカードの数字ではなく、実際に使うプロバイダーの本当のコンテキスト上限を読んでください。入力コストは0.50ドルを基準に予算を組んでください。そして知識のソースとして扱わないでください。-9.0というOmniscienceスコアは、モデル自身が事前に「自信満々に間違える」と告げているようなものだからです。
顧客対応の用途では、モデル選びは簡単な決断です。難しいのはその周りの自動化レイヤーで、それがうまく機能するかどうかを決めるのはこちらであり、来月どのチェックポイントが勝とうとそれは変わりません。
この記事を読んでダウンロードよりも導入を検討する気になったなら、まずTier-1のデフレクションから始めてください。次に、モデルが一切答えるべきでない領域を見極める作業に進みます。それがチケットトリアージの仕事です。
出典
- Thinking Machines Labのモデルカード、Hugging Faceの
thinkingmachines/Inkling-Small(アーキテクチャ、ベンチマーク表、ハードウェアガイダンス、サンプリング設定) - Artificial Analysis(Intelligence Index、スループット、TTFT、ブレンド価格、Omniscience)
- OpenRouterのモデルページとAPI(提供されているコンテキストウィンドウ、入力価格、プロバイダー数)
- Unslothの量子化ビルドサイズ
- Hacker Newsローンチスレッド
- eesel Customer Voice Dossier(GENERAL BYTES、許諾済み、匿名化されたB2Bテクニカルサポートおよびサプリメント系DTCの抜粋)
よくある質問
Inkling-Smallとは何ですか?
Inkling-Smallは無料でオープンソースですか?
Inkling-Smallの料金はいくらですか?
Inkling-Smallのコンテキストウィンドウは?
Inkling-Smallをローカルで実行できますか?
Inkling-Smallはカスタマーサポートに向いていますか?
Inkling-SmallはDeepSeek V4 FlashやKimi K3と比べてどうですか?
Inkling-Smallにはどんなハードウェアが必要ですか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







