2026年版、Inkling-Smallの代替8選
Kurnia Kharisma Agung Samiadjie
Katelin Teen
最終更新 August 4, 2026

なぜ人々はすでにInkling-Smallの先を見ているのか
Thinking Machines Labは2026年7月30日、親モデルの15日後にApache 2.0の下でInkling-Smallをリリースした。訴求内容は妥当で、モデルは実際にそれを実現している。親モデルの4分の1のサイズで、より速く、より安く、しかもベンダー自身のカードによればSWE-bench Verifiedで親モデルを80.2対77.6で上回っている。
r/LocalLLaMAの反応は「small」という言葉について色々と言いたいことがあったようだ。ローンチスレッドで3番目に評価の高いコメントは、ベンチマークについてではまったくない。
"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"
もっともな指摘だ。だが命名は誰かをモデルから遠ざける理由にはならない。それを担っているのは、モデルが何を知っているかだ。
Artificial AnalysisはIntelligence Indexを40、101モデル中15位としており、これは十分立派な数字だ。ところが同じページのAA-Omniscienceの知識テストを見ると、指数**-9.0**、正答率30.5%、ハルシネーション率**56.9%**とある。AAはこの評価を「知識の信頼性とハルシネーション」を測るものだと説明しており、-100から100の範囲だ。つまりそこでのマイナスの数字は丸め誤差の類ではない。モデルが持ち合わせていない答えに手を伸ばしているということだ。
AA-Briefcaseの内訳が、私が何度も戻ってしまう部分だ。総合Eloは917.13で、これだけでは何もわからないが、分解すると見えてくる。プレゼンテーション1067.99に対し、分析の質は797.13。このモデルは実際に知っている以上に上手く答えを書く。
自分のハードウェアでこれらのモデルを動かしている人々は、この事実をすぐに見抜いた。しかもベンチマーク表よりも鋭い切り口で。
"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."
この84%という数字は現在AAのページにある56.9%より高いので、正確な数字は彼らの観測として受け取ってほしい、私のものとしてではなく。いずれにせよ、この指摘の要点は変わらないし、それは正しい着眼点だ。彼らはコードをどれだけうまく書けるかではなく、知らないことを知っているかでモデルを選んでいる。

他にも3つ、人々をこのモデルから遠ざける要因がある。価格はその中に含まれない。
コンテキストウィンドウはコンテキストウィンドウではない。 AAはこのモデルを1Mトークンとして掲載している。だが実際に2つのプロバイダーが提供しているのは256,000(Thinking Machines)と524,288(DeepInfra)だ。カードの「1M」を読んでその数字を前提に構築した人は、実際にはそれを得られていない。親モデルでも同じ問題があり、最良の提供数値は3つのプロバイダーで524kで、DeepInfraの最安・最速の枠は131kが上限だ。
プロバイダーが2つというのは心もとない。 親モデルには3つあり、DeepSeekやGLMを提供する陣容はさらに大きい。ローンチ当日、このモデルはOpenRouterにすら載っていなかった。このギャップはパラメーター数と並んで、あるコメンターがHacker Newsで指摘している。手に入る2つのプロバイダーの挙動も異なる。DeepInfraは1万トークンのワークロードでは1.43倍速いが、10万トークンでは首位に劣る。82.36トークン/秒対113.36トークン/秒だ。プロンプトの長さによってレイテンシのプロファイルが変わるというのは、本番環境で発見するには最悪な事実だ。
薄いカバレッジはまた、プロバイダーが手を抜き始めたときに乗り換える余地を狭める。これは公開されているベンチマークが示す以上によく起きている。
"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."
価格は一つの数字ではない。 ファーストパーティは入力$0.30・出力$1.20。DeepInfraは長いコンテキストに対して$0.58と$1.44を求める。ブレンド後で見ると、AAはデフォルトの7:2:1比率で$0.222を示す一方、伝統的な3:1のブレンドでは$0.525になる。つまり最終的にどの一つの数字を引用するかは、実は比率の選び方次第であり、この選択はAIカスタマーサービスのコストを大量運用の規模でモデリングするときに効いてくる。
公平を期すために言えば、これらすべてが「悪いモデル」を意味するわけではない。出力の95.5%を推論が占めており、まさにそこから知能が生まれている。GPQA Diamondで89.5%、長文脈推論で63%というのは本物の数字だ。このモデルは実行者(doer)だ。困るのは実行者に知識者(knower)であることを求めたときだけだ。
この8つをどう選んだか
私はこの種のまとめ記事をたくさん書いてきたが、罠はいつも変わらない。ベンチマークで順位を付け、公開し、次に進む。だから今回はフィルターをもっと狭く保った。
8つそれぞれは、Inkling-Smallのユーザーが今週にでも乗り換えられるものでなければならなかった。つまり価格が公開された、待機リストのない現行の公開APIだ。すべての価格は比較サイトではなくベンダー自身の請求ページから2026年8月5日に取得した。比較サイトの数字は2週間もすれば古くなるからだ。プロバイダーが提供済みコンテキストと広告上のコンテキストの両方を公開している場合は、両者を照合した。ライセンスも読み、これは重要な作業だった。ここに挙げた2つのモデルには収益しきい値がライセンスに潜んでいたからだ。
やっていないのは、8つすべてに対して半年分の本番トラフィックを流したふりをすることだ。ドキュメントと請求ページ、モデルカード、AAの測定値を読み、それらが裏付ける範囲でのみ語っている。
Inkling-Smallの代替、一目で分かる比較表
以下の価格はすべて100万トークンあたり、米ドル建てで、2026年8月5日時点で確認したものだ。
| Model | Best for | Weights | Params | Input | Output | Real context | Modalities in | The catch |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (baseline) | Cheap agentic execution | Apache 2.0 | 276B / 12B active (266B per AA) | $0.30 | $1.20 | 256K first-party, 524,288 on DeepInfra | Text, image, audio | Knowledge index -9.0 |
| DeepSeek V4 Flash | Same job, a quarter the cost | MIT | 284B / 13B | $0.14 | $0.28 | 1M | Text | A 2x peak surcharge is announced |
| Inkling | Staying in the family, knowing more | Apache 2.0 | 975B / 41B | $1.00 | $4.05 | 524K best, 131K cheapest | Text, image, audio | Two AA pages quote different prices |
| GLM-5.2 | Strongest open weights you can host | MIT | ~753B total | $1.40 | $4.40 | 1M | Text | 128K output cap |
| MiniMax M3 | Video in, at Inkling-Small's price | Custom community licence | 428B / 23B | $0.30 | $1.20 | 1M, 512K guaranteed | Text, image, video | Non-commercial by default |
| Kimi K3 | Long-horizon agent work | Custom (Kimi K3 Licence) | 2.8T | $3.00 | $15.00 | 1,048,576 | Text | No batch tier, 3 RPM on entry tier |
| Qwen3.8-Max | Closed model, generous window | Closed | Undisclosed | $2.00 | $6.00 | 1M | Text | Two prices for one model |
| Gemini 3.6 Flash | Audio in with no premium | Closed | Undisclosed | $1.50 | $7.50 | 1,048,576 | Text, image, video, audio, PDF | 65,536 output ceiling |
| Claude Opus 5 | When wrong answers cost money | Closed | Undisclosed | $5.00 | $25.00 | 1M, no surcharge | Text, image | Newer tokenizer emits ~30% more tokens |
1. DeepSeek V4 Flash
Best for: Inkling-Smallと同じことを、出力コストのおよそ4分の1でこなすこと。
これは実際のInkling-Smallユーザーが真っ先に検討する比較で、r/LocalLLaMAのローンチスレッドでも最も内容のあるトップコメントだった。
"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."
まさにそういう構図だ。DeepSeek V4 Flashは総パラメーター284B、アクティブ13Bで動作し、Inkling-Smallの12Bと並ぶ。AAは両者を40で評価している。エンジンは似ているが、請求額は似ていない。
パラメーター数が隠している一点があり、セルフホストを検討しているなら重要だ。DeepSeekはInkling-SmallがBF16でリリースされているのに対しネイティブでFP4とFP8の混在で提供されている。あるローカル実行者によれば、ネイティブ精度では約160GB対540GBだった。紙の上ではほぼ同じサイズなのに、実際にはメモリが3倍違う。
Features. Hugging Face上のMITライセンスのウェイトに加え、1Mのコンテキストウィンドウと最大384Kの出力、これはこのリストの中で群を抜いて最大だ。レート制限は毎分リクエスト数ではなく同時実行数ベースで、公開されている上限はアカウントあたり2,500同時リクエストだ。
Pros. キャッシュの経済性が本当の見どころだ。キャッシュヒットは入力100万トークンあたり$0.0028で、$0.14のキャッシュミス率の50分の1。安定したシステムプロンプトを持つものなら、とんでもなく安くなる。そしてMITはこのグループの中で最もクリーンなライセンスで、収益しきい値も帰属条項もない。
Cons. テキスト専用なので、Inkling-Smallに与えていた音声はどこにも行き場がない。また料金ページには、北京時間09:00-12:00と14:00-18:00に将来2倍のピークサーチャージを課す旨の脚注があり、発効日は「正式発表を待つ」となっている。既知の未確定要素が、コストモデルの中に潜んでいる。
Pricing. 100万トークンあたり入力$0.14・出力$0.28、キャッシュヒットは$0.0028。Proは$0.435と$0.87で、どちらもFlashのちょうど3.1倍だ。詳しい試算はDeepSeek V4 Flashの料金にまとめてあり、Kimi K3との比較も別に行った。
My take: 離れる理由が金額なら、ここで読むのをやめていい。正確性が理由なら読み続けてほしい。安くなったからといって、モデルがより物を知るようになったことは一度もないからだ。
2. Inkling, the parent
Best for: 同じウェイト、同じツール、同じライセンスのまま、事実の正確性を買い戻すこと。

小型モデルにとって最も興味深い代替は、しばしばそれが蒸留された元の大きなモデルであり、ここでもその数字がきれいにそれを裏付けている。同じAAの方法論の下で、InklingはIntelligence Indexで41、Smallの40に対してほぼ横並びだ。差が出るのはAA-Omniscienceで、2.05・正答率39.95%対-9.0・30.5%。3割近く多くの質問が正しく返ってくる。
Features. 66レイヤーにわたり総パラメーター975B、アクティブ41B、Apache 2.0で、テキストと画像と音声入力に対応。提供プロバイダーはローンチ時の1社から今では3社に増えており、DeepInfra、Together AI、Thinking Machinesだ。
Pros. 同じライセンス、同じファミリーなので、移行はほぼモデル文字列を変えるだけで済む。DeepInfraのFP8枠は速く、201.5トークン/秒。そこでのIntelligence Indexタスクあたりのコストは$0.4296で、このクラスとしては安い。
Cons. 現在2つのAAページが価格について食い違っているので、どちらを引用しているのか把握しておく必要がある。モデルページは入力$1.87・出力$4.68としている。一方プロバイダー行はすべて$1.00と$4.05だ。これらのプロバイダーの数字は3社すべてで内部的に一貫しているので、それが計画すべき組み合わせだ。提供コンテキストも乱雑で、最良でも524k、DeepInfraの安くて速い枠は131k、つまり広告上の100万の13.1%に留まる。
Pricing. プロバイダーのデータでは入力$1.00・出力$4.05、キャッシュヒットは$0.17、ブレンドで$0.724。Smallの出力レートのおよそ3.4倍だ。親モデルを検討しているなら、Inklingの代替がより広いラインナップをカバーしている。
My take: 最も分かりやすい選択肢であり、それでいて多くの人が見送ってしまうものでもある。「大きい兄弟にアップグレードする」というのが、小型モデルの選択が間違いだったと認めるように感じられるからだ。だが間違ってはいなかった。ただ知識の仕事には合わない道具だっただけだ。
3. GLM-5.2
Best for: 現実的に自分でホストできる、このリスト中で最も強力なオープンウェイト。
GLM-5.2は、MITライセンスの領域にとどまったままのステップアップだ。総パラメーターは約753B、APIが実際に提供する1Mコンテキスト、そしてzai-org/GLM-5.2リポジトリで223万ダウンロード。このダウンロード数が、セルフホストコミュニティがすでに十分にこれを試し尽くしていることを物語っている。
Features. MITウェイト、1Mコンテキスト、最大出力128K、キャッシュされた入力は$0.26で、キャッシュストレージは今のところ無料とされている。Z.aiはサブスクリプションの選択肢も販売しており、Coding Planは月額$18、割引後$12.60から始まり、週10,000クレジットが付いてくる。
Z.aiは独自のエフォートレベル曲線を公開しており、見出しのスコアをそのまま受け取るより、それを見た方がいい。

Pros. GLM-5.2の価格はGLM-5.1と同じ$1.40と$4.40のままなのに、コンテキストウィンドウは200Kから1Mになった。まさに無料アップグレードだ。収益条項のないMITライセンスも、製品としてこれを出荷する段になれば、ベンチマークの1、2点よりも価値がある。
Cons. その128Kの出力上限は、DeepSeekの384Kに対してこのリストのオープンウェイト選択肢の中で最も窮屈だ。Coding Planのクレジットはピーク時に3倍、オフピーク時に2倍の速さで消費され、オフピークは9月末まで一時的に1倍になっているので、サブスクリプションの計算には注意が必要だ。
Pricing. 入力$1.40、出力$4.40、キャッシュ$0.26。より安い兄弟モデルもあり、GLM-4.7とGLM-4.6はどちらも$0.60と$2.20、GLM-4.7-FlashXは$0.07と$0.40だ。
My take: このリストの中で最良のライセンスと性能のトレードオフだ。法務チームから「ベンダーが規約を変える日には何が起きるのか」と聞かれたことがあるなら、この行を指させばいい。
4. MiniMax M3
Best for: Inkling-Smallとまったく同じ価格のまま、動画入力を追加すること。
これは純粋な価格の一致であり、それがこの比較を珍しくクリーンなものにしている。入力512K未満では、MiniMax M3は入力$0.30・出力$1.20を課し、これはInkling-Smallのファーストパーティレートと同じだ。しかもこちらは428Bモデルでアクティブ23B。つまりコスト以外のすべてで選ぶことになる。
Features. 1Mコンテキストで最低保証512K、キャッシュ読み取り$0.06、テキスト・画像・動画入力がimage_urlとvideo_urlのコンテンツパートを通じて渡せる。Thinkingモードのオン・オフでコストは変わらない。ウェイトはHugging FaceのMiniMaxAI/MiniMax-M3で公開済みで、これまでに170,353ダウンロードされている。
Pros. 同じ金額でInkling-Smallのほぼ2倍のアクティブパラメーターに加え、動画入力も付いてくる。この価格帯でこのリストの他に動画入力を提供するものはない。料金ページには現在のレートが「Permanent 50% off」と表記されており、有効期限はどこにも書かれていない。
Cons. ライセンスこそが本当の落とし穴だ。MINIMAX COMMUNITY LICENSEはデフォルトで非商用であり、商用利用には目立つ「Built with MiniMax M3」のクレジット表記が求められ、年間収益$20Mを超えると書面での許可が必要になる。入力が512Kを超えると両方のレートが倍になり、$0.60と$2.40だ。Priorityティアも存在し、より速いキューが必要ならこちらは1.5倍だ。
Pricing. 入力512Kまでは$0.30と$1.20、それを超えると$0.60と$2.40、キャッシュ読み取りは$0.06。Priorityは$0.45と$1.80、しきい値を超えると$0.90と$3.60だ。
My take: エンジンは良いが、ライセンスは腰を据えて読む必要がある。収益ラインを下回るスタートアップで、クレジット表記を出すことに抵抗がないなら、離れようとしているモデルより多くをここで手に入れられる。
5. Kimi K3
Best for: トークン価格よりも実行の質そのものが重要な、長時間にわたるエージェント作業。
Kimi K3はこれまでのどれよりもずっと大きな飛躍で、Moonshot自身の料金ドキュメントでは「長時間にわたるコーディングとエンドツーエンドの知識労働」のフラッグシップと呼ばれている。2.8兆パラメーターを4-bit mxfp4で提供しており、ウェイトをダウンロードできるモデルとしてはここで最大でもある。
Features. 1,048,576トークンのコンテキスト、reasoning_effort設定(low・high・max、maxがデフォルト)で常時推論、そしてゲートのないmoonshotai/Kimi-K3リポジトリ。ウェブ検索は別課金で、成功呼び出し1回あたり$0.005だ。
Pros. このスケールでオープンウェイトというのは珍しい。キャッシュヒット率$0.30対キャッシュミスの入力$3.00は、コンテキストが繰り返されるたびに10倍の節約になる。中間層はkimi-k2.7-codeという安い兄弟モデルがカバーしており、$0.95と$4.00だ。
Cons. 運用面での落とし穴が2つあり、どちらも痛い。K3はバッチティアに対応していないので、他のKimiモデルが受けられる60%のバッチ割引はここには届かない。ティア制度も支出額でゲートされており、Tier 0(累計チャージ$1)では同時1リクエスト・毎分3リクエストまで、Tier 5の$3,000に達すると同時1,000・毎分10,000RPMまで上がる。ライセンスは一見MITのように見えるが、年間の任意の連続12か月で収益$20Mを超えるモデル・アズ・ア・サービス事業には別途契約が必要という条項が付いている。
Pricing. 入力$3.00・出力$15.00、キャッシュヒットは$0.30。Inkling-Smallの出力レートの12.5倍で、誰もこれを横並びの移行だと勘違いすべきではない。ティア表の全容はKimi K3の料金にある。
My take: ワークロードが何千もの短い回答ではなく1つの長いエージェント実行であるときの選択肢。チケット的なトラフィックに対しては、3分の1の価格のGLM-5.2に対してこれを正当化するのは難しくなる。
6. Qwen3.8-Max
Best for: 十分に寛大なウィンドウと無料トライアル枠を備えたクローズドモデル。
Qwen3.8-Maxは、オープンウェイトにこだわらないと決め、Alibabaの最上位商用ティアを選んだ先にたどり着く場所だ。料金ページを見ての嬉しい驚きは、Maxがついに入力長による段階制を廃止したことだ。1つの帯域が、100万トークンのウィンドウ全体をカバーしている。
Features. 1Mコンテキスト、最大出力131K、最大推論262K、TPM200万・RPM15,000。暗黙のキャッシュは$0.25。90日間有効な100万トークンの無料枠もある。
Pros. 入力長による段階制がないというのは見た目以上に大きな意味を持つ。旧qwen3-maxではAlibabaの段階ルールがオール・オア・ナッシングで、境界を超えるとリクエスト全体が再課金され、33Kトークンのプロンプトが入力$1.20から$2.40に跳ね上がっていた。ここではその罠がない。無料の100万トークンも、きちんと評価するための実質的な余地を与えてくれる。
Cons. モデルIDは1つなのに価格は2つあり、デプロイのスコープ次第で変わる。InternationalとSingaporeの表では$2.00と$6.00、Globalの表では$1.65と$4.951だ。挙動の違いがないのに18%の差があるのは、予算を組むうえで紛らわしい。無料枠はSingapore限定で、そのカウントダウンは非アクティブでも止まらず、残った分は期限切れで無効になる。バッチは50%オフだがキャッシュ割引とは併用できない。Maxもクローズドで、公開されているQwenのウェイトは2世代前、最新でも2026年4月24日付だ。
Pricing. InternationalとSingaporeでは入力$2.00・出力$6.00、Globalでは$1.65と$4.951。明示的なキャッシュ作成は$2.50で、これは入力の125%にあたる。詳細はQwen3.8-Maxの料金に、逆方向を検討しているならQwen3.8-Maxの代替のまとめもある。
My take: 悪くはないが、要求が少なくウェイトまで渡してくれるGLM-5.2と比べるとやや割高だ。それでも無料枠は試す理由になる。
7. Gemini 3.6 Flash
Best for: メディアプレミアムを払わずに音声や複合メディアの入力を扱うこと。
Inkling-Smallに音声入力を求めて使っていたのなら、これがちゃんとしたサービスレベルを備えた最も近い代替だ。Gemini 3.6 Flashはテキスト・画像・動画・音声・PDFを一律$1.50の入力レートでカバーしており、これはGoogle自身が作ったパターンを崩している。Gemini 2.5 Flashでは音声入力がテキストの$0.30に対して$1.00で、2.0 Flashではその倍率が7倍に達していた。
Features. 入力1,048,576トークン、出力65,536トークン、キャッシュは100万あたり$0.15に加え保管1時間あたり100万で$1.00、Batch・Flexティアはどちらも半額で$0.75と$3.75。
Pros. このフラットなメディアレートこそが際立った特徴で、$0.75と$3.75のBatchティアは大量処理を手頃なものにする。Googleの料金ページはこれをプレビューではなく安定版として掲載しており、これは顧客に近いところで使うなら重要なポイントだ。
Cons. 65,536という出力上限はここで最も窮屈なので、長い生成は分割する必要がある。ストレージベースのキャッシュ課金は、他所のフラットなキャッシュ読み取りレートとは違い、メーター制のように動く。ウェイトはクローズドなのでセルフホストはできない。またGemini 3.xでのグラウンディングは無料ティアでは使えず、評価するにもお金がかかる。
Pricing. 標準は入力$1.50・出力$7.50、BatchまたはFlexは$0.75と$3.75、Priorityは$2.70と$13.50。予算が制約ならGemini 3.5 Flash-Liteは$0.30と$2.50で、こちらも音声の別料金はない。全体のはしごはGemini 3.6 Flashの料金にまとめてある。
My take: 音声用の選択肢。大量の複合メディアを送りたい場合、私が迷わず選ぶのもここだけだ。
8. Claude Opus 5
Best for: 自信満々の誤答が実際の損失につながるケース。
これは価格帯の遥か遠端であり、一つの理由でリストに入っている。Inkling-Smallが抱える問題そのものに答えているからだ。Claude Opus 5は入力$5.00・出力$25.00、Inkling-Smallの出力レートのおよそ21倍だが、誤答の下振れがトークン代を上回るときにはこれを買う価値がある。
Features. 標準料金のままフルの1Mコンテキスト、しかも長文脈サーチャージなしというのは珍しい。Anthropicの料金ドキュメントはそれをはっきり書いている。90万トークンのリクエストも9,000トークンのそれと同じトークン単価で課金される。キャッシュ読み取りは$0.50。Batch APIは両側フラットに50%オフの$2.50と$12.50で、キャッシュとも併用できる。
Pros. コンテキスト長による崖がないので、課金のサプライズという一大カテゴリーがまるごと消える。拡張思考(Extended thinking)にも別料金はなく、標準の出力として課金される。Batchとキャッシュを組み合わせれば、重い反復ワークロードを表示価格からかなり下げられる。
Cons. どんなコスト比較でも、トークナイザーが罠になる。AnthropicはClaude 4.7以降が旧トークナイザーに比べ「同じテキストに対しておよそ30%多くのトークンを生成する」と述べており、つまりその$25.00という表示価格は、まだ旧世代のトークナイザーを使うライバルとの実際のタスクあたりの差を過小に見せている。Fastモードは両側を倍にして$10.00と$50.00、ファーストパーティAPI限定で、Batchとは併用できない。ウェイトはクローズドだ。
Pricing. 標準は$5.00と$25.00、Batchは$2.50と$12.50、Fastモードは$10.00と$50.00、キャッシュ読み取り$0.50。より安い停車駅はSonnet 5で、2026年8月31日までは$2.00と$10.00、9月1日からは$3.00と$15.00に上がる。その差を払う価値があるかは、Opus 5対Sonnet 5の比較記事で扱っている。
My take: 大半のチケットトラフィックにはオーバースペックだが、お金・ポリシー・契約が絡む5%にはまさにぴったりだ。全部に同じモデルを使うのではなく、質問の種類でルーティングした方がいい。
The price ladder, in one picture
8つを出力価格で横一列に並べれば、判断の構図はおのずと見えてくる。

Inkling-Smallはすでに底値近くにいる。 意味のあるステップダウンは1つだけで、$0.28のDeepSeek V4 Flash。同じ価格の横移動はMiniMax M3のみだ。それ以外はすべて上りであり、上りが買うのは速さでは決してない。
これがチケットの量ではどれくらいのコストになるかを計算する価値はある。月間1,000チケットとして、1回答あたり出力2,000トークンとすれば、サポート返信としては寛大な数字だ。つまり出力200万トークンになる。
| Model | Output cost, 2M tokens | Against Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | $0.56 | $1.84 cheaper |
| Inkling-Small | $2.40 | baseline |
| MiniMax M3 | $2.40 | identical |
| GLM-5.2 | $8.80 | $6.40 more |
| Inkling | $8.10 | $5.70 more |
| Gemini 3.6 Flash | $15.00 | $12.60 more |
| Kimi K3 | $30.00 | $27.60 more |
| Claude Opus 5 | $50.00 | $47.60 more |
この規模なら、最も安いものと最も高いものの差は月あたり約$50に過ぎない。1件のエスカレーションを下手に扱えば、それだけでこれ以上の損失になる。これがはしごを上る本当の理由であり、同時にモデル選びが最も大きなレバレッジのある場所ではない理由でもある。
この8つのどれも解決しないこと
上の8行のどれも、次の部分は解決しない。だから誰かが「もっと安いモデルを見つけた」と言うたびに、私は押し返してしまう。
私はこの失敗がまさに課金中のアカウントで起きるのを見てきた。検索(リトリーバル)が空振りしても、モデルは止まらない。学習で身につけたものからその隙間を埋めようとする。あるデンマークの太陽光エネルギー企業では、ボットがサブスクリプションに関する主張をでっち上げ、実際の顧客に送ってしまった。別のケースでは、ボットに質問をしたら「Oxygen(periodic table)」という答えが返ってきた。どちらも悪いモデルだったわけではない。どちらも、根拠にするものが何もなく、当て推量を止める仕組みも何もないモデルだった。
私たちのアカウントを担当するあるサポートマネージャーは、AIに「してはいけないこと」を伝える形で同じ懸念を口にした。
"stop telling customers that we will get them sorted. You dont know that"
配達日を安請け合いしすぎるボットを心配していた、あるeコマースのサポートマネージャーだ。問題の形は同じだ。モデルは自信満々に聞こえ、その自信満々に聞こえることこそが危険なのだ。Inkling-Small自身のAA-Briefcaseの内訳が、プレゼンテーションが分析より270.86 Eloポイント優れていると、それをそのまま物語っている。

大きなモデルは解決策ではない。標準搭載されていない2つの要素こそがそうだ。まずグラウンディング。回答がパラメトリックな記憶からではなく、あなたのヘルプセンターと過去のチケットから出てくるようにすること。次に信頼度ゲート。基準を下回るものは人に渡り、そのまま出ていかないようにすること。この2つが生のエンジンを、実際の稼働中キューに向けられるものへと変える。それがまさにAIハルシネーション防止の主題だ。
モデル探しをやめる、もっとありふれた理由もある。私たちが話を聞いたある開発者は、ITインシデントのナレッジベースを組み立てていて、すでにこのループを一周していた。あるベンダーのAPIを試したがコストが高すぎ、別のを試したが不安定で、最終的にただ動くものが欲しかっただけだった。モデルを比較するのは楽しい。モデル層を維持するのはそうではない。
Try eesel
選んだモデルが顧客からの質問に答えることになるなら、正直なアドバイスは二段構えだ。上の8つの中から予算とライセンスに合うものを選ぶ。そのうえで、その上に乗る層は自分で作らないことだ。
その層こそがeeselだ。Zendesk、Freshdesk、あるいは既に使っている他の何にでも接続でき、モデルの学習データではなく過去に解決済みのチケットとヘルプセンターから学習し、自分で設定した信頼度しきい値をクリアしたときだけ返信する。その基準を下回るものはすべてエスカレーションされる。そして実際のトラフィックに触れる前に、自分のチケット履歴に対してシミュレーションでき、顧客に間違える前に何を間違えるかを学べる。

私たちが測定した自社の事実誤り率7%を隠さずに冒頭に置いたのは、それがモデルを選んでいる最中に重要になる数字だからだ。これはドイツのジュエリー小売業者の実際のZendeskトラフィック、月あたりおよそ1,000チケット、284件のチャットと100件のチケットにわたるクロスバリデーション、実際のヘルプセンターへの検索から得られたものだ。グラウンディングでゼロにはならない。だが測定でき、ゲートをかけ、改善できる数字にはなる。それはモデルが自信満々に当て推量するのとはまったく別のカテゴリーのものだ。
商業的な見せ方も意図的に席数制ではない。課金は解決済みチケットごとであり、料金体系は頭数ではなく実際にこなした仕事を追跡する。無料で試せる。まず数字を検証したいなら、チケット削減ガイドから始めるのがいいだろう。
My take
Inkling-Smallは良い小型モデルであり、それに向いていない仕事をやってほしいと頼まれ続けているだけだ。すでに底値近くの価格で実行の質は高く、知識の信頼性は-9.0と測定されている。この2つの事実は矛盾していない。合わせて、それが一つの道具の姿を描いている。
コストが理由で離れるなら、DeepSeek V4 Flashを選べばそれで済む。答えが間違っていることが押し出す理由なら、安い修正策として親モデルのInklingに、あるいは高い方の修正策としてClaude Opus 5に上がろう。どちらもゼロにはしてくれないと分かったうえで。
そしてもし、コンテキストウィンドウがカードと一致しないことが理由なら、GLM-5.2はMITの下で広告どおりのものを提供している。一つだけ選べと言われたら、私はこの行を選ぶ。
それでも8つすべてに共通する正直な結論は変わらない。エンジンを乗り換えれば、請求額とベンチマークのスコアは動く。だが顧客があなたのドキュメントが一度も答えたことのない質問をしてきたときに何が起きるかには、何も触れない。そのギャップを埋めるには、検索、信頼度のしきい値、ハンドオフが必要だ。どんなモデルのアップグレードもそれを代わりにはやってくれない。それは、また別の午後をAIチケット分類のベンチマークを読むことに費やす前に、解決しておく価値のあることだ。
よくある質問
Inkling-Smallの代替として最適なのは?
Inkling-Smallより安い代替はある?
なぜInkling-Smallから乗り換えるべきなのか?
Inkling-Smallは本当に100万トークンのコンテキストウィンドウを持っているのか?
Inkling-Smallの代替の中で最もオープンなライセンスを持つのは?
Inkling-Smallの代替をサポートチケットで運用するコストは?
トークン課金の代わりにInkling-Smallの代替をセルフホストできる?
Inkling-Smallだけでカスタマーサポートに十分な性能か?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








