2026年、Inkling-Smallの代替8選
Kurnia Kharisma Agung Samiadjie
Katelin Teen
最終更新 August 4, 2026

なぜ人々はすでにInkling-Smallの先を見ているのか
Thinking Machines Labは2026-07-30にApache 2.0のもとでInkling-Smallをリリースした。親モデルから15日後だ。売り込みは妥当なもので、モデルは実際にそれを果たしている。親モデルの4分の1のサイズで、より速く、より安く、ベンダー自身のカードでもSWE-bench Verifiedで親モデルを上回っている、80.2対77.6だ。
r/LocalLLaMAでの反応は「small」という言葉について言いたいことがたくさんあった。ローンチスレッドで3番目に高評価のコメントは、ベンチマークについてまったく触れていない。
「もうすぐ、これら全部の2-3Tモデルの後に、500-700Bモデルを『small』と呼ぶようになるんだろうな…12GBのVRAMで泣きながら」
まあ、それはそうだ。ただ命名がモデルから人を離れさせる理由ではない。何を知っているかがその理由だ。
Artificial AnalysisはIntelligence Indexを40、101モデル中15位としており、それなりに立派だ。しかし同じページのAA-Omniscience知識テストでは、指数**-9.0**、正解率30.5%、ハルシネーション率**56.9%**と報告されている。AAはこの評価を「知識の信頼性とハルシネーション」を-100から100の範囲で測定するものと説明している。だからここでのマイナスの数字は丸め誤差の類ではない。モデルが持っていない答えに手を伸ばしているということだ。
AA-Briefcaseの内訳は、私が何度も戻ってしまう部分だ。総合Eloは917.13で、分割するまではあまり多くを語らない。プレゼンテーションが1067.99に対して、分析の質は797.13。モデルは実際に知っている以上に良い回答を書く。
自分のハードウェアでこれらのモデルを動かしている人々は、ベンチマーク表よりも鋭い軸でこれを早々に見つけていた。
「でもOmniscience指数ではGPT 5.5 Lunaより悪い、答えを作り上げすぎるからだ。ハルシネーション率84%、だから私は他のオープンモデルを好む、それらは自分の不確実性を『検出』するのが上手い」
その84%という数字は、AAのページに今日載っている56.9%より高い。だからこの正確な数字はあくまで彼らの見立てとして受け取ってほしい、私のものではない。どちらにしても要点は成り立つし、それは正しい指摘だ。彼らはコードを書く能力ではなく、知らないことを知っているかどうかでモデルを選んでいる。

他にも3つ、人々をそこから遠ざける要因がある。価格はその中に含まれない。
コンテキストウィンドウはコンテキストウィンドウではない。 AAはこのモデルを1Mトークンとして掲載している。実際に2つのプロバイダーが提供しているのは256,000(Thinking Machines)と524,288(DeepInfra)だ。だからカードで「1M」を読んでその数字を前提に構築した人は、それを得られていない。親モデルでも同じ問題があり、そこでは3つのプロバイダーの中で最も良い提供値が524k、DeepInfraの最も安くて速い行は131kで頭打ちになっている。
2プロバイダーは薄い。 親モデルには3つあり、DeepSeekやGLMを提供する集団はさらに大きい。ローンチ日には、このモデルはOpenRouterにさえ載っていなかった。あるコメンターがパラメータ数と併せてHacker Newsでこのギャップを指摘している。得られる2つのプロバイダーの振る舞いも異なる。DeepInfraは10kのワークロードで1.43倍速いが、100kではファーストパーティーに遅れを取る、82.36トークン/秒対113.36だ。レイテンシのプロファイルはプロンプトの長さによって変わり、それは本番環境で発見するには非常に厄介なことだ。
薄いカバレッジはまた、プロバイダーが手抜きを始めたときに他を探す余地を狭める。これは公開されたベンチマークが示すよりも頻繁に起きている。
「実際に、多くの推論プロバイダーが重みやKVキャッシュさえも量子化していることがわかった。低価格で大規模バッチで提供しているため、結果としてスループットが不安定になっている」
価格は一つの数字ではない。 ファーストパーティーは入力0.30ドル、出力1.20ドルだ。DeepInfraはより長いコンテキストに対して0.58ドルと1.44ドルを要求する。ブレンドした場合、AAはデフォルトの7:2:1の比率で0.222ドルを示しているが、古典的な3:1のブレンドでは0.525ドルになる。だから最終的に引用する単一の数字が何であれ、それは実際には比率についての選択であり、その選択はAIカスタマーサービスのコストを大量にモデリングする段になって重要になる。
公平を期すなら、これらすべてが悪いモデルを意味するわけではない。推論はその出力の課金の95.5%を占め、それがまさに知能の来所であり、GPQA Diamondの89.5%とロングコンテキスト推論の63%は本物の数字だ。この製品は「実行者」だ。問題が始まるのは、実行者に「知る者」であることを求めたときだけだ。
この8つをどのように選んだか
私はこの種のまとめをたくさん書いてきたが、罠は毎回同じだ。ベンチマークでランク付けし、公開し、次に進む。だから今回はフィルターをもっと狭く保った。
8つそれぞれが、Inkling-Smallユーザーが今週中に移行できるものでなければならなかった。つまり公開価格を持つライブの公開APIで、ウェイティングリストなしだ。すべての価格は比較サイトではなくベンダー自身の請求ページから2026-08-05に取得した。比較サイトの数字は2週間以内に古くなるからだ。プロバイダーが提供コンテキストと宣伝コンテキストの両方を公開している場合は、片方を他方と照合した。ライセンスも読んだし、それは重要だった。ここにあるモデルのうち2つには収益しきい値がライセンスの中に埋め込まれているからだ。
やらなかったのは、6か月分の本番トラフィックが8つすべてを通ったかのように装うことだ。ドキュメントと請求ページ、モデルカード、AAの測定結果を読み、それらが裏付けることだけを述べた。
Inkling-Smallの最良の代替、一覧
以下の価格はすべて100万トークンあたりUSDで、2026-08-05に確認したものだ。
| モデル | 最適な用途 | 重み | パラメータ | 入力 | 出力 | 実際のコンテキスト | 入力モダリティ | 落とし穴 |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small(基準) | 安価なエージェント実行 | Apache 2.0 | 276B / 12Bアクティブ(AAでは266B) | 0.30ドル | 1.20ドル | ファーストパーティー256K、DeepInfraで524,288 | テキスト、画像、音声 | 知識指数-9.0 |
| DeepSeek V4 Flash | 同じ仕事を4分の1のコストで | MIT | 284B / 13B | 0.14ドル | 0.28ドル | 1M | テキスト | 2倍のピーク時課金が予告されている |
| Inkling(親モデル) | ファミリーに留まりつつ、より多くを知る | Apache 2.0 | 975B / 41B | 1.00ドル | 4.05ドル | 最良524K、最安131K | テキスト、画像、音声 | 2つのAAページが異なる価格を提示 |
| GLM-5.2 | ホストできる最強のオープンウェイト | MIT | 総計約753B | 1.40ドル | 4.40ドル | 1M | テキスト | 出力128Kの上限 |
| MiniMax M3 | Inkling-Smallの価格で動画入力 | 独自コミュニティライセンス | 428B / 23B | 0.30ドル | 1.20ドル | 1M、512K保証 | テキスト、画像、動画 | デフォルトで非商用 |
| Kimi K3 | 長時間のエージェント作業 | 独自ライセンス(Kimi K3 Licence) | 2.8T | 3.00ドル | 15.00ドル | 1,048,576 | テキスト | バッチ層なし、エントリー層は3RPM |
| Qwen3.8-Max | クローズドモデル、余裕あるウィンドウ | クローズド | 非公開 | 2.00ドル | 6.00ドル | 1M | テキスト | 1モデルに2つの価格 |
| Gemini 3.6 Flash | 上乗せなしの音声入力 | クローズド | 非公開 | 1.50ドル | 7.50ドル | 1,048,576 | テキスト、画像、動画、音声、PDF | 出力上限65,536 |
| Claude Opus 5 | 誤答がお金に直結するとき | クローズド | 非公開 | 5.00ドル | 25.00ドル | 1M、上乗せなし | テキスト、画像 | 新しいトークナイザーが約30%多くトークンを生成 |
1. DeepSeek V4 Flash
最適な用途: Inkling-Smallがやることを、出力コストのおよそ4分の1で行う。
これは実際のInkling-Smallユーザーが最初に手を伸ばす比較であり、r/LocalLLaMAのローンチスレッドで最も内容のあるトップコメントでもあった。
「DSV4 Flashと比べてどうなんだろう。Artificial Analysisの知能ベンチマークでは同等(どちらも40)。ただコーディングやエージェント系のワークフローは少し得意なようだ」
これがその実態だ。DeepSeek V4 Flashは総計284B、アクティブ13Bで動作し、Inkling-Smallの12Bと並ぶ。AAはどちらも40としている。似たエンジン。似ていない請求額。
パラメータ数が隠していることが一つあり、それはセルフホスティングを検討しているなら重要だ。DeepSeekはネイティブでFP4とFP8混合で配布されるのに対し、Inkling-Smallはbf16で配布される。だからネイティブ精度では、あるローカルランナーが片方を約160GB、もう片方を540GBと計測した。紙の上では同程度のサイズ。実際には3倍のメモリだ。
機能。 Hugging Face上のMITライセンスの重み、加えて1Mのコンテキストウィンドウと最大384Kの出力、これはこのリストの中でも群を抜いて最大だ。レート制限は分あたりのリクエスト数ではなく同時実行数によるもので、公開されている上限はアカウントあたり2,500の同時リクエストだ。
利点。 キャッシュの経済性が本当の見どころだ。キャッシュヒットは100万入力トークンあたり0.0028ドルで、キャッシュミス率の0.14ドルの50分の1だ。安定したシステムプロンプトを持つものは何でもばかばかしいほど安くなる。そしてMITはこのグループの中で最もクリーンなライセンスで、収益しきい値もクレジット表記の義務もない。
欠点。 テキストのみなので、これまでInkling-Smallに投入していた音声には行き場がなくなる。また価格ページには、北京時間09:00-12:00と14:00-18:00の間に将来的な2倍のピーク時課金を予告する脚注があり、発効日は「公式発表による」となっている。あなたのコストモデルに埋め込まれた既知の未知数だ。
価格。 100万あたり入力0.14ドル、出力0.28ドル、キャッシュヒットは0.0028ドル。Proは0.435ドルと0.87ドルで、これはFlashのちょうど3.1倍だ、両方向で。詳細な計算例はDeepSeek V4 Flashの価格の記事にあり、Kimi K3との比較も別途行っている。
私の見解: お金が離れる理由なら、ここで読むのをやめて構わない。精度が理由なら読み進めてほしい。安くなることがモデルに多くを知らせることには繋がったことがないからだ。
2. Inkling、親モデル
最適な用途: 同じ重み、同じツール、同じライセンスに留まりながら、事実の正確性を買い戻す。

小さなモデルへの最も興味深い代替は、しばしばそれが蒸留された元の大きなモデルであり、ここでは数字がその主張を明確に裏付けている。同じAAの方法論の下で、InklingはIntelligence Indexで41を記録し、Smallの40とほぼ同等だ。AA-Omniscienceでは差が出る。2.05、正解率39.95%、対して**-9.0と30.5%**。ほぼ3分の1多くの質問が正しく返ってくる。
機能。 66層にわたって総計975B、アクティブ41B、Apache 2.0、そしてテキストに加え画像と音声の入力。今は3つのサービングプロバイダーがあり、ローンチ時は1つだった。DeepInfra、Together AI、Thinking Machinesだ。
利点。 同じライセンス、同じファミリーなので、移行はほとんどモデル文字列を変えるだけだ。DeepInfraのFP8の行は速く、201.5トークン/秒で、そこでのIntelligence Indexタスクあたりのコストは0.4296ドルと、このクラスとしては安い。
欠点。 現在、2つのAAページが価格について一致していない。だからどちらを引用しているのか把握しておく必要がある。モデルページは入力1.87ドル、出力4.68ドルと記載している。プロバイダー各行はすべて1.00ドルと4.05ドルと記載している。それらのプロバイダーの数字は3つすべてで一貫しているので、私が計画するならその組み合わせにするだろう。提供コンテキストも同様に混乱している。最良で524k、DeepInfraの安くて速い行は131k、つまり宣伝されている100万の13.1%で頭打ちになる。
価格。 プロバイダーのデータでは、入力1.00ドル、出力4.05ドル、キャッシュヒットで0.17ドル、ブレンドで0.724ドル。Smallの出力料率の3.4倍と言っていいだろう。親モデルの方を検討しているなら、Inklingの代替の記事がより広いラインアップを取り上げている。
私の見解: 明白な選択であり、そして多くの人が飛ばしてしまう選択でもある。「大きい兄弟にアップグレードする」ことが、小さい方が失敗だったと認めるような気がするからだ。そうではなかった。それは知識の仕事には合わない道具だったというだけだ。
3. GLM-5.2
最適な用途: 現実的にセルフホストできる、このリストの中で最も強力なオープンウェイト。
GLM-5.2は、MITライセンス圏内に留まったままステップアップできるモデルだ。総計約753Bパラメータ、APIが実際に提供する1Mコンテキスト、zai-org/GLM-5.2リポジトリで223万ダウンロード。このダウンロード数は、セルフホスティングのコミュニティがすでに徹底的にストレステストしていることを示している。
機能。 1Mコンテキストと最大出力128KのMITウェイト、そしてキャッシュ入力は0.26ドル、キャッシュストレージは今のところ無料とされている。Z.aiはサブスクリプションの道も販売している。Coding Planは月18ドルから始まり、12.60ドルに割引され、週に10,000クレジットが付く。
Z.aiは独自の努力レベル曲線を公開しており、目玉のスコアを額面通りに受け取るより、それを見た方が良い。

利点。 GLM-5.2はGLM-5.1と同じコスト、1.40ドルと4.40ドルで、その間にコンテキストウィンドウは200Kから1Mへと拡大した。純粋な無料アップグレードだ。収益条項のないMITライセンスも、プロダクトの中でこれを使い始めれば、ベンチマークの1、2ポイントより価値がある。
欠点。 その128Kの出力上限は、ここにあるオープンウェイトの選択肢の中で最も厳しく、DeepSeekの384Kと対照的だ。Coding Planのクレジットはピーク時に3倍、オフピーク時に2倍で消費され、オフピークは9月末まで一時的に1倍になっている。だからサブスクリプションの計算には注意が必要だ。
価格。 入力1.40ドル、出力4.40ドル、キャッシュ0.26ドル。少なくて我慢できるなら、より安い兄弟モデルもある。GLM-4.7とGLM-4.6はどちらも0.60ドルと2.20ドル、GLM-4.7-FlashXは0.07ドルと0.40ドルだ。
私の見解: このリストの中で最良のライセンス対能力のトレードオフだ。法務チームがベンダーが条件を変更した日に何が起こるかを尋ねたことがあるなら、この行を指し示すといい。
4. MiniMax M3
最適な用途: Inkling-Smallの正確な価格に一致させつつ、動画入力を加える。
これは価格の完全一致であり、それが比較を異例なほど明快にしている。入力512K未満では、MiniMax M3は入力0.30ドル、出力1.20ドルを課しており、Inkling-Smallのファーストパーティー料率と同一だ。428Bモデル、アクティブ23Bから成る。これによりコスト以外のすべてで選ぶことになる。
機能。 最小保証512Kを含む1Mコンテキスト、キャッシュ読み込みは0.06ドル、そしてimage_urlとvideo_urlのコンテンツ部分から届くテキストに加え画像と動画の入力。思考モードはオンでもオフでも同じコストだ。重みはHugging Face上のMiniMaxAI/MiniMax-M3で公開されており、これまでに170,353ダウンロードだ。
利点。 同じ金額でInkling-Smallのほぼ2倍のアクティブパラメータ、加えて動画入力もあり、このリストの同価格帯で他に提供しているものはない。価格ページは現在の料率を「永続50%オフ」と表示しており、期限はどこにも記載されていない。
欠点。 ライセンスがここでの本当の落とし穴だ。MINIMAX COMMUNITY LICENSEはデフォルトで非商用であり、商用利用には目立つ「Built with MiniMax M3」のクレジットが必要で、年間収益2000万ドルを超えると書面での許可が必要になる。入力512Kを超えると両方の料率が2倍になり、0.60ドルと2.40ドルになる。Priorityティアも存在し、1.5倍で、速いキューがそれに値するなら選べる。
価格。 入力512Kまでは0.30ドルと1.20ドル、それを超えると0.60ドルと2.40ドル、キャッシュ読み込みは0.06ドル。Priorityは0.45ドルと1.80ドル、しきい値を超えると0.90ドルと3.60ドルだ。
私の見解: 良いエンジンだが、座って読む必要のあるライセンスだ。収益ラインを下回るスタートアップで、クレジット表記を喜んで載せられるなら、離れる先よりドルあたりのモデル性能をここで多く得られる。
5. Kimi K3
最適な用途: トークン価格よりも実行そのものが重要な、長時間のエージェント作業。
Kimi K3はこれまでの何よりもはるかに大きな飛躍で、Moonshot自身の価格ドキュメントでは「長時間のコーディングとエンドツーエンドの知識作業」のフラッグシップと呼んでいる。4ビットのmxfp4で提供される2.8兆パラメータで、これは重みをダウンロードできるこのリストの中で最大のモデルでもある。
機能。 1,048,576トークンのコンテキスト、reasoning_effort設定(low、high、max、デフォルトはmax)の裏にある常時稼働の推論、そして制限のないmoonshotai/Kimi-K3リポジトリ。ウェブ検索は別途課金され、成功したコールごとに0.005ドルだ。
利点。 この規模でのオープンウェイトは珍しい。キャッシュヒットの0.30ドルとキャッシュミス入力の3.00ドルの比率は、コンテキストが繰り返されるたびに10倍の節約にもなる。そして中間帯はkimi-k2.7-codeのようなより安い兄弟モデルで0.95ドルと4.00ドルとカバーされている。
欠点。 運用上の落とし穴が2つあり、両方が痛手になる。K3はバッチ層に対応していないため、他のKimiモデルが受けられる60%のバッチ割引が届かない。ティアシステムも支出に応じたゲート制だ。ティア0では累積チャージ1ドルで同時1リクエストと1分あたり3リクエストが許可され、ティア5の3,000ドルに達すると同時1,000、10,000RPMまで上がる。ライセンスはMIT風に見えるが、直近12か月の任意の期間で収益2000万ドルを超えるモデル・アズ・ア・サービス事業に対して別途契約を要求する条項が加えられている。
価格。 入力3.00ドル、出力15.00ドル、キャッシュヒットで0.30ドル。Inkling-Smallの出力料率の12.5倍なので、誰もこれを横移動だと誤解すべきではない。ティア表の全体はKimi K3の価格にある。
私の見解: ワークロードが数千の短い回答ではなく1つの長いエージェント実行であるときの選択肢だ。チケット型のトラフィックでは、3分の1の価格のGLM-5.2に対してこれを正当化するのは難しくなる。
6. Qwen3.8-Max
最適な用途: きちんと余裕のあるウィンドウと無料トライアル分を持つクローズドモデル。
Qwen3.8-Maxは、オープンウェイトが本題ではないと決め、Alibabaの最上位商用ティアがそうだと決めたときに行き着く場所だ。請求ページでの嬉しい驚きは、Maxがついに入力長のブラケットを廃止したことだ。1つの帯で、100万トークンのウィンドウ全体をカバーする。
機能。 1Mコンテキスト、最大出力131K、最大推論262K、TPMは200万に対しRPMは15,000。暗黙のキャッシュは0.25ドル。90日間有効な100万トークンの無料クォータもある。
利点。 入力長のティア分けがないことは、聞こえる以上に大きな話だ。Alibabaのティア制ルールはオールオアナッシングで動くため、旧qwen3-maxでは境界を越えるとリクエスト全体が再計算され、33Kトークンのプロンプトが入力で1.20ドルから2.40ドルに跳ね上がった。ここではその落とし穴がなくなっている。無料の100万トークンも、きちんと評価するための実際の余裕を与えてくれる。
欠点。 1つのモデルIDに、展開スコープによって2つの価格がある。InternationalとSingaporeの表では2.00ドルと6.00ドル、Globalの表では1.65ドルと4.951ドルだ。裏に振る舞いの違いが何もない18%の差は、予算を組む上で紛らわしい。無料クォータはシンガポール限定で、そのタイマーは無活動でも停止せず、残った分は期限切れで無効になる。バッチは50%オフだが、キャッシュ割引とは併用できない。Maxもクローズドで、公開されているQwenの重みは2世代遅れており、最新のものは2026-04-24付けだ。
価格。 InternationalとSingaporeで入力2.00ドル、出力6.00ドル、Globalでは1.65ドルと4.951ドル。明示的なキャッシュ作成は2.50ドルで、これは入力の125%だ。詳細はQwen3.8-Maxの価格の記事にあり、逆方向で検討しているならQwen3.8-Maxの代替のまとめもある。
私の見解: しっかりしているが、より少なく要求して重みまで渡してくれるGLM-5.2と比べるとやや高め。無料クォータはそれでも試す理由になる。
7. Gemini 3.6 Flash
最適な用途: メディアの上乗せなしでの音声とマルチメディア入力。
音声入力のためだけにInkling-Smallを使っていましたか?それならこれが、実際のサービスレベルを備えた最も近い代替だ。Gemini 3.6 Flashはテキスト、画像、動画、音声、PDFをカバーする一律1.50ドルの入力料率を課しており、これはGoogle自身が設定してきたパターンを打ち破っている。Gemini 2.5 Flashでは、音声入力はテキストの0.30ドルに対して1.00ドルかかり、2.0 Flashではその倍率は7倍にまで達していた。
機能。 入力1,048,576トークンに対し出力65,536、キャッシュは100万あたり0.15ドルに加えて保存1時間あたり100万あたり1.00ドル、BatchとFlexのティアはどちらも半額の0.75ドルと3.75ドルだ。
利点。 ここでの目立つ点は一律のメディア料率であり、0.75ドルと3.75ドルのBatchティアはバルクの作業を手頃にする。Googleの価格ページはこれをプレビューではなく安定版として掲載しており、これが顧客に近い場所で使われるならそれは重要だ。
欠点。 その65,536の出力上限はここで最も厳しく、長い生成は分割する必要がある。ストレージベースのキャッシュ課金は1回限りではなくメーターとして動作し、他のフラットなキャッシュ読み込み料率とは異なる。重みはクローズドなので、セルフホスティングはできない。Gemini 3.xのグラウンディングも無料ティアでは利用できず、評価にはお金がかかることになる。
価格。 標準は入力1.50ドル、出力7.50ドル、BatchまたはFlexは0.75ドルと3.75ドル、Priorityは2.70ドルと13.50ドルだ。予算が制約になる場合、Gemini 3.5 Flash-Liteは0.30ドルと2.50ドルで、音声の区分もない。全体のはしごはGemini 3.6 Flashの価格にある。
私の見解: 音声の選択肢だ。また、二の足を踏むことなく大量の混合メディアを送りたい、ここで唯一のモデルでもある。
8. Claude Opus 5
最適な用途: 自信満々な誤答が実際のお金に直結するケース。
これははしごの最も遠い端であり、リストに入れた理由の一つだ。Inkling-Smallが抱える特定の問題に答えている。Claude Opus 5は入力5.00ドル、出力25.00ドルで、Inkling-Smallの出力料率のおよそ21倍だ。誤答による損失がトークン代を上回るときに、それを買うことになる。
機能。 標準価格で1Mのフルコンテキストで、ロングコンテキストの追加課金ティアがない、これは珍しい。Anthropicの価格ドキュメントがそれを説明している。900kトークンのリクエストは、9kトークンのものと同じトークンあたりの料率で課金される。キャッシュ読み込みは0.50ドルだ。Batch APIは両方向に一律50%オフを適用し、2.50ドルと12.50ドルになり、キャッシュとも併用できる。
利点。 コンテキスト長の断崖がないことで、課金の思いがけない事態というカテゴリー全体が消える。拡張思考には別料金がなく、標準出力として課金される。Batchとキャッシュを組み合わせることでも、大量の繰り返しワークロードを定価から大きく引き下げられる。
欠点。 どんなコスト比較でもトークナイザーが落とし穴になる。Anthropicは、Claude 4.7以降が古いトークナイザーに比べて「同じテキストに対して約30%多くのトークンを生成する」と記している。だからこの25.00ドルのラベルは、まだ古いトークナイザーを使っているライバルとの実際のタスクあたりの差を過小評価している。Fastモードは両方向を2倍にして10.00ドルと50.00ドルにし、ファーストパーティーAPIのみで動作し、Batchとは併用できない。重みはクローズドだ。
価格。 標準5.00ドルと25.00ドル、Batch 2.50ドルと12.50ドル、Fastモード10.00ドルと50.00ドル、キャッシュ読み込み0.50ドル。より安価な選択肢はSonnet 5で、2026年8月31日まで2.00ドルと10.00ドル、9月1日には3.00ドルと15.00ドルに変わる。その差が支払う価値があるかどうかは、Opus 5対Sonnet 5の比較記事で取り上げている。
私の見解: 大半のチケットトラフィックには過剰で、お金、方針、契約に関わる5%にはちょうど良い。すべてに1つのモデルを選ぶのではなく、質問の種類でルーティングすべきだ。
価格のはしご、1枚の図で
出力価格でこの8つを並べれば、決定の形が明らかになる。

Inkling-Smallはすでに底に近い。意味のある下降が一段だけ存在する、0.28ドルのDeepSeek V4 Flashだ。そして同じ価格の横移動としてMiniMax M3がある。他のすべてはここではステップアップであり、ステップアップが買うものは決して速度ではない。
これがチケットの量においてどのくらいのコストになるか、計算しておく価値がある。1か月に1000チケット、1回答あたり2,000出力トークンとしよう。これはサポートの返信としては十分に多めだ。つまり200万出力トークンだ。
| モデル | 出力コスト、200万トークン | Inkling-Smallとの比較 |
|---|---|---|
| DeepSeek V4 Flash | 0.56ドル | 1.84ドル安い |
| Inkling-Small | 2.40ドル | 基準 |
| MiniMax M3 | 2.40ドル | 同一 |
| GLM-5.2 | 8.80ドル | 6.40ドル高い |
| Inkling | 8.10ドル | 5.70ドル高い |
| Gemini 3.6 Flash | 15.00ドル | 12.60ドル高い |
| Kimi K3 | 30.00ドル | 27.60ドル高い |
| Claude Opus 5 | 50.00ドル | 47.60ドル高い |
この量では、最安から最高までの差は月あたりおよそ50ドルだ。1件のエスカレーションを下手に処理すれば、それ以上のコストがかかる。それがはしごを上る本当の理由であり、また、モデル選択が最も大きなレバレッジのある場所ではない理由でもある。
サポートキューにおいて、これらのどれも解決しないこと
上記の8行のうち、どれも次の部分を解決しない。だから誰かが安いモデルを見つけたと言うたびに、私は反論を続けている。
私はこの正確な失敗が支払い中のアカウントで起きるのを見てきた。検索が空振りしたときにモデルは止まらない。学習で得たものから穴を埋める。あるデンマークの太陽光エネルギープロバイダーの顧客は、ボットにサブスクリプションの主張を作り上げさせて実際の顧客に送らせてしまった。別の顧客はボットに質問をして「酸素(周期表)」という答えを受け取った。いずれのケースも悪いモデルではなかった。両方とも、何にもグラウンディングするものがなく、推測を止めるものが何もないモデルだった。
私たちのアカウントの、あるサポートマネージャーは、AIに何をすべきでないかを伝えることで、同じ懸念をもっと平易な言葉にした。
「顧客に、私たちが何とかしますと言うのはやめてくれ。それはわからないだろう」
これはEコマースのサポートマネージャーで、ボットが配送日を過大に約束することを心配していた。同じ形の問題だ。モデルは自信を持っているように聞こえ、その自信を持っているように聞こえることこそが危険な部分だ。Inkling-Small自身のAA-Briefcaseの分割がそれを言い切っている。分析よりプレゼンテーションが270.86 Eloポイント優れている。

大きなモデルが解決策ではない。モデルが標準搭載していない2つのことがそれに当たる。まず、答えがパラメトリックな記憶ではなく、あなたのヘルプセンターと過去のチケットから出てくるようにするグラウンディング。次に、しきい値未満のものはすべて出て行く前に人間に渡す信頼度ゲートだ。この2つが、生のエンジンを実際のキューに向けられるものに変え、それがまさにAIハルシネーション防止というテーマの全体だ。
人々がモデル比較をやめる別の理由は、それよりもっと地味なものだ。ITインシデントのナレッジベースを構築していた、私たちが話をした、ある構築者はすでに一巡していた。あるベンダーのAPIを試してコストが高すぎると感じ、別のを試して信頼性がないと感じ、最終的にただ動くものを求めるようになった。モデルを比較するのは楽しい。モデル層を維持するのはそうではない。
eeselを試す
選ぶモデルが顧客の質問に答えることになるなら、正直なアドバイスは2つに分かれる。上記8つのうち、あなたの予算とライセンスに合うものを選ぶこと。そしてその上の層を自分で構築しないことだ。
その層こそがeeselだ。Zendesk、Freshdesk、あるいは既に使っている何にでも接続し、モデルの学習データではなく過去の解決済みチケットとヘルプセンターから学び、あなた自身が設定する信頼度しきい値を超えたときにだけ返答する。それ未満のすべてはエスカレーションされる。そして実際のトラフィックに触れる前に、自分自身のチケット履歴に対してシミュレーションできる。それが、顧客が気づく前に何を間違えたであろうかを学ぶ方法だ。

私は自社の測定された事実誤り率7%を隠すのではなく先頭に置いている。それがモデルを選んでいる間に重要な数字だからだ。それはドイツのジュエリー小売業者の実際のZendeskトラフィック、月あたりおよそ1000チケットから得られたもので、284のチャットと100のチケットにわたって相互検証され、実際のヘルプセンターに対する検索を伴っていた。グラウンディングはゼロにはしてくれない。測定でき、ゲートをかけ、そして改善できる数字を与えてくれる。それは自信満々に推測するモデルとは全く別のカテゴリーのものだ。
商業面の設計も意図的に座席単位ではない。課金は解決済みチケットあたりで行われるため、価格は人員数ではなく実際に行われた作業を追跡する。試すのは無料だ。まず数字を自分で確認したいなら、チケット削減ガイドが良い出発点になる。
私の見解
Inkling-Smallは、人々が向いていない仕事を求め続けている良い小型モデルだ。うまく実行し、価格はすでに底に近く、その知識の信頼性は-9.0だ。これら2つの事実は矛盾していない。合わせて、それは1つの道具を描いている。
コストが理由で離れるのか?DeepSeek V4 Flashを選べばそれで終わりだ。誤答が離れる原因なら、安く済ませたいなら親のInklingへ、高くても構わないならClaude Opus 5へ上がるといい。どちらもゼロには到達しないことを知った上で進むべきだ。
そしてコンテキストウィンドウがカードと一致しないことが理由なら、GLM-5.2はMITのもとで宣伝どおりのものを提供している。1つだけ選ばなければならないなら、私はその行を選ぶだろう。
しかし8つすべてについての正直な結論は変わらない。エンジンを乗り換えることは請求額とベンチマークのスコアを動かす。それはあなたのドキュメントが答えたことのない何かを顧客が尋ねたときに起こることを変えない。そのギャップを埋めるには検索、信頼度しきい値、引き渡しが必要だ。どのモデルのアップグレードもそれをあなたの代わりにやってはくれない。AIチケット分類のベンチマークを読むのにもう1日午後を費やす前に、それに取り組む価値がある。
よくある質問
Inkling-Smallの最良の代替は何ですか?
Inkling-Smallより安い代替はありますか?
なぜInkling-Smallから乗り換えるべきですか?
Inkling-Smallは本当に1Mのコンテキストウィンドウを持っていますか?
どのInkling-Small代替が最も優れたオープンライセンスを持っていますか?
サポートチケットでInkling-Small代替を運用するにはどのくらいコストがかかりますか?
トークン単位で支払う代わりに、Inkling-Small代替を自分でホストできますか?
Inkling-Small単体でカスタマーサポートに十分ですか?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






