2026年、Inkling-Smallの代替8選

Kurnia Kharisma Agung Samiadjie
執筆者

Kurnia Kharisma Agung Samiadjie

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 4, 2026

専門家による検証済み
小さなモデルが片隅に置かれ、5つの代替モデルが光を浴びている

なぜ人々はすでにInkling-Smallの先を見ているのか

Thinking Machines Labは2026-07-30にApache 2.0のもとでInkling-Smallをリリースした。親モデルから15日後だ。売り込みは妥当なもので、モデルは実際にそれを果たしている。親モデルの4分の1のサイズで、より速く、より安く、ベンダー自身のカードでもSWE-bench Verifiedで親モデルを上回っている、80.2対77.6だ。

r/LocalLLaMAでの反応は「small」という言葉について言いたいことがたくさんあった。ローンチスレッドで3番目に高評価のコメントは、ベンチマークについてまったく触れていない。

Reddit

「もうすぐ、これら全部の2-3Tモデルの後に、500-700Bモデルを『small』と呼ぶようになるんだろうな…12GBのVRAMで泣きながら

まあ、それはそうだ。ただ命名がモデルから人を離れさせる理由ではない。何を知っているかがその理由だ。

Artificial AnalysisはIntelligence Indexを40、101モデル中15位としており、それなりに立派だ。しかし同じページのAA-Omniscience知識テストでは、指数**-9.0**、正解率30.5%、ハルシネーション率**56.9%**と報告されている。AAはこの評価を「知識の信頼性とハルシネーション」を-100から100の範囲で測定するものと説明している。だからここでのマイナスの数字は丸め誤差の類ではない。モデルが持っていない答えに手を伸ばしているということだ。

AA-Briefcaseの内訳は、私が何度も戻ってしまう部分だ。総合Eloは917.13で、分割するまではあまり多くを語らない。プレゼンテーションが1067.99に対して、分析の質は797.13。モデルは実際に知っている以上に良い回答を書く。

自分のハードウェアでこれらのモデルを動かしている人々は、ベンチマーク表よりも鋭い軸でこれを早々に見つけていた。

Reddit

「でもOmniscience指数ではGPT 5.5 Lunaより悪い、答えを作り上げすぎるからだ。ハルシネーション率84%、だから私は他のオープンモデルを好む、それらは自分の不確実性を『検出』するのが上手い」

その84%という数字は、AAのページに今日載っている56.9%より高い。だからこの正確な数字はあくまで彼らの見立てとして受け取ってほしい、私のものではない。どちらにしても要点は成り立つし、それは正しい指摘だ。彼らはコードを書く能力ではなく、知らないことを知っているかどうかでモデルを選んでいる。

チームがInkling-Smallを離れる3つの理由、それぞれ異なる代替モデルを指している
チームがInkling-Smallを離れる3つの理由、それぞれ異なる代替モデルを指している

他にも3つ、人々をそこから遠ざける要因がある。価格はその中に含まれない。

コンテキストウィンドウはコンテキストウィンドウではない。 AAはこのモデルを1Mトークンとして掲載している。実際に2つのプロバイダーが提供しているのは256,000(Thinking Machines)と524,288(DeepInfra)だ。だからカードで「1M」を読んでその数字を前提に構築した人は、それを得られていない。親モデルでも同じ問題があり、そこでは3つのプロバイダーの中で最も良い提供値が524k、DeepInfraの最も安くて速い行は131kで頭打ちになっている。

2プロバイダーは薄い。 親モデルには3つあり、DeepSeekやGLMを提供する集団はさらに大きい。ローンチ日には、このモデルはOpenRouterにさえ載っていなかった。あるコメンターがパラメータ数と併せてHacker Newsでこのギャップを指摘している。得られる2つのプロバイダーの振る舞いも異なる。DeepInfraは10kのワークロードで1.43倍速いが、100kではファーストパーティーに遅れを取る、82.36トークン/秒対113.36だ。レイテンシのプロファイルはプロンプトの長さによって変わり、それは本番環境で発見するには非常に厄介なことだ。

薄いカバレッジはまた、プロバイダーが手抜きを始めたときに他を探す余地を狭める。これは公開されたベンチマークが示すよりも頻繁に起きている。

Hacker News

「実際に、多くの推論プロバイダーが重みやKVキャッシュさえも量子化していることがわかった。低価格で大規模バッチで提供しているため、結果としてスループットが不安定になっている」

価格は一つの数字ではない。 ファーストパーティーは入力0.30ドル、出力1.20ドルだ。DeepInfraはより長いコンテキストに対して0.58ドルと1.44ドルを要求する。ブレンドした場合、AAはデフォルトの7:2:1の比率で0.222ドルを示しているが、古典的な3:1のブレンドでは0.525ドルになる。だから最終的に引用する単一の数字が何であれ、それは実際には比率についての選択であり、その選択はAIカスタマーサービスのコストを大量にモデリングする段になって重要になる。

公平を期すなら、これらすべてが悪いモデルを意味するわけではない。推論はその出力の課金の95.5%を占め、それがまさに知能の来所であり、GPQA Diamondの89.5%とロングコンテキスト推論の63%は本物の数字だ。この製品は「実行者」だ。問題が始まるのは、実行者に「知る者」であることを求めたときだけだ。

この8つをどのように選んだか

私はこの種のまとめをたくさん書いてきたが、罠は毎回同じだ。ベンチマークでランク付けし、公開し、次に進む。だから今回はフィルターをもっと狭く保った。

8つそれぞれが、Inkling-Smallユーザーが今週中に移行できるものでなければならなかった。つまり公開価格を持つライブの公開APIで、ウェイティングリストなしだ。すべての価格は比較サイトではなくベンダー自身の請求ページから2026-08-05に取得した。比較サイトの数字は2週間以内に古くなるからだ。プロバイダーが提供コンテキストと宣伝コンテキストの両方を公開している場合は、片方を他方と照合した。ライセンスも読んだし、それは重要だった。ここにあるモデルのうち2つには収益しきい値がライセンスの中に埋め込まれているからだ。

やらなかったのは、6か月分の本番トラフィックが8つすべてを通ったかのように装うことだ。ドキュメントと請求ページ、モデルカード、AAの測定結果を読み、それらが裏付けることだけを述べた。

Inkling-Smallの最良の代替、一覧

以下の価格はすべて100万トークンあたりUSDで、2026-08-05に確認したものだ。

モデル最適な用途重みパラメータ入力出力実際のコンテキスト入力モダリティ落とし穴
Inkling-Small(基準)安価なエージェント実行Apache 2.0276B / 12Bアクティブ(AAでは266B)0.30ドル1.20ドルファーストパーティー256K、DeepInfraで524,288テキスト、画像、音声知識指数-9.0
DeepSeek V4 Flash同じ仕事を4分の1のコストでMIT284B / 13B0.14ドル0.28ドル1Mテキスト2倍のピーク時課金が予告されている
Inkling(親モデル)ファミリーに留まりつつ、より多くを知るApache 2.0975B / 41B1.00ドル4.05ドル最良524K、最安131Kテキスト、画像、音声2つのAAページが異なる価格を提示
GLM-5.2ホストできる最強のオープンウェイトMIT総計約753B1.40ドル4.40ドル1Mテキスト出力128Kの上限
MiniMax M3Inkling-Smallの価格で動画入力独自コミュニティライセンス428B / 23B0.30ドル1.20ドル1M、512K保証テキスト、画像、動画デフォルトで非商用
Kimi K3長時間のエージェント作業独自ライセンス(Kimi K3 Licence)2.8T3.00ドル15.00ドル1,048,576テキストバッチ層なし、エントリー層は3RPM
Qwen3.8-Maxクローズドモデル、余裕あるウィンドウクローズド非公開2.00ドル6.00ドル1Mテキスト1モデルに2つの価格
Gemini 3.6 Flash上乗せなしの音声入力クローズド非公開1.50ドル7.50ドル1,048,576テキスト、画像、動画、音声、PDF出力上限65,536
Claude Opus 5誤答がお金に直結するときクローズド非公開5.00ドル25.00ドル1M、上乗せなしテキスト、画像新しいトークナイザーが約30%多くトークンを生成

あなたが離れる理由に合うInkling-Smallの代替はどれか?

今週のあなたに一番近い文章を選んでください。

Claude Opus 5を選ぶ、予算が厳しければ親のInklingを

5.00ドル / 25.00ドルOpus 5、100万トークンあたり 1.00ドル / 4.05ドルInkling、100万トークンあたり 2.05 対 -9.0Inkling対Small、AA-Omniscience

Inkling-Smallの知識指数はマイナスで、親モデルはプラスだ。だから最も安価な本当の解決策は、同じファミリー内で一段上に上がることだ。同じライセンス、同じツール、出力価格は約3.4倍。Opus 5はもっとコストがかかるが、誤答が返金、コンプライアンス問題、または顧客の離反を意味する場合に頼るべき選択肢だ。

このリストのどのモデルもゼロには到達しない。自社文書へのグラウンディングと信頼度ゲートは、ここにあるどのアップグレードよりも精度に効く。

DeepSeek V4 Flashを選ぶ

0.14ドル / 0.28ドル100万トークンあたり 4.3倍Inkling-Smallより出力が安い MIT重みのライセンス

キャッシュヒットは100万あたり0.0028ドルまで下がる。これは自身のキャッシュミス率の50分の1で、繰り返しの多いワークロードは非常に速く非常に安くなる。MITの重み、1Mコンテキスト、公開されている上限で2,500の同時リクエスト。MiniMax M3は次点で、Inkling-Smallと全く同じ価格に動画入力を加えている。

DeepSeekは北京時間の09:00-12:00と14:00-18:00に2倍のピーク時課金を予告している。開始日はまだないので、ピーク時は倍額の料率でモデル化しておくこと。

DeepSeek V4 FlashまたはGLM-5.2を選ぶ

1M提供、両モデル 256KInkling-Small、ファーストパーティー 384K / 128K最大出力、DeepSeek / GLM

両方とも1Mウィンドウを宣伝し、両方とも実際にそれを提供している。これが重要な違いだ。GLM-5.2は200KだったGLM-5.1と同じ価格なので、ウィンドウは無料で手に入ったことになる。ただし出力の上限には注意。DeepSeekは出力384Kを許可するが、GLMは128Kで頭打ちだ。

長いコンテキストと長いコンテキストの推論は別物だ。Inkling-SmallはAAのロングコンテキスト推論テストで63%のスコアだ。ウィンドウを大きくするだけでは記憶の問題は解決しない。

Kimi K3を選ぶ、音声が必要ならGemini 3.6 Flashを

3.00ドル / 15.00ドルKimi K3、100万あたり 1.50ドル / 7.50ドルGemini 3.6 Flash、100万あたり 2.8TKimi K3のパラメータ数

Kimi K3は長時間のエージェント実行のために作られており、その重みは公開されていて、4ビットで2.8兆パラメータだ。Gemini 3.6 Flashはテキスト、画像、動画、音声、PDFにわたって一律の入力料率を課している。これは珍しく、入力が混在している場合には有用だ。

Kimi K3にはバッチ層がなく、エントリーの支出層では1分あたり3リクエストしか許可されない。コミットする前にトラフィックに対するレート制限を確認すること。

1. DeepSeek V4 Flash

最適な用途: Inkling-Smallがやることを、出力コストのおよそ4分の1で行う。

DeepSeekの無料ウェブチャットインターフェース、DeepSeekより

これは実際のInkling-Smallユーザーが最初に手を伸ばす比較であり、r/LocalLLaMAのローンチスレッドで最も内容のあるトップコメントでもあった。

Reddit

「DSV4 Flashと比べてどうなんだろう。Artificial Analysisの知能ベンチマークでは同等(どちらも40)。ただコーディングやエージェント系のワークフローは少し得意なようだ」

これがその実態だ。DeepSeek V4 Flashは総計284B、アクティブ13Bで動作し、Inkling-Smallの12Bと並ぶ。AAはどちらも40としている。似たエンジン。似ていない請求額。

パラメータ数が隠していることが一つあり、それはセルフホスティングを検討しているなら重要だ。DeepSeekはネイティブでFP4とFP8混合で配布されるのに対し、Inkling-Smallはbf16で配布される。だからネイティブ精度では、あるローカルランナーが片方を約160GB、もう片方を540GBと計測した。紙の上では同程度のサイズ。実際には3倍のメモリだ。

機能。 Hugging Face上のMITライセンスの重み、加えて1Mのコンテキストウィンドウと最大384Kの出力、これはこのリストの中でも群を抜いて最大だ。レート制限は分あたりのリクエスト数ではなく同時実行数によるもので、公開されている上限はアカウントあたり2,500の同時リクエストだ。

利点。 キャッシュの経済性が本当の見どころだ。キャッシュヒットは100万入力トークンあたり0.0028ドルで、キャッシュミス率の0.14ドルの50分の1だ。安定したシステムプロンプトを持つものは何でもばかばかしいほど安くなる。そしてMITはこのグループの中で最もクリーンなライセンスで、収益しきい値もクレジット表記の義務もない。

欠点。 テキストのみなので、これまでInkling-Smallに投入していた音声には行き場がなくなる。また価格ページには、北京時間09:00-12:00と14:00-18:00の間に将来的な2倍のピーク時課金を予告する脚注があり、発効日は「公式発表による」となっている。あなたのコストモデルに埋め込まれた既知の未知数だ。

価格。 100万あたり入力0.14ドル、出力0.28ドル、キャッシュヒットは0.0028ドル。Proは0.435ドルと0.87ドルで、これはFlashのちょうど3.1倍だ、両方向で。詳細な計算例はDeepSeek V4 Flashの価格の記事にあり、Kimi K3との比較も別途行っている。

私の見解: お金が離れる理由なら、ここで読むのをやめて構わない。精度が理由なら読み進めてほしい。安くなることがモデルに多くを知らせることには繋がったことがないからだ。

2. Inkling、親モデル

最適な用途: 同じ重み、同じツール、同じライセンスに留まりながら、事実の正確性を買い戻す。

1,048.6kのコンテキストカウンターとともにUnsloth Studioでローカル実行されるInkling、Unslothより
1,048.6kのコンテキストカウンターとともにUnsloth Studioでローカル実行されるInkling、Unslothより

小さなモデルへの最も興味深い代替は、しばしばそれが蒸留された元の大きなモデルであり、ここでは数字がその主張を明確に裏付けている。同じAAの方法論の下で、InklingはIntelligence Indexで41を記録し、Smallの40とほぼ同等だ。AA-Omniscienceでは差が出る。2.05、正解率39.95%、対して**-9.0と30.5%**。ほぼ3分の1多くの質問が正しく返ってくる。

機能。 66層にわたって総計975B、アクティブ41B、Apache 2.0、そしてテキストに加え画像と音声の入力。今は3つのサービングプロバイダーがあり、ローンチ時は1つだった。DeepInfra、Together AI、Thinking Machinesだ。

利点。 同じライセンス、同じファミリーなので、移行はほとんどモデル文字列を変えるだけだ。DeepInfraのFP8の行は速く、201.5トークン/秒で、そこでのIntelligence Indexタスクあたりのコストは0.4296ドルと、このクラスとしては安い。

欠点。 現在、2つのAAページが価格について一致していない。だからどちらを引用しているのか把握しておく必要がある。モデルページは入力1.87ドル、出力4.68ドルと記載している。プロバイダー各行はすべて1.00ドルと4.05ドルと記載している。それらのプロバイダーの数字は3つすべてで一貫しているので、私が計画するならその組み合わせにするだろう。提供コンテキストも同様に混乱している。最良で524k、DeepInfraの安くて速い行は131k、つまり宣伝されている100万の13.1%で頭打ちになる。

価格。 プロバイダーのデータでは、入力1.00ドル、出力4.05ドル、キャッシュヒットで0.17ドル、ブレンドで0.724ドル。Smallの出力料率の3.4倍と言っていいだろう。親モデルの方を検討しているなら、Inklingの代替の記事がより広いラインアップを取り上げている。

私の見解: 明白な選択であり、そして多くの人が飛ばしてしまう選択でもある。「大きい兄弟にアップグレードする」ことが、小さい方が失敗だったと認めるような気がするからだ。そうではなかった。それは知識の仕事には合わない道具だったというだけだ。

3. GLM-5.2

最適な用途: 現実的にセルフホストできる、このリストの中で最も強力なオープンウェイト。

Z.aiによるGLM-5.2のローンチ資料、Z.aiより

GLM-5.2は、MITライセンス圏内に留まったままステップアップできるモデルだ。総計約753Bパラメータ、APIが実際に提供する1Mコンテキスト、zai-org/GLM-5.2リポジトリで223万ダウンロード。このダウンロード数は、セルフホスティングのコミュニティがすでに徹底的にストレステストしていることを示している。

機能。 1Mコンテキストと最大出力128KのMITウェイト、そしてキャッシュ入力は0.26ドル、キャッシュストレージは今のところ無料とされている。Z.aiはサブスクリプションの道も販売している。Coding Planは月18ドルから始まり、12.60ドルに割引され、週に10,000クレジットが付く。

Z.aiは独自の努力レベル曲線を公開しており、目玉のスコアを額面通りに受け取るより、それを見た方が良い。

Z.aiのチャート、エージェント的コーディングのスコアとタスクあたりの平均出力トークンを比較し、GLM-5.2とGLM-5.1を2つのClaude Opusバージョンと比べている、Z.aiより
Z.aiのチャート、エージェント的コーディングのスコアとタスクあたりの平均出力トークンを比較し、GLM-5.2とGLM-5.1を2つのClaude Opusバージョンと比べている、Z.aiより

利点。 GLM-5.2はGLM-5.1と同じコスト、1.40ドルと4.40ドルで、その間にコンテキストウィンドウは200Kから1Mへと拡大した。純粋な無料アップグレードだ。収益条項のないMITライセンスも、プロダクトの中でこれを使い始めれば、ベンチマークの1、2ポイントより価値がある。

欠点。 その128Kの出力上限は、ここにあるオープンウェイトの選択肢の中で最も厳しく、DeepSeekの384Kと対照的だ。Coding Planのクレジットはピーク時に3倍、オフピーク時に2倍で消費され、オフピークは9月末まで一時的に1倍になっている。だからサブスクリプションの計算には注意が必要だ。

価格。 入力1.40ドル、出力4.40ドル、キャッシュ0.26ドル。少なくて我慢できるなら、より安い兄弟モデルもある。GLM-4.7とGLM-4.6はどちらも0.60ドルと2.20ドル、GLM-4.7-FlashXは0.07ドルと0.40ドルだ。

私の見解: このリストの中で最良のライセンス対能力のトレードオフだ。法務チームがベンダーが条件を変更した日に何が起こるかを尋ねたことがあるなら、この行を指し示すといい。

4. MiniMax M3

最適な用途: Inkling-Smallの正確な価格に一致させつつ、動画入力を加える。

MiniMax M3のモデルページ、MiniMaxより

これは価格の完全一致であり、それが比較を異例なほど明快にしている。入力512K未満では、MiniMax M3は入力0.30ドル、出力1.20ドルを課しており、Inkling-Smallのファーストパーティー料率と同一だ。428Bモデル、アクティブ23Bから成る。これによりコスト以外のすべてで選ぶことになる。

機能。 最小保証512Kを含む1Mコンテキスト、キャッシュ読み込みは0.06ドル、そしてimage_urlvideo_urlのコンテンツ部分から届くテキストに加え画像と動画の入力。思考モードはオンでもオフでも同じコストだ。重みはHugging Face上のMiniMaxAI/MiniMax-M3で公開されており、これまでに170,353ダウンロードだ。

利点。 同じ金額でInkling-Smallのほぼ2倍のアクティブパラメータ、加えて動画入力もあり、このリストの同価格帯で他に提供しているものはない。価格ページは現在の料率を「永続50%オフ」と表示しており、期限はどこにも記載されていない。

欠点。 ライセンスがここでの本当の落とし穴だ。MINIMAX COMMUNITY LICENSEはデフォルトで非商用であり、商用利用には目立つ「Built with MiniMax M3」のクレジットが必要で、年間収益2000万ドルを超えると書面での許可が必要になる。入力512Kを超えると両方の料率が2倍になり、0.60ドルと2.40ドルになる。Priorityティアも存在し、1.5倍で、速いキューがそれに値するなら選べる。

価格。 入力512Kまでは0.30ドルと1.20ドル、それを超えると0.60ドルと2.40ドル、キャッシュ読み込みは0.06ドル。Priorityは0.45ドルと1.80ドル、しきい値を超えると0.90ドルと3.60ドルだ。

私の見解: 良いエンジンだが、座って読む必要のあるライセンスだ。収益ラインを下回るスタートアップで、クレジット表記を喜んで載せられるなら、離れる先よりドルあたりのモデル性能をここで多く得られる。

5. Kimi K3

最適な用途: トークン価格よりも実行そのものが重要な、長時間のエージェント作業。

Kimiのチャットインターフェース、Moonshot AIのアシスタント兼エージェントフロントエンド、Moonshot AIより

Kimi K3はこれまでの何よりもはるかに大きな飛躍で、Moonshot自身の価格ドキュメントでは「長時間のコーディングとエンドツーエンドの知識作業」のフラッグシップと呼んでいる。4ビットのmxfp4で提供される2.8兆パラメータで、これは重みをダウンロードできるこのリストの中で最大のモデルでもある。

機能。 1,048,576トークンのコンテキスト、reasoning_effort設定(low、high、max、デフォルトはmax)の裏にある常時稼働の推論、そして制限のないmoonshotai/Kimi-K3リポジトリ。ウェブ検索は別途課金され、成功したコールごとに0.005ドルだ。

利点。 この規模でのオープンウェイトは珍しい。キャッシュヒットの0.30ドルとキャッシュミス入力の3.00ドルの比率は、コンテキストが繰り返されるたびに10倍の節約にもなる。そして中間帯はkimi-k2.7-codeのようなより安い兄弟モデルで0.95ドルと4.00ドルとカバーされている。

欠点。 運用上の落とし穴が2つあり、両方が痛手になる。K3はバッチ層に対応していないため、他のKimiモデルが受けられる60%のバッチ割引が届かない。ティアシステムも支出に応じたゲート制だ。ティア0では累積チャージ1ドルで同時1リクエストと1分あたり3リクエストが許可され、ティア5の3,000ドルに達すると同時1,000、10,000RPMまで上がる。ライセンスはMIT風に見えるが、直近12か月の任意の期間で収益2000万ドルを超えるモデル・アズ・ア・サービス事業に対して別途契約を要求する条項が加えられている。

価格。 入力3.00ドル、出力15.00ドル、キャッシュヒットで0.30ドル。Inkling-Smallの出力料率の12.5倍なので、誰もこれを横移動だと誤解すべきではない。ティア表の全体はKimi K3の価格にある。

私の見解: ワークロードが数千の短い回答ではなく1つの長いエージェント実行であるときの選択肢だ。チケット型のトラフィックでは、3分の1の価格のGLM-5.2に対してこれを正当化するのは難しくなる。

6. Qwen3.8-Max

最適な用途: きちんと余裕のあるウィンドウと無料トライアル分を持つクローズドモデル。

Qwenのチャットインターフェース、Alibaba Cloudのアシスタント兼APIフロントエンド、Alibaba Cloudより

Qwen3.8-Maxは、オープンウェイトが本題ではないと決め、Alibabaの最上位商用ティアがそうだと決めたときに行き着く場所だ。請求ページでの嬉しい驚きは、Maxがついに入力長のブラケットを廃止したことだ。1つの帯で、100万トークンのウィンドウ全体をカバーする。

機能。 1Mコンテキスト、最大出力131K、最大推論262K、TPMは200万に対しRPMは15,000。暗黙のキャッシュは0.25ドル。90日間有効な100万トークンの無料クォータもある。

利点。 入力長のティア分けがないことは、聞こえる以上に大きな話だ。Alibabaのティア制ルールはオールオアナッシングで動くため、旧qwen3-maxでは境界を越えるとリクエスト全体が再計算され、33Kトークンのプロンプトが入力で1.20ドルから2.40ドルに跳ね上がった。ここではその落とし穴がなくなっている。無料の100万トークンも、きちんと評価するための実際の余裕を与えてくれる。

欠点。 1つのモデルIDに、展開スコープによって2つの価格がある。InternationalとSingaporeの表では2.00ドルと6.00ドル、Globalの表では1.65ドルと4.951ドルだ。裏に振る舞いの違いが何もない18%の差は、予算を組む上で紛らわしい。無料クォータはシンガポール限定で、そのタイマーは無活動でも停止せず、残った分は期限切れで無効になる。バッチは50%オフだが、キャッシュ割引とは併用できない。Maxもクローズドで、公開されているQwenの重みは2世代遅れており、最新のものは2026-04-24付けだ。

価格。 InternationalとSingaporeで入力2.00ドル、出力6.00ドル、Globalでは1.65ドルと4.951ドル。明示的なキャッシュ作成は2.50ドルで、これは入力の125%だ。詳細はQwen3.8-Maxの価格の記事にあり、逆方向で検討しているならQwen3.8-Maxの代替のまとめもある。

私の見解: しっかりしているが、より少なく要求して重みまで渡してくれるGLM-5.2と比べるとやや高め。無料クォータはそれでも試す理由になる。

7. Gemini 3.6 Flash

最適な用途: メディアの上乗せなしでの音声とマルチメディア入力。

GoogleのGeminiウェブアプリ、Googleより

音声入力のためだけにInkling-Smallを使っていましたか?それならこれが、実際のサービスレベルを備えた最も近い代替だ。Gemini 3.6 Flashテキスト、画像、動画、音声、PDFをカバーする一律1.50ドルの入力料率を課しており、これはGoogle自身が設定してきたパターンを打ち破っている。Gemini 2.5 Flashでは、音声入力はテキストの0.30ドルに対して1.00ドルかかり、2.0 Flashではその倍率は7倍にまで達していた。

機能。 入力1,048,576トークンに対し出力65,536、キャッシュは100万あたり0.15ドルに加えて保存1時間あたり100万あたり1.00ドル、BatchとFlexのティアはどちらも半額の0.75ドルと3.75ドルだ。

利点。 ここでの目立つ点は一律のメディア料率であり、0.75ドルと3.75ドルのBatchティアはバルクの作業を手頃にする。Googleの価格ページはこれをプレビューではなく安定版として掲載しており、これが顧客に近い場所で使われるならそれは重要だ。

欠点。 その65,536の出力上限はここで最も厳しく、長い生成は分割する必要がある。ストレージベースのキャッシュ課金は1回限りではなくメーターとして動作し、他のフラットなキャッシュ読み込み料率とは異なる。重みはクローズドなので、セルフホスティングはできない。Gemini 3.xのグラウンディングも無料ティアでは利用できず、評価にはお金がかかることになる。

価格。 標準は入力1.50ドル、出力7.50ドル、BatchまたはFlexは0.75ドルと3.75ドル、Priorityは2.70ドルと13.50ドルだ。予算が制約になる場合、Gemini 3.5 Flash-Liteは0.30ドルと2.50ドルで、音声の区分もない。全体のはしごはGemini 3.6 Flashの価格にある。

私の見解: 音声の選択肢だ。また、二の足を踏むことなく大量の混合メディアを送りたい、ここで唯一のモデルでもある。

8. Claude Opus 5

最適な用途: 自信満々な誤答が実際のお金に直結するケース。

Claudeのウェブアプリ、Anthropicより

これははしごの最も遠い端であり、リストに入れた理由の一つだ。Inkling-Smallが抱える特定の問題に答えている。Claude Opus 5は入力5.00ドル、出力25.00ドルで、Inkling-Smallの出力料率のおよそ21倍だ。誤答による損失がトークン代を上回るときに、それを買うことになる。

機能。 標準価格で1Mのフルコンテキストで、ロングコンテキストの追加課金ティアがない、これは珍しい。Anthropicの価格ドキュメントがそれを説明している。900kトークンのリクエストは、9kトークンのものと同じトークンあたりの料率で課金される。キャッシュ読み込みは0.50ドルだ。Batch APIは両方向に一律50%オフを適用し、2.50ドルと12.50ドルになり、キャッシュとも併用できる。

利点。 コンテキスト長の断崖がないことで、課金の思いがけない事態というカテゴリー全体が消える。拡張思考には別料金がなく、標準出力として課金される。Batchとキャッシュを組み合わせることでも、大量の繰り返しワークロードを定価から大きく引き下げられる。

欠点。 どんなコスト比較でもトークナイザーが落とし穴になる。Anthropicは、Claude 4.7以降が古いトークナイザーに比べて「同じテキストに対して約30%多くのトークンを生成する」と記している。だからこの25.00ドルのラベルは、まだ古いトークナイザーを使っているライバルとの実際のタスクあたりの差を過小評価している。Fastモードは両方向を2倍にして10.00ドルと50.00ドルにし、ファーストパーティーAPIのみで動作し、Batchとは併用できない。重みはクローズドだ。

価格。 標準5.00ドルと25.00ドル、Batch 2.50ドルと12.50ドル、Fastモード10.00ドルと50.00ドル、キャッシュ読み込み0.50ドル。より安価な選択肢はSonnet 5で、2026年8月31日まで2.00ドルと10.00ドル、9月1日には3.00ドルと15.00ドルに変わる。その差が支払う価値があるかどうかは、Opus 5対Sonnet 5の比較記事で取り上げている。

私の見解: 大半のチケットトラフィックには過剰で、お金、方針、契約に関わる5%にはちょうど良い。すべてに1つのモデルを選ぶのではなく、質問の種類でルーティングすべきだ。

価格のはしご、1枚の図で

出力価格でこの8つを並べれば、決定の形が明らかになる。

7モデルにわたる100万トークンあたりの出力価格の棒グラフ、Inkling-Smallは範囲の下端近くで強調表示されている
7モデルにわたる100万トークンあたりの出力価格の棒グラフ、Inkling-Smallは範囲の下端近くで強調表示されている

Inkling-Smallはすでに底に近い。意味のある下降が一段だけ存在する、0.28ドルのDeepSeek V4 Flashだ。そして同じ価格の横移動としてMiniMax M3がある。他のすべてはここではステップアップであり、ステップアップが買うものは決して速度ではない。

これがチケットの量においてどのくらいのコストになるか、計算しておく価値がある。1か月に1000チケット、1回答あたり2,000出力トークンとしよう。これはサポートの返信としては十分に多めだ。つまり200万出力トークンだ。

モデル出力コスト、200万トークンInkling-Smallとの比較
DeepSeek V4 Flash0.56ドル1.84ドル安い
Inkling-Small2.40ドル基準
MiniMax M32.40ドル同一
GLM-5.28.80ドル6.40ドル高い
Inkling8.10ドル5.70ドル高い
Gemini 3.6 Flash15.00ドル12.60ドル高い
Kimi K330.00ドル27.60ドル高い
Claude Opus 550.00ドル47.60ドル高い

この量では、最安から最高までの差は月あたりおよそ50ドルだ。1件のエスカレーションを下手に処理すれば、それ以上のコストがかかる。それがはしごを上る本当の理由であり、また、モデル選択が最も大きなレバレッジのある場所ではない理由でもある。

サポートキューにおいて、これらのどれも解決しないこと

上記の8行のうち、どれも次の部分を解決しない。だから誰かが安いモデルを見つけたと言うたびに、私は反論を続けている。

私はこの正確な失敗が支払い中のアカウントで起きるのを見てきた。検索が空振りしたときにモデルは止まらない。学習で得たものから穴を埋める。あるデンマークの太陽光エネルギープロバイダーの顧客は、ボットにサブスクリプションの主張を作り上げさせて実際の顧客に送らせてしまった。別の顧客はボットに質問をして「酸素(周期表)」という答えを受け取った。いずれのケースも悪いモデルではなかった。両方とも、何にもグラウンディングするものがなく、推測を止めるものが何もないモデルだった。

私たちのアカウントの、あるサポートマネージャーは、AIに何をすべきでないかを伝えることで、同じ懸念をもっと平易な言葉にした。

「顧客に、私たちが何とかしますと言うのはやめてくれ。それはわからないだろう」

これはEコマースのサポートマネージャーで、ボットが配送日を過大に約束することを心配していた。同じ形の問題だ。モデルは自信を持っているように聞こえ、その自信を持っているように聞こえることこそが危険な部分だ。Inkling-Small自身のAA-Briefcaseの分割がそれを言い切っている。分析よりプレゼンテーションが270.86 Eloポイント優れている。

1つの顧客質問に対する2つの道:記憶から答える生のモデル対、自信を評価してエスカレーションするグラウンディングされたモデル
1つの顧客質問に対する2つの道:記憶から答える生のモデル対、自信を評価してエスカレーションするグラウンディングされたモデル

大きなモデルが解決策ではない。モデルが標準搭載していない2つのことがそれに当たる。まず、答えがパラメトリックな記憶ではなく、あなたのヘルプセンターと過去のチケットから出てくるようにするグラウンディング。次に、しきい値未満のものはすべて出て行く前に人間に渡す信頼度ゲートだ。この2つが、生のエンジンを実際のキューに向けられるものに変え、それがまさにAIハルシネーション防止というテーマの全体だ。

人々がモデル比較をやめる別の理由は、それよりもっと地味なものだ。ITインシデントのナレッジベースを構築していた、私たちが話をした、ある構築者はすでに一巡していた。あるベンダーのAPIを試してコストが高すぎると感じ、別のを試して信頼性がないと感じ、最終的にただ動くものを求めるようになった。モデルを比較するのは楽しい。モデル層を維持するのはそうではない。

eeselを試す

選ぶモデルが顧客の質問に答えることになるなら、正直なアドバイスは2つに分かれる。上記8つのうち、あなたの予算とライセンスに合うものを選ぶこと。そしてその上の層を自分で構築しないことだ。

その層こそがeeselだ。ZendeskFreshdesk、あるいは既に使っている何にでも接続し、モデルの学習データではなく過去の解決済みチケットとヘルプセンターから学び、あなた自身が設定する信頼度しきい値を超えたときにだけ返答する。それ未満のすべてはエスカレーションされる。そして実際のトラフィックに触れる前に、自分自身のチケット履歴に対してシミュレーションできる。それが、顧客が気づく前に何を間違えたであろうかを学ぶ方法だ。

eeselのAIヘルプデスクダッシュボード、AIチームメイトがサポートチケットを解決し下書きする様子
eeselのAIヘルプデスクダッシュボード、AIチームメイトがサポートチケットを解決し下書きする様子

私は自社の測定された事実誤り率7%を隠すのではなく先頭に置いている。それがモデルを選んでいる間に重要な数字だからだ。それはドイツのジュエリー小売業者の実際のZendeskトラフィック、月あたりおよそ1000チケットから得られたもので、284のチャットと100のチケットにわたって相互検証され、実際のヘルプセンターに対する検索を伴っていた。グラウンディングはゼロにはしてくれない。測定でき、ゲートをかけ、そして改善できる数字を与えてくれる。それは自信満々に推測するモデルとは全く別のカテゴリーのものだ。

商業面の設計も意図的に座席単位ではない。課金は解決済みチケットあたりで行われるため、価格は人員数ではなく実際に行われた作業を追跡する。試すのは無料だ。まず数字を自分で確認したいなら、チケット削減ガイドが良い出発点になる。

私の見解

Inkling-Smallは、人々が向いていない仕事を求め続けている良い小型モデルだ。うまく実行し、価格はすでに底に近く、その知識の信頼性は-9.0だ。これら2つの事実は矛盾していない。合わせて、それは1つの道具を描いている。

コストが理由で離れるのか?DeepSeek V4 Flashを選べばそれで終わりだ。誤答が離れる原因なら、安く済ませたいなら親のInklingへ、高くても構わないならClaude Opus 5へ上がるといい。どちらもゼロには到達しないことを知った上で進むべきだ。

そしてコンテキストウィンドウがカードと一致しないことが理由なら、GLM-5.2はMITのもとで宣伝どおりのものを提供している。1つだけ選ばなければならないなら、私はその行を選ぶだろう。

しかし8つすべてについての正直な結論は変わらない。エンジンを乗り換えることは請求額とベンチマークのスコアを動かす。それはあなたのドキュメントが答えたことのない何かを顧客が尋ねたときに起こることを変えない。そのギャップを埋めるには検索、信頼度しきい値、引き渡しが必要だ。どのモデルのアップグレードもそれをあなたの代わりにやってはくれない。AIチケット分類のベンチマークを読むのにもう1日午後を費やす前に、それに取り組む価値がある。

よくある質問

Inkling-Smallの最良の代替は何ですか?
多くのチームにとっては3つに絞られます。同じ仕事をより安く済ませたいならDeepSeek V4 Flash、同じファミリーに留まりつつ事実の正確性を上げたいならInkling本体、間違った回答が実際のお金に直結するならClaude Opus 5です。本記事の全ラインアップではGLM-5.2、MiniMax M3、Kimi K3Qwen3.8-MaxGemini 3.6 Flashも取り上げています。
Inkling-Smallより安い代替はありますか?
あります。DeepSeek V4 Flashの価格は100万トークンあたり入力0.14ドル、出力0.28ドルで、Inkling-Smallの0.30ドルと1.20ドルに対して、出力はおよそ4倍安くなります。MiniMax M3は入力512K未満でInkling-Smallと完全に同じ価格です。解決あたりのコストを下げようとしているなら、モデルの費目が最大になることはほとんどありません。
なぜInkling-Smallから乗り換えるべきですか?
知識の信頼性が理由です。Artificial AnalysisはInkling-SmallをAA-Omniscience指数で-9.0、正解率30.5%と評価していますが、その親モデルは2.05、39.95%です。この差は、あなたのナレッジベースが対応していない質問をモデルにした際のサポートにおけるAIハルシネーションとして表面化します。
Inkling-Smallは本当に1Mのコンテキストウィンドウを持っていますか?
モデルカードには1Mと記載されていますが、2つのプロバイダーのどちらもそれを提供していません。Artificial Analysisによると、Thinking Machinesは256,000トークン、DeepInfraは524,288トークンを提供しています。同じ差が親モデルにも存在します。長いコンテキストが選んだ理由なら、1Mを前提に構築する前にInkling-Small解説記事を確認してください。
どのInkling-Small代替が最も優れたオープンライセンスを持っていますか?
DeepSeek V4 FlashとGLM-5.2はどちらもMITでリリースされており、このグループの中で最もクリーンな商用ポジションです。Inkling-Smallとその親モデルはApache 2.0です。Kimi K3とMiniMax M3はどちらも収益しきい値付きの独自ライセンスを持ち、MiniMaxのライセンスはデフォルトで非商用です。より詳しい調査はオープンソースAIエージェントのまとめをご覧ください。
サポートチケットでInkling-Small代替を運用するにはどのくらいコストがかかりますか?
トークンは小さい数字です。100万出力トークンあたり1.20ドルなら、1000チケットの月でも推論コストは数ドルです。実際にお金がかかるのは検索層、エスカレーションのロジック、QAであり、だからこそチームはこの層を自作せずに購入するのが普通です。当社の価格ページは座席あたりではなく解決チケットあたりで課金し、AIカスタマーサービスのコストで計算を細かく分解しています。
トークン単位で支払う代わりに、Inkling-Small代替を自分でホストできますか?
できます。DeepSeek V4 Flash、GLM-5.2、Kimi K3、MiniMax M3の重みはすべて公開されています。コストは消えるのではなくハードウェアに移り、サービング、評価、アップグレードも自分で引き継ぐことになります。AIカスタマーサービスでこの道を選んだチームは、モデルが難しい部分ではなかったことに気づくのが常です。
Inkling-Small単体でカスタマーサポートに十分ですか?
単体では不十分で、このリストの他のどれも同様です。生のモデルは検索が空振りしたときに学習データから答えようとし、それがまさに自信満々な誤答が顧客に届く経路です。解決策はグラウンディングと、引き渡しを行う信頼度ゲートで、これがAIエスカレーション管理エージェントへの引き渡しの本質です。

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
1つの小型モデルが脇に置かれ、5つの代替モデルが光を受けている様子
Alternatives

2026年版、Inkling-Smallの代替8選

Inkling-Smallは安くて速いが、測定された知識スコアはマイナスだ。実際の価格とそれぞれの落とし穴付きで、Inkling-Smallの代替8選を紹介する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
装飾豊かな一本の高い柱と、デザインの異なる8本の小さな柱
Alternatives

Claude Opus 5の代替として優れた8つのモデル(2026年版)

Claude Opus 5は独立系インデックスで1.8ポイント首位に立つが、10ポイント下のモデルよりタスクあたりのコストは86倍高い。実測のタスク単価で比較した8つの代替モデルを紹介する。

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
1本の背の高い装飾的な柱と、それを囲む8本のデザインが異なる小さな柱
Alternatives

2026年におけるClaude Opus 5の代替ツール・ベスト8

Claude Opus 5は独立指標で1.8ポイントの差でトップに立ちながら、10ポイント下のモデルよりタスクあたり86倍のコストがかかる。実測タスクあたりコストで評価した8つの代替案を紹介する。

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
開発者がモデルカードを選んでいる様子。中央にDeepSeekのクジラのカード、周囲に競合モデルのカードが並んでいる
Alternatives

2026年、DeepSeek V4 Flashの代替ベスト8選

実在する8つのDeepSeek V4 Flashの代替を、数字で比較する。価格や速度を理由に乗り換える人はいないので、Flashが実際に抱える4つのギャップでランキングした。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Skywork AIの代替となる複数のAIスーパーエージェントを検討している人物のイラスト
Alternatives

2026年のSkywork AI代替7選

2026年のベストなSkywork AI代替ツールを紹介。Manusのような汎用スーパーエージェントから、リサーチツール、デッキビルダー、サポート専用ツールまで、実際の料金付きで解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
3つの異なる音声エージェントの選択肢に話しかける発信者と、左側の Grok ロゴマーク
Alternatives

2026年版 Grok Voice Think Fast 2の代替ツール10選

Grok Voice Think Fast 2.0はデフォルトのエイリアス経路で60%の値上げとなった。実測の時間あたりコストと正直なベンチマーク数値で見る、10個の本物の代替ツール。

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
発信者が3つの異なるボイスエージェントの選択肢と話しており、左側にGrokのロゴマークがある様子
Alternatives

2026年、Grok Voice Think Fast 2の代替となる10のサービス

Grok Voice Think Fast 2.0はデフォルトのエイリアスで60%値上がりした。実測の時間あたりコストと正直なベンチマーク数値をもとに、本当に使える10の代替案を紹介する。

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Google Gemini 3.5 Proの代替をまとめた記事のヒーローイラスト
Alternatives

2026年、Gemini 3.5 Proの代替として最適な8選

Gemini 3.5 Proの代替を探している?落とし穴は、3.5 Proはまだリリースされていないこと。今すぐ使える8つのモデルを、実際の価格とおすすめポイントとともに紹介します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
GPT-5.6 Solの代替としてフラッグシップAIモデルを比較するエディトリアルイラスト
Alternatives

GPT-5.6 Sol の代替9選(2026年版)

GPT-5.6 Solは、フラッグシップの価格を持つOpenAIのフラッグシップモデルだ:100万トークンあたり入力5ドル/出力30ドルで、GPT-5.5と同じ料金。ここではSolの本当の代替9つと、それぞれが向いている相手を紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める