2026年版、Inkling-Smallの代替8選

Kurnia Kharisma Agung Samiadjie
執筆者

Kurnia Kharisma Agung Samiadjie

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 4, 2026

専門家による検証済み
1つの小型モデルが脇に置かれ、5つの代替モデルが光を受けている様子

なぜ人々はすでにInkling-Smallの先を見ているのか

Thinking Machines Labは2026年7月30日、親モデルの15日後にApache 2.0の下でInkling-Smallをリリースした。訴求内容は妥当で、モデルは実際にそれを実現している。親モデルの4分の1のサイズで、より速く、より安く、しかもベンダー自身のカードによればSWE-bench Verifiedで親モデルを80.2対77.6で上回っている。

r/LocalLLaMAの反応は「small」という言葉について色々と言いたいことがあったようだ。ローンチスレッドで3番目に評価の高いコメントは、ベンチマークについてではまったくない。

Reddit

"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"

もっともな指摘だ。だが命名は誰かをモデルから遠ざける理由にはならない。それを担っているのは、モデルが何を知っているかだ。

Artificial AnalysisはIntelligence Indexを40、101モデル中15位としており、これは十分立派な数字だ。ところが同じページのAA-Omniscienceの知識テストを見ると、指数**-9.0**、正答率30.5%、ハルシネーション率**56.9%**とある。AAはこの評価を「知識の信頼性とハルシネーション」を測るものだと説明しており、-100から100の範囲だ。つまりそこでのマイナスの数字は丸め誤差の類ではない。モデルが持ち合わせていない答えに手を伸ばしているということだ。

AA-Briefcaseの内訳が、私が何度も戻ってしまう部分だ。総合Eloは917.13で、これだけでは何もわからないが、分解すると見えてくる。プレゼンテーション1067.99に対し、分析の質は797.13。このモデルは実際に知っている以上に上手く答えを書く。

自分のハードウェアでこれらのモデルを動かしている人々は、この事実をすぐに見抜いた。しかもベンチマーク表よりも鋭い切り口で。

Reddit

"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."

この84%という数字は現在AAのページにある56.9%より高いので、正確な数字は彼らの観測として受け取ってほしい、私のものとしてではなく。いずれにせよ、この指摘の要点は変わらないし、それは正しい着眼点だ。彼らはコードをどれだけうまく書けるかではなく、知らないことを知っているかでモデルを選んでいる。

Three reasons teams leave Inkling-Small, each pointing at a different replacement model
Three reasons teams leave Inkling-Small, each pointing at a different replacement model

他にも3つ、人々をこのモデルから遠ざける要因がある。価格はその中に含まれない。

コンテキストウィンドウはコンテキストウィンドウではない。 AAはこのモデルを1Mトークンとして掲載している。だが実際に2つのプロバイダーが提供しているのは256,000(Thinking Machines)と524,288(DeepInfra)だ。カードの「1M」を読んでその数字を前提に構築した人は、実際にはそれを得られていない。親モデルでも同じ問題があり、最良の提供数値は3つのプロバイダーで524kで、DeepInfraの最安・最速の枠は131kが上限だ。

プロバイダーが2つというのは心もとない。 親モデルには3つあり、DeepSeekやGLMを提供する陣容はさらに大きい。ローンチ当日、このモデルはOpenRouterにすら載っていなかった。このギャップはパラメーター数と並んで、あるコメンターがHacker Newsで指摘している。手に入る2つのプロバイダーの挙動も異なる。DeepInfraは1万トークンのワークロードでは1.43倍速いが、10万トークンでは首位に劣る。82.36トークン/秒対113.36トークン/秒だ。プロンプトの長さによってレイテンシのプロファイルが変わるというのは、本番環境で発見するには最悪な事実だ。

薄いカバレッジはまた、プロバイダーが手を抜き始めたときに乗り換える余地を狭める。これは公開されているベンチマークが示す以上によく起きている。

Hacker News

"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."

価格は一つの数字ではない。 ファーストパーティは入力$0.30・出力$1.20。DeepInfraは長いコンテキストに対して$0.58と$1.44を求める。ブレンド後で見ると、AAはデフォルトの7:2:1比率で$0.222を示す一方、伝統的な3:1のブレンドでは$0.525になる。つまり最終的にどの一つの数字を引用するかは、実は比率の選び方次第であり、この選択はAIカスタマーサービスのコストを大量運用の規模でモデリングするときに効いてくる。

公平を期すために言えば、これらすべてが「悪いモデル」を意味するわけではない。出力の95.5%を推論が占めており、まさにそこから知能が生まれている。GPQA Diamondで89.5%、長文脈推論で63%というのは本物の数字だ。このモデルは実行者(doer)だ。困るのは実行者に知識者(knower)であることを求めたときだけだ。

この8つをどう選んだか

私はこの種のまとめ記事をたくさん書いてきたが、罠はいつも変わらない。ベンチマークで順位を付け、公開し、次に進む。だから今回はフィルターをもっと狭く保った。

8つそれぞれは、Inkling-Smallのユーザーが今週にでも乗り換えられるものでなければならなかった。つまり価格が公開された、待機リストのない現行の公開APIだ。すべての価格は比較サイトではなくベンダー自身の請求ページから2026年8月5日に取得した。比較サイトの数字は2週間もすれば古くなるからだ。プロバイダーが提供済みコンテキストと広告上のコンテキストの両方を公開している場合は、両者を照合した。ライセンスも読み、これは重要な作業だった。ここに挙げた2つのモデルには収益しきい値がライセンスに潜んでいたからだ。

やっていないのは、8つすべてに対して半年分の本番トラフィックを流したふりをすることだ。ドキュメントと請求ページ、モデルカード、AAの測定値を読み、それらが裏付ける範囲でのみ語っている。

Inkling-Smallの代替、一目で分かる比較表

以下の価格はすべて100万トークンあたり、米ドル建てで、2026年8月5日時点で確認したものだ。

ModelBest forWeightsParamsInputOutputReal contextModalities inThe catch
Inkling-Small (baseline)Cheap agentic executionApache 2.0276B / 12B active (266B per AA)$0.30$1.20256K first-party, 524,288 on DeepInfraText, image, audioKnowledge index -9.0
DeepSeek V4 FlashSame job, a quarter the costMIT284B / 13B$0.14$0.281MTextA 2x peak surcharge is announced
InklingStaying in the family, knowing moreApache 2.0975B / 41B$1.00$4.05524K best, 131K cheapestText, image, audioTwo AA pages quote different prices
GLM-5.2Strongest open weights you can hostMIT~753B total$1.40$4.401MText128K output cap
MiniMax M3Video in, at Inkling-Small's priceCustom community licence428B / 23B$0.30$1.201M, 512K guaranteedText, image, videoNon-commercial by default
Kimi K3Long-horizon agent workCustom (Kimi K3 Licence)2.8T$3.00$15.001,048,576TextNo batch tier, 3 RPM on entry tier
Qwen3.8-MaxClosed model, generous windowClosedUndisclosed$2.00$6.001MTextTwo prices for one model
Gemini 3.6 FlashAudio in with no premiumClosedUndisclosed$1.50$7.501,048,576Text, image, video, audio, PDF65,536 output ceiling
Claude Opus 5When wrong answers cost moneyClosedUndisclosed$5.00$25.001M, no surchargeText, imageNewer tokenizer emits ~30% more tokens

あなたがInkling-Smallを離れる理由に合う代替はどれ?

自分の一週間に一番近い文を選んでほしい。

Claude Opus 5を選ぼう。予算が厳しいなら親モデルのInklingを

$5.00 / $25.00Opus 5、100万トークンあたり $1.00 / $4.05Inkling、100万トークンあたり 2.05 vs -9.0Inkling対Small、AA-Omniscience

Inkling-Smallの知識指数はマイナスで、親モデルはプラスだ。つまり最も安上がりな本当の対策は、同じファミリー内でのステップアップだ。同じライセンス、同じツール群で、出力価格はおよそ3.4倍。Opus 5はずっと高くつくが、誤った答えが返金・コンプライアンス問題・顧客離れにつながる場合に手を伸ばすべきモデルだ。

このリストのどのモデルもゼロにはならない。自社文書へのグラウンディングと信頼度ゲートの方が、ここでのどんなアップグレードよりも精度に効く。

DeepSeek V4 Flashを選ぼう

$0.14 / $0.28100万トークンあたり 4.3倍Inkling-Smallより安い出力コスト MITウェイトのライセンス

キャッシュヒットは100万あたり$0.0028で、自身のキャッシュミス率の50分の1だ。繰り返しの多いワークロードは一気に安くなる。MITのウェイト、1Mコンテキスト、公開されている上限で2,500の同時リクエスト。MiniMax M3はInkling-Smallとまったく同じ料金で、動画入力までついてくる次点候補だ。

DeepSeekは北京時間09:00-12:00と14:00-18:00にピーク時2倍のサーチャージを予告している。開始日はまだ未定なので、ピーク時は倍額のレートを想定してモデリングしておくこと。

DeepSeek V4 FlashかGLM-5.2を選ぼう

1M両モデルとも提供済み 256KInkling-Small、ファーストパーティ 384K / 128K最大出力、DeepSeek / GLM

どちらも1Mのウィンドウを謳い、どちらも実際にそれを提供している。ここが重要な違いだ。GLM-5.2の価格はGLM-5.1が200Kだった頃と同じなので、このウィンドウは実質タダで手に入ったことになる。ただし出力上限には注意。DeepSeekは384K出力できるが、GLMは128Kが上限だ。

長いコンテキストと長文脈推論は別物だ。Inkling-SmallはAAの長文脈推論テストで63%しか取れておらず、ウィンドウを大きくするだけでは正答力の問題は解決しない。

Kimi K3を選ぼう。音声が必要ならGemini 3.6 Flashを

$3.00 / $15.00Kimi K3、100万あたり $1.50 / $7.50Gemini 3.6 Flash、100万あたり 2.8TKimi K3のパラメーター数

Kimi K3は長時間にわたるエージェントの実行のために作られており、そのウェイトは公開されている。4-bitで2.8兆パラメーターだ。Gemini 3.6 Flashはテキスト・画像・動画・音声・PDFにわたって単一の入力レートを課しており、これは珍しく、入力が雑多な場合には役に立つ。

Kimi K3にはバッチ枠がなく、入門支出ティアでは毎分3リクエストしか許可されない。契約前に自分のトラフィックに対してレート制限を確認すること。

1. DeepSeek V4 Flash

Best for: Inkling-Smallと同じことを、出力コストのおよそ4分の1でこなすこと。

DeepSeek's free web chat interface, as taken from DeepSeek

これは実際のInkling-Smallユーザーが真っ先に検討する比較で、r/LocalLLaMAのローンチスレッドでも最も内容のあるトップコメントだった。

Reddit

"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."

まさにそういう構図だ。DeepSeek V4 Flashは総パラメーター284B、アクティブ13Bで動作し、Inkling-Smallの12Bと並ぶ。AAは両者を40で評価している。エンジンは似ているが、請求額は似ていない。

パラメーター数が隠している一点があり、セルフホストを検討しているなら重要だ。DeepSeekはInkling-SmallがBF16でリリースされているのに対しネイティブでFP4とFP8の混在で提供されている。あるローカル実行者によれば、ネイティブ精度では約160GB対540GBだった。紙の上ではほぼ同じサイズなのに、実際にはメモリが3倍違う。

Features. Hugging Face上のMITライセンスのウェイトに加え、1Mのコンテキストウィンドウと最大384Kの出力、これはこのリストの中で群を抜いて最大だ。レート制限は毎分リクエスト数ではなく同時実行数ベースで、公開されている上限はアカウントあたり2,500同時リクエストだ。

Pros. キャッシュの経済性が本当の見どころだ。キャッシュヒットは入力100万トークンあたり$0.0028で、$0.14のキャッシュミス率の50分の1。安定したシステムプロンプトを持つものなら、とんでもなく安くなる。そしてMITはこのグループの中で最もクリーンなライセンスで、収益しきい値も帰属条項もない。

Cons. テキスト専用なので、Inkling-Smallに与えていた音声はどこにも行き場がない。また料金ページには、北京時間09:00-12:00と14:00-18:00に将来2倍のピークサーチャージを課す旨の脚注があり、発効日は「正式発表を待つ」となっている。既知の未確定要素が、コストモデルの中に潜んでいる。

Pricing. 100万トークンあたり入力$0.14・出力$0.28、キャッシュヒットは$0.0028。Proは$0.435と$0.87で、どちらもFlashのちょうど3.1倍だ。詳しい試算はDeepSeek V4 Flashの料金にまとめてあり、Kimi K3との比較も別に行った。

My take: 離れる理由が金額なら、ここで読むのをやめていい。正確性が理由なら読み続けてほしい。安くなったからといって、モデルがより物を知るようになったことは一度もないからだ。

2. Inkling, the parent

Best for: 同じウェイト、同じツール、同じライセンスのまま、事実の正確性を買い戻すこと。

Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth
Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth

小型モデルにとって最も興味深い代替は、しばしばそれが蒸留された元の大きなモデルであり、ここでもその数字がきれいにそれを裏付けている。同じAAの方法論の下で、InklingはIntelligence Indexで41、Smallの40に対してほぼ横並びだ。差が出るのはAA-Omniscienceで、2.05・正答率39.95%-9.0・30.5%。3割近く多くの質問が正しく返ってくる。

Features. 66レイヤーにわたり総パラメーター975B、アクティブ41B、Apache 2.0で、テキストと画像と音声入力に対応。提供プロバイダーはローンチ時の1社から今では3社に増えており、DeepInfra、Together AI、Thinking Machinesだ。

Pros. 同じライセンス、同じファミリーなので、移行はほぼモデル文字列を変えるだけで済む。DeepInfraのFP8枠は速く、201.5トークン/秒。そこでのIntelligence Indexタスクあたりのコストは$0.4296で、このクラスとしては安い。

Cons. 現在2つのAAページが価格について食い違っているので、どちらを引用しているのか把握しておく必要がある。モデルページは入力$1.87・出力$4.68としている。一方プロバイダー行はすべて$1.00と$4.05だ。これらのプロバイダーの数字は3社すべてで内部的に一貫しているので、それが計画すべき組み合わせだ。提供コンテキストも乱雑で、最良でも524k、DeepInfraの安くて速い枠は131k、つまり広告上の100万の13.1%に留まる。

Pricing. プロバイダーのデータでは入力$1.00・出力$4.05、キャッシュヒットは$0.17、ブレンドで$0.724。Smallの出力レートのおよそ3.4倍だ。親モデルを検討しているなら、Inklingの代替がより広いラインナップをカバーしている。

My take: 最も分かりやすい選択肢であり、それでいて多くの人が見送ってしまうものでもある。「大きい兄弟にアップグレードする」というのが、小型モデルの選択が間違いだったと認めるように感じられるからだ。だが間違ってはいなかった。ただ知識の仕事には合わない道具だっただけだ。

3. GLM-5.2

Best for: 現実的に自分でホストできる、このリスト中で最も強力なオープンウェイト。

GLM-5.2's launch material from Z.ai, as taken from Z.ai

GLM-5.2は、MITライセンスの領域にとどまったままのステップアップだ。総パラメーターは約753B、APIが実際に提供する1Mコンテキスト、そしてzai-org/GLM-5.2リポジトリで223万ダウンロード。このダウンロード数が、セルフホストコミュニティがすでに十分にこれを試し尽くしていることを物語っている。

Features. MITウェイト、1Mコンテキスト、最大出力128K、キャッシュされた入力は$0.26で、キャッシュストレージは今のところ無料とされている。Z.aiはサブスクリプションの選択肢も販売しており、Coding Planは月額$18、割引後$12.60から始まり、週10,000クレジットが付いてくる。

Z.aiは独自のエフォートレベル曲線を公開しており、見出しのスコアをそのまま受け取るより、それを見た方がいい。

Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai
Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai

Pros. GLM-5.2の価格はGLM-5.1と同じ$1.40と$4.40のままなのに、コンテキストウィンドウは200Kから1Mになった。まさに無料アップグレードだ。収益条項のないMITライセンスも、製品としてこれを出荷する段になれば、ベンチマークの1、2点よりも価値がある。

Cons. その128Kの出力上限は、DeepSeekの384Kに対してこのリストのオープンウェイト選択肢の中で最も窮屈だ。Coding Planのクレジットはピーク時に3倍、オフピーク時に2倍の速さで消費され、オフピークは9月末まで一時的に1倍になっているので、サブスクリプションの計算には注意が必要だ。

Pricing. 入力$1.40、出力$4.40、キャッシュ$0.26。より安い兄弟モデルもあり、GLM-4.7とGLM-4.6はどちらも$0.60と$2.20、GLM-4.7-FlashXは$0.07と$0.40だ。

My take: このリストの中で最良のライセンスと性能のトレードオフだ。法務チームから「ベンダーが規約を変える日には何が起きるのか」と聞かれたことがあるなら、この行を指させばいい。

4. MiniMax M3

Best for: Inkling-Smallとまったく同じ価格のまま、動画入力を追加すること。

The MiniMax M3 model page, as taken from MiniMax

これは純粋な価格の一致であり、それがこの比較を珍しくクリーンなものにしている。入力512K未満では、MiniMax M3は入力$0.30・出力$1.20を課し、これはInkling-Smallのファーストパーティレートと同じだ。しかもこちらは428Bモデルでアクティブ23B。つまりコスト以外のすべてで選ぶことになる。

Features. 1Mコンテキストで最低保証512K、キャッシュ読み取り$0.06、テキスト・画像・動画入力がimage_urlvideo_urlのコンテンツパートを通じて渡せる。Thinkingモードのオン・オフでコストは変わらない。ウェイトはHugging FaceのMiniMaxAI/MiniMax-M3で公開済みで、これまでに170,353ダウンロードされている。

Pros. 同じ金額でInkling-Smallのほぼ2倍のアクティブパラメーターに加え、動画入力も付いてくる。この価格帯でこのリストの他に動画入力を提供するものはない。料金ページには現在のレートが「Permanent 50% off」と表記されており、有効期限はどこにも書かれていない。

Cons. ライセンスこそが本当の落とし穴だ。MINIMAX COMMUNITY LICENSEはデフォルトで非商用であり、商用利用には目立つ「Built with MiniMax M3」のクレジット表記が求められ、年間収益$20Mを超えると書面での許可が必要になる。入力が512Kを超えると両方のレートが倍になり、$0.60と$2.40だ。Priorityティアも存在し、より速いキューが必要ならこちらは1.5倍だ。

Pricing. 入力512Kまでは$0.30と$1.20、それを超えると$0.60と$2.40、キャッシュ読み取りは$0.06。Priorityは$0.45と$1.80、しきい値を超えると$0.90と$3.60だ。

My take: エンジンは良いが、ライセンスは腰を据えて読む必要がある。収益ラインを下回るスタートアップで、クレジット表記を出すことに抵抗がないなら、離れようとしているモデルより多くをここで手に入れられる。

5. Kimi K3

Best for: トークン価格よりも実行の質そのものが重要な、長時間にわたるエージェント作業。

Kimi's chat interface, Moonshot AI's assistant and agent front end, as taken from Moonshot AI

Kimi K3はこれまでのどれよりもずっと大きな飛躍で、Moonshot自身の料金ドキュメントでは「長時間にわたるコーディングとエンドツーエンドの知識労働」のフラッグシップと呼ばれている。2.8兆パラメーターを4-bit mxfp4で提供しており、ウェイトをダウンロードできるモデルとしてはここで最大でもある。

Features. 1,048,576トークンのコンテキスト、reasoning_effort設定(low・high・max、maxがデフォルト)で常時推論、そしてゲートのないmoonshotai/Kimi-K3リポジトリ。ウェブ検索は別課金で、成功呼び出し1回あたり$0.005だ。

Pros. このスケールでオープンウェイトというのは珍しい。キャッシュヒット率$0.30対キャッシュミスの入力$3.00は、コンテキストが繰り返されるたびに10倍の節約になる。中間層はkimi-k2.7-codeという安い兄弟モデルがカバーしており、$0.95と$4.00だ。

Cons. 運用面での落とし穴が2つあり、どちらも痛い。K3はバッチティアに対応していないので、他のKimiモデルが受けられる60%のバッチ割引はここには届かない。ティア制度も支出額でゲートされており、Tier 0(累計チャージ$1)では同時1リクエスト・毎分3リクエストまで、Tier 5の$3,000に達すると同時1,000・毎分10,000RPMまで上がる。ライセンスは一見MITのように見えるが、年間の任意の連続12か月で収益$20Mを超えるモデル・アズ・ア・サービス事業には別途契約が必要という条項が付いている。

Pricing. 入力$3.00・出力$15.00、キャッシュヒットは$0.30。Inkling-Smallの出力レートの12.5倍で、誰もこれを横並びの移行だと勘違いすべきではない。ティア表の全容はKimi K3の料金にある。

My take: ワークロードが何千もの短い回答ではなく1つの長いエージェント実行であるときの選択肢。チケット的なトラフィックに対しては、3分の1の価格のGLM-5.2に対してこれを正当化するのは難しくなる。

6. Qwen3.8-Max

Best for: 十分に寛大なウィンドウと無料トライアル枠を備えたクローズドモデル。

Qwen's chat interface, Alibaba Cloud's assistant and API front end, as taken from Alibaba Cloud

Qwen3.8-Maxは、オープンウェイトにこだわらないと決め、Alibabaの最上位商用ティアを選んだ先にたどり着く場所だ。料金ページを見ての嬉しい驚きは、Maxがついに入力長による段階制を廃止したことだ。1つの帯域が、100万トークンのウィンドウ全体をカバーしている。

Features. 1Mコンテキスト、最大出力131K、最大推論262K、TPM200万・RPM15,000。暗黙のキャッシュは$0.25。90日間有効な100万トークンの無料枠もある。

Pros. 入力長による段階制がないというのは見た目以上に大きな意味を持つ。旧qwen3-maxではAlibabaの段階ルールがオール・オア・ナッシングで、境界を超えるとリクエスト全体が再課金され、33Kトークンのプロンプトが入力$1.20から$2.40に跳ね上がっていた。ここではその罠がない。無料の100万トークンも、きちんと評価するための実質的な余地を与えてくれる。

Cons. モデルIDは1つなのに価格は2つあり、デプロイのスコープ次第で変わる。InternationalとSingaporeの表では$2.00と$6.00、Globalの表では$1.65と$4.951だ。挙動の違いがないのに18%の差があるのは、予算を組むうえで紛らわしい。無料枠はSingapore限定で、そのカウントダウンは非アクティブでも止まらず、残った分は期限切れで無効になる。バッチは50%オフだがキャッシュ割引とは併用できない。Maxもクローズドで、公開されているQwenのウェイトは2世代前、最新でも2026年4月24日付だ。

Pricing. InternationalとSingaporeでは入力$2.00・出力$6.00、Globalでは$1.65と$4.951。明示的なキャッシュ作成は$2.50で、これは入力の125%にあたる。詳細はQwen3.8-Maxの料金に、逆方向を検討しているならQwen3.8-Maxの代替のまとめもある。

My take: 悪くはないが、要求が少なくウェイトまで渡してくれるGLM-5.2と比べるとやや割高だ。それでも無料枠は試す理由になる。

7. Gemini 3.6 Flash

Best for: メディアプレミアムを払わずに音声や複合メディアの入力を扱うこと。

Google's Gemini web app, as taken from Google

Inkling-Smallに音声入力を求めて使っていたのなら、これがちゃんとしたサービスレベルを備えた最も近い代替だ。Gemini 3.6 Flashテキスト・画像・動画・音声・PDFを一律$1.50の入力レートでカバーしており、これはGoogle自身が作ったパターンを崩している。Gemini 2.5 Flashでは音声入力がテキストの$0.30に対して$1.00で、2.0 Flashではその倍率が7倍に達していた。

Features. 入力1,048,576トークン、出力65,536トークン、キャッシュは100万あたり$0.15に加え保管1時間あたり100万で$1.00、Batch・Flexティアはどちらも半額で$0.75と$3.75。

Pros. このフラットなメディアレートこそが際立った特徴で、$0.75と$3.75のBatchティアは大量処理を手頃なものにする。Googleの料金ページはこれをプレビューではなく安定版として掲載しており、これは顧客に近いところで使うなら重要なポイントだ。

Cons. 65,536という出力上限はここで最も窮屈なので、長い生成は分割する必要がある。ストレージベースのキャッシュ課金は、他所のフラットなキャッシュ読み取りレートとは違い、メーター制のように動く。ウェイトはクローズドなのでセルフホストはできない。またGemini 3.xでのグラウンディングは無料ティアでは使えず、評価するにもお金がかかる。

Pricing. 標準は入力$1.50・出力$7.50、BatchまたはFlexは$0.75と$3.75、Priorityは$2.70と$13.50。予算が制約ならGemini 3.5 Flash-Liteは$0.30と$2.50で、こちらも音声の別料金はない。全体のはしごはGemini 3.6 Flashの料金にまとめてある。

My take: 音声用の選択肢。大量の複合メディアを送りたい場合、私が迷わず選ぶのもここだけだ。

8. Claude Opus 5

Best for: 自信満々の誤答が実際の損失につながるケース。

Claude's web app, as taken from Anthropic

これは価格帯の遥か遠端であり、一つの理由でリストに入っている。Inkling-Smallが抱える問題そのものに答えているからだ。Claude Opus 5は入力$5.00・出力$25.00、Inkling-Smallの出力レートのおよそ21倍だが、誤答の下振れがトークン代を上回るときにはこれを買う価値がある。

Features. 標準料金のままフルの1Mコンテキスト、しかも長文脈サーチャージなしというのは珍しい。Anthropicの料金ドキュメントはそれをはっきり書いている。90万トークンのリクエストも9,000トークンのそれと同じトークン単価で課金される。キャッシュ読み取りは$0.50。Batch APIは両側フラットに50%オフの$2.50と$12.50で、キャッシュとも併用できる。

Pros. コンテキスト長による崖がないので、課金のサプライズという一大カテゴリーがまるごと消える。拡張思考(Extended thinking)にも別料金はなく、標準の出力として課金される。Batchとキャッシュを組み合わせれば、重い反復ワークロードを表示価格からかなり下げられる。

Cons. どんなコスト比較でも、トークナイザーが罠になる。AnthropicはClaude 4.7以降が旧トークナイザーに比べ「同じテキストに対しておよそ30%多くのトークンを生成する」と述べており、つまりその$25.00という表示価格は、まだ旧世代のトークナイザーを使うライバルとの実際のタスクあたりの差を過小に見せている。Fastモードは両側を倍にして$10.00と$50.00、ファーストパーティAPI限定で、Batchとは併用できない。ウェイトはクローズドだ。

Pricing. 標準は$5.00と$25.00、Batchは$2.50と$12.50、Fastモードは$10.00と$50.00、キャッシュ読み取り$0.50。より安い停車駅はSonnet 5で、2026年8月31日までは$2.00と$10.00、9月1日からは$3.00と$15.00に上がる。その差を払う価値があるかは、Opus 5対Sonnet 5の比較記事で扱っている。

My take: 大半のチケットトラフィックにはオーバースペックだが、お金・ポリシー・契約が絡む5%にはまさにぴったりだ。全部に同じモデルを使うのではなく、質問の種類でルーティングした方がいい。

The price ladder, in one picture

8つを出力価格で横一列に並べれば、判断の構図はおのずと見えてくる。

Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range
Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range

Inkling-Smallはすでに底値近くにいる。 意味のあるステップダウンは1つだけで、$0.28のDeepSeek V4 Flash。同じ価格の横移動はMiniMax M3のみだ。それ以外はすべて上りであり、上りが買うのは速さでは決してない。

これがチケットの量ではどれくらいのコストになるかを計算する価値はある。月間1,000チケットとして、1回答あたり出力2,000トークンとすれば、サポート返信としては寛大な数字だ。つまり出力200万トークンになる。

ModelOutput cost, 2M tokensAgainst Inkling-Small
DeepSeek V4 Flash$0.56$1.84 cheaper
Inkling-Small$2.40baseline
MiniMax M3$2.40identical
GLM-5.2$8.80$6.40 more
Inkling$8.10$5.70 more
Gemini 3.6 Flash$15.00$12.60 more
Kimi K3$30.00$27.60 more
Claude Opus 5$50.00$47.60 more

この規模なら、最も安いものと最も高いものの差は月あたり約$50に過ぎない。1件のエスカレーションを下手に扱えば、それだけでこれ以上の損失になる。これがはしごを上る本当の理由であり、同時にモデル選びが最も大きなレバレッジのある場所ではない理由でもある。

この8つのどれも解決しないこと

上の8行のどれも、次の部分は解決しない。だから誰かが「もっと安いモデルを見つけた」と言うたびに、私は押し返してしまう。

私はこの失敗がまさに課金中のアカウントで起きるのを見てきた。検索(リトリーバル)が空振りしても、モデルは止まらない。学習で身につけたものからその隙間を埋めようとする。あるデンマークの太陽光エネルギー企業では、ボットがサブスクリプションに関する主張をでっち上げ、実際の顧客に送ってしまった。別のケースでは、ボットに質問をしたら「Oxygen(periodic table)」という答えが返ってきた。どちらも悪いモデルだったわけではない。どちらも、根拠にするものが何もなく、当て推量を止める仕組みも何もないモデルだった。

私たちのアカウントを担当するあるサポートマネージャーは、AIに「してはいけないこと」を伝える形で同じ懸念を口にした。

"stop telling customers that we will get them sorted. You dont know that"

配達日を安請け合いしすぎるボットを心配していた、あるeコマースのサポートマネージャーだ。問題の形は同じだ。モデルは自信満々に聞こえ、その自信満々に聞こえることこそが危険なのだ。Inkling-Small自身のAA-Briefcaseの内訳が、プレゼンテーションが分析より270.86 Eloポイント優れていると、それをそのまま物語っている。

Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates
Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates

大きなモデルは解決策ではない。標準搭載されていない2つの要素こそがそうだ。まずグラウンディング。回答がパラメトリックな記憶からではなく、あなたのヘルプセンターと過去のチケットから出てくるようにすること。次に信頼度ゲート。基準を下回るものは人に渡り、そのまま出ていかないようにすること。この2つが生のエンジンを、実際の稼働中キューに向けられるものへと変える。それがまさにAIハルシネーション防止の主題だ。

モデル探しをやめる、もっとありふれた理由もある。私たちが話を聞いたある開発者は、ITインシデントのナレッジベースを組み立てていて、すでにこのループを一周していた。あるベンダーのAPIを試したがコストが高すぎ、別のを試したが不安定で、最終的にただ動くものが欲しかっただけだった。モデルを比較するのは楽しい。モデル層を維持するのはそうではない。

Try eesel

選んだモデルが顧客からの質問に答えることになるなら、正直なアドバイスは二段構えだ。上の8つの中から予算とライセンスに合うものを選ぶ。そのうえで、その上に乗る層は自分で作らないことだ。

その層こそがeeselだ。ZendeskFreshdesk、あるいは既に使っている他の何にでも接続でき、モデルの学習データではなく過去に解決済みのチケットとヘルプセンターから学習し、自分で設定した信頼度しきい値をクリアしたときだけ返信する。その基準を下回るものはすべてエスカレーションされる。そして実際のトラフィックに触れる前に、自分のチケット履歴に対してシミュレーションでき、顧客に間違える前に何を間違えるかを学べる。

The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets
The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets

私たちが測定した自社の事実誤り率7%を隠さずに冒頭に置いたのは、それがモデルを選んでいる最中に重要になる数字だからだ。これはドイツのジュエリー小売業者の実際のZendeskトラフィック、月あたりおよそ1,000チケット、284件のチャットと100件のチケットにわたるクロスバリデーション、実際のヘルプセンターへの検索から得られたものだ。グラウンディングでゼロにはならない。だが測定でき、ゲートをかけ、改善できる数字にはなる。それはモデルが自信満々に当て推量するのとはまったく別のカテゴリーのものだ。

商業的な見せ方も意図的に席数制ではない。課金は解決済みチケットごとであり、料金体系は頭数ではなく実際にこなした仕事を追跡する。無料で試せる。まず数字を検証したいなら、チケット削減ガイドから始めるのがいいだろう。

My take

Inkling-Smallは良い小型モデルであり、それに向いていない仕事をやってほしいと頼まれ続けているだけだ。すでに底値近くの価格で実行の質は高く、知識の信頼性は-9.0と測定されている。この2つの事実は矛盾していない。合わせて、それが一つの道具の姿を描いている。

コストが理由で離れるなら、DeepSeek V4 Flashを選べばそれで済む。答えが間違っていることが押し出す理由なら、安い修正策として親モデルのInklingに、あるいは高い方の修正策としてClaude Opus 5に上がろう。どちらもゼロにはしてくれないと分かったうえで。

そしてもし、コンテキストウィンドウがカードと一致しないことが理由なら、GLM-5.2はMITの下で広告どおりのものを提供している。一つだけ選べと言われたら、私はこの行を選ぶ。

それでも8つすべてに共通する正直な結論は変わらない。エンジンを乗り換えれば、請求額とベンチマークのスコアは動く。だが顧客があなたのドキュメントが一度も答えたことのない質問をしてきたときに何が起きるかには、何も触れない。そのギャップを埋めるには、検索、信頼度のしきい値、ハンドオフが必要だ。どんなモデルのアップグレードもそれを代わりにはやってくれない。それは、また別の午後をAIチケット分類のベンチマークを読むことに費やす前に、解決しておく価値のあることだ。

よくある質問

Inkling-Smallの代替として最適なのは?
多くのチームにとっては3つに絞られる。同じ仕事をより安く済ませたいならDeepSeek V4 Flash、同じファミリーでより高い事実の正確性が欲しいならInkling本体、誤った回答が実際の損失につながるならClaude Opus 5だ。この記事のラインナップにはGLM-5.2、MiniMax M3、Kimi K3Qwen3.8-MaxGemini 3.6 Flashも含まれている。
Inkling-Smallより安い代替はある?
ある。DeepSeek V4 Flashの価格は入力$0.14・出力$0.28(100万トークンあたり)で、Inkling-Smallの$0.30と$1.20に対して出力はおよそ4分の1だ。MiniMax M3は512K未満の入力ではInkling-Smallとまったく同じ$0.30と$1.20になる。解決あたりのコストを下げようとしているなら、モデルの費用項目が最大の要因であることはめったにない。
なぜInkling-Smallから乗り換えるべきなのか?
知識の信頼性の問題だ。Artificial AnalysisはInkling-SmallをAA-Omniscience Indexで-9.0、正答率30.5%と評価している一方、親モデルは2.05・39.95%だ。この差が、モデルがあなたのナレッジベースでカバーされていない質問をされたときにサポートにおけるAIハルシネーションとして現れる。
Inkling-Smallは本当に100万トークンのコンテキストウィンドウを持っているのか?
モデルカードには1Mと書かれているが、2つのプロバイダーのどちらもそれを提供していない。Artificial Analysisによれば、Thinking Machinesは256,000トークン、DeepInfraは524,288トークンを提供している。同じギャップは親モデルにも存在する。長いコンテキストが選んだ理由なら、100万を前提に構築する前にInkling-Smallの解説記事を確認してほしい。
Inkling-Smallの代替の中で最もオープンなライセンスを持つのは?
DeepSeek V4 FlashとGLM-5.2はどちらもMITでリリースされており、これがこのグループの中で最もクリーンな商用利用の立場だ。Inkling-Smallとその親モデルはApache 2.0。Kimi K3とMiniMax M3はどちらも収益しきい値が付いたカスタムライセンスで、MiniMaxはデフォルトで非商用だ。より詳しい調査はオープンソースAIエージェントのまとめを参照してほしい。
Inkling-Smallの代替をサポートチケットで運用するコストは?
トークン代は小さな金額だ。出力100万トークンあたり$1.20なら、月間1,000チケットの推論コストは数ドルで済む。実際にお金がかかるのは検索(リトリーバル)層、エスカレーションのロジック、QAであり、だからこそ多くのチームは自作せずこの層を購入する。当社の料金ページは席数ではなく解決済みチケットごとに課金され、AIカスタマーサービスのコストで計算方法を詳しく説明している。
トークン課金の代わりにInkling-Smallの代替をセルフホストできる?
できる。DeepSeek V4 Flash、GLM-5.2、Kimi K3、MiniMax M3のウェイトはすべて公開されている。ただし費用が消えるのではなくハードウェアに移るだけで、提供・評価・アップグレードの手間も自分で引き受けることになる。AIカスタマーサービスのためにこの道を選ぶチームは、たいていモデルが一番の難所ではなかったと気づく。
Inkling-Smallだけでカスタマーサポートに十分な性能か?
単独では不十分で、このリストの他のどれも同じだ。検索が空振りしたとき、生のモデルは学習データから答えようとする。これがまさに自信満々の誤答が顧客に届く仕組みだ。修正策はグラウンディング(根拠付け)と、自信が足りない場合にハンドオフする信頼度ゲートであり、それがAIエスカレーション管理エージェントのハンドオフの主題だ。

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
開発者がモデルカードを選んでいる様子。中央にDeepSeekのクジラのカード、周囲に競合モデルのカードが並んでいる
Alternatives

2026年、DeepSeek V4 Flashの代替ベスト8選

実在する8つのDeepSeek V4 Flashの代替を、数字で比較する。価格や速度を理由に乗り換える人はいないので、Flashが実際に抱える4つのギャップでランキングした。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Skywork AIの代替となる複数のAIスーパーエージェントを検討している人物のイラスト
Alternatives

2026年のSkywork AI代替7選

2026年のベストなSkywork AI代替ツールを紹介。Manusのような汎用スーパーエージェントから、リサーチツール、デッキビルダー、サポート専用ツールまで、実際の料金付きで解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
3つの異なる音声エージェントの選択肢に話しかける発信者と、左側の Grok ロゴマーク
Alternatives

2026年版 Grok Voice Think Fast 2の代替ツール10選

Grok Voice Think Fast 2.0はデフォルトのエイリアス経路で60%の値上げとなった。実測の時間あたりコストと正直なベンチマーク数値で見る、10個の本物の代替ツール。

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Google Gemini 3.5 Proの代替をまとめた記事のヒーローイラスト
Alternatives

2026年、Gemini 3.5 Proの代替として最適な8選

Gemini 3.5 Proの代替を探している?落とし穴は、3.5 Proはまだリリースされていないこと。今すぐ使える8つのモデルを、実際の価格とおすすめポイントとともに紹介します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
GPT-5.6 Solの代替としてフラッグシップAIモデルを比較するエディトリアルイラスト
Alternatives

GPT-5.6 Sol の代替9選(2026年版)

GPT-5.6 Solは、フラッグシップの価格を持つOpenAIのフラッグシップモデルだ:100万トークンあたり入力5ドル/出力30ドルで、GPT-5.5と同じ料金。ここではSolの本当の代替9つと、それぞれが向いている相手を紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
2026年のGPT-Live代替ベスト、リアルタイム音声AIツールまとめ
Alternatives

2026年のGPT-Live代替ベスト8選

GPT-Liveは魅力的だが、リアルタイム音声AIの選択肢はそれだけではない。Gemini Liveから音声エージェントビルダーまで、2026年におすすめのGPT-Live代替8つを紹介する。

Rama Adi NugrahaRama Adi NugrahaJul 13, 2026
GPT-5.6の代替となるAIチャットモデルの比較を表現したエディトリアルイラスト
Alternatives

2026年版 GPT-5.6の代替ベスト9選

GPT-5.6は今日、政府による限定プレビューから、GPT-5.5とまったく同じ価格でのグローバル展開へと移行しました。ここでは9つの本物の代替案と、それぞれがどんな人に向いているかを紹介します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Grok 4.5の代替となるAIチャットモデルの比較を表現したエディトリアルイラスト
Alternatives

2026年に試す価値のあるGrok 4.5の代替9選

Grok 4.5は高速で安価だが、Intelligence Indexでは4位であり、信頼性の面でも実際に懸念を抱えている。ここでは9つの本物の代替案と、それぞれがどんな人に向いているかを紹介する。

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Meta Muse Imageの代替案を表す、青系トーンのAI生成ビジュアルタイルのグリッド
Alternatives

2026年最高のMeta Muse Image代替8選

Meta Muse Imageが登場したばかりだが、Nano Banana Pro、GPT Image 2、Midjourneyなど他5つのAI画像生成ツールが、すでに品質・価格・コントロール性で上回っている。

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める