2026年、DeepSeek V4 Flashの代替ベスト8選

Kurnia Kharisma Agung Samiadjie
執筆者

Kurnia Kharisma Agung Samiadjie

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 6, 2026

専門家による検証済み
開発者がモデルカードを選んでいる様子。中央にDeepSeekのクジラのカード、周囲に競合モデルのカードが並んでいる

なぜスコアでランキングしないのか

私はSEOと検索意図を仕事にしている。「deepseek v4 flash alternatives」というクエリには、「より良いもの」を探しているという前提が隠れている。しかしこのモデルを測定している2つのボードを見る限り、多くの場合そうではない。

Artificial Analysisは最大エフォートでFlashを50とし、「知性面でトップクラスに位置し、同規模のオープンウェイトモデルと比較して価格も適正」と評している。Lunaは51点、Gemini 3.6 Flashは50点。知性面では横移動でしかなく、それに追加コストを払うことになる。

実際に買っているのは、機能かコンプライアンス上の答えだ。だからこのリストは、埋めるギャップごとに、乗り換えの正直なコストを添えて並べている。乗り換え元のモデルそのものについて純粋なスペック評を知りたければ、DeepSeek V4 Flashの概要とFlashレビューがカバーしており、Flash対GPT-5.6は最も近い一対一比較を詳しく扱っている。

数字を一箇所にまとめると

以下の数字はすべてArtificial Analysisかベンダー自身の料金ページからのもので、2026年8月4日に確認済みだ。「Index run」はAAがそのモデルをIntelligence Index全体で評価するのにかかった費用で、各社が公開している中でタスクあたりの実コストに最も近い数字だ。

モデルAA Index入力/100万出力/100万Index run出力速度最初のトークンまでIndex実行に使ったトークン数入力形式コンテキスト重み
DeepSeek V4 Flash 0731(max)50$0.14$0.28$72.02113 t/s1.31秒2.1億text1MMIT
GPT-5.6 Luna(max)51$0.20$1.20$174.06181 t/s132.75秒1.3億text, image1.05Mclosed
Gemini 3.6 Flash(high)50$1.50$7.50$726.70213 t/s15.69秒5,900万text, image, speech, video1Mclosed
Gemini 3.5 Flash-Lite36$0.30$2.50$153.08366 t/s8.41秒4,300万text, image, speech, video1Mclosed
Claude Haiku 4.5(non-reasoning)24$1.00$5.00未公開90 t/s0.96秒未公開text, image200Kclosed
Kimi K3(max)57$3.00$15.00$2,437.4136 t/s2.85秒1.3億text, image1Mkimi-k3ライセンス
DeepSeek V4 Pro44$0.435$0.87未公開未公開未公開未公開text1Mopen
Qwen3.7-Flash未掲載$0.03–$0.20$0.13–$0.80未公開59 t/s未公開未公開text, image, video1Mclosed

この表から浮かび上がる2点がある。FlashはHaikuを除く全モデルの中で最初のトークンまでの速さが2倍であり、ここではオープンウェイトかつ実際に安価な唯一のモデルだ。それ以外はすべてトレードオフになる。

最大エフォートでの最初のトークンまでの時間を示した手描きの横棒グラフ。DeepSeek V4 Flashは1.31秒、GPT-5.6 Lunaは132.75秒でフレームの外にはみ出している
最大エフォートでの最初のトークンまでの時間を示した手描きの横棒グラフ。DeepSeek V4 Flashは1.31秒、GPT-5.6 Lunaは132.75秒でフレームの外にはみ出している

スコアではなくギャップで選ぶ

リストの前に、これが5クリックで済む意思決定だ。何が自分をブロックしているかを選べば、選ぶべきモデルと乗り換えコストが両方わかる。

本当に何のために乗り換えるのか?

Flashはすでに最も安く、最初のトークンまでも最速。だからギャップで選ぶ。

GPT-5.6 Luna

Flashには画像入力の記載がない。Lunaはテキストと画像を扱い、AAインデックスでは1点高い51点、181トークン/秒で動く。この比較の中で画像対応モデルとしては最も安く、入力$0.20、出力$1.20だ。

乗り換えコスト:キャッシュ多用、推論多用、長文プロンプトのいずれの形状でも実際の請求は約3倍。最大エフォートでの最初のトークンまでは132.75秒。エフォートを下げない限りインタラクティブな用途には向かない。

Flashの重みを自社ホストする

同じモデルをそのまま使い、推論の場所だけを変える。重みはMITライセンスで、単一のAMD MI300X上で0731チェックポイントを動かす公開済みの本番構成は、シングルストリームで168.6トークン/秒に達する。これはファーストパーティAPIで計測された113を上回る。

乗り換えコスト:ハードウェア。156.67GiBの重みをHBMに載せる必要があり、MI300Xを単体で購入するのは難しい。GPUを運用したくないなら、Geminiの有料プランはコンテンツを製品改善に使わないと明記している。

Gemini 3.5 Flash-Lite

このグループで最速の366トークン/秒、そして最も簡潔:AAインデックスの実行にかかった出力トークンはFlashの2.1億に対して4,300万。テキスト、画像、音声、動画を入力できる。大量のトリアージや分類に向いている。

乗り換えコスト:知性。FlashのIndex 50に対して36と、別の重量級のタスクになる。どんな価格でもコンピュータ操作は使えない。

Kimi K3

信頼性重視の選択肢。AA-Omniscienceハルシネーション率はFlashの84%に対して51%、Omniscience IndexはFlashの-16に対して18、そしてこの中で生の知性が最も高い57点。

乗り換えコスト:タスクあたりのコストで約29倍、速度は36トークン/秒。予算版K3は存在しない。K3(low)行はFlashより3点低い47点なのに、コストは8倍。推論はオフにできない。

DeepSeek V4 Pro

同じファミリーに留まる。Proはリコールと長文コンテキストの検索精度で明確に勝つ:SimpleQA-VerifiedはFlashの34.1に対して57.9、1MコンテキストでのMRCRは78.7に対して83.5、LMArenaの人間投票ではFlashの1436に対して1458と評価されている。

乗り換えコスト:キャッシュミス入力と出力で3.11倍、そして安価な実行方法はない。DeepSeek自身のエフォートマッピング表はlowのリクエストをProでhighとして処理する。

1. GPT-5.6 Luna

OpenAIの開発者プラットフォームのGPT-5.6 Lunaモデルページ。100万トークンあたり入力$0.20、キャッシュ入力$0.02、出力$1.20と表示されている。出典: OpenAI
OpenAIの開発者プラットフォームのGPT-5.6 Lunaモデルページ。100万トークンあたり入力$0.20、キャッシュ入力$0.02、出力$1.20と表示されている。出典: OpenAI

向いている用途: 最も近い一対一の乗り換え先で、画像入力を追加する最も安い方法。

実際はどんなモデルか

LunaはGPT-5.6ファミリーの低価格帯で、モデルページ自身に「コスト重視のワークロード向けに最適化」と書かれている。Flashとの比較で多くの記事が間違える理由は、gpt-5.6がフロンティア級のSolを指す別名になっているからだ。そのため人々は誤って$0.14のモデルを$5のモデルとベンチマークしてしまう。Luna限定で見れば、知性の比較はほぼ引き分けだ:AAインデックスで51対50

コンテキストウィンドウは1,050,000トークン、最大出力トークンは128,000、ナレッジカットオフは2026年2月16日、推論トークンにも対応する。テキストと画像の入力、テキストの出力。

料金

100万トークンあたり入力$0.20、キャッシュ入力$0.02、出力$1.20。実はその下に多くの記事が見落としている割引の段階がある。

ティア入力/100万キャッシュ/100万出力/100万
Standard$0.20$0.02$1.20
Batch$0.10$0.01$0.60
Flex$0.10$0.01$0.60
Fast mode$0.40$0.04$2.40
Long context(272K超)$0.40$0.04$1.80

BatchやFlexでは、Lunaの入力$0.10はFlashの$0.14より実際に安い。ワークロードが一晩かけて処理できるもので、入力が多く出力が短いなら、これはチケット分類の多くに当てはまる話だが、Lunaが優位になり得る。Flashにはバッチ割引がまったくない。

Flashより優れている点

画像入力、計画に使える公開レイテンシ、そしてセキュリティレビュー担当者に説明できるデータ処理の説明だ。ウェブ検索についても正確に言っておく必要がある:Flashは実際にサーバーサイドのweb_searchツールを持っているが、それはFlash専用のResponses APIだけで、chat-completions経路にはない。「DeepSeekにはウェブ検索がない」という広く繰り返された説明は古い。

Flashに劣る点

Hacker Newsの実測値によれば、実際のギャップは出力列が示す4.3倍ではなく2倍から3倍だ。Lunaのキャッシュ入力も安いからだ。しかし3倍でも3倍だ。そしてレイテンシの数字は容赦ない。

Hacker News

"2x to 3x the price… 2 to 5 times faster inference"

その「faster inference」はスループットのことであり、応答性のことではない。最大エフォートでのLunaの最初のトークンまでの時間は132.75秒だ。バッチ処理には十分だが、チャットウィジェットには向かない。

計画すべき非対称の崖もある。入力が272Kを超えるプロンプトは、超過分だけでなくリクエスト全体が入力2倍、出力1.5倍で再計算される。キャッシュ書き込みは非キャッシュ料率の1.25倍で課金される。

結論

Flashから離れる理由が画像入力かコンプライアンスの話であれば、まず試すべきはこれだ。バッチ料率のおかげで想像より安くなる。最大エフォートでインタラクティブな面に置くことは勧めない。ティアの詳しい内訳はGPT-5.6の料金ガイドにあり、GPT-5.6レビューはファミリー全体をカバーしている。

2. Gemini 3.5 Flash-Lite

Gemini APIのモデルカタログ。Gemini 3.5 Flash-Liteが高スループット実行向けの最速かつ最も費用対効果の高い3.5モデルとして強調表示されている。出典: Google
Gemini APIのモデルカタログ。Gemini 3.5 Flash-Liteが高スループット実行向けの最速かつ最も費用対効果の高い3.5モデルとして強調表示されている。出典: Google

向いている用途: 大量の分類、トリアージ、そしてトークン/秒がボトルネックになる用途全般。

実際はどんなモデルか

Googleの3.5系で最も安価な一般提供モデルで、モデルページには「高スループット実行に向けた、最速かつ最も費用対効果の高い3.5モデル」と説明されている。モデルコードはgemini-3.5-flash-lite、入力コンテキストは1,048,576、出力は65,536で、テキスト、画像、音声、動画、PDFを入力できる。

料金

Standardで100万トークンあたり入力$0.30、出力$2.50。BatchとFlexは両方を半額の$0.15/$1.25にする。Priorityは$0.54/$4.50。コンテキストキャッシングは$0.03。

Flashより優れている点

2つの数字がある。この中で最速の366トークン/秒、そしてAAインデックスの実行にかかった出力トークンはFlashの2.1億に対して4,300万。AAはこれを「かなり簡潔」と評し、Flashを「非常に冗長」と評している。この簡潔さのおかげで、名目上9倍高い出力レートを持つモデルなのに、Flashの$72.02に対してインデックス実行にかかったコストは$153.08、つまり9倍ではなくおよそ2倍にとどまっている。

4つのモダリティすべてでマルチモーダル入力がネイティブに対応している。そしてGoogleの有料ティアはDeepSeekが何も言わない部分を明言している:料金ページには有料ティアの特性として「コンテンツは製品改善に使用されない」とあり、無料ティアでは「コンテンツは製品改善に使用される」とある。

Flashに劣る点

Intelligence IndexはFlashの50に対して36。これは小さな差ではなく、まったく別の重量級であり、エージェント的なタスクや複数ステップのタスクではFlash-Liteの方が劣る。どんな価格でもコンピュータ操作は使えない。最初のトークンまでは8.41秒で、Flashの6倍だ。

結論

大量の意図分類や感情分析を回すなら、これは正しい形であり、簡潔さが実際にコストを節約する。エージェントを動かすなら向かない。詳しくはGemini 3.5 Flash-Liteの概要を参照。

3. Gemini 3.6 Flash

Gemini Developer APIの料金ページ。Free、Paid、Enterpriseの各ティアが示され、有料ティアはコンテンツがGoogleの製品改善に使われないと明記している。出典: Google
Gemini Developer APIの料金ページ。Free、Paid、Enterpriseの各ティアが示され、有料ティアはコンテンツがGoogleの製品改善に使われないと明記している。出典: Google

向いている用途: Flashと同じ知性を出力トークン3分の1で実現し、さらにコンピュータ操作も使える。

実際はどんなモデルか

Googleの主力Flashティアで、2026年7月21日に発表された。「エージェント的かつマルチモーダルなタスクで強力な性能を発揮するよう、速度と知性のバランスを取ったモデル」と位置づけられている。ナレッジカットオフは2026年3月に更新。コンピュータ操作が組み込まれている。コンテキストは1M、出力は65K。

料金

100万トークンあたり入力$1.50、出力$7.50。Batchは両方を半額の$0.75/$3.75にする。

Flashより優れている点

この項目が、この比較全体の読み方を変えるものだ。Gemini 3.6 FlashはFlashと同じ50点を出しながら、出力トークンはFlashの2.1億に対して5,900万で済む。定価上ではこれは出力の26.8倍のギャップだが、AAの実際のインデックス実行の請求額では$726.70対$72.02、つまり10.1倍になる。

10倍は依然として10倍なので、これは安いモデルではない。だが方向性が重要だ:この記事のあらゆる冗長性比較はFlashに不利な方向に動く。もし1トークンあたりの列を基準に予算を組んできたなら、節約額を過大評価してきたことになる。

出力の定価上のギャップ26.8倍が、実際のインデックス実行請求額では10.1倍に縮む様子を示した手描きの二段階の図。同じスコア50に対してFlashは出力トークン2.1億、Gemini 3.6 Flashは5,900万を使っている
出力の定価上のギャップ26.8倍が、実際のインデックス実行請求額では10.1倍に縮む様子を示した手描きの二段階の図。同じスコア50に対してFlashは出力トークン2.1億、Gemini 3.6 Flashは5,900万を使っている

さらに4つの入力モダリティ、213トークン/秒、そしてこのリストのこのティアでは他にないコンピュータ操作も備えている。

Flashに劣る点

知性が同等でもタスクあたりのコストは10倍。最初のトークンまでは15.69秒。重みは非公開のため自社ホストは選択肢にない。

結論

モデルが混在メディアのナレッジベースに対してエージェント的な作業をしていて、トークン数を減らしたいときに選ぶべきモデルだ。Gemini 3.6 Flashの概要、または評価の詳細はレビューを参照。

4. Claude Haiku 4.5

Claude Platformのドキュメントにあるモデルズオーバービュー。Fable 5、Opus 5、Sonnet 5、Haiku 4.5を比較し、Haikuはフロンティア級に近い知性を持つ最速モデルと説明されている。出典: Anthropic
Claude Platformのドキュメントにあるモデルズオーバービュー。Fable 5、Opus 5、Sonnet 5、Haiku 4.5を比較し、Haikuはフロンティア級に近い知性を持つ最速モデルと説明されている。出典: Anthropic

向いている用途: このグループで最速の最初のトークン、そして最も簡単なセキュリティレビュー。

実際はどんなモデルか

Anthropicの小型モデルclaude-haiku-4-5で、ドキュメントには「フロンティア級に近い知性を持つ最速モデル」と説明されている。テキストと画像の入力、200Kコンテキスト、ナレッジは2025年7月まで。Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundryで利用可能。

料金

100万トークンあたり入力$1.00、出力$5.00。

Flashより優れている点

最初のトークンまで0.96秒、このページでFlashの1.31秒を上回る唯一の数字で、90.2トークン/秒だ。AAはこのTTFTを、その価格帯の中央値1.43秒と比べて「非常に競争力がある」と評している。

もう一つFlashより優れているのは調達面だ。BedrockとGoogle Cloudを通じたマルチクラウド提供により、データレジデンシーと契約はすでに誰かが解決済みの問題になり、自分で抱える問題ではなくなる。私の経験上、実際のブロッカーはどんなベンチマークよりもこちらの方が多い。

HIPAA/BAAでデモ中に完全にブロックされ、ソフトな懸念ではなくハードなブロッカーだと説明された。

Zendeskを使う米国の医療・理学療法プラットフォームで、月間約500チケットを処理している

その取引はハルシネーション率で頓挫したわけではなかった。

Flashに劣る点

非推論モードでのIntelligence Indexは24で、この中で最低。コンテキストウィンドウも200Kと最小で、他の全モデルの1Mに劣る。AAはインデックス実行のコストを公開していないため、タスクあたりのコストは不明だ。Anthropicは推論版も出しているが、24というのは非推論の行であり、デフォルト設定での$1/$5が買うのはそれだ。

結論

生の性能よりも応答性と契約面が重要な場合に選ぶべきで、それは顧客対応チャットの大半に当てはまる。エージェント的な作業には選ばないこと。開発者体験の側面はOpenAI API対Anthropic APIがカバーしており、上位ティアはClaude Sonnet 5の料金が扱っている。

5. Kimi K3

Kimi Platformのモデル推論料金ドキュメント。フラッグシップモデルKimi K3の課金単位と課金ロジックを示している。出典: Moonshot AI
Kimi Platformのモデル推論料金ドキュメント。フラッグシップモデルKimi K3の課金単位と課金ロジックを示している。出典: Moonshot AI

向いている用途: 29倍のコストを払う正当化ができる唯一のケース:間違えられない回答。

実際はどんなモデルか

Moonshot AIのフラッグシップで、2026年7月16日にローンチされた。総パラメータ2.8Tでアクティブ104B、コンテキストは1M、画像と動画にネイティブな視覚対応。オープンウェイトは約束どおり7月27日に公開され、96シャードにわたる1,561GBで、大規模MaaS事業者や非常に大規模なプロダクト向けの条件を含むkimi-k3ライセンスのもとで提供されている。

料金

100万トークンあたり入力$3、キャッシュヒット入力$0.30、出力$15。これはClaude Sonnetの領域であり、予算モデルの領域ではない。

Flashより優れている点

信頼性で、その差は小さくない。AA-Omniscienceハルシネーション率はFlashの84%に対して51%。Omniscience IndexはFlashの**-16**に対して18で、負のスコアは正解より誤答が多いことを意味する。正答率は37%に対して46%。この比較の中で生の知性は最高の57点。

規制業種や、お金に関わるAIエージェントが用途であれば、この差がすべての論拠になる。

Flashに劣る点

コストで、その差は定価どおりではない。出力レートはFlashの54倍だが、AAのタスクあたりコストは$0.03に対して$0.86であり、実際のギャップは29倍だ。K3は知性のポイントあたりで見ると言葉数が多いからだ。インデックス実行全体では$72.02対$2,437.41。

36トークン/秒で、この中で最も遅い。そして予算版K3は存在しない:AAは別にK3(low)行を掲載しており、Intelligence Indexは47、Flashより3点低く、タスクあたり$0.24かかる。これはFlashの8倍でありながら速くもない。Moonshotのクイックスタート自身が、推論をオフにできないことを確認しており、エフォートレベルはコストのティアではなくレイテンシの制御にすぎない。

データポリシーを比較する人向けに、もう一つ正直に述べておくべきことがある。Moonshotの規約は、DeepSeekが何も言わない部分について明確かつ許容的だ。第4条には「別途書面で合意しない限り、顧客コンテンツは前述の目的のために使用される可能性がある」とあり、オプトアウトは交渉済みのエンタープライズ契約を通じてのみ可能だ。データはシンガポールに置かれる。

結論

誤答のコストがトークン代の29倍を上回るなら購入する価値がある。それは実際にあり得る状況だが、多くの購入者が思うより狭い状況だ。それ以外なら計算が合わない。この一対一比較はFlash対Kimi K3でしっかり検証しており、Kimi K3レビュー料金ガイドもある。

6. DeepSeek V4 Pro

DeepSeek APIのモデルと料金のカード。deepseek-v4-flashとdeepseek-v4-proを並べて、キャッシュヒット、キャッシュミス、出力の各料率を示している。出典: DeepSeek
DeepSeek APIのモデルと料金のカード。deepseek-v4-flashとdeepseek-v4-proを並べて、キャッシュヒット、キャッシュミス、出力の各料率を示している。出典: DeepSeek

向いている用途: 推論よりリコールが必要なとき、同じファミリーに留まる。

実際はどんなモデルか

上位のV4ティアdeepseek-v4-proで、アクティブパラメータはFlashの13Bに対して49B。まだ4月のプレビュービルドのままで、0731相当版は存在しない。これがこの比較を奇妙にしている理由そのものだ。

料金

100万トークンあたりキャッシュミス入力$0.435、キャッシュヒット入力$0.003625、出力$0.87。キャッシュミス入力と出力ではFlashの3.11倍だが、キャッシュヒットでは1.29倍にとどまる。

Flashより優れている点

リコールと長文コンテキストの検索精度、つまり追加のアクティブパラメータが買っているものだ。DeepSeek自身のクロスモード表(最大エフォート)から:SimpleQA-Verifiedは34.1に対して57.9、GDPval-AA Eloは1395に対して1554、BrowseCompは73.2に対して83.4、1MコンテキストのMRCRは78.7に対して83.5。

そして人間投票もProに賛同している。自動インデックスとは違う結果だ。LMArena Textはそれぞれ約49,000票をもとに、Proを1458±4、Flashを1436±4とランクしている。2つのボードはそれぞれ違うものを測っており、どちらも正しい。

Flashに劣る点

Flash 0731は、DeepSeekが公開している9つのエージェント系タスクすべてでProのプレビュー版を上回る。DeepSWEは54.4対12.8で最大の差だ。AAではFlashが50点でタスクあたり$0.03、Proは44点で$0.05。正直に言っておくべき点として、9つのうち2つはDeepSeek自身の内部セットであり、評価ハーネスは未公開だ。

安価なPro実行方法もない。DeepSeekが公開しているエフォートマッピング表は、Proのlowリクエストをhighとして処理するため、3.11倍を支払いながら推論を下げることができない。このマッピングは2026年8月上旬に変更予定だった。

結論

狭いが実在する選択:長文書に対するリトリーバル重視の作業ならProを、エージェント的作業やコーディングならFlashに留まる。詳細はFlash対V4 Proを参照。

7. Flashの重みを自社ホストする

単一のAMD MI300X上でDeepSeek V4 Flash 0731を動かすGitHubリポジトリ。Apache-2.0ライセンスと、シングルストリームで168.6トークン/秒のデコードを示す結果表がある。出典: GitHub
単一のAMD MI300X上でDeepSeek V4 Flash 0731を動かすGitHubリポジトリ。Apache-2.0ライセンスと、シングルストリームで168.6トークン/秒のデコードを示す結果表がある。出典: GitHub

向いている用途: モデルはそのままに、レジデンシーの問題を一度の対応で解決する。

実際はどんなモデルか

別のモデルではない。同じMITライセンスのDeepSeek-V4-Flash-0731チェックポイントを、自分で管理するハードウェア上で動かすだけだ。この項目がここに入る理由は、本番構成が本日公開され、Hacker Newsのフロントページで165ポイントを獲得したからだ。

料金

トークンではなくハードウェアだ。ブロッカーが予算ではなくセキュリティレビューであるなら、これこそが本質だ。

FlashのAPIより優れている点

リポジトリに固定されたvLLM ROCmスタックから得られた、単一のAMD MI300Xでの公開数値:

指標結果
シングルストリームデコード168.6 tok/s
チューニング済みカーネルでのプリフィル約7.9〜8.5K tok/s
8並列ストリーム集計542 tok/s、ストリームあたり中央値90.3 tok/s
64ストリームバースト集計830 tok/s、OOMなし
検証済みコンテキスト256K(アーキテクチャは1Mをサポート)
HBM上の重み156.67 GiB、追加の量子化なし

1枚のカードでの168.6トークン/秒は、Artificial AnalysisがDeepSeek自身のAPIで計測した113 tok/sを上回る。リポジトリは「チェックポイントは追加の重み量子化やオフロードなしで、出荷時のまま動作する」と明記しているため、これは速度と品質のトレードオフではない。

また、モデルそのものとは関係のない、最も多く聞く反論にも答えている。

Philは「答えを知らない場合に何らかの別のChatGPTのようなものを使うのか」、そしてそれをオフにできるのかを尋ねた。Gilは知識が自社組織内に閉じられたままかを尋ねた。

自社が承認したナレッジのみからAIが回答すること、一般的な学習データからではないことの保証を必要としていた、B2B半導体ハードウェア企業の技術評価担当者

このページの中で、この問いに利用規約の読み込みではなくネットワーク図で答えられる選択肢は、自社ホストだけだ。

Flashに劣る点

調達しなければならないハードウェア、そしてコミュニティはそれについて率直だ。

Hacker News

"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."

同じスレッドに回避策もある。

Hacker News

"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."

もう2つ正直な注意点がある。リポジトリはチェックポイントを304Bパラメータと説明しているが、AAは総284Bを公開しており、実際のパラメータ数には食い違いがある。そして同じスレッドのxorfishによれば、DeepSeekは自社のDSparkペーパーでH800上で15K tok/s/gpuを得ているとされており、この構成にはまだ伸びる余地がある。

結論

データレジデンシーが乗り換えの理由なら、これはリストの一番下ではなく一番上に置くべきだ。モデルの品質を何もトレードオフしていない。関連記事:オープンソースAIエージェントカスタムAIモデル自社構築か購入か

8. Qwen3.7-Flash

Qwen3.7 FlashのOpenRouterモデルページ。100万トークンあたり入力$0.03、出力$0.13、単一のAlibaba Cloudプロバイダー、そして加重平均の実効価格$0.061と$0.163を示している。出典: OpenRouter
Qwen3.7 FlashのOpenRouterモデルページ。100万トークンあたり入力$0.03、出力$0.13、単一のAlibaba Cloudプロバイダー、そして加重平均の実効価格$0.061と$0.163を示している。出典: OpenRouter

向いている用途: プロンプトが本当に小さいなら、最安の定価。

実際はどんなモデルか

Alibabaのビジョン言語推論モデルで、2026年7月27日にリリースされた。OpenRouterでは「マルチモーダルエージェント、視覚的コーディング、検索、コンピュータ操作」に適していると説明されている。コンテキストは1M、テキストに加えて画像と動画を入力できる。

料金

ここが興味深い点であり、DeepSeekの「Flash」との名称の衝突が実際に混乱を招いている部分だ。料金はプロンプトサイズによって帯で分かれているため、見出しの料率と1Mコンテキストが同じ呼び出しの中で両方成立することはない。

プロンプトサイズ入力/100万出力/100万
32K未満$0.03$0.13
32K〜256K$0.10$0.40
256K〜1M$0.20$0.80

入力で6.7倍の振れ幅がある。そしてOpenRouterは実際に顧客が支払っている過去30日間の平均を公開している:入力$0.061、出力$0.163で定価を上回っており、実際のトラフィックが上位の帯に着地していることを示している。

Flashより優れている点

32K未満の帯では$0.03/$0.13で、Flashの$0.14/$0.28より実際に安く、入力ではおよそ4.6倍だ。Flashがどちらも扱えない画像と動画を扱える。キャッシュ読み取りは$0.006。

Flashに劣る点

独立して検証されているものがほとんどなく、それこそが本題であり脇の話ではない。Qwenはベンチマークもアーキテクチャもパラメータ数も公開していない。Artificial Analysisにはまったく掲載されていないため、上の表に匹敵するインデックススコアがない。重みは非公開だ。

私が信頼する唯一の第三者評価はRoboflowのビジョンベンチマークで、全体では**23モデル中22位で61.7%**としながら、コストでは23モデル中1位に位置づけている。識別は得意でも位置特定は苦手だということだ。

ここでの「Flash」は速いという意味ではなく安いという意味だ:Flashの113、Flash-Liteの366に対して59トークン/秒。ツールコールのエラー率は8.88%、P99エンドツーエンドレイテンシは90.19秒。OpenRouterは「単一プロバイダーがホストしている」ため「ルーティングの判断はない」と注記しており、そのプロバイダーの調子が悪い日にはフォールバックがない。

結論

プロンプトが本当に32K未満で、予算内でビジョンが必要な場合にのみ選ぶ価値がある。それを超えると帯の仕組みが優位性を消してしまい、評価データが欠けているため信用で買うことになる。帯の計算はQwen 3.7 Flashの料金ガイドで詳しく解説しており、Qwen 3.7 Flashの概要がスペックをカバーしている。

この8つのどれもやってくれないこと

ここに挙げたモデルはすべて最下層のレイヤーにすぎない。これははっきり言っておく価値がある。人々が私に持ち込んでくる乗り換えの判断は、普通モデル選びとして語られるが、実際にはほとんどそうではないからだ。

84%のハルシネーション率は、モデルがチケットの84%を間違えるという意味ではない。これはコンテキストが与えられていない質問について測定されたAA-Omniscienceの数字であり、サポートエージェントの正しい運用のちょうど正反対だ。同じモデルを検証済みのヘルプセンター上のRAGに接続すれば、重要になる数字は完全に変わる。

これがRAG対LLMハルシネーション対策の背景にある論点だ。解決策はグラウンディングとガードレールであり、より良いベースモデルではない。

こうした取引を実際に決める買い手の反論は、抽象的な精度の話ではない。制御だ。あるCXリーダーが、どのベンチマークよりも的確に言い表していた。

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Gorgias・Shopifyを使うDTCサプリメントブランドのCXリーダー、月間約7,000チケット・30,000注文規模

上の表のどの項目もそれを解決していない。確信度スコア、エスカレーションルール、チケットタイプの除外、そして人間によるチェックがそれを解決するのであり、それらはAPIより上の層にある。

確信度のしきい値コンテインメント率については別途詳しく書いている。これらこそが、この仕組みが実際に機能するかどうかを決める部分だからだ。

これら8つがやってくれないもう一つのことは、実際に予算組みに使う数字を教えてくれないことだ。トークン料率は入力にすぎない。解決あたりのコストが出力であり、リトリーバル、リトライ、後始まつに費やす人的時間を加えると、両者は比例しなくなる。

私が実際にサポートキューに対してすること

eesel AIのレポートダッシュボード。タスクの総ボリューム、種類別のトリガーイベント、Zendeskエージェントのツールごとの承認・却下利用状況を示している
eesel AIのレポートダッシュボード。タスクの総ボリューム、種類別のトリガーイベント、Zendeskエージェントのツールごとの承認・却下利用状況を示している

サポートキューのためにモデルを買い比べるのは、最初のステップとして間違っている。今週8つのモデルカードを読んで過ごした私が言うのだからそうだ。問題はどのモデルが最もハルシネーションを起こさないかではなく、自社のチケットに対する精度がどうなるかであり、それはリーダーボードからはわからない。

それこそがeeselが生のAPIにはできないことだ。Zendesk、Freshdesk、Gorgias、Front、Help Scoutに数分で接続し、すべての返信をヘルプセンター、過去のチケット、マクロに根拠づけ、そして実際の過去チケットに対してシミュレーションを実行し、顧客に触れる前に実際の解決率を確認できる。基準を満たさなければ、導入しない。

料金は対応チケット1件あたり40セント、席数の課金はなく、人間が対応したチケットには課金されない。月間1,000チケットのうち200件をルーティングして始めれば、支払いは$80だ。eeselを試す、$50分の利用枠付きで無料、クレジットカードも不要。

私はeeselがベースモデルを賢くすると主張しているわけではない。主張しているのは、あなたが本当に探しているもの、つまり顧客の前で信頼できるモデルというものは、そもそもモデルの問題ではないということだ。そう確信できるのは、私たち自身のエージェントがどのベンチマークにも捉えられない形で失敗するのを見てきたからだ。これまで記録した中で最悪のパターンは、あるエージェントがAPIに一度も触れずに約10ターンにわたって「Zendesk検索を実行中」と語り続けたことだった。何をしたかについて嘘をつくことほど、チームメイトへの信頼を壊すものはなく、どんなインデックススコアもそれを予測できなかった。

では、どれを選ぶべきか

  • 画像入力が必要GPT-5.6 Luna。ここでは最も安いビジョン対応の選択肢で、知性はFlashと同等、実際のコストは約3倍。レイテンシが重要ならエフォートを低く保つこと。
  • データレジデンシーが必要→Flashの重みを自社ホストする。同じモデル、MITライセンス、1台のMI300Xで168.6 tok/s。最も安いマネージドのフォールバックはGeminiの有料プランで、コンテンツを学習に使わないと書面で明記している。
  • スループットが必要Gemini 3.5 Flash-Lite、366 tok/sでこのグループ最も簡潔な出力。Index 36は受け入れる必要がある。
  • 同等スコアで出力トークンを減らしたいGemini 3.6 Flash。2.1億トークンではなく5,900万トークンで同じ50点を出すが、タスクコストは10倍。
  • 信頼性が必要Kimi K3。ハルシネーション率84%に対して51%、タスクあたりコストは29倍。K3(low)には手を出さないこと。
  • 長文書に対するリコールが必要DeepSeek V4 Pro。SimpleQA-Verifiedで34.1に対して57.9で勝ち、LMArenaの投票者もそれに同意している。
  • 最安の定価が必要Qwen3.7-Flash。ただし32K未満のプロンプトに限り、独立した評価がほとんどないことを受け入れられる場合のみ。
  • 上記どれも当てはまらない→Flashに留まる。最も安く、最初のトークンまでも最速で、オープンだ。ただし保留中の2倍ピーク時間サーチャージには注意すること。DeepSeekが開始日を発表すれば、北京時間9:00〜12:00と14:00〜18:00に適用される。

顧客チケットに回答させるモデルを選んでいるなら、最適なAIサポートエージェントの解説とAIカスタマーサービスのコストは、上のどのモデルページよりも次に読む価値がある。文章を書くために選んでいるなら、ブログ執筆に最適なLLMから始めるのがおすすめだ。

Sources

Frequently Asked Questions

DeepSeek V4 Flashの代替として最適なのはどれですか?
どのギャップを埋めたいかによります。GPT-5.6 Lunaは知性の面で最も近く、実コストは約3倍になりますが画像入力が加わります。Gemini 3.5 Flash-Liteはスループット重視の選択肢です。Kimi K3は料金より回答の信頼性を重視するなら選ぶべきモデルです。Flashはすでに最も安く、最初のトークンまでの速度も最速なので、単一の勝者はいません。
DeepSeek V4 Flashより安い代替はありますか?
定価だけを見ればあります。Qwen3.7-Flashは100万トークンあたり入力$0.03、出力$0.13から始まります。ただしこれは32K未満の帯域だけの話で、OpenRouterが公開している過去30日の実際の平均支払額は入力$0.061、出力$0.163と定価を上回っています。Flashを本当に下回るかは、プロンプトのサイズに完全に依存します。帯域の計算はQwen 3.7 Flashの料金ガイドで詳しく分解しています。
画像入力に対応しているDeepSeek V4 Flashの代替はどれですか?
V4 Proを除く全モデルです。Flashはテキスト入力・テキスト出力のみで、画像入力の記載はありません。スクリーンショットや破損した荷物の写真を読み取る必要があるなら、それが乗り換える最も明確な理由になります。Gemini 3.6 Flashはテキスト、画像、音声、動画を扱えます。Luna、Kimi K3、Claude Haiku 4.5はいずれもテキストと画像に対応します。スクリーンショットを含むナレッジベースにサポートエージェントを接続するなら、まずここを確認してください。
モデルを切り替える代わりにDeepSeek V4 Flashを自社ホストできますか?
できますし、このリストの中で最も過小評価されている選択肢です。重みはMITライセンスで総パラメータ284B、アクティブ13Bであり、単一のAMD MI300X向けの本番構成もすでに公開されています。この方法ならモデルはそのままに、データレジデンシーの問題を解決できます。これはほとんどの人が本当に探しているものです。トレードオフはハードウェアの購入またはレンタルが必要になることです。より広いエコシステムについてはオープンソースAIエージェントを参照してください。
DeepSeekは有料顧客のAPIデータで学習していますか?
有料のOpen Platform利用規約はこの点について何も述れておらず、それは許可されているのとも安全であるとも異なります。コンシューマー向け規約に含まれる学習に関する条項は、API規約には存在しません。また公開されたDPAやゼロリテンションのオプションもどちらの方向にもありません。Googleの有料Geminiプランはコンテンツを製品改善に利用しないと明記しています。この違いが取引先にとって重要なら、サポートチャットボットのためのSOC 2とGDPRを読んでください。
DeepSeek V4 Flashは他の代替と比べてどのくらいのコストですか?
Flashは100万トークンあたりキャッシュミス入力$0.14、出力$0.28で、Lunaの$0.20/$1.20、Gemini 3.6 Flashの$1.50/$7.50と比べられます。しかし料金表はギャップを過大に見せています。というのもFlashはこのグループの中で最も言葉数が多いモデルだからです。Artificial Analysis自身のインデックス実行では、同じスコアでFlashは$72、Gemini 3.6 Flashは$727となり、これは出力列が示す27倍ではなく10倍です。サポート業務で重要なのはトークン単価ではなく解決あたりのコストです。
DeepSeek V4 Flashは顧客の前に置いても安全ですか?
単体では安全ではありません。このリストのどのモデルもそうです。FlashのAA-Omniscienceハルシネーション率は84%で、スコアカードの中で最も高い数字ですが、Kimi K3の51%であっても無人の応答としては受け入れられません。解決策はより良いモデルではなく、グラウンディング確信度のしきい値、そして本番導入前に自社の履歴でテストすることです。
FlashではなくDeepSeek V4 Proを使うべきですか?
リコールと長文コンテキストでの検索精度が必要な場合のみです。この点ではProが明確に勝っています:SimpleQA-Verifiedは57.9対Flashの34.1です。DeepSeekが公開している9つのエージェント系タスクでは、Flash 0731がProのプレビュービルドを全て上回っています。またProは効果レベルを下げることができず、lowのリクエストもhighで処理されます。詳細はFlash対V4 Proで解説しています。

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
1つの小型モデルが脇に置かれ、5つの代替モデルが光を受けている様子
Alternatives

2026年版、Inkling-Smallの代替8選

Inkling-Smallは安くて速いが、測定された知識スコアはマイナスだ。実際の価格とそれぞれの落とし穴付きで、Inkling-Smallの代替8選を紹介する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Skywork AIの代替となる複数のAIスーパーエージェントを検討している人物のイラスト
Alternatives

2026年のSkywork AI代替7選

2026年のベストなSkywork AI代替ツールを紹介。Manusのような汎用スーパーエージェントから、リサーチツール、デッキビルダー、サポート専用ツールまで、実際の料金付きで解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
3つの異なる音声エージェントの選択肢に話しかける発信者と、左側の Grok ロゴマーク
Alternatives

2026年版 Grok Voice Think Fast 2の代替ツール10選

Grok Voice Think Fast 2.0はデフォルトのエイリアス経路で60%の値上げとなった。実測の時間あたりコストと正直なベンチマーク数値で見る、10個の本物の代替ツール。

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
AIエージェント向けの最適なPaperclip代替ツールガイドのイラスト付きヒーローバナー
Alternatives

AIエージェント向けPaperclip代替ツール8選(2026年)

Paperclipは、AIエージェントの会社をまるごと運用できる優れたオープンソースツールですが、サポートキューに対応するために作られたものではありません。ここでは8つのPaperclip代替ツールと、それぞれがどんなチームに向いているかを紹介します。

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
AIエージェントとカスタマーサポート向けのベストなNemoClaw代替ガイドのイラスト付きヒーローバナー
Alternatives

サポートチーム向けNemoClawの代替8選(2026年版)

NemoClawはNVIDIAが提供する、AIエージェントを自前でホストするためのガバナンス型ランタイムですが、サポートキューを回すために作られたものではありません。8つのNemoClaw代替と、それぞれが誰に向いているかを紹介します。

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
AIカスタマーサポート向けZeroClaw代替ガイドのイラスト付きヒーローバナー
Alternatives

サポートチームのためのZeroClaw代替8選(2026年版)

ZeroClawは見事に作られたセルフホスト型のAIエージェントランタイムですが、サポートキューを回すためには作られていません。ここでは8つのZeroClaw代替と、それぞれがどんな人に向いているかを紹介します。

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
電話、チャット、メールをまたいで顧客との会話をルーティングするAIエージェントのイラスト
Alternatives

2026年おすすめのReplicant代替8選:AIサポート導入ガイド

2026年のReplicant代替ベスト8を料金・チャネル・導入期間で比較。エンタープライズ向け音声AIから、すぐ使えるセルフサーブのヘルプデスク自動化まで。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
2026年、企業ITと従業員サポートAIのためのEspressive代替を示すイラスト
Alternatives

2026年、Espressiveの代替となる8つの最良の選択肢

EspressiveはResolveに買収され、ブランドは終了することになりました。2026年における従業員・顧客サポートAIのためのEspressive代替8選をご紹介します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
2026年のAIカスタマーサービスにおける最良のMaven AGI代替ガイドのイラストバナー
Alternatives

2026年版 Maven AGIの代替7選

2026年のAIカスタマーサポートにおける最良のMaven AGI代替を、セルフサーブのヘルプデスクエージェントからエンタープライズCXプラットフォームまで、実際の料金とともに検証する。

Rama Adi NugrahaRama Adi NugrahaJul 15, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める