
The price card, side by side
両モデルは同じページに掲載されており、比較としては珍しいほどクリーンだ。同じベンダー、同じ料金表、同じ日付。

| 課金項目(100万トークンあたり) | deepseek-v4-flash | deepseek-v4-pro | Pro / Flash |
|---|---|---|---|
| 入力、キャッシュヒット | $0.0028 | $0.003625 | 1.29x |
| 入力、キャッシュミス | $0.14 | $0.435 | 3.11x |
| 出力 | $0.28 | $0.87 | 3.11x |
ベンチマークの前に、注目すべき点が2つある。まず比率が一様ではないこと。Proは、ほとんどの場面で支払う料金ではFlashの3.11倍だが、キャッシュヒット時ではわずか1.29倍にとどまる。次にキャッシュ料金そのものだ。Flashのキャッシュヒット価格は、自身のキャッシュミス価格に対して50倍の割引となっており、キャッシュはデフォルトで有効でコード変更も不要だ。Artificial Analysisはこれを、業界の大半が提供する90%割引よりも積極的な約98%のキャッシュヒット割引と呼んだ。
ただし落とし穴があり、リクエストが保存されているキャッシュのプレフィックス単位に完全一致した場合にのみヒット料金が適用される。部分的な一致はカウントされず、これはDeepSeekがスライディングウィンドウ・アテンションによるものだと説明している。キャッシュはベストエフォートとも明記されており、未使用のエントリは数時間から数日で消える。したがって安い料金は「たまに得られる割引」であって、計画に組み込める確定料金ではないと考えるべきだ。
料金表にはもう一つ、計算を変える要素がある。DeepSeekはAPIが近くピーク時料金(通常の2倍)を導入すると発表しており、対象は北京時間の毎日9:00〜12:00と14:00〜18:00だ。開始日はどこにも公表されていない。現在の数値は割引時間帯ではなく、通常料金である。
Same window, different brain
通常、安いプランと高いプランを分けるはずのスペックが、ここではまったく同じになっている。
| スペック | V4 Flash | V4 Pro |
|---|---|---|
| 総パラメータ数 | 284B | 1.6T |
| アクティブパラメータ数 | 13B | 49B |
| コンテキスト長 | 1M | 1M |
| 最大出力 | 384K | 384K |
| 思考モード | デフォルトでオン | デフォルトでオン |
| 同時実行数上限 | 2,500 | 500 |
| Responses API | あり | まだなし |
どちらもMixture-of-Expertsモデルであり、32Tトークン超で事前学習されている。ハイブリッドアテンション設計(Compressed Sparse AttentionとHeavily Compressed Attention)、さらにManifold-Constrained Hyper-ConnectionsとMuonオプティマイザも共通だ。1Mのウィンドウはマーケティング上の数字ではなく設定上も実在する。max_position_embeddingsは1048576となっており、これは64Kで学習されたウィンドウをYaRNで16倍に拡張することで到達している。

つまりProを選んでも大きなウィンドウが手に入るわけではなく、手に入るのはアクティブパラメータ3.8倍分だけだ。この違いは重要で、アクティブパラメータは主に想起力を左右し、まさにこの想起力こそ両者が分かれる部分だからだ。小さいモデルが健闘するという発想が初耳なら、一般論として小規模言語モデルの解説記事を参照してほしい。
画像入力はどちらのモデルにも明記されていない。Hugging Faceのどちらのリポジトリでもパイプラインタグはテキスト生成となっており、設定はDeepseekV4ForCausalLMを宣言していて、どこにもビジョンエンコーダは存在しない。料金表の機能欄にもJSON出力、ツールコール、FIMは載っているがビジョンの項目はない。DeepSeekのマルチモーダル関連は別系統のモデルラインで扱われている。あるエージェント開発者は、ビジョンとウェブ検索を補うために別のモデルを組み込んだと述べている。
Work out what each tier actually costs you
3.11倍という価格比が成り立つのは、両モデルが同じ数のトークンを出力する場合に限られるが、実際にはそうならない。Artificial AnalysisはFlashを冗長だと指摘しており、Intelligence Indexの完了までに2億1000万の出力トークンを生成した。これは同クラスの中央値1億トークンに対してかなり多い。推論トークンは出力料金で課金されるため、この冗長さはそのままコストの項目になる。
ここで有用な問いが浮かぶ。Proの方が安くなるには、Flashはどれだけおしゃべりになる必要があるのか?自分の数値を入れて試してみてほしい。
覚えておくべき数字はこれだ。出力トークンだけで見ると、Flashの冗長度がProの3.11倍を超えて初めてProの方が安くなる。AAが測定した中央値との差はおよそ2.1倍だ。入力トークンではさらにハードルが上がる。多くのワークロードは入力量が多く、Flashの入力料金はProの3分の1だからだ。実際にはFlashが、冗長さでは埋まらないほどの差でコスト面で勝つ。
とはいえ、これがビジネス上どんな意味を持つかも見積もっておく価値がある。Proの料金でさえ人件費の前では誤差の範囲であり、サポートチームにとって本当に興味深い比較はAI対人間のエージェントであって、FlashとProの比較ではない。
The benchmark inversion
ここが人々を驚かせた部分だ。2026年7月31日、DeepSeekはDeepSeek-V4-Flash-0731をリリースした。同社によればアーキテクチャとサイズは変えず、事後学習だけをやり直したという。つまり284B/13Bはそのままで、事後学習だけが新しくなった。公開されているエージェント系ベンチマークの表は以下の通り。
| Benchmark | Flash 0731 | Flash Preview | Pro Preview | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | – | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Flash 0731は9項目すべてでProビルドを上回り、9項目すべてでClaude Opus 4.8には及ばない。「安いプランが高いプランに勝つ」という同じ問いは他のラボでも起きており、指摘しておく価値があるが、たいていは逆の結果になる。Opus 5とSonnet 5を比較した記事では、高いプランがタスクあたりのコストでも品質だけでなく勝っていた。
DeepSeek自身が明記している注意点が2つあり、ここでも繰り返しておく。†のついた行は社内テストセットである。そしてコードエージェントの実行にはDeepSeek独自のハーネスが使われているが、これは公開されていないため、現時点では誰も独立に再現できない。あるXのアナリストは、公平な受け止め方を端的にこう述べている。
"DeepSeek is launching a very cheap, very capable coding-agent Flash model that looks surprisingly close to Claude Opus 4.8, especially considering it's the lightweight model. That said, this is DeepSeek's own benchmark selection, so it's naturally designed to highlight its strengths."
独立系のベンチマークも同じ方向性を示している。Artificial AnalysisはFlash 0731にIntelligence Indexで50点をつけ、これはDeepSeek V4 Proの44点を6ポイント上回る。タスクあたりのコストはFlashが$0.03、Proが$0.05だ。
重みの形が変わっていないにもかかわらずDeepSWEが7.3から54.4へ跳ね上がったことは疑念を招くもので、著名な日本のAIアカウントの少なくとも一つがそれをはっきり指摘している。以前のスコアがあまりに低かったため、この急回復はベンチマーク狙い撃ちのように見えるという。心に留めておく価値のある指摘であり、だからこそここではベンダー自身の表よりも独立系のインデックスの数値の方が重要になる。
Where Pro still wins
DeepSeekのプレビュー時代のクロスモード表は、両モデルを同じ推論エフォートで測定している唯一の場所であり、Proの強みが見えるのもここだけだ。
| Benchmark (max effort) | Flash | Pro | Gap |
|---|---|---|---|
| SimpleQA-Verified | 34.1 | 57.9 | +23.8 |
| Chinese-SimpleQA | 78.9 | 84.4 | +5.5 |
| BrowseComp | 73.2 | 83.4 | +10.2 |
| MRCR 1M | 78.7 | 83.5 | +4.8 |
| GDPval-AA (Elo) | 1395 | 1554 | +159 |
| MMLU-Pro | 86.2 | 87.5 | +1.3 |
| LiveCodeBench | 91.6 | 93.5 | +1.9 |
何かを決めるべきなのは、この想起力の差だ。SimpleQA-Verifiedにおける23.8ポイントの開きは丸め誤差の範囲ではなく、まさにアクティブパラメータ13Bというコストそのものである。DeepSeek自身もそれを認めており、Flashは純粋な知識タスクと最も複雑なエージェントワークフローでやや劣ると述べたうえで、同等性の主張をシンプルなエージェントタスクに限定している。
長文コンテキストの検索精度も同じ傾向だ。どちらも1Mを謳っているが、MRCR 1MはProが83.5、Flashが78.7で、ウィンドウのサイズは同じでも「針を見つける」精度は同じではない。「巨大なコーパスを詰め込んで、そこに正確な質問をする」というワークロードならProの領域だ。これはまた、生のコンテキストよりもRAGが概ね完勝するワークロードでもあり、ファインチューニングが3番目の選択肢として使われることはカスタムAIモデルの記事で扱っている。
この表には注意点が2つある。これらの数値は0731リビルド以前のプレビュービルドのFlashによるもので、DeepSeekは0731向けの知識系ベンチマーク表を再公開していないため、SimpleQAの差がそのまま残っているかどうかは分からない。さらに人間の好みという観点では、LMArenaは今もdeepseek-v4-proを1458±4、deepseek-v4-flashを1436±4とし、それぞれ約4万9000票にもとづいてProを上に置いている。自動化されたインデックスと人間の投票がここでは逆方向を指しており、単一の数値だけで結論を出すべきではない理由がここにある。
The reasoning-effort trap
もし私が両者の間で予算を動かそうとしているなら、真っ先に読むのはこのセクションだ。直感に反する内容で、料金表にも載っていない。DeepSeekはリクエストと実際のエフォートの対応表を公開している。
| You request | Flash serves | Pro serves |
|---|---|---|
low | low | high |
high | high | high |
xhigh | high | max |
max | max | max |
Proの列をもう一度見てほしい。lowのリクエストがhighとして処理されるため、Proには安い設定が存在しない。つまりトークン単価の3.11倍を払う上に、推論予算を絞ってそれを相殺することもできないのだ。Flashには逆の癖があり、xhighは静かにhighへと格下げされるため、このパラメータをいじってもhigh以上の効果は得られない。DeepSeekはProのこのマッピングを2026年8月上旬に更新予定としている。
思考モードはどちらもデフォルトでオン、エフォートはhighで、推論トークンは出力料金で課金される。-thinkingという別のモデル名は存在せず、同じエイリアス上のパラメータにすぎない。これをオフにすることも小さなトレードオフではない。思考なしのFlashはHLEで8.1、Apexで1.0にとどまり、maxではそれぞれ34.8と33.0になる。つまり安い設定を選ぶことは、実質的に別のモデルを選んでいるのと同じであり、これはLLM最適化のガイドが繰り返し行き着く教訓でもある。
ついでにサンプリング関連の落とし穴も2つある。思考モードではtemperature、top_p、presence_penalty、frequency_penaltyはすべて非対応で、設定してもエラーにはならず、単に何も起きない。また、モデルがツールコールを実行した場合、以降のすべてのターンでreasoning_contentを送り返す必要がある。
Operational differences that decide it
価格とベンチマークは見出しを飾るが、実際のデプロイで選択を左右するのはこちらの要素だ。
- 同時実行数。 Flashは2,500、Proは500の同時リクエストを許可する。DeepSeekはRPMやTPMの上限をまったく公開しておらず、レート制限モデルはこの同時実行数がすべてであり、キーに関係なくアカウント単位でカウントされ、上限を超えるとHTTP 429が返る。ファンアウト型のワークロードでは、この5倍の差が決定的になる。
- Responses API。 Flashのみ対応しており、DeepSeekはProへの対応を2026年8月上旬としている。0731ビルドはCodex向けに特化した調整も施されている。
- オープンウェイト。 FlashはMITライセンスでFP4/FP8混合の約167GBとして公開されており、8つのファインチューンと57種類の量子化がすでに公開済みで、同じチェックポイントにDSparkの投機的デコーディングモジュールも組み込まれている。Proには公開チェックポイントが存在しない。ライセンスが理由でここに来たなら、オープンソースチャットボットプラットフォームがより広い視点を与えてくれる。
- バージョニング。 Flashのエイリアスは常に最新ビルドを自動追従するため、「DeepSeek V4 Flash」というベンチマークの引用が、実際に手に入るモデルと同じとは限らない。あるデベロッパーのサフィックスに関する不満は聞く価値がある。何かを引用する際は必ず
-0731のように固定しておくべきだ。

What developers actually report
小さいモデルがなぜエージェント系タスクで勝るのか、最も有用な説明をしてくれたのは、両方をテストしたうえで理由を探しに行ったチームだった。
"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."
一発勝負では賢いが、ツールの扱いは苦手。これはベンチマークの分かれ方とほぼ完全に一致しており、私がこの二つを選ぶ際に見つけた最もクリーンなメンタルモデルだ。
実際にいくら使っているかについて、ローンチスレッドから自発的に投稿された2つの「レシート」を紹介する。
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
両方のプランを2週間運用したある人物は、Proに1日あたり約$1.50を支払っていると報告し、その差を「Flashよりおよそ50%高い」としている。これは料金表上の3.11倍よりも明らかに小さく、キャッシュヒットが多いことと、実際のProのトークン数が少ないことが実際の請求額にどう効くかを示している。もう一つ、私が強調したい指摘は、どちらのプランも小さなタスク、新しいセッション、手動でのチェックといった「面倒を見る」作業が必要だという点だ。
ネガティブな指摘は具体的で、繰り返し出てくる。ハルシネーションとコンテキストの取りこぼしは頻出だ。
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
Artificial Analysisは同じ現象を別の角度から測定している。Flash 0731の**AA-Omniscienceハルシネーション率は84%**で、前バージョンから12ポイント改善しているが、これは精度の向上ではなくハルシネーションの減少によるものだ。そしてDeepSeek関連のスレッドを支配する異論は、品質についてのものではまったくない。
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching."
この最後の指摘は、顧客データを扱う人にとって比較全体を静かに書き換えてしまう。ゼロデータ保持型のプロバイダーを使うと、Flashの$0.28という出力料金はおよそ$0.84〜1.40になり、Proの純正料金と並ぶか上回ってしまう。FlashとProの価格差は純正APIでのみ成立するものであり、その純正APIこそサポートの受信箱に直接つなぐことができないものなのだ。ここが、多くのチームがトークンの値段を比較するのをやめ、データ保持の問題を代わりに引き受けてくれるカスタマーサービス自動化を探し始める分岐点になる。
What this changes if you point it at a support queue
私はeeselでインテグレーションとモデル周りの実装を担当しているため、これは最もよく聞かれる質問だ。どのモデルをAIエージェントの裏に置くべきか。実際のサポートキューでAIを3年以上運用してきた経験からの正直な答えは、プランの選択は「うまくいくかどうか」を決める要素のリストの中で、だいたい5番目あたりだということだ。
ベンチマークではなく自分たちのデータからの証拠を示そう。実際のZendeskトラフィックを使ったクロスバリデーション試験(284件のチャットと、あるヨーロッパのEコマースチームでの100件の手動チェック)で、AIは受信箱の22%を占めるスパムに対して93%のトリアージ精度と、誤検知ゼロで100%のスパム検出を達成した。下書きの品質は88%の割合で方向性として正しかった。しかし**そのまま送信された下書きはわずか12%**で、**事実誤りの割合は7%**だった。エージェントが残りを書き直した理由を調べたところ、約65%が長さやトーンの問題、約20%はAIが接続されていないデータが必要な部分、そしてモデルそのものが間違っていたのはわずか5%程度だった。
この65/20/5という内訳がすべてを物語っている。品質のギャップの5分の4は、より多くのシステムを接続し、チーム自身の送信済み返信で学習させることで解決できるものであり、大きなモデルはそのどちらも代わりにやってはくれない。私たちが目にした最悪の失敗も、実は知能の問題ではまったくなかった。ナレッジベースの検索が何も返さなかったときにボットが回答をでっち上げてしまった有料顧客がいて、そのうちの一件では実際の顧客に架空のサブスクリプション情報を伝えてしまった。そこでの解決策は検索失敗時のハードなフォールバックであり、これはパラメータ数ではなくパイプラインの設計判断だ。
したがって、この二つのどちらかをサポートチケットの自動化に使うのであれば、Flashを選び、浮いたお金を実際のデータソースの接続に使い、そのうえで適切なエスカレーション経路を用意すべきだ。
解決率をプランのアップグレードよりも大きく動かす要素がいくつかあり、おおよそ次の順序になる。まずチケット分類を正しく行い、AIが答えるべきことだけに答えるようにすること。次に、それ以外のすべてに対して実効性のあるエージェントへのハンドオフ経路を構築すること。そして自社データでの学習、特にチーム自身の送信済み返信での学習であり、これだけで私たちの試験データではそのまま採用される下書きの割合が12%から30〜40%まで伸びるとされた。
そのすべての上に、もう一つの制約が乗っている。DeepSeekの純正APIは安い料金がある場所であると同時に、あなたのチケットが学習データになる場所でもある。したがって顧客とのやり取りに関しては、現実的にはゼロデータ保持型のプロバイダーの料金を見積もることになる。これによって候補リストは変わってくるため、AIカスタマーサービスソリューションの概要記事の方が、トークンの料金表よりも良い出発点になる。どちらの道を選ぶにせよ、解決率の改善はモデルの問題になるずっと前から、まずデータの問題であり続ける。
Try eesel
誰かのベンチマークに受信箱を賭けることなく、安いモデルの経済性を手に入れたいだろうか。eeselは、あなたがすでに使っているヘルプデスクに接続し、過去のチケットとヘルプセンターから学習する。この記事にとって重要なのは、顧客が一人でも目にする前に、自社の過去チケットに対してエージェントをシミュレーションできる点だ。今月どのモデルが勝っていようと、あなたのデータとトーンにもとづいた実際の解決率と、実際に間違えていたであろう内容のリストが得られる。無料で試せて、料金は座席数ではなく解決したチケット単位だ。

このシミュレーションの習慣は、マーケティングのためではなく傷跡から生まれたものだ。私たちは自信満々に間違った答えを返すボットを何度も見てきた。過去のチケットに対してまずロールアウトを実行することだけが、顧客より先にそれを捕まえる唯一の方法だ。決める前にもっと広い視野が欲しいなら、ベストAIエージェントのまとめ記事とベストAIヘルプデスクソフトウェアのリストが良い出発点になる。
Which one I would pick
2026年8月時点のエージェント系・コーディング作業なら、迷わずFlashだ。実際に支払う料金では3.11倍安い。DeepSeekが公開するエージェント系の全項目でProを上回り、独立系インデックスでも6ポイント高く、同時実行数は5倍で、オープンウェイトとResponses APIの両方に対応しているのもこの二つのうちFlashだけだ。今日のエージェント系作業においてProが勝つ比較の描き方は存在しない。
事実想起、非常に大きなコンテキストにおける正確な検索、あるいは自信満々に間違えることがコストにつながる場面では、Proを選び、代わりにClaude Opus 5やGPT-5.6にすべきかも確認してほしい。SimpleQAの差は「とりあえず安い方を使えばいい」が知識系タスクにおいては悪いアドバイスになるほど大きく、その軸でProが欧米のフロンティアモデルに対して優位かどうかも明らかではない。
タイミングが不確定要素だ。DeepSeekはV4-Proのリフレッシュを予告しているが、FlashのDeepSWEスコアを7.3から54.4に押し上げたのと同じ事後学習のやり直しは、まだProには適用されていない。あるコメント投稿者は当然の疑問を率直に投げかけている。今回の判断がこのスプリント限りではなく12か月単位のコミットメントであるなら、注目すべきなのはこのイベントだ。
ついでに他の選択肢とも価格を比較しておく価値がある。Qwen 3.8 Maxは$2/$6、Kimi K3は$3/$15で、どちらもあらゆる指標でDeepSeekより明らかに高い。
料金表ではなく直接対決が見たいなら、私はすでにQwenとFlashを直接比較しており、QwenとKimi、QwenとGPT-5.6の比較も行っている。
前世代から乗り換える場合は、DeepSeek V3.2の記事がアップグレードの文脈を扱っており、Qwen 3.7 Flashが最も近い安価プランのライバルだ。どのモデルを選んでも、その上に乗るハーネス層についてはベストAIコーディングアシスタントを参照してほしい。
よくある質問
DeepSeek V4 FlashとV4 Proの違いは何ですか?
DeepSeek V4 FlashはV4 Proより優れていますか?
DeepSeek V4 ProはFlashと比べてどれくらい高いですか?
DeepSeek V4 Flashはオープンウェイトですか?
カスタマーサポートエージェントにはどちらのDeepSeekモデルが最適ですか?
コスト削減のためDeepSeek V4 Proを低い推論エフォートで動かせますか?
lowを指定しても実際にはhighで処理されるため、このプランには安価な設定そのものが存在しない。Flashではlowは文字通り低く、xhighはhighとして処理される。DeepSeekはProのこのマッピングを2026年8月上旬に変更予定としている。DeepSeek V4 Flashの料金は近く変更されますか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








