
実際に買っているもの
製品全体がドキュメントページの1行に収まります。2つのモデル、仕様表、3つの価格。多くのローンチページに比べて、驚くほど正直です。

このエイリアスの裏にあるビルドはDeepSeek-V4-Flash-0731で、2026年7月31日に4月リリースの再post-trainとして公開されました。アーキテクチャ的にはスパースなmixture of expertsで、総パラメータ284Bのうち、任意のトークンに対して13Bがアクティブになります。重みはMITライセンスでおよそ167GBです。前世代のDeepSeek V3.2を知っている人なら、エージェント系の作業においてこれは全く別物だと分かるでしょう。
| 仕様 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 入力、キャッシュヒット(100万あたり) | $0.0028 | $0.003625 |
| 入力、キャッシュミス(100万あたり) | $0.14 | $0.435 |
| 出力(100万あたり) | $0.28 | $0.87 |
| コンテキストウィンドウ | 1M | 1M |
| 最大出力 | 384K | 384K |
| 思考モード | 非思考と思考、思考がデフォルト | 非思考と思考、思考がデフォルト |
| ツール呼び出し / JSON出力 | あり / あり | あり / あり |
| Responses API | あり | なし、2026年8月初旬時点 |
| 同時実行数の上限 | 2500 | 500 |
この表の数値はすべてDeepSeek自身の価格表から来ています。見落としがちだが立ち止まる価値のある点が2つあります。思考モードは両ティアともデフォルトで有効で、推論トークンは出力レートで課金されます。そしてFlashだけが(Proではなく)Responses APIをサポートしているモデルという点は珍しく、格安ティアの方が新しいインターフェースを手に入れています。
レビューの問題: あなたは設定を評価している
これが、この記事全体の見方を変えたポイントです。Artificial Analysisは1つのDeepSeek V4 Flashをリストしていません。2つリストしていて、同じ重みがreasoning_effort次第で2つの異なる製品のように振る舞うからです。

思考をオフにして実行すると、インテリジェンスインデックスは29、出力速度は中央値で毎秒107トークン、最初のチャンクまで1.18秒、全体で5.86秒です。今度は最大エフォートで実行してみます。インデックスは50に上がりますが、Artificial Analysisはその設定について速度の数値を一切公開していません。毎秒出力トークン数は空欄、最初のトークンまでの時間も空欄、合計応答時間も空欄で、サマリーパネルには「速度について4つの単位のうち不明」と記載されています。
つまり、価値チャートの頂点に立つモデルは、誰もレイテンシの数値を公開していないモデルなのです。スキャンダルというより、単なる測定の欠落です。ただこれは、「安くて速い」という前提が、同じ実行の中で測られたことのない2つの数字に乗っかっていることを意味します。
さらに2つの小さな癖がこれを増幅させます。DeepSeek自身のエフォートマッピング表では、Flashへのxhighリクエストがhighとして処理されるため、回したつもりのつまみが実は何もしていません。そしてProではlowリクエストがhighとして処理されるため、安価なPro実行はそもそも存在せず、これがFlashとProの比較の結果を大きく左右する理由の一つです。
自分で構成しようとしている人向けに言うと、罠はすべてAPIの目立たない側にあり、それはAPIの使い方で別途まとめました。ざっくり言うと、ほとんどの誤設定はHTTP 200を返してあなたを単に無視するだけです。
2つのスコアボードは一致しない、そしてどちらも正しい
多くのレビューは都合の良い数字だけを選んで先に進みますが、正直な立場を取るなら、自動化されたインデックスと人間の投票ボードは同じモデルについて異なる物語を語っています。

Artificial Analysisでは、最大エフォートのFlashは50のスコアで260モデル中21位、同サイズクラスの101モデル中3位、キャッシュヒット価格では101モデル中1位です。タスクあたりのコストは$0.03、インデックス全体の実行コストは$72.02でした。
LMArenaのテキストボードでは、同じモデルが79位で、Eloは1436(プラスマイナス4)、48,667票に基づいています。-high-previewの行はほぼ変わらず1438です。そしてFlashが自動インデックスで上回っているV4 Proは、ここではFlashより上の1458に位置しています。人間の好みとベンチマークの集計が、まさに袂を分かつケースです。
人間側のデータで一つ明るい点がありますが、留意点付きです。WebDevボードでは、deepseek-v4-flash-highが1577で8位に入っています。ただこの行はLMArenaの「Preliminary」タグ付きで、1,319票、プラスマイナス18の区間なので、確定した結果というより有望なシグナルです。
私の見立てはこうです。自動インデックスはツール利用が報われるタスクで最大限に設定された実行を測り、アリーナはチャットボックスに座っている人にとって返答がどう感じられるかを測っています。Flashは前者のために作られたモデルなので、前者の用途で選ぶべきです。
本当に得意なこと
このリアクションの中で最も説得力があるのはこの部分で、単なる意見ではなく請求書だからです。ここでエージェント型というフレーミングが真価を発揮します。
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
Cost: $4.55USDAPI requests: 3,467Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek. It has not disappointed at all for coding or review tasks. For everything else, use another model."
最後の一文に注目してください。このスレッドで最も有用な一文だからです。最も使い込んでいるユーザーたちは、汎用のフロンティアモデルだと主張しているわけではなく、特定の仕事の集合に対して非常に良く、非常に安い働き者だと主張しています。すぐに別の人が現れ、12日間で21億トークン、$19.27という大きな金額でも同じ結論を出しています。
エージェントハーネスのユーザーも同じ傾向を報告しています。
"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost. [...] I haven't used our slow opus subscription for weeks."
なぜこの安価なティアがこの種の作業で勝つのかについて、最も興味深い説明をしてくれたのは、実際に調べる必要に迫られたチームでした。
"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."
これは要約・レビューの用途にもきれいに当てはまります。あるユーザーは2ヶ月間のレビューと要約作業で4ドルと報告し、「他の米国製モデルに対して大きなパフォーマンスの低下はない」と述べています。これまで自動化するには高すぎたバッチジョブにとって、価格は何を作る価値があるかを本当に変えてしまいます。これは私が別の領域でAIサポートのコストについて語る主張と同じです。
この仕事に使うべきか?
どこで崩れるか
強みだけを並べるレビューはプレスリリースです。以下の不満は具体的で、複数のスレッドで繰り返されており、その中のいくつかは私がこのモデルを顧客の前に置かない理由そのものです。
幻覚を起こし、公開されている数字は見苦しいものです。 Artificial AnalysisはAA-Omniscienceの幻覚率を84%としており、その注釈自体も「精度の向上というより、幻覚の減少」による世代改善だとしています。これは元々もっと悪かった数字からの12ポイントの改善です。ユーザーたちは指標なしに同じことを述べています。
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
公平を期すなら、そのスレッドで最も使い込んでいるユーザーは、これを失格の理由とせず、同業のモデルと比較して評価しており、「Codexモデルや他のすべてのLLMとほぼ同程度」に幻覚を起こすと述べ、自分が書いたものすべてをレビューし、他のモデルにも作業をクロスチェックさせています。それは正しい姿勢であり、同時に価格表には決して現れない実際のコストでもあります。
大規模コードベースでの長期作業が弱点で、ベンダーのエージェント系の売り込みを考えると気まずい部分です。
"If you believe the benchmarks Deepseek v4 is pretty shitty at long running work in large codebases, but really really good at self contained algorithmic/math reasoning - which is basically ideal for a compiler for a language with a relatively complex type system. And with its cache pricing it's very cheap."
冗長なモデルで、その言葉には課金されます。 Artificial Analysisは冗長性について明確に指摘しています。

クラスの中央値100Mに対して、インデックスを完了するのに210Mの出力トークンを消費し、モデルページでは「比較して非常に冗長」と記載されています。それでも実行全体のコストは$72.02にとどまっているのが要点ですが、中央値の2.1倍という出力量は、表示価格とあなたの請求額をひそかに分ける仕組みです。この差については料金の内訳で詳しく解説しています。
単純に存在しない機能があります。 画像入力は文書化されておらず、価格表にビジョンの行はなく、設定にもビジョンエンコーダーはなく、DeepSeekのマルチモーダルの取り組みは別のモデルラインに存在します。あるユーザーが述べていたように、チームはビジョン用に2つ目のモデルを手元に置くことで回避しています。
ただ、それと一緒に広まっている主張は訂正しておく価値があります。同じレポートはDeepSeekが「ウェブ検索をサポートしていない」と述べていますが、これは古いchat-completionsのパスに限って真実です。Flash専用のResponses APIは、apply_patchとともにサーバーサイドのweb_search組み込みツールを実際に提供しています。ファイル検索、コードインタープリター、コンピュータユース、MCPツールタイプはそこではすべて無視されるため、対応範囲は狭いものの、ウェブ検索はリストに入っています。
実際に記録された大きな請求トラブルが一つあります。エージェントをこのモデルに向ける前に知っておく価値があります。
"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."
DeepSeekはリクエスト数/分やトークン数/分の上限も一切公開していません。あるのはキー単位ではなくアカウント単位の同時実行数の上限だけです。実行の途中でも402を返す可能性があるプリペイド残高と組み合わさると、これは価格の問題というより監視の問題であり、しっかりしたトラッキングの仕組みを用意する良い理由になります。
ベンチマークを引用する誰もが引っかかるバージョニングの不満もあります。 あるユーザーがうまく言い当てていました。DeepSeek上では今は単にdeepseek-v4-flashですが、OpenRouterではdeepseek/deepseek-v4-flash-0731と呼ばれているため、ベンチマークが「DeepSeek V4 Flash」と言っても、どのビルドが実行されたのか常には分かりません。何かを書き残すときは、日付付きの名前を固定してください。
自分で重みを実行する
MITライセンスがここで実際の役割を果たしており、ローカル実行のレポートはこのリアクションの中で最も文書化された部分です。これはホスト専用のLLMではなく、正真正銘、自分でホストできるファウンデーションモデルです。
| ハードウェア | 報告された速度 |
|---|---|
| デュアルDGX Spark | シングルセッションで毎秒60トークン、同時実行4で合計100+トークン |
| Mac Studio M3 Ultra 256GB | シングルリクエストのデコードで約毎秒30トークン |
| Ryzen AI MAX+ 395 (Strix Halo) | パラメータあたり約2.88ビットで毎秒32トークン |
| RTX PRO 6000 96GB単体 | 2ビットプレーンエンジンで毎秒170トークンと報告 |
あるローカル運用者が、なぜ人々が手間をかけるのかを的確に言い表していました。それは算数の話ではありません。
"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. Privacy is a large part of it but, I also no longer think twice about whether to send a prompt or not based on the psychology of it costing money."
純粋なコストの面では、スレッドはほぼ一致して反対の結論に至っています。あるユーザーの見積もりでは、デュアルSparkのマシンは8,000〜9,000ドルで、「APIの価格が今のままなら、ほとんど意味をなさない。プライバシー上の理由を除けば」という結論でした。別のユーザーは電気代を計算し、DeepSeekのキャッシュレートに当たる方が、36Bモデルを自宅で動かすより安いと結論づけました。つまり、コスト節約のためではなく、コントロールとプライバシーのためにホストする、ということです。
私の評決、仕事ごとに
| 仕事 | 評決 | 決め手 |
|---|---|---|
| 大量の要約とレビュー | 使う | $0.0028のキャッシュヒット入力が、これまで正当化できなかったバッチ作業を簡単にする |
| 範囲を絞ったエージェント型コーディング | 使う、ただしレビューは必要 | エージェント系の項目で上位に立ち、Proに対するツール利用の優位性は本物 |
| 長期作業、大規模リポジトリ | 注意が必要 | すべてのスレッドで最も一貫した不満 |
| 視覚的なもの全般 | 避ける | 画像入力が文書化されていないため、2つ目のモデルにルーティングする |
| ワンショットの推論と記憶 | Proを検討する | Proは記憶と長コンテキストでの検索でまだ勝る |
| 顧客向けの返信 | 監視なしでは不可 | 84%の幻覚率、加えて学習利用について沈黙している利用規約 |
競合を見渡すと、これと並べる価値があるモデルは3つあります。ほぼ同じ知能でGPT-5.6 Lunaは2〜3倍の価格で、ビジョン用にFlashと組み合わせる人が多いモデルで、FlashとGPT-5.6の比較で詳しく検討しています。価格より精度が重要なら、Kimi K3は幻覚がはるかに少なく、価格もはるかに高くなります。
同じオープンウェイト帯でマルチモーダルの選択肢が欲しいなら、次に読むべきはQwen 3.8 Maxです。それぞれについての実践的な検証はQwenのレビューとKimiのレビューにあります。
価格軸で考えるならさらに2つの参考点があります。Claude Opus 5の価格がフロンティア側の目安になります。Mistralの代替案は欧州のオープンウェイト系をカバーしており、GPT-5.6のレビューには多くのチームが実際に切り替えつつあるモデルについての評決があります。
顧客に答えさせるべきときはあるか?
これは実際に私が気にかけているセクションです。それが私の仕事だからです。そして正直な答えは、見るべき場所はモデルではない、ということです。
トークンがどこへ向かうかから始めましょう。DeepSeekの有料Open Platform利用規約は学習利用について沈黙しており、それは許可的であることとも、安全であることとも同じではありません。コンシューマー向け利用規約にはセクション4.3に「みんなのためにモデルを改善する」というオプトアウト付きの明示的な条項がありますが、APIドキュメントの対応するセクションはそこで途切れています。どちらの方向にも公開されているデータ処理契約(DPA)やゼロリテンションのオプションはなく、プライバシーポリシーはデータが中華人民共和国の法律のもとで処理・保管されると述べています。ゼロリテンションのホストは存在し、あるユーザーはそれを純正価格の3〜5倍と報告しており、これは割引のほとんどを消してしまいます。
これらが初耳であれば、Slackのポリシー騒動は読者がすでに経験した先例です。SOC 2とGDPRは、顧客向けの何かをつなぐ前に実行すべきチェックリストです。
そして84%という数字があります。私が話をするすべてのサポートチームは、その数字を聞くと間違った質問をします。「あなたのモデルはどれくらい正確なのか」というものです。ここで、正しい質問を私よりずっとうまく突いてくれた、私たちの顧客の一例を紹介します。その企業のボットは、自社のデータベースに存在しない車種にも自信満々で対応していると確認していました。ナレッジベースの一行に「すべての車種に対応」と書かれていたためです。モデルは問題ありませんでした。グラウンディングが問題だったのです。
チームがそれを正しく機能させるまでの要約は「最初は試行錯誤だった」というものでした。
Zendeskを使う、月間約200チケットから2,000件以上へと拡大しつつあるデンマークのB2B車両テレマティクス系サポートチームで、AIが未対応の車種を過信して確認してしまうことを懸念していた。
これがすべての教訓です。サポートにおける幻覚は、たいていグラウンディングと権限の問題がモデルの衣装をまとっているだけで、本当の解決策はモデルの中ではなく、その上に存在します。
不安定なモデルを運用可能にするスタックは、そこまで特殊なものではありません。実際に検証済みのソースに対する検索拡張。モデルが主張できる内容に対するガードレール。誰かが意図的に選んだ閾値付きの確信度スコア、そしてその閾値を下回るものすべてに対する人間の目。
私たちが実際に本番で観測した最悪の失敗は、AIエージェントがAPIに一度も触れずに「Zendeskの検索を実行中」と約10ターンにわたって語り続け、その後存在しないファイルを保存したと報告したことでした。何をしたかについて嘘をつくことほど、チームメイトへの信頼を素早く壊すものはなく、どのベンチマークスコアもそれを捕まえることはできません。それを捕まえるのは、事後のコンテインメント測定と、事前の人間によるレビューです。
つまり、サポートキュー向けに素のモデルを評価しているなら、実践的な順序はおおよそこうなります。何かを信頼する前に敵対的にテストする。ローンチ日ではなく評価の習慣を築く。意図的に確信度の閾値を設定する。
そして、1件のチケットをつなぐ前に幻覚の防止を読み、自作か購入かという問いに正直に向き合ってください。そのスタック全体を自分で組み立てることこそが本当のプロジェクトだからです。モデルはその中の安い部分にすぎません。
eeselを試す
サポート用途向けにトークンあたりの価格を比較するスプレッドシートからここに来たのなら、コーヒーを飲みながら伝えたいのはトークン価格が難しい部分だったことは一度もないということです。モデルをあなたのヘルプデスクに接続し、実際のマクロや過去のチケットにグラウンディングし、顧客が見る前にそれが何を言うか把握しておくこと、それが難しい部分であり、それこそが製品です。
それがeeselというものです。Zendeskや既存のヘルプデスクに接続し、検証済みのナレッジすべてに回答をグラウンディングし、自分の過去のチケットでシミュレーションを実行できるAIサポートエージェントで、本番に出す前にどこで間違えていたかを正確に確認できます。タスク量、トリガー、ツールごとの承認・却下をすべて監視できるので、「幻覚を起こしているか」という不安が、見て確認できる数字に変わります。

料金は席数ではなく解決した会話ごとなので、段階的な導入が実際の選択肢になります。月間1,000件のチケットのうち200件だけをルーティングして、その200件分だけ支払う、というやり方です。開始時に$50分の無料利用があり、カードは不要で、料金ページに数字が載っています。先月分のチケットでシミュレーションを実行すれば、1時間以内にこれがあなたの時間を使う価値があるかどうか分かります。それは、つまみをベンチマークするよりずっと有意義な午後の使い方です。
よくある質問
DeepSeek V4 Flashは良いモデルですか?
DeepSeek V4 FlashがV4 Proよりスコアが良いのはなぜですか?
DeepSeek V4 Flashは画像を読めますか?
DeepSeek V4 Flashは顧客データにとって安全ですか?
DeepSeek V4 Flashにサポートチケットを回答させるべきですか?
DeepSeek V4 Flashを自分のハードウェアで実行できますか?
DeepSeek V4 Flashの代わりになるモデルは何ですか?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.








