
本当の戦いはSolではなくLuna対Flash
GPT-5.6は1つではなく3つのモデルであり、gpt-5.6というエイリアスは単純にSolにルーティングされる。だから多くの対決記事は妙な読み味になる。DeepSeekの安いティアをOpenAIの高いティアと比較して、「安いモデルは安い」という結論を出しているのだ。
以下が現時点での価格表の全体像で、標準ティア、短いコンテキスト、100万トークンあたりの価格だ。
| モデル | 入力 | キャッシュ入力 | 出力 | AA Intelligence Index |
|---|---|---|---|---|
deepseek-v4-flash | $0.14 | $0.0028 | $0.28 | 50 |
gpt-5.6-luna | $0.20 | $0.02 | $1.20 | 51 |
gpt-5.6-terra | $2.00 | $0.20 | $12.00 | 55 |
gpt-5.6-sol | $5.00 | $0.50 | $30.00 | 59 |
deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | 44 |
価格はDeepSeekの価格表とOpenAIの価格ページより、指数スコアはArtificial Analysisより。最後の行に注目してほしい、これ自体が興味深い話で、DeepSeekの高価格ティアが今では安価ティアよりスコアが低いという現象についてFlash対Proで詳しく掘り下げている。

この投稿が存在する理由は7月30日の値下げにある。OpenAIは1つの発表でTerraを20%、Lunaを80%引き下げた:"Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." いまだにLunaを$1.00と$6.00で引用している比較記事は5倍ずれている。ティアごとの詳細はGPT-5.6 SolとGPT-5.6 Terraでそれぞれ扱っている。

それぞれのモデルの実体
Flashはスパースな専門家混合(MoE)モデルで、総パラメータ284B、アクティブパラメータ13B、MITライセンスで提供されているため、重みはHugging Face上にあり、自分で自由に実行できる。vLLMチームはリリース日にこのアーキテクチャについて次のように説明した:"A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." 一部のモデルウィジェットに表示される"304B"という数字は無視してよい、設定ファイルには284Bと記載されている。
GPT-5.6はクローズドウェイトで、3つのティアがあるが仕様書は共通だ。3つとも1,050,000のコンテキスト、128,000の最大出力、2026年2月16日の知識カットオフを持ち、テキストと画像の入力に対応する。
| DeepSeek V4 Flash | GPT-5.6(全ティア) | |
|---|---|---|
| 重み | MIT、オープン、約167GB | クローズド |
| パラメータ | 総284B / アクティブ13B | 非公開 |
| コンテキスト | 1M | 1,050,000 |
| 最大出力 | 384K | 128,000 |
| 画像入力 | 記載なし | あり |
| ウェブ検索 | 記載なし | あり |
| 知識カットオフ | 非公開 | 2026年2月16日 |
| 思考モード | デフォルトON、3段階の推論レベル | 推論トークン対応 |
| キャッシュ割引 | 約98% | 90% |
| 同時実行数 | 2,500 | ティアによる、500〜30,000 RPM |
設定を書く前に知っておくべき2つの癖がある。Flashでは、xhighは黙ってhighとして扱われるため、ある時点から先は推論レベルを上げることができない。GPT-5.6では、同じ7月30日にFast modeがPriority Processingに取って代わった。料金は2倍になり、"up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."という条件だ。
オープンウェイトをもっと広く検討しているなら、この比較と並んでよく聞かれるのが小規模言語モデルとオープンソースエージェントの2つだ。
ベンチマークの読み方:下位では互角、上位では明確な差
Artificial Analysis Intelligence Index v4.1では、Flashは50で、オープンウェイトモデルの中ではKimi K3の57、GLM 5.2の51に次いで3位だ。Lunaは51、Terraは55、Solは59で、Solは全体のボード上でも2つのClaudeモデルに次いで3位につけている。Artificial Analysisはリリース当日、コスト面を次のようにまとめた:
"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."
人間による評価は複合指数とは違う物語を語る。LMArenaのテキストボードでは、deepseek-v4-flashは48,667票中1436±4のスコアで79位、一方gpt-5.6-sol-xhighは全体で15位だ。WebDevでは、deepseek-v4-flash-highは1577で8位、Solは1620で6位。つまり安価なオープンモデルは自動化された指数では競争力があるが、人間によるブラインド比較では明確に劣っており、これはほぼ予想通りであり、はっきり言っておく価値がある。
この投稿を出すにあたって、外せない3つの注意点がある。
- DeepSeek自身のチャートは選択的だ。 ある冷静な読み手が指摘したように、この比較は"is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge"というものだ(Dr. Tomislav Marinovic, X)。
- このジャンプは疑念を招いた。 DeepSWEはパラメータ数が変わらないまま7.3から54.4に上昇し、あるAIアカウントは、アップデート直後にスコアだけが飛躍するのはベンチマーク対策(benchmaxxing)のように見えると率直に指摘した。というのも、以前の低いDeepSWEスコアこそが前バージョンの弱点を露呈させていたからだ。
- Flashは冗長で、幻覚(ハルシネーション)もまだ発生する。 Artificial Analysisは指数の測定に2.1億の出力トークンを要したと計測しており、これは同クラスの中央値1億トークンに対して多い。AA-Omniscienceの幻覚率は84%で、前バージョンより12ポイント改善している。Lunaも冗長で、中央値6,200万トークンに対し1.3億トークンを使う。どちらの数字も気になるなら、幻覚を防ぐ方法についてのメモが実践的な内容になっている。
実際のワークロードでかかるコスト
料金表は誤解を招きやすい。2つのモデルの比率はトラフィックの量だけでなく、その形状によっても変わるからだ。キャッシュ入力の比率、出力重視の推論、長いプロンプト、いずれもこの比率を動かす。自分のワークロードに最も近いプロファイルを選んでほしい。
地味な結論だが、これが持ち帰るべき数字だ。どの形状でも、Flashは出力価格の列が示す4倍ではなく、Lunaよりおおよそ3倍安く収まる。あるHacker Newsのコメント投稿者はタスクあたりコストの列から同じトレードオフを的確に評価した:"OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference"(spwa4, Hacker News)。別の投稿者は料金表を並べて同じような結論に達した:
"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."
表示価格が実際の価格でなくなる場面
実際の請求額を動かす要因は4つあり、両ベンダー間でまったく対称ではない。
GPT-5.6には272K入力トークンという崖がある。 すべてのGPT-5.6モデルページに同じ文言が書かれている:"Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." これを超えるとリクエスト全体が再価格化され、Solのリクエストは$5と$30から$10と$45になる。Flashの100万トークンウィンドウには同等の記載がなく、リポジトリ全体や履歴全体を渡すプロンプトにはより安定した選択肢だ。これはどちらのモデルでも詰め込みより検索の方が良いという論拠にもなる。

DeepSeekにはピーク時間帯の2倍料金が予定されている。 価格表には、APIが"will soon adopt a peak/off-peak pricing policy"を導入予定で、"during peak hours, prices will be 2x the regular prices, applicable to all billing items"になると記載されている。時間帯は北京時間9:00〜12:00と14:00〜18:00、UTCでは01:00〜04:00と06:00〜10:00にあたる。開始日は未発表で、ピーク料金表も公開されていないため、具体的な数字というよりは同期処理トラフィックに対するリスクとして捉えるべきだ。
キャッシュこそがDeepSeekの優位性が最も大きく、かつ最も不安定な部分だ。 約98%のキャッシュヒット割引はOpenAIや業界の大半が提供する90%を上回り、コード変更なしにデフォルトで有効になる。ただし仕組みに落とし穴がある。リクエストが永続化されたキャッシュプレフィックス単位に完全一致した場合のみヒット料金が適用され、キャッシュは明示的にベストエフォートであり、未使用のエントリは"usually within a few hours to a few days"で消去される。$0.0028を定常状態として計算に入れてはいけない。
サードパーティの課金は思わぬ形で驚かされることがある。 あるユーザーはその最も極端な例を報告している:"The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff"(onlyrealcuzzo, Hacker News)。OpenRouter上でFlashを提供しているプロバイダーは11社あり、DeepSeek自身が最安とは限らないため、ループをスケールさせる前にプロバイダーごとの計測方法を確認する価値がある。
実際に支払われている金額
ここがDeepSeekへの反応の中で私が一番好きな部分だ。みんな意見ではなく領収書を投稿するからだ。ローンチスレッドには、頼まれてもいないのに2件のこうした投稿があった。
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:
$19.27 USDAPI requests: 7,877Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."
2つ目の投稿が認めている点に注目してほしい。目を見張るようなトークン数が安いのは、まさにキャッシュを多用しているからであり、これは上のウィジェットの最初のプロファイルそのものだ。3人目のユーザーは30ターンのエージェントハーネスを実行し、1セッションを"~$0.5 cost"と報告し、Opusのサブスクリプションを数週間触っていないと述べている(kmarc, Hacker News)。
一方でGPT-5.6の値下げには公表済みの顧客の数字が伴っており、これはOpenAIが出す領収書に最も近いものだ。NotionのAIプロダクトリードは、新モデルが"delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time"と述べ、BlitzyのCTOは、単一の構造化出力コールからフルエージェントループに移行した後、Lunaが"handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini"だったと報告している。どちらもベンダー発表であるため、独立した検証ではなく方向性を示すものとして読んでほしい。
実際に決め手となる機能面のギャップ
ここまで読んで価格で決着がつくと思っていたなら、ここで話が変わる。ほとんどのチームにとってこの比較を決めるのは、価格ページには載っていない2つの要素だ。
Flashは画像を見ることも検索することもできない。 画像入力の記載はなく、ウェブ検索もAPIに含まれていない。人々はモデルをどちらか一つ選ぶのではなく、組み合わせることでこれを回避しており、これは私も真似したいパターンだ:"Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly"(theturtletalks, Hacker News)。サポートキューがスクリーンショットだらけなら、このギャップだけで議論は終わる。
速度は片方で未計測、もう片方では公開されている。 Artificial AnalysisはFlashの推論版について出力速度、最初のトークンまでの時間、総応答時間のいずれも記載しておらず、速度を"Unknown out of 4 units"としている。非推論版には数値があり、1秒あたり107トークンだ。Lunaは1秒あたり177.8トークン、Terraは138トークン。Solは例外的で、1秒あたり67.7トークン、最初のトークンまでの時間が137.84秒と、自身の価格帯の中央値を下回っており、インタラクティブな用途の裏側に置く前に知っておく価値がある。

オープンウェイトはここで現実的な選択肢だが、計算上はやめておいた方がいいという結論になることが多い。 Flashはローカルで動作し、報告は詳細だ。デュアルDGX Sparksでシングルセッション毎秒60トークン、256GBのM3 Ultraで約30トークン、Ryzen AI MAX+ 395で1パラメータあたり約2.88ビットで32トークン。問題はハードウェア代で、デュアルSpark構成で約8,200ユーロかかる。計算をした人の結論はこうだ:"it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons"(cmrdporcupine, Hacker News)。ただしプライバシーは小さな例外ではなく、それが最後の項目につながる。
データ保持こそが最も繰り返される反論だ。 Flashについて最も多く繰り返される不満は品質ではない:
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."
これを料金表に当てはめると、見出しの優位性は消えてしまう。Flashの出力価格$0.28は$0.84〜$1.40になり、これはLunaの$1.20とほぼ同じ帯域で、しかもLunaには画像入力、検索、公開されたレイテンシプロファイルが付いてくる。もしトークンに顧客データが含まれるなら、「安いモデル」の話と「安全なモデル」の話は同じ話になる。

私の結論
自分でデータを所有する大量のテキスト処理にはDeepSeek V4 Flashを選ぶ:コーディングエージェント、コードレビュー、要約、分類、長いキャッシュプレフィックス、30ターンでも気にせず回せるようなあらゆる用途に向く。現時点ではボード上で最も「ドルあたりの知能」が高く、上に挙げた領収書もそれを裏付けている。オープンウェイトが重要なら、これも選ぶべき理由になる。ライセンスもHugging Faceの重みも約束ではなく実在するものだからだ。
画像や検索が必要な場合、レイテンシがユーザーに見える形で影響する場合、あるいはどのみちゼロリテンションホストを経由するつもりならGPT-5.6 Lunaを選ぶべきだ。その時点でLunaと同じ料金を払いながら能力は劣ることになるからだ。Solを選ぶのは、タスクが本当にボードの最上位を必要とする場合だけにし、チャット画面の裏に置く前に最初のトークンまでの時間を確認しておこう。どちらも合わなければ、GPT-5.6の代替がほかの選択肢をカバーしており、GPT-5.6のレビューにティアごとの詳細がある。
あるいは両方を使うのも一つの手で、これはこのテーマについて投稿しているチームの多くが実際にやっていることだ。大量のテキストはFlashに、スクリーンショットと検索はLunaに振り分け、ルーティングロジックを自分のコード側に持たせておけば、次の値下げが来ても設定変更だけで済む。これは単一モデルに賭けるよりも私が実際に構築する方法にずっと近く、返信を作成するモデルよりも安いモデルでチケット分類を動かすのと同じ発想だ。
eeselを試す
この比較では答えられないことがある:モデルが占める割合は、解決したサポートチケット全体のわずか2%程度だ。私はeeselでインテグレーションを開発しており、AIエージェントがチケットを解決するか、それとも顧客をイライラさせるだけかを実際に左右するのは、自社のヘルプセンターに対する検索精度、いつ止まるべきかを知っているエスカレーションルール、そして顧客の目に触れる前に自社のチケット履歴でテストされたロールアウトだ。私たちは自信満々な口調で間違った答えを出すボットを何度も見てきたため、ベンチマークスコアだけで出荷するのではなく、すべてのロールアウトをまず過去のチケットでシミュレーションしている。
経済性の面でもトークン単価の話ではない。Flash上でのサポート返信1件分の生のトークンコストはほぼゼロに近い。実際に請求書に載るのは解決あたりのコストであり、eeselはシート課金なしでチケット単位の課金なので、AIの調子が良い月がペナルティになることはない。あるGridwiseのリーダーはその成果をこう率直に語った:"In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." あるD2Cサプリメントブランドのカスタマー体験リーダーは、信頼の面を私と同じように次のように表現した:"I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
ZendeskやFreshdesk上で、すでに自社のヘルプセンターを理解していて、コーヒーブレイク中に導入でき、誰にも答える前に前四半期のチケットでドライランできるAIエージェントが欲しいなら、それこそ私たちが作ったものだ。無料で試せて、まず使ってほしいのはシミュレーション機能だ。

サポート向けにモデルを選んでいるなら、次に読む価値があるのはこちら:サポートに合うLLM、ドメイン特化型LLM、そして正直なAIサポートのコストについて。
よくある質問
DeepSeek V4 FlashはGPT-5.6より優れているか?
DeepSeek V4 FlashはGPT-5.6よりどれくらい安いのか?
DeepSeek V4 FlashはGPT-5.6のように画像に対応しているか?
DeepSeek V4 FlashのコンテキストウィンドウはGPT-5.6と比べてどうか?
DeepSeek V4 Flashは顧客データにとって安全か?
DeepSeek V4 FlashとGPT-5.6、どちらが高速か?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








