
60秒でわかる比較表
以下は各ベンダー自身の公開ページから、2026年8月3日時点の情報だ。両社が同じ指標を異なる方法で測定している箇所は、それを均さずにそのまま明記している。
| Qwen 3.8 Max | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | |
|---|---|---|---|---|
| モデルID | qwen3.8-max | gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna |
| リリース日 | 2026年8月2日 | 2026年7月9日 | 2026年7月9日 | 2026年7月9日 |
| 入力 / 100万トークン | $2.00 | $5.00 | $2.00 | $0.20 |
| 出力 / 100万トークン | $6.00 | $30.00 | $12.00 | $1.20 |
| キャッシュ入力 / 100万トークン | $0.25 | $0.50 | $0.20 | $0.02 |
| ロングコンテキスト割増料金 | 未公開 | 27.2万超で入力2倍、出力1.5倍 | 同上 | 同上 |
| コンテキストウィンドウ | 1,000,000 | 1,050,000 | 1,050,000 | 1,050,000 |
| 最大出力 | 131,072 | 128,000 | 128,000 | 128,000 |
| 最大推論トークン | 262,144 | 未公開 | 未公開 | 未公開 |
| 入力モダリティ | テキスト、画像、動画 | テキスト、画像 | テキスト、画像 | テキスト、画像 |
| パラメータ数 | 総数2.4T、アクティブ95B | 未公開 | 未公開 | 未公開 |
| 学習データのカットオフ | 未公開 | 2026年2月16日 | 2026年2月16日 | 2026年2月16日 |
| モデルカード | なし | あり | あり | あり |
| オープンウェイト | 約束のみ、未提供 | なし | なし | なし |
| レート制限(最上位ティア) | 15K RPM / 2M TPM | 15K RPM / 40M TPM | Solと同じ | 30K RPM / 180M TPM |
| コンシューマーチャットでの利用 | Qwen Studio | ChatGPT | CodexとWorkのみ | CodexとWorkのみ |
| 推論制御 | reasoning_effort:low/medium/xhigh | 推論エフォート(max含む) | 同上 | 同上 |
特に注目すべき行が2つある。Qwenは4モデル中唯一動画入力に対応しており、これは単なるスペック上の見栄えではなく実際の能力差だ。そしてQwenは唯一、学習データのカットオフもモデルカードもシステムカードも未公開であり、こちらは実際のエビデンス不足だ。
Qwen 3.8 Maxとは実際何なのか
QwenはAlibaba Cloudのモデルファミリーで、Maxは安価なPlusおよびTurbo層の上に位置する独自のフラッグシップラインだ。Qwen 3.8 Maxは最新モデルで、2段階でリリースされた。
ファミリー全体を先に知りたければ、私のQwenレビューが旧ティアをカバーしており、単独記事のQwen 3.8 Maxレビューはこのモデルだけをより深く掘り下げている。
第1段階は7月19日、上海の世界人工知能大会でのこと。プレビューエンドポイント、X上の投稿2件、そしてチャートなしの口頭でのフロンティアランキング主張だった。第2段階は8月2日で、Alibabaはプレビューで欠けていた情報をすべて含む5,000語の発表記事を公開した。
Alibabaが述べるアーキテクチャは、総パラメータ2.4兆、アクティブパラメータ950億の疎なMixture-of-Expertsモデルで、Qwen 3.5をベースに構築されている。この950億というアクティブパラメータ数こそが重要であり、プレビュー時には伏せられていた数字だ。総パラメータは見出し用、アクティブパラメータはレイテンシと請求額を決める。
マルチモーダル対応がMaxラインにとって真に新しい点だ。Alibabaのモデルページには画像・テキスト・動画の入力対応が記載されており、発表記事には具体的な数字も添えられている。200ページを超える財務報告書やPDF、そしてAlibabaが「ビデオメモリグラフ」と呼ぶ仕組みに整理された「100時間を超える」動画だ。ただし正直に言っておくべき点がある。同じ発表記事に掲載されている両方のハーネス構成は、いずれもテキストと画像のみを対応と明記している。動画対応はOpenAI互換エンドポイント経由ではなく、DashScopeのネイティブ経路のようだ。

推論はreasoning_effortで制御し、low・medium・xhighから選べ、デフォルトはxhighだ。Alibabaはさらに「最良のすぐに使える体験」のためとしてpreserve_thinkingをデフォルトで有効にしている。これは、モデルが答える前にじっくり考えるようチューニングされているという丁寧な言い換えだ。この点は後でコストの問題として再び登場するので覚えておいてほしい。
GPT-5.6とは実際何なのか
GPT-5.6は単一のモデルではない。7月9日に一般提供が開始された3つの能力ティアだ。フラッグシップのSol、バランス型の中間であるTerra、そして高速で安価なLuna。それぞれの詳細は完全版のGPT-5.6レビューで解説している。3つとも同じ1,050,000トークンのコンテキストウィンドウ、同じ128,000トークンの出力上限、そして同じ2026年2月16日の学習データカットオフを共有している。
そして7月30日、OpenAIはこの比較全体を静かにリセットする一手を打った。3ティアのうち2つで価格を引き下げたのだ。
「7月30日より、APIの価格はTerraが入力100万トークンあたり$2・出力$12、Lunaが入力$0.20・出力$1.20となります。Solの価格は変更ありません。」
これはTerraが20%オフ、Lunaが80%オフということだ。Solは据え置きで$5と$30のままだった。7月中旬に書かれたGPT-5.6の料金比較記事を読んでいるなら、Lunaに関しては最大5倍間違っていることになる。
同じアップデートで、Priority ProcessingはFastモードに改名され、Solでは最大2.5倍の速度と引き換えに価格が2倍になる。そしてOpenAIはQwenにはない仕組みを追加した。ロングコンテキスト割増料金だ。入力27.2万トークンを超えるプロンプトは、超過分だけでなくリクエスト全体が入力2倍・出力1.5倍で課金される。この線を越えると、$5/$30のSol呼び出しが$10/$45になる。つまりSolの実質的な100万トークンウィンドウとは、2倍払わされる100万トークンなのだ。
ベンチマーク:審判のいない2枚のチャート
ここが多くの比較記事が間違える箇所だ。両社ともチャートを公開しているが、どちらも第三者によって実施されたものではなく、2つのチャートは重ねて比較できるものではない。

まずAlibabaが公開した内容から見てみよう。珍しく率直で、チャートには**GPT-5.6 Sol(max)**が比較列として掲載されている。そのチャートからそのまま引用する。
| ベンチマーク | Qwen 3.8 Max | GPT-5.6 Sol(max) | 勝者 |
|---|---|---|---|
| SWE-Pro | 67.7 | 64.6 | Qwen |
| TerminalBench-2.1 | 86.6 | 88.8 | Sol |
| PaperBench | 93.0 | 90.5 | Qwen |
| FrontierSWE | 73.5 | 88.8 | Sol、15.3差 |
| CoWorkBench | 74.8 | 71.5 | Qwen |
| JobBench | 53.4 | 45.4 | Qwen |
| Agents' Last Exam | 52.4 | 53.6 | Sol |
| CharXiv(RQ) | 93.5 | 89.1 | Qwen |
| ERQA | 77.8 | 70.0 | Qwen |
| PerceptionBench | 63.5 | 59.7 | Qwen |
| LVBench | 81.8 | 78.8 | Qwen |
| Vision2Web | 69.0 | 62.1 | Qwen |
| OSWorld-Verified | 86.1 | 83.2 | Qwen |
16項目中13でQwenの勝ち、視覚系の項目はすべてQwenのクリーンな勝利だ。これは本物の結果であり、私はそれを軽視するつもりはない。
しかし、ほとんど誰も読まない注釈を読んでほしい。Alibabaはコーディングベンチマークのうち6つが自社独自の評価(QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench、RecreationBench)であること、競合のスコアが同一条件ではなく混在したハーネスから取得されたこと、そしていくつかの行はライバルモデルによって採点されていることを開示している。gemini-3.1-pro-previewがPLawBenchを採点し、Claude Opus 4.6がPaperBenchを採点している。さらに、Fable 5の結果には「フォールバックが関与している可能性がある」との注記もある。
次に第三者の評価だが、これは評決をきれいに二分している。9つの評価を自動集計した指標Intelligence Index v4.1を持つArtificial Analysisでは、GPT-5.6 Solは59点でClaude Opus 5とClaude Fable 5に次ぐ総合3位、Terraは55点、Lunaは51点だ。
人間による好み投票であるLMArenaでは、qwen3.8-maxはText部門で1496ポイントの5位、WebDev部門で1668ポイントの4位に位置し、gpt-5.6-sol-xhigh(それぞれ15位、6位)を上回っている。この自動集計対人間評価という同じ分裂は、私のGPT-5.6対Claude比較記事でも見られる。
つまり、自動集計指標はSol、人間の好みはQwenを支持している。片方だけを引用している人がいたら、何かを売り込もうとしているということだ。
コミュニティの見方はもっと率直だ。プレビューについてのHacker Newsスレッドより。
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
みんなが逆に捉えている価格比較
7月に自然と広まった物語は、「中国のラボがOpenAIを出し抜いた」というものだった。$2と$6をSolの$5と$30と比較すれば、それは事実だ。しかし残りのファミリーと比較すると話は違ってくる。

Qwen 3.8 MaxはTerraの入力価格に1セント単位で一致し、出力価格を半分にしている。これは正真正銘の勝利だ。しかしLunaは入力でQwenの10分の1、出力で5分の1を実現しており、「中国のモデルの方が安い」という構図が定着した時点では、この価格帯は存在すらしていなかった。
もう一つ、実際の請求額を左右する二次的な問題がある。Qwenはxhigh推論をデフォルトで有効にし、preserve_thinkingも有効な状態で出荷される。冗長なモデルは推論トークン一つ一つに課金されるため、表示価格が示唆するより実際のコストは高くなる。Artificial AnalysisはLunaが指標を実行する際に、中央値の6,200万トークンに対して1億3,000万トークンもの出力トークンを消費したと計測しており、これはどちら側にも当てはまる話だ。要点は、トークン単価とタスクあたりのコストは別物だということであり、価格ページに載っているのはそのうちの一方だけだ。
自分の使用量を入力してみてほしい。
APIではなく安価な月額サブスクリプションを検討している人向けに、もう一つ注意点がある。qwen3.8-max-previewエンドポイントはそもそもトークン単位では一切販売されておらず、Alibabaのトークンプラン経由でのみ利用可能だった。Personalティアで月額$6、$18、$68だ。これらのプランは固定5時間・7日間ウィンドウのクレジット制で動作し、未使用クレジットは繰り越されず、どちらかの上限に達するとウィンドウがリセットされるまで利用が一時停止される。Alibabaはクレジットとトークンの換算係数も公開していないため、事前にコストを計算することはできない。目玉だったプレビュー特典、通常料金の10%に加えて22:00から08:00の間はさらに80%オフ(標準消費の2%相当)は、Personalプラン限定で、プレビュー終了とともに消滅する。GA版モデルには代わりに一律50%の夜間割引が適用される。
実際に決め手となるもの
ベンチマークは能力を測る。しかし本番運用が測るのは能力を忍耐力で割ったものだ。私が見つけたハンズオンレポートはすべて同じ不満に行き着いており、それは知性についての話ではない。
リリース初日に同じリッチデザイン変換タスクを両モデルで実行した開発者の声だ。
"Same prompt for both for the conversion. I used OpenCode for the qwen version, but I encountered a significant amount of errors / timeouts while it was running. Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build."
もう一人、数日にわたって4つのフロンティアモデルを横並びでテストした人の声。
"Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA."
同じ開発者は、あるWebアプリタスクについてのトークン計算も公開しており、これが今のところ最も有用な実コストデータだ。Kimi K3が$5.50、Qwen 3.8 Maxが$6.30、Fable 5が$30。Qwenの安いレートは本物だが、同じ作業にKimiの950万トークンに対して1,800万入力トークンを必要とした。
モデル自体への評価は割れており、これは平均化せずにそのまま伝える価値がある。あるユーザーはこれを理由にAnthropicの契約を解約した。別のユーザーは「壊滅的にひどい」と評し、「進展のない長い自問自答ループに陥る」モデルだと説明した。両者とも同じ2週間の間に同じプレビュービルドをテストしていた。この評価の振れ幅が気になるなら、より安全な候補リストとして私のQwen代替ツールとGPT-5.6代替ツールまとめ、そしてこの階層の第3の候補としてKimi K3レビューをどうぞ。
そして単純に公開されていない情報もある。Qwen 3.8 Maxには学習データのカットオフも、モデルカードも、システムカードも、安全性評価もどこにもない。8月2日から「来週」と約束されたオープンウェイトには、ライセンスも日付もリポジトリもない。あなたの調達プロセスがこうした資料を求めるなら、今日時点での答えは「存在しない」だ。
フロンティアモデルが終わり、サポート業務が始まる場所
これは私が最も気にかけている部分だ。なぜなら、そこでチームが四半期を丸ごと失うのを見てきたからだ。

どちらのモデルもあなたの返金ポリシーを知らない。どちらも直近7,000件のチケットを読んだことがない。どちらも、メールを送ってきた顧客がエンタープライズプランであり、すでに2回エスカレーションされたことがあるという概念すら持っていない。ベンチマークのスコアはサポートエージェントではなく、この二つの間のギャップこそが、ほとんどのAIサポート自動化プロジェクトが静かに頓挫する場所だ。
同じギャップが、AIヘルプデスクを選ぶことがモデルを選ぶこととは違う作業である理由であり、チケット自動化が生の推論力ではなく検索精度によって成否が決まる理由でもある。
私たちは何年もの間、実際のサポートキューでAIを運用してきたが、特有の失敗モードは「AIが知らない」よりも悪い。それは自信満々のでっち上げだ。ナレッジベース検索が空振りしたときに、ボットが実際の顧客に対して答えを捏造した有料顧客のケースを見てきた。あるソーラー企業のボットは存在しないサブスクリプション条件を作り上げ、別のケースでは顧客に周期表の「酸素」という単語を答えとして送りつけた。2.4兆パラメータのモデルであっても、それを防ぐものは何もない。大きなモデルはただ、間違ったことをより流暢に言うだけだ。
実際にこれを解決する仕組みは、月間7,000件のチケットを処理するサポートリーダーとの通話で出てきたもので、モデル選びとは何の関係もない。
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
これはモデルの選択ではなく、プロダクトの設計判断だ。だからこそeesel AIは、何かを本番稼働させる前に過去のチケットに対するシミュレーションを実行し、実際の過去の会話に対する解決率と実際の返信内容を先に確認できるようにしている。
また、回答が確信度に応じてルーティングされ、人間への下書きとして渡されるかエスカレーションされる仕組みになっているのも、当てずっぽうを避けるためだ。この方式を運用した結果、Gridwiseは初月で一次対応解決率73%を達成した。
したがって、Qwen 3.8 Max対GPT-5.6についての戦略的な答えは、少し拍子抜けするものになる。エンジンを交換できるように構築せよ、ということだ。モデルレイヤーは数週間ごとに、より良く、より安くなっていく。Kimi K3はQwenのわずか数日前に登場し、Lunaの価格はたった一晩で80%下落した。そして9月にチャートのトップに立つものは、今日時点ではまだ存在すらしていない。7月に一つのAPIに固定してしまったチームは、すでに配線をやり直す羽目になっている。
これは「代わりにGemini、Grok、Mistralを使うべきか」という質問への正直な答えでもある。おそらく、いずれ、何かのタスクでは、そうなるだろう。だからこそ、今月の勝者にあまりこだわらないことをお勧めする。
では、どちらを選ぶべきか
プロダクトを提供する立場で、一つの答えが欲しいなら:
- 視覚、動画、または文書中心の作業: Qwen 3.8 Maxが余裕をもって適している。Alibabaのチャートでは視覚系の項目すべてがQwenの勝利で、4モデル中唯一動画に対応している。
- 高難度のソフトウェアエンジニアリング: GPT-5.6 Sol。FrontierSWEの88.8対73.5は誤差の範囲ではなく、これはAlibaba自身の数字だ。
- 大量処理、低レイテンシ、コスト重視: GPT-5.6 Luna、価格面では圧勝だ。ただし冗長性には注意が必要だ。
- 能力あたりのコストパフォーマンスを重視する汎用ワークホース: 本当の勝負はTerraとQwen 3.8 Maxの間にある。Qwenは出力価格が半分、Terraはより高速でモデルカード・学習データカットオフ・安定したエンドポイントを備えている。
- 顧客対応の業務全般: どちらも単体では不十分だ。まずレイヤーを選び、モデルはそのレイヤーに選ばせよう。計算式はエージェントのコスト比較に、候補リストはベストAIエージェントにまとめている。
私ならやらないのは、8月2日のチャートを確定事項として扱うことだ。あのコーディングベンチマークのうち6つはAlibaba自身のもので、第三者による再検証は一切行われておらず、同じビルドに対するコミュニティの評価は「Anthropicの契約を解約した」から「壊滅的にひどい」まで幅広い。あと1か月待って、独立した数字を見てほしい。
eeselを試す
チャートで勝つモデルではなく、実際にチケットを解決してくれるモデルを求めてここにたどり着いたのなら、それこそがeesel AIの存在意義だ。Zendesk、Freshdeskをはじめとする100以上のツールと連携し、あなたのヘルプセンターと過去のチケットから学習して、数分で下書きを始める。

差別化要因はエンジンではなく、信頼を積み上げるプロセスにある。実際のチケット履歴でシミュレーションし、数字を確認し、ドラフトモードで始め、納得できたときだけ自律モードに移行する。それがQwenであれ、GPT-5.6であれ、あるいは来月登場する何かであれ、配線をやり直すことなくフロンティアの進化をそのまま享受できる。eeselを試す、クレジットカード不要の無料トライアルだ。
よくある質問
Qwen 3.8 MaxはGPT-5.6より安いですか?
コーディング用途ではQwen 3.8 MaxとGPT-5.6 Solのどちらが優れていますか?
Qwen 3.8 MaxとGPT-5.6のコンテキストウィンドウはどれくらいですか?
Qwen 3.8 Maxはオープンソースですか?
Qwen 3.8 MaxやGPT-5.6はカスタマーサポートに使えますか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








