Qwen 3.7 Flashレビュー: 落とし穴のある0.03ドルのビジョンモデル

Rama Adi Nugraha
執筆者

Rama Adi Nugraha

Katelin Teen
レビュー者

Katelin Teen

最終更新 July 31, 2026

専門家による検証済み
画像、動画、ドキュメントのパネルを使って作業する開発者のイラスト、Qwenのロゴ付き

Qwen 3.7 Flashの正体

私はインテグレーションとAPIを構築するのを生業にしている。だからどんなローンチでも最初にやることは、発表を無視して実際にモデルカードを読みに行くことで、Qwen 3.7 Flashについてはそれが簡単だった。なぜなら無視すべき発表そのものが存在しなかったからだ。

このモデルについてのQwenのブログ記事は存在しない。qwen.aiの記事フィードにはQwen 3.7 MaxとQwen 3.7 Plusのローンチ記事が掲載されているが、Flashについては何もない。QwenCloudの変更履歴にある2026年7月25日付けの一行だけが、存在する唯一の公式な告知だ。

2026年7月27日にOpenRouterで公開され、正規のスラッグ qwen/qwen3.7-flash-20260727 で、qwen3.7-flash-2026-07-15 という名前のピン留めされたスナップショットが付いている。

以下がAlibaba Cloudのモデルカードからそのまま引用した、ポジショニングステートメントの全文だ。

"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."

これが売り込み文句のすべてだ。ベンチマーク表もなく、評価名もなく、パーセンテージもなく、アーキテクチャもない。Qwenはパラメータ数を公表していない。密なモデルか混合エキスパートかも、どれだけのトークンを見たかも公表していない。オープンリリースで評判を築いてきた企業にしては異なる姿勢であり、コミュニティもそれに気づいている。

機械的な事実の方がまだ役に立つ。テキスト、画像、動画が入力、テキストが出力。コンテキストは1,000,000トークンで、使用可能な入力は991,808に、出力は65,536に制限されている。これはPlusとMaxが許容する量の半分だ。思考連鎖の予算は262,144トークンまで及び、推論はデフォルトでオンになっている。関数呼び出しも機能する。組み込みツールとしてコード解釈やウェブ抽出、さらに画像・テキスト検索も用意されている。

価格、スループット、入力モダリティでQwen 3.7 Flash、Plus、Maxを比較する3枚のカード
価格、スループット、入力モダリティでQwen 3.7 Flash、Plus、Maxを比較する3枚のカード

ファミリーの全体図には本当の驚きがある。Flashは3モデル中最も安く、最も速く、毎秒59トークンとPlusの12を上回る。しかも動画を受け付ける唯一のモデルでもある。フラッグシップであるQwen 3.7 Maxはテキスト専用だ。通常はバジェット階層が機能を削られる側だが、ここではバジェット階層が最も多くを見ている。

価格、そして表示価格が語らない部分

この投稿を一つのセクションしか読まないなら、これを読んでほしい。誰もが引用している0.03ドルという数字は本物だ。ただし、これは3つのうちの最良のケースでしかない。

プロンプトサイズ入力/100万出力/100万キャッシュ読み取り/100万キャッシュ書き込み/100万
32Kトークン未満$0.03$0.13$0.006$0.038
32K〜256K$0.10$0.40$0.02$0.125
256K〜1M$0.20$0.80$0.04$0.25

これらの料率はOpenRouterのモデルAPIから得たもので、同じ3段階の構造がAlibaba自身のカードでも人民元建てで確認できる。北京、フランクフルト、東京でそれぞれ入力100万トークンあたり0.2、0.6、1.2元だ。一つの価格体系を二つの視点から見ているだけなので、矛盾を解消する必要はない。

プロンプトサイズが大きくなるにつれて、価格が入力100万トークンあたり0.03ドルから0.20ドルへと上昇していく3段階の階段グラフ
プロンプトサイズが大きくなるにつれて、価格が入力100万トークンあたり0.03ドルから0.20ドルへと上昇していく3段階の階段グラフ

つまりマーケティングは「最も安いビジョンモデル」と「100万コンテキスト」を並べて、両方を同時に得られると思わせている。しかし実際はそうではない。100万コンテキストと0.03ドルの価格は互いに排他的だ。実際に長いウィンドウを必要とするものは、それが大きなコードベースであれ、動画であれ、ドキュメントの山であれ、予算していた料率の6.7倍にあたる最上位の価格帯に着地する。

これは理論上の話ではまったくない。OpenRouterはキャッシュ適用後に顧客が実際に支払っている金額を30日間のローリング平均として公開しており、このモデルでは入力0.044ドル、出力0.149ドル、キャッシュヒット率51.0%となっている。この平均が表示価格を上回るということは、実際のトラフィックのかなりの割合がすでに32Kおよび256Kの階層を支払っていることを意味する以外にありえない。キャッシュ割引もあなたを救ってはくれない。

自分の数字を当てはめてみよう。

コンテキスト階層計算機
月間入力1000万トークン+出力200万トークンの実際のコスト
あなたのワークロードに典型的なプロンプトサイズを選んでください。
$0.56 / 月
入力0.03ドル、出力0.13ドル。このモデルに関するすべての見出しに登場する料率で、短いプロンプトでのみ成立する。
$1.80 / 月
入力0.10ドル、出力0.40ドル。1つの長いドキュメントや控えめなチャット履歴だけでここに到達する。見出しの請求額の3.2倍だ。
$3.60 / 月
入力0.20ドル、出力0.80ドル。これが謳われている100万コンテキストのコストだ。同じトークン量で請求額の6.4倍になる。

エンドポイントを選ぶ前に知っておくべき地域ごとの癖がいくつかある。同じモデルでも、シンガポールは北京、フランクフルト、東京よりおよそ22%高い。ウェブ検索は北京とシンガポールでのみ機能する。バッチ推論は北京でのみ機能し、ファインチューニングはどこでも利用できない。

安価な階層の他モデルとの比較

価格帯を考慮してもなお、価格こそが主役だ。以下は現在の安価かつビジョン対応のフィールドで、数字はすべて各ベンダー自身の価格ページから取っている。Kimi K3のようなフロンティア価格帯のリリースはここでは対象外だ。

モデル入力$/100万出力$/100万コンテキストビジョンリリース
Qwen 3.7 Flash$0.03$0.131Mテキスト、画像、動画2026年7月27日
Mistral Small 4$0.15$0.60256Kテキスト、画像2026年3月16日
GPT-5.6 Luna$0.20$1.201.05Mテキスト、画像2026年7月9日
Gemini 3.1 Flash-Lite$0.25$1.50非公開テキスト、画像非公開
Gemini 3.5 Flash-Lite$0.30$2.501,048,576テキスト、画像、動画2026年7月21日
Claude Haiku 4.5$1.00$5.00200Kテキスト、画像2025年10月15日
Gemini 3.6 Flash$1.50$7.501,048,576テキスト、画像、動画2026年7月21日

いくつか目を引く点がある。Qwenはここでは桁違いに安く、入力でMistral Small 4の5分の1、Gemini 3.5 Flash-Liteの10分の1だ。また、GPT-5.6 LunaとMistral Small 4が画像限定であるのに対し、動画を0.10ドル未満の入力レートで受け付ける唯一のモデルでもある。

自分で比較する場合に避けるべき落とし穴が一つある。Gemini 3.1 Flash-Liteは3.5 Flash-Liteよりも依然として安く、0.25ドル/1.50ドルに対して0.30ドル/2.50ドルだ。Googleのラインナップでは新しい方が必ずしも安いわけではなく、Gemini 3.6 Flashは上位に位置している。そしてGPT-5.6 Lunaは私がこれを書く1日前の2026年7月30日に価格を80%引き下げており、1週間前よりもはるかに近い競合になっている。

しかし実際にこのモデルが最も打ち負かしているのは、自らの前身だ。0.1875ドル/1.125ドルのQwen 3.6-Flashに対して、新しいベース階層は入力で6.25倍、出力で8.65倍安い。今回のローンチについて他に何が真実であれ、Alibabaは自社のビジョンの下限を一度のリリースで桁違いに引き下げたのだ。

"Flash"はここでは「安い」を意味し、「速い」を意味しない

ここで名前が誤解を招く。Googleのラインナップでは、Flashは低レイテンシーを意味する。ここでは低価格を意味する。これらはまったく異なる製品だ。

OpenRouterは唯一の提供者を毎秒59出力トークン(P50)、初回トークンまでの時間1.20秒と計測している。Artificial AnalysisはGemini 3.5 Flash-Liteを毎秒382トークン、GPT-5.4 miniを毎秒177と計測している。ハーネスも条件も異なるため、この比率は緩く受け止めるべきだ。それでも6倍の差は測定誤差と呼ぶには広すぎ、デフォルトでオンになっている推論がこの数字をさらに押し下げている。

これに異を唱えるデータポイントもある。あるコーディングツールでテストした開発者は、OpenRouterのテレメトリが示すよりもはるかに優れたスループットを報告している。

"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."

彼の150 TPSはOpenRouterが計測したP50のおよそ2.5倍だが、短いプロンプトとウォームなキャッシュならそうなり得る。本番トラフィックをサンプリングしているのはOpenRouterの方なので、私なら150ではなく59を前提に計画を立てる。

夜も眠れなくなりそうなのはテール部分だ。エンドツーエンドのレイテンシーはP50で3.56秒、P75で8.54秒で、これは問題ない。しかしP90では17.96秒、P95では29.03秒、P99では90.19秒になる。

エンドツーエンドのレイテンシーがP50の3.6秒からP99の90.2秒まで上昇していく様子を示す横棒グラフ
エンドツーエンドのレイテンシーがP50の3.6秒からP99の90.2秒まで上昇していく様子を示す横棒グラフ

バッチジョブにとってこのテールは見えない存在だ。しかし人が待っている場合、100件に1件のリクエストが1分半かかるというのは、単なる指標ではなく製品上の決断事項になる。そしてこれはAIエージェントのループの中で複利のように効いてくる。1回の遅いツール呼び出しが、その後ろのすべてのステップを止めてしまうからだ。

同じパネルからもう2つの数字を挙げよう。ツール呼び出しのエラー率は8.88%で、Plusの6.45%に対して高く、これはエージェント作業向けと明確に謳われているモデルにおいて、およそ11回に1回ツール呼び出しが失敗することを意味する。そして提供者はちょうど1社だけだ。Alibaba Cloudが不調な午後を迎えても、フォールバックのルーティングは存在しない。

私が解決できなかった小さなドキュメントの矛盾もある。Alibabaのモデルカードは構造化出力をサポート対象として挙げている。OpenRouterのパラメータ一覧はFlashについて構造化出力フラグを公開していない。response_format のみで、PlusとMaxについては公開しているにもかかわらずだ。厳密なスキーマ強制がパイプラインにとって重要なら、どちらのページも信用せず、コミットする前にテストしてほしい。

唯一存在する独立ベンチマーク

Qwenは何も公表しなかったので、実際にスコアを付けた人を探しに行った。それはちょうど一件だけ存在する。

Artificial Analysisはこのモデルを掲載していない。モデルページは404を返しサイトのサイトマップを確認しても、Qwen 3.7関連のページはMaxとPlusしかないことが分かる。LMArenaにもFlashのエントリはない。つまり、通常の情報源によるインテリジェンス指数はなく、Eloもなく、いかなる形の品質スコアの公表もない。

例外はRoboflowのビジョン評価で、その内容は芳しくない。

タスクスコア順位
総合61.7%23モデル中22位
識別84.4%23モデル中10位
OCR文字起こし84.1%23モデル中23位
データ抽出78.4%ランク外
物体検出42.8% mAP@5023モデル中16位
物体カウント46%完全一致ランク外
サンプルあたりのコスト約0.0001ドル23モデル中1位

総合では23モデル中22位の61.7%で、GPT-5.4 miniの63.5%のすぐ後ろにつけ、コストでは23モデル中1位だ。公平を期すなら、OCRの結果は僅差のフィールドの中での最下位であり、失敗ではない。84.1%という平均一致率は絶対値としては立派なものだ。そしてQwenはFlashについてOCRやGUI操作を強みだと謳ったことはない。それらはPlusの領域だ。だから「OCRで最下位」というのは、破られた約束というより、Alibabaが言っていたことと一致している。

しかしこの結果は、あなたが何を買っているのかを明確にしてくれる。識別が84.4%という得意技であるのに対し、位置特定は42.8%という弱点だ。写っているものが何かを教える能力は、それがどこにあるかを教える能力よりもはるかに優れている。ワークロードが「1000万枚の画像をカテゴリ別にタグ付けする」というものなら、1000サンプルあたり1セントの10分の1という価格で見事にフィットする。「この請求書を読んで項目を抽出する」というものなら、別のモデルに手を伸ばした方がいい。

コミュニティの声、そしてなぜそれがこれほど少ないのか

これはこのリリースについて最も奇妙な点であり、私が最も示唆的だと考えている点でもある。

100万トークンあたり0.03ドルというビジョンモデルが4日前にローンチされたのに、Hacker Newsにはこれについてのコメントが一件もない。HNで qwen3.7-flash を全文検索しても、記事・コメントを問わず全期間でゼロ件がヒットする。ローンチスレッドは一度も投稿されていない。この期間中で唯一のQwen関連の記事、「Qwen 3.7 or 3.8 30B – 100B. QWhen?」は、コメントをゼロ件しか集めなかった。

さらに興味深いことがある。ローンチした週にHNで交わされていたQwenに関する生きた会話は、DeepSeekのスレッドの中で起きていたもので、そこでは人々がQwenが果たしてビジョンをリリースするのかどうかを議論していた。Qwenがビジョンモデルを出荷した4日後にもかかわらずだ。

Hacker News

"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."

Hacker News

"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."

2つ目のコメントがまさに理由を突いている。かつてQwenのリリースを追いかけていた層はローカルウェイトのコミュニティであり、Qwenは彼らへのサービス提供をやめてしまった。同じ論点はGLM 5.2についてのスレッドでも浮上している。

Hacker News

"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."

Flashも同様にクローズドだ。Hugging Faceは空の配列を返し、Roboflowはライセンスをプロプライエタリと表示している。それでもローンチ当日、別の期待を抱いていた人もいた。

"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"

これは「Qwen 3.7がまもなくローカルAI向けに利用可能になるかもしれない」という期待を訳したものだ。しかし、そうはならないだろう。

このセクションが何であるかについては正直に言っておくべきだ。これらの引用はどれもFlashについてのものではない。なぜならまだそうした引用は存在しないからだ。これらは3.7ファミリー全体と、Flashが埋めるために作られたギャップについてのものだ。ファミリーへの評価は両方向に分かれている。あるHNコメント投稿者は1ヶ月間毎日使った末に3.7 Proを「まったく使い物にならない」と評しているし、chewzは速度の面で3.7 MaxをOpusレベル以上と評価している。Qwenがそもそも一切ベンチマークを公表しなかったFlashに関して言えば、そのスレッドの一行が私の心に残った。

Hacker News

"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."

ベンチマークスコアをまったく信じなくなっていた層に対して、ベンチマークスコアを一切持たないモデルを送り出すというのは、ある種の対称性がある。

一方で、人々は静かにこれを使っている。OpenRouterのアクティビティパネルでは、Hermes AgentがClaude Codeや数種のコーディングツールを上回り、最大の利用元として表示されている。利用は実在するが、議論だけが一度も起きなかったのだ。

誰が実際に使うべきか

私の見解を率直に述べよう。

手を伸ばすべき人: たまに間違えることは安く済むが、コストがかかることは致命的である、という高ボリューム・低リスクのビジョン作業を行っている場合。大量の画像タグ付け。一次的なコンテンツ分類、サムネイルの選別、「このフレームに人が写っているか」といった、より優れたモデルが慎重なパスを行う前の事前フィルタリング。1サンプルあたりおよそ1セントの100分の1という価格は、そもそも何を処理する価値があるかという経済性を変えてしまうもので、これは大きな意味を持つ。

避けるべき人: OCRやドキュメント抽出、正確な物体の位置特定、予測可能なレイテンシー、ホストできる重み、あるいは関係者に示せる公表済みの品質シグナルが必要な場合。プロンプトが恒常的に長い場合も避けた方がいい。というのも、その時点では80%の値下げ後のGPT-5.6 Lunaが現実的な選択肢に見えてくるし、Gemini 3.5 Flash-Liteもそうだ。どちらもはるかに速い。

Qwenファミリーを具体的に望みつつもより高い能力が必要なら、Qwen 3.8 Maxがレンジの反対側にあり、Qwenの代替製品のまとめが残りをカバーしている。

決め手となる要因は、誤った答えが何かしらのコストを生むかどうかだ。これはベンチマークの問題というより製品の問題であり、統合コードを書き始める前に決めておくべき問いだ。

サポートキューに近づけるなら、まずこれを読んでほしい

ここは率直にならざるを得ない。実際に痛い経験をしてきた部分だからだ。

私はeeselでインテグレーションを構築しており、数千件の実際のチケットを通じて何年もの間、本番のサポートキューでAIを運用してきた。私が見てきた中で最も高くつく誤解は、この投稿の価格表がまさに助長しているものだ。「モデル=製品」という誤解だ。0.03ドルのモデルは、独自のサポートボットを構築することがほぼ無料であるかのように見せてくれる。チケットあたりのコスト計算もスプレッドシート上では素晴らしく見える。しかしモデルは決してコストの高い部分ではなかった。

コストがかかる部分は、矛盾だらけのヘルプセンターに対する検索であり、正しい場所にルーティングするチケット分類であり、いつ黙るべきかを知ることだ。顧客を取りこぼさないエスカレーション。顧客より先に自分が間違っていると気づく方法。そのどれもがトークン価格には含まれていない。私たちはそれを、自信満々に間違った答えを出すボットを見てきたことで痛みとともに学んだ。だからこそ今では、実施するすべてのロールアウトを本番キューに触れる前に過去のチケットに対してシミュレーションするようにしている。

誰もこの構築路線をうまく機能させられないと言うつもりはない。私たちの解約の一部はまさにこれだ。LLM APIの上に直接構築するために離れていった顧客で、AR/建設テック企業やDTCビューティーブランドが含まれる。それは実在する選択肢であり、時には正しい選択でもある。しかし最も真剣に検討したチームは、大抵別の場所に着地した。ConfluenceとTelegramにまたがる300記事のナレッジベースを運用する、あるビットコインATMハードウェア企業のエンジニアリングリーダーはこう表現した。

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

そして実際にサポートAIがうまく機能するかどうかを決めるのは自制心であり、どんなモデルスコアもそれを捉えることはできない。月間7000件のチケットを処理するブランドのCXリーダーは、どんなベンチマークよりも的確にこう表現した。

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

さて、Qwen 3.7 Flashをその基準に照らし合わせてみよう。8.88%のツール呼び出しエラー率、90秒に及ぶP99、公表された品質スコアもなく、23モデル中22位という結果の一件を除けば独立評価もない。これらは100万枚の画像にタグ付けするには十分に許容できる数字だ。しかし、自社ブランドと苛立った顧客の間に置きたい数字ではない。チケット偏向ガイドAI解決率についてのノートでは、生のモデル性能よりも信頼度のしきい値がなぜ重要なのかをさらに深く掘り下げている。

それでも自前で構築する道を選ぶなら、まずRAG対ファインチューニングから始め、次にナレッジベースでのトレーニングを読んでほしい。そしてハルシネーションの防止に本気で時間をかけてほしい。トークンが安くなっても、これらの問題は一つも安くならない。

eeselを試す

0.03ドルのモデルから本当に欲しかったものが、より安価なサポート自動化だったのなら、組み立て作業自体を省略できる。eeselはあなたがすでに運用しているヘルプデスクに接続し、過去のチケットとヘルプセンターから学習した上で、自信がある質問には答え、それ以外は手を出さずに残す。

何を構築するにせよ盗む価値がある部分はこれだ。本番投入前に、実際のチケット履歴に対して実行し、それが何と答えていたかのスコア付きレポートを得られる。それが、顧客より先にモデルの誤りを見つける方法だ。どんなトークン価格でも買えないチェックだ。

タスク量、種類別のトリガーイベント、ツールごとの承認・却下の利用状況を示すeeselレポートダッシュボード
タスク量、種類別のトリガーイベント、ツールごとの承認・却下の利用状況を示すeeselレポートダッシュボード

eeselを試すのは無料だ。あるいは、まず自分のキューに対して実際に動かして見てみたいなら、デモを予約することもできる。

よくある質問

Qwen 3.7 Flashの料金はいくらですか?
入力100万トークンあたり0.03ドル、出力100万トークンあたり0.13ドルから始まりますが、これは32Kトークン未満のプロンプトのみに適用されます。32Kを超えると0.10ドル/0.40ドルになり、256Kを超えると0.20ドル/0.80ドルになります。OpenRouter自身の30日間の実際の顧客支払い額の平均は入力0.044ドル、出力0.149ドルで、表示価格より高くなっています。ファミリー全体の背景については、Qwenの価格の解説をご覧ください。
Qwen 3.7 FlashはOCRに適していますか?
Roboflowのビジョン評価では、OCR文字起こしで23モデル中最下位でしたが、僅差のフィールドの中で平均一致率84.1%を記録しています。QwenはFlashのOCRを強みとして謳ったことはないため、これは破られた約束というより一貫した結果と言えます。ドキュメント読み取りが目的なら、このモデルは選ぶべきではありません。
Qwen 3.7 Flashの重みはオープンソースですか?
いいえ。Hugging Faceには該当リポジトリがなく、Roboflowはライセンスをプロプライエタリと表示しているため、API限定です。Qwenの3.7シリーズ全体がクローズドウェイトであり、この会社の以前の評判からは変化しています。ホストできる重みが必要なら、オープンソースAIエージェントのおすすめのまとめの方が良い出発点です。
Qwen 3.7 Flash対Gemini 3.5 Flash-Lite: どちらが速いですか?
Geminiが大差で勝ります。Artificial AnalysisはFlash-Liteを毎秒382出力トークンと計測しており、OpenRouterはQwen 3.7 Flashを毎秒59と計測しています。Qwenは価格で決定的に勝ち、速度で決定的に負けます。詳しい数値はGemini 3.5 Flash-Liteの価格の記事にあります。
Qwen 3.7 Flashをカスタマーサポートに使えますか?
呼び出すこと自体は可能ですが、生のモデルはサポートエージェントではありません。ヘルプセンターに対する検索、エスカレーションルール、本番投入前のテスト方法が依然として必要です。サポート向けLLMの選び方のガイドでトレードオフを、ハルシネーション防止で実際に痛い目を見る部分をカバーしています。
Qwen 3.7 Flashが停止したらどうなりますか?
提供者が1社だけなので、ルーティングのフォールバックはありません。OpenRouterは3日間で99.99%の稼働率を報告していますが、これはこれだけ新しいモデルにしては短い観測期間です。P99のエンドツーエンドレイテンシー90.2秒の方がより実務的なリスクで、特にエージェントループの中では遅いツール呼び出しがその後ろのすべてを止めてしまいます。障害時の対応方法についてはAIエスカレーション管理をご覧ください。

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
画面上で段階的な料金カードを確認する2人のイラスト、Qwenのロゴ付き
Trending

Qwen 3.7 Flashの料金:2026年に実際いくら払うのか

$0.03という料金は本物だが、それは請求書にある4つのメーターのうちの1つに過ぎない。プロンプトの階層、キャッシュ、バッチのリージョン、リトライ率がどのように組み合わさって実際の請求額になるのかを解説する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
画像、動画、文書のパネルがビジョン言語モデルに入力される様子を描いたイラスト、Qwenのロゴ付き
Trending

Qwen 3.7 Flash: スペック、価格、そして実際にできること

Qwen 3.7 Flashはブログ記事もベンチマークも重みの公開もないまま登場した。ここでは完全なスペックシート、段階的な料金、そしてQwenが決して主張しなかったことをまとめる。

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
大量のドキュメントを処理しながら推論する大規模言語モデルのエディトリアルイラスト
Trending

Kimi K3レビュー:Moonshotのオープンフロンティアモデルを徹底検証

Kimi K3の実践レビュー:2.8兆パラメータのオープンモデルのアーキテクチャ、ベンチマーク、実際の料金、そしてローンチ週のコミュニティの本音を検証する。

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
ヒューマノイドロボットの制御モデルを描いたイラスト、Gemini Robotics 2を表現
Trending

Gemini Robotics 2:DeepMind自身の数字が示すもの

Gemini Robotics 2は3つのモデルを同時に出し、タスク別成功率の表ではほとんどのスコアが80%を下回る。この表こそ、今回のリリースで最も役に立つ部分だ。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
1つのAIモデルが一方のタスクはきれいに終わらせ、隣のタスクでは行き詰まる、開発者の作業台。Metaのブランドブルーで描かれている
Trending

Meta Muse Spark 1.1 レビュー:天井は高く、底は低いモデル

Muse Spark 1.1 はボード上で最速のモデルでありながら、エージェント性能では最下位クラス。この安価なトークンが実際にどの仕事で通用するのかをレビューする。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
モニターから手を伸ばしアプリのウィンドウや文書を操作するAIエージェントを、2人の同僚が見守っている様子。Metaのブランドカラーである青を基調としたイラスト
Trending

Meta Muse Spark 1.1:概要・料金・弱点を整理

Metaが初の有料モデルAPIとして100万トークンのコンテキストを持つエージェントモデルを$1.25/$4.25で提供開始。Muse Spark 1.1が実際に得意なことと、Metaがスライドから外したベンチマークを整理する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Claude Opus 5スタイルのコントロールストリップ上で、5つの推論エフォートダイヤルの1つを選んでいる人物のイラスト
Trending

Claude Opus 5とは何か、実際にどう使うか

Claude Opus 5は1つのモデルではなく、実質5つのモデルだ。スペック、料金を左右するeffortダイヤル、そして古いコードを壊す2つのAPI変更をわかりやすく解説する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
多数の暗い経路の中から2つの光るエキスパート経路へトークンを振り分ける小型モデルチップのイラスト。Inkling-Small の解説用
Trending

Inkling-Small解説:2760億パラメータ、実働は120億

Inkling-Smallが実際に何なのか:Thinking Machines発の2760億/120億のオープンウェイトMoEモデル、ドキュメントとプロバイダーで食い違うコンテキストウィンドウ、100万トークンの実際のコスト、そしてサポートスタックにおける位置づけ。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
整然とした小型モデルのコアと、はるかに大きく絡み合ったコアを比較するイラスト。Inkling-Small のレビュー用
Trending

Inkling-Smallレビュー:サイズは4分の1、賢さはほぼそのまま

実際に試したInkling-Smallレビュー:サイズと価格が4分の1でありながら、コーディングでは975Bの親モデルを上回る。ただし事実性は崖から落ちるように急落する。このトレードオフが実際に何を意味するのかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める