
私がこのスキーマにこだわる理由
私はeeselでAIエージェントを構築しており、そのため他の人がリリースノートを読むような感覚でモデルカードを読み、検出器がデモ用の箱の中ではなく実際のパイプラインの中に組み込まれたときに何が起きるかを見届ける立場にある。
eeselのブログライターが作成するすべてのドラフトは、人間が目にする前に検出器のゲートを通過する。これは小さなサンプルではない。あるカスタマー(Webflow CMS上でキーワードから公開までのパイプラインを運用するSEOコンテンツリード)は、月に360本以上、1日あたり約12本のペースで運用しており、最後にまとめてレビューして公開している。この規模で運用していると、「検出器が84%と言っている」は役に立たず、「この4段落はAI支援と読める、残りはクリーンだ」の方が実行可能だ。だから私にとってはスキーマこそが製品であり、Pangram 4はそのスキーマが目玉機能になった最初のバージョンだ。
この規模だからこそ、私は結果セクションより先に制限事項のセクションを読む。AIコンテンツパイプラインの中に組み込まれた検出器には、テストされたことのないものが投げ込まれる。そしてその失敗は静かに起きる。自らが公言する範囲外の入力に対しても数値を返し、その数値は本物の数値とまったく同じように見えるのだ。
eeselのチームは何年もかけて実際のキューにAIを導入し、自信満々に聞こえるモデルが、規模を伴って初めて表面化する形で間違っていることを見てきた。それが、0.0041%という主張に対して私が持ち込む同じ本能だ。疑うわけではない。ただ、脚注を先に読む習慣があるだけだ。
Pangram 4とは実際には何か
Pangram Labsはブルックリンの企業で、2023年に設立され、社員数は11〜50人。Max Spero(CEO)とBradley Emi(CTO)はスタンフォード大学1年目の寮で出会い、後にこの分類器を共同開発した。Pangram自身のストーリーによる。同社はAssuranceLabによって検証されたSOC 2 Type 2を保持している。
Pangram 4は2026年7月29日にローンチし、同日にMenlo Ventures主導の900万ドルの資金調達ラウンドと、リサーチプレビューとして位置づけられた初のAI画像検出モデルが発表された。公開されているモデルカードと、arXivの2607.27183としての技術レポートがあり、これはこのカテゴリーのほとんどの製品よりも開示度が高い。
ポジショニングは率直で対決姿勢が強い。ホームページの見出しは「An AI detector that actually works(本当に機能するAI検出器)」で、サブヘッドは99.98%の精度を謳っている。注目すべきは、サイトがどのページを見るかによって異なる精度の数値を挙げていることだ。ヒーロー部分では99.98%、バッジ帯では99.9%以上、FAQでは「99%超」、そして別のFAQの項目ではモデルカードの1万分の24分の1という誤検知率とは異なる、1万分の1という誤検知率が示されている。これらは厳密には矛盾ではなく、同じ自信を持って提示された異なる測定値であり、これがマーケティングページではなくモデルカードを見るべき最初の理由だ。
Pangram 4がドキュメントを読む仕組み
ここがPangram 4を前身モデルと異なるものにしている部分であり、すべて公表されている。

バックボーンは「因果的で、オープンウェイトなスパースMixture-of-Expertsの言語モデル」。Pangramはベースモデル名を公表しておらず、パラメータ数も公開していない。トレーニングには8基のNVIDIA H100 GPUを使い4日間を要し、PyTorchとHugging Faceのライブラリを用い、最初のアダプターをバックボーンにマージしてから2段階目を開始する2段階のLoRAプロセスが採用されている。
共有の表現の上に4つの線形ヘッドが乗っている:
- 15クラスのセグメントヘッド: テキストウィンドウ全体のAI関与レベルを推定する。
- 3クラスのトークン単位の来歴ヘッド: 各トークンごとにHuman、AI-Assisted、AI-Generatedを予測する。
- バイナリの混合著者ヘッド: セグメントが混合した来歴のテキストを含んでいるかを推定する。
- 4クラスのヒューマナイザーヘッド: Human、AI-Generated、AI-Edited、Humanized-AIのテキストを分離する。
ヒューマナイザーヘッドはストップグラディエントのプローブとして訓練されているため、その目的関数が共有バックボーンを更新することはない。また最終的なラベルの決定にも投票しない。モデルカードは明確に、デコーディングのステップにおいて「ヒューマナイザーの証拠は寄与しない」としている。つまりis_humanizedは判定への入力ではなく、別途読み取るサイドチャンネルということだ。
推論は512トークンのウィンドウ単位で行われる。つまり長いドキュメントは重なり合うウィンドウに分割され、複数のウィンドウにまたがって現れるトークンの予測は整列され平均化される。その後、較正された3状態の線形連鎖条件付き確率場(CRF)がトークン単位・セグメント単位・混合著者の観測値をドキュメント全体にわたって統合し、ビタビ復号が最も可能性の高いラベル系列を選び、後処理のステップが「おおよそ2文」に調整された最小連続長で文の境界に丸める。
この512トークンのウィンドウは、この製品に関する最もよくあるユーザーの混乱の元にもなっており、それは1年以上前からのことだ:
"Can you tell me how the sections work in Pangram? I am looking at a student's work, and Section 1 is all green, with 7.83% identified as possible AI use. Section 2, which includes most of Section 1 along with some additional new paragraphs, says 99.9% possible AI use, and some of the paragraphs that were green before are now red. Confused!"
これはバグ報告ではなく、ウィンドウ処理が設計通りに動作しているだけだ。段落のラベルは、それがどの文脈の中でスコアリングされたかに依存する。つまり同じ段落でも、周囲を変えると色が変わり得る。Pangram 4はここでの影響範囲を、最小セグメントを約2文まで縮めることで狭めている(Pangram 3ははるかに粗かった)が、その効果を完全になくすわけではない。抜粋をスキャンしているなら、断片ごとではなくドキュメント全体を一度にスキャンすれば、矛盾は見られなくなるはずだ。
出力フィールドと、誤読されがちな2つ
実際に完成したPangramの結果がどのようなものかを見てみよう。

セグメントごとに、APIは正確な部分文字列、label、文字オフセット、単語数、そして4つの数値を返す。この4つのうち2つは、実際にはそうではないものとして日常的に読み違えられており、モデルカードはその両方を平易な言葉で訂正している。
ai_assistance_scoreはP(AI-Generated) + 0.5 × P(AI-Assisted)として計算される。モデルカードは、これは「連続的なAI関与スコアであり、表示されている離散ラベルの確率ではない」と述べている。つまり0.62というスコアのセグメントは、62%の確信度という意味ではない。ブレンドされたAI関与度の推定値が0.62に着地した、という意味であり、その隣にあるラベルは別のデコーディング経路から来ている。
confidenceはHigh、Medium、Lowを返し、「非拘束のCRF事後分布のピークの鋭さを測定するものであり、較正された確率推定値ではない」。High confidenceは、モデルの内部分布がどれだけ鋭くピークを迎えたかについての言明であり、95%の確率で正しいという主張ではない。
残る2つはよりクリーンだ。humanizer_scoreはヒューマナイザーツールがそのセグメントに触れた確率であり、is_humanizedはリリース時点でデフォルトで0.91を境に真になる。この閾値についてPangramは内部的に較正されたものだとしており、これは動く可能性があるという意味の丁寧な言い方だ。
もしあなたが同僚と検出器のパーセンテージが何を意味するのかで議論したことがあるなら、その議論の正体はここにある。この数値は本物であり、モデルは何かを実際に測定しているが、それはみんなが読み取っているような「AIである可能性」を示す数値ではない。そのギャップこそが、検出器の精度についての私の長編記事全体のテーマであり、それはこの製品に限らずこのカテゴリーのすべてのツールに当てはまる。
ドキュメントレベルの判定がどう決まるか
ドキュメントレベルでは、Pangramは合計が1.0になる3つの文字数加重の割合を返し、加えてprediction_shortフィールドには正確に3つの可能な値と、公表された2つの閾値がある。

prediction_shortの閾値。Pangram 4のモデルカードによる。Humanはドキュメントの文字の少なくとも90%が人間として分類されていることを要求する。AIは少なくとも80%がAI生成として分類されていることを要求する。それ以外はすべてMixedだ。この非対称性に注目してほしい。Human側の基準はAI側の基準よりも厳しいため、85%がAI生成のドキュメントはAIという結果にはならず、Mixedという結果になる。
この非対称性は見た目以上に重要だ。というのも、Pangram自身の評価手法では、完全に人間か完全にAIのテキストのみを含むバイナリデータセットにおいて、Mixedという予測はエラーとしてカウントされるからだ。これは公正な扱いであり、同時にヘッドラインのエラー率は「雰囲気を正しく捉えたか」よりも厳しい基準で測定されているということも意味する。
自分の割合を入れて、判定がどこで切り替わるか確認してみよう:
この点が、採点ではなく編集をする人にとって重要な理由だ。Mixedは実際の作業では通常の結果になる。うまく磨かれた導入部を持つ人間のドラフトも、人間が適切にリライトしたAIのドラフトも、どちらもここに着地する。Mixedを不合格として扱うことは、AIコンテンツの編集を疑わしい行為として扱うことになり、これは本末転倒であり、書き手を誤った目標に向かわせてしまう。目指すべきは、閾値をクリアする割合ではなく、人が書いたように読めるエラーのない文章だ。
Pangram 4がカバーしないもの
モデルカードは自らの限界について異例なほど率直であり、このセクションは、どこかに導入する前に印刷して手元に置いておきたいくらいだ。
Pangram 4は「50語以上のテキスト入力を受け付ける」もので、「完全な文で書かれた自然言語の散文向けに設計されている」。主要な対象範囲外、またはエラーが起きやすいとされているものとして、短い会話的な返信、単一事実の回答、ソースコード、目次、参考文献セクション、テンプレート化された文章や自動生成された文章、指示書や技術マニュアル、数学的記法が支配的なテキストが挙げられている。Pangramはまた、スキャン前に人間が書いたヘッダー、フッター、書式を取り除くことを推奨しており、PDFの解析はアーティファクトを生むため、生テキストや.docxの方をPDFより推奨している。
このリストを人々が実際に検出器をどう使っているかと照らし合わせると、ミスマッチは明白だ。製品説明、変更履歴のエントリ、メタディスクリプション、リリースノート、FAQの回答、ソーシャルのキャプションはいずれも50語未満か、性質上テンプレート化されている。これらに対する判定はモデルが自ら主張する範囲の外にあり、これはまさにそうしたフォーマットを大量に生成するコンテンツ生成ツールの出力をゲートしようとしているなら重要な点だ。
言語のギャップはもう一つの境界であり、これは数値化されている。英語の0.3396%に対し、公表されている言語別の見逃し率はチェコ語の0.2760%から**ペルシア語の3.1715%、ウルドゥー語の5.3169%**まで幅がある。多言語での見逃し率を合算すると1.24%になり、これは英語の数値のほぼ4倍だ。誤検知率側でも幅は小さいながら実在し、ウクライナ語が最悪の0.0361%となっている。
| Corpus(コーパス) | N | エラー数 | 率 |
|---|---|---|---|
| FineWeb 英語、人間 | 1,000,000 | 誤検知41件 | 0.0041% |
| FineWeb2、104言語、人間 | 996,273 | 誤検知14件 | 0.0014% |
| 英語AI、26のジェネレーターモデル | 519,993 | 見逃し1,766件 | 0.3396% |
| 多言語AI、18言語 | 190,149 | 見逃し23,578件 | 1.24% |
数値はPangram 4のモデルカードより。
Pangram 3.3.2と比較すると、英語全体の見逃し率は1.9942%から0.3396%へと低下しており、これは丸め誤差ではなく実質的な世代間の進歩と言える。ジェネレーターごとに見ると、Grok 4.3が最も難しく0.605%、Claude Haiku 4.5が最も易しく0.130%で、単一で最大の改善はGeminiで、5.138%から0.498%へと下がった。
実際にスキャンできる場所
5つの利用面があり、無料プランでもそのほとんどに手が届く。
Webアプリはペーストされたテキストまたはファイルアップロードを受け付け、PDF、DOCX、RTFに対応し、一度に最大100ファイルまで扱える。ChromeとFirefox向けのブラウザ拡張機能もあり、右クリックで「Check for AI Content」というアクションを追加し、Google Docsの中でも動作する。

APIはサブスクリプションではなく前払いクレジット方式で、Pangram 4では100語あたり0.05ドル、20%のバルク割引、5 QPSのリアルタイム上限がある。これは、生成側のライターAPIと同じ統合形態で、検出器のゲートを自分のスタックに組み込みたい場合に使う面だ。ここで見誤りやすい点が2つある。Pangram 4は語あたりでPangram 3のちょうど10倍のコストがかかる。というのも、単位が1,000語から100語に縮小した一方でドル金額は0.05ドルのままだったからだ。そしてmodel引数を省略した呼び出しは、2026年9月30日まで旧来の課金体系でPangram 3にルーティングされ続け、その時点を過ぎると同じ呼び出しが語あたり10倍のコストになる。今のうちにmodel="pangram-4"を指定しておけば、10月に驚くことはない。
Canvas、Moodle、Brightspace、Google Classroom向けのLMS統合は、見積もり制の機関向けライセンスの背後にあり、盗作チェックが無料版と有料版の境界線になっている。画像検出器は無料プランを含むすべてのプランで1日3回のスキャンとして利用できるが、リサーチプレビューであり、ページには99.8%の精度が記載されているものの、データセットも方法論も対応するジェネレーターの公開リストもない。
数値を、読み過ぎずに読む
入手できる証拠に基づく限り、Pangram 4はこのカテゴリーで最も強力な検出器だ。UChicago Booth、Vrije Universiteit Brussel、University of Marylandの独立チームはいずれも、テストした商用検出器の中でPangramの誤検知率が最も低いという結果を示した。ただし、これらの研究はすべてPangram 3.xを対象に実施されたものだ。Pangram 4はまだどのサードパーティにもテストされていない。そして、これまでに誰かが実施した中で最大の人間コントロールセットでも、誤検知率の上限はおよそ0.15%までしか絞り込めておらず、0.0041%ではない。1万分の24分の1という数値を確認するには、およそ7万3,000件のクリーンな人間サンプルが必要になる。
最も鋭い2つの批判は逸話ではなく統計的なものであり、いずれもPangram自身の数値と照らしても成立している。
"Pangram boasts a false positive rate of 1 in a 10,000. That is, if Pangram says a block of text is AI there is only a one in ten thousand chance that it was written by a human. That'd be if they had a false discovery rate of 1/10,000."
この区別こそ、しっかり理解しておくべきものだ。誤検知率(false positive rate)は「このツールがクリーンなテキストにどれくらいの頻度でフラグを立てるか」に答えるものであり、誤発見率(false discovery rate)は「フラグが立ったとき、それが間違っている確率はどれくらいか」に答えるものだ。この2つの数値は、スキャンしている山の中に本物のAIテキストが少ない場合に大きく乖離する。そしてそれはまさに、ほとんどの編集ワークフローで起きている状況そのものだ。
2つ目は、何人をスキャンしたかではなく、誰をスキャンしたかについてのものだ。
"People mention Pangram has a low false positive rate, but usually such statistics are over a large population. […] But in your example you aren't checking 10 random works from an assortment of authors. You are checking 10 works from one author. […] all it might take for them to get most of them flagged even if they are 100% human written is for that author to have some style choice, like those 3 bullet point sections, that they just use in much of their writing."
人口全体あたりのエラー率は、著者1人あたりのエラー率については何も語らない。そしてエラーは文体と相関する。Pangramの公表統計はこれに答えていない。ただし公平を期すために言えば、どの検出器の統計も答えていない。Speroその人も、プッシュされると自らのマーケティング上の主張を狭め、パブリックデータセットでのベンチマークでは誤検知率が「おおよそ1万分の1程度」だと自身のHNへの返信で述べており、これはモデルカードのヘッドライン数値とは異なる数値であり、それが一つの数値に過ぎないことに正直だ。
このツールが何に向いているかについて、私が何度も立ち返る、うまく言い表された表現がある。
"The most reliable automatic detector right now must be https://www.pangram.com/. If Pangram says something is AI, it is very likely AI. Sometimes it concludes more unusual AI text is human-written"
ポジティブな結果の方を、ネガティブな結果よりも信頼すること。この非対称性は公表されている数値に組み込まれており、見逃し率は誤検知率のおよそ80倍だ。これは、単一のパーセンテージよりも優れたメンタルモデルだ。そしてこれはPangramに固有のものでもなく、検出器の仕組み一般から導かれるものだ。検出器は無実のテキストを誤って告発しないよう調整されており、その選択の代償が、AIの見逃しなのだ。
私ならどう導入するか
検出器は最後、決して最初には使わない。ある作品が機械生成であると考える独立した理由がすでにあるなら、スキャンはそれを裏付けることができるし、セグメント単位のビューはどこが問題かを教えてくれる。スキャンから出発して逆算していくやり方は、確率と議論することになる典型的なパターンだ。
単発の結果ではなく、パターンを見ること。同じ著者による10作品のうち1回のフラグはノイズだ。10作品中8作品なら、それは会話に値する。そしてその議論のまともなバージョンは、HNで私よりうまく述べられている。
チャンクではなくドキュメント全体をスキャンすること。そうすれば512トークンのウィンドウ処理が同じ段落に矛盾した色を付けることがなくなる。
そして、SEO業界がこの議論に追いつくよりも何年も前に、教育現場側がすでに言語化していたカテゴリー的な限界も忘れないこと。
"Ultimately they're black boxes. You don't really know what causes false positives/negatives. You get a number and hopefully its correct, but it's not like something that scans for plagiarism because with that you have the original source that you can refer to and make more insightful decisions on."
盗作検出は、開いて確認できる元の出典を生成する。AI検出は、監査できない確率を生成する。Pangram 4のセグメント単位の出力は、そのギャップを埋めることに誰よりも近づいているが、それでもなお同じものではない。
コンテンツチームにとって具体的に言えば、これは有益な作業を上流に押し上げる。検出器はどの段落が機械生成として読めるかを教えてくれるが、その作品がクエリに答えているかどうかは教えてくれない。この2つの事実は無関係だ。だからこそ私は、スコアを追いかけるのではなく、実際の編集を通じてコンテンツを人間らしく響かせることと、個性を加えることに労力を注ぐ。
さまざまなヒューマナイゼーションツールの多くは、読者ではなくその数値を最適化しており、Pangram 4が専用のヒューマナイザーヘッドを備えているのは、まさにこのカテゴリーが人気になったからに他ならない。Surferのヒューマナイザーは、比較を求められることが最も多いツールだが、私の正直な見解では、優れた入力プロンプトの方が、後付けのリライトパスよりも勝る。
そもそも検出器を選ぶ段階にあるなら、検出器ソフトウェアの選択肢についての私の比較や、AI支援の情報源としてのGrammarlyについてのメモが、隣接する問いになる。そしてもし懸念が著者性ではなく検索であるなら、正直な答えはGoogleはAIコンテンツにペナルティを科すかにある。この2つは常に別の基準で測定されてきたからだ。
組織的な規模でこれを行う人にとっては、同じ議論のガバナンス版がSEOコンテンツを安全にスケールするだ。検出器はそのシステムの中の1つの管理策であって、システムそのものではない。
検出器のためではなく、ドラフトのためにeeselを試す
Pangram 4は、すでに手元にあるドラフトを採点する。そのリサーチが良かったかどうかについては何の見解も持たない。そして、多くのドラフトがこのゲートを通過するのを見てきた後に言えるのは、簡単にクリアするドラフトは、そもそもきちんとリサーチされ、きちんと編集されたものだということだ。適切な言い回しを見つけたから薄い記事が通る、という近道は存在しない。
それがeeselのやっている仕事だ。eeselは一次情報源からトピックをリサーチし、ブランドボイストレーニングを使って執筆し、内部リンクグラフを構築し、編集者が救出するのではなく仕上げるだけのドラフトを引き渡す。この投稿を作ったのも同じパイプラインであり、検出器のゲートも含めてだ。これ以上正直なデモはなかなかないだろう。Try eeselを無料で試すか、自動化されたループがキーワードから公開までを実行する様子を見てほしい。
売り込みの前に仕組みを知りたいなら、ライターの仕組みが解説記事、長所と短所が公平版、そして私がツールをテストする方法は、私たち自身のものを含め、この分野のどんなツールにも使う手法だ。

次にどこへ進むべきかは、あなたが今どこにいるかによる。まだツールを比較検討中なら、私のAIブログライターレビューが正面対決の記事で、ライターの出力例は何かにコミットする前に出力を見せてくれる。
すでに大量に公開している?なら制約はドラフト作成そのものではなく、たいていレビューのループであり、それがブログ執筆の自動化と制作スピードが扱っているテーマだ。
そしてドラフトはクリーンなのにトラフィックが伸びないなら、それはまったく別の問題だ。私はランキングのギャップについて別稿にまとめており、実は本当の原因であることが多いE-E-A-Tの観点も一緒に扱っている。
より広い視点で見たいなら、AIコンテンツジェネレーターのまとめや、AIライターツールの候補一覧もある。
ランキングだけが重要な指標なら、代わりにSEO重視の視点から始めてほしい。私自身のドラフト作成のワークフローもまとめてあるので、製品を買うより手順をコピーしたい人はそちらへ。
よくある質問
Pangram 4とは何ですか?
Pangram 4はどのように機能しますか?
Pangram 4は無料で使えますか?
Pangram 4はどの言語に対応していますか?
Pangram 4はAI画像を検出できますか?
Pangram 4はどのようなテキストを対象としていませんか?
Pangram 4は、誰かがAIを使ったと非難できるほど正確ですか?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







