Andersonの視点

AIが生成した文章は決して「疲れ」を知らない、そしてそれがAIであることを暴露する

mm
Unite.AI を Google の優先ソースに追加
AI-generated image, by Z-Image Turbo (V1) via Krita AI Diffusion. Prompt: 'An American, hot high-school exam room in Texas,, with all the students seated exhausted in the heat, at lines of desks, trying to concentrate on winning their exams. In the center of the picture we focus on an industrial humanoid robot who is filling out the exam papers so quickly that the A$ sheets are flying around its desk in a flurry of activity. Some of the nearby, sweating and exhausted young students are looking at the tireless robot with annoyance and/or jealousy.'

ChatGPTスタイルのAIは、一貫性の増加によって自分自身を暴露し、人間の文章は全体を通じて不規則性を保つ。

 

大規模言語モデル(LLM)のコンテキストウィンドウは、ユーザーの会話の以前の部分を忘れたり、間違った情報を思い出したりすることがあります。これは、出力が完全に意味のないものになったり、または欺瞞的な整合性のある文章が生成されたりする可能性があります。

これらの状況は、ハルシネーションを引き起こし、ハルシネーションはまだAIの総市場進出の最大の障害です。したがって、より長く一貫性のあるテキストを生成できる生成AIシステムを作成するために多くの研究努力が費やされています。

実際、進歩は著しくなっており、長形式のAIコンテンツ(つまり、AIによって生成されたコンテンツで、人間の後処理は最小限またはゼロ)を認識することは、増加する問題と見なされています。

AIフィリバスターの暴露

それでも、最近の実証研究は、主張します。AIテキスト生成器が1回の出力で生成するテキストが長くなるほど、人間が書いたテキストかどうかを判断するのが容易になります。しかし、この検出「アンカー」に関する受け入れられた知識は、AIが人間と異なり、長いテキストで何をするかをより多く行う機会があると仮定しています。

テキスト自体の「分布」については、仮定は行われていません。

これに異議を唱え、問題を拡大するために、中国からの新しい研究は、最新の長形式AIコンテンツ生成器を人間の著者から区別するための新しい方法を提供しています。研究者は、トークンによるトークンの性質により、AIテキストは長さが増すにつれて一貫性が増し、人間の個性は長さが増えても減少しないと主張しています。

このように、著者は、人間の文章は一貫性がなく、AIの文章は一貫性があるという洞察が、AIテキスト検出システムの新しいメトリックを提供する可能性があると示唆しています。

‘AI生成トークンはテキストの後半部分で、小さくて安定した確率変動を示し、モデルが予測をより一貫性を持って行うにつれて、確率変動が小さくなる。

‘私たちはこのパターンを 後期の変動性の低下と呼びます。この現象は、自己回帰生成の固有の動作を反映しています。コンテキストが利用可能になるにつれて、モデルの予測分布は鋭化し、トークンレベルの統計量の変動が減少します。

‘人間の文章は、逆に、予期せぬ語彙の選択を続け、全体を通じて高い変動性を維持します。’

AIテキストの終わりの方で蓄積するこの「滑らかさ」を捉えるために、研究者は2つの単純な特徴を定義しています。最初の特徴は、文章の統計的挙動がトークン間でどれだけ「飛び跳ねる」かを測定します。2番目の特徴は、短いテキストの区間でどれだけ安定しているかを確認します。

両方のシグナルは、AIが明らかにより規則的になるテキストの後半部分からのみ計算され、人間の文章は規則的にならないことを著者は指摘しています。著者は、これらのシグナルはそれ自体でうまく機能するが、以前の検出方法と組み合わせるとさらに効果的であると述べています。これらの方法は、テキスト全体をスキャンしてより広いパターンを検索します。

このアプローチは、特に長いテキストで最も効果的であり、対比がより明確になることが示されています。

新しい論文では、二次的特徴分析を必要とせずに、「AI-ness」をテストするための方法論を提供しています。

新しい研究は、題して AIが落ち着くとき:AI生成テキスト検出のための後期安定性 であり、杭州のウェストレイク大学の4人の著者によって行われました。

方法

AI生成テキストの増加する滑らかさを捉えるために、研究者は、パッセージの後半部分にのみ焦点を当てた2つの測定を設計しました。これらは、標準的な言語モデルからの対数確率スコアに依存し、ファインチューニング、再トレーニング、または追加サンプルは必要ありません。

新しい論文から - 各行は、EvoBenchのトークンシーケンス全体で基本メトリックの動作を示しています。生値(左)、絶対導関数(中央)、および局所標準偏差(右)。人間とAIの線は青と赤で示されています。最も多くの乖離はテキストの後半部分で発生し、特に対数確率とサンプリング不一致では、上昇する乖離と滑らかなAI出力が見られます。エントロピーとトップK濃度は時間の経過とともにほとんど変化しません。ソース - https://arxiv.org/pdf/2601.04833

新しい論文から – 各行は、EvoBenchのトークンシーケンス全体で基本メトリックの動作を示しています。生値(左)、絶対導関数(中央)、および局所標準偏差(右)。人間とAIの線は青と赤で示されています。最も多くの乖離はテキストの後半部分で発生し、特に対数確率とサンプリング不一致では、上昇する乖離と滑らかなAI出力が見られます。エントロピーとトップK濃度は時間の経過とともにほとんど変化しません。ソース – https://arxiv.org/pdf/2601.04833

最初の測定値、導関数分散(DD)は、モデルの信頼度が1語から次の語にどれだけ急激に変化するかを追跡します。AIテキストはリズムに落ち着き、これらの変化は2番目の半分で小さく予測可能になります。一方、人間の文章は「不均一」なままです。

2番目の測定値、局所的変動(LV)は、小さなテキストウィンドウ内でモデルの信頼度がどれだけ「飛び跳ねる」かを見ます。再び、AIは時間の経過とともにより安定し、人間の選択はより予測不可能で一貫性のないままです。

AIテキストは進むにつれて滑らかになりますが、人間の文章は不均一のままです。これらのグラフは、パッセージ全体でモデルの信頼度の変化を追跡し、連続する単語間の変化の鋭さと、局所的なテキスト区間内の変動の量を反映しています。両方の点で、機械生成出力の減少は人間の文章よりもはるかに急激です。黄色のボックスは、2番目の半分でこのギャップを強調しています。ここで、AIの文章は人間の文章よりも最大32%安定しています。

AIテキストは進むにつれて滑らかになりますが、人間の文章は不均一のままです。これらのグラフは、パッセージ全体でモデルの信頼度の変化を追跡し、連続する単語間の変化の鋭さと、局所的なテキスト区間内の変動の量を反映しています。両方の点で、機械生成出力の減少は人間の文章よりもはるかに急激です。黄色のボックスは、2番目の半分でこのギャップを強調しています。ここで、AIの文章は人間の文章よりも最大32%安定しています。

再び、両方のメトリックは、人間と機械の文章の違いが最も明らかなテキストの後半部分からのみ計算されます。これらは、時系列安定性検出(TSD)スコアと呼ばれる単一の値に統合されます。TSDスコアは、文章が「滑らか」なもの(そしてAIによって生成されたもの)である可能性が高くなるにつれて上昇する傾向があります。単純な閾値が使用され、パッセージが機械によって書かれたものであるかどうかを判断します。

これらの特徴は、パターンが現れる「時期」に焦点を当てているため、テキスト全体で統計的奇妙さを検索する古い方法と補完されます。TSDスコアを2024年後半の提供であるFast‑DetectGPT(ウェストレイク大学との共同研究)の出力に追加すると、特に長いコンテンツの場合に、結果がさらに改善されます(後期の滑らかさ効果が最も強い場合)。

データとテスト

著者は、2つの関連するベンチマークデータセットでテストを実施しました。 EvoBenchには、7つのモデルファミリー(GPT-4、GPT-4o、ClaudeGoogle GeminiLLaMA-3、およびQwenを含む)で生成された32,000の人間/AIテキストペアが含まれています。合計29のモデルバージョンが機能しています。

もう1つのフレームワークは、MAGEでした。これには、8つのモデルファミリー(OPTFLAN-T5ファミリーを含む)でテストされた30,000のペアが含まれています。

対象者

新しい方法は、ゼロショット検出器と同じサロゲートモデルを使用してテストされました。 確率エントロピーランク、および対数ランク(DetectGPT)は、パッセージ全体でトークンレベルの統計を測定しました。 LLR(DetectLLM)は、モデル間の直接比較を可能にするために正規化を適用しました。 Fast-Detect は、サンプリングベースの摂動を介してローカル曲率を推定しました。

Lastdeは、確率シグナル内の判別的な部分シーケンスを分析しました。 FourierGPTは周波数ドメインで動作しました。 Diveyeは、シーケンス全体で「驚き」の多様性の変化を捉えました。

最後に、UCEは、トークンの予測の不確実性プロファイルを評価し、自然な信頼パターンを識別しました。

実装と結果

すべての検出方法は、Llama-3-8B-Instructを共有サロゲートモデルとして使用して実行され、入力シーケンスは512トークンに制限されました。時系列特徴は、スライディングウィンドウを使用して、各パッセージの2番目の半分からのみ抽出され、20トークンのウィンドウで変動を測定しました。提案されたシグナルとFast-DetectGPTを組み合わせた、TSD+と呼ばれるメソッドの融合バージョンが作成されました。

受信者操作特性曲線の下の面積(AUROC)が、主な評価メトリックでした

さまざまなテスト方法に対するAI生成テキストのパフォーマンスの多様性。EvoBenchとMAGEの2つのベンチマークに対する検出精度が示されています。メトリックは、グローバル統計、時系列特徴、提案されたバリアントにグループ化されています。平均AUROCスコアは、最後の列に示されています。著者の方法バリアントの結果は、一貫して以前のベースラインを上回り、TSD+はほぼすべてのモデル設定で最高スコアを達成しています。

さまざまなテスト方法に対するAI生成テキストのパフォーマンスの多様性。EvoBenchとMAGEの2つのベンチマークに対する検出精度が示されています。メトリックは、グローバル統計、時系列特徴、提案されたバリアントにグループ化されています。平均AUROCスコアは、最後の列に示されています。著者の方法バリアントの結果は、一貫して以前のベースラインを上回り、TSD+はほぼすべてのモデル設定で最高スコアを達成しています。

これらの初期結果について、著者は次のように述べています。

‘私たちの単純な時系列特徴は、スタンドアロン方法の中で最先端のパフォーマンスを達成し、EvoBenchでは83.36%、MAGEでは71.56%を達成し、Fast-DetectGPTを含むすべてのベースラインを上回ります。 ‘

‘これは注目に値することです。私たちの方法は非常に単純です。私たちは、シーケンスの2番目の半分からのみ2次統計を計算し、摂動サンプリングや周波数ドメイン変換を行っていません。’

新しい方法は、特にGPT-4やGPT-4oなどの新しいAIモデルで最も効果的に機能し、最も近いリーディング検出器よりもAI書き込みテキストをより正確に識別しました。パフォーマンスギャップは最大9.66%でした。新しい高度なモデルは、より一貫性のあるテキストを生成しますが、後期のパターンは依然として存在します。

広い構造的特徴に焦点を当てた競合他社のアプローチは、これらの後期のパターンを捉えることに失敗しました。グローバル検出器を統合することで、ハイブリッドシステムは明らかにこれらの欠落したシグナルを回復し、特にテンポラルキューが弱いベンチマークでパフォーマンスが向上しました。

結論

新しい研究では、人間の作家が自分の作品を草案を通じて、そしてさまざまなレベルの監視を通じて反復する傾向について直接触れられていません。編集者、校正者、法務部門(文脈によっては)の入力を含む、ドキュメントとして簡単に埋もれた新聞記事に含まれる可能性のある複数の利害関係者です。

編集者、校正者、法務部門(文脈によっては)の入力を含む、ドキュメントとして簡単に埋もれた新聞記事に含まれる可能性のある複数の利害関係者です。

さらに、研究対象システムは、編集や校正を含む人間の作業をトレーニングデータとして使用しているため、これらの「最も重み付けされた」または「最も権威のある」情報源は、カジュアルなメールを同僚に書くよりも、年次総会向けの報告書を組み立てる場合と比較して、最も「自然でない」ものになる可能性があります。

さらに、複数の人が貢献したテキストコンテンツは、最も断片化された、欠陥のある、繰り返しの多い文章の1つになる可能性があります。なぜなら、最終的な統一された声音の利点がないため、開発の断片的な性質が文章に明らかになるからです。

 

* 著者のオリジナルのテキストスタイリングは、論文から再現されており、強調は私のものではありません。

著者は「主な」と述べていますが、他の評価メトリックはリストされていません。

2026年1月26日月曜日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai