Andersonの視点

個人用言語モデルは作りやすいーしかし検出は難しい

mm
Unite.AI を Google の優先ソースに追加
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

オープンソースのChatGPTのクローンは、大規模に、かつ、専門知識がなくても、またはわずかな専門知識でファインチューニングできるため、「プライベート」言語モデルが検出を回避できるようになる。ほとんどのツールは、これらのモデルがどこから来て、何に訓練されたかを追跡することができないため、学生や他のユーザーは、AIテキストを生成して検出を避けることができる。しかし、新しい方法では、これらの隠れたバリアントを検出できるという主張がある。これは、モデルの出力に共通の「ファミリートレイト」があることを利用している。

 

カナダからの新しい研究によると、ChatGPTに似たユーザー専用のAIチャットモデルは、人間の書き込みと見分けがつかないソーシャルメディアコンテンツを生成することができ、最先端の検出アルゴリズムと人間の両方を欺くことができる。

論文では次のように述べられている。

‘現実的な動機を持った攻撃者は、自分のスタイルとユースケースに合わせてモデルをファインチューニングする可能性が高い。わずかな努力、時間、金額で、非常にリアルなソーシャルメディアツイートを生成できるファインチューニングジェネレーターを生成できた。言語的特徴と検出精度の両方で確認され、人間の注釈によって検証された。

著者は、カスタムモデルのこの種のものは、短い形式のソーシャルメディアコンテンツに限定されていないことを強調している。

‘ソーシャルメディアでのAIコンテンツの拡散と、それに伴うアストロターフィングとインフルエンスキャンペーンのリスクに触発されたが、主な発見はすべてのテキストドメインにわたる。

‘実際、スタイル固有のコンテンツ生成のためのモデルのファインチューニングは、汎用的に適用可能な方法であり、多くの生成的なAIユーザーによってすでに使用されていると思われる。つまり、既存のAIGT検出方法は、研究室では効果的かもしれないが、実世界では効果的ではないかもしれない。

この論文では、カスタム言語モデルを作成するために使用される方法は、ファインチューニングであり、ユーザーが自分のターゲットデータを少し作成し、それをオンライントレーニングツールにフィードするものである。

例えば、人気のリポジトリHugging Faceは、大規模言語モデル(LLM)のファインチューニングを、簡略化されたインターフェイスを使用して提供しており、AutoTrain Advancedシステムを使用して、オンラインのGPUを使用して数ドルで、またはローカルで無料で実行することができる。

Hugging Face AutoTrainシステムのGPUの範囲にわたるさまざまな価格構造。

Hugging Face AutoTrainシステムのGPUの範囲にわたるさまざまな価格構造。 ソース:https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

他の簡略化された方法とプラットフォームには、AxolotlUnsloth、およびより高度で要求の厳しいTorchTuneがある。

使用例としては、自分のエッセイを書くのが面倒で、オンラインのAI検出ツールに捕捉されることを恐れている学生が、自分の過去のエッセイをトレーニングデータとして使用して、人気のオープンソースモデルであるMistralシリーズをファインチューニングすることができる。

ファインチューニングすることで、モデルのパフォーマンスが追加のトレーニングデータに向けて傾斜し、全体的なパフォーマンスが低下することがあるが、「パーソナライズされた」モデルは、ChatGPTのようなシステムからの出力の特徴的な特性を「デアイ」するために使用でき、ユーザーの独自の歴史的なスタイル(および、よりリアルなものにするために、欠点)を反映することができる。

しかし、特定のタスクまたはタスクのセットに特化したファインチューニングされたモデルを、たとえば特定の大学モジュールのコースワークに特化したLLMを使用することもできる。このようなモデルは、汎用的なLLMであるChatGPTよりも、ドメイン内では、より狭いしかし深い洞察を提供する可能性があり、訓練するコストも10ドルから20ドル以下になる可能性がある。

LLMの氷山

この行為の規模は不明である。アネクドートとして、さまざまなソーシャルメディアプラットフォームで、最近、LLMのファインチューニングのビジネス向けの例を多く見かけるようになった。1つの例では、企業が自分の発行されたリーダーシップの考え方のピースに言語モデルをファインチューニングし、それを使用して、新しいクライアントとの雑なZoomコールを、ほとんど一回で、ポリッシュされたB2B投稿に変換することができた。

そのようなモデルを作成するには、ペアデータ(スケールで前後例)が必要であるが、特定のライターの特徴を模倣する「個性化された光沢」を作成することは、スタイル転送に似ているが、より簡単なタスクである。

この行為は秘密裏に行われている(このトピックに関する多数のヘッドライン学術研究にもかかわらず)、数字は利用できないが、同じ共通の感覚が、TAKE IT DOWN法を今年法制化するために導かれたものと同じである。つまり、ターゲット活動は可能で、手頃で、潜在的なユーザーが強く動機付けられているということである。

オンラインの最も「単純化」されたファインチューニングシステムにはまだ多少のフリクションが残っているため、この行為はまだ比較的ニッチなユースケースのままであるが、伝統的な学生の発明力の限界を超えてはいない。

PhantomHunter

これにより、私たちがここで注目している主な論文に至る。中国からの新しいアプローチでは、多様な技術を1つのフレームワークにまとめ、PhantomHunterと呼ばれる、ファインチューニングされた言語モデルの出力を検出できるという主張がある。

システムは、特定のファインチューニングされたモデルが前に遭遇したことがない場合でも機能するように設計されており、代わりに、元のベースモデルによって残された残留的な痕跡に依存している。著者はこれを「ファミリートレイト」と表現している。

テストでは、論文は、RoBERTaを含むゼロショットGPT-4ミニ評価を上回る強力な検出精度を報告している。システムは、テキストサンプルをモデルファミリーに戻すことができた。

これは、モデルがファインチューニングされるほど、その祖先についてより多くの情報を明らかにすることを示唆しており、プライベートファインチューニングが常にモデル起源を隠すという仮定に反する。代わりに、ファインチューニングプロセスは、正しく読み取れば、ゲームを暴露する検出可能な指紋を残す可能性がある。

論文では次のように述べられている。

‘[マシン生成テキスト]検出は一般に、LLM生成テキストと人間が書いたテキストを、2値分類によって区別する。既存の方法は、LLM間で共通のテキスト特徴を使用して表現学習によって学習するか、またはLLMの内部信号(例:トークン確率)に基づいて、人間とLLMテキストの間の区別可能なメトリックを設計する。

‘両方のカテゴリについて、そのテストは主に、パブリックに利用可能なLLMからのデータで実行され、ユーザーがパブリック、オフザシェルフのサービスを使用してテキストを生成することを前提としていた。

私たちは、この状況がオープンソースLLMコミュニティの最近の発展によって変化していることを主張する。 HuggingFaceのようなプラットフォームや、LoRAのような効率的なLLMトレーニング技術のおかげで、カスタマイズされたプライベートデータセットを使用してファインチューニングされたLLMを構築することは、以前よりもはるかに簡単になった。

‘例えば、HuggingFaceには60,000以上のLlamaベースの派生モデルがある。未知のコーパスでプライベートにファインチューニングされた後、ベースモデルの学習された特徴は変更され、LLMGT検出器は[失敗]し、悪意のあるユーザーがLLMGT検出器に検出されることなく有害なテキストをプライベートに生成できる新たなリスクを生み出す。

‘新しい課題が生じる:プライベートにチューニングされたオープンソースLLMによって生成されたテキストを検出する方法は?

方法と訓練

PhantomHunterシステムは、ファミリーアウェアな学習戦略を使用し、3つのコンポーネントを組み合わせる:特徴抽出器、既知のベースモデルからの出力確率を取得する;コントラストエンコーダー、ファミリー間を区別するために訓練される;および(以下に詳述する)、専門家の混合分類器、新しいテキストサンプルにファミリーレベルを割り当てる。

システムのスキーマ。PhantomHunterは、テキストサンプルを複数のベースモデルで処理して確率特徴を抽出し、それをCNNとトランスフォーマーレイヤーでエンコードする。モデルファミリーを推定してゲーティングウェイトを計算し、LLM生成テキストを予測するための専門家の混合モジュールを導く。訓練中にコントラストロスが適用され、モデルファミリー間の分離が改善される。

システムのスキーマ。PhantomHunterは、テキストサンプルを複数のベースモデルで処理して確率特徴を抽出し、それをCNNとトランスフォーマーレイヤーでエンコードする。モデルファミリーを推定してゲーティングウェイトを計算し、LLM生成テキストを予測するための専門家の混合モジュールを導く。訓練中にコントラストロスが適用され、モデルファミリー間の分離が改善される。 ソース:https://arxiv.org/pdf/2506.15683

PhantomHunterは、テキストを複数の既知のベースモデルを通じてパスし、各ステップで次の単語が出現する可能性を記録することで動作する。これらのパターンは、各モデルファミリーの特徴を学習するニューラルネットワークにフィードされる。

訓練中、システムは同じファミリーのテキストを比較し、それらをグループ化することを学び、異なるファミリーのものと区別することで、ファインチューニングされたモデルとそのベースモデル間の隠れた接続を特定するのに役立つ。

MOE

テキストが人間によって書かれたかAIによって生成されたかを判断するために、PhantomHunterは、専門家の混合システムを使用する。ここで、各「専門家」は、特定のモデルファミリーのテキストを検出するように調整されている。

システムがテキストが最も可能性の高いファミリーを推測した後、それを使用して各専門家の意見にどれだけの重みを付けるかを決定する。重み付けされた意見は、最終的な判断(AIまたは人間)を下すために組み合わされる。

システムの訓練には、複数の目的が含まれる:モデルファミリーを認識すること、AIテキストと人間のテキストを区別すること、そしてコントラスト学習を使用して異なるファミリーを区別すること。これらの目的は、調整可能なパラメータを介して訓練中にバランスが取られる。

ファミリー全体に共通するパターンに焦点を当てることで、PhantomHunterは、訓練時に見られなかったファインチューニングされたモデルを検出できるはずである。

データとテスト

テスト用のデータを開発するために、著者は、2つの最も一般的な学術シナリオに焦点を当てた。執筆の場合、Arxiv学術アーカイブから69,297の要約を収集し、主なドメインに分けた。質問と回答の場合、3つの科目(ELI5金融医学)にわたる2,062のペアを、HC3データセットからキュレーションした。

研究のためにキュレーションされたデータソースとその数の一覧。

研究のためにキュレーションされたデータソースとその数の一覧。

合計で、12のモデルがテストのために訓練された。3つのベースモデルは、LLaMA-2 7B-ChatMistral 7B-Instruct-v0.1、およびGemma 7B-itでした。これらのベースモデルから、9つのファインチューニングされたバリアントが生成され、それぞれがドメインまたは著者スタイルに特化していた。

評価データセットの統計。'FTドメイン'はファインチューニング中に使用されたドメインを指し、'ベース'はファインチューニングがなかったことを示す。

評価データセットの統計。’FTドメイン’はファインチューニング中に使用されたドメインを指し、’ベース’はファインチューニングがなかったことを示す。

合計で、3つのベースモデルがフルパラメータとLoRAの両方のテクニックを使用して、2つのシナリオ(学術的要約の執筆質問と回答)で3つの異なるドメインにわたってファインチューニングされた。

対抗フレームワークとして選択されたものは、RoBERTaT5-SentinelSeqXGPTDNA-GPTDetectGPTFast-DetectGPT、およびDeTeCtiveであった。

PhantomHunterは、2つの種類のニューラルネットワークレイヤーを使用して訓練された:3つの畳み込みレイヤーマックスプーリングを使用してローカルなテキストパターンを取得し、2つのトランスフォーマーレイヤーと4つのアテンションヘッドを使用して長距離の関係をモデル化する。

コントラスト学習のために、温度パラメータは0.07に設定された。

訓練目的は、3つの損失項の組み合わせで構成されていた:ファミリー分類のためのL1(重み1.0)と二値検出のためのL2(重み1.0)、およびコントラスト学習のためのL3(重み0.5)。

モデルは、Adamと学習率2e-5、バッチサイズ32を使用して最適化された。訓練は10エポックで行われ、検証セットを使用して最適なチェックポイントが選択された。すべての実験は、4つのNVIDIA A100 GPUを搭載したサーバーで実行された。

使用されたメトリックは、各テストサブセットのF1スコアと、商用検出器との比較のための真陽性率であった。

見えないファインチューニング言語モデルのテキストを検出するF1スコア。各カテゴリのトップ2の結果は太字と下線で示されている。'BFE'はベース確率特徴抽出を、'CL'はコントラスト学習を、'MoE'は専門家の混合モジュールを示す。

見えないファインチューニング言語モデルのテキストを検出するF1スコア。各カテゴリのトップ2の結果は太字と下線で示されている。’BFE’はベース確率特徴抽出を、’CL’はコントラスト学習を、’MoE’は専門家の混合モジュールを示す。

初期テストの結果は、上の表に示されており、PhantomHunterはすべてのベースラインシステムを上回り、人間が生成したテキストとマシンが生成したテキストの両方で90パーセントを超えるF1スコアを維持し、訓練に含まれていなかったファインチューニングされたモデルの出力でさえも検出することができた。

著者は次のように述べている。

‘フルファインチューニングの場合、PhantomHunterは、MacF1スコアをベースラインの最高値よりも3.65%と2.96%改善し、LoRAファインチューニングの場合、改善度はそれぞれ2.01%と6.09%であった。

‘結果は、PhantomHunterが見えないファインチューニングLLMによって生成されたテキストを検出するための強力な能力を実証している。

削除研究が実施され、PhantomHunterの各主要コンポーネントの役割を評価した。個々の要素を削除すると(たとえば、特徴抽出器、コントラストエンコーダー、または専門家の混合分類器)、精度の低下が一貫して観察された。これは、システムがすべてのコンポーネントの調整に依存していることを示している。

著者はまた、PhantomHunterが訓練データセットを超えて一般化できるかどうかを調べ、訓練中に存在しなかったベースモデルの出力に対してさえも、PhantomHunterが対抗する方法を上回ることを確認した。つまり、ファミリーレベルの署名は、ファインチューニングされたバリアント全体で検出可能のままである。

結論

ユーザーが訓練した生成的な言語モデルを支持する議論の1つは、少なくともこれらの小さなファインチューニングとLoRAが、作者の個性と特徴を保存することである。これは、AIチャットボットの汎用的な、SEOに最適化された口調が、AIが主要な、または支配的な貢献者となる言語を汎用化するのを脅かす中で、言語を保存することになる。

大学でのエッセイの価値が低下し、学生がAIを使用していないことを証明するために、巨大な書き込みセッションをスクリーンキャストするようになっているため、ヨーロッパ以外の地域(口頭試験が正常化されている地域)では、より多くの教師が、提出されたテキストではなく、対面試験を検討している。最近では、手書きの作業に戻すことが提案されている。

議論の余地はあるが、両方の解決策は、LLMベースのディープフェイクのアームズレースの再現よりも優れている。ただし、人間の労力と注意が必要になるが、これは現在、テクノロジー文化が自動化で除去しようとしているものである。

 

詳細については、ソース論文の主要な結果の後の最後のセクションを参照してください。

* 著者のインライン引用をハイパーリンクに変換したもの。著者のテキストの強調は私のものではない。

2025年6月19日木曜日に初めて公開されました

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai