Andersonの視点

忘却的なAIに「その考えを保持する」を長期間にわたって教える

mm
Unite.AI を Google の優先ソースに追加
AI-generated image: A robot with ChatGPT logo at laptop, with vice on open head and glowing text emerging from head. GPT-image-1.

言語モデルはしばしば会話の開始部分を思い出すことができない。新しいテキスト圧縮方法によってこれが変化し、AIチャットセッションをはるかに weniger 怒りを感じるものにすることができる。

 

会話AIシステムであるChatGPTは、以前の会話の部分を忘れることがあり、自分自身を繰り返したり、以前の合意されたルールを無視した回答を与えることがある。

これは、LLM(Large Language Model)が注目する能力が限られているためで、これは「コンテキストウィンドウ」と呼ばれるもので、直接照らすことができるものと、隣接するオブジェクトのみを照らすことができるものに似ている。

このような「健忘症」の傾向を修正することは、言語ベースのAIモデルに関する研究の最も重要な方向の1つである。特に、LLMの有用性と一貫性のあるマルチターン会話の可能性を制限し、医療や法律などの精度が重要なコンテキストでLLMの有用性を制限するからである。

Crushing It

中国からの新しい研究は、AIモデルを実行するGPUの限られたリソースに大量のテキストを収めるための新しい方法を提案しており、20倍の圧縮改善を達成し、98%の精度を維持している。

コンテキストカスケード圧縮は、長いドキュメントを、ディープシークOCRなどの光学圧縮方法よりも、最大40倍の圧縮レベルでより正確に再構築する。

コンテキストカスケード圧縮は、長いドキュメントを、ディープシークOCRなどの光学圧縮方法よりも、最大40倍の圧縮レベルでより正確に再構築する。 ソース

このテキスト圧縮は、93%の精度で、40倍の圧縮比を達成することができる。

長いテキストを言語モデル入力に圧縮するための3つのアプローチ:ベースライン方法(左)がテキストを直接トークン化し、大量のトークンを生成する;光学ルート(中央)がテキストを画像に変換し、ビジョントランスフォーマーを使用して視覚的な埋め込みを抽出する;新しいC3方法(右)が小さな言語モデルを使用してテキストを32個の潜在的なトークンに圧縮する。

長いテキストを言語モデル入力に圧縮するための3つのアプローチ:ベースライン方法(左)がテキストを直接トークン化し、大量のトークンを生成する;光学ルート(中央)がテキストを画像に変換し、ビジョントランスフォーマーを使用して視覚的な埋め込みを抽出する;新しいC3方法(右)が小さな言語モデルを使用してテキストを32個の潜在的なトークンに圧縮する。

これは、長い会話の全体を圧縮して、後で会話の中で背景コンテキスト情報として再注入することができることを意味する。通常、LLMは以前の事実を忘れて「健忘症」のような行動をとることがあるが、この方法ではそれを防ぐことができる。

この圧縮方法はlossy圧縮方法ではあるが、情報の損失が発生する方法も有用である。新しい方法では、文の末尾で情報が損失するが、ディープシークOCRアーキテクチャのように、ランダムに情報が損失するのではなく、人間の記憶と同様の方法で情報が損失する。

上:人間の記憶がデータストリームの末尾で損失する;中:ディープシークOCRがランダムに損失する;下:新しい方法が人間の記憶と同様の方法で損失する。

上:人間の記憶がデータストリームの末尾で損失する;中:ディープシークOCRがランダムに損失する;下:新しい方法が人間の記憶と同様の方法で損失する。

これは、記憶されたデータがどこで信頼性が低いかを予測し、その知識を使用して問題を解決することができることを意味する。潜在的に、会話の再現と一貫性を大幅に改善することができる。

新しいアプローチは、コンテキストカスケード圧縮(C3)と呼ばれ、ディープシークOCRがテキストを画像として圧縮する方法に着想を得ている。しかし、2つの言語モデル(中規模と大規模)を使用して長いテキストを直接潜在的な埋め込みに圧縮することで、新しいアプローチは、レーサスター画像を使用することによるドラッグを排除し、パフォーマンスを向上させる。

論文では、次のように述べられている。

‘C3の優れたパフォーマンスは、その基本的なアーキテクチャ設計に帰することができる。ディープシークOCR分析は、そのパフォーマンスの低下は「複雑なレイアウト」と「低解像度での画像のぼけ」のような要因によるものであると仮定しているが、光学パスウェイの固有の限界である。’

‘私たちのC3パラダイムは、テキストドメインで直接操作することで、これらの視覚ドメインのアーティファクトに免疫である。テキストをピクセルにレンダリングし、それらのピクセルをエンコードすることによる情報の損失を避ける。代わりに、事前トレーニングされたLLMの強力なセマンティック理解を利用して、テキスト情報を効率的な潜在的な表現に直接抽出する。’

新しい論文は、コンテキストカスケード圧縮:テキスト圧縮の限界を探ると題されており、2人の著者によって提出されており、C3をオープンソースリポジトリとしてGitHubで提供している。

Method

新しいアプローチを理解するには、光学文字認識(OCR)とは何かを知る必要がある。これは、アイデアの出発点であるからである。

OCRは、1920年代に初めて提案されたが、1990年代に普及した、パターン認識を使用してコンピュータープログラムがレーサスター画像内のテキスト(選択できない写真のようなテキスト)を編集可能なテキストに変換するアルゴリズミック方法である。

ディープシークOCRの作成者は、OCRを中間ステージとして使用することで、標準的なパイプラインよりもテキストを圧縮できることを発見した。つまり、テキスト自体を圧縮するのではなく、レーサスター化されたテキストの圧縮によって、潜在的な埋め込みの密度(保存される情報の量)を大幅に増やすことができる。

ディープシークOCRリリース論文からの圧縮パイプラインのスキーマ。

ディープシークOCRリリース論文からの圧縮パイプラインのスキーマ。 ソース

新しい論文では、光学アプローチであるディープシークOCRが、圧縮の利点の源を誤って帰属させている可能性があると示唆している。光学的なアプローチの主な要因ではなく、テキストトークンをより効率的な潜在的な表現に変換することによる利点が主な要因であると示唆している。

これをテストするために、2つの言語モデルを使用してパイプラインを作成した。小さなQwen2.5 1.5Bモデルは、エンコーダーとして機能し、長い文章を小さなセットの潜在的なトークンに圧縮する。大きいQwen2.5 3Bモデルは、デコーダーとして機能し、元のテキストをそれらのトークンから再構築する。

新しいC3システムでは、小さなQwen2.5 1.5Bモデルが、訓練可能なクエリ埋め込みを使用して、長い入力を固定長の潜在的なトークンに圧縮する。

新しいC3システムでは、小さなQwen2.5 1.5Bモデルが、訓練可能なクエリ埋め込みを使用して、長い入力を固定長の潜在的なトークンに圧縮する。

圧縮ステージを処理するために、研究者は、訓練可能なクエリ埋め込みを導入して、事前トレーニングされたQwen2.5 1.5Bモデルを適応させた。抽象的なプロンプトが、モデルに長いコンテキストを小さな潜在的な表現に抽出することを導く。

アーキテクチャを変更するのではなく、長いテキストとクエリ埋め込みを一緒に単一の入力としてフィードする。モデルのセルフアテンションメカニズムは、これらの要素を同一に扱い、新しいレイヤーや設計の変更を必要とせずに、固定長の潜在的なコンテキストを出力する。出力は、再構築のために大きいモデルに渡される。

圧縮によってどれだけの情報が残るかを評価するために、研究者は、Qwen2.5 3Bデコーダーに、潜在的なトークンとプロンプト‘テキストを繰り返す’を使用して、元の入力を再構築するように指示した。タスクは、要約やパラフレーズではなく、正確な再現であったため、元のテキストからのあらゆる偏差は、圧縮によって失われた情報に直接帰することができた。

Data and Tests

論文では、著者が、インターネットから得た100万ページのOCR資料の独自のデータセットをコンパイルしたと述べられている。ただし、このソーシングについての詳細は明らかではなく、著者はこの点について故意に曖昧にしている。

それでも、データエンジニアリングとキュレーションは不要であり、著者は「さまざまな長さ」のサンプルでモデルを効果的にトレーニングできたと述べている。また、著者は、自分のアーキテクチャが堅牢(トレーニング設定によっては、汎化されている)であることを示唆している。

モデルは、8つのNVIDIA H800 GPUで構成される高性能クラスターでトレーニングされた。各GPUには80GBのVRAMが搭載されており、合計640GBのVRAMリソースが利用可能であった。各GPUには、バッチサイズ2が割り当てられ、16の蓄積ステップを考慮すると、合計バッチサイズ256が得られた。オプティマイザーは、AdamWで、合計40,000ステップでトレーニングされた。

C3アーキテクチャの有効性をテストするために、研究者は、Foxベンチマークを使用して、さまざまなドキュメント長と圧縮設定で圧縮と再構築の精度を評価した。

英語テキストが選択され、トークン化はQwenトークナイザーで実行された。パスは600から1300トークンの範囲で選択された。

公平な比較のために、光学ベースライン(ディープシークOCR)と同等の圧縮レベルが使用された。64と100の潜在的なトークンが使用された。方法の限界を探るために、32の潜在的なトークンのテストも実行された。すべての場合で、再構築は‘テキストを繰り返す’という指示で開始された。

初期テストの結果。7つのトークン範囲で、64と100の潜在的なトークンを使用して、再構築の精度と圧縮比を測定し、C3がディープシークOCRを上回ることを示した。

初期テストの結果。7つのトークン範囲で、64と100の潜在的なトークンを使用して、再構築の精度と圧縮比を測定し、C3がディープシークOCRを上回ることを示した。

論文では、次のように述べられている。

‘データは、C3の直接テキストから潜在的な圧縮パラダイムが、すべてのテスト条件で光学圧縮アプローチを上回ることを明確に示している。高忠実度コンテキスト圧縮の新しい最先端を確立している。’

ディープシークOCRは、圧縮が増加すると精度が低下し、最も極端なケースでは60%以下まで低下した。一方、C3は同じレベルの圧縮で損失が少なく、圧縮された入力が元のサイズの20分の1に縮小された場合でも、98%近くまで精度を維持した。

最も厳しいテストでは、テキストが32トークンに縮小された。ただし、モデルはほとんどの場合で、元のコンテンツを99%近くまで回復することができた。

32の潜在的なトークンでの再構築精度と圧縮比。最大40倍の圧縮レベルで、精度が93%以上であることを示した。

32の潜在的なトークンでの再構築精度と圧縮比。最大40倍の圧縮レベルで、精度が93%以上であることを示した。

最も極端な設定では、入力がほぼ40分の1のサイズに圧縮されたが、93%以上の精度で回復された。対照的に、以前の光学方法は、半分の圧縮レベルで約60%の精度に低下した。

著者は、次のように述べている††

‘これらの結果は、C3アーキテクチャの優位性を明確に示している。視覚モダリティ(例:画像解像度の限界、レイアウトの複雑さ)に固有の情報ボトルネックやアーティファクトを避けることで、方法は極端な圧縮をもたらし、情報損失を最小限に抑える。’

‘この激しいテストケースの結果は、私たちの主張を固める。直接テキストから潜在的な圧縮は、光学的な対象物よりも根本的に効率的で強力なパラダイムである。’

また、C3は「本の全体、広範な法的文書、または大規模なコードベースを、質問回答、要約、分析などのタスクのために処理するための新しい機能を解放する」ことができる、と結論付けている。

Conclusion

これは、最近出会った最も明確でアプローチ可能な論文の1つであり、少なくとも「コンテキストウィンドウ問題」に対する新しい攻撃方法を提供する可能性のある、称賛に値する核心アイデアがある。

LLMの多くのユーザーは、重要な情報やガイドラインを会話の中で定期的に「更新」する必要があることを、辛い経験から学んだことでしょう。会話の長さに応じて、長い会話の高圧縮バージョンを、自動的にLLMのコンテキストウィンドウに再注入するというアイデアは、従来の「健忘症」の問題に対する新しいアプローチである。

GPUの不足により、従来のコンピューターメモリ(DRAMなど)でさえも価格上昇している状況では、AIのホストハードウェアが将来大幅に改善される可能性は低い。したがって、このようなアプローチは、パフォーマンスを向上させるために必要となるかもしれない。

ただし、LLMが1時間以上の会話を維持し、会話の内容を最初から最後まで覚えることができると、よりよいことだろう。

 

* CLIインストールの指示は提供されているが、インストールを試みる時間がないため、リポジトリがコード完了であるかどうかは不明である。

2人の著者は、劉凡凡(Fanfan Liu)と邱海波(Haibo Qiu)とされている。カジュアルな調査によると、邱は現在、中国のテクノロジー企業、美団(Meituan)で研究者として働いており、劉は中国科学院の大学院生である。どちらも現在、論文をリストに載せていない。帰属が間違っている場合は、プロフィールから連絡してください。

†† 著者は、追加の質的テストを提供しているが、これらは最初の圧縮テストに比べてあまりにも明らかではないため、ここでは扱っていない。

2025年11月21日金曜日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai