AIモデルとプラットフォーム

ディープマインドのミケランジェロベンチマーク:長文脈LLMの限界を明らかにする

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)が進化を続ける中、長い情報のシーケンスを処理し、理解する能力はますます重要になっています。現在、AIシステムは、長いドキュメントの分析、長い会話の追跡、膨大なデータの処理などの複雑なタスクに使用されています。しかし、多くのモデルは長文脈の推論に苦労しています。入力が長くなるにつれて、重要な詳細を失い、正確性や一貫性のある結果が得られないことがあります。

この問題は、ヘルスケア、法務、金融などの業界で特に深刻です。ここでは、AIツールは詳細なドキュメントや長い会話を処理しながら、正確で文脈に応じた回答を提供する必要があります。共通の課題は、文脈の漂移です。モデルは新しい入力を処理するにつれて、以前の情報から注意を逸らすため、関連性のない結果になることがあります。

これらの限界を克服するために、ディープマインドはミケランジェロベンチマークを開発しました。このツールは、長文脈の推論をテストするために、LLMを厳しくテストします。以前のベンチマークと異なり、ミケランジェロベンチマークは、長いデータシーケンスを処理し、無関係な情報を除外するタスクに重点を置いています。

長文脈推論の理解

長文脈推論とは、AIモデルが長いテキスト、コード、または会話のシーケンスで一貫性と正確性を維持する能力です。GPT-4やPaLM-2などのモデルは、短いまたは中程度の長さの入力でよく機能します。しかし、長い文脈では苦労します。入力の長さが増加するにつれて、これらのモデルは重要な詳細を失い、理解、要約、または決定に誤りが生じることがあります。これは、文脈ウィンドウの限界として知られています。モデルが情報を保持して処理する能力は、文脈が長くなるにつれて低下します。

この問題は、現実世界のアプリケーションで重要です。例えば、法務サービスでは、AIモデルは数百ページに及ぶ契約書、事例研究、または規制を分析します。これらのモデルが長いドキュメントを効果的に処理して推論できない場合、重要な条項を逃したり、法的用語を誤解したりする可能性があります。これにより、不正確なアドバイスまたは分析が生じる可能性があります。ヘルスケアでは、AIシステムは数年または数十年にわたる患者記録、医療歴、治療計画を統合する必要があります。モデルが以前の記録からの重要な情報を正確に思い出すことができない場合、不適切な治療を勧めたり、患者の診断を誤ったりする可能性があります。

モデルが処理できる入力の長さを改善する努力が行われています(例:GPT-4は最大32,000トークン、約50ページのテキストを処理できます)。しかし、長文脈推論は依然として課題です。文脈ウィンドウの問題は、モデルが処理できる入力の量を制限し、全入力シーケンスを通じて正確な理解を維持する能力に影響します。これにより、文脈の漂移が生じ、モデルは新しい情報が導入されるにつれて以前の詳細を忘れたり混同したりします。これにより、モデルは一貫性と関連性のある出力を生成する能力が低下します。

ミケランジェロベンチマーク:概念とアプローチ

ミケランジェロベンチマークは、LLMが長いシーケンスで情報を保持して処理する能力をテストすることで、長文脈推論の課題に取り組みます。以前のベンチマークとは異なり、ミケランジェロベンチマークは、モデルが長いデータシーケンスを処理し、無関係な情報を除外するタスクに重点を置いています。

ミケランジェロベンチマークは、潜在的な構造クエリ(LSQ)フレームワークを使用してAIモデルをテストします。この方法では、モデルは大きなデータセットから有意義なパターンを見つける必要がありますが、無関係な情報を除外する必要があります。これは、人間が複雑なデータを分析して重要な情報に焦点を当てるのと似ています。ベンチマークは、自然言語とコードの2つの主要な分野に焦点を当てています。

重要なタスクの1つは潜在的なリストタスクです。このタスクでは、モデルはPythonリスト操作のシーケンス(例:要素の追加、削除、またはソート)を受け取り、正しい最終的なリストを生成する必要があります。タスクをより困難にするために、無関係な操作(例:リストの逆順または前の手順の取消)が含まれます。これにより、モデルは重要な操作に焦点を当てる能力がテストされ、AIシステムが関連性の混合された大きなデータセットを処理する能力をシミュレートします。

別の重要なタスクは、マルチラウンドの共参照解決(MRCR)です。このタスクでは、モデルは長い会話でオーバーラップまたは不明なトピックの参照を追跡する能力を測定します。課題は、モデルが会話の後半で行われた参照を以前のポイントにリンクする能力です。トピックがシフトしたり、無関係な詳細が含まれたりする会話を反映するため、モデルは正確に参照を追跡して一貫性のあるコミュニケーションを維持する必要があります。

さらに、ミケランジェロには、モデルが情報不足で質問に答えることができないことを認識する能力をテストするIDKタスクがあります。このタスクでは、モデルは質問に対する回答に必要な情報を含まないテキストが提示され、正しい回答は「わかりません」ということです。これは、AIの信頼性の重要な側面である不確実性を認識する能力を反映しています。

これらのタスクを通じて、ミケランジェロは単純なデータの取得を超えて、長文脈の入力の推論、統合、管理をテストします。長文脈推論のためのスケーラブルで合成されたベンチマークを提供し、LLMの現在の状態と将来の潜在能力をより正確に測定します。

AI研究と開発への影響

ミケランジェロベンチマークの結果は、AIの開発方法に重大な影響を及ぼします。ベンチマークは、現在のLLMがアーキテクチャ、特に注意メカニズムとメモリシステムの改善が必要であることを示しています。現在の多くのLLMは自己注意メカニズムに依存していますが、これは短いタスクでは効果的ですが、文脈が長くなるにつれて苦労します。これは、文脈の漂移の問題が生じ、モデルが以前の詳細を忘れたり混同したりする原因となります。解決策として、研究者はメモリを増強したモデルを探究しています。これらのモデルは、会話またはドキュメントの以前の部分からの重要な情報を保存して、必要に応じて呼び出すことができます。

別の有望なアプローチは、階層的な処理です。この方法により、AIは長い入力をより小さな、管理可能な部分に分割できます。各ステップで最も関連性の高い詳細に焦点を当てることができるため、モデルは複雑なタスクをよりうまく処理できます。情報の量が多すぎてモデルが圧倒されるのを防ぐことができます。

長文脈推論の改善は大きな影響を及ぼすでしょう。ヘルスケアでは、AIが患者記録をよりよく分析し、より正確な治療の勧告を行うことができるようになります。法務サービスでは、これらの進歩は、AIシステムが長い契約書や法的事例をより正確に分析し、弁護士や法的専門家により信頼性の高い洞察を提供できるようにするでしょう。

しかし、これらの進歩とともに、重大な倫理的懸念も生じます。AIが長い文脈をよりよく処理し、推論できるようになると、機密またはプライベートな情報が公開される可能性があります。これは、機密性が重要なヘルスケアやカスタマーサービスなどの業界で特に懸念されます。

AIモデルが以前のやり取りから多すぎる情報を保持する場合、将来の会話で個人情報を無意識に明らかにする可能性があります。また、AIがより長い形式のコンテンツを生成する能力が向上すると、より高度な誤情報やデザインフォメーションを作成する可能性もあり、AIの規制に関する課題がさらに複雑になる可能性があります。

結論

ミケランジェロベンチマークは、AIモデルが複雑な長文脈タスクを処理する能力についての洞察を明らかにし、その強みと限界を強調しています。このベンチマークは、AIの進化に伴い、革新を推進し、モデルアーキテクチャとメモリシステムの改善を促進します。ヘルスケアや法務サービスなどの業界を変革する可能性は興奮するものですが、倫理的責任も伴います。

プライバシー、誤情報、公平性の懸念は、AIが膨大な情報を処理する能力が向上するにつれて、解決される必要があります。AIの成長は、社会に思慮深く責任を持って利益をもたらすことに焦点を当てる必要があります。

Dr. アサド・アッバースは、パキスタンのCOMSATS University Islamabadの正教授です。彼は、ノースダコタ州立大学(アメリカ)から博士号を取得しました。彼の研究は、クラウド、フォグ、エッジコンピューティング、ビッグデータ分析、AIなどの先進技術に焦点を当てています。Dr. アッバースは、信頼できる科学雑誌や会議での発表により、著しい貢献をしています。また、MyFastingBuddyの創設者でもあります。