AIモデルとプラットフォーム

トップAIモデルが長いドキュメントで迷う

mm
Unite.AI を Google の優先ソースに追加

ミュンヘン大学、ミュンヘンマシンラーニングセンター、Adobe (ADBE ) Researchの研究者による新しい研究によると、AI言語モデルには、驚くほどの弱点があることが明らかになった。研究チームの調査結果によると、最も高度なAIモデルでも、単純な単語マッチングに頼ることができない場合、情報を接続するのに苦労することが分かった。

AIの読解力の秘密の問題

長い研究論文の中で特定の詳細を見つけることを想像してみてください。スキャンしながら、さまざまなセクション間でメンタルなつながりを作りながら、必要な情報を組み立てるかもしれません。多くのAIモデルは、実際にはまったく異なる方法で動作します。代わりに、Ctrl+Fを使用するのと同様に、単語の完全な一致を見つけることに大きく依存しています。

研究チームは、NOLIMA(No Literal Matching)という新しいベンチマークを開発し、さまざまなAIモデルをテストしました。結果は、AIモデルが2,000語を超えるテキストを扱うと、パフォーマンスが急激に低下することを示しました。約6,000語(8,000トークン)に達すると、最も強力なモデルであるGPT-4oでも、通常の能力の半分以下にパフォーマンスが低下します。これには、GPT-4o、Gemini 1.5 Pro、Llama 3.3 70Bなどの主要モデルも含まれます。

医療研究者がAIを使用して患者記録を分析したり、法的チームがAIを使用して事件文書をレビューしたりする場合、AIが関連情報を見逃すと、重大な結果を招く可能性があります。

単語マッチングだけでは不十分

現在のAIモデルは、テキストを処理するために「注意メカニズム」と呼ばれるものを使用しています。このシステムは、AIがテキストのさまざまな部分に焦点を当て、単語とアイデアの関係を理解するのに役立ちます。短いテキストの場合、これは十分に機能します。ただし、研究によると、このメカニズムはテキストが長くなると圧倒され、特に単語の完全な一致に頼ることができない場合にそうです。

NOLIMAテストは、単語マッチングに頼るのではなく、コンテキストを理解する必要がある質問をAIモデルにしたことで、この限界を明らかにしました。結果は、モデルは短いテキストではうまく機能しますが、テキストの長さが増加すると、コンテキストを理解する能力が急激に低下することを示しています。推論タスク用に特別に設計されたモデルでも、長いドキュメントを扱うと、50%未満の精度でスコアしました。

単語マッチングのクレッチなしで、AIモデルは次のことに苦労しました:

  • 異なる用語を使用する関連概念を接続する
  • 複数ステップの推論パスをたどる
  • 重要なコンテキストの後に表示される関連情報を見つける
  • 無関係なセクションの誤解を招く単語マッチングを無視する

数字が物語る

研究の結果は、AIモデルが長いテキストを扱うときのパフォーマンスを明らかにしています。GPT-4oは、約6,000語(8,000トークン)までのテキストで最も強力なパフォーマンスを維持しました。ただし、長いテキストでは、パフォーマンスが低下しました。Gemini 1.5 ProやLlama 3.3 70Bなどの他のモデルは、2,000から8,000トークンの間で急激にパフォーマンスが低下しました。

パフォーマンスの低下は、複数の推論ステップを必要とするタスクでさらに明らかになりました。たとえば、モデルが2つの論理的なつながりを作る必要がある場合(たとえば、キャラクターが特定のランドマークの近くに住んでいたということと、そのランドマークが特定の都市にあったということ)、成功率は大幅に低下しました。研究によると、16,000トークンを超えるテキストでは、推論を改善するためのChain-of-Thought promptingなどのテクニックを使用していても、多段階の推論が特に困難になります。

これらの発見が特に注目に値するのは、AIモデルが長いコンテキストを扱う能力に関する主張に異議を唱えることです。多くのモデルは広範なコンテキストウィンドウをサポートすることを宣伝していますが、NOLIMAベンチマークは、有効な理解がこれらの理論的な限界に達する前に低下することを示しています。

ソース:Modarressi et al.

AIが森を見失うとき

これらの限界は、現実世界のアプリケーションでAIを使用する方法に重大な影響を及ぼします。法的AIシステムが事件法を検索する場合を考えてみましょう。検索クエリと異なる用語を使用しているため、関連する先例を見逃す可能性があります。代わりに、システムは検索用語と共有する単語が多いが、関連性の低い事件に焦点を当てる可能性があります。

検索と文書分析への影響は特に懸念されます。現在のAI駆動型検索システムは、Retrieval-Augmented Generation(RAG)というテクニックを頻繁に使用しています。システムが関連情報を含む文書を取得できたとしても、AIは文書の関連性を認識できない可能性があります。検索クエリと異なる用語を使用しているからです。代わりに、AIは検索用語と表面的な類似性があるが、関連性の低い文書に惹かれる可能性があります。

AIユーザーにとって、これらの発見はいくつかの重要な考慮事項を示唆しています:

まず、短いクエリとドキュメントはより信頼性の高い結果をもたらす可能性が高いです。長いテキストを扱う場合、重要なコンテキストを維持するために、それらを小さなセグメントに分割することが役立ちます。

次に、長いドキュメントの異なる部分間のつながりを作るようにAIに依頼する場合は、特に注意する必要があります。研究によると、AIモデルは、特に明らかなつながりがない場合、情報を組み立てるのに苦労します。

最後に、これらの限界は、人間の監視の継続的な重要性を強調しています。AIはテキストの処理と分析に強力なツールとなる可能性がありますが、複雑なドキュメントの重要なつながりを特定する唯一の手段として扱うべきではありません。人間が長いテキストを処理し、概念的なつながりを作る能力は、現在のAI能力を上回っています。

これらの発見は、AIテクノロジーの進歩が速いにもかかわらず、これらのシステムが情報を処理する方法は人間と大きく異なることを思い出させるものです。AIツールを効果的に使用するには、これらの限界を理解することが重要です。

次に何が来るのか

現在のAIモデルの長いテキストを処理する能力の限界を理解することは、AI開発の未来について重要な疑問を提起します。NOLIMAベンチマークの背後にある研究は、テキスト処理のための現在のアプローチが、特にモデルが長いパスを扱う方法において、根本的な改良が必要であることを示しています。

現在の解決策は部分的な成功しか示していません。推論を段階的に分解するChain-of-Thought promptingは、パフォーマンスをある程度改善するのに役立ちます。たとえば、このテクニックを使用すると、Llama 3.3 70Bは長いコンテキストを扱う能力が向上しました。ただし、16,000トークンを超えるテキストでは依然として不足しており、根本的な解決策が必要であることを示しています。

テキストを処理するために現在のAIモデルが使用している注意メカニズムを再考する必要があります。会話の中で重要なポイントを追跡するのと同様に、会話が長くなると、すべての重要なポイントを追跡するのが難しくなります。現在のAIモデルは、はるかに大きなスケールで同様の課題に直面しています。

将来を見て、研究者はいくつかの有望な方向性を模索しています。1つのアプローチは、単語マッチングを超えて、長いテキスト内の情報を組織化し、優先順位付けするための新しい方法を開発することです。人間が情報のメンタルマップを作成するのと同様に、単語の共有語彙ではなく、意味に基づいてアイデアを接続することです。

別の分野は、AIモデルが「潜在的なホップ」と呼ばれるものを処理する方法を改善することに焦点を当てています。現在のモデルは、特に長いテキストでは、これらのつながりを苦労していますが、新しいアーキテクチャがこのギャップを埋めるのに役立ちます。

現在AIツールを使用している人にとって、これらの発見はいくつかの実用的なアプローチを示唆しています:

長いドキュメントを扱う場合は、論理的なセグメントに分割することを検討してください。これにより、重要なコンテキストを維持することができます。たとえば、研究論文を分析する場合、方法と結果のセクションを一緒に維持することができます。これらは通常、関連する情報を含んでいます。

長いテキストを分析するようにAIに依頼する場合は、関心のある関係について具体的に指示してください。広範な質問ではなく、AIに特定の関係を探すように導きます。これにより、モデルの現在の限界を補うことができます。

最も重要なのは、長いテキストのAIの能力について現実的な期待を維持することです。AIツールは多くのタスクに非常に役立ちますが、複雑なドキュメントの重要なつながりを特定するための完全な置き換えとして扱うべきではありません。人間が長いテキストを処理し、概念的なつながりを作る能力は、現在のAI能力を上回っています。

この分野でのAI開発の将来は、課題と興奮の両方を伴います。AIの限界をよりよく理解するにつれて、長いテキストを真正に理解するAIシステムではなく、単に処理するだけのシステムを開発することができます。そうなるまで、AIを効果的に使用するには、現在の限界と強みの両方を認識する必要があります。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。