ソートリーダー

LLMは実際にどれくらい複雑な問題を推論できるのか?

mm
Unite.AI を Google の優先ソースに追加

ジェネレーティブAIの導入と進化は、突然で激しいものだったので、実際にはこのテクノロジーが私たちの生活をどれだけ変えたかを完全に理解するのは難しい。

3年前まで戻ってみましょう。はい、AIはより普及し始めていましたが、少なくとも理論的にはそうでした。より多くの人がAIが何ができるかを知っていましたが、そこでもAIの能力についての大きな誤解がありました。何故か、このテクノロジーは同時に、実際に達成できることに対して、十分な信用と過大な信用の両方を与えられました。まだ、平均的な人は、AIが高度に特殊化されたタスクを実行している1つまたは2つの分野を指摘できましたが、それ以外のものは、まだ研究室にあったか、または存在しませんでした。

それを今と比較してみましょう。文章を書くことや質問をすること以外のスキルがない場合、世界は私たちの指先にある。私たちは、実際にユニークで驚くべき画像、音楽、映画を生成でき、それらは業界全体を混乱させることができます。私たちは、検索エンジンのプロセスを超高速化でき、正しく構成された質問を1つ聞くだけで、大学で学んだ学者か、平均的な3年生のように見えるページのカスタムコンテンツを生成できます。そうでなければ、これらの機能は、わずか1、2年前では、絶対に不可能と考えられていました。ジェネレーティブAIの分野は存在しましたが、まだ始まっていませんでした。

今日、多くの人々は、ChatGPT、Midjourney、またはその他のツールなどのジェネレーティブAIを実験しました。他の人はすでにそれらを日常生活に取り入れています。これらの進化のスピードは、ほとんど恐ろしいほど速いです。過去6ヶ月の進歩を考えると、間違いなく、次の数年間で何度も驚かされることになります。

ジェネレーティブAIの中で特に注目すべきツールは、Retrieval-Augmented Generation(RAG)システムのパフォーマンスと、特に複雑なクエリを推論する能力です。FRAMESデータセットの導入は、評価データセットの仕組みについて詳細に説明されており、現在の最先端技術と今後の進化の方向性を示しています。FRAMESの導入以来、すでに多くのプラットフォームが、難しいクエリを推論する能力で新しい記録を樹立しています。

FRAMESが評価するものと、さまざまなジェネレーティブAIモデルがどれほどよく実行されているかを見てみましょう。分散型とオープンソースのプラットフォームが、地位を維持しているだけでなく、Sentient Chatのように、ユーザーがAIモデルが達成できる驚くべき推論力を垣間見ることができるようになっています。

FRAMES as a Window into the GenAI Brain

FRAMESデータセットとその評価プロセスは、推論、論理的なつながり、複数の情報源からの重要な情報の取得、そしてそれらを論理的に結び付けて質問に答える能力を必要とする824の「マルチホップ」質問に焦点を当てています。質問には、2つから15個のドキュメントが必要で、さらに制約、数学的な計算と推論、時間ベースの論理の処理が含まれています。つまり、これらの質問は非常に難しく、実際には人間がインターネットで行うリアルな研究課題を表しています。私たちはこれらの課題に直面し、情報の散在する重要なピースをインターネットの情報源の中から探し出し、情報を結び付けて、新しい情報を計算して推論し、事実を正しい答えにまとめる必要があります。

研究者がデータセットを最初に公開してテストしたときに発見したのは、トップのGenAIモデルは、単一ステップの方法で回答する必要がある場合には、約40%の精度で正確性がありましたが、質問に回答するために必要なすべてのドキュメントを収集できる場合は、73%の精度で回答できることが分かりました。はい、73%は革命的ではありませんが、質問の内容を理解することで、数字はより印象的なものになります。

たとえば、特定の質問は次のとおりです: 「Kanye Westの曲「Power」にサンプリングされた曲のバンドリーダーはいつ生まれたのか?」人間はこの問題をどのように解決するでしょうか。人間は、Kanye Westの曲「Power」の歌詞を収集する必要があること、そして歌詞の中から別の曲がサンプリングされている部分を特定する必要があることを認識するでしょう。私たち人間は、歌に馴染みがなくても、別の曲がサンプリングされているときにそれを聞き出すことができます。

しかし、考えてみましょう: GenAIが別の曲を「聴き」ながら検出するには何が必要か。これは、実際に知的なAIをテストするための基本的な質問です。もし私たちが曲を見つけて、聴いて、サンプリングされた歌詞を特定できたとします。まだ、曲の名前、バンドの名前、バンドリーダーの名前、そしてその人の生年月日を調べる必要があります。

FRAMESは、現実的な質問に答えるために、膨大な量の思考プロセスが必要であることを示しています。ここで2つのことが考慮されます。

まず、分散型GenAIモデルの能力は、競争するだけでなく、結果を支配する可能性があるということです。多くの企業は、分散型方法を使用して処理能力を拡大し、ソフトウェアを大規模なコミュニティが所有するようにしているため、PerplexityやSentientのような企業がこのトレンドを牽引しています。FRAMESが最初に公開されたときの最初の精度記録を上回るほど優れたモデルを実行しています。

2つ目の要素は、これらのAIモデルのうち少数が分散型であり、オープンソースであるということです。たとえば、Sentient Chatは両方であり、初期のテストでは、オープンソースアクセスのおかげで、どれほど複雑な推論が可能かがわかります。上記のFRAMESの質問は、人間と同じ思考プロセスを使用して回答され、推論の詳細は確認できます。さらに興味深いのは、プラットフォームが、特定の視点とパフォーマンスを微調整できる複数のモデルで構成されていることです。たとえば、最近のモデル「Dobby 8B」は、FRAMESのベンチマークを上回り、プロクライプトとプロフリーダムの態度を開発し、モデルが情報を処理して回答を開発する際の視点に影響を与えることができます。

On the Horizon

これらの驚くべき進歩の鍵は、ここまでたどり着いたスピードです。私たちは、テクノロジーがこれまでに進化したスピードと同じくらい、将来的にもさらに速く進化することを認識する必要があります。分散型とオープンソースのGenAIモデルを特に見ると、システムの知能が私たちの知能を上回る重要なしきい値に達するのを見て、そしてそれが将来に何を意味するかを見てみることができます。

David Balabanは、17年以上のマルウェア分析とアンチウイルスソフトウェア評価の経験を持つコンピュータセキュリティ研究者です。Davidは、MacSecurity.net Privacy-PC.comプロジェクトを運営しており、これらは社会工学、 マルウェア、ペネトレーションテスト、脅威インテリジェンス、オンラインプライバシー、ホワイトハットハッキングを含む現代の情報セキュリティ問題についての専門家の意見を提供しています。Davidは、マルウェアのトラブルシューティングの強い背景を持っており、最近はランサムウェア対策に焦点を当てています。