ソートリーダー

LLMのベンチマーク

mm
Unite.AI を Google の優先ソースに追加

LLMのパフォーマンス評価におけるベンチマークの役割と限界を理解する。ロバストなLLMを開発するためのテクニックを探索する。

大規模言語モデル(LLM)は近年大きな注目を集めています。LLMの人間の言語コマンドを理解する能力は、ビジネスに最適な統合となり、重要なワークフローをサポートし、タスクを最大限に効率化しました。さらに、平均的なユーザーの理解を超えて、LLMはより多くのことができます。私たちのLLMへの依存が増すにつれて、正確性と信頼性を確保するための措置に注目する必要があります。これは、全機関に関わる世界的なタスクですが、ビジネスの分野では、LLMのパフォーマンスをさまざまなドメインで評価するために使用できるいくつかのベンチマークがあります。これらは、モデルの理解、論理的推論、数学などの能力をテストし、結果はLLMがビジネスへの展開に適しているかどうかを決定します。

この記事では、LLM評価の最も人気のあるベンチマークの包括的なリストをまとめました。各ベンチマークについて詳細に説明し、さまざまなLLMが評価基準に対してどのように対応するかを見ていきます。但し、まずLLM評価についてより詳細に理解しましょう。

LLM評価とは何か

他のAIモデルと同様に、LLMもパフォーマンスのさまざまな側面を評価するための特定のベンチマークに対して評価される必要があります。標準的な評価では、以下の点が含まれます。

  1. ユーザー クエリの理解: モデルの幅広いユーザー入力に対する正確な理解と解釈能力を評価します。
  2. 出力の検証: AIが生成した回答を信頼できる知識ベースに対して検証し、正確で関連性があることを確認します。
  3. ロバスト性: 不明確、不完全、またはノイズのある入力に対してモデルのパフォーマンスを測定します。

LLM評価により、開発者は制限を効率的に特定して対処でき、ユーザー エクスペリエンスの全体的な向上につながります。LLMが徹底的に評価されれば、実際のアプリケーションに対応できるだけの精度とロバスト性を備え、不明確または予期せぬ入力にも対応できるようになります。

ベンチマーク

LLMは今までで最も複雑な技術の1つであり、最も複雑なアプリケーションにも対応できるため、その評価プロセスは同様に複雑でなければなりません。ベンチマークでは、特定のデータセット、メトリック、評価タスクを使用してLLMのパフォーマンスをテストし、さまざまなLLMを比較して精度を測定することができます。これにより、業界の進歩が促進され、パフォーマンスが向上します。

LLMのパフォーマンスの最も典型的な側面は以下のとおりです。

  • 知識: モデルの知識はさまざまなドメインでテストされる必要があります。知識ベンチマークは、モデルのさまざまな分野からの情報を効果的に回収する能力を評価します。
  • 論理的推論: モデルの論理的推論能力をテストすることを意味します。日常の知識と論理的推論に基づいて最も妥当な続きや説明を選択するシナリオが含まれます。
  • 読解力: モデルは自然言語の解釈と応答の生成において優れている必要があります。テストでは、パッセージに基づく質問に答えることで、理解、推論、詳細の保持を評価します。
  • コード理解: モデルのコードの理解、記述、デバッグ能力を測定するために必要です。これらのベンチマークでは、モデルにコード関連のタスクまたは問題を提示し、正確に解決する能力を評価します。
  • 世界の知識: モデルの世界に関する一般的な知識を評価するために使用されます。これらのデータセットには、正解するために広範な百科事典的知識を必要とする質問が含まれます。

「知識」ベンチマーク

MMLU(マルチモーダル言語理解)

このベンチマークは、人文科学、社会科学、歴史、コンピュータ科学、法学など、さまざまなトピックの事実的知識をLLMが把握しているかどうかをテストするために設計されています。57の質問と15,000のタスクがあり、モデルがさまざまなトピックで推論能力を発揮するかどうかを確認します。

最近、MMLUはLLMの高度な推論と知識を評価するための重要なベンチマークとなりました。開発者は、MMLUで他のモデルを上回るようにモデルを最適化しようとします。GPT-4-omniは88.7%、Claude 3 Opusは86.8%、Gemini 1.5 Proは85.9%、Llama-3 70Bは82%というスコアを達成しています。小規模モデルは通常、60〜65%を超えることはありませんが、Phi-3-Small-7bは75.3%という成績を残しています。

GPQA(大学院レベルのGoogle-Proof Q&Aベンチマーク)

このベンチマークは、448の質問からなるデータセットを使用して、LLMの論理的推論能力を評価します。生物学、物理学、化学などのトピックをカバーし、ドメインの専門家によって開発されています。

コードベンチマーク

HumanEval

HumanEvalは、164のプログラミング問題で構成され、LLMの基本的なコーディング能力をテストするために設計されています。pass@kメトリックを使用して、生成されたコードの機能的精度を評価します。

MBPP(Mostly Basic Python Programming)

MBPPベンチマークは、1,000のクラウドソーシングされたPythonプログラミング問題で構成されています。これらの問題はエントリーレベルの問題であり、基本的なプログラミングスキルに焦点を当てています。

数学ベンチマーク

大規模言語モデルは標準的な応答を構造化するのが得意ですが、数学的推論は大きな課題です。なぜなら、質問の理解、論理的推論、正しい答えを導き出す能力が必要になるからです。

GSM8K:人気の数学ベンチマーク

GSM8Kは、基本的な計算を実行する必要がある中学校レベルの数学問題8,500問で構成されています。GPT-4モデルは96.5%のスコアを達成していますが、DeepSeekMATH-RL-7Bは88.2%です。

The Math Dataset:包括的な代替

The Math Datasetは、GSM8Kの限界を解決するために開発されました。このデータセットはより広範囲にわたり、初等数学から高校、さらには大学レベルの問題までカバーしています。

読解力ベンチマーク

RACE(試験からの読解力データセット)

RACEベンチマークには、12〜18歳の中国人中学生の英語試験から収集された約28,000のパッセージと100,000の質問が含まれています。

DROP(段落上の離散的推論)

別の重要なアプローチは、段落上の離散的推論を実行するモデルを挑戦させるDROP(Discrete Reasoning Over Paragraphs)です。96,000の質問で構成されており、LLMの推論能力をテストします。

常識ベンチマーク

HellaSwag(Harder Endings、Longer contexts、Low-shot Activities for Situations With Adversarial Generations)

HellaSwagは、与えられたシナリオの最も妥当な続きを予測するモデルの能力をテストするために設計されています。

Openbook

Openbookデータセットには、5957の小学校レベルの科学の多肢選択問題が含まれています。これらの質問は、オープンブック試験から収集され、人間の主題理解を評価するために開発されています。

ベンチマーク aloneはLLMのパフォーマンス評価に十分か

はい、ベンチマークは標準化されたアプローチを提供し、LLMのパフォーマンスを評価するために使用できますが、誤解を招く可能性もあります。Large Model Systems Organizationによると、優れたLLMベンチマークは拡張可能で、新しいモデルを比較的小さな数の試行で評価でき、すべてのモデルに一意のランキング順序を提供できなければなりません。しかし、ベンチマークだけでは十分ではない理由がいくつかあります。

ベンチマーク漏洩

ベンチマーク漏洩は、トレーニングデータとテストデータが重複するときに発生し、誤った評価につながります。モデルがすでにトレーニング中にいくつかのテスト質問に遭遇した場合、その結果はモデルの真の能力を正確に反映しない可能性があります。

評価バイアス

LLMベンチマークのランキングは、さまざまなタスクでのLLMのパフォーマンスを比較するために使用されます。ただし、これらのランキングに頼ることは、モデル比較のために誤解を招く可能性があります。質問の順序などのベンチマークテストの単純な変更は、モデルのランキングを最大8つの位置までシフトできます。

オープンエンドネス

実際のLLMのやり取りには、望ましいAI出力を生成するためのプロンプトの設計が含まれます。LLMの出力はプロンプトの有効性に依存し、ベンチマークはLLMのコンテキスト認識をテストするように設計されています。ベンチマークは、コンテキスト認識をテストするように設計されていますが、常に実際のパフォーマンスに直接翻訳されるわけではありません。

ロバストなLLMのための効果的な評価

したがって、ベンチマークだけでは常に最善の選択肢ではないことがわかりました。しかし、他の方法もあります。

カスタムベンチマーク

これらは、タスク固有のシナリオでの特定の動作や機能をテストするのに最適です。たとえば、LLMが医療担当者向けに設計されている場合、医療設定からのデータセットは実際のシナリオを効果的に表現します。これらのカスタムベンチマークは、ドメイン固有の言語理解、パフォーマンス、ユニークなコンテキスト要件に焦点を当てることができます。

データ漏洩検出パイプライン

評価の完全性を示すには、データ漏洩のないベンチマークパイプラインが重要です。データ漏洩は、ベンチマークデータがモデルの事前トレーニングコーパスに含まれているときに発生し、人工的に高いパフォーマンススコアにつながります。これを避けるには、ベンチマークを事前トレーニングデータと交差検証し、以前に見た情報を避ける手順を実行する必要があります。

人間による評価

自動メトリックだけでは、モデルのパフォーマンスの全スペクトルを捉えることはできません。特に、言語理解と生成のニュアンスがあり、主観的な側面についてはそうです。ここで、人間による評価がより包括的な評価を提供します。

  • 専門家の雇用: 特定のドメイン、特に専門分野について、詳細で信頼性の高い評価を提供できる専門家を雇用します。
  • クラウドソーシング: Amazon Mechanical Turkなどのプラットフォームを使用して、迅速かつ低コストで多様な人間の判断を収集します。
  • コミュニティフィードバック: ユーザーがモデルを比較して投票できるプラットフォーム、たとえばLMSYSリーダーボードアリーナを使用して、さらに洞察を追加します。

結論

評価とベンチマークなしでは、LLMが実際のタスクをどのくらい正確に、適切に処理できるかを判断する方法がないでしょう。ただし、ベンチマークは完全に信頼できる方法ではありません。ベンチマークはパフォーマンスのギャップにつながり、ロバストなLLMの開発を遅くする可能性があります。

理想的な世界では、LLMはユーザーのクエリを理解し、プロンプトのエラーを特定し、タスクを指示通りに完了し、信頼性の高い出力を生成します。結果はすでに素晴らしいものですが、理想的ではありません。これが、タスク固有のベンチマーク、人間による評価、ベンチマーク漏洩の検出が非常に役立つ理由です。これらのテクニックを使用することで、実際にロバストなLLMを生成する機会が得られます。

イリーナ・バルスカヤ博士は、10年以上の経験を持つ優秀なデータサイエンティストで、製品分析と最新技術の分析を担当しています。彼女は、サウジアラビア初の完全に機能するローカライズされたAIベースの音声アシスタントであるヤスミナの作成と分析を主導し、現代標準アラビア語とサウジアラビア方言の複雑なデータローカライズとラベル付けを担当しました。現在、イリーナはヤンデックスの品質分析を担当し、AI技術の進歩を推進しています。