ソートリーダー
LLMの現在の問題に対処し、次のステップへ
現在、GPT-3、GPT-4、LaMDA、Bardなどの大規模言語モデル(LLM)が数十種類公開されており、その数は新しいモデルがリリースされるたびに増え続けています。LLMは人工知能を革命し、様々な業界で技術と人間のやり取りを完全に変化させました。これらのモデルは多数の人間の言語データセットから学び、新しいイノベーション、創造性、効率性の道を開きました。
しかし、大きな力には大きな複雑さが伴います。LLMには、最大限に活用する前に解決しなければならない固有の課題と倫理的な問題があります。例えば、スタンフォード大学の最近の研究では、ChatGPT-4が人種や性別を暗示する名前が含まれるクエリにどのように対応するかを調査し、人種や性別に関する偏見が見られました。この研究では、Jamal Washingtonという名前の人物が売っている使用済み自転車の価格についてのアドバイスを求めましたが、Logan Beckerという名前の人物が売っている場合よりも価格が大幅に低くなっていました。これらの発見が明らかになるにつれて、LLMの課題に対処する必要性はさらに高まります。
LLMの共通の懸念を軽減する方法
偏見
LLMで最もよく議論される問題の1つは偏見と公平性です。最近の研究では、専門家が4つの最近公開されたLLMをテストし、それらすべてが事実に基づいていない男女に関する偏った仮定を表明していることがわかりました。この文脈では、偏見とは、歴史的または構造的な力関係の不均衡により、異なる社会グループ間で不均等な扱いまたは結果が生じることを指します。
LLMでは、偏見はデータの選択、作成者の人口統計、言語または文化の偏りによって引き起こされます。データの選択による偏見は、LLMのトレーニングに使用されるテキストがウェブで使用される言語の多様性を完全に表していない場合に発生します。広範囲にわたるが限られたデータセットでトレーニングされたLLMは、既存のテキストに含まれる偏見を継承する可能性があります。作成者の人口統計では、特定の人口統計グループが他のグループよりも頻繁に強調されるため、偏見を減らすためにコンテンツの作成における多様性と包括性の必要性を示しています。例えば、ウィキペディアは、LLMのトレーニングデータの一般的なソースであり、編集者の男女比が84%の男性であると報告されています。これは、言語と文化の偏りにも見られるものです。LLMのトレーニングに使用される多くのソースは、英語中心の偏りがあり、他の言語や文化に常に正確に翻訳されるとは限りません。
LLMがフィルタリングされたデータでトレーニングされることが重要であり、データに一致しないトピックを抑制するガードレールが必要です。1つの方法は、データ増強ベースの技術を使用することです。トレーニングデータに表現されていないグループからの例を追加することで、データセットの多様性を高めることができます。別の軽減戦略は、データのフィルタリングと再加重です。これは、既存のデータセット内で特定の表現されていない例を正確にターゲットにすることに重点を置いています。
幻覚
LLMの文脈では、幻覚とは、文法的に正しく、意味のあるように見えるが、事実の正確さやソース資料の意図から逸脱するテキストの生成を指します。実際、最近の報告では、ミネソタ州の法案に関する訴訟がLLMの幻覚の影響を受けていることがわかりました。法案を支持するために提出された宣誓書には、ChatGPTまたは他のLLMによって幻覚された可能性のある、実在しないソースが含まれていることがわかりました。これらの幻覚は、LLMの信頼性を低下させる可能性があります。
幻覚には3つの主な形式があります:
- 入力と矛盾する幻覚:LLMの出力がユーザーの提供した入力、つまりタスクの指示や処理する必要のあるコンテンツから逸脱する場合に発生します。
- コンテキストと矛盾する幻覚:LLMは、長い対話や複数のやり取りを含むシナリオで、内部的に矛盾する応答を生成する可能性があります。これは、モデルがコンテキストを追跡したり、複数のやり取りで一貫性を維持したりする能力に欠陥があることを示唆しています。
- 事実と矛盾する幻覚:LLMが既存の事実に反するコンテンツを生成する場合に発生する幻覚です。このようなエラーの原因は多様であり、LLMのライフサイクルの中でさまざまな段階で発生する可能性があります。
この現象に寄与する要因としては、知識の不足、トレーニングデータ内の偏見、またはLLMの生成戦略の「幻覚の雪球化」などがあります。
幻覚を軽減する方法はありますが、LLMの特徴であるため完全に除去することはできません。幻覚の軽減には、事前トレーニング中のデータの手動による精査(フィルタリング技術を使用)や、ファインチューニング(トレーニングデータのキュレーション)が有効です。しかし、最も費用対効果が高く制御可能な解決策は、推論中の軽減です。
プライバシー
インターネットの普及により、個人情報やその他のプライベートデータへのアクセスが容易になり、広く認知される懸念事項となりました。ある研究では、80%のアメリカ人消費者が、自分のデータがAIモデルをトレーニングするために使用されていることを心配していることがわかりました。最も著名なLLMはウェブサイトから得られるため、プライバシー上のリスクをもたらす可能性と、LLMにとって未解決の問題であることを考慮する必要があります。
LLMが個人情報を配布しないようにする最も直接的な方法は、トレーニングデータからその情報を除去することです。しかし、LLMに使用されるデータの量が膨大であるため、すべてのプライベート情報が除去されることを保証することはほぼ不可能です。外部で開発されたモデルに依存する組織にとって、もう1つの一般的な代替策は、ChatGPTのようなサービスではなく、オープンソースのLLMを選択することです。
このアプローチでは、モデルを内部にデプロイすることができます。ユーザーのプロンプトは、サードパーティのサービスに公開されるのではなく、組織のネットワーク内で安全に保たれます。ただし、これにより、機密データの漏洩のリスクが大幅に減少しますが、複雑さが大幅に増加します。プライベートデータの保護を完全に保証することは困難であるため、アプリケーションの開発者は、これらのモデルがユーザーにリスクをもたらす可能性を考慮することが重要です。
LLMの次のフロンティア
LLMのリスクを軽減し続けるにつれて、LLMエージェントのブレークスルーを期待できます。すでに、HやRunner Hなどの企業が最初の製品をリリースし始めています。純粋な言語モデルからエージェントアーキテクチャへの移行は、AIシステム設計の変化を表します。業界は、チャットインターフェイスやシンプルな生成の限界を超えて進化します。これらの新しいエージェントフレームワークは、複雑な目標を原子的なサブタスクに分解する高度なプランニングモジュールを備え、エピソードメモリを使用してコンテキストに基づく推論を行い、明確に定義されたAPIを介して専用ツールを活用します。これにより、タスクの自動化がより強力なアプローチで実現します。アーキテクチャの進化は、従来のLLM実装におけるタスク、推論、ツール統合、実行モニタリングに関する一般的な課題を軽減するのに役立ちます。
LLMに加えて、小規模な言語モデルへのトレーニングにも焦点が当てられるようになります。これは、コスト効率が高く、導入が容易であるためです。例えば、ドメイン固有の言語モデルは特定の業界や分野に特化しています。これらのモデルは、ドメイン固有のデータと用語で微調整されており、精度が重要な医療や法律などの複雑で規制された環境に最適です。このターゲットアプローチにより、一般目的のモデルが専門的なコンテンツに直面したときに生じる可能性のあるエラーと幻覚の可能性が低減されます。
LLMの新しいフロンティアを探求し続けるにつれて、イノベーションの境界を押し広げ、開発と展開に関連する潜在的なリスクを軽減することが重要です。偏見、幻覚、プライバシーに関する課題を最初に特定し、積極的に対処することで、LLMが様々な分野で繁栄するためのより強固な基礎を創造できます。












