AIモデルとプラットフォーム

オープンソースとクローズドソースの言語モデル:技術分析

mm
Unite.AI を Google の優先ソースに追加

大規模言語モデル(LLM)は、近年、AIコミュニティを魅了し、自然言語処理の分野でブレークスルーをもたらしてきました。ただし、その背後には、オープンソースとクローズドソースのどちらが適切かという複雑な議論があります。

この記事では、オープンソースとクローズドソースのアプローチの技術的な違いを分析し、各アプローチの機会と限界を理解します。以下の主要な側面について説明します。

  • オープンソースとクローズドソースLLMの定義
  • アーキテクチャの透明性とカスタマイズ性
  • パフォーマンスベンチマーク
  • 計算要件
  • アプリケーションの多様性
  • アクセシビリティとライセンス
  • データプライバシーと機密性
  • 商業的バックアップとサポート

最後に、オープンソースとクローズドソースLLMの技術的なトレードオフについて十分な理解を得ることができ、AI戦略を導くことができます。では、始めましょう。

オープンソースとクローズドソースLLMの定義

オープンソースLLMは、モデルアーキテクチャ、ソースコード、重みパラメータが公開されています。これにより、研究者は内部を調査し、品質を評価し、結果を再現し、カスタムバリアントを構築できます。AnthropicのConstitutionalAI、MetaのLLaMA、EleutherAIのGPT-NeoXが代表的な例です。

一方、クローズドソースLLMは、モデルアーキテクチャと重みを独自の資産として扱います。Anthropic、DeepMind、OpenAIなどの企業が内部で開発しています。コードや設計の詳細が公開されていないため、再現性とカスタマイズ性が制限されます。

アーキテクチャの透明性とカスタマイズ性

オープンソースLLMの内部にアクセスすることで、カスタマイズの機会が広がります。これは、クローズドソースの代替手段では不可能です。

研究者は、モデルアーキテクチャを調整して、ニッチタスクのパフォーマンスを向上させることができます。重みパラメータにアクセスすることで、事前トレーニングされたビルディングブロックを転送学習することができます。

このカスタマイズ性により、オープンソースLLMは、バイオメディカル研究、コード生成、教育などの特殊なドメインで優れたパフォーマンスを発揮できます。ただし、プロダクション品質の実装を提供するには、専門知識が必要です。

クローズドソースLLMは、カスタマイズ性が制限されていますが、内部研究と開発に多大なリソースを投入しています。結果として、一般的な自然言語タスクで優れたパフォーマンスを発揮します。

パフォーマンスベンチマーク

オープンソースLLMのパフォーマンスを測定するには、複数の構成とチューニング戦略が可能であるため、課題があります。

クローズドソースLLMは、明確に定義されたパフォーマンス目標を備えており、バックアップ企業がベンチマークと特定のメトリックしきい値を公表しています。

ただし、これらのベンチマークは、実世界のタスクでのパフォーマンスを過大評価し、失敗を軽視していると批判されています。真正なベンチマークの評価は、オープンソースとクローズドソースの両方で、未解決の研究課題です。

計算要件

大規模言語モデルのトレーニングには、膨大な計算リソースが必要です。OpenAIは、GPT-3をトレーニングするために数百万ドルを費やしました。

このようなモデルをトレーニングする費用は、個人や小規模チームにとっては、オープンソースコミュニティから除外されます。EleutherAIは、GPT-Jモデルを公開アクセスから削除することを余儀なくされました。

ボランティアによる計算リソースの提供により、オープンソースLLMは成功を収めています。LAIONは、クラウドソーシングされたデータを使用して、LAION-5Bモデルを開発しました。

大規模なテクノロジー企業のバックアップにより、クローズドソースLLMは、開発とメンテナンスのための多大なリソースを得ることができます。DeepMindの280億パラメータのGopherモデルは、オープンソースの努力では達成不可能なスケールです。

アプリケーションの多様性

オープンソースLLMのカスタマイズ性により、特化したユースケースに取り組むことができます。研究者は、モデル内部を大幅に変更して、タンパク質構造予測、コードドキュメンテーション生成、数学的証明検証などのニッチタスクでパフォーマンスを向上させることができます。

ただし、コードにアクセスして編集することは、データの品質と充実度に依存します。特化したアプリケーション向けの包括的なトレーニングデータセットを整備して維持するには、多大な労力が必要です。

クローズドソースLLMは、内部リポジトリと商業パートナーからトレーニングデータを取得することで、より幅広いアプリケーションに適応できます。DeepMindは、ChEMBLやUniProtなどのデータベースをライセンスして、化学やタンパク質などの分野でモデルを拡張しています。

アクセシビリティとライセンス

オープンソースLLMのライセンスは、自由なアクセスとコラボレーションを促進します。GPT-NeoX、LLaMA、Jurassic-1 Jumboなどのモデルは、クリエイティブコモンズやApache 2.0ライセンスを使用して、非商用研究と公平な商業化を可能にします。

一方、クローズドソースLLMは、制限的なライセンスを持ち、モデルへのアクセスを制限しています。企業は、予測APIやエンタープライズパートナーシップからの潜在的な収益ストリームを保護するために、モデルへのアクセスを厳しく制限しています。

AnthropicやCohereは、ConstitutionalAIやCohere-512へのアクセスを有料化しています。ただし、これにより、重要な研究分野が価格設定によって排除される可能性があり、開発が十分な資金を得た業界にのみ焦点を当てているとみなされる可能性があります。

データプライバシーと機密性

LLMのトレーニングデータセットは、通常、ウェブページ、科学記事、ディスカッションフォーラムなどのオンラインソースからのコンテンツを集めたものです。これにより、モデル出力に個人情報や機密情報が含まれる可能性があります。

オープンソースLLMの場合、データセットの構成を調査することで、機密性の問題に対する最良のガイドラインを提供できます。データソース、フィルタリング手順、テスト中に見つかった懸念事項を文書化することで、脆弱性を特定することができます。

クローズドソースLLMは、内部レビュープロセスに依存する必要があります。Azure Cognitive Servicesは、個人データをフィルタリングすることを約束していますが、Googleは、正式なプライバシーレビューとデータラベル付けを実施しています。

商業的バックアップとサポート

クローズドソースLLMは、莫大な商業的投資を得ることができます。Microsoftは、GPTモデルに関するOpenAIとの多億ドル規模のパートナーシップに合意しました。

一方、オープンソースLLMは、ボランティアの時間や限定的な資金提供に頼っています。これにより、プロジェクトの継続性と長期的な存続が危険にさらされます。

ただし、商業化の障壁は、オープンソースコミュニティが科学的進歩に焦点を当てる自由を与えます。分散化されたオープンエコシステムは、単一のバッカーの持続的な関心に依存しないことを意味します。

オープンソースとクローズドソースLLMのランドスケープをナビゲートする

オープンソースとクローズドソースLLMの選択は、組織の優先事項とモデル機能を一致させる必要があります。

研究者やスタートアップ企業にとって、オープンソースは、特定のタスクに合わせてモデルを調整するためのより大きなコントロールを提供します。ライセンスは、コラボレーター間での洞察の共有を促進します。ただし、トレーニングデータとインフラストラクチャの取得の負担は、実用的には実現不可能になる可能性があります。

一方、クローズドソースLLMは、多大な品質の向上を約束しますが、モデルへのアクセスと変更が制限されるため、科学的透明性が低下します。また、ベンダーのロードマップに従う必要があります。

実際には、オープンソースとクローズドソースの両方のアプローチの欠点を補うために、共通の基盤を共有することが重要です。GoogleのTransformerやOxfordのREALTOベンチマークは、再現性を高めます。ONNXのような相互運用性の標準により、オープンソースとクローズドソースのコンポーネントを組み合わせることができます。

最終的に、どのツールを選択するかは、タスクの性質によって決まります。クローズドソースLLMをバックアップする企業の影響力は否定できませんが、オープンソースコミュニティの情熱と原則は、AIの進歩を推進する上で重要な役割を果たすでしょう。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。