ソートリーダー
ジェネレーティブAIの時代におけるオープンソースの再考

オープンソースモデル – ソフトウェア開発におけるエチオスであり、ソースコードが自由に再配布または改変される – は、長年にわたりイノベーションの原動力となってきた。1983年にリチャード・ストールマンというソフトウェア開発者が、クローズドソースのプリンターのブラックボックス性に苛立ったときに、この理想は生まれた。
彼のビジョンはフリーソフトウェア運動を生み出し、今日のインターネットとソフトウェアイノベーションの多くを支えるオープンソースエコシステムの道を切り開いた。
しかし、それは40年以上前のことである。
今日、ジェネレーティブAIは、独自の技術的および倫理的課題をもたらしており、オープンソースのパラダイムを再検討することを要求している – それを放棄するのではなく、それを適応させるためである。
AIとオープンソースの自由
オープンソースソフトウェアの4つの基本的な自由 – ソフトウェアコードを実行、研究、改変、再配布する能力 – は、ジェネレーティブAIの性質と相反する点が複数ある:
- 実行: AIモデルは、非常に高額なインフラストラクチャと計算コストを必要とするため、アクセスが制限されることが多い。
- 研究と改変: AIモデルは非常に複雑であるため、コードとデータにアクセスできないと、理解し、改変することが大きな課題となる。
- 再配布: 多くのAIモデルは、再配布を制限するように設計されている、特にトレーニング済みの重みとプロプライエタリデータセットを持つものである。
これらの基本的な原則の侵食は、悪意のある意図によるものではなく、現代のAIシステムの複雑さとコストによるものである。実際、最新のAIモデルをトレーニングするための費用は、近年急激に増加している – OpenAIのGPT-4は、7,800万ドルのトレーニングコストがかかったと報告されており、1億ドルを超える総費用がかかっている。
「オープンソース」AIの複雑さ
真にオープンなAIモデルは、推論ソースコード、トレーニングソースコード、モデル重み、トレーニングデータの完全な透明性を必要とする。しかし、多くのモデルは「オープン」というラベルが付いているにもかかわらず、推論コードまたは部分的な重みのみを公開している場合があり、または商用利用を制限している場合もある。
この中立的なオープン性は、オープンソースの原則の幻想を生み出しているが、実践では短所となっている。
オープンソースイニシアチブ(OSI)による分析によると、Llama2やLlama 3.x(Metaが開発)、Grok(X)、Phi-2(Microsoft )、Mixtral(Mistral AI)などの人気の大規模言語モデルは、オープンソースと称しているにもかかわらず、オープンソースの原則と構造的に相容れないものである。
持続可能性とインセンティブの課題
ほとんどのオープンソースソフトウェアは、ボランティアによるものまたは助成金によって開発されたものであり、高コストのインフラストラクチャや計算コストに基づいていない。AIモデルは、高額なトレーニングとメンテナンスコストがかかり、コストはさらに増加する可能性がある。AnthropicのCEOであるDario Amodeiは、将来的には、100億ドルかかる可能性があると予測している。
持続可能な資金調達モデルやインセンティブ構造がない場合、開発者は、クローズドソースまたは非商用ライセンスでアクセスを制限するか、財政難に陥るかという選択を迫られる。
「オープンウェイト」およびライセンスに関する誤解
AIモデルへのアクセスは、多くのプラットフォームが「オープン」というラベルを付けており、実際にはオープンソースの原則と相反する制限を課しているため、ますます複雑になっている。
- 「オープンウェイト」というラベルが付いているモデルは、商用利用を完全に禁止している場合があり、実践的なビジネスツールではなく、むしろ学術的な好奇心の対象となっている。
- 一部のプロバイダーは、事前トレーニング済みのモデルへのアクセスを提供しているが、トレーニングデータセットと方法論を厳密に守っているため、結果を意味的に再現または検証することが不可能である。
- 多くのプラットフォームは、開発者がコミュニティのためにモデルを改善または構築することを防ぐ再配布の制限を課しているため、コードに「アクセス」できる場合でも、実際には「オープン」ではない。
これらの場合、「研究用にオープン」というのは、「ビジネス用にクローズド」ということの言い換えにすぎない。結果として、組織は、時間とリソースを、表面上はオープンにアクセスできるように見えるプラットフォームに投資するが、実際にはスケールアップまたは商業化しようとしたときに重大な制限に直面する。
この混乱は、開発者だけに悩みを与えるのではない。AIエコシステムにおける信頼を根本的に損なう。なぜなら、「オープン」というラベルが付いたAIは、オープンソースソフトウェアコミュニティと同等であると、利害関係者が妥当に想定するからである。オープンソースソフトウェアコミュニティでは、透明性、改変権、商業的自由が維持されるからである。
法的遅れ
GenAIの急速な進歩は、適切な法的枠組みの開発を上回っており、既存の懸念を複雑にした知的財産の課題を生み出している。
最初の主要な法的戦場は、トレーニングデータの使用に関するものである。ディープラーニングモデルは、インターネットから大規模なデータセットを収集し、著作権で保護された素材を使用する。テクノロジー企業は、著作権で保護された素材から学習し、新しい変換的なコンテンツを作成するためにAIシステムを使用していると主張する。一方、著作権所有者は、これらのAI企業が著作権で保護された作品を違法に複製し、競合するコンテンツを作成して彼らの生計を脅かしていると主張する。
AIによって生成された派生作品の所有権も、法的曖昧さの1つである。AIによって完全に生成されたコンテンツは、米国著作権局によると、著作権で保護できない。
GenAIに関する法的不確実性 – 特に著作権侵害、AI生成作品の所有権、トレーニングデータのライセンスされていないコンテンツに関するもの – は、基盤となるAIモデルが地政学的重要性のツールとして登場するにつれて、さらに複雑になる。
AI時代におけるオープンソースの必要なもの
GenAIの列車はすでに出発しており、減速する兆しは見られない。私たちは、AIがイノベーションを促進するのではなく、阻害するのではなく、将来を築きたい。そうするには、テクノロジー企業が安全で透明な商用利用を可能にするフレームワークが必要である。責任あるイノベーションを促進し、データ所有権とライセンスを扱い、「オープン」と「無料」の違いを明確にする必要がある。
新しい概念であるオープンコマーシャルソースライセンスは、非商用利用のための無料アクセス、商用利用のためのライセンスアクセス、データの出所と所有権の認識と尊重を提案することで、解決策を提供する可能性がある。
この新しい現実に適応するには、オープンソースコミュニティは、AI特有のオープンライセンスモデルを開発し、パブリックプライベートパートナーシップを形成してこれらのモデルを資金提供し、透明性、安全性、倫理性のための信頼できる基準を確立する必要がある。
オープンソースは、世界を一度変えた。ジェネレーティブAIは、世界を再び変えている。オープン性の精神を維持するには、AIの独自の要求を認めながら、課題に正面から取り組み、包括的で持続可能なエコシステムを作成するために、法律の文字を進化させる必要がある。












