思想领袖
在人工智能时代重新思考开源

开源模式是一种软件开发理念,源代码被公开以供公众重新分发或修改,长期以来一直是创新发展的催化剂。这种理念诞生于1983年,当时软件开发者理查德·斯托曼对他的封闭源代码打印机感到沮丧。
他的愿景引发了自由软件运动,为今天的互联网和软件创新奠定了基础。
但那已经是40多年前的事情了。
如今,生成式人工智能带来了独特的技术和伦理挑战,要求我们重新审视和调整开源范式——不是放弃它,而是适应它。
人工智能与开源自由
开源软件的四项基本自由——运行、研究、修改和重新分发软件代码——在多个方面与生成式人工智能的性质相冲突:
- 运行:人工智能模型通常需要非常高的基础设施和计算成本,这限制了由于资源约束而导致的访问。
- 研究和修改:人工智能模型非常复杂,理解和修改它们而不需要访问代码和数据是一个重大的挑战。
- 重新分发:许多人工智能模型通过设计限制重新分发,特别是那些具有训练权重和专有数据集的模型,由平台提供商拥有。
这些核心原则的侵蚀并非出于恶意,而是现代人工智能系统的复杂性和成本。事实上,训练最先进的人工智能模型的财务需求在近年来大幅增加——据报道,OpenAI的GPT-4的训练成本高达7800万美元,不包括员工工资,总支出超过1亿美元。
“开源”人工智能的复杂性
真正的开源人工智能模型需要推理源代码、训练源代码、模型权重和训练数据的完全透明度。然而,许多被标记为“开源”的模型只会发布推理代码或部分权重,而其他模型则提供有限的许可或限制商业用途。
这种不完全的开放性制造了开源原则的幻觉,但在实践中却存在不足。
考虑到开放源代码倡议(OSI)的一项分析发现,包括Llama2和Llama 3.x(由Meta开发)、Grok(X)、Phi-2(Microsoft )和Mixtral(Mistral AI)在内的几种流行的大型语言模型声称是开源的,但在结构上与开源原则不相容。
可持续性和激励挑战
大多数开源软件都是建立在志愿者驱动或资助支持的基础上,而不是计算密集型、高成本的基础设施上。另一方面,人工智能模型的训练和维护成本很高,预计这些成本只会增加。Anthropic的CEO Dario Amodei预测,训练尖端模型的成本可能会达到100亿美元。
如果没有可持续的资金模式或激励结构,开发人员面临着限制访问或冒着财务风险的选择。
围绕“开源权重”和许可的误解
人工智能模型的可访问性变得越来越混乱,许多平台将自己标记为“开源”,但实际上却施加了限制,违背了真正的开源原则。这种“手法”体现在多个方面:
- 被标记为“开源权重”的模型可能完全禁止商业用途,使其更像学术奇观,而不是公众可以探索和开发的实用商业工具。
- 一些提供商提供预训练模型的访问,但严格保护其训练数据集和方法,使得无法在实质上复制或验证其发现。
- 许多平台施加重新分发限制,阻止开发人员为其社区构建或改进模型,即使他们可以完全“访问”代码。
在这些情况下,“开放研究”只是“封闭商业”的委婉说法。结果是对组织的不诚实的供应商锁定,组织投入时间和资源到看似开放的平台上,但当试图扩大或商业化应用时,发现了关键限制。
由此产生的混淆不仅仅让开发人员感到沮丧,还积极地破坏了人工智能生态系统中的信任。它在利益相关者中制造了不切实际的期望,他们合理地假设“开源”人工智能与开源软件社区相当,在那里,透明度、修改权和商业自由得到维护。
法律滞后
生成式人工智能的快速发展已经超过了适当的法律框架的发展,产生了知识产权挑战的复杂网络,这些挑战加剧了现有的问题。
第一个主要的法律战场集中在训练数据的使用上。深度学习模型从互联网上获取大量数据集,例如公开可用的图像和网页文本。这种大规模的数据收集引发了关于知识产权的激烈辩论。科技公司认为,他们的人工智能系统学习和研究版权材料,以创建新的、具有变革性的内容。版权所有者则声称,这些人工智能公司非法复制他们的作品,产生竞争内容,威胁他们的生计。
人工智能生成的衍生作品的所有权代表了另一个法律模糊性。目前尚不清楚如何对人工智能生成的内容进行分类,除了美国版权局,它指出“如果人工智能完全生成内容,则不能受版权保护”。
生成式人工智能的法律不确定性,特别是关于版权侵权、人工智能生成作品的所有权和训练数据中的未经许可内容,变得更加复杂,因为基础人工智能模型作为地缘政治重要性的工具出现:各国在开发更先进的人工智能能力的竞争中可能不太倾向于限制数据访问,这将使具有更严格的知识产权保护的国家处于竞争劣势。
开源在人工智能时代的演变
生成式人工智能的发展已经无法停止,我们希望建设一个未来,在那里人工智能促进而不是扼杀创新。为此,科技领导者需要一个框架,确保安全和透明的商业使用,促进负责任的创新,解决数据所有权和许可问题,并区分“开源”和“免费”。
一种新兴的概念,即开源商业许可,可能提供了一条前进的道路,提出非商业用途的免费访问、商业用途的许可访问以及对数据的起源和所有权的承认和尊重。
为了适应这一新现实,开源社区必须开发人工智能特定的开源许可模型,建立公私合作伙伴关系来资助这些模型,并建立透明度、安全性和伦理的可信标准。
开源曾经改变了世界。生成式人工智能正在再次改变世界。为了保留开放的精神,我们必须进化开源的法律,承认人工智能的独特需求,同时直面挑战,创造一个包容和可持续的生态系统。












