AI 模型与平台
为 AI 训练提供研究的货币化:风险和最佳实践
随着对生成式 AI 的需求的增长,对用于训练这些系统的高质量数据的需求也在增长。学术出版商已经开始将其研究内容货币化,以提供大型语言模型(LLMs)的训练数据。虽然这种发展为出版商创造了新的收入来源,并使生成式 AI 能够用于科学发现,但它也引发了人们对所使用研究的完整性和可靠性的质疑。这引发了一个至关重要的问题:被出售的数据集是否可靠,这种做法对科学界和生成式 AI 模型有什么影响?
货币化研究协议的崛起
主要的学术出版商,包括 Wiley、Taylor & Francis 等,已经 报告 了从将内容许可给开发生成式 AI 模型的科技公司中获得了大量收入。例如,Wiley 本年 alone 就从此类交易中获得了超过 4000 万美元的收入。这些协议使 AI 公司能够访问多样化和广泛的科学数据集,从而提高了他们的 AI 工具的质量。
出版商的说法很简单:许可确保了更好的 AI 模型,造福社会同时为作者带来版税。这一商业模式使科技公司和出版商都受益。然而,科学知识货币化的趋势也带来了风险,特别是当可疑研究渗入这些 AI 训练数据集时。
伪造研究的阴影
学术界并非对伪造研究的問題陌生。研究表明,许多发表的研究结果存在缺陷、偏见或不可靠。2020 年的一项调查发现,近半数研究人员报告了诸如选择性数据报告或设计不良的实地研究等问题。2023 年,超过 10,000 篇 论文因结果被篡改或不可靠而被撤回,这个数字每年都在增加。专家认为,这个数字只是冰山一角,许多可疑研究正在科学数据库中流传。
这种危机主要是由 “论文工厂” 引起的,论文工厂是指生产伪造研究的影子组织,通常是为了应对学术压力,在中国、印度和东欧等地区。据估计,全球约有 2% 的期刊投稿来自论文工厂。这些伪造研究看起来可能像合法研究,但充满了虚假数据和毫无根据的结论。令人不安的是,这些研究可以通过同行评审并最终发表在受尊敬的期刊上,从而损害科学洞察力的可靠性。例如,在 COVID-19 大流行期间,关于伊维菌素的 有缺陷的研究 错误地表明其作为治疗方法的有效性,造成了混乱并延迟了有效的公共卫生应对。这一例子凸显了传播不可靠研究的潜在危害,其中有缺陷的结果可能对公共卫生产生重大影响。
对 AI 训练和信任的影响
当大型语言模型训练于包含伪造或低质量研究的数据库时,后果将非常严重。AI 模型使用其训练数据中的模式和关系来生成输出。如果输入数据被破坏,输出可能会延续不准确性,甚至放大它们。这一风险在医学等领域尤其高,因为不正确的 AI 生成的洞察可能会产生危及生命的后果。
此外,这一问题威胁着公众对学术界和 AI 的信任。随着出版商继续达成协议,他们必须解决人们对所出售数据质量的担忧。未能做到这一点可能会损害科学界的声誉并破坏 AI 的潜在社会效益。
确保 AI 的可靠数据
减少有缺陷研究破坏 AI 训练的风险,需要出版商、AI 公司、开发人员、研究人员和更广泛的社区共同努力。出版商必须改进同行评审过程,以便在研究进入训练数据集之前捕获不可靠的研究。为审稿人提供更好的回报并设定更高的标准可以带来帮助。开放评审过程在此至关重要。它带来更多的透明度和问责制,有助于建立对研究的信任。
AI 公司在为 AI 训练获取研究时必须更加谨慎。选择具有良好声誉的出版商和期刊,以确保高质量、经过良好审查的研究至关重要。在这种情况下,仔细审视出版商的记录(例如撤回论文的频率或对评审过程的开放程度)是有价值的。选择性地提高数据的可靠性并在 AI 和研究界建立信任。
AI 开发人员需要对所使用的数据负责。这意味着与专家合作,仔细检查研究,并比较多个研究的结果。AI 工具本身也可以被设计为识别可疑数据并降低可疑研究传播的风险。
透明度也是一个至关重要的因素。出版商和 AI 公司应该公开分享有关研究如何使用以及版税如何分配的详细信息。像 生成式 AI 许可协议跟踪器 这样的工具显示出希望,但需要更广泛的采用。研究人员也应该对其工作的使用有发言权。像 选择加入 政策(例如来自 剑桥大学出版社 的政策)为作者提供了对其贡献的控制权。这建立了信任,确保了公平,并使作者积极参与这一过程。
此外,鼓励开放获取高质量研究,以确保 AI 开发中的包容性和公平性。政府、非营利组织和行业参与者可以资助开放获取计划,减少对商业出版商的依赖,以获取关键的训练数据集。除此之外,AI 行业需要明确的数据来源伦理准则。通过关注可靠、经过良好审查的研究,我们可以构建更好的 AI 工具,保护科学的完整性,并维护公众对科学和技术的信任。
结论
为 AI 训练提供研究的货币化既带来了机会,也带来了挑战。虽然许可学术内容允许开发更强大的 AI 模型,但也引发了人们对所使用数据的完整性和可靠性的担忧。包括来自 “论文工厂” 的有缺陷研究在内的伪造研究可能会破坏 AI 训练数据集,导致不准确性,并可能破坏公众对 AI 和科学的信任。为了确保 AI 模型建立在可靠的数据之上,出版商、AI 公司和开发人员必须共同努力,改进同行评审过程,增加透明度,并优先考虑高质量、经过良好审查的研究。通过这样做,我们可以保障 AI 的未来并维护科学界的完整性。为了确保 AI 模型建立在可靠的数据之上,出版商、AI 公司和开发人员必须共同努力,改进同行评审过程,增加透明度,并优先考虑高质量、经过良好审查的研究。通过这样做,我们可以保障 AI 的未来并维护科学界的完整性。












