AI 模型与平台
谷歌研究人员发现了阻碍许多 AI 模型的underspecification问题
最近,谷歌的一组研究人员发现了人工智能模型失败的常见原因,指出underspecification是机器学习模型在现实世界中表现与在实验室中表现相差甚远的主要原因之一。
(GOOGL )机器学习模型通常在处理现实世界任务时会失败,即使它们在实验室中表现最佳。训练/开发和现实世界性能之间的差异有很多原因。人工智能模型在现实世界任务中失败的最常见原因之一是数据转移。数据转移是指开发机器学习模型所使用的数据类型与模型应用时输入的数据类型之间的根本差异。例如,使用高质量图像数据训练的计算机视觉模型将难以处理低质量相机捕获的数据,这些相机存在于模型的日常环境中。
根据MIT技术评论,谷歌的40名研究人员发现了机器学习模型性能差异的另一个原因。这个问题是“underspecification”,这是一个统计概念,描述了观察现象有多种可能的原因,但并非所有原因都被模型考虑在内。根据研究负责人Alex D’Amour的说法,这个问题在许多机器学习模型中都存在,他说这种现象“无处不在”。
训练机器学习模型的典型方法是将大量数据输入模型,让其分析和提取相关模式。然后,模型会被输入它以前没有见过的例子,并要求预测这些例子的性质,基于它已经学习的特征。一旦模型达到一定的准确度,训练通常被认为是完成的。
根据谷歌研究团队的说法,需要做更多工作来确保模型能够真正推广到非训练数据。训练机器学习模型的经典方法会产生各种模型,这些模型可能都通过了测试,但这些模型在小的、看似无关紧要的方面存在差异。模型中的不同节点可能被赋予不同的随机值,或者训练数据可能以不同的方式被选择或表示。这些差异很小,通常是任意的,如果它们在训练过程中没有对模型的性能产生重大影响,那么它们很容易被忽略。然而,当这些小变化的影响累积起来时,它们可能会导致现实世界性能的重大差异。
这个underspecification问题很麻烦,因为它意味着,即使训练过程能够产生好的模型,也可能产生一个糟糕的模型,而这种差异可能不会被发现,直到模型进入生产环境并开始使用。
为了评估underspecification的影响,研究团队检查了多个模型。每个模型都使用相同的训练过程,然后这些模型会经过一系列测试,以突出它们的性能差异。在一个例子中,50个不同的图像识别系统被训练在ImageNet数据集上。这些模型除了随机分配的神经网络值外,其他方面都相同。用于确定模型差异的压力测试使用了ImageNet-C,一个由通过对比度或亮度调整修改的图像组成的原始数据集的变体。这些模型还在ObjectNet上进行了测试,ObjectNet是一组具有日常物体的图像,这些物体以不寻常的方向和背景出现。尽管所有50个模型在训练数据集上的性能几乎相同,但当这些模型经过压力测试时,其性能却有很大差异。
研究团队发现,当他们训练和压力测试两个不同的NLP系统时,会出现类似的结果,也会出现类似的结果,当他们测试各种其他计算机视觉模型时。每种情况下,模型都从彼此身上大大分化开来,尽管所有模型的训练过程都相同。
根据D’Amour的说法,机器学习研究人员和工程师在发布模型之前需要进行更多的压力测试。这可能很困难,因为压力测试需要根据特定任务使用的现实世界数据来量身定制,这些数据对于某些任务和背景来说可能很难获得。underspecification问题的一个潜在解决方案是同时生成多个模型,然后在一系列现实世界任务中测试这些模型,选择一致表现最佳的模型。以这种方式开发模型需要大量时间和资源,但这种权衡可能是值得的,特别是对于在医疗背景或其他安全至关重要的领域中使用的AI模型。正如D’Amour通过MIT技术评论解释的那样:
“我们需要更好地指定我们对模型的要求。因为通常会发生的情况是,我们只在模型在现实世界中失败后才发现这些要求。”












