伦理

研究人员寻求神经科学家的帮助以克服数据集偏差

mm
将 Unite.AI 添加到您在 Google 上的首选来源

麻省理工学院、哈佛大学和富士通株式会社的研究人员团队寻求了解如何使机器学习模型克服数据集偏差。他们采用神经科学方法研究训练数据如何影响人工神经网络学习识别其从未见过的物体的能力。

该研究发表在Nature Machine Intelligence上。

训练数据的多样性

该研究的结果表明,训练数据的多样性会影响神经网络是否能够克服偏差。然而,数据多样性也可能对网络的性能产生负面影响。研究人员还表明,神经网络的训练方式也会影响其是否能够克服偏差数据集。

Xavier Boix 是脑和认知科学系(BCS)和脑、思维和机器中心(CBMM)的研究科学家。他也是论文的首席作者。

“神经网络可以克服数据集偏差,这是令人鼓舞的。但主要的收获是,我们需要考虑数据多样性。我们需要停止认为,只要收集大量的原始数据,就会得到某种结果。我们需要非常小心地设计数据集。” Boix 说。

该团队采用了神经科学家的思维方式,开发了新的方法。根据 Boix 的说法,实验中经常使用受控数据集,因此该团队构建了包含不同物体在不同姿势下的图像的数据集。然后,他们控制了组合,使得某些数据集比其他数据集更多样化。一个数据集中如果只有一个视角的物体图像,则该数据集的多样性较低,而如果有多个视角的物体图像,则该数据集的多样性较高。

研究人员使用这些数据集来训练神经网络进行图像分类。然后,他们研究了网络识别其在训练过程中未见过的物体的能力。

他们发现,多样化的数据集使得网络更好地泛化新的图像或视角,这对于克服偏差至关重要。

“但是,更多的数据多样性并不总是更好;这里存在一种紧张关系。当神经网络变得更擅长于识别新事物时,它也会变得更难以识别它已经见过的东西。” Boix 说。

训练神经网络的方法

该团队还发现,对于每个任务单独训练的模型比同时训练两个任务的模型更能克服偏差。

“结果非常惊人。事实上,我们第一次进行这个实验时,认为这是一个错误。花了几周时间才意识到这是一个真实的结果,因为它太出乎意料了。” Boix 继续说。

更深入的分析揭示,神经元专化参与了这个过程。当神经网络被训练来识别图像中的物体时,会出现两种类型的神经元。其中一种神经元专门用于识别物体类别,而另一种神经元专门用于识别视角。

当神经网络被训练来分别执行任务时,专门的神经元变得更加突出。然而,当网络被训练来同时执行两个任务时,一些神经元变得模糊。这意味着它们不专门用于某一任务,因此更容易混淆。

“但是,下一个问题是,这些神经元是如何出现的?你训练神经网络,它们就会从学习过程中出现。没有人告诉网络在其架构中包含这些类型的神经元。这是最令人着迷的事情。” Boix 说。

研究人员将在未来的工作中探索这个问题,并将新的方法应用于更复杂的任务。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。