访谈

安德鲁·戈登,高级研究顾问,Prolific – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

安德鲁·戈登凭借他在心理学和神经科学方面的坚实背景,作为一名研究人员,揭示了新的见解。拥有心理学学士、神经心理学硕士和认知神经科学博士学位,安德鲁利用科学原理来理解消费者动机、行为和决策。

Prolific 由研究人员为研究人员创建,旨在提供一种优越的方法来获取高质量的人类数据和输入,以进行尖端研究。今天,来自学术界和工业界的超过 35,000 名研究人员依赖 Prolific AI 来收集决定性的人类数据和反馈。该平台以其可靠、参与和公平对待的参与者而闻名,每三分钟就会启动一个新研究。

您如何利用认知神经科学的背景来帮助从事涉及 AI 的项目的研究人员?

一个好的起点是定义认知神经科学到底是什么。基本上,认知神经科学研究认知过程的生物基础。它结合了神经科学和心理学的原理,偶尔还会结合计算机科学等其他学科,这有助于我们理解大脑如何实现各种精神功能。基本上,任何从事认知神经科学研究的人都需要对研究方法有很好的理解,并对人们的思考和行为有很好的理解。这些两个方面是至关重要的,可以结合起来开发和运行高质量的 AI 研究。一个警告是,AI 研究是一个广泛的术语;它可以涉及从基础模型训练和数据注释到理解人们如何与 AI 系统交互等一切。使用 AI 运行研究项目与不使用 AI 运行研究项目没有什么不同;您仍然需要对方法有很好的理解,设计研究以创建最佳的数据,正确地采样以避免偏差,然后使用这些数据进行有效的分析来回答您要解决的任何研究问题。

Prolific 强调对其参与者的道德待遇和公平补偿。您能否分享一下维持这些标准的挑战和解决方案的见解?

我们的补偿模式旨在确保参与者受到重视和奖励,从而感到自己在研究中发挥着重要作用(因为他们确实如此)。我们相信,公平地对待参与者并提供公平的报酬率,可以激励他们更深入地参与研究,并因此提供更好的数据。

不幸的是,大多数在线采样平台没有强制执行这些道德支付和待遇原则。结果是参与者池被激励去尽快完成研究以最大化他们的收入潜力,从而导致数据质量低下。维持我们在 Prolific 采取的立场是具有挑战性的;我们基本上是在与潮流作斗争。AI 研究和其他形式的在线研究的现状并没有关注参与者待遇或福祉,而是关注以最低成本收集尽可能多的数据。

使更广泛的研究社区了解我们采取这种方法的原因以及他们使用我们而不是竞争平台的价值,带来了很大的挑战。另一个挑战是从后勤角度来看,需要花费大量时间来及时和公平地回应参与者或研究人员的担忧、询问或投诉。我们致力于此,因为它让参与者和研究人员保持愉快的体验,鼓励他们继续回到 Prolific。然而,我们也严重依赖使用我们平台的研究人员在参与者离开 Prolific 生态系统并进入研究人员的任务或调查时坚持我们的高标准。发生在我们平台之外的事情实际上由研究团队控制,因此我们不仅依赖参与者让我们知道是否出了问题,还依赖我们的研究人员坚持最高标准。我们尽可能提供指导,以确保这一点的发生。

考虑到 Prolific 的商业模式,您对 AI 开发中人类反馈的基本作用有什么看法,特别是在偏差检测和社会推理改进等领域?

AI 开发中的人类反馈至关重要。没有人类的参与,我们就有可能延续偏见,忽视人类社会交互的细微差别,并未能解决与 AI 相关的某些负面道德问题。这可能会阻碍我们朝着创建负责任、有效和道德的 AI 系统的进步。就偏差检测而言,在开发过程中融入人类反馈至关重要,因为我们应该努力开发反映尽可能广泛的观点和价值观的 AI,而不偏袒任何一种。不同的 демограф、背景和文化都有无意识的偏见,这些偏见虽然不一定是负面的,但可能反映出一种不被广泛接受的观点。Prolific 和密歇根大学之间的合作研究强调了不同注释者的背景如何显著影响他们对诸如言论毒性或礼貌等方面的评分。为了解决这个问题,涉及来自不同背景、文化和观点的参与者可以防止这些偏见在开发中的 AI 系统中被固化。此外,人类反馈使 AI 研究人员能够检测到自动方法可能无法捕捉到的更微妙的偏见形式。这为通过算法、底层模型或数据预处理技术的调整来解决偏差提供了机会。

社会推理的情况基本相同。AI 通常难以完成需要社会推理的任务,因为它本质上不是一个社会存在,而人类是。检测上下文、理解讽刺或识别情感线索需要人类般的社会推理,这是 AI 无法自行学习的。我们作为人类,通过社会学习,所以教导 AI 系统这些推理技术的唯一方法是使用实际的人类反馈来训练 AI 解释和响应各种社会线索。在 Prolific,我们开发了一个社会推理数据集,专门设计用于教授 AI 模型这一重要技能。

本质上,人类反馈不仅有助于确定 AI 系统的优势和劣势,还使开发人员能够进行必要的改进和完善算法。ChatGPT 的工作原理就是一个实用示例。当您提出问题时,ChatGPT 有时会提供两个答案并要求您评估哪一个更好。采用这种方法是因为该模型始终在学习,而开发人员了解人类输入在确定最佳答案方面的重要性,而不是仅仅依赖另一个模型。

Prolific 在连接研究人员与参与者以进行 AI 训练和研究方面发挥了重要作用。您能否分享一些通过您的平台实现的成功故事或显著的 AI 进步?

由于我们参与的许多 AI 工作的商业性质,特别是在非学术领域,大多数项目都受到严格的保密协议的约束。这主要是为了确保技术或方法的保密性,防止被复制。然而,我们可以讨论的一个项目是我们与 Remesh 的合作,Remesh 是一个 AI 驱动的洞察平台。我们与 OpenAI 和 Remesh 合作,开发了一个利用美国人口的代表性样本的系统。成千上万来自代表性样本的个人通过 Remesh 的系统参与了关于 AI 相关政策的讨论,实现了开发反映公众广泛意愿而不是特定人群的 AI 政策,多亏了 Prolific 提供了如此多样化的样本。

展望未来,您对道德 AI 开发的愿景是什么?Prolific 如何为实现这一愿景做出贡献?

我对 AI 未来发展的希望寄托于人们认识到 AI 的质量将取决于其训练数据。确保 AI 系统的数据质量至关重要。训练 AI 系统使用低质量数据,最终会导致次优的 AI 系统。确保高质量数据的唯一方法是确保招募一组多样化和积极参与的参与者,他们渴望提供最佳的数据。在 Prolific,我们的方法和指导原则旨在培养这种参与。通过创建一个定制的、彻底核实的和值得信赖的参与者池,我们预计研究人员将使用这种资源来开发更有效、更可靠和更值得信赖的未来 AI 系统。

您在收集高质量、人工驱动的 AI 训练数据方面面临的最大挑战是什么?Prolific 如何克服这些障碍?

最大的挑战无疑是数据质量。糟糕的数据不仅无益,而且可能导致有害的结果,特别是在金融市场或军事行动等关键领域使用 AI 系统时。这种担忧凸显了“垃圾进,垃圾出”的基本原则。如果输入数据是次优的,则结果 AI 系统将本质上是低质量或实用性的。大多数在线样本往往会产生比理想的 AI 开发更低质量的数据。有很多原因,但 Prolific 解决的一个关键因素是对在线参与者的普遍待遇。这些个人通常被视为可牺牲的,获得低报酬、待遇差、研究人员尊重度低。通过致力于参与者的道德待遇,Prolific 培养了一组积极参与、投入、诚实和细心的贡献者。因此,通过 Prolific 收集的数据质量有保证,支撑可靠和值得信赖的 AI 模型。

我们在 AI 训练数据方面面临的另一个挑战是确保样本中的多样性。虽然在线样本已经显著扩大了我们可以进行研究的个体范围,但它们通常局限于来自西方国家的人。这些样本往往偏向年轻人、计算机素养高、受教育程度高且更倾向于自由主义的人口。这些并不能完全代表全球人口。为了解决这个问题,Prolific 的参与者来自全球 38 个国家。我们还为研究人员提供了工具,以便他们在研究开始前指定样本的确切人口统计学特征。此外,我们通过人口普查匹配模板(如年龄、性别、种族)甚至政治隶属关系提供代表性样本。这些模板确保研究、注释任务或其他项目获得多样化的参与者,从而获得广泛的见解。

感谢这次精彩的采访,希望了解更多的读者可以访问 Prolific

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。