AI 模型与平台
研究人员开发了一套能让最好的计算机感到困惑的问题集
马里兰大学的研究人员能够创建一套容易让人回答但难以让当前最好的计算机回答系统回答的问题。该团队通过人机协作生成了这些问题,并创建了一个包含超过 1,200 个词的数据库。如果计算机系统能够学习和掌握这些问题,它将拥有目前所有计算机系统中对人类语言的最佳理解。
该研究成果发表在《计算语言学协会交易》杂志上。
马里兰大学计算机科学系副教授、论文的首席作者乔丹·博伊德-加伯(Jordan Boyd-Gaber)谈到了最新的发展。
“大多数问题回答计算机系统不会解释为什么他们会以某种方式回答,但我们的工作帮助我们了解计算机实际上理解了什么,”他说。“另外,我们已经生成了一个测试计算机的数据集,这将揭示计算机语言系统是否实际上正在阅读和执行人类能够执行的相同类型的处理。”
目前,这些程序和系统的题目由人类作者或计算机生成。问题在于,当人类生成题目时,他们并不知道所有可能让计算机感到困惑的题目元素。另一方面,计算机系统使用公式、填空题或犯错误,这可能会生成无意义的内容。
为了实现人类和计算机之间的合作以生成问题,博伊德-加伯和研究团队创建了一个特殊的计算机接口。根据他们的说法,它可以告诉计算机在人类输入问题时“思考”什么。然后,作者可以根据计算机的弱点编辑和修改问题,从而为计算机生成困惑。
当作者输入问题时,计算机的猜测会按排名顺序列出。导致计算机猜测的词语会被突出显示。
系统可以正确回答问题,接口会突出显示导致答案的词语或短语。有了这些信息,作者可以编辑问题,使其对计算机更难,但问题的含义保持不变。虽然计算机最终会感到困惑,但专家仍然能够回答。
当人类和计算机合作时,他们能够开发出 1,213 个计算机无法回答的问题。研究人员在人类玩家和计算机之间进行了一场比赛,人类玩家包括高中知识竞赛队和“危险边缘”冠军。最弱的人类队伍能够击败最强的计算机系统。
马里兰大学计算机科学研究生、论文的共同作者施飞(Shi Feng)谈到了新的研究成果。
“过去三四年,人们已经意识到计算机问题回答系统非常脆弱,很容易被欺骗,”她说。“但这是我们所知道的第一篇使用机器帮助人类破解模型本身的论文。”
使用的题目能够揭示六种不同的语言现象,这些现象会让计算机感到困惑。这些现象可以分为两类。第一类是语言现象,包括改述、分散注意力语言和意外背景。第二类是推理技能,包括逻辑和计算、问题中元素的精神三角测量以及将多个步骤组合成一个结论。
“人类能够更好地概括和看到更深层次的联系,”博伊德-加伯说。“他们没有计算机的无限记忆,但他们仍然在能够看到森林中树木方面具有优势。列出计算机存在的问题有助于我们了解需要解决的问题,以便我们能够让计算机开始看到森林中的树木,并像人类一样回答问题。”
这项研究为计算机系统最终掌握人类语言奠定了基础。它无疑会不断发展和改进。
“这篇论文为未来几年的研究议程奠定了基础,以便我们能够让计算机更好地回答问题,”博伊德-加伯说。












