AI 模型与平台

计算机视觉技术可以从视频中预测人类行为

mm
将 Unite.AI 添加到您在 Google 上的首选来源

哥伦比亚工程师研究人员开发了一种新的计算机视觉技术,可以从视频中预测人类行为。这种新技术使机器具有直觉感,能够通过使用人、动物和物体之间的高级关联来预测接下来会发生什么。

卡尔·冯德里克是哥伦比亚大学计算机科学助理教授。冯德里克领导了这项研究,该研究于6月24日在计算机视觉和模式识别国际会议上发表。

“我们的算法是机器能够更好地预测人类行为并与我们的行为更好地协调的重要一步,”冯德里克说。“我们的结果为人机协作、自动驾驶和辅助技术开辟了多种可能性。”

这种新方法是迄今为止最准确的预测视频动作事件的方法,预测时间可达几分钟。该系统首先分析了数千小时的电影、体育比赛和节目,然后预测了数百种活动,例如握手和击拳。

如果系统无法预测特定动作,它会找到一个更高级的概念来链接它们,例如“问候”一词。

过去的尝试

过去的预测机器学习尝试通常专注于一次预测一个动作,算法决定将动作归类为例如拥抱、握手、击掌或非动作。然而,高不确定性意味着大多数机器学习模型无法找到可能选项之间的共同点。

该团队包括哥伦比亚工程博士生Didac Suris和Ruoshi Liu,两人从不同的角度看待长期预测问题。

苏里斯是论文的共同首席作者。

“并非所有未来的事情都是可预测的,”苏里斯说。“当一个人无法准确预测接下来会发生什么时,他们会谨慎地预测更高层次的抽象概念。我们的算法是第一个具有抽象推理未来事件能力的算法。”

https://www.youtube.com/watch?v=b1riFCPiqN4

开发新系统

苏里斯和刘依赖于不寻常的几何形状来开发人工智能模型,这些模型组织高级概念并预测人类行为在未来会发生什么。

奥德·奥利瓦是麻省理工学院的高级研究科学家,也是麻省理工学院-IBM沃森人工智能实验室的联合主任,她没有参与这项研究。

“预测是人类智慧的基础,”奥利瓦说。“机器会犯人类永远不会犯的错误,因为它们缺乏抽象推理的能力。这项工作是弥合这一技术差距的关键一步。”

研究人员开发了一个数学框架,能够使机器根据事件在未来被预测的可能性进行组织。例如,新系统学习如何将活动如游泳和跑步归类为自己的类别,而不仅仅是运动。该系统还能够考虑不确定性,从而导致更具体的行为。

根据刘的说法,这项新技术可以帮助计算机做出细致的决定,而不是预编程的动作,对于建立人类和计算机之间的信任至关重要。

“信任来自于机器真正理解人的感觉,”他解释说。“如果机器能够理解和预测我们的行为,计算机将能够无缝地协助人们进行日常活动。”

该团队现在将致力于验证该技术在现实世界中的有效性,并可能将其用于安全、健康和安全领域。

“人类行为往往令人惊讶,”冯德里克说。“我们的算法使机器能够更好地预测接下来会发生什么。”

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。