Anderson 视角

使用偏光滤镜和物体识别识别驾驶员移动电话滥用

mm
将 Unite.AI 添加到您在 Google 上的首选来源

英国的研究人员提出了一个路边系统,使用经典的光学滤镜和红外捕获来自动检测驾驶员非法使用移动电话。根据捕获设备的质量,该系统在现实世界试验中展示了高达95.81%的准确率。

研究人员的模型在行动。挡风玻璃区域首先被识别和隔离为一个用于AI辅助搜索移动电话图像的区域。该系统旨在忽略安装的移动电话,并寻找由驾驶员主动持有的设备。来源:https://www.youtube.com/watch?v=PErIUr3Cxvg

研究人员的模型在行动。挡风玻璃区域首先被识别和隔离为一个用于AI辅助搜索移动电话图像的区域。该系统旨在忽略安装的移动电话,并寻找由驾驶员主动持有的设备。来源:https://www.youtube.com/watch?v=PErIUr3Cxvg

该研究题为《通过最先进的物体检测和跟踪识别驾驶员电话使用违规》,来自纽卡斯尔大学的计算机科学学院。

克服挡风玻璃的反射性

以前的驾驶员移动设备使用检测方法由于挡风玻璃在白天的高反射性而受到阻碍,尤其是在大片云层反射进一步遮挡车内的情况下。这些情况不能通过红外光源来解决,因为需要的IR照明量将是资源密集型的。

因此,纽卡斯尔的研究人员提出了最古老的技巧(可以追溯到1812年)来消除从玻璃表面反射出来的光线——一种廉价的物理偏光滤镜,可以附着在路边监控摄像机上,一次校准后,就可以清晰地看到车内的情况。

上图为未过滤的汽车挡风玻璃视图。下图为附有物理偏光滤镜的摄像机的相同视图。来源:https://arxiv.org/pdf/2109.02119.pdf

上图为未过滤的汽车挡风玻璃视图。下图为附有物理偏光滤镜的摄像机的相同视图。来源:https://arxiv.org/pdf/2109.02119.pdf

随着从专用相机转向基于移动设备的传感器,偏光滤镜在流行文化中的存在主要被减少到其包含在合理质量的太阳镜中,在那里,佩戴者可以通过倾斜视角或改变视角来观察其消除反射的特性。

阳光被氧气和氮气分子散射,蓝光比其他波长更广泛地被散射,使蓝色成为白天清晰天空的本色。蓝光是偏振的,线性或圆偏振镜头可以有效地消除这种偏振光,去除反射。

该论文承认,烟雾挡风玻璃可能会阻碍或破坏这种方法的有效性。然而,由于这在英国法律上是有限的,各州在美国的规定有所不同,该论文不认为这是一个主要障碍。

YOLO

该论文提出的系统旨在集成到市政基础设施中,例如政府安装的路边监控摄像机。意识到可能的成本障碍,研究人员测试了各种物体识别系统配置,跨越不同质量级别的捕获设备,并提供了一个最低成本场景,其中廉价的偏光滤镜可以添加到现有的摄像机中,所有其他系统方面都是远程的。

测试了四种物体识别框架:You-Only-Look-Once(YOLO)版本3和4;SSD基网络;Faster R-CNN;和CenterNet。在测试中,使用YOLO V3获得了最准确的结果,使用一个两步工作流程,首先定位挡风玻璃区域,然后在该空间中寻找移动设备。

然而,需要将视频通过两个网络运行,结果是一个低于最佳的13.15fps帧率,相比简单系统的30fps。结果质量取决于输入设备,研究人员发现,当输入设备在低端相机和更高质量的设备之间分配时,高端设备可以获得接近96%的准确率,而低端相机可以获得74.35%的准确率。

限制识别的违规行为

除了使系统在经济上可行外,研究人员还关心开发一个完全自动化的系统,具有最少必要的人类监督,该系统旨在自动发出罚单。然而,由于世界各地的法律关于驾驶时使用移动电话变得更加严格,处罚可能超过简单的罚款或驾照扣分(例如在英国),因此在此类系统的部署中,可能仍然需要人工验证。

尽管使用了光流和其他方法来考虑整个视频内容,但物体识别算法(如YOLO)将每个帧视为“完整的故事”,下一帧是后续的项目。因此,必须防止此类系统发出(例如)128个单独的罚款,涵盖128帧的违规行为捕获视频。

为了避免这种情况,该系统集成了物体跟踪算法Deep SORT,为每个违规行为识别添加了一个唯一的“事件ID”,并确保该ID不会在单个捕获序列中的帧之间重复。

处理夜间监控

对于夜间条件,研究人员默认使用红外捕获,如以前的研究项目中所探讨的相同挑战。他们测试了850和730纳米的IR波长,并发现730nm可以捕获最好的细节。

该论文认为,需要进一步调查红外捕获在白天条件下的使用程度。

数据

对于系统的更经济的单步版本,研究人员使用了2,235张车牌图像来自Google Open Images Dataset,以及2150张库存和自定义的移动电话图像。由于需要包含驾驶员持有的电话图像,因此1,700张电话图像是专门为该项目拍摄的。

两步系统需要标注487个挡风玻璃,用于训练过程的第一步,除了用于单步过程的数据外。

由于没有官方的道路监控基础设施,所有图像都是由志愿者拍摄的,以近似类似的条件。

权衡

最终结果提供了一系列需要与实施成本进行权衡的准确性标准,具有更好的捕获设备和处理结果的更高准确性,可以通过廉价的现有城市监控设备的改装来实现“可接受”的准确性。

更便宜的“单步”管道可以实现近75%的准确率,具有最低的实施成本(即安装廉价的偏光滤镜),而更复杂的两步系统(首先隔离挡风玻璃区域,然后寻找驾驶员持有的移动设备)可以实现更高的准确率,但可能只适用于新基础设施,取决于可用的预算。

更便宜的“单步”管道可以实现近75%的准确率,具有最低的实施成本(即安装廉价的偏光滤镜),而更复杂的两步系统(首先隔离挡风玻璃区域,然后寻找驾驶员持有的移动设备)可以实现更高的准确率,但可能只适用于新基础设施,取决于可用的预算。在两种情况下,捕获设备的质量都是一个额外的变量。

如上所述,研究人员对该项目可行性的看法似乎是基于这样的假设:该系统应该完全自主运行——一个值得怀疑的要求。

请查看项目的官方视频,了解更多关于实施和使用的方法的详细信息。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai