Anderson 视角
如何在运行机器学习模型时保持智能手机的凉爽

来自奥斯汀大学和卡内基梅隆大学的研究人员提出了一种新方法,可以在移动设备(如智能手机)和低功耗边缘设备上运行计算密集型的机器学习模型,而不会触发热节制——一种常见的保护机制,旨在降低主机设备的温度,直到达到可接受的操作温度。
这种新方法可以帮助更复杂的机器学习模型在不威胁主机智能手机稳定的情况下运行推理和其他类型的任务。
核心思想是使用动态网络,其中模型的权重可以被“低压”和“全强度”版本的本地机器学习模型访问。
在本地机器学习模型的运行可能导致设备温度急剧升高的情况下,模型将动态切换到一个不那么耗费资源的模型,直到温度稳定下来,然后再切换回完整版本。
研究人员在2019款Honor V30 Pro智能手机和Raspberry Pi 4B 4GB上进行了计算机视觉和自然语言处理(NLP)模型的概念验证测试。
从结果(对于智能手机)中,我们可以看到主机设备的温度随着使用而升高和降低。红线代表没有使用动态切换的模型运行。

虽然结果看起来很相似,但它们并不是:蓝线(即使用新论文方法)中的温度波动是由于在简单和复杂模型版本之间切换所致。在整个操作过程中,热节制从未被触发。
红线中的温度升高和降低是由于设备中的热节制自动启动所致,这会降低模型的性能并增加其延迟。
在模型的可用性方面,我们可以看到未经辅助的模型的延迟显著更高,当它被热节制时:

上面的图像显示,使用动态切换的模型几乎没有延迟的变化,始终保持响应。
对于最终用户,高延迟可能意味着等待时间的增加,这可能导致任务被放弃和应用程序的满意度降低。
在NLP(而不是计算机视觉)系统中,高响应时间可能更加令人不安,因为任务可能依赖于及时的响应(例如自动翻译或帮助残障用户的实用程序)。
对于真正的实时应用(如实时VR/AR),高延迟将有效地破坏模型的核心用途。
研究人员指出:
‘我们认为热节制对延迟关键的移动机器学习应用构成严重威胁。例如,在视频流媒体或游戏的实时视觉渲染期间,每帧处理延迟的突然增加将对用户体验产生重大负面影响。另外,现代移动操作系统通常为视力障碍人群提供特殊服务和应用程序,例如iOS上的VoiceOver和Android上的TalkBack。’
‘用户通常完全依赖语音与移动电话交互,因此这些服务的质量高度依赖于应用程序的响应性或延迟。’

展示BERT w50 d50未辅助(红色)和使用动态切换(蓝色)的性能。注意动态切换(蓝色)中的延迟均匀性。
论文题为保持凉爽:动态切换防止热节制,这是奥斯汀大学、卡内基梅隆大学和两所机构的合作成果。
CPU-Based Mobile AI
虽然动态切换和多尺度架构是一个已确立和活跃的研究领域,但大多数工作都集中在更高端的计算设备阵列上,目前的工作重点是分配在本地(即设备基于)神经网络的强化,通常用于推理而不是训练,以及改进专用移动硬件。
研究人员进行的测试是在CPU而不是GPU芯片上进行的。尽管人们对利用本地GPU资源在移动机器学习应用中(甚至直接在移动设备上训练,这可能会提高最终模型的质量)越来越感兴趣,但GPU通常会消耗更多的电力,这是AI在设备资源有限的情况下独立(不依赖云服务)和有用的努力中的一个关键因素。
Testing Weight Sharing
该项目测试的网络是Slimmable网络和DynaBERT,分别代表计算机视觉和NLP任务。
虽然已经有各种努力使BERT的迭代在移动设备上高效且经济地运行,但一些尝试被批评为拐弯抹角的解决方案,研究人员指出,使用BERT在移动空间是一个挑战,并且“BERT模型通常对于移动电话来说计算密集度太高”。
DynaBERT是一个中国倡议,旨在将谷歌的强大NLP/NLU框架优化到资源匮乏的环境中;但是,即使是这个BERT实现,研究人员也发现它非常耗费资源。
尽管如此,在智能手机和树莓派设备上,作者进行了两次实验。在计算机视觉实验中,一个随机选择的图像被连续和重复地处理为ResNet50的分类任务,并且能够在整个实验运行时间内稳定运行而不触发热节制。
论文指出:
‘虽然可能会牺牲一些准确性,但所提出的动态切换具有更快的推理速度。最重要的是,我们的动态切换方法具有一致的推理。’

在连续图像分类任务中运行ResNet50未辅助和使用动态切换在Slimmable ResNet50 x1.0和x0.25版本之间,持续60分钟。
对于NLP测试,作者将实验设置为在DynaBERT套件中两个最小的模型之间切换,但发现BERT在1.4倍延迟时在70°时会热节制。因此,他们将下切换设置为在操作温度达到65°时发生。
BERT实验涉及让安装在GLUE的ONLI数据集中的一对问题/答案对上连续运行推理。
与计算机视觉实现相比,BERT任务的延迟和准确性权衡更为严重,准确性是以控制设备温度为代价,以避免热节制:

研究人员实验中两个任务的延迟与准确性权衡。
作者观察到:
‘动态切换通常无法防止BERT模型的热节制,因为模型的计算密集度非常高。然而,在某些限制下,动态切换仍然可以在部署BERT模型在移动电话时提供帮助。’
作者发现BERT模型会导致Honor V30手机的CPU温度在32秒内升高到80°,并在6分钟内触发热节制。因此,作者只使用了半宽度的BERT模型。
实验在树莓派设置上重复进行,技术也能够在这种环境中防止热节制的触发。然而,作者指出,树莓派不像紧密打包的智能手机那样具有极端的热约束,并且似乎添加了这批实验作为进一步展示该方法在适度配置的处理环境中的有效性的证明。
首次发布于2022年6月23日。













