AI 模型与平台
研究人员创建了GPU的替代品

来自莱斯大学的计算机科学家与英特尔的合作伙伴共同开发了一种更具成本效益的GPU替代品。这种新算法被称为“亚线性深度学习引擎”(SLIDE),它使用一般用途的中央处理器(CPU),而不需要专用的加速硬件。
(INTC )结果在奥斯汀会议中心的机器学习系统会议(MLSys)上发表。
人工智能(AI)领域面临的最大挑战之一是专用的加速硬件,例如图形处理器(GPU)。在新的发展之前,人们认为加速深度学习技术需要使用这种专用的加速硬件。
许多公司非常重视投资GPU和专用硬件用于深度学习,这些技术包括数字助手、面部识别和产品推荐系统。其中一家公司是Nvidia (NVDA ) ,它制造Tesla (TSLA ) V100 Tensor Core GPU。Nvidia最近报告称,其第四季度收入比去年增加了41%。
SLIDE的发展开启了全新的可能性。
安舒马利·什里瓦斯塔娃(Anshumali Shrivastava)是莱斯大学布朗工程学院的助理教授,他与研究生贝迪·陈(Beidi Chen)和塔伦·梅迪尼(Tharun Medini)一起发明了SLIDE。
“我们的测试表明,SLIDE是第一个智能的算法实现,能够在CPU上实现深度学习,并且能够在行业规模的推荐数据集和大型全连接架构上超越GPU硬件加速,”什里瓦斯塔娃说。
SLIDE能够克服GPU的挑战,是因为它对深度学习采取了完全不同的方法。目前,深度神经网络的标准训练技术是“反向传播”,这需要矩阵乘法。这种工作负载需要使用GPU,因此研究人员改变了神经网络训练,使其能够使用哈希表解决。
这种新方法大大减少了SLIDE的计算开销。目前最好的GPU平台是像Amazon (AMZN ) 和Google这样的公司用于云端深度学习的八个Tesla V100,价格约为100,000美元。
(GOOGL )“我们在实验室中有一台这样的设备,我们测试了一个适合V100的工作负载,一个具有超过100万个参数的大型全连接网络,适合GPU内存,”什里瓦斯塔娃说。“我们使用谷歌的TensorFlow进行了训练,需要3.5小时。”
“然后我们展示了我们的新算法可以在一小时内完成训练,而不是在GPU上,而是在44核的Xeon级CPU上,”他继续说。
哈希是一种数据索引方法,于1990年代为互联网搜索而发明。使用数值方法将大量信息编码为一串数字,这被称为哈希。哈希被列出以创建可以快速搜索的表格。
“在TensorFlow或PyTorch上实现我们的算法毫无意义,因为他们首先要做的事情就是将任何内容转换为矩阵乘法问题,”陈说。“这正是我们想要避免的。因此,我们从头开始编写C++代码。”
根据什里瓦斯塔娃的说法,SLIDE最大的优势是它是数据并行的。
“通过数据并行,我是指如果我有两个数据实例要训练,假设一个是猫的图像,另一个是公交车的图像,它们可能会激活不同的神经元,SLIDE可以独立更新或训练它们,”他说。“这对于CPU来说是更好的并行利用。”
“相比GPU,另一方面,我们需要大量内存,”他说。“在主内存中有一个缓存层次,如果你不小心,你可能会遇到缓存抖动的问题,即缓存命中率很低。”
SLIDE为深度学习的新实现方法开启了大门,什里瓦斯塔娃认为这只是开始。
“我们才刚刚开始,”他说。“还有很多我们可以做的优化。我们还没有使用向量化,或者CPU中的内置加速器,例如英特尔深度学习增强。还有很多其他技巧我们可以使用来使其更快。”












