访谈
凯文·塔布斯(Kevin Tubbs),Penguin Computing战略解决方案集团高级副总裁 – 采访系列

凯文·塔布斯(Kevin Tubbs)博士是Penguin Computing战略解决方案集团的高级副总裁。Penguin Computing根据客户需求定制设计无关性、端到端(硬件/软件/云/服务)解决方案,以解决当今的财富500强公司、初创企业、学术机构和联邦组织面临的复杂科学、分析和工程问题。
是什么最初吸引你进入计算机科学领域?
我的父母在我很小的时候给我买了一台电脑,我一直对计算机和摆弄东西有着浓厚的兴趣。通过我的教育,我一直被STEM领域所吸引,这让我想参与一个更实际的领域。我的背景是物理学和高性能计算(HPC)。早期对计算机的热爱使我能够在其他任何科学、数学或工程兴趣中优先考虑计算机科学,这让我走到了今天的位置。
Penguin Computing与开放计算项目(Open Compute Project,OCP)密切合作 – 什么是OCP?
从开放计算项目(OCP)运动开始,Penguin Computing就成为早期采用者、支持者和主要贡献者,致力于将OCP的优势带到高性能计算(HPC)和人工智能(AI)领域。
OCP的重点是聚集全球开发者社区,创建一个完整的基础设施技术生态系统,以提高效率、灵活性和可扩展性。Penguin Computing加入OCP是因为其开放技术和社区理念。随着时间的推移,我们确保传统HPC和新兴AI、分析趋势的技术能够高效扩展 – Penguin Computing推动这些技术进入OCP。
OCP的一个好处是降低总拥有成本(TCO)- 由于去掉了所有虚荣元素,资本支出降低,服务从前端开始,共享电源和其他设计变化,操作支出也降低 – 这使得基于OCP的技术非常适合扩展。
Penguin Computing拥有多个OCP产品,包括Penguin Computing Tundra Extreme Scale平台和Penguin Computing Tundra AP。Tundra平台还支持HPC和AI工作负载。
Tundra AP是我们高密度Tundra超级计算平台的最新一代,结合了英特尔Xeon可扩展9200系列处理器和Penguin Computing的Relion XO1122eAP服务器,采用OCP形式因子,提供高密度的CPU核心每个机架。
在大数据方面,为了优化性能水平,用户需要消除瓶颈,减慢他们访问数据的速度。Penguin Computing如何解决这个问题?
Penguin Computing利用我们的能力,采用开放技术,跟上当前趋势 – 其中之一是大数据或数据驱动工作负载的增长。为此,我们建立了战略解决方案集团来直接解决这个问题。
在解决这个问题时,我们发现大多数工作负载,甚至来自传统技术计算的工作负载,都被激励去变得更加数据驱动。因此,Penguin Computing通过试图了解用户的工作负载来设计完整的端到端解决方案。为了创建一个工作负载优化的端到端解决方案,我们专注于工作负载优化的软件层,包括编排和工作负载交付。基本上,我们需要了解用户将如何使用基础设施。
接下来,我们尝试专注于工作负载优化的计算基础设施。有不同级别的数据和IO挑战,这些挑战给计算部分带来了很大的压力。例如,不同的工作负载需要不同的加速计算基础设施组合,包括CPU、GPU、内存带宽和网络,这些都允许数据流经并被计算。
最后,我们需要弄清楚什么样的解决方案将使我们能够交付这些数据。我们研究工作负载优化的数据基础设施,以了解工作负载如何与数据交互,什么是容量要求和IO模式。一旦我们拥有这些信息,它将帮助我们设计一个工作负载优化的系统。
一旦我们拥有所有信息,我们就会利用Penguin Computing内部的专业知识来设计和创建一个完整的解决方案。了解它是从性能角度设计的,我们需要了解它将被部署在哪里(在场所、云端、边缘、所有这些的组合等)。这就是Penguin Computing交付数据驱动工作负载优化解决方案的方法。
您能否讨论在深度学习中使用GPU而不是CPU的重要性?
我看到的深度学习中GPU重要性的最大趋势之一,是使用通用GPU(GPGPU)作为数据并行的硬件,允许我们大大加速可以交付的计算核心数量来解决并行计算问题。这已经持续了十年。
我在研究生阶段和职业生涯早期参与了GPGPU编程的早期阶段。我相信拥有计算密度的飞跃,GPU提供了大量的密集计算和分析核心设备,并允许您在服务器空间中获得更多,并能够将最初用于图形的东西改造为计算引擎,这是HPC和AI社区中真正令人眼前一新的趋势。
然而,所有这些都依赖于将代码转换和优化为在GPU上运行,而不是在CPU上运行。当我们做了所有这些工作时,我们正在等待“杀手级应用”的概念 – 应用程序或使用场景,它真正起飞或被GPU加速。对于GPGPU社区来说,深度学习是那个杀手级应用,它凝聚了努力和开发,加速了HPC和AI工作负载。
随着时间的推移,人工智能和机器学习(ML)经历了一次复兴,深度学习进入了舞台。我们意识到,使用深度学习训练神经网络实际上非常适合GPU的底层设计。我相信,一旦这两件事汇聚,您就有能力进行以前由CPU处理器和最终限制我们在规模和实践中进行人工智能的能力所不可能的深度学习。
一旦GPU进入舞台,它实际上重新激发了研究和开发社区对人工智能和深度学习的兴趣,因为您只没有足够的计算能力来高效地进行,并且它没有被民主化。GPU实际上允许您交付密集的计算,这在其核心上是为深度学习而设计的,并将其带到一个更容易让更多研究人员和科学家使用的硬件架构解决方案水平。我相信这是GPU更适合深度学习的主要原因之一。
什么是Penguin Computing提供的GPU加速计算解决方案?
Penguin Computing目前专注于端到端解决方案,这些解决方案由战略解决方案集团开发,特别是Penguin Computing的AI和分析实践。在这个实践中,我们专注于三种GPU加速解决方案的高级方法。
首先,我们为边缘分析提供参考架构,我们旨在设计适合非传统数据中心(在边缘或近边缘)的解决方案。这可以包括电信边缘数据中心、零售设施、加油站等。这些都是基于推理的AI解决方案。一些解决方案针对视频分析,用于联系人追踪和手势识别,以确定某人是否洗了手或戴了口罩。这些是使用GPU加速硬件的完整解决方案的应用,这些硬件针对非传统或边缘部署进行了优化,以及使研究人员和最终用户能够有效使用它们的软件栈。
Penguin Computing解决方案的下一个类别是为数据中心和核心AI训练和推理参考架构而构建的。您可以想象一下在大型数据中心内或在云中(Penguin Computing Cloud)运行的解决方案,我们的一些客户正在使用成千上万个GPU来加速深度学习。我们研究如何交付完整的解决方案和参考架构,以支持所有这些软件工作负载和容器化,通过GPU设计和布局,所有数据基础设施要求都支持它。
我们实践中的第三类参考架构是前两个的组合。我们正在寻找在第三个参考架构中创建数据织物、路径和工作流,以实现连续学习,以便我们可以使用我们的边缘GPU加速解决方案运行推理,将数据推送到私有或公共云,继续训练,并在新的训练模型更新后,将其推回到推理中。这样,我们就有了一个迭代的连续学习和AI模型循环。
Penguin Computing最近与英特尔和CoolIT合作为LLNL部署了一台新超级计算机。您能否告诉我们关于这台超级计算机及其设计目的?
(INTC )在LLNL部署的Magma超级计算机是通过国家核安全管理局(NNSA)的商品技术系统(CTS-1)合同采购的,并且是英特尔Xeon Platinum 9200系列处理器和CoolIT Systems的完整直接液体冷却和Omni-Path互连的首批部署之一。
由NNSA的高级模拟和计算(ASC)计划资助,Magma将支持NNSA的生命延长计划和确保国家核武器安全、安全和可靠性的关键工作,所有这些工作都在没有地下测试的情况下进行。
Magma超级计算机是一个增强了人工智能的HPC系统,它是一个融合平台,允许人工智能加速HPC建模。Magma在2020年6月的Top500榜单中排名第80位,跻身前100名。
在CTS-1合同下,Penguin Computing已向NNSA三实验室(劳伦斯利弗莫尔、洛斯阿拉莫斯和桑迪亚国家实验室)交付了超过22皮etaflops的计算能力,以支持ASC计划。
Penguin Computing如何支持对抗COVID-19的斗争?
2020年6月,Penguin Computing正式与AMD合作,为美国三所顶级大学(纽约大学、麻省理工学院和莱斯大学)的研究人员提供HPC能力,以帮助对抗COVID-19。
Penguin Computing与AMD的COVID-19 HPC基金会合作,向研究机构提供了大量的计算资源,以加速COVID-19和其他疾病的医学研究。Penguin Computing和AMD正在合作,向纽约大学、麻省理工学院和莱斯大学提供基于场内和云端的HPC解决方案,以提高数百名科学家的研究能力,他们最终将为对新型冠状病毒的理解做出贡献。
由第二代AMD EPYC处理器和Radeon Instinct MI50 GPU加速器提供支持的系统预计每个系统将提供超过1 petaflops的计算性能。通过Penguin Computing的HPC云服务Penguin Computing On-Demand(POD),我们还将为研究人员提供额外的4 petaflops的计算能力。总的来说,这些捐赠的系统将为研究人员提供超过7 petaflops的GPU加速计算能力,可以用于对抗COVID-19。
受助大学预计将利用新的计算能力进行与流行病相关的各种工作负载,包括基因组学、疫苗开发、传播科学和建模。
您还想分享关于Penguin Computing的其他信息吗?
超过二十年来,Penguin Computing一直为高性能和技术计算世界提供定制、创新和开放的解决方案。Penguin Computing的解决方案为组织提供了必要的敏捷性和灵活性,以便他们能够利用计算环境中的最新技术。组织可以专注于将产品和想法推向市场,而不是关注底层技术。Penguin Computing的AI/ML/分析、HPC、DataOps和云原生技术的广泛解决方案可以根据当前需求进行定制和组合,并可以快速适应未来的需求和技术变化。Penguin Computing的专业服务和托管服务可以帮助集成、实施和管理解决方案。Penguin Computing的托管服务可以帮助计算环境的“哪里”,为组织提供所有权选项和灵活性,以便在场内、公共云或专用云、托管或按服务运行。
感谢这次精彩的采访,希望了解更多的读者可以访问Penguin Computing。












