AI 模型与平台
利用硅:如何开发内部AI芯片以塑造AI的未来
人工智能,像任何软件一样,依赖于两个基本组件:人工智能程序(通常称为模型)和驱动这些程序的计算硬件(或芯片)。到目前为止,AI开发的重点一直在于完善模型,而硬件通常被视为第三方供应商提供的标准组件。然而,最近这种方法开始发生变化。像谷歌、Meta和亚马逊这样的主要AI公司已经开始开发自己的AI芯片。内部开发定制AI芯片正在开启AI发展的新时代。本文将探讨这种方法转变的原因,并将强调这一不断发展领域的最新进展。
为什么内部开发AI芯片?
向内部开发定制AI芯片的转变是由几个关键因素驱动的,包括:
AI芯片的日益增长的需求
创建和使用AI模型需要大量的计算资源来有效地处理大量数据并生成精确的预测或见解。传统的计算机芯片无法处理训练在数万亿个数据点上的计算需求。这一限制导致了专门为满足现代AI应用的高性能和效率需求而设计的尖端AI芯片的诞生。随着AI研究和开发的不断增长,对这些专用芯片的需求也在不断增长。
Nvidia (NVDA ) ,一家领先的高级AI芯片生产商,远远领先于其竞争对手,但它面临着挑战,因为需求远远超过其制造能力。这一情况导致了Nvidia的AI芯片的等待时间延长到几个月,这一延迟继续增长,因为对其AI芯片的需求激增。此外,芯片市场,包括Nvidia和Intel (INTC ) 等主要玩家,面临着芯片生产的挑战。这一问题源于他们对台湾制造商台积电(TSMC)进行芯片组装的依赖。这一对单一制造商的依赖导致了制造这些高级芯片的延长交货时间。
使AI计算更加节能和可持续
当前一代AI芯片,由于其设计用于重负荷计算任务,往往会消耗大量的电力,并产生大量的热量。这导致了训练和使用AI模型的重大环境影响。OpenAI的研究人员指出,自2012年以来,训练高级AI模型所需的计算能力每3.4个月就增加了一倍,到2040年,信息和通信技术(ICT)部门的排放量可能占全球排放量的14%。另一项研究表明,训练一个大型语言模型可以产生多达284,000公斤的二氧化碳排放量,这大约相当于五辆汽车在其整个生命周期中的能耗。此外,预计数据中心的能耗将在2030年之前增长28%。这些发现强调了在AI开发和环境责任之间找到平衡的必要性。为了应对这一挑战,许多AI公司现在正在投资开发更加节能的芯片,以使AI训练和运营更加可持续和环保。
为专门任务定制芯片
不同的AI过程具有不同的计算需求。例如,训练深度学习模型需要大量的计算能力和高吞吐量来处理大型数据集并快速执行复杂的计算。为训练而设计的芯片被优化以增强这些操作,提高速度和效率。另一方面,推理过程,即模型应用其学习到的知识来进行预测,需要快速处理和最小化能耗,特别是在边缘设备如智能手机和物联网设备中。为推理而设计的芯片被工程化以优化每瓦特的性能,确保快速响应和电池保护。这种芯片设计的专门化不仅支持更强大的AI功能,还促进了更大的能效和成本效益。
减轻财务负担
AI模型训练和运营的计算成本仍然很高。OpenAI使用微软创建的超级计算机进行训练和推理,自2020年以来,训练其GPT-3模型的成本约为1200万美元,而训练GPT-4的成本则激增至1亿美元。根据SemiAnalysis的一份报告,OpenAI需要大约3617台HGX A100服务器,总共28936个GPU来支持ChatGPT,每个查询的平均成本约为0.36美元。考虑到这些高昂的成本,OpenAI的CEO Sam Altman据报道正在寻求大量投资来建立全球AI芯片生产设施网络,根据彭博社的一份报告。
掌握控制和创新
第三方AI芯片通常带有限制。依赖这些芯片的公司可能会发现自己受到标准化解决方案的限制,这些解决方案并不完全符合他们独特的AI模型或应用。内部芯片开发允许根据特定用例进行定制。无论是用于自动驾驶汽车还是移动设备,控制硬件使公司能够充分利用其AI算法。定制芯片可以增强特定任务,减少延迟并提高整体性能。
AI芯片开发的最新进展
本节将探讨谷歌、Meta和亚马逊在AI芯片技术方面的最新进展。
谷歌的Axion处理器
谷歌在AI芯片技术方面取得了显著进展,自2015年推出Tensor Processing Unit(TPU)以来。基于这一基础,谷歌最近推出了Axion处理器,这是其首款专门为数据中心和AI工作负载设计的定制CPU。这些处理器基于Arm架构,以其高效和紧凑的设计而闻名。Axion处理器旨在提高CPU基础AI训练和推理的效率,同时保持能效。这一进展还标志着对各种通用工作负载(包括Web和应用服务器、容器化微服务、开源数据库、内存缓存、数据分析引擎、媒体处理等)的性能显著提高。
Meta的MTIA
Meta正在推进AI芯片技术的发展,推出了Meta Training and Inference Accelerator(MTIA)。该工具旨在提高训练和推理过程的效率,特别是对于排名和推荐算法。最近,Meta概述了MTIA如何成为其加强AI基础设施的关键部分,超越GPU。最初计划于2025年推出,Meta已经将MTIA的两个版本投入生产,表明其芯片开发计划正在加速。虽然MTIA目前专注于训练某些类型的算法,但Meta计划扩大其使用范围,以包括训练生成式AI,如其Llama语言模型。
亚马逊的Trainium和Inferentia
自2013年推出其定制Nitro芯片以来,亚马逊已经显著扩展了其AI芯片开发。该公司最近推出了两款创新AI芯片:Trainium和Inferentia。Trainium专门设计用于增强AI模型训练,并将被集成到EC2 UltraClusters中。这些集群可以容纳多达100,000个芯片,针对训练基础模型和大型语言模型进行优化,以实现能效。Inferentia则针对推理任务进行优化,在AI模型被积极应用时,专注于降低推理的延迟和成本,以更好地满足数百万用户与AI服务交互的需求。
结论
像谷歌、微软和亚马逊这样的主要公司转向内部开发定制AI芯片,反映了一个战略转变,以应对AI技术日益增长的计算需求。这一趋势强调了需要专门为高效支持AI模型而设计的解决方案,以满足这些先进系统的独特需求。随着对AI芯片的需求持续增长,行业领先者如Nvidia可能会看到显著的市场价值增长,凸显了定制芯片在推动AI创新方面的重要作用。通过创建自己的芯片,这些科技巨头不仅提高了其AI系统的性能和效率,还促进了一个更加可持续和成本有效的未来。这一演变正在为该行业设定新的标准,推动技术进步和快速变化的全球市场中的竞争优势。 (GOOGL ) (AMZN ) (MSFT )












