AI 模型与平台
摩尔定律是什么,它如何影响人工智能?
摩尔定律是对经济上有价值的集成电路组件数量呈指数增长的历史观察。它并非物理定律,也不意味着计算机会在固定的时间表上自动翻倍提速。
对于人工智能而言,晶体管密度很重要,因为它能够提供更多的算术单元、存储和互连。但实际进展还取决于架构、数值精度、封装、内存带宽、算法、软件、能耗、制造良率以及可用数据的数量。
要点概览
- 摩尔在1965年的原始文章描述的是一种经济和工程趋势,而非物理保证。
- 时钟频率的提升放缓;现代的性能提升更多来自并行化和专用加速器。
- 人工智能性能往往受限于内存传输和能耗,而不仅仅是算术运算。
- 比较系统时应关注工作负载层面的延迟、吞吐量、质量、功耗和总体成本,而不是晶体管数量。

摩尔实际观察到的内容
戈登·摩尔绘制了领先集成电路中组件数量的趋势,并预测在每个组件的最低成本下会持续快速增长。此后常被概括为大约每两年翻一番,但其表述和测量指标各不相同。
更小的工艺特征可以提升密度并降低部分切换成本,但制造复杂度和经济性决定了该趋势是否仍具价值。节点名称是营销标签,不能直接用于不同代工厂之间的物理比较。
从更快的核心到异构计算
曾经,Dennard 式的电压缩放能够在功耗不成比例增长的情况下提升时钟频率,但这种关系已逐渐减弱。设计者转而采用多核 CPU、GPU、张量单元、芯片块、先进封装以及特定领域加速器。
这种异构性是深度学习的核心。密集的矩阵运算可在并行硬件上高效运行,而 CPU 则负责协调不规则的逻辑和数据移动。如果流水线无法持续供给,最快的组件也无济于事。
内存、精度与算法
在训练和推理过程中,权重、激活和缓存数据会在芯片内外存储层次之间反复移动。带宽、容量、局部性和通信往往主导成本。当质量仍可接受时,降低数值精度和量化可以减少数据移动。
算法改进可以降低实现目标结果所需的计算量。稀疏模型、Transformer 效率方法、更好的优化器以及更高质量的数据都会影响用户实际感受到的进展。
如何比较人工智能硬件
每秒峰值运算次数是理论值。应使用具有代表性的模型、批大小、序列长度、精度、软件栈和质量阈值进行评估。报告端到端延迟、吞吐量、能耗、内存占用、利用率和成本。
边缘系统可能更看重隐私和低功耗,而非最大吞吐量;数据中心则可能优先考虑每瓦特产生的总令牌数或样本数。边缘 AI阐明了为何单一的 headline 数字无法描述所有有用的系统。
为何半导体规模化发生了变化
早期的集成电路进步得益于更小的器件、更好的制造工艺、更低的每元件成本以及设计改进。多年来,晶体管尺寸的缩小也带来了更快的开关速度和更低的每次运算能耗。最终,泄漏、电压限制、热密度、互连延迟以及制造成本削弱了新工艺节点与更快通用核心之间的简单关联。
因此,现代的进步是多维度的。FinFET 与全环绕栅极器件提升了电静态控制;极紫外光刻技术支持更小的图形;芯片块使设计者能够将不同工艺制造的裸片组合在一起;先进封装将计算单元与存储更紧密地放置。良率和封装决定了技术上令人印象深刻的设计在大规模生产时是否具备经济性。
单一尺度化机制的放缓并不意味着硬件停止进步,而是要求架构师更有针对性地使用晶体管。专用单元在特定工作负载上以牺牲灵活性为代价换取吞吐量或效率,而更大的缓存和互连则致力于为这些单元提供持续供给。
AI 工作负载如何对硬件施压
训练过程在前向计算、反向传播、优化器更新以及加速器之间的通信之间交替进行。推理则从批量评分到交互式令牌生成不等。矩阵乘法固然重要,但嵌入、归一化、激活函数、注意力、路由、缓存访问以及主机编排等都对实际性能产生影响。
算术强度——即每移动一个字节所执行的计算量——有助于解释工作负载是受计算还是受带宽限制。小批量和自回归解码常导致算术单元利用率不足,因为需要反复获取权重或缓存数据。增大批量可以提升利用率,但会增加延迟和内存需求。
数值格式改变了这种权衡。FP32、BF16、FP16、FP8 以及整数格式在范围、精度、硬件支持和误差方面各不相同。混合精度训练在更高精度下保留关键操作;量化推理则需要校准和质量测试,而不能假设所有模型都能容忍相同的位宽。
系统经济学与未来方向
AI 的总体成本包括加速器的采购或租赁、供电、散热、网络、存储、软件工程、闲置容量以及失败的实验。如果利用率低下或模型需要昂贵的分布式拓扑,即使芯片更快,总成本也可能更高。应在定义的质量阈值下衡量有用的产出。
规模化同样受数据和算法的限制。更多的计算无法修复标注错误的数据或奖励捷径的评估。高效的注意力机制、更好的优化器、稀疏性、检索、蒸馏以及算法创新可以在不成比例增加硬件的情况下提升结果,尽管它们可能将成本转移到其他方面。
未来的系统将把工艺进步与三维堆叠、高带宽存储、光学或先进电气互连、特定领域数据流以及协同设计的软件相结合。摩尔定律仍是有价值的历史背景,但规划时应依据实际测量的工作负载曲线以及现实的供应、能耗和部署约束。
在 AI 系统设计中正确解读摩尔定律
有价值的分析应将晶体管密度、通用 CPU 性能、加速器吞吐量、内存容量、内存带宽、互连、能耗、制造良率和成本等因素分开考虑。这些因素的提升速率并不相同。若 AI 工作负载主要受模型权重移动限制,则更多算术单元带来的收益有限;而小型芯片上模型则能显著受益于专用低精度硬件。应引用具体的指标、精度、工作负载和功耗范围,而不是把工艺节点等同于性能。
扩展 AI 模型还会改变软件和系统需求。更大的训练任务需要并行算法、可靠的检查点、极速网络、存储流水线以及足够的数据以利用新增容量。推理时,延迟取决于提示长度、生成的令牌数、批处理、缓存以及服务级别目标。算法改进、稀疏化、量化、检索和更优数据能够带来与晶体管趋势无关的提升,有时甚至超过一次硬件代的进步。
在规划时,应在候选系统上对具有代表性的模型进行基准测试,并对部署全生命周期的总体成本进行建模: 采购或云服务费用、功耗、散热、利用率、工程投入、迁移以及供应风险。使用情景分析而非单一的指数预测。摩尔定律仍是关于集成经济学的有价值历史观察,但它并不保证人工智能会在固定时间表上实现成比例的更快、更便宜、更强大或更可持续。
实际实施清单
将概念转化为有界且可测试的工作流: 晶体管 → 并行化 → 加速器 → 内存 → 软件 → 工作负载。指定负责人,记录数据和依赖关系,建立简易基线,设定接受和停止标准,测试代表性故障,并在扩展范围前定义监控、回滚和审查。记录版本和假设,以便其他团队能够复现结果并了解变更情况。
上线前,需与构建、运营、保障以及受系统影响的人员进行有文档记录的就绪审查。测试正常情况、边界条件、依赖故障和误用;保存证据和未解决的风险。明确谁有权批准发布、修改阈值、覆盖输出或停止运行。实际数据到来后重新评估决策,因为技术上成功的试点并不保证在更大规模下的可靠性能。
- 密度: 芯片面积内提供更多能力。
- 效率: 精度、局部性和专用化。
- 真实结果: 单位时间、能量和成本下的质量。
常见问题
摩尔定律已经结束了吗?
这一简单的历史趋势已经放缓并改变了特性,但半导体进步仍在通过器件、架构、封装、存储和软件等方面持续进行。该说法是否仍适用取决于所使用的指标。
晶体管数量翻倍就意味着 AI 性能翻倍吗?
不。性能取决于晶体管的使用方式以及带宽、精度、模型结构、软件效率、功耗和工作负载限制。












