AI 模型与平台
阿贡国家实验室推出大规模人工智能推理服务,用于开放科学

多年来,建造更大的人工智能模型一直占据着头条新闻,但科学计算中最大的挑战之一仍然未得到解决:研究人员如何在不建立自己的昂贵基础设施的情况下在大规模上使用先进的人工智能系统。
这是阿贡国家实验室正在尝试解决的问题,通过推出据称是为开放科学设计的第一个大规模人工智能推理服务。
该服务由阿贡领导计算设施(Argonne Leadership Computing Facility,简称ALCF)开发,提供云式访问大型语言模型、科学基础模型和计算机视觉系统,这些系统直接运行在阿贡的高性能计算基础设施上。与其训练自己的模型或管理专用硬件集群,科学家可以使用优化了大规模研究工作流程的共享推理平台。
为什么人工智能推理对科学至关重要
人工智能的讨论大多集中在模型训练上,但推理是人工智能系统变得实用有用的阶段。人工智能推理是训练模型分析数据、生成预测、解释结果或在实时帮助决策的阶段。
对于科学研究,推理可以显著加快实验的步伐。来自粒子加速器、望远镜、聚变实验、基因组学项目和分子模拟的庞大数据集通常会让传统的分析管道不堪重负。人工智能推理系统可以快速解释这些数据集,帮助研究人员识别出可能需要数周或数月才能发现的模式或异常。
阿贡的新服务旨在通过提供集中资源而不是要求每个机构部署自己的人工智能堆栈来消除一个主要瓶颈。
阿贡领导计算设施(ALCF)主任迈克尔·帕普卡(Michael Papka)将这一举措描述为从提供原始计算能力转向提供集成的人工智能启用的科学服务的转变。
国家人工智能基础设施用于研究
推理服务与美国能源部更广泛的创世使命(Genesis Mission)密切相关,这是一项国家倡议,旨在通过人工智能驱动的基础设施加速科学发现。该使命旨在将超级计算机、科学仪器和大规模数据集连接到一个统一的人工智能生态系统中,以支持下一代研究。
阿贡的系统已经支持来自多个美国能源部实验室的研究人员,包括布鲁克黑文国家实验室、劳伦斯伯克利国家实验室、橡树岭国家实验室和洛斯阿拉莫斯国家实验室。更广泛的愿景是创建一个互联的国家研究平台,在那里人工智能工具、实验数据和超级计算资源可以无缝地协同工作。
这在科学人工智能工作负载日益涉及代理工作流(agentic workflows)方面尤为重要,在这些工作流中,模型反复与模拟系统、数据库和分析工具交互。这些工作流可以在商业人工智能平台上运行时产生巨大的令牌消耗和计算成本。阿贡的基础设施旨在支持这些工作负载,以满足科学应用的内部需求。
平台背后的技术
该服务提供了多个模型家族的访问权限,包括谷歌的Gemma模型、Meta的LLaMA家族和OpenAI的GPT-OSS系统,以及特定领域的科学基础模型和内部开发的系统,如AuroraGPT。
AuroraGPT尤其值得注意,因为它代表了阿贡更广泛的雄心壮志,即建立专门针对科学文献、数据集和多模态研究输入的训练人工智能系统。该项目已经探索了针对科学推理和高性能计算环境优化的极大规模架构。
基础设施本身运行在专用的ALCF系统上,包括Sophia和Metis,并计划在未来扩展到名为Tara和Minerva的NVIDIA驱动系统上。
超越聊天机器人:真正的科学应用
虽然公众对人工智能的讨论经常围绕着对话式助手,但阿贡的重点却坚定地放在了研究加速上。
在聚变能研究中,推理模型可以实时监测等离子体行为,并可能在其发生之前预测中断。在天文学和粒子物理学中,人工智能系统可以更高效地分析大量的望远镜或碰撞器数据,以识别罕见事件。在化学和材料科学中,推理系统可以协调复杂的分子模拟,并自动化大规模的计算工作流程。
阿贡强调的一个例子是ChemGraph,这是一种人工智能驱动的框架,旨在简化分子模拟工作流程。该系统使用重复的人工智能工具调用交互来协调模拟、数据分析和迭代实验,以实现更连贯的工作流程。
更广泛的含义是,科学计算正在从孤立的超级计算作业演变为持续交互的人工智能辅助研究环境。
阿贡在人工智能基础设施中的日益增长的作用
阿贡国家实验室成立于1946年,长期以来一直是美国最重要的科学研究机构之一,特别是在高性能计算、能源系统、材料科学和核研究方面。该实验室在美国能源部下运营,并在几代美国超级计算倡议中发挥了核心作用。
近年来,阿贡在科学人工智能开发方面变得越来越有影响力,尤其是在与exascale计算和大型科学基础模型相关的项目中。ALCF本身拥有该国最先进的计算系统,包括Aurora,这是世界上最快的超级计算机之一。
推理服务的推出反映了学术界和企业计算领域正在发生的一场更大转变:从独立的人工智能模型转向能够支持连续、大规模推理工作负载的集成人工智能基础设施平台。
对于科学研究来说,这种转变可能会显著压缩原始数据生成和有意义的发现之间的时间线。












