AI 模型与平台

Arm 推出 Mali G2-Ultra NX,首款原生 AI 移动 GPU

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Arm 于 2026 年 9 月 8 日推出了 Mali G2-Ultra NX,这是其首款在着色器核心中直接集成专用神经加速器的 Mali GPU,相关信息发布在高级产品经理 Deyan Lazarov 的新闻稿中。该 GPU 是 Arm CSS for Mobile 2 的图形组件,后者是公司同日宣布的面向下一代移动设备的计算平台。

着色器核心内部的神经加速

Mali G2-Ultra NX 将神经加速器置于着色器核心内部,使神经图形工作负载能够与传统图形和计算工作并行运行。此集成复用 GPU 的内存系统、统一缓存和控制结构,Arm 表示这可以减少管线中的数据移动。产品页面称该加速块支持 INT8 和 INT16 处理,并具备光流加速功能。

Arm 详细介绍了内置于 GPU 的三项神经图形技术。神经超采样(Neural Super Sampling,简称 NSS)可从低分辨率渲染重建出更高分辨率的图像,降低生成最终图像所需的传统渲染工作量。神经帧率提升(Neural Frame Rate Upscaling,简称 NFRU)通过生成中间帧来提升显示帧率。神经超采样与去噪(Neural Super Sampling and Denoising,简称 NSSD)将神经上采样与去噪相结合,适用于光线追踪场景中的复杂光照和阴影。

Neural Dawn 是由 Arm 与 Sumo Digital 开发的游戏,展示了 NFRU 与 NSSD 如何融入制作流水线。Arm 表示,与原生渲染相比,该游戏的性能效率提升最高可达 4 倍,外部内存流量降低最高可达 70%,公司称这些收益使得诸如 Unreal Engine MegaLights 等技术在移动硬件上变得可行。Arm 于 2026 年 6 月首次展示 Neural Dawn;该游戏计划于 2026 年晚些时候在搭载即将发布的 Mali GPU 的 Android 设备上推出。

全新执行引擎与第三代光线追踪

除了神经硬件外,GPU 还引入了全新的执行引擎,Arm 将其描述为七代以来 Mali GPU 指令集架构的最大升级。该引擎每个 warp 提供的寄存器数量提升至原来的两倍,公司称此改动为开发者在处理复杂场景时提供了更大的余量,同时保持帧率稳定。

Arm 报告称,这些架构改进使基准性能提升最高可达 24%,游戏性能提升 14%,相较前一代。结合 NFRU,公司表示该 GPU 可支持最高 120 帧每秒的移动游戏体验。产品页面的脚注指出,这些对比基于对前代的比较,并依据 2026 年 3 月至 8 月期间的内部测试得出。

第三代光线追踪单元支持更复杂的光照、阴影、反射和几何形状。Arm 表示,该单元在主流光线追踪基准测试中可将 DRAM 流量降低最高 13%。对不透明微映射(Opacity Micromaps)的硬件支持能够更高效地处理植被和分层表面等透明几何体,在一次 Arm 演示中提升了 30% 的帧率,并将光线追踪工作负载削减最高 70%。

开发者生态与游戏采纳

Arm 表示,早在硬件发布两年前就已开始准备软件生态系统,推出了 Arm Neural Technology 以及面向神经图形的开放开发套件。Arm Neural Graphics Development Kit 目前提供 NSS 与 NFRU、Vulkan 的机器学习扩展,以及包括 Unreal Engine 在内的游戏引擎插件。该 SDK 支持自定义引擎集成,并配备性能分析、训练和模型优化工具,完善了整套开发堆栈。

网易的《Where Winds Meet》是首批搭载该技术的游戏之一。该作的引擎负责人周可莉表示,工作室正在将 Arm Neural Technology 整合进其 Messiah 引擎,并称该游戏“将成为首批向玩家引入 Arm Neural Technology 的作品”。

CSS for Mobile 2 宣布中,Arm 表示腾讯游戏中心技术的 MagicDawn 和 Unity 中国的团结引擎也在整合 Arm Neural Technology,同时展示了使用腾讯游戏《Arena Breakout Infinite》的 NSSD 示例以及与 Infold Games《Infinity Nikki》的 NSS 集成。该平台将 GPU 与 Arm C2 CPU 集群、增强的系统 IP 以及面向构建下一代移动芯片的硅合作伙伴的物理实现相结合。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。