合作伙伴
NVIDIA 详细阐述 Skild AI 与 S1 机器人基础模型背后的合作

NVIDIA 于 2026 年 9 月 10 日详细说明了 Skild AI 如何在 NVIDIA AI 基础设施上构建其 S1 机器人基础模型,并表示该机器人公司在首次商业部署后 10 个月实现了 1 亿美元的年收入跑道。
在 NVIDIA 博客文章 中,公司表示 Skild 在其基础设施上构建了 S1 并开展了相关研究,这属于涵盖合成数据生成、模型训练、仿真以及真实世界物理 AI 部署的更广泛合作的一部分。Skild AI 的联合创始人兼 CEO Deepak Pathak 说:“通过经验学习,而非预先编程,是机器人领域发生的根本性变革。”他补充道,NVIDIA Isaac Lab 和 NVIDIA Cosmos 帮助 Skild 为其机器人提供可扩展、多样化的体验,以便在众多场景和形态中学习。两家公司表示,他们正致力于将可适应的机器人智能从实验室搬入工厂及其他动态运行环境。
从单个视频学习未见任务
Skild 在一篇 2026 年 8 月 18 日的研究文章 中推出了 S1,将其描述为从头构建的机器人基础模型,具备上下文学习能力。该模型以任务的视频演示作为输入,并在不更新权重或进行任务特定后训练的情况下执行任务。Skild 称 S1 为首个在长时程任务(最长可达 10 分钟)上展示上下文学习的机器人基础模型,这些任务在预训练期间从未出现过。
操作员记录下所需任务的视频并将其作为提示提供给模型。模型解释演示中的意图、物体和顺序,然后将其映射为机器人前方的动作,无需重新训练,且常常针对其预训练数据集未覆盖的任务。根据双方公司透露,S1 能执行包括植物栽培、煎饼制作、手冲咖啡冲泡以及套件组装等不熟悉的任务,这些工作涉及数十个操作步骤,需要在模型之前未执行过的序列中组合技能。
在 Skild 的研究文章中记录的一个植物栽培测试中,土壤、花盆、浇水壶和植物于晚上 8:54 抵达办公室,录制于 9:16 开始,9:22 记录了一段第一人称的人类视频演示,S1 于 9:27 在硬件上开始自主执行任务。Skild 表示,从演示到自主执行的时间为 11 分钟。
Skild 报告称,S1 能在任务进行中物体被移动时进行调整,能够从错误中恢复,并在需要时替换具有相同功能的物体,例如在演示中使用浇水壶的情况下,模型使用了一杯水。该公司还指出,模型有时会改进有缺陷的演示,将演示视为目标规范而非需复制的轨迹。
针对语言提示策略的报告结果
NVIDIA 的文章报告称,在 Skild 对新多步骤任务的测试中,S1 在每一步的成功率约为 66%,而类似的 AI 系统仅为 9%,NVIDIA 将这一差距描述为超过七倍的提升。Skild 的研究文章将此对比描述为针对语言提示 VLA 策略的受控研究,该策略通过语言而非演示获取任务规范。两种策略在相同的数据、架构和计算资源下进行训练,预训练数据集时长从 1,000 小时到 100,000 小时不等,且根据 Skild 的说法,这 66% 与 9% 的数值是在 100,000 小时、未见长时程任务上记录的。
在预训练期间已见过的任务上,Skild 报告称,在最大规模下上下文学习的成功率达到 96%,而在 1,000 小时时,语言条件策略得分为 53%,上下文学习为 43%。Skild 还在五个分布转移层级上评估了鲁棒性,报告称在最严苛的条件下——机器人一半的动作必须用另一只手臂执行——语言提示策略的性能下降幅度是上下文策略的三倍。
关于演示效率,Skild 估计单个上下文视频相当于约 380 次后训练情景,该数值是基于测量点之间的插值得出,并报告称收集 380 条长时程演示耗时 50 至 100 小时的遥操作。根据 Skild,经过后训练的基线在拥有 2,000 条演示后最终达到了 86% 的成功率。
商业牵引力与富士康部署
NVIDIA 的文章指出,Skild 已建立超过 60 家部署合作伙伴,业务涵盖制造、物流、检测、安全、食品准备等多个应用领域。
在工厂车间,Skild、NVIDIA 与富士康正将 Skild Brain 部署在双臂机械手上,用于 NVIDIA Blackwell 系统的高精度装配。在一次演示的工作流程中,机器人安装母线和限位块,拧紧 16 颗螺钉,并在多步骤任务中适应扰动。NVIDIA 的文章称,此工作需要精确的运动、接触感知控制、序列跟踪以及当现场与计划不符时的恢复能力。
Skild 最早在一篇 2026 年 3 月 19 日的文章 中宣布了 Blackwell 生产线计划,并披露了与 ABB Robotics、Universal Robots 与 Mobile Industrial Robots 的合作关系。在该公告中,Skild 将装配序列描述为富士康产线上由人工执行的真实任务,最后移除限位块,并称其大脑已通过少量机器人数据对该工作流程进行微调。
S1 背后的 NVIDIA 技术栈
据 NVIDIA 称,其 Cosmos 开放世界基础模型帮助 Skild 多样化训练数据并将视频转化为结构化描述,而 Cosmos Curator 则用于大规模标注、过滤和组织数据。NVIDIA Omniverse 库和 Isaac Sim 框架提供基于物理的虚拟环境,用于生成数据、测试极端案例并在真实部署前验证行为。
Skild 在 Isaac Lab 中使用强化学习,这是一套由 Newton 物理引擎驱动的开放模块化 机器人学习 框架,用于建模诸如力、接触、碰撞和压力等物理参数,以缩小仿真与现实之间的差距。随着模型向生产迈进,NVIDIA Nsight 工具帮助工程师在训练期间发现性能瓶颈,而 TensorRT 软件开发套件则优化推理,使机器人能够在物理世界中快速响应。
Skild 与 NVIDIA 还在联合开发 GPU 加速的仿真求解器,用于模拟机器人在物理上如何触碰、抓握和操作固体物体。两家公司表示,这些求解器将很快作为 Newton 的一部分向所有开发者开放。












