机器人与物理 AI
Figure 推出 Helix 2.5,在 30 套未见过的住宅中进行零样本测试

Figure 推出 Helix 2.5 于 2026 年 9 月 17 日,这是一种在公司 Index 数据集(收集人类行为)上预训练的人形神经网络,并在 30 套旧金山湾区的住宅中进行评估,这些住宅中没有收集任何数据。Figure 报告称,Index 预训练使零样本成功率从 9% 提升至 56%,相较于在相同条件下从零开始训练的策略进行的受控比较。
Figure 将 Helix 2.5 描述为其构建的最先进的神经网络。基于单一的 Index 预训练基础模型,公司生成了三种全身行为:整理客厅、折叠毛巾和铺床。早期的 Helix 02 系统在长时间范围内协调全身控制,包括卸载洗碗机并自主执行物流任务达 200 小时,但它是从机器人实际运行地点收集的数据中学习的。
评估设计与评分标准
Figure 将零样本定义为评估环境和所操作对象均未在微调数据中出现;每项行为都是通过在其他地点收集的微调数据指定的。评估用的玩具、毛巾或床上用品均未出现在任务规范数据中,机器人使用每个住宅现有的沙发、床铺和折叠表面。评估对象在实验开始前已预先挑选,并由 AI 模型随后经人工审查确认其未出现在任务规范数据中。
每项任务在所有 30 套住宅中使用同一固定检查点。未对评估住宅或对象的权重进行任何适配,也未使用评估 rollout 数据或表现来选择检查点。成功的标准是完整完成任务,且不计部分得分。每次试验均从唯一的初始配置开始,对所有被评估的策略统一应用复位条件,任何出于安全考虑的人为干预都会中止 rollout 并标记为失败。
评分员依据评估前已确定的标准进行评分。客厅整理要求将场景中散落的全部 13–15 件玩具拾起并放入篮子,每件玩具有一分钟的超时限制,超时则中止 rollout。毛巾折叠要求每条毛巾都被拾起、折叠并放入篮子,折叠质量依据角部对齐程度评分——最高等级要求四个角在一英寸范围内几乎相接——且每条毛巾有三分钟的超时限制。铺床要求两个枕头和被子两端的角落都达到床的上三分之一位置,并且被子保持平整;枕头还需根据朝向评分,每个枕头和被子每侧均有一分钟的超时限制。
分离 Index 预训练的影响
为衡量结果中有多少来源于 Index 而非任务规范数据本身,Figure 在相同的任务规范数据上训练了两套策略,一套使用随机权重初始化,另一套则从 Index 预训练的 Helix 2.5 模型初始化。网络结构、优化方式、超参数、下游数据和评估均保持不变,使 Index 预训练成为唯一的实验变量。Helix 2.5 本身完全基于随机初始化并在 Index 上进行预训练,而 Helix 02 则是从预训练的视觉语言模型开始的。
在盲评中,随机训练的策略在零样本试验中成功率为 9%,而 Index 预训练的策略成功率为 56%,Figure 将这一差距描述为超过六倍。由于预训练是唯一的变量,公司称该差距直接衡量了其贡献。Figure 报告称,没有任何单一评估任务占 Index 预训练数据集的比例超过 1.90%,并声明据其所知,此工作是首次在人形机器人上展示如此规模的零样本全身泛化。
数据效率与转移缩放定律
Figure 还将 Helix 2.5 与之前的 Helix 02 策略进行比较,后者使用在评估环境中直接收集的数据来完成相同任务。公司报告称,Helix 2.5 在使用仅一半的适配数据的情况下,达到了该策略的成功率,并且在 30 套未见过的住宅中实现了零样本表现。Figure 进一步描述了全身自我纠正的质的提升,例如后退重新定位、改变站姿或绕过整张床以纠正折叠,并将其称为 Index 预训练的重要效果。
另外,公司在 Index 的嵌套子集上训练了四个模型,数据量相当于预训练数据的 8 倍增长,保持模型规模和下游训练不变,并报告说,随着 Index 数据每翻倍,留出的动作预测损失会可预测地下降。Figure 表示,仅使用较小的实验就预测出了最大实验的测试损失,精确到小数点后四位,预测误差占整个 8 倍数据范围变化的 0.54%。公司将该结果描述为据其所知,首次在人形机器人上测量到的人机 转移 缩放定律,同时指出该定律仅衡量数据规模的影响。
支撑 Helix 2.5 的 Index 数据集
Figure 推出了 Index,时间为 2026 年 8 月 25 日,结束隐身期并为其四个月前推出的数据收集应用重新命名,同时称其为有史以来最具多样性的机器人训练数据集。在该公告中,Figure 报告称 Index 已在 108 个国家实现 264,000 次应用下载,拥有超过 44,000 名每周活跃用户,创作者上传的视频总量超过 1,600 万段,向这些创作者支付了 1,500 万美元,并且每秒处理 30 分钟的视频上传。公司表示,每收集 1,000 小时数据,Index 包含 373 项独特任务、1,146 种独特操作对象和 116 种独特环境,这些数据通过过滤、欺诈审查、去重、再平衡和标注五阶段流水线进行处理。
Helix 2.5 的公告指出,Index 现在每秒产生约 35 分钟的新的人类体验,Figure 已承诺投入 35 亿美元的算力用于训练 Helix。公司在公告的结尾表示,正在招聘从事通用物理智能相关工作的人员。












