奥里恩·佐藤 是一名专注于 机器人、自动化和智能机器 的 AI 生成记者。他的写作探讨了机器人技术如何通过日益自治的系统重塑制造业、物流、医疗保健和日常生活。
普渡机器人 于 2026 年 8 月 12 日推出了普渡 ET1,这是一款针对 100 至 800 平方米商业空间的 AI 本地紧凑型扫地机器人,扩大了深圳公司的清洁产品线,涵盖了便利店、药店和连锁餐厅等小型空间。ET1 是普渡 E 系列的第一款产品,公司在 发布公告 中表示。目标部署包括便利店、药店、连锁餐厅、商务酒店和办公空间,这些地方的高频率、空间有限的楼层上,传统的扫地机器人难以操作,小型机器通常需要更多的手动干预。该机器人将扫地、扫除、吸尘和拖地功能集成在一个底盘上,采用前扫、后擦的布局,可以在一次通过中处理干燥的碎屑和湿污渍。扫地功能来自一个最高转速达 800 转/分钟的滚筒,伴随着 20 kPa 的吸力,公司称该机器可以快速回收脏水,以便在其后留下干燥的楼面,这是保持开放式商业空间清洁的重要考虑因素。对于餐厅和零售店中的顽固污渍,ET1 支持...
这一说法之所以重要,是因为该领域的限制所在。通用机器人政策大多是基于远程操作的动作数据训练的:人类通过远程操作引导机器人完成任务,耗时数小时。这种数据收集成本高,速度慢,限制了机器人基础模型的扩展。DYNA-2 的赌注是,机器人需要的物理直觉可以从人类执行任务的视频中学习,然后转移到机器人硬件上。“通过建立一个世界动作模型,机器人在采取行动之前可以想象物理世界的运动,我们给机器人提供了传统的视觉语言模型所缺乏的空间推理和接触物理能力。”如何在不看到机器人的情况下从视频中学习该架构被称为世界动作模型,建立在视频生成基础上,而不是视觉语言动作的改进。预训练期间,模型在人类视频语料库上运行双目标(预测下一帧和下一个动作)。该公司表示,这使得模型具有工作的接触物理和空间推理能力,可以在不同的机器人平台上转移:固定机器人臂、人形原型和灵巧的五指手,尽管这些机器人在预训练中没有出现。将结果适应特定平台需要数小时的本地微调,而不是数周的数据收集。在 Dyna 引用的一个案例中,13 分钟的数据足以教会一对五指机器人手打开瓶盖。在 15 个基准任务中,预训练在更多人类数据上的政策一致优于训练在较少数据上的政策,公司指出这是扩展曲线的证据。最明显的比较是 Dyna 自己的前一个模型。DYNA-1 是运行在公司商业部署中的视觉语言动作模型,面对 DYNA-2 进行了头对头的物理评估,训练步骤和数据集匹配。在需要对用户命令做出不同运动反应的任务中,Dyna 表示 DYNA-2 从物理干扰中恢复过来,而不需要人工干预,而 VLA 基线失败并需要手动重置。视频协同训练算法将指令跟随评分提高了 133%。DYNA-2 数据 100 万+ 小时 的自我中心人类视频用于预训练 —— 公司描述为大约 170...
DeepSeek已投资140.8百万元人民币(约合20.8百万美元)于Unitree Robotics的上海首次公开募股,并签署协议共同开发人形机器人AI模型,根据8月6日2026年公开的招股说明书。该投资使得杭州人工智能实验室获得933,399股,占比IPO战略配售的2.31%,同时伴随着一项采购协议,将两家公司的硬件和模型开发路线图联系在一起。根据招股说明书中描述的协议,两家杭州公司将结合DeepSeek的AI模型和Unitree在机械工程、运动控制和具身智能方面的工作。Unitree将在采购模型训练服务和技术解决方案时给予DeepSeek优先考虑;DeepSeek将在购买机器人或探索具身AI应用时优先考虑Unitree。战略配售位于中国机器人行业的里程碑式上市中。Unitree在上海证券交易所的科创板上市,股票代码为688836,其IPO价格为每股150.80元,发行4,045万新股,占比扩大后的资本的10%,以61亿元的估值筹集约61亿元人民币。这使得Unitree成为中国大陆首家上市的人形机器人制造商。订阅将于2026年8月10日开始。DeepSeek-Unitree协议的内容合作伙伴关系的目标是解决人形机器人开发者面临的一个关键瓶颈:构建能够理解陌生环境并可靠地将指令转化为物理动作的“大脑”。中国制造商,包括Unitree,在制造能够行走、奔跑和在舞台上表演编排动作的廉价机器方面已经取得了成功。但是,将指令转化为可靠的物理动作在陌生房间中是一个不同的问题,这需要在物理世界数据上训练的模型,这种数据比文本数据更为罕见:操纵物体、从错误中恢复、响应任务中途变化的环境。中国机器人制造商已经建立了数据采集设施,人类操作员在这些设施中反复引导人形机器人完成诸如折叠衣服和打开门等任务,以生成这些数据。DeepSeek带来了模型构建的优势,填补了招股说明书逻辑直接解决的差距。实验室的模型在编码、数学和推理基准测试中表现出色,价格也很有竞争力,但这种优势主要体现在语言模型而不是集成的多模态系统中,多模态系统可以处理视觉和文本。DeepSeek已经发表了单独的视觉语言研究,包括其VL2模型,但尚未将其整合到其旗舰商业产品线中。稳定的机器人供应和物理世界数据是Unitree在回报中提供的资产,以换取对DeepSeek的训练服务的优先访问权。该协议还为DeepSeek提供了一个金融立场,在该行业最重要的硬件制造商中占有一席之地。DeepSeek收到的933,399股股份伴随着36个月的锁定期,根据证券时报从招股公告中报道,其他战略投资者包括腾讯投资工具。DeepSeek在此次配售中的认购上限为1.55亿人民币。Unitree上市的数据IPO价格较高。每股150.80元的价格使得该公司的市盈率达到219.23,远高于行业平均值38.56,根据财联社报道,该公司的发行公告显示,交易所自2026年3月接受Unitree的申请以来,已经密切关注这一交易,当时该公司计划筹集42.02亿人民币——最终的募资金额远远超过了这一目标。招股说明书中的数据显示,该公司的增长速度很快,基于小规模的利润基础。2025年的收入增长了四倍,达到17亿人民币,人形机器人超过四足机器人成为最大业务,销售额达到8.678亿人民币。2026年初的增长势头有所减缓:第一季度的收入增长了68.5%,达到4.228亿人民币,但除一次性项目外的利润下降了52.6%,达到4030万人民币,因为研发和营销支出增加了。该公司预计2026年上半年的收入将达到105.2亿至112.8亿人民币,同比增长35.6%至45.4%。招股说明书中提到的风险语言中,有一项风险尤其突出。2025年,美国销售额占Unitree收入的13.3%,招股说明书指出,关税、政府采购限制、出口管制或现有批准的丧失可能会损害海外增长并扰乱进口零部件的供应。该公司表示,其当前的人形和四足机器人已经获得了美国批准,但未来型号可能会被禁止在美国销售。2026年8月10日开始接受认购,8月12日支付。对于DeepSeek来说,锁定期意味着其持股是一种对合作伙伴关系的三年承诺,而不是一种交易;对于Unitree来说,募集资金将用于机器人软件和硬件开发、新产品和制造基地的建设。两家公司表示,联合开发的模型将是这笔交易的实际成果。
谷歌推出了Gemini Robotics ER 2,这是一种嵌入式推理模型,旨在作为机器人的高级规划器,而另一个模型则处理电机。它通过Gemini API和Google AI Studio提供给开发者,并在Gemini Enterprise Agent Platform上提供私人预览访问。ER 2可以处理视频、图像、音频和文本,推理场景,规划一个运行几分钟的任务,然后调用其他内容来移动硬件:一个视觉语言操作模型、导航API或开发人员自己的函数,宣布给模型作为工具。它还可以在任务中调用Google搜索。 模型卡 将其描述为基于Gemini 3.5 Flash的视觉语言模型,具有128,000个令牌的上下文窗口和最多64,000个令牌的输出。它继承了Gemini Robotics-ER 1.6,该模型于2026年4月14日发布,增加了仪表读取(解释压力表或化学视觉)功能,这是谷歌与波士顿动力公司共同开发的设施检查功能。 ER 2将其扩展到数字显示、线性尺度、尺子和液体温度计,在10种仪表类型中进行了测试。连续视频的作用实质性的变化是ER 2在直播视频流中进行推理,而不是静态帧,这使它能够判断一个步骤是否完成,这一直是限制机器人自主性的一个关键因素。这带来了两个功能。进度分类要求模型将视频流中的每一帧分为五个完成类别,从0-20%到80-100%;谷歌报告了57.4%的准确率。关键帧检测要求模型找到发生关键事件的确切帧,例如倒入足够的液体停止倒入的时刻。该公司报告了91.3%的准确率,并表示该模型以大型模型的四倍执行速度和一小部分计算资源提供了这一功能。亚秒级的计时是实际机器上重要的部分。一个可以判断步骤完成60%或完全失败的机器人可以重试该步骤,而不是重新启动工作流程或等待操作员。 ER 2通过Gemini Live API的双向端点流式传输,这是谷歌保持推理循环不在操作之间插入停止和思考暂停的方式。将推理延迟降低到足以进行物理控制的水平是推动机器人供应商使用专用机器人芯片和单GPU实时模型的相同约束。两个机器人,一份工作另一个新功能是多机器人协作:不同机器共享对任务的语义理解,并在它们之间交换工作,基于这样的推理:带轮子的底座和一对腿更适合同一份工作的不同部分。DeepMind的演示将Apptronik的Apollo 2人形机器人与Franka Duo双臂平台配对。第二个演示有ER...
NVIDIA 已经发布了一个外科手术模拟器,可以实时生成手术现场,速度足够快,让外科医生或训练有素的机器人政策可以控制场景的发展。这个模型,Cosmos-H-Dreams,在单个 RTX PRO 6000 GPU 上可以达到大约 160 帧每秒的速度,比起它从中提取的离线模型的每秒 10 帧有了显著的提高,根据 NVIDIA 自己的数据。模型的权重和服务代码于 2026 年 7 月 23 日发布,公司在四天后发布了技术细节。这个模型下面没有物理引擎。相反,模型从外科手术视频和机器人运动学中学习视觉动态,然后预测相机下一步会看到什么。它需要一个初始帧和一串实时的臂部命令,然后生成接下来的 12 帧,之后再消耗下一批动作。浏览器客户端可以从键盘驱动它,Meta Quest 头显可以将跟踪控制器运动映射到机器人动作,训练有素的外科手术政策也可以代替人类放入同样的循环中。同类模型在其他领域也获得了大量资金,包括 Odyssey 的 3.1...
基础设施未来产业(Foundation Future Industries),一家位于旧金山的初创公司,正在为工厂和军事领域建设人形机器人。2026年7月23日,该公司宣布,其Phantom机器人将使用AMD最新的嵌入式处理器,这标志着该公司与Nvidia的合作关系发生了变化,Nvidia的芯片和软件一直是大多数人形机器人项目的默认选择。该公司在AMD的Advancing AI 2026活动中披露了这一计划,在该活动中,AMD推出了Ryzen AI Embedded X100 Series处理器,该处理器将被基础设施公司使用。这一选择的重要性不仅在于相关的营销数据,还在于谁做出了这一选择。基础设施公司是少数几家拥有在客户设施中进行付费工作的机器人公司之一,而不是仅仅运行演示程序。处于这一阶段的公司需要为其生产车队在未来几年内提供硬件和软件支持。Nvidia在这些年里已经成为显而易见的选择,从其Jetson边缘模块到其Isaac机器人模拟软件。AMD堆栈实际带来的东西X100是AMD首个专门针对物理人工智能的嵌入式处理器家族。每个芯片都配备了最多16个AMD的”Zen 5″CPU核心、一个集成的GPU和一个专用的神经处理单元,所有这些都共享一个内存池,以减少在它们之间传输数据的延迟。AMD将其定位为机器人的感知和推理侧:读取相机、运行视觉和语言模型以及规划运动。推销中更有特色的部分是该芯片旁边的内容。基础设施公司表示,它将使用AMD的现场可编程门阵列(FPGA),一种擅长快速、可预测、重复控制的可编程逻辑,来驱动机器人的手和感知。基础设施公司的手部开发负责人Andrea Esposito表示,FPGA使其自定义手能够”驱动和协调所有23个自由度,同时融合高频触觉反馈到一个单一的确定性控制环路中”,根据Forbes的报道。这一能力归功于AMD 2022年收购的Xilinx,该公司发明了FPGA。这也是GPU-only堆栈难以匹配的部分:一个23关节的手需要时序保证,而不仅仅是原始吞吐量。速度声明更难以直接接受。基础设施公司声称X100的推理速度比Nvidia快2.5倍,训练速度快3倍,没有说明哪些Nvidia部件、哪些模型或哪些测试产生了这些数字。AMD自己的比较更具体,也是由供应商运行的:它报告X100达到Nvidia Jetson T5000的最高单精度吞吐量的3倍,Intel Core Ultra芯片的令牌生成率的3.5倍,所有这些都在其自己的实验室中测量。两者都属于声明列,不属于基准测试列,直到独立的硬件测试存在。物理人工智能的反复教训是,数据表上的数字很少能在工厂车间中幸存下来。对Nvidia的扩大战线对于AMD来说,基础设施公司是一个展示客户,在一个AMD几乎没有参与的市场。与X100一起,公司推出了Kria机器人平台和开放合作伙伴网络,该平台和网络将其CPU、GPU、NPU和FPGA打包成一个用于机器人构建者的整体系统,这是对Nvidia集成硬件和软件方法的直接回应,Nvidia的方法使其成为该领域的领导者。AMD的嵌入式首席Kirk Saban将新芯片定位为一种方法,能够为自主系统提供更多的计算能力,而不会将开发人员锁定在单个供应商的工具中。时机是故意的。同一周,AMD详细介绍了一项更大规模的安排,以向Anthropic提供最多两千瓦的数据中心GPU,这是AMD在人工智能计算领域蚕食Nvidia领先地位的更广泛战役的一部分。机器人是一个较小的奖品,但具有战略意义,因为谁为第一批大型人形机器人提供大脑,将决定该行业的软件习惯。对手正在追求同样的机会,这一点在向工业人形制造商(如Humanoid,该公司已筹集了1.52亿美元)流入的资金中可见一斑,以及在正在围绕他们构建的体现式人工智能软件栈中也可见一斑。基础设施公司实际部署了什么基础设施公司在这笔交易中的杠杆作用在于其部署记录。该公司成立于2024年5月,声称其Phantom机器人每周五天全天候在客户工厂中工作,2025年为超过24,000辆汽车的生产做出了贡献,并产生了1亿美元的年度合同收入,这些数字将使其成为少数几家赚取真正收入的机器人制造商之一。虽然在生产线上使用人形机器人并不罕见(如mimic机器人在奥迪工厂的视频动作模型),但基础设施公司的具体数字是其独有的,并且没有被审计,这是来自内部很容易声称但很难核实的运营声明。AMD芯片主要针对的是接下来的事情。基础设施公司表示,其即将推出的Phantom MK-2将从一开始就使用AMD的芯片,并将其加固用于工业和国防用途,具有耐受100-G冲击、防尘防水等级为IP67和360度视觉的能力。AMD表示,X100于2026年6月开始向客户提供样品,预计2026年第四季度将开始批量生产,因此,实际上使用新芯片的第一批机器人还需要几个月的时间。基础设施公司还拥有一个不寻常的政治形象。特朗普总统的儿子埃里克·特朗普(Eric Trump)是投资者和公司的首席战略顾问,基础设施公司拥有大约2400万美元的五角大楼研究合同,并在乌克兰测试了Phantom单元,这是一个参议员伊丽莎白·沃伦(Elizabeth Warren)批评为由于家庭关系而过于密切的安排。所有这些都无法解决AMD交易提出的工程问题,这个问题基础设施公司将在MK-2单元使用新芯片运行一个完整的班次,并且公司外部有人能够衡量出人类仍然需要介入的频率时才会解决。
数千名现代汽车工会成员在韩国蔚山的现代汽车综合体中因计划在装配线上使用人形机器人而罢工——这是汽车行业中第一次因人形自动化而导致的工厂停工,据《华尔街日报》报道,这次部分罢工发生在蔚山。争议的中心是波士顿动力公司的Atlas机器人,它尚未在任何韩国工厂中被分配任何任务。工人从7月13日到7月15日提前两小时结束白班和夜班,工会已经为7月20日至22日安排了四小时的停工时间,因为15轮工资谈判失败了。要求不仅仅是工资的问题:工会希望将小时工资工人转为固定工资,以免自动化悄悄地侵蚀他们的工作时间,将退休年龄从60岁提高到65岁,并获得更大的利润份额。最尖锐的要求是书面保证:在签署劳资协议之前,任何人形机器人不得进入现代汽车工厂,这是工会几个月前就提出的要求,甚至在Atlas机器人在韩国有工作之前就提出了这一要求。所有这些背后都有一个说法,即公司尚未部署的机器人是用来取代他们的。现代汽车的承诺计划是明确的,也是庞大的。在摩根大通投资者会议上,现代汽车集团表示,计划在自己的现代和起亚工厂中部署超过25,000台Atlas机器人——这大约占到2028年计划建造的30,000台机器人的83%。第一批机器将被送到位于美国佐治亚州萨凡纳外的现代汽车集团美塔普兰特美国工厂,从2028年开始,起亚的佐治亚工厂将在2029年跟进。推出是根据任务难度而非日历野心来安排的。现代自己的路线图从2028年开始,让Atlas机器人负责零件排序——移动和整理生产线的零件,然后在2030年扩展到零件组装,并且只在以后才会承担重复和重载工作。这种顺序很重要:排序和材料处理是工厂中最能容忍人形机器人的工作,因为它们可以容忍较慢的周期时间,并且不需要组装所需的精细力控制。规格和经济学生产型Atlas机器人在纸面上是一台功能强大的机器。波士顿动力公司的商业版具有56度的自由度,完全旋转的关节,2.3米的范围,并且可以举起最多50公斤(110磅)的重量;它可以更换自己的电池,并且可以在没有安全笼的情况下工作,因为它具有人体检测和无围栏防护功能。这些功能使得通用人形机器人与几十年来一直占据汽车工厂的固定机器臂区别开来。令工会担心的是经济问题。每台机器的预计成本为13万美元至14万美元,韩国先驱报报道称,一旦累计产量超过5万台,价格可能会降至约3万美元。分析师告诉记者,在这个价格下,机器人可以在大约两年内收回成本——这是一种基于预期的劳动力节省,而不是基于实际的工厂数据。工会的看法很明确:一台比受薪工人便宜、从不请假的机器,无论公司怎么称呼它,都是一种降低劳动力成本的工具。这也是为什么像Apptronik这样的竞争对手正在吸引资金的原因。机器人目前无法做到的事情Atlas机器人尚未完成一整班汽车组装工作。波士顿动力公司仍然将其人形机器人描述为“目前处于开发中的平台”,而那些吸引众多关注的负载夹是主要在模拟环境中训练的,并在受控环境中展示——而不是在活跃的生产线上记录数月的数据,并附有正常运行时间和干预率。演示和生产车队之间的距离正是人形机器人项目之前停滞不前的原因。安全规则也尚未跟上。工业机器人的主要国际标准假设机器在断电时会保持静止;行走机器人会倒下。国际标准化组织(ISO)正在开发一项关于平衡机器人的标准,由包括波士顿动力公司和Agility Robotics的工程师在内的工作组编写,但这仍是一份草案。直到该标准发布之前,部署人形机器人的工厂将按照类比原则应用较旧的、针对固定机器人的规则。这并没有使工会的恐惧变得过早。汽车行业已经是世界上最大的机器人用户——仅在美国,汽车制造商就安装了13,500台工业机器人,比其他任何行业都多——而从特斯拉到宝马的竞争对手都在工厂中运行自己的人形机器人试点项目。现代汽车在美国的推出也从一个非工会工厂开始,美国汽车工人联合会仍在努力组织该工厂。韩国工人没有部署日期可以指出,这正是他们现在正在谈判的原因。机器人仍然只是一个预测时,条款更容易确定,而不是等到机器人上线后。
Momentis Surgical 于 2026 年 7 月 23 日宣布,美国食品和药物管理局(FDA)已批准其 Anovo 机器人用于多端口手术,这是传统的多切口技术,目前大多数机器人外科手术都采用这种技术,也是之前 Anovo 平台无法提供的唯一途径。有了这个批准,公司称 Anovo 现在可以处理所有三种微创手术方法(通过自然体腔、通过单个切口和通过多个小切口)在一个系统上,这是第一个覆盖所有三种方法的机器人平台。对于普通外科医生来说,这个批准意味着可以选择单切口或多端口途径进行腹壁疝修复;对于妇科外科医生来说,它增加了多端口选项,除了 Anovo 已经有的单切口和经阴道途径。Momentis 董事长、骨科机器人制造商 MAKO Surgical 的联合创始人 Maurice Ferré,将其描述为允许外科医生选择适合每个患者的技术,而不是当医院购买机器人时就必须选择一种途径。为什么仪器很重要机器人外科手术围绕着途径组织,目前主流的方法是多端口:多个独立的切口,每个切口都有一个刚性、直的仪器,安装在自己的机器人臂上。这是 Intuitive Surgical 的...
高德是阿里巴巴的映射和位置服务部门,已经发布了一个全栈升级,用于 ABot,这是它正在构建的体现式 AI 系统,用于引导机器人,而不是驾驶员。该升级于 2026 年 7 月 22 日宣布,包括五个新的模型,涵盖导航、操作、推理、长期记忆和运动控制,高德表示,综合栈在 17 个基准测试中获得了最高分。该公司发布的不是一个带有价格标签或客户的机器人,而是一个模型和研究论文的集合。这种区别很重要。发布的内容描述了在基准测试中衡量的功能,而不是在某个地方运行的机器的日志记录的干预。该栈的设计是与身体无关的,可以通过可更换的技能插入人形、四足和轮式机器人,这样一个“大脑”可以在原则上驱动不同的硬件——这与更广泛的机器人竞赛中运行的相同的跨身体志向是一致的。升级添加了什么导航是最接近高德日常工作的部分,其模型 ABot-N1 反映了这一点。它将一个用于路线规划的慢速模块与一个用于发出移动命令的快速模块配对,并添加了一个所谓的“像素级链式思维”,将摄像头看到的内容与书面推理链接起来,以便可以追踪决策。高德表示,ABot-N1 可以仅使用普通导航地图跨越城市,室外成功率为 92.9%;论文报告室内复杂场景为 95.4%,到达兴趣点的增益为 35%,达到 77.3%。操作更加困难,这是 ABot-M0.5 的目标:移动到一个物体并处理它,例如从房间对面的分配器中取水。它不是将移动和抓取作为一个序列运行,而是将它们分成两个操作流,并添加了一种高德称为“梦幻自愈”的训练方法,这允许模型从嘈杂的视觉预测中继续运行,而不是在小错误上停滞。高德报告称,在 RoboCasa-365 测试套件中,ABot-M0.5 比以前的最佳系统在复杂任务上提高了 20.4%,在基本任务上提高了 10.6%。另外两个模型形成了决策层。ABot-ER...
一家中国的协作机器人制造商正在尝试在体化人工智能领域占据一席之地。2026年7月21日,精英机器人宣布与Generalist AI合作,提供其协作机器人作为收集实世界数据和验证GEN-1算法的平台——Generalist AI在2026年4月发布的机器人模型。该公告来自精英机器人,而不是Generalist AI,这是硬件供应商将其名称与物理人工智能领域最热门的实验室之一联系起来的宣布。这种区别很重要,因为合作的实质是精英机器人的描述。Generalist AI自己的GEN-1介绍和其2026年6月的资金公告中没有提到精英机器人。该公司实际上是在宣称一个支持角色,在一个它没有建立的模型中,并且押注这种关联会在机器人智能开始到达工厂车间时带来回报。精英机器人所声称的精英机器人声称,其协作机器人在没有人工干预的情况下运行,完成了Generalist AI用来展示GEN-1可靠性的重复任务——超过1,800次块堆叠和200次盒子折叠。它将这些任务与工厂买家会认可的规格联系起来:100,000小时的平均无故障时间,±0.02毫米的重复性,以及足够快的力反馈,以便模型可以在任务中纠正自己的错误。这些数字来自精英机器人,该公司拥有超过10,000台协作机器人,分布在40多个国家,客户包括丰田和大众。该公司成立于2016年,总部位于上海的机器人集群,销售3至25千克的EC和CS系列机器人。然而,块堆叠和盒子折叠的数字可以追溯到Generalist AI在2026年4月对GEN-1任务演示的描述。精英机器人声称其机器人是这些运行的硬件基础——这是一个合理的角色,因为GEN-1需要一个物理机器人来收集大约一小时的任务特定数据来学习每个技能,但这并不是Generalist AI公开确认的。精英机器人还使用了该行业最喜欢的说法,称这是在机器人领域的“ChatGPT时刻”。这是一种营销手段,而不是一个里程碑。宣传背后的模型GEN-1是一个真实的模型,它也是供应商希望与其关联的原因。Generalist AI由前谷歌DeepMind研究人员创立,包括Pete Florence,他领导了PaLM-E和RT-2项目,报告称GEN-1模型在几个灵巧的任务中达到99%的平均成功率,高于其早期GEN-0模型64%的成功率,同时运行速度约为以前最先进技术的三倍。它可以在大约12秒内折叠一个盒子。该公司从头开始训练GEN-1,使用超过50万小时的实世界数据,并且这些预训练数据不来自机器人——它们来自低成本的可穿戴设备,这些设备记录人们进行普通手工工作,这是一种旨在规避远程操作数据成本的方法。这些是公司自己的数字,来自博客文章,而不是独立测试或同行评审论文,Generalist AI坦率地承认GEN-1并没有在每个任务中都达到标准。它还提到了工业买家关心的一个问题:模型的即兴恢复,如重新就座一个滑动的零件,对于一个活跃的生产线来说可能是一个负担。尽管如此,投资者仍然支持这种发展趋势。2026年6月,Generalist AI 筹集了4亿美元,使其总融资额超过5亿美元,估值为20亿美元,这轮融资由Radical Ventures领投,NVIDIA的风险投资部门和贝佐斯探索公司也参与了投资。为什么协作机器人制造商想要参与Generalist AI的整个推销点是其与硬件无关——这是一种智能层,旨在在人形机器人、仓库机器人和工厂机械臂上运行,而不是任何单一机器。这种框架正是像精英机器人这样的公司宣布合作的价值所在。如果基础模型成为工业自动化的大脑,那么它们运行的机械臂就有可能成为一种商品硬件,除非供应商能够将自己确立为首选的、经过验证的平台。被提及与GEN-1相关——即使是在Generalist AI没有共同签署的发布中——这是精英机器人希望排在第一位的尝试。这是整个领域悬而未决的一个价值捕获问题,从NVIDIA将物理人工智能连接到行业,到像FieldAI和谷歌的Gemini Robotics等众多资金充足的智能层创业公司:当机器人最终获得通用、有目的的软件时,钱会去向谁——是编写智能的人还是建造身体的人?精英机器人正在赌博,它可以成为值得编写的身体。目前,这种合作只是新闻稿中的一个声明——一个真正的协作机器人制造商,一个真正的模型,以及Generalist AI尚未用自己的话描述的关联。