思想领袖

机器人新赛道:数据、模型和制造

mm
将 Unite.AI 添加到您在 Google 上的首选来源

创新往往不会在孤立中出现。更常见的是,它是在工程师、创始人、研究人员和投资者之间的对话中诞生的,他们试图理解技术的发展方向。

在过去的一年里,我参加了世界各地的几十个会议。商务旅行有时会持续数月,会议会在亚洲到北美之间的各个地方举行。然而,我最近一次去瑞士的旅行却特别有趣——主要是因为那里的人和发生的对话。

苏黎世被证明是讨论机器人和物理人工智能的未来的地方。随着对话的深入,人们越来越意识到机器人领域的真正竞争正在围绕数据展开。

欧洲的硅谷

苏黎世传统上与金融行业相关联,但近年来,它越来越被称为欧洲的硅谷。这种声誉在很大程度上与苏黎世联邦理工大学(ETH Zurich)有关,这是欧洲最受尊敬的工程大学之一。它吸引了来自世界各地的研究人员、博士生、企业家和工程师。因此,围绕大学形成了一个强大的技术生态系统,在这里,研究、创业和工业项目几乎同时发展。

我去苏黎世的原因之一是为了更深入地了解Introspector可以为机器人市场提供什么。自2025年初以来,机器人行业就一直处于蓬勃发展的状态。许多初创公司都试图进入这个行业,而来自大型科技公司的技术突破也正在积极地重塑这个行业。然而,尽管有这么多动力,领域仍然带来了更多的问题而不是答案。

苏黎世也是我们的合作伙伴Lightly的所在地,他们帮助我认识了在机器人、计算机视觉和人工智能交叉领域工作的同行。这里有一个重要的技术生态系统方面我想强调:人们在这里非常开放和友好。他们不怕分享自己的想法和假设,讨论他们试图解决的挑战和正在进行的实验。因此,你能够更快地理解市场的真实背景和行业的发展方向。

当人们问我欧洲的“硅谷”与美国的硅谷有什么不同时,答案经常让他们感到惊讶。在苏黎世,工作和生活的平衡感更强:早晨进行体育活动,白天专注工作以平静而高效的节奏进行,晚上在山中与家人或简单地放松。相比之下,旧金山经常给人一种感觉,即你需要不断证明自己比别人工作得更努力。在苏黎世,节奏不同——更可持续。但这里的技术雄心并不低于其他地方。

更好的数据,才有更好的机器人

我从这次旅行中获得的一个主要收获是:许多人今天都想在机器人领域工作。但是,尽管人们对这个行业有巨大的兴趣,许多团队仍然处于探索阶段,试图理解他们在机器人和物理人工智能的新浪潮中可以扮演什么角色,以及他们可以做出什么贡献。

许多对话最终都集中在同一个话题上:数据。今天,行业缺乏关于灵巧任务的数据,即精细运动技能。在这个领域,机器人的能力仍然极其有限。人类几乎可以自动完成的任务——拾起一个物体,转动它,仔细将其放在某个地方,或者执行一个小的操作——仍然是机器人面临的最具挑战性的任务之一。

在这里,进步的关键主要在于大规模、适当收集的数据集。今天,人们经常谈论自我中心的数据集,即从第一人称的角度记录的数据,在这种情况下,系统捕获人类的行为,就像它自己执行这些行为一样。然而,在实践中,发现“自我中心数据集”的概念可能意味着非常不同的东西,并带来一系列技术问题。相机应该放在哪里?在额头上、胸部上,还是在眼部水平上?应该使用什么传感器来记录视频?如果我们捕获手部运动,操作员应该使用特殊的手套吗?如果使用手套,是否应该包含触觉传感器、陀螺仪或其他运动跟踪系统?

一个更复杂的问题出现了:如何正确捕获运动的深度。毕竟,理解手的位置不仅在二维平面上,还要在三维空间中移动——向前、向后、向上或向下——是很重要的。

到目前为止,行业还没有达成统一的答案。这就是为什么今天许多团队正在尝试不同的传感器配置、记录方法和数据集格式。

多模态系统

一旦对话转向机器人数据收集,另一个话题很快出现——额外的传感器和多模态,它们使得能够以更高的精度捕获身体运动、手部动作和物体交互。它们还帮助减少在数据集收集过程中出现的错误。

当一个人用相机记录自己的行为时,总是存在这样一个风险:部分材料将无法使用。相机可能会稍微移动,拍摄角度可能不正确,操作员可能会不小心转向错误的方向,或者操作员可能会太快地执行一个动作。因此,记录的大部分材料被丢弃。一个简单的例子:为了获得一小时真正可用的视频,操作员通常需要记录大约两小时的原始素材。

额外的传感器有助于补偿一些这些问题。即使相机稍微移动,传感器数据仍然可以使得重建手或身体在空间中的运动成为可能。因此,相比记录两小时,可能只需要大约一小时二十分钟来获得相同数量的可用数据。这大大提高了数据集收集的效率,并降低了创建它们的成本。

因此,许多团队也注意到对多模态数据注释的兴趣日益增长。这已经成为与机器人和具身人工智能发展直接相关的更明显的趋势之一。

下一点是这样的数据集的标注。我们在Keymakr处理客户机器人用例的数据集时遇到了类似的问题:在实践中,这样的注释应该是什么样子?应该是骨骼式的吗?二维还是三维的?应该将强化学习的元素纳入管道吗?有几十个这样的问题。工程师们自己承认,目前还没有人能够确定哪种特定的数据配置最终会导致真正的技术突破。

这些担忧是可以理解的。构建复杂的数据集是一个昂贵的过程。数据结构中的每一个错误都可能花费成千上万甚至数百万美元。有可能收集“错误”的数据集,或在难以在现实世界中复制的条件下记录它,最终会破坏整个项目。这就是为什么今天,人们越来越关注模型本身和训练这些模型的数据的质量和架构。

市场需要什么样的机器人?

经典的工业机器人,它们已经在汽车装配线上运行了几十年,实际上需要很少的计算机视觉或复杂的人工智能模型。它们的任务非常具体:以高精度和一致性执行严格的重复动作——左、右、上、下。在这个领域,它们已经远远超过了人类。

另一类是人形机器人。这些系统需要“大脑”:在空间中导航、感知周围环境、理解情况的背景以及控制操作员的方式不是通过预编程的轨迹,而是通过适应现实世界。

即使在现代工厂车间高度自动化的今天,许多任务仍然由人类完成。移动一个物体、拾起一个盒子、分类零件、固定一个部件或组织材料——这些都是需要灵活性和协调性的小动作。这仍然是最难以自动化的领域,也是人形系统可能发挥作用的地方。

我交谈过的许多团队都使用类似的商业模式。他们接洽一家工厂并提出解决一个特定的生产案例。例如,一个工人可能会花一整天的时间在仓库区域之间移动箱子。工程师建议进行一个相对简单的实验:为工人配备一个摄像头和一套传感器,记录他们的行为数千小时,并使用这些数据来训练一个控制人形机器人的模型。这样,机器人就能学习执行与人类工人相同的任务。

本质上,公司购买一个人形平台,而开发团队则构建一个自定义模型,该模型复制了特定操作员的行为。这不是一种能够解决任何任务的通用智能,而是一组针对特定场景或一组生产任务而训练的技能。对于今天的许多工程师来说,这种方法似乎更为现实。他们不是试图立即创建一个通用机器人,而是专注于狭窄但在经济上可行的自动化场景。

商业维度

如果未来在于定制模型,那么了解这一点在经济上是非常重要的。

每个行业本质上都是一个独立的世界。每个生产环境都有其自己的流程、工作流程和异常。训练在汽车工厂运行的机器人不能简单地转移到食品制造或仓库物流中。在每种情况下,系统都必须从头开始重新训练。

这引发了下一个逻辑问题:谁将成为此类技术的第一批客户?

在这一阶段,主要的采用者可能是大型企业——那些拥有预算并且可以从自动化中获得有意义的经济影响的企业。今天,人形机器人的硬件成本大约为6万美元至9万美元。这只是基本配置。除此之外,还有维护成本、电池、充电站、基础设施和软件。

因此,能够尝试使用这些系统的公司主要是大型组织、汽车制造商、食品公司和主要工业企业。

当然,小型行业也可能会有一些早期采用者。一些公司可能会购买一两个机器人用于特定任务。然而,在大多数情况下,这些企业仍然不愿意投资数十万欧元来收集和注释自定义数据集,以训练系统执行高度特定的操作场景。对于他们来说,人类劳动仍然是更便宜的选择。

机器人创新长期游戏

我们最终来到了一个基本的经济问题:人类和机器人哪一个更高效?如果我们看今天的经济,答案是明显的:人类劳动更便宜,能够更快地适应新条件,并且不需要复杂的基础设施。

那么,为什么行业今天仍然继续投资于机器人?答案在很大程度上是战略性的。

许多公司都理解,正在进行一场技术领导地位的竞争。他们正在开发解决方案,尽管成本很高,以便在机器人经济学转变时处于领先地位。

随着电子技术的进步、组件成本的降低和计算效率的提高,机器人最终将变得更加经济。并且,当这种情况发生时,优势将属于那些已经建立模型、积累数据并建立必要的技术基础设施的公司。

例如,假设新的法规出现,允许大规模使用人形机器人进行制造。或者,政府开始为工业的机器人化提供补贴。在这种情况下,市场可能会在短短几年内迅速增长。而那些提前做好准备、拥有现成模型、研究、数据集和技术栈的公司将是最受益的。

这就是为什么,即使业务经济学可能还不理想,开发仍在继续。对于许多公司来说,这是一项对未来的投资——对机器人技术变得更加便捷、需求激增的那一刻的投资。

在这场竞争中,如同许多技术革命一样,一个因素往往是决定性的:谁先开始。从这个意义上说,今天的机器人领域与人工智能的早期阶段非常相似。当时,也有更多的问题而不是答案。然而,开始使用数据和基础设施的团队最终塑造了整个行业的方向。

迈克尔·阿布拉莫夫(Michael Abramov)是Introspector的创始人兼首席执行官,拥有15多年的软件工程和计算机视觉AI系统经验,致力于打造企业级标注工具。

迈克尔在软件工程师和研发经理的职位上开始了他的职业生涯,构建了可扩展的数据系统,并管理着跨功能的工程团队。直到2025年,他曾担任Keymakr的首席执行官,Keymakr是一家数据标注服务公司,他在那里开创了人机协同工作流程、先进的QA系统和定制工具,以支持大规模计算机视觉和自主驾驶数据需求。

他拥有计算机科学学士学位,并具有工程和创意艺术背景,带来多学科视角解决复杂问题。迈克尔生活在技术创新、战略产品领导和现实世界影响的交叉点,推动自主系统和智能自动化的下一个前沿。