思想领袖
机器人训练的真实成本

在第一部分中,我们讨论了机器人如何从基本机械演变为理解其环境。在“最后一英里”阶段——机器人经过预训练后,为特定、自定义任务进行后期训练——一个意外的障碍出现。它与数据有关:数据的收集、组织和在现实世界条件下的扩展。
这是概念和实施之间的差距最明显的阶段。什么是关键的瓶颈,它们如何被克服以最小的摩擦?
为什么成千上万小时的数据变成多年的工作
让我们想象一下,我们已经有一个经过预训练的机器人,它可以在周围环境中导航、移动、避开障碍并与物体交互。它就像一个“十岁的孩子”,一般来说,可以独立行动。下一步是教它在特定条件下执行特定的动作,例如在汽车生产线上安装玻璃板和密封条。
乍一看,这个任务似乎更简单。它涉及掌握一个单一的场景,所需的数据量远远小于预训练。虽然基础训练可能需要数十万小时,但后期训练可能只需要几千小时。但这些数字是误导性的。
当转换为实际时间时,过程揭示了其真正的复杂性。在标准工作时间表中,一个人每月工作大约160小时。然而,这并不意味着所有时间都可以用于录制。
在实践中,会不断出现中断:电池耗尽,相机移动,传感器故障。设备设置越复杂,问题的可能性就越高。即使是手套上的传感器停止工作这样简单的故障也会停止过程并导致时间损失。
因此,实际的数据收集速度是2-3倍较低。一个小时的高质量录制可能需要三个小时的实际工作。这根本改变了计算:5000小时的数据相当于大约15000小时的劳动。
复杂性层层叠加
在预训练期间,可能足以给一个人一台相机并要求他们录制日常活动。但是在这个阶段,需要访问特定的环境,例如工厂、建筑工地或专用生产设施。
这立即引入了实际的限制。例如,在建筑工地,工人需要戴安全帽,这意味着需要开发专门的设备:具有集成相机的安全帽,能够抵抗灰尘、湿气和冲击。
然后是进入工地本身。需要与工地所有者达成协议,获得许可,并协商条件。这几乎总是涉及额外的成本:公司期望得到补偿,工人期望得到报酬以参与该项目。
保险和安全合规也成为关键问题。如果设备不符合所需的标准,保险可能会被取消,这将迫使整个过程被重新结构。
即使在日常运营的层面上,挑战仍然存在。相机需要被打开、监控和维护。工人在手套和恶劣条件下工作。设备会变得脏、磨损和损坏。相机可能会在几分钟后关闭,人员可能甚至没有注意到。
这就需要参与者进行自我训练——他们必须了解如何使用设备。此外,需要持续的监督——有人必须确保录制正在进行,设备正在正常运行。
从原始视频到训练数据
录制后,下一个阶段开始:数据收集、上传、结构化、验证其质量和标记。
任何原始数据都由视频和传感器信号组成。为了将其转换为训练材料,必须对其进行结构化:需要识别对象、捕获动作和状态、移动和与环境的交互。这里就是标记的作用。一个合理的问题出现了——这样的标记工作流程的黄金标准是什么?
在某些情况下,简单的边界框就足以在帧中识别对象。在其他情况下,需要时间标记来描述一段时间内的动作序列。在某些场景中,使用关键点和骨骼模型来捕捉身体运动。在更复杂的情况下,需要3D网格或手势跟踪来准确地表示交互机制。通常会集成其他传感器,例如加速度计,以捕捉运动动力学和施加的力。
这样的项目通常需要扩大团队规模。标记是一项大型且复杂的任务,需要时间、专业知识和大量的人力资源。这就是数据解决方案提供商带有内部标记团队的作用,例如Keymakr,由于其能够扩大团队以匹配任何数据量,从单个专家到数百名标记员,因此特别有效。
目前还没有正确的训练方法
该行业仍处于探索阶段,因为还没有共识关于哪种数据组合会产生最佳结果。许多方法都是通过经验验证的,因为它们在特定实验中有效。因此,不同的团队继续依赖不同的技术,这些技术受到他们自己的经验、任务和约束的影响。
在学术和应用层面上,这导致了碎片化:实验室和公司正在朝着不同的方向发展。这种情况让人联想到早期的自动驾驶汽车,当时特斯拉押注于仅使用视觉的方法,而大多数其他玩家选择LiDAR作为核心传感器。
如今,基于LiDAR的系统往往表现出更稳定的性能,但特斯拉的方法仍在不断演进。区别在于,在自动驾驶领域,市场已经基本成熟:稳定的架构已经出现,局限性已经被充分理解,并且已经积累了大量的专业知识。
相比之下,对于物理人工智能和类似的模型训练,尚未达到这种成熟度。市场仍在形成,缺乏标准,大部分进展是由实验驱动的。新的模型训练方法、提高效率和适应现实世界场景的方法继续涌现,表明该领域最重要的突破仍然在前方。
人类作为强化系统
标记并不是孤立的,也不是仅为模型而存在的。它作为工程师构建该模型的工具。通过它,他们正式化现实,识别关键参数,并定义系统的行为规则。
工程师的任务是教导系统在现实世界条件下正确执行动作。例如,一个基本场景可能由四个动作组成:拿起玻璃,打开水龙头,装满水,关闭水龙头。但在现实中,会发生偏差——玻璃溢出。
在那一刻,模型预计会完成场景并采取额外的动作:停止水流,调整水位,防止溢出。这是基于上下文理解的行为逻辑。
工程师遵循一个循环:标记数据,训练模型,测试它。如果系统工作,则假设得到证实。如果不行,则开始分析。
在某个时候,可能会清楚地表明模型缺少一个重要的参数,例如玻璃的填充水平。以前,数据可能包含了对象(玻璃、水龙头、手柄)的注释和动作(打开、填充、关闭)的注释,但缺少了状态的注释,例如满度。
然后将一个新层添加到该过程中:注释填充级别,然后进行正式化,例如,将任何超过85%的内容定义为临界状态。
这导致了训练的下一个迭代。您可以有数百个这样的迭代。
没有人假设系统会立即正常工作。相反,过程是围绕连续近似进行的:首先创建一个基线版本;然后在实际或近实际条件下进行测试;确定差距;然后完善系统。这是我经常与Introspector的客户讨论的内容,我们一起完成整个物理人工智能之旅。
在某个时候,期望的结果就会实现。但其价值不仅在于系统开始工作,还在于积累的经验,这使得该结果可以更可预测地被复制。
大家都忽略的经济学
在过去的一年左右时间里,我注意到公司在处理自我中心数据时犯下的最大错误与技术几乎无关。
核心问题实际上在于低估了项目的经济学。
在想法阶段,技术占据了中心舞台:使用什么模型、如何训练它们以及应用什么方法。您学习、研究、讨论架构并测试假设。这是自然的:技术感觉是问题中最有形和最明显的部分。
但是在这个阶段,团队很少会提出一个直接且实际的问题:这将花费多少钱?
当项目从理论转变为实施时,很明显每个模型背后都有成千上万小时的数据。收集这些数据需要时间、访问真实环境以及专家的参与。标记添加了另一个复杂性和成本的层次。因此,最后的数字往往远远高于最初预期的。
这并不意味着这样的项目不应该被追求。相反,它们是推动行业前进的动力。
但重要的是要从一开始就理解挑战的规模。认识到在模型训练中,任何令人惊叹的算法背后都有复杂、资源密集的数据工作。
即使是强大的想法也会因数据成本开始超过七位数而无法实现。
也许今天在机器人领域发生的最重要的转变与这一认识有关。这些系统的未来将由它们的“智能”程度和整个数据管道的有效性、精确性决定——从数据收集到最终解释。












