Лидеры мнений
Настоящая Стоимость Обучения Роботов

В первой части мы обсуждали, как роботы эволюционируют от базовой механики к пониманию окружающей среды. На этапе “последней мили” – когда роботы проходят пост-обучение для специальных, индивидуальных задач – возникает неожиданный барьер. Он связан с данными: их сбором, организацией и масштабированием в реальных условиях.
Это именно на этом этапе, что разрыв между концепцией и реализацией становится наиболее очевидным. Каковы ключевые瓶leneckи, и как их можно преодолеть с минимальными затратами?
Почему тысячи часов данных превращаются в годы работы
Давайте представим, что у нас уже есть обученный робот, который прошел предобучение. Он может ориентироваться в окружающей среде, двигаться, избегать препятствий и взаимодействовать с объектами. Это как “десятилетний ребенок”, который в целом способен действовать самостоятельно. Следующий шаг – научить его выполнять конкретные действия в конкретных условиях, например, устанавливать стеклянные панели и уплотнительные полосы на производственной линии автомобильного производства.
На первый взгляд, задача parece более простой. Она включает в себя освоение единого сценария, и объем необходимых данных значительно меньше, чем во время предобучения. В то время как базовое обучение может требовать сотен тысяч часов, пост-обучение может занять только тысячи. Но эти цифры вводят в заблуждение.
Когда их переводят в реальное время, процесс раскрывает свою истинную сложность. Под стандартным графиком работы человек работает примерно 160 часов в месяц. Однако это не означает, что все это время можно использовать для записи.
На практике происходят постоянные сбои: батареи разряжаются, камеры смещаются, датчики отказывают. Чем более сложна установка оборудования, тем выше вероятность проблем. Даже простая неисправность, такая как отказ датчиков на перчатке, может остановить процесс и привести к потере времени.
В результате фактическая скорость сбора данных на 2-3 раза ниже. Один час высококачественной записи может потребовать до трех часов реальной работы. Это радикально меняет расчет: 5 000 часов данных переводятся в примерно 15 000 часов труда.
Слои за слоями сложности
Во время предобучения может быть достаточно дать человеку камеру и попросить его записать повседневные действия. Однако на этом этапе требуется доступ к конкретной среде, такой как фабрика, строительная площадка или специализированное производственное предприятие.
Это сразу же вводит практические ограничения. Например, на строительной площадке работникам необходимо носить защитные каски, что означает разработку специального оборудования: касок с интегрированными камерами, устойчивыми к пыли, влаге и ударам.
Затем возникает вопрос доступа к площадке самой. Необходимо заключить соглашения с владельцами площадки, получить разрешения и договориться об условиях. Это почти всегда предполагает дополнительные затраты: компании ожидают компенсацию, а работники ожидают оплаты за участие.
Страхование и соблюдение требований безопасности также становятся критическими проблемами. Если оборудование не соответствует необходимым стандартам, страховка может быть аннулирована, что заставляет整个 процесс быть переструктурированным.
Даже на уровне повседневной деятельности сохраняются проблемы. Камеры необходимо включать, контролировать и обслуживать. Работники работают в перчатках и суровых условиях. Оборудование загрязняется, изнашивается и ломается. Камера может выключиться после нескольких минут, и человек может даже не заметить этого.
Это создает необходимость для участников обучиться – им необходимо понять, как использовать оборудование. Кроме того, требуется постоянный надзор – кто-то должен обеспечить продолжение записи и правильную работу устройств.
От сырого видео к обучающим данным
После записи начинается следующий этап: сбор данных, загрузка, структуризация, проверка качества и标注.
Любые сырые данные состоят из видео- и сигналов датчиков. Чтобы превратить их в обучающий материал, необходимо структурировать их: необходимо определить объекты, захватить действия, описать состояния, движения и взаимодействия с окружающей средой. Это то место, где вступает в действие аннотация. Возникает логический вопрос – какой стандарт такой аннотации?
В некоторых случаях достаточно простых ограничивающих рамок, чтобы определить объекты в кадре. В других случаях требуется временная аннотация, чтобы описать последовательности действий во времени. В определенных сценариях используются ключевые точки и скелетные модели, чтобы захватить движения тела. В более сложных случаях используются 3D-модели или отслеживание положения руки, чтобы точно представить механику взаимодействия. Часто интегрируются дополнительные датчики, такие как акселерометры, чтобы захватить динамику движения и приложенную силу.
Проекты такого типа часто требуют масштабирования команды. Маркировка – это большая и сложная задача, требующая времени, опыта и значительных человеческих ресурсов. Это то место, где вступают в действие поставщики решений для данных с внутренними командами аннотации. Например, Keymakr, который оказался особенно эффективным благодаря своей способности масштабировать команды для соответствия любому объему данных, от одного специалиста до сотен аннотаторов.
Еще нет правильного подхода к обучению
Отрасль все еще находится на экспериментальной стадии, поскольку нет консенсуса о том, какая комбинация данных дает лучшие результаты. Многие подходы подтверждаются эмпирически, поскольку они работают в конкретных экспериментах. В результате разные команды продолжают полагаться на разные технологии, сформированные их собственным опытом, задачами и ограничениями.
На академическом и прикладном уровнях это приводит к фрагментации: лаборатории и компании движутся в разных направлениях. Ситуация напоминает ранние дни автономного вождения, когда Tesla поставила на карту подход, основанный только на видении, без LiDAR, в то время как большинство других игроков выбрали LiDAR в качестве основного датчика.
Сегодня системы, основанные на LiDAR, склонны демонстрировать более стабильную производительность, но подход Tesla продолжает эволюционировать. Разница в том, что в автономном вождении рынок в значительной степени созрел: появились стабильные архитектуры, хорошо поняты ограничения, и накоплен значительный опыт.
Напротив, для Физического ИИ и подобной тренировки моделей этот уровень зрелости еще не достигнут. Рынок все еще формируется, отсутствуют стандарты, и большая часть прогресса обусловлена экспериментами. Новые методы тренировки моделей, повышения эффективности и адаптации к реальным сценариям продолжают появляться, что предполагает, что наиболее важные прорывы в этой области еще впереди.
Человек как система подкрепления
Маркировка не существует в изоляции, ни для модели. Она служит инструментом для инженера, строящего эту модель. С ее помощью он формализует реальность, определяет ключевые параметры и задает правила поведения системы.
Задача инженера – научить систему выполнять действия правильно в реальных условиях. Например, базовый сценарий может состоять из четырех действий: взять стакан, включить кран, наполнить его и выключить кран. Но в реальности возникает отклонение – стакан переполняется.
В этот момент от модели ожидается завершение сценария и выполнение дополнительных действий: остановка потока воды, регулирование уровня воды и предотвращение разлива. Это поведенческая логика, основанная на контекстном понимании.
Инженер следует циклу: аннотирует данные, тренирует модель, тестирует ее. Если система работает, гипотеза подтверждается. Если нет, начинается анализ.
В какой-то момент может стать ясно, что модель缺ает важным параметром, таким как уровень наполнения стакана. Ранее данные могли включать аннотации для объектов (стакан, кран, ручка) и действий (открытие, наполнение, закрытие), но не имели аннотаций для состояния, такого как степень наполнения.
Затем добавляется новый слой в процесс: аннотация уровня наполнения, за которой следует формализация, например, определение любого значения выше 85% как критического состояния.
Это приводит к следующей итерации тренировки. Можно иметь сотни таких итераций.
Никто не предполагает, что система будет работать правильно сразу. Напротив, процесс построен вокруг последовательных приближений: сначала создается базовая версия; затем она тестируется в реальных или gầnко-реальных условиях; выявляются пробелы; и система совершенствуется. Это то, о чем я часто говорю с клиентами в Introspector, с которыми мы проходим весь путь Физического ИИ вместе.
В определенный момент достигается желаемый результат. Но его ценность заключается не только в том, что система начинает работать, но и в накопленном опыте, который позволяет этот результат воспроизводить более предсказуемо.
Экономика, которую все забывают
За последний год или около того я заметил, что самая большая ошибка, которую совершают компании, работая с эгоцентричными данными, имеет мало отношения к технологиям.
Основная проблема на самом деле заключается в недооценке экономики проекта.
На стадии идеи технологии занимают центральное место – какие модели использовать, как их тренировать и какие подходы применять. Вы изучаете, исследуете, обсуждаете архитектуры и тестируете гипотезы. Это естественно: технологии кажутся наиболее осязаемой и очевидной частью проблемы.
Но гораздо реже на этой стадии команды задают прямой и практический вопрос: сколько это будет стоить?
Когда проект переходит от теории к реализации, становится ясно, что за каждой моделью стоят десятки тысяч часов данных. Сбор этих данных требует времени, доступа к реальным средам и участия специалистов. Маркировка добавляет еще один слой сложности и затрат. В результате окончательные цифры часто оказываются на порядок выше, чем ожидалось.
Это не означает, что такие проекты не следует реализовывать. Напротив, они являются тем, что движет отрасль вперед.
Но что важно, так это понимание масштаба задачи с самого начала. Признание того, что в тренировке моделей за каждым удивительным алгоритмом стоит сложная, ресурсоемкая работа с данными.
Даже сильные идеи не доходят до полной реализации, когда затраты на данные начинают превышать семизначные суммы.
И, возможно, наиболее важный сдвиг, происходящий в робототехнике сегодня, связан с этим осознанием. Будущее этих систем будет определяться тем, насколько “умными” они будут, и насколько эффективно и точно будет построен весь путь данных – от сбора до окончательной интерпретации.












