Лидеры мнений
Мы научили роботов двигаться. Теперь мы учим их жить

Современная робототехника достигла точки, где движение больше не является основной проблемой – машины уже могут ориентироваться, захватывать и работать в пространстве с впечатляющей точностью. Однако возможность真正 “жить” и функционировать в реальном мире остается нерешенной проблемой.
В этом процессе ключевую роль играет то, что можно назвать “спинным мозгом”: система, ответственная за основные реакции, поведение и взаимодействие с окружающей средой.
Когда вы смотрите на эволюцию роботов через эту призму, становится ясно, что эта последовательность стадий – где система учится чему-то новому на каждом шаге, от простого движения к сложным, контекстно-зависимым действиям – очень похожа на человеческое развитие.
И именно в этой эволюции – от “пустого” оборудования к осмысленному поведению – происходит основной сдвиг в физическом ИИ сегодня. Интересно узнать об этом более глубоко.
Основы робототехники: стадия, которую редко обсуждают
Что такое робот в практическом смысле? Это физическое устройство, изначально созданное как универсальная платформа. По сути, это “чистый лист”, который затем должен быть адаптирован для конкретных задач, обучен работать в определенной среде и научен выполнять необходимые действия.
Если мы выходим за рамки повседневных сценариев и рассматриваем более реалистичные近未来 применения, становится ясно, что полное внедрение роботов в первую очередь произойдет в промышленных и потенциально опасных средах. Это, в свою очередь, подразумевает значительно более высокие требования к их поведению, надежности и качеству обучения.
Процесс начинается с наиболее базового шага – сборки устройства. Робот собирается из множества компонентов, включая актуаторы, двигатели, датчики, камеры, лидары. Он может быть гуманоидным, колесным, двуногим или четвероногим – форма второстепенна. Что важно, так это то, что на этой стадии мы получаем функционирующее, но все еще “пустое” устройство.
Следующий шаг – установка базовой модели, которая служит основой для его поведения. В широком смысле “модель” – это весь функциональный контрольный слой. Он отвечает за основные возможности: поддержание баланса, стояние и движение, навигация из точки А в точку Б, избежание препятствий, не повреждение окружающей среды и безопасное взаимодействие с людьми.
Именно здесь вступает в игру обучение с подкреплением. В таких системах запускаются миллиарды симуляций. Мы часто видим видео, где роботы “учатся” в сложных средах: большинство из них падают, теряют баланс или не могут выполнить задание. Но те, кто смог остаться на ногах и продолжать двигаться, – это те, кто прогрессирует.
Это суть обучения с подкреплением: выбор успешного поведения. Алгоритмы тех, кто “выживает”, становятся основой для следующих итераций. В результате после огромного количества запусков появляется модель, которая может уверенно справляться с препятствиями. Этот алгоритм затем передается на физическое устройство.
Это фундаментальная, но критически важная стадия – часто включающая мало или совсем не включающая компьютерное зрение, которое не требуется на этом этапе. С чем мы имеем дело здесь, так это фундаментальная физика и механика, которые должны быть встроены в систему с самого начала.
Как роботы начинают “чувствовать” мир
Итак, у нас уже есть “аппаратное обеспечение” – робот с установленной базовой моделью: он может стоять, ходить и поддерживать баланс. Но достаточно ли этого для реальных задач, например, в промышленных средах? Очевидно, нет.
Следующий уровень начинается здесь. Мы интегрируем датчики и обучаем модель действовать на основе сенсорной информации. Появляется новый слой основных навыков – уже намного более сложный, чем простое движение.
Аналогия с человеческим развитием полезна здесь. На первой стадии мы привели систему к уровню примерно годовалого ребенка: он может стоять, делать первые шаги и поддерживать баланс без падения. Следующий шаг более соответствует уровню восьмилетнего ребенка.
В этом возрасте ребенок активно использует свои “датчики”: он может воспринимать риск и оценивать последствия своих действий. Он понимает, что не следует трогать что-то горячее или класть что-то очень холодное в рот. Он может вскарабкаться на стол, кататься на велосипеде и взаимодействовать с объектами. Он способен хватать, нести и манипулировать предметами и выполнять основные действия по самообслуживанию.
Мы называем эту стадию предобучением. И на этом этапе симуляцииalone уже недостаточно.
Да, некоторые сценарии все еще могут быть эффективно смоделированы: как поднять стакан, или заменить батарею, например, удалив один компонент, положив его на зарядку, взяв другой и установив его обратно.
Но в целом баланс смещается: около 80% обучения все еще может происходить в симуляции, в то время как около 20% данных должно поступать из реального мира. И именно здесь мы начинаем обсуждать эгоцентричные данные.
Эгоцентричные данные как основа понимания окружающей среды
Сегодня эгоцентричные данные собираются в огромном масштабе по всему миру – потому что без них невозможно перейти от базовой механики к осмысленному взаимодействию с реальным миром. Коллега mine, который управляет сетью автомастерских, имеет сотрудников, использующих камеры, установленные на голове, для записи всего процесса ремонта автомобиля. Владелец здания в Нью-Йорке реализовал аналогичный подход: уборщики носят камеры, установленные на лбу, которые захватывают, как они чистят пространства и поддерживают санитарные зоны.
Со временем эти записи становятся самостоятельным продуктом – они упаковываются и продаются. Их ключевая ценность заключается в их пригодности для стадии предобучения, giúpая построить базовое понимание окружающей среды и последовательностей действий.
Например, такая служба существовала на Keymakr, где команда независимо создала целые коллекции эгоцентричных данных от простых сценариев, таких как мытье посуды, до более сложных.
Почему это так важно? Потому что такие данные предоставляют то, чего не может симуляция – разнообразие реальных сред. Офисы, автомастерские, строительные площадки, рестораны и отели – каждая из них добавляет свой контекст, сценарии и нюансы. Вместе они образуют набор данных, который позволяет системе не просто “видеть”, но постепенно начинать понимать динамику реального мира.
На этой стадии целью больше не является обучение робота идеально выполнить конкретное действие. Что важнее, так это возможность ориентироваться в окружающей среде в первую очередь.
Сегодня почти все компании, работающие в области робототехники – от Tesla до Unitree Robotics и Figure AI – сосредоточены именно на этой стадии. Их цель – построить базовую модель, чьи возможности сначала напоминают возможности “восьмилетнего ребенка”, а затем прогрессируют в сторону “двенадцатилетнего”. Это также то, на чем мы сосредоточены в Introspector – подготовке данных, необходимых для предобучения, самой критической фазы в “становлении” современной робототехники.
Последний этап обучения: где заканчивается универсальность и начинается специализация
Давайте представим, что робот уже завершил предобучение и изготавливается с самого начала с базовым пониманием мира и набором навыков, сравнимым с тем, что у подростка. Но даже этого недостаточно для реальных деловых случаев. Компаниям не нужен просто “универсальный” робот – им нужен специалист.
Возьмем производство автомобилей в качестве примера. Некоторые задачи все еще выполняются людьми, потому что они требуют чувствительности, точности и непрерывного визуального контроля. Традиционная автоматизация здесь борется. Промышленные манипуляторы отлично справляются с повторяющимися, жесткими задачами – “взять, переместить, положить”. Но задачи, требующие адаптивности, чувствительности давления и реальных корректировок, остаются в области человеческой деятельности.
Именно здесь возникает новая потребность: обучить робота выполнять конкретную операцию точно так же, как это делает квалифицированный работник на производственной линии. Другими словами, после базового обучения наступает следующий уровень: обучение для конкретной профессии и сценария.
На этом этапе возникает практический вопрос: что именно требуется для этого уровня обучения? Если мы хотим, чтобы робот воспроизводил человеческое поведение, нам нужно запечатлеть это поведение как можно более точно. Например, специалист на заводском полу должен носить камеру и в течение длительного периода, месяцев или даже года, записывать, как он выполняет задание.
Что необходимо, чтобы роботы “жили” в человеческом мире
Камера одна недостаточна. Необходимо запечатлеть не только визуальную перспективу, но и физику движения. Для этого используются специальные перчатки с тактильными датчиками, которые измеряют давление, приложенную силу и характер взаимодействия с объектами. Это особенно важно, потому что сами объекты могут значительно различаться. Например, уплотнительные полосы могут различаться по жесткости в зависимости от модели автомобиля, что напрямую влияет на то, как выполняется задача.
Далее идет кинематический трекинг. Маркеры – визуальные или сенсорные – размещаются на запястьях, локтях и иногда плечах. Это могут быть, например, браслеты с идентифицируемыми маркерами (podobными QR-кодам), которые позволяют системе отслеживать положение руки в пространстве по видео. Дополнительные датчики, такие как гироскопы, используются для захвата движений суставов.
Окончательной целью является полная реконструкция механики движения: как движется плечо, как сгибается локоть, как вращается запястье. Все это становится необходимым для следующего этапа – постобучения.
Если во время предобучения мы все еще могли частично полагаться на симуляцию, на этой стадии это уже не работает. Этот “последний этап” почти невозможно точно смоделировать. Вы не можете полностью смоделировать, например, как повар раскатывает тесто – приложенную силу, как распределяется давление, как чувствуется материал.
Поэтому во время постобучения почти все данные должны поступать из реального мира. И именно здесь становится ясно: основная проблема смещается в практическую область – как получить такие данные в реальности. Сбор эгоцентричных данных на этом уровне – это сложный, многоступенчатый процесс, который включает доступ к средам, специальное оборудование, участие квалифицированных работников и последующую подготовку данных.
За пределами теории это то место, где роботы действительно “оживают” – после того, как мы сумеем организовать этот процесс, преодолеть ограничения, с которыми сталкиваются команды в различных отраслях, и аннотировать такие наборы данных в масштабе. Это будет рассмотрено в следующей части, где мы более подробно рассмотрим все проблемы, которые возникают во время маркировки и подготовки.












