Робототехника и физический ИИ

Эра гуманоидов не грядет — она уже здесь

mm
Добавьте Unite.AI в избранные источники в Google

Ранее в этом месяце в Китае гуманоидный робот по имени Shuang Shuang вышел на сцену на церемонии выпуска в средней школе в провинции Фуцзянь, чтобы получить диплом — пожимая руки и радуя студентов и учителей. Такие моменты представляют собой значительный сдвиг, когда гуманоидные роботы начинают входить в общественную жизнь очень заметными способами.

Эти моменты отмечают не только общественное любопытство — они сигнализируют о сдвиге в сторону реальной интеграции. В этой статье исследуется, как гуманоиды переходят от показа и зрелища к функциональности — и почему то, что кажется исключительно аппаратным достижением, на самом деле связано с интегрированным интеллектом, который позволяет этим машинам ходить, взаимодействовать и учиться в средах, не предназначенных для автоматизации. Мы также обсудим, как мы подходим к коммерциализации через раннюю эксплуатацию и долгосрочные партнерства.

Как гуманоиды продвигают ИИ в реальный мир

Пробел между виртуальной производительностью и физической надежностью остается одной из наиболее упущенных проблем в ИИ. Чат-бот может генерировать абзацы связного текста без необходимости действовать по ним — так же, как модель зрения может идентифицировать ступеньку на изображении без необходимости физически ориентироваться на ней или рисковать падением. Гуманоиды не имеют такого роскоши.

Чтобы функционировать в реальном мире, ИИ должен оставить позади статические наборы данных и контролируемые условия. Он должен видеть, решать и действовать в средах, которые меняются каждую секунду. Это включает в себя неровные полы, перемещенные объекты, непредсказуемое поведение человека и контекстно-зависимые невербальные сигналы. Результатом является ежедневная конфронтация с шумом, неоднозначностью и потенциальной неудачей.

Именно здесь начинается значение воплощенного рассуждения — когда язык основан на пространстве, времени и последствиях — более важного, чем предсказание токенов. Например, если человек говорит «осторожно, это скользко», робот должен связать эту фразу не только с определением слова, но и с пространственным осознанием, потенциальными рисками и реальными корректировками.

В то же время становится необходимым многомодальное обучение, поскольку ни один входной канал не достаточно надежен, чтобы работать самостоятельно. Камера может пропустить скользкую поверхность, но датчики давления в ноге могут обнаружить внезапную потерю сцепления. Или, в другой ситуации, распознавание речи может не сработать в шумном складе, но визуальные сигналы или жесты могут заполнить пробел.

Обобщение также становится критическим. Робот не может полагаться на то, что увидит одну и ту же среду дважды. Ему нужно адаптировать свое поведение, когда пол мокрый, освещение меняется или коробка не находится там, где она была вчера. Это становится разницей между успешной реализацией и неудачей.

В Humanoid это почему мы начинаем тестировать рано с коммерческими партнерами. Мы интегрируем наших роботов в реальные среды, чтобы оперативно обнаружить потенциальные недостатки и обеспечить оптимальную функциональность до развертывания. Робот, который работает хорошо в симуляции или демонстрации, не тот же, что и тот, который заслуживает доверия под давлением, потому что это доверие в конечном итоге строится на реальном обучении.

Мы знаем, что гуманоиды будут доступны коммерчески в течение следующих двух лет — но мы не ждем. Для нас коммерциализация начинается рано. Это означает построение долгосрочных партнерств вокруг реальных случаев использования. Через серию пилотных программ мы не только обучаем наших партнеров о технологии — мы также учимся вместе с ними. Этот совместный процесс обучения также помогает нам усовершенствовать структуры затрат и надежность работы с первого дня — обеспечивая лучшую возможную общую стоимость владения (TCO) по мере масштабирования систем.

Почему гуманоиды являются окончательной тестовой площадкой для общего интеллекта

Мир, который мы создали за последний век, предназначен для человеческого масштаба. Ручки дверей, вилочные погрузчики, склады — все предполагает определенные размеры, диапазоны движения и неявное социальное поведение. Гуманоиды должны адаптироваться к этой реальности или они рискуют быть чрезвычайно ограниченными в своей функциональности.

Чтобы подняться по лестнице, нести объект, интерпретировать указывающий жест или распознавать колебания в голосе, робот должен понимать контекст далеко за пределами визуальной классификации или сценарного планирования движения. Он должен выводить намерения, учиться новому заданию, наблюдая за человеком, адаптировать этот навык к немного другому расположению и улучшать свою производительность со временем. На практике эта система эффективно расширяет то, что может делать ИИ под реальными ограничениями.

В Humanoid мы ускоряем этот процесс с помощью телеоперации. На ранних этапах разработки человеческие операторы направляют робота через ключевые задачи. Эти практические данные становятся основой для обучения новых поведений. Со временем эти демонстрации входят в наши модели «от начала до конца», помогая нам строить надежную автономию.

От узких систем к интегрированному интеллекту

Большинство систем ИИ сегодня превосходно справляются с узкими задачами. В изоляции каждая из них работает хорошо. Но гуманоиды не нуждаются в отключенных специалистах. Чтобы интегрироваться успешно, нам нужны системы, которые могут рассуждать через модальности и временные масштабы.

Гуманоид может получить относительно неясную инструкцию — «Иди принеси мне желтую коробку из склада через коридор» — и должен расшифровать ее в последовательность подзадач: локализовать говорящего, пройти по коридору, определить правильную коробку, отрегулировать силу хватки, избежать столкновений и, конечно же, вернуться безопасно.

Каждая часть этой последовательности включает в себя разную подсистему — зрение, локомоцию, язык, манипуляцию и обратную связь. И надежность всей системы зависит от того, насколько хорошо эти части общаются в меняющихся условиях.

Модульная архитектура — это способ решить эту проблему. Это позволяет нам итерировать подсистемы независимо, сохраняя при этом системную координацию. Кроме того, это позволяет нам масштабировать возможности в нескольких средах без необходимости перестраивать все с нуля. Это то, как мы переходим от закрытых демонстраций к открытой реализации.

Ставки огромны — и они глобальны

Легко представить гуманоидов как футуристических. Но когда мы говорим с нашими клиентами, потребность является немедленной. Многие склады, сборочные линии и другие когда-то оживленные рабочие места теперь борются за то, чтобы остаться укомплектованными.

Эти нехватки рабочей силы являются демографическими проблемами. В Японии почти 30% населения старше 65 лет. В Европе ключевые секторы — которые имеют совокупную зарплату в 1,7 триллиона долларовборются за набор более молодых работников. Это не те роли, которые большинство людей хотят, и все чаще это не те роли, которые люди готовы выполнять.

Выходя в качестве помощников, а не замены, гуманоиды могут взять на себя физически требовательные, повторяющиеся или опасные задачи — перемещение запасов, загрузку паллет, эксплуатацию оборудования — без риска усталости или травмы. Это освобождает человеческих работников, чтобы сосредоточиться на более сложных, творческих или межличностных аспектах работы.

Кроме того, это создает долгосрочную экономическую стойкость. Когда рабочая сила волатильна или недоступна, интеллектуальные машины могут помочь обеспечить непрерывность — все без жертвования безопасностью, качеством или адаптивностью.

Другой аспект, который следует подчеркнуть, — это нормативная база. Большинство команд — особенно в юрисдикциях с слабым регулированием — ждут, чтобы подумать об этом. Мы начали с этого. Безопасность и законы о данных в Европе являются одними из самых жестких в мире, но вместо того, чтобы рассматривать их как препятствия, мы считаем их нашим конкурентным преимуществом. Когда другие рынки принимают более строгие правила, мы будем готовы им соответствовать, в то время как другие компании могут спешить.

Новая гонка ИИ — но не та, о которой вы думаете

Большая часть дискуссии об ИИ сегодня центрируется вокруг вычислительной мощности, параметров и обучающих данных. Но настоящий прорыв может прийти с другого фронта: интеграции в физическом мире. Именно там интеллект должен учиться выполнять, а не просто предсказывать.

В этом отношении гонка заключается в наиболее способной системе — той, которая может работать в общественных пространствах, под ограничениями безопасности и с людьми в цикле. Эта система, кроме обучения на данных, также — и особенно — будет учиться на реальности и работать вместе с людьми без нарушения потока событий.

Именно поэтому мы не ждем до развертывания, чтобы начать. С самого начала мы работаем напрямую с коммерческими партнерами, чтобы интегрироваться в реальные среды — обеспечивая, чтобы система улучшалась там, где это наиболее важно: на практике.

Такое реальное обучение — именно то, где узкие системы не справляются. Хотя они привели нас далеко, они не были разработаны для этой сложности. Гуманоиды требуют чего-то другого — координации, прочности и, как упоминалось, способности учиться на неожиданном.

Это огромная возможность перед нами. Не автоматизировать все, а построить машины, которые могут понимать, ориентироваться и сотрудничать с человеческим миром.

Артем Соколов - основатель Humanoid, а также глобальный инвестор и предприниматель. Он успешно взял на себя семейный бизнес и вырос до оценки в 1 миллиард долларов. Затем он основал Humanoid, чтобы создать безопасных и надежных гуманоидных роботов, которые освобождают людей от физически требовательной работы. Сегодня он возглавляет команду из более чем 130 профессионалов из некоторых из ведущих технологических компаний мира, привнося мировой технический уровень для разработки будущего сотрудничества человека и машины.