Робототехніка та фізичний ШІ
Як робототехніка вчить роботів просити про допомогу
У світі робототехніки виділяється революційна співпраця між Принстонським університетом та Google (GOOGL ). Інженери цих престижних закладів розробили інноваційний метод, який вчить роботів важливому навику: розпізнаванню ситуацій, коли їм потрібна допомога, та способам просити про неї. Цей розвиток став значним кроком вперед у робототехніці, зв’язуючи пропасти між автономною діяльністю та взаємодією людини та робота.
Шлях до створення більш інтелектуальних та незалежних роботів завжди був ускладнений однією значною проблемою: складністю та двозначністю людської мови. На відміну від двійкової ясності комп’ютерних кодів, людська мова наповнена нюансами та тонкостями, роблячи її лабіринтом для роботів. Наприклад, команда такої простої, як “підніміть чашку”, може стати складним завданням, коли присутнє кілька чашок. Роботи, оснащені для сприйняття довкілля та реагування на мову, часто опиняються на роздоріжжі, коли стикаються з такими мовними невизначеностями.
Квантуюча невизначеність
Для вирішення цієї проблеми команда Принстона та Google ввела новий підхід, який квантуює “розмиту” людської мови. Ця техніка міряє рівень невизначеності в мовних командах та використовує цю міру для керування діями робота. У ситуаціях, коли команда може привести до декількох інтерпретацій, робот тепер може оцінити рівень невизначеності та вирішити, коли шукати подальше уточнення. Наприклад, у середовищі з декількома чашками вищий рівень невизначеності спонукатиме робота запитати, яку чашку підняти, тим самим уникнувши потенційних помилок або неефективності.
Цей підхід не тільки наділяє роботів кращим розумінням мови, але також підвищує їхню безпеку та ефективність у виконанні завдань. Інтегруючи великі мовні моделі (LLM), як ті, що стоять за ChatGPT, дослідники зробили значний крок у зближенні дій роботів з очікуваннями та потребами людини.
Роль великих мовних моделей
Інтеграція LLM грає ключову роль у цьому новому підході. LLM інструментальні у обробці та інтерпретації людської мови. У цьому контексті вони використовуються для оцінки та вимірювання невизначеності, присутньої у мовних командах, даних роботам.
Однак залежність від LLM не позбавлена своїх проблем. Як зазначає дослідницька команда, виходи LLM іноді можуть бути ненадійними.
Анірудха Маджумдар, асистент-професор у Принстоні, підкреслює важливість цього балансу:
“Сліпе слідування планам, згенерованим LLM, може спричинити дії роботів у небезпечній або недостовірній манері, і тому нам потрібні наші LLM-роботи, які знають, коли вони не знають.”
Це підкреслює необхідність нюансованого підходу, де LLM використовуються як інструменти для керівництва, а не як невід’ємні рішення.
Практичне застосування та тестування
Практичність цього методу була перевірена у різних сценаріях, демонструючи його універсальність та ефективність. Одним із таких тестів було завдання роботизованої руки, яке мало сортувати іграшки-їжу у різні категорії. Ця проста установка продемонструвала здатність робота ефективно орієнтуватися у завданнях з чіткими виборами.

Зображення: Принстонський університет
Складність значно зросла в іншому експерименті, який включав роботизовану руку, встановлену на колісній платформі в офісній кухні. Тут робот стикнувся з реальними викликами, такими як ідентифікація правильного предмета для розміщення в мікрохвильовій печі, коли було представлено кілька варіантів.
Через ці тести роботів успішно продемонстрували свою здатність використовувати квантуючу невизначеність для прийняття рішень або пошуку уточнення, тим самим підтверджуючи практичну корисність цього методу.
Майбутні наслідки та дослідження
Оглядаючи майбутнє, наслідки цього дослідження виходять далеко за межі поточних застосувань. Команда, очолювана Маджумдаром та аспірантом Алленом Реном, досліджує, як цей підхід можна застосувати до більш складних проблем у сприйнятті роботів та штучному інтелекті. Це включає сценарії, у яких роботам потрібно поєднувати візуальну та мовну інформацію для прийняття рішень, ще більше звужуючи пропасти між розумінням роботів та взаємодією людини.
Триває дослідження, спрямоване не тільки на підвищення здатності роботів виконувати завдання з вищою точністю, але й на орієнтацію у світі з розумінням, подібним до людського сприйняття. Це дослідження може відкрити шлях для роботів, які не тільки більш ефективні та безпечні, але й більш гармонійні з нюансами вимог людського середовища.
Опубліковане дослідження можна знайти тут.












