Робототехніка та фізичний ШІ

Модель машинного навчання розуміє відносини між об’єктами

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Масачусетського технологічного інституту (MIT) розробили нову модель машинного навчання (ML), яка розуміє основні відносини між об’єктами в сцені. Модель представляє окремі відносини одна за одною, перш ніж поєднувати їх для опису загальної сцени.

За допомогою цього нового підходу модель машинного навчання може генерувати більш точні зображення з текстових описів, і вона може робити це навіть тоді, коли сцена має кілька проектів, розташованих у різних відносинах один з одним.

Цей новий розвиток важливий, оскільки багато моделей глибокого навчання не можуть зрозуміти заплутані відносини між окремими об’єктами.

Модель команди може бути використана в випадках, коли промислові роботи повинні виконувати багатокрокові маніпуляції, такі як укладання предметів або збірка пристроїв. Вона також допомагає привести до того, щоб машини могли вивчати та взаємодіяти зі своїми середовищами, як і люди.

Yilun Du – аспірант лабораторії комп’ютерних наук та штучного інтелекту (CSAIL) і співавтор статті. Du спільно очолював дослідження з Shuang Li, аспірантом CSAIL, і Nan Liu, аспірантом університету Іллінойсу в Урбані-Шампейні. До складу команди також входили Joshua B. Tenenbaum, професор когнітивних наук та обчислень у відділі мозку та когнітивних наук, і старший автор Antonio Torralba, професор електротехніки та комп’ютерних наук. Обидва Tenenbaum і Torralba є членами CSAIL.

Нова структура

“Коли я дивлюся на стіл, я не можу сказати, що там є об’єкт у місці XYZ. Наші розуми не працюють так. Коли ми розуміємо сцену, ми дійсно розуміємо її на основі відносин між об’єктами. Ми вважаємо, що побудувавши систему, яка може зрозуміти відносини між об’єктами, ми могли б використовувати цю систему для більш ефективного маніпулювання та зміни наших середовищ”, – говорить Du.

Нова структура може генерувати зображення сцени на основі текстового опису об’єктів та їх відносин.

Система може розбити ці речення на менші частини, які описують кожну окрему відносину. Кожна частина потім моделюється окремо, а частини поєднуються через процес оптимізації, який генерує зображення сцени.

З розбитими реченнями на менші частини система може потім рекомбінувати їх різними способами, що дозволяє їй адаптуватися до описів сцен, яких вона ніколи не зустрічала.

“Інші системи б взяли всі відносини цілісно та згенерували б зображення одним кроком з опису. Однак такі підходи не працюють, коли у нас є описи поза розподілом, такі як описи з більшою кількістю відносин, оскільки ці моделі не можуть адаптуватися одним кроком для генерації зображень, що містять більше відносин. Однак, оскільки ми складаємо ці окремі, менші моделі разом, ми можемо моделювати більшу кількість відносин та адаптуватися до нових комбінацій”, – говорить Du.

Система також може виконувати цей процес у зворотному порядку. Якщо їй подається зображення, вона може знайти текстові описи, які відповідають відносинам між об’єктами в сцені.

Оцінка моделі

Дослідники попросили людей оцінити, чи зображення, згенеровані моделлю, відповідають оригінальному опису сцени. Коли описи містили три відносини, що було найбільш складним типом, 91% учасників сказали, що нова модель працює краще, ніж інші методи глибокого навчання.

“Одна цікава річ, яку ми знайшли, полягає в тому, що для нашої моделі ми можемо збільшити нашу речення з одного опису відносини до двох, трьох або навіть чотирьох описів, і наш підхід продовжує генерувати зображення, які правильно описуються цими описами, тоді як інші методи не працюють”, – говорить Du.

Модель також продемонструвала вражаючу здатність працювати з описами, яких вона раніше не зустрічала.

“Це дуже перспективно, оскільки це ближче до того, як працюють люди. Люди можуть побачити лише кілька прикладів, але ми можемо витягнути корисну інформацію лише з цих кількох прикладів і поєднати їх разом, щоб створити нескінченну кількість комбінацій. І наша модель має таку властивість, яка дозволяє їй вивчати на основі менших даних, але узагальнювати до більш складних сцен або генерації зображень”, – говорить Li.

Команда тепер планує протестувати модель на реальних зображеннях, які є більш складними, та дослідити, як в кінцевому підсумку інтегрувати модель у робототехнічні системи.

Alex очолює новинні операції Unite.AI, що працюють на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію, щоб підтримувати своєчасне та масштабоване висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок у сфері ШІ, зберігаючи редакційні стандарти видання.