Робототехніка та фізичний ШІ

Дослідники CMU створили робототехнічного робота, який малює

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники Інституту робототехніки Університету Карнегі-Меллона створили інструмент під назвою FRIDA, який являє собою роботизовану руку з прикріпленою до неї пензлем. Цей інструмент використовує штучний інтелект (ШІ), щоб працювати разом з людьми над художніми проєктами.

Команда готується представити свою роботу під назвою “FRIDA: Колаборативний робот-малюар з диференційовним, реальним плануванням середовища” на Міжнародній конференції з робототехніки та автоматизації IEEE у травні.

Пітер Шальденбранд – аспірант Інституту робототехніки Школи комп’ютерних наук. Він працює з FRIDA та досліджує ШІ та креативність.

“Є одна картина жаби-балерини, яку я думаю, що вийшла дуже добре”, – сказав він. “Це дуже дурно і весело, і я думаю, що сюрприз того, що створила FRIDA на основі моїх вхідних даних, був дуже весело бачити”.

FRIDA – це акронім від Framework and Robotics Initiative for Developing Arts. Її назвали на честь Фріди Кало.

Дослідження було проведено під керівництвом Шальденбранда разом з членами факультету RI Джин Ох і Джимом Маккаамом, і воно привернуло увагу студентів і дослідників з усієї території CMU.

Колаборативний інструмент, а не художник

Користувачі можуть керувати FRIDA, вводячи текстовий опис, надсилаючи інші твори мистецтва для натхнення її стилю, або завантажуючи фотографію і просити її намалювати представлення її. Команда також тестує інші входи, такі як аудіо.

“FRIDA – це роботизована система малювання, але FRIDA не є художником”, – продовжив Шальденбранд. “FRIDA не генерує ідеї для спілкування. FRIDA – це система, з якою художник може співпрацювати. Художник може вказувати високорівневі цілі для FRIDA, а потім FRIDA може виконувати їх”.

Для створення зображення робот використовує моделі ШІ, які порівнянні з тими, які живлять OpenAI’s ChatGPT і DALL-E 2, які генерують текст або зображення у відповідь на запит. FRIDA симулює, як би вона намалювала зображення пензлем, і використовує машинне навчання для оцінки свого прогресу під час роботи.

Кінцевими продуктами FRIDA є фантастичні та імпресіоністичні зображення. Пензлеві рухи сміливі та не мають точності, яку часто шукають у роботизованих заходах.

“FRIDA – це проєкт, який досліджує перетин людської та роботизованої креативності”, – додав Маккенн. “Фріда використовує ті самі моделі ШІ, які були розроблені для виконання завдань, таких як підписання зображень і розуміння змісту сцени, і застосовує їх до цієї художньої генеративної задачі”.

FRIDA використовує ШІ та машинне навчання кілька разів під час свого процесу створення мистецтва. Спочатку вона витрачає годину або більше на навчання використання свого пензля. Потім вона використовує моделі мови та зображення, які були навчені на великих наборах даних, що поєднують текст і зображення, витягнуті з інтернету, такі як OpenAI’s Contrastive Language-Image Pre-Training (CLIP), щоб зрозуміти вхідні дані.

Одним з найважливіших технічних викликів при створенні фізичного зображення є зменшення розриву між симуляцією та реальністю, тобто розриву між тим, що створює FRIDA у симуляції, і тим, що вона малює на полотні. FRIDA використовує ідею, відому як реальне планування середовища, де фактичні рухи пензля робота використовуються для навчання симулятора відображати та імітувати фізичні можливості робота та матеріалів для малювання.

Команда FRIDA тепер спрямована на вирішення деяких обмежень сучасних великих моделей мови та зображення шляхом постійного вдосконалення тих, які вони використовують. Вони годували моделі заголовками новинних статей, щоб надати їм відчуття того, що відбувається у світі, і далі навчали їх на зображеннях і текстах, які є більш репрезентативними для різноманітних культур, щоб уникнути американського або західного упередження.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.