Робототехніка та фізичний ШІ
mimic robotics представляє FLUX-mimic для впровадження моделей відео-дій на заводському поверсі Audi

mimic robotics представила FLUX-mimic, нову модель відео-дій, розроблену для допомоги індустріальним роботам у вивченні складних маніпуляційних завдань з значно менших обсягів демонстраційних даних.
Розроблена у співробітництві з компанією візуального штучного інтелекту Black Forest Labs, система вже тестується та впроваджується разом з Audi на виробничих завданнях, які історично були складними для автоматизації, включаючи роботу з гнучкими матеріалами, змінними конфігураціями деталей та точними маніпуляціями.
Оголошення вказує на потенційний зсув у фізичному штучному інтелекті. Замість того, щоб спиратися в основному на великі колекції демонстрацій роботів, FLUX-mimic намагається передати знання, вже вивчені генеративною відеомоделлю, у систему, здатну контролювати фізичні машини.
Новий підхід до навчання роботів
Багато сучасних загальних робототехнічних систем базуються на моделях візуальної мови та дії, загальновідомих як VLA. Ці системи зазвичай поєднують модель, навчену на зображеннях та мові, з додатковим компонентом, який передбачає рухи, які повинен виконувати робот.
Цей підхід надає роботам певний рівень семантичного розуміння, такий як розпізнавання об’єкта або інтерпретація написаної інструкції. Однак статичні зображення не повністю відображають, як об’єкти згинаються, рухаються, зіштовхуються або реагують на фізичний контакт.
Відсутню інформацію тому необхідно вивчити з демонстрацій роботів, які можуть бути дорогими та часозатратними для збору. Кожна демонстрація вимагає фізичного робота, оператора, робочого простору та ретельно записаних даних дій.
FLUX-mimic вибирає інший шлях. Він використовує візуальні представлення, створені моделлю FLUX 3 компанії Black Forest Labs, як основу для передбачення того, як завдання повинно розвиватися з часом. Black Forest Labs описує FLUX 3 як багатомодальну модель, здатну генерувати зображення, відео, аудіо та дії, а не систему, обмежену статичною генерацією зображень.
Декодер дій потім перекладає візуальне передбачення моделі у команди, які може виконувати робот. У практичних термінах система спочатку оцінює, яким повинно бути успішне виконання завдання, а потім визначає, які фізичні рухи необхідні для отримання такого результату.
Розбудова на основі архітектури mimic-video
FLUX-mimic розбудовується на основі mimic-video, попередніх досліджень компанії щодо використання попередньо навчених відеомоделей як основи для робототехнічного контролю.
Натомість ніж просити традиційну модель візуальної мови передбачити рух з окремих кадрів, mimic-video створює латентний візуальний план, який представляє, як завдання може розвиватися. Відокремлений декодер дій використовує це внутрішнє представлення для генерації рухів робота.
У своєму дослідницькому папері компанія повідомила, що mimic-video досягла приблизно у десять разів вищої ефективності вибірки та вдвічі вищої швидкості згортання навчання порівняно з порівнюваною архітектурою VLA під час своїх оцінок. Реальна система була навчена за допомогою близько 500 траєкторій від дворукої роботизованої установки.
FLUX-mimic розширює цю концепцію, використовуючи архітектуру FLUX 3 та дизайн, спеціально створений для фізичного штучного інтелекту.
За словами компанії mimic robotics, завдання, які раніше могли потребувати 30 годин або більше демонстрацій роботів, можуть досягти продукційної готовності з лише 30 хвилин даних. Ця цифра представляє звіти компанії та в кінцевому підсумку повинна бути оцінена у ширшому діапазоні заводів, апаратних конфігурацій та виробничих умов.
Хоча це й так, зменшення вимог до даних такого рівня могло б суттєво змінити економіку індустріальної робототехніки. Витрати на розгортання часто розширюються далеко за межі самого робота, з значними ресурсами, присвяченими програмуванню, інтеграції, симуляції, тестуванню та перепроектуванню всякий раз, коли продукт або процес змінюється.
Audi пропонує складний промисловий тест
Audi працює з компанією mimic robotics для оцінки FLUX-mimic у реальних виробничих середовищах, де системи автоматизації повинні мати справу з варіацією продукції, жорсткими вимогами виробництва та завданнями, які не завжди можна скоротити до повторюваних рухів.
Автовиробник каже, що роботи виконали складні маніпуляції з м’якими тілами, які були б надзвичайно складними для традиційної робототехніки. М’які матеріали особливо складні, оскільки їхня форма змінюється під час обробки, що робить складним визначення кожного руху через фіксовані координати чи правила.
Ширші дослідження автоматизації Audi ілюструють, чому адаптивність стає дедалі важливішою. На своєму заводі Böllinger Höfe компанія тестує штучний інтелект, мобільних роботів, комп’ютерне бачення та нові технології збирання у реальному світі. Audi відзначила, що високий рівень налаштування автомобілів, таких як e-tron GT, створює складні логістичні процеси, що включають велику кількість різних деталей.
Традиційні промислові роботи залишаються високоефективними, коли середовище структуроване, а кожен об’єкт прибуває у передбачуваній позиції. Вони стають менш економічними, коли частини, матеріали або варіанти продукції часто змінюються, що вимагає повторної інженерної роботи.
Системи, засновані на навчанні, могли б зробити ці нижньоволоконні та високоваріативні процеси більш практичними для автоматизації. Замість того, щоб писати нову програму для кожного завдання, виробники могли б продемонструвати бажану поведінку та дозволити системі вивчити, як її повторити.
Об’єднання моделей, апаратного забезпечення та демонстрацій людини
Модель є частиною повноцінної робототехнічної платформи, розроблюваної компанією mimic robotics.
Компанія будує власну апаратну руку, носимий апарат для збору даних, моделі навчання роботів та інфраструктуру розгортання. Її носимий апарат призначений для запису рухів людської руки у форматі, який можна передати більш напряму до роботизованих рук компанії.
Центр уваги на руках, а не на повністю гуманоїдних роботах, відображає більш цілеспрямований підхід до промислової автоматизації. Декстерні руки можна прикріпити до традиційних роботизованих рук, вже використовуваних на заводах, що знижує потребу у введенні цілком нового роботизованого формату. ETH Zurich описує цей підхід як об’єднання людиноподібної маніпуляції з усталеною промисловою апаратурою для вирішення завдань, які вимагають адаптивності та самокорекції.
Заснована як спін-офф ETH Zurich у 2024 році, компанія mimic robotics виросла до понад 50 працівників у Цюриху та Сан-Франциско. Її команда охоплює дослідження моделей, робототехніку, розробку апаратного забезпечення, операції з даними та промислове розгортання.
Ширші наслідки для заводської автоматизації
Значення FLUX-mimic буде залежати менше від ізольованих демонстрацій, ніж від того, чи зможе технологія підтримувати високі показники успіху протягом тисяч виробничих циклів.
Заводи вимагають постійної продуктивності, передбачуваних часів циклів, безпечної роботи біля працівників, швидкого відновлення після помилок та інтеграції з існуючими виробничими системами. Модель, яка вивчає швидко, але поводиться непередбачувано, пропонуватиме мало переваг над традиційною автоматизацією.
Однак, якщо відео-дійові моделі можуть зберегти свою заявлену ефективність даних, одночасно задовольняючи вимогам промислової надійності, вони могли б розширити робототехніку на категорії робіт, які залишилися ручними, оскільки вони були надто змінними або дорогими для програмування.
Це могло б включати збірку гнучких компонентів, обробку змішаних запасів, сортування нерівномірних об’єктів, упаковку часто змінюваних продуктів та підтримку працівників у фізично вимагаючих процесах.
Довгострокова можливість полягає не просто у більш здатній роботизованій руці. Це інша модель розгортання, у якій виробники вчать машини через демонстрацію, а не визначають кожний рух заздалегідь.
Участь Audi надає FLUX-mimic можливість довести, що цей підхід може вийти за межі контрольованих дослідницьких середовищ. Успіх на автомобільному заводському поверсі пропонує важливий індикатор того, що генеративні відеомоделі можуть стати не просто інструментами для створення цифрових медіа, а частиною інтелектуального шару, який контролює машини у фізичному світі.












