Робототехника и физический ИИ
компания mimic robotics представляет FLUX-mimic для применения видео-моделей действий на заводском полу Audi

компания mimic robotics представила FLUX-mimic, новую видео-модель действий, предназначенную для помощи промышленным роботам в обучении сложным задачам манипуляции с помощью значительно меньших объемов демонстрационных данных.
Разработанная в сотрудничестве с компанией визуального искусственного интеллекта Black Forest Labs, система уже тестируется и развертывается с компанией Audi на производственных задачах, которые исторически были трудными для автоматизации, включая работу с гибкими материалами, изменяющимися конфигурациями деталей и точной манипуляцией.
Объявление указывает на потенциальный сдвиг в физическом искусственном интеллекте. Вместо того, чтобы полагаться в первую очередь на большие коллекции демонстраций роботов, FLUX-mimic пытается передать знания, уже полученные генеративной видео-моделью, в систему, способную контролировать физические машины.
Новый подход к обучению роботов
Многие современные системы робототехники общего назначения основаны на моделях видения-языка-действия, обычно известных как VLA. Эти системы обычно объединяют модель, обученную на изображениях и языке, с дополнительным компонентом, который предсказывает движения, которые должен выполнить робот.
Этот подход дает роботам определенный уровень семантического понимания, такой как распознавание объекта или интерпретация написанной инструкции. Однако статические изображения не полностью отражают, как объекты гнутся, движутся, сталкиваются или реагируют на физический контакт.
Отсутствующее знание должно быть получено из демонстраций роботов, что может быть дорогим и耗ительным процессом. Каждая демонстрация требует физического робота, оператора, подходящего рабочего пространства и тщательно записанных данных действий.
FLUX-mimic следует другому пути. Он использует визуальные представления, полученные моделью FLUX 3 компании Black Forest Labs, в качестве основы для предсказания того, как задача должна развиваться во времени. Black Forest Labs описывает FLUX 3 как многомодальную модель, способную генерировать изображения, видео, аудио и действия, а не систему, ограниченную статической генерацией изображений.
Декодер действий затем переводит визуальное предсказание модели в команды, которые может выполнить робот. В практическом смысле система сначала оценивает, как должно выглядеть успешное выполнение задачи, и затем определяет, какие физические движения необходимы для достижения этого результата.
Развитие архитектуры mimic-video
FLUX-mimic основан на mimic-video, ранее проведенных исследованиях компании по использованию предварительно обученных видеомоделей в качестве основы для управления роботами.
Вместо того, чтобы просить традиционную модель видения-языка сделать вывод о движении из отдельных кадров, mimic-video создает латентный визуальный план, представляющий, как задача может развиваться. Отдельный декодер действий использует это внутреннее представление для генерации движений робота.
В своем исследовательском докладе компания сообщила, что mimic-video достигла примерно в десять раз большей эффективности выборки и в два раза большей скорости сходимости обучения по сравнению с аналогичной архитектурой VLA на протяжении всех своих оценок. Реальная система была обучена с использованием примерно 500 траекторий от двухрукого роботизированного манипулятора.
FLUX-mimic расширяет эту концепцию, используя архитектуру FLUX 3 и специально разработанный дизайн для физического искусственного интеллекта.
По словам компании mimic robotics, задачи, которые ранее могли потребовать 30 часов или более демонстраций роботов, могут достичь производственной готовности с помощью лишь 30 минут данных. Этот показатель представляет собой заявленные результаты компании и в конечном итоге потребует оценки в более широком диапазоне фабрик, конфигураций оборудования и производственных условий.
Тем не менее, сокращение требований к данным в такой степени может существенно изменить экономику промышленной робототехники. Затраты на развертывание часто распространяются далеко за пределы самого робота, с значительными ресурсами, посвященными программированию, интеграции, симуляции, тестированию и повторному проектированию всякий раз, когда меняется продукт или процесс.
Audi предоставляет требовательный промышленный тест
Компания Audi работает с компанией mimic robotics для оценки FLUX-mimic в реальных производственных средах, где системы автоматизации должны справляться с вариациями продукции, жесткими производственными требованиями и задачами, которые не всегда могут быть сведены к повторяющимся движениям.
Автомобильный производитель заявляет, что роботы выполнили сложные работы по манипуляции с мягкими телами, которые были бы чрезвычайно трудными для решения с помощью традиционной робототехники. Гибкие материалы особенно сложны, поскольку их форма меняется во время обработки, что делает трудным определение каждого движения через фиксированные координаты или правила.
Более широкие исследования автоматизации компании Audi иллюстрируют, почему адаптивность становится все более важной. На своем заводе Böllinger Höfe компания тестирует искусственный интеллект, мобильных роботов, компьютерное зрение и новые технологии сортировки в реальной лаборатории. Компания Audi отметила, что высокий уровень настройки автомобилей, таких как e-tron GT, создает сложные логистические процессы, включающие большое количество различных деталей.
Традиционные промышленные роботы остаются высокоэффективными, когда среда структурирована и каждый объект прибывает в предсказуемом положении. Они становятся менее экономически эффективными, когда детали, материалы или варианты продукции меняются достаточно часто, чтобы требовать повторной инженерной работы.
Системы, основанные на обучении, могут сделать эти процессы с более низким объемом производства и более высокой вариативностью более практичными для автоматизации. Вместо написания новой программы для каждой задачи производители могли бы продемонстрировать желаемое поведение и позволить системе научиться воспроизводить его.
Объединение моделей, оборудования и демонстраций человека
Модель является частью более широкой платформы робототехники, разрабатываемой компанией mimic robotics.
Компания разрабатывает свою собственную роботизированную руку, носимое оборудование для сбора данных, модели обучения роботов и инфраструктуру развертывания. Ее носимая система предназначена для записи движений человеческой руки в формате, который может быть передан более直接amente в роботизированные руки компании.
Этот акцент на руках, а не на полноценных роботах, отражает более целевой подход к промышленной автоматизации. Роботизированные руки могут быть прикреплены к традиционным роботизированным рукам, уже используемым на фабриках, что снижает необходимость введения совершенно нового роботизированного форм-фактора. ETH Zurich описывает этот подход как сочетание человекоподобной манипуляции с установленным промышленным оборудованием для решения задач, требующих адаптивности и самокоррекции.
Была основана как спин-офф ETH Zurich в 2024 году, компания mimic robotics выросла до более чем 50 сотрудников в Цюрихе и Сан-Франциско. Ее команда охватывает исследования моделей, робототехнику, разработку оборудования, операции с данными и промышленное развертывание.
Более широкие последствия для автоматизации фабрик
Значимость FLUX-mimic будет зависеть меньше от изолированных демонстраций, чем от того, сможет ли технология поддерживать высокие показатели успеха на протяжении тысяч производственных циклов.
Фабрики требуют последовательной производительности, предсказуемых циклов времени, безопасной работы вокруг сотрудников, быстрого восстановления после ошибок и интеграции с существующими производственными системами. Модель, которая учится быстро, но ведет себя непредсказуемо, не предложит никакого преимущества над традиционной автоматизацией.
Однако, если видео-модели действий могут сохранить свою заявленную эффективность данных, одновременно удовлетворяя требованиям промышленной надежности, они могут расширить робототехнику на категории работы, которые оставались ручными, потому что они были слишком переменными или дорогими для программирования.
Это может включать сборку гибких компонентов, обработку смешанного инвентаря, сортировку нерегулярных объектов, упаковку часто меняющихся продуктов и поддержку работников с физически требовательными процессами.
Долгосрочная возможность заключается не только в более способной роботизированной руке. Это другой модель развертывания, в которой производители учат машины через демонстрацию, а не определяют каждое движение заранее.
Участие Audi дает FLUX-mimic возможность доказать, что этот подход может выйти за пределы контролируемых исследовательских сред. Успех на заводском полу автомобильного производителя будет важным указанием на то, что генеративные видео-модели могут стать не просто инструментами для создания цифровых медиа, а частью интеллектуального слоя, который контролирует машины в физическом мире.












