Взгляд Anderson

Исправление ограниченного понимания диффузионных моделей отражений и зеркал

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o and Adobe Firefly

С тех пор, как генеративный ИИ начал привлекать общественное внимание, область исследований компьютерного зрения углубила свой интерес в разработке моделей ИИ, способных понимать и воспроизводить физические законы; однако, задача обучения систем машинного обучения симулировать явления, такие как гравитация и динамика жидкостей, была значительным направлением исследовательских усилий как минимум в течение пяти последних лет.

С латентными диффузионными моделями (ЛДМ), которые стали доминирующими в сцене генеративного ИИ в 2022 году, исследователи все больше сосредоточились на ограниченной способности архитектуры ЛДМ понимать и воспроизводить физические явления. Теперь эта проблема приобрела дополнительную значимость с появлением новой генеративной видеомодели OpenAI Sora и (спорно) более значимого недавнего выпуска открытых видеомоделей Hunyuan Video и Wan 2.1.

Отражая плохо

Большинство исследований, направленных на улучшение понимания физики ЛДМ, были сосредоточены на областях, таких как симуляция походки, физика частиц и другие аспекты ньютоновского движения. Эти области привлекли внимание, поскольку неточности в основных физических поведениях сразу же подорвали бы аутентичность видео, сгенерированного ИИ.

Однако небольшой, но растущий поток исследований сосредоточен на одном из самых больших слабостей ЛДМ – их относительной неспособности производить точные отражения.

Из январской статьи 2025 года 'Отражая реальность: Включение диффузионных моделей для создания верных отражений зеркал', примеры 'отражательной неудачи' против подхода исследователей. Источник: https://arxiv.org/pdf/2409.14677

Из январской статьи 2025 года ‘Отражая реальность: Включение диффузионных моделей для создания верных отражений зеркал’, примеры ‘отражательной неудачи’ против подхода исследователей. Источник: https://arxiv.org/pdf/2409.14677

Эта проблема также была вызовом в эпоху CGI и остается таковой в области видеоигр, где алгоритмы трассировки лучей симулируют путь света при взаимодействии с поверхностями. Трассировка лучей рассчитывает, как виртуальные лучи света отражаются или проходят через объекты, создавая реалистичные отражения, преломления и тени.

Однако, поскольку каждый дополнительный отскок значительно увеличивает вычислительную стоимость, реальные приложения должны идти на компромисс между задержкой и точностью, ограничивая количество допустимых отскоков лучей.

Представление виртуально рассчитанного светового луча в традиционной 3D-сцене, использующей технологии и принципы, впервые разработанные в 1960-х годах и которые были доведены до совершенства между 1982-93 годами (период между 'Троном' [1982] и 'Парком Юрского периода' [1993]). Источник: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Представление виртуально рассчитанного светового луча в традиционной 3D-сцене, использующей технологии и принципы, впервые разработанные в 1960-х годах и которые были доведены до совершенства между 1982-93 годами (период между ‘Троном’ [1982] и ‘Парком Юрского периода’ [1993]). Источник: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Проблемы изображений

По этой причине, фреймворки, которые были популярны до появления диффузионных моделей, такие как Нейронные радиационные поля (NeRF), и некоторые более поздние претенденты, такие как Гауссовское разбрызгивание, сохранили свои собственные проблемы с созданием отражений естественным образом.

Проект REF2-NeRF предложил метод моделирования NeRF для сцен с витриной. В этом методе преломление и отражение моделировались с помощью элементов, зависящих и независящих от точки зрения наблюдателя. Этот подход позволил исследователям оценить поверхности, где происходит преломление, в частности, стеклянные поверхности, и обеспечить разделение и моделирование прямого и отраженного света.

Примеры из статьи Ref2Nerf. Источник: https://arxiv.org/pdf/2311.17116

Примеры из статьи Ref2Nerf. Источник: https://arxiv.org/pdf/2311.17116

Другие решения NeRF, связанные с отражением, за последние 4-5 лет включали NeRFReN, Reflecting Reality и проект Meta 2024 года Planar Reflection-Aware Neural Radiance Fields проект.

Для GSplat статьи, такие как Mirror-3DGS, Reflective Gaussian Splatting и RefGaussian, предложили решения, связанные с проблемой отражения, а проект 2023 года Nero предложил специальный метод включения отражательных качеств в нейронные представления.

Зеркальный мир

Заставить диффузионную модель уважать логику отражения аргументированно более сложно, чем с явно структурными, не-семантическими подходами, такими как гауссовское разбрызгивание и NeRF. В диффузионных моделях правило такого типа, скорее всего, станет надежно встроенным только в том случае, если обучающие данные содержат многочисленные и разнообразные примеры в широком диапазоне сценариев, что делает его сильно зависим от распределения и качества исходной базы данных.

Традиционно, добавление конкретных поведений такого типа является прерогативой LoRA или тонкой настройки базовой модели; но эти решения не идеальны, поскольку LoRA склонна отклонять вывод в сторону своих собственных обучающих данных, даже без подсказок, а тонкая настройка – кроме того, что она дорогая – может отвести основную модель неразрывно от основной линии и породить множество связанных с этим индивидуальных инструментов, которые никогда не будут работать с другими вариантами модели, включая исходную.

В целом, улучшение диффузионных моделей требует, чтобы обучающие данные уделяли больше внимания физике отражения. Однако, есть много других областей, которые также нуждаются в подобном специальном внимании. В контексте гипермасштабных баз данных, где индивидуальная курирование дорогая и трудная, решение каждой отдельной слабости таким образом нецелесообразно.

Тем не менее, решения проблемы отражения ЛДМ время от времени появляются. Одним из недавних примеров является проект MirrorVerse из Индии, который предлагает улучшенную базу данных и метод обучения, способный улучшить состояние дел в этой конкретной задаче исследования диффузии.

Справа, результаты MirrorVerse, противопоставленные двум предыдущим подходам (центральные две колонки). Источник: https://arxiv.org/pdf/2504.15397

Справа, результаты MirrorVerse, противопоставленные двум предыдущим подходам (центральные две колонки). Источник: https://arxiv.org/pdf/2504.15397

Как мы видим в примере выше (фичер-изображение в PDF новой статьи), MirrorVerse улучшает недавние предложения, решающие одну и ту же проблему, но далеко не идеален.

В верхнем правом изображении мы видим, что керамические горшки находятся немного справа от того места, где они должны быть, и в изображении ниже, которое технически не должно содержать отражение чашки, неточное отражение было вставлено в правую часть, против логики естественных углов отражения.

Следовательно, мы рассмотрим новый метод не столько потому, что он может представлять собой текущее состояние дел в диффузионном отражении, но и чтобы проиллюстрировать степень, в которой это может оказаться неразрешимой проблемой для латентных диффузионных моделей, статических и видео, поскольку необходимые примеры отражательности, скорее всего, будут переплетены с конкретными действиями и сценариями.

Следовательно, эта конкретная функция ЛДМ может продолжать отставать от подходов, специфичных для структуры, таких как NeRF, GSplat и традиционный CGI.

Новая статья озаглавлена MirrorVerse: толкая диффузионные модели к реалистичному отражению мира и исходит от трех исследователей из Vision and AI Lab, IISc Bangalore и Samsung R&D Institute в Бангалоре. Статья имеет связанную страницу проекта, а также базу данных в Hugging Face, с исходным кодом, выпущенным на GitHub.

Метод

Исследователи отмечают с самого начала, что модели, такие как Stable Diffusion и Flux, испытывают трудности с соблюдением отражательных подсказок, иллюстрируя проблему умело:

Из статьи: современные модели генерации изображений по тексту, SD3.5 и Flux, демонстрируют значительные проблемы в создании последовательных и геометрически точных отражений при генерации отражений в сцене.

Из статьи: современные модели генерации изображений по тексту, SD3.5 и Flux, демонстрируют значительные проблемы в создании последовательных и геометрически точных отражений при генерации отражений в сцене.

Исследователи разработали MirrorFusion 2.0, диффузионную генеративную модель, направленную на улучшение фотorealизма и геометрической точности отражений зеркал в синтетических изображениях. Обучение модели было основано на собственной новой базе данных исследователей, озаглавленной MirrorGen2, разработанной для решения слабостей обобщения, наблюдаемых в предыдущих подходах.

MirrorGen2 расширяет предыдущие методологии, вводя случайное позиционирование объектов, рандомизированные вращения и явную привязку объектов, с целью обеспечения того, чтобы отражения оставались правдоподобными в широком диапазоне положений и ориентаций объектов относительно поверхности зеркала.

Схема генерации синтетических данных в MirrorVerse: конвейер генерации базы данных применяет ключевые аугментации путем случайного позиционирования, вращения и привязки объектов внутри сцены с помощью 3D-Positioner. Объекты также объединяются в семантически последовательных комбинациях для симуляции сложных пространственных отношений и окуляций, позволяя базе данных захватить более реалистичные взаимодействия в сценах с несколькими объектами.

Схема генерации синтетических данных в MirrorVerse: конвейер генерации базы данных применяет ключевые аугментации путем случайного позиционирования, вращения и привязки объектов внутри сцены с помощью 3D-Positioner. Объекты также объединяются в семантически последовательных комбинациях для симуляции сложных пространственных отношений и окуляций, позволяя базе данных захватить более реалистичные взаимодействия в сценах с несколькими объектами.

Чтобы еще больше укрепить способность модели справляться с сложными пространственными расположениями, конвейер MirrorGen2 включает парные сцены с объектами, позволяя системе лучше представлять окуляции и взаимодействия между несколькими элементами в отражающих условиях.

В статье говорится:

‘Категории объединяются вручную, чтобы обеспечить семантическую последовательность – например, объединение стула с столом. Во время рендеринга после позиционирования и вращения основного [объекта] выбирается дополнительный [объект] из объединенной категории и располагается так, чтобы избежать перекрытия, обеспечивая отдельные пространственные регионы внутри сцены.’

Что касается явной привязки объектов, здесь авторы обеспечили, чтобы сгенерированные объекты были ‘привязаны’ к земле в синтетических данных, а не ‘плавали’ неправдоподобно, что может произойти, когда синтетические данные генерируются в больших масштабах или с высокоавтоматизированными методами.

Поскольку инновации базы данных являются центральными для новизны статьи, мы перейдем к этому разделу раньше, чем обычно.

Данные и тесты

SynMirrorV2

База данных SynMirrorV2 исследователей была разработана для улучшения разнообразия и реализма обучающих данных отражений зеркал, включающих 3D-объекты из Objaverse и Amazon Berkeley Objects (ABO) баз данных, с последующим уточнением через OBJECT 3DIT, а также процесс фильтрации из V1 MirrorFusion проекта, для исключения низкокачественных активов. Это привело к уточненной базе из 66 062 объектов.

Примеры из базы данных Objaverse, использованные при создании базы данных для новой системы. Источник: https://arxiv.org/pdf/2212.08051

Примеры из базы данных Objaverse, использованные при создании базы данных для новой системы. Источник: https://arxiv.org/pdf/2212.08051

Строительство сцены включало размещение этих объектов на текстурированных полах из CC-Textures и фонов HDRI из PolyHaven CGI-репозитория, используя либо полноэкранные, либо высокие прямоугольные зеркала. Освещение было стандартизировано с помощью светильника, расположенного над и позади объектов, под углом 45 градусов. Объекты были масштабированы, чтобы поместиться внутри единичного куба и позиционировались с помощью предварительно вычисленного пересечения зеркала и камеры фрустумов, обеспечивая видимость.

Случайные вращения применялись вокруг оси Y, и использовалась техника привязки для предотвращения ‘плавающих артефактов’.

Чтобы смоделировать более сложные сцены, база данных также включала несколько объектов, расположенных в соответствии с семантически последовательными парами на основе категорий ABO. Вторичные объекты размещались так, чтобы избежать перекрытия, создавая 3 140 сцен с несколькими объектами, разработанных для захвата различных окуляций и глубинных отношений.

Примеры рендерингов из базы данных авторов, содержащей несколько (более двух) объектов, с иллюстрациями сегментации объектов и визуализаций карт глубины ниже.

Примеры рендерингов из базы данных авторов, содержащей несколько (более двух) объектов, с иллюстрациями сегментации объектов и визуализаций карт глубины ниже.

Процесс обучения

Признавая, что реализм синтетических данных сам по себе был недостаточным для надежной обобщаемости к реальным данным, исследователи разработали трехэтапный процесс обучения для MirrorFusion 2.0.

На этапе 1 авторы инициализировали веса как условной, так и генеративной ветвей с помощью контрольной точки Stable Diffusion v1.5 и дообучили модель на односубъектной обучающей раздел базы данных SynMirrorV2. В отличие от вышеупомянутого Reflecting Reality проекта, исследователи не замораживали генеративную ветвь. Затем они обучили модель в течение 40 000 итераций.

На этапе 2 модель была дообучена в течение дополнительных 10 000 итераций на многосубъектной обучающей раздел базы данных SynMirrorV2, чтобы научить систему справляться с окуляциями и более сложными пространственными расположениями, встречающимися в реалистичных сценах.

Наконец, на этапе 3 были проведены дополнительные 10 000 итераций дообучения с использованием реальных данных из MSD базы данных, с картами глубины, сгенерированными Matterport3D моноокулярным оценщиком глубины.

Примеры из MSD базы данных, с реальными сценами, проанализированными в карты глубины и сегментации. Источник: https://arxiv.org/pdf/1908.09101

Примеры из MSD базы данных, с реальными сценами, проанализированными в карты глубины и сегментации. Источник: https://arxiv.org/pdf/1908.09101

Во время обучения текстовые подсказки опускались на 20 процентов времени обучения, чтобы поощрить модель сделать оптимальное использование доступной информации о глубине (т.е. ‘маскированный’ подход).

Обучение проводилось на четырех NVIDIA A100 GPU для всех этапов (спецификация VRAM не указана, хотя она должна была составлять 40 ГБ или 80 ГБ на карту). Была использована скорость обучения 1e-5 на пакете размером 4 на GPU, под оптимизатором AdamW.

Эта схема обучения постепенно увеличивала сложность задач, представляемых модели, начиная с более простых синтетических сцен и продвигаясь к более сложным композициям, с целью развития надежной переносимости в реальные данные.

Тестирование

Авторы оценили MirrorFusion 2.0 против предыдущего состояния дел, MirrorFusion, который служил базовой линией, и провели эксперименты на базе данных MirrorBenchV2, охватывающей как односубъектные, так и многосубъектные сцены.

Дополнительные качественные тесты были проведены на образцах из MSD базы данных и Google Scanned Objects (GSO) базы данных.

Оценка использовала 2 991 односубъектное изображение из известных и неизвестных категорий и 300 двухобъектных сцен из ABO. Производительность оценивалась с помощью пикового отношения сигнал/шум (PSNR); индекс структурированного подобия (SSIM); и обучаемое перцептивное подобие патчей изображений (LPIPS) баллов, чтобы оценить качество отражения в маскированном регионе зеркала. Симметрия CLIP использовалась для оценки текстовой выравнивания с входными подсказками.

В количественных тестах авторы генерировали изображения, используя четыре семени для конкретной подсказки, и выбирали полученное изображение с лучшим баллом SSIM. Две таблицы результатов количественных тестов показаны ниже.

Слева, количественные результаты для качества генерации отражений одного объекта на односубъектной раздел базы данных MirrorBenchV2. MirrorFusion 2.0 превзошел базовую линию, с лучшими результатами, показанными жирным шрифтом. Справа, количественные результаты для качества генерации отражений нескольких объектов на многосубъектной раздел базы данных MirrorBenchV2. MirrorFusion 2.0, обученная на нескольких объектах, превзошла версию, обученную без них, с лучшими результатами, показанными жирным шрифтом.

Слева, количественные результаты для качества генерации отражений одного объекта на односубъектной раздел базы данных MirrorBenchV2. MirrorFusion 2.0 превзошел базовую линию, с лучшими результатами, показанными жирным шрифтом. Справа, количественные результаты для качества генерации отражений нескольких объектов на многосубъектной раздел базы данных MirrorBenchV2. MirrorFusion 2.0, обученная на нескольких объектах, превзошла версию, обученную без них, с лучшими результатами, показанными жирным шрифтом.

Авторы комментируют:

‘[Результаты] показывают, что наш метод превосходит базовую линию и что дообучение на нескольких объектах улучшает результаты на сложных сценах.’

Большинство результатов, и те, которые подчеркиваются авторами, относятся к качественному тестированию. Из-за размеров этих иллюстраций мы можем только частично воспроизвести примеры из статьи.

Сравнение на MirrorBenchV2: базовая линия не смогла сохранить точные отражения и пространственную последовательность, показывая неправильную ориентацию стула и искаженные отражения нескольких объектов, тогда как (авторы утверждают) MirrorFusion 2.0 правильно отображает стул и диваны, с точной позицией, ориентацией и структурой.

Сравнение на MirrorBenchV2: базовая линия не смогла сохранить точные отражения и пространственную последовательность, показывая неправильную ориентацию стула и искаженные отражения нескольких объектов, тогда как (авторы утверждают) MirrorFusion 2.0 правильно отображает стул и диваны, с точной позицией, ориентацией и структурой.

Из этих субъективных результатов исследователи полагают, что базовая линия не смогла точно отобразить ориентацию объектов и пространственные отношения в отражениях, часто производя артефакты, такие как неправильное вращение и плавающие объекты. MirrorFusion 2.0, обученная на SynMirrorV2, авторы утверждают, сохраняет правильную ориентацию объектов и позиционирование в односубъектных и многосубъектных сценах, в результате чего получаются более реалистичные и последовательные отражения.

Ниже мы видим качественные результаты на вышеупомянутой GSO базе данных:

Сравнение на GSO базе данных. Базовая линия неправильно представила структуру объекта и произвела неполные, искаженные отражения, тогда как MirrorFusion 2.0, авторы утверждают, сохраняет пространственную целостность и генерирует точную геометрию, цвет и детали, даже для объектов, не входящих в базу данных.

Сравнение на GSO базе данных. Базовая линия неправильно представила структуру объекта и произвела неполные, искаженные отражения, тогда как MirrorFusion 2.0, авторы утверждают, сохраняет пространственную целостность и генерирует точную геометрию, цвет и детали, даже для объектов, не входящих в базу данных.

Здесь авторы комментируют:

‘MirrorFusion 2.0 генерирует значительно более точные и реалистичные отражения. Например, на рис. 5 (а – выше), MirrorFusion 2.0 правильно отражает ручки ящика (выделено зеленым), тогда как базовая линия производит неправдоподобное отражение (выделено красным). ‘

‘Аналогично, для ‘Белой-желтой кружки’ на рис. 5 (б), MirrorFusion 2.0 обеспечивает убедительную геометрию с минимальными артефактами, тогда как базовая линия не может точно захватить геометрию и внешний вид объекта.’

Окончательный качественный тест был проведен против вышеупомянутой реальной MSD базы данных (частичные результаты показаны ниже):

Реальные результаты сцены, сравнивающие MirrorFusion, MirrorFusion 2.0 и MirrorFusion 2.0, дообученную на MSD базе данных. MirrorFusion 2.0, авторы утверждают, захватывает сложные детали сцены более точно, включая захламленные объекты на столе и присутствие нескольких зеркал в трехмерной среде. Показаны только частичные результаты, из-за размеров результатов в исходной статье, на которую мы ссылаемся читателя для полных результатов и лучшего разрешения.

Реальные результаты сцены, сравнивающие MirrorFusion, MirrorFusion 2.0 и MirrorFusion 2.0, дообученную на MSD базе данных. MirrorFusion 2.0, авторы утверждают, захватывает сложные детали сцены более точно, включая захламленные объекты на столе и присутствие нескольких зеркал в трехмерной среде. Показаны только частичные результаты, из-за размеров результатов в исходной статье, на которую мы ссылаемся читателя для полных результатов и лучшего разрешения.

Здесь авторы отмечают, что хотя MirrorFusion 2.0 показал хорошие результаты на MirrorBenchV2 и GSO базах данных, она изначально испытывала трудности с сложными реальными сценами в MSD базе данных. Дообучение модели на подмножестве MSD улучшило ее способность справляться с захламленными средами и несколькими зеркалами, в результате чего получались более последовательные и детальные отражения на тестовой выборке.

Кроме того, был проведен пользовательский тест, в котором 84% пользователей предпочли генерации MirrorFusion 2.0 базовому методу.

Результаты пользовательского теста.

Результаты пользовательского теста.

Поскольку подробности пользовательского теста были отнесены к приложению статьи, мы ссылаемся читателя на него для деталей исследования.

Заключение

Хотя некоторые из результатов, показанных в статье, являются впечатляющими улучшениями над текущим состоянием дел, текущее состояние дел в этой конкретной области настолько плохо, что даже неубедительное агрегатное решение может выиграть с минимальными усилиями. Основная архитектура диффузионной модели враждебна надежному обучению и демонстрации последовательной физики, поэтому проблема является неправильно поставленной и, по-видимому, не склонной к элегантному решению.

Более того, добавление данных к существующим моделям уже является стандартным методом исправления пробелов в производительности ЛДМ, со всеми упомянутыми выше недостатками. Можно предположить, что если будущие высокомасштабные базы данных будут уделять больше внимания распределению (и аннотации) отражательных данных, мы можем ожидать, что полученные модели будут лучше справляться с этой ситуацией.

Однако то же самое верно и для множества других проблем в выводе ЛДМ – кто может сказать, какая из них наиболее заслуживает усилий и средств, необходимых для решения, предложенного авторами новой статьи?

 

Опубликовано в понедельник, 28 апреля 2025 года. Вторник, 29 апреля: внесены исправления грамматики в последних абзацах.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai