Взгляд Anderson

Может ли модель мира ИИ действительно понять физические законы?

mm
Добавьте Unite.AI в избранные источники в Google
Image produced by ChatGPT-4o, depicting diverse objects exhibiting aberrant physical properties. The prompt was developed conversationally

Большая надежда на модели ИИ, основанные на языке и изображениях, заключается в том, что они однажды станут способны к большей автономии и универсальности, включая принципы физических законов таким же образом, как мы развиваем интуитивное понимание этих принципов через ранний опыт.

Например, детские игры с мячом помогают развить понимание кинетики движения, и влияние веса и текстуры поверхности на траекторию. Аналогично, взаимодействие с обычными сценариями, такими как ванны, пролитые напитки, океан, бассейны и другие разнообразные жидкие тела, помогут нам развить универсальное и масштабируемое понимание того, как жидкости ведут себя под гравитацией.

Даже постулаты менее распространенных явлений – таких как сгорание, взрывы и распределение веса зданий под давлением – бессознательно воспринимаются через просмотр телепрограмм и фильмов или видео в социальных сетях.

К моменту, когда мы изучаем принципы этих систем на академическом уровне, мы фактически просто “дорабатываем” наши интуитивные (но неосведомленные) ментальные модели их.

Мастера одного

В настоящее время большинство моделей ИИ более “специализированы” и многие из них либо настраиваются или обучаются с нуля на наборах изображений или видео, которые довольно специфичны для определенных случаев использования, а не предназначены для развития такого общего понимания управляемых законов.

Другие могут создавать видимость понимания физических законов; но они могут фактически воспроизводить образцы из своих тренировочных данных, а не действительно понимать основы областей, таких как физика движения, в sposób, который может производить действительно новые (и научно правдоподобные) изображения из запросов пользователей.

На этом деликатном этапе продукционизации и коммерциализации систем ИИ остается нам и вниманию инвесторов различать искусственно созданный маркетинг новых моделей ИИ и реальность их ограничений.

Одна из наиболее интересных работ ноября, возглавляемая Bytedance Research, затронула эту проблему, изучая разрыв между кажущимися и реальными возможностями “универсальных” моделей ИИ, таких как Sora.

Работа заключила, что на текущем уровне развития моделей ИИ, сгенерированный вывод из моделей этого типа более вероятно является подражанием примерам из их тренировочных данных, чем демонстрацией полного понимания основных физических ограничений, действующих в реальном мире.

Документ гласит*:

‘Эти модели могут быть легко предвзяты “обманчивыми” примерами из тренировочного набора, что приводит к тому, что они обобщают в “случае-основанном” порядке под определенным условиями. Это явление, также наблюдаемое в больших языковых моделях, описывает тенденцию модели ссылаться на подобные тренировочные случаи при решении новых задач.

‘Например, рассмотрим видеомодель, обученную на данных высокоскоростного мяча, движущегося в равномерном линейном движении. Если данные дополняются путем горизонтального переворота видео, что вводит движение в обратном направлении, модель может сгенерировать сценарий, в котором низкоскоростной мяч меняет направление после начальных кадров, хотя такое поведение не физически правильно.’

Мы более подробно рассмотрим эту работу – озаглавленную Оценка моделей мира с помощью LLM для принятия решений – чуть позже. Но сначала давайте посмотрим на фоновые условия этих кажущихся ограничений.

Воспоминание о прошлом

Без обобщения обученная модель ИИ является лишь дорогой таблицей ссылок на разделы ее тренировочных данных: найдите подходящий поисковый запрос, и вы можете вызвать экземпляр этих данных.

В этом сценарии модель фактически действует как “нейронный поисковый движок”, поскольку она не может производить абстрактные или “креативные” интерпретации желаемого вывода, а вместо этого реплицирует некоторую незначительную вариацию данных, которые она видела во время тренировки.

Это известно как запоминание – спорная проблема, которая возникает потому, что действительно гибкие и интерпретируемые модели ИИ склонны к нехватке деталей, в то время как действительно подробные модели склонны к нехватке оригинальности и гибкости.

Способность моделей, затронутых запоминанием, воспроизводить тренировочные данные является потенциальной юридической проблемой в случаях, когда создатели модели не имели неограниченных прав на использование этих данных; и где выгоды от этих данных можно продемонстрировать через растущее количество методов извлечения.

Из-за запоминания следы неавторизованных данных могут сохраняться, соединенные через несколько тренировочных систем, как нестираемый и непреднамеренный водяной знак – даже в проектах, где практикующий машинное обучение принял меры, чтобы обеспечить использование “безопасных” данных.

Модели мира

Однако основной проблемой использования запоминания является то, что оно склонно создавать иллюзию интеллекта или предполагать, что модель ИИ обобщила фундаментальные законы или области, когда на самом деле это большое количество запомненных данных, которое создает эту иллюзию (т.е. модель имеет так много потенциальных примеров данных, которые она может выбрать, что человеку трудно определить, повторяет ли она выученный контент или имеет ли она действительно абстрактное понимание концепций, участвующих в генерации).

Эта проблема имеет последствия для растущего интереса к моделям мира – перспективе высоко разнообразных и дорого обученных систем ИИ, которые включают несколько известных законов и богато исследуемых.

Модели мира особенно интересны в области генерации изображений и видео. В 2023 году RunwayML начала исследовательскую инициативу по разработке и осуществимости таких моделей; DeepMind недавно наняла одного из создателей известной генеративной видеомодели Sora для работы над моделью этого типа; и стартапы, такие как Higgsfield, инвестируют значительные средства в модели мира для синтеза изображений и видео.

Трудные комбинации

Одним из обещаний новых разработок в системах ИИ генерации видео является перспектива того, что они могут научиться фундаментальным физическим законам, таким как движение, кинематика человека (например, характеристики походки), динамика жидкостей и другие известные физические явления, которые, по крайней мере, визуально знакомы людям.

Если системы ИИ генерации видео смогут достичь этой вехи, они смогут производить гиперреалистичные визуальные эффекты, изображающие взрывы, наводнения и правдоподобные столкновения объектов.

Если, с другой стороны, система ИИ просто была обучена на тысячах (или сотнях тысяч) видео, изображающих такие события, она может быть способна воспроизводить тренировочные данные довольно убедительно, когда она обучена на похожем данных пункте на запрос пользователя; но провалится, если запрос сочетает слишком много концепций, которые в таком сочетании не представлены в данных.

Более того, эти ограничения не будут сразу очевидны, пока система не будет протестирована на сложных комбинациях.

Это означает, что новая система генерации видео может быть способна генерировать вирусный видеоконтент, который, хотя и впечатляет, создает ложное впечатление о возможностях системы и глубине понимания, поскольку задача, которую она представляет, не является реальной проблемой для системы.

Например, относительно распространенное и хорошо распространенное событие, такое как ‘здание снесено’, может присутствовать в нескольких видео в наборе данных, используемом для обучения модели, которая должна иметь некоторое понимание физики. Следовательно, модель может, предположительно, обобщить эту концепцию хорошо и даже произвести действительно новые выводы в пределах параметров, изученных из многочисленных видео.

Это в-дистрибутивный пример, где набор данных содержит много полезных примеров для обучения модели.

Однако, если вы запросите более странное или сомнительное пример, такое как ‘Эйфелева башня взорвана инопланетянами’, модель должна объединить разнообразные области, такие как ‘металлические свойства’, ‘характеристики взрывов’, ‘гравитация’, ‘сопротивление ветра’ – и ‘инопланетные космические корабли’.

Это вне-дистрибутивный (OOD) пример, который сочетает так много переплетенных концепций, что система, скорее всего, либо не сможет сгенерировать правдоподобный пример, либо будет использовать ближайший семантический пример, на который она была обучена – даже если этот пример не соответствует запросу пользователя.

За исключением того, что набор данных модели содержал спецэффекты CGI-стиля из Голливуда, изображающие то же или подобное событие, такое изображение абсолютно потребовало бы, чтобы модель достигла хорошо обобщенного и гибкого понимания физических законов.

Физические ограничения

Новая работа – совместная работа между Bytedance, Университетом Цинхуа и Технионом – предполагает, что модели, такие как Sora, не только не действительно интернализируют детерминированные физические законы таким образом, но и что масштабирование данных (обычный подход за последние 18 месяцев) кажется, в большинстве случаев, не приводит к реальному улучшению в этом отношении.

Работа изучает не только пределы экстраполяции конкретных физических законов – таких как поведение объектов в движении при столкновении или когда их путь блокируется – но и способность модели к комбинаторному обобщению – экземпляры, в которых представления двух различных физических принципов объединяются в одну генеративную salida, которая является верной физическому закону, лежащему в основе каждого из отдельных движений.

Видеообзор новой работы. Источник: https://x.com/bingyikang/status/1853635009611219019

Три физических закона, выбранных для изучения исследователями, были параболическое движение; равномерное линейное движение; и совершенно упругое столкновение.

Как можно увидеть в видео выше, результаты показывают, что модели, такие как Sora, не действительно интернализируют физические законы, а склонны воспроизводить тренировочные данные.

Более того, авторы обнаружили, что такие аспекты, как цвет и форма, становятся настолько переплетенными во время вывода, что сгенерированный мяч, скорее всего, превратится в квадрат, по-видимому, потому что подобное движение в примере набора данных содержало квадрат, а не мяч (см. пример в видео выше).

Работа, которая заметно вовлекла исследовательский сектор в социальных сетях, заключает:

‘Наше исследование показывает, что масштабирование само по себе недостаточно для моделей генерации видео, чтобы открыть фундаментальные физические законы, несмотря на его роль в более широком успехе Sora…

‘…[Результаты] показывают, что масштабирование само по себе не может решить проблему OOD, хотя оно улучшает производительность в других сценариях.

‘Наш подробный анализ показывает, что обобщение видеомодели больше полагается на ссылку на подобные тренировочные примеры, чем на изучение универсальных правил. Мы наблюдали порядок приоритета цвета > размера > скорости > формы в этом “случае-основанном” поведении.

‘[Наше] исследование показывает, что наивное масштабирование недостаточно для моделей генерации видео, чтобы обнаружить фундаментальные физические законы.’

Когда исследователям был задан вопрос, нашла ли команда решение этой проблемы, один из авторов работы отметил:

‘К сожалению, мы не нашли. На самом деле, это, вероятно, миссия всего сообщества ИИ.’

Метод и данные

Исследователи использовали Вариационный автоэнкодер (VAE) и DiT архитектуры для генерации видеоэкземпляров. В этой настройке сжатые латентные представления, произведенные VAE, работают в тандеме с моделью DiT денойзинга.

Видео были обучены на стабильном распространении V1.5-VAE. Схема была оставлена фундаментально неизменной, с только конечными архитектурными улучшениями:

‘[Мы сохраняем] большинство исходных 2D-сворачивания, групповой нормализации и механизмов внимания на пространственных размерностях.

‘Чтобы надуть эту структуру в пространственно-временной автоэнкодер, мы конвертируем последние несколько 2D-блоков сворачивания кодировщика и первые несколько 2D-блоков расворачивания декодера в 3D, и используем несколько дополнительных 1D-слоев для улучшения временного моделирования.’

Для включения видеомоделирования модифицированный VAE был совместно обучен с данными HQ-изображений и видео, с 2D-компонентом генеративной сети противодействия (GAN) родной архитектуры SD1.5, дополненной для 3D.

Используемый набор изображений был исходным источником Stable Diffusion, LAION-Aesthetics, с фильтрацией, в дополнение к DataComp. Для видеоданных был отобран поднабор из Vimeo-90K, Panda-70m и HDVG наборов данных.

Данные были обучены в течение одного миллиона шагов, с случайным изменением размера и случайным горизонтальным переворотом, примененным в качестве процессов дополнения данных.

Переворот

Как упоминалось выше, процесс случайного горизонтального переворота может быть недостатком при обучении системы, предназначенной для производства аутентичного движения. Это связано с тем, что вывод из обученной модели может учитывать обе направления объекта и вызывать случайные обращения, когда она пытается согласовать это противоречивое данные (см. встроенное видео выше).

С другой стороны, если выключить горизонтальный переворот, модель более вероятно произведет вывод, который придерживается только одного направления, изученного из тренировочных данных.

Итак, нет простого решения этой проблемы, кроме того, что система действительно ассимилирует все возможности движения как из родного, так и из перевернутого варианта – способность, которую дети развивают легко, но которая, по-видимому, является более сложной задачей для моделей ИИ.

Тесты

Для первого набора экспериментов исследователи сформировали 2D-симулятор для производства видео движения объектов и столкновений, которые соответствуют законам классической механики, что обеспечило большой и контролируемый набор данных, который исключил неоднозначности реальных видео, для оценки моделей. Box2D физический движок игр был использован для создания этих видео.

Три фундаментальных сценария, упомянутых выше, были重点ом тестов: равномерное линейное движение, совершенно упругое столкновение и параболическое движение.

Наборы данных увеличивающегося размера (от 30 000 до трех миллионов видео) были использованы для обучения моделей разных размеров и сложности (DiT-S до DiT-L), с первыми тремя кадрами каждого видео, использованными для условий.

Детали различных моделей, обученных в первом наборе экспериментов. Источник: https://arxiv.org/pdf/2411.02385

Детали различных моделей, обученных в первом наборе экспериментов. Источник: https://arxiv.org/pdf/2411.02385

Исследователи обнаружили, что результаты в-дистрибутива (ID) масштабируются хорошо с увеличением количества данных, в то время как генерации OOD не улучшаются, что указывает на недостатки в обобщении.

Результаты первого раунда тестов.

Результаты первого раунда тестов.

Авторы отмечают:

‘Эти результаты показывают, что масштабирование не может выполнять рассуждения в сценариях OOD.’

Далее исследователи протестировали и обучили системы, предназначенные для демонстрации профессиональности в комбинаторном обобщении, когда два противоречивых движения объединяются (надеюсь) для производства связного движения, которое является верным физическому закону, лежащему в основе каждого из отдельных движений.

Для этой фазы тестов авторы использовали PHYRE симулятор, создав 2D-окружение, которое изображает несколько и разнообразно-форменных объектов в свободном падении, сталкивающихся друг с другом в различных сложных взаимодействиях.

Метрики оценки для этого второго теста были Fréchet Video Distance (FVD); Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); и человеческое исследование (обозначенное как ‘abnormal’ в результатах).

Три масштаба обучающих наборов данных были созданы, на 100 000 видео, 0,6 миллиона видео и 3-6 миллиона видео. Модели DiT-B и DiT-XL были использованы, из-за повышенной сложности видео, с первым кадром, использованным для условий.

Модели были обучены в течение одного миллиона шагов на разрешении 256×256, с 32 кадрами на видео.

Результаты второго раунда тестов.

Результаты второго раунда тестов.

Результат этого теста показывает, что просто увеличение объема данных является недостаточным подходом:

Работа гласит:

‘Эти результаты показывают, что как емкость модели, так и покрытие пространства комбинаций являются важными для комбинаторного обобщения. Этот вывод подразумевает, что законы масштабирования для генерации видео должны сосредоточиться на увеличении разнообразия комбинаций, а не просто на увеличении объема данных.’

Наконец, исследователи провели дальнейшие тесты, чтобы попытаться определить, могут ли модели генерации видео действительно ассимилировать физические законы или просто запоминать и воспроизводить тренировочные данные во время вывода.

Здесь они изучили концепцию “случае-основанного” обобщения, когда модели склонны имитировать конкретные тренировочные примеры, когда сталкиваются с новыми ситуациями, а также изучили примеры равномерного движения – в частности, как направление движения в тренировочных данных влияет на прогнозы обученной модели.

Два набора тренировочных данных, для равномерного движения и столкновения, были отобраны, каждый из которых состоит из видео равномерного движения, изображающих скорости между 2,5 и 4 единицами, с первыми тремя кадрами, использованными в качестве условий. Латентные значения, такие как скорость, были опущены, и после обучения тестирование было проведено на обоих виденных и невиденных сценариях.

Ниже мы видим результаты теста для генерации равномерного движения:

Результаты теста для генерации равномерного движения, где переменная 'скорость' опущена во время обучения.

Результаты теста для генерации равномерного движения, где переменная ‘скорость’ опущена во время обучения.

Авторы заявляют:

‘[С] большим пробелом в тренировочном наборе модель склонна генерировать видео, где скорость либо высокая, либо низкая, чтобы походить на тренировочные данные, когда начальные кадры показывают средние скорости.’

Для тестов столкновения задействовано гораздо больше переменных, и модель должна изучить двумерную нелинейную функцию.

Столкновение: результаты третьего и последнего раунда тестов.

Столкновение: результаты третьего и последнего раунда тестов.

Авторы наблюдают, что присутствие ‘обманчивых’ примеров, таких как обратное движение (т.е. мяч, который отскакивает от поверхности и меняет направление), может ввести в заблуждение модель и заставить ее генерировать физически неправильные прогнозы.

Заключение

Если алгоритм, не являющийся ИИ (т.е. “запечатанный”, процедурный метод), содержит математические правила для поведения физических явлений, таких как жидкости, объекты под гравитацией или под давлением, есть набор неизменных констант, доступных для точного рендеринга.

Однако вывод новой работы показывает, что никакого эквивалентного отношения или внутреннего понимания классических физических законов не развивается во время обучения моделей генерации, и что увеличение количества данных не решает проблему, а скорее скрывает ее – потому что большее количество тренировочных видео доступно для системы, чтобы имитировать во время вывода.

 

* Мой перевод INLINE-цитат авторов в гиперссылки.

Опубликовано впервые во вторник, 26 ноября 2024 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai