Взгляд Anderson

Почему концептуальная запутанность означает, что вы не можете иметь видео AI «по вашему желанию»

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-1.5) depicting a man trying to fit disparate Legos together.

Инструменты видео AI обещают полный контроль, но скрытая «концептуальная запутанность» склеивает идентичности, выражения и поведение вместе, заставляя использовать хитрости и трюки с шаблонами, которые разрушают миф об легкой магии GenAI.

 

Мнение С тех пор, как я последний раз подробно рассматривал эту тему пять лет назад, проблема концептуальной запутанности в обученных системах AI распространилась на гораздо более широкий круг пользователей, не будучи по-настоящему понятой на своих собственных условиях.

Тогда автоэнкодерные системы глубоких подделок (т.е. теперь не существующие DeepFaceLab и менее порнографические FaceSwap, оба полученные из опозоренного и почти сразу же запрещенного выпуска кода на Reddit 2017 года) были единственной игрой в городе для создания относительно фотографически реалистичных глубоких подделок людей.

Эти системы полагались на обширные наборы данных для обучения лиц, которые были предназначены для предоставления модели AI информации о том, как человек выглядит в покое (каноническое вложение ссылки) и о том, как он выглядит в различных ситуациях, которые может отражать лицо, от сна до смеха, ужаса, скуки, цинизма, печали и т. д.

Идентичность не приходит одна, а вместе с выражениями лица. Кроме того, определенные эмоции могут иметь доступные только с определенных, экстремальных углов, которые будут ассоциировать угол с эмоцией и наоборот.

Идентичность не приходит одна, а вместе с выражениями лица. Кроме того, определенные эмоции могут иметь доступные только с определенных, экстремальных углов, которые будут ассоциировать угол с эмоцией и наоборот.

Проблема заключалась в том, что каноническая идентичность обычно должна была быть выведена из захватов лиц, которые не были сами по себе «нейтральными», поэтому преобладание улыбок и улыбок, полученных при скрапинге акций, сместит распределение в сторону «улыбчивого по умолчанию». Это было потому, что высокого объема красной ковровой фотографии в веб-скрапированных обучающих данных, которые обычно информируют эти модели, а также любая другая равно сомнительная причина, почему набор данных может быть смещен к одному типу изображения.

Иными словами, система автоэнкодера должна была попытаться извлечь «нейтральную» концепцию идентичности из тысяч изображений, где черты лица были искажены нормальными выражениями лица.

Она также должна была попытаться разъединить семантические концепции лица различных эмоций от углов, с которых были сделаны лица. Это означало, что если единственные «ужаснувшиеся» выражения лица были сделаны с профиля, обученная система сможет воспроизвести эту эмоцию оптимально только с этого вида.

Вперед

Когда диффузионные подходы взяли на себя генерацию изображений AI (и позже видео) с 2022 года, генеративные системы стали намного лучше в экстраполяции точных выражений лица при ограниченных данных лица.

Даже очень сложная задача создания убедительных профильных видов была практически преодолена на текущем уровне искусства, а данные об выражениях были довольно эффективно отделены от идентичности – настолько, что тип живой глубокой подделки, который был открыт автоэнкодерной системой DeepFaceLive, имеет много эффективных офлайн-приложений диффузии, с реальным временем воплощения, вероятно, будущим развитием:

Нажмите, чтобы воспроизвести. Из проекта «FlashPortrait» разнообразные примеры управления аватарами через исходные видео. В данном случае не имеет значения, какой «реалистичный» домен сидит на каком-либо месте, если таковой имеется. Источник 

Но когда холст GenAI расширился и выход стал более сложным, проблема запутанности просто распространилась на множество других областей – и в настоящее время «исправляется» некоторыми довольно дешевыми и старыми трюками. Если вы не знаете, какие это трюки, вы можете иметь более положительный взгляд на то, как быстро видео и изображения AI развиваются и преодолевают свои старые проблемы.

Болтливые кошки

Надеюсь, теперь ясно, почему идентичность и эмоция оказались трудными для разделения для старых систем автоэнкодера 2017 года. Это было потому, что а) было слишком много данных одного типа, или слишком конкретная версия одного типа важных данных, любое из которых вызовет смещение распределения; и/или Б) архитектура модели не была способна разделить эти качества и склеила их вместе во время вывода, если пользователь не принял необычных мер, чтобы обеспечить баланс в своем наборе данных.

По той же причине, подобные проблемы возникли в ряде открытых и проприетарных видеомоделей за последние несколько лет, хотя они были затенены большим уровнем критики вокруг галлюцинаций, отсутствия цензуры и различных других тем.

Например, в системе Wan2.+ многие пользователи обнаружили, что очень сложно остановить своих сгенерированных персонажей от бесконечной болтовни, и часто также сложно остановить их глядя на камеру.

Последняя проблема (глядя на камеру или ломая четвертую стену) предшествует появлению систем синтеза видео, поскольку она возникла в различных системах диффузии только для изображений, из-за распространения фотографий «глядящих на камеру» в веб-скрапированных наборах данных, таких как LAION.

Проблема вокруг «болтливых» персонажей возникает из-за легкого изобилия «инфлюенсерских» видео на YouTube, которые естественно предлагают тысячи часов прямого дискурса в объектив, часто кураторированных в наборы данных, где исследователи могут отмыть веб-скрап, предоставив академический контекст.

Но если исходные или последующие кураторы не принимают мер, чтобы ограничить количество видео этого типа и сбалансировать их с другими типами кадров, возникает сильное смещение в видеомодели, которое потребует решения через средства корректировки и различные сторонние системы.

Фaced с проблемой «болтовни» Wan, пользователь Reddit u/Several-Estimate-681 придумал обходной путь, который использует настройку в системе Wan 2.1 Infinite Talk V2V –框架, предназначенный для поощрения инфлюенсерского типа болтовни – который позволяет пользователю заглушить отображаемый персонаж:

Нажмите, чтобы воспроизвести. Просто слушайте – обходной путь, чтобы достичь внимания персонажа в Wan2.+. Источник 

Ясно, что обходные пути этого типа не представляют собой низкоуровневые архитектурные решения, и, в отсутствие настоящих решений, найденных и реализованных создателями моделей основы (поскольку случайные хобби не обычно имеют миллионы долларов, чтобы пересоздать или тонко настроить такую работу), это означает, что игра в «запутанность» «кто кого» вряд ли будет сброшена до нуля при следующем выпуске версии.

Дешевые и хрупкие

В диффузионной архитектуре самой по себе нет ничего, что делало бы эти проблемы неизбежными; действительно, если бы был способ применить действительно эффективную курирование, триаж и высококачественную подпись и аннотацию к гипермасштабным наборам данных с миллионами точек данных, почти все эти проблемы, вероятно, исчезли бы.

Однако такой уровень внимания к деталям был бы подобен Манхэттенскому проекту по логистике, объему, необходимым ресурсам и чистому долгосрочному усилию. В климате, где новая архитектура или даже новая версия архитектуры могла бы отменить всю степень такого усилия, нет текущей воли сделать такой компромисс.

Следовательно, поскольку это согласуется с получением рабочих моделей, наиболее дешевые подходы остаются предпочтительными. Одним из таких примеров «жадности» является aData augmentation, который, когда применяется без ограничений и к неправильным типам наборов данных видеоклипов, может иметь смешные результаты:

Поскольку данные часто обращаются в сторону источников в наборе данных, модель AI может иногда выучить некоторые «невозможные» движения. Источник

Однако в целом камни, катящиеся вверх, и люди, ломающие характер, включая «инфлюенсерский режим», склонны считаться примерами побочного ущерба в генеративных системах, которые, несмотря на такие постоянные промахи и ахиллесовы пяты, могут быть подогнаны к производству впечатляющих результатов и достаточно впечатляющих заголовков.

Шаблонные решения

В текущий период сотни генеративных видеодоменов, почти все из которых каким-то образом нарушают новый набор законов и давление против GenAI, наслаждаются своим временем у корыта, прежде чем правоохранительные органы, блокировки или другие виды деактивации удалят эти коммерческие услуги.

Большие и более известные сайты этого типа, такие как Kling и Grok, склонны либо придерживаться некоторой формы самоцензуры (в конечном итоге), либо реагировать на критику, меняя тип контента, который их платформы облегчают для пользователей.

Но за этими большими именами есть сотни других мошеннических операций, постоянно обслуживающих спрос на новые (и часто более экстремальные) виды контента.

Такой тип низкоуровневого обеспечения исключает очень высокую стоимость и усилия по обучению моделей основы с нуля. Даже тонкая настройка, которая стоит значительно меньше, часто исключается.

Следовательно, эти сайты предлагают «шаблоны», которые ведут себя на 100% идентично в практике кастомным обученным LoRAs, которые были использованы хобби AI более четырех лет, чтобы обучить любую желаемую идентичность, стиль, объект и (в случае видео LoRAs) движение или действие в посвященный LoRA-адъютант.

С LoRA, расположенным между пользователем и моделью основы, результаты, полученные в результате, будут очень специфичными для того, на чем был обучен LoRA, и обычно более широкая производительность модели будет подорвана влиянием LoRA, который будет воспроизводить свой собственный предмет очень хорошо, но также будет вставлять этот материал в любой запрос, если мошеннические сайты GenAI видео позволяют этот уровень контроля – они не; они просто предлагают [ДЕЙСТВИЕ ВАШЕГО ВЫБОРА] шаблон и интерпретируют ваш ввод текста/изображений/видео таким образом, чтобы наиболее вероятно привести к успешному применению шаблона.

Для очевидных причин я не могу встроить примеры веб-сайтов в эту статью; но литература исследований недавно предложила некоторые аналогичные примеры. Здесь, например, проект EffectMaker показывает принцип в действии, когда конкретное действие применяется к пользовательскому изображению:

Нажмите, чтобы воспроизвести. В EffectMaker можно применить тонко настроенные конкретные эффекты к пользовательскому вводу. Источник 

Даже в этих высоко курированных и целевых обстоятельствах пользователи часто жалуются, что необходимо сделать несколько попыток, сжигающих токены, чтобы получить хороший результат, и мы не должны, возможно, приписывать провайдерам жадности или острым практикам, что более вероятно является виной врожденных «попаданий и промахов» DiT GenAI-фреймворков.

Широкая общественность, можно утверждать, получает свое впечатление о возможностях GenAI из отобранных примеров, которые не являются представительными для того, что может получить случайный, начинающий пользователь. Если пользователь сжигает шесть попыток шаблона (т. е. LoRA, поставляемого веб-сайтом AI), он, скорее всего, опубликует и похвалит лучшее из них, передавая впечатление, что можно получить такие результаты, запросив базовую модель – и передавая впечатление, что генеративные модели основы намного более дезентangled, чем они есть на самом деле.

Вывод

Литература продолжает исследовать проблему запутанности, которая впервые серьезно появилась в 2020 году в сотрудничестве Max Planck/Google A Sober Look at the Unsupervised Learning of Disentangled Representations and their Evaluation.

Кроме того, различные последователи Disentanglement via Contrast (DisCo) периодически появляются, и сцена остается живой с осознанием проблемы, которая далеко превышает общественное осознание того, что AI не может сделать в этом отношении.

Одно китайское исследование 2024 года предполагает, что решение проблемы запутанности может не быть необходимо для решения проблем, которые оно вызывает. Исторически это звучит правдиво, поскольку многие неразрешимые проблемы в компьютерном зрении были преодолены не решением, а обходом через совершенно новые методы и подходы.

До тех пор, пока не появится дискретный претендент, кажется, мы продолжим применять горячие исправления и повязки на несовершенства и ограничения GenAI и терпеть общественную переоценку гибкости и пластичности моделей основы.

 

Опубликовано в понедельник, 23 марта 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai