Взгляд Anderson
Личный взгляд на тенденции литературы по компьютерному зрению в 2024 году

Я последовательно слежу за исследованиями в области компьютерного зрения (CV) и синтеза изображений на Arxiv и других площадках уже около пяти лет, поэтому тенденции становятся очевидными со временем, и они меняются в новых направлениях каждый год.
Поэтому, когда 2024 год подходит к концу, я подумал, что было бы уместно взглянуть на некоторые новые или эволюционирующие характеристики в публикациях на Arxiv в разделе Компьютерное зрение и распознавание образов section. Эти наблюдения, хотя и основаны на сотнях часов изучения сцены, являются строго анекдотическими.
Продолжающийся рост Восточной Азии
К концу 2023 года я заметил, что большинство литературы в категории “синтез голоса” исходило из Китая и других регионов Восточной Азии. К концу 2024 года я должен отметить (анекдотически), что это теперь применяется также к исследовательской сцене синтеза изображений и видео.
Это не означает, что Китай и соседние страны всегда производят лучшую работу (на самом деле, есть некоторые доказательства обратного); ни то, что это учитывает высокую вероятность в Китае (как и на Западе), что некоторые из наиболее интересных и мощных новых разрабатываемых систем являются проприетарными и исключены из научной литературы.
Но это говорит о том, что Восточная Азия обгоняет Запад по объему. То, что это стоит, зависит от степени, в которой вы верите в жизнеспособность пersistence Эдисона, который обычно оказывается неэффективным в лицо непреодолимых препятствий.
Есть многие такие препятствия в генеративном ИИ, и не легко знать, какие из них можно решить, устраняя существующие архитектуры, а какие будут нуждаться в пересмотре с нуля.
Хотя исследователи из Восточной Азии, кажется, производят большее количество статей по компьютерному зрению, я заметил увеличение частоты проектов в стиле “Франкенштейна” – инициатив, которые представляют собой слияние предыдущих работ, добавляя ограниченную архитектурную новизну (или, возможно, просто другой тип данных).
В этом году гораздо большее число восточно-азиатских (в основном китайских или китайских сотрудничеств) работ, казалось, было обусловлено квотами, а не заслугами, значительно увеличивая отношение сигнала к шуму в уже переполненной области.
В то же время, большее число восточно-азиатских статей также привлекло мое внимание и восхищение в 2024 году. Итак, если это все игра чисел, она не терпит неудачи – но и не дешева.
Увеличение объема публикаций
Объем статей, из всех стран,显но увеличился в 2024 году.
Самый популярный день публикаций меняется на протяжении года; сейчас это вторник, когда количество публикаций в разделе Компьютерное зрение и распознавание образов часто составляет около 300-350 в один день, в “пиковые периоды” (май-август и октябрь-декабрь, т.е. сезон конференций и “сезон ежегодных квот” соответственно).
За пределами моего собственного опыта, Arxiv сам сообщает о рекордном количестве публикаций в октябре 2024 года, с 6000 новыми публикациями, и раздел Компьютерное зрение является вторым по количеству публикаций после раздела Машинное обучение.
Однако, поскольку раздел Машинное обучение на Arxiv часто используется как “дополнительная” или агрегированная супер-категория, это говорит о том, что Компьютерное зрение и распознавание образов на самом деле является наиболее опубликованной категорией Arxiv.
Собственные статистические данные Arxiv, конечно, изображают информатику как явного лидера по публикациям:

Информатика (CS) доминирует в статистике публикаций на Arxiv за последние пять лет. Источник: https://info.arxiv.org/about/reports/submission_category_by_year.html
Отчет 2024 AI Index Стэнфордского университета, хотя и не может сообщить о последних статистических данных, также подчеркивает заметный рост публикаций научных статей по машинному обучению в последние годы:

Хотя цифры для 2024 года недоступны, отчет Стэнфорда все же демонстрирует значительный рост объема публикаций по машинному обучению. Источник: https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf
Распространение Diffusion>Mesh фреймворков
Одной из других ясных тенденций, которая возникла для меня, было значительное увеличение количества статей, которые занимаются использованием латентных диффузионных моделей (LDM) в качестве генераторов сеточных, “традиционных” моделей CGI.
Проекты этого типа включают InstantMesh3D, 3Dtopia, Diffusion2, V3D, MVEdit и GIMDiffusion, среди множества других.

Генерация и уточнение сетки через диффузионный процесс в 3Dtopia. Источник: https://arxiv.org/pdf/2403.02234
Эта возникающая исследовательская ветвь может быть рассмотрена как неявное признание продолжающейся неэффективности генеративных систем, таких как диффузионные модели, которые только два года назад позиционировались как потенциальная замена всем системам, которые модели диффузии>сетки теперь стремятся заполнить; отводя диффузию на роль инструмента в технологиях и рабочих процессах, которые восходят к тридцати или более годам.
Stability.ai, создатели открытой модели Stable Diffusion, только что выпустили Stable Zero123, который может, среди прочего, использовать нейронные радиационные поля (NeRF) как мост для создания явной, сеточной модели CGI, которая может быть использована в средах CGI, таких как Unity, в видеоиграх, дополненной реальности и других платформах, которые требуют явных 3D координат, в отличие от неявных (скрытых) координат непрерывных функций.
Нажмите, чтобы воспроизвести. Изображения, сгенерированные в Stable Diffusion, могут быть преобразованы в рациональные сетки CGI. Здесь мы видим результат рабочего процесса изображение>CGI, используя Stable Zero 123. Источник: https://www.youtube.com/watch?v=RxsssDD48Xc
3D Семантика
Пространство генеративного ИИ делает различие между 2D и 3D системами реализации зрения и генеративных систем. Например, фреймворки для определения лица, хотя и представляют 3D объекты (лица) во всех случаях, не все обязательно вычисляют адресуемые 3D координаты.
Популярная система FANAlign, широко используемая в архитектурах deepfake 2017 года (среди других), может удовлетворять обоим подходам:

Выше, 2D ориентиры генерируются на основе признанных линий и особенностей лица. Ниже, они рационализируются в 3D пространстве X/Y/Z. Источник: https://github.com/1adrianb/face-alignment
Итак, как и термин “deepfake” стал неоднозначным и захваченным термином, термин “3D” также стал запутанным в исследованиях компьютерного зрения.
Для потребителей он обычно означал стерео-видео (например, фильмы, где зритель должен носить специальные очки); для практиков визуальных эффектов и модельеров он обеспечивает различие между 2D графикой (такой как концептуальные эскизы) и сеточными моделями, которые можно манипулировать в “3D программе”, такой как Maya или Cinema4D.
Но в компьютерном зрении это просто означает, что декартова система координат существует где-то в латентном пространстве модели – не то, что она может быть адресована или напрямую манипулирована пользователем; по крайней мере, не без третьих сторон, интерпретирующих системы CGI, таких как 3DMM или FLAME.
Следовательно, понятие диффузия>3D неточно; не только любой тип изображения (включая реальную фотографию) может быть использован в качестве входных данных для генерации модели CGI, но и более точный термин “сетка” более уместен.
Однако, чтобы усугубить неоднозначность, диффузия нужна для интерпретации исходной фотографии в сетку, в большинстве возникающих проектов. Итак, лучшее описание может быть изображение>сетка, а изображение>диффузия>сетка является еще более точным описанием.
Но это трудно продать на совещании или в пресс-релизе, предназначенном для привлечения инвесторов.
Доказательства архитектурных тупиков
Даже по сравнению с 2023 годом, последние 12 месяцев публикаций демонстрируют растущую отчаянность вокруг удаления жестких практических ограничений на диффузионную генерацию.
Ключевым препятствием остается генерация повествовательно и временно последовательного видео, а также поддержание последовательного вида персонажей и объектов – не только в разных видеоклипах, но и в течение короткого времени одного сгенерированного видеоклипа.
Последнее эпохальное инновационное решение в диффузионном синтезе было введением LoRA в 2022 году. Хотя новые системы, такие как Flux, улучшили некоторые из проблем аутлиеров, такие как бывшая неспособность Stable Diffusion воспроизводить текстовый контент внутри сгенерированного изображения, и общее качество изображения улучшилось, большинство статей, которые я изучил в 2024 году, были по сути просто перестановкой еды на тарелке.
Эти тупики произошли раньше, с генеративными противостоящими сетями (GAN) и нейронными радиационными полями (NeRF), которые не оправдали своего первоначального потенциала – и которые все чаще используются в более традиционных системах (например, использование NeRF в Stable Zero 123, см. выше). Это также кажется происходящим с диффузионными моделями.
Исследования по Гауссовой сплэттингу
Казалось, что к концу 2023 года метод растеризации 3D Гауссовой сплэттинг (3DGS), который дебютировал как медицинская визуализация в начале 1990-х годов, был готов突然 обогнать автоэнкодерные системы человеческого синтеза изображений (такие как симуляция и воссоздание лица, а также передача идентичности).
Статья ASH 2023 года обещала полноценных 3DGS людей, а Гауссовы аватары предлагали значительно улучшенную детализацию (по сравнению с автоэнкодером и другими конкурирующими методами), вместе с впечатляющим перекрестным переигрованием.
Однако в этом году было относительно мало таких прорывных моментов для человеческого синтеза 3DGS; большинство статей, которые решали эту проблему, были либо производными от вышеуказанных работ, либо не смогли превзойти их возможности.
Вместо этого внимание к 3DGS было сосредоточено на улучшении его фундаментальной архитектурной осуществимости, что привело к всплеску статей, которые предлагают улучшенные внешние среды 3DGS. Особое внимание было уделено подходам одновременной локализации и картографирования (SLAM) 3DGS, в проектах, таких как Gaussian Splatting SLAM, Splat-SLAM, Gaussian-SLAM, DROID-Splat, среди многих других.
Проекты, которые действительно пытались продолжить или расширить сплэт-основанный человеческий синтез, включали MIGS, GEM, EVA, OccFusion, FAGhead, HumanSplat, GGHead, HGM и Topo4D. Хотя есть и другие, ни одна из этих работ не сравнилась с первоначальным влиянием статей, которые появились в конце 2023 года.
‘Эра Вайнштейна’ тестовых образцов находится в (медленном) упадке
Исследования в Юго-Восточной Азии в целом (и в Китае в частности) часто включают тестовые примеры, которые проблематичны для republications в обзорной статье, поскольку они содержат материал, который немного “пикантен”.
Независимо от того, является ли это так, потому что исследователи в этой части мира стремятся привлечь внимание к своей работе, но за последние 18 месяцев все больше статей по генеративному ИИ (изображению и/или видео) по умолчанию используют молодых и полуобнаженных женщин и девочек в качестве примеров проектов. Граничные NSFW примеры этого включают UniAnimate, ControlNext и даже очень “сухие” статьи, такие как Оценка согласованности движения с помощью Fréchet видео движения (FVMD).
Это следует общим тенденциям субреддитов и других сообществ, которые собрались вокруг латентных диффузионных моделей (LDM), где правило 34 остается очень актуальным.
Сравнение знаменитостей
Этот тип неуместного примера перекрывается с растущим признанием того, что ИИ-процессы не должны эксплуатировать произвольно знаменитости – особенно в исследованиях, которые некритически используют примеры с участием привлекательных знаменитостей, часто женщин, и помещают их в сомнительные контексты.
Один из примеров – AnyDressing, который, помимо использования очень молодых аниме-стильных женских персонажей, также свободно использует личности классических знаменитостей, таких как Мэрилин Монро, и современных, таких как Энн Хэтэуэй (которая очень громко осудила такое использование).

Произвольное использование текущих и ‘классических’ знаменитостей все еще довольно распространено в статьях из Юго-Восточной Азии, хотя эта практика немного снижается. Источник: https://crayon-shinchan.github.io/AnyDressing/
В западных статьях эта практика заметно снижается на протяжении 2024 года, под влиянием крупных выпусков от FAANG и других высокоуровневых исследовательских организаций, таких как OpenAI. Критически осознав потенциал будущих судебных разбирательств, эти крупные корпоративные игроки, кажется, все чаще неохотно представляют даже вымышленные фотореалистичные люди.
Хотя системы, которые они создают (например, Imagen и Veo2), явно способны на такой вывод, примеры из западных проектов генеративного ИИ теперь склоняются к “мильным”, диснеевским и очень “безопасным” изображениям и видео.

Несмотря на заявления об возможностях Imagen создавать ‘фотореалистичный’ вывод, примеры, продвигаемые Google Research, обычно фантастические, ‘семейные’ – фотореалистичные люди тщательно избегаются или предоставляются минимальные примеры. Источник: https://imagen.research.google/
Очищение лица
В западной литературе по компьютерному зрению этот неискренний подход особенно заметен для систем настройки – методов, которые могут создавать последовательные подобия конкретного человека в нескольких примерах (т.е. как LoRA и старый DreamBooth).
Примеры включают ортогональное визуальное вложение, LoRA-Composer, систему Google InstructBooth и многие другие.

Система Google InstructBooth увеличивает фактор миловидности до 11, хотя история показывает, что пользователи больше интересуются созданием фотореалистичных людей, чем пушистых или милых персонажей. Источник: https://sites.google.com/view/instructbooth
Однако рост “мильных” примеров наблюдается и в других направлениях исследований компьютерного зрения и синтеза, в проектах, таких как Comp4D, V3D, DesignEdit, UniEdit, FaceChain (которая признается более реалистичными ожиданиями пользователей на своей странице GitHub), и DPG-T2I, среди многих других.
Легкость, с которой такие системы (например, LoRAs) могут быть созданы домашними пользователями с относительно скромным оборудованием, привела к взрыву свободно загружаемых моделей знаменитостей на сайте civit.ai и в сообществе. Такое незаконное использование остается возможным благодаря открытым архитектурам, таким как Stable Diffusion и Flux.
Хотя часто возможно обойти функции безопасности генеративных текст-изображение (T2I) и текст-видео (T2V) систем, чтобы произвести материал, запрещенный условиями использования платформы, разрыв между ограниченными возможностями лучших систем (например, RunwayML и Sora) и неограниченными возможностями просто эффективных систем (например, Stable Video Diffusion, CogVideo и локальные развертывания Hunyuan), на самом деле не закрывается, как считают многие.
Скорее, эти проприетарные и открытые системы, соответственно, угрожают стать одинаково бесполезными: дорогие и гипермасштабные T2V системы могут стать чрезмерно ограниченными из-за страха судебных разбирательств, а отсутствие инфраструктуры лицензирования и надзора за наборами данных в открытых системах может полностью исключить их из рынка, когда будут приняты более строгие правила.
Опубликовано во вторник, 24 декабря 2024 года












