Взгляд Anderson

Разделение «сращенных» людей в компьютерном зрении

mm
Добавьте Unite.AI в избранные источники в Google

Новая статья из Центра инноваций Hyundai Motor Group в Сингапуре предлагает метод разделения «сращенных» людей в компьютерном зрении – тех случаев, когда框架 распознавания объектов обнаружил человека, который находится слишком близко к другому человеку (например, «объятия» или «стояние позади»), и не может различить этих двух людей, путая их с одним человеком или сущностью.

Два становятся одним, но это не хорошо в семантической сегментации. Здесь мы видим, как новая система достигает лучших результатов в индивидуализации переплетенных людей в сложных и сложных изображениях. Источник: https://arxiv.org/pdf/2210.03686.pdf

Два становятся одним, но это не хорошо в семантической сегментации. Здесь мы видим, как новая система достигает лучших результатов в индивидуализации переплетенных людей в сложных и сложных изображениях. Источник: https://arxiv.org/pdf/2210.03686.pdf

Это заметная проблема, которая получила большое внимание в исследовательском сообществе в последние годы. Решение этой проблемы без очевидных, но обычно недоступных расходов на гипермасштабную, ручную маркировку может в конечном итоге позволить улучшить индивидуализацию людей в текстово-изображающих системах, таких как Stable Diffusion, которые часто «сливаются» людей вместе, когда запрошенная поза требует нескольких человек в близком расположении друг к другу.

Примите ужас – текстово-изображающие модели, такие как DALL-E 2 и Stable Diffusion (обе представлены выше), испытывают трудности в представлении людей в очень близком расположении друг к другу.

Примите ужас – текстово-изображающие модели, такие как DALL-E 2 и Stable Diffusion (обе представлены выше), испытывают трудности в представлении людей в очень близком расположении друг к другу.

Хотя генеративные модели, такие как DALL-E 2 и Stable Diffusion, не используют (по крайней мере, насколько известно) семантическую сегментацию или распознавание объектов, эти ужасные человеческие порталы не могут быть вылечены применением таких методов – потому что современные библиотеки и ресурсы распознавания объектов не намного лучше в различении людей, чем CLIP-основанные рабочие процессы моделей диффузии.

Чтобы решить эту проблему, новая статья – озаглавленная Людям не нужно маркировать больше людей: Occlusion Copy & Paste для Occluded Human Instance Segmentation– адаптирует и улучшает недавний подход «вырезать и вставить» к полу-синтетическим данным, чтобы достичь нового лидерства в задаче, даже против наиболее сложных исходных материалов:

Новая методология Occlusion Copy & Paste в настоящее время лидирует в области даже против предыдущих рамок и подходов, которые решают эту проблему в более сложных и специализированных способах, таких как специальное моделирование для перекрытия.

Новая методология Occlusion Copy & Paste в настоящее время лидирует в области даже против предыдущих рамок и подходов, которые решают эту проблему в более сложных и специализированных способах, таких как специальное моделирование для перекрытия.

Вырезать это!

Модифицированный метод – озаглавленный Occlusion Copy & Paste – получен из статьи 2021 года Simple Copy-Paste, возглавляемой Google Research, которая предложила, что наложение извлеченных объектов и людей на различные исходные обучающие изображения может улучшить способность системы распознавания изображений дискретизировать каждую найденную в изображении экземпляр:

Из статьи 2021 года Google Research-led 'Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation', мы видим элементы из одного фото, 'мигрирующие' в другие фото, с целью обучения лучшей и более интуитивной модели распознавания изображений. Источник: https://arxiv.org/pdf/2012.07177.pdf

Из статьи 2021 года Google Research-led ‘Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation’, мы видим элементы из одного фото, ‘мигрирующие’ в другие фото, с целью обучения лучшей модели распознавания изображений. Источник: https://arxiv.org/pdf/2012.07177.pdf

Новая версия добавляет ограничения и параметры в этот автоматизированный и алгоритмический «репастинг», аналогизируя процесс в «корзину» изображений, полную потенциальных кандидатов для «передачи» в другие изображения, на основе нескольких ключевых факторов.

Концептуальная рабочая схема для OC&P.

Концептуальная рабочая схема для OC&P.

Контроль элементов

Эти ограничивающие факторы включают вероятность вырезания и вставки, которая гарантирует, что процесс не происходит все время, что бы достигло «насыщения» и подорвало бы увеличение данных; количество изображений, которое будет иметь «корзина» в любой момент времени, где большее количество «сегментов» может улучшить разнообразие экземпляров, но увеличить время предварительной обработки; и диапазон, который определяет количество изображений, которые будут вставлены в «хост»-изображение.

Что касается последнего, статья отмечает ‘Нам нужно достаточно перекрытия, чтобы это произошло, но не слишком много, поскольку они могут слишком загромоздить изображение, что может быть вредным для обучения.’

Другие две инновации для OC&P – целевая вставка и усиленная вставка экземпляра.

Целевая вставка гарантирует, что подходящее изображение приземляется рядом с существующим экземпляром в целевом изображении. В предыдущем подходе, из предыдущей работы, новый элемент был ограничен только границами изображения, без учета контекста.

Хотя это «вставка», с целевой вставкой, очевидна для человеческого глаза, как OC&P, так и его предшественник обнаружили, что увеличение визуальной аутентичности не обязательно важно и даже может быть вредным (см. «Реальность кусает» ниже).

Хотя это «вставка», с целевой вставкой, очевидна для человеческого глаза, как OC&P, так и его предшественник обнаружили, что увеличение визуальной аутентичности не обязательно важно и даже может быть вредным (см. «Реальность кусает» ниже).

Усиленная вставка экземпляра, с другой стороны, гарантирует, что вставленные экземпляры не демонстрируют «отличительный вид», который может быть классифицирован системой каким-либо образом, что может привести к исключению или «специальному обращению», которое может препятствовать обобщению и применимости. Усиленная вставка модулирует визуальные факторы, такие как яркость и резкость, масштаб и вращение, и насыщенность – среди других факторов.

Из дополнительных материалов для новой статьи: добавление OC&P к существующим рамкам распознавания приводит к превосходной индивидуализации людей в очень близком расположении. Источник: https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

Из дополнительных материалов для новой статьи: добавление OC&P к существующим рамкам распознавания приводит к превосходной индивидуализации людей в очень близком расположении. Источник: https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

Кроме того, OC&P регулирует минимальный размер для любого вставленного экземпляра. Например, может быть возможно извлечь изображение одного человека из огромной толпы, которое можно вставить в другое изображение – но в таком случае небольшое количество пикселей, участвующих в этом, не поможет распознаванию. Следовательно, система применяет минимальный масштаб на основе отношения равной длины стороны для целевого изображения.

Далее, OC&P вводит масштабно-чувствительную вставку, где, помимо поиска подобных предметов, как и вставляемый предмет, она учитывает размер границы в целевом изображении. Однако это не приводит к составным изображениям, которые люди считают правдоподобными или реалистичными (см. изображение ниже), а скорее собирает семантически подходящие элементы рядом друг с другом в способах, полезных во время обучения.

Реальность кусает

И предыдущая работа, на которой основан OC&P, и текущая реализация, ставят низкую ценность на аутентичность или «фотореализм» любого окончательного «монтажного» изображения. Хотя важно, чтобы окончательная сборка не спустилась совсем в дадаизм (иначе реальные развертывания обученных систем никогда не смогут встретить элементы в таких сценах, как они были обучены), обе инициативы обнаружили, что заметное увеличение «визуальной достоверности» не только добавляет к времени предварительной обработки, но и что такие «усиления реализма» могут быть даже контрпродуктивными.

Из дополнительных материалов для новой статьи: примеры дополненных изображений с «случайным смешением». Хотя эти сцены могут выглядеть как галлюцинации для человека, они тем не менее имеют подобные предметы, собранные вместе; хотя перекрытия фантастичны для человеческого глаза, природа потенциального перекрытия не может быть известна заранее и невозможно обучить – поэтому такие странные «отрезки» формы достаточно, чтобы заставить обученную систему искать и распознавать частичные целевые предметы, не нуждаясь в разработке сложных методологий, подобных Photoshop, чтобы сделать сцены более правдоподобными.

Из дополнительных материалов для новой статьи: примеры дополненных изображений с «случайным смешением». Хотя эти сцены могут выглядеть как галлюцинации для человека, они тем не менее имеют подобные предметы, собранные вместе; хотя перекрытия фантастичны для человеческого глаза, природа потенциального перекрытия не может быть известна заранее и невозможно обучить – поэтому такие странные «отрезки» формы достаточно, чтобы заставить обученную систему искать и распознавать частичные целевые предметы, не нуждаясь в разработке сложных методологий, подобных Photoshop, чтобы сделать сцены более правдоподобными.

Данные и тесты

Для фазы тестирования система была обучена на классе человека набора данных MS COCO, содержащего 262 465 примеров людей на 64 115 изображениях. Однако, чтобы получить лучшие маски, чем у MS COCO, изображения также получили LVIS аннотации масок.

Выпущенный в 2019 году, LVIS, из исследований Facebook, представляет собой объемный набор данных для Large Vocabulary Instance Segmentation. Источник: https://arxiv.org/pdf/1908.03195.pdf

Выпущенный в 2019 году, LVIS, из исследований Facebook, представляет собой объемный набор данных для Large Vocabulary Instance Segmentation. Источник: https://arxiv.org/pdf/1908.03195.pdf

Чтобы оценить, насколько хорошо дополненная система может противостоять большому количеству перекрытых изображений людей, исследователи противопоставили OC&P OCHuman (Occluded Human) бенчмарку.

Примеры из набора данных OCHuman, введенного в поддержку проекта Pose2Seg в 2018 году. Эта инициатива стремилась получить улучшенную семантическую сегментацию людей, используя их позу и положение как семантический делитель для пикселей, представляющих их тела. Источник: https://github.com/liruilong940607/OCHumanApi

Примеры из набора данных OCHuman, введенного в поддержку проекта Pose2Seg в 2018 году. Эта инициатива стремилась получить улучшенную семантическую сегментацию людей, используя их позу и положение как семантический делитель для пикселей, представляющих их тела. Источник: https://github.com/liruilong940607/OCHumanApi

Поскольку бенчмарк OCHuman не полностью аннотирован, исследователи новой статьи создали подмножество только тех примеров, которые были полностью помечены, озаглавленное OCHumanFL. Это уменьшило количество экземпляров человека до 2 240 на 1 113 изображениях для проверки и 1 923 экземпляров на 951 фактических изображениях, используемых для тестирования. Оба исходного и нового подмножества были протестированы, используя среднюю точность (mAP) в качестве основной метрики.

Для последовательности архитектура состояла из Mask R-CNN с основой ResNet-50 и функциональной пирамидальной сетью, последняя из которых обеспечивает приемлемый компромисс между точностью и скоростью обучения.

С учетом того, что исследователи отметили вредное влияние вверх по потоку ImageNet в подобных ситуациях, вся система была обучена с нуля на 4 NVIDIA V100 GPU, в течение 75 эпох, следующих параметрам инициализации Facebook 2021 года Detectron 2.

Результаты

Помимо вышеупомянутых результатов, базовые результаты против MMDetection (и его трех связанных моделей) для тестов показали явное лидерство OC&P в его способности выбрать людей из сложных поз.

Помимо того, что OC&P превосходит PoSeg и Pose2Seg, одна из наиболее заметных достижений статьи заключается в том, что система может быть довольно широко применена к существующим рамкам, включая те, которые были противопоставлены ей в испытаниях (см. сравнения с/без в первом блоке результатов, gần начала статьи).

Статья заключает:

‘Одним из ключевых преимуществ нашего подхода является то, что он легко применим с любой моделью или другими улучшениями, основанными на модели. Учитывая скорость, с которой движется область глубокого обучения, всем выгодно иметь подходы, которые высоко совместимы с каждым другим аспектом обучения. Мы оставляем как будущую работу интеграцию этого с улучшениями, основанными на модели, чтобы эффективно решить проблему сегментации экземпляров перекрытых людей.’

Потенциал для улучшения текстово-изображающей синтеза

Ведущий автор Эван Линг отметил в электронном письме нам*, что главным преимуществом OC&P является то, что он может сохранить исходные метки масок и получить новую ценность из них «бесплатно» в новом контексте – т.е. в изображениях, в которые они были вставлены.

Хотя семантическая сегментация людей кажется тесно связанной с трудностью, которую модели, такие как Stable Diffusion, испытывают в индивидуализации людей (а не «сливая их вместе», как они часто делают), любое влияние, которое культура семантической маркировки может оказать на кошмарные человеческие рендеры, которые SD и DALL-E 2 часто выводят, очень, очень далеко вверх по потоку.

Миллиарды LAION 5B подмножества изображений, которые населяют генеративную мощь Stable Diffusion, не содержат объектно-уровневых меток, таких как границы и экземплярные маски, даже если архитектура CLIP, которая составляет рендеры из изображений и контента базы данных, могла извлечь пользу из такой инстанциации; скорее, метки LAION получены «бесплатно», поскольку их метки были получены из метаданных и окружающих подписей и т. д., которые были связаны с изображениями, когда они были собраны из сети в набор данных.

«Но, кроме того,» Линг сказал нам. «некоторого рода дополнение, подобное нашему OC&P, может быть использовано во время обучения текстово-изображающих генеративных моделей. Но я думаю, что реализм дополненного обучающего изображения может стать проблемой.

«В нашей работе мы показываем, что «идеальный» реализм обычно не требуется для надзированной сегментации экземпляра, но я не уверен, можно ли сделать тот же вывод для обучения текстово-изображающих генеративных моделей (особенно когда их выводы ожидается очень реалистичными). В этом случае может потребоваться больше работы по «совершенствованию» реализма дополненных изображений.’

CLIP уже используется как возможный многомодальный инструмент для семантической сегментации, что предполагает, что улучшенные системы распознавания и индивидуализации людей, такие как OC&P, могут в конечном итоге быть разработаны в фильтры или классификаторы внутри системы, которые произвольно отклоняют «сращенные» и искаженные человеческие представления – задача, которая сейчас трудна для Stable Diffusion, поскольку у нее ограниченная способность понимать, где она ошиблась (если бы она имела такую способность, она, вероятно, не совершила бы ошибку в первую очередь).

Только один из проектов, в настоящее время использующих фреймворк CLIP от OpenAI – сердце DALL-E 2 и Stable Diffusion – для семантической сегментации. Источник: https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

Только один из проектов, в настоящее время использующих фреймворк CLIP от OpenAI – сердце DALL-E 2 и Stable Diffusion – для семантической сегментации. Источник: https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

«Другой вопрос будет,» предполагает Линг. «сработает ли простое кормление этих генеративных моделей изображениями перекрытых людей во время обучения, без дополнительного проектирования архитектуры модели, чтобы смягчить проблему «сращивания людей»? Это, вероятно, вопрос, который трудно ответить сразу. Это будет интересно увидеть, как мы можем ввести некоторое руководство на уровне экземпляра (через метки экземпляра, такие как маска экземпляра) во время обучения текстово-изображающих генеративных моделей.’

 

* 10 октября 2022

Опубликовано впервые 10 октября 2022.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai