Модели и платформы ИИ

Sapiens: Прорыв в моделях человеческого зрения

mm
Добавьте Unite.AI в избранные источники в Google

Замечательный успех крупномасштабной предварительной подготовки, за которой следует подготовка для конкретных задач в моделировании языка, установил этот подход в качестве стандартной практики. Аналогично, методы компьютерного зрения прогрессивно принимают обширные масштабы данных для предварительной подготовки. Появление крупных наборов данных, таких как LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome и YFCC100M, позволило изучить корпус данных, выходящий за рамки традиционных эталонов. Заметные работы в этой области включают DINOv2, MAWS и AIM. DINOv2 достигает результатов на уровне состояния искусства в генерации самоподдерживающихся функций путем масштабирования метода контрастного iBot на наборе данных LDV-142M. MAWS изучает масштабирование маскированных автокодировщиков (MAE) на миллиардах изображений. AIM исследует масштабируемость автoregressивной визуальной предварительной подготовки, аналогичной BERT для трансформеров зрения. В отличие от этих методов, которые в основном фокусируются на общей предварительной подготовке изображений или классификации изображений с нулевым выстрелом, Sapiens принимает явно человеко-ориентированный подход: модели Sapiens используют обширную коллекцию изображений человека для предварительной подготовки, а затем настраивают для диапазона задач, связанных с человеком. Преследование крупномасштабной 3D-цифровизации человека остается важной целью в компьютерном зрении.

Были достигнуты значительные успехи в контролируемых или студийных условиях, но сохраняются проблемы при расширении этих методов до неограниченных сред. Для решения этих проблем важно разработать универсальные модели, способные выполнять несколько фундаментальных задач, таких как оценка ключевых точек, сегментация частей тела, оценка глубины и прогнозирование поверхности нормали из изображений в естественных условиях. В этой работе Sapiens стремится разработать модели для этих необходимых задач человеческого зрения, которые обобщаются в условиях в дикой природе. В настоящее время самые крупные публично доступные языковые модели содержат более 100 миллиардов параметров, в то время как более часто используемые языковые модели содержат около 7 миллиардов параметров. Напротив, трансформеры зрения (ViT), несмотря на аналогичную архитектуру, не были масштабированы до такой степени успешно. Хотя есть заметные усилия в этом направлении, включая разработку плотного ViT-4B, обученного на тексте и изображениях, и формулировку методов для стабильной подготовки ViT-22B, обычно используемые визуальные основы все еще варьируются от 300 миллионов до 600 миллионов параметров и в основном предварительно обучены на разрешении изображения около 224 пикселей. Аналогично, существующие трансформерные модели генерации изображений, такие как DiT, используют менее 700 миллионов параметров и работают в высоко сжатом латентном пространстве. Для решения этой проблемы Sapiens представляет коллекцию крупных, высокоразрешающих моделей ViT, которые предварительно обучены родными на разрешении изображения 1024 пикселя на миллионах изображений человека.

Sapiens представляет семейство моделей для четырех фундаментальных человеко-ориентированных задач зрения: оценка 2D-позы, сегментация частей тела, оценка глубины и прогнозирование поверхности нормали. Модели Sapiens родными поддерживают вывод высокого разрешения 1K и чрезвычайно легко адаптируются для отдельных задач путем простой настройки моделей, предварительно обученных на более чем 300 миллионах изображений человека в дикой природе. Sapiens наблюдает, что, учитывая одинаковый вычислительный бюджет, самоподдерживающаяся предварительная подготовка на отобранном наборе данных изображений человека значительно повышает производительность для разнообразного набора человеко-ориентированных задач. Результатом являются модели, которые демонстрируют замечательную обобщаемость в данных в дикой природе, даже когда помеченные данные скудны или полностью синтетические. Простой дизайн модели также обеспечивает масштабируемость – производительность модели по задачам улучшается по мере увеличения количества параметров от 0,3 до 2 миллиардов. Sapiens последовательно превосходит существующие базовые показатели по различным человеко-ориентированным эталонам, достигая значительных улучшений по сравнению с предыдущими результатами на уровне состояния искусства: 7,6 mAP на Humans-5K (поза), 17,1 mIoU на Humans-2K (сегментация частей тела), 22,4% относительная ошибка RMSE на Hi4D (глубина) и 53,5% относительная угловая ошибка на THuman2 (нормаль).

Sapiens: Прорыв в моделях человеческого зрения

В последние годы были достигнуты замечательные успехи в генерации фотореалистичных людей в 2D и 3D. Успех этих методов в значительной степени обусловлен прочной оценкой различных активов, таких как 2D-ключевые точки, тонкая сегментация частей тела, глубина и поверхность нормали. Однако прочная и точная оценка этих активов остается активной областью исследований, и сложные системы для повышения производительности для отдельных задач часто препятствуют более широкому внедрению. Кроме того, получение точных основополагающих аннотаций в дикой природе известно как трудно масштабируемое. Цель Sapiens – предоставить унифицированную основу и модели для вывода этих активов в дикой природе, открывая широкий спектр человеко-ориентированных приложений для всех.

Sapiens утверждает, что такие человеко-ориентированные модели должны удовлетворять трем критериям: обобщаемости, широкой применимости и высокой точности. Обобщаемость обеспечивает прочность к незнакомым условиям, позволяя модели работать последовательно в различных средах. Широкая применимость указывает на универсальность модели, делая ее подходящей для широкого спектра задач с минимальными изменениями. Высокая точность обозначает способность модели производить точные, высокоразрешающие выходные данные, необходимые для задач верной генерации человека. В этой статье подробно описывается разработка моделей, которые воплощают эти атрибуты, коллективно известные как Sapiens.

Следуя этим идеям, Sapiens использует крупные наборы данных и масштабируемые архитектуры моделей, ключевые для обобщаемости. Для более широкой применимости Sapiens принимает подход предварительной подготовки, а затем настройки, позволяя пост-предварительной подготовке адаптации к конкретным задачам с минимальными изменениями. Этот подход вызывает критический вопрос: какой тип данных наиболее эффективен для предварительной подготовки? Учитывая вычислительные ограничения, следует ли уделять внимание сбору как можно большего количества изображений человека или предпочтительнее предварительно подготовить на менее отобранном наборе для лучшего отражения реальной изменчивости? Существующие методы часто упускают из виду распределение предварительной подготовки данных в контексте задач вниз по потоку. Для изучения влияния распределения предварительной подготовки данных на человеко-специфические задачи Sapiens собирает набор данных Humans-300M, в котором представлены 300 миллионов разнообразных изображений человека. Эти неаннотированные изображения используются для предварительной подготовки семейства трансформеров зрения с нуля, с количеством параметров от 300 миллионов до 2 миллиардов.

Среди различных методов самоподдерживающейся подготовки для обучения общих визуальных функций из крупных наборов данных Sapiens выбирает подход маскированного автокодировщика (MAE) из-за его простоты и эффективности в предварительной подготовке. MAE, имеющий модель однопроходного вывода по сравнению с контрастными или многопроходными стратегиями, позволяет обрабатывать больший объем изображений с теми же вычислительными ресурсами. Для более высокой точности, в отличие от предыдущих методов, Sapiens увеличивает родное входное разрешение предварительной подготовки до 1024 пикселей, что приводит к примерно 4-кратному увеличению FLOPs по сравнению с крупнейшим существующим визуальным основанием. Каждая модель предварительно обучается на 1,2 триллионе токенов. Для настройки на человеко-ориентированные задачи Sapiens использует последовательную архитектуру кодировщика-декодировщика. Кодировщик инициализируется весами из предварительной подготовки, а декодировщик, легкий и задача-специфический заголовок, инициализируется случайно. Оба компонента затем настраиваются конец в конец. Sapiens фокусируется на четырех ключевых задачах: оценке 2D-позы, сегментации частей тела, глубине и нормали оценки, как показано на следующей иллюстрации.

Согласно предыдущим исследованиям, Sapiens подтверждает критическое влияние качества меток на производительность модели в дикой природе. Публичные эталоны часто содержат шумные метки, предоставляющие несоответствующие сигналы надзора во время настройки модели. В то же время важно использовать тонкие и точные аннотации, чтобы тесно соответствовать основной цели Sapiens – 3D-цифровизации человека. Для этого Sapiens предлагает значительно более плотный набор 2D-ключевых точек для оценки позы и подробный словарный класс для сегментации частей тела, превосходящий объем предыдущих наборов данных. Конкретно, Sapiens вводит всесторонний набор из 308 ключевых точек, охватывающих тело, руки, ноги, поверхность и лицо. Кроме того, Sapiens расширяет словарный класс для сегментации частей тела до 28 классов, покрывающих части тела, такие как волосы, язык, зубы, верхняя/нижняя губа и туловище. Для обеспечения качества и последовательности аннотаций и высокой степени автоматизации Sapiens использует многовидовую систему захвата для сбора аннотаций позы и сегментации. Sapiens также использует человеко-ориентированные синтетические данные для оценки глубины и нормали, используя 600 подробных сканов от RenderPeople для генерации высокоразрешающих глубинных карт и поверхностных нормалей. Sapiens демонстрирует, что сочетание доменно-специфической крупномасштабной предварительной подготовки с ограниченными, но высококачественными аннотациями приводит к прочной обобщаемости в дикой природе. В целом, метод Sapiens показывает эффективную стратегию разработки высокоточных дискриминативных моделей, способных работать в реальных сценариях без необходимости сбора дорогостоящего и разнообразного набора аннотаций.

Sapiens: Метод и архитектура

Sapiens следует подходу маскированного автокодировщика (MAE) для предварительной подготовки. Модель обучается восстанавливать исходное изображение человека, данное его частичным наблюдением. Как и все автокодировщики, модель Sapiens имеет кодировщик, который сопоставляет видимое изображение с латентным представлением, и декодировщик, который восстанавливает исходное изображение из этого латентного представления. Набор данных для предварительной подготовки состоит из как отдельных, так и многочеловеческих изображений, с каждым изображением, измененным до фиксированного размера с квадратным соотношением сторон. Аналогично ViT, изображение делится на регулярные неперекрывающиеся патчи с фиксированным размером патча. Подмножество этих патчей случайным образом выбирается и маскируется, оставляя остальные видимыми. Соотношение маскированных патчей к видимым, известное как коэффициент маскирования, остается фиксированным на протяжении всего обучения.

Модели Sapiens демонстрируют обобщаемость по различным характеристикам изображений, включая масштабы, обрезки, возраст и этническую принадлежность субъектов, а также количество субъектов. Каждый патч-токен в модели учитывает 0,02% площади изображения по сравнению с 0,4% в стандартных ViT, что представляет собой 16-кратное уменьшение – обеспечивая тонкое межтокеновое рассуждение для моделей. Даже с увеличенным коэффициентом маскирования 95% модель Sapiens достигает правдоподобного восстановления человеческой анатомии на отложенных образцах. Восстановление предварительно обученной модели Sapiens на не виденных ранее изображениях человека показано на следующей иллюстрации.

Кроме того, Sapiens использует крупный проприетарный набор данных для предварительной подготовки, состоящий примерно из 1 миллиарда изображений в дикой природе, фокусирующихся исключительно на изображениях человека. Предварительная обработка включает в себя удаление изображений с водяными знаками, текстом, художественными изображениями или неестественными элементами. Sapiens затем использует готовый детектор ограничивающих рамок человека для фильтрации изображений, сохраняя те, у которых балл обнаружения выше 0,9 и размеры ограничивающей рамки превышают 300 пикселей. Более 248 миллионов изображений в наборе данных содержат несколько субъектов.

Оценка 2D-позы

Фреймворк Sapien настраивает кодировщик и декодировщик в P по нескольким скелетам, включая K = 17 [67], K = 133 [55] и новый высокодетализированный скелет с K = 308, как показано на следующей иллюстрации.

По сравнению с существующими форматами, имеющими не более 68 ключевых точек лица, аннотации Sapien состоят из 243 ключевых точек лица, включая представительные точки вокруг глаз, губ, носа и ушей. Этот дизайн предназначен для тщательного захвата нюансов выражений лица в реальном мире. С этими ключевыми точками фреймворк Sapien вручную аннотировал 1 миллион изображений в разрешении 4K из внутренней системы захвата. Аналогично предыдущим задачам, мы устанавливаем выходные каналы декодировщика оценщика нормали N равными 3, соответствующими xyz-компонентам вектора нормали в каждом пикселе. Синтетические данные, сгенерированные также, используются в качестве надзора для оценки поверхности нормали.

Sapien: Эксперимент и результаты

Sapiens-2B предварительно обучается с использованием 1024 A100 GPU в течение 18 дней с PyTorch. Sapiens использует оптимизатор AdamW для всех экспериментов. Расписание обучения включает в себя краткий линейный разогрев, за которым следует косинусное затухание для предварительной подготовки и линейное затухание для настройки. Все модели предварительно обучаются с нуля на разрешении 1024 × 1024 с размером патча 16. Для настройки входное изображение изменяется до соотношения 4:3, т. е. 1024 × 768. Sapiens применяет стандартные аугментации, такие как обрезка, масштабирование, переворачивание и фотометрические искажения. Случайный фон из нечеловеческих изображений COCO добавляется для задач сегментации, глубины и нормали. Важно, что Sapiens использует дифференциальные скорости обучения для сохранения обобщаемости, с более низкими скоростями обучения для начальных слоев и прогрессивно более высокими скоростями для последующих слоев. Затухание скорости обучения по слоям устанавливается равным 0,85 с затуханием веса 0,1 для кодировщика.

Спецификации конструкции Sapiens подробно описаны в следующей таблице. Следуя определенному подходу, Sapiens отдает приоритет масштабированию моделей по ширине, а не по глубине. Заметно, что модель Sapiens-0,3B, хотя и архитектурно аналогична традиционной ViT-Large, состоит из двадцатикратного количества FLOPs из-за более высокого разрешения.

Sapiens настраивается для оценки позы лица, тела, ног и рук (K = 308) с использованием высококачественных аннотаций. Для обучения Sapiens использует обучающий набор с 1 миллионом изображений, а для оценки – тестовый набор, названный Humans5K, с 5 тысячами изображений. Оценка проводится по топ-даун подходу, где Sapiens использует готовый детектор ограничивающих рамок для обнаружения человека и проводит вывод позы для одного человека. Таблица 3 показывает сравнение моделей Sapiens с существующими методами для оценки позы всего тела. Все методы оцениваются на 114 общих ключевых точках между словарем ключевых точек Sapiens из 308 точек и словарем ключевых точек COCO-WholeBody из 133 точек. Sapiens-0,6B превосходит текущее состояние искусства, DWPose-l, на +2,8 AP. В отличие от DWPose, который использует сложную студент-учительскую структуру с дистилляцией функций, адаптированной для задачи, Sapiens принимает общую архитектуру кодировщика-декодировщика с крупномасштабной человеко-ориентированной предварительной подготовкой.

Интересно, что даже при одинаковом количестве параметров модели Sapiens демонстрируют лучшую производительность по сравнению с их аналогами. Например, Sapiens-0,3B превосходит VitPose+-L на +5,6 AP, а Sapiens-0,6B превосходит VitPose+-H на +7,9 AP. Внутри семейства Sapiens результаты указывают на прямую корреляцию между размером модели и производительностью. Sapiens-2B устанавливает новый уровень состояния искусства с 61,1 AP, что представляет собой значительное улучшение на +7,6 AP по сравнению с предыдущим искусством. Несмотря на настройку с аннотациями из внутренней студийной системы, Sapiens демонстрирует прочную обобщаемость в реальных сценариях, как показано на следующей иллюстрации.

Sapiens настраивается и оценивается с использованием словаря сегментации частей тела из 28 классов. Обучающий набор состоит из 100 тысяч изображений, а тестовый набор, Humans-2K, – из 2 тысяч изображений. Sapiens сравнивается с существующими методами сегментации частей тела, настроенными на том же обучающем наборе, используя предложенные предварительно обученные контрольные точки для каждой модели в качестве инициализации. Аналогично оценке позы, Sapiens показывает обобщаемость в сегментации, как показано в следующей таблице.

Интересно, что даже самая маленькая модель, Sapiens-0,3B, превосходит существующие методы сегментации, такие как Mask2Former и DeepLabV3+, на 12,6 mIoU благодаря более высокому разрешению и крупномасштабной человеко-ориентированной предварительной подготовке. Кроме того, увеличение размера модели еще больше улучшает производительность сегментации. Sapiens-2B достигает лучшей производительности, с 81,2 mIoU и 89,4 mAcc на тестовом наборе, как показано на следующей иллюстрации.

Вывод

Sapiens представляет собой значительный шаг на пути к продвижению человеко-ориентированных моделей зрения в область фундаментальных моделей. Модели Sapiens демонстрируют прочные обобщаемые возможности по различным человеко-ориентированным задачам. Результаты на уровне состояния искусства обусловлены: (i) крупномасштабной предварительной подготовкой на отобранном наборе данных, специально разработанном для понимания человека, (ii) масштабированными высокоразрешающими и высокоемкими трансформерами зрения, и (iii) высококачественными аннотациями на аугментированных студийных и синтетических данных. Модели Sapiens имеют потенциал стать ключевым строительным блоком для множества задач вниз по потоку и обеспечить доступ к высококачественным визуальным основам значительно более широкой части сообщества.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.