Моделі та платформи ШІ
Sapiens: Підхід до моделей людського бачення
Відзначений успіх великомасштабної попередньої підготовки, за якою слідує підготовка для конкретних завдань, встановив цей підхід як стандартну практику. Аналогічно, методи комп’ютерного бачення все більше приймають великомасштабні дані для попередньої підготовки. Поява великих наборів даних, таких як LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome та YFCC100M, дозволила дослідити корпус даних, який значно перевищує традиційні бенчмарки. Видатні роботи в цій галузі включають DINOv2, MAWS та AIM. DINOv2 досягає найвищих результатів у генерації само-наглядових ознак шляхом масштабування методу контрастного iBot на наборі даних LDV-142M. MAWS вивчає масштабування маскових-автоенкодерів (MAE) на мільярдах зображень. AIM досліджує масштабованість автoregresивної візуальної попередньої підготовки, подібної до BERT для візуальних трансформерів. На відміну від цих методів, які в основному зосереджені на загальній попередній підготовці зображень або нульовій класифікації зображень, Sapiens приймає явно людино-орієнтований підхід: моделі Sapiens використовують величезну колекцію людських зображень для попередньої підготовки, а потім дофінуєтуються для ряду завдань, пов’язаних з людиною.
Було досягнуто значний прогрес у контрольованих або студійних середовищах, проте залишаються виклики при розширенні цих методів до неконтрольованих середовищ. Для подолання цих викликів важливо розробляти універсальні моделі, здатні виконувати кілька фундаментальних завдань, таких як оцінка ключових точок, сегментація частин тіла, оцінка глибини та передбачення поверхневої нормалі зображень у природних умовах. У цій роботі Sapiens спрямована на розробку моделей для цих основних завдань людського бачення, які узагальнюються до середовищ у дикій природі. Наразі найбільші публічно доступні мовні моделі містять понад 100 мільярдів параметрів, тоді як більш поширені мовні моделі містять близько 7 мільярдів параметрів. Натомість трансформери зору (ViT), незважаючи на подібну архітектуру, не були масштабовані до цього рівня успішно. Хоча є помітні спроби в цьому напрямку, включаючи розробку густого ViT-4B, навченого на тексті та зображеннях, та формулювання технік для стабільної підготовки ViT-22B, загальновживані зорові основи все ще знаходяться в діапазоні від 300 мільйонів до 600 мільйонів параметрів і в основному попередньо навчаються на розширенні зображення близько 224 пікселів. Аналогічно, існуючі трансформерні моделі генерації зображень, такі як DiT, використовують менше 700 мільйонів параметрів і працюють у висококомпресованому латентному просторі. Для подолання цього розриву Sapiens вводить колекцію великих, високорозрішених моделей ViT, які попередньо навчаються нативно на розширенні зображення 1024 пікселів на мільйонах людських зображень.
Sapiens представляє сімейство моделей для чотирьох фундаментальних завдань людського бачення: оцінка 2D-позиції, сегментація частин тіла, оцінка глибини та передбачення поверхневої нормалі. Моделі Sapiens нативно підтримують висновок високої роздільної здатності 1K і дуже легко адаптуються для окремих завдань шляхом простої дофінуєтії моделей, попередньо навчених на понад 300 мільйонах зображень у дикій природі. Sapiens спостерігає, що, дано той же обчислювальний бюджет, само-наглядова попередня підготовка на кураторському наборі людських зображень суттєво підвищує продуктивність для різноманітних завдань, пов’язаних з людиною. Результатом є моделі, які демонструють видатну узагальнюваність до даних у дикій природі, навіть коли позначені дані рідкі або повністю синтетичні. Проста конструкція моделі також забезпечує масштабованість – продуктивність моделей по завданням покращується при збільшенні кількості параметрів від 0,3 до 2 мільярдів. Sapiens послідовно перевершує існуючі бенчмарки по різним завданням, пов’язаним з людиною, досягнувши суттєвих поліпшень порівняно з попередніми результатами державного рівня: 7,6 mAP на Humans-5K (оцінка позиції), 17,1 mIoU на Humans-2K (сегментація частин тіла), 22,4% відносної похибки RMSE на Hi4D (оцінка глибини) та 53,5% відносної кутової похибки на THuman2 (передбачення поверхневої нормалі).
Sapiens: Прорив у моделях людського бачення
Останні роки відзначились суттєвими кроками до генерації фотореалістичних людей у 2D та 3D. Успіх цих методів значною мірою обумовлений надійною оцінкою різних активів, таких як 2D ключові точки, детальна сегментація частин тіла, глибина та поверхнева нормаль. Однак надійна та точна оцінка цих активів залишається активною областю досліджень, а складні системи для підвищення продуктивності окремих завдань часто перешкоджають більш широкому впровадженню. Крім того, отримання точної позначеної анотації у дикій природі особливо важко масштабувати. Метою Sapiens є надання уніфікованої структури та моделей для висновку цих активів у дикій природі, відкриваючи широкий спектр застосувань, пов’язаних з людиною, для всіх.
Sapiens стверджує, що такі моделі людського бачення повинні задовольняти трьом критеріям: узагальнюваності, широкій застосованості та високій точності. Узагальнюваність забезпечує стабільність до невиданих умов, дозволяючи моделі працювати послідовно в різних середовищах. Широка застосованість вказує на універсальність моделі, роблячи її придатною для широкого спектра завдань з мінімальними змінами. Висока точність означає здатність моделі генерувати точні, високорозрішенні виходи, які є суттєвими для завдань генерації людей. Ця робота описує розробку моделей, які втілюють ці атрибути, які колективно називаються Sapiens.
Відповідно до цих ідей, Sapiens використовує великі набори даних та масштабовані архітектури моделей, які є ключовими для узагальнюваності. Для більш широкої застосованості Sapiens приймає підхід “попередня підготовка, а потім дофінуєтія”, що дозволяє після попередньої підготовки адаптуватися до конкретних завдань з мінімальними змінами. Це підходить до критичного питання: який тип даних є найбільш ефективним для попередньої підготовки? Враховуючи обчислювальні обмеження, слід акцентуватися на зборі якомога більшої кількості людських зображень чи краще попередньо готувати на менш кураторському наборі для кращого відображення реальної варіативності? Існуючі методи часто нехтують розподілом даних попередньої підготовки в контексті завдань після попередньої підготовки. Для вивчення впливу розподілу даних попередньої підготовки на завдання, пов’язані з людиною, Sapiens збирає набір даних Humans-300M, який складається з 300 мільйонів різноманітних людських зображень. Ці незначені зображення використовуються для попередньої підготовки сім’ї візуальних трансформерів з нуля, з кількістю параметрів від 300 мільйонів до 2 мільярдів.
Серед різних методів само-наглядового навчання для вивчення загальних візуальних ознак з великих наборів даних, Sapiens вибирає підхід маскового-автоенкодера (MAE) через його простоту та ефективність під час попередньої підготовки. MAE, маючи однопасовий висновок моделі порівняно з контрастними чи багаторазовими висновками, дозволяє обробляти більший обсяг зображень з тими ж обчислювальними ресурсами. Для вищої точності, на відміну від попередніх методів, Sapiens збільшує вхідну роздільну здатність попередньої підготовки до 1024 пікселів, що призводить до приблизно чотирикратного збільшення FLOPs порівняно з найбільшим існуючим зоровим основою. Кожна модель попередньо готується на 1,2 трильйоні токенів. Для дофінуєтії на завданнях, пов’язаних з людиною, Sapiens використовує послідовну архітектуру кодувача-дешифрувача. Кодувач ініціалізується вагами з попередньої підготовки, тоді як дешифрувач, легкий і завдання-специфічний заголовок, ініціалізується випадковим чином. Обидві компоненти потім дофінуєтуються повністю.

Послідовно з попередніми дослідженнями, Sapiens підтверджує критичний вплив якості позначок на продуктивність моделі у дикій природі. Публічні бенчмарки часто містять шумові позначки, забезпечуючи несумісні наглядові сигнали під час дофінуєтії моделі. Водночас важливо використовувати тонкі та точні анотації для узгодження з основною метою Sapiens – 3D цифровізація людини. Для цього Sapiens пропонує суттєво густіший набір 2D ключових точок для оцінки позиції та детальний словник класів для сегментації частин тіла, що перевершує попередні набори даних. Зокрема, Sapiens вводить повний збір 308 ключових точок, що охоплюють тіло, руки, ноги, поверхню та обличчя. Крім того, Sapiens розширює словник класів сегментації до 28 класів, що охоплюють частини тіла, такі як волосся, язик, зуби, верхня/нижня губа та тулуб. Для забезпечення якості та узгодженості анотацій та високого рівня автоматизації, Sapiens використовує багатогранний збірний набір для збору анотацій позиції та сегментації. Sapiens також використовує людські синтетичні дані для оцінки глибини та нормалі, використовуючи 600 детальних сканів з RenderPeople для генерації високорозрішених карт глибини та поверхневих нормалей. Sapiens демонструє, що поєднання великомасштабної попередньої підготовки з обмеженими, але високоякісними анотаціями, призводить до стабільної узагальнюваності у дикій природі.

Sapiens: Метод та архітектура
Sapiens слідує підходу маскового-автоенкодера (MAE) для попередньої підготовки. Модель навчається відновлювати оригінальне людське зображення, дане його часткове спостереження. Як усі автоенкодери, модель Sapiens має кодувач, який відображає видиме зображення у латентне представлення, та дешифрувач, який відновлює оригінальне зображення з цього латентного представлення. Набір даних попередньої підготовки складається з окремих та багаторих зображень, кожне з яких змінено до фіксованого розміру з квадратним співвідношенням сторін. Аналогічно до ViT, зображення розділяється на регулярні не перекриваються патчі з фіксованим розміром патчу. Підмножина цих патчів випадково вибирається та маскується, залишаючи інші видимими. Відношення маскованих патчів до видимих залишається постійним протягом навчання.
Моделі Sapiens демонструють узагальнюваності по різним характеристикам зображень, включаючи масштаби, обрізання, вік та етнічну приналежність суб’єктів, а також кількість суб’єктів. Кожна патч-токена у моделі відповідає 0,02% площі зображення порівняно з 0,4% у стандартних ViT, що забезпечує тонке міжтокенне висновок для моделей. Навіть з підвищеним співвідношенням маскування 95%, модель Sapiens досягає правдоподібного відновлення людської анатомії на триманих зразках. Відновлення попередньо навченого моделі Sapiens на невиданих людських зображеннях демонструється на наступному зображенні.

Крім того, Sapiens використовує великий приватний набір даних для попередньої підготовки, який складається з приблизно 1 мільярда зображень у дикій природі, зосереджуючись виключно на людських зображеннях. Передобробка включає видалення зображень з водяними знаками, текстом, художніми зображеннями чи ненауковими елементами. Sapiens потім використовує готовий детектор обмежувальних рамок осіб для фільтрації зображень, зберігаючи ті, які мають балл детектора понад 0,9 та розміри обмежувальної рамки понад 300 пікселів. Більше 248 мільйонів зображень у наборі даних містять кілька суб’єктів.
Оцінка 2D-позиції
Фреймворк Sapien дофінуєтується кодувача та дешифрувача у P по декількох скелетах, включаючи K = 17 [67], K = 133 [55] та новий високодеталізований скелет, з K = 308, як показано на наступному зображенні.

Порівняно з існуючими форматами з найбільшими 68 ключовими точками обличчя, анотації Sapien складаються з 243 ключових точок обличчя, включаючи представницькі точки навколо очей, губ, носа та вух. Цей дизайн розроблений для ретельного захоплення нюансів виразів обличчя у реальному світі. З цими ключовими точками фреймворк Sapien ручним чином анотував 1 мільйон зображень у роздільній здатності 4K з внутрішнього збірного набору. Аналогічно попереднім завданням, ми встановили канали виходу дешифрувача нормального оцінювача N як 3, що відповідає компонентам xyz вектора нормалі в кожній точці. Синтетичні дані також використовуються як нагляд для оцінки поверхневої нормалі.

Sapien: Експеримент та результати
Sapiens-2B попередньо готується за допомогою 1024 процесорів A100 протягом 18 днів з PyTorch. Sapiens використовує оптимізатор AdamW для всіх експериментів. Графік навчання включає коротке лінійне розігрівання, після якого слідує косинусне анеалогування для попередньої підготовки та лінійне зниження для дофінуєтії. Всі моделі попередньо готуються з нуля у роздільній здатності 1024 × 1024 з розміром патчу 16. Для дофінуєтії вхідне зображення змінюється до співвідношення 4:3, тобто 1024 × 768. Sapiens застосовує стандартні збільшення, такі як обрізання, масштабування, переворот та фотометричні спотворення. Випадковий фон з не людських зображень COCO додається для завдань сегментації, глибини та нормальної оцінки. Насамперед, Sapiens використовує диференційне навчання для збереження узагальнюваності, з нижчими швидкостями навчання для початкових шарів та поступово вищими швидкостями для наступних шарів. Шар-шаровий спад швидкостей навчання встановлюється на 0,85 з ваговим зниженням 0,1 для кодувача.
Конструктивні характеристики Sapiens деталізуються в наступній таблиці. Слідуючи певному підходу, Sapiens пріоритезує масштабування моделей по ширині, а не глибині. Насамперед, модель Sapiens-0,3B, архітектурно подібна до традиційної ViT-Large, складається з двадцятираз більшої кількості FLOPs через вищу роздільну здатність.

Sapiens дофінуєтується для оцінки позиції обличчя, тіла, ніг та рук (K = 308) за допомогою високоякісних анотацій. Для навчання Sapiens використовує тренувальний набір з 1 мільйоном зображень, а для оцінки – тестовий набір Humans5K з 5 тисячами зображень. Оцінка проводиться зверху вниз, де Sapiens використовує готовий детектор обмежувальних рамок для отримання обмежувальних рамок та проводить висновок позиції одного суб’єкта. Таблиця 3 показує порівняння моделей Sapiens з існуючими методами для оцінки позиції всього тіла. Всі методи оцінюються на 114 спільних ключових точках між 308 ключовими точками Sapiens та 133 ключовими точками COCO-WholeBody. Sapiens-0,6B перевершує поточний державний рівень DWPose-l на +2,8 AP. На відміну від DWPose, який використовує складний студент-вчительський фреймворк з дистиляцією ознак, спеціально розроблений для завдання, Sapiens приймає загальну архітектуру кодувача-дешифрувача з великомасштабною людсько-орієнтованою попередньою підготовкою.
Насамперед, навіть з тією ж кількістю параметрів, моделі Sapiens демонструють вищу продуктивність порівняно з їхніми аналогами. Наприклад, Sapiens-0,3B перевершує VitPose+-L на +5,6 AP, а Sapiens-0,6B перевершує VitPose+-H на +7,9 AP. В межах сім’ї Sapiens результати вказують на прямий кореляційний зв’язок між розміром моделі та продуктивністю. Sapiens-2B встановлює новий державний рівень з 61,1 AP, що є суттєвим поліпшенням на +7,6 AP порівняно з попереднім державним рівнем. Навіть з дофінуєтією з анотаціями з внутрішнього збірного набору, Sapiens демонструє стабільну узагальнюваності до реальних сценаріїв, як показано на наступному зображенні.

Sapiens дофінуєтується та оцінюється за словником сегментації з 28 класами. Тренувальний набір складається з 100 тисяч зображень, а тестовий набір Humans-2K – з 2 тисяч зображень. Sapiens порівнюється з існуючими методами сегментації частин тіла, дофінуєтією на тому ж тренувальному наборі, використовуючи запропоновані попередньо навченні чекпойнти кожного методу як ініціалізацію. Аналогічно оцінці позиції, Sapiens демонструє узагальнюваності у сегментації, як показано в наступній таблиці.

Насамперед, найменша модель, Sapiens-0,3B, перевершує існуючі методи сегментації, такі як Mask2Former та DeepLabV3+, на 12,6 mIoU завдяки вищій роздільній здатності та великомасштабній людсько-орієнтованій попередній підготовці. Крім того, збільшення розміру моделі далі покращує продуктивність сегментації. Sapiens-2B досягає найкращої продуктивності з 81,2 mIoU та 89,4 mAcc на тестовому наборі, як показано на наступному зображенні.

Висновок
Sapiens представляє суттєвий крок вперед у розвитку моделей людського бачення у напрямку моделей-основ. Моделі Sapiens демонструють сильні можливості узагальнюваності по різним завданням, пов’язаним з людиною. Державний рівень продуктивності пояснюється: (i) великомасштабною попередньою підготовкою на кураторському наборі даних, спеціально розробленому для розуміння людей, (ii) масштабованими високорозрішними та високомісткими зоровими трансформерними основами, та (iii) високоякісними анотаціями на збільшених студійних та синтетичних даних. Моделі Sapiens мають потенціал стати ключовим будівельним блоком для широкого спектра завдань після попередньої підготовки та забезпечити доступ до високоякісних зорових основ до суттєво ширшої частини спільноти.












