Погляд Anderson
“Деградовані” Синтетичні Обличчя Могуть Допомогти Покращити Розпізнавання Обличь

Дослідники з Університету Мічигану розробили спосіб використання синтетичних обличь для покращення системи розпізнавання обличь, зробивши її більш точною.
Нова модуль контролювання синтезу обличь (CFSM), яку вони розробили, здатна регенерувати обличчя в стилі реального відео спостереження, а не використовувати високоякісні зображення, які використовуються в популярних відкритих наборах даних знаменитостей, які не відображають усіх недоліків і обмежень справжніх систем спостереження, таких як розмиття обличчя, низька роздільна здатність і шум сенсорів – чинники, які можуть впливати на точність розпізнавання.

Концептуальна архітектура модуля контролювання синтезу обличь (CFSM). Джерело: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf
CFSM не призначена для автентичного симулювання положень голови, виразів обличчя чи інших звичайних ознак, які є метою систем глибокого фейку, а радше для генерації ряду альтернативних видів в стилі системи розпізнавання, використовуючи перенос стилю.
Система розроблена для імітування стилю цільової системи та адаптації свого виходу відповідно до роздільної здатності та діапазону “екзцентричних” ознак. Варіант використання включає застарілі системи, які не можуть бути оновлені через високу вартість, але які можуть зараз зробити мало внеску у нове покоління технологій розпізнавання обличь через низьку якість виходу, яка колись була передовою.
Під час тестування системи дослідники виявили, що вона зробила помітні успіхи в системах розпізнавання обличь, які мають справу з такими шумними та низькоякісними даними.

Навчання моделей розпізнавання обличь адаптуватися до обмежень цільових систем. Джерело: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf
Вони також виявили корисний побічний продукт процесу – те, що цільові набори даних тепер можуть бути охарактеризовані та порівняні один з одним, що робить порівняння, бенчмаркінг та генерацію спеціальних наборів даних для різних систем спостереження легшим у майбутньому.
Крім того, цей метод можна застосувати до існуючих наборів даних, виконуючи де-факто адаптацію домену та роблячи їх більш придатними для систем розпізнавання обличь.
Нова стаття називається Контрольований та керований синтез обличь для необмеженого розпізнавання обличь, підтримується частково офісом директора національної розвідки США (ODNI, в IARPA), і надходить від чотирьох дослідників відділу комп’ютерних наук та інженерії в Університеті Мічигану.
Виділений Контент
Розпізнавання обличь низької якості (LQFR) стало помітною областю дослідження за останні кілька років. Через те, що цивільні та муніципальні органи влади будували системи відеоспостереження, щоб вони були стійкими та довгостроковими (не бажаючи періодично перерозподіляти ресурси на цю проблему), багато “застарілих” систем спостереження стали жертвами технічного боргу, щодо їхньої адаптованості як джерел даних для машинного навчання.

Різні рівні роздільної здатності обличчя через ряд історичних та більш недавніх систем відеоспостереження. Джерело: https://arxiv.org/pdf/1805.11519.pdf
На щастя, це завдання, до якого добре підходять дифузійні моделі та інші моделі, засновані на шумі. Багато з найбільш популярних та ефективних систем синтезу зображень останніх років виконують апскейлінг низькоякісних зображень як частину свого конвеєра, тоді як це також абсолютно необхідно для технік нейронного стиснення (методів збереження зображень та фільмів як нейронних даних замість даних бітмап).
Частина виклику розпізнавання обличь полягає в тому, щоб отримати максимально можливу точність з мінімальної кількості ознак, які можна витягнути з найменших та найменш перспективних низькоякісних зображень. Це обмеження існує не тільки тому, що корисно能够 ідентифікувати (або створити) обличчя на низькій роздільній здатності, але також через технічні обмеження на розмір зображень, які можуть проходити через емерджентний латентний простір моделі, яка тренується в будь-якій локальній GPU.
У цьому сенсі термін “ознаки” є плутаним, оскільки такі ознаки також можна отримати з набору даних лавок. У секторі комп’ютерного зору “ознаки” відноситься до відмінних характеристик, отриманих з зображень – будь-яких зображень, незалежно від того, чи це лінії церкви, гірська місцевість або розподіл обличьових ознак у наборі даних обличь.
Оскільки алгоритми комп’ютерного зору тепер здатні підвищувати роздільну здатність зображень та відео, різні методи були запропоновані для “підвищення” низькоякісних або інакше деградованих матеріалів спостереження, до тієї точки, коли їх можна буде використати такі доповнення для юридичних цілей, таких як розміщення певної особи на місці злочину.
Крім можливості неправильної ідентифікації, яка іноді збирає заголовки, теоретично не повинно бути необхідним гіпер-розрізняти або інакше перетворювати низькоякісне відео, щоб зробити позитивну ідентифікацію особи, оскільки система розпізнавання обличь, яка фокусується на низькорівневих ознаках, не повинна потребувати такого рівня роздільної здатності та ясності. Крім того, такі перетворення є дорогими на практиці та піднімають додаткові, постійні питання щодо їхньої потенційної валідності та законності.
Потрібно Більше “Знижених” Знаменитостей
Було б корисніше, якщо система розпізнавання обличь могла б витягувати ознаки (тобто ознаки машинного навчання людських ознак) з виходу застарілих систем, як вони є, розуміючи краще відносини між “високою роздільною здатністю” ідентичністю та деградованими зображеннями, які доступні в незмінних (і часто незамінних) існуючих рамках відеоспостереження.
Проблема тут полягає в стандартах: загальні веб-набори даних, такі як MS-Celeb-1M і WebFace260M (серед інших), були замкнуті дослідницькою спільнотою, оскільки вони забезпечують послідовні бенчмарки, проти яких дослідники можуть вимірювати свій поступальний або значний прогрес щодо поточного стану мистецтва.

Приклади з популярного набору даних MS-Celeb1m. Джерело: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/
Однак, автори стверджують, що алгоритми розпізнавання обличь, навчені на цих наборах даних, не підходять для візуальних “домінів” виходу багатьох старих систем спостереження.
Стаття зазначає*:
‘[Стан мистецтва] (SoTA) моделі розпізнавання обличь не працюють добре на реальному відео спостереження (необмеженому) через проблему зміщення домену, тобто великомасштабні навчальні набори даних (напівобмежені), отримані шляхом веб-черв’яків знаменитих обличь, не мають різноманітності в дикій природі, таких як вбудований шум сенсорів, низька роздільна здатність, розмиття руху, турбулентний ефект тощо.
‘Наприклад, точність 1:1 верифікації, зазначена в одній з моделей SoTA на необмеженому наборі даних IJB-S, становить близько 30% нижче, ніж на напівобмеженому LFW.
‘Потенційне рішення цієї прогалини у продуктивності полягає в створенні великомасштабного необмеженого набору даних обличь. Однак створення такого навчального набору даних з десятками тисяч об’єктів є надзвичайно складним через високу ручну вартість маркування.’
Стаття описує різні попередні методи, які намагалися “схожі” з різними типами виходу історичних або низькоякісних систем спостереження, але відзначає, що ці методи мали справу з “сліпими” доповненнями. Натомість CFSM отримує прямий зворотній зв’язок від реального виходу цільової системи під час навчання та адаптує себе через перенос стилю, щоб імітувати цей домен.

Акторка Наталі Портман, яка не є чужою для декількох наборів даних, які домінують у спільноті комп’ютерного зору, з’являється серед ідентифікаторів у цьому прикладі CFSM, який виконує стилево-відповідну адаптацію домену на основі зворотного зв’язку від домену фактичної цільової моделі.
Архітектура, розроблена авторами, використовує швидкий метод градієнтного знаку (FGSM) для індивідуалізації та “імпорту” отриманих стилів та характеристик з фактичного виходу цільової системи. Частина конвеєра, присвячена генерації зображень, згодом покращиться та стане більш вірною до цільової системи з навчанням. Цей зворотний зв’язок з низьковимірного простору стилю цільової системи є низькорівневим за своєю суттю та відповідає найбільш загальним виведеним візуальним дескрипторам.
Автори коментують:
‘З зворотним зв’язком від моделі розпізнавання обличь, синтезовані зображення є більш корисними для продуктивності розпізнавання обличь, що призводить до значно покращених можливостей узагальнення моделей розпізнавання обличь, навчених з ними.’
Тести
Дослідники використали попередню роботу MSU як шаблон для тестування своєї системи. На основі тих самих експериментальних протоколів вони використали MS-Celeb-1m, який складається виключно з фотографій знаменитостей, зібраних з вебу, як маркований навчальний набір даних. Для справедливості вони також включили MS1M-V2, який містить 3,9 мільйона зображень, що представляють 85 700 класів.
Цільові дані були набором даних WiderFace з Китайського університету Гонконгу. Це досить різноманітний набір зображень, призначений для завдань виявлення обличь у складних ситуаціях. 70 000 зображень з цього набору були використані.
Для оцінки система була протестована на чотирьох бенчмарках розпізнавання обличь: IJB-B, IJB-C, IJB-S та TinyFace.
CFSM був навчений з ~10% навчальних даних з MS-Celeb-1m, близько 0,4 мільйона зображень, за 125 000 ітерацій з розміром批 32 під оптимізатором Adam при дуже низькій швидкості навчання 1e-4.
Цільова модель розпізнавання обличь використовувала модифікацію ResNet-50 для задньої частини, з функцією втрат ArcFace, включеною під час навчання. Крім того, модель була навчена з CFSM як абляцією та порівняльним вправлянням (позначеною як “ArcFace” у таблиці результатів нижче).
Автори коментують основні результати:
‘Модель ArcFace перевершує всі бенчмарки як у завданнях ідентифікації обличчя, так і у завданнях верифікації, та досягає нового стану мистецтва.’
Спроможність витягувати домени з різних характеристик застарілих або низькоякісних систем спостереження також дозволяє авторам порівнювати та оцінювати подібність розподілу серед цих систем, та представляти кожну систему у вигляді візуального стилю, який можна буде використати у подальшій роботі.
Автори відзначають додатково, що їхня система може зробити корисне використання деяких технологій, які до цього часу були розглянуті лише як проблеми, які потрібно вирішити дослідницькою та візуальною спільнотою:
‘[CFSM] показує, що маніпуляція суперником може вийти за рамки атаки та збільшити точність розпізнавання у завдань комп’ютерного зору. Крім того, ми визначаємо метрику подібності набору даних на основі вивчених стилів, які захоплюють відмінності у стилі в позначці чи передбачуваному агностичному вигляді.’
‘Ми вважаємо, що наша робота представила силу керованої та спрямованої моделі синтезу обличь для необмеженого розпізнавання обличь та забезпечує розуміння різниць у наборах даних.’
* Моє перетворення внутрішніх посилань авторів у гіперпосилання.
Перше опублікування 1 серпня 2022 року.














