Взгляд Anderson
Реальные личности могут быть восстановлены из синтетических наборов данных

Если 2022 год ознаменовал собой момент, когда разрушительный потенциал генеративного ИИ впервые привлёк широкое внимание общественности, то 2024 год стал годом, когда вопросы о законности его основополагающих данных заняли центральное место для бизнеса, стремящегося использовать его силу.
Доктрина добросовестного использования в США, а также неявная академическая лицензия, которая долгое время позволяла исследовательским и коммерческим секторам изучать генеративный ИИ, стали все более невозможными, когда появились все больше доказательств плагиата. В результате США, по крайней мере на данный момент, не разрешают авторское право на контент, сгенерированный ИИ.
Эти вопросы еще далеки от решения, и далеко не сразу будут решены; в 2023 году, частично из-за растущей обеспокоенности средств массовой информации и общественности по поводу правового статуса выходных данных ИИ, Управление США по авторским правам начало многолетнее расследование этого аспекта генеративного ИИ, опубликовав первую часть (относящуюся к цифровым репликам) в июле 2024 года.
Между тем, бизнес-интересы остаются разочарованными из-за возможности того, что дорогостоящие модели, которые они хотят использовать, могут подвергнуть их юридическим последствиям, когда в конечном итоге появятся окончательные законодательство и определения.
Дорогой краткосрочный вариант – легитимизация генеративных моделей путем их обучения на данных, которые компании имеют право использовать. Архитектура Firefly от Adobe, которая генерирует изображения и видео из текста, в основном работает на основе покупки Adobe набора данных изображений Fotolia в 2014 году, дополненного использованием истекших авторских прав публичных данных*. В то же время такие поставщики стоковых фотографий, как Getty и Shutterstock, воспользовались новой ценностью своих лицензированных данных, заключив ряд сделок по лицензированию контента или разработке собственных систем ИИ, соответствующих интеллектуальной собственности.
Синтетические решения
Поскольку удаление авторских данных из обученного пространства ИИ модели сопряжено с проблемами, ошибки в этой области могут быть очень дорогостоящими для компаний, экспериментирующих с потребительскими и деловыми решениями, использующими машинное обучение.
Альтернативным и намного более дешевым решением для систем компьютерного зрения (и также для больших языковых моделей, или БЯМ) является использование синтетических данных, когда набор данных состоит из случайно сгенерированных примеров целевой области (такой как лица, кошки, церкви или даже более общий набор данных).
Сайты, такие как thispersondoesnotexist.com, уже давно популяризировали идею о том, что аутентичные фотографии “не существующих” людей могут быть синтезированы (в данном случае с помощью генеративно-состязательных сетей, или ГСС) без какого-либо отношения к людям, которые действительно существуют в реальном мире.
Следовательно, если вы обучаете систему распознавания лиц или генеративную систему на таких абстрактных и не реальных примерах, вы можете в теории получить фотографически реалистичный стандарт продуктивности для модели ИИ без необходимости учитывать, можно ли использовать данные с точки зрения закона.
Баланс
Проблема заключается в том, что системы, которые производят синтетические данные, сами обучаются на реальных данных. Если следы этих данных просачиваются в синтетические данные, это потенциально предоставляет доказательства того, что ограниченные или неавторизованные материалы были использованы для получения прибыли.
Чтобы избежать этого и для производства действительно “случайных” изображений, такие модели должны обеспечить, чтобы они были хорошо обобщены. Обобщение – это мера способности обученной модели ИИ внутренне понимать высокоуровневые концепции (такие как “лицо”, “мужчина” или “женщина”) без обращения к фактическим данным обучения.
К сожалению, может быть трудно для обученных систем производить (или распознавать) детали, если они не обучаются достаточно обширно на наборе данных. Это подвергает систему риску заучивания: тенденции воспроизводить, в какой-то степени, примеры фактических данных обучения.
Это можно смягчить, установив более расслабленный темп обучения или завершив обучение на этапе, когда основные концепции еще гибкие и не связаны с конкретными данными (такими как конкретное изображение человека в случае набора данных лиц).
Однако эти меры, вероятно, приведут к моделям с менее детальными деталями, поскольку система не имела возможности перейти за пределы “основ” целевой области и добраться до конкретных деталей.
Следовательно, в научной литературе обычно применяются очень высокие темпы обучения и комплексные графики обучения. Хотя исследователи обычно пытаются найти компромисс между широкой применимостью и детальностью в окончательной модели, даже немного “заученные” системы могут часто неправильно представлять себя как хорошо обобщенные – даже в первоначальных тестах.
Раскрытие лица
Это приводит нас к интересной новой работе из Швейцарии, которая утверждает, что она впервые демонстрирует, что исходные, реальные изображения, которые обеспечивают синтетические данные, могут быть восстановлены из сгенерированных изображений, которые, в теории, должны быть совершенно случайными:
Результаты, по мнению авторов, указывают на то, что “синтетические” генераторы действительно заучили большое количество точек данных обучения в поисках большей детализации. Они также указывают на то, что системы, которые полагаются на синтетические данные для защиты производителей ИИ от юридических последствий, могут быть очень ненадежными в этом отношении.
Исследователи провели обширное исследование шести синтетических наборов данных, продемонстрировав, что во всех случаях исходные (потенциально защищенные авторским правом или защищенные) данные могут быть восстановлены. Они комментируют:
Исследование было проведено на шести синтетических наборах данных, и в каждом случае исходные данные можно было восстановить. Авторы отмечают, что это вызывает серьезные опасения по поводу использования синтетических данных в задачах, чувствительных к конфиденциальности, таких как биометрия и распознавание лиц.
Метод, данные и результаты
Заученные лица в исследовании были раскрыты с помощью атаки на определение членства. Хотя концепция кажется сложной, она довольно проста: определение членства в данном случае означает процесс вопросов к системе до тех пор, пока она не раскроет данные, которые либо совпадают с искомыми данными, либо сильно им подобны.
Исследователи изучили шесть синтетических наборов данных, для которых был известен источник (реальный) набора данных. Поскольку и реальные, и фальшивые наборы данных, рассматриваемые в вопросе, содержат очень большое количество изображений, это фактически похоже на поиск иголки в стоге сена.
Поэтому авторы использовали готовую модель распознавания лиц с архитектурой ResNet100, обученную на функции потерь AdaFace (на наборе данных WebFace12M).
Шесть синтетических наборов данных, использованных в исследовании, были: DCFace (латентная диффузионная модель); IDiff-Face (Uniform – диффузионная модель на основе FFHQ); IDiff-Face (Two-stage – вариант, использующий другой метод выборки); GANDiffFace (на основе генеративно-состязательных сетей и диффузионных моделей, использующих StyleGAN3 для генерации начальных идентификаторов, а затем DreamBooth для создания различных примеров); IDNet (метод на основе ГСС, основанный на StyleGAN-ADA); и SFace (рамка, защищающая идентификаторы, для распознавания лиц с использованием синтетических данных).
Поскольку GANDiffFace использует как ГСС, так и диффузионные методы, его сравнивают с набором данных StyleGAN – ближайшим к “реальному лицу” источнику, который эта сеть предоставляет.
Авторы исключили синтетические наборы данных, которые используют методы CGI, а не методы ИИ, и при оценке результатов не учитывали совпадения для детей из-за аномалий распределения в этом отношении, а также изображений, не являющихся лицами (которые могут часто встречаться в наборах данных лиц, где системы веб-скрапинга производят ложные положительные результаты для объектов или артефактов, имеющих качества, подобные лицам).
Косинусное сходство было рассчитано для всех извлеченных пар, и объединено в гистограммы, представленные ниже:
Количество сходств представлено в пиках на графике выше. В работе также представлены образцы сравнений из шести наборов данных и их оцененные изображения в исходных (реальных) наборах данных, из которых некоторые выборки представлены ниже:
Работа комментирует:
Авторы отмечают, что для этого подхода масштабирование до наборов данных большего объема, вероятно, будет неэффективным, поскольку необходимые вычисления будут чрезвычайно обширными. Они также отмечают, что визуальное сравнение было необходимо для определения совпадений, и что автоматическое распознавание лиц в одиночку вряд ли будет достаточным для более крупной задачи.
Что касается последствий исследования, и учитывая пути вперед, работа гласит:
Хотя авторы обещают выпустить код для этой работы на странице проекта, в настоящее время нет ссылки на репозиторий.
Заключение
В последнее время внимание средств массовой информации было сосредоточено на уменьшающихся доходах, полученных от обучения моделей ИИ данными, сгенерированными ИИ.
Однако новое швейцарское исследование привлекает внимание к вопросу, который может быть более важным для растущего числа компаний, которые хотят использовать и получать прибыль от генеративного ИИ – сохранение законодательно защищенных или неавторизованных закономерностей данных, даже в наборах данных, предназначенных для борьбы с этой практикой. Если бы мы должны были дать ему определение, в данном случае это можно было бы назвать “лицевым отмыванием”.
* Однако решение Adobe разрешить пользователям загружать изображения, сгенерированные ИИ, в Adobe Stock, фактически подорвало юридическую “чистоту” этих данных. Bloomberg утверждал в апреле 2024 года, что изображения, сгенерированные пользователем из системы генеративного ИИ MidJourney, были включены в возможности Firefly.
† Эта модель не идентифицируется в работе.
Опубликовано впервые в среду, 6 ноября 2024 года.












