Взгляд Anderson
Неуловимое определение термина “Дипфейк”

Привлекательное новое исследование из Германии критикует определение термина “дипфейк” в законе ЕС об ИИ как чрезмерно расплывчатое, особенно в контексте манипуляции цифровыми изображениями. Авторы утверждают, что акцент закона на содержании, похожем на реальных людей или события, но потенциально выглядящем фальшивым, лишен ясности.
Они также подчеркивают, что исключения закона для “стандартной обработки” (т.е. якобы незначительных модификаций изображений с помощью ИИ) не учитывают как повсеместное влияние ИИ в потребительских приложениях, так и субъективную природу художественных конвенций, предшествующих появлению ИИ.
Неточные законы по этим вопросам дают начало двум основным рискам: “охлаждающему эффекту”, когда широкий объем толкования закона подавляет инновации и внедрение новых систем; и “эффекту нарушителя”, когда закон игнорируется как чрезмерно широкий или нерелевантный.
В любом случае, расплывчатые законы фактически передают ответственность за установление практических юридических определений на будущие судебные решения – осторожный и риск-averse подход к законодательству.
Технологии манипуляции изображениями на основе ИИ остаются заметно впереди способности законодательства решать их, кажется. Например, один заметный пример растущей эластичности понятия ИИ-обусловленной “автоматической” пост-обработки, отмечает статья, является функцией “Оптимизатор сцены” в недавних камерах Samsung, которая может заменить пользовательские изображения луны (трудной темой), на ИИ-обусловленное, “отшлифованное” изображение:

В верхнем левом углу пример из новой статьи реального пользовательского изображения луны, слева от версии Samsung, созданной с помощью Оптимизатора сцены; Справа, официальная иллюстрация Samsung процесса, стоящего за этим; В нижнем левом углу примеры из Reddit-пользователя u/ibreakphotos, показывающие (слева) намеренно размытое изображение луны и (справа) переосмысление Samsung этого изображения – даже если исходная фотография была изображением монитора, а не реальной луны. Источники (по часовой стрелке от верхнего левого): https://arxiv.org/pdf/2412.09961; https://www.samsung.com/uk/support/mobile-devices/how-galaxy-cameras-combine-super-resolution-technologies-with-ai-to-produce-high-quality-images-of-the-moon/; https://reddit.com/r/Android/comments/11nzrb0/samsung_space_zoom_moon_shots_are_fake_and_here/
В нижнем левом углу изображения выше мы видим два изображения луны. Изображение слева – фотография сделанная Reddit-пользователем. Здесь изображение было намеренно размыто и уменьшено пользователем.
Справа от него мы видим фотографию того же ухудшенного изображения, сделанную с помощью камеры Samsung с включенной ИИ-обусловленной пост-обработкой. Камера автоматически “усовершенствовала” распознанное “объект луны”, даже если исходное изображение не было реальной луной.
Статья подвергает более глубокой критике функцию “Лучший кадр”, встроенную в недавние смартфоны Google – противоречивую функцию ИИ, которая редактирует вместе “лучшие” части групповой фотографии, сканируя несколько секунд фотографической последовательности, так что улыбки перемещаются вперед или назад во времени по мере необходимости – и никто не показан в середине моргания.
Статья утверждает, что такой композитный процесс имеет потенциал неправильно представить события:
‘[В] типичной групповой фотографии средний зритель, вероятно, все еще будет считать полученную фотографию аутентичной. Улыбка, которая вставлена, существовала в течение нескольких секунд от остальной части фотографии.
‘С другой стороны, временной интервал функции “Лучший кадр” в течение десяти секунд достаточен для изменения настроения. Человек мог перестать улыбаться, пока остальная часть группы смеется над шуткой за его счет.
‘В результате мы предполагаем, что такая групповая фотография может хорошо составлять дипфейк.’
Новая статья называется Что составляет дипфейк? Размытая граница между законной обработкой и манипуляцией в соответствии с законом ЕС об ИИ и исходит от двух исследователей из Лаборатории вычислительного права Университета Тюбингена и Университета Саарланда.
Старые трюки
Манипулирование временем в фотографии намного старше, чем потребительский ИИ. Авторы новой статьи отмечают существование гораздо более старых техник, которые можно рассматривать как “неаутентичные”, таких как объединение нескольких последовательных изображений в изображение с высоким динамическим диапазоном (HDR) или “сшитую” панорамную фотографию.
Действительно, некоторые из самых старых и самых забавных фотографических фейков были традиционно созданы школьниками, бегущими от одного конца школьной группы к другому, впереди траектории специальных панорамных камер, которые когда-то использовались для спортивных и школьных групповых фотографий – позволяя ученику появиться дважды в одном и том же изображении:

Искушение обмануть панорамные камеры во время групповых фотографий было слишком велико, чтобы сопротивляться многим студентам, которые были готовы рискнуть плохой сессией в кабинете директора, чтобы “клонировать” себя в школьных фотографиях. Источник: https://petapixel.com/2012/12/13/double-exposure-a-clever-photo-prank-from-half-a-century-ago/
Если вы не делаете фотографию в режиме RAW, который по сути сбрасывает датчик объектива камеры в очень большой файл без какой-либо интерпретации, вероятно, ваши цифровые фотографии не являются полностью аутентичными. Системы камер обычно применяют алгоритмы “улучшения” такие как резкость изображения и белый баланс по умолчанию – и делали это с момента возникновения потребительской цифровой фотографии.
Авторы новой статьи утверждают, что даже эти более старые типы цифровой фотографической аугментации не представляют “реальность”, поскольку такие методы предназначены для того, чтобы сделать фотографии более приятными, а не более “реальными”.
Исследование предполагает, что закон ЕС об ИИ, даже с более поздними поправками, такими как рекиталы 123–27, помещает все фотографическое выходное в доказательную основу, не подходящую для контекста, в котором фотографии производятся сегодня, а не для (номинально объективной) природы кадров безопасности или судебной фотографии. Большинство изображений, рассматриваемых в законе ЕС об ИИ, с большей вероятностью происходят из контекстов, в которых производители и онлайн-платформы активно продвигают творческую интерпретацию фотографий, включая использование ИИ.
Исследователи предлагают, что фотографии “никогда не были объективным изображением реальности”. Рассмотрения, такие как местоположение камеры, выбранный диапазон глубины и выбор освещения, все способствуют тому, чтобы сделать фотографию глубоко субъективной.
Статья отмечает, что обычные задачи “очистки” – такие как удаление пыли датчика или нежелательных линий электропередачи из в противном случае хорошо составленной сцены – были только полу-автоматизированы до возникновения ИИ: пользователи должны были вручную выбрать область или инициировать процесс, чтобы достичь желаемого результата.
Сегодня эти операции часто запускаются текстовыми подсказками пользователя, наиболее заметно в инструментах, таких как Photoshop. На потребительском уровне такие функции становятся все более автоматизированными без ввода пользователя – результат, который, по-видимому, рассматривается производителями и платформами как “очевидно желательный”.
Разбавленное значение “Дипфейка”
Центральной задачей для законодательства вокруг ИИ-измененных и ИИ-генерируемых изображений является неоднозначность термина “дипфейк”, который имел свое значение заметно расширено за последние два года.
Первоначально термины применялись только к видеовыходу из автоэнкодерных систем, таких как DeepFaceLab и FaceSwap, оба полученные из анонимного кода, опубликованного на Reddit в конце 2017 года.
С 2022 года приход латентных диффузионных моделей (LDM) таких, как Stable Diffusion и Flux, а также текст-в-видео систем, таких как Sora, также позволили бы замене идентификаторов и настройки, на улучшенном разрешении, универсальности и верности. Теперь стало возможным создать диффузионные модели, которые могут изображать знаменитостей и политиков. Поскольку термин “дипфейк” уже был сокровищем, привлекающим заголовки для производителей СМИ, он был расширен для покрытия этих систем.
Позже, как в СМИ, так и в исследовательской литературе, термин также включал текстовую имитацию. В этот момент исходное значение “дипфейка” было почти потеряно, в то время как его расширенное значение постоянно эволюционировало и становилось все более разбавленным.
Но поскольку слово было так взрывоопасным и галванизирующим, и было теперь мощным политическим и медиа-ориентиром, оно оказалось невозможным отказаться от него. Оно привлекало читателей на веб-сайты, финансирование исследователям и внимание политиков. Эта лексическая двусмысленность является основным焦点ом новой исследовательской работы.
Как отмечают авторы, статья 3(60) закона ЕС об ИИ очерчивает четыре условия, определяющих “дипфейк”.
1: Настоящая луна
Прежде всего, содержание должно быть сгенерировано или манипулировано, т.е. либо создано с нуля с помощью ИИ (генерация), либо изменено из существующих данных (манипуляция). Статья подчеркивает трудность в различении между “допустимыми” результатами редактирования изображений и манипулятивными дипфейками, учитывая, что цифровые фотографии никогда не являются истинными представлениями реальности.
Статья утверждает, что сгенерированное Samsung-изображение луны можно считать аутентичным, поскольку луна вряд ли изменит свой вид, и поскольку ИИ-генерируемое содержание, обученное на реальных изображениях луны, вероятно, будет точным.
Однако авторы также заявляют, что поскольку система Samsung была показана как генерирующая “усовершенствованное” изображение луны в случае, когда исходное изображение не было луной, это будет считаться “дипфейком”.
Было бы нецелесообразно составить полный список различных случаев использования вокруг этого типа ад хок-функциональности. Поэтому бремя определения, кажется, снова передается суду.
2: Текстовые фейки
Во-вторых, содержание должно быть в форме изображения, аудио или видео. Текстовое содержание, хотя и подлежит другим обязательствам прозрачности, не считается дипфейком в соответствии с законом ЕС об ИИ. Это не рассматривается в подробностях в новой статье, хотя оно может иметь заметное влияние на эффективность визуальных дипфейков (см. ниже).
3: Реальные проблемы
В-третьих, содержание должно похожать на существующих людей, объекты, места, сущности или события. Это условие устанавливает связь с реальным миром, означающую, что чисто фабрикованные изображения, даже если они фотографически реалистичны, не будут квалифицированы как дипфейки. Рекитал 134 закона ЕС об ИИ подчеркивает аспект “похожести” добавлением слова “заметно” (очевидная отсрочка до последующих юридических решений).
Авторы, ссылаясь на предыдущую работу, рассматривают, должен ли ИИ-генерируемый образ принадлежать реальному человеку или должен ли он быть только достаточно podobnym реальному человеку, чтобы удовлетворить это определение.
Например, как можно определить, имеет ли последовательность фотографически реалистичных изображений, изображающих политика Дональда Трампа, цель имитации, если изображения (или прикрепленные тексты) не упоминают его явно? Распознавание лиц? Опросы пользователей? Определение “здравого смысла” судьи?
Возвращаясь к вопросу “Текстовые фейки” (см. выше), слова часто составляют значительную часть акта визуального дипфейка. Например, можно взять (неизмененное) изображение или видео “лица а“, и сказать в подписи или в социальном посте, что изображение является “лицом б” (предполагая, что два человека похожи).
В таком случае не нужно ИИ, и результат может быть поразительно эффективным – но такое низкотехнологичное подход также составляет “дипфейк”?
4: Ретушь, переделка
Наконец, содержание должно показаться аутентичным или правдивым для человека. Это условие подчеркивает восприятие человеческих зрителей. Содержание, которое распознается только как представляющее реального человека или объект алгоритмом, не будет считаться дипфейком.
Из всех условий в 3(60) это самое очевидное отступление к последующему суду, поскольку оно не позволяет никакой интерпретации через технические или механизированные средства.
Существуют явные трудности в достижении консенсуса по такому субъективному положению. Авторы отмечают, например, что разные люди, и разные типы людей (такие как дети и взрослые), могут быть по-разному склонны верить в конкретный дипфейк.
Авторы进一步 отмечают, что продвинутые возможности ИИ инструментов, таких как Photoshop, бросают вызов традиционным определениям “дипфейка”. Хотя эти системы могут включать базовые меры безопасности против спорного или запрещенного контента, они значительно расширяют понятие “ретуши”. Пользователи теперь могут добавлять или удалять объекты в высоко убедительной, фотографически реалистичной манере, достигая профессионального уровня аутентичности, который переопределяет границы манипуляции изображениями.
Авторы утверждают:
‘Мы утверждаем, что текущее определение дипфейков в законе ЕС об ИИ и соответствующие обязательства не достаточно конкретизированы, чтобы решить проблемы, поставленные дипфейками. Анализируя жизненный цикл цифровой фотографии от датчика камеры до функций цифровой обработки, мы обнаруживаем, что:
‘(1) Дипфейки плохо определены в законе ЕС об ИИ. Определение оставляет слишком много места для того, что такое дипфейк.
‘(2) Неясно, как функции редактирования, такие как функция “Лучший кадр” Google, могут быть рассмотрены как исключение из обязательств прозрачности.
‘(3) Исключение для существенно отредактированных изображений вызывает вопросы о том, что составляет существенную редактирование контента и должно ли это редактирование быть воспринимаемым человеком.’
Принятие исключения
Закон ЕС об ИИ содержит исключения, которые, по мнению авторов, могут быть очень пермиссивными. Статья 50(2), утверждают они, предлагает исключение в случаях, когда большинство исходного изображения не изменено. Авторы отмечают:
‘Что можно считать содержанием в смысле статьи 50(2) в случаях цифрового аудио, изображений и видео? Например, в случае изображений, должны ли мы учитывать пространство пикселей или видимое пространство, воспринимаемое людьми? Существенные манипуляции в пространстве пикселей могут не изменить человеческое восприятие, и, с другой стороны, небольшие возмущения в пространстве пикселей могут изменить восприятие драматически.’
Исследователи предоставляют пример добавления пистолета к фотографии человека, указывающего на кого-то. Добавляя пистолет, вы изменяете всего 5% изображения; однако семантическое значение измененного участка заметно. Поэтому кажется, что это исключение не учитывает никакого “здравого смысла” понимания того, какой эффект может иметь небольшой деталь на общее значение изображения.
Статья 50(2) также позволяет исключения для “помощной функции для стандартной обработки”. Поскольку закон не определяет, что такое “стандартная обработка”, даже пост-обработочные функции, такие как функция “Лучший кадр” Google, кажется, защищены этим исключением, отмечают авторы.
Заключение
Заявленной целью новой работы является поощрение междисциплинарного изучения регулирования дипфейков и служить началом новых диалогов между компьютерными учеными и юридическими учеными.
Однако сама статья подвергается тавтологии в нескольких пунктах: она часто использует термин “дипфейк” так, как если бы его значение было самоочевидным, в то же время критикуя закон ЕС об ИИ за неопределенность того, что фактически составляет дипфейк.
Опубликовано в первый раз в понедельник, 16 декабря 2024 года












