Взгляд Anderson
Восстановление того, что ваша камера запечатлела до того, как это изменило ИИ

Как можно защитить святость сырого фотографического изображения от вмешательства ИИ, когда оно уже было автоматически обработано ИИ внутри камеры? Новые исследования направлены на восстановление «истинных» данных датчика – также с помощью ИИ!
Рост аутентичности изображений ИИ за последний год или около того вызвал у многих групп и отдельных лиц протесты против последующей эрозии доверия к фотографии.
В тот же период Коалиция за подлинность и аутентичность контента (C2PA) попыталась ввести полу-криптографический стандарт, который присоединяет метаданные об аутентичности к изображению, начиная с момента его захвата поддерживаемой камерой или устройством, надеясь раскрыть любое последующее использование генеративного ИИ на этих «оригинальных» изображениях:

Схема аутентичности в системе C2PA, где метаданные, написанные в момент захвата, можно добавить как дневник, позволяя делать обычные корректировки, такие как яркость и контраст, но записывая значительные корректировки, так что сильно измененное изображение ИИ будет отображаться как таковое в средствах массовой информации, поддерживающих эту систему. Источник
Принятие стандарта не было таким широким, как надеялась коалиция, и в настоящее время только 14 камер поддерживают встроенную аутентификацию информации об аутентичности.
Что интересно в идее C2PA о том, чтобы дать фотографии «паспорт» сразу после ее создания, так это то, что к тому времени может уже быть слишком поздно – потому что производители камер сейчас обычно включают обработку ИИ в сам процесс создания изображения:

Из статьи 2024 года «Advocating Pixel-Level Authentication of Camera-Captured Images»: иллюстрация того, как современные камеры вводят вымышленный контент во время захвата и как метаданные аутентичности на уровне пикселей раскрывают это. В (А) изображение смартфонного сенсора обрабатывается ISP, где модули ИИ могут изобретать детали во время цифрового зума или корректировки экспозиции, производя реалистичные изображения с ошибками, такими как неверно прочитанные цифры номерных знаков. В (Б) аутентификационная маска встроена в виде метаданных и позже наложена, чтобы раскрыть неаутентичные области, позволяя пользователям различать оригинальные данные и измененные пиксели ИИ. Источник
На самом деле, это вмешательство ИИ в захват сырых данных из сенсора камеры может в конечном итоге стать главным процессом.
Этот тип пост-обработки не является таким же, как текущая тенденция к изменению фотографий в камере, когда приложение камеры или камерное приложение позволяет пользователю пересмотреть фотографию в свое удовольствие, прежде чем она будет даже загружена с устройства.
Напротив, обработка происходит в «черном ящике» в Image Signal Processor (ISP) камеры, обычно в проприетарном режиме, который не раскрывает или не делает доступным сырые данные сенсора (и учитывайте, что якобы «чистый» формат камеры RAW не является совершенно «сырым»).
Следовательно, к тому времени, когда вы сможете увидеть фотографию, она может быть уже подвергнута ИИ-усилению, такому как усиление при слабом свете, увеличение или даже замена луны.
Во многих случаях это может привести к неточным реконструкциям, например, текста, что может сделать недействительной использование такого изображения в качестве доказательства, поскольку истинное «сырое» изображение не будет доступно:

Из новой статьи – изображение RAW-сенсора обрабатывается ИИ-усилителем ISP, чтобы произвести окончательный выход sRGB, который выглядит четче, но может содержать вымышленные детали, как показано в примере с номерным знаком, где символы неверно выведены во время цифрового зума. Истинная сцена, которая не доступна на практике, отличается от обоих ИИ-усиленного выхода и промежуточного аутентичного изображения до вымышления. Предлагаемый подход позволяет восстановить это до-вымышленное изображение, восстанавливая то, что камера оптически запечатлела до того, как ИИ-усиление изменило содержание. Источник
Вышеуказанные примеры взяты из новой исследовательской статьи, которая предлагает решение для «родных фотографий ИИ», используя альтернативные процессы ИИ для реконструкции оценочного сырого и неискаженного изображения из обработанного изображения.
Авторы утверждают:
‘Когда модели ИИ, обученные с генеративными или перцептивными потерями, используются в ISP, они склонны к вымышлению контента, потенциально изменяя смысл изображения. Это означает, что изображения, выведенные напрямую из камеры, могут содержать «фальшивый» контент, особенно в смартфонных камерах, где модули ИИ-ISP получают все большее распространение.
‘Использование ИИ в камерах означает сдвиг в том, как мы смотрим на изображения камеры и бросает вызов традиционному судебному взгляду на изображения камеры как на нечто внутренне достоверное.’
Новая работа использует очень легкий кодировщик и MLP-декодировщик, который может быть включен внутри изображения с весовым штрафом только 180кб. Цель состоит в разработке систем кодирования, достаточно быстрых для повторной экстракции исходного изображения в реальном времени.

Из новой статьи: ИИ-усиление в камере ISP может незаметно изменить черты лица, меняя вид или воспринимаемую личность через изменения взгляда и формы рта. Усиление при слабом свете может аналогичным образом изменить содержание изображения, влияя на интерпретацию, несмотря на улучшение визуального качества. В примере с QR-кодом усиление делает изображение более привлекательным, но делает код неразличимым. Метод позволяет восстановить аутентичное изображение до этих вымышлений, восстанавливая исходные черты лица и считываемый QR-код.
Альтернативно, производители камер могли бы дать пользователям доступ к真正 неискаженным данным сенсора; однако, это, скорее всего, останется ограниченным только очень высококлассным оборудованием. В мобильном и потребительском пространстве, к сожалению, доступ к необработанным фотографиям может быть рассмотрен как «нишевая» или маргинальная цель.
Хотя потребительские камеры всегда применяли некоторый уровень пост-обработки, до появления ИИ на краю, алгоритмы, используемые ранее, были минимально «интерпретативными» и не склонны изменять содержание фотографии таким же значимым образом, как текущие методы ИИ.
Интересно, что, учитывая масштабы, в которых политика Samsung по замене луны подверглась общественной критике несколько лет назад, центр ИИ Samsung в Торонто является одним из участников новой работы, озаглавленной Решение проблемы аутентичности изображений при использовании камерами генеративного ИИ, и возглавляемой вкладами пяти исследователей из Университета Торонто.
Метод
Авторы используют единственный другой проект, который, по-видимому, напрямую решал проблему намеренного нарушения:
2024 год статья Advocating Pixel-Level Authentication of Camera-Captured Images, которая предложила «бинарную аутентификационную маску», определяющую области, измененные процессами ИИ в камере:

Справа, «аутентификационная маска» статьи 2024 года раскрывает области неба, затронутые процессами ИИ «сглаживания» в камере.
Однако система не предложила метода, которым можно было бы восстановить «истинное» изображение, что новая работа и решает, признавая долг перед предыдущей работой.
Цель новой работы состоит в том, чтобы позволить пользователям восстановить изображение, максимально близкое к тому, что фактически попало в сенсор, до того, как обработка произошла:

Обзор предложенного метода. В (А), во время захвата, выходное изображение ISP, содержащее вымышленные детали, передается через предварительно обученный кодировщик, и его латентные особенности объединяются с пространственными координатами и подают в MLP, который работает на уровне пикселя, чтобы предсказать не-вымышленное изображение, с обучением, управляемым потерей против аутентичного изображения. Весы кодировщика и MLP затем сохраняются в виде метаданных вместе с изображением. В (Б), во время вывода, эти веса извлекаются из метаданных и используются с кодировщиком и MLP для реконструкции не-вымышленного изображения.
Во время захвата, в новом методе, обработанное изображение передается через замороженный кодировщик, который преобразует его в компактное латентное представление. Затем соответствующие пространственные координаты объединяются с этими особенностями и подают в легкий MLP, который работает на уровне пикселя, чтобы предсказать исходное содержание изображения – фактически, учиться вычитать вымышленные элементы через реконструкционную потерю, против аутентичных целей.
Кодировщик и декодировщик предварительно обучаются на парных аутентичных и вымышленных изображениях, затем быстро настраиваются для каждого захваченного изображения, с их весами, сохраненными в виде метаданных вместе с фотографией, добавляя только небольшой размерный штраф.
Во время просмотра эти сохраненные веса извлекаются и повторно используются для запуска того же кодировщика и MLP, что позволяет восстановить изображение, близкое к тому, что сенсор камеры изначально запечатлел, не вводя новый синтетический контент.
Данные и тесты
Авторы протестировали новый метод, используя два наиболее часто реализуемых задач пост-обработки ISP: супер-разрешение (SR, включая для увеличения); и фотография при слабом свете.
Для общего («естественного изображения») раздела SR тестов были включены многие примеры текста, поскольку известно, что процедуры SR ISP изменяют текст (например, номера автомобильных номерных знаков, но см. примеры ранее в статье). Поскольку искажение текста является самостоятельной проблемой, оно было обработано как подмножество тестов SR, с выделенными данными.
Упомянутый кодировщик был обучен для каждой из двух тестируемых модальностей, и каждый был выбран на основе того, какой модуль ИИ-ISP, вероятно, будет задействован во время захвата (т.е. модуль «слабый свет» в темных условиях).
Авторы использовали DIV2K dataset для обучения супер-разрешения, используя популярную RealESRGAN сеть. В соответствии с вышеупомянутой работой 2024 года об вмешательстве ИИ, исследователи сгенерировали парные данные, содержащие не затронутый и затронутый вымышлением контент.
Для раздела SR текста авторы использовали модель MARCONet 2023 года:

Из статьи MARCONet 2023 года: примеры реальных низкокачественных и эквивалентных увеличенных текстов. Источник
Чтобы создать парные данные в этом случае, исследователи запустили не-вымышленные изображения через MARCONet. 2000 изображений были сгенерированы из исходного кода проекта, с 200 отложенными для проверки, вместе с еще 200 для тестирования.
Для тестов при слабом свете был принят LOw-Light dataset (LOL) из китайской статьи 2018 года:

Из китайского набора данных LOL 2018 года: примеры одного и того же изображения при разных экспозициях и уровнях темноты и деградации. Источник
Конкурентные рамки
Для оценки метода были проведены сравнения с тремя конкретными базовыми линиями, обученными в сопоставимых условиях. Сначала SIREN и NeRF были предварительно обучены на парных аутентичных и вымышленных изображениях, а затем донастроены во время захвата в течение того же времени, что и предложенный подход, обеспечивая прямое сравнение с NeRF.
Во-вторых, MLP с обученным кодированием на основе метода hashgrid из Instant-NGP был использован, с таблицей хэша и MLP совместно оптимизированными.
Размер вложения и емкость сети были сопоставлены с целевым кодировщиком и MLP, с экспериментами, охватывающими как оптимизацию на уровне изображения с нуля, так и предварительное обучение с последующим донастройкой.
Третьим был реализован базовый метод перевода изображения в изображение без метаданных, используя модель NAFNet размером 64МБ, обученную как система регрессии пиксель в пиксель без доступа к метаданным.
В обучении был использован оптимизатор Adam через PyTorch, как для предварительного обучения, так и для донастройки. Кодировщик и MLP были обучены в течение 50 000 эпох с размером партии 32, с модальностью-специфическими кодировщиками, обученными для каждой задачи (т.е. SR, SR-текст, слабый свет).
Донастройка происходила примерно за три секунды на GPU NVIDIA V100 с 32ГБ видеопамяти. Авторы отмечают, что, хотя оптимизация на устройстве является целевой средой и сценарием, она не была реалистичной для реализации для всех рамок, и поэтому все тесты были проведены в настольной среде:

Сравнение производительности с базовыми линиями, основанными на MLP с метаданными, включая SIREN, NeRF и метод хэш-таблицы, а также с восстановлением без метаданных, используя NAFNet. Результаты представлены в виде PSNR в децибелах для трех задач: супер-разрешение естественных изображений на DIV2K; супер-разрешение текста на MARCONet; и усиление при слабом свете на LOL, с методом авторов, достигающим наивысших баллов в каждом случае.
Для подходов, основанных на MLP, производительность сильно зависела от входного представления, где модели, обученные только с пространственными координатами, испытывали трудности во время предварительного обучения и не смогли улучшиться во время ограниченной стадии донастройки. Добавление информации о цвете привело к более сильным результатам.
Восстановление без метаданных, используя NAFNet, показало хорошую производительность на DIV2K, где отображение из деградированных до чистых изображений было относительно стабильным, но разрушилось на MARCONet и LOL, где существовало несколько возможных реконструкций, и модель не имела информации, необходимой для разрешения этой неоднозначности.
Этот эффект был наиболее выражен при усилении при слабом свете, где исходная яркость сцены не могла быть надежно выведена из обработанного изображения в одиночку.
Авторы утверждают:
‘[В] синтетических данных MARCONet изображения с разными силами размытия отображаются в одно и то же вымышленное изображение. Можно увидеть из результатов, что наш предложенный подход превосходит конкурентов во всех наборах данных.’

В сравнении выше мы можем увидеть, насколько хорошо разные методы работают в зависимости от времени, которое им дано для запуска в момент захвата фотографии. Обучение модели с нуля для каждого изображения может дать сильные результаты, как это видно с SIREN, NeRF и хэш-таблицей – но это занимает слишком много времени, чтобы быть практичным внутри камеры.
Вместо этого метод авторов выполняет большую часть работы заранее, с быстрой корректировкой во время захвата, что позволяет ему обеспечить лучшие результаты в течение жестких временных ограничений (3, 5 или десять секунд).

Сравнение производительности с базовыми линиями, основанными на MLP с метаданными, включая SIREN, NeRF и метод хэш-таблицы, а также с восстановлением без метаданных, используя NAFNet. Результаты представлены в виде PSNR в децибелах для трех задач: супер-разрешение естественных изображений на DIV2K; супер-разрешение текста на MARCONet; и усиление при слабом свете на LOL, с предложенным методом, достигающим наивысших баллов в каждом случае. Пожалуйста, обратитесь к исходной статье для (немного) лучшего разрешения.
Выше показаны качественные результаты на DIV2K, где методы усиления ввели видимые вымышления. Модель супер-разрешения на основе ГАН изменила цвет глаз, а восстановление без метаданных испытывало трудности с реконструкцией исходного изображения. NeRF и хэш-таблица произвели артефакты в структурированных областях, таких как окна и текст, в то время как предложенный метод более точно соответствовал аутентичному изображению.

Наконец, на рисунке выше мы видим результаты на наборе данных LOL, с яркостью, масштабированной для визуализации.
Восстановление без метаданных не смогло разрешить неизвестный масштаб яркости, в то время как предложенный метод лучше реконструировал текстуры и восстановил измененные символы, такие как исправление «1» обратно в «i», без добавления артефактов.
Заключение
Вероятно, неоспоримо, и никогда не было неоспоримо, что «камера никогда не лжет». Каждое решение о том, что фотографировать и когда фотографировать, а также как представить и контекстуализировать это, является по сути политическим или социальным решением.
Даже старейшие методы пост-обработки, такие как доджинг и бёрнинг (давно перенесенные в инструменты Photoshop), являются высоко субъективными актами художественного решения и предпочтения.
Однако это не причина отказаться от цели «объективных» захватов изображений; и кажется разумным, что средний потребитель должен быть допущен, даже с некоторыми трудностями, к доступу к «немассированным» сырым данным сенсора фотографий, которые он делает, если он хочет; или, по крайней мере, что он должен быть разрешен ограничить пост-обработку ISP до не-ИИ алгоритмов, как он может предпочесть.
Опубликовано впервые в пятницу, 24 апреля 2026 года












