Погляд Anderson
Відновлення того, що ваша камера захопила до зміни AI

Як захистити святість необробленої фотографії від втручання штучного інтелекту, коли вона вже пройшла через штучний інтелект всередині камери? Нові дослідження спрямовані на відновлення «справжніх» даних сенсора – також за допомогою штучного інтелекту!
Збільшення автентичності зображень штучного інтелекту за останні рік або близько того змусило багато груп і осіб виступити проти подальшої ерозії довіри до фотографії.
За той же період Коаліція за довіру та автентичність контенту (C2PA) намагалася впровадити напівкриптографічний стандарт, який приєднує метадані про походження до зображення, починаючи з моменту його захоплення камерою або пристроєм, сподіваючись розмаскувати подальше використання генеративного штучного інтелекту на цих «оригінальних» зображеннях:

Схема походження в системі C2PA, де метадані, написані в момент захоплення, можуть бути додані, як до щоденника, дозволяючи звичайні корекції, такі як яскравість і контраст, але реєструючи великі корекції, щоб сильно змінене зображення штучного інтелекту відображалося б у ЗМІ, які підтримують цю систему. Джерело
Прийняття цього стандарту не було таким поширеним, як сподівалася коаліція, і зараз тільки 14 камер підтримують відбиток автентичності всередині камери.
Цікаво, що ідея C2PA про надання фотографії «паспорту» відразу після її створення полягає в тому, що в цей момент може бути вже пізно – оскільки виробники камер тепер часто впроваджують обробку штучного інтелекту в процес створення зображення:

З паперу 2024 року «Advocating Pixel-Level Authentication of Camera-Captured Images»: ілюстрація того, як сучасні камерні потоки вводять вигадані дані під час захоплення та як метадані автентифікації на рівні пікселів розкривають це. У (А), зображення смартфонного сенсора обробляється ISP, де модулі штучного інтелекту можуть вигадувати деталі під час цифрового зуму або корекції експозиції, створюючи реалістичні зображення з помилками, такими як неправильно прочитані цифри номерного знака. У (Б), автентифікаційна маска вкладена як метадані та пізніше накладається, щоб розкрити неавтентичні області, дозволяючи користувачам розрізняти оригінальні дані від змінених пікселів штучного інтелекту. Джерело
Насправді, такий втручання штучного інтелекту у захоплення сирої інформації з сенсора камери може врешті-решт навіть стати керуючим процесом.
Цей тип постобробки відрізняється від поточної тенденції зміни фотографій всередині камери, коли додаток камери або камерний додаток дозволяє користувачеві переглянути фотографію в спокої, перш ніж вона буде завантажена з пристрою.
Натомість обробка відбувається в «чорному ящику» режимі в процесорі сигналу зображення (ISP) камери, зазвичай у пропрієтарному режимі виконання, який не розкриває або не надає сирої інформації сенсора (і розгляньте, що так званий «чистий» формат камери RAW не є таким вже «сирим»).
Отже, до того, як ви зможете побачити фотографію взагалі, вона могла бути піддана обробці штучного інтелекту, chẳng hạn як підвищення якості при низькому освітленні, збільшення чи навіть заміна місяця.
У багатьох випадках це може привести до неточних реконструкцій, наприклад, тексту, який може зробити недійсною використання такого зображення як доказ, оскільки справжнє «сире» зображення не буде доступне:
<img class=" wp-image-413558" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-1-5.jpg" alt="З нової статті – сире зображення сенсора обробляється генеративним штучним інтелектом, щоб створити кінцевий сRGB-вихід, який виглядає чіткіше, але може містити вигадані деталі, як показано в прикладі з номерним знаком, де символи неправильно витлумачені під час цифрового зуму. Справжня сцена, яка не доступна на практиці, відрізняється від обох виведених зображень штучного інтелекту та проміжного автентичного зображення до вигаданих деталей. Запропонований підхід дозволяє відновити це до-вигадане зображення, відновлюючи те, що камера спочатку захопила, перш ніж штучний інтелект змінив вміст. Джерело
Наведені вище приклади походять з нової статті, яка пропонує ліки від «рідних фотографій штучного інтелекту», використовуючи альтернативні процеси штучного інтелекту для реконструкції оцінених сирих і неушкоджених зображень з обробленого зображення.
Автори заявляють:
‘Коли моделі штучного інтелекту, навчені з генеративними або сприймальними втратами, використовуються в ISP, вони схильні вигадувати вміст, потенційно змінюючи зміст зображення. Вплив полягає в тому, що зображення, що виводяться безпосередньо з камери, можуть містити «фальшивий» вміст, особливо в камерах смартфонів, де модулі штучного інтелекту ISP бачать зростаюче впровадження.
‘Використання генеративного штучного інтелекту в апаратному забезпеченні камери означає зміну парадигми того, як ми сприймаємо зображення камери, і викликає традиційний судовий погляд на зображення, захоплені камерою, як на внутрішньо довірчі.’
Нова робота використовує дуже легкий кодувальник і MLP-декодувальник, який можна включити всередину зображення з ваговим штрафом лише 180кб. Метою є розвиток систем кодування, достатньо швидких для повторної екстракції оригінального зображення в режимі реального часу.
<img class=" wp-image-413559" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-2-5.jpg" alt="З нової статті: генеративне підвищення роздільної здатності всередині ISP камери може тонко змінити риси обличчя, змішуючи вигляд або сприйняття особи через зміни в погляді та формі рота. Підвищення якості при низькому освітленні може подібним чином змінити вміст зображення, впливаючи на інтерпретацію, незважаючи на покращення візуальної якості. У прикладі з кодом QR підвищення якості робить зображення більш привабливим, але робить код нерозбірливим. Метод дозволяє відновити оригінальне зображення до цих вигаданих деталей, відновлюючи оригінальні риси обличчя та розбірливий код QR.
Альтернативно, виробники камер могли б надати користувачам доступ до真正 сирої інформації сенсора; однак це, ймовірно, залишиться обмеженим лише висококласним обладнанням. У мобільному та популярному споживчому просторі, на жаль, доступ до неопрацьованих фотографій може бути розглянутий як «ніша» або маргінальне заняття.
Хоча споживчі камери завжди застосовували певний рівень постобробки, до появи штучного інтелекту краю, алгоритми, які використовувалися, були мінімально «інтерпретативними» і не схильні змінювати вміст фотографії тим же значним способом, яким сучасні методи штучного інтелекту можуть.
Цікаво, що, враховуючи ступінь, до якої політика заміни місяця Samsung була піддана публічній критиці кілька років тому, Центр штучного інтелекту Samsung у Торонто є одним із учасників нової роботи, яка називається Addressing Image Authenticity When Cameras Use Generative AI і очолюється внесками п’яти дослідників з Університету Торонто.
Метод
Автори використовують єдиний інший проект, який, як здається, безпосередньо звернувся до питання пертурбації за призначенням:
2024 року стаття Advocating Pixel-Level Authentication of Camera-Captured Images, яка запропонувала «бінарну автентифікаційну маску», що виділяє області, змінені процесами штучного інтелекту камери:

Зправа, «автентифікаційна маска» 2024 року розкриває області неба, які були піддані впливу процесів «згладжування» штучного інтелекту камери.
Однак система не пропонувала жодного методу, яким можна було б відновити «справжнє» зображення, чого досягла нова робота, визнаючи борг перед попередньою роботою.
Метою нової роботи є надання користувачам можливості відновити зображення, яке якнайближче до того, що фактично потрапило на сенсор до обробки:

Огляд запропонованого методу. У (А), в момент захоплення, вивід зображення ISP, що містить вигадані деталі, передається через попередньо навчений кодувальник, і його латентні особливості поєднуються зі сповіщеннями координат і подаються в MLP, який працює з пікселя до пікселя для передбачення не-вигаданого зображення, з навчанням, керованим втратою щодо автентичного зображення. Ваги кодувальника та MLP зберігаються як метадані поряд із зображенням. У (Б), під час висновку ці ваги витягуються з метаданих і використовуються з кодувальником та MLP для реконструкції не-вигаданого зображення.
У момент захоплення, у новому методі, оброблене зображення передається через заморожений кодувальник, який перетворює його в компактне латентне представлення. Потім відповідні координати поєднуються з цими особливостями і подаються в легкий MLP, який працює з пікселя до пікселя, для передбачення оригінального вмісту зображення – фактично, вивчаючи, як відняти вигадані елементи через втрату реконструкції, щодо автентичних цілей.
Кодувальник і декодувальник попередньо навчаються на парних автентичних і вигаданих зображеннях, потім швидко дообучені для кожного захопленого зображення, з їхніми вагами, збереженими як метадані поряд із фотографією самою, додаючи лише невеликий розмір надбудови.
Під час перегляду ці збережені ваги витягуються і повторно використовуються для запуску того ж кодувальника та MLP, що дозволяє відновити зображення, яке досить близько до того, що камера сенсор спочатку захопила, без введення нового синтетичного вмісту.
Дані та тести
Автори протестували новий метод, використовуючи два найпоширеніші завдання постобробки ISP: супер-роздільну здатність (SR, включаючи для зумованих областей); та низьке освітлення.
Для загального («природного») розділу SR тестів було включено багато прикладів тексту, оскільки відомо, що процедури SR ISP змінюють текст (наприклад, номерні знаки автомобілів, але див. приклади раніше в статті). Оскільки спотворення тексту є окремою проблемою, це було розглянуто як підмножина тестів SR, з окремими даними.
Вказаний вище кодувальник був навчений для кожної з двох модальностей, які були протестовані, і кожна з них була вибрана на основі того, який модуль штучного інтелекту ISP, ймовірно, буде активований під час захоплення (наприклад, «низьке освітлення» модуль у темних умовах).
Автори використовували DIV2K dataset для навчання супер-роздільної здатності, підтримуваного популярною RealESRGAN мережею. У відповідності з вищезгаданою роботою 2024 року щодо втручання ISP, дослідники згенерували парні дані, що містять неушкоджений і вигаданий вміст.
Для розділу SR тексту автори використовували модель MARCONet 2023 року:

З паперу MARCONet 2023 року: приклади реальних низькочітких і еквівалентних збільшених текстів. Джерело
Для створення парних даних у цьому випадку дослідники прошли неушкоджені зображення через MARCONet. Дві тисячі зображень були згенеровані з оригінального коду проекту, з 200 відкладеними для перевірки, разом з ще 200 для тестування.
Для тестів низького освітлення було прийнято LOw-Light dataset (LOL) з китайської статті 2018 року:

З китайської статті LOL 2018 року: приклади однієї й тієї ж фотографії при різних експозиціях і рівнях темноти та погіршення. Джерело
Рівні рамки
Для оцінки методу були проведені порівняння з трьома конкретними базовими лініями, навченими за збіглих умов. По-перше, SIREN і NeRF були попередньо навчені на парних автентичних і вигаданих зображеннях, а потім дообучені в момент захоплення протягом того ж часу, що і запропонований підхід, забезпечуючи прямий порівняння з NeRF.
По-друге, MLP з вивченим кодуванням на основі методу hashgrid з Instant-NGP був використаний, з таблицями хешу та MLP спільно оптимізованими.
Розмір вкладення та потужність мережі були збігли з цільовим кодувальником та MLP, з експериментами, які охоплювали як оптимізацію з нуля для кожного зображення, так і попереднє навчання з подальшим дообученням.
Третє, була реалізована базова лінія сліпого перекладу зображення в зображення, використовуючи модель NAFNet розміром 64МБ, навченої як системі регресії піксель у піксель без доступу до метаданих.
Під час навчання використовувався оптимізатор Adam через PyTorch, як для попереднього навчання, так і для дообучення. Кодувальник і MLP були навчені протягом 50 000 епох з розміром партії 32, з модальними кодувальниками, навченими для кожної задачі (наприклад, SR, SR тексту, низьке освітлення).
Дообучення відбувалося протягом приблизно трьох секунд на GPU NVIDIA V100 з 32ГБ відеопам’яті. Автори відзначають, що хоча оптимізація на пристрої є цілевим середовищем і сценарієм, не було реалістично впровадити це для всіх рамок, і тому всі тести проводилися в середовищі робочого столу:

Порівняння продуктивності з метаданих-асистованими базовими лініями MLP, включаючи SIREN, NeRF і метод hash-grid, поряд з сліпим відновленням за допомогою NAFNet. Результати повідомляються як PSNR у децибелах через три завдання: супер-роздільна здатність природного зображення на DIV2K; супер-роздільна здатність тексту на MARCONet; і підвищення якості при низькому освітленні на LOL, з методом авторів, який досягає найвищих балів у кожному випадку.
Для підходів, заснованих на MLP, продуктивність сильно залежала від входної репрезентації, де моделі, навчені лише зі сповіщеннями координат, боролися під час попереднього навчання і не змогли покращитися під час обмеженого етапу дообучення. Додавання кольорової інформації призвело до кращих результатів.
Сліпе відновлення за допомогою NAFNet показало хороші результати на DIV2K, де відображення з низької якості на високу була відносно стабільною, але зазнало поразки на MARCONet і LOL, де існували кілька правдоподібних реконструкцій, і модель не мала інформації, необхідної для розв’язання цієї двозначності.
Цей ефект був найбільш виражений при підвищенні якості при низькому освітленні, де оригінальна яскравість сцени не могла бути надійно витлумачена з обробленого зображення сам по собі.
Автори заявляють:
‘[У] синтетичних даних MARCONet зображення з різними силами розмиття відображаються в одне й те саме вигадане зображення. Як видно з результатів, наш запропонований підхід перевершує конкурентів у всіх наборах даних.’

У вищезгаданому порівнянні ми бачимо, як добре різні методи працюють залежно від часу, який їм дозволено виконувати в момент захоплення фотографії. Навчання моделі з нуля для кожного зображення може дати сильні результати, як видно з SIREN, NeRF і hash-grid – але це займає забагато часу, щоб бути практичним всередині камери.
Натомість метод авторів виконує більшу частину роботи заздалегідь, з швидкою корекцією в момент захоплення, що дозволяє йому досягати кращих результатів у рамках обмеженого часу (3, 5 або десять секунд).

Порівняння продуктивності з метаданих-асистованими базовими лініями MLP, включаючи SIREN, NeRF і метод hash-grid, поряд з сліпим відновленням за допомогою NAFNet. Результати повідомляються як PSNR у децибелах через три завдання: супер-роздільна здатність природного зображення на DIV2K; супер-роздільна здатність тексту на MARCONet; і підвищення якості при низькому освітленні на LOL, з методом авторів, який досягає найвищих балів у кожному випадку. Будь ласка, зверніться до джерельної статті для (трохи) кращої роздільної здатності.
Вище показані якісні результати на DIV2K, де методи підвищення якості вводили помітні вигадані деталі. Модель супер-роздільної здатності на основі GAN змінила колір очей, а сліпе відновлення боролися з реконструкцією оригінального зображення. NeRF і hash-grid створили артефакти в структурованих регіонах, таких як вікна і текст, тоді як запропонований метод більш точно збігався з автентичним зображенням.

Нарешті, на вищезгаданому малюнку ми бачимо результати на наборі даних LOL, з яскравістю, масштабованою для візуалізації.
Сліпе відновлення не змогло розв’язати невідому шкалу яскравості, тоді як запропонований метод краще реконструював текстури і відновив змінені символи, такі як виправлення «1» до «i», без додавання артефактів.
Висновок
Ймовірно, не доводиться доводити, що «камера ніколи не бреше». Кожна рішення про те, що сфотографувати і коли сфотографувати, разом з тим, як представити і контекстуалізувати це, є, по суті, політичним або соціальним рішенням.
Даже найстаріші методи постобробки, такі як доджинг і бёрнінг (давно перейшли до інструментів Photoshop), є високо суб’єктивними актами художнього рішення та уподобань.
Однак, це не означає, що варто відмовитися принаймні від мети «об’єктивних» знімків; і здається досить розумним, що середньому споживачеві слід дозволити, навіть з певними труднощами, отримати доступ до «немасованих» сирої інформації сенсора фотографій, які вони роблять, якщо вони хочуть; або принаймні, що їм слід дозволити обмежити постобробку ISP до не-штучного інтелекту алгоритмів, як вони можуть бажати.
Перша публікація – п’ятниця, 24 квітня 2026












