Взгляд Anderson
JPEG AI размыляет границу между реальными и синтетическими изображениями

В феврале этого года был опубликован международный стандарт JPEG AI, после нескольких лет исследований, направленных на использование методов машинного обучения для создания более компактного и легко передаваемого кодека изображений без потери перцептивного качества.

Из официального публикационного потока JPEG AI, сравнение между пиковой сигнал-шумовой отношением (PSNR) и подходом JPEG AI с помощью машинного обучения. Источник: https://jpeg.org/jpegai/documentation.html
Одной из возможных причин, почему это событие не получило широкого освещения, является то, что основные PDF-файлы для этого объявления не были доступны через бесплатные порталы, такие как Arxiv. Тем не менее, Arxiv уже опубликовал ряд исследований, изучающих значение JPEG AI с различных аспектов, включая необычные артефакты сжатия и его значение для судебной экспертизы.

Одно исследование сравнило артефакты сжатия, включая те, которые были получены ранее с помощью JPEG AI, и обнаружило, что новый метод имел тенденцию размыть текст – не незначительный вопрос в случаях, когда кодек может способствовать цепочке доказательств. Источник: https://arxiv.org/pdf/2411.06810
Поскольку JPEG AI изменяет изображения способами, которые имитируют артефакты синтетических генераторов изображений, существующие судебные инструменты имеют трудности с различением реальных и фальшивых изображений:

После сжатия JPEG AI современные алгоритмы уже не могут надежно разделить аутентичный контент и манипулированные области в картах локализации, согласно недавней статье (март 2025). Примеры на левой стороне – манипулированные/фальшивые изображения, где манипулированные области четко определены стандартными судебными методами (центральное изображение). Однако сжатие JPEG AI придает фальшивым изображениям слой достоверности (изображение справа). Источник: https://arxiv.org/pdf/2412.03261
Одной из причин является то, что JPEG AI обучается с помощью модели архитектуры, подобной тем, которые используются генеративными системами, которые судебные инструменты стремятся обнаружить:

Новая статья иллюстрирует сходство между методологиями кодирования изображений с помощью ИИ и фактическими ИИ-генерированными изображениями. Источник: https://arxiv.org/pdf/2504.03191
Следовательно, обе модели могут производить некоторые подобные визуальные характеристики с точки зрения судебной экспертизы.
Квантование
Это пересечение происходит из-за квантования, общего для обеих архитектур, и которое используется в машинном обучении как метод преобразования непрерывных данных в дискретные точки, и как техника оптимизации, которая может значительно уменьшить размер обученной модели (любители синтеза изображений знакомы с ожиданием между выпуском официальной модели и версией, оптимизированной сообществом, которая может работать на локальном оборудовании).
В этом контексте квантование относится к процессу преобразования непрерывных значений в латентном представлении изображения в фиксированные, дискретные шаги. JPEG AI использует этот процесс для уменьшения количества данных, необходимых для хранения или передачи изображения, упрощая внутреннее числовое представление.
Хотя квантование делает кодирование более эффективным, оно также вводит структурные регулярности, которые могут напоминать артефакты, оставленные генеративными моделями – достаточно тонкие, чтобы избежать восприятия, но нарушающие судебные инструменты.
В ответ авторы новой работы под названием Три судебных подсказки для изображений JPEG AI предлагают интерпретируемые, не-нейронные методы, которые обнаруживают сжатие JPEG AI; определяют, было ли изображение пересжато; и различают сжатые реальные изображения и те, которые были полностью сгенерированы ИИ.
Метод
Цветовые корреляции
Статья предлагает три ‘судебных подсказки’ для изображений JPEG AI: цветовые корреляции каналов, введенные на этапе предобработки JPEG AI; измеримые искажения качества изображения при повторных сжатиях, которые раскрывают события пересжатия; и латентные закономерности квантования, которые помогают различать изображения, сжатые JPEG AI, и те, которые были сгенерированы моделями ИИ.
Что касается подхода, основанного на цветовых корреляциях, предобработка JPEG AI вводит статистические зависимости между цветовыми каналами изображения, создавая сигнатуру, которая может служить судебной подсказкой.
JPEG AI преобразует изображения RGB в пространство цвета YUV и выполняет хрома-сабсэмплинг 4:2:0, который включает в себя уменьшение хроминансных каналов перед сжатием. Этот процесс приводит к тонким корреляциям между высокочастотными остатками красных, зеленых и синих каналов – корреляциям, которые отсутствуют в несжатых изображениях и которые отличаются по силе от тех, которые производятся традиционным сжатием JPEG или синтетическими генераторами изображений.

Сравнение того, как сжатие JPEG AI изменяет цветовые корреляции в изображениях..
Выше мы видим сравнение из статьи, иллюстрирующее, как сжатие JPEG AI изменяет цветовые корреляции в изображениях, используя красный канал в качестве примера.
Панель А сравнивает несжатые изображения с сжатыми JPEG AI, показывая, что сжатие значительно увеличивает межканальную корреляцию; панель Б изолирует эффект предобработки JPEG AI – только цветовое преобразование и сабсэмплинг – демонстрируя, что даже этот шаг alone повышает корреляции заметно; панель В показывает, что традиционное сжатие JPEG также увеличивает корреляции немного, но не в той же степени; и панель Г исследует синтетические изображения, с Midjourney-V5 и Adobe Firefly, демонстрирующими умеренные увеличения корреляций, в то время как другие остаются ближе к несжатым уровням.
Скорость-искажение
Сигнал скорости-искажения выявляет пересжатие JPEG AI, отслеживая, как качество изображения, измеряемое пиковой сигнал-шумовой отношением (PSNR), снижается в предсказуемом порядке при повторных сжатиях.
Исследование утверждает, что повторное сжатие изображения с помощью JPEG AI приводит к постепенным, но все еще измеримым, потерям качества изображения, как количественно выражается через PSNR, и что это постепенное ухудшение образует основу для судебной подсказки обнаружения пересжатия.
В отличие от традиционного JPEG, где ранее методы отслеживали изменения в конкретных блоках изображения, JPEG AI требует другого подхода из-за своей нейронной архитектуры сжатия; поэтому авторы предлагают отслеживать, как битрейт и PSNR эволюционируют при повторных сжатиях. Каждый раунд сжатия изменяет изображение меньше, чем предыдущий, и это уменьшающееся изменение (когда оно отображается против битрейта) может раскрыть, было ли изображение пересжато:

Иллюстрация того, как повторное сжатие влияет на качество изображения при различных кодеках, показывает, что JPEG AI и нейронный кодек, разработанный в https://arxiv.org/pdf/1802.01436, оба демонстрируют стабильное снижение PSNR при каждом дополнительном сжатии – даже при более низких битрейтах. Напротив, традиционное сжатие JPEG поддерживает относительно стабильное качество при повторных сжатиях, если только битрейт не высок.
На изображении выше мы видим графики скорости-искажения для JPEG AI; второго кодека на основе ИИ; и традиционного JPEG, обнаруживая, что JPEG AI и нейронный кодек демонстрируют стабильное снижение PSNR при всех битрейтах, в то время как традиционное сжатие JPEG демонстрирует заметное ухудшение только при высоких битрейтах. Это поведение обеспечивает количественный сигнал, который можно использовать для флагирования пересжатых изображений JPEG AI.
Отслеживая, как битрейт и качество изображения эволюционируют при повторных сжатиях, авторы аналогичным образом построили сигнатуру, которая помогает флагировать, было ли изображение пересжато, обеспечивая потенциальную практическую судебную подсказку в контексте JPEG AI.
Квантование
Как мы видели ранее, одной из более сложных судебных проблем, связанных с JPEG AI, является его визуальное сходство с синтетическими изображениями, сгенерированными моделями диффузии. Обе системы используют архитектуры кодирования-декодирования, которые обрабатывают изображения в сжатом латентном пространстве и часто оставляют после себя тонкие артефакты апсэмплинга.
Эти общие черты могут запутать детекторы – даже те, которые были переобучены на изображениях JPEG AI. Однако ключевое структурное различие остается: JPEG AI применяет квантование, шаг, который округляет латентные значения до дискретных уровней для эффективного сжатия, в то время как генеративные модели обычно не делают этого.
Новая статья использует это различие для разработки судебной подсказки, которая косвенно тестирует наличие квантования. Метод анализирует, как латентное представление изображения реагирует на округление, исходя из предположения, что если изображение уже было квантовано, его латентная структура будет демонстрировать измеримую закономерность выравнивания с округленными значениями.
Эти закономерности, хотя и невидимые для глаза, производят статистические различия, которые могут помочь разделить сжатые реальные изображения и полностью синтетические.
<img class=" wp-image-215542" src="https://www.unite.ai/wp-content/uploads/2025/04/fig-7.jpg" alt="Пример средних спектров Фурье показывает, что как изображения, сжатые JPEG AI, так и те, которые были сгенерированы моделями диффузии, такими как Midjourney-V5 и Stable Diffusion XL, демонстрируют регулярные сетчатые закономерности в области частот – артефакты, обычно связанные с апсэмплингом. Напротив, реальные изображения не демонстрируют этих закономерностей. Это совпадение в спектральной структуре помогает объяснить, почему судебные инструменты часто путают сжатые реальные изображения с синтетическими. Источник: https://arxiv.org/pdf/2412.03261
Важно отметить, что авторы показывают, что эта подсказка работает при различных генеративных моделях и остается эффективной даже при сильном сжатии, которое может обнулить целые разделы латентного пространства. Напротив, синтетические изображения демонстрируют гораздо более слабые реакции на этот тест округления, предлагая практический способ различать между двумя.
Результат предназначен как легкий и интерпретируемый инструмент, нацеленный на основное различие между сжатием и генерацией, а не полагающийся на хрупкие поверхностные артефакты.
Данные и тесты
Сжатие
Чтобы оценить, может ли их подсказка цветовых корреляций надежно обнаружить сжатие JPEG AI (т.е. первый проход от несжатого источника), авторы протестировали ее на высококачественных несжатых изображениях из набора данных RAISE, сжимая их при различных битрейтах с помощью референсной реализации JPEG AI.
Они обучили простой случайный лес на статистических закономерностях цветовых корреляций каналов (особенно того, как остаточный шум в каждом канале выравнивается с другими) и сравнили это с ResNet50 нейронной сетью, обученной直接 на пикселях изображения.

Точность обнаружения сжатия JPEG AI с помощью функций цветовых корреляций, сравненная при различных битрейтах. Метод наиболее эффективен при более низких битрейтах, где артефакты сжатия сильнее, и показывает лучшую обобщаемость на незнакомые уровни сжатия по сравнению с базовой моделью ResNet50.
Хотя ResNet50 достигла более высокой точности, когда тестовые данные были близки к условиям ее обучения, она испытывала трудности с обобщением на различные уровни сжатия. Подход, основанный на корреляциях, хотя и намного проще, оказался более последовательным при различных битрейтах, особенно при более низких скоростях сжатия, где предобработка JPEG AI имеет более сильный эффект.
Эти результаты предполагают, что даже без глубокого обучения возможно обнаружить сжатие JPEG AI, используя статистические подсказки, которые остаются интерпретируемыми и устойчивыми.
Пересжатие
Чтобы оценить, может ли пересжатие JPEG AI быть надежно обнаружено, исследователи протестировали подсказку скорости-искажения на наборе изображений, сжатых при различных битрейтах – некоторые только один раз, а другие второй раз с помощью JPEG AI.
Этот метод включал извлечение 17-мерного вектор-признаков для отслеживания того, как битрейт и PSNR изображения эволюционировали при трех проходах сжатия. Этот набор признаков захватывал, сколько качества было потеряно на каждом шаге, и как латентные и гиперпriorные скорости ведут себя – метрики, которые традиционные пиксельные методы не могут легко получить.
Исследователи обучили случайный лес на этих признаках и сравнили его производительность с ResNet50, обученной на пикселях изображения:

Результаты классификационной точности случайного леса, обученного на функциях скорости-искажения для обнаружения пересжатия JPEG AI. Метод работает лучше всего, когда первоначальное сжатие сильное (т.е. при более низких битрейтах), и затем последовательно превосходит пиксельную ResNet50 – особенно в случаях, когда второе сжатие мягче, чем первое.
Случайный лес оказался заметно эффективным, когда первоначальное сжатие было сильным (т.е. при более низких битрейтах), раскрывая четкие различия между однократно и двукратно сжатыми изображениями. Как и в случае с предыдущей подсказкой, итерация ResNet50 испытывала трудности с обобщением, особенно когда тестировалась на уровнях сжатия, которых она не видела во время обучения.
Признаки скорости-искажения, напротив, оставались стабильными при широком диапазоне сценариев. Заметно, что подсказка работала даже при применении к другому кодеку на основе ИИ, что предполагает, что подход обобщается за пределы JPEG AI.
JPEG AI и синтетические изображения
Для финального раунда тестирования авторы протестировали, могут ли их функции квантования различать изображения, сжатые JPEG AI, и полностью синтетические изображения, сгенерированные моделями, такими как Midjourney, Stable Diffusion, DALL-E 2, Glide и Adobe Firefly.
Для этого исследователи использовали подмножество набора данных Synthbuster, смешав реальные фотографии из базы данных RAISE с сгенерированными изображениями из ряда моделей диффузии и GAN.

Примеры синтетических изображений в Synthbuster, сгенерированных с помощью текстовых подсказок, вдохновленных естественными фотографиями из набора данных RAISE-1k. Изображения были созданы с помощью различных моделей диффузии, с подсказками, разработанными для производства фотореалистичного контента и текстур, а не стилизованных или художественных представлений. Источник: https://ieeexplore.ieee.org/document/10334046
Реальные изображения были сжаты с помощью JPEG AI при нескольких битрейтах, и классификация была поставлена как двусторонняя задача: либо JPEG AI против конкретного генератора, либо конкретный битрейт против Stable Diffusion XL.
Функции квантования (корреляции, извлеченные из латентных представлений) были рассчитаны из фиксированного региона 256×256 пикселей и поданы в классификатор случайного леса. В качестве базовой модели была использована ResNet50, обученная на пикселях изображения.

Точность классификации случайного леса, использующего функции квантования для разделения изображений, сжатых JPEG AI, и синтетических изображений.
При большинстве условий подход, основанный на квантовании, превосходил базовую ResNet50, особенно при более низких битрейтах, где артефакты сжатия были сильнее.
Авторы заявляют:
‘Базовая ResNet50 работает лучше всего для изображений Glide, с точностью 66,1%, но в остальных случаях обобщается хуже, чем функции квантования. Функции квантования демонстрируют хорошую обобщаемость при различных силах сжатия и типах генераторов.
‘Важность коэффициентов, квантованных до нуля, показана в весьма достойной производительности [функций], которые в многих случаях работают сравнимо с классификатором ResNet50.
‘Однако функции квантования, использующие полный, неотрезанный вектор целых чисел, все еще работают заметно лучше. Эти результаты подтверждают, что количество нулей после квантования является важной подсказкой для различения сжатых и сгенерированных изображений.
‘Тем не менее, это также показывает, что другие факторы также способствуют. Точность полного вектора для обнаружения JPEG AI составляет более 91,0% при всех битрейтах, и более сильное сжатие приводит к более высокой точности.’
Проекция пространства признаков с помощью UMAP показала четкое разделение между изображениями JPEG AI и синтетическими изображениями, с более низкими битрейтами, увеличивающими расстояние между классами. Одним постоянным аутлиером был Glide, чьи изображения кластеризовались по-другому и имели самую низкую точность обнаружения среди всех протестированных генераторов.

Двумерная визуализация UMAP изображений JPEG AI и синтетических изображений на основе функций квантования. Левый график показывает, что более низкие битрейты JPEG AI создают большее разделение от синтетических изображений; правый график показывает, как изображения из разных генераторов кластеризуются различно в пространстве признаков.
Наконец, авторы оценили, насколько хорошо функции выдерживают типичную постобработку, такую как пересжатие JPEG или уменьшение размера. Хотя производительность снижалась при более сильной обработке, спад был постепенным, что предполагает, что подход сохраняет некоторую устойчивость даже при ухудшенных условиях.

Оценка устойчивости функций квантования при постобработке, включая пересжатие JPEG (JPG) и изменение размера изображения (RS).
Заключение
Не гарантировано, что JPEG AI получит широкое распространение. Во-первых, существует достаточно инфраструктурного долга, чтобы наложить трение на любой новый кодек; и даже ‘традиционный’ кодек с хорошей репутацией и широким консенсусом относительно его ценности, такой как AV1, имеет трудности с вытеснением устоявшихся методов.
Что касается потенциального столкновения системы с генераторами ИИ, характерные артефакты квантования, которые помогают текущему поколению детекторов изображений ИИ, могут быть уменьшены или в конечном итоге заменены следами другого рода в более поздних системах (при условии, что генераторы ИИ всегда будут оставлять судебные следы, что не является определенным).
Это означало бы, что собственные характеристики квантования JPEG AI, возможно, вместе с другими выявленными подсказками, не столкнутся с судебным следом наиболее эффективных новых генеративных систем ИИ.
Если, однако, JPEG AI продолжит работать как де-факто ‘ИИ-стирание’, значительно размывая различие между реальными и сгенерированными изображениями, будет трудно сделать убедительный аргумент в пользу его принятия.
Опубликовано впервые во вторник, 8 апреля 2025












