Взгляд Anderson

Исследования Disney предлагают улучшенную компрессию изображений на основе ИИ – но она может галлюцинировать детали

mm
Добавьте Unite.AI в избранные источники в Google
Detail for the supplementary Disney paper – source: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Supplementary-1.pdf

Исследовательское подразделение Disney предлагает новый метод сжатия изображений, использующий открытую модель Stable Diffusion V1.2 для получения более реалистичных изображений при более низких битрейтах, чем конкурирующие методы.

Метод сжатия Disney по сравнению с предыдущими подходами. Авторы утверждают, что их метод обеспечивает лучшее восстановление деталей, при этом не требует сотен тысяч долларов на обучение и работает быстрее, чем ближайший эквивалентный конкурирующий метод. Источник: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

Метод сжатия Disney по сравнению с предыдущими подходами. Авторы утверждают, что их метод обеспечивает лучшее восстановление деталей, при этом не требует сотен тысяч долларов на обучение и работает быстрее, чем ближайший эквивалентный конкурирующий метод. Источник: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

Новый подход (определенный как «кодек», несмотря на его увеличенную сложность по сравнению с традиционными кодеками, такими как JPEG и AV1) может работать с любым латентной диффузионной моделью (LDM). В количественных тестах он превосходит предыдущие методы по точности и детализации, и требует значительно меньше обучения и вычислительных ресурсов.

Ключевым моментом нового исследования является то, что ошибка квантования (центральный процесс во всех алгоритмах сжатия изображений) похожа на шум (центральный процесс в диффузионных моделях).

Следовательно, «традиционно» квантованное изображение можно рассматривать как шумную версию исходного изображения и использовать в процессе денойзинга LDM вместо случайного шума, чтобы восстановить изображение на целевом битрейте.

Дополнительные сравнения нового метода Disney (выделено зеленым), в сравнении с конкурирующими подходами.

Дополнительные сравнения нового метода Disney (выделено зеленым), в сравнении с конкурирующими подходами.

Авторы утверждают:

‘Мы формулируем удаление ошибки квантования как задачу денойзинга, используя диффузию для восстановления потерянной информации в передаваемом латентном изображении. Наш подход позволяет нам выполнить менее 10% полного диффузионного генеративного процесса и не требует никаких архитектурных изменений в модели диффузии, что позволяет использовать основные модели в качестве сильного априорного знания без дополнительной настройки базовой модели.’

‘Наш предложенный кодек превосходит предыдущие методы в количественных метриках реализма, и мы подтверждаем, что наши реконструкции качественно предпочитаются конечными пользователями, даже когда другие методы используют вдвое больший битрейт.’

Однако, как и другие проекты, которые стремятся использовать возможности сжатия диффузионных моделей, выход может галлюцинировать детали. В отличие от этого, потерянные методы, такие как JPEG, будут производить явно искаженные или чрезмерно сглаженные области деталей, которые можно распознать как ограничения сжатия непрофессиональным пользователем.

Вместо этого кодек Disney может изменить детали из контекста, который не был в исходном изображении, из-за грубой природы вариационного автоэнкодера (VAE), используемого в типичных моделях, обученных на гипермасштабных данных.

‘Аналогично другим генеративным подходам, наш метод может отбрасывать определенные особенности изображения, синтезируя подобную информацию на стороне получателя. В определенных случаях, однако, это может привести к неточной реконструкции, такой как изгиб прямых линий или искажение границы небольших объектов. ‘

‘Эти хорошо известные проблемы основной модели, на которой мы основываемся, можно отнести к относительно низкому размеру особенностей ее VAE.’

Хотя это имеет некоторые последствия для художественных изображений и достоверности повседневных фотографий, это может иметь более критическое влияние в случаях, когда небольшие детали составляют важную информацию, такую как доказательства для судебных дел, данные для распознавания лиц, сканирование для оптического распознавания символов (OCR) и широкий спектр других возможных случаев использования, в случае популяризации кодека с этой возможностью.

На этой ранней стадии развития ИИ-усиленного сжатия изображений все эти возможные сценарии находятся в далеком будущем. Однако хранение изображений является глобальной проблемой, затрагивающей вопросы хранения данных, потоковой передачи и потребления электроэнергии, помимо других проблем. Следовательно, сжатие на основе ИИ может предложить заманчивый компромисс между точностью и логистикой. История показывает, что лучшие кодеки не всегда выигрывают самую широкую базу пользователей, когда вопросы, такие как лицензирование и захват рынка проприетарными форматами, являются факторами принятия.

Disney уже давно экспериментирует с машинным обучением в качестве метода сжатия. В 2020 году один из исследователей новой статьи участвовал в проекте на основе VAE для улучшения сжатия видео.

Новая статья Disney была обновлена в начале октября. Сегодня компания выпустила сопровождающее видео на YouTube. Проект называется Потерянное сжатие изображений с помощью основанных на диффузии моделей, и исходит от четырех исследователей из ETH Цюриха (аффилированных с проектами Disney на основе ИИ) и исследовательского центра Disney. Исследователи также предлагают дополнительную статью.

Метод

Новый метод использует VAE для кодирования изображения в его сжатое латентное представление. На этой стадии входное изображение состоит из полученных особенностей – векторных представлений низкого уровня. Латентное вложение затем квантуется обратно в битовый поток и обратно в пространство пикселей.

Это квантованное изображение затем используется в качестве шаблона для шума, который обычно запускает диффузионное изображение, с переменным количеством шагов денойзинга (при которых часто существует компромисс между увеличением шагов денойзинга и большей точностью, и меньшей задержкой и большей эффективностью).

Схема нового метода сжатия Disney.

Схема нового метода сжатия Disney.

И параметры квантования, и общее количество шагов денойзинга можно контролировать в новой системе, посредством обучения нейронной сети, которая предсказывает соответствующие переменные, связанные с этими аспектами кодирования. Этот процесс называется адаптивным квантованием, и система Disney использует Entroformer в качестве модели энтропии, которая питает процедуру.

Авторы заявляют:

‘Интуитивно, наш метод учится отбрасывать информацию (через преобразование квантования), которую можно синтезировать во время процесса диффузии. Поскольку ошибки, введенные во время квантования, подобны добавлению шума, и диффузионные модели являются функциональными моделями денойзинга, они могут быть использованы для удаления шума квантования, введенного во время кодирования.’

Stable Diffusion V2.1 является диффузионным основанием для системы, выбранным потому, что весь код и базовые веса являются общедоступными. Однако авторы подчеркивают, что их схема применима к более широкому кругу моделей.

Ключевым моментом экономики процесса является предсказание временных шагов, которое оценивает оптимальное количество шагов денойзинга – баланс между эффективностью и производительностью.

Предсказания временных шагов, с оптимальным количеством шагов денойзинга, указанным красной границей. Пожалуйста, обратитесь к исходному PDF для точного разрешения.

Предсказания временных шагов, с оптимальным количеством шагов денойзинга, указанным красной границей. Пожалуйста, обратитесь к исходному PDF для точного разрешения.

Количество шума в латентном вложении необходимо учитывать при предсказании лучшего количества шагов денойзинга.

Данные и тесты

Модель была обучена на наборе данных Vimeo-90k. Изображения были случайно обрезаны до 256x256px для каждого эпохи (т.е. каждой полной ингестии уточненного набора данных моделью обучения).

Модель была оптимизирована за 300 000 шагов при скорости обучения 1e-4. Это наиболее распространенный среди проектов компьютерного зрения, и также самый низкий и наиболее тонкий обычно практикуемый значение, как компромисс между широкой обобщаемостью концепций и особенностей набора данных, и способностью к воспроизведению мелких деталей.

Авторы комментируют некоторые логистические соображения для экономически эффективной системы*:

‘Во время обучения слишком дорого обратно пропагандировать градиент через несколько проходов диффузионной модели, когда она работает во время DDIM выборки. Следовательно, мы выполняем только одну итерацию DDIM и直接 используем ее в качестве полностью денойзированных данных.’

Наборы данных, использованные для тестирования системы, были Kodak; CLIC2022; и COCO 30k. Набор данных был предварительно обработан в соответствии с методологией, изложенной в предложении Google 2023 года Многообразное сжатие изображений с условным генератором.

Использованные метрики были Пиковая отношение сигнал-шум (PSNR); Изученные перцептивные метрики сходства (LPIPS); Мультимасштабный индекс структурного сходства (MS-SSIM); и Расстояние Фреше-Инсепшн (FID).

Конкурирующие предыдущие рамки были разделены между старыми системами, которые использовали генеративные противостоящие сети (GAN), и более недавними предложениями, основанными на диффузионных моделях. Системы GAN, протестированные, были Высокочетвертное генеративное сжатие изображений (HiFiC); и ILLM (который предлагает некоторые улучшения над HiFiC).

Диффузионные системы были Потерянное сжатие изображений с помощью условных диффузионных моделей (CDC) и Высокочетвертное сжатие изображений с помощью генеративных моделей на основе оценки (HFD).

Количественные результаты против предыдущих рамок на различных наборах данных.

Количественные результаты против предыдущих рамок на различных наборах данных.

Для количественных результатов (визуализированных выше) исследователи заявляют:

‘Наш метод устанавливает новый уровень реализма реконструированных изображений, превосходя все базовые модели в кривых FID-битрейта. В некоторых метриках искажения (именно, LPIPS и MS-SSIM) мы превосходим все диффузионные кодеки, оставаясь конкурентоспособными с наиболее высокопроизводительными генеративными кодеками.

‘Как ожидается, наш метод и другие генеративные методы страдают при измерении в PSNR, поскольку мы отдаем предпочтение перцептивно приятным реконструкциям вместо точного воспроизведения деталей.’

Для пользовательского исследования был использован метод двухальтернативного принудительного выбора (2AFC), в турнирном контексте, где предпочитаемые изображения переходят к последующим раундам. Исследование использовало систему рейтинга Эло, первоначально разработанную для шахматных турниров.

Следовательно, участники просматривали и выбирали лучшее из двух представленных 512x512px изображений среди различных генеративных методов. Дополнительный эксперимент был проведен, в котором все сравнения изображений от одного и того же пользователя были оценены через симуляцию Монте-Карло за 10 000 итераций, с медианным баллом, представленным в результатах.

Оцененные рейтинги Эло для пользовательского исследования, с турнирами Эло для каждого сравнения (слева) и также для каждого участника, с более высокими значениями лучше.

Оцененные рейтинги Эло для пользовательского исследования, с турнирами Эло для каждого сравнения (слева) и также для каждого участника, с более высокими значениями лучше.

Здесь авторы комментируют:

‘Как можно увидеть в рейтингах Эло, наш метод значительно превосходит все остальные, даже по сравнению с CDC, который в среднем использует вдвое больше бит, чем наш метод. Это остается верным независимо от стратегии турнира Эло, используемой.’

В исходной статье, а также в дополнительном PDF, авторы предоставляют дальнейшие визуальные сравнения, одно из которых показано ранее в этой статье. Однако из-за гранулярности различий между образцами мы отсылаем читателя к исходному PDF, чтобы эти результаты могли быть оценены справедливо.

Статья заключается, отметив, что предложенный метод работает в два раза быстрее, чем конкурирующий CDC (3,49 против 6,87 секунд соответственно). Он также отмечает, что ILLM может обработать изображение за 0,27 секунды, но эта система требует обременительного обучения.

Вывод

Исследователи из ETH/Disney четко заявляют в заключении статьи о потенциале своей системы для генерации ложных деталей. Однако ни один из образцов, представленных в материалах, не фокусируется на этой проблеме.

Вполне справедливо, эта проблема не ограничивается новым подходом Disney, но является неизбежным побочным эффектом использования диффузионных моделей – изобретательной и интерпретативной архитектуры – для сжатия изображений.

Интересно, что всего пять дней назад два других исследователя из ETH Zurich опубликовали статью, озаглавленную Условные галлюцинации для сжатия изображений, которая изучает возможность «оптимального уровня галлюцинации» в системах сжатия изображений на основе ИИ.

Авторы там утверждают, что желательно иметь галлюцинации, когда область достаточно общая (и, возможно, «безвредная»):

‘Для текстурного контента, такого как трава, веснушки и каменные стены, генерация пикселей, которые реалистично соответствуют данной текстуре, более важна, чем восстановление точных значений пикселей; генерация любого образца из распределения текстуры обычно достаточна.’

Таким образом, эта вторая статья делает случай для сжатия, которое должно быть оптимально «креативным» и представительным, а не точно восстанавливать исходное несжатое изображение.

Интересно, что фотографическое и творческое сообщество отреагирует на это довольно радикальное переопределение «сжатия».

 

*Мое преобразование внутренних цитат авторов в гиперссылки.

Опубликовано впервые в среду, 30 октября 2024 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai