Взгляд Anderson

Использование ИИ для улучшения реальных фотографий до их съёмки

mm
Добавьте Unite.AI в избранные источники в Google
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

Вместо использования GenAI для исправления фотографий после их съёмки, исследователи разработали систему, которая подсказывает, как двигаться, позировать и кадрировать сцену до съёмки, используя изученные знания о том, что делает фотографии запоминающимися.

 

Исправление фотографий после съёмки стало проще с течением времени, поскольку производители и технологические платформы все чаще предлагают редактирование в камере, позволяющее пользователям изменять изображения сразу после съёмки. Популярные системы этого типа включают конверсационное редактирование Google и генеративное редактирование Samsung, среди других.

Однако, новая тенденция, которая отдает предпочтение ‘аутентичности’ над результатами, улучшенными с помощью ИИ, может означать, что многие потребители, на которых ориентированы такие системы, начинают считать ‘измененные’ фотографии мусором ИИ.

Возможно, это вдохновило Google на создание ИИ-обучаемого ‘камерного тренера’, информированного Gemini, который способен давать прямые инструкции для улучшения фотографии во время съёмки:

Камерный тренер Google подсказывает пользователю, как перекадрировать фотографию, среди других基本ных советов. Источник: https://store.google.com/intl/en_uk/ideas/articles/camera-coach/

Камерный тренер Google подсказывает пользователю, как перекадрировать фотографию, среди других基本ных советов. Источник

Будучи проприетарной системой, и с практически нулевой информацией, доступной в Интернете, Камерный тренер, по-видимому, использует Gemini для помощи пользователям в улучшении кадрирования (см. изображение выше) или для внесения незначительных изменений в позу (например, приближаясь ближе друг к другу или глядя прямо в камеру).

Итак, насколько можно судить, продукт толкает композицию к медиане, предположительно на основе миллионов загруженных данных, которые, вероятно, внесли свой вклад в обучающие данные Gemini. В этом смысле загружающие пользователи создали калибровку ИИ, отвергая неудовлетворительные снимки и загружая те, которые им нравятся – эффективную (и бесплатную) форму кураторства набора данных!

Это говорит о том, что фотографии, которые усреднены в плане композиции, не обязательно обладают теми же эстетическими ценностями или воздействием на зрителя, как фотографии, которые запоминаются.

За пределами ‘Сыра!’ и правила третей

Для этого, и для создания системы, более доступной на различных платформах, новые исследования из Италии предлагают систему Coach, основанную на предварительных знаниях о том, что делает фотографии запоминающимися:

Разнообразные примеры советов из новой системы авторов. Источник - https://arxiv.org/pdf/2602.21877

Разнообразные примеры советов из новой системы авторов. Источник

В примерах выше мы видим советы, данные новой системой авторов – названной MemCoach – которую трудно представить, что композиционно-ориентированный ИИ, такой как Камерный тренер, мог бы предоставить. В первом (левом) случае совет удалить головной убор особенно спекулятивен; во втором изображении трудно представить, какой контекст композиционно-ориентированный ИИ мог бы извлечь из общей ситуации (т.е. ‘художественного’ изображения молодой женщины, лежащей на полу с закрытыми глазами).

Основное понимание о запоминаемости в фотографии, используемое для разработки трехчастной итальянской системы, основано на различных предыдущих работах, включая работу 2015 года о том, что делает объект запоминающимся, и работу 2013 года о том, что делает фотографию запоминающейся.

Из работы 2013 года 'Что делает фотографию запоминающейся?', представительные примеры хороших, средних и плохих фотографий в плане запоминаемости. Источник - https://people.csail.mit.edu/torralba/publications/Isola_memorabilityPhotos_PAMI2014.pdf

Из работы 2013 года ‘Что делает фотографию запоминающейся?’, представительные примеры хороших, средних и плохих фотографий в плане запоминаемости. Источник

Любой, как и я, с отрицательной датой рождения Unix, вероятно, узнает шаблон для ‘наименее запоминающихся изображений’ (вверху справа на изображении выше), из бесконечных вечеров слайд-шоу, которые проклинали наше детство. Как говорят авторы*:

‘Эти работы определили ключевые внутренние факторы, такие как присутствие людей, интерьерные сцены или эмоциональные выражения, а не объекты и панорамные виды, а также внешние факторы, включая контекст и наблюдателя.’

Проект центрируется на ‘обратной связи о запоминаемости’ (MemFeed), которая выражается в приложении-наставнике MemCoach, и эталоне (названном MemBench) на основе набора данных PPR10K.

Из работы PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, разнообразные примеры из набора данных. Верхний ряд показывает исходные изображения, нижний ряд показывает экспертно-отредактированные версии вместе с соответствующими масками области человека. Исходные фотографии сильно различаются по точки зрения, фону, освещению и настройкам камеры, тогда как отредактированные результаты демонстрируют улучшенное визуальное качество и более сильную последовательность внутри каждой группы. Источник - https://arxiv.org/pdf/2105.09180

Из работы PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, разнообразные примеры из набора данных. Верхний ряд показывает исходные изображения, нижний ряд показывает экспертно-отредактированные версии вместе с соответствующими масками области человека. Исходные фотографии сильно различаются по точки зрения, фону, освещению и настройкам камеры, тогда как отредактированные результаты демонстрируют улучшенное визуальное качество и более сильную последовательность внутри каждой группы. Источник

Работа отмечает, что запоминаемость является количественной величиной в фотографиях, а не регистром субъективных суждений, и авторы进一步 отмечают, что это свойство было определено как для фотографий (в различных работах) и видео (в различных других).

Новая работа названа Как сделать запоминающуюся фотографию? Вдохновляя пользователей с помощью действенной обратной связи, и исходит от четырех исследователей из Университета Тренто, Университета Пизы и Фонда Бруно Келлер. Сопровождающая страница проекта предполагает, что код GitHub и данные, размещенные на Hugging Face, будут доступны в следующем месяце (март 2026).

Метод

Для создания набора данных MemBench из исходного набора данных портретов PPR10K исследователи сгруппировали фотографии из одной и той же сцены и оценили каждое изображение по запоминаемости с помощью обученного предсказателя на основе CLIP фичей. Затем они ранжировали фотографии внутри каждой сцены от менее запоминающихся до более запоминающихся и объединили их соответственно:

Обзор конструкции MemBench и его оценки. Верхний ряд изображает конвейер данных, от группировки изображений по сцене и предсказания запоминаемости до ранжирования фотографий и генерации обратной связи, осведомленной о запоминаемости. Нижний ряд иллюстрирует оценку, измеряющую качество обратной связи через редактирование, основанное на запоминаемости, и оценку perplexity.

Обзор конструкции MemBench и его оценки. Верхний ряд изображает конвейер данных, от группировки изображений по сцене и предсказания запоминаемости до ранжирования фотографий и генерации обратной связи, осведомленной о запоминаемости. Нижний ряд иллюстрирует оценку, измеряющую качество обратной связи через редактирование, основанное на запоминаемости, и оценку perplexity.

Для каждой пары были сгенерированы естественно-языковые описания с помощью модели InternVL3.5, чтобы объяснить видимые различия между менее запоминающейся версией и более запоминающейся версией; и эти описания составили обучающий сигнал для системы обратной связи о запоминаемости.

В отличие от логики, лежащей в основе Камерного тренера Google, исследователи стремились к более тонкому набору интерпретаций:

‘В отличие от вычислительной фотографии, корректирующей ошибки после съёмки (например, “сделать изображение ярче”), мы фокусируемся на семантических действиях, которые пользователь может выполнить на лету для лучшего снимка, например, “Лицом к друг другу”.’

Окончательная коллекция MemBench состоит из около 10 000 изображений, сгруппированных в 1 570 сцен, в среднем 6,5 изображений на сцену. Облако слов, сгенерированное авторами (см. изображение ниже), предполагает широкий спектр семантических категорий в наборе данных:

Облако слов наиболее частых терминов в MemBench.

Облако слов наиболее частых терминов в MemBench.

Исходные фотографии в среднем имели балл запоминаемости 0,63, тогда как наиболее запоминающиеся снимки из одной и той же сцены варьировались от 0,51 до 1,0, с заметным перекрытием между двумя группами:

Распределения баллов запоминаемости, сравнивающие наименее и наиболее запоминающиеся изображения внутри каждой сцены.

Распределения баллов запоминаемости, сравнивающие наименее и наиболее запоминающиеся изображения внутри каждой сцены.

Сама обратная связь варьировалась от коротких семизначных заметок до заметно более длинных инструкций (слева на изображении ниже). Каждый совет затем разбивался на небольшие типы действий с помощью GPT-5 Mini (справа на изображении ниже):

Распределение длины обратной связи, измеренной в содержательных словах, и категоризация атомарных под-действий с помощью аккордовых ширин, указывающих частоту совместного появления между категориями.

Распределение длины обратной связи, измеренной в содержательных словах, и категоризация атомарных под-действий с помощью аккордовых ширин, указывающих частоту совместного появления между категориями.

Авторы отмечают, что большинство предложений фокусировались на том, как была позирована модель, за которыми следовали изменения смысла или содержания сцены, а кадрирование часто было связано с позированием, а коррекция освещения часто была связана с семантическими изменениями.

Флукс-капаситор

Для оценки того, увеличивает ли обратная связь запоминаемость, была смоделирована комплаентность пользователя с помощью генеративной модели FLUX.1 Kontext в качестве замены фотографа. Учитывая исходное изображение и текстовую обратную связь, была сгенерирована отредактированная версия с помощью Flux, которая模улировала предложенные изменения:

Изображения слева являются реальными, из набора данных, и изображения справа (в каждом случае) созданы с помощью Flux на основе подсказки (в желтом, ниже). Таким образом, эффективность подсказок могла быть оценена без обширного участия человека. Это знание будет возвращено в конечном итоге в рамки MemCoach, и на самом деле представляет собой рабочий процесс, который может итеративно улучшать систему такого типа (т.е. в конечном итоге с реальными, а не Flux-примерами).

Изображения слева являются реальными, из набора данных, и изображения справа (в каждом случае) созданы с помощью Flux на основе подсказки (в желтом, ниже). Таким образом, эффективность подсказок могла быть оценена без обширного участия человека. Это знание будет возвращено в конечном итоге в рамки MemCoach, и на самом деле представляет собой рабочий процесс, который может итеративно улучшать систему такого типа (т.е. в конечном итоге с реальными, а не Flux-примерами).

И исходные, и отредактированные изображения затем передавались через предсказатель запоминаемости, что позволяло измерить, как часто отредактированная версия достигала более высокого балла – обозначаемого как Коэффициент улучшения – и насколько большой была эта выгода по сравнению с исходным изображением, обозначаемой как Относительная запоминаемость.

Аналогично, подобие обратной связи о запоминаемости была измерена путем расчета perplexity против реальных описаний, и 80–20 раздел был применен на уровне сцены, чтобы тестирование проводилось только на сценах, которые не использовались во время обучения.

Современное состояние

Была протестирована осведомленность о запоминаемости текущих многомодальных крупномасштабных языковых моделей. Изображения из набора данных LaMem были показаны ведущим моделям, которые были попросены определить, является ли изображение запоминающимся. Оценка уверенности модели затем сравнивалась с баллами, присвоенными человеческими наблюдателями в исходном исследовании:

Тесты, указывающие на то, что базовые многомодальные модели не отражают запоминаемость. Слева, ранговая корреляция Спирмана между предсказаниями модели и реальными баллами LaMem, с межаннотаторным согласием из LaMem, показанным для справки. Справа, коэффициент улучшения, достигнутый нулевой обратной связью по сравнению с редактированием, показывающий только незначительные выигрыши.

Тесты, указывающие на то, что базовые многомодальные модели не отражают запоминаемость. Слева, ранговая корреляция Спирмана между предсказаниями модели и реальными баллами LaMem, с межаннотаторным согласием из LaMem, показанным для справки. Справа, коэффициент улучшения, достигнутый нулевой обратной связью по сравнению с редактированием, показывающий только незначительные выигрыши.

Почти не было найдено значимой корреляции с человеческими суждениями, и, несмотря на крупномасштабное предварительное обучение, авторы утверждают, что модели не отслеживали то, что люди постоянно запоминают.

Примеры из набора данных LaMem. В верхнем левом углу также показана карта тепла для этого изображения. Источник - http://memorability.csail.mit.edu/explore.html

Примеры из набора данных LaMem. В верхнем левом углу также показана карта тепла для этого изображения. Источник

MemCoach

MemCoach фокусируется на семантических, на-лету инструкциях, которые могут быть выполнены до нажатия затвора – например, корректировка позы, изменение взаимодействия между моделями или изменение элементов сцены. Обратная связь, предоставляемая MemCoach, варьируется от 7 до 102 содержательных слов. Запоминаемость, как утверждает работа, кажется, обусловлена больше конфигурацией модели и повествовательными сигналами, чем простыми композиционными корректировками:

Обзор конвейера MemCoach, в котором осведомленная о запоминаемости обратная связь от учителя МЛЛМ объединяется с нейтральными ответами ученика для формирования контрастных данных; различия активаций по слоям усредняются для получения вектора управления запоминаемостью; и этот вектор вводится на этапе вывода для сдвига активаций ученика в сторону генерации улучшенной, ориентированной на запоминаемость обратной связи без дополнительного обучения.

Обзор конвейера MemCoach, в котором осведомленная о запоминаемости обратная связь от учителя МЛЛМ объединяется с нейтральными ответами ученика для формирования контрастных данных; различия активаций по слоям усредняются для получения вектора управления запоминаемостью; и этот вектор вводится на этапе вывода для сдвига активаций ученика в сторону генерации улучшенной, ориентированной на запоминаемость обратной связи, без дополнительного обучения.

Тесты

В фазе тестирования для новой системы было использовано семь многомодальных крупномасштабных языковых моделей (МЛЛМ): Qwen2.5V.L; InternVL3_5-8B; Idefics3-8B; и LLaVA-OneVision-1.5. Кроме того, был включен GPT-5 Mini в качестве представителя проприетарных, закрытых моделей, а также модели, специализирующиеся на эстетике, Q-Instruct и AesExpert. МЛЛМ работали в качестве нулевой обратной связи и в качестве учителя или оракула.

InternVL3.5 использовался для обоих моделей учителя и ученика, и раздел MemBench использовался для создания контрастных примеров:

Производительность MemCoach по сравнению с современными МЛЛМ через учителя-оракула, модели, специализирующиеся на эстетике, и нулевую обратную связь, показывающая более высокий коэффициент улучшения и конкурентную относительную запоминаемость, а также наименьшую perplexity, указывающую на более последовательную и ориентированную на запоминаемость обратную связь.

Производительность MemCoach по сравнению с современными МЛЛМ через учителя-оракула, модели, специализирующиеся на эстетике, и нулевую обратную связь, показывающая более высокий коэффициент улучшения и конкурентную относительную запоминаемость, а также наименьшую perplexity, указывающую на более последовательную и ориентированную на запоминаемость обратную связь.

В таблице первого теста (показано выше) мы видим, что MemCoach, по-видимому, обеспечивает более эффективную обратную связь о запоминаемости, чем любая из сравниваемых моделей – и что управляемая модель InternVL3.5 повышает запоминаемость чаще и на большую величину, с 5% увеличением коэффициента улучшения по сравнению с GPT-5 Mini и 31,81% увеличением относительной запоминаемости по сравнению с неуправляемой версией.

Он также превосходит системы, ориентированные на эстетику, не требуя дополнительного обучения. Более низкая perplexity, по мнению авторов, еще больше указывает на то, что его обратная связь следует тем же лингвистическим закономерностям, которые человеческие суждения о запоминаемости обычно вознаграждают:

Результаты обобщения, показывающие, что MemCoach улучшает обратную связь, ориентированную на запоминаемость, на нескольких многомодальных задних концах, последовательно повышая коэффициент улучшения и относительную запоминаемость, а также снижая perplexity для большинства моделей.

Результаты обобщения, показывающие, что MemCoach улучшает обратную связь, ориентированную на запоминаемость, на нескольких многомодальных задних концах, последовательно повышая коэффициент улучшения и относительную запоминаемость, а также снижая perplexity для большинства моделей.

Дополнительный тест (см. таблицу выше) указывает на то, что добавление MemCoach повысило обратную связь, ориентированную на запоминаемость, на каждом из протестированных многомодальных задних концов, с последовательными выигрышами в коэффициенте улучшения и наибольшими скачками, появляющимися для Qwen2.5VL и LLaVA-OV.

Был проведен качественный анализ, в котором были проанализированы примеры обратной связи MemCoach, где исходное изображение, естественно-языковая инструкция и представленное улучшенное изображение были рассмотрены бок о бок:

Качественные примеры обратной связи, сгенерированной MemCoach. Каждая тройка показывает исходное изображение, естественно-языковую инструкцию и результирующее отредактированное изображение, с относительной запоминаемостью (RM), указывающей на измеренную изменение. Руководство варьируется от корректировки позы и взгляда до семантических вмешательств, таких как удаление объекта, иллюстрируя как успешные выигрыши, так и случаи, когда удаление необычных элементов снижает запоминаемость.

Качественные примеры обратной связи, сгенерированной MemCoach. Каждая тройка показывает исходное изображение, естественно-языковую инструкцию и результирующее отредактированное изображение, с относительной запоминаемостью (RM), указывающей на измеренную изменение. Руководство варьируется от корректировки позы и взгляда до семантических вмешательств, таких как удаление объекта, иллюстрируя как успешные выигрыши, так и случаи, когда удаление необычных элементов снижает запоминаемость.

Из этих результатов авторы заявляют:

‘Примеры подчеркивают разнообразие предложений, которые предлагает модель, варьирующихся от тонких композиционных корректировок, таких как изменение направления взгляда, позы или положения руки, до семантических вмешательств, включающих удаление объекта или изменение выражения лица. ‘

‘Обратная связь естественно интерпретируема и действенна, выражена в кратких текстовых инструкциях (в основном включающих глаголы “Принести”, “Стоять”, “Удалить”), которые могут быть直接 реализованы, эффективно вербализируя, как сделать запоминающуюся фотографию.’

Заключение

Было бы интересно сравнить методологию закрытого подхода Google с проектом MemBench – не в последнюю очередь, чтобы узнать, какие центральные стандарты, ссылки и базы данных Google использовали для определения стандартов эстетики системы.

Отрицательный аспект систем такого типа, открытых или проприетарных, заключается в том, что они рискуют навязать единые стандарты, которые обречены стать мемами и клише – своего рода визуальным эквивалентом дебатов об ИИ и тире, где ‘правильная’ процедура стала немного проклятой в неформальном использовании.

 

* Мое преобразование внутренних цитат авторов в гиперссылки, если ссылка не представлена в другом месте статьи.

Работа ссылается здесь, как и в нескольких других местах, на ‘дополнительный материал’, который я не смог найти, ни из работы, ни из основного списка Arxiv, ни из сайта проекта.

Опубликовано впервые в четверг, 26 февраля 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai