Kąt Andersona

Wykorzystanie sztucznej inteligencji do poprawy zdjęć przed ich wykonaniem

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

Zamiast używać GenAI do poprawy zdjęć po ich wykonaniu, naukowcy opracowali system, który informuje, jak się poruszać, pozować i kadrować zdjęcie wcześniej, wykorzystując wiedzę na temat tego, co sprawia, że zdjęcia są zapamiętywane.

 

Poprawa zdjęć po wykonaniu stała się łatwiejsza, ponieważ producenci i platformy technologiczne coraz częściej oferują edycję w kamerze, która pozwala użytkownikom na zmianę zdjęć zaraz po ich wykonaniu. Popularne systemy tego rodzaju obejmują conversational editing Google’ a oraz generative edit Samsunga, wśród innych.

Jednakże nowy trend, który faworyzuje “autentyczność” nad wynikami “poprawionymi” przez sztuczną inteligencję, może oznaczać, że wiele konsumentów, których dotyczą te systemy, zacznie uważać zdjęcia “zmienione” za AI slop.

Może to było inspiracją dla Google, aby stworzyć szkolenie z wykorzystaniem sztucznej inteligencji, które jest w stanie udzielać bezpośrednich wskazówek, jak poprawić zdjęcie podczas procesu jego wykonania:

Google's Camera Coach informuje użytkownika, jak reframować zdjęcie, wśród innych podstawowych wskazówek. Źródło: https://store.google.com/intl/en_uk/ideas/articles/camera-coach/

Google’s Camera Coach informuje użytkownika, jak reframować zdjęcie, wśród innych podstawowych wskazówek. Źródło

Jako system własny, z praktycznie żadnymi informacjami dostępnymi online, Camera Coach wydaje się wykorzystywać Gemini, aby pomóc użytkownikom poprawić kadrowanie (patrz zdjęcie powyżej) lub wprowadzić niewielkie zmiany w pozycji (takie jak przesunięcie bliżej siebie lub spojrzenie prosto w kamerę).

W przeciwieństwie do logiki, która leży u podstaw Camera Coach, naukowcy poszukiwali bardziej subtelnych interpretacji:

‘W przeciwieństwie do korekcji fotograficznych, które koncentrują się na poprawkach po wykonaniu zdjęcia (np. “zrób zdjęcie jaśniejsze”), koncentrujemy się na semantycznych działaniach, które użytkownik może wykonać na żywo, aby uzyskać lepsze zdjęcie, np. “Zwróć się do siebie”.’

Nowy artykuł zatytułowany Jak zrobić zapamiętywalne zdjęcie? Udzielanie użytkownikom aktywnych wskazówek pochodzi od czterech naukowców z Uniwersytetu w Trydencie, Uniwersytetu w Pizie i Fondazione Bruno Kessler.

Strona projektu MemCoach sugeruje, że kod GitHub i dane hostowane przez Hugging Face będą dostępne w przyszłym miesiącu (marzec 2026).

Metoda

Aby opracować zestaw danych MemBench z zestawu portretowego PPR10K, naukowcy pogrupowali zdjęcia z tego samego scenariusza i ocenili każde zdjęcie pod kątem zapamiętywalności, wykorzystując przeszkolony predyktor oparty na CLIP cechach.

Flux Capacitor

Aby ocenić, czy zapamiętywalność została zwiększona dzięki wskazówkom, symulowano zgodność użytkownika za pomocą modelu generatywnego FLUX.1 Kontext jako proxy dla fotografa.

Stan sztuki

Świadomość zapamiętywalności bieżących wielomodalnych dużych modeli językowych została przetestowana.

MemCoach

MemCoach koncentruje się na semantycznych, na-żywo instrukcjach, które mogą być wykonane przed naciśnięciem spustu migawki – na przykład, dostosowując pozę, zmieniając interakcje między osobami lub modyfikując elementy sceny.

Testy

Siedem wielomodalnych dużych modeli językowych (MLLM) zostało wykorzystanych w fazie testowej dla nowego systemu:

Wyniki wskazują, że MemCoach dostarcza bardziej skuteczne wskazówki dotyczące zapamiętywalności niż jakikolwiek z porównywanych modeli.

Wnioski

Bardzo byłoby interesujące porównać metodologię zamkniętego podejścia Google z projektem MemBench – nie tylko po to, aby wiedzieć, jakie standardy, odniesienia i bazy danych Google wykorzystał do określenia standardów estetycznych systemu.

Negatywnym aspektem systemów tego rodzaju, otwartych lub zamkniętych, jest to, że w skali masowej ryzykują one narzucenie jednolitych standardów, które skazane są na to, aby stać się memami i kliszami – rodzajem wizualnego odpowiednika debatach AI em-dash, w których “poprawna” procedura stała się nieco przeklęta w codziennym użyciu.

Artykuł odnosi się tutaj, jak i w innych miejscach, do “materiałów uzupełniających”, których nie mogłem znaleźć, ani w artykule, ani w podstawowym wykazie Arxiv, ani na stronie projektu.

Pierwotnie opublikowane w czwartek, 26 lutego 2026

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai