Anderson의 관점
인간의 주의력을 활용하여 AI 생성 이미지 개선 가능

중국에서 새로운 연구가提出されており, Latent Diffusion Models (LDMs) 모델인 Stable Diffusion의 이미지 품질을 개선하는 방법을 제안하였다.
이 방법은 이미지의 중요한 영역을 최적화하는 데 중점을 둔다. 이러한 영역은 인간의 주의를 끄는 영역이다.

새로운 연구에 따르면, saliency maps (왼쪽에서 네 번째 열)는 denoising 과정에서 인간이 주의를 집중하는 이미지 영역으로 주의를 끌기 위한 필터 또는 ‘마스크’로 사용될 수 있다. 출처: https://arxiv.org/pdf/2410.10257
전통적인 방법은 이미지 전체를 균일하게 최적화한다. 그러나 새로운 접근 방식은 saliency detector를 사용하여 이미지의 더 ‘중요한’ 영역을 식별하고 우선순위를 지정한다.
양적 및 질적 테스트에서, 연구자의 방법은 이전의 확산 기반 모델보다 이미지 품질과 텍스트 프롬프트에 대한 충실도에서 우수한 성능을 보였다.
새로운 접근 방식은 또한 100명의 참가자가 참여한 인간 인식 테스트에서 최고의 성적을 거두었다.
자연 선택
Saliency, 즉 실제 세계와 이미지에서 정보를 우선순위로 하는 능력은 인간 시각의 필수적인 부분이다.
예를 들어, 고전적인 예술 작품에서는 중요한 영역에 더 많은 주의를 기울인다. 예를 들어, 초상화에서는 얼굴에, 해상 주제에서는 배의 마스트에 더 많은 주의를 기울인다. 이러한 예에서, 예술家的 주의는 중심 주제에 집중되므로, 배경이나 먼 물결과 같은 광범위한 세부 사항은 더粗略하게 표현된다.
인간 연구에 기반한 기계 학습 방법은 지난 10년 동안 개발되어 이미지의 주요 관심 영역을 식별할 수 있다.

객체 분할 (semantic segmentation)은 이미지의 특징을 식별하고 해당 saliency maps를 개발하는 데 도움이 될 수 있다. 출처: https://arxiv.org/pdf/1312.6034
최근 5년 동안 가장 인기 있는 saliency map detector는 2016년의 Gradient-weighted Class Activation Mapping (Grad-CAM)이다. 이는 이후 개선된 Grad-CAM++ 시스템으로 발전하였다.
Grad-CAM은 의미적인 토큰 (예: ‘dog’ 또는 ‘cat’)의 gradient activation을 사용하여 이미지에서 해당 개념이나 주석이 나타날 가능성이 높은 시각적 맵을 생성한다.

원래 Grad-CAM 논문에서 예시. 출처: https://arxiv.org/pdf/1610.02391
이러한 방법으로 얻어진 결과는 인간의 주의와 일치한다.
SGOOL
새로운 논문은 SGOOL을 제안한다. SGOOL은 Stable Diffusion과 같은 텍스트-이미지 (또는 텍스트-비디오) 시스템에서 saliency를 적용하여 이미지 품질을 개선하는 방법이다.
사용자의 텍스트 프롬프트를 해석할 때, Latent Diffusion Models는 훈련된 잠재 공간을 탐색하여 사용자의 텍스트 프롬프트와 일치하는 시각적 개념을 찾는다. 그런 다음 이러한 데이터 포인트를 denoising 과정으로 처리하여 사용자의 텍스트 프롬프트를 창의적으로 해석한다.
그러나 이 과정에서 모델은 이미지의 모든 부분에 동일한 주의를 기울인다. 2022년 OpenAI의 Dall-E 이미지 생성기와 Stability.ai의 Stable Diffusion 프레임워크가 공개된 이후, 사용자들은 ‘중요한’ 이미지 영역이 종종 부족하다는 것을 발견하였다.
일반적인 이미지에서, 사람의 얼굴은 전체 이미지의 10~35%를 차지할 뿐이다. 이러한 민주적인 주의 분배 방법은 인간의 인식과 예술 및 사진의 역사에 반한다.
연구자들은 새로운 방법을 제안하였다. 이 방법은 saliency mapper를 사용하여 이미지의 중요 영역에 더 많은 주의를 기울인다.
방법
SGOOL 파이프라인에는 이미지 생성, saliency mapping, 및 최적화가 포함된다.

SGOOL 개념 스키마.
확산 모델의 잠재 임베딩은 직접 최적화되며, 이는 별도의 모델을 훈련할 필요가 없다. Stanford University의 Denoising Diffusion Implicit Model (DDIM) 샘플링 방법은 Stable Diffusion 사용자에게 친숙한 방법으로, saliency maps를 통합한다.
논문은 다음과 같이述한다:
‘우리는 먼저 saliency detector를 사용하여 인간의 시각적 주의 시스템을 모방하고, salient 영역을 표시한다. 추가 모델을 훈련할 필요가 없도록, 우리의 방법은 직접 확산 잠재 변수를 최적화한다. ‘
‘또한, SGOOL은 가역적인 확산 과정을 사용하며, 이는 상수 메모리 구현의 장점을 제공한다. 따라서, 우리의 방법은 매개 변수 효율적인 플러그 앤 플레이 최적화 방법이 된다. 광범위한 실험을 수행하였으며, 여러 지표와 인간 평가를 통해 검증하였다.’
데이터 및 테스트
SGOOL을 테스트하기 위해, 연구자들은 ‘바닐라’ Stable Diffusion V1.4와 CLIP 가이드를 사용한 Stable Diffusion을 사용하였다.
시스템은 세 가지 공개 데이터셋을 사용하여 평가되었다: CommonSyntacticProcesses (CSP), DrawBench, 및 DailyDallE*.
각 데이터셋은 다양한 프롬프트와 이미지로 구성되어 있다.
테스트에서, CLIP 모델은 ViT/B-32를 사용하여 이미지와 텍스트 임베딩을 생성하였다. 동일한 프롬프트와 랜덤 시드를 사용하였다. 출력 크기는 256×256이었으며, TransalNet의 기본 가중치와 설정을 사용하였다.
CLIP 점수 지표 외에도, 인간 선호도 점수 (HPS)가 사용되었다. 또한 100명의 참가자가 참여한 실제 연구가 수행되었다.

SGOOL과 이전 구성의 양적 결과 비교.
논문은 다음과 같이述한다:
‘우리의 모델은 모든 데이터셋에서 SD와 Baseline보다 CLIP 점수와 HPS에서 유의하게 더 나은 성능을 보였다. 우리 모델의 평균 CLIP 점수와 HPS는 두 번째로 높은 모델보다 각각 3.05와 0.0029 더 높다.’
결론
Stable Diffusion의 한계가 나타난 직후, 다양한 방법이 등장하여 시스템이 인간의 관심을 끄는 영역에 더 많은 주의를 기울이도록 강제하였다.
그러나 이러한 접근 방식은 확산 시스템이 먼저 정상적인 과정으로 모든 이미지 부분에 동일한 주의를 기울인 후, 추가 단계에서 더 많은 작업을 수행해야 한다.
SGOOL의 증거는 기본적인 인간 심리학을 이미지 섹션의 우선순위에 적용하여 초기 추론을 크게 향상시킬 수 있으며, 후처리 단계가 필요하지 않음을 시사한다.
* 이 논문은 CommonSyntacticProcesses와 동일한 링크를 제공한다.
最初에 2024년 10월 16일에 게시되었습니다.












