Anderson의 관점

인공지능을 이용한 인간 이미지 복원 및 편집

mm
Unite.AI를 Google의 선호 소스에 추가
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

캘리포니아 대학교 머세드와 어도비의 새로운 협력은 인간 이미지 완성의最新 기술을 제공합니다. 이는 가려진 또는 숨겨진 이미지의 부분을 복원하는 연구입니다. 이 기술은 가상 시연, 애니메이션 및 사진 편집과 같은 목적으로 사용됩니다.

인간 이미지 완성 시스템인 CompleteMe는 기존 이미지에 새로운 의류를 입히거나 변경할 수 있습니다. 이러한 예제는 새로운 논문의 보충 자료에서 가져왔습니다. 출처: https://liagm.github.io/CompleteMe/pdf/supp.pdf

인간 이미지 완성 시스템인 CompleteMe는 기존 이미지에 새로운 의류를 입히거나 변경할 수 있습니다. 이러한 예제는 새로운 논문의 보충 자료에서 가져왔습니다. 출처: https://liagm.github.io/CompleteMe/pdf/supp.pdf

새로운 접근 방식은 CompleteMe: Reference-based Human Image Completion이라고 불리며, 보충 입력 이미지를 사용하여 시스템에 가려진 또는 숨겨진 이미지 부분을 대체할 내용을 제안합니다.

CompleteMe 시스템은 가려진 또는 숨겨진 이미지 부분에 참조 내용을 적용할 수 있습니다.

CompleteMe 시스템은 가려진 또는 숨겨진 이미지 부분에 참조 내용을 적용할 수 있습니다.

새로운 시스템은 두 개의 U-Net 아키텍처와 Region-Focused Attention(RFA) 블록을 사용하여 이미지 복원 인스턴스의 관련 영역에 리소스를 할당합니다.

연구자들은 또한 참조 기반 완성 작업을 평가하기 위한 새로운 벤치마크 시스템을 제안했습니다. CompleteMe는 기존의 연구 스트림의 일부이지만, 지금까지는 벤치마크 스키마가 없었습니다.

테스트와 사용자 연구에서, 새로운 방법은 대부분의 메트릭에서最高의 성적을 나타내었고, 전체적으로最高의 성적을 나타내었습니다. 어떤 경우에는 이전 방법들이 참조 기반 접근 방식에 의해 완전히 혼동되었습니다.

보충 자료에서: AnyDoor 방법은 참조 이미지를 해석하는 데 어려움을 겪습니다.

보충 자료에서: AnyDoor 방법은 참조 이미지를 해석하는 데 어려움을 겪습니다.

논문은 다음과 같이述합니다:

‘우리의 벤치마크에서 CompleteMe는 참조 기반 및 비참조 기반의 최신 방법들을 모두 능가합니다.

‘특히 복잡한 포즈, 복잡한 의류 패턴 및 특징적인 액세서리와 같은 도전적인 시나리오에서, 우리의 모델은 일관되게 우수한 시각적 충실도와 의미적 일관성을 달성합니다.’

불행히도, 프로젝트의 깃허브 페이지에는 코드가 없으며, 이니셔티브는 소규모 프로젝트 페이지도 가지고 있습니다. 이 프로젝트는 독점 아키텍처로 프레임化되어 있습니다.

새로운 시스템의 주관적인 성능에 대한 추가적인 예입니다. 이 문서의 뒷부분에 자세한 내용이 있습니다.

새로운 시스템의 주관적인 성능에 대한 추가적인 예입니다. 이 문서의 뒷부분에 자세한 내용이 있습니다.

방법

CompleteMe 프레임워크는 참조 U-Net과 일관된 U-Net으로 구성됩니다. 참조 U-Net은 보충 자료를 통합하고, 일관된 U-Net은 더广い 범위의 프로세스를 처리합니다.

CompleteMe의 개념 스키마입니다. 출처: https://arxiv.org/pdf/2504.20042

CompleteMe의 개념 스키마입니다. 출처: https://arxiv.org/pdf/2504.20042

시스템은 먼저 가려진 입력 이미지를 잠재적인 표현으로 인코딩합니다.同時에, 참조 U-Net은 여러 참조 이미지를 처리하여 자세한 공간적 특징을 추출합니다.

이 특징들은 Region-focused Attention 블록을 통해 선택적으로 마스킹되며, 모델이 참조 이미지를 주의깊게 처리하도록 합니다.

마스킹된 특징들은 글로벌 의미적 특징들과 함께 결합되어 이미지의 누락된 부분을 복원합니다.

참조 전용

이전의 참조 기반 이미지 인페인팅 방법들은 일반적으로 의미 수준의 인코더에 의존했습니다. 이러한 프로젝트에는 CLIP과 DINOv2가 포함되며, 참조 이미지를 통해 글로벌 특징을 추출하지만, 자세한 공간적 세부 사항을 잃어버릴 수 있습니다.

DINOv2는 비교 테스트에 사용된 이전 접근 방식입니다. 출처: https://arxiv.org/pdf/2304.07193

DINOv2는 비교 테스트에 사용된 이전 접근 방식입니다. 출처: https://arxiv.org/pdf/2304.07193

CompleteMe는 이러한 문제를 해결하기 위해 Stable Diffusion 1.5에서 초기화된 특수한 참조 U-Net을 사용합니다.

오케스트레이션

일관된 U-Net은 완성 프로세스의 최종 단계를 관리합니다. 이는 Stable Diffusion 1.5의 인페인팅 변형에서 유래되며, 가려진 소스 이미지를 잠재적인 형태로 입력받으며, 참조 이미지를 통해 추출된 자세한 공간적 특징과 글로벌 의미적 특징을 함께 결합합니다.

이러한 입력은 RFA 블록을 통해 통합되며, 모델이 참조 자료의 가장 관련된 영역에 주의를 집중하도록 합니다.

이 통합을 강화하기 위해 CompleteMe는 IP-Adapter 프레임워크에서 유래된 분리된 크로스 어텐션 메커니즘을 포함합니다.

IP-Adapter는 CompleteMe에 통합된 성공적인 프로젝트 중 하나입니다. 출처: https://ip-adapter.github.io/

IP-Adapter는 CompleteMe에 통합된 성공적인 프로젝트 중 하나입니다. 출처: https://ip-adapter.github.io/

이로 인해 모델은 공간적으로 자세한 시각적 특징과 더广い 의미적 컨텍스트를 별도의 어텐션 스트림을 통해 처리할 수 있으며, 이후 결합되어 일관된 재구성을 생성합니다.

벤치마킹

연구자들은 참조 기반 인간 완성 작업을 평가하기 위한 새로운 벤치마크를 제안했습니다. 이 벤치마크는 Adobe Research의 2023 UniHuman 프로젝트에서 개발된 WPose 데이터셋에서 선택된 이미지 쌍을 수집하여 구성되었습니다.

Adobe Research 2023 UniHuman 프로젝트의 예입니다. 출처: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Adobe Research 2023 UniHuman 프로젝트의 예입니다. 출처: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

연구자들은 소스 마스크를 수동으로 그려서 인페인팅 영역을 표시하여 417개의 삼중 이미지 그룹을 얻었습니다.

참조 WPose 데이터셋에서 유래된 이미지 그룹의 두 가지 예입니다.

참조 WPose 데이터셋에서 유래된 이미지 그룹의 두 가지 예입니다.

저자들은 LLaVA 대형 언어 모델을 사용하여 소스 이미지를 설명하는 텍스트 프롬프트를 생성했습니다.

메트릭은 일반적인 것보다 광범위했습니다. PSNR, SSIM, LPIPS와 함께, 연구자들은 DINO를 사용하여 유사성 점수를 계산했습니다. 또한 DreamSim을 사용하여 생성 결과를 평가했습니다.

데이터 및 테스트

저자들은 Stable Diffusion V1.5 모델과 1.5 인페인팅 모델을 사용하여 작업을 테스트했습니다. 시스템의 이미지 인코더는 CLIP 비전 모델과 프로젝션 레이어를 사용했습니다.

训練은 30,000 반복으로 8개의 NVIDIA A100† GPU에서 수행되었습니다. 중간에 다양한 요소를 무작위로 삭제하여 과적합을 방지했습니다.

데이터셋은 Parts to Whole 데이터셋에서 수정되었습니다. 이는 DeepFashion-MultiModal 데이터셋을 기반으로 합니다.

Parts to Whole 데이터셋의 예입니다. 출처: https://huanngzh.github.io/Parts2Whole/

Parts to Whole 데이터셋의 예입니다. 출처: https://huanngzh.github.io/Parts2Whole/

저자들은 다음과 같이述합니다:

‘우리의 요구 사항을 충족하기 위해, 우리는 여러 참조 이미지를 사용하여 인간 외모의 다양한 측면을 캡처한 훈련 쌍을 재구성했습니다.

‘각 샘플에는 상반신 의류, 하반신 의류, 전체 의류, 머리 또는 모자, 얼굴, 신발과 같은 6가지 외모 유형이 포함됩니다. 마스킹 전략으로, 우리는 50%의 무작위 격자 마스킹을 1~30회 적용하고, 나머지 50%에서는 인간 신체 모양 마스크를 사용하여 마스킹 복잡도를 증가시킵니다. ‘

‘파이프라인 구축 후, 우리는 40,000개의 이미지 쌍을 훈련에 사용했습니다.’

이전의 비참조 방법으로 테스트된 것은 Large occluded human image completion(LOHC)와 BrushNet이었습니다. 참조 기반 모델로는 Paint-by-Example, AnyDoor, LeftRefill, MimicBrush가 있었습니다.

저자들은 다음과 같이述합니다:

‘우리는 초기 양적 비교를 수행했습니다. ‘

초기 양적 비교 결과입니다.

초기 양적 비교 결과입니다.

양적 평가에 대해, CompleteMe는 대부분의 감知 메트릭에서最高의 점수를 얻었습니다. 그러나 모든 기준에서 최고의 성적을 얻지는 못했습니다. BrushNet은 CLIP-T에서最高의 점수를 얻었고, LeftRefill은 SSIM과 PSNR에서最高의 점수를 얻었습니다.

CompleteMe는 전반적으로 강한 성적을 보였지만, 일부 경우에는 성능 차이가 미미했습니다. 일부 메트릭은 여전히 이전 방법에 의해 리드되었습니다.

질적 테스트의 일러스트레이션이 너무 많아 여기서 재현하기 어렵습니다. 저자들은 다음과 같이述합니다:

‘가려진 입력이 주어졌을 때, 비참조 방법들은 가려진 영역에 대해妥当한 내용을 생성할 수 있지만, 참조 이미지를 통해 동일한 정보를 재구성하는 데 실패합니다. ‘

‘반면, CompleteMe는 참조 이미지를 통해 가려진 영역을 완성함으로써 동일한 정보를 효과적으로 보존합니다.’

저자들은 15명의 주석자와 2,895개의 샘플 쌍을 사용하여 사용자 연구를 수행했습니다. 각 쌍은 CompleteMe의 출력과 네 가지 참조 기반 베이스라인 중 하나를 비교했습니다.

주석자는 각 결과를 시각적 품질과 참조에서 동일한 정보를 보존하는 정도에 따라 평가했습니다.

사용자 연구 결과입니다.

사용자 연구 결과입니다.

결론

이 연구의 질적 결과는 양적으로 압도적입니다. 새로운 시스템은 가장 효과적인 엔트리입니다.

그러나 질적 결과를 자세히 살펴보면, 이전 방법에 비해 참조 자료를 어떻게 적용하는지 알 수 있습니다.

보충 자료의 결과를 자세히 살펴보는 것을 강력히 추천합니다.

보충 자료의 결과를 자세히 살펴보는 것을 강력히 추천합니다.

* 현재 사용되지 않는 V1.5 릴리즈는 여전히 연구자들의 선호도입니다. 이는 레거시 테스트와 함께 쉽게 훈련할 수 있는 가장 적은 검열을 받은 버전이기 때문입니다. 또한 FOSS Flux 릴리즈의 검열을 받지 않습니다.

VRAM 사양이 주어지지 않았습니다. 40GB 또는 80GB 중 하나일 것입니다.

最初에 2025년 4월 29일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]