AI 모델 및 플랫폼

HD-Painter: 고해상도 텍스트 가이드 이미지 인페인팅을 위한 확산 모델

mm
Unite.AI를 Google의 선호 소스에 추가

확산 모델은 확실히 AI와 ML 산업을 혁신시켰으며, 실시간 응용 분야에서 우리의 일상 생활의 중요한 부분이 되었습니다. 텍스트-이미지 모델이 뛰어난 능력을 보여준 후, 확산 기반 이미지 조작 기술인 제어 가능한 생성, 전문 및 개인화된 이미지 합성, 객체 수준 이미지 편집, 프롬프트 조건 변형 및 편집이 컴퓨터 비전 산업에서 응용 분야로 인해 핫 연구 주제로 등장했습니다.

그러나 그들의 인상적인 능력과 예외적인 결과에도 불구하고, 텍스트-이미지 프레임워크, 특히 텍스트-이미지 인페인팅 프레임워크는 여전히 개발할 수 있는 잠재적인 영역이 있습니다. 이러한 영역에는 글로벌 장면을 이해하는 능력, 특히 높은 확산 시간 단계에서 이미지의 노이즈를 제거할 때 포함됩니다. 이 문제를 해결하기 위해 연구자들은 프롬프트 지침을 정확하게 따르고 고해상도 이미지 인페인팅에 일관되게 확장할 수 있는 완전히 훈련되지 않은 프레임워크인 HD-Painter를 도입했습니다. HD-Painter 프레임워크는 프롬프트 정보를 사용하여 자기 주의 점수를 향상시키는 프롬프트 인식 내향적 주의(PAIntA) 레이어를 사용합니다. 이는 텍스트 정렬 생성을 더 잘 생성하는 결과를 낳습니다.

프롬프트의 일관성을さらに 개선하기 위해 HD-Painter 모델은 후속 샘플링 전략을 일반적인 DDIM 구성 요소에无缝하게 통합하는 Reweighting Attention Score Guidance(RASG) 접근 방식을 도입합니다. 이 접근 방식은 후속 샘플링 지침 방법을 사용하여 텍스트와의 생성 정렬을 더욱 향상시킵니다. 그러나 이 후속 샘플링 지침 방법은 확산 잠재 영역의 도메인을 변경하여 이미지 품질을 저하할 수 있습니다. 이를 해결하기 위해 HD-Painter 프레임워크는 그라디언트 재가중 메커니즘을 도입하여 잠재 영역을 보존하는 RASG 메커니즘을 구현합니다.

HD-Painter: 텍스트 가이드 이미지 인페인팅

텍스트-이미지 확산 모델은 최근 몇 개월 동안 AI 및 ML 산업에서 중요한 주제였으며, 다양한 실제 응용 분야에서 인상적인 실시간 능력을 보여주었습니다. DALL-E, Imagen 및 Stable Diffusion와 같은 사전 훈련된 텍스트-이미지 생성 모델은 이미지를 완성하기 위해.diffused 알려진 영역과 denoised(생성된) 알려진 영역을 백워드 확산 프로세스 중에 결합하여 적합성을 입증했습니다. 그러나 기존 모델은 글로벌 장면을 이해하는 데 어려움을 겪습니다. 특히 높은 확산 시간 단계에서 노이즈를 제거하는 과정에서 어려움을 겪습니다. 사전 훈련된 텍스트-이미지 확산 모델을 추가 컨텍스트 정보를 포함하도록 수정하여 텍스트 가이드 이미지 완성을 위해 미세 조정할 수 있습니다.

さらに, 확산 모델 내에서 텍스트 가이드 인페인팅과 텍스트 가이드 이미지 완성은 연구자들에게 주요 관심 영역입니다. 이는 텍스트 가이드 인페인팅 모델이 입력 이미지의 특정 영역에 텍스트 프롬프트에 따라 콘텐츠를 생성할 수 있기 때문입니다. 이러한 관심은 이미지의 특정 영역을 리터치하거나 수정하거나 속성(색상, 의류 등)을 변경하거나 객체를 추가 또는 대체하는 것과 같은 잠재적인 응용 분야에서 비롯됩니다. 요약하면, 텍스트-이미지 확산 모델은 최근에 예외적인 실시간 생성 능력으로 인해 전례 없는 성공을 달성했습니다.

그러나 대부분의 기존 프레임워크는 두 가지 시나리오에서 프롬프트를 무시하는 경향이 있습니다. 첫 번째 시나리오는 배경 우세입니다. 모델이 배경에서 알려진 영역을 무시하고 알 수 없는 영역을 완성합니다. 두 번째 시나리오는 근처 객체 우세입니다. 모델이 시각적 컨텍스트를 사용하여 알려진 영역의 객체를 알 수 없는 영역으로 전파합니다. 이러한 문제는 확산 인페인팅의 순수한 공간 및 프롬프트가 없는 자기 주의 레이어의 능력으로 인해 발생할 수 있습니다.

이러한 장애물을 극복하기 위해 HD-Painter 프레임워크는 Prompt Aware Introverted Attention(PAIntA) 레이어를 도입합니다. PAIntA는 프롬프트 정보를 사용하여 자기 주의 점수를 향상시키고, 알려진 픽셀의 기여도를 높이며, 알 수 없는 영역의 출력을 제어합니다. PAIntA는 텍스트 조건을 사용하여 자기 주의 점수를 조정하고, 새로운 유사성 행렬을 정의합니다.

HD-Painter: 방법 및 아키텍처

HD-Painter 프레임워크의 아키텍처를 이해하기 전에, 세 가지 기본 개념을 이해하는 것이 중요합니다: 이미지 인페인팅, 확산 프레임워크의 후속 지침 및 인페인팅 특정 아키텍처 블록입니다.

이미지 인페인팅은 이미지의 누락된 영역을 채우는 것을 목표로 하는 접근 방식입니다. 전통적인 딥 러닝 프레임워크는 알려진 영역에서 깊은 특징을 전파하는 방법을 구현했습니다. 그러나 확산 모델의 도입으로 인페인팅 모델, 특히 텍스트 가이드 이미지 인페인팅 프레임워크가 발전했습니다. 전통적으로, 사전 훈련된 텍스트-이미지 확산 모델은 노이즈된 알려진 영역의 잠재를 사용하여 알 수 없는 영역을 대체합니다. 그러나 이 접근 방식은 노이즈된 알려진 영역의 품질을 저하할 수 있습니다.

안정적인 확산 및 안정적인 인페인팅

안정적인 확산은 오토인코더의 잠재 공간에서 작동하는 확산 모델입니다. 텍스트-이미지 합성을 위해 안정적인 확산 프레임워크는 텍스트 프롬프트를 사용하여 프로세스를 안내합니다. 가이드 함수는 UNet 아키텍처와 유사한 구조를 가지고 있으며, 크로스 어텐션 레이어는 텍스트 프롬프트에 조건을 부여합니다. 또한 안정적인 확산 모델은 일부 수정과 미세 조정을 통해 이미지 인페인팅을 수행할 수 있습니다.

프롬프트 인식 내향적 주의 또는 PAIntA

기존의 인페인팅 모델은 시각적 컨텍스트를 사용하여 알 수 없는 영역을 채우는 경향이 있습니다. 이는 근처 객체 우세 또는 배경 우세로 이어질 수 있습니다. 이 문제는 자기 주의 레이어의 순수한 공간 및 프롬프트가 없는 능력으로 인해 발생할 수 있습니다. 이를 해결하기 위해 HD-Painter 프레임워크는 Prompt Aware Introverted Attention(PAIntA) 레이어를 도입합니다. PAIntA는 프롬프트 정보를 사용하여 자기 주의 점수를 향상시키고, 알려진 픽셀의 기여도를 높이며, 알 수 없는 영역의 출력을 제어합니다.

주의 점수 가중 재지침 또는 RASG

HD-Painter 프레임워크는 후속 샘플링 지침 방법을 사용하여 텍스트와의 생성 정렬을 더욱 향상시킵니다. 그러나 이 후속 샘플링 지침 방법은 확산 잠재 영역의 도메인을 변경하여 이미지 품질을 저하할 수 있습니다. 이를 해결하기 위해 HD-Painter 프레임워크는 그라디언트 재가중 메커니즘을 도입하여 잠재 영역을 보존하는 RASG 메커니즘을 구현합니다.

HD-Painter: 실험 및 결과

HD-Painter 프레임워크의 성능을 분석하기 위해, 현재의 상태 오프 더 아트 모델과 비교합니다. 비교 모델에는 Stable Inpainting, GLIDE 및 BLD(Blended Latent Diffusion)가 포함됩니다.

그림에서 볼 수 있듯이, HD-Painter 프레임워크는 세 가지 다른 지표에서 기존 프레임워크를 크게 능가합니다. 특히 CLIP 지표에서 1.5 점의 향상과 다른 상태 오프 더 아트 방법에서 약 10%의 차이를 보입니다.

최종 생각

이 기사에서, 우리는 텍스트 가이드 이미지 인페인팅의 도전 과제를 해결하고, 근처 객체 우세 및 배경 우세를 극복하는 훈련되지 않은 고해상도 텍스트 가이드 이미지 인페인팅 접근 방식인 HD-Painter에 대해 논의했습니다. HD-Painter 프레임워크는 프롬프트 정보를 사용하여 자기 주의 점수를 향상시키는 PAIntA 레이어를 구현합니다. 이를 통해 텍스트 정렬 생성을 더 잘 생성하는 결과를 낳습니다.

또한, HD-Painter 모델은 후속 샘플링 전략을 일반적인 DDIM 구성 요소에无缝하게 통합하는 RASG 접근 방식을 도입하여 확산 잠재 영역의 도메인을 보존합니다. 마지막으로, HD-Painter 프레임워크는 인페인팅을 위한 특수한 超解像 기술을 도입하여 더 큰 규모로 확장하고, 2K 해상도까지의 누락된 영역을 완성할 수 있습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.