AI 모델 및 플랫폼

브러쉬넷: 듀얼 브랜치 확산을 이용한 이미지 인페인팅

mm
Unite.AI를 Google의 선호 소스에 추가

이미지 인페인팅은 컴퓨터 비전 분야에서 고전적인 문제 중 하나로, 이미지의 손실된 영역을 자연스럽고 합리적인 내용으로 복원하는 것을 목표로 합니다. 기존의 전통적인 이미지 인페인팅 기술은 제네러티브 적대적 네트워크(GANs) 또는 변분 오토인코더(VAEs)를 사용하지만, 이러한 방법은 보조적인 특징을 필요로 하며, 만족스러운 결과를 제공하지 못합니다. 최근 몇 년 동안 확산 기반 방법은 컴퓨터 비전 커뮤니티에서 인기를 얻었으며, 높은 품질의 이미지 생성, 다이버시티, 세부적인 제어가 가능합니다.

초기에는 확산 모델을 이용한 텍스트 가이드 이미지 인페인팅을 위해 표준 디노이징 전략을 수정하여 마스킹된 영역을 사전 훈련된 확산 모델에서 샘플링하고, 비마스킹된 영역을 주어진 이미지에서 복사했습니다. 이러한 방법은 간단한 이미지 인페인팅 작업에서 만족스러운 성능을 제공했지만, 복잡한 마스크 모양, 텍스트 프롬프트, 이미지 내용에서 일관성이 없는 결과를 제공했습니다. 이러한 일관성이 없는 결과는 주로 마스크 경계와 비마스킹된 이미지 영역의 맥락에 대한 제한된 지식으로 인해 발생합니다.

최근 몇 년 동안 이러한 모델의 발전과 연구에도 불구하고, 이미지 인페인팅은 여전히 컴퓨터 비전 개발자들에게 주요 장애물입니다. 현재의 확산 모델을 이미지 인페인팅 작업에 적용하는 방법은 샘플링 전략을 수정하거나, 이미지 인페인팅을 위한 확산 모델을 개발하는 것입니다. 그러나 이러한 방법은 이미지 품질이 저하되고, 의미론적인 일관성이 없는 결과를 제공할 수 있습니다. 이러한 도전을 극복하고, 이미지 인페인팅 모델을 발전시키기 위해, 본 문서에서는 브러쉬넷(BrushNet)이라는 새로운 플러그 앤 플레이 듀얼 브랜치 엔지니어드 프레임워크를 소개합니다. 브러쉬넷은 픽셀 수준의 마스킹된 이미지 특징을任意의 사전 훈련된 확산 모델에 삽입하여, 일관성과 향상된 결과를 제공합니다.

브러쉬넷 프레임워크는 이미지 특징과 노이즈 래티스를 별도의 브랜치로 분리하여, 모델의 학습 부담을 줄이고, 마스킹된 이미지 정보를 계층적으로 통합합니다. 또한, 브러쉬넷 프레임워크는 브러쉬벤치(BrushBench)와 브러쉬데이터(BrushData)를 소개합니다. 브러쉬벤치는 세그멘테이션 기반의 성능 평가와 이미지 인페인팅 훈련을 위한 데이터셋입니다.

본 문서는 브러쉬넷 프레임워크를 깊이 있게 다루고, 메커니즘, 방법론, 아키텍처, 그리고 상태 오토 프레임워크와의 비교를探讨합니다. 따라서, 시작해 봅시다.

브러쉬넷: 듀얼 브랜치 확산을 이용한 이미지 인페인팅

이미지 인페인팅은 컴퓨터 비전 분야에서 오랜 시간 동안 존재해 온 문제로, 이미지의 손실된 영역을 자연스럽게 복원하는 것을 목표로 합니다. 이미지 인페인팅은 이미지 편집, 가상 시연 등 다양한 컴퓨터 비전 작업에서 적용됩니다. 최근에는 확산 모델이 높은 품질의 이미지 생성과 세부적인 제어가 가능하다는 사실이 밝혀졌습니다.

전통적인 확산 기반 텍스트 가이드 이미지 인페인팅 프레임워크는 두 가지 범주로 나눌 수 있습니다. 첫 번째는 샘플링 전략 수정 방법으로, 표준 디노이징 전략을 수정하여 마스킹된 영역을 사전 훈련된 확산 모델에서 샘플링하고, 비마스킹된 영역을 주어진 이미지에서 복사합니다. 두 번째는 전용 이미지 인페인팅 모델을 개발하는 방법으로, 확산 모델을 이미지 인페인팅 작업에 특화시킵니다. 그러나 이러한 방법은 이미지 품질이 저하되고, 의미론적인 일관성이 없는 결과를 제공할 수 있습니다.

전용 이미지 인페인팅 모델은 마스킹된 이미지 특징과 노이즈 래티스를 초기에 결합하여, 이후의 레이어에서純粋한 마스킹된 이미지 특징을 얻지 못하게 됩니다. 또한, 이러한 방법은 텍스트와 마스크를 초기에 결합하여, 모델이 텍스트와 마스크를 동시에 처리해야 하므로, 모델의 부담을 가중시킵니다.

마스킹된 이미지 특징을 추출하기 위한 추가적인 브랜치를 추가하는 것이 해결책으로 보일 수 있지만, 기존의 프레임워크는 이러한 접근법에서 불충분한 정보를 추출하여, 만족스러운 결과를 제공하지 못합니다. 따라서, 브러쉬넷 프레임워크는 추가적인 브랜치를 원래의 확산 네트워크에 추가하여, 이미지 인페인팅 작업에 더 적합한 아키텍처를 제공합니다.

  1. 브러쉬넷 프레임워크는 랜덤한 초기화를 사용하는 대신, 변분 오토인코더(VAE) 인코더를 사용하여 마스킹된 이미지를 처리합니다. 이를 통해, 브러쉬넷 프레임워크는 이미지 특징을 더 효과적으로 추출할 수 있습니다.
  2. 브러쉬넷 프레임워크는 계층적인 접근 방식을 사용하여, 마스킹된 이미지 특징을 단계적으로 통합합니다. 이를 통해, 브러쉬넷 프레임워크는 픽셀 단위의 제어가 가능합니다.
  3. 브러쉬넷 프레임워크는 추가적인 브랜치에서 텍스트 크로스 어텐션을 제거하여,純粋한 이미지 정보만을 고려합니다. 또한, 브러쉬넷 프레임워크는 블러링된 블렌딩 전략을 사용하여, 일관성이 있는 결과를 제공합니다.

브러쉬넷: 방법론과 아키텍처

다음 그림은 브러쉬넷 프레임워크의 개요를 제공합니다.

브러쉬넷 프레임워크는 듀얼 브랜치 전략을 사용하여, 마스킹된 이미지 특징을 삽입합니다. 또한, 블러링된 마스크를 사용하여, 비마스킹된 영역을 보존합니다. 브러쉬넷 프레임워크는 추가적인 브랜치를 사용하여, 마스킹된 이미지 특징을 추출하고, 이를 원래의 확산 네트워크에 통합합니다.

마스킹된 이미지 가이드

브러쉬넷 프레임워크는 추가적인 브랜치를 사용하여, 마스킹된 이미지 특징을 삽입합니다. 이를 통해, 브러쉬넷 프레임워크는 이미지 인페인팅 작업에서 일관성이 있는 결과를 제공할 수 있습니다.

블렌딩 작업

브러쉬넷 프레임워크는 블러링된 블렌딩 전략을 사용하여, 일관성이 있는 결과를 제공합니다. 이를 통해, 브러쉬넷 프레임워크는 비마스킹된 영역을 보존할 수 있습니다.

유연한 제어

브러쉬넷 프레임워크는 추가적인 브랜치를 사용하여, 마스킹된 이미지 특징을 추출하고, 이를 원래의 확산 네트워크에 통합합니다. 이를 통해, 브러쉬넷 프레임워크는 유연한 제어가 가능합니다.

브러쉬넷: 구현과 결과

브러쉬넷 프레임워크는 브러쉬벤치(BrushBench)라는 데이터셋을 사용하여, 성능을 평가합니다. 브러쉬벤치는 600개 이상의 이미지로 구성되어 있으며, 각 이미지에는 마스크와 캡션 注解이 있습니다.

양적 비교

다음 표는 브러쉬넷 프레임워크와 기존의 확산 기반 이미지 인페인팅 모델을 비교합니다.

브러쉬넷 프레임워크는 마스킹된 영역 보존, 텍스트 정렬, 이미지 품질에서优秀한 성능을 제공합니다.

질적 비교

다음 그림은 브러쉬넷 프레임워크와 기존의 이미지 인페인팅 방법을 비교합니다.

브러쉬넷 프레임워크는 비마스킹된 영역의 일관성과, 마스킹된 영역의 일관성을 제공합니다.

최종 생각

본 문서에서는 브러쉬넷 프레임워크를 소개했습니다. 브러쉬넷 프레임워크는 픽셀 수준의 마스킹된 이미지 특징을任意의 사전 훈련된 확산 모델에 삽입하여, 일관성과 향상된 결과를 제공합니다. 브러쉬넷 프레임워크는 이미지 인페인팅 작업에서 유연한 제어가 가능합니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.