Anderson의 관점
녹색 화면 생성을 위한 안정 확산 모델 개선

시각적 생성 인공지능에 대한 커뮤니티와 투자자의 열렬한 지지에도 불구하고, 이러한 시스템의 출력은 항상 현실 세계에서 사용할 준비가 된 것은 아닙니다. 예를 들어, 생성 인공지능 시스템은 일반적으로 개별적으로 분리된 요소가 아니라 전체 이미지(또는 비디오의 경우 이미지 시리즈)를 출력합니다. 이러한 요소는 멀티미디어 및 시각 효과 실무자에게 다양한 응용 분야에서 필요합니다.
간단한 예는 사용자가 선택한 대상 배경 위에 부유하는 클립 아트입니다.
[캡션 id=”첨부_209495″ align=”alignnone” width=”840″]
이러한 종류의 투명도는 30년 이상 동안 일반적으로 사용 가능했습니다. 1990년대 초 디지털 혁명 이후 사용자는 점점 더 정교해지는 도구 세트와 기술을 통해 비디오 및 이미지에서 요소를 추출할 수 있었습니다.
예를 들어, 비디오 화면의 블루 스크린 및 그린 스크린 배경을 “드롭 아웃”하는 것은 한때 비싼 화학적 공정 및 광학 인쇄기(以及 수작업으로 만든 매트)의 영역이었습니다. 그러나 Adobe의 After Effects 및 Photoshop 애플리케이션(그 외 많은 무료 및 사유 프로그램 및 시스템)을 포함한 시스템에서 몇 분 만에 수행할 수 있게 되었습니다.
요소를 분리한 후에는 알파 채널(실제로 관련이 없는 콘텐츠를 가리는 마스크)이 비디오의 요소를 쉽게 새로운 배경 위에 겹치거나 다른 분리된 요소와 함께 구성할 수 있도록 합니다.
[캡션 id=”첨부_209496″ align=”alignnone” width=”529″]
드롭 아웃
컴퓨터 비전에서 알파 채널의 생성은 의미론적 분할의 범위 내에 있으며, 메타의 Segment Anything과 같은 오픈 소스 프로젝트는 텍스트 프롬프트 가능한 메서드를 제공하여 목표 객체를 분리/추출할 수 있습니다.
[캡션 id=”첨부_209499″ align=”alignnone” width=”990″]
이러한 의미론적 분할 방법은 요소를 추출하는 작업에 적응할 수 있습니다.
그러나 의미론적 분할은 요소를 추출하는 데 필요한 모든 객체 범주를 포함하지 않는 훈련 데이터에 의존합니다. 매우大量의 데이터로 훈련된 모델은 더 많은 객체를 인식할 수 있지만(기본적으로 기초 모델 또는 세계 모델이 됩니다), 훈련된 클래스에 의해 제한됩니다.
[캡션 id=”첨부_209500″ align=”alignnone” width=”507″]
이 경우 의미론적 분할은 녹색 화면 절차와 마찬가지로 후속 처리입니다. 또한 단일 색상 배경을 인식하고 제거하는 이점이 없습니다.
따라서 사용자 커뮤니티는 이미지를 생성할 수 있다는 생각이 들었습니다. 실제로 녹색 화면 배경이 포함되어 있으며 전통적인 방법으로 즉시 제거할 수 있습니다.
불행히도, Stable Diffusion과 같은 인기 있는 잠재 확산 모델은 실제로 생생한 녹색 화면을 렌더링하는 데 어려움을 겪을 수 있습니다. 이는 모델의 훈련 데이터가 이러한 특수 시나리오의 많은 예를 포함하지 않기 때문입니다. 시스템이 성공하더라도 “녹색”이라는 개념은 전경 주체로 원치 않는 방식으로 퍼집니다. 개념 엔트윈먼트로 인해:
[캡션 id=”첨부_209501″ align=”alignnone” width=”672″]
이러한 모델의 약점은 특정 데이터를 문제에 던짐으로써 극복할 수 있으며, 상당한 훈련 자원을 투자할 수 있습니다. Stanford의 2024년 LayerDiffuse와 같은 시스템은 알파 채널이 있는 이미지를 생성할 수 있는 미세 조정된 모델을 생성합니다.
[캡션 id=”첨부_209503″ align=”alignnone” width=”895″]
불행히도, 이 접근 방식에는 상당한 큐레이션 및 훈련 자원이 필요하며, LayerDiffuse에 사용된 데이터셋은 공개적으로 사용할 수 없습니다. 이는 모델을 사용하는 것을 제한하며, 사용자는 새로 구축하거나 사용자 지정해야 합니다.
2024년稍後, Adobe Research는 Stonybrook University와 협력하여 MAGICK를 제작했습니다. MAGICK는 사용자 정의로 만든 확산 이미지에 대한 AI 추출 접근 방식입니다.
[캡션 id=”첨부_209504″ align=”alignnone” width=”689″]
MAGICK는 15만 개의 추출된 AI 생성 객체를 사용하여 훈련되었습니다. 이를 통해 시스템은 추출에 대한 직관적인 이해를 개발할 수 있습니다.
[캡션 id=”첨부_209506″ align=”alignnone” width=”937″]
이 데이터셋은 앞서 언급한 이유로 생성하기 어렵습니다. 즉, 확산 방법은 단일 색상 배경을 생성하는 데 어려움을 겪습니다. 따라서 생성된 매트의 수동 선택이 필요했습니다.
이 로지스틱 병목 현상은 다시 한 번 시스템이 쉽게 개발되거나 사용자 지정할 수 없는 시스템을 만듭니다.
TKG-DM – 잠재 확산 모델을 위한 ‘네이티브’ 크로마 키 추출
독일과 일본의 연구자 간의 새로운 협력은 위에서 언급한 방법보다 더 나은 결과를 얻을 수 있으며, 특별히 큐레이션된 데이터셋에 대한 훈련이 필요하지 않다고 주장합니다.
[캡션 id=”첨부_209508″ align=”alignnone” width=”1200″]
새로운 방법은 생성 수준에서 문제를 접근하여 랜덤 노이즈를 최적화합니다. 이는 잠재 확산 모델(LDM)에서 이미지 생성의基础입니다.
[캡션 id=”첨부_209509″ align=”alignnone” width=”605″]
이 접근 방식은 이전에 Stable Diffusion 분포의 색상 스키마를 조사한 연구에 기반합니다. 또한 배경 색상에 대한 오염 없이 배경 색상이任意의 색상일 수 있습니다.
저자들은 다음과 같이 말합니다.
‘우리의 광범위한 실험은 TKG-DM이 FID 및 mask-FID 점수를 각각 33.7%, 35.9% 향상시킨다는 것을 보여줍니다. ‘
‘따라서 우리의 훈련 없는 모델은 미세 조정된 모델과 경쟁하며, 다양한 시각적 콘텐츠 생성 작업에 대한 효율적이고 다용도 솔루션을 제공합니다. ‘
새로운 논문은 TKG-DM: 훈련 없는 크로마 키 콘텐츠 생성 확산 모델이라고 제목이 붙여졌으며, 도쿄의 Hosei University와 카이저슬라우테른-란다우의 RPTU 및 DFKI GmbH의 7명의 연구자에 의해 작성되었습니다.
방법
새로운 접근 방식은 Stable Diffusion의 아키텍처를 확장하여 초기 가우시안 노이즈를 채널 평균 이동(CMS)을 통해 조건화합니다. 이는 생성된 결과에서 원하는 배경/전경 분리를 장려하는 노이즈 패턴을 생성합니다.
[캡션 id=”첨부_209511″ align=”alignnone” width=”992″]
CMS는 덴오이징 프로세스의 일반적인 개발을 유지하면서 각 색상 채널의 평균을 조정합니다.
저자들은 다음과 같이 말합니다.
‘크로마 키 배경에 전경 객체를 생성하기 위해 초기 노이즈 선택 전략을 적용하여 초기 [노이즈]와 초기 색상 [노이즈]를 2D 가우시안 [마스크]를 사용하여 선택적으로 결합합니다. ‘
‘이 마스크는 원래 노이즈를 전경 영역에 보존하고 배경 영역에 색상 변경된 노이즈를 적용하여渐进적인 전환을 만듭니다.’
[캡션 id=”첨부_209512″ align=”alignnone” width=”923″]
자체 주의 및 크로스 주의는 이미지의 두 가지 측면(크로마 배경 및 전경 콘텐츠)을 분리하는 데 사용됩니다. 자체 주의는 전경 객체의 내부 일관성을 도와주며, 크로스 주의는 텍스트 프롬프트에 대한 충실도를 유지합니다. 배경 이미지는 일반적으로 세부 사항이 적고 생성에서 강조되지 않기 때문에, 배경 이미지는 상대적으로 쉽게 극복되고 순수한 색상으로 대체될 수 있다고 논문은 지적합니다.
[캡션 id=”첨부_209513″ align=”alignnone” width=”504″]
데이터 및 테스트
TKG-DM은 Stable Diffusion V1.5 및 Stable Diffusion SDXL에서 테스트되었습니다. 이미지들은 각각 512x512px 및 1024x1024px로 생성되었습니다.
이미지는 Stable Diffusion의 DDIM 스케줄러를 사용하여 생성되었으며, 가이드 스케일은 7.5, 덴오이징 단계는 50으로 설정되었습니다. 대상 배경 색상은 녹색으로, 현재 주도적인 드롭 아웃 방법입니다.
새로운 접근 방식은 DeepFloyd, 미세 조정된 low-rank 확산 모델인 GreenBack LoRA, 및 앞서 언급한 LayerDiffuse와 비교되었습니다.
데이터에는 MAGICK 데이터셋에서 3000개의 이미지들이 사용되었습니다.
[캡션 id=”첨부_209514″ align=”alignnone” width=”851″]
저자들은 전경 품질을 평가하기 위해 Fréchet Inception Distance(FID)를 사용했습니다. 또한 마스크 품질을 평가하기 위해 BiRefNet 시스템을 사용하는 프로젝트 특정 지표인 m-FID를 개발했습니다.
[캡션 id=”첨부_209515″ align=”alignnone” width=”848″]
입력 프롬프트와의 의미론적 정렬을 테스트하기 위해 CLIP-Sentence(Clip-S) 및 CLIP-Image(Clip-I) 방법이 사용되었습니다. Clip-S는 프롬프트 충실도를 평가하며, Clip-I는 지상 진리와의 시각적 유사성을 평가합니다.
[캡션 id=”첨부_209518″ align=”alignnone” width=”973″]
저자들은 결과가 TKG-DM이 프롬프트 엔지니어링이나 모델 훈련/미세 조정이 필요하지 않으면서도 높은 품질의 전경을 생성할 수 있음을 보여줍니다.
[캡션 id=”첨부_209519″ align=”alignnone” width=”973″]
저자들은 Stable Diffusion 1.5가 깨끗한 배경을 생성하는 데 어려움을 겪으며, SDXL은 약간 더 잘 수행하지만 불안정한 밝은 녹색 색조를 생성하여 크로마 프로세스에서 분리하는 것을 방해할 수 있다고 관찰합니다.
또한 LayerDiffuse는 잘 분리된 배경을 생성하지만, 때때로 세부 사항(예: 정확한 숫자 또는 글자)을 잃어버리며, 이는 데이터셋의 제한으로 인한 것으로 저자들은 주장합니다. 또한 마스크 생성이 때때로 실패하여 ‘uncut’ 이미지를 생성할 수 있다고 추가합니다.
양적 테스트에서 LayerDiffuse는 SDXL에서 FID에서 우위를 점하는 것으로 보이지만, 저자들은 이는 특수한 데이터셋의 결과이며, 이는 사실상 “구워진” 및 유연하지 않은 제품이라고 주장합니다. 이러한 데이터셋에 포함되지 않은 객체 또는 클래스는 잘 수행되지 않을 수 있으며, 새로운 클래스에 대한 추가 미세 조정을 수행하는 것은 사용자에게 큐레이션 및 훈련 부담을 줄 수 있습니다.
[캡션 id=”첨부_209520″ align=”alignnone” width=”680″]
저자들은 다음과 같이 말합니다.
‘DeepFloyd의 높은 FID, m-FID, 및 CLIP-I 점수는 DeepFloyd의 출력이 지상 진리와의 유사성을 반영한다는 것을 보여줍니다. 그러나 이는 이미지 품질에 대한 공정한 벤치마크로 사용하기에 적합하지 않습니다. 또한 낮은 CLIP-S 점수는 다른 모델에 비해 텍스트 정렬이 약함을 나타냅니다.’
‘전반적으로, 이러한 결과는 우리 모델이 미세 조정 없이 높은 품질의 전경을 생성하고, 효율적인 크로마 키 콘텐츠 생성 솔루션을 제공하는 능력을 강조합니다. ‘
마지막으로, 연구자들은 다양한 방법의 프롬프트 충실도를 평가하기 위해 사용자 연구를 수행했습니다. 100명의 참가자가 각 방법의 30개의 이미지 쌍을 평가했으며, BiRefNet 및 수동 보정을 통해 모든 예시에서 객체를 추출했습니다. 저자들의 훈련 없는 접근 방식이 이 연구에서 선호되었습니다.
[캡션 id=”첨부_209521″ align=”alignnone” width=”684″]
TKG-DM은 Stable Diffusion을 위한 인기 있는 제3자 시스템인 ControlNet과 호환되며, 저자들은 이를 사용하여 더 나은 결과를 생성할 수 있다고 주장합니다.
결론
이 새로운 논문에서 가장 주목할 만한 발견은 잠재 확산 모델이 실제로 분리될 수 있는 것과는 달리, 이미지 및 비디오의 측면을 분리하는 데 어려움을 겪을 수 있다는 것입니다.
이 연구는 또한 연구 및 취미 커뮤니티가 모델의 약점을 해결하기 위해 미세 조정을 사용하는 정도를 강조합니다. 이러한 솔루션은 특정 클래스 및 객체 유형에 대해 잘 작동하거나 더 높은 데이터 양으로 인해 더 많은 클래스 및 객체에서 중간 정도로 작동할 수 있습니다. 그러나 이러한 접근 방식은 사용자에게 데이터 큐레이션 및 훈련 부담을 줄 수 있으며, 새로운 클래스에 대한 추가 미세 조정을 수행하는 것은 사용자에게 부담을 줄 수 있습니다.
따라서 이러한 노력 중 하나인 솔루션이 이러한 노동 집약적이고 논쟁의 여지가 있는 솔루션에 의존하지 않는다는 것은 환영할 만한 일입니다.
* 1978년 슈퍼맨 영화를 촬영할 때, 배우 크리스토퍼 리브는 블루 스크린 프로세스 샷을 위해 터키석 슈퍼맨 코스튬을 착용해야 했습니다. 이는 아이코닉한 블루 코스튬이 지워지는 것을 방지하기 위해서입니다. 코스튬의 블루 색상은 나중에 컬러 그레이딩을 통해 복원되었습니다.












