Anderson의 관점

녹색 화면 생성을 위한 안정 확산 모델 개선

mm
Unite.AI를 Google의 선호 소스에 추가
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

시각적 생성 인공지능에 대한 커뮤니티와 투자자의 열렬한 지지에도 불구하고, 이러한 시스템의 출력은 항상 현실 세계에서 사용할 준비가 된 것은 아닙니다. 예를 들어, 생성 인공지능 시스템은 일반적으로 개별적으로 분리된 요소가 아니라 전체 이미지(또는 비디오의 경우 이미지 시리즈)를 출력합니다. 이러한 요소는 멀티미디어 및 시각 효과 실무자에게 다양한 응용 분야에서 필요합니다.

간단한 예는 사용자가 선택한 대상 배경 위에 부유하는 클립 아트입니다.

[캡션 id=”첨부_209495″ align=”alignnone” width=”840″]Photoshop 사용자에게 가장 친숙한 밝은 회색 체크무늬 배경은 투명도 채널 또는 알파 채널을 나타내는 것으로 간주될 수 있으며, 이는 단순한 소비자 아이템인 스톡 이미지에서도 마찬가지입니다. Photoshop 사용자에게 가장 친숙한 밝은 회색 체크무늬 배경은 투명도 채널 또는 알파 채널을 나타내는 것으로 간주될 수 있으며, 이는 단순한 소비자 아이템인 스톡 이미지에서도 마찬가지입니다.[/캡션]

이러한 종류의 투명도는 30년 이상 동안 일반적으로 사용 가능했습니다. 1990년대 초 디지털 혁명 이후 사용자는 점점 더 정교해지는 도구 세트와 기술을 통해 비디오 및 이미지에서 요소를 추출할 수 있었습니다.

예를 들어, 비디오 화면의 블루 스크린 및 그린 스크린 배경을 “드롭 아웃”하는 것은 한때 비싼 화학적 공정 및 광학 인쇄기(以及 수작업으로 만든 매트)의 영역이었습니다. 그러나 Adobe의 After Effects 및 Photoshop 애플리케이션(그 외 많은 무료 및 사유 프로그램 및 시스템)을 포함한 시스템에서 몇 분 만에 수행할 수 있게 되었습니다.

요소를 분리한 후에는 알파 채널(실제로 관련이 없는 콘텐츠를 가리는 마스크)이 비디오의 요소를 쉽게 새로운 배경 위에 겹치거나 다른 분리된 요소와 함께 구성할 수 있도록 합니다.

[캡션 id=”첨부_209496″ align=”alignnone” width=”529″]알파 채널의 예시, 하단 행에 효과가 표시되어 있습니다. 출처: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html 알파 채널의 예시, 하단 행에 효과가 표시되어 있습니다. 출처: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html[/캡션]

드롭 아웃

컴퓨터 비전에서 알파 채널의 생성은 의미론적 분할의 범위 내에 있으며, 메타의 Segment Anything과 같은 오픈 소스 프로젝트는 텍스트 프롬프트 가능한 메서드를 제공하여 목표 객체를 분리/추출할 수 있습니다.

[캡션 id=”첨부_209499″ align=”alignnone” width=”990″]Alpha-CLIP 프레임워크에서 Segment Anything를 사용한 예시 추출: 출처: https://arxiv.org/pdf/2312.03818 Alpha-CLIP 프레임워크에서 Segment Anything를 사용한 예시 추출: 출처: https://arxiv.org/pdf/2312.03818[/캡션]

이러한 의미론적 분할 방법은 요소를 추출하는 작업에 적응할 수 있습니다.

그러나 의미론적 분할은 요소를 추출하는 데 필요한 모든 객체 범주를 포함하지 않는 훈련 데이터에 의존합니다. 매우大量의 데이터로 훈련된 모델은 더 많은 객체를 인식할 수 있지만(기본적으로 기초 모델 또는 세계 모델이 됩니다), 훈련된 클래스에 의해 제한됩니다.

[캡션 id=”첨부_209500″ align=”alignnone” width=”507″]의미론적 분할 시스템인 Segment Anything는 특정 객체 또는 객체의 일부를 식별하는 데 어려움을 겪을 수 있습니다. 출처: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html 의미론적 분할 시스템인 Segment Anything는 특정 객체 또는 객체의 일부를 식별하는 데 어려움을 겪을 수 있습니다. 출처: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html[/캡션]

이 경우 의미론적 분할은 녹색 화면 절차와 마찬가지로 후속 처리입니다. 또한 단일 색상 배경을 인식하고 제거하는 이점이 없습니다.

따라서 사용자 커뮤니티는 이미지를 생성할 수 있다는 생각이 들었습니다. 실제로 녹색 화면 배경이 포함되어 있으며 전통적인 방법으로 즉시 제거할 수 있습니다.

불행히도, Stable Diffusion과 같은 인기 있는 잠재 확산 모델은 실제로 생생한 녹색 화면을 렌더링하는 데 어려움을 겪을 수 있습니다. 이는 모델의 훈련 데이터가 이러한 특수 시나리오의 많은 예를 포함하지 않기 때문입니다. 시스템이 성공하더라도 “녹색”이라는 개념은 전경 주체로 원치 않는 방식으로 퍼집니다. 개념 엔트윈먼트로 인해:

[캡션 id=”첨부_209501″ align=”alignnone” width=”672″]위에서 Stable Diffusion은 이미지의 진실성을 녹색의 단일 강度 생성보다 우선시하여 전통적인 녹색 화면 시나리오에서 발생하는 실제 문제를 효과적으로 복제했습니다. 아래에서 전경 이미지로 '녹색' 개념이 오염되는 것을 볼 수 있습니다. '녹색' 개념에 대한 프롬프트가 집중할수록 이 문제가 더 심해질 것입니다. 출처: https://stablediffusionweb.com/ 위에서 Stable Diffusion은 이미지의 진실성을 녹색의 단일 강度 생성보다 우선시하여 전통적인 녹색 화면 시나리오에서 발생하는 실제 문제를 효과적으로 복제했습니다. 아래에서 전경 이미지로 ‘녹색’ 개념이 오염되는 것을 볼 수 있습니다. ‘녹색’ 개념에 대한 프롬프트가 집중할수록 이 문제가 더 심해질 것입니다. 출처: https://stablediffusionweb.com/[/캡션]

이러한 모델의 약점은 특정 데이터를 문제에 던짐으로써 극복할 수 있으며, 상당한 훈련 자원을 투자할 수 있습니다. Stanford의 2024년 LayerDiffuse와 같은 시스템은 알파 채널이 있는 이미지를 생성할 수 있는 미세 조정된 모델을 생성합니다.

[캡션 id=”첨부_209503″ align=”alignnone” width=”895″]Stanford의 LayerDiffuse 프로젝트는 모델에 투명성 기능을 부여할 수 있는 100만 개의 적절한 이미지를 사용하여 훈련되었습니다. 출처: https://arxiv.org/pdf/2402.17113 Stanford의 LayerDiffuse 프로젝트는 모델에 투명성 기능을 부여할 수 있는 100만 개의 적절한 이미지를 사용하여 훈련되었습니다. 출처: https://arxiv.org/pdf/2402.17113[/캡션]

불행히도, 이 접근 방식에는 상당한 큐레이션 및 훈련 자원이 필요하며, LayerDiffuse에 사용된 데이터셋은 공개적으로 사용할 수 없습니다. 이는 모델을 사용하는 것을 제한하며, 사용자는 새로 구축하거나 사용자 지정해야 합니다.

2024년稍後, Adobe Research는 Stonybrook University와 협력하여 MAGICK를 제작했습니다. MAGICK는 사용자 정의로 만든 확산 이미지에 대한 AI 추출 접근 방식입니다.

[캡션 id=”첨부_209504″ align=”alignnone” width=”689″]2024년 논문에서 MAGICK의 세부 알파 채널 추출 예시. 출처: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf 2024년 논문에서 MAGICK의 세부 알파 채널 추출 예시. 출처: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf[/캡션]

MAGICK는 15만 개의 추출된 AI 생성 객체를 사용하여 훈련되었습니다. 이를 통해 시스템은 추출에 대한 직관적인 이해를 개발할 수 있습니다.

[캡션 id=”첨부_209506″ align=”alignnone” width=”937″]MAGICK 훈련 데이터셋의 샘플. MAGICK 훈련 데이터셋의 샘플.[/캡션]

이 데이터셋은 앞서 언급한 이유로 생성하기 어렵습니다. 즉, 확산 방법은 단일 색상 배경을 생성하는 데 어려움을 겪습니다. 따라서 생성된 매트의 수동 선택이 필요했습니다.

이 로지스틱 병목 현상은 다시 한 번 시스템이 쉽게 개발되거나 사용자 지정할 수 없는 시스템을 만듭니다.

TKG-DM – 잠재 확산 모델을 위한 ‘네이티브’ 크로마 키 추출

독일과 일본의 연구자 간의 새로운 협력은 위에서 언급한 방법보다 더 나은 결과를 얻을 수 있으며, 특별히 큐레이션된 데이터셋에 대한 훈련이 필요하지 않다고 주장합니다.

[캡션 id=”첨부_209508″ align=”alignnone” width=”1200″]TKG-DM은 생성된 이미지에 대한 단단한, 키 가능한 배경을 생성할 수 있도록 초기 랜덤 노이즈를 조정합니다. 출처: https://arxiv.org/pdf/2411.15580 TKG-DM은 생성된 이미지에 대한 단단한, 키 가능한 배경을 생성할 수 있도록 초기 랜덤 노이즈를 조정합니다. 출처: https://arxiv.org/pdf/2411.15580[/캡션]

새로운 방법은 생성 수준에서 문제를 접근하여 랜덤 노이즈를 최적화합니다. 이는 잠재 확산 모델(LDM)에서 이미지 생성의基础입니다.

[캡션 id=”첨부_209509″ align=”alignnone” width=”605″]초기 노이즈는 채널 평균 이동으로 조건화되어 덴오이징 프로세스의 측면을 영향을 줄 수 있습니다. 초기 노이즈는 채널 평균 이동으로 조건화되어 덴오이징 프로세스의 측면을 영향을 줄 수 있습니다.[/캡션]

이 접근 방식은 이전에 Stable Diffusion 분포의 색상 스키마를 조사한 연구에 기반합니다. 또한 배경 색상에 대한 오염 없이 배경 색상이任意의 색상일 수 있습니다.

저자들은 다음과 같이 말합니다.

‘우리의 광범위한 실험은 TKG-DM이 FID 및 mask-FID 점수를 각각 33.7%, 35.9% 향상시킨다는 것을 보여줍니다. ‘

‘따라서 우리의 훈련 없는 모델은 미세 조정된 모델과 경쟁하며, 다양한 시각적 콘텐츠 생성 작업에 대한 효율적이고 다용도 솔루션을 제공합니다. ‘

새로운 논문은 TKG-DM: 훈련 없는 크로마 키 콘텐츠 생성 확산 모델이라고 제목이 붙여졌으며, 도쿄의 Hosei University와 카이저슬라우테른-란다우의 RPTU 및 DFKI GmbH의 7명의 연구자에 의해 작성되었습니다.

방법

새로운 접근 방식은 Stable Diffusion의 아키텍처를 확장하여 초기 가우시안 노이즈를 채널 평균 이동(CMS)을 통해 조건화합니다. 이는 생성된 결과에서 원하는 배경/전경 분리를 장려하는 노이즈 패턴을 생성합니다.

[캡션 id=”첨부_209511″ align=”alignnone” width=”992″]제안된 시스템의 워크플로우 스키마. 제안된 시스템의 워크플로우 스키마.[/캡션]

CMS는 덴오이징 프로세스의 일반적인 개발을 유지하면서 각 색상 채널의 평균을 조정합니다.

저자들은 다음과 같이 말합니다.

‘크로마 키 배경에 전경 객체를 생성하기 위해 초기 노이즈 선택 전략을 적용하여 초기 [노이즈]와 초기 색상 [노이즈]를 2D 가우시안 [마스크]를 사용하여 선택적으로 결합합니다. ‘

‘이 마스크는 원래 노이즈를 전경 영역에 보존하고 배경 영역에 색상 변경된 노이즈를 적용하여渐进적인 전환을 만듭니다.’

[캡션 id=”첨부_209512″ align=”alignnone” width=”923″]원하는 배경 크로마 색상 채널은 null 텍스트 프롬프트와 함께 인스턴스화되며, 실제 전경 콘텐츠는 사용자의 텍스트 지침에서 의미론적으로 생성됩니다. 원하는 배경 크로마 색상 채널은 null 텍스트 프롬프트와 함께 인스턴스화되며, 실제 전경 콘텐츠는 사용자의 텍스트 지침에서 의미론적으로 생성됩니다.[/캡션]

자체 주의크로스 주의는 이미지의 두 가지 측면(크로마 배경 및 전경 콘텐츠)을 분리하는 데 사용됩니다. 자체 주의는 전경 객체의 내부 일관성을 도와주며, 크로스 주의는 텍스트 프롬프트에 대한 충실도를 유지합니다. 배경 이미지는 일반적으로 세부 사항이 적고 생성에서 강조되지 않기 때문에, 배경 이미지는 상대적으로 쉽게 극복되고 순수한 색상으로 대체될 수 있다고 논문은 지적합니다.

[캡션 id=”첨부_209513″ align=”alignnone” width=”504″]크로마 스타일 생성 프로세스에서 자체 주의 및 크로스 주의의 영향의 시각화. 크로마 스타일 생성 프로세스에서 자체 주의 및 크로스 주의의 영향의 시각화.[/캡션]

데이터 및 테스트

TKG-DM은 Stable Diffusion V1.5 및 Stable Diffusion SDXL에서 테스트되었습니다. 이미지들은 각각 512x512px 및 1024x1024px로 생성되었습니다.

이미지는 Stable Diffusion의 DDIM 스케줄러를 사용하여 생성되었으며, 가이드 스케일은 7.5, 덴오이징 단계는 50으로 설정되었습니다. 대상 배경 색상은 녹색으로, 현재 주도적인 드롭 아웃 방법입니다.

새로운 접근 방식은 DeepFloyd, 미세 조정된 low-rank 확산 모델인 GreenBack LoRA, 및 앞서 언급한 LayerDiffuse와 비교되었습니다.

데이터에는 MAGICK 데이터셋에서 3000개의 이미지들이 사용되었습니다.

[캡션 id=”첨부_209514″ align=”alignnone” width=”851″]새 시스템을 테스트하기 위해 MAGICK 데이터셋에서 큐레이션된 3000개의 이미지의 예시. 출처: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html 새 시스템을 테스트하기 위해 MAGICK 데이터셋에서 큐레이션된 3000개의 이미지의 예시. 출처: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html[/캡션]

저자들은 전경 품질을 평가하기 위해 Fréchet Inception Distance(FID)를 사용했습니다. 또한 마스크 품질을 평가하기 위해 BiRefNet 시스템을 사용하는 프로젝트 특정 지표인 m-FID를 개발했습니다.

[캡션 id=”첨부_209515″ align=”alignnone” width=”848″]BiRefNet 시스템과 이전 방법의 시각적 비교. 출처: https://arxiv.org/pdf/2401.03407 BiRefNet 시스템과 이전 방법의 시각적 비교. 출처: https://arxiv.org/pdf/2401.03407[/캡션]

입력 프롬프트와의 의미론적 정렬을 테스트하기 위해 CLIP-Sentence(Clip-S) 및 CLIP-Image(Clip-I) 방법이 사용되었습니다. Clip-S는 프롬프트 충실도를 평가하며, Clip-I는 지상 진리와의 시각적 유사성을 평가합니다.

[캡션 id=”첨부_209518″ align=”alignnone” width=”973″]새로운 방법에 대한 첫 번째 질적 결과, 이 경우 Stable Diffusion V1.5. 출처 PDF를 참조하십시오. 새로운 방법에 대한 첫 번째 질적 결과, 이 경우 Stable Diffusion V1.5. 출처 PDF를 참조하십시오.[/캡션]

저자들은 결과가 TKG-DM이 프롬프트 엔지니어링이나 모델 훈련/미세 조정이 필요하지 않으면서도 높은 품질의 전경을 생성할 수 있음을 보여줍니다.

[캡션 id=”첨부_209519″ align=”alignnone” width=”973″]SDXL의 질적 결과. 출처 PDF를 참조하십시오. SDXL의 질적 결과. 출처 PDF를 참조하십시오.[/캡션]

저자들은 Stable Diffusion 1.5가 깨끗한 배경을 생성하는 데 어려움을 겪으며, SDXL은 약간 더 잘 수행하지만 불안정한 밝은 녹색 색조를 생성하여 크로마 프로세스에서 분리하는 것을 방해할 수 있다고 관찰합니다.

또한 LayerDiffuse는 잘 분리된 배경을 생성하지만, 때때로 세부 사항(예: 정확한 숫자 또는 글자)을 잃어버리며, 이는 데이터셋의 제한으로 인한 것으로 저자들은 주장합니다. 또한 마스크 생성이 때때로 실패하여 ‘uncut’ 이미지를 생성할 수 있다고 추가합니다.

양적 테스트에서 LayerDiffuse는 SDXL에서 FID에서 우위를 점하는 것으로 보이지만, 저자들은 이는 특수한 데이터셋의 결과이며, 이는 사실상 “구워진” 및 유연하지 않은 제품이라고 주장합니다. 이러한 데이터셋에 포함되지 않은 객체 또는 클래스는 잘 수행되지 않을 수 있으며, 새로운 클래스에 대한 추가 미세 조정을 수행하는 것은 사용자에게 큐레이션 및 훈련 부담을 줄 수 있습니다.

[캡션 id=”첨부_209520″ align=”alignnone” width=”680″]비교의 양적 결과. 논문은 LayerDiffuse의 명백한 우위를 유연성의 손실 및 데이터 큐레이션 및 훈련의 부담으로 인한 결과라고 주장합니다. 비교의 양적 결과. 논문은 LayerDiffuse의 명백한 우위를 유연성의 손실 및 데이터 큐레이션 및 훈련의 부담으로 인한 결과라고 주장합니다.[/캡션]

저자들은 다음과 같이 말합니다.

‘DeepFloyd의 높은 FID, m-FID, 및 CLIP-I 점수는 DeepFloyd의 출력이 지상 진리와의 유사성을 반영한다는 것을 보여줍니다. 그러나 이는 이미지 품질에 대한 공정한 벤치마크로 사용하기에 적합하지 않습니다. 또한 낮은 CLIP-S 점수는 다른 모델에 비해 텍스트 정렬이 약함을 나타냅니다.’

‘전반적으로, 이러한 결과는 우리 모델이 미세 조정 없이 높은 품질의 전경을 생성하고, 효율적인 크로마 키 콘텐츠 생성 솔루션을 제공하는 능력을 강조합니다. ‘

마지막으로, 연구자들은 다양한 방법의 프롬프트 충실도를 평가하기 위해 사용자 연구를 수행했습니다. 100명의 참가자가 각 방법의 30개의 이미지 쌍을 평가했으며, BiRefNet 및 수동 보정을 통해 모든 예시에서 객체를 추출했습니다. 저자들의 훈련 없는 접근 방식이 이 연구에서 선호되었습니다.

[캡션 id=”첨부_209521″ align=”alignnone” width=”684″]사용자 연구의 결과. 사용자 연구의 결과.[/캡션]

TKG-DM은 Stable Diffusion을 위한 인기 있는 제3자 시스템인 ControlNet과 호환되며, 저자들은 이를 사용하여 더 나은 결과를 생성할 수 있다고 주장합니다.

결론

이 새로운 논문에서 가장 주목할 만한 발견은 잠재 확산 모델이 실제로 분리될 수 있는 것과는 달리, 이미지 및 비디오의 측면을 분리하는 데 어려움을 겪을 수 있다는 것입니다.

이 연구는 또한 연구 및 취미 커뮤니티가 모델의 약점을 해결하기 위해 미세 조정을 사용하는 정도를 강조합니다. 이러한 솔루션은 특정 클래스 및 객체 유형에 대해 잘 작동하거나 더 높은 데이터 양으로 인해 더 많은 클래스 및 객체에서 중간 정도로 작동할 수 있습니다. 그러나 이러한 접근 방식은 사용자에게 데이터 큐레이션 및 훈련 부담을 줄 수 있으며, 새로운 클래스에 대한 추가 미세 조정을 수행하는 것은 사용자에게 부담을 줄 수 있습니다.

따라서 이러한 노력 중 하나인 솔루션이 이러한 노동 집약적이고 논쟁의 여지가 있는 솔루션에 의존하지 않는다는 것은 환영할 만한 일입니다.

* 1978년 슈퍼맨 영화를 촬영할 때, 배우 크리스토퍼 리브는 블루 스크린 프로세스 샷을 위해 터키석 슈퍼맨 코스튬을 착용해야 했습니다. 이는 아이코닉한 블루 코스튬이 지워지는 것을 방지하기 위해서입니다. 코스튬의 블루 색상은 나중에 컬러 그레이딩을 통해 복원되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]