Anderson의 관점

안정적인 확산의 세 가지 도전

mm
Unite.AI를 Google의 선호 소스에 추가

안정적인 확산의 공개적인 잠재 확산 이미지 합성 모델은 지난 2주 전发布되었으며, 이는 1999년 DeCSS 이후 가장 중요한 기술적 공개일 수 있습니다. 이는 2017년 깊은 가짜 코드가 깃허브에 복사되어 깊은 얼굴 연구소와 얼굴 스왑이 된 이후 AI 생성 이미지에서 가장 큰 사건입니다.

한 번에 사용자의 불만을 없애는 Stable Diffusion의 NSFW 필터는 단일 코드 줄을 변경하여 비활성화할 수 있습니다. Stable Diffusion 레딧은 거의 즉시 나타났으며, 개발자와 사용자는 공식 및 NSFW 커뮤니티로 분리되었습니다.

현재, 매일이면 개발자들이 시스템을 채택하여 플러그인과 제3자 추가 기능을 작성하고 있습니다. Krita, Photoshop, Cinema4D, Blender 등 다양한 응용 프로그램 플랫폼에서 이러한 추가 기능을 작성하고 있습니다.

한편, 프롬프트 크래프팅은 전문적인 예술이 되고 있으며, 이는 Stable Diffusion의 초기 商业화가 패트론 수준에서 발생하고 있습니다. 그러나 이러한 초기 商业화는 Conda 기반의 소스 코드 설치 또는 웹 기반 구현의 제한적인 NSFW 필터를 탐색하지 않으려는 사람들을 위해 더 정교한 제공이 필요할 것입니다.

개발과 사용자의 자유로운 탐색은 매우 빠른 속도로 진행되고 있습니다. 따라서 우리는 Stable Diffusion 커뮤니티가 직면하고 극복해야 할 세 가지 도전을 살펴보겠습니다.

1: 타일 기반 파이프라인 최적화

Stable Diffusion은 제한된 하드웨어 자원과 훈련 이미지의 해상도에 대한 하드한 제한으로 인해 개발자가 시스템의 품질과 해상도를 개선하는 방법을 찾을 가능성이 있습니다. 이러한 프로젝트는 시스템의 한계를 이용하여 시스템의 네이티브 해상도인 512×512 픽셀을 초과하는 이미지를 생성하는 것입니다.

Stable Diffusion은 컴퓨터 비전과 이미지 합성과 같은 시스템에서 일반적으로 사용되는 방식으로, 512×512 픽셀의 정방형 비율 이미지로 훈련되었습니다. 따라서 Stable Diffusion은 512×512 픽셀의 정방형 비율로 작동하며, 많은 사용자가 시스템의 제한된 종횡비에서 가장 신뢰할 수 있는 결과를 얻을 수 있다고 보고 있습니다.

다양한 구현에서 RealESRGAN을 사용하여 업스케일링을 수행할 수 있으며, GFPGAN을 사용하여 잘 렌더링되지 않은 얼굴을 수정할 수 있습니다. 그러나 일부 사용자는 이미지를 512x512px 섹션으로 분할하여 더 큰 합성 이미지를 생성하는 방법을 개발 중입니다.

이 1024x576 렌더는 Stable Diffusion의 타일 기반 업스케일링을 사용하여 생성되었습니다.

이 1024×576 렌더는 Stable Diffusion의 타일 기반 업스케일링을 사용하여 생성되었습니다.

이러한 추상적인 예는 많은 세부 사항을 가지고 있으며, 이러한 세부 사항은 시스템의 솔립시스틱 접근 방식에 적합합니다. 그러나 이러한 세부 사항은 더 복잡한 코드 기반 솔루션을 필요로 할 수 있습니다.

Stable Diffusion은 현재 얼굴에 대한 특별한 주의를 기울이는 메커니즘을 가지고 있지 않습니다. 그러나 일부 개발자는 이러한 종류의 ‘향상된 주의’를 구현하는 방법을 고려하고 있습니다.

인간의 얼굴은 내부적으로 완전한 의미 논리가 있으며, 이는 건물의 하단 모서리와 같은 오브젝트의 ‘타일’에는 찾을 수 없습니다. 따라서 Stable Diffusion 출력에서 얼굴을 매우 효과적으로 ‘줌 인’하고 다시 렌더링할 수 있습니다.

왼쪽: Stable Diffusion의 초기 렌더. 오른쪽: Img2Img를 사용하여 개선된 얼굴.

왼쪽: Stable Diffusion의 초기 렌더. 오른쪽: Img2Img를 사용하여 개선된 얼굴.

이러한 프로세스는 유명인 이미지에서만 작동하며, 이는 LAION 데이터 하위 집합에 이미 잘 표현되어 있는 경우에만 가능합니다.

유명인들은 일반적으로 오래된 나이로 렌더링되며, 더 젊은 이미지를 생성하려면 프롬프트에 ‘젊은’ 또는 ‘[년도]’와 같은 어휘를 추가해야 합니다.

일부 유명인들은 LAION 데이터베이스에서 시간에 따라 잘 표현되어 있으며, 이는 Stable Diffusion에서 다양한 연령대의 이미지를 생성할 수 있습니다.

이미지의 해상도를 높이는 타일 기반 접근 방식은 Stable Diffusion에서 높은 품질의 출력을 생성하는 강력한 방법입니다. 그러나 이러한 접근 방식은 더 높은 수준의 주의 메커니즘을 필요로 할 수 있습니다.

2: 인간의 四肢 문제 해결

Stable Diffusion은 인간의 四肢를 묘사하는 데 어려움을 겪습니다. 손이 무작위로 증가하고, 손가락이 합쳐지며, 세 번째 다리가 나타나고, 기존의 四肢가 사라질 수 있습니다. 이는 DALL-E 2와 같은 다른 모델에서도 나타나는 문제입니다.

DALL-E 2와 Stable Diffusion의 렌더에서 四肢 문제가 나타납니다.

DALL-E 2와 Stable Diffusion의 렌더에서 四肢 문제가 나타납니다.

이러한 문제는 데이터 품질의 문제일 수 있습니다.

이미지 합성 시스템을 위한 오픈 소스 데이터베이스는 인간과 인간의 행동에 대한 레이블을 제공할 수 있습니다. 그러나 이러한 레이블은 일관되게 주석이 달리지 않을 수 있으며, 이는 후속 렌더에서 문제를 일으킬 수 있습니다.

한 가지 가능한 해결책은 모델을 재훈련하는 것입니다. 그러나 이는 데이터 큐레이션과 라벨링에 대한 많은 노력과 비용을 필요로 할 수 있습니다.

또 다른 접근 방식은 필터를 적용하여 이러한 내용을 렌더링하는 것을 방지하는 것입니다. 그러나 이는 레이블이 존재하지 않는 경우에만 가능합니다.

3: 사용자 정의

Stable Diffusion의 미래에 대한 가장 흥미로운 가능성 중 하나는 사용자 또는 조직이 수정된 시스템을 개발할 수 있는 것입니다. 이는 LAION 사전 훈련 데이터 범위 외부의 콘텐츠를 시스템에 통합할 수 있습니다.

이러한 수정은 전체 모델을 다시 훈련하는 것보다 더 효율적일 수 있습니다. 그러나 이는 기술 부채를 초래할 수 있습니다.

개발자들은 이미 후속 체크포인트가 이전 버전과 호환되지 않을 수 있다고 언급했습니다. 따라서 Stable Diffusion의 체크포인트를 분기하여 상업 제품으로 개발하는 것은 상당한 약속이 됩니다.

현재 Stable Diffusion의 사용자 정의를 위한 가장 큰 희망은 텍스트적 반전입니다. 이는 사용자가 작은 수의 CLIP-정렬된 이미지를 훈련시킵니다.

이러한 텍스트적 반전은 새로운 개체를 훈련시킬 수 있으며, 이는 스타일 전송 작업에 유용할 수 있습니다. 그러나 이는 제한된 엔티티를 생성할 수 있으며, 이는 사진 현실적인 개체를 삽입하는 것보다 스타일 전송에 더 유용할 수 있습니다.

이러한 텍스트적 반전은 많은 VRAM, 시간, 그리고 인내를 필요로 할 수 있습니다. 그러나 이는 Stable Diffusion의 사용자 정의를 위한 가장 큰 희망입니다.

Stable Diffusion의 사용자 정의를 위한 이러한 접근 방식은まだ 실험 중입니다. 그러나 이는 Stable Diffusion의 미래에 대한 가장 흥미로운 가능성 중 하나입니다.

첫 번째 게시일: 2022년 9월 6일.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]