Anderson의 관점
엔비디아의 eDiffi 확산 모델은 ‘단어로 그림 그리기’와 더 많은 것을 가능하게 합니다

안정적인 확산과 같은 잠재적인 확산 생성 이미지 모델을 사용하여 정확한 구성도를 만들 수는 있지만, 시스템이 비록 놀라운 세부 사항을 생성하고 단순한 텍스트 프롬프트에서 비록 놀라운 이미지를 생성할 수 있는 것과 같은 상상력과 해석력을 사용하여 이미지 생성을 제어하는 것은 어려울 수 있습니다.
이제, 엔비디아 연구에서 제시한 새로운 접근 방식인 eDiffi(ensemble diffusion for images)는 파이프라인 전체에 동일한 방법을 사용하는 대신 여러 개의 임베딩과 해석 방법을 혼합하여 생성된 콘텐츠에 대한 제어 수준을 크게 향상시킵니다. 아래 예제에서 사용자는 텍스트 프롬프트의 단어를 나타내는 각 색상으로 요소를 페인팅합니다.

‘단어로 그림 그리기’는 엔비디아의 eDiffi 확산 모델의 두 가지 새로운 기능 중 하나입니다. 각 색상은 프롬프트의 단어를 나타내며, 적용된 색상 영역은 해당 요소만으로 구성됩니다. 더 많은 예제와 더 높은 해상도를 보려면 공식 비디오를 참조하십시오. https://www.youtube.com/watch?v=k6cOx9YjHJc
실제로 이것은 ‘마스크로 그림 그리기’이며, 안정적인 확산의 npainting 패러다임을 반대로 합니다. 안정적인 확산은 깨진 이미지나 원래 크기와 같을 수 있는 이미지의 확장을 기반으로 합니다.
이곳에서는 사용자가 캔버스의 크기를 미리 설정한 후 각 요소를 별도로 추가할 수 있습니다.

새 논문의 예제입니다. 출처: https://arxiv.org/pdf/2211.01324.pdf
eDiffi에서 사용되는 다양한 방법은 또한 시스템이 긴 텍스트 프롬프트에서 모든 요소를 포함하는 데 더 좋은 일을 합니다. 안정적인 확산과 오픈AI의 DALL-E 2는 프롬프트의 일부를 우선시하는 경향이 있습니다.

논문에서: eDiffi는 최대 가능한 요소 수를 렌더링할 때까지 프롬프트를 더彻底하게 반복합니다. 개선된 결과는 체리 피킹되었지만, 안정적인 확산과 DALL-E 2의 비교 이미지도 체리 피킹되었습니다.
또한, 전용 T5 텍스트-텍스트 인코더를 사용하면 eDiffi가 이해할 수 있는 영어 텍스트를 렌더링할 수 있습니다.

eDiffi의 전용 텍스트-텍스트 처리는 텍스트를 이미지에verbatim으로 렌더링할 수 있습니다.
새 프레임워크의 또 다른 장점은 단일 이미지로 스타일 프롬프트를 제공할 수 있다는 것입니다.

스타일 전송은 참조 이미지에서 텍스트-이미지 프롬프트 또는 이미지-이미지 프롬프트로 적용할 수 있습니다.
새 논문은 eDiffi: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers라고 제목이 붙여졌습니다.
T5 텍스트 인코더
eDiffi에서 사용된 구글의 Text-to-Text Transfer Transformer(T5)는 개선된 결과를 보여주는 핵심 요소입니다. 평균적인 잠재적인 확산 파이프라인은 훈련된 이미지와 함께 제공된 캡션 사이의 연관성을 중심으로 합니다.

T5의 텍스트-기반 변환, 이는 eDiffi(그리고 잠재적으로 다른 잠재적인 확산 모델)에서 생성 이미지 워크플로우를 지원할 수 있습니다. 출처: https://arxiv.org/pdf/1910.10683.pdf
소스 텍스트를 재구성하고 T5 모듈을 실행하면 원래 모델에 훈련된 것보다 더 정확한 연관성과 표현을 얻을 수 있습니다.
저자들은 다음과 같이 설명합니다:
‘대부분의 확산 모델 연구에서, 노이즈 레벨에 걸쳐 공유되는 노이즈 제거 모델이 있으며, 시간 동적은 노이즈 제거 모델에 피드되는 단순한 시간 임베딩을 사용하여 표현됩니다. 우리는 노이즈 제거 확산의 복잡한 시간 동적이 제한된 용량의 공유 모델로 효과적으로 학습되지 않을 수 있다고 주장합니다.
‘대신, 우리는 노이즈 제거 모델의 용량을 전문가 노이즈 제거기 앙상블을 도입하여 확장합니다. 각 전문가 노이즈 제거기는 특정 노이즈 레벨 범위에 특화된 노이즈 제거 모델입니다.这样, 우리는 모델의 용량을 증가시킬 수 있습니다.

eDiffi의 개념적 아키텍처입니다.
기존의 CLIP 인코딩 모듈은 DALL-E 2와 안정적인 확산에 포함되어 있으며, 텍스트 관련 사용자 입력에 대한 대체 이미지 해석을 찾을 수 있습니다. 그러나, 이러한 모듈은 원래 모델과 유사한 정보로 훈련되며, eDiffi에서 T5와 같은 별도의 해석 계층으로 사용되지 않습니다.
저자들은 eDiffi가 T5와 CLIP 인코더를 단일 파이프라인에 통합한 최초의 시도라고 말합니다:
‘이 두 인코더는 서로 다른 목표로 훈련되므로, 동일한 입력 텍스트에 대해 서로 다른 이미지 형성을 선호합니다. CLIP 텍스트 임베딩은 생성된 이미지의 전반적인 외관을 결정하는 데 도움이 됩니다.
‘반면, T5 텍스트 임베딩만을 사용하여 생성된 이미지에서는 텍스트에 설명된 개별 객체가 더 잘 반영되지만, 전반적인 외관은 덜 정확합니다. 이 두 가지를 함께 사용하면 우리 모델에서 최고의 이미지 생성 결과를 얻을 수 있습니다.’
확산 프로세스 중단 및 보강
논문은 일반적인 잠재적인 확산 모델이 텍스트를 기반으로 초기 단계에서 노이즈에서 이미지로의 여정을 시작한다고 지적합니다.
노이즈가 텍스트 프롬프트에 대한 약간의 레이아웃으로 해결되면, 텍스트 가이드 측면의 프로세스는 본质적으로 떨어져 나가고, 프로세스의 나머지 부분은 시각적 특성을 보강하는 쪽으로 이동합니다.
이것은 초기 텍스트 가이드 노이즈 해석 단계에서 해결되지 않은 모든 요소를 나중에 이미지에 주입하는 것이 어려운 이유입니다. 두 프로세스(텍스트-레이아웃 및 레이아웃-이미지)는 상대적으로 적은 중복을 가지고 있으며, 기본 레이아웃은 이미지가 생성될 때까지 상당히 얽혀 있습니다.
전문가 잠재력
프로젝트 페이지와 유튜브 비디오의 예제는 PR-친화적 인 meme-타스틱한 이미지 생성에 중점을 두고 있습니다. 일반적으로, 엔비디아 연구는 최신 혁신이 사진 현실적인 워크플로우나 VFX 워크플로우를 개선하고, 심층 가짜 이미지 및 비디오를 개선하는 데의 잠재력을 낮추고 있습니다.
예제에서, 초보자 또는 아마추어 사용자는 특정 요소의 배치에 대한粗略한輪郭를 스케치합니다. 반면, 더 체계적인 VFX 워크플로우에서는, 사용자는 비디오 요소에 대한 텍스트-이미지 프롬프트를 사용하여 여러 프레임의 텍스트-이미지 프롬프트를 사용하여 요소를 해석할 수 있습니다.

런웨이 ML은 이미 AI 기반의 로토스코핑을 제공합니다. 이 예제에서, 주체를 둘러싼 ‘그린 스크린’은 알파 채널을 나타내며, 추출은 실제 그린 스크린 배경의 알고리즘 제거를 통해 이루어졌습니다. 출처: https://twitter.com/runwayml/status/1330978385028374529
훈련된 드림부스 모델과 이미지-이미지 파이프라인을 사용하여 eDiffi를 사용하면, 잠재적인 확산 모델의 한 가지 문제인 시간적 안정성을 해결할 수 있습니다.
방법, 데이터 및 테스트
논문은 eDiffi 모델이 ‘공개 및 사적 데이터셋의 모음’에서 훈련되었으며, 사전 훈련된 CLIP 모델로 필터링되어 이미지의 일반적인 미적 점수를 낮출 수 있는 이미지들을 제거했습니다. 최종 필터링된 이미지 세트는 약 10억 개의 텍스트-이미지 쌍으로 구성됩니다. 훈련된 이미지의 크기는 ‘최단辺가 64 픽셀보다 크다’로 설명됩니다.
여러 모델이 프로세스에 대해 훈련되었으며, 기본 모델과 초해상도 모델은 모두 AdamW 최적화器에서 학습률 0.0001, 가중치 감소 0.01, 배치 크기 2048로 훈련되었습니다.
기본 모델은 256개의 엔비디아 A100 GPU에서 훈련되었으며, 두 개의 초해상도 모델은 각 모델당 128개의 엔비디아 A100 GPU에서 훈련되었습니다.
시스템은 엔비디아의 자체 Imaginaire PyTorch 라이브러리를 기반으로 합니다. COCO 및 Visual Genome 데이터셋은 평가에 사용되었으며, MS-COCO는 테스트에 사용된 특정 변형입니다. 테스트된 라이벌 시스템은 GLIDE, Make-A-Scene, DALL-E 2, 안정적인 확산, 구글의 Imagen 및 Parti입니다.
이전 연구와 마찬가지로, zero-shot FID-30K를 평가 지표로 사용했습니다. 30,000개의 캡션을 COCO 검증 세트에서 추출하여 이미지 합성을 위한 텍스트 프롬프트로 사용했습니다.
합성된 이미지와 실제 이미지 사이의 프레첼 인셉션 거리(FID)를 계산했으며, 생성된 이미지의 CLIP 점수를 기록했습니다.

COCO 2014 검증 데이터셋에서 현재 상태의 접근 방식에 대한 zero-shot FID 테스트 결과입니다. 더 낮은 결과가 더 좋습니다.
테스트 결과, eDiffi는 20억 개의 매개변수가 있는 Parti와 같은 더 높은 매개변수 수를 가진 시스템보다 더 낮은(더好的) 점수를 얻었습니다.
결론
엔비디아의 eDiffi는 기존 시스템에 더 많은 데이터와 복잡성을 추가하는 것보다 더 지능적이고 계층적인 접근 방식을 사용하여 잠재적인 확산 생성 이미지 시스템에서 발생하는 가장 어려운 장애물 중 일부에 대한 대안을 제공합니다.
안정적인 확산의 서브레딧과 디스코드에서는 이미 eDiffi의 코드를 직접 통합하거나 별도의 구현에서 원리를 재현하는 것을 논의하고 있습니다. 그러나, 새로운 파이프라인은 너무나 다르기 때문에, 이것은 SD에 대한 전체 버전 번호의 변경을 구성할 것입니다. 이것은 일부 후방 호환성을 포기하는 대신, 생성된 이미지에 대한 제어 수준을 크게 향상시키는 것을 제공할 것입니다.
最初에 게시됨: 2022년 11월 3일.












