AI 모델 및 플랫폼

Stability AI, DeepFloyd IF

mm
Unite.AI를 Google의 선호 소스에 추가

Stability AI 및 멀티모달 AI 연구소인 DeepFloyd는 최신 텍스트-이미지 캐스케이드 픽셀 확산 모델인 DeepFloyd IF의 연구 릴리스를 발표했습니다. 이 모델은 초기에 비상업적, 연구 허가 라이선스로 출시되지만 향후 오픈 소스 릴리스가 계획되어 있습니다.

DeepFloyd IF는 다음과 같은 몇 가지 주목할만한 기능을 보유하고 있습니다.

  1. 깊은 텍스트 프롬프트 이해: 이 모델은 T5-XXL-1.1을 텍스트 인코더로 사용하며, 수많은 텍스트-이미지 크로스 어텐션 레이어를 사용하여 프롬프트와 이미지 간의 정렬을 개선합니다.
  2. 일관성 있고 명확한 텍스트와 함께 생성된 이미지: DeepFloyd IF는 다양한 속성과 공간 관계를 가진 객체를 포함하는 이미지를 생성할 수 있습니다.
  3. 고도한寫實性: 이 모델은 COCO 데이터셋에서 6.66의 제로샷 FID 점수를 달성했습니다.
  4. 화면비 전환: 이 모델은 수직, 수평 및 표준 사각형 화면비를 포함하여 비표준 화면비의 이미지를 생성할 수 있습니다.
  5. 제로샷 이미지-이미지 번역: 이 모델은 기본 형태를 유지하면서 이미지의 스타일, 패턴 및 세부 사항을 수정할 수 있습니다.

다음은 DeepFloyd IF에 의해 생성된 일부 예시 개념입니다.

DeepFloyd IF의 모듈러, 캐스케이드, 픽셀 확산 설계는 여러 신경 모듈이 상호 작용하여 구성됩니다. 이 모델은 픽셀 공간에서 작동하며 개별적으로 훈련된 모델을 사용하여 다양한 해상도에서 캐스케이드 방식으로 높은 해상도 데이터를 처리합니다. 이는 낮은 해상도의 샘플을 생성하는 기본 모델과 높은 해상도의 이미지를 생성하는 연속적인 超해상도 모델이 포함됩니다.

이 모델은 10억 개의 (이미지, 텍스트) 쌍을 포함하는 사용자 정의 고품질 LAION-A 데이터셋으로 훈련되었으며, 이는 LAION-5B 데이터셋의 영어 부분의 하위 집합입니다. DeepFloyd의 사용자 정의 필터를 사용하여 워터마크, 음란물 및 기타 부적절한 콘텐츠를 제거했습니다.

DeepFloyd IF의 프로세스

초기에는 DeepFloyd IF가 연구 라이선스로 출시됩니다. 연구자들은 예술, 디자인, 스토리텔링, 가상 현실 및 접근성과 같은 다양한 도메인에서 새로운 애플리케이션 개발을 장려하고자 합니다. 잠재적인 연구를 위해 몇 가지 기술적, 학술적 및 윤리적 연구 질문을 제안했습니다.

기술적 연구 질문에는 다음이 포함됩니다.

  • IF 모델의 성능, 확장성 및 효율성을 개선하기 위한 최적화.
  • 샘플링, 가이드 또는 모델의 세부 튜닝을 통해 출력 품질을 개선합니다.
  • Stable Diffusion 출력을 수정하는 데 사용되는 기술을 DeepFloyd IF에 적용합니다.

학술적 연구 질문에는 다음이 포함됩니다.

  • 전이 학습을 위한 사전 훈련의 역할을 탐색합니다.
  • 이미지 생성에 대한 모델의 제어를 향상합니다.
  • 여러 모달리티를 통합하여 모델의 기능을 텍스트-이미지 합성 너머로 확장합니다.
  • 생성된 이미지의 시각적 특징에 대한 이해를 개선하기 위해 모델의 해석 가능성을 평가합니다.

윤리적 연구 질문에는 다음이 포함됩니다.

  • DeepFloyd IF의 편향을 식별하고 완화합니다.
  • 모델이 소셜 미디어 및 콘텐츠 생성에 미치는 영향을 평가합니다.
  • 모델을 사용하는 효과적인 가짜 이미지 감지기를 개발합니다.

모델의 가중치를 액세스하려면 사용자는 DeepFloyd의 Hugging Face 공간에서 라이선스를 수락해야 합니다. 자세한 정보는 모델의 웹사이트, GitHub 리포지토리, Gradio 데모 또는 DeepFloyd의 Linktree를 통해 공개 논의에 참여할 수 있습니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.