Anderson의 관점
구글의 Imagic과 Runway의 ‘Erase and Replace’를 사용한 AI 지원 객체 편집

이번 주에 두 가지 새로운 AI 기반 그래픽 알고리즘이 객체를 편집하는 새로운 방법을 제공했습니다.
첫 번째는 Imagic입니다. Imagic은 구글 리서치와 이스라엘 공과 대학 및 바이츠만 과학 연구소의 협력으로 개발되었습니다. Imagic은 확산 모델의 미세 조정을 통해 텍스트 조건부 객체 편집을 제공합니다.
누구든지 스테이블 디퓨전에서 한 요소를 변경하려고 시도해 본 사람들은 성공적인 편집마다 5가지 변경이 발생한다는 것을 잘 알고 있습니다. 이것은 현재 많은 스테이블 디퓨전 애호가들이 스테이블 디퓨전과 포토샵 사이를 오가며 이러한 ‘부작용’을 수정하도록 만들고 있습니다. 이 관점에서 Imagic의 성과는 주목할 만합니다.
현재 Imagic에는 아직 프로모션 비디오가 없습니다. 구글의 신중한 태도로 인해 이미지 합성 도구를 출시하는 데에 있어 불확실성이 있습니다.
두 번째는 Runway ML의 Erase and Replace 기능입니다. 이것은 Runway ML의 온라인 기반 기계 학습 기반 시각 효과 유틸리티의 ‘AI Magic Tools’ 섹션에 있는 새로운 기능입니다.

Runway ML의 Erase and Replace 기능, 이미 텍스트-비디오 편집 시스템의 미리 보기에서 볼 수 있습니다. 출처: https://www.youtube.com/watch?v=41Qb58ZPO60
Runway의 Erase and Replace를 먼저 살펴보겠습니다.
Erase and Replace
Erase and Replace는 정지 이미지에서만 작동합니다. 그러나 Runway는 아직 출시되지 않은 텍스트-비디오 편집 솔루션에서 같은 기능을 미리 보기로 제공했습니다.

비디오 버전은 아직 공개되지 않았지만 누구든지 이미지를 테스트할 수 있습니다. 출처: https://twitter.com/runwayml/status/1568220303808991232
Runway ML은 Erase and Replace의 기술 세부 사항을 공개하지 않았습니다. 그러나 HOUSE PLANT를 Reasonably Convincing Bust of Ronald Reagan으로 대체하는 속도는 확산 모델이 엔진이 될 수 있음을 시사합니다.

HOUSE PLANT를 The Gipper로 대체하는 것은 이 정도 빠르지 않지만 빠릅니다. 출처: https://app.runwayml.com/
시스템에는 DALL-E 2 유형의 제한이 있습니다. 이미지 또는 텍스트가 Erase and Replace 필터를 트리거할 경우 경고 메시지가 나타납니다.

Nicole Kidman의 Mural은 diffusion 기반 모델이 DALL-E 2의 이전 시스템적인 실제 얼굴 또는 성적인 콘텐츠 거부를欠如하고 있음을 나타냅니다. 출처: https://www.unite.ai/wp-content/uploads/2022/10/copyright.jpg
Erase and Replace는 객체 교체 시스템으로서 효과적이며, 훌륭한 inpainting을 제공합니다. 그러나 기존의 인식된 객체를 편집할 수는 없습니다. 객체를 대체할 수만 있습니다. 기존 이미지 콘텐츠를 변경하지 않고 주변 물질을 손상시키지 않는 것은 훨씬 더 어려운 작업입니다.
Imagic
이 작업은 Imagic이 해결합니다. 새로운 논문은 여러 예제를 제공합니다. 이 예제들은 사진의 개별 요소를 성공적으로 수정하면서 나머지 이미지는 변경하지 않습니다.

Imagic에서 수정된 이미지에는 Deepfake 인형의 특징적인 늘리기, 왜곡 및 ‘occlusion guessing’이 없습니다.
시스템은 세 단계로 이루어져 있습니다. 텍스트 임베딩 최적화, 모델 미세 조정 및 수정된 이미지 생성이 있습니다.

Imagic은 대상 텍스트 프롬프트를 인코딩하여 초기 텍스트 임베딩을 검색한 다음 결과를 최적화하여 입력 이미지를 얻습니다. 그런 다음 생성 모델을 미세 조정하여 소스 이미지에 추가 매개 변수를 추가한 다음 요청된 보간에 대해 적용합니다.
프레임워크는 구글의 Imagen 텍스트-비디오 아키텍처에 기반합니다. 연구자들은 시스템의 원리가 잠재 확산 모델에도 광범위하게 적용될 수 있다고 말합니다.
Imagen은 세 개의 티어 아키텍처를 사용합니다. 이는 구글의 최근 텍스트-비디오 반복에서 사용된 7티어 배열과 다릅니다. 세 개의 개별 모듈은 64x64px 해상도의 생성 확산 모델, 256x256px로 업스케일링하는 슈퍼 해상도 모델 및 1024×1024 해상도로 출력하는 추가 슈퍼 해상도 모델로 구성됩니다.
Imagic은 이 프로세스의 초기 단계에 개입하여 64px 단계에서 Adam 옵티마이저를 사용하여 요청된 텍스트 임베딩을 최적화합니다.

Diffusion, GAN 또는 NeRF 모델에서 렌더링된 객체의 색상을 변경하려고 시도한 사용자는 Imagic이 이러한 변환을 수행하는 것이 얼마나 중요한지 알고 있습니다.
미세 조정은 Imagen의 기본 모델에서 1500 단계당 입력 이미지로 수행됩니다. 동시에 64px > 256px 레이어가 조건부 이미지에서 병렬로 최적화됩니다. 연구자들은 최종 256px > 1024px 레이어에 대한 유사한 최적화가 결과에 거의 영향을 미치지 않는다고 언급했습니다.
연구 논문에 따르면 최적화 프로세스는 TPUV4 칩에서 약 8분이 소요됩니다. 최종 렌더링은 Imagen의 DDIM 샘플링 스키마에서 수행됩니다.
Imagic은 텍스트-비디오 아키텍처를 기반으로 하지만, 연구자들은 시스템의 원리가 잠재 확산 모델에도 광범위하게 적용될 수 있다고 말합니다.
Imagic의 자원 요구 사항과 훈련 시간은 소비자 수준으로 축소될 수 있을지 불확실합니다. 현재로서는 Imagic은 API에 더 적합한 것으로 보입니다. 구글 리서치는 딥페이크를 촉진하는 것에 대해 비판을 받는 것을 피하기 위해 이 환경에서 더 편안함을 느낄 수 있습니다.
첫 번째로 게시됨: 2022년 10월 18일.













