Anderson의 관점
유니튜恩: 구글의 대체 신경 이미지 편집 기술

구글 리서치에서는 텍스트 기반 이미지 편집을 여러 방면에서 공격하고 있으며, 어떤 것이 효과적인지 확인하기 위해 기다리고 있는 것으로 보입니다. 이번 주에 발표된 Imagic 논문에 이어, 검색巨자는 추가적인 잠재적인 방법을 제안했습니다. 이는 이미지 편집을 위한 새로운 잠재적 방법으로, 유니튜恩(UniTune)이라고 합니다.
프로젝트의 예시를 보면, 유니튜恩은 이미지의 의미적 포즈와 아이디어를 실제 이미지 콘텐츠에서 분리하는 데惊異的な 정도의 성과를 달성했습니다.

유니튜恩의 의미적 구성 능력은 뛰어납니다. 위쪽 행의 사진에서 두 사람의 얼굴이 이미지의 나머지 부분에 대한 비범한 변환으로歪曲되지 않은 것을 확인할 수 있습니다. 출처: https://arxiv.org/pdf/2210.09477.pdf
안정적인 확산의 팬들은 이미 알고 있듯이, 이미지의 일부 섹션에 편집을 적용하는 것은 때때로 불가능한 작업일 수 있습니다. AUTOMATIC1111과 같은 인기 있는 배포판은 지역 및 제한된 편집을 위한 마스크를 생성할 수 있지만, 이 과정은 번거롭고 예측할 수 없습니다.
컴퓨터 비전 전문가에게는 明顯한 答案은 이미지에 의미적 분할을 중간에 삽입하는 것입니다. 이는 사용자 개입 없이 객체를 인식하고 분리할 수 있습니다. 최근 이러한 방향으로 몇 가지 새로운 이니셔티브가 있었습니다.
또 다른 가능성은 오픈AI의 영향력 있는 대조적 언어-이미지 사전 훈련(Contrastive Language–Image Pre-training, CLIP) 모듈을 활용하여 메시지-이미지 모델이 사용자에게 렌더링을 보내기 전에 필터 및 품질 관리 모듈로 작동하도록 하는 것입니다. 이 경우 CLIP는 잘못된 또는 적합하지 않은 렌더링을 거부하는 감시자 역할을 합니다. 이는 곧 Stability.ai의 DreamStudio API 주도 포털에서 시행될 예정입니다.
그러나 CLIP는 이러한 시나리오에서 범인과 해결책 모두이기 때문에(이미지의 진화 방식을 알려주기 때문이다), 하드웨어 요구 사항이 로컬 사용자에게 사용할 수 있는 것보다 더 높을 수 있으므로 이 접근 방식이 이상적이지 않을 수 있습니다.
압축 언어
제안된 유니튜恩은 기존 확산 모델(이 경우 구글의 Imagen)을 ‘세부 튜닝’하여 고유한 토큰을 삽입합니다. 이는 텍스트 프롬프트에 포함되어 호출할 수 있습니다.
표면적으로 이는 구글의 DreamBooth와 비슷해 보이거나 텍스트 반전과 비슷해 보일 수 있습니다. 그러나 연구자들은 이러한 접근 방식을 거부했습니다. 텍스트 반전은 중요한 세부 사항을 생략했고, DreamBooth는 수행하기에 더 오래 걸렸고 성능이 더 낮았습니다.
유니튜恩은 DreamBooth와 같은 캡슐화된 의미적 ‘메타 프롬프트’ 접근 방식을 사용합니다. 훈련된 변경 사항은 훈련자에 의해 선택된 고유한 단어를 사용하여 호출할 수 있습니다. 이는 이미 모델에 존재하는 용어와 충돌하지 않습니다.
‘편집 작업을 수행하려면 우리는 “rare_tokens edit_prompt”와 같은 프롬프트(예: “beikkpic 두 개의 개가 레스토랑에” 또는 “beikkpic 미니언”)로 미세 조정된 모델을 샘플링합니다.'”
과정
이미지 편집 작업을 수행하는 두 개의 거의 동일한 논문이 구글에서 같은 주에 도착한 것은 의아할 수 있습니다. 그러나 두 이니셔티브 사이에는 적어도 하나의 명확한 차이가 있습니다. 후자는 ‘압축되지 않은’ 자연어 프롬프트를 사용하여 이미지 편집 작업을 안내하는 반면, 유니튜恩은 DreamBooth 스타일의 고유한 토큰을 훈련합니다.
따라서 이미지를 편집하려면…

유니튜恩 논문에서 – 유니튜恩은 구글의 경쟁 신경 편집 프레임워크인 SDEdit와 대조됩니다. 유니튜恩의 결과는 오른쪽에 있으며, 추정된 마스크는 두 번째 이미지에서 볼 수 있습니다.
이미지 편집을 위해…
이미지 편집을 위해…
유니튜恩 명령은 ‘남자 뒤에 [x]’‘와 같을 것입니다. 여기서 x는 모피 괴물 캐릭터와 관련된 미세하게 조정된 개념에 바인딩된 고유한 단어입니다.
유니튜恩과 이미지는 모두 단일 이미지를 시스템에 입력합니다. 이는 최근 몇 년 동안 많은 GAN 기반 편집 도구가 작동한 방식과 비슷합니다.
그러나 확산 모델에서 이러한 방법의 결과는 비교적 놀랍도록 정확합니다.
세부 튜닝 과정
유니튜恩 방법은 원본 이미지를 확산 모델에 전달하여 수정 방법에 대한 지침을 제공합니다. 이는 모델에 훈련된 방대한 데이터를 사용하여 수행할 수 있습니다. 이는 현재 Stable Diffusion의 img2img 기능을 사용하여 수행할 수 있지만, 원하는 부분을 변경하지 않고 이미지를 변경하는 것은 어렵습니다.
유니튜恩 과정에서 시스템은 ‘세부 튜닝’됩니다. 즉, 모델이 훈련을 재개하고 대부분의 레이어가 언프리즌됩니다. 대부분의 경우, 세부 튜닝은 모델의 일반적인 손실 값을 새로운 측면을 생성하거나 향상시키는 것을 선호하는 방향으로 낮출 것입니다.
그러나 유니튜恩의 경우, 모델의 사본은 처리를 위해 사용되며, 처리가 완료되면 폐기됩니다. 이는 데이터 톤이지만, DreamBooth 팬들의 모델은 최소 2GB입니다.
유니튜恩의 경우, 튜닝은 주로 Imagen의 하위 두 레이어에서 발생합니다. 그러나 연구자들은 가장 큰 超解像 레이어를 최적화하는 데도 잠재적인 가치를 보고 있습니다.
샘플링
변경 사항을 유도하는 데 사용할 수 있는 샘플링 방법은 여러 가지가 있습니다. 분류기 무료 지침(Classifier Free Guidance, CFG)과 같은 Stable Diffusion의 주요 구성 요소도 포함됩니다. CFG는 모델이 렌더링 가능성을 탐색하거나 입력 소스 데이터에 더 잘 부합하도록 제어하는 정도를 정의합니다.
연구자들은 또한 SDEdit의 ‘늦은 시작’ 기술을 실험했습니다. 이는 시스템이 원본 세부 사항을 유지하도록鼓励하는 부분적으로 노이즈에서 시작하는 방식입니다. 연구자들은 이것이 유용한 추가 샘플링 기술이 될 수 있다고 믿습니다.
연구자들은 또한 프롬프트-투-프롬프트(prompt-to-prompt)와 같은 추가 텍스트 기반 기술을 모델에 조건화했습니다.
‘프롬프트 투 프롬프트 설정에서 프롬프트 가이드(prompt guidance)라는 기술이 특히 유용하다는 것을 발견했습니다. ‘
‘프롬프트 가이드는 분류기 무료 지침과 비슷하지만, 기준은 무조건 모델이 아닌 다른 프롬프트입니다. 이는 모델을 두 프롬프트 사이의 델타로 안내합니다.'”
프롬프트 가이드는 CFG와 비슷하지만, 기준은 무조건 모델이 아닌 다른 프롬프트입니다. 이는 모델을 두 프롬프트 사이의 델타로 안내합니다.
그러나 프롬프트 가이드는 CFG가 원하는 결과를 얻지 못하는 경우에만 간혹 필요했습니다.
유니튜恩 개발 중에 발견된 또 다른 새로운 샘플링 접근 방식은 보간법입니다. 이는 이미지의 영역이 충분히 분리되어 있어 원본 이미지와 변경된 이미지 모두에서 보간법을 사용할 수 있습니다.
저자들은 보간법이 잘 작동할 수 있으며, 많은 대상 이미지에서 기본 설정으로 사용할 수 있을 것이라고 제안합니다. 또한 복잡한 occlusions를 협상할 필요가 없는 경우에 비범한 변환을 수행할 수 있다고 관찰합니다.
유니튜恩은 편집 마스크가 있거나 없거나 로컬 편집을 수행할 수 있으며, 또한 편집을 위치시키는 데 있어 해석력과 강건성을 모두 가지고 있습니다.

두 번째 열의 최상단 이미지에서 유니튜恩은 ‘배경에 빨간 기차’를 삽입하도록 지시받았으며, 적절한 위치에 기차를 배치했습니다. 다른 예제에서 이미지의 의미적 무결성이 유지되는 것을 확인할 수 있습니다.
지연
첫 번째 반복은 항상 느릴 수 있으며, 이는 시스템을 최적화하고 속도를 높이는 데 커뮤니티나 기업의 참여가 필요할 수 있습니다. 그러나 유니튜恩과 이미지는 둘 다 편집을 생성하기 위해 주요 기계 학습 매뉴버를 수행하며, 이러한 리소스 집약적인 프로세스가 언제든지 국내 사용으로 축소될 수 있을지疑問입니다.
현재, 입력에서 결과까지의 라운드 트립은 T4 GPU에서 약 3분이며, 추론에는 약 30초가 더 걸립니다. 저자들은 이것이 높은 지연이며, 상호작용에 해당하지 않는다고 인정하지만, 모델이 초기에 조정된 후 편집이 완료될 때까지 사용할 수 있으므로 편집 시간을 줄일 수 있다고 주장합니다.
최초로 게시된 날짜: 2022년 10월 21일.
















