Anderson의 관점

AI 이미지 편집의 정확도 향상

mm
Unite.AI를 Google의 선호 소스에 추가
Images from the paper ' Tight Inversion: Image-Conditioned Inversion for Real Image Editing'

Adobe의 Firefly latent diffusion model (LDM)은 현재 사용 가능한 최고의 모델 중 하나이지만, Photoshop 사용자들은 이미지를 쉽게 편집할 수 없다는 것을 알게 될 것입니다. 대신, 사용자가 선택한 영역을 텍스트 프롬프트에 기반한 이미지로 대체합니다. 그러나 Firefly는 생성된 이미지를 원본 이미지의 컨텍스트에 통합하는 데 능숙합니다.

현재 베타 버전의 Photoshop는 참조 이미지를 부분 이미지 프롬프트로 포함할 수 있습니다. 이것은 Stable Diffusion 사용자가 2년 동안 즐겨온 기능과 유사하며, Controlnet과 같은 第三方 프레임워크 덕분에 가능합니다.

현재 베타 버전의 Adobe Photoshop은 선택 영역 내에서 새 콘텐츠를 생성할 때 참조 이미지를 사용할 수 있습니다. 그러나 현재는 성공과 실패가 반복되는 상황입니다.

현재 베타 버전의 Adobe Photoshop은 선택 영역 내에서 새 콘텐츠를 생성할 때 참조 이미지를 사용할 수 있습니다. 그러나 현재는 성공과 실패가 반복되는 상황입니다.

이것은 이미지 합성 연구에서 열린 문제를 보여줍니다. 즉, 확산 모델이 이미지 편집을 수행할 때 원본 이미지를 완전히 재구성하는 대신, 사용자가 선택한 영역을 편집하는 데 어려움을 겪는다는 것입니다.

이 확산 기반 inpaint는 사용자의 프롬프트를 따르지만, 원본 이미지의 주제를 완전히 재창조하여 환경과만 블렌딩합니다. 출처: https://arxiv.org/pdf/2502.20376

이 확산 기반 inpaint는 사용자의 프롬프트를 따르지만, 원본 이미지의 주제를 완전히 재창조하여 환경과만 블렌딩합니다. 출처: https://arxiv.org/pdf/2502.20376

이 문제는 LDM이 이미지 생성을 위해 반복적인 노이즈 제거를 사용하기 때문입니다. 각 단계는 사용자가 제공한 텍스트 프롬프트에 조건화됩니다. 텍스트 프롬프트의 내용은 임베딩 토큰으로 변환되고, Stable Diffusion이나 Flux와 같은 대규모 모델에는 수백만 개의 近似 임베딩 토큰이 있습니다. 이 과정은 계산된 조건부 분포를 목표로 하며, 각 단계는 이 목표를 향한 단계입니다.

이것은 텍스트에서 이미지로의 시나리오입니다. 사용자는 결과를 정확히 예측할 수 없습니다.

대신, 많은 사람들이 이미지를 편집하기 위해 LDM의 강력한 생성 능력을 사용하려고 했습니다. 그러나 이것은 충성도와 유연성 사이의 균형을 잡는 작업입니다.

이미지를 모델의 잠재 공간으로 투영하는 방법은 DDIM inversion과 같은 방법을 사용할 수 있습니다. 목표는 원본 이미지를 가능한 한 정확하게 복구하는 것입니다. 그러나 이미지의 원래 구조에 대한 모델의 충성도가 높을수록, 주요 수정이 어려워집니다.

고양이의 목에 보우 타이가 나타납니다. 그러나 많은 다른 확산 기반 이미지 편집 프레임워크와 마찬가지로, Renoise 아키텍처는 이미지의 외관을 실제로 변경하는 데 어려움을 겪습니다.

고양이의 목에 보우 타이가 나타납니다. 그러나 많은 다른 확산 기반 이미지 편집 프레임워크와 마찬가지로, Renoise 아키텍처는 이미지의 외관을 실제로 변경하는 데 어려움을 겪습니다.

반면에, 편집 가능성을 우선하면, 모델은 원본 이미지를 더 느슨하게 잡아당깁니다. 그러나 이것은 전체적인 일관성을 희생하여 수행됩니다.

미션을 수행했습니다. 그러나 대부분의 AI 기반 이미지 편집 프레임워크에서는 변형이 아닌 조정입니다.

미션을 수행했습니다. 그러나 대부분의 AI 기반 이미지 편집 프레임워크에서는 변형이 아닌 조정입니다.

타이트 인버션

따라서 이번 주에 발표된 새로운 논문의 예제는 현재 상태에 대한 유용한 개선으로 주목할 만합니다. 즉, 모델의 잠재 공간에 투영된 이미지에 미묘한 편집을 적용할 수 있습니다. 편집은 원본 콘텐츠를 덮어쓰지 않고, 원본 이미지를 더 세부적으로 고려합니다.

타이트 인버션을 기존의 인버션 방법에 적용하면, 원본 선택 영역을 더 세부적으로 고려하고, 변환은 원본 물질을 덮어쓰지 않습니다.

타이트 인버션을 기존의 인버션 방법에 적용하면, 원본 선택 영역을 더 세부적으로 고려하고, 변환은 원본 물질을 덮어쓰지 않습니다.

LDM 취미인과 전문가는 이러한 결과를 인식할 수 있습니다. 이것은 Controlnet과 IP-Adapter와 같은 외부 시스템을 사용하여 복잡한 워크플로우에서 생성할 수 있습니다.

새로운 방법은 IP-Adapter와 함께 전용 얼굴 기반 모델을 사용하여 인간 묘사를 위해 타이트 인버션을 사용합니다.

원본 2023 IP-Adapter 논문에서, 원본 물질에 적합한 편집을 만드는 예제입니다. 출처: https://arxiv.org/pdf/2308.06721

원본 2023 IP-Adapter 논문에서, 원본 물질에 적합한 편집을 만드는 예제입니다. 출처: https://arxiv.org/pdf/2308.06721

타이트 인버션의 주요 성과는 복잡한 기술을 단일 플러그인 모달리티로 절차화하여 기존 시스템에 적용할 수 있다는 것입니다.

자연스럽게, 타이트 인버전은 다른 시스템과 마찬가지로 원본 이미지를 조건으로 사용하여 편집된 버전을 생성합니다.

타이트 인버전이 원본 물질에 실제로 혼합된 편집을 적용하는 추가 예제입니다.

타이트 인버전이 원본 물질에 실제로 혼합된 편집을 적용하는 추가 예제입니다.

저자는 타이트 인버전이 기존 방법과 비교하여 상태에 대한 결과를 보고합니다.

방법

초기에는 대규모 언어 모델(Large Language Model, LLM)을 사용하여 이미지 생성을 위한 다양한 텍스트 프롬프트를 생성합니다. 그런 다음 DDIM inversion을 각 이미지에 적용합니다.

이verted 노이즈를 반환한 후, 이미지들은 다시 생성되며, 동일한 조건하에 생성됩니다.

다양한 지표에 대한 DDIM inversion 점수입니다.

다양한 지표에 대한 DDIM inversion 점수입니다.

이미지-의식적

타이트 인버전은 호스트 확산 모델이 실제 이미지를 편집하는 방식을 변경하여, 이미지 자체를 조건으로 사용합니다.

일반적으로, 이미지를 확산 모델의 노이즈 공간으로 투영하는 데에는 시작 노이즈를 추정하는 것이 필요합니다. 그러나 타이트 인버전은 IP Adapter를 사용하여 시각 정보를 모델에 제공하여, 원본 이미지를 더 정확하게 재구성합니다.

이 매개변수는 편집 가능합니다. 원본 이미지의 영향을 증가시키면 재구성이 거의 완벽해집니다. 그러나 감소시키면 더 창의적인 변경이 가능해집니다.

데이터 및 테스트

연구자들은 실제 이미지의 재구성 및 편집 능력에 대한 타이트 인버전의 능력을 평가했습니다.

모든 실험은 Stable Diffusion XL과 DDIM 스케줄러를 사용했습니다. 테스트는 50개의 노이즈 제거 단계와 기본 가이드 스케일 7.5로 수행되었습니다.

이미지 조건에는 IP-Adapter-plus sdxl vit-h가 사용되었습니다.

저자는 타이트 인버전이 기존 방법과 비교하여 상태에 대한 결과를 보고합니다.

결론

타이트 인버전은 LDM 기반 이미지 합성의 가장 어려운 문제 중 하나를 해결하는 것은 아닙니다. 그러나 부담스러운 보조 접근법을 통합하여, AI 기반 이미지 편집의 단일 방법을 제공합니다.

편집 가능성과 충성도 사이의 긴장은 사라지지 않았습니다. 그러나 결과에 따르면, 긴장이 현저히 감소했습니다. 타이트 인버전은 상태에 대한 유용한 개선입니다.

첫 번째로 게시된 날짜: 2025년 2월 28일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai