AI 모델 및 플랫폼
InstantID: 0초 안에 수행되는 영속적 개인 정보 보호 이미지 생성
최근 몇 년 동안 DALL-E, GLIDE, Stable Diffusion, Imagen 등 대규모 텍스트-이미지 확산 모델의 등장으로 인해 AI 기반 이미지 생성 기술은 놀라운 성장과 발전을 거듭해 왔습니다. 이러한 이미지 생성 AI 모델은 고유한 아키텍처와 훈련 방법을 가지고 있지만, 모두 사용자 지정 및 개인화된 이미지 생성을 목표로 하며, 참조 이미지의 일관된 문자 ID, 주제 및 스타일을 기반으로 이미지를 생성하는 것을 공통의焦點으로 가지고 있습니다. 이러한 현대적인 이미지 생성 AI 프레임워크는 이미지 애니메이션, 가상 현실, 전자 상거래, AI 초상화 등 다양한 분야에서 응용 프로그램을 찾았습니다. 그러나 이러한 프레임워크는 모두 공통의 장애물을 가지고 있습니다. 즉, 대부분의 경우 세부적인 개인 정보를 정확하게 보존하는 사용자 지정 이미지를 생성하는 데 어려움을 겪습니다.
세부적인 정보를 보존하는 이미지를 생성하는 것은 특히 높은 신뢰성 및 세부적인 의미를 요구하는 인간의 얼굴 인식과 같은 작업에서 매우 중요합니다. 최근의 연구에서는 LoRA, DreamBooth, Textual Inversion 등과 같은 개인화된 이미지 합성 프레임워크가 크게 발전했습니다. 그러나 이러한 개인화된 이미지 생성 AI 모델은 여전히 실제 환경에서 배포하기에 완벽하지 않습니다. 높은 저장 공간 요구 사항, 여러 참조 이미지의 필요성, 그리고 긴 미세 조정 과정 등이 그 이유입니다. 반면에, 기존의 ID 임베딩 기반 방법은 공개적으로 미리 훈련된 모델과 호환되지 않거나, 수많은 매개변수에 대한 과도한 미세 조정 과정을 필요로 하거나, 높은 얼굴 신뢰성을 유지하지 못합니다.
이러한 문제를 해결하고 이미지 생성 능력을 더욱 향상시키기 위해, 본 문서에서는 InstantID라는 확산 모델 기반의 이미지 생성 솔루션에 대해 논의할 것입니다. InstantID는 다양한 스타일로의 이미지 생성과 개인화를 수행하는 플러그 앤 플레이 모듈입니다. 단일 참조 이미지로 높은 신뢰성을 보장하는 것을 목표로 합니다. 본 문서의 주요 목적은 InstantID 프레임워크의 기술적 기반과 구성 요소를 자세히 살펴보는 것입니다.
InstantID: 0초 안에 수행되는 영속적 개인 정보 보호 이미지 생성
텍스트-이미지 확산 모델의 등장은 이미지 생성 기술의 발전에 크게 기여했습니다. 이러한 모델의 주요 목적은 사용자 지정 및 개인화된 이미지 생성입니다. 참조 이미지의 일관된 주제, 스타일, 문자 ID를 사용하여 이미지를 생성하는 것입니다. 이러한 프레임워크의 능력은 일관된 이미지를 생성할 수 있게 해주어, 이미지 애니메이션, AI 초상화 생성, 전자 상거래, 가상 및 증강 현실 등 다양한 산업에서 잠재적인 응용 프로그램을 창출했습니다.
그러나 이러한 프레임워크는 여전히 한 가지 기본적인 문제를 가지고 있습니다. 즉, 세부적인 개인 정보를 정확하게 보존하는 사용자 지정 이미지를 생성하는 데 어려움을 겪습니다. 인간의 얼굴 인식과 같은 작업에서는 높은 신뢰성과 세부적인 의미를 요구하기 때문에, 이러한 이미지를 생성하는 것은 매우 중요합니다. 기존의 텍스트-이미지 모델은 자세한 텍스트 설명에 의존하며, 사용자 지정 이미지 생성을 위한 강한 의미적 관련성을 달성하는 데 어려움을 겪습니다. 일부 대규모 미리 훈련된 텍스트-이미지 프레임워크는 공간 조건 제어를 추가하여 세부적인 구조적 제어를 가능하게 하지만, 이러한 추가와 향상에도 불구하고, 이러한 프레임워크는 참조 이미지와 생성된 이미지의 부분적인 신뢰성만을 달성할 수 있습니다.
이러한 문제를 해결하기 위해, InstantID 프레임워크는 즉각적인 개인 정보 보호 이미지 합성을 목표로 하며, 효율성과 높은 신뢰성 간의 간격을 메우기 위해 단일 얼굴 이미지로 개인화 이미지를 생성하는 데 사용할 수 있는 단순한 플러그 앤 플레이 모듈을 도입합니다. 또한, 참조 이미지의 얼굴 पहच別을 보존하기 위해, InstantID 프레임워크는 새로운 얼굴 인코더를 구현하여 세부적인 이미지 세부 사항을 유지하는 데 필요한 약한 공간적 및 강한 의미적 조건을 추가합니다.
InstantID 프레임워크는 기존의 텍스트-이미지 생성 프레임워크와 세 가지 주요 특징으로 구별됩니다.
- 호환성 및 플러그 가능성: InstantID 프레임워크는 UNet 프레임워크의 전체 매개변수를 훈련하는 대신, 경량 어댑터를 훈련합니다. 따라서 InstantID 프레임워크는 기존의 미리 훈련된 모델과 호환 가능하며, 플러그 앤 플레이 모듈로 사용할 수 있습니다.
- 미세 조정 없음: InstantID 프레임워크의 방법론은 미세 조정을 필요로 하지 않습니다. 즉, 단일 전방 전파만으로 추론을 수행할 수 있으므로, 모델은 실제 환경에서 매우 실제적이고 경제적입니다.
- 우수한 성능: InstantID 프레임워크는 높은 유연성과 신뢰성을 демонстри합니다. 즉, 단일 참조 이미지로도 훈련 기반 방법과 비교할 수 있는 상태-of-the-art 성능을 달성할 수 있습니다.
InstantID 프레임워크의 기여는 다음과 같이 요약할 수 있습니다.
- InstantID 프레임워크는 미리 훈련된 텍스트-이미지 확산 모델을 위한 혁신적인 ID 보존 적응 방법입니다. 효율성과 신뢰성 간의 간격을 메우는 것을 목표로 합니다.
- InstantID 프레임워크는 기존의 미리 훈련된 모델과 호환 가능하며, 동일한 확산 모델을 사용하여 미세 조정을 수행할 수 있습니다. 따라서 기존의 미리 훈련된 모델에서 ID 보존을 수행하는 데 추가 비용이 들지 않습니다.
InstantID: 방법론 및 아키텍처
InstantID 프레임워크는 효율적인 경량 어댑터로, 미리 훈련된 텍스트-이미지 확산 모델에 ID 보존 능력을 부여하는 역할을 합니다.
아키텍처에 대해 이야기하자면, InstantID 프레임워크는 Stable Diffusion 모델을 기반으로 합니다. 이는 저차원 잠재 공간에서 확산 과정을 수행하는 능력으로 유명합니다. 입력 이미지를 받으면, 인코더는 이미지를 잠재 표현으로 매핑하며, 다운샘플링 요인과 잠재 차원을 사용합니다. 또한, 확산 과정은 노이즈가 있는 잠재 상태를 정화하기 위해 denoising UNet 구성 요소를 사용합니다. 조건은 텍스트 프롬프트의 임베딩으로, 미리 훈련된 CLIP 텍스트 인코더 구성 요소를 사용하여 생성됩니다.
InstantID 프레임워크는 또한 ControlNet 구성 요소를 사용하여 미리 훈련된 확산 모델에 공간 제어를 추가합니다. ControlNet 구성 요소는 Stable Diffusion 프레임워크의 UNet 아키텍처를 사용하며, 중간 블록과 인코더 블록에 제로畳み込み 層을 특징으로 합니다. 그러나 ControlNet 구성 요소는 Stable Diffusion 모델과 다르게, 후반의 残差 項이 다릅니다. ControlNet 구성 요소는 공간 조건 정보를 인코딩하여 UNet 블록에 추가하고, 이를 원래 네트워크에 임베딩합니다.
InstantID 프레임워크는 또한 IP-Adapter 또는 이미지 프롬프트 어댑터에서 영감을 받았습니다. 이는 텍스트 프롬프트와 병렬로 실행되는 이미지 프롬프트 기능을 달성하는 새로운 접근 방식을 도입합니다. IP-Adapter 구성 요소는 추가적인 크로스 어텐션 層을 사용하여 이미지 특징을 임베딩하는 고유한 디커플드 크로스 어텐션 전략을 사용합니다.
방법론
간단히 말하자면, InstantID 프레임워크는 단일 참조 ID 이미지로 다양한 스타일이나 포즈의 사용자 지정 이미지를 생성하는 것을 목표로 합니다. 다음 그림은 InstantID 프레임워크의 개요를 제공합니다.

InstantID 프레임워크에는 세 가지 주요 구성 요소가 있습니다.
- ID 임베딩 구성 요소는 이미지의 얼굴 특징에 대한 강력한 의미 정보를 캡처합니다.
- 경량 어댑터 구성 요소는 디커플드 크로스 어텐션 구성 요소를 사용하여 이미지 프롬프트를 사용합니다.
- IdentityNet 구성 요소는 참조 이미지의 세부 특징을 추가적인 공간 제어를 사용하여 인코딩합니다.
ID 임베딩
기존의 FaceStudio, PhotoMaker, IP-Adapter 등과 같은 방법은 미리 훈련된 CLIP 이미지 인코더를 사용하여 시각적 프롬프트를 추출합니다. 그러나 InstantID 프레임워크는 ID 보존 작업에서 강한 의미 정보와 높은 신뢰성을 강조합니다. CLIP 구성 요소의 내재된 한계는 약하게 정렬된 데이터에서 훈련된 결과로, 인코딩된 특징은 주로 색상, 스타일, 구성과 같은 광범위한 의미 정보를 캡처합니다. 이러한 특징은 텍스트 임베딩의 보충으로 작용할 수 있지만, 강한 의미 정보와 높은 신뢰성을 요구하는 ID 보존 작업에는 적합하지 않습니다. 최근의 얼굴 표현 모델 연구, 특히 얼굴 인식과 재구성과 같은 복잡한 작업에서 얼굴 표현의 효율성을 보여주었습니다. InstantID 프레임워크는 이러한 연구를 기반으로 미리 훈련된 얼굴 모델을 사용하여 참조 이미지에서 얼굴 ID 임베딩을 감지하고 추출합니다.
이미지 어댑터
미리 훈련된 텍스트-이미지 확산 모델의 이미지 프롬프트 작업 능력은 텍스트 프롬프트를 보완하는 데 크게 기여합니다. InstantID 프레임워크는 IP-Adapter 모델과 유사한 전략을 사용하여 경량 어댑터 구성 요소를 사용하여 이미지 프롬프트를 지원합니다. 그러나 InstantID 프레임워크는 ID 임베딩을 이미지 프롬프트로 사용하여 의미적으로 풍부한 프롬프트 통합을 달성합니다.
IdentityNet
기존의 방법은 이미지 프롬프트와 텍스트 프롬프트를 통합하지만, InstantID 프레임워크는 이러한 방법이 ID 보존 이미지 생성을 위한 통합 수준이 부족하다고 주장합니다. 또한, 크로스 어텐션 層에서 이미지 토큰과 텍스트 토큰을 직접 추가하면 텍스트 토큰의 제어력을 약화시킬 수 있습니다. InstantID 프레임워크는 이러한 문제를 해결하기 위해 ControlNet을 사용하여 공간 정보를 입력으로 사용하는 컨트롤러블 모듈을 구현합니다.
InstantID 프레임워크는 전통적인 ControlNet 아키텍처에 두 가지 변경을 가합니다. 첫째, 조건 입력으로 5개의 얼굴 키포인트를 사용합니다. 둘째, 크로스 어텐션 層에서 텍스트 프롬프트 대신 ID 임베딩을 사용합니다.
훈련 및 추론
훈련 단계에서, InstantID 프레임워크는 IdentityNet과 이미지 어댑터의 매개변수를 최적화합니다. 미리 훈련된 확산 모델의 매개변수는 고정됩니다. 전체 InstantID 파이프라인은 인간 주제를 특징으로 하는 이미지-텍스트 쌍으로 훈련되며, Stable Diffusion 프레임워크에서 사용되는 작업 특정 이미지 조건과 유사한 훈련 목표를 사용합니다. InstantID 훈련 방법의亮点은 이미지와 텍스트 크로스 어텐션 層을 분리하여 이미지 조건의 가중치를 유연하게 조정할 수 있습니다.
InstantID: 실험 및 결과
InstantID 프레임워크는 Stable Diffusion을 구현하고 LAION-Face 데이터셋으로 훈련합니다. InstantID 프레임워크는 또한 BLIP2 모델을 사용하여 자동으로 생성된 1,000만 개 이상의 인간 이미지로 훈련 데이터를 확장합니다. InstantID 프레임워크는 주로 단일 인물 이미지를 사용하며, 미리 훈련된 얼굴 모델을 사용하여 인간 이미지에서 얼굴 ID 임베딩을 감지하고 추출합니다. 훈련 중에, 미리 훈련된 텍스트-이미지 모델은 고정되고, IdentityNet과 이미지 어댑터의 매개변수만 업데이트됩니다.
이미지 전용 생성
InstantID 모델은 빈 프롬프트를 사용하여 참조 이미지로만 이미지 생성 과정을 안내하며, 결과는 다음 그림에示되어 있습니다.

‘빈 프롬프트’ 생성은 InstantID 프레임워크가 풍부한 의미적인 얼굴 특징을 강력하게 유지하는 능력을 보여줍니다. 그러나 빈 프롬프트를 사용하면 다른 의미 정보를 정확하게 복제하지 못할 수 있습니다. 또한, 그림에서 볼 수 있듯이, 2열부터 4열까지는 이미지와 프롬프트를 사용하며, 생성된 이미지는 텍스트 제어 능력의 저하를 보여주지 않으며, 동일한 ID 일관성을 유지합니다. 마지막으로, 5열부터 9열까지는 이미지, 프롬프트, 및 공간 제어가 사용되며, 미리 훈련된 공간 제어 모델과 호환되는 것을 보여줍니다.

참조 이미지의 수는 생성된 이미지의 품질에 큰 영향을 미칩니다. InstantID 프레임워크는 단일 참조 이미지로 좋은 결과를 생성할 수 있지만, 여러 참조 이미지는 더 높은 품질의 이미지를 생성합니다. InstantID 프레임워크는 이미지 프롬프트로 ID 임베딩의 평균을 사용하기 때문입니다. InstantID 프레임워크와 기존의 상태-of-the-art 모델을 비교하면, InstantID 프레임워크가 인간의 얼굴 특징을 보존하는 능력이 뛰어나다는 것을 알 수 있습니다.

InstantID 프레임워크는 ID 임베딩이 풍부한 의미 정보를 내포하기 때문에, 얼굴 특징을 보존할 수 있습니다. InstantID 프레임워크는 기존의 프레임워크보다 사용자 지정 이미지 생성에서 우수한 성능을 보입니다.

최종 생각
본 문서에서는 InstantID라는 확산 모델 기반의 이미지 생성 솔루션에 대해 논의했습니다. InstantID는 다양한 스타일로의 이미지 생성과 개인화를 수행하는 플러그 앤 플레이 모듈입니다. 단일 참조 이미지로 높은 신뢰성을 보장하는 것을 목표로 합니다. InstantID 프레임워크는 즉각적인 개인 정보 보호 이미지 합성을 목표로 하며, 효율성과 높은 신뢰성 간의 간격을 메우기 위해 단일 얼굴 이미지로 개인화 이미지를 생성하는 데 사용할 수 있는 단순한 플러그 앤 플레이 모듈을 도입합니다.












