AI 모델 및 플랫폼

EasyPhoto: 개인용 AI 사진 생성기

mm
Unite.AI를 Google의 선호 소스에 추가
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Web 사용자 인터페이스, 또는 SD-WebUI는 Stable Diffusion 모델을 위한 포괄적인 프로젝트로 Gradio 라이브러리를 사용하여 브라우저 인터페이스를 제공합니다. 오늘, 우리는 AI 초상화와 이미지 생성을 가능하게 하는 혁신적인 WebUI 플러그인인 EasyPhoto에 대해 이야기하겠습니다. EasyPhoto WebUI 플러그인은 다양한 템플릿을 지원하는 여러 사진 스타일과 다중 수정을 지원하는 AI 초상화를 생성합니다. 또한, EasyPhoto의 기능을 더욱 향상시키기 위해 사용자는 SDXL 모델을 사용하여 더 만족스럽고 정확한 결과를 얻을 수 있습니다. 시작해 보겠습니다.

EasyPhoto와 Stable Diffusion 소개

Stable Diffusion 프레임워크는 개발자가 입력 텍스트 설명에 기반하여 현실적인 이미지를 생성하는 데 사용되는 인기 있는 확산 기반 생성 프레임워크입니다. Stable Diffusion 프레임워크의 기능 덕분에 이미지 아웃페인팅, 이미지 인페인팅, 이미지-이미지 번역과 같은 다양한 응용 분야가 있습니다. Stable Diffusion Web UI, 또는 SD-WebUI는 이 프레임워크의 가장 인기 있는 응용 프로그램 중 하나입니다. Gradio 라이브러리를 기반으로 하는 브라우저 인터페이스를 제공하여 Stable Diffusion 모델에 대한 상호 작용 및 사용자 친화적인 인터페이스를 제공합니다. 이미지 생성의 제어 및 사용성을 더욱 향상시키기 위해 SD-WebUI는 여러 Stable Diffusion 응용 프로그램을 통합합니다.

SD-WebUI 프레임워크의 편리성 덕분에 EasyPhoto 프레임워크 개발자는 전체 응용 프로그램이 아닌 Web 플러그인으로 EasyPhoto를 생성하기로 결정했습니다. 기존 방법과는 달리 EasyPhoto 프레임워크는 이미지-이미지 기능을 사용하여 정확하고 현실적인 이미지를 생성합니다. 사용자는 WebUI 내에서 EasyPhoto 프레임워크를 확장으로 쉽게 설치할 수 있으며, 이는 사용자 친화성과 접근성을 더 넓은 사용자에게 제공합니다. EasyPhoto 프레임워크를 사용하면 사용자는 입력 ID와 매우 유사한 고품질의 실제 AI 초상화를 생성할 수 있습니다.

EasyPhoto 프레임워크는 먼저 사용자에게 몇 가지 이미지를 업로드하여 온라인에서 얼굴 LoRA 또는 저랭크 적응 모델을 교육하도록 요청합니다. LoRA 프레임워크는 저랭크 적응 기술을 사용하여 확산 모델을 빠르게 미세 조정합니다. 이 프로세스는 기반 모델이 특정 사용자의 ID 정보를 이해하도록 허용합니다. 훈련된 모델은 이후 기준 Stable Diffusion 모델과 함께 병합 및 통합되어 간섭에 참여합니다. 또한, 간섭 프로세스 동안 모델은 안정적인 확산 모델을 사용하여 간섭 템플릿의 얼굴 영역을 다시 그리려고 시도하며, 입력 이미지와 출력 이미지의 유사성은 다양한 ControlNet 단위에서 검증됩니다.

EasyPhoto 프레임워크는 또한 잠재적인 문제인 경계 아티팩트 및 ID 손실을 해결하기 위해 2단계 확산 프로세스를 사용합니다. 따라서 생성된 이미지에서 시각적 불일치를 최소화하면서 사용자의 ID를 유지합니다. EasyPhoto 프레임워크의 간섭 파이프라인은 초상화 생성에만 국한되지 않으며 사용자의 ID와 관련된 모든 것을 생성할 수 있습니다. 즉, LoRA 모델을 특정 ID에 대해 훈련하면 다양한 AI 사진을 생성할 수 있으며, 가상 시연과 같은 광범위한 응용 분야를 가질 수 있습니다.

요약하면, EasyPhoto 프레임워크

  1. 이미지 생성에서 얼굴 신뢰도를 유지하기 위해 여러 LoRA 모델을 포함하는 새로운 접근 방식을 제안합니다.
  2. LoRA 모델을 최적화하기 위해 강화 학습 방법을 사용하여 얼굴 ID 보상을 직접 최적화합니다.
  3. 고품질의 AI 사진을 생성하기 위한 2단계 inpaint 기반 확산 프로세스를 제안합니다.

EasyPhoto: 아키텍처 및 훈련

다음 그림은 EasyPhoto AI 프레임워크의 훈련 프로세스를 보여줍니다.

그림에서 볼 수 있듯이, 프레임워크는 먼저 사용자에게 훈련 이미지를 입력하도록 요청한 다음 얼굴을 감지하여 얼굴 위치를 감지합니다. 얼굴을 감지한 후에 프레임워크는 미리 정의된 비율을 사용하여 입력 이미지를 얼굴 영역에만 집중하여 자릅니다. 그런 다음 프레임워크는 피부 미화 및 발산 감지 모델을 사용하여 깨끗하고 선명한 얼굴 훈련 이미지를 얻습니다. 이 두 모델은 얼굴의 시각적 품질을 향상시키는 데 중요한 역할을 하며 배경 정보가 제거되고 훈련 이미지는 주로 얼굴을 포함한다는 것을 보장합니다. 마지막으로 프레임워크는 이러한 처리된 이미지를 사용하여 LoRA 모델을 훈련시키고 사용자 특有的 얼굴 특성을 더 효과적으로 이해하도록 합니다.

또한 훈련 단계에서 프레임워크는 중요한 검증 단계를 포함합니다. 여기서 프레임워크는 사용자 입력 이미지와 훈련된 LoRA 모델에 의해 생성된 확인 이미지 사이의 얼굴 ID 격차를 계산합니다. 검증 단계는 LoRA 모델의 융합을 달성하고 훈련된 LoRA 프레임워크가 사용자의 디지털 복제본으로 변환되도록 하는 데 중요한 역할을 하는 기본 프로세스입니다. 또한, 최적의 얼굴 ID 점수를 가진 확인 이미지가 선택되어 얼굴 ID 이미지로 사용되며, 이는 간섭 생성의 ID 유사성을 향상시키기 위해 사용됩니다.

계속해서, 앙상블 프로세스에 따라 프레임워크는 LoRA 모델을 훈련시킵니다. 여기서 가능성 추정은 주요 목표이며 얼굴 ID 유사성을 유지하는 것이 하위 목표입니다. 이 문제를 해결하기 위해 EasyPhoto 프레임워크는 하위 목표를 직접 최적화하기 위해 강화 학습 기술을 사용합니다.결과적으로 LoRA 모델이 학습한 얼굴 특징은 템플릿 간의 일반화와 함께 향상을 보여줍니다.

간섭 프로세스

다음 그림은 EasyPhoto 프레임워크에서 개별 사용자 ID에 대한 간섭 프로세스를 보여줍니다. 이 프로세스는 세 부분으로 나뉩니다.

  • 얼굴 전처리: ControlNet 참조와 전처리된 입력 이미지를 얻는 데 사용됩니다.
  • 첫 번째 확산: 사용자 입력과 유사한 거친 결과를 생성하는 데 도움이 됩니다.
  • 두 번째 확산: 경계 아티팩트를 수정하여 이미지를 더 정확하고 현실적으로 만듭니다.

입력으로, 프레임워크는 훈련 중에 생성된 얼굴 ID 이미지와 간섭 템플릿을 사용합니다. 출력은 사용자의 고유한 외모와 일치하는 고해상도, 정확하고 현실적인 초상화입니다. 이제 이러한 프로세스를 자세히 살펴보겠습니다.

얼굴 전처리

의식적인推論 없이 간섭 템플릿을 기반으로 AI 초상화를 생성하는 방법은 SD 모델을 사용하여 간섭 템플릿의 얼굴 영역을 inpaint하는 것입니다. 또한 ControlNet 프레임워크를 프로세스에 추가하면 사용자 ID를 보존하고 생성된 이미지의 유사성을 향상시킬 수 있습니다. 그러나 ControlNet을 직접 지역 inpaint에 사용하면

  • 입력과 생성된 이미지의 불일치: 템플릿 이미지의 키 포인트와 얼굴 ID 이미지의 키 포인트가 호환되지 않기 때문에 얼굴 ID 이미지를 참조로 사용하여 ControlNet을 사용하는 경우 출력에서 불일치가 발생할 수 있습니다.
  • 인페인팅 영역의 결함: 영역을 마스킹하고 새 얼굴로 inpaint하면 특히 inpaint 경계에서 결함이 발생할 수 있으며, 이는 생성된 이미지의 진실성과 현실성을 부정적으로 영향을 줄 수 있습니다.
  • ControlNet에 의한 ID 손실: 훈련 과정에서 ControlNet 프레임워크를 사용하지 않았기 때문에 간섭 단계에서 ControlNet을 사용하면 훈련된 LoRA 모델이 입력 사용자 ID를 유지하는 능력에 영향을 줄 수 있습니다.

위에서 언급한 문제를 해결하기 위해 EasyPhoto 프레임워크는 세 가지 절차를 제안합니다.

  • 정렬 및 붙이기: 얼굴 붙이기 알고리즘을 사용하여 템플릿과 얼굴 ID 사이의 얼굴 랜드마크의 불일치를 해결합니다. 먼저 모델은 얼굴 ID와 템플릿 이미지의 얼굴 랜드마크를 계산한 다음, 템플릿 이미지의 얼굴 랜드마크를 얼굴 ID 이미지와 일치시키기 위한 어파인 변환 행렬을 결정합니다. 결과 이미지는 얼굴 ID 이미지의 랜드마크를 유지하며 템플릿 이미지와 일치합니다.
  • 얼굴 융합: 얼굴 융합은 마스킹 inpaint로 인한 경계 아티팩트를 수정하는 새로운 접근 방식입니다. 이 방법은 EasyPhoto 프레임워크가 조화된 에지를 보존하고 이미지 생성 프로세스를 안내하도록 허용합니다. 얼굴 융합 알고리즘은 또한 ground truth 사용자 이미지와 템플릿을 융합하여 경계가 더 안정화된 융합된 이미지를 생성합니다. 이는 첫 번째 확산 단계에서 더 나은 출력으로 이어집니다.
  • ControlNet 지시 검증: LoRA 모델은 ControlNet 프레임워크를 사용하여 훈련되지 않았기 때문에 간섭 프로세스에서 사용하면 ID를 유지하는 능력에 영향을 줄 수 있습니다. EasyPhoto 프레임워크는 ControlNet 프레임워크의 영향을 고려하고 다양한 단계의 LoRA 모델을 통합하여 일반화 능력을 향상시킵니다.

첫 번째 확산

첫 번째 확산 단계에서는 템플릿 이미지를 사용하여 고유한 ID를 가진 이미지를 생성합니다. 입력 이미지는 사용자 입력 이미지를 템플릿 이미지와 융합한 것입니다. EasyPhoto 프레임워크는 이미지 생성을 더 제어하기 위해 세 개의 ControlNet 단위를 통합합니다. 첫 번째 ControlNet 단위는 융합된 이미지의 제어에 중점을 두며, 두 번째 ControlNet 단위는 융합된 이미지의 색상을 제어합니다. 마지막 ControlNet 단위는 대체된 이미지의 오픈포즈(실시간 다인물 인체 姿勢 제어)입니다. 이는 템플릿 이미지의 얼굴 구조와 사용자의 얼굴 ID를 모두 포함합니다.

두 번째 확산

두 번째 확산 단계에서는 얼굴 경계 근처의 아티팩트를 세부적으로 조정하고 사용자가 특정 영역을 마스킹하여 전용 영역 내에서 생성의 효과를 향상시킬 수 있습니다. 이 단계에서 프레임워크는 첫 번째 확산 단계에서 얻은 출력 이미지를 사용자 이미지 또는 결과와 융합하여 두 번째 확산 단계의 입력 이미지를 생성합니다. 전반적으로 두 번째 확산 단계는 생성된 이미지의 품질과 세부를 향상시키는 데 중요한 역할을 합니다.

다중 사용자 ID

EasyPhoto의 주요 기능 중 하나는 다중 사용자 ID 생성을 지원하는 것입니다. 다음 그림은 EasyPhoto 프레임워크에서 다중 사용자 ID의 간섭 프로세스 파이프라인을 보여줍니다.

다중 사용자 ID 생성을 지원하기 위해 EasyPhoto 프레임워크는 먼저 간섭 템플릿에서 얼굴을 감지합니다. 이러한 간섭 템플릿은 여러 마스크로 나뉘며, 각 마스크에는 하나의 얼굴만 포함되고 나머지 이미지는 흰색으로 마스킹되어 다중 사용자 ID 생성을 단순화합니다. 사용자 ID 이미지를 생성한 후, 프레임워크는 이러한 이미지를 간섭 템플릿에无缝하게 통합하여 템플릿 이미지와 생성된 이미지를 결합하여 고품질의 이미지를 생성합니다.

실험 및 결과

이제 EasyPhoto 프레임워크에 대한 이해를 바탕으로 EasyPhoto 프레임워크의 성능을 탐구해 보겠습니다.

위 이미지는 EasyPhoto 플러그인을 사용하여 생성되었으며, 스타일 기반 SD 모델을 사용하여 이미지 생성을 수행합니다. 이미지를 보면 생성된 이미지가 현실적이고 정확한 것을 알 수 있습니다.

위에 추가된 이미지는 EasyPhoto 프레임워크를 사용하여 Comic Style 기반 SD 모델로 생성되었습니다. 이미지를 보면 코믹 사진과 실제 사진이 현실적이고 사용자 입력에 근거한 사용자 프롬프트 또는 요구 사항과 매우 유사한 것을 알 수 있습니다.

아래에 추가된 이미지는 EasyPhoto 프레임워크를 사용하여 다인물 템플릿으로 생성되었습니다. 이미지를 보면 생성된 이미지가 명확하고 정확하며 원본 이미지와 유사함을 알 수 있습니다.

EasyPhoto를 사용하면 사용자는 다양한 AI 초상화를 생성하거나 보존된 템플릿을 사용하여 다중 사용자 ID를 생성하거나 SD 모델을 사용하여 간섭 템플릿을 생성할 수 있습니다. 위에 추가된 이미지는 EasyPhoto 프레임워크가 다양한 고품질 AI 사진을 생성하는 능력을 보여줍니다.

결론

이 기사에서 우리는 AI 초상화 및 이미지 생성을 가능하게 하는 혁신적인 WebUI 플러그인인 EasyPhoto에 대해 이야기했습니다. EasyPhoto WebUI 플러그인은 임의의 템플릿을 사용하여 AI 초상화를 생성하며, 현재 EasyPhoto WebUI의 지원은 다양한 사진 스타일과 다중 수정을 포함합니다. 또한, EasyPhoto의 기능을 더욱 향상시키기 위해 사용자는 SDXL 모델을 사용하여 더 만족스럽고 정확한 결과를 얻을 수 있습니다. EasyPhoto 프레임워크는 안정적인 확산 기반 모델과 사전 훈련된 LoRA 모델을 결합하여 고품질의 이미지 출력을 생성합니다.

이미지 생성기에 관심이 있으십니까? 우리는 또한 사용하기 쉬우며 기술 전문 지식이 없는 최고의 AI 헤드샷 생성기최고의 AI 이미지 생성기 목록을 제공합니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.