Anderson의 관점
제로샷 맞춤화의 어려움: 생성적 AI에서 맞춤화의 도전

만약 인기 있는 이미지 또는 비디오 생성 도구에 자신을 삽입하고 싶지만 이미 유명하지 않아서 기본 모델이 인식하지 못한다면, 자신의 사진을 사용하여 저랭크 적응(Low-Rank Adaptation, LoRA) 모델을 훈련해야 합니다. 이 개인화된 LoRA 모델은 생성 모델이 미래의 출력에서 자신의 정체성을 포함할 수 있도록 합니다.
이것은 이미지 및 비디오 합성 연구 분야에서 일반적으로 맞춤화로 알려져 있습니다. 2022년 여름에 Stable Diffusion이 등장한 지 몇 개월 후에 Google Research의 DreamBooth 프로젝트가 고용량 맞춤화 모델을 제공하면서 처음 등장했으며, 이 프로젝트는 폐쇄형 스키마로 시작되었지만 곧 열광자들에 의해 적응되어 커뮤니티에 공개되었습니다.
LoRA 모델은 곧이어 등장하여 훈련과 파일 크기에서 훨씬 더 가벼운 대안을 제공했으며, 품질에서 거의 손실이 없거나 전혀 손실이 없으면서도 Stable Diffusion과 그 후속 모델들을 위한 맞춤화 분야를 빠르게 지배했습니다. 최근에는 Flux와 같은 새로운 텍스트-이미지 모델 및 Hunyuan Video와 Wan 2.1과 같은 새로운 생성적 비디오 모델이 등장했습니다.
반복과 반복
문제는, 새로운 모델이 등장할 때마다 새로운 LoRA 세트를 훈련해야 하므로 LoRA 제작자에게 상당한 마찰을 일으킵니다. 이들은 맞춤화된 모델을 여러 개 훈련하지만 새로운 모델이나 인기 있는 모델이 등장하면 모든 것을 다시 시작해야 할 수 있습니다.
따라서 최근에는 제로샷 맞춤화 접근 방식이 강력한 연구 주제가 되었습니다. 이 시나리오에서는 데이터셋을 수집하고 자체 하위 모델을 훈련할 필요 없이 생성에 주입할 주체의 사진을 하나 이상 제공하면 시스템이 입력 소스를 블렌DED 출력으로 해석합니다.
아래에서 볼 수 있듯이, PuLID 시스템을 사용하여 얼굴 교환 외에도 ID 값을 스타일 전송에 통합할 수 있습니다.

PuLID 시스템을 사용한 얼굴 ID 전송 예시. 출처: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file
LoRA와 같은 노동 집약적이고 취약한 시스템을 제네릭 어댑터로 대체하는 것은 훌륭한 아이디어이지만, 또한 도전적입니다. LoRA 훈련 과정에서 얻은 극심한 세부 사항과 범위는 일회성 IP-Adapter 스타일 모델에서 모방하기 어렵습니다.
HyperLoRA
이 점을 염두에 두고, ByteDance는 실제 LoRA 코드를 생성하는 시스템을 제안하는 새로운 논문을 발표했습니다. 이는 현재 제로샷 솔루션 중에서 유일한 접근 방식입니다.

입력 이미지(왼쪽)와 출력 이미지(오른쪽)의 예시. 출처: https://arxiv.org/pdf/2503.16944
논문은 다음과 같이述합니다:
‘어댑터 기반 기술은 IP-Adapter와 같이 기초 모델 매개변수를 고정하고 플러그인 아키텍처를 사용하여 제로샷 추론을 가능하게 하지만, 종종 자연스럽지 못하고 진정성 없는 결과를 나타낼 수 있습니다. ‘
‘HyperLoRA는 적응형 플러그인 네트워크를 사용하여 LoRA 가중치를 생성하는 매개변수 효율적인 적응적 생성 방법입니다. 이는 LoRA의 우수한 성능과 어댑터 스키마의 제로샷 기능을 결합합니다. ‘
‘우리의 신중하게 설계된 네트워크 구조와 훈련 전략을 통해 우리는 높은 사진 현실성, 충실도 및 편집 가능성을 갖춘 제로샷 개인화된 초상화 생성을 달성했습니다. ‘
가장 유용한 점은, 훈련된 시스템이 기존 ControlNet과 함께 사용될 수 있으며, 생성에서 높은 수준의 특이성을 제공할 수 있습니다.

HyperLoRA와 ControlNet을 사용한 예시. 출처: https://github.com/lllyasviel/ControlNet
새로운 시스템이 언제 끝 사용자에게 공개될지에 대해서는 ByteDance는 합리적인 기록을 가지고 있습니다. LatentSync 립싱크 프레임워크와 InfiniteYou 프레임워크를 이미 공개했습니다.
부정적으로, 논문은 공개 의도를 나타내지 않으며, 재현에 필요한 훈련 자원은 इतन으로 거대하여 열광자 커뮤니티가 DreamBooth와 같이 재현하기 어렵습니다.
새로운 논문은 HyperLoRA: Parameter-Efficient Adaptive Generation for Portrait Synthesis라는 제목을 가지고 있으며, ByteDance와 ByteDance의 지능형 창작 부서의 7명의 연구자들에 의해 작성되었습니다.
방법
새로운 방법은 Stable Diffusion 잠재 확산 모델(LDM)인 SDXL을 기초 모델로 사용합니다. 훈련 과정은 세 단계로 나뉘어 있으며, 각 단계는 학습된 가중치에서 특정 정보를 분리하고 보존하는 것을 목표로 합니다.
첫 번째 단계는 ‘Base-LoRA’를 학습하는 것으로, 이는 정체성과 무관한 세부 사항을 포착합니다.
두 번째 단계에서는 ‘ID-LoRA’가 도입되며, 여기서 얼굴 정체성을 두 개의 병렬 경로를 통해 인코딩합니다. 하나는 구조적 특징을 위한 CLIP Vision Transformer(CLIP ViT)이고, 다른 하나는 추상적인 정체성 표현을 위한 InsightFace AntelopeV2 인코더입니다.
전이 접근 방식
CLIP 특징은 모델이 빠르게 수렴하도록 도와주지만, 과적합의 위험이 있습니다. 반면에 Antelope 임베딩은 더 안정적이지만 훈련에 더 오래 걸립니다. 따라서 시스템은 처음에 CLIP에 더 많이 의존하고, 점차적으로 Antelope를 चरण적으로 도입하여 불안정성을 피합니다.
최종 단계에서는 CLIP 유도된 주의.layers가 완전히 동결됩니다. 오직 AntelopeV2와 연결된 주의 모듈만이 계속 훈련되며, 모델이 정체성 보존을 개선하는 동시에 이전에 학습된 구성 요소의 충실도와 일반성을 저하하지 않도록 합니다.
이 단계적 구조는 본질적으로 분리(disentanglement)의 시도입니다. 정체성과 비정체성 특징이 먼저 분리되고, 이후 독립적으로 세부화됩니다. 이는 개인화의 일반적인 실패 모드에 대한 체계적인 반응입니다.
무게를 두면서
CLIP ViT와 AntelopeV2가 주어진 초상화에서 구조적 특징과 정체성 특징을 추출한 후, 얻은 특징은 변압기 기반 모듈인 퍼시버 리샘플러를 통해 컴팩트한 계수 집합으로 매핑됩니다.
두 개의 별도 리샘플러가 사용됩니다. 하나는 Base-LoRA 가중치를 생성하는 데 사용되며, 다른 하나는 ID-LoRA 가중치를 생성하는 데 사용됩니다.

HyperLoRA 네트워크 구조.
출력 계수는 학습된 LoRA 기저 행렬과 선형적으로 결합되어, 기초 모델을 미세 조정할 필요 없이 완전한 LoRA 가중치를 생성합니다.
이 접근 방식은 시스템이 이미지 인코더와 경량 프로젝션만을 사용하여 개인화된 가중치를 완전히 즉석에서 생성할 수 있도록 합니다.
데이터 및 테스트
HyperLoRA를 훈련하기 위해, 연구자들은 LAION-2B 데이터셋의 4.4백만 개의 얼굴 이미지 하위 집합을 사용했습니다.
InsightFace를 사용하여 비초상화 얼굴과 여러 이미지를 필터링했습니다. 이미지는 BLIP-2 캡션 시스템으로 주석이 달렸습니다.
데이터 증강에 있어서, 이미지는 얼굴 영역에 집중하면서 무작위로 자르졌습니다.
LoRA 랭크는 훈련 설정에서 사용 가능한 메모리에 따라 조정해야 했습니다. 따라서 ID-LoRA의 LoRA 랭크는 8로 설정되었으며, Base-LoRA의 랭크는 4로 설정되었습니다. 여덟 단계의 그래디언트 누적을 사용하여 실제보다 더 큰 배치 크기를 시뮬레이션했습니다.
연구자들은 Base-LoRA, ID-LoRA(CLIP), 및 ID-LoRA(정체성 임베딩) 모듈을 순차적으로 20K, 15K, 및 55K 반복으로 훈련했습니다. ID-LoRA 훈련 중에, 세 가지 조건 시나리오에서 0.9, 0.05, 및 0.05의 확률로 샘플링했습니다.
시스템은 PyTorch와 Diffusers를 사용하여 구현되었으며, 전체 훈련 과정은 16개의 NVIDIA A100 GPU에서 약 10일 동안 실행되었습니다.
ComfyUI 테스트
저자는 ComfyUI 합성 플랫폼에서 HyperLoRA를 InstantID, IP-Adapter-FaceID-Portrait, 및 PuLID와 비교하기 위해 워크플로우를 구축했습니다. 일관된 시드, 프롬프트, 및 샘플링 방법이 모든 프레임워크에서 사용되었습니다.
저자는 어댑터 기반 방법은 일반적으로 LoRA 기반 방법보다 더 낮은 CFG 스케일을 요구하는 반면, HyperLoRA는 이 점에서 더 관대하다고 주목합니다.
따라서 연구자들은 공정한 비교를 위해 LEOSAM의 Hello World XL 체크포인트를 사용했습니다. 정량적 테스트에서는 Unsplash-50 이미지 데이터셋을 사용했습니다.
메트릭
충실도 벤치마크로, 저자는 CLIP 이미지 임베딩 및 CurricularFace를 통해 추출된 별도의 정체성 임베딩 사이의 코사인 거리를 측정했습니다.
각 방법은 테스트 세트의 정체성당 4개의 고해상도 헤드샷을 생성했으며, 결과는 평균화되었습니다.
편집 가능성은 CLIP-I 점수를 비교하여 평가되었습니다. 정체성 제약이 이미지에 미친 영향을 확인하기 위해, 정체성 모듈이 있는 경우와 없는 경우의 차이를 분석했습니다.
또한 CLIP 이미지-텍스트 정렬을 10개의 프롬프트 변형에 걸쳐 측정했습니다. 이는 헤어 스타일, 액세서리, 의류, 및 배경과 같은 다양한 요소를 다루었습니다.
Arc2Face 기초 모델도 비교에 포함되었습니다. 이는 고정 캡션 및 자른 얼굴 영역에서 훈련된 모델입니다.
HyperLoRA의 두 가지 변형이 테스트되었습니다. 하나는 오직 ID-LoRA 모듈만을 사용했고, 다른 하나는 ID-LoRA와 Base-LoRA를 모두 사용했으며, 후자는 0.4의 가중치를 가졌습니다. Base-LoRA는 충실도를 개선했지만, 편집 가능성을 약간 제한했습니다.

초기 정량적 비교 결과.
저자는 정량적 테스트에 대해 다음과 같이 주석을 달았습니다:
‘Base-LoRA는 충실도를 개선하지만 편집 가능성을 제한합니다. 우리의 설계는 이미지 특징을 다른 LoRA로 분리하지만, 서로의 영향을 피할 수 없습니다. 따라서, 우리는 Base-LoRA의 가중치를 조정하여 다양한 애플리케이션 시나리오에 적응할 수 있습니다. ‘
‘우리의 HyperLoRA(Full 및 ID)는 최고 및 차순위의 얼굴 충실도를 달성했으며, InstantID는 얼굴 정체성 유사성에서 우수성을 보였지만 얼굴 충실도는 낮았습니다. ‘
‘이 두 가지 지표를 모두 함께 고려하여 충실도를 평가해야 합니다. 얼굴 정체성 유사성은 더 추상적이며, 얼굴 충실도는 더 많은 세부 사항을 반영하기 때문입니다.’
정성적 테스트에서, 다양한 트레이드오프가 나타납니다. 이에 대한 자세한 내용은 원 논문에서 확인할 수 있습니다.
결론
최근 18개월 동안 다양한 제로샷 맞춤화 시스템이 끊임없이 등장하고 있습니다. 이 시스템 중에서 상태 오프 더 아트를 조금이라도 개선한 시스템은 거의 없으며, 개선한 시스템은 훈련 요구량이 지나치게 많거나 추론 요구량이极도로 복잡하거나 자원 집약적입니다.
HyperLoRA의 훈련 체제는 다른 최근 시스템과 마찬가지로 놀라울 정도로 많지만, 적어도 모델이 즉석에서 맞춤화를 처리할 수 있습니다.
추가적으로, HyperLoRA의 추론 속도는 IP-Adapter보다 빠르지만 InstantID와 PuLID보다 느립니다. 이러한 수치는 NVIDIA V100 GPU에서 측정되었으며, 이는 일반 소비자 하드웨어가 아닙니다.

경쟁 방법의 추론 속도(밀리초).
제로샷 맞춤화는 여전히 실제적인 관점에서 풀어야 할 문제입니다. HyperLoRA의 상당한 하드웨어 요구 사항은 진정한 장기적인 단일 기초 모델을 생성하는 능과 상충됩니다.
* NVIDIA A100 GPU의 VRAM은 640GB 또는 1280GB입니다(구체적으로 명시되지 않음).
최초로 2025년 3월 24일 게시됨.







![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)



