Anderson의 관점

모델 버전 업그레이드에 생존할 수 있는 LoRAs를 향하여

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

최근에 저는 Hunyuan Video LoRAs의 성장에 대한 내용을 다루었으며, Civit 커뮤니티에서 관련 LoRAs의 수가 185% 증가했습니다.

Hunyuan Video LoRA를 만들기 위한 쉬운 방법은 없지만, Civit의 유명인과 테마 LoRAs 카탈로그는 매일 증가하고 있습니다. 출처: https://civitai.com/

Hunyuan Video LoRA를 만들기 위한 쉬운 방법은 없지만, Civit의 유명인과 테마 LoRAs 카탈로그는 매일 증가하고 있습니다. 출처: https://civitai.com/

이 커뮤니티는 Hunyuan Video의 ‘추가 개인성’을 생산하는 방법을 배우고자 하는데, 또한 Hunyuan Video의 이미지-비디오(I2V) 기능의 출시를 기다리고 있습니다.

오픈 소스 인간 이미지 합성의 경우, 이것은 큰 문제입니다. Hunyuan LoRAs의 성장과 결합하여, 이것은 사용자가 사진을 비디오로 변환할 수 있는 방법을 제공할 수 있습니다. 현재의 모든 상태 오픈 이미지-비디오 생성기,包括 Kling, Kaiber, 및 RunwayML과 달리, 이것은 사용자의 정체성을 유지할 수 있습니다.

재생을 클릭하세요. RunwayML의 최신 Gen 3 Turbo 모델에서 생성된 이미지-비디오 생성입니다. 그러나, 모든 유사한 모델과 달리, 이것은 카메라에서 물체가 돌아가면 정체성을 유지할 수 없습니다. 그리고, 시작 이미지의 특징은 ‘일반적인 확산 여성’으로 변합니다.. 출처: https://app.runwayml.com/

사용자 지정 LoRA를 개발하여, HV I2V 워크플로에서 실제 사진을 시작점으로 사용할 수 있습니다. 이것은 모델의 잠재 공간에 임의의 숫자를 보내고, 결과적으로 발생하는 시맨틱 시나리오를 기다리는 것보다 더好的 ‘시드’입니다. 사용자는 LoRA 또는 여러 LoRA를 사용하여 정체성, 헤어 스타일, 의류 및 기타 생성의 중요한 측면을 유지할 수 있습니다.

이러한 조합의 가용성은 Stable Diffusion의 출시 이후 가장 중요한 발전일 수 있습니다. 오픈 소스 애호가들에게 강력한 생성 능력을 제공하는 동시에, 현재 인기 있는 생성 비디오 시스템의 콘텐츠 검열을 제공하지 않습니다.

현재, Hunyuan 이미지-비디오는 Hunyuan Video GitHub 저장소에서 체크되지 않은 ‘할 일’입니다. 호비스트 커뮤니티는 Discord에서 Hunyuan 개발자의 댓글을 보고 있으며, 이 기능의 출시가 모델이 ‘너무 검열되지 않다’는 이유로 Q1 말로 연기되었다고 합니다.

Hunyuan Video의 공식 기능 출시 체크리스트. 출처: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Hunyuan Video의 공식 기능 출시 체크리스트. 출처: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

정확하거나 아니거나, 저장소 개발자들은 Hunyuan 체크리스트의 나머지 부분에 상당히 충실했으며, 따라서 Hunyuan I2V는 결국 출시될 것입니다. 검열된, 비검열된, 또는某种方式로 ‘잠금 해제’될 것입니다.

그러나, I2V 출시가 별도의 모델 전체로 나타날 가능성이 크므로, 현재 Civit 및 다른 곳에서 번창하는 HV LoRAs 중 하나도 그것과 작동할 가능성이 낮습니다.

이 시나리오에서, LoRA 훈련 프레임워크는 Musubi Tuner 및 OneTrainer와 같은 훈련 프레임워크가 새 모델을 지원하거나 재설정될 것입니다. 한편, 기술적으로 가장熟練한 유튜브 AI 전문가 중 일부는 Patreon을 통해 자신의 솔루션을 랜섬할 것입니다.

업그레이드 피로

거의 никто도 업그레이드 피로를 경험하지 않습니다. LoRA 또는 미세 조정 애호가와 같이, 생성적 인공지능의 급격한 발전은 Stability.ai, Tencent, Black Forest Labs와 같은 모델 공장을 더 큰 모델을 생산하도록鼓励합니다.

이 새로운 모델은 최소한 다른 편향과 가중치를 가지며, 더 일반적으로 다른 규모와/또는 아키텍처를 가질 것입니다. 이는 미세 조정 커뮤니티가 새로운 버전을 위해 데이터를 다시 가져와서 훈련 과정을 반복해야 함을 의미합니다.

이러한 이유로, Civit에는 다양한 Stable Diffusion LoRA 버전이 있습니다.

civit.ai의 검색 필터 옵션에서 시각화된 업그레이드 트레일

civit.ai의 검색 필터 옵션에서 시각화된 업그레이드 트레일

이러한 가벼운 LoRA 모델은 더 높은 또는 더 낮은 모델 버전과 상호 운용성이 없으며, 많은 경우에는 이전 모델에 종속된 인기 있는 대규모 머지 및 미세 조정에 의존합니다. 따라서 커뮤니티의 상당한 부분은 ‘레거시’ 릴리즈를 유지하는 경향이 있습니다.

변화에 적응

이 주제는 Qualcomm AI Research의 새로운 논문으로 인해 떠올랐습니다. 이 논문은 기존 LoRAs를 새로운 모델 버전으로 ‘업그레이드’할 수 있는 방법을 개발했다고 주장합니다.

모델 버전 간 LoRAs의 예시 변환. 출처: https://arxiv.org/pdf/2501.16559

모델 버전 간 LoRAs의 예시 변환. 출처: https://arxiv.org/pdf/2501.16559

이 접근법은 LoRA-X라고 불리며, 기존 LoRAs를 새로운 모델 버전으로 전환할 수 있습니다. 그러나, 이것은 모든 모델 유형 간에 자유롭게 전환할 수 있는 것은 아닙니다. Stable Diffusion v1.5에서 SDXL로의 LoRA 전환 및 TinyLlama 3T 모델에서 TinyLlama 2.5T로의 전환을 시연했습니다.

LoRA-X는 소스 모델의 하위 공간 내에서 어댑터를 보존하여 다른 모델 버전 간에 LoRA 매개변수를 전송합니다. 그러나, 이것은 모델 버전 간에 충분히 유사한 부분만 가능합니다.

LoRA-X 소스 모델의 어댑터를 미세 조정하는 방법의 스키마. 출처: https://arxiv.org/pdf/2501.16559

LoRA-X 소스 모델의 어댑터를 미세 조정하는 방법의 스키마. 출처: https://arxiv.org/pdf/2501.16559

이 접근법은 훈련이 필요하지 않습니다. 그러나, 이것은 모델 버전 간에 전환할 수 있는 것은 아닙니다.

이 방법은 LoRA-X의 여러 단점이 있으므로, 이 논문을 깊이 있게 분석하지는 않습니다.

다른 PEFT 접근법

LoRAs를 더 포터블하게 만드는 가능성은 문헌에서 작은 nhưng 흥미로운 연구 주제입니다. LoRA-X는 이 추구에 기여하는 주된 내용은 훈련이 필요하지 않다는 것입니다. 그러나, 이것은 이전 방법보다 훈련이 적게 필요합니다.

LoRA-X는 Parameter-Efficient Fine-Tuning (PEFT) 방법의 또 다른 엔트리입니다. PEFT는 대규모 사전 훈련된 모델을 특정 작업에 적응시키는 데 필요한 훈련을 최소화하는 것을 목표로 합니다.

주목할만한 것들 중에는 다음이 있습니다.

X-Adapter

X-Adapter 프레임워크는 모델 간에 미세 조정된 어댑터를 전송합니다. 이 시스템은 Stable Diffusion v1.5와 같은 기본 확산 모델에서 미세 조정된 플러그인 모듈(예: ControlNet 및 LoRA)을 사용하여 업그레이드된 확산 모델인 SDXL과 같은 모델을 직접 작동시킬 수 있도록 설계되었습니다.

이 시스템은 업그레이드된 모델을 제어하는 추가 네트워크를 훈련하여 기본 모델의 플러그인 커넥터를 보존합니다.

X-Adapter의 스키마. 출처: https://arxiv.org/pdf/2312.02238

X-Adapter의 스키마. 출처: https://arxiv.org/pdf/2312.02238

X-Adapter는 원래 SD1.5에서 SDXL로 어댑터를 전송하기 위해 개발되고 테스트되었습니다. LoRA-X는 더 다양한 전송을 제공합니다.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA는 LoRA를 개선한 미세 조정 방법입니다. 이것은 가중치 분해 전략을 사용하여 더 근본적인 매개변수 변경을 허용합니다.

DORA는 단순히 어댑터를 복사하는 대신, 가중치의 크기와 방향과 같은 매개변수를 변경합니다. 출처: https://arxiv.org/pdf/2402.09353

DORA는 단순히 어댑터를 복사하는 대신, 가중치의 크기와 방향과 같은 매개변수를 변경합니다. 출처: https://arxiv.org/pdf/2402.09353

DoRA는 미세 조정을 개선하는 데 중점을 두고 있으며, 모델의 가중치를 크기와 방향으로 분해합니다. 반면에, LoRA-X는 기존 미세 조정된 매개변수를 다른 기본 모델로 전송하는 데 중점을 둡니다.

그러나, LoRA-X 접근법은 DORA에서 개발된 투영 기술을 사용하며, 테스트에서 DORA보다 개선된 DINO 점수를 주장합니다.

FouRA (Fourier Low Rank Adaptation)

FouRA 방법은 2024년 6월에 발표되었습니다. 이것은 Qualcomm AI Research에서 나왔으며, 일부 테스트 프롬프트와 테마를 공유합니다.

LoRA와 FouRA를 사용하여 'Blue Fire'와 'Origami' 스타일 어댑터를 위한 Realistic Vision 3.0 모델의 분포 붕괴 예시. 출처: https://arxiv.org/pdf/2406.08798

LoRA와 FouRA를 사용하여 ‘Blue Fire’와 ‘Origami’ 스타일 어댑터를 위한 Realistic Vision 3.0 모델의 분포 붕괴 예시. 출처: https://arxiv.org/pdf/2406.08798

FouRA는 주파수 도메인에서 LoRA를 개선하는 데 중점을 두고 있으며, 푸리에 변환 접근법을 사용합니다.

이 접근법은 생성된 이미지의 다양성과 품질을 개선하는 데 중점을 둡니다.

LoRA-X는 FouRA보다 더好的 결과를 달성했습니다.

SVDiff

SVDiff는 다른 목표를 가지고 있으며, LoRA-X 논문에서 강조됩니다. SVDiff는 확산 모델의 미세 조정을 개선하는 데 중점을 두고 있으며, 모델의 가중치 행렬 내에서 값을 직접 수정합니다.

이 접근법은 Cut-Mix-Unmix라는 데이터 증강 기술을 사용합니다.

SVDiff에서 다중 주제 생성이 작동하는 방식. 출처: https://arxiv.org/pdf/2303.11305

SVDiff에서 다중 주제 생성이 작동하는 방식. 출처: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix는 모델이 여러 개별 개념을 학습할 수 있도록 설계되었습니다. 이 접근법은 다른 주제의 이미지들을 하나의 이미지로 결합합니다. 그런 다음 모델은 이미지 내의 별개 요소들을 설명하는 프롬프트와 함께 훈련됩니다.

훈련 중에, 추가적인 정규화 항이 교차 주제 간섭을 방지하는 데 도움이 됩니다.

SVDiff는 LoRA-X 테스트에서 제외되었습니다. SVDiff는 컴팩트한 매개변수 공간을 생성하는 데 중점을 둡니다. 반면에, LoRA-X는 원래 모델의 하위 공간 내에서 작동하여 다른 기본 모델 간에 LoRA 매개변수를 전송하는 데 중점을 둡니다.

결론

여기서 논의된 방법은 PEFT의 유일한 주민이 아닙니다. 다른 방법들로는 QLoRA 및 QA-LoRA, Prefix Tuning, Prompt-Tuning, 어댑터 튜닝 등이 있습니다.

업그레이드 가능한 LoRA는 아마도 알케미의 추구일 것입니다. 현재 지평선에 나타날 가능성이 있는 것은 없으며, 모델 버전 간의 아키텍처 및 매개변수 변경에 생존할 수 있는 가중치 수정 프로토콜은まだ 문헌에서 나타나지 않았습니다.

첫 번째로 게시됨: 2025년 1월 30일 목요일

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]