Mô hình và nền tảng AI

Hướng tới LoRAs Có Thể Tồn Tại Qua Các Phiên Bản Cập Nhật Mô Hình

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Kể từ khi tôi đã đưa tin về sự phát triển của các LoRAs Hunyuan Video (các tệp được đào tạo nhỏ, có thể tiêm các tính cách tùy chỉnh vào các mô hình nền tảng văn bản-sang-video và hình ảnh-sang-video đa tỷ tham số), số lượng LoRAs liên quan có sẵn tại cộng đồng Civit đã tăng 185%.

Mặc dù không có cách nào dễ dàng hoặc ít công sức để tạo một LoRA Hunyuan Video, nhưng danh mục các LoRAs về người nổi tiếng và chủ đề tại Civit đang phát triển hàng ngày. Nguồn: https://civitai.com/

Mặc dù không có cách nào dễ dàng hoặc ít công sức để tạo một LoRA Hunyuan Video, nhưng danh mục các LoRAs về người nổi tiếng và chủ đề tại Civit đang phát triển hàng ngày. Nguồn: https://civitai.com/

Cùng cộng đồng đang cố gắng học cách sản xuất những ‘tính cách bổ sung’ này cho Hunyuan Video (HV) cũng đang đau khổ vì sự phát hành được hứa hẹn của một chức năng hình ảnh-sang-video (I2V) trong Hunyuan Video.

Về tổng hợp hình ảnh con người mã nguồn mở, đây là một vấn đề lớn; kết hợp với sự phát triển của các LoRAs Hunyuan, nó có thể cho phép người dùng chuyển đổi ảnh của người thành video mà không làm mất đi bản sắc của họ khi video phát triển – điều này hiện đang xảy ra trong tất cả các mô hình hình ảnh-sang-video hiện đại, bao gồm Kling, Kaiber và RunwayML:

Click để phát. Một hình ảnh-sang-video được tạo từ mô hình Gen 3 Turbo của RunwayML. Tuy nhiên, giống như tất cả các mô hình đối thủ tương tự và kém hơn, nó không thể duy trì tính nhất quán của bản sắc khi đối tượng quay lưng lại với máy ảnh, và các đặc điểm riêng biệt của hình ảnh bắt đầu trở thành ‘phụ nữ khuếch tán chung’. Nguồn: https://app.runwayml.com/

Bằng cách phát triển một LoRA tùy chỉnh cho tính cách trong câu hỏi, một người có thể, trong một quy trình I2V của HV, sử dụng một bức ảnh thực của họ làm điểm bắt đầu. Đây là một ‘hạt giống’ tốt hơn nhiều so với việc gửi một số ngẫu nhiên vào không gian tiềm ẩn của mô hình và chấp nhận bất kỳ kịch bản ngữ nghĩa nào kết quả. Sau đó, một người có thể sử dụng LoRA, hoặc nhiều LoRA, để duy trì tính nhất quán của bản sắc, kiểu tóc, quần áo và các khía cạnh quan trọng khác của một thế hệ.

Có khả năng, sự sẵn có của sự kết hợp này có thể đại diện cho một trong những thay đổi mang tính cách mạng nhất trong trí tuệ nhân tạo tạo sinh kể từ khi ra mắt Stable Diffusion, với sức mạnh tạo sinh đáng kể được trao cho các nhà đam mê mã nguồn mở, mà không có sự điều chỉnh (hoặc ‘giám sát’, nếu bạn thích) được cung cấp bởi các censor nội dung trong các hệ thống video gen phổ biến hiện nay.

Khi tôi viết, hình ảnh-sang-video Hunyuan là một mục tiêu chưa được đánh dấu trong kho GitHub của Hunyuan Video, với cộng đồng đam mê báo cáo (theo lời đồn) một bình luận từ một nhà phát triển Hunyuan, người dường như đã tuyên bố rằng việc phát hành chức năng này đã được lùi lại đến một thời điểm nào đó trong Q1 do mô hình quá ‘không được kiểm duyệt’.

Danh sách kiểm tra tính năng phát hành chính thức cho Hunyuan Video. Nguồn: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Danh sách kiểm tra tính năng phát hành chính thức cho Hunyuan Video. Nguồn: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Đúng hay không, các nhà phát triển kho đã thực hiện đáng kể phần còn lại của danh sách kiểm tra Hunyuan, và do đó, Hunyuan I2V dường như sẽ đến cuối cùng, dù có bị kiểm duyệt, không bị kiểm duyệt hay theo một cách nào đó ‘mở khóa’.

Nhưng như chúng ta có thể thấy trong danh sách trên, việc phát hành I2V là một mô hình riêng biệt – điều này khiến nó khá không thể rằng bất kỳ LoRA HV nào hiện tại sẽ hoạt động với nó.

Trong kịch bản này (bây giờ) có thể dự đoán, các khung đào tạo LoRA như Musubi Tuner và OneTrainer sẽ bị lùi lại hoặc đặt lại về việc hỗ trợ mô hình mới. Trong khi đó, một hoặc hai trong số những người có ảnh hưởng về AI trên YouTube sẽ đòi tiền cho các giải pháp của họ thông qua Patreon cho đến khi cảnh quan bắt kịp.

Mệt mỏi khi nâng cấp

Gần như không ai trải qua mệt mỏi khi nâng cấp nhiều như một người đam mê LoRA hoặc đào tạo tinh chỉnh, vì tốc độ thay đổi nhanh chóng và cạnh tranh trong trí tuệ nhân tạo tạo sinh khuyến khích các xưởng mô hình như Stability.ai, Tencent và Black Forest Labs sản xuất các mô hình lớn hơn và (thỉnh thoảng) tốt hơn với tần suất tối đa có thể.

Kể từ khi những mô hình mới và được cải tiến này sẽ ít nhất có các thiên vị và trọng số khác nhau, và thường sẽ có quy mô và/hoặc kiến trúc khác nhau, điều này có nghĩa là cộng đồng tinh chỉnh phải lấy lại các tập dữ liệu của họ và lặp lại quá trình đào tạo khó khăn cho phiên bản mới.

Do đó, nhiều loại LoRA Stable Diffusion khác nhau có sẵn tại Civit:

Con đường nâng cấp, được hình ảnh hóa trong các tùy chọn bộ lọc tìm kiếm tại civit.ai

Con đường nâng cấp, được hình ảnh hóa trong các tùy chọn bộ lọc tìm kiếm tại civit.ai

Vì không có mô hình LoRA nhẹ nào trong số này tương thích với các phiên bản mô hình cao hơn hoặc thấp hơn, và vì nhiều mô hình trong số này có phụ thuộc vào các hợp nhất và tinh chỉnh quy mô lớn phổ biến và gắn liền với một mô hình cũ hơn, một phần đáng kể của cộng đồng có xu hướng gắn bó với một phiên bản ‘di sản’, giống như sự trung thành của khách hàng với Windows XP vẫn tồn tại nhiều năm sau khi hỗ trợ chính thức kết thúc.

Thích nghi với sự thay đổi

Chủ đề này đến trong tâm trí vì một bài báo mới từ Qualcomm (QCOM ) AI Research tuyên bố đã phát triển một phương pháp mà các LoRA hiện có có thể được ‘nâng cấp’ lên một phiên bản mô hình mới được phát hành.

Ví dụ về việc chuyển đổi LoRAs qua các phiên bản mô hình. Nguồn: https://arxiv.org/pdf/2501.16559

Ví dụ về việc chuyển đổi LoRAs qua các phiên bản mô hình. Nguồn: https://arxiv.org/pdf/2501.16559

Điều này không có nghĩa là phương pháp mới, có tên LoRA-X, có thể dịch tự do giữa tất cả các mô hình cùng loại (tức là mô hình văn bản-sang-hình ảnh, hoặc Mô hình Ngôn ngữ Lớn [LLM]); nhưng các tác giả đã chứng minh một sự chuyển đổi hiệu quả của một LoRA từ Stable Diffusion v1.5 > SDXL, và một sự chuyển đổi của một LoRA cho mô hình TinyLlama 3T dựa trên văn bản sang TinyLlama 2.5T.

LoRA-X chuyển các tham số LoRA qua các mô hình cơ sở khác nhau bằng cách bảo tồn phụ kiện trong không gian con của mô hình nguồn; nhưng chỉ trong các phần của mô hình mà đủ tương tự trên các phiên bản mô hình.

Trái: một lược đồ về cách mô hình nguồn LoRA-X tinh chỉnh một phụ kiện, sau đó được điều chỉnh để phù hợp với mô hình đích bằng cấu trúc nội bộ của nó. Phải: hình ảnh được tạo bởi các mô hình đích SD Eff-v1.0 và SSD-1B, sau khi áp dụng các phụ kiện được chuyển từ SD-v1.5 và SDXL mà không cần đào tạo thêm.

Trái: một lược đồ về cách mô hình nguồn LoRA-X tinh chỉnh một phụ kiện, sau đó được điều chỉnh để phù hợp với mô hình đích. Phải: hình ảnh được tạo bởi các mô hình đích SD Eff-v1.0 và SSD-1B, sau khi áp dụng các phụ kiện được chuyển từ SD-v1.5 và SDXL mà không cần đào tạo thêm.

Mặc dù đây là một giải pháp thực tế cho các kịch bản mà việc đào tạo lại là không mong muốn hoặc không thể (chẳng hạn như thay đổi giấy phép trên dữ liệu đào tạo ban đầu), phương pháp này bị hạn chế ở các kiến trúc mô hình tương tự, trong số các hạn chế khác.

Mặc dù đây là một cuộc đột nhập hiếm hoi vào một lĩnh vực chưa được nghiên cứu kỹ, chúng tôi sẽ không kiểm tra bài báo này một cách chi tiết do các hạn chế đáng kể của LoRA-X, như được chứng minh bởi các bình luận từ các nhà phê bình và cố vấn tại Open Review.

Phương pháp này dựa vào tương đồng không gian con hạn chế ứng dụng của nó ở các mô hình liên quan chặt chẽ, và các tác giả đã đồng ý trong diễn đàn xem xét rằng LoRA-X không thể dễ dàng chuyển đổi qua các kiến trúc khác biệt đáng kể

Các phương pháp PEFT khác

Khả năng làm cho LoRAs có thể di chuyển được qua các phiên bản là một chủ đề nghiên cứu nhỏ nhưng thú vị trong tài liệu, và đóng góp chính mà LoRA-X mang lại cho sự theo đuổi này là nó không yêu cầu đào tạo. Điều này không hoàn toàn đúng, nếu một người đọc bài báo, nhưng nó yêu cầu ít đào tạo nhất trong số tất cả các phương pháp trước đó.

LoRA-X là một mục nhập khác trong thể loại PEFT (Đào tạo tinh chỉnh hiệu quả về tham số) các phương pháp, nhằm giải quyết thách thức của việc thích nghi các mô hình tiền đào tạo lớn với các nhiệm vụ cụ thể mà không cần đào tạo lại rộng rãi. Cách tiếp cận này nhằm mục đích sửa đổi số lượng tham số tối thiểu trong khi duy trì hiệu suất.

Đáng chú ý trong số này là:

X-Adapter

Khung X-Adapter chuyển các phụ kiện tinh chỉnh qua các mô hình với một lượng đào tạo lại. Hệ thống này nhằm mục đích cho phép các mô-đun tiền đào tạo (như ControlNet và LoRA) từ một mô hình khuếch tán cơ sở (tức là Stable Diffusion v1.5) hoạt động trực tiếp với một mô hình khuếch tán được nâng cấp như SDXL mà không cần đào tạo lại – hiệu quả hoạt động như một ‘nâng cấp phổ quát’ cho các plugin.

Hệ thống này đạt được điều này bằng cách đào tạo một mạng bổ sung để kiểm soát mô hình được nâng cấp, sử dụng một bản sao đóng băng của mô hình cơ sở để bảo tồn các kết nối plugin:

Lược đồ cho X-Adapter. Nguồn: https://arxiv.org/pdf/2312.02238

Lược đồ cho X-Adapter. Nguồn: https://arxiv.org/pdf/2312.02238

X-Adapter ban đầu được phát triển và thử nghiệm để chuyển các phụ kiện từ SD1.5 sang SDXL, trong khi LoRA-X cung cấp nhiều chuyển đổi hơn.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA là một phương pháp tinh chỉnh nâng cao cải tiến LoRA bằng cách sử dụng một chiến lược phân tích trọng số khiến nó giống với việc tinh chỉnh hoàn chỉnh hơn:

DoRA không chỉ cố gắng sao chép một phụ kiện trong một môi trường đóng băng, như LoRA-X, mà thay vào đó thay đổi các tham số cơ bản của trọng số, chẳng hạn như độ lớn và hướng. Nguồn: https://arxiv.org/pdf/2402.09353

DoRA không chỉ cố gắng sao chép một phụ kiện trong một môi trường đóng băng, như LoRA-X, mà thay vào đó thay đổi các tham số cơ bản của trọng số, chẳng hạn như độ lớn và hướng. Nguồn: https://arxiv.org/pdf/2402.09353

DoRA tập trung vào việc cải thiện quá trình tinh chỉnh chính nó, bằng cách phân tích trọng số của mô hình thành độ lớn và hướng (xem hình ảnh trên). Thay vào đó, LoRA-X tập trung vào việc cho phép chuyển đổi các tham số tinh chỉnh hiện có giữa các mô hình cơ sở khác nhau

Tuy nhiên, phương pháp LoRA-X áp dụng các kỹ thuật độ phân giải được phát triển cho DoRA, và trong các thử nghiệm chống lại hệ thống cũ hơn này, nó tuyên bố đạt được điểm DINO tốt hơn.

FouRA (Fourier Low Rank Adaptation)

Được xuất bản vào tháng 6 năm 2024, phương pháp FouRA đến từ Qualcomm AI Research, giống như LoRA-X, và thậm chí chia sẻ một số chủ đề và lời nhắc kiểm tra.

Ví dụ về sự sụp đổ phân phối trong LoRA, từ bài báo FouRA năm 2024, sử dụng mô hình Realistic Vision 3.0 được đào tạo với LoRA và FouRA cho các bộ điều khiển 'Lửa Xanh' và 'Origami' trên bốn hạt giống. Hình ảnh LoRA thể hiện sự sụp đổ phân phối và giảm đa dạng, trong khi FouRA tạo ra đầu ra đa dạng hơn. Nguồn: https://arxiv.org/pdf/2406.08798

Ví dụ về sự sụp đổ phân phối trong LoRA, từ bài báo FouRA năm 2024, sử dụng mô hình Realistic Vision 3.0 được đào tạo với LoRA và FouRA cho các bộ điều khiển ‘Lửa Xanh’ và ‘Origami’ trên bốn hạt giống. Hình ảnh LoRA thể hiện sự sụp đổ phân phối và giảm đa dạng, trong khi FouRA tạo ra đầu ra đa dạng hơn. Nguồn: https://arxiv.org/pdf/2406.08798

FouRA tập trung vào việc cải thiện sự đa dạng và chất lượng của hình ảnh được tạo ra bằng cách thích nghi LoRA trong miền tần số, sử dụng một phương pháp Fourier.

Ở đây, một lần nữa, LoRA-X đã đạt được kết quả tốt hơn so với phương pháp dựa trên Fourier của FouRA.

Mặc dù cả hai khuôn khổ đều thuộc thể loại PEFT, chúng có các trường hợp sử dụng và cách tiếp cận rất khác nhau; trong trường hợp này, FouRA có thể được coi là ‘để lấp đầy số lượng’ cho một vòng kiểm tra có giới hạn đối thủ tương tự cho các tác giả của bài báo mới tham gia.

SVDiff

SVDiff cũng có các mục tiêu khác với LoRA-X, nhưng được sử dụng mạnh mẽ trong bài báo mới. SVDiff được thiết kế để cải thiện hiệu quả của việc tinh chỉnh các mô hình khuếch tán, và trực tiếp sửa đổi các giá trị trong các ma trận trọng số của mô hình, trong khi giữ nguyên các vectơ đặc biệt không đổi. SVDiff sử dụng SVD bị cắt, chỉ sửa đổi các giá trị lớn nhất, để điều chỉnh trọng số của mô hình.

Phương pháp này sử dụng một kỹ thuật tăng cường dữ liệu gọi là Cut-Mix-Unmix:

Sự tạo sinh đa chủ đề hoạt động như một hệ thống cô lập khái niệm trong SVDiff. Nguồn: https://arxiv.org/pdf/2303.11305

Sự tạo sinh đa chủ đề hoạt động như một hệ thống cô lập khái niệm trong SVDiff. Nguồn: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix được thiết kế để giúp mô hình khuếch tán học nhiều khái niệm riêng biệt mà không trộn chúng. Ý tưởng trung tâm là lấy các hình ảnh của các đối tượng khác nhau và kết hợp chúng thành một hình ảnh duy nhất. Sau đó, mô hình được đào tạo với các lời nhắc mô tả rõ ràng các yếu tố riêng biệt trong hình ảnh. Điều này buộc mô hình phải nhận ra và bảo tồn các khái niệm riêng biệt thay vì trộn chúng.

Trong quá trình đào tạo, một thuật ngữ điều chỉnh bổ sung giúp ngăn chặn sự can thiệp giữa các chủ đề. Lý thuyết của các tác giả cho rằng điều này tạo điều kiện cho việc tạo sinh đa chủ đề được cải thiện, trong đó mỗi yếu tố vẫn rõ ràng về mặt trực quan, thay vì bị hợp nhất.

SVDiff, bị loại khỏi vòng kiểm tra LoRA-X, nhằm tạo ra một không gian tham số compact. LoRA-X, thay vào đó, tập trung vào khả năng chuyển đổi của các tham số LoRA qua các mô hình cơ sở khác nhau bằng cách hoạt động trong không gian con của mô hình ban đầu.

Kết luận

Các phương pháp được thảo luận ở đây không phải là những cư dân duy nhất của PEFT. Những phương pháp khác bao gồm QLoRA và QA-LoRA; Prefix Tuning; Prompt-Tuning; và adapter-tuning, trong số những phương pháp khác.

‘LoRA có thể nâng cấp’ có thể là một sự theo đuổi mang tính cách mạng; chắc chắn, không có gì ngay trên đường chân trời sẽ ngăn cản những người đam mê LoRA phải lấy lại các tập dữ liệu cũ của họ cho việc phát hành trọng số mới nhất. Nếu có một nguyên mẫu tiêu chuẩn nào cho việc sửa đổi trọng số, có khả năng tồn tại qua các thay đổi về kiến trúc và các tham số bùng nổ giữa các phiên bản mô hình, nó vẫn chưa xuất hiện trong tài liệu cho đến nay, và sẽ cần phải tiếp tục được trích xuất từ dữ liệu trên cơ sở từng mô hình.

 

Được xuất bản lần đầu vào thứ Năm, ngày 30 tháng 1 năm 2025

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai