มุมมองของ Anderson

สู่ LoRAs ที่สามารถอยู่รอดได้หลังการอัปเกรดเวอร์ชันโมเดล

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

นับตั้งแต่ฉันรายงานเกี่ยวกับการเติบโตของฮันหยวน วิดีโอ LoRAs (ไฟล์ที่ฝึกฝนขนาดเล็กที่สามารถ.inject บุคลิกภาพที่กำหนดเองเข้าไปในโมเดลที่มีพารามิเตอร์หลายพันล้านตัว) จำนวน LoRAs ที่เกี่ยวข้องที่มีอยู่ในชุมชน Civit เพิ่มขึ้น 185%

แม้ว่าจะไม่มีวิธีที่ง่ายหรือไม่ต้องใช้ความพยายามมากในการสร้างฮันหยวน วิดีโอ LoRA แต่แค็ตตาล็อกของ LoRAs ที่มีชื่อเสียงและธีมต่างๆ ที่ Civit กำลังเติบโตทุกวัน Source: https://civitai.com/

แม้ว่าจะไม่มีวิธีที่ง่ายหรือไม่ต้องใช้ความพยายามมากในการสร้างฮันหยวน วิดีโอ LoRA แต่แค็ตตาล็อกของ LoRAs ที่มีชื่อเสียงและธีมต่างๆ ที่ Civit กำลังเติบโตทุกวัน Source: https://civitai.com/

ชุมชนเดียวกับที่กำลังเรียนรู้วิธีการผลิต ‘บุคลิกภาพเพิ่มเติม’ เหล่านี้สำหรับฮันหยวน วิดีโอ (HV) ยังต้องการการเปิดตัวฟังก์ชันการแปลงภาพเป็นวิดีโอ (I2V) ในฮันหยวน วิดีโอ

ในด้านการ合成ภาพของมนุษย์ที่เปิดเผยต่อสาธารณะ สิ่งนี้เป็นเรื่องใหญ่ เนื่องจากเมื่อรวมกับการเติบโตของฮันหยวน LoRAs แล้ว มันสามารถทำให้ผู้ใช้สามารถแปลงภาพของคนให้เป็นวิดีโอได้โดยไม่ทำให้เอกลักษณ์ของพวกเขาเสื่อมถอย ซึ่งเป็นปัญหาที่เกิดขึ้นกับเครื่องกำเนิดวิดีโอที่มีคุณภาพสูงสุดในปัจจุบัน รวมถึง Kling, Kaiber และ RunwayML

คลิกเพื่อเล่น การสร้างวิดีโอจาก RunwayML's Gen 3 Turbo model อย่างไรก็ตาม ในรูปแบบที่คล้ายกันและเป็นคู่แข่งที่น้อยกว่า ไม่สามารถรักษาความสม่ำเสมอของเอกลักษณ์ได้เมื่อผู้แสดงหันหนีจากกล้อง และคุณสมบัติที่แตกต่างของภาพเริ่มต้นกลายเป็น ‘ผู้หญิงที่กระจายตัว’. Source: https://app.runwayml.com/

โดยการพัฒนา LoRA ที่กำหนดเองสำหรับบุคลิกภาพที่เกี่ยวข้อง ผู้ใช้สามารถใช้ภาพจริงของพวกเขาเป็นจุดเริ่มต้นในกระบวนการ HV I2V ได้ ซึ่งเป็น ‘เมล็ดพันธุ์’ ที่ดีกว่าการส่งตัวเลขสุ่มเข้าสู่พื้นที่ 潛在ของโมเดลและยอมรับสถานการณ์ทางภาษาที่เกิดขึ้น

โดยที่ LoRA หรือ LoRAs หลายตัวสามารถใช้เพื่อรักษาความสม่ำเสมอของเอกลักษณ์ ผม หัว发 และเสื้อผ้าและด้านอื่นๆ ที่สำคัญของการสร้าง

โดยที่การมีอยู่ของการผสมผสานดังกล่าวอาจเป็นตัวอย่างของการเปลี่ยนแปลงที่สำคัญที่สุดใน AI ที่สร้างขึ้นตั้งแต่การเปิดตัว Stable Diffusion โดยมีพลังการสร้างที่น่าเกรงขามที่ส่งมอบให้กับแฟนคลับโอเพ่นซอร์ส โดยไม่มีการควบคุม (หรือ ‘การดูแล’ หากคุณชอบ) ที่ให้ไว้โดยผู้ตรวจสอบเนื้อหาของระบบวิดีโอสร้างที่ได้รับความนิยมในปัจจุบัน

เมื่อฉันเขียน ฮันหยวน วิดีโอเป็น ‘งานที่ต้องทำ’ ที่ยังไม่ได้ทำใน GitHub repo ของฮันหยวน วิดีโอ โดยมีการรายงานจากชุมชนฮอบบี้ (โดยไม่มีการตรวจสอบ) เกี่ยวกับคำว่า ‘ไม่มีการตรวจสอบ’ ใน Discord จากนักพัฒนาฮันหยวน ซึ่งดูเหมือนจะบอกว่าการเปิดตัวฟังก์ชันนี้ถูกเลื่อนออกไปจนถึงช่วงเวลาหนึ่งในไตรมาส 1 เนื่องจากโมเดล ‘ไม่มีการตรวจสอบ’

รายการตรวจสอบการเปิดตัวฟีเจอร์อย่างเป็นทางการสำหรับฮันหยวน วิดีโอ Source: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

รายการตรวจสอบการเปิดตัวฟีเจอร์อย่างเป็นทางการสำหรับฮันหยวน วิดีโอ Source: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

แม้ว่าจะไม่ถูกต้องหรือไม่ ผู้พัฒนาใน repo ได้ส่งมอบส่วนใหญ่ของรายการตรวจสอบฮันหยวน และดังนั้น ฮันหยวน I2V จึงดูเหมือนว่าจะมาถึงในที่สุด ไม่ว่าจะถูกตรวจสอบหรือไม่หรือในบางวิธีการ ‘ปลดล็อก’

แต่เมื่อเราเห็นในรายการด้านบน การเปิดตัว I2V เป็นโมเดลที่แยกออกมาโดยสิ้นเชิง ซึ่งทำให้ไม่น่าจะเป็นไปได้ที่ LoRAs ที่มีอยู่ในปัจจุบันจะทำงานร่วมกับมัน

ในสถานการณ์ที่คาดการณ์ได้ (ในขณะนี้) แพลตฟอร์มการฝึกอบรม LoRA เช่น Musubi Tuner และ OneTrainer จะถูกย้อนกลับหรือรีเซ็ตในการสนับสนุนโมเดลใหม่ ในขณะที่หนึ่งหรือสองในผู้นำ AI ที่มีความสามารถทางเทคนิคมากที่สุดใน YouTube จะรับเงินจากการแก้ปัญหาผ่าน Patreon จนกว่าฉากจะตามทัน

ความเหนื่อยล้าในการอัปเกรด

เกือบไม่มีใครประสบกับความเหนื่อยล้าในการอัปเกรดมากเท่ากับผู้ที่ชื่นชอบ LoRA หรือการฝึกอบรมที่ละเอียด เนื่องจากความเร็วและความก้าวหน้าในการเปลี่ยนแปลงของ AI ที่สร้างขึ้นกระตุ้นให้โรงงานโมเดล เช่น Stability.ai, Tencent และ Black Forest Labs ผลิตโมเดลที่ใหญ่ขึ้นและดีขึ้นในอัตราสูงสุดที่เป็นไปได้

เนื่องจากโมเดลใหม่เหล่านี้จะมีความเอนเอียงและพารามิเตอร์ที่แตกต่างกันอย่างน้อย และมักจะมีขนาดและ/หรือสถาปัตยกรรมที่แตกต่างกัน ซึ่งหมายความว่าชุมชนการฝึกอบรมที่ละเอียดจะต้องนำชุดข้อมูลออกมาและทำซ้ำกระบวนการฝึกอบรมที่ยากลำบากสำหรับเวอร์ชันใหม่

ด้วยเหตุนี้ จึงมีหลายรูปแบบของ Stable Diffusion LoRA ที่มีอยู่ที่ Civit:

เส้นทางการอัปเกรดที่แสดงเป็นตัวเลือกการค้นหาที่ civit.ai

เส้นทางการอัปเกรดที่แสดงเป็นตัวเลือกการค้นหาที่ civit.ai

เนื่องจากโมเดล LoRA ที่มีน้ำหนักเบาเหล่านี้ไม่สามารถใช้งานร่วมกับเวอร์ชันโมเดลที่สูงกว่าหรือต่ำกว่า และเนื่องจากหลายตัวมีความพึ่งพาในการรวมและฝึกอบรมขนาดใหญ่ที่มีพารามิเตอร์เก่ากว่า ส่วนสำคัญของชุมชนมักจะยึดติดกับการเปิดตัว ‘มรดก’ ในลักษณะเดียวกับที่ความภักดีของลูกค้าต่อ Windows XP ยังคงอยู่หลายปีหลังจากที่การสนับสนุนอย่างเป็นทางการสิ้นสุดลง

การปรับตัวเข้ากับการเปลี่ยนแปลง

หัวข้อนี้เกิดขึ้นในใจเนื่องจาก有一งงานวิจัยใหม่จาก Qualcomm AI Research ที่อ้างว่าได้พัฒนาวิธีการที่ LoRAs ที่มีอยู่สามารถ ‘อัปเกรด’ ให้เข้ากับเวอร์ชันโมเดลใหม่ที่ปล่อยออกมา

ตัวอย่างการแปลง LoRAs ระหว่างเวอร์ชันโมเดล Source: https://arxiv.org/pdf/2501.16559

ตัวอย่างการแปลง LoRAs ระหว่างเวอร์ชันโมเดล Source: https://arxiv.org/pdf/2501.16559

วิธีการนี้เรียกว่า LoRA-X และไม่สามารถแปลได้ระหว่างโมเดลทั้งหมดของประเภทเดียวกัน (เช่น โมเดลภาพถึงภาพ หรือโมเดลภาษาขนาดใหญ่) แต่ผู้เขียนได้แสดงให้เห็นถึงการแปล LoRA จาก Stable Diffusion v1.5 > SDXL และการแปลง LoRA สำหรับโมเดล TinyLlama 3T ไปเป็น TinyLlama 2.5T

LoRA-X โอนพารามิเตอร์ LoRA ระหว่างโมเดลฐานที่แตกต่างกันโดยการรักษาแอดapter ภายในพื้นที่ย่อยของโมเดลแหล่งที่มา แต่เฉพาะในส่วนที่มีความคล้ายคลึงกันระหว่างเวอร์ชันโมเดล

ทางซ้ายมือ เป็นแผนภาพแสดงวิธีการที่ LoRA-X โอนแอดapter จากโมเดลแหล่งที่มาและปรับให้เหมาะสมกับโมเดลเป้าหมายโดยใช้โครงสร้างภายในของโมเดลเป้าหมาย ทางขวามือ เป็นภาพที่สร้างโดยโมเดลเป้าหมาย SD Eff-v1.0 และ SSD-1B หลังจากการโอนแอดapter จาก SD-v1.5 และ SDXL โดยไม่ต้องฝึกอบรมเพิ่มเติม

ทางซ้ายมือ เป็นแผนภาพแสดงวิธีการที่ LoRA-X โอนแอดapter จากโมเดลแหล่งที่มาและปรับให้เหมาะสมกับโมเดลเป้าหมายโดยใช้โครงสร้างภายในของโมเดลเป้าหมาย ทางขวามือ เป็นภาพที่สร้างโดยโมเดลเป้าหมาย SD Eff-v1.0 และ SSD-1B หลังจากการโอนแอดapter จาก SD-v1.5 และ SDXL โดยไม่ต้องฝึกอบรมเพิ่มเติม

แม้ว่าจะเป็นแนวทางที่มีประโยชน์สำหรับสถานการณ์ที่ไม่ต้องการหรือไม่สามารถฝึกอบรมได้ (เช่น การเปลี่ยนแปลงใบอนุญาตของข้อมูลการฝึกอบรมเดิม) วิธีการนี้มีข้อจำกัดหลายประการ

แม้ว่าจะเป็นการวิจัยที่ไม่ค่อยมีใครศึกษา แต่เราจะไม่ตรวจสอบงานวิจัยนี้อย่างลึกซึ้งเนื่องจากข้อบกพร่องหลายประการของ LoRA-X ตามที่เห็นจากคำวิจารณ์และที่ปรึกษาใน Open Review

การอาศัยความคล้ายคลึงกันของพื้นที่ย่อยของ LoRA-X ทำให้การประยุกต์ใช้จำกัดอยู่ในโมเดลที่เกี่ยวข้องอย่างใกล้ชิด และผู้เขียนได้ยกย่องในฟอรัมการตรวจสอบว่า LoRA-X ไม่สามารถโอนย้ายได้ง่ายระหว่างสถาปัตยกรรมที่แตกต่างกันอย่างมาก

วิธีการ PEFT อื่นๆ

ความเป็นไปได้ในการทำให้ LoRAs สามารถใช้งานได้บนเวอร์ชันต่างๆ เป็นส่วนหนึ่งของการวิจัยที่น่าสนใจ และสิ่งที่ LoRA-X มีส่วนร่วมในเรื่องนี้คือการอ้างว่าไม่ต้องการการฝึกอบรม

LoRA-X เป็นอีกหนึ่งรายการในกลุ่มวิธีการ Parameter-Efficient Fine-Tuning (PEFT) ซึ่งจัดการกับความท้าทายในการปรับโมเดลที่ฝึกอบรมไว้ล่วงหน้าให้เหมาะสมกับงานเฉพาะโดยไม่ต้องฝึกอบรมใหม่ วิธีการนี้มุ่งหมายที่จะแก้ไขพารามิเตอร์จำนวนเล็กน้อยในขณะที่รักษาความสามารถไว้

ที่น่าสนใจคือ:

X-Adapter

เฟรมเวิร์ก X-Adapter โอนการฝึกอบรมแอดapter ระหว่างโมเดลโดยมีการฝึกอบรมบางส่วน ระบบนี้มีจุดมุ่งหมายเพื่อให้โมดูลที่ฝึกอบรมไว้ล่วงหน้า (เช่น ControlNet และ LoRA) จากโมเดลการกระจายที่มั่นคง v1.5 สามารถทำงานได้โดยตรงกับโมเดลการอัปเกรด เช่น SDXL โดยไม่ต้องฝึกอบรมใหม่

ระบบนี้บรรลุเป้าหมายนี้โดยการฝึกอบรมเครือข่ายเพิ่มเติมที่ควบคุมโมเดลที่อัปเกรดโดยใช้โมเดลฐานที่ถูกแช่แข็งเพื่อรักษาการเชื่อมต่อแอดapter:

แผนภาพสำหรับ X-Adapter Source: https://arxiv.org/pdf/2312.02238

แผนภาพสำหรับ X-Adapter Source: https://arxiv.org/pdf/2312.02238

X-Adapter ได้รับการพัฒนาขึ้นและทดสอบเพื่อโอนแอดapter จาก SD1.5 ไปเป็น SDXL ในขณะที่ LoRA-X มีการโอนย้ายที่หลากหลายกว่า

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA เป็นวิธีการฝึกอบรมที่ดีขึ้นซึ่งปรับปรุง LoRA โดยใช้กลยุทธ์การแยกพารามิเตอร์แบบถ่วงน้ำหนัก

DoRA ไม่เพียงแต่พยายามคัดลอกแอดapter ในสภาพแวดล้อมที่ถูกแช่แข็งเท่านั้น แต่ยังเปลี่ยนพารามิเตอร์พื้นฐานของน้ำหนัก เช่น ขนาดและทิศทาง Source: https://arxiv.org/pdf/2402.09353

DoRA ไม่เพียงแต่พยายามคัดลอกแอดapter ในสภาพแวดล้อมที่ถูกแช่แข็งเท่านั้น แต่ยังเปลี่ยนพารามิเตอร์พื้นฐานของน้ำหนัก เช่น ขนาดและทิศทาง Source: https://arxiv.org/pdf/2402.09353

DoRA มุ่งเน้นไปที่การปรับปรุงกระบวนการฝึกอบรมโดยการแยกพารามิเตอร์ของโมเดลออกเป็นขนาดและทิศทาง (ดูภาพด้านบน) ในขณะที่ LoRA-X มุ่งเน้นไปที่การโอนย้ายพารามิเตอร์ที่ฝึกอบรมไว้ล่วงหน้าระหว่างโมเดลฐานที่แตกต่างกัน

อย่างไรก็ตาม วิธีการ LoRA-X นำเทคนิคการ ‘โพรเจคชัน’ ที่พัฒนาขึ้นสำหรับ DoRA มาใช้ และในการทดสอบกับระบบเก่าได้แสดงให้เห็นถึงคะแนน DINO ที่ดีขึ้น

FouRA (Fourier Low Rank Adaptation)

วิธีการ FouRA ซึ่งตีพิมพ์ในเดือนมิถุนายน 2024 มาจาก Qualcomm AI Research เช่นเดียวกับ LoRA-X และมีการแบ่งปันการprompt การทดสอบและธีมที่คล้ายคลึงกัน

ตัวอย่างการล่มสลายของการกระจายตัวใน LoRA จากงานวิจัย FouRA ในปี 2024 โดยใช้โมเดล Realistic Vision 3.0 ที่ฝึกอบรมด้วย LoRA และ FouRA สำหรับแอดapter 'ไฟสีน้ำเงิน' และ 'โอริกามิ' ตลอดจนทั้งสี่เมล็ด ภาพที่สร้างโดย LoRA แสดงการล่มสลายของการกระจายตัวและความหลากหลายที่ลดลง ในขณะที่ FouRA สร้างภาพที่มีความหลากหลายมากกว่า Source: https://arxiv.org/pdf/2406.08798

ตัวอย่างการล่มสลายของการกระจายตัวใน LoRA จากงานวิจัย FouRA ในปี 2024 โดยใช้โมเดล Realistic Vision 3.0 ที่ฝึกอบรมด้วย LoRA และ FouRA สำหรับแอดapter ‘ไฟสีน้ำเงิน’ และ ‘โอริกามิ’ ตลอดจนทั้งสี่เมล็ด ภาพที่สร้างโดย LoRA แสดงการล่มสลายของการกระจายตัวและความหลากหลายที่ลดลง ในขณะที่ FouRA สร้างภาพที่มีความหลากหลายมากกว่า Source: https://arxiv.org/pdf/2406.08798

FouRA มุ่งเน้นไปที่การปรับปรุงความหลากหลายและคุณภาพของภาพที่สร้างขึ้นโดยการปรับ LoRA ในโดเมนความถี่โดยใช้เทคนิคการแปลง Fourier

ที่นี่อีกครั้ง LoRA-X สามารถบรรลุผลลัพธ์ที่ดีกว่าวิธีการที่ใช้ Fourier ของ FouRA

แม้ว่าทั้งสองเฟรมเวิร์กจะอยู่ในหมวด PEFT แต่ก็มีการใช้งานและแนวทางที่แตกต่างกัน ในกรณีนี้ FouRA อาจถูกมองว่าเป็นการ ‘เติมเต็ม’ สำหรับการทดสอบรอบที่มีการแข่งขันที่จำกัดสำหรับผู้เขียนของเอกสารใหม่

SVDiff

SVDiff มีเป้าหมายที่แตกต่างจาก LoRA-X แต่ได้รับการสนับสนุนอย่างมากในเอกสารใหม่ SVDiff ได้รับการออกแบบมาเพื่อปรับปรุงประสิทธิภาพของการฝึกอบรมโมเดลการกระจาย และแก้ไขค่าโดยตรงในเมทริกซ์น้ำหนักของโมเดลโดยไม่เปลี่ยนเวกเตอร์เอกพจน์ที่ไม่เปลี่ยนแปลง

วิธีการนี้ใช้เทคนิคการเพิ่มข้อมูลใหม่เรียกว่า Cut-Mix-Unmix:

การสร้างหลายวัตถุใน SVDiff ทำหน้าที่เป็นระบบการแยกแนวคิด Source: https://arxiv.org/pdf/2303.11305

การสร้างหลายวัตถุใน SVDiff ทำหน้าที่เป็นระบบการแยกแนวคิด Source: https://arxiv.org/pdf/2303.11305

การผสมผสานและแยกออกเป็นกระบวนการที่ออกแบบมาเพื่อช่วยให้โมเดลการกระจายเรียนรู้แนวคิดที่แตกต่างกันโดยไม่ทำให้แนวคิดเหล่านั้นผสมกัน

ในระหว่างการฝึกอบรม จะมีการเพิ่มพจน์ปรับให้เหมาะสมเพื่อช่วยป้องกันการรบกวนระหว่างวัตถุ

SVDiff ซึ่งไม่ได้รับการทดสอบในรอบทดสอบของ LoRA-X มุ่งเน้นไปที่การสร้างพื้นที่พารามิเตอร์ที่กะทัดรัด ในขณะที่ LoRA-X มุ่งเน้นไปที่การโอนย้ายพารามิเตอร์ LoRA ระหว่างโมเดลฐานที่แตกต่างกันโดยการทำงานภายในพื้นที่ย่อยของโมเดลเดิม

สรุป

วิธีการที่กล่าวถึงนี้ไม่ใช่วิธีเดียวใน PEFT อื่นๆ รวมถึง QLoRA และ QA-LoRA; Prefix Tuning; Prompt-Tuning; และ adapter-tuning

การตามหา LoRA ที่สามารถอัปเกรดได้ อาจเป็นการตามหาที่ยาก เนื่องจากไม่มีอะไรที่จะหยุด LoRA modelers จากการดึงชุดข้อมูลเก่าออกมาเพื่อรับการเปิดตัวพารามิเตอร์ใหม่ล่าสุด หากมีมาตรฐานที่เป็นไปได้สำหรับการแก้ไขพารามิเตอร์ที่สามารถอยู่รอดได้จากการเปลี่ยนแปลงสถาปัตยกรรมและการเพิ่มขนาดพารามิเตอร์ระหว่างเวอร์ชันโมเดล มันไม่ได้ปรากฏในเอกสารที่มีอยู่ และจะต้องถูกดึงออกมาจากข้อมูลสำหรับแต่ละโมเดล

 

เผยแพร่ครั้งแรกวันพฤหัสบดี 30 มกราคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai