มุมมองของ Anderson

การต่อสู้เพื่อการปรับแต่งแบบ Zero-Shot ใน Generative AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

หากคุณต้องการใส่ตัวเองลงในเครื่องมือสร้างภาพหรือวิดีโอ แต่คุณไม่ค่อยมีชื่อเสียงพอที่จะให้โมเดลฐานรู้จักคุณ คุณจะต้องฝึกโมเดล การปรับแต่งระดับต่ำ (LoRA) โดยใช้รูปภาพของคุณเอง เมื่อสร้างเสร็จ โมเดล LoRA ที่ปรับแต่งแล้วจะทำให้โมเดลสร้างภาพสามารถรวมตัวตนของคุณเข้าไปในผลลัพธ์ในอนาคตได้

สิ่งนี้เรียกว่า การปรับแต่ง ในสาขาวิจัยสังเคราะห์ภาพและวิดีโอ เป็นครั้งแรกที่ปรากฏหลังจากการเปิดตัว Stable Diffusion ในฤดูร้อนปี 2022 โดยโครงการ DreamBooth ของ Google Research ซึ่งเสนอโมเดลการปรับแต่งขนาดใหญ่ในโครงสร้างที่ปิด และได้รับการปรับแต่งโดยนักสนใจและเผยแพร่ให้กับชุมชน

โมเดล LoRA ตามมาและให้การฝึกที่ง่ายขึ้นและขนาดไฟล์ที่เบากว่า โดยไม่สูญเสียคุณภาพ และได้ครอบงำส่วนการปรับแต่งสำหรับ Stable Diffusion และรุ่นต่อๆ ไป เช่น Flux และตอนนี้โมเดลวิดีโอสังเคราะห์ใหม่ๆ เช่น Hunyuan Video และ Wan 2.1

การทำซ้ำ

ปัญหาก็คือ ตามที่เราได้กล่าวไว้ก่อนหน้านี้ ว่าทุกครั้งที่มีโมเดลใหม่เกิดขึ้น จะต้องมีการฝึกโมเดล LoRA ใหม่ ซึ่งเป็นความเสี่ยงอย่างมากต่อผู้ผลิต LoRA ที่อาจต้องฝึกโมเดลปรับแต่งหลายแบบเพียงเพื่อที่จะพบว่าโมเดลใหม่หรือโมเดลที่ได้รับความนิยมมากกว่าจะต้องเริ่มต้นใหม่

ดังนั้น การปรับแต่งแบบ Zero-Shot จึงกลายเป็นแนวทางที่แข็งแกร่งในเอกสารวิชาการล่าสุด ในสถานการณ์นี้ แทนที่จะต้องสร้างชุดข้อมูลและฝึกโมเดลย่อย คุณเพียงแค่ให้ภาพของคนที่จะถูกฉีดเข้าไปในการสร้าง และระบบจะแปลแหล่งเข้าเหล่านี้เป็นผลลัพธ์ที่ผสมผสาน

ด้านล่างนี้ เราจะเห็นว่า除了การเปลี่ยนใบหน้า ระบบประเภทนี้ (โดยใช้ PuLID) ยังสามารถรวมค่า ID เข้ากับการถ่ายโอนสไตล์ได้:

ตัวอย่างการถ่ายโอน ID ใบหน้าโดยใช้ระบบ PuLID

ตัวอย่างการถ่ายโอน ID ใบหน้าโดยใช้ระบบ PuLID Source: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

การแทนที่ระบบที่ต้องใช้แรงงานและเปราะบางเช่น LoRA ด้วยตัวปรับแต่งทั่วไปเป็นความคิดที่ดี (และเป็นที่นิยม) แต่ก็ท้าทายเช่นกัน ความใส่ใจในรายละเอียดและความครอบคลุมที่ได้รับจากกระบวนการฝึก LoRA นั้นยากที่จะเลียนแบบในโมเดล IP-Adapter สไตล์ one-shot ซึ่งต้องจับคู่ระดับความแม่นยำและความยืดหยุ่นของ LoRA โดยไม่มีข้อได้เปรียบในการวิเคราะห์ชุดภาพตัวตนอย่างครอบคลุม

HyperLoRA

โดยมีประเด็นเหล่านี้ในใจ มีเอกสารวิชาการใหม่ที่น่าสนใจจาก ByteDance ที่เสนอระบบที่สร้างโค้ด LoRA จริงๆ แบบเรียลไทม์ ซึ่งเป็นสิ่งที่ไม่เหมือนใครในหมู่โซลูชัน Zero-Shot

ด้านซ้าย ภาพเข้า ด้านขวา ผลลัพธ์ที่ผสมผสานจากภาพเข้า โดยสร้าง deepfakes ของนักแสดง Anthony Hopkins และ Anne Hathaway

ด้านซ้าย ภาพเข้า ด้านขวา ผลลัพธ์ที่ผสมผสานจากภาพเข้า โดยสร้าง deepfakes ของนักแสดง Anthony Hopkins และ Anne Hathaway Source: https://arxiv.org/pdf/2503.16944

เอกสารระบุว่า:

‘เทคนิคการปรับแต่ง เช่น IP-Adapter จะแช่แข็งพารามิเตอร์ของโมเดลฐานและใช้สถาปัตยกรรมแบบปลั๊กอินเพื่อเปิดใช้งานการอนุมานแบบ Zero-Shot แต่สิ่งเหล่านี้มักแสดงให้เห็นถึงการขาดความเป็นธรรมชาติและความจริง ซึ่งไม่ควรละเลยในงานสังเคราะห์ภาพพอร์เทรต’

‘[เรา] เสนอการสร้างแบบปรับแต่งที่มีประสิทธิภาพสูง ชื่อ HyperLoRA ซึ่งใช้เครือข่ายแบบปลั๊กอินแบบปรับแต่งเพื่อสร้างน้ำหนัก LoRA โดยรวมความสามารถที่ดีกว่าของ LoRA เข้ากับความสามารถ Zero-Shot ของการปรับแต่ง’

‘ด้วยโครงสร้างเครือข่ายและกลยุทธ์การฝึกที่ออกแบบอย่างรอบคอบ เราบรรลุการสร้างภาพพอร์เทรตแบบส่วนบุคคลแบบ Zero-Shot (รองรับทั้งการเข้าแบบภาพเดียวและหลายภาพ) โดยมีความสมจริงสูง ความถูกต้อง และความสามารถในการแก้ไข’

สิ่งที่มีประโยชน์ที่สุด คือ ระบบที่ฝึกแล้วสามารถใช้กับ ControlNet ที่มีอยู่ได้ ทำให้สามารถควบคุมการสร้างได้ละเอียด:

Timothy Chalomet ปรากฏตัวในภาพยนตร์ 'The Shining' (1980) โดยใช้ HyperLoRA และ ControlNet

Timothy Chalomet ปรากฏตัวในภาพยนตร์ ‘The Shining’ (1980) โดยใช้ HyperLoRA และ ControlNet

วิธีการ

วิธีการใหม่นี้ใช้โมเดล SDXL ของ Stable Diffusion เป็นโมเดลฐาน แม้ว่าหลักการเหล่านี้ดูเหมือนจะใช้ได้กับโมเดลการกระจายทั่วไป แต่ความต้องการในการฝึกอาจทำให้ยากที่จะใช้กับโมเดลวิดีโอสังเคราะห์

กระบวนการฝึก HyperLoRA แบ่งออกเป็นสามขั้นตอน แต่ละขั้นตอนออกแบบมาเพื่อแยกและรักษาข้อมูลเฉพาะในน้ำหนักที่ได้เรียนรู้ วัตถุประสงค์ของกระบวนการนี้คือการป้องกันไม่ให้คุณลักษณะที่เกี่ยวข้องกับตัวตนถูกปนเปื้อนด้วยองค์ประกอบที่ไม่เกี่ยวข้อง เช่น เสื้อผ้าหรือพื้นหลัง ในขณะเดียวกันก็บรรลุการเข้าใกล้และความเสถียรอย่างรวดเร็ว

โครงสร้างแนวคิดสำหรับ HyperLoRA

โครงสร้างแนวคิดสำหรับ HyperLoRA

การเข้าใกล้แบบเปลี่ยนผ่าน

ในขั้นตอนที่สอง ‘ID-LoRA’ ถูกนำมาใช้ โดยที่คุณลักษณะของใบหน้าถูกเข้ารหัสโดยใช้สองเส้นทางขนานกัน: CLIP Vision Transformer สำหรับคุณลักษณะโครงสร้าง และ InsightFace AntelopeV2 สำหรับการแสดงตัวตนแบบที่เป็นนามธรรมมากกว่า

ในขณะที่คุณชั่งน้ำหนัก

หลังจากที่ CLIP ViT และ AntelopeV2 ได้ถอดรหัสคุณลักษณะทั้งโครงสร้างและเฉพาะตัวจากพอร์เทรตที่กำหนดแล้ว คุณลักษณะที่ได้รับจะถูกส่งผ่าน ตัวอย่างรับฟัง (ที่มาจากโครงการ IP-Adapter) – โมดูลที่อาศัยทรานส์ฟอร์เมอร์ ซึ่งแมปกับค่าสัมประสิทธิ์ที่กะทัดรัด

ข้อมูลและการทดสอบ

ในการฝึก HyperLoRA นักวิจัยใช้ซับเซตของภาพใบหน้า 4.4 ล้านภาพจากชุดข้อมูล LAION-2B (ตอนนี้รู้จักกันดีในฐานะแหล่งที่มาของโมเดล Stable Diffusion ต้นฉบับปี 2022)

การทดสอบ ComfyUI

ผู้เขียนสร้างเวิร์กโฟลว์ในแพลตฟอร์มสังเคราะห์ ComfyUI เพื่อเปรียบเทียบ HyperLoRA กับวิธีการที่เป็นคู่แข่งสามวิธี: InstantID;: IP-Adapter ในรูปแบบของ IP-Adapter-FaceID-Portrait;: และ PuLID

เมตริก

สำหรับการทดสอบคุณภาพ ผู้เขียนวัดความคล้ายคลึงกันของใบหน้าโดยใช้ระยะห่างโคไซน์ระหว่างการฝังตัวภาพ CLIP (CLIP-I) และการฝังตัวตัวตน (ID Sim) ที่แยกออกมาโดยใช้ CurricularFace ซึ่งเป็นโมเดลที่ไม่ได้ใช้ในการฝึก

สรุป

กระแสการปรับแต่งแบบ Zero-Shot ที่ต่อเนื่องกันในช่วง 18 เดือนที่ผ่านมาได้กลายเป็นเรื่องที่น่าหดหู่ ไม่มีหลายวิธีที่จะก้าวหน้าอย่างมีนัยสำคัญ และสิ่งที่ก้าวหน้าบ้างมักมีความต้องการในการฝึกที่สูงหรือความต้องการการอนุมานที่ซับซ้อนหรือต้องใช้ทรัพยากรมาก

ในขณะที่การฝึก HyperLoRA มีความต้องการที่น่ากลัวเช่นเดียวกับหลายๆ การเข้าใกล้แบบ Zero-Shot ที่คล้ายกัน แต่อย่างน้อยก็ได้โมเดลที่สามารถจัดการการปรับแต่งแบบ ad hoc ได้โดยไม่ต้องมีการฝึกเพิ่มเติม

จากเอกสารเสริม เราสังเกตเห็นว่าความเร็วในการอนุมานของ HyperLoRA ดีกว่า IP-Adapter แต่ช้ากว่าวิธีการสองวิธีก่อนหน้านี้ และตัวเลขเหล่านี้อ้างอิงจาก GPU V100 ของ NVIDIA ซึ่งไม่ใช่ฮาร์ดแวร์สำหรับผู้บริโภคทั่วไป (แม้ว่า GPU ของ NVIDIA รุ่นใหม่ๆ จะสามารถเทียบหรือเกิน VRAM สูงสุด 32GB ของ V100 ได้)

สมเหตุสมผลที่จะกล่าวว่าการปรับแต่งแบบ Zero-Shot ยังคงเป็นปัญหาที่ไม่ได้รับการแก้ไขจากมุมมองทางปฏิบัติ เนื่องจากการเรียกใช้ฮาร์ดแวร์ที่สำคัญของ HyperLoRA อาจขัดแย้งกับความสามารถในการผลิตโมเดลฐานเดียวที่แท้จริงในระยะยาว

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai