มุมมองของ Anderson
การต่อสู้เพื่อการปรับแต่งแบบ Zero-Shot ใน Generative AI

หากคุณต้องการใส่ตัวเองลงในเครื่องมือสร้างภาพหรือวิดีโอ แต่คุณไม่ค่อยมีชื่อเสียงพอที่จะให้โมเดลฐานรู้จักคุณ คุณจะต้องฝึกโมเดล การปรับแต่งระดับต่ำ (LoRA) โดยใช้รูปภาพของคุณเอง เมื่อสร้างเสร็จ โมเดล LoRA ที่ปรับแต่งแล้วจะทำให้โมเดลสร้างภาพสามารถรวมตัวตนของคุณเข้าไปในผลลัพธ์ในอนาคตได้
สิ่งนี้เรียกว่า การปรับแต่ง ในสาขาวิจัยสังเคราะห์ภาพและวิดีโอ เป็นครั้งแรกที่ปรากฏหลังจากการเปิดตัว Stable Diffusion ในฤดูร้อนปี 2022 โดยโครงการ DreamBooth ของ Google Research ซึ่งเสนอโมเดลการปรับแต่งขนาดใหญ่ในโครงสร้างที่ปิด และได้รับการปรับแต่งโดยนักสนใจและเผยแพร่ให้กับชุมชน
โมเดล LoRA ตามมาและให้การฝึกที่ง่ายขึ้นและขนาดไฟล์ที่เบากว่า โดยไม่สูญเสียคุณภาพ และได้ครอบงำส่วนการปรับแต่งสำหรับ Stable Diffusion และรุ่นต่อๆ ไป เช่น Flux และตอนนี้โมเดลวิดีโอสังเคราะห์ใหม่ๆ เช่น Hunyuan Video และ Wan 2.1
การทำซ้ำ
ปัญหาก็คือ ตามที่เราได้กล่าวไว้ก่อนหน้านี้ ว่าทุกครั้งที่มีโมเดลใหม่เกิดขึ้น จะต้องมีการฝึกโมเดล LoRA ใหม่ ซึ่งเป็นความเสี่ยงอย่างมากต่อผู้ผลิต LoRA ที่อาจต้องฝึกโมเดลปรับแต่งหลายแบบเพียงเพื่อที่จะพบว่าโมเดลใหม่หรือโมเดลที่ได้รับความนิยมมากกว่าจะต้องเริ่มต้นใหม่
ดังนั้น การปรับแต่งแบบ Zero-Shot จึงกลายเป็นแนวทางที่แข็งแกร่งในเอกสารวิชาการล่าสุด ในสถานการณ์นี้ แทนที่จะต้องสร้างชุดข้อมูลและฝึกโมเดลย่อย คุณเพียงแค่ให้ภาพของคนที่จะถูกฉีดเข้าไปในการสร้าง และระบบจะแปลแหล่งเข้าเหล่านี้เป็นผลลัพธ์ที่ผสมผสาน
ด้านล่างนี้ เราจะเห็นว่า除了การเปลี่ยนใบหน้า ระบบประเภทนี้ (โดยใช้ PuLID) ยังสามารถรวมค่า ID เข้ากับการถ่ายโอนสไตล์ได้:

ตัวอย่างการถ่ายโอน ID ใบหน้าโดยใช้ระบบ PuLID Source: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file
การแทนที่ระบบที่ต้องใช้แรงงานและเปราะบางเช่น LoRA ด้วยตัวปรับแต่งทั่วไปเป็นความคิดที่ดี (และเป็นที่นิยม) แต่ก็ท้าทายเช่นกัน ความใส่ใจในรายละเอียดและความครอบคลุมที่ได้รับจากกระบวนการฝึก LoRA นั้นยากที่จะเลียนแบบในโมเดล IP-Adapter สไตล์ one-shot ซึ่งต้องจับคู่ระดับความแม่นยำและความยืดหยุ่นของ LoRA โดยไม่มีข้อได้เปรียบในการวิเคราะห์ชุดภาพตัวตนอย่างครอบคลุม
HyperLoRA
โดยมีประเด็นเหล่านี้ในใจ มีเอกสารวิชาการใหม่ที่น่าสนใจจาก ByteDance ที่เสนอระบบที่สร้างโค้ด LoRA จริงๆ แบบเรียลไทม์ ซึ่งเป็นสิ่งที่ไม่เหมือนใครในหมู่โซลูชัน Zero-Shot

ด้านซ้าย ภาพเข้า ด้านขวา ผลลัพธ์ที่ผสมผสานจากภาพเข้า โดยสร้าง deepfakes ของนักแสดง Anthony Hopkins และ Anne Hathaway Source: https://arxiv.org/pdf/2503.16944
เอกสารระบุว่า:
‘เทคนิคการปรับแต่ง เช่น IP-Adapter จะแช่แข็งพารามิเตอร์ของโมเดลฐานและใช้สถาปัตยกรรมแบบปลั๊กอินเพื่อเปิดใช้งานการอนุมานแบบ Zero-Shot แต่สิ่งเหล่านี้มักแสดงให้เห็นถึงการขาดความเป็นธรรมชาติและความจริง ซึ่งไม่ควรละเลยในงานสังเคราะห์ภาพพอร์เทรต’
‘[เรา] เสนอการสร้างแบบปรับแต่งที่มีประสิทธิภาพสูง ชื่อ HyperLoRA ซึ่งใช้เครือข่ายแบบปลั๊กอินแบบปรับแต่งเพื่อสร้างน้ำหนัก LoRA โดยรวมความสามารถที่ดีกว่าของ LoRA เข้ากับความสามารถ Zero-Shot ของการปรับแต่ง’
‘ด้วยโครงสร้างเครือข่ายและกลยุทธ์การฝึกที่ออกแบบอย่างรอบคอบ เราบรรลุการสร้างภาพพอร์เทรตแบบส่วนบุคคลแบบ Zero-Shot (รองรับทั้งการเข้าแบบภาพเดียวและหลายภาพ) โดยมีความสมจริงสูง ความถูกต้อง และความสามารถในการแก้ไข’
สิ่งที่มีประโยชน์ที่สุด คือ ระบบที่ฝึกแล้วสามารถใช้กับ ControlNet ที่มีอยู่ได้ ทำให้สามารถควบคุมการสร้างได้ละเอียด:

Timothy Chalomet ปรากฏตัวในภาพยนตร์ ‘The Shining’ (1980) โดยใช้ HyperLoRA และ ControlNet
วิธีการ
วิธีการใหม่นี้ใช้โมเดล SDXL ของ Stable Diffusion เป็นโมเดลฐาน แม้ว่าหลักการเหล่านี้ดูเหมือนจะใช้ได้กับโมเดลการกระจายทั่วไป แต่ความต้องการในการฝึกอาจทำให้ยากที่จะใช้กับโมเดลวิดีโอสังเคราะห์
กระบวนการฝึก HyperLoRA แบ่งออกเป็นสามขั้นตอน แต่ละขั้นตอนออกแบบมาเพื่อแยกและรักษาข้อมูลเฉพาะในน้ำหนักที่ได้เรียนรู้ วัตถุประสงค์ของกระบวนการนี้คือการป้องกันไม่ให้คุณลักษณะที่เกี่ยวข้องกับตัวตนถูกปนเปื้อนด้วยองค์ประกอบที่ไม่เกี่ยวข้อง เช่น เสื้อผ้าหรือพื้นหลัง ในขณะเดียวกันก็บรรลุการเข้าใกล้และความเสถียรอย่างรวดเร็ว

โครงสร้างแนวคิดสำหรับ HyperLoRA
การเข้าใกล้แบบเปลี่ยนผ่าน
ในขั้นตอนที่สอง ‘ID-LoRA’ ถูกนำมาใช้ โดยที่คุณลักษณะของใบหน้าถูกเข้ารหัสโดยใช้สองเส้นทางขนานกัน: CLIP Vision Transformer สำหรับคุณลักษณะโครงสร้าง และ InsightFace AntelopeV2 สำหรับการแสดงตัวตนแบบที่เป็นนามธรรมมากกว่า
ในขณะที่คุณชั่งน้ำหนัก
หลังจากที่ CLIP ViT และ AntelopeV2 ได้ถอดรหัสคุณลักษณะทั้งโครงสร้างและเฉพาะตัวจากพอร์เทรตที่กำหนดแล้ว คุณลักษณะที่ได้รับจะถูกส่งผ่าน ตัวอย่างรับฟัง (ที่มาจากโครงการ IP-Adapter) – โมดูลที่อาศัยทรานส์ฟอร์เมอร์ ซึ่งแมปกับค่าสัมประสิทธิ์ที่กะทัดรัด
ข้อมูลและการทดสอบ
ในการฝึก HyperLoRA นักวิจัยใช้ซับเซตของภาพใบหน้า 4.4 ล้านภาพจากชุดข้อมูล LAION-2B (ตอนนี้รู้จักกันดีในฐานะแหล่งที่มาของโมเดล Stable Diffusion ต้นฉบับปี 2022)
การทดสอบ ComfyUI
ผู้เขียนสร้างเวิร์กโฟลว์ในแพลตฟอร์มสังเคราะห์ ComfyUI เพื่อเปรียบเทียบ HyperLoRA กับวิธีการที่เป็นคู่แข่งสามวิธี: InstantID;: IP-Adapter ในรูปแบบของ IP-Adapter-FaceID-Portrait;: และ PuLID
เมตริก
สำหรับการทดสอบคุณภาพ ผู้เขียนวัดความคล้ายคลึงกันของใบหน้าโดยใช้ระยะห่างโคไซน์ระหว่างการฝังตัวภาพ CLIP (CLIP-I) และการฝังตัวตัวตน (ID Sim) ที่แยกออกมาโดยใช้ CurricularFace ซึ่งเป็นโมเดลที่ไม่ได้ใช้ในการฝึก
สรุป
กระแสการปรับแต่งแบบ Zero-Shot ที่ต่อเนื่องกันในช่วง 18 เดือนที่ผ่านมาได้กลายเป็นเรื่องที่น่าหดหู่ ไม่มีหลายวิธีที่จะก้าวหน้าอย่างมีนัยสำคัญ และสิ่งที่ก้าวหน้าบ้างมักมีความต้องการในการฝึกที่สูงหรือความต้องการการอนุมานที่ซับซ้อนหรือต้องใช้ทรัพยากรมาก
ในขณะที่การฝึก HyperLoRA มีความต้องการที่น่ากลัวเช่นเดียวกับหลายๆ การเข้าใกล้แบบ Zero-Shot ที่คล้ายกัน แต่อย่างน้อยก็ได้โมเดลที่สามารถจัดการการปรับแต่งแบบ ad hoc ได้โดยไม่ต้องมีการฝึกเพิ่มเติม
จากเอกสารเสริม เราสังเกตเห็นว่าความเร็วในการอนุมานของ HyperLoRA ดีกว่า IP-Adapter แต่ช้ากว่าวิธีการสองวิธีก่อนหน้านี้ และตัวเลขเหล่านี้อ้างอิงจาก GPU V100 ของ NVIDIA ซึ่งไม่ใช่ฮาร์ดแวร์สำหรับผู้บริโภคทั่วไป (แม้ว่า GPU ของ NVIDIA รุ่นใหม่ๆ จะสามารถเทียบหรือเกิน VRAM สูงสุด 32GB ของ V100 ได้)
สมเหตุสมผลที่จะกล่าวว่าการปรับแต่งแบบ Zero-Shot ยังคงเป็นปัญหาที่ไม่ได้รับการแก้ไขจากมุมมองทางปฏิบัติ เนื่องจากการเรียกใช้ฮาร์ดแวร์ที่สำคัญของ HyperLoRA อาจขัดแย้งกับความสามารถในการผลิตโมเดลฐานเดียวที่แท้จริงในระยะยาว











![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)