มุมมองของ Anderson

ความเสียหายจากการตกแต่งแบบละเอียดของโมเดล AI สามารถฟื้นฟูได้ง่ายๆ ตามที่พบจากงานวิจัย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image from ChatGPT. Prompt: ' a photorealistic panoramic image of a scientist in a white coat, wearing protective soldering goggles, who is soldering circuitry in an open panel of the underside of a massive and high-tech computer system. Photorealistic, gorgeous, UHQ'

งานวิจัยใหม่จากสหรัฐอเมริกาบ่งชี้ว่าการปรับแต่งโมเดล AI แบบละเอียดบนข้อมูลของคุณเองไม่จำเป็นต้องลดหรือทำลายฟังก์ชันของโมเดลเดิม – และวิธีแก้ปัญหาแบบง่ายๆ สามารถไม่เพียงแต่ฟื้นฟูความสามารถของโมเดลเดิม แต่ยังสามารถปรับปรุงคุณภาพของเอาต์พุตที่คุณพยายามผลิตจากโมเดล (ที่ได้รับการฝึกอบรมแล้ว) ได้

การเพิ่มขึ้นของประสิทธิภาพในโมเดลที่หลากหลายด้วยการปรับแต่งหลังการฝึกอบรมใหม่ของ作者 Further details later in the article. Source: http://export.arxiv.org/pdf/2409.16223

การเพิ่มขึ้นของประสิทธิภาพในโมเดลที่หลากหลายด้วยการปรับแต่งหลังการฝึกอบรมใหม่ของ作者 Further details later in the article. Source: http://export.arxiv.org/pdf/2409.16223

ผลกระทบของสิ่งนี้มีนัยสำคัญ ไม่เพียงแต่สำหรับบริษัทเทคโนโลยีขนาดใหญ่ที่ให้ความสนใจกับผลตอบแทนทางการเงินจากการให้บริการระบบสร้างสรรค์ ‘as-a-service’ แต่ยังรวมถึงผู้ใช้ที่เพิ่มขึ้นเรื่อยๆ ที่ ‘ตัดคอร์ด’ และดาวน์โหลดและปรับแต่งโมเดลโอเพ่นซอร์ส เพื่อให้สามารถเข้าถึงระบบการเขียนและสร้างภาพ/วิดีโอ AI ที่เป็นส่วนตัวได้อย่างมีประสิทธิภาพและราคาไม่แพง – และมีข้อจำกัดน้อยลง

ผู้เขียนของเอกสารไม่กลัวที่จะแสดงความกระตือรือร้นต่อศักยภาพของวิธีการของพวกเขา ซึ่งดูเหมือนจะก้าวหน้าอย่างมีนัยสำคัญจาก การยื่นในปี 2023 การถ่ายโอนแบบองค์รวม: การปรับแต่งแบบไม่ทำลายด้วยข้อมูลเป้าหมายบางส่วน (ร่วมเขียนโดยผู้ร่วมให้ข้อมูลหลายคนในเอกสารใหม่นี้)

พวกเขากล่าวว่า:

‘ผลการวิจัยนี้น่าสนับสนุนและมีผลกระทบอย่างลึกซึ้ง! พวกเขาบ่งชี้ว่าการปรับแต่งหลังการฝึกอบรมแบบง่ายๆ สามารถแก้ไขปัญหาความแม่นยำที่ด้อยกว่าของโมเดลที่ปรับแต่งแล้วในคลาสที่ไม่มีอยู่ได้ โดยนำความสามารถของโมเดลที่ฝึกอบรมไว้ล่วงหน้ามาใช้ใหม่ และเปิดเผยคุณภาพของฟีเจอร์ที่ดีขึ้นในคลาสทั้งหมด’

เราจะมาดูกันว่างานวิจัยใหม่นี้เป็นอย่างไร ก่อนอื่น มาทำความเข้าใจกันว่าปัญหาที่พวกเขาต้องการแก้ไขคืออะไร

เหตุใดจึงมีความสำคัญ

การปรับแต่งครั้งแรกที่แพร่หลายเกิดขึ้นหลังจากการเปิดตัวโมเดล Stable Diffusion ของ Stability.ai ในเดือนสิงหาคม 2002 โมเดลแรกๆ ที่ฝึกอบรมบนชุดข้อมูล LAION ที่มีขนาดใหญ่ถูกทำให้สามารถดาวน์โหลดได้โดยทุกคน

อย่างไรก็ตาม ผู้ใช้ที่ต้องการใส่ เนื้อหาที่เฉพาะเจาะจง (เช่น อัตลักษณ์ของตนเอง รูปแบบศิลปะ หรือการแสดงภาพของคนดัง) ลงในคุณสมบัติการสร้างสรรค์ที่ไม่ธรรมดาของ Stable Diffusion จะต้องใช้เทคนิค เช่น DreamBooth – การขยายตัวของวิธีการปรับแต่งของ Google Research ซึ่งช่วยให้ผู้ใช้สามารถฝึกอบรมข้อมูลใหม่เข้าไปในโมเดลที่สามารถดาวน์โหลดได้ฟรีได้โดยการปรับแต่ง

ตัวอย่างของกระบวนการของผู้ใช้สำหรับการใช้งาน DreamBooth อย่างเป็นทางการของ Google ในปี 2022 ผู้ใช้เลือกภาพที่มีคุณภาพสูงและเลือกชื่อที่ไม่ซ้ำกัน (ซึ่ง Stable Diffusion ไม่มีในข้อมูลการฝึกอบรม) ในคำสั่งจากโมเดลที่ปรับแต่งแล้ว Source: https://dreambooth.github.io/

ตัวอย่างของกระบวนการของผู้ใช้สำหรับการใช้งาน DreamBooth อย่างเป็นทางการของ Google ในปี 2022 ผู้ใช้เลือกภาพที่มีคุณภาพสูงและเลือกชื่อที่ไม่ซ้ำกัน (ซึ่ง Stable Diffusion ไม่มีในข้อมูลการฝึกอบรม) ในคำสั่งจากโมเดลที่ปรับแต่งแล้ว Source: https://dreambooth.github.io/

ในทางนี้ จึงเป็นไปได้ที่จะได้รับโมเดลที่ดีมากในการสร้างภาพของบุคคลหรือรูปแบบศิลปะที่กำหนด แต่ซึ่ง ตอนนี้ ‘ถูกบุกรุก’ สำหรับการใช้งานทั่วไป

ซึ่งหมายความว่าหากคุณต้องการปรับแต่ง Stable Diffusion เพื่อให้สามารถสร้างภาพของคนสามคนได้อย่างแม่นยำ คุณจำเป็นต้องสร้าง โมเดลสามแบบที่แตกต่างกัน แต่ละแบบมีขนาดประมาณ 2-4GB หรือมากกว่า

การพยายามปรับแต่งโมเดลเหล่านี้ ครั้งที่สอง จะไม่เพียงแต่ทำให้ประสิทธิภาพทั่วไปของโมเดลด้อยลงเท่านั้น แต่ยังจะส่งผลเสียต่อเอาต์พุตจากเซสชันการปรับแต่งครั้งก่อนด้วย

ในกรณีอื่นๆ โมเดล DreamBooth ของคนดังจะแพร่หลายบนอินเทอร์เน็ต โดยส่วนใหญ่จะอยู่ที่โดเมน civit.ai ในที่สุด วิธีการที่ไม่หนักหน่วง เช่น การปรับแต่งแบบอันดับต่ำ (LoRA) ก็ได้รับความนิยมมากกว่าการปรับแต่ง (แม้ว่าเอาต์พุตของ LoRA จะมีประสิทธิภาพเท่ากับการปรับแต่งแบบเต็มหรือไม่นั้นยังคงเป็นเรื่องที่ ถูกถกเถียงกัน และ NVIDIA ได้ เปิดเผย วิธีการที่ดูเหมือนจะ有效มากกว่าเรียกว่า DoRA)

LoRA เป็นส่วนหนึ่งของ การปรับแต่งแบบมีประสิทธิภาพของพารามิเตอร์ (PEFT) ซึ่งมีผลต่อพารามิเตอร์ที่ฝึกอบรมไว้ของโมเดลเพียงบางส่วนเท่านั้น

บางผู้ใช้ต้องการเปลี่ยนแปลงลักษณะพื้นฐานของจุดตรวจสอบ Stable Diffusion ที่เปิดเผยต่อสาธารณะ โดยการปรับแต่งบนภาพหลายพันภาพ

ซึ่งโดยพื้นฐานแล้วจะสร้าง โมเดลพื้นฐาน ที่อุทิศให้กับโดเมนที่ผู้ใช้พยายามฝึกอบรม (เช่น รูปแบบศิลปะที่เฉพาะเจาะจง) สำหรับวัตถุประสงค์นี้ วิธีการ ‘เบา’ เช่น LoRA อาจมีประสิทธิภาพน้อยกว่า เนื่องจาก น้ำหนัก ของโมเดลต้องการการเอนเอียงอย่างรุนแรงต่อข้อมูลการฝึกอบรมใหม่

การแชทท้องถิ่น

ด้วยความสนใจที่เพิ่มขึ้นใน โมเดลภาษาขนาดใหญ่ (LLMs) ผู้ใช้ที่ต้องการหลีกเลี่ยงช่องทางที่เพิ่มขึ้น (และค่าใช้จ่ายที่เกี่ยวข้อง) ของบริการ API เช่น ChatGPT ได้เริ่มดาวน์โหลดและปรับแต่งโมเดลโอเพ่นซอร์สที่มีประสิทธิภาพ เช่น Llama 3 และอื่นๆ

ที่นี่ LoRAs สามารถใช้ได้ แทนการปรับแต่งจุดตรวจสอบทั้งหมด เราได้ โต้แย้งก่อนหน้านี้ ว่าการปรับแต่งเป็นวิธีที่เหนือกว่าสำหรับการผลิต LLMs ที่ปรับให้เหมาะสมกับความต้องการของผู้ใช้เฉพาะ แม้ว่าการปรับแต่งอาจต้องใช้ฮาร์ดแวร์ที่มีประสิทธิภาพมากกว่าและอาจใช้เวลานานกว่า แต่ก็ให้การสรุปที่ลึกซึ้งยิ่งขึ้นของข้อมูลใหม่ที่ผู้ใช้ต้องการให้โมเดลรวมเข้าด้วยกัน

ปัญหากับการปรับแต่งคือเป็นกระบวนการที่ทำลายล้างที่ไม่สามารถฝึกอบรมเพิ่มเติมได้ตามลำดับเช่นเดียวกับการฝึกอบรมข้อมูลเพิ่มเติมในภายหลังตามที่เราได้กล่าวไว้ข้างต้น

คุณลักษณะและความเอนเอียงที่ถูกฉีดเข้าไปในโมเดลดูเหมือนจะ รบกวนสมดุลเดิมของน้ำหนักในเซตข้อมูล ซึ่งหมายความว่าโมเดลอาจสะท้อนข้อมูลที่ผู้ใช้ให้มาอย่างมากหรือจะทำงานได้ไม่ดีโดยรวมมากกว่าโมเดลพื้นฐาน (ในงานที่ไม่เกี่ยวข้องกับข้อมูลใหม่)

สามารถแก้ไขปัญหานี้ได้บ้างโดย การแช่แข็ง บางส่วนของโมเดลระหว่างการฝึกอบรม แต่นี่อาจทำให้ฟังก์ชันโดยรวมลดลง เนื่องจากส่วนที่แช่แข็งของสถาปัตยกรรมอาจไม่สรุปผลได้ดีสำหรับข้อมูลที่ปรับแต่งใหม่ภายใน พื้นที่ 잠บ ของโมเดล

ดังนั้น จะดีมากหากมีวิธีที่ง่ายกว่าในการรักษาความสามารถของโมเดลที่ปรับแต่งแล้ว ในขณะเดียวกันก็รักษาความสามารถของโมเดลในการผลิตเอาต์พุตตามข้อมูลการปรับแต่ง

การปรับปรุงดังกล่าวจะเป็นประโยชน์ในช่วงผู้ใช้ที่เป็นไปได้ ตั้งแต่นักเล่นและผู้รับบริการที่ใช้ LLMs และโมเดลสร้างสรรค์อื่นๆ ที่ระดับท้องถิ่น ไปจนถึงระดับ FAANG (โดยที่โมเดล AI ที่มีราคาแพงมากสามารถปรับปรุงได้อย่างไม่ทำลายล้างโดยไม่ต้องมีค่าใช้จ่ายหลายล้านเหรียญในการเริ่มการฝึกอบรมใหม่พร้อมกับข้อมูลเพิ่มเติม)

การปรับแต่งหลังการฝึกอบรม

สิ่งนี้นำเราไปสู่ เอกสารใหม่ ซึ่งมีชื่อว่า การปรับแต่งแบบละเอียดเป็นเรื่องที่ดี ถ้าได้รับการปรับเทียบ และมาจากนักวิจัย 11 คนจาก Ohio State University, University of Wisconsin Madison และ Rensselar Polytechnic Institute

นักวิจัยพยายามค้นหาว่าอะไรที่ถูกทำลายในโมเดลพื้นฐานเมื่อมันถูกปรับแต่ง พวกเขาสรุปว่าความแตกต่างหลักเดียวระหว่าง ‘ก่อนและหลัง’ โมเดลคือว่ามาตราส่วนลอจิตข้ามคลาสการปรับแต่งและคลาสเดิมในโมเดลแสดงถึงความไม่เท่าเทียมกันที่สำคัญ

ลิงก์ลอจิตทำนายความน่าจะเป็นของความสำเร็จใน กระบวนการถดถอยเชิงตรรกะ โดยการแปลงค่าที่คำนวณได้ (ซึ่งอาจมีความแม่นยำสูง) เป็น 0 หรือ 1

ผู้เขียนไม่เพียงแต่พบว่าความบกพร่องนี้สามารถกลับด้านได้อย่างง่ายดายโดยเทคนิคการปรับเทียบ แต่ยังพบว่าการแก้ไข หลังการฝึกอบรม นี้ทำให้คุณภาพของเอาต์พุตสำหรับข้อมูลการปรับแต่งดีขึ้น ดังนั้น ด้วยเทคนิคนี้ คุณไม่เพียงแต่ได้รับความสามารถของโมเดลพื้นฐานเท่านั้น แต่ยังได้รับการบูรณาการที่ดีขึ้นของข้อมูลการปรับแต่งของคุณด้วย

(แม้ว่าเอกสารจะไม่ได้ตรวจสอบโอกาส แต่เทคนิคนี้ชี้ให้เห็นว่าโมเดลสามารถปรับแต่งได้หลายครั้งและยังคงมีประสิทธิภาพ)

เมื่อพูดถึงการค้นพบของพวกเขาเกี่ยวกับการทำลายโมเดลหลังการปรับแต่ง ผู้เขียนกล่าวว่า:

‘เราพบว่าโมเดลที่ปรับแต่งแล้วไม่ลืมความสัมพันธ์ระหว่างคลาสอื่นๆ และไม่ทำให้คุณลักษณะในการรู้จักคลาสเหล่านั้นเสื่อมลง

‘แทนที่จะทำให้โมเดลที่ปรับแต่งแล้วมักจะสร้างคุณลักษณะที่แยกแยะได้ดีขึ้นสำหรับคลาสอื่นๆ แม้ว่าคลาสเหล่านั้นจะไม่มีอยู่ระหว่างการปรับแต่งก็ตาม!

‘สิ่งที่แท้จริงทำลายความแม่นยำคือมาตราส่วนลอจิตที่ไม่เท่าเทียมกันระหว่างคลาสการปรับแต่งและคลาสอื่นๆ ซึ่งบ่งชี้ว่าการปรับเทียบหลังการฝึกอบรมแบบง่ายๆ จะทำให้โมเดลพื้นฐานกลับมามีความสามารถและเปิดเผยการปรับปรุงคุณลักษณะในคลาสทั้งหมด’

ผู้เขียนได้ทำให้ผลลัพธ์ของการทดสอบสำหรับทฤษฎีนี้สามารถทำซ้ำได้ใน GitHub repository

เมื่อตรวจสอบ พบว่าส่วนเดียวของสถาปัตยกรรมโมเดลพื้นฐานที่ถูกทำลายจากการปรับแต่งคือ ตัวจำแนกแบบทวินาม ซึ่งจำแนกคลาสที่ ไม่มีอยู่ ในโมเดลเดิมเป็นคลาสการปรับแต่ง

เอกสารระบุว่า*:

‘ด้วยการเพิ่มปัจจัยการปรับเทียบคงที่ให้กับลอจิตของคลาสที่ไม่มีอยู่ทั้งหมด [4, 40 ] โมเดลที่ปรับแต่งแล้วสามารถกลับมามีความแม่นยำของคลาสที่ไม่มีอยู่และได้รับการปรับปรุงโดยรวมในโดเมนลงสตรีมได้

‘ผลการทำงานนี้แม้จะเหนือกว่า Holistic Transfer – เอกสารที่นี้สร้างขึ้น – ในหลายๆ เบนช์มาร์ก รวมถึง ImageNet และรูปแบบต่างๆ ของ ImageNet [ImageNet, ImageNet-R(endition), ImageNet-S(ketch) ], Office-Home และ VTAB โดยไม่ต้องมีการฝึกอบรมที่ซับซ้อนและการตั้งค่าพารามิเตอร์’

ผลลัพธ์จากเอกสาร: โมเดลที่ปรับแต่งแล้วซึ่งได้รับการปรับเทียบหลังการฝึกอบรมสามารถเหนือกว่าวิธีการที่ดีที่สุดในปัจจุบันในการแก้ปัญหา

ผลลัพธ์จากเอกสาร: โมเดลที่ปรับแต่งแล้วซึ่งได้รับการปรับเทียบหลังการฝึกอบรมสามารถเหนือกว่าวิธีการที่ดีที่สุดในปัจจุบันในการแก้ปัญหา

ผู้เขียนจัดประเภทการทำงานที่ดีขึ้นของโมเดลที่ปรับแต่งแล้วและปรับเทียบหลังการฝึกอบรมเป็น ‘พฤติกรรมที่ดีไม่คาดคิด’ และสังเกตว่าเมื่อใช้ Stochastic Gradient Descent (SGD) ที่เป็นตัวเลือกพื้นฐาน ผลลัพธ์ที่ดีกว่าจะได้รับเมื่อเทียบกับตัวเลือกการปรับเทียบที่ได้รับความนิยมมากกว่า เช่น Adam

‘อย่างไรก็ตาม,’ พวกเขาเขียนว่า ‘ด้วยอัตราการเรียนรู้ที่เล็กพอที่จะลดลงและลดความสำคัญของน้ำหนัก ผลที่ดีจะปรากฏและคงอยู่’

การซ่อมแซมเล็กๆ น้อยๆ

เพื่อซ่อมแซมความไม่เท่าเทียมกันของลอจิตที่เกิดจากการปรับแต่ง ผู้เขียนยืมเทคนิคจาก การเรียนรู้แบบไม่มีข้อมูลฝึกอบรม โดยการเพิ่มปัจจัยคงที่ให้กับลอจิตของคลาสที่ไม่มีอยู่ทั้งหมด ซึ่งนำไปสู่กฎการจำแนกใหม่

ผู้เขียนสังเกตว่ากระบวนการนี้ ‘ส่งเสริม’ คลาสที่ไม่มีอยู่ให้มีคุณภาพในการทำนายเท่ากับคลาสที่ปรับแต่ง และทำให้โมเดลกลับมามีประสิทธิภาพเดิมและปรับปรุงประสิทธิภาพของ ‘ข้อมูลที่เพิ่ม’ ในขณะอนุมาน

ในการทดสอบ เทคนิคการปรับเทียบหลังการฝึกอบรมทำให้โมเดลที่ปรับแต่งแล้วมีประสิทธิภาพกลับมา 'Oracle' ที่แสดงในตารางหมายถึงตัวจำแนกที่ปรับแต่งแล้วซึ่งพิจารณาข้อมูลคลาสที่ไม่มีอยู่ด้วย

ในการทดสอบ เทคนิคการปรับเทียบหลังการฝึกอบรมทำให้โมเดลที่ปรับแต่งแล้วมีประสิทธิภาพกลับมา ‘Oracle’ ที่แสดงในตารางหมายถึงตัวจำแนกที่ปรับแต่งแล้วซึ่งพิจารณาข้อมูลคลาสที่ไม่มีอยู่ด้วย

พวกเขายังเห็นว่าการปรับเทียบหลังการฝึกอบรม ‘มีศักยภาพในการใช้กับโมเดลใดๆ’ และวิธีการที่พยายามรักษาความสมบูรณ์ของโมเดลพื้นฐานโดยการแช่แข็งชั้น (เช่น ตัวจำแนกและโครงร่าง) มีประสิทธิภาพต่ำกว่าวิธีการที่พวกเขาเสนอ

สรุป

ผลการวิจัยจากความร่วมมือนี้ดูเหมือนจะมีนัยสำคัญ การฝึกอบรมโมเดล AI บนเซตข้อมูลขนาดใหญ่ถือเป็นการมุ่งหมายที่ยิ่งใหญ่ เช่นเดียวกับการปล่อยเครื่องบินโดยสาร การฝึกอบรมสามารถหยุดชั่วคราว และความเสียหายสามารถบรรเทาได้โดยการบันทึกน้ำหนักปัจจุบัน (ด้วยต้นทุนการเก็บบันทึกที่มาก) เพื่อให้สามารถหยุดการฝึกอบรมได้ แต่มีไม่มากที่สามารถทำได้เพื่อเปลี่ยนผลลัพธ์หลังจากการปล่อย

สิ่งที่น่าประทับใจเกี่ยวกับงานวิจัยคือว่านักวิจัยดูเหมือนจะค้นพบหลักการสำคัญในการฝึกอบรมโมเดล AI โดยรวม และวิธีแก้ปัญหาของพวกเขานั้นง่ายแต่สวยงาม

ผลกระทบทางเศรษฐกิจของการรักษาความแม่นยำของโมเดลพื้นฐานหลังการปรับแต่งมีนัยสำคัญ ในปัจจุบัน วิธีการทั่วไปในการแก้ไขข้อบกพร่องของโมเดล AI ที่มีราคาหลายล้านเหรียญคือการกรองเอาต์พุตในขณะอนุมานหรือควบคุมการอนุมานเพื่อหลีกเลี่ยงจุดอ่อนของโมเดล

นอกจากนี้ เทคนิคนี้อาจนำไปสู่การปรับปรุงความสามารถของโมเดลสร้างสรรค์ที่ปรับแต่งแล้วที่ระดับผู้บริโภค โดยมีผลประโยชน์เป็นการเพิ่มคุณภาพของเอาต์พุต

 

* การแปลงอ้างอิงภายในของฉันให้เป็นลิงก์

เผยแพร่ครั้งแรกวันอังคารที่ 1 ตุลาคม 2024

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai