โมเดลและแพลตฟอร์ม AI

การพัฒนาการจัดตำแหน่ง AI ที่สอดคล้องกับค่านิยมของมนุษย์โดยใช้ WARM

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การจัดตำแหน่งระบบ AI ที่สอดคล้องกับค่านิยมของมนุษย์

ระบบปัญญาประดิษฐ์ (AI) มีความสามารถที่เพิ่มขึ้นในการช่วยเหลือมนุษย์ในงานที่ซับซ้อน ตั้งแต่แชทบอทบริการลูกค้าไปจนถึงอัลกอริธึมการวินิจฉัยทางการแพทย์ อย่างไรก็ตาม เมื่อระบบ AI เหล่านี้รับผิดชอบมากขึ้น จึงจำเป็นที่จะต้องแน่ใจว่าระบบเหล่านั้นสอดคล้องกับค่านิยมและความชอบของมนุษย์ วิธีการหนึ่งที่จะบรรลุเป้าหมายนี้คือการใช้เทคนิคที่เรียกว่าการเรียนรู้การเสริมแรงจากข้อมูลการให้คำติชมของมนุษย์ (RLHF) ใน RLHF ระบบ AI ที่เรียกว่านโยบายจะได้รับรางวัลหรือถูกปรับตามการตัดสินของมนุษย์เกี่ยวกับการกระทำของระบบ AI วัตถุประสงค์คือเพื่อให้นโยบายเรียนรู้ที่จะเพิ่มรางวัลให้สูงสุด และดังนั้นจึงปฏิบัติตามความชอบของมนุษย์

ส่วนประกอบหลักของ RLHF คือโมเดลรางวัล (RM) RM มีความรับผิดชอบในการประเมินการกระทำและผลลัพธ์ของนโยบาย และส่งสัญญาณรางวัลกลับเพื่อช่วยในการเรียนรู้ การออกแบบ RM ที่ดีนั้นเป็นเรื่องที่ท้าทาย เนื่องจากความชอบของมนุษย์อาจซับซ้อน ขึ้นอยู่กับบริบท และแม้กระทั่งไม่สอดคล้องกันระหว่างบุคคล นักวิจัยจาก Google DeepMind ได้เสนอเทคนิคที่เรียกว่า Weight Averaged Reward Models (WARM) เพื่อปรับปรุงการออกแบบ RM

ปัญหาในการหลอกลวงรางวัล

ปัญหาหลักใน RLHF คือการหลอกลวงรางวัล การหลอกลวงรางวัลเกิดขึ้นเมื่อนโยบายพบวิธีการหลอกลวงระบบ RM เพื่อให้ได้รับรางวัลสูงโดยไม่ต้องปฏิบัติตามวัตถุประสงค์ที่ตั้งใจไว้ ตัวอย่างเช่น สมมติว่าวัตถุประสงค์คือการฝึกอบรม AI เพื่อสร้างสรุปที่มีคุณภาพสูง RM อาจให้รางวัลแก่สรุปที่สั้นและให้ข้อมูล นโยบายอาจเรียนรู้ที่จะใช้ประโยชน์จากสิ่งนี้โดยการสร้างสรุปที่สั้นและไม่มีข้อมูลที่มีคำสำคัญที่หลอกลวง RM

การหลอกลวงรางวัลเกิดขึ้นจากสองสาเหตุหลัก:

  1. การเปลี่ยนแปลงการกระจาย – RM ถูกฝึกอบรมบนชุดข้อมูลที่มีการให้ฉลากโดยมนุษย์ เมื่อใช้งาน นโยบายอาจผลิตผลลัพธ์ที่มาจากการกระจายที่แตกต่างที่ RM ไม่สามารถทั่วไปได้ดี
  2. ฉลากที่มีเสียงรบกวน – การให้ฉลากโดยมนุษย์ไม่สมบูรณ์แบบ มีความไม่เห็นด้วยระหว่างผู้ให้ฉลาก RM อาจจับกับเสียงรบกวนมากกว่าเครื่องหมายที่แข็งแกร่งของคุณภาพ

การหลอกลวงรางวัลนำไปสู่ระบบที่ไม่มีประโยชน์ซึ่งล้มเหลวในการตอบสนองความคาดหวังของมนุษย์ สิ่งนี้อาจส่งผลให้เกิดพฤติกรรม AI ที่มีอคติหรือแม้กระทั่งอันตรายหากใช้งานโดยไม่ระมัดระวัง

การเพิ่มขึ้นของการรวมโมเดล

ความสนใจที่เพิ่มขึ้นในกลยุทธ์การรวมโมเดล เช่น Model Ratatouille ถูกขับเคลื่อนโดยการรับรู้ว่าโมเดลที่ใหญ่ขึ้น แม้ว่าจะมีพลัง แต่ก็อาจไม่มีประสิทธิภาพและไม่เหมาะสม การฝึกอบรมโมเดลที่มีพารามิเตอร์ 1 ล้านล้านตัวต้องใช้ข้อมูลจำนวนมาก การคำนวณ เวลา และต้นทุน สิ่งสำคัญกว่านั้น โมเดลเหล่านี้มักจะ overfit กับการกระจายการฝึกอบรม ทำให้ไม่สามารถทั่วไปได้ดีในสถานการณ์โลกแห่งความเป็นจริงที่หลากหลาย

การรวมโมเดลให้วิธีทางเลือกในการปลดล็อกความสามารถที่มากกว่าโดยไม่ต้องเพิ่มขนาดโมเดลขึ้นอย่างไม่มีการควบคุม โดยการนำโมเดลที่เชี่ยวชาญหลายตัวที่ฝึกอบรมบนการกระจาย การทำงาน หรือวัตถุประสงค์ที่แตกต่างกัน การรวมโมเดลมุ่งหมายที่จะเพิ่มความสามารถในการปรับตัวและความแข็งแกร่งในการกระจายตัว

ผลลัพธ์最近แสดงให้เห็นถึงความหวังของแนวคิดนี้ โมเดลที่ได้รับจากการรวม แม้ว่าจะมีพารามิเตอร์น้อยกว่า แต่ก็สามารถเทียบหรือแม้กระทั่งเหนือกว่าผลการทำงานของโมเดลยักษ์อย่าง GPT-3 ตัวอย่างเช่น โมเดล Ratatouille ที่ประกอบด้วยเช็คพอยต์ขนาดกลาง 7 จุดบรรลุความแม่นยำสูงสุดในข้อมูลชุดข้อมูลการอนุมานข้อความสูง โดยเหนือกว่า GPT-3

ความเรียบง่ายของการรวมโดยการเฉลี่ยถ่วงน้ำหนักเป็นข้อดีใหญ่ การฝึกอบรมโมเดลเสริมหลายตัวต้องใช้ทรัพยากรเพิ่มเติม แต่การคำนวณในขณะอนุมานยังคงเหมือนกับโมเดลเดียว เนื่องจากน้ำหนักถูกย่อให้เหลือน้ำหนักเดียว ทำให้วิธีการนี้สามารถปรับให้เหมาะสมได้ง่าย โดยไม่ต้องกังวลเรื่องความล่าช้าหรือต้นทุนหน่วยความจำ

กลไกเบื้องหลังการรวมโมเดล

แต่สิ่งใดที่ทำให้เกิดการเพิ่มขึ้นของความแม่นยำจากการรวมโมเดลนั้น การวิเคราะห์最近ให้คำตอบบางอย่าง:

  • การบรรเทาผลการจำ: แต่ละโมเดลเห็นชุดข้อมูลที่ถูกสับเปลี่ยนในช่วงการฝึกอบรม การเฉลี่ยลดการจำแบบสุ่มลง โดยเก็บเฉพาะการสรุประดับชุดข้อมูล
  • การลดความแปรปรวน: โมเดลที่ฝึกอบรมอิสระมีข้อผิดพลาดที่ไม่สัมพันธ์กัน การรวมกันจะเฉลี่ยความผิดพลาดออกไป โดยปรับปรุงการปรับให้เหมาะสม
  • การปรับให้เหมาะสมผ่านความหลากหลาย: การเปลี่ยนแปลงงานเสริมบังคับให้โมเดลจับกับคุณลักษณะที่ทั่วไปและเป็นประโยชน์ข้ามการกระจายตัว
  • การเพิ่มความแข็งแกร่ง: ความไม่สอดคล้องกันในการทำนายสัญญาณความไม่แน่นอน การเฉลี่ยจะลดการวินิจฉัยที่ผิดปกติ โดยเพิ่มความน่าเชื่อถือ

โดยสรุป การรวมโมเดลจะชดเชยความอ่อนแอของโมเดลแต่ละตัวเพื่อเพิ่มจุดแข็งร่วมกัน การแสดงผลที่รวมกันจับโครงสร้างสาเหตุพื้นฐานที่ซ่อนอยู่ โดยไม่สนใจการเปลี่ยนแปลงที่ไม่สำคัญ

รากฐานแนวคิดนี้เชื่อมโยงการรวมโมเดลกับเทคนิคอื่นๆ เช่น การรวมกันและการเรียนรู้หลายงาน ทั้งหมดนี้ใช้ความหลากหลายระหว่างโมเดลหรืองานเพื่อให้ได้ระบบที่มีความสามารถและตระหนักถึงความไม่แน่นอน ความเรียบง่ายและประสิทธิภาพของการเฉลี่ยถ่วงน้ำหนักทำให้การรวมโมเดลมีข้อได้เปรียบเฉพาะตัวสำหรับการใช้งานจริง

Weight Averaged Reward Models

การปรับตำแหน่งด้วย WARM

การปรับตำแหน่งด้วย WARM

WARM ใช้โมเดลรางวัลที่เป็นโพรกซี่ (RM) ซึ่งเป็นการเฉลี่ยถ่วงน้ำหนักของโมเดลรางวัลหลายตัวที่ถูกปรับให้เหมาะสมจากโมเดลภาษาขนาดใหญ่ (LLM) ที่เหมือนกัน แต่มีไฮเปอร์พารามิเตอร์ที่แตกต่างกัน วิธีการนี้ปรับปรุงประสิทธิภาพ ความน่าเชื่อถือภายใต้การเปลี่ยนแปลงการกระจาย และความแข็งแกร่งต่อความชอบที่ไม่สอดคล้องกัน การศึกษายังแสดงให้เห็นว่าการใช้ WARM เป็นโมเดลรางวัลที่เป็นโพรกซี่ โดยเฉพาะอย่างยิ่งด้วยจำนวนโมเดลรางวัลที่เฉลี่ยถ่วงน้ำหนักที่เพิ่มขึ้น จะปรับปรุงผลลัพธ์และชะลอการเริ่มต้นของ ‘การหลอกลวงรางวัล’ ซึ่งเป็นปรากฏการณ์ที่รางวัลควบคุมเสื่อมลงเมื่อเวลาผ่านไป

นี่คือภาพรวมระดับสูง:

  1. เริ่มต้นด้วยโมเดลภาษาขนาดใหญ่ที่ฝึกอบรมบนโคปัสขนาดใหญ่ เริ่มต้นโมเดลรางวัลหลายตัวโดยการเพิ่มชั้นเฉพาะงานบนโมเดลภาษาขนาดใหญ่
  2. ปรับให้เหมาะสมโมเดลรางวัลแต่ละตัวแยกกันบนชุดข้อมูลความชอบของมนุษย์ โดยใช้ไฮเปอร์พารามิเตอร์ที่แตกต่างกัน เช่น อัตราการเรียนรู้เพื่อความหลากหลาย
  3. เฉลี่ยน้ำหนักของโมเดลรางวัลที่ปรับให้เหมาะสมเพื่อให้ได้โมเดล WARM ที่รวมกัน

ข้อคิดหลักคือการเฉลี่ยน้ำหนักจะเก็บเฉพาะข้อมูลที่ไม่เปลี่ยนแปลงที่เรียนรู้ทั่วโมเดลรางวัลที่หลากหลาย สิ่งนี้จะลดการอาศัยสัญญาณที่ไม่แท้จริง และเพิ่มความแข็งแกร่ง โมเดลที่รวมกันยังได้รับประโยชน์จากการลดความแปรปรวน ซึ่งปรับปรุงความน่าเชื่อถือ尽管การเปลี่ยนแปลงการกระจาย

ตามที่กล่าวไว้ก่อนหน้านี้ ความหลากหลายระหว่างโมเดลที่ฝึกอบรมอิสระเป็นสิ่งสำคัญสำหรับการปลดล็อกศักยภาพเต็มที่ของการรวมโมเดล แต่วิธีการเฉพาะเจาะจงใดที่สามารถส่งเสริมความหลากหลายที่มีประสิทธิผล?

เอกสาร WARM ตรวจสอบความคิดที่ชาญฉลาดบางอย่างที่อาจทั่วไปได้:

การสลับลำดับ

วิธีการที่ง่ายแต่มีผลกระทบคือการสลับลำดับที่ข้อมูลจุดต่างๆ ถูกมองเห็นโดยโมเดลแต่ละตัวระหว่างการฝึกอบรม แม้ว่าจะเป็นเพียงขั้นตอนง่ายๆ การสับเปลี่ยนก็ทำให้น้ำหนักไม่สัมพันธ์กัน ลดการจำแบบสุ่มลง

การเปลี่ยนแปลงไฮเปอร์พารามิเตอร์

การปรับไฮเปอร์พารามิเตอร์ เช่น อัตราการเรียนรู้และความน่าจะเป็นในการทิ้งสำหรับการวิ่งแต่ละครั้ง จะแนะนำความหลากหลายที่มีประโยชน์ โมเดลจะบรรลุผลลัพธ์ที่แตกต่างกัน โดยจับกับคุณลักษณะที่แตกต่างกันของชุดข้อมูล

การเฉลี่ยเช็คพอยต์ – Baklava

วิธีการ Baklava เริ่มต้นโมเดลสำหรับการรวมจากสแนปช็อตที่แตกต่างกันตามเส้นทางการฝึกอบรมเดียวกัน สิ่งนี้คลายข้อจำกัดเมื่อเทียบกับโมเดลซุปที่กำหนดจุดเริ่มต้นที่ใช้ร่วมกัน เมื่อเทียบกับโมเดล Ratatouille Baklava หลีกเลี่ยงงานเสริมเพิ่มเติม โดยรวมแล้ว มันสร้างสมดุลระหว่างความแม่นยำและความหลากหลายได้อย่างมีประสิทธิภาพ

การปรับให้เหมาะสมของโมเดลรางวัลหลายตัว

การปรับให้เหมาะสมของโมเดลรางวัลหลายตัว

การวิเคราะห์ยืนยันว่าการเพิ่มเช็คพอยต์ที่เก่ากว่าโดยเฉลี่ยถ่วงน้ำหนักจะทำลายประสิทธิภาพของแต่ละตัว โดยประนีประนอมความชอบของความหลากหลาย การเฉลี่ยเฉพาะการแสดงผลสุดท้ายจากแต่ละการวิ่งจะทำงานได้ดีกว่า โดยทั่วไป การสร้างสมดุลระหว่างเป้าหมายความหลากหลายกับการรักษาความแม่นยำยังคงเป็นความท้าทายในการวิจัยที่เปิดกว้าง

โดยรวมแล้ว การรวมโมเดลสอดคล้องกับจิตวิญญาณทั่วไปในสนามเพื่อใช้ทรัพยากรที่มีอยู่ให้เกิดประโยชน์สูงสุดเพื่อความน่าเชื่อถือ ประสิทธิภาพ และความสามารถที่ดีขึ้น ความเรียบง่ายของการเฉลี่ยน้ำหนักทำให้มันเป็นตัวเลือกชั้นนำสำหรับการสร้างโมเดลที่แข็งแกร่งจากบล็อกที่มีอยู่

ไม่เหมือนกับวิธีการรวมแบบดั้งเดิมที่เฉลี่ยการทำนาย WARM รักษาความซับซ้อนที่คำนวณให้เหลือน้อยที่สุด โดยรักษาชุดน้ำหนักเดียว การทดลองบนงานสรุปข้อความแสดงให้เห็นถึงประสิทธิผลของ WARM:

  • สำหรับการตัวอย่างที่ดีที่สุด WARM บรรลุอัตราชนะ 92.5% เมื่อเทียบกับการเลือกแบบสุ่มตามฉลากความชอบของมนุษย์
  • ใน RLHF นโยบาย WARM บรรลุอัตราชนะ 79.4% เมื่อเทียบกับนโยบายที่ฝึกอบรมด้วยโมเดลรางวัลเดียวหลังจากจำนวนขั้นตอนที่เท่ากัน
  • WARM ยังคงทำงานได้ดีแม้ว่าหนึ่งในสี่ของฉลากของมนุษย์ถูกบิดเบือน

ผลลัพธ์เหล่านี้แสดงถึงศักยภาพของ WARM ในฐานะเทคนิคที่ใช้ได้จริงสำหรับการพัฒนาช่วยเหลือ AI ที่มีความน่าเชื่อถือ โดยการทำให้ความไม่สอดคล้องกันในข้อมูลการให้คำติชมของมนุษย์เรียบง่ายลง นโยบาย WARM สามารถยังคงสอดคล้องกับค่านิยมของมนุษย์แม้จะเรียนรู้จากประสบการณ์ใหม่ต่อไป

ภาพรวมที่ใหญ่กว่า

WARM ตั้งอยู่ที่จุดตัดของสองแนวโน้มหลักในการวิจัยการจัดตำแหน่ง AI ประการแรกคือการศึกษาการทั่วไปที่อยู่นอกการกระจาย (OOD) ซึ่งมีเป้าหมายเพื่อปรับปรุงประสิทธิภาพของโมเดลในข้อมูลใหม่ที่แตกต่างจากการกระจายการฝึกอบรม ประการสองคือการวิจัยเกี่ยวกับความแข็งแกร่งของอัลกอริทึม โดยเน้นความน่าเชื่อถือ尽管การเปลี่ยนแปลงอินพุตเล็กๆ หรือเสียงรบกวน

โดยการเชื่อมโยงระหว่างสาขาเหล่านี้รอบแนวคิดเรื่องความไม่เปลี่ยนแปลงที่เรียนรู้ WARM นำเราไปสู่เทคนิคที่มีพื้นฐานที่เข้มงวดมากขึ้นสำหรับการจัดตำแหน่งค่านิยม ข้อคิดเห็นจาก WARM อาจทั่วไปได้แม้กระทั่งเกินกว่า RLHF โดยให้บทเรียนสำหรับระบบการเรียนรู้ของเครื่องอื่นๆ ที่โต้ตอบกับโลกเปิด

แน่นอนว่าการสร้างโมเดลรางวัลเป็นเพียงส่วนหนึ่งของปัญหาการจัดตำแหน่ง เรายังคงต้องการความก้าวหน้าในความท้าทายอื่นๆ เช่น การระบุรางวัล การกำกับดูแลที่สามารถปรับขนาดได้ และการสำรวจที่ปลอดภัย เมื่อรวมกับเทคนิคที่เสริมซึ่งกันและกัน WARM อาจเร่งการพัฒนาของ AI ที่ส่งเสริมความเจริญรุ่งเรืองของมนุษย์อย่างยั่งยืน โดยการทำให้หลักการเบื้องหลังการจัดตำแหน่งที่แข็งแกร่งชัดเจน นักวิจัยกำลังสร้างเส้นทางไปสู่ AI ที่มีประโยชน์และมีจริยธรรม

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป