Prompt engineering
การฝึกอบรมการฝังตัวข้อความที่ดีขึ้นด้วยโมเดลภาษาขนาดใหญ่

การฝังตัวข้อความเป็นตัวแทนของเวกเตอร์ของคำ วรรค ประโยค หรือเอกสารที่จับความหมายเชิงความหมายของพวกมัน ซึ่งใช้เป็นบล็อกการสร้างหลักในหลาย ๆ แอปพลิเคชันประมวลผลภาษา自然ในปัจจุบัน รวมถึงการค้นหาข้อมูล การตอบคำถาม การค้นหาความหมายเชิงความหมาย และอื่น ๆ
การปรับปรุงล่าสุดในโมเดลภาษาขนาดใหญ่ เช่น GPT-3 ได้แสดงให้เห็นถึงความสามารถที่น่าประทับใจในการเรียนรู้แบบ few-shot และการสร้างภาษา自然 ในที่นี้ เราสามารถใช้โมเดลภาษาขนาดใหญ่เหล่านี้เพื่อปรับปรุงสถานะของการฝังตัวข้อความหรือไม่ ในบทความ “การปรับปรุงการฝังตัวข้อความด้วยโมเดลภาษาขนาดใหญ่” นักวิจัยจาก Microsoft (MSFT ) เสนอวิธีการใหม่ที่สามารถให้ผลลัพธ์ที่เหนือกว่าโดยการสร้างข้อมูลฝึกอบรมสังเคราะห์ด้วยโมเดลภาษาขนาดใหญ่และปรับแต่งบนข้อมูลนั้น
ความท้าทายของวิธีการที่มีอยู่
เทคนิคการฝังตัวข้อความแบบดั้งเดิม เช่น การใช้ค่าเฉลี่ยถ่วงน้ำหนักของเวกเตอร์คำหรือ TF-IDF ไม่สามารถจับข้อมูลเชิงบริบทที่มีคุณภาพในข้อความได้อย่างเพียงพอ วิธีการที่ใหม่กว่าซึ่งใช้โมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้า เช่น BERT สามารถให้การฝังตัวข้อความที่ตระหนักบริบทได้ดีกว่า
อย่างไรก็ตาม วิธีการเหล่านี้ต้องการการฝึกอบรมหลายขั้นตอนที่ซับซ้อน
- การฝึกอบรมล่วงหน้าบนคู่ข้อความที่มีเครื่องหมายกำกับอ่อนหรือสังเคราะห์หลายพันล้านคู่
- การปรับแต่งบนชุดข้อมูลที่มีการจัดเตรียมด้วยมืออย่างจำกัด
สิ่งนี้ต้องการทรัพยากรการคำนวณและความพยายามของมนุษย์ในการรวบรวมข้อมูลอย่างมาก ข้อมูลฝึกอบรมยังถูกจำกัดในด้านความหลากหลายและความคุ้มครองภาษา ตัวอย่างเช่น ชุดข้อมูล BEIR ประกอบด้วยชุดข้อมูลสำหรับงานค้นหาข้อมูลเพียง 15 งานในภาษาอังกฤษ
วิธีการที่มีอยู่ส่วนใหญ่ใช้โครงสร้างแบบ BERT ที่มีขนาดเล็กกว่าในฐานะโมเดลหลัก และไม่สามารถใช้ประโยชน์จากโมเดลภาษาขนาดใหญ่ที่มีความก้าวหน้ากว่าได้
วิธีการ: การสร้างข้อมูลสังเคราะห์ด้วยโมเดลภาษาขนาดใหญ่
เพื่อเอาชนะข้อจำกัดเหล่านี้ นักวิจัยได้เสนอแนวทางฝึกอบรมแบบเดี่ยวที่ใช้โมเดลภาษาขนาดใหญ่ เช่น GPT-3 และ GPT-4 เพื่อสร้างข้อมูลฝึกอบรมสังเคราะห์ที่หลากหลาย
ขั้นตอนหลักคือ
- การจำแนกประเภทงาน: นิยามระบบการจำแนกประเภทที่แบ่งงานการฝังตัวข้อความออกเป็น
- งานแบบไม่สมมาตร (คำถามและเอกสารไม่ใช่การเขียนใหม่ เช่น การค้นหา)
- งานแบบสมมาตร (คำถามและเอกสารเป็นการเขียนใหม่ เช่น ความคล้ายคลึงกันเชิงความหมาย)
- การออกแบบคำสั่ง: สร้างเทมเพลตคำสั่งที่ปรับให้เหมาะสมกับแต่ละประเภทงานเพื่อชี้นำโมเดลภาษาขนาดใหญ่ในการสร้างตัวอย่างฝึกอบรมที่เกี่ยวข้อง
- การสร้างข้อมูลสังเคราะห์: ใช้คำสั่งที่ออกแบบมาเพื่อสร้างคู่ (คำถาม, เอกสาร) หลายแสนคู่ที่ครอบคลุมงานเชิงความหมายหลากหลายใน 93 ภาษา
- การฝึกอบรมโมเดล: ปรับแต่งโมเดลภาษาขนาดใหญ่ที่เปิดเผยต่อสาธารณะ เช่น Mistral บนข้อมูลสังเคราะห์โดยใช้การฝึกอบรมแบบสูญเสียที่สอดคล้องกัน
วิธีการนี้ช่วยให้สามารถสร้างข้อมูลฝึกอบรมที่เพียงพอสำหรับงานที่หลากหลายในหลายภาษาโดยไม่ต้องใช้ความพยายามในการทำเครื่องหมายของมนุษย์
นักวิจัยได้แสดงให้เห็นถึงสิ่งนี้ด้วยกลยุทธ์การส่งคำสั่ง 2 ขั้นตอน
- การส่งคำสั่ง GPT-4 เพื่อแนะนำงานค้นหาที่เป็นไปได้
- การส่งคำสั่งอีกครั้งเพื่อสร้างตัวอย่าง (คำถาม, เอกสาร) ตามงานที่แนะนำ
บางแง่มุมที่สำคัญของการออกแบบคำสั่ง
- คำสั่งภาษาธรรมชาติสำหรับการสั่งงานที่直观และคล้ายกับการสั่งงานของมนุษย์
- พื้นที่ว่างสำหรับการส่งเสริมความหลากหลาย (เช่น ความยาวคำถาม ความชัดเจน ความยาวเอกสาร)
- การรวมข้อมูลจากหลายเทมเพลตสำหรับประเภทงานเดียวกัน
- การชั่งน้ำหนักภาษาตามความพร้อมของทรัพยากร
โดยรวมแล้ว พวกเขาสามารถสร้างตัวอย่างการฝังตัวข้อความได้ 500,000 ตัวอย่างด้วยค่าใช้จ่ายในการคำนวณ 180 ล้านโทเค็น ภาษาที่ใช้มากที่สุดคือภาษาอังกฤษ (43%) ตามด้วยภาษาโปแลนด์ ญี่ปุ่น อิตาลี และอื่น ๆ
สำหรับการฝึกอบรมโมเดล พวกเขาตัดสินใจปรับแต่งโมเดล Mistral ที่เปิดเผยต่อสาธารณะขนาด 7B พารามิเตอร์แทนการใช้โครงสร้าง BERT ที่มีขนาดเล็กกว่า เนื่องจาก Mistral ได้รับการฝึกอบรมล่วงหน้าบนคอร์ปัสข้อความขนาดใหญ่แล้ว จึงไม่จำเป็นต้องมีการฝึกอบรมแบบสูญเสียเพิ่มเติม
การปรับแต่งทั้งหมดใช้เวลาไม่ถึง 1,000 ขั้นตอน โดยใช้ข้อมูลสังเคราะห์และข้อมูลที่มีการทำเครื่องหมายด้วยมือ ซึ่งแสดงให้เห็นถึงประสิทธิภาพของตัวอย่างของวิธีการที่เสนอ
ผลลัพธ์
นักวิจัยได้ประเมินโมเดลของตนบนชุดข้อมูล MTEB ซึ่งครอบคลุมงานที่หลากหลายทั้งการจำแนกประเภท การจัดกลุ่ม ความคล้ายคลึงกันเชิงความหมาย การสรุป และการค้นหาข้อมูล
โมเดลของพวกเขา ทำผลงานเหนือกว่าผลงานที่ดีที่สุดก่อนหน้านี้ 2.4 คะแนนในคะแนนเฉลี่ย โดยสร้างสถิติใหม่เกือบทุกประเภท
| โมเดล | ผลงานที่ดีที่สุดก่อนหน้านี้ | โมเดลที่เสนอ |
|---|---|---|
| การจำแนกประเภท | 76.0 | 78.5 |
| การจัดกลุ่ม | 46.1 | 50.3 |
| การจำแนกประเภทแบบคู่ | 87.1 | 88.3 |
| การเรียงลำดับ | 60.0 | 60.2 |
| การค้นหา | 54.3 | 56.9 |
| STS | 83.1 | 84.6 |
| การสรุป | 31.6 | 31.4 |
| ค่าเฉลี่ย | 64.2 | 66.6 |
น่าประทับใจที่แม้ไม่ได้ใช้ข้อมูลที่มีการทำเครื่องหมายและฝึกอบรมเพียงบนข้อมูลสังเคราะห์เท่านั้น แต่ก็สามารถบรรลุความแม่นยำที่สามารถแข่งขันได้ โดยอยู่ห่างจากโมเดลที่ได้รับการดูแลอย่างเต็มที่เพียง 3.5 คะแนน
นักวิจัยยังประเมินบนชุดข้อมูล MIRACL ที่ครอบคลุม 18 ภาษา โมเดลของพวกเขาได้ทำผลงานเหนือกว่าผลงานที่ดีที่สุดก่อนหน้านี้ในภาษาที่มีทรัพยากรมาก แต่ทำผลงานได้ไม่ดีนักในภาษาที่มีทรัพยากรน้อย
โดยสรุป การฝังตัวข้อความที่ฝึกอบรมบนข้อมูลสังเคราะห์ที่สร้างโดยโมเดลภาษาขนาดใหญ่สร้างผลงานที่ดีที่สุดใหม่ โดยใช้การฝึกอบรมที่ง่ายและประหยัดกว่าวิธีการหลายขั้นตอนก่อนหน้านี้
การวิเคราะห์
งานนี้ให้ข้อคิดที่มีคุณค่าหลายประการ
- โมเดลภาษาขนาดใหญ่ เช่น GPT-3 และ GPT-4 มีความสามารถที่น่าประทับใจในการสร้างข้อมูลฝึกอบรมสังเคราะห์คุณภาพสูงสำหรับงานประมวลผลภาษาหลายอย่างเมื่อได้รับคำสั่งที่เหมาะสม
- สำหรับการฝังตัวข้อความ การฝึกอบรมแบบสูญเสียที่สอดคล้องกันไม่ได้ให้ประโยชน์อย่างมีนัยสำคัญเมื่อเทียบกับการปรับแต่งโมเดลที่มีการฝึกอบรมล่วงหน้าขนาดใหญ่แล้ว เช่น Mistral
- วิธีการสร้างแบบไดนามิกที่ช่วยให้โมเดลภาษาขนาดใหญ่สามารถเข้าถึงความรู้ภายนอกได้ เป็นวิธีที่มีประสิทธิภาพในการปรับปรุงการฝังตัวข้อความ
- ยังมีงานที่ต้องทำอย่างมากในภาษาที่มีทรัพยากรน้อย การฝึกอบรมโมเดลภาษาขนาดใหญ่บนข้อมูลที่มีแทนเนตที่ครอบคลุมมากขึ้นอาจช่วยปิดช่องว่างนี้
- โดยแนวคิดแล้ว การสร้างแบบและข้อความการฝังตัวเป็นสองด้านของเหรียญเดียวกัน – การทำความเข้าใจความหมายของภาษา ด้วยการสร้างข้อมูลสังเคราะห์ โมเดลภาษาขนาดใหญ่สามารถปรับให้เหมาะสมกับการฝังตัวได้โดยไม่ต้องใช้กระบวนการหลายขั้นตอน
ทิศทางที่มีแนวโน้มสำหรับการทำงานในอนาคต bao gồm
- การใช้โมเดลภาษาขนาดใหญ่ที่เปิดเผยต่อสาธารณะ เช่น GPT-NeoX เพื่อสร้างข้อมูลสังเคราะห์
- การสำรวจการฝึกอบรมหลังการฝึกอบรมแบบเบาเพื่อปรับให้เหมาะสมกับบริบทที่ยาวขึ้น
- การพัฒนาวิธีการสร้างคำสั่งที่ช่วยควบคุมคุณภาพและครอบคลุมงาน
- วิธีการปรับปรุงความหน่วงในการอนุมานและค่าใช้จ่ายในการจัดเก็บสำหรับการใช้งานในอุตสาหกรรม
นอกเหนือจากการเอาชนะบันทึกแล้ว การใช้โมเดลภาษาขนาดใหญ่เพื่อปรับปรุงการฝังตัวข้อความเปิดโอกาสที่น่าสนใจสำหรับอนาคต เมื่อโมเดลภาษาขนาดใหญ่ดำเนินการต่อในการควบคุมภาษา自然 ความสามารถในการสร้างข้อมูลสังเคราะห์คุณภาพสูงก็มีแนวโน้มที่จะดีขึ้น
การปรับแต่งและควบคุม
ประโยชน์หลักของข้อมูลสังเคราะห์คือความสามารถในการสร้างตัวอย่างที่ปรับให้เหมาะสมกับความต้องการเฉพาะได้ตามโปรแกรม
อย่างไรก็ตาม การออกแบบคำสั่งในปัจจุบันยังคงเป็นศิลปะมากกว่าวิทยาศาสตร์ การพัฒนาวิธีการที่เป็นระบบและซ้ำได้เพื่อควบคุมคุณสมบัติของข้อมูลที่สร้างขึ้นจะขยายความสามารถในการใช้วิธีการนี้
การฝึกอบรมขนาดใหญ่
แม้ว่าโมเดลภาษาขนาดใหญ่ที่ได้รับการฝึกอบรมล่วงหน้าจะเข้ารหัสความรู้ภาษาลinguistic อยู่แล้ว แต่ความสามารถในการสร้างข้อมูลของพวกมันก็มีแนวโน้มที่จะดีขึ้นเมื่อมีการเพิ่มขนาด
การออกแบบและวัตถุประสงค์ที่ปรับให้เหมาะสมกับการสร้างข้อมูลฝึกอบรมแบบ self-supervised ที่มีขนาดใหญ่มากอาจปรับปรุงคุณภาพและประสิทธิภาพของวิธีการนี้ได้
หลายงานและหลายภาษา
ตามที่บทความระบุไว้ การปรับปรุงประสิทธิภาพในภาษาที่มีทรัพยากรน้อยยังคงเป็นปัญหา แทนที่จะฝึกอบรมโมเดลภาษาขนาดใหญ่เพียงตัวเดียว อีกทางหนึ่งคือการฝึกอบรมชุดโมเดลที่เล็กกว่าที่เชี่ยวชาญในโดเมนข้อมูลหรือภาษาเฉพาะ
วิธีการแบบアンซัมเบิลนี้สามารถช่วยปรับปรุงการครอบคลุมงานและภาษาที่หายากโดยการแบ่งปันการแสดงออกที่เรียนรู้ทั่วทั้งผู้เชี่ยวชาญ การเรียนรู้อย่างต่อเนื่องเพื่อขยายความเชี่ยวชาญด้านภาษาและงานเมื่อเวลาผ่านไปก็เป็นแนวคิดที่น่าสนใจ
สรุปแล้ว บทความนี้แนะนำแนวคิดใหม่ในการสร้างข้อมูลฝึกอบรมจากโมเดลภาษาขนาดใหญ่เพื่อสร้างการฝังตัวข้อความที่มีประสิทธิภาพ ผลลัพธ์ของพวกเขาแสดงให้เห็นถึงประสิทธิผลของวิธีการนี้ โดยเอาชนะบันทึกก่อนหน้านี้ เมื่อโมเดลภาษาขนาดใหญ่และเทคนิคข้อมูลสังเคราะห์เดินหน้าต่อไป การใช้ความรู้ของพวกมันในการฝึกอบรมการฝังตัวข้อความอาจกลายเป็นทิศทางที่มีแนวโน้มมาก















