Prompt engineering

การฝึกอบรมการฝังตัวข้อความที่ดีขึ้นด้วยโมเดลภาษาขนาดใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การฝังตัวข้อความเป็นตัวแทนของเวกเตอร์ของคำ วรรค ประโยค หรือเอกสารที่จับความหมายเชิงความหมายของพวกมัน ซึ่งใช้เป็นบล็อกการสร้างหลักในหลาย ๆ แอปพลิเคชันประมวลผลภาษา自然ในปัจจุบัน รวมถึงการค้นหาข้อมูล การตอบคำถาม การค้นหาความหมายเชิงความหมาย และอื่น ๆ

vector embedding

vector embedding

การปรับปรุงล่าสุดในโมเดลภาษาขนาดใหญ่ เช่น GPT-3 ได้แสดงให้เห็นถึงความสามารถที่น่าประทับใจในการเรียนรู้แบบ few-shot และการสร้างภาษา自然 ในที่นี้ เราสามารถใช้โมเดลภาษาขนาดใหญ่เหล่านี้เพื่อปรับปรุงสถานะของการฝังตัวข้อความหรือไม่ ในบทความ “การปรับปรุงการฝังตัวข้อความด้วยโมเดลภาษาขนาดใหญ่” นักวิจัยจาก Microsoft (MSFT ) เสนอวิธีการใหม่ที่สามารถให้ผลลัพธ์ที่เหนือกว่าโดยการสร้างข้อมูลฝึกอบรมสังเคราะห์ด้วยโมเดลภาษาขนาดใหญ่และปรับแต่งบนข้อมูลนั้น

ความท้าทายของวิธีการที่มีอยู่

เทคนิคการฝังตัวข้อความแบบดั้งเดิม เช่น การใช้ค่าเฉลี่ยถ่วงน้ำหนักของเวกเตอร์คำหรือ TF-IDF ไม่สามารถจับข้อมูลเชิงบริบทที่มีคุณภาพในข้อความได้อย่างเพียงพอ วิธีการที่ใหม่กว่าซึ่งใช้โมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้า เช่น BERT สามารถให้การฝังตัวข้อความที่ตระหนักบริบทได้ดีกว่า

อย่างไรก็ตาม วิธีการเหล่านี้ต้องการการฝึกอบรมหลายขั้นตอนที่ซับซ้อน

  • การฝึกอบรมล่วงหน้าบนคู่ข้อความที่มีเครื่องหมายกำกับอ่อนหรือสังเคราะห์หลายพันล้านคู่
  • การปรับแต่งบนชุดข้อมูลที่มีการจัดเตรียมด้วยมืออย่างจำกัด

สิ่งนี้ต้องการทรัพยากรการคำนวณและความพยายามของมนุษย์ในการรวบรวมข้อมูลอย่างมาก ข้อมูลฝึกอบรมยังถูกจำกัดในด้านความหลากหลายและความคุ้มครองภาษา ตัวอย่างเช่น ชุดข้อมูล BEIR ประกอบด้วยชุดข้อมูลสำหรับงานค้นหาข้อมูลเพียง 15 งานในภาษาอังกฤษ

วิธีการที่มีอยู่ส่วนใหญ่ใช้โครงสร้างแบบ BERT ที่มีขนาดเล็กกว่าในฐานะโมเดลหลัก และไม่สามารถใช้ประโยชน์จากโมเดลภาษาขนาดใหญ่ที่มีความก้าวหน้ากว่าได้

วิธีการ: การสร้างข้อมูลสังเคราะห์ด้วยโมเดลภาษาขนาดใหญ่

เพื่อเอาชนะข้อจำกัดเหล่านี้ นักวิจัยได้เสนอแนวทางฝึกอบรมแบบเดี่ยวที่ใช้โมเดลภาษาขนาดใหญ่ เช่น GPT-3 และ GPT-4 เพื่อสร้างข้อมูลฝึกอบรมสังเคราะห์ที่หลากหลาย

ขั้นตอนหลักคือ

  1. การจำแนกประเภทงาน: นิยามระบบการจำแนกประเภทที่แบ่งงานการฝังตัวข้อความออกเป็น
    • งานแบบไม่สมมาตร (คำถามและเอกสารไม่ใช่การเขียนใหม่ เช่น การค้นหา)
    • งานแบบสมมาตร (คำถามและเอกสารเป็นการเขียนใหม่ เช่น ความคล้ายคลึงกันเชิงความหมาย)
  2. การออกแบบคำสั่ง: สร้างเทมเพลตคำสั่งที่ปรับให้เหมาะสมกับแต่ละประเภทงานเพื่อชี้นำโมเดลภาษาขนาดใหญ่ในการสร้างตัวอย่างฝึกอบรมที่เกี่ยวข้อง
  3. การสร้างข้อมูลสังเคราะห์: ใช้คำสั่งที่ออกแบบมาเพื่อสร้างคู่ (คำถาม, เอกสาร) หลายแสนคู่ที่ครอบคลุมงานเชิงความหมายหลากหลายใน 93 ภาษา
  4. การฝึกอบรมโมเดล: ปรับแต่งโมเดลภาษาขนาดใหญ่ที่เปิดเผยต่อสาธารณะ เช่น Mistral บนข้อมูลสังเคราะห์โดยใช้การฝึกอบรมแบบสูญเสียที่สอดคล้องกัน

วิธีการนี้ช่วยให้สามารถสร้างข้อมูลฝึกอบรมที่เพียงพอสำหรับงานที่หลากหลายในหลายภาษาโดยไม่ต้องใช้ความพยายามในการทำเครื่องหมายของมนุษย์

นักวิจัยได้แสดงให้เห็นถึงสิ่งนี้ด้วยกลยุทธ์การส่งคำสั่ง 2 ขั้นตอน

  • การส่งคำสั่ง GPT-4 เพื่อแนะนำงานค้นหาที่เป็นไปได้

Prompt for generating high-level retrieval tasks

    Prompt for generating high-level retrieval tasks
  • การส่งคำสั่งอีกครั้งเพื่อสร้างตัวอย่าง (คำถาม, เอกสาร) ตามงานที่แนะนำ

n generate (query, positive, hard negative) triplets

    n generate (query, positive, hard negative) triplets

บางแง่มุมที่สำคัญของการออกแบบคำสั่ง

  • คำสั่งภาษาธรรมชาติสำหรับการสั่งงานที่直观และคล้ายกับการสั่งงานของมนุษย์
  • พื้นที่ว่างสำหรับการส่งเสริมความหลากหลาย (เช่น ความยาวคำถาม ความชัดเจน ความยาวเอกสาร)
  • การรวมข้อมูลจากหลายเทมเพลตสำหรับประเภทงานเดียวกัน
  • การชั่งน้ำหนักภาษาตามความพร้อมของทรัพยากร

โดยรวมแล้ว พวกเขาสามารถสร้างตัวอย่างการฝังตัวข้อความได้ 500,000 ตัวอย่างด้วยค่าใช้จ่ายในการคำนวณ 180 ล้านโทเค็น ภาษาที่ใช้มากที่สุดคือภาษาอังกฤษ (43%) ตามด้วยภาษาโปแลนด์ ญี่ปุ่น อิตาลี และอื่น ๆ

สำหรับการฝึกอบรมโมเดล พวกเขาตัดสินใจปรับแต่งโมเดล Mistral ที่เปิดเผยต่อสาธารณะขนาด 7B พารามิเตอร์แทนการใช้โครงสร้าง BERT ที่มีขนาดเล็กกว่า เนื่องจาก Mistral ได้รับการฝึกอบรมล่วงหน้าบนคอร์ปัสข้อความขนาดใหญ่แล้ว จึงไม่จำเป็นต้องมีการฝึกอบรมแบบสูญเสียเพิ่มเติม

การปรับแต่งทั้งหมดใช้เวลาไม่ถึง 1,000 ขั้นตอน โดยใช้ข้อมูลสังเคราะห์และข้อมูลที่มีการทำเครื่องหมายด้วยมือ ซึ่งแสดงให้เห็นถึงประสิทธิภาพของตัวอย่างของวิธีการที่เสนอ

ผลลัพธ์

นักวิจัยได้ประเมินโมเดลของตนบนชุดข้อมูล MTEB ซึ่งครอบคลุมงานที่หลากหลายทั้งการจำแนกประเภท การจัดกลุ่ม ความคล้ายคลึงกันเชิงความหมาย การสรุป และการค้นหาข้อมูล

โมเดลของพวกเขา ทำผลงานเหนือกว่าผลงานที่ดีที่สุดก่อนหน้านี้ 2.4 คะแนนในคะแนนเฉลี่ย โดยสร้างสถิติใหม่เกือบทุกประเภท

โมเดล ผลงานที่ดีที่สุดก่อนหน้านี้ โมเดลที่เสนอ
การจำแนกประเภท 76.0 78.5
การจัดกลุ่ม 46.1 50.3
การจำแนกประเภทแบบคู่ 87.1 88.3
การเรียงลำดับ 60.0 60.2
การค้นหา 54.3 56.9
STS 83.1 84.6
การสรุป 31.6 31.4
ค่าเฉลี่ย 64.2 66.6

น่าประทับใจที่แม้ไม่ได้ใช้ข้อมูลที่มีการทำเครื่องหมายและฝึกอบรมเพียงบนข้อมูลสังเคราะห์เท่านั้น แต่ก็สามารถบรรลุความแม่นยำที่สามารถแข่งขันได้ โดยอยู่ห่างจากโมเดลที่ได้รับการดูแลอย่างเต็มที่เพียง 3.5 คะแนน

นักวิจัยยังประเมินบนชุดข้อมูล MIRACL ที่ครอบคลุม 18 ภาษา โมเดลของพวกเขาได้ทำผลงานเหนือกว่าผลงานที่ดีที่สุดก่อนหน้านี้ในภาษาที่มีทรัพยากรมาก แต่ทำผลงานได้ไม่ดีนักในภาษาที่มีทรัพยากรน้อย

โดยสรุป การฝังตัวข้อความที่ฝึกอบรมบนข้อมูลสังเคราะห์ที่สร้างโดยโมเดลภาษาขนาดใหญ่สร้างผลงานที่ดีที่สุดใหม่ โดยใช้การฝึกอบรมที่ง่ายและประหยัดกว่าวิธีการหลายขั้นตอนก่อนหน้านี้

การวิเคราะห์

งานนี้ให้ข้อคิดที่มีคุณค่าหลายประการ

  • โมเดลภาษาขนาดใหญ่ เช่น GPT-3 และ GPT-4 มีความสามารถที่น่าประทับใจในการสร้างข้อมูลฝึกอบรมสังเคราะห์คุณภาพสูงสำหรับงานประมวลผลภาษาหลายอย่างเมื่อได้รับคำสั่งที่เหมาะสม
  • สำหรับการฝังตัวข้อความ การฝึกอบรมแบบสูญเสียที่สอดคล้องกันไม่ได้ให้ประโยชน์อย่างมีนัยสำคัญเมื่อเทียบกับการปรับแต่งโมเดลที่มีการฝึกอบรมล่วงหน้าขนาดใหญ่แล้ว เช่น Mistral
  • วิธีการสร้างแบบไดนามิกที่ช่วยให้โมเดลภาษาขนาดใหญ่สามารถเข้าถึงความรู้ภายนอกได้ เป็นวิธีที่มีประสิทธิภาพในการปรับปรุงการฝังตัวข้อความ
  • ยังมีงานที่ต้องทำอย่างมากในภาษาที่มีทรัพยากรน้อย การฝึกอบรมโมเดลภาษาขนาดใหญ่บนข้อมูลที่มีแทนเนตที่ครอบคลุมมากขึ้นอาจช่วยปิดช่องว่างนี้
  • โดยแนวคิดแล้ว การสร้างแบบและข้อความการฝังตัวเป็นสองด้านของเหรียญเดียวกัน – การทำความเข้าใจความหมายของภาษา ด้วยการสร้างข้อมูลสังเคราะห์ โมเดลภาษาขนาดใหญ่สามารถปรับให้เหมาะสมกับการฝังตัวได้โดยไม่ต้องใช้กระบวนการหลายขั้นตอน

ทิศทางที่มีแนวโน้มสำหรับการทำงานในอนาคต bao gồm

  • การใช้โมเดลภาษาขนาดใหญ่ที่เปิดเผยต่อสาธารณะ เช่น GPT-NeoX เพื่อสร้างข้อมูลสังเคราะห์
  • การสำรวจการฝึกอบรมหลังการฝึกอบรมแบบเบาเพื่อปรับให้เหมาะสมกับบริบทที่ยาวขึ้น
  • การพัฒนาวิธีการสร้างคำสั่งที่ช่วยควบคุมคุณภาพและครอบคลุมงาน
  • วิธีการปรับปรุงความหน่วงในการอนุมานและค่าใช้จ่ายในการจัดเก็บสำหรับการใช้งานในอุตสาหกรรม

นอกเหนือจากการเอาชนะบันทึกแล้ว การใช้โมเดลภาษาขนาดใหญ่เพื่อปรับปรุงการฝังตัวข้อความเปิดโอกาสที่น่าสนใจสำหรับอนาคต เมื่อโมเดลภาษาขนาดใหญ่ดำเนินการต่อในการควบคุมภาษา自然 ความสามารถในการสร้างข้อมูลสังเคราะห์คุณภาพสูงก็มีแนวโน้มที่จะดีขึ้น

การปรับแต่งและควบคุม

ประโยชน์หลักของข้อมูลสังเคราะห์คือความสามารถในการสร้างตัวอย่างที่ปรับให้เหมาะสมกับความต้องการเฉพาะได้ตามโปรแกรม

อย่างไรก็ตาม การออกแบบคำสั่งในปัจจุบันยังคงเป็นศิลปะมากกว่าวิทยาศาสตร์ การพัฒนาวิธีการที่เป็นระบบและซ้ำได้เพื่อควบคุมคุณสมบัติของข้อมูลที่สร้างขึ้นจะขยายความสามารถในการใช้วิธีการนี้

การฝึกอบรมขนาดใหญ่

แม้ว่าโมเดลภาษาขนาดใหญ่ที่ได้รับการฝึกอบรมล่วงหน้าจะเข้ารหัสความรู้ภาษาลinguistic อยู่แล้ว แต่ความสามารถในการสร้างข้อมูลของพวกมันก็มีแนวโน้มที่จะดีขึ้นเมื่อมีการเพิ่มขนาด

การออกแบบและวัตถุประสงค์ที่ปรับให้เหมาะสมกับการสร้างข้อมูลฝึกอบรมแบบ self-supervised ที่มีขนาดใหญ่มากอาจปรับปรุงคุณภาพและประสิทธิภาพของวิธีการนี้ได้

หลายงานและหลายภาษา

ตามที่บทความระบุไว้ การปรับปรุงประสิทธิภาพในภาษาที่มีทรัพยากรน้อยยังคงเป็นปัญหา แทนที่จะฝึกอบรมโมเดลภาษาขนาดใหญ่เพียงตัวเดียว อีกทางหนึ่งคือการฝึกอบรมชุดโมเดลที่เล็กกว่าที่เชี่ยวชาญในโดเมนข้อมูลหรือภาษาเฉพาะ

วิธีการแบบアンซัมเบิลนี้สามารถช่วยปรับปรุงการครอบคลุมงานและภาษาที่หายากโดยการแบ่งปันการแสดงออกที่เรียนรู้ทั่วทั้งผู้เชี่ยวชาญ การเรียนรู้อย่างต่อเนื่องเพื่อขยายความเชี่ยวชาญด้านภาษาและงานเมื่อเวลาผ่านไปก็เป็นแนวคิดที่น่าสนใจ

สรุปแล้ว บทความนี้แนะนำแนวคิดใหม่ในการสร้างข้อมูลฝึกอบรมจากโมเดลภาษาขนาดใหญ่เพื่อสร้างการฝังตัวข้อความที่มีประสิทธิภาพ ผลลัพธ์ของพวกเขาแสดงให้เห็นถึงประสิทธิผลของวิธีการนี้ โดยเอาชนะบันทึกก่อนหน้านี้ เมื่อโมเดลภาษาขนาดใหญ่และเทคนิคข้อมูลสังเคราะห์เดินหน้าต่อไป การใช้ความรู้ของพวกมันในการฝึกอบรมการฝังตัวข้อความอาจกลายเป็นทิศทางที่มีแนวโน้มมาก

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป