โมเดลและแพลตฟอร์ม AI

LongWriter: การปลดปล่อยการสร้างเนื้อหามากกว่า 10,000 คำจากโมเดลภาษาขนาดใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
LONGWRITER: UNLEASHING 10,000+ WORD GENERATION FROM LONG CONTEXT LLMS

โมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันสามารถประมวลผลข้อมูลเข้าได้สูงสุด 100,000 โทเค็น แต่ก็ยังต้องดิ้นรนในการสร้างผลลัพธ์ที่มีความยาวเกิน 2,000 คำ การทดลองที่ควบคุมอย่างเข้มงวดเปิดเผยว่าความยาวการสร้างที่มีประสิทธิภาพของโมเดลถูกจำกัดโดยตัวอย่างที่เห็นระหว่างการฝึกอบรมแบบกำกับ (SFT) ในอีกทางหนึ่ง การจำกัดความยาวผลลัพธ์นี้เกิดจากความขาดแคลนตัวอย่างผลลัพธ์ที่มีความยาวในเซตข้อมูล SFT ที่มีอยู่

ความก้าวหน้าล่าสุดในโมเดลภาษาขนาดใหญ่แบบยาวได้นำไปสู่การสร้างโมเดลที่มีความจุหน่วยความจำที่ขยายออกไปอย่างมีนัยสำคัญ ซึ่งสามารถประมวลผลประวัติที่เกิน 100,000 โทเค็นได้ อย่างไรก็ตาม แม้ว่าโมเดลเหล่านี้จะสามารถจัดการข้อมูลเข้าได้อย่างกว้างขวาง แต่โมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันก็ยังดิ้นรนในการสร้างผลลัพธ์ที่มีความยาวเท่ากัน

เพื่อสำรวจข้อจำกัดนี้ LongWriter ตรวจสอบความยาวผลลัพธ์สูงสุดของโมเดลภาษาขนาดใหญ่แบบยาวรุ่นล่าสุดโดยใช้คำถามที่ต้องการคำตอบที่มีความยาวต่างกัน เช่น “เขียนบทความ 10,000 คำเกี่ยวกับประวัติของจักรวรรดิโรมัน” ผลลัพธ์แสดงให้เห็นว่าโมเดลทั้งหมดล้มเหลวในการสร้างผลลัพธ์ที่มีความยาวเกิน 2,000 คำอย่างต่อเนื่อง ในขณะเดียวกัน การวิเคราะห์บันทึกการโต้ตอบของผู้ใช้เผยให้เห็นว่ามากกว่า 1% ของคำถามของผู้ใช้ขอผลลัพธ์ที่มีความยาวเกินขีดจำกัดนี้ ซึ่งเน้นย้ำถึงความจำเป็นในการวิจัยในปัจจุบันที่จะต้องเอาชนะข้อจำกัดนี้

เพื่อแก้ไขปัญหานี้ LongWriter แนะนำ AgentWrite ซึ่งเป็นกระบวนการแบบตัวแทนใหม่ที่ออกแบบมาเพื่อใช้โมเดลภาษาขนาดใหญ่แบบยาวที่มีอยู่แล้วในการสร้างผลลัพธ์ที่มีความยาวเกิน 20,000 คำ โดยใช้ AgentWrite LongWriter สร้าง LongWriter-6k ซึ่งเป็นชุดข้อมูล SFT ที่มี 6,000 ตัวอย่าง โดยมีความยาวผลลัพธ์ระหว่าง 2,000 ถึง 32,000 คำ เมื่อเพิ่มข้อมูลนี้เข้าไปในการฝึกอบรมโมเดล LongWriter สามารถขยายความยาวผลลัพธ์ของโมเดลที่มีอยู่แล้วให้มากกว่า 10,000 คำได้สำเร็จ ในขณะเดียวกันก็รักษาคุณภาพผลลัพธ์ไว้

LongWriter ยังพัฒนา LongBench-Write ซึ่งเป็นมาตรฐานการประเมินสำหรับการประเมินความสามารถในการสร้างผลลัพธ์ที่มีความยาวเกิน 10,000 คำ โมเดล 9B ที่ได้รับการปรับปรุงเพิ่มเติมโดยใช้ DPO สามารถบรรลุผลลัพธ์ที่ดีที่สุดในมาตรฐานนี้ และสามารถแซงหน้าโมเดลที่มีขนาดใหญ่กว่าได้

ในบทความนี้ เราจะพูดถึงเฟรมเวิร์ก LongWriter ตรวจสอบสถาปัตยกรรม และเปรียบเทียบประสิทธิภาพกับโมเดลภาษาขนาดใหญ่แบบยาวรุ่นล่าสุด มาเริ่มกันเลย

LongWriter: เฟรมเวิร์กการสร้างเนื้อหามากกว่า 10,000 คำ

ความก้าวหน้าล่าสุดในโมเดลภาษาขนาดใหญ่แบบยาวได้นำไปสู่การสร้างโมเดลที่มีความจุหน่วยความจำที่ขยายออกไปอย่างมีนัยสำคัญ ซึ่งสามารถประมวลผลประวัติที่เกิน 100,000 โทเค็นได้ อย่างไรก็ตาม โมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันยังดิ้นรนในการสร้างผลลัพธ์ที่มีความยาวเท่ากัน เพื่อสำรวจข้อจำกัดนี้ LongWriter ตรวจสอบความยาวผลลัพธ์สูงสุดของโมเดลภาษาขนาดใหญ่แบบยาวรุ่นล่าสุดโดยใช้คำถามที่ต้องการคำตอบที่มีความยาวต่างกัน เช่น “เขียนบทความ 10,000 คำเกี่ยวกับประวัติของจักรวรรดิโรมัน” ผลลัพธ์แสดงให้เห็นว่าโมเดลทั้งหมดล้มเหลวในการสร้างผลลัพธ์ที่มีความยาวเกิน 2,000 คำอย่างต่อเนื่อง ในขณะเดียวกัน การวิเคราะห์บันทึกการโต้ตอบของผู้ใช้เผยให้เห็นว่ามากกว่า 1% ของคำถามของผู้ใช้ขอผลลัพธ์ที่มีความยาวเกินขีดจำกัดนี้ ซึ่งเน้นย้ำถึงความจำเป็นในการวิจัยในปัจจุบันที่จะต้องเอาชนะข้อจำกัดนี้

การวิจัยของ LongWriter เผยให้เห็นถึงข้อค้นพบหลักๆ ว่าข้อจำกัดความยาวผลลัพธ์ของโมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันเกิดจากข้อจำกัดความยาวผลลัพธ์ในเซตข้อมูล SFT โดยเฉพาะอย่างยิ่ง LongWriter พบว่าความยาวการสร้างที่มีประสิทธิภาพของโมเดลถูกจำกัดโดยขีดจำกัดความยาวผลลัพธ์ที่มีอยู่ในเซตข้อมูล SFT ของโมเดล นี่เป็นเหตุผลที่ทำให้เกิดขีดจำกัดความยาว 2,000 คำที่พบเห็นทั่วไปในโมเดลในปัจจุบัน เนื่องจากเซตข้อมูล SFT ที่มีอยู่มักไม่มีตัวอย่างที่มีความยาวเกินขีดจำกัดนี้

เพื่อแก้ไขปัญหานี้ LongWriter แนะนำ AgentWrite ซึ่งเป็นกระบวนการแบบตัวแทนใหม่ที่ออกแบบมาเพื่อใช้โมเดลภาษาขนาดใหญ่แบบยาวที่มีอยู่แล้วในการสร้างผลลัพธ์ที่มีความยาวเกิน 20,000 คำ โดยใช้ AgentWrite LongWriter สร้าง LongWriter-6k ซึ่งเป็นชุดข้อมูล SFT ที่มี 6,000 ตัวอย่าง โดยมีความยาวผลลัพธ์ระหว่าง 2,000 ถึง 32,000 คำ เมื่อเพิ่มข้อมูลนี้เข้าไปในการฝึกอบรมโมเดล LongWriter สามารถขยายความยาวผลลัพธ์ของโมเดลที่มีอยู่แล้วให้มากกว่า 10,000 คำได้สำเร็จ ในขณะเดียวกันก็รักษาคุณภาพผลลัพธ์ไว้

LongWriter ยังพัฒนา LongBench-Write ซึ่งเป็นมาตรฐานการประเมินสำหรับการประเมินความสามารถในการสร้างผลลัพธ์ที่มีความยาวเกิน 10,000 คำ โมเดล 9B ที่ได้รับการปรับปรุงเพิ่มเติมโดยใช้ DPO สามารถบรรลุผลลัพธ์ที่ดีที่สุดในมาตรฐานนี้ และสามารถแซงหน้าโมเดลที่มีขนาดใหญ่กว่าได้

  • การวิเคราะห์ขีดจำกัดความยาวการสร้าง: LongWriter ระบุข้อจำกัดหลักๆ ที่ทำให้โมเดลภาษาขนาดใหญ่แบบยาวในปัจจุบันไม่สามารถสร้างผลลัพธ์ที่มีความยาวเกิน 2,000 คำ ซึ่งเป็นข้อจำกัดความยาวผลลัพธ์ในเซตข้อมูล SFT
  • AgentWrite: LongWriter แนะนำ AgentWrite ซึ่งเป็นกระบวนการแบบตัวแทนใหม่ที่ออกแบบมาเพื่อใช้โมเดลภาษาขนาดใหญ่แบบยาวที่มีอยู่แล้วในการสร้างผลลัพธ์ที่มีความยาวเกิน 20,000 คำ โดยใช้ AgentWrite LongWriter สร้าง LongWriter-6k ซึ่งเป็นชุดข้อมูล SFT ที่มี 6,000 ตัวอย่าง โดยมีความยาวผลลัพธ์ระหว่าง 2,000 ถึง 32,000 คำ
  • การขยายความยาวผลลัพธ์ของโมเดล: LongWriter สามารถขยายความยาวผลลัพธ์ของโมเดลที่มีอยู่แล้วให้มากกว่า 10,000 คำได้สำเร็จ โดยการเพิ่มข้อมูล LongWriter-6k เข้าไปในการฝึกอบรมโมเดล และใช้ DPO เพื่อปรับปรุงคุณภาพผลลัพธ์และความยาวผลลัพธ์

AgentWrite: การสร้างข้อมูลอัตโนมัติ

เพื่อใช้โมเดลภาษาขนาดใหญ่แบบยาวที่มีอยู่แล้วในการสร้างผลลัพธ์ที่มีความยาวเกิน 20,000 คำ LongWriter ออกแบบ AgentWrite ซึ่งเป็นกระบวนการแบบตัวแทนใหม่ที่ใช้โมเดลภาษาขนาดใหญ่แบบยาวที่มีอยู่แล้วในการสร้างผลลัพธ์ที่มีความยาวเกิน 20,000 คำ โดยใช้ AgentWrite LongWriter สร้าง LongWriter-6k ซึ่งเป็นชุดข้อมูล SFT ที่มี 6,000 ตัวอย่าง โดยมีความยาวผลลัพธ์ระหว่าง 2,000 ถึง 32,000 คำ

ขั้นตอนที่ 1: การวางแผน

โดยใช้ความสามารถในการวางแผนของโมเดลภาษาขนาดใหญ่แบบยาว LongWriter สร้างแผนการเขียนที่มีรายละเอียด โดยมีเป้าหมายและจำนวนคำที่ต้องการสำหรับแต่ละย่อหน้าตามคำสั่งของผู้ใช้

ขั้นตอนที่ 2: การเขียน

หลังจากได้รับแผนการเขียนจากขั้นตอนที่ 1 LongWriter จะเรียกโมเดลภาษาขนาดใหญ่แบบยาวเพื่อสร้างเนื้อหาส่วนต่างๆ ตามแผนการเขียน โดยใช้ข้อมูลที่มีอยู่แล้วเพื่อสร้างเนื้อหาส่วนต่อไป

การตรวจสอบ

LongWriter ทดสอบความยาวการสร้างและคุณภาพของวิธีการ AgentWrite บนชุดข้อมูล LongWrite-Ruler และ LongBench-Write โดยใช้โมเดล GPT-4o และโมเดล LongWriter-9B

การฝึกอบรมแบบกำกับ

LongWriter ฝึกอบรมโมเดลภาษาขนาดใหญ่แบบยาวโดยใช้โมเดล GLM-4-9B และ Llama-3.1-8B โดยใช้เทคนิคการฝึกอบรมแบบกำกับและเทคนิคการปรับเปลี่ยนความยาวผลลัพธ์

การปรับเปลี่ยนความยาวผลลัพธ์

LongWriter ใช้เทคนิคการปรับเปลี่ยนความยาวผลลัพธ์โดยใช้ DPO เพื่อปรับปรุงคุณภาพผลลัพธ์และความยาวผลลัพธ์ของโมเดล

LongWriter: การทดลองและผลลัพธ์

LongWriter ทดสอบโมเดลภาษาขนาดใหญ่แบบยาว 4 โมเดลที่มีอยู่แล้วและโมเดล LongWriter-9B และ LongWriter-8B บนชุดข้อมูล LongBench-Write โดยใช้เทคนิคการประเมินความยาวผลลัพธ์และคุณภาพผลลัพธ์

โมเดลก่อนหน้านี้ไม่สามารถตอบสนองความต้องการความยาวเกิน 2,000 คำ ในขณะที่โมเดล LongWriter ให้ผลลัพธ์ที่มีความยาวและความ豊富มากกว่า

LongWriter พบว่าโมเดลก่อนหน้านี้ไม่สามารถตอบสนองความต้องการความยาวเกิน 2,000 คำ ในขณะที่โมเดล LongWriter ให้ผลลัพธ์ที่มีความยาวและความ豊富มากกว่า

DPO ปรับปรุงคุณภาพผลลัพธ์และความยาวผลลัพธ์ของโมเดล

LongWriter พบว่า DPO ปรับปรุงคุณภาพผลลัพธ์และความยาวผลลัพธ์ของโมเดล โดยเฉพาะอย่างยิ่งเมื่อใช้เทคนิคการปรับเปลี่ยนความยาวผลลัพธ์

ความยาวผลลัพธ์ของโมเดล LongWriter ขยายได้ระหว่าง 10,000 ถึง 20,000 คำ แต่ต้องการข้อมูลที่มีความยาวมากกว่าเพื่อสนับสนุนผลลัพธ์ที่มีความยาวมากกว่า

LongWriter พบว่าความยาวผลลัพธ์ของโมเดล LongWriter ขยายได้ระหว่าง 10,000 ถึง 20,000 คำ แต่ต้องการข้อมูลที่มีความยาวมากกว่าเพื่อสนับสนุนผลลัพธ์ที่มีความยาวมากกว่า

ข้อคิดสุดท้าย

ในงานนี้ เราได้พูดถึง LongWriter ซึ่งเป็นเฟรมเวิร์กที่ใช้โมเดลภาษาขนาดใหญ่แบบยาวในการสร้างผลลัพธ์ที่มีความยาวเกิน 10,000 คำ โดยใช้เทคนิคการฝึกอบรมแบบกำกับและเทคนิคการปรับเปลี่ยนความยาวผลลัพธ์ LongWriter สามารถขยายความยาวผลลัพธ์ของโมเดลที่มีอยู่แล้วให้มากกว่า 10,000 คำได้สำเร็จ และสามารถปรับปรุงคุณภาพผลลัพธ์ได้โดยใช้ DPO

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล