มุมมองของ Anderson
การสร้างโมเดลภาษา GPT-Style สำหรับคำถามเดียว

นักวิจัยจากจีนได้พัฒนาแนวทางที่คุ้มค่าในการสร้างระบบประมวลผลภาษาธรรมชาติ GPT-3-Style โดยหลีกเลี่ยงค่าใช้จ่ายที่เพิ่มขึ้นเรื่อยๆ ของเวลาและเงินในการฝึกอบรมชุดข้อมูลขนาดใหญ่ – แนวโน้มที่กำลังเติบโตซึ่งอาจทำให้ภาคส่วนนี้ของ AI ถูกจำกัดเฉพาะผู้เล่น FAANG และนักลงทุนที่มีระดับสูง
เฟรมเวิร์กที่เสนอเรียกว่า Task-Driven Language Modeling (TLM) แทนที่จะฝึกโมเดลขนาดใหญ่และซับซ้อนบน корпусภาษาขนาดใหญ่หลายพันล้านคำและหลายพันลेबล์และคลาส TLM ฝึกโมเดลขนาดเล็กที่รวมคำถามเข้าไปในโมเดลโดยตรง

ด้านซ้าย เป็นแนวทางแบบไฮเปอร์สเกลในการสร้างโมเดลภาษาขนาดใหญ่ ด้านขวา เป็นแนวทางแบบ TLM ในการสำรวจคอร์ปัสภาษาขนาดใหญ่ตามหัวข้อหรือคำถามแต่ละรายการ Source: https://arxiv.org/pdf/2111.04130.pdf
โดยทั่วไป โมเดลหรืออัลกอริทึม NLP ที่ไม่ซ้ำกันจะถูกสร้างขึ้นเพื่อตอบคำถามเดียว แทนที่จะสร้างโมเดลภาษาทั่วไปที่สามารถตอบคำถามได้หลากหลาย
ในการทดสอบ TLM นักวิจัยพบว่าแนวทางใหม่นี้สามารถให้ผลลัพธ์ที่คล้ายหรือดีกว่าโมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้า เช่น RoBERTa-Large และระบบ NLP ระดับไฮเปอร์สเกล เช่น OpenAI’s GPT-3, Google’s TRILLION Parameter Switch Transformer Model, Korea’s HyperClover, AI21 Labs’ Jurassic 1 และ Microsoft’s Megatron-Turing NLG 530B
ในการทดสอบ TLM บนชุดข้อมูลการจำแนกประเภทแปดชุดในสี่โดเมน ผู้วิจัยพบว่าระบบนี้สามารถลดการคำนวณ FLOPs (การดำเนินการ浮้าจุดต่อวินาที) ที่จำเป็นในการฝึกอบรมลงสองอันดับ ผู้วิจัยหวังว่า TLM จะ “ทำให้ประชาธิปไตย” ในภาคส่วนที่กำลังจะกลายเป็นชนชั้นสูง โดยมีโมเดล NLP ที่ใหญ่เกินไปที่ไม่สามารถติดตั้งได้จริงบนเครื่องและต้องอยู่เบื้องหลัง API ของ OpenAI และ Microsoft Azure ที่มีค่าใช้จ่ายสูงและจำกัด
ผู้วิจัยระบุว่าการลดเวลาในการฝึกอบรมลงสองอันดับสามารถลดค่าใช้จ่ายในการฝึกอบรมลงได้มากกว่า 1,000 เท่า โดยใช้ GPU 8 ตัวเป็นเวลา 48 ชั่วโมง
รายงานใหม่ รายงาน มีชื่อเรื่องว่า NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework และมาจากนักวิจัยสามคนจาก Tsinghua University ใน北京 และนักวิจัยจากบริษัทพัฒนา AI ของจีน Recurrent AI, Inc.
คำตอบที่ไม่สามารถจ่ายได้
ค่าใช้จ่ายในการฝึกอบรมโมเดลภาษาที่มีประสิทธิภาพและทั่วไปกำลังจะกลายเป็น “ขีดจำกัดความร้อน” ที่สามารถแพร่กระจาย NLP ที่แม่นยำและมีประสิทธิภาพได้จริง

สถิติเกี่ยวกับการเติบโตของแง่มุมในโครงสร้างโมเดล NLP จากรายงานปี 2020 โดย A121 Labs Source: https://arxiv.org/pdf/2004.08900.pdf
ในปี 2019 นักวิจัย คำนวณ ว่าค่าใช้จ่ายในการฝึกอบรมโมเดล XLNet (ที่รายงานว่าสามารถเอาชนะ BERT ในงาน NLP) คือ 61,440 ดอลลาร์สหรัฐฯ ในช่วง 2.5 วัน โดยใช้ 512 คอร์บนอุปกรณ์ 64 เครื่อง ในขณะที่ GPT-3 มีค่าใช้จ่าย ประมาณ 12 ล้านดอลลาร์ในการฝึกอบรม – ค่าใช้จ่ายที่สูงกว่า GPT-2 ถึง 200 เท่า (แม้ว่าประมาณการใหม่จะระบุว่าสามารถฝึกอบรมได้ใน ราคาเพียง 4,600,000 ดอลลาร์ บน GPU ค่าใช้จ่ายต่ำสุด)
ชุดข้อมูลย่อยตามความต้องการของคำถาม
แทนการฝึกอบรมโมเดลขนาดใหญ่และซับซ้อนบนคอร์ปัสภาษาขนาดใหญ่ แนวทางใหม่นี้มุ่งหวังที่จะให้การจำแนกประเภทที่แม่นยำและทั่วไปโดยใช้คำถามเป็นฟิลเตอร์เพื่อกำหนดชุดข้อมูลย่อยจากคอร์ปัสภาษาขนาดใหญ่ที่จะถูกฝึกอบรมพร้อมกับคำถามเพื่อให้คำตอบในหัวข้อที่จำกัด
ผู้วิจัยระบุว่า:
‘TLM มีแรงบันดาลใจจากสองแนวคิดหลัก แรก มนุษย์สามารถทำความเข้าใจงานได้โดยใช้เพียงส่วนเล็กๆ ของความรู้ของโลก (เช่น นักเรียนต้องทบทวนเพียงบางบทจากหนังสือทั้งหมดในโลกเพื่อเตรียมตัวสอบ) เราคาดว่ามีความซ้ำซ้อนมากในคอร์ปัสขนาดใหญ่สำหรับงานเฉพาะ ที่สอง การฝึกอบรมบนข้อมูลที่มีลेबล์และดูแลเป็นอย่างดีมีประสิทธิภาพมากกว่าการปรับโมเดลภาษาโดยไม่มีลेबล์ ตามแรงบันดาลใจเหล่านี้ TLM ใช้ข้อมูลงานเป็นคำถามในการดึงชุดข้อมูลย่อยจากคอร์ปัสทั่วไป สิ่งนี้ตามด้วยการปรับโมเดลภาษาและงานโดยใช้ข้อมูลที่ดึงมาและข้อมูลงาน’
นอกจากการทำให้การฝึกอบรมโมเดล NLP มีประสิทธิภาพและคุ้มค่าแล้ว ผู้วิจัยยังเห็นประโยชน์หลายประการในการใช้โมเดล NLP ที่ขับเคลื่อนด้วยงาน เช่น นักวิจัยสามารถมีความยืดหยุ่นมากขึ้น โดยมีกลยุทธ์ที่กำหนดเองสำหรับความยาวลำดับ การแบ่งคำ การปรับไฮเปอร์พารามิเตอร์และการแสดงข้อมูล
ผู้วิจัยยังเห็นถึงการพัฒนาระบบไฮบริดในอนาคตที่ซึ่งสามารถแลกเปลี่ยนการฝึกอบรมล่วงหน้าแบบ PLM (ซึ่งไม่คาดว่าจะเกิดขึ้นในขณะนี้) กับความยืดหยุ่นและทั่วไปที่ดีขึ้นในการฝึกอบรม
การทดสอบและผลลัพธ์
TLM ถูกทดสอบบนงานจำแนกประเภทแปดงานใน四โดเมน – วิทยาศาสตร์ทางชีวการแพทย์ ข่าวสาร รีวิว และวิทยาการคอมพิวเตอร์ งานเหล่านี้ถูกแบ่งออกเป็นสองประเภท: งานที่มีทรัพยากรมากและงานที่มีทรัพยากรน้อย
ผู้วิจัยสร้างชุดข้อมูลฝึกอบรมสองชุด ชื่อ Corpus-BERT และ Corpus-RoBERTa โดยชุดหลังใหญ่กว่าชุดแรกถึง 10 เท่า การทดลองนี้เปรียบเทียบโมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้า เช่น BERT และ RoBERTA กับโครงสร้างใหม่นี้
รายงานระบุว่าแม้ว่า TLM จะเป็นวิธีทั่วไป แต่ก็สามารถทำงานได้ใกล้เคียงกับวิธีการปรับโมเดลภาษาให้เหมาะสมกับโดเมน
ผู้วิจัยสรุปว่า TLM สามารถให้ผลลัพธ์ที่เทียบเท่าหรือดีกว่า PLM โดยมีการลดการคำนวณ FLOPs ที่จำเป็นลงอย่างมาก และต้องการเฉพาะคอร์ปัสฝึกอบรมที่มีขนาดเล็กกว่า 1/16
‘ผลลัพธ์เหล่านี้ยืนยันว่า TLM มีความแม่นยำสูงและใช้ประสิทธิภาพมากกว่า PLM นอกจากนี้ TLM ยังมีข้อได้เปรียบมากขึ้นในด้านประสิทธิภาพเมื่อใช้ในขนาดที่ใหญ่ขึ้น ซึ่งบ่งชี้ว่า PLM ขนาดใหญ่อาจถูกฝึกอบรมเพื่อเก็บข้อมูลทั่วไปที่ไม่จำเป็นสำหรับงานเฉพาะ’













