มุมมองของ Anderson

การสร้างโมเดลภาษา GPT-Style สำหรับคำถามเดียว

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากจีนได้พัฒนาแนวทางที่คุ้มค่าในการสร้างระบบประมวลผลภาษาธรรมชาติ GPT-3-Style โดยหลีกเลี่ยงค่าใช้จ่ายที่เพิ่มขึ้นเรื่อยๆ ของเวลาและเงินในการฝึกอบรมชุดข้อมูลขนาดใหญ่ – แนวโน้มที่กำลังเติบโตซึ่งอาจทำให้ภาคส่วนนี้ของ AI ถูกจำกัดเฉพาะผู้เล่น FAANG และนักลงทุนที่มีระดับสูง

เฟรมเวิร์กที่เสนอเรียกว่า Task-Driven Language Modeling (TLM) แทนที่จะฝึกโมเดลขนาดใหญ่และซับซ้อนบน корпусภาษาขนาดใหญ่หลายพันล้านคำและหลายพันลेबล์และคลาส TLM ฝึกโมเดลขนาดเล็กที่รวมคำถามเข้าไปในโมเดลโดยตรง

ด้านซ้าย เป็นแนวทางแบบไฮเปอร์สเกลในการสร้างโมเดลภาษาขนาดใหญ่ ด้านขวา เป็นแนวทางแบบ TLM ในการสำรวจคอร์ปัสภาษาขนาดใหญ่ตามหัวข้อหรือคำถามแต่ละรายการ Source: https://arxiv.org/pdf/2111.04130.pdf

ด้านซ้าย เป็นแนวทางแบบไฮเปอร์สเกลในการสร้างโมเดลภาษาขนาดใหญ่ ด้านขวา เป็นแนวทางแบบ TLM ในการสำรวจคอร์ปัสภาษาขนาดใหญ่ตามหัวข้อหรือคำถามแต่ละรายการ Source: https://arxiv.org/pdf/2111.04130.pdf

โดยทั่วไป โมเดลหรืออัลกอริทึม NLP ที่ไม่ซ้ำกันจะถูกสร้างขึ้นเพื่อตอบคำถามเดียว แทนที่จะสร้างโมเดลภาษาทั่วไปที่สามารถตอบคำถามได้หลากหลาย

ในการทดสอบ TLM นักวิจัยพบว่าแนวทางใหม่นี้สามารถให้ผลลัพธ์ที่คล้ายหรือดีกว่าโมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้า เช่น RoBERTa-Large และระบบ NLP ระดับไฮเปอร์สเกล เช่น OpenAI’s GPT-3, Google’s TRILLION Parameter Switch Transformer Model, Korea’s HyperClover, AI21 Labs’ Jurassic 1 และ Microsoft’s Megatron-Turing NLG 530B

ในการทดสอบ TLM บนชุดข้อมูลการจำแนกประเภทแปดชุดในสี่โดเมน ผู้วิจัยพบว่าระบบนี้สามารถลดการคำนวณ FLOPs (การดำเนินการ浮้าจุดต่อวินาที) ที่จำเป็นในการฝึกอบรมลงสองอันดับ ผู้วิจัยหวังว่า TLM จะ “ทำให้ประชาธิปไตย” ในภาคส่วนที่กำลังจะกลายเป็นชนชั้นสูง โดยมีโมเดล NLP ที่ใหญ่เกินไปที่ไม่สามารถติดตั้งได้จริงบนเครื่องและต้องอยู่เบื้องหลัง API ของ OpenAI และ Microsoft Azure ที่มีค่าใช้จ่ายสูงและจำกัด

ผู้วิจัยระบุว่าการลดเวลาในการฝึกอบรมลงสองอันดับสามารถลดค่าใช้จ่ายในการฝึกอบรมลงได้มากกว่า 1,000 เท่า โดยใช้ GPU 8 ตัวเป็นเวลา 48 ชั่วโมง

รายงานใหม่ รายงาน มีชื่อเรื่องว่า NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework และมาจากนักวิจัยสามคนจาก Tsinghua University ใน北京 และนักวิจัยจากบริษัทพัฒนา AI ของจีน Recurrent AI, Inc.

คำตอบที่ไม่สามารถจ่ายได้

ค่าใช้จ่ายในการฝึกอบรมโมเดลภาษาที่มีประสิทธิภาพและทั่วไปกำลังจะกลายเป็น “ขีดจำกัดความร้อน” ที่สามารถแพร่กระจาย NLP ที่แม่นยำและมีประสิทธิภาพได้จริง

สถิติเกี่ยวกับการเติบโตของแง่มุมในโครงสร้างโมเดล NLP จากรายงานปี 2020 โดย A121 Labs Source: https://arxiv.org/pdf/2004.08900.pdf

สถิติเกี่ยวกับการเติบโตของแง่มุมในโครงสร้างโมเดล NLP จากรายงานปี 2020 โดย A121 Labs Source: https://arxiv.org/pdf/2004.08900.pdf

ในปี 2019 นักวิจัย คำนวณ ว่าค่าใช้จ่ายในการฝึกอบรมโมเดล XLNet (ที่รายงานว่าสามารถเอาชนะ BERT ในงาน NLP) คือ 61,440 ดอลลาร์สหรัฐฯ ในช่วง 2.5 วัน โดยใช้ 512 คอร์บนอุปกรณ์ 64 เครื่อง ในขณะที่ GPT-3 มีค่าใช้จ่าย ประมาณ 12 ล้านดอลลาร์ในการฝึกอบรม – ค่าใช้จ่ายที่สูงกว่า GPT-2 ถึง 200 เท่า (แม้ว่าประมาณการใหม่จะระบุว่าสามารถฝึกอบรมได้ใน ราคาเพียง 4,600,000 ดอลลาร์ บน GPU ค่าใช้จ่ายต่ำสุด)

ชุดข้อมูลย่อยตามความต้องการของคำถาม

แทนการฝึกอบรมโมเดลขนาดใหญ่และซับซ้อนบนคอร์ปัสภาษาขนาดใหญ่ แนวทางใหม่นี้มุ่งหวังที่จะให้การจำแนกประเภทที่แม่นยำและทั่วไปโดยใช้คำถามเป็นฟิลเตอร์เพื่อกำหนดชุดข้อมูลย่อยจากคอร์ปัสภาษาขนาดใหญ่ที่จะถูกฝึกอบรมพร้อมกับคำถามเพื่อให้คำตอบในหัวข้อที่จำกัด

ผู้วิจัยระบุว่า:

‘TLM มีแรงบันดาลใจจากสองแนวคิดหลัก  แรก  มนุษย์สามารถทำความเข้าใจงานได้โดยใช้เพียงส่วนเล็กๆ ของความรู้ของโลก (เช่น นักเรียนต้องทบทวนเพียงบางบทจากหนังสือทั้งหมดในโลกเพื่อเตรียมตัวสอบ)  เราคาดว่ามีความซ้ำซ้อนมากในคอร์ปัสขนาดใหญ่สำหรับงานเฉพาะ  ที่สอง  การฝึกอบรมบนข้อมูลที่มีลेबล์และดูแลเป็นอย่างดีมีประสิทธิภาพมากกว่าการปรับโมเดลภาษาโดยไม่มีลेबล์  ตามแรงบันดาลใจเหล่านี้  TLM ใช้ข้อมูลงานเป็นคำถามในการดึงชุดข้อมูลย่อยจากคอร์ปัสทั่วไป  สิ่งนี้ตามด้วยการปรับโมเดลภาษาและงานโดยใช้ข้อมูลที่ดึงมาและข้อมูลงาน’

นอกจากการทำให้การฝึกอบรมโมเดล NLP มีประสิทธิภาพและคุ้มค่าแล้ว ผู้วิจัยยังเห็นประโยชน์หลายประการในการใช้โมเดล NLP ที่ขับเคลื่อนด้วยงาน เช่น นักวิจัยสามารถมีความยืดหยุ่นมากขึ้น โดยมีกลยุทธ์ที่กำหนดเองสำหรับความยาวลำดับ การแบ่งคำ การปรับไฮเปอร์พารามิเตอร์และการแสดงข้อมูล

ผู้วิจัยยังเห็นถึงการพัฒนาระบบไฮบริดในอนาคตที่ซึ่งสามารถแลกเปลี่ยนการฝึกอบรมล่วงหน้าแบบ PLM (ซึ่งไม่คาดว่าจะเกิดขึ้นในขณะนี้) กับความยืดหยุ่นและทั่วไปที่ดีขึ้นในการฝึกอบรม

การทดสอบและผลลัพธ์

TLM ถูกทดสอบบนงานจำแนกประเภทแปดงานใน四โดเมน – วิทยาศาสตร์ทางชีวการแพทย์ ข่าวสาร รีวิว และวิทยาการคอมพิวเตอร์ งานเหล่านี้ถูกแบ่งออกเป็นสองประเภท: งานที่มีทรัพยากรมากและงานที่มีทรัพยากรน้อย

ผู้วิจัยสร้างชุดข้อมูลฝึกอบรมสองชุด ชื่อ Corpus-BERT และ Corpus-RoBERTa โดยชุดหลังใหญ่กว่าชุดแรกถึง 10 เท่า การทดลองนี้เปรียบเทียบโมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้า เช่น BERT และ RoBERTA กับโครงสร้างใหม่นี้

รายงานระบุว่าแม้ว่า TLM จะเป็นวิธีทั่วไป แต่ก็สามารถทำงานได้ใกล้เคียงกับวิธีการปรับโมเดลภาษาให้เหมาะสมกับโดเมน

ผลลัพธ์จากการเปรียบเทียบการทำงานของ TLM กับชุดข้อมูล BERT และ RoBERTa

ผลลัพธ์จากการเปรียบเทียบการทำงานของ TLM กับชุดข้อมูล BERT และ RoBERTa

ผู้วิจัยสรุปว่า TLM สามารถให้ผลลัพธ์ที่เทียบเท่าหรือดีกว่า PLM โดยมีการลดการคำนวณ FLOPs ที่จำเป็นลงอย่างมาก และต้องการเฉพาะคอร์ปัสฝึกอบรมที่มีขนาดเล็กกว่า 1/16

‘ผลลัพธ์เหล่านี้ยืนยันว่า TLM มีความแม่นยำสูงและใช้ประสิทธิภาพมากกว่า PLM นอกจากนี้ TLM ยังมีข้อได้เปรียบมากขึ้นในด้านประสิทธิภาพเมื่อใช้ในขนาดที่ใหญ่ขึ้น ซึ่งบ่งชี้ว่า PLM ขนาดใหญ่อาจถูกฝึกอบรมเพื่อเก็บข้อมูลทั่วไปที่ไม่จำเป็นสำหรับงานเฉพาะ’

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai