โมเดลและแพลตฟอร์ม AI
นักวิจัยค้นพบ Subnetwork ที่มีประสิทธิภาพสูงภายในเครือข่ายประสาทเทียม Deep Learning
เครือข่ายประสาทเทียม Deep Learning มักจะมีขนาดใหญ่และต้องการพลังประมวลผลที่มาก แต่การค้นพบใหม่แสดงให้เห็นว่าสามารถลดขนาดลงเพื่อทำงานได้อย่างมีประสิทธิภาพมากขึ้น Джонาธาน แฟรงคล์ และทีมของเขาจาก MIT ได้พัฒนาความคิดเห็น “彩票ตั๋ว” ซึ่งแสดงให้เห็นว่ามี Subnetwork ที่เล็กกว่าภายในเครือข่ายประสาทเทียมขนาดใหญ่ Subnetwork เหล่านี้สามารถทำงานได้อย่างมีประสิทธิภาพมากขึ้นด้วยพลังประมวลผลที่น้อยลง โดยมีข้อท้าทายใหญ่ที่สุดคือการค้นหา Subnetwork เหล่านี้ หรือที่เรียกว่า “彩票ตั๋ว” ของทีม
ทีมงานค้นพบ Subnetwork เหล่านี้ภายใน BERT ซึ่งเป็นเทคนิคการประมวลผลภาษาที่ดีที่สุดสำหรับการประมวลผลภาษาธรรมชาติ (NLP) NLP เป็นสาขาย่อยของปัญญาประดิษฐ์ (AI) ที่รับผิดชอบในการถอดรหัสและวิเคราะห์ภาษาของมนุษย์ และใช้สำหรับการใช้งาน เช่น การสร้างข้อความที่คาดการณ์ได้และการสร้างแชทบอท
อย่างไรก็ตาม BERT มีขนาดใหญ่และต้องการพลังประมวลผลที่มาก ซึ่งเป็นเรื่องที่ยากสำหรับผู้ใช้หลายคน ด้วยการค้นพบ Subnetwork เหล่านี้ อาจเปิดโอกาสให้ผู้ใช้หลายคนสามารถใช้เทคโนโลยีนี้เพื่อพัฒนาตัวช่วย NLP
“เรากำลังถึงจุดที่เราจะต้องทำให้โมเดลเหล่านี้มีประสิทธิภาพและเล็กลง” แฟรงคล์กล่าว
ตามเขามา การพัฒนานี้อาจ “ลดข้อจำกัดในการเข้าถึง” สำหรับ NLP
BERT – “แพงเกินไป”
BERT เป็นพื้นฐานสำหรับสิ่งที่เช่น Google Search และได้รับความสนใจมากตั้งแต่ Google เปิดตัวในปี 2018 เป็นวิธีการสร้างเครือข่ายประสาทเทียมและได้รับการฝึกฝนโดยการพยายามเติมช่องว่างในข้อความหลายครั้ง หนึ่งในคุณสมบัติที่น่าประทับใจที่สุดของ BERT คือชุดข้อมูลการฝึกอบรมเริ่มต้นที่มีขนาดใหญ่
จากนั้นสามารถปรับให้เหมาะสมสำหรับงานเฉพาะ เช่น แชทบอทสำหรับลูกค้า แต่คราวนี้ต้องการพลังประมวลผลที่มาก โดยมีความเป็นไปได้ที่พารามิเตอร์จะถึง 1 พันล้าน
“BERT มาตรฐานในปัจจุบัน – สายพันธุ์ทั่วไป – มีพารามิเตอร์ 340 ล้าน” แฟรงคล์กล่าว “นี่คือสิ่งที่แพงเกินไป นี่คือสิ่งที่อยู่นอกเหนือความสามารถในการประมวลผลของเรา”
ตามที่ Tianlong Chen ผู้เขียนนำจาก University of Texas at Austin โมเดล เช่น BERT “มีขนาดเครือข่ายที่มาก” แต่ด้วยการวิจัยใหม่ “彩票ตั๋ว” ดูเหมือนจะเป็นวิธีแก้ปัญหา
Subnetwork ที่มีประสิทธิภาพ
Chen และทีมงานค้นหาโมเดลที่เล็กกว่าภายใน BERT และเปรียบเทียบประสิทธิภาพของ Subnetwork ที่ค้นพบกับโมเดล BERT เดิม ซึ่งได้รับการทดสอบในงาน NLP หลายอย่าง รวมถึงการตอบคำถามและเติมช่องว่างในประโยค
ทีมงานค้นพบ Subnetwork ที่ประสบความสำเร็จซึ่งมีขนาดเล็กลง 40 ถึง 90 เปอร์เซ็นต์เมื่อเทียบกับโมเดล BERT เดิม โดยมีเปอร์เซ็นต์ที่แท้จริงขึ้นอยู่กับงาน นอกจากนี้ยังสามารถระบุได้ก่อนการปรับให้เหมาะสมสำหรับงานเฉพาะ ซึ่งทำให้ลดค่าใช้จ่ายในการประมวลผลลงอีก ข้อได้เปรียบอีกอย่างคือ Subnetwork บางตัวที่เลือกสำหรับงานเฉพาะสามารถนำมาใช้ใหม่สำหรับงานอื่นได้
“ฉันรู้สึกประหลาดใจที่สิ่งนี้ได้ผล” แฟรงคล์กล่าว “ไม่ใช่สิ่งที่ฉันคาดหวัง ฉันคาดหวังผลลัพธ์ที่ยุ่งเหยิงมากกว่าที่เราได้รับ”
ตามที่ Ari Morcos นักวิทยาศาสตร์จาก Facebook (META ) AI Research การค้นพบครั้งนี้ “น่าเชื่อถือ” และ “โมเดลเหล่านี้กำลังแพร่หลายมากขึ้น ดังนั้นจึงสำคัญที่จะเข้าใจว่า彩票ตั๋วเป็นจริงหรือไม่”
Morcos ยังบอกอีกว่าหาก Subnetwork เหล่านี้สามารถทำงานได้ด้วยพลังประมวลผลที่น้อยลงมาก จะ “มีผลกระทบมาก” เนื่องจากโมเดลขนาดใหญ่เหล่านี้มีค่าใช้จ่ายในการทำงานสูงมากในปัจจุบัน
“ฉันไม่รู้ว่าเราจะไปได้ใหญ่แค่ไหนโดยใช้การคำนวณแบบซูเปอร์คอมพิวเตอร์” แฟรงคล์กล่าวเสริม “เราจะต้องลดข้อจำกัดในการเข้าถึง”
“ความหวังของเราคือสิ่งนี้จะลดค่าใช้จ่าย ทำให้สามารถเข้าถึงได้สำหรับทุกคน … สำหรับคนเล็กๆ ที่มีเพียงแล็ปท็อป” เขาสรุป
การวิจัยนี้มีกำหนดการนำเสนอที่การประชุม Conference on Neural Information Processing Systems












