โมเดลและแพลตฟอร์ม AI
โมเดล AI ให้ข้อมูลเชิงลึกเกี่ยวกับวิธีการที่สมองประมวลผลภาษา
การวิจัยใหม่จากสถาบันเทคโนโลยีแมสซาชูเซตส์ (MIT) เสนอว่าฟังก์ชันพื้นฐานของ ‘การคาดการณ์คำถัดไป’ ของโมเดลการประมวลผลภาษาเหมือนกับฟังก์ชันของศูนย์ประมวลผลภาษาในสมองของมนุษย์
ความหมายของภาษา
โมเดลภาษาที่คาดการณ์ได้ใหม่ๆ อาจเรียนรู้บางสิ่งเกี่ยวกับความหมายพื้นฐานของภาษา ซึ่งจะเป็นก้าวสำคัญในด้านนี้ โมเดลเหล่านี้คาดการณ์คำที่จะตามมา แต่ยังทำภารกิจที่ต้องมีความเข้าใจที่แท้จริง เช่น การตอบคำถาม การสรุปเอกสาร และการเติมเรื่องราว
โมเดลเหล่านี้ถูกออกแบบมาเพื่อเพิ่มประสิทธิภาพในการคาดการณ์ข้อความโดยไม่พยายามเลียนแบบวิธีการที่สมองของมนุษย์เข้าใจภาษา อย่างไรก็ตาม ทีมนักวิจัยจาก MIT เสนอว่ามีบางสิ่งที่เกิดขึ้นในด้านนี้
ข้อค้นพบที่น่าสนใจอย่างหนึ่งของการวิจัยนี้คือ โมเดลคอมพิวเตอร์ที่ทำงานได้ดีในภารกิจภาษาอื่นๆ ไม่แสดงความคล้ายคลึงกับสมองของมนุษย์ ซึ่งถือเป็นหลักฐานที่บ่งชี้ว่าสมองของมนุษย์อาจใช้การคาดการณ์คำถัดไปเพื่อประมวลผลภาษา
นэнซี คานวิเชอร์ เป็นศาสตราจารย์แห่งว Walter A. Rosenblith ในด้านวิทยาศาสตร์认知 เธอยังเป็นสมาชิกของสถาบันวิจัยสมอง MIT และศูนย์สำหรับสมอง จิตใจ และเครื่องจักร (CBMM) และเป็นหนึ่งในผู้เขียนการศึกษา
“โมเดลที่ดีกว่าในการคาดการณ์คำถัดไปจะเข้ากับสมองของมนุษย์ได้ดีขึ้น” คานวิเชอร์กล่าว “นี่เป็นเรื่องที่น่าประหลาดใจที่โมเดลเหล่านี้เข้ากันได้ดี และบ่งชี้อย่างไม่โดยตรงว่าระบบภาษาของมนุษย์อาจกำลังคาดการณ์สิ่งที่จะเกิดขึ้นต่อไป”
การศึกษานี้ตีพิมพ์ใน Proceedings of the National Academy of Sciences
การศึกษานี้ยังรวมถึงผู้เขียนอาวุโส Joshue Tenenbaum ศาสตราจารย์ด้านวิทยาศาสตร์认知ที่ MIT และสมาชิกของ CBMM และ CSAIL ของ MIT; และ Eveline Fedorenko ศาสตราจารย์ด้านประสาทวิทยาศาสตร์แห่ง Frederick A. และ Carole J. Middleton Career Development และสมาชิกของสถาบันวิจัยสมอง MIT ผู้เขียนหลักของเอกสารคือ Martin Schrimpf นักศึกษาระดับบัณฑิตศึกษาของ MIT
การศึกษา
ทีมนักวิจัยจาก MIT เปรียบเทียบศูนย์ประมวลผลภาษาในสมองของมนุษย์กับโมเดลการประมวลผลภาษา พวกเขาวิเคราะห์โมเดลภาษา 43 แบบ รวมถึงโมเดลที่ได้รับการปรับให้เหมาะสมสำหรับการคาดการณ์คำถัดไป เช่น GPT-3 โมเดลอื่นๆ ได้รับการออกแบบมาเพื่อทำภารกิจภาษาที่แตกต่างกัน เช่น การเติมช่องว่าง
แต่ละโมเดลถูกนำเสนอด้วยชุดคำ และนักวิจัยวัดกิจกรรมของโหนดที่ประกอบเป็นเครือข่าย รูปแบบเหล่านี้ถูกเปรียบเทียบกับกิจกรรมในสมอง ซึ่งวัดจากผู้เข้าร่วมที่ทำภารกิจภาษาสามแบบ: ฟังเรื่องราว อ่านประโยคทีละประโยค และอ่านประโยคทีละคำ
ชุดข้อมูลของมนุษย์รวมถึงข้อมูล fMRI และการวัด electrocorticographic ที่ได้รับจากผู้ที่เข้ารับการผ่าตัดสมองเนื่องจากโรคปลอกประสาทอักเสบ
นักวิจัยพบว่าโมเดลการคาดการณ์คำถัดไปที่มีประสิทธิภาพสูงสุดมีรูปแบบกิจกรรมที่คล้ายคลึงกับสมองของมนุษย์ โมเดลเหล่านี้ยังแสดงกิจกรรมที่สัมพันธ์กับมาตรการทางพฤติกรรมของมนุษย์ เช่น ความเร็วในการอ่านข้อความ
“เราพบว่าโมเดลที่คาดการณ์การตอบสนองของสมองได้ดี cũngสามารถคาดการณ์การตอบสนองทางพฤติกรรมของมนุษย์ได้ดีในรูปแบบของเวลาอ่าน” Schrimpf กล่าว “และทั้งสองอย่างนี้ถูกอธิบายโดยประสิทธิภาพของโมเดลในการคาดการณ์คำถัดไป สามเหลี่ยมนี้เชื่อมทุกอย่างเข้าด้วยกัน”
นักวิจัยจะพยายามสร้างรูปแบบต่างๆ ของโมเดลการประมวลผลภาษา ซึ่งจะช่วยให้พวกเขาเห็นว่าการเปลี่ยนแปลงเล็กๆ น้อยๆ ในสถาปัตยกรรมของโมเดลส่งผลต่อประสิทธิภาพและความสามารถในการเข้ากับข้อมูลประสาทของมนุษย์












