มุมมองของ Anderson
โมเดลภาษาขนาดใหญ่จำข้อมูลที่ใช้ทดสอบพวกมัน

หากคุณพึ่งพา AI ในการแนะนำสิ่งที่จะดู อ่าน หรือซื้อ การวิจัยใหม่บ่งชี้ว่าระบบบางระบบอาจพึ่งพาผลลัพธ์จาก ความจำ มากกว่าทักษะ: แทนที่จะเรียนรู้เพื่อแนะนำข้อเสนอแนะที่มีประโยชน์ โมเดลเหล่านี้มักจะระลึกถึงรายการจากชุดข้อมูลที่ใช้ในการประเมินพวกมัน ซึ่งนำไปสู่การประเมินประสิทธิภาพที่สูงเกินไป และคำแนะนำที่อาจล้าสมัยหรือไม่เหมาะสมกับผู้ใช้
ในเครื่องมือการเรียนรู้ของเครื่อง การ การแบ่งชุดข้อมูล ใช้เพื่อดูว่าโมเดลที่ได้รับการฝึกอบรมมีความสามารถในการแก้ปัญหาได้ดีหรือไม่
ดังนั้น หากโมเดลการรู้จำพันธุ์สุนัข AI ใหม่ถูกฝึกอบรมด้วยชุดข้อมูล 100,000 รูปภาพของสุนัข มันจะประกอบด้วยการแบ่ง 80/20 – 80,000 รูปภาพที่ใช้ในการฝึกอบรมโมเดล และ 20,000 รูปภาพที่ถูกเก็บไว้และใช้เป็นวัสดุสำหรับการทดสอบโมเดลที่เสร็จสมบูรณ์
เป็นที่ชัดเจนว่า หากข้อมูลการฝึกอบรมของ AI มีข้อมูล “ลับ” 20% ของการแบ่งชุดข้อมูลที่ถูกส่งเข้าไปในโมเดล มันจะผ่านการทดสอบเหล่านี้ได้อย่างง่ายดาย เพราะมันรู้คำตอบแล้ว (มันเห็นข้อมูล 100% ของโดเมนแล้ว)
สปอยเลอร์ภาพยนตร์
ปัญหาของ AI ที่โกงในการสอบของมันเพิ่มขึ้นพร้อมกับการเพิ่มขึ้นของขนาดโมเดล เนื่องจากระบบในปัจจุบันถูกฝึกอบรมด้วยข้อมูลที่กว้างใหญ่และไม่เลือก lọc เช่น Common Crawl ความเป็นไปได้ที่ชุดข้อมูลมาตรฐาน (เช่น 20% ที่ถูกเก็บไว้) จะเข้าสู่การผสมผสานการฝึกอบรมไม่ใช่กรณีแยกต่างหากอีกต่อไป แต่เป็นเรื่องปกติ – อาการที่เรียกว่า การปนเปื้อนของข้อมูล และในขนาดนี้ การดูแลอย่างมีจิตสำนึกที่สามารถจับข้อผิดพลาดเหล่านี้ได้เป็นเรื่องที่ไม่สามารถทำได้
กรณีนี้ถูกสำรวจในเอกสารใหม่จาก Politecnico di Bari ในอิตาลี โดยนักวิจัยเน้นไปที่บทบาทที่มีขนาดใหญ่ของชุดข้อมูลการแนะนำภาพยนตร์ MovieLens-1M ซึ่งพวกเขาอ้างว่าถูก จดจำ โดยโมเดล AI หลายรุ่นระหว่างการฝึกอบรม
เนื่องจากชุดข้อมูลนี้ถูกใช้กันอย่างแพร่หลายในการทดสอบระบบการแนะนำ การมีอยู่ของมันในความจำของโมเดลอาจทำให้การทดสอบเหล่านี้ไม่มีความหมาย: สิ่งที่ดูเหมือนจะเป็นความฉลาดอาจเป็นเพียงการระลึกถึงเท่านั้น และสิ่งที่ดูเหมือนจะเป็นทักษะการแนะนำที่มี直觉อาจเป็นเพียงการสะท้อนกลับทางสถิติที่สะท้อนถึงการเปิดเผยในอดีต
วิธีการ
เพื่อทำความเข้าใจว่าโมเดลเหล่านี้ได้เรียนรู้หรือเพียงแค่ระลึกถึง นักวิจัยเริ่มต้นด้วยการกำหนดสิ่งที่การระลึกถึงหมายถึงในบริบทนี้ และเริ่มต้นด้วยการทดสอบว่าโมเดลสามารถเรียกข้อมูลเฉพาะจากชุดข้อมูล MovieLens-1M ได้หรือไม่เมื่อถูกกระตุ้นในลักษณะที่เหมาะสม
หากโมเดลสามารถแสดงชื่อและประเภทของภาพยนตร์จาก ID ของภาพยนตร์ นั่นถือเป็นการระลึกถึงรายการ; หากสามารถสร้างรายละเอียดเกี่ยวกับผู้ใช้ (เช่น อายุ อาชีพ หรือรหัสไปรษณีย์) จาก ID ของผู้ใช้ นั่นก็ถือเป็นการระลึกถึงผู้ใช้; และหากสามารถสร้างคะแนนการให้คะแนนภาพยนตร์ของผู้ใช้จากลำดับการให้คะแนนก่อนหน้านี้ นั่นถือเป็นการระลึกถึงข้อมูลการโต้ตอบ
ข้อมูลและการทดสอบ
เพื่อสร้างชุดข้อมูลที่เหมาะสม นักวิจัยสำรวจเอกสารล่าสุดจากสองการประชุมสำคัญของสาขานี้ ACM RecSys 2024 และ ACM SIGIR 2024 ชุดข้อมูล MovieLens-1M ปรากฏบ่อยที่สุด โดยถูกอ้างอิงในมากกว่าหนึ่งในห้าของการยื่นคำขอ
ชุดข้อมูล MovieLens-1M ประกอบด้วยสามไฟล์: Movies.dat ซึ่งแสดงรายการภาพยนตร์ตาม ID ชื่อ และประเภท; Users.dat ซึ่งแมปกับผู้ใช้ ID ถึงฟิลด์ทางชีวภาพพื้นฐาน; และ Ratings.dat ซึ่งบันทึกผู้ใช้ให้คะแนนภาพยนตร์ใดและเมื่อใด
เพื่อดูว่าข้อมูลนี้ถูกจดจำโดยโมเดลภาษาขนาดใหญ่หรือไม่ นักวิจัยใช้เทคนิคการกระตุ้นที่ถูกนำมาใช้ครั้งแรกใน เอกสาร การดึงข้อมูลการฝึกอบรมจากโมเดลภาษาขนาดใหญ่ และถูกปรับเปลี่ยนใน งานต่อเนื่อง กล่องทริคสำหรับการดึงข้อมูลการฝึกอบรมจากโมเดลภาษา
สรุป
ปัญหาไม่ใช่เรื่องใหม่: เมื่อชุดข้อมูลฝึกอบรมมีขนาดใหญ่ขึ้น ความเป็นไปได้ที่จะดูแลพวกมันจะลดลงในอัตราส่วนผกผัน MovieLens-1M อาจเป็นหนึ่งในหลาย ๆ ชุดข้อมูลที่เข้าสู่ชุดข้อมูลฝึกอบรมที่กว้างใหญ่โดยไม่มีการดูแล
ปัญหาเกิดขึ้นที่ทุกขนาดและต้านการทำงานอัตโนมัติ วิธีแก้ปัญหาใดๆ ต้องการไม่เพียงแต่ความพยายามเท่านั้น แต่ยังต้องการการตัดสินใจของมนุษย์ – การตัดสินใจที่ช้าและอาจผิดพลาด ซึ่งเครื่องจักรไม่สามารถให้ได้ ในแง่นี้ เอกสารใหม่นี้ไม่ได้ให้วิธีแก้ปัญหา
* การวัดคะแนนการครอบคลุมในบริบทนี้คือเปอร์เซ็นต์ที่แสดงว่าโมเดลภาษาสามารถสร้างข้อมูลชุดข้อมูลเดิมได้มากเพียงใดเมื่อถูกถามในลักษณะที่เหมาะสม หากโมเดลถูกกระตุ้นด้วย ID ของภาพยนตร์และตอบด้วยชื่อและประเภทที่ถูกต้อง นั่นถือเป็นการระลึกถึงที่สำเร็จ การนับจำนวนการระลึกถึงที่สำเร็จแล้วหารด้วยจำนวนรายการในชุดข้อมูลเพื่อสร้างคะแนนการครอบคลุม ตัวอย่างเช่น หากโมเดลตอบข้อมูลที่ถูกต้องสำหรับ 800 รายการจาก 1,000 รายการ คะแนนการครอบคลุมจะเป็น 80 เปอร์เซ็นต์
เผยแพร่ครั้งแรกวันศุกร์ที่ 16 พฤษภาคม 2025












