มุมมองของ Anderson
โมเดลภาษาขนาดใหญ่จำข้อมูลที่ใช้ทดสอบพวกมัน

หากคุณพึ่ง AI เพื่อแนะนำสิ่งที่จะดู อ่าน หรือซื้อ งานวิจัยใหม่ชี้ว่าบางระบบอาจอาศัยความจำมากกว่าความสามารถ แทนที่จะเรียนรู้วิธีเสนอสิ่งที่มีประโยชน์ โมเดลอาจจำรายการจากชุดข้อมูลที่ใช้ประเมิน ทำให้คะแนนสูงเกินจริงและคำแนะนำล้าสมัยหรือไม่เหมาะกับผู้ใช้
ในแมชชีนเลิร์นนิง การแบ่งชุดทดสอบใช้ตรวจว่าโมเดลแก้ปัญหาใหม่ที่คล้ายแต่ไม่เหมือนข้อมูลฝึกได้หรือไม่ เช่น ชุดภาพสุนัข 100,000 ภาพอาจแบ่ง 80,000 ภาพสำหรับฝึกและเก็บ 20,000 ภาพไว้ทดสอบ หากข้อมูลฝึกเผลอรวมส่วนลับ 20% โมเดลจะทำข้อสอบได้ดีเพราะเห็นคำตอบแล้ว แต่ไม่ได้สะท้อนประสิทธิภาพกับข้อมูลใหม่ในการใช้งานจริง
สปอยเลอร์ภาพยนตร์
ปัญหา AI “โกงข้อสอบ” รุนแรงขึ้นตามขนาดโมเดล ระบบสมัยใหม่ฝึกจากข้อมูลเว็บมหาศาลและไม่คัดกรอง เช่น Common Crawl ชุดมาตรฐานที่ควรถูกกันไว้จึงหลุดเข้าไปในข้อมูลฝึกเป็นเรื่องปกติ เรียกว่า การปนเปื้อนข้อมูล และการตรวจด้วยมือในระดับนี้แทบเป็นไปไม่ได้
งานใหม่จาก Politecnico di Bari ประเทศอิตาลี ศึกษาชุดข้อมูลแนะนำภาพยนตร์ MovieLens-1M ซึ่งถูกใช้แพร่หลายและอาจถูกโมเดลชั้นนำหลายรุ่นจดจำระหว่างฝึก เมื่อข้อมูลนี้อยู่ในความจำ การทดสอบระบบแนะนำอาจไร้ความหมาย สิ่งที่ดูเหมือนสติปัญญาอาจเป็นเพียงการระลึก และทักษะการแนะนำที่ดูเป็นธรรมชาติอาจเป็นเสียงสะท้อนทางสถิติจากสิ่งที่เคยเห็น
ผู้เขียนรายงานว่า LLM มีความรู้กว้างขวางเกี่ยวกับรายการ คุณลักษณะผู้ใช้ และประวัติการโต้ตอบใน MovieLens-1M เพียงคำสั่งง่าย ๆ ก็ทำให้ GPT-4o กู้ชื่อภาพยนตร์เกือบ 80% ได้ และไม่มีโมเดลที่ทดสอบรุ่นใดปราศจากความรู้นี้
บทความชื่อ Do LLMs Memorize Recommendation Datasets? A Preliminary Study on MovieLens-1M จัดทำโดยนักวิจัยหกคน และเผยแพร่กระบวนการทำซ้ำงานไว้บน GitHub
วิธีการ
นักวิจัยกำหนดความหมายของการจดจำในบริบทนี้และทดสอบว่าโมเดลดึงข้อมูลเฉพาะจาก MovieLens-1M เมื่อได้รับคำสั่งที่เหมาะสมได้หรือไม่ หากให้รหัสภาพยนตร์แล้วตอบชื่อและประเภทได้ ถือว่าจำรายการ หากให้รหัสผู้ใช้แล้วสร้างอายุ อาชีพ หรือรหัสไปรษณีย์ได้ ถือว่าจำผู้ใช้ และหากสร้างคะแนนถัดไปจากลำดับคะแนนก่อนหน้าได้ ก็อาจจำข้อมูลการโต้ตอบเฉพาะแทนการเรียนรู้รูปแบบทั่วไป
คำสั่งถูกเขียนให้ชี้นำโดยไม่ให้ข้อมูลใหม่ ยิ่งคำตอบถูกต้องมาก ก็ยิ่งมีแนวโน้มว่าโมเดลเคยพบข้อมูลนั้นระหว่างฝึก

ข้อมูลและการทดสอบ
ทีมสำรวจบทความจากการประชุม ACM RecSys 2024 และ ACM SIGIR 2024 พบว่า MovieLens-1M ปรากฏบ่อยที่สุด โดยถูกอ้างในงานมากกว่าหนึ่งในห้า ยืนยันความโดดเด่นที่งานก่อนหน้าเคยรายงาน
MovieLens-1M มีสามไฟล์ ได้แก่ Movies.dat ซึ่งจับคู่รหัสกับชื่อและประเภทภาพยนตร์, Users.dat ซึ่งจับคู่รหัสผู้ใช้กับข้อมูลชีวประวัติพื้นฐาน และ Ratings.dat ซึ่งบันทึกว่าใครให้คะแนนเรื่องใดและเมื่อใด
นักวิจัยประยุกต์เทคนิคจากงาน Extracting Training Data from Large Language Models และ Bag of Tricks for Training Data Extraction from Language Models หลักการตรงไปตรงมา คือถามในรูปแบบเดียวกับชุดข้อมูลแล้วดูว่าโมเดลตอบถูกหรือไม่
พวกเขาทดสอบ zero-shot, chain-of-thought และ few-shot โดย few-shot ซึ่งให้ตัวอย่างเล็กน้อยมีประสิทธิภาพที่สุด แม้เทคนิคซับซ้อนกว่าอาจดึงข้อมูลได้มากขึ้น แต่วิธีนี้เพียงพอที่จะเผยสิ่งที่ถูกจดจำ

การเรียกคืนถูกแบ่งเป็นสามประเภท คือรายการ ผู้ใช้ และการโต้ตอบ แล้ววัดด้วยคะแนน coverage ซึ่งแสดงสัดส่วนของชุดข้อมูลที่สร้างกลับได้ผ่านคำสั่ง
โมเดลที่ทดสอบได้แก่ GPT-4o, GPT-4o mini, GPT-3.5 turbo, Llama-3.3 70B, Llama-3.2 ขนาด 3B และ 1B และ Llama-3.1 ขนาด 405B, 70B และ 8B ทุกโมเดลใช้ temperature เป็นศูนย์, top_p เป็นหนึ่ง ปิดโทษความถี่และการปรากฏ และใช้ seed คงที่เพื่อให้ผลทำซ้ำได้

โมเดลจดจำข้อมูลได้มากเพียงใด
เมื่อขอข้อมูลตรงจากทั้งสามไฟล์ ผลเผยความแตกต่างชัดระหว่างตระกูล GPT กับ Llama และระหว่างขนาดโมเดล GPT-4o และ GPT-3.5 turbo กู้ข้อมูลส่วนใหญ่ได้ง่าย ขณะที่โมเดลเปิดจำนวนมากเรียกคืนได้เพียงเศษส่วน แสดงว่าระดับการสัมผัสชุดมาตรฐานระหว่างฝึกไม่เท่ากัน
ความแตกต่างไม่ใช่เพียงเล็กน้อย โมเดลที่แข็งแกร่งจดจำ MovieLens-1M ได้เป็นส่วนใหญ่ สำหรับ GPT-4o ค่า coverage สูงพอบ่งชี้ว่าชุดข้อมูลจำนวนมากถูกจำโดยตรง เพียงคำสั่งง่ายก็เรียกคืนระเบียน MovieID::Title เกือบ 80% และพบแนวโน้มคล้ายกันในข้อมูลผู้ใช้กับประวัติการโต้ตอบ
ความจำส่งผลต่อคะแนนคำแนะนำ
จากนั้นผู้เขียนให้แต่ละโมเดลทำหน้าที่ระบบแนะนำ และเปรียบเทียบกับวิธีมาตรฐานเจ็ดแบบ ได้แก่ UserKNN, ItemKNN, BPRMF, EASE-R, LightGCN, MostPop และ Random ชุดข้อมูลถูกแบ่ง 80/20 ด้วยกลยุทธ์ leave-one-out เพื่อจำลองการใช้งานจริง และวัดด้วย Hit Rate กับ nDCG

LLM หลายรุ่นทำคะแนนเหนือวิธีดั้งเดิมในทุกตัวชี้วัด GPT-4o นำห่างทุกคอลัมน์ ขณะที่ GPT-3.5 turbo และ Llama-3.1 405B ก็เหนือ BPRMF และ LightGCN อย่างสม่ำเสมอ ในกลุ่ม Llama ขนาดเล็กผลต่างกันมาก แต่ Llama-3.2 3B ได้ HR@1 สูงสุดในกลุ่ม
เมื่อเปรียบเทียบความจำกับประสิทธิภาพ โมเดลที่จำมากกว่าภายในแต่ละกลุ่มให้คำแนะนำดีกว่า GPT-4o เหนือ GPT-4o mini และ Llama-3.1 405B เหนือรุ่น 70B และ 8B จึงมีความเสี่ยงว่าการทดสอบบนข้อมูลที่รั่วเข้าไปในชุดฝึกจะให้ผลดีเกินจริงจากความจำแทนการประยุกต์ทั่วไป
ขนาดโมเดลสัมพันธ์ทั้งกับความจำและคะแนน Llama-3.1 405B มีอัตราจดจำเฉลี่ย 12.9% ขณะที่รุ่น 8B เก็บไว้เพียง 5.82% การเรียกคืนลดลงเกือบ 55% สอดคล้องกับ nDCG ที่ลด 54.23% และ Hit Rate ที่ลด 47.36% เมื่อความจำลด ประสิทธิภาพที่ปรากฏก็ลดตาม
อคติจากความนิยม
การทดสอบสุดท้ายตรวจว่าความจำสะท้อนอคติความนิยมใน MovieLens-1M หรือไม่ โดยแบ่งรายการตามความถี่การโต้ตอบเป็นกลุ่มยอดนิยม 20% กลาง 20% และได้รับปฏิสัมพันธ์น้อยที่สุด 20% โมเดลใหญ่ให้ความสำคัญกับรายการยอดนิยมอย่างต่อเนื่อง

GPT-4o เรียกคืนรายการยอดนิยมได้ 89.06% แต่รายการที่นิยมน้อยที่สุดเพียง 63.97% ส่วน GPT-4o mini และ Llama ขนาดเล็กมี coverage ต่ำกว่าทุกช่วง ความจำจึงไม่เพียงเพิ่มตามขนาด แต่ยังขยายความไม่สมดุลเดิมในข้อมูลฝึก ภาพยนตร์ยอดนิยมถูกนำเสนอมากกว่าและถูกจดจำมากเกินสัดส่วน
แหล่งข้อมูลและลิงก์อ้างอิง
- test-split
- Common Crawl
- data contamination
- MovieLens-1M
- memorized
- new paper
- made available at GitHub
- ACM RecSys 2024
- ACM SIGIR 2024
- earlier studies
- paper
- subsequent work
- Zero-shot
- Chain-of-Thought
- few-shot prompting
- GPT-4o
- GPT-4o mini
- GPT-3.5 turbo
- Llama-3.3 70B
- Llama-3.2 3B
- Llama-3.2 1B
- Llama-3.1 405B
- Llama-3.1 70B
- Llama-3.1 8B
- temperature
- top_p
- frequency and presence
- random seed
- UserKNN
- ItemKNN
- BPRMF
- EASER
- LightGCN
- MostPop
- leave-one-out
- Hit Rate
- nDCG
- popularity bias
บทสรุป
ปัญหานี้ไม่ใหม่ ยิ่งชุดฝึกใหญ่ ความเป็นไปได้ในการดูแลก็ยิ่งลดลง MovieLens-1M อาจเป็นเพียงหนึ่งในหลายชุดที่เข้าสู่คลังข้อมูลมหาศาลโดยไม่มีการตรวจสอบและหายไปท่ามกลางปริมาณข้อมูล
ปัญหาเกิดซ้ำในทุกขนาดและต่อต้านระบบอัตโนมัติ ทางแก้ต้องใช้ทั้งแรงงานและการตัดสินของมนุษย์ ซึ่งช้าและผิดพลาดได้ แต่เครื่องจักรไม่สามารถทดแทน ในประเด็นนี้งานใหม่ยังไม่มีคำตอบสำเร็จรูป
คะแนน coverage คือร้อยละของข้อมูลต้นฉบับที่โมเดลสร้างกลับได้เมื่อถูกถามอย่างเหมาะสม หากตอบถูก 800 รายการจาก 1,000 รายการ คะแนนคือ 80%.
เผยแพร่ครั้งแรกวันศุกร์ที่ 16 พฤษภาคม 2025












