มุมมองของ Anderson
AI อ้างอิงเอกสารเดียวกันซ้ำแล้วซ้ำเล่า – เหมือนมนุษย์

ChatGPT และเครื่องมือเขียนด้วย AI อื่น ๆ อาจกำลังแปลงวิทยาศาสตร์ให้เป็นการแข่งขันความนิยมอย่างเงียบ ๆ โดยพาให้นักวิจัยมุ่งไปยังเอกสารเดียวกันซ้ำแล้วซ้ำเล่า ในขณะที่มองข้ามผลงานใหม่และนวัตกรรมที่อาจทำให้สาขานี้ก้าวหน้าได้จริง
โมโนคัลเจอร์ ในแง่ของความถี่และสถิติ คือการที่ชุดแหล่งข้อมูลหรือทรัพยากรที่จำกัดเดียวกันปรากฏซ้ำ ๆ จนทำให้เสียงใหม่และมุมมองสดใหม่ถูกกดทับ: ชุด เพลงที่จำกัดเดียวกัน ในการจัดรายการวิทยุ; กลุ่มผู้เขียนและหนังสือเดียวกัน ในชั้นวางสนามบิน; และ การคัดสรรผลไม้และผักที่จำกัด ในซุปเปอร์มาร์เก็ต:

ใช่ เรามีกล้วยเหล่านี้ – และมีเพียงกล้วยเหล่านี้เท่านั้น ความเป็นเอกภาพของผลไม้และผักในห่วงโซ่อาหารตะวันตกมองข้ามศักยภาพของพันธุ์อื่น ๆ ร้อย ๆ ชนิดในแต่ละกรณี เนื่องจากกระบวนการผลิตและการขนส่งที่หลากหลายมีค่าใช้จ่ายสูงเกินกว่าจะทำอุตสาหกรรมได้สำหรับผลไม้หรือผักหลายประเภท แหล่งที่มา
สิ่งนี้ยังเกิดขึ้นใน การอ้างอิง ที่ปรากฏในงานวิจัยวิทยาศาสตร์ใหม่ ๆ โดยที่นักวิจัยอาจเลือกอ้างอิงชุดแหล่งข้อมูล “เชื่อถือได้” ที่ได้รับความนิยมจนกลายเป็นมาตรฐานและครอบงำสาขาการวิจัยต่าง ๆ
นี่คือสิ่งที่เรียกว่า ผลกระทบแมทธิว (Matthew Effect) – ทฤษฎีสังคมวิทยาที่บ่งชี้ว่า ผู้ที่อยู่ในตำแหน่งที่ดีจะได้รับประโยชน์ต่อเนื่อง; ปรากฏการณ์นี้ถูกเปรียบเทียบกับคำสัญญาในมัทธิว 13:12 ซึ่ง กล่าวว่า “ผู้ที่มีจะได้รับเพิ่มขึ้นและจะมีความอุดมสมบูรณ์ ผู้ที่ไม่มี แม้แต่สิ่งที่มีอยู่ก็จะถูกพรากไป”
กลุ่มงานที่ได้รับความนิยม
หนึ่งใน ความคาดหวังใหญ่ ของการวิจัยที่เสริมด้วย AI คือวิธีการเรียนรู้ของเครื่องใหม่ ๆ จะสามารถทำลายผลกระทบแมทธิว – หรือที่รู้จักกันในชื่อ อคติความนิยม (popularity bias) และเริ่มอ้างอิงผลงานที่ไม่ค่อยเป็นที่รู้จักซึ่งอาจให้ข้อมูลที่ลึกซึ้งหรือเหมาะสมกับประเด็นของบทความมากกว่า
อย่างไรก็ตาม จากวิธีที่กระบวนการฝึกโมเดล AI แปลความหมายชุดข้อมูล การคาดหวังนี้ไม่เคยมีเหตุผลที่ดี และพบว่าเมื่อ AI ไม่ได้ สร้างอ้างอิงขึ้นมาโดยตรง – ปัญหาเรื้อรังที่ยังคงอยู่ – มันกลับทำให้ ผลกระทบแมทธิว ยังคงดำเนินต่อไปเช่นเดียวกับมนุษย์ แม้อาจมีสาเหตุที่ต่างกันบ้าง
ระหว่างการฝึก โมเดลจะเรียนรู้ให้ให้คะแนนสูงกับเอกสารที่อ้างอิงบ่อยที่สุด (หรือ “ที่ถูกอ้างอิงซ้ำบ่อย”) ในชุดฝึก เนื่องจากกระบวนการฝึกถูกออกแบบให้สกัดรูปแบบที่มีความหมายและ ลดน้ำหนักข้อมูลที่เป็นค่าเบี่ยงเบน (outliers) ว่าเป็น “เสียงรบกวน” หรือความผิดปกติทางสถิติ
ภายใต้กรอบนี้ ทฤษฎีสัมพัทธภาพของไอน์สไตน์ก็อาจไม่เคยได้รับความสนใจจากเครื่องจักร เพราะเมื่อโมเดลได้รับการฝึกแล้ว จะรู้สึกว่ามันได้พบหลักการและแหล่งอ้างอิงที่ต้องการแล้ว และสามารถปรับเปลี่ยนเล็กน้อยโดยการเข้าถึงการตีพิมพ์ใหม่ ๆ ผ่าน RAG หรือวิธีอื่น ๆ ที่ขยายขอบเขตของโมเดลนอกเมทริกซ์ที่ฝึกไว้
ปัญหาคือ โมเดลจะไม่ให้เครดิตกับผลงานใหม่เหล่านั้นในลักษณะเดียวกับ “ผลงานโปรดเก่า” ที่มันเคยรู้จัก หรืออาจไม่ให้เครดิตเลย เนื่องจากอคติทางสถิติของมันได้ฝังแน่นแล้ว
ดังนั้น AI ไม่ได้สังเกตและเลียนแบบพฤติกรรมของมนุษย์เมื่อทำให้ผลกระทบแมทธิวดำเนินต่อไป – มันเพียงแค่นับจำนวนครั้งที่นักวิจัยเลือกอ้างอิงเอกสารเดิมซ้ำ ๆ และจัดอันดับเอกสารเหล่านั้นสูง ในแง่นี้ ปัญหาการอ้างอิงซ้ำเป็นส่วนหนึ่งของความท้าทายในการ คัดเลือก งานวิทยาศาสตร์ที่น่าสนใจจาก พายุข้อมูลวิจัย AI ที่เพิ่มขึ้นเรื่อย ๆ เนื่องจากผลงานที่แข็งแกร่งที่สุดมักจะมีสัญญาณที่อ่อนที่สุด
Diagnosing Mono
ประเด็นนี้ได้รับการสำรวจใน บทความใหม่ที่น่าสนใจ จากสหรัฐอเมริกาชื่อ When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models งานวิจัยใหม่ซึ่งเป็นความร่วมมือระหว่าง University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University และ University of Notre Dame มุ่งพิสูจน์การมีอยู่ของ “โมโนคัลเจอร์การอ้างอิง” ในการเรียนรู้ของเครื่อง เพื่อให้สามารถแก้ไขตัวแปรเหล่านี้ได้โดยตรงในอนาคต รวมถึงแก้ไขปัญหานี้เอง
ในการทดสอบ ผู้เขียนพบว่าโมเดลสิบเอ็ดตัวจาก OpenAI, Google และ Anthropic มักให้ความสำคัญกับ กลุ่มเอกสารขนาดเล็กเดียวกัน แม้หลังจากสัญญาณความนิยมชัดเจนถูกลบออกแล้ว
เพื่อทดสอบ ผู้วิจัยได้ลบจำนวนการอ้างอิงและแหล่งที่มาของเอกสารจริง 120 ฉบับออก พร้อมเปลี่ยนชื่อผู้เขียนและสุ่มกำหนดปีการตีพิมพ์ใหม่ ชุดสุ่มของเอกสารสามสิบฉบับจึงถูกแสดงต่อแต่ละโมเดล ซึ่งแต่ละโมเดลได้รับอนุญาตให้อ้างอิงไม่เกินสิบฉบับ
ผู้เชี่ยวชาญมนุษย์จำนวนแปดคนในสาขาที่เกี่ยวข้องได้รับเอกสารบลายด์เดียวกันเช่นกัน แต่ ไม่ได้ ตรงกับเอกสารที่ AI ชื่นชอบ ซึ่งบ่งบอกว่าความเอนเอียงนี้ เฉพาะต่อโมเดล AI ไม่ได้เกิดจากเอกสารเอง:

จากบทความใหม่ ผลการทดสอบเปรียบเทียบการเลือกอ้างอิงระหว่างโมเดล AI กับผู้เชี่ยวชาญมนุษย์ ทั้งสิบเอ็ดโมเดลมุ่งอ้างอิงไปยังกลุ่มเอกสารขนาดเล็ก ในขณะที่บางเอกสารถูกละเลยอย่างสมบูรณ์ ผู้เชี่ยวชาญมนุษย์ไม่แสดงแนวโน้มเช่นนี้ แหล่งที่มา
แม้เมื่อโมเดลถูกขอให้เลือกอ้างอิงเท่านั้น เอกสารเดียวกันก็ยังคงได้รับความนิยม ซึ่งแสดงว่าการเขียนรีวิวเองไม่ได้เป็นสาเหตุของความเอนเอียง
จากนั้นการทดลองได้ขยายเป็นสิบเอ็ดรอบ โดยเพิ่มเอกสารที่เขียนด้วย AI จำนวน 120 ฉบับหลังแต่ละรอบ เพื่อทดสอบว่าการมีอคติร่วมกันนี้ทำงานอย่างไรเมื่อฐานข้อมูลงานวิจัย AI เติบโตขึ้น
เมื่อเอกสารที่เขียนด้วย AI เพิ่มมากขึ้น โมเดลต่าง ๆ จะยิ่งมุ่งอ้างอิงไปยังจำนวนเอกสารมนุษย์ดั้งเดิมที่ลดลงเรื่อย ๆ
ผู้เขียนระบุ:
‘เมื่อโมเดลภาษาเปลี่ยนจากการร่างบทความเป็นการรันเอเจนต์ค้นหาวรรณกรรมด้วยการเรียกเครื่องมือ การอ้างอิงที่ปลอมสร้างจะง่ายต่อการตรวจจับและจำกัดมากขึ้น’
‘ความล้มเหลวที่ยากขึ้นเริ่มเกิดขึ้นหลังจากทุกตัวเลือกเป็นจริง: โมเดลต่าง ๆ อาจยังคงเลือกกลุ่มแคบเดียวกัน ส่งผลให้เกิดโมโนคัลเจอร์การอ้างอิงโดยไม่มีการอ้างอิงใด ๆ ที่ผิดพลาด’
เพื่อแก้ไขปัญหา บทความชี้ว่าการผสมโมเดลจากผู้จำหน่ายต่าง ๆ หรือการให้เอกสารได้รับการเปิดเผยเท่า ๆ กันไม่เพียงพอ เนื่องจากความชอบส่วนใหญ่ถูกแชร์ระหว่างโมเดลต่าง ๆ แทนที่จะต้องเปลี่ยน ความชอบพื้นฐานต่อเอกสารเฉพาะ ซึ่งอาจทำได้โดยการให้ความสำคัญกับเอกสารที่ถูกละเลยมากขึ้น อย่างไรก็ตาม ผู้เขียนย้ำว่าการแนวทางนี้ยังไม่ได้รับการทดสอบ
Testing Approaches
ชุดมาตรฐานถูกสร้างจากเอกสารการสกัดความรู้จริง 120 ฉบับที่รวบรวมจาก arXiv และตีพิมพ์ระหว่างปี 2015‑2022 แต่ละฉบับมีการอ้างอิงระหว่าง 50‑500 ครั้งในช่วงเวลาที่รวบรวม เพื่อคัดกรองเอกสารที่ไม่เป็นที่รู้จักหรือมีอิทธิพลมากเกินไป
การทดลองเริ่มต้นด้วยการสุ่มเลือกเอกสารสามสิบฉบับจากคอลเลกชันที่มีอยู่ โดยซ่อนชื่อผู้เขียน ปีการตีพิมพ์ และจำนวนการอ้างอิง แต่ละโมเดลสร้างรีวิวสั้นหรือบทความตำแหน่งโดยอ้างอิงไม่เกินสิบฉบับ และผลลัพธ์เหล่านี้ถูกเปรียบเทียบกับการเลือกแบบสุ่มจากวัสดุเดียวกัน:

โครงร่างวิธีการทดสอบความชอบในการอ้างอิง: เอกสารสามสิบฉบับที่สุ่มเลือกถูกแสดงต่อโมเดลโดยซ่อนข้อมูลระบุตัวตน หลังจากนั้นโมเดลสามารถอ้างอิงได้สูงสุดสิบฉบับ ผลลัพธ์ถูกเปรียบเทียบกับการเลือกแบบสุ่ม ในขณะที่แต่ละรอบเพิ่มเอกสารที่เขียนด้วย AI จำนวน 120 ฉบับเข้าสู่คอลเลกชันของรอบต่อไป
ในการทดลองต่อเนื่อง เอกสารที่สร้างใหม่จำนวน 120 ฉบับถูกเพิ่มเข้าไปในคอลเลกชันหลังแต่ละรอบ ทำให้สัดส่วนของงานวิจัยที่เขียนด้วย AI ค่อย ๆ เพิ่มขึ้น
ในการทดสอบเบื้องต้น โมเดลมักอ้างอิงส่วนใหญ่ของเอกสารที่แสดงให้เห็น โดยทั่วไปเลือก 22‑27 ฉบับจาก 30 ฉบับ ดังนั้นนักวิจัยจึงกำหนดให้มีการอ้างอิงสูงสุดสิบฉบับสำหรับการทดลองหลัก เพื่อบังคับให้โมเดลเลือกอย่างระมัดระวังมากขึ้น
ด้านล่างเป็นสรุปการออกแบบการทดลองที่ได้ผลลัพธ์:

การตั้งค่าการทดลองเพื่อทดสอบความชอบในการอ้างอิง: การศึกษาเริ่มต้นด้วยเอกสารจริง 120 ฉบับและทดสอบโมเดลสิบเอ็ดตัวจากผู้ให้บริการสามราย โดยใช้ชุดสุ่มของ 30 ฉบับและจำกัดการอ้างอิงสูงสุดสิบฉบับ รอบต่อมาจะเพิ่มเอกสารที่สร้างด้วย AI ทำให้คอลเลกชันขยายเป็น 1,440 ฉบับ
การทดลองเบื้องต้นใช้โมเดลสิบเอ็ดตัวจากผู้ให้บริการหลักสามราย: OpenAI มี GPT‑5, GPT‑5 mini, GPT‑4.1 และ GPT‑4.1 mini; Google มี Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro และ Gemini 3.1 Flash‑Lite; ส่วน Anthropic มี Claude Opus 4.8, Claude Sonnet 4.6 และ Claude Haiku 4.5
ในผลลัพธ์ที่แสดงด้านล่าง เราเห็นว่าทุกโมเดลมุ่งอ้างอิงไปยังกลุ่มเอกสารขนาดเล็กเพียงใด; จำนวนเอกสารที่ถูกละเลยทั้งหมด; และความสม่ำเสมอของการเลือกเดียวกันเมื่อทำการทดลองซ้ำ:

ผลการทดสอบแสดงระดับการมุ่งอ้างอิงของแต่ละโมเดลต่อเอกสารเฉพาะและจำนวนเอกสารที่ถูกละเลยทั้งหมด ‘ส่วนแบ่ง Top‑10%’ แสดงจำนวนการอ้างอิงที่ไปยัง 12 เอกสารที่ได้รับความนิยมสูงสุด ส่วน ‘HHI’ วัดระดับการกระจุกของการอ้างอิงโดยรวม ‘Reliability’ แสดงความสม่ำเสมอของการเลือกเอกสารเดียวกันระหว่างการทดสอบ และ ρ แสดงความคล้ายคลึงของความชอบระหว่างโมเดล ‘Matched null’ แสดงผลที่คาดว่าจะเกิดขึ้นหากเลือกเอกสารแบบสุ่ม
โมเดลกำลังให้ความสำคัญกับอะไรกันแน่?
ความชอบนี้พบว่าขับเคลื่อนโดย เนื้อหาของเอกสารเองเป็นหลัก ตัวอย่างเช่น สำหรับ GPT‑5 mini ประมาณ 90 % ของความแปรปรวนในเอกสารที่ถูกชื่นชอบสืบเนื่องจากเนื้อหา ไม่ใช่ปัจจัยเช่นลำดับรายการ, เสียงรบกวนจากการสร้าง, หรือเมตาดาต้าที่สร้างขึ้นสำหรับแต่ละเอกสาร ผลกระทบ ‘เนื้อหาโดดเด่น’ เดียวกันถูกทำซ้ำกับ GPT‑4.1 mini ด้วย
แผนที่ความชอบ (ดูด้านล่าง) ก็ไม่ได้เปลี่ยนแปลงมากเมื่อหัวข้อและบทคัดย่อถูกเขียนใหม่อย่างมากโดยยังคงรักษาความหมายเดิมไว้ การทดสอบการพาราฟเรซสี่ครั้งที่ประสบความสำเร็จให้ความสัมพันธ์ 0.95‑0.99 แม้ใช้โมเดลจากผู้ให้บริการสามรายต่างกันในการเขียนใหม่
การเปลี่ยนแปลงในแผนที่ความชอบสังเกตได้เฉพาะเมื่อ ความหมายพื้นฐาน ของเอกสารถูกเปลี่ยนแปลงอย่างมีนัยสำคัญ:

ผลการทดสอบเปรียบเทียบความชอบในการอ้างอิงระหว่างโมเดลสิบเอ็ดตัว ตัวเลขแสดงความใกล้เคียงของการชื่นชอบเอกสารเดียวกันระหว่างแต่ละคู่โมเดล ค่าใกล้เคียงสูงบ่งบอกถึงความสอดคล้องมากขึ้น แม้ว่าจะมีความแตกต่างระหว่างโมเดลและผู้ให้บริการ แต่ความชอบโดยรวมยังคงคล้ายคลึงกันทั่วกลุ่ม
ดังนั้นโมเดลดูเหมือนจะตอบสนองต่อเนื้อหาเชิงความหมายเป็นหลัก มากกว่าการตอบสนองต่อการจัดวางคำเฉพาะ อย่างไรก็ตาม สาเหตุของความสอดคล้องสูงนี้ยังไม่สามารถสรุปได้อย่างแน่ชัด
ผู้เขียนเสนอว่า ความเห็นพ้องกันในการอ้างอิงอาจถูกฝังไว้ระหว่างการฝึกฝนเป็น “ความเข้าใจร่วม” หรืออาจเป็นผลมาจากการประเมินว่าอะไรเป็นเอกสารที่ “ควรอ้างอิง” อย่างอิสระกัน
จึงสรุปว่ามีการยืนยันการมีอยู่ของความชอบร่วมกัน แต่ที่มาที่แท้จริงยังคงไม่เป็นที่ทราบ
ผู้เขียนชี้ว่าการใช้ AI อย่างกว้างขวางในการวิจัยอาจทำให้ขอบเขตของงานที่ได้รับความสนใจแคบลง เนื่องจากโมเดลต่าง ๆ มักชื่นชอบเอกสารเดียวกัน และเมื่อวรรณกรรมที่สร้างด้วย AI สะสม ความชอบร่วมนี้อาจถูกเสริมแรงต่อเนื่องผ่านการอ้างอิงซ้ำ ทำให้การค้นคว้างานที่ไม่ได้รับความนิยมยากขึ้นเรื่อย ๆ การกระจายความหลากหลายของการอ้างอิงและการตรวจสอบการกระจุกของการอ้างอิงจึงถูกเสนอเป็นมาตรการป้องกันที่เป็นไปได้
ชุดมาตรฐานสำหรับการวัดการกระจุกของการอ้างอิงแบบวนซ้ำพร้อมให้ดาวน์โหลด ที่ GitHub
Conclusion
Opinion ในฐานะผู้ที่อ่านบทความวิจัย AI จำนวนมากเป็นประจำทุกสัปดาห์ ผมได้เห็น “คลื่นการอ้างอิง” ปรากฏและหายไปอย่างต่อเนื่อง สิ่งที่คงอยู่เสมอคือ Attention Is All You Need ของ Google ซึ่งตอนนี้กลายเป็นส่วนที่ฝังอยู่ในเทมเพลตการส่งบทความแล้ว
อีกหนึ่งงานที่เคยถูกอ้างอิงบ่อยครั้งคือ Generative Adversarial Networks จากปี 2014 แม้ว่าต่อมาจะถูกแทนที่ด้วย Denoising Diffusion Probabilistic Models และงานวิจัยเชิงกระจายอื่น ๆ ที่เป็นหัวใจสำคัญ
ในเกือบทุกกรณี การอ้างอิง “ซ้ำ” เหล่านี้ไม่ได้ ผิด อย่างแท้จริง; แต่บ่อยครั้งที่ขอบเขตของมันกว้างเกินไปจนไม่ใช่การสนับสนุนที่มีประโยชน์ต่อบทความที่อ้างอิง และในความหมายนี้ พวกมันกลายเป็นสิ่งที่คล้ายกับ “การทำให้การอ้างอิงดูดี” – การใส่คำอ้างอิง “เชื่อถือได้” แต่ส่วนใหญ่เป็นการตกแต่งเพื่อให้ดูน่าเชื่อถือโดยใช้ความพยายามน้อย
เผยแพร่ครั้งแรกวันจันทร์ที่ 24 สิงหาคม 2026 แก้ไขเวลา 23:07 น. ตามเวลา EET เพื่อเติมรูปพหูพจน์ที่ตกหล่น
แหล่งอ้างอิงของบทความต้นฉบับ: unite.ai [1]












