มุมมองของ Anderson

AI อ้างอิงเอกสารเดียวกันซ้ำแล้วซ้ำเล่า – เหมือนมนุษย์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT และเครื่องมือเขียนด้วย AI อื่น ๆ อาจกำลังแปลงวิทยาศาสตร์ให้เป็นการแข่งขันความนิยมอย่างเงียบ ๆ โดยพาให้นักวิจัยมุ่งไปยังเอกสารเดียวกันซ้ำแล้วซ้ำเล่า ในขณะที่มองข้ามผลงานใหม่และนวัตกรรมที่อาจทำให้สาขานี้ก้าวหน้าได้จริง

 

โมโนคัลเจอร์ ในแง่ของความถี่และสถิติ คือการที่ชุดแหล่งข้อมูลหรือทรัพยากรที่จำกัดเดียวกันปรากฏซ้ำ ๆ จนทำให้เสียงใหม่และมุมมองสดใหม่ถูกกดทับ: ชุด เพลงที่จำกัดเดียวกัน ในการจัดรายการวิทยุ; กลุ่มผู้เขียนและหนังสือเดียวกัน ในชั้นวางสนามบิน; และ การคัดสรรผลไม้และผักที่จำกัด ในซุปเปอร์มาร์เก็ต:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

ใช่ เรามีกล้วยเหล่านี้ – และมีเพียงกล้วยเหล่านี้เท่านั้น ความเป็นเอกภาพของผลไม้และผักในห่วงโซ่อาหารตะวันตกมองข้ามศักยภาพของพันธุ์อื่น ๆ ร้อย ๆ ชนิดในแต่ละกรณี เนื่องจากกระบวนการผลิตและการขนส่งที่หลากหลายมีค่าใช้จ่ายสูงเกินกว่าจะทำอุตสาหกรรมได้สำหรับผลไม้หรือผักหลายประเภท แหล่งที่มา

สิ่งนี้ยังเกิดขึ้นใน การอ้างอิง ที่ปรากฏในงานวิจัยวิทยาศาสตร์ใหม่ ๆ โดยที่นักวิจัยอาจเลือกอ้างอิงชุดแหล่งข้อมูล “เชื่อถือได้” ที่ได้รับความนิยมจนกลายเป็นมาตรฐานและครอบงำสาขาการวิจัยต่าง ๆ

นี่คือสิ่งที่เรียกว่า ผลกระทบแมทธิว (Matthew Effect) – ทฤษฎีสังคมวิทยาที่บ่งชี้ว่า ผู้ที่อยู่ในตำแหน่งที่ดีจะได้รับประโยชน์ต่อเนื่อง; ปรากฏการณ์นี้ถูกเปรียบเทียบกับคำสัญญาในมัทธิว 13:12 ซึ่ง กล่าวว่า “ผู้ที่มีจะได้รับเพิ่มขึ้นและจะมีความอุดมสมบูรณ์ ผู้ที่ไม่มี แม้แต่สิ่งที่มีอยู่ก็จะถูกพรากไป”

กลุ่มงานที่ได้รับความนิยม

หนึ่งใน ความคาดหวังใหญ่ ของการวิจัยที่เสริมด้วย AI คือวิธีการเรียนรู้ของเครื่องใหม่ ๆ จะสามารถทำลายผลกระทบแมทธิว – หรือที่รู้จักกันในชื่อ อคติความนิยม (popularity bias) และเริ่มอ้างอิงผลงานที่ไม่ค่อยเป็นที่รู้จักซึ่งอาจให้ข้อมูลที่ลึกซึ้งหรือเหมาะสมกับประเด็นของบทความมากกว่า

อย่างไรก็ตาม จากวิธีที่กระบวนการฝึกโมเดล AI แปลความหมายชุดข้อมูล การคาดหวังนี้ไม่เคยมีเหตุผลที่ดี และพบว่าเมื่อ AI ไม่ได้ สร้างอ้างอิงขึ้นมาโดยตรง – ปัญหาเรื้อรังที่ยังคงอยู่ – มันกลับทำให้ ผลกระทบแมทธิว ยังคงดำเนินต่อไปเช่นเดียวกับมนุษย์ แม้อาจมีสาเหตุที่ต่างกันบ้าง

ระหว่างการฝึก โมเดลจะเรียนรู้ให้ให้คะแนนสูงกับเอกสารที่อ้างอิงบ่อยที่สุด (หรือ “ที่ถูกอ้างอิงซ้ำบ่อย”) ในชุดฝึก เนื่องจากกระบวนการฝึกถูกออกแบบให้สกัดรูปแบบที่มีความหมายและ ลดน้ำหนักข้อมูลที่เป็นค่าเบี่ยงเบน (outliers) ว่าเป็น “เสียงรบกวน” หรือความผิดปกติทางสถิติ

ภายใต้กรอบนี้ ทฤษฎีสัมพัทธภาพของไอน์สไตน์ก็อาจไม่เคยได้รับความสนใจจากเครื่องจักร เพราะเมื่อโมเดลได้รับการฝึกแล้ว จะรู้สึกว่ามันได้พบหลักการและแหล่งอ้างอิงที่ต้องการแล้ว และสามารถปรับเปลี่ยนเล็กน้อยโดยการเข้าถึงการตีพิมพ์ใหม่ ๆ ผ่าน RAG หรือวิธีอื่น ๆ ที่ขยายขอบเขตของโมเดลนอกเมทริกซ์ที่ฝึกไว้

ปัญหาคือ โมเดลจะไม่ให้เครดิตกับผลงานใหม่เหล่านั้นในลักษณะเดียวกับ “ผลงานโปรดเก่า” ที่มันเคยรู้จัก หรืออาจไม่ให้เครดิตเลย เนื่องจากอคติทางสถิติของมันได้ฝังแน่นแล้ว

ดังนั้น AI ไม่ได้สังเกตและเลียนแบบพฤติกรรมของมนุษย์เมื่อทำให้ผลกระทบแมทธิวดำเนินต่อไป – มันเพียงแค่นับจำนวนครั้งที่นักวิจัยเลือกอ้างอิงเอกสารเดิมซ้ำ ๆ และจัดอันดับเอกสารเหล่านั้นสูง ในแง่นี้ ปัญหาการอ้างอิงซ้ำเป็นส่วนหนึ่งของความท้าทายในการ คัดเลือก งานวิทยาศาสตร์ที่น่าสนใจจาก พายุข้อมูลวิจัย AI ที่เพิ่มขึ้นเรื่อย ๆ เนื่องจากผลงานที่แข็งแกร่งที่สุดมักจะมีสัญญาณที่อ่อนที่สุด

Diagnosing Mono

ประเด็นนี้ได้รับการสำรวจใน บทความใหม่ที่น่าสนใจ จากสหรัฐอเมริกาชื่อ When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models งานวิจัยใหม่ซึ่งเป็นความร่วมมือระหว่าง University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University และ University of Notre Dame มุ่งพิสูจน์การมีอยู่ของ “โมโนคัลเจอร์การอ้างอิง” ในการเรียนรู้ของเครื่อง เพื่อให้สามารถแก้ไขตัวแปรเหล่านี้ได้โดยตรงในอนาคต รวมถึงแก้ไขปัญหานี้เอง

ในการทดสอบ ผู้เขียนพบว่าโมเดลสิบเอ็ดตัวจาก OpenAI, Google และ Anthropic มักให้ความสำคัญกับ กลุ่มเอกสารขนาดเล็กเดียวกัน แม้หลังจากสัญญาณความนิยมชัดเจนถูกลบออกแล้ว

เพื่อทดสอบ ผู้วิจัยได้ลบจำนวนการอ้างอิงและแหล่งที่มาของเอกสารจริง 120 ฉบับออก พร้อมเปลี่ยนชื่อผู้เขียนและสุ่มกำหนดปีการตีพิมพ์ใหม่ ชุดสุ่มของเอกสารสามสิบฉบับจึงถูกแสดงต่อแต่ละโมเดล ซึ่งแต่ละโมเดลได้รับอนุญาตให้อ้างอิงไม่เกินสิบฉบับ

ผู้เชี่ยวชาญมนุษย์จำนวนแปดคนในสาขาที่เกี่ยวข้องได้รับเอกสารบลายด์เดียวกันเช่นกัน แต่ ไม่ได้ ตรงกับเอกสารที่ AI ชื่นชอบ ซึ่งบ่งบอกว่าความเอนเอียงนี้ เฉพาะต่อโมเดล AI ไม่ได้เกิดจากเอกสารเอง:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

จากบทความใหม่ ผลการทดสอบเปรียบเทียบการเลือกอ้างอิงระหว่างโมเดล AI กับผู้เชี่ยวชาญมนุษย์ ทั้งสิบเอ็ดโมเดลมุ่งอ้างอิงไปยังกลุ่มเอกสารขนาดเล็ก ในขณะที่บางเอกสารถูกละเลยอย่างสมบูรณ์ ผู้เชี่ยวชาญมนุษย์ไม่แสดงแนวโน้มเช่นนี้ แหล่งที่มา

แม้เมื่อโมเดลถูกขอให้เลือกอ้างอิงเท่านั้น เอกสารเดียวกันก็ยังคงได้รับความนิยม ซึ่งแสดงว่าการเขียนรีวิวเองไม่ได้เป็นสาเหตุของความเอนเอียง

จากนั้นการทดลองได้ขยายเป็นสิบเอ็ดรอบ โดยเพิ่มเอกสารที่เขียนด้วย AI จำนวน 120 ฉบับหลังแต่ละรอบ เพื่อทดสอบว่าการมีอคติร่วมกันนี้ทำงานอย่างไรเมื่อฐานข้อมูลงานวิจัย AI เติบโตขึ้น

เมื่อเอกสารที่เขียนด้วย AI เพิ่มมากขึ้น โมเดลต่าง ๆ จะยิ่งมุ่งอ้างอิงไปยังจำนวนเอกสารมนุษย์ดั้งเดิมที่ลดลงเรื่อย ๆ

ผู้เขียนระบุ:

‘เมื่อโมเดลภาษาเปลี่ยนจากการร่างบทความเป็นการรันเอเจนต์ค้นหาวรรณกรรมด้วยการเรียกเครื่องมือ การอ้างอิงที่ปลอมสร้างจะง่ายต่อการตรวจจับและจำกัดมากขึ้น’

‘ความล้มเหลวที่ยากขึ้นเริ่มเกิดขึ้นหลังจากทุกตัวเลือกเป็นจริง: โมเดลต่าง ๆ อาจยังคงเลือกกลุ่มแคบเดียวกัน ส่งผลให้เกิดโมโนคัลเจอร์การอ้างอิงโดยไม่มีการอ้างอิงใด ๆ ที่ผิดพลาด’

เพื่อแก้ไขปัญหา บทความชี้ว่าการผสมโมเดลจากผู้จำหน่ายต่าง ๆ หรือการให้เอกสารได้รับการเปิดเผยเท่า ๆ กันไม่เพียงพอ เนื่องจากความชอบส่วนใหญ่ถูกแชร์ระหว่างโมเดลต่าง ๆ แทนที่จะต้องเปลี่ยน ความชอบพื้นฐานต่อเอกสารเฉพาะ ซึ่งอาจทำได้โดยการให้ความสำคัญกับเอกสารที่ถูกละเลยมากขึ้น อย่างไรก็ตาม ผู้เขียนย้ำว่าการแนวทางนี้ยังไม่ได้รับการทดสอบ

Testing Approaches

ชุดมาตรฐานถูกสร้างจากเอกสารการสกัดความรู้จริง 120 ฉบับที่รวบรวมจาก arXiv และตีพิมพ์ระหว่างปี 2015‑2022 แต่ละฉบับมีการอ้างอิงระหว่าง 50‑500 ครั้งในช่วงเวลาที่รวบรวม เพื่อคัดกรองเอกสารที่ไม่เป็นที่รู้จักหรือมีอิทธิพลมากเกินไป

การทดลองเริ่มต้นด้วยการสุ่มเลือกเอกสารสามสิบฉบับจากคอลเลกชันที่มีอยู่ โดยซ่อนชื่อผู้เขียน ปีการตีพิมพ์ และจำนวนการอ้างอิง แต่ละโมเดลสร้างรีวิวสั้นหรือบทความตำแหน่งโดยอ้างอิงไม่เกินสิบฉบับ และผลลัพธ์เหล่านี้ถูกเปรียบเทียบกับการเลือกแบบสุ่มจากวัสดุเดียวกัน:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

โครงร่างวิธีการทดสอบความชอบในการอ้างอิง: เอกสารสามสิบฉบับที่สุ่มเลือกถูกแสดงต่อโมเดลโดยซ่อนข้อมูลระบุตัวตน หลังจากนั้นโมเดลสามารถอ้างอิงได้สูงสุดสิบฉบับ ผลลัพธ์ถูกเปรียบเทียบกับการเลือกแบบสุ่ม ในขณะที่แต่ละรอบเพิ่มเอกสารที่เขียนด้วย AI จำนวน 120 ฉบับเข้าสู่คอลเลกชันของรอบต่อไป

ในการทดลองต่อเนื่อง เอกสารที่สร้างใหม่จำนวน 120 ฉบับถูกเพิ่มเข้าไปในคอลเลกชันหลังแต่ละรอบ ทำให้สัดส่วนของงานวิจัยที่เขียนด้วย AI ค่อย ๆ เพิ่มขึ้น

ในการทดสอบเบื้องต้น โมเดลมักอ้างอิงส่วนใหญ่ของเอกสารที่แสดงให้เห็น โดยทั่วไปเลือก 22‑27 ฉบับจาก 30 ฉบับ ดังนั้นนักวิจัยจึงกำหนดให้มีการอ้างอิงสูงสุดสิบฉบับสำหรับการทดลองหลัก เพื่อบังคับให้โมเดลเลือกอย่างระมัดระวังมากขึ้น

ด้านล่างเป็นสรุปการออกแบบการทดลองที่ได้ผลลัพธ์:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

การตั้งค่าการทดลองเพื่อทดสอบความชอบในการอ้างอิง: การศึกษาเริ่มต้นด้วยเอกสารจริง 120 ฉบับและทดสอบโมเดลสิบเอ็ดตัวจากผู้ให้บริการสามราย โดยใช้ชุดสุ่มของ 30 ฉบับและจำกัดการอ้างอิงสูงสุดสิบฉบับ รอบต่อมาจะเพิ่มเอกสารที่สร้างด้วย AI ทำให้คอลเลกชันขยายเป็น 1,440 ฉบับ

การทดลองเบื้องต้นใช้โมเดลสิบเอ็ดตัวจากผู้ให้บริการหลักสามราย: OpenAI มี GPT‑5, GPT‑5 mini, GPT‑4.1 และ GPT‑4.1 mini; Google มี Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro และ Gemini 3.1 Flash‑Lite; ส่วน Anthropic มี Claude Opus 4.8, Claude Sonnet 4.6 และ Claude Haiku 4.5

ในผลลัพธ์ที่แสดงด้านล่าง เราเห็นว่าทุกโมเดลมุ่งอ้างอิงไปยังกลุ่มเอกสารขนาดเล็กเพียงใด; จำนวนเอกสารที่ถูกละเลยทั้งหมด; และความสม่ำเสมอของการเลือกเดียวกันเมื่อทำการทดลองซ้ำ:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

ผลการทดสอบแสดงระดับการมุ่งอ้างอิงของแต่ละโมเดลต่อเอกสารเฉพาะและจำนวนเอกสารที่ถูกละเลยทั้งหมด ‘ส่วนแบ่ง Top‑10%’ แสดงจำนวนการอ้างอิงที่ไปยัง 12 เอกสารที่ได้รับความนิยมสูงสุด ส่วน ‘HHI’ วัดระดับการกระจุกของการอ้างอิงโดยรวม ‘Reliability’ แสดงความสม่ำเสมอของการเลือกเอกสารเดียวกันระหว่างการทดสอบ และ ρ แสดงความคล้ายคลึงของความชอบระหว่างโมเดล ‘Matched null’ แสดงผลที่คาดว่าจะเกิดขึ้นหากเลือกเอกสารแบบสุ่ม

โมเดลกำลังให้ความสำคัญกับอะไรกันแน่?

ความชอบนี้พบว่าขับเคลื่อนโดย เนื้อหาของเอกสารเองเป็นหลัก ตัวอย่างเช่น สำหรับ GPT‑5 mini ประมาณ 90 % ของความแปรปรวนในเอกสารที่ถูกชื่นชอบสืบเนื่องจากเนื้อหา ไม่ใช่ปัจจัยเช่นลำดับรายการ, เสียงรบกวนจากการสร้าง, หรือเมตาดาต้าที่สร้างขึ้นสำหรับแต่ละเอกสาร ผลกระทบ ‘เนื้อหาโดดเด่น’ เดียวกันถูกทำซ้ำกับ GPT‑4.1 mini ด้วย

แผนที่ความชอบ (ดูด้านล่าง) ก็ไม่ได้เปลี่ยนแปลงมากเมื่อหัวข้อและบทคัดย่อถูกเขียนใหม่อย่างมากโดยยังคงรักษาความหมายเดิมไว้ การทดสอบการพาราฟเรซสี่ครั้งที่ประสบความสำเร็จให้ความสัมพันธ์ 0.95‑0.99 แม้ใช้โมเดลจากผู้ให้บริการสามรายต่างกันในการเขียนใหม่

การเปลี่ยนแปลงในแผนที่ความชอบสังเกตได้เฉพาะเมื่อ ความหมายพื้นฐาน ของเอกสารถูกเปลี่ยนแปลงอย่างมีนัยสำคัญ:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

ผลการทดสอบเปรียบเทียบความชอบในการอ้างอิงระหว่างโมเดลสิบเอ็ดตัว ตัวเลขแสดงความใกล้เคียงของการชื่นชอบเอกสารเดียวกันระหว่างแต่ละคู่โมเดล ค่าใกล้เคียงสูงบ่งบอกถึงความสอดคล้องมากขึ้น แม้ว่าจะมีความแตกต่างระหว่างโมเดลและผู้ให้บริการ แต่ความชอบโดยรวมยังคงคล้ายคลึงกันทั่วกลุ่ม

ดังนั้นโมเดลดูเหมือนจะตอบสนองต่อเนื้อหาเชิงความหมายเป็นหลัก มากกว่าการตอบสนองต่อการจัดวางคำเฉพาะ อย่างไรก็ตาม สาเหตุของความสอดคล้องสูงนี้ยังไม่สามารถสรุปได้อย่างแน่ชัด

ผู้เขียนเสนอว่า ความเห็นพ้องกันในการอ้างอิงอาจถูกฝังไว้ระหว่างการฝึกฝนเป็น “ความเข้าใจร่วม” หรืออาจเป็นผลมาจากการประเมินว่าอะไรเป็นเอกสารที่ “ควรอ้างอิง” อย่างอิสระกัน

จึงสรุปว่ามีการยืนยันการมีอยู่ของความชอบร่วมกัน แต่ที่มาที่แท้จริงยังคงไม่เป็นที่ทราบ

ผู้เขียนชี้ว่าการใช้ AI อย่างกว้างขวางในการวิจัยอาจทำให้ขอบเขตของงานที่ได้รับความสนใจแคบลง เนื่องจากโมเดลต่าง ๆ มักชื่นชอบเอกสารเดียวกัน และเมื่อวรรณกรรมที่สร้างด้วย AI สะสม ความชอบร่วมนี้อาจถูกเสริมแรงต่อเนื่องผ่านการอ้างอิงซ้ำ ทำให้การค้นคว้างานที่ไม่ได้รับความนิยมยากขึ้นเรื่อย ๆ การกระจายความหลากหลายของการอ้างอิงและการตรวจสอบการกระจุกของการอ้างอิงจึงถูกเสนอเป็นมาตรการป้องกันที่เป็นไปได้

ชุดมาตรฐานสำหรับการวัดการกระจุกของการอ้างอิงแบบวนซ้ำพร้อมให้ดาวน์โหลด ที่ GitHub

Conclusion

Opinion ในฐานะผู้ที่อ่านบทความวิจัย AI จำนวนมากเป็นประจำทุกสัปดาห์ ผมได้เห็น “คลื่นการอ้างอิง” ปรากฏและหายไปอย่างต่อเนื่อง สิ่งที่คงอยู่เสมอคือ Attention Is All You Need ของ Google ซึ่งตอนนี้กลายเป็นส่วนที่ฝังอยู่ในเทมเพลตการส่งบทความแล้ว

อีกหนึ่งงานที่เคยถูกอ้างอิงบ่อยครั้งคือ Generative Adversarial Networks จากปี 2014 แม้ว่าต่อมาจะถูกแทนที่ด้วย Denoising Diffusion Probabilistic Models และงานวิจัยเชิงกระจายอื่น ๆ ที่เป็นหัวใจสำคัญ

ในเกือบทุกกรณี การอ้างอิง “ซ้ำ” เหล่านี้ไม่ได้ ผิด อย่างแท้จริง; แต่บ่อยครั้งที่ขอบเขตของมันกว้างเกินไปจนไม่ใช่การสนับสนุนที่มีประโยชน์ต่อบทความที่อ้างอิง และในความหมายนี้ พวกมันกลายเป็นสิ่งที่คล้ายกับ “การทำให้การอ้างอิงดูดี” – การใส่คำอ้างอิง “เชื่อถือได้” แต่ส่วนใหญ่เป็นการตกแต่งเพื่อให้ดูน่าเชื่อถือโดยใช้ความพยายามน้อย

 

เผยแพร่ครั้งแรกวันจันทร์ที่ 24 สิงหาคม 2026 แก้ไขเวลา 23:07 น. ตามเวลา EET เพื่อเติมรูปพหูพจน์ที่ตกหล่น

แหล่งอ้างอิงของบทความต้นฉบับ: unite.ai [1]

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai