มุมมองของ Anderson
ทำไม AI ถึงรักการเขียนเรื่องราวเกี่ยวกับคนดูแลหอไฟ

เมื่อถูกขอให้ “เขียนเรื่องหนึ่ง” ChatGPT และโมเดลภาษาชั้นนำอื่น ๆ ดูเหมือนพยายามหลีกเลี่ยงการละเมิดลิขสิทธิ์ด้วยการหวนกลับไปใช้ตัวละครแปลก ๆ กลุ่มเล็กเดิมซ้ำแล้วซ้ำเล่า เช่น ผู้ดูแลประภาคาร ชาวประมง และช่างทำนาฬิกา
งานวิจัยใหม่จากมหาวิทยาลัย Cornell พบว่า เมื่อได้รับเพียงคำสั่ง “เขียนเรื่องหนึ่ง” โมเดลภาษาชั้นนำกลับหมกมุ่นกับองค์ประกอบการเล่าเรื่องที่แคบมาก จากเรื่อง 20,000 เรื่องที่สร้างโดย LLM สี่รุ่น 88% มีอย่างน้อยหนึ่งใน 11 โทเคนเฉพาะจากหมวดสถานที่ ชื่อ และอาชีพ

จำนวนครั้งต่อหนึ่งล้านคำของคำสำคัญที่ไม่น่าจะพบ ซึ่งได้จากการวิเคราะห์เรื่องที่ LLM สร้าง 20,000 เรื่อง แหล่งที่มา
คำ 11 คำที่เกิดซ้ำบ่อยที่สุดในข้อความกว่า 12 ล้านคำ ได้แก่ชื่อ elias, mara, elara; อาชีพ keeper, baker, mayor, clockmaker, fisherman, librarian, conductor; และสถานที่ lighthouse
โมเดลที่ทดสอบคือ Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini และ OLMo 7b Thinking แต่ละรุ่นได้รับหนึ่งในห้าคำขอ ได้แก่ “เขียนเรื่องหนึ่ง” “โปรดเขียนเรื่องหนึ่ง” “เขียนเรื่องให้ฉัน” “เล่าเรื่องให้ฉันฟัง” หรือ “โปรดเล่าเรื่องหนึ่ง”
เพื่อดูว่าปรากฏการณ์ในงานวิจัยมีอยู่ในโมเดลขณะเขียนหรือไม่ ฉันทดลองกับบัญชี ChatGPT ระดับกลางที่ใช้ประจำก่อน (บทสนทนาอยู่ที่นี่) ไม่ต้องเลือกเฉพาะผลที่เข้าทาง เพราะ ChatGPT-5.5 เลือกเนื้อหาตามที่นักวิจัยคาดไว้ตั้งแต่ครั้งแรก

ChatGPT-5.5 สนับสนุนข้อค้นพบเบื้องต้นของงานวิจัยทันที แหล่งที่มา
เพื่อแยกผลจากประวัติการใช้หรือการรั่วไหลข้ามบริบท ฉันเข้าสู่บัญชี ChatGPT ฟรีที่ไม่ได้ใช้มานานกว่าหนึ่งปีผ่านหน้าต่างส่วนตัวของ Firefox แล้วลองอีกครั้ง (บทสนทนาที่นี่) หาก OpenAI ไม่ใช้ IP เดียวกันเชื่อมข้อมูลข้ามบัญชี ChatGPT ก็ยังตอบตรงเป้าอีกครั้ง

บัญชี ChatGPT ที่สองยังยึดติดกับชื่อและธีมชุดเล็กแบบเดียวกับงานวิจัยใหม่ โดย “Mira” อยู่ใน 20 อันดับแรกของผู้เขียน แหล่งที่มา
ควรสังเกตว่า GPT เหล่านี้ใหม่กว่ารุ่น 5.4 ที่ทดสอบในงานวิจัยหนึ่งระดับ
แม้งานวิจัยทดสอบ Claude Haiku ฉันลอง Sonnet 4.6 ซึ่งเป็นค่าเริ่มต้นของ Anthropic และก็ไม่ผิดหวัง คำสำคัญคุ้นเคยปรากฏตั้งแต่ครั้งแรกอีกครั้ง (บทสนทนาที่นี่)

ครั้งนี้ “Mara” หนึ่งในคำหลัก 11 อันดับแรก นำเรื่องตั้งแต่การลองครั้งแรกกับ Claude Sonnet 4.6 แหล่งที่มา
การใช้คำสั่งเดียวกันกับ Claude Haiku 4.5 ให้ผลแทบเหมือนกัน
ตอนแรกฉันทำซ้ำข้อค้นพบใน Google Gemini ไม่ได้ จนเลือก Gemini 3.1 Flash-Lite ตามงานวิจัยโดยเฉพาะ แล้วรูปแบบก็ปรากฏทันทีในการลองรวมครั้งที่สาม แต่เป็นครั้งแรกกับโมเดลนี้ (ลิงก์ที่นี่)

Google Gemini 3.1 Flash-Lite แหล่งที่มา
การทดลองเพิ่มเติมกับ Gemini รุ่นอื่นให้ธีมประภาคารทุกครั้ง แม้มีชื่อที่ไม่อยู่ใน 11 อันดับแรก เช่น Thomas หรือในอีกแบบหนึ่งใช้ชื่อของฉันเองเป็นตัวเอก
อย่างไรก็ตาม ณ เวลาที่เขียน ข้อค้นพบของงานวิจัยพิสูจน์ซ้ำได้ง่ายมาก
ประภาคารในโลกจริง
ความคิดที่ดีมักมาบรรจบกัน หนึ่งสัปดาห์ก่อนงานวิจัยใหม่เผยแพร่ Daniel May นักเขียนซอฟต์แวร์ชี้ให้เห็นความบังเอิญของธีม Elias กับผู้ดูแลประภาคารที่นักวิจัยสกัดได้* เขาทดสอบ Gemini, DeepSeek, Qwen และ Gemma แปดรุ่น ซึ่งสร้างมีมประภาคารและตัวเอก Elias Thorne* แต่ข้อสังเกตนี้ยังไม่ครอบคลุมธีมถาวรที่กว้างกว่าจากงานวิจัยใหม่
เพื่อดูว่าธีม ชื่อ และสถานที่ซ้ำเหล่านี้หลุดออกจากแชตหรือไม่ ฉันค้นคำและธีมอันดับต้น ๆ บน Google และพบโพสต์จำนวนมากอย่างน่าประหลาดที่ดูเหมือนใช้สิ่งเหล่านี้

ตัวอย่างมีมสามรายการในผลลัพธ์ ดูลิงก์แหล่งที่มาด้านล่าง
May ระบุชื่อเต็ม Elias Thorne ไม่ใช่แค่ Elias ว่าเป็นมีม LLM ที่เกิดซ้ำ และโพสต์ภาพจาก Amazon ซึ่งชื่อนี้ถูกใช้เป็นชื่อผู้แต่งหนังสือหลายประเภท รวมทั้งหนังสือทางการแพทย์
ฉันยังพบเนื้อหาที่ดูเหมือนเรียกใช้ธีมซ้ำจาก LLM ได้แก่ โพสต์เรื่องบน X (ฉบับเก็บที่นี่) งานเรื่องแต่ง (เก็บที่นี่) และเรื่องพร้อมเสียงบรรยายบน YouTube (เก็บที่นี่) ยังมีอีกมากแต่เวลาไม่พอสำรวจ
รสนิยมที่หวนหาอดีต
นั่นคือส่วนของการสังเกตโดยบังเอิญ แม้ยังไม่พบ “เอกสารมหัศจรรย์” ชิ้นเดียวในข้อมูลฝึกที่มีองค์ประกอบซ้ำทั้งหมดหรือส่วนใหญ่ แต่งานวิจัยใหม่ชื่อ “Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories” โดยนักวิจัย Cornell สองคน เสนอว่าตัวกรองลิขสิทธิ์ในการพัฒนา AI อาจจำกัดเรื่องแต่งของ LLM ให้อยู่กับเนื้อหาที่พ้นลิขสิทธิ์
ผู้เขียนระบุว่า:
“การที่เรื่อง ‘Elias ในประภาคาร’ ครองสัดส่วนสูง ไม่สามารถอธิบายด้วยความแพร่หลายในข้อมูลก่อนหรือหลังการฝึก เราคาดว่าโมเดลถูกฝึกระหว่างการจัดแนวให้หลีกเลี่ยงตัวละครมีลิขสิทธิ์และเนื้อหาสำหรับผู้ใหญ่ แต่ขอทิ้งคำถามนี้ไว้สำหรับงานในอนาคต”
| หมวดหมู่ | โทเคน | งานวิจัยนี้ | วรรณกรรม | ก่อนฝึก–สารคดี | ก่อนฝึก–เรื่องแต่ง | หลังฝึก–สารคดี | หลังฝึก–เรื่องแต่ง |
|---|---|---|---|---|---|---|---|
| ชื่อ | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| ชื่อ | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| ชื่อ | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| อาชีพ | keeper | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| อาชีพ | baker | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| อาชีพ | mayor | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| อาชีพ | clockmaker | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| อาชีพ | fisherman | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| อาชีพ | librarian | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| อาชีพ | conductor | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| สถานที่ | lighthouse | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
ตารางเปรียบเทียบความถี่ของคำซ้ำจากเรื่องที่ AI สร้างในวรรณกรรมตีพิมพ์ เรื่องแต่งบนเว็บ และข้อมูลหลังการฝึก โดยคำอย่าง Elias และ lighthouse พบในเรื่องของแชตบอตบ่อยกว่ามาก
คำเด่น 11 คำปรากฏใน 88% ของเรื่อง 20,000 เรื่อง และต่างกันน้อยระหว่างโมเดล ผู้เขียนเน้นว่าคำเหล่านี้หาได้ยากในวรรณกรรมอังกฤษตีพิมพ์ และข้อมูลหลังการฝึกที่ปรับเงื่อนไขและจัดแนวโมเดลสู่การใช้ที่ “ยอมรับได้” อาจเป็นสาเหตุ
งานวิจัยระบุว่า:
“ตัวอย่างทั่วไปด้านล่างแสดงองค์ประกอบสามอย่างที่พบร่วมกันในเกือบทุกเรื่อง 20,000 เรื่อง ได้แก่สถานที่ (19,864 เรื่อง) ชื่อตัวละคร (19,864) และอาชีพ (15,807)”
“สถานที่เฉพาะคือประภาคาร ชื่อ Elias และอาชีพ keeper ปรากฏร่วมกันในรูปแบบใดรูปแบบหนึ่งใน 66.6% ของเรื่องทั้งหมด แสงก็เป็นธีมร่วม: 56% ของเรื่องจาก Claude ใช้ชื่อ ‘The Lighthouse Keeper’s Secret’ และคำว่า light ปรากฏใน 16,784 เรื่อง เฉลี่ย 3.2 ครั้งต่อเรื่อง”

งานวิจัยระบุว่าตัวอย่างนี้เขียนโดย Google Gemini 3.1 Flash-Lite ตอบคำสั่ง “เขียนเรื่องหนึ่ง”
น่าสังเกตด้วยว่าผู้เขียนมองเห็นแนวโน้มเชิงหวนหาอดีตหรือย้อนกลับไปสู่รูปแบบเก่าในคำสำคัญและชื่อทั้งหมด
ตามหาร่องรอยของลักษณะซ้ำ
เพื่อทดสอบว่าเรื่องประภาคารซ้ำอธิบายได้ด้วยการสัมผัสเรื่องแต่งทั่วไปหรือไม่ จึงเปรียบเทียบคำโปรดของโมเดลกับคลังภาษาอังกฤษขนาดใหญ่หลายชุด เรื่องแต่งร่วมสมัยใช้ CONLIT ซึ่งมีนวนิยายอังกฤษ 2,700 เล่มจากปี 2007–2021 ครอบคลุม 12 ประเภท รวมประมาณ 287 ล้านคำ
Elias ปรากฏในเรื่องที่สร้างมากกว่าเรื่องแต่งตีพิมพ์ราว 900 เท่า เรื่องสมัครเล่นจากชุมชน Reddit /r/writingprompts มีความถี่ใกล้กับงานตีพิมพ์ แสดงว่ารูปแบบนี้ไม่ได้สะท้อนนิสัยการเล่าเรื่องของมนุษย์ทั่วไป
ข้อมูลก่อนฝึกก็ให้รูปแบบเดียวกัน ในคลัง OLMo 3 แบบเปิดซึ่งมีเอกสารส่วนใหญ่เขียนโดยมนุษย์ราว 3.89 พันล้านฉบับ บางส่วนจาก Common Crawl แทบไม่พบคำ “Core” ซ้ำเหล่านี้
เพราะ OLMo 3 ส่วนใหญ่เป็นสารคดี จึงสร้างตัวจำแนกเรื่องแต่งด้วยคำกำกับจาก GPT-OSS 20b และโมเดล FastText ที่ฝึกด้วยตัวอย่างสมดุล 200,000 รายการ แม้กรองเฉพาะเรื่องแต่ง คำอย่าง Elara ยังมีอัตราน้อยมากเมื่อเทียบกับเรื่องที่ AI สร้าง แล้วเหตุใดจึงครองการตอบคำสั่งเขียนเรื่องระดับพื้นฐานที่สุด?
ผู้เขียนกล่าวว่า:
“หากคำ Core ไม่แพร่หลายในข้อมูลเว็บ แหล่งที่เหลือคือข้อมูลหลังการฝึก แต่เราพบว่าข้อมูลหลังการฝึกของ OLMo มีโทเคนเหล่านี้ในอัตราต่ำกว่า CONLIT”
ในเรื่อง 78,958 เรื่องจากข้อมูลหลังการฝึก OLMo 3 ชื่อ Elias พบ 52.7 ครั้งต่อหนึ่งล้านคำ เทียบกับ 2.7 ใน CONLIT แต่สูงถึง 2,428 ครั้งในเรื่องที่สร้างซึ่งงานวิจัยตรวจสอบ
เพื่อหาต้นทางของเรื่อง “Core” ซ้ำ แต่ละเรื่องในข้อมูลหลังการฝึก OLMo 3 ถูกให้คะแนนตามการมีโทเคนอย่าง Elara หรือ Mara อย่างน้อยหนึ่งคำ คาดว่าส่วนใหญ่จะอยู่ในข้อมูลปรับละเอียดแบบมีผู้สอน เพราะ WildChat และแหล่งเกี่ยวข้องส่งเรื่อง 59,266 เรื่องเข้า OLMo 3
แต่มีเพียง 1,803 เรื่องที่มีคำ Core ขณะที่ชุดข้อมูลสำหรับ DPO และการเรียนรู้แบบเสริมกำลังมีความเข้มข้นสูงกว่า
โดยรวมติดตามคำ Core ซ้ำได้เพียง 3,053 เรื่อง หรือ 3.8% ของเรื่องหลังการฝึกทั้งหมดที่ตรวจสอบ ส่วนย่อยเล็กเช่นนี้ไม่มีความเป็นไปได้ทางสถิติที่จะครองผลลัพธ์ในระดับที่พบ
งานวิจัยสรุปว่า:
“เมื่อได้รับทิศทางน้อย โมเดลแนวหน้าปัจจุบันเขียนเรื่องโดยใช้รายชื่อ ชื่อสถานที่ และอาชีพที่แคบ ตัวละครซ้ำรวมถึง Elias ผู้ดูแลประภาคาร ซึ่งเป็นชื่อที่ผิดปกติและไม่แพร่หลายในวรรณกรรม ข้อมูลเว็บ หรือแม้แต่ข้อมูลหลังการฝึก”
บทสรุป
เมื่อไม่มีงานวรรณกรรมหรือชุดใดชิ้นเดียวที่มีคำ 11 อันดับแรกทั้งหมดหรือส่วนใหญ่ ก็ไม่ชัดเจนว่าคำกลุ่มนี้สะสมและเชื่อมโยงกันในระดับล่างสุดของ LLM หลายรุ่นที่มีข้อมูลและวิธีฝึกต่างกันได้อย่างไร
แม้ข้อเสนอว่าตัวกรองลิขสิทธิ์จำกัดผลลัพธ์จะถูกต้อง มหาสมุทรของวรรณกรรมคลาสสิกในข้อมูลฝึกก็ควรป้องกันไม่ให้คำเก่าแปลก ๆ กลุ่มนี้ครองคำสั่ง “เขียน” ที่ไม่ระบุเงื่อนไข
แต่ทฤษฎีนี้ตั้งอยู่บนสมมติฐานว่าวรรณกรรมคลาสสิกจำนวนมากถูกรวมในการฝึก ซึ่งไม่น่าเป็นไปได้ เพราะเป้าหมายไม่ใช่โมเดลที่ผลิตงานเลียนแบบ Dickens แต่คือโมเดลที่ใช้ศัพท์ร่วมสมัยและตอบโจทย์ธุรกิจปัจจุบัน ปริมาณวรรณกรรมก่อนยุคอุตสาหกรรมเพียงอย่างเดียวก็มหาศาล
หากมีเรื่องใดเรื่องหนึ่งที่รวมลักษณะ “หมกมุ่น” เหล่านี้สลับกัน ก็น่าจะหาได้ง่ายกว่า ผู้เขียนเองยังไม่พบ และการค้นยุคก่อน AI ก็ไม่มีผู้สมัคร หาก “กลุ่มอาการประภาคาร” โด่งดังเท่าขีด em ของ AI อาจมีนักวิชาการออกมาให้คำตอบ
* ฉันไม่สามารถลงรายละเอียดบทความของ May ไปกว่านี้ ด้วยเหตุผลที่อาจชัดเจนเมื่ออ่านบทความนั้น
เผยแพร่ครั้งแรกวันพุธที่ 27 พฤษภาคม 2026 แก้ไขภายใน 30 นาทีแรกเพื่อซ่อมลิงก์ Anthropic












