มุมมองของ Anderson

ทำไม AI ถึงรักการเขียนเรื่องราวเกี่ยวกับคนดูแลหอไฟ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

เมื่อถูกขอให้ “เขียนเรื่องหนึ่ง” ChatGPT และโมเดลภาษาชั้นนำอื่น ๆ ดูเหมือนพยายามหลีกเลี่ยงการละเมิดลิขสิทธิ์ด้วยการหวนกลับไปใช้ตัวละครแปลก ๆ กลุ่มเล็กเดิมซ้ำแล้วซ้ำเล่า เช่น ผู้ดูแลประภาคาร ชาวประมง และช่างทำนาฬิกา

 

งานวิจัยใหม่จากมหาวิทยาลัย Cornell พบว่า เมื่อได้รับเพียงคำสั่ง “เขียนเรื่องหนึ่ง” โมเดลภาษาชั้นนำกลับหมกมุ่นกับองค์ประกอบการเล่าเรื่องที่แคบมาก จากเรื่อง 20,000 เรื่องที่สร้างโดย LLM สี่รุ่น 88% มีอย่างน้อยหนึ่งใน 11 โทเคนเฉพาะจากหมวดสถานที่ ชื่อ และอาชีพ

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers' analysis of 20,000 LLM-generated stories. Source - https://arxiv.org/pdf/2605.26492

จำนวนครั้งต่อหนึ่งล้านคำของคำสำคัญที่ไม่น่าจะพบ ซึ่งได้จากการวิเคราะห์เรื่องที่ LLM สร้าง 20,000 เรื่อง แหล่งที่มา

คำ 11 คำที่เกิดซ้ำบ่อยที่สุดในข้อความกว่า 12 ล้านคำ ได้แก่ชื่อ elias, mara, elara; อาชีพ keeper, baker, mayor, clockmaker, fisherman, librarian, conductor; และสถานที่ lighthouse

โมเดลที่ทดสอบคือ Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini และ OLMo 7b Thinking แต่ละรุ่นได้รับหนึ่งในห้าคำขอ ได้แก่ “เขียนเรื่องหนึ่ง” “โปรดเขียนเรื่องหนึ่ง” “เขียนเรื่องให้ฉัน” “เล่าเรื่องให้ฉันฟัง” หรือ “โปรดเล่าเรื่องหนึ่ง”

เพื่อดูว่าปรากฏการณ์ในงานวิจัยมีอยู่ในโมเดลขณะเขียนหรือไม่ ฉันทดลองกับบัญชี ChatGPT ระดับกลางที่ใช้ประจำก่อน (บทสนทนาอยู่ที่นี่) ไม่ต้องเลือกเฉพาะผลที่เข้าทาง เพราะ ChatGPT-5.5 เลือกเนื้อหาตามที่นักวิจัยคาดไว้ตั้งแต่ครั้งแรก

ChatGPT-5.5 immediately backs up the paper's initial findings. Source - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 สนับสนุนข้อค้นพบเบื้องต้นของงานวิจัยทันที แหล่งที่มา

เพื่อแยกผลจากประวัติการใช้หรือการรั่วไหลข้ามบริบท ฉันเข้าสู่บัญชี ChatGPT ฟรีที่ไม่ได้ใช้มานานกว่าหนึ่งปีผ่านหน้าต่างส่วนตัวของ Firefox แล้วลองอีกครั้ง (บทสนทนาที่นี่) หาก OpenAI ไม่ใช้ IP เดียวกันเชื่อมข้อมูลข้ามบัญชี ChatGPT ก็ยังตอบตรงเป้าอีกครั้ง

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. Source - https://chatgpt.com/share/6a16b210-d450-83ea-936e-78c6062ca74d

บัญชี ChatGPT ที่สองยังยึดติดกับชื่อและธีมชุดเล็กแบบเดียวกับงานวิจัยใหม่ โดย “Mira” อยู่ใน 20 อันดับแรกของผู้เขียน แหล่งที่มา

ควรสังเกตว่า GPT เหล่านี้ใหม่กว่ารุ่น 5.4 ที่ทดสอบในงานวิจัยหนึ่งระดับ

แม้งานวิจัยทดสอบ Claude Haiku ฉันลอง Sonnet 4.6 ซึ่งเป็นค่าเริ่มต้นของ Anthropic และก็ไม่ผิดหวัง คำสำคัญคุ้นเคยปรากฏตั้งแต่ครั้งแรกอีกครั้ง (บทสนทนาที่นี่)

This time 'Mara', another stalwart from the 'top 11', leads the story, in the first attempt on Claude Sonnet 4.6. Source - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

ครั้งนี้ “Mara” หนึ่งในคำหลัก 11 อันดับแรก นำเรื่องตั้งแต่การลองครั้งแรกกับ Claude Sonnet 4.6 แหล่งที่มา

การใช้คำสั่งเดียวกันกับ Claude Haiku 4.5 ให้ผลแทบเหมือนกัน

ตอนแรกฉันทำซ้ำข้อค้นพบใน Google Gemini ไม่ได้ จนเลือก Gemini 3.1 Flash-Lite ตามงานวิจัยโดยเฉพาะ แล้วรูปแบบก็ปรากฏทันทีในการลองรวมครั้งที่สาม แต่เป็นครั้งแรกกับโมเดลนี้ (ลิงก์ที่นี่)

Google Gemini 3.1 Flash-Lite. Source - https://gemini.google.com/share/82c245884ec1

Google Gemini 3.1 Flash-Lite แหล่งที่มา

การทดลองเพิ่มเติมกับ Gemini รุ่นอื่นให้ธีมประภาคารทุกครั้ง แม้มีชื่อที่ไม่อยู่ใน 11 อันดับแรก เช่น Thomas หรือในอีกแบบหนึ่งใช้ชื่อของฉันเองเป็นตัวเอก

อย่างไรก็ตาม ณ เวลาที่เขียน ข้อค้นพบของงานวิจัยพิสูจน์ซ้ำได้ง่ายมาก

ประภาคารในโลกจริง

ความคิดที่ดีมักมาบรรจบกัน หนึ่งสัปดาห์ก่อนงานวิจัยใหม่เผยแพร่ Daniel May นักเขียนซอฟต์แวร์ชี้ให้เห็นความบังเอิญของธีม Elias กับผู้ดูแลประภาคารที่นักวิจัยสกัดได้* เขาทดสอบ Gemini, DeepSeek, Qwen และ Gemma แปดรุ่น ซึ่งสร้างมีมประภาคารและตัวเอก Elias Thorne* แต่ข้อสังเกตนี้ยังไม่ครอบคลุมธีมถาวรที่กว้างกว่าจากงานวิจัยใหม่

เพื่อดูว่าธีม ชื่อ และสถานที่ซ้ำเหล่านี้หลุดออกจากแชตหรือไม่ ฉันค้นคำและธีมอันดับต้น ๆ บน Google และพบโพสต์จำนวนมากอย่างน่าประหลาดที่ดูเหมือนใช้สิ่งเหล่านี้

Three examples of the meme in output. See below for source links.

ตัวอย่างมีมสามรายการในผลลัพธ์ ดูลิงก์แหล่งที่มาด้านล่าง

May ระบุชื่อเต็ม Elias Thorne ไม่ใช่แค่ Elias ว่าเป็นมีม LLM ที่เกิดซ้ำ และโพสต์ภาพจาก Amazon ซึ่งชื่อนี้ถูกใช้เป็นชื่อผู้แต่งหนังสือหลายประเภท รวมทั้งหนังสือทางการแพทย์

ฉันยังพบเนื้อหาที่ดูเหมือนเรียกใช้ธีมซ้ำจาก LLM ได้แก่ โพสต์เรื่องบน X (ฉบับเก็บที่นี่) งานเรื่องแต่ง (เก็บที่นี่) และเรื่องพร้อมเสียงบรรยายบน YouTube (เก็บที่นี่) ยังมีอีกมากแต่เวลาไม่พอสำรวจ

รสนิยมที่หวนหาอดีต

นั่นคือส่วนของการสังเกตโดยบังเอิญ แม้ยังไม่พบ “เอกสารมหัศจรรย์” ชิ้นเดียวในข้อมูลฝึกที่มีองค์ประกอบซ้ำทั้งหมดหรือส่วนใหญ่ แต่งานวิจัยใหม่ชื่อ “Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories” โดยนักวิจัย Cornell สองคน เสนอว่าตัวกรองลิขสิทธิ์ในการพัฒนา AI อาจจำกัดเรื่องแต่งของ LLM ให้อยู่กับเนื้อหาที่พ้นลิขสิทธิ์

ผู้เขียนระบุว่า:

“การที่เรื่อง ‘Elias ในประภาคาร’ ครองสัดส่วนสูง ไม่สามารถอธิบายด้วยความแพร่หลายในข้อมูลก่อนหรือหลังการฝึก เราคาดว่าโมเดลถูกฝึกระหว่างการจัดแนวให้หลีกเลี่ยงตัวละครมีลิขสิทธิ์และเนื้อหาสำหรับผู้ใหญ่ แต่ขอทิ้งคำถามนี้ไว้สำหรับงานในอนาคต”

หมวดหมู่ โทเคน งานวิจัยนี้ วรรณกรรม ก่อนฝึก–สารคดี ก่อนฝึก–เรื่องแต่ง หลังฝึก–สารคดี หลังฝึก–เรื่องแต่ง
ชื่อ elias 2,428 2.7 2.2 4.0 0.4 52.7
ชื่อ mara 5,200 3.9 2.5 8.7 0.4 21.7
ชื่อ elara 1,221 0.0 0.4 1.2 0.9 108
อาชีพ keeper 1,495 7.2 6.3 14.7 3.5 10.0
อาชีพ baker 161 20 11.8 10.56 1.7 11.9
อาชีพ mayor 198 28 11.5 16.1 1.4 27.4
อาชีพ clockmaker 108 0.1 0.18 0.0 0.3 1.4
อาชีพ fisherman 62 4.2 3.0 7.6 0.0 9.3
อาชีพ librarian 68 5.3 7.6 5.9 2.3 11.5
อาชีพ conductor 96 5.0 5.9 5.7 4.7 7.5
สถานที่ lighthouse 3,005 5.5 3.5 4.6 4.6 10.1

ตารางเปรียบเทียบความถี่ของคำซ้ำจากเรื่องที่ AI สร้างในวรรณกรรมตีพิมพ์ เรื่องแต่งบนเว็บ และข้อมูลหลังการฝึก โดยคำอย่าง Elias และ lighthouse พบในเรื่องของแชตบอตบ่อยกว่ามาก

คำเด่น 11 คำปรากฏใน 88% ของเรื่อง 20,000 เรื่อง และต่างกันน้อยระหว่างโมเดล ผู้เขียนเน้นว่าคำเหล่านี้หาได้ยากในวรรณกรรมอังกฤษตีพิมพ์ และข้อมูลหลังการฝึกที่ปรับเงื่อนไขและจัดแนวโมเดลสู่การใช้ที่ “ยอมรับได้” อาจเป็นสาเหตุ

งานวิจัยระบุว่า:

“ตัวอย่างทั่วไปด้านล่างแสดงองค์ประกอบสามอย่างที่พบร่วมกันในเกือบทุกเรื่อง 20,000 เรื่อง ได้แก่สถานที่ (19,864 เรื่อง) ชื่อตัวละคร (19,864) และอาชีพ (15,807)”

“สถานที่เฉพาะคือประภาคาร ชื่อ Elias และอาชีพ keeper ปรากฏร่วมกันในรูปแบบใดรูปแบบหนึ่งใน 66.6% ของเรื่องทั้งหมด แสงก็เป็นธีมร่วม: 56% ของเรื่องจาก Claude ใช้ชื่อ ‘The Lighthouse Keeper’s Secret’ และคำว่า light ปรากฏใน 16,784 เรื่อง เฉลี่ย 3.2 ครั้งต่อเรื่อง”

This example, the paper states, was written by Google Gemini 3.1 Flash-Lite, in response to the prompt 'Write a story'.

งานวิจัยระบุว่าตัวอย่างนี้เขียนโดย Google Gemini 3.1 Flash-Lite ตอบคำสั่ง “เขียนเรื่องหนึ่ง”

น่าสังเกตด้วยว่าผู้เขียนมองเห็นแนวโน้มเชิงหวนหาอดีตหรือย้อนกลับไปสู่รูปแบบเก่าในคำสำคัญและชื่อทั้งหมด

ตามหาร่องรอยของลักษณะซ้ำ

เพื่อทดสอบว่าเรื่องประภาคารซ้ำอธิบายได้ด้วยการสัมผัสเรื่องแต่งทั่วไปหรือไม่ จึงเปรียบเทียบคำโปรดของโมเดลกับคลังภาษาอังกฤษขนาดใหญ่หลายชุด เรื่องแต่งร่วมสมัยใช้ CONLIT ซึ่งมีนวนิยายอังกฤษ 2,700 เล่มจากปี 2007–2021 ครอบคลุม 12 ประเภท รวมประมาณ 287 ล้านคำ

Elias ปรากฏในเรื่องที่สร้างมากกว่าเรื่องแต่งตีพิมพ์ราว 900 เท่า เรื่องสมัครเล่นจากชุมชน Reddit /r/writingprompts มีความถี่ใกล้กับงานตีพิมพ์ แสดงว่ารูปแบบนี้ไม่ได้สะท้อนนิสัยการเล่าเรื่องของมนุษย์ทั่วไป

ข้อมูลก่อนฝึกก็ให้รูปแบบเดียวกัน ในคลัง OLMo 3 แบบเปิดซึ่งมีเอกสารส่วนใหญ่เขียนโดยมนุษย์ราว 3.89 พันล้านฉบับ บางส่วนจาก Common Crawl แทบไม่พบคำ “Core” ซ้ำเหล่านี้

เพราะ OLMo 3 ส่วนใหญ่เป็นสารคดี จึงสร้างตัวจำแนกเรื่องแต่งด้วยคำกำกับจาก GPT-OSS 20b และโมเดล FastText ที่ฝึกด้วยตัวอย่างสมดุล 200,000 รายการ แม้กรองเฉพาะเรื่องแต่ง คำอย่าง Elara ยังมีอัตราน้อยมากเมื่อเทียบกับเรื่องที่ AI สร้าง แล้วเหตุใดจึงครองการตอบคำสั่งเขียนเรื่องระดับพื้นฐานที่สุด?

ผู้เขียนกล่าวว่า:

“หากคำ Core ไม่แพร่หลายในข้อมูลเว็บ แหล่งที่เหลือคือข้อมูลหลังการฝึก แต่เราพบว่าข้อมูลหลังการฝึกของ OLMo มีโทเคนเหล่านี้ในอัตราต่ำกว่า CONLIT”

ในเรื่อง 78,958 เรื่องจากข้อมูลหลังการฝึก OLMo 3 ชื่อ Elias พบ 52.7 ครั้งต่อหนึ่งล้านคำ เทียบกับ 2.7 ใน CONLIT แต่สูงถึง 2,428 ครั้งในเรื่องที่สร้างซึ่งงานวิจัยตรวจสอบ

เพื่อหาต้นทางของเรื่อง “Core” ซ้ำ แต่ละเรื่องในข้อมูลหลังการฝึก OLMo 3 ถูกให้คะแนนตามการมีโทเคนอย่าง Elara หรือ Mara อย่างน้อยหนึ่งคำ คาดว่าส่วนใหญ่จะอยู่ในข้อมูลปรับละเอียดแบบมีผู้สอน เพราะ WildChat และแหล่งเกี่ยวข้องส่งเรื่อง 59,266 เรื่องเข้า OLMo 3

แต่มีเพียง 1,803 เรื่องที่มีคำ Core ขณะที่ชุดข้อมูลสำหรับ DPO และการเรียนรู้แบบเสริมกำลังมีความเข้มข้นสูงกว่า

โดยรวมติดตามคำ Core ซ้ำได้เพียง 3,053 เรื่อง หรือ 3.8% ของเรื่องหลังการฝึกทั้งหมดที่ตรวจสอบ ส่วนย่อยเล็กเช่นนี้ไม่มีความเป็นไปได้ทางสถิติที่จะครองผลลัพธ์ในระดับที่พบ

งานวิจัยสรุปว่า:

“เมื่อได้รับทิศทางน้อย โมเดลแนวหน้าปัจจุบันเขียนเรื่องโดยใช้รายชื่อ ชื่อสถานที่ และอาชีพที่แคบ ตัวละครซ้ำรวมถึง Elias ผู้ดูแลประภาคาร ซึ่งเป็นชื่อที่ผิดปกติและไม่แพร่หลายในวรรณกรรม ข้อมูลเว็บ หรือแม้แต่ข้อมูลหลังการฝึก”

บทสรุป

เมื่อไม่มีงานวรรณกรรมหรือชุดใดชิ้นเดียวที่มีคำ 11 อันดับแรกทั้งหมดหรือส่วนใหญ่ ก็ไม่ชัดเจนว่าคำกลุ่มนี้สะสมและเชื่อมโยงกันในระดับล่างสุดของ LLM หลายรุ่นที่มีข้อมูลและวิธีฝึกต่างกันได้อย่างไร

แม้ข้อเสนอว่าตัวกรองลิขสิทธิ์จำกัดผลลัพธ์จะถูกต้อง มหาสมุทรของวรรณกรรมคลาสสิกในข้อมูลฝึกก็ควรป้องกันไม่ให้คำเก่าแปลก ๆ กลุ่มนี้ครองคำสั่ง “เขียน” ที่ไม่ระบุเงื่อนไข

แต่ทฤษฎีนี้ตั้งอยู่บนสมมติฐานว่าวรรณกรรมคลาสสิกจำนวนมากถูกรวมในการฝึก ซึ่งไม่น่าเป็นไปได้ เพราะเป้าหมายไม่ใช่โมเดลที่ผลิตงานเลียนแบบ Dickens แต่คือโมเดลที่ใช้ศัพท์ร่วมสมัยและตอบโจทย์ธุรกิจปัจจุบัน ปริมาณวรรณกรรมก่อนยุคอุตสาหกรรมเพียงอย่างเดียวก็มหาศาล

หากมีเรื่องใดเรื่องหนึ่งที่รวมลักษณะ “หมกมุ่น” เหล่านี้สลับกัน ก็น่าจะหาได้ง่ายกว่า ผู้เขียนเองยังไม่พบ และการค้นยุคก่อน AI ก็ไม่มีผู้สมัคร หาก “กลุ่มอาการประภาคาร” โด่งดังเท่าขีด em ของ AI อาจมีนักวิชาการออกมาให้คำตอบ

 

* ฉันไม่สามารถลงรายละเอียดบทความของ May ไปกว่านี้ ด้วยเหตุผลที่อาจชัดเจนเมื่ออ่านบทความนั้น

เผยแพร่ครั้งแรกวันพุธที่ 27 พฤษภาคม 2026 แก้ไขภายใน 30 นาทีแรกเพื่อซ่อมลิงก์ Anthropic

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai