มุมมองของ Anderson
โมเดลการเขียนสร้างสรรค์แบบอาศัย AI มัก ‘คัดลอกและวาง’ ข้อมูลแหล่งที่มา

นักเขียนบทและนักธุรกิจชาวอเมริกัน วิลสัน มิซเนอร์ มักถูกอ้างถึงว่า曾 กล่าวว่า ‘เมื่อคุณขโมยจากผู้เขียนคนหนึ่ง มันคือการลอกเลียนแบบ แต่ถ้าคุณขโมยจากหลายคน มันคือการวิจัย’
ในทำนองเดียวกัน ความคิดเห็นรอบๆ รุ่นใหม่ของระบบการเขียนสร้างสรรค์แบบอาศัย AI คือว่าปริมาณข้อมูลที่ถูกป้อนเข้าไปในระหว่างการฝึกอบรมมีผลให้เกิดการสรุปแนวคิดและความคิดที่สูงขึ้นจริงๆ; ว่าระบบเหล่านี้มีภูมิปัญญาที่กลั่นกรองมาจากนักเขียนหลายพันคน ซึ่ง AI สามารถสร้างสรรค์ผลงานที่ใหม่และเป็นเอกลักษณ์ได้; และผู้ที่ใช้ระบบเหล่านี้สามารถมั่นใจได้ว่าพวกเขาไม่ได้ทำการลอกเลียนแบบโดยไม่ตั้งใจ
สมมติฐานนี้ถูกท้าทายโดยงานวิจัยใหม่จากกลุ่มวิจัย (รวมถึง Facebook และ Microsoft’s AI research divisions) ซึ่งพบว่าโมเดลภาษาแบบสร้างสรรค์ที่ใช้การเรียนรู้ของเครื่อง เช่น ซีรีส์ GPT ‘บางครั้งจะคัดลอกแม้กระทั่งประโยคที่ยาวมาก’ ลงในผลลัพธ์ที่ถูกกล่าวถึงว่าเป็น “เดิม” โดยไม่มีการอ้างอิง
ในบางกรณี ผู้เขียนบันทึกว่า GPT-2 จะคัดลอกข้อความมากกว่า 1,000 คำจากชุดข้อมูลฝึกอบรมไปในผลลัพธ์ของมัน
งานวิจัย มีชื่อเรื่องว่า ภาษาโมเดลคัดลอกจากข้อมูลฝึกอบรม多少? การประเมินความใหม่ทางภาษาในการสร้างข้อความโดยใช้ RAVEN และเป็นการร่วมมือระหว่าง Johns Hopkins University, Microsoft Research, New York University และ Facebook AI Research
RAVEN
การศึกษานี้ใช้วิธีการใหม่ที่เรียกว่า RAVEN (RAtingVErbalNovelty) ซึ่งเป็นตัวย่อที่ถูกสร้างขึ้นเพื่อสะท้อนถึงตัวอักษรที่มีชื่อเสียงในบทกวี:
‘ตัวย่อ nàyหมายถึง “The Raven” โดย Edgar Allan Poe ซึ่งผู้บรรยายพบกับนกกาปริศนา ซึ่งร้องออกมา “Nevermore!” ผู้บรรยายไม่สามารถบอกได้ว่านกกาเพียงแต่ร้องซ้ำสิ่งที่ได้ยินจากมนุษย์ หรือว่ามันกำลังสร้างคำพูดของมันเอง (อาจโดยการรวม never และ more)—ความไม่แน่นอนที่เหมือนกันที่งานวิจัยของเราต้องเผชิญ’
ผลการวิจัยจากงานวิจัยใหม่นี้มาในบริบทของการเติบโตที่สำคัญของระบบการเขียนเนื้อหาที่ใช้ AI ที่พยายามที่จะเข้ามาแทนที่ ‘งานแก้ไขที่ง่าย’ และแม้กระทั่งการเขียนเนื้อหาที่สมบูรณ์ ระบบหนึ่ง ได้รับเงิน 21 ล้านเหรียญ ในการระดมทุน Series A เมื่อต้นสัปดาห์นี้
นักวิจัยสังเกตว่า ‘GPT-2 บางครั้งจะคัดลอกข้อความจากชุดข้อมูลฝึกอบรมที่ยาวกว่า 1,000 คำ’ (การเน้นของพวกเขา) และระบบภาษาแบบสร้างสรรค์จะแพร่กระจายข้อผิดพลาดทางภาษาในข้อมูลแหล่งที่มา
โมเดลภาษาที่ถูกศึกษาโดยใช้ RAVEN คือ ซีรีส์ GPT รุ่นถึง GPT-2 (ผู้เขียนไม่มีการเข้าถึง GPT-3 ในขณะนั้น) Transformer, Transformer-XL และ LSTM
ความใหม่
งานวิจัยระบุว่า GPT-2 สร้างคำใหม่ เช่น ‘Swissified’ และการเปลี่ยนแปลง เช่น ‘IKEA-ness’ โดยการสร้างคำใหม่เหล่านี้ (ไม่ปรากฏในชุดข้อมูลฝึกอบรมของ GPT-2) ตามหลักการทางภาษาที่ได้รับจากพื้นที่มิติสูงระหว่างการฝึกอบรม
ผลการวิจัยยังแสดงให้เห็นว่า ‘74% ของประโยคที่สร้างโดย Transformer-XL มีโครงสร้างทางไวยากรณ์ที่ไม่มีในประโยคใดๆ ในชุดข้อมูลฝึกอบรม’ ซึ่งบ่งชี้ตามที่ผู้เขียนระบุ ‘โมเดลภาษาแบบสร้างสรรค์ไม่เพียงแต่จดจำข้อมูลเท่านั้น แต่ยังใช้กระบวนการผลิตที่ช่วยให้สามารถรวมส่วนต่างๆ ที่คุ้นเคยเข้าด้วยกันในลักษณะใหม่ๆ ‘
ดังนั้น การสรุปและสร้างสรรค์ ควร ผลิตเนื้อหาที่สร้างสรรค์และใหม่ๆ
การคัดลอกข้อมูลอาจเป็นปัญหา
งานวิจัยเสนอว่าการอ้างอิงยาวและไม่มีการเปลี่ยนแปลงที่ผลิตโดยระบบ NLG อาจถูก ‘อบ’ เข้าไปในโมเดล AI เนื่องจากข้อความแหล่งที่มาถูกซ้ำหลายครั้งในชุดข้อมูลที่ไม่ได้รับการดีดน้ำ
แม้ว่า งานวิจัยอื่น พบว่าการคัดลอกข้อความที่สมบูรณ์สามารถเกิดขึ้นได้แม้กระทั่งหากข้อความแหล่งที่มาปรากฏเพียงครั้งเดียวในชุดข้อมูล แต่นักวิจัยสังเกตว่างานวิจัยนั้นมีโครงสร้างแนวคิดที่แตกต่างจากระบบการสร้างเนื้อหาที่ใช้ AI ทั่วไป
นักวิจัยยังพบว่าการเปลี่ยนแปลงส่วนการถอดรหัสในระบบการสร้างภาษาเพิ่มความใหม่ แต่พบว่าการเปลี่ยนแปลงนี้เกิดขึ้นที่ราคาของคุณภาพของผลลัพธ์
ปัญหาเพิ่มเติมเกิดขึ้นเมื่อชุดข้อมูลที่ใช้ในการสร้างเนื้อหาที่ใช้ AI มีขนาดใหญ่ขึ้นเรื่อยๆ นอกเหนือจากปัญหาเรื่องต้นทุนและความเป็นไปได้ในการประมวลผลข้อมูลก่อนการฝึกอบรม ตลอดจนการรับรองคุณภาพและดีดน้ำของข้อมูล ข้อผิดพลาดพื้นฐานหลายข้อยังคงอยู่ ในข้อมูลแหล่งที่มา ซึ่งจะถูกแพร่กระจายไปสู่ผลลัพธ์ของ AI
นักวิจัยสังเกตว่า*:
‘การเพิ่มขึ้นของขนาดชุดข้อมูลฝึกอบรมทำให้จำเป็นต้องตรวจสอบความใหม่ เนื่องจากขนาดของชุดข้อมูลเหล่านี้สามารถทำลายความคิดเห็นของเราเกี่ยวกับสิ่งที่คาดหวังว่าจะเกิดขึ้นตามธรรมชาติ ตัวอย่างเช่น งานวิจัยที่มีชื่อเสียงใน ภาษา การได้รับภาษา อาศัยสมมติฐานที่ว่ารูปกริยาในอดีตที่ไม่ปกติของคำกริยาที่ไม่ปกติ (เช่น becomed, teached) ไม่ปรากฏในประสบการณ์ของผู้เรียน ดังนั้นหากผู้เรียนสร้างคำเหล่านี้ พวกเขาจะต้องเป็นคำใหม่สำหรับผู้เรียน
‘อย่างไรก็ตาม มันปรากฏว่าสำหรับ 92 คำกริยาที่ไม่ปกติในภาษาอังกฤษ รูปกริยาที่ไม่ถูกต้องปรากฏในชุดข้อมูลฝึกอบรมของ GPT-2’
การดูแลข้อมูลมากขึ้น
งานวิจัยยืนยันว่าควรให้ความสนใจกับความใหม่ในการสร้างระบบภาษาแบบสร้างสรรค์ โดยเฉพาะอย่างยิ่งในการรับรองว่าส่วน ‘ถูกถอดออก’ ของข้อมูล (ส่วนของข้อมูลแหล่งที่มาซึ่งถูกแบ่งออกเพื่อทดสอบว่าโมเดลสุดท้ายประเมินข้อมูลหลักได้ดีเพียงใด) เหมาะสมกับงาน
‘ในการเรียนรู้ของเครื่อง มันสำคัญที่จะประเมินโมเดลบนชุดข้อมูลทดสอบที่ถูกถอดออก เนื่องจากธรรมชาติแบบเปิดของการสร้างภาษา เนื้อข้อความที่สร้างโดยโมเดลอาจถูกคัดลอกจากชุดข้อมูลฝึกอบรม ในกรณีนี้ การใช้ข้อมูลนั้นในการประเมินโมเดล (เช่น สำหรับการสอดคล้องหรือความถูกต้องทางไวยากรณ์) ไม่ถูกต้อง’
นักวิจัยยังยืนยันว่าควรให้ความสนใจมากขึ้นในการผลิตโมเดลภาษาเนื่องจาก ผล Eliza ซึ่งเป็นอาการที่ถูกตั้งชื่อในปี 1966 ซึ่งระบุ “ความเสี่ยงของมนุษย์ที่จะอ่านความเข้าใจมากกว่าที่ควรในตัวอักษร—โดยเฉพาะคำ—ที่เชื่อมต่อกันโดยคอมพิวเตอร์”
* การแปลงอ้างอิงภายในให้เป็นลิงก์












