มุมมองของ Anderson
อันตรายของการใช้คำพูดเพื่อยืนยันเนื้อหาของ NLG

ความคิดเห็น โมเดลการสร้างภาษาธรรมชาติ (Natural Language Generation) เช่น GPT-3 มีแนวโน้มที่จะ “หลอกลวง” ข้อมูลที่นำเสนอในบริบทของข้อมูลจริง ในยุคที่มีความกังวลเกี่ยวกับการเติบโตของข่าวปลอมแบบข้อความเหล่านี้เป็นอุปสรรคที่สำคัญสำหรับการพัฒนาระบบการเขียนและสรุปอัตโนมัติ และสำหรับอนาคตของ การเขียนข่าวโดยใช้ AI รวมถึงสาขาอื่นๆ ของการประมวลผลภาษาธรรมชาติ (NLP)
ปัญหาที่สำคัญคือโมเดลภาษา GPT-รุ่นได้รับข้อมูลสำคัญและชั้นเรียนจาก คอร์ปัสการฝึกที่มีขนาดใหญ่มาก และเรียนรู้ที่จะใช้ข้อมูลเหล่านี้เป็นบล็อกการสร้างภาษาที่มีความสามารถและความจริง โดยไม่คำนึงถึงความถูกต้องหรือความยอมรับของเนื้อหาที่สร้างขึ้น
ข่าวเก่าและข้อเท็จจริงปลอม
โมเดลการสร้างภาษาธรรมชาติ (NLG) สามารถสร้างเนื้อหาที่น่าเชื่อถือและเป็นไปได้เพราะพวกมันได้เรียนรู้โครงสร้างทางภาษา มากกว่าการเรียนรู้ประวัติศาสตร์ วิทยาศาสตร์ เศรษฐศาสตร์ หรือหัวข้ออื่นๆ ที่พวกมันต้องแสดงความคิดเห็น ซึ่งถูกผสมผสานเข้ากับข้อมูลต้นฉบับ
ความถูกต้องของข้อมูลที่โมเดล NLG สร้างขึ้นสมมติว่าข้อมูลที่ใช้ในการฝึกอบรมมีความน่าเชื่อถือและเป็นปัจจุบัน ซึ่งเป็นภาระที่ยิ่งใหญ่ในด้านการประมวลผลและการตรวจสอบข้อมูลของมนุษย์ – อุปสรรคที่มีค่าใช้จ่ายที่ NLP ต้องเผชิญอยู่
ระบบ GPT-3 มีขนาดใหญ่และต้องใช้เวลาและเงินมากในการฝึกอบรม และหลังจากที่ฝึกอบรมแล้ว ก็ยากที่จะอัปเดตที่ระดับ “เคอร์เนล” แม้ว่าการเปลี่ยนแปลงแบบเซสชันและแบบผู้ใช้จะสามารถเพิ่มความสามารถและความถูกต้องของโมเดลที่ใช้งานได้ แต่ประโยชน์เหล่านี้ยากที่จะส่งต่อไปยังโมเดลหลักโดยไม่ต้องฝึกอบรมใหม่หรือบางส่วน
ดังนั้น จึงยากที่จะสร้างโมเดลภาษาที่สามารถใช้ข้อมูลล่าสุดได้

โมเดลที่ฝึกอบรมก่อนการเกิดโควิด-19 และการรุกรานยูเครนในปี 2022 – text-davinci-002 ซึ่งเป็นรุ่นที่มีความสามารถมากที่สุดของ GPT-3 ตามที่ OpenAI พิจารณา – สามารถประมวลผล 4000 โทเค็นต่อคำขอ แต่ไม่มีข้อมูลเกี่ยวกับโควิด-19 หรือการรุกรานยูเครน (คำขอและคำตอบเหล่านี้มาจากวันที่ 5 เมษายน 2022) น่าสนใจที่ “ไม่ทราบ” เป็นคำตอบที่ยอมรับได้ในทั้งสองกรณี แต่คำขอเพิ่มเติมสามารถแสดงได้ว่า GPT-3 ไม่มีข้อมูลเกี่ยวกับเหตุการณ์เหล่านี้ Source: https://beta.openai.com/playground
โมเดลที่ฝึกอบรมแล้วสามารถเข้าถึง “ความจริง” ได้เพียงเท่าที่พวกมันจัดเก็บไว้ระหว่างการฝึกอบรม และยากที่จะรับคำพูดที่ถูกต้องและเกี่ยวข้องโดยอัตโนมัติเมื่อพยายามยืนยันคำกล่าวของพวกมัน

ด้านบน三个คำพูดที่ถูกต้องที่ได้รับจาก GPT-3 ในปี 2021 ตรงกลาง GPT-3 ล้มเหลวในการอ้างถึงคำพูดที่มีชื่อเสียงของ Einstein ("พระเจ้าไม่เล่นลูกเต๋ากับจักรวาล") แม้จะได้รับคำขอที่ชัดเจน ล่าง GPT-3 ระบุคำพูดที่ไม่เหมาะสมและไม่มีอยู่จริงให้กับ Albert Einstein ซึ่งดูเหมือนจะส่งต่อจากคำถามก่อนหน้าเกี่ยวกับ Winston Churchill ในเซสชันเดียวกัน Source: https://www.width.ai/post/business-applications-for-gpt-3
GopherCite
เพื่อแก้ไขปัญหานี้โดยทั่วไป โมเดล GopherCite ของ Google’s DeepMind ได้ถูกเสนอเป็น โมเดล 280 ล้านพารามิเตอร์ที่สามารถอ้างอิงหลักฐานที่ถูกต้องและแม่นยำเพื่อสนับสนุนคำตอบที่สร้างขึ้น



ตัวอย่างสามตัวอย่างของ GopherCite ที่สนับสนุนคำกล่าวของมันด้วยคำพูดที่แท้จริง Source: https://arxiv.org/pdf/2203.11147.pdf
GopherCite ใช้การเรียนรู้แบบเสริมจากความชอบของมนุษย์ (RLHP) เพื่อฝึกโมเดลคำถามที่สามารถอ้างอิงคำพูดที่แท้จริงเป็นหลักฐานสนับสนุน คำพูดเหล่านี้ถูกดึงมาจากแหล่งข้อมูลเอกสารหลายแห่งที่ได้รับจากเครื่องมือค้นหา หรือจากเอกสารที่ผู้ใช้ให้มา
การอ้างอิงความเท็จ
อย่างไรก็ตาม เมื่อทดสอบกับ TruthfulQA ของมหาวิทยาลัย牛津 พบว่าคำตอบของ GopherCite มักจะไม่ได้รับการประเมินว่าเป็นคำตอบที่ถูกต้องเมื่อเทียบกับคำตอบที่ถูกต้องที่ได้รับการตรวจสอบจากมนุษย์
ผู้เขียนเสนอว่าสาเหตุนี้เป็นเพราะแนวคิดของ “คำตอบที่ได้รับการสนับสนุน” ไม่ได้ช่วยกำหนดความจริงในตัวเอง เนื่องจากความมีประโยชน์ของคำพูดที่อ้างอิงอาจถูกบ่อนทำลายโดยปัจจัยอื่นๆ เช่น ความเป็นไปได้ที่ผู้เขียนคำพูดอาจ “หลอกลวง” (เช่น การเขียนเกี่ยวกับโลกที่ไม่มีอยู่จริง การสร้างเนื้อหาสำหรับการโฆษณา หรือการสร้างเรื่องราวที่ไม่จริง)
ดังนั้น จึงจำเป็นต้องแยกความแตกต่างระหว่าง “การสนับสนุน” และ “ความจริง” ในกรณีเหล่านี้
ในกรณีของเนื้อหาที่ได้รับการสนับสนุนและ “ยืนยัน” ระบบ NLG สามารถสังเคราะห์จากข้อมูลการฝึกอบรมของมนุษย์ได้เพียงความแตกต่างและความหลากหลายของมนุษย์ ซึ่งเป็นปัญหาที่ไม่ได้รับการแก้ไขและยังไม่มีคำตอบ
เรามีแนวโน้มที่จะอ้างอิงแหล่งข้อมูลที่สนับสนุนมุมมองของเรา และพูดด้วยความมั่นใจในกรณีที่ข้อมูลของเราอาจไม่ถูกต้องหรือไม่ถูกต้อง และมีแนวโน้มที่จะเผยแพร่ความคิดเห็นเหล่านี้โดยตรงและในวงกว้างโดยไม่มีการตรวจสอบ
ดังนั้น อันตรายที่เกี่ยวข้องกับการพัฒนาระบบ NLG ที่มีการอ้างอิงจึงเกี่ยวข้องกับธรรมชาติที่ไม่แน่นอนของแหล่งข้อมูล
เทคนิคใดๆ ที่เพิ่มความมั่นใจของผู้ใช้ในผลลัพธ์ของ NLG ในปัจจุบันจะเพิ่มความเสี่ยงต่อความถูกต้องของผลลัพธ์
เทคนิคเหล่านี้อาจมีประโยชน์เมื่อ NLP สร้างสรรค์ผลงานที่คล้ายกับ “กระจกสี” ของ Orwell’s Nineteen Eighty-Four; แต่พวกมันแสดงถึงการแสวงหาที่อันตรายสำหรับการวิเคราะห์เอกสารที่เป็นกลาง การเขียนข่าวโดยใช้ AI และการประยุกต์ใช้การสร้างข้อความอัตโนมัติและสรุปข้อมูลของเครื่องจักรในด้าน “นอนฟิกชัน” อื่นๆ
เผยแพร่ครั้งแรกเมื่อวันที่ 5 เมษายน 2022 อัปเดตเวลา 15:29 น. ตามเวลา EET เพื่อแก้ไขคำศัพท์












