มุมมองของ Anderson

อันตรายของการใช้คำพูดเพื่อยืนยันเนื้อหาของ NLG

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ความคิดเห็น โมเดลการสร้างภาษาธรรมชาติ (Natural Language Generation) เช่น GPT-3 มีแนวโน้มที่จะ “หลอกลวง” ข้อมูลที่นำเสนอในบริบทของข้อมูลจริง ในยุคที่มีความกังวลเกี่ยวกับการเติบโตของข่าวปลอมแบบข้อความเหล่านี้เป็นอุปสรรคที่สำคัญสำหรับการพัฒนาระบบการเขียนและสรุปอัตโนมัติ และสำหรับอนาคตของ การเขียนข่าวโดยใช้ AI รวมถึงสาขาอื่นๆ ของการประมวลผลภาษาธรรมชาติ (NLP)

ปัญหาที่สำคัญคือโมเดลภาษา GPT-รุ่นได้รับข้อมูลสำคัญและชั้นเรียนจาก คอร์ปัสการฝึกที่มีขนาดใหญ่มาก และเรียนรู้ที่จะใช้ข้อมูลเหล่านี้เป็นบล็อกการสร้างภาษาที่มีความสามารถและความจริง โดยไม่คำนึงถึงความถูกต้องหรือความยอมรับของเนื้อหาที่สร้างขึ้น

ข่าวเก่าและข้อเท็จจริงปลอม

โมเดลการสร้างภาษาธรรมชาติ (NLG) สามารถสร้างเนื้อหาที่น่าเชื่อถือและเป็นไปได้เพราะพวกมันได้เรียนรู้โครงสร้างทางภาษา มากกว่าการเรียนรู้ประวัติศาสตร์ วิทยาศาสตร์ เศรษฐศาสตร์ หรือหัวข้ออื่นๆ ที่พวกมันต้องแสดงความคิดเห็น ซึ่งถูกผสมผสานเข้ากับข้อมูลต้นฉบับ

ความถูกต้องของข้อมูลที่โมเดล NLG สร้างขึ้นสมมติว่าข้อมูลที่ใช้ในการฝึกอบรมมีความน่าเชื่อถือและเป็นปัจจุบัน ซึ่งเป็นภาระที่ยิ่งใหญ่ในด้านการประมวลผลและการตรวจสอบข้อมูลของมนุษย์ – อุปสรรคที่มีค่าใช้จ่ายที่ NLP ต้องเผชิญอยู่

ระบบ GPT-3 มีขนาดใหญ่และต้องใช้เวลาและเงินมากในการฝึกอบรม และหลังจากที่ฝึกอบรมแล้ว ก็ยากที่จะอัปเดตที่ระดับ “เคอร์เนล” แม้ว่าการเปลี่ยนแปลงแบบเซสชันและแบบผู้ใช้จะสามารถเพิ่มความสามารถและความถูกต้องของโมเดลที่ใช้งานได้ แต่ประโยชน์เหล่านี้ยากที่จะส่งต่อไปยังโมเดลหลักโดยไม่ต้องฝึกอบรมใหม่หรือบางส่วน

ดังนั้น จึงยากที่จะสร้างโมเดลภาษาที่สามารถใช้ข้อมูลล่าสุดได้

โมเดลที่ฝึกอบรมก่อนการเกิดโควิด-19 และการรุกรานยูเครนในปี 2022 - text-davinci-002 ซึ่งเป็นรุ่นที่มีความสามารถมากที่สุดของ GPT-3 ตามที่ OpenAI พิจารณา - สามารถประมวลผล 4000 โทเค็นต่อคำขอ แต่ไม่มีข้อมูลเกี่ยวกับโควิด-19 หรือการรุกรานยูเครน (คำขอและคำตอบเหล่านี้มาจากวันที่ 5 เมษายน 2022) น่าสนใจที่

โมเดลที่ฝึกอบรมก่อนการเกิดโควิด-19 และการรุกรานยูเครนในปี 2022 – text-davinci-002 ซึ่งเป็นรุ่นที่มีความสามารถมากที่สุดของ GPT-3 ตามที่ OpenAI พิจารณา – สามารถประมวลผล 4000 โทเค็นต่อคำขอ แต่ไม่มีข้อมูลเกี่ยวกับโควิด-19 หรือการรุกรานยูเครน (คำขอและคำตอบเหล่านี้มาจากวันที่ 5 เมษายน 2022) น่าสนใจที่ “ไม่ทราบ” เป็นคำตอบที่ยอมรับได้ในทั้งสองกรณี แต่คำขอเพิ่มเติมสามารถแสดงได้ว่า GPT-3 ไม่มีข้อมูลเกี่ยวกับเหตุการณ์เหล่านี้ Source: https://beta.openai.com/playground

โมเดลที่ฝึกอบรมแล้วสามารถเข้าถึง “ความจริง” ได้เพียงเท่าที่พวกมันจัดเก็บไว้ระหว่างการฝึกอบรม และยากที่จะรับคำพูดที่ถูกต้องและเกี่ยวข้องโดยอัตโนมัติเมื่อพยายามยืนยันคำกล่าวของพวกมัน

ด้านบน三个คำพูดที่ถูกต้องที่ได้รับจาก GPT-3 ในปี 2021 ตรงกลาง GPT-3 ล้มเหลวในการอ้างถึงคำพูดที่มีชื่อเสียงของ Einstein (

ด้านบน三个คำพูดที่ถูกต้องที่ได้รับจาก GPT-3 ในปี 2021 ตรงกลาง GPT-3 ล้มเหลวในการอ้างถึงคำพูดที่มีชื่อเสียงของ Einstein ("พระเจ้าไม่เล่นลูกเต๋ากับจักรวาล") แม้จะได้รับคำขอที่ชัดเจน ล่าง GPT-3 ระบุคำพูดที่ไม่เหมาะสมและไม่มีอยู่จริงให้กับ Albert Einstein ซึ่งดูเหมือนจะส่งต่อจากคำถามก่อนหน้าเกี่ยวกับ Winston Churchill ในเซสชันเดียวกัน Source: https://www.width.ai/post/business-applications-for-gpt-3

GopherCite

เพื่อแก้ไขปัญหานี้โดยทั่วไป โมเดล GopherCite ของ Google’s DeepMind ได้ถูกเสนอเป็น โมเดล 280 ล้านพารามิเตอร์ที่สามารถอ้างอิงหลักฐานที่ถูกต้องและแม่นยำเพื่อสนับสนุนคำตอบที่สร้างขึ้น

ตัวอย่างสามตัวอย่างของ GopherCite ที่สนับสนุนคำกล่าวของมันด้วยคำพูดที่แท้จริง

ตัวอย่างสามตัวอย่างของ GopherCite ที่สนับสนุนคำกล่าวของมันด้วยคำพูดที่แท้จริง Source: https://arxiv.org/pdf/2203.11147.pdf

GopherCite ใช้การเรียนรู้แบบเสริมจากความชอบของมนุษย์ (RLHP) เพื่อฝึกโมเดลคำถามที่สามารถอ้างอิงคำพูดที่แท้จริงเป็นหลักฐานสนับสนุน คำพูดเหล่านี้ถูกดึงมาจากแหล่งข้อมูลเอกสารหลายแห่งที่ได้รับจากเครื่องมือค้นหา หรือจากเอกสารที่ผู้ใช้ให้มา

การอ้างอิงความเท็จ

อย่างไรก็ตาม เมื่อทดสอบกับ TruthfulQA ของมหาวิทยาลัย牛津 พบว่าคำตอบของ GopherCite มักจะไม่ได้รับการประเมินว่าเป็นคำตอบที่ถูกต้องเมื่อเทียบกับคำตอบที่ถูกต้องที่ได้รับการตรวจสอบจากมนุษย์

ผู้เขียนเสนอว่าสาเหตุนี้เป็นเพราะแนวคิดของ “คำตอบที่ได้รับการสนับสนุน” ไม่ได้ช่วยกำหนดความจริงในตัวเอง เนื่องจากความมีประโยชน์ของคำพูดที่อ้างอิงอาจถูกบ่อนทำลายโดยปัจจัยอื่นๆ เช่น ความเป็นไปได้ที่ผู้เขียนคำพูดอาจ “หลอกลวง” (เช่น การเขียนเกี่ยวกับโลกที่ไม่มีอยู่จริง การสร้างเนื้อหาสำหรับการโฆษณา หรือการสร้างเรื่องราวที่ไม่จริง)

ดังนั้น จึงจำเป็นต้องแยกความแตกต่างระหว่าง “การสนับสนุน” และ “ความจริง” ในกรณีเหล่านี้

ในกรณีของเนื้อหาที่ได้รับการสนับสนุนและ “ยืนยัน” ระบบ NLG สามารถสังเคราะห์จากข้อมูลการฝึกอบรมของมนุษย์ได้เพียงความแตกต่างและความหลากหลายของมนุษย์ ซึ่งเป็นปัญหาที่ไม่ได้รับการแก้ไขและยังไม่มีคำตอบ

เรามีแนวโน้มที่จะอ้างอิงแหล่งข้อมูลที่สนับสนุนมุมมองของเรา และพูดด้วยความมั่นใจในกรณีที่ข้อมูลของเราอาจไม่ถูกต้องหรือไม่ถูกต้อง และมีแนวโน้มที่จะเผยแพร่ความคิดเห็นเหล่านี้โดยตรงและในวงกว้างโดยไม่มีการตรวจสอบ

ดังนั้น อันตรายที่เกี่ยวข้องกับการพัฒนาระบบ NLG ที่มีการอ้างอิงจึงเกี่ยวข้องกับธรรมชาติที่ไม่แน่นอนของแหล่งข้อมูล

เทคนิคใดๆ ที่เพิ่มความมั่นใจของผู้ใช้ในผลลัพธ์ของ NLG ในปัจจุบันจะเพิ่มความเสี่ยงต่อความถูกต้องของผลลัพธ์

เทคนิคเหล่านี้อาจมีประโยชน์เมื่อ NLP สร้างสรรค์ผลงานที่คล้ายกับ “กระจกสี” ของ Orwell’s Nineteen Eighty-Four; แต่พวกมันแสดงถึงการแสวงหาที่อันตรายสำหรับการวิเคราะห์เอกสารที่เป็นกลาง การเขียนข่าวโดยใช้ AI และการประยุกต์ใช้การสร้างข้อความอัตโนมัติและสรุปข้อมูลของเครื่องจักรในด้าน “นอนฟิกชัน” อื่นๆ

เผยแพร่ครั้งแรกเมื่อวันที่ 5 เมษายน 2022 อัปเดตเวลา 15:29 น. ตามเวลา EET เพื่อแก้ไขคำศัพท์

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai