มุมมองของ Anderson
การทำให้ NLP ท้าทายคำถามที่ไม่ถูกต้อง

บางคำถามไม่สามารถตอบได้เพราะมีข้อมูลที่ไม่ถูกต้อง – การสันนิษฐานที่ผู้ฟังต้องกรองและปฏิเสธ สิ่งนี้สมมติว่าผู้ฟังมีข้อมูลที่ถูกต้องเพียงพอเพื่อท้าทายคำถาม แทนที่จะใช้คำถามนั้นเองเป็นแหล่งของข้อมูลที่ไม่ถูกต้อง
เป็นความท้าทายสำหรับระบบประมวลผลภาษาธรรมชาติ (NLP) เช่น GPT-3 ซึ่งมีแนวโน้มที่จะ “hallucinate” ข้อมูลเพื่อรักษาการสนทนา
ปัจจุบัน การถาม GPT-3 ‘เมื่อไหร่ที่ Marie Curie ค้นพบยูเรเนียม?’ จะได้รับคำตอบ ‘Marie Curie ค้นพบยูเรเนียมในปี 1898’

Source: https://beta.openai.com/playground (Da Vinci instruct beta).
ในความเป็นจริง ยูเรเนียมถูกค้นพบในปี 1789 โดยนักเคมีชาวเยอรมัน Martin Heinrich Klaproth ในขณะที่การค้นพบของ Curies ในปี 1898 เป็นการแยกกันของเรเดียม
ปัญหาเกี่ยวกับระบบ NLP ที่เพิกเฉยต่อการสันนิษฐานที่ไม่ถูกต้องได้รับการเน้นย้ำในหลายกรณีในปีนี้ รวมถึงวิธีการที่ Google’s AI-assisted search results จะเพิกเฉยต่อข้อมูลที่ไม่ถูกต้องในคำถาม ‘เมื่อไหร่ที่ Neil Armstrong เดินบนดาวอังคาร?’ – ซึ่งเป็นข้อผิดพลาดที่ยังคงแสดงอยู่ในขณะเขียนบทความนี้ และยังใช้กับ Buzz Lightyear จาก Toy Story ที่เดินบนดวงจันทร์เมื่อวันที่ 21 กรกฎาคม 1969
Tom Hanks อีกหนึ่งคนจาก Toy Story ยังได้รับการยกย่องจาก Google ว่าเดินบนดวงจันทร์ในปี 1970 แม้ว่าเขาจะไม่เคยทำเช่นนั้นจริงๆ

การแก้ไขปัญหาเกี่ยวกับการสันนิษฐานใน NLP
ทีมนักวิจัยจาก Google Research ร่วมกับนักวิจัยจากมหาวิทยาลัย John Hopkins และ Brown University กำลังพัฒนาวิธีการใหม่ๆ ในการทำให้ระบบ NLP ท้าทายคำถามที่ไม่ถูกต้อง
บทความล่าสุด Which Linguist Invented the Lightbulb? Presupposition Verification for Question-Answering อธิบายถึงความพยายามในการพัฒนาระบบใหม่ที่สามารถระบุและตรวจสอบการสันนิษฐานก่อนที่จะตอบคำถาม
อัลกอริทึมใหม่นี้จะประมวลคำถามก่อนที่จะตอบ โดยแบ่งออกเป็นสามขั้นตอน

Does not compute! On the left, the ‘roadblock’ that occurs even when an advanced NLP system has been able to identify that the question does not make sense. On the right, a breakdown of a proposed algorithm that attempts to rectify the source error. Source: https://arxiv.org/pdf/2101.00391.pdf
แม้ว่าจะดูเหมือนเป็นกระบวนการตรวจสอบที่เรียบง่าย แต่ระบบ NLP ส่วนใหญ่จะไม่ได้รับการฝึกฝนให้ตรวจสอบข้อมูลที่ไม่ถูกต้อง
การกำหนดแนวทางที่ดีที่สุดสำหรับคำถามที่ไม่สามารถตอบได้
เพื่อกำหนดแนวทางที่ดีที่สุดสำหรับคำถามที่ไม่สามารถตอบได้ ทีมนักวิจัยได้ใช้คำถาม 100 คำถามที่มีข้อมูลที่ไม่ถูกต้อง และขอให้ผู้เข้าร่วมเลือกคำตอบที่ดีที่สุดหรือมีปัญหาเล็กที่สุด
มีคำตอบสี่แบบที่เป็นไปได้สำหรับคำถามที่ไม่สามารถตอบได้: ‘ไม่สามารถตอบได้’ – ซึ่งระบบจะปิดคำถามโดยไม่มีการอธิบายเพิ่มเติม; ‘คำอธิบายการละเมิดการสันนิษฐาน’ – ซึ่งระบบจะไม่สามารถตรวจสอบการสันนิษฐานที่ไม่ถูกต้อง และให้คำอธิบาย; ‘คำอธิบายการค้นหา’ – ซึ่งระบบจะค้นหาและเพิ่มคำอธิบายจากวิกิพีเดีย; และ ‘การเขียนใหม่แบบเปิด’ – ซึ่งระบบจะพยายามค้นหาแหล่งข้อมูลเพิ่มเติมจากวิกิพีเดีย

This example of four possible answers to an apparently ‘unanswerable’ question illustrates the complexity of attempting a competitive domain-based solution to the problem.
ผู้เข้าร่วมมีความชอบคำตอบที่อธิบายการละเมิดการสันนิษฐาน ซึ่งนำไปสู่การสร้างเฟรมเวิร์กใหม่ในการตรวจสอบคำถาม
ชุดข้อมูล
ชุดข้อมูลที่ใช้ในการศึกษาได้รับการสร้างขึ้นโดยการแก้ไขคำถามที่มีข้อมูลที่ไม่ถูกต้อง และการเพิ่มคำอธิบายจากวิกิพีเดีย
สองในสามผู้เขียนได้ทำการตรวจสอบและแก้ไขชุดข้อมูลเพื่อให้แน่ใจว่าข้อมูลมีความถูกต้อง
ผลลัพธ์และการสร้างคำตอบ
ผลลัพธ์ที่ดีที่สุดได้รับจากอัลกอริทึมที่ใช้การผสมผสานระหว่างการตรวจสอบและการค้นหา

The performance of the verification models, where ‘Wiki sentences’ uses sentences obtained from question-related Wikipedia articles, and ‘Wiki presuppositions’ are generated presuppositions from those sentences.
โดยใช้การผสมผสานนี้ ทีมนักวิจัยได้สร้างระบบที่สามารถตรวจสอบและตอบคำถามได้ดีขึ้น
ผลกระทบ
ผลกระทบของการวิจัยนี้อาจนำไปสู่การสร้างระบบ NLP ที่มีความสามารถในการท้าทายคำถามที่ไม่ถูกต้องได้ดีขึ้น
อย่างไรก็ตาม ทีมนักวิจัยยังตระหนักถึงข้อจำกัดของระบบ เช่น การใช้เวลาและทรัพยากรในการประมวลผล
ในอนาคต ทีมนักวิจัยมีแผนที่จะพัฒนาระบบ NLP ที่มีความสามารถในการท้าทายคำถามที่ไม่ถูกต้องได้ดีขึ้น โดยใช้การผสมผสานระหว่างการตรวจสอบและการค้นหา
ตัวอย่างเช่น who does pip believe is estella has an embedded possessive under a nonfactive verb believe, but our generator would nevertheless generate ‘estella has ‘mother’
ทีมนักวิจัยมีแผนที่จะสร้างระบบ NLP ที่มีความสามารถในการท้าทายคำถามที่ไม่ถูกต้องได้ดีขึ้น โดยใช้การผสมผสานระหว่างการตรวจสอบและการค้นหา
In the future, we plan to build on this work by proposing QA systems that are more robust and cooperative. For instance, different types of presupposition failures could be addressed by more fluid answer strategies—e.g., violation of uniqueness presuppositions may be better handled by providing all possible answers, rather than stating that the uniqueness presupposition was violated.












