โมเดลและแพลตฟอร์ม AI

TextFooler Algorithm Fools NLP AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แม้ว่าขั้นตอนการประมวลผลภาษาที่เป็นธรรมชาติและระบบจะมีความสามารถมากขึ้นในช่วงไม่กี่ปีที่ผ่านมา แต่ก็ยังคงอ่อนแอต่อการโจมตีชนิดหนึ่งที่เรียกว่า “ตัวอย่างที่เป็นปฏิปักษ์” ตัวอย่างที่เป็นปฏิปักษ์เป็นประโยคที่ถูกออกแบบมาอย่างรอบคอบซึ่งสามารถทำให้ระบบ NLP มีพฤติกรรมที่ไม่คาดคิดและไม่พึงประสงค์ โปรแกรม AI สามารถถูกทำให้ทำงานผิดปกติด้วยตัวอย่างเหล่านี้ และด้วยเหตุนี้ นักวิจัย AI จึงพยายามออกแบบวิธีการป้องกันผลกระทบของตัวอย่างที่เป็นปฏิปักษ์

เมื่อเร็วๆ นี้ ทีมนักวิจัยจากมหาวิทยาลัยฮ่องกงและหน่วยงานวิทยาศาสตร์ เทคโนโลยี และการวิจัยแห่งสิงคโปร์ ได้ร่วมมือกันเพื่อสร้างอัลกอริทึมที่แสดงให้เห็นถึงอันตรายของตัวอย่างที่เป็นปฏิปักษ์ ตามที่ Wired รายงาน อัลกอริทึมนี้ได้รับการตั้งชื่อว่า TextFooler โดยทีมวิจัย และมันทำงานโดยการเปลี่ยนแปลงบางส่วนของประโยค ซึ่งจะส่งผลต่อวิธีการที่ NLP classifier ตีความประโยค ตัวอย่างเช่น อัลกอริทึมได้แปลงประโยคหนึ่งไปเป็นประโยคที่คล้ายกันและประโยคนั้นถูกป้อนเข้าไปในตัวจำแนกที่ออกแบบมาเพื่อกำหนดว่าบทวิจารณ์เป็นลบหรือบวก ประโยคเดิมคือ

“ตัวละครที่ถูกวางในสถานการณ์ที่ไม่สามารถทำได้ สร้างขึ้น ได้อย่างสมบูรณ์แบบ เป็น คนแปลก ที่ถูกตัดขาดจากความเป็นจริง”

แปลงเป็นประโยค

“ตัวละครที่ถูกวางในสถานการณ์ที่ไม่สามารถทำได้ ออกแบบ ได้อย่างสมบูรณ์แบบ เป็น คนเต็ม ที่ถูกตัดขาดจากความเป็นจริง”

การเปลี่ยนแปลงเล็กๆ นี้ทำให้ตัวจำแนกข้อความจำแนกบทวิจารณ์ว่าเป็นบวกแทนลบ ทีมวิจัยทดสอบวิธีการเดียวกัน (การเปลี่ยนคำบางคำด้วยคำที่มีความหมายเหมือนกัน) บนชุดข้อมูลและอัลกอริทึมการจำแนกข้อความหลายตัว ทีมวิจัยรายงานว่าพวกเขาได้ลดความแม่นยำในการจำแนกของอัลกอริทึมลงเหลือเพียง 10% จาก 90% ซึ่งแม้ว่าคนอ่านประโยคเหล่านี้จะเข้าใจว่ามีความหมายเหมือนกัน

ผลลัพธ์เหล่านี้เป็นเรื่องที่น่ากังวลในยุคที่อัลกอริทึม NLP และ AI ถูกใช้บ่อยขึ้น และสำหรับงานสำคัญๆ เช่น การประเมินคำร้องขอทางการแพทย์หรือการวิเคราะห์เอกสารทางกฎหมาย ไม่ทราบว่าตัวอย่างที่เป็นปฏิปักษ์มีอันตรายต่ออัลกอริทึมที่ใช้อยู่ในปัจจุบันมากน้อยเพียงใด ทีมวิจัยทั่วโลกยังคงพยายามค้นหาว่าตัวอย่างที่เป็นปฏิปักษ์สามารถมีผลกระทบได้มากเพียงใด เมื่อเร็วๆ นี้ รายงานที่เผยแพร่โดยกลุ่ม Stanford Human-Centered AI เสนอว่าตัวอย่างที่เป็นปฏิปักษ์สามารถหลอกลวงอัลกอริทึม AI และใช้เพื่อกระทำการฉ้อโกงภาษี

มีข้อจำกัดบางประการใน nghiên cứuล่าสุด ตัวอย่างเช่น Sameer Singh ผู้ช่วยศาสตราจารย์ภาควิชาวิทยาการคอมพิวเตอร์แห่ง UC Irvine ระบุว่าวิธีการที่เป็นปฏิปักษ์ที่ใช้นั้นมีประสิทธิภาพ แต่ต้องอาศัยความรู้บางส่วนเกี่ยวกับโครงสร้างของ AI AI ต้องถูกทดสอบซ้ำๆ จนกว่าจะพบชุดคำที่มีประสิทธิภาพ และการโจมตีแบบซ้ำๆ อาจถูกตรวจจับโดยโปรแกรมรักษาความปลอดภัย Singh และเพื่อนร่วมงานได้ทำการวิจัยเกี่ยวกับเรื่องนี้และพบว่าระบบขั้นสูง เช่น อัลกอริทึม OpenAI สามารถส่งผลกระทบต่อข้อความที่เป็นอันตรายเมื่อถูกกระตุ้นโดยคำกระตุ้นบางคำ

ตัวอย่างที่เป็นปฏิปักษ์ยังเป็นปัญหาเมื่อจัดการกับข้อมูลภาพ เช่น รูปภาพหรือวิดีโอ ตัวอย่างที่มีชื่อเสียงหนึ่งเกี่ยวข้องกับการใช้การเปลี่ยนแปลงดิจิทัลบางอย่างต่อรูปภาพแมว ทำให้ตัวจำแนกภาพ ตีความว่าเป็นหน้าจอหรือคอมพิวเตอร์ตั้งโต๊ะ ในตัวอย่างอื่น การวิจัยที่ทำโดย Dawn Song ศาสตราจารย์จาก UC Berkeley พบว่าตัวอย่างที่เป็นปฏิปักษ์สามารถใช้เพื่อเปลี่ยนแปลงวิธีการที่ระบบการมองเห็นของคอมพิวเตอร์เข้าใจป้ายจราจร ซึ่งอาจเป็นอันตรายต่อยานพาหนะอัตโนมัติ

การวิจัยเช่นที่ทีมฮ่องกง-สิงคโปร์ทำสามารถช่วยให้วิศวกร AI เข้าใจถึงจุดอ่อนของอัลกอริทึม AI และออกแบบวิธีการป้องกันจุดอ่อนเหล่านี้ ตัวอย่างเช่น ตัวจำแนกแบบアンサンブルสามารถใช้เพื่อลดโอกาสที่ตัวอย่างที่เป็นปฏิปักษ์จะหลอกลวงระบบการมองเห็นของคอมพิวเตอร์ โดยใช้เทคนิคนี้ ตัวจำแนกหลายตัวจะถูกใช้ และการเปลี่ยนแปลงเล็กๆ จะถูกทำต่อภาพเข้า ทั้งหมดนี้จะถูกนำมารวมกัน ผลลัพธ์คือแม้ว่าตัวจำแนกบางตัวจะถูกหลอกลวง แต่ส่วนใหญ่จะไม่ถูกหลอกลวงและภาพจะถูกจำแนกอย่างถูกต้อง

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี