มุมมองของ Anderson
การสอน AI ให้เข้าใจและใช้ภาพในบทสนทนา

นักวิจัยจากเกาหลีใต้ได้พัฒนาชุดข้อมูลที่ออกแบบมาเพื่อช่วยให้ AI เข้าใจวิธีการที่มนุษย์ใช้ภาพในบทสนทนา และช่วยให้โมเดลภาษาที่เป็นธรรมชาติสามารถเข้าร่วมในความก้าวหน้านี้ของการสื่อสารของมนุษย์
บทความ นี้ จาก KAIST ที่ Daedeok Innopolis ระบุว่าการวิจัยเกี่ยวกับระบบสนทนาที่มีหลายรูปแบบในช่วง 10 ปีที่ผ่านมาได้รับผลกระทบจากชุดข้อมูลและวิธีการที่มุ่งเน้นไปที่สาขาที่ไม่เกี่ยวข้อง เช่น การถามคำถามเกี่ยวกับภาพ และ การเขียนคำบรรยายภาพ
ในแนวทางที่เก่ากว่านี้ ภาพถูกประเมินนอกบริบทของการสนทนา โดยไม่มีความเข้าใจว่าภาพตอบสนองต่อการสนทนาอย่างไร และไม่มีสกีมาที่ครอบคลุมสำหรับการถอดรหัสการมีส่วนร่วมของภาพต่อการสนทนา
ภาพเป็นส่วนหนึ่งของการสนทนา
หลายแนวทางที่กล่าวถึงข้างต้นได้รับการพัฒนาจากสาขาวิจัย AI ของ Microsoft ซึ่งในปี 2017 ได้ ศึกษาหัวข้อนี้ เกี่ยวกับการสนทนาที่มีหลายรูปแบบที่เริ่มต้นด้วยภาพ แทนที่จะใช้ภาพเป็นส่วนหนึ่งของการสนทนา
เพื่อแก้ไขปัญหาการขาดชุดข้อมูล นักวิจัยจากเกาหลีใต้ได้พัฒนาชุดข้อมูลที่มี 45,000 ตัวอย่างการสนทนาโดยใช้ภาพในลักษณะที่ไม่คาดคิด โดยไม่เน้นไปที่ ภาพ “meme” ที่เป็นไวรัส; สิ่งเหล่านี้เป็นเรื่องที่น่าสนใจในด้านการวิจัยภาษา แต่อาจเป็นเรื่องที่น้อยที่สุด เนื่องจากความหมายของภาพ “meme” ที่เป็นไวรัสสามารถอนุมานได้ง่ายขึ้นผ่านการใช้งานในบริบทบนแพลตฟอร์มโซเชียลมีเดียหลายพันครั้ง
พัฒนาการวาดภาพแทนข้อความ
เพื่อพัฒนาวิธีการสำหรับการแปลข้อความเป็นภาพทั้งสองทาง นักวิจัยจากเกาหลีใต้ได้ฝึกอบรมระบบการเรียนรู้ของเครื่องเพื่อทดแทนบางส่วนของการสนทนาแบบข้อความด้วยภาพที่มีความหมายเชิงсемัน

สถาปัตยกรรมของระบบเกาหลีสำหรับการสร้างชุดข้อมูลสำหรับการวิจัยการสนทนาที่มีหลายรูปแบบ Source: https://arxiv.org/pdf/2107.08685.pdf
การประมวลผลข้อความเป้าหมายเกี่ยวข้องกับการลบ คำหยุด ที่อาจขัดขวางการคาดการณ์คำตอบในลำดับต่อไปของการสนทนา และการ tỉกันของการแลกเปลี่ยนที่มีคุณภาพต่ำผ่านตัวกรองความคล้ายคลึงกันในบริบท
เพื่อทดสอบความมีประโยชน์ของชุดข้อมูล นักวิจัยได้ตั้งค่าโมดูลเพื่อคาดการณ์คำตอบต่อไปในลำดับของการสนทนาโดยพิจารณาจากบริบทของการสนทนาและภาพที่เกี่ยวข้อง

ระบบการประเมินของมนุษย์ที่ใช้ในงานวิจัย
ใช้ชุดข้อมูลภายนอก 5 ชุดเป็นฐานสำหรับการสร้างชุดข้อมูล 45k (ซึ่ง มีอยู่บน GitHub) สามชุดเป็นข้อความ: DailyDialog ซึ่งเป็นชุดข้อมูลข้อความหลายรอบที่มีการบันทึกด้วยมือในปี 2017; และ Facebook’s EmpatheticDialogues และ PersonaChat ทั้งสองชุดนี้มาจากปี 2018 ชุดข้อมูลภาพที่ใช้คือ MS-COCO และ Flicker30k

คู่ภาพและข้อความ – สกีม่า JSON ของวลีในชุดข้อมูลที่เกี่ยวข้องกับภาพ (ในตัวอย่างนี้) จากฐานข้อมูลภาพ COCO ของ Microsoft
การแทนที่ข้อความด้วยภาพสำหรับระบบนี้ได้รับการสนับสนุนจาก เครือข่ายการให้เหตุผลเชิงวิภาษวิธีภาพ (VSRN) ที่ฝึกอบรมไว้ล่วงหน้าในปี 2019 ที่ Northeastern University ที่ Boston VSRN ถูกตั้งค่าให้ทำงานกับวลีที่เลือกมาจากชุดข้อมูลข้อความที่มีส่วนร่วม
การสร้างความสอดคล้อง
ความสอดคล้องของชุดข้อมูลต้นฉบับถูกสร้างขึ้นโดยการพัฒนา 6 ชุดผสมของชุดข้อมูลการสนทนาแต่ละชุด โดยเกี่ยวข้องกับชุดข้อมูลภาพแต่ละชุด และได้รับการประเมินผ่านหลายรอบโดยมนุษย์
การประเมินของมนุษย์ขึ้นอยู่กับ 3 เกณฑ์: ความสอดคล้องกับบริบทของการแลกเปลี่ยน; ความเกี่ยวข้องกับภาพต่อแนวคิดหลักที่ภาพพยายามแสดง; และระดับที่ภาพมีวัตถุหลักจากประโยคเป้าหมาย
เมื่อพิจารณาจากเกณฑ์หลัง อาจกล่าวได้ว่าสกีมาที่นักวิจัยตัดสินใจใช้นั้นได้ละเลยโอกาสที่จะให้ความหมายที่ขำขัน สารคดี ที่เป็นนามธรรม หรืออภิปรัชญาแก่ภาพที่ถูกฉีดเข้าไปในข้อความสนทนา
อย่างไรก็ตาม สิ่งนี้เป็นงานวิจัยที่สำคัญ และมันจะต้องเริ่มต้นจากที่ไหนสักแห่ง ในขณะที่มีการใช้ความพยายามอย่างมากในด้านการประมวลผลภาษาที่เป็นธรรมชาติ (NLP) เพื่อ ทำแผนที่ของการแสดงออกที่ขำขัน ในโซเชียลมีเดีย
การทดสอบ
เพื่อทดสอบเฟรมเวิร์กการสร้างข้อมูล นักวิจัยได้ใช้แบบจำลองการค้นหาที่มี 3 ส่วน โดยอาศัยการวิจัย Image-Chat ของ Facebook ในปี 2020 โมดูลนี้ประกอบด้วย Resnext-101 เป็นตัวเข้ารหัสภาพ; BERT ของ Google เป็นตัวเข้ารหัสข้อความ; และโมดูลการผสมที่กำหนดเองสำหรับสิ่งเหล่านี้
ระบบได้รับ 50.35 และ 14.38 ในการทำนายประโยคปัจจุบันและประโยคถัดไป ซึ่งดีกว่าแบบจำลองฐานสำหรับการทำงานทั้งสอง
ต่อมา นักวิจัยสองคนได้รับมอบหมายให้สร้างการสนทนาที่มีหลายรูปแบบ 100 รายการโดยการแทรกภาพเข้าไปในข้อความสนทนาอย่างเป็นธรรมชาติ และรันระบบกับ “การสนทนาที่มีหลายรูปแบบออร์แกนิก” เหล่านี้ ระบบสามารถคาดการณ์การสนทนาในรอบปัจจุบันและรอบถัดไปได้ด้วยความเข้าใจบริบทที่สูงแม้สำหรับตัวอย่างที่ไม่คาดคิดเหล่านี้













