มุมมองของ Anderson

การสอน AI ให้เข้าใจและใช้ภาพในบทสนทนา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากเกาหลีใต้ได้พัฒนาชุดข้อมูลที่ออกแบบมาเพื่อช่วยให้ AI เข้าใจวิธีการที่มนุษย์ใช้ภาพในบทสนทนา และช่วยให้โมเดลภาษาที่เป็นธรรมชาติสามารถเข้าร่วมในความก้าวหน้านี้ของการสื่อสารของมนุษย์

บทความ นี้ จาก KAIST ที่ Daedeok Innopolis ระบุว่าการวิจัยเกี่ยวกับระบบสนทนาที่มีหลายรูปแบบในช่วง 10 ปีที่ผ่านมาได้รับผลกระทบจากชุดข้อมูลและวิธีการที่มุ่งเน้นไปที่สาขาที่ไม่เกี่ยวข้อง เช่น การถามคำถามเกี่ยวกับภาพ และ การเขียนคำบรรยายภาพ

ในแนวทางที่เก่ากว่านี้ ภาพถูกประเมินนอกบริบทของการสนทนา โดยไม่มีความเข้าใจว่าภาพตอบสนองต่อการสนทนาอย่างไร และไม่มีสกีมาที่ครอบคลุมสำหรับการถอดรหัสการมีส่วนร่วมของภาพต่อการสนทนา

ภาพเป็นส่วนหนึ่งของการสนทนา

หลายแนวทางที่กล่าวถึงข้างต้นได้รับการพัฒนาจากสาขาวิจัย AI ของ Microsoft ซึ่งในปี 2017 ได้ ศึกษาหัวข้อนี้ เกี่ยวกับการสนทนาที่มีหลายรูปแบบที่เริ่มต้นด้วยภาพ แทนที่จะใช้ภาพเป็นส่วนหนึ่งของการสนทนา

เพื่อแก้ไขปัญหาการขาดชุดข้อมูล นักวิจัยจากเกาหลีใต้ได้พัฒนาชุดข้อมูลที่มี 45,000 ตัวอย่างการสนทนาโดยใช้ภาพในลักษณะที่ไม่คาดคิด โดยไม่เน้นไปที่ ภาพ “meme” ที่เป็นไวรัส; สิ่งเหล่านี้เป็นเรื่องที่น่าสนใจในด้านการวิจัยภาษา แต่อาจเป็นเรื่องที่น้อยที่สุด เนื่องจากความหมายของภาพ “meme” ที่เป็นไวรัสสามารถอนุมานได้ง่ายขึ้นผ่านการใช้งานในบริบทบนแพลตฟอร์มโซเชียลมีเดียหลายพันครั้ง

พัฒนาการวาดภาพแทนข้อความ

เพื่อพัฒนาวิธีการสำหรับการแปลข้อความเป็นภาพทั้งสองทาง นักวิจัยจากเกาหลีใต้ได้ฝึกอบรมระบบการเรียนรู้ของเครื่องเพื่อทดแทนบางส่วนของการสนทนาแบบข้อความด้วยภาพที่มีความหมายเชิงсемัน

สถาปัตยกรรมของระบบเกาหลีสำหรับการสร้างชุดข้อมูลสำหรับการวิจัยการสนทนาที่มีหลายรูปแบบ

สถาปัตยกรรมของระบบเกาหลีสำหรับการสร้างชุดข้อมูลสำหรับการวิจัยการสนทนาที่มีหลายรูปแบบ Source: https://arxiv.org/pdf/2107.08685.pdf

การประมวลผลข้อความเป้าหมายเกี่ยวข้องกับการลบ คำหยุด ที่อาจขัดขวางการคาดการณ์คำตอบในลำดับต่อไปของการสนทนา และการ tỉกันของการแลกเปลี่ยนที่มีคุณภาพต่ำผ่านตัวกรองความคล้ายคลึงกันในบริบท

เพื่อทดสอบความมีประโยชน์ของชุดข้อมูล นักวิจัยได้ตั้งค่าโมดูลเพื่อคาดการณ์คำตอบต่อไปในลำดับของการสนทนาโดยพิจารณาจากบริบทของการสนทนาและภาพที่เกี่ยวข้อง

ระบบการประเมินของมนุษย์ที่ใช้ในงานวิจัย

ระบบการประเมินของมนุษย์ที่ใช้ในงานวิจัย

ใช้ชุดข้อมูลภายนอก 5 ชุดเป็นฐานสำหรับการสร้างชุดข้อมูล 45k (ซึ่ง มีอยู่บน GitHub) สามชุดเป็นข้อความ: DailyDialog ซึ่งเป็นชุดข้อมูลข้อความหลายรอบที่มีการบันทึกด้วยมือในปี 2017; และ Facebook’s EmpatheticDialogues และ PersonaChat ทั้งสองชุดนี้มาจากปี 2018 ชุดข้อมูลภาพที่ใช้คือ MS-COCO และ Flicker30k

คู่ภาพและข้อความ – สกีม่า JSON ของวลีในชุดข้อมูลที่เกี่ยวข้องกับภาพ (ในตัวอย่างนี้) จากฐานข้อมูลภาพ COCO ของ Microsoft

คู่ภาพและข้อความ – สกีม่า JSON ของวลีในชุดข้อมูลที่เกี่ยวข้องกับภาพ (ในตัวอย่างนี้) จากฐานข้อมูลภาพ COCO ของ Microsoft

การแทนที่ข้อความด้วยภาพสำหรับระบบนี้ได้รับการสนับสนุนจาก เครือข่ายการให้เหตุผลเชิงวิภาษวิธีภาพ (VSRN) ที่ฝึกอบรมไว้ล่วงหน้าในปี 2019 ที่ Northeastern University ที่ Boston VSRN ถูกตั้งค่าให้ทำงานกับวลีที่เลือกมาจากชุดข้อมูลข้อความที่มีส่วนร่วม

การสร้างความสอดคล้อง

ความสอดคล้องของชุดข้อมูลต้นฉบับถูกสร้างขึ้นโดยการพัฒนา 6 ชุดผสมของชุดข้อมูลการสนทนาแต่ละชุด โดยเกี่ยวข้องกับชุดข้อมูลภาพแต่ละชุด และได้รับการประเมินผ่านหลายรอบโดยมนุษย์

การประเมินของมนุษย์ขึ้นอยู่กับ 3 เกณฑ์: ความสอดคล้องกับบริบทของการแลกเปลี่ยน; ความเกี่ยวข้องกับภาพต่อแนวคิดหลักที่ภาพพยายามแสดง; และระดับที่ภาพมีวัตถุหลักจากประโยคเป้าหมาย

เมื่อพิจารณาจากเกณฑ์หลัง อาจกล่าวได้ว่าสกีมาที่นักวิจัยตัดสินใจใช้นั้นได้ละเลยโอกาสที่จะให้ความหมายที่ขำขัน สารคดี ที่เป็นนามธรรม หรืออภิปรัชญาแก่ภาพที่ถูกฉีดเข้าไปในข้อความสนทนา

อย่างไรก็ตาม สิ่งนี้เป็นงานวิจัยที่สำคัญ และมันจะต้องเริ่มต้นจากที่ไหนสักแห่ง ในขณะที่มีการใช้ความพยายามอย่างมากในด้านการประมวลผลภาษาที่เป็นธรรมชาติ (NLP) เพื่อ ทำแผนที่ของการแสดงออกที่ขำขัน ในโซเชียลมีเดีย

การทดสอบ

เพื่อทดสอบเฟรมเวิร์กการสร้างข้อมูล นักวิจัยได้ใช้แบบจำลองการค้นหาที่มี 3 ส่วน โดยอาศัยการวิจัย Image-Chat ของ Facebook ในปี 2020 โมดูลนี้ประกอบด้วย Resnext-101 เป็นตัวเข้ารหัสภาพ; BERT ของ Google เป็นตัวเข้ารหัสข้อความ; และโมดูลการผสมที่กำหนดเองสำหรับสิ่งเหล่านี้

ระบบได้รับ 50.35 และ 14.38 ในการทำนายประโยคปัจจุบันและประโยคถัดไป ซึ่งดีกว่าแบบจำลองฐานสำหรับการทำงานทั้งสอง

ต่อมา นักวิจัยสองคนได้รับมอบหมายให้สร้างการสนทนาที่มีหลายรูปแบบ 100 รายการโดยการแทรกภาพเข้าไปในข้อความสนทนาอย่างเป็นธรรมชาติ และรันระบบกับ “การสนทนาที่มีหลายรูปแบบออร์แกนิก” เหล่านี้ ระบบสามารถคาดการณ์การสนทนาในรอบปัจจุบันและรอบถัดไปได้ด้วยความเข้าใจบริบทที่สูงแม้สำหรับตัวอย่างที่ไม่คาดคิดเหล่านี้

ผลลัพธ์ของการทดสอบสำหรับระบบเกาหลีในการสร้างชุดข้อมูลสำหรับการวิจัยการสนทนาที่มีหลายรูปแบบ โดยแสดงให้เห็นถึงความสัมพันธ์ที่สูงระหว่างความคล้ายคลึงกันของข้อความและภาพกับคะแนนคำถามที่อิงจากมนุษย์บนข้อมูลเดียวกัน

ผลลัพธ์ของการทดสอบสำหรับระบบเกาหลีในการสร้างชุดข้อมูลสำหรับการวิจัยการสนทนาที่มีหลายรูปแบบ โดยแสดงให้เห็นถึงความสัมพันธ์ที่สูงระหว่างความคล้ายคลึงกันของข้อความและภาพกับคะแนนคำถามที่อิงจากมนุษย์บนข้อมูลเดียวกัน

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai