Погляд Anderson
Навчання штучного інтелекту розуміти та використовувати зображення в діалозі

Дослідники з Південної Кореї створили набір даних, призначений для допомоги у дослідженнях з розуміння штучним інтелектом того, як люди використовують зображення в діалозі, та для допомоги моделям природної мови брати участь у цьому останньому розвитку людських комунікацій.
У статті, опублікованій у KAIST у Дедок-Іннополісі, зазначається, що дослідження таких мультимодальних діалогових систем за останні десять років були ускладнені через використання наборів даних і методологій, що зосереджені на периферійних дисциплінах, таких як візуальне питання-відповідь та підпис зображення.
У цих старих підходах зображення оцінюються поза лексичним контекстом розмови, без розуміння того, як діалог посилюється та розвивається завдяки відповідям на зображення, і без схематики для декодування внеску візуальних елементів у дискурс.
Зображення як першокласні складові діалогу
Багато з вищезазначених підходів на сьогоднішній день були ініціативами або розробками від дослідницького підрозділу Microsoft, який у 2017 році також досліджував тему мультимодальних розмов, які починаються із зображення, а не вільно використовують зображення як складові діалогу.
Для подолання нестачі у дослідницьких даних південнокорейські дослідники створили набір даних із 45 000 діалогічних екземплярів, що涉ляють ad hoc використання зображень, не зосереджуючись на віральних “мем” зображеннях; останні, хоча й є областю інтересу у мовних дослідженнях, можна вважати меншим викликом, оскільки значення віральних мемів можна витлумачити легше завдяки тисячам контекстних використання на соціальних платформах.
Розробка ілюстрацій як заміни тексту
Для розробки методології двосторонньої транслітерації слово/фраза>зображення південнокорейські дослідники тренували систему машинного навчання, щоб замінити частини текстової розмови на семантично релевантний вміст зображення.

Архітектура корейської системи генерації набору даних для мультимодального діалогового дослідження. Джерело: https://arxiv.org/pdf/2107.08685.pdf
Передобробка цільових фраз включала видалення стоп-слів, які могли б інгібувати передбачення подальшої репліки в розмові, та обрізання нижчої якості обмінів через фільтри контекстної схожості.
Для перевірки корисності набору даних дослідники встановили модуль для передбачення наступної “репліки” в діалозі, враховуючи контекст розмови та зображення.

Система оцінки людини, використана у дослідженні.
Було використано п’ять зовнішніх наборів даних як базовий матеріал для 45-тисячного набору даних (який доступний на GitHub). Три з них є текстовими елементами: DailyDialog, ручно анотований багаторозмовий текстовий набір з 2017 року; та EmpatheticDialogues і PersonaChat, обидва з 2018 року. Два образових набори даних, які були використані, були MS-COCO і Flicker30k.

Пари зображення/текст – схема JSON фраз у наборі даних, пов’язаних із зображеннями (у цьому прикладі) з бази даних зображень Microsoft COCO.
Заміна тексту на зображення для системи була забезпечена завдяки попередньо натренованій Візуально-Семантичній Мережі Розуміння (VSRN), розробленій у 2019 році в Університеті Норtheastern у Бостоні. VSRN була встановлена для роботи з ручними попередньо вибраними фразами з текстових наборів даних.
Встановлення узгодженості
Узгодженість джерельних наборів даних була встановлена шляхом розробки шести комбінацій кожного діалогового набору даних, корельованих з екземплярами кожного образового набору даних, та оцінених протягом декількох раундів людьми.
Оцінка людини була заснована на трьох критеріях: узгодженості з контекстом обміну; відповідності зображення до основної концепції, яку зображення намагалося виразити; та ступеня, у якому зображення містило ключові об’єкти з цільової речення.
Якщо вважати останній критерій, можна сказати, що схема, яку дослідники вирішили використовувати, значною мірою виключила можливість гумористичних, саркастичних, абстрактних або метафізичних можливостей для семантичного значення зображення, яке могло бути ін’єктовано у текстову розмову.
Однак, це є семінальною роботою, і вона повинна починатися десь, тоді як значні зусилля витрачаються в іншому місці в секторі обробки природної мови (NLP) для картографування інстансів сарказму, серед інших менш осяжних прикладів відносин між зображенням та текстом.
Тестування
Для тестування rámки генерації даних дослідники використали тричастинову модель відновлення, засновану на дослідженні Image-Chat компанії Facebook у 2020 році. Модуль складається з Resnext-101 як кодувальника зображення; системи BERT компанії Google для текстового кодувальника; та спеціального модуля злиття для цих.
Система досягла 50,35 та 14,38 на задачах передбачення поточної та наступної речення, покращуючи базові показники для кожної задачі.
Пізніше двоє дослідників були доручені створити 100 мультимодальних діалогів шляхом вставки зображень у розмови вручну та виконання системи проти цих “органічних” мультимодальних розмов. Система змогла передбачити поточну та наступну репліку з високою свідомістю контексту навіть для цих ad hoc прикладів.













