Взгляд Anderson
Обучение ИИ понимать и использовать изображения в диалоге

Исследователи из Южной Кореи разработали набор данных, предназначенный для помощи в исследовании понимания ИИ того, как люди используют изображения в диалоге, и для помощи моделям обработки естественного языка в участии в этом недавнем развитии человеческих коммуникаций.
В статье, опубликованной в KAIST в Дэдок Иннополисе, отмечается, что исследования по таким много модальным диалоговым системам за последние десять лет были осложнены наборами данных и методологиями, центрированными на периферийных дисциплинах, таких как визуальное вопрос-ответ и подписывание изображений.
В этих более старых подходах изображения оцениваются вне лексического контекста разговора, без понимания того, как диалог улучшается и развивается с помощью ответов на изображения, и без междоменной схемы для декодирования вклада визуальных вкладов в дискурс.
Изображения как первоклассные аспекты диалога
Многие из вышеупомянутых подходов на сегодняшний день были инициативами или разработками исследовательского отдела Microsoft, который в 2017 году также изучил тему много модальных разговоров, которые начинаются с изображения, а не свободно используют изображения как компоненты диалога.
Чтобы устранить нехватку исследовательских данных, южнокорейские исследователи разработали набор данных из 45 000 экземпляров диалога, включающих ad hoc использование изображений, без концентрации на виральных ‘мем’ изображениях; последние, хотя и являются областью интереса в языковых исследованиях, являются, возможно, менее сложными, поскольку значение виральных мемов может быть выведено более легко через тысячи контекстных использований на социальных медиа платформах.
Разработка иллюстраций как замены текста
Чтобы разработать методологию для двусторонней транслитерации слова/фразы и изображения, южнокорейские исследователи обучили систему машинного обучения заменять части текстового разговора на семантически релевантный контент изображения.

Архитектура корейской системы для генерации набора данных для много модального диалогового исследования. Источник: https://arxiv.org/pdf/2107.08685.pdf
Предварительная обработка целевых фраз включала удаление стоп-слов, которые могли бы препятствовать предсказанию следующего ответа в разговоре, и обрезку низкокачественных обменов через фильтры контекстуального сходства.
Чтобы протестировать полезность набора данных, исследователи настроили модуль для предсказания следующего ‘хода’ в диалоге, учитывая контекст разговора и изображения.

Графический интерфейс человека для оценки, используемый в исследовании.
Пять внешних наборов данных были использованы в качестве базового материала для 45k набора данных (который доступен на GitHub). Три из них являются текстовыми элементами: DailyDialog, вручную аннотированный многоходовой текстовый набор 2017 года; и EmpatheticDialogues и PersonaChat, оба из 2018 года. Два изображения-ориентированных набора данных, использованных в работе, были MS-COCO и Flicker30k.

Пары изображений и текста – JSON-схема фраз в наборе данных, связанных с изображениями (в этом примере) из базы данных изображений Microsoft COCO.
Замена текста на изображение для системы была обеспечена предварительно обученной сетью визуального семантического рассуждения (VSRN), разработанной в 2019 году в Университете Норtheastern в Бостоне. VSRN была настроена на ручную предварительную выборку фраз из текстовых наборов данных.
Установление связности
Связность исходных наборов данных была установлена путем разработки шести комбинаций каждого диалогового набора данных, связанных с экземплярами каждого изображения-набора данных, и оцененных за несколько раундов людьми.
Оценка человека была основана на трех критериях: последовательности контекста обмена; актуальности изображения для основной концепции, которую изображение пытается выразить; и степени, в которой изображение содержит ключевые объекты из целевого предложения.
Учитывая последний критерий, можно утверждать, что схема, которую исследователи решили использовать, в значительной степени исключила возможность юмористических, саркастических, абстрактных или метафизических возможностей для семантического значения изображения, которое может быть введено в текстовый разговор.
Однако это семинальная работа, и она должна начаться где-то, в то время как значительные усилия тратятся в другом месте в секторе обработки естественного языка (NLP), чтобы отобразить экземпляры сарказма, среди других менее осязаемых примеров отношения изображения и текста.
Тестирование
Чтобы протестировать генерацию данных, исследователи использовали трехчастную модель извлечения, основанную на исследовании Image-Chat 2020 года от Facebook. Модуль состоит из Resnext-101 в качестве кодировщика изображения; BERT от Google в качестве кодировщика текста; и настраиваемого модуля слияния для этих.
Система достигла 50,35 и 14,38 на задаче предсказания текущего и следующего предложения, улучшив базовую линию для каждой задачи.
Позже два исследователя были поручены создать 100 много модальных диалогов, вставив изображения в разговоры вручную, и запустив систему против этих ‘органических’ много модальных разговоров. Система смогла предсказать текущие и следующий ход обмена с высоким осознанием контекста даже для этих ad hoc примеров.













