Andersonの視点
ダイアログにおける画像の理解と使用をAIに教える

韓国の研究者は、人間がダイアログで画像を使用する方法を理解するためのデータセットを開発し、自然言語モデルがこの人間のコミュニケーションの最近の発展に参加できるようにしました。
KAISTのDaedeok Innopolisからの論文によると、過去10年間の多モーダルダイアログシステムに関する研究は、視覚質問回答や画像キャプションなどの周辺分野に焦点を当てたデータセットと方法論によって妨げられてきました。
これらの古いアプローチでは、画像は会話の語彙的コンテキストの外で評価され、画像応答によって会話がどのように強化され開発されるかを理解できず、視覚的貢献が談話にどのように影響するかを解釈するためのクロスドメインスキーマもありません。
ダイアログの第一級ファセットとしての画像
これまでの多くのアプローチは、2017年に画像によって開始される多モーダル会話を検討したMicrosoftのAI研究部門からの取り組みでした。画像をダイアログのコンポーネントとして自由に使用するのではなく、画像によって開始される会話に焦点を当てました。
研究データの不足を補うために、韓国の研究者は、画像のアドホック使用を含む45,000のダイアログインスタンスのデータセットを開発しました。データセットは、ウイルス性「ミーム」画像に焦点を当てていません。ミームは言語研究の分野では関心のあるトピックですが、ソーシャルメディアプラットフォームでの数千のコンテキスト内使用を通じてミームの意味をより簡単に推測できるため、チャレンジは少ないと考えられます。
テキストの代替としてのイラストの開発
単語/フレーズ>画像の双方向の翻字を実現する方法論を開発するために、韓国の研究者は、テキストベースの会話の一部を意味的に関連する画像コンテンツに置き換えるようにマシンラーニングシステムをトレーニングしました。
ターゲットフレーズの前処理には、会話の次の部分の予測を妨げる可能性のあるストップワードの削除と、コンテキストの類似性フィルタを介した低品質の交換の切り捨てが含まれました。
システムの有用性をテストするために、研究者は、会話のコンテキストと画像を考慮して、ダイアログの次の「ターン」を予測するモジュールを設定しました。

研究で使用された人間評価GUI。
45,000のデータセット(GitHubで利用可能)のベースマテリアルとして、5つの外部データセットが使用されました。3つはテキストベースの要素です:DailyDialog(2017年の手動アノテーション付きマルチターンテキストベースのセット);およびFacebookのEmpatheticDialoguesとPersonaChat(両方とも2018年)です。使用された2つの画像ベースのデータセットは、MS-COCOとFlicker30kです。

画像/テキストペア – データセットのフレーズのJSONスキーマ、MicrosoftのCOCO画像データベース(この例)の画像と関連付けられたもの。
システムのテキストから画像への置き換えは、2019年にボストンのノースイースタン大学で開発された事前トレーニング済みのVisual Semantic Reasoning Network(VSRN)によって推進されました。VSRNは、寄付テキストデータセットからの手動で事前に選択されたフレーズで動作するように設定されました。
一貫性の確立
ソースデータセットの一貫性は、各ダイアログデータセットの6つの組み合わせを開発し、画像データセットのインスタンスと関連付けて、複数のラウンドで人間によって評価することで確立されました。
人間のスコアリングは、交換のコンテキストへの一貫性、画像が表現しようとしている核心的な概念への画像の関連性、および画像がターゲット文からキーオブジェクトを含む程度の3つの基準に基づいていました。
後者の基準を考慮すると、研究者が選択したスキーマは、テキスト会話に注入される可能性のあるユーモア、皮肉、抽象的、または形而上学的な画像の意味の可能性を大幅に無視している可能性があると主張できます。
しかし、これは先駆的な研究であり、どこかから始める必要があります。自然言語処理(NLP)セクターの他の場所では、ソーシャルメディアでの皮肉の例をマッピングするなどの、画像/テキスト関係のより無形な例への取り組みが行われています。
テスト
データ生成フレームワークをテストするために、研究者は、Facebookの2020年のImage-Chat研究に基づく3部構成のリトリーバルモデルを使用しました。モジュールは、Resnext-101を画像エンコーダーとして、GoogleのBERTをテキストエンコーダーとして、そしてカスタムのフュージョンモジュールとして使用しました。
システムは、現在と次の文予測タスクでそれぞれ50.35と14.38を達成し、各タスクのベースラインを改善しました。
後に、2人の研究者は、画像を会話に手動で挿入して100の多モーダルダイアログを作成し、システムをこれらの「オーガニック」多モーダル会話に対して実行するよう指示されました。システムは、コンテキストの認識度が高いまま、現在と次のターンの交換を予測することができました。














