Andersonův úhel

Učení AI rozumět a používat obrázky v dialogu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Jižní Koreje vyvinuli dataset, který má pomoci výzkumu AI při porozumění způsobu, jakým lidé používají obrázky v dialogu, a pomoci modelům přirozeného jazyka zúčastnit se tohoto nedávného vývoje v lidské komunikaci.

Článek z KAIST v Daedeok Innopolis uvádí, že výzkum takových multimodálních dialogových systémů za posledních deset let byl omezen datovými soubory a metodologiemi, které se soustředily na okrajové disciplíny, jako je vizuální otázka a odpověď a popis obrázků.

V těchto starších přístupech jsou obrázky vyhodnocovány mimo lexikální kontext konverzace, bez porozumění tomu, jak je dialog zlepšen a rozvinut pomocí obrázkových odpovědí, a bez mezioborového schématu pro dekódování příspěvků vizuálních příspěvků do diskurzu.

Obrázky jako první třídy dialogu

Mnoho z výše uvedených přístupů bylo iniciativami nebo vývojem z výzkumného oddělení Microsoftu, který v roce 2017 také prozkoumal téma multimodálních konverzací, které jsou spuštěny obrázkem, spíše než volným použitím obrázků jako dialogových komponentů.

Aby se řešil nedostatek výzkumných dat, jiho-korejští výzkumníci vyvinuli dataset 45 000 dialogových instancí, které zahrnují ad hoc použití obrázků, bez soustředění na virální ‘meme’ obrázky; ty, ačkoli jsou oblastí zájmu v jazykovém výzkumu, jsou pravděpodobně méně náročné, protože význam virálních meme může být odvozen snadněji prostřednictvím tisíců kontextových použití na sociálních médiích.

Vývoj ilustrací jako náhrady za text

Aby se vyvinula metodologie pro bilaterální transliteraci slov/frází a obrázků, jiho-korejští výzkumníci vyškolili systém strojového učení, aby nahradil části textové konverzace semanticky relevantním obrázkovým obsahem.

Architektura korejského systému pro generování datasetu pro multimodální dialogový výzkum. Zdroj: https://arxiv.org/pdf/2107.08685.pdf

Architektura korejského systému pro generování datasetu pro multimodální dialogový výzkum. Zdroj: https://arxiv.org/pdf/2107.08685.pdf

Předzpracování cílových frází zahrnovalo odstranění stop slov, která by mohla inhibovat předpověď následujícího kroku v konverzaci, a prořezání nižší kvality výměn pomocí kontextových filtrů podobnosti.

Pro testování užitku datasetu výzkumníci nastavili modul pro předpověď následujícího ‘kroku’ v dialogu, zatímco zohledňovali kontext konverzace a zapojené obrázky.

Lidský vyhodnocovací GUI použitý ve výzkumu.

Lidský vyhodnocovací GUI použitý ve výzkumu.

Pět externích datasetů bylo použito jako základ pro 45k dataset (který je dostupný na GitHubu). Tři jsou textově založené prvky: DailyDialog, ručně anotovaný multi-turn textový dataset z roku 2017; a Facebookův EmpatheticDialogues a PersonaChat, oba z roku 2018. Dva obrázkové datasety, které byly použity, byly MS-COCO a Flicker30k.

Obrázkové/textové páry – JSON schéma frází v datasetu, spojené s obrázky (v tomto příkladu) z Microsoftova COCO obrázkového databáze.

Obrázkové/textové páry – JSON schéma frází v datasetu, spojené s obrázky (v tomto příkladu) z Microsoftova COCO obrázkového databáze.

Text na obrázek nahrazení pro systém bylo poháněno předem naučenou Sítí vizuálního semantického rozumu (VSRN), vyvinutou v roce 2019 na Northeastern University v Bostonu. VSRN byl nastaven pro provoz na ručně předem vybraných frázích z přispívajících textových datasetů.

Stanovení koherence

Koherence zdrojových datasetů byla stanovena vyvinutím šesti kombinací každého dialogového datasetu, korelovat s instancemi v každém obrázkovém datasetu, a hodnocena přes několik kol lidskými hodnotiteli.

Lidské hodnocení bylo založeno na třech kritériích: konzistence s kontextem výměny; obrázková relevance k jádru konceptu, který obrázek snažil vyjádřit; a rozsah, v jakém obrázek obsahoval klíčové objekty z cílové věty.

Při zohlednění posledního kritéria by se dalo argumentovat, že schéma, na které se výzkumníci rozhodli, má z velké části vyloučeno možnost humorných, sarkastických, abstraktních nebo metafyzických možností pro semantický význam obrázku, který by mohl být vložen do textové konverzace.

Nicméně, jedná se o seminální práci a musí začít někde, zatímco jsou vynaloženy značné úsilí v sektoru zpracování přirozeného jazyka (NLP), aby zmapovaly instance sarkasmu, mezi jinými méně hmotnými příklady vztahu obrázek/text.

Testování

Pro testování datové generace frameworku výzkumníci použili tříčástový model pro načtení založený na Facebookově výzkumu Image-Chat z roku 2020. Modul se skládá z Resnext-101 jako obrázkového kódéru; Googleova BERT pro textový kódér; a vlastního fúzního modulu pro tyto.

Systém dosáhl 50,35 a 14,38 na aktuální a následující větné úkoly, zlepšující se oproti základnímu úkolu.

Později dva výzkumníci byli pověřeni vytvořením 100 multimodálních dialogů vložením obrázků do konverzací ručně a spuštěním systému proti těmto ‘organickým’ multimodálním konverzacím. Systém byl schopen předpovědět aktuální a následující výměny s vysokou povědomím o kontextu, i pro tyto ad hoc příklady.

Výsledky testování korejského multimodálního datasetu generace systému, ukazující konzistentně vysokou korelaci mezi text-obrázek podobností a lidskými založenými skóre na stejných datech.

Výsledky testování korejského multimodálního datasetu generace systému, ukazující konzistentně vysokou korelaci mezi text-obrázek podobností a lidskými založenými skóre na stejných datech.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai