Unghiul lui Anderson

Învățarea inteligenței artificiale să înțeleagă și să utilizeze imagini în dialog

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetători din Coreea de Sud au dezvoltat un set de date menit să ajute la cercetarea înțelegerii de către inteligența artificială a modului în care oamenii utilizează imagini în dialog și să ajute la dezvoltarea de modele de limbaj natural care să poată participa la acest tip de comunicare umană recent.

Studiul, publicat de KAIST la Daedeok Innopolis, arată că cercetările din ultimii zece ani privind sistemele de dialog multi-modale au fost limitate de seturile de date și metodologiile care se concentrează pe discipline periferice, cum ar fi răspunsurile la întrebări vizuale și titlurile de imagini.

În aceste abordări mai vechi, imaginile sunt evaluate în afara contextului lexical al unei conversații, fără a înțelege modul în care dialogul este îmbunătățit și dezvoltat prin răspunsuri la imagini, și fără a avea un schema transversală pentru decodificarea contribuțiilor vizuale la discurs.

Imaginile ca facetă principală a dialogului

Multe dintre abordările menționate până acum au fost inițiative sau dezvoltări ale brațului de cercetare al lui Microsoft, care în 2017 a examinat și subiectul conversațiilor multi-modale care încep cu o imagine, în loc să utilizeze imagini ca componente ale dialogului.

Pentru a aborda lipsa de date de cercetare, cercetătorii coreeni au dezvoltat un set de date cu 45.000 de exemple de dialog care implică utilizarea ad-hoc a imaginilor, fără a se concentra pe imagini “meme” virale; acestea din urmă, deși sunt un domeniu de interes în cercetarea limbajului, sunt mai puțin provocatoare, deoarece înțelesul lor poate fi dedus mai ușor prin mii de utilizări în context pe platformele de socializare.

Dezvoltarea de ilustrații ca substitut pentru text

Pentru a dezvolta o metodologie pentru transliterarea bilaterală a cuvintelor/frazelor în conținut de imagine, cercetătorii coreeni au antrenat un sistem de învățare automată pentru a înlocui părți ale unei conversații textuale cu conținut de imagine semantic relevant.

Arhitectura sistemului coreean pentru generarea unui set de date pentru cercetarea dialogului multi-modal.

Arhitectura sistemului coreean pentru generarea unui set de date pentru cercetarea dialogului multi-modal. Sursa: https://arxiv.org/pdf/2107.08685.pdf

Pre-procesarea frazelor țintă a implicat ștergerea cuvintelor de oprire care ar putea inhiba predicția următoarei fraze în conversație, și tăierea schimburilor de calitate inferioară prin filtre de similaritate contextuală.

Pentru a testa utilitatea setului de date, cercetătorii au setat un modul pentru a prezice următoarea “rotire” în dialog, luând în considerare contextul conversației și imaginile implicate.

Interfața de evaluare umană utilizată în cercetare.

Interfața de evaluare umană utilizată în cercetare.

Cinci seturi de date externe au fost utilizate ca material de bază pentru setul de date de 45.000 de exemple (care este disponibil pe GitHub). Trei dintre ele sunt elemente textuale: DailyDialog, un set text multioral annotat manual din 2017; și EmpatheticDialogues și PersonaChat, ambele din 2018. Cele două seturi de date cu imagini utilizate au fost MS-COCO și Flicker30k.

Perechi imagine/text – schema JSON a frazelor din setul de date, asociate cu imagini (în acest exemplu) din baza de date de imagini Microsoft COCO.

Perechi imagine/text – schema JSON a frazelor din setul de date, asociate cu imagini (în acest exemplu) din baza de date de imagini Microsoft COCO.

Înlocuirea textului cu imagine pentru sistem a fost realizată prin utilizarea rețelei pre-antrenate Visual Semantic Reasoning Network (VSRN), dezvoltată în 2019 la Universitatea Northeastern din Boston. VSRN a fost setat să funcționeze pe fraze pre-selecționate manual din seturile de date text.

Stabilirea coerenței

Coerența seturilor de date sursă a fost stabilită prin dezvoltarea a șase combinații ale fiecărui set de date de dialog, corelate cu exemple din fiecare set de date de imagini, și evaluate de-a lungul mai multor runde de către oameni.

Evaluarea umană s-a bazat pe trei criterii: consistența cu contextul schimbului; relevanța imaginii pentru conceptul central pe care imaginea încearcă să-l exprime; și măsura în care imaginea conține obiecte cheie din fraza țintă.

Luând în considerare ultimul criteriu, se poate argumenta că schema pe care cercetătorii au decis să o utilizeze a descartat în mare măsură posibilitatea de a include posibilități umoristice, sarcastice, abstracte sau metafizice pentru semnificația semantică a unei imagini care ar putea fi injectată într-o conversație text.

Cu toate acestea, aceasta este o lucrare seminală, și trebuie să înceapă de undeva, în timp ce eforturi considerabile sunt depuse în altă parte în sectorul Procesării Limbajului Natural (NLP) pentru a cartografia instanțelor de sarcasm, printre alte exemple mai puțin tangibile ale relației imagine/text.

Testarea

Pentru a testa cadrul de generare a datelor, cercetătorii au utilizat un model de recuperare în trei părți, bazat pe cercetarea Image-Chat a lui Facebook din 2020. Modulul este compus din Resnext-101 ca encoder de imagine; BERT de la Google pentru encoderul de text; și un modul de fuziune personalizat pentru acestea.

Sistemul a obținut scoruri de 50,35 și 14,38 la sarcinile de predicție a propoziției curente și următoare, îmbunătățind rezultatele de bază pentru fiecare sarcină.

Mai târziu, doi cercetători au fost însărcinați să creeze 100 de dialoguri multi-modale prin inserarea de imagini în conversații manual, și să ruleze sistemul împotriva acestor “dialoguri organice” multi-modale. Sistemul a fost capabil să prezică schimburile curente și următoare cu o conștientizare ridicată a contextului, chiar și pentru aceste exemple ad-hoc.

Rezultatele testării sistemului coreean de generare a setului de date pentru dialog multi-modal, arătând o corelație ridicată și consistentă între similaritatea text-imagină și scorurile bazate pe întrebări umane pe aceleași date.

Rezultatele testării sistemului coreean de generare a setului de date pentru dialog multi-modal, arătând o corelație ridicată și consistentă între similaritatea text-imagină și scorurile bazate pe întrebări umane pe aceleași date.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai