Andersons Blickwinkel

Lehren von KI, Bilder in Dialogen zu verstehen und zu verwenden

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Forscher aus Südkorea haben eine Datenbank entwickelt, die darauf abzielt, die Forschung über das Verständnis von KI für die Art und Weise zu unterstützen, wie Menschen Bilder in Dialogen verwenden, und um natürliche Sprachmodelle zu ermöglichen, an diesem sehr aktuellen Entwicklungsprozess in der menschlichen Kommunikation teilzunehmen.

Die Studie, die von KAIST am Daedeok Innopolis stammt, weist darauf hin, dass die Forschung über solche multi-modale Dialogsysteme in den letzten zehn Jahren durch Datenbanken und Methoden behindert wurde, die auf Randdisziplinen wie visuelle Fragebeantwortung und Bildbeschriftung fokussiert sind.

In diesen älteren Ansätzen werden Bilder außerhalb des lexikalischen Kontexts einer Konversation bewertet, ohne Verständnis dafür, wie die Konversation durch Bildantworten verbessert und entwickelt wird, und ohne ein Schema zur Dekodierung der Beiträge visueller Elemente zur Diskussion.

Bilder als erste Klasse von Dialogfacetten

Viele der bisherigen Ansätze waren Initiativen oder Entwicklungen des Microsoft-Forschungsarms, der 2017 auch untersuchte, wie multimodale Konversationen begonnen werden, indem ein Bild verwendet wird, anstatt Bilder frei als Dialogkomponenten zu verwenden.

Um den Forschungsdatenmangel zu beheben, haben die südkoreanischen Forscher eine Datenbank von 45.000 Dialoginstanzen entwickelt, die die ad-hoc-Verwendung von Bildern beinhaltet, ohne sich auf virale ‘Meme’-Bilder zu konzentrieren; Letztere sind zwar ein Bereich von Interesse in der Sprachforschung, aber wahrscheinlich weniger herausfordernd, da die Bedeutung von viralen Memes leichter durch Tausende von Kontexten auf sozialen Medienplattformen abgeleitet werden kann.

Entwicklung von Illustrationen als Ersatz für Text

Um eine Methodik für die bilateralen Transliterationen von Worten/Phrasen in Bilder zu entwickeln, haben die südkoreanischen Forscher ein maschinelles Lernsystem trainiert, um Teile einer textbasierten Konversation in semantisch relevante Bildinhalte umzuwandeln.

Architektur des koreanischen Systems für die Generierung einer Datenbank für multimodale Dialogforschung. Quelle: https://arxiv.org/pdf/2107.08685.pdf

Architektur des koreanischen Systems für die Generierung einer Datenbank für multimodale Dialogforschung. Quelle: https://arxiv.org/pdf/2107.08685.pdf

Die Vorverarbeitung der Zielphrasen umfasste die Löschung von Stoppwörtern, die die Vorhersage des nächsten Schritts in der Konversation behindern könnten, und die Beschneidung von minderwertigen Austauschen durch kontextuelle Ähnlichkeitsfilter.

Um die Nützlichkeit der Datenbank zu testen, setzten die Forscher ein Modul ein, um den nächsten ‘Schritt’ im Dialog vorherzusagen, während sie den Kontext der Konversation und die beteiligten Bilder berücksichtigten.

Die von den Forschern verwendete menschliche Bewertungs-GUI.

Die von den Forschern verwendete menschliche Bewertungs-GUI.

Fünf externe Datenbanken wurden als Grundmaterial für die 45k-Datenbank verwendet (die auf GitHub verfügbar ist). Drei sind textbasierte Elemente: DailyDialog, eine manuell annotierte, mehrstufige textbasierte Menge aus dem Jahr 2017; und Facebooks EmpatheticDialogues und PersonaChat, beides aus dem Jahr 2018. Die zwei bildbasierten Datenbanken, die verwendet wurden, waren MS-COCO und Flicker30k.

Bild/Text-Paare – JSON-Schema von Phrasen in der Datenbank, assoziiert mit Bildern (in diesem Beispiel) aus Microsofts COCO-Bild-Datenbank.

Bild/Text-Paare – JSON-Schema von Phrasen in der Datenbank, assoziiert mit Bildern (in diesem Beispiel) aus Microsofts COCO-Bild-Datenbank.

Die Text-Bild-Ersetzung für das System wurde durch das vorgebildete Visuelle Semantische Reasoning-Netzwerk (VSRN) ermöglicht, das 2019 an der Northeastern University in Boston entwickelt wurde. VSRN wurde so eingestellt, dass es auf manuell vorausgewählten Phrasen aus den beitragenden Text-Datenbanken operiert.

Herstellung von Kohärenz

Die Kohärenz der Quelldatenbanken wurde durch die Entwicklung von sechs Kombinationen jeder Dialog-Datenbank hergestellt, die mit Instanzen in jeder Bild-Datenbank korreliert sind und über mehrere Runden von Menschen bewertet wurden.

Die menschliche Bewertung basierte auf drei Kriterien: Konsistenz zum Kontext des Austauschs; Bild-Relevanz zum Kernkonzept, das das Bild auszudrücken versucht; und das Ausmaß, in dem das Bild Schlüsselobjekte aus dem Ziel-Satz enthält.

Bei der Berücksichtigung der letztgenannten Kriterien könnte argumentiert werden, dass das Schema, das die Forscher ausgewählt haben, die Möglichkeit von humorvollen, sarkastischen, abstrakten oder metaphysischen Möglichkeiten für die semantische Bedeutung eines Bildes, das in eine Text-Konversation injiziert werden könnte, weitgehend ausgeschlossen hat.

Jedoch ist dies eine grundlegende Arbeit, und sie muss irgendwo beginnen, während erhebliche Anstrengungen in anderen Bereichen des Natural Language Processing (NLP) unternommen werden, um Beispiele für Sarkasmus zu kartieren, unter anderem weniger greifbare Beispiele für die Bild-Text-Beziehung.

Testen

Um den Daten-Generierungs-Rahmen zu testen, verwendeten die Forscher ein dreiteiliges Abrufmodell basierend auf Facebooks Image-Chat-Forschung aus dem Jahr 2020. Das Modul besteht aus Resnext-101 als Bild-Encoder; Google’s BERT für den Text-Encoder; und einem benutzerdefinierten Fusion-Modul für diese.

Das System erreichte 50,35 und 14,38 bei der Vorhersage des aktuellen und nächsten Satzes, was eine Verbesserung gegenüber dem Basiswert für jede Aufgabe darstellt.

Später wurden zwei Forscher beauftragt, 100 multimodale Dialoge zu erstellen, indem sie Bilder in Konversationen manuell einfügten und das System gegen diese ‘organischen’ multimodalen Konversationen liefen. Das System konnte aktuelle und nächste Schritte in der Konversation mit hoher Kontext-Awareness vorhersagen, sogar für diese ad-hoc-Beispiele.

Ergebnisse des Testens des koreanischen multimodalen Daten-Generierungssystems, die eine konsistent hohe Korrelation zwischen Text-Bild-Ähnlichkeit und menschlicher Frage-Scores auf den gleichen Daten zeigen.

Ergebnisse des Testens des koreanischen multimodalen Daten-Generierungssystems, die eine konsistent hohe Korrelation zwischen Text-Bild-Ähnlichkeit und menschlicher Frage-Scores auf den gleichen Daten zeigen.

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai