Andersons Blickwinkel

DALL-E 2s einzigartige Lösung für Doppeldeutigkeiten

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Jeder, der Italienisch gelernt hat, lernt früh, auf den Kontext zu achten, wenn er einen Besen beschreibt, weil das italienische Wort für dieses alltägliche Haushaltsgerät eine extrem unangemessene zweite Bedeutung als Verb* hat. Obwohl wir früh lernen, die semantische Zuordnung und (passende) Anwendbarkeit von Wörtern mit mehreren Bedeutungen zu entwirren, ist dies nicht eine Fähigkeit, die leicht an hyperskalige Bildsynthesesysteme wie DALL-E 2 und Stable Diffusion weitergegeben werden kann, da sie auf OpenAIs Contrastive Language-Image Pre-training (CLIP) -Modul angewiesen sind, der Objekte und ihre Eigenschaften eher locker (aber immer mehr Boden in der latenten Diffusionsbild- und Videosynthese gewinnt) behandelt.

Bei der Untersuchung dieser Lücke bietet eine neue Forschungszusammenarbeit der Bar-Ilan-Universität und des Allen Institute for Artificial Intelligence eine umfassende Studie über das Ausmaß, in dem DALL-E 2 zu solchen semantischen Fehlern neigt:

Doppeldeutigkeiten werden in DALL-E 2 in mehrere Objekte aufgeteilt - obwohl jedes latente Diffusionssystem solche Beispiele erzeugen kann. Im oberen rechten Bild ändert das Entfernen von 'Gold' aus dem Prompt die Fischart, während im Fall der 'Zebrastreifen' es notwendig ist, die Straßenoberfläche explizit anzugeben, um die duplizierte Assoziation zu entfernen. Quelle: https://export.arxiv.org/pdf/2210.10606

Doppeldeutigkeiten werden in DALL-E 2 in mehrere Interpretationen aufgeteilt – obwohl jedes latente Diffusionssystem solche Beispiele erzeugen kann. Im oberen rechten Bild ändert das Entfernen von ‘Gold’ aus dem Prompt die Fischart, während im Fall der ‘Zebrastreifen’ es notwendig ist, die Straßenoberfläche explizit anzugeben, um die duplizierte Assoziation zu entfernen. Quelle: https://export.arxiv.org/pdf/2210.10606

Die Autoren haben festgestellt, dass diese Tendenz, Wörter und Phrasen doppelt zu interpretieren, nicht nur allen CLIP-gesteuerten Diffusionsmodellen gemeinsam ist, sondern dass sie sich auch verschlimmert, wenn die Modelle auf immer größere Datenmengen trainiert werden. Die Studie bemerkt, dass “reduzierte” Versionen von Text-Bild-Modellen, einschließlich DALL-E Mini (jetzt Craiyon), diese Arten von Fehlern viel seltener produzieren, und dass Stable Diffusion auch weniger Fehler macht – aber nur, weil es sehr oft dem Prompt nicht folgt, was ein anderer Fehler ist.

Der einfache Prompt 'Datum' zwingt DALL-E 2, zwei der mehreren Bedeutungen des Wortes aufzurufen, während das Wort 'Fan' auch in zwei seiner semantischen Zuordnungen aufgeteilt wird, und im dritten Bild wird die Phrase 'Kegel' das nicht spezifizierte Essen im Prompt zuverlässig in Eiscreme umwandelt, das mit 'Kegel' assoziiert ist.

Der einfache Prompt ‘Datum’ zwingt DALL-E 2, zwei der mehreren Bedeutungen des Wortes aufzurufen, während das Wort ‘Fan’ auch in zwei seiner semantischen Zuordnungen aufgeteilt wird, und im dritten Bild wird die Phrase ‘Kegel’ das nicht spezifizierte Essen im Prompt zuverlässig in Eiscreme umwandelt, das mit ‘Kegel’ assoziiert ist.

Durch die Erklärung, wie wir effiziente lexikalische Trennungen durchführen, stellt die Studie fest:

‘Während Symbole – sowie Satzstrukturen – mehrdeutig sein können, ist diese Mehrdeutigkeit bereits aufgelöst, sobald eine Interpretation erstellt wurde. Zum Beispiel kann das Symbol “Fledermaus” in einer fliegenden Fledermaus als ein hölzerner Stock oder ein Tier interpretiert werden, unsere möglichen Interpretationen des Satzes sind jedoch entweder ein fliegender hölzerner Stock oder ein fliegender Fledermaus, aber nie beides gleichzeitig. Sobald das Wort “Fledermaus” in der Interpretation verwendet wurde, um ein Objekt (z.B. einen hölzernen Stock) zu bezeichnen, kann es nicht erneut verwendet werden, um ein anderes Objekt (ein Tier) in der gleichen Interpretation zu bezeichnen.’

DALL-E 2, so bemerkt die Studie, ist nicht auf diese Weise eingeschränkt:

'Eine Fledermaus fliegt über ein Baseball-Stadion' - das erste Bild stammt aus der Studie, die anderen drei wurden einfach durch Eingabe des gleichen Prompts in DALL-E 2 erhalten.

‘Eine Fledermaus fliegt über ein Baseball-Stadion’ – das erste Bild stammt aus der Studie, die anderen drei wurden einfach durch Eingabe des gleichen Prompts in DALL-E 2 erhalten.

Diese Eigenschaft wurde benannt ressourcensensitiv.

Die Studie identifiziert drei abweichende Verhaltensweisen, die DALL-E 2 aufweist: dass ein Wort oder eine Phrase interpretiert und effektiv in zwei verschiedene Entitäten aufgeteilt werden kann, wodurch ein Objekt oder Konzept in der gleichen Szene dargestellt wird; dass ein Wort als Modifikator von zwei verschiedenen Entitäten interpretiert werden kann (siehe die Beispiele ‘Goldfisch’ und andere oben); und dass ein Wort gleichzeitig als Modifikator und als alternative Entität interpretiert werden kann – wie im Prompt ‘ein Siegel öffnet einen Brief’:

'Ein Siegel öffnet einen Brief' - das erste Bild stammt aus der Studie, die drei benachbarten Bilder sind identische Reproduktionen aus DALL-E 2. Die photorealistischen Beispiele unten hatten den zusätzlichen Text 'Foto, Canon50, 85mm, F5.6, preisgekröntes Foto'.

‘Ein Siegel öffnet einen Brief’ – das erste Bild stammt aus der Studie, die drei benachbarten Bilder sind identische Reproduktionen aus DALL-E 2. Die photorealistischen Beispiele unten hatten den zusätzlichen Text ‘Foto, Canon50, 85mm, F5.6, preisgekröntes Foto’.

Die Autoren identifizieren zwei Fehlermodi für Diffusionsmodelle in diesem Zusammenhang: dass die Ergebnisse von Benutzerprompts mit sinnambigen Wörtern oft die konkreten Wörter zusammen mit einer Manifestation des Konzepts aufweisen; und Konzeptlecks, bei dem die Eigenschaften eines Objekts in ein anderes gerendertes Objekt “lecken”.

‘Insgesamt liefert die von uns untersuchte Phänomene Beweise für Einschränkungen in der sprachlichen Fähigkeit von DALLE-2 und eröffnet Wege für zukünftige Forschung, die herausfinden würde, ob diese aus Problemen mit der Textcodierung, dem generativen Modell oder beidem stammen. Im Allgemeinen kann der vorgeschlagene Ansatz auf andere Szenarien ausgeweitet werden, in denen der Dekodierprozess verwendet wird, um die induktive Voreingenommenheit und die Mängel von Text-Bild-Modellen aufzudecken.’

Mithilfe von 17 Wörtern, die DALL-E 2 dazu bringen, die Eingabe in mehrere Ausgaben aufzuteilen, stellten die Autoren fest, dass Homonym-Duplizierung in über 80% von 216 gerenderten Bildern auftrat.

Die Forscher verwendeten Reiz-Kontroll-Paare, um den Umfang zu untersuchen, in dem spezifische und möglicherweise übermäßig spezifische Sprache notwendig ist, um diese Duplizierungen zu verhindern. Für die Entitäts-Eigenschaftstests wurden 10 solcher Paare erstellt, und die Autoren bemerken, dass die Reiz-Prompts die geteilte Eigenschaft in 92,5% der Fälle hervorrufen, während der Kontroll-Prompt sie nur in 6,6% der Fälle hervorrufen.

‘Um zu demonstrieren, betrachten Sie ein Zebra und eine Straße, hier ist Zebra eine Entität, aber es modifiziert die Straße, und DALLE-2 erzeugt konstant Querungen, möglicherweise wegen der Ähnlichkeit der Zebra-Streifen mit einer Querung. Und in Übereinstimmung mit unserer Vermutung legt die Kontrolle ein Zebra und eine Schotterstraße eine Art von Straße fest, die normalerweise keine Querungen hat, und tatsächlich enthalten alle unsere Kontrollproben für diesen Prompt keine Querung.’

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai