Andersons Blickwinkel
Tiefes Lernen-Modelle könnten Schwierigkeiten haben, künstlich erstellte Bilder zu erkennen

Ergebnisse aus einem neuen Paper deuten darauf hin, dass State-of-the-Art-KI wesentlich weniger in der Lage ist, künstlich erstellte Bilder zu erkennen und zu interpretieren als Menschen, was in einer kommenden Ära, in der maschinelle Lernmodelle zunehmend auf synthetischen Daten trainiert werden und es nicht unbedingt bekannt ist, ob die Daten “echt” oder nicht sind, von Bedenken sein kann.

Hier sehen wir das resnext101_32x8d_wsl-Predictionsmodell, das in der ‘Bagel’-Kategorie Schwierigkeiten hat. In den Tests galt ein Erkennungsfehler als aufgetreten, wenn das Kernzielwort (in diesem Fall ‘Bagel’) nicht in den Top-5-Vorhersagen enthalten war. Quelle: https://arxiv.org/pdf/2208.10760.pdf
Die neue Forschung testete zwei Kategorien von computerbasierten Erkennungsframeworks: Objekterkennung und visuelle Fragebeantwortung (VQA).

Links: Erfolge und Misserfolge von Objekterkennungssystemen; rechts: VQA-Aufgaben, die darauf abzielen, das Verständnis von Szenen und Bildern in einer exploratorischeren und bedeutenderen Weise zu erforschen. Quellen: https://arxiv.org/pdf/2105.05312.pdf und https://arxiv.org/pdf/1505.00468.pdf
Von zehn State-of-the-Art-Modellen, die auf kuratierten Datensätzen getestet wurden, die von Bildsynthese-Frameworks wie DALL-E 2 und Midjourney generiert wurden, erreichte das beste Modell nur 60% und 80% Top-5-Genauigkeit bei den beiden Arten von Tests, während ImageNet, das auf nicht-synthetischen, realen Daten trainiert wurde, jeweils 91% und 99% in den gleichen Kategorien erreichen kann, während die menschliche Leistung typischerweise deutlich höher ist.
Bei der Behandlung von Problemen im Zusammenhang mit Verteilungsverschiebung (auch “Modell-Drift” genannt, bei dem Vorhersagemodelle eine verringerte Vorhersagekapazität erleben, wenn sie von Trainingsdaten auf “reale” Daten umgestellt werden), stellt das Paper fest:
‘Menschen können die generierten Bilder erkennen und Fragen dazu beantworten, ohne Schwierigkeiten. Wir kommen zu dem Schluss, dass a) tiefe Modelle Schwierigkeiten haben, den generierten Inhalt zu verstehen, und möglicherweise nach Feinabstimmung besser abschneiden, und b) es eine große Verteilungsverschiebung zwischen den generierten Bildern und den realen Fotografien gibt. Die Verteilungsverschiebung scheint kategorieabhängig zu sein.’
Angesichts der Menge an synthetischen Bildern, die bereits im Internet verfügbar sind, insbesondere nach der sensationellen Open-Source-Veröffentlichung des leistungsstarken Stable-Diffusion-Latent-Diffusions-Synthesemodells, ergibt sich die Möglichkeit, dass die Genauigkeit über die Jahre hinweg erheblich durch “unreale” Bilder beeinflusst werden könnte, wenn diese in branchenübliche Datensätze wie Common Crawl einfließen.
Obwohl synthetische Daten als potenzieller Retter des datenverhungerten computerbasierten Forschungsbereichs gehandelt werden, der oft an Ressourcen und Budgets für hyperskalige Kuratierung mangelt, ist die neue Flut von Stable-Diffusion-Bildern (zusammen mit dem allgemeinen Anstieg an synthetischen Bildern seit der Einführung und Kommerzialisierung von DALL-E 2) unwahrscheinlich, dass alle mit nützlichen Labels, Anmerkungen und Hashtags versehen sind, die sie als “falsch” kennzeichnen, wenn maschinelle Sehsysteme sie aus dem Internet sammeln.
Die Geschwindigkeit der Entwicklung in Open-Source-Bildsynthese-Frameworks hat unsere Fähigkeit, Bilder aus diesen Systemen zu kategorisieren, überholt, was zu wachsendem Interesse an “falschen Bild”-Erkennungssystemen geführt hat, ähnlich wie Deepfake-Erkennungssysteme, aber mit der Aufgabe, ganze Bilder anstelle von Gesichtsteilen zu bewerten.
Das neue Paper trägt den Titel Wie gut sind tiefe Modelle darin, die generierten Bilder zu verstehen?, und stammt von Ali Borji von dem San Franciscoer Maschinenlern-Startup Quintic AI.
Daten
Die Studie predatiert die Veröffentlichung von Stable Diffusion, und die Experimente verwenden Daten, die von DALL-E 2 und Midjourney über 17 Kategorien hinweg generiert wurden, darunter Elefant, Pilz, Pizza, Bretzel, Traktor und Hase.

Beispiele der Bilder, aus denen die getesteten Erkennungs- und VQA-Systeme herausgefordert wurden, den wichtigsten Schlüsselbegriff zu identifizieren.
Bilder wurden durch Web-Suchen und über Twitter beschafft, und, gemäß den Richtlinien von DALL-E 2 (zumindest zum damaligen Zeitpunkt), enthielten sie keine Bilder mit menschlichen Gesichtern. Nur Bilder von guter Qualität, die von Menschen erkennbar waren, wurden ausgewählt.
Zwei Bildersätze wurden kuratiert, einer für die Objekterkennung und einer für die VQA-Aufgaben.

Die Anzahl der Bilder in jeder getesteten Kategorie für die Objekterkennung.
Testen der Objekterkennung
Für die Objekterkennungstests wurden zehn Modelle getestet, die alle auf ImageNet trainiert wurden: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, und ResNext_WSL.
Einige der Klassen in den getesteten Systemen waren feiner unterteilt als andere, was die Anwendung von durchschnittlichen Ansätzen erforderlich machte. Zum Beispiel enthält ImageNet drei Klassen, die sich auf “Uhren” beziehen, und es war notwendig, eine Art willkürliche Metrik zu definieren, bei der die Aufnahme einer beliebigen “Uhr” in die Top-5-Labels für jedes Bild als Erfolg in diesem Fall angesehen wurde.

Modellleistung über 17 Kategorien hinweg.
Das beste Modell in dieser Runde war resnext101_32x8d_ws, das nahezu 60% für Top-1 (d. h. die Male, in denen seine bevorzugte Vorhersage aus fünf Vermutungen die richtige Konzeption im Bild war) und 80% für Top-5 (d. h. die gewünschte Konzeption war mindestens in den fünf Vermutungen des Modells über das Bild enthalten) erreichte.
Der Autor schlägt vor, dass die gute Leistung dieses Modells darauf zurückzuführen ist, dass es für die schwach überwachte Vorhersage von Hashtags in sozialen Medien trainiert wurde. Allerdings sind diese führenden Ergebnisse, so der Autor, deutlich unter dem, was ImageNet auf realen Daten erreichen kann, nämlich 91% und 99%. Er schlägt vor, dass dies auf eine große Diskrepanz zwischen der Verteilung von ImageNet-Bildern (die auch aus dem Web gesammelt werden) und generierten Bildern zurückzuführen ist.
Die fünf schwierigsten Kategorien für das System, in der Reihenfolge der Schwierigkeit, waren Drachen, Schildkröte, Eichhörnchen, Sonnenbrille und Helm. Das Paper bemerkt, dass die Drachen-Klasse oft mit Ballon, Fallschirm und Regenschirm verwechselt wird, obwohl diese Unterscheidungen für menschliche Beobachter trivial sind.
Bestimmte Kategorien, einschließlich Drachen und Schildkröte, verursachten ein universelles Versagen bei allen Modellen, während andere (insbesondere Bretzel und Traktor) fast universellen Erfolg bei den getesteten Modellen ergaben.

Polarisierende Kategorien: einige der Zielkategorien, die entweder alle Modelle verwirrten oder für alle Modelle leicht zu identifizieren waren.
Die Autoren vermuten, dass diese Ergebnisse darauf hindeuten, dass alle Objekterkennungsmodelle ähnliche Stärken und Schwächen aufweisen.
Testen der visuellen Fragebeantwortung
Als nächstes testete der Autor VQA-Modelle auf offene und freie VQA mit binären Fragen (d. h. Fragen, auf die nur “ja” oder “nein” geantwortet werden kann). Das Paper bemerkt, dass aktuelle State-of-the-Art-VQA-Modelle 95% Genauigkeit auf dem VQA-v2-Datensatz erreichen können.
Für diese Testphase curatierte der Autor 50 Bilder und formulierte 241 Fragen dazu, 132 davon mit positiven Antworten und 109 mit negativen. Die durchschnittliche FrageLänge betrug 5,12 Wörter.
Bei dieser Runde wurde das OFA-Modell verwendet, ein task-agnostisches und modality-agnostisches Framework, um die Aufgabenumfassendheit zu testen, und war kürzlich der führende Scorer im VQA-v2-Test-Standard-Set. OFA erreichte 77,27% Genauigkeit auf den generierten Bildern, verglichen mit seinem eigenen 94,7% Score im VQA-v2-Test-Standard-Set.

Beispiel-Fragen und Ergebnisse aus dem VQA-Teil der Tests. ‘GT” ist ‘Ground Truth’, d. h. die richtige Antwort.
Der Autor des Papiers schlägt vor, dass Teil des Grundes dafür sein könnte, dass die generierten Bilder semantische Konzepte enthalten, die im VQA-v2-Datensatz fehlen, und dass die Fragen, die für die VQA-Tests geschrieben wurden, möglicherweise schwieriger sind als der allgemeine Standard von VQA-v2-Fragen, obwohl er glaubt, dass der erste Grund wahrscheinlicher ist.
LSD im Datenstrom?
Meinung
Die neue Verbreitung von künstlich erstellten Bildern, die sofortige Konjunktionen und Abstraktionen von Kernkonzepten darstellen können, die in der Natur nicht existieren, und die mit herkömmlichen Methoden prohibitiv zeitaufwändig zu produzieren wären, könnte ein besonderes Problem für schwach überwachte Daten-Sammelsysteme darstellen, die möglicherweise nicht in der Lage sind, elegant zu versagen – größtenteils, weil sie nicht dafür ausgelegt waren, eine große Menge an ungelabelten synthetischen Daten zu verarbeiten.
In solchen Fällen kann es ein Risiko geben, dass diese Systeme einen Prozentsatz “merkwürdiger” synthetischer Bilder in falsche Kategorien einordnen, einfach weil die Bilder distinkte Objekte enthalten, die nicht wirklich zusammengehören.

‘Astronaut auf einem Pferd’ ist vielleicht das emblematischste Bild für die neue Generation von Bildsynthese-Systemen – aber diese ‘unrealen’ Beziehungen könnten in reale Erkennungssysteme gelangen, wenn nicht Vorsicht walten lässt. Quelle: https://twitter.com/openai/status/1511714545529614338?lang=en
Es sei denn, dies kann im Vorverarbeitungsstadium vor dem Training verhindert werden, könnten solche automatisierten Pipelines dazu führen, dass unwahrscheinliche oder sogar groteske Assoziationen in maschinelle Lernsysteme trainiert werden, was deren Effektivität beeinträchtigen und das Risiko birgt, hochrangige Assoziationen in nachgelagerte Systeme und Subklassen und Kategorien zu übertragen.
Alternativ könnten disjointe synthetische Bilder einen “abschreckenden Effekt” auf die Genauigkeit späterer Systeme haben, wenn neue oder geänderte Architekturen entstehen, die versuchen, ad-hoc-synthetische Bilder zu berücksichtigen, und zu weit gefasst sind.
In beiden Fällen könnten synthetische Bilder in der post-Stable-Diffusion-Ära ein Problem für den computerbasierten Forschungsbereich darstellen, dessen Bemühungen diese seltsamen Schöpfungen und Fähigkeiten ermöglichten – nicht zuletzt, weil sie die Hoffnung des Sektors gefährden, dass die Sammlung und Kuratierung von Daten eventually viel automatisierter und weniger teuer und zeitaufwändig sein kann, als es derzeit der Fall ist.
Erstveröffentlicht am 1. September 2022.












