Andersons Blickwinkel

Änderung von Geschlecht und Rasse in Bildsuchergebnissen mit Machine Learning

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Eine Forschungskooperation zwischen der UC San Diego und Adobe (ADBE ) Research hat eine innovative und proaktive Lösung für den Mangel an Rassen- und Geschlechtervielfalt in Bildsuchergebnissen für traditionell von WASP-dominierten Berufen vorgeschlagen: die Verwendung von Generative Adversarial Networks (GANs), um nicht-reale Bilder von “voreingenommenen” Berufen zu erstellen, bei denen das Geschlecht und/oder die Rasse des Subjekts geändert wird.

In diesem Beispiel aus dem neuen Paper haben die Forscher Eingabeeigenschaften für ein gewünschtes Foto eingegeben, das entweder nicht in einem typischen Korpus verfügbarer Bildmaterial repräsentiert ist oder auf unangemessene Weise dargestellt wird (z. B. sexualisiert oder in einer anderen unangemessenen Darstellung). Quelle

In diesem Beispiel aus dem neuen Paper haben die Forscher Eingabeeigenschaften für ein gewünschtes Foto eingegeben, das entweder nicht in einem typischen Korpus verfügbarer Bildmaterial repräsentiert ist oder auf unangemessene Weise dargestellt wird (z. B. sexualisiert oder in einer anderen unangemessenen Darstellung). Quelle

In einem neuen Paper mit dem Titel Erzeugung und Kontrolle von Vielfalt in der Bildsuche schlagen die Autoren vor, dass es eine Grenze für die Korrektur von Ungleichgewichten in voreingenommenen Bild-/Merkmalsklassen wie Installateur, Maschinenbediener, Software-Ingenieur und vielen anderen gibt – und dass die Erhöhung der Rassen- und Geschlechtervielfalt mit synthetischen Daten der Weg nach vorne für diese Herausforderung sein könnte.

‘Die Verfolgung einer utopischen Welt erfordert, dass Benutzern die Möglichkeit gegeben wird, jeden Beruf mit vielfältigen Rassen- und Geschlechtsmerkmalen darzustellen. Die begrenzte Auswahl an bestehendem Inhalt für bestimmte Kombinationen von Beruf, Rasse und Geschlecht stellt eine Herausforderung für Inhaltsanbieter dar. Aktuelle Forschung, die sich mit Voreingenommenheit in der Suche beschäftigt, konzentriert sich hauptsächlich auf Re-Ranking-Algorithmen.

‘Allerdings können diese Methoden keinen neuen Inhalt erstellen oder die Gesamtlage der geschützten Attribute in Fotos ändern. Um diese Probleme zu beheben, schlagen wir eine neue Aufgabe der hochauflösenden Bildgenerierung vor, die auf mehreren Attributen aus unbalancierten Datensätzen basiert. ‘

Um dies zu erreichen, haben die Autoren mit verschiedenen GAN-basierten Bildsynthesesystemen experimentiert und schließlich eine Architektur auf der Grundlage von StyleGan2 entwickelt.

Aus den ergänzenden Materialien des Papiers, zwei Beispiele für die 'Ausgleich' von bildbasierten Darstellungen von voreingenommenen Berufen, in diesem Fall 'Zimmermann' und 'Maschinenbediener'. Quelle

Aus den ergänzenden Materialien des Papiers, zwei Beispiele für die ‘Ausgleich’ von bildbasierten Darstellungen von voreingenommenen Berufen, in diesem Fall ‘Zimmermann’ und ‘Maschinenbediener’. Quelle

Nicht ausreichend oder unangemessen dargestellt

Die Forscher betrachten die Herausforderung in Bezug auf ein reales Suchergebnis für Installateur* auf Google Bildsuche, wobei sie feststellen, dass die Bildergebnisse von jungen weißen Männern dominiert werden.

Aus dem Paper, ausgewählte Ergebnisse für 'Installateur' in Google Bildsuche, Januar 2021.

Aus dem Paper, ausgewählte Ergebnisse für ‘Installateur’ in Google Bildsuche, Januar 2021.

Die Autoren bemerken, dass ähnliche Anzeichen von Voreingenommenheit für eine Reihe von Berufen auftreten, wie z. B. ‘Büroangestellter’, ‘Reinigungskraft’ und ‘Maschinenbediener’, mit entsprechenden Voreingenommenheiten für Alter, Geschlecht und Rasse.

‘Unerwarteterweise gibt es aufgrund solcher gesellschaftlicher Voreingenommenheit einige Kombinationen von Rasse und Geschlecht, die nur wenige oder keine Bilder in einem Inhaltsrepository haben. Zum Beispiel fanden wir bei der Suche nach ‘weiblich, schwarz (oder afroamerikanisch) Maschinenbediener’ oder ‘männlich, asiatisch, Büroangestellter’ keine relevanten Bilder auf [Google Bildsuche].

‘Darüber hinaus kann in seltenen Fällen eine bestimmte Kombination von Geschlecht und Rasse dazu führen, dass Einzelpersonen unangemessen dargestellt werden. Wir beobachteten dieses Verhalten bei Suchanfragen wie ‘weiblich, asiatisch, Installateur’ oder ‘weiblich, schwarz (oder afroamerikanisch), Sicherheitswachmann.’

Das Paper zitiert eine andere akademische Zusammenarbeit aus dem Jahr 2014, in der Forscher die Top-400-Bildsuchergebnisse für 96 Berufe gesammelt haben. Diese Arbeit ergab, dass Frauen nur 37% der Ergebnisse ausmachten und anti-stereotype Bilder nur 22%. Eine Studie von 2019 aus Yale ergab, dass fünf Jahre diese Prozentsätze auf 45% und 30% erhöht hatten.

Darüber hinaus klassifizierte die Studie von 2014 die Sexualisierung von Personen in bestimmten Berufen in Bildsuchergebnissen als das Sexy-Carpenter-Problem, wobei solche unangemessenen Klassifizierungen möglicherweise die Ergebnisse für Berufserkennung verzerren könnten.

Das große Bild

Die primäre Herausforderung für die Autoren bestand darin, ein GAN-basiertes Bildsynthesesystem zu entwickeln, das in der Lage ist, 1024×1024-Auflösungsbilder auszugeben, da bei dem aktuellen Stand der Technik in GAN- und Encoder/Decoder-basierten Bildsynthesesystemen 512×512 bereits sehr luxuriös ist. Alles, was höher wäre, würde tendenziell durch Aufskalieren des Endausgabebildes erreicht, was Zeit und Rechenressourcen kostet und möglicherweise die Authentizität der generierten Bilder beeinträchtigt.

Die Autoren erklären jedoch, dass niedrigere Auflösungen nicht mit der erforderlichen Authentizität in der Bildsuche rechnen können und experimentierten mit verschiedenen GAN-Rahmenwerken, die in der Lage sind, hochauflösende Bilder auf Anfrage mit akzeptablem Authentizitätslevel auszugeben.

Als die Entscheidung getroffen wurde, StyleGan2 zu verwenden, wurde deutlich, dass das Projekt eine größere Kontrolle über Submerkmale des generierten Ausgabebildes (wie Rasse, Beruf und Geschlecht) benötigen würde, als eine Standardimplementierung zulässt. Daher verwendeten die Autoren eine multi-klassige Bedingung, um den Generierungsprozess zu erweitern.

Die Architektur des spezifizierenden Bildgenerators, die die Autoren erklären, nicht spezifisch für StyleGAN2 ist, sondern auf eine Reihe von Generator-Rahmenwerken angewendet werden kann.

Die Architektur des spezifizierenden Bildgenerators, die die Autoren erklären, nicht spezifisch für StyleGAN2 ist, sondern auf eine Reihe von Generator-Rahmenwerken angewendet werden kann.

Um die Faktoren Rasse, Geschlecht und Beruf zu kontrollieren, injiziert die Architektur eine einmalige Kodierung dieser konkatinierten Merkmale in den y-Vektor. Danach wird ein Feedforward-Netzwerk verwendet, um diese Merkmale zu integrieren, damit sie nicht zur Generierungszeit ignoriert werden.

Die Autoren bemerken, dass es harte Grenzen für die Manipulation von StyleGAN2 auf diese Weise gibt und dass feinere Versuche, die Ergebnisse zu ändern, zu schlechterer Bildqualität und sogar Modus-Kollaps führen können.

Diese Abhilfen lösen jedoch nicht die impliziten Voreingenommenheitsprobleme in der Architektur, die die Forscher durch Übersampling unterrepräsentierter Entitäten aus dem Datensatz angehen mussten, ohne jedoch das Risiko des Überanpassens zu riskieren, das die Flexibilität der generierten Bildströme beeinträchtigen würde.

Daher passten die Autoren StyleGAN2-ADA an, das Adaptive Discriminator Augmentation (ADA) verwendet, um zu verhindern, dass der Diskriminator überanpasst.

Datengenerierung und -bewertung

Da das Ziel des Projekts darin besteht, neue, synthetisierte Daten zu generieren, wählten die Forscher die Methodik des 2014-Projekts und wählten eine Reihe von Zielberufen aus, die eine hohe Rassen- und Geschlechtervoreingenommenheit aufweisen. Die ausgewählten Berufe waren ‘Geschäftsführer’, ‘Büroangestellter’, ‘Krankenpfleger’, ‘Bauer’, ‘Militärperson’, ‘Sicherheitswachmann’, ‘LKW-Fahrer’, ‘Reinigungskraft’, ‘Zimmermann’, ‘Installateur’, ‘Maschinenbediener’, ‘Technischer Support’, ‘Software-Ingenieur’ und ‘Schriftsteller’.

Die Autoren wählten diese Berufe nicht nur aufgrund des Ausmaßes der wahrgenommenen Voreingenommenheit in Bildsuchergebnissen aus, sondern auch, weil die meisten von ihnen eine Art visuelles Merkmal enthalten, das für den Beruf codiert ist, wie z. B. eine Uniform oder die Anwesenheit spezifischer Ausrüstung oder Umgebungen.

Das Dataset wurde von 10.000 Bildern aus der Adobe Stock-Bibliothek gespeist, die in der Regel eine Bewertung von 95% oder besser erhielten, wenn sie versuchten, einen Beruf zu klassifizieren.

Da viele der Bilder nicht hilfreich für die Zielgabe waren (d. h., sie enthielten keine Menschen), war manuelles Filtern notwendig. Danach wurde ein ResNet32-basierter Klassifizierer, der auf FairFace vor trainiert war, verwendet, um die Bilder nach Geschlecht und Rasse zu kennzeichnen, wobei eine durchschnittliche Genauigkeit von 95,7% für das Geschlecht und 81,5% für die Rasse erzielt wurde. Somit erhielten die Forscher Bildkennzeichnungen für die Attribute Geschlecht: Männlich, Weiblich, Rasse: Weiß, Schwarz, Asien und andere Rassen.

Modelle wurden in TensorFlow mit StyleGAN2 und StyleGAN2-ADA als Kernnetzwerke erstellt. Die Vortrainierung wurde mit den vortrainierten Gewichten von StyleGAN2 auf dem NVIDIA’s Flickr-Faces-HQ-Dataset (FFHQ) durchgeführt, das mit 34.000 berufsspezifischen Bildern ergänzt wurde, die die Autoren in ein separates Dataset namens Uncurated Stock-Occupation HQ (U-SOHQ) gesammelt hatten.

Ein Beispiel für eine HIT aus der Amazon Mechanical Turk-Humanbewertung.

Ein Beispiel für eine HIT aus der Amazon Mechanical Turk-Humanbewertung.

Bilder wurden unter vier Konfigurationen der Architektur generiert, wobei Uniform+ schließlich die besten Bewertungen sowohl in FID (automatisierte Bewertung) als auch in der anschließenden Bewertung durch Amazon Mechanical Turk-Arbeiter erhielt. Kombiniert mit der KlassifizierungsGenauigkeit verwendeten die Autoren dies als Kernmetrik für ihre eigene Metrik, die Attribute-Matching-Score-Metrik.

Humanbewertung von Bildern, die mit verschiedenen Methoden generiert wurden, wobei die Uniform+-Methode die überzeugendste und somit die Grundlage für ein neues Dataset war.

Humanbewertung von Bildern, die mit verschiedenen Methoden generiert wurden, wobei die Uniform+-Methode die überzeugendste und somit die Grundlage für ein neues Dataset war.

Das Paper gibt nicht an, ob Stock-Occupation-HQ, das vollständige Dataset, das aus Uniform+ abgeleitet wurde, öffentlich zugänglich gemacht wird, aber es enthält 8.113 HQ-Bilder (1024×1024).

Diffusion

Das neue Paper beschäftigt sich nicht explizit mit der Frage, wie synthetisierte, ‘neu ausgewogene’ Bilder in den Umlauf gebracht werden könnten. Es ist anzunehmen, dass das Einbringen neuer (kostenloser) Computer-Vision-Datensätze mit den von den Autoren erstellten Bildern, die Voreingenommenheit ausgleichen, das Problem der Voreingenommenheit lösen würde, aber auch Hindernisse für andere Arten von Forschung darstellen könnte, die die Bewertung von Geschlecht und Rasse in ‘realen’ Szenarien untersuchen, in denen synthetische Bilder mit realen Bildern vermischt werden.

Synthetische Datenbanken wie die von den Forschern erstellte könnten vermutlich kostenlos als hochauflösende Stock-Bilder zur Verfügung gestellt werden, wobei diese kostengünstige Anreiz als Motor der Diffusion dienen könnte.

Das Projekt beschäftigt sich nicht mit altersbedingter Voreingenommenheit, was vermutlich ein potenzielles Thema für zukünftige Forschung sein könnte.

 

* Die Suche wurde am 5. Januar 2022 durchgeführt, die Suche, die in dem Paper zitiert wird, wurde im Januar 2021 durchgeführt.

 

Erstveröffentlichung am 5. Januar 2022.

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai