Andersons Blickwinkel
Die Risiken von “Vibe”-basierten Bildannotationen

Obwohl sie nur ein paar Dollar (oder sogar nichts) verdienen, kÃķnnen die unbekannten Menschen, die Bilder fÞr âschÃĪdlicheâ Inhalte bewerten, mit ihren Entscheidungen dein Leben verÃĪndern. Jetzt scheint ein neues Papier von Google zu suggerieren, dass diese Annotatoren ihre eigenen Regeln dafÞr erstellen, was âschÃĪdlichâ oder anstÃķÃig ist â unabhÃĪngig davon, wie merkwÞrdig oder persÃķnlich ihre Reaktionen auf ein bestimmtes Bild sein mÃķgen. Was kÃķnnte schiefgehen?
Â
Meinung Diese Woche brachte eine neue Zusammenarbeit zwischen Google Research und Google Mind nicht weniger als 13 Mitwirkende zusammen, um ein neues Papier zu erstellen, das erforscht, ob die âinstinktiven GefÞhleâ von Bildannotatoren berÞcksichtigt werden sollten, wenn Menschen Bilder fÞr Algorithmen bewerten, auch wenn ihre Reaktionen nicht mit etablierten Bewertungsstandards Þbereinstimmen.
Dies ist wichtig fÞr dich, weil das, was Rater und Annotatoren als anstÃķÃig durch Konsens finden, tendenziell in automatisierte Zensur- und Moderationssysteme und in die Kriterien fÞr âobszÃķneâ oder âinakzeptableâ Materialien, in Gesetzen wie dem neuen NSFW-Feuerwall* des Vereinigten KÃķnigreichs (eine Version davon kommt bald nach Australien), und in Inhaltsbewertungssystemen auf sozialen Medienplattformen und in anderen Umgebungen, aufgenommen wird.
Je breiter die Kriterien fÞr AnstÃķÃigkeit sind, desto breiter ist das Potenzial fÞr Zensur.
Vibe-Zensur
Das ist nicht der einzige Standpunkt, den das neue Papier hat; es findet auch heraus, dass Menschen, die Bilder bewerten, oft strenger sind, was sie denken, dass andere Menschen anstÃķÃig finden kÃķnnten; und dass Bilder mit schlechter QualitÃĪt oft Sicherheitsbedenken hervorrufen, obwohl die BildqualitÃĪt nichts mit dem Bildinhalt zu tun hat.
Am Ende des Papiers betont es diese beiden Ergebnisse, als ob die zentrale Position des Papiers fehlgeschlagen wÃĪre, aber die Forscher verpflichtet waren, es dennoch zu verÃķffentlichen.
Obwohl das nicht ungewÃķhnlich ist, ergibt das Papier bei sorgfÃĪltiger LektÞre eine noch unheilvollere UnterstrÃķmung: dass Annotierungspraktiken mÃķglicherweise das adoptieren kÃķnnten, was ich nur als Vibe-Annotieren beschreiben kann:
âUnsere Ergebnisse deuten darauf hin, dass bestehende Rahmenbedingungen subjektive und kontextuelle Dimensionen wie emotionale Reaktionen, implizite Urteile und kulturelle Interpretationen von Schaden berÞcksichtigen mÞssen. Die hÃĪufige Verwendung emotionaler Sprache durch Annotatoren und ihre Abweichung von vordefinierten Schadenslabels heben LÞcken in aktuellen Bewertungspraktiken hervor.
âDie Erweiterung von Annotierungsrichtlinien, um illustrierte Beispiele von vielfÃĪltigen kulturellen und emotionalen Interpretationen zu umfassen, kann helfen, diese LÞcken zu schlieÃen.â

Das kaum illustrierte neue Papier beginnt mit Beispielen, die fÞr den durchschnittlichen Leser unmissverstÃĪndlich und sympathisch sind, obwohl das tatsÃĪchliche Kernmaterial viel mehr Fragen aufwirft. Hier sehen wir unter jedem Bild die emotionalen Reaktionen der Annotatoren fÞr ihre jeweiligen Bilder. Quelle: https://arxiv.org/pdf/2507.16033
ZunÃĪchst klingt dies wie ein Vorschlag, das, was âSchadenâ in einem Bild ausmacht, zu erweitern und besser zu quantifizieren â eine lobenswerte Verfolgung; aber das Papier wiederholt mehrmals, dass dies weder wÞnschenswert noch (notwendigerweise) machbar ist:
âUnsere Ergebnisse deuten darauf hin, dass bestehende Rahmenbedingungen subjektive und kontextuelle Dimensionen wie emotionale Reaktionen, implizite Urteile und kulturelle Interpretationen von Schaden berÞcksichtigen mÞssen. Die hÃĪufige Verwendung emotionaler Sprache durch Annotatoren und ihre Abweichung von vordefinierten Schadenslabels heben LÞcken in aktuellen Bewertungspraktiken hervor.
âDie Erweiterung von Annotierungsrichtlinien, um illustrierte Beispiele von vielfÃĪltigen kulturellen und emotionalen Interpretationen zu umfassen, kann helfen, diese LÞcken zu schlieÃen [âĶ]
â[âĶ] Der Prozess, durch den Annotatoren Þber zweideutige Bilder nachdenken, spiegelt oft ihre persÃķnlichen, kulturellen und emotionalen Perspektiven wider, die schwierig zu strukturieren oder zu standardisieren sind.â
Es ist schwierig zu sehen, wie âDie Erweiterung von Annotierungsrichtlinien, um illustrierte Beispiele von vielfÃĪltigen kulturellen und emotionalen Interpretationen zu umfassenâ in ein rationales Bewertungssystem passt; die Autoren kÃĪmpfen darum, diesen Punkt zu klÃĪren oder eine deutliche Theorie zu formulieren, indem sie das Material mehrmals angreifen, aber nie die Oberhand gewinnen. In dieser Hinsicht scheint ihre zentrale These selbst âvibeâ-generiert, auch wenn sie mit nicht greifbaren Psychologien zu tun hat.
Offensichtlich scheint es mir, dass die Erweiterung der Annotierungs-Pipeline, um Kriterien dieser Art zu umfassen, potenziell die âStornierungâ oder Verwischung von jedem Material (oder einer Klasse von Themen) ermÃķglicht, auf das ein Annotator stark reagiert.
BinÃĪres Urteil
Das AusmaÃ, in dem Bilder und Texte Schaden verursachen kÃķnnen, ist tatsÃĪchlich schwierig zu quantifizieren, nicht zuletzt, weil Hochkultur oft mit âNiederâ-Kultur (z.B. mit Kunst und Romanen) Þberschneidet, was zu den frÞhesten âvibeâ-basierten Zensurkriterien fÞhrt: dass sogar wenn anstÃķÃiges Material keine genaue Definition enthÃĪlt, du es erkennst, wenn du es siehst.
Unter der ausfÞhrlichen und exploratorischen Diskussion des Papiers Þber Empathie und qualitative Nuancen scheint die Arbeit stillschweigend die AutoritÃĪt der zentralisierten, standardisierten Taxonomien (âGewaltâ, âNacktheitâ, âHassâ usw.) anzugreifen, die es Plattformen ermÃķglichen, Moderation mit vertretbaren Fehlerraten zu implementieren und zu skalieren (in der Regel).
Das Argument, das sich herausbildet, ist, dass nur dezentralisierte, subjektive, kontextbewusste menschliche RÞckmeldungen GenAI-Ausgaben ordnungsgemÃĪà beurteilen kÃķnnen.
Es ist jedoch offensichtlich, dass dies nicht skalierbar ist, da man nicht einen trillionenfachen Filterprozess auf âVibesâ und Lebenserfahrung durchfÞhren kann. Man muss Schaden in verschiedene Eigenschaften quantifizieren; die Reichweite des resultierenden Filtersystems begrenzen; und auf neue Richtlinien in âRandâ-FÃĪllen warten (ÃĪhnlich wie von verletzten Parteien manchmal auf die Verabschiedung neuer Gesetze gewartet werden muss, die ihre besonderen UmstÃĪnde ansprechen).
Stattdessen prÃĪsentiert das neue Papier eine stillschweigende Richtlinie fÞr eine automatisierte Moderations-Pipeline, die ihre Reichweite automatisch erweitert und so sehr auf der Seite der Vorsicht ist, dass sogar die spezifischste und nicht replizierbare Reaktion eines Annotators ein Bild bestrafen kÃķnnte, das niemanden anderen beleidigt hat.
Moralische Expansion
Obwohl das Papier eher zur Erforschung als zur Einnahme einer festen Haltung tendiert, enthÃĪlt es Elemente der wissenschaftlichen Methode: die Autoren entwickelten einen Rahmen, um ein breiteres Spektrum von Annotator-Reaktionen auf Bilder zu identifizieren (wenn auch nicht streng zu messen) und zu untersuchen, wie diese Reaktionen Þber Geschlecht und andere demografische Faktoren variieren.
Neben der Analyse der Schadenfokussierungâ analysierte der Prozess die âmoralische Argumentationâ in den Nebenkommentaren der Testteilnehmer, die aufgefordert wurden, ein modifiziertes Testdatenset mit Bildern und assoziierten Texten zu annotieren.
Dieser âmoralische Sentiment-Autoraterâ wurde entwickelt, um die moralischen Werte Sorge, Gleichheit, VerhÃĪltnismÃĪÃigkeit, LoyalitÃĪt, AutoritÃĪt und Reinheit zu erfassen, wie in der Moral Foundations Theory definiert â einer psychologischen Theorie, die aufgrund ihrer flÞssigen und sich entwickelnden Natur der Schaffung von konkreten Definitionen, die fÞr groÃe menschliche Bewertungssysteme erforderlich sind, entgegengesetzt ist.
Informiert durch diese Theorie, kategorisierten die Autoren zusÃĪtzliche Dimensionen der Sicherheit, einschlieÃlich Angst, Zorn, Traurigkeit, Ekel, Verwirrung und Unheimlichkeit.
Die Autoren erlÃĪutern die erste davon, Angst:
âViele Annotatoren verwendeten Begriffe wie âerschreckendâ (z.B. fÞr verzerrte Gesichter oder Bilder, die Gewalt suggerieren, wie ein auf ein Kind gerichteter Revolver), âbeunruhigendâ (z.B. âAbsolut ekelhaft, jemanden Þberfahren zu sehen, sehr beunruhigend und beunruhigendâ oder âBeunruhigend und sieht aus wie Blutâ fÞr rohe Farbe) oder âbeunruhigendâ (z.B. âDas Bild des Jungen hat viele VerzerrungenâĶ Ich finde es unangenehm, weil es scheint, dass der Junge auf der falschen Seite der SeitenrÃĪder spieltâ).
âDie [Graphik unten] quantifiziert âAngstâ als die am hÃĪufigsten erwÃĪhnte Emotion (233 ErwÃĪhnungen, wÃĪhrend fast die HÃĪlfte dieser ErwÃĪhnungen mit gewaltsamem Inhalt assoziiert ist, der Inhalt, der als nicht schÃĪdlich angesehen wird, auch die zweithÃķchste ErwÃĪhnung von Angst hervorruft).â

Verteilung von emotionsbezogenen Begriffen Þber Schadenskategorien, wobei die HÃķhe der Balken die Anteile der Kommentare anzeigt, die ZÃĪhlungen in den Balken angezeigt werden und die Gesamtkommentarzahlen Þber jeder Kategorie angezeigt werden.
In Bezug auf die Aufnahme dieser neuen Sicherheitsdimensionen erklÃĪren die Autoren:
âDiese aufkommenden Themen heben eine kritische Notwendigkeit hervor, AI-Bildbewertungsframeworks durch die Integration subjektiver, emotionaler und wahrnehmungsbezogener Elemente zu bereichern.â
Dies kann ein gefÃĪhrlicher Weg sein, da es den Annotierungsprozessen zu ermÃķglichen scheint, willkÞrlich Regeln auf der Grundlage von Reaktionen hinzuzufÞgen, die Material bei einem einzelnen Annotator hervorrufen kÃķnnte, anstatt zu verlangen, dass alle Annotatoren etablierten Standards und Benchmarks folgen.
Wenn man diesem Gedanken einen wirtschaftlichen Imperativ zuweisen kÃķnnte, ist es, dass dieser Ansatz es ermÃķglicht, hyperskalierbare menschliche Annotierung, bei der der Prozess reibungslos ist, die Teilnehmer selbst regulieren und selbst entscheiden, was die Regeln und Grenzen sind.
Unter Standard-Annotierung werden Regeln durch menschliche Ãbereinstimmung erstellt und von menschlichen Annotatoren befolgt; unter dem im Papier vorgestellten Szenario wird diese erste Ebene der Aufsicht entweder entfernt oder herabgestuft: effektiv wÞrde jedes Bild, das jemanden beleidigen kÃķnnte, markiert werden (nicht zuletzt, weil Ãbereinstimmung teuer und zeitaufwÃĪndig ist).
Rorschach-Urteile
Die Absicht der Annotierung ist es, durch Expertenaufsicht, allgemeine Ãbereinstimmung unter mehreren Annotatoren oder (idealerweise) beides eine genaue Beschreibung oder Definition zu erhalten. Stattdessen ist die Erweiterung einer begrenzten, aber gut definierten Hierarchie von SchÃĪden in eine âintuitiveâ und sehr persÃķnliche interpretative Haltung ÃĪquivalent zur Annotierung eines Rorschach-Tests.
Zum Beispiel interpretierten einige Annotatoren, wie das Papier feststellt, eine schlechte BildqualitÃĪt (wie JPEG-Artefakte sowie sinnlose technische MÃĪngel in einem Bild) als âbeunruhigendâ oder âhinweisend auf Schadenâ:
âDies geschah, obwohl die Aufgabe Anweisungen zur BildqualitÃĪt auslieÃ. DarÞber hinaus interpretierten Annotatoren diese QualitÃĪtsartefakte als semantisch bedeutsam.
âEin Annotator kommentierte: âDas Bild ist nicht schÃĪdlich; er hat nur ein bisschen ein verzerrtes Gesicht.â Gleichzeitig interpretierten einige Annotatoren BildqualitÃĪtsartefakte als absichtlichen Schaden und attribuierten emotionale Bedeutung zu Fehlern. Zum Beispiel interpretierte ein anderer Annotator ein verzerrtes Gesicht in einem anderen Bild als âhinweisend auf Schmerzââ
Durch die Erhebung subjektiver, emotionaler oder kontextspezifischer Reaktionen Þber vordefinierte Sicherheitskategorien hinaus Ãķffnen die hier prÃĪsentierten Ideen die TÞr zu einem Regime, in dem alles willkÞrlich als schÃĪdlich markiert werden kann und in dem ein âchilling effectâ von ad-hoc-Entfernungen oder negativer Neukategorisierung von Material (d.h. Material, das eine spezielle Interessengruppe âbeleidigenâ kÃķnnte) zu einer realen Aussicht wird.
Â
Â
Das Papier âJust a strange picâ: Evaluating âsafetyâ in GenAI Image safety annotation tasks from diverse annotatorsâ perspectives ist verfÞgbar auf Arxiv.
* Ein Shortcut, da es nicht das zentrale Thema hier ist; unter der neuen Gesetzgebung sollen anstÃķÃige Seiten entweder selbst Þberwachen; komplexe und teure ÃberprÞfungssysteme und Altersverifizierungstechnologien einsetzen, die nur fÞr die grÃķÃten Seiten erschwinglich sind; oder ihre Domains fÞr das britische Publikum blockieren (erneut auf eigene Kosten).
â Einfach ausgedrÞckt im âdenk an die Kinderâ-Meme, das die Aneignung der moralischen Agency einer anderen Person fÞr scheinbar altruistische Zwecke satirisiert.
Â
ErstverÃķffentlicht am Freitag, den 25. Juli 2025












