Andersons Blickwinkel

KI-Bildsysteme sehen oft gar nicht wirklich

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

KI-Bildsysteme erklären möglicherweise Bilder mit Stereotypen anstelle dessen, was sie tatsächlich sehen. Entfernt man das Label, brechen ihre angeblichen visuellen Erklärungen zusammen.

 

Da frontier-KI-Plattformen ständig Geld verlieren, in der Hoffnung auf ein KI-Ereignishorizont, bedeuten kleine Einsparungen in ihrer Bereitstellung und ihren Dienstleistungen enorme Einsparungen: Zum Beispiel kann jedes Mal, wenn ein LLM eine Antwort aus seiner eigenen trainierten Matrix liefern kann, anstelle einer RAG-basierten Reise zum Web, um aktuelle Informationen zu erhalten, die destilliert und verfeinert werden müssen, es schneller antworten und dem Anbieter Geld sparen.

Es ist jedoch wahrscheinlicher, dass es halluziniert, ohne extra Token und Energie für Kontextualisierung und Überprüfung seiner Annahmen aufzuwenden.

Ebenso wird es, selbst wenn ein LLM auf das Web zugreift, sehr oft vage, unangemessene oder sogar bedeutungslose und nicht damit zusammenhängende URLs zitieren, da es Energie gespart hat, indem es nur die Metadaten für diese Seiten ausgewertet hat, anstelle sie tatsächlich zu lesen.

Ähnlich verhält es sich, wenn man ein PDF zu einem LLM hochlädt und über es diskutieren möchte. Das LLM wird schließlich den Inhalt des PDF aus seinem Speicher löschen und nur sparse Metadaten darüber verwenden, um die Anfragen zu beantworten, ohne auch nur zu erwähnen, dass es neu hochgeladen werden sollte – was zu Fehlern, falschen Annahmen und weiteren Halluzinationen führt.

Industrielle Tests

Diese sind pragmatische, wenn auch nicht ganz ehrliche Einsparungen, die dem Benutzer aus betrieblichen Gründen auferlegt werden. In der Welt der Datenerfassung und des Modelltrainings, in der Millionen – sogar Hunderte von Millionen – von Bildern verarbeitet werden müssen en masse und nicht von Menschen von Hand annotiert werden können, ist der Druck, Energie- und Zeitverbrauch zu minimieren, ebenso intensiv.

Eine solche “Abkürzung” ist die Verwendung eines Zwischen-Vision-Sprachmodells wie Contrastive Language Image Pretraining (CLIP), das Bilder und Text in einen gemeinsamen semantischen Raum kartiert, so dass visuelle Konzepte mithilfe von Sprache verglichen werden können, anstelle von expliziten Labels.

Was bedeutet das? Nun, stellen Sie sich vor, ein Kind lernt von Millionen von beschrifteten Bildern, bis es eine grobe Vorstellung davon entwickelt, welche Bilder und Wörter natürlich zusammengehören.

Das Problem ist, dass die Beschriftungen sehr oft von Website-Besitzern und anderen selbstsüchtigen Entitäten geschrieben wurden, die mehr an guten SEO als an gute Beschriftung interessiert waren, was zu einer großen Menge “Rauschen” oder ungenauer Beschriftung führte.

Trotzdem bedeutet die Skala, in der ein Konzept und ein damit verbundenes Wort in großen Datensätzen wiederkehren, normalerweise, dass die Kernwörter mit dem richtigen Bild in Verbindung gebracht werden, da die geringere Anzahl von “Unsinn”-Labels normalerweise in eine Outlier-Ghetto gezwungen wird und nicht normalerweise mit dem Bild in Verbindung gebracht wird. Es funktioniert also mehr oder weniger, meistens.

Die Datenauszeichnung wird auf diese Weise durchgeführt, weil sie billig und minimal funktional ist, nicht weil sie gut ist.

Abseits der Etiketten

In diese problematische Situation kommt ein neues Papier von Carnegie Mellon, das deutlich zeigt, dass viele den Bildern zugewiesenen Beschriftungen – zum Beispiel von CLIP – einfach Stereotype basierend auf der Bezugnahme auf die (textbasierte) Bezeichnung des Bildes sind, anstelle von aktivem Hinsehen auf das Bild selbst.

In einem auffallenden Beispiel aus dem Papier wird CLIP mit Deskriptoren gepaart, die aus dem ImageNet-Klassennamen Erdbeere generiert werden, und dann auf ImageNet-Sketch getestet, wo jede Erdbeere eine Schwarz-Weiß-Zeichnung ist – dennoch behaupten die Deskriptoren, dass die Frucht ‘rot’ und ‘reif’ ist:

Klassennamen-Deskriptoren versagen bei ImageNet-Sketch: Sprachpriors sagen 'rot' und 'reif', während bildbasierte Attribute der Schwarz-Weiß-Zeichnung entsprechen. Quelle - https://arxiv.org/pdf/2607.18695

Klassennamen-Deskriptoren versagen bei ImageNet-Sketch: Sprachpriors sagen ‘rot’ und ‘reif’, während bildbasierte Attribute der Schwarz-Weiß-Zeichnung entsprechen. Quelle

Hier wird CLIP mit Deskriptoren gepaart, die nur aus dem Klassennamen Erdbeere generiert werden, über GPT-3 oder externes Wissen. Diese sehen das Bild nie, so dass sie auf kanonische Merkmale wie rot und blättrig zurückgreifen. Wenn sie auf die monochromen Linienzeichnungen in ImageNet-Sketch angewendet werden, scheitert der Prozess.

Im Gegensatz dazu wählen Attribute, die aus den Bildern selbst abgeleitet werden, Merkmale, die unter der Verschiebung bestehen bleiben, wie gepunktet oder herzförmig.

So können wir sehen, dass das identifizierte Objekt nicht für das, was es ist, beworben wird, sondern, sozusagen, “aufgrund seines Rufs”; die Adjektive “rot” und “blättrig” sind genau für die Subdomäne Erdbeere, aber überschreiten die Grenzen des Bildes (Instanz) in Frage.

Die Autoren der neuen Arbeit – mit dem Titel Attribute sollten aus Bildern stammen, nicht aus Klassennamen: Verteilungsbedingte Attributselektion für Vision-Sprachmodelle – argumentieren, dass dies ein anhaltendes und weit verbreitetes Problem ist, und schlagen vor, Attribute direkt aus den Bildern selbst auszuwählen, so dass sie das tatsächlich Sichtbare unter Verteilungsverschiebung widerspiegeln, anstelle darauf zu vertrauen, dass Klassennamen-Priors verwendet werden.

Die Autoren stellen fest:

‘Ein beliebter Weg zu interpretierbarer Zero-Shot-Klassifizierung fordert ein großes Sprachmodell (LLM) auf, jeden Klassennamen zu beschreiben und CLIP mit den resultierenden Deskriptoren zu versehen. Wir zeigen, dass diese Deskriptoren wenig visuelles Beweismaterial haben: Das Entfernen des Klassennamens aus dem Prompt lässt die ImageNet-Genauigkeit von 59,5% auf 15,5% sinken.

‘Die Diagnose ist, dass die Deskriptoren auf dem Label und nicht auf den Bildern konditioniert sind, so dass sie das Konzept im Allgemeinen beschreiben und genau dann täuschen, wenn die Daten sich verschieben; ein LLM behauptet, dass Erdbeeren rot sind, aber jede Erdbeere in ImageNet-Sketch ist eine farblose Linienzeichnung.

‘Wir wählen daher Attribute aus der Zielbildsammlung aus: Wir bewerten eine große Attribut-Pool gegen die Bilder im gemeinsamen Einbettungsraum von CLIP und behalten die besten Attributewerte pro Klasse bei.’

Ihre vorgeschlagene Lösung ist, dass das Modell gleich bleibt, aber anstelle von Klassennamen-Beschreibungen ein Pool von Kandidaten-Attributen gegen die Bilder überprüft und nur diejenigen beibehält, die tatsächlich zu dem passen, was sichtbar ist.

Der Aufwand dafür ist angeblich akzeptabel, da er nicht vorschlägt, die gespeicherte Energie der “betrügerischen” Methoden wieder aufzurufen, die zu dem Problem führten. Stattdessen fügt er einen Bewertungsdurchlauf über Kandidaten-Attribute pro Klasse hinzu, so dass die Latenz leicht ansteigt – aber viel weniger als bei einer Neuausbildung oder vollständigen RAG-ähnlichen Pipelines. In der Theorie wäre der Energieaufwand akzeptabel, abgewogen gegen die Verbesserung der Ausrichtung.

Methode

Da die Methodik der Autoren-Tests besonders arkane ist und da minimale zusätzliche nützliche Erkenntnisse durch eine tiefe Untersuchung gewonnen würden, werden wir, untypischerweise, nur eine verkürzte Übersicht ihrer Herangehensweise betrachten.

Die Arbeit charakterisiert das Kernproblem als Klassennamen-Konfund: Eine Situation, in der die Leistung scheinbar von sinnvollen Deskriptoren kommt, aber in Wirklichkeit auf dem Klassennamen selbst basiert, wobei die Deskriptoren wenig hinzufügen und versagen, sobald diese Unterstützung entfernt wird

Das Papier argumentiert dann, dass dieser Misserfolg unvermeidlich ist, da Deskriptoren, die aus einem Klassennamen generiert werden, nur beschreiben können, wie etwas normalerweise aussieht, anstelle von dem, was tatsächlich in einem bestimmten Bild vorhanden ist. Sobald die Daten von diesen Erwartungen abweichen, werden die Deskriptoren nicht nur unhelpful, sondern aktiv täuschend, indem sie effektiv gegen die richtige Antwort stimmen.

Die Forscher haben auch untersucht, ob CLIP einfach schlecht darin ist, Attribute ohne die Hilfe von Klassenlabels zu erkennen, oder ob GPT-generierte Deskriptoren zu allgemein sind, um nützlich zu sein. Ihre anschließenden Experimente widerlegten jedoch beide Erklärungen.

Um dieses Problem anzugehen, wurde ein eingefrorenes CLIP-Modell verwendet, um Bilder gegen einen großen Pool von Kandidaten-Attributen zu vergleichen, die aus VAW, LSA und GPT-3-Ausgaben gezogen wurden, wobei nur die Attribute beibehalten wurden, die am besten mit den Bildern übereinstimmten, ohne dass eine Neuausbildung oder zusätzliche Bild-Text-Überwachung erforderlich war:

Überblick über das vorgeschlagene System: Ein eingefrorenes CLIP-Modell kodiert sowohl Bilder als auch einen großen Pool von Kandidaten-Attribut-Texten, wobei die Kosinus-Ähnlichkeit verwendet wird, um zu messen, wie stark jeder Deskriptor den visuellen Inhalt trifft. Die höchstbewerteten Attribute werden dann pro Klasse beibehalten, wodurch ein interpretierbarer Satz von Prompts entsteht, während sowohl der Bild- als auch der Text-Encoder während des gesamten Prozesses fest bleiben.

Überblick über das vorgeschlagene System: Ein eingefrorenes CLIP-Modell kodiert sowohl Bilder als auch einen großen Pool von Kandidaten-Attribut-Texten, wobei die Kosinus-Ähnlichkeit verwendet wird, um zu messen, wie stark jeder Deskriptor den visuellen Inhalt trifft. Die höchstbewerteten Attribute werden dann pro Klasse beibehalten, wodurch ein interpretierbarer Satz von Prompts entsteht, während sowohl der Bild- als auch der Text-Encoder während des gesamten Prozesses fest bleiben.

Daten und Tests

Die Experimente der Autoren verwendeten CLIP mit einem ResNet-50-Rücken und bewerteten die Leistung auf ImageNet zusammen mit vier verteilungsverschobenen Varianten: ImageNetV2; ImageNet-Sketch; ImageNet-A; und ImageNet-R.

Attribute wurden unter Verwendung nur der ursprünglichen ImageNet-Trainingsbilder ausgewählt – was es den verschobenen Datensätzen ermöglichte, als außerhalb der Verteilung liegende Test, um zu überprüfen, ob bildbasierte Attribute nützlich bleiben, wenn die visuellen Erscheinungen sich ändern:

Top-1-Klassifizierungs-Genauigkeit über ImageNet und vier verteilungsverschobene Benchmarks. Die Ergebnisse zeigen, dass die Leistung im Allgemeinen ähnlich bleibt, wenn Klassennamen in Prompts enthalten sind, aber zusammenbricht, wenn Deskriptoren gezwungen werden, alleine zu stehen, was darauf hindeutet, dass viel von ihrer scheinbaren Effektivität von dem Klassennamen selbst abgeleitet wird. Im Gegensatz dazu bleiben Attribute, die direkt aus Bildern ausgewählt werden, wesentlich informativer über alle getesteten Datensätze hinweg.

Top-1-Klassifizierungs-Genauigkeit über ImageNet und vier verteilungsverschobene Benchmarks. Die Ergebnisse zeigen, dass die Leistung im Allgemeinen ähnlich bleibt, wenn Klassennamen in Prompts enthalten sind, aber zusammenbricht, wenn Deskriptoren gezwungen werden, alleine zu stehen, was darauf hindeutet, dass viel von ihrer scheinbaren Effektivität von dem Klassennamen selbst abgeleitet wird. Im Gegensatz dazu bleiben Attribute, die direkt aus Bildern ausgewählt werden, wesentlich informativer über alle getesteten Datensätze hinweg.

Das erneute Auswählen von Attributen aus dem gleichen GPT-generierten Pool, aber unter Bedingung von ImageNet-Bildern, erhöhte die Klassennamen-freie Genauigkeit von 15,5% auf 19,4%. Da das Modell, der Attribut-Pool und das Bewertungsprotokoll unverändert blieben, konnte der Gewinn vollständig der bildkonditionierten Auswahl zugeschrieben werden.

Das Ergebnis wies auch darauf hin, dass CLIP Attribute ohne Klassenlabels identifizieren kann und dass der GPT-generierte Pool bereits nützliche Deskriptoren enthielt. Der Hauptfehler schien stattdessen in der Label-konditionierten Generierung zu liegen, die oft versagte, die Attribute zu enthüllen, die für die Bilder selbst am relevantesten waren.

Obwohl die Autoren weitere umfangreiche Experimente durchführen, müssen wir den Leser auf das Quellenmaterial verweisen, um weitere Details zu erhalten, da sie anstelle der Erweiterung des Umfangs der Ergebnisse nur die zentralen Hypothesen bestätigen, die bisher dargelegt wurden – dass die Abhängigkeit von Labels das Potenzial realer Bildaten in modernen Computer-Vision-Anwendungen potenziell untergraben kann, wobei billige Abhängigkeit von “reputationaler” Wahrscheinlichkeit eine Gefahr für die Genauigkeit der Ergebnisse darstellt.

Zusammenfassung

Es ist interessant, die Schulden zu betrachten, die moderne generative KI den Millionen von handbeschriebenen Bildern verdankt, die in riesige Datensätze wie Common Crawl aufgenommen wurden, zu Beginn der Hyperskala-Ära.

Jedes Mal, wenn ein Bilderkennungs- oder Auto-Beschriftungssystem versucht, ein altes oder neues Bild zu klassifizieren oder neu zu beschriften, führt die Herkunft dieses Wissens zurück zu einem Händler, der ‘Heiße 70er-Jahre-Zeitschrift!’ in der alt-Beschriftung einer eBay-Listung im Jahr 2004 geschrieben hat, oder einem ähnlichen Ereignis.

Obwohl viele glauben, dass das goldene Zeitalter des Keyword-Stuffings von Google’s PageRank-Algorithmus vor fast drei Jahrzehnten weggefegt wurde, bleibt der Wand-Text-Ansatz sehr lebendig: Nur gestern war am Anfang der HTML-Seite der Veröffentlichung des Qwen-Image-3.0-Modells ein atavistischer Ausbruch (es kann noch immer dort sein!) von Keyword-Stuffing-Wahnsinn:

Der HTML-Code für die Veröffentlichung von Qwen Image 3 ist eine nicht ganz SFW-Wand von Keyword-Text, zumindest zum Zeitpunkt des Schreibens. Quelle - https://qwen.ai/blog?id=qwen-image-3.0

Der HTML-Code für die Veröffentlichung von Qwen Image 3 ist eine nicht ganz SFW-Wand von Keyword-Text, zumindest zum Zeitpunkt des Schreibens. Quelle

Ob dies nun systematisch aus Ziel-Listen oder von SEO-Spezialisten handschriftlich erstellt wurde, ist dies ein Beispiel für die rohen Ursprünge des modernen generativen KI-Systems, wobei die Bedeutung oft eine enorme Fracht von Eigeninteresse mit sich trägt, die später entfernt oder zumindest auf irgendeine Weise berücksichtigt werden muss, wenn solche Begriffe mit rationalen Systemen und Anwendungen interferieren oder behindern.

 

Erstveröffentlicht am Mittwoch, 22. Juli 2026

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai