Andersons Blickwinkel

Die ‘Rogue’-Daten, die die Leistung von generativen KI-Modellen verunreinigen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
Flux Dev, Firefly.

Ein neues Studie ergab, dass viele beliebte Bild-Datensätze, die zum Trainieren von KI-Modellen verwendet werden, mit Test-Bildern oder near-Duplikaten kontaminiert sind, was es den Modellen ermöglicht, durch Memorieren von Antworten anstelle von Lernen zu “schummeln”. Die Kontamination ist weit verbreitet, aber im Allgemeinen unentdeckt und führt zu einer leichten Inflation der Punktzahlen und gibt Modellen, die auf Web-Skala-Daten trainiert werden, einen unfairen Vorteil.

 

Wenn Sie einen Führerschein testen, werden Ihnen normalerweise nicht im Voraus genau die Straßen genannt, auf denen der Test stattfinden wird. Wenn Sie dies jedoch tun (und Sie ein bisschen an Integrität fehlt), könnten Sie den Test “optimieren”, indem Sie wiederholt auf dieser Route üben, anstelle von breiteren Fahrkünsten, die jede Route vernünftig bewältigen können.

Bei der Ausbildung von Machine-Learning-Modellen ist dies eine vernünftige Analogie für eine Test-Split – eine Aufteilung der Trainings-Datensätze zwischen (normalerweise) einer 70%-Split für die Daten, die zum Trainieren des Modells verwendet werden, und den verbleibenden 30% als “in der Wildnis”-Daten.

Da “in der Wildnis”-Daten noch nie vom Modell gesehen wurden, kann angenommen werden, dass das Modell effektiv und leistungsfähig ist, wenn es auf diesen Daten gut abschneidet; wenn nicht, kann das Modell überangepasst auf einem gut ausgewogenen Satz – oder die Daten benötigen zusätzliche Pflege und Definition.

Egal, wie, nicht die Auswertung von Modellen auf ihren Trainings-Daten ist die Grundlage der aktuellen Methode in der KI-Forschung und -Entwicklung.

Noch einmal, bitte

Laut einer neuen Forschungsarbeit aus Japan hat die Computer-Vision- und generative KI-Forschung nicht im Entferntesten die Bemühungen der LLM-Forscher erreicht, um sicherzustellen, dass Test-Daten nicht in Trainings-Daten eindringen; in Tests fanden die Forscher heraus, dass jeder hyperskalige Vision-Datensatz, den sie untersuchten, einschließlich derjenigen, die einige der größten aktuellen generativen KI-Systeme antreiben, in gewissem Maße zugelassen hat, dass seine Test-Daten in seine Trainings-Daten übergehen – was bedeutet, dass Benchmarks und Leistungsberichte für Modelle, die auf diesen Splits trainiert werden, nicht genauer sind als ein Prüfungsergebnis von jemandem, der einen Spickzettel in den Prüfungsraum geschmuggelt hat, und werden nicht die tatsächliche Leistung in echt neuen Daten widerspiegeln.

Beispiele für Daten-Kontamination, die von den Forschern gefunden wurden, bei denen duplizierte oder near-duplizierte Datenpunkte in Trainings- und Test-Daten existieren. Quelle: https://arxiv.org/pdf/2508.17416

Beispiele für Daten-Kontamination, die von den Forschern gefunden wurden, bei denen duplizierte oder near-duplizierte Datenpunkte in Trainings- und Test-Daten existieren. Quelle: https://arxiv.org/pdf/2508.17416

Im Bild oben, aus dem neuen Paper, sehen wir Beispiele für entweder duplizierte oder near-duplizierte Datenpunkte, die in Trainings- und Test-Daten von verschiedenen Modellen gefunden wurden – genug, um die Leistung des Modells auf diesen Daten zu invalidieren und leicht die allgemeinen Punktzahlen zu erhöhen, was zu einem Schein von Generalisierung führt, den das Modell möglicherweise nicht tatsächlich erreicht hat.

Um die Dinge noch komplizierter zu machen, scheint die Kontamination in verschiedenen Szenarien aufzutreten, einschließlich ‘Vor-Training‘, bei dem die Gewichte von älteren Vorgänger-Modellen verwendet werden, um ein neues Modell zu “starten”. Wenn das ältere Modell einige der gleichen Daten wie das neue Dataset hat, das vor-getrainiert wird, kann eine Kreuz-Kontamination auch dann auftreten, wenn die 70/30- oder 80/20-Split sauber ist.

Kumulative Wirkung

Dies ist fast sicher auch in den neuesten Datensätzen der Fall: Der Umfang von Vision/Sprache-Datensätzen hat in den letzten fünf Jahren enorm zugenommen und umfasst nicht nur die neuesten Bild-Daten im Internet, sondern auch die erneute Ernte von viel von den gleichen Daten, die diese älteren, historischen Datensätze bevölkerten.

Weiterhin sind automatisierte Routinen, die darauf ausgelegt sind, Milliarden von Bildern auf Duplikate und near-Duplikate zu durchsuchen und zu filtern, jetzt mit einer so aufwändigen Aufgabe konfrontiert, dass die Kuratierung selbst – ihre Kosten in Bezug auf Zeit und Geld – jetzt im Kontext von Budget-Beschränkungen berücksichtigt werden muss

Währenddessen ist Bild-Duplizierung eine unvermeidliche Folge der Art von ad-hoc Web-Scraping, das hinter großen Sammlungen wie Common Crawl steckt, aufgrund der gängigen Praxis, Bilder neu zu posten und zu rekompresieren und Bearbeitungen wie Crops und sogar Flips (um Erkennung zu vermeiden, wenn das Bild beispielsweise ohne Erlaubnis verwendet wurde) anzuwenden.

Die Autoren bemerken*:

‘Daten-Leck ist ein weit verbreitetes Problem, das in den meisten visuellen Datensätzen vorkommt. Leck kann die Generalisierungsfähigkeit von Modellen verbergen, was besonders problematisch ist, wenn Modelle auf verschiedenen Datensätzen trainiert werden, was zu unfairen Vergleichen führt.

‘Wir bitten die Designer von Datensätzen, die Auswirkungen dieser Auswertungen sorgfältig zu berücksichtigen. Für eine faire Auswertung von Modellen empfehlen wir die Verwendung von Duplikat-Erkennern, die sowohl harte als auch weiche Lecks berücksichtigen.

‘Idealerweise sollten geleakte Bilder aus dem Trainings-Set entfernt werden, und wenn dies nicht möglich ist, sollten sie zumindest aus dem Test-Set entfernt werden.’

Das Paper erläutert eine Reihe von Tests, die die Forscher an großen und beliebten Datensätzen durchgeführt haben – jeder einzelne davon zeigte ein gewisses Maß an Kontamination.

Das neue Paper trägt den Titel Daten-Leck in visuellen Datensätzen und stammt von drei Forschern der Universität Osaka.

Methode

Die Autoren des Papiers definieren Leck in drei Dimensionen: Modus, Abdeckung und Grad.

Modus unterscheidet, ob nur Bilder geleakt werden oder ob sowohl Bilder als auch Labels exponiert sind; Abdeckung identifiziert, ob die Überlappung innerhalb desselben Datensatzes oder über verschiedene Datensätze hinweg auftritt; und Grad definiert, ob der duplizierte Inhalt genau gleich ist oder nur benachbart.

In Bezug auf Leck wurden in der Arbeit zwei Szenarien in Betracht gezogen: Intra-Datensatz-Leck (wenn Bewertungsbilder im Trainings-Teil desselben Datensatzes wieder auftauchen), und Inter-Datensatz-Leck (wenn Bewertungsbilder aus einem Datensatz in einem anderen Datensatz für das Training vorhanden sind).

In Bezug auf den Grad wurden zwei Ebenen definiert: weiches Leck (wenn Bilder nicht identisch sind, sondern nur kleine Variationen aufweisen), und hartes Leck (wenn Bilder genau gleich sind, sowohl im Training als auch in der Bewertung).

Die Forscher behandeln die Erkennung von Leck in Bezug auf Bild-Retrieval, indem sie Bild-Encoder verwenden, um jedes Bild als Funktionvektor darzustellen. Der Abfrage-Set ist die Bewertungs-Daten, während die Sammlung das Trainings-Set ist.

Für kleinere Datensätze wurde jeder Abfrage-Vektor direkt mit allen Trainings-Vektoren unter Verwendung von Kosinus-Ähnlichkeit verglichen. Für größere Datensätze wurde ein Faiss-Index erstellt, um einen schnelleren, K-Nearest-Neighbors (KNN)-Suchlauf zu ermöglichen.

Da der Encoder genug visuelle Informationen erfassen muss, um subtile Ähnlichkeiten zu erkennen, aber immer noch effizient in Bezug auf sehr große Datenmengen sein muss, verließen sich die Autoren auf vorab berechnete CLIP-Funktionen, die von den Datensatz-Erstellern bereitgestellt wurden, im Falle der LAION-Sammlung, die Stable Diffusion untermauert, und späteren Projekten.

Die Autoren bemerken, dass die Verwendung von CLIP, um seine destillierte Kenntnis des Datensatzes (anstatt der tatsächlichen Dateien im großen Maßstab) zu nutzen, den Prozess erheblich beschleunigte und eine verbesserte Konsistenz über Vergleiche hinweg bot.

Daten und Tests

Der CLIP-Bild-Encoder, der in den Tests für die neue Arbeit verwendet wurde, war der Standard-CLIP ViT-B/32 , der ursprünglich verwendet wurde, um LAION zu sichten. Um zu bestimmen, ob verschiedene Bilder miteinander in Beziehung stehen, wurde KNN unter AutoFaiss verwendet.

Die Datensätze wurden in drei Arten unterteilt: Vor-Trainings-Datensätze – große, web-gesammelte Sammlungen, die zum Trainieren von Generalisten-Modellen verwendet werden; Trainings-Datensätze – kleinere, oft annotierte Sammlungen, die für das direkte Modell-Tuning bestimmt sind; und Benchmark-Datensätze – manuell annotiert und ausschließlich für die Bewertung verwendet.

Die Analyse umfasste zwanzig Splits über sieben Datensätze: Microsoft COCO wurde als Trainings- und Bewertungs-Set verwendet, einschließlich der Trainings-, Validierungs-, Test- und unbeschrifteten Splits; Flickr30k diente ausschließlich als Benchmark; und die Google Conceptual Captions (GCC)-Sammlung wurde als Vor-Trainings-Quelle behandelt, wobei der Validierungs-Teil auch für die Bewertung verwendet wurde.

Zusätzlich wurde ImageNet für das Training und die Bewertung verwendet, während die LAION-400M-Datensammlung ausschließlich für das Vor-Training verwendet wurde.

OpenImages v4 trug Trainings- und Benchmark-Daten bei, und TextCaps lieferte sowohl Trainings- als auch Test-Splits für die Bewertung.

Beispiele für Bild-Annotierungen aus Googles Open Images-Datensatz, die in der neuen Arbeit untersucht wurden. Quelle: https://arxiv.org/pdf/1811.00982

Beispiele für Bild-Annotierungen aus Googles Open Images-Datensatz, die in der neuen Arbeit untersucht wurden. Quelle: https://arxiv.org/pdf/1811.00982

Um zu bewerten, wie gut die Methode Leckagen erkennen kann, wenn Bilder subtil verändert wurden, indem sie vergrößert, beschnitten oder ähnlich nicht-semantische Transformationen unterzogen werden, testeten die Autoren auf Flickr30k, indem sie 5.000 Bilder zufällig als Abfragen auswählten und die gesamte Datensammlung als Referenz-Sammlung verwendeten.

Jedes Abfrage-Bild wurde vor der Kodierung (d. h. einer nicht-semantischen Modifikation wie Vergrößerung oder Beschnitt) transformiert und dann mit dem ähnlichsten Element in der Sammlung unter Verwendung von Kosinus-Ähnlichkeit verglichen; ein Treffer wurde nur gezählt, wenn das Original-Bild als oberstes Ergebnis zurückgegeben wurde.

Die drei verglichenen Encoder waren ResNet-152; DINOv2 ViT-B/14; und CLIP ViT-B/32.

Vier Arten von nicht-semantischen Bild-Transformationen wurden verwendet: geometrisch (Flips und Rotationen); Beschnitt (Entfernung von 20, 50 oder 100 Pixeln von jeder Kante); Pixelisierung (Gaußscher Rauschen, Hinzufügen von Rauschen oder Downsampling auf 128 oder 256 Pixel); und Farbe (Graustufen, Invertierung oder rote, grüne oder blaue Überlagerungen).

Aus dem Zusatzmaterial, Beispiele für die Transformationen, die auf die Daten angewendet wurden - typische Routinen, die auch in der Daten-Aufbereitung verwendet werden.

Aus dem Zusatzmaterial, Beispiele für die Transformationen, die auf die Daten angewendet wurden – typische Routinen, die auch in der Daten-Aufbereitung verwendet werden.

Dann testeten die Autoren auf Leckagen im Bild-Retrieval:

Leck-Erkennungs-Genauigkeit auf 5.000 Flickr30k-Abfrage-Bildern, die verschiedenen nicht-semantischen Transformationen unterzogen wurden.

Leck-Erkennungs-Genauigkeit auf 5.000 Flickr30k-Abfrage-Bildern, die verschiedenen nicht-semantischen Transformationen unterzogen wurden.

Alle drei Encoder erreichten eine perfekte Leistung auf unveränderten Bildern, und CLIP blieb zuverlässig über Beschnitt, horizontale Flips, Rauschen und Vergrößerung, und übertraf ResNet bei Pixel- und Farb-Änderungen.

DINOv2 zeigte eine starke Resistenz gegenüber Farb-Transformationen (wahrscheinlich aufgrund seines selbst-supervisierten Designs, so die Autoren), aber war deutlich schwächer bei geometrischen Bearbeitungen und Beschnitt – beides ist in duplizierten Datensätzen häufig.

Da LAION bereits CLIP-Embeddings enthält und aufgrund seiner konsistenten Robustheit und Geschwindigkeit, wurde CLIP als Standard-Encoder für die Haupt-Analyse ausgewählt.

Hartes und weiches Leck

Die Leistung wurde über verschiedene Kosinus-Ähnlichkeits-Schwellenwerte hinweg bewertet, um exakte und near-duplizierte Bilder (hartes und weiches Leck) zu unterscheiden.

Ein Schwellenwert von 0,98 wurde ausgewählt, um hartes Leck zu definieren, was zu keiner Falsch-Positiv-Rate und einer perfekten Erkennung identischer Bilder führte.

Für weiches Leck wurde ein Schwellenwert von 0,95 gewählt, der es ermöglichte, mehr near-Duplikate zu erkennen, während eine nahezu Null-Falsch-Positiv-Rate beibehalten wurde; der Schwerpunkt lag auf Präzision gegenüber Recall, und die Ergebnisse wurden daher konservativ geschätzt:

Empfänger-Operation-Charakteristika-Kurven wurden verwendet, um die Auswahl von hartem und weichem Leck-Schwellenwert zu leiten. Hohe AUC-Werte unter beiden transformierten und untransformierten Bedingungen zeigen, dass near-Duplikate zuverlässig von nicht verwandten Bildern unterschieden werden können, selbst wenn minimale Änderungen vorliegen.

Empfänger-Operation-Charakteristika-Kurven wurden verwendet, um die Auswahl von hartem und weichem Leck-Schwellenwert zu leiten. Hohe AUC-Werte unter beiden transformierten und untransformierten Bedingungen zeigen, dass near-Duplikate zuverlässig von nicht verwandten Bildern unterschieden werden können, selbst wenn minimale Änderungen vorliegen.

Intra-Datensatz-Leck

Intra-Datensatz-Leck wurde berechnet, indem die Bild-Überlappung zwischen Trainings- und Bewertungs-Splits innerhalb desselben Datensatzes identifiziert wurde. Nur Datensätze mit beiden Benchmark- und Trainings- oder Vor-Trainings-Splits waren berechtigt, die Analyse auf COCO, GCC, ImageNet, OpenImages und TextCaps einzugrenzen.

Für COCO wurde der Test-Set gegen den Trainings-Set, den Bewertungs-Set und den unbeschrifteten Subsets verglichen, und der Validierungs-Set gegen den Trainings- und unbeschrifteten Subsets.

Die höchsten Raten von Intra-Datensatz-Leck wurden in den ImageNet-Test- und Validierungs-Splits beobachtet, wobei hartes Leck bis zu 1,58% und weiches Leck knapp unter 2% erreichte. GCC und COCO folgten, wobei COCO val2017 eine weiche Leck-Rate von 3% aufwies und seine Test-Splits zwischen 1,35% und 1,38% lagen. OpenImages zeigte ein geringes hartes Leck von 0,05%, aber weiches Leck überstieg 1,3% in beiden Test- und Validierungs-Splits. TextCaps zeigte die geringste Gesamtleck-Rate, bei 0,69%, mit keinem harten Leck, das erkannt wurde:

Intra-Datensatz-Leck-Raten, die den Anteil jeder Bewertungs-Split anzeigen, der mit seinem zugehörigen Trainings-Daten überlappt.

Intra-Datensatz-Leck-Raten, die den Anteil jeder Bewertungs-Split anzeigen, der mit seinem zugehörigen Trainings-Daten überlappt.

In Bezug auf diese Ergebnisse bemerken die Autoren†:

‘Diese Ergebnisse zeigen, dass Intra-Datensatz-Leck in allen analysierten Datensätzen auftritt, entweder in seiner harten oder weichen Form.

‘Da Daten-Leck die Modell-Auswertung beeinträchtigen kann und Datensätze speziell für diesen Zweck konzipiert sind, ist Intra-Datensatz-Leck ein Risiko, das per Design nicht existieren sollte.

‘Trotzdem haben wir mehrere Fälle in allen Datensätzen identifiziert.’

Inter-Datensatz-Leck

Um Inter-Datensatz-Leck zu messen (wenn ein Modell auf einem Datensatz trainiert und auf einem anderen ausgewertet wird), wurden vier Datensätze als Trainings-Daten-Quellen verwendet: GCC-Trainings, ImageNet-Trainings, OpenImages-Trainings und LAION.

Diese wurden mit Bewertungs-Daten verglichen, die aus dem COCO 2014-Test- und Validierungs-Split, Flickr30K, TextCaps-Test, dem OpenImages-Test- und Validierungs-Split und dem ImageNet-Test- und Validierungs-Split stammten.

CLIP ViT-B/32-Embeddings wurden für alle Datensätze extrahiert, außer LAION, das seine eigenen vorab berechneten Embeddings bereitstellt. Da diese Embeddings jedoch leicht von denen abweichen, die mit der offiziellen CLIP-Implementierung generiert werden, wurden die Abfrage-Bilder gemäß der Methode im clip-retrieval-Repository skaliert, um Kompatibilität zu gewährleisten.

Die Suche wurde mit einem KNN-Suchlauf durchgeführt, obwohl die Größe von LAION eine Aufteilung in millionen-Bild-Blöcke erforderte, wobei jeder separat indexiert wurde:

Inter-Datensatz-Leck zwischen Benchmark-Datensätzen (Spalten) und Vor-Trainings-Datensätzen (Zeilen). Auf der linken Seite sehen wir 'hartes' Leck (identische Bilder), und auf der rechten Seite 'weiches' Leck (near-Duplikate).

Inter-Datensatz-Leck zwischen Benchmark-Datensätzen (Spalten) und Vor-Trainings-Datensätzen (Zeilen). Auf der linken Seite sehen wir ‘hartes’ Leck (identische Bilder), und auf der rechten Seite ‘weiches’ Leck (near-Duplikate).

Leckagen zwischen Datensätzen wurden über alle Benchmark-Datensätze hinweg beobachtet, mit unterschiedlichen Schweregraden. LAION zeigte die höchsten Raten von hartem Leck (identische Bilder), insbesondere für OpenImages und TextCaps-Test-Daten, die jeweils über 3% lagen. OpenImages trug auch einen kleineren Anteil von hartem Leck zu COCO bei.

Obwohl weniger schwerwiegend, enthielt ImageNet immer noch harte Duplikate aus jedem untersuchten Benchmark; und GCC zeigte das geringste Gesamtleck, das unter 1% blieb.

Weiches Leck (near-Duplikate) war weiter verbreitet: LAION produzierte wiederum die höchsten Raten, mit bis zu 7,9% Überlappung für bestimmte Benchmarks; OpenImages und TextCaps waren die am stärksten betroffenen Benchmarks; und Flickr30k zeigte die geringste Leck-Rate.

Obwohl solche Überlappungen nur einen kleinen Teil der Bewertungs-Sätze ausmachen, bemerken die Autoren, dass ihre Anwesenheit Memorisation ermöglichen und die Test-Gültigkeit beeinträchtigen kann:

Beispiele für geleakte Bilder. Auf der linken Seite sind Fälle von 'hartem' Leck, wo Bilder identisch innerhalb eines Datensatzes (oben) oder zwischen Datensätzen (unten) sind; auf der rechten Seite Fälle von 'weichem' Leck, wo Bilder visuell near-identisch sind.

Beispiele für geleakte Bilder. Auf der linken Seite sind Fälle von ‘hartem’ Leck, wo Bilder identisch innerhalb eines Datensatzes (oben) oder zwischen Datensätzen (unten) sind; auf der rechten Seite Fälle von ‘weichem’ Leck, wo Bilder visuell near-identisch sind.

Auswirkung auf die Downstream-Auswertung

Das Paper betrachtet als Nächstes, wie Daten-Leck die Downstream-Auswertung (d. h. die Leistung bei Standard-Aufgaben, wenn vorgefertigte Modelle auf Benchmarks getestet werden, die duplizierte Trainings-Daten enthalten) beeinflusst.

Drei Aufgaben wurden berücksichtigt: Zero-Shot-Klassifizierung; überwachte Klassifizierung; und Bild-Text-Retrieval.

Für jede Aufgabe wurde die Modell-Leistung auf einem Benchmark-Datensatz ausgewertet, für den bereits geleakte Proben innerhalb der Vor-Trainings-Daten identifiziert worden waren. Die Ergebnisse wurden über vier Subsets verglichen: das vollständige Benchmark; ein Subset von geleakten Proben; ein Subset von nicht-geleakten Proben; und ein zufällig ausgewähltes Subset der gleichen Größe wie die geleakte Gruppe (als Kontrolle verwendet).

Die Auswirkung von Daten-Leck auf drei Downstream-Aufgaben wurde unter Verwendung von Benchmark-Subsets gemessen, die bekannte geleakte Bilder enthielten. Bei der Zero-Shot-Klassifizierung erreichte ein auf LAION vorgefertigtes Modell eine bemerkenswerte höhere Genauigkeit auf geleakten Bildern aus dem ImageNet-Bewertungs-Set, was bestätigt, dass die Exposition gegenüber sogar near-Duplikaten während des Trainings einen messbaren Vorteil bietet:

Zero-Shot-Klassifizierungs-Genauigkeit auf dem ImageNet-Validierungs-Set über Subsets mit und ohne Leck hinweg. Die letzte Spalte berichtet Genauigkeits-Gewinne im Vergleich zum vollständigen Satz, und hervorgehobene Zeilen entsprechen geleakten Subsets.

Zero-Shot-Klassifizierungs-Genauigkeit auf dem ImageNet-Validierungs-Set über Subsets mit und ohne Leck hinweg. Die letzte Spalte berichtet Genauigkeits-Gewinne im Vergleich zum vollständigen Satz, und hervorgehobene Zeilen entsprechen geleakten Subsets.

Bei der überwachten Klassifizierung verursachte Leck in ImageNet einen dramatischen Leistungsabfall – es sei denn, das geleakte Bild hatte das gleiche Label in beiden Splits, in welchem Fall das Modell nahezu perfekte Genauigkeit erreichte, was einen starken Memorisation-Effekt aufdeckt:

Überwachte Klassifizierungs-Genauigkeit auf dem ImageNet-Validierungs-Set für Subsets, mit und ohne Leck. Die Gewinn-Spalten zeigen die Änderung im Vergleich zum vollständigen Satz. Geleakte Subsets sind hervorgehoben.

Überwachte Klassifizierungs-Genauigkeit auf dem ImageNet-Validierungs-Set für Subsets, mit und ohne Leck. Die Gewinn-Spalten zeigen die Änderung im Vergleich zum vollständigen Satz. Geleakte Subsets sind hervorgehoben.

Bei der Bild-Text-Retrieval verbesserte sich die Leistung erneut für geleakte Proben, wobei sowohl hartes als auch weiches Leck zu höherer Recall führten, und wobei geleakte Subsets auch konsistentere Ergebnisse über Läufe hinweg lieferten:

Bild-Text-Retrieval-Leistung auf Flickr30k über Subsets mit und ohne Leck hinweg, wobei geleakte Subsets hervorgehoben sind.

Bild-Text-Retrieval-Leistung auf Flickr30k über Subsets mit und ohne Leck hinweg, wobei geleakte Subsets hervorgehoben sind.

Die Autoren schlussfolgern:

‘Insgesamt zeigen wir konsistente Beweise, dass Leck eine ernsthafte Bedrohung für eine faire Modell-Auswertung in visuellen Datensätzen darstellt, die eine der grundlegendsten Prinzipien des maschinellen Lernens gefährdet: nicht die Auswertung von Modellen auf ihren Trainings-Daten durchzuführen.’

Schlussfolgerung

Ein schockierender Aspekt des Papiers, obwohl es keine Neuigkeit ist, ist die Erwähnung, dass CLIP verwendet werden musste, um Embeddings für den riesigen Berg an Bild-Daten in LAION zu erhalten, was einen Umfang darstellt, der nicht mehr auf andere Weise als aggregiert behandelt werden kann, indem man mit tokenisierten Metadaten anstelle der detaillierteren Merkmale, die bei einem handhabbaren Datensatz untersucht werden können, arbeitet.

Es ist eine deutliche Illustration des Ausmaßes, in dem das Training von Vision-Sprache-Modellen die Grenzen und Fähigkeiten der menschlichen Überwachung oder jeder Art von manueller Kuratierung über repräsentative Sub-Samples hinaus definitiv überschritten hat.

 

* Vielleicht ein bisschen verwirrend, wird das Problem der Duplizierung in der Arbeit als ‘Leck’ definiert.

† Betonung der Autoren.

Erstveröffentlicht am Dienstag, den 26. August 2025

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai