Andersons Blickwinkel

Zensur von KI-Modellen funktioniert nicht gut, Studie zeigt

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
ChatGPT-4o, Krita (Flux/Flux Koncept Dev), Firefly.

Die Versuche, KI-Bildgeneratoren durch das Löschen von verbotenem Inhalt (wie Pornografie, Gewalt oder urheberrechtlich geschützten Stilen) aus den trainierten Modellen zu zensieren, sind nicht erfolgreich: Eine neue Studie zeigt, dass die aktuellen Methoden der Konzeptlöschung es verbotenen Attributen ermöglichen, in nicht verwandte Bilder zu gelangen, und auch nicht verhindern, dass eng verwandte Versionen des vermeintlich “gelöschten” Inhalts auftauchen.

 

Wenn Unternehmen, die grundlegende KI-Modelle produzieren, nicht verhindern können, dass diese missbräuchlich verwendet werden, um unangemessene oder illegale Materialien zu produzieren, riskieren sie, verklagt und/oder geschlossen zu werden. Andererseits sind Anbieter, die ihre Modelle nur über eine API bereitstellen, wie z.B. Adobe’s Firefly-Generativ-Engine, in der Lage, sich keine Sorgen über das zu machen, was ihre Modelle möglicherweise erstellen, da sowohl die Benutzereingabe als auch die resultierende Ausgabe überprüft und gesäubert werden:

Adobes Firefly-System, das in Tools wie Photoshop verwendet wird, weigert sich manchmal sofort, eine generative Anfrage zu bearbeiten, indem es die Eingabe vor der Erstellung blockiert. Manchmal generiert es das Bild, aber blockiert das Ergebnis nach der Überprüfung. Diese Art von mid-process-Verweigerung kann auch bei ChatGPT auftreten, wenn das Modell eine Antwort beginnt, aber nach Erkennen einer Richtlinienverletzung abbricht - und manchmal kann man das abgebrochene Bild während dieses Prozesses kurz sehen.

Adobes Firefly-System, das in Tools wie Photoshop verwendet wird, weigert sich manchmal sofort, eine generative Anfrage zu bearbeiten, indem es die Eingabe vor der Erstellung blockiert. Manchmal generiert es das Bild, aber blockiert das Ergebnis nach der Überprüfung. Diese Art von mid-process-Verweigerung kann auch bei ChatGPT auftreten, wenn das Modell eine Antwort beginnt, aber nach Erkennen einer Richtlinienverletzung abbricht – und manchmal kann man das abgebrochene Bild während dieses Prozesses kurz sehen.

API-Filter dieser Art können jedoch in der Regel von Benutzern auf lokalen Modellen neutralisiert werden, einschließlich Vision-Language-Modellen (VLMs), die der Benutzer möglicherweise durch lokale Trainings auf benutzerdefinierten Daten anpassen möchte.

Die Deaktivierung solcher Operationen ist in den meisten Fällen trivial und erfordert lediglich das Auskommentieren eines Funktionsaufrufs in Python (obwohl Hacks dieser Art normalerweise nach Framework-Updates wiederholt oder neu erfunden werden müssen).

Aus geschäftlicher Sicht ist es schwierig zu verstehen, wie dies ein Problem sein könnte, da der API-Ansatz die Unternehmenskontrolle über den Benutzer-Workflow maximiert. Aus der Sicht des Benutzers jedoch ist sowohl die Kosten von API-Modellen als auch das Risiko von Fehl- oder übermäßiger Zensur wahrscheinlich, um sie dazu zu bringen, lokale Installationen von Open-Source-Alternativen herunterzuladen und anzupassen – zumindest, wenn die FOSS-Lizenzierung günstig ist.

Das letzte bedeutende Modell, das ohne jeden Versuch, Selbstzensur zu verankern, veröffentlicht wurde, war Stable Diffusion V1.5, fast drei Jahre ago. Später führte die Enthüllung, dass seine Trainingskorpora CSAM-Daten enthielten, zu wachsenden Forderungen, seine Verfügbarkeit zu verbieten, und seiner Entfernung aus dem Hugging Face-Repository im Jahr 2024.

Schneiden Sie es aus!

Zyniker behaupten, dass das Interesse eines Unternehmens an der Zensur von lokal installierbaren generativen KI-Modellen allein auf Bedenken hinsichtlich der rechtlichen Haftung basiert, sollte ihr Framework öffentlich bekannt werden, weil es die Erstellung unangemessener oder illegaler Inhalte ermöglicht.

Einige ‘lokal-freundliche’ Open-Source-Modelle sind nicht so schwer zu entsperren (wie Stable Diffusion 1.5 und DeepSeek R1).

Im Gegensatz dazu war die jüngste Veröffentlichung von Black Forest Lab’s Flux Kontext-Modellreihe durch das Engagement des Unternehmens gekennzeichnet, die gesamte Kontext-Reihe zu zensieren. Dies wurde durch sorgfältige Datenkuratierung und gezielte Feinabstimmung nach dem Training erreicht, um jede verbleibende Tendenz zur NSFW- oder verbotenen Inhalte zu entfernen.

Dies ist der Ort, an dem die Forschung in den letzten 2-3 Jahren stattgefunden hat: mit einem Schwerpunkt auf der Nachbearbeitung von Modellen mit nicht kuratierten Daten. Angebote dieser Art umfassen Unified Concept Editing in Diffusion Models (UCE); Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models (RECE); Mass Concept Erasure in Diffusion Models (MACE); und concept-Semi-Permeable structure is injected as a Membrane (SPM):

Das 2024-Papier 'Unified Concept Editing in Diffusion Models' bot geschlossene Formulierungen für Aufmerksamkeitsgewichte, die eine effiziente Bearbeitung mehrerer Konzepte in Text-Bild-Modellen ermöglichten. Aber hält die Methode der Prüfung stand?

Das 2024-Papier ‘Unified Concept Editing in Diffusion Models’ bot geschlossene Formulierungen für Aufmerksamkeitsgewichte, die eine effiziente Bearbeitung mehrerer Konzepte in Text-Bild-Modellen ermöglichten. Aber hält die Methode der Prüfung stand?

Obwohl dies ein effizienter Ansatz ist (Hyperskalensammlungen wie LAION sind viel zu groß, um manuell zu kuratieren), ist er nicht unbedingt effektiv: Laut einer neuen US-Studie funktionieren keine der oben genannten Bearbeitungsverfahren – die den aktuellen Stand der Technik bei der Nachbearbeitung von KI-Modellen darstellen – sehr gut.

Die Autoren fanden heraus, dass diese Konzeptlöschtechniken (CETs) normalerweise leicht umgangen werden können und dass sie, selbst wenn sie effektiv sind, erhebliche Nebenwirkungen haben:

Auswirkungen der Konzeptlöschung auf Text-Bild-Modelle. Jede Spalte zeigt eine Eingabe und das zu löschende Konzept, zusammen mit den generierten Ausgaben vor und nach der Bearbeitung. Hierarchien zeigen Eltern-Kind-Beziehungen zwischen Konzepten. Die Beispiele zeigen häufige Nebenwirkungen, einschließlich des Versagens, Kindkonzepte zu löschen, der Unterdrückung benachbarter Konzepte, der Umgehung durch Umformulierung und der Übertragung gelöschter Attribute auf nicht verwandte Objekte.. Quelle: https://arxiv.org/pdf/2508.15124

Auswirkungen der Konzeptlöschung auf Text-Bild-Modelle. Jede Spalte zeigt eine Eingabe und das zu löschende Konzept, zusammen mit den generierten Ausgaben vor und nach der Bearbeitung. Hierarchien zeigen Eltern-Kind-Beziehungen zwischen Konzepten. Die Beispiele zeigen häufige Nebenwirkungen, einschließlich des Versagens, Kindkonzepte zu löschen, der Unterdrückung benachbarter Konzepte, der Umgehung durch Umformulierung und der Übertragung gelöschter Attribute auf nicht verwandte Objekte. Quelle: https://arxiv.org/pdf/2508.15124

Die Autoren fanden heraus, dass die führenden aktuellen Konzeptlöschtechniken nicht in der Lage sind, kompositionale Prompts zu blockieren (z.B. roter Wagen oder kleiner hölzerner Stuhl); oft lassen sie Unterklassen durchschlüpfen, auch nachdem eine Elternkategorie gelöscht wurde (z.B. Auto oder Bus erscheinen weiterhin, nachdem Fahrzeug entfernt wurde); und führen neue Probleme wie Attribut-Leckage ein (wenn z.B. das Löschen von blauem Sofa dazu führt, dass das Modell ein blaues Auto generiert).

In über 80% der Testfälle führte das Löschen eines breiten Konzepts wie Fahrzeug nicht dazu, dass das Modell aufhörte, spezifischere Fahrzeug-Instanzen wie Autos oder Busse zu generieren.

Die Bearbeitung, so bemerkt das Papier, führt auch dazu, dass Aufmerksamkeitskarten (die Teile des Modells, die entscheiden, wo im Bild zu fokussieren ist) zerstreut werden, was die Ausgabqualität schwächt.

Interessanterweise findet das Papier heraus, dass das Löschen verwandter trainierter Konzepte einzeln besser funktioniert als das Löschen aller auf einmal – obwohl es nicht alle Mängel der untersuchten Bearbeitungsmethoden beseitigt:

Vergleich von progressiven und auf-einmal-Löschstrategien. Wenn alle Varianten von 'Teddybär' gleichzeitig gelöscht werden, generiert das Modell weiterhin bärähnliche Objekte. Das Löschen der Varianten schrittweise ist effektiver und führt dazu, dass das Modell das Zielkonzept zuverlässiger unterdrückt.

Vergleich von progressiven und auf-einmal-Löschstrategien. Wenn alle Varianten von ‘Teddybär’ gleichzeitig gelöscht werden, generiert das Modell weiterhin bärähnliche Objekte. Das Löschen der Varianten schrittweise ist effektiver und führt dazu, dass das Modell das Zielkonzept zuverlässiger unterdrückt.

Obwohl die Forscher derzeit keine Lösung für die in der Studie aufgezeigten Probleme anbieten können, haben sie ein neues Dataset und eine Benchmark entwickelt, die möglicherweise späteren Forschungsprojekten helfen können, zu verstehen, ob ihre eigenen “zensierten” Modelle wie erwartet funktionieren.

Das Papier besagt:

‘Frühere Bewertungen haben sich ausschließlich auf eine kleine Menge von Ziel- und Erhaltungsklassen verlassen; zum Beispiel, wenn das Konzept, das gelöscht werden soll, ‘Fahrzeug’ ist, wird nur die Fähigkeit des Modells getestet, Fahrzeuge zu generieren. Wir zeigen, dass dieser Ansatz grundlegend unzureichend ist und die Konzeptlöschungsbewertung umfassender sein sollte, um alle verwandten Subkonzepte wie ‘roter Wagen’ zu umfassen.

‘Durch die Einführung eines vielfältigen Datensatzes mit kompositionellen Variationen und systematischer Analyse von Effekten wie Auswirkungen auf benachbarte Konzepte, Konzeptumgehung und Attribut-Leckage decken wir erhebliche Einschränkungen und Nebenwirkungen bestehender CETs auf.

‘Unsere Benchmark ist modellunabhängig und leicht integrierbar und ist ideal geeignet, um die Entwicklung neuer Konzeptlöschtechniken (CETs) zu unterstützen.’

Obwohl CETs das Zielkonzept 'Vogel' löschen, versagen sie bei der kompositionellen Variante 'roter Vogel' (oben). Nach dem Löschen von 'blauem Sofa' verlieren alle Methoden auch die Fähigkeit, einen blauen Stuhl zu generieren (unten). Erfolgreiche Ergebnisse sind mit einem grünen Häkchen-Symbol markiert, und Misserfolge mit einem roten Kreuz-Symbol.

Obwohl CETs das Zielkonzept ‘Vogel’ löschen, versagen sie bei der kompositionellen Variante ‘roter Vogel’ (oben). Nach dem Löschen von ‘blauem Sofa’ verlieren alle Methoden auch die Fähigkeit, einen blauen Stuhl zu generieren (unten). Erfolgreiche Ergebnisse sind mit einem grünen Häkchen-Symbol markiert, und Misserfolge mit einem roten ‘X’-Symbol.

Die Studie bietet einen interessanten Einblick in das Ausmaß der Verflechtung von Konzepten, die in den latenten Raum eines Modells trainiert werden, und das Ausmaß, in dem Verflechtung es nicht leicht ermöglicht, ein bestimmtes und wirklich diskretes Konzept zu löschen.

Die neue Studie trägt den Titel Side Effects of Erasing Concepts from Diffusion Models und stammt von vier Forschern der University of Maryland.

Methode und Daten

Die Autoren sind der Meinung, dass frühere Arbeiten, die behaupten, Konzepte aus Diffusionsmodellen zu löschen, den Anspruch nicht ausreichend belegen, und stellen fest*:

‘Behauptungen über das Löschen benötigen eine robustere und umfassendere Bewertung. Zum Beispiel, wenn das Konzept, das gelöscht werden soll, ‘Fahrzeug’ ist, sollten auch Subkonzepte wie ‘Auto’ und kompositionelle Konzepte wie ‘roter Wagen’ oder ‘kleiner Wagen’ gelöscht werden.

‘Dieser Aspekt der Konzept-Hierarchie und -Komposition wird jedoch in bestehenden Bewertungsprotokollen nicht berücksichtigt, da sie sich nur auf die Genauigkeit des einzelnen gelöschten Konzepts konzentrieren. [Die Autoren von EraseBench] bewerten, wie CETs visuell ähnliche und paraphrasierte Konzepte (wie ‘Katze’ und ‘Kätzchen’) beeinflussen; jedoch erforschen sie nicht erschöpfend die Hierarchie und Komposition von Konzepten.’

Um Benchmark-Daten für zukünftige Projekte bereitzustellen, erstellten die Autoren den Side Effect Evaluation (SEE)-Datensatz – eine große Sammlung von Text-Prompts, die darauf ausgelegt sind, zu testen, wie gut Konzeptlöschmethoden funktionieren.

Die Prompts folgen einem einfachen Template, in dem ein Objekt mit Attributen wie Größe, Farbe und Material beschrieben wird – zum Beispiel ein Bild eines kleinen roten hölzernen Autos.

Objekte wurden aus dem MS-COCO-Datensatz ausgewählt und in eine Hierarchie von Oberklassen wie Fahrzeug und Unterklassen wie Auto oder Bus organisiert, wobei die Attributkombinationen die Blätter (die spezifischste Ebene der Hierarchie) bildeten. Diese Struktur ermöglicht es, das Löschen auf verschiedenen semantischen Ebenen zu testen, von breiten Kategorien bis hin zu spezifischen Varianten.

Um eine automatisierte Bewertung zu unterstützen, wurde jeder Prompt mit einer Ja-oder-Nein-Frage wie Gibt es ein Auto im Bild? gepaart und auch als Klassenlabel für Bildklassifizierungsmodelle verwendet:

Prompt-Kombinationen im SEE-Datensatz, die durch Variation von Größe-, Farbe- und Materialattributen generiert wurden.

Prompt-Kombinationen im SEE-Datensatz, die durch Variation von Größe-, Farbe- und Materialattributen generiert wurden.

Um zu messen, wie gut jede Konzeptlöschmethode funktionierte, entwickelten die Autoren zwei Bewertungsmethoden: Zielgenauigkeit, die misst, wie oft gelöschte Konzepte immer noch in den generierten Bildern erscheinen; und Erhaltungs-Genauigkeit, die misst, ob das Modell weiterhin Material generiert, das nicht gelöscht werden sollte.

Die Balance zwischen den beiden Bewertungen soll zeigen, ob die Methode das verbotene Konzept erfolgreich entfernt, ohne die Ausgabe des Modells zu schädigen.

Die Autoren bewerteten die Konzeptlöschung über drei Fehlermodi: Erstens, ein Maß dafür, ob das Entfernen eines Konzepts wie Fahrzeug benachbarte oder nicht verwandte Konzepte stört, basierend auf semantischer und attributbasierter Ähnlichkeit; zweitens, ein Test darauf, ob das Löschen umgangen werden kann, indem Subkonzepte wie roter Wagen nach dem Löschen von Fahrzeug verwendet werden.

Schließlich wurde ein Test auf Attribut-Leckage durchgeführt, bei dem Merkmale, die mit gelöschten Konzepten verknüpft sind, in anderen Teilen des Bildes erscheinen (z.B. das Löschen von Sofa könnte dazu führen, dass ein anderes Objekt, wie ein Topf, dessen Farbe oder Material übernimmt). Der endgültige Datensatz enthält 5056 kompositionelle Prompts

Tests

Die getesteten Frameworks waren die oben genannten – UCE, RECE, MACE und SPM. Die Forscher übernahmen die Standard-Einstellungen aus den ursprünglichen Projekten und feinabstimmten alle Modelle auf einer NVIDIA RTX 6000 GPU mit 48 GB VRAM.

Stable Diffusion 1.4, eines der am häufigsten verwendeten Modelle in der Literatur, wurde für alle Tests verwendet – vielleicht nicht zuletzt, weil die frühesten SD-Modelle wenig oder keine konzeptionelle Einschränkung hatten und somit eine weiße Leinwand in diesem Forschungskontext darstellen.

Jeder der 5056 Prompts aus dem SEE-Datensatz wurde durch die uneditierte und die editierte Version des Modells geführt, wobei vier Bilder pro Prompt mit festen Zufallsseeds generiert wurden, um zu testen, ob die Löschungseffekte über mehrere Ausgaben hinweg konsistent blieben. Jedes editierte Modell produzierte insgesamt 20.224 Bilder.

Die Anwesenheit von erhaltenen Konzepten wurde gemäß früheren Methoden für Text-Bild-Löschverfahren bewertet, unter Verwendung der VQA-Modelle BLIP, QWEN 2.5 VL und Florence-2base.

Auswirkungen auf benachbarte Konzepte

Der erste Test maß, ob das Löschen eines Konzepts unbeabsichtigt benachbarte Konzepte beeinflusste. Zum Beispiel, nach dem Entfernen von Auto, sollte das Modell aufhören, roter Wagen oder großer Wagen zu generieren, aber immer noch in der Lage sein, verwandte Konzepte wie Bus oder LKW zu generieren, und nicht verwandte wie Gabel.

Die Analyse verwendete CLIP-Ähnlichkeit und attributbasierte Edit-Distanz, um zu schätzen, wie nah jedes Konzept dem gelöschten Ziel war, um so die Störung zu quantifizieren:

Kombinierte Ergebnisse für Zielgenauigkeit (links) und Erhaltungs-Genauigkeit (rechts) gegen semantische Ähnlichkeit (oben) und kompositionelle Distanz (unten). Eine ideale Konzeptlöschmethode würde eine niedrige Zielgenauigkeit und eine hohe Erhaltungs-Genauigkeit über alle Distanzen hinweg zeigen; aber die Ergebnisse zeigen, dass die aktuellen Techniken nicht sauber generalisieren, mit näheren Konzepten, die entweder unzureichend gelöscht oder unverhältnismäßig gestört werden.

Kombinierte Ergebnisse für Zielgenauigkeit (links) und Erhaltungs-Genauigkeit (rechts) gegen semantische Ähnlichkeit (oben) und kompositionelle Distanz (unten). Eine ideale Konzeptlöschmethode würde eine niedrige Zielgenauigkeit und eine hohe Erhaltungs-Genauigkeit über alle Distanzen hinweg zeigen; aber die Ergebnisse zeigen, dass die aktuellen Techniken nicht sauber generalisieren, mit näheren Konzepten, die entweder unzureichend gelöscht oder unverhältnismäßig gestört werden.

Von diesen Ergebnissen bemerken die Autoren:

‘Alle CETs generieren weiterhin kompositionelle oder semantisch entfernte Varianten des Ziels, trotz der Löschung, was idealerweise nicht auftreten sollte. Es ist offensichtlich, dass UCE konsistent eine höhere Genauigkeit als andere CET-Methoden auf der [Erhaltungs-]Menge erreicht, was auf einen minimalen ungewollten Einfluss auf semantisch verwandte Konzepte hinweist.

‘Im Gegensatz dazu erreicht SPM die niedrigste Genauigkeit, was darauf hindeutet, dass seine Bearbeitungsstrategie anfälliger für Konzept-Ähnlichkeit ist.’

Unter den vier getesteten Methoden war RECE am effektivsten, um das Zielkonzept zu blockieren. Allerdings, wie in der linken Seite des Bildes oben gezeigt, versagten alle Methoden, kompositionelle Varianten zu unterdrücken. Nach dem Löschen von Vogel generierte das Modell immer noch Bilder eines roten Vogels, was darauf hindeutet, dass das Konzept teilweise intakt blieb.

Das Entfernen von blauem Sofa verhinderte auch, dass das Modell ein blaues Auto generierte, was auf eine Schädigung benachbarter Konzepte hinweist.

RECE behandelte kompositionelle Varianten besser als die anderen, während UCE eine bessere Aufgabe bei der Erhaltung verwandter Konzepte erledigte.

Löschungsumgehung

Der Löschungsumgehungs-Test bewertete, ob Modelle immer noch Subkonzepte generieren konnten, nachdem ihre Oberklasse gelöscht worden war. Zum Beispiel, wenn Fahrzeug entfernt wurde, überprüfte der Test, ob das Modell immer noch Ausgaben wie Fahrrad oder roter Wagen produzieren konnte.

Prompts zielten auf direkte Subklassen und kompositionelle Varianten, um zu bestimmen, ob die Konzeptlösch-Operation die gesamte Hierarchie tatsächlich entfernt hatte oder ob sie durch spezifischere Beschreibungen umgangen werden konnte:

Umgang mit gelöschten Oberklassen durch ihre Subklassen und kompositionellen Varianten, mit höherer Genauigkeit, was auf eine größere Umgangsmöglichkeit hinweist.

Umgang mit gelöschten Oberklassen durch ihre Subklassen und kompositionellen Varianten, mit höherer Genauigkeit, was auf eine größere Umgangsmöglichkeit hinweist.

Das uneditierte Modell behielt eine hohe Genauigkeit über alle Oberklassen hinweg, was bestätigte, dass es keine Zielkonzepte entfernt hatte. Unter den CETs zeigte MACE die geringste Umgangsmöglichkeit, indem es in mehr als der Hälfte der getesteten Kategorien die niedrigste Subklasse-Genauigkeit erreichte. RECE zeigte auch eine gute Leistung, insbesondere in den Zubehör-, Sport– und Elektronik-Gruppen.

Im Gegensatz dazu zeigten UCE und SPM eine höhere Subklasse-Genauigkeit, was darauf hindeutet, dass gelöschte Konzepte leichter durch verwandte oder verschachtelte Prompts umgangen werden konnten.

Die Autoren bemerken:

‘Alle CETs unterdrücken erfolgreich das Ziel-Oberkonzept (‘Essen’). Aber wenn sie mit attributbasierten Kindern der Essens-Hierarchie (z.B. ‘große Pizza’) konfrontiert werden, generieren alle Methoden Essensartikel.

‘Ähnlich verhält es sich in der ‘Fahrzeug’-Kategorie, alle Modelle generieren Fahrräder, obwohl ‘Fahrzeug’ gelöscht wurde.’

Attribut-Leckage

Der dritte Test, Attribut-Leckage, überprüfte, ob Merkmale, die mit gelöschten Konzepten verknüpft sind, in anderen Teilen des Bildes erscheinen.

Beispielsweise sollte das Modell nach dem Löschen von Sofa weder ein Sofa noch dessen typische Merkmale (wie Farbe oder Material) auf nicht verwandte Objekte im gleichen Prompt anwenden. Dies wurde gemessen, indem das Modell mit gepaarten Objekten konfrontiert und überprüft wurde, ob die gelöschten Merkmale fälschlicherweise in erhaltenen Konzepten erschienen:

Aufmerksamkeitskarten für Attribut-Tokens nach Konzeptlöschung. Links: Wenn 'Bank' gelöscht wird, verschiebt sich das Token 'holz' zum Vogel, was zu hölzernen Vögeln führt. Rechts: Das Löschen von 'Sofa' verhindert nicht die Sofa-Generierung, während das Token 'groß' fälschlicherweise dem Doughnut zugewiesen wird.

Aufmerksamkeitskarten für Attribut-Tokens nach Konzeptlöschung. Links: Wenn ‘Bank’ gelöscht wird, verschiebt sich das Token ‘holz’ zum Vogel, was zu hölzernen Vögeln führt. Rechts: Das Löschen von ‘Sofa’ verhindert nicht die Sofa-Generierung, während das Token ‘groß’ fälschlicherweise dem Doughnut zugewiesen wird.

RECE war am effektivsten darin, Ziel-Attribute zu löschen, aber führte auch die meisten Attribut-Leckagen in erhaltenen Prompts ein, was sogar das uneditierte Modell übertraf. UCE leckte weniger als andere Methoden.

Die Ergebnisse, so schlagen die Autoren vor, deuten auf die Notwendigkeit eines inhärenten Kompromisses hin, wobei eine stärkere Löschung das Risiko einer fehlgeleiteten Attribut-Übertragung erhöht.

Schlussfolgerung

Der latente Raum eines Modells füllt sich nicht auf eine geordnete Weise während des Trainings, mit abgeleiteten Konzepten, die ordentlich auf Regale oder in Schubladen abgelegt werden; sondern die trainierten Einbettungen sind sowohl der Inhalt als auch ihre Behälter: nicht durch starre Grenzen getrennt, sondern ineinander verschmolzen, was die Entfernung problematisch macht – wie das Versuch, ein Pfund Fleisch zu entfernen, ohne Blutverlust.

In intelligenten und sich entwickelnden Systemen sind grundlegende Ereignisse – wie das Verbrennen der Finger und die spätere respektvolle Behandlung von Feuer – mit den Verhaltensweisen und Assoziationen, die sie später bilden, verbunden, was es schwierig macht, ein Modell zu erstellen, das möglicherweise mit den Konsequenzen eines zentralen, potenziell ‘verbotenen’ Konzepts übrig bleibt, aber selbst nicht über dieses Konzept verfügt.

 

* Meine Umwandlung der Autoren-Inline-Zitate in Hyperlinks.

Erstveröffentlicht am Freitag, 22. August 2025

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai