Kąt Andersona

Cenzurowanie modeli AI nie działa dobrze, ujawnia badanie

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ChatGPT-4o, Krita (Flux/Flux Koncept Dev), Firefly.

Próby cenzurowania generatorów obrazów AI przez usuwanie zakazanych treści (takich jak pornografia, przemoc lub chronione prawem autorskim style) z wytrenowanych modeli nie przynoszą pożądanych efektów: nowe badanie wykazało, że obecne metody usuwania pojęć pozwalają “zakazanym” atrybutom przenikać do niezwiązanych obrazów i nie powstrzymują powiązanych wersji rzekomo “usuniętej” treści od pojawiania się.

 

Jeśli firmy produkujące podstawowe modele AI nie mogą zapobiec ich nadużywaniu do tworzenia obraźliwych lub nielegalnych materiałów, ryzykują prześladowania i/lub zamknięcie. Odwrotnie, dostawcy, którzy udostępniają swoje modele tylko za pośrednictwem interfejsu API, jak w przypadku silnika generatywnego Firefly firmy Adobe, są w sytuacji, w której nie muszą się martwić o to, co ich modele mogą tworzyć, ponieważ zarówno prompt użytkownika, jak i wygenerowany wynik są sprawdzane i oczyszczane:

System Firefly firmy Adobe, wykorzystywany w narzędziach takich jak Photoshop, czasami odmawia generatywnej prośby od razu, blokując提示 przed utworzeniem czegokolwiek. Czasami generuje obraz, ale następnie blokuje wynik po przeglądzie. Ten rodzaj odmowy w trakcie procesu może również wystąpić w ChatGPT, gdy model rozpoczyna odpowiedź, ale przerywa ją po rozpoznaniu naruszenia polityki.

System Firefly firmy Adobe, wykorzystywany w narzędziach takich jak Photoshop, czasami odmawia generatywnej prośby od razu, blokując提示 przed utworzeniem czegokolwiek. Czasami generuje obraz, ale następnie blokuje wynik po przeglądzie. Ten rodzaj odmowy w trakcie procesu może również wystąpić w ChatGPT, gdy model rozpoczyna odpowiedź, ale przerywa ją po rozpoznaniu naruszenia polityki.

Jednak filtry API tego rodzaju można zwykle neutralizować, jeśli użytkownicy zainstalują modele lokalnie, w tym modele językowo-wizualne (VLM), które użytkownik może chcieć dostosować za pomocą lokalnego szkolenia na danych niestandardowych.

W większości przypadków wyłączenie takich operacji jest trywialne i wymaga jedynie zakomentowania wywołania funkcji w Pythonie (chociaż hakowanie tego rodzaju zwykle musi być powtarzane lub ponownie wymyślane po aktualizacjach frameworka).

Z punktu widzenia biznesu trudno zrozumieć, jak to mogłoby być problemem, ponieważ podejście oparte na API maksymalizuje korporacyjną kontrolę nad przepływem pracy użytkownika. Z perspektywy użytkownika jednak zarówno koszt modeli tylko z API, jak i ryzyko błędnej lub nadmiernej cenzury, prawdopodobnie skłoni ich do pobrania i dostosowania lokalnych instalacji alternatyw otwartoźródłowych – przynajmniej tam, gdzie licencjonowanie FOSS jest korzystne.

Ostatnim znaczącym modelem, który został wydany bez żadnej próby wbudowania samoregulacji, był Stable Diffusion V1.5, prawie trzy lata temu. Później ujawnienie, że jego zestawy szkoleniowe zawierały dane CSAM, doprowadziło do rosnących wezwań do zakazu ich dostępności oraz usunięcia z repozytorium Hugging Face w 2024 roku.

Wyciąć to!

Cynicy twierdzą, że zainteresowanie cenzurowaniem lokalnie instalowalnych generatywnych modeli AI jest oparte wyłącznie na obawach o ekspozycję prawną, jeśli ich ramy staną się publicznie znane z ułatwiania nielegalnych lub obraźliwych treści.

W rzeczywistości niektóre “przyjazne dla lokalnego użytkowania” modele open source nie są tak trudne do odcenzurowania (jak Stable Diffusion 1.5 i DeepSeek R1).

W przeciwieństwie do tego, niedawne wydanie serii modeli Kontext przez Black Forest Lab zostało zunifikowane przez zaangażowanie firmy w ocenzurowanie całego zakresu Kontext, zarówno przez staranne kuratorowanie danych, jak i ukierunkowane dostosowanie po szkoleniu, zaprojektowane w celu usunięcia wszelkich pozostałych tendencji do tworzenia treści NSFW lub zakazanych.

To jest miejsce, w którym znajduje się centrum działania w scenie badawczej przez ostatnie 2-3 lata: z naciskiem na naprawę modeli z niedostatecznie uważnymi danymi. Oferty tego rodzaju obejmują Unified Concept Editing in Diffusion Models (UCE); Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models (RECE); Mass Concept Erasure in Diffusion Models (MACE); i concept-Semi-Permeable structure is injected as a Membrane (SPM):

Artykuł z 2024 roku 'Unified Concept Editing in Diffusion Models' oferował zamknięte edycje wag uwagi, umożliwiając wydajną edycję wielu pojęć w modelach tekstowych do obrazu. Ale czy metoda wytrzymuje krytykę?

Artykuł z 2024 roku ‘Unified Concept Editing in Diffusion Models’ oferował zamknięte edycje wag uwagi, umożliwiając wydajną edycję wielu pojęć w modelach tekstowych do obrazu. Ale czy metoda wytrzymuje krytykę? Source: https://arxiv.org/pdf/2308.14761

Chociaż jest to wydajne podejście (zbiory hiperskali, takie jak LAION, są zbyt duże, aby ręcznie je kuratorować), nie jest to koniecznie skuteczne: według nowego amerykańskiego badania, żadna z wymienionych procedur edycyjnych – reprezentujących stan sztuki w modyfikacji modeli AI po szkoleniu – nie działa szczególnie dobrze.

Autorzy odkryli, że te techniki usuwania pojęć (CET) mogą zwykle być łatwo obejściowe, a nawet tam, gdzie są one skuteczne, mają one znaczne skutki uboczne:

Efekty usuwania pojęć w modelach tekstowych do obrazu. Każda kolumna przedstawia提示 i usuwaną koncepcję, wraz z wygenerowanymi wynikami przed i po edycji. Hierarchie wskazują relacje rodzic-dziecko między pojęciami. Przykłady podkreślają powszechne skutki uboczne, w tym niepowodzenie w usunięciu podrzędnych pojęć, tłumienie sąsiednich pojęć, unikanie przez przeszczegółowienie i przeniesienie usuniętych atrybutów do niezwiązanych obiektów.

Efekty usuwania pojęć w modelach tekstowych do obrazu. Każda kolumna przedstawia提示 i usuwaną koncepcję, wraz z wygenerowanymi wynikami przed i po edycji. Hierarchie wskazują relacje rodzic-dziecko między pojęciami. Przykłady podkreślają powszechne skutki uboczne, w tym niepowodzenie w usunięciu podrzędnych pojęć, tłumienie sąsiednich pojęć, unikanie przez przeszczegółowienie i przeniesienie usuniętych atrybutów do niezwiązanych obiektów. Source: https://arxiv.org/pdf/2508.15124

Autorzy odkryli, że wiodące obecne techniki usuwania pojęć nie blokują kompozycyjnych podpowiedzi (na przykład red car lub small wooden chair); często pozwalają na przenikanie podrzędnych klas, nawet po usunięciu nadrzędnej kategorii (takiej jak car lub bus, które nadal pojawiają się po usunięciu vehicle); i wprowadzają nowe problemy, takie jak przeniesienie atrybutów (gdzie, na przykład, usunięcie blue couch może spowodować, że model wygeneruje niezwiązane obiekty, takie jak blue chair).

W ponad 80% przypadków testowych usunięcie szerokiej koncepcji, takiej jak vehicle, nie powstrzymało modelu od generowania bardziej szczegółowych instancji vehicle, takich jak samochody lub busy.

Edycja, jak zauważa artykuł, powoduje również rozproszenie map uwagi (części modelu, które decydują, gdzie się skupić w obrazie), osłabiając jakość wyjścia.

Co ciekawe, artykuł stwierdza, że usuwanie powiązanych wytrenowanych pojęć jeden po drugim działa lepiej niż próba usunięcia ich wszystkich na raz – chociaż nie usuwa wszystkich wad badanych metod edycyjnych:

Porównanie strategii usuwania stopniowego i jednorazowego. Gdy wszystkie warianty 'teddy bear' są usuwane jednocześnie, model nadal generuje obiekty przypominające niedźwiedzie. Usuwanie wariantów stopniowo jest bardziej skuteczne, powodując, że model bardziej niezawodnie tłumi celowe pojęcie.

Porównanie strategii usuwania stopniowego i jednorazowego. Gdy wszystkie warianty ‘teddy bear’ są usuwane jednocześnie, model nadal generuje obiekty przypominające niedźwiedzie. Usuwanie wariantów stopniowo jest bardziej skuteczne, powodując, że model bardziej niezawodnie tłumi celowe pojęcie.

Chociaż badacze obecnie nie mogą zaproponować rozwiązania problemów, które artykuł przedstawia, opracowali nowy zestaw danych i punkt odniesienia, który może pomóc w późniejszych projektach badawczych w zrozumieniu, czy ich własne “ocenzurowane” modele działają tak, jak oczekiwano.

Artykuł stwierdza:

‘Poprzednie oceny opierały się wyłącznie na małym zestawie klas docelowych i zabezpieczających; na przykład, gdy usuwa się “car”, sprawdza się tylko zdolność modelu do generowania samochodów. Wykazujemy, że ten podejście jest fundamentalnie niewystarczające, a ocena usuwania pojęć powinna być bardziej kompleksowa, aby objąć wszystkie powiązane podpojęcia, takie jak “red car”.’

‘Przez wprowadzenie zróżnicowanego zestawu danych z wariacjami kompozycyjnymi i systematyczną analizą efektów, takich jak wpływ na sąsiednie pojęcia, unikanie pojęć i przeniesienie atrybutów, ujawniamy znaczne ograniczenia i skutki uboczne istniejących CET.’

‘Nasze punkty odniesienia są modelowo-neutrale i łatwo integrujące, a także idealnie nadają się do wspomagania rozwoju nowych technik usuwania pojęć (CETs).’

Chociaż CET usuwa celowe pojęcie 'ptak', nie powstrzymuje go przed generowaniem wariantów kompozycyjnych, takich jak 'czerwony ptak' (góra). Po usunięciu 'blue couch' wszystkie metody tracą również zdolność generowania 'blue chair' (dół). Pomyślne wyniki są oznaczone zielonym znakiem tick, a niepowodzenia czerwonym krzyżykiem.

Chociaż CET usuwa celowe pojęcie ‘ptak’, nie powstrzymuje go przed generowaniem wariantów kompozycyjnych, takich jak ‘czerwony ptak’ (góra). Po usunięciu ‘blue couch’ wszystkie metody tracą również zdolność generowania ‘blue chair’ (dół). Pomyślne wyniki są oznaczone zielonym znakiem tick, a niepowodzenia czerwonym krzyżykiem.

Badanie dostarcza interesującej wglądu w zakres przenikania się pojęć wytrenowanych w przestrzeni latentnej modelu i stopień, w jakim splątanie nie pozwoli na łatwe i rzeczywiste usunięcie pojęć.

Nowy artykuł pt. “Skutki uboczne usuwania pojęć z modeli dyfuzyjnych” pochodzi od czterech badaczy z Uniwersytetu w Maryland.

Metoda i dane

Autorzy twierdzą, że poprzednie prace, które twierdzą, że usuwają pojęcia z modeli dyfuzyjnych, nie udowadniają tego twierdzenia wystarczająco, stwierdzając*:

‘Twierdzenia o usunięciu wymagają bardziej solidnej i kompleksowej oceny. Na przykład, jeśli pojęcie do usunięcia to “vehicle”, podpojęcia, takie jak “car” i kompozycyjne pojęcia, takie jak “red car” lub “small car”, również powinny być usunięte. ‘

‘Jednakże ten aspekt hierarchii pojęć i kompozycyjności nie jest brany pod uwagę w istniejących protokołach oceny, które koncentrują się wyłącznie na dokładności usuniętego pojedynczego pojęcia. [Autorzy EraseBench] oceniają, jak CET wpływa na wizualnie podobne i przeszczegółowane pojęcia (takie jak “cat” i “kitten”)[;] jednak nie wyczerpująco badają hierarchię i kompozycyjność pojęć.’

Aby dostarczyć dane referencyjne dla przyszłych projektów, autorzy stworzyli zestaw danych Side Effect Evaluation (SEE) – duży zbiór podpowiedzi tekstowych zaprojektowanych do testowania, jak dobrze metody usuwania pojęć działają.

Podpowiedzi te są oparte na prostym szablonie, w którym obiekt jest opisany atrybutami wielkości, koloru i materiału – na przykład, obraz małego czerwonego drewnianego samochodu.

Obiekty zostały pobrane z zestawu danych MS-COCO i zorganizowane w hierarchię nadklas, takich jak vehicle, i podklas, takich jak car lub bus, z kombinacjami atrybutów tworzącymi węzły liści (najbardziej szczegółowy poziom hierarchii). Ta struktura umożliwia testowanie usunięcia na różnych poziomach semantycznych, od szerokich kategorii do konkretnych wariantów.

Aby wesprzeć automatyczną ocenę, każda podpowiedź została połączona z pytaniem tak/nie, takim jak Czy w obrazie jest samochód?, i została również użyta jako etykieta klasy dla modeli klasyfikacji obrazów:

Kombinacje podpowiedzi w zestawie danych SEE, wygenerowane przez zmianę atrybutów wielkości, koloru i materiału.

Kombinacje podpowiedzi w zestawie danych SEE, wygenerowane przez zmianę atrybutów wielkości, koloru i materiału.

Aby zmierzyć, jak dobrze każda metoda usuwania pojęć działa, autorzy opracowali dwie metody oceny: dokładność celu, która śledzi, jak często usunięte pojęcia nadal pojawiają się w generowanych obrazach; i dokładność zabezpieczenia, która śledzi, czy model nadal generuje treści, które nie miały być usunięte.

Równowaga między tymi dwiema ocenami ma na celu ujawnienie, czy metoda pomyślnie usuwa zakazane pojęcie bez uszkadzania szerszych danych wyjściowych modelu.

Autorzy oceniali usuwanie pojęć w trzech trybach niepowodzenia: po pierwsze, miarą, czy usuwanie pojęcia, takiego jak car, zakłóca sąsiednie lub niezwiązane pojęcia, oparte na podobieństwie semantycznym i atrybutowym; po drugie, testem, czy usunięcie można ominąć, podając podpojęcia, takie jak red car, po usunięciu vehicle.

Wreszcie, przeprowadzono kontrolę przeniesienia atrybutów, gdzie cechy związane z usuniętymi pojęciami pojawiają się w innych częściach obrazu (na przykład, usunięcie couch może spowodować, że inny obiekt, taki jak doniczka, odziedziczy jego kolor lub materiał). Ostateczny zestaw danych zawiera 5056 kompozycyjnych podpowiedzi

Testy

Wcześniej wymienione ramy zostały przetestowane – UCE, RECE, MACE i SPM. Badacze przyjęli ustawienia domyślne z oryginalnych projektów i dostosowali wszystkie modele na karcie graficznej NVIDIA RTX 6000 z 48 GB pamięci VRAM.

Stable Diffusion 1.4, jeden z najbardziej trwałych modeli w literaturze, został użyty we wszystkich testach – być może nie tylko dlatego, że wczesne modele SD miały niewiele lub żadnych ograniczeń pojęciowych, co czyni je czystą kartą w tym kontekście badawczym.

Każda z 5056 podpowiedzi z zestawu danych SEE została uruchomiona w wersjach nieedytowanych i edytowanych modelu, generując cztery obrazy na podpowiedź przy użyciu ustalonych nasion losowych, co pozwoliło na przetestowanie, czy efekty usunięcia były spójne w wielu danych wyjściowych. Każdy edytowany model wygenerował łącznie 20 224 obrazy.

Obecność zachowanych pojęć została oceniona zgodnie z poprzednimi metodami dla procedur usuwania tekstowych do obrazu, przy użyciu modeli VQA BLIP, QWEN 2.5 VL i Florence-2base.

Wpływ na sąsiednie pojęcia

Pierwszy test mierzył, czy usuwanie pojęcia nieumyślnie wpływa na sąsiednie pojęcia. Na przykład, po usunięciu car, model powinien przestać generować red car lub large car, ale nadal powinien być w stanie generować powiązane pojęcia, takie jak bus lub truck, i niezwiązane, takie jak fork.

Analiza wykorzystała CLIP podobieństwo osadzania i atrybutowe odległość edycyjną, aby oszacować, jak blisko każde pojęcie było do usuniętego celu, co pozwoliło na ilościową ocenę, jak daleko rozprzestrzenia się zakłócenie:

Połączone wyniki dla dokładności celu (lewy) i dokładności zabezpieczenia (prawy) wykreślone przeciwko podobieństwu semantycznemu (góra) i odległości kompozycyjnej (dół). Ideał metody usuwania pojęć powinien wykazywać niską dokładność celu i wysoką dokładność zabezpieczenia we wszystkich odległościach; jednak wyniki pokazują, że obecne techniki nie działały czysto, z bliższymi pojęciami, które albo nie były wystarczająco usunięte, albo były nadmiernie zakłócone.

Połączone wyniki dla dokładności celu (lewy) i dokładności zabezpieczenia (prawy) wykreślone przeciwko podobieństwu semantycznemu (góra) i odległości kompozycyjnej (dół). Ideał metody usuwania pojęć powinien wykazywać niską dokładność celu i wysoką dokładność zabezpieczenia we wszystkich odległościach; jednak wyniki pokazują, że obecne techniki nie działały czysto, z bliższymi pojęciami, które albo nie były wystarczająco usunięte, albo były nadmiernie zakłócone.

Z tych wyników autorzy komentują:

‘Wszystkie CET nadal generują kompozycyjne lub semantycznie odległe warianty celu pomimo usunięcia, co idealnie nie powinno się zdarzać. Jest oczywiste, że UCE konsekwentnie osiąga wyższą dokładność niż inne metody CET w [zestawie zabezpieczenia], wskazując na minimalny niezamierzony wpływ na semantycznie powiązane pojęcia. ‘

‘W przeciwieństwie do tego, SPM osiąga najniższą dokładność, sugerując, że jego strategia edycyjna jest bardziej podatna na podobieństwo pojęć.’

Wśród czterech testowanych metod RECE była najbardziej skuteczna w blokowaniu celu pojęcia. Jednak, jak widać na lewej stronie powyższego obrazu, wszystkie metody nie powstrzymały wariantów kompozycyjnych. Po usunięciu bird, model nadal generował obrazy czerwonego ptaka, sugerując, że pojęcie pozostało częściowo nienaruszone.

Usuwanie blue couch również uniemożliwiło modelowi generowanie blue chair, wskazując na szkodę dla sąsiednich pojęć.

RECE radziła sobie lepiej z wariantami kompozycyjnymi niż inne metody, podczas gdy UCE lepiej zachowywała powiązane pojęcia.

Unikanie usunięcia

Test unikania usunięcia oceniał, czy modele mogą nadal generować pojęcia podrzędne po usunięciu nadrzędnej klasy. Na przykład, jeśli vehicle zostało usunięte, test sprawdzał, czy model mógł nadal generować wyniki, takie jak bicycle lub red car.

Podpowiedzi dotyczyły zarówno bezpośrednich podklas, jak i wariantów kompozycyjnych, aby określić, czy operacja usunięcia pojęcia rzeczywiście usunęła pełną hierarchię, czy też mogła być obejściowa przez bardziej szczegółowe opisy:

Ominięcie usuniętych nadrzędnych klas przez ich podklasy i warianty kompozycyjne, z wyższą dokładnością wskazującą na większe unikanie.

Ominięcie usuniętych nadrzędnych klas przez ich podklasy i warianty kompozycyjne, z wyższą dokładnością wskazującą na większe unikanie.

Niedostosowany model utrzymywał wysoką dokładność we wszystkich nadrzędnych klasach, potwierdzając, że nie usunął żadnych celowych pojęć. Wśród CET, MACE wykazała najmniejsze unikanie, osiągając najniższą dokładność podklasy w ponad połowie testowanych kategorii. RECE również radziła sobie dobrze, szczególnie w grupach accessory, sports i electronic.

W przeciwieństwie do tego, UCE i SPM wykazały wyższą dokładność podklasy, wskazując, że usunięte pojęcia były łatwiejsze do obejścia przez powiązane lub zagnieżdżone podpowiedzi.

Autorzy zauważają:

‘[Wszystkie] CET pomyślnie tłumią celowe pojęcie nadrzędne (“food”). Jednak, gdy są podpowiedzią atrybutami dziecięcymi hierarchii żywności (np. “duży pizzę”), wszystkie metody generują produkty spożywcze. ‘

‘Podobnie w kategorii “vehicle”, wszystkie modele generują rowery, pomimo usunięcia “vehicle”.’

Przeniesienie atrybutów

Trzeci test, przeniesienie atrybutów, sprawdzał, czy cechy związane z usuniętym pojęciem pojawiają się w innych częściach obrazu.

Na przykład, po usunięciu couch, model nie powinien generować kanapy ani nie powinien stosować jej typowych atrybutów (takich jak kolor lub materiał) do niezwiązanych obiektów w tej samej podpowiedzi. To zostało zmierzone przez podpowiedź modelu z parami obiektów i zbadanie, czy usunięte atrybuty błędnie pojawiają się w zachowanych pojęciach:

Mapy uwagi dla tokenów atrybutów po usunięciu pojęcia. Lewy: Gdy 'bench' jest usunięty, token 'wooden' przechodzi do ptaka, w wyniku czym powstają drewniane ptaki. Prawy: Usunięcie 'couch' nie powstrzymuje generowania kanapy, a token 'large' jest niewłaściwie przypisany do ciasta.

Mapy uwagi dla tokenów atrybutów po usunięciu pojęcia. Lewy: Gdy ‘bench’ jest usunięty, token ‘wooden’ przechodzi do ptaka, w wyniku czym powstają drewniane ptaki. Prawy: Usunięcie ‘couch’ nie powstrzymuje generowania kanapy, a token ‘large’ jest niewłaściwie przypisany do ciasta.

RECE była najbardziej skuteczna w usunięciu atrybutów celu, ale również wprowadziła najwięcej przeniesienia atrybutów do zachowanych podpowiedzi, przewyższając nawet niedostosowany model. UCE przeciekała mniej niż inne metody.

Wyniki, jak sugerują autorzy, wskazują na konieczność wewnętrznej równowagi, przy czym silniejsze usunięcie zwiększa ryzyko błędnego przeniesienia atrybutów.

Wnioski

Przestrzeń latentna modelu nie wypełnia się w sposób uporządkowany podczas szkolenia, z pochodnymi pojęciami złożonymi na półki lub do szuflad; raczej wytrenowane osadzenia są zarówno treścią, jak i ich pojemnikami: nie oddzielone przez żadne wyraźne granice, ale raczej przenikające się wzajemnie w sposób, który utrudnia usunięcie – jak próba usunięcia funta ciała bez żadnej utraty krwi.

W inteligentnych i ewoluujących systemach, podstawowe wydarzenia – takie jak poparzenie palców i późniejsze traktowanie ognia z szacunkiem – są związane z późniejszymi zachowaniami i skojarzeniami, co utrudnia stworzenie modelu, który mógłby zostać pozbawiony konsekwencji centralnego, potencjalnie “zakazanego” pojęcia, a jednocześnie nie posiadać samego pojęcia.

 

* Moja konwersja cytatów wstawianych przez autorów na hiperłącza.

Pierwotnie opublikowano w piątek, 22 sierpnia 2025

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai