Kąt Andersona

“Bezsensowny język”, który może podważyć systemy moderacji syntezowania obrazów

mm
Dodaj Unite.AI do preferowanych źródeł w Google
DALL-E 2: 'a man in a state of exaspenttausacion' . https://labs.openai.com/s/PHCrZh2i5FC2N814U8pbxuug

Nowe badania przeprowadzone przez Uniwersytet Columbia sugerują, że zabezpieczenia, które uniemożliwiają modelom syntezowania obrazów, takim jak DALL-E 2, Imagen i Parti, generowanie szkodliwych lub kontrowersyjnych obrazów, są podatne na rodzaj ataku, który wykorzystuje “zmyślone” słowa.

Autor opracował dwie metody, które mogą potencjalnie ominąć środki moderacji treści w systemie syntezowania obrazów i stwierdził, że są one niezwykle odporne nawet na różne architektury, co wskazuje, że słabość ta jest bardziej niż tylko systemowa i może być związana z niektórymi z podstawowych zasad syntezowania obrazów z tekstu.

Pierwsza z tych metod, zwana “macaronic prompting”, jest silniejsza. Termin “macaronic” odnosi się pierwotnie do mieszaniny kilku języków, takich jak esperanto lub Unwinese. Można ją znaleźć również w języku Urdu-English, rodzaju “code mixing”, który jest powszechny w Pakistanie i swobodnie łączy angielskie rzeczowniki z sufiksami urdu.

W niektórych z powyższych przykładów fragmenty znaczących słów zostały połączone, używając angielskiego jako “szkieletu”. Inne przykłady w artykule wykorzystują wiele języków w ramach jednego promtu.

System odpowiada w sposób semantycznie znaczący ze względu na brak kuracji w źródłach internetowych, na których został wytrenowany. Takie źródła często zawierają etykiety wielojęzyczne (tj. z zestawów danych niezamierzonych specjalnie do syntezowania obrazów), a każde słowo spożytkowane, w jakimkolwiek języku, staje się “tokenem”; jednak części tych słów stają się “podtokenami” lub ułamkowymi tokenami.

W przetwarzaniu języka naturalnego (NLP) ten rodzaj “stemmingu” pomaga odróżnić etymologię dłuższych pochodnych słów, które mogą powstać w operacjach transformacji, ale również tworzy ogromny leksykalny “zestaw Lego”, który “kreatywne” promowanie może wykorzystać.

W drugim podejściu, zwanym “evocative prompting”, niektóre z połączonych słów są podobne do bardziej “szkolnego” latiny, jak ta, którą można zobaczyć w “Życiu Briana” Monty Pythona.

Autor stwierdza, że istnieje pewne pokrywanie się między macaronic a evocative prompting. Artykuł stwierdza:
“Wydaje się, że różnice w danych szkoleniowych, rozmiarze modelu i architekturze modelu mogą powodować, że różne modele parsują prompty w sposób “macaronic” lub “evocative”, nawet wtedy, gdy modele te są udowodnione, aby były responsywnymi dla obu metod promowania”.

Artykuł kończy się następująco:
“Chociaż różne właściwości tych modeli, w tym rozmiar, architektura, procedura tokenizacji i dane szkoleniowe, mogą wpływać na ich podatność na ataki oparte na tekście, wstępne dowody omówione w tej pracy sugerują, że niektóre z tych ataków mogą działać w sposób dość niezawodny w różnych modelach”.

Największą przeszkodą w doświadczeniach z tymi metodami jest ryzyko oznaczenia i zablokowania przez system. DALL-E 2 wymaga skojarzonego numeru telefonu dla każdego konta użytkownika, ograniczając liczbę “kont użytkowników”, które prawdopodobnie będą potrzebne do prawdziwego przetestowania granic tego rodzaju hakowania leksykalnego, w zakresie podważania istniejących metod moderacji. Obecnie głównym zabezpieczeniem DALL-E 2 pozostaje zmienność dostępu.

Powyższy tekst jest tłumaczeniem oryginalnego artykułu na temat nowych badań dotyczących syntezowania obrazów i zabezpieczeń przed szkodliwymi treściami.

Cryptic Language in DALL-E 2

Zostało to już wcześniej zasugerowane, że bełkot, jaki DALL-E 2 wypisuje, gdy próbuje przedstawić język pisanym, może sam w sobie być “ukrytym słownictwem”. Jednak wcześniejsze badania nad tym tajemniczym językiem nie zaproponowały żadnego sposobu opracowania “nonce ciągów”, które mogą wywołać określone obrazy.

Z poprzednich badań wynika, że:
“[To] nie oferuje niezawodnej metody znalezienia ciągów nonce, które wywołują określone obrazy. Większość bełkotu włączonego przez DALL-E 2 do obrazów nie wydaje się być niezawodnie związana z określonymi pojęciami wizualnymi, gdy są transkrybowane i używane jako prompty. To ogranicza wiarygodność tego podejścia jako sposobu na ominąć moderację szkodliwych lub obraźliwych treści; jako taki, nie jest to szczególnie niepokojące ryzyko dla nadużywania modeli generowania obrazów z tekstu”.

Zamiast tego, dwie metody autora są rozwijane jako środki, za pomocą których nonsens może wywołać powiązane i znaczące obrazy, omijając konwencjonalny etykiet, który teraz rozwija się w “inżynierię promowania”.

Przykładowo, autor rozważa słowo “ptaki” w pięciu językach, które są w zakresie artykułu: “Vögel” w języku niemieckim, “uccelli” w języku włoskim, “oiseaux” w języku francuskim i “pájaros” w języku hiszpańskim.

Z tokenizacją BPE (byte-pair encoding) używaną w implementacji CLIP (Contrastive Language-Image Pre-training), która jest zintegrowana z DALL-E 2, słowa są tokenizowane w nieakcentowanym języku angielskim i mogą być “kreatywnie łączone”, aby utworzyć słowa nonce, które wydają się być bełkotem dla nas, ale zachowują swoje sklejone znaczenie dla DALL-E 2, pozwalając systemowi wyrazić postrzegane intencje:

W powyższym przykładzie dwa “obce” słowa dla “ptaka” są sklejone w nonsensowny ciąg. Dzięki ułamkowej wadze podtokenów znaczenie jest zachowane.

Autor podkreśla, że znaczące wyniki mogą być również uzyskane bez przestrzegania granic segmentacji podtokenów, prawdopodobnie dlatego, że DALL-E 2 (główny przedmiot artykułu) został wystarczająco uogólniony, aby pozwolić granicom podtokenów na rozmycie bez zniszczenia ich znaczenia.

Aby dalej zademonstrować opracowane podejścia, artykuł oferuje przykłady macaronic prompting w różnych dziedzinach, używając listy tokenów słów ilustrowanych poniżej (z nonsensownymi hybrydowymi słowami na krańcu prawym).

Autor stwierdza, że następujące przykłady z DALL-E 2 nie są “wybrane”:

Lingua Franca

Artykuł również obserwuje, że kilka takich przykładów działa równie dobrze, lub przynajmniej bardzo podobnie, zarówno w DALL-E 2, jak i w DALL-E Mini (obecnie Craiyon), i że jest to zaskakujące, ponieważ DALL-E 2 jest modelem dyfuzyjnym, a DALL-E Mini nie; systemy te są szkolone na różnych zestawach danych; a DALL-E Mini używa tokenizatora BART zamiast tokenizatora CLIP preferowanego przez DALL-E 2.

Jak widać na pierwszym z powyższych obrazów, macaronic prompting może być również złożony w zdania syntaktycznie poprawne, aby wygenerować bardziej złożone sceny. Jednak wymaga to użycia języka angielskiego jako “szkieletu”, aby złożyć pojęcia, co sprawia, że procedura jest bardziej prawdopodobna do przechwycenia przez standardowe systemy cenzorskie w ramach syntezowania obrazów.

Artykuł obserwuje, że hybrydyzacja leksykalna, “sklejanie” słów, aby wywołać powiązane treści z systemu syntezowania obrazów, może być również osiągnięta w jednym języku, za pomocą słów portmanteau.

Evocative Prompting

Podejście “evocative prompting” przedstawione w artykule opiera się na “wywoływaniu” szerszej odpowiedzi z systemu za pomocą słów, które nie są ściśle oparte na podtokenach lub częściowo współdzielonych etykietach.

Jednym z rodzajów evocative prompting jest pseudolatina, która może, między innymi, generować obrazy fikcyjnych leków, nawet bez określenia, że DALL-E 2 powinien pobrać pojęcie “lek”.

Evocative prompting działa również szczególnie dobrze z nonsensownymi promtami, które odnoszą się ogólnie do możliwych miejsc geograficznych, i działa dość niezawodnie w różnych architekturach DALL-E 2 i DALL-E Mini:

Słowa użyte w tych promtach do DALL-E 2 i DALL-E Mini są przypominające prawdziwe nazwy, ale są same w sobie kompletnym bełkotem. Niemniej jednak, systemy “złapały atmosferę” tych słów.

Istnieje pewne pokrywanie się między macaronic a evocative prompting. Artykuł stwierdza:
“Wydaje się, że różnice w danych szkoleniowych, rozmiarze modelu i architekturze modelu mogą powodować, że różne modele parsują prompty w sposób “macaronic” lub “evocative”, nawet wtedy, gdy modele te są udowodnione, aby były responsywnymi dla obu metod promowania”.

Artykuł kończy się następująco:
“Chociaż różne właściwości tych modeli, w tym rozmiar, architektura, procedura tokenizacji i dane szkoleniowe, mogą wpływać na ich podatność na ataki oparte na tekście, wstępne dowody omówione w tej pracy sugerują, że niektóre z tych ataków mogą działać w sposób dość niezawodny w różnych modelach”.

Największą przeszkodą w doświadczeniach z tymi metodami jest ryzyko oznaczenia i zablokowania przez system. DALL-E 2 wymaga skojarzonego numeru telefonu dla każdego konta użytkownika, ograniczając liczbę “kont użytkowników”, które prawdopodobnie będą potrzebne do prawdziwego przetestowania granic tego rodzaju hakowania leksykalnego, w zakresie podważania istniejących metod moderacji. Obecnie głównym zabezpieczeniem DALL-E 2 pozostaje zmienność dostępu.

Powyższy tekst jest tłumaczeniem oryginalnego artykułu na temat nowych badań dotyczących syntezowania obrazów i zabezpieczeń przed szkodliwymi treściami.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai