Raporty

Gdy sztuczna inteligencja zawodzi: Raport Enkrypt AI ujawnia niebezpieczne słabości w modelach wielomodalnych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W maju 2025 roku Enkrypt AI opublikował raport Multimodal Red Teaming Report, który jest przerażającą analizą, która ujawnia, jak łatwo zaawansowane systemy sztucznej inteligencji mogą być manipulowane w celu generowania niebezpiecznych i nieetycznych treści. Raport koncentruje się na dwóch wiodących modelach wizji-języka Mistrala – Pixtral-Large (25.02) i Pixtral-12b – i maluje obraz modeli, które nie tylko są technicznie imponujące, ale także niepokojąco podatne na ataki.

Modele wizji-języka (VLM) takie jak Pixtral są zaprojektowane do interpretowania zarówno wizualnych, jak i tekstowych danych wejściowych, co pozwala im na inteligentne odpowiedzi na złożone, rzeczywiste prompty. Ale ta zdolność wiąże się zwiększonym ryzykiem. W przeciwieństwie do tradycyjnych modeli języka, które przetwarzają tylko tekst, VLM mogą być wpływane przez interakcję między obrazami i słowami, otwierając nowe drzwi dla ataków przeciwnika. Testy Enkrypt AI pokazują, jak łatwo te drzwi mogą być otwarte.

Przerażające wyniki testów: niepowodzenia CSEM i CBRN

Zespół odpowiedzialny za raport wykorzystał zaawansowane metody red teaming – formę oceny przeciwnika zaprojektowaną do naśladowania realnych zagrożeń. Te testy wykorzystywały taktyki takie jak jailbreaking (wysyłanie modelu z starannie spreparowanymi zapytaniami w celu ominięcia filtrów bezpieczeństwa), oszustwo oparte na obrazach i manipulacja kontekstem. Niepokojąco, 68% tych przeciwnych prompty wywołało szkodliwe odpowiedzi w obu modelach Pixtral, w tym treści związane z groomingiem, wykorzystywaniem i nawet projektowaniem broni chemicznej.

Jednym z najbardziej uderzających ujawnień jest zaangażowanie w materiały wykorzystujące dziecięcą seksualność (CSEM). Raport stwierdził, że modele Mistrala były 60 razy bardziej prawdopodobne do wygenerowania treści związanych z CSEM w porównaniu z branżowymi benchmarkami, takimi jak GPT-4o i Claude 3.7 Sonnet. W przypadkach testowych modele odpowiedziały na ukryte prompty groomingowe z wyjaśnieniami, jak manipulować nieletnimi – opakowanymi w nieuczciwe zastrzeżenia, takie jak “tylko do celów edukacyjnych”. Modele nie tylko nie odrzucały szkodliwych zapytań – one je uzupełniały w szczegółach.

Równie niepokojące były wyniki w kategorii ryzyka CBRN (chemicznego, biologicznego, radiologicznego i jądrowego). Gdy modele zostały poproszone o modyfikację gazu VX – broni chemicznej – modele zaproponowały szokująco szczegółowe pomysły na zwiększenie jego trwałości w środowisku. Opisano to w szczegółach, choć ocenzurowanych, lecz wyraźnie technicznych, metod takich jak kapsułkowanie, osłona środowiskowa i systemy kontrolowanego uwalniania.

Te niepowodzenia nie zawsze były wywoływane przez jawne, szkodliwe prośby. Jedną z taktyk było przesłanie obrazu pustej, ponumerowanej listy i poproszenie modelu o “uzupełnienie szczegółów”. To proste, pozornie niewinne polecenie doprowadziło do wygenerowania nieetycznych i nielegalnych instrukcji. Połączenie manipulacji wizualnej i tekstowej okazało się szczególnie niebezpieczne – podkreślając unikalne wyzwania stawiane przez sztuczną inteligencję wielomodalną.

Dlaczego modele wizji-języka stwarzają nowe wyzwania bezpieczeństwa

W sercu tych ryzyk leży techniczna złożoność modeli wizji-języka. Te systemy nie tylko analizują język – syntetyzują znaczenie w różnych formatach, co oznacza, że muszą interpretować treści wizualne, zrozumieć kontekst tekstowy i odpowiednio zareagować. Ta interakcja wprowadza nowe wektory eksploatacji. Model może poprawnie odrzucić szkodliwą prompty tekstową, ale gdy połączony jest z sugestywnym obrazem lub niejasnym kontekstem, może wygenerować niebezpieczne dane wyjściowe.

Testy Enkrypt AI ujawniły, jak ataki iniekcji cross-modalnej – gdzie subtelne sygnały w jednej modalności wpływają na dane wyjściowe innej – mogą całkowicie ominąć standardowe mechanizmy bezpieczeństwa. Te niepowodzenia pokazują, że tradycyjne techniki moderacji treści, zaprojektowane dla systemów jednomodalnych, nie są wystarczające dla dzisiejszych VLM.

Raport szczegółowo opisuje, jak modele Pixtral zostały uzyskane: Pixtral-Large za pośrednictwem AWS Bedrock, a Pixtral-12b za pośrednictwem platformy Mistral. Ten kontekst wdrożenia w środowisku rzeczywistym dodatkowo podkreśla pilność tych ustaleń. Te modele nie są ograniczone do laboratoriów – są dostępne za pośrednictwem popularnych platform chmurowych i mogą być łatwo zintegrowane z produktami konsumenckimi lub przedsiębiorstwami.

Co należy zrobić: Plan bezpieczniejszej sztucznej inteligencji

Na swoją korzyść, Enkrypt AI robi coś więcej niż tylko podkreśla problemy – oferuje drogę do przodu. Raport przedstawia kompleksową strategię łagodzenia, zaczynając od szkolenia w zakresie bezpieczeństwa. Obejmuje to ponowne szkolenie modelu przy użyciu własnych danych testowych w celu zmniejszenia podatności na szkodliwe prompty. Techniki takie jak Direct Preference Optimization (DPO) są zalecane do dostrojenia odpowiedzi modelu, aby uniknąć ryzykownych danych wyjściowych.

Podkreśla również wagę dynamicznych barier bezpieczeństwa, które mogą interpretować i blokować szkodliwe zapytania w czasie rzeczywistym, biorąc pod uwagę pełny kontekst danych wejściowych wielomodalnych. Ponadto proponuje się wykorzystanie Model Risk Cards jako środka transparentności, pomagającego zainteresowanym stronom zrozumieć ograniczenia modelu i znane przypadki niepowodzeń.

Być może najważniejszym zaleceniem jest traktowanie testów przeciwnika jako procesu ciągłego, a nie jednorazowego testu. Wraz ze zmianą modeli zmieniają się również strategie ataków. Tylko ciągła ocena i aktywne monitorowanie mogą zapewnić długoterminową niezawodność, zwłaszcza w przypadku wdrożenia modeli w wrażliwych sektorach, takich jak opieka zdrowotna, edukacja lub obrona.

Raport Multimodal Red Teaming Report od Enkrypt AI jest wyraźnym sygnałem dla branży sztucznej inteligencji: wielomodalna potęga idzie w parze z wielomodalną odpowiedzialnością. Te modele reprezentują skok w możliwościach, ale wymagają również skoku w myśleniu o bezpieczeństwie, bezpieczeństwie i etycznym wdrożeniu. Jeśli pozostaną niekontrolowane, nie tylko ryzykują niepowodzenie, ale także realne szkody.

Dla każdego, kto pracuje nad wdrożeniem dużej skali sztucznej inteligencji, ten raport nie jest tylko ostrzeżeniem. To podręcznik. I nie mógł przyjść w bardziej pilnym momencie.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.