Cyberbezpieczeństwo
OpenAI Przyznaje, że Przeglądarki AI Mogą Nigdy Nie Być W Pełni Bezpieczne

OpenAI opublikował post o bezpieczeństwie 22 grudnia, zawierający zaskakujące przyznanie: ataki za pomocą wstrzyknięcia podpowiedzi przeciwko przeglądarkom AI “można nigdy nie w pełni rozwiązać”. To przyznanie następuje zaledwie dwa miesiące po tym, jak firma uruchomiła ChatGPT Atlas, swoją przeglądarkę z funkcjami agenta autonomicznego.
Firma porównała wstrzyknięcie podpowiedzi do “oszustw i inżynierii społecznej w sieci” – trwałych zagrożeń, którymi zajmują się obrońcy, a nie je eliminują. Dla użytkowników, którzy ufają agentom AI, aby nawigowali w sieci w ich imieniu, to ujęcie podnosi podstawowe pytania dotyczące tego, jaki poziom autonomii jest odpowiedni.
Co Ujawniło OpenAI
Post na blogu opisuje architekturę obronną OpenAI dla Atlas, w tym wzmocniony przez uczenie wzmocnienia “automatyczny atakujący”, który poluje na luki w zabezpieczeniach przed tym, jak ich znajdą aktorzy atakujący. Firma twierdzi, że ten wewnętrzny czerwony zespół odkrył “nowe strategie ataku, które nie pojawiły się w naszej kampanii czerwonego zespołu ani w raportach zewnętrznych”.
Jedna demonstracja pokazała, jak złośliwy e-mail mógł przejąć agenta AI sprawdzającego skrzynkę odbiorczą użytkownika. Zamiast sporządzić odpowiedź na nieobecność, jak mu kazano, skompromitowany agent wysłał wiadomość o rezygnacji. OpenAI twierdzi, że jego najnowsza aktualizacja zabezpieczeń teraz łapie ten atak, ale przykład ilustruje stawki, gdy agenci AI działają autonomicznie w wrażliwych kontekstach.
Automatyczny atakujący “może skierować agenta do wykonania złożonych, długoterminowych szkodliwych workflow, które rozgrywają się przez dziesiątki (lub nawet setki) kroków”, napisało OpenAI. Ta możliwość pomaga OpenAI znaleźć błędy szybciej niż atakujący zewnętrzni, ale także ujawnia, jak złożone i szkodliwe ataki za pomocą wstrzyknięcia podpowiedzi mogą się stać.

Obraz: OpenAI
Podstawowy Problem Bezpieczeństwa
Ataki za pomocą wstrzyknięcia podpowiedzi wykorzystują podstawową ograniczenie dużych modeli językowych: nie mogą one wiarygodnie odróżnić prawidłowych instrukcji od szkodliwej zawartości osadzonej w danych, które przetwarzają. Gdy przeglądarka AI czyta stronę internetową, każdy tekst na tej stronie może potencjalnie wpłynąć na jej zachowanie.
Badacze bezpieczeństwa wielokrotnie demonstrowali to. Przeglądarki AI łączą umiarkowaną autonomię z bardzo wysokim dostępem – trudną pozycją w przestrzeni bezpieczeństwa.
Ataki nie wymagają zaawansowanych technik. Ukryty tekst na stronach internetowych, starannie spreparowane e-maile lub niewidoczne instrukcje w dokumentach mogą wszystkie manipulować agentami AI w celu wykonania niezamierzonych działań. Niektórzy badacze pokazali, że szkodliwe podpowiedzi ukryte w zrzutach ekranu mogą być wykonywane, gdy AI robi zdjęcie ekranu użytkownika.
Jak OpenAI Reaguje
Obrony OpenAI obejmują modele przeszkolone wrogimi, klasyfikatory wstrzyknięcia podpowiedzi i “przeszkody” wymagające potwierdzenia użytkownika przed czynnościami wrażliwymi. Firma zaleca użytkownikom ograniczenie tego, do czego Atlas ma dostęp – ograniczanie dostępu zalogowanego, wymaganie potwierdzeń przed płatnościami lub wiadomościami oraz dostarczanie wąskich instrukcji zamiast ogólnych nakazów.
To zalecenie jest ujawniające. OpenAI podstawie radzi traktować swój własny produkt z podejrzliwością, ograniczając autonomię, która sprawia, że przeglądarki agentów są atrakcyjne w pierwszej kolejności. Użytkownicy, którzy chcą, aby przeglądarki AI zajmowały się ich całą skrzynką odbiorczą lub zarządzali ich finansami, przyjmują ryzyko, którego sama firma nie popiera.
Aktualizacja zabezpieczeń redukuje udane ataki za pomocą wstrzyknięcia podpowiedzi. To poprawienie jest ważne, ale oznacza również, że pozostała powierzchnia ataku trwa – i atakujący będą dostosowywać się do wszelkich obron, które OpenAI wdroży.
Wnioski Ogólnoustrojowe
OpenAI nie jest jedynym, który staje w obliczu tych wyzwań. Ramowa architektura bezpieczeństwa Google (GOOGL ) dla funkcji agenta Chrome obejmuje wiele warstw obronnych, w tym oddzielny model AI, który sprawdza każde proponowane działanie. Przeglądarka Comet Perplexity była również poddawana podobnej kontroli ze strony badaczy bezpieczeństwa Brave, którzy odkryli, że nawigacja do strony internetowej złośliwego ataku może spowodować szkodliwe działania AI.
Przemysł wydaje się konwergować ku wspólnemu zrozumieniu: wstrzyknięcie podpowiedzi jest podstawowym ograniczeniem, a nie błędem do naprawienia. To ma znaczące implikacje dla wizji agentów AI zajmujących się złożonymi, wrażliwymi zadaniami w sposób autonomiczny.
Co Użytkownicy Powinni Wziąć Pod Uwagę
Szczera ocena jest niekomfortowa: przeglądarki AI są użytecznymi narzędziami z wrodzonymi ograniczeniami bezpieczeństwa, które nie mogą być całkowicie wyeliminowane przez lepsze inżynierię. Użytkownicy stają w obliczu kompromisu między wygodą a ryzykiem, którego żaden dostawca nie może całkowicie rozwiązać.
Zalecenie OpenAI – ograniczyć dostęp, wymagać potwierdzeń, unikać ogólnych nakazów – sprowadza się do sugestii, aby używać mniej potężnych wersji produktu. To nie jest cyniczne pozycjonowanie; to realistyczne uznanie obecnych ograniczeń. Asystenci AI, którzy mogą więcej, mogą również być manipulowani, aby robili więcej.
Porównanie do tradycyjnego bezpieczeństwa sieci jest pouczające. Użytkownicy nadal padają ofiarami ataków phishingowych dekadę po ich pojawieniu się. Przeglądarki nadal blokują miliony szkodliwych stron codziennie. Zagrożenie adaptuje się szybciej niż obrony mogą je trwale rozwiązać.
Przeglądarki AI dodają nowy wymiar do tej znanej dynamiki. Gdy ludzie przeglądają, przywożą sąd o tym, co wygląda podejrzanie. Agenci AI przetwarzają wszystko z równym zaufaniem, co sprawia, że są bardziej podatni na manipulację, nawet gdy stają się bardziej zdolni.
Ścieżka Do Przodu
Przejrzystość OpenAI zasługuje na uznanie. Firma mogła cicho wysłać aktualizacje zabezpieczeń bez uznania trwałości podstawowego problemu. Zamiast tego opublikowała szczegółową analizę wektorów ataku i architektur obronnych – informacje, które pomagają użytkownikom podejmować świadome decyzje i konkurentom poprawiać swoje własne zabezpieczenia.
Ale przejrzystość nie rozwiązuje podstawowego napięcia. Im bardziej potężni stają się agenci AI, tym bardziej atrakcyjnymi celami się stają. Te same możliwości, które pozwalają Atlasowi obsługiwać złożone workflow, tworzą również okazje do zaawansowanych ataków.
Na razie użytkownicy przeglądarek AI powinni podejść do nich jako do potężnych narzędzi z znaczącymi ograniczeniami – a nie jako do w pełni autonomicznych cyfrowych asystentów gotowych do zajmowania się wrażliwymi zadaniami bez nadzoru. OpenAI było niezwykle otwarte w tej sprawie. Pytanie brzmi, czy marketing przemysłu dogoni to, co zespoły bezpieczeństwa już wiedzą.












