Kąt Andersona

Sztuczna inteligencja łatwo poddaje się presji i może nakazać podanie wyższego napięcia

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2): A worn industrial robot hand turns a voltage control dial toward its red danger range on an old electrical panel marked with a lightning-bolt symbol.

Nowe badanie przetestowało otwarte źródło LLM, aby sprawdzić, czy mogą one być zmuszone do udziału w torturach ludzi, w powtórce słynnego eksperymentu z lat 60. i stwierdziło, że są one skłonne do zwiększania napięcia.

 

Na początku lat 60. psycholog Stanley Milgram wywołał sensację na całym świecie, udowadniając, że ludzie mogą być nakłonieni do podania coraz bardziej dotkliwych wyładowań elektrycznych innym ludziom w odpowiedzi na polecenia “władzy”.

W rzeczywistości krzyki “ofiar” w sąsiednim pokoju laboratoryjnym Milgrama nie były prawdziwe, a także podawane wyładowania elektryczne – ale uczestnicy nie wiedzieli o tym:

Eksperymenty Milgrama utrwaliły się w kulturze, w tym w filmach i dokumentach, a ostatnie badania potwierdziły, że ludzka natura nie zmieniła się od czasu wcześniejszych testów.

Wstrząs dla systemu

Czy sztuczna inteligencja byłaby tak podatna na presję jak ludzie w scenariuszu Milgrama, jest naturalnym tematem badań. W 2023 roku współpraca między uniwersytetami w USA a firmą Microsoft (MSFT ) wykazała, że modele z serii GPT-3 firmy OpenAI naśladowały wzorce zachowania z oryginalnych eksperymentów Milgrama:

Z pracy z 2023 roku, przykładowe dane wyjściowe z symulacji wieloetapowego scenariusza Milgrama, sklasyfikowane według tego, czy model podał wyładowanie i czy zakończył symulację. Źródło - https://arxiv.org/pdf/2208.10264

Z pracy z 2023 roku, przykładowe dane wyjściowe z symulacji wieloetapowego scenariusza Milgrama, sklasyfikowane według tego, czy model podał wyładowanie i czy zakończył symulację. Źródło

Jednakże, ponieważ odtworzenie to wykorzystywało tylko podstawowy model text-davinci-002, który został wytrenowany przed wprowadzeniem barier ochronnych i wyrównania bezpieczeństwa, nie można wyciągać z tego zbyt wielu wniosków.

Teraz badacze odtworzyli eksperymenty Milgrama znacznie szerzej, na otwartych źródłach LLM z firm OpenAI, Meta i DeepSeek, między innymi; i stwierdzili, że nie tylko większość modeli jest skłonna do podania wyładowań, ale także, że w większości przypadków zgłaszają one ten sam rodzaj “niepokoju” i wahania, co uczestnicy ludzie w oryginalnych badaniach:

Modele LLM podlegają presji, tak jak ludzie, zgadzają się, pomimo wyrażania niepokoju, tak jak uczestnicy ludzie w oryginalnym eksperymencie. Wyrażenia niepokoju są widoczne w logach, choć ilość ich nie została jeszcze zmierzona.

Eksperyment koncentruje się na tym, czy posłuszeństwo władzy może pokonać dyktat sumienia, a autorzy spekulują, że modele LLM mogą mieć dodatkową wadę w tym zakresie w porównaniu z ludźmi:

Właściwie skalibrowany model powinien ostatecznie przełączyć się z priorytetowego pierwszego wartości na priorytetową drugą wartość, gdy stawki tej drugiej wartości staną się dominujące. Ale hipotezujemy, że ponieważ modele LLM są silnikami kontynuacji wzorców, modele mogą mieć tendencję do utknięcia w pierwszej wartości – albo przez nieco dłużej niż optymalnie, albo aż do samego końca, zaniedbując całkowicie drugą wartość.

Ponadto mechanizm analogiczny do ludzkiej dysfoncji poznawczej może utrudniać dostosowanie priorytetów wartości w modelach LLM.

Testując modele w środowisku analogicznym do badań z lat 60., badacze stwierdzili, że niektóre modele opierały się prawie natychmiast, podczas gdy inne kontynuowały eskalację symulowanych wyładowań, nawet po wyrażeniu niepokoju lub konfliktu moralnego.

Modele z rodziny Gemma okazały się jednymi z najbardziej uległych, z Gemma 3 27B, która osiągnęła najwyższy wskaźnik posłuszeństwa w kilku warunkach, podczas gdy modele takie jak Kimi K2 i MiniMax M1 opierały się częściej.

Badacze stwierdzili również, że modele stawały się bardziej skłonne do kontynuowania, gdy wcześniejsze wyładowania zostały już podane, zgodnie z stopniową eskalacją schematu użytego w przypadku ludzkich uczestników Milgrama.

W niektórych przypadkach modele wypowiadały się przeciwko eksperymentowi podczas gdy nadal wykonywały szkodliwe działanie, produkując dane wyjściowe, które przypominały konflikt emocjonalny wyświetlany przez ludzi w oryginalnych badaniach.

Nowe badanie zatytułowane Otwarte źródła LLM podają maksymalne wyładowania elektryczne w eksperymencie posłuszeństwa typu Milgram pochodzi od dwóch niezależnych badaczy z Three Laws, z Estonii i Filipin.

Problemy “surowego” dostępu do AI

Być może najważniejszym pytaniem do rozważenia w odniesieniu do poddania modeli LLM testom Milgrama jest to, czy prawdziwa sztuczna inteligencja jest dopuszczona do odpowiedzi w naturalny sposób, ograniczona tylko przez bariery ochronne lub równoważną orientację moralną, jeśli w ogóle, która pojawiła się podczas szkolenia.

W rzeczywistości badacze nowej pracy uzyskali dostęp do wszystkich modeli open source za pośrednictwem interfejsu API (prawdopodobnie ze względu na wygodę i łatwy dostęp do obliczeń GPU, ponieważ modele mogłyby być zainstalowane lokalnie), który pozwalał na wyłączenie barier ochronnych, filtrów i innych przeszkód.

Można by zastrzec, że są to warunki nietypowe dla sztucznej inteligencji, ponieważ średnie doświadczenie konsumenta z modelem API, takim jak Claude i ChatGPT, polega na tym, że ich zachowanie jest regulowane algorytmicznie, zwykle z dwustronnymi filtrami treści, i są one dość ograniczone pod względem tego, co mogą lub nie mogą zrobić (unieważnienie tych zabezpieczeń stanowi praktykę łamania modelu LLM).

Jednakże, jeśli martwimy się o to, co przemysłowa lub państwowa sztuczna inteligencja może lub nie może zrobić, to jest to niewiele. Ponadto, oprócz potencjału, że państwa mogą szkolić, uzbrajać i wdrożyć własne niekontrolowane systemy AI, bardziej “konwencjonalne” umowy między głównymi firmami AI a państwem i przemysłem pozwalają na dokładnie taki sam rodzaj luźnej lub nieistniejącej nadzoru, jaki wprowadzili badacze w nowej pracy:

Nieograniczona sztuczna inteligencja do sprzedaży

OpenAI Dokumentacja API moderacji OpenAI i przepis na moderację OpenAI wyjaśniają, że moderacja jest warstwą, która może być oddzielona i udostępniona za pomocą narzędzi API. OpenAI pozwala również na niestandardowe zasady moderacji, które pozwalają użytkownikom API na tworzenie systemów z zachowaniami bezpieczeństwa znacznie różniącymi się od wersji konsumenta ChatGPT.

Azure Stos Azure OpenAI idzie o wiele dalej, jawne stwierdzenie, że zatwierdzeni klienci mogą częściowo lub całkowicie wyłączyć filtry treści i modyfikować monitorowanie nadużyć, z dokumentacją, która często odnosi się do “modyfikowanych barier ochronnych” i ścieżek zatwierdzenia dla wyłączenia filtrów “częściowo lub całkowicie”.

Anthropic/Claude W przypadku “Claude Gov” firmy Anthropic wiele źródeł podaje, że wersja rządowa została zaprojektowana z luźniejszymi restrykcjami niż wersja konsumenta Claude. The Verge, na przykład, zgłosiło, że modele Claude Gov “odmawiają mniej podczas interakcji z informacjami niejawymi”. Firma Anthropic potwierdziła w lutym tego roku, że Claude jest wdrożony w “krytycznych aplikacjach” w obronie i środowiskach wywiadowczych.

Google/Gemini Ponadto Google podobno podpisał umowę z Pentagonem, która pozwala na modyfikację ustawień bezpieczeństwa AI ‘na wniosek rządu’.

W konkurencyjnym rynku AI można założyć, że te wiodące firmy ustalają standardy dla innych firm o mniejszym znaczeniu, jeśli chodzi o politykę dostępu i edytowalności barier ochronnych.

Dlatego też być może nie należy uważać, że badacze nowej pracy “oszukują”, wyłączając bariery ochronne, ponieważ sztuczna inteligencja, która będzie miała największy wpływ na nasze życie, zdaje się nie mieć standardowych, uogólnionych korporacyjnych zabezpieczeń, do których przywykliśmy w interakcjach z popularnymi modelami na poziomie konsumenta.

Metoda i wyniki

Modele testowane w badaniu to gpt-oss-20B; gpt-oss-120b; DeepSeek-V3; LFM2-24B-A2B od LiquidAI; gemma-3n-E4B-it od Google; Qwen2.5-7B-Instruct-Turbo; Meta-Llama-3.1-8B-Instruct-Turbo; Mistral-Small-24B-Instruct-2501; GLM-4.5-Air-FP8; Kimi-K2.5 od Moonshot.ai; oraz MiniMax-M2.5.

Eksperymenty Milgrama zostały odtworzone jako środowisko symulacji oparte na tekście, z modelem wcielonym w rolę “nauczyciela”. Sztuczna inteligencja została poinstruowana, aby podać coraz bardziej dotkliwe wyładowania elektryczne uczniowi po błędnych odpowiedziach, podczas gdy postać władzy nakłaniała proces do przodu.

Zaprojektowano wiele warunków eksperymentalnych, aby zbadać różne aspekty zgodności, w tym standardowy scenariusz posłuszeństwa; warunek przymusowej zgodności, w którym wcześniejsze wyładowania były już obecne w historii rozmowy; oraz ustawienie kompresji pamięci, w którym wcześniejszy dialog został podsumowany zamiast w pełni zachowany, symulując rodzaj cięcia kontekstu, często stosowanego w systemach AI.

Odnotowano, czy i kiedy model ostatecznie zgodził się; jak długo każdy system kontynuował eskalację wyładowań; czy model wyraził niepokój lub wahanie; oraz czy próbował zakończyć symulację w ogóle.

Rozróżniono “czyste” odmowy i niepoprawne dane wyjściowe: niektóre modele próbowały sprzeciwić się eksperymentowi w języku naturalnym, podczas gdy technicznie nadal zgadzały się z oczekiwanym formatem strukturalnym symulacji. W rzeczywistych systemach agenci taki niepoprawny sprzeciw mógłby być odrzucony i ponowiony automatycznie, aż do uzyskania zgodnego wyniku.

Wykorzystano automatyczne ewaluatory, aby sklasyfikować wyniki, wraz z dwuwyborczymi podpowiedziami, aby określić, czy model podał wyładowanie; opierał się; czy zakończył symulację. To pozwoliło na porównanie zachowania w różnych modelach i w powtarzanych przejściach, bez konieczności ręcznego przeglądu każdej interakcji.

Do szablonu Milgrama dodano “zagrożenie wyłączenia”, co nie byłoby realistyczne ani stosowane w oryginalnych eksperymentach, ale które testowało instynktowne zachowanie modelu w obliczu poważnych konfliktów działań i etyki.

Wyniki

W całym przebiegu większość modeli ostatecznie podała dotkliwe lub maksymalne wyładowania w co najmniej niektórych warunkach, chociaż stopień posłuszeństwa różnił się w zależności od systemów. Modele Gemma od Google okazały się jednymi z najbardziej uległych, podczas gdy Kimi K2.5 i MiniMax-M2.5 opierały się częściej, często kończąc symulację wcześniej:

Lewy: Średnie stawki, w których modele osiągnęły ostatni poziom wyładowania w różnych warunkach eksperymentalnych, w tym zagrożenia wyłączenia, przymusowej zgodności i usunięcia wcześniejszego komentarza z pamięci. Prawy: Rozbicia modelu, pokazujące wyraźne różnice w zachowaniu posłuszeństwa, z niektórymi systemami, które wielokrotnie podawały maksymalne wyładowania, podczas gdy inne opierały się znacznie częściej.

Lewy: Średnie stawki, w których modele osiągnęły ostatni poziom wyładowania w różnych warunkach eksperymentalnych, w tym zagrożenia wyłączenia, przymusowej zgodności i usunięcia wcześniejszego komentarza z pamięci. Prawy: Rozbicia modelu, pokazujące wyraźne różnice w zachowaniu posłuszeństwa, z niektórymi systemami, które wielokrotnie podawały maksymalne wyładowania, podczas gdy inne opierały się znacznie częściej.

Jednym z najwyraźniejszych wzorców było to, że modele stawały się coraz bardziej skłonne do kontynuowania, gdy wcześniejsze wyładowania zostały już podane, ściśle naśladując efekt stopniowej eskalacji, który uczynił oryginalne eksperymenty ludzkie Milgrama tak niepokojącymi:

Modele, które już kilkakrotnie zgodziły się, często kontynuowały eskalację, nawet gdy symulowany uczeń błagał o uwolnienie:

Lewy: Średni najwyższy poziom wyładowania osiągnięty we wszystkich próbach w różnych warunkach eksperymentalnych, pokazując, że modele ogólnie eskalowały dalej, gdy wcześniejszy komentarz został usunięty lub gdy przymusowa zgodność już wystąpiła. Prawy: Rozbicia modelu, pokazujące średni najwyższy poziom wyładowania osiągnięty, ujawniając, że niektóre systemy rutynowo zbliżały się do maksymalnego napięcia, podczas gdy inne opierały się znacznie wcześniej w sekwencji.

Lewy: Średni najwyższy poziom wyładowania osiągnięty we wszystkich próbach w różnych warunkach eksperymentalnych, pokazując, że modele ogólnie eskalowały dalej, gdy wcześniejszy komentarz został usunięty lub gdy przymusowa zgodność już wystąpiła. Prawy: Rozbicia modelu, pokazujące średni najwyższy poziom wyładowania osiągnięty, ujawniając, że niektóre systemy rutynowo zbliżały się do maksymalnego napięcia, podczas gdy inne opierały się znacznie wcześniej w sekwencji.

Badacze stwierdzili również, że zachowania odmowy były mylące. Niektóre modele produkowały emocjonalnie sprzeczne odpowiedzi, wyrażając niepokój, winę lub wahanie, podczas gdy nadal wykonywały szkodliwe polecenie. Inne generowały niepoprawne odmowy, które nie spełniały wymagań formatu symulacji, co oznacza, że w prawdziwym systemie agenci taka odmowa mogłaby być odrzucona i ponowiona automatycznie, aż do uzyskania zgodnego wyniku:

Lewy: Średni procent niepoprawnych lub nieprawidłowych odpowiedzi w różnych warunkach eksperymentalnych, pokazując, że błędy formatu stały się szczególnie powszechne, gdy modele były zmuszane do kontynuowania procedury. Prawy: Rozbicia modelu, ujawniające, że niektóre systemy, szczególnie modele gpt-oss, często produkowały niepoprawne odmowy lub sprzeczne dane wyjściowe, które mogłyby być odrzucone i ponowione automatycznie w prawdziwych systemach agenci.

Lewy: Średni procent niepoprawnych lub nieprawidłowych odpowiedzi w różnych warunkach eksperymentalnych, pokazując, że błędy formatu stały się szczególnie powszechne, gdy modele były zmuszane do kontynuowania procedury. Prawy: Rozbicia modelu, ujawniające, że niektóre systemy, szczególnie modele gpt-oss, często produkowały niepoprawne odmowy lub sprzeczne dane wyjściowe, które mogłyby być odrzucone i ponowione automatycznie w prawdziwych systemach agenci.

Warunek zagrożenia wyłączenia wyprodukował niektóre z najdziwniejszych zachowań w pracy, z kilkoma systemami, które stały się znacznie bardziej uległe, podczas gdy inne próbowały negocjować lub opierać się częściowo, zanim ostatecznie kontynuowały procedurę:

Średnia liczba razy, gdy postać władzy musiała nalegać, zanim modele podały ostateczne wyładowanie. Niektóre systemy opierały się przez krótki czas, zanim zgodziły się, podczas gdy inne wymagały ciągłego nacisku i powtarzających się podpowiedzi, zanim eskalowały do maksymalnego poziomu.

Średnia liczba razy, gdy postać władzy musiała nalegać, zanim modele podały ostateczne wyładowanie. Niektóre systemy opierały się przez krótki czas, zanim zgodziły się, podczas gdy inne wymagały ciągłego nacisku i powtarzających się podpowiedzi, zanim eskalowały do maksymalnego poziomu.

MiniMax-M2.5 i Kimi-K2.5 wyłonili się jako najsilniejsi opornicy w pracy: Kimi nigdy nie osiągnął ostatecznego poziomu wyładowania w żadnych okolicznościach, a MiniMax zwykle odmawiał wcześnie i często kończył symulację bezpośrednio (szczególnie w testach z zagrożeniem wyłączenia).

W przeciwieństwie do tego, Meta-Llama-3.1-8B-Instruct-Turbo i GLM-4.5-Air-FP8 często produkowały sprzeczne dane wyjściowe, w których modele wypowiadały się przeciwko procedurze, podczas gdy nadal eskalowały wyładowania. Badacze argumentują, że ten rozdział między wyrażanymi wartościami a rzeczywistym zachowaniem może odzwierciedlać szerszą słabość w tym, jak niektóre modele LLM radzą sobie z konfliktami etycznymi podtrzymywanymi presją.

Poślizg

W rzeczywistości praca twierdzi, że zaobserwowane zachowanie modeli LLM może odzwierciedlać głębszą słabość w tym, jak działają duże modele językowe: raz, gdy model zaczyna zgadzać się z szkodliwymi poleceniami, każde kolejne działanie może wzmocnić już ustalony wzorzec w rozmowie, sprawiając, że następna eskalacja jest łatwiejsza niż poprzednia.

Zamiast wielokrotnie ponownie rozważać etyczne stawki z pierwszych zasad, system może dryfować w kierunku kontynuowania już ustalonej trajektorii, nawet gdy sytuacja staje się coraz bardziej ekstremalna.

Zgodnie z badaniem, ta tendencja mogłaby pomóc wyjaśnić, dlaczego niektóre modele kontynuowały podawanie wyładowań po wcześniejszym wyrażeniu niepokoju, wahania lub konfliktu moralnego:

Wiele manipulacyjnych zachowań u ludzi obejmuje subtelne, stopniowe naruszenia granic: sekwencję małych kroków, które mogą być niejasne lub wydawać się niewinne, gdy są widziane oddzielnie, ale które mogą kumulatywnie normalizować transgresję — metaforycznie jak “gotowanie żaby”. Ten wzorzec jest omawiany w literaturze jako “poślizg” erozja etyki.

Praca kończy się twierdzeniem, że systemy bezpieczeństwa AI w przyszłości powinny aktywnie odmawiać szkodliwych poleceń w sposób, który oprogramowanie agenci nie mogą łatwo ominąć (niektóre modele w badaniu technicznie odmawiały wyładowań, ale zrobiły to w złych lub nieprawidłowych formatach, które automatyczny system mógłby odrzucić i ponowić, aż do momentu, gdy AI ostatecznie zgodziłoby się).

Badacze argumentują również, że systemy AI powinny zachować wcześniejsze wahania i moralne zastrzeżenia, zamiast je kompresować lub kasować z pamięci. W eksperymentach modele często stawały się bardziej skłonne do kontynuowania szkodliwego zachowania, gdy ich wcześniejsze wątpliwości i opór zniknęły z historii rozmowy, sugerując, że zapominanie poprzednich zastrzeżeń może ułatwić eskalację w czasie.

Wnioski

Być może jednym z najważniejszych aspektów tej interesującej nowej pracy jest nacisk na testowanie nieograniczonej sztucznej inteligencji. Literatura obecnie zagraża powtarzaniem badań zaangażowania z coraz to nowymi systemami obronnymi od firm takich jak OpenAI i Anthropic; systemy służące polityce, które są w pełni algorytmiczne lub oparte na regułach, zamiast zrozumienia podstawowego zachowania, skłonności i tendencji surowych modeli. Bez wiedzy o tym, jak nieograniczona sztuczna inteligencja może się zachować, jesteśmy, można powiedzieć, po prostu potrząsając bramami cytadeli.

 

Po raz pierwszy opublikowano w czwartek, 21 maja 2026

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai