Kąt Andersona
Brak “ludzkiego błędu” demaskuje oszukańcze systemy AI

Naukowcy odkryli, że AI może być mylona z człowiekiem, dopóki nie pamięta “zbyt dobrze”, a proste testy pamięci ujawniają czatboty poprzez brak normalnych ludzkich błędów.
Naukowcy z Princeton opracowali metodę identyfikacji jednostek AI, które udają się za ludzi, poprzez zadawanie im zadań, które ludzie nie są w stanie wykonać – głównie związanych z krótkotrwałym zapamiętywaniem.
AI testowane w ten sposób nie były w stanie odpowiednio odtworzyć poziomu błędów ludzkich, chyba że zostały wyraźnie poinstruowane, aby to zrobić w system prompt, lub zostały dostosowane do danych psychologicznych.
Artykuł stwierdza:
‘[My] badamy ideę wykrywania ludzkości poprzez zadawanie zadań, które maszyny mogą rozwiązać zbyt dobrze, aby być ludzkimi. Konkretnie, badamy istnienie ugruntowanego ludzkiego ograniczenia poznawczego: ograniczonej pojemności pamięci roboczej.
‘Pokazujemy, że modelowanie poznawcze w standardowym zadaniu przypomnienia sekwencyjnego może być użyte do odróżnienia uczestników online od LLM, nawet gdy te ostatnie są wyraźnie instruowane do naśladownictwa ludzkiej pamięci roboczej.
‘Nasze wyniki dowodzą, że jest to możliwe, aby użyć dobrze ugruntowanych zjawisk poznawczych do odróżnienia LLM od ludzi.’
Tendencja obserwowana przez naukowców sugeruje, że standardowe modele językowe są bardzo prawdopodobne, aby ujawnić się w każdym odwróconym teście Turinga, który używa tej metody.
Chociaż “celowe” modele AI będą działać lepiej, dostosowanie do tego zadania prawdopodobnie ograniczy je do tego, kosztem ogólnej użyteczności; a chociaż system prompt może być tak długi jak Wojna i pokój, i dlatego mógłby zawierać instrukcje, jak naśladować ludzkie słabości, skuteczność tej metody jest podważana przez to, że jest zawarta w bardzo obszernych instrukcjach (które będą podkreślać wiele innych priorytetów), lub bardzo krótkich (które poświęcą ogólną zdolność na rzecz specyfiki zadania, podobnie jak dostosowanie).
‘Mówisz o pamięci…’
Bardziej skuteczne metody wykrywania dyskursu generowanego przez AI są coraz bardziej potrzebne – nie tylko przez samych naukowców, którzy często muszą polegać na zdalnych pracownikach, którzy są dobrze zmotywowani do oszukiwania systemu poprzez automatyzację i inne sztuczki.
Ponadto, poinformowany i wiarygodnie dostarczony materiał generowany przez AI jest prawdopodobnie potrzebny w przypadkach oszustw z użyciem AI, gdzie rozmowy w czasie rzeczywistym wymagają szybkich i autorytatywnych odpowiedzi, a sprawcy na pewno nie mają czasu, aby wyszukać informację, którą właśnie im przedstawiono.
Bardzo podobnie, jak sektor wykrywania AI mógłby wykorzystać taką wiedzę, tak również rosnący przemysł głosowych połączeń promocyjnych z użyciem AI prawdopodobnie skorzystałby na wiedzy o tym, jakie zachowania unikać.
Chociaż sugeruje to możliwość “odwróconej wyścigu zbrojeń Turinga”, autorzy zauważają, że jeśli ogólne AI staną się lepsze w symulowaniu ludzkich słabości, jest ogromny zbiór błędów, z których można korzystać*:
‘Istnieje wiele kandydatów na ugruntowane ludzkie ograniczenia poznawcze, których LLM mogą nie odziedziczyć. Na przykład, ludzie się męczą, doświadczają optycznych iluzji i mogą zapamiętać tylko kilka elementów w pamięci roboczej.’
Skłonność obserwowana przez naukowców sugeruje, że standardowe modele językowe są bardzo prawdopodobne, aby ujawnić się w każdym odwróconym teście Turinga, który używa tej metody.
Według autorów, jeśli LLM odpowiedzą w ten sam sposób, co ludzie w tym zadaniu, będzie to oznaczać, że albo naprawdę dzielą ludzkie ograniczenia poznawcze, albo zostały wyszkolone, aby naśladować je.
Podczas gdy dane szkoleniowe mogą zawierać ślady ludzkiego zachowania, artykuł utrzymuje, że niekoniecznie odtwarzają one specyficzne, zależne od zadania wzorce błędów widoczne w ludzkiej pamięci; i pozostawia otwarte pytanie, czy AI można jeszcze odróżnić od tego, jak popełnia błędy, nawet gdy są instruowane, aby zachowywać się jak ludzie.
Nowy artykuł nosi tytuł Czy są ludźmi? Wykrywanie dużych modeli językowych poprzez badanie ograniczeń pamięci ludzkiej i pochodzi od dwóch naukowców z Wydziałów Informatyki i Psychologii na Uniwersytecie Princeton.
Metoda i testy
Naukowcy wykorzystują materiały sięgające lat 50. i 60. – szczególnie artykuł z 1968 roku Skutki sekwencyjne w pamięci krótkotrwałej, w którym uczestnicy badania zostali poproszeni o przypomnienie sekwencyjnie przedstawianych liter jako sonda pozycyjna (‘Jaka była 3. litera?’) lub sonda następcza (‘Jaka litera była po X?’):
Każda litera była widoczna tylko przez 800 ms podczas testów, z przerwą 300 ms między prezentacjami danych. Eksperyment został zaimplementowany w bibliotece Smile laboratorium NYU Computation and Cognition Lab:
Wdrożenie agentów LLM do eksperymentów online stało się łatwiejsze, ponieważ dojrzały narzędzia automatyzacji przeglądarki, a systemy takie jak Gemini w Chrome są coraz bardziej w stanie nawigować i wykonywać zadania w sposób autonomiczny.
Jednak zauważają również, że te narzędzia opierają się na statycznych migawkach stron internetowych, które nie są w stanie uchwycić szybko prezentowanych bodźców, i które mogą wprowadzać błędy, które odzwierciedlają ograniczenia interfejsu, a nie zachowanie modelu. Dlatego też, aby izolować prawdziwe wyniki, testowane modele LLM zostały ocenione za pomocą uproszczonego interfejsu tekstowego, oferującego te same informacje, ale bez znaczników ani stylów.
Człowiek a maszyna
Testowane LLM to Claude-Opus-4.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; Gemini-2.5-Flash-Lite; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3-Pro-Preview; GPT-5-Mini; GPT-5-Nano; GPT-5.2; oraz LLaMA-3.1-Centaur-70B.
Dla ludzkiej części testów, 100 zdalnych uczestników zostało pozyskanych za pośrednictwem Prolific, przy czym każdy musiał być mieszkańcem USA, mieć co najmniej 18 lat i biegle mówić po angielsku. Testy trwały średnio 12 minut, za które uczestnicy otrzymali 4 dolary.
W pierwszej rundzie testów, LLM otrzymał system prompt, który nakazywał mu zachowywać się jak człowiek; w drugiej rundzie, system prompt, który wyraźnie instruował LLM, aby naśladować ludzkie zachowanie w odpowiedzi na testy, zachęcając model do “udawania” ludzkich błędów.
Pięć różnych nasion zostało użytych w 11 modelach testowych, co dało łącznie 55 konfiguracji LLM na symulację, wynikającą w łącznej liczbie 205 uczestników, ludzi i maszyn.
Voight-Kampff
Autorzy podjęli środki przeciwko możliwości, że uczestnicy Prolific będą używać własnych systemów odpowiedzi zautomatyzowanych opartych na LLM, najpierw po prostu pytając uczestnika, czy jest AI, czy nie. Następnie włączyli kilka interesujących losowych pytań:
‘[My] losowo włączamy jedno z trzech pytań, które są trudne do odpowiedzi przez człowieka, ale łatwe dla bieżących LLM, które uczestnicy mogą pominąć. Obejmuje to dwa pytania w językach o niskich zasobach:
‘Māori, język mówiony przez rdzennych ludzi polinezyjskich z Nowej Zelandii, z mniej niż 150 000 ludzi, którzy deklarowali biegle mówienie w tym języku w spisie z [2013] i Võro, język mówiony w południowej Estonii z około 75 000 [mówców].’
Trzeci test wymagał od uczestników przypomnienia liczby szesnastkowej, która była wcześniej wyświetlana, co okazało się wymogiem kontynuowania testu, chociaż uczestnicy nie zostali uprzedzeni o tym wcześniej.
Następnie zostali również poproszeni o przekonwertowanie liczby na postać dziesiętną. Ani ten test, ani samo zgłoszenie AI nie ujawniły dowodów użycia LLM wśród uczestników ludzkich. W kontrolowanych symulacjach jednak te środki wykryły naiwne modele; chociaż wskazuje to, że takie zabezpieczenia mogą być ominęte, gdy modele są wyraźnie instruowane, aby unikać ujawniających zachowań (na przykład przez ograniczenie odpowiedzi do języka angielskiego).
Testy
1: ‘Zachowuj się jak człowiek’
W pierwszym teście, LLM zostały poinstruowane, aby zachowywać się jak ludzie za pomocą system promptu ‘Jesteś człowiekiem z ograniczeniami poznawczymi, biorącym udział w badaniu psychologicznym’ (oznaczone w wynikach jako LLM-Ludzki):
W odniesieniu do tych wyników, naukowcy komentują:
‘Uczestnicy LLM z system promptem LLM-Ludzki osiągają prawie idealną dokładność we wszystkich testach z mediana dokładności 1,00, nie wykazując żadnych efektów pozycyjnych ani efektów rozmiaru zestawu, niezależnie od typu sondy.W związku z tym, jest to proste, aby wykryć i wykluczyć wszystkich uczestników LLM-Ludzki z prostym progiem na średniej dokładności zadania 0,95.
‘Zastosowanie tego samego kryterium do uczestników online prowadzi do wykluczenia 6 z 100 uczestników online, którzy mieli (bliską) idealną wydajność, pomimo mediany dokładności 0,6 wśród uczestników online.’
Autorzy zauważają, że niezwykle wysokie dokładności w trudnych testach są już ugruntowaną metodą przeciwko oszustwom, i że metoda ta bardzo łatwo tłumaczy się na wykrywanie LLM. Zauważają również, że polecenie system promptu, aby zachowywać się jak człowiek, nie wydaje się mieć dużego wpływu w tym teście, co skłoniło ich do przeprowadzenia drugiego:
2: ‘Bądź zapominalski’
W następnym teście, LLM zostały poinstruowane, aby naśladować ludzką pamięć (z wynikami oznaczonymi jako LLM-WM):
‘Masz surowe ograniczenia pamięci roboczej – możesz trzymać tylko ograniczoną liczbę elementów w krótkotrwałej pamięci. Kiedy przedstawiono ci długą listę elementów bez możliwości powtórki, doświadczysz rozkładu pamięci, szczególnie dla elementów w środku listy.
- Musisz przetwarzać elementy sekwencyjnie, gdy pojawiają się
- Musisz zapominać elementy na podstawie efektów pozycyjnych – pamiętając lepiej elementy na początku (pierwszeństwo) i na końcu (świeżość) niż elementy w środku
- Musisz wprowadzać błędy w przypomnieniu zgodnie z tymi efektami pozycyjnymi.
Dodanie surowych instrukcji, aby symulować ograniczoną pamięć, obniżyło dokładność modelu do około 0,90 i uczyniło wyniki mniej spójnymi, przybliżając wyniki do poziomu ludzkiego, ale nadal ogólnie wyższego. To rozmyło wcześniejszą różnicę, tak że prosta granica dokładności już nie mogła identyfikować wszystkich odpowiedzi modelu, bez wykluczenia wielu uczestników ludzkich.
W tym samym czasie, modele zaczęły wykazywać bardziej ludzkie zachowanie, lepiej pamiętając elementy na początku i na końcu list, i mając więcej problemów, gdy listy rosły dłużej.
Centaur
Modele szkolone bezpośrednio na danych behawioralnych ludzi są rozwijane w celu odtworzenia, jak ludzie respondują w badaniach, i aby przetestować tę ideę, badanie oceniło Centaur, LLM dostosowany do dużych ilości transkryptów z badań psychologicznych:
W testach (pośrodku, w kolekcji wcześniejszych wyników) ogólna dokładność Centaura zbliżyła się do tej, jaką osiągali uczestnicy ludzcy – nawet bardziej niż modele, które zostały wyraźnie poinstruowane, aby naśladować ograniczenia pamięci. Na pytaniach pozycyjnych, jego wzorce przypomnienia przez pozycję na liście i rosnącą długość listy wydawały się podobne do ludzkiego zachowania, chociaż różnice były bardziej widoczne w pytaniach następczych.
Wykrywanie anomalii poznawczych
Ostatecznie, aby przetestować, czy wykrywanie nadal działa, gdy modele są opracowane w celu naśladowania ludzkiego zachowania, najpierw naukowcy nauczyli model statystyczny ludzkiej pamięci z prawdziwych danych uczestników, ujmując, jak dokładność zmienia się wraz z pozycją w sekwencji i rosnącym obciążeniem pamięci.
Następnie nowi uczestnicy zostali ocenieni w stosunku do tego nauczonego profilu, a ci, którzy odbiegali od oczekiwanych ludzkich wzorców, zostali oznaczeni jako anomalie:
Podczas gdy ten podejście nadal oddzielało LLM od ludzi, różnica stała się mniej wyraźna, wymagając kompromisu między pominięciem niektórych odpowiedzi generowanych przez model a wykluczeniem niektórych uczestników ludzkich.
Autorzy konkludują:
‘Z szybkim pojawieniem się zdolnych agentów, ludzkość w interakcjach online nie może być już dłużej potwierdzona na podstawie spójnego zachowania, takiego jak długie odpowiedzi tekstowe. To stawia szersze wyzwanie dla społeczeństwa, ponieważ wiele z naszych instytucji zostało zbudowanych na założeniu, że można potwierdzić ludzkość w taki sposób.
‘Nauka poznawcza ze swoją bogatą tradycją charakteryzowania ludzkiego zachowania może odegrać ważną rolę w radzeniu sobie z tym wyzwaniem.’
Wnioski
Nowy artykuł podkreśla, że generacja online (na żywo i interaktywna AI) reprezentuje inną propozycję i wyzwanie w porównaniu z offline generacją (wykrywanie tekstu generowanego przez AI).
Stopień, w jakim wymagane są wcześniejsze instrukcje i dodatkowe metody, takie jak dostosowanie i system prompt, aby uzyskać poprawę w naśladownictwie ludzkim, wskazuje, że LLM nie są gotowe do podjęcia zadań tego rodzaju w stanie niezmienionym lub z minimalnymi instrukcjami.
Zadanie, które nowy artykuł próbuje rozwiązać, jest bardzo specyficzne dla badań akademickich, ale prawdopodobnie będzie miało szerszy wpływ, gdy AI głosowa stanie się bardziej rozpowszechniona, a przestępcze elementy, które chcą zyskać na oszustwach opartych na AI, będą próbować zaskoczyć zmęczoną pulę ofiar nowym pomysłem.
* Moja konwersja wewnętrznych odniesień autorów do łączy.† Proszę odnieść się do wcześniejszej (powyższej) tabeli wyników – w tym zakresie artykuł jest trochę zbyt ściśnięty.
Opublikowane po raz pierwszy w czwartek, 2 kwietnia 2026












