Kąt Andersona

Modele AI wolą pisanie ludzkie od generowanego przez AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google
William Shakespeare arm-wrestling a robot. The style should not be illustration-type, nor cartoonish, but instead, photorealistic, in the style of a publicity photo for Real Steel' + variations. GPT-4o, Flux Kontext, Firefly.

Zgodnie z nowymi badaniami, ChatGPT i podobne modele wykazują wyraźną predyspozycję do tekstu, który uważają za napisany przez ludzi, nawet jeśli ta przekonanie jest błędne. Po prostu nazywanie tekstu “ludzkim” sprawia, że modele AI są skłonne go faworyzować – i ironicznie, mogą uczyć się tej uprzedzenia od nas.

 

Pojęcia autentyczności, pochodzenia i wspólnej ludzkiej doświadczenia mogą odgrywać większą rolę w ataku AI na sektor twórczego pisania niż dotąd: testy przeprowadzone dla nowego badania na Uniwersytecie Princeton wykazały, że wiele głównych modeli językowych, w tym ChatGPT, preferuje to, co uważa za “ludzkie”, nawet gdy ta przekonanie jest błędne.

Nawet gdy etykiety na próbkach pisarskich były odwrócone, zarówno modele AI, jak i ludzie nadal znajdowali wady w tekście napisanym przez AI, powtarzając te same krytyki, które mieli, gdy był on prawidłowo oznaczony.

Badacze uważają, że część powodu może tkwić w rosnącej wrogości ludzi wobec generatywnego AI, która wydaje się manifestować nowe i interesujące wydarzenia każdego dnia, mogąc wpływać na same systemy AI. Zauważając, jak bardzo AI nie lubi pisania AI, jeszcze bardziej niż ludzie, stwierdzają*:

’13 modeli AI, które przetestowaliśmy, wykazało 34,3 punkt procentowy predyspozycji w porównaniu z 13,7 punktami procentowymi u ludzi, co sprawia, że są one 2,5 razy bardziej podatne na sygnały atrybucji niż nasi ludzcy oceniający.

‘To wzmocnienie ma sens, gdy rozpoznamy, że współczesne modele są preference-trenowane oceniające. Wyrównanie szkolenia za pomocą wzmocnienia uczenia się od ludzkiej opinii (RLHF) explicite uczy modele, aby traktować ludzkie osądy jako ich standard złoty, skutecznie instalując naukową wiarygodność [prior].

‘Modele uczą się, że ustępowanie ludzkim preferencjom jest nagradzane, tworząc sycophancy, gdzie powtarzają oczekiwane postawy użytkowników, zamiast zapewnić niezależną ocenę.’

Wyniki mają zastosowanie do dziedziny twórczego pisania, a badacze użyli historii znanego francuskiego autora jako próbek danych; i wskazują, że ludzka uprzedzenie przeciwko AI może, w równowadze, przewyższać wszelkie ilościowe ulepszenia w konstrukcji języka, które Duże Modele Językowe (LLM) mogą wyprodukować, gdy ewoluują – i że etykieta “AI” może być perhaps oznaczać “nieautentyczne”, “ersatz” i nawet “drugiej klasy” w tej dziedzinie.

Wiele powodów koncentruje się na praktyce kulturowej i użyciu: artykuł wskazuje, że kreatywność jest często opisywana w kategoriach nowości, wartości i typowości, tzn. jak nowe coś się wydaje; jak bardzo jest doceniane przez ekspertów; i jak dobrze pasuje do swojej kategorii. Gdy fragment jest oznaczony jako ludzki, znane cechy gatunku są nagradzane jako cenne; gdy oznaczony jako wygenerowany przez AI, te same cechy są odrzucane jako niewygłoszone.

W efekcie, ujawnienie źródła powoduje ponowną ocenę wartości pracy, ukształtowaną przez założenia o tym, jak została wykonana. Gdy autorstwo AI jest ujawnione, czytelnicy instynktownie odrzucają możliwość indywidualnego odkrycia lub intencji za wyjściem.

Artykuł stwierdza*:

‘W większości sztuk nie ma standardu dla “dostatecznie kreatywnego”, co sprawia, że sygnały pochodzenia są potężnymi primami, które mogą zmienić, jaki kryterium jest najbardziej istotne: dyscyplinowany kunszt czy oczywista nowość, dostępność czy trudność.

‘Ponieważ obserwatorzy często inferują proces z produktu, sygnały pochodzenia wpływają na osądy o tym, jak coś zostało zrobione, a także o tym, co to jest: konserwatywne ruchy mogą być uznane za kunszt od ludzkiego rzemieślnika (ocenianego jako umiejętny), ale odrzucone jako “zwykła generacja” od modelu’.

Trzynaście modeli, w tym warianty ChatGPT, Claude, Gemini i Mistral, wzięło udział wraz z ludzkimi czytelnikami, a wszystkie oceniły historie bardziej korzystnie, gdy powiedziano im, że są one napisane przez ludzi, z LLM, które wykazywały więcej predyspozycji niż ludzie.

Pomysł, że modele AI mogą mieć wchłoniętą uprzedzenie przeciwko własnemu wyjściu, podnosi pytania o to, skąd pochodzi ta predyspozycja. Ponieważ pisanie AI nie zawsze jest łatwe do identyfikacji, jakiekolwiek negatywne skojarzenia utworzone podczas szkolenia prawdopodobnie pochodzą z przykładów, które są jawnie oznaczone, czy to za pomocą relacji prasowych o treściach AI, czy samozadeklarowanych artykułów AI w głównych publikacjach.

Nowy artykuł nosi tytuł Everyone prefers human writers, including AI i pochodzi od dwóch autorów z Princeton’s Center for Digital Humanities. Praca jest zaopatrzona w powiązane wydanie danych na Zenodo (z cytowanym repozytorium GitHub w artykule, ale repozytorium nie jest aktywne w momencie pisania).

Metoda

Aby zbadać, jak atrybucja wpływa na percepcję stylu i kreatywności, autorzy użyli Exercices de style, niezwykłej pracy z 1947 roku autorstwa Raymonda Queneau, która przepisuje proste anegdotę w 99 różnych stylach. Historia opowiada o mężczyźnie, który wsiada do autobusu, kłóci się z innym pasażerem i później otrzymuje porady dotyczące mody od przyjaciela.

Chociaż jest to literackie pochodzenie, ta struktura przypomina transformacje oparte na promptach w nowoczesnych modelach językowych, gdzie użytkownicy proszą o przepisanie w określonym tonie, głosie lub rejestrze. Ten proces był kiedyś nazwany transstylization – ramą, która teraz jest powtarzana w badaniach AI w kontekście Style Transfer. Podczas gdy większość metod komputacyjnych ma na celu funkcjonalne zmiany, takie jak zmiany nastroju lub detoksykacja, przepisy Queneau mają na celu zauważalne kontrasty stylistyczne.

Z popularnego angielskiego tłumaczenia pracy Queneau wybrano trzydzieści ćwiczeń, które zachowały narrację, pokrywając szeroki zakres stylistyczny. Obejmowały one ograniczone formy, takie jak alexandrines i lipograms, zmiany rejestru, takie jak noble lub abusive, przesunięcia narracyjne, takie jak retrograde i hesitation, oraz zabawne deformacje, obejmujące spoonerisms, onomatopoeia lub dog Latin:

Przykłady z badania, pokazujące, jak GPT-4 przepisał historie Queneau w różnych stylach literackich, w parze ze stylami opisów, które widzieli ludzcy i AI oceniający podczas testowania. Źródło: https://arxiv.org/pdf/2510.08831

Przykłady z badania, pokazujące, jak GPT-4 przepisał historie Queneau w różnych stylach literackich, w parze ze stylami opisów, które widzieli ludzcy i AI oceniający podczas testowania. Źródło: https://arxiv.org/pdf/2510.08831

Ponieważ eksperymenty Queneau są trudne do sklasyfikowania, te kategorie są tylko przybliżonymi grupowaniami, a ich celem nie jest testowanie rozpoznawalności lub zgodności z gatunkiem, ale raczej stworzenie różnych warunków, w których (ludzcy) czytelnicy i modele mogą ujawnić swoje predyspozycje.

Aby wyprodukować odpowiedniki AI dla każdego wybranego stylu, badacze użyli celowo minimalnych promptów. Każdy model otrzymał najprostszą wersję anegdoty Queneau (początkowe ćwiczenie, Notation), wraz z krótką instrukcją, aby ją przepisać w określonym stylu, takim jak Przepisz historię jako wersję science fiction. Ten podejście pozwoliło na prompty, które odzwierciedlały ducha oryginalnych transformacji Queneau, jednocześnie pozwalając modelowi na swobodną interpretację stylu.

Podwójna wizja

Pierwsze badanie przeprowadzone przez autorów użyło GPT-4o do wygenerowania wszystkich trzydziestu wariantów stylu, ponieważ był to najbardziej zaawansowany model dostępny w tym czasie. Użycie jednego modelu zapewniło spójne dane wyjściowe, co umożliwiło izolację efektu etykiet atrybucji, który badanie miało na celu przetestować.

Dane wyjściowe nie były edytowane pod względem stylu ani tonu, poza ramą taką jak To jest przepisana wersja.

W drugim badaniu proces generacji został powtórzony w trzynastu dużych modelach językowych: Qwen 2.5 72B Instruct, Mistral Nemo, Mistral Medium 3, Llama 4 Maverick, Llama 3.3 70B Instruct, Gemini 2.5 Flash, GPT-4o Mini, GPT-4o, GPT-3.5 Turbo Instruct, DeepSeek RI (0528), DeepSeek Chat v3 (0324), Cohere Command R (08-2024), Claude Sonnet 4 i Claude 3.5 Haiku.

Każdy model otrzymał te same instrukcje i wyprodukował własne wersje trzydziestu ćwiczeń, co pozwoliło badaczom przetestować, czy efekt atrybucji utrzymuje się we wszystkich modelach AI, a nie jest związany z jednym modelem.

Dane i testy

Badacze pokazali te same pary historii różnym grupom ludzi, ale zmienili etykiety, aby zobaczyć, jak bardzo nazwa autora wpływa na opinie: jedna grupa nie widziała żadnych nazw autorów, tylko etykiety “A” i “B”. Druga grupa widziała prawidłowe nazwy, z jedną wersją oznaczoną jako napisaną przez człowieka, a drugą jako napisaną przez GPT-4o.

Trzecia grupa widziała nazwy zmienione, z “AI” historią oznaczoną jako “ludzka”, a wersją ludzką oznaczoną jako “AI”:

Przegląd Badania 1. Ludzcy i AI sędziowie porównali 30 par historii, z których każda zawierała wersję napisaną przez Queneau i jedną przez GPT-4. Sędziowie byli podzieleni na trzy grupy: jeden nie widział żadnych etykiet autorów; jeden widział prawidłowe etykiety; i jeden widział etykiety zamienione – ustawienie zaprojektowane w celu przetestowania, jak nazwa autora wpływa na opinie o stylu pisarskim.

Przegląd Badania 1. Ludzcy i AI sędziowie porównali 30 par historii, z których każda zawierała wersję napisaną przez Queneau i jedną przez GPT-4. Sędziowie byli podzieleni na trzy grupy: jeden nie widział żadnych etykiet autorów; jeden widział prawidłowe etykiety; i jeden widział etykiety zamienione – ustawienie zaprojektowane w celu przetestowania, jak nazwa autora wpływa na opinie o stylu pisarskim.

Badanie 1

Badacze podzielili 30 utworzonych stylów na mniejsze zestawy, z których każdy uczestnik badania widział tylko pięć stylów, a każdy styl był testowany pod wszystkimi trzema ustawieniami etykiet.

Każdy uczestnik widział tylko jedne ustawienie etykiety: grupa nieświadoma nie widziała żadnej wzmianki o AI, podczas gdy inne grupy widziały albo prawidłowe, albo odwrócone etykiety autorów. Przypisanie grupy, kolejność historii i rozmieszczenie lewo-prawe były wszystkie losowe.

Modele AI przeszły ten sam proces, otrzymując tę samą mieszankę stylów i tę samą losową permutację. Każdy test został uruchomiony trzy razy na model, aby upewnić się, że wyniki są spójne, co umożliwiło porównanie ludzkich i AI reakcji na etykiety autorów.

Badanie 2 użyło tych samych trzech ustawień etykiet co poprzednio, ale rozszerzyło test, aby objąć wszystkie 420 historii wygenerowanych z 14 różnych modeli LLM. Każdy model ocenił każdą historię pod każdym warunkiem etykiety, produkując 1260 decyzji na model, co dało 17 596 prawidłowych ocen:

Wyniki z Badania 1. AI i ludzcy sędziowie wykazali predyspozycję na podstawie etykiet autorów. Gdy nie pokazano żadnych etykiet (Nieświadomy), preferencje były prawie równe; gdy pokazano prawidłowe etykiety (Otwarta etykieta), obie grupy faworyzowały tekst napisany przez człowieka; i gdy etykiety były odwrócone (Kontrfakt), obie grupy zmieniły się na faworyzowanie tekstu, który uważały za ludzki – i ten efekt był znacznie silniejszy w modelach AI niż u ludzi. Paski błędu pokazują 95% przedziałów ufności.

Wyniki z Badania 1. AI i ludzcy sędziowie wykazali predyspozycję na podstawie etykiet autorów. Gdy nie pokazano żadnych etykiet (Nieświadomy), preferencje były prawie równe; gdy pokazano prawidłowe etykiety (Otwarta etykieta), obie grupy faworyzowały tekst napisany przez człowieka; i gdy etykiety były odwrócone (Kontrfakt), obie grupy zmieniły się na faworyzowanie tekstu, który uważały za ludzki – i ten efekt był znacznie silniejszy w modelach AI niż u ludzi. Paski błędu pokazują 95% przedziałów ufności.

Wśród wszystkich trzynastu modeli wzorzec odpowiadał ludzkiej predyspozycji, ale był znacznie silniejszy: bez etykiet AI systemy oceniały teksty ludzkie i AI prawie równie, wybierając tekst AI 49,4% czasu; gdy etykieta AI była widoczna, preferencja spadła gwałtownie do 29,8%, pokazując wyraźną dewaluację uznanych prac AI; i gdy ten sam tekst był oznaczony jako ludzki, preferencja wzrosła do 64,1%.

Różnica między dwoma warunkami etykiet wyniosła 34,3%, co oznacza, że modele AI zmieniły swoją preferencję znacznie bardziej niż ludzie, gdy etykiety zostały zamienione. Ponadto modele były bardzo spójne w powtarzanych przebiegach, potwierdzając, że predyspozycja była stabilna, a nie losowa.

Aby sprawdzić, czy predyspozycja była spowodowana sformułowaniem etykiet, a nie tym, kto napisał tekst, badacze przeprowadzili dwa dodatkowe testy: jeden używał etykiet, które sprawiały, że AI brzmiało bardziej imponująco; i drugi używał neutralnych terminów, takich jak “AI-authored” i “Human-authored”.

Oba nadal wykazywały tę samą predyspozycję, a nawet gdy modele AI produkowały tę samą odpowiedź za każdym razem, predyspozycja się utrzymywała, wskazując, że predyspozycja jest spowodowana typem etykiety (“ludzkiej” lub “AI”), a nie dokładnymi słowami używanymi.

Badanie 2

Drugie badanie wykazało tę samą pro-ludzką predyspozycję we wszystkich 13 modelach AI, niezależnie od architektury czy dostawcy:

Predyspozycja atrybucyjna dla każdego z 13 modeli AI: paski pokazują rozmiary efektów z 95% przedziałami ufności, a czerwona linia oznacza ludzki poziom bazowy. Wszystkie modele wykazywały silniejszą predyspozycję niż ludzie, z tylko niewielkimi różnicami między nimi.

Predyspozycja atrybucyjna dla każdego z 13 modeli AI: paski pokazują rozmiary efektów z 95% przedziałami ufności, a czerwona linia oznacza ludzki poziom bazowy. Wszystkie modele wykazywały silniejszą predyspozycję niż ludzie, z tylko niewielkimi różnicami między nimi.

Każdy model faworyzował historie oznaczone jako napisane przez ludzi, z silniejszymi efektami niż te widziane u ludzi. Nawet po usunięciu najbardziej ekstremalnego przypadku średnia predyspozycja pozostała ponad dwa razy większa niż ludzka wersja, sugerując, że efekt ten nie jest błędem jednego modelu, ale wspólną cechą modeli LLM.

Wnioski

Chociaż, jak zauważa artykuł, wcześniejsze badania wykazały, że AI może produkować pisanie równie dobre lub lepsze niż ludzkie, autorzy podkreślają, że w literaturze wartość przypisywana autorstwu i autentyczności jest starym i głęboko zakorzenionym konwencją:

‘Gdy GPT-4o Mini odrzuca “kreatywny i humorystyczny” styl Queneau jako “przesadzony” pod etykietą AI, a chwali identyczne cechy pod etykietą ludzką, nieświadomie ujawnia, jak te etykiety wyzwalają założenia, że nie wystąpił autentyczny proces psychologiczny.

‘Sygnały pochodzenia przemycą proces z powrotem do tego, co mogłoby być osądem tylko produktu: “zwykła generacja” wydaje się akceptowalna od ludzkiego rzemieślnika (ocenianego jako umiejętny), ale podejrzana od modelu’.

Modele LLM nie są jeszcze wystarczająco niezawodne do niesupervisionowanych badań faktograficznych, chociaż staranna nadzór może nadal sprawić, że będą produktywne – ale twórcze pisanie oparte na modelach LLM może stanowić bardziej niepewną przyszłość, jeśli AI wygenerowane prace twórcze staną się piętnowane przez szerszą niezgodę publiczną na wkroczenie AI na ludzkie dziedziny, a nie na podstawie zasług literackich.

Wnioski z badań tego typu są znacznie wpływane przez postawę firm i indywidualnych użytkowników do przyznania się do użycia AI. W niektórych przypadkach niechęć do przyznania się do takiego użycia może mieć więcej wspólnego z piractwem prawa autorskiego niż z obawą, czy publiczność zaakceptuje AI wygenerowane prace twórcze.

Jednak prawne, finansowe i polityczne rozwiązania są możliwe (choć bardzo wyzwaniowe) w odniesieniu do prawa autorskiego. Czy można kiedykolwiek sprawić, by ludzie cieszyli się twórczymi pracami AI, które nie mają jednego i związanego ludzkiego umysłu – to może być jeszcze trudniejszym zadaniem.

 

* Proszę odnieść się do oryginalnego artykułu, aby uzyskać usunięte cytaty w tekście. W razie potrzeby zostaną one uwzględnione w artykule. Po raz pierwszy opublikowane w poniedziałek, 13 października 2025.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai