Kąt Andersona

Nawet podstawowy AI może już pisać newsy, które nie różnią się od tych napisanych przez ludzi

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated illustration: a stylized orthographic illustration depicting a woman seated at her home office desk reading a laptop, and a cut-away diagram depicting 'Schrodinger's news source' - a box with a robot writing an article, partitioned from a human writing an article. Each has a stylized journalist appearance. The idea being conveyed is that until you actually know who wrote the piece the woman is reading, it could have been a human or a robot. GPT-1.5

Naukowcy odkryli, że nawet małe, lokalne modele AI mogą pisać newsy, których ludzie nie są w stanie odróżnić od tych napisanych przez ludzi, co jest zgodne z wynikami najlepszych systemów, a czytelnicy nie są w stanie określić, kto jest autorem.

 

Według nowego badania przeprowadzonego przez naukowców z Niemiec i Francji, ludzie nie są w stanie określić, czy artykuł został napisany przez AI, czy przez człowieka, nawet jeśli został napisany przez modele open source, które można pobrać i uruchomić na przeciętnych komputerach.

W innym dowodzie na to, że małe modele AI są na wzrost, badanie przeprowadzone na grupie 1 054 uczestników wykazało, że ludzie nie są w stanie określić, czy artykuł został napisany przez AI, czy przez człowieka, nawet jeśli został napisany przez modele o stosunkowo niewielkiej liczbie parametrów, takie jak Mistral i Llama variants:

Średnie wyniki ocen źródła i autentyczności dla modeli LLM. Parametry GPT-4o nie znacznie przewyższają parametry mniejszych modeli. Źródło - https://arxiv.org/pdf/2604.03755

Średnie wyniki ocen źródła i autentyczności dla modeli LLM. Parametry GPT-4o nie znacznie przewyższają parametry mniejszych modeli. Modele testowane w badaniu to Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o i GPT-3.5. Źródło

Autorzy powracają do tematu, który po raz pierwszy został zbadany w opublikowanym w 2024 roku Blessing or curse? A survey on the Impact of Generative AI on Fake News. Wyniki same są nowymi danymi z większego projektu, który został ogłoszony w styczniu, i wykorzystują framework JudgeGPT stworzony przez autorów.

Moc w małych rozmiarach

Tytuł Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News, a pochodzący od trzech badaczy z Frankfurt University of Applied Sciences i jednostki badawczej IRISA w Nantes, nowe badanie wprowadza ważne rozróżnienie pomiędzy “fałszywymi newsami” a “newsami napisanymi przez AI” (ponieważ fałszywe newsy mogą być napisane przez ludzi lub przez AI, a oba aspekty nie są tożsame).

Jednak najbardziej interesującym aspektem jest wniosek, że mniejsze modele, w tym Mistral 7B i Gemma 7B, mogą, z tylko siedmioma miliardami parametrów, konkurować z modelem ChatGPT-4o z 200 miliardami parametrów:

‘Modele o otwartych wagach z tak niewielką liczbą parametrów, jak 7B, produkują tekst, który nie różni się od tekstu wygenerowanego przez GPT-4o, co wskazuje, że zdolność do generowania tekstu nieodróżnialnego od ludzkiego nie jest już ograniczona do największych modeli.’

Jednak “newsy wygenerowane przez AI” mogą reprezentować wiele różnych rodzajów współpracy człowiek-AI, od sprawdzania pisowni po pełne, zakończenie definitywne, a badanie nie wyjaśnia dokładnie, jaki rodzaj zawartości AI został wygenerowany do testów (chociaż opisuje metodologię jego wytworzenia – patrz poniżej).

Metoda

Dla uczestników zaangażowanych w platformę JudgeGPT, każdy fragment newsa był oceniany za pomocą dwuosiowego frameworku, w którym dostarczali trzy niezależne oceny na ciągłych skalach 0-100:

Interfejs platformy JudgeGPT, gdzie oceniający oceniają materiał pod kątem atrybucji źródła; autentyczności; i znajomości tematu.

Interfejs platformy JudgeGPT, gdzie oceniający oceniają materiał pod kątem atrybucji źródła; autentyczności; i znajomości tematu. Proszę odnieść się do źródłowego artykułu w celu uzyskania lepszej rozdzielczości.

Ocena źródła pozwalała określić, czy fragment wydaje się napisany przez maszynę, czy przez człowieka; ocena autentyczności pozwalała określić, czy jest on postrzegany jako fałszywy, czy prawdziwy; i znajomość tematu pozwalała określić, jak dobrze czytelnik zna temat.

Stosowano ciągłe skale zamiast skali Likerta, aby dokładniej uchwycić stopnie pewności i wesprzeć analizę statystyczną, w tym korelację Pearsona i klastering.

Fragmenty tekstu wygenerowane przez maszynę zostały wytworzone za pomocą frameworku RogueGPT autorów, który jest architekturą podstawową dla JudgeGPT. RogueGPT koordynuje wkład sześciu dużych modeli językowych (LLM): ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; i Mistral 7B.

Stosowano persone-based prompting do generowania tekstów, a generacje AI były oparte na rzeczywistych tematach newsowych i zostały sprawdzone przez ludzi.

Odwrotnie, fragmenty napisane przez ludzi zostały pobrane z “ustanowionych wydawnictw prasowych” i niespecyfikowanych “bazy danych”.

Autorzy zauważają:

‘Zestaw bodźców jest celowo przesunięty w stronę fragmentów pochodzących z maszyny (98%), z fragmentami pochodzącymi od ludzi służącymi jako kotwice kalibracyjne.

‘To wybór projektu odzwierciedla focus badania na zmianach wewnątrz-AI (między modelami) a nie porównaniu człowiek-AI; uczestnicy nie zostali poinformowani o podstawowej częstotliwości, a wyniki nieznacznie przekraczające poziom przypadku utrzymują się, gdy analizowane są na podstawie fragmentów pochodzących od ludzi.’

Uczestnicy najpierw wyrazili zgodę i wypełnili kwestionariusz demograficzny, obejmujący wiek, wykształcenie, orientację polityczną i znajomość AI, po czym oceniali sekwencję fragmentów newsowych.

Każda osoba przeglądała od 5 do 87 elementów, z medianą 12, podczas gdy kolejność prezentacji była losowa, a przydział modeli był zrównoważony wśród uczestników, aby zmniejszyć stronniczość. Platforma rejestrowała trzy oceny na suwakach wraz z czasem odpowiedzi i anonimowym identyfikatorem, umożliwiając powiązanie poszczególnych ocen z czynnikami tła.

Autorzy zwracają uwagę, że próba była przesunięta w stronę wykształconych uczestników z Europy, z 68% wykształconych na poziomie uniwersyteckim i 74% mieszkających w Europie – stronniczość, którą artykuł wymienia jako ograniczenie dla szerszej generalizacji.

Testy

Testy są podzielone na pięć typów wyników: rozróżnianie tekstu wygenerowanego przez maszynę od tekstu napisanego przez człowieka; porównywanie wykrywania między różnymi LLM; badanie wpływu ekspertyzy domenowej na dokładność; identyfikowanie odrębnych strategii odpowiedzi wśród uczestników; i śledzenie, jak dokładność zmienia się w czasie powtarzanych ocen, ze względu na zmęczenie:

Podsumowanie pięciu podstawowych wyników z 2 318 ocen z 1 054 uczestników, pokazujące, że wykrywanie przez ludzi tekstu wygenerowanego przez AI pozostawało na poziomie przypadku we wszystkich modelach, że dokładność była związana z ekspertyzą domenową, a nie orientacją polityczną, że uczestnicy klasyfikowali się na dwa odrębne profile zaufania, i że wydajność spadała po około 30 ocenach, ze względu na zmęczenie poznawcze.

Podsumowanie pięciu podstawowych wyników z 2 318 ocen z 1 054 uczestników, pokazujące, że wykrywanie przez ludzi tekstu wygenerowanego przez AI pozostawało na poziomie przypadku we wszystkich modelach, że dokładność była związana z ekspertyzą domenową, a nie orientacją polityczną, że uczestnicy klasyfikowali się na dwa odrębne profile zaufania, i że wydajność spadała po około 30 ocenach, ze względu na zmęczenie poznawcze.

Test pokazał, że nie ma znaczącej różnicy powyżej poziomu przypadku w ocenach źródła między warunkami, co wskazuje, że uczestnicy nie są w stanie rozróżnić tekstu wygenerowanego przez AI od tekstu napisanego przez człowieka:

Rozkład ocen źródła i autentyczności dla fragmentów pochodzących od maszyny i od ludzi pokazuje znaczne nakładanie się, bez znaczącego rozdzielenia między warunkami, a testy statystyczne wskazują, że uczestnicy nie są w stanie niezawodnie rozróżnić tekst wygenerowany przez AI od tekstu napisanego przez człowieka.

Rozkład ocen źródła i autentyczności dla fragmentów pochodzących od maszyny i od ludzi pokazuje znaczne nakładanie się, bez znaczącego rozdzielenia między warunkami, a testy statystyczne wskazują, że uczestnicy nie są w stanie niezawodnie rozróżnić tekst wygenerowany przez AI od tekstu napisanego przez człowieka.

Dla drugiego aspektu, jak pokazano na wykresie na początku artykułu, nieudane wykrywanie nie różniło się w zależności od modelu, ponieważ dane wyjściowe wszystkich LLM były skupione wokół ocen na poziomie przypadku, bez znaczących różnic między nimi. Nawet mniejsze systemy o otwartych wagach, takie jak Mistral 7B i Gemma 7B, były oceniane nie inaczej niż GPT-4o, co wskazuje, że tekst nieodróżnialny od ludzkiego może nie być już ograniczony do największych modeli.

Dla trzeciego aspektu, dokładność była silniej związana z ekspertyzą domenową niż z orientacją polityczną, ponieważ znajomość fałszywych newsów korelowała z lepszymi ocenami, podczas gdy poglądy polityczne nie miały znaczącego wpływu, co sugeruje, że umiejętności analityczne mogą być ważniejsze niż ideologia:

Wyniki dotyczące trzeciego kierunku badawczego: korelacje między cechami tła a dokładnością ocen wykazały, że orientacja polityczna nie miała znaczącego wpływu na atrybucję źródła ani ocenę autentyczności, z tylko słabymi, nieistotnymi tendencjami w obu miarach. Jednocześnie, deklarowana znajomość fałszywych newsów była konsekwentnie związana z wyższą dokładnością w obu osiach, co odzwierciedla się w umiarkowanych, pozytywnych korelacjach i wzrostach regresji. Autorzy twierdzą, że oznacza to, że umiejętność analityczna oparta na doświadczeniu była silniejszym predyktorem wydajności w ocenianiu newsów wygenerowanych przez AI i napisanych przez ludzi. Proszę odnieść się do źródłowego artykułu w celu uzyskania lepszej rozdzielczości.

Wyniki dotyczące trzeciego kierunku badawczego wykazały, że orientacja polityczna nie miała znaczącego wpływu na atrybucję źródła ani ocenę autentyczności, z tylko słabymi, nieistotnymi tendencjami, podczas gdy deklarowana znajomość fałszywych newsów była związana z wyższą dokładnością w obu osiach, co sugeruje, że umiejętność analityczna oparta na doświadczeniu była silniejszym predyktorem wydajności. Proszę odnieść się do źródłowego artykułu w celu uzyskania lepszej rozdzielczości.

Czwarty wynik pokazał, że uczestnicy dzielili się na dwa odrębne style odpowiedzi, określane jako “Sceptycy” – którzy przypisywali niskie zaufanie do zawartości niezależnie od pochodzenia – i “Wierzący” – którzy utrzymywali wyższy poziom zaufania.

Wreszcie, odnosząc się do piątego celu, analiza sekwencyjna ocen wykazała, że uczestnicy początkowo stawali się lepsi w zadaniu, z dokładnością poprawiającą się w ciągu około pierwszych 15-20 ocen, gdy dostosowywali się do formatu:

Średnie oceny źródła i autentyczności w sekwencji ocen uczestników pokazują krótką fazę poprawy na początku, gdy użytkownicy zdają się dostosowywać do zadania w ciągu pierwszych 15-20 elementów, po której następuje stały spadek w obu miarach po około 30 ocenach. Wyniki spadają w kierunku odpowiedzi domyślnych – co interpretowane jest jako zmęczenie poznawcze. Proszę odnieść się do źródłowego artykułu w celu uzyskania lepszej rozdzielczości.

Średnie oceny źródła i autentyczności w sekwencji ocen uczestników pokazują krótką fazę poprawy na początku, gdy użytkownicy zdają się dostosowywać do zadania w ciągu pierwszych 15-20 elementów, po której następuje stały spadek w obu miarach po około 30 ocenach. Proszę odnieść się do źródłowego artykułu w celu uzyskania lepszej rozdzielczości.

Jednak ten efekt był krótkotrwały, ponieważ wydajność zaczęła spadać po około 30 elementach, z uczestnikami, którzy coraz częściej oznaczali zawartość jako fałszywą – co interpretowane jest jako zmęczenie poznawcze, wskazując na wyraźne ograniczenia, jak długo podejścia oparte na wykrywaniu mogą pozostawać skuteczne w praktyce.

To może stanowić pewne dowody empiryczne, że, zmęczeni perspektywą rozróżniania fałszywych newsów od prawdziwych, newsów AI od ludzkich, możemy tendować do przyjmowania założenia, że newsy są AI i/lub fałszywe (co niekoniecznie jest tym samym), aby “być po bezpiecznej stronie”. Ci, którzy uważają to za “lenistwo” i uważają, że ludzie powinni sami sprawdzić, czy potencjalna fałszywa historia jest prawdziwa, mogą być zainteresowani tym, że badanie z 2024 roku wskazało, że to tylko pogarsza problemy.

Autorzy sugerują, że niepowodzenie w wykrywaniu przez ludzi wskazuje, że możemy potrzebować zastosować technologie pochodzenia kryptograficznego, takie jak inicjatywa C2PA prowadzoną przez Adobe. Inne możliwe rozwiązania, o których mowa, to framework OriginLens autorów oraz inny projekt zaangażowany przez autorów o nazwie CRED-1.

Autorzy kończą:

‘Czy ludzie mogą rozpoznać? Nasze dwuosiowe badanie 2 318 ocen z sześciu rodzin LLM dostarcza jasnej, empirycznej odpowiedzi: nie.

‘Tekst wygenerowany przez maszynę jest nieodróżnialny od pisarstwa ludzkiego, niezależnie od rozmiaru modelu lub rodziny, ekspertyza domenowa lepiej przewiduje dokładność wykrywania niż orientacja polityczna, uczestnicy przyjmują odrębne strategie zaufania, a zmęczenie poznawcze ogranicza trwałe wykrywanie.

‘Te wyniki wspierają przesunięcie od wykrywania na poziomie użytkownika do środków przeciwdziałania na poziomie systemowym, w tym pochodzenie zawartości, wskaźniki zaufania i ograniczone interwencje szczepionkowe.’

Wnioski

Niepokojącym aspektem tego artykułu jest sieć powiązanych projektów i artykułów, które autorzy (lub niektórzy z nich, w zależności od pracy) zainicjowali lub w których brali udział; i na pewno byłoby interesujące, gdyby można było przeanalizować przykłady tekstu AI i ludzkiego, które wygenerowały te wyniki, aby lepiej zrozumieć rodzaj wyjściowego tekstu, jaki generowana metoda produkuje.

Niemniej jednak, według strony canirun.ai, Mistral 7B (który był mniej więcej na tym samym poziomie co ChatGPT-4o w testach) ‘działa dobrze’ na NVIDIA RTX 3080 z 16 GB VRAM, i ‘działa przyzwoicie’ na 3060 z 6 GB VRAM – co nie jest najnowszymi ani największymi kartami graficznymi w grze*. Więc każdy, kto chce opracować własną metodologię dla próbek, może również wziąć udział w tych eksperymentach.

 

* Gemma 7B nie jest wymieniona na stronie.

Pierwotnie opublikowane w czwartek, 9 kwietnia 2026

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]