Andersonův úhel

I když je to základní AI, může nyní psát zprávy, které jsou srovnatelné s lidskou žurnalistikou

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated illustration: a stylized orthographic illustration depicting a woman seated at her home office desk reading a laptop, and a cut-away diagram depicting 'Schrodinger's news source' - a box with a robot writing an article, partitioned from a human writing an article. Each has a stylized journalist appearance. The idea being conveyed is that until you actually know who wrote the piece the woman is reading, it could have been a human or a robot. GPT-1.5

Nový výzkum ukazuje, že i malé lokální modely AI mohou psát zprávy, které lidé nemohou rozlišit od skutečné žurnalistiky, a to na stejné úrovni jako nejlepší systémy, a čtenáři nejsou schopni určit, kdo článek napsal.

 

Podle nové spolupráce mezi Německem a Francií lidé nemohou určit, zda je článek napsán člověkem nebo AI – ani když je napsán otevřenými modely, které lze stáhnout a spustit na relativně průměrných spotřebitelských počítačích.

V další indikaci, že malá AI je na vzestupu, průzkum 2 318 hodnocení shromážděných od 1 054 účastníků v akademickém studijním portálu ukázal, že lidské čtenáře nemohly identifikovat původ článku na vyšší úrovni než náhodou, ani když byl výstupem relativně skromných modelů s pouze sedmi miliardami parametrů, včetně Mistral a Llama variant:

Průměrné skóre zdroje a autenticity pro testované LLM. 200 miliard parametrů GPT-4o výrazně nepřevyšuje 7 miliard parametrů menších modelů. Zdroj - https://arxiv.org/pdf/2604.03755

Průměrné skóre zdroje a autenticity pro testované LLM. 200 miliard parametrů GPT-4o výrazně nepřevyšuje 7 miliard parametrů menších modelů. Testované modely byly Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o a GPT-3.5. Zdroj

Autoři se vrací k tématu, které poprvé prozkoumali v roce 2024 zveřejnění Blessing or curse? A survey on the Impact of Generative AI on Fake News. Samotná zjištění jsou nově zveřejněné výsledky z většího projektu, který byl původně ohlášen v lednu, a využívají autorů vlastní JudgeGPT online participační rámec.

Lehká váha

Nazvaný Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News, a pocházející od tří výzkumníků z Frankfurt University of Applied Sciences a IRISA research unit v Nantes, nová studie dělá důležité rozlišení mezi ‘fake news’ a ‘AI-written news’ (protože fake news může být napsána lidmi nebo AI, a tyto dva aspekty nejsou nutně synonymní).

Avšak možná nejzajímavějším aspektem je závěr, že malé modely, včetně Mistral 7B a Gemma 7B, mohou s pouze sedmi miliardami parametrů obstát proti modelu ChatGPT (4o) s 200 miliardami parametrů:

‘Otevřené modely s pouze 7 miliardami parametrů produkují text, který je hodnocen stejně jako výstup GPT-4o, což naznačuje, že schopnost generovat text, který je nerozlišitelný od lidského, již není omezena pouze na modely na hranici možností.’

Avšak ‘AI-generated news’ může představovat mnoho různých typů spolupráce mezi lidmi a AI, od kontrolingu pravopisu až po plné, kariérní odložení úsilí, a studie nezjišťuje přesně, jaký typ AI obsahu byl pro testy vyprodukován (ačkoli popisuje metodologii pro jeho produkci – viz níže).

Metoda

Pro účastníky zapojené do platformy JudgeGPT byl každý news fragment hodnocen pomocí duální osy, ve které poskytli tři nezávislé hodnocení na kontinuálních 0-100 posuvnících:

JudgeGPT portál GUI, kde hodnotitelé hodnotí materiál na základě atributu zdroje; autenticity; a znalosti tématu.

JudgeGPT portál GUI, kde hodnotitelé hodnotí materiál na základě atributu zdroje; autenticity; a znalosti tématu. Prosím, odkážete se na zdroj papíru pro lepší rozlišení.

Hodnocení zdroje zachytilo, zda pasáž vypadala jako napsaná strojově nebo lidsky; hodnocení autenticity, zda byla vnímána jako falešná nebo legitimní; a znalost tématu, jak dobře čtenář znal téma.

Byly použity kontinuální škály místo Likertovy škály, aby se přesněji zachytila jistota a aby se podpořila statistická analýza, včetně Pearsonovy korelace a klusteringu.

Machine-generated text fragments byly vyprodukovány pomocí autorů vlastní RogueGPT framework, který je feeder architekturou pro JudgeGPT. RogueGPT orchestrates příspěvky od šesti Large Language Models (LLM): ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; a Mistral 7B.

Persona-based prompting byl použit pro generování textů, a AI generace byly založeny na skutečných zpravodajských tématech, a byly fakticky ověřeny lidmi.

Naproti tomu lidsky psané fragmenty byly vzorky z ‘zavedených zpravodajských zdrojů’ a neurčených ‘informačních databází’.

Autoři pozorují:

‘Soubor stimulů je záměrně zkreslený směrem k strojově generovaným fragmentům (98%), s lidsky generovanými položkami, které slouží jako kalibrační kotvy.

‘Toto rozhodnutí o designu odráží zaměření studie na variaci uvnitř AI (mezi modely) spíše než na srovnání člověk vs. AI; účastníci nejsou informováni o základních rychlostech, a výsledky blízké náhodě zůstávají, když jsou analyzovány na podsouboru lidsky generovaných položek.’

Účastníci nejprve poskytli informovaný souhlas a dokončili demografický dotazník, který pokrýval věk, vzdělání, politickou orientaci a znalost AI, po kterém ohodnotili sekvenci zpravodajských fragmentů.

Každá osoba prošla 5-87 položkami, s mediánem 12, zatímco pořadí prezentace bylo náhodné, a přiřazování modelů bylo vyváženo napříč účastníky, aby se snížila zkreslení. Platforma zaznamenala tři hodnocení posuvníků spolu s časem reakce a anonymním identifikátorem, což umožnilo propojit jednotlivá hodnocení s faktory na pozadí.

Autoři se snaží poukázat na to, že vzorek se naklonil směrem k vzdělaným evropským účastníkům, se 68% vysokoškolsky vzdělanými, a 74% založenými v Evropě – zkreslení, které studie označuje jako omezení pro širší generalizaci.

Testy

Testy jsou rozděleny do pěti typů zjištění: rozlišení strojově generovaného textu od lidsky psaného textu; srovnání detekce napříč různými LLM; zkoumání účinku odborné znalosti versus politické orientace na přesnost; identifikace odlišných strategií reakcí mezi účastníky; a sledování, jak se přesnost mění při opakovaných hodnoceních, kvůli únavě:

Souhrn pěti hlavních zjištění z 2 318 hodnocení napříč 1 054 účastníky, ukazující, že lidská detekce AI-psaného textu zůstala na úrovni náhody napříč všemi modely, že přesnost byla spojena s odbornou znalostí spíše než s politickou orientací, že účastníci se seskupili do odlišných profilů důvěry, a že výkon poklesl po zhruba 30 hodnoceních, kvůli kognitivní únavě.

Souhrn pěti hlavních zjištění z 2 318 hodnocení napříč 1 054 účastníky, ukazující, že lidská detekce AI-psaného textu zůstala na úrovni náhody napříč všemi modely, že přesnost byla spojena s odbornou znalostí spíše než s politickou orientací, že účastníci se seskupili do odlišných profilů důvěry, a že výkon poklesl po zhruba 30 hodnoceních, kvůli kognitivní únavě.

Test ukázal, že mezi podmínkami nebyl žádný významný rozdíl v hodnoceních zdrojů na vyšší úrovni než náhoda, což naznačuje, že účastníci nemohli rozlišit AI-generovaný text od lidského výstupu:

Distribuce hodnocení zdroje a autenticity pro strojově a lidsky generované fragmenty ukazují podstatné překrytí, bez významného rozlišení mezi dvěma podmínkami, a statistické testování – ukazující, že účastníci nemohli spolehlivě rozlišit AI-generovaný text od lidsky psaného obsahu.

Distribuce hodnocení zdroje a autenticity pro strojově a lidsky generované fragmenty ukazují podstatné překrytí, bez významného rozlišení mezi dvěma podmínkami, a statistické testování – ukazující, že účastníci nemohli spolehlivě rozlišit AI-generovaný text od lidsky psaného obsahu.

Pro druhý aspekt, jak je ukázáno v grafu na začátku článku, selhání detekce se nezměnilo v závislosti na modelu, protože výstupy ze všech LLM se seskupily kolem hodnocení na úrovni náhody, bez významných rozdílů mezi nimi. I menší otevřené modely, jako je Mistral 7B a Gemma 7B, byly hodnoceny stejně jako GPT-4o, což naznačuje, že lidsky nerozlišitelný text již nemusí být omezen pouze na největší modely.

Pro třetí aspekt, přesnost byla více spojena s odbornou znalostí než s politickou orientací, protože znalost falešných zpráv korelovala s lepšími hodnoceními, zatímco politické názory neměly žádný významný účinek, což naznačuje, že naučené analytické dovednosti mohou být důležitější než ideologie:

Výsledky týkající se třetí linie vyšetřování: účastnické korelace mezi pozadími a přesností hodnocení ukázaly, že politická orientace neměla žádný významný účinek na hodnocení zdroje nebo autenticity, s pouze slabými, statisticky neznačnými trendy napříč oběma měřeními. Současně se samoohodnocení znalosti falešných zpráv spojilo s vyšší přesností na obou osách, jak je patrné z moderovaných pozitivních korelací a vzestupných regresních sklonů. Autoři tvrdí, že to naznačuje, že zkušenostní analytické dovednosti (spíše než ideologická pozice) byly silnějším prediktorem výkonu při hodnocení AI-generovaného a lidsky psaného obsahu. Prosím, odkážete se na zdroj papíru pro lepší rozlišení.

Výsledky třetí linie vyšetřování ukázaly, že politická orientace neměla žádný významný účinek na hodnocení zdroje nebo autenticity, s pouze slabými, statisticky neznačnými trendy, zatímco samoohodnocení znalosti falešných zpráv se spojilo s vyšší přesností na obou osách. To naznačuje, že zkušenostní analytické dovednosti byly silnějším prediktorem výkonu než ideologická pozice. Prosím, odkážete se na zdroj papíru pro lepší rozlišení.

Čtvrté zjištění ukázalo, že účastníci se seskupili do dvou odlišných stylů reakcí, identifikovaných jako ‘Skeptici’ – kteří přiřazovali nízkou důvěru napříč obsahem bez ohledu na původ – a ‘Věřící’ – kteří udržovali vyšší základní úroveň důvěry.

Nakonec, pokud jde o pátý cíl, analýza posloupných hodnocení ukázala, že účastníci se zpočátku stali lepšími v úkolu, s přesností, která se zlepšila během prvních zhruba 15-20 hodnocení, protože se adaptovali na formát:

Rolling averages hodnocení zdroje a autenticity napříč sekvencí účastnických hodnocení ukazují krátkou počáteční fázi zlepšení, protože uživatelé se zdají adaptovat na úkol během prvních 15–20 položek, následované stálým poklesem obou měření po zhruba 30 hodnoceních. Skóre klesají směrem k výchozím odpovědím – vzorec, který je v studii interpretován jako kognitivní únava. Prosím, odkážete se na zdroj papíru pro lepší rozlišení.

Rolling averages hodnocení zdroje a autenticity napříč sekvencí účastnických hodnocení ukazují krátkou počáteční fázi zlepšení, protože uživatelé se zdají adaptovat na úkol během prvních 15–20 položek, následované stálým poklesem obou měření po zhruba 30 hodnoceních. Prosím, odkážete se na zdroj papíru pro lepší rozlišení.

Avšak tento účinek byl krátkodobý, protože výkon začal klesat po zhruba 30 položkách, s účastníky, kteří se stále více přikláněli k označování obsahu jako falešného – posun, který je interpretován jako kognitivní únava, a naznačuje jasná omezení, jak dlouho mohou detekční přístupy zůstat účinné v praxi.

To může představovat some empirické důkazy, že, unaveni perspektivou rozlišení falešných zpráv od skutečných, AI zpráv od lidských, jsme mohli se přiklonit k předpokladu, že zprávy jsou AI a/nebo falešné (což nejsou nutně stejné věci), aby byli ‘na bezpečné straně’. Ti, kteří považují toto za ‘lenivé’, a kteří se domnívají, že lidé by měli sami provést výzkum, aby ověřili potenciální falešnou zprávu, by mohli být interesováni tím, že studie z roku 2024 ukázala, že to pouze zhoršuje problémy.

Autoři navrhují, že selhání lidského úsudku, které je patrné z výsledků, naznačuje, že bychom mohli potřebovat odložit tyto záležitosti k technologii kryptografického původu, jako je iniciativa C2PA vedená Adobe. Další možné řešení zahrnují autorů vlastní OriginLens framework a další autorův projekt nazvaný CRED-1.

Autoři uzavírají:

‘Můžou lidé rozlišit? Naše duální osa studie 2 318 hodnocení napříč šesti LLM rodinami poskytuje jasnou empirickou odpověď: nemohou.

‘Strojově generovaný text je nerozlišitelný od lidského psaní bez ohledu na velikost modelu nebo rodinu, odborná znalost předpovídá detekční přesnost více než politická orientace, účastníci přijímají odlišné strategie důvěry, a kognitivní únava omezuje udržitelnou detekci.

‘Tyto výsledky podporují posun od uživatelské detekce směrem k systémovým protižádáním, včetně obsahu původu, adaptivních indikátorů důvěry a omezených intervenčních vakcín.’

Závěr

Zajímavým aspektem tohoto článku je podpůrná síť projektů a článků, které autoři – nebo někteří z autorů, v závislosti na práci – založili nebo se na nich podíleli; a jistě by bylo osvěžující prozkoumat vzorky AI a lidsky generovaného textu, které produkují tyto výsledky, aby lépe pochopili typ výstupu, který popisovaná metodika generuje.

Nicméně je zajímavé slyšet, že otevřené, otevřené zdrojové modely mohou být srovnatelné s API-řízenými giganty, jako je série ChatGPT – může to být úkol, který není tak obtížný, a 200miliardový parametrový model je nadbytečný pro takové úkoly? Potřebujeme vědět trochu více o předložených AI a lidsky generovaných vzorcích, abychom mohli odpovědět na tuto otázku.

Mezitím, podle webu canirun.ai, Mistral 7B (který byl více méně na stejné úrovni jako ChatGPT-4o v testech) ‘běží skvěle’ na NVIDIA RTX 3080 s 16GB VRAM, a ‘běží dobře’ na 3060 s 6GB VRAM – což nejsou nejnovější nebo nejlepší grafické karty v použití*. Kdokoli, kdo chce vytvořit vlastní metodologii pro podání vzorků, může se zdát účastnit těchto experimentů také.

 

* Gemma 7B není uvedena na webu.

První zveřejnění čtvrtek, 9. dubna 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai