Andersonův úhel
ChatGPT-5 a Gemini 2.5 halucinují ve 40% testovaných dotazů redakce

Googleův NotebookLM si vede lépe s pouze 13 % – mírou, která by vẫn mohla dostat každého novináře na světě do problémů. Studie zjistila, že modely často zkreslovaly zdroje tím, že měnily názory na fakta a odstraňovaly atributy, což je činí rizikovými nástroji pro žurnalistiku. Autoři volají po lepších, specializovaných nástrojích pro tyto úkoly. Velké jazykové modely se rychle rozšířily do žurnalistiky v nedávné době, v pracovním prostředí, které již dlouho snižuje náklady, rozpočet a personál od
Nová studie zjistila, že ChatGPT-5 a Google Gemini produkují halucinace ve 40 % dotazů ve stylu redakce, často vynalézají sebevědomě znějící tvrzení, která nejsou podložena ověřitelnými fakty. doby, kdy digitální žurnalistika zničila dvě století tradice v nepřetržitelném procesu , který začal na počátku roku 2000. Ve skutečnosti byl terén již připraven, protože média se již dlouho zvykla na snižování počtu pracovních míst prostřednictvím “inovací” od turbulentního zavedení digitálního sazby v 80. letech, stejně jako dřívější výzvy ze strany rozhlasu a televize. Cesta umělé inteligence do redakcí a médií nebyla bez potíží; v kontextu, kde 55 % společností nyní lituje nahrazení lidí umělou inteligencí a kde Gartner předpovídá , že organizace budou výrazně zpomalovat své plány na přijetí umělé inteligence do dvou let, několik novinových organizací znovu najalo novináře, kteří byli nahrazeni umělou inteligencí, protože se ukázaly závažné ačasto embarrassing nedostatky alternativ založených na strojovém učení.
Chybovat není jen lidské
Although halucinace se ukázaly jako obrovský problém pro oblasti, kde je přesná citace nezbytná (s významnou veřejnou pozorností propřípady selhání umělé inteligence v právu , výzkumu a žurnalistice ), nová americká studie zjistila, že strojové učení vžurnalistice čelíširším výzvám, než se očekávalo. Autorům se podařilo ChatGPT , Google Gemini a NotebookLM na úkolu reportážního stylu: pomocí 300dokumentového korpusu zaměřeného na právní a politické spory související s TikTokem ve Spojených státech. Výzkumníci měnili specifičnost podnětů a počet dokumentů, které byly modelům poskytnuty, a poté analyzovali výsledky pomocí taxonomie navržené pro zachycení typu a závažnosti halucinací. Ve všech výstupech obsahovalo 30 % alespoň jednu halucinaci, zatímco ChatGPT a Gemini každý vykázaly 40% míru halucinace –což je o něco více než trojnásobek
vyšší než 13% chybové míry NotebookLM. Autoři studie komentují, že: ‘Kvalitativně většina chyb nezahrnovala vynalezené entity nebo čísla; místo toho jsme pozorovali
interpretativní nadměrnou sebevědomost – modely přidávaly nepodporované charakteristiky zdrojů a měnily připsané názory na obecné výroky.’ ‘Tyto vzorce
fundamentální epistemologickou nesrovnalost: zatímco žurnalistika vyžaduje explicitní zdroje pro každé tvrzení, LLM generuje autoritativně znějící text bez ohledu na
odhalují důkazní podporu.’‘Navrhujeme žurnalisticky specifické rozšíření stávajících taxonomií halucinací vynucují přesnou atribuci spíše než optimalizují pro plynulost.’a argumentujeme, že efektivní nástroje pro redakce potřebují architektury, které
Teorie a metoda
Přesná příčina halucinací* je sporná ; ačkoli téměř všechny teorie souhlasí s tím, že kvalita dat a/neborozložení
jsou přispívajícím faktorem během tréninku, bylo dokonce navrženo , že 100 % výstupu LLM je
se shodují s realitou). Autoři pozorují † : ‘Z
vlastně halucinace (kromě toho, že některé z těchto halucinací technického hlediska halucinace vznikají z LLM schopnosti generovat text, který následuje běžné vzorce bez pochopení toho, co je pravdivé. LLM Tato charakteristika vede k pravděpodobně znějícím odpovědím, které neodrážejí realitu – například LLM vynalezené právní precedenty, které pronikají do argumentů . ‘A zatímco schopnosti .’ se dramaticky zvýšily za posledních pět let, halucinace zůstávají problémem, v některých případech se dokonce zvyšují, jak modely se stávají schopnějšími
Tik Tok
Autoři provedli hodnocení, aby zjistili, které přístupy by mohly být skutečně užitečné pro novináře, a provedli hodnocení, která měla odrážet reálné pracovní postupy a standardy redakce, přičemž se zkoumala halucinace v kontextu typických reportážních úkolů. Modely na hranici možností byly testovány pomocí běžných strategií pro podněty a nastavení založených na dokumentech, aby se mohly měřit jak frekvence, tak typ chyb halucinací – spolu s tím, co tyto chyby vlastně znamenají pro integraci umělé inteligence do redakcí. Analýza se zaměřila na typ dotazů založených na dokumentech, typických pro výzkum a investigativní žurnalistiku. Autoři se snažili vybrat sbírku dokumentů, která by odrážela typický malý až středně velký projekt redakce, který by byl stále dostatečně velký na to, aby zachytil reálné reportáže;složitost k tomuto účelu vybrali 300dokumentovéprůběžné právní úsilí o zákaz TikToku ve Spojených státech. Dokumenty byly shromážděny z , Washington Post , New York Times a ProQuest , což vedlo k sbírka, která obsahovala pět akademických článků, 150 novinových článků a 145 právních podání (úplná kompilace je k dispozici akademickým výzkumníkům na vyžádání prostřednictvím repozitáře Westlaw projektu). Zatímco odpovědi modelů LLM silně závisí na tom, jak je výzva formulována a kolik kontextu je poskytnuto, autoři navrhli pět dotazů, které sahaly od velmi obecných až po velmi specifické – od obecných otázek týkajících se zákazu TikToku až po podrobné dotazy, které požadovaly svědectví z konkrétních soudních případů.
Soupeři
Tři nástroje byly testovány, každý reprezentující jiný přístupk dotazům založených na dokumentech: ChatGPT-5 byl hodnocen pomocí funkce Projekty , která omezovala nahrávání na 100 dokumentů; Google Gemini 2.5 Pro byl schopen zpracovat plnou 300dokumentovou sbírku v kontextu (pomocí svého kontextového okna o velikosti jednoho milionu tokenů pro přímé načtení 923 všech tokenů); 000 Google NotebookLM, který notebookůnabízí vestavěnou funkci načítání citací, byl testován pomocí speciálních pro každou vzorku.
Data a testy
V počátečním testu pro bylo zjištěno,

halucinaci, s pozoruhodnou variací
modelů obsahovalo alespoň jednu mezi nástroji. ChatGPT
NotebookLM produkovaly halucinace pouze
a Gemini každý vyprodukovaly halucinace ve 40 % svých výstupů, zatímco ve 13 % případů: prevalenci halucinací Autoři komentují:
odpovědí napříč všemi nástroji
‘To naznačuje, že zatímco většina skutečněneobsahuje halucinace, volba nástroje dělá rozdíl pro stejnou sbírku dokumentů a sadu dotazů.’
Závěr
Každý, kdo experimentoval se třemi modely studovanými v novém článku, ví, že každý z nich má své silné a slabé stránky. Ačkoli NotebookLM dosahuje v citaci mnohem lepších výsledků než ChatGPT nebo Gemini, je těžké uvěřit, že byl vytvořen speciálně pro tuto funkci a stále dosahuje míry chyb, která by většině novinářů, výzkumníků nebo právníků způsobila problémy s opakujícími se případy.<p Navíc NotebookLM, který se prezentuje jako výzkumný rámec, postrádá mnoho uživatelsky přívětivých vylepšení, která usnadňují psaní z ostatních dvou platforem. Navíc se zdá, že NotebookLM alespoň skutečně čte nahrané dokumenty, spíše než aby upadl do neuvěřitelně destruktivního zvyku ChatGPT hádat, co by nahraný dokument mohl říkat, na základě toho, co ví o obecném rozvržení podobných dokumentů. Může být obtížné přimět jakoukoli verzi ChatGPT, aby provedla fulltextové čtení nahraného materiálu, spíše než aby se spoléhala na metadata nebo vlastní předpoklady/halucinace. V oblastech, kde jsou standardy prověřování a citace kritické, jako je právo, žurnalistika a vědecký výzkum, se zdá, žeže MCP nastavení neexistují žádné zařízení na trhu, která by mohla zlepšit jejich omezenou kapacitu pro přesnou extrakci a manipulaci s informacemi, které uživatelé směrují. nativně trénované Jak tomu je, a v očekávání příjezdu pomocných systémů, které mohou nabídnout lepší rozhraní pro LLM než pouhý systémový podnět nebo , vše, co tytosystémy vydávají pro tyto kritické sektory, stále vyžaduje kontrolu těmi drahými, neohrabanými a obecně otravnými lidmi. * Google Cloud nabízí docela zajímavý a komplexní přehled této problematiky zde . † Moje konverzeinline
citací autorů na hypertextové odkazy. Poprvé zveřejněno ve středu
1. října 2025. Opraveno ve čtvrtek 2. října, aby se opravila chyba v TL: DR a stylistická chyba v prvním odstavci.












