Kąt Andersona
ChatGPT-5 i Gemini 2.5 halucynują w 40% testowanych zapytań redakcyjnych

Nowe badanie wykazało, że ChatGPT-5 i Google Gemini produkują halucynacje w 40% zapytań w stylu redakcyjnym, często wymyślając brzmiące pewnie twierdzenia niepoparte przez weryfikowalne fakty. Google NotebookLM radzi sobie lepiej, z wynikiem 13% – poziomem, który i tak byłby wystarczający, aby zwolnić każdego dziennikarza na świecie. Badanie wykazało, że modele często zniekształcały źródła, zamieniając opinie w fakty i usuwając atrybucję, co sprawia, że są to ryzykowne narzędzia dla dziennikarstwa. Autorzy apelują o lepsze, dedykowane narzędzia do tych zadań.
Duże modele językowe zostały szybko wdrożone w dziennikarstwie w ostatnich czasach, w środowiskach pracy, które i tak cięły koszty, budżety i personel od czasu, gdy dziennikarstwo cyfrowe zrujnowało dwieście lat tradycji w nieubłaganych procesach, które rozpoczęły się na początku lat 2000.
W rzeczywistości teren był już przygotowany, ponieważ media przyzwyczaiły się do cięć pracy poprzez “innowacje” od co najmniej burzliwego wprowadzenia składu cyfrowego w latach 80., a także wcześniejszych wyzwań ze strony rozgłośni radiowych i telewizji.
Bezustanne wprowadzanie AI do redakcji i mediów nie było pozbawione potknięć; w kontekście, w którym 55% firm obecnie żałuje zastępowania ludzi przez AI, a Gartner przewiduje, że organizacje znacznie ograniczą swoje plany wdrożenia AI w ciągu dwóch lat, wiele organizacji medialnych zatrudniło ponownie dziennikarzy zastąpionych przez AI, ponieważ poważne i często wstydliwe słabości alternatyw opartych na uczeniu maszynowym stały się widoczne.
Błąd nie jest tylko ludzki
Chociaż halucynacje okazały się ogromnym problemem dla dziedzin, w których dokładne cytowanie jest niezbędne (zgodnie z zainteresowaniem publicznym w przypadku niepowodzeń AI w sektorach prawa, badań i dziennikarstwa), nowe amerykańskie badanie wykazało, że modele językowe w dziennikarstwie stają w obliczu szerszych wyzwań, niż się spodziewano.
Badacze ocenili ChatGPT, Google Gemini oraz NotebookLM w zadaniu raportowania: korzystając z korpusu 300 dokumentów dotyczących sporu sądowego i polityki TikToka w Stanach Zjednoczonych.
Badacze zmieniali szczegółowość promtu i liczbę dokumentów dostarczonych, a następnie analizowali wyniki przy użyciu taksonomii zaprojektowanej w celu przechwycenia typu i ciężkości halucynacji.
Wszystkie dane wyjściowe zawierały co najmniej jedną halucynację, podczas gdy ChatGPT i Gemini wykazywały 40% wskaźnik halucynacji – trochę ponad trzykrotnie wyższy niż 13% wskaźnik błędu NotebookLM.
Badacze zauważają, że interpretacyjna pewność siebie była bardziej powszechna niż wymyślanie faktów lub jednostek; modele często wykazywały interpretacyjną pewność siebie, dodając niepoparte charakterystyki i przekształcając przypisane opinie w ogólne stwierdzenia:
‘Jakościowo, większość błędów nie polegała na wymyślaniu jednostek lub liczb; zamiast tego obserwowaliśmy pewność siebie modeli – dodawali niepoparte charakterystyki źródeł i przekształcali przypisane opinie w ogólne stwierdzenia.
‘Te wzorce ujawniają fundamentalną niezgodność epistemologiczną: Podczas gdy dziennikarstwo wymaga jawnej atrybucji dla każdego twierdzenia, LLM generują autorytatywnie brzmiący tekst niezależnie od wsparcia dowodowego.
‘Proponujemy rozszerzenia istniejących taksonomii halucynacji dla dziennikarstwa i argumentujemy, że skuteczne narzędzia redakcyjne wymagają architektur, które egzekwują dokładną atrybucję, a nie optymalizują płynność.’
Nowe badanie, fascynujące, ale krótkie, liczące pięć stron, nosi tytuł Nie błędne, ale nieprawdziwe: Nadpewność LLM w zapytaniach opartych na dokumentach i pochodzi od trzech badaczy z Northwestern University i University of Minnesota.
Teoria i metoda
Dokładna przyczyna halucynacji jest sporna; chociaż niemal wszystkie teorie zgadzają się, że jakość danych i/lub ich rozkład są czynnikiem przyczyniającym się w czasie szkolenia, zostało nawet zaproponowane, że 100% danych wyjściowych LLM jest podstawowo halucynacją (z wyjątkiem tych halucynacji, które zbiegają się z rzeczywistością).
Badacze obserwują†:
‘Z technicznego punktu widzenia halucynacje pojawiają się z możliwości LLM do generowania tekstu, który podąża za powszechnymi wzorcami bez posiadania zrozumienia tego, co jest prawdą. Ta cecha powoduje wiarygodnie brzmiące odpowiedzi, które nie odzwierciedlają rzeczywistości – na przykład LLM-wymyślone orzecznictwo, które trafia do argumentów.
‘I chociaż możliwości LLM znacznie wzrosły w ciągu ostatnich pięciu lat, halucynacje pozostają problemem, w niektórych przypadkach nawet zwiększając się wraz ze wzrostem możliwości modeli.
Badanie sektora obserwuje, że istnieje wiele sposobów, aby zmniejszyć lub lepiej zrozumieć halucynacje LLM, które zwykle dzielą się na trzy główne obszary: Po pierwsze, kontekst, modele mogą być ugruntowane w zewnętrznych źródłach, takich jak bazy danych, kolekcje dokumentów lub treści internetowe, aby wesprzeć swoje twierdzenia.
To działa dobrze, gdy materiał jest wiarygodny i kompletny, ale luki, nieaktualna informacja lub niska jakość danych nadal powodują błędy; a modele mają również tendencję do robienia pewnych stwierdzeń, które wykraczają poza to, co źródła naprawdę mówią.
Po drugie, promowanie i dekodowanie odnosi się do użycia starannych instrukcji, aby prowadzić modele. Może to obejmować prośbę do modeli, aby sprawdziły swoje dowody, podzielić zadania na mniejsze kroki lub postępować według ściślejszych formatów. Czasami modele są nawet nakierowane na przeglądanie własnej pracy lub porównywanie wielu odpowiedzi.
Te techniki mogą złapać błędy, ale również zwiększają koszty i często nie są w stanie wykryć subtelnych błędów; dlatego bez wiarygodnego sprawdzania dowodów, większość ciężaru weryfikacji nadal spoczywa na użytkowniku.
Po trzecie, modele i narzędzia odnoszą się do udostępnienia LLM dostępu do zasobów, które mogą wspierać weryfikację, takich jak wyszukiwarki lub kalkulatory – chociaż dokładność może również poprawić się, gdy modele są szkolone na dobrze udokumentowanych danych lub gdy funkcje cytowania są wbudowane.
Jednak te środki nie są niezawodne i nadal polegają na jakości źródeł, jasności wytycznych i nadzoru ludzkiego, aby zapobiec rozpowszechnianiu się fałszywych informacji.
TikTok
Aby dowiedzieć się, które podejścia mogą być naprawdę przydatne dla dziennikarzy, badanie przeprowadziło oceny, które odzwierciedlały rzeczywiste przepływy pracy i standardy redakcyjne, z halucynacjami badanymi w kontekście typowych zadań raportowania.
Modele frontierowe zostały przetestowane przy użyciu wspólnych strategii promowania i ustawień podstawy dokumentów, tak aby można było zmierzyć częstotliwość i typ błędów halucynacji – wraz z tym, co te błędy naprawdę oznaczają dla integracji AI w redakcjach.
Analiza koncentrowała się na rodzaju zapytań opartych na dokumentach, typowych w dziennikarstwie badawczym i śledczym. Badacze starali się skompilować korpus, który miałby odzwierciedlać typowy projekt redakcyjny o średniej wielkości, ale który byłby wystarczająco duży, aby uchwycić złożoność rzeczywistych zadań raportowania; w tym celu wybrali trwające starania prawne, aby zakazać TikToka w Stanach Zjednoczonych.
Dokumenty zostały zebrane z Washington Post, New York Times, ProQuest i Westlaw, w wyniku czego powstał zbiór 300 dokumentów, składający się z pięciu prac akademickich, 150 artykułów prasowych i 145 dokumentów sądowych (z pełną kompilacją dostępną dla badaczy akademickich na żądanie przez repozytorium projektu).
Ponieważ odpowiedzi LLM zależą silnie od sposobu sformułowania promtu i od ilości kontekstu dostarczonego, badacze zaprojektowali pięć zapytań, od bardzo ogólnych do bardzo szczegółowych – od ogólnych pytań o zakazy TikToka po szczegółowe prompty, które proszą o zeznania ze specyficznych spraw sądowych.
Liczba dokumentów dostarczonych do każdego modelu została zmieniona na 10, 100 lub wszystkie 300 z pełnego korpusu, z dwoma kluczowymi dokumentami włączonymi do każdej próbki, aby zapewnić spójność. Piętnaście odpowiedzi zostało wygenerowanych dla każdego modelu, z wyjątkiem ChatGPT, który został ograniczony do dziesięciu odpowiedzi.
Konkurenci
Trzy narzędzia zostały przetestowane, każde reprezentujące inne podejście do zapytań opartych na dokumentach: ChatGPT-5 został oceniony przy użyciu funkcji Projects, która ograniczała przesyłanie dokumentów do 100; Google Gemini 2.5 Pro mógł przetworzyć pełny korpus 300 dokumentów w kontekście (korzystając z okna kontekstowego o jednym milionie tokenów, aby bezpośrednio przetworzyć wszystkie 923 000 tokenów); Google NotebookLM, który oferuje wbudowaną funkcję cytowania, został przetestowany przy użyciu dedykowanych notesów dla każdej próbki.
Chociaż te metody obsługi dokumentów się różnią, wszystkie trzy reprezentują prawdziwe narzędzia dostępne dla dziennikarzy; a w każdym razie stan sztuki jest obecnie bardziej eksperymentalny niż jednorodny, z funkcjonalnością i zakresem nieuniknienie różniącymi się wśród obecnych ofert.
Aby uchwycić zakres możliwych zachowań halucynacji, zastosowano taksonomię z poprzedniej pracy z 2023 roku, z halucynacjami zakodowanymi według orientacji (zniekształcenie vs. elaboracja); kategorii (typ błędu); i stopnia (ciężkość oceniana jako łagodna, umiarkowana lub alarmująca).
Wszystkie dane wyjściowe modeli zostały opatrzonych adnotacjami przez jednego autora, który przeglądał każde zdanie i stosował te kody. Błędy nieobjęte taksonomią zostały oznaczone jako rozmaite i później przeanalizowane w celu opracowania kategorii specyficznych dla dziennikarstwa.
Dane i testy
W początkowym teście halucynacji, 12 z 40 odpowiedzi modelu zawierało co najmniej jedną halucynację, przy czym zaobserwowano znaczną zmienność między narzędziami. ChatGPT i Gemini wygenerowały halucynacje w 40% swoich danych wyjściowych, podczas gdy NotebookLM wygenerował halucynacje w zaledwie 13% przypadków:

Ogólne wskaźniki halucynacji dla każdego narzędzia, z Gemini i ChatGPT produkującymi najwyższy odsetek odpowiedzi zawierających błędy. Źródło: https://arxiv.org/pdf/2509.25498
Z tych wyników badacze komentują:
‘To wskazuje, że chociaż większość odpowiedzi we wszystkich narzędziach nie zawiera halucynacji, wybór narzędzia ma znaczenie dla tego samego korpusu dokumentów i zestawu zapytań.’
Halucynacje rzadko występują w izolacji; Gemini średnio cztery na odpowiedź, NotebookLM trzy, a ChatGPT 1,5. Większość była umiarkowana pod względem ciężkości, ale 14% zostało sklasyfikowanych jako alarmujące. W jednym przypadku ChatGPT wymyślił motyw odwetowy za zakaz TikToka, który nie pojawił się w źródle:
‘[W] jednym z zapytań ChatGPT scharakteryzował potencjalny zakaz TikToka jako środek odwetowy podejmowany przez amerykańskich ustawodawców w odpowiedzi na chińską politykę, twierdzenie, które w ogóle nie występuje w cytowanym dokumencie źródłowym.’
Ogółem 64% odpowiedzi z halucynacjami wprowadzało nieprawidłowości faktograficzne lub dygresje, co potencjalnie podnosi pytania, czy korzystanie z LLM faktycznie zaoszczędza czas w tym rodzaju przepływie pracy opartym na informacjach, przynajmniej na obecnym etapie rozwoju.
W tym pierwszym teście większość halucynacji nie pasowała do istniejących kategorii taksonomicznych, często obejmując sfabrykowane cytaty lub nieprawidłowe rozszerzenia skrótów, co sugeruje, że obecne ramy mogą być zbyt wąskie dla przypadków użycia w dziennikarstwie.
Nota książkowa NotebookLM, obserwują badacze, wskazuje, że jego system RAG oparty na cytowaniu zapewnia bardziej niezawodne ugruntowanie niż funkcja Projektów ChatGPT lub przetwarzanie kontekstowe Gemini, zwłaszcza w przypadku, gdy konieczne jest odniesienie do konkretnych dokumentów.
W odniesieniu do badania cech jakościowych obserwowanych halucynacji w wynikach testowych, badacze zauważają, że halucynacje wynikały nie tyle z wymyślonych faktów, co z przekroczenia interpretacyjnego:
‘Modele dodawały pewne charakterystyki dotyczące celów dokumentu, odbiorców i intencji mówców, które brzmiały autorytatywnie, ale nie miały podstawy w samym tekście. Przekształcały stwierdzenia przypisane w stwierdzenia o charakterze faktów.’
Pewność siebie przejawiała się na dwa sposoby: Po pierwsze, modele dodawały niepoparte twierdzenia o celu dokumentu, takie jak oznaczenie artykułu jako “napisanego dla publiczności” lub dokumentu sądowego jako “skierowanego do prawników”.
Po drugie, przekształcały przypisane opinie na stwierdzenia podobne do faktów, zacierając oryginalne źródło i podważając ocenę źródła.
Te zachowania występowały we wszystkich narzędziach i nie były ograniczone do jednej architektury – a większość błędów nie była wymyślona, ale raczej przekroczeniem interpretacyjnym.
Większość halucynacji została oznaczona jako rozmaite, ponieważ nie pasowały do istniejących kategorii, zacierając kluczowe różnice między typami błędów. Częste problemy, takie jak brak atrybucji i niejasne opisy źródeł, sugerują, że obecne taksonomie pomijają rodzaje błędów, które mają największe znaczenie w dziennikarstwie, gdzie jasna atrybucja jest niezbędna.
Badacze zauważają, że ‘Modele dodają pewną analizę, której dokumenty nie wspierają, i usuwają kluczową atrybucję.’
Wnioski
Ktokolwiek, kto eksperymentował z trzema modelami badanymi w nowym artykule, wie, że każdy z nich ma słabości i zalety. Chociaż NotebookLM radzi sobie znacznie lepiej w cytowaniu niż ChatGPT lub Gemini, można by uznać, że został on zbudowany specjalnie z tej funkcjonalności i nadal dostarcza wskaźnik błędu, który byłby wystarczający, aby zwolnić większość dziennikarzy, badaczy lub prawników, z wielokrotnymi przypadkami.
Ponadto NotebookLM, pozycjonując się jako ramy badawcze, brakuje wielu udogodnień UX, które sprawiają, że inne dwie platformy są łatwiejszym doświadczeniem pisarskim.
Jednakże, przynajmniej NotebookLM wydaje się naprawdę czytać przesłane dokumenty, zamiast popadać w niszczycielski zwyczaj ChatGPT, który inferuje, co dokument przesłany może powiedzieć, opierając się na tym, co wie o ogólnym rozkładzie podobnych dokumentów. Może to być bardzo trudne, aby każdą wersję ChatGPT przekonać do pełnego odczytu przesłanego materiału, zamiast polegania na metadanych lub własnych założeniach/halucynacjach.
Dla dziedzin, w których pochodzenie i standardy cytowania są krytyczne, takie jak prawo, dziennikarstwo i badania naukowe, wydaje się, że nie ma wrodzonych ulepszeń w obecnych czołowych LLM, które mogłyby poprawić ich ograniczoną zdolność do dokładnego wyodrębniania i radzenia sobie z informacjami, które użytkownik kieruje do nich.
W obecnej sytuacji i w oczekiwaniu na przyjście systemów pomocniczych, które mogą zapewnić lepszy interfejs do LLM niż zwykły systemowy promt lub ustawienie MCP, wszystko, co te systemy generują dla tych sektorów o wysokiej randze, nadal wymaga sprawdzenia przez te drogie, niewygodne i ogólnie kłopotliwe ludzi.
* Google Cloud oferuje interesujący i wyczerpujący opis na ten temat tutaj.
† Moja konwersja cytowań w tekście autorów na odnośniki.
Pierwotnie opublikowane w środę, 1 października 2025. Zmienione w czwartek, 2 października, w celu poprawienia błędu w TL;DR i usunięcia błędu stylistycznego w pierwszym akapicie.












