Взгляд Anderson

ChatGPT-5 и Gemini 2.5 генерируют вымысел в 40% тестируемых запросов в редакции

mm
Добавьте Unite.AI в избранные источники в Google
A robot journalist in a retro newsroom. SDXL, Flux Kontext Pro, Firefly 3, et al.

Новое исследование показало, что ChatGPT-5 и Google Gemini генерируют вымысел в 40% запросов в стиле редакции, часто изобретая уверенно звучащие утверждения, не подтвержденные проверяемыми фактами. Google NotebookLM показал лучший результат, с показателем только 13% – уровнем, который все равно стоил бы любому журналисту в мире работы. Исследование показало, что модели часто искажали источники, превращая мнения в факты и удаляя атрибуцию, что делает их рискованными инструментами для журналистики. Авторы призывают к созданию лучших, специализированных инструментов для этих задач.

 

Большие языковые модели быстро вошли в журналистику в последнее время, в условиях сокращения затрат, бюджета и штата с момента, когда цифровая журналистика разрушила двухвековую традицию в неизбежном процессе, начавшемся в начале 2000-х годов.

Фактически, почва уже была готова, поскольку СМИ привыкли сокращать штат через “инновации” с момента бурного введения цифровой верстки в 1980-х годах, а также ранее挑али радио и телевидение.

Неумолимый путь ИИ в редакции и СМИ не обошелся без неудач, однако; в контексте, где 55% компаний теперь сожалеют о замене людей на ИИ, и где Gartner предсказывает, что организации сильно сократят свои планы по внедрению ИИ в течение двух лет, ряд СМИ вернули на работу журналистов, замененных ИИ, поскольку серьезные и часто смущающие недостатки альтернатив на основе машинного обучения стали очевидными.

Ошибка не только человеческая

Хотя вымысел стал огромной проблемой для областей, где точная цитата имеет решающее значение (с заметным общественным вниманием к случаям неудач ИИ в правовой, исследовательской и журналистской сферах), новое американское исследование показало, что машинное обучение в журналистике сталкивается с более широкими проблемами, чем ожидалось.

Исследование оценило ChatGPT, Google Gemini и более цитатно-ориентированный NotebookLM на задаче в стиле репортажа: использование корпуса из 300 документов, сосредоточенного на судебных разбирательствах и политике TikTok в США.

Исследователи варьировали специфику подсказки и количество предоставленных документов, затем анализировали результаты с помощью таксономии, предназначенной для захвата типа и тяжести вымысла.

Во всех выходных данных 30% содержали хотя бы один вымысел, в то время как ChatGPT и Gemini каждый показали 40% уровень вымысла – немного более трех раз выше, чем уровень ошибок NotebookLM, составляющий 13%.

Вместо того, чтобы изобретать факты или сущности, исследователи отметили, что модели часто демонстрировали интерпретативную самоуверенность, добавляя необоснованные характеристики и превращая атрибутированные мнения в общее утверждение:

‘Качественно, большинство ошибок не涉ивали изобретение сущностей или чисел; вместо этого мы наблюдали интерпретативную самоуверенность – модели добавляли необоснованные характеристики источников и превращали атрибутированные мнения в общее утверждение.’

‘Эти закономерности раскрывают фундаментальное эпистемологическое несоответствие: в то время как журналистика требует явной атрибуции для каждого утверждения, модели LLM генерируют авторитетно звучащий текст, независимо от доказательной поддержки.’

‘Мы предлагаем журналистские расширения существующих таксономий вымысла и утверждаем, что эффективные инструменты для редакции нуждаются в архитектурах, которые обеспечивают точную атрибуцию, а не оптимизируют для плавности.’

Новое исследование, fasciniruyuschaya, но краткая статья на пять страниц, озаглавленная Не неправильно, но не правда: самоуверенность LLM в запросах на основе документов, и исходит от трех исследователей из Northwestern University и University of Minnesota.

Теория и метод

Точная причина вымысла оспаривается в различные времена; хотя почти все теории согласны, что качество данных и/или распределения являются вкладывающим фактором на этапе обучения, даже было предложено, что 100% выходных данных LLM по сути является вымыслом (за исключением того, что некоторые из этих вымыслов совпадают с реальностью).

Авторы наблюдают:

‘С технической точки зрения, вымысел возникает из способности LLM генерировать текст, следующий общим закономерностям, не обладая пониманием того, что является истинным. Это характеристика приводит к правдоподобно звучащим ответам, которые не отражают реальность – например, LLM-изобретенная судебная практика, которая попадает в аргументы.’

‘И хотя возможности LLM увеличились значительно за последние пять лет, вымысел остается проблемой, в некоторых случаях даже увеличиваясь, когда модели становятся более мощными.’

Сектор исследований, как отмечает статья, изучил ряд способов уменьшить или лучше понять вымысел LLM, которые обычно делятся на три основные области: во-первых, в контексте, модели могут быть основаны на внешних источниках, таких как базы данных, коллекции документов или веб-контент, для подтверждения своих утверждений.

Это работает хорошо, когда материал надежен и полон, но пробелы, устаревшая информация или плохое качество данных все равно вызывают ошибки; и модели также имеют привычку делать уверенные заявления, которые выходят за рамки того, что источники на самом деле говорят.

Во-вторых, промптинг и декодирование относится к использованию тщательных инструкций для руководства моделями. Это может включать в себя запрос к моделям проверить их доказательства, разбить задачи на более мелкие шаги или следовать более строгим форматам. Иногда модели даже направляются на проверку своей собственной работы или сравнение нескольких ответов.

Эти методы могут поймать ошибки, но они также увеличивают затраты, и они часто не могут обнаружить тонкие ошибки; поэтому без надежной проверки фактов большая часть бремени верификации все еще лежит на пользователе.

В-третьих, модели и инструменты относится к предоставлению LLM доступа к ресурсам, которые могут поддержать верификацию, таким как поисковые системы или калькуляторы – хотя точность также может улучшиться, когда модели обучаются на хорошо источниках данных или когда функции цитирования встроены.

Однако эти меры не являются безошибочными и все равно полагаются на качество источников, ясность руководств и человеческий надзор, чтобы предотвратить распространение ложной информации.

Tik Tok

Чтобы узнать, какие подходы могут быть действительно полезными для журналистов, исследование провело оценки, предназначенные для отражения реальных рабочих процессов редакции и стандартов, с вымыслом, изученным в контексте типичных задач репортажа.

Фронтовые модели были протестированы с помощью общих стратегий промптинга и настроек документной основы, чтобы измерить частоту и тип ошибок вымысла, а также то, что эти ошибки на самом деле означают для интеграции ИИ в редакцию.

Анализ был сосредоточен на типе документно-ориентированного запроса, типичном для исследовательской и расследовательской журналистики. Авторы стремились создать корпус, предназначенный для отражения типичного проекта небольшой или средней редакции, но который все равно будет достаточно большим, чтобы захватить сложность реальной журналистики; для этого они выбрали продолжающиеся юридические усилия по запрету TikTok в США.

Документы были собраны из Washington Post, New York Times, ProQuest и Westlaw, в результате чего получился корпус из 300 документов, включающий пять академических статей, 150 новостных статей и 145 юридических документов (с полной компиляцией, доступной для запроса академических исследователей через репозиторий проекта).

Поскольку ответы LLM сильно зависят от того, как сформулирована подсказка, и сколько контекста предоставлено, авторы разработали пять запросов, варьирующихся от очень широких до очень конкретных – от общих вопросов о запрете TikTok до подробных подсказок, запрашивающих показания из конкретных судебных дел.

Количество документов, предоставленных каждой модели, варьировалось от 10 до 100, или всех 300 из полного корпуса, с двумя ключевыми документами, включенными в каждую выборку, чтобы обеспечить последовательность. Было сгенерировано 15 ответов для каждой модели, за исключением ChatGPT, который был ограничен 10 ответами.

Претенденты

Три инструмента были протестированы, каждый отражающий разный подход к документно-ориентированному запросу: ChatGPT-5 был оценен с помощью функции Projects, которая ограничивала загрузку до 100 документов; Google Gemini 2.5 Pro смог обработать полный корпус из 300 документов в контексте (используя свое окно контекста из одного миллиона токенов для прямого потребления всех 923 000 токенов); Google NotebookLM, который предлагает встроенную функцию извлечения цитат, был протестирован с помощью специальных тетрадей для каждой выборки.

Хотя эти методы обработки документов различаются, все три представляют собой реальные инструменты, в настоящее время доступные журналистам; и в любом случае, текущее состояние дел более экспериментальное, чем однородное, с функциональным паритетом и объемом, которые неизбежно различаются среди текущих предложений.

Для захвата диапазона возможного поведения вымысла была использована таксономия из предыдущей работы 2023 года, с вымыслом, закодированным по ориентации (искажение против эLABORации); категории (тип ошибки); и степени (тяжести, оцененной как легкая, умеренная или тревожная).

Все выходные данные моделей были аннотированы одним человеческим автором, который просмотрел каждое предложение и применил эти коды. Ошибки, не покрытые таксономией, были помечены как разное, и позже проанализированы для разработки журналистских категорий.

Данные и тесты

В первоначальном тесте на распространенность вымысла 12 из 40 ответов моделей были найдены содержащими хотя бы один вымысел, с заметным варьированием между инструментами. ChatGPT и Gemini каждый произвели вымысел в 40% своих выходных данных, в то время как NotebookLM произвел вымысел в 13% случаев:

Из этих результатов авторы комментируют:

‘Это указывает на то, что, хотя большинство ответов во всех инструментах не содержат вымысла, выбор инструмента действительно имеет значение для одного и того же корпуса документов и набора запросов.’

Вымысел редко возникает в изоляции, отмечает статья; Gemini в среднем четыре на ошибочный ответ, NotebookLM три, и ChatGPT 1,5. Большинство были умеренными по тяжести, но 14% были классифицированы как тревожные. В одном случае ChatGPT изобрел мотив мести за запрет TikTok, который не появлялся в источнике:

‘[В] одном запросе ChatGPT сформулировал потенциальный запрет TikTok как меру ответа со стороны американских законодателей в ответ на китайскую политику, утверждение, полностью отсутствующее в цитируемом источнике.’

В целом 64% ответов с вымыслом вводили фактические неточности или побочные пути, потенциально вызывая вопросы о том, действительно ли использование LLM экономит время в этом типе информационного рабочего процесса, по крайней мере на текущем уровне развития.

В этом первоначальном тесте большинство вымыслов не соответствовали существующим категориям таксономии, часто включающим фабрикованные цитаты или неправильные расширения аббревиатур, что предполагает, что текущие рамки могут быть слишком узкими для случаев использования журналистики.

Более низкий уровень вымысла NotebookLM, отмечают авторы, предполагает, что его система RAG обеспечивает более надежную основу, чем функция Projects ChatGPT или обработка в контексте Gemini, особенно когда необходимо ссылаться на конкретные документы.

Что касается исследования качественных характеристик наблюдаемого вымысла в тестовых результатах, исследователи наблюдают, что вымысел возник не в первую очередь из изобретенных фактов, а из интерпретативного превышения:

‘Модели добавили уверенные характеристики о целях документов, аудитории и намерениях говорящего, которые казались авторитетными, но не имели никакой основы в фактическом тексте. Они превратили осторожные или атрибутированные утверждения в определенные утверждения.’

Самоуверенность приняла две формы: во-первых, модели добавили необоснованные утверждения об аудитории или цели документа, такие как маркировка статьи как ‘написанной для общественности’ или судебного документа как ‘направленного на юристов’.

Во-вторых, они преобразовали атрибутированные мнения в утверждения, похожие на факты, скрывая исходный источник и подрывая оценку источника.

Эти поведения появлялись во всех инструментах и не были ограничены одной архитектурой – и большинство ошибок не были фабрикациями, а скорее переинтерпретациями.

Большинство вымыслов были помечены как разное, потому что они не соответствовали существующим категориям, стирая ключевые различия между типами ошибок. Частые проблемы, такие как отсутствие атрибуции и расплывчатые описания источников, предполагают, что текущие таксономии пропускают типы ошибок, которые имеют наибольшее значение в журналистике, где ясная атрибуция является необходимой.

Авторы наблюдают, что ‘Модели добавляют уверенный анализ, которого документы не поддерживают, и удаляют важную атрибуцию.’

Заключение

Кто бы ни экспериментировал с тремя моделями, изученными в новой статье, знает, что каждая из них имеет свои слабости и сильные стороны. Хотя NotebookLM работает намного лучше, чем ChatGPT или Gemini, в плане цитирования, можно считать, что он был построен специально для этой функциональности и все равно имеет уровень ошибок, который стоил бы большинству журналистов, исследователей или юристов работы, с повторяющимися инцидентами.

Кроме того, NotebookLM, позиционирующий себя как исследовательская платформа, лишен многих усовершенствований UX, которые делают другие две платформы более удобным опытом письма.

Однако, по крайней мере, NotebookLM, кажется, действительно читает загруженные документы, вместо того, чтобы падать в разрушительную привычку ChatGPT делать полный текстовый просмотр загруженного материала, а не полагаться на метаданные или свои собственные предположения/вымысел. Это может быть трудной задачей, чтобы заставить любую версию ChatGPT сделать полный текстовый просмотр загруженного материала, вместо того, чтобы полагаться на метаданные или свои собственные предположения/вымысел.

Для областей, где происхождение и стандарты цитирования имеют решающее значение, такие как право, журналистика и научные исследования, кажется, что в настоящее время нет родных возможностей в текущих ведущих LLM, которые могли бы улучшить их ограниченную способность точно извлекать и работать с информацией, которую пользователь направляет им.

Как оно стоит, и в ожидании прибытия вспомогательных систем, которые могут предложить лучший интерфейс к LLM, чем простая системная подсказка или настройка MCP, все, что эти системы выводят для этих критически важных секторов, все равно требует проверки теми дорогими, неуклюжими и, в общем, надоедливыми людьми.

 

* Google Cloud предлагает вполне интересный и всесторонний обзор этой темы здесь.

Мое преобразование встроенных цитат авторов в гиперссылки.

Опубликовано впервые в среду, 1 октября 2025 года. Исправлено в четверг, 2 октября, для исправления ошибки в TL:DR и внесения стилистической ошибки в первом абзаце.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai