Взгляд Anderson

Может ли ИИ развить нос для новостей?

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-1.5) featuring a dog journalist in a photorealistic newsroom, who has spotted a lead, and attracted the attention of his co-workers.

ИИ становится лучше в написании новостных статей, но не становится намного лучше в определении их.

 

Мнение За пять лет с тех пор, как я в последний раз рассмотрел способность ИИ находить горячую новостную историю, ландшафт изменился значительно, с увеличением уровня ИИ-автоматизации, сопровождаемого неизбежными растущими болями и скандалами.

Недавно, в отчете WSJ о плодовитом, ИИ-усиленном Fortune.contributor представил журналиста будущего как освобожденного от скучной работы, такой как транслитерация пресс-релизов, оставив ему возможность писать статьи и делать раскопки, которые обычно только более крупные издания могут позволить себе.

Но что мы слышим гораздо реже, это способность ИИ выявить новостную историю.

Подавление шума

В статье 2021 года я сосредоточился на писателях, освещающих научную тему, поскольку это то, где я провожу большую часть своего времени; и, возможно, самым большим эффектом, который новая революция ИИ оказала на это, является то, что она создала неконтролируемую снежную бурю ИИ-усиленных научных статей, повышая соотношение сигнал-шум до такой степени, что даже освещение Arxiv ИИ-связанных доменов всесторонне теперь выходит за рамки возможностей одного человека.

Конечно, это именно то, где ИИ преуспевает – в итерации через огромные массивы данных, которые люди не могут решить, чтобы найти ‘аутсайдеров’ (которые мы рассмотрим позже) за секунды, которые заняли бы у людей дни, если бы они могли это сделать.

Почему, тогда, ИИ все еще так плох в определении горячей новостной истории из тысяч, даже десятков тысяч, ежедневных претендентов?

ИИ, смотрящий назад

Это массивное распространение ИИ-генерируемого контента происходит далеко за пределами академического сектора, который я обсуждал ранее. В конце прошлого года было оценено, что половина всего нового письма в Интернете написана ИИ, с еще большим ускорением этой тенденции, как полагают. Следовательно, шум оглушает везде, не только в академии.

Хотя был некоторый прогресс в ИИ/алгоритмическом определении ‘горячей’ истории за последние несколько лет, эти системы склонны концентрироваться на стратифицированных и предсказуемо-организованных потоках данных, что означает, что они могут работать только в довольно хрупком контексте.

В этом отношении постдокторант Стэнфорда и бывший журналист New York Times Александр Спангер сделал несколько попыток определить ‘новостность’ в терминах, которые можно применить к процессам машинного обучения и статистическому анализу; и представил доказательства автоматизированного генерации лидов в корпорах таких как судебные документы, государственные законопроекты и заседания городского совета, а также общедоступные документы – тот вид схемо-ориентированного вывода, который сценарист Fortune может превратить в 6-7 новостных статей в день:

Тепло распределения слов, полученное из корпораций общественных документов. В этом случае мы видим, что 'авторизация' имеет высокий балл, возможно, потому что она представляет решение, изменение и новизну. Источник - https://arxiv.org/pdf/2311.09734

Тепло распределения слов, полученное из корпораций общественных документов. В этом случае мы видим, что ‘авторизация’ имеет высокий балл, возможно, потому что она представляет решение, изменение и новизну. Источник

Однако проблема с подходами, такими как предложение Спангера 2023 года отслеживание новостности общественных документов, заключается в том, что они, как обычно для ИИ, концентрируются на наблюдаемых тенденциях в данных. Другими словами, они наблюдают за тем, что делало хорошую новость раньше, и продолжают искать еще больше одного и того же.

В реальном мире неожиданные источники почти всегда оказываются ‘одноразовым чудом’; и для того, насколько они были неизвестны, никто не мог предсказать их внезапную известность. Затем, после того, как они были полезны один раз, и несмотря на периодические попытки воспользоваться мимолетной славой/известностью, они обычно никогда не произведут ничего полезного снова.

Знак времени

Следовательно, поскольку мониторинг этого вида одного и законченного новостного источника обычно только добавляет больше шума в общую снежную бурю, не может ли ИИ вместо этого определить сигналы источника, который однажды станет плодотворным? Если можно узнать, какой тип источника может в конечном итоге дать новость, можно сосредоточиться на его характеристиках rather, чем на его контексте или методах.

По этой логике можно сделать вывод из откровений Эдварда Сноудена 2010-х годов, что любой, кто недавно покинул службу в ЦРУ (или похожей организации), будет стоить того, чтобы следить за ним как за потенциальным источником будущего откровения.

Однако нет RSS-лент или API, которые, скорее всего, смогут автоматизировать этот вид постоянного мониторинга, поскольку LinkedIn и многие другие когда-то открытые источники данных отступают перед лицом жадных и нарушающих закон ИИ-веб-скрейперов. Даже если бы они были, частота была бы проблемой, потому что вы не можете опросить API или сайт каждые пять секунд; помимо стоимости ресурсов, ответы IP-бана от платформ сделали бы это неустойчивой деятельностью.

Кроме того, есть явно ‘человеческий аспект’ таких раскрытий, который трудно автоматизировать.

Сбор новостей с личным подходом: кадр с дискового релиза фильма Алана Пакулы 'Все люди президента', в котором информатор выходит из тени. Источник - https://blueprintreview.co.uk/2016/11/all-the-presidents-men/

Сбор новостей с личным подходом: кадр с дискового релиза фильма Алана Пакулы ‘Все люди президента’, в котором информатор выходит из тени. Источник

Также в реальном мире очень трудно определить определяющие характеристики будущего источника новостей. Это, вероятно, не ‘люди, которые недавно покинули ЦРУ’, и это определенно не определяется протоколом: платформы, такие как X или GitHub, производят слишком много сигнала сами по себе, и даже сужение поиска на поисковые термины или категории постов не делает большого различия – только если вы участвуете в проблеме и взаимодействуете с сообществом (или репозиторием и т. д.), вы действительно, скорее всего, распознаете значение развития.

Даже термин такой как ‘предупреждение о безопасности’ не может контекстуализировать истинную серьезность или новостность инцидента, поскольку ссылки такого рода разбрасываются ежедневно, тысячами, в таких сообществах – и даже если вы ограничите этот вид мониторинга только английским языком, потенциальные вариации идиом, вместе с использованием косвенного языка, сделали бы очень трудным парсинг ‘в дикой природе’ поста в истинное новостное предупреждение.

Узкий путь

Текущая куча ИИ-усиленных систем обнаружения новостности зависит от формализованных структур данных (таких как JSON-выход из API) или от неформализованных структур данных, которые алгоритмы, разработанные ИИ, могут иметь шанс на парсинг в структурированную схему (такую как пресс-релизы из конкретной организации):

Спарсенный RSS/XML-лент, показывающий жесткую иерархию контейнеров данных. Источник - https://www.xml.com/articles/2023/03/06/visualising-xml-schemas/

Спарсенный RSS/XML-лент, показывающий жесткую иерархию контейнеров данных. Источник

Очевидно, что подходы этого рода хорошо подходят для программируемого вывода, такого как рутинная работа, которую упомянутый репортер Fortune заявляет, что ИИ освободил его от нее, включая прогнозы погоды, акции и спортивные результаты, а также рутинные пресс-релизы из муниципальных и других государственных организаций.

Хотя возможно прикрепить ‘человеческие триггеры’ к статистическим лентам, таким как погода (внезапные штормы), акции (внезапные падения) и спорт (неожиданные победы/поражения, с некоторой предварительной работой), снова, человеческое внимание все еще потребуется даже для очень стратифицированных государственных релизов, чтобы оценить новостность.

Хотя термины, такие как ‘смерть’, ‘неожиданная болезнь’, ‘утечка’ и ‘авария’, могут все помочь углубиться в новостные события, они только решают ‘рутинные’ последствия и не могут учесть альтернативный язык (или языки).

Возвращение элитных писателей?

В последние годы журналистика, основанная на данных, стала восходящей доской в новостных репортажах, с редакционными отделами, которые больше не ограничены ‘сладкими’ сделками по раскрытию специальных отчетов и белых бумаг из крупных издателей; вместо этого они могут сами анализировать цифры.

Однако это не бесплатный обед; поскольку очевидная ценность парсинга общественных данных с ИИ таким образом выросла, реакция на аренду/блокировку ИИ последовала – или даже предшествовала – спросу, толкая крупных игроков ИИ в скрытые тактики.

Дополнительная трение Новой отступления, возможно, восстанавливает некоторую власть от ‘гражданских журналистов’ обратно к наследственным СМИ – или, по крайней мере, хорошо финансируемым новостным организациям, которые имеют полосу, чтобы поглотить дополнительную ручную работу, необходимую для сбора, уточнения и оценки данных, в эпоху, когда издатели и домены все чаще ограничивают случайный доступ.

Итак, в некотором смысле, возможно, в духе времени практическое проявление ИИ в журналистике, в плане того, как крупные игроки и рынки отреагировали на ИИ-инновации и принятие, может фактически возвращать нас назад во времени: дедемократизируя средства производства новостей, и добавляя препятствия на пути значимых систем оценки новостности, основанных на данных.

Общие инстинкты

Эти ограничения, очевидно, ведут нас обратно к ‘чувству’ как неизбежному компоненту в оценке новостности истории.

Естественно, это утешительно для тех, кто профессионально занимается этим аспектом; но самоуспокоенность была бы ошибкой, поскольку этот инстинкт может, до определенной степени, быть дистиллирован и операционализирован очень общим образом, который не зависит от изучения одержимостей или хобби любого отдельного человека или организации: в исследовании 2022 года исследователи из Северо-Западного университета использовали оценки потенциально новостных историй, полученные из толпы, для обучения прогностической модели, специально связанной с новостностью недавно опубликованных исследовательских работ Arxiv:

Вопросы опроса, заданные участникам исследования, чтобы получить данные для обучения 'модели предсказания новостности' ИИ. Источник - https://nishalsach.github.io/pdfs/2022-newsworthiness.pdf

Вопросы опроса, заданные участникам исследования, чтобы получить данные для обучения ‘модели предсказания новостности’ ИИ. Источник

Система довольно хорошо ранжирует кандидатов, с примерно 80% своих лучших выборов, также признанных новостными экспертами. Однако согласие с экспертами оказалось только умеренным, с результатами, пропускающими факторы, такие как фрейминг или соответствие аудитории.

Система основана на принципах, изложенных в статье 2020 года Вычислительное открытие новостей: к соображениям по проектированию алгоритмов редакционной ориентации в журналистике. Как и большинство подобных проектов, эта работа решает журналистику науки, а не абстрактное сбор новостей – возможно, потому, что научная литература склоняется к шаблонному выводу, который потенциально может быть спарсирован в обучаемые и интерпретируемые данные.

Ну, как я заметил в 2021 году, это было бы так, если бы исследователи-ученые нечасто злоупотребляли конвенциями подачи научных статей, чтобы скрыть или преуменьшить непечатные результаты или даже прямую неудачу.

Даже большим вызовом является большая трудность, с которой системы ИИ сталкиваются при интерпретации фигур и таблиц в научных статьях, до такой степени, что это занятие в последнее время стало активной ветвью литературы:

Из статьи 'SciFigDetect: Бенчмарк для обнаружения научных фигур, сгенерированных ИИ', показывающий реальные научные фигуры, их генерационные подсказки и синтетические аналоги, произведенные Nano Banana и GPT в трех категориях: иллюстрация, обзор и экспериментальные фигуры. Источник - https://arxiv.org/pdf/2604.08211v1

Из статьи ‘SciFigDetect: Бенчмарк для обнаружения научных фигур, сгенерированных ИИ’, показывающий реальные научные фигуры, их генерационные подсказки и синтетические аналоги, произведенные Nano Banana и GPT в трех категориях: иллюстрация, обзор и экспериментальные фигуры. Источник

Это часто бывает так, что таблица или график содержит результаты, которые основной текст статьи либо сообщает с избирательным предвзятостью, либо вообще игнорирует любые негативные последствия, подразумеваемые результатами таблицы/графика. Следовательно, это препятствие в ИИ-журналистике не является незначительным.

Более того, тот факт, что статья является производной или только незначительным прогрессом (если вообще) над состоянием дел, часто закопан в почти непроницаемую цитату (т. е. вам нужно искать термин, найти читаемую копию PDF и понять объем предыдущего искусства, прежде чем понять отсутствие оригинальности или новизны в новой работе).

Одинокий снова, естественно

Метод, основанный на толпе, описанный выше, предполагает некоторое возможное согласие между общим консенсусом по потенциальным новостным историям и профессиональной оценкой одной и той же. Но без контекста только самые широкие мазки новостности, по-видимому, могут быть определены.

Самая сила ИИ заключается в его способности, в зависимости от конфигурации, изолировать аутсайдеров – либо для цели их удаления как кривой и бессмысленного исключения из тенденций в наборе данных, либо (более актуально для сбора новостей) для определения значимых и ценных необычных экземпляров и случаев:

Аутсайдеры (в красном цвете) на графике рассеяния. Источник - https://stackoverflow.com/questions/73079324/python-removing-outliers-from-plotly-scatter-plot

Аутсайдеры (в красном цвете) на графике рассеяния. Источник

По принципу, что молния редко бьет дважды, почти все хитовые новостные истории являются аутсайдерами. В случаях, когда они исходят из активного и волатильного домена, такого как продолжающаяся война, этот домен может быть бдительно сканирован с высокой вероятностью появления новостных историй – но за счет огромной конкуренции, поскольку общее внимание, скорее всего, также сосредоточено на домене.

Многие новостные научные лиды, по определению, не являются центром языкового распределения. Они являются редкими комбинациями методов, удивительных отрицательных результатов или аномальных репликаций. Если компетентность модели ухудшается непропорционально на таких низкочастотных группировках, то область, где редакторский ‘нос’ должен быть острым, становится областью, где модель наименее надежна.

Проблемы доверия

При поиске новых историй журналисты балансируют множество ограничений, включая время, доступ, достоверность, аудиторию и организационные приоритеты), что приводит к неочевидным выборам. Обзор литературы 2022 года из Дании характеризовал журналистов как балансирующих множество проблем, остро осознающих, что источники могут иметь программы или быть дезинформированы; и часто обходящих прямую проверку в пользу косвенных сигналов доверия, когда они работают под давлением.

Эти же ‘проблемы доверия’ были бы препятствием для развития любой определительной ИИ-управляемой системы выявления новостности, поскольку взаимодействие с такой платформой требует от пользователя доверия, что любая алгоритмически-отбрасываемая статья действительно не стоит времени писателя.

Обширное бета-тестирование и повторное обучение или тонкая настройка, с человеческим надзором, подхватывающим пропущенные и отстающие, в конечном итоге может улучшить надежность такого подхода; но сдвиг в национальной или глобальной культуре – такой как удивительные изменения в политическом ландшафте или вспышка войны – неизбежно перевернет все базовые приоритеты такой тонко настроенной системы, оставив ИИ-зависимого писателя перестраивать необходимую ‘внутреннюю модель домена’ почти с нуля.

 

Опубликовано в понедельник, 20 апреля 2026 года.
Отредактировано в четверг, 23 апреля 2026 года 14:13:25, чтобы заменить ‘Fortune’ на ‘WSJ’ в ‘Узком пути’, абзац 2 (благодаря Марку Райли из mathison.ai за указание на это).

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]