Погляд Anderson
Чи може штучний інтелект розвинути нюх на новини?

Штучний інтелект став краще у написанні новинних статей, але не став значно краще у визначенні їх.
Думка За останні п’ять років, відколи я останній раз розглянув можливість штучного інтелекту знаходити гарячу новинну історію, ландшафт змінився значно, з підвищенням рівня автоматизації, керованої штучним інтелектом, та супутнім зростанням болісних процесів і скандалів.
Нещодавно, у звіті WSJ про плідного, штучно-допоможеного Fortune дописувача, журналіста майбутнього було представлено як звільненого від рутинної роботи, такої як транслітерація прес-релізів, залишаючи йому місце для написання статей і проведення розслідувань, які зазвичай мають тільки великі видання.
Але що ми чуємо набагато менше часто – це можливість штучного інтелекту виявити новинну історію.
Покращення шуму
У статті 2021 року я зосередився на письменниках, які висвітлюють наукові дослідження, оскільки це те, де я провожу більшу частину свого часу; і, можливо, найбільший ефект, який нова революція штучного інтелекту мала на це, полягає в тому, що вона створила неуправляему бурю подань наукових робіт, керованих штучним інтелектом, підвищуючи співвідношення сигналу до шуму так високо, що навіть висвітлення всіх наукових досліджень у галузі штучного інтелекту Архіву тепер виходить за межі можливостей однієї особи.
Звичайно, це саме те місце, де штучний інтелект повинен виділятися – у перебуванні через величезні масиви даних, які люди не можуть вирішити, щоб знайти відхили (до яких ми повернемось пізніше) за секунди, які б зайняли у людей дні, якщо б вони могли це зробити взагалі.
Чому ж штучний інтелект усе ще так поганий у визначенні гарячої новинної історії з тисяч, навіть десятків тисяч, щоденних претендентів?
Штучний інтелект, орієнтований на минулому
Ця величезна поширеність штучно створеного контенту відбувається далеко за межами академічної сфери, про яку я говорив раніше. У кінці минулого року було оцінено, що половина всієї нової писемності у мережі написана штучним інтелектом, з ще більш прискореним темпом цього тренду, який, як передбачається, має прийти. Тому шум оглушливий скрізь, не тільки в академії.
Хоча за останні кілька років було деякий прогрес у визначенні штучним інтелектом/алгоритмічному визначенні “гарячої” історії, ці системи tend до зосередження на стратифікованих і передбачуваних організованих даних, що означає, що вони можуть працювати тільки в досить крихкому контексті.
У цьому відношенні Стенфордський постдокторант і колишній журналіст Александер Спангер зробив кілька спроб визначення “новинності” у термінах, які можуть бути застосовані до процесів машинного навчання та статистичного аналізу; і надав докази автоматичної генерації лідерів у корпусах таких як судові документи, державні біллі, засідання міської ради, а також загальні публічні документи – саме той вид схемо-орієнтованого виходу, який сценарист Fortune може перетворити на 6-7 новинних статей на день:

«Тепло» розподілу слів, отримане з корпусів публічних документів. У цьому випадку ми бачимо, що «авторизація» має високий бал, можливо, тому що вона представляє рішення, зміну та новизну. Джерело
Однак, проблема підходів, таких як той, який очолив Спангер у 2023 році пропозиції Відстежування новинності публічних документів, полягає в тому, що вони зосереджені на спостережуваних тенденціях у даних. Інакше кажучи, вони спостерігають речі, які робили хороші новини раніше, і продовжують шукати ще більше такого ж.
У реальному світі несподівані джерела майже завжди виявляються “одноразовими”; і після того, як вони стали плідними один раз, і незважаючи на періодичні спроби скористатися мимовільною славою/зловістю, вони зазвичай ніколи не дають нічого корисного знову.
Знак часу
Отже, оскільки моніторинг такого типу джерел майже завжди тільки додає шум до загальної бурі, чи не може штучний інтелект визначити ознаки джерела, яке одного дня стане плідним? Якщо можна визначити, який тип джерела може в майбутньому дати новини, можна зосередитися на його характеристиках, а не на контексті чи методах.
За цією логікою, можна зробити висновок з розголошень Едварда Сноудена 2010-х років, що будь-хто, хто недавно покинув роботу в ЦРУ (або подібній організації), буде гідним того, щоб його слідкували як потенційного джерела майбутнього скандалу.
Однак, немає RSS-строк чи API, які могли б автоматизувати такий тип постійного моніторингу, оскільки LinkedIn і багато інших відкритих джерел даних відступають перед лицем жадібних і злочинних веб-скрейперів штучного інтелекту. Навіть якщо б вони були, частота була б проблемою, оскільки не можна опитувати API або сайт кожні п’ять секунд; крім витрат на ресурси, відповіді платформ з блокуванням IP зробили б це нездійсненною діяльністю.
Крім того, є явна “людська складова” таких розголошень, яку важко автоматизувати.

Збір новин з особистим дотиком: кадр з дискової версії фільму Алана Пакули «Всі люди президента» 1976 року, на якому інформатор виходить з тіні. Джерело
Також, у реальному світі дуже важко визначити визначальні характеристики майбутнього джерела новин. Це, ймовірно, не “люди, які покинули ЦРУ недавно”, і це точно не визначається протоколом: платформи, такі як X або GitHub, видають занадто багато сигналів самі по собі, і навіть звуження до пошукових термінів або категорій публікацій не робить великої різниці – тільки якщо ви займаєтеся проблемою і взаємодієте зі спільнотою (або репозиторієм тощо), ви справді можете розпізнати значення розвитку.
Навіть термін такий як “повідомлення про безпеку” не може контекстуалізувати справжню серйозність або новинність події, оскільки посилання такого типу розкидаються щодня, тисячами, у таких спільнотах – і все ж не мають широкої новинної цінності; і навіть якщо обмежити такий моніторинг тільки англійською мовою, потенційні варіації ідій, разом з використанням непрямої мови, зробили б дуже важким розбори “дикої” публікації у справжнє повідомлення про новини.
Вузький шлях
Поточна генерація систем виявлення новинності, керованих штучним інтелектом, залежить від формалізованих структур даних (таких як JSON-вийпут, з API), або ж від неформалізованих структур даних, які алгоритми, розроблені штучним інтелектом, мають шанс розібрати у структуровану схему (таку як прес-релізи з певної організації):

Розібраний RSS-/XML-потік, який показує жорстку ієрархію контейнерів даних. Джерело
Чиятно, що підходи такого типу добре підходять для програмного виходу, такого як рутинна робота, яку згаданий дописувач Fortune заявляє, що штучний інтелект звільнив його від неї, включаючи погоду, акції та спортивні результати, а також рутинні прес-релізи з муніципальних та інших урядових організацій.
Хоча можна прикріпити «сповіщення людини» до статистичних потоків, таких як погода (раптові бурі), акції (раптові падіння) та спортивні результати (неочікувані перемоги/поразки, з деякою попередньою роботою), знову ж таки, людська увага все ж буде потрібна навіть для дуже стратифікованих урядових прес-релізів, щоб оцінити новинність.
Хоча терміни, такі як “смерть”, “неочікувана хвороба”, “утека” та “аварія”, можуть допомогти зосередитися на новинних подіях, вони тільки адресують “рутинні” наслідки, і також не можуть впоратися з альтернативною мовою (або мовами).
Повернення елітних письменників?
За останні роки джерналістика, заснована на даних стала аскендентним напрямком у висвітленні новин, з редакційними відділами, які більше не обмежені угодами про ексклюзивне право на публікацію спеціальних звітів і білих книг великих видавців; натомість вони можуть самостійно обробляти дані.
Однак, це не безкоштовний обід; оскільки очевидна цінність парсингу публічних даних штучним інтелектом зростає, ренто-орієнтована/блокуюча реакція штучного інтелекту слідує – або навіть передуватиме – попиту, що спонукає великих гравців штучного інтелекту до приховування тактики.
Доданий тертя Нової Відступності аргументно відновлює певну кількість влади від “громадянських журналістів” назад до традиційних ЗМІ – або принаймні, добре фінансованих новинних організацій, які мають смугу пропускання, щоб поглинути додаткову ручну роботу, необхідну для збору, уточнення та оцінки даних у часи, коли видавці та домени все частіше обмежують вільний доступ.
Отже, певним чином, можливо, що практична реалізація штучного інтелекту у журналістиці, у термінах того, як великі гравці та ринки відповіли на інновації та прийняття штучного інтелекту, може фактично повернути нас назад у час: демократизацію засобів виробництва новин, і додавання бар’єрів для значущих систем оцінки новинності, заснованих на даних.
Спільні інстинкти
Ці обмеження явно ведуть нас назад до “чутливого відчуття” як невід’ємної складової оцінки новинності історії.
Природно, це є втішним для тих, хто займається цією стороною професійно; але самозадоволеність була б помилкою, оскільки цей інстинкт можна, до певної міри, витягнути і операціоналізувати досить загальним чином, який не залежить від вивчення одержимостей або хобі окремої особи чи організації: у дослідженні 2022 року дослідники з Північно-Західного університету використали оцінки новинності потенційних історій, отримані від натовпу, для навчання передбачувальної моделі, спеціально пов’язаної з новинністю щойно опублікованих наукових робіт Архіву:

Питання опитування, надані учасникам дослідження для отримання навчальних даних для моделі «передбачення новинності» штучного інтелекту. Джерело
Система досить добре ранжує кандидатів, з близько 80% її топ-10 виборів, також визнаних новинними експертами. Однак, узгодженість з експертами виявилася тільки помірною, з результатами, які не враховували такі фактори, як рамкування чи відповідність аудиторії.
Система заснована на принципах, викладених у документі 2020 року Обчислювальне відкриття новин: До проектних міркувань для редакційних орієнтаційних алгоритмів у журналістиці. Як і більшість подібних проектів, ця робота займається науковою журналістикою, а не абстрактним збором новин – можливо, тому що наукова література схильна до шаблонного виходу, який потенційно може бути розібраний у навчальні та інтерпретовані дані.
Ну, як я спостерігав у 2021 році, це б було б так, окрім того, що дослідники часто зловживають конвенціями подання наукових робіт, щоб приховати або занизити незадовільні результати, або навіть явну невдачу.
Ще більшим викликом є велика складність, з якою системи штучного інтелекту мають справу при інтерпретації таблиць і малюнків у наукових статтях, до тієї міри, що це останнім часом стало активною гілкою у літературі:

З паперу «SciFigDetect: Бенчмарк для виявлення наукових малюнків, згенерованих штучним інтелектом», показуючи справжні наукові малюнки, їхні генеруючі запити та синтетичні аналоги, створені Nano Banana та GPT у трьох категоріях: ілюстрації, огляди та експериментальні малюнки. Джерело
Часто таблиця чи малюнок містить результати, які основний текст статті або звітується з селективним упередженням, або ж зовсім ігнорує будь-які негативні наслідки, що випливають з результатів таблиці/малюнка. Тому ця перешкода у штучному інтелекті не є незначною.
Більш виразно, той факт, що паперу є похідним, або тільки малим кроком вперед (якщо взагалі), часто закопаний у майже непроникну цитату (тобто, вам потрібно буде шукати термін, знайти читабельну копію PDF та зрозуміти ступінь попередньої роботи, перш ніж зрозуміти відсутність оригінальності чи новизни у «новій» роботі).
Самі знову, природно
Метод, заснований на натовпі, описаний вище, припускає деяку згоду між загальною згодою щодо потенційних новинних історій та професійною оцінкою тих самих.
Сама сила штучного інтелекту полягає в його здатності, залежно від конфігурації, виділяти відхили – або для цілей відкидання їх як кривої та безглуздої винятку з тенденцій у наборі даних, або (що більш актуально для збору новин) для визначення значущих і цінних незвичайних випадків та подій:

Відхили (червоним) на розсіювальній діаграмі. Джерело
За принципом, що блискавка рідко вдаряє двічі, майже всі новинні історії – відхили. У випадках, коли вони походять з активної та волатильної області, такої як триваюча війна, цю область можна уважно сканувати з високою ймовірністю появи новинних історій – але за рахунок величезної конкуренції, оскільки загальна увага, ймовірно, також зосереджена на цій області.
Багато новинних наукових лідерів, за визначенням, не знаходяться в центрі розподілу мови. Вони є рідкісними комбінаціями методів, несподіваними негативними результатами чи аномальними реплікаціями. Якщо компетентність моделі погіршується непропорційно на таких низькочастотних групах, то саме той регіон, де редакторський “нюх” повинен бути гострим, стає регіоном, де модель є найменш надійною.
Проблеми довіри
Під час пошуку нових історій журналісти балансують кілька обмежень, включаючи час, доступ, достовірність, аудиторію та організаційні пріоритети), що приводить до неочевидних виборів. У огляді літератури 2022 року з Данії журналістів характеризували як балансування декількох проблем, гостро усвідомлюючи, що джерела можуть мати програми або бути дезінформованими; і часто обходячи прямий перевірку на користь непрямих сигналів довіри, коли вони працюють під тиском.
Ці самі “проблеми довіри” стали б перешкодою для будь-якої визначеної системи виявлення новинності, керованої штучним інтелектом, оскільки взаємодія з такою платформою вимагає, щоб користувач довіряв, що будь-які алгоритмічно-виключені статті справді не варті часу письменника.
Розгорнуте бета-тестування та повторне навчання або тонке налаштування, з людським наглядом, який підхоплює втрачених і відсталих, могло б в кінцевому підсумку покращити надійність такого підходу; але зміна національної чи глобальної культури – така як несподівані зміни у політичному ландшафті, або вибух війни – могла б зруйнувати всі базові пріоритети такої ретельно налаштованої системи, залишаючи штучно-інтелектуального письменника з необхідністю відбудувати свій необхідний “внутрішній модель домену” майже з нуля.
Перша публікація понеділка, 20 квітня 2026 р.
Змінено четверга, 23 квітня 2026 р. 14:13:25, щоб замінити «Fortune» на «WSJ» у «Вузькому шляху», абз. 2 (дякуючи Марку Райлі з mathison.ai за те, що він звернув на це увагу).












