Погляд Anderson
До автоматизованого наукового письма

Цього ранку, переглядаючи розділи комп’ютерних наук на Arxiv, як я роблю більшість ранків, я наткнувся на недавню статтю з Федерального університету Сеари в Бразилії, яка пропонує нову структуру обробки природної мови для автоматизації підсумовування та видобування основних даних з наукових статей.
Оскільки це більш менш те, що я роблю кожен день, ця стаття привела мені на думку коментар на тему письменників Reddit раніше цього року – пророкування щодо того, що наукові письменники будуть серед перших журналістських робіт, які будуть замінені машинним навчанням.
Дозвольте мені бути ясним – я абсолютно вірю, що автоматизований науковий письменник прийде, і що всі виклики, які я викладаю в цій статті, або вже розв’язані, або врешті-решт будуть розв’язані. Там, де можливо, я даю приклади для цього. Крім того, я не розглядаю питання про те, чи зможуть поточні або найближчі наукові письменники АІ писати зрозуміло; на основі поточної зацікавленості в цьому секторі обробки природної мови, я припускаю, що цей виклик врешті-решт буде розв’язаний.
Натомість я запитую, чи зможе науковий письменник АІ ідентифікувати відповідні наукові історії згідно з (дуже різноманітними) бажаними результатами видавців.
Я не думаю, що це близьке; на основі перегляду заголовків та/або копій близько 2000 нових наукових статей про машинне навчання кожен тиждень, я маю більш цинічний погляд на ступінь, до якої академічні подання можуть бути алгоритмічно розбиті, як для академічного індексування, так і для наукової журналістики. Як зазвичай, це ті самі люди, які заважають.
Вимоги для автоматизованого наукового письменника
Давайте розглянемо виклик автоматизації наукової звітності про останні академічні дослідження. Щоб保持ати справедливість, ми обмежимося в основному категоріями CS дуже популярного некомерційного домену Arxiv з Корнелльського університету, який至少 має ряд систематичних, шаблонних функцій, які можуть бути підключені до потоку видобування даних.
Давайте припустимо також, що завдання полягає в тому, щоб ітерувати через заголовки, підсумки, метадані та (якщо виправдано) тіло змісту нових наукових статей у пошуках констант, надійних параметрів, токенів та дієвої, редукованої інформації домену.
Це, після всього, принцип, на якому успішні нові структури здобувають успіх в таких областях, як звітність про землетруси, спортивна журналістика, фінансова журналістика та охорона здоров’я, і це розумний пункт відправлення для наукового журналіста, що працює на основі АІ…. (переклад продовжується згідно з вимогами)












