Andersonův úhel
Směřování k automatizovanému psaní o vědě

Dnes ráno, při procházení počítačových věd na Arxiv, jako to dělám většinu dnů, jsem narazil na nedávnou práci z Federální univerzity v Ceará v Brazílii, která nabízí nový framework pro zpracování přirozeného jazyka pro automatizaci sumarizace a extrakci základních dat z vědeckých článků.
Jelikož se jedná o něco, co dělám téměř každý den, článek mi připomněl komentář na vláknu pro spisovatele na Redditu na začátku tohoto roku – prognózu, že psaní o vědě bude jedním z prvních novinářských povolání, která budou převzata strojovým učením.
Chci být jasný – absolutně věřím, že automatizovaný spisovatel o vědě je na cestě, a že všechny výzvy, které zde uvádím, jsou buď nyní řešitelné, nebo budou řešitelné. Kde je to možné, uvádím příklady. Kromě toho se nezabývám tím, zda současné nebo blízké budoucí AI pro psaní o vědě budou schopny psát srozumitelně; na základě současného zájmu v tomto sektoru zpracování přirozeného jazyka předpokládám, že tato výzva bude nakonec vyřešena.
Místo toho se ptám, zda AI spisovatel o vědě bude schopen identifikovat relevantní vědecké příběhy v souladu s (velmi různými) požadovanými výsledky vydavatelů.
Nemyslím si, že je to blízké; na základě procházení titulů a/nebo kopií kolem 2000 nových vědeckých článků o strojovém učení každý týden mám spíše cynický názor na rozsah, ve kterém lze akademické příspěvky rozložit algoritmicky, ať už pro účely akademického indexování nebo pro vědeckou žurnalistiku. Jako obvykle, je to těch zatracených lidí, kteří se dostanou do cesty.
Požadavky pro automatizovaného spisovatele o vědě
Zvažme výzvu automatizovaného vědeckého reportování o nejnovějším akademickém výzkumu. Abychom to učinili spravedlivým, budeme se většinou omezovat na kategorie CS na velmi populární neplacené doméně Arxiv z Cornellovy univerzity, která má alespoň některé systematické a šablonové funkce, které lze zapojit do datové extrakční pipeline.
Předpokládejme také, že úkolem je, stejně jako u nové práce z Brazílie, procházet tituly, souhrny, metadata a (pokud je odůvodněno) tělo obsahu nových vědeckých článků při hledání konstant, spolehlivých parametrů, tokenů a akčních, redukovatelných doménových informací.
To je totiž princip, na kterém jsou založeny velmi úspěšné nové rámce jsou získávány v oblastech reportování o zemětřeseních, sportovního psaní, finančního žurnalistiky a zdravotní péče, a rozumný výchozí bod pro AI-powered vědeckého žurnalistu…. (zbytek obsahu)












