Andersons vinkel
Mod automatisk videnskabelig skrivning

I morges, da jeg gennemgik computer science-sektionerne på Arxiv, som jeg gør de fleste morgener, faldt jeg over en ny artikel fra det føderale universitet i Ceará i Brasilien, der tilbyder en ny ramme for naturlig sprogbehandling til automatisering af sammenfatning og udtrækning af kernedata fra videnskabelige artikler.
Da dette er mere eller mindre, hvad jeg gør hver dag, fik artiklen mig til at tænke på en kommentar på en Reddit-forfattertråd tidligere på året – en profeti om, at videnskabelig skrivning vil være blandt de første journalistiske job, der overtages af maskinlæring.
Lad mig være klar – jeg absolut tro på, at den automatiserede videnskabelige forfatter er på vej, og at alle de udfordringer, jeg fremhæver i denne artikel, enten kan løses nu eller vil blive løst. Hvor muligt giver jeg eksempler på dette. Desuden behandler jeg ikke, om nuværende eller nærmeste fremtidens videnskabelige skrivnings-AI kan skrive sammenhængende; baseret på nuværende interesse i dette område af NLP, antager jeg, at denne udfordring vil blive løst.
I stedet spørger jeg, om en videnskabelig forfatter-AI kan identificere relevante videnskabelige historier i overensstemmelse med (højst varierede) ønskede resultater for udgivere.
Jeg tror ikke, det er forestående; baseret på at gennemgå overskrifterne og/eller kopien af omkring 2000 nye videnskabelige artikler om maskinlæring hver uge, har jeg en mere cynisk tilgang til, i hvilken udstrækning akademiske indsendelser kan brydes ned algoritmissk, enten til formål for akademisk indeksering eller for videnskabelig journalistik. Som sædvanligt er det mennesker, der kommer i vejen.
Krav til den automatiserede videnskabelige forfatter
Lad os overveje udfordringen ved at automatisere videnskabelig rapportering om den seneste akademiske forskning. For at gøre det retfærdigt vil vi primært begrænse det til CS-kategorierne på den meget populære non-paywalled Arxiv-domæne fra Cornell University, der i hvert fald har en række systematiske, skabelonmæssige funktioner, der kan indsættes i en dataudtrækningsrørledning.
Lad os antage, at opgaven, som med den nye artikel fra Brasilien, er at iterere gennem titler, sammenfatninger, metadata og (hvis berettiget) indhold af nye videnskabelige artikler for at finde konstanter, pålidelige parametre, tokens og handlingsbare, reducible domæneinformationer.
Dette er, efter alt, principperne for, hvorpå højst succesfulde nye rammer er på vej i områderne jordskælv rapportering, sports skrivning, finansiel journalistik og sundhedsdækning, og en rimelig udgangspunkt for den AI-drevne videnskabelige journalist…. (resten af indholdet)…












