Andersons vinkel
Kan AI udvikle en næse for nyheder?

AI bliver bedre til at skrive nyhedsartikler, men bliver ikke meget bedre til at identificere dem.
Opinion I de fem år siden, jeg sidst kiggede på AI’s evne til at finde en varm nyhedshistorie, har landskabet ændret sig betydeligt, med øget niveau af AI-dreven automation ledsaget af de uundgåelige voksende smerter og kontroverser.
For nylig var der en WSJ-rapport om en produktiv, AI-baseret Fortune-bidragsyder, der præsenterede journalisten i fremtiden som befriet fra slid som at translitterere pressemeddelelser, og giver dem mulighed for at skrive artikler og gøre research, som kun større publikationer normalt har budget til.
Men hvad vi hører meget mindre om er AI’s evne til at spotte en nyhedshistorie.
Støjreduktion
I artiklen fra 2021 koncentrerede jeg mig om forfattere, der dækker forskningsområdet, da det er, hvor jeg tilbringer det meste af min tid; og måske det største effekt, den nye AI-revolution har haft på dette, er, at den har skabt en ucontrollerbar storm af AI-drevne forskningspapirer, der øger signal-til-støj-forholdet så højt, at selv at dække Arxiv AI-relaterede domæner komprehensivt er nu ud over en enkelt persons evner.
Sikkert er dette, hvor AI udmærker sig – ved at iterere gennem enorme mængder af data, som mennesker ikke kan løse, for at finde ‘outliers’ (som vi kommer til om lidt) på sekunder, som ville have taget mennesker dage, hvis de kunne have gjort det overhovedet.
Hvorfor er AI så dårlig til at identificere en varm nyhedshistorie ud af de tusinder, selv ti-tusinder, af daglige kandidater?
Bagsigtet AI
Denne massive prolifering af AI-genereret indhold sker langt ud over den akademiske sektor, som jeg diskuterede tidligere. Sidste år blev det estimeret, at halvdelen af alle nye skriverier på internettet er nu ‘skrevet af AI’, med endnu større acceleration af denne trend forventet. Derfor er støjen øredøvende overalt, ikke kun i akademien.
Selv om der har været nogen fremskridt i AI/algoritmisk identifikation af en ‘varm’ historie i de sidste par år, tenderer disse systemer til at koncentrere sig om stratificerede og forudsigelige datafeeds, hvilket betyder, at de kun kan operere i en ret brittisk kontekst.
I denne henseende har Stanford-postdoc-forsker og tidligere New York Times-journalist Alexander Spangher gjort flere forsøg på at definere ‘nyheds værdi’ i termer, der kan anvendes på maskinelæring og statistisk analyse; og har produceret beviser for automatiseret lead-generering i korpus såsom retsdokumenter, lovbilleder og byråds møder, samt generelle offentlige dokumenter – den type skema-drevet output, som Fortune’s produktive AI-drevne forfatter kan omdanne til 6-7 nyhedsartikler om dagen:

Den ‘varme’ af ordistributioner hentet fra korpus af offentlige dokumenter. I dette tilfælde kan vi se, at ‘authorizing’ har en høj score, måske fordi det repræsenterer beslutning, forandring og nytænkning. Kilde
Men problemet med tilgange som den Spangher-ledede 2023 tilbud Tracking the Newsworthiness of Public Documents, er, at de i typisk AI-fasion centerer sig om observerede tendenser i data. Med andre ord, de observerer ting, der gjorde god nyhed før, og går derefter ud for at finde mere af samme slags.
I den virkelige verden er uventede kilder næsten altid en ‘one hit wonder’; og for hvor obskure de var, kunne ingen have forudset deres pludselige prominens. Så, efter at have været frugtbar én gang, og på trods af lejlighedsvis forsøg på at kapitalisere på flygtig berømmelse/notorietet, vil de normalt aldrig producere noget nyttigt igen.
Tegn på tiden
Derfor, da overvågning af denne type one-and-done-nyhedskilde normalt kun vil tilføje mere støj til den generelle storm, kunne AI i stedet ikke identificere signifikatorerne af en kilde, der en dag vil blive frugtbar? Hvis man kunne finde ud af, hvilken type kilde der måske en dag vil give nyheder, kunne man fokusere på dens egenskaber i stedet for dens kontekst eller metoder.
Med denne logik kunne man slutte, at enhver, der for nylig har forladt CIA’s (eller en lignende organisation) ansættelse, ville være værd at følge som en potentiel kilde til en fremtidig scoop.
Men der er ingen RSS-feeds eller API’er, der sandsynligvis kan automatisere denne type løbende overvågning, da LinkedIn og mange andre tidligere åbne kilder af data trækker sig tilbage i mødet med rapace og lovstridige AI-web-scrapere. Selv hvis der var, ville hyppighed være et problem, da man ikke kan afhøre en API eller et websted hver fem sekunder; ud over ressource-omkostningerne ville IP-blokeringssvar fra platformene gøre dette til en uholdbar aktivitet.
Derudover er der tydeligvis en ‘menneskelig dimension’ i disse afsløringer, der er svær at automatisere.

Nyhedsindsamling med personlig touch: capture fra en disk-udgave af filmen ‘All The President’s Men’ fra 1976, med informant, der kommer ud af skyggen. Kilde
Også i den virkelige verden er det frygteligt svært at identificere definerende egenskaber af en fremtidig nyhedskilde. Det er sandsynligvis ikke ‘personer, der forlod CIA for nylig’, og det er bestemt ikke defineret af en protokol: platforme som X eller GitHub producerer for meget signal i sig selv, og selv at indsnævre på søgeord eller post-kategorier gør ikke stor forskel – kun hvis man er involveret i problemet og engageret i fællesskabet (eller repo osv.) er man sandsynligvis i stand til at genkende betydningen af en udvikling.
Selv en term såsom ‘sikkerhedsadvarsel’ kan ikke kontekstualisere den sande alvor eller nyheds værdi af en begivenhed, da referencer af den slags kastes rundt dagligt, tusinder af gange, i sådanne fællesskaber – og selv hvis man begrænser denne type overvågning til engelsk sprog alene, ville variationer i idiom samt brug af omslørende sprog gøre det meget svært at parse en ‘i det vilde’ post til en sand nyhedsadvarsel.
Den smalle vej
Den nuværende samling af AI-drevne systemer til identifikation af nyheds værdi afhænger af formaliserede datastrukturer (såsom JSON-udgang fra en API) eller uformelle datastrukturer, som AI-udviklede algoritmer har en chance for at parse til en struktureret skema (såsom pressemeddelelser fra en bestemt organisation):

En parsed RSS/XML-feed, der afslører den stive hierarki af datacontainere. Kilde
Det er tydeligt, at tilgange af denne type er velegnede til programmatisk output, såsom det kedelige arbejde, som den nævnte Fortune-forfatter erklærer, at AI har befriet ham fra, herunder vejr, aktier og sportsresultater, samt rutinemæssige pressemeddelelser fra kommunale og andre regeringsorganisationer.
Det er muligt at tilføje ‘menneskelig-alarm’ udløsere til statistiske feeds som vejr (pludselige storme), aktier (pludselige fald) og sport (uventede sejre/tabs, med nogen forberedelse), men igen ville menneskelig opmærksomhed stadig være nødvendig, selv for meget stratificerede regeringsudgivelser, for at vurdere nyheds værdi.
Selv om termer som ‘død’, ‘uventet sygdom’, ‘læk’ og ‘ulykke’ alle kan hjælpe med at bore ned til nyheds værdige begivenheder, kan de kun håndtere ‘rutinemæssige’ begivenheder og kan ikke tage hensyn til alternativt sprog (eller sprog).
Return of the Elite Writers?
I de seneste år er data-dreven journalistik blevet en stigende plank i nyhedsrapportering, med redaktionelle afdelinger, der ikke længere er begrænset til søde ‘scoop’-aftaler, der giver dem tidlig udgivelse på særlige rapporter og hvidbøger fra store udgivere; i stedet kan de selv knuse tallene.
Men dette er ingen gratis frokost; da den åbenlyse værdi af at parse offentlige data med AI på denne måde er vokset, er der fulgt en leje-/AI-blokeringssvar – eller endda forventet – efterspørgsel, og driver de store AI-spillere ind i hemmelige taktikker.
Tilføjelsen af friktion fra den nye tilbagetrækning giver muligvis en vis mængde magt tilbage til legacy-medier – eller i hvert fald, velfinansierede nyhedsorganisationer, der har kapaciteten til at absorbere den ekstra manuelle arbejde, der kræves for at indsamle, raffinere og evaluere data i en æra, hvor udgivere og domæner er mere og mere begrænsede i deres adgang.
Så, på en måde, kan det praktiske udtryk for AI i journalistik, i termer af, hvordan store spillere og markeder har reageret på AI-baseret innovation og adoption, måske faktisk tage os tilbage i tiden: udemokratisere midlerne til nyhedsproduktion og tilføje vejspærringer til meningsfulde data-drevne nyheds-værdi-evalueringssystemer.
Fælles instinkter
Disse begrænsninger fører os tilbage til ‘fornemmelse’ som en uundgåelig komponent i evaluering af en histories nyheds værdi.
Naturligvis er dette beroligende for dem, der er professionelt engageret i dette aspekt; men selvtillid ville være en fejl, da denne fornemmelse kan, til en vis grad, destilleres og operationaliseres på en meget generel måde, der ikke afhænger af at studere besættelser eller hobbyheste af en enkelt person eller organisation: i en undersøgelse fra 2022 brugte forskere fra Northwestern University crowdsourced-evalueringer af potentiel nyheds-værdige historier til at træne en prædictiv model, specifikt beskæftiget med nyheds-værdien af nyligt publicerede Arxiv-forskningspapirer:

Spørgsmål, der blev stillet til deltagere i studiet for at få træningsdata til en ‘nyheds-værdi-forudsigelses’-AI-model. Kilde
Systemet rangerer kandidater ret godt, med omkring 80% af dens top-10-valg også vurderet som nyheds-værdige af eksperter. Men enighed med eksperter viste sig kun at være moderat, med resultater, der manglede faktorer som ramme, eller publikumets tilpasning.
Systemet er baseret på principperne i 2020-papiret Computational News Discovery: Towards Design Considerations for Editorial Orientation Algorithms in Journalism. Som med de fleste lignende projekter, tackler dette arbejde videnskabsjournalistik snarere end abstrakt nyhedsindsamling – måske fordi den videnskabelige litteratur tenderer mod at blive standardiseret output, der potentielt kan parses til trænede og fortolkelige datapunkter.
Vel, som jeg observerede tilbage i 2021, ville dette være tilfældet, hvis forskningsvidenskabsmænd ikke ofte misbrugte konventionerne for forskningspapir-indsendelse til at skjule eller nedtone imponerende resultater, eller endda direkte fiasko.
Endnu mere udfordrende er den store vanskelighed, som AI-systemer har med at fortolke figurer og tabeller i videnskabelige papirer, til den grad, at dette forsøg for nylig er blevet en aktiv gren i litteraturen:

Fra papiret ‘SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection’, der viser ægte videnskabelige figurer, deres generationprompts og syntetiske modstykker produceret af Nano Banana og GPT på tværs af tre kategorier: illustration, oversigt og eksperimentelle figurer. Kilde
Det er ofte tilfældet, at en graf eller tabel vil indeholde resultater, som hovedparten af papiret vil enten rapportere med selektiv bias eller udrette ignorere enhver negativ konsekvens implicit i tabel/grafs resultater. Derfor er dette vejspærring i AI-dreven videnskabsjournalistik ikke et mindre problem.
Mere betydningsfuldt er det faktum, at et papir er afledt, eller kun en mindre fremgang (hvis overhovedet) på standen af kunsten, ofte begravet i en næsten ugennemtrængelig citation (dvs. du ville neede at søge efter termen, finde en læselig PDF-kopi og forstå omfanget af den tidligere kunst, før du kunne forstå mangel på originalitet eller nytænkning i det nye arbejde).
Alene igen, naturligt
Den crowdsourced-metode, der er beskrevet ovenfor, antyder en vis enighed mellem fælles konsensus om potentiel nyheds-værdige historier og professionel vurdering af samme.
Denne styrke af AI ligger i dets evne, afhængigt af konfiguration, til at isolere outliers – enten for at afvise dem som en kurve-ødelæggende og meningsløs undtagelse til en tendens i en datamængde, eller (mere relevant for nyhedsindsamling) til at identificere meningsfulde og værdifulde usædvanlige eksempler og begivenheder:

Outliers (i rød) i en spredningsplot. Kilde
På principperne om, at lyn sjældent slår to gange, er næsten alle hit-nyhedsartikler outliers. I tilfælde, hvor de kommer fra et aktivt og volatilt domæne, såsom en pågående krig, kan dette domæne overvåges med en høj sandsynlighed for, at nyheds-værdige historier vil opstå – men til en kostnad af massiv konkurrence, da fælles opmærksomhed sandsynligvis også er fokuseret på domænet.
Mange nyheds-værdige videnskabelige leads er, per definition, ikke centrum af sprogfordelingen. De er sjældne kombinationer af metoder, overraskende negative resultater eller anomale re-replikationer. Hvis modellens kompetence svækkes uforholdsmæssigt på disse lavfrekvens-grupperinger, bliver det område, hvor en redaktionel ‘næse’ har brug for at være skarp, det område, hvor modellen er mindst pålidelig.
Tillidsproblemer
I søgen efter nye historier balancerer journalister multiple begrænsninger, herunder tid, adgang, troværdighed, publikum og organisationsprioriteter), hvilket fører til ikke-åbenlyse valg. En litteraturgennemgang fra 2022 fra Danmark karakteriserede journalister som balancerende multiple bekymringer, akut bevidste om, at kilder kan have dagsordener eller være misinformeret; og ofte omgår direkte kontrol i fordel af indirekte tillidskilder, når de opererer under pres.
Disse samme ’tillidsproblemer’ ville være en udviklingshinder i enhver definitiv AI-dreven nyheds-værdi-identifikationssystem, da engagement med en sådan platform kræver, at brugeren stoler på, at enhver algoritmemæssigt-afvist artikel ikke er værdig til forfatterens tid.
Omfattende beta-test og gen-træning eller fin-justering, med menneskelig overvågning, der samler stragglers op, kunne muligvis forbedre pålideligheden af en sådan tilgang; men en ændring i national eller global kultur – såsom overraskende ændringer i det politiske landskab eller udbruddet af krig – kunne uundgåeligt undergrave alle grundlæggende prioriteringer i en sådan fint justeret system, og efterlade AI-afhængige forfattere til at genopbygge deres nødvendige ‘interne domæne-model’ næsten fra scratch.
Først publiceret mandag, 20. april 2026.
Ændret torsdag, 23. april 2026 14:13:25, for at erstatte ‘WSJ’ med ‘Fortune’ i ‘Den smalle vej’, afsnit 2 (tak til Mark Riley fra mathison.ai for at pege på det).












