Angolo di Anderson
PuÃē l’AI Sviluppare un Naso per le Notizie?

LâAI sta migliorando nella scrittura di storie di notizie, ma non sta migliorando molto nellâidentificazione di esse.
Â
Opinione Nel corso dei cinque anni da quando ho esaminato per lâultima volta la capacità dellâAI di trovare una storia di notizie calda, il panorama ÃĻ cambiato notevolmente, con livelli aumentati di automazione guidata dallâAI accompagnati dai inevitabili dolori crescenti e controversie.
Recentemente, un rapporto del WSJ su un contributore prolifico e aiutato dallâAI di Fortune ha presentato il giornalista del futuro come emancipato da lavori di scrittura come la trascrizione di comunicati stampa, lasciandogli lo spazio per scrivere articoli e fare ricerche che solo le pubblicazioni piÃđ grandi hanno generalmente il budget per fare.
Ma cosa sentiamo parlare molto meno spesso ÃĻ la capacità dellâAI di individuare una storia di notizie.
Riduzione del Rumore
Nel pezzo del 2021, mi sono concentrato sugli scrittori che coprono la ricerca, poichÃĐ ÃĻ lÃŽ che passo la maggior parte del mio tempo; e forse lâeffetto piÃđ grande che la nuova rivoluzione dellâAI ha avuto su di esso ÃĻ che ha creato una tempesta di neve ingovernabile di presentazioni di ricerca potenziata dallâAI, aumentando il rapporto segnale/rumore cosÃŽ alto che anche coprire i domini di ricerca dellâArxiv relativi allâAI in modo completo ÃĻ ora al di là degli sforzi di una sola persona.
Certamente questo ÃĻ dove lâAI eccelle â nellâiterare attraverso vasti tratti di dati che gli esseri umani non possono risolvere, per trovare âoutlierâ (che affronteremo tra poco) in pochi secondi che avrebbero richiesto ai persone giorni, se avessero potuto farlo.
PerchÃĐ, allora, lâAI ÃĻ ancora cosÃŽ scarsa nellâidentificare una storia di notizie calda tra le migliaia, anche le decine di migliaia, di concorrenti quotidiani?
AI Rivolto allâIndietro
Questa massiccia proliferazione di contenuti generati dallâAI sta avvenendo ben al di là del settore accademico che ho discusso in precedenza. Lo scorso anno ÃĻ stato stimato che la metà di tutti i nuovi scritti su Internet ÃĻ ora âscritta da AIâ, con unâaccelerazione ancora maggiore di questa tendenza presumibilmente in arrivo. Pertanto, il rumore ÃĻ assordante ovunque, non solo nellâambito accademico.
Sebbene ci sia stato qualche progresso nellâidentificazione algoritmica dellâAI di una âstoria caldaâ negli ultimi anni, questi sistemi tendono a concentrarsi su flussi di dati stratificati e organizzati in modo prevedibile, il che significa che possono operare solo in un contesto abbastanza fragile.
In questo senso, il ricercatore post-dottorato di Stanford e ex giornalista del New York Times Alexander Spangher ha fatto diverse incursioni nel definire ânewsworthinessâ in termini che possono essere applicati a processi di apprendimento automatico e analisi statistica; e ha prodotto prove di generazione di lead automatizzata in corpora come depositi di tribunale, progetti di legge statale, e riunioni del consiglio comunale, nonchÃĐ documenti pubblici generici â il tipo di output basato su schema che lo scrittore potenziato dallâAI di Fortune puÃē trasformare in 6-7 pezzi di notizie al giorno:

La âcaloreâ delle distribuzioni di parole tratte da corpora di documenti pubblici. In questo caso, possiamo vedere che âautorizzazioneâ ha un punteggio alto, forse perchÃĐ rappresenta decisione, cambiamento e novità . Fonte
Tuttavia, il problema con approcci come quello del lavoro del 2023 guidato da Spangher, ÃĻ che, in tipico stile AI, si concentrano su tendenze osservate nei dati. In altre parole, osservano le cose che hanno fatto buone notizie in precedenza e vanno a cercare altre cose simili.
Nel mondo reale, le fonti inaspettate si rivelano quasi sempre un âone hit wonderâ; e per quanto fossero oscure, nessuno avrebbe potuto prevedere la loro improvvisa notorietà . Poi, dopo essere stati fruttuosi una volta, e nonostante occasionali tentativi di capitalizzare la fama o la notorietà effimera, di solito non produrranno mai nulla di utile di nuovo.
Segno dei Tempi
Pertanto, poichÃĐ monitorare questo tipo di fonte di notizie âuna tantumâ sarà solitamente solo aggiungere altro rumore alla tempesta generale, lâAI non potrebbe invece identificare i segnali di una fonte che un giorno diventerà fruttuosa? Se si potesse scoprire che tipo di fonte potrebbe eventualmente produrre notizie, si potrebbe concentrare sulle sue caratteristiche piuttosto che sul contesto o sui metodi.
Per tale logica, si potrebbe dedurre dalle rivelazioni di Edward Snowden degli anni 2010 che chiunque abbia recentemente lasciato il servizio della CIA (o unâorganizzazione simile) sarebbe degno di essere seguito come potenziale fonte di una futura storia.
Tuttavia, non ci sono feed RSS o API che siano probabilmente in grado di automatizzare questo tipo di monitoraggio continuo, poichÃĐ LinkedIn e molte altre fonti di dati un tempo aperte stanno ritirandosi di fronte a web scraper rapaci e scofflaw dellâAI. Anche se ci fossero, la frequenza sarebbe un problema, poichÃĐ non si puÃē interrogare unâAPI o un sito ogni cinque secondi; a parte il costo delle risorse, le risposte di blocco dellâIP dalle piattaforme renderebbero questa unâattività insostenibile.
Inoltre, câÃĻ chiaramente una âdimensione umanaâ in tali rivelazioni che ÃĻ difficile da automatizzare.

Raccolta di notizie con il tocco personale: cattura da un rilascio su disco del film del 1976 di Alan J. Pakula âAll The Presidentâs Menâ, con lâinformatore che esce dallâombra. Fonte
Anche nel mondo reale, ÃĻ molto difficile identificare le caratteristiche definitorie di una futura fonte di notizie. Probabilmente non ÃĻ âpersone che hanno lasciato la CIA di recenteâ, e sicuramente non ÃĻ definito da un protocollo: piattaforme come X o GitHub producono troppo segnale in se stesse, e anche restringendo a termini di ricerca o categorie di post non fa molta differenza â solo se si ÃĻ coinvolti nel problema e si ÃĻ impegnati con la comunità (o repo, ecc.) si ÃĻ veramente probabili a riconoscere lâimportanza di uno sviluppo.
Anche un termine come âallarme di sicurezzaâ non puÃē contestualizzare la vera gravità o newsworthiness di un incidente, poichÃĐ riferimenti di questo tipo vengono gettati ogni giorno, a migliaia, in tali comunità â e anche se si restringe questo tipo di monitoraggio alla lingua inglese sola, le potenziali variazioni di idioma, insieme allâuso di linguaggio obliquo, renderebbero molto difficile analizzare un post âin naturaâ in un vero allarme di notizie.
Il Sentiero Stretto
Lâattuale raccolta di sistemi di rilevamento della newsworthiness potenziati dallâAI dipende da strutture di dati formalizzate (come lâoutput JSON da unâAPI), o da strutture di dati informali che gli algoritmi sviluppati dallâAI hanno una possibilità di analizzare in uno schema strutturato (come comunicati stampa da unâorganizzazione specifica):

Un feed RSS/XML parsato, che rivela la rigida gerarchia dei contenitori di dati. Fonte
Chiaramente, approcci di questo tipo sono ben adatti per lâoutput programmatico, come il lavoro monotono che il suddetto reporter di Fortune dichiara che lâAI lo ha liberato da, inclusi report meteorologici, azioni e punteggi sportivi, nonchÃĐ comunicati stampa di routine da organizzazioni governative e municipali.
Sebbene sia possibile attaccare grilletti di allarme umani a feed statistici come il tempo (tempeste improvvise), azioni (crolli improvvisi) e sport (vittorie/ sconfitte inaspettate, con un poâ di preparazione), nuovamente, lâattenzione umana sarebbe ancora necessaria anche per rilasci governativi stratificati, al fine di valutare la newsworthiness.
Sebbene termini come âmorteâ, âmalattia inaspettataâ, âperditaâ, e âincidenteâ possano aiutare a individuare eventi degni di nota, affrontano solo eventualità âdi routineâ, e non possono nemmeno tenere conto di linguaggio alternativo (o lingue).
Il Ritorno degli Scrittori dâÃlite?
Negli ultimi anni, il giornalismo basato sui dati ÃĻ diventato un pilastro ascendente nella copertura delle notizie, con dipartimenti editoriali non piÃđ limitati a accordi di âscoopâ con rilasci speciali e white paper da importanti editori; invece, possono analizzare i numeri da soli.
Tuttavia, questo non ÃĻ un pasto gratuito; poichÃĐ il valore evidente dellâanalisi dei dati pubblici con lâAI in questo modo ÃĻ cresciuto, una risposta di blocco dellâAI/rent-seeking â o addirittura anticipata â la domanda, spingendo i principali giocatori di dati dellâAI in tattiche furtive.
Lâattrito aggiuntivo della Nuova Ritirata restituisce probabilmente una certa quantità di potere dai âgiornalisti cittadiniâ ai media tradizionali â o almeno, organizzazioni di notizie ben finanziate che hanno la larghezza di banda per assorbire il lavoro manuale aggiuntivo richiesto nella raccolta, raffinazione e valutazione dei dati, in unâera in cui gli editori e i domini stanno sempre piÃđ restringendo lâaccesso casuale.
Quindi, in un certo senso, forse nello spirito del tempo, la manifestazione pratica dellâAI nel giornalismo, in termini di come i principali giocatori e i mercati hanno risposto allâinnovazione e allâadozione dellâAI, potrebbe effettivamente portarci indietro nel tempo: de-democratizzando i mezzi di produzione delle notizie, e aggiungendo ostacoli a sistemi di valutazione della newsworthiness basati sui dati.
Instinti Comuni
Queste limitazioni ci portano chiaramente indietro allâistinto come componente inevitabile nella valutazione della newsworthiness di una storia.
Naturalmente, questo ÃĻ confortante per coloro che sono impegnati professionalmente in questo aspetto; ma la compiacenza sarebbe un errore, poichÃĐ questo istinto puÃē, in una certa misura, essere distillato e operazionalizzato in un modo molto generale che non dipende dallo studio delle ossessioni o dei cavalli di battaglia di un individuo o organizzazione specifica: in uno studio del 2022, i ricercatori dellâUniversità Northwestern hanno utilizzato valutazioni crowd-sourced di storie potenzialmente degne di nota per addestrare un modello predittivo, specificamente interessato alla newsworthiness di ricerche pubblicate di recente su Arxiv:

Domande di sondaggio presentate ai partecipanti allo studio per ottenere dati di addestramento per un modello di previsione della newsworthiness dellâAI. Fonte
Il sistema classifica i candidati abbastanza bene, con circa lâ80% delle sue prime scelte giudicate degne di nota anche dagli esperti. Tuttavia, lâaccordo con gli esperti si ÃĻ rivelato solo moderato, con i risultati che mancano di fattori come lâinquadratura o lâadattamento al pubblico.
Il sistema si basa sui principi delineati nel lavoro del 2020 Scoperta di notizie computazionale: verso considerazioni di progettazione per algoritmi di orientamento editoriale nel giornalismo. Come per la maggior parte dei progetti simili, questo lavoro affronta il giornalismo scientifico piuttosto che la raccolta di notizie astratte â forse perchÃĐ la letteratura scientifica tende verso lâoutput templato che potrebbe potenzialmente essere analizzato in punti di dati addestrabili e interpretabili.
Ebbene, come ho osservato nel 2021, questo sarebbe il caso, tranne che i ricercatori scientifici abusano frequentemente delle convenzioni di presentazione della ricerca per nascondere o sminuire risultati non impressionanti, o addirittura fallimenti.
Unâaltra sfida ancora piÃđ grande ÃĻ la grande difficoltà che i sistemi dellâAI hanno nellâinterpretare figure e tabelle nei documenti scientifici, al punto che questo inseguimento ÃĻ diventato di recente un filone attivo nella letteratura:

Dal lavoro âSciFigDetect: un benchmark per la rilevazione di figure scientifiche generate dallâAIâ, che mostra figure scientifiche reali, i loro prompt di generazione e i loro equivalenti sintetici prodotti da Nano Banana e GPT in tre categorie: illustrazioni, panorami e figure sperimentali. Fonte
Spesso un grafico o una tabella conterranno risultati che il corpo principale del documento riporterà con pregiudizio selettivo, o che addirittura ignorerà del tutto le conseguenze negative implicite nei risultati del grafico/tabella. Pertanto, questo ostacolo nel giornalismo scientifico guidato dallâAI non ÃĻ di poco conto.
Maggiormente rilevante, il fatto che un documento sia derivato, o solo un avanzamento minore (se alcuno) rispetto allo stato dellâarte, ÃĻ spesso sepolto in una citazione quasi impenetrabile (vale a dire, si dovrebbe cercare il termine, trovare una copia PDF leggibile e capire lâentità dellâarte precedente prima di comprendere la mancanza di originalità o novità nel nuovo lavoro).
Solo di Nuovo, Naturalmente
Il metodo crowd-sourced descritto sopra suggerisce una possibile concordanza tra il consenso comune sulle potenziali storie di notizie e la valutazione professionale delle stesse. Ma senza contesto, solo i tratti piÃđ ampi della newsworthiness possono essere determinati.
La vera forza dellâAI risiede nella sua capacità , a seconda della configurazione, di isolare outlier â o per lo scopo di scartarli come eccezioni curve e non significative in un set di dati, o (piÃđ rilevante per la raccolta di notizie) per identificare istanze e accadimenti significativi e preziosi:

Outlier (in rosso) in un grafico a dispersione. Fonte
Sul principio che i fulmini raramente colpiscono due volte, quasi tutte le storie di notizie di successo sono outlier. Nei casi in cui provengono da un dominio attivo e volatile, come una guerra in corso, quel dominio puÃē essere scansionato con una probabilità alta di storie di notizie emergenti â ma al costo di una forte concorrenza, poichÃĐ lâattenzione comune ÃĻ probabilmente anche focalizzata sul dominio.
Molte storie di notizie scientifiche degne di nota sono, per definizione, non al centro della distribuzione del linguaggio. Sono combinazioni rare di metodi, risultati negativi sorprendenti o riproduzioni anomale. Se la competenza del modello si deteriora sproporzionatamente su tali raggruppamenti a bassa frequenza, allora la regione in cui un ânasoâ editoriale deve essere affilato diventa la regione in cui il modello ÃĻ meno affidabile.
Questioni di Fiducia
Nella ricerca di nuove storie, i giornalisti bilanciano molteplici vincoli, tra cui tempo, accesso, credibilità , pubblico e priorità organizzative), portando a scelte non ovvie. Un lavoro di revisione della letteratura del 2022 dalla Danimarca ha caratterizzato i giornalisti come bilancianti molteplici preoccupazioni, acutamente consapevoli che le fonti possono avere agende o essere male informate; e spesso bypassando il controllo diretto in favore di segnali di fiducia indiretti quando operano sotto pressione.
Queste stesse âquestioni di fiduciaâ sarebbero un ostacolo di sviluppo in qualsiasi sistema di identificazione della newsworthiness guidato dallâAI, poichÃĐ lâinterazione con una tale piattaforma richiede allâutente di fidarsi che qualsiasi articolo scartato dallâalgoritmo non sia degno dellâattenzione dello scrittore.
Unâestensiva fase di testing beta e riaddestramento o affinamento, con la supervisione umana che raccoglie gli stragglanti, potrebbe eventualmente migliorare lâaffidabilità di un tale approccio; ma un cambiamento nella cultura nazionale o globale â come sorprendenti cambiamenti nel paesaggio politico, o lo scoppio di una guerra â potrebbe inevitabilmente rovesciare tutte le priorità di base di un tale sistema finemente calibrato, lasciando lo scrittore dipendente dallâAI a ricostruire il suo necessario âmodello di dominio internoâ quasi da zero.
Â
Pubblicato per la prima volta lunedÃŽ 20 aprile 2026.
Modificato giovedÃŽ 23 aprile 2026 14:13:25, per sostituire âFortuneâ con âWSJâ in âIl Sentiero Strettoâ, paragrafo 2 (grazie a Mark Riley di mathison.ai per averlo segnalato).












