Leader di pensiero
Il Problema dei Dati al Cuore della Scoperta di Farmaci con Intelligenza Artificiale

Mentre l’intelligenza artificiale si sta integrando rapidamente nella scoperta di farmaci, forse la domanda più importante non è quanto potente sarà il prossimo modello, ma quali dati quei modelli stanno effettivamente imparando.
L’espansione recente di Anthropic nel settore dello sviluppo di farmaci è l’ultimo segno che l’intelligenza artificiale sta andando oltre il ragionamento di scopo generale e si sta muovendo verso la scienza applicata. Riflette un reale slancio nel settore e una crescente fiducia nel fatto che l’IA possa ridisegnare significativamente come vengono scoperti i nuovi farmaci. Tuttavia, se l’obiettivo è migliorare i tassi di successo clinico e non semplicemente accelerare la scoperta, dovremmo chiederci se i dati biologici che sottostanno a questi sistemi sono in grado di insegnare loro cosa sia effettivamente la biologia umana.
Per anni, l’attenzione dell’industria è stata concentrata sul costruire algoritmi sempre più sofisticati. Modelli più grandi, più calcoli e migliori architetture hanno guidato notevoli progressi nella previsione della struttura delle proteine, nell’identificazione dei bersagli, nella progettazione molecolare e in altre aree di ricerca biomedica. Queste innovazioni meritano l’attenzione che hanno ricevuto.
Ciò che ha ricevuto molto meno attenzione è la fondazione biologica che sta sotto di essi.
L’IA è eccezionalmente brava a trovare modelli. Tuttavia, non può distinguere tra biologia che è semplicemente misurabile e biologia che è veramente predittiva di ciò che accade nei pazienti. Il limite per la scoperta di farmaci con IA sarà determinato in ultima analisi non solo dall’intelligenza dei modelli, ma dalla fedeltà dei dati umani utilizzati per addestrare, convalidare e misurare quei modelli. Se vogliamo che l’IA fornisca farmaci migliori e non solo ipotesi più veloci, costruire un’infrastruttura di dati biologici umani di alta qualità potrebbe rivelarsi altrettanto importante quanto costruire la prossima generazione di IA.
L’IA può Imparare Solo dalla Biologia che Le Forniamo
Ogni modello di IA è limitato dalle informazioni che apprende. Lo sviluppo di farmaci presenta una sfida particolarmente difficile perché la biologia è straordinariamente complessa. La malattia umana è influenzata da genetica, età, sesso, comorbidità, risposte immunitarie, esposizioni ambientali e migliaia di vie molecolari interagenti che rimangono solo parzialmente comprese.
Storicamente, gran parte dei dati sperimentali utilizzati durante lo sviluppo di farmaci proveniva da studi su animali, linee cellulari immortali, sistemi in vitro semplificati e simulazioni computazionali. Questi strumenti hanno avanzato notevolmente la scienza biomedica e rimangono indispensabili in molte fasi della ricerca. Tuttavia, decenni di esperienza hanno anche dimostrato che non possono pienamente replicare la fisiologia umana.
Circa il 90% dei candidati farmaceutici che entrano nei trial clinici alla fine falliscono, con la mancanza di efficacia e la scoperta di problemi di sicurezza inaspettati che rappresentano importanti contribuenti. Mentre molti fattori contribuiscono a questi fallimenti, un tema ricorrente è che i modelli preclinici spesso lottano per prevedere cosa accada effettivamente nei pazienti.
Se i sistemi di IA vengono addestrati principalmente con dati generati da modelli che hanno limitazioni di traslazione note, non dovrebbe essere sorprendente se queste limitazioni persistono. L’IA può riconoscere modelli in modo notevole, ma non può inventare verità biologica che non era presente nei suoi dati di addestramento.
I Dati in Maggior Quantità Non Sono Necessariamente Migliori
La comunità di IA spesso parla di leggi di scala: l’osservazione che dataset più grandi migliorano frequentemente le prestazioni del modello. Tuttavia, nella biologia, quantità e qualità non sono interscambiabili. Milioni di punti dati raccolti da sistemi sperimentali che riflettono male la fisiologia umana possono offrire meno valore predittivo rispetto a dataset più piccoli generati direttamente dalla biologia umana clinicamente rilevante. Questa distinzione diventa particolarmente importante nello sviluppo di farmaci, dove l’obiettivo non è solo la previsione, ma la previsione che si traduce in esiti di successo per i pazienti.
I dati biologici umani ad alta fedeltà differiscono dai tradizionali dataset di laboratorio in diversi modi importanti. Catturano la funzione biologica piuttosto che istantanee statiche. Preservano le relazioni tra tessuti, architettura cellulare, perfusione, metabolismo e farmacologia. Incorporano la storia del paziente, le caratteristiche cliniche, le misurazioni molecolari e le risposte funzionali all’interno dello stesso sistema biologico. La cosa più importante è che misurano la biologia che esiste effettivamente negli esseri umani.
Mentre l’IA diventa sempre più capace di estrarre modelli sottili da dati complessi, la qualità di quei modelli diventa inseparabile dalla qualità della biologia sottostante.
Il Prossimo Vantaggio Competitivo Potrebbe Essere l’Infrastruttura di Dati Umani
Negli ultimi anni, enormi investimenti sono stati fatti in modelli fondamentali, infrastrutture computazionali e architetture di IA specializzate. Molta meno attenzione è stata rivolta all’infrastruttura necessaria per generare sistematicamente dati biologici umani di alta qualità su larga scala.
I campioni biologici umani sono intrinsecamente limitati e richiedono l’integrazione con una qualche forma di infrastruttura di donazione. La standardizzazione rimane una sfida. I protocolli sperimentali devono essere riproducibili. I metadati devono essere completi. Le misurazioni multiomiche, l’imaging, gli assaggi funzionali e il contesto clinico devono tutti essere integrati in dataset sufficientemente coerenti per l’apprendimento computazionale.
Nessuna di queste cose assomiglia all’ingegneria del software tradizionale. Invece, richiede operazioni biologiche coordinate in grado di produrre dataset riproducibili e pronti per i regolatori nel corso di molti anni. Proprio come l’infrastruttura cloud è diventata essenziale per lo sviluppo del software moderno, l’infrastruttura biologica umana potrebbe diventare fondamentale per la prossima generazione di terapie guidate dall’IA. Le organizzazioni che investono in quell’infrastruttura oggi potrebbero alla fine plasmare cosa i modelli di IA saranno in grado di imparare domani.
I Regolatori Si Stanno Muovendo in Questa Direzione
Importante, questa discussione va oltre la curiosità accademica. I regolatori stanno sempre più enfatizzando le prove umane rilevanti. La FDA ha esteso il suo sostegno alle Nuove Metodologie di Approccio (NAM), delineando percorsi attraverso cui i modelli computazionali, le tecnologie on-chip di organi, i sistemi in vitro avanzati e altri approcci umani rilevanti possono contribuire alla presa di decisioni regolatorie.
Questo spostamento riconosce una realtà importante. Mentre i metodi computazionali diventano più sofisticati, la fiducia nelle loro previsioni dipende dalla fiducia nelle prove biologiche che le supportano. Se un’IA migliore richiede una migliore convalida e una migliore convalida richiede migliori dati umani, allora un’IA migliore deve richiedere migliori dati umani che stanno alla base di ogni modello.
Il Prossimo Decennio Sarà Definito dalla Qualità dei Dati
L’industria farmaceutica ha vissuto molte rivoluzioni tecnologiche, dalle tecniche di screening ad alta velocità alla sequenziamento di nuova generazione. Ognuna ha espanso il volume di dati disponibili, ma l’applicazione dell’IA in questo campo rappresenta qualcosa di diverso.
Il suo successo dipende non solo dal produrre più dati, ma dal produrre dati che rappresentano più fedelmente la biologia umana. Mentre i modelli fondamentali diventano sempre più accessibili, i vantaggi algoritmici soli potrebbero diventare meno duraturi. L’accesso a dati biologici umani differenziati e di alta qualità potrebbe invece emergere come uno dei vantaggi competitivi definitivi nell’ecosistema farmaceutico. Ciò è particolarmente vero se l’obiettivo finale dell’industria è migliorare i tassi di successo clinico e non solo accelerare la scoperta.
L’ingresso di Anthropic nello sviluppo di farmaci riflette i notevoli progressi che l’IA ha fatto negli ultimi anni. Evidenzia anche la prossima domanda che l’industria deve rispondere. Se l’IA ha veramente il potenziale di trasformare la medicina, su quale fondazione biologica quei modelli si baseranno?
Il futuro della scoperta di farmaci con IA dipenderà senza dubbio da algoritmi migliori. Ma potrebbe dipendere ancora di più dalla costruzione di un’infrastruttura di dati umani in grado di insegnare a quegli algoritmi cosa sia effettivamente la biologia umana.












