Tankeledere

Dataproblemet i hjertet av AI-drevet legemiddelforskning

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ettersom AI raskt blir en del av legemiddelforskning, er kanskje det viktigste spørsmålet ikke hvordan kraftig neste modell vil være, men hva slags data disse modellene faktisk lærer av.

Anthropics nylige utvidelse innen legemiddelutvikling er det siste tegnet på at kunstig intelligens beveger seg beyond generell årsak og inn i anvendt vitenskap. Det reflekterer virkelig momentum i feltet og økende tillit til at AI kan betydelig endre hvordan nye legemidler oppdages. Men hvis målet er å forbedre klinisk suksess – ikke bare akselerere oppdagelse – bør vi spørre om den biologiske dataen som ligger under disse systemene er i stand til å lære dem hva menneskebiologi faktisk ligner.

I årevis har bransjens fokus vært på å bygge stadig mer sofistikerte algoritmer. Større modeller, mer beregning og bedre arkitektur har drevet bemerkelsesverdige fremgang i proteinstrukturprediksjon, målidentifikasjon, molekylær design og andre områder av biomedisinsk forskning. Disse innovasjonene fortjener oppmerksomheten de har fått.

Hva som har fått langt mindre oppmerksomhet, er den biologiske grunnlaget under dem.

AI er usedvanlig god til å finne mønster. Men den kan ikke skille mellom biologi som bare er målbart og biologi som faktisk er prediktiv for hva som skjer hos pasienter. Taket for AI-drevet legemiddelforskning vil til slutt bli bestemt ikke bare av intelligensen til modellene, men av troverdigheten av den menneskebiologiske dataen som brukes til å trene, validere og benchmark dem. Hvis vi vil at AI skal levere bedre legemidler enn bare raskere hypoteser, kan bygging av høykvalitets menneskebiologisk datainfrastruktur vise seg å være like viktig som bygging av neste generasjons AI selv.

AI kan bare lære fra biologien vi gir den

Hver AI-modell er begrenset av informasjonen den lærer av. Legemiddelutvikling presenterer en særlig vanskelig utfordring fordi biologi er usedvanlig kompleks. Menneskelig sykdom påvirkes av genetikk, alder, kjønn, komorbiditet, immunresponser, miljømessige eksponeringer og tusenvis av interagerende molekylære stier som fortsatt bare delvis er forstått.

Historisk sett har mye av den eksperimentelle dataen som er brukt i legemiddelutvikling kommet fra dyrestudier, udødelige cellelinjer, forenklede in vitro-systemer og komputasjonelle simulasjoner. Disse verktøyene har fremmet biomedisinsk vitenskap betraktelig og er fortsatt uunnværlige over mange stadier av forskning. Men tiår med erfaring har også vist at de ikke fullt ut kan replikere menneskefysiologi.

Omtrent 90% av legemiddelkandidater som går inn i kliniske studier, feiler til slutt, med manglende effektivitet og uventede sikkerhetsfunn som viktige bidragsytere. Mens mange faktorer bidrar til disse feilene, er ett gjentakende tema at prekliniske modeller ofte sliter med å forutsi hva som faktisk skjer hos pasienter.

Hvis AI-systemer hovedsakelig er trenet på data generert fra modeller som selv har kjente translasjonsgrenser, bør det ikke være overraskende hvis disse grensene varer ved. AI kan gjenkjenne mønster usedvanlig godt, men den kan ikke oppfinne biologisk sannhet som aldri var til stede i treningsdataene.

Mer data er ikke nødvendigvis bedre data

AI-samfunnet snakker ofte om skaleringslover: observasjonen av at større datasett ofte forbedrer modellprestasjon. I biologi er imidlertid mengde og kvalitet ikke utskiftbare. Millioner av datapunkter samlet inn fra eksperimentelle systemer som dårlig reflekterer menneskefysiologi, kan tilby mindre prediktiv verdi enn mindre datasett generert direkte fra klinisk relevante menneskebiologi. Denne distinksjonen blir spesielt viktig i legemiddelutvikling, hvor målet er ikke bare prediksjon, men prediksjon som oversetter til vellykkede pasientresultater.

Høykvalitets menneskebiologisk data skiller seg fra tradisjonelle laboratoriedatasett på flere viktige måter. Den fanger biologisk funksjon i stedet for statiske øyeblikksbilder. Den beholder relasjoner mellom vev, cellearkitektur, perfusjon, metabolisme og farmakologi. Den inkorporerer pasienthistorie, kliniske kjennetegn, molekylære målinger og funksjonelle responser innen samme biologiske system. Det viktigste er at den måler biologi som faktisk eksisterer hos mennesker.

Ettersom AI blir stadig mer i stand til å trekke ut subtile mønster fra komplekse data, blir kvaliteten på disse mønstrene uatskillelig fra kvaliteten på den underliggende biologien.

Neste konkurransefordel kan være menneskebiologisk infrastruktur

Over de siste årene har enorme investeringer gått til grunnmodeller, komputasjonsinfrastruktur og spesialiserte AI-arkitekturer. Langt mindre oppmerksomhet har vært rettet mot infrastrukturen som kreves for å systematisk generere høykvalitets menneskebiologisk data i skala.

Menneskebiologiske prøver er innebygget begrenset og krever integrasjon med noen form for donasjonsinfrastruktur. Standardisering er utfordrende. Eksperimentelle protokoller må være reproduserbare. Metadata må være omfattende. Multiomiske målinger, bilde, funksjonelle prøver og klinisk kontekst må alle integreres i datasett som er tilstrekkelig konsistente for komputasjonell læring.

Ingen av dette ligner tradisjonell programvareutvikling. I stedet krever det koordinerte biologiske operasjoner i stand til å produsere reproduserbare, regulator-klare datasett over mange år. Like som skyinfrastruktur ble essensiell for moderne programvareutvikling, kan menneskebiologisk infrastruktur bli grunnleggende for neste generasjons AI-drevne legemidler. Organisasjonene som investerer i denne infrastrukturen i dag, kan til slutt forme hva AI-modellene er i stand til å lære.

Regulatorer beveger seg i denne retningen

Viktig, denne diskusjonen strekker seg beyond akademisk nysgjerrighet. Regulatorer selv er stadig mer fremtredende menneske-relevant bevis. FDA har utvidet sin støtte til nye tilnærmingsmetoder (NAMs), og har lagt frem veier gjennom hvilke komputasjonelle modeller, organ-på-chip-teknologier, avanserte in vitro-systemer og andre menneske-relevante tilnærminger kan bidra til regulatoriske avgjørelser.

Denne skiftet erkjenner en viktig realitet. Ettersom komputasjonelle metoder blir mer sofistikerte, avhenger tillit til deres prediksjoner av tillit til den biologiske bevisstøtten som støtter dem. Hvis bedre AI krever bedre validering, og bedre validering krever bedre menneskebiologisk data, så må bedre AI kreve bedre menneskebiologisk data som ligger til grunn for hver modell.

Neste tiår vil bli definert av datakvalitet

Legemiddelindustrien har opplevd flere teknologiske revolusjoner fra high-throughput screening til next-generation sequencing. Hver utvidet volumet av tilgjengelige data, men anvendelsen av AI i dette feltet representerer noe annet.

Dens suksess avhenger ikke bare av å produsere mer data, men av å produsere data som mer trofast representerer menneskebiologi. Ettersom grunnmodeller blir stadig mer tilgjengelige, kan algoritme-fordeler alene bli mindre varige. Tilgang til differensiert, høykvalitets menneskebiologisk data kan i stedet oppstå som en av de avgjørende konkurransefordelene over hele legemiddeløkosystemet. Dette er spesielt sant hvis industrien ultimate mål er å forbedre klinisk suksess i stedet for bare å akselerere oppdagelse.

Anthropics inngang i legemiddelutvikling reflekterer den bemerkelsesverdige fremgangen AI har gjort over de siste årene. Det høydepunktet også neste spørsmål industrien må svare på. Hvis AI faktisk har potensialet til å transformere medisin, hva slags biologisk grunnlag vil disse modellene stå på?

Fremtiden for AI-drevet legemiddelforskning vil uten tvil avhenge av bedre algoritmer. Men den kan avhenge enda mer av å bygge menneskebiologisk datainfrastruktur i stand til å lære disse algoritmene hva menneskebiologi faktisk ligner.

Dr. Jenna DiRito er medgründer og administrerende direktør i Revalia Bio. Hennes arbeid fokuserer på å bygge menneskebiologisk datainfrastruktur for å støtte AI-drevet legemiddelutvikling, translasjonsvitenskap og regulativt godkjenning av menneskebaserte modeller for forskning.