Tankeledere

Dataproblemet i hjertet af AI-drevet lægemiddelforskning

mm
Føj Unite.AI til dine foretrukne kilder på Google

Da AI hurtigt bliver en integreret del af lægemiddelforskning, er det måske det vigtigste spørgsmål ikke, hvor kraftfuld den næste model vil være, men hvad data de modeller faktisk lærer af.

Anthropics seneste udvidelse til lægemiddelforskning er det seneste tegn på, at kunstig intelligens bevæger sig ud over generel formål og ind i anvendt videnskab. Det afspejler en reel fremdrift i feltet og en voksende tillid til, at AI kan betydeligt forme, hvordan nye mediciner opfindes. Men hvis målet er at forbedre klinisk succes – og ikke blot accelerere opdagelse – bør vi spørge, om den biologiske data, der ligger til grund for disse systemer, er i stand til at lære dem, hvad menneskebiologi faktisk ligner.

I årevis har branchens fokus været på at bygge stadig mere avancerede algoritmer. Større modeller, mere beregning og bedre arkitektur har drevet bemærkelsesværdige fremskridt i proteinstrukturforudsigelse, målidentifikation, molekylær design og andre områder af biomedicinsk forskning. Disse innovationer fortjener den opmærksomhed, de har fået.

Hvad der har fået langt mindre opmærksomhed, er den biologiske grundlag under dem.

AI er exceptionelt god til at finde mønstre. Men den kan ikke skelne mellem biologi, der blot er målbart, og biologi, der faktisk er prædictiv for, hvad der sker hos patienter. Loftet for AI-drevet lægemiddelforskning vil ultimativt blive bestemt ikke kun af modellernes intelligens, men af den biologiske datas troværdighed, der bruges til at træne, validerer og benchmark dem. Hvis vi vil have, at AI leverer bedre mediciner og ikke blot hurtigere hypoteser, kan opbygning af en højkvalitets menneskebiologisk datainfrastruktur vise sig at være lige så vigtig som opbygning af den næste generation af AI selv.

AI kan kun lære af den biologi, vi giver det

Hver AI-model er begrænset af den information, den lærer af. Lægemiddelforskning stiller et særligt svært problem, fordi biologi er ekstraordinært kompleks. Menneskesygdomme påvirkes af genetik, alder, køn, komorbiditeter, immunsvar, miljøpåvirkninger og tusinder af interagerende molekylærer vej, der kun delvist er forstået.

Historisk set er det meste af den eksperimentelle data, der er brugt i lægemiddelforskning, kommet fra dyrestudier, udødelige celler, simplificerede in vitro-systemer og computersimulationer. Disse værktøjer har fremmet biomedicinsk videnskab enormt og er stadig uundværlige på mange stadier af forskning. Men årtiers erfaring har også vist, at de ikke fuldt ud kan reproducere menneskefysiologi.

Cirka 90% af lægemiddelkandidater, der indgår i kliniske forsøg, fejler ultimativt, med manglende effektivitet og uventede sikkerhedsfund som væsentlige bidragydere. Mens mange faktorer bidrager til disse fejl, er en tilbagevendende tema, at prækliniske modeller ofte kæmper med at forudsige, hvad der faktisk sker hos patienter.

Hvis AI-systemer primært trænes på data genereret fra modeller, der selv har kendte translational begrænsninger, burde det ikke være overraskende, hvis disse begrænsninger består. AI kan genkende mønstre bemærkelsesværdigt godt, men den kan ikke opfinde biologisk sandhed, der aldrig var til stede i dens træningsdata.

Mere data er ikke nødvendigvis bedre data

AI-fællesskabet taler ofte om skala-love: observationen af, at større datasæt ofte forbedrer modelpræstation. I biologi er kvantitet og kvalitet dog ikke udskiftelige. Millioner af datapunkter indsamlet fra eksperimentelle systemer, der dårligt afspejler menneskefysiologi, kan tilbyde mindre prædictiv værdi end mindre datasæt genereret direkte fra klinisk relevant menneskebiologi. Denne forskel bliver særligt vigtig i lægemiddelforskning, hvor målet er ikke blot forudsigelse, men forudsigelse, der oversætter til succesfulde patientresultater.

Højtroværdig menneskebiologisk data adskiller sig fra traditionelle laboratoriedatasæt på flere vigtige måder. Den fanger biologisk funktion i stedet for statiske snapshots. Den bevarede forhold mellem væv, cellearkitektur, perfusion, metabolisme og farmakologi. Den inkorporerer patienthistorie, kliniske karakteristika, molekylære målinger og funktionelle svar inden for samme biologiske system. Mest vigtigt er, at den måler biologi, der faktisk findes hos mennesker.

Da AI bliver stadig mere kapabel til at udtrække subtile mønstre fra komplekse data, bliver kvaliteten af disse mønstre uløseligt forbundet med kvaliteten af den underliggende biologi.

Næste konkurrencefordel kan være menneskebiologisk infrastruktur

I de seneste år er enorme investeringer gået til grundmodeller, beregningsinfrastruktur og specialiserede AI-arkitekturer. Langt mindre opmærksomhed er blevet rettet mod den infrastruktur, der kræves til systematisk at generere højkvalitets menneskebiologisk data i stor skala.

Menneskebiologiske prøver er naturligt begrænsede og kræver integration med nogen form for donationsinfrastruktur. Standardisering forbliver udfordrende. Eksperimentelle protokoller må være reproducerbare. Metadata må være omfattende. Multiomiske målinger, billedanalyse, funktionelle tests og klinisk kontekst må alle integreres i datasæt, der er tilstrækkeligt konsistente for computermæssig læring.

Ingen af dette ligner traditionel softwareudvikling. I stedet kræver det koordinerede biologiske operationer, der kan producere reproducerbare, regulator-klare datasæt over mange år. Lige som cloud-infrastruktur blev essentiel for moderne softwareudvikling, kan menneskebiologisk infrastruktur blive grundlæggende for den næste generation af AI-drevne terapier. Organisationerne, der investerer i denne infrastruktur i dag, kan ultimativt forme, hvad morgendagens AI-modeller er i stand til at lære.

Regulatorer bevæger sig i denne retning

Vigtigt er, at denne diskussion udstrækker sig ud over akademisk nysgerrighed. Regulatorer selv er stadig mere fokuserede på menneske-relevant bevis. FDA har udvidet sin støtte til New Approach Methodologies (NAMs), hvor de har fastlagt veje, hvorved computermæssige modeller, organ-på-chip-teknologier, avancerede in vitro-systemer og andre menneske-relevante tilgange kan bidrage til regulatoriske beslutninger.

Denne skift anerkender en vigtig realitet. Da computermæssige metoder bliver mere avancerede, afhænger tilliden til deres forudsigelser af tilliden til den biologiske bevisning, der støtter dem. Hvis bedre AI kræver bedre validering, og bedre validering kræver bedre menneskebiologisk data, så må bedre AI også kræve bedre menneskebiologisk data, der ligger til grund for hver model.

Næste årti vil blive defineret af datakvalitet

Lægemiddelindustrien har oplevet flere teknologiske revolutioner fra high-throughput screening til next-generation sequencing. Hver udvidede datavolumenet, men anvendelsen af AI i dette felt repræsenterer noget andet.

Dets succes afhænger ikke kun af at producere mere data, men af at producere data, der mere trofast repræsenterer menneskebiologi. Da grundmodeller bliver stadig mere tilgængelige, kan algoritme-fordele alene blive mindre varige. Adgang til differentieret, højkvalitets menneskebiologisk data kan i stedet opstå som en af de definerende konkurrencefordele på tværs af lægemiddeløkosystemet. Dette er særligt sandt, hvis industriens ultimative mål er at forbedre klinisk succes og ikke blot accelerere opdagelse.

Anthropics indtræden i lægemiddelforskning afspejler den bemærkelsesværdige fremdrift, AI har gjort i de seneste år. Det fremhæver også det næste spørgsmål, industrien må besvare. Hvis AI virkelig har potentialet til at transformere medicin, hvilket biologisk grundlag vil disse modeller så stå på?

Fremtiden for AI-drevet lægemiddelforskning vil uden tvivl afhænge af bedre algoritmer. Men den kan også afhænge mere af opbygning af en menneskebiologisk datainfrastruktur, der kan lære disse algoritmer, hvad menneskebiologi faktisk ligner.

Dr. Jenna DiRito er medstifter og administrerende direktør i Revalia Bio. Hendes arbejde fokuserer på at opbygge menneskebiologisk datainfrastruktur til at understøtte AI-drevet lægemiddeludvikling, translationsvidenskab og regulativ adoption af menneskebaserede modeller til forskning.