Tankeledare

Dataproblemet i hjärtat av AI-drivna läkemedelsupptäckter

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Medan AI snabbt blir en integrerad del av läkemedelsupptäckter, är kanske den viktigaste frågan inte hur kraftfull den nästa modellen kommer att vara, utan vad data som modellerna faktiskt lär sig från.

Anthropics senaste expansion in i läkemedelsutveckling är det senaste tecknet på att artificiell intelligens rör sig bortom allmänna resonemang och in i tillämpad vetenskap. Det speglar verklig framång i fältet och växande förtroende för att AI kan meningsfullt omforma hur nya läkemedel upptäcks. Men om målet är att förbättra kliniska framgångsgrader – och inte bara accelerera upptäckt – bör vi fråga oss om den biologiska data som ligger till grund för dessa system är kapabel att lära dem vad mänsklig biologi faktiskt ser ut som.

Under många år har branschens fokus varit på att bygga alltmer sofistikerade algoritmer. Större modeller, mer beräkningskraft och bättre arkitektur har drivit remarkabla framsteg inom proteinstrukturprediktion, målidentifiering, molekylär design och andra områden av biomedicinsk forskning. Dessa innovationer förtjänar den uppmärksamhet de har fått.

Vad som har fått betydligt mindre uppmärksamhet är den biologiska grunden under dem.

AI är exceptionellt bra på att hitta mönster. Men den kan inte skilja mellan biologi som bara är mätbar och biologi som faktiskt är förutsägande för vad som händer i patienter. Taket för AI-drivna läkemedelsupptäckter kommer slutligen att bestämmas inte bara av modellernas intelligens, utan av den mänskliga data som används för att träna, validera och utvärdera dem. Om vi vill att AI ska leverera bättre läkemedel snarare än bara snabbare hypoteser, kan byggandet av högkvalitativ mänsklig biologisk datainfrastruktur visa sig vara lika viktigt som att bygga nästa generation av AI.

AI kan bara lära sig från den biologi vi ger den

Varje AI-modell är begränsad av den information den lär sig från. Läkemedelsutveckling presenterar ett särskilt svårt problem eftersom biologi är oerhört komplex. Mänskliga sjukdomar påverkas av genetik, ålder, kön, samtidiga sjukdomar, immunreaktioner, miljöexponering och tusentals interagerande molekylära vägar som förblir delvis outforstådda.

Historiskt har en stor del av den experimentella data som används under läkemedelsutveckling kommit från djurstudier, odödliga cellinjer, förenklade in vitro-system och datorsimulationer. Dessa verktyg har främjat biomedicinsk vetenskap avsevärt och förblir oumbärliga under många stadier av forskning. Men decennier av erfarenhet har också visat att de inte kan fullständigt replikera mänsklig fysiologi.

Ungefär 90% av läkemedelskandidater som går in i kliniska prövningar misslyckas slutligen, med brist på effektivitet och oväntade säkerhetsfynd som stora bidragsgivare. Medan många faktorer bidrar till dessa misslyckanden, är ett återkommande tema att prekliniska modeller ofta kämpar för att förutsäga vad som faktiskt händer i patienter.

Om AI-system tränas primärt på data genererad från modeller som i sig har kända translationala begränsningar, borde det inte vara förvånande om dessa begränsningar kvarstår. AI kan känna igen mönster på ett remarkabelt sätt, men den kan inte uppfinna biologisk sanning som aldrig fanns i dess träningsdata.

Mera data är inte nödvändigtvis bättre data

AI-gemenskapen talar ofta om skalningslagar: observationen att större datamängder ofta förbättrar modellprestanda. I biologi är dock kvantitet och kvalitet inte utbytbara. Miljontals datapunkter insamlade från experimentella system som dåligt återspeglar mänsklig fysiologi kan erbjuda mindre prediktivt värde än mindre datamängder genererade direkt från kliniskt relevanta mänskliga biologiska system. Denna distinktion blir särskilt viktig i läkemedelsutveckling, där målet är inte bara förutsägelse utan förutsägelse som översätts till framgångsrika patientresultat.

Högkvalitativ mänsklig biologisk data skiljer sig från traditionella laboratoriedatamängder på flera viktiga sätt. Den fångar biologisk funktion snarare än statiska ögonblicksbilder. Den bevarar relationer mellan vävnader, cellarkitektur, perfusion, metabolism och farmakologi. Den inkorporerar patienthistoria, kliniska egenskaper, molekylära mätningar och funktionella svar inom samma biologiska system. Det viktigaste är att den mäter biologi som faktiskt existerar i människor.

Medan AI blir alltmer kapabelt att extrahera subtila mönster från komplexa data, blir kvaliteten på dessa mönster oupplösligt förbunden med kvaliteten på den underliggande biologin.

Nästa konkurrensfördel kan vara mänsklig datainfrastruktur

Under de senaste åren har enorma investeringar gått till grundmodeller, beräkningsinfrastruktur och specialiserade AI-arkitekturer. Mycket mindre uppmärksamhet har ägnats åt den infrastruktur som krävs för att systematiskt generera högkvalitativ mänsklig biologisk data i stor skala.

Mänskliga biologiska prover är medfött begränsade och kräver integration med någon form av donationsinfrastruktur. Standardisering förblir utmanande. Experimentella protokoll måste vara reproducerbara. Metadata måste vara omfattande. Multiomiska mätningar, avbildning, funktionella tester och klinisk kontext behöver alla integreras i datamängder som är tillräckligt konsekventa för datorbaserat lärande.

Inget av detta liknar traditionell programvaruutveckling. Istället kräver det samordnade biologiska operationer som kan producera reproducerbara, regulator-klara datamängder under många år. Precis som molninfrastruktur blev avgörande för modern programvaruutveckling, kan mänsklig biologisk infrastruktur bli grundläggande för nästa generation av AI-drivna terapier. Organisationerna som investerar i den infrastrukturen idag kan slutligen forma vad morgondagens AI-modeller är kapabla att lära sig.

Regulatorer rör sig i den här riktningen

Viktigt nog sträcker sig denna diskussion bortom akademisk nyfikenhet. Regulatorer betonar alltmer mänskligt relevanta bevis. FDA har utvidgat sitt stöd för nya tillvägagångssätt för metodutveckling (NAM), och har fastställt vägar för hur datorbaserade modeller, organ-på-chip-teknologier, avancerade in vitro-system och andra mänskligt relevanta tillvägagångssätt kan bidra till regulatoriska beslutsprocesser.

Denna förändring erkänner en viktig verklighet. Medan datorbaserade metoder blir alltmer sofistikerade, beror förtroendet för deras förutsägelser på förtroendet för den biologiska bevisningen som stöder dem. Om bättre AI kräver bättre validering, och bättre validering kräver bättre mänsklig data, då kräver bättre AI bättre mänsklig data som ligger till grund för varje modell.

Nästa decennium kommer att definieras av datakvalitet

Läkemedelsindustrin har upplevt flera tekniska revolutioner, från höggenomströmningsskäring till nästa generations sekvensering. Var och en utvidgade volymen av tillgänglig data, men tillämpningen av AI i detta område representerar något annat.

Dess framgång beror inte bara på att producera mer data, utan på att producera data som mer troget representerar mänsklig biologi. Medan grundmodeller blir alltmer tillgängliga, kan algoritmiska fördelar ensamma bli mindre varaktiga. Tillgång till differentierad, högkvalitativ mänsklig biologisk data kan istället dyka upp som en av de avgörande konkurrensfördelarna inom läkemedels ekosystemet. Detta är särskilt sant om industrins slutgiltiga mål är att förbättra kliniska framgångar snarare än att bara accelerera upptäckt.

Anthropics inträde i läkemedelsutveckling speglar den remarkabla framgång som AI har gjort under de senaste åren. Det lyfter också fram nästa fråga som industrin måste besvara. Om AI verkligen har potentialen att omvandla medicin, vad biologisk grund kommer dessa modeller att stå på?

Framtiden för AI-drivna läkemedelsupptäckter kommer utan tvekan att bero på bättre algoritmer. Men den kan bero ännu mer på att bygga den mänskliga datainfrastruktur som kan lära dessa algoritmer vad mänsklig biologi faktiskt ser ut som.

Dr. Jenna DiRito är medgrundare och Chief Operating Officer för Revalia Bio. Hennes arbete fokuserar på att bygga mänsklig biologisk datainfrastruktur för att stödja AI-aktiverad läkemedelsutveckling, translational vetenskap och regulatorisk antagande av mänskliga modeller för forskning.