Thought leaders

Het dataprobleem in het hart van AI-gestuurde geneesmiddelontdekking

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Terwijl AI snel ingebed wordt in geneesmiddelontdekking, is de belangrijkste vraag misschien niet hoe krachtig het volgende model zal zijn, maar wat voor soort data die modellen daadwerkelijk leren van.

De recente expansie van Anthropic naar geneesmiddelontwikkeling is het laatste teken dat kunstmatige intelligentie verder gaat dan algemene redenering en zich richt op toegepaste wetenschap. Dit weerspiegelt een echte impuls in het veld en een groeiend vertrouwen dat AI de manier waarop nieuwe medicijnen worden ontdekt, significant kan veranderen. Maar als het doel is om de klinische succesratio te verbeteren – en niet alleen de ontdekking te versnellen – zouden we moeten vragen of de biologische data die ten grondslag liggen aan deze systemen, in staat zijn om hen te leren wat de menselijke biologie eigenlijk lijkt.

Jarenlang heeft de industrie zich gericht op het bouwen van steeds geavanceerdere algoritmes. Grotere modellen, meer berekeningen en betere architectuur hebben opmerkelijke vooruitgang geboekt in eiwitstructuurvoorspelling, doelidentificatie, moleculaire ontwerp en andere gebieden van biomedisch onderzoek. Die innovaties verdienen de aandacht die ze hebben gekregen.

Wat veel minder aandacht heeft gekregen, is de biologische basis ervan.

AI is uitzonderlijk goed in het vinden van patronen. Maar het kan niet onderscheiden tussen biologie die alleen meetbaar is en biologie die echt voorspellend is voor wat er in patiënten gebeurt. Het plafond voor AI-gestuurde geneesmiddelontdekking zal uiteindelijk worden bepaald, niet alleen door de intelligentie van de modellen, maar door de kwaliteit van de menselijke data die worden gebruikt om ze te trainen, valideren en benchmarken. Als we willen dat AI betere medicijnen levert in plaats van alleen snellere hypothesen, kan het bouwen van een hoge-kwaliteit menselijke biologische gegevensinfrastructuur net zo belangrijk blijken te zijn als het bouwen van de volgende generatie AI.

AI kan alleen leren van de biologie die we het geven

Elk AI-model is beperkt door de informatie die het leert. Geneesmiddelontwikkeling vormt een bijzonder moeilijke uitdaging, omdat biologie buitengewoon complex is. Menselijke ziekte wordt beïnvloed door genetica, leeftijd, geslacht, comorbiditeiten, immuunreacties, omgevingsfactoren en duizenden interactieve moleculaire paden die nog maar gedeeltelijk worden begrepen.

Historisch gezien is veel van de experimentele data die in de geneesmiddelontwikkeling wordt gebruikt, afkomstig van dierstudies, onsterfelijke celculturen, vereenvoudigde in vitro-systemen en computationele simulaties. Deze instrumenten hebben de biomedische wetenschap enorm vooruit geholpen en blijven onmisbaar in veel fasen van het onderzoek. Maar decennia van ervaring hebben ook aangetoond dat ze de menselijke fysiologie niet volledig kunnen repliceren.

Ongeveer 90% van de kandidaat-geneesmiddelen die klinische proeven ingaan, falen uiteindelijk, waarbij gebrek aan werkzaamheid en onverwachte veiligheidsbevindingen belangrijke bijdragen zijn. Terwijl veel factoren bijdragen aan deze mislukkingen, is een terugkerend thema dat preklinische modellen vaak worstelen om te voorspellen wat er werkelijk in patiënten gebeurt.

Als AI-systemen voornamelijk worden getraind op data gegenereerd door modellen die zelf bekende translationele beperkingen hebben, is het niet verwonderlijk als die beperkingen aanhouden. AI kan patronen opmerkelijk goed herkennen, maar het kan geen biologische waarheid uitvinden die nooit in de trainingsdata aanwezig was.

Meer data is niet noodzakelijkerwijs betere data

De AI-gemeenschap spreekt vaak over schaalwetten: de observatie dat grotere datasets de prestaties van modellen vaak verbeteren. In biologie zijn echter kwantiteit en kwaliteit niet inwisselbaar. Miljoenen datapunten verzameld uit experimentele systemen die de menselijke fysiologie slecht weerspiegelen, kunnen minder voorspellende waarde bieden dan kleinere datasets gegenereerd uit klinisch relevante menselijke biologie. Dit onderscheid wordt vooral belangrijk in geneesmiddelontwikkeling, waar het doel niet alleen voorspelling is, maar voorspelling die zich vertaalt in succesvolle patiëntresultaten.

Hoge-kwaliteit menselijke biologische data verschilt van traditionele laboratoriumdatasets op verschillende belangrijke punten. Het vat biologische functionaliteit in plaats van statische momentopnames. Het behoudt relaties tussen weefsels, celarchitectuur, perfusie, metabolisme en farmacologie. Het omvat patiëntgeschiedenis, klinische kenmerken, moleculaire metingen en functionele reacties binnen hetzelfde biologische systeem. Het meet biologie die daadwerkelijk in mensen bestaat.

Naarmate AI steeds beter in staat is om subtiele patronen uit complexe data te extraheren, wordt de kwaliteit van die patronen onlosmakelijk verbonden met de kwaliteit van de onderliggende biologie.

De volgende concurrentievoordeel kan menselijke gegevensinfrastructuur zijn

In de afgelopen jaren zijn enorme investeringen gedaan in basismodellen, computationele infrastructuur en gespecialiseerde AI-architectuur. Veel minder aandacht is besteed aan de infrastructuur die nodig is om systematisch hoge-kwaliteit menselijke biologische data op grote schaal te genereren.

Menselijke biologische monsters zijn inherent beperkt en vereisen integratie met enige vorm van donatie-infrastructuur. Standaardisatie blijft een uitdaging. Experimentele protocollen moeten reproduceerbaar zijn. Metagegevens moeten uitgebreid zijn. Multi-omische metingen, beeldvorming, functionele assays en klinische context moeten allemaal worden geïntegreerd in datasets die voldoende consistent zijn voor computationeel leren.

Niets hiervan lijkt op traditionele software-engineering. In plaats daarvan vereist het gecoördineerde biologische operaties die in staat zijn om reproduceerbare, regulator-klaar datasets te produceren over vele jaren. Net zoals cloud-infrastructuur essentieel is geworden voor moderne software-ontwikkeling, kan menselijke biologische infrastructuur fundamenteler worden voor de volgende generatie AI-gestuurde therapeutica. De organisaties die vandaag investeren in die infrastructuur, kunnen uiteindelijk bepalen wat de AI-modellen van morgen in staat zullen zijn te leren.

Regulators bewegen zich in deze richting

Belangrijk is dat dit gesprek verder gaat dan academische nieuwsgierigheid. Regulators leggen steeds meer de nadruk op mens-relevante bewijzen. De FDA heeft de steun voor New Approach Methodologies (NAM’s) uitgebreid, waarin paden worden uitgestippeld voor computationele modellen, organ-op-chip-technologie, geavanceerde in vitro-systemen en andere mens-relevante benaderingen die kunnen bijdragen aan regulatorische besluitvorming.

Deze verschuiving erkent een belangrijke realiteit. Naarmate computationele methoden geavanceerder worden, hangt het vertrouwen in hun voorspellingen af van het vertrouwen in de biologische bewijzen die hen ondersteunen. Als beter AI beter validatie vereist, en beter validatie beter menselijke data vereist, dan moet beter AI beter menselijke data vereisen die aan de basis van elk model liggen.

Het komende decennium zal worden gedefinieerd door gegevenskwaliteit

De farmaceutische industrie heeft meerdere technologische revoluties meegemaakt, van high-throughput screening tot next-generation sequencing. Elk heeft het volume van beschikbare data uitgebreid, maar de toepassing van AI in dit veld vertegenwoordigt iets anders.

Het succes ervan hangt niet alleen af van het produceren van meer data, maar van het produceren van data die de menselijke biologie beter weerspiegelen. Naarmate foundation-modellen steeds toegankelijker worden, kunnen algoritme-voordelen alleen minder duurzaam worden. Toegang tot gedifferentieerde, hoge-kwaliteit menselijke biologische data kan in plaats daarvan een van de definiërende concurrentievoordelen worden in de farmaceutische ecosystemen. Dit is vooral waar als het uiteindelijke doel van de industrie het verbeteren van de klinische succesratio is en niet alleen het versnellen van de ontdekking.

De toetreding van Anthropic tot de geneesmiddelontwikkeling weerspiegelt de opmerkelijke vooruitgang die AI de afgelopen jaren heeft geboekt. Het benadrukt ook de volgende vraag die de industrie moet beantwoorden. Als AI daadwerkelijk het potentieel heeft om de geneeskunde te transformeren, wat voor biologische basis zullen die modellen dan staan?

De toekomst van AI-gestuurde geneesmiddelontdekking zal ongetwijfeld afhankelijk zijn van betere algoritmes. Maar het kan nog meer afhankelijk zijn van het opbouwen van een menselijke gegevensinfrastructuur die in staat is om die algoritmes te leren wat menselijke biologie eigenlijk lijkt.

Dr. Jenna DiRito is medeoprichter en Chief Operating Officer van Revalia Bio. Haar werk richt zich op het opbouwen van humane biologische gegevensinfrastructuur om AI-geactiveerde geneesmiddelenontwikkeling, translationele wetenschap en regulatoire adoptie van op mensen gebaseerde modellen voor onderzoek te ondersteunen.