Ajatusjohtajat

Datongelman lääkekehityksen sydämessä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kun tekoäly nopeasti vakiinnuttaa itsensä lääkekehitykseen, ehkä tärkein kysymys ei ole, kuinka voimakas seuraava malli on, vaan se, mitä dataa nuo mallit todella oppivat.

Anthropicsin tuore laajentuminen lääkekehitykseen on viimeisin merkki siitä, että tekoäly siirtyy yleispätevien päättelymenetelmien lisäksi soveltavaan tieteeseen. Se heijastaa todellista vauhtia alalla ja kasvavaa luottamusta siihen, että tekoäly voi merkittävästi muuttaa uusien lääkeaineiden kehittämistä. Mutta jos tavoitteena on parantaa kliinistä onnistumisprosenttia – eikä ainoastaan nopeuttaa kehittämistä – meidän pitäisi kysyä, onko biologinen data, jota nämä järjestelmät hyödyntävät, kykenevä opettamaan niille, miltä ihmisbiologia todella näyttää.

Vuosiin saakka alan keskittyminen on ollut rakentamaan yhä monimutkaisempia algoritmeja. Suuremmat mallit, enemmän laskentakapasiteettia ja paremmat arkkitehtuurit ovat ajaneet merkittäviä edistysaskelia proteiinirakenteen ennustamisessa, kohdetunnistuksessa, molekyylisuunnittelussa ja muilla biolääketieteellisen tutkimuksen aloilla. Nuo innovaatiot ansaitsevat huomionsa.

Mitä on saanut paljon vähemmän huomiota, on biologinen perusta niiden alla.

Tekoäly on poikkeuksellisen hyvä löytämään kuvioita. Mutta se ei voi erottaa biologiaa, joka on vain mitattavissa, ja biologiaa, joka on todella ennustettavissa siitä, mitä potilailla tapahtuu. Tekoälyvoimaisen lääkekehityksen katto määräytyy lopulta ei ainoastaan mallien älykkyyden vaan myös ihmisten biologisen datan laadun perusteella, jota käytetään kouluttamiseen, validointiin ja vertailuun. Jos haluamme tekoälyn toimittavan parempia lääkkeitä eikä ainoastaan nopeampia hypoteeseja, korkealaatuisen ihmisen biologisen datan infrastruktuurin rakentaminen saattaa osoittautua yhtä tärkeäksi kuin seuraavan tekoälysukupolven kehittäminen itsessään.

Tehtävä oppia biologiasta, jonka annamme sille

Jokainen tekoälymalli on rajoitettu tiedolla, jonka se oppii. Lääkekehitys esittää erityisen haasteellisen ongelman, koska biologia on erittäin monimutkainen. Ihmisen sairaudet vaikuttavat geneettisiin, ikään, sukupuoleen, komorbiditeetteihin, immuunivasteisiin, ympäristöaltistuksiin ja tuhansiin vuorovaikutuksiin molekyyliteitä, jotka ovat vain osittain ymmärretty.

Perinteisesti suurin osa kokeellisesta dataa, jota on käytetty lääkekehityksessä, on peräisin eläintutkimuksista, ikuisesti elävistä solulinjoista, yksinkertaistetuista in vitro -järjestelmistä ja laskennalllisista simulaatioista. Nämä työkalut ovat edistäneet merkittävästi biolääketieteellistä tiedettä ja ovat edelleen välttämättömiä monissa tutkimuksen vaiheissa. Viime kuitenkin osoittaa, etteivät ne voi täysin jäljitellä ihmisen fysiologiaa.

Suunnilleen 90 % lääkeehdokkaista, jotka aloittavat kliiniset kokeet, epäonnistuvat lopulta, ja niiden epäonnistumisen syynä on usein puute vaikuttavuudesta ja odottamattomat turvallisuuden löydökset. Vaikka moni tekijä vaikuttaa näihin epäonnistumisiin, yksi toistuva teema on, että prekliiniset mallit usein kamppailevat ennustamaan, mitä todella tapahtuu potilailla.

Jos tekoälyjärjestelmät koulutetaan pääasiassa malleista, joilla itsellään on tunnettu käännöshäiriö, ei pitäisi olla yllättävää, jos nämä rajoitukset jatkuvat. Tekoäly tunnistaakin kuvioita erinomaisesti, mutta se ei voi keksittyä biologista totuutta, jota sen koulutusdata ei sisällä.

Enemmän dataa ei välttämättä ole parempaa dataa

Tekoälyyhteisö puhuu usein skaalautumislaeista: havainnosta, että suuremmat tietokannat usein parantavat mallin suorituskykyä. Biologiassa kuitenkin määrä ja laatu eivät ole vaihtokelpoisia. Miljoonat datakohdat, jotka on kerätty kokeellisista järjestelmistä, jotka heijastelevat huonosti ihmisen fysiologiaa, voivat tarjota vähemmän ennustearvoa kuin pienemmät tietokannat, jotka on luotu suoraan kliinisesti merkityksellisestä ihmisen biologiasta. Tämä ero on erityisen tärkeä lääkekehityksessä, jossa tavoitteena ei ole ainoastaan ennustaminen vaan ennustaminen, joka kääntyy onnistuneiksi potilastuloksiksi.

Korkealaatuinen ihmisen biologinen data eroaa perinteisistä laboratoriotietokannoista useilla tärkeillä tavoin. Se havaitsee biologisen toiminnan eikä ainoastaan staattisia otoksia. Se säilyttää kudosten, solurakenteen, perfuusion, aineenvaihdunnan ja farmakologian väliset suhteet. Se sisältää potilaan historian, kliiniset ominaisuudet, molekyylimittaukset ja toiminnalliset reaktiot samassa biologisessa järjestelmässä. Ennen kaikkea se mittaakin biologiaa, joka todella esiintyy ihmisissä.

Kun tekoäly kehittyy yhä enemmän kykeneväksi havainnoimaan hienoja kuvioita monimutkaisesta datasta, niiden kuvioiden laatu tulee erottamattomaksi datan perustana olevan biologian laadusta.

Seuraava kilpailuetu saattaa olla ihmisen biologinen infrastruktuuri

Viime vuosina on tehty valtavat sijoitukset perusmalleihin, laskennalliseen infrastruktuuriin ja erikoistuneisiin tekoälyarkkitehtuureihin. Vähemmän huomiota on kiinnitetty infrastruktuuriin, jota tarvitaan korkealaatuisen ihmisen biologisen datan järjestelmälliseen tuottamiseen suuressa mittakaavassa.

Ihmisen biologiset näytteet ovat luonnostaan rajoitettuja ja vaativat jonkinlaista lahjoitusinfrastruktuuria. Standardisointi on haasteellista. Kokeelliset protokollat on oltava toistettavissa. Metatieto on oltava kattava. Moni-ominaisuusmittaukset, kuvantaminen, toiminnalliset testit ja kliininen konteksti kaikki vaativat integroimista tietokantoihin, jotka ovat riittävän yhdenmukaisia laskennallista oppimista varten.

Tämä ei muistuta perinteistä ohjelmistosuunnittelua. Sen sijaan se vaatii koordinoitua biologista toimintaa, joka pystyy tuottamaan toistettavissa ja sääntelijöiden hyväksymissä tietokannoissa useiden vuosien ajan. Niin kuin pilvi-infrastruktuuri on tullut välttämättömäksi modernille ohjelmistokehitykselle, ihmisen biologinen infrastruktuuri saattaa tulla perustavaksi seuraavalle tekoälyvoimalle lääkkeitä kehittäville.

Sääntelijät siirtyvät tähän suuntaan

Tärkeää on, että tämä keskustelu ulottuu akateemisen uteliaisuuden ulkopuolelle. Sääntelijät itse korostavat yhä enemmän ihmisten kannalta relevanttia näyttöä. FDA on laajentanut tukensa Uuden lähestymistavan menetelmiin (NAM), ja selittänyt polkuja, joilla laskennalliset mallit, mikropiiri-tekniikka, edistyneet in vitro -järjestelmät ja muut ihmisten kannalta relevantit lähestymistavat voivat vaikuttaa sääntelijöiden päätöksentekoon.

Tämä siirtyminen tunnustaa tärkeän tosiasian. Kun laskennalliset menetelmät kehittyvät yhä monimutkaisemmiksi, niiden ennusteiden luotettavuus riippuu biologisesta näytöstä, joka tukee niitä. Jos parempi tekoäly vaatii parempaa validointia, ja parempi validointi vaatii parempaa ihmisen dataa, niin parempi tekoäly vaatii parempaa ihmisen dataa, joka on jokaisen mallin lähtökohtana.

Seuraava vuosikymmen määritellään datan laadun mukaan

Lääketeollisuus on kokenut useita teknologisia vallankumouksia massatuotantotestauksesta seuraavaan sukupolven sekvensointiin. Jokainen laajensi saatavilla olevan datan määrää, mutta tekoälyn soveltaminen tässä alalla edustaa jotain erilaista.

Sen onnistuminen riippuu ei ainoastaan siitä, että se tuottaa enemmän dataa, vaan siitä, että se tuottaa dataa, joka edustaa uskollisemmin ihmisen biologiaa. Kun perusmallit tulevat yhä helpommin saataville, algoritmiin perustuvat edut voivat muodostua vähemmän kestäviksi. Pääsy eriytetylle, korkealaatuiselle ihmisen biologiselle datalle saattaa kehittyä yhdeksi määrittävistä kilpailueduista koko lääketeollisuuden ekosysteemissä. Tämä on erityisen totta, jos alan lopullinen tavoite on parantaa kliinistä onnistumista eikä ainoastaan nopeuttaa kehittämistä.

Anthropicsin sisäänastuminen lääkekehitykseen heijastaa tekoälyn tekemiä merkittäviä edistysaskelia viime vuosina. Se myös korostaa seuraavaa kysymystä, jonka alan on ratkaistava. Jos tekoälyllä on todella potentiaalia muuttaa lääketiedettä, mikä biologinen perusta tukisi näitä malleja?

Tekoälyvoimaisen lääkekehityksen tulevaisuus riippuu ilmanväliä paremmista algoritmeista. Mutta se saattaa riippua vielä enemmän ihmisen biologisen datan infrastruktuurin rakentamisesta, joka opettaa näille algoritmeille, miltä ihmisen biologia todella näyttää.

Tohtori Jenna DiRito on Revalia Bio -yrityksen perustaja ja toimitusjohtaja. Hänen työnsä keskittyy ihmisen biologisen datan infrastruktuurin rakentamiseen tukemaan tekoälypohjaista lääkekehitystä, translational tutkimusta ja sääntelyviranomaisten hyväksymistä ihmisperäisistä malleista tutkimukseen.