AI-modeller og plattformer

AI-forskere utvikler forklarbar neural nettverk for å oppdage genetiske regler

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et team av forskere har nylig utviklet et forklarbar neural nettverk som skal hjelpe biologer med å avdekke de mystiske reglene som styrer koden i det menneskelige genomet. Forskerne har trenet et neural nettverk på kart over protein-DNA-interaksjoner, og gjort det mulig for AI å oppdage hvordan bestemte DNA-sekvenser regulerer bestemte gener. Forskerne har også gjort modellen forklarbar, så de kan analysere modellens konklusjoner og bestemme hvordan sekvensmotiver regulerer gener.

En av de store mysterier i biologien er den regulerende koden i genomet. Det er kjent at DNA består av fire nukleotidbaser – Adenin, Guanin, Thymin og Cytosin – men det er ikke kjent hvordan disse baseparene brukes til å regulere aktivitet. De fire nukleotidbasene koder for instruksjoner for å bygge proteiner, men de kontrollerer også hvor og hvordan gener uttrykkes, (hvordan de produserer proteiner i en organisme). Bestemte kombinasjoner og arrangeringer av basene skaper seksjoner av regulerende kode som binder til segmenter av DNA, og det er ukjent hva disse kombinasjonene er.

Et tverrfaglig team av datavitenskapsmenn og biologer satte ut for å løse dette mysteriet ved å utvikle et forklarbar neural nettverk. Forskerne utviklet et neural nettverk de kalte “Base Pair Network” eller “BPNet”. Modellen som BPNet bruker til å generere prediksjoner, kan tolkes for å identifisere regulerende koder. Dette ble oppnådd ved å prediktere hvordan proteiner kalt transkripsjonsfaktorer binder med DNA-sekvenser.

Forskerne utførte en rekke eksperimenter og gjorde omfattende datamodellering for å bestemme hvordan transkripsjonsfaktorer og DNA var bundet sammen, og utviklet et detaljert kart ned til individuelle nukleotidbaser. De detaljerte representasjonene av transkripsjonsfaktor-DNA lot forskerne utvikle verktøy som kunne tolke både kritiske DNA-sekvensmønster og regler som fungerer som regulerende kode.

Julia Zeitlinger, PhD-biolog og datavitenskapsforsker ved Stanford University, forklarte at resultater fra det forklarbare neural nettverket sammenfalt med eksisterende eksperimentelle resultater, men de inneholdt også overraskende innsikter i den regulerende koden i genomet. Som et eksempel, lot AI-modellen forskerne oppdage en regel som påvirker hvordan en transkripsjonsfaktor kalt Nanog fungerer. Når flere eksemplarer av Nanog-motivet er til stede på samme side av en DNA-dobbelthelix, binder de sammen til DNA. Som Zeitlinger forklarte via ScienceDaily:

“Det har vært en lang rekke av eksperimentelle bevis som viser at slike motivperiodisiteter noen ganger eksisterer i den regulerende koden. Men de eksakte omstendighetene var flyktige, og Nanog hadde ikke vært en mistenkt. Å oppdage at Nanog har en slik mønster, og se ytterligere detaljer om dens interaksjoner, var overraskende fordi vi ikke spesifikt søkte etter dette mønsteret.”

Den nyeste forskningsartikkelen er langt ifra den første studien som bruker AI til å analysere DNA, men det er sannsynligvis den første studien som åpner den “svarte boksen” i AI for å bestemme hvilke DNA-sekvenser regulerer gener i genomet. Neurale nettverk er gode til å finne mønster i data, men deres innsikter er vanskelige å trekke ut av modellene de skaper. Ved å utvikle en metode for å analysere hvilke egenskaper modellen regner som viktige for prediksjonen av genetiske regler, kunne forskerne trene mer nyanserte modeller som ledet til nye oppdagelser.

Arkitekturen i BPNet er lignende nettverk som brukes til å gjenkjenne ansikter i bilder. Når computersynssystemer gjenkjenner ansikter i bilder, starter nettverket med å detektere kanter og deretter kombinere disse kantene. Forskjellen er at BPNet lærer fra DNA-sekvenser, detekterer sekvensmotiver og kombinerer disse motivene til høyere-ordens regler som kan brukes til å prediktere binding av data på base-nivå.

Etter at modellen har nådd en høy nøyaktighetsgrense, spores mønsterene som er lært av modellen tilbake til de opprinnelige inndata-sekvensene, og avslører sekvensmotivene. Til slutt blir modellen gitt systematiske DNA-sekvensforespørsler, som lar forskerne forstå reglene for hvordan sekvensmotiver kombinerer og fungerer. Ifølge Zeitlinger er modellen i stand til å prediktere mange flere sekvenser enn forskerne kunne håpe å teste i en tradisjonell, eksperimentell måte. I tillegg lar prediksjonen av resultatet av eksperimentelle anomali forskerne identifisere hvilke eksperimenter som var mest informerende når de validerer modellen.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.