AI-modeller og platforme

AI-forskere udvikler forklarlig neuralt netværk til at opdage genetiske regler

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et hold af forskere har nylig oprettet et forklarligt neuralt netværk med det formål at hjælpe biologer med at afkode de mystiske regler, der styrer koden i det menneskelige genom. Forskerholdet trænede et neuralt netværk på kort over protein-DNA-interaktioner, hvilket gjorde det muligt for AI at opdage, hvordan bestemte DNA-sekvenser regulerer bestemte gener. Forskerne gjorde også modellen forklarlig, så de kunne analysere modellens konklusioner og bestemme, hvordan sekvensmotiver regulerer gener.

En af de store mysterier i biologien er den regulerende kode i genomet. Det er kendt, at DNA består af fire nukleotidbaser – Adenin, Guanin, Thymin og Cytosin – men det er ikke kendt, hvordan disse basepar bruges til at regulere aktivitet. De fire nukleotidbaser koder instruktionerne for opbygning af proteiner, men de kontrollerer også, hvor og hvordan gener udtrykkes, (hvor de producerer proteiner i en organisme). Bestemte kombinationer og arrangementer af baserne skaber sekvenser af regulerende kode, der binder til segmenter af DNA, og det er ukendt, hvad disse kombinationer er.

Et tværfagligt hold af computerforskere og biologer satte sig for at løse dette mysterium ved at oprette et forklarligt neuralt netværk. Forskerholdet oprettede et neuralt netværk, som de kaldte “Base Pair Network” eller “BPNet”. Modellen, som BPNet brugte til at generere forudsigelser, kan fortolkes for at identificere regulerende koder. Dette blev opnået ved at forudsige, hvordan proteiner kaldet transkriptionsfaktorer binder til DNA-sekvenser.

Forskerne udførte en række eksperimenter og udførte omfattende computermodellering for at bestemme, hvordan transkriptionsfaktorer og DNA var bundet sammen, og udviklede en detaljeret kort ned til niveauet for enkelt nukleotidbaser. De detaljerede transkriptionsfaktor-DNA-repræsentationer gjorde det muligt for forskerne at oprette værktøjer, der kan fortolke både kritiske DNA-sekvensmønstre og regler, der fungerer som regulerende kode.

Julia Zeitlinger, PhD-biolog og computorforsker ved Stanford University, forklarede, at resultaterne fra det forklarlige neuralt netværk sammenfaldt med eksisterende eksperimentelle resultater, men de indeholdt også overraskende indsigt i den regulerende kode i genomet. Som eksempel gjorde AI-modellen det muligt for forskerholdet at opdage en regel, der påvirker, hvordan en transkriptionsfaktor kaldet Nanog fungerer. Når multiple eksemplarer af Nanog-motivet er til stede på samme side af en DNA-dobbelt-helix, binder de samarbejdende til DNA. Som Zeitlinger forklarede via ScienceDaily:

“Der har været en lang række af eksperimentelle beviser for, at sådanne motif-periode eksisterer i den regulerende kode. Men de præcise omstændigheder var uundgåelige, og Nanog havde ikke været en mistænkt. At opdage, at Nanog har sådan en mønster, og at se yderligere detaljer om dets interaktioner, var overraskende, fordi vi ikke specifikt ledte efter denne mønster.”

Den seneste forskningsartikel er langt fra den første studie, der bruger AI til at analysere DNA, men det er sandsynligvis den første studie, der åbner “sorte boks” af AI for at bestemme, hvilke DNA-sekvenser regulerer gener i genomet. Neurale netværk er gode til at finde mønstre i data, men deres indsigt er svær at trække ud af de modeller, de opretter. Ved at oprette en metode til at analysere, hvilke funktioner modellen betragter som vigtige for forudsigelsen af genetiske regler, kunne forskerne træne mere nuancerede modeller, der fører til nye opdagelser.

Arkitekturen i BPNet ligner netværk, der bruges til at genkende ansigter i billeder. Når computersystemer til genkender ansigter i billeder, starter netværket med at detektere kanter og derefter forbinder disse kanter sammen. Forskellen er, at BPNet lærer fra DNA-sekvenser, detekterer sekvensmotiver og forbinder disse motiver sammen i højere ordens regler, der kan bruges til at forudsige binding af data på base-niveau.

Efter at modellen har nået en høj nøjagtighedstærskel, spores mønstrene, som modellen har lært, tilbage til de oprindelige input-sekvenser, hvilket afslører sekvensmotiverne. Til sidst gives modellen systematiske DNA-sekvensforespørgsler, hvilket giver forskerne mulighed for at forstå reglerne for, hvordan sekvensmotiver kombinerer og fungerer. Ifølge Zeitlinger er modellen i stand til at forudsige mange flere sekvenser, end forskerne kunne håbe at teste i en traditionel, eksperimentel facon. Derudover giver forudsigelsen af eksperimentelle anomalier forskerne mulighed for at identificere, hvilke eksperimenter var mest informativ, når de validerer modellen.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.