AI-mallit ja alustat
Tutkijat kehittivät selitettävän neuronverkon geenien sääntöjen löytämiseksi

Tutkijaryhmä on vastikään luonut selitettävän neuronverkon, jonka tarkoituksena on auttaa biologeja paljastamaan ihmisgenomin salaperäiset säännöt. Tutkijaryhmä koulutti neuronverkon proteiini-DNA-vuorovaikutusten kartoista, mahdollistaen AI:n löytää, miten tiettyjä DNA-sekvenssejä säätelevät tiettyjä geenejä. Tutkijat tekivät myös mallin selitettäväksi, jotta he voivat analyysin avulla selvittää, miten mallin johtopäätökset muodostuvat ja miten sekvenssimotivoilla säätelevät geenejä.
Yksi suurista biologian mysteereistä on genomin säätelykoodi. On tiedossa, että DNA koostuu neljästä nukleotidiemästä – Adeniinista, Guaniinista, Tymiinistä ja Sytosiinista – mutta ei tiedetä, miten näitä emäksiä käytetään säätelyyn. Neljä nukleotidiemästä koodaavat ohjeet proteiinien rakentamiseksi, mutta ne myös ohjaavat, missä ja miten geenejä ilmennetään (miten ne tuottavat proteiineja eliössä). Tiettyjen emästen yhdistelmät ja järjestelyt luovat säätelykoodin osia, jotka sitoutuvat DNA-segmentteihin, ja ei tiedetä, mitkä nämä yhdistelmät ovat.
Tietokoneiden ja biologian tutkijoiden monitieteinen ryhmä lähti ratkaisemaan tätä mysteeriä luomalla selitettävän neuronverkon. Tutkijaryhmä loi neuronverkon, jonka he kutsuivat “Base Pair Networkiksi” tai “BPNetiksi”. BPNetin käyttämä malli, joka tuottaa ennusteita, voidaan tulkita säätelykoodeja. Tämä saavutettiin ennustamalla, miten proteiinit, transkriptiofaktorit, sitoutuvat DNA-sekvensseihin.
Tutkijat suorittivat useita kokeita ja tekivät kattavaa tietokonemallinnusta määrittääkseen, miten transkriptiofaktorit ja DNA sitoutuvat toisiinsa, luoden yksityiskohtaisen kartan yksittäisten nukleotidiemästen tasolle. Yksityiskohtaiset transkriptiofaktori-DNA-edustukset antoivat tutkijoille työkalut, joilla voidaan tulkita sekä kriittisiä DNA-sekvenssimuotoja että sääntöjä, jotka toimivat säätelykoodina.
Stanfordin yliopiston biologi ja tietokonetutkija Julia Zeitlinger totesi, että selitettävän neuronverkon tulokset vastasivat olemassa olevia kokeellisia tuloksia, mutta ne sisälsivät myös yllättäviä näkemyksiä genomin säätelykoodista. Esimerkiksi AI-malli mahdollisti tutkijoiden löytää säännön, joka vaikuttaa siihen, miten transkriptiofaktori Nanog toimii. Kun useita Nanog-motivoita on samalla puolella DNA-kaksoiskierteessä, ne sitoutuvat DNA:han yhteistyössä. Kuten Zeitlinger selitti Science Dailyn kautta
“On ollut pitkä polku kokeellisia todisteita siitä, että tällainen motiivin periodisuus joskus on olemassa säätelykoodissa. Kuitenkin tarkat olosuhteet olivat hämäriä, eikä Nanog ollut epäilty. Sen löytäminen, jolla on tällainen malli, ja näkeminen lisätietoja sen vuorovaikutuksista, oli yllättävää, koska emme erityisesti etsineet tätä mallia.”
Tuore tutkimusartikkeli ei ole ensimmäinen tutkimus, jossa AI:ta on käytetty DNA:n analysointiin, mutta se on todennäköisesti ensimmäinen tutkimus, jossa “mustan laatikon” AI:ta on avattu, jotta voidaan selvittää, mitkä DNA-sekvenssit säätelevät geenejä genomissa. Neuronverkot ovat erittäin hyviä löytämään kuvioita datasta, mutta niiden havainnot ovat vaikeita erottaa malleista, joita ne luovat. Luomalla menetelmän, jolla voidaan analysoida, mitkä piirteet malli pitää tärkeinä genomin sääntöjen ennustamisessa, tutkijat voivat kouluttaa hienostuneempia malleja, jotka johtavat uusiin löytöihin.
BPNetin arkkitehtuuri on samankaltainen kuin verkot, joita käytetään kasvojen tunnistamiseen kuvissa. Kun tietokoneen näköjärjestelmät tunnistavat kasvot kuvissa, verkko alkaa havainnoida reunoja ja yhdistää ne. Ero on, että BPNet oppii DNA-sekvensseistä, havainnoi sekvenssimotivoita ja yhdistää nämä motivit ylemmän tason sääntöihin, joita voidaan käyttää ennustamaan tietojen sitoutumista emäsresoluution tasolla.
Kun malli on saavuttanut korkean tarkkuuden kynnyksen, mallin oppimat kuvioita johdetaan takaisin alkuperäisiin syötesekvensseihin, paljastaen sekvenssimotivoita. Lopuksi mallille annetaan systemaattisia DNA-sekvenssikyselyjä, jolloin tutkijat voivat ymmärtää säännöt, joilla sekvenssimotivoita yhdistetään ja toimivat. Zeitlingerin mukaan malli pystyy ennustamaan paljon enemmän sekvenssejä kuin tutkijat voivat toivoa testata perinteisessä, kokeellisessa tyylissä. Lisäksi ennustamalla kokeellisten poikkeamien tulokset tutkijat voivat tunnistaa, mitkä kokeet olivat informatiivisimmat mallin validoinnissa.












