Modely a platformy AI

Výzkumníci vyvinuli explainable neuronovou síť pro objevování genomických pravidel

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Tým výzkumníků nedávno vytvořil explainable neuronovou síť určenou k pomoci biologům odhalit tajemná pravidla, která řídí kód lidského genomu. Výzkumný tým trénoval neuronovou síť na mapách interakcí protein-DNA, což umožnilo síti objevit, jak určitá DNA sekvenční regulují určité geny. Výzkumníci také učinili model explainable, aby mohli analyzovat závěry modelu a určit, jak sekvence motivů regulují geny.

Jedna z velkých záhad v biologii je regulační kód genomu. Je známo, že DNA se skládá ze čtyř nukleotidových bází – Adeninu, Guaninu, Thyminu a Cytosinu – ale není známo, jak tyto báze páry regulují aktivitu. Čtyři nukleotidové báze kódují instrukce pro stavbu proteinů, ale také kontrolují, kde a jak se geny exprimují, (jak vytvářejí proteiny v organismu). Konkrétní kombinace a uspořádání bází vytvářejí sekce regulačního kódu, které se vážou na segmenty DNA, a není známo, co tyto kombinace jsou.

Mezioborový tým počítačových vědců a biologů se pokusil vyřešit tuto záhadu vytvořením explainable neuronové sítě. Výzkumný tým vytvořil neuronovou síť, kterou nazvali “Base Pair Network” nebo “BPNet”. Model použitý BPNet pro generování předpovědí lze interpretovat pro identifikaci regulačních kódů. To bylo dosaženo předpovědí, jak proteiny nazývané transkripční faktory vazebně interagují s DNA sekvencemi.

Výzkumníci provedli řadu experimentů a komplexní počítačové modelování, aby určili, jak transkripční faktory a DNA jsou vázány společně, a vytvořili detailní mapu až na úroveň jednotlivých nukleotidových bází. Detailní reprezentace transkripčních faktorů-DNA umožnily výzkumníkům vytvořit nástroje schopné interpretovat kritické DNA sekvence a pravidla, která fungují jako regulační kód.

Julia Zeitlinger, PhD bioložka a počítačová výzkumnice ze Stanfordovy univerzity, vysvětlila, že výsledky získané z explainable neuronové sítě souhlasily s existujícími experimentálními výsledky, ale také obsahovaly překvapivé poznatky o regulačním kódu genomu. Jako příklad uvedla, že model AI umožnil výzkumníkům objevit pravidlo, které ovlivňuje, jak transkripční faktor nazývaný Nanog funguje. Když jsou na stejné straně DNA dvojité helixy více instancí Nanog motivu, vazebně interagují s DNA. Jak Zeitlinger vysvětlila prostřednictvím ScienceDaily:

“Byla dlouhá stopa experimentálních důkazů, že taková motivická periodicitě někdy existuje v regulačním kódu. Nicméně, přesné okolnosti byly únikové, a Nanog nebyl podezřelý. Objev, že Nanog má takový vzorec, a vidění dalších detailů jeho interakcí, bylo překvapivé, protože jsme nezaměřovali na tento vzorec.”

Nedávná výzkumná práce je daleko od první studie, která používá AI pro analýzu DNA, ale je pravděpodobně první studií, která otevřela “černou skříňku” AI, aby zjistila, které DNA sekvenční regulují geny v genomu. Neuronové sítě excelují v nalezení vzorců v datech, ale jejich poznatky jsou obtížně extrahovatelné z modelů, které vytvářejí. Vytvořením metody pro analýzu, welche funkce model považuje za důležité pro předpověď genomických pravidel, mohli výzkumníci trénovat jemnější modely, které vedou k novým objevům.

Architektura BPNet je podobná sítím používaným pro rozpoznávání tváří v obrazech. Když počítačové vidění rozpoznává tváře v obrazech, síť začíná detekovat hrany a poté je spojuje. Rozdíl spočívá v tom, že BPNet se učí z DNA sekvencí, detekuje sekvence motivů a spojuje je do vyšších řádů pravidel, která lze použít pro předpověď vazby dat na úrovni bází.

Po dosažení vysoké přesnosti modelu jsou vzorce naučené modelem sledovány zpět k původním vstupním sekvencím, což odhaluje sekvence motivů. Nakonec je modelu poskytnuta systematická DNA sekvence dotazů, což umožňuje výzkumníkům pochopit pravidla, kterými sekvence motivů kombinují a fungují. Podle Zeitlinger je model schopen předpovědět mnoho více sekvencí, než by mohli výzkumníci doufat v tradičním, experimentálním stylu. Kromě toho předpověď výsledků experimentálních anomálií umožnila výzkumníkům identifikovat, které experimenty byly nejvíce informativní při validaci modelu.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.