Ochrona zdrowia
Sztuczna inteligencja wykorzystywana do identyfikacji sekwencji aktywacji genów i znajdowania genów powodujących choroby

Sztuczna inteligencja odgrywa coraz większą rolę w nauce o genomice każdego dnia. Niedawno zespół badaczy z UC San Diego wykorzystał sztuczną inteligencję do odkrycia kodu DNA, który może otworzyć drogę do kontrolowania aktywacji genów. Ponadto, badacze z australijskiej organizacji naukowej CSIRO wykorzystali algorytmy sztucznej inteligencji do analizy ponad jednego trylionu punktów danych genetycznych, co posunęło nasze zrozumienie ludzkiego genomu i umożliwiło zlokalizowanie konkretnych genów powodujących choroby.
Ludzki genom, a także wszystkie DNA, składają się z czterech różnych zasad chemicznych: adeniny, guaniny, tyminy i cytozyny, skrótowo oznaczanych jako A, G, T i C. Te cztery zasady łączą się w różnych kombinacjach, które kodują różne geny. Około jedną czwartą wszystkich ludzkich genów kodują sekwencje genetyczne, które są zbliżone do TATAAA, z niewielkimi zmianami. Te pochodne TATAAA tworzą “TATA Box”, niekodujące sekwencje DNA, które odgrywają rolę w inicjacji transkrypcji genów zawierających TATA. Nie wiadomo jeszcze, jak aktywowana jest pozostała część ludzkiego genomu, licząca około 75%, ze względu na ogromną liczbę możliwych kombinacji sekwencji zasad.
Jak donosi ScienceDaily, badacze z UCSD udało się zidentyfikować kod aktywacji DNA, który jest używany tak często, jak aktywacje TATA Box, dzięki wykorzystaniu sztucznej inteligencji. Badacze nazywają ten kod aktywacji DNA “regionem rdzenia promotora w dół” (DPR). Według głównego autora artykułu opisującego te odkrycia, profesora Jamesa Kagonagi z Wydziału Biologii UCSD, odkrycie DPR ujawnia, jak około jedną czwartą do jednej trzeciej naszych genów jest aktywowana.
Kadonaga początkowo odkrył sekwencję aktywacji genu odpowiadającą części DPR, pracując z muchami owocowymi w 1996 roku. Od tego czasu Kadonaga i jego współpracownicy pracowali nad określeniem, które sekwencje DNA były skorelowane z aktywnością DPR. Zespół badawczy rozpoczął od stworzenia pół miliona różnych sekwencji DNA i określenia, które sekwencje wykazywały aktywność DPR. Około 200 000 sekwencji DNA zostało wykorzystanych do szkolenia modelu sztucznej inteligencji, który mógł przewidzieć, czy aktywność DPR zostanie zaobserwowana w fragmentach ludzkiego DNA. Model okazał się bardzo dokładny. Kadonaga opisał wyniki modelu jako “absurdalnie dobre” i ich predykcyjną moc jako “niewiarygodną”. Proces tworzenia modelu okazał się tak niezawodny, że badacze stworzyli podobny model sztucznej inteligencji do odkrywania nowych wystąpień TATA Box.
W przyszłości sztuczna inteligencja może być wykorzystywana do analizy wzorców sekwencji DNA i dostarczania badaczom większej wiedzy na temat aktywacji genów w ludzkich komórkach. Kadonaga uważa, że podobnie jak sztuczna inteligencja pomogła jego zespołowi badawczemu zidentyfikować DPR, sztuczna inteligencja pomoże również innym naukowcom w odkrywaniu ważnych sekwencji i struktur DNA.
W innym przypadku wykorzystania sztucznej inteligencji do badania ludzkiego genomu, jak donosi MedicalExpress, badacze z australijskiej agencji naukowej CSIRO wykorzystali platformę sztucznej inteligencji o nazwie VariantSpark do analizy ponad jednego trylionu punktów danych genetycznych. Ma się nadzieję, że badania oparte na sztucznej inteligencji pomogą naukowcom określić lokalizację pewnych genów związanych z chorobami.
Tradycyjne metody analizy cech genetycznych mogą trwać lata, ale jak wyjaśnił Dr Denis Bauser, lider bioinformatyki w CSIRO, sztuczna inteligencja ma potencjał, aby znacznie przyspieszyć ten proces. VariantSpark to platforma sztucznej inteligencji, która może analizować cechy takie jak podatność na pewne choroby i określać, które geny mogą na nie wpływać. Bauer i inni badacze wykorzystali VariantSpark do analizy syntetycznego zestawu danych obejmującego około 100 000 osób w zaledwie 15 godzin. VariantSpark przeanalizował ponad dziesięć milionów wariantów jednego trylionu punktów danych genetycznych, co zajęłoby nawet najszybszym konkurentom korzystającym z tradycyjnych metod tysiące lat.
Jak wyjaśnił Dr David Hansin, dyrektor generalny Centrum Badań nad Zdrowiem w CSIRO przez MedicalExpress:
“Pomimo ostatnich przełomów technologicznych w badaniach sekwencjonowania całego genomu, molekularne i genetyczne podstawy złożonych chorób są nadal słabo rozumiane, co utrudnia predykcję, zastosowanie odpowiednich środków zapobiegawczych i leczenie personalizowane.”
Bauer uważa, że VariantSpark może być skalowany do zbiorów danych na poziomie populacji i pomóc określić rolę genów w rozwoju chorób serca i neuronów. Taka praca mogłaby prowadzić do wczesnej interwencji, personalizowanych leczeń i ogólnie lepszych wyników zdrowotnych.












