Ochrona zdrowia
Google DeepMind przedstawia AlphaGenome do odczytania funkcji ludzkiego genomu

Google DeepMind wydał AlphaGenome 28 stycznia, model AI, który przewiduje, jak sekwencje DNA tłumaczą się na funkcje biologiczne, przetwarzając do jednego miliona par zasad jednocześnie i przewyższając istniejące modele w 25 z 26 benchmarków predykcji efektu wariantu.
Model, opublikowany w Nature i szczegółowo opisany na blogu DeepMind, reprezentuje znaczący postęp w dziedzinie genomiki komputerowej. Tam, gdzie poprzednie modele wymagały oddzielnych systemów dla różnych zadań predykcji, AlphaGenome obsługuje wszystko, od ekspresji genów do dostępności chromatyny, w jednej zunifikowanej architekturze.
“AlphaGenome może spojrzeć na długi odcinek DNA i przewidzieć, gdzie znajdują się krytyczne elementy regulacyjne i ich efekt downstream na ekspresję genów”, zespół DeepMind napisał w swoim ogłoszeniu. Okno kontekstowe modelu o długości miliona tokenów pozwala mu przechwytywać oddziaływania dalekosiężne między odległymi regionami DNA, które wpływają na to, jak geny są włączane i wyłączane.
Jak to działa
AlphaGenome łączy dwie architektury sieci neuronowych: sieć 1D konwolucyjną w stylu Borzoi do przetwarzania surowych sekwencji DNA oraz architekturę U-Net zaadaptowaną z segmentacji obrazu. Ten hybrydowy podejście pozwala modelowi obsługiwać zarówno sekwencyjny charakter DNA, jak i złożone relacje przestrzenne między elementami regulacyjnymi.
Dane szkoleniowe obejmują około 7 000 śladów genomowych z konsorcjów ENCODE i FANTOM – ogromnych współpracy, które skatalogowały elementy funkcjonalne w całym ludzkim genomie. Model uczy się przewidywać sygnały z eksperymentalnych testów pomiaru ekspresji genów, dostępności DNA, wiązania białek i modyfikacji chromatyny.
Dla badaczy praktyczna wartość leży w predykcji efektu wariantu. Kiedy genom pacjenta zawiera mutację, klinicyści muszą wiedzieć, czy ta wariacja ma znaczenie. AlphaGenome może przewidzieć, jak zmiana jednego nukleotydu wpływa na cały krajobraz regulacyjny, potencjalnie flagując warianty chorobotwórcze, których obecne metody nie wykrywają.
Model osiągnął silne wyniki w benchmarkach testujących jego zdolność do przewidywania, jak warianty genetyczne wpływają na ekspresję genów i aktywność elementów regulacyjnych. W przypadku locus eQTL (wariantów znanych z wpływu na poziomy ekspresji genów) AlphaGenome dopasował lub przewyższył specjalistyczne modele szkolone specjalnie do tych zadań.
Dostępność Open Source
DeepMind wydał kod źródłowy AlphaGenome na GitHub do użytku niekomercyjnego, kontynuując wzorzec laboratorium, który udostępnia podstawowe narzędzia biologiczne publicznie. Repozytorium zawiera wagi modelu, kod inferencyjny i dokumentację do uruchamiania predykcji na niestandardowych sekwencjach.
Otwarta publikacja następuje po modelu ustanowionym przez AlphaFold, narzędziu DeepMind do predykcji struktury białek, które zostało użyte przez ponad 3 miliony badaczy od jego premiery w 2021 roku. AlphaGenome rozwiązuje komplementarny problem: podczas gdy AlphaFold przewiduje, jak wyglądają białka, AlphaGenome przewiduje, kiedy i gdzie geny produkują te białka.
CEO Google DeepMind, Demis Hassabis, ustawił biologię jako główny obszar zastosowania możliwości AI laboratorium. Praca nad genomiką rozszerza ambicje DeepMind poza AI konwersacyjny i modele językowe, które napędzają produkty takie jak Gemini, stosując podobne innowacje architektoniczne do problemów naukowych.
Dlaczego to ma znaczenie
Ludzki genom zawiera około 3 miliardów par zasad, ale tylko około 1,5% koduje bezpośrednio białka. Pozostałe 98,5% – dawno uważane za “śmieciowe DNA” – zawierają elementy regulacyjne, które kontrolują, kiedy, gdzie i jak bardzo geny są wyrażane. Mutacje w tych regionach niekodujących powodują choroby, ale identyfikacja, które warianty mają znaczenie, była nadzwyczaj trudna.
Tradycyjne metody wymagają drogich, czasochłonnych eksperymentów w celu przetestowania poszczególnych wariantów. Modele uczenia maszynowego, takie jak AlphaGenome, mogą przesiewać tysiące wariantów komputacyjnie, priorytetyzując, które z nich zasługują na eksperymentalne kontynuowanie. W przypadku diagnozy rzadkich chorób, gdzie pacjenci często noszą nowe warianty o nieznanych skutkach, ta zdolność mogłaby przyspieszyć ścieżkę od sekwencjonowania do diagnozy.
Możliwość modelu do przetwarzania kontekstów o długości miliona par zasad jest szczególnie istotna. Elementy regulacyjne genów mogą znajdować się setki tysięcy par zasad od genów, które kontrolują, komunikując się przez złożone fałdowanie DNA. Poprzednie modele o krótszych oknach kontekstowych nie mogły przechwytywać tych dalekosiężnych zależności.
AlphaGenome dołącza do rosnącego ekosystemu narzędzi AI, które transformują badania biologiczne. Predykcja struktury białek, odkrywanie leków i teraz regulacja genów stają się coraz bardziej rozwiązywalnymi problemami dla uczenia maszynowego. Dla społeczności badawczej genetyki dostępność otwarta tych modeli demokratyzuje dostęp do możliwości komputacyjnych, które wcześniej były ograniczone do dobrze finansowanych laboratoriów.
Ograniczenia modelu są również jasne z prezentacji DeepMind. Podczas gdy AlphaGenome wyróżnia się w przewidywaniu pomiarów eksperymentalnych, tłumaczenie tych predykcji na wyniki kliniczne wymaga dodatkowej walidacji. Przerwa między przewidywaniem dostępności chromatyny a przewidywaniem ryzyka choroby pozostaje znacząca.
Na razie AlphaGenome służy jako narzędzie badawcze – które mogłoby przyspieszyć zrozumienie, jak działa genom, nawet jeśli aplikacje kliniczne pozostają jeszcze kilka lat w przyszłości. 3 000 naukowców z 160 krajów, którzy już używają modelu, sugeruje, że społeczność badawcza widzi natychmiastową wartość w tym, co DeepMind zbudował.












