Модели и платформы ИИ

Расшифровка скрытых секретов генома с помощью ИИ: прорыв AlphaGenome

mm
Добавьте Unite.AI в избранные источники в Google

Человеческая ДНК содержит примерно 3 миллиарда букв генетического кода. Однако мы понимаем только небольшую часть того, что эта обширная инструкция говорит нашим клеткам. Большая часть генома остается загадочной, особенно 98% не кодирующих белки. Эти некодирующие области ранее считались “мусорной ДНК”, но теперь ученые знают, что они играют важные роли в контроле того, когда и как гены выражаются.

В недавнем прорывном развитии DeepMind представила AlphaGenome, модель ИИ, предназначенную для раскрытия тайн этих некодирующих областей. Этот новый инструмент может анализировать последовательности ДНК длиной до одного миллиона букв и предсказывать тысячи молекулярных свойств, определяющих, как работают гены. Впервые исследователи имеют единую систему ИИ, которая может решать полную сложность регуляции генов с беспрецедентной точностью.

Проблема чтения генетических инструкций

Понимание того, как работает ДНК, похоже на попытку расшифровать сложный язык, написанный всего четырьмя буквами: А, Т, С и Г. Эти буквы образуют строительные блоки всей генетической информации, но их значение сильно зависит от контекста. Одно изменение буквы в неправильном месте может вызвать болезнь, в то время как то же изменение в другом месте может не иметь никакого эффекта.

Проблема становится еще более сложной, когда мы учитываем, что гены не работают в изоляции. Они контролируются регуляторными элементами, которые могут находиться на расстоянии тысяч или даже сотен тысяч букв. Эти дальние контроллеры могут включать или выключать гены, увеличивать или уменьшать их активность и координировать сложный процесс молекул, который поддерживает функционирование наших клеток. Мутации в этих контроллерах могут иметь глубокие последствия для здоровья и болезни, но интерпретация их влияния остается одной из величайших проблем геномики. Предыдущие модели ИИ могли анализировать только небольшие участки ДНК одновременно, не учитывая общую картину того, как дальние генетические элементы работают вместе.

Понимание AlphaGenome

AlphaGenome является значительным прорывом в области геномной ИИ. В отличие от предыдущих моделей ИИ, которые могли либо анализировать длинные участки ДНК с низким разрешением, либо изучать короткие участки в деталях, AlphaGenome может обрабатывать более длинные последовательности, сохраняя при этом точность предсказаний на уровне отдельных букв. Это сочетание длинного контекста и высокого разрешения ранее было невозможно без использования огромных вычислительных ресурсов.

Модель использует специализированную архитектуру, которая объединяет три ключевых компонента. Сначала свёрточные нейронные сети сканируют последовательность ДНК, чтобы выявить короткие закономерности, имеющие биологическое значение. Затем трансформерные сети анализируют, как эти закономерности связаны друг с другом на протяжении всей последовательности, фиксируя длинные зависимости, которые являются важными для регуляции генов. Наконец, специализированные выходные слои преобразуют эти закономерности в тысячи конкретных предсказаний о молекулярных свойствах.

Эти предсказания охватывают широкий спектр биологических явлений. AlphaGenome может предсказать, где начинаются и заканчиваются гены, сколько РНК они производят, какие части хромосом соприкасаются друг с другом и как ДНК сплайсируется. Она также может оценить эффекты генетических вариантов, сравнивая предсказания между нормальными и мутантными последовательностями.

Наука за прорывом

AlphaGenome была обучена на огромных наборах данных из международных исследовательских консорциумов, включая ENCODE, GTEx и 4D Nucleome. Эти базы данных содержат экспериментальные измерения из сотен типов клеток человека и мыши, показывающие, как гены ведут себя в разных тканях.

Это обучение позволяет AlphaGenome понимать, как одна и та же генетическая последовательность может вести себя по-разному в различных типах клеток. Регуляторный элемент, который активирует ген в клетках мозга, может не иметь никакого эффекта в клетках печени, и AlphaGenome может предсказать эти контекстно-зависимые различия.

Модель построена на основе предыдущей работы DeepMind в области геномики, включая их более раннюю модель Enformer, и дополняет AlphaMissense, которая фокусируется конкретно на кодирующих белок регионах. Вместе эти модели предоставляют более полную картину того, как генетические вариации влияют на биологическую функцию.

Тесты производительности

Когда AlphaGenome производит предсказания для отдельных последовательностей ДНК, она обогнала лучшие внешние модели в 22 из 24 оценок. И когда она предсказывала регуляторный эффект варианта, она соответствовала или превосходила лучшие внешние модели в 24 из 26 оценок.

Что делает это еще более впечатляющим, так это то, что AlphaGenome соревновалась со специализированными моделями, предназначенными для отдельных задач. Каждая сравнительная модель была оптимизирована для одного конкретного типа предсказания, в то время как AlphaGenome справлялась со всеми задачами с помощью единого подхода.

Модель может анализировать генетический вариант и сразу предсказать его эффекты на тысячи разных молекулярных свойств. Эта скорость и глубина анализа позволяют исследователям генерировать и проверять гипотезы намного быстрее, чем раньше.

Применение в реальных условиях и исследовательское влияние

Разработка AlphaGenome может ускорить исследования в нескольких важных областях. Исследователи заболеваний могут использовать модель для лучшего понимания того, как генетические варианты способствуют заболеваниям, потенциально выявляя новые терапевтические цели. Модель особенно ценна для изучения редких вариантов с большими эффектами, таких как те, которые вызывают менделианские расстройства.

DeepMind уже продемонстрировала потенциал модели, изучая мутации, связанные с раком. У пациентов с Т-клеточным острым лимфобластным лейкозом AlphaGenome успешно предсказала, что определенные мутации активируют ген TAL1, введя мотив связывания ДНК MYB. Это соответствовало известному механизму заболевания и показало, как модель может связать конкретные генетические изменения с процессами заболеваний.

Исследователи синтетической биологии могут использовать AlphaGenome для проектирования последовательностей ДНК с конкретными регуляторными свойствами. Например, они могут создать генетические переключатели, которые активируются только в определенных типах клеток или под определенным условиями. Это может привести к более точным генетическим терапиям и лучшим инструментам для изучения функции клеток.

Текущие ограничения и будущие направления

Несмотря на впечатляющие возможности, AlphaGenome имеет важные ограничения, которые исследователи должны понимать. Как и другие модели, основанные на последовательностях, она испытывает трудности в точном захвате влияния очень дальних регуляторных элементов, расположенных более чем на 100 000 букв от генов, которые они контролируют. Модель также нуждается в улучшении для захвата клеточно-специфических и тканеспецифических закономерностей регуляции генов.

Модель не была разработана для личного геномного анализа, который представляет уникальные проблемы для систем ИИ. Вместо этого она фокусируется на характеристике эффектов отдельных генетических вариантов, что более подходит для исследовательских применений, чем для клинической диагностики.

AlphaGenome может предсказать молекулярные результаты, но не предоставляет полную картину того, как генетические вариации приводят к сложным чертам или заболеваниям. Эти часто включают более широкие биологические процессы, включая развитие и факторы окружающей среды, которые выходят за рамки прямых эффектов изменений последовательности ДНК.

Демократизация доступа к геномной ИИ

DeepMind сделала AlphaGenome доступной для некоммерческих исследований через API, позволяя исследователям во всем мире получить доступ к возможностям модели. Эта демократизация передовой геномной ИИ может ускорить научные открытия, предоставляя меньшим исследовательским группам доступ к инструментам, которые ранее были доступны только крупным учреждениям с значительными вычислительными ресурсами.

Компания также создала форум сообщества, где исследователи могут делиться примерами использования, задавать вопросы и предоставлять обратную связь. Этот совместный подход может помочь выявить новые применения и руководить будущими улучшениями модели.

Взгляд в будущее

Когда исследователи начинают использовать AlphaGenome в своей работе, мы можем ожидать новых открытий о том, как генетические вариации способствуют заболеваниям, эволюции и биологическому разнообразию. Модель предоставляет основу, на которой другие ученые могут строить, совершенствуя ее для своих конкретных исследовательских вопросов.

Будущие версии модели могут расшириться для охвата большего количества видов, включая дополнительные типы биологических данных или достижения еще лучшей производительности за счет улучшенных методов обучения. DeepMind показала, что их подход является масштабируемым и гибким, что предполагает, что даже более мощные геномные системы ИИ могут быть возможны в будущем.

Основная идея

Введение AlphaGenome является значительным достижением в нашем стремлении понять скрытые секреты генома. Хотя многие тайны остаются, у нас теперь есть мощный новый инструмент для изучения обширного регуляторного механизма, закодированного в нашей ДНК. Когда исследователи по всему миру начинают использовать эту технологию, мы, вероятно, увидим ускоренный прогресс в понимании того, как генетические вариации формируют здоровье и заболевание человека.

Для научного сообщества AlphaGenome является как возможностью, так и ответственностью. Предсказания модели могут руководить важными исследовательскими решениями и помогать расставлять приоритеты экспериментальной работы. Но как и любой мощный инструмент, ее влияние в конечном итоге будет зависеть от того, насколько вдумчиво и осторожно она будет применена к реальным биологическим вопросам.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.