Модели и платформы ИИ
Исследователи в области ИИ разработали объяснимую нейронную сеть для открытия геномных правил

Команда исследователей недавно создала объяснимую нейронную сеть, предназначенную для помощи биологам в раскрытии тайных правил, которые управляют кодом человеческого генома. Исследовательская команда обучила нейронную сеть на картах взаимодействия белка и ДНК, что позволило ИИ открыть, как определенные последовательности ДНК регулируют определенные гены. Исследователи также сделали модель объяснимой, чтобы они могли проанализировать выводы модели и определить, как мотивы последовательностей регулируют гены.
Одна из больших загадок биологии – это регуляторный код генома. Известно, что ДНК состоит из четырех нуклеотидных оснований – аденина, гуанина, тимина и цитозина, – но неизвестно, как эти основания используются для регулирования активности. Четыре нуклеотидных основания кодируют инструкции для построения белков, но они также контролируют, где и как гены экспрессируются, (как они производят белки в организме). Определенные комбинации и расположения оснований создают участки регуляторного кода, которые связываются с сегментами ДНК, и неизвестно, какие именно эти комбинации.
Междисциплинарная команда компьютерных ученых и биологов поставила цель решить эту загадку, создав объяснимую нейронную сеть. Исследовательская команда создала нейронную сеть, которую они назвали “Сетью пар оснований” или “BPNet”. Модель, используемая BPNet для генерации прогнозов, может быть интерпретирована для выявления регуляторных кодов. Это было достигнуто путем прогнозирования, как белки, называемые транскрипционными факторами, связываются с последовательностями ДНК.
Исследователи провели ряд экспериментов и выполнили комплексное компьютерное моделирование, чтобы определить, как транскрипционные факторы и ДНК связаны вместе, разработав подробную карту до уровня отдельных нуклеотидных оснований. Подробные представления транскрипционных факторов и ДНК позволили исследователям создать инструменты, способные интерпретировать как критические закономерности последовательностей ДНК, так и правила, которые функционируют как регуляторный код.
Юлия Цайтлингер, доктор биологических наук и компьютерный исследователь в Стэнфордском университете, объяснила, что результаты, полученные из объяснимой нейронной сети, совпали с существующими экспериментальными результатами, но они также содержали удивительные прозрения в регуляторный код генома. Например, модель ИИ позволила исследовательской команде открыть правило, которое влияет на то, как работает транскрипционный фактор, называемый Наногом. Когда несколько экземпляров мотива Нанога присутствуют на одной стороне двойной спирали ДНК, они кооперативно связываются с ДНК. Как объяснила Цайтлингер через ScienceDaily:
“Была длинная цепочка экспериментальных доказательств того, что такая периодичность мотивов иногда существует в регуляторном коде. Однако точные обстоятельства были неясны, и Наног не был подозреваемым. Открытие того, что Наног имеет такой шаблон, и увидение дополнительных деталей его взаимодействия, было удивительным, потому что мы не специально искали этот шаблон.”
В недавней статье далеко не первый раз, когда ИИ используется для анализа ДНК, но, вероятно, это первый раз, когда “черный ящик” ИИ открывается, чтобы узнать, какие последовательности ДНК регулируют гены в геноме. Нейронные сети хорошо находят закономерности в данных, но их прозрения трудно извлечь из моделей, которые они создают. Создав метод анализа того, какие функции модель считает важными для прогнозирования геномных правил, исследователи могли обучить более тонкие модели, которые приводят к новым открытиям.
Архитектура BPNet похожа на сети, используемые для распознавания лиц на изображениях. Когда системы компьютерного зрения распознают лица на изображениях, сеть начинает с обнаружения краев, а затем объединяет эти края. Разница заключается в том, что BPNet учится на последовательностях ДНК, обнаруживая мотивы последовательностей и объединяя эти мотивы в более высокие правила, которые можно использовать для прогнозирования связывания данных на уровне отдельных оснований.
После того, как модель достигла высокого порога точности, закономерности, изученные моделью, отслеживаются до исходных входных последовательностей, раскрывая мотивы последовательностей. Наконец, модели предоставляются систематические запросы последовательностей ДНК, что позволяет исследователям понять правила, по которым мотивы последовательностей объединяются и функционируют. Согласно Цайтлингер, модель способна прогнозировать многие больше последовательностей, чем исследователи могли бы надеяться протестировать в традиционном, экспериментальном порядке. Кроме того, прогнозирование результатов экспериментальных аномалий позволяет исследователям определить, какие эксперименты были наиболее информативными при проверке модели.












