Модели и платформы ИИ
Метод ИИ раскрывает, чему геномные модели учатся из ДНК, и выявляет скрытую экспериментальную предвзятость

Исследователи Института Стоуэрс по медицинским исследованиям разработали метод интерпретации, который показывает, нуклеотид за нуклеотидом, чему глубокая нейронная сеть научилась из ДНК, и использовали его, чтобы удалить скрытую экспериментальную предвзятость из геномных данных. Метод, названный PISA, описан в статье, опубликованной в Nature Communications в августе 2026 года и анонсирована институтом 25 августа 2026 года.
Нейронные сети «последовательность‑в‑функцию» принимают необработанную ДНК в качестве входных данных и предсказывают результаты геномных экспериментов, от связывания транскрипционных факторов до организации нуклеосом. Что они обычно не могут сказать, так это почему делают то или иное предсказание. PISA, сокращение от pairwise influence by sequence attribution, прослеживает предсказание модели в одной точной геномной позиции назад ко всем другим нуклеотидам, которые на него повлияли, создавая двумерную карту с разрешением в один нуклеотид, показывающую, чему модель научилась, а не только что предсказывает.
Исследование возглавила Джулия Цайтлингер в Институте Стоуэрс совместно с Аншулом Кундаджем из Стэнфордского университета; первым автором является Чарльз МакЭнани, стипендиат по ИИ в Стоуэрс. PISA работает внутри BPReveal, последнего расширения BPNet, фреймворка глубокого обучения, который команда впервые разработала в 2021 году.
Как PISA отделяет экспериментальную предвзятость от биологии
Команда применила PISA к MNase-seq, широко используемому методу, который картирует нуклеосомы — структуры, образующиеся, когда ДНК оборачивается вокруг гистонов. Метод работает с помощью фермента, который разрезает открытое ДНК, оставляя защищённое нуклеосомой ДНК нетронутым, но фермент предпочитает некоторые последовательности перед другими. Поэтому данные содержат два перекрывающихся сигнала, и модель выучила оба.
Поскольку ранние инструменты интерпретации сводят влияние каждого нуклеотида к единому значению, положительные и отрицательные эффекты могут взаимно уничтожаться и исчезать. PISA сохраняет информацию с полным разрешением, и при этом предпочтение фермента к определённым последовательностям проявилось в виде характерного отпечатка на картах. Команда математически извлекла этот сигнатур, обучила отдельную модель только на предвзятости и вычла её, оставив вторую модель, которая выучила лишь биологию.
«Это немного похоже на микроскопию сверхразрешения», — сказала Цайтлингер в объявлении института. «Даже ранние методы интерпретации открывали чёрный ящик. Затем вы понимаете, что можете увидеть ещё больше. Вы добавляете пиксели, и вдруг видите то, чего раньше не могли увидеть».
Неожиданное, скрытое в чистых данных
Внутри модели, скорректированной по предвзятости, PISA выявила ДНК‑последовательности, которые помогают позиционировать нуклеосомы, с эффектами, распространяющимися на сотни пар оснований в обе стороны. Многие из них были асимметричными, влияя на одну сторону иначе, чем на другую. Эта асимметрия привела команду к границам хроматиновых доменов — границам, определяющим, какие регуляторные последовательности могут достичь каких генов. Такие границы обычно картируют методами 3D‑хроматина, требующими огромной глубины секвенирования; модель обнаружила тысячи таких границ только из данных о нуклеосомах, часто точнее, чем позволяют 3D‑данные, согласно статье.
Затем команда использовала модели, сфокусированные на биологии, для проектирования синтетических ДНК‑последовательностей, предсказанных как способные располагать нуклеосомы в определённых конфигурациях, и экспериментально проверила подмножество этих конструкций. Предсказания подтвердились, что свидетельствует о том, что правила, выученные моделью, могут генерировать проверяемые гипотезы, а не просто описывать существующие данные.
Работа относится к области, активно инвестирующей в всё более крупные последовательностные модели. AlphaGenome от Google DeepMind, опубликованный ранее в 2026 году и упомянутый во введении статьи о PISA, предсказывает эффекты регуляторных вариантов по всему геному. PISA решает комплементарную задачу: после того как модель делает такие предсказания, понять, какие именно последовательностные признаки она использовала. Метод уже вышел за пределы лаборатории Цайтлингер, реализован в отдельном программном пакете сотрудником и принят нейробиологом Стоуэрс Нешетом Озелом для другого биологического вопроса.
PISA в цифрах
- 2021 – фреймворк глубокого обучения BPNet, фундамент PISA, впервые разработанный командой
- 8 апреля 2025 – 8 апреля 2025 – препринт PISA впервые размещён на bioRxiv
- август 2026 – август 2026 – рецензируемая публикация в Nature Communications
- Hundreds of base pairs – Сотни пар оснований – охват отдельных последовательностей, позиционирующих нуклеосомы, обнаруженных моделями
- Thousands – Тысячи – границы хроматиновых доменов, выявленные исключительно из данных о нуклеосомах
Ограничения, указанные авторами
Это статья о методах и геномике, и её актуальность для заболеваний является направлением, а не результатом. Большинство генетических вариантов, связанных с болезнями, находится в регуляторной ДНК, а не в генах, и Цайтлингер явно указывает, что размещение варианта в сайте связывания или на границе домена предлагает механизм без создания лекарства. Работа также требовала лаборатории, владеющей как глубоким обучением, так и экспериментальной биологией, и Цайтлингер называет эту двойную экспертизу постоянным пробелом в области, а не вычислительной мощностью.
Синтезированные ДНК‑последовательности были проверены только для части, протестированной экспериментально, а демонстрация коррекции предвзятости в статье специфична для MNase-seq, хотя авторы показывают применение PISA к нескольким типам данных. История правок препринта показывает, что анализ хроматиновых доменов был добавлен в процессе рецензирования, после пересмотренной версии, опубликованной 5 января 2026 года.
То, что теперь подтверждает эта работа, — это способ аудита того, что геномные модели поглощают из своих обучающих данных, исправление частей, пришедших из эксперимента, а не из биологии, и извлечение правил последовательностей, достаточно точных для проектирования и тестирования в живых системах.












