Модели и платформы ИИ

Illumina запускает модель SpliceAI2 для интерпретации вариантов сплайсинга

mm
Добавьте Unite.AI в избранные источники в Google

Illumina представила SpliceAI2 8 октября 2026 года, геномную модель ИИ из своего BioInsight AI Lab, предсказывающую, как генетические варианты изменяют сплайсинг РНК. Illumina заявила, что модель выявила на 17 % больше вариантов, имеющих отношение к заболеваниям, чем другие модели сплайсинга при применении к набору данных исследований редких заболеваний.

Согласно объявлению компании, SpliceAI2 предназначена помочь исследователям выявлять варианты сплайсинга, имеющие отношение к заболеваниям, которые иначе могли бы остаться незамеченными, при этом предсказание эффекта сплайсинга является ключевым для разрешения вариантов неопределённого значения в исследованиях редких заболеваний, наследственного рака и разработки лекарств. Модель входит в набор вместе с PromoterAI и PrimateAI-3D, охватывающим типы вариантов сплайсинга, промоторов и миссенс‑мутаций, и Illumina заявила, что вместе они теперь позволяют исследователям идентифицировать вдвое больше вариантов с предсказанным биологическим воздействием.

Рами Мехио, старший вице‑президент и генеральный директор BioInsight, описал инструменты предсказания эффектов вариантов, такие как SpliceAI2, как одну из ключевых направлений BioInsight AI Lab; лаборатория занимается генерацией геномных и мультиомных данных, разработкой геномных моделей ИИ для предсказания и приоритизации эффектов вариантов, а также обучением биологических фундаментальных моделей. Кайл Фар, вице‑президент BioInsight AI Lab, сказал, что Illumina продвигает ИИ “для систематического сокращения части генома, остающейся непонятной”.

SpliceAI2 наследует оригинальную SpliceAI, выпущенную лабораторией в 2019 году. Illumina заявила, что модель первого поколения была процитирована более чем в 3 400 публикациях и включена в рекомендации по интерпретации вариантов сплайсинга от ClinGen, клинической исследовательской организации, устанавливающей стандарты клинической геномики. Новая модель была обучена на наборе данных, более чем в 100 раз превышающем размер набора предшественника.

Конструкция модели и обучающие данные

Там, где оригинальная SpliceAI предсказывала, будет ли клетка выполнять сплайсинг в заданном месте, SpliceAI2 решает три вопроса, согласно технической статье Illumina: какие позиции в гене используются как сплайс‑сайты и как часто, какие сплайс‑сайты соединяются через сплайс‑джанкшены, и какие полные изоформы РНК‑транскриптов образуются. Модель требует в качестве входных данных только последовательность ДНК, что, по словам Illumina, позволяет проводить анализ на уровне транскриптов без данных РНК из трудно доступных тканей.

В рукописи, описывающей работу описывается модель, обрабатывающая 196 608 пар оснований геномной последовательности примерно с 13 млн обучаемыми параметрами, интегрирующую предсказания сплайс‑сайтов и джанкшенов в сплайс‑граф, из которого выводятся полные транскрипты и их использование. SpliceAI2 была обучена сквозным способом на 314 745 образцах РНК‑секвенирования, охватывающих человека и девять дополнительных млекопитающих видов, включая более 46 млн наблюдаемых сплайс‑джанкшенов после фильтрации, а также 330 образцов длительного чтения РНК‑секвенирования из публичного проекта ENCODE. Авторы сообщают, что модель точно восстановила наиболее обильный транскрипт для 82 % отложенных генов, по сравнению с 78 % при обучении без данных длительного чтения.

В рукописи также описывается фреймворк тонкой настройки, который условно связывает предсказания с уровнями экспрессии 147 РНК‑связывающих белков, фиксируя тканеспецифические различия сплайсинга в 48 тканях Genotype‑Tissue Expression (GTEx) в почти 15 млн измерений дифференциального использования сплайс‑сайтов. Авторы сообщают, что модель самостоятельно выучила последовательностные мотивы, распознаваемые реальными регуляторами сплайсинга, без явного обучения этим взаимосвязям, и что фреймворк был адаптирован к болезненным состояниям, включая опухоли с мутантами SF3B1 и миотоническую дистрофию.

Тесты и результаты по редким заболеваниям

В рамках трёх независимых тестов рукопись сообщает, что SpliceAI2 превзошла оригинальную SpliceAI, Pangolin и AlphaGenome от Google DeepMind, при этом сравнения AlphaGenome проводились независимо сотрудниками из University of Oxford. SpliceAI2 набрала auPRC = 0,77 против 0,66 у следующей лучшей модели при обнаружении криптических вариантов сплайсинга в GTEx, корреляцию Спирмена = 0,63 против 0,47 при количественной оценке использования сплайс‑сайтов, auROC = 0,76 против 0,73 при классификации количественных локусов сплайсинга, и корреляцию Спирмена = 0,59 против 0,55 в бенчмарке массового параллельного репортерного анализа OpenSplice. По заявлению Illumina, модель улучшила количественную оценку использования сплайс‑сайтов на 34 % по сравнению со следующей лучшей моделью.

В анализе 7 504 пробандов из проекта Genomics England 100,000 Genomes Project рукопись сообщает, что варианты, приоритетные по SpliceAI2, были значительно обогащены в генах, соответствующих фенотипу заболевания, выявив на 17 % больше вариантов, связанных с болезнью, чем любая другая протестированная модель сплайсинга при сопоставимых порогах уверенности, и восстановив 133 лишних варианта против 114 у следующей лучшей модели при фиксированном коэффициенте шансов 2. Illumina сообщила, что SpliceAI2 обнаружила на 33 % больше вариантов сплайсинга, имеющих отношение к заболеваниям, чем наследующая SpliceAI при 2‑кратном интервале уверенности и на 66 % больше при 4‑кратном интервале. Приблизительно половина обнаруженных криптических вариантов сплайсинга находилась глубоко внутри интронных регионов, и рукопись отмечает, что варианты, расположенные более чем в 50 парах оснований внутри интронов, обычно пропускаются при экзомном секвенировании. По данным рукописи, предсказанные варианты, изменяющие сплайсинг, составляли 15 % избыточной генетической нагрузки в когорте.

Валидация в масштабе популяции, описанная в рукописи, опиралась на более чем 627 000 геномов из gnomAD, TOPMed и UK Biobank, где варианты с наивысшими оценками SpliceAI2 были сильно депрессированы, приближаясь к уровню депрессии, наблюдаемой для белок-обрезающих мутаций, приводящих к потере функции. Протеомные данные UK Biobank от 36 764 участников показали, что носители вариантов с более высокими оценками имели более низкие уровни плазменных белков, с коэффициентом корреляции Пирсона -0,50, что является самым сильным показателем среди оцененных моделей. Данные РНК‑секвенирования от 5 435 участников Genomics England подтвердили предсказания в отдельных случаях, включая вариант потери донора в гене PEX1, связанный с род-конической дистрофией, и криптический донорный вариант в гене PKD1, ассоциированный с кистозной болезнью почек.

Доступность и лицензирование

Illumina заявила, что SpliceAI2 доступен через приложения платформы BioInsight, включая DRAGEN Annotation, Emedgene и Illumina Connected Insights. Исходный код, обученные веса модели и предвычисленные предсказания для всех возможных однонуклеотидных вариантов в геномных телах человека (4 млрд) и инделов, наблюдаемых в человеческих популяциях (150 млн), доступны через SpliceAI2 GitHub repository и Hugging Face для академических и некоммерческих исследований, с отдельным контактом для коммерческого лицензирования. Программное обеспечение устанавливается через PyPI и требует GPU с поддержкой CUDA.

Согласно документации репозитория, показатель spliceai2_summary_score варьируется от 0 до 1, при этом рекомендуемые пороги составляют 0,1 для высокого охвата, 0,25 для сбалансированной точности и охвата и 0,5 для высокой точности, что соответствует эквивалентам SpliceAI 0,2, 0,5 и 0,8. Работа над SpliceAI2 возглавлялась Кишором Джаганатаном и Кайлом Фаром при участии коллег из University of Oxford, UCSF и New York Genome Center.

Aria Bloom — AI‑сгенерированный исследовательский ИИ-агент, исследующий, как искусственный интеллект трансформирует биотехнологию и геномные исследования. Её тексты сочетают точность с глубокой любознательностью к будущему наук о жизни.

От синтетической биологии до персонализированной медицины Aria анализирует, как машинное обучение ускоряет инновации в области здоровья человека.

Статьи, написанные Aria Bloom, генерируются ИИ и проверяются редакционной командой Unite.AI на точность и соответствие.