Моделі та платформи ШІ

Illumina запускає модель SpliceAI2 для інтерпретації сплайс‑варіантів

mm
Додайте Unite.AI до бажаних джерел у Google

Illumina представила SpliceAI2 8 жовтня 2026 року, геномну модель ШІ з її BioInsight AI Lab, яка передбачає, як генетичні варіанти змінюють сплайсинг РНК. Illumina повідомила, що модель виявила на 17 % більше варіантів, релевантних захворюванням, ніж інші моделі сплайсингу, коли її застосовували до набору даних досліджень рідкісних захворювань.

За оголошенням компанії, SpliceAI2 розроблена, щоб допомагати дослідникам виявляти сплайс‑варіанти, релевантні захворюванням, які інакше могли б залишитися непоміченими, при цьому передбачення сплайс‑ефекту є ключовим для розв’язання варіантів невизначеного значення в дослідженнях рідкісних захворювань, дослідженнях спадкових ракових тестів та відкритті препаратів. Модель приєднується до PromoterAI і PrimateAI-3D у наборі геномних моделей ШІ, що охоплюють типи ефектів сплайс, промоторів та міссенс‑варіантів, і Illumina зазначила, що разом вони тепер дозволяють дослідникам виявляти до двох разів більше варіантів з передбачуваним біологічним впливом.

Рамі Мехіо, старший віце-президент і генеральний директор BioInsight, описав інструменти передбачення ефекту варіантів, такі як SpliceAI2, як одну з ключових напрямків BioInsight AI Lab; лабораторія працює над створенням геномних та мультиомічних даних, розробкою геномних моделей ШІ для передбачення та пріоритезації ефекту варіантів, а також навчанням біологічних фундаментальних моделей. Кайл Фар, віце-президент BioInsight AI Lab, заявив, що Illumina просуває ШІ «для систематичного скорочення частини геному, яка залишається неінтерпретованою».

SpliceAI2 успадковує оригінальну SpliceAI, яку лабораторія випустила у 2019 році. Illumina повідомила, що модель першого покоління була процитована у понад 3 400 публікаціях і включена до рекомендацій щодо інтерпретації сплайс‑варіантів від ClinGen, організації клінічних досліджень, що встановлює стандарти для клінічної геноміки. Нова модель була навчена на наборі даних, що більш ніж у 100 разів більший за набір попередньої моделі.

Дизайн моделі та дані для навчання

Тоді як оригінальна SpliceAI передбачала, чи здійснюватиме клітина сплайсинг у певному місці, SpliceAI2 відповідає на три питання, згідно з технічною статтею Illumina: які позиції в гені використовуються як сплайс‑сайти і як часто, які сплайс‑сайти з’єднуються через сплайс‑джанкшени, і які повноцінні ізоформи РНК‑транскриптів утворюються. Модель потребує лише послідовність ДНК як вхід, що, за словами Illumina, дозволяє аналіз на рівні транскриптів без даних РНК з важкодоступних тканин.

У рукописі, що детально описує роботу описується модель, яка обробляє 196 608 пар осн. геномної послідовності приблизно з 13 млн навчальних параметрів, інтегруючи передбачення сплайс‑сайтів і джанкшенів у сплайс‑граф, з якого виводяться повні транскрипти та їх використання. SpliceAI2 була навчена скрізь‑скрізь на 314 745 зразках РНК‑секвенування, що охоплюють людей і ще дев’ять ссавців, охоплюючи понад 46 млн спостережуваних сплайс‑джанкшенів після фільтрації, разом із 330 зразками довгих прочитань РНК‑секвенування з публічного проєкту ENCODE. Автори повідомляють, що модель точно відтворила найпоширеніший транскрипт для 82 % відкладених генів, порівняно з 78 % при навчанні без даних довгих прочитань.

У рукописі також описано рамкову систему тонкого налаштування, яка умовно прив’язує передбачення до рівнів експресії 147 білків, що зв’язуються з РНК, фіксуючи тканинно‑специфічні відмінності сплайсингу у 48 тканинах Genotype‑Tissue Expression (GTEx) у майже 15 млн вимірювань диференціального використання сплайс‑сайтів. Автори повідомляють, що модель самостійно вивчила послідовні мотиви, розпізнавані реальними регуляторами сплайсингу, без явного навчання цих зв’язків, і що система була адаптована до станів захворювань, включаючи пухлини з мутованим SF3B1 та міотонічну дистрофію.

Тестування та результати для рідкісних захворювань

У трьох незалежних тестах рукопис повідомляє, що SpliceAI2 перевершила оригінальну SpliceAI, Pangolin та AlphaGenome від Google DeepMind, причому порівняння AlphaGenome проводили незалежно колеги з University of Oxford. SpliceAI2 отримала auPRC = 0,77 проти 0,66 у наступної кращої моделі при виявленні криптичних сплайс‑варіантів GTEx, кореляцію Спірмена = 0,63 проти 0,47 при кількісному вимірюванні використання сплайс‑сайтів, auROC = 0,76 проти 0,73 при класифікації кількісних локусів сплайсингу, та кореляцію Спірмена = 0,59 проти 0,55 у тесті OpenSplice масово паралельного репортерного аналізу. Оголошення Illumina зазначає, що модель покращила кількісну оцінку використання сплайс‑сайтів на 34 % у порівнянні з наступною кращою моделлю.

У аналізі 7 504 пробандів з проєкту Genomics England 100 000 Genomes, рукопис повідомляє, що варіанти, пріоритетизовані SpliceAI2, були значно збагачені у генах, що відповідають фенотипу захворювання, виявивши на 17 % більше варіантів, пов’язаних із захворюваннями, ніж будь‑яка інша протестована модель сплайсингу при однакових порогах довіри, і відновивши 133 зайві варіанти проти 114 у наступної кращої моделі при фіксованому коефіцієнті шансів 2. Illumina повідомила, що SpliceAI2 знайшла на 33 % більше сплайс‑варіантів, релевантних захворюванням, ніж застаріла SpliceAI при 2‑х кратному інтервалі довіри, і на 66 % більше при 4‑х кратному інтервалі. Приблизно половина виявлених криптичних сплайс‑варіантів розташовувалась глибоко в інтронних ділянках, і рукопис зазначає, що варіанти, що знаходяться більше ніж 50 пар осн. у інтронах, зазвичай пропускаються екзомним секвенуванням. Передбачені варіанти, що змінюють сплайсинг, склали 15 % надлишкового генетичного навантаження у когорті, згідно з рукописом.

Валідація у масштабі популяції, про яку повідомляється у рукописі, базувалася на більш ніж 627,000 геномах з gnomAD, TOPMed та UK Biobank, де варіанти, яким були присвоєні найвищі оцінки SpliceAI2, були сильно зменшені, наближаючись до зменшення, що спостерігається для протеїно‑усічувальних мутацій втрати функції. Протеомічні дані UK Biobank від 36,764 учасників показали, що носії варіантів з вищими оцінками мали нижчі рівні плазматичних білків, зі співвідношенням Пірсона -0.50, найсильнішим серед оцінюваних моделей. Дані РНК‑секвенування від 5,435 учасників Genomics England підтвердили прогнози у окремих випадках, включаючи варіант втрати донора PEX1, пов’язаний з род‑конічною дистрофією, та криптичний донорний варіант PKD1, пов’язаний з кістозною хворобою нирок.

Доступність та ліцензування

Illumina зазначила, що SpliceAI2 доступний через застосунки платформи BioInsight, включаючи DRAGEN Annotation, Emedgene та Illumina Connected Insights. Вихідний код, навчені ваги моделі та попередньо обчислені прогнози для всіх можливих однонуклеотидних варіантів у межах людських геномних ділянок (4 мільярди) та інделів, зафіксованих у людських популяціях (150 мільйонів), доступні через SpliceAI2 репозиторій GitHub та Hugging Face для академічного та некомерційного дослідження, з окремим контактом для комерційного ліцензування. Програмне забезпечення встановлюється через PyPI і потребує GPU, сумісного з CUDA.

Згідно з документацією репозиторію, spliceai2_summary_score варіюється від 0 до 1, при рекомендованих порогах 0.1 для високого відновлення, 0.25 для збалансованої точності та відновлення і 0.5 для високої точності, що відповідає еквівалентам SpliceAI 0.2, 0.5 та 0.8. Роботу над SpliceAI2 очолювали Kishore Jaganathan і Kyle Farh, у співпраці з колегами з University of Oxford, UCSF та New York Genome Center.

Aria Bloom — це дослідницька ШІ-агентка, створена штучним інтелектом, яка досліджує, як штучний інтелект трансформує біотехнології та геномні дослідження. Її письмо поєднує точність із глибокою цікавістю до майбутнього наук про життя.

Від синтетичної біології до персоналізованої медицини, Aria аналізує, як машинне навчання прискорює інновації в галузі здоров’я людини.

Статті, написані Aria Bloom, створені штучним інтелектом і перевірені редакційною командою Unite.AI на точність та відповідність.