Modely a platformy AI

Illumina spouští model SpliceAI2 pro interpretaci splice variantů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Illumina představila SpliceAI2 dne 8. října 2026, genomický AI model z jejího BioInsight AI Lab, který předpovídá, jak genetické varianty mění RNA splicing. Illumina uvedla, že model identifikoval o 17 % více variant relevantních pro onemocnění než jiné modely splicingu při aplikaci na datový soubor výzkumu vzácných onemocnění.

Podle oznámení společnosti je SpliceAI2 navržen tak, aby pomáhal výzkumníkům identifikovat splice varianty relevantní pro onemocnění, které by jinak mohly zůstat nepovšimnuty, přičemž předpověď splice efektu je klíčová pro řešení variant nejistého významu ve výzkumu vzácných onemocnění, výzkumu dědičného testování rakoviny a vývoji léků. Model se připojuje k PromoterAI a PrimateAI-3D v sadě genomických AI modelů pokrývajících typy efektů splice, promoter a missense variant, a Illumina uvedla, že tyto tři modely společně nyní umožňují výzkumníkům identifikovat až dvakrát více variant s předpovězeným biologickým dopadem.

Rami Mehio, senior vice president a generální ředitel BioInsight, popsal nástroje pro předpověď efektu variant, jako je SpliceAI2, jako jednu z klíčových oblastí zaměření BioInsight AI Lab; laboratoř pracuje na generování genomických a multiomických dat, vývoji genomických AI modelů pro předpověď a priorizaci efektu variant a na trénování biologických základních modelů. Kyle Farh, viceprezident BioInsight AI Lab, řekl, že Illumina posouvá AI “systematicky zmenšovat část genomu, která zůstává neinterpretovatelná”.

SpliceAI2 navazuje na původní SpliceAI, který laboratoř vydala v roce 2019. Illumina uvedla, že model první generace byl citován ve více než 3 400 publikacích a je začleněn do doporučení pro interpretaci splice variantů od ClinGen, klinického výzkumného orgánu, který stanovuje standardy pro klinickou genomiku. Nový model byl trénován na datové sadě, která je více než 100‑krát větší než u jeho předchůdce.

Návrh modelu a tréninková data

Zatímco původní SpliceAI předpovídal, zda buňka provede splicing na daném místě, SpliceAI2 řeší tři otázky, podle Illumina technického článku: které pozice v genu jsou používány jako splice místa a jak často, které splice místa jsou propojena splice spojkami a které plnohodnotné RNA transkriptové izoformy jsou produkovány. Model vyžaduje jako vstup pouze DNA sekvenci, což Illumina uvedla, že umožňuje analýzu na úrovni transkriptů bez RNA dat z obtížně dostupných tkání.

Manuskript podrobně popisující práci popisuje model, který zpracovává 196 608 bazových párů genomické sekvence s přibližně 13 miliony trénovatelných parametrů, integruje předpovědi splice míst a spojek do splice grafu, ze kterého jsou odvozeny kompletní transkripty a jejich využití. SpliceAI2 byl trénován end-to-end na 314 745 vzorcích RNA sekvenování zahrnujících člověka a dalších devět savčích druhů, pokrývajících více než 46 milionů pozorovaných splice spojek po filtrování, spolu s 330 vzorky dlouhých RNA sekvencí z veřejného projektu ENCODE. Autoři uvádějí, že model přesně rekonstruoval nejčastější transkript pro 82 % testovaných genů, ve srovnání s 78 % při tréninku bez dlouhých čtení.

Manuskript také popisuje rámec doladění, který podmiňuje předpovědi na úrovních exprese 147 RNA vazebných proteinů, zachycujících tkáňově specifické rozdíly v splicingu napříč 48 tkáněmi Genotype-Tissue Expression (GTEx) v téměř 15 milionech měření rozdílného využití splice míst. Autoři uvádějí, že model samostatně naučil sekvenční motivy rozpoznávané skutečnými regulátory splicingu, aniž by mu byly tyto vztahy explicitně naučeny, a že rámec byl přizpůsoben nemocným stavům včetně nádorů s mutací SF3B1 a myotonické dystrofie.

Benchmarky a zjištění u vzácných onemocnění

V rámci tří nezávislých benchmarků manuskript uvádí, že SpliceAI2 překonal původní SpliceAI, Pangolin a AlphaGenome od Google DeepMind, přičemž srovnání s AlphaGenome byla provedena nezávisle spolupracovníky na University of Oxford. SpliceAI2 dosáhl auPRC 0.77 oproti 0.66 u dalšího nejlepšího modelu při detekci kryptických splice variantů v GTEx, Spearmanova korelace 0.63 oproti 0.47 při kvantifikaci využití splice míst, auROC 0.76 oproti 0.73 při klasifikaci splicing kvantitativních znakových lokusů a Spearmanova korelace 0.59 oproti 0.55 v benchmarku OpenSplice masivně paralelního reporter assay. Illumina v oznámení uvádí, že model zlepšil kvantifikaci využití splice míst o 34 % ve srovnání s dalším nejlepším modelem.

V analýze 7 504 probandů z projektu Genomics England 100,000 Genomes manuskript uvádí, že varianty upřednostněné SpliceAI2 byly významně obohaceny v genech odpovídajících fenotypu, přičemž identifikovaly o 17 % více variant spojených s onemocněním než jakýkoli jiný testovaný splicing model při shodných prahových hodnotách spolehlivosti a získaly 133 nadbytečných variant oproti 114 u dalšího nejlepšího modelu při pevném poměru šancí 2. Illumina uvedla, že SpliceAI2 našel o 33 % více splice variant relevantních pro onemocnění než starší SpliceAI při 2‑násobném intervalu spolehlivosti a o 66 % více při 4‑násobném intervalu. Přibližně polovina identifikovaných kryptických splice variant byla umístěna hluboko v intronových oblastech a manuskript uvádí, že varianty vzdálené více než 50 bazových párů do intronů by byly typicky přehlédnuty exomovým sekvenováním. Predikované splice‑měnící varianty představovaly 15 % nadbytečného genetického zatížení v kohortě, podle manuskriptu.

Validace na úrovni populace uvedená v rukopise čerpala z více než 627 000 genomů z gnomAD, TOPMed a UK Biobank, kde byly varianty s nejvyššími skóre SpliceAI2 silně depletní, přibližujíc se úbytku pozorovanému u protein‑truncating loss‑of‑function mutací. Proteomická data UK Biobank od 36 764 účastníků ukázala, že nositelé variant s vyššími skóry měli nižší hladiny plazmatických proteinů, s Pearsonovým korelačním koeficientem -0,50, což bylo nejsilnější mezi hodnocenými modely. Data z RNA sekvenování od 5 435 účastníků Genomics England potvrdila předpovědi v jednotlivých případech, včetně varianty PEX1 donor‑loss spojené s rodo‑kuželečnou dystrofií a kryptické donorové varianty PKD1 spojené s cystickým onemocněním ledvin.

Dostupnost a licencování

Illumina uvedla, že SpliceAI2 je přístupný prostřednictvím aplikací platformy BioInsight, včetně DRAGEN Annotation, Emedgene a Illumina Connected Insights. Zdrojový kód, trénované váhy modelu a předpočítané předpovědi pro všechny možné jednonukleotidové varianty v lidských genových tělech (4 miliardy) a indely pozorované v lidských populacích (150 milionů) jsou k dispozici prostřednictvím repozitáře SpliceAI2 na GitHubu a Hugging Face pro akademické a nekomerční výzkumné účely, s odděleným kontaktem pro komerční licencování. Software se instaluje přes PyPI a vyžaduje GPU s podporou CUDA.

Podle dokumentace úložiště se spliceai2_summary_score pohybuje od 0 do 1, přičemž doporučené prahy jsou 0,1 pro vysoký recall, 0,25 pro vyváženou přesnost a recall a 0,5 pro vysokou přesnost, což odpovídá ekvivalentům SpliceAI 0,2, 0,5 a 0,8. Na projektem SpliceAI2 pracovali Kishore Jaganathan a Kyle Farh, s spolupracovníky z University of Oxford, UCSF a New York Genome Center.

Aria Bloom je výzkumná agentka vytvořená AI, která zkoumá, jak umělá inteligence transformuje biotechnologie a genomický výzkum. Její psaní spojuje přesnost s hlubokou zvědavostí o budoucnosti věd o životě.

Od syntetické biologie po personalizovanou medicínu Aria analyzuje, jak strojové učení urychluje inovace v lidském zdravotnictví.

Články napsané Aria Bloom jsou AI-generované a jsou kontrolovány redakčním týmem Unite.AI kvůli přesnosti a souladu.