AIモデルとプラットフォーム
Illumina、スプライス変異解釈のためのSpliceAI2モデルを発表

Illuminaは2026年10月8日に、同社のBioInsight AI Labが開発したゲノムAIモデルSpliceAI2を発表した。このモデルは遺伝子変異がRNAスプライシングに与える影響を予測する。Illuminaによると、希少疾患研究データセットに適用した際、同モデルは他のスプライシングモデルに比べて疾患関連変異を17%多く特定した。
Illuminaの会社の発表によると、SpliceAI2は研究者が見逃しがちな疾患関連スプライス変異を特定することを支援するよう設計されており、スプライス効果の予測は希少疾患研究、遺伝性がん検査研究、薬剤探索における不確定意義変異の解決に重要である。このモデルはPromoterAIおよびPrimateAI-3Dと共に、スプライス、プロモーター、ミスセンス変異効果タイプを網羅するゲノムAIモデルスイートに加わり、Illuminaはこれら3つが合わせて、予測された生物学的影響を持つ変異を最大で2倍まで特定できるようになったと述べた。
Rami Mehio、BioInsightのシニア・バイスプレジデント兼ゼネラルマネージャーは、SpliceAI2のような変異効果予測ツールをBioInsight AI Labの主要な重点領域の一つと述べた。同ラボはゲノムおよびマルチオミクスデータの生成、変異効果予測と優先順位付けのためのゲノムAIモデルの開発、そして生物学的基盤モデルのトレーニングに取り組んでいる。BioInsight AI LabのバイスプレジデントであるKyle Farhは、IlluminaがAIを「体系的に解釈不能なゲノム領域を縮小する」ことに進めていると語った。
SpliceAI2は、ラボが2019年にリリースしたオリジナルのSpliceAIに続くモデルである。Illuminaによると、第一世代モデルは3,400件以上の論文で引用されており、臨床ゲノミクスの標準を策定する臨床研究機関ClinGenのスプライス変異解釈推奨に組み込まれている。新しいモデルは、前モデルのデータセットの100倍以上の規模のデータセットで学習された。
モデル設計とトレーニングデータ
オリジナルのSpliceAIが特定の位置で細胞がスプライスするかどうかを予測したのに対し、SpliceAI2はIlluminaの技術記事によれば、次の3つの質問に答える:遺伝子内のどの位置がスプライス部位として使用され、その頻度はどれくらいか、どのスプライス部位がスプライスジャンクションで接続されるか、そしてどの全長RNA転写産物アイソフォームが生成されるか。モデルは入力としてDNA配列のみを必要とし、Illuminaはこれにより取得が難しい組織からのRNAデータなしで転写レベルの解析が可能になると述べた。
作業内容を詳細に記した原稿では、約1,300万の学習可能パラメータを持ち、196,608塩基対のゲノム配列を処理するモデルが、スプライス部位とジャンクション予測を統合したスプライスグラフを構築し、そこから完全な転写産物とその使用量を推定すると記述されている。SpliceAI2は、人間と追加の9種の哺乳類種をカバーする314,745件のRNAシーケンシングサンプルを用いてエンドツーエンドで学習され、フィルタリング後に4,600万以上の観測スプライスジャンクションをカバーし、さらに公開されているENCODEプロジェクトからの330件のロングリードRNAシーケンシングサンプルも組み込んでいる。著者らは、モデルが保持されていない遺伝子のうち82%で最も豊富な転写産物を正確に再構築したと報告しており、ロングリードデータなしで学習した場合の78%と比較している。
この原稿では、147種のRNA結合タンパク質の発現レベルに基づいて予測を条件付けるファインチューニングフレームワークも説明されており、48のGenotype-Tissue Expression(GTEx)組織にわたる約1,500万件の差分スプライス部位使用測定で組織特異的なスプライシング差異を捉えている。著者らは、モデルが実際のスプライシング調節因子が認識する配列モチーフを明示的な指導なしに独自に学習したこと、そしてこのフレームワークがSF3B1変異腫瘍や筋強直性ジストロフィーなどの疾患状態に適用されたことを報告している。
ベンチマークと希少疾患に関する所見
3つの独立したベンチマークにわたり、原稿はSpliceAI2がオリジナルのSpliceAI、Pangolin、そしてGoogle DeepMindのAlphaGenomeを上回ったと報告している。AlphaGenomeの比較は、University of Oxfordの共同研究者によって独立して実施された。SpliceAI2はGTEx暗号スプライス変異検出において次点モデルが0.66であるのに対し0.77のauPRCを、スプライス部位使用量の定量化において0.47に対し0.63のSpearman相関、スプライシング定量形質座位(sQTL)分類において0.73に対し0.76のauROC、OpenSplice大規模並列レポーターアッセイベンチマークにおいて0.55に対し0.59のSpearman相関を示した。Illuminaの発表によれば、モデルは次点モデルと比較してスプライス部位使用量の定量化を34%向上させた。
Genomics England 100,000 Genomes Projectからの7,504人のプロバンドを対象とした解析で、原稿はSpliceAI2によって優先された変異が表現型に合致した疾患遺伝子に有意に富んでいることを報告している。信頼度閾値を合わせた場合、他のすべてのスプライシングモデルよりも疾患関連変異を17%多く特定し、オッズ比2の固定条件下で次点モデルが114件であるのに対し133件の余剰変異を回収した。Illuminaは、SpliceAI2がレガシーなSpliceAIに比べて2倍信頼区間で33%、4倍信頼区間で66%多く疾患関連スプライス変異を検出したと報告した。特定された暗号スプライス変異の約半数はイントロン内部の深部に位置しており、原稿はイントロン内50塩基以上の変異は通常エクソームシーケンシングで見逃されると述べている。予測されたスプライス変化変異は、コホート全体の余剰遺伝的負荷の15%を占めていると原稿は示している。
本稿で報告された集団規模の検証は、gnomAD、TOPMed、UK Biobank からの 627,000 件以上のゲノムを使用し、最高の SpliceAI2 スコアが付与された変異は強く減少しており、タンパク質切断型ロスオブファンクション変異で観察される減少に近いことが示されました。UK Biobank の 36,764 人の参加者のプロテオミクスデータは、スコアが高い変異を保有する者は血漿タンパク質レベルが低く、ピアソン相関は -0.50 で、評価されたモデルの中で最も強い相関を示しました。5,435 人の Genomics England 参加者の RNA シーケンシングデータは、個別症例における予測を検証し、PEX1 ドナー欠失変異(桿体円錐ジストロフィーに関連)および PKD1 隠れドナー変異(嚢胞性腎疾患に関連)を含んでいました。
利用可能性とライセンス
Illumina は、SpliceAI2 が BioInsight Platform のアプリケーション(DRAGEN Annotation、Emedgene、Illumina Connected Insights を含む)を通じて利用可能であると述べました。ヒト遺伝子本体内のすべての単一ヌクレオチド変異(40 億件)およびヒト集団で観測されたインデル(1.5 億件)に対するソースコード、学習済みモデル重み、事前計算された予測は、SpliceAI2 GitHub リポジトリ と Hugging Face を通じて、学術および非商用研究利用向けに提供され、商用ライセンスについては別途連絡先があります。ソフトウェアは PyPI 経由でインストールでき、CUDA 対応 GPU が必要です。
リポジトリのドキュメントによれば、spliceai2_summary_score は 0 から 1 の範囲で、ハイリコールには 0.1、精度とリコールのバランスには 0.25、ハイプレシジョンには 0.5 の閾値が推奨されており、これは SpliceAI の 0.2、0.5、0.8 に相当します。SpliceAI2 の研究は Kishore Jaganathan と Kyle Farh が主導し、University of Oxford、UCSF、New York Genome Center の共同研究者が参加しました。












