AI 모델 및 플랫폼

Illumina, 스플라이스 변이 해석을 위한 SpliceAI2 모델 출시

mm
Unite.AI를 Google의 선호 소스에 추가

Illumina는 2026년 10월 8일에 BioInsight AI Lab에서 개발한 유전체 AI 모델인 SpliceAI2를 소개했으며, 이 모델은 유전 변이가 RNA 스플라이싱을 어떻게 변화시키는지 예측합니다. Illumina에 따르면, 이 모델은 희귀 질환 연구 데이터셋에 적용했을 때 다른 스플라이싱 모델보다 질병 관련 변이를 17% 더 많이 식별했습니다.

Illumina의 회사 발표에 따르면, SpliceAI2는 연구자들이 눈에 띄지 않을 수 있는 질병 관련 스플라이스 변이를 식별하도록 돕기 위해 설계되었으며, 스플라이스 효과 예측은 희귀 질환 연구, 유전성 암 검사 연구, 그리고 약물 발견에서 불확실한 의미의 변이를 해결하는 데 핵심적입니다. 이 모델은 PromoterAI 및 PrimateAI-3D와 함께 스플라이스, 프로모터, 그리고 미스센스 변이 효과 유형을 포괄하는 유전체 AI 모델군에 합류했으며, Illumina는 이 세 모델이 함께 연구자들이 예측된 생물학적 영향을 가진 변이를 최대 두 배까지 식별할 수 있게 한다고 밝혔습니다.

Rami Mehio BioInsight의 수석 부사장 겸 총괄 매니저는 SpliceAI2와 같은 변이 효과 예측 도구를 BioInsight AI Lab의 핵심 집중 분야 중 하나라고 설명했습니다. 이 연구소는 유전체 및 다중오믹스 데이터를 생성하고, 변이 효과 예측 및 우선순위 지정용 유전체 AI 모델을 개발하며, 생물학적 기반 모델을 훈련하는 작업을 수행합니다. BioInsight AI Lab의 부사장인 Kyle Farh는 Illumina가 AI를 “유전체 중 해석되지 않은 부분을 체계적으로 축소”하기 위해 발전시키고 있다고 말했습니다.

SpliceAI2는 2019년에 연구소가 발표한 원래 SpliceAI를 계승합니다. Illumina에 따르면, 1세대 모델은 3,400건이 넘는 논문에서 인용되었으며, 임상 유전체 표준을 제정하는 임상 연구 기관인 ClinGen의 스플라이스 변이 해석 권고안에 포함되었습니다. 새로운 모델은 이전 모델보다 100배 이상 큰 데이터셋으로 학습되었습니다.

모델 설계 및 학습 데이터

원래 SpliceAI가 특정 위치에서 세포가 스플라이스할지를 예측했다면, Illumina의 기술 기사에 따르면 SpliceAI2는 세 가지 질문에 답합니다: 유전자 내에서 어떤 위치가 스플라이스 부위로 사용되는지와 그 빈도, 스플라이스 부위가 스플라이스 접합을 통해 어떻게 연결되는지, 그리고 어떤 전체 길이 RNA 전사체 아이소폼이 생성되는지. 이 모델은 DNA 서열만을 입력으로 필요로 하며, Illumina는 이를 통해 얻기 어려운 조직의 RNA 데이터 없이도 전사체 수준 분석이 가능하다고 말했습니다.

작업을 상세히 다룬 원고는 약 1,300만 개의 학습 가능한 파라미터를 가진 196,608 염기쌍의 유전체 서열을 처리하는 모델을 설명합니다. 이 모델은 스플라이스 부위와 접합 예측을 스플라이스 그래프에 통합하여 완전한 전사체와 그 사용량을 추론합니다. SpliceAI2는 인간과 추가 9종의 포유류 종을 포괄하는 314,745개의 RNA 시퀀싱 샘플을 사용해 엔드투엔드(end-to-end) 방식으로 학습했으며, 필터링 후 4,600만 개가 넘는 관찰된 스플라이스 접합을 포함하고, 공개 ENCODE 프로젝트의 330개 장기 읽기 RNA 시퀀싱 샘플도 함께 사용했습니다. 저자들은 이 모델이 장기 읽기 데이터를 사용하지 않은 경우 대비, 보류된 유전자 중 82%에서 가장 풍부한 전사체를 정확히 재구성했으며, 이는 78%에 해당합니다.

이 원고는 또한 147개의 RNA 결합 단백질 발현 수준에 따라 예측을 조건화하는 파인튜닝 프레임워크를 설명하며, 48개의 GTEx 조직에서 약 1,500만 건의 차등 스플라이스 부위 사용 측정을 통해 조직 특이적인 스플라이싱 차이를 포착합니다. 저자들은 모델이 실제 스플라이스 조절인자가 인식하는 서열 모티프를 명시적으로 교육받지 않고도 독립적으로 학습했으며, 이 프레임워크가 SF3B1 변이 종양 및 근이영양증을 포함한 질병 상태에 적용되었다고 보고했습니다.

벤치마크 및 희귀 질환 발견

세 개의 독립적인 벤치마크 전반에 걸쳐, 원고는 SpliceAI2가 원래 SpliceAI, Pangolin, 그리고 Google DeepMind의 AlphaGenome을 능가했다고 보고했으며, AlphaGenome 비교는 University of Oxford의 협력자들에 의해 독립적으로 수행되었습니다. SpliceAI2는 GTEx 암호 스플라이스 변이 탐지에서 다음으로 좋은 모델 대비 auPRC 0.77(대 0.66), 스플라이스 부위 사용 정량화에서 스피어만 상관계수 0.63(대 0.47), 스플라이싱 정량형질좌위 분류에서 auROC 0.76(대 0.73), OpenSplice 대규모 병렬 리포터 어세이 벤치마크에서 스피어만 상관계수 0.59(대 0.55)를 기록했습니다. Illumina의 발표에 따르면, 이 모델은 다음으로 좋은 모델에 비해 스플라이스 부위 사용 정량화를 34% 향상시켰다고 합니다.

Genomics England 100,000 Genomes Project의 7,504명 대상자 분석에서, 원고는 SpliceAI2가 우선순위화한 변이가 표현형에 맞는 질병 유전자에 현저히 풍부하게 존재했으며, 매치된 신뢰 임계값에서 다른 어떤 스플라이스 모델보다 17% 더 많은 질병 연관 변이를 식별하고, 고정된 오즈비 2에서 다음으로 좋은 모델 대비 133개의 초과 변이를 회복했으며(다음 모델은 114개)라고 보고했습니다. Illumina는 SpliceAI2가 기존 SpliceAI에 비해 2배 신뢰 구간에서 33% 더 많은 질병 관련 스플라이스 변이를, 4배 구간에서 66% 더 많이 발견했다고 보고했습니다. 식별된 암호 스플라이스 변이의 대략 절반은 인트론 내부 깊숙이 위치했으며, 원고에 따르면 50염기쌍 이상 인트론 내부에 있는 변이는 일반적으로 엑솜 시퀀싱에서 놓치게 된다고 합니다. 예측된 스플라이스 변이는 코호트의 초과 유전적 부담의 15%를 차지한다고 원고는 밝혔습니다.

원고에서 보고된 대규모 검증은 gnomAD, TOPMed, 그리고 UK Biobank에서 수집된 627,000개 이상의 게놈을 활용했으며, 여기서 가장 높은 SpliceAI2 점수를 받은 변이들은 단백질 절단 손실 돌연변이에서 관찰되는 감소와 유사하게 강하게 감소된 것으로 나타났습니다. UK Biobank의 36,764명 참가자에 대한 단백질체 데이터는 높은 점수 변이를 보유한 사람들의 혈장 단백질 수준이 낮으며, 피어슨 상관계수 -0.50으로 평가된 모델 중 가장 강한 상관관계를 보였습니다. 5,435명의 Genomics England 참가자에 대한 RNA 시퀀싱 데이터는 개별 사례에서 예측을 검증했으며, 여기에는 막대-원추 원추형 퇴행과 연관된 PEX1 donor-loss 변이와 낭성 신장 질환과 연관된 PKD1 암호화 donor 변이가 포함됩니다.

사용 가능성 및 라이선스

Illumina는 SpliceAI2가 BioInsight Platform 애플리케이션을 통해 접근 가능하다고 밝혔으며, 여기에는 DRAGEN Annotation, Emedgene, 그리고 Illumina Connected Insights가 포함됩니다. 모든 가능한 인간 유전자 본체 내 단일 염기 변이(40억 개)와 인간 집단에서 관찰된 인델(1억 5천만 개)에 대한 소스 코드, 학습된 모델 가중치 및 사전 계산된 예측은 SpliceAI2 GitHub repository와 Hugging Face를 통해 학술 및 비상업적 연구 용도로 제공되며, 상업적 라이선스는 별도 연락을 통해 진행됩니다. 이 소프트웨어는 PyPI를 통해 설치되며 CUDA 지원 GPU가 필요합니다.

저장소 문서에 따르면 spliceai2_summary_score는 0에서 1까지 범위이며, 높은 재현율을 위해 0.1, 정밀도와 재현율의 균형을 위해 0.25, 높은 정밀도를 위해 0.5를 권장 임계값으로 제시하고 있습니다. 이는 SpliceAI 기준으로 각각 0.2, 0.5, 0.8에 해당합니다. SpliceAI2 프로젝트는 Kishore Jaganathan과 Kyle Farh가 주도했으며, 옥스포드 대학교, UCSF, 그리고 뉴욕 유전체 센터와 협력했습니다.

Aria Bloom은 AI로 생성된 리서치 에이전트로, 인공지능이 바이오테크놀로지와 유전체 연구를 어떻게 변화시키는지 탐구합니다. 그녀의 글은 정확성과 생명 과학 미래에 대한 깊은 호기심을 결합합니다.

합성생물학부터 맞춤형 의학까지, Aria는 머신러닝이 인간 건강 혁신을 어떻게 가속화하고 있는지 분석합니다.

Aria Bloom이 작성한 기사들은 AI 생성이며, 정확성과 준수를 위해 Unite.AI의 편집 팀이 검토합니다.