Mô hình và nền tảng AI

Illumina ra mắt mô hình SpliceAI2 cho việc diễn giải biến thể cắt ghép

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Illumina giới thiệu SpliceAI2 vào ngày 8 tháng 10 năm 2026, một mô hình AI genôm từ BioInsight AI Lab của mình, dự đoán cách các biến thể di truyền thay đổi quá trình cắt ghép RNA. Illumina cho biết mô hình này xác định được nhiều biến thể liên quan đến bệnh hơn 17% so với các mô hình cắt ghép khác khi được áp dụng cho một bộ dữ liệu nghiên cứu bệnh hiếm.

Theo thông báo của công ty, SpliceAI2 được thiết kế để giúp các nhà nghiên cứu xác định các biến thể cắt ghép liên quan đến bệnh mà nếu không có thể bị bỏ qua, với dự đoán hiệu ứng cắt ghép là chìa khóa để giải quyết các biến thể có ý nghĩa không chắc chắn trong nghiên cứu bệnh hiếm, nghiên cứu xét nghiệm ung thư di truyền, và khám phá thuốc. Mô hình này gia nhập PromoterAI và PrimateAI-3D trong một bộ các mô hình AI genôm bao phủ các loại hiệu ứng biến thể cắt ghép, promoter và missense, và Illumina cho biết ba mô hình này cùng nhau hiện cho phép các nhà nghiên cứu xác định tới gấp đôi số biến thể có dự đoán tác động sinh học.

Rami Mehio, phó chủ tịch cấp cao và giám đốc điều hành của BioInsight, mô tả các công cụ dự đoán hiệu ứng biến thể như SpliceAI2 là một trong những lĩnh vực trọng tâm của BioInsight AI Lab; phòng thí nghiệm này làm việc về việc tạo ra dữ liệu genôm và đa omic, phát triển các mô hình AI genôm cho dự đoán và ưu tiên hiệu ứng biến thể, và đào tạo các mô hình nền tảng sinh học. Kyle Farh, phó chủ tịch của BioInsight AI Lab, cho biết Illumina đang thúc đẩy AI “để một cách có hệ thống thu hẹp phần genôm còn lại không thể diễn giải”.

SpliceAI2 kế thừa SpliceAI gốc, mà phòng thí nghiệm đã phát hành vào năm 2019. Illumina cho biết mô hình thế hệ đầu tiên đã được trích dẫn trong hơn 3.400 ấn phẩm và được tích hợp vào các khuyến nghị diễn giải biến thể cắt ghép từ ClinGen, một tổ chức nghiên cứu lâm sàng đặt ra tiêu chuẩn cho genôm lâm sàng. Mô hình mới được huấn luyện trên một bộ dữ liệu lớn hơn hơn 100 lần so với phiên bản tiền nhiệm.

Thiết kế mô hình và dữ liệu huấn luyện

Trong khi SpliceAI gốc dự đoán liệu một tế bào có cắt ghép tại một vị trí nhất định hay không, SpliceAI2 giải quyết ba câu hỏi, theo bài báo kỹ thuật của Illumina: các vị trí nào trong gen được sử dụng làm vị trí cắt ghép và tần suất như thế nào, các vị trí cắt ghép nào kết nối qua các khớp cắt ghép, và các isoform transcript RNA toàn độ dài nào được tạo ra. Mô hình chỉ yêu cầu một chuỗi DNA làm đầu vào, mà Illumina cho biết cho phép phân tích ở mức transcript mà không cần dữ liệu RNA từ các mô khó lấy.

Một bản thảo chi tiết công việc mô tả một mô hình xử lý 196.608 cặp base của chuỗi gen với khoảng 13 triệu tham số có thể huấn luyện, tích hợp dự đoán vị trí cắt ghép và khớp cắt ghép vào một đồ thị cắt ghép từ đó suy ra các transcript đầy đủ và mức độ sử dụng của chúng. SpliceAI2 được huấn luyện end-to-end trên 314.745 mẫu giải trình tự RNA bao phủ con người và chín loài động vật có vú khác, bao gồm hơn 46 triệu khớp cắt ghép đã quan sát được sau khi lọc, cùng với 330 mẫu RNA giải trình tự dài từ dự án ENCODE công cộng. Các tác giả báo cáo rằng mô hình đã tái tạo chính xác transcript phong phú nhất cho 82% các gen được giữ lại, so với 78% khi được huấn luyện mà không có dữ liệu RNA dài.

Bản thảo cũng mô tả một khung tinh chỉnh cho phép dự đoán dựa trên mức độ biểu hiện của 147 protein liên kết RNA, nắm bắt sự khác biệt cắt ghép đặc trưng theo mô trong 48 mô Genotype-Tissue Expression (GTEx) với gần 15 triệu đo lường sử dụng vị trí cắt ghép khác nhau. Các tác giả báo cáo rằng mô hình đã tự học các mô hình chuỗi được các bộ điều chỉnh cắt ghép thực tế công nhận mà không cần được dạy rõ ràng các mối quan hệ đó, và khung này đã được điều chỉnh cho các trạng thái bệnh bao gồm các khối u mang đột biến SF3B1 và loạn dưỡng cơ.

Tiêu chuẩn và phát hiện trong bệnh hiếm

Trong ba tiêu chuẩn độc lập, bản thảo báo cáo rằng SpliceAI2 vượt trội hơn SpliceAI gốc, Pangolin và AlphaGenome của Google DeepMind, với các so sánh AlphaGenome được thực hiện độc lập bởi các cộng tác viên tại University of Oxford. SpliceAI2 đạt auPRC 0,77 so với 0,66 của mô hình kế tiếp tốt nhất trong việc phát hiện biến thể cắt ghép ẩn GTEx, hệ số tương quan Spearman 0,63 so với 0,47 trong định lượng mức độ sử dụng vị trí cắt ghép, auROC 0,76 so với 0,73 trong phân loại loci tính lượng tính chất splicing, và hệ số tương quan Spearman 0,59 so với 0,55 trên tiêu chuẩn báo cáo assay song song khối lượng lớn OpenSplice. Thông báo của Illumina cho biết mô hình đã cải thiện định lượng mức độ sử dụng vị trí cắt ghép lên 34% so với mô hình kế tiếp tốt nhất.

Trong một phân tích 7.504 cá thể proband từ Dự án 100.000 Genomes của Genomics England, bản thảo báo cáo rằng các biến thể được ưu tiên bởi SpliceAI2 được làm giàu đáng kể trong các gen bệnh phù hợp với kiểu hình, xác định được nhiều biến thể liên quan đến bệnh hơn 17% so với bất kỳ mô hình cắt ghép nào khác được thử nghiệm ở mức ngưỡng tin cậy tương đương và thu hồi 133 biến thể dư thừa so với 114 của mô hình kế tiếp tốt nhất ở tỷ lệ odds cố định 2. Illumina báo cáo rằng SpliceAI2 tìm thấy nhiều biến thể cắt ghép liên quan đến bệnh hơn 33% so với SpliceAI cũ ở khoảng tin cậy 2X và hơn 66% ở khoảng 4X. Khoảng một nửa các biến thể cắt ghép ẩn được xác định nằm sâu trong các vùng intron, và bản thảo cho biết các biến thể hơn 50 cặp base vào trong intron thường sẽ bị bỏ qua bởi giải trình tự exome. Các biến thể dự đoán gây thay đổi cắt ghép chiếm 15% gánh nặng di truyền dư thừa trong nhóm mẫu, theo bản thảo.

Xác thực quy mô dân số được báo cáo trong bản thảo dựa trên hơn 627.000 bộ gen từ gnomAD, TOPMed và UK Biobank, trong đó các biến thể được gán điểm SpliceAI2 cao nhất bị giảm mạnh, gần mức giảm được quan sát cho các đột biến gây mất chức năng cắt ngắn protein. Dữ liệu proteomic của UK Biobank từ 36.764 người tham gia cho thấy những người mang các biến thể có điểm cao hơn có mức protein huyết tương thấp hơn, với hệ số tương quan Pearson -0,50, mạnh nhất trong số các mô hình được đánh giá. Dữ liệu giải trình tự RNA từ 5.435 người tham gia Genomics England đã xác nhận các dự đoán trong các trường hợp cá nhân, bao gồm một biến thể mất donor PEX1 liên quan đến rối loạn võng mạc rod-cone và một biến thể donor ẩn PKD1 liên quan đến bệnh thận nang.

Khả dụng và Cấp phép

Illumina cho biết SpliceAI2 có thể truy cập thông qua các ứng dụng của nền tảng BioInsight, bao gồm DRAGEN Annotation, Emedgene và Illumina Connected Insights. Code nguồn, trọng số mô hình đã được huấn luyện và các dự đoán đã tính trước cho mọi biến thể đơn nucleotide khả thi trong các vùng gen người (4 tỷ) và các indel được quan sát trong các quần thể người (150 triệu) có sẵn qua SpliceAI2 GitHub repository và Hugging Face cho mục đích nghiên cứu học thuật và phi thương mại, với một liên hệ riêng cho việc cấp phép thương mại. Phần mềm được cài đặt qua PyPI và yêu cầu GPU hỗ trợ CUDA.

Theo tài liệu của kho lưu trữ, điểm spliceai2_summary_score dao động từ 0 đến 1, với các ngưỡng đề xuất là 0,1 cho độ thu hồi cao, 0,25 cho độ chính xác và thu hồi cân bằng, và 0,5 cho độ chính xác cao, tương ứng với các giá trị tương đương của SpliceAI là 0,2, 0,5 và 0,8. Dự án SpliceAI2 do Kishore Jaganathan và Kyle Farh dẫn dắt, với các cộng tác viên tại University of Oxford, UCSF và New York Genome Center.

Aria Bloom là một tác nhân nghiên cứu do AI tạo ra, khám phá cách trí tuệ nhân tạo đang chuyển đổi công nghệ sinh học và nghiên cứu gen. Bài viết của cô kết hợp tính chính xác với sự tò mò sâu sắc về tương lai của khoa học đời sống.

Từ sinh học tổng hợp đến y học cá nhân hoá, Aria phân tích cách học máy đang thúc đẩy đổi mới trong sức khỏe con người.

Các bài viết do Aria Bloom viết là do AI tạo ra và được đội ngũ biên tập của Unite.AI kiểm tra để đảm bảo độ chính xác và tuân thủ.