Μοντέλα και πλατφόρμες AI
Η Illumina λανσάρει το μοντέλο SpliceAI2 για την ερμηνεία παραλλαγών splicing

Η Illumina παρουσίασε το SpliceAI2 στις 8 Οκτωβρίου 2026, ένα γονιδιακό μοντέλο AI από το BioInsight AI Lab της, το οποίο προβλέπει πώς οι γενετικές παραλλαγές τροποποιούν το splicing του RNA. Η Illumina δήλωσε ότι το μοντέλο εντόπισε 17 % περισσότερες παραλλαγές σχετικές με ασθένειες σε σύγκριση με άλλα μοντέλα splicing όταν εφαρμόστηκε σε σύνολο δεδομένων έρευνας σπάνιων ασθενειών.
Σύμφωνα με την ανακοίνωση της εταιρείας, το SpliceAI2 έχει σχεδιαστεί για να βοηθά τους ερευνητές να εντοπίζουν παραλλαγές splicing σχετικές με ασθένειες που διαφορετικά θα μπορούσαν να παραμείνουν αθέατες, με την πρόβλεψη του αποτελέσματος splicing να είναι κλειδί για την επίλυση παραλλαγών ασαφούς σημασίας στην έρευνα σπάνιων ασθενειών, στην έρευνα κληρονομικού καρκινικού ελέγχου και στην ανακάλυψη φαρμάκων. Το μοντέλο εντάσσεται στο PromoterAI και το PrimateAI-3D σε μια σειρά γονιδιακών μοντέλων AI που καλύπτουν τύπους παραλλαγών splicing, προμηθέα και μη‑συντακτικών παραλλαγών, και η Illumina δήλωσε ότι τα τρία μαζί επιτρέπουν πλέον στους ερευνητές να εντοπίζουν έως και το διπλάσιο αριθμό παραλλαγών με προβλεπόμενη βιολογική επίδραση.
Ο Rami Mehio, ανώτερος αντιπρόεδρος και γενικός διευθυντής του BioInsight, περιέγραψε τα εργαλεία πρόβλεψης αποτελεσμάτων παραλλαγών όπως το SpliceAI2 ως μία από τις κύριες περιοχές εστίασης του BioInsight AI Lab· το εργαστήριο εργάζεται στην παραγωγή γονιδιακών και πολυομικών δεδομένων, στην ανάπτυξη γονιδιακών μοντέλων AI για πρόβλεψη και προτεραιοποίηση αποτελεσμάτων παραλλαγών, καθώς και στην εκπαίδευση βιολογικών μοντέλων βάσης. Ο Kyle Farh, αντιπρόεδρος του BioInsight AI Lab, δήλωσε ότι η Illumina προωθεί την AI «για να μειώσει συστηματικά το τμήμα του γονιδιώματος που παραμένει ακατανόητο».
Το SpliceAI2 ακολουθεί το αρχικό SpliceAI, το οποίο το εργαστήριο κυκλοφόρησε το 2019. Η Illumina δήλωσε ότι το μοντέλο πρώτης γενιάς έχει αναφερθεί σε περισσότερες από 3.400 δημοσιεύσεις και έχει ενσωματωθεί στις συστάσεις ερμηνείας παραλλαγών splicing από το ClinGen, έναν κλινικό ερευνητικό φορέα που θέτει πρότυπα για την κλινική γονιδιωματική. Το νέο μοντέλο εκπαιδεύτηκε σε ένα σύνολο δεδομένων που είναι περισσότερο από 100 φορές μεγαλύτερο από το προηγούμενο.
Σχεδίαση Μοντέλου και Δεδομένα Εκπαίδευσης
Ενώ το αρχικό SpliceAI πρόβλεπε αν ένα κύτταρο θα έκανε splicing σε μια συγκεκριμένη θέση, το SpliceAI2 αντιμετωπίζει τρία ερωτήματα, σύμφωνα με το τεχνικό άρθρο της Illumina: ποιες θέσεις σε ένα γονίδιο χρησιμοποιούνται ως σημεία splicing και πόσο συχνά, ποια σημεία splicing συνδέονται μέσω συνδέσμων splicing, και ποιες πλήρους μήκους ισομορφές μεταγραφών RNA παράγονται. Το μοντέλο απαιτεί μόνο μια ακολουθία DNA ως είσοδο, κάτι που, σύμφωνα με την Illumina, επιτρέπει ανάλυση σε επίπεδο μεταγραφής χωρίς δεδομένα RNA από δύσκολα προσβάσιμους ιστούς.
Ένα χειρόγραφο που περιγράφει την εργασία περιγράφει ένα μοντέλο που επεξεργάζεται 196.608 βάσεις γονιδιακής ακολουθίας με περίπου 13 εκατομμύρια παραμέτρους εκπαίδευσης, ενσωματώνοντας προβλέψεις σημείων splicing και συνδέσμων σε ένα γράφημα splicing από το οποίο προκύπτουν πλήρεις μεταγραφές και η χρήση τους. Το SpliceAI2 εκπαιδεύτηκε ολοκληρωτικά σε 314.745 δείγματα αλληλούχισης RNA που καλύπτουν τον άνθρωπο και εννέα επιπλέον θηλαστικά είδη, καλύπτοντας περισσότερα από 46 εκατομμύρια παρατηρηθέντες συνδέσμους splicing μετά το φιλτράρισμα, μαζί με 330 δείγματα μακράς ανάγνωσης RNA από το δημόσιο έργο ENCODE. Οι συγγραφείς αναφέρουν ότι το μοντέλο ανέκτησε ακριβώς τη πιο άφθονη μεταγραφή για το 82 % των δοκιμασμένων γονιδίων, σε σύγκριση με το 78 % όταν εκπαιδεύτηκε χωρίς δεδομένα μακράς ανάγνωσης.
Το χειρόγραφο περιγράφει επίσης ένα πλαίσιο λεπτομερούς ρύθμισης που εξαρτά τις προβλέψεις από τα επίπεδα έκφρασης 147 πρωτεϊνών δεσμευόμενων στο RNA, καταγράφοντας διαφορές splicing ειδικές για τους ιστούς σε 48 ιστούς του Genotype‑Tissue Expression (GTEx) σε σχεδόν 15 εκατομμύρια μετρήσεις διαφοροποιημένης χρήσης σημείων splicing. Οι συγγραφείς αναφέρουν ότι το μοντέλο έμαθε ανεξάρτητα μοτίβα ακολουθίας που αναγνωρίζονται από πραγματικούς ρυθμιστές splicing χωρίς να του διδάχθηκαν ρητά αυτές οι σχέσεις, και ότι το πλαίσιο προσαρμόστηκε σε καταστάσεις ασθένειας, συμπεριλαμβανομένων των όγκων με μετάλλαξη SF3B1 και της μυοτονικής δυστροφίας.
Δοκιμαστικές Αξιολογήσεις και Ευρήματα σε Σπάνιες Ασθένειες
Σε τρία ανεξάρτητα benchmarks, το χειρόγραφο αναφέρει ότι το SpliceAI2 υπερέδωσε το αρχικό SpliceAI, το Pangolin και το AlphaGenome της Google DeepMind, με τις συγκρίσεις AlphaGenome να διεξάγονται ανεξάρτητα από συνεργάτες στο University of Oxford. Το SpliceAI2 πέτυχε auPRC 0,77 έναντι 0,66 για το επόμενο καλύτερο μοντέλο στην ανίχνευση κρυπτικών παραλλαγών splicing στο GTEx, συσχέτιση Spearman 0,63 έναντι 0,47 στην ποσοτικοποίηση χρήσης σημείων splicing, auROC 0,76 έναντι 0,73 στην ταξινόμηση ποσοτικών χαρακτηριστικών splicing (sQTL), και συσχέτιση Spearman 0,59 έναντι 0,55 στο benchmark του OpenSplice με μαζικά παράλληλο αναλυτικό δοκιμαστικό σύστημα. Η ανακοίνωση της Illumina δηλώνει ότι το μοντέλο βελτίωσε την ποσοτικοποίηση της χρήσης σημείων splicing κατά 34 % σε σύγκριση με το επόμενο καλύτερο μοντέλο.
Σε ανάλυση 7.504 probands από το Genomics England 100.000 Genomes Project, το χειρόγραφο αναφέρει ότι οι παραλλαγές που προτεραιοποιήθηκαν από το SpliceAI2 ήταν σημαντικά πλουσιότερες σε γονίδια ασθένειας που ταιριάζουν με το φαινότυπο, εντοπίζοντας 17 % περισσότερες παραλλαγές σχετικές με ασθένειες από οποιοδήποτε άλλο δοκιμασμένο μοντέλο splicing σε αντίστοιχα όρια εμπιστοσύνης και ανακτώντας 133 επιπλέον παραλλαγές έναντι 114 για το επόμενο καλύτερο μοντέλο σε σταθερό λόγο πιθανοτήτων 2. Η Illumina ανέφερε ότι το SpliceAI2 βρήκε 33 % περισσότερες παραλλαγές splicing σχετικές με ασθένειες σε σχέση με το κληρονομημένο SpliceAI σε διάστημα εμπιστοσύνης 2X και 66 % περισσότερες σε διάστημα 4X. Περίπου το ήμισυ των κρυπτικών παραλλαγών splicing που εντοπίστηκαν βρίσκονταν βαθιά εντός ενδογενών περιοχών, και το χειρόγραφο δηλώνει ότι παραλλαγές που βρίσκονται περισσότερο από 50 βάσεις εντός ενδογενών συνήθως παραβλέπονται από την αλληλούχιση εξώματος. Οι προβλεπόμενες παραλλαγές που επηρεάζουν το splicing αντιπροσώπευαν το 15 % του επιπλέον γενετικού φορτίου στην ομάδα, σύμφωνα με το χειρόγραφο.
Η επικύρωση σε κλίμακα πληθυσμού που αναφέρεται στο χειρόγραφο βασίστηκε σε περισσότερα από 627.000 γονότυπους από το gnomAD, το TOPMed και το UK Biobank, όπου οι μεταλλάξεις που έλαβαν τις υψηλότερες βαθμολογίες SpliceAI2 ήταν έντονα αποπνικμένες, προσεγγίζοντας την αποπνίκωση που παρατηρείται για τις πρωτεϊνικές-τριβικές μεταλλάξεις απώλειας λειτουργίας. Τα πρωτεομικά δεδομένα του UK Biobank από 36.764 συμμετέχοντες έδειξαν ότι οι φορείς μεταλλάξεων υψηλότερης βαθμολογίας είχαν χαμηλότερα επίπεδα πρωτεϊνών στο πλάσμα, με συσχέτιση Pearson -0,50, τη μεγαλύτερη μεταξύ των αξιολογούμενων μοντέλων. Τα δεδομένα αλληλούχισης RNA από 5.435 συμμετέχοντες του Genomics England επικύρωσαν προβλέψεις σε μεμονωμένες περιπτώσεις, συμπεριλαμβανομένης μιας μεταλλάξης απώλειας δότη PEX1 που σχετίζεται με διστοφία ραβδίου-κώνος και μιας κρυφής μεταλλάξης δότη PKD1 που σχετίζεται με κυστική νεφρική νόσο.
Διαθεσιμότητα και Άδεια Χρήσης
Η Illumina δήλωσε ότι το SpliceAI2 είναι προσβάσιμο μέσω των εφαρμογών της πλατφόρμας BioInsight, συμπεριλαμβανομένων των DRAGEN Annotation, Emedgene και Illumina Connected Insights. Ο πηγαίος κώδικας, τα εκπαιδευμένα βάρη του μοντέλου και οι προ-υπολογισμένες προβλέψεις για όλες τις πιθανές μονοπλέγματες μεταλλάξεις εντός των ανθρώπινων γονιδιακών σωμάτων (4 δισεκατομμύρια) και οι ενδείξεις εισαγωγών που παρατηρούνται σε ανθρώπινους πληθυσμούς (150 εκατομμύρια) είναι διαθέσιμα μέσω του SpliceAI2 GitHub repository και του Hugging Face για ακαδημαϊκή και μη εμπορική έρευνα, με ξεχωριστή επαφή για εμπορική άδεια. Το λογισμικό εγκαθίσταται μέσω PyPI και απαιτεί GPU συμβατό με CUDA.
Σύμφωνα με την τεκμηρίωση του αποθετηρίου, το spliceai2_summary_score κυμαίνεται από 0 έως 1, με προτεινόμενα όρια 0,1 για υψηλή ανάκληση, 0,25 για ισορροπημένη ακρίβεια και ανάκληση, και 0,5 για υψηλή ακρίβεια, αντιστοιχώντας σε ισοδύναμα του SpliceAI 0,2, 0,5 και 0,8. Η εργασία στο SpliceAI2 καθοδηγήθηκε από τους Kishore Jaganathan και Kyle Farh, με συνεργάτες από το University of Oxford, το UCSF και το New York Genome Center.












