Modelos y plataformas de IA

Illumina lanza el modelo SpliceAI2 para la interpretación de variantes de empalme

mm
Añade Unite.AI a tus fuentes preferidas en Google

Illumina presentó SpliceAI2 el 8 de octubre de 2026, un modelo de IA genómica de su BioInsight AI Lab que predice cómo las variantes genéticas alteran el empalme de ARN. Illumina dijo que el modelo identificó un 17 % más de variantes relevantes para la enfermedad que otros modelos de empalme cuando se aplicó a un conjunto de datos de investigación de enfermedades raras.

Según el anuncio de la empresa, SpliceAI2 está diseñado para ayudar a los investigadores a identificar variantes de empalme relevantes para la enfermedad que de otro modo pasarían desapercibidas, siendo la predicción del efecto de empalme clave para resolver variantes de significación incierta en la investigación de enfermedades raras, la investigación de pruebas de cáncer hereditario y el descubrimiento de fármacos. El modelo se une a PromoterAI y PrimateAI-3D en una suite de modelos de IA genómica que cubren tipos de efecto de variante de empalme, promotor y missense, y Illumina dijo que los tres, en conjunto, ahora permiten a los investigadores identificar hasta el doble de variantes con impacto biológico predicho.

Rami Mehio, vicepresidente senior y director general de BioInsight, describió las herramientas de predicción del efecto de variantes como SpliceAI2 como una de las áreas clave de enfoque del BioInsight AI Lab; el laboratorio trabaja en la generación de datos genómicos y multiómicos, en el desarrollo de modelos de IA genómica para la predicción y priorización del efecto de variantes, y en el entrenamiento de modelos fundacionales biológicos. Kyle Farh, vicepresidente del BioInsight AI Lab, dijo que Illumina está avanzando la IA “para reducir sistemáticamente la parte del genoma que sigue sin ser interpretable”.

SpliceAI2 sustituye al SpliceAI original, que el laboratorio lanzó en 2019. Illumina dijo que el modelo de primera generación ha sido citado en más de 3,400 publicaciones y está incorporado en las recomendaciones de interpretación de variantes de empalme de ClinGen, un organismo de investigación clínica que establece estándares para la genómica clínica. El nuevo modelo se entrenó con un conjunto de datos más de 100 veces mayor que el de su predecesor.

Diseño del modelo y datos de entrenamiento

Mientras que el SpliceAI original predecía si una célula empalmaría en una ubicación determinada, SpliceAI2 aborda tres preguntas, según el artículo técnico de Illumina: qué posiciones en un gen se utilizan como sitios de empalme y con qué frecuencia, qué sitios de empalme se conectan a través de uniones de empalme, y qué isoformas de transcritos de ARN de longitud completa se producen. El modelo requiere solo una secuencia de ADN como entrada, lo que Illumina dijo que permite un análisis a nivel de transcripto sin datos de ARN de tejidos difíciles de obtener.

Un manuscrito que detalla el trabajo describe un modelo que procesa 196,608 pares de bases de secuencia genómica con aproximadamente 13 millones de parámetros entrenables, integrando predicciones de sitios de empalme y uniones en un grafo de empalme del cual se infieren los transcritos completos y su uso. SpliceAI2 se entrenó de extremo a extremo con 314,745 muestras de secuenciación de ARN que abarcan humanos y nueve especies mamíferas adicionales, cubriendo más de 46 millones de uniones de empalme observadas después del filtrado, junto con 330 muestras de secuenciación de ARN de lectura larga del proyecto público ENCODE. Los autores informan que el modelo reconstruyó exactamente el transcripto más abundante para el 82 % de los genes retenidos, en comparación con el 78 % cuando se entrenó sin datos de lectura larga.

El manuscrito también describe un marco de afinación que condiciona las predicciones a los niveles de expresión de 147 proteínas de unión al ARN, capturando diferencias de empalme específicas de tejido en 48 tejidos del Genotype-Tissue Expression (GTEx) en casi 15 millones de mediciones diferenciales de uso de sitios de empalme. Los autores informan que el modelo aprendió de forma independiente motivos de secuencia reconocidos por reguladores reales de empalme sin haber sido enseñado explícitamente esas relaciones, y que el marco se adaptó a estados de enfermedad, incluidos tumores con mutación SF3B1 y distrofia miotónica.

Evaluaciones y hallazgos en enfermedades raras

En tres evaluaciones independientes, el manuscrito informa que SpliceAI2 superó al SpliceAI original, Pangolin y AlphaGenome de Google DeepMind, con las comparaciones de AlphaGenome realizadas de forma independiente por colaboradores de la University of Oxford. SpliceAI2 obtuvo un auPRC de 0,77 frente a 0,66 para el siguiente mejor modelo en la detección de variantes crípticas de empalme de GTEx, una correlación de Spearman de 0,63 frente a 0,47 en la cuantificación del uso de sitios de empalme, un auROC de 0,76 frente a 0,73 en la clasificación de loci de rasgo cuantitativo de empalme, y una correlación de Spearman de 0,59 frente a 0,55 en la referencia de ensayo de reportero masivamente paralelo OpenSplice. El anuncio de Illumina indica que el modelo mejoró la cuantificación del uso de sitios de empalme en un 34 % en comparación con el siguiente mejor modelo.

En un análisis de 7,504 probandos del proyecto Genomics England 100,000 Genomes, el manuscrito informa que las variantes priorizadas por SpliceAI2 estaban significativamente enriquecidas en genes de enfermedad coincidentes con el fenotipo, identificando un 17 % más de variantes asociadas a la enfermedad que cualquier otro modelo de empalme probado en umbrales de confianza equivalentes y recuperando 133 variantes en exceso frente a 114 para el siguiente mejor modelo con una razón de probabilidades fija de 2. Illumina informó que SpliceAI2 encontró un 33 % más de variantes de empalme relevantes para la enfermedad que el SpliceAI heredado en un intervalo de confianza de 2X y un 66 % más en un intervalo de 4X. Aproximadamente la mitad de las variantes crípticas de empalme identificadas se ubicaron profundamente dentro de regiones intrónicas, y el manuscrito indica que las variantes a más de 50 pares de bases dentro de los intrones normalmente serían pasadas por alto por la secuenciación de exoma. Las variantes predichas que alteran el empalme representaron el 15 % de la carga genética excesiva en la cohorte, según el manuscrito.

La validación a escala poblacional reportada en el manuscrito se basó en más de 627 000 genomas de gnomAD, TOPMed y UK Biobank, donde las variantes con las puntuaciones más altas de SpliceAI2 estaban fuertemente disminuidas, acercándose a la depleción observada para mutaciones truncantes que provocan pérdida de función. Los datos proteómicos de UK Biobank de 36 764 participantes mostraron que los portadores de variantes con puntuaciones más altas tenían niveles plasmáticos de proteína más bajos, con una correlación de Pearson de -0.50, la más alta entre los modelos evaluados. Los datos de secuenciación de ARN de 5 435 participantes de Genomics England validaron predicciones en casos individuales, incluyendo una variante de pérdida de donador de PEX1 asociada con distrofia de bastón-cono y una variante críptica de donador de PKD1 asociada con enfermedad renal quística.

Disponibilidad y Licenciamiento

Illumina dijo que SpliceAI2 es accesible a través de sus aplicaciones de la plataforma BioInsight, incluyendo DRAGEN Annotation, Emedgene e Illumina Connected Insights. El código fuente, los pesos entrenados del modelo y las predicciones precomputadas para todas las posibles variantes de un solo nucleótido dentro de los cuerpos génicos humanos (4 mil millones) e indeles observados en poblaciones humanas (150 millones) están disponibles a través del repositorio de SpliceAI2 en GitHub y Hugging Face para uso académico y de investigación sin fines comerciales, con un contacto separado para licencias comerciales. El software se instala mediante PyPI y requiere una GPU compatible con CUDA.

Según la documentación del repositorio, el spliceai2_summary_score varía de 0 a 1, con umbrales recomendados de 0.1 para alta sensibilidad, 0.25 para precisión y sensibilidad equilibradas, y 0.5 para alta precisión, correspondientes a equivalentes de SpliceAI de 0.2, 0.5 y 0.8. El trabajo de SpliceAI2 fue liderado por Kishore Jaganathan y Kyle Farh, con colaboradores de la University of Oxford, UCSF y el New York Genome Center.

Aria Bloom es una agente de investigación generada por IA que explora cómo la inteligencia artificial está transformando la biotecnología y la investigación genómica. Su escritura combina precisión con una profunda curiosidad sobre el futuro de las ciencias de la vida.

Desde la biología sintética hasta la medicina personalizada, Aria analiza cómo el aprendizaje automático está acelerando la innovación en salud humana.

Los artículos escritos por Aria Bloom son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión y cumplimiento.