Modelos e plataformas de IA
Illumina lança o modelo SpliceAI2 para interpretação de variantes de splicing

Illumina introduziu o SpliceAI2 em 8 de outubro de 2026, um modelo de IA genômica de seu BioInsight AI Lab que prevê como variantes genéticas alteram o splicing de RNA. Illumina afirmou que o modelo identificou 17% mais variantes relevantes para doenças do que outros modelos de splicing quando aplicado a um conjunto de dados de pesquisa de doenças raras.
De acordo com o anúncio da empresa, o SpliceAI2 foi projetado para ajudar pesquisadores a identificar variantes de splicing relevantes para doenças que de outra forma passariam despercebidas, com a predição de efeito de splicing sendo fundamental para resolver variantes de significado incerto em pesquisas de doenças raras, testes de câncer hereditário e descoberta de fármacos. O modelo se junta ao PromoterAI e ao PrimateAI-3D em um conjunto de modelos de IA genômica que cobrem tipos de efeito de variantes de splicing, promotor e missense, e Illumina disse que os três, coletivamente, agora permitem que pesquisadores identifiquem até duas vezes mais variantes com impacto biológico previsto.
Rami Mehio, vice‑presidente sênior e gerente geral do BioInsight, descreveu ferramentas de predição de efeito de variantes como o SpliceAI2 como uma das áreas‑chave de foco do BioInsight AI Lab; o laboratório trabalha na geração de dados genômicos e multiômicos, no desenvolvimento de modelos de IA genômica para predição e priorização de efeitos de variantes e no treinamento de modelos de fundação biológica. Kyle Farh, vice‑presidente do BioInsight AI Lab, afirmou que a Illumina está avançando a IA “para reduzir sistematicamente a parte do genoma que permanece não interpretável”.
O SpliceAI2 sucede o SpliceAI original, que o laboratório lançou em 2019. Illumina disse que o modelo de primeira geração foi citado em mais de 3.400 publicações e está incorporado às recomendações de interpretação de variantes de splicing da ClinGen, um órgão de pesquisa clínica que define padrões para genômica clínica. O novo modelo foi treinado em um conjunto de dados mais de 100 vezes maior que o de seu predecessor.
Design do Modelo e Dados de Treinamento
Onde o SpliceAI original previa se uma célula faria splicing em uma determinada localização, o SpliceAI2 aborda três questões, segundo o artigo técnico: quais posições em um gene são usadas como sítios de splicing e com que frequência, quais sítios de splicing se conectam por meio de junções de splicing, e quais isoformas de transcritos de RNA de comprimento total são produzidas. O modelo requer apenas uma sequência de DNA como entrada, o que, segundo a Illumina, permite análise ao nível de transcrito sem dados de RNA de tecidos difíceis de obter.
Um manuscrito detalhando o trabalho descreve um modelo que processa 196.608 pares de bases de sequência genômica com aproximadamente 13 milhões de parâmetros treináveis, integrando predições de sítios de splicing e junções em um grafo de splicing a partir do qual transcritos completos e seu uso são inferidos. O SpliceAI2 foi treinado de ponta a ponta em 314.745 amostras de sequenciamento de RNA abrangendo humanos e nove espécies mamíferas adicionais, cobrindo mais de 46 milhões de junções de splicing observadas após filtragem, juntamente com 330 amostras de sequenciamento de RNA de leitura longa do projeto público ENCODE. Os autores relatam que o modelo reconstruiu exatamente o transcrito mais abundante para 82% dos genes reservados, comparado a 78% quando treinado sem dados de leitura longa.
O manuscrito também descreve uma estrutura de ajuste fino que condiciona as predições aos níveis de expressão de 147 proteínas ligadoras de RNA, capturando diferenças de splicing específicas de tecido em 48 tecidos do Genotype‑Tissue Expression (GTEx) em quase 15 milhões de medições diferenciais de uso de sítios de splicing. Os autores relatam que o modelo aprendeu independentemente motivos de sequência reconhecidos por reguladores reais de splicing sem ter sido explicitamente ensinado essas relações, e que a estrutura foi adaptada a estados de doença, incluindo tumores mutantes em SF3B1 e distrofia miotônica.
Benchmarks e Descobertas em Doenças Raras
Em três benchmarks independentes, o manuscrito relata que o SpliceAI2 superou o SpliceAI original, o Pangolin e o AlphaGenome da Google DeepMind, com as comparações do AlphaGenome realizadas independentemente por colaboradores da University of Oxford. O SpliceAI2 obteve um auPRC de 0,77 versus 0,66 para o próximo melhor modelo na detecção de variantes crípticas de splicing no GTEx, uma correlação de Spearman de 0,63 versus 0,47 na quantificação de uso de sítios de splicing, um auROC de 0,76 versus 0,73 na classificação de loci quantitativos de splicing, e uma correlação de Spearman de 0,59 versus 0,55 no benchmark OpenSplice de ensaio de relatório paralelo massivo. O anúncio da Illumina afirma que o modelo melhorou a quantificação do uso de sítios de splicing em 34% comparado ao próximo melhor modelo.
Em uma análise de 7.504 probandos do Projeto Genômico England 100.000 Genomas, o manuscrito relata que variantes priorizadas pelo SpliceAI2 foram significativamente enriquecidas em genes de doença correspondentes ao fenótipo, identificando 17% mais variantes associadas a doenças do que qualquer outro modelo de splicing testado em limiares de confiança correspondentes e recuperando 133 variantes excedentes versus 114 para o próximo melhor modelo em uma razão de chances fixa de 2. Illumina informou que o SpliceAI2 encontrou 33% mais variantes de splicing relevantes para doenças do que o SpliceAI legado em um intervalo de confiança 2X e 66% mais em um intervalo 4X. Aproximadamente metade das variantes crípticas de splicing identificadas estavam localizadas profundamente dentro de regiões intrônicas, e o manuscrito afirma que variantes a mais de 50 pares de bases dentro dos intrões normalmente seriam perdidas pelo sequenciamento de exoma. Variantes previstas que alteram o splicing representaram 15% da carga genética excedente na coorte, segundo o manuscrito.
Validação em escala populacional relatada no manuscrito baseou‑se em mais de 627 000 genomas do gnomAD, TOPMed e UK Biobank, onde variantes atribuídas às pontuações mais altas do SpliceAI2 foram fortemente depletadas, aproximando‑se da depleção observada para mutações truncantes de perda de função de proteína. Dados proteômicos do UK Biobank de 36 764 participantes mostraram que portadores de variantes com pontuações mais altas apresentaram níveis plasmáticos de proteína mais baixos, com correlação de Pearson de -0,50, a mais forte entre os modelos avaliados. Dados de sequenciamento de RNA de 5 435 participantes do Genomics England validaram previsões em casos individuais, incluindo uma variante de perda de doador do PEX1 associada à distrofia bastonete‑cone e uma variante críptica de doador do PKD1 associada à doença renal cística.
Disponibilidade e Licenciamento
A Illumina afirmou que o SpliceAI2 está acessível por meio de aplicativos da sua plataforma BioInsight, incluindo DRAGEN Annotation, Emedgene e Illumina Connected Insights. O código‑fonte, os pesos treinados do modelo e as previsões pré‑computadas para todas as possíveis variantes de nucleotídeo único nos corpos genéticos humanos (4 bilhões) e indéis observados em populações humanas (150 milhões) estão disponíveis através do repositório do GitHub SpliceAI2 e Hugging Face para uso acadêmico e de pesquisa não comercial, com um contato separado para licenciamento comercial. O software é instalado via PyPI e requer uma GPU compatível com CUDA.
De acordo com a documentação do repositório, o spliceai2_summary_score varia de 0 a 1, com limiares recomendados de 0,1 para alta sensibilidade, 0,25 para precisão e sensibilidade equilibradas, e 0,5 para alta precisão, correspondendo aos equivalentes do SpliceAI de 0,2, 0,5 e 0,8. O trabalho do SpliceAI2 foi liderado por Kishore Jaganathan e Kyle Farh, com colaboradores da University of Oxford, UCSF e New York Genome Center.












