Modelos y plataformas de IA
Método de IA Revela Qué Aprenden los Modelos Genómicos del ADN y Expone el Sesgo Experimental Oculto

Los investigadores del Stowers Institute for Medical Research han desarrollado un método de interpretación que muestra, base por base, lo que un modelo de aprendizaje profundo ha aprendido del ADN, y lo han usado para eliminar un sesgo experimental oculto de los datos genómicos. El método, llamado PISA, se describe en un artículo publicado en Nature Communications en agosto de 2026 y anunciado por el instituto el 25 de agosto de 2026.
Las redes neuronales de secuencia a función toman ADN crudo como entrada y predicen la lectura de experimentos genómicos, desde la unión de factores de transcripción hasta la organización de nucleosomas. Lo que normalmente no pueden decirte es por qué hacen una predicción determinada. PISA, abreviatura de pairwise influence by sequence attribution, rastrea la predicción de un modelo en una posición genómica exacta hasta cada otra base que la influyó, produciendo un mapa bidimensional a resolución de una sola base de lo que el modelo aprendió, en lugar de solo lo que predijo.
El estudio fue liderado por Julia Zeitlinger en Stowers en colaboración con Anshul Kundaje de la Universidad de Stanford, con Charles McAnany, becario de IA de Stowers, como autor principal. PISA se ejecuta dentro de BPReveal, la última extensión del laboratorio de BPNet, un marco de aprendizaje profundo que el equipo desarrolló por primera vez en 2021.
Cómo PISA Separa el Sesgo Experimental de la Biología
El equipo aplicó PISA a MNase-seq, un ensayo ampliamente usado que mapea nucleosomas, las estructuras que se forman cuando el ADN se enrolla alrededor de proteínas histonas. El ensayo funciona usando una enzima que corta el ADN expuesto mientras deja intacto el ADN protegido por nucleosomas, pero la enzima prefiere algunas secuencias sobre otras. Por lo tanto, los datos contienen dos señales superpuestas, y el modelo aprendió ambas.
Porque las herramientas de interpretación anteriores colapsan la influencia de cada base en un solo valor, los efectos positivos y negativos pueden cancelarse y desaparecer. PISA conserva la información a plena resolución, y a esa resolución la preferencia de secuencia de la enzima apareció como una huella distintiva en los mapas. El equipo extrajo esa firma matemáticamente, entrenó un modelo separado solo con el sesgo y lo restó, dejando un segundo modelo que había aprendido únicamente la biología.
“Es un poco como la microscopía de super‑resolución”, dijo Zeitlinger en el anuncio del instituto. “Incluso los métodos de interpretación anteriores abrieron la caja negra. Luego te das cuenta de que puedes ver aún más. Añades píxeles y de repente ves cosas que antes no podías ver”.
La Sorpresa Oculta en los Datos Limpios
Dentro del modelo corregido por sesgo, PISA reveló secuencias de ADN que ayudan a posicionar nucleosomas, con efectos que se extienden cientos de pares de bases en ambas direcciones. Muchas eran asimétricas, influyendo de manera distinta en un lado respecto al otro. Seguir esa asimetría llevó al equipo a los límites de dominios de cromatina, los bordes que determinan qué secuencias reguladoras pueden alcanzar a qué genes. Esos límites normalmente se mapean con métodos de cromatina 3D que requieren una profundidad de secuenciación enorme; el modelo descubrió miles de ellos solo a partir de datos de nucleosomas, a menudo con mayor precisión que los datos 3D, según el artículo.
El equipo luego utilizó los modelos centrados en la biología para diseñar secuencias de ADN sintético predichas para organizar nucleosomas en configuraciones específicas, y probó experimentalmente un subconjunto de esos diseños. Las predicciones se confirmaron, lo que evidencia que las reglas aprendidas por el modelo pueden generar hipótesis comprobables en lugar de simplemente describir datos existentes.
El trabajo se inserta en un campo que ha estado invirtiendo fuertemente en modelos de secuencia cada vez mayores. AlphaGenome de Google DeepMind, publicado a principios de 2026 y citado en la introducción del artículo de PISA, predice los efectos de variantes regulatorias en todo el genoma. PISA aborda el problema complementario: una vez que un modelo hace esas predicciones, comprender qué características de la secuencia utilizó realmente. El método ya se ha difundido más allá del laboratorio de Zeitlinger, implementado en un paquete de software independiente por un colaborador y adoptado por la neurocientífica de Stowers Neşet Özel para una pregunta biológica diferente.
PISA en Cifras
- 2021 – el marco de aprendizaje profundo BPNet, base de PISA, desarrollado inicialmente por el equipo
- 8 de abril de 2025 – preimpresión de PISA publicada por primera vez en bioRxiv
- agosto de 2026 – publicación revisada por pares en Nature Communications
- Cientos de pares de bases – el alcance de las secuencias individuales de posicionamiento de nucleosomas que los modelos descubrieron
- Miles – límites de dominios de cromatina identificados únicamente a partir de datos de nucleosomas
Los Límites que los Autores Señalan
Este es un artículo de métodos y genómica, y su relevancia para enfermedades es una dirección, no un resultado. La mayor parte de la variación genética asociada a enfermedades se encuentra en ADN regulador más que en genes, y Zeitlinger es explícita al afirmar que colocar una variante en un sitio de unión o en un límite de dominio propone un mecanismo sin producir un fármaco. El trabajo también requirió un laboratorio competente tanto en aprendizaje profundo como en biología experimental, y Zeitlinger señala esa doble experiencia como la brecha persistente del campo más que la potencia computacional.
Las secuencias de ADN diseñadas se validaron solo para un subconjunto probado experimentalmente, y la demostración de corrección de sesgo del artículo es específica de MNase-seq, aunque los autores muestran PISA aplicado a varios tipos de datos. El historial de revisiones de la preimpresión muestra que el análisis de dominios de cromatina se añadió durante la revisión por pares, después de una versión revisada publicada el 5 de enero de 2026.
Lo que el trabajo establece ahora es una forma de auditar qué absorben los modelos genómicos de sus datos de entrenamiento, corregir las partes que provienen del experimento en lugar de la biología, y extraer reglas de secuencia lo suficientemente precisas como para diseñar y probar contra sistemas vivos.












