Entrevistas
Dr. Serafim Batzoglou, Director de Datos en Seer – Serie de Entrevistas

Serafim Batzoglou es el Director de Datos en Seer. Antes de unirse a Seer, Serafim se desempeñó como Director de Datos en Insitro, donde lideró el aprendizaje automático y la ciencia de datos en su enfoque para el descubrimiento de fármacos. Antes de Insitro, se desempeñó como Vicepresidente de Biología Aplicada y Computacional en Illumina, donde lideró la investigación y el desarrollo de tecnología de AI y ensayos moleculares para hacer que los datos genómicos sean más interpretables en la salud humana.
¿Qué te atrajo inicialmente al campo de la genómica?
Me interesé en el campo de la biología computacional al comienzo de mi doctorado en ciencias de la computación en el MIT, cuando tomé un curso sobre el tema impartido por Bonnie Berger, quien se convirtió en mi asesor de doctorado, y David Gifford. El proyecto del genoma humano estaba ganando ritmo durante mi doctorado. Eric Lander, quien dirigía el Centro de Genoma en el MIT, se convirtió en mi coasesor de doctorado y me involucró en el proyecto. Motivado por el proyecto del genoma humano, trabajé en la ensambladura de genomas completos y genómica comparativa de ADN humano y murino.
Luego me mudé a la Universidad de Stanford como profesor en el Departamento de Ciencias de la Computación, donde pasé 15 años, y tuve el privilegio de haber asesorado a unos 30 estudiantes de doctorado increíblemente talentosos y muchos investigadores postdoctorales y estudiantes de pregrado. El enfoque de mi equipo ha sido la aplicación de algoritmos, aprendizaje automático y herramientas de software para el análisis de datos genómicos y biomoleculares a gran escala. Dejé Stanford en 2016 para liderar un equipo de investigación y desarrollo en Illumina. Desde entonces, he disfrutado liderando equipos de I+D en la industria. Encuentro que el trabajo en equipo, el aspecto empresarial y un impacto más directo en la sociedad son características de la industria en comparación con la academia. He trabajado en empresas innovadoras a lo largo de mi carrera: DNAnexus, que cofundé en 2009, Illumina, Insitro y ahora Seer. La computación y el aprendizaje automático son esenciales en toda la cadena de tecnología en biotecnología, desde el desarrollo de tecnología, la adquisición de datos, la interpretación de datos biológicos y la traducción a la salud humana.
En los últimos 20 años, la secuenciación del genoma humano se ha vuelto mucho más barata y rápida. Esto ha llevado a un crecimiento dramático en el mercado de secuenciación de genomas y una adopción más amplia en la industria de las ciencias de la vida. Ahora estamos en el umbral de tener datos genómicos, multiómicos y fenotípicos de poblaciones de suficiente tamaño para revolucionar significativamente la atención médica, incluyendo la prevención, el diagnóstico, el tratamiento y el descubrimiento de fármacos. Podemos descubrir cada vez más los fundamentos moleculares de la enfermedad en individuos a través del análisis computacional de datos genómicos, y los pacientes tienen la oportunidad de recibir tratamientos personalizados y dirigidos, especialmente en áreas como el cáncer y las enfermedades genéticas raras. Más allá del uso obvio en medicina, el aprendizaje automático combinado con la información genómica nos permite obtener conocimientos en otras áreas de nuestra vida, como la genealogía y la nutrición. Los próximos años verán la adopción de una atención médica personalizada y basada en datos, primero para grupos selectos de personas, como pacientes con enfermedades raras, y cada vez más para el público en general.
Antes de tu cargo actual, eras Director de Datos en Insitro, donde liderabas el aprendizaje automático y la ciencia de datos en su enfoque para el descubrimiento de fármacos. ¿Cuáles fueron algunos de tus principales hallazgos durante este período sobre cómo el aprendizaje automático puede acelerar el descubrimiento de fármacos?
El paradigma tradicional de descubrimiento y desarrollo de fármacos “de prueba y error” está plagado de ineficiencias y plazos extremadamente largos. Para que un fármaco llegue al mercado, puede tomar más de $1 mil millones y más de una década. Al incorporar el aprendizaje automático en estos esfuerzos, podemos reducir drásticamente los costos y los plazos en varios pasos del camino. Un paso es la identificación de objetivos, donde un gen o un conjunto de genes que modulan un fenotipo de enfermedad o revierten un estado celular de enfermedad a un estado más saludable pueden ser identificados a través de perturbaciones genéticas y químicas a gran escala, y salidas fenotípicas como la imagen y la genómica funcional. Otro paso es la identificación y optimización de compuestos, donde una molécula pequeña o otra modalidad puede ser diseñada mediante predicción in silico impulsada por aprendizaje automático, así como mediante cribado in vitro, y además, las propiedades deseables de un fármaco, como la solubilidad, la permeabilidad, la especificidad y la no toxicidad, pueden ser optimizadas. El aspecto más difícil y también más importante es quizás la traducción a humanos. Aquí, la elección del modelo correcto, líneas de células madre pluripotentes inducidas versus líneas de células primarias de pacientes y muestras de tejido versus modelos animales, para la enfermedad correcta, plantea un conjunto de compensaciones increíblemente importantes que reflejan finalmente la capacidad de los datos resultantes más el aprendizaje automático para traducirse a los pacientes.
Seer Bio está pionera en nuevas formas de descifrar los secretos del proteoma para mejorar la salud humana. Para los lectores que no están familiarizados con este término, ¿qué es el proteoma?
El proteoma es el conjunto cambiante de proteínas producidas o modificadas por un organismo con el tiempo y en respuesta al entorno, la nutrición y el estado de salud. La proteómica es el estudio del proteoma dentro de un tipo de célula o muestra de tejido determinada. El genoma de un ser humano u otro organismo es estático: con la importante excepción de las mutaciones somáticas, el genoma al nacer es el genoma que se tiene toda la vida, copiado exactamente en cada célula del cuerpo. El proteoma es dinámico y cambia en períodos de años, días e incluso minutos. Como tal, los proteomas están mucho más cerca del fenotipo y, en última instancia, del estado de salud que los genomas, y, por lo tanto, son más informativos para monitorear la salud y comprender la enfermedad.
En Seer, hemos desarrollado una nueva forma de acceder al proteoma que proporciona conocimientos más profundos sobre las proteínas y los proteoformas en muestras complejas, como el plasma, que es una muestra muy accesible que, desafortunadamente, ha planteado un gran desafío para la proteómica de espectrometría de masas convencional.
¿Qué es la plataforma Proteograph de Seer y cómo ofrece una nueva visión del proteoma?
La plataforma Proteograph de Seer aprovecha una biblioteca de nanopartículas ingenierizadas de forma propietaria, impulsada por un flujo de trabajo simple, rápido y automatizado, que permite una interrogación profunda y escalable del proteoma.
La plataforma Proteograph brilla al interrogar plasma y otras muestras complejas que exhiben un gran rango dinámico, muchas órdenes de magnitud de diferencia en la abundancia de varias proteínas en la muestra, donde los métodos de espectrometría de masas convencionales no pueden detectar la parte de baja abundancia del proteoma. Las nanopartículas de Seer están ingenierizadas con propiedades fisioquímicas ajustables que recogen proteínas en todo el rango dinámico de manera no sesgada. En muestras de plasma típicas, nuestra tecnología permite la detección de 5 a 8 veces más proteínas que cuando se procesa plasma puro sin utilizar la Proteograph. Como resultado, desde la preparación de la muestra hasta la instrumentación y el análisis de datos, nuestra Suite de Productos Proteograph ayuda a los científicos a encontrar firmas de enfermedad del proteoma que de otro modo podrían ser indetectables. Nos gusta decir que en Seer, estamos abriendo una nueva puerta al proteoma.
Además, estamos permitiendo que los científicos realicen fácilmente estudios de proteogenómica a gran escala. La proteogenómica es la combinación de datos genómicos con datos proteómicos para identificar y cuantificar variantes de proteínas, vincular variantes genómicas con niveles de abundancia de proteínas y, en última instancia, vincular el genoma y el proteoma con el fenotipo y la enfermedad, y comenzar a desenredar las vías genéticas causales y descendentes asociadas con la enfermedad.
¿Puedes discutir algunas de las tecnologías de aprendizaje automático que se utilizan actualmente en Seer Bio?
Seer está aprovechando el aprendizaje automático en todos los pasos, desde el desarrollo de tecnología hasta el análisis de datos posteriores. Esos pasos incluyen: (1) el diseño de nuestras nanopartículas propietarias, donde el aprendizaje automático nos ayuda a determinar qué propiedades fisioquímicas y combinaciones de nanopartículas funcionarán con líneas de productos y ensayos específicos; (2) la detección y cuantificación de péptidos, proteínas, variantes y proteoformas a partir de los datos de salida producidos por los instrumentos MS; (3) análisis proteómicos y proteogenómicos posteriores en cohortes de población a gran escala.
El año pasado, publicamos un artículo en Advanced Materials que combinaba métodos de proteómica, nanoingeniería y aprendizaje automático para mejorar nuestra comprensión de los mecanismos de formación de la corona de proteínas. Este artículo descubrió interacciones nano-bio y está informando a Seer en la creación de nanopartículas y productos mejorados en el futuro.
Más allá del desarrollo de nanopartículas, hemos estado desarrollando algoritmos novedosos para identificar péptidos variantes y modificaciones post-traduccionales (PTM). Recientemente desarrollamos un método para la detección de loci de rasgos cuantitativos de proteínas (pQTL) que es robusto a las variantes de proteínas, que es un confusor conocido para la proteómica basada en afinidad. Estamos extendiendo este trabajo para identificar directamente estos péptidos a partir de los espectros brutos utilizando métodos de secuenciación de novo basados en aprendizaje profundo para permitir la búsqueda sin inflar el tamaño de las bibliotecas espectrales.
Nuestro equipo también está desarrollando métodos para permitir que los científicos sin experiencia profunda en aprendizaje automático ajusten y utilicen óptimamente los modelos de aprendizaje automático en su trabajo de descubrimiento. Esto se logra a través de un marco de aprendizaje automático de Seer basado en la herramienta AutoML, que permite un ajuste eficiente de hiperparámetros a través de la optimización bayesiana.
Finalmente, estamos desarrollando métodos para reducir el efecto de lote y aumentar la precisión cuantitativa de la salida de la espectrometría de masas al modelar los valores cuantitativos medidos para maximizar las métricas esperadas, como la correlación de los valores de intensidad a través de los péptidos dentro de un grupo de proteínas.
Las alucinaciones son un problema común con los LLM, ¿cuáles son algunas de las soluciones para prevenir o mitigar esto?
Los LLM son métodos generativos que se les da un gran corpus y se entrenan para generar texto similar. Capturan las propiedades estadísticas subyacentes del texto en el que se entrenan, desde propiedades locales simples, como con qué frecuencia se encuentran ciertas combinaciones de palabras (o tokens) juntas, hasta propiedades de nivel superior que emulan la comprensión del contexto y el significado.
Sin embargo, los LLM no se entrenan principalmente para ser correctos. El aprendizaje de refuerzo con retroalimentación humana (RLHF) y otras técnicas ayudan a entrenarlos para propiedades deseables, incluida la corrección, pero no son completamente exitosas. Dado un prompt, los LLM generarán texto que se asemeje más a las propiedades estadísticas de los datos de entrenamiento. A menudo, este texto también es correcto. Por ejemplo, si se pregunta “¿cuándo nació Alejandro Magno”, la respuesta correcta es 356 a.C. (o a.C.), y un LLM probablemente dará esa respuesta porque en los datos de entrenamiento el nacimiento de Alejandro Magno aparece con frecuencia como este valor. Sin embargo, cuando se pregunta “¿cuándo nació la emperatriz Reginella”, un personaje ficticio que no está presente en el corpus de entrenamiento, el LLM probablemente alucinará y creará una historia de su nacimiento. De manera similar, cuando se hace una pregunta que el LLM puede no poder responder correctamente (ya sea porque la respuesta correcta no existe o por otras razones estadísticas), es probable que alucine y responda como si lo supiera. Esto crea alucinaciones que son un problema obvio para aplicaciones serias, como “¿cómo se puede tratar tal y tal cáncer”.
No hay soluciones perfectas para las alucinaciones. Son endémicas al diseño del LLM. Una solución parcial es la promoción adecuada, como pedirle al LLM que “piense con cuidado, paso a paso”, etc. Esto aumenta la probabilidad de que el LLM no invente historias. Un enfoque más sofisticado que se está desarrollando es el uso de grafos de conocimiento. Los grafos de conocimiento proporcionan datos estructurados: las entidades en un grafo de conocimiento están conectadas a otras entidades de una manera predefinida y lógica. Construir un grafo de conocimiento para un dominio determinado es, por supuesto, una tarea desafiante, pero factible con una combinación de métodos automatizados y estadísticos y curación. Con un grafo de conocimiento incorporado, los LLM pueden verificar las declaraciones que generan contra el conjunto estructurado de hechos conocidos y pueden estar limitados a no generar una declaración que contradiga o no esté respaldada por el grafo de conocimiento.
Debido al problema fundamental de las alucinaciones, y quizás debido a la falta de capacidad de razonamiento y juicio suficiente, los LLM son hoy poderosos para recuperar, conectar y destilar información, pero no pueden reemplazar a los expertos humanos en aplicaciones serias, como el diagnóstico médico o el asesoramiento legal. Sin embargo, pueden aumentar enormemente la eficiencia y la capacidad de los expertos humanos en estos dominios.
¿Puedes compartir tu visión para un futuro donde la biología esté guiada por datos en lugar de hipótesis?
El enfoque tradicional basado en hipótesis, que implica a los investigadores encontrar patrones, desarrollar hipótesis, realizar experimentos o estudios para probarlas y luego refinar teorías basadas en los datos, está siendo reemplazado por un nuevo paradigma basado en modelado de datos.
En este paradigma emergente, los investigadores comienzan con la generación de datos a gran escala y sin hipótesis. Luego, entrenan un modelo de aprendizaje automático, como un LLM, con el objetivo de una reconstrucción precisa de los datos ocultos, un rendimiento de regresión o clasificación fuerte en una serie de tareas posteriores. Una vez que el modelo de aprendizaje automático puede predecir los datos con precisión y logra una fidelidad comparable a la similitud entre réplicas experimentales, los investigadores pueden interrogar el modelo para extraer información sobre el sistema biológico y discernir los principios biológicos subyacentes.
Los LLM están demostrando ser especialmente buenos en el modelado de datos biomoleculares y están destinados a impulsar un cambio de la biología basada en hipótesis a la biología basada en datos. Este cambio se volverá cada vez más pronunciado en los próximos 10 años y permitirá un modelado preciso de sistemas biomoleculares a una granularidad que va más allá de la capacidad humana.
¿Cuál es el impacto potencial para el diagnóstico de enfermedades y el descubrimiento de fármacos?
Creo que el LLM y el AI generativo conducirán a cambios significativos en la industria de las ciencias de la vida. Un área que se beneficiará enormemente de los LLM es el diagnóstico clínico, específicamente para enfermedades raras y difíciles de diagnosticar, y subtipos de cáncer. Hay cantidades tremendas de información completa de pacientes que podemos aprovechar, desde perfiles genómicos, respuestas al tratamiento, historias médicas y antecedentes familiares, para impulsar un diagnóstico preciso y oportuno. Si podemos encontrar una forma de compilar todos estos datos de manera que sean fácilmente accesibles y no estén aislados por organizaciones de salud individuales, podemos mejorar dramáticamente la precisión del diagnóstico. Esto no implica que los modelos de aprendizaje automático, incluidos los LLM, puedan operar de forma autónoma en el diagnóstico. Debido a sus limitaciones técnicas, en el futuro predecible no serán autónomos, sino que serán herramientas poderosas para ayudar a los expertos humanos a proporcionar evaluaciones y diagnósticos informados en una fracción del tiempo necesario hasta la fecha, y para documentar y comunicar sus diagnósticos al paciente, así como a toda la red de proveedores de salud conectados a través del sistema de aprendizaje automático.
La industria ya está aprovechando el aprendizaje automático para el descubrimiento y desarrollo de fármacos, destacando su capacidad para reducir costos y plazos en comparación con el paradigma tradicional. Los LLM agregan aún más al conjunto de herramientas disponibles y proporcionan excelentes marcos para modelar datos biomoleculares a gran escala, incluidos genomas, proteomas, datos genómicos funcionales y epigenómicos, datos de células únicas y más. En el futuro predecible, los LLM de base sin duda conectarán todos estos modos de datos y a lo largo de grandes cohortes de individuos cuya información genómica, proteómica y de salud se recopila. Estos LLM ayudarán en la generación de objetivos de fármacos prometedores, identificarán probablemente bolsillos de actividad de proteínas asociadas con función biológica y enfermedad, o sugerirán vías y funciones celulares más complejas que se pueden modular de una manera específica con moléculas pequeñas u otras modalidades de fármacos. También podemos aprovechar los LLM para identificar a los que responden y no responden a los fármacos en función de la susceptibilidad genética, o para reutilizar fármacos en otras indicaciones de enfermedad. Muchas de las empresas de descubrimiento de fármacos basadas en AI existentes están, sin duda, ya empezando a pensar y desarrollar en esta dirección, y debemos esperar ver la formación de empresas adicionales, así como esfuerzos públicos dirigidos a la implementación de LLM en la salud humana y el descubrimiento de fármacos. Gracias por la entrevista detallada, los lectores que deseen aprender más pueden visitar Seer.












