Entrevistas
Leland Hyman, científico de datos líder en Sherlock Biosciences – Serie de entrevistas

Leland Hyman es el científico de datos líder en Sherlock Biosciences. Es un experimentado científico informático e investigador con experiencia en aprendizaje automático y diagnósticos moleculares.
Sherlock Biosciences es una empresa de biotecnología con sede en Cambridge, Massachusetts, que desarrolla pruebas de diagnóstico utilizando CRISPR. Su objetivo es revolucionar los diagnósticos moleculares con pruebas mejores, más rápidas y asequibles.
¿Qué te atrajo inicialmente a la informática?
Empecé a programar a una edad muy temprana, pero mi interés principal era crear videojuegos con mis amigos. Mi interés creció en otras aplicaciones de la informática durante la universidad y la escuela de posgrado, particularmente con todo el trabajo innovador en aprendizaje automático que se llevaba a cabo a principios de la década de 2010. Todo el campo parecía una frontera emocionante y nueva que podría impactar directamente la investigación científica y nuestra vida diaria — no podía evitar sentirme atraído por ello.
También cursaste un doctorado en Biología Celular y Molecular, ¿cuándo te diste cuenta de que los dos campos se intersectarían?
Empecé a hacer este tipo de trabajo de intersección entre la informática y la biología al principio de la escuela de posgrado. Mi laboratorio se centraba en resolver problemas de ingeniería de proteínas a través de colaboraciones entre bioquímicos, científicos informáticos y todos los demás. Rápidamente me di cuenta de que el aprendizaje automático podría proporcionar información valiosa sobre los sistemas biológicos y hacer que la experimentación sea mucho más fácil. Por otro lado, también adquirí aprecio por el valor de la intuición biológica al construir modelos de aprendizaje automático. En mi opinión, enmarcar el problema de manera precisa es el elemento crucial en el aprendizaje automático. Es por eso que creo que los esfuerzos colaborativos en diferentes campos pueden tener un impacto profundo.
Desde 2022 has estado trabajando en Sherlock Biosciences, ¿podrías compartir algunos detalles sobre lo que implica tu función?
Actualmente lidero el equipo computacional en Sherlock Biosciences. Nuestro grupo es responsable de diseñar los componentes que se incorporan en nuestras pruebas de diagnóstico, interactuar con los experimentadores que prueban estos diseños en el laboratorio húmedo y desarrollar nuevas capacidades computacionales para mejorar los diseños. Más allá de coordinar estas actividades, trabajo en las partes de aprendizaje automático de nuestro código, experimentando con nuevas arquitecturas de modelos y nuevas formas de simular la física del ADN y el ARN involucrados en nuestras pruebas.
El aprendizaje automático es fundamental en Sherlock Biosciences, ¿podrías describir el tipo de datos y el volumen de datos que se están recopilando, y cómo el aprendizaje automático procesa esos datos?
Durante el desarrollo de las pruebas, probamos decenas o cientos de candidatos a pruebas para cada nuevo patógeno. Aunque la mayoría de esos candidatos no pasarán a una prueba comercial, los vemos como una oportunidad para aprender de nuestros errores. En estos experimentos, medimos dos cosas clave: sensibilidad y velocidad. Nuestros modelos toman las secuencias de ADN y ARN en cada prueba como entrada y luego aprenden a predecir la sensibilidad y la velocidad de la prueba.
¿Cómo predice el aprendizaje automático qué componentes de diagnóstico molecular tendrán la mayor velocidad y precisión?
Cuando pensamos en cómo aprende un ser humano, hay dos estrategias principales. Por un lado, una persona podría aprender a realizar una tarea a través de ensayo y error puro. Podrían repetir la tarea, y después de muchos fracasos, eventualmente descubrirían las reglas de la tarea por sí mismos. Esta estrategia era bastante popular antes de internet. Sin embargo, podríamos proporcionarle a esta persona un maestro que le enseñe las reglas de la tarea de inmediato. El estudiante con el maestro podría aprender mucho más rápido que con el enfoque de ensayo y error, pero solo si tienen un buen maestro que comprenda completamente la tarea.
Nuestro enfoque para entrenar modelos de aprendizaje automático está a mitad de camino entre estas dos estrategias. Aunque no tenemos un “maestro” perfecto para nuestros modelos de aprendizaje automático, podemos comenzar con algunos conocimientos sobre la física del ADN y las hebras de ARN en nuestras pruebas. Esto les ayuda a aprender a hacer predicciones mejores con menos datos. Para hacer esto, ejecutamos varias simulaciones biofísicas en las secuencias de ADN y ARN de nuestras pruebas. Luego, alimentamos los resultados al modelo y le pedimos que prediga la velocidad y la sensibilidad de la prueba. Repetimos este proceso para todos los experimentos que hemos realizado en el laboratorio, y el modelo muestra la diferencia entre sus predicciones y lo que realmente sucedió. A través de suficiente repetición, eventualmente aprende cómo la física del ADN y el ARN se relacionan con la velocidad y la sensibilidad de cada prueba.
¿Cuáles son otras formas en que los algoritmos de inteligencia artificial se utilizan en Sherlock Biosciences?
Hemos utilizado algoritmos de aprendizaje automático para resolver una amplia variedad de problemas. Algunos ejemplos que me vienen a la mente están relacionados con la investigación de mercado y el análisis de imágenes. Para la investigación de mercado, pudimos entrenar modelos que aprenden sobre diferentes tipos de clientes y cuántas personas podrían tener una necesidad insatisfecha de pruebas de enfermedades. También hemos construido modelos para analizar imágenes de tiras de flujo lateral (el tipo de prueba comúnmente utilizado en pruebas de COVID de venta libre), y predecir automáticamente si una banda positiva está presente. Aunque esto parece una tarea trivial para un ser humano, puedo decir por experiencia propia que es una alternativa increíblemente conveniente a la anotación manual de miles de imágenes.
¿Cuáles son algunos de los desafíos detrás de la construcción de modelos de aprendizaje automático que funcionan en conjunto con tecnologías de biociencia de vanguardia como CRISPR?
La disponibilidad de datos es el principal desafío al aplicar modelos de aprendizaje automático a cualquier tecnología de biociencia. CRISPR y las tecnologías basadas en ADN y ARN enfrentan un desafío distintivo, principalmente debido a los conjuntos de datos estructurales significativamente más pequeños disponibles para ácidos nucleicos en comparación con las proteínas. Es por eso que hemos visto enormes avances en el aprendizaje automático de proteínas en los últimos años (con AlphaFold2 y otros), pero los avances en el aprendizaje automático de ADN y ARN todavía están rezagados.
¿Cuál es tu visión para el futuro de cómo la inteligencia artificial se integrará con CRISPR y la biociencia?
Estamos viendo un auge masivo de inteligencia artificial en los campos de ingeniería de proteínas y descubrimiento de fármacos en este momento, y espero que esto continúe acelerando el desarrollo en la industria farmacéutica. Me encantaría ver que suceda lo mismo con CRISPR y otras tecnologías basadas en ADN y ARN en los próximos años. Esto podría tener un impacto increíble en diagnósticos, medicina humana y biología sintética. Ya hemos visto los beneficios de las herramientas computacionales en nuestro desarrollo de diagnósticos y tecnologías CRISPR aquí en Sherlock, y espero que este tipo de trabajo incentive un efecto “bola de nieve” para impulsar el campo hacia adelante.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Sherlock Biosciences.












