Interviews
Dr. Serafim Batzoglou, Chief Data Officer bij Seer – Interviewreeks

Serafim Batzoglou is Chief Data Officer bij Seer. Voordat hij bij Seer kwam, was Serafim Chief Data Officer bij Insitro, waar hij machine learning en data science leidde in hun aanpak van drug discovery. Voordat hij bij Insitro kwam, was hij VP of Applied and Computational Biology bij Illumina, waar hij onderzoek en technologieontwikkeling van AI en moleculaire assays leidde om genoomdata meer interpreteerbaar te maken in de menselijke gezondheid.
Wat trok je aanvankelijk aan tot het vakgebied van genomics?
Ik werd geïnteresseerd in het vakgebied van computationele biologie aan het begin van mijn PhD in computerwetenschappen aan MIT, toen ik een cursus over het onderwerp volgde die werd gegeven door Bonnie Berger, die mijn PhD-begeleider werd, en David Gifford. Het human genome project kreeg tijdens mijn PhD vaart. Eric Lander, die het Genome Center aan MIT leidde, werd mijn co-begeleider en betrok me bij het project. Gemotiveerd door het human genome project, werkte ik aan whole-genome assembly en comparative genomics van menselijk en muis-DNA.
Ik verhuisde vervolgens naar Stanford University als faculteitslid van de afdeling Computer Science, waar ik 15 jaar doorbracht en het privilege had om ongeveer 30 buitengewoon getalenteerde PhD-studenten en veel postdoctorale onderzoekers en undergraduate studenten te begeleiden. Het focus van mijn team was de toepassing van algoritmes, machine learning en softwaretools voor de analyse van grote hoeveelheden genomicsche en biomoleculaire data. Ik verliet Stanford in 2016 om een onderzoeks- en technologieontwikkelingsteam te leiden bij Illumina. Sindsdien heb ik genoten van het leiden van R&D-teams in de industrie. Ik vind dat teamwork, het zakelijke aspect en een directe impact op de samenleving kenmerken zijn van de industrie in vergelijking met de academische wereld. Ik heb gewerkt bij innovatieve bedrijven in mijn carrière: DNAnexus, dat ik in 2009 mede-oprichtte, Illumina, Insitro en nu Seer. Computatie en machine learning zijn essentieel in de hele technologieketen in biotech, van technologieontwikkeling tot gegevensverzameling, biologische gegevensinterpretatie en vertaling naar menselijke gezondheid.
In de afgelopen 20 jaar is het sequencen van het menselijk genoom een stuk goedkoper en sneller geworden. Dit leidde tot een dramatische groei van de markt voor genoomsequencing en bredere toepassing in de levenswetenschappenindustrie. We staan nu aan de vooravond van het hebben van populatiegenomicsche, multi-omische en fenotypische gegevens van voldoende omvang om de gezondheidszorg, inclusief preventie, diagnose, behandeling en drug discovery, significant te revolutioneren. We kunnen steeds vaker de moleculaire onderliggende oorzaken van ziekten bij individuen ontdekken door computationele analyse van genomicsche gegevens, en patiënten hebben de kans om behandelingen te ontvangen die zijn afgestemd op hun specifieke behoeften en doelen, vooral in de gebieden van kanker en zeldzame genetische aandoeningen. Buiten de voor de hand liggende toepassing in de geneeskunde, stelt machine learning in combinatie met genomicsche informatie ons in staat om inzicht te krijgen in andere aspecten van ons leven, zoals onze genealogie en voeding. De komende jaren zullen de adoptie van persoonlijke, gegevensgestuurde gezondheidszorg zien, eerst voor geselecteerde groepen mensen, zoals patiënten met zeldzame ziekten, en steeds vaker voor het bredere publiek.
Voordat je je huidige functie had, was je Chief Data Officer bij Insitro, waar je machine learning en data science leidde in hun aanpak van drug discovery. Wat waren enkele van je belangrijkste inzichten uit deze periode over hoe machine learning kan worden gebruikt om drug discovery te versnellen?
De conventionele aanpak van drug discovery en ontwikkeling, die wordt gekenmerkt door “trial-and-error”, is geplaagd door inefficiënties en extreem lange tijdslijnen. Voor één drug om op de markt te komen, kan het meer dan $1 miljard en meer dan een decennium kosten. Door machine learning in deze inspanningen te integreren, kunnen we de kosten en tijdslijnen in verschillende stappen aanzienlijk verlagen. Een stap is doelwitidentificatie, waarbij een gen of een set genen die een ziekte fenotype of een gezonde celstaat kunnen moduleren, kan worden geïdentificeerd door middel van grote-scale genetische en chemische perturbaties en fenotypische readouts zoals beeldvorming en functionele genomics. Een andere stap is verbindingidentificatie en optimalisatie, waarbij een kleine molecule of andere modaliteit kan worden ontworpen door machine learning-gestuurde in silico voorspelling en in vitro screening, en waarbij gewenste eigenschappen van een drug zoals oplosbaarheid, permeabiliteit, specificiteit en niet-toxiciteit kunnen worden geoptimaliseerd. Het moeilijkste en belangrijkste aspect is misschien de vertaling naar mensen. Hierbij is de keuze van het juiste model – geïnduceerde pluripotente stamcellen gegenereerde lijnen versus primaire patiëntcellijnen en weefselmonsters versus diermodellen – voor de juiste ziekte een enorm belangrijke set van compromissen die uiteindelijk van invloed zijn op de mogelijkheid van de resulterende gegevens plus machine learning om te vertalen naar patiënten.
Seer Bio baanbrekt nieuwe manieren om de geheimen van het proteoom te ontcijferen om de menselijke gezondheid te verbeteren. Voor lezers die niet bekend zijn met deze term, wat is het proteoom?
Het proteoom is de veranderende set van eiwitten die door een organisme worden geproduceerd of gemodificeerd in de loop van de tijd en als reactie op de omgeving, voeding en gezondheidstoestand. Proteomics is de studie van het proteoom binnen een bepaalde celtype of weefselmonster. Het genoom van een mens of ander organisme is statisch: met de belangrijke uitzondering van somatische mutaties, is het genoom bij de geboorte het genoom dat men het hele leven heeft, exact gekopieerd in elke cel van het lichaam. Het proteoom is dynamisch en verandert in de tijdspannes van jaren, dagen en zelfs minuten. Als zodanig zijn proteomen veel dichter bij het fenotype en uiteindelijk bij de gezondheidstoestand dan genomen, en zijn ze dus meer informatief voor het monitoren van de gezondheid en het begrijpen van ziekten.
Bij Seer hebben we een nieuwe manier ontwikkeld om toegang te krijgen tot het proteoom, die diepere inzichten biedt in eiwitten en proteovormen in complexe monsters zoals plasma, dat een zeer toegankelijk monster is dat helaas tot nu toe een grote uitdaging heeft gevormd voor conventionele massaspectrometrie-proteomics.
Wat is het Proteograph-platform van Seer en hoe biedt het een nieuw beeld van het proteoom?
Het Proteograph-platform van Seer maakt gebruik van een bibliotheek van propriëtaire, geëngineerde nanodeeltjes, die worden aangedreven door een eenvoudige, snelle en geautomatiseerde workflow, waardoor diepe en schaalbare ondervraging van het proteoom mogelijk wordt.
Het Proteograph-platform blinkt uit in het ondervragen van plasma en andere complexe monsters die een groot dynamisch bereik vertonen – vele orden van grootte verschil in de abundantie van verschillende eiwitten in het monster – waar conventionele massaspectrometrie-methoden niet in staat zijn om de lage abundantie van het proteoom te detecteren. De nanodeeltjes van Seer zijn geëngineerd met aanpasbare fysiochemische eigenschappen die eiwitten over het dynamische bereik verzamelen op een onbevooroordeelde manier. In typische plasma-monsters maakt onze technologie het mogelijk om 5x tot 8x meer eiwitten te detecteren dan wanneer we neat plasma verwerken zonder het Proteograph te gebruiken. Als gevolg hiervan helpt ons Proteograph Product Suite wetenschappers om proteoomziektekenmerken te vinden die anders ondetecteerbaar zouden zijn. We zeggen graag dat we bij Seer een nieuwe poort naar het proteoom openen.
Verder stellen we wetenschappers in staat om gemakkelijk grote-scale proteogenomische studies uit te voeren. Proteogenomics is de combinatie van genomicsche gegevens met proteomicsche gegevens om eiwitvarianten te identificeren en te kwantificeren, genvarianten te koppelen aan eiwitabundantieniveaus en uiteindelijk het genoom en het proteoom te koppelen aan fenotype en ziekte, en om de causale en downstream genetische paden te ontwarren die geassocieerd zijn met ziekte.
Kun je enkele van de machine learning-technologieën bespreken die momenteel bij Seer Bio worden gebruikt?
Seer maakt gebruik van machine learning op alle stappen, van technologieontwikkeling tot downstream gegevensanalyse. Deze stappen omvatten: (1) het ontwerp van onze propriëtaire nanodeeltjes, waarbij machine learning ons helpt te bepalen welke fysiochemische eigenschappen en combinaties van nanodeeltjes zullen werken met specifieke productlijnen en assays; (2) detectie en kwantificatie van peptiden, eiwitten, varianten en proteovormen uit de readout-gegevens die worden gegenereerd door de MS-instrumenten; (3) downstream proteomicsche en proteogenomische analyses in grote populatiekohorten.
Vorig jaar publiceerden we een paper in Advanced Materials waarin we proteomics-methoden, nano-engineering en machine learning combineerden om onze kennis van de mechanismen van eiwitcorona-vorming te verbeteren. Deze paper onthulde nano-bio-interacties en informeert Seer over de creatie van verbeterde toekomstige nanodeeltjes en producten.
Behalve nanodeeltje-ontwikkeling hebben we nieuwe algoritmes ontwikkeld om variantpeptiden en post-translational modificaties (PTM’s) te identificeren. Onlangs ontwikkelden we een methode voor detectie van proteïnekwantificeerbare traitloci (pQTL’s) die robuust is tegenover eiwitvarianten, wat een bekende confounder is voor affiniteitsgebaseerde proteomics. We breiden deze werk uit naar het direct identificeren van deze peptiden uit de ruwe spectra met behulp van deep learning-gebaseerde de novo sequencing-methoden, waardoor we kunnen zoeken zonder de grootte van de spectraalbibliotheken te vergroten.
Ons team ontwikkelt ook methoden om wetenschappers zonder diepe expertise in machine learning in staat te stellen om machine learning-modellen optimaal af te stemmen en te gebruiken in hun ontdekkingswerk. Dit wordt bereikt via een Seer ML-kader op basis van het AutoML-hulpmiddel, dat efficiënte hyperparameterafstemming mogelijk maakt via Bayesiaanse optimalisatie.
Tenslotte ontwikkelen we methoden om de batch-effecten te verminderen en de kwantitatieve nauwkeurigheid van de massaspectrometrie-readout te verhogen door de gemeten kwantitatieve waarden te modelleren om de verwachte metrics zoals de correlatie van intensiteitswaarden over peptiden binnen een proteïnegroep te maximaliseren.
Hallucinaties zijn een veelvoorkomend probleem met LLM’s, wat zijn enkele van de oplossingen om dit te voorkomen of te mitigeren?
LLM’s zijn generatieve methoden die zijn getraind op een grote corpus en zijn ontworpen om soortgelijke tekst te genereren. Ze vangen de onderliggende statistische eigenschappen van de tekst die ze zijn getraind op, van eenvoudige lokale eigenschappen zoals hoe vaak bepaalde combinaties van woorden (of tokens) samen voorkomen, tot hogere niveau-eigenschappen die emuleren van context en betekenis.
LLM’s zijn echter niet primair getraind om correct te zijn. Versterking van het leren met menselijke feedback (RLHF) en andere technieken helpen hen trainen voor gewenste eigenschappen, inclusief correctheid, maar zijn niet volledig succesvol. Gegeven een prompt, zullen LLM’s tekst genereren die het meest lijkt op de statistische eigenschappen van de trainingsgegevens. Vaak is deze tekst ook correct. Bijvoorbeeld, als je vraagt “wanneer was Alexander de Grote geboren”, is het correcte antwoord 356 voor Christus (of v.Chr.), en een LLM zal waarschijnlijk dit antwoord geven omdat Alexander de Grote’s geboortedatum vaak voorkomt in de trainingsgegevens. Echter, als je vraagt “wanneer was keizerin Reginella geboren”, een fictief personage dat niet in de trainingscorpus voorkomt, zal de LLM waarschijnlijk hallucineren en een verhaal over haar geboorte creëren. Evenzo, als je een vraag stelt die de LLM niet kan beantwoorden (of omdat het juiste antwoord niet bestaat, of om andere statistische redenen), zal het waarschijnlijk hallucineren en antwoorden alsof het weet. Dit creëert hallucinaties die een duidelijk probleem vormen voor serieuze toepassingen, zoals “hoe kan een bepaalde kanker worden behandeld”.
Er zijn nog geen perfecte oplossingen voor hallucinaties. Ze zijn inherent aan het ontwerp van de LLM. Een gedeeltelijke oplossing is een juiste prompting, zoals het vragen van de LLM om “zorgvuldig, stap voor stap” te denken, enz. Dit verhoogt de kans dat de LLM geen verhalen verzint. Een meer geavanceerde aanpak die wordt ontwikkeld, is het gebruik van kennisgraphen. Kennisgraphen bieden gestructureerde gegevens: entiteiten in een kennisgraaf zijn verbonden met andere entiteiten in een vooraf gedefinieerde, logische manier. Het construeren van een kennisgraaf voor een bepaald domein is natuurlijk een uitdagende taak, maar kan worden gedaan met een combinatie van geautomatiseerde en statistische methoden en curatie. Met een ingebouwde kennisgraaf kunnen LLM’s de uitspraken die ze genereren controleren tegen de gestructureerde set van bekende feiten en kunnen ze worden beperkt om geen uitspraken te genereren die in strijd zijn met of niet worden ondersteund door de kennisgraaf.
Vanwege het fundamentele probleem van hallucinaties en, naar men kan aannemen, vanwege hun gebrek aan voldoende redeneer- en oordeelsvermogen, zijn LLM’s vandaag krachtig voor het ophalen, verbinden en samenvatten van informatie, maar kunnen ze geen menselijke experts vervangen in serieuze toepassingen zoals medische diagnose of juridisch advies. Toch kunnen ze de efficiëntie en capaciteit van menselijke experts in deze domeinen enorm verhogen.
Kun je je visie delen voor een toekomst waarin biologie wordt gestuurd door gegevens in plaats van hypotheses?
De traditionele, hypothese-gedreven aanpak, die onderzoekers ertoe brengt patronen te vinden, hypotheses te ontwikkelen, experimenten of studies uit te voeren om ze te testen en vervolgens theorieën te verfijnen op basis van de gegevens, wordt vervangen door een nieuwe paradigma gebaseerd op gegevensgestuurde modellering.
In dit opkomende paradigma beginnen onderzoekers met hypothese-vrije, grote-scale gegevensgeneratie. Vervolgens trainen ze een machine learning-model, zoals een LLM, met als doel de nauwkeurige reconstructie van verborgen gegevens, sterke regressie- of classificatieprestaties in een aantal downstream-taken. Zodra het machine learning-model de gegevens nauwkeurig kan voorspellen en een geloofwaardigheid bereikt die vergelijkbaar is met de geloofwaardigheid tussen experimentele replicaten, kunnen onderzoekers het model ondervragen om inzicht te krijgen in het biologische systeem en de onderliggende biologische principes te achterhalen.
LLM’s blijken bijzonder goed te zijn in het modelleren van biomoleculaire gegevens en zijn gericht op het stimuleren van een verschuiving van hypothese-gedreven naar gegevensgestuurde biologische ontdekking. Deze verschuiving zal in de komende 10 jaar steeds meer naar voren komen en zal het mogelijk maken om biomoleculaire systemen op een granulariteit te modelleren die verder gaat dan de menselijke capaciteit.
Wat is het potentieel voor ziekte-diagnose en drug discovery?
Ik geloof dat LLM en generatieve AI zullen leiden tot significante veranderingen in de levenswetenschappenindustrie. Een gebied dat veel zal profiteren van LLM’s is klinische diagnose, met name voor zeldzame, moeilijk te diagnosticeren ziekten en kankersubtypen. Er zijn enorme hoeveelheden uitgebreide patiëntinformatie die we kunnen benutten – van genoomprofielen, behandelingreacties, medische dossiers en familiegeschiedenis – om nauwkeurige en tijdige diagnose te stimuleren. Als we een manier kunnen vinden om al deze gegevens te compileren zodat ze gemakkelijk toegankelijk zijn en niet worden geïsoleerd door individuele gezondheidsorganisaties, kunnen we de diagnostische precisie aanzienlijk verbeteren. Dit wil niet zeggen dat de machine learning-modellen, inclusief LLM’s, autonoom zullen kunnen opereren in de diagnose. Vanwege hun technische beperkingen zullen ze in de voorzienbare toekomst niet autonoom zijn, maar zullen ze in plaats daarvan menselijke experts ondersteunen. Ze zullen krachtige hulpmiddelen zijn om artsen te helpen bij het maken van superb geïnformeerde beoordelingen en diagnoses in een fractie van de tijd die momenteel nodig is, en om hun diagnoses correct te documenteren en te communiceren naar de patiënt en het hele netwerk van zorgverleners dat is verbonden via het machine learning-systeem.
De industrie maakt al gebruik van machine learning voor drug discovery en ontwikkeling, waarbij het de mogelijkheid heeft om kosten en tijdslijnen te verlagen in vergelijking met het traditionele paradigma. LLM’s voegen hier nog een extra framework aan toe voor het modelleren van grote-scale biomoleculaire gegevens, waaronder genomen, proteomen, functionele genomicsche en epigenomische gegevens, single-cellgegevens en meer. In de voorzienbare toekomst zullen foundation LLM’s ongetwijfeld verbinding maken met al deze gegevensmodaliteiten en met grote kohorten van individuen waarvan de genomicsche, proteomicsche en gezondheidsinformatie is verzameld. Dergelijke LLM’s zullen helpen bij het genereren van veelbelovende drugdoelen, het identificeren van waarschijnlijke pockets van activiteit van eiwitten die zijn geassocieerd met biologische functie en ziekte, of het suggereren van paden en meer complexe cellulair functies die kunnen worden gereguleerd op een specifieke manier met kleine moleculen of andere drugmodaliteiten. We kunnen ook LLM’s gebruiken om drugresponders en niet-responders te identificeren op basis van genetische gevoeligheid, of om drugs te hergebruiken in andere ziekte-indicaties. Veel van de bestaande innovatieve AI-gebaseerde drug discovery-bedrijven zijn ongetwijfeld al aan het denken en ontwikkelen in deze richting, en we moeten verwachten dat er meer bedrijven en openbare inspanningen zullen zijn gericht op de inzet van LLM’s in menselijke gezondheid en drug discovery. Thank you for the detailed interview, readers who wish to learn more should visit Seer.












