Intervjuer

Dr. Serafim Batzoglou, Chief Data Officer på Seer – Intervju-serie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Serafim Batzoglou är Chief Data Officer på Seer. Innan han gick med i Seer, var Serafim Chief Data Officer på Insitro, där han ledde maskinlärning och data science i deras tillvägagångssätt för läkemedelsupptäckt. Innan Insitro, var han VP of Applied and Computational Biology på Illumina, där han ledde forskning och teknikutveckling av AI och molekylära analyser för att göra genetisk data mer tolkningsbar i human hälsa.

Vad var det som initialt drog dig till fältet genetik?

Jag blev intresserad av fältet beräkningsbiologi i början av min doktorsexamen i datavetenskap på MIT, när jag tog en kurs på ämnet som undervisades av Bonnie Berger, som blev min handledare, och David Gifford. Mänskliga genomet-projektet var på gång under min doktorsexamen. Eric Lander, som ledde Genome Center på MIT, blev min handledare och involverade mig i projektet. Motiverad av det mänskliga genomet-projektet, arbetade jag med helgenom-sammanställning och jämförande genetik av mänsklig och mus-DNA.

Jag flyttade sedan till Stanford University som lärare på datavetenskapsavdelningen, där jag tillbringade 15 år, och hade privilegiet att ha handledt omkring 30 otroligt begåvade doktorsexamenstudenter och många postdoktorala forskare och studenter. Mitt teams fokus har varit tillämpningen av algoritmer, maskinlärning och programvaruverktyg för analys av storskalig genetisk och biomolekylär data. Jag lämnade Stanford 2016 för att leda en forsknings- och teknikutvecklingsteam på Illumina. Sedan dess har jag njutit av att leda FoU-team i branschen. Jag tycker att lagarbete, affärsaspekten och en mer direkt inverkan på samhället är karakteristiska för branschen jämfört med akademin. Jag har arbetat på innovativa företag under min karriär: DNAnexus, som jag co-founderade 2009, Illumina, Insitro och nu Seer. Beräkning och maskinlärning är essentiella över hela teknikutvecklingskedjan i bioteknik, från teknikutveckling till datainsamling, till biologisk data tolkning och översättning till human hälsa.

Under de senaste 20 åren har sekvensering av det mänskliga genomet blivit avsevärt billigare och snabbare. Detta har lett till en dramatisk tillväxt på marknaden för genomsökning och en bredare användning inom life sciences-industrin. Vi står nu på tröskeln till att ha populationens genetiska, multi-omiska och fenotypiska data i tillräcklig storlek för att revolutionera hälsovården, inklusive förebyggande, diagnos, behandling och läkemedelsupptäckt. Vi kan alltmer upptäcka de molekylära grunderna för sjukdomar hos individer genom beräkningsanalys av genetisk data, och patienter har chansen att få behandlingar som är personliga och riktade, särskilt inom områdena cancer och sällsynta genetiska sjukdomar. Utöver den uppenbara användningen inom medicin, gör maskinlärning kombinerad med genetisk information att vi kan få insikt i andra områden av våra liv, såsom vår släkt och nutrition. De närmaste åren kommer att se en ökning av personlig, data-driven hälsovård, först för utvalda grupper av människor, såsom patienter med sällsynta sjukdomar, och alltmer för den breda allmänheten.

Innan din nuvarande roll var du Chief Data Officer på Insitro, och ledde maskinlärning och data science i deras tillvägagångssätt för läkemedelsupptäckt. Vilka var några av dina viktigaste slutsatser från denna period med hur maskinlärning kan användas för att påskynda läkemedelsupptäckt?

Det traditionella läkemedelsupptäckts- och utvecklingsparadigmet, som kännetecknas av “trial-and-error”, är plågat av ineffektiviteter och extremt långa tidsramar. För att ett läkemedel ska nå marknaden kan det ta över 1 miljard dollar och över ett decennium. Genom att införa maskinlärning i dessa ansträngningar kan vi dramatiskt minska kostnader och tidsramar i flera steg på vägen. Ett steg är målidentifiering, där en gen eller en uppsättning gener som modulerar en sjukdomsfenotyp eller återställer en sjukdomscell till en mer hälsosam tillstånd kan identifieras genom storskalig genetisk och kemisk perturbation, och fenotypiska utdata som avbildning och funktionell genetik. Ett annat steg är identifiering och optimering av föreningar, där en liten molekyl eller annan modalitet kan designas med maskinlärningsdriven in silico-prediktion samt in vitro-screening, och önskade egenskaper hos ett läkemedel som löslighet, permeabilitet, specificitet och icke-toxicitet kan optimeras. Det svåraste och viktigaste aspekten är kanske översättning till människor. Här är valet av rätt modell – inducerad pluripotent stamcell-linje versus primär patientcell-linje och vävnadsprover versus djurmodeller – för rätt sjukdom en otroligt viktig uppsättning avvägningar som slutligen återspeglar förmågan hos de resulterande data plus maskinlärning att översätta till patienter.

Seer Bio banar nya vägar för att avkoda hemligheterna i proteomet för att förbättra human hälsa, för läsare som är ovana vid denna term, vad är proteomet?

Proteomet är den föränderliga uppsättningen proteiner som produceras eller modifieras av en organism över tid och i svar på miljö, nutrition och hälsotillstånd. Proteomik är studiet av proteomet inom en given celltyp eller vävnadsprov. Människans eller andra organismers genetiska kod är statisk: med den viktiga undantaget av somatiska mutationer, är genomet vid födseln det genomet man har hela livet, kopierat exakt i varje cell i kroppen. Proteomet är dynamiskt och förändras på tidsrymden av år, dagar och till och med minuter. Som sådant är proteomet närmare fenotyp och slutligen hälsotillstånd än genomet, och är därför mer informativt för att övervaka hälsa och förstå sjukdom.

På Seer har vi utvecklat ett nytt sätt att komma åt proteomet som ger djupare insikt i proteiner och proteoformer i komplexa prover som plasma, som är ett lättillgängligt prov som tyvärr har utgjort en stor utmaning för konventionell masspektrometri-proteomik.

Vad är Seers Proteograph™-plattform och hur erbjuder den en ny vy av proteomet?

Seers Proteograph-plattform använder en bibliotek av proprietära nanopartiklar, som drivs av en enkel, snabb och automatiserad arbetsflöde, som möjliggör djup och skalbar förhör av proteomet.

Proteograph-plattformen utmärker sig i att förhöra plasma och andra komplexa prover som visar stora dynamiska områden – många storleksordningar skillnad i abundansen av olika proteiner i provet – där konventionella masspektrometri-metoder inte kan upptäcka den låga abundansen av proteomet. Seers nanopartiklar är utformade med justerbara fysio-kemiska egenskaper som samlar proteiner över dynamiska området på ett opartiskt sätt. I typiska plasma-prover möjliggör vår teknik upptäckt av 5x till 8x fler proteiner än när man bearbetar rent plasma utan att använda Proteograph. Som ett resultat, från provberedning till instrumentering till dataanalys, hjälper vår Proteograph-produktserie forskare att hitta proteom-sjukdomssignaturer som annars kan vara oupptäckta. Vi säger att vi på Seer öppnar upp en ny gateway till proteomet.

Dessutom möjliggör vi för forskare att enkelt utföra storskaliga proteogenomiska studier. Proteogenomik är kombinationen av genetisk data med proteomikdata för att identifiera och kvantifiera proteinvarianter, koppla genetiska varianter med proteinabundansnivåer och slutligen koppla genomet och proteomet till fenotyp och sjukdom, och börja reda ut de kausala och nedströms genetiska vägarna som är associerade med sjukdom.

Kan du diskutera någon av den maskinlärningsteknik som för närvarande används på Seer Bio?

Seer använder maskinlärning i alla steg från teknikutveckling till nedströms dataanalys. Dessa steg inkluderar: (1) design av våra proprietära nanopartiklar, där maskinlärning hjälper oss att bestämma vilka fysio-kemiska egenskaper och kombinationer av nanopartiklar som kommer att fungera med specifika produktlinjer och analyser; (2) upptäckt och kvantifiering av peptider, proteiner, varianter och proteoformer från utdata som produceras av MS-instrumenten; (3) nedströms proteomiska och proteogenomiska analyser i storskaliga populationer.

Förra året publicerade vi en artikel i Advanced Materials som kombinerar proteomikmetoder, nanoingenjörskap och maskinlärning för att förbättra vår förståelse av mekanismerna för protein korona-bildning. Denna artikel avslöjade nano-bio-interaktioner och informerar Seer om skapandet av förbättrade framtida nanopartiklar och produkter.

Utöver nanopartikelutveckling har vi utvecklat nya algoritmer för att identifiera variantpeptider och post-translationala modifieringar (PTM). Vi har nyligen utvecklat en metod för upptäckt av protein-kvantifierade egenskaper (pQTL) som är robust mot proteinvarianter, som är en känd confounder för affinitetsbaserad proteomik. Vi utökar detta arbete för att direkt identifiera dessa peptider från de råa spektrumen med hjälp av djupinlärningsbaserad de novo-sekvensering för att tillåta sökning utan att inflera storleken på spektralbiblioteken.

Vårt team utvecklar också metoder för att möjliggöra för forskare utan djup expertis i maskinlärning att optimera och använda maskinlärningsmodeller på bästa sätt i sitt upptäcktsarbete. Detta uppnås via en Seer ML-ram som bygger på AutoML-verktyget, som tillåter effektiv hyperparameter-justering via Bayesian-optimering.

Slutligen utvecklar vi metoder för att minska batch-effekten och öka den kvantitativa noggrannheten hos masspektrometri-utdata genom att modellera de uppmätta kvantitativa värdena för att maximera förväntade mått som korrelationen av intensitetsvärden över peptider inom en protein-grupp.

Hallucinationer är ett vanligt problem med LLM, vad är några av lösningarna för att förhindra eller mildra detta?

LLM är generativa metoder som ges en stor korpus och tränas för att generera liknande text. De fångar de underliggande statistiska egenskaperna hos texten de tränas på, från enkla lokala egenskaper som hur ofta vissa kombinationer av ord (eller token) är tillsammans, till högre nivåegenskaper som emulerar förståelse av kontext och mening.

Men LLM är inte primärt tränade för att vara korrekta. Förstärkt lärande med mänsklig feedback (RLHF) och andra tekniker hjälper till att träna dem för önskvärda egenskaper, inklusive korrekthet, men är inte fullständigt framgångsrika. Givet en prompt, kommer LLM att generera text som mest liknar de statistiska egenskaperna hos träningsdata. Ofta är denna text också korrekt. Till exempel, om man frågar “när föddes Alexander den store”, är det korrekta svaret 356 f.Kr. (eller f.Kr.), och en LLM är sannolikt att ge detta svar eftersom Alexanders födelse oftast anges som detta värde i träningsdata. Men när man frågar “när föddes kejsarinnan Reginella”, en fiktiv karaktär som inte finns i träningskorpusen, är LLM sannolikt att hallucinera och skapa en berättelse om hennes födelse. På samma sätt, när man ställer en fråga som LLM kanske inte kan hämta ett rätt svar för (antingen för att det rätta svaret inte finns, eller för andra statistiska syften), är det sannolikt att hallucinera och svara som om den vet. Detta skapar hallucinationer som är ett uppenbart problem för allvarliga tillämpningar, såsom “hur kan man behandla sådan och sådan cancer”.

Det finns inga perfekta lösningar ännu för hallucinationer. De är endemiska för LLM:s design. En partiell lösning är korrekt prompting, såsom att be LLM att “tänka noggrant, steg för steg”, och så vidare. Detta ökar LLM:s sannolikhet att inte fabricera berättelser. En mer sofistikerad metod som utvecklas är användningen av kunskapsgrafer. Kunskapsgrafer tillhandahåller strukturerad data: entiteter i en kunskapsgraf är kopplade till andra entiteter på ett fördefinierat, logiskt sätt. Att konstruera en kunskapsgraf för ett visst område är naturligtvis en utmanande uppgift, men den kan utföras med en kombination av automatiserade och statistiska metoder och kurering. Med en inbyggd kunskapsgraf kan LLM korskontrollera de uttalanden de genererar mot den strukturerade uppsättningen kända fakta och kan begränsas till att inte generera ett uttalande som motsäger eller inte stöds av kunskapsgrafen.

På grund av det grundläggande problemet med hallucinationer, och troligen på grund av deras brist på tillräcklig resonemangs- och bedömningsförmåga, är LLM idag kraftfulla för att hämta, ansluta och destillera information, men kan inte ersätta mänskliga experter i allvarliga tillämpningar som medicinsk diagnos eller juridisk rådgivning. De kan dock avsevärt förbättra effektiviteten och förmågan hos mänskliga experter inom dessa områden.

Kan du dela din vision för en framtid där biologi styrs av data snarare än hypoteser?

Det traditionella hypotesdrivna tillvägagångssättet, som innefattar att forskare hittar mönster, utvecklar hypoteser, utför experiment eller studier för att testa dem och sedan finslipar teorier baserat på data, ersätts av ett nytt paradigm baserat på data-driven modellering.

I detta framväxande paradigm börjar forskare med hypotesfri, storskalig data-generering. Sedan tränar de en maskinlärningsmodell, såsom en LLM, med målet att återge dold data, stark regression eller klassificeringsprestanda i en mängd nedströmsuppgifter. När maskinlärningsmodellen kan förutsäga data med tillräcklig noggrannhet och uppnår en trogenhet som är jämförbar med likheten mellan experimentella replikater, kan forskare förhöra modellen för att extrahera insikt om det biologiska systemet och urskilja de underliggande biologiska principerna.

LLM visar sig vara särskilt bra på att modellera biomolekylär data och är utformade för att driva en förändring från hypotesdriven till data-driven biologisk upptäckt. Denna förändring kommer att bli alltmer uttalad under de närmaste 10 åren och tillåta exakt modellering av biomolekylära system på en granularitet som går långt utöver mänsklig kapacitet.

Vad är den potentiella inverkan för sjukdomsdiagnos och läkemedelsupptäckt?

Jag tror att LLM och generativ AI kommer att leda till betydande förändringar inom life sciences-industrin. Ett område som kommer att dra nytta av LLM är klinisk diagnos, särskilt för sällsynta, svårdiagnosticerade sjukdomar och cancersubtyper. Det finns enorma mängder omfattande patientinformation som vi kan utnyttja – från genetiska profiler, behandlingssvar, medicinska journaler och familjehistoria – för att driva exakt och tidig diagnos. Om vi kan hitta ett sätt att samla in all denna data så att den är lättillgänglig och inte är isolerad av enskilda hälsoorganisationer, kan vi dramatiskt förbättra diagnostisk precision. Detta innebär inte att maskinlärningsmodellerna, inklusive LLM, kommer att kunna operera autonomt i diagnos. På grund av deras tekniska begränsningar kommer de inte att vara autonoma i den närmaste framtiden, utan snarare kommer de att förstärka mänskliga experter. De kommer att vara kraftfulla verktyg för att hjälpa läkaren att ge superb informerade bedömningar och diagnoser på en bråkdel av den tid som behövs idag, och att ordentligt dokumentera och kommunicera sina diagnoser till patienten samt till hela nätverket av hälsovårdspersonal som är anslutna via maskinlärningssystemet.

Industrin använder redan maskinlärning för läkemedelsupptäckt och utveckling, och lyfter fram dess förmåga att minska kostnader och tidsramar jämfört med det traditionella paradigmet. LLM lägger till ytterligare verktyg i verktygslådan och erbjuder utmärkta ramar för modellering av storskalig biomolekylär data, inklusive genomer, proteomer, funktionell genomik och epigenomik, single-cell data och mer. I den närmaste framtiden kommer grundläggande LLM att utan tvekan ansluta till alla dessa data-modaliteter och till stora kohorter av individer vars genetiska, proteomiska och hälsodata samlas in. Sådana LLM kommer att hjälpa till att generera lovande läkemedelsmål, identifiera sannolika fickor av aktivitet av proteiner som är associerade med biologisk funktion och sjukdom, eller föreslå vägar och mer komplexa cellulära funktioner som kan moduleras på ett visst sätt med små molekyler eller andra läkemedelsmodaliteter. Vi kan också utnyttja LLM för att identifiera läkemedelsrespondenter och icke-respondenter baserat på genetisk känslighet, eller för att återanvända läkemedel i andra sjukdomsindikationer. Många av de befintliga innovativa AI-baserade läkemedelsupptäcktsföretagen är utan tvekan redan börjar tänka och utvecklas i denna riktning, och vi bör förvänta oss att se bildandet av ytterligare företag samt offentliga insatser som syftar till att distribuera LLM i human hälsa och läkemedelsupptäckt. Tack för den detaljerade intervjun, läsare som vill lära sig mer bör besöka Seer.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.