Rozhovory

Dr. Serafim Batzoglou, Chief Data Officer ve společnosti Seer – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Serafim Batzoglou je Chief Data Officer ve společnosti Seer. Předtím, než nastoupil do Seer, působil Serafim jako Chief Data Officer ve společnosti Insitro, kde vedl týmy strojového učení a datové vědy pro objevování léků. Předtím působil jako VP of Applied and Computational Biology ve společnosti Illumina, kde vedl výzkum a vývoj technologií pro analýzu genomických dat v oblasti lidského zdraví.

Co vás původně přitáhlo k oboru genomics?

Začal jsem se zajímat o obor počítačové biologie na počátku svého doktorského studia v oboru počítačových věd na MIT, kdy jsem absolvoval kurz na toto téma, který učil Bonnie Berger, který se stal mým doktorským poradcem, a David Gifford. Projekt lidského genomu se tehdy rozvíjel a během mého doktorského studia jsem pracoval na whole-genome assembly a komparativní genomics lidského a myšího DNA.

Později jsem přešel na Stanford University jako člen počítačového oddělení, kde jsem strávil 15 let a měl jsem tu čest vést kolem 30 mimořádně talentovaných doktorandů a mnoha postdoktorandů a studentů. Zaměření mého týmu bylo aplikací algoritmů, strojového učení a softwarových nástrojů pro analýzu velkých genomických a biomolekulárních dat. V roce 2016 jsem opustil Stanford, aby vedl tým výzkumu a technologického rozvoje ve společnosti Illumina. Od té doby jsem měl možnost vést týmy výzkumu a vývoje v průmyslu. Zjistil jsem, že týmová práce, obchodní aspekt a přímý dopad na společnost jsou charakteristické pro průmysl ve srovnání s akademickou sférou. Pracoval jsem pro inovativní společnosti po celou svou kariéru: DNAnexus, kterou jsem spoluzaložil v roce 2009, Illumina, Insitro a nyní Seer. Počítačové výpočty a strojové učení jsou nezbytné v celém technologickém řetězci biotechnologií, od technologického rozvoje, přes získávání dat, až po biologickou interpretaci a aplikaci v lidském zdraví.

V posledních 20 letech se sekvenování lidského genomu stalo mnohem levnějším a rychlejším. To vedlo k dramatickému růstu trhu sekvenování genomu a širšímu použití v průmyslu life sciences. Nyní jsme na prahu toho, že budeme mít dostatečné množství dat o populaci, multi-omických a fenotypových datech, abychom mohli významně změnit zdravotní péči, včetně prevence, diagnostiky, léčby a objevování léků. Můžeme stále více objevovat molekulární základy onemocnění u jednotlivých lidí prostřednictvím počítačové analýzy genomických dat a pacienti mají šanci dostat se k léčbám, které jsou personalizované a cílené, zejména v oblastech rakoviny a vzácných genetických onemocnění. Kromě zjevného použití v medicíně umožňuje strojové učení spojené s genomickými informacemi získat poznatky i do jiných oblastí našeho života, jako je naše genealogie a výživa. V následujících letech budeme svědky přijetí personalizované, datově řízené zdravotní péče, nejprve pro vybrané skupiny lidí, jako jsou pacienti s vzácnými onemocněními, a postupně pro širší veřejnost.

Předtím, než jste nastoupil do své současné pozice, jste byl Chief Data Officer ve společnosti Insitro, kde jste vedl týmy strojového učení a datové vědy pro objevování léků. Jaké byly některé z vašich hlavních poznatků z tohoto období, pokud jde o to, jak lze strojové učení použít pro urychlení objevování léků?

Tradiční paradigma objevování a vývoje léků, které je založeno na “trial-and-error”, je zatíženo neefektivitami a extrémně dlouhými časovými rámci. Pro jeden lék, aby se dostal na trh, může trvat přes 1 miliardu dolarů a více než deset let. Integrací strojového učení do těchto snah můžeme dramaticky snížit náklady a časové rámce v několika krocích na cestě. Jedním z kroků je identifikace cílů, kde lze identifikovat gen nebo sadu genů, které modulují fenotyp onemocnění nebo vrátí buňkový stav do zdravějšího stavu, prostřednictvím velkých genetických a chemických perturbací a fenotypových readoutů, jako je zobrazování a funkční genomics. Dalším krokem je identifikace sloučenin a optimalizace, kde lze navrhnout malé molekuly nebo jiné modality pomocí strojového učení a in vitro screeningu, a navíc lze optimalizovat požadované vlastnosti léku, jako je rozpustnost, propustnost, specifita a netoxicitu.

Můžete diskutovat o některých technologiích strojového učení, které se目前 používají ve společnosti Seer Bio?

Seer využívá strojové učení ve všech krocích, od technologického rozvoje až po analýzu dat. Tyto kroky zahrnují: (1) návrh našich vlastních nanočástic, kde strojové učení pomáhá určit, welche fyzikálně-chemické vlastnosti a kombinace nanočástic budou fungovat s konkrétními produkty a analytickými metodami; (2) detekci a kvantifikaci peptidů, proteinů, variant a proteoformů z dat vygenerovaných z MS přístrojů; (3) následné proteomické a proteogenomické analýzy ve velkých populacích.

Minulý rok jsme publikovali článek v Advanced Materials, který kombinoval proteomické metody, nano-inženýrství a strojové učení pro zlepšení našeho porozumění mechanismům tvorby proteinového koronu. Tento článek odhalil nano-bio interakce a informuje Seer o vytvoření lepších nanočástic a produktů.

Můžeme také diskutovat o některých řešeních, která mohou zabránit nebo zmírnit hallucinace?

Strojové učení je generativní metoda, která je trénována na velkém korpusu a generuje text, který se podobá statistickým vlastnostem trénovacího korpusu. Nicméně, strojové učení není primárně trénováno pro správnost. Učení s lidskou zpětnou vazbou (RLHF) a další techniky pomáhají trénovat strojové učení pro žádoucí vlastnosti, včetně správnosti, ale nejsou plně úspěšné. Pokud je strojovému učení dána výzva, generuje text, který se nejvíce podobá statistickým vlastnostem trénovacího korpusu. Často je tento text také správný.

Můžete sdílet své vize pro budoucnost, kde biologie bude řízena daty spíše než hypotézami?

Tradiční hypotéza-řízený přístup, který zahrnuje výzkumníky, kteří nacházejí vzory, vyvíjejí hypotézy, provádějí experimenty nebo studie pro testování hypotéz a poté upravují teorie na základě dat, je nahrazován novým paradigmatem založeným na datově-řízeném modelování.

V tomto novém paradigmatu začínají výzkumníci s hypotézami-volnými, velkými datovými generacemi. Poté trénují model strojového učení, jako je LLM, s cílem přesné rekonstrukce zakrytých dat, silné regrese nebo klasifikační výkony v několika následujících úkolech. Jakmile model strojového učení může přesně předpovídat data a dosahuje fidelitní srovnatelné se similaritou mezi experimentálními replikacemi, výzkumníci mohou model strojového učení dotázat, aby extrahovali poznatky o biologickém systému a rozlišovali základní biologické principy.

Jaký je potenciál pro diagnostiku onemocnění a objevování léků?

Domnívám se, že LLM a generativní AI povedou k významným změnám v průmyslu life sciences. Jedna oblast, která bude mít prospěch z LLM, je klinická diagnostika, zejména pro vzácná a obtížně diagnostikovatelná onemocnění a rakovinné subtypy. Existuje obrovské množství komplexních informací o pacientech, které můžeme využít – od genomických profilů, reakcí na léčbu, zdravotních záznamů a rodinné historie – pro přesnou a včasnou diagnostiku. Pokud můžeme najít způsob, jak zkompilovat tato data tak, aby byla snadno přístupná a nebyla izolována jednotlivými zdravotnickými organizacemi, můžeme dramaticky zlepšit diagnostickou přesnost.

Děkuji vám za podrobný rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Seer.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.