Interviuri

Dr. Serafim Batzoglou, Chief Data Officer la Seer – Interviu în serie

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Serafim Batzoglou este Chief Data Officer la Seer. Înainte de a se alătura Seer, Serafim a fost Chief Data Officer la Insitro, conducând machine learning și știința datelor în abordarea lor de descoperire a medicamentelor. Înainte de a lucra la Insitro, a fost VP de Biologie Aplicată și Computațională la Illumina, conducând cercetarea și dezvoltarea tehnologică a IA și a asay-urilor moleculare pentru a face datele genomice mai interpretabile în sănătatea umană.

Ce v-a atras inițial în domeniul geneticii?

M-am interesat de domeniul biologiei computaționale la începutul doctoratului meu în știința calculatoarelor la MIT, când am urmat un curs pe această temă predat de Bonnie Berger, care a devenit consilierul meu de doctorat, și David Gifford. Proiectul genomului uman a câștigat viteza în timpul doctoratului meu. Eric Lander, care conducea Centrul de Genom la MIT, a devenit co-consilierul meu de doctorat și m-a implicat în proiect. Motivat de proiectul genomului uman, am lucrat la asamblarea genomului întreg și la genetica comparativă a ADN-ului uman și a șoarecelui.

Apoi, m-am mutat la Universitatea Stanford ca membru al departamentului de știința calculatoarelor, unde am petrecut 15 ani și am avut privilegiul de a-i consilia pe aproximativ 30 de studenți foarte talentați la doctorat și mulți cercetători postdoctorali și studenți. Focusul echipei mele a fost aplicarea algoritmilor, a învățării automate și a instrumentelor software pentru analizarea datelor genomice și biomoleculare la scară largă. Am părăsit Stanford în 2016 pentru a conduce o echipă de cercetare și dezvoltare tehnologică la Illumina. De atunci, am avut plăcerea de a conduce echipe de cercetare și dezvoltare în industrie. Constatac că munca în echipă, aspectul de business și impactul direct asupra societății sunt caracteristice industriei, comparativ cu academia. Am lucrat la companii inovatoare de-a lungul carierei mele: DNAnexus, pe care am co-fondat-o în 2009, Illumina, Insitro și acum Seer. Calculul și învățarea automată sunt esențiale pe întreg lanțul tehnologic în biotehnologie, de la dezvoltarea tehnologiei, la achiziționarea datelor, la interpretarea datelor biologice și la translația în sănătatea umană.

În ultimii 20 de ani, secvențierea genomului uman a devenit mult mai ieftină și mai rapidă. Acest lucru a condus la o creștere dramatică a pieței de secvențiere a genomului și la o adoptare mai largă în industria științelor vieții. Suntem acum la pragul de a avea date genomice, multi-omice și fenotipice de dimensiuni suficiente pentru a revoluționa în mod semnificativ îngrijirea sănătății, inclusiv prevenirea, diagnosticarea, tratamentul și descoperirea medicamentelor. Putem descoperi din ce în ce mai mult bazele moleculare ale bolilor la indivizi prin analiza computațională a datelor genomice, iar pacienții au șansa de a primi tratamente personalizate și țintite, în special în domeniile cancerului și bolilor genetice rare. Dincolo de utilizarea evidentă în medicină, învățarea automată, combinată cu informații genomice, ne permite să obținem informații și în alte domenii ale vieții noastre, cum ar fi genealogia și nutriția. Următorii ani vor vedea adoptarea îngrijirii sănătății personalizate și bazate pe date, mai întâi pentru grupuri selecte de oameni, cum ar fi pacienții cu boli rare, și din ce în ce mai mult pentru publicul larg.

Înainte de a deveni Chief Data Officer la Seer, ați fost Chief Data Officer la Insitro, conducând învățarea automată și știința datelor în abordarea lor de descoperire a medicamentelor. Care au fost unele dintre principalele concluzii ale acestei perioade cu privire la modul în care învățarea automată poate fi utilizată pentru a accelera descoperirea medicamentelor?

Paradigma convențională de descoperire și dezvoltare a medicamentelor “încercare și eroare” este plină de ineficiențe și are termene foarte lungi. Pentru a aduce un medicament pe piață, poate dura peste 1 miliard de dolari și peste o decadă. Prin încorporarea învățării automate în aceste eforturi, putem reduce dramatic costurile și termenele în mai multe etape. O etapă este identificarea țintelor, unde un gen sau un set de gene care pot modula un fenotip de boală sau pot reveni la o stare celulară mai sănătoasă pot fi identificate prin perturbații genetice și chimice la scară largă și prin citiri fenotipice, cum ar fi imagistica și genomica funcțională. O altă etapă este identificarea și optimizarea compusului, unde o moleculă mică sau o altă modalitate poate fi proiectată prin predicție in silico condusă de învățarea automată, precum și prin screening in vitro, și, de asemenea, pot fi optimizate proprietățile dorite ale unui medicament, cum ar fi solubilitatea, permeabilitatea, specificitatea și netoxicitatea. Cea mai dificilă, dar și cea mai importantă parte, este, probabil, translația la oameni. Alegerea modelului potrivit – linii de celule stem pluripotente induse versus linii de celule primare și mostre de țesut versus modele animale – pentru boala corectă ridică un set incredibil de importante de compromisuri care reflectă, în cele din urmă, capacitatea datelor rezultate, plus învățarea automată, de a se traduce la pacienți.

Seer Bio este pionier în noi modalități de decodificare a secretelor proteomului pentru a îmbunătăți sănătatea umană. Pentru cititorii care nu sunt familiarizați cu acest termen, ce este proteomul?

Proteomul este ansamblul dinamic de proteine produse sau modificate de un organism în timp și în răspuns la mediu, nutriție și stare de sănătate. Proteomica este studiul proteomului într-un anumit tip de celulă sau probă de țesut. Genomul unui om sau al altor organisme este static: cu excepția importantă a mutațiilor somatice, genomul de la naștere este genomul pe care îl are toată viața, copiat exact în fiecare celulă a corpului. Proteomul este dinamic și se schimbă în intervale de timp de ani, zile și chiar minute. Ca atare, proteomurile sunt mult mai aproape de fenotip și, în cele din urmă, de starea de sănătate decât sunt genomurile și, prin urmare, sunt mult mai informative pentru monitorizarea sănătății și înțelegerea bolilor.

La Seer, am dezvoltat o nouă modalitate de acces la proteom care oferă perspective mai profunde asupra proteinelor și proteoformelor în probe complexe, cum ar fi plasma, care este o probă foarte accesibilă, dar care, până în prezent, a constituit o mare provocare pentru proteomica convențională cu spectrometrie de masă.

Ce este platforma Proteograph a Seer și cum oferă o nouă perspectivă asupra proteomului?

Platforma Proteograph a Seer utilizează o bibliotecă de nanoparticule inginerizate în mod propriu, alimentate de un flux de lucru simplu, rapid și automatizat, care permite o interogare profundă și scalabilă a proteomului.

Platforma Proteograph strălucește în interogarea plasmei și a altor probe complexe care prezintă un interval dinamic mare – multe ordine de mărime diferență în abundența proteinelor din probă – unde metodele convenționale de spectrometrie de masă nu pot detecta partea cu abundență scăzută a proteomului. Nanoparticulele Seer sunt inginerizate cu proprietăți fizico-chimice reglabile care adună proteinele de-a lungul intervalului dinamic într-un mod neîmpărtit. În probele tipice de plasmă, tehnologia noastră permite detectarea a 5x până la 8x mai multe proteine decât atunci când se procesează plasmă pură fără a utiliza Proteograph. Ca urmare, de la pregătirea probei la instrumentație și la analiza datelor, pachetul nostru de produse Proteograph ajută oamenii de știință să găsească semnături de boală ale proteomului care ar fi altfel nedetectabile. Ne place să spunem că, la Seer, deschidem o poartă nouă către proteom.

În plus, ne permitem oamenilor de știință să efectueze cu ușurință studii proteogenomice la scară largă. Proteogenomica este combinarea datelor genomice cu date proteomice pentru a identifica și cuantifica variantele de proteine, a lega variantele genomice de nivelurile de abundență ale proteinelor și, în cele din urmă, a lega genomul și proteomul de fenotip și de boală și a începe să desfacă căile genetice cauzale și descendente asociate cu boala.

Puteți discuta despre unele dintre tehnologiile de învățare automată utilizate în prezent la Seer Bio?

Seer utilizează învățarea automată în toate etapele, de la dezvoltarea tehnologiei la analiza datelor descendente. Aceste etape includ: (1) proiectarea nanoparticulelor noastre proprietare, unde învățarea automată ne ajută să determinăm care proprietăți fizico-chimice și care combinații de nanoparticule vor funcționa cu linii de produse și teste specifice; (2) detectarea și cuantificarea peptidelor, proteinelor, variantelor și proteoformelor din datele de citire produse de instrumentele MS; (3) analizele proteomice și proteogenomice descendente în cohorte mari de populație.

Anul trecut, am publicat un articol în Advanced Materials care combină metode de proteomică, nanoinginerie și învățare automată pentru a îmbunătăți înțelegerea noastră asupra mecanismelor de formare a coroanei de proteine. Acest articol a descoperit interacțiuni nano-bio și ne informează la Seer în crearea nanoparticulelor și produselor îmbunătățite viitoare.

În afara dezvoltării nanoparticulelor, am dezvoltat algoritmi noi pentru a identifica peptide variante și modificări post-traducționale (PTM). Am dezvoltat recent o metodă pentru detectarea locilor cuantificați ai proteinelor (pQTL) care este robustă la variantele de proteine, ceea ce este un factor de confuzie cunoscut pentru proteomica bazată pe afinitate. Suntem extinzând această lucrare pentru a identifica direct aceste peptide din spectrele brute, utilizând metode de secvențiere de novo bazate pe învățare profundă, pentru a permite căutarea fără a inflaționa dimensiunea bibliotecilor spectrale.

Echipa noastră dezvoltă, de asemenea, metode pentru a permite oamenilor de știință fără expertiză profundă în învățare automată să ajusteze și să utilizeze optim modele de învățare automată în munca lor de descoperire. Acest lucru se realizează prin intermediul unui cadru Seer ML bazat pe instrumentul AutoML, care permite ajustarea eficientă a hiperparametrilor prin optimizare Bayesiană.

În cele din urmă, dezvoltăm metode pentru a reduce efectul de lot și a crește acuratețea cantitativă a citirilor spectrometrice de masă, modelând valorile cantitative măsurate pentru a maximiza metricele așteptate, cum ar fi corelația valorilor de intensitate între peptide în cadrul unui grup de proteine.

Hallucinațiile sunt o problemă comună cu LLM-urile, ce sunt unele dintre soluțiile pentru a preveni sau a atenua acest lucru?

LLM-urile sunt metode generative care primesc un corpus mare și sunt antrenate pentru a genera text similar. Ele captează proprietățile statistice subiacente ale textului pe care sunt antrenate, de la proprietăți locale simple, cum ar fi frecvența cu care anumite combinații de cuvinte (sau tokeni) sunt găsite împreună, la proprietăți de nivel superior care emulează înțelegerea contextului și a sensului.

În continuare, LLM-urile nu sunt antrenate în primul rând pentru a fi corecte. Învățarea prin întărire cu feedback uman (RLHF) și alte tehnici ajută la antrenarea lor pentru proprietăți dorite, inclusiv corectitudinea, dar nu sunt pe deplin reușite. Dat fiind un prompt, LLM-urile vor genera text care seamănă cel mai mult cu proprietățile statistice ale datelor de antrenament. Adesea, acest text este, de asemenea, corect. De exemplu, dacă li se cere “când s-a născut Alexandru cel Mare”, răspunsul corect este 356 î.Hr. (sau î.e.n.), și o LLM este probabil să dea acest răspuns, deoarece în datele de antrenament nașterea lui Alexandru cel Mare apare adesea ca această valoare. Cu toate acestea, dacă li se cere “când s-a născut Împărăteasa Reginella”, un personaj fictiv care nu este prezent în corpusul de antrenament, LLM-ul este probabil să halucineze și să creeze o poveste despre nașterea ei. Similar, atunci când li se pune o întrebare la care LLM-ul nu poate găsi un răspuns corect (fie pentru că răspunsul corect nu există, fie din alte motive statistice), este probabil să halucineze și să răspundă ca și cum ar ști. Acest lucru creează halucinații care sunt o problemă evidentă pentru aplicații serioase, cum ar fi “cum poate fi tratat un anumit cancer”.

Încă nu există soluții perfecte pentru halucinații. Ele sunt endemice pentru proiectarea LLM-ului. O soluție parțială este o promptare corespunzătoare, cum ar fi a cere LLM-ului “să gândească cu atenție, pas cu pas” și așa mai departe. Acest lucru crește probabilitatea ca LLM-urile să nu inventeze povești. O abordare mai sofisticată, care este în curs de dezvoltare, este utilizarea grafurilor de cunoaștere. Grafurile de cunoaștere oferă date structurate: entitățile dintr-un graf de cunoaștere sunt conectate la alte entități într-un mod predefinit și logic. Construirea unui graf de cunoaștere pentru un anumit domeniu este, desigur, o sarcină dificilă, dar realizabilă cu o combinație de metode automate și statistice și curățare. Cu un graf de cunoaștere încorporat, LLM-urile pot verifica afirmațiile pe care le generează împotriva setului structurat de fapte cunoscute și pot fi limitate să nu genereze o afirmație care contrazice sau nu este susținută de grafurile de cunoaștere.

Întrucât halucinațiile sunt o problemă fundamentală și, probabil, din cauza lipsei lor de raționament și judecată suficientă, LLM-urile sunt astăzi puternice pentru recuperarea, conectarea și distilarea informațiilor, dar nu pot înlocui experții umani în aplicații serioase, cum ar fi diagnosticul medical sau consultanța juridică. Cu toate acestea, ele pot spori considerabil eficiența și capacitatea experților umani în aceste domenii.

Puteți împărtăși viziunea dvs. pentru un viitor în care biologia este condusă de date, mai degrabă decât de ipoteze?

Aproachul tradițional, bazat pe ipoteză, care implică cercetători care găsesc modele, dezvoltă ipoteze, efectuează experimente sau studii pentru a le testa și apoi rafinează teoriile pe baza datelor, este înlocuit de un nou paradigmă bazat pe modelarea datelor.

În această paradigmă emergentă, cercetătorii încep cu generarea de date la scară largă, fără ipoteze. Apoi, antrenează un model de învățare automată, cum ar fi un LLM, cu obiectivul de a reconstitui cu acuratețe datele mascate, de a avea o performanță puternică de regresie sau clasificare într-un număr de sarcini descendente. Odată ce modelul de învățare automată poate prezice cu acuratețe datele și atinge o fidelitate comparabilă cu similaritatea dintre replici experimentale, cercetătorii pot interoga modelul pentru a extrage informații despre sistemul biologic și pentru a descoperi principiile biologice subiacente.

LLM-urile se dovedesc a fi deosebit de bune în modelarea datelor biomoleculare și sunt destinate să alimenteze o schimbare de la descoperirea biologică bazată pe ipoteze la descoperirea biologică bazată pe date. Această schimbare va deveni din ce în ce mai pronunțată în următorii 10 ani și va permite modelarea cu acuratețe a sistemelor biomoleculare la o granulație care depășește capacitatea umană.

Care este impactul potențial pentru diagnosticarea bolilor și descoperirea medicamentelor?

Cred că LLM și IA generativă vor conduce la schimbări semnificative în industria științelor vieții. Un domeniu care va beneficia în mod deosebit de LLM-urile este diagnosticul clinic, în special pentru boli rare, dificil de diagnosticat și subtipuri de cancer. Există cantități uriașe de informații cuprinzătoare despre pacienți pe care le putem exploata – de la profiluri genomice, răspunsuri la tratament, dosare medicale și istoric familial – pentru a conduce la diagnostice precise și la timp. Dacă putem găsi o modalitate de a compila toate aceste date astfel încât să fie ușor accesibile și nu să fie izolate de organizațiile sanitare individuale, putem îmbunătăți semnificativ precizia diagnosticului. Acest lucru nu înseamnă că modelele de învățare automată, inclusiv LLM-urile, vor putea opera în mod autonom în diagnostic. Din cauza limitărilor tehnice, în viitorul previzibil, nu vor fi autonome, ci vor fi unelte puternice care ajută experții umani să furnizeze evaluări și diagnostice bine informate într-un timp mult mai scurt decât cel necesar în prezent și să documenteze și să comunice diagnosticele pacientului, precum și întregii rețele de furnizori de sănătate conectați prin sistemul de învățare automată.

Industria este deja în curs de a utiliza învățarea automată pentru descoperirea și dezvoltarea medicamentelor, susținând că aceasta poate reduce costurile și termenele comparativ cu paradigma tradițională. LLM-urile adaugă și mai mult la setul de instrumente disponibile și oferă cadre excelente pentru modelarea datelor biomoleculare la scară largă, inclusiv genomuri, proteome, date genomice și epigenomice funcționale, date de celule unice și multe altele. În viitorul previzibil, LLM-urile de bază vor conecta, fără îndoială, toate aceste modalități de date și toate cohortele mari de indivizi ale căror informații genomice, proteomice și de sănătate sunt colectate. Astfel de LLM-uri vor ajuta la generarea de ținte de medicamente promițătoare, vor identifica probabil buzunare de activitate ale proteinelor asociate cu funcția biologică și boala, sau vor sugera căi și funcții celulare mai complexe care pot fi modulate într-un anumit mod cu molecule mici sau alte modalități de medicamente. Putem, de asemenea, să utilizăm LLM-urile pentru a identifica răspunsul la medicamente și non-răspunsul la medicamente pe baza susceptibilității genetice, sau pentru a reutiliza medicamente în alte indicații de boală. Multe dintre companiile inovatoare de descoperire a medicamentelor bazate pe IA sunt, fără îndoială, deja pe cale să gândească și să dezvolte în această direcție, și ar trebui să ne așteptăm la formarea unor companii și eforturi publice suplimentare vizând implementarea LLM-urilor în sănătatea umană și descoperirea medicamentelor. Vă mulțumim pentru interviul detaliat; cititorii care doresc să afle mai multe despre Seer ar trebui să viziteze Seer.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.