Wywiady

Dr Serafim Batzoglou, Chief Data Officer w Seer – Wywiad

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Serafim Batzoglou jest Chief Data Officer w Seer. Przed dołączeniem do Seer, Serafim pełnił funkcję Chief Data Officer w Insitro, gdzie kierował zespołem machine learning i data science w podejściu do odkrycia leków. Przed Insitro, pełnił funkcję VP of Applied and Computational Biology w Illumina, gdzie kierował badaniami i rozwojem technologii AI i molekularnych testów w celu uczynienia danych genomowych bardziej zrozumiałych w zdrowiu ludzkim.

Czym było to, co początkowo przyciągnęło Cię do dziedziny genomiki?

Zainteresowałem się dziedziną biologii komputacyjnej na początku mojego doktoratu z informatyki na MIT, kiedy uczestniczyłem w zajęciach z tej dziedziny prowadzonych przez Bonnie Berger, która została moim promotorem, i Davida Gifforda. Projekt ludzkiego genomu zyskiwał wówczas na popularności podczas mojego doktoratu. Eric Lander, który kierował Centrum Genomu na MIT, został moim współpromotorem i zaangażował mnie w ten projekt. Zmotywowany projektem ludzkiego genomu, pracowałem nad całogenomową analizą i porównawczą genomiką ludzkiej i mysiej DNA.

Następnie przeniosłem się na Uniwersytet Stanforda jako wykładowca na wydziale informatyki, gdzie spędziłem 15 lat i miałem przywilej doradzać około 30 niezwykle utalentowanym studentom doktoranckim i wielu badaczom poszukiwawczym i studentom. Moja grupa skupiła się na zastosowaniu algorytmów, machine learning i narzędzi programowych do analizy dużych zbiorów danych genomowych i biomolekularnych. Opuściłem Stanford w 2016 roku, aby kierować zespołem badawczo-rozwojowym w Illumina. Od tego czasu cieszę się, że mogłem kierować zespołami R&D w branży. Uważam, że współpraca zespołowa, aspekt biznesowy i bardziej bezpośredni wpływ na społeczeństwo są charakterystyczne dla branży w porównaniu z akademickimi. Pracowałem w innowacyjnych firmach przez całą swoją karierę: DNAnexus, które założyłem w 2009 roku, Illumina, Insitro i teraz Seer. Obliczenia i machine learning są niezbędne w całym łańcuchu technologicznym w biotechnologii, od rozwoju technologii, poprzez pozyskiwanie danych, aż do interpretacji danych biologicznych i ich tłumaczenia na zdrowie ludzkie.

W ciągu ostatnich 20 lat sekwencjonowanie ludzkiego genomu stało się znacznie tańsze i szybsze. Doprowadziło to do gwałtownego wzrostu rynku sekwencjonowania genomu i szerszego zastosowania w branży nauk o życiu. Jesteśmy teraz na progu posiadania danych genomowych, multi-omikowych i fenotypowych o wystarczającej skali, aby znacząco rewolucjonizować opiekę zdrowotną, w tym profilaktykę, diagnozę, leczenie i odkrywanie leków. Możemy coraz częściej odkrywać molekularne podstawy chorób u osób poprzez komputacyjną analizę danych genomowych, a pacjenci mają szansę otrzymać leczenia, które są personalizowane i ukierunkowane, szczególnie w obszarach raka i rzadkich chorób genetycznych. Poza oczywistym zastosowaniem w medycynie, machine learning w połączeniu z informacjami genomowymi pozwala nam uzyskać wgląd w inne obszary naszego życia, takie jak genealogia i odżywianie. Kolejne lata przyniosą wdrożenie personalizowanej, opartej na danych opieki zdrowotnej, najpierw dla wybranych grup ludzi, takich jak pacjenci z rzadkimi chorobami, a następnie coraz bardziej dla szerszej publiczności.

Przed swoją obecną rolą byłeś Chief Data Officer w Insitro, gdzie kierowałeś machine learning i data science w podejściu do odkrycia leków. Jakie były niektóre z Twoich najważniejszych wniosków z tego okresu, dotyczących tego, jak machine learning może być wykorzystany do przyspieszenia odkrycia leków?

Konwencjonalny paradygmat odkrycia i rozwoju leków „próba i błąd” jest naznaczony nieefektywnościami i niezwykle długimi ramami czasowymi. Aby wprowadzić machine learning do tych wysiłków, możemy dramatycznie zredukować koszty i ramy czasowe na kilku etapach. Jednym z etapów jest identyfikacja celów, gdzie gen lub zestaw genów, które modyfikują fenotyp choroby lub przywracają stan komórkowy do zdrowszego stanu, mogą być zidentyfikowane za pomocą dużych skalowych perturbacji genetycznych i chemicznych oraz odczytów fenotypowych, takich jak obrazowanie i genomicska analiza funkcjonalna. Innym etapem jest identyfikacja i optymalizacja związków, gdzie mała cząsteczka lub inny modality może być zaprojektowana za pomocą machine learning i in silico predykcji, a także pożądane właściwości leku, takie jak rozpuszczalność, przenikalność, swoistość i nietoksyczność, mogą być zoptymalizowane. Najtrudniejszym, a także najważniejszym aspektem, jest być może tłumaczenie na ludzi. Tutaj wybór odpowiedniego modelu – linii komórkowych wyindukowanych z pluripotencjalnych komórek macierzystych w porównaniu z pierwotnymi liniami komórkowymi pacjentów i próbkami tkanek w porównaniu z modelami zwierzęcymi – dla odpowiedniej choroby stanowi niezwykle ważny zestaw kompromisów, które ostatecznie wpływają na zdolność wynikających danych plus machine learning do tłumaczenia na pacjentów.

Seer Bio jest pionierem nowych sposobów odczytywania sekretów proteomu w celu poprawy zdrowia ludzkiego. Dla czytelników, którzy nie są zaznajomieni z tym terminem, co to jest proteom?

Proteom to zbiór białek wytwarzanych lub modyfikowanych przez organizm w czasie i w odpowiedzi na środowisko, odżywianie i stan zdrowia. Proteomika to badanie proteomu w ramach określonego typu komórkowego lub próbki tkanek. Ludzki genom lub genom innych organizmów jest statyczny: z ważnym wyjątkiem mutacji somatycznych, genom urodzenia jest genomem, którym się całe życie. Proteom jest dynamiczny i zmienia się w czasie trwania lat, dni i nawet minut. Jako taki, proteomy są o wiele bliżej fenotypu i ostatecznie stanu zdrowia niż genomy, i w związku z tym są bardziej informacyjne dla monitorowania zdrowia i zrozumienia choroby.

W Seer opracowaliśmy nowy sposób dostępu do proteomu, który zapewnia głębsze wglądy w białka i proteoformy w złożonych próbkach, takich jak osocze, które jest łatwo dostępną próbką, która niestety do tej pory stanowiła duże wyzwanie dla konwencjonalnej spektrometrii masowej proteomiki.

Co to jest platforma Proteograph Seer i jak oferuje nowy widok na proteom?

Platforma Proteograph Seer wykorzystuje bibliotekę własnych, inżynierskich nano-cząstek, napędzanych przez prosty, szybki i zautomatyzowany przepływ pracy, umożliwiający głęboką i skalowalną analizę proteomu.

Platforma Proteograph wyróżnia się w analizie osocza i innych złożonych próbek, które wykazują duży dynamiczny zakres – wiele rzędów wielkości różnicy w obfitości różnych białek w próbce – gdzie konwencjonalne metody spektrometrii masowej nie są w stanie wykryć niskiej obfitości części proteomu. Nano-cząstki Seer są inżynierskie z dostosowanymi właściwościami fizykochemicznymi, które gromadzą białka w sposób niezależny od dynamicznego zakresu. W typowych próbkach osocza, nasza technologia umożliwia wykrycie 5-krotnie do 8-krotnie więcej białek niż przy przetwarzaniu nieczystego osocza bez użycia platformy Proteograph. W rezultacie, od przygotowania próbki do instrumentacji i analizy danych, nasz zestaw produktów Proteograph pomaga naukowcom znaleźć sygnatury choroby proteomu, które mogłyby być niewykrywalne.

Dalej, umożliwiamy naukowcom łatwe przeprowadzanie dużych skalowych badań proteogenomicznych. Proteogenomika to łączenie danych genomowych z danymi proteomicznymi w celu identyfikacji i ilościowania wariantów białek, połączenia wariantów genomowych z poziomami obfitości białek, i ostatecznie połączenia genomu i proteomu z fenotypem i chorobą, i rozpoczęcia rozplątywania przyczynowych i poniższych ścieżek genetycznych związanych z chorobą.

Czy możesz omówić niektóre z technologii machine learning, które są obecnie wykorzystywane w Seer Bio?

Seer wykorzystuje machine learning na wszystkich etapach, od rozwoju technologii do analizy danych. Te etapy obejmują: (1) projektowanie naszych własnych nano-cząstek, gdzie machine learning pomaga nam określić, które właściwości fizykochemiczne i kombinacje nano-cząstek będą działać z określonymi liniami produktów i testami; (2) wykrywanie i ilościowanie peptydów, białek, wariantów i proteoform z odczytów danych wytworzonych przez instrumenty MS; (3) dalsze analizy proteomiczne i proteogenomiczne w dużych kohortach populacyjnych.

W zeszłym roku opublikowaliśmy artykuł w Advanced Materials, łącząc metody proteomiczne, nano-inżynierię i machine learning w celu poprawy naszego zrozumienia mechanizmów tworzenia korony białkowej. Ten artykuł ujawnił interakcje nano-bio i informuje Seer o tworzeniu lepszych nano-cząstek i produktów w przyszłości.

Ponadto opracowaliśmy nowe algorytmy do identyfikacji wariantów peptydów i modyfikacji post-translacyjnych (PTMs). Niedawno opracowaliśmy metodę wykrywania locus cech ilościowych białek (pQTLs), która jest odporna na warianty białek, co jest znanym czynnikiem zakłócającym dla proteomiki opartej na afinitcie. Rozszerzamy tę pracę, aby bezpośrednio identyfikować te peptydy z surowych widm przy użyciu metod sekwencjonowania de novo opartych na głębokim uczeniu, aby umożliwić wyszukiwanie bez inflacji rozmiaru bibliotek spectralnych.

Nasze zespoły również rozwijają metody, które umożliwiają naukowcom bez głębokiej wiedzy na temat machine learning optymalne dostosowanie i wykorzystanie modeli machine learning w ich pracy badawczej. To jest osiągane za pomocą ramy Seer ML opartej na narzędziu AutoML, które umożliwia wydajne dostosowanie hiperparametrów za pomocą optymalizacji bayesowskiej.

Wreszcie, rozwijamy metody, które redukują efekt partii i zwiększają dokładność ilościową odczytu spektrometrii masowej, modelując zmierzone wartości ilościowe, aby maksymalizować oczekiwane metryki, takie jak korelacja wartości intensywności w obrębie grupy białek.

Hallucynacje są powszechnym problemem z LLM, jakie są niektóre z rozwiązań, aby temu przeciwdziałać lub złagodzić?

LLM to metody generatywne, które są szkolone na dużym korpusie i są trenowane do generowania podobnego tekstu. LLM pochłaniają podstawowe właściwości statystyczne tekstu, od prostych właściwości lokalnych, takich jak częstość występowania pewnych kombinacji słów (lub tokenów), do wyższych poziomów, które naśladują zrozumienie kontekstu i znaczenia.

Jednak LLM nie są szkolone przede wszystkim, aby być poprawne. Uczenie ze sprzężeniem zwrotnym z ludzkim feedbackiem (RLHF) i inne techniki pomagają szkolić je w pożądanych właściwościach, w tym poprawności, ale nie są w pełni skuteczne. Podane pytanie, LLM generuje tekst, który najbardziej przypomina właściwości statystyczne danych szkoleniowych. Często ten tekst jest również poprawny. Na przykład, jeśli zostanie zadane pytanie „kiedy urodził się Aleksander Wielki”, poprawna odpowiedź to 356 p.n.e., i LLM jest prawdopodobnie poda tę odpowiedź, ponieważ w danych szkoleniowych urodzenie Aleksandra Wielkiego pojawia się często jako ta wartość. Jednak, jeśli zostanie zadane pytanie „kiedy urodziła się cesarzowa Reginella”, fikcyjna postać nieobecna w korpusie szkoleniowym, LLM jest prawdopodobnie zahipnotyzuje i stworzy historię jej urodzenia. Podobnie, jeśli zostanie zadane pytanie, na które LLM może nie znaleźć odpowiedzi (albo dlatego, że odpowiedź nie istnieje, albo z innych powodów statystycznych), jest prawdopodobne, że zahipnotyzuje i odpowie, jakby wiedziało. To tworzy hallucynacje, które są oczywistym problemem dla poważnych aplikacji, takich jak „jak można leczyć taką i taką chorobę”.

Brak jest idealnych rozwiązań hallucynacji. Są one endemiczne dla projektu LLM. Jednym z częściowych rozwiązań jest odpowiednie pytanie, takie jak „zastanów się starannie, krok po kroku” itp. To zwiększa prawdopodobieństwo, że LLM nie wymyśli historii. Bardziej zaawansowane podejście, które jest rozwijane, to użycie grafów wiedzy. Grafy wiedzy zapewniają strukturalne dane: jednostki w grafie wiedzy są połączone z innymi jednostkami w sposób logiczny. Tworzenie grafu wiedzy dla danej dziedziny jest oczywiście wyzwaniem, ale jest to możliwe dzięki połączeniu automatycznych i statystycznych metod oraz kuracji. Z wbudowanym grafem wiedzy, LLM mogą sprawdzić oświadczenia, które generują, przeciwko zestawowi znanych faktów, i mogą być ograniczone do niegenerowania oświadczeń, które sprzeczają się lub nie są wspierane przez graf wiedzy.

Ponieważ hallucynacje są podstawowym problemem, a także ze względu na brak wystarczających zdolności rozumowania i oceny, LLM są dziś potężne w odzyskiwaniu, łączeniu i destylowaniu informacji, ale nie mogą zastąpić ludzkich ekspertów w poważnych aplikacjach, takich jak medyczna diagnoza lub prawna porada. Mogą one jednak znacznie zwiększyć wydajność i możliwości ludzkich ekspertów w tych dziedzinach.

Czy możesz podzielić się swoją wizją przyszłości, w której biologia jest sterowana przez dane, a nie hipotezy?

Tradycyjne podejście oparte na hipotezach, które obejmuje znalezienie wzorców, rozwinięcie hipotez, przeprowadzenie eksperymentów lub badań w celu ich przetestowania, a następnie udoskonalenie teorii na podstawie danych, jest zastępowane nowym paradygmatem opartym na modelowaniu danych.

W tym nowym paradygmacie, badacze zaczynają od generowania danych bez hipotez, a następnie trenują model machine learning, takiego jak LLM, z celem dokładnej rekonstrukcji ukrytych danych, silnej regresji lub klasyfikacji w wielu zadaniach. Gdy model machine learning może dokładnie przewidywać dane i osiągać wierność porównywalną z podobieństwem między replikami eksperymentalnymi, badacze mogą przesłuchać model, aby wydobyć wgląd w system biologiczny i zrozumieć podstawowe zasady biologiczne.

LLM okazują się szczególnie dobrze w modelowaniu danych biomolekularnych i są przeznaczone do napędzania zmiany z podejścia opartego na hipotezach do odkrycia biologicznego opartego na danych. Ta zmiana stanie się coraz bardziej widoczna w ciągu najbliższych 10 lat i pozwoli na dokładne modelowanie systemów biomolekularnych na poziomie, który wykracza poza ludzkie możliwości.

Jaki jest potencjalny wpływ na diagnozowanie chorób i odkrywanie leków?

Wierzę, że LLM i generatywne AI doprowadzą do znaczących zmian w branży nauk o życiu. Jednym z obszarów, który skorzysta na LLM, jest diagnoza kliniczna, szczególnie dla rzadkich, trudnych do zdiagnozowania chorób i podtypów raka. Istnieją ogromne ilości kompleksowych informacji o pacjentach, które możemy wykorzystać – od profili genetycznych, odpowiedzi na leczenie, kart medycznych i historii rodzinnej – aby poprowadzić dokładną i terminową diagnozę. Jeśli możemy znaleźć sposób, aby skompilować te dane tak, aby były łatwo dostępne i nie były izolowane przez poszczególne organizacje zdrowia, możemy dramatycznie poprawić precyzję diagnozy. To nie oznacza, że modele machine learning, w tym LLM, będą mogły działać samodzielnie w diagnozie. Ze względu na ich ograniczenia techniczne, w najbliższej przyszłości nie będą autonomiczne, ale będą potężnymi narzędziami, które pomogą lekarzom dostarczyć doskonale poinformowane oceny i diagnozy w ułamku czasu, jaki jest potrzebny do tej pory, i odpowiednio udokumentować i przekazać diagnozy pacjentom, a także całej sieci dostawców opieki zdrowotnej połączonych za pomocą systemu machine learning.

Przemysł już wykorzystuje machine learning do odkrywania i rozwoju leków, podkreślając jego zdolność do redukcji kosztów i czasu w porównaniu z tradycyjnym paradygmatem. LLM dodatkowo zwiększają dostępne narzędzie, zapewniając doskonałe ramy dla modelowania dużych zbiorów danych biomolekularnych, w tym genomów, proteomów, danych genomics, epigenomics, danych jednej komórki i więcej. W najbliższej przyszłości, podstawowe LLM połączą się we wszystkich tych modalnościach danych i we wszystkich dużych kohortach osób, których informacje genetyczne, proteomiczne i zdrowotne są zbierane. Takie LLM pomogą w generowaniu obiecujących celów leków, identyfikacji prawdopodobnych kieszeni aktywności białek związanych z funkcjami biologicznymi i chorobami, lub sugerowaniu ścieżek i bardziej złożonych funkcji komórkowych, które mogą być modyfikowane w określony sposób za pomocą małych cząsteczek lub innych modalności leków. Możemy również wykorzystać LLM, aby zidentyfikować odpowiedzi na leki i nieodpowiedzi na leki na podstawie genetycznej podatności lub do przeprojektowania leków w innych wskazaniach chorobowych. Wiele istniejących innowacyjnych firm AI zajmujących się odkrywaniem leków jest bez wątpienia już myślących i rozwijających się w tym kierunku, i powinniśmy oczekiwać powstania dodatkowych firm, a także publicznych wysiłków ukierunkowanych na wdrożenie LLM w zdrowiu ludzkim i odkrywaniu leków. Dziękuję za szczegółowy wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Seer.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.