Röportajlar

Dr. Serafim Batzoglou, Seer’in Baş Veri Sorumlusu – Röportaj Serisi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Serafim Batzoglou, Seer’in Baş Veri Sorumlusu’dur. Seer’e katılmadan önce, Serafim, Insitro’da Baş Veri Sorumlusu olarak görev yaptı ve ilaç keşfinde makine öğrenimi ve veri bilimini liderlik etti. Insitro’dan önce, Illumina’da Uygulamalı ve Hesaplamalı Biyoloji Başkan Yardımcısı olarak görev yaptı ve insan sağlığında genomik verilerin daha anlaşılır hale getirilmesi için AI ve moleküler testlerin araştırma ve teknoloji geliştirilmesini yönetti.

Sizi ilk olarak genomik alanına neler çekti?

Bilgisayar bilimi alanında doktoramı yapmaya başladığım MIT’de, Bonnie Berger’ın verdiği bir derse katıldım ve David Gifford ile birlikte doktoramı yapmaya başladım. İnsan genom projesi benim doktoram sırasında hız kazandı. MIT’deki Genome Merkezi’nin başkanı olan Eric Lander, benim doktoram danışmanım oldu ve beni projeye dahil etti. İnsan genom projesi tarafından motive edildim ve insan ve fare DNA’sının bütün-genom montajı ve karşılaştırmalı genomikleri üzerine çalıştım.

Sonra Stanford Üniversitesi’ne bilgisayar bilimi bölümünde öğretim üyesi olarak taşındım ve 15 yıl orada kaldım. 30 tane yetenekli doktora öğrencisi ve birçok post-doktora araştırmacısı ve lisans öğrencisi danışmanlığını yaptım. Ekibimin odak noktası, büyük ölçekli genomik ve biyomoleküler verilerin analizi için algoritmalar, makine öğrenimi ve yazılım araçlarının geliştirilmesiydi. 2016’da Stanford’dan ayrıldım ve Illumina’da araştırma ve teknoloji geliştirme ekibini yönetmek için görev aldım. O zamandan beri endüstrideki AR-GE ekiplerini yönetmekten keyif aldım. İşbirliği, iş aspecti ve toplum üzerindeki daha doğrudan etki, akademiden farklı olarak endüstrinin karakteristik özellikleridir. Kariyerim boyunca DNAnexus, Illumina, Insitro ve şimdi Seer gibi yenilikçi şirketlerde çalıştım. Hesaplama ve makine öğrenimi, biyoteknolojide teknoloji geliştirme, veri edinimi, biyolojik veri yorumlanması ve insan sağlığına çevirim için teknoloji zincirinin tamamında temel öğelerdir.

Son 20 yıl içinde, insan genomunun dizilenmesi çok daha ucuz ve hızlı hale geldi. Bu, genom dizileme pazarında dramatik bir büyümeye ve yaşam bilimleri endüstrisinde daha geniş bir kabul görmeye yol açtı. Şimdi, sağlık hizmetlerini, önleme, tanı, tedavi ve ilaç keşfini devrimleştirerek anlamlı bir şekilde değiştirebilecek kadar büyük bir nüfus genomik, multi-omik ve fenotipik verilere sahibiz. Genomik verilerin hesaplamalı analizi sayesinde, hastalara kişiselleştirilmiş ve hedeflenmiş tedaviler alma şansı veriyoruz, özellikle de kanser ve nadir genetik hastalıklar gibi alanlarda. Tıp dışında, makine öğrenimi ve genomik bilgi, soyağaçımız ve beslenmemiz hakkında da fikir sahibi olmamızı sağlıyor. Önümüzdeki birkaç yıl içinde, kişiselleştirilmiş, veri odaklı sağlık hizmetlerinin, önce nadir hastalık hastaları gibi seçilmiş gruplar için ve sonra geniş halk için benimsenmesini göreceğiz.

Şu anki rolünüzden önce Insitro’da Baş Veri Sorumlusu olarak görev yaptınız ve ilaç keşfinde makine öğrenimi ve veri bilimini yönettiniz. Bu süre zarfında ilaç keşfini hızlandırmak için makine öğreniminin nasıl kullanılabileceği hakkında neler öğrendiniz?

Geleneksel ilaç keşfi ve geliştirme “deneme-yanılma” paradigması, verimsizliklerle ve çok uzun zaman çizelgesi ile dolu. Bir ilacın piyasaya sürülmesi için, 1 milyar doların üzerinde bir maliyet ve on yıldan fazla bir süre gerekebilir. İlaç keşfi çabalarına makine öğrenimi entegre ederek, maliyetleri ve zaman çizelgesini dramatic bir şekilde azaltabiliriz. Hedef tanımlama, bir gen veya genlerin bir hastalık fenotipini veya daha sağlıklı bir hücre durumuna çevirebileceği şekilde tanımlanabileceği bir adımdır. Makine öğrenimi, büyük ölçekli genetik ve kimyasal müdahaleler ve fenotipik okumalar aracılığıyla bu hedefleri tanımlamaya yardımcı olabilir. Bir başka adım, bileşik tanımlama ve optimizasyonudur, burada makine öğrenimi, küçük moleküllerin veya diğer modellerin tasarlanmasına yardımcı olabilir ve ayrıca bir ilacın özelliklerini optimize edebilir, zoals çözünürlük, geçirgenlik, özgüllük ve toksik olmayan özellikler.

Seer Bio, proteomun sırlarını çözmek için yeni yollar geliştiriyor. Proteom nedir?

Proteom, bir organizma tarafından üretilen veya değiştirilen proteinlerin değişen kümesidir ve bu, zaman içinde ve çevre, beslenme ve sağlık durumuna bağlı olarak gerçekleşir. Proteomik, bir hücre tipi veya doku örneğinde proteomun incelenmesidir. Bir insan veya diğer organizmaların genomu statiktir: doğumda sahip olduğunuz gen, tüm hayatınız boyunca kopyalanır ve vücudunuzun her hücresinde aynıdır. Proteom dinamiktir ve yıllar, günler ve hatta dakikalar içinde değişir. Bu nedenle, proteomlar, fenotipe ve sonunda sağlık durumuna çok daha yakın ve daha bilgilendiricidir.

Seer’de, kompleks örneklerde seperti plazma, proteom hakkında daha derin bilgiler sağlayan yeni bir proteom erişim yöntemi geliştirdik. Bu örnekler, geleneksel kütle spektrometresi proteomik için büyük bir zorluk oluşturur.

Seer’in Proteograph™ platformu nedir ve proteomu nasıl yeni bir şekilde sunar?

Seer’in Proteograph platformu, özel mühendislik nanoparçacıklarının bir kütüphanesini kullanır ve basit, hızlı ve otomatik bir iş akışını sağlar, bu da proteomun derin ve ölçeklenebilir bir şekilde sorgulanmasını sağlar.

Proteograph platformu, büyük dinamik aralığa sahip örnekleri, özellikle plazma gibi örnekleri sorgulamada öne çıkıyor ve geleneksel kütle spektrometresi yöntemleri bu örneklerde düşük bolluklu proteomun tespit edilememesine neden oluyor. Seer’in nanoparçacıkları, proteinleri toplamak için tasarlanmış ve önyargılı bir şekilde çalışır. Tipik plazma örneklerinde, teknolojiniz 5 ila 8 kat daha fazla proteini tespit edebilir.

Seer Bio’da şu an kullanılan bazı makine öğrenimi teknolojileri hakkında konuşabilir misiniz?

Seer, teknoloji geliştirme ve veri analizi dahil olmak üzere tüm adımlarda makine öğrenimini kullanıyor. Makine öğrenimi, nanoparçacıkların tasarımı, peptitlerin, proteinlerin, varyantların ve proteoformların tespiti ve nicelendirilmesi, büyük ölçekli popülasyon kohortlarında proteomik ve proteogenomik analizler gibi adımları içerir.

Geçen yıl, Advanced Materials’de bir makale yayınladık ve proteomik yöntemleri, nano-mühendislik ve makine öğrenimi birleştirdik. Bu makale, nano-biyolojik etkileşimleri ortaya çıkardı ve Seer’in gelecekteki nanoparçacıkların ve ürünlerin geliştirilmesine yol gösteriyor.

Nanoparçacık geliştirme ötesinde, varyant peptitleri ve post-translasyonel modifikasyonları tespit etmek için yeni algoritmalar geliştiriyoruz. Protein nicelendirilmiş özelliklerini tespit etmek için bir yöntem geliştirdik ve bu, protein varyantlarına karşı dayanıklıdır.

Ekibimiz, makine öğrenimi modellerini optimal bir şekilde ayarlamak ve kullanmak için bilim insanlarına bir Seer ML çerçevesi sunuyor. Bu, AutoML aracı temel alınarak geliştirilen bir çerçeve ve bilim insanlarına makine öğrenimi modellerini verimli bir şekilde ayarlamalarına yardımcı oluyor.

Large Language Models’de (LLM) hayal gücü veya yanlış bilgi üretme sorunu nasıl önlenir veya azaltılır?

LLM’ler, büyük bir korpusa dayalı olarak eğitilen ve benzer metinler üreten yöntemlerdir. LLM’ler, metinlerin istatistiksel özelliklerini yakalar, ancak esas olarak doğru olmak için eğitilmezler. İnsan geri bildirimi ile takviye öğrenimi ve diğer teknikler, LLM’lerin doğru ve istenen özellikleri kazanmasına yardımcı olur, ancak tamamen başarılı değildir. Bir LLM, bir soruya verilen cevabı, eğitim verisinin istatistiksel özelliklerine göre üretir. Örneğin, “Alexander the Great doğduğunda” sorusuna verilen cevap, genellikle 356 BC (veya BCE) olur, çünkü bu değer eğitim verisinde sıkça görülür. Ancak, “Empress Reginella doğduğunda” gibi bir soru sorulduğunda, LLM, hayal gücü veya yanlış bilgi üretebilir.

Halüsinasyonları tamamen önlemek için henüz mükemmel bir çözüm yok. LLM’lerin tasarımının bir parçası olarak ortaya çıkarlar. Kısmi bir çözüm, LLM’lere uygun bir şekilde soru sormaktır, örneğin “dikkatlice, adım adım düşünün” gibi. Bu, LLM’nin hayal gücü veya yanlış bilgi üretme olasılığını azaltabilir. Daha gelişmiş bir yaklaşım, bilgi grafiklerinin kullanılmasıdır. Bilgi grafikleri, önceden tanımlanmış bir mantıkla birbirine bağlı olan varlıkları temsil eder. Bir domaine özgü bilgi grafiği oluşturmak, otomatik ve istatistiksel yöntemler ile birlikte insan müdahalesi gerektirir. Bir LLM, bilgi grafiği ile birlikte çalışabilir ve ürettiği ifadeleri, bilinen gerçeklerle karşılaştırabilir ve doğrulayabilir.

LLM’ler, bilgi toplamak, bağlantılı bilgiler sunmak ve özetlemek için güçlü araçlardır, ancak ciddi uygulamalar için, özellikle tıp veya hukuk gibi alanlarda, hala insan uzmanlığına ihtiyaç duyulur. LLM’ler, uzmanların verimliliğini ve kapasitesini artırabilir, ancak onların yerini alamaz.

Veri odaklı bir gelecekte, biyoloji nasıl yönlendirilir?

Geleneksel hipotez-odaklı yaklaşım, araştırmacıların kalıplar bulması, hipotezler geliştirmesi, deneyler veya çalışmalar yapması ve sonra teorileri revize etmesi şeklinde işler. Yeni bir paradigma, büyük ölçekli veri üretimi ile başlıyor. Sonra, bir makine öğrenimi modeli, occluded veri yeniden inşa etme, güçlü regresyon veya sınıflandırma performansı gibi görevler için eğitiliyor. Model, verileri doğru bir şekilde yeniden ürettiğinde, araştırmacılar, modeli sorgulayarak biyolojik sistem hakkında bilgi edinebilir ve altta yatan biyolojik prensipleri ortaya çıkarabilir.

LLM’ler, biyomoleküler verilerin modellemesi için özellikle iyi sonuçlar veriyor ve biyolojik keşifte bir değişimin önünü açıyor. Bu değişim, önümüzdeki 10 yıl içinde daha da belirgin hale gelecek ve biyomoleküler sistemlerin insan kapasitesinin ötesinde bir ayrıntı düzeyinde modellenmesine olanak tanıyacak.

Hastalık tanısında ve ilaç keşfinde bu yaklaşımın potansiyel etkisi nedir?

LLM ve üretken AI, yaşam bilimleri endüstrisinde önemli değişikliklere yol açacak. Klinik tanı, özellikle nadir ve zor teşhis edilebilen hastalıklar ve kanser alt tipleri için büyük bir fayda sağlayacak. Hastaların genomik profilleri, tedavi cevapları, tıbbi kayıtları ve aile öyküleri gibi kapsamlı bilgiler, doğru ve zamanında tanı için kullanılabilir. Bu bilgiler, makine öğrenimi modelleri tarafından işlenerek, doktorların daha iyi bilgilendirilmiş değerlendirmeler yapmasına ve hastalara daha doğru tanılar koymasına yardımcı olabilir.

İlaç keşfi ve geliştirme, geleneksel paradigmanın dışında, makine öğrenimi ve büyük veri analizini kullanarak, daha hızlı ve daha ucuz bir şekilde gerçekleştirilebilir. LLM’ler, büyük ölçekli biyomoleküler verilerin modellemesi için güçlü bir araç sunar ve ilaç hedeflerinin belirlenmesinde, proteinlerin aktivite ceplerinin ve modülasyon yollarının tanımlanmasında yardımcı olabilir.

İleriye dönük olarak, LLM’lerin, genomik, proteomik, fonksiyonel genomik ve epigenomik veriler gibi farklı veri türleri arasında bağlantı kurabileceğini ve büyük kohortlardaki bireylerin genomik, proteomik ve sağlık bilgilerini birleştirebileceğini öngörüyoruz. Bu, ilaç keşfi ve geliştirme için yeni fırsatlar sunacak ve sağlık hizmetlerinin daha kişiselleştirilmesi ve daha etkili hale getirilmesine yardımcı olacaktır.

Detaylı röportaj için teşekkür ederiz. Daha fazla bilgi öğrenmek isteyen okuyucular, Seer‘i ziyaret edebilir.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.