Phỏng vấn

Tiến sĩ Serafim Batzoglou, Chief Data Officer tại Seer – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Serafim Batzoglou là Chief Data Officer tại Seer. Trước khi gia nhập Seer, Serafim từng là Chief Data Officer tại Insitro, dẫn đầu về máy học và khoa học dữ liệu trong cách tiếp cận khám phá thuốc. Trước khi gia nhập Insitro, ông từng là VP của Applied và Computational Biology tại Illumina, dẫn đầu nghiên cứu và phát triển công nghệ về AI và phân tích sinh học phân tử để làm cho dữ liệu gen người trở nên dễ hiểu hơn trong lĩnh vực sức khỏe con người.

Điều gì ban đầu thu hút bạn đến lĩnh vực genomics?

Tôi trở nên quan tâm đến lĩnh vực sinh học tính toán tại thời điểm bắt đầu luận án tiến sĩ về khoa học máy tính tại MIT, khi tôi tham gia một lớp về chủ đề này do Bonnie Berger giảng dạy, người sau đó trở thành cố vấn luận án tiến sĩ của tôi, và David Gifford. Dự án bộ gen người đang dần phát triển trong thời gian tôi làm luận án tiến sĩ. Eric Lander, người đứng đầu Trung tâm Gen tại MIT, đã trở thành cố vấn luận án tiến sĩ thứ hai của tôi và đã tham gia tôi vào dự án. Được thúc đẩy bởi dự án bộ gen người, tôi đã làm việc về việc lắp ráp toàn bộ bộ gen và so sánh gen của người và chuột.

Sau đó, tôi chuyển đến Đại học Stanford với tư cách là giảng viên tại Khoa Khoa học Máy tính, nơi tôi đã dành 15 năm và may mắn được hướng dẫn khoảng 30 sinh viên tiến sĩ tài năng và nhiều nhà nghiên cứu sau tiến sĩ và sinh viên đại học. Nhóm của tôi tập trung vào việc ứng dụng các thuật toán, máy học và xây dựng công cụ phần mềm để phân tích dữ liệu sinh học và phân tử lớn. Tôi rời Stanford vào năm 2016 để lãnh đạo một nhóm nghiên cứu và phát triển công nghệ tại Illumina. Kể từ đó, tôi đã tận hưởng việc lãnh đạo các nhóm R&D trong ngành công nghiệp. Tôi nhận thấy rằng làm việc nhóm, khía cạnh kinh doanh và tác động trực tiếp đến xã hội là đặc trưng của ngành công nghiệp so với môi trường học thuật. Tôi đã làm việc tại các công ty đổi mới trong suốt sự nghiệp của mình: DNAnexus, mà tôi đồng sáng lập vào năm 2009, Illumina, Insitro và hiện tại là Seer. Máy tính và máy học là thiết yếu trên toàn bộ chuỗi công nghệ trong công nghệ sinh học, từ phát triển công nghệ đến thu thập dữ liệu, đến giải thích dữ liệu sinh học và dịch sang sức khỏe con người.

Trong 20 năm qua, việc giải mã bộ gen người đã trở nên rẻ hơn và nhanh hơn rất nhiều. Điều này đã dẫn đến sự tăng trưởng đáng kể trong thị trường giải mã bộ gen và áp dụng rộng rãi hơn trong ngành công nghiệp khoa học đời sống. Chúng ta hiện đang ở ngưỡng của việc có dữ liệu gen, đa dạng và đặc điểm của đủ quy mô để cách mạng hóa chăm sóc sức khỏe, bao gồm phòng ngừa, chẩn đoán, điều trị và khám phá thuốc. Chúng ta có thể ngày càng khám phá các cơ sở phân tử của bệnh tật ở các cá nhân thông qua phân tích tính toán dữ liệu gen, và bệnh nhân có cơ hội nhận được các phương pháp điều trị được cá nhân hóa và nhắm mục tiêu, đặc biệt là trong lĩnh vực ung thư và bệnh di truyền hiếm. Ngoài việc sử dụng rõ ràng trong y học, máy học kết hợp với thông tin gen cho phép chúng ta có được kiến thức về các lĩnh vực khác của cuộc sống, chẳng hạn như gia đình và dinh dưỡng. Những năm tới sẽ chứng kiến sự áp dụng chăm sóc sức khỏe được cá nhân hóa, dựa trên dữ liệu, trước hết là cho các nhóm người được chọn, chẳng hạn như bệnh nhân bệnh hiếm, và ngày càng nhiều cho công chúng rộng lớn.

Trước khi bạn đảm nhiệm vai trò hiện tại, bạn từng là Chief Data Officer tại Insitro, dẫn đầu về máy học và khoa học dữ liệu trong cách tiếp cận khám phá thuốc. Những kết luận chính nào bạn có được từ thời gian này về cách máy học có thể được sử dụng để tăng tốc khám phá thuốc?

Thương thức khám phá và phát triển thuốc truyền thống theo kiểu “thử và sai” đầy rẫy những bất hiệu quả và thời gian dài. Để một loại thuốc ra thị trường, nó có thể mất hơn 1 tỷ đô la và hơn một thập kỷ. Bằng cách kết hợp máy học vào những nỗ lực này, chúng ta có thể giảm đáng kể chi phí và thời gian trong một số bước trên đường đi. Một bước là xác định mục tiêu, nơi một gen hoặc tập hợp gen có thể điều chỉnh một kiểu hình bệnh hoặc phục hồi một trạng thái tế bào bệnh đến một trạng thái khỏe mạnh hơn có thể được xác định thông qua các can thiệp di truyền và hóa học lớn, cũng như các kết quả đọc kiểu hình như hình ảnh và genomics chức năng. Một bước khác là xác định và tối ưu hóa hợp chất, nơi một phân tử nhỏ hoặc phương thức khác có thể được thiết kế bởi dự đoán in silico dựa trên máy học cũng như sàng lọc in vitro, và hơn nữa, các thuộc tính mong muốn của một loại thuốc như khả năng hòa tan, thấm qua, đặc异 và không độc có thể được tối ưu hóa. Khía cạnh khó khăn nhất cũng như quan trọng nhất có lẽ là dịch sang người. Ở đây, việc chọn mô hình phù hợp – dòng tế bào đa năng cảm ứng so với dòng tế bào nguyên sinh, mẫu mô so với mô hình động vật – cho bệnh phù hợp đặt ra một tập hợp các sự đánh đổi cực kỳ quan trọng cuối cùng phản ánh khả năng của dữ liệu kết hợp với máy học để dịch sang bệnh nhân.

Seer Bio đang tiên phong trong các cách mới để giải mã bí mật của proteome để cải thiện sức khỏe con người, đối với những người đọc không quen thuộc với thuật ngữ này, proteome là gì?

Proteome là tập hợp các protein được sản xuất hoặc sửa đổi bởi một sinh vật theo thời gian và phản ứng với môi trường, dinh dưỡng và trạng thái sức khỏe. Proteomics là nghiên cứu về proteome trong một loại tế bào hoặc mẫu mô nhất định. Bộ gen của một người hoặc các sinh vật khác là tĩnh: với ngoại lệ quan trọng của đột biến soma, bộ gen khi sinh là bộ gen mà một người có suốt đời, được sao chép chính xác trong mỗi tế bào của cơ thể. Proteome là động và thay đổi trong khoảng thời gian nhiều năm, ngày và thậm chí phút. Như vậy, proteome gần gũi hơn với kiểu hình và cuối cùng là với trạng thái sức khỏe hơn là bộ gen, và do đó cung cấp nhiều thông tin hơn để theo dõi sức khỏe và hiểu bệnh.

Tại Seer, chúng tôi đã phát triển một cách mới để truy cập proteome cung cấp thông tin sâu hơn về protein và proteoform trong các mẫu phức tạp như huyết tương, đây là một mẫu dễ tiếp cận nhưng đáng tiếc là đến nay đã đặt ra một thách thức lớn cho proteomics phổ khối thông thường.

Seer’s Proteograph ™ nền tảng là gì và nó cung cấp một cái nhìn mới về proteome như thế nào?

Nền tảng Proteograph của Seer tận dụng một thư viện các hạt nano được thiết kế độc quyền, được hỗ trợ bởi một quy trình làm việc đơn giản, nhanh chóng và tự động, cho phép thẩm vấn sâu và có thể mở rộng về proteome.

Nền tảng Proteograph nổi bật trong việc thẩm vấn huyết tương và các mẫu phức tạp khác thể hiện phạm vi động lớn – nhiều bậc độ lớn khác biệt về sự phong phú của các protein trong mẫu – nơi các phương pháp phổ khối thông thường không thể phát hiện phần thấp phong phú của proteome. Các hạt nano của Seer được thiết kế với các tính chất vật lý hóa học có thể điều chỉnh để thu thập protein trên toàn bộ phạm vi động một cách không thiên vị. Trong các mẫu huyết tương điển hình, công nghệ của chúng tôi cho phép phát hiện 5x đến 8x nhiều protein hơn so với khi xử lý huyết tương không sử dụng Proteograph. Kết quả là, từ chuẩn bị mẫu đến thiết bị đến phân tích dữ liệu, Bộ sản phẩm Proteograph của chúng tôi giúp các nhà khoa học tìm thấy các chữ ký bệnh của proteome có thể không thể phát hiện được. Chúng tôi thích nói rằng tại Seer, chúng tôi đang mở ra một cánh cổng mới đến proteome.

Hơn nữa, chúng tôi đang cho phép các nhà khoa học dễ dàng thực hiện các nghiên cứu proteogenomic quy mô lớn. Proteogenomics là sự kết hợp của dữ liệu gen với dữ liệu proteomic để xác định và định lượng các biến thể protein, liên kết các biến thể gen với mức độ phong phú của protein, và cuối cùng liên kết bộ gen và proteome với kiểu hình và bệnh, và bắt đầu giải quyết các con đường di truyền gây bệnh và hạ lưu liên quan đến bệnh.

Bạn có thể thảo luận về một số công nghệ máy học đang được sử dụng tại Seer Bio không?

Seer đang tận dụng máy học ở tất cả các bước từ phát triển công nghệ đến phân tích dữ liệu hạ nguồn. Những bước này bao gồm: (1) thiết kế các hạt nano độc quyền của chúng tôi, nơi máy học giúp chúng tôi xác định các tính chất vật lý hóa học và sự kết hợp của các hạt nano sẽ hoạt động với các dòng sản phẩm và xét nghiệm cụ thể; (2) phát hiện và định lượng peptit, protein, biến thể và proteoform từ dữ liệu đầu ra được tạo ra từ các công cụ MS; (3) phân tích proteomic và proteogenomic hạ nguồn trong các quần thể lớn.

Năm ngoái, chúng tôi đã xuất bản một bài báo trên Advanced Materials kết hợp các phương pháp proteomic, kỹ thuật nano và máy học để cải thiện sự hiểu biết của chúng tôi về các cơ chế hình thành vương miện protein. Bài báo này đã khám phá ra các tương tác nano-sinh học và đang thông tin cho Seer trong việc tạo ra các hạt nano và sản phẩm cải tiến trong tương lai.

Beyond việc phát triển hạt nano, chúng tôi đã phát triển các thuật toán mới để xác định peptit biến thể và các sửa đổi sau dịch mã (PTMs). Chúng tôi gần đây đã phát triển một phương pháp để phát hiện các locus đặc điểm lượng protein được lượng hóa (pQTLs) có khả năng chống lại các biến thể protein, đây là một yếu tố gây nhiễu đã biết cho proteomic dựa trên sự亲 và. Chúng tôi đang mở rộng công việc này để xác định trực tiếp các peptit này từ các phổ thô bằng cách sử dụng các phương pháp giải trình tự de novo dựa trên học sâu để cho phép tìm kiếm mà không làm tăng kích thước của các thư viện phổ.

Đội ngũ của chúng tôi cũng đang phát triển các phương pháp để cho phép các nhà khoa học không có chuyên môn sâu về máy học tối ưu hóa và sử dụng các mô hình máy học trong công việc khám phá của họ. Điều này được thực hiện thông qua khuôn khổ Seer ML dựa trên công cụ AutoML, cho phép điều chỉnh siêu tham số hiệu quả thông qua tối ưu hóa Bayesian.

Cuối cùng, chúng tôi đang phát triển các phương pháp để giảm hiệu ứng批 và tăng độ chính xác định lượng của giá trị đọc mass spec bằng cách mô hình hóa các giá trị định lượng được đo để tối đa hóa các chỉ số dự kiến như hệ số tương quan của các giá trị cường độ trên các peptit trong một nhóm protein.

Ảo giác là một vấn đề phổ biến với LLMs, những giải pháp nào để ngăn chặn hoặc giảm thiểu điều này?

LLMs là các phương pháp tạo sinh được đào tạo trên một tập hợp lớn và được đào tạo để tạo ra văn bản tương tự. Chúng nắm bắt các thuộc tính thống kê cơ bản của văn bản được đào tạo, từ các thuộc tính cục bộ đơn giản như tần suất của các kết hợp từ (hoặc token) cùng nhau, đến các thuộc tính cấp cao hơn mô phỏng sự hiểu biết về ngữ cảnh và ý nghĩa.

Tuy nhiên, LLMs không được đào tạo chủ yếu để chính xác. Học tăng cường với phản hồi của con người (RLHF) và các kỹ thuật khác giúp đào tạo chúng cho các thuộc tính mong muốn, bao gồm cả độ chính xác, nhưng không hoàn toàn thành công. Cho một lời nhắc, LLMs sẽ tạo ra văn bản giống nhất với các thuộc tính thống kê của dữ liệu đào tạo. Thường thì văn bản này cũng chính xác. Ví dụ, nếu được hỏi “Alexander Đại đế sinh năm nào”, câu trả lời chính xác là 356 TCN (hoặc TCN), và một LLM có khả năng đưa ra câu trả lời đó vì trong dữ liệu đào tạo, ngày sinh của Alexander Đại đế xuất hiện thường xuyên với giá trị này. Tuy nhiên, khi được hỏi “Nữ hoàng Reginella sinh năm nào”, một nhân vật hư cấu không có trong tập dữ liệu, LLM có khả năng sẽ ảo giác và tạo ra một câu chuyện về ngày sinh của cô. Tương tự, khi được hỏi một câu hỏi mà LLM có thể không tìm được câu trả lời đúng (hoặc vì câu trả lời đúng không tồn tại, hoặc vì các lý do thống kê khác), nó có khả năng sẽ ảo giác và trả lời như thể nó biết. Điều này tạo ra các ảo giác mà là một vấn đề rõ ràng đối với các ứng dụng nghiêm túc, chẳng hạn như “cách điều trị ung thư như thế nào”.

Không có giải pháp hoàn hảo nào cho ảo giác. Chúng là đặc trưng của thiết kế LLM. Một giải pháp một phần là lời nhắc phù hợp, chẳng hạn như yêu cầu LLM “nghĩ cẩn thận, từng bước”, v.v. Điều này làm tăng khả năng LLM không tạo ra các câu chuyện. Một cách tiếp cận tinh vi hơn đang được phát triển là sử dụng các đồ thị kiến thức. Các đồ thị kiến thức cung cấp dữ liệu có cấu trúc: các thực thể trong đồ thị kiến thức được kết nối với các thực thể khác theo một cách logic đã định nghĩa trước. Xây dựng một đồ thị kiến thức cho một lĩnh vực nhất định là một nhiệm vụ đầy thách thức nhưng có thể thực hiện được với sự kết hợp của các phương pháp tự động và thống kê và kiểm duyệt. Với một đồ thị kiến thức tích hợp sẵn, LLMs có thể kiểm tra các câu lệnh chúng tạo ra chống lại tập hợp cấu trúc các sự kiện đã biết và có thể bị giới hạn để không tạo ra một câu lệnh mâu thuẫn hoặc không được hỗ trợ bởi đồ thị kiến thức.

Do vấn đề cơ bản của ảo giác, và có thể do thiếu khả năng lý luận và phán đoán đủ, LLMs hiện tại mạnh mẽ cho việc thu thập, kết nối và cô đọng thông tin, nhưng không thể thay thế các chuyên gia con người trong các ứng dụng nghiêm túc như chẩn đoán y tế hoặc tư vấn pháp lý. Tuy nhiên, chúng có thể tăng cường đáng kể hiệu quả và khả năng của các chuyên gia con người trong các lĩnh vực này.

Bạn có thể chia sẻ tầm nhìn của mình về một tương lai nơi sinh học được dẫn dắt bởi dữ liệu chứ không phải giả thuyết?

Cách tiếp cận truyền thống dựa trên giả thuyết, trong đó các nhà nghiên cứu tìm kiếm các mẫu, phát triển giả thuyết, thực hiện các thí nghiệm hoặc nghiên cứu để kiểm tra chúng, và sau đó tinh chỉnh các lý thuyết dựa trên dữ liệu, đang bị thay thế bởi một mô hình mới dựa trên mô hình hóa dữ liệu.

Trong mô hình mới này, các nhà nghiên cứu bắt đầu với việc tạo ra dữ liệu lớn, không dựa trên giả thuyết. Sau đó, họ đào tạo một mô hình máy học như LLM với mục tiêu là tái tạo chính xác dữ liệu bị che khuất, hiệu suất hồi quy hoặc phân loại mạnh trong một số nhiệm vụ hạ nguồn. Một khi mô hình máy học có thể dự đoán dữ liệu một cách chính xác và đạt được độ trung thực tương đương với sự tương đồng giữa các bản sao thí nghiệm, các nhà nghiên cứu có thể thẩm vấn mô hình để trích xuất thông tin về hệ thống sinh học và phân biệt các nguyên tắc sinh học cơ bản. LLMs đang chứng minh là đặc biệt tốt trong việc mô hình hóa dữ liệu sinh học phân tử và được thiết kế để thúc đẩy sự chuyển đổi từ khám phá sinh học dựa trên giả thuyết sang khám phá sinh học dựa trên dữ liệu. Sự chuyển đổi này sẽ trở nên ngày càng rõ ràng trong thập kỷ tới và cho phép mô hình hóa chính xác hệ thống sinh học phân tử ở mức độ chi tiết vượt quá khả năng của con người.

Ảnh hưởng tiềm năng đối với chẩn đoán bệnh và khám phá thuốc là gì?

Tôi tin rằng LLM và trí tuệ tạo sinh sẽ dẫn đến những thay đổi đáng kể trong ngành công nghiệp khoa học đời sống. Một lĩnh vực sẽ được hưởng lợi rất nhiều từ LLMs là chẩn đoán lâm sàng, đặc biệt là đối với các bệnh hiếm gặp, khó chẩn đoán và các loại ung thư. Có một lượng thông tin bệnh nhân toàn diện mà chúng ta có thể tận dụng – từ hồ sơ gen, phản ứng điều trị, hồ sơ y tế và lịch sử gia đình – để đưa ra chẩn đoán chính xác và kịp thời. Nếu chúng ta có thể tìm cách biên soạn tất cả những thông tin này để chúng dễ dàng truy cập và không bị cô lập bởi các tổ chức y tế riêng lẻ, chúng ta có thể cải thiện đáng kể độ chính xác của chẩn đoán. Điều này không có nghĩa là các mô hình máy học, bao gồm cả LLMs, sẽ có thể hoạt động tự chủ trong chẩn đoán. Do những hạn chế kỹ thuật của chúng, trong tương lai gần, chúng sẽ không tự chủ, mà thay vào đó, chúng sẽ hỗ trợ các chuyên gia con người. Chúng sẽ là những công cụ mạnh mẽ để giúp bác sĩ đưa ra các đánh giá và chẩn đoán thông tin tốt, trong một phần nhỏ của thời gian cần thiết cho đến ngày nay, và để ghi lại và truyền đạt chẩn đoán của họ đến bệnh nhân cũng như toàn bộ mạng lưới các nhà cung cấp dịch vụ chăm sóc sức khỏe được kết nối thông qua hệ thống máy học.

Những năm tới sẽ chứng kiến sự áp dụng chăm sóc sức khỏe được cá nhân hóa, dựa trên dữ liệu, trước hết là cho các nhóm người được chọn, chẳng hạn như bệnh nhân bệnh hiếm, và ngày càng nhiều cho công chúng rộng lớn.

Cảm ơn bạn vì cuộc phỏng vấn chi tiết, những người đọc muốn tìm hiểu thêm nên truy cập Seer.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.