Mô hình và nền tảng AI
Stefano Pacifico và David Heeger, Đồng sáng lập Epistemic AI – Loạt phỏng vấn

Epistemic AI sử dụng các công nghệ Xử lý Ngôn ngữ Tự nhiên (NLP), học máy và học sâu tiên tiến để ánh xạ mối quan hệ giữa một lượng kiến thức sinh học y tế ngày càng lớn, từ nhiều nguồn công khai và riêng tư, bao gồm tài liệu văn bản và cơ sở dữ liệu. Thông qua quá trình Ánh xạ Kiến thức, người dùng tương tác với nền tảng để ánh xạ và hiểu các tập con của kiến thức sinh học y tế, điều này tiết lộ các khái niệm và mối quan hệ mà nếu không sẽ bị bỏ lỡ với tìm kiếm truyền thống.
Chúng tôi đã phỏng vấn cả hai Đồng sáng lập của Epistemic AI để thảo luận về những tiến bộ mới nhất.
Stefano Pacifico có hơn 10 năm kinh nghiệm trong lĩnh vực phát triển AI và NLP ứng dụng. Trước đây ông từng làm việc tại Bloomberg, nơi ông đã dành 7 năm và sau đó là tại Elemental Cognition trước khi thành lập Epistemic.
David Heeger là Giáo sư bạc về khoa học dữ liệu và khoa học thần kinh tại NYU, và đã dành sự nghiệp của mình để kết nối khoa học máy tính, AI và khoa học sinh học. Ông là thành viên của Viện Hàn lâm Khoa học Quốc gia. Với tư cách là người sáng lập, họ kết hợp chuyên môn xây dựng các hệ thống AI và NLP ứng dụng lớn để hiểu các tập hợp kiến thức lớn với chuyên môn về sinh học tính toán và khoa học sinh học y tế từ nhiều năm nghiên cứu trong lĩnh vực này.
Điều gì đã giới thiệu và thu hút bạn đến với AI và Xử lý Ngôn ngữ Tự nhiên (NLP)?
Stefano Pacifico: Khi tôi còn ở trường đại học tại Rome, và AI không phổ biến chút nào (thực tế nó rất ngoài lề), tôi đã hỏi người cố vấn của tôi tại thời điểm đó nên chuyên về lĩnh vực nào trong số các lựa chọn có sẵn. Ông ấy nói: “Nếu bạn muốn kiếm tiền, thì hãy chọn Kỹ thuật Phần mềm và Cơ sở Dữ liệu, nhưng nếu bạn muốn trở nên kỳ lạ nhưng rất tiên tiến, thì hãy chọn Trí tuệ Nhân tạo”. Tôi đã bị thu hút bởi từ “kỳ lạ”. Sau đó, tôi bắt đầu làm việc về đại diện kiến thức và suy luận để nghiên cứu cách các tác nhân tự động có thể chơi bóng đá hoặc cứu người. Sau đó, hai nhận thức đã khiến tôi yêu thích NLP: đầu tiên, các tác nhân tự động có thể phải giao tiếp với ngôn ngữ tự nhiên với nhau! Thứ hai, xây dựng cơ sở kiến thức chính thức bằng tay là khó, trong khi ngôn ngữ tự nhiên (trong văn bản) đã cung cấp cơ sở kiến thức lớn nhất của tất cả. Tôi biết ngày nay những quan sát này có thể xem là hiển nhiên, nhưng chúng không phổ biến trước đây.
Điều gì đã truyền cảm hứng cho việc ra mắt Epistemic AI?
Stefano Pacifico: Tôi sẽ đưa ra một tuyên bố táo bạo. Không ai ngày nay có công cụ phù hợp để hiểu và kết nối kiến thức có trong các tập hợp tài liệu và dữ liệu lớn, không ngừng tăng trưởng. Tôi đã từng làm việc về vấn đề đó trong thế giới tài chính. Hãy nghĩ về tin tức, báo cáo tài chính, dữ liệu giá, hành động của công ty, hồ sơ etc. Tôi thấy rằng vấn đề đó rất hấp dẫn. Và当然, đó là một vấn đề khó khăn; và một vấn đề quan trọng! Khi tôi gặp người đồng sáng lập của mình, Tiến sĩ David Heeger, chúng tôi đã dành khá nhiều thời gian để đánh giá các cơ hội khởi nghiệp trong ngành công nghiệp sinh học y tế. Khi chúng tôi nhận ra khối lượng thông tin khổng lồ được tạo ra trong lĩnh vực này, nó giống như mọi thứ đã rơi vào đúng vị trí. Các nhà nghiên cứu sinh học y tế phải vật lộn với tình trạng quá tải thông tin, đồng thời cố gắng đối phó với cơ sở kiến thức sinh học y tế rộng lớn và đang mở rộng nhanh chóng, bao gồm tài liệu (ví dụ: bài báo, bằng sáng chế, thử nghiệm lâm sàng) và cơ sở dữ liệu (ví dụ: gen, protein, con đường, thuốc, bệnh, thuật ngữ y tế). Đây là một điểm đau lớn cho các nhà nghiên cứu và, không có giải pháp phù hợp nào có sẵn, họ bị buộc phải sử dụng các công cụ tìm kiếm cơ bản (PubMed và Google (GOOGL ) Scholar) và khám phá các cơ sở dữ liệu được biên tập thủ công. Những công cụ này phù hợp để tìm tài liệu khớp với từ khóa (ví dụ: một gen hoặc một bài báo đã xuất bản), nhưng không để có được kiến thức toàn diện về một lĩnh vực hoặc phân ngành (ví dụ: COVID-19), hoặc để giải thích kết quả của các thí nghiệm sinh học với hiệu suất cao, chẳng hạn như trình tự gen, biểu hiện protein hoặc sàng lọc các hợp chất hóa học. Chúng tôi đã bắt đầu Epistemic AI với ý tưởng giải quyết vấn đề này bằng một nền tảng cho phép họ tương tác để:
- Ngắn thời gian thu thập thông tin và xây dựng bản đồ kiến thức toàn diện
- Phát hiện thông tin liên ngành mà nếu không sẽ khó tìm (các khám phá thực sự thường đến từ việc nhìn vào khoảng trống giữa các ngành);
- Xác định các giả thuyết nguyên nhân bằng cách tìm đường dẫn và liên kết bị thiếu trong bản đồ kiến thức của bạn.
Một số nguồn công khai và riêng tư được sử dụng để ánh xạ các mối quan hệ này là gì?
Stefano Pacifico: Hiện tại, chúng tôi đang tiêu thụ tất cả các nguồn công khai có sẵn mà chúng tôi có thể tiếp cận, bao gồm Pubmed và clinicaltrials.gov. Chúng tôi tiêu thụ các cơ sở dữ liệu về gen, thuốc, bệnh và tương tác của chúng. Chúng tôi cũng bao gồm các nguồn dữ liệu riêng tư cho các khách hàng được chọn, nhưng chúng tôi không được phép tiết lộ bất kỳ chi tiết nào tại thời điểm này.
Loại công nghệ học máy nào được sử dụng cho việc ánh xạ kiến thức?
Stefano Pacifico: Một trong những niềm tin sâu sắc tại Epistemic AI là rằng sự cuồng tín không giúp ích cho việc xây dựng sản phẩm. Việc xây dựng một kiến trúc tích hợp nhiều kỹ thuật học máy là một quyết định được đưa ra từ sớm, và những kỹ thuật đó bao gồm từ Đại diện Kiến thức đến Mô hình Transformer, thông qua việc nhúng đồ thị, nhưng cũng bao gồm các mô hình đơn giản hơn như hồi quy và rừng ngẫu nhiên. Mỗi thành phần đơn giản như nó cần, nhưng không đơn giản hơn. Mặc dù chúng tôi tin rằng đã xây dựng các thành phần NLP thuộc hàng đầu tiên cho một số nhiệm vụ, chúng tôi không ngần ngại sử dụng các mô hình cơ bản hơn khi có thể.
Có thể nêu một số công ty, tổ chức phi lợi nhuận hoặc cơ sở giáo dục đang sử dụng nền tảng Epistemic?
Stefano Pacifico: Mặc dù tôi rất muốn, nhưng chúng tôi chưa thống nhất với người dùng của mình để làm như vậy. Tôi có thể nói rằng chúng tôi đã có người đăng ký từ các tổ chức có uy tín cao trong cả ba phân khúc (công ty, tổ chức phi lợi nhuận và cơ sở giáo dục). Ngoài ra, chúng tôi dự định sẽ giữ nền tảng miễn phí cho mục đích học thuật / phi lợi nhuận.
Epistemic hỗ trợ các nhà nghiên cứu trong việc xác định các dấu ấn sinh học cụ thể cho hệ thống thần kinh trung ương (CNS) và các bệnh khác như thế nào?
Dr. David Heeger: Khoa học thần kinh là một lĩnh vực rất đa ngành, bao gồm sinh học phân tử và tế bào, di truyền học, nhưng cũng bao gồm tâm lý học, hóa học và các nguyên tắc vật lý, kỹ thuật và toán học. Nó rộng lớn đến mức không ai có thể là chuyên gia về tất cả. Các nhà nghiên cứu tại các tổ chức học thuật và công ty dược phẩm / công nghệ sinh học bị buộc phải chuyên môn hóa. Nhưng chúng tôi biết rằng những hiểu biết quan trọng là liên ngành, kết hợp kiến thức từ các chuyên ngành con. Nền tảng phần mềm được hỗ trợ bởi AI mà chúng tôi đang xây dựng cho phép mọi người trở nên liên ngành hơn, để thấy các kết nối giữa lĩnh vực chuyên môn của họ và các chủ đề khác, và để xác định các giả thuyết mới. Điều này đặc biệt quan trọng trong khoa học thần kinh vì nó là một lĩnh vực liên ngành đến mức khó tin. Chức năng và rối loạn chức năng của não bộ con người là vấn đề khó khăn nhất mà khoa học đã từng đối mặt. Chúng tôi đang trên một sứ mệnh để thay đổi cách các nhà khoa học sinh học y tế làm việc và thậm chí cách họ suy nghĩ.
Epistemic cũng cho phép khám phá các cơ chế di truyền của các rối loạn CNS. Bạn có thể giải thích cách nó hoạt động không?
Dr. David Heeger: Hầu hết các bệnh thần kinh, rối loạn tâm thần và rối loạn phát triển không có một lời giải thích đơn giản về sự khác biệt di truyền. Có một số ít hội chứng mà một đột biến cụ thể được biết là gây ra hội chứng. Nhưng đó không phải là trường hợp điển hình. Có hàng trăm sự khác biệt di truyền, ví dụ, đã được liên kết với các rối loạn phổ tự kỷ (ASD). Có một số hiểu biết về một số gen này về các chức năng mà chúng phục vụ trong sinh học cơ bản. Ví dụ, một số gen liên quan đến ASD giữ các synap cùng nhau trong não (lưu ý, tuy nhiên, rằng cùng một gen thường thực hiện các chức năng khác trong các hệ thống cơ thể khác). Nhưng có rất ít hiểu biết về cách những khác biệt di truyền này có thể giải thích bộ các khác biệt hành vi phức tạp được thể hiện bởi các cá nhân với ASD. Để làm cho vấn đề trở nên tồi tệ hơn, hai cá nhân có cùng một khác biệt di truyền có thể có kết quả hoàn toàn khác nhau, một được chẩn đoán ASD và người kia thì không. Và hai cá nhân có hồ sơ di truyền hoàn toàn khác nhau có thể có cùng một kết quả với các khiếm khuyết hành vi rất tương tự. Để hiểu tất cả điều này đòi hỏi phải kết nối từ di truyền học và sinh học phân tử đến khoa học thần kinh tế bào (các khác biệt di truyền gây ra cho các neuron riêng lẻ hoạt động khác như thế nào) và sau đó đến khoa học thần kinh hệ thống (các khác biệt trong chức năng tế bào gây ra cho các mạng lưới lớn các neuron liên kết hoạt động khác như thế nào) và sau đó đến tâm lý học (các khác biệt trong chức năng mạng lưới thần kinh gây ra các khác biệt trong nhận thức, cảm xúc và hành vi như thế nào). Và tất cả điều này cần được hiểu từ một góc độ phát triển. Một khác biệt di truyền có thể gây ra một khiếm khuyết trong một khía cạnh nhất định của chức năng thần kinh. Nhưng não không chỉ ngồi đó và chấp nhận nó. Não bộ rất thích nghi. Nếu có một cơ chế bị thiếu hoặc bị hỏng thì não sẽ phát triển khác để bù đắp càng nhiều càng tốt. Sự bù đắp này có thể là phân tử, ví dụ, tăng cường một thụ thể synap khác để thay thế chức năng của một thụ thể synap bị hỏng. Hoặc sự bù đắp có thể là hành vi. Kết quả cuối cùng phụ thuộc không chỉ vào sự khác biệt di truyền ban đầu mà còn vào các nỗ lực bù đắp dựa trên các cơ chế phân tử, tế bào, mạch, hệ thống và hành vi khác nhau.
Không ai có kiến thức để hiểu tất cả điều này. Chúng tôi đều cần sự giúp đỡ. Nền tảng phần mềm được hỗ trợ bởi AI mà chúng tôi đang xây dựng cho phép mọi người thu thập và liên kết tất cả kiến thức sinh học y tế có liên quan, để thấy các kết nối và xác định các giả thuyết mới.
Làm thế nào các công ty dược phẩm và các tổ chức học thuật đang sử dụng Epistemic để đối phó với thách thức COVID-19?
Stefano Pacifico: Chúng tôi đã phát hành một phiên bản công khai của nền tảng của mình, bao gồm các tập dữ liệu cụ thể về COVID và có sẵn miễn phí cho bất kỳ ai nghiên cứu về COVID-19. Nó có sẵn tại https://covid.epistemic.ai
Epistemic đã được sử dụng cho các bệnh hoặc vấn đề di truyền khác nào?
Stefano Pacifico: Chúng tôi đã hợp tác với các nhà nghiên cứu về tự kỷ và gần đây nhất đang xây dựng một nỗ lực nghiên cứu mới cho bệnh xơ nang. Nhưng chúng tôi sẵn sàng hợp tác với bất kỳ nhà nghiên cứu hoặc tổ chức nào có thể cần giúp đỡ với nghiên cứu của họ.
Có điều gì khác mà bạn muốn chia sẻ về Epistemic?
Stefano Pacifico: Chúng tôi đang xây dựng một phong trào của những người muốn thay đổi cách các nhà nghiên cứu sinh học y tế làm việc và suy nghĩ. Chúng tôi thực sự hy vọng rằng nhiều độc giả của bạn sẽ muốn tham gia cùng chúng tôi!
Cảm ơn cả hai đã dành thời gian để trả lời các câu hỏi của chúng tôi. Độc giả muốn tìm hiểu thêm nên truy cập Epistemic AI.












