Lãnh đạo tư tưởng

Vấn Đề Dữ Liệu Tại Trái Tim Của Khám Phá Thuốc Bằng Trí Tuệ Nhân Tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khi trí tuệ nhân tạo đang nhanh chóng được tích hợp vào khám phá thuốc, có lẽ câu hỏi quan trọng nhất không phải là làm thế nào để mô hình tiếp theo trở nên mạnh mẽ hơn, mà là những dữ liệu mà các mô hình đó thực sự học được.

Sự mở rộng gần đây của Anthropic vào phát triển thuốc là dấu hiệu mới nhất rằng trí tuệ nhân tạo đang vượt ra ngoài lý luận chung và vào khoa học ứng dụng. Nó phản ánh động lực thực sự trong lĩnh vực này và sự tự tin ngày càng tăng rằng trí tuệ nhân tạo có thể thay đổi đáng kể cách thức phát hiện ra các loại thuốc mới. Nhưng nếu mục tiêu là cải thiện tỷ lệ thành công lâm sàng – không chỉ tăng tốc độ phát hiện – chúng ta nên đặt câu hỏi liệu dữ liệu sinh học dướipinning những hệ thống này có khả năng dạy cho chúng biết sinh học của con người thực sự trông như thế nào.

Trong nhiều năm, ngành công nghiệp đã tập trung vào xây dựng các thuật toán ngày càng phức tạp. Các mô hình lớn hơn, nhiều tính toán hơn và kiến trúc tốt hơn đã thúc đẩy những tiến bộ đáng kể trong dự đoán cấu trúc protein, xác định mục tiêu, thiết kế phân tử và các lĩnh vực nghiên cứu sinh học y học khác. Những đổi mới đó xứng đáng nhận được sự chú ý mà chúng đã nhận được.

Điều đã nhận được ít sự chú ý hơn là nền tảng sinh học bên dưới chúng.

Trí tuệ nhân tạo đặc biệt giỏi trong việc tìm kiếm các mẫu. Nhưng nó không thể phân biệt giữa sinh học chỉ có thể đo lường được và sinh học thực sự dự đoán được những gì xảy ra ở bệnh nhân. Trần cho khám phá thuốc bằng trí tuệ nhân tạo cuối cùng sẽ được xác định không chỉ bởi trí thông minh của các mô hình, mà còn bởi độ trung thực của dữ liệu sinh học của con người được sử dụng để đào tạo, xác thực và đánh giá chúng. Nếu chúng ta muốn trí tuệ nhân tạo mang lại những loại thuốc tốt hơn chứ không chỉ là những giả thuyết nhanh hơn, việc xây dựng cơ sở hạ tầng dữ liệu sinh học của con người chất lượng cao có thể chứng minh là quan trọng không kém so với việc xây dựng thế hệ tiếp theo của trí tuệ nhân tạo.

Trí Tuệ Nhân Tạo Chỉ Có Thể Học Từ Sinh Học Mà Chúng Ta Cung Cấp

Mỗi mô hình trí tuệ nhân tạo đều bị giới hạn bởi thông tin mà nó học được. Phát triển thuốc đưa ra một thách thức đặc biệt khó khăn vì sinh học cực kỳ phức tạp. Bệnh của con người bị ảnh hưởng bởi di truyền, tuổi tác, giới tính, bệnh đồng thời, phản ứng miễn dịch, phơi nhiễm môi trường và hàng nghìn con đường phân tử tương tác vẫn chỉ được hiểu một phần.

Lịch sử, phần lớn dữ liệu thực nghiệm được sử dụng trong toàn bộ quá trình phát triển thuốc đã xuất phát từ các nghiên cứu trên động vật, dòng tế bào bất tử, hệ thống in vitro đơn giản và mô phỏng tính toán. Những công cụ này đã thúc đẩy khoa học sinh học y học đáng kể và vẫn không thể thiếu trong nhiều giai đoạn nghiên cứu. Tuy nhiên, nhiều thập kỷ kinh nghiệm cũng đã chứng minh rằng chúng không thể hoàn toàn tái tạo sinh lý của con người.

Khoảng 90% ứng viên thuốc tham gia vào các thử nghiệm lâm sàng cuối cùng đã thất bại, với việc thiếu hiệu quả và phát hiện an toàn không mong muốn là những yếu tố đóng góp chính. Mặc dù nhiều yếu tố góp phần vào những thất bại này, nhưng một chủ đề lặp đi lặp lại là các mô hình tiền lâm sàng thường khó dự đoán được những gì thực sự xảy ra ở bệnh nhân.

Nếu các hệ thống trí tuệ nhân tạo được đào tạo chủ yếu trên dữ liệu được tạo ra từ các mô hình mà bản thân chúng có những hạn chế dịch thuật đã biết, thì không có gì ngạc nhiên khi những hạn chế đó vẫn tồn tại. Trí tuệ nhân tạo có thể nhận ra các mẫu một cách đáng kinh ngạc, nhưng nó không thể tạo ra sự thật sinh học mà không bao giờ có trong dữ liệu đào tạo của nó.

Nhiều Dữ Liệu Không Necessarily Là Dữ Liệu Tốt Hơn

Cộng đồng trí tuệ nhân tạo thường nói về các luật quy mô: quan sát rằng các tập dữ liệu lớn thường cải thiện hiệu suất của mô hình. Trong sinh học, tuy nhiên, số lượng và chất lượng không thể hoán đổi cho nhau. Hàng triệu điểm dữ liệu được thu thập từ các hệ thống thí nghiệm phản ánh kém sinh lý của con người có thể cung cấp ít giá trị dự đoán hơn so với các tập dữ liệu nhỏ hơn được tạo trực tiếp từ sinh học lâm sàng của con người. Sự khác biệt này trở nên đặc biệt quan trọng trong phát triển thuốc, nơi mục tiêu không chỉ là dự đoán mà còn là dự đoán chuyển thành kết quả bệnh nhân thành công.

Dữ liệu sinh học của con người có độ trung thực cao khác với các tập dữ liệu phòng thí nghiệm truyền thống ở một số cách quan trọng. Nó nắm bắt chức năng sinh học chứ không phải ảnh chụp tĩnh. Nó bảo tồn mối quan hệ giữa các mô, kiến trúc tế bào, tưới máu, chuyển hóa và dược lý. Nó kết hợp lịch sử bệnh nhân, đặc điểm lâm sàng, đo lường phân tử và phản ứng chức năng trong cùng một hệ thống sinh học. Điều quan trọng nhất, nó đo lường sinh học thực sự tồn tại ở người.

Khi trí tuệ nhân tạo trở nên ngày càng có khả năng trích xuất các mẫu tinh vi từ dữ liệu phức tạp, chất lượng của những mẫu đó trở nên không thể tách rời với chất lượng của sinh học cơ bản.

Ưu Thế Cạnh Tranh Tiếp Theo Có Thể Là Cơ Sở Hạ Tầng Dữ Liệu Sinh Học Của Con Người

Trong những năm qua, đầu tư khổng lồ đã được đổ vào các mô hình nền tảng, cơ sở hạ tầng tính toán và kiến trúc trí tuệ nhân tạo chuyên dụng. Ít chú ý hơn đã được trả cho cơ sở hạ tầng cần thiết để tạo ra dữ liệu sinh học của con người chất lượng cao một cách hệ thống ở quy mô lớn.

Các mẫu sinh học của con người vốn bị giới hạn và đòi hỏi phải tích hợp với một số hình thức cơ sở hạ tầng quyên góp. Tiêu chuẩn hóa vẫn còn đầy thách thức. Các giao thức thí nghiệm phải có khả năng tái tạo. Dữ liệu siêu dữ liệu phải được toàn diện. Các phép đo đa omics, hình ảnh, xét nghiệm chức năng và bối cảnh lâm sàng đều cần được tích hợp vào các tập dữ liệu đủ nhất quán cho việc học máy tính.

Không có gì giống như kỹ thuật phần mềm truyền thống. Thay vào đó, nó đòi hỏi các hoạt động sinh học được phối hợp có khả năng sản xuất các tập dữ liệu có thể tái tạo, sẵn sàng cho quy định trong nhiều năm. Giống như cơ sở hạ tầng đám mây đã trở nên thiết yếu cho phát triển phần mềm hiện đại, cơ sở hạ tầng sinh học của con người có thể trở thành nền tảng cho thế hệ tiếp theo của thuốc điều trị bằng trí tuệ nhân tạo. Các tổ chức đầu tư vào cơ sở hạ tầng đó ngày nay cuối cùng có thể định hình những gì mà các mô hình trí tuệ nhân tạo của ngày mai có thể học được.

Các Nhà Quy Định Đang Di Chuyển Theo Hướng Này

Quan trọng, cuộc thảo luận này vượt ra ngoài sự tò mò của học thuật. Các nhà quy định bản thân đang ngày càng nhấn mạnh bằng chứng liên quan đến con người. FDA đã mở rộng sự hỗ trợ của mình cho các Phương Pháp Tiếp Cận Mới (NAMs), phác thảo các con đường mà các mô hình tính toán, công nghệ chip trên chip, hệ thống in vitro tiên tiến và các phương pháp liên quan đến con người khác có thể đóng góp vào việc ra quyết định của quy định.

Sự thay đổi này nhận ra một thực tế quan trọng. Khi các phương pháp tính toán trở nên tinh vi hơn, sự tin cậy vào các dự đoán của chúng phụ thuộc vào sự tin cậy vào bằng chứng sinh học hỗ trợ chúng. Nếu trí tuệ nhân tạo tốt hơn đòi hỏi phải xác thực tốt hơn, và xác thực tốt hơn đòi hỏi dữ liệu sinh học của con người tốt hơn, thì trí tuệ nhân tạo tốt hơn phải đòi hỏi dữ liệu sinh học của con người tốt hơn nằm ở nguồn của mỗi mô hình.

Thập Kỷ Tiếp Theo Sẽ Được Định Hình Bởi Chất Lượng Dữ Liệu

Ngành công nghiệp dược phẩm đã trải qua nhiều cuộc cách mạng công nghệ từ sàng lọc cao đến dãy trình tự thế hệ tiếp theo. Mỗi lần mở rộng thể tích dữ liệu có sẵn, nhưng việc áp dụng trí tuệ nhân tạo trong lĩnh vực này đại diện cho điều gì đó khác biệt.

Thành công của nó phụ thuộc không chỉ vào việc sản xuất nhiều dữ liệu hơn mà còn vào việc sản xuất dữ liệu phản ánh trung thực sinh học của con người. Khi các mô hình nền tảng trở nên dễ tiếp cận hơn, lợi thế thuật toán đơn thuần có thể trở nên kém bền vững hơn. Truy cập vào dữ liệu sinh học của con người chất lượng cao, phân biệt, có thể xuất hiện như một trong những lợi thế cạnh tranh định nghĩa trên toàn hệ sinh thái dược phẩm. Điều này đặc biệt đúng nếu mục tiêu cuối cùng của ngành là cải thiện tỷ lệ thành công lâm sàng chứ không chỉ là tăng tốc độ phát hiện.

Sự tham gia của Anthropic vào phát triển thuốc phản ánh tiến bộ đáng kể mà trí tuệ nhân tạo đã đạt được trong những năm qua. Nó cũng nhấn mạnh câu hỏi tiếp theo mà ngành phải trả lời. Nếu trí tuệ nhân tạo thực sự có tiềm năng chuyển đổi y học, nền tảng sinh học nào mà những mô hình đó sẽ dựa vào?

Tương lai của khám phá thuốc bằng trí tuệ nhân tạo chắc chắn sẽ phụ thuộc vào các thuật toán tốt hơn. Nhưng nó có thể phụ thuộc nhiều hơn vào việc xây dựng cơ sở hạ tầng dữ liệu sinh học của con người có khả năng dạy cho các thuật toán biết sinh học của con người thực sự trông như thế nào.

Tiến sĩ Jenna DiRito là Đồng sáng lập và Giám đốc Điều hành của Revalia Bio. Công việc của cô tập trung vào xây dựng cơ sở hạ tầng dữ liệu sinh học của con người để hỗ trợ phát triển thuốc bằng trí tuệ nhân tạo, khoa học chuyển đổi và áp dụng các mô hình dựa trên con người cho nghiên cứu.