Mô hình và nền tảng AI

PSBench tại Đại học Missouri: Lớp tin cậy mới cho khám phá protein được thúc đẩy bởi AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trí tuệ nhân tạo đã giải quyết một trong những bí ẩn khó nhằn nhất của sinh học: cách các protein gấp thành hình dạng không gian ba chiều phức tạp. Nhưng khi lĩnh vực này chuyển từ dự đoán sang ứng dụng, một câu hỏi mới trở nên cấp thiết hơn bao giờ hết:

Khi nào chúng ta có thể tin tưởng vào mô hình?

Các nhà nghiên cứu tại Đại học Missouri tin rằng họ đã thực hiện một bước tiến quan trọng để trả lời câu hỏi đó. Đại học đã công bố việc phát hành PSBench, một tập dữ liệu chuẩn mực lớn mới chứa 1,4 triệu mô hình cấu trúc protein với đánh giá chất lượng được chú thích. Dưới sự dẫn dắt của Jianlin ‘Jack’ Cheng, một giáo sư danh dự của Curators trong lĩnh vực Tin sinh học, dự án này được thiết kế không để tạo ra cấu trúc mới mà để đánh giá chúng.

Sự khác biệt đó có thể chứng minh là quan trọng cho tương lai của y học được thúc đẩy bởi AI.

Ách tắc mới trong Protein AI

Vấn đề gấp protein đã không được giải quyết trong hơn nửa thế kỷ. Điều đó đã thay đổi đáng kể khi AlphaFold từ Google DeepMind đã chứng minh độ chính xác gần như thực nghiệm trong việc dự đoán nhiều cấu trúc protein. Phát hiện này đã mang tính cách mạng đến mức dự đoán cấu trúc protein được thúc đẩy bởi AI đã được công nhận với một phần của Giải Nobel Hóa học năm 2024.

Kể từ đó, các hệ thống dự đoán đã mở rộng từ protein đơn lẻ đến phức hợp, giao diện và tương tác sinh học phân tử. Cơ sở dữ liệu AlphaFold Protein Structure hiện chứa hàng trăm triệu cấu trúc dự đoán, biến thứ gì từng khan hiếm thành thứ gì gần như dồi dào.

Nhưng sự dồi dào này lại đưa đến một thách thức mới.

Một mô hình protein dự đoán có thể trông rất thuyết phục, thậm chí là tinh tế. Tuy nhiên, những sai sót tinh vi – đặc biệt là tại các giao diện liên kết hoặc vùng linh hoạt – có thể tạo ra sự khác biệt giữa một mục tiêu thuốc khả thi và một kết thúc tốn kém. Các chỉ số tự tin nội bộ như pLDDT và sai số dự đoán được sắp xếp cung cấp hướng dẫn hữu ích, nhưng chúng vẫn là tín hiệu được tạo ra từ mô hình. Chúng ước tính sự không chắc chắn từ bên trong.

PSBench tiếp cận vấn đề từ bên ngoài.

Điều gì làm cho PSBench khác biệt

Thay vì xây dựng một động cơ dự đoán khác, PSBench hoạt động như một nền tảng đánh giá lớn. Cơ sở dữ liệu này tổng hợp 1,4 triệu mô hình cấu trúc được rút ra từ các nỗ lực của cộng đồng như Đánh giá quan trọng về dự đoán cấu trúc protein (CASP), tiêu chuẩn vàng lâu dài cho các thí nghiệm mô hình hóa protein mù. Những mô hình này được ghép nối với nhãn chính xác cho phép các nhà nghiên cứu đào tạo và kiểm tra các hệ thống AI độc lập có khả năng ước tính độ tin cậy cấu trúc.

Nói cách khác, PSBench cho phép các mô hình AI đánh giá các mô hình AI khác.

Khả năng này đang trở nên ngày càng quan trọng khi lĩnh vực này chuyển từ việc hỏi “Chúng ta có thể dự đoán cấu trúc không?” sang hỏi “Cấu trúc này có đáng tin cậy để hướng dẫn các thí nghiệm không?”

Đội ngũ của Cheng có gốc rễ sâu trong sự tiến hóa này. Vào năm 2012, trong một cuộc thi CASP trước đó, nhóm của ông là một trong những nhóm đầu tiên chứng minh rằng học sâu có thể cải thiện đáng kể việc mô hình hóa cấu trúc protein. Hơn một thập kỷ sau, PSBench phản ánh giai đoạn tiếp theo của hành trình đó: tinh chỉnh cách các dự đoán được đánh giá, không chỉ được tạo ra.

Công việc này đã được trình bày gần đây tại NeurIPS 2025, nhấn mạnh sự gắn kết chặt chẽ giữa nghiên cứu học máy và sinh học cấu trúc.

AlphaFold vào năm 2026: Từ gấp đến tương tác

Trong khi đó, hệ sinh thái rộng lớn hơn tiếp tục phát triển. Thế hệ AlphaFold mới nhất mở rộng từ gấp các chuỗi protein riêng lẻ đến mô hình hóa tương tác giữa protein, DNA, RNA và phân tử nhỏ. Các cơ sở dữ liệu đã phát triển đến quy mô chưa từng có, và các đóng góp của cộng đồng đang tăng tốc độ bao phủ trên các proteome vi khuẩn, virus và người.

Khi các công cụ này trưởng thành, các nhà nghiên cứu ngày càng coi các cấu trúc dự đoán như điểm khởi đầu cho việc tạo ra giả thuyết. Xác nhận thực nghiệm vẫn rất quan trọng, nhưng AI hiện đặt chương trình cho những gì được kiểm tra đầu tiên.

Đó chính xác là lý do tại sao đánh giá chất lượng lại quan trọng đến vậy.

Nếu các hệ thống AI dự đoán đang tạo ra nhiều giả thuyết cấu trúc hơn những gì các phòng thí nghiệm có thể xác nhận, thì khả năng phân loại các giả thuyết đó – chính xác và khách quan – trở thành cơ sở hạ tầng cơ bản.

Hậu quả đối với khám phá thuốc

Protein là động cơ chức năng của sinh học. Hình dạng không gian ba chiều của chúng quyết định cách chúng tương tác, tín hiệu và điều chỉnh các quá trình của cuộc sống. Khi cấu trúc được hiểu lầm, đặc biệt là trong các ngữ cảnh điều trị, hậu quả có thể lan truyền qua nhiều năm phát triển.

Bằng cách cải thiện đào tạo và chuẩn mực hóa các hệ thống đánh giá chất lượng mô hình, PSBench có thể giúp giảm sự tự tin sai lầm trong các dự đoán bị lỗi. Đánh giá cấu trúc đáng tin cậy hơn có nghĩa là ưu tiên mục tiêu tốt hơn, sử dụng hiệu quả hơn các nguồn lực phòng thí nghiệm và có thể dẫn đến con đường nhanh hơn đến các phương pháp điều trị cho các bệnh phức tạp như Alzheimer và ung thư.

Quan trọng là, PSBench không thay thế các công cụ dự đoán như AlphaFold. Thay vào đó, nó bổ sung cho chúng – thêm một lớp tin cậy vào một hệ sinh thái đang mở rộng nhanh chóng về sức mạnh và quy mô.

Sự trỗi dậy của Lớp tin cậy khoa học

Trí tuệ nhân tạo trong sinh học đã bước vào một giai đoạn mới. Giai đoạn đầu tiên là về việc giải quyết dự đoán. Giai đoạn thứ hai là về việc mở rộng khả năng tiếp cận. Giai đoạn mới nổi thứ ba là về xác nhận, chuẩn mực hóa và quản trị.

PSBench đại diện cho sự chuyển đổi đó.

Khi các hệ thống AI trở thành trung tâm của khám phá sinh học, khả năng đánh giá đầu ra của chúng với sự nghiêm ngặt sẽ quyết định mức độ tự tin mà các nhà nghiên cứu có thể xây dựng dựa trên chúng. Trong một lĩnh vực mà độ chính xác ở mức angstrom có thể ảnh hưởng đến quyết định trị giá tỷ đô la, sự tin cậy không phải là tùy chọn.

Nếu AlphaFold đã giúp mở khóa cấu trúc của sự sống ở quy mô lớn, PSBench có thể giúp đảm bảo rằng những gì chúng ta mở khóa là đủ vững chắc để đứng trên đó.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.