Mô hình và nền tảng AI

Nhà nghiên cứu sử dụng thuật toán Xử lý Ngôn ngữ Tự nhiên để hiểu Chuyển đổi Protein

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu từ Đại học Maryland gần đây đã áp dụng các kỹ thuật xử lý ngôn ngữ tự nhiên và thuật toán học máy để có được cái nhìn sâu sắc về cách phân tử protein thay đổi từ một hình dạng này sang một hình dạng khác. Bài báo gần đây, được công bố trên tạp chí Nature Communications, là lần đầu tiên một thuật toán AI được sử dụng để nghiên cứu động lực học của hệ thống phân tử sinh học liên quan đến chuyển đổi protein.

Phân tử protein có thể có nhiều hình dạng khác nhau, nhưng các cơ chế khiến một protein thay đổi từ một hình dạng này sang một hình dạng khác vẫn còn khá bí ẩn. Chức năng của một phân tử protein được xác định bởi hình dạng của nó, và việc hiểu rõ hơn về các cơ chế ảnh hưởng đến hình dạng/cấu trúc của một protein có thể cho phép các nhà khoa học thiết kế các liệu pháp thuốc nhắm mục tiêu và xác định nguyên nhân của các bệnh.

Các phân tử sinh học không đứng yên, chúng liên tục di chuyển để đáp ứng với các sự kiện trong môi trường của chúng. Áp lực môi trường có thể khiến các phân tử thay đổi hình dạng, thường rất nhanh. Một phân tử có thể đột ngột thay đổi cấu trúc thành một hình dạng hoàn toàn khác, trong một quá trình rất giống với việc tháo xoắn của một lò xo. Các phần khác nhau của phân tử sẽ mở ra và gấp lại, và các nhà nghiên cứu đã nghiên cứu các giai đoạn trung gian giữa các hình dạng phân tử khác nhau.

Theo Phys.org, Pratyush Tiwary là tác giả chính của bài báo và là giáo sư trợ lý tại Khoa Hóa học và Sinh hóa của Maryland và Viện Khoa học Vật lý và Công nghệ. Theo Tiwary, xử lý ngôn ngữ tự nhiên có thể được sử dụng để mô hình hóa cách các phân tử chuyển đổi và thích nghi. Tiwary lưu ý rằng các phân tử có một “ngôn ngữ” nhất định mà chúng “nói”, với các chuyển động mà các phân tử thực hiện có thể được dịch thành một ngôn ngữ trừu tượng. Khi quá trình ánh xạ chuyển động phân tử sang mẫu ngôn ngữ được thực hiện, các kỹ thuật xử lý ngôn ngữ tự nhiên và thuật toán AI có thể được sử dụng để “tạo ra các câu chuyện sinh học chân thực từ các từ trừu tượng kết quả.”

Khi một phân tử chuyển đổi từ một hình dạng này sang một hình dạng khác, quá trình chuyển đổi xảy ra rất nhanh. Quá trình chuyển đổi có thể chỉ mất một phần nghìn tỷ giây. Tốc độ chuyển đổi nhanh như vậy khiến cho các nhà khoa học khó xác định được các tham số ảnh hưởng đến quá trình mở ra của protein bằng các phương pháp như quang phổ hoặc thậm chí là kính hiển vi công suất cao. Để xác định các tham số ảnh hưởng đến quá trình mở ra của protein, Tiwary và nhóm nghiên cứu đã tạo ra các mô hình vật lý mô phỏng protein. Các mô hình thống kê phức tạp được sử dụng để tạo ra các mô phỏng protein mô phỏng hình dạng, quỹ đạo và chuyển động của các phân tử. Các mô hình sau đó được đưa vào một thuật toán học máy dựa trên các phương pháp xử lý ngôn ngữ tự nhiên.

Các mô hình xử lý ngôn ngữ tự nhiên được sử dụng để đào tạo hệ thống học máy rất giống với các thuật toán được sử dụng trong các hệ thống văn bản dự đoán của Gmail. Các protein mô phỏng được xử lý như một ngôn ngữ nơi các chuyển động của phân tử được dịch thành “chữ cái”. Các chữ cái sau đó được liên kết với nhau để tạo thành từ và câu. Các thuật toán học máy có thể học các quy tắc ngữ pháp và cú pháp đằng sau cấu trúc protein, xác định các hình dạng/chuyển động nào theo sau các hình dạng/chuyển động khác. Các thuật toán sau đó có thể được sử dụng để dự đoán cách các protein nhất định sẽ mở ra và hình dạng nào chúng sẽ lấy.

Các nhà nghiên cứu đã sử dụng một mạng nhớ ngắn hạn dài (LSTM) để phân tích các câu protein. Nhóm nghiên cứu cũng theo dõi các toán học mà mạng dựa trên, theo dõi các tham số khi mạng học động lực học của chuyển đổi phân tử. Theo kết quả của nghiên cứu, mạng sử dụng logic tương tự như một khái niệm vật lý tĩnh gọi là entropy đường. Nếu phát hiện này được giữ nguyên, nó có thể dẫn đến cải tiến trong các mạng LSTM. Tiwary giải thích rằng việc phát hiện này giúp làm sáng tỏ một số bản chất “hộp đen” của LSTM, cho phép các nhà nghiên cứu hiểu rõ hơn về các tham số có thể được điều chỉnh cho hiệu suất tối ưu.

Để kiểm tra thuật toán của họ, các nhà nghiên cứu đã phân tích một phân tử sinh học gọi là riboswitch. Riboswitch đã được phân tích trước đó bằng quang phổ, và khi riboswitch được phân tích bằng hệ thống học máy, các hình dạng riboswitch dự đoán khớp với những gì được phát hiện bằng quang phổ.

Tiwary hy vọng rằng những phát hiện của họ sẽ cho phép các nhà nghiên cứu phát triển các loại thuốc nhắm mục tiêu có ít tác dụng phụ hơn. Như Tiwary giải thích qua Phys.org:

“Bạn muốn có các loại thuốc mạnh mẽ gắn kết rất mạnh, nhưng chỉ với thứ mà bạn muốn chúng gắn kết. Chúng ta có thể đạt được điều đó nếu chúng ta có thể hiểu các hình dạng khác nhau mà một phân tử sinh học nhất định có thể lấy, vì chúng ta có thể tạo ra các loại thuốc gắn kết chỉ với một trong những hình dạng cụ thể đó tại thời điểm phù hợp và chỉ trong thời gian chúng ta muốn.”

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.