Mô hình và nền tảng AI

Các nhà nghiên cứu AI phát triển mạng nơ-ron giải thích được để khám phá các quy tắc bộ gen

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm các nhà nghiên cứu gần đây đã tạo ra một mạng nơ-ron giải thích được nhằm giúp các nhà sinh học khám phá các quy tắc bí ẩn điều khiển mã di truyền của bộ gen người. Nhóm nghiên cứu đã đào tạo một mạng nơ-ron trên các bản đồ tương tác protein-DNA, cho phép AI khám phá cách các trình tự DNA nhất định điều chỉnh các gen nhất định. Các nhà nghiên cứu cũng làm cho mô hình trở nên giải thích được, để họ có thể phân tích kết luận của mô hình và xác định cách các motif trình tự điều chỉnh gen.

Một trong những bí ẩn lớn trong sinh học là mã điều khiển của bộ gen. Người ta biết rằng DNA bao gồm bốn bazơ nitơ – Adenine, Guanine, Thymine và Cytosine – nhưng không biết cách các cặp bazơ này được sử dụng để điều chỉnh hoạt động. Bốn bazơ nitơ mã hóa các hướng dẫn để xây dựng protein, nhưng chúng cũng kiểm soát nơi và cách gen được biểu hiện, (như thế nào chúng tạo ra protein trong một sinh vật). Các kết hợp và sắp xếp đặc biệt của các bazơ tạo ra các đoạn mã điều khiển ràng buộc với các đoạn DNA, và không biết chính xác những kết hợp này là gì.

Một nhóm nghiên cứu liên ngành gồm các nhà khoa học máy tính và sinh học đã cố gắng giải quyết bí ẩn này bằng cách tạo ra một mạng nơ-ron giải thích được. Nhóm nghiên cứu đã tạo ra một mạng nơ-ron mà họ gọi là “Mạng cặp bazơ” hoặc “BPNet”. Mô hình được sử dụng bởi BPNet để tạo ra dự đoán có thể được giải thích để xác định mã điều khiển. Điều này được thực hiện bằng cách dự đoán cách các protein gọi là yếu tố phiên mã liên kết với các trình tự DNA.

Các nhà nghiên cứu đã thực hiện một loạt các thí nghiệm và mô hình hóa máy tính toàn diện để xác định cách các yếu tố phiên mã và DNA được liên kết, tạo ra một bản đồ chi tiết xuống đến mức độ của từng bazơ nitơ riêng lẻ. Các biểu diễn chi tiết của yếu tố phiên mã-DNA cho phép các nhà nghiên cứu tạo ra các công cụ có khả năng giải thích cả các mẫu trình tự DNA quan trọng và các quy tắc hoạt động như mã điều khiển.

Julia Zeitlinger, tiến sĩ sinh học và nhà nghiên cứu tính toán tại Đại học Stanford, giải thích rằng kết quả thu được từ mạng nơ-ron giải thích được phù hợp với kết quả thực nghiệm hiện có, nhưng chúng cũng chứa những thông tin bất ngờ về mã điều khiển của bộ gen. Ví dụ, mô hình AI cho phép nhóm nghiên cứu khám phá một quy tắc ảnh hưởng đến cách một yếu tố phiên mã gọi là Nanog hoạt động. Khi nhiều bản sao của motif Nanog có mặt trên cùng một bên của một chuỗi DNA kép, chúng liên kết hợp tác với DNA. Như Zeitlinger giải thích qua ScienceDaily:

“Đã có một loạt bằng chứng thực nghiệm cho thấy sự tồn tại của sự tuần hoàn motif trong mã điều khiển. Tuy nhiên, các tình huống chính xác vẫn còn khó hiểu, và Nanog chưa bao giờ là một nghi phạm. Khám phá ra rằng Nanog có một mẫu như vậy, và thấy thêm các chi tiết về tương tác của nó, là điều bất ngờ vì chúng tôi không tìm kiếm mẫu này một cách cụ thể.”

Bài nghiên cứu gần đây không phải là nghiên cứu đầu tiên sử dụng AI để phân tích DNA, nhưng nó có thể là nghiên cứu đầu tiên mở “hộp đen” của AI để xác định các trình tự DNA điều chỉnh gen trong bộ gen. Các mạng nơ-ron giỏi trong việc tìm kiếm mẫu trong dữ liệu, nhưng những thông tin này khó có thể trích xuất từ các mô hình mà chúng tạo ra. Bằng cách tạo ra một phương pháp phân tích các tính năng mà mô hình coi là quan trọng để dự đoán các quy tắc bộ gen, các nhà nghiên cứu có thể đào tạo các mô hình tinh vi hơn dẫn đến những khám phá mới.

Cấu trúc của BPNet tương tự như các mạng được sử dụng để nhận dạng khuôn mặt trong hình ảnh. Khi các hệ thống tầm nhìn máy tính nhận dạng khuôn mặt trong hình ảnh, mạng bắt đầu bằng việc phát hiện các cạnh và sau đó kết hợp các cạnh này lại với nhau. Sự khác biệt là BPNet học hỏi từ các trình tự DNA, phát hiện các motif trình tự và kết hợp các motif này lại với nhau thành các quy tắc cấp cao hơn có thể được sử dụng để dự đoán sự liên kết của dữ liệu ở độ phân giải cơ bản.

Sau khi mô hình đạt đến ngưỡng độ chính xác cao, các mẫu được học bởi mô hình được theo dõi lại đến các trình tự đầu vào ban đầu, tiết lộ các motif trình tự. Cuối cùng, mô hình được cung cấp các truy vấn trình tự DNA có hệ thống, cho phép các nhà nghiên cứu hiểu các quy tắc mà các motif trình tự kết hợp và hoạt động. Theo Zeitlinger, mô hình có khả năng dự đoán nhiều trình tự hơn những gì các nhà nghiên cứu có thể hy vọng kiểm tra trong một cách thức truyền thống, thực nghiệm. Ngoài ra, dự đoán kết quả của các dị thường thực nghiệm cho phép các nhà nghiên cứu xác định哪 các thí nghiệm nào mang lại thông tin nhất khi xác thực mô hình.

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.