Mô hình và nền tảng AI
Bộ Dữ Liệu Mở Về Covid-19 Được Phát Hành Cho Học Máy
Văn phòng Chính sách Khoa học và Công nghệ của Nhà Trắng đang yêu cầu các nhà nghiên cứu phân tích hàng nghìn bài viết học thuật bằng công nghệ trí tuệ nhân tạo (AI). Tất cả các bài viết, với khoảng 29.000 bài, có thể cung cấp câu trả lời cho các câu hỏi về coronavirus. Khoảng 13.000 bài viết trong cơ sở dữ liệu là toàn bộ và có thể đọc được bằng máy. Đối với 16.000 bài viết còn lại, cơ sở dữ liệu có văn bản và tóm tắt một phần.
Trong những ngày qua, các quan chức chính phủ Hoa Kỳ đã làm việc với các công ty công nghệ và tổ chức nghiên cứu của Mỹ để bảo đảm sự cho phép pháp lý để làm cho các bài viết về coronavirus có sẵn.
Bộ dữ liệu mở này được gọi là Bộ Dữ Liệu Nghiên Cứu Mở Covid-19, hoặc CORD-19. Nó sẽ liên tục thêm thông tin mới vào một trung tâm tập trung, cung cấp cho các nhà nghiên cứu và những người khác một nơi duy nhất để truy cập.
Quan hệ đối tác được Nhà Trắng công bố bao gồm Sáng kiến Chan Zuckerberg, Nghiên cứu Microsoft (MSFT ), Viện Trí tuệ Nhân tạo Allen, Thư viện Y khoa Quốc gia của Viện Y tế Quốc gia, Trung tâm An ninh và Công nghệ Nổi bật của Đại học Georgetown, Phòng thí nghiệm Cold Spring Harbor và nền tảng AI Kaggle, thuộc sở hữu của Google.
Theo CTO Michael Kratsios của Hoa Kỳ, bộ dữ liệu CORD-19 là “tập hợp lớn nhất về văn học coronavirus có thể đọc được bằng máy tính cho đến nay.”
Học viện Khoa học, Kỹ thuật và Y học Quốc gia đã làm việc với Tổ chức Y tế Thế giới (WHO) để phát triển các câu hỏi “ưu tiên cao”. Những câu hỏi này xoay quanh mối quan hệ giữa coronavirus và di truyền, ủ bệnh, điều trị, triệu chứng và phòng ngừa.
Một số nghiên cứu hiện có trong cơ sở dữ liệu là nghiên cứu trước khi xuất bản được lấy từ các nguồn như medRxiv và bioRxiv. Đây là các kho lưu trữ truy cập mở.
Cori Bargmann là Người đứng đầu Khoa học của Sáng kiến Chan Zuckerberg.
“Chia sẻ thông tin quan trọng qua các cộng đồng khoa học và y tế là chìa khóa để tăng tốc khả năng phản ứng với đại dịch coronavirus,” Bargmann nói.
Theo Lời kêu gọi Hành động được Nhà Trắng phát hành, bộ sưu tập cơ sở dữ liệu được phát triển thông qua việc sử dụng các công cụ kiểm duyệt văn học trên web của Microsoft, đã xác định và đưa cùng nhau các công việc khoa học khác nhau từ khắp thế giới. Sáng kiến Chan Zuckerberg đã cung cấp quyền truy cập vào nội dung trước khi xuất bản, Thư viện Y khoa Quốc gia đã cung cấp quyền truy cập vào nội dung văn học và nhóm Allen AI đã định dạng nội dung để nó có thể được phân tích.
Tiến sĩ Eric Horvitz là Giám đốc Khoa học tại Microsoft.
“Đây là tất cả các tay trong khi chúng ta đối mặt với đại dịch Covid-19,” Horvitz nói. “Chúng ta cần phải đoàn kết như các công ty, chính phủ và nhà khoa học và làm việc để đưa công nghệ tốt nhất của chúng ta vào các lĩnh vực sinh học, dịch tễ học, AI và các khoa học khác. Tài nguyên văn học Covid-19 và thách thức sẽ kích thích các nỗ lực có thể đẩy nhanh con đường đến các giải pháp về Covid-19.”
Nhiều người hy vọng rằng cách tiếp cận này sẽ hoạt động và cung cấp một cách mới để sử dụng công nghệ AI và học máy trong tương lai. Một trong những người đó là Tiến sĩ Dewey Murdick, Giám đốc Khoa học Dữ liệu tại Trung tâm An ninh và Công nghệ Nổi bật của Đại học Georgetown. Tiến sĩ Murdick đã giúp phối hợp dự án.
“Tài nguyên quý giá này là kết quả của sự hợp tác vô tư và bây giờ cung cấp cơ hội để tìm câu trả lời cho các câu hỏi quan trọng về Covid-19,” Tiến sĩ Murdick nói. “Khi cuộc khủng hoảng đã qua, chúng tôi hy vọng dự án này sẽ truyền cảm hứng cho các cách mới để sử dụng học máy để thúc đẩy nghiên cứu khoa học.”
Nếu dự án này thành công trong việc cung cấp câu trả lời cần thiết về coronavirus, nó có thể được sử dụng như một mô hình trong tương lai. Công nghệ AI là một công cụ mạnh mẽ, và nó có thể phân tích kết quả của các chuyên gia và tổ chức trên toàn cầu nhanh hơn con người. Điều này có nghĩa là thời gian phản ứng nhanh hơn mỗi khi một đại dịch hoặc khủng hoảng khác xảy ra, điều này có thể cứu nhiều mạng sống và ngăn chặn sự hỗn loạn kinh tế.












