Mô hình và nền tảng AI
Peter Staar, Nhà khoa học IBM, Bộ dữ liệu nghiên cứu mở COVID-19 – Loạt phỏng vấn

Nhà khoa học IBM Peter Staar đã phát triển một công cụ AI đang được sử dụng bởi hơn 300 chuyên gia đang phát triển một phương pháp điều trị hoặc vắc-xin cho COVID-19.
Để giúp các nhà nghiên cứu truy cập dữ liệu có cấu trúc và không có cấu trúc nhanh chóng, IBM đang cung cấp một tài nguyên nghiên cứu AI dựa trên đám mây đã được đào tạo trên một tập hợp gồm hơn 45.000 bài báo khoa học trong Bộ dữ liệu nghiên cứu mở COVID-19 (CORD-19), được chuẩn bị bởi Nhà Trắng và một liên minh của các nhóm nghiên cứu, và các cơ sở dữ liệu được cấp phép từ DrugBank, Clinicaltrials.gov và GenBank.
Dr. Peter Staar đã gia nhập Phòng thí nghiệm Nghiên cứu IBM – Zurich vào tháng 7 năm 2015 với tư cách là nghiên cứu sinh sau tiến sĩ trong dự án Foundations of Cognitive Solutions. Nhà khoa học người Bỉ này lần đầu tiên đến với IBM Research với tư cách là sinh viên mùa hè vào năm 2006.
Bạn đã gia nhập Phòng thí nghiệm Nghiên cứu IBM – Zurich vào tháng 7 năm 2015. Bạn đã làm việc trên những dự án nào tại IBM?
Nghiên cứu ban đầu của tôi tập trung vào các ứng dụng cho tính toán hiệu suất cao và là một phần của đội chiến thắng giải thưởng ACM Gordon Bell.
Gần đây hơn, vào khoảng năm 2017, tôi bắt đầu tập trung vào AI và vào tháng 8 năm 2018, nhóm của tôi đã xuất bản một bài báo tại Hội nghị ACM về Khám phá và Khai thác Dữ liệu (KDD 2018) về một hệ thống nhập liệu tài liệu có khả năng mở rộng lớn, mà chúng tôi gọi là Dịch vụ Chuyển đổi Corpus. Công cụ AI dựa trên đám mây này có thể nhập 100.000 trang PDF mỗi ngày (ngay cả các tài liệu được quét) với độ chính xác trên 97 phần trăm – và sau đó đào tạo và áp dụng các mô hình học máy tiên tiến để trích xuất nội dung từ các tài liệu này với quy mô chưa từng đạt được trước đây. Chúng tôi hiện đang áp dụng cùng công nghệ này để giúp các nhà nghiên cứu về COVID-19.
Khi nào IBM lần đầu tiên đưa ra ý tưởng sử dụng Dịch vụ Chuyển đổi Corpus để đối phó với dịch COVID-19?
Vào giữa tháng 3, Nhà Trắng đã dẫn đầu một nỗ lực để xuất bản hơn 45.000 tài liệu về coronavirus và COVID-19. Khi chúng tôi nhìn thấy tập hợp dữ liệu này, chúng tôi nhanh chóng nhận ra rằng công nghệ của chúng tôi có thể giúp đỡ, không chỉ để làm cho các tệp PDF có thể tìm kiếm, mà còn để kết hợp kiến thức trong những tệp PDF này với các tập dữ liệu bổ sung như Drugbank, GenBank và Clinicaltrials.gov. Chúng tôi đã đưa dịch vụ này lên mạng vào ngày 3 tháng 4.
Bạn có thể mô tả Dịch vụ Chuyển đổi Corpus là gì?
Giống như bất kỳ tập hợp lớn nào của các nguồn dữ liệu khác nhau, việc tổng hợp và phân tích dữ liệu này theo cách có thể tạo ra kiến thức khoa học là rất khó khăn. Chúng tôi làm cho việc này trở nên dễ dàng hơn bằng cách sử dụng một đồ thị kiến thức tìm kiếm các kết nối giữa các nguồn dữ liệu này để có thể tạo ra kiến thức mới.
Bạn có thể thảo luận về thách thức chính khi trích xuất dữ liệu từ định dạng PDF sang dạng có thể tìm kiếm?
Theo Adobe (ADBE ), hiện có khoảng 2,5 nghìn tỷ tệp Portable Document Format (PDF) đang lưu hành. Hãy nghĩ về kiến thức mà những tệp này chứa: bài báo khoa học, văn học kỹ thuật và nhiều hơn nữa. Nhưng tất cả nội dung này đều “bị che khuất” hoặc không được sử dụng, vì cho đến nay, chúng tôi không có cách nào để nhập một số lượng lớn tệp PDF với quy mô lớn và làm cho nội dung của chúng trở nên hữu ích (hoặc có cấu trúc).
Các tệp PDF thường bao gồm sự kết hợp của đồ họa vector, văn bản và đồ họa bitmap, tất cả đều khiến việc trích xuất dữ liệu định lượng và định tính trở nên rất thách thức. Trên thực tế, việc chuyển đổi tự động việc tái tạo nội dung đã là một vấn đề trong hơn một thập kỷ. Mặc dù nhiều giải pháp chuyển đổi tài liệu có sẵn, nhưng không có giải pháp nào giải quyết được khả năng mở rộng hoặc áp dụng AI, điều này có nghĩa là chúng cần dựa vào việc bảo trì và nâng cấp của con người tốn kém.
Theo kiến thức của chúng tôi, Dịch vụ Chuyển đổi Corpus là hệ thống toàn diện đầu tiên sử dụng AI tiên tiến ở mức độ khả năng mở rộng này. Trong khi các giải pháp hiện có chỉ có thể chuyển đổi một tài liệu tại một thời điểm sang định dạng đầu ra mong muốn, thì công cụ của chúng tôi có thể nhập toàn bộ bộ sưu tập, một tập hợp tài liệu, và xây dựng các mô hình học máy trên đó.
Bạn có thể thảo luận về cách bạn không chỉ trích xuất văn bản chứa trong một tài liệu mà còn trích xuất cấu trúc?
Một yếu tố quan trọng là chúng tôi đã thiết kế sự tương tác giữa người và máy tính trong hệ thống này để cho phép sự chú thích nhanh chóng và lớn mà không cần kiến thức về khoa học máy tính. Sự chuyển đổi này sang học máy mang lại cho dịch vụ của chúng tôi sự linh hoạt rất lớn, vì nó có thể thích nghi nhanh chóng với các mẫu tài liệu nhất định, đạt được kết quả chính xác cao và cuối cùng loại bỏ việc điều chỉnh tốn kém và tốn thời gian điển hình của các thuật toán dựa trên quy tắc truyền thống.
Bạn có thể thảo luận về thách thức của việc xây dựng một mô hình học máy có thể mở rộng và phản hồi nhanh với hàng trăm, thậm chí hàng nghìn người dùng đồng thời?
Chúng tôi đã phát triển Dịch vụ Chuyển đổi Corpus trên các dịch vụ đám mây hiện đại, chẳng hạn như OpenShift trên IBM Cloud. Điều này cho phép chúng tôi mở rộng ứng dụng của mình một cách dễ dàng với nhu cầu tăng lên. Các mô hình AI mà chúng tôi áp dụng có thể được sử dụng bởi nhiều người dùng đồng thời.
Bạn đã nhập bao nhiêu tài liệu vào dịch vụ?
Chúng tôi có một số khách hàng công nghiệp sử dụng công cụ, vì vậy chúng tôi không biết họ đã nhập bao nhiêu tài liệu vì mỗi khách hàng có thể có một phiên bản riêng của Dịch vụ Chuyển đổi Corpus trên IBM Cloud. Nhưng đối với COVID-19, chúng tôi đã nhập tất cả 45.826 bài báo từ Nhà Trắng.
Cộng đồng nghiên cứu đã phản ứng như thế nào khi sử dụng công cụ AI này?
Kể từ khi chúng tôi宣 bố tính khả dụng miễn phí của công cụ này vài tuần trước, chúng tôi đã có hơn 400 người dùng từ hơn một tá quốc gia, hầu hết trong số họ là bác sĩ và giáo sư y khoa.
Có điều gì khác mà bạn muốn chia sẻ về Dịch vụ Chuyển đổi Corpus và/hoặc cách nó được sử dụng trong bối cảnh COVID-19?
Một trong những khách hàng của chúng tôi là công ty năng lượng Ý Eni, đang sử dụng công nghệ của chúng tôi để khám phá hydrocarbon, đây là một doanh nghiệp phức tạp và đòi hỏi kiến thức chuyên sâu liên quan đến nhiều kỷ luật kỹ thuật và khoa học làm việc cùng nhau.
Tại Eni, kiến thức dựa trên việc xử lý lượng lớn dữ liệu địa chất, vật lý và địa hóa, sau đó được xử lý thành một đồ thị kiến thức. Các nhà địa chất có thể sử dụng AI để đặt câu hỏi và trình bày thông tin liên quan, điều này sẽ giúp họ cải thiện việc ra quyết định và xác định các kịch bản khám phá thay thế. Cụ thể hơn, đối với Eni, điều này có nghĩa là một mô hình địa chất thực tế và chính xác hơn.
Cảm ơn bạn vì cuộc phỏng vấn rất quan trọng này, điều này sẽ giúp các nhà nghiên cứu tiết kiệm rất nhiều thời gian. Những người đọc muốn tìm hiểu thêm về công nghệ nên truy cập trang web của Dịch vụ Chuyển đổi Corpus. Các nhà nghiên cứu nên truy cập trang công cụ AI COVID-19. Xin lưu ý, quyền truy cập vào tài nguyên này sẽ chỉ được cấp cho các nhà nghiên cứu đủ tiêu chuẩn.












