Моделі та платформи ШІ
Відкритий набір даних про COVID-19 випущений для машинного навчання
Офіс науки і технологій Білого дому запитує дослідників проаналізувати тисячі наукових статей з використанням штучного інтелекту (ШІ). Всі статті, яких близько 29 000, можуть дати відповіді на питання про коронавірус. Близько 13 000 статей у базі даних представлені повністю і можуть бути прочитані машиною. Що стосується інших 16 000 статей, база даних містить частковий текст і резюме.
За останні кілька днів офіційні особи уряду США працювали з американськими технологічними компаніями та дослідницькими інститутами, щоб отримати юридичний дозвіл на розміщення наукових статей про коронавірус.
Відкритий набір даних називається COVID-19 Open Research Dataset, або CORD-19. Він постійно додає нову інформацію до одного централізованого хабу, надаючи дослідникам і іншим можливість отримувати доступ до неї з одного місця.
Партнерство, оголошене Білим домом, включає в себе Chan Zuckerberg Initiative, Microsoft (MSFT ) Research, Allen Institute for Artificial Intelligence, Національну бібліотеку медицини Національного інституту охорони здоров’я, Центр безпеки та нових технологій Джорджтаунського університету, Cold Spring Harbor Laboratory і платформу Kaggle AI, яка належить Google.
За словами технічного директора США Майкла Кратсіоса, набір даних CORD-19 є “найбільш повною колекцією машиннозчитуваної літератури про коронавірус на сьогоднішній день”.
Національна академія наук, інженерії та медицини працювала з Всесвітньою організацією охорони здоров’я (ВООЗ), щоб розробити “високопріоритетні” питання. Ці питання стосуються взаємозв’язку між коронавірусом і генетикою, інкубацією, лікуванням, симптомами та профілактикою.
Деякі дослідження, присутні в базі даних, є доопублікаційними дослідженнями, взятими з таких джерел, як medRxiv і bioRxiv. Це відкриті архіви.
Корі Баргманн є головою наукового відділу Chan Zuckerberg Initiative.
“Поділ інформацією між науковими та медичними спільнотами є ключем до прискорення нашої здатності реагувати на пандемію коронавірусу”, – сказав Баргманн.
За даними звернення, випущеного Білим домом, колекція бази даних була розроблена за допомогою інструментів Microsoft для кураторства літератури у всьому світі, які ідентифікували та зібрали різні наукові роботи з усього світу. Chan Zuckerberg Initiative надала доступ до доопублікаційного контенту, Національна бібліотека медицини надала доступ до літературного контенту, а команда Allen AI сформатувала контент так, щоб його можна було проаналізувати.
Доктор Ерік Хорвіц є головним науковим співробітником Microsoft.
“Це всі руки на палубі, коли ми стикаємося з пандемією COVID-19”, – сказав Хорвіц. “Нам потрібно об’єднатися як компанії, уряди та науковці і працювати над тим, щоб我们的 найкращі технології були застосовані в біомедицині, епідеміології, штучному інтелекті та інших науках. Ресурс літератури про COVID-19 і виклик сприяють зусиллям, які можуть прискорити шлях до рішень щодо COVID-19”.
Багато людей сподіваються, що цей підхід буде успішним і надасть новий спосіб використання технологій штучного інтелекту та машинного навчання в майбутньому. Одним з цих людей є доктор Дьюї Мурдік, директор відділу даних науки Центру безпеки та нових технологій Джорджтаунського університету. Доктор Мурдік допоміг координувати проєкт.
“Цінний новий ресурс є плодом безкорисливого співробітництва і тепер надає можливість знайти відповіді на важливі питання про COVID-19”, – сказав доктор Мурдік. “Після того, як криза мине, ми сподіваємося, що цей проєкт надихне на нові способи використання машинного навчання для розвитку наукових досліджень”.
Якщо цей проєкт вдасться у доведенні необхідних відповідей про коронавірус, він міг би бути використаний як модель у майбутньому. Технологія штучного інтелекту є потужним інструментом, і вона може аналізувати результати експертів та інститутів усього світу значно швидше, ніж люди. Це означає швидшу реакцію на будь-яку пандемію або іншу кризу, що може врятувати багато життів і запобігти економічній турбулентності.












