Моделі та платформи ШІ

Петер Стаар, вчений IBM, відкритий дослідницький набір даних COVID-19 – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Вчений IBM Петер Стаар розробив інструмент штучного інтелекту, який використовується понад 300 експертами, які розробляють лікування або вакцину проти COVID-19.

Щоб допомогти дослідникам швидко отримувати структуровані та неструктуровані дані, IBM пропонує хмарний ресурс штучного інтелекту для досліджень, який був навчений на корпусі понад 45 000 наукових статей, що містяться в відкритому дослідницькому наборі даних COVID-19 (CORD-19), підготовленому Білим домом та коаліцією дослідницьких груп, а також ліцензованих баз даних з DrugBank, Clinicaltrials.gov та GenBank.

Доктор Петер Стаар приєднався до лабораторії IBM Research – Zurich у липні 2015 року як постдокторант у проєкті “Основи когнітивних рішень”. Вчений з Бельгії вперше прийшов до IBM Research як літній студент у 2006 році.

Ви вперше приєдналися до лабораторії IBM Research – Zurich у липні 2015 року. Над якими проєктами ви працювали в IBM?

Мої перші дослідження були зосереджені на застосуванні високопродуктивних обчислень і були частиною команди, яка виграла престижну премію ACM Gordon Bell.

Недавно, близько 2017 року, я почав зосереджуватися на штучному інтелекті, а у серпні 2018 року моя команда опублікувала статтю на конференції ACM з відкриття знань та даних (KDD 2018) про масштабований документо-орієнтований сервіс, який ми назвали Corpus Conversion Service. Цей інструмент штучного інтелекту на основі хмари міг обробляти 100 000 сторінок PDF за день (навіть сканованих документів) з точністю понад 97 відсотків, а потім навчати та застосовувати передові моделі машинного навчання, які витягують вміст з цих документів у масштабі, який раніше не був досягнутий. Тепер ми застосовуємо цю саму технологію, щоб допомогти дослідникам у боротьбі з COVID-19.

Коли IBM вперше прийшла ідея використовувати Corpus Conversion Service для боротьби з епідемією COVID-19?

У середині березня Білим домом була проведена робота з публікації понад 45 000 документів про коронавірус та COVID-19. Коли ми побачили корпус, ми швидко зрозуміли, що наша технологія могла б допомогти, не тільки зробити PDF-документи пошукабельними, але й об’єднати знання всередині цих документів з додатковими наборами даних, такими як Drugbank, GenBank та Clinicaltrials.gov. Ми запустили сервіс 3 квітня.

Як би ви описали Corpus Conversion Service?

Як і з будь-яким великим об’ємом розрізнених джерел даних, важко ефективно агрегувати та аналізувати ці дані способами, які можуть дати наукові знання. Ми полегшуємо це завдання за допомогою графа знань, який знаходить зв’язки між цими джерелами даних, щоб потенційно дати нове знання.

Чи можете ви обговорити основну проблему витягування даних з формату PDF у пошукабельну форму?

За даними Adobe (ADBE ), існує близько 2,5 трильйонів файлів у форматі PDF, які зараз перебувають в обігу. Подумайте про знання, які містяться в цих файлах: наукові статті, технічна література та багато іншого. Але все це вміст “темний” або невикористаний, оскільки раніше у нас не було способу обробляти велику кількість файлів PDF у масштабі та зробити їх вміст використовуваним (або структурованим).

Файли PDF часто містять комбінації векторної графіки, тексту та растрової графіки, всі з яких роблять витягування якісних та кількісних даних досить складним. Насправді, конвертація автоматичного відновлення вмісту була проблемою протягом понад десяти років. Хоча багато рішень з конвертації документів доступні, жодне з них не вирішує питання масштабованості або не застосовує штучний інтелект, що означає, що їм потрібно покладатися на дорогий людський підтримку та оновлення.

На нашу думку, Corpus Conversion Service є першою комплексною системою, яка використовує передовий штучний інтелект на такому рівні масштабованості. Хоча існуючі рішення можуть конвертувати тільки один документ за раз у бажаний формат виводу, наш інструмент може обробляти цілі колекції, корпус документів, та будувати моделі машинного навчання на основі цього.

Як ви витягуєте не тільки текст, який міститься в документі, але й структуру?

Ключовим елементом є те, що ми спроєктували взаємодію людини та комп’ютера в системі для дуже швидкої та масової анотації без будь-яких знань у галузі комп’ютерних наук. Ця зміна до машинного навчання надає нашому сервісу велику гнучкість, оскільки він може швидко адаптуватися до певних шаблонів документів, досягати високої точності та в кінцевому підсумку усунути дорогий та часозатратний налаштування, типове для традиційних алгоритмів, заснованих на правилах.

Чи можете ви обговорити проблеми створення моделі машинного навчання, яка може масштабуватися та швидко реагувати на сотні та навіть потенційно тисячі одночасних користувачів?

Ми розробили Corpus Conversion Service на основі сервісів хмари останнього покоління, таких як OpenShift на IBM Cloud. Це дозволяє нам масштабувати нашу програму без зусиль з підвищенням вимог. Моделі штучного інтелекту, які ми застосовуємо, можуть бути використані багатьма користувачами одночасно.

Скільки документів було оброблено у сервіс?

У нас є кілька промислових клієнтів, які використовують інструменти, тому ми не знаємо, скільки документів вони обробили, оскільки кожен з них має свій власний екземпляр IBM Cloud. Але для COVID-19 ми обробили всі 45 826 документів з Білого дому.

Як дослідницька спільнота реагує на використання цього інструменту штучного інтелекту?

Відтоді, як ми оголосили про безкоштовну доступність нашого інструменту кілька тижнів тому, у нас є понад 400 користувачів з десятка країн, більшість з яких – медичні лікарі та професори.

Чи є щось ще, що ви хотіли б поділитися про Corpus Conversion Service та/або його використання у контексті COVID-19?

Одним з наших клієнтів є італійська енергетична компанія Eni, яка використовує нашу технологію для розвідки гідрокарбонів, яка є складним та знання-інтенсивним бізнесом, що включає різні інженерні та наукові дисципліни, які працюють разом.

У Eni знання базуються на обробці великих обсягів геологічних, фізичних та геохімічних даних, які потім обробляються у граф знань. Геонауки можуть використовувати штучний інтелект для контекстуалізації та представлення відповідної інформації, що допоможе їм покращити прийняття рішень та ідентифікацію та верифікацію можливих альтернативних сценаріїв дослідження. Конкретно для Eni це означає більш реалістичне та точне представлення геологічної моделі.

Дякуємо за це дуже важливе інтерв’ю, це збереже дослідникам безліч годин. Читачі, які бажають дізнатися більше про технологію, повинні відвідати веб-сайт Corpus Conversion Service. Дослідникам слід відвідати сторінку інструменту штучного інтелекту COVID-19. Будь ласка, зверніть увагу, що доступ до цього ресурсу буде надано лише кваліфікованим дослідникам.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.