Модели и платформы ИИ

Петер Стаар, ученый IBM, COVID-19 Открытый исследовательский набор данных – Серия интервью

mm
Добавьте Unite.AI в избранные источники в Google

Ученый IBM Петер Стаар разработал инструмент на основе ИИ, который используется более чем 300 экспертами, разрабатывающими лечение или вакцину для COVID-19.

Чтобы помочь исследователям быстро получить доступ к структурированным и неструктурированным данным, IBM предлагает облачный ресурс для исследований на основе ИИ, который был обучен на корпусе более 45 000 научных статей, содержащихся в наборе данных Открытых исследований COVID-19 (CORD-19), подготовленном Белым домом и коалицией исследовательских групп, а также лицензированных баз данных из DrugBank, Clinicaltrials.gov и GenBank.

Доктор Петер Стаар присоединился к лаборатории IBM Research – Zurich в июле 2015 года в качестве постдокторального исследователя в проекте Основы когнитивных решений. Родившийся в Бельгии ученый впервые пришел в IBM Research как летний студент в 2006 году.

Вы впервые присоединились к лаборатории IBM Research – Zurich в июле 2015 года. Какие проекты вы работали над в IBM?

Мои первоначальные исследования были сосредоточены на применении высокопроизводительных вычислений и были частью команды, получившей престижную премию ACM Gordon Bell.

Более недавно, около 2017 года, я начал сосредотачиваться на ИИ, и в августе 2018 года моя команда опубликовала статью на конференции ACM по открытию знаний и добыче данных (KDD 2018) о масштабируемой системе ингестии документов, которую мы назвали Сервисом конверсии корпуса. Этот инструмент на основе ИИ смог ингестировать 100 000 страниц PDF в день (даже сканированных документов) с точностью выше 97 процентов – и затем обучить и применить продвинутые модели машинного обучения, которые извлекают содержание из этих документов в масштабе, никогда ранее не достигаемом. Мы сейчас применяем эту же технологию, чтобы помочь исследователям с COVID-19.

Когда IBM впервые столкнулась с идеей использования Сервиса конверсии корпуса для борьбы с эпидемией COVID-19?

В середине марта Белый дом возглавил усилия по публикации более 45 000 документов о коронавирусе и COVID-19. Когда мы увидели корпус, мы быстро поняли, что наша технология может помочь, не только сделать PDF-файлы поисковыми, но и объединить знания внутри этих PDF-файлов с дополнительными наборами данных, такими как Drugbank, GenBank и Clinicaltrials.gov. Мы запустили сервис 3 апреля.

Как бы вы лучше всего описали, что такое Сервис конверсии корпуса?

Как и в случае с любым большим объемом разнообразных источников данных, трудно эффективно агрегировать и анализировать эти данные таким образом, чтобы получить научные знания. Мы делаем это проще, используя граф знаний, который находит связи между этими источниками данных, чтобы потенциально получить новые знания.

Можете ли вы обсудить основную проблему извлечения данных из формата PDF в поисковую форму?

По данным Adobe (ADBE ), существует примерно 2,5 триллиона файлов в формате Portable Document Format (PDF), которые сейчас находятся в обращении. Подумайте о знаниях, которые содержат эти файлы: научные статьи, техническая литература и многое другое. Но все это содержание “темное” или неиспользуемое, потому что до сих пор у нас не было способа ингестировать большое количество файлов PDF в масштабе и сделать их содержание использованным (или структурированным).

Файлы PDF часто включают в себя комбинации векторной графики, текста и битовой графики, все из которых делают извлечение качественных и количественных данных довольно сложным. На самом деле, конверсия автоматического восстановления содержания была проблемой более чем на десятилетие. Хотя многие решения конверсии документов доступны, ни одно из них не решает проблему масштабируемости или не использует ИИ, что означает, что они должны полагаться на дорогостоящее обслуживание и обновление на основе человеческого фактора.

Насколько нам известно, Сервис конверсии корпуса является первой комплексной системой, которая использует продвинутый ИИ на этом уровне масштабируемости. Хотя существующие решения могут конвертировать только один документ за раз в желаемый формат вывода, наш инструмент может ингестировать целые коллекции, корпус документов, и строить модели машинного обучения на основе этого.

Как вы извлекаете не только текст, содержащийся в документе, но и структуру?

Ключевым элементом является то, что мы разработали взаимодействие человека и компьютера в системе, чтобы позволить очень быструю и массовую аннотацию без каких-либо знаний в области компьютерных наук. Этот переход к машинному обучению дает нашей службе большую гибкость, поскольку она может быстро адаптироваться к определенным шаблонам документов, достигать высокоточных результатов и в конечном итоге устранять дорогостоящее и трудоемкое настройка, типичное для традиционных алгоритмов, основанных на правилах.

Можете ли вы обсудить проблемы построения модели машинного обучения, которая может масштабироваться и быстро реагировать на hundreds и даже потенциально thousands одновременных пользователей?

Мы разработали Сервис конверсии корпуса на основе современных облачных сервисов, таких как OpenShift на IBM Cloud. Это позволяет нам масштабировать наше приложение без усилий с увеличением спроса. Модели ИИ, которые мы применяем, могут быть использованы многими пользователями одновременно.

Сколько документов было ингестировано в сервис?

У нас есть несколько промышленных клиентов, которые используют инструменты, поэтому мы не знаем, сколько документов они ингестировали, поскольку у каждого из них есть свой собственный экземпляр IBM Cloud. Но для COVID-19 мы ингестировали все 45 826 статей из Белого дома.

Как отреагировало исследовательское сообщество на использование этого инструмента ИИ?

С тех пор, как мы объявили о бесплатной доступности нашего инструмента несколько недель назад, у нас более 400 пользователей из более чем десятка стран, большинство из которых – медицинские доктора и профессора.

Есть ли что-то еще, что вы хотели бы поделиться о Сервисе конверсии корпуса и/или о том, как он используется в контексте COVID-19?

Один из наших клиентов – итальянская энергетическая фирма Eni, которая использует нашу технологию для разведки углеводородов, что является сложным и знание-интенсивным бизнесом, который включает в себя различные инженерные и научные дисциплины, работающие вместе.

В Eni знания основаны на обработке больших объемов геологических, физических и геохимических данных, которые затем обрабатываются в граф знаний. Геоученые могут затем использовать ИИ, чтобы контекстуализировать и представить соответствующую информацию, что поможет им улучшить принятие решений и выявление и проверку возможных альтернативных сценариев разведки. Более конкретно, для Eni это означает более реалистичное и точное представление геологической модели.

Спасибо за это очень важное интервью, это спасет исследователям бесчисленные часы. Читателям, которые хотят узнать больше о технологии, следует посетить веб-сайт Сервиса конверсии корпуса. Исследователям следует посетить страницу инструмента ИИ COVID-19. Пожалуйста, обратите внимание, что доступ к этому ресурсу будет предоставлен только квалифицированным исследователям.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.