Yapay zeka modelleri ve platformları
Peter Staar, IBM Bilim İnsanı, COVID-19 Açık Araştırma Veri Seti – Röportaj Serisi

IBM bilim insanı Peter Staar, COVID-19’a tedavi veya aşı geliştiren 300’den fazla uzmanın kullandığı bir AI aracı geliştirdi.
Araştırmacılara yapılandırılmış ve yapılandırılmamış verileri hızlı bir şekilde erişmeleri için IBM, COVID-19 Açık Araştırma Veri Seti (CORD-19)中的 45.000’den fazla bilimsel makaleyi içeren ve Beyaz Saray ve araştırma grupları koalisyonu tarafından hazırlanan ve DrugBank, Clinicaltrials.gov ve GenBank’tan lisanslı veritabanlarından oluşan bir bulut tabanlı AI araştırma kaynağını sunuyor.
Dr. Peter Staar, Temmuz 2015’te IBM Araştırma – Zürih Laboratuvarı’na Bilişsel Çözümler Projesi’nde post-doktor araştırmacı olarak katıldı. Belçika doğumlu bilim insanı ilk olarak 2006 yılında IBM Araştırma’ya yaz öğrencisi olarak katılmıştı.
İlk olarak Temmuz 2015’te IBM Araştırma – Zürih Laboratuvarı’na katıldınız. IBM’de hangi tür projeler üzerinde çalıştınız?
İlk araştırmam yüksek performanslı hesaplama uygulamalarına odaklandı ve ACM Gordon Bell ödülü kazanan ekibin bir parçasıydım.
2017 yılı civarında AI’ye odaklanmaya başladım ve Ağustos 2018’de ekibim, Corpus Conversion Service adlı bir belge alımı sistemi hakkında KDD 2018 konferansında bir makale yayınladı. Bu AI tabanlı bulut aracı, even taramalı belgeler dahil olmak üzere günde 100.000 belge sayfasını %97’den fazla doğrulukla işleyebiliyordu ve sonra gelişmiş makine öğrenimi modellerini bu belgelerden çıkarılan içeriğe uygulayabiliyordu. Şimdi bu teknolojiyi COVID-19 ile mücadele için uyguluyoruz.
IBM, Corpus Conversion Service’ı COVID-19 salgınıyla mücadele için kullanma fikrine ne zaman ulaştı?
Mart ortalarında Beyaz Saray, koronavirüs ve COVID-19 hakkında 45.000’den fazla belge yayınladı. Bu koleksiyonu gördüğümüzde, teknolojimizin sadece PDF’leri aranabilir hale getirmekle kalmayıp, bu PDF’ler içindeki bilgileri Drugbank, GenBank ve Clinicaltrials.gov gibi ek veri setleriyle birleştirebileceğini nhanh chóng anladık. Hizmeti 3 Nisan’da kullanıma sunduk.
Corpus Conversion Service’ı en iyi nasıl tanımlarsınız?
Her büyük hacimli veri kaynağında, bu verileri bilimsel içgörüler elde edecek şekilde etkili bir şekilde birleştirmek ve analiz etmek zordur. Bunu, veri kaynakları arasındaki bağlantılar bulan bir bilgi grafiği kullanarak kolaylaştırıyoruz.
PDF formatından aranabilir bir forma veri çıkarmadaki temel zorluğu tartışabilir misiniz?
Adobe’a göre, şu anda dolaşımda yaklaşık 2,5 trilyon Portable Document Format (PDF) dosyası vardır. Bu dosyaların içerdiği bilgiyi düşünün: bilimsel makaleler, teknik literatür ve çok daha fazlası. Ancak tüm bu içerik “karanlık” veya kullanılmayan çünkü şimdiye kadar bu dosyaların içeriğini büyük ölçekte işleyerek kullanılabilir hale getirebilecek bir yol yoktu.
PDF dosyaları genellikle vektör grafikleri, metin ve bitmap grafikleri bir arada içerir, bu da nitel ve nicel verilerin çıkarılmasını oldukça zorlaştırır. Aslında, otomatik içerik yeniden yapılandırması on yıldan fazla bir süredir bir sorun teşkil etmektedir. Çok sayıda belge dönüştürme çözümü mevcuttur, ancak bunlar hiçbirisi ölçeklenebilirlik veya AI uygulamaktadır, bu nedenle pahalı insan temelli bakım ve güncellemeye ihtiyaç duyarlar.
Bildiğimiz kadarıyla, Corpus Conversion Service, bu düzeyde ölçeklenebilirlikte advanced AI kullanan ilk kapsamlı sistemdir. Mevcut çözümler sadece bir belgeyi bir defada istenilen çıkış formatına dönüştürebilirken, aracımız tüm koleksiyonları işleyebilir ve bunların üzerinde makine öğrenimi modelleri oluşturabilir.
Belgelerdeki metnin yanı sıra yapıyı nasıl çıkarırsınız?
Ana unsur, sistemdeki insan-bilgisayar etkileşimini, hiçbir bilgisayar bilimi bilgisi olmadan çok hızlı ve büyük ölçekli anotasyonlara izin verecek şekilde tasarlamamızdır. Makine öğrenimine geçiş, hizmetimize büyük bir esneklik kazandırır, çünkü belirli belge şablonlarına hızla adapte olabilir, çok yüksek doğruluk elde edebilir ve geleneksel kural tabanlı algoritmaların pahalı ve zaman alan ayarlamalarını ortadan kaldırabilir.
Yüzlerce, hatta binlerce eş zamanlı kullanıcıya hızlı bir şekilde yanıt verebilen bir makine öğrenimi modeli oluşturmanın zorluklarını tartışabilir misiniz?
Corpus Conversion Service’ı, OpenShift trên IBM Cloud gibi son teknoloji bulut hizmetleri üzerine geliştirdik. Bu, uygulamamızın artan talebe göre çaba harcamadan ölçeklenmesini sağlar. Uyguladığımız AI modelleri, birçok kullanıcı tarafından eş zamanlı olarak kullanılabilir.
Hizmete kaç belge alındı?
Sanayi müşterilerimiz aracı kullanıyor, ancak kendi IBM Cloud örneklerine sahip olduklarından, kaç belge aldıklarını bilmiyoruz. COVID-19 için Beyaz Saray’ın yayınladığı 45.826 makaleyi işledik.
Araştırma topluluğu, bu AI aracını kullanmaya nasıl tepki verdi?
Araçlarımızın ücretsiz olarak kullanılabilirliğini duyurduktan birkaç hafta sonra, dozenlerce ülkeden 400’den fazla kullanıcıya ulaştık, bunların çoğu tıp doktorları ve profesörler.
Corpus Conversion Service ve/veya COVID-19 bağlamındaki kullanımı hakkında paylaşmak istediğiniz başka bir şey var mı?
Müşterilerimizden biri, hidrokarbon keşfi için teknolojisini kullanan İtalyan enerji şirketi Eni’dir. Bu, çeşitli mühendislik ve bilimsel disiplinlerin birlikte çalıştığı karmaşık ve bilgi yoğun bir iştir.
Eni’de, bilgi, büyük miktarda jeolojik, fiziksel ve jeokimyasal verilerin işlenmesiyle oluşturulan bir bilgi grafiğidir. Jeobilimciler, AI’ı kullanarak ilgili bilgileri bağlamsal olarak sunabilir ve böylece karar verme ve alternatif keşif senaryolarının tanımlanması ve doğrulanmasını iyileştirebilirler. Özellikle Eni için, bu, jeolojik modelin daha gerçekçi ve precisa bir temsilini sağlar.
Çok önemli bu röportaj için teşekkür ederiz, bu araştırmacılara saatlerce zaman kazandıracaktır. Daha fazla bilgi edinmek isteyen okuyucular, Corpus Conversion Service web sitesini ziyaret edebilir. Araştırmacılar, COVID-19 AI aracı sayfasını ziyaret etmelidir. Lütfen dikkat: bu kaynağa erişim, sadece nitelikli araştırmacılara verilecektir.












