AI-mallit ja alustat
Peter Staar, IBM-tutkija, COVID-19 Open Research Dataset – Haastattelusarja

IBM-tutkija Peter Staar on kehittänyt tekoälytyökalun, jota yli 300 asiantuntijaa käyttää kehittääkseen hoitoa tai rokotetta COVID-19:ää vastaan.
Jotta tutkijat pääsisivät nopeasti käsiksi rakenteisiin ja rakenteettomiin tietoihin, IBM tarjoaa pilvipohjaisen tekoälytutkimusresurssin, joka on koulutettu yli 45 000 tieteellisen artikkelin korpuksella, joka sisältyy COVID-19 Open Research Dataset -korpuksiin (CORD-19), jonka ovat valmistaneet Valkoinen talo ja tutkimusryhmien liittouma, sekä lisensoituja tietokantoja, kuten DrugBank, Clinicaltrials.gov ja GenBank.
Tohtori Peter Staar liittyi IBM Research – Zurich Laboratoryyn heinäkuussa 2015 post-doc-tutkijaksi Foundations of Cognitive Solutions -projektiin. Belgialaissyntyinen tutkija tuli IBM Researchiin ensimmäisen kerran kesäoppilaana vuonna 2006.
Liityit IBM Research – Zurich Laboratoryyn heinäkuussa 2015. Millaista työtä olet tehnyt IBM:llä?
Alkuvaiheessa tutkimukseni keskittyi suorituskykyisen laskennan sovelluksiin ja olin voittajatiimin jäsen arvostetussa ACM Gordon Bell -palkinnossa.
Viimeaikaisemmin, noin vuonna 2017, aloin keskittyä tekoälyyn, ja elokuussa 2018 tiimimme julkaisi artikkelin ACM Conference on Knowledge Discovery and Data Mining (KDD 2018) -konferenssissa massiivisesti skaalautuvasta asiakirjan sisäänottopalvelusta, jonka kutsuimme Corpus Conversion Serviceksi. Tämä tekoälypohjainen pilvitöökalu pystyi sisäänottamaan 100 000 PDF-sivua päivässä (jopa skannattuja asiakirjoja) yli 97 prosentin tarkinnoilla – ja sitten kouluttamaan ja soveltamaan edistyneitä koneoppimismalleja, jotka poistivat sisällön näistä asiakirjoista aikaisemmin saavuttamattomalla skaalalla. Nyt soveltamme samaa teknologiaa auttaaksemme tutkijoita COVID-19:ssä.
Milloin IBM sai idean käyttää Corpus Conversion Servicea COVID-19-epidemian torjumiseksi?
Kesäkuun puolivälissä Valkoinen talo johti pyrkimystä julkaista yli 45 000 asiakirjaa koronaviruksesta ja COVID-19:stä. Kun näimme korpuksen, ymmärsimme nopeasti, että teknologiamme voisi auttaa, ei ainoastaan tekemällä PDF-tiedostoja hakukoneystävällisiksi, vaan myös yhdistämällä tietämys näiden PDF-tiedostojen sisällä muiden tietokantojen, kuten Drugbankin, GenBankin ja Clinicaltrials.gov:n, kanssa. Käynnistimme palvelun 3. huhtikuuta.
Miten kuvailisit parhaiten, mitä Corpus Conversion Service on?
Kuten minkä tahansa suuren määrän erilaisia tietolähteitä, on vaikea kerätä ja analysoida tietoja tehokkaasti niin, että niistä voisi saada tieteellisiä oivalluksia. Tehdäksemme tämän helpommaksi käytämme tietämysverkkoa, joka löytää yhteyksiä näiden tietolähteiden välillä, mikä voi johtaa uuden tietämyksen löytymiseen.
Voitko keskustella siitä, mitä haasteita on ollut siinä, että olet poistanut tietoja PDF-muodosta hakukelpoiseen muotoon?
Adobeen mukaan on noin 2,5 biljoonaa Portable Document Format (PDF) -tiedostoa liikkeessä. Ajattele kaikkea tietoa, joka näissä tiedostoissa on: tieteellisiä artikkeleita, teknistä kirjallisuutta ja paljon muuta. Mutta kaikki tämä sisältö on “pimeää” tai käyttämätöntä, koska meillä ei ole ollut tapaa sisäänottaa suurta määrää PDF-tiedostoja skaalattavasti ja tehdä niiden sisällöstä käytettävissä (tai rakenteista).
PDF-tiedostot sisältävät usein yhdistelmiä vektorigrafiikkaa, tekstiä ja bittikarttagrafiikkaa, mikä kaikki tekee laadukkaan ja määrällisen tietojen poistamisen haasteelliseksi. Toisaalta, automaattisen sisällön jälleenrakennus on ollut ongelma yli kymmenen vuoden ajan. Vaikka monia asiakirjanmuunnosratkaisuja on saatavilla, mikään niistä ei koske skaalautuvuutta tai sovellaa tekoälyä, mikä tarkoittaa, että ne joutuvat turvautumaan kalliiseen, ihmisten ylläpitämään ja päivittämiseen.
Parhaan tiedon mukaamme Corpus Conversion Service on ensimmäinen kattava järjestelmä, joka käyttää edistynyttä tekoälyä tässä skaalassa. Koska olemassa olevat ratkaisut voivat muuttaa vain yhden asiakirjan kerrallaan haluttuun tulostemuotoon, työkalumme voi sisäänottaa kokoelmat, asiakirjojen korpuksen, ja rakentaa koneoppimismalleja sen päällä.
Miten poistat ei ainoastaan tekstin, joka on sisällytetty asiakirjaan, vaan myös rakenteen?
Avainasiana on, että suunnittelimme ihmisen ja tietokoneen vuorovaikutusta järjestelmässä sallimaan erittäin nopean ja massiivisen annotaation ilman tietokoneen tieteen tuntemista. Tämä vaihto tekoälyyn antaa palvelullemme suuren joustavuuden, koska se voi sopeutua nopeasti tiettyihin asiakirjamalleihin, saavuttaa erittäin tarkan tuloksen ja lopulta poistaa kalliin ja aikaa vievän säätämisen, joka on tyypillistä perinteisille, sääntöpohjaisille algoritmeille.
Voitko keskustella siitä, mitä haasteita on ollut siinä, että olet rakentanut tekoälymallin, joka voi skaalautua ja reagoida nopeasti satoihin ja jopa tuhansiin samanaikaisten käyttäjien pyynnöksiin?
Olemme kehittäneet Corpus Conversion Service -palvelun state-of-the-art-pilvipalvelujen päällä, kuten OpenShift IBM Cloudissa. Tämä mahdollistaa sovelluksen skaalautumisen vaivattomasti kasvavan kysynnän mukana. Tekoälymallit, joita sovellemme, voidaan käyttää useiden käyttäjien kesken samanaikaisesti.
Montako asiakirjaa on sisäänottanut palveluun?
Meillä on useita teollisia asiakkaita, jotka käyttävät työkaluja, joten emme tiedä, montako asiakirjaa he ovat sisäänottaneet, koska heillä on jokaisella oma IBM Cloud -esiintymä. Mutta COVID-19:lle sisäänottomme kaikki 45 826 artikkelia Valkoisen talon toimesta.
Miten tutkimusyhteisö on reagoinut käyttämällä tätä tekoälytyökalua?
Koska ilmoitimme työkalun ilmaisen saatavuuden muutama viikko sitten, meillä on yli 400 käyttäjää yli kymmenestä maasta, ja useimmat heistä ovat lääkäreitä ja professoreita.
Onko mitään muuta, mitä haluaisit jakaa Corpus Conversion Service -palvelusta ja/tai siitä, miten sitä käytetään COVID-19:n kontekstissa?
Yksi asiakkaistamme on italialainen energiayhtiö Eni, joka käyttää teknologiaamme hiilivetyjen etsintään, joka on monimutkainen ja tietämysintensivinen liiketoiminta, joka vaatii useita insinööri- ja tieteellisiä aloja yhteistyöhön.
Enissä tietämys perustuu suuriin määriin geologista, fysikaalista ja geokemiallista dataa, joka prosessoidaan tietämysverkostoksi. Geotieteilijät voivat sitten käyttää tekoälyä asiakirjojen kontekstualisointiin ja esittää relevanttia tietoa, mikä auttaa heitä parantamaan päätöksentekoa ja mahdollisten vaihtoehtoisten etsintätilanteiden tunnistamista. Enille tämä tarkoittaa enemmän realistista ja tarkkaa geologisen mallin esittämistä.
Kiitos tästä erittäin tärkeästä haastattelusta, tämä säästää tutkijoille lukemattomia tunteja. Lukijat, jotka haluavat oppia lisää teknologiasta, voivat vierailla Corpus Conversion Service -verkkosivustolla. Tutkijat voivat vierailla COVID-19 AI -työkalusivulla. Huomaa, että pääsy tähän resurssiin myönnetään ainoastaan päteville tutkijoille.












