AI-modeller og plattformer
Peter Staar, IBM-forsker, COVID-19 Open Research Dataset – Intervju-serie

IBM-forsker Peter Staar har utviklet et AI-verktøy som brukes av over 300 eksperter som utvikler en behandling eller vaksine for COVID-19.
For å hjelpe forskere med å få tilgang til strukturert og ustrukturert data raskt, tilbyr IBM en skybasert AI-forskningsressurs som er trent på en samling av over 45 000 vitenskapelige artikler i COVID-19 Open Research Dataset (CORD-19), som er forberedt av Det hvite hus og en koalisjon av forskningsgrupper, og lisensierede databaser fra DrugBank, Clinicaltrials.gov og GenBank.
Dr. Peter Staar ble med i IBM Research – Zurich Laboratory i juli 2015 som postdoktorand i prosjektet Foundations of Cognitive Solutions. Den belgiskfødte forskeren kom først til IBM Research som sommerstudent i 2006.
Du ble med i IBM Research – Zurich Laboratory i juli 2015. Hva slags prosjekter har du arbeidet med i IBM?
Mitt første forskningsarbeid fokuserte på anvendelser for høy-ytelses databehandling og var en del av vinnerlaget for den prestisjefylte ACM Gordon Bell-prisen.
Mer nylig, rundt 2017, begynte jeg å fokusere på AI, og i august 2018 publiserte mitt team en artikkel på ACM-konferansen om kunnskapsoppdagelse og datautvinning (KDD 2018) om et massivt skalerbart dokumentinnsugningssystem, som vi kalte Corpus Conversion Service. Dette AI-baserte skyverktøyet kunne innsuge 100 000 PDF-sider per dag (også av skannede dokumenter) med en nøyaktighet over 97 prosent – og deretter trene og anvende avanserte maskinlæringsmodeller som kunne utvinne innholdet fra disse dokumentene på en skala som aldri tidligere var oppnådd. Vi anvender nå denne samme teknologien for å hjelpe forskere med COVID-19.
Når oppdaget IBM først ideen om å bruke Corpus Conversion Service til å takle COVID-19-epidemien?
I midten av mars ledet Det hvite hus en innsats for å publisere over 45 000 dokumenter om koronaviruset og COVID-19. Da vi så korpusen, innsett vi raskt at vår teknologi kunne hjelpe, ikke bare til å gjøre PDF-ene søkbare, men også til å kombinere kunnskapen i disse PDF-ene med ekstra datasamlinger som Drugbank, GenBank og Clinicaltrials.gov. Vi lanserte tjenesten den 3. april.
Hvordan ville du beskrive hva Corpus Conversion Service er?
Som med enhver stor mengde ulike datakilder, er det vanskelig å effektivt aggregere og analysere data på måter som kan gi vitenskapelige innsikter. Vi gjør dette enklere ved å bruke en kunnskapsgraf som finner sammenhenger mellom disse datakildene for å potensielt gi ny kunnskap.
Kan du diskutere den viktigste utfordringen ved å utvinne data fra PDF-format til et søkbart format?
Ifølge Adobe (ADBE ), finnes det omtrent 2,5 billioner Portable Document Format (PDF)-filer i omløp. Tenk på all kunnskap disse filene inneholder: vitenskapelige artikler, teknisk litteratur og mye mer. Men all denne kunnskapen er “mørk” eller ubrukt, fordi vi tidligere ikke har hatt noen måte å innsuge store mengder PDF-filer på en skala og gjøre deres innhold brukbart (eller strukturert).
PDF-filer inneholder ofte kombinasjoner av vektorgrafikk, tekst og bitmapgrafikk, noe som gjør det svært utfordrende å utvinne kvalitative og kvantitative data. Faktisk har konvertering av automatisk innholdsgjenopprettelse vært et problem i over ett tiår. Mens mange dokumentkonverteringsløsninger er tilgjengelige, løser ingen av dem skalerbarhet eller anvender AI, noe som betyr at de må stole på dyre menneskebaserte vedlikehold og oppgradering.
Så langt vi vet, er Corpus Conversion Service det første omfattende systemet som anvender avansert AI på dette nivået av skalerbarhet. Mens eksisterende løsninger bare kan konvertere ett dokument om gangen til et ønsket utdataformat, kan vårt verktøy innsuge hele samlinger, en korpus av dokumenter, og bygge maskinlærte modeller på toppen av det.
Hvordan utvinner du ikke bare tekst som er inneholdt i et dokument, men også strukturen?
En nøkkelkomponent er at vi har designet menneske-datamaskin-interaksjonen i systemet for å tillate svært rask og massiv annotering uten noen datavitenskapelig kunnskap. Denne omleggingen til maskinlæring gir vår tjeneste en stor grad av fleksibilitet, ettersom den kan tilpasse seg raskt til bestemte maler av dokumenter, oppnå svært nøyaktige resultater og til slutt eliminere den kostbare og tidskrevende finjusteringen som er typisk for tradisjonelle regelbaserte algoritmer.
Kan du diskutere utfordringene ved å bygge en maskinlæringsmodell som kan skaleres og svare raskt på hundrevis og potensielt tusenvis av samtidige brukere?
Vi har utviklet Corpus Conversion Service på toppen av state-of-the-art skytjenester, som OpenShift på IBM Cloud. Dette gjør det mulig for oss å skalerer vår applikasjon uten noen innsats med økt etterspørsel. De AI-modellene vi anvender kan derfor brukes av mange brukere samtidig.
Hvor mange dokumenter er innsugt i tjenesten?
Vi har flere industriclienter som bruker verktøyet, så vi vet ikke hvor mange dokumenter de har innsugt, ettersom de hver har sin egen IBM Cloud-forekomst. Men for COVID-19 innsugde vi alle 45 826 papirer fra Det hvite hus.
Hvordan har forskningssamfunnet reagert på å bruke dette AI-verktøyet?
Siden vi annonserte den gratis tilgjengeligheten av vårt verktøy for noen uker siden, har vi over 400 brukere fra over et dusin land, de fleste av dem medisinske doktorer og professorer.
Er det noe annet du ville like å dele om enten Corpus Conversion Service og/eller hvordan det brukes i sammenheng med COVID-19?
En av våre klienter er det italienske energiselskapet Eni, som bruker vår teknologi for utforskning av hydrokarboner, som er en kompleks og kunnskapsintensiv forretning som involverer flere ingeniør- og vitenskapelige disipliner som arbeider sammen.
Hos Eni er kunnskapen basert på behandling av store mengder geologisk, fysisk og geokjemisk data, som deretter behandles til en kunnskapsgraf. Geovitenskapsmenn kan deretter bruke AI til å kontekstualisere og presentere relevant informasjon, som vil hjelpe dem med å forbedre beslutningstakingen og identifisere og verifisere mulige alternative utforsknings-scenarier. Mer spesifikt for Eni betyr dette en mer realistisk og nøyaktig representasjon av det geologiske modellen.
Takk for dette viktige intervjuet, dette vil spare forskere uendelig mye tid. Lesere som ønsker å lære mer om teknologien, bør besøke Corpus Conversion Service-nettstedet. Forskere bør besøke COVID-19 AI-verktøysiden. Vær oppmerksom på at tilgang til denne ressursen vil bare bli gitt til kvalifiserte forskere.












