AI-modeller og platforme
Peter Staar, IBM-forsker, COVID-19 Open Research Dataset – Interviewserie

IBM-forsker Peter Staar har udviklet et AI-værktøj, der anvendes af mere end 300 eksperter, der udvikler en behandling eller vaccination mod COVID-19.
For at hjælpe forskere med at få adgang til struktureret og ustruktureret data hurtigt tilbyder IBM en cloud-baseret AI-forskningsressource, der er trænet på en samling af mere end 45.000 videnskabelige artikler i COVID-19 Open Research Dataset (CORD-19), udarbejdet af Det Hvide Hus og en koalition af forskningsgrupper, samt licenserede databaser fra DrugBank, Clinicaltrials.gov og GenBank.
Doktor Peter Staar tiltrådte IBM Research – Zurich Laboratory i juli 2015 som postdoc-forsker i projektet Foundations of Cognitive Solutions. Den belgisk-fødte forsker kom først til IBM Research som sommerstudent i 2006.
Du tiltrådte IBM Research – Zurich Laboratory i juli 2015. Hvad slags projekter har du arbejdet på hos IBM?
Mit første forskningsområde fokuserede på anvendelser for højtydende beregninger og var en del af det vindende hold for den prestigefyldte ACM Gordon Bell-pris.
For nylig, omkring 2017, begyndte jeg at fokusere på AI, og i august 2018 offentliggjorde mit hold en artikel på ACM Conference on Knowledge Discovery and Data Mining (KDD 2018) om et massivt skalerbart dokumentindtagningssystem, som vi kaldte Corpus Conversion Service. Dette AI-baserede cloud-værktøj kunne indtage 100.000 PDF-sider om dagen (selv af scannede dokumenter) med en nøjagtighed på over 97 procent – og derefter træne og anvende avancerede machine learning-modeller, der kan udtrække indholdet fra disse dokumenter på en skala, der aldrig før er opnået. Vi anvender nu denne samme teknologi til at hjælpe forskere med COVID-19.
Hvornår fik IBM først ideen om at bruge Corpus Conversion Service til at bekæmpe COVID-19-epidemien?
I midten af marts ledte Det Hvide Hus en indsats for at offentliggøre mere end 45.000 dokumenter om coronavirus og COVID-19. Da vi så korpusset, indså vi hurtigt, at vores teknologi kunne hjælpe, ikke kun med at gøre PDF-filerne søgbare, men også med at kombinere viden fra disse PDF-filer med yderligere datasets som Drugbank, GenBank og Clinicaltrials.gov. Vi lancerede tjenesten den 3. april.
Hvordan ville du bedst beskrive, hvad Corpus Conversion Service er?
Som med enhver stor mængde af forskellige datakilder er det svært at effektivt aggregere og analysere data på måder, der kan give videnskabelige indsigt. Vi gør det lettere ved hjælp af en viden graf, der finder forbindelser mellem disse datakilder for at give muligvis ny viden.
Kan du diskutere den primære udfordring ved at udtrække data fra PDF-format til en søgbart form?
Ifølge Adobe (ADBE ) er der omtrent 2,5 billioner Portable Document Format (PDF)-filer i omløb. Tænk på den viden, disse filer indeholder: videnskabelige artikler, teknisk litteratur og meget mere. Men alt dette indhold er “mørkt” eller ubrugt, fordi vi indtil nu ikke har haft nogen måde at indtage et stort antal PDF-filer på en skala og gøre deres indhold brugbart (eller struktureret).
PDF-filer indeholder ofte kombinationer af vektorgrafik, tekst og bitmap-grafik, hvilket gør det meget udfordrende at udtrække kvalitativ og kvantitativ data. Faktisk har konvertering af automatisk indholdsgenskabelse været et problem i mere end et årti. Selvom mange dokumentkonverteringsløsninger er tilgængelige, løser ingen af dem skalerbarheden eller anvender AI, hvilket betyder, at de skal afhænge af dyre menneskebaserede vedligeholdelse og opgradering.
Så vidt vi ved, er Corpus Conversion Service det første omfattende system, der anvender avanceret AI på dette niveau af skalerbarhed. Mens eksisterende løsninger kun kan konvertere ét dokument ad gangen til en ønsket outputformat, kan vores værktøj indtage hele samlinger, en korpus af dokumenter, og bygge maskinlærte modeller oven på det.
Hvordan udtrækker du ikke kun teksten, der er indeholdt i et dokument, men også strukturen?
En nøgleelement er, at vi designede menneske-computer-interaktionen i systemet til at tillade meget hurtig og massiv annotering uden nogen computervidenskabelig viden. Dette skift til maskinlæring giver vores tjeneste en stor grad af fleksibilitet, da den kan tilpasse sig hurtigt til bestemte skabeloner af dokumenter, opnå højpræcise resultater og ultimativt eliminere den dyre og tidskrævende justering, der er typisk for traditionelle regelbaserede algoritmer.
Kan du diskutere udfordringerne ved at opbygge en maskinlæringsmodel, der kan skaleres og reagere hurtigt på hundredvis og endda potentiale tusindvis af samtidige brugere?
Vi har udviklet Corpus Conversion Service på toppen af state-of-the-art cloud-tjenester, såsom OpenShift på IBM Cloud. Dette giver os mulighed for at skalerer vores anvendelse uden besvær med øget efterspørgsel. De AI-modeller, vi anvender, kan derfor anvendes af mange brugere samtidigt.
Hvor mange dokumenter er indtaget i tjenesten?
Vi har flere industriclienter, der anvender værktøjet, så vi ved ikke, hvor mange dokumenter de har indtaget, da de hver især har deres egen IBM Cloud-forekomst. Men for COVID-19 indtog vi alle 45.826 papirer fra Det Hvide Hus.
Hvordan har forskningssamfundet reageret på at anvende dette AI-værktøj?
Siden vi annoncerede den gratis tilgængelighed af vores værktøj for nogle uger siden, har vi mere end 400 brugere fra over et dusin lande, de fleste af dem medicinske læger og professorer.
Er der noget andet, du gerne vil dele om enten Corpus Conversion Service eller hvordan det anvendes i sammenhæng med COVID-19?
En af vores klienter er det italienske energiselskab Eni, der anvender vores teknologi til udvikling af hydrocarboner, som er en kompleks og videnintensiv forretning, der involverer forskellige ingeniør- og videnskabelige discipliner, der arbejder sammen.
Hos Eni baseres viden på behandling af store mængder geologisk, fysisk og geokemisk data, som derefter behandles til en viden graf. Geovidenskabsfolk kan derefter anvende AI til at kontekstualisere og præsentere relevant information, hvilket kan hjælpe dem med at forbedre beslutningstagning og identificering og verificering af mulige alternative udviklingsscenarier. Mere specifikt betyder det for Eni en mere realistisk og præcis repræsentation af den geologiske model.
Tak for dette meget vigtige interview, dette vil spare forskere utallige timer. Læsere, der ønsker at lære mere om teknologien, skal besøge Corpus Conversion Service-webstedet. Forskere skal besøge COVID-19 AI-værktøjsiden. Vær venlig at bemærk, at adgang til denne ressource vil kun blive bevilget til kvalificerede forskere.












