AI-modeller och plattformar
Peter Staar, IBM-forskare, COVID-19 Open Research Dataset – Intervju-serie

IBM-forskaren Peter Staar har utvecklat ett AI-verktyg som används av mer än 300 experter som utvecklar ett botemedel eller vaccin mot COVID-19.
För att hjälpa forskare att snabbt komma åt strukturerad och ostrukturerad data erbjuder IBM en molnbaserad AI-forskningsresurs som har tränats på en samling av över 45 000 vetenskapliga artiklar som ingår i COVID-19 Open Research Dataset (CORD-19), som har förberetts av Vita huset och en koalition av forskargrupper, samt licensierade databaser från DrugBank, Clinicaltrials.gov och GenBank.
Dr Peter Staar anslöt sig till IBM Research – Zurich Laboratory i juli 2015 som postdoktorand i projektet Foundations of Cognitive Solutions. Den belgiskfödde forskaren kom första gången till IBM Research som sommarstudent 2006.
När du först anslöt dig till IBM Research – Zurich Laboratory i juli 2015, vilka typer av projekt har du arbetat med på IBM?
Mina initiala forskningsinsatser fokuserade på tillämpningar för högpresterande datorer och var en del av det vinnande laget för det prestigefyllda ACM Gordon Bell-priset.
Mer nyligen, runt 2017, började jag fokusera på AI och i augusti 2018 publicerade min grupp en artikel på ACM-konferensen om kunskapsupptäckt och datautvinning (KDD 2018) om ett massivt skalbart dokumentinkameringsystem, som vi kallade Corpus Conversion Service. Detta AI-baserade molnverktyg kunde inkamera 100 000 PDF-sidor per dag (även skannade dokument) med en noggrannhet på över 97 procent – och sedan träna och tillämpa avancerade maskinlärningsmodeller som extraherar innehållet från dessa dokument i en skala som aldrig tidigare uppnåtts. Vi tillämpar nu samma teknik för att hjälpa forskare med COVID-19.
När upptäckte IBM första gången idén att använda Corpus Conversion Service för att hantera COVID-19-epidemin?
I mitten av mars ledde Vita huset en insats för att publicera mer än 45 000 dokument om coronaviruset och COVID-19. När vi såg samlingen insåg vi snabbt att vår teknik kunde hjälpa, inte bara för att göra PDF-filerna sökbara, utan också för att kombinera kunskapen inom dessa PDF-filer med ytterligare datamängder som Drugbank, GenBank och Clinicaltrials.gov. Vi lanserade tjänsten den 3 april.
Hur skulle du bäst beskriva vad Corpus Conversion Service är?
Som med alla stora volymer av disparata datakällor är det svårt att effektivt samla in och analysera data på sätt som kan ge vetenskapliga insikter. Vi underlättar detta med hjälp av en kunskapsgraf som hittar samband mellan dessa datakällor för att potentiellt ge ny kunskap.
Kan du diskutera den huvudsakliga utmaningen med att extrahera data från PDF-format till ett sökbart format?
Enligt Adobe (ADBE ) finns det ungefär 2,5 biljoner Portable Document Format (PDF)-filer i omlopp. Tänk på den kunskap som dessa filer innehåller: vetenskapliga artiklar, teknisk litteratur och mycket mer. Men all denna innehåll är “mörkt” eller outnyttjat, eftersom vi tidigare inte har haft något sätt att inkamera stora mängder PDF-filer i skala och göra deras innehåll användbart (eller strukturerat).
PDF-filer innehåller ofta kombinationer av vektorgrafik, text och bitmap-grafik, vilket alla gör extraktion av kvalitativ och kvantitativ data ganska utmanande. Faktum är att omvandling av automatisk innehållsrekonstruktion har varit ett problem i över ett decennium. Medan många dokumentomvandlingssystem finns tillgängliga, adresserar ingen av dem skalbarhet eller tillämpar AI, vilket innebär att de måste förlita sig på dyra människobaserade underhåll och uppdateringar.
Såvitt vi vet är Corpus Conversion Service det första omfattande systemet som använder avancerad AI på denna nivå av skalbarhet. Medan befintliga lösningar bara kan konvertera ett dokument åt gången till ett önskat utdataformat, kan vårt verktyg inkamera hela samlingar, en korpus av dokument, och bygga maskinlärda modeller ovanpå det.
Hur extraherar du inte bara texten som finns i ett dokument, utan också strukturen?
En nyckelelement är att vi utformade människa-datorinteraktionen i systemet för att tillåta mycket snabb och massiv annotering utan någon datavetenskaplig kunskap. Denna övergång till maskinlärning ger vår tjänst en stor flexibilitet, eftersom den kan anpassa sig snabbt till vissa dokumentmallar, uppnå mycket exakta resultat och slutligen eliminera den dyra och tidskrävande justeringen som är typisk för traditionella regelbaserade algoritmer.
Kan du diskutera utmaningarna med att bygga en maskinlärningsmodell som kan skalas och svara snabbt på hundratals och potentiellt tusentals samtidiga användare?
Vi har utvecklat Corpus Conversion Service ovanpå state-of-the-art-molntjänster, såsom OpenShift på IBM Cloud. Detta tillåter oss att skalera vår applikation utan ansträngning med ökad efterfrågan. De AI-modeller vi tillämpar kan därför användas av många användare samtidigt.
Hur många dokument har inkamerats i tjänsten?
Vi har flera industriella kunder som använder verktygen, så vi vet inte hur många dokument de har inkamerat, eftersom de var och en har sin egen IBM Cloud-instans. Men för COVID-19 inkamerade vi alla 45 826 artiklar från Vita huset.
Hur har forskarsamhället reagerat på att använda detta AI-verktyg?
Sedan vi meddelade att verktyget är tillgängligt gratis för några veckor sedan har vi över 400 användare från över ett dussin länder, de flesta av dem är läkare och professorer.
Finns det något annat du skulle vilja dela om antingen Corpus Conversion Service och/eller hur det används i sammanhanget med COVID-19?
En av våra kunder är det italienska energiföretaget Eni, som använder vår teknik för utforskning av kolväten, som är en komplex och kunskapsintensiv verksamhet som involverar olika ingenjörs- och vetenskapliga discipliner som arbetar tillsammans.
Hos Eni baseras kunskapen på bearbetning av stora mängder geologiska, fysiska och geokemiska data, som sedan bearbetas till en kunskapsgraf. Geovetare kan sedan använda AI för att kontextualisera och presentera relevant information, vilket hjälper dem att förbättra beslutsfattandet och identifieringen och verifikationen av möjliga alternativa utforsknings scenarier. Mer specifikt för Eni innebär detta en mer realistisk och exakt representation av den geologiska modellen.
Tack för detta mycket viktiga samtal, detta kommer att spara forskare otaliga timmar. Läsare som vill lära sig mer om tekniken bör besöka Corpus Conversion Service-webbplatsen. Forskare bör besöka COVID-19 AI-verktygssidan. Observera att åtkomst till denna resurs kommer endast att beviljas kvalificerade forskare.












