AI-modellen en platforms
Peter Staar, IBM-wetenschapper, COVID-19 Open Research Dataset – Interviewreeks

IBM-wetenschapper Peter Staar heeft een AI-hulpmiddel ontwikkeld dat wordt gebruikt door meer dan 300 experts die een behandeling of vaccin voor COVID-19 ontwikkelen.
Om onderzoekers in staat te stellen gestructureerde en ongestructureerde gegevens snel te benaderen, biedt IBM een cloudgebaseerd AI-onderzoeksresource aan dat getraind is op een corpus van meer dan 45.000 wetenschappelijke artikelen in de COVID-19 Open Research Dataset (CORD-19), samengesteld door het Witte Huis en een coalitie van onderzoeksinstellingen, en gelicenceerde databases van DrugBank, Clinicaltrials.gov en GenBank.
Dr. Peter Staar sloot zich in juli 2015 aan bij het IBM Research – Zurich Laboratory als postdoctoraal onderzoeker in het project Foundations of Cognitive Solutions. De in België geboren wetenschapper kwam voor het eerst bij IBM Research als zomerstudent in 2006.
U bent voor het eerst bij het IBM Research – Zurich Laboratory gekomen in juli 2015. Wat voor soort projecten heeft u bij IBM gewerkt?
Mijn initiële onderzoek richtte zich op toepassingen voor high-performance computing en was onderdeel van het winnende team voor de prestigieuze ACM Gordon Bell Award.
Onlangs, rond 2017, begon ik me te richten op AI en in augustus 2018 publiceerde mijn team een paper op de ACM Conference on Knowledge Discovery and Data Mining (KDD 2018) over een massaal schaalbaar document-conversiesysteem, dat we de Corpus Conversion Service noemden. Dit AI-gebaseerde cloudhulpmiddel kon 100.000 PDF-pagina’s per dag (zelfs van gescande documenten) met een nauwkeurigheid van boven de 97 procent verwerken – en vervolgens geavanceerde machine learning-modellen trainen en toepassen die de inhoud van deze documenten op een schaal extracteren die nooit eerder was bereikt. We passen nu dezelfde technologie toe om onderzoekers met COVID-19 te helpen.
Wanneer kwam IBM voor het eerst op het idee om de Corpus Conversion Service te gebruiken om de COVID-19-epidemie aan te pakken?
Halverwege maart leidde het Witte Huis een inspanning om meer dan 45.000 documenten over het coronavirus en COVID-19 te publiceren. Toen we het corpus zagen, realiseerden we ons snel dat onze technologie kon helpen, niet alleen om de PDF’s doorzoekbaar te maken, maar ook om de kennis binnen die PDF’s te combineren met aanvullende datasets zoals Drugbank, GenBank en Clinicaltrials.gov. We gingen op 3 april live met de service.
Hoe zou u het beste de Corpus Conversion Service beschrijven?
Net als bij elke grote hoeveelheid uiteenlopende gegevensbronnen is het moeilijk om die gegevens efficiënt te aggregeren en te analyseren op manieren die wetenschappelijke inzichten kunnen opleveren. We maken dit gemakkelijker met een kennisgrafiek die verbindingen tussen deze gegevensbronnen vindt om potentieel nieuwe kennis op te leveren.
Kunt u de belangrijkste uitdaging bespreken van het extraheren van gegevens uit PDF-formaat naar een doorzoekbaar formaat?
Volgens Adobe (ADBE ) zijn er ongeveer 2,5 biljoen Portable Document Format (PDF)-bestanden in omloop. Denk aan de kennis die deze bestanden bevatten: wetenschappelijke artikelen, technische literatuur en veel meer. Maar al die inhoud is “donker” of ongebruikt, omdat we tot nu toe geen manier hadden om grote aantallen PDF-bestanden op schaal te verwerken en hun inhoud bruikbaar te maken (of gestructureerd).
PDF-bestanden bevatten vaak combinaties van vectorgraphics, tekst en bitmapgraphics, waardoor het extraheren van kwalitatieve en kwantitatieve gegevens erg moeilijk is. In feite is het omzetten van automatische inhoudsreconstructie al meer dan een decennium een probleem. Terwijl veel documentconversieoplossingen beschikbaar zijn, lossen ze geen van alle schaalbaarheid op of passen ze AI toe, wat betekent dat ze moeten vertrouwen op dure, door mensen gebaseerde onderhoud en upgraden.
Wat wij weten, is dat de Corpus Conversion Service het eerste uitgebreide systeem is dat geavanceerde AI op dit niveau van schaalbaarheid gebruikt. Terwijl bestaande oplossingen alleen één document tegelijk kunnen omzetten naar een gewenst uitvoerformaat, kan ons hulpmiddel hele collecties verwerken, een corpus van documenten, en machine learning-modellen op basis daarvan bouwen.
Hoe extraheren wij niet alleen de tekst die in een document staat, maar ook de structuur?
Een belangrijk element is dat wij de mens-computerinteractie in het systeem hebben ontworpen om zeer snelle en massale annotatie mogelijk te maken zonder enige kennis van computerwetenschap. Deze omschakeling naar machine learning geeft onze service een grote mate van flexibiliteit, omdat het snel kan aanpassen aan bepaalde sjablonen van documenten, zeer nauwkeurige resultaten kan bereiken en uiteindelijk de dure en tijdrovende afstemming van traditionele regelgebaseerde algoritmen elimineert.
Kunt u de uitdagingen bespreken van het opbouwen van een machine learning-model dat kan schalen en snel kan reageren op honderden en mogelijk duizenden gelijktijdige gebruikers?
Wij hebben de Corpus Conversion Service ontwikkeld op basis van state-of-the-art cloudservices, zoals OpenShift op IBM Cloud. Dit stelt ons in staat om onze toepassing moeiteloos te schalen met een toename van de vraag. De AI-modellen die wij toepassen, kunnen dus door veel gebruikers tegelijk worden gebruikt.
Hoeveel documenten zijn er in de service geïntegreerd?
Wij hebben verschillende industriële klanten die de tools gebruiken, dus weten wij niet hoeveel documenten zij hebben geïntegreerd, omdat elk van hen zijn eigen IBM Cloud-exemplaar heeft. Maar voor COVID-19 hebben wij alle 45.826 papers van het Witte Huis geïntegreerd.
Hoe heeft de onderzoekscommunity gereageerd op het gebruik van dit AI-hulpmiddel?
Sinds wij de gratis beschikbaarheid van ons hulpmiddel aankondigden, een paar weken geleden, hebben wij meer dan 400 gebruikers uit meer dan een dozijn landen, waarvan de meeste medische artsen en professoren.
Is er nog iets anders dat u zou willen delen over de Corpus Conversion Service en/of hoe het wordt gebruikt in de context van COVID-19?
Een van onze klanten is het Italiaanse energiebedrijf Eni, dat onze technologie gebruikt voor de exploratie van koolwaterstoffen, een complexe en kennisintensieve onderneming die verschillende ingenieurs- en wetenschappelijke disciplines omvat die samenwerken.
Bij Eni is de kennis gebaseerd op de verwerking van grote hoeveelheden geologische, fysieke en geochemische gegevens, die vervolgens worden omgezet in een kennisgrafiek. Geowetenschappers kunnen dan AI gebruiken om relevante informatie te contextualiseren en weer te geven, wat hen zal helpen om betere beslissingen te nemen en alternatieve exploratiescenario’s te identificeren en te verifiëren. Meer specifiek betekent dit voor Eni een meer realistische en nauwkeurige weergave van het geologische model.
Bedankt voor dit zeer belangrijke interview, dit zal onderzoekers ontelbare uren besparen. Lezers die meer willen weten over de technologie, moeten de website van de Corpus Conversion Service bezoeken. Onderzoekers moeten de COVID-19 AI-tool pagina bezoeken. Let op, toegang tot deze resource wordt alleen verleend aan gekwalificeerde onderzoekers.












