Modely a platformy AI
Peter Staar, IBM Vědec, COVID-19 Otevřená Výzkumná Datová Sada – Rozhovorová Série

Vědec IBM Peter Staar vyvinul nástroj AI, který používají více než 300 odborníků, kteří vyvíjejí léčbu nebo očkování proti COVID-19.
Aby mohli výzkumníci rychle získat přístup k strukturovaným a nestrukturovaným údajům, nabízí IBM cloudový výzkumný zdroj AI, který byl vyškolován na korpusu více než 45 000 vědeckých článků obsažených v datové sadě COVID-19 Open Research Dataset (CORD-19), připravené Bílým domem a koalicí výzkumných skupin, a licencovaných databází z DrugBank, Clinicaltrials.gov a GenBank.
Dr. Peter Staar se připojil k IBM Research – Zurich Laboratory v červenci 2015 jako postdoktorální výzkumný pracovník v projektu Foundations of Cognitive Solutions. Belgický vědec poprvé přišel do IBM Research jako letní student v roce 2006.
Poprvé jste se připojili k IBM Research – Zurich Laboratory v červenci 2015. Na jakých projektech jste pracoval v IBM?
Moje počáteční výzkum se zaměřil na aplikace pro vysokovýkonné výpočetní techniky a byl součástí vítězného týmu pro prestižní cenu ACM Gordon Bell.
V roce 2017 jsem začal soustředit na AI a v srpnu 2018 můj tým publikoval článek na konferenci ACM Conference on Knowledge Discovery and Data Mining (KDD 2018) o rozsáhlém systému pro ingestování dokumentů, který jsme nazvali Corpus Conversion Service. Tento nástroj AI založený na cloudu byl schopen ingestovat 100 000 PDF stránek denně (i skenovaných dokumentů) s přesností nad 97 procenty – a poté aplikovat pokročilé modely strojového učení, které extrahují obsah z těchto dokumentů v měřítku, které nebylo dříve dosaženo. Nyní aplikujeme tuto technologii na pomoc výzkumníkům s COVID-19.
Kdy poprvé IBM přišla na myšlenku použití Corpus Conversion Service pro boj s epidemií COVID-19?
V polovině března vedl Bílý dům úsilí o zveřejnění více než 45 000 dokumentů o koronaviru a COVID-19. Když jsme viděli korpus, rychle jsme si uvědomili, že naše technologie může pomoci, nejen aby se PDF soubory staly vyhledatelnými, ale také aby se znalosti v těchto PDF souborech kombinovaly s dalšími datovými sadami, jako je Drugbank, GenBank a Clinicaltrials.gov. Služba byla spuštěna 3. dubna.
Jak byste nejlépe popsali, co je Corpus Conversion Service?
Jako u každé velké množství různorodých zdrojů dat je obtížné efektivně agregovat a analyzovat tato data způsoby, které mohou vést k vědeckým poznatkům. Usnadňujeme to pomocí znalostního grafu, který nachází spojení mezi těmito zdroji dat, aby potenciálně vedl k novým poznatkům.
Můžete diskutovat o hlavním výzvě při extrahování dat z formátu PDF do vyhledatelné formy?
Podle Adobe (ADBE ) existuje přibližně 2,5 bilionu souborů Portable Document Format (PDF) v oběhu. Představte si znalosti, které tyto soubory obsahují: vědecké články, technickou literaturu a mnoho dalšího. Ale veškerý tento obsah je „tmavý“ nebo nevyužitý, protože dosud jsme neměli způsob, jak ingestovat velké množství PDF souborů v měřítku a učinit jejich obsah využitelným (nebo strukturovaným).
Soubory PDF často zahrnují kombinaci vektorové grafiky, textu a bitmapové grafiky, což vše činí extrakci kvalitativních a kvantitativních dat bastante výzvou. Skutečně, konverze automatické rekonstrukce obsahu byla problémem po více než deset let. Ačkoli existuje mnoho řešení pro konverzi dokumentů, žádná z nich nezahrnuje škálovatelnost nebo aplikaci AI, což znamená, že musí spoléhat na drahá lidská údržba a aktualizace.
Naše znalosti naznačují, že Corpus Conversion Service je prvním komplexním systémem, který využívá pokročilou AI na této úrovni škálovatelnosti. Zatímco stávající řešení mohou konvertovat pouze jeden dokument najednou do požadovaného výstupního formátu, náš nástroj může ingestovat celé kolekce, korpus dokumentů, a vytvářet modely strojového učení na základě toho.
Jak extrahujete nejen text, který je obsažen v dokumentu, ale také strukturu?
Klíčovým prvkem je, že jsme navrhli interakci mezi člověkem a počítačem v systému, aby umožňoval velmi rychlou a masivní anotaci bez jakýchkoli znalostí počítačové vědy. Tento přechod na strojové učení dává naší službě velkou flexibilitu, protože se může rychle přizpůsobit určitým šablonám dokumentů, dosáhnout vysoce přesných výsledků a nakonec eliminovat nákladnou a časově náročnou úpravu typickou pro tradiční algoritmy založené na pravidlech.
Můžete diskutovat o výzvách při budování modelu strojového učení, který může škálovat a reagovat rychle na stovky a potenciálně tisíce současných uživatelů?
Wir entwickelten Corpus Conversion Service na základě nejmodernějších cloudových služeb, jako je OpenShift na IBM Cloud. To nám umožňuje škálovat naše aplikace bez úsilí s rostoucí poptávkou. Modely AI, které aplikujeme, lze tedy použít mnoha uživateli současně.
Kolik dokumentů bylo ingestováno do služby?
Máme několik průmyslových klientů, kteří používají naše nástroje, takže nevíme, kolik dokumentů ingestovali, protože každý z nich má svou vlastní instanci IBM Cloud. Ale pro COVID-19 jsme ingestovali všechny 45 826 článků z Bílého domu.
Jak reagovala výzkumná komunita na použití tohoto nástroje AI?
Od té doby, co jsme oznámili bezplatnou dostupnost našeho nástroje před několika týdny, máme více než 400 uživatelů z více než deseti zemí, většina z nich jsou lékaři a profesoři.
Je něco jiného, co byste chtěl sdílet o Corpus Conversion Service a / nebo o tom, jak je používán v kontextu COVID-19?
Jedním z našich klientů je italská energetická firma Eni, která používá naši technologii pro průzkum uhlovodíků, což je složitý a znalostně náročný obchod, který zahrnuje různé inženýrské a vědecké disciplíny, které spolupracují.
U Eni je znalost založena na zpracování velkých množství geologických, fyzikálních a geochemických dat, která jsou poté zpracována do znalostního grafu. Geovědci mohou poté použít AI, aby kontextualizovali a představili relevantní informace, což jim pomůže zlepšit rozhodování a identifikaci a ověření možných alternativních scénářů průzkumu. Konkrétněji pro Eni to znamená více realistický a přesný geologický model.
Děkuji vám za tento velmi důležitý rozhovor, tento bude šetřit výzkumníkům nespočet hodin. Čtenáři, kteří chtějí dozvědět se více o technologii, by měli navštívit webovou stránku Corpus Conversion Service. Výzkumníci by měli navštívit stránku COVID-19 AI nástroje. Poznámka, přístup k tomuto zdroji bude udělen pouze kvalifikovaným výzkumníkům.












