Modele și platforme AI

Peter Staar, om de știință IBM, COVID-19 Open Research Dataset – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Omul de știință IBM, Peter Staar, a dezvoltat un instrument AI care este utilizat de peste 300 de experți care lucrează la un tratament sau vaccin pentru COVID-19.

Pentru a ajuta cercetătorii să aibă acces rapid la date structurate și nestructurate, IBM oferă o resursă de cercetare bazată pe cloud care a fost instruită pe un corpus de peste 45.000 de articole științifice conținute în COVID-19 Open Research Dataset (CORD-19), pregătit de Casa Albă și o coaliție de grupuri de cercetare, și baze de date licențiate de la DrugBank, Clinicaltrials.gov și GenBank.

Dr. Peter Staar s-a alăturat laboratorului IBM Research – Zurich în iulie 2015 ca bursier postdoctoral în proiectul Foundations of Cognitive Solutions. Omul de știință belgian a venit pentru prima dată la IBM Research ca student de vară în 2006.

Când ai început să lucrezi la IBM Research – Zurich Laboratory în iulie 2015, ce tipuri de proiecte ai lucrat?

Inițial, cercetarea mea s-a concentrat pe aplicații pentru calculul de înaltă performanță și am făcut parte din echipa care a câștigat prestigiosul premiu ACM Gordon Bell.

Mai recent, în jurul anului 2017, am început să mă concentrez pe AI, iar în august 2018, echipa mea a publicat un articol la Conferința ACM pe Descoperirea și Mineritul Cunoașterii (KDD 2018) despre un sistem de ingestiune de documente masiv scalabil, pe care l-am numit Corpus Conversion Service. Acest instrument bazat pe AI a putut ingera 100.000 de pagini PDF pe zi (chiar și documente scanate) cu o acuratețe de peste 97 la sută – și apoi a instruit și aplicat modele avansate de învățare automată care extrag conținutul din aceste documente la o scară niciodată atinsă înainte. Acum aplicăm aceeași tehnologie pentru a ajuta cercetătorii cu COVID-19.

Când a venit IBM cu ideea de a utiliza Corpus Conversion Service pentru a combate epidemia COVID-19?

La mijlocul lunii martie, Casa Albă a condus un efort pentru a publica peste 45.000 de documente despre coronavirus și COVID-19. Când am văzut corpusul, am realizat rapid că tehnologia noastră poate ajuta, nu numai pentru a face PDF-urile căutabile, ci și pentru a combina cunoștințele din aceste PDF-uri cu seturi de date suplimentare, cum ar fi Drugbank, GenBank și Clinicaltrials.gov. Am lansat serviciul pe 3 aprilie.

Cum ai descrie cel mai bine ce este Corpus Conversion Service?

Ca și în cazul oricărui volum mare de surse de date disparate, este dificil să agregăm și să analizăm aceste date în moduri care pot oferi insight-uri științifice. Facem acest lucru mai ușor utilizând un grafic de cunoaștere care găsește legături între aceste surse de date pentru a obține cunoștințe noi.

Poți discuta despre principala provocare a extragerii datelor din formatul PDF într-o formă căutabilă?

Conform Adobe (ADBE ), există aproximativ 2,5 trilioane de fișiere PDF în circulație. Gândiți-vă la cunoștințele pe care le conțin aceste fișiere: articole științifice, literatură tehnică și multe altele. Dar tot acest conținut este “întunecat” sau nefolosit, deoarece până acum nu am avut niciun mod de a ingera un număr mare de fișiere PDF la scară și de a face conținutul lor utilizabil (sau structurat).

Fișierele PDF conțin adesea combinații de grafică vectorială, text și grafică bitmap, toate acestea făcând extragerea datelor calitative și cantitative destul de provocatoare. De fapt, conversia conținutului automat a fost o problemă de peste un deceniu. Deși există multe soluții de conversie a documentelor, niciuna dintre ele nu abordează problema scalabilității sau nu utilizează AI, ceea ce înseamnă că trebuie să se bazeze pe întreținerea și actualizarea umană costisitoare.

Corpus Conversion Service este, după cunoștința noastră, primul sistem cuprinzător care utilizează AI la acest nivel de scalabilitate. În timp ce soluțiile existente pot converti doar un document la un moment dat într-un format de ieșire dorit, instrumentul nostru poate ingera întregi colecții, un corpus de documente, și poate construi modele de învățare automată pe baza acestora.

Cum extrageți nu numai textul conținut într-un document, ci și structura?

Un element cheie este că am proiectat interacțiunea om-calculator în sistem pentru a permite o annotare foarte rapidă și masivă fără cunoștințe de știință computerizată. Acest schimb către învățarea automată oferă serviciului nostru o mare flexibilitate, deoarece poate adapta rapid la anumite șabloane de documente, poate obține rezultate foarte precise și, în final, poate elimina reglarea costisitoare și consumatoare de timp, tipică pentru algoritmii tradiționali bazati pe reguli.

Poți discuta despre provocările construirii unui model de învățare automată care poate scala și răspunde rapid la sute și chiar mii de utilizatori concurenți?

Am dezvoltat Corpus Conversion Service pe baza unor servicii cloud de ultimă generație, cum ar fi OpenShift pe IBM Cloud. Acest lucru ne permite să scalăm aplicația noastră fără efort cu cererea crescută. Modelele de AI pe care le aplicăm pot fi utilizate de mulți utilizatori concurenți.

Câte documente au fost ingerate în serviciu?

Aveam mai mulți clienți industriali care utilizează instrumentele, așa că nu știm câte documente au ingerrat, deoarece fiecare are propria instanță IBM Cloud. Dar pentru COVID-19, am ingerrat toate cele 45.826 de articole de la Casa Albă.

Cum a reacționat comunitatea de cercetare la utilizarea acestui instrument AI?

De când am anunțat disponibilitatea gratuită a instrumentului nostru, acum câteva săptămâni, am avut peste 400 de utilizatori din peste o duzină de țări, majoritatea fiind medici și profesori.

Există ceva altceva pe care ai vrea să-l împărtășești despre Corpus Conversion Service și/sau despre modul în care este utilizat în contextul COVID-19?

Unul dintre clienții noștri este compania italiană de energie Eni, care utilizează tehnologia noastră pentru explorarea hidrocarburilor, care este o afacere complexă și intensivă din punct de vedere al cunoașterii, care implică diverse discipline inginerești și științifice care lucrează împreună.

La Eni, cunoașterea se bazează pe prelucrarea unor cantități mari de date geologice, fizice și geo-chimice, care sunt apoi prelucrate într-un grafic de cunoaștere. Geologii pot utiliza apoi AI pentru a contextualiza și prezenta informații relevante, ceea ce va ajuta la îmbunătățirea procesului de luare a deciziilor și la identificarea și verificarea unor scenarii alternative de explorare. Mai specific, pentru Eni, acest lucru înseamnă o reprezentare mai realistă și precisă a modelului geologic.

Mulțumim pentru acest interviu foarte important, care va salva cercetătorilor ore nesfârșite. Citiitorii care doresc să afle mai multe despre tehnologie ar trebui să viziteze site-ul Corpus Conversion Service. Cercetătorii ar trebui să viziteze pagina instrumentului AI COVID-19. Vă rugăm să rețineți că accesul la această resursă va fi acordat numai cercetătorilor calificați.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.