Modele i platformy AI
Peter Staar, naukowiec IBM, COVID-19 Open Research Dataset – seria wywiadów

Naukowiec IBM Peter Staar opracował narzędzie AI, które jest używane przez ponad 300 ekspertów, którzy pracują nad leczeniem lub szczepionką na COVID-19.
Aby pomóc badaczom w szybkim dostępie do danych strukturalnych i niestrukturalnych, IBM oferuje chmurowe zasoby badawcze AI, które zostały opracowane na podstawie korpusu ponad 45 000 artykułów naukowych zawartych w COVID-19 Open Research Dataset (CORD-19), przygotowanym przez Biały Dom i koalicję grup badawczych, oraz licencjonowanych baz danych z DrugBank, Clinicaltrials.gov i GenBank.
Dr Peter Staar dołączył do laboratorium badawczego IBM w Zurichu w lipcu 2015 roku jako stypendysta badawczy w projekcie Foundations of Cognitive Solutions. Urodzony w Belgii naukowiec po raz pierwszy przyjechał do IBM Research jako student letni w 2006 roku.
Po raz pierwszy dołączyłeś do laboratorium badawczego IBM w Zurichu w lipcu 2015 roku. Jakie projekty realizowałeś w IBM?
Początkowo moje badania koncentrowały się na aplikacjach obliczeń wysokowydajnych i byłem częścią zespołu, który wygrał prestiżową nagrodę ACM Gordon Bell.
W 2017 roku zacząłem się zajmować sztuczną inteligencją, a w sierpniu 2018 roku moja drużyna opublikowała artykuł na konferencji ACM Conference on Knowledge Discovery and Data Mining (KDD 2018) na temat ogromnie skalowalnego systemu konwersji dokumentów, który nazwaliśmy Corpus Conversion Service. To narzędzie oparte na chmurze mogło przyjmować 100 000 stron dokumentów PDF dziennie (nawet skanowanych) z dokładnością powyżej 97 procent, a następnie trenować i stosować zaawansowane modele uczenia maszynowego, które wyodrębniają treść z tych dokumentów w skali, jakiej nie osiągnięto wcześniej. Teraz stosujemy tę samą technologię, aby pomóc badaczom w walce z COVID-19.
Kiedy IBM po raz pierwszy zainteresowało się pomysłem wykorzystania Corpus Conversion Service do walki z epidemią COVID-19?
W połowie marca Biały Dom podjął starania, aby opublikować ponad 45 000 dokumentów na temat koronawirusa i COVID-19. Gdy zobaczyliśmy korpus, szybko zrozumieliśmy, że nasza technologia może pomóc, nie tylko uczynić pliki PDF wyszukiwalnymi, ale także połączyć wiedzę zawartą w tych plikach z dodatkowymi zestawami danych, takimi jak Drugbank, GenBank i Clinicaltrials.gov. Uruchomiliśmy usługę 3 kwietnia.
Jak najlepiej opisałbyś, czym jest Corpus Conversion Service?
Podobnie jak w przypadku każdego dużego wolumenu źródeł danych, trudno jest wydajnie agregować i analizować te dane w sposób, który może przynieść naukowe spostrzeżenia. Ułatwiamy to, używając grafu wiedzy, który znajduje połączenia między tymi źródłami danych, co może potencjalnie przynieść nową wiedzę.
Czy możesz omówić główne wyzwania związane z wyodrębnieniem danych z formatu PDF do postaci wyszukiwalnej?
Zgodnie z danymi Adobe (ADBE ), istnieje około 2,5 biliona plików Portable Document Format (PDF) obecnie w obiegu. Pomyśl o wiedzy, którą zawierają te pliki: artykuły naukowe, literatura techniczna i wiele innych. Ale cała ta treść jest “ciemna” lub niewykorzystana, ponieważ do tej pory nie mieliśmy sposobu na przyjmowanie dużej liczby plików PDF w skali i uczynienie ich treści użytecznymi (lub uporządkowanymi).
Pliki PDF często zawierają kombinacje grafiki wektorowej, tekstu i grafiki bitmapowej, co wszystko sprawia, że wyodrębnianie danych jakościowych i ilościowych jest dość wyzwaniem. W rzeczywistości konwersja automatycznego odtwarzania treści była problemem przez ponad dekadę. Chociaż wiele rozwiązań konwersji dokumentów jest dostępnych, żadne z nich nie rozwiązuje problemu skalowalności ani nie stosuje sztucznej inteligencji, co oznacza, że muszą one polegać na drogich, opartych na ludziach rozwiązaniach konserwacyjnych i modernizacyjnych.
Według naszej wiedzy, Corpus Conversion Service jest pierwszym kompleksowym systemem, który wykorzystuje zaawansowaną sztuczną inteligencję na tym poziomie skalowalności. Podczas gdy istniejące rozwiązania mogą tylko przekonwertować jeden dokument na raz do pożądanego formatu wyjściowego, nasze narzędzie może przyjmować całe kolekcje, korpus dokumentów i tworzyć na ich podstawie modele uczenia maszynowego.
Jak wyodrębniasz nie tylko tekst zawarty w dokumencie, ale także strukturę?
Kluczowym elementem jest to, że zaprojektowaliśmy interakcję człowiek-komputer w systemie, aby umożliwić bardzo szybką i masową adnotację bez wiedzy z zakresu informatyki. To przeniesienie do uczenia maszynowego daje naszej usłudze dużą elastyczność, ponieważ może ona szybko adaptować się do określonych szablonów dokumentów, osiągać bardzo dokładne wyniki i ostatecznie eliminować kosztowne i czasochłonne dostosowania typowe dla tradycyjnych algorytmów opartych na regułach.
Czy możesz omówić wyzwania związane z budowaniem modelu uczenia maszynowego, który może skalować się i szybko reagować na setki, a nawet potencjalnie tysiące użytkowników?
Opracowaliśmy Corpus Conversion Service na podstawie najnowocześniejszych usług chmurowych, takich jak OpenShift na IBM Cloud. To pozwala nam na łatwe skalowanie naszej aplikacji wraz ze wzrostem popytu. Modele AI, które stosujemy, mogą być więc używane przez wielu użytkowników jednocześnie.
Ile dokumentów zostało przyjętych do usługi?
Mamy kilku klientów korporacyjnych, którzy używają naszych narzędzi, więc nie wiemy, ile dokumentów przyjęli, ponieważ każdy z nich ma własną instancję IBM Cloud. Ale dla COVID-19 przyjęliśmy wszystkie 45 826 prac z Białego Domu.
Jak zareagowała społeczność badawcza na korzystanie z tego narzędzia AI?
Od momentu ogłoszenia bezpłatnej dostępności naszego narzędzia kilka tygodni temu mamy ponad 400 użytkowników z ponad tuzina krajów, większość z nich to lekarze i profesorowie.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat Corpus Conversion Service i/lub jego użycia w kontekście COVID-19?
Jednym z naszych klientów jest włoski koncern energetyczny Eni, który używa naszej technologii do poszukiwania węglowodorów, co jest skomplikowanym i wymagającym wiedzy biznesem, który obejmuje różne dyscypliny inżynierskie i naukowe pracujące razem.
W Eni wiedza oparta jest na przetwarzaniu dużych ilości danych geologicznych, fizycznych i geochemicznych, które są następnie przetwarzane w graf wiedzy. Geolodzy mogą następnie używać sztucznej inteligencji, aby kontekstualizować i prezentować istotne informacje, co pomoże im w podejmowaniu decyzji i identyfikowaniu oraz weryfikowaniu możliwych alternatywnych scenariuszy poszukiwań. Konkretnie, dla Eni oznacza to bardziej realistyczne i precyzyjne przedstawienie modelu geologicznego.
Dziękujemy za ten bardzo ważny wywiad, który zaoszczędzi badaczom niezliczoną ilość godzin. Czytelnicy, którzy chcą dowiedzieć się więcej o technologii, powinni odwiedzić stronę Corpus Conversion Service. Badacze powinni odwiedzić stronę COVID-19 AI tool. Proszę zauważyć, że dostęp do tego zasobu zostanie udzielony tylko wykwalifikowanym badaczom.












