Liderzy opinii

Włączanie wdrożeń sztucznej inteligencji w skali

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Przez Brada Kinga, field CTO, Scality

Narzędzia AI/ML i big data mają wspólny wątek – potrzebują danych, i potrzebują ich dużo. Konwencjonalna mądrość mówi, że im więcej, tym lepiej. Analitycy przewidują, że globalna tworzenie danych wzrośnie do ponad 180 zettabajtów do 2025 roku – a w 2020 roku ilość danych utworzonych i skopiowanych osiągnęła nowy rekord 64,2 zettabajtów.

Te dane są niezwykle cenne – często niezastąpione i czasem reprezentujące jednorazowe lub raz na całe życie zdarzenia. Dane te muszą być przechowywane w sposób bezpieczny i zabezpieczony; i chociaż szacuje się, że tylko niewielki procent nowo tworzonych danych jest przechowywany, popyt na pojemność magazynu nadal rośnie. W rzeczywistości zainstalowana baza pojemności magazynu ma wzrosnąć o 19,2% w latach 2020-2025, według badaczy z Statista.

Z większą ilością tworzonych danych – szczególnie przez te obciążenia AI/ML – organizacje potrzebują więcej miejsca do magazynowania, ale nie wszystkie rozwiązania magazynowania mogą obsłużyć te intensywne i ogromne obciążenia. Co jest potrzebne, to nowe podejście do magazynowania. Zobaczmy, jak organizacje pokonują te wyzwania poprzez pryzmat trzech przypadków użycia.

Przemysł podróżniczy

Chociaż wielu z nas dopiero zaczyna przyzwyczajać się do podróżowania ponownie po ponad roku lockdownów, przemysł podróżniczy stara się wrócić do czasów sprzed pandemii w znaczący sposób. I to sprawia, że znaczenie danych – szczególnie odpowiedniego zastosowania tych danych – staje się jeszcze bardziej istotne.

Wyobraź sobie, co mogłoby się stać, gdybyś miał wiedzę o tym, gdzie większość podróżników lotniczych będzie podróżować jutro lub gdzie będą podróżować następnego dnia. Dla agencji turystycznej, na przykład, byłoby to ogromne.

Ale te organizacje podróżnicze mają do czynienia z tak ogromną ilością danych, że przeszukiwanie ich w celu ustalenia, co jest istotne, jest przytłaczającym wyzwaniem. Codziennie generowany jest około jednego petabajta danych, a część z tych danych jest powielana przez strony takie jak Kayak. Dane te są czasowo istotne, a firmy podróżnicze muszą szybko odkryć, które dane są istotne. Potrzebują narzędzia, które pozwoli im zarządzać tym poziomem skali w sposób bardziej efektywny.

Przemysł samochodowy

Innym przykładem jest przemysł samochodowy, który jest jednym z najbardziej omawianych przypadków użycia. Przemysł ten od dawna pracuje nad narzędziami wspomagającymi, takimi jak utrzymanie pasa ruchu, unikanie kolizji itp. Wszystkie te sensory dostarczają ogromne ilości danych. I, oczywiście, rozwijają, testują i weryfikują algorytmy samochodów autonomicznych.

Co potrzebuje ten przemysł, to lepszy sposób, aby zrozumieć te przechowywane dane, aby mogli je wykorzystać do analizy incydentów, gdzie coś poszło nie tak, wyselekcjonować dane sensoryczne jako przypadki testowe, przetestować algorytmy na danych sensorycznych itd. Potrzebują testów QA, aby uniknąć regresji, i muszą udokumentować przypadki, które nie powiodły się.

Cyfrowa patologia

Innym interesującym przypadkiem użycia sztucznej inteligencji i maszynowego uczenia, który również boryka się z lawiną danych i potrzebą lepszego wykorzystania danych, jest cyfrowa patologia. Podobnie jak w poprzednich przykładach, co potrzebne jest, to możliwość lepszego wykorzystania tych danych, aby można było wykonywać takie czynności, jak automatyczne wykrywanie patologii w próbkach tkanek, wykonywanie zdalnej diagnostyki itd.

Ale dzisiejsze rozwiązania magazynowania ograniczają ich użycie. Obrazy o przydatnej rozdzielczości są zbyt duże, aby przechowywać je ekonomicznie. Jednak szybki magazyn obiektowy umożliwi nowe możliwości – takie jak banki obrazów, które mogą być wykorzystywane jako kluczowy zasób szkoleniowy, oraz wykorzystanie krzywych wypełniających przestrzeń do nazwania i przechowywania obrazów o wielu rozdzielczościach w magazynie obiektowym. Umożliwia również rozszerzalne i elastyczne tagowanie metadanych, co ułatwia wyszukiwanie i zrozumienie tych informacji.

Obciążenia sztucznej inteligencji wymagają nowego podejścia

Jak widzieliśmy w trzech przypadkach powyżej, jest krytyczne, aby można było agregować i orchestrować ogromne ilości danych związanych z obciążeniami sztucznej inteligencji i maszynowego uczenia. Zbiory danych często osiągają skalę wielu petabajtów, z wymaganiami dotyczącymi wydajności, które mogą nasycić całą infrastrukturę. Przy radzeniu sobie z takimi dużymi zbiorami danych szkoleniowych i testowych, pokonywanie wąskich gardeł magazynowania (opóźnień i/lub problemów z przepustowością) oraz ograniczeń pojemności/bariery są kluczowymi elementami sukcesu.

Obciążenia sztucznej inteligencji, maszynowego uczenia i głębokiego uczenia wymagają architektury magazynowania, która może utrzymać przepływ danych przez potok, z doskonałą surową wydajnością wejścia/wyjścia oraz możliwością skalowania pojemności. Infrastruktura magazynowania musi nadążać za coraz bardziej wymagającymi wymaganiami we wszystkich etapach potoku sztucznej inteligencji, maszynowego uczenia i głębokiego uczenia. Rozwiązaniem jest infrastruktura magazynowania specjalnie zaprojektowana dla szybkości i nieograniczonej skali.

Wyciąganie wartości

Nie mija tydzień, aby nie było historii o potencjale sztucznej inteligencji i maszynowego uczenia do zmiany procesów biznesowych i codziennego życia. Istnieje wiele przypadków użycia, które wyraźnie demonstrują korzyści z wykorzystania tych technologii. Rzeczywistość sztucznej inteligencji w przedsiębiorstwach dzisiaj jest jednak jedną z ogromnych zbiorów danych i rozwiązań magazynowania, które nie mogą obsłużyć tych ogromnych obciążeń. Innowacje w samochodach, opiece zdrowotnej i wielu innych branżach nie mogą się rozwijać, dopóki problem magazynowania nie zostanie rozwiązany. Szybki magazyn obiektowy pokonuje wyzwanie przechowywania dużych zbiorów danych, aby organizacje mogły wyciągać wartość z tych danych, aby mogły rozwijać swoje biznesy.

Jako field CTO, Brad King jest odpowiedzialny za projektowanie największych systemów, które Scality wdrożone są na całym świecie. Obejmują one systemy wielopetabajtowe, wielomiejscowe z setkami serwerów. Brad jest jednym z założycieli Scality. Rozpoczął swoją wielowymiarową karierę jako architekt morski we francuskiej marynarce wojennej, wykonując symulacje numeryczne przewrócenia statku i fal wokół dużych statków. Następnie dołączył do laboratorium badawczego Schlumberger w Paryżu na kilka lat, gdzie pracował nad dynamiką turbulentnego płynu, automatyką laboratoryjną, dużymi, równoległymi symulacjami numerycznymi oraz nowymi technologiami internetowymi, w tym monitorowaniem projektów NCSA (takich jak Mosaic) finansowanych przez Schlumberger.