Tankeledere

Aktivering av virkelige AI-utrolleringer i stor skala

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Av Brad King, felt CTO, Scality

Verktøyene for AI/ML og stor data har en felles tråd – de trenger data, og de trenger mye av det. Konvensjonell visdom sier at jo mer, jo bedre. Analytikerne forutser at den globale dataskapingen vil vokse til over 180 zettabytes i 2025 – og i 2020 nådde mengden av data som ble skapt og replisert et nytt høydepunkt på 64,2 zettabytes.

Denne dataen er ekstremt verdifull – ofte er den ikke erstattbar og noen ganger representerer den en gang eller en enkelt gang hendelser. Denne dataen må lagres trygt og sikkert; og selv om det estimeres at bare en liten prosent av denne ny-skapt dataen blir beholdt, fortsetter etterspørselen etter lagringskapasitet å vokse. Faktisk er det installerte basislagringskapasiteten forventet å vokse med en årlig vekstrate på 19,2% mellom 2020 og 2025, ifølge forskere ved Statista.

Med mer data som skapes – spesielt av disse AI/ML-arbeidsbyrdene – trenger organisasjonene mer lagring, men ikke alle lagringsløsninger kan håndtere disse intensive og massive arbeidsbyrdene. Hva som trengs er en ny tilnærming til lagring. La oss se hvordan organisasjonene overvinner disse utfordringene gjennom tre eksempler.

Reiseindustrien

Mens mange av oss bare er vant til å reise igjen etter mer enn ett år med nedstengninger, ser reiseindustrien frem til å komme tilbake til tiden før pandemien på en stor måte. Og dette gjør viktigheten av data – spesielt relevant anvendelse og bruk av denne dataen – enda viktigere.

Forestall hva du kunne gjøre med kunnskapen om hvor majoriteten av verdens flypassasjerer skal reise neste eller hvor de skal gå i morgen. For en reisebyrå, for eksempel, ville det være enormt.

Men disse reiseorganisasjonene håndterer så mye data at å sortere gjennom den for å finne ut hva som er meningsfullt er en overveldende prospekt. Om lag en petabyte data genereres hver dag, og noen av dataene er duplisert av nettsteder som Kayak. Denne dataen er tidssensitiv, og reiseselskapene trenger å oppdage raskt hvilken data som er meningsfull. De trenger et verktøy for å kunne håndtere denne skalaen mer effektivt.

Bilindustrien

Et annet eksempel kommer fra bilindustrien, som er en av de mest omtalte eksemplene. Industrien har vært hardt arbeidende i lang tid med hjelpemidler som lane-mindere, kollisjonsunngåelse og lignende. Alle disse sensorene bringer inn store mengder data. Og, selvfølgelig, utvikler de, tester og verifiserer selvkjørende algoritmer.

Hva industrien trenger er en bedre måte å gi mening til denne lagrede dataen så de kan bruke den til å analysere hendelser hvor noe gikk galt, kuratere sensorutdata som en testfall, teste algoritmer mot sensordata og mer. De trenger QA-testing for å unngå tilbakeslag, og de trenger å dokumentere tilfeller som feiler.

Digital patologi

Et annet interessant eksempel på AI/ML som også sliter med dataflommen og behovet for å gjøre bedre bruk av data er digital patologi. Like som de andre eksemplene, hva de virkelig trenger er evnen til å gjøre bedre bruk av denne dataen så de kan gjøre ting som automatisk detektere patologier i vevsprøver, utføre fjernediagnostikk og så videre.

Men lagring i dag begrenser bruken. Bilder med nyttig oppløsning er for store til å lagre økonomisk. Imidlertid vil rask objektlagring aktivere nye evner – som bildebanker som kan brukes som en nøkkelressurs og bruken av rom-fyllende kurver for å navngi/lagre og hente multiresolusjonsbilder i et objektbutikk. Det aktiverer også utvidbar og fleksibel metadata-merking, som gjør det lettere å søke etter og gi mening til denne informasjonen.

AI-arbeidsbyrdene krever en ny tilnærming

Som vi har sett i de tre eksemplene ovenfor, er det kritisk å kunne aggregere og dirigere enorme mengder data relatert til AI/ML-arbeidsbyrdene. Datamengdene når ofte multi-petabyte-skala, med ytelseskrav som kan mette hele infrastrukturen. Når det gjelder så store trenings- og testdatamengder, er det å overvinne lagringsbottlenecks (latens- og/eller gjennomstrømningsproblemer) og kapasitetsbegrensninger/hindringer nøkkel-elementer for suksess.

AI/ML/DL-arbeidsbyrdene krever en lagringsarkitektur som kan holde data flytende gjennom pipeline, med både utmerket rå ytelse og kapasitets-skaleringsmulighet. Lagringsinfrastrukturen må holde tritt med økende krav over alle stadier av AI/ML/DL-pipeline. Løsningen er en lagringsinfrastruktur spesifikt bygget for hastighet og ubegrenset skala.

Utvinning av verdi

Ikke en uke går uten historier om potensialet for AI og ML til å endre forretningsprosesser og hverdagsliv. Det er mange eksempler som tydelig demonstrerer fordelen med å bruke disse teknologiene. Virkeligheten av AI i bedriftene i dag er en av overveldende store datamengder og lagringsløsninger som ikke kan håndtere disse massive arbeidsbyrdene. Innovasjoner i biler, helse og mange andre industrier kan ikke gå videre før lagringsproblemet er løst. Rask objektlagring overvinner utfordringen med å beholde stor data så organisasjonene kan utvinne verdien fra denne dataen for å flytte sine forretninger fremover.

Som felt CTO er Brad King ansvarlig for design av de største systemene Scality setter i drift over hele verden. Dette inkluderer multi-petabyte, multi-steds systemer med hundrevis av servere. Brad er en av medstifterne av Scality. Han startet sin mangfoldige karriere som en marinearkitekt med den franske marinen, der han utførte numeriske simuleringer av skipskollisjon og bølger rundt store skip. Han gikk deretter til et Schlumberger-forskningslaboratorium i Paris i flere år, der han arbeidet med turbulente fluiddynamikker, laboratorieautomatisering, storskala parallell numeriske simuleringer og nye internett-teknologier, inkludert overvåking av NCSA-prosjekter (som Mosaic) finansiert av Schlumberger.