Tankeledere

Aktivering af virkelighedsnære AI-installationer i stor målestok

mm
Føj Unite.AI til dine foretrukne kilder på Google

Af Brad King, felt-CTO, Scality

Værktøjerne til AI/ML og big data har en fælles tråd – de har brug for data, og de har brug for meget af det. Konventionel visdom siger, at jo mere, jo bedre. Analytikere forudser, at den globale dataoprettelse vil vokse til mere end 180 zettabytes i 2025 – og i 2020 nåede mængden af data, der blev oprettet og kopieret, et nyt højdepunkt på 64,2 zettabytes.

Denne data er ekstremt værdifuld – ofte er den uerstattelig og repræsenterer en gangs eller en enkelt lejlighedsbegivenhed. Denne data skal gemmes sikkert og sikret; og selvom det estimeres, at kun en lille procentdel af denne nyoprettede data gemmes, fortsætter efterspørgslen på lagringskapacitet med at vokse. Faktisk forventes den installeret base af lagringskapacitet at vokse med en årlig vækstrate på 19,2% mellem 2020 og 2025, ifølge forskere fra Statista.

Med mere data, der bliver oprettet – især af disse AI/ML-arbejdsbyrder – har organisationer brug for mere lagring, men ikke alle lagringsløsninger kan håndtere disse intensive og massive arbejdsbyrder. Hvad der er nødvendigt, er en ny tilgang til lagring. Lad os se, hvordan organisationer overvinder disse udfordringer gennem tre brugsændringer.

Rejseindustrien

Mens mange af os lige er ved at vænne os til at rejse igen efter mere end et år med lockdowns, ser rejseindustrien frem til at komme tilbage til tiden før pandemien på en stor måde. Og det gør dataens – specifikt den relevante anvendelse og brug af data – betydning endnu mere vigtig.

Forestil dig, hvad du kunne gøre med viden om, hvor de fleste af verdens flypassagerer skal rejse hen i morgen eller hvor de skal rejse i morgen. For en rejsebureau, for eksempel, ville det være enormt.

Men disse rejseorganisationer har med så meget data at gøre, at det er overvældende at finde ud af, hvad der er meningsfuldt. Omkring en petabyte data genereres hver dag, og nogle af dataene er duplicerede af sites som Kayak. Disse data er tidsfølsomme, og rejsefirmaer har brug for at opdage hurtigt, hvilke data der er meningsfulde. De har brug for et værktøj til at kunne håndtere denne niveau af skala mere effektivt.

Bilindustrien

Et andet eksempel kommer fra bilindustrien, som bestemt er en af de mest omtalte brugsændringer. Branchen har arbejdet hårdt i lang tid med hjælpemidler som lane-mindere, kollisionsundgåelse og lignende. Alle disse sensorer bringer store mængder af data med. Og selvfølgelig udvikler, tester og verificerer de selvstyrende algoritmer.

Hvad branchen har brug for, er en bedre måde at give mening til denne gemte data, så de kan bruge den til at analysere tilfælde, hvor noget gik galt, kuraterer sensorudgang som en testcase, testalgoritmer mod sensordata og mere. De har brug for QA-testning for at undgå tilbageskridt, og de har brug for at dokumentere tilfælde, der fejler.

Digital patologi

Et andet interessant eksempel på AI/ML, der også kæmper med dataoversvømmelsen og behovet for at gøre bedre brug af data, er digital patologi. Ligesom de andre eksempler har de virkelig brug for at kunne gøre bedre brug af disse data, så de kan gøre ting som automatisk at opdage patologier i vævsprøver, udføre fjern-diagnosticering og så videre.

Men lagring i dag begrænser brugen. Billeder med nyttig opløsning er for store til at gemme økonomisk. Men hurtig objektlagring vil aktivere nye evner – som billedbanker, der kan bruges som en nøgletræningsressource, og brugen af rum-fyldende kurver til at navngive og gemme multiresolutionsbilleder i et objektlager. Det gør det også muligt at udvide og fleksible metadata-mærkninger, hvilket gør det lettere at søge efter og give mening til denne information.

AI-arbejdsbyrder kræver en ny tilgang

Som vi har set i de tre ovennævnte tilfælde er det kritisk at kunne aggregere og orkestrere enorme mængder af data i forbindelse med AI/ML-arbejdsbyrder. Datamængder når ofte multi-petabyte-skalaen, med ydelseskrav, der kan mætte hele infrastrukturen. Når man har med så store trænings- og testdatamængder at gøre, er det afgørende at overvinde lagringsbottlenecks (latence- og/eller gennemløbstilfælde) og kapacitetsbegrænsninger/barrierer.
AI/ML/DL-arbejdsbyrder kræver en lagringsarkitektur, der kan holde data flydende gennem røret, med både fremragende rå-ydelse og kapacitetsudvidelsesevne. Lagringsinfrastrukturen skal følge med de stadig mere krævende krav på tværs af alle stadier i AI/ML/DL-røret. Løsningen er en lagringsinfrastruktur, der specifikt er bygget til hastighed og ubegrænset skala.

Værdiudtrækning

Der går ikke en uge, uden at der er historier om AI’ens og ML’s potentiale til at ændre forretningsprocesser og hverdagsliv. Der er mange brugsændringer, der tydeligt demonstrerer fordelene ved at bruge disse teknologier. Virkeligheden for AI i virksomhederne i dag er dog en af overvældende store datamængder og lagringsløsninger, der ikke kan håndtere disse massive arbejdsbyrder. Innovationer i biler, sundhedspleje og mange andre brancher kan ikke fortsætte, før lagringsproblemet er løst. Hurtig objektlagring overvinder udfordringen med at fastholde big data, så organisationer kan udtrække værdien fra disse data for at føre deres forretninger fremad.

Som felt CTO er Brad King ansvarlig for designet af de største systemer Scality udruller verden over. Dette inkluderer multi-petabyte, multi-site systemer med hundredvis af servere. Brad er en af medstifterne af Scality. Han startede sin multifacetterede karriere som en skibsarkitekt med den franske flåde, hvor han udførte numeriske simulationer af skibskapsejl og bølger omkring store skibe. Han sluttede sig derefter til et Schlumberger-forskningslaboratorium i Paris i flere år, hvor han arbejdede med turbulente fluidodynamik, laboratorieautomatisering, storstilet parallel numerisk simulation og nye internetteknologier, herunder overvågning af NCSA-projekter (såsom Mosaic) finansieret af Schlumberger.