AI-modeller og plattformer

Forskere utvikler alternativ til GPU

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Datavitenskapsfolk fra Rice University, sammen med samarbeidspartnere fra Intel (INTC ), har utviklet et mer kostnadseffektivt alternativ til GPU. Den nye algoritmen kalles “sub-linear deep learning engine” (SLIDE), og den bruker generelle formål sentrale prosessorer (CPUs) uten spesialisert akselerasjonshardware.

Resultatene ble presentert på Austin Convention Center, som holder maskinlæringskonferansen MLSys.

En av de største utfordringene innen kunstig intelligens (AI) omgår spesialisert akselerasjonshardware som grafikkprosessorer (GPUs). Før de nye utviklingene, trodde man at det var nødvendig å bruke denne spesialiserte akselerasjonshardware for å accelerere dypt lærings-teknologi.

Mange selskaper har lagt stor vekt på å investere i GPUs og spesialisert hardware for dypt lærings-teknologi, som er ansvarlig for teknologi som digitale assistenter, ansiktsgjenkjenning og produktranke-systemer. Et slikt selskap er Nvidia (NVDA ), som lager Tesla (TSLA ) V100 Tensor Core GPUs. Nvidia rapporterte nylig en økning på 41% i deres fjerde kvartals inntekter sammenlignet med i fjor.

Utviklingen av SLIDE åpner opp helt nye muligheter.

Anshumali Shrivastava er en assistentprofessor ved Rice’s Brown School of Engineering og hjalp til å oppfinne SLIDE sammen med masterstudenter Beidi Chen og Tharun Medini.

“Våre tester viser at SLIDE er den første smarte algoritme- implementeringen av dypt lærings-teknologi på CPU som kan overgå GPU-hardware akselerasjon på industriskala anbefalingsdatasett med store fullt koblet arkitekturer,” sa Shrivastava.

SLIDE kommer forbi utfordringen med GPUs på grunn av sin helt forskjellige tilnærming til dypt lærings-teknologi. For tiden er den standard treningsteknikken for dype neurale nettverk “back propagation”, og den krever matrisemultiplikasjon. Denne arbeidsbyrden krever bruk av GPUs, så forskerne endret neuralt nettverks-trening så det kunne løses med hashtabeller.

Denne nye tilnærmingen reduserer betraktelig den beregningsmessige arbeidsbyrden for SLIDE. Den nåværende beste GPU-plattformen som selskaper som Amazon (AMZN ) og Google (GOOGL ) bruker for sky-basert dypt lærings-teknologi har åtte Tesla V100, og prisetiketten er rundt 100 000 dollar.

“Vi har en i laboratoriet, og i vårt testtilfelle tok vi en arbeidsbyrd som er perfekt for V100, en med over 100 millioner parametre i store, fullt koblet nettverk som passer i GPU-minne,” sa Shrivastava. “Vi trente det med det beste (programvare) pakket der ute, Googles TensorFlow, og det tok 3 og en halv time å trene.

“Vi viste så at vår nye algoritme kan gjøre treningen på en time, ikke på GPUs, men på en 44-kjerne Xeon-klasse CPU,” fortsatte han.

Hashing er en type data-indeksmetode oppfunnet på 1990-tallet for internett-søk. Numeriske metoder brukes til å kode store mengder informasjon som en streng av siffer, som kalles en hash. Hasher listes for å lage tabeller som kan søkes raskt.

“Det ville ha vært meningsløst å implementere vår algoritme på TensorFlow eller PyTorch fordi det første de vil gjøre er å konvertere hva du gjør til en matrisemultiplikasjon-problem,” sa Chen. “Det er nettopp det vi ville komme vekk fra. Så vi skrev vår egen C++-kode fra scratch.”

Ifølge Shrivastava er den største fordelen med SLIDE at den er data-parallell.

“Med data-parallell mener jeg at hvis jeg har to data-eksempler som jeg ønsker å trene på, la oss si ett er et bilde av en katt og det andre er et bilde av en buss, vil de sannsynligvis aktivere forskjellige nerver, og SLIDE kan oppdatere, eller trene på disse to uavhengig,” sa han. “Dette er mye bedre utnyttelse av parallellitet for CPUs.”

“Baksiden, sammenlignet med GPU, er at vi krever mye minne,” sa han. “Det er en cache-hierarki i hovedminnet, og hvis du ikke er forsiktig med det, kan du løpe inn i et problem som kalles cache-thrashing, hvor du får mange cache-misser.”

SLIDE har åpnet døren for nye måter å implementere dypt lærings-teknologi på, og Shrivastava tror det er bare begynnelsen.

“Vi har bare skrapet overflaten,” sa han. “Det er mye vi kan gjøre for å optimere. Vi har ikke brukt vektorisering, for eksempel, eller innebygde akseleratorer i CPU, som Intel Deep Learning Boost. Det er mange andre triks vi kunne bruke for å gjøre dette enda raskere.”

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.