Ajatusjohtajat

Generatiivisen tekoälynnän tulevaisuus on reunassa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

ChatGPT:n ja yleensä generatiivisen tekoälyn saapuminen on merkittävä käännekohta teknologian historiassa, ja se voidaan verrata internetin ja älypuhelimen syntymään. Generatiivinen tekoäly on osoittanut rajattoman potentiaalinsa kykynsä osallistua älykkäisiin keskusteluihin, suorittaa kokeita, luoda monimutkaisia ohjelmia ja kuvia sekä videoita. Vaikka GPU:t suorittavat useimmat Gen AI -mallit pilvessä – sekä koulutuksessa että päätöksenteossa – tämä ei ole pitkällä aikavälillä skaalautuva ratkaisu, erityisesti päätöksenteon osalta, johtuen tekijöistä kuten kustannuksista, virrasta, viiveestä, yksityisyydestä ja turvallisuudesta. Tässä artikkelissa käsitellään näitä tekijöitä yksityiskohtaisemmin ja esitetään motivaatio esimerkkejä siirtää Gen AI -laskentakuormat reunalle.

Useimmat sovellukset suoritetaan korkean suorituskyvyn prosessoreilla – joko laitteessa (esim. älypuhelimet, tietokoneet, kannettavat tietokoneet) tai tietokeskuksissa. Koska sovellusten osuus, joka hyödyntää tekoälyä, laajenee, nämä prosessorit, joissa on vain CPU, eivät ole riittäviä. Lisäksi generatiivisen tekoälyn työkuormien nopea laajeneminen aiheuttaa eksponentiaalisen kasvun tekoälyyn perustuvien palvelimien kysynnän, joissa on kalliit, virtaa vievät GPU:t, mikä puolestaan kasvattaa infrastruktuurin kustannuksia. Nämä tekoälyyn perustuvat palvelimet voivat maksaa jopa 7-kertaisen normaalin palvelimen hinnan, ja GPU:t vastaavat 80 % tästä lisäkustannuksesta.

Lisäksi pilvipalvelin kuluttaa 500W:sta 2000W:iin, kun taas tekoälyyn perustuva palvelin kuluttaa 2000W:sta 8000W:iin – 4-kertaisesti enemmän! Tuetakseen näitä palvelimia tietokeskuksissa tarvitaan lisäksi ylimääräisiä jäähdytysmoduuleja ja infrastruktuuripäivityksiä – jotka voivat olla jopa korkeampia kuin itse laskentasijoitus. Tietokeskukset kuluttavat jo 300 TWh vuodessa, lähes 1 % maailmanlaajuisesta sähkönkulutuksesta. Jos tekoälyn omaksumisen trendit jatkuvat, tietokeskukset voivat kuluttaa jopa 5 % maailmanlaajuisesta sähköstä vuoteen 2030 mennessä. Lisäksi on epäilty, että generatiivisen tekoälyn tietokeskuksiin tehdään ennennäkemätön sijoitus. Arvioidaan, että tietokeskukset kuluttavat jopa 500 miljardia dollaria pääomaisiin menoihin vuoteen 2027 mennessä, pääosin tekoälyyn perustuvien infrastruktuurivaatimusten vuoksi.

Tietokeskusten sähkönkulutus, jo 300 TWh, kasvaa merkittävästi generatiivisen tekoälyn omaksumisen myötä.

Tekoälyn laskentakustannukset sekä energiankulutus estävät generatiivisen tekoälyn laajan omaksumisen. Skaalautumisen haasteet voidaan voittaa siirtämällä tekoälyn laskenta reunalle ja käyttämällä tekoälytyökuormille optimoituja prosessointiratkaisuja. Tällä lähestymistavalla asiakkaat saavat myös muita etuja, kuten viiveen, yksityisyyden, luotettavuuden sekä lisää kykyä.

Laskenta seuraa dataa reunalle

Viimeisen kymmenen vuoden ajan, kun tekoäly nousi akateemisesta maailmasta, tekoälymallien koulutus ja päätöksenteko on tapahtunut pilvessä/tietokeskuksissa. Koska suurin osa datasta luodaan ja käytetään reunassa – erityisesti video – on järkevää siirtää datan päätöksenteko reunalle, mikä parantaa yritysten omistamiskustannuksia (TCO) vähentämällä verkkokustannuksia ja laskentakustannuksia. Vaikka tekoälyn päätöksentekokustannukset pilvessä ovat toistuvia, reunan päätöksentekokustannukset ovat kertakustannus, laitteiston kustannus. Periaatteessa, järjestelmän täydentäminen reunan tekoälyprosessorilla alentaa kokonaiskäyttökustannuksia. Kuten perinteisten tekoälytyökuormien siirtäminen reunalle (esim. laitteet, laitteet), generatiivisen tekoälyn työkuormat seuraavat samaa mallia. Tämä tuo merkittäviä säästöjä sekä yrityksille että kuluttajille.

Siirtymä reunalle yhdistettynä tehokkaaseen tekoälykiihdyttimeen, joka suorittaa päätöksentekofunktiota, tarjoaa muita etuja. Ennen kaikkea näistä on viive. Esimerkiksi pelisovelluksissa ei-pelihahmot (NPC:t) voidaan ohjata ja täydentää generatiivisella tekoälyllä. Käyttämällä LLM-malleja, jotka suoritetaan reunan tekoälykiihdyttimillä pelikonsolissa tai tietokoneessa, pelaajat voivat antaa näille hahmoille tiettyjä tavoitteita, jotta he voivat osallistua merkityksellisesti tarinaan. Reunan paikallisen päätöksenteon alhainen viive mahdollistaa NPC-hahmojen puheen ja liikkeiden vastaamisen pelaajien komentojen ja toimien mukaan reaaliajassa. Tämä tarjoaa erittäin upottavan pelikokemuksen kustannustehokkaalla ja energiatehokkaalla tavalla.

Sovelluksissa, kuten terveydenhuollossa, yksityisyys ja luotettavuus ovat erittäin tärkeitä (esim. potilasarviointi, lääkeohjeet). Data ja siihen liittyvät Gen AI -mallit on oltava paikallisesti suojellakseen potilastietoja (yksityisyys) ja estääkseen verkkokatkokset, jotka voivat estää pääsyn pilvipalvelimissa oleviin tekoälymalliin. Reunan tekoälylaite, joka suorittaa Gen AI -mallia, joka on suunniteltu kullekin asiakasyritykselle – tässä tapauksessa terveydenhuollon tarjoajalle – voi ratkaista yksityisyyden ja luotettavuuden ongelmat samalla, kun se tarjoaa alhaisemman viiveen ja kustannukset.

Generatiivinen tekoäly reunalaitteissa takaa alhaisen viiveen pelien ja terveydenhuollon sovelluksissa sekä suojelee potilastietoja ja parantaa luotettavuutta.

Gen AI voittaa reunassa

Aina on olemassa tarve generatiiviselle tekoälylle pilvessä, erityisesti yleiskäyttöisissä sovelluksissa, kuten ChatGPT:ssä ja Claudessa. Mutta kun on kyse yrityskohtaisista sovelluksista, kuten Adoben Photoshopin generatiivisesta täytöstä tai Githubin copilotista, generatiivinen tekoäly reunassa ei ole vain tulevaisuutta, vaan myös nykyisyyttä. Tähän mahdollistavat erityisesti reunan tekoälykiihdyttimet.

Silicon Valley -veteraani ja Kinara Inc:n toimitusjohtaja Ravi Annavajjhala tuo yli 20 vuoden kokemuksen liiketoimintakehityksestä, markkinoinnista ja insinööritöistä, luoden edistyksellisiä teknologiaa ja markkinoille tuomista tuotteita. Nykyisessä tehtävässään Deep Visionin toimitusjohtajana Ravi toimii sen hallituksessa ja on kerännyt 50 miljoonaa dollaria, jotta yhtiön Ara-1-prosessori on päässyt täysimittaiseen tuotantoon ja toisen sukupolven prosessori, Ara-2, on saatu volyymituotantoon. Ennen liittymistään Deep Visioniin Ravi toimi johtotehtävissä Intelissä ja SanDiskissa, jossa hänellä oli avainrooli liikevaihdon kasvussa, strategisten kumppanuuksien kehittämisessä ja tuotantotielle johtavien, alan kärkeen kuuluvien ominaisuuksien ja mahdollisuuksien kehittämisessä.