Ajatusjohtajat
Generatiivisen tekoälynnän tulevaisuus on reunassa

ChatGPT:n ja yleensä generatiivisen tekoälyn saapuminen on merkittävä käännekohta teknologian historiassa, ja se voidaan verrata internetin ja älypuhelimen syntymään. Generatiivinen tekoäly on osoittanut rajattoman potentiaalinsa kykynsä osallistua älykkäisiin keskusteluihin, suorittaa kokeita, luoda monimutkaisia ohjelmia ja kuvia sekä videoita. Vaikka GPU:t suorittavat useimmat Gen AI -mallit pilvessä – sekä koulutuksessa että päätöksenteossa – tämä ei ole pitkällä aikavälillä skaalautuva ratkaisu, erityisesti päätöksenteon osalta, johtuen tekijöistä kuten kustannuksista, virrasta, viiveestä, yksityisyydestä ja turvallisuudesta. Tässä artikkelissa käsitellään näitä tekijöitä yksityiskohtaisemmin ja esitetään motivaatio esimerkkejä siirtää Gen AI -laskentakuormat reunalle.
Useimmat sovellukset suoritetaan korkean suorituskyvyn prosessoreilla – joko laitteessa (esim. älypuhelimet, tietokoneet, kannettavat tietokoneet) tai tietokeskuksissa. Koska sovellusten osuus, joka hyödyntää tekoälyä, laajenee, nämä prosessorit, joissa on vain CPU, eivät ole riittäviä. Lisäksi generatiivisen tekoälyn työkuormien nopea laajeneminen aiheuttaa eksponentiaalisen kasvun tekoälyyn perustuvien palvelimien kysynnän, joissa on kalliit, virtaa vievät GPU:t, mikä puolestaan kasvattaa infrastruktuurin kustannuksia. Nämä tekoälyyn perustuvat palvelimet voivat maksaa jopa 7-kertaisen normaalin palvelimen hinnan, ja GPU:t vastaavat 80 % tästä lisäkustannuksesta.
Lisäksi pilvipalvelin kuluttaa 500W:sta 2000W:iin, kun taas tekoälyyn perustuva palvelin kuluttaa 2000W:sta 8000W:iin – 4-kertaisesti enemmän! Tuetakseen näitä palvelimia tietokeskuksissa tarvitaan lisäksi ylimääräisiä jäähdytysmoduuleja ja infrastruktuuripäivityksiä – jotka voivat olla jopa korkeampia kuin itse laskentasijoitus. Tietokeskukset kuluttavat jo 300 TWh vuodessa, lähes 1 % maailmanlaajuisesta sähkönkulutuksesta. Jos tekoälyn omaksumisen trendit jatkuvat, tietokeskukset voivat kuluttaa jopa 5 % maailmanlaajuisesta sähköstä vuoteen 2030 mennessä. Lisäksi on epäilty, että generatiivisen tekoälyn tietokeskuksiin tehdään ennennäkemätön sijoitus. Arvioidaan, että tietokeskukset kuluttavat jopa 500 miljardia dollaria pääomaisiin menoihin vuoteen 2027 mennessä, pääosin tekoälyyn perustuvien infrastruktuurivaatimusten vuoksi.

Tietokeskusten sähkönkulutus, jo 300 TWh, kasvaa merkittävästi generatiivisen tekoälyn omaksumisen myötä.
Tekoälyn laskentakustannukset sekä energiankulutus estävät generatiivisen tekoälyn laajan omaksumisen. Skaalautumisen haasteet voidaan voittaa siirtämällä tekoälyn laskenta reunalle ja käyttämällä tekoälytyökuormille optimoituja prosessointiratkaisuja. Tällä lähestymistavalla asiakkaat saavat myös muita etuja, kuten viiveen, yksityisyyden, luotettavuuden sekä lisää kykyä.
Laskenta seuraa dataa reunalle
Viimeisen kymmenen vuoden ajan, kun tekoäly nousi akateemisesta maailmasta, tekoälymallien koulutus ja päätöksenteko on tapahtunut pilvessä/tietokeskuksissa. Koska suurin osa datasta luodaan ja käytetään reunassa – erityisesti video – on järkevää siirtää datan päätöksenteko reunalle, mikä parantaa yritysten omistamiskustannuksia (TCO) vähentämällä verkkokustannuksia ja laskentakustannuksia. Vaikka tekoälyn päätöksentekokustannukset pilvessä ovat toistuvia, reunan päätöksentekokustannukset ovat kertakustannus, laitteiston kustannus. Periaatteessa, järjestelmän täydentäminen reunan tekoälyprosessorilla alentaa kokonaiskäyttökustannuksia. Kuten perinteisten tekoälytyökuormien siirtäminen reunalle (esim. laitteet, laitteet), generatiivisen tekoälyn työkuormat seuraavat samaa mallia. Tämä tuo merkittäviä säästöjä sekä yrityksille että kuluttajille.
Siirtymä reunalle yhdistettynä tehokkaaseen tekoälykiihdyttimeen, joka suorittaa päätöksentekofunktiota, tarjoaa muita etuja. Ennen kaikkea näistä on viive. Esimerkiksi pelisovelluksissa ei-pelihahmot (NPC:t) voidaan ohjata ja täydentää generatiivisella tekoälyllä. Käyttämällä LLM-malleja, jotka suoritetaan reunan tekoälykiihdyttimillä pelikonsolissa tai tietokoneessa, pelaajat voivat antaa näille hahmoille tiettyjä tavoitteita, jotta he voivat osallistua merkityksellisesti tarinaan. Reunan paikallisen päätöksenteon alhainen viive mahdollistaa NPC-hahmojen puheen ja liikkeiden vastaamisen pelaajien komentojen ja toimien mukaan reaaliajassa. Tämä tarjoaa erittäin upottavan pelikokemuksen kustannustehokkaalla ja energiatehokkaalla tavalla.
Sovelluksissa, kuten terveydenhuollossa, yksityisyys ja luotettavuus ovat erittäin tärkeitä (esim. potilasarviointi, lääkeohjeet). Data ja siihen liittyvät Gen AI -mallit on oltava paikallisesti suojellakseen potilastietoja (yksityisyys) ja estääkseen verkkokatkokset, jotka voivat estää pääsyn pilvipalvelimissa oleviin tekoälymalliin. Reunan tekoälylaite, joka suorittaa Gen AI -mallia, joka on suunniteltu kullekin asiakasyritykselle – tässä tapauksessa terveydenhuollon tarjoajalle – voi ratkaista yksityisyyden ja luotettavuuden ongelmat samalla, kun se tarjoaa alhaisemman viiveen ja kustannukset.

Gen AI voittaa reunassa
Aina on olemassa tarve generatiiviselle tekoälylle pilvessä, erityisesti yleiskäyttöisissä sovelluksissa, kuten ChatGPT:ssä ja Claudessa. Mutta kun on kyse yrityskohtaisista sovelluksista, kuten Adoben Photoshopin generatiivisesta täytöstä tai Githubin copilotista, generatiivinen tekoäly reunassa ei ole vain tulevaisuutta, vaan myös nykyisyyttä. Tähän mahdollistavat erityisesti reunan tekoälykiihdyttimet.












