Ajatusjohtajat

Miksi seuraava vaihe tekoälyinfrastruktuurissa vaatii enemmän kuin hyperskaalaiset datakeskukset

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoäly on siirtymässä vaiheeseen, jossa infrastruktuuristrategia on erottamaton mallin kyvystä. Vuosien ajan hyperskaalaiset datakeskukset ovat mahdollistaneet suurten mallien koulutuksen, jolloin eturintamien mallit ovat kasvaneet miljoonista triljooniin parametreihin. Mutta kun tekoälyn käyttöönotto kiihtyy yrityksissä, aloilla ja reaaliaikaisissa järjestelmissä, inference korvaa koulutuksen hallitsevana työnkuluna, ja inference:llä on perustavanlaatuisesti erilaiset vaatimukset.

Tekoälyn seuraavaa aikakautta ei voida tukea pelkästään hyperskaalaisilla laitoksilla. Sen sijaan hybridimalli on kehittymässä, jossa keskitetyt koulutusleirit täydennetään jakautuneilla, voimatasapainotetuilla, kaupallisen mittakaavan datakeskuksilla inference:lle. Tämä muutos johtuu viiverajoituksista, tietosuojausvaatimuksista, energiarealiteeteista ja hyperskaalaisen laajentamisen fyysisistä rajoituksista.

Koulutuksen ja inference:n ero

Koulutus on edelleen keskitetty toiminta. Se vaatii massiivisia klustereita, nopeita dataputkia ja pitkäaikaisia töitä, jotka hyötyvät skaalan taloudellisista etuihin. Hyperskaalaiset leirit on optimoitu tähän tiheän laskennan, erikoistuneiden verkkoyhteyksien ja maailmanlaajuisen saatavuuden kanssa. Mutta inference toimii eri tavalla. Se on lyhytaikainen, suurivolyyminen, viiveherkkä ja usein sidottu maantieteellisiin tai yritysten rajoituksiin. Akamain viimeaikaisen tutkimuksen agenteerattujen järjestelmien mukaan useimmat organisaatiot tavoittelevat nyt alle 500 millisekunnin loppuun asti -viiveä kriittisille tekoälysovelluksille, ja useiden agenttien työnkulut ylittävät usein tämän kynnyksen pelkästään verkon siirtymisen ja CPU-puolen suorittamisen vuoksi.

Viive ei ole abstrakti mittari. Robotiikassa ja autonomisissa järjestelmissä ohjaussilmukat toimivat usein 100-1000 hertsin taajuudella joka 1-10 millisekunnissa. Kaikki ulkopuolinen äly on kunnioitettava näitä aikarajoituksia. 50 millisekunnin pyörähdysajan etäiseen datakeskukseen rikkoisi ohjausjärjestelmän kokonaan. Rahoituksessa ja petosten havaitsemisessa millisekunnit määräävät taloudelliset tulokset. Teollisessa automaatiassa viiveellinen inference voi epävakautta prosesseja tai vaarantaa turvallisuuden. Ja interaktiivisissa kokemuksissa, kuten pelaamisessa, AR/VR:ssä ja reaaliaikaisissa ohjausjärjestelmissä, vastauskyky heikkenee terävästi yli 100-150 millisekunnin jälkeen.

Modernit tekoälyjärjestelmät riippuvat yhä enemmän useiden agenttien työnkuluista, jotka koostuvat useista peräkkäisistä kutsuista. Akamain analyysi osoittaa, että CPU-puolen suorittaminen voi muodostaa suurimman osan kokonaisviiveestä, ja jokainen verkon pyörähdys lisää viivettä. Työnkulku, jossa on 50 peräkkäistä kutsua, voi aiheuttaa sekunteja siirtymisviivettä, kun se ohjataan etäiseen hyperskaalaiseen alueeseen. Sijoita sama työnkulku hyperlokaaliseen datakeskukseen, joka sijaitsee samalla kampuksella tai metroalueella, ja fysiikka muuttuu. Paikallinen inference voi tarjota 1-5 millisekunnin pyörähdysajan. 50 vaiheen työnkulku, joka kestäisi sekunteja etäisessä alueessa, voi suorittaa 50-250 millisekunnissa paikallisesti, pysyen yrityksen viivebudjetissa.

Tietosuojaus ja verkkotodellisuudet ajavat paikallisia käyttöönottoja

Viive on vain yksi osa tarinaa. Säädeltyjen alojen, kuten terveydenhuollon, rahoituksen ja julkisen sektorin, osalta tietosuojaus on usein ensisijainen ajuri paikalliselle inference:lle. Tekoälytyönkulun suorittaminen yrityksen palomuurin takana säilyttää olemassa olevat turvallisuusrajoitukset, vähentää monen vuokraajan altistusta, yksinkertaa vaatimukset ja pitää arkaluontoiset tiedot jaetun pilvi-infrastruktuurin ulkopuolella. Hyperskaalaiset tarjoajat tarjoavat vahvaa turvallisuutta, mutta hyökkäyspinta-ala ja luottamusketju ovat luonnostaan laajempia. Yritykset suosivat yhä enemmän inference-arkkitehtuureja, jotka ovat linjassa heidän olemassa olevan turvallisuusasenteensa kanssa.

Viive- ja turvallisuushuolen ohella sähkön saatavuus on muodostumassa yhtä tärkeäksi rajoitteeksi. Suuret hyperskaalaiset leirit kohtaavat usein useiden vuosien viiveitä johtuen siirtymisrajoituksista ja verkkojonotuksesta. Pienemmät kaupallisen mittakaavan käyttöönotot, erityisesti ne, jotka sijaitsevat lähellä olemassa olevia kuormia tai hajautettua sähköntuotantoa, voidaan usein energisoida paljon nopeammin. Tämä on merkittävää, koska tekoälyn kysyntä törmää outoon paradoksiin.

Samalla kun operaattorit kamppailevat uusien verkkoyhteyksien kanssa, valtavat määrät uusiutuvaa energiaa ovat leikattu. Maailmanlaajuisesti uusiutuvan energian leikkaus ylittää jo 200 terawattituntia vuodessa. Yhdysvalloissa leikkaus on arvioitu olevan noin 20 terawattituntia vuodessa. ERCOT leikkasi yli 9 terawattituntia tuulivoima- ja aurinkosähköä viime vuonna. CAISO hylkäsi 3,4 terawattituntia aurinko- ja tuulivoimaa vuonna 2024, ja aurinko kattoi 93% kaikista leikattuja tuloksia. Energiajärjestelmien tutkimukset osoittavat jatkuvasti, että sekä aurinko- että tuulivoima kohtaavat merkittävää leikkausta, kun tuotanto ylittää verkon kapasiteetin. Aurinkoleikkaus on erityisen yleistä alueilla, joilla on vahvat keskipäivän huiput, kun taas tuulileikkaus tapahtuu usein alhaisina tunteina tai rajoitettujen reittien aikana. Hajautetut datakeskukset, jotka sijaitsevat lähellä sähköntuotantoa, erityisesti aurinkovoimaisilla alueilla, voivat muuttaa haaskatun energian hyödylliseksi inference-kapasiteetiksi.

Hyperskaalaiset leirit säilyvät olennaisina koulutukselle, mutta ne kohtaavat kasvavia fyysisiä ja taloudellisia rajoituksia. Yhdistäminen siirtoverkkoon voi olla pitkä prosessi, joka vaatii uusia alajaon muuntajia, siirtolinjojen päivityksiä, monen viranomaisen lupaa ja yhteisöarviointia. Nämä ovat prosesseja, jotka kestävät jatkuvasti vuosia. Hyperskaalaiset laitokset vaativat suuria maapohjia, merkittäviä vesivarauksia ja monimutkaisia ympäristöhyväksyntöjä. Yhteisöt ovat yhä enemmän vastaan uusien datakeskusten kehittämistä melun, vedenkäytön ja maan vaikutuksen vuoksi. Ja keskitetyt leirit keskittävät riskin siten, että sääilmiöt, verkkokatkokset tai geopolitiikka voi vaikuttaa suuriin osiin maailmanlaajuisesta laskentakapasiteetista. Hajautetut arkkitehtuurit tarjoavat maantieteellisen monipisteyden ja toiminnallisen kestävyyden.

Tulevaisuus on monitasoinen tekoälyarkkitehtuuri

Inference-laskennan suorittamiseksi vaivattomasti tehokkuus voi tulla yhtä tärkeäksi kuin raaka kapasiteetti. Inference kuluttaa energiaa jatkuvasti, ja teollisuusanalyytikot arvioivat, että inference voi lopulta edustaa suurimman osan tekoälyyn liittyvästä energiankulutuksesta. Tehokkuuden parantuminen paikallisesta uusiutuvan energian integroinnista, vähennetyistä siirtymenetyksistä, oikeankokoisista käyttöönotoista, parannetuista lämpöprofiileista ja korkeammista käyttöasteista tulee olemaan olennaisia kestävän globaalin tekoälyn kysynnän täyttämiseksi. Hajautetut kaupallisen mittakaavan datakeskukset ovat hyvin asemissa tarjoamaan nämä edut, koska ne voidaan sijoittaa paikoille, joilla energia on runsasta, halpaa tai alikäytettyä.

Tekoälyinfrastruktuurin seuraava vaihe on hybridiseos hyperskaalaisista leireistä, jotka hallitsevat koulutusta, hajautetuista kaupallisen mittakaavan datakeskuksista, jotka palvelevat inference:ä, ja reuna-laiteista, jotka palvelevat ultra-lokaaleja työmääriä. Tämä monitasoinen arkkitehtuuri heijastaa tehon, viiveen, turvallisuuden ja mittakaavan fyysisiä realiteetteja. Kun tekoäly upotetaan reaaliaikaisiin järjestelmiin kaikilla aloilla, infrastruktuurin on kehittymistä vastaavasti inference:n lähentämiseksi maailmaa, jonka se palvelee.

Jeff Thramann, M.D. on keksijä ja sarjayrittäjä, jolle on myönnetty yli 130 patenttia, ja hän on perustanut ja myynyt kuusi yritystä. LT350:n perustajana ja toimitusjohtajana hän on lääkäri-yrittäjä ja tekoäly-infrastruktuurin strategi, joka keskittyy hajautettuihin laskentarakenteisiin ja seuraavan sukupolven datakeskuksen suunnitteluun, joka hyödyntää olemassa olevaa infrastruktuuria vähentämään datakeskuksen vaikutuksia.