Lideri de opinie
Viitorul Inteligenței Artificiale Generative este Marginea

Apariția ChatGPT și a Inteligenței Artificiale Generative, în general, reprezintă un moment de cotitură în istoria tehnologiei și este comparabilă cu apariția Internetului și a smartphone-ului. Inteligența Artificială Generativă a demonstrat un potențial nelimitat în capacitatea sa de a purta conversații inteligente, de a promova examene, de a genera programe complexe și cod, precum și de a crea imagini și videoclipuri atractive. Deși GPU-urile rulează majoritatea modelelor de Inteligență Artificială Generativă în cloud – atât pentru antrenament, cât și pentru inferență – această abordare nu este o soluție pe termen lung, scalabilă, în special pentru inferență, din cauza factorilor care includ costul, puterea, latența, confidențialitatea și securitatea. Acest articol abordează fiecare dintre acești factori, împreună cu exemple motivante pentru a muta sarcinile de lucru ale Inteligenței Artificiale Generative către margine.
Majoritatea aplicațiilor rulează pe procesoare de înaltă performanță – fie pe dispozitiv (de exemplu, smartphone, desktop, laptop) sau în centre de date. Pe măsură ce crește cota de aplicații care utilizează Inteligența Artificială, aceste procesoare cu doar CPU-uri sunt inadecvate. Mai mult, expansiunea rapidă a sarcinilor de lucru ale Inteligenței Artificiale Generative conduce la o cerere exponențială de servere cu GPU-uri scumpe și consumatoare de energie, ceea ce, la rândul său, conduce la creșterea costurilor infrastructurii. Aceste servere cu Inteligență Artificială pot costa de până la 7 ori mai mult decât un server obișnuit, iar GPU-urile reprezintă 80% din acest cost suplimentar.
În plus, un server cloud consumă între 500W și 2000W, în timp ce un server cu Inteligență Artificială consumă între 2000W și 8000W – de 4 ori mai mult! Pentru a susține aceste servere, centrele de date necesită module de răcire suplimentare și upgrade-uri ale infrastructurii – care pot fi și mai mari decât investiția în calcul. Centrele de date consumă deja 300 TWH pe an, aproape 1% din consumul total de energie la nivel mondial. Dacă tendințele de adoptare a Inteligenței Artificiale continuă, atunci până în 2030, centrele de date pot consuma până la 5% din energia mondială. În plus, există o investiție fără precedent în centrele de date pentru Inteligența Artificială Generativă. Se estimează că centrele de date vor consuma până la 500 de miliarde de dolari pentru cheltuieli de capital până în 2027, în principal determinate de cerințele de infrastructură pentru Inteligența Artificială.

Consumul de energie electrică al centrelor de date, care este deja de 300 TWh, va crește semnificativ odată cu adoptarea Inteligenței Artificiale Generative.
Costul calculului Inteligenței Artificiale, precum și consumul de energie, va împiedica adoptarea pe scară largă a Inteligenței Artificiale Generative. Provocările de scalare pot fi depășite prin mutarea calculului Inteligenței Artificiale către margine și utilizarea soluțiilor de procesare optimizate pentru sarcinile de lucru ale Inteligenței Artificiale. Cu această abordare, se obțin și alte beneficii pentru client, inclusiv latența, confidențialitatea, fiabilitatea, precum și o capacitate crescută.
Calculul urmează datele către Margine
De aproximativ un deceniu, de când Inteligența Artificială a apărut din lumea academică, antrenamentul și inferența modelelor de Inteligență Artificială au avut loc în cloud/centrul de date. Având în vedere că o mare parte din date sunt generate și consumate la margine – în special video – a fost logic să se mute inferența datelor către margine, îmbunătățind astfel costul total de proprietate (TCO) pentru întreprinderi, datorită reducerii costurilor de rețea și de calcul. În timp ce costurile de inferență ale Inteligenței Artificiale în cloud sunt recurente, costul inferenței la margine este o cheltuială unică, de hardware. Esențial, îmbunătățirea sistemului cu un procesor de Inteligență Artificială la margine reduce costurile operaționale totale. La fel ca migrarea sarcinilor de lucru convenționale ale Inteligenței Artificiale către Margine (de exemplu, aparat, dispozitiv), sarcinile de lucru ale Inteligenței Artificiale Generative vor urma același drum. Acest lucru va aduce economii semnificative pentru întreprinderi și consumatori.
Mutarea către margine, împreună cu un accelerator de Inteligență Artificială eficient pentru a efectua funcțiile de inferență, oferă și alte beneficii. Printre acestea se numără latența. De exemplu, în aplicațiile de jocuri, personajele non-jucător (NPC) pot fi controlate și îmbunătățite utilizând Inteligența Artificială Generativă. Utilizând modele LLM care rulează pe acceleratoare de Inteligență Artificială la margine, într-o consolă de jocuri sau pe un PC, jucătorii pot da acestor personaje obiective specifice, astfel încât acestea să poată participa în mod semnificativ la poveste. Latența scăzută din inferența locală la margine va permite ca vorbirea și mișcările NPC să răspundă în timp real la comenzile și acțiunile jucătorilor. Acest lucru va oferi o experiență de joc imersivă, eficientă din punct de vedere al costurilor și al energiei.
În aplicații precum sănătatea, confidențialitatea și fiabilitatea sunt extrem de importante (de exemplu, evaluarea pacientului, recomandările de medicamente). Datele și modelele asociate de Inteligență Artificială Generativă trebuie să fie pe teren pentru a proteja datele pacientului (confidențialitate) și orice întrerupere a rețelei care va bloca accesul la modelele de Inteligență Artificială din cloud poate fi catastrofală. Un aparat de Inteligență Artificială la margine care rulează un model de Inteligență Artificială Generativă, special conceput pentru fiecare client întreprindere – în acest caz, un furnizor de servicii de sănătate – poate rezolva în mod eficient problemele de confidențialitate și fiabilitate, oferind în același timp o latență scăzută și costuri reduse.

Inteligența Artificială Generativă pe dispozitivele de margine va asigura o latență scăzută în jocuri și va păstra datele pacientului și va îmbunătăți fiabilitatea pentru sănătate.
Multe modele de Inteligență Artificială Generativă care rulează în cloud pot avea aproape un trilion de parametri – aceste modele pot aborda eficient întrebări cu scop general. Cu toate acestea, aplicațiile specifice întreprinderilor necesită ca modelele să furnizeze rezultate pertinente pentru cazul de utilizare. Luați exemplul unui asistent bazat pe Inteligența Artificială Generativă, conceput pentru a primi comenzi la un restaurant fast-food – pentru ca acest sistem să aibă o interacțiune cu clientul fără probleme, modelul de Inteligență Artificială Generativă subiacent trebuie să fie antrenat pe articolele din meniul restaurantului, cunoscând și alergenii și ingredientele. Mărimea modelului poate fi optimizată prin utilizarea unui model LLM mai mare pentru a antrena un model LLM relativ mic, cu 10-30 de miliarde de parametri, și apoi prin utilizarea unei reglări fine suplimentare cu datele specifice clientului. Un astfel de model poate furniza rezultate cu o precizie și o capacitate crescute. Și, având în vedere dimensiunea mai mică a modelului, acesta poate fi implementat eficient pe un accelerator de Inteligență Artificială la margine.
Inteligența Artificială Generativă va câștiga la Margine
Va exista întotdeauna o nevoie de Inteligență Artificială Generativă care rulează în cloud, în special pentru aplicații cu scop general, cum ar fi ChatGPT și Claude. Dar, atunci când vine vorba de aplicații specifice întreprinderilor, cum ar fi umplerea generativă a Adobe Photoshop sau Github Copilot, Inteligența Artificială Generativă la margine nu este doar viitorul, ci și prezentul. Acceleratoarele de Inteligență Artificială special concepute sunt cheia pentru a face acest lucru posibil, mai ales pentru aplicații specifice întreprinderilor, cum ar fi Adobe Photoshop și Github Copilot, Inteligența Artificială Generativă la margine nu este doar viitorul, ci și prezentul. Acceleratoarele de Inteligență Artificială special concepute sunt cheia pentru a face acest lucru posibil.












