Modele și platforme AI

Cerebras raportează o creștere de 5 ori a debitului de inferență prin dezagregare

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cerebras Systems a declarat pe 1 octombrie 2026 că a crescut debitul de inferență de 5 ori în rezultatele inițiale, utilizând o tehnică numită dezagregare, cu același număr de sisteme Cerebras și fără pierdere a vitezei de generare a token‑urilor. Anunțul a fost publicat în Inferență dezagregată de la zero, un articol de blog al companiei scris de Isaac Tai și Zhenwei Gao, care deschide o serie planificată pe acest subiect.

Articolul încadrează seria pentru cititorii care au auzit termenul dezagregare sau afirmația că faza de preumplere este limitată de calcul, iar faza de decodare este limitată de memorie, și s-au întrebat ce înseamnă de fapt fiecare. El construiește explicația de la zero, începând cu modul în care acceleratoarele echilibrează operațiile aritmetice cu mișcarea datelor.

Preumplerea și decodarea impun cerințe diferite asupra hardware‑ului

Articolul definește intensitatea aritmetică ca numărul de operații în virgulă mobilă împărțit la numărul de octeți transferați între memorie și unitățile de calcul ale acceleratorului. Într-unul dintre exemple, adăugarea a două matrici efectuează 1 FLOP pentru fiecare 6 octeți mutați, o intensitate aritmetică de 0,167 FLOP pe octet, iar acest raport rămâne constant pe măsură ce matricile cresc. Înmulțirea matricilor se comportă diferit: fiecare valoare de ieșire este construită dintr-un rând întreg al unei intrări și o coloană întreagă a celeilalte, astfel încât valorile încărcate contribuie la mai multe ieșiri și intensitatea aritmetică crește odată cu dimensiunea intrării.

Articolul explică că inferența este un lanț de astfel de înmulțiri matriciale între greutățile fixe ale modelului și token‑urile de intrare, și rulează în două faze cu profiluri de intensitate diferite. În timpul preumplerii, întreaga solicitare este procesată paralel ca o operație matricială mare, iar solicitările din viața reală pot conține mii sau chiar sute de mii de token‑uri. În timpul decodării, token‑urile sunt generate unul câte unul, iar modelul se bazează pe memoria cache KV, care stochează cheile și valorile calculate pentru token‑urile anterioare, pentru a le reutiliza în loc să le recalculeze.

Ambele faze trebuie totuși să transfere toate greutățile modelului, potențial sute de gigabytes sau terabytes, către unitățile de calcul pentru fiecare token generat. Articolul arată că mișcarea memoriei rămâne aproape constantă, în timp ce intensitatea aritmetică scade după preumplere, și citează acest decalaj ca motiv pentru care adăugarea de capacitate brută de calcul nu face neapărat ca token‑urile să ajungă mai repede în timpul decodării.

Dezagregarea împarte inferența în grupuri separate

În producție, un server de inferență gestionează de obicei numeroase cereri simultan, și când preumplerea și decodarea rulează pe același hardware, preumplerea intensă din punct de vedere al calculului poate bloca cererile de decodare active. Planificatorii trebuie apoi să aleagă între a permite noilor cereri să obțină rapid primul token, a menține fluxul de răspunsuri active fără întreruperi și a maximiza debitul total. Gruparea permite cererilor concurente să împartă sarcina de citire a greutăților modelului, dar loturile mai mari pot face ca fiecare pas de decodare să dureze mai mult, astfel debitul total poate crește în timp ce fiecare utilizator primește token‑uri mai lent.

Articolul descrie dezagregarea ca un model de proiectare a sistemelor care rulează cele două faze în grupuri hardware separate. Odată ce etapele sunt separate, operatorii pot aloca hardware, pot stabili politici de grupare și pot prioritiza latența sau debitul pentru fiecare etapă independent: un sistem cu obiective stricte privind timpul până la primul token poate rezerva mai multă capacitate pentru preumplere, în timp ce unul conceput pentru streaming fluid poate aloca decodării un grup mai mare sau programat mai strâns. Grupurile pot fi, de asemenea, scalate individual.

Separarea introduce o nouă cerință. După ce preumplerea construiește memoria cache KV, acea stare specifică cererii trebuie transferată către grupul de decodare, unde este încărcată în memorie înainte ca generarea să poată continua, în timp ce greutățile modelului sunt deja încărcate în ambele grupuri. Articolul observă că transferul adaugă costuri de rețea și coordonare, că oricare dintre grupuri poate rămâne inactiv dacă capacitățile nu corespund cererii și că latența suplimentară depinde de faptul dacă cache‑ul se mută între mașini colocalizate sau între regiuni. Se susține că dezagregarea este cea mai convingătoare la scară, unde beneficiile obținute prin dimensionarea și programarea independentă a grupurilor pot depăși costurile de transfer și operare, și că aceasta modifică interfața de control a sistemului de servire, nu doar netezește streamingul.

Hardware heterogen, rezultate timpurii și parteneriate

Cerebras a declarat că conduce dezvoltarea dezagregării heterogene, combinând mai multe tipuri de cipuri într-un singur sistem de inferență și alocând hardware diferit segmentelor care sunt limitate de memorie sau de calcul. Articolul contrastează designul la scară de wafer al companiei, care distribuie SRAM alături de unități de calcul pe întregul wafer, cu GPU‑urile, care preiau datele modelului din memoria cu bandă largă prin memorii și cache‑uri mai mici integrate pe cip.

Un grafic publicat cu lățimea de bandă maximă a memoriei în articol, datat 10 septembrie 2026, enumeră SRAM‑ul integrat în Cerebras WSE‑3 la 21.000 TB/s per wafer, alături de un accelerator SRAM integrat nenumit la 150 TB/s și GPU‑uri HBM4 la 23,3 și 22 TB/s. Graficul avertizează că valorile SRAM însumează lățimea de bandă a memoriei locale pe un procesor, în timp ce valorile HBM măsoară traficul din memoria externă, astfel că cifrele descriu niveluri diferite de memorie, nu viteze de token măsurate.

Postarea reproduce, de asemenea, datele Artificial Analysis din 10 septembrie 2026 pentru GPT-oss-120B care rulează raționament avansat cu 10,000 tokeni de intrare. Aceasta enumeră Cerebras la 1,669 tokeni de ieșire pe secundă, SambaNova la 708, Groq la 475, Microsoft Azure la 319, Nebius la 294 și Baseten la 293.

Cerebras a declarat că, într-un sistem agregat tradițional, creșterea capacității însemna instalarea de hardware suplimentar și că, prin valorificarea acceleratoarelor partenere pentru a gestiona procesarea promptului, a crescut capacitatea de 5x în testele inițiale cu aceeași amprentă WSE. Compania a anunțat că a încheiat parteneriate cu mai mulți parteneri hardware pentru a aduce pe piață tokeni ultrarapizi și un diagramă din postare arată sistemele AWS Trainium și AMD Helios Instinct GPU printre opțiunile hardware de preumplere care alimentează un pool de decodare Cerebras.

Postarea identifică aplicațiile agentice ca o potrivire convingătoare pentru desagregarea heterogenă, deoarece acestea implică adesea fluxuri de lucru lungi, cu multiple etape, în care contextul crește pe parcursul apelurilor la model și întârzierile la fiecare pas se cumulează. Cerebras a declarat că următoarele ediții vor acoperi stivele hardware și software implicate și compromisurile economice ale implementării inferență desagregată la scară.

Theo Nash este un specialist generat de AI la Unite.AI, care acoperă infrastructura AI, calculul și sistemele hardware care alimentează inteligența artificială modernă. Munca sa se concentrează pe fundamentele tehnice din spatele sarcinilor de lucru AI la scară largă, inclusiv centrele de date, acceleratoarele, rețelele și stivele software care le leagă.

Dintr‑o perspectivă analitică și orientată spre inginerie, Theo examinează modul în care progresele în GPU‑uri, silicon personalizat, arhitecturi de memorie și sisteme distribuite permit noi generații de modele AI. El acordă o atenție deosebită compromisurilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care modelează implementarea în lumea reală a infrastructurii AI.

Articolele scrise de Theo Nash sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului în rapidă evoluție al calculului AI.