Modele și platforme AI

Cerebras Introduce Soluția de Inferență AI Ceă Mai Rapidă Din Lume: 20 de Ori Viteza la o Fracțiune Din Cost

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cerebras Systems (CBRS ), un pionier în computerele de înaltă performanță AI, a introdus o soluție revoluționară care urmează să schimbe inferența AI. La 27 august 2024, compania a anunțat lansarea Cerebras Inference, cel mai rapid serviciu de inferență AI din lume. Cu metrici de performanță care întrec cu mult pe cele ale sistemelor tradiționale bazate pe GPU, Cerebras Inference oferă 20 de ori viteza la o fracțiune din cost, stabilind un nou standard în computerele AI.

Viteză și Eficiență Neegalate

Cerebras Inference este proiectat pentru a oferi performanțe excepționale în diverse modele AI, în special în segmentul în evoluție rapidă al modelelor de limbaj mari (LLM). De exemplu, procesează 1.800 de tokeni pe secundă pentru modelul Llama 3.1 8B și 450 de tokeni pe secundă pentru modelul Llama 3.1 70B. Această performanță nu numai că este de 20 de ori mai rapidă decât cea a soluțiilor bazate pe GPU NVIDIA (NVDA ), dar vine și la un cost semnificativ mai mic. Cerebras oferă acest serviciu începând de la doar 10 cenți pe milion de tokeni pentru modelul Llama 3.1 8B și 60 de cenți pe milion de tokeni pentru modelul Llama 3.1 70B, reprezentând o îmbunătățire de 100 de ori a raportului preț-performanță în comparație cu ofertele existente bazate pe GPU.

Menținerea Preciziei în Timp Ce Se Împing Barierelor Vitezei

Unul dintre cele mai impresionante aspecte ale Cerebras Inference este capacitatea sa de a menține precizia de ultimă generație în timp ce oferă o viteză fără precedent. În contrast cu abordările care sacrifică precizia pentru viteză, soluția Cerebras rămâne în domeniul de 16 biți pentru întreaga rulare a inferenței. Acest lucru asigură că beneficiile de performanță nu vin în detrimentul calității ieșirilor modelului AI, un factor crucial pentru dezvoltatorii axați pe precizie.

Micah Hill-Smith, Co-Fondator și CEO al Artificial Analysis, a subliniat importanța acestui realizări: „Cerebras oferă viteze de un ordin de mărime mai mari decât soluțiile bazate pe GPU pentru modelele AI Llama 3.1 8B și 70B ale Meta. Măsurăm viteze de peste 1.800 de tokeni de ieșire pe secundă pe Llama 3.1 8B și peste 446 de tokeni de ieșire pe secundă pe Llama 3.1 70B – un nou record în aceste benchmark-uri.”

Crescândă Importanță a Inferenței AI

Inferența AI este segmentul în creștere cel mai rapid al computelor AI, reprezentând aproximativ 40% din piața totală de hardware AI. Apariția inferenței AI de înaltă viteză, cum ar fi cea oferită de Cerebras, este similară cu introducerea internetului de bandă largă – deblocând noi oportunități și anunțând o nouă eră pentru aplicațiile AI. Cu Cerebras Inference, dezvoltatorii pot acum construi aplicații AI de generație următoare care necesită performanțe complexe și în timp real, cum ar fi agenți AI și sisteme inteligente.

Andrew Ng, Fondator al DeepLearning.AI, a subliniat importanța vitezei în dezvoltarea AI: “DeepLearning.AI are multiple fluxuri de lucru agenți care necesită apelarea repetată a unui model LLM pentru a obține un rezultat. Cerebras a construit o capacitate de inferență impresionant de rapidă, care va fi foarte utilă pentru astfel de sarcini.

Susținere Industriașă și Parteneriate Strategice

Cerebras a obținut un sprijin puternic din partea liderilor industriei și a format parteneriate strategice pentru a accelera dezvoltarea aplicațiilor AI. Kim Branson, SVP de AI/ML la GlaxoSmithKline, un client timpuriu al Cerebras, a subliniat potențialul transformativ al acestei tehnologii: „Viteza și scala schimbă totul.”

Alte companii, cum ar fi LiveKit, Perplexity și Meter, au exprimat, de asemenea, entuziasm pentru impactul pe care Cerebras Inference îl va avea asupra operațiunilor lor. Aceste companii utilizează puterea capacităților de calcul Cerebras pentru a crea experiențe AI mai receptive și mai umane, pentru a îmbunătăți interacțiunea utilizatorilor în motoarele de căutare și pentru a îmbunătăți sistemele de gestionare a rețelelor.

Cerebras Inference: Nivele și Accesibilitate

Cerebras Inference este disponibil pe trei nivele competitiv prețuite: Free, Developer și Enterprise. Nivelul Free oferă acces gratuit la API cu limite generoase de utilizare, făcându-l accesibil unei game largi de utilizatori. Nivelul Developer oferă o opțiune de implementare flexibilă și fără server, cu modele Llama 3.1 prețuite la 10 cenți și 60 de cenți pe milion de tokeni. Nivelul Enterprise se adresează organizațiilor cu sarcini de lucru susținute, oferind modele personalizate, acorduri de nivel de serviciu personalizate și suport dedicat, cu prețuri disponibile la cerere.

Punerea în Funcțiune a Cerebras Inference: Motorul Wafer Scale 3 (WSE-3)

La baza Cerebras Inference se află sistemul Cerebras CS-3, alimentat de motorul Wafer Scale 3 (WSE-3) lider în industrie. Acest procesor AI este neegalat în ceea ce privește dimensiunea și viteza, oferind 7.000 de ori mai multă lățime de bandă a memoriei decât NVIDIA H100. Scara masivă a WSE-3 îi permite să gestioneze mulți utilizatori simultan, asigurând viteze uluitoare fără compromisuri în ceea ce privește performanța. Această arhitectură permite Cerebras să ocolească compromisurile care, de obicei, afectează sistemele bazate pe GPU, oferind o performanță de clasă superioară pentru sarcinile de lucru AI.

Integrare Fără Probleme și API Prietenos pentru Dezvoltatori

Cerebras Inference este proiectat cu dezvoltatorii în minte. Acesta prezintă un API care este pe deplin compatibil cu API-ul OpenAI Chat Completions, permițând o migrare ușoară cu modificări minime de cod. Acest abordare prietenos pentru dezvoltatori asigură că integrarea Cerebras Inference în fluxurile de lucru existente este cât se poate de simplă, permițând o implementare rapidă a aplicațiilor AI de înaltă performanță.

Sistemele Cerebras: Impulsionarea Inovației în Diverse Industrii

Cerebras Systems nu este doar un lider în computerele AI, ci și un jucător cheie în diverse industrii, inclusiv sănătate, energie, guvern, calcul științific și servicii financiare. Soluțiile companiei au fost instrumentale în impulsionarea descoperirilor la instituții precum Laboratoarele Naționale, Aleph Alpha, Clinica Mayo și GlaxoSmithKline.

Prin oferirea unei viteze, scalabilități și precizii neegalate, Cerebras permite organizațiilor din aceste sectoare să abordeze unele dintre cele mai provocatoare probleme din AI și dincolo de aceasta. Indiferent dacă este vorba despre accelerarea descoperirii de medicamente în sănătate sau despre îmbunătățirea capacităților de calcul în cercetarea științifică, Cerebras se află în fruntea impulsionării inovației.

Concluzie: O Nouă Eră pentru Inferența AI

Cerebras Systems stabilește un nou standard pentru inferența AI cu lansarea Cerebras Inference. Prin oferirea unei viteze de 20 de ori mai mari decât a sistemelor tradiționale bazate pe GPU la o fracțiune din cost, Cerebras nu numai că face AI mai accesibil, dar și deschide calea pentru următoarea generație de aplicații AI. Cu tehnologia sa de ultimă generație, parteneriate strategice și angajamentul față de inovație, Cerebras este poziționat să conducă industria AI într-o nouă eră de performanță și scalabilitate fără precedent.

Pentru mai multe informații despre Cerebras Systems și pentru a încerca Cerebras Inference, vizitați www.cerebras.ai.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.