Wywiady

Andrew Feldman, współzałożyciel i CEO Cerebras Systems – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Andrew jest współzałożycielem i CEO Cerebras Systems (CBRS ). Jest przedsiębiorcą, który poświęca się przekraczaniu granic w dziedzinie obliczeń. Przed Cerebras, współzałożył i był CEO SeaMicro, pioniera energooszczędnych, wysokopasmowych mikroserwerów. SeaMicro zostało przejęte przez AMD w 2012 roku za 357 milionów dolarów. Przed SeaMicro, Andrew był wiceprezesem ds. zarządzania produktem, marketingu i rozwoju biznesu w firmie Force10 Networks, która później została sprzedana firmie Dell Computing za 800 milionów dolarów. Przed Force10 Networks, Andrew był wiceprezesem ds. marketingu i rozwoju korporacyjnego w firmie RiverStone Networks od powstania firmy do pierwszej oferty publicznej w 2001 roku. Andrew posiada tytuł licencjata i magistra biznesu ze Stanford University.

Cerebras Systems buduje nową klasę systemów komputerowych, zaprojektowanych od podstaw z myślą o przyspieszaniu sztucznej inteligencji i zmianie przyszłości pracy z AI.

Czy mógłbyś podzielić się historią powstania Cerebras Systems?

Moje współzałożyciele i ja pracowaliśmy razem w poprzedniej firmie, którą założyłem w 2007 roku, nazwanej SeaMicro (która została sprzedana AMD w 2012 roku za 334 miliony dolarów). Moi współzałożyciele to niektórzy z czołowych architektów komputerowych i inżynierów w branży – Gary Lauterbach, Sean Lie, JP Fricker i Michael James. Kiedy ponownie zjednoczyliśmy się w 2015 roku, napisaliśmy dwie rzeczy na tablicy – chcieliśmy współpracować i zbudować coś, co zmieni branżę i znajdzie się w Muzeum Historii Komputera, które jest odpowiednikiem Komputera Hall of Fame. Byliśmy uhonorowani, kiedy Muzeum Historii Komputera uznało nasze osiągnięcia i dodało procesor WSE-2 do swojej kolekcji w zeszłym roku, cytując, jak zmienił on krajobraz sztucznej inteligencji.

Cerebras Systems to zespół pionierskich architektów komputerowych, naukowców komputerowych, badaczy głębokiego uczenia się i inżynierów wszystkich typów, którzy kochają bezstronne inżynierię. Naszym celem, kiedy się zjednoczyliśmy, było zbudowanie nowej klasy komputera, aby przyspieszyć głębokie uczenie się, które stało się jednym z najważniejszych obciążeń naszych czasów.

Uświadomiliśmy sobie, że głębokie uczenie się ma unikalne, ogromne i rosnące wymagania obliczeniowe. Nie jest dobrze dopasowane do maszyn dziedzictwa, takich jak jednostki przetwarzania grafiki (GPU), które zostały podstawowo zaprojektowane do innej pracy. W rezultacie, AI dzisiaj jest ograniczona nie przez aplikacje czy pomysły, ale przez dostępność obliczeń. Przetestowanie jednej nowej hipotezy – przeszkolenie nowego modelu – może potrwać dni, tygodnie lub nawet miesiące i kosztować setki tysięcy dolarów w czasie obliczeń. To jest duży przeszkoda dla innowacji.

Więc powstanie Cerebras było spowodowane budową nowego typu komputera zoptymalizowanego wyłącznie do głębokiego uczenia się, rozpoczynając od czystej kartki papieru. Aby spełnić ogromne wymagania obliczeniowe głębokiego uczenia się, zaprojektowaliśmy i wyprodukowaliśmy największy chip kiedykolwiek zbudowany – Wafer-Scale Engine (WSE). Tworząc pierwszy na świecie procesor wafer-scale, pokonaliśmy wyzwania w dziedzinie projektowania, produkcji i pakowania – wszystkie z nich były uważane za niemożliwe przez całe 70-letnie historii komputerów. Każdy element WSE jest zaprojektowany, aby umożliwić badania głębokiego uczenia się z niezwykłą szybkością i skalą, napędzając najbardziej wydajny superkomputer AI, Cerebras CS-2.

Z każdym komponentem zoptymalizowanym do pracy AI, CS-2 dostarcza więcej wydajności obliczeniowej w mniejszej przestrzeni i przy mniejszej mocy niż jakikolwiek inny system. Robi to, redukując radykalnie złożoność programistyczną, czas obliczeń i czas rozwiązania. W zależności od obciążenia, od AI do HPC, CS-2 dostarcza setki lub tysiące razy więcej wydajności niż alternatywy dziedzictwa. CS-2 zapewnia zasoby obliczeniowe głębokiego uczenia się równoważne setkom GPU, jednocześnie zapewniając łatwość programowania, zarządzania i wdrożenia pojedynczego urządzenia.

W ciągu ostatnich kilku miesięcy Cerebras wydaje się być wszędzie w wiadomościach, co możesz nam powiedzieć o nowym superkomputerze Andromeda AI?

Ogłosiliśmy Andromeda w listopadzie zeszłego roku, i jest to jeden z największych i najpotężniejszych superkomputerów AI kiedykolwiek zbudowanych. Dostarczając ponad 1 Exaflop obliczeń AI i 120 Petaflops gęstych obliczeń, Andromeda ma 13,5 miliona rdzeni w 16 systemach CS-2 i jest jedynym superkomputerem AI, który kiedykolwiek wykazał niemal idealną liniową skalowalność w dużych obciążeniach modeli językowych. Jest również niezwykle łatwy w użyciu.

Przypomnijmy, że największy superkomputer na Ziemi – Frontier – ma 8,7 miliona rdzeni. Pod względem liczby rdzeni Andromeda jest ponad jeden i pół raza większa. Wykonuje inną pracę, oczywiście, ale to daje pojęcie o skali: niemal 100 terabitów wewnętrznej przepustowości, niemal 20 000 rdzeni AMD Epyc karmi ją, i – w przeciwieństwie do gigantycznych superkomputerów, które zajmują lata, aby stanąć – postawiliśmy Andromeda w ciągu trzech dni i natychmiast potem, dostarczała niemal idealną liniową skalowalność AI.

Argonne National Labs było naszym pierwszym klientem, który użył Andromeda, i zastosował ją do problemu, który łamał ich klaster 2000 GPU o nazwie Polaris. Problemem było uruchomienie bardzo dużych, modeli generatywnych GPT-3XL, umieszczając cały genom Covid w oknie sekwencji, tak aby można było analizować każdy gen w kontekście całego genomu Covid. Andromeda uruchomiła unikalne obciążenie genetyczne z długimi długościami sekwencji (MSL 10K) w 1, 2, 4, 8 i 16 węzłach, z niemal idealną liniową skalowalnością. Liniowa skalowalność jest jedną z najbardziej pożądanych cech dużego klastra. Andromeda dostarczyła 15,87-krotną przepustowość w 16 systemach CS-2 w porównaniu z pojedynczym systemem CS-2 i redukcję czasu szkolenia do dopasowania.

Czy mógłbyś nam powiedzieć o partnerstwie z Jasper, które zostało ujawnione pod koniec listopada, i co to oznacza dla obu firm?

Jasper to bardzo interesująca firma. Są liderem w dziedzinie generatywnego AI dla marketingu, a ich produkty są używane przez ponad 100 000 klientów na całym świecie, aby pisać kopie dla marketingu, reklam, książek i innych. To jest oczywiście bardzo ekscytująca i dynamicznie rozwijająca się dziedzina. W zeszłym roku ogłosiliśmy partnerstwo z nimi, aby przyspieszyć przyjęcie i poprawić dokładność generatywnego AI w aplikacjach przedsiębiorstw i konsumentów. Jasper używa naszego superkomputera Andromeda do szkolenia ich niezwykle obliczeniowo intensywnych modeli w ułamku czasu. To pozwoli na rozszerzenie zasięgu modeli generatywnego AI na masową skalę.

Z mocą superkomputera Cerebras Andromeda, Jasper może dramatycznie przyspieszyć pracę AI, w tym szkolenie sieci GPT, aby dopasować wyjścia AI do wszystkich poziomów złożoności i szczegółowości użytkownika końcowego. To poprawi kontekstową dokładność modeli generatywnych i pozwoli Jasperowi na personalizację treści w kilku klasach klientów szybko i łatwo.

Nasze partnerstwo pozwala Jasperowi na wynalezienie przyszłości generatywnego AI, robiąc rzeczy, które są niewykonalne lub niemożliwe z tradycyjną infrastrukturą, i przyspieszyć potencjał generatywnego AI, przynosząc jego korzyści naszej szybko rosnącej bazie klientów na całym świecie.

W niedawnym komunikacie prasowym, National Energy Technology Laboratory i Pittsburgh Supercomputing Center ogłosiły pierwszą kiedykolwiek symulację dynamiki płynów obliczeniowych na silniku wafer-scale Cerebras. Czy mógłbyś opisać, co konkretnie jest silnikiem wafer-scale i jak działa?

Nasz silnik Wafer-Scale Engine (WSE) to rewolucyjny procesor AI dla naszego systemu komputera głębokiego uczenia się, CS-2. W przeciwieństwie do procesorów ogólnego przeznaczenia, WSE został zbudowany od podstaw, aby przyspieszyć głębokie uczenie się: ma 850 000 zoptymalizowanych pod kątem AI rdzeni dla operacji na tensorach, ogromną pamięć wewnętrzną o wysokiej przepustowości i połączenia o kilka rzędów wielkości szybsze niż tradycyjny klaster mógłby osiągnąć. To daje Ci zasoby obliczeniowe głębokiego uczenia się równoważne klastrowi maszyn dziedzictwa, wszystko w jednym urządzeniu, łatwym do programowania jak pojedynczy węzeł – radykalnie redukując złożoność programistyczną, czas obliczeń i czas rozwiązania.

Nasza druga generacja WSE-2, która napędza nasz system CS-2, może rozwiązywać problemy niezwykle szybko. Szybko enough, aby umożliwić modele w czasie rzeczywistym, o wysokiej wierności, dla systemów inżynierskich. To jest rzadki przykład udanej “silnej skalowalności”, która jest użyciem równoległości, aby zmniejszyć czas rozwiązania z ustalonym rozmiarem problemu.

To jest to, do czego National Energy Technology Laboratory i Pittsburgh Supercomputing Center używają go. Ogłosiliśmy niedawno bardzo ekscytujące wyniki symulacji dynamiki płynów obliczeniowych (CFD), składającej się z około 200 milionów komórek, w czasie rzeczywistym. Ten film pokazuje wysokorozdzielczą symulację konwekcji Rayleigh-Bénard, która występuje, gdy warstwa płynu jest ogrzewana od dołu i chłodzona od góry. Te termicznie napędzane przepływy płynów są wszędzie wokół nas – od wietrznych dni, po burze śnieżne, po ruchy magmy w jądrze Ziemi i ruchy plazmy w Słońcu. Jak mówi narrator, to nie tylko wizualna uroda symulacji, która jest ważna: to szybkość, z jaką możemy ją obliczyć. Po raz pierwszy, używając naszego silnika Wafer-Scale, NETL jest w stanie manipulować siatką niemal 200 milionów komórek w czasie rzeczywistym.

Jaki rodzaj danych jest symulowany?

Obciążenie testowe było termicznie napędzanymi przepływami płynów, również znanymi jako konwekcja naturalna, które jest aplikacją dynamiki płynów obliczeniowych (CFD). Przepływy płynów występują naturalnie wszędzie wokół nas – od wietrznych dni, po burze śnieżne, po ruchy płyt tektonicznych. Ta symulacja, składająca się z około 200 milionów komórek, koncentruje się na zjawisku zwanym “konwekcją Rayleigh-Bénard”, które występuje, gdy płyn jest ogrzewany od dołu i chłodzony od góry. W naturze, to zjawisko może prowadzić do ciężkich zdarzeń pogodowych, takich jak downbursty, microbursty i derechos. To jest również odpowiedzialne za ruchy magmy w jądrze Ziemi i ruchy plazmy w Słońcu.

We wrześniu 2022 roku, NETL wprowadziło nowy interfejs API do modelowania równań pola, napędzany przez system CS-2, który był nawet 470 razy szybszy niż to, co było możliwe na superkomputerze Joule NETL. To oznacza, że mógł dostarczyć prędkości poza tym, co klastrowe CPU lub GPU mogą osiągnąć. Używając prostego interfejsu API Python, który umożliwia przetwarzanie wafer-scale dla większości nauki komputeryzacyjnej, WFA dostarcza zyski w wydajności i użyteczności, które nie mogły być uzyskane na konwencjonalnych komputerach i superkomputerach – w rzeczywistości, przewyższył OpenFOAM na superkomputerze Joule 2.0 NETL o ponad dwa rzędy wielkości w czasie rozwiązania.

Ponieważ interfejs API WFA jest tak prosty, wyniki zostały osiągnięte w ciągu zaledwie kilku tygodni i kontynuują bliską współpracę między NETL, PSC i Cerebras Systems.

Przez transformację szybkości CFD (która zawsze była powolną, offline’ową zadaniem) na naszym WSE, możemy otworzyć wiele nowych, rzeczywistych przypadków użycia dla tego i wielu innych podstawowych aplikacji HPC. Naszym celem jest, aby umożliwić naszym klientom wykonanie więcej eksperymentów i wynalezienie lepszej nauki. Dyrektor laboratorium NETL, Brian Anderson, powiedział nam, że to znacznie przyspieszy i poprawi proces projektowy dla niektórych bardzo dużych projektów, nad którymi NETL pracuje w celu złagodzenia zmian klimatu i umożliwienia bezpiecznej przyszłości energetycznej – projektów, takich jak sekwestracja węgla i produkcja wodoru niebieskiego.

Cerebras jest stale lepszy od konkurencji, jeśli chodzi o wydawanie superkomputerów, jakie są wyzwania związane z budową superkomputerów najnowszej generacji?

Ironicznie, jednym z najtrudniejszych wyzwań dużej AI jest nie AI. To jest rozproszone obliczenia.

Aby przeszkolić dzisiejsze sieci neuronowe najnowszej generacji, badacze często używają setek lub tysięcy jednostek przetwarzania grafiki (GPU). I to nie jest łatwe. Skalowanie szkolenia dużych modeli językowych w klastrze GPU wymaga rozproszenia obciążenia na wiele małych urządzeń, radzenia sobie z ograniczeniami pamięci urządzeń i przepustowości, oraz starannego zarządzania komunikacją i synchronizacją.

Zajęliśmy się zupełnie innym podejściem do projektowania naszych superkomputerów poprzez rozwój klastra Wafer-Scale Cerebras i trybu wykonywania Cerebras Weight Streaming. Z tymi technologiami, Cerebras rozwiązuje nowy sposób skalowania oparty na trzech kluczowych punktach:

Zamiana procesorów CPU i GPU na przyspieszacze wafer-scale, takie jak system Cerebras CS-2. Ta zmiana redukuje liczbę jednostek obliczeniowych potrzebnych do osiągnięcia akceptowalnej prędkości obliczeń.

Aby sprostać wyzwaniu rozmiaru modelu, zastosowaliśmy architekturę systemu, która oddziela obliczenia od przechowywania modelu. Usługa obliczeniowa oparta na klastrze systemów CS-2 (dostarczająca wystarczającą przepustowość obliczeniową) jest ściśle powiązana z usługą pamięci (o dużej pojemności pamięci), która dostarcza podzbiory modelu do klastra obliczeniowego na żądanie. Jak zwykle, usługa danych dostarcza partie danych szkoleniowych do usługi obliczeniowej w miarę potrzeby.

Innowacyjny model do planowania i koordynowania pracy szkoleniowej w klastrze CS-2, który wykorzystuje równoległość danych, szkolenie warstwa po warstwie z rozproszonymi wagami przesyłanymi na żądanie i przechowywaniem aktywacji w usłudze obliczeniowej.

Istnieją obawy dotyczące końca prawa Moore’a od prawie dekady, ile lat jeszcze może branża “wycisnąć” i jakie innowacje są potrzebne do tego?

Myślę, że pytanie, z którym wszyscy się mierzymy, to czy prawo Moore’a – tak jak je napisał Moore – jest martwe. Nie trwa już dwa lata, aby dostać więcej tranzystorów. Teraz trwa to cztery lub pięć lat. I te tranzystory nie przychodzą po tej samej cenie – przychodzą po znacznie wyższych cenach. Więc pytanie staje się, czy nadal otrzymujemy te same korzyści z przechodzenia z siedmiu do pięciu do trzech nanometrów? Korzyści są mniejsze i kosztują więcej, i rozwiązania stają się bardziej skomplikowane niż po prostu chip.

Jack Dongarra, wiodący architekt komputerowy, wygłosił niedawno wykład i powiedział: “Staliśmy się znacznie lepsi w tworzeniu FLOPs i wejścia/wyjścia”. To jest prawda. Byliśmy zadowoleni, kiedy to powiedział, ponieważ potwierdza naszą decyzję o zbudowaniu większego chipa i przesłaniu mniej rzeczy poza chip. To również daje nam wskazówki dotyczące przyszłych sposobów na zbudowanie systemów z chipami, które będą lepiej wykonywać. Jest jeszcze wiele pracy do wykonania, nie tylko wyciskanie więcej FLOPs, ale także techniki do przenoszenia ich i przenoszenia danych z chipa do chipa – nawet z bardzo dużego chipa do bardzo dużego chipa.

Czy jest coś jeszcze, co chciałbyś podzielić się o Cerebras Systems?

Dla lepszego lub gorszego, ludzie często umieszczają Cerebras w tej kategorii “naprawdę duży chip”. Udało nam się dostarczyć przekonujące rozwiązania dla bardzo dużych sieci neuronowych, eliminując potrzebę bolesnych obliczeń rozproszonych. Uważam, że to jest ogromnie interesujące i leży u serca, dlaczego nasi klienci nas kochają. Interesująca dziedzina na 2023 rok będzie to, jak wykonać duże obliczenia na wyższym poziomie dokładności, używając mniej FLOPs.

Nasza praca nad rzadkością dostarcza niezwykle interesujące podejście. Nie wykonujemy pracy, która nie przybliża nas do linii końcowej, i mnożenie przez zero jest złym pomysłem. Będziemy wydawać bardzo interesujący artykuł o rzadkości wkrótce, i myślę, że będzie więcej wysiłku, aby zobaczyć, jak możemy osiągnąć te punkty wydajności, i jak możemy to zrobić za mniej mocy. I nie tylko za mniej mocy i szkolenia; jak możemy zminimalizować koszt i moc używaną w inferencji? Myślę, że rzadkość pomaga na obu frontach.

Dziękuję za te głębokie odpowiedzi, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Cerebras Systems.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.