Wywiady
Elad Raz, CEO NextSilicon – Wywiad z serii

Elad Raz, CEO NextSilicon, to doświadczony przedsiębiorca i lider technologiczny, który jest powszechnie szanowany za swoją głęboką wiedzę w zakresie niskopoziomowych systemów, bezpieczeństwa, sieci i rozwoju systemów plików. Przez karierę, która obejmuje elitarną inżynierię wojskową, kierownictwo oprogramowania, budowę firm i długoterminowe inwestycje, Raz kierował złożonymi, krytycznymi projektami w zakresie wewnętrznych systemów operacyjnych i integracji sprzętu z oprogramowaniem. Przed założeniem NextSilicon, zbudował i opuścił wiele firm technologicznych, pełnił funkcje kierownicze w wiodącej firmie półprzewodnikowej i inwestował w zróżnicowany portfel startupów, łącząc głęboką wiedzę inżynierską z silną realizacją i długoterminową wizją strategiczną.
NextSilicon to izraelska firma komputerowa i półprzewodnikowa o wysokiej wydajności, założona w 2017 roku, która zmienia architekturę obliczeniową dla wymagających obciążeń, takich jak sztuczna inteligencja i obliczenia naukowe. Firma ta opracowała platformę obliczeniową zdefiniowaną przez oprogramowanie, zaprojektowaną do dostarczania wysokiej wydajności i efektywności bez wymogu ponownego pisania aplikacji przez deweloperów. Poprzez skupienie się na adaptacyjności na poziomie sprzętu, NextSilicon dąży do rozwiązania podstawowych wąskich gardeł w nowoczesnych centrach danych i środowiskach superkomputera, pozycjonując się jako następna generacja alternatywy dla tradycyjnych przyspieszaczy.
Czy możesz opowiedzieć o swojej drodze, która doprowadziła do założenia NextSilicon? Co wywołało pomysł początkowy, a jak Twoje wczesne doświadczenia z komputerami ukształtowały Twoją wizję?
Od dziecka fascynowałem się komputerami. Ta fascynacja doprowadziła mnie od eksperymentowania ze starymi Commodore 64 i Atari (które do dzisiaj zbieram) do współzałożenia startupów, a ostatecznie do sprzedaży mojej poprzedniej firmy firmie Mellanox. Ale nawet pomimo tych wczesnych sukcesów, nieustannie widywałem to samo wyzwanie w tej branży. W miarę jak obciążenia obliczeniowe stawały się coraz bardziej złożone, tradycyjne architektury CPU i GPU osiągały granice wydajności, efektywności energetycznej i skalowalności. Niezależnie od optymalizacji algorytmów czy uruchamiania dużych symulacji, stało się jasne, że bieżące architektury zmuszają obciążenia do adaptacji do sprzętu – a nie odwrotnie.
Iskra dla NextSilicon pojawiła się z tego powtarzającego się wyzwania i zadała pytanie: Co, gdybyśmy mogli odwrócić sytuację i zbudować architektury obliczeniowe, które adaptują się do obciążeń, a nie odwrotnie? Moje wczesne doświadczenia z projektowaniem algorytmów i sprzętem nauczyły mnie, że prawdziwy przełom nastąpiłby z połączenia obu w czasie rzeczywistym. To jest podstawa naszej Inteligentnej Architektury Obliczeniowej (ICA) i wizji przewodniej NextSilicon od samego początku.
Maverick-2 jest opisywany jako Inteligentny Przyspieszacz Obliczeniowy, który adaptuje się do obciążeń w czasie rzeczywistym. Jak jego architektura różni się od tradycyjnych GPU lub FPGA, a co umożliwia ten poziom adaptacyjności?
Procesory CPU i GPU przekształciły nasz świat i służyły nam dobrze. Ale nie zostały one zaprojektowane, aby spełnić wymagania nowoczesnych obciążeń sztucznej inteligencji i obliczeń o wysokiej wydajności w dziedzinach takich jak nauka, pogoda, energia i obrona. Te obciążenia mają złożone zależności danych, wzorce dostępu do pamięci i wzorce obliczeniowe, których dzisiejsze procesory nie były zaprojektowane do obsługi. W efekcie pojawiają się wąskie gardła, które spowalniają innowacje.
Kluczowa różnica Maverick-2 polega na nowatorskim podejściu, które łączy silnik przepływu danych z optymalizacją oprogramowania w czasie rzeczywistym. Kluczowa różnica architektoniczna polega na tym, że sprzęt jest konfigurowany na podstawie Twojego obciążenia, a nie odwrotnie. Dla Maverick-2 dostępność danych napędza obliczenia, a nie program sterujący wykonywaniem instrukcji, jak w tradycyjnych procesorach. To pozwala nam tworzyć wirtualne jednostki przetwarzania zdefiniowane przez oprogramowanie, które mogą być konfigurowane i rekonfigurowane w czasie rzeczywistym, aby dopasować się do określonych wzorców obciążenia.
Wyniki mówią same za siebie: Maverick-2 dostarcza ponad 4-krotną wydajność na wat w porównaniu z GPU i ponad 20-krotną w porównaniu z procesorami CPU, jednocześnie redukując koszty operacyjne o ponad połowę. W rezultacie badacze i inżynierowie mogą uruchamiać duże, nieregularne symulacje szybciej i bardziej efektywnie, odblokowując spostrzeżenia i przełomy w ułamku czasu.
Opowiedz nam o kluczowych innowacjach, które napędzają te zyski wydajności w przypadku obciążeń rzeczywistych.
Zyski wydajności wynikają z kilku kluczowych innowacji, które działają razem.
Po pierwsze, odeszliśmy od modelu von Neumanna, który dominował w komputerach przez 80 lat. Zamiast sekwencyjnego wykonywania instrukcji, Maverick-2 wykorzystuje architekturę przepływu danych, w której obliczenia są wykonywane w zależności od dostępności danych. Jest to fundamentalnie lepiej dopasowane do nieregularnych, intensywnych obciążeń pamięciowych.
Po drugie, nasza samooptymalizująca się architektura generuje rdzenie procesora zdefiniowane przez oprogramowanie w czasie rzeczywistym. Sprzęt adaptuje się do potrzeb każdej aplikacji bez wymogu ponownego pisania kodu – otrzymujesz optymalizację bez nakładu.
Po trzecie, a jest to kluczowe: skupiamy się na utrzymaniu rzeczywistej wydajności w środowiskach rzeczywistych, a nie teoretycznych szczytów. Wiele architektur wygląda dobrze na papierze, ale zawodzą w przypadku rzeczywistych obciążeń. Maverick-2 utrzymuje wydajność w przypadku sztucznej inteligencji, obliczeń o wysokiej wydajności i baz danych wektorowych, ciągle adaptując się do potrzeb obciążenia.
Maverick-2 obsługuje języki C/C++, Fortran, OpenMP i Kokkos bez wymogu modyfikacji kodu. Jak deweloperzy zareagowali na tę kompatybilność, a jakie są plany na obsługę CUDA, ROCm lub popularnych frameworków AI?
Deweloperzy kochają to, że Maverick-2 jest prawdziwym „zamień i uruchom”. Mogą uruchamiać swoje istniejące aplikacje natychmiast bez barier portowania, które dotknęły tę branżę. Obecnie obsługujemy języki C/C++, Fortran, OpenMP i Kokkos, a CUDA, ROCm i główne frameworki AI, takie jak TensorFlow, JAX, PyTorch i ONNX, są w aktywnej fazie rozwoju. To eliminuje zamykanie się w jednym dostawcy i drogie przeróbki kodu, pozwalając klientom ocenić i przyjąć nowe architektury bez zakłócania ich przepływów pracy.
Jak działa telemetryczna optymalizacja systemu Maverick-2 za kulisami? Co jest zaangażowane w profilowanie i rekonfigurowanie układu w czasie rzeczywistym?
Wyobraź sobie naszą optymalizację systemu jako ciągły cykl: podczas wykonywania, nasz system telemetryczny mierzy setki wskaźników wydajności (np. przepustowość pamięci, wykorzystanie, głębokość kolejek). Wszystkie te dane są wprowadzane do optymalizatora czasu wykonywania, który określa, czy bieżąca konfiguracja sprzętu pozostaje optymalna dla obciążenia i jego przewidywanych potrzeb. Jeśli nie, może on ponownie podzielić zasoby, ponownie uporządkować ścieżki danych i dostosować potoki obliczeniowe w sposób ciągły, co oznacza, że aplikacja nie zatrzymuje się. To następuje w ciągu milisekund, więc aplikacja utrzymuje stałą wydajność szczytową, gdy jej profil obliczeniowy ulega zmianie.
Czy istnieją określone typy obciążeń lub przypadki graniczne, w których adaptacyjna optymalizacja czasu wykonywania jest mniej skuteczna lub wprowadza kompromisy w opóźnieniu lub mocy?
Każda architektura ma kompromisy. Maverick-2 wyróżnia się w złożonych, nieregularnych obciążeniach z zmiennymi wzorcami obliczeniowymi i dostępu do danych. Dla wysoko przewidywalnych, stałych obciążeń, dobrze dostosowany GPU może być bardzo wydajny bez nakładu adaptacji. W tych przypadkach nasza adaptacyjność nadal dostarcza solidną wydajność, ale względna przewaga może być mniejsza.
Projekt NextSilicon opiera się na uniwersalności i konkurencyjności w prostych przypadkach, ale jest przełomowy w wyzwaniach.
Dlaczego zdecydowałeś się na priorytet rynku HPC na początku, kiedy większość startupów spieszyła się do AI? Jak to ukształtowało Twoją strategię produktu i biznesu?
Rynek HPC reprezentuje granicę złożoności obliczeniowej i rozwiązywania problemów dla ogromnych zbiorów danych, nieregularnego dostępu do pamięci i nieprzewidywalnych wzorców obliczeniowych. Jeśli możesz zbudować architekturę, która tam się sprawdza – jak na przykład uruchamianie symulacji w skali egabajtów w modelowaniu klimatu lub fizyce cząstek, to również się sprawdzi w AI.
Skupiając się na HPC najpierw, udowodniliśmy Maverick-2 na najbardziej wymagających obciążeniach w modelowaniu klimatu, fizyce i naukach o życiu. To dało nam wiarygodność, dane o wydajności w świecie rzeczywistym i dojrzały produkt, zanim wkroczyliśmy głębiej na rynki AI. Teraz jesteśmy przygotowani, aby obsłużyć oba, bez kompromisów w architekturze, aby skapitalizować krótkoterminowe trendy lub potrzeby.
Teraz, gdy Maverick-2 jest w produkcji i wdrożony u setek klientów, możesz podzielić się przykładami, jak jest on wykorzystywany? Czy są jakieś szczególne wyniki lub benchmarki z wdrożeń flagowych?
Przykładem flagowym jest nasze wdrożenie w Sandia National Labs, gdzie Maverick-2 napędza ich superkomputer Spectra w ramach programu Vanguard-II. Widzimy imponujące wyniki wydajności bez konieczności modyfikacji kodu. Pracujemy również z ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), które łączy wiodące instytucje badawcze, aby obsłużyć dane w skali egabajtów z CERN’s High-Luminosity Large Hadron Collider i Square Kilometre Array Observatory. Rola Maverick-2 polega na rozwiązaniu wyzwania przetwarzania petabajtów surowych danych eksperymentalnych w ułamku czasu i energii wcześniej wymaganej. Celem końcowym jest umożliwienie szybszych analiz fizycznych i odkryć astronomicznych.
Podniósłeś ponad 300 milionów dolarów, z głównymi rundami ogłoszonymi w 2021 roku i ostatnio. Czy możesz podzielić się, jak to finansowanie przyspieszyło rozwój Twojego produktu i zasięg rynkowy?
Finansowanie pozwoliło nam na trzy rzeczy. Po pierwsze, mogliśmy posunąć architekturę do przodu, nie tylko poprawiając ją stopniowo, ale wprowadzając fundamentalne postępy, które uczyniły Maverick-2 gotowym do produkcji. Po drugie, skalowaliśmy naszą produkcję i łańcuch dostaw, aby spełnić rosnący popyt, co nie było trywialnym wyzwaniem dla nowego sprzętu. Po trzecie, rozszerzyliśmy nasz ekosystem oprogramowania, aby umożliwić klientom szybsze integrację i wdrożenie.
To również umożliwiło nam strategiczne partnerstwa z ośrodkami superkomputera i dostawcami chmury, pozwalając nam na przyspieszenie procesu od pomysłu do wdrożenia i szybsze rozszerzanie się niż tradycyjne startupy sprzętowe.
W krajobrazie, który obejmuje Cerebras (CBRS ), SambaNova i Nvidia (NVDA ), jak widzisz pozycjonowanie NextSilicon? Jaka jest Twoja strategia wejścia na rynek jako wyzwaniacz?
Widzimy NextSilicon jako firmę technologiczną, a nie tylko kolejną firmę produkującą chipy. Optymalizujemy każde obciążenie, zapewniamy adaptacyjność i nie zamykamy klientów w oprogramowaniu lub sprzęcie. Nasi klienci mogą przyjmować swój istniejący kod i osiągać natychmiastowe przyspieszenie bez długich cykli portowania lub zamykania się w jednym ekosystemie, takim jak CUDA. To ma znaczenie, zwłaszcza gdy obciążenia sztucznej inteligencji ewoluują poza czyste szkolenie. Modele wnioskowania, rozszerzona inferencja i duże okna kontekstowe wymagają fundamentalnie innych wzorców obliczeniowych: bardziej dynamicznego dostępu do pamięci, zmiennych długości obliczeń i adaptacyjnego przydziału zasobów. Nie są to problemy, które można rozwiązać za pomocą więcej tej samej architektury stałej.
Nasza strategia wejścia na rynek koncentruje się na rozwiązywaniu najtrudniejszych problemów najpierw: współpracy z instytucjami badawczymi, laboratoriami narodowymi i przedsiębiorstwami, gdzie wydajność, efektywność energetyczna i elastyczność są kluczowe. Stamtąd skalujemy do szerszych rynków AI i intensywnych danych. Branża jest zdominowana przez architektury stałe. Ofertujemy coś innego – adaptacyjność zbudowaną od samego początku. Sztuczna inteligencja przechodzi od czystej skali do inteligencji. Większe modele umożliwiają inteligentne wnioskowanie, od krótkich podpowiedzi do długiego zrozumienia kontekstu. W tej transformacji, adaptacyjne architektury nie będą tylko nowatorskie; będą niezbędne.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić NextSilicon.












