Wywiady
Mosze Tanach, CEO i współzałożyciel NeuReality – seria wywiadów

Mosze Tanach jest CEO i współzałożycielem NeuReality. Przed założeniem NeuReality, Mosze pełnił funkcję Dyrektora Inżynieryjnego w Marvell i Intel (INTC ), gdzie kierował rozwojem złożonych produktów bezprzewodowych i sieciowych do produkcji masowej. Pełnił również funkcję AVP ds. Badań i Rozwoju w DesignArt Networks (później przejętym przez Qualcomm (QCOM )), gdzie przyczynił się do rozwoju produktów stacji bazowych 4G.
NeuReality ma za misję uproszczenie wdrożenia sztucznej inteligencji. Poprzez podejście systemowe do sztucznej inteligencji, zespół NeuReality dostarcza inferencję sztucznej inteligencji w sposób holistyczny, identyfikując ból głowy i dostarczając rozwiązania inferencji sztucznej inteligencji opracowane specjalnie, od krzemu do oprogramowania, które sprawiają, że sztuczna inteligencja jest zarówno przystępna, jak i dostępna.
Z uwagi na Pańskie bogate doświadczenie w kierowaniu projektami inżynieryjnymi w Marvell, Intel i DesignArt-Networks, co skłoniło Pana do współzałożenia NeuReality, i jak Pańskie poprzednie role wpłynęły na wizję i kierunek firmy?
NeuReality zostało zbudowane od początku, aby rozwiązać przyszłe problemy związane z kosztami, złożonością i klimatem, które byłyby nieuniknione w przypadku inferencji sztucznej inteligencji – czyli wdrożenia opracowanych modeli i oprogramowania sztucznej inteligencji do produkcji w centrach danych. Tam, gdzie szkolenie sztucznej inteligencji jest sposobem, w jaki sztuczna inteligencja jest tworzona; inferencja sztucznej inteligencji jest sposobem, w jaki jest używana i w jaki sposób wchodzi w interakcje z miliardami ludzi i urządzeń na całym świecie.
Jesteśmy zespołem inżynierów systemowych, więc patrzymy na wszystkie aspekty, wszystkie wieloaspektowe inferencje sztucznej inteligencji, w tym GPU i wszystkie klasy specjalistycznych przyspieszaczy sztucznej inteligencji. Stało się dla nas jasne, wracając do 2015 roku, że procesory CPU-zależne od sztucznej inteligencji i systemy – czyli każdy GPU, TPU, LPU, NRU, ASIC i FPGA dostępne na rynku – uderzą w znaczącą barierę do 2020 roku. Ich ograniczenia systemowe, gdzie przyspieszacz sztucznej inteligencji stał się lepszy i szybszy pod względem surowej wydajności, ale podstawowa infrastruktura nie nadążyła.
W rezultacie postanowiliśmy odejść od dużych gigantów, które są naznaczone biurokracją, chroniąc udane interesy, takie jak producenci CPU i kart sieciowych, i zakłócić branżę lepszą architekturą sztucznej inteligencji, która jest otwarta, agnostyczna i opracowana specjalnie dla inferencji sztucznej inteligencji. Jednym z wniosków z ponownego wyobrażenia idealnej inferencji sztucznej inteligencji jest to, że poprzez zwiększenie wykorzystania GPU i efektywności systemu, nasza nowa infrastruktura obliczeniowa i sieciowa sztucznej inteligencji – napędzana przez nasz nowy układ serwerowy NR1, który zastępuje procesor CPU i karty sieciowe. Jako marka składnikowa i towarzysząca każdemu GPU lub przyspieszaczowi sztucznej inteligencji, możemy usunąć bariery rynkowe, które odstraszają 65% organizacji od innowacji i wdrożenia sztucznej inteligencji dzisiaj – niewykorzystane GPU, co prowadzi do kupowania więcej, niż to, co jest naprawdę potrzebne (ponieważ pracują bezczynnie > 50% czasu) – przy jednoczesnym zmniejszaniu zużycia energii, wyzwania związanego z centrami danych sztucznej inteligencji i kosztami operacyjnymi.
To jest raz w życiu okazja, aby naprawdę przekształcić architekturę systemu sztucznej inteligencji na lepsze, oparte na wszystkim, czego nauczyłem się i praktykowałem przez 30 lat, otwierając drzwi dla nowych innowatorów sztucznej inteligencji w różnych branżach i usuwając wąskie gardła CPU, złożoność i ślady węglowe.
Misja NeuReality to demokratyzacja sztucznej inteligencji. Czy mógłby Pan wyjaśnić, co “sztuczna inteligencja dla wszystkich” oznacza dla Pana i jak NeuReality planuje osiągnąć tę wizję?
Nasza misja to demokratyzacja sztucznej inteligencji, czyniąc ją bardziej dostępną i przystępną dla wszystkich organizacji, dużych i małych – poprzez uwolnienie maksymalnej pojemności każdego GPU lub każdego przyspieszacza sztucznej inteligencji, dzięki czemu uzyskasz więcej z Twojej inwestycji; innymi słowy, uzyskaj WIĘCEJ z GPU, które kupujesz, zamiast KUPIĆ więcej GPU, które pracują bezczynnie > 50% czasu. Możemy zwiększyć przyspieszacze sztucznej inteligencji do 100% pełnej zdolności, dostarczając jednocześnie do 15-krotnie większą efektywność energetyczną i obcinając koszty systemu do 90%. Są to poprawy o rzędy wielkości. Planujemy osiągnąć tę wizję naszym rozwiązaniem NR1 AI Inference, pierwszą architekturą systemu centrum danych opracowaną dla ery sztucznej inteligencji. Uruchamia duże objętości, różnorodne potoki danych sztucznej inteligencji w sposób przystępny i wydajny, z dodatkową korzyścią zmniejszonego śladu węglowego.
Osiąganie sztucznej inteligencji dla wszystkich oznacza również łatwość użycia. W NeuReality upraszczamy wdrożenie, zarządzanie i skalowalność infrastruktury sztucznej inteligencji, poprawiamy procesy biznesowe i zyski, oraz wspieramy sektory takie jak opieka zdrowotna, bezpieczeństwo, egzekwowanie prawa i obsługa klienta. Nasz wpływ obejmuje sektory takie jak obrazowanie medyczne, badania kliniczne, wykrywanie oszustw, tworzenie treści sztucznej inteligencji i wiele innych.
Obecnie nasze pierwsze komercyjnie dostępne urządzenia NR1-S AI Inference są dostępne z przyspieszaczami Qualcomm Cloud AI 100 Ultra i za pośrednictwem Cirrascale, dostawcy usług chmurowych.
Rozwiązanie NR1 AI Inference jest określane jako pierwsza architektura systemu centrum danych opracowana dla ery sztucznej inteligencji i opracowana specjalnie dla inferencji sztucznej inteligencji. Jakie były kluczowe innowacje i przełomy, które doprowadziły do rozwoju NR1?
NR1 to nazwa całej architektury systemu od krzemu do oprogramowania, którą opracowaliśmy i dostarczyliśmy przemysłowi sztucznej inteligencji – jako otwarta, w pełni kompatybilna infrastruktura obliczeniowa i sieciowa, która uzupełnia każdy przyspieszacz sztucznej inteligencji i GPU. Jeśli miałbym to podsumować do najważniejszych i najbardziej interesujących innowacji, które doprowadziły do tego rozwiązania NR1 i różnią nas, powiedziałbym:
- Optymalizowane grafy obliczeniowe sztucznej inteligencji: Zespół zaprojektował przyspieszacz wykonywania grafów, aby zoptymalizować przetwarzanie grafów obliczeniowych, które są kluczowe dla sztucznej inteligencji i innych obciążeń, takich jak przetwarzanie mediów, bazy danych i wiele innych. Grafy obliczeniowe reprezentują serię operacji z zależnościami, a ich szersza stosowalność pozycjonuje NR1 jako potencjalnie przełomowe poza zwykłym zwiększaniem wydajności GPU i innych przyspieszaczy sztucznej inteligencji. Uproszcza wdrożenie modeli sztucznej inteligencji, generując zoptymalizowane grafy obliczeniowe (CG) na podstawie przetworzonych danych sztucznej inteligencji i interfejsów API oprogramowania, co prowadzi do znaczących zysków wydajności.
- NR1 NAPU (Network Addressable Processing Unit): Nasza architektura inferencji sztucznej inteligencji jest napędzana przez NR1 NAPU – układ serwerowy 7nm, który umożliwia bezpośredni dostęp do sieci dla pre- i post-przetwarzania sztucznej inteligencji. Wkładamy 6,5-krotnie więcej energii na mniejszym chipie NR1 niż typowy, ogólny procesor CPU. Tradycyjnie, zadania pre-przetwarzania (takie jak czyszczenie danych, formatowanie i ekstrakcja cech) i post-przetwarzania (takie jak interpretacja wyników i formatowanie) są obsługiwane przez CPU. Przez przeniesienie tych zadań na NR1 NAPU, usuwamy zarówno CPU, jak i karty sieciowe. To redukuje wąskie gardła, umożliwiając szybsze ogólne przetwarzanie, błyskawiczne czasy odpowiedzi i niższe koszty na zapytanie sztucznej inteligencji.
- Technologia AI-Hypervisor NR1: Patented, sprzętowa technologia AI-Hypervisor NR1 optymalizuje orkiestrację zadań sztucznej inteligencji i wykorzystanie zasobów, poprawiając efektywność i redukując wąskie gardła.
- Silnik sieciowy AI-over-Fabric NR1: NR1 zawiera unikalny silnik sieciowy AI-over-Fabric, który zapewnia bezproblemową łączność sieciową i efektywne skalowanie zasobów sztucznej inteligencji na wielu chipach NR1 – które są połączone z dowolnym GPU lub przyspieszaczem sztucznej inteligencji – w ramach tego samego serwera inferencji lub urządzenia NR1-S.
Najnowsze dane wydajności NeuReality podkreślają znaczące oszczędności kosztów i energii. Czy mógłby Pan dostarczyć więcej szczegółów na temat tego, jak NR1 osiąga do 90% oszczędności kosztów i 15-krotnie lepszą efektywność energetyczną w porównaniu z tradycyjnymi systemami?
NeuReality NR1 redukuje koszty i zużycie energii przez inferencję sztucznej inteligencji do 90% i 15-krotnie, odpowiednio. To jest osiągane za pomocą:
- Specjalistyczny krzem: Nasza infrastruktura inferencji sztucznej inteligencji jest napędzana przez układ serwerowy NR1 NAPU, który absorbuje funkcjonalność CPU i karty sieciowej w jeden – i eliminuje potrzebę CPU w inferencji. Ostatecznie NR1 maksymalizuje wyjście każdego przyspieszacza sztucznej inteligencji lub GPU w najbardziej efektywny sposób.
- Optymalizowana architektura: Przez uproszczenie przepływu danych sztucznej inteligencji i włączenie pre- i post-przetwarzania sztucznej inteligencji bezpośrednio w ramach NR1 NAPU, odłączamy i zastępujemy CPU. To prowadzi do zmniejszonej latencji, liniowej skalowalności i niższych kosztów na zapytanie sztucznej inteligencji.
- Elastyczne wdrożenie: Można kupić NR1 na dwa główne sposoby: 1) wewnątrz modułu NR1-M, który jest kartą PCIe, która zawiera wiele układów NR1 NAPU (zazwyczaj 10) zaprojektowanych do połączenia z kartami przyspieszania sztucznej inteligencji. 2) wewnątrz urządzenia NR1-S, które łączy układy NR1 NAPU z taką samą liczbą przyspieszaczy sztucznej inteligencji (GPU, ASIC, FPGA itp.) jako gotowy system inferencji sztucznej inteligencji.
Na Supercomputing 2024 w listopadzie, zobaczycie, jak będziemy demonstrować urządzenie NR1-S z 4-krotnymi chipami NR1 na 16-krotnych przyspieszaczach Qualcomm Cloud AI 100 Ultra. Przetestowaliśmy to samo z chipami inferencji sztucznej inteligencji Nvidia (NVDA ). NeuReality rewolucjonizuje inferencję sztucznej inteligencji dzięki otwartej, opracowanej specjalnie architekturze.
Jak urządzenie NR1-S AI Inference porównuje się z tradycyjnymi serwerami inferencji CPU z przyspieszaczami Nvidia H100 lub L40S GPU w aplikacjach rzeczywistych?
NR1, w połączeniu z przyspieszaczami Qualcomm Cloud AI 100 lub Nvidia H100 lub L40S GPU, dostarcza znaczną poprawę wydajności w aplikacjach sztucznej inteligencji w porównaniu z tradycyjnymi serwerami inferencji CPU. Innymi słowy, uruchamianie systemu inferencji sztucznej inteligencji z NR1 optymalizuje wydajność, koszty systemu, efektywność energetyczną i czasy odpowiedzi w aplikacjach sztucznej inteligencji, takich jak duże modele językowe, rozpoznawanie obrazów, przetwarzanie języka naturalnego i rozpoznawanie mowy.
Wynik? Kiedy połączony z NR1, klient otrzymuje WIĘCEJ z inwestycji w GPU, zamiast KUPIĆ więcej GPU, aby osiągnąć pożądaną wydajność.
Ponadto maksymalizując wykorzystanie GPU, NR1 dostarcza wyjątkową efektywność, prowadząc do 50-90% lepszej ceny/wydajności i do 13-15-krotnie większej efektywności energetycznej. To przekłada się na znaczące oszczędności kosztów i zmniejszenie śladu węglowego dla infrastruktury sztucznej inteligencji.
Urządzenie NR1-S demonstruje liniową skalowalność bez spadku wydajności. Czy mógłby Pan wyjaśnić aspekty techniczne, które umożliwiają taką bezproblemową skalowalność?
Urządzenie NR1-S, łącząc nasze chipy NR1 z przyspieszaczami sztucznej inteligencji dowolnego typu lub ilości, ponownie definiuje infrastrukturę sztucznej inteligencji. Przeszliśmy poza ograniczenia CPU, aby osiągnąć nowy poziom wydajności i efektywności.
Zamiast tradycyjnego wąskiego gardła NIC-CPU-przyspieszacz, urządzenie NR1-S integruje bezpośredni dostęp do sieci, pre- i post-przetwarzanie w ramach naszych Jednostek Przetwarzania Adresowalnych Sieciowo (NAPU). Zazwyczaj 10 NAPU na system, każdy obsługujący zadania, takie jak przetwarzanie wizji, audio i DSP, oraz nasz AI-Hypervisor, który orkiestruje obciążenia, uproszczony przepływ danych sztucznej inteligencji jest osiągany. To przekłada się na liniową skalowalność: dodaj więcej przyspieszaczy, otrzymaj proporcjonalnie więcej wydajności.
Wynik? 100% wykorzystanie przyspieszaczy sztucznej inteligencji jest stale obserwowane. Podczas gdy ogólny koszt i efektywność energetyczna różnią się w zależności od konkretnych chipów sztucznej inteligencji, maksymalizacja inwestycji w sprzęt i poprawa wydajności są stale dostarczane. Gdy potrzeby inferencji sztucznej inteligencji rosną, urządzenie NR1-S dostarcza przekonywującą alternatywę dla tradycyjnych architektur.
NeuReality ma na celu rozwiązanie barier dla powszechnego wdrożenia sztucznej inteligencji. Jakie są największe wyzwania, przed którymi stają firmy przy wdrożeniu sztucznej inteligencji, i jak Pańska technologia pomaga pokonać te bariery?
Gdy są źle wdrożone, oprogramowanie i rozwiązania sztucznej inteligencji mogą stać się uciążliwe. Wiele firm nie może wdrożyć sztucznej inteligencji ze względu na koszty i złożoność budowy i skalowania systemów sztucznej inteligencji. Dzisiejsze rozwiązania sztucznej inteligencji nie są zoptymalizowane pod kątem inferencji, a ich wydajność jest słaba, a serwery inferencji mają wysokie wąskie gardła. Aby podjąć to wyzwanie i uczynić sztuczną inteligencję bardziej dostępną, opracowaliśmy pierwsze kompletne rozwiązanie inferencji sztucznej inteligencji – infrastrukturę obliczeniową i sieciową napędzaną przez nasz układ NAPU – która wykorzystuje maksymalnie towarzyszący przyspieszacz sztucznej inteligencji i redukuje bariery rynkowe związane z nadmiernymi kosztami i zużyciem energii.
Nasze podejście systemowe do inferencji sztucznej inteligencji – w przeciwieństwie do rozwoju lepszego GPU lub przyspieszacza sztucznej inteligencji, gdzie jest już wiele innowacji i konkurencji – oznacza, że wypełniamy znaczącą lukę w branży dla dziesiątek innowatorów chipów i systemów inferencji sztucznej inteligencji. Nasz zespół zaatakował słabości inferencji sztucznej inteligencji w sposób systemowy i holistyczny, identyfikując ból głowy, luki architektoniczne i projekcje obciążeń sztucznej inteligencji – aby dostarczyć pierwszą architekturę sztucznej inteligencji opracowaną specjalnie, od krzemu do oprogramowania, CPU-wolną.
W konkurencyjnym rynku sztucznej inteligencji, co wyróżnia NeuReality spośród innych dostawców rozwiązań inferencji sztucznej inteligencji?
Łatwo powiedzieć, że jesteśmy otwarci i agnostyczni wobec przyspieszaczy. Nasza infrastruktura inferencji NR1 napędza każdy przyspieszacz sztucznej inteligencji – GPU, TPU, LPU, ASIC, niezależnie od nazwy – tworząc w pełni zoptymalizowany system końcowy. Przyspieszacze sztucznej inteligencji zostały wprowadzone po to, aby pomóc CPU w radzeniu sobie z wymaganiami sieci neuronowych i uczenia maszynowego w dużych ilościach, ale teraz przyspieszacze sztucznej inteligencji stały się tak potężne, że są teraz ograniczane przez same CPU, które miały im pomóc.
Nasze rozwiązanie? NR1. To jest kompletne, ponownie wyobrażone rozwiązanie inferencji sztucznej inteligencji. Naszym sekretnym orężem jest NR1 NAPU, który został zaprojektowany jako współskładnik, aby maksymalizować wydajność przyspieszacza sztucznej inteligencji bez pochłaniania dodatkowej mocy lub łamania banku. Zbudowaliśmy otwarty ekosystem, który integruje się bezproblemowo z każdym chipem inferencji sztucznej inteligencji i popularnymi frameworkami oprogramowania, takimi jak Kubernetes, Python, TensorFlow i wiele innych.
Podejście NeuReality do otwartości oznacza, że nie konkurujemy z krajobrazem sztucznej inteligencji; jesteśmy tu, aby go uzupełnić poprzez partnerstwa strategiczne i współpracę technologiczną. Dostarczamy brakujący element układanki: architekturę inferencji opracowaną specjalnie, wolną od CPU, która nie tylko odblokowuje przyspieszacze sztucznej inteligencji, aby osiągnąć wydajność referencyjną, ale także ułatwia firmom i rządom wdrożenie sztucznej inteligencji. Wyobraź sobie uwolnienie pełnej mocy NVIDIA H100, Google (GOOGL ) TPUs lub AMD MI300 – dając im infrastrukturę, na którą zasługują.
NeuReality otwarta, efektywna architektura wyrównuje pole gry, czyniąc sztuczną inteligencję bardziej dostępną i przystępną dla wszystkich. Jestem pasjonatem widzenia różnych branż – fintech, biotech, healthtech – doświadczających zalet NR1. Porównaj swoje rozwiązania sztucznej inteligencji na tradycyjnych systemach CPU z nowoczesną infrastrukturą NR1 i zobacz różnicę. Dzisiaj tylko 35% firm i rządów wdrożyło sztuczną inteligencję, a to oparte na niezwykle niskich kryteriach kwalifikacji. Zróbmy, aby ponad 50% klientów korporacyjnych mogło wdrożyć sztuczną inteligencję w ciągu najbliższego roku, bez szkody dla planety lub banku.
Spójrzając w przyszłość, jaka jest długoterminowa wizja NeuReality dla roli sztucznej inteligencji w społeczeństwie, i jak Pańska firma przyczynia się do tej przyszłości?
Wyobrażam sobie przyszłość, w której sztuczna inteligencja przynosi korzyści wszystkim, pobudzając innowacje i poprawiając życie. Nie budujemy tylko technologii; budujemy fundamenty dla lepszej przyszłości.
Nasze NR1 jest kluczem do tej wizji. To jest kompletne rozwiązanie inferencji sztucznej inteligencji, które zaczyna łamać bariery kosztów i złożoności, które utrudniają masowe wdrożenie sztucznej inteligencji w firmach. Zreimaginowaliśmy zarówno infrastrukturę, jak i architekturę, dostarczając rewolucyjny system, który maksymalizuje wyjście każdego GPU, każdego przyspieszacza sztucznej inteligencji, bez zwiększania kosztów operacyjnych lub zużycia energii.
Model biznesowy naprawdę ma znaczenie, aby skalować i dać końcowym klientom prawdziwe wybory ponad skoncentrowaną autokracją sztucznej inteligencji, o czym pisałem wcześniej. Zamiast tego, budujemy otwarty ekosystem, w którym nasz krzem działa z innym krzemem, a nie przeciwko niemu. Dlatego zaprojektowaliśmy NR1, aby integrował się bezproblemowo z wszystkimi przyspieszaczami sztucznej inteligencji i z otwartymi modelami i oprogramowaniem, czyniąc go tak łatwym do instalacji, zarządzania i skalowania.
Ale nie przestajemy tam. Współpracujemy z partnerami, aby zwalidować naszą technologię w różnych obciążeniach sztucznej inteligencji i dostarczyć “inferencję jako usługę” i “LLM jako usługę” za pośrednictwem dostawców usług chmurowych, hiper-skalowalności i bezpośrednio z towarzyszącymi producentami chipów. Chcemy uczynić zaawansowaną sztuczną inteligencję dostępną i przystępną dla wszystkich.
Wyobraź sobie możliwości, gdybyśmy mogli poprawić wydajność inferencji sztucznej inteligencji, efektywność energetyczną i przystępność o dwucyfrowe procenty. Wyobraź sobie silne, sztucznie inteligentne społeczeństwo z większą liczbą głosów i wyborów, które staje się rzeczywistością. Więc musimy wszyscy wykonać wymagającą pracę, aby udowodnić wpływ biznesowy i ROI, gdy sztuczna inteligencja jest wdrożona w codziennych operacjach centrów danych. Skoncentrujmy się na rewolucyjnym wdrożeniu sztucznej inteligencji, a nie tylko na możliwościach modelu.
To jest sposób, w jaki przyczyniamy się do przyszłości, w której sztuczna inteligencja przynosi korzyści wszystkim – wygraną dla marż zysku, ludzi i planety.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić NeuReality.












