Interviuri

Elad Raz, CEO al NextSilicon – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Elad Raz, CEO al NextSilicon, este un antreprenor experimentat și lider în tehnologie, respectat pentru expertiza sa profundă în sisteme de nivel scăzut, securitate, rețele și dezvoltare de sisteme de fișiere. Pe parcursul unei cariere care a cuprins roluri de inginerie militară de elită, conducere de software senior, construire de companii și investiții pe termen lung, Raz a condus proiecte complexe și critice pentru misiuni, care au implicat internalele sistemelor de operare și integrarea hardware-software. Înainte de a fonda NextSilicon, el a construit și a ieșit din mai multe companii de tehnologie, a ocupat roluri de conducere senior într-o firmă de semiconductoare de top și a investit într-un portofoliu divers de startup-uri, combinând profunzimea inginerească practică cu o execuție puternică și o viziune strategică pe termen lung.

NextSilicon este o companie israeliană de calcul de înaltă performanță și semiconductoare, fondată în 2017, care redefinește arhitectura de calcul pentru sarcini solicitante, cum ar fi inteligența artificială și calculul științific. Compania a dezvoltat o platformă de calcul inteligent, definită prin software, proiectată pentru a oferi performanță ridicată și eficiență, fără a necesita ca dezvoltatorii să rescrie aplicațiile. Prin concentrarea pe adaptabilitate la nivel de hardware, NextSilicon își propune să abordeze blocajele fundamentale din centrele de date moderne și mediile de supercalcul, poziționându-se ca o alternativă de nouă generație la acceleratoarele tradiționale.

Puteți să ne spuneți despre călătoria dvs. care a condus la fondarea NextSilicon? Ce a declanșat ideea inițială și cum au influențat experiențele dvs. timpurii cu calculul viziunea dvs.?

M-am fascinat de calculatoare de când eram copil. Acea fascinație m-a condus de la a experimenta cu vechile Commodore 64 și Atari (pe care le colecționez și astăzi) la a co-fonda startup-uri și, în cele din urmă, la a vinde compania mea anterioară către Mellanox. Dar, chiar și cu acele succese timpurii, am continuat să văd aceeași provocare,again și again, în această industrie. Pe măsură ce sarcinile de calcul au devenit mai complexe, arhitecturile tradiționale de CPU și GPU au atins limitele de performanță, eficiență energetică și scalabilitate. Indiferent dacă se optimizau algoritmi sau se rulează simulări la scară largă, a devenit clar că arhitecturile actuale forțează sarcinile să se adapteze la hardware – și nu invers.

Scânteia pentru NextSilicon a venit din această provocare recurentă și a ridicat întrebarea: Ce s-ar întâmpla dacă am putea să răsturnăm situația și să construim arhitecturi de calcul care să se adapteze la sarcini, și nu să forțeze sarcinile să se adapteze la hardware? Experiența mea timpurie cu proiectarea algoritmilor și hardware-ul mi-a învățat că adevăratele descoperiri vor veni din combinarea celor două în timp real. Acesta este fundamentul Arhitecturii noastre de Calcul Inteligent (ICA) și viziunea ghidatoare a NextSilicon de la început.

Maverick-2 este descris ca un Accelerator de Calcul Inteligent care se adaptează la sarcini în timp real. Cum diferă arhitectura sa de cea a GPU-urilor sau FPGA-urilor tradiționale și ce permite nivelul acela de adaptabilitate?

CPUs și GPUs au transformat lumea noastră și ne-au servit bine. Dar ele nu au fost proiectate pentru a îndeplini cerințele sarcinilor moderne de inteligență artificială și calcul de înaltă performanță (HPC) din domenii precum știința, vremea, energia și apărarea. Aceste sarcini au dependențe de date complexe, modele de acces la memorie și modele de calcul care procesorii de azi nu au fost proiectați să le gestioneze. Rezultatul este reprezentat de blocaje care încetinesc inovația.

Diferența cheie a arhitecturii Maverick-2 este abordarea sa inovatoare, care combină un motor de flux de date reconfigurabil cu optimizarea software în timp real. Diferența arhitecturală cheie este că hardware-ul este configurat pe baza sarcinii dvs., și nu invers. Pentru Maverick-2, disponibilitatea datelor conduce calculul, și nu un program care conduce executarea instrucțiunilor, ca în procesorii tradiționali. Acest lucru ne permite să creăm unități virtuale de procesare definite prin software, care pot fi configurate și reconfigurate în timp real pentru a se potrivi cu modelele specifice de sarcină.

Rezultatele vorbesc de la sine: Maverick-2 oferă o performanță de peste 4 ori mai mare pe watt decât GPU-urile și de peste 20 de ori mai mare decât CPU-urile de înaltă performanță, reducând în același timp costurile operaționale cu peste jumătate. Ca urmare, cercetătorii și inginerii pot rula simulări mari și neregulate mai rapid și mai eficient, deblocând insight-uri și descoperiri într-o fracțiune din timp.

Ați raportat obținerea unei performanțe de peste 4 ori mai mare pe watt față de GPU-uri și de peste 20 de ori mai mare decât CPU-urile de înaltă performanță. Care sunt inovațiile cheie care conduc la aceste câștiguri de performanță în sarcini reale?

Câștigurile de performanță provin din câteva inovații cheie care lucrează împreună.

În primul rând, am părăsit modelul Von Neumann, care a dominat calculul timp de 80 de ani. În loc de executarea secvențială a instrucțiunilor, Maverick-2 utilizează o arhitectură de flux de date, în care calculul urmează disponibilitatea datelor. Acest lucru este fundamental mai bine adaptat pentru sarcini neregulate și intensive din punct de vedere al memoriei.

În al doilea rând, arhitectura noastră de auto-optimizare generează nuclee de procesor definite prin software în timp real. Hardware-ul se adaptează la nevoile fiecărei aplicații fără a necesita rescrierea codului – obțineți optimizarea fără suprasarcină.

În al treilea rând, și acesta este critic: ne concentrăm pe performanța reală, sustenabilă, și nu pe vârfurile teoretice. Multe arhitecturi arată bine pe hârtie, dar se înfrâng pe sarcini reale. Maverick-2 menține eficiența pe parcursul sarcinilor de inteligență artificială, HPC și baze de date vectoriale, adaptându-se continuu la nevoile sarcinii.

Maverick-2 suportă C/C++, Fortran, OpenMP și Kokkos fără a necesita modificări de cod. Cum au răspuns dezvoltatorii la această compatibilitate și care sunt planurile dvs. pentru a suporta CUDA, ROCm sau cadre populare de inteligență artificială?

Dezvoltatorii iubesc faptul că Maverick-2 este un adevărat “înlocuitor de picături”. Ei pot rula aplicațiile existente imediat, fără a întâmpina bariere de portare care afectează această industrie. În prezent, suportăm C/C++, Fortran, OpenMP și Kokkos, cu CUDA, ROCm și cadre majore de inteligență artificială, cum ar fi TensorFlow, JAX, PyTorch și ONNX, în dezvoltare activă. Acest lucru elimină blocajele furnizorului și rescrierea codului costisitoare și permite clienților să evalueze și să adopte noi arhitecturi fără a perturba fluxurile de lucru.

Cum funcționează optimizarea sistemului bazată pe telemetrie în spatele scenei? Ce este implicat în profilarea și reconfigurarea cipului în timp real?

Considerați optimizarea noastră de sistem ca un ciclu continuu: în timpul executării, sistemul nostru de telemetrie măsoară sute de indicatori de performanță (de exemplu, lățimea de bandă a memoriei, utilizarea, adâncimea cozilor). Toate aceste date sunt introduse într-un optimizator de timp de rulare care determină dacă configurația actuală de hardware rămâne optimă pentru sarcină și nevoile sale anticipate. Dacă nu, poate repartitiona resurse, rearanja căile de date și ajusta pipe-line-urile de calcul continuu, ceea ce înseamnă că aplicația nu se oprește. Acest lucru se întâmplă în milisecunde, astfel încât aplicația menține eficiența maximă constantă, pe măsură ce profilul său de calcul se schimbă.

Există tipuri specifice de sarcini sau cazuri limită în care ajustarea performanței în timp real este mai puțin eficientă sau introduce compromisuri în latență sau putere?

Orice arhitectură va avea compromisuri. Maverick-2 excelează la sarcini complexe și neregulate, cu modele de calcul și acces la date schimbătoare. Pentru sarcini foarte previzibile și cu funcții fixe, un GPU bine reglat poate fi foarte eficient fără suprasarcina adaptării. În aceste cazuri, adaptabilitatea noastră oferă totuși o performanță solidă, dar avantajul relativ poate fi mai mic.

Proiectarea NextSilicon se concentrează pe versatilitate și competitivitate în cazuri simple, dar este transformatoare în cele provocatoare.

De ce ați decis să prioritizați piața HPC de la început, când majoritatea startup-urilor se grăbeau să intre în inteligența artificială? Cum a influențat această decizie strategia dvs. de produs și de afaceri?

Piața HPC reprezintă frontiera complexității computaționale și a rezolvării problemelor pentru seturi de date masive, acces la memorie neregulat și modele de calcul imprevizibile. Dacă puteți construi o arhitectură care să prospere acolo – cum ar fi rularea simulărilor la scară de exabytes în modelarea climatică sau fizica particulelor, va excela și în inteligența artificială.

Prin concentrarea asupra HPC de la început, am demonstrat Maverick-2 pe cele mai solicitante sarcini din modelarea climatică, fizică și științe ale vieții. Acest lucru ne-a oferit credibilitate, date de performanță din lumea reală și un produs matur înainte de a ne extinde în piețele de inteligență artificială. Acum, suntem poziționați pentru a deservi ambele, fără a compromite arhitectura noastră pentru a capitaliza tendințe sau nevoi pe termen scurt.

Acum, când Maverick-2 este în producție și implementat la zeci de clienți, puteți să ne împărtășiți exemple de modul în care este utilizat? Există rezultate sau benchmark-uri specifice din implementări de top?

Un exemplu de top este implementarea noastră la Sandia National Labs, unde Maverick-2 alimentează supercomputerul Spectra, ca parte a programului Vanguard-II. Vedem rezultate impresionante de performanță “out-of-the-box” fără a necesita modificări de cod. De asemenea, lucrăm cu ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), care reunește instituții de cercetare de top pentru a gestiona date la scară de exabytes de la CERN’s High-Luminosity Large Hadron Collider și Square Kilometre Array Observatory. Rolul Maverick-2 va juca este de a rezolva provocarea de a prelucra petabytes de date experimentale brute într-o fracțiune din timpul și energia necesară anterior. Scopul final este de a permite analize de fizică și descoperiri astronomice mai rapide.

Ați strâns peste 300 de milioane de dolari, cu rotunjiri majore anunțate în 2021 și mai recent. Puteți să ne împărtășiți cum a accelerat această finanțare dezvoltarea produsului și atingerea pieței?

Finanțarea ne-a permis să facem trei lucruri. În primul rând, am putut să împingem arhitectura mai departe, nu doar îmbunătățiri incrementale, ci avansuri fundamentale care au făcut Maverick-2 gata pentru producție. În al doilea rând, am scalat producția noastră și lanțul de aprovizionare pentru a satisface cererea în creștere, o provocare non-trivială pentru siliciul nou. În al treilea rând, am extins ecosistemul nostru de software pentru a permite clienților să integreze și să implementeze mai rapid.

De asemenea, ne-a permis să încheiem parteneriate strategice cu centre de supercalcul și furnizori de cloud, permițându-ne să accelerăm procesul de la concept la implementare și să ne extindem mult mai rapid decât startup-urile tradiționale de hardware.

Într-un peisaj care include Cerebras (CBRS ), SambaNova și Nvidia (NVDA ), cum vă poziționați NextSilicon? Care este abordarea dvs. de piață ca un challenger?

Ne vedem NextSilicon mai degrabă ca o companie de tehnologie decât doar o companie de cipuri. Optimizăm fiecare sarcină, oferim adaptabilitate și nu blocăm clienții în programe sau hardware proprietare. Clienții noștri pot aduce codul existent și obține accelerare imediată fără cicluri lungi de portare sau blocare a unui singur ecosistem, cum ar fi CUDA. Acest lucru contează, în special pe măsură ce sarcinile de inteligență artificială evoluează dincolo de antrenamentul pur. Modelele de raționament, inferența extinsă și ferestrele de context larg necesită modele de calcul fundamental diferite: acces la memorie mai dinamic, calcul cu lungime variabilă și alocare de resurse adaptabilă. Acestea nu sunt probleme pe care le puteți rezolva cu mai mult din aceeași arhitectură fixă.

Strategia noastră de piață se concentrează pe rezolvarea problemelor cele mai dificile mai întâi: lucrul cu instituții de cercetare, laboratoare naționale și întreprinderi unde performanța, eficiența energetică și flexibilitatea sunt critice. De acolo, ne extindem în piețele mai largi de inteligență artificială și de date intensive. Industria este dominată de arhitecturi fixe. Noi oferim ceva diferit, adaptabilitate construită de la început. Inteligența artificială se mută de la scară pură la inteligență. Modelele mai mari permit raționament mai inteligent, de la prompturi scurte la înțelegere contextuală pe termen lung. În această tranziție, arhitecturile adaptabile nu vor fi doar noi; vor fi esențiale.

Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe, le recomandăm să viziteze NextSilicon.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.