Haastattelut
Moshe Tanach, NeuRealityn CEO ja Co-Perustaja – Haastattelusarja

Moshe Tanach on NeuRealityn CEO ja co-perustaja. Ennen NeuRealityn perustamista Moshe toimi Marvellin ja Intelin insinöörien johtajana, johtaen monimutkaisten langattomien ja verkkotuotteiden kehitystä massatuotantoon. Hän toimi myös DesignArt Networksin (myöhemmin Qualcommin omistama) AVP:na, jossa hän osallistui 4G:tä tukevien tukiasematuotteiden kehitykseen.
(INTC )NeuRealityn tehtävänä on yksinkertaisutta AI:n omaksumista. Ottamalla järjestelmätasoiset lähestymistavat AI:hin, NeuRealityn tiimin teollisuusasiantuntijat toimittavat AI-inferenssin holistisesti, tunnistavat kipupisteet ja tarjoavat tarkoitukseen suunniteltuja, piirilevystä ohjelmistoihin AI-inferenssiratkaisuja, jotka tekevät AI:sta sekä edullisen että saatavissa olevan.
Millä tavoin laajasti kokemuksesta johtajan tehtävistä Marvellissa, Intelissä ja DesignArt-Verkoissa, mitä inspiroi sinua perustamaan NeuRealityn, ja miten aikaisemmat roolit vaikuttivat yrityksen visioon ja suuntaan?
NeuReality rakennettiin alusta alkaen ratkaisemaan tulevaisuuden kustannus-, monimutkaisuus- ja ilmasto-ongelmia, jotka olisivat välttämättömiä AI-inferenssissä – eli koulutettujen AI-mallien ja ohjelmistojen käyttöönotossa tuotantotasoisissa AI-tietokeskuksissa. AI-koulutus on tapa, jolla AI luodaan; AI-inferenssi on tapa, jolla se käytetään ja vuorovaikuttaa miljardien ihmisten ja laitteiden kanssa ympäri maailmaa.
Olemme joukko järjestelmäinsinöörejä, joten tarkastelemme kaikkia kulmia, monia AI-inferenssin loppupään mukaan lukien GPU:ta ja kaikkia tarkoitukseen suunniteltuja AI-kiihdyttimiä. Se tuli meille selväksi vuonna 2015, että CPU-riippuvaiset AI-suorittimet ja järjestelmät – joita on jokainen GPU, TPU, LPU, NRU, ASIC ja FPGA – osuisivat merkittävään esteeseen vuoteen 2020 mennessä. Järjestelmän rajoitukset, joissa AI-kiihdytin on parantunut ja nopeutunut raakasuorituskyvyn suhteen, mutta perustava infrastruktuuri ei ole pysynyt mukana.
Tuloksena päädyimme irtautumaan suurista jättiläisistä, jotka ovat byrokratian täynnä ja suojavat menestyviä liiketoimintoja, kuten CPU- ja NIC-valmistajia, ja häiritsemään alan paremmalla AI-arkkitehtuurilla, joka on avoin, agnostinen ja tarkoitukseen suunniteltu AI-inferenssiin. Yksi idealisoidun AI-inferenssin johtopäätöksistä on, että GPU:n hyödyntämisen ja järjestelmätasoisuuden tehostamisessa uusi AI-laskenta- ja verkkoinfrastruktuurimme – joka on voimassa NR1-palvelimen piirilevyllä, joka korvaa isäntä-CPU:n ja NIC:t. Ainesmerkkinä ja minkä tahansa GPU:n tai AI-kiihdyttimen seuralaisena voimme poistaa markkinoiden esteet, jotka estävät 65 %:ia organisaatioita innovoimasta ja omaksuvan AI:ta tänään – alikäytetyt GPU:t, jotka johtavat siihen, että niistä ostetaan enemmän kuin mitä todella tarvitaan (koska ne ovat yli 50 %:ssa ajasta tyhjillään) – samalla kun energiankulutus, AI-tietokeskuksen kiinteistöhaaste ja toimintakustannukset vähenevät.
Tämä on kerran elämässä oleva tilaisuus muuttaa AI-järjestelmäarkkitehtuuria paremmaksi, perustuen siihen, mitä olen oppinut ja harjoittanut 30 vuoden ajan, avaamalla ovet uusille AI-innovaattoreille eri aloilla ja poistamalla CPU-pullonkaulat, monimutkaisuuden ja hiilijalanjäljen.
NeuRealityn tehtävänä on demokratisoida AI. Voitko selittää, mitä “AI kaikille” tarkoittaa sinulle ja miten NeuReality aikoo saavuttaa tämän vision?
Tehtävämme on demokratisoida AI:tä tekemällä siitä helpommin saatavilla ja edullista kaikille organisaatioille, suurille ja pienille – vapauttamalla minkä tahansa GPU:n tai minkä tahansa AI-kiihdyttimen maksimikapasiteetin, jotta saat enemmän sijoituksestasi; toisin sanoen, saat ENEMMÄN siitä, mitä GPU:sta ostaa, sen sijaan, että ostaisit enemmän GPU:ita, jotka ovat yli 50 %:ssa ajasta tyhjillään. Voimme tehostaa AI-kiihdyttimiä jopa 100 %:iin, tarjoamalla samalla jopa 15-kertaisen energiatehokkuuden ja vähentämällä järjestelmäkustannuksia jopa 90 %:lla. Nämä ovat kertaluokan parannuksia. Suunnittelemme saavuttamaan tämän visiomme NR1 AI-inferenssiratkaisulla, maailman ensimmäisellä tietokeskusjärjestelmäarkkitehtuurilla, joka on suunniteltu AI-ajan tarpeisiin. Se suorittaa suurimääräisiä, monimuotoisia AI-tietoputkia edullisesti ja tehokkaasti, ja sen ansiosta on vähennetty hiilijalanjälki.
AI:n saavuttaminen myös tarkoittaa, että se on helppo käyttää. NeuRealityssa yksinkertaisimme AI-infrastruktuurin käyttöönoton, hallinnan ja skaalautuvuuden, parannamme liiketoimintaprosesseja ja voittoa, ja edistämme aloja, kuten julkista terveyttä, turvallisuutta, lainvalvontaa ja asiakaspalvelua. Vaikutuksemme kattaa aloja, kuten lääketieteellistä kuvantamista, kliinisiä tutkimuksia, petosten havaitsemista, AI-sisällön luomista ja monia muita.
Tällä hetkellä ensimmäiset kaupalliset NR1-S AI-inferenssilaitteet ovat saatavilla Qualcomm (QCOM ) Cloud AI 100 Ultra -kiihdyttimillä ja Cirrascale-pilvipalveluntarjoajalla.
NR1 AI-inferenssiratkaisu on mainittu ensimmäisenä tietokeskusjärjestelmäarkkitehtuurina, joka on suunniteltu AI-ajan tarpeisiin ja tarkoitukseen suunniteltu AI-inferenssiin. Mitkä olivat avaininnovaatiot ja läpimurrot, jotka johtivat NR1:n kehitykseen?
NR1 on koko siemensuunnittelusta ohjelmistoihin suunniteltu järjestelmäarkkitehtuuri, joka on avoin, täysin yhteensopiva AI-laskenta- ja verkkoinfrastruktuuri, joka täydentää minkä tahansa AI-kiihdyttimen ja GPU:n. Jos minun on jaettava se ylimmät ainutlaaduiset ja jännittävät innovaatiot, jotka johtivat tähän loppupään NR1-ratkaisuun ja erottaa meidät, sanon:
- Optimoidut AI-laskentakaavat: Tiimimme suunnitteli ohjelmoitavan kaavion suorittimen AI-laskentakaavien prosessointiin, jotka ovat olennaisia AI:lle ja muille työkuormille, kuten medialle, tietokannoille ja muille. Laskentakaavat edustavat sarjaa operaatioita, joiden välillä on riippuvuussuhteita, ja tämä laajempi soveltuvuus asettaa NR1: n mahdollisesti häiritseväksi AI-kiihdyttimien ja muiden AI-kiihdyttimien lisäksi. Se yksinkertaa AI-mallin käyttöönoton generoimalla optimoidut laskentakaavat (CG) esikäsitellyistä AI-tiedoista ja ohjelmistoliittymistä, mikä johtaa merkittäviin suorituskyvyn parannuksiin.
- NR1 NAPU (Network Addressable Processing Unit): AI-inferenssiarkkitehtuurimme on voimassa NR1 NAPU: lla – 7 nm:n palvelimen piirilevy, joka mahdollistaa suoran verkkopääsyn AI-ennakkokäsittelyyn ja -jälkikäsittelyyn. Pakkaamme 6,5-kertaisen iskun pienempään NR1-piiriin kuin tyypilliseen yleiskäyttöön tarkoitettuun isäntä-CPU:hen. Perinteisesti ennakko- ja jälkikäsittelytehtävät (kuten tietojen puhdistus, muotoilu ja piirteiden poisto) käsitellään CPU:lla. Siirtämällä nämä tehtävät NR1 NAPU: lle, korvaamme sekä CPU:t että NIC:t. Tämä vähentää pullonkauloja ja mahdollistaa nopeamman käsittelyn, salamannopeat vastausajat ja alempia kustannuksia AI-kyselyittäin.
- NR1 AI-Hypervisor-tekniikka: NR1: n patentoidun, laitteistopohjaisen AI-Hypervisorin avulla voidaan optimoida AI-tehtävien orkestraatiota ja resurssien käyttöä, parantaa tehokkuutta ja vähentää pullonkauloja.
- NR1 AI-over-Fabric-verkkomoottori: NR1 sisältää ainutlaatuisen AI-over-Fabric-verkkomoottorin, joka takaa vaivattoman verkkoyhteyden ja tehokkaan skaalautuvuuden AI-resursseille useiden NR1-piirien välillä – jotka on yhdistetty minkä tahansa GPU:n tai AI-kiihdyttimen kanssa – samassa inferenssipalvelimessa tai NR1-S AI-inferenssilaite.
NeuRealityn viimeisimmät suorituskykydat korostavat merkittäviä kustannussäästöjä ja energiansäästöjä. Voitko antaa lisätietoja siitä, miten NR1 saavuttaa jopa 90 %:n kustannussäästöt ja 15-kertaisen energiatehokkuuden verrattuna perinteisiin järjestelmiin?
NeuRealityn NR1 vähentää AI-inferenssin kustannuksia ja energiankulutusta jopa 90 %:lla ja 15-kertaisesti. Tämä saavutetaan seuraavasti:
- Erikoistunut piiri: Tarkoitukseen suunniteltu AI-inferenssiratkaisumme on voimassa NR1 NAPU-palvelimen piirilevyllä, joka absorboi CPU:n ja NIC:n toiminnallisuuden yhteen – ja poistaa CPU:n tarpeen inferenssissä. Lopulta NR1 maksimoi minkä tahansa AI-kiihdyttimen tai GPU:n tuotannon mahdollisimman tehokkaalla tavalla.
- Optimoitu arkkitehtuuri: AI-tietovirran suorittamisen ja AI-ennakkokäsittelyn ja -jälkikäsittelyn sisällyttämisen NR1 NAPU: lle, poistamme ja korvaamme CPU:n. Tämä johtaa vähennettyyn viiveeseen, lineaariseen skaalautuvuuteen ja alempiin kustannuksiin AI-kyselyittäin.
- Joustava käyttöönotto: Voit ostaa NR1: n kahdella pääasiallisella tavalla: 1) NR1-M-moduulissa, joka on PCIe-kortti, jossa on useita NR1 NAPU:ita (tyypillisesti 10), suunniteltu pariksi olemassa olevien AI-kiihdyttimikorttien kanssa. 2) NR1-S-laite, joka yhdistää NR1 NAPU:ita ja AI-kiihdyttimiä (GPU, ASIC, FPGA jne.) valmiina AI-inferenssijärjestelmänä.
Supercomputing 2024 -tapahtumassa marraskuussa näet meidät esittelemässä NR1-S-laite, jossa on 4 NR1-piiriä 16 Qualcomm Cloud AI 100 Ultra -kiihdyttimelle. Olemme testanneet samaa Nvidia (NVDA ) AI-inferenssiprosessoreiden kanssa. NeuReality vallankumouksellistaa AI-inferenssiä avoimella, tarkoitukseen suunnitellulla arkkitehtuurilla.
Miten NR1-S AI-inferenssilaite, joka on yhdistetty Qualcomm Cloud AI 100 -kiihdyttimiin, vertautuu perinteisiin CPU-keskeisiin inferenssipalvelimiin, joissa on Nvidia H100- tai L40S-GPU:tä, käytännön sovelluksissa?
NR1, yhdistettynä Qualcomm Cloud AI 100:aan tai NVIDIA H100- tai L40S-GPU:ihin, tarjoaa merkittävän suorituskyvyn parannuksen perinteisiin CPU-keskeisiin inferenssipalvelimiin AI-sovelluksissa, kuten suurissa kielimalleissa, kuten Llama 3, tietokoneen näkö, luonnollinen kielen prosessointi ja puheentunnistus. Toisin sanoen, kun suoritat AI-inferenssijärjestelmäsi NR1: n kanssa, se optimoi suorituskyvyn, järjestelmäkustannukset, energiatehokkuuden ja vastausajat kuvissa, äänissä, kielessä ja teksteissä – erikseen (yksittäinen modaalinen) tai yhdessä (monimodaalinen).
Lopputulos? Kun NR1 on yhdistetty, asiakas saa ENEMMÄN kalliista GPU-sijoituksestaan, sen sijaan, että ostaisi enemmän GPU:ita, jotka ovat yli 50 %:ssa ajasta tyhjillään.
Lisäksi NR1 tarjoaa poikkeuksellisen tehokkuuden, josta seuraa 50-90 %:n parempi hinta-suorituskyky ja jopa 13-15-kertaisesti parempi energiatehokkuus. Tämä kääntyy merkittäviksi kustannussäästöiksi ja vähennetyksi ympäristövaikutuksiin AI-infrastruktuurissasi.
NR1-S osoittaa lineaarisen skaalautuvuuden ilman suorituskyvyn laskua. Voitko selittää tekniset seikat, jotka mahdollistavat tällaisen vaivattoman skaalautuvuuden?
NR1-S-laite, joka yhdistää NR1-piirit AI-kiihdyttimiin, määrittää uuden AI-infrastruktuurin. Olemme siirtyneet CPU-keskeisistä rajoituksista uudelle suorituskyvyn ja tehokkuuden tasolle.
Perinteisen NIC-CPU-kiihdyttimen pullonkaulan sijaan NR1-S integroi suoran verkkopääsyn, AI-ennakkokäsittelyn ja -jälkikäsittelyn Network Addressable Processing Units (NAPU):iin. Tyypillisesti 10 NAPU:ta järjestelmässä, käsittelytehtävistä kuten näön, äänen ja DSP-käsittelyn, ja AI-Hypervisorin orkestraation, suoritamme AI-tietovirran suorittamisen. Tämä kääntyy lineaariseen skaalautuvuuteen: lisää kiihdyttimiä, saat suhteessa enemmän suorituskykyä.
Tulos? 100 %:n AI-kiihdyttimien käyttö on jatkuvasti havaittavissa. Vaikka koko kustannus ja energiatehokkuus vaihtelevat AI-suorittimien mukaan, maksimoitu laitteiston sijoitus ja parannettu suorituskyky toimitetaan jatkuvasti. Kun AI-inferenssin tarpeet kasvavat, NR1-S tarjoaa vakuuttavan vaihtoehdon perinteisille arkkitehtuureille.
NeuReality pyrkii poistamaan esteitä laajamittaisen AI-omaksumisen tieltä. Mitkä ovat merkittävimmät haasteet, joita yritykset kohtaavat AI:n omaksumisessa, ja miten teknologianne auttaa ylittämään nämä esteet?
Kun AI-ohjelmistot ja -ratkaisut toteutetaan huonosti, ne voivat muuttua ongelmallisiksi. Monet yritykset eivät voi omaksua AI:ta sen koulutuksen ja skaalautuvuuden monimutkaisuuden ja kustannusten vuoksi. Tänään AI-ratkaisut eivät ole optimoituja inferenssiin, ja koulutusmoduulit ovat yleensä tehokkaita, mutta inferenssipalvelimet ovat pullonkauloja. Ottaaksemme haasteen ja tekemään AI:sta helpommin omaksuttavissa, olemme kehittäneet ensimmäisen täydellisen AI-inferenssiratkaisun – laskenta- ja verkkoinfrastruktuurin, joka on voimassa NAPU: lla, joka tekee enemmän minkä tahansa AI-kiihdyttimen ja vähentää markkinoiden esteitä liiallisen kustannuksen ja energiankulutuksen ympärillä.
Systeemitasoinen lähestymistapa AI-inferenssiin – verrattuna kehittämiseen parempaa GPU:ta tai AI-kiihdyttimelle, jossa on jo paljon innovaatioita ja kilpailua – tarkoittaa, että täytämme merkittävää aukkoa kymmenille AI-inferenssiprosessori- ja järjestelmäinnovaattoreille. Tiimimme hyökkäsi AI-inferenssin puutteita järjestelmällisesti ja holistisesti määrittämällä kipupisteet, arkkitehtuurin aukot ja AI-työkuormien ennusteet – toimittamaan ensimmäisen tarkoitukseen suunnitellun, siemensuunnittelusta ohjelmistoihin, CPU-vapaaan AI-inferenssirakenteen. Ja kehittämällä ylä- ja alapuolisen avoimen ohjelmistopinon Pythonista ja Kubernetesista yhdistettynä NeuReality-työkalupakettiin, määritykseen ja Inferenssi-API:hin, integroiduimme kaikki komponentit yhteen korkealaatuisen UI/UX:ksi.
Miten kilpailukykyisessä AI-markkinassa NeuReality erottuu muista AI-inferenssiratkaisujen tarjoajista?
Yksinkertaisesti sanottuna, olemme avoimia ja kiihdyttimen agnostisia. NR1-inferenssiratkaisumme supercharge minkä tahansa AI-kiihdyttimen – GPU, TPU, LPU, ASIC, nimetä vain – luomalla todella optimoidun loppupään järjestelmän. AI-kiihdyttimet otettiin alun perin auttamaan CPU:ta käsittelemään neuroverkkojen ja koneoppimisen vaatimuksia laajassa mittakaavassa, mutta nyt AI-kiihdyttimet ovat niin voimakkaita, että ne ovat jääneet jälkeen juuri niiden CPU:iden vuoksi, joiden avuksi ne oli tarkoitettu.
Ratkaisumme? NR1. Se on täydellinen, uudelleen suunniteltu AI-inferenssirakenteen. Salainen aseemme? NR1 NAPU on suunniteltu kiihdyttimen rinnalla olevaksi aineeksi, joka maksimoi AI-kiihdyttimen suorituskyvyn ilman ylimääräistä tehokkuutta tai rahaa. Olemme rakentaneet avoimen ekosysteemin, joka integroituu vaivattomasti minkä tahansa AI-inferenssichipin ja suosittujen ohjelmistokehysten, kuten Kubernetes, Python, TensorFlow ja monien muiden kanssa.
NeuRealityn avoin lähestymistapa tarkoittaa, että emme kilpaile AI-maailmalla; olemme täällä täydentämään sitä strategisten kumppanuuksien ja teknologisen yhteistyön kautta. Tarjoamme puuttuvan palan palapelistä: tarkoitukseen suunnitellun, CPU-vapaaan inferenssirakenteen, joka ei ainoastaan lukitse AI-kiihdyttimiä suorituskyvyn, vaan myös tekee siitä helpommin yritysten ja hallitusten omaksumista. Kuvittele, että vapautat NVIDIA H100:n, Google (GOOGL ) TPU:n tai AMD MI300:n täyden tehon – antaen heille infrastruktuurin, jonka he ansaitsevat.
NeuRealityn avoin, tehokas arkkitehtuuri tasoittaa pelikenttää, tekee AI:sta helpommin saatavilla ja edullista kaikille. Olen intohimoinen siitä, että eri alojen, kuten fintechin, biotekniikan, terveydenhuollon, näkevät NR1-edun ensimmäisinä. Vertaa AI-ratkaisujasi perinteisiin CPU-keskeisiin järjestelmiin verrattuna moderniin NR1-infrastruktuuriin ja havaitse ero. Tänään vain 35 %:ia yrityksistä ja hallituksista on omaksunut AI:n, ja se perustuu erittäin alhaisiin kelpoisuuskriteereihin. Tehdään siitä mahdollista, että yli 50 %:ia yritysasiakkaista omaksuu AI:n ensi vuonna ilman, että se vahingoittaa planeettaa tai rikkoa rahoitusta.
Etäältä katsottaessa, mikä on NeuRealityn pitkän aikavälin visio AI:n roolista yhteiskunnassa, ja miten yhtiösi osallistuu tähän tulevaisuuteen?
Näen tulevaisuuden, jossa AI hyödyttää kaikkia, edistää innovaatioita ja parantaa elämää. Emme ainoastaan rakenna teknologiaa; rakennamme perustaa paremmalle tulevaisuudelle.
NR1 on avain tähän visioon. Se on täydellinen AI-inferenssiratkaisu, joka alkaa murtamaan kustannus- ja monimutkaisuusesteitä, jotka estävät laajamittaisen liiketoimintainnovaation. Olemme uudelleen suunnitelleet sekä infrastruktuuria että arkkitehtuuria, toimittamalla vallankumouksellisen järjestelmän, joka maksimoi minkä tahansa GPU:n tai AI-kiihdyttimen tuotannon ilman toimintakustannusten tai energiankulutuksen lisäämistä.
Liiketoimintamalli on tärkeä skaalautuvuuden ja asiakasvalintojen tarjoamiseksi. Sen sijaan, että keskityisimme keskittyneeseen AI-autokratioon, rakennamme avoimen ekosysteemin, jossa meidän piirimme toimii muiden piirien kanssa, ei niiden vastaisesti. Siksi suunnittelimme NR1: n integroitumaan kaikkien AI-kiihdyttimien ja avoimien mallien ja ohjelmistojen kanssa, tehdäksemme siitä helppoa asentaa, hallita ja skaalata.
Emme kuitenkaan lopeta siinä. Olemme yhteistyössä kumppaneiden kanssa validoidaksemme teknologiamme eri AI-työkuormissa ja toimittamaan “inferenssin palveluna” ja “LLM-palveluna” pilvipalveluntarjoajien, hyperskaalareiden ja suoraan kiihdyttimen valmistajien kautta. Haluamme tehdä edistyneen AI:n helpommin saatavilla ja edulliseksi kaikille.
Kuvittele mahdollisuuksia, jos voimme parantaa AI-inferenssin suorituskykyä, energiatehokkuutta ja edullisuutta kaksinumeroisilla prosenteilla. Kuvittele vahvan, AI-käyttöön perustuvan yhteiskunnan, jossa enemmän ääniä ja valintoja tulee todelliseksi. Joten meidän on tehtävä vaadittava työ liiketoimintavaikutuksen ja ROI:n osoittamiseksi, kun AI toteutetaan päivittäisissä tietokeskuksen toiminnassa. Keskitytään vallankumoukselliseen AI-toteutukseen, ei ainoastaan AI-mallin ominaisuuksiin.
Tämä on tapa, jolla osallistumme tulevaisuuteen, jossa AI hyödyttää kaikkia – voittoja, ihmisiä ja planeettaa varten. Kiitos hienosta haastattelusta, lukijat, jotka haluavat oppia enemmän, kannattaa vierailla NeuRealityssa.












