Haastattelut

Moshe Tanach, NeuRealityn CEO ja Co-Perustaja – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Moshe Tanach on NeuRealityn CEO ja co-perustaja. Ennen NeuRealityn perustamista Moshe toimi Marvellin ja Intelin insinöörien johtajana, johtaen monimutkaisten langattomien ja verkkotuotteiden kehitystä massatuotantoon. Hän toimi myös DesignArt Networksin (myöhemmin Qualcommin omistama) AVP:na, jossa hän osallistui 4G:tä tukevien tukiasematuotteiden kehitykseen.

(INTC )

NeuRealityn tehtävänä on yksinkertaisutta AI:n omaksumista. Ottamalla järjestelmätasoiset lähestymistavat AI:hin, NeuRealityn tiimin teollisuusasiantuntijat toimittavat AI-inferenssin holistisesti, tunnistavat kipupisteet ja tarjoavat tarkoitukseen suunniteltuja, piirilevystä ohjelmistoihin AI-inferenssiratkaisuja, jotka tekevät AI:sta sekä edullisen että saatavissa olevan.

Millä tavoin laajasti kokemuksesta johtajan tehtävistä Marvellissa, Intelissä ja DesignArt-Verkoissa, mitä inspiroi sinua perustamaan NeuRealityn, ja miten aikaisemmat roolit vaikuttivat yrityksen visioon ja suuntaan?

NeuReality rakennettiin alusta alkaen ratkaisemaan tulevaisuuden kustannus-, monimutkaisuus- ja ilmasto-ongelmia, jotka olisivat välttämättömiä AI-inferenssissä – eli koulutettujen AI-mallien ja ohjelmistojen käyttöönotossa tuotantotasoisissa AI-tietokeskuksissa. AI-koulutus on tapa, jolla AI luodaan; AI-inferenssi on tapa, jolla se käytetään ja vuorovaikuttaa miljardien ihmisten ja laitteiden kanssa ympäri maailmaa.

Olemme joukko järjestelmäinsinöörejä, joten tarkastelemme kaikkia kulmia, monia AI-inferenssin loppupään mukaan lukien GPU:ta ja kaikkia tarkoitukseen suunniteltuja AI-kiihdyttimiä. Se tuli meille selväksi vuonna 2015, että CPU-riippuvaiset AI-suorittimet ja järjestelmät – joita on jokainen GPU, TPU, LPU, NRU, ASIC ja FPGA – osuisivat merkittävään esteeseen vuoteen 2020 mennessä. Järjestelmän rajoitukset, joissa AI-kiihdytin on parantunut ja nopeutunut raakasuorituskyvyn suhteen, mutta perustava infrastruktuuri ei ole pysynyt mukana.

Tuloksena päädyimme irtautumaan suurista jättiläisistä, jotka ovat byrokratian täynnä ja suojavat menestyviä liiketoimintoja, kuten CPU- ja NIC-valmistajia, ja häiritsemään alan paremmalla AI-arkkitehtuurilla, joka on avoin, agnostinen ja tarkoitukseen suunniteltu AI-inferenssiin. Yksi idealisoidun AI-inferenssin johtopäätöksistä on, että GPU:n hyödyntämisen ja järjestelmätasoisuuden tehostamisessa uusi AI-laskenta- ja verkkoinfrastruktuurimme – joka on voimassa NR1-palvelimen piirilevyllä, joka korvaa isäntä-CPU:n ja NIC:t. Ainesmerkkinä ja minkä tahansa GPU:n tai AI-kiihdyttimen seuralaisena voimme poistaa markkinoiden esteet, jotka estävät 65 %:ia organisaatioita innovoimasta ja omaksuvan AI:ta tänään – alikäytetyt GPU:t, jotka johtavat siihen, että niistä ostetaan enemmän kuin mitä todella tarvitaan (koska ne ovat yli 50 %:ssa ajasta tyhjillään) – samalla kun energiankulutus, AI-tietokeskuksen kiinteistöhaaste ja toimintakustannukset vähenevät.

Tämä on kerran elämässä oleva tilaisuus muuttaa AI-järjestelmäarkkitehtuuria paremmaksi, perustuen siihen, mitä olen oppinut ja harjoittanut 30 vuoden ajan, avaamalla ovet uusille AI-innovaattoreille eri aloilla ja poistamalla CPU-pullonkaulat, monimutkaisuuden ja hiilijalanjäljen.

NeuRealityn tehtävänä on demokratisoida AI. Voitko selittää, mitä “AI kaikille” tarkoittaa sinulle ja miten NeuReality aikoo saavuttaa tämän vision?

Tehtävämme on demokratisoida AI:tä tekemällä siitä helpommin saatavilla ja edullista kaikille organisaatioille, suurille ja pienille – vapauttamalla minkä tahansa GPU:n tai minkä tahansa AI-kiihdyttimen maksimikapasiteetin, jotta saat enemmän sijoituksestasi; toisin sanoen, saat ENEMMÄN siitä, mitä GPU:sta ostaa, sen sijaan, että ostaisit enemmän GPU:ita, jotka ovat yli 50 %:ssa ajasta tyhjillään. Voimme tehostaa AI-kiihdyttimiä jopa 100 %:iin, tarjoamalla samalla jopa 15-kertaisen energiatehokkuuden ja vähentämällä järjestelmäkustannuksia jopa 90 %:lla. Nämä ovat kertaluokan parannuksia. Suunnittelemme saavuttamaan tämän visiomme NR1 AI-inferenssiratkaisulla, maailman ensimmäisellä tietokeskusjärjestelmäarkkitehtuurilla, joka on suunniteltu AI-ajan tarpeisiin. Se suorittaa suurimääräisiä, monimuotoisia AI-tietoputkia edullisesti ja tehokkaasti, ja sen ansiosta on vähennetty hiilijalanjälki.

AI:n saavuttaminen myös tarkoittaa, että se on helppo käyttää. NeuRealityssa yksinkertaisimme AI-infrastruktuurin käyttöönoton, hallinnan ja skaalautuvuuden, parannamme liiketoimintaprosesseja ja voittoa, ja edistämme aloja, kuten julkista terveyttä, turvallisuutta, lainvalvontaa ja asiakaspalvelua. Vaikutuksemme kattaa aloja, kuten lääketieteellistä kuvantamista, kliinisiä tutkimuksia, petosten havaitsemista, AI-sisällön luomista ja monia muita.

Tällä hetkellä ensimmäiset kaupalliset NR1-S AI-inferenssilaitteet ovat saatavilla Qualcomm (QCOM ) Cloud AI 100 Ultra -kiihdyttimillä ja Cirrascale-pilvipalveluntarjoajalla.

NR1 AI-inferenssiratkaisu on mainittu ensimmäisenä tietokeskusjärjestelmäarkkitehtuurina, joka on suunniteltu AI-ajan tarpeisiin ja tarkoitukseen suunniteltu AI-inferenssiin. Mitkä olivat avaininnovaatiot ja läpimurrot, jotka johtivat NR1:n kehitykseen?

NR1 on koko siemensuunnittelusta ohjelmistoihin suunniteltu järjestelmäarkkitehtuuri, joka on avoin, täysin yhteensopiva AI-laskenta- ja verkkoinfrastruktuuri, joka täydentää minkä tahansa AI-kiihdyttimen ja GPU:n. Jos minun on jaettava se ylimmät ainutlaaduiset ja jännittävät innovaatiot, jotka johtivat tähän loppupään NR1-ratkaisuun ja erottaa meidät, sanon:

  • Optimoidut AI-laskentakaavat: Tiimimme suunnitteli ohjelmoitavan kaavion suorittimen AI-laskentakaavien prosessointiin, jotka ovat olennaisia AI:lle ja muille työkuormille, kuten medialle, tietokannoille ja muille. Laskentakaavat edustavat sarjaa operaatioita, joiden välillä on riippuvuussuhteita, ja tämä laajempi soveltuvuus asettaa NR1: n mahdollisesti häiritseväksi AI-kiihdyttimien ja muiden AI-kiihdyttimien lisäksi. Se yksinkertaa AI-mallin käyttöönoton generoimalla optimoidut laskentakaavat (CG) esikäsitellyistä AI-tiedoista ja ohjelmistoliittymistä, mikä johtaa merkittäviin suorituskyvyn parannuksiin.
  • NR1 NAPU (Network Addressable Processing Unit): AI-inferenssiarkkitehtuurimme on voimassa NR1 NAPU: lla – 7 nm:n palvelimen piirilevy, joka mahdollistaa suoran verkkopääsyn AI-ennakkokäsittelyyn ja -jälkikäsittelyyn. Pakkaamme 6,5-kertaisen iskun pienempään NR1-piiriin kuin tyypilliseen yleiskäyttöön tarkoitettuun isäntä-CPU:hen. Perinteisesti ennakko- ja jälkikäsittelytehtävät (kuten tietojen puhdistus, muotoilu ja piirteiden poisto) käsitellään CPU:lla. Siirtämällä nämä tehtävät NR1 NAPU: lle, korvaamme sekä CPU:t että NIC:t. Tämä vähentää pullonkauloja ja mahdollistaa nopeamman käsittelyn, salamannopeat vastausajat ja alempia kustannuksia AI-kyselyittäin.
  • NR1 AI-Hypervisor-tekniikka: NR1: n patentoidun, laitteistopohjaisen AI-Hypervisorin avulla voidaan optimoida AI-tehtävien orkestraatiota ja resurssien käyttöä, parantaa tehokkuutta ja vähentää pullonkauloja.
  • NR1 AI-over-Fabric-verkkomoottori: NR1 sisältää ainutlaatuisen AI-over-Fabric-verkkomoottorin, joka takaa vaivattoman verkkoyhteyden ja tehokkaan skaalautuvuuden AI-resursseille useiden NR1-piirien välillä – jotka on yhdistetty minkä tahansa GPU:n tai AI-kiihdyttimen kanssa – samassa inferenssipalvelimessa tai NR1-S AI-inferenssilaite.

NeuRealityn viimeisimmät suorituskykydat korostavat merkittäviä kustannussäästöjä ja energiansäästöjä. Voitko antaa lisätietoja siitä, miten NR1 saavuttaa jopa 90 %:n kustannussäästöt ja 15-kertaisen energiatehokkuuden verrattuna perinteisiin järjestelmiin?

NeuRealityn NR1 vähentää AI-inferenssin kustannuksia ja energiankulutusta jopa 90 %:lla ja 15-kertaisesti. Tämä saavutetaan seuraavasti:

  • Erikoistunut piiri: Tarkoitukseen suunniteltu AI-inferenssiratkaisumme on voimassa NR1 NAPU-palvelimen piirilevyllä, joka absorboi CPU:n ja NIC:n toiminnallisuuden yhteen – ja poistaa CPU:n tarpeen inferenssissä. Lopulta NR1 maksimoi minkä tahansa AI-kiihdyttimen tai GPU:n tuotannon mahdollisimman tehokkaalla tavalla.
  • Optimoitu arkkitehtuuri: AI-tietovirran suorittamisen ja AI-ennakkokäsittelyn ja -jälkikäsittelyn sisällyttämisen NR1 NAPU: lle, poistamme ja korvaamme CPU:n. Tämä johtaa vähennettyyn viiveeseen, lineaariseen skaalautuvuuteen ja alempiin kustannuksiin AI-kyselyittäin.
  • Joustava käyttöönotto: Voit ostaa NR1: n kahdella pääasiallisella tavalla: 1) NR1-M-moduulissa, joka on PCIe-kortti, jossa on useita NR1 NAPU:ita (tyypillisesti 10), suunniteltu pariksi olemassa olevien AI-kiihdyttimikorttien kanssa. 2) NR1-S-laite, joka yhdistää NR1 NAPU:ita ja AI-kiihdyttimiä (GPU, ASIC, FPGA jne.) valmiina AI-inferenssijärjestelmänä.

Supercomputing 2024 -tapahtumassa marraskuussa näet meidät esittelemässä NR1-S-laite, jossa on 4 NR1-piiriä 16 Qualcomm Cloud AI 100 Ultra -kiihdyttimelle. Olemme testanneet samaa Nvidia (NVDA ) AI-inferenssiprosessoreiden kanssa. NeuReality vallankumouksellistaa AI-inferenssiä avoimella, tarkoitukseen suunnitellulla arkkitehtuurilla.

 Miten NR1-S AI-inferenssilaite, joka on yhdistetty Qualcomm Cloud AI 100 -kiihdyttimiin, vertautuu perinteisiin CPU-keskeisiin inferenssipalvelimiin, joissa on Nvidia H100- tai L40S-GPU:tä, käytännön sovelluksissa?

NR1, yhdistettynä Qualcomm Cloud AI 100:aan tai NVIDIA H100- tai L40S-GPU:ihin, tarjoaa merkittävän suorituskyvyn parannuksen perinteisiin CPU-keskeisiin inferenssipalvelimiin AI-sovelluksissa, kuten suurissa kielimalleissa, kuten Llama 3, tietokoneen näkö, luonnollinen kielen prosessointi ja puheentunnistus. Toisin sanoen, kun suoritat AI-inferenssijärjestelmäsi NR1: n kanssa, se optimoi suorituskyvyn, järjestelmäkustannukset, energiatehokkuuden ja vastausajat kuvissa, äänissä, kielessä ja teksteissä – erikseen (yksittäinen modaalinen) tai yhdessä (monimodaalinen).

Lopputulos? Kun NR1 on yhdistetty, asiakas saa ENEMMÄN kalliista GPU-sijoituksestaan, sen sijaan, että ostaisi enemmän GPU:ita, jotka ovat yli 50 %:ssa ajasta tyhjillään.

Lisäksi NR1 tarjoaa poikkeuksellisen tehokkuuden, josta seuraa 50-90 %:n parempi hinta-suorituskyky ja jopa 13-15-kertaisesti parempi energiatehokkuus. Tämä kääntyy merkittäviksi kustannussäästöiksi ja vähennetyksi ympäristövaikutuksiin AI-infrastruktuurissasi.

NR1-S osoittaa lineaarisen skaalautuvuuden ilman suorituskyvyn laskua. Voitko selittää tekniset seikat, jotka mahdollistavat tällaisen vaivattoman skaalautuvuuden?

NR1-S-laite, joka yhdistää NR1-piirit AI-kiihdyttimiin, määrittää uuden AI-infrastruktuurin. Olemme siirtyneet CPU-keskeisistä rajoituksista uudelle suorituskyvyn ja tehokkuuden tasolle.

Perinteisen NIC-CPU-kiihdyttimen pullonkaulan sijaan NR1-S integroi suoran verkkopääsyn, AI-ennakkokäsittelyn ja -jälkikäsittelyn Network Addressable Processing Units (NAPU):iin. Tyypillisesti 10 NAPU:ta järjestelmässä, käsittelytehtävistä kuten näön, äänen ja DSP-käsittelyn, ja AI-Hypervisorin orkestraation, suoritamme AI-tietovirran suorittamisen. Tämä kääntyy lineaariseen skaalautuvuuteen: lisää kiihdyttimiä, saat suhteessa enemmän suorituskykyä.

Tulos? 100 %:n AI-kiihdyttimien käyttö on jatkuvasti havaittavissa. Vaikka koko kustannus ja energiatehokkuus vaihtelevat AI-suorittimien mukaan, maksimoitu laitteiston sijoitus ja parannettu suorituskyky toimitetaan jatkuvasti. Kun AI-inferenssin tarpeet kasvavat, NR1-S tarjoaa vakuuttavan vaihtoehdon perinteisille arkkitehtuureille.

NeuReality pyrkii poistamaan esteitä laajamittaisen AI-omaksumisen tieltä. Mitkä ovat merkittävimmät haasteet, joita yritykset kohtaavat AI:n omaksumisessa, ja miten teknologianne auttaa ylittämään nämä esteet?

Kun AI-ohjelmistot ja -ratkaisut toteutetaan huonosti, ne voivat muuttua ongelmallisiksi. Monet yritykset eivät voi omaksua AI:ta sen koulutuksen ja skaalautuvuuden monimutkaisuuden ja kustannusten vuoksi. Tänään AI-ratkaisut eivät ole optimoituja inferenssiin, ja koulutusmoduulit ovat yleensä tehokkaita, mutta inferenssipalvelimet ovat pullonkauloja. Ottaaksemme haasteen ja tekemään AI:sta helpommin omaksuttavissa, olemme kehittäneet ensimmäisen täydellisen AI-inferenssiratkaisun – laskenta- ja verkkoinfrastruktuurin, joka on voimassa NAPU: lla, joka tekee enemmän minkä tahansa AI-kiihdyttimen ja vähentää markkinoiden esteitä liiallisen kustannuksen ja energiankulutuksen ympärillä.

Systeemitasoinen lähestymistapa AI-inferenssiin – verrattuna kehittämiseen parempaa GPU:ta tai AI-kiihdyttimelle, jossa on jo paljon innovaatioita ja kilpailua – tarkoittaa, että täytämme merkittävää aukkoa kymmenille AI-inferenssiprosessori- ja järjestelmäinnovaattoreille. Tiimimme hyökkäsi AI-inferenssin puutteita järjestelmällisesti ja holistisesti määrittämällä kipupisteet, arkkitehtuurin aukot ja AI-työkuormien ennusteet – toimittamaan ensimmäisen tarkoitukseen suunnitellun, siemensuunnittelusta ohjelmistoihin, CPU-vapaaan AI-inferenssirakenteen. Ja kehittämällä ylä- ja alapuolisen avoimen ohjelmistopinon Pythonista ja Kubernetesista yhdistettynä NeuReality-työkalupakettiin, määritykseen ja Inferenssi-API:hin, integroiduimme kaikki komponentit yhteen korkealaatuisen UI/UX:ksi.

Miten kilpailukykyisessä AI-markkinassa NeuReality erottuu muista AI-inferenssiratkaisujen tarjoajista?

Yksinkertaisesti sanottuna, olemme avoimia ja kiihdyttimen agnostisia. NR1-inferenssiratkaisumme supercharge minkä tahansa AI-kiihdyttimen – GPU, TPU, LPU, ASIC, nimetä vain – luomalla todella optimoidun loppupään järjestelmän. AI-kiihdyttimet otettiin alun perin auttamaan CPU:ta käsittelemään neuroverkkojen ja koneoppimisen vaatimuksia laajassa mittakaavassa, mutta nyt AI-kiihdyttimet ovat niin voimakkaita, että ne ovat jääneet jälkeen juuri niiden CPU:iden vuoksi, joiden avuksi ne oli tarkoitettu.

Ratkaisumme? NR1. Se on täydellinen, uudelleen suunniteltu AI-inferenssirakenteen. Salainen aseemme? NR1 NAPU on suunniteltu kiihdyttimen rinnalla olevaksi aineeksi, joka maksimoi AI-kiihdyttimen suorituskyvyn ilman ylimääräistä tehokkuutta tai rahaa. Olemme rakentaneet avoimen ekosysteemin, joka integroituu vaivattomasti minkä tahansa AI-inferenssichipin ja suosittujen ohjelmistokehysten, kuten Kubernetes, Python, TensorFlow ja monien muiden kanssa.

NeuRealityn avoin lähestymistapa tarkoittaa, että emme kilpaile AI-maailmalla; olemme täällä täydentämään sitä strategisten kumppanuuksien ja teknologisen yhteistyön kautta. Tarjoamme puuttuvan palan palapelistä: tarkoitukseen suunnitellun, CPU-vapaaan inferenssirakenteen, joka ei ainoastaan lukitse AI-kiihdyttimiä suorituskyvyn, vaan myös tekee siitä helpommin yritysten ja hallitusten omaksumista. Kuvittele, että vapautat NVIDIA H100:n, Google (GOOGL ) TPU:n tai AMD MI300:n täyden tehon – antaen heille infrastruktuurin, jonka he ansaitsevat.

NeuRealityn avoin, tehokas arkkitehtuuri tasoittaa pelikenttää, tekee AI:sta helpommin saatavilla ja edullista kaikille. Olen intohimoinen siitä, että eri alojen, kuten fintechin, biotekniikan, terveydenhuollon, näkevät NR1-edun ensimmäisinä. Vertaa AI-ratkaisujasi perinteisiin CPU-keskeisiin järjestelmiin verrattuna moderniin NR1-infrastruktuuriin ja havaitse ero. Tänään vain 35 %:ia yrityksistä ja hallituksista on omaksunut AI:n, ja se perustuu erittäin alhaisiin kelpoisuuskriteereihin. Tehdään siitä mahdollista, että yli 50 %:ia yritysasiakkaista omaksuu AI:n ensi vuonna ilman, että se vahingoittaa planeettaa tai rikkoa rahoitusta.

Etäältä katsottaessa, mikä on NeuRealityn pitkän aikavälin visio AI:n roolista yhteiskunnassa, ja miten yhtiösi osallistuu tähän tulevaisuuteen?

Näen tulevaisuuden, jossa AI hyödyttää kaikkia, edistää innovaatioita ja parantaa elämää. Emme ainoastaan rakenna teknologiaa; rakennamme perustaa paremmalle tulevaisuudelle.

NR1 on avain tähän visioon. Se on täydellinen AI-inferenssiratkaisu, joka alkaa murtamaan kustannus- ja monimutkaisuusesteitä, jotka estävät laajamittaisen liiketoimintainnovaation. Olemme uudelleen suunnitelleet sekä infrastruktuuria että arkkitehtuuria, toimittamalla vallankumouksellisen järjestelmän, joka maksimoi minkä tahansa GPU:n tai AI-kiihdyttimen tuotannon ilman toimintakustannusten tai energiankulutuksen lisäämistä.

Liiketoimintamalli on tärkeä skaalautuvuuden ja asiakasvalintojen tarjoamiseksi. Sen sijaan, että keskityisimme keskittyneeseen AI-autokratioon, rakennamme avoimen ekosysteemin, jossa meidän piirimme toimii muiden piirien kanssa, ei niiden vastaisesti. Siksi suunnittelimme NR1: n integroitumaan kaikkien AI-kiihdyttimien ja avoimien mallien ja ohjelmistojen kanssa, tehdäksemme siitä helppoa asentaa, hallita ja skaalata.

Emme kuitenkaan lopeta siinä. Olemme yhteistyössä kumppaneiden kanssa validoidaksemme teknologiamme eri AI-työkuormissa ja toimittamaan “inferenssin palveluna” ja “LLM-palveluna” pilvipalveluntarjoajien, hyperskaalareiden ja suoraan kiihdyttimen valmistajien kautta. Haluamme tehdä edistyneen AI:n helpommin saatavilla ja edulliseksi kaikille.

Kuvittele mahdollisuuksia, jos voimme parantaa AI-inferenssin suorituskykyä, energiatehokkuutta ja edullisuutta kaksinumeroisilla prosenteilla. Kuvittele vahvan, AI-käyttöön perustuvan yhteiskunnan, jossa enemmän ääniä ja valintoja tulee todelliseksi. Joten meidän on tehtävä vaadittava työ liiketoimintavaikutuksen ja ROI:n osoittamiseksi, kun AI toteutetaan päivittäisissä tietokeskuksen toiminnassa. Keskitytään vallankumoukselliseen AI-toteutukseen, ei ainoastaan AI-mallin ominaisuuksiin.

Tämä on tapa, jolla osallistumme tulevaisuuteen, jossa AI hyödyttää kaikkia – voittoja, ihmisiä ja planeettaa varten. Kiitos hienosta haastattelusta, lukijat, jotka haluavat oppia enemmän, kannattaa vierailla NeuRealityssa.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.