Wawancara

Moshe Tanach, CEO dan Co-Founder di NeuReality – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Moshe Tanach adalah CEO & co-founder dari NeuReality. Sebelum mendirikan NeuReality, Moshe menjabat sebagai Direktur Teknik di Marvell dan Intel (INTC ), di mana ia memimpin pengembangan produk nirkabel dan jaringan yang kompleks ke produksi massal. Ia juga menjabat sebagai Wakil Presiden R&D di DesignArt Networks (kemudian diakuisisi oleh Qualcomm (QCOM )), di mana ia berkontribusi pada pengembangan produk stasiun basis 4G.

NeuReality memiliki misi untuk mempermudah adopsi AI. Dengan mengambil pendekatan sistem-level untuk AI, tim ahli industri NeuReality menyampaikan inferensi AI secara holistik, mengidentifikasi titik sakit dan menyediakan solusi inferensi AI yang dirancang khusus, membuat AI lebih terjangkau dan mudah diakses.

Dengan pengalaman luas Anda dalam memimpin proyek teknik di Marvell, Intel, dan DesignArt-Networks, apa yang menginspirasi Anda untuk mendirikan NeuReality, dan bagaimana peran sebelumnya mempengaruhi visi dan arah perusahaan?

NeuReality dibangun dari awal untuk memecahkan masalah biaya, kompleksitas, dan masalah iklim yang akan menjadi tak terhindarkan dalam inferensi AI – yaitu penerapan model AI yang dilatih dan perangkat lunak ke pusat data level produksi. Di mana pelatihan AI adalah bagaimana AI dibuat; inferensi AI adalah bagaimana AI digunakan dan bagaimana AI berinteraksi dengan miliaran orang dan perangkat di seluruh dunia.

Kami adalah tim insinyur sistem, sehingga kami melihat semua sudut, semua aspek inferensi AI yang berkelanjutan, termasuk GPU dan semua kelas akselerator AI yang dirancang khusus. Menjadi jelas bagi kami sejak 2015 bahwa chip dan sistem AI yang bergantung pada CPU – yang merupakan setiap GPU, TPU, LPU, NRU, ASIC, dan FPGA di luar sana – akan menghadapi dinding yang signifikan pada tahun 2020. Batasan sistem di mana akselerator AI telah menjadi lebih baik dan lebih cepat dalam hal kinerja mentah, tetapi infrastruktur yang mendasarinya tidak mengikuti.

Sebagai hasilnya, kami memutuskan untuk meninggalkan raksasa besar yang dipenuhi birokrasi yang melindungi bisnis yang sukses, seperti produsen CPU dan NIC, dan mengganggu industri dengan arsitektur AI yang lebih baik yang terbuka, netral, dan dirancang khusus untuk inferensi AI. Salah satu kesimpulan dari merancang kembali inferensi AI yang ideal adalah bahwa dengan meningkatkan utilitas GPU dan efisiensi sistem-level, infrastruktur komputasi dan jaringan AI baru kami – yang ditenagai oleh chip server-on-chip NR1 yang baru kami yang menggantikan CPU host dan NIC. Sebagai merek bahan dan pendamping untuk setiap GPU atau akselerator AI, kami dapat menghilangkan hambatan pasar yang mencegah 65% organisasi untuk berinovasi dan mengadopsi AI saat ini – GPU yang tidak terpakai yang menyebabkan membeli lebih dari yang dibutuhkan (karena mereka berjalan idle > 50% dari waktu) – semuanya sambil mengurangi konsumsi energi, tantangan real estat pusat data AI, dan biaya operasional.

Ini adalah kesempatan sekali seumur hidup untuk benar-benar mengubah arsitektur sistem AI untuk lebih baik berdasarkan semua yang saya pelajari dan praktikkan selama 30 tahun, membuka pintu untuk inovator AI baru di seluruh industri dan menghilangkan bottleneck CPU, kompleksitas, dan jejak karbon.

Misi NeuReality adalah untuk mendemokratisasi AI. Bisakah Anda menjelaskan apa yang dimaksud dengan “AI untuk Semua” bagi Anda dan bagaimana NeuReality berencana untuk mencapai visi ini?

Misi kami adalah untuk mendemokratisasi AI dengan membuatnya lebih mudah diakses dan terjangkau bagi semua organisasi besar dan kecil – dengan melepaskan kapasitas maksimum dari setiap GPU atau akselerator AI; dengan kata lain, mendapatkan LEBIH dari investasi GPU yang Anda buat, bukan MEMBELI lebih banyak GPU untuk mencapai kinerja yang diinginkan. Kami dapat meningkatkan akselerator AI hingga 100% kemampuan penuh, sambil menyampaikan hingga 15X efisiensi energi dan mengurangi biaya sistem hingga 90%. Ini adalah perbaikan besar. Kami berencana untuk mencapai visi ini dengan Solusi Inferensi AI NR1 kami, arsitektur sistem pusat data pertama yang dirancang khusus untuk era AI. Ini menjalankan pipa data AI volume tinggi, variasi tinggi dengan biaya yang terjangkau dan efisien dengan manfaat tambahan dari jejak karbon yang berkurang.

Mencapai AI untuk semua juga berarti membuatnya mudah digunakan. Di NeuReality, kami menyederhanakan penerapan, pengelolaan, dan skalabilitas infrastruktur AI, meningkatkan proses bisnis dan profitabilitas, dan memajukan sektor seperti kesehatan masyarakat, keamanan, penegakan hukum, dan layanan pelanggan. Dampak kami mencakup sektor seperti pencitraan medis, uji klinis, deteksi penipuan, pembuatan konten AI, dan banyak lagi.

Saat ini, NR1-S Appliance Inferensi AI kami yang pertama tersedia secara komersial dengan akselerator Cloud AI 100 Ultra Qualcomm dan melalui Cirrascale, penyedia layanan cloud.

NR1 Solusi Inferensi AI dipuji sebagai arsitektur sistem pusat data pertama yang dirancang khusus untuk era AI, dan dirancang khusus untuk inferensi AI. Apa yang menjadi inovasi dan terobosan kunci yang mengarah pada pengembangan NR1?

NR1 adalah nama dari arsitektur sistem silicon-ke-perangkat lunak yang kami rancang dan sampaikan ke industri AI – sebagai infrastruktur komputasi dan jaringan AI yang terbuka, sepenuhnya kompatibel yang melengkapi setiap akselerator AI dan GPU. Jika saya harus memecahnya menjadi inovasi paling unik dan menarik yang mengarah pada Solusi NR1 ini dan membedakan kami, saya akan mengatakan:

  • Grafik Komputasi yang Dioptimalkan: Tim kami merancang Accelerator Eksekusi Grafik yang Dapat Diprogram untuk mengoptimalkan pemrosesan Grafik Komputasi, yang sangat penting untuk AI dan berbagai beban kerja lain seperti pemrosesan media, database, dan lain-lain. Grafik Komputasi mewakili serangkaian operasi dengan ketergantungan, dan aplikasi yang lebih luas ini memposisikan NR1 sebagai potensial mengganggu tidak hanya super meningkatkan GPU dan akselerator AI lainnya. Ini menyederhanakan penerapan model AI dengan menghasilkan Grafik Komputasi yang dioptimalkan (CG) berdasarkan data AI yang diproses sebelumnya dan API perangkat lunak, mengarah ke peningkatan kinerja yang signifikan.
  • NR1 NAPU (Unit Pengolahan yang Dapat Diakses Jaringan): Arsitektur inferensi AI kami ditenagai oleh NR1 NAPU – sebuah chip server-on-chip 7nm yang memungkinkan akses jaringan langsung untuk pra-pengolahan dan pasca-pengolahan AI. Kami memasukkan 6,5x lebih banyak daya pada chip NR1 yang lebih kecil daripada CPU host umum. Secara tradisional, tugas pra-pengolahan (seperti pembersihan data, pemformatan, dan ekstraksi fitur) dan tugas pasca-pengolahan (seperti interpretasi hasil dan pemformatan) ditangani oleh CPU. Dengan memindahkan tugas-tugas ini ke NR1 NAPU, kami menggantikan CPU dan NIC. Ini mengurangi bottleneck yang memungkinkan pemrosesan yang lebih cepat secara keseluruhan, waktu respons yang sangat cepat, dan biaya yang lebih rendah per kueri AI.
  • Teknologi AI-Hypervisor NR1: AI-Hypervisor berbasis perangkat keras NR1 kami mengoptimalkan orkestrasi tugas AI dan utilitas sumber daya, meningkatkan efisiensi dan mengurangi bottleneck.
  • NR1 AI-over-Fabric Network Engine: NR1 mengintegrasikan mesin jaringan AI-over-Fabric yang unik yang memastikan koneksi jaringan yang mulus dan penskalaan sumber daya AI yang efisien di seluruh beberapa chip NR1 – yang dipasangkan dengan GPU atau akselerator AI apa pun – di dalam server inferensi yang sama atau NR1-S Appliance inferensi AI.

NeuReality’s data kinerja terbaru menyoroti penghematan biaya dan energi yang signifikan. Bisakah Anda memberikan lebih banyak detail tentang bagaimana NR1 mencapai penghematan biaya hingga 90% dan 15x lebih baik dalam efisiensi energi dibandingkan dengan sistem tradisional?

NeuReality’s NR1 mengurangi biaya dan konsumsi energi inferensi AI hingga 90% dan 15x, masing-masing. Ini dicapai melalui:

  • Silikon Khusus: Infrastruktur inferensi AI kami yang dirancang khusus ditenagai oleh NR1 NAPU server-on-chip, yang menyerap fungsi CPU dan NIC menjadi satu – dan menghilangkan kebutuhan akan CPU dalam inferensi. Pada akhirnya NR1 memaksimalkan output dari setiap akselerator AI atau GPU dengan cara yang paling efisien.
  • Arsitektur yang Dioptimalkan: Dengan menyederhanakan aliran data AI dan mengintegrasikan pra-pengolahan dan pasca-pengolahan AI langsung dalam NR1 NAPU, kami memindahkan dan menggantikan CPU. Ini menghasilkan latensi yang berkurang, skalabilitas linear, dan biaya per kueri AI yang lebih rendah.
  • Penerapan yang Fleksibel: Anda dapat membeli NR1 dengan dua cara utama: 1) di dalam Modul NR1-M yang merupakan kartu PCIe yang menampung beberapa NR1 NAPU (biasanya 10) yang dirancang untuk dipasangkan dengan kartu akselerator AI Anda yang ada. 2) di dalam NR1-S Appliance, yang memasangkan NR1 NAPU dengan jumlah akselerator AI yang sama (GPU, ASIC, FPGA, dll.) sebagai sistem inferensi AI yang siap digunakan.

Di Supercomputing 2024 pada bulan November, Anda akan melihat kami mendemonstrasikan NR1-S Appliance dengan 4x chip NR1 per 16x akselerator Cloud AI 100 Ultra Qualcomm. Kami telah mengujinya dengan chip inferensi AI Nvidia (NVDA ). NeuReality merevolusi inferensi AI dengan arsitektur yang terbuka dan dirancang khusus.

Bagaimana NR1-S Appliance Inferensi AI yang dipasangkan dengan akselerator Cloud AI 100 Qualcomm membandingkan dengan server inferensi tradisional yang berbasis CPU dengan GPU Nvidia H100 atau L40S dalam aplikasi dunia nyata?

NR1, dikombinasikan dengan akselerator Cloud AI 100 Qualcomm atau GPU Nvidia H100 atau L40S, memberikan dorongan kinerja yang substansial atas server inferensi tradisional yang berbasis CPU dalam aplikasi AI dunia nyata di seluruh model bahasa besar seperti Llama 3, penglihatan komputer, pemrosesan bahasa alami, dan pengenalan suara. Dengan kata lain, menjalankan sistem inferensi AI Anda dengan NR1 mengoptimalkan kinerja, biaya sistem, efisiensi energi, dan waktu respons di seluruh gambar, suara, bahasa, dan teks – baik secara terpisah (modality tunggal) atau bersama (multi-modality).

Hasil akhirnya? Ketika dipasangkan dengan NR1, pelanggan mendapatkan LEBIH dari investasi GPU yang mahal yang mereka buat, bukan MEMBELI lebih banyak GPU untuk mencapai kinerja yang diinginkan.

Di luar memaksimalkan utilitas GPU, NR1 memberikan efisiensi yang luar biasa, menghasilkan 50-90% harga/kinerja yang lebih baik dan hingga 13-15x lebih efisien dalam energi. Ini diterjemahkan menjadi penghematan biaya yang signifikan dan jejak lingkungan yang berkurang untuk infrastruktur AI Anda.

NR1-S menunjukkan skalabilitas linear tanpa penurunan kinerja. Bisakah Anda menjelaskan aspek teknis yang memungkinkan skalabilitas yang mulus ini?

NR1-S Appliance, yang menggabungkan chip NR1 kami dengan akselerator AI dari jenis atau kuantitas apa pun, mendefinisikan kembali infrastruktur AI. Kami telah melampaui keterbatasan yang berbasis CPU untuk mencapai tingkat kinerja dan efisiensi yang baru.

Sebagai gantinya dari bottleneck tradisional NIC-ke-CPU-ke-akselerator, NR1-S mengintegrasikan akses jaringan langsung, pra-pengolahan AI, dan pasca-pengolahan dalam Unit Pengolahan yang Dapat Diakses Jaringan (NAPU) kami. Dengan biasanya 10 NAPU per sistem, masing-masing menangani tugas seperti pemrosesan visi, audio, dan DSP, dan AI-Hypervisor kami yang mengatur beban kerja, aliran data AI yang disederhanakan dicapai. Ini diterjemahkan menjadi skalabilitas linear: tambahkan lebih banyak akselerator, dapatkan kinerja yang proporsional.

Hasilnya? Utilitas 100% akselerator AI secara konsisten diamati. Sementara biaya dan efisiensi energi keseluruhan bervariasi tergantung pada chip AI yang digunakan, investasi perangkat keras yang dimaksimalkan dan kinerja yang ditingkatkan secara konsisten disampaikan. Ketika kebutuhan inferensi AI meningkat, NR1-S menyediakan alternatif yang menarik untuk arsitektur tradisional.

NeuReality bertujuan untuk mengatasi hambatan adopsi AI yang luas. Apa tantangan paling signifikan yang dihadapi bisnis saat mengadopsi AI, dan bagaimana teknologi Anda membantu mengatasi hambatan ini?

Ketika diimplementasikan dengan buruk, perangkat lunak dan solusi AI dapat menjadi bermasalah. Banyak bisnis tidak dapat mengadopsi AI karena biaya dan kompleksitas membangun dan menskalakan sistem AI. Saat ini, solusi AI tidak dioptimalkan untuk inferensi, dengan pod pelatihan yang biasanya memiliki efisiensi yang buruk dan server inferensi yang memiliki bottleneck yang tinggi. Untuk mengatasi tantangan ini dan membuat AI lebih mudah diakses, kami telah mengembangkan solusi inferensi AI yang lengkap – infrastruktur komputasi dan jaringan yang ditenagai oleh NAPU kami – yang membuat akselerator AI pendamping dan mengurangi hambatan pasar sekitar biaya dan konsumsi energi yang berlebihan.

Pendekatan sistem-level kami untuk inferensi AI – bukan mencoba mengembangkan GPU atau akselerator AI yang lebih baik di mana sudah ada banyak inovasi dan persaingan – berarti kami mengisi celah industri yang signifikan untuk lusinan inovator chip dan sistem inferensi AI. Tim kami menyerang kekurangan inferensi AI secara sistematis dan holistik, dengan menentukan titik sakit, celah arsitektur, dan proyeksi beban kerja AI – untuk menyampaikan arsitektur inferensi AI yang dirancang khusus, silicon-ke-perangkat lunak, dan bebas CPU. Dan dengan mengembangkan tumpukan perangkat lunak AI terintegrasi dengan standar terbuka dari Python dan Kubernetes yang digabungkan dengan NeuReality Toolchain, Provisioning, dan API Inferensi, rangkaian alat perangkat lunak terintegrasi kami menggabungkan semua komponen menjadi antarmuka pengguna yang berkualitas tinggi.

Di pasar AI yang kompetitif, apa yang membedakan NeuReality dari penyedia solusi inferensi AI lainnya?

Untuk menyederhanakannya, kami terbuka dan netral akselerator. Infrastruktur inferensi NR1 kami supercharge setiap akselerator AI – GPU, TPU, LPU, ASIC, Anda namanya – menciptakan sistem akhir-ke-akhir yang benar-benar dioptimalkan. Akselerator AI awalnya dibawa untuk membantu CPU menangani tuntutan jaringan neural dan pembelajaran mesin dalam skala besar, tetapi sekarang akselerator AI telah menjadi sangat kuat, mereka sekarang terhambat oleh CPU yang mereka maksudkan untuk membantu.

Solusi kami? NR1. Ini adalah arsitektur inferensi AI yang lengkap dan direkayasa ulang. Senjata rahasia kami? NR1 NAPU dirancang sebagai bahan pendamping untuk memaksimalkan kinerja akselerator AI tanpa menghabiskan daya tambahan atau memecahkan bank. Kami telah membangun ekosistem yang terbuka, yang berintegrasi dengan mulus dengan setiap chip inferensi AI dan kerangka perangkat lunak populer seperti Kubernetes, Python, TensorFlow, dan banyak lagi.

NeuReality’s pendekatan yang terbuka berarti kami tidak bersaing dengan lanskap AI; kami ada untuk melengkapi melalui kemitraan strategis dan kolaborasi teknologi. Kami menyediakan potongan puzzle yang hilang: arsitektur inferensi yang dirancang khusus, bebas CPU yang tidak hanya membuka kinerja akselerator AI, tetapi juga membuatnya lebih mudah bagi bisnis dan pemerintah untuk mengadopsi AI. Bayangkan melepaskan kekuatan penuh dari NVIDIA H100, Google (GOOGL ) TPU, atau AMD MI300 – memberikan mereka infrastruktur yang mereka layak.

NeuReality’s arsitektur yang terbuka dan efisien memungkinkan lapangan yang merata, membuat AI lebih mudah diakses dan terjangkau bagi semua orang. Saya bersemangat untuk melihat berbagai industri – fintech, biotech, healthtech – mengalami keuntungan NR1 secara langsung. Bandingkan solusi AI Anda di sistem tradisional yang berbasis CPU versus infrastruktur NR1 modern dan saksikan perbedaannya. Saat ini, hanya 35% bisnis dan pemerintah yang telah mengadopsi AI dan itu berdasarkan kriteria kualifikasi yang sangat rendah. Mari kita buatnya memungkinkan lebih dari 50% pelanggan perusahaan untuk mengadopsi AI dalam setahun ke depan tanpa merugikan planet atau memecahkan bank.

Melihat ke depan, apa visi jangka panjang NeuReality untuk peran AI dalam masyarakat, dan bagaimana Anda melihat perusahaan Anda berkontribusi pada masa depan ini?

Saya membayangkan masa depan di mana AI memberikan manfaat bagi semua orang, memicu inovasi, dan meningkatkan kehidupan. Kami tidak hanya membangun teknologi; kami membangun fondasi untuk masa depan yang lebih baik.

NR1 kami adalah kunci untuk visi ini. Ini adalah solusi inferensi AI yang lengkap yang mulai menghancurkan hambatan biaya dan kompleksitas yang menghambat adopsi AI bisnis massal. Kami telah merancang kembali infrastruktur dan arsitektur, menyampaikan sistem revolusioner yang memaksimalkan output dari setiap GPU, setiap akselerator AI, tanpa meningkatkan biaya operasional atau konsumsi energi.

Model bisnis benar-benar penting untuk menskalakan dan memberikan pilihan nyata kepada pelanggan akhir atas autokrasi AI yang terkonsentrasi seperti yang saya tulis sebelumnya. Jadi, kami membangun ekosistem yang terbuka, di mana silikon kami bekerja dengan silikon lain, bukan melawan. Itulah mengapa kami merancang NR1 untuk berintegrasi dengan mulus dengan semua akselerator AI dan dengan model terbuka dan perangkat lunak, membuatnya semudah mungkin untuk menginstal, mengelola, dan menskalakan.

Namun, kami tidak berhenti di situ. Kami berkolaborasi dengan mitra untuk memvalidasi teknologi kami di seluruh beban kerja AI dan menyampaikan “inferensi-sebagai-layanan” dan “LLM-sebagai-layanan” melalui penyedia layanan cloud, hyper scaler, dan langsung dengan pembuat chip pendamping. Kami ingin membuat AI canggih lebih mudah diakses dan terjangkau bagi semua orang.

Bayangkan kemungkinan jika kita bisa meningkatkan kinerja inferensi AI, efisiensi energi, dan keterjangkauan dengan persentase double-digit. Bayangkan masyarakat yang kuat dan didukung AI dengan lebih banyak suara dan pilihan yang menjadi kenyataan. Jadi, kita semua harus melakukan pekerjaan yang menantang untuk membuktikan dampak bisnis dan ROI ketika AI diimplementasikan d in daily data center operations. Let’s focus on revolutionary AI implementation, not just AI model capability. This is how we contribute to a future where AI benefits everyone – a win for profit margins, people, and the planet. Thank you for the great interview, readers who wish to learn more should visit NeuReality.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.