Interviews

Moshe Tanach, CEO und Mitgründer von NeuReality – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Moshe Tanach ist der CEO und Mitgründer von NeuReality. Bevor er NeuReality gründete, war Moshe als Director of Engineering bei Marvell und Intel (INTC ) tätig, wo er die Entwicklung komplexer drahtloser und Netzwerkprodukte zur Massenproduktion leitete. Er war auch als AVP of R&D bei DesignArt Networks (später von Qualcomm (QCOM ) übernommen) tätig, wo er zur Entwicklung von 4G-Basisstationsprodukten beitrug.

NeuReality’s Mission ist es, die Adoption von KI zu vereinfachen. Durch einen systemweiten Ansatz für KI liefert NeuRealitys Team von Branchenexperten KI-Inferenz holistisch, indem es Schmerzpunkte identifiziert und zweckgebundene, siliziumbasierte KI-Inferenzlösungen bereitstellt, die KI sowohl erschwinglich als auch zugänglich machen.

Mit Ihrer umfassenden Erfahrung bei der Leitung von Ingenieurprojekten bei Marvell, Intel und DesignArt-Networks, was hat Sie dazu inspiriert, NeuReality mitzubegründen, und wie haben Ihre vorherigen Rollen die Vision und Richtung des Unternehmens beeinflusst?

NeuReality wurde von Anfang an gebaut, um die zukünftigen Kosten-, Komplexitäts- und Klimaprobleme zu lösen, die bei der KI-Inferenz unvermeidlich wären – also der Bereitstellung von trainierten KI-Modellen und Software in Produktions-KI-Rechenzentren. Wo KI-Training die Erstellung von KI ist; KI-Inferenz ist, wie sie verwendet wird und wie sie mit Milliarden von Menschen und Geräten auf der ganzen Welt interagiert.

Wir sind ein Team von Systemingenieuren, also betrachten wir alle Aspekte, alle mehrfachen Facetten der KI-Inferenz, einschließlich GPUs und aller Klassen von zweckgebundenen KI-Beschleunigern. Es wurde uns klar, dass CPU-abhängige KI-Chips und -Systeme – also jeder GPU, TPU, LPU, NRU, ASIC und FPGA – bis 2020 an eine erhebliche Wand stoßen würden. Die Systemgrenzen, bei denen der KI-Beschleuniger leistungsfähiger und schneller in Bezug auf Rohleistung wurde, aber die zugrunde liegende Infrastruktur nicht mithalten konnte.

Als Ergebnis entschieden wir uns, uns von den großen Giganten zu lösen, die von Bürokratie durchsetzt sind und erfolgreiche Unternehmen schützen, wie CPU- und NIC-Hersteller, und die Branche mit einer besseren KI-Architektur zu revolutionieren, die offen, agnostisch und zweckgebunden für KI-Inferenz ist. Eine der Schlussfolgerungen aus der Neukonzeption der idealen KI-Inferenz ist, dass wir durch die Steigerung der GPU-Auslastung und der Systemeffizienz unsere neue KI-Rechen- und Netzwerkinfrastruktur – angetrieben von unserem neuartigen NR1-Server-on-Chip, der den Host-CPU und NICs ersetzt – Marktbarrieren beseitigen kann, die 65 % der Organisationen davon abhalten, KI zu innovieren und zu adoptieren – unterausgelastete GPUs, die zu mehr als dem führen, was wirklich benötigt wird (da sie mehr als 50 % der Zeit im Leerlauf laufen) – und gleichzeitig den Energieverbrauch, die KI-Rechenzentrums-Flächenherausforderung und die Betriebskosten reduzieren.

Das ist eine einmalige Chance, die KI-Systemarchitektur wirklich zum Besseren zu verändern, basierend auf allem, was ich in 30 Jahren gelernt und praktiziert habe, und Türen für neue KI-Innovatoren in verschiedenen Branchen zu öffnen und CPU-Engpässe, Komplexität und Kohlenstoffausstoß zu beseitigen.

NeuRealitys Mission ist es, KI zu demokratisieren. Können Sie erläutern, was “KI für alle” für Sie bedeutet und wie NeuReality diese Vision erreichen will?

Unsere Mission ist es, KI zu demokratisieren, indem wir sie für alle Organisationen, groß und klein, zugänglicher und erschwinglicher machen – indem wir die maximale Kapazität jeder GPU oder jedes KI-Beschleunigers freisetzen, so dass Sie mehr aus Ihrer Investition erhalten; mit anderen Worten, mehr aus den GPUs, die Sie kaufen, anstelle von mehr GPUs, die mehr als 50 % der Zeit im Leerlauf laufen. Wir können KI-Beschleuniger bis zu 100 % ihrer vollen Kapazität steigern, während wir bis zu 15-mal bessere Energieeffizienz und bis zu 90 % geringere Systemkosten liefern. Das sind Verbesserungen im Bereich von Größenordnungen. Wir planen, diese Vision mit unserer NR1-KI-Inferenzlösung zu erreichen, der weltweit ersten Rechenzentrums-Systemarchitektur, die speziell für das KI-Zeitalter entwickelt wurde. Sie ermöglicht es, große Mengen an KI-Datenpipelines zu einem erschwinglichen Preis und mit hoher Effizienz zu verarbeiten, mit dem zusätzlichen Vorteil einer reduzierten Kohlenstoffbilanz.

Die Erreichung von KI für alle bedeutet auch, dass sie einfach zu verwenden ist. Bei NeuReality vereinfachen wir die Bereitstellung, Verwaltung und Skalierbarkeit von KI-Infrastrukturen, verbessern Geschäftsprozesse und Profitabilität und fördern Branchen wie öffentliche Gesundheit, Sicherheit, Strafverfolgung und Kundenservice. Unser Einfluss erstreckt sich auf Branchen wie medizinische Bildgebung, klinische Studien, Betrugsbekämpfung, KI-Inhaltserschaffung und viele mehr.

Aktuell sind unsere ersten kommerziell verfügbaren NR1-S-KI-Inferenz-Geräte mit Qualcomm Cloud AI 100 Ultra-Beschleunigern und über Cirrascale, einen Cloud-Dienstleister, verfügbar.

Die NR1-KI-Inferenzlösung wird als die erste Rechenzentrums-Systemarchitektur für das KI-Zeitalter und speziell für KI-Inferenz entwickelt. Was waren die wichtigsten Innovationen und Durchbrüche, die zur Entwicklung der NR1 führten?

NR1™ ist der Name der gesamten siliziumbasierten Systemarchitektur, die wir für die KI-Industrie entwickelt und bereitgestellt haben – als offene, voll kompatible KI-Rechen- und Netzwerkinfrastruktur, die jede KI-Beschleunigung und GPU ergänzt. Wenn ich es auf die wichtigsten und aufregendsten Innovationen herunterbrechen müsste, die zu dieser End-to-End-NR1-Lösung und die uns von anderen unterscheidet, würde ich sagen:

  • Optimierte KI-Computegraphen: Das Team entwickelte einen programmierbaren Graph-Execution-Accelerator, um die Verarbeitung von Computegraphen zu optimieren, die für KI und andere Workloads wie Medienverarbeitung, Datenbanken und mehr entscheidend sind. Computegraphen stellen eine Reihe von Operationen mit Abhängigkeiten dar, und diese breitere Anwendbarkeit positioniert NR1 als potenziell disruptiv über die bloße Leistungssteigerung von GPUs und anderen KI-Beschleunigern hinaus. Es vereinfacht die KI-Modellbereitstellung, indem es optimierte Computegraphen (CGs) auf der Grundlage vorverarbeiteter KI-Daten und Software-APIs generiert, was zu signifikanten Leistungssteigerungen führt.
  • NR1 NAPU™ (Network Addressable Processing Unit): Unsere KI-Inferenzarchitektur wird von der NR1 NAPU™ angetrieben – einem 7nm-Server-on-Chip, der direkten Netzwerkzugriff für KI-Vor- und Nachverarbeitung ermöglicht. Wir packen 6,5-mal mehr Leistung in einen kleineren NR1-Chip als eine typische allgemeine, host-CPU. Traditionell werden Vorverarbeitungsaufgaben (wie Datenreinigung, Formatierung und Merkmalsextraktion) und Nachverarbeitungsaufgaben (wie Ergebnisinterpretation und Formatierung) von der CPU gehandhabt. Durch die Auslagerung dieser Aufgaben an die NR1 NAPU™ verdrängen wir sowohl die CPUs als auch die NICs. Dies reduziert Engpässe und ermöglicht schnellere Gesamtbearbeitung, blitzschnelle Antwortzeiten und geringere Kosten pro KI-Abfrage. Dies reduziert Engpässe und ermöglicht schnellere Gesamtbearbeitung.
  • NR1™ KI-Hypervisor™-Technologie: Der NR1s patentierte hardwarebasierte KI-Hypervisor™ optimiert die KI-Aufgaben-Orchestrierung und Ressourcennutzung, wodurch die Effizienz verbessert und Engpässe reduziert werden.
  • NR1™ KI-über-Fabric™-Netzwerk-Engine: Der NR1 enthält eine einzigartige KI-über-Fabric™-Netzwerk-Engine, die einen nahtlosen Netzwerkzugriff und eine effiziente Skalierung von KI-Ressourcen über mehrere NR1-Chips – die mit jedem GPU oder KI-Beschleuniger gekoppelt sind – innerhalb desselben Inferenzservers oder NR1-S-KI-Inferenzgeräts gewährleistet.

NeuRealitys aktuelle Leistungsdaten heben signifikante Kosteneinsparungen und Energieeffizienz hervor. Können Sie mehr Details darüber liefern, wie die NR1 bis zu 90 % Kosteneinsparungen und 15-mal bessere Energieeffizienz im Vergleich zu herkömmlichen Systemen erreicht?

NeuRealitys NR1 reduziert die Kosten und den Energieverbrauch von KI-Inferenz um bis zu 90 % und 15-mal, jeweils. Dies wird durch:

  • Spezialisierte Silizium: Unsere zweckgebundene KI-Inferenzinfrastruktur wird von der NR1 NAPU™-Server-on-Chip angetrieben, die die Funktionalität der CPU und NIC in einem absorbiert und den Bedarf an CPUs in der Inferenz eliminiert. Letztendlich maximiert die NR1 die Ausgabe jeder KI-Beschleunigung oder GPU auf die effizienteste Weise möglich.
  • Optimierte Architektur: Durch die Straffung des KI-Datenflusses und die direkte Integration von KI-Vor- und Nachverarbeitung in die NR1 NAPU™ verlagern und ersetzen wir die CPU. Dies führt zu reduzierter Latenz, linearer Skalierbarkeit und geringeren Kosten pro KI-Abfrage.
  • Flexible Bereitstellung: Sie können die NR1 auf zwei primäre Weise erwerben: 1) innerhalb des NR1-M™-Moduls, das eine PCIe-Karte ist, die mehrere NR1-NAPUs (in der Regel 10) enthält, die für die Verbindung mit Ihren bestehenden KI-Beschleunigerkarten konzipiert sind. 2) innerhalb des NR1-S™-Geräts, das NR1-NAPUs mit einer gleichen Anzahl von KI-Beschleunigern (GPU, ASIC, FPGA usw.) als ein fertiges KI-Inferenzsystem paart.

Auf der Supercomputing 2024 im November werden Sie uns bei der Demonstration eines NR1-S-Geräts mit 4x NR1-Chips pro 16x Qualcomm Cloud AI 100 Ultra-Beschleunigern sehen. Wir haben dasselbe mit Nvidia (NVDA ) -KI-Inferenzchips getestet. NeuReality revolutioniert die KI-Inferenz mit ihrer offenen, zweckgebundenen Architektur.

Wie verhält sich das NR1-S-KI-Inferenzgerät mit Qualcomm® Cloud AI 100-Beschleunigern im Vergleich zu herkömmlichen CPU-zentrischen Inferenzservern mit Nvidia® H100- oder L40S-GPUs in realen Anwendungen?

NR1, kombiniert mit Qualcomm Cloud AI 100 oder NVIDIA H100 oder L40S-GPUs, liefert einen erheblichen Leistungsboost über herkömmliche CPU-zentrische Inferenzserver in realen KI-Anwendungen über große Sprachmodelle wie Llama 3, Computer-Vision, natürliche Sprachverarbeitung und Spracherkennung. Mit anderen Worten, wenn Sie Ihr KI-Inferenzsystem mit NR1 ausführen, optimieren Sie die Leistung, die Systemkosten, die Energieeffizienz und die Antwortzeiten über Bilder, Sound, Sprache und Text – sowohl separat (eine einzige Modalität) als auch zusammen (mehrere Modalitäten).

Das Ergebnis? Wenn Sie NR1 mit einem Kunden kombinieren, erhält der Kunde mehr von den teuren GPU-Investitionen, anstatt mehr GPUs zu kaufen, um die gewünschte Leistung zu erzielen.

Darüber hinaus maximiert die NR1 die GPU-Auslastung und liefert außergewöhnliche Effizienz, was zu 50-90 % besserer Preis-Leistungs-Verhältnis und bis zu 13-15-mal besserer Energieeffizienz führt. Dies übersetzt sich in erhebliche Kosteneinsparungen und einen reduzierten Umweltfußabdruck für Ihre KI-Infrastruktur.

Das NR1-S-Gerät zeigt lineare Skalierbarkeit ohne Leistungsabfälle. Können Sie die technischen Aspekte erklären, die eine solche nahtlose Skalierbarkeit ermöglichen?

Das NR1-S-Gerät, das unsere NR1-Chips mit KI-Beschleunigern von jedem Typ oder jeder Menge paart, definiert die KI-Infrastruktur neu. Wir sind über die CPU-zentrischen Grenzen hinausgegangen, um ein neues Leistungsniveau und eine neue Effizienz zu erreichen.

Anstelle des traditionellen NIC-zu-CPU-zu-Beschleuniger-Engpasses integriert das NR1-S direkten Netzwerkzugriff, KI-Vor- und Nachverarbeitung in unsere Network Addressable Processing Units (NAPUs). Mit typischerweise 10 NAPUs pro System, die jeweils Aufgaben wie Vision, Audio und DSP-Verarbeitung ausführen, und unserem KI-Hypervisor, der Workloads orchestriert, wird ein gestraffter KI-Datenfluss erreicht. Dies übersetzt sich in lineare Skalierbarkeit: Fügen Sie mehr Beschleuniger hinzu, erhalten Sie proportionale Leistung.

Das Ergebnis? Eine 100-prozentige Auslastung von KI-Beschleunigern wird konsistent beobachtet. Während die Gesamtkosten und Energieeffizienz je nach verwendeten KI-Chips variieren, werden maximale Hardwareinvestitionen und verbesserte Leistung konsistent geliefert. Wenn die KI-Inferenzbedürfnisse skalieren, bietet das NR1-S eine überzeugende Alternative zu herkömmlichen Architekturen.

NeuReality zielt darauf ab, die Barrieren für eine weit verbreitete KI-Adoption zu beseitigen. Was sind die größten Herausforderungen, denen Unternehmen bei der Adoption von KI gegenüberstehen, und wie hilft Ihre Technologie, diese zu überwinden?

Wenn KI-Software und -Lösungen schlecht implementiert werden, können sie zu Problemen führen. Viele Unternehmen können KI nicht adoptieren, weil die Kosten und die Komplexität von KI-Systemen zu hoch sind. Heute sind KI-Lösungen nicht für Inferenz optimiert, wobei Trainingspods typischerweise eine schlechte Effizienz und Inferenzserver hohe Engpässe haben. Um diese Herausforderung anzugehen und KI zugänglicher zu machen, haben wir die erste vollständige KI-Inferenzlösung entwickelt – eine Rechen- und Netzwerkinfrastruktur, die von unserem NAPU angetrieben wird, die das Meiste aus ihrem Begleit-KI-Beschleuniger macht und Marktbarrieren um exzessive Kosten und Energieverbrauch reduziert.

Unser systemweiter Ansatz für KI-Inferenz – im Gegensatz zur Entwicklung eines besseren GPUs oder KI-Beschleunigers, wo es bereits viel Innovation und Wettbewerb gibt – bedeutet, dass wir eine erhebliche Lücke in der KI-Inferenz-Systematik und holistisch angehen, indem wir Schmerzpunkte, Architekturlücken und KI-Workload-Prognosen bestimmen, um die erste zweckgebundene, siliziumbasierte KI-Inferenzarchitektur zu liefern. Und durch die Entwicklung eines Top-to-Bottom-KI-Software-Stacks mit offenen Standards von Python und Kubernetes kombiniert mit NeuReality-Toolchain, Provisioning und Inferenz-APIs, kombinieren unsere integrierten Software-Tools alle Komponenten in einer einzigen hochwertigen Benutzeroberfläche.

In einem wettbewerbsintensiven KI-Markt, was unterscheidet NeuReality von anderen KI-Inferenzlösungsanbietern?

Um es einfach auszudrücken, wir sind offen und beschleuniger-agnostisch. Unsere NR1-Inferenzinfrastruktur beschleunigt jeden KI-Beschleuniger – GPU, TPU, LPU, ASIC, Sie nennen es – und erstellt ein wirklich optimiertes End-to-End-System. KI-Beschleuniger wurden ursprünglich eingeführt, um CPUs bei der Bewältigung der Anforderungen von neuronalen Netzen und maschinellem Lernen in großem Umfang zu helfen, aber jetzt sind die KI-Beschleuniger so leistungsfähig, dass sie von den CPUs, die sie unterstützen sollten, behindert werden.

Unsere Lösung? Die NR1. Es ist eine vollständige, neukonzipierte KI-Inferenzarchitektur. Unser Geheimwissen? Die NR1 NAPU™ wurde als Co-Zutat entwickelt, um die Leistung von KI-Beschleunigern zu maximieren, ohne zusätzliche Leistung zu verbrauchen oder die Bank zu brechen. Wir haben ein offenes Ökosystem aufgebaut, das nahtlos mit jedem KI-Inferenzchip und beliebten Software-Frameworks wie Kubernetes, Python, TensorFlow und mehr integriert ist.

NeuRealitys offener Ansatz bedeutet, dass wir nicht mit der KI-Landschaft konkurrieren, sondern sie durch strategische Partnerschaften und Technologie-Kooperationen ergänzen. Wir liefern das fehlende Puzzleteil: eine zweckgebundene, CPU-freie Inferenzarchitektur, die nicht nur KI-Beschleuniger auf Benchmark-Leistung freisetzt, sondern es auch Unternehmen und Regierungen ermöglicht, KI zu adoptieren. Stellen Sie sich vor, die volle Leistung von NVIDIA H100s, Google (GOOGL ) TPUs oder AMD MI300s freizusetzen – ihnen die Infrastruktur zu geben, die sie verdienen.

NeuRealitys offene, effiziente Architektur ebnet den Weg für eine breitere Verfügbarkeit von KI und macht sie für jeden zugänglicher und erschwinglicher. Ich bin leidenschaftlich daran interessiert, verschiedene Branchen – Finanztechnologie, Biotechnologie, Gesundheitstechnologie – die NR1-Vorteile hautnah zu erleben. Vergleichen Sie Ihre KI-Lösungen auf herkömmlichen CPU-gebundenen Systemen mit der modernen NR1-Infrastruktur und erleben Sie den Unterschied. Heute haben nur 35 % der Unternehmen und Regierungen KI adoptiert, und das basierend auf sehr niedrigen Qualifizierungsstandards. Lassen Sie uns es möglich machen, dass über 50 % der Unternehmenskunden KI adoptieren, ohne die Umwelt zu schädigen oder die Bank zu brechen.

Ausblick vor Augen, was ist NeuRealitys langfristige Vision für die Rolle von KI in der Gesellschaft, und wie sehen Sie Ihr Unternehmen als Beitrag zu dieser Zukunft?

Ich stelle mir eine Zukunft vor, in der KI allen Menschen zugutekommt, Innovationen fördert und Leben verbessert. Wir bauen nicht nur Technologie, sondern die Grundlage für eine bessere Zukunft.

Unsere NR1 ist der Schlüssel zu dieser Vision. Es ist eine vollständige KI-Inferenzlösung, die beginnt, die Kosten- und Komplexitätsbarrieren zu durchbrechen, die eine breite Geschäftsadoption von KI behindern. Wir haben sowohl die Infrastruktur als auch die Architektur neu konzipiert und eine revolutionäre Systematik geliefert, die die Ausgabe jeder GPU oder jedes KI-Beschleunigers maximiert, ohne die Betriebskosten oder den Energieverbrauch zu erhöhen.

Unser Geschäftsmodell ist wichtig, um zu skalieren und Endkunden echte Auswahlmöglichkeiten über konzentrierte KI-Autokratie zu bieten, wie ich zuvor geschrieben habe. Stattdessen bauen wir ein offenes Ökosystem auf, in dem unser Silizium mit anderen Silizium arbeitet, nicht gegen es. Deshalb haben wir die NR1 so konzipiert, dass sie nahtlos mit allen KI-Beschleunigern und offenen Modellen und Software integriert ist, um es so einfach wie möglich zu machen, sie zu installieren, zu verwalten und zu skalieren.

Aber wir hören nicht auf. Wir kooperieren mit Partnern, um unsere Technologie über verschiedene KI-Workloads zu validieren und “Inferenz-as-a-Service” und “LLM-as-a-Service” über Cloud-Dienstleister, Hyper-Scaler und direkt mit Begleitchip-Herstellern bereitzustellen. Wir möchten fortschrittliche KI für jeden zugänglich und erschwinglich machen.

Stellen Sie sich vor, wenn wir die KI-Inferenzleistung, die Energieeffizienz und die Erschwinglichkeit um zweistellige Prozentsätze steigern könnten. Stellen Sie sich eine robuste, KI-aktivierte Gesellschaft vor, in der mehr Stimmen und Auswahlmöglichkeiten Realität werden. Also müssen wir alle die anspruchsvolle Arbeit leisten, um den Geschäftsnutzen und die Rentabilität von KI in täglichen Rechenzentrumsoperationen zu beweisen. Lassen Sie uns uns auf revolutionäre KI-Implementierung konzentrieren, nicht nur auf KI-Modellfähigkeiten.

Das ist, wie wir zu einer Zukunft beitragen, in der KI allen Menschen zugutekommt – ein Gewinn für Gewinnspannen, Menschen und die Umwelt.

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten NeuReality besuchen.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.