インタビュー

NeuRealityのモシェ・タナハ CEO兼共同創設者 – インタビュー・シリーズ

mm
Unite.AI を Google の優先ソースに追加

モシェ・タナハは、NeuRealityのCEO兼共同創設者です。NeuRealityを創設する前に、モシェはマーベルとインテルのエンジニアリング・ディレクターを務め、複雑なワイヤレスとネットワーク製品の大量生産を指揮しました。また、デザインアート・ネットワーク(後のQualcommによる買収)のR&D部門の副社長を務め、4Gベースステーション製品の開発に貢献しました。

(INTC )

NeuRealityの使命は、AIの導入を簡素化することです。AIをシステムレベルで取り組むことで、NeuRealityの業界の専門家チームは、AI推論を包括的に提供し、痛み点を特定し、目的を絞ったシリコンからソフトウェアまでのAI推論ソリューションを提供し、AIをより手頃でアクセスしやすくしています。

マーベル、インテル、デザインアート・ネットワークでのエンジニアリング・プロジェクトの経験を生かして、NeuRealityを共同創設するきっかけとなったのは何ですか?また、以前の役割が会社のビジョンと方向性にどのように影響しましたか。

NeuRealityは、AI推論のための将来のコスト、複雑さ、気候問題を解決するために構築されました。AIのトレーニングがAIの作成方法であるのに対し、AI推論はAIモデルとソフトウェアを本稼働レベルのAIデータセンターに展開する方法であり、世界中の数十億の人々やデバイスとやり取りする方法です。

私たちはシステムエンジニアのチームですので、エンドツーエンドのAI推論のすべての側面、つまりGPUやすべての種類の目的を絞ったAIアクセラレータを含むすべてを見ています。2015年から、CPU依存のAIチップやシステム(これはすべてのGPU、TPU、LPU、NRU、ASIC、FPGAです)が2020年までに大きな壁に当たることは明らかでした。そのシステムの限界では、AIアクセラレータは生のパフォーマンスではより優れていますが、基盤となるインフラストラクチャはそれに追いついていません。

その結果、私たちは、大きな巨人から離れて、AI産業をより優れたAIアーキテクチャで混乱させることにしました。AI推論のための新しいAIコンピューティングとネットワークインフラストラクチャを開発し、ホストCPUとNICを置き換えることで、GPUの利用率とシステムレベルの効率を高めました。私たちは、65%の組織がAIを採用できない市場の障壁を取り除くことができます。GPUが使用されていない時間が50%を超えるため、必要以上にGPUを購入する必要がありますが、エネルギー消費、AIデータセンターのリアルエステートの課題、運用コストを削減することができます。

これは、30年にわたる私の知識と経験を生かして、AIシステムアーキテクチャを改善する絶好の機会です。新しいAIイノベーターを各業界に導入し、CPUのボトルネック、複雑さ、炭素排出量を除去することができます。

NeuRealityの使命は、AIを民主化することです。私にとって「AI for All」とは何ですか?また、NeuRealityはどのようにしてこのビジョンを達成する予定ですか。

私たちの使命は、AIをよりアクセスしやすく、手頃なものにすることです。すべての組織、大小問わずに、AIをよりアクセスしやすく、手頃なものにすることです。つまり、GPUやAIアクセラレータの最大の能力を解放することです。つまり、GPUを購入するのではなく、GPUからより多くのものを得ることです。私たちは、AIアクセラレータを100%の能力まで高めることができ、エネルギー効率を15倍まで高め、システムコストを90%まで削減することができます。これは、10倍の改善です。私たちは、NR1 AI推論ソリューションを使用してこのビジョンを達成する予定です。NR1は、AIの時代に合わせて設計された世界初のデータセンター・システム・アーキテクチャです。大量のAIデータ・パイプラインを高ボリューム、高バリエティで、手頃で効率的に実行することができます。また、炭素排出量を削減することもできます。

AI for Allを達成するには、AIを使用しやすくすることも重要です。NeuRealityでは、AIインフラストラクチャの展開、管理、スケーラビリティを簡素化し、ビジネス・プロセスと収益性を向上させ、公共の健康、安全、法執行、顧客サービスなどの分野を進歩させています。私たちの影響は、医療画像、臨床試験、不正検出、AIコンテンツ作成など多くの分野に及びます。

現在、初めて商用化されたNR1-S AI推論アプライアンスが、Qualcomm (QCOM ) Cloud AI 100 UltraアクセラレータとCirrascaleを通じて利用可能です。

NR1 AI推論ソリューションは、AIの時代に合わせて設計された最初のデータセンター・システム・アーキテクチャであり、AI推論のために目的を絞ったものです。NR1の開発に至った主な革新とブレークスルーは何ですか。

NR1は、私たちがAI業界に提供したシリコンからソフトウェアまでのシステム・アーキテクチャの名称です。これは、すべてのAIアクセラレータとGPUと完全に互換性のある、オープンで目的を絞ったAIコンピューティングとネットワークインフラストラクチャです。NR1の開発に至った主な革新とブレークスルーを簡単に説明すると、以下のようになります:

  • 最適化されたAIコンピューティング・グラフ: 私たちのチームは、コンピューティング・グラフの処理を最適化するプログラム可能なグラフ・エクスキューション・アクセラレータを設計しました。コンピューティング・グラフは、AIやメディア・プロセッシング、データベースなどのさまざまなワークロードに不可欠です。このより広い適用性により、NR1はAI以外の分野でも革新的な可能性を秘めています。AIモデルを展開することを簡素化するために、事前に処理されたAIデータとソフトウェアAPIに基づいて最適化されたコンピューティング・グラフ(CG)を生成します。これにより、パフォーマンスが大幅に向上します。
  • NR1 NAPU(ネットワーク・アドレス可能・プロセッシング・ユニット): 私たちのAI推論アーキテクチャは、NR1 NAPUによって推進されます。NR1 NAPUは、7nmサーバー・オン・チップで、AIの前処理と後処理のための直接ネットワーク・アクセスを可能にします。伝統的なホストCPUとNICを置き換えることで、ボトルネックを除去し、全体的な処理を高速化し、応答時間を短縮し、コストを削減します。
  • NR1 AI-ハイパーバイザー技術: NR1の特許取得されたハードウェアベースのAI-ハイパーバイザーは、AIタスクのオーケストレーションとリソースの使用を最適化し、効率を向上させ、ボトルネックを削減します。
  • NR1 AI-over-Fabricネットワーク・エンジン: NR1には、AIリソースを複数のNR1チップ間で効率的にスケーリングできる、ユニークなAI-over-Fabricネットワーク・エンジンが組み込まれています。

NeuRealityの最近のパフォーマンス・データは、コストとエネルギー消費の削減を強調しています。NR1が伝統的なシステムと比較して、コストを90%、エネルギー消費を15倍削減するには、どのようにしてこれらの成果を達成するのですか。

NeuRealityのNR1は、AI推論のコストとエネルギー消費を90%、15倍削減します。これは、以下の要因によって達成されます:

  • 特化したシリコン: 私たちの目的を絞ったAI推論インフラストラクチャは、NR1 NAPUサーバー・オン・チップによって推進されます。これは、CPUとNICの機能を1つに統合し、推論のためにCPUが不要になります。最終的には、NR1は、AIアクセラレータまたはGPUの出力を最も効率的な方法で最大化します。
  • 最適化されたアーキテクチャ: AIデータのフローをストリームライン化し、NR1 NAPU内でAIの前処理と後処理を組み込むことで、CPUをオフロードして置き換えます。これにより、待ち時間が短縮され、スケーラビリティが線形化され、コストが削減されます。
  • 柔軟な展開: NR1は、2つの主な方法で購入できます。1)NR1-Mモジュール内で、10個のNR1 NAPUが含まれたPCIeカードです。これは、既存のAIアクセラレータ・カードとペアにするように設計されています。2)NR1-Sアプライアンス内で、NR1 NAPUとAIアクセラレータ(GPU、ASIC、FPGAなど)がペアになっています。これは、AI推論システムとして利用できる状態で提供されます。

Supercomputing 2024では、16個のQualcomm Cloud AI 100 Ultraアクセラレータと4個のNR1チップを搭載したNR1-Sアプライアンスをデモンストレーションします。私たちは、Nvidia (NVDA ) AI推論チップでも同様のテストを実施しました。NeuRealityは、オープンで目的を絞ったアーキテクチャを使用してAI推論を革命しています。

NR1-S AI推論アプライアンスは、Qualcomm Cloud AI 100アクセラレータと組み合わせて、伝統的なCPU中心の推論サーバーと比較して、Nvidia H100またはL40S GPUを搭載したサーバーと比較して、リアルワールド・アプリケーションでどのように比較されますか。

NR1は、Qualcomm Cloud AI 100またはNvidia H100またはL40S GPUと組み合わせて、リアルワールドのAIアプリケーションで、伝統的なCPU中心の推論サーバーよりも大幅なパフォーマンスの向上を実現します。画像、音、言語、テキストを含む、単一モダリティまたはマルチモダリティのAI推論システムのパフォーマンス、システムコスト、エネルギー効率、応答時間が向上します。

結果は、NR1を使用することで、顧客は高価なGPU投資からより多くのものを得ることができます。つまり、より多くのGPUを購入するのではなく、GPUの利用率を最大化することです。NR1は、GPUの利用率を最大化するだけでなく、50〜90%の価格パフォーマンスの向上と13〜15倍のエネルギー効率の向上を実現します。これにより、AIインフラストラクチャのコストと環境への影響が大幅に削減されます。

NR1-Sは、パフォーマンスの低下なしに線形にスケーラブルです。NR1-Sがスケーラビリティを実現する技術的側面について説明してください。

NR1-Sアプライアンスは、NR1チップとAIアクセラレータを組み合わせて、AIインフラストラクチャを再定義します。私たちは、CPU中心の制限を超えて、新しいレベルのパフォーマンスと効率性を達成しました。

従来のNICからCPUへのボトルネックではなく、NR1-Sは、ネットワーク・アクセス、AIの前処理、後処理を、ネットワーク・アドレス可能・プロセッシング・ユニット(NAPU)内で統合します。通常、システムごとに10個のNAPUが含まれており、それぞれがビジョン、オーディオ、DSP処理などのタスクを処理し、AI-ハイパーバイザーがワークロードをオーケストレートします。これにより、AIデータのフローがストリームライン化され、線形のスケーラビリティが実現します。つまり、AIアクセラレータを追加すると、比例してパフォーマンスが向上します。

結果は、AIアクセラレータの100%の利用率が一貫して観察されます。全体的なコストとエネルギー効率は、使用するAIチップによって異なりますが、ハードウェア投資の最大化とパフォーマンスの向上が一貫して実現します。AI推論のニーズが拡大するにつれて、NR1-Sは、従来のアーキテクチャに対する魅力的な代替手段を提供します。

NeuRealityは、AIの広範な採用の障壁に対処することを目指しています。企業がAIを採用する際に直面する最も重大な課題は何ですか?また、NeuRealityのテクノロジーはこれらの課題をどのようにして克服するのですか。

AIソフトウェアとソリューションは、適切に実装されていない場合、トラブルになる可能性があります。多くの企業は、AIシステムの構築とスケーリングのコストと複雑さのために、AIを採用できません。現在のAIソリューションは、推論に最適化されていません。トレーニング・ポッドは一般的に効率が悪く、推論サーバーはボトルネックが大きいです。この課題に対処し、AIをよりアクセスしやすくするために、私たちは、最初の完全なAI推論ソリューションを開発しました。私たちのシステムレベルのAI推論アプローチは、GPUやAIアクセラレータの開発における既存の革新と競争を補完するものです。私たちのチームは、AI推論システムの欠点を体系的に解決し、痛み点、建築上のギャップ、AIワークロードの予測を特定しました。私たちは、CPUフリーのAI推論アーキテクチャを開発しました。また、PythonとKubernetesを組み合わせたオープンな標準とNeuReality Toolchain、Provisioning、Inference APIを使用した、シリコンからソフトウェアまでのトップダウンAIソフトウェア・スタックを開発しました。これらの統合されたソフトウェア・ツールは、すべてのコンポーネントを単一の高品質なUI/UXにまとめました。

競合するAI市場で、NeuRealityは他のAI推論ソリューション・プロバイダーと比較して何が異なるのでしょうか。

私たちが異なるのは、オープンでアクセラレータに依存しないことです。私たちのNR1推論インフラストラクチャは、GPU、TPU、LPU、ASICなど、すべての AIアクセラレータを強化します。完全なエンドツーエンドのシステムを作成します。AIアクセラレータは、CPUがニューラル・ネットワークとマシン・ラーニングの要求を処理するのを支援するために導入されましたが、現在、AIアクセラレータは、支援するはずだったCPUによって制限されるようになりました。

私たちの解決策は、NR1です。これは、完全に再構想されたAI推論アーキテクチャです。私たちの秘密兵器は、NR1 NAPUで、AIアクセラレータのパフォーマンスを最大化するために設計されています。私たちは、オープンなエコシステムを構築しました。これは、AI推論チップや人気のソフトウェア・フレームワークであるKubernetes、Python、TensorFlowなどとシームレスに統合します。NeuRealityのオープン・アプローチは、AIの風景と競争するのではなく、それを補完することを意味します。私たちは、AIアクセラレータのパフォーマンスをベンチマークで解放し、AIを企業や政府が採用しやすくする、目的を絞ったCPUフリーの推論アーキテクチャを提供するために、戦略的なパートナーシップと技術のコラボレーションに重点を置いています。

NeuRealityの長期的なビジョンは、社会におけるAIの役割について何ですか?また、会社はこの未来にどのように貢献する予定ですか。

私は、AIがすべての人に利益をもたらす未来を想像しています。イノベーションを促進し、生活を改善します。私たちはただのテクノロジーを構築するのではなく、より良い未来の基盤を構築しています。

(GOOGL )

私たちのNR1は、そのビジョンの鍵です。これは、AI推論のための完全なソリューションです。これは、AIビジネスの広範な採用のコストと複雑さの障壁を打ち破り始めています。私たちは、インフラストラクチャとアーキテクチャの両方を再構想し、AIアクセラレータやGPUの出力を最大化する革命的なシステムを提供しています。

ビジネス・モデルは、スケールアップとエンド・カスタマーに実際の選択肢を提供することに関係しています。集中型のAI独裁政治を避けるためです。代わりに、オープンなエコシステムを構築しています。私たちのシリコンは、他のシリコンと対立するのではなく、協力します。NR1は、すべてのAIアクセラレータやオープンなモデル、ソフトウェアとシームレスに統合できるように設計されています。インストール、管理、スケーリングを容易にします。

しかし、それでは十分ではありません。私たちは、テクノロジーの検証をパートナーと協力して行い、クラウド・サービス・プロバイダー、ハイパー・スケーラー、コンパニオン・チップ・メーカーを通じて、推論サービスとLLMサービスを提供するために取り組んでいます。私たちは、AIをすべての人にアクセスしやすく、手頃なものにしたいと考えています。

AI推論のパフォーマンス、エネルギー効率、コストを10%の単位で向上させる可能性を想像してください。AIを活用した社会が、より多くの声や選択肢を持ち、現実になる可能性を想像してください。したがって、AIを日常のデータセンター・オペレーションに実装した場合のビジネスへの影響とROIを証明するために、我々はすべてが厳しい作業に取り組む必要があります。革命的なAIの実装に焦点を当て、AIモデルの能力だけに焦点を当てるのではなく、AIの実装に取り組みましょう。

これが、私たちが、AIがすべての人に利益をもたらす未来に貢献する方法です。利益のマージン、人々、地球すべてに勝利です。

素晴らしいインタビュー、詳しく知りたい読者はNeuRealityを訪れてください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。