インタビュー
エラド・ラズ、NextSiliconのCEO – インタビュー・シリーズ

エラド・ラズ、NextSiliconのCEOは、低レベル・システム、セキュリティ、ネットワーキング、ファイル・システム開発における深い専門知識で広く尊敬されている、豊富な経験を持つ起業家であり、テクノロジー・リーダーです。エリートの軍事技術者としての役割、シニア・ソフトウェア・リーダーシップ、企業の構築、長期的な投資など、キャリアを通じて、ラズは、オペレーティング・システムの内部とハードウェア・ソフトウェアの統合を跨ぐ、複雑でミッション・クリティカルなプロジェクトを率いてきました。NextSiliconを設立する前に、彼は複数のテクノロジー企業を構築して退社し、半導体企業のリーダーシップ役割を務め、スタートアップの多様なポートフォリオに投資し、ハンズオンのエンジニアリングの深さと強力な実行と長期的な戦略的ビジョンを組み合わせました。
NextSiliconは、2017年に設立されたイスラエルのハイパフォーマンス・コンピューティングと半導体企業で、AIや科学計算などの要求の厳しいワークロードのためのコンピュート・アーキテクチャを再定義しています。同社は、開発者がアプリケーションを書き直す必要なく、高パフォーマンスと効率を提供することを目的とした、ソフトウェア定義のインテリジェント・コンピュート・プラットフォームを開発しました。ハードウェアレベルでの適応性に焦点を当てて、NextSiliconは、モダンなデータセンターとスーパーコンピューティング環境における基本的なボトルネックに対処し、従来のアクセラレータの次世代の代替品として自己を位置付けます。
NextSiliconの設立に至るまでのあなたの旅についてお話しください。初期のアイデアは何がきっかけで、コンピューティングとの初期の経験はあなたのビジョンをどのように形作ったのか。
私は子供の頃からコンピューターに魅了されていました。その魅力は、古いコモドール64やアタリ(現在も収集しています)をいじくることから、スタートアップを共同設立し、最終的に前回の会社をMellanoxに売却するまで続きました。しかし、それらの初期の成功にもかかわらず、業界で同じ課題に出くわすことが何度もありました。計算ワークロードが複雑になるにつれて、従来のCPUとGPUアーキテクチャは、パフォーマンス、電力効率、スケーラビリティの限界に達しています。アルゴリズムの最適化や大規模シミュレーションの実行に関係なく、現在のアーキテクチャがワークロードに適応するのではなく、ワークロードがハードウェアに適応するように強制していることは明らかでした。
NextSiliconのアイデアは、この繰り返しの課題と、質問から生まれました。ワークロードに適応するコンピュート・アーキテクチャを構築できるのではないか。私の初期のアルゴリズム設計とハードウェアへの露出は、ブレークスルーが、実時間にハードウェアとソフトウェアを組み合わせることから来ることを教えてくれました。那が私たちのインテリジェント・コンピュート・アーキテクチャ(ICA)と、NextSiliconの指針となるビジョンです。
Maverick-2は、リアルタイムのワークロードに適応するインテリジェント・コンピュート・アクセラレータと説明されています。そのアーキテクチャは、従来のGPUやFPGAとどのように異なるのでしょうか。どのような適応性を実現するのでしょうか。
CPUとGPUは、私たちの世界を変え、よく仕えてきました。しかし、AIやハイパフォーマンス・コンピューティング(HPC)ワークロードの需要に応えるように設計されていませんでした。科学、天気、エネルギー、防衛などの分野で、複雑なデータの依存関係、メモリ・アクセス・パターン、計算パターンがありますが、現在のプロセッサはそれらを処理するように設計されていません。結果として、イノベーションを遅くするボトルネックが生じます。
Maverick-2の重要な違いは、再構成可能なデータフロー・エンジンとリアルタイムのソフトウェア最適化を組み合わせた新しいアプローチにあります。アーキテクチャの違いは、ハードウェアがワークロードに基づいて構成されるという点にあります。Maverick-2では、データの可用性が計算を駆動し、従来のプロセッサのようにプログラム・カウンタが命令の実行を駆動するのではなく、ソフトウェア定義の仮想プロセッシング・ユニットをリアルタイムに構成して再構成できるようになります。
結果は自分で語ってくれます。Maverick-2は、GPUよりも4倍以上のパフォーマンス・パー・ワットと、CPUよりも20倍以上のパフォーマンスを提供し、運用コストを半分以上削減します。研究者やエンジニアは、大規模で不規則なシミュレーションをより迅速に、より効率的に実行でき、洞察やブレークスルーを短時間で解放できます。
GPUよりも4倍以上のパフォーマンス・パー・ワット、CPUよりも20倍以上のパフォーマンスを達成したと報告しています。実際のワークロードでのパフォーマンス向上の主な要因は何ですか。
パフォーマンスの向上は、いくつかの重要な革新が協力して実現しています。
まず、80年間コンピューティングを支えてきたフォン・ノイマン・モデルから離脱しました。命令の逐次実行ではなく、Maverick-2はデータフロー・アーキテクチャを使用し、計算はデータの可用性に従います。これは、不規則でメモリを大量に使用するワークロードに根本的に適しています。
2つ目に、私たちの自己最適化アーキテクチャはリアルタイムでソフトウェア定義のプロセッサ・コアを生成します。ハードウェアは各アプリケーションのニーズに適応するため、コードの書き直しは不要です。
3つ目に、そしてこれは重要です。私たちは、理論的なピークではなく、実際のワークロードでの持続可能なパフォーマンスに焦点を当てています。多くのアーキテクチャは紙上では素晴らしいですが、実際のワークロードでは失敗します。Maverick-2は、AI、HPC、ベクタ・データベースで、ワークロードのニーズに継続的に適応することで、効率を維持します。
Maverick-2は、C/C++、Fortran、OpenMP、Kokkosを、コードの変更なしでサポートしています。開発者はこの互換性にどのように反応しましたか。CUDA、ROCm、または人気のAIフレームワークのサポートについての計画はありますか。
開発者は、Maverick-2が「真正のドロップイン・リプレイスメント」であることを愛しています。彼らは、コードの書き直しの障壁なしに、既存のアプリケーションをすぐに実行できます。現在、C/C++、Fortran、OpenMP、Kokkosをサポートしています。CUDA、ROCm、およびTensorFlow、JAX、PyTorch、ONNXなどの主要なAIフレームワークは、活発に開発中です。これにより、ベンダーのロックインや高価なコードの書き直しが排除され、顧客はワークフローを妨げることなく、新しいアーキテクチャを評価して採用できます。
Maverick-2のテレメトリ駆動のシステム最適化は、バックエンドでどのように機能しますか。チップをリアルタイムでプロファイリングして再構成するには、どのようなプロセスが関与しますか。
私たちのシステム最適化を、継続的なループとして考えてください。実行中、テレメトリ・システムは、メモリ・バンド幅、利用率、キューの深さなどの数百のパフォーマンス・インジケーターを測定します。すべてのデータは、ランタイム・オプティマイザーにフィードされ、現在のハードウェア構成がワークロードとその予測されるニーズにとって最適であるかどうかを判断します。そうでない場合、リソースを再パーティション化し、データ・パスを再オーダーし、計算パイプラインを調整できます。アプリケーションは停止しません。ミリ秒単位で発生するため、アプリケーションは、計算プロファイルが変化するにつれて、一貫したピークの効率を維持します。
特定のワークロードやエッジケースでは、適応型ランタイム・パフォーマンス・チューニングが効果的ではなかったり、待ち時間や電力消費量のトレードオフを生み出したりすることはありますか。
どのアーキテクチャもトレードオフがあります。Maverick-2は、複雑で不規則なワークロードに優れています。予測可能で固定関数のワークロードでは、適応のオーバーヘッドなしで、適切に調整されたGPUは非常に効率的です。そのような場合、適応性はまだ良好なパフォーマンスを提供しますが、相対的な利点は小さくなります。
NextSiliconの設計は、シンプルなケースでは多才で競争力があるが、課題的なケースでは変革的です。
あなたはHPC市場を優先することを決断した背景は何ですか。多くのスタートアップがAIに突進している中で、どのようにしてその戦略に至ったのですか。
HPCは、計算の複雑さと問題解決の最前線を表しています。大量のデータ、不規則なメモリ・アクセス、予測不可能な計算パターンです。如果そこでアーキテクチャを構築できるなら – たとえば、気候モデリングや粒子物理学でのエクサバイト・スケールのシミュレーションを実行する – それがAIでも優れています。
HPCに焦点を当てたことで、Maverick-2を最も厳しいワークロードで証明し、信頼性のあるパフォーマンス・データと成熟した製品を得ることができました。現在、AI市場にも進出できる準備が整っています。アーキテクチャを短期的なトレンドやニーズに合わせて妥協することなく、両方の市場でサービスを提供できるようになりました。
Maverick-2が本格的に生産され、数十の顧客に導入されている今、具体的な使用例や、注目すべき導入事例からの結果やベンチマークを共有できますか。
注目すべき例は、サンディア国立研究所での導入です。Maverick-2は、Vanguard-IIプログラムの一環として、Spectraスーパーコンピューターを動かしています。コードの変更なしで、出色なパフォーマンスの結果を確認しています。また、CERNのHigh-Luminosity Large Hadron ColliderとSquare Kilometre Array Observatoryからのエクサバイト・スケールのデータを処理するために、ODISSEE(Online Data Intensive Solutions for Science in the Exabytes Era)と協力しています。Maverick-2が果たす役割は、以前よりも短時間で、少ないエネルギーで、ペタバイトの生データを処理することです。最終的な目標は、物理分析と天文学の発見を迅速化することです。
300万ドル以上の資金を調達しました。2021年と最近にも大規模なラウンドが発表されました。資金調達が製品開発と市場への展開をどのように加速させたかについてお話しください。
資金調達により、3つのことを実現できました。まず、アーキテクチャをさらに押し進めることができました。インクリメンタルな改善ではなく、根本的な進歩が、Maverick-2を本格的な製品にしました。2つ目に、需要の増加に応えるために、製造とサプライ・チェーンを拡大しました。新しいシリコンの課題は、従来のハードウェア・スタートアップでは解決できないものでした。3つ目に、ソフトウェア・エコシステムを拡大して、顧客が統合して展開しやすくしました。
また、スーパーコンピューティング・センターやクラウド・プロバイダーとの戦略的パートナーシップを実現し、コンセプトから導入までのプロセスを効率化し、従来のハードウェア・スタートアップよりもはるかに速く拡大することができました。
Cerebras (CBRS ) 、SambaNova、Nvidia (NVDA ) が存在する市場で、NextSiliconはどのように自己を位置付けているのでしょうか。チャレンジャーとしてのあなたのマーケット・アプローチは何ですか。
NextSiliconを、単なるチップ・カンパニーではなく、テクノロジー・カンパニーとして見ています。私たちは、ワークロードを最適化し、適応性を提供し、顧客を独自のプログラミングやハードウェアにロックインしません。顧客は、長いポート移行サイクルやベンダーのエコシステムへのロックインなしに、既存のコードを持ち込み、即座に加速を実現できます。これは、AIワークロードが純粋なトレーニングを超えて進化するにつれて、特に重要になります。推論モデル、拡張された推論、長いコンテキスト・ウィンドウには、よりダイナミックなメモリ・アクセス、可変長の計算、適応的なリソース割り当てが必要です。これらは、固定アーキテクチャで解決できる問題ではありません。
私たちのマーケット・アプローチは、最も難しい問題を最初に解決することに焦点を当てています。研究機関、国立研究所、パフォーマンス、エネルギー効率、柔軟性が重要な企業と協力しています。そこから、AIやデータ・インテンシブな市場に拡大しています。業界は固定アーキテクチャで支配されています。私たちは、最初から適応性を構築したものを提供しています。AIは、純粋なスケールからインテリジェンスへの移行を遂げています。より大きなモデルは、短いプロンプトから長いコンテキストの理解まで、より賢い推論を可能にします。この移行において、適応可能なアーキテクチャは、革新的なものではなく、必須のものになります。素晴らしいインタビュー、詳しく知りたい読者は、NextSiliconを訪問してください。












