インタビュー
ハイローCTOアヴィ・バウムとのインタビュー・シリーズ

アヴィ・バウム、ハイローのCTOは、会社のテクノロジー・ビジョンと製品イノベーションを牽引しています。彼は以前、テキサス・インスツルメンツのワイヤレス・コネクティビティのCTOを務め、IoTおよびIIoT市場の接続されたマイクロコントローラーの戦略を牽引し、イスラエル国防軍でシニア・アーキテクチャーおよびリーダーシップの役割を果たしました。
(TXN )ハイローは、自律車、スマート・カメラ、ロボティクスなどのアプリケーション向けの高性能、低消費電力のエッジAIプロセッサを専門とするイスラエル人AIチップ企業です。包括的なソフトウェア・スイートとグローバル・パートナー・エコシステムによってサポートされています。
エッジAIの分野に最初に惹かれたことと、早期のエンジニアリング経験がプロセッサ設計についての考え方をどのように形作ったかについて、教えてください。
私のキャリアパスは、エマージング・マーケットの分野に導いてくれました。TI(テキサス・インスツルメンツ)での勤務期间、半導体のリーダーであるTIでは、システムレベルの設計とアーキテクチャをリードし、製品定義部門の責任者を務め、後にCTOを務めました。この経験は、私に新興技術を継続的に探求する機会を与えました。
私たちが2017年にハイローを設立したとき、AIはクラウドで始まったものの、エッジ・デバイスにも有効な技術になる可能性があることが明らかでした。そこで、私たちはこの旅を始めました。
エッジでジェネレーティブAIが拡大するにつれて、TOPS(テラ・オペレーションズ・パー・セカンド)はプロセッサのパフォーマンスを評価するための十分なベンチマークではなくなった理由を教えてください。
TOPSは長年、AIハードウェアを評価するための主要なメトリックでしたが、エッジでのジェネレーティブAIの時代には、十分なメトリックではなくなりました。クラシック・モデルの性質は、多くのデータを有意義な洞察に翻訳することです。そこで、処理されるデータの量が増えるにつれて、処理するために必要なコンピューティング量も増えます。ただし、ジェネレーティブ・モデルは、典型的には10億パラメータ以上のドメインで動作し、メモリ・バンド幅が重要な要素になります。
TOPSのみに焦点を当てるのではなく、プロセッサがリアルワールドの条件下でコンピューティングとメモリをどのようにバランスさせているかを評価することが重要です。最も高い数字を追求することではなく、プロセッサのアーキテクチャを取り扱うワークロードに合わせて調整することが重要です。
エッジAIのワークロード、特にLLMやVLMの場合、メモリ・バンド幅がコンピューティングよりも重要なボトルネックになる理由を教えてください。
エッジAIのワークロード、特にLLMやVLMの場合、メモリ・バンド幅がボトルネックになりつつあります。これらのモデルは、通常、0.5〜8億のパラメータを持つため、オンチップ・メモリの容量を超え、オフチップ・メモリへのアクセスが必要になります。メモリ・バンド幅の需要が急増します。たとえば、1億パラメータのモデルは、最適な条件下で約40トークン/秒のレートで動作しますが、4億パラメータのモデルでは、4倍のバンド幅が必要になります。そうでない場合、パフォーマンスが低下します。コンピューティングの限界ではなく、プロセッサがデータを十分に処理できないためです。このコンピューティングとメモリの不均衡は、エッジAIでジェネレーティブAIを展開する上で最も重要な課題の1つです。
エッジのリアルワールド・アプリケーションを設計する際に、ベンチマーク戦略を再考する方法を教えてください。
製品チームは、単一のパフォーマンス・メトリックであるTOPSのみに頼るのではなく、エッジ展開の現実を反映したベンチマーク戦略に移行する必要があります。そのためには、特定のユースケースを理解し、プロセッサが取り扱う必要がある実際のワークロードを特定し、「ワーキング・ポイント」を特定する必要があります。ワーキング・ポイントとは、パワー、コスト、レイテンシーの制約が交差する点です。その後、コンピューティングとメモリがこれらの条件下でどのように相互作用するかを評価する必要があります。高TOPSを持つプロセッサは、メモリ・バンド幅が制限されている場合、パフォーマンスを発揮できません。コンピューティング能力が不足している場合、メモリを追加しても効果がありません。
チームは、プロセッサがパフォーマンスを維持できるかどうかを評価する必要があります。パフォーマンス、エンハンス、ジェネレーティブ・ワークロードなどのタスクは、システムに異なる要求を課します。目標は、ピーク・スペックを最適化することではなく、予想されるユースケースの全範囲でバランスの取れたパフォーマンスを確保することです。
これは、他のアーキテクチャが主流になったときに起こったことと同様の自然な移行です(たとえば、SPEC、Coremark、3DMarkなど)。
電力とコストの制約が、特に消費者向けエッジ・デバイスのハイロー・プロセッサのアーキテクチャ・デシジョンにどのように影響するかを教えてください。
電力とコストは、エッジ・デバイス用のAIプロセッサを設計する際に、特に消費者向け製品の場合、最も重要な2つの制約です。IoTセンサーまたはスマート・ホーム・アシスタントなどのコンパクトなデバイスでは、パワーの予算が厳しく、活性化された冷却がないため、エネルギー効率が重要になります。追加のコンピューティングまたはメモリ・リソースは、パワー消費と熱を直接増加させ、使いやすさとバッテリー・ライフに影響します。
コストも同様に影響力があります。消費者向けデバイスは、競合する価格帯内に留まる必要があります。つまり、プロセッサには、TOPSとメモリを追加することができますが、経済的に実行可能な範囲内でなければなりません。これらの制約により、厳しいアーキテクチャーのトレードオフが生じます。ハイローでは、リアルワールドのアプリケーションに必要なバランスをとったコンピューティングとメモリを提供する設計を優先し、エッジAIが実行可能、効率的、かつスケーラブルになるようにします。
アプリケーションの「ワーキング・ポイント」を定義する方法を教えてください。また、これがエッジAIの展開において重要となる理由を教えてください。
「ワーキング・ポイント」の定義は、システムを設計する際に最も重要なステップの1つです。ワーキング・ポイントとは、パワー、コスト、レイテンシーの制約が交差する点であり、特定の展開で実現可能なものを形作ります。クラウドとは異なり、エッジ・デバイスは固定のエンベロープ内で動作するため、実際のアプリケーションの要件に基づいて慎重なトレードオフを行う必要があります。たとえば、IoTセンサーは、生産性よりもエネルギー効率を優先するかもしれませんが、自律システムは、パワー消費に関係なく、超低レイテンシを要求する可能性があります。ワーキング・ポイントが確立されると、プロセッサが必要なニーズを満たすために必要なコンピューティングとメモリのバランスを評価できます。これは、すべての方向でスペックを最大化することではなく、リアルワールドの条件で安定したパフォーマンスを確保することです。
一般に言えば、ワーキング・ポイントは、重要なパフォーマンス・インジケーターが最適化されている場所です。そうでない場合、最も典型的な使用シナリオでサブオプティマルな動作になる可能性があります。
たとえば、AI分析システムを非常に高解像度の入力で非常に効率的にすることができますが、システムがこの解像度に達することはない場合、この最適化は無意味です。
ビデオ、オーディオ、言語が現代のデバイスでよく組み合わされる場合、多モーダル・モデルを最適化する方法を教えてください。
多モーダル・モデルでは、コンピューティングとメモリ・リソースのバランスが必要です。各モダリティはシステムに異なるストレスを与えます。ビデオは、高解像度とフレーム・レートのため、コンピューティング・インテンシブですが、言語とオーディオはよりコンパクトですが、メモリ・バンド幅に大きな負担を課します。ビジョン・言語・プロセッシングなどのアプリケーションでは、この分離が明らかです(これは保証ではありませんが、典型的なシナリオです)。ビデオ・プロセッシングはコンピューティングを推進しますが、言語・モデルはすぐにメモリのボトルネックに達します。
ワークロードがパイプライン全体でどのように相互作用するかを考慮し、プロセッサがこれらを同時にサポートできるようにアーキテクチャを設計することで、最適化に取り組んでいます。
エッジでのモデル・サイズの増加が、待ち時間と電力消費をどのように複雑にし、システム・レベルのアーキテクチャがこれを解決する役割を教えてください。
エッジでのモデル・サイズの増加により、待ち時間と電力消費が管理しづらしくなります。より大きなモデルは、オフチップ・メモリに大きく依存し、メモリ・バンド幅がボトルネックになるにつれて、エネルギー使用量と遅延が増加します。たとえば、1億パラメータから4億パラメータへのスケーリングでは、同じパフォーマンスを維持するために4倍のバンド幅が必要になりますが、実際のパフォーマンスは、バンド幅とシステム・レベルの制約により線形にスケールしません。
これは、コンピューティングとメモリがどのように相互作用するかということです。高TOPSまたは大きなメモリを持つだけでは不十分です。コンピューティング、メモリ、バンド幅が効率的に協調して動作するバランスの取れた設計が必要です。
ハイローは、AIモデル、ワークロード、展開要件が急速に進化していることを考慮して、将来の展開に対してどのように設計していますか。
エッジAIの将来の展開に対して、さまざまな進化するワークロードを処理できるプロセッサを設計する必要があります。ハイローでは、特定のタスクのみに最適化されたアーキテクチャではなく、パフォーマンス、エンハンス、ジェネレーティブ・モデルなど、さまざまなワークロードをサポートできるバランスの取れたアーキテクチャを設計しています。また、リアルワールドのアプリケーションで発生する実際のパワー、コスト、レイテンシーの制約も考慮します。ワークロードの多様性とリソースのバランスを優先することで、次世代のエッジAI展開をサポートすることを目指しています。
ただし、1つのサイズがすべてに適合するわけではありません。ポートフォリオは、特定のアドレッサブル・アプリケーションを対象とし、たとえばパワー、フォーム・ファクタなどの利用可能な予算内に収まるようにします。これが「ワーキング・ポイント」を定義します。
開発者・エコシステムがプロセッサの価値を最大化する上でどのような役割を果たすかを教えてください。また、開発者がハイローの機能を最大限に活用できるようにするためにどのようにしているかを教えてください。
プログラム可能なデバイスとして、開発者がプロセッサの潜在能力を発揮しやすいツールを提供することが重要です。プロセッサの周りの環境を十分にサポートすることで、チームがAIアプリケーションをさまざまなユースケースで実現できるようになります。
エンジニアやCTOが、今日構築されている次世代製品の最初のAIアクセラレータを選択する際に、どのようなアドバイスを提供しますか。
成熟した条件が整っています。私は、多くのイノベーションの可能性があると考えています。これにより、私たちは想像力を実際の製品に変えることができます。急速に変化する環境では、コンセプトから展開までのサイクルを迅速化できるアクセラレータを選択することが重要です。
素晴らしいインタビュー、詳細についてはハイローを訪問してください。












