인터뷰
헤일로의 Avi Baum, CTO – 인터뷰 시리즈

Avi Baum, 헤일로의 CTO는 회사의 기술 비전과 제품 혁신을 이끌고 있습니다. 그는 이전에 텍사스 인스트루먼츠의 무선 연결 부문의 CTO로 일하며 IoT 및 IIoT 시장의 연결된 MCU에 대한 전략을 주도했으며, 이스라엘 국방부에서 고위 아키텍처 및 리더십 역할을 수행했습니다.
(TXN )헤일로는 자율 주행 자동차, 스마트 카메라, 로봇공학 등의 응용 분야를 위한 고성능, 저전력 에지 AI 프로세서를 전문으로 하는 이스라엘의 AI 칩 회사입니다. 이를 지원하는 포괄적인 소프트웨어 스위트와 글로벌 파트너 생태계를 보유하고 있습니다.
에지 AI 분야에 처음 관심을 갖게 된 경위와 초기 엔지니어링 경험은 프로세서 설계에 대한 당신의 생각을 어떻게 형성했나요?
제 경력은 저를 새로운 시장 영역으로 이끌었습니다. 텍사스 인스트루먼츠에서 시스템 수준 설계와 아키텍처를 주도하고 제품 정의 부서를 이끈 뒤 해당 부서의 CTO를 맡았습니다. 이 경험을 통해 미래를 만들어갈 신기술을 끊임없이 탐색할 수 있었습니다.
2017년 헤일로를 설립했을 때, 클라우드에서 번창하기 시작한 AI가 에지 디바이스에서도 핵심 기술이 될 수 있을 것이라는 확신이 있었고, 이 여정에 착수했습니다.
에지에서 발생하는 생성형 AI의 확장으로 인해 TOPS(tera operations per second)가 프로세서 성능을 평가하는 데 더 이상 적합한 지표가 아니게 된 이유는 무엇인가요?
TOPS는 오랫동안 AI 하드웨어의 성능을 평가하는 데 사용되는 지표였습니다. 그러나 에지에서 생성형 AI가 확장됨에 따라 TOPS만으로는 더 이상 충분하지 않습니다. 클래식 모델은 많은 데이터를 의미 있는 정보로 변환하는 데 사용되므로, 처리할 데이터의 양이 증가함에 따라 필요한 컴퓨팅 능력도 증가합니다. 이러한 모델은 일반적으로 처리하는 데이터보다 크기가 작기 때문에 모델 매개변수에 접근하는 데 필요한 오버헤드 대역폭은 상대적으로 무시할 수 있습니다.
그러나 생성형 모델은 크기가 크기 때문에(수십억 매개변수 수준) 메모리 대역폭이 중요해집니다. TOPS만을 중점적으로 두지 말고, 프로세서가 실제 환경에서 컴퓨팅과 메모리를 어떻게 균형 있게 처리하는지 평가해야 합니다. 가장 높은 숫자를 추구하는 것이 아니라, 작업에 필요한 아키텍처를 조정하는 것이 중요합니다.
에지 AI 작업에서 메모리 대역폭이 컴퓨팅보다 더 중요한 병목 현상이 되는 이유는 무엇이며, 특히 LLM 및 VLM의 경우에는 어떨까요?
에지 AI 작업에서 메모리 대역폭은 컴퓨팅보다 더 중요한 병목 현상이 됩니다. 특히 LLM 및 VLM과 같은 모델은 수십억 매개변수로 구성되어 있기 때문에, 온칩 메모리의 용량을 초과하여 오프칩 메모리인 DRAM에 접근해야 합니다. 이는 메모리 대역폭에 대한 요구를 크게 증가시킵니다. 예를 들어, 1억 매개변수의 모델은 최적의 조건에서 LPDDR4X 인터페이스를 사용하여 약 40개의 토큰을 1초당 처리할 수 있지만, 4억 매개변수의 모델을 처리하려면 4배 이상의 대역폭이 필요합니다. 이를 충족하지 못하면 성능이 저하됩니다. 이는 컴퓨팅 능력의 제한이 아니라, 프로세서가 데이터를 충분히 빠르게 처리하지 못하기 때문입니다. 컴퓨팅과 메모리 간의 불균형은 에지에서 생성형 AI를 배포하는 데 가장 큰 과제 중 하나입니다.
실제 에지 응용 프로그램을 설계할 때 벤치마킹 전략을 어떻게 재고해야 하나요?
제품 팀은 단일 성능 지표인 TOPS에만 의존하지 말고, 에지 배포의 실제를 반영하는 벤치마킹 전략을 채택해야 합니다. 이는 사용 사례를 이해하고, 프로세서가 처리해야 하는 실제 작업을 식별하며, 전력, 비용, 지연 제약의 교차점인 “작업 점”을 찾는 것으로 시작합니다. 그다음에는 이러한 조건에서 컴퓨팅과 메모리가 어떻게 상호 작용하는지 평가하는 것입니다. 높은 TOPS를 가진 프로세서는 메모리 대역폭이 제한적이면 성능을 발휘하지 못하며, 충분한 컴퓨팅 능력이 없으면 더 많은 메모리가 도움이 되지 않습니다.
팀은 프로세스가 인식, 강화, 생성 작업과 같은 다양한 작업에서 지속적인 성능을 발휘할 수 있는지 평가해야 합니다. 목표는 최고의 사양을 최적화하는 것이 아니라, 실제 환경에서 예상되는 사용 사례 전체에 걸쳐 균형 잡힌 성능을 보장하는 것입니다.
이것은 다른 아키텍처에서 주류가 된 것과 마찬가지로, ‘sterile’한 측정에서 더 복잡한 접근 방식으로의 자연스러운 전환입니다.
에지 디바이스에서 전력 및 비용 제약은 헤일로 프로세서의 아키텍처 결정에 어떻게 영향을 미치나요?
에지 디바이스에서 전력 및 비용은 프로세서 설계의 두 가지 주요 제약입니다. 특히 소비자용 에지 디바이스의 경우, 전력 예산이 제한적이며, 일반적으로 활성 냉각이 없으므로 에너지 효율성이 중요합니다. 추가 컴퓨팅 또는 메모리 리소스는 전력 소모와 열을 증가시켜 사용성과 배터리 수명을 직접적으로 영향합니다.
비용도 동등하게 영향합니다. 소비자 디바이스는 경쟁력 있는 가격대를 유지해야 하므로, 프로세서에는 TOPS와 메모리가 포함될 수 있는 범위가 제한되어 있습니다. 이러한 제약은 어려운 아키텍처적 절충을 강요합니다. 헤일로는 실제 응용 프로그램 요구 사항을 충족하는 컴퓨팅과 메모리의 균형을 제공하는 설계를 우선시하여, 에지 AI가 소비자 제품 전반에서 비용 효율적이고 확장 가능하게 만듭니다.
어떻게 “작업 점”을 정의하며, 에지 AI 배포에서 이것이 왜 그렇게 중요할까요?
“작업 점”을 정의하는 것은 시스템 설계에서 가장 중요한 단계 중 하나입니다. 이는 전력, 비용, 지연 제약의 교차점을 의미하며, 특정 배포에서 실제로 달성할 수 있는 것을 결정합니다. 클라우드와 달리, 에지 디바이스는 고정된 환경에서 작동하므로, 응용 프로그램의 실제 요구 사항에 따라 의도적인 절충을 해야 합니다. 예를 들어, IoT 센서는 원활한 성능보다 에너지 효율성을 우선시할 수 있지만, 자율 시스템은 전력 소모와 상관없이 cực저지연을 요구할 수 있습니다. 작업 점을 정의하면, 프로세서가 실제 환경에서 지속적인 성능을 발휘할 수 있는지 평가할 수 있습니다.
일반적으로, 작업 점은 주요 성능 지표가 최적화된 지점입니다. 이를 하지 않으면, 플랫폼의 가장 일반적인 사용 사례에서 하위 최적의 작동이 발생할 수 있습니다.
예를 들어, 매우 높은 해상도에서 매우 효율적인 AI 분석 시스템을 만들 수 있지만, 시스템이 이 해상도에 도달하지 않는 경우, 이러한 최적화는 무의미합니다.
비디오, 오디오, 언어가 현대 디바이스에서 혼합되는 경우, 다중 모달 모델을 최적화하는 방법은 무엇인가요?
다중 모달 모델은 컴퓨팅과 메모리 리소스의 균형을 필요로 합니다. 각 모달리티는 시스템에 다른 스트레스를 가합니다. 비디오는 높은 해상도와 프레임 속도로 인해 컴퓨팅 집중적이며, 언어와 오디오는 더 긴밀하지만 메모리 대역폭에 더 많은 부담을 가합니다. 비전-언어 처리와 같은 응용 프로그램에서, 이러한 분리는 명확합니다. 비디오 처리는 컴퓨팅을 강조하며, 언어 모델은 메모리 병목 현상을 빠르게 발생시킬 수 있습니다.
우리는 이러한 워크로드가 파이프라인에서 어떻게 상호 작용하는지 살펴보고, 프로세서가 이를 동시에 지원하도록 설계하여, 한 모달리티가 다른 모달리티의 성능을 손상시키지 않도록 최적화를 진행합니다.
에지에서 모델 크기가 증가함에 따라 대기 시간과 전력 소모가 어떻게 복잡해지며, 시스템 수준 아키텍처는 이를 해결하는 데 어떤 역할을 하나요?
에지에서 모델 크기가 증가함에 따라 대기 시간과 전력 소모가 관리하기 더 어려워집니다. 더 큰 모델은 오프칩 메모리에 더 많이 의존하기 때문에, 메모리 대역폭이 병목 현상이 되며, 특히 시스템 수준에서 제약이 발생합니다. 예를 들어, 1억 매개변수 모델에서 4억 매개변수 모델로 확장하면, 동일한 성능을 유지하기 위해 4배 이상의 대역폭이 필요합니다. 그러나 실제로는 성능이 선형적으로 증가하지 않습니다.
컴퓨팅과 메모리만으로는 충분하지 않습니다. 컴퓨팅, 메모리, 대역폭이 효율적으로 협력하여 시스템 전체를 제한하지 않도록 하는 균형 잡힌 설계가 필요합니다.
헤일로는 어떻게 미래를 대비하여 설계하고 있으며, AI 모델, 워크로드, 배포 요구 사항이 어떻게 빠르게 진화하고 있나요?
에지 AI에서 미래를 대비하는 것은 다양한 워크로드를 처리할 수 있는 프로세서를 설계하는 것을 의미합니다. 헤일로는 단일 작업에만 최적화된 아키텍처가 아니라, 인식 기능부터 생성형 모델까지 모든 것을 지원할 수 있는 설계에 중점을 둡니다. 각 워크로드는 컴퓨팅과 메모리에 다른 스트레스를 가하므로, 우리는 유연성을 설계하여 이러한 워크로드 간의 전환에서 병목 현상을 피합니다. 또한, 실제 응용 프로그램에서 전력, 비용, 지연의 제약을 고려합니다. 워크로드 다양성과 리소스 균형을 우선시하여, 소비자 및 산업용 사례에서 에지 AI 배포의 다음 세대를 지원하는 것을 목표로 합니다.
그러나, 하나의 크기가 모든 것을 커버할 수는 없습니다. 포트폴리오에는 특정 주소 가능한 응용 프로그램이 있으며, 이는 예를 들어 전력, 형태 및 예산과 같은 제약을 고려하여 ‘작업 점’을 정의합니다.
개발자 생태계는 프로세서의 가치를 최대화하는 데 어떤 역할을 하나요? 헤일로는 어떻게 팀이 헤일로의 기능을 충분히 활용할 수 있도록 보장할 수 있나요?
프로그래밍 가능한 디바이스로, 개발자들이 프로세서의 잠재력을 쉽게 발휘하고, 배포를 단축하며, 새로운 사용 사례를 가능하게 하는 환경을 제공하는 것이 중요합니다. 헤일로의 프로세서를 둘러싼 잘 지원되는 환경을 제공하여, 팀이 다양한 사용 사례에서 AI 응용 프로그램을 구현할 수 있도록 도와줍니다.
첫 번째 AI 가속기를 선택할 때, 오늘날 구축되는 차세대 제품을 위한 조언은 무엇인가요?
ripe한 조건이 갖춰졌으며, 많은 혁신 가능성이 있으며, 상상을 실제 제품으로 번역할 수 있는 환경이 조성되어 있습니다. 빠르게 변화하는 환경에서, 빠른 개념-배포 주기를 가능하게 하는 가속기를 선택하는 것이 중요합니다.
감사합니다. 더 많은 정보를 원하는 독자는 헤일로를 방문하십시오.












