Интервью

Ави Баум, технический директор Hailo – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Ави Баум, технический директор Hailo, возглавляет технологическую стратегию и инновации компании. Ранее он занимал должность технического директора по беспроводной связи в Texas Instruments (TXN ), где разрабатывал стратегии для подключенных микроконтроллеров на рынках IoT и IIoT, и занимал руководящие должности в Израильских оборонных силах.

Hailo – израильская компания, специализирующаяся на высокопроизводительных, низкопотребляющих процессорах edge AI для приложений, таких как автономные транспортные средства, умные камеры и робототехника, поддерживаемых комплексным программным обеспечением и глобальной экосистемой партнеров.

Можете ли вы рассказать, что изначально привлекло вас к области edge AI и как ваши ранние инженерные опыт сформировали ваше мышление о проектировании процессоров?

Мой карьерный путь привел меня к областям новых рынков. Во время моего пребывания в TI (Texas Instruments), лидера полупроводниковой промышленности с давними традициями, у меня была возможность возглавлять системное проектирование и архитектуру, возглавляя отдел определения продукта и позже служа техническим директором этого отдела. Это привело меня к постоянному исследованию новых технологий, которые, вероятно, сформируют будущее.

Когда мы основали Hailo в 2017 году, было ясно, что ИИ, который начал процветать в облаке, также имел потенциал стать технологией, обеспечивающей работу устройств на краю сети. Итак, мы начали это путешествие.

Поскольку генеративный ИИ расширяется на краю, почему TOPS – тера операций в секунду – больше не является достаточной метрикой для оценки производительности процессора?

TOPS долгое время был основной метрикой для оценки аппаратного обеспечения ИИ, но в эпоху генеративного ИИ на краю он больше не достаточен. Природа классических моделей заключается в переводе больших объемов данных в осмысленные идеи, поэтому количество вычислений, необходимых для обработки входящих данных, растет с количеством данных, которые необходимо обработать. Модели для этих задач обычно меньше по размеру, чем количество данных, которые они обрабатывают, что делает накладные расходы, связанные с доступом к параметрам модели, относительно незначительными.

Генеративные модели, однако, заметно больше – в области миллиардов параметров, и в этих случаях пропускная способность памяти становится значимым фактором.

Вместо того, чтобы сосредотачиваться только на TOPS, важно оценить, как хорошо процессор балансирует вычисления и память в реальных условиях. Это не о том, чтобы гнаться за самым высоким числом; это о том, чтобы настроить архитектуру на задачи, которые она должна выполнять.

Почему пропускная способность памяти теперь становится более критическим ограничением, чем вычисления в задачах edge AI, особенно для LLM и VLM?

Для задач edge AI, особенно тех, которые включают LLM или VLM, пропускная способность памяти быстро становится основным ограничением. Эти модели обычно варьируются от 0,5 до 8 миллиардов параметров, превышая емкость памяти на кристалле и требуя доступа к внешней памяти, такой как DRAM. Это значительно увеличивает спрос на пропускную способность памяти. Например, модель с 1 миллиардом параметров может обеспечить до 40 токенов в секунду при оптимальных условиях с использованием стандартного интерфейса LPDDR4X, но поддержание этого темпа с моделью на 4 миллиарда параметров требует более чем в четыре раза большей пропускной способности. Без нее производительность снижается, не из-за ограниченных вычислений, а потому, что процессор не может обеспечить быструю подачу данных. Этот дисбаланс между вычислениями и памятью является одной из наиболее насущных проблем при развертывании генеративного ИИ на краю. Это еще больше усугубляется в архитектурах, которые вычисляют слой за слоем, где промежуточные результаты также увеличивают трафик памяти и еще больше напрягают пропускную способность.

Как команды продукта должны пересмотреть свою стратегию бенчмаркинга при проектировании для реальных приложений на краю?

Команды продукта должны отказаться от зависимости от одной метрики производительности, такой как TOPS, и вместо этого принять стратегию бенчмаркинга, отражающую реалии развертывания на краю. Это начинается с понимания конкретного случая использования, фактической рабочей нагрузки, которую процессор должен обработать, и определения “рабочей точки”: пересечения ограничений мощности, стоимости и задержки. Оттуда это вопрос оценки того, как вычисления и память взаимодействуют в этих условиях. Процессор с высокими TOPS не обеспечит производительность, если пропускная способность памяти ограничена, и больше памяти не поможет, если емкость вычислений недостаточна.

Команды должны оценить, может ли процессор поддерживать производительность при выполнении задач, таких как восприятие, улучшение и генеративные рабочие нагрузки, каждая из которых имеет очень разные требования. Цель не состоит в том, чтобы оптимизировать пиковые характеристики, а в том, чтобы обеспечить сбалансированную производительность во всем диапазоне ожидаемых случаев использования в реальных средах.

Это естественный сдвиг от “стерильных” мер к более сложным подходам, которые отражают, как платформы используются и как они оцениваются – подобно тому, что произошло с другими архитектурами, которые стали мейнстримом (например, SPEC, Coremark, 3DMark и т. д.).

Как ограничения мощности и стоимости влияют на архитектурные решения за процессорами Hailo, особенно для потребительских устройств на краю?

Мощность и стоимость являются двумя из наиболее определяющих ограничений при проектировании процессоров ИИ для устройств на краю, особенно в потребительских продуктах. В компактных устройствах, таких как датчики IoT или умные домашние помощники, бюджет мощности ограничен, и часто нет активного охлаждения, поэтому энергоэффективность становится критической. Каждый дополнительный ресурс вычислений или памяти добавляет потребление мощности и тепло, что непосредственно влияет на удобство использования и срок службы батареи.

Стоимость столь же влияет. Потребительские устройства должны оставаться в конкурентных ценовых точках, что означает, что процессор может включать только определенное количество TOPS и памяти, прежде чем он станет экономически нецелесообразным. Эти ограничения заставляют принимать трудные архитектурные компромиссы. В Hailo мы отдаем приоритет проектам, которые обеспечивают правильный баланс вычислений и памяти для удовлетворения реальных потребностей приложений в рамках жесткого ограничения мощности и стоимости, гарантируя, что ИИ на краю становится жизнеспособным, эффективным и масштабируемым во всем диапазоне потребительских продуктов.

Можете ли вы рассказать, как вы определяете “рабочую точку” для приложения и почему это так важно в развертывании edge AI?

Определение “рабочей точки” является одним из наиболее важных шагов при проектировании системы. Это относится к пересечению ограничений мощности, стоимости и задержки, которые формируют то, что реально достижимо в конкретном развертывании. В отличие от облака, где можно бросить больше вычислений или памяти на проблему, устройства на краю работают в рамках фиксированного ограничения. Это означает, что необходимо принимать намеренные компромиссы, основанные на фактических требованиях приложения. Например, датчик IoT может отдавать приоритет энергоэффективности над сырой производительностью, в то время как автономная система может требовать сверхнизкой задержки, независимо от потребления мощности. Как только рабочая точка установлена, можно оценить, имеет ли процессор правильный баланс вычислений и памяти для удовлетворения этой потребности. Это не о том, чтобы максимизировать характеристики в каждом направлении; это о том, чтобы обеспечить устойчивую, надежную производительность в реальных условиях, с которыми столкнется приложение.

Обычно говоря, рабочая точка – это место, где вы хотите, чтобы ключевые показатели производительности были наилучшими. Неудача в этом может привести к субоптимальной работе в наиболее типичных сценариях использования платформы.

Как простой пример, можно сделать систему аналитики ИИ чрезвычайно эффективной, когда входные данные находятся на очень высоком разрешении, но если это развертывается в системах, которые никогда не достигают этого разрешения, эта оптимизация бессмысленна.

Как вы подходите к оптимизации для многомодальных моделей, когда видео, аудио и язык часто объединяются в современных устройствах?

Многомодальные модели требуют вдумчивого баланса ресурсов вычислений и памяти. Каждая модальность оказывает давление на систему по-разному: видео является вычислительно интенсивным из-за высокого разрешения и частоты кадров, в то время как язык и аудио более компактны, но оказывают более сильное давление на пропускную способность памяти. В приложениях, таких как обработка языка и зрения, это разделение становится очевидным (хотя это не гарантия, а типичный сценарий): обработка видео толкает вычисления, в то время как языковая модель может быстро столкнуться с ограничениями памяти.

Мы подходим к оптимизации, анализируя, как эти рабочие нагрузки взаимодействуют на протяжении всего процесса, и гарантируя, что процессор спроектирован для поддержки их одновременно, не позволяя одной модальности компрометировать производительность другой.

Как увеличение размера модели на краю усложняет задержку и потребление мощности, и какая роль системной архитектуры играет в решении этой проблемы?

По мере увеличения размера модели на краю задержка и потребление мощности становятся более трудными для управления. Более крупные модели полагаются более сильно на внешнюю память, что увеличивает как энергопотребление, так и задержку, особенно когда пропускная способность памяти становится ограничением. Например, масштабирование с модели на 1 миллиард параметров до модели на 4 миллиарда параметров потребует более чем в четыре раза большей пропускной способности для поддержания одной и той же производительности – но на практике производительность не масштабируется линейно из-за ограничений пропускной способности и системной архитектуры.

Это не только о наличии высоких TOPS или большой памяти; это о том, как эти компоненты взаимодействуют. Сбалансированный дизайн гарантирует, что вычисления, память и пропускная способность работают вместе эффективно, предотвращая ограничение всей системы одним ресурсом.

Как Hailo проектирует для будущей защиты, учитывая, как быстро эволюционируют модели ИИ, рабочие нагрузки и требования к развертыванию?

Будущая защита в edge AI означает проектирование процессоров, которые могут справиться с широким спектром эволюционирующих рабочих нагрузок. В Hailo мы фокусируемся на сбалансированных архитектурах, которые не предназначены только для одной задачи, но могут поддерживать все, от перцептивных функций, таких как обнаружение объектов, до генеративных моделей, таких как VLM. Каждый тип рабочей нагрузки оказывает давление на вычисления и память по-разному, поэтому мы проектируем для гибкости, избегая ограничений при переключении между ними. Мы также учитываем реальные ограничения мощности, стоимости и задержки в приложениях. Отдавая приоритет разнообразию рабочих нагрузок и балансу ресурсов, мы стремимся поддержать следующее поколение развертываний edge AI в потребительских и промышленных случаях использования.

Однако один размер не может подойти всем, и наш портфель ориентирован на определенные приложения и пытается уместиться в доступном бюджете, например, мощности, форм-фактора, что определяет “рабочую точку”.

Какая роль экосистемы разработчиков играет в максимизации ценности процессора, и как вы гарантируете, что команды могут полностью использовать возможности Hailo?

Как программируемое устройство, важно иметь простые инструменты для разработчиков, чтобы использовать потенциал процессора, сократить путь к развертыванию и включить новые случаи использования. Предоставляя хорошо поддерживаемую среду вокруг наших процессоров, мы помогаем командам оживить приложения ИИ в широком диапазоне случаев использования.

Какой совет вы дадите инженерам или техническим директорам, выбирающим свой первый ускоритель ИИ для следующего поколения продукта, который строится сегодня?

С благоприятными условиями, я считаю, что существует много инновационного потенциала, позволяющего нам переводить воображение в реальные продукты. В быстро меняющейся среде выбор ускорителя, который позволяет быстро перейти от концепции к развертыванию, является критическим.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Hailo

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.