Лидеры мнений

Будущее генеративного ИИ – это Edge

mm
Добавьте Unite.AI в избранные источники в Google

Появление ChatGPT и генеративного ИИ в целом является поворотным моментом в истории технологий и сравнимо с зарей Интернета и смартфонов. Генеративный ИИ показал безграничный потенциал в своей способности вести интеллектуальные разговоры, сдавать экзамены, генерировать сложные программы/код и создавать привлекающие внимание изображения и видео. Хотя большинство моделей Gen AI запускаются на GPU в облаке – как для обучения, так и для вывода – это не является долгосрочным масштабируемым решением, особенно для вывода, из-за факторов, включая стоимость, мощность, задержку, конфиденциальность и безопасность. Эта статья рассматривает каждый из этих факторов, а также мотивирующие примеры для переноса рабочих нагрузок Gen AI на Edge.

Большинство приложений запускаются на высокопроизводительных процессорах – либо на устройстве (например, смартфонах, настольных компьютерах, ноутбуках), либо в центрах обработки данных. По мере расширения доли приложений, использующих ИИ, эти процессоры с только ЦПУ становятся недостаточными. Кроме того, быстрое расширение рабочих нагрузок генеративного ИИ стимулирует экспоненциальный спрос на серверы с поддержкой ИИ, оснащенные дорогими, энергозависимыми GPU, что, в свою очередь, увеличивает затраты на инфраструктуру. Эти серверы с поддержкой ИИ могут стоить в 7 раз дороже обычных серверов, а GPU составляют 80% от этой добавленной стоимости.

Кроме того, сервер в облаке потребляет 500 Вт до 2000 Вт, тогда как сервер с поддержкой ИИ потребляет от 2000 Вт до 8000 Вт – в 4 раза больше! Чтобы поддерживать эти серверы, центрам обработки данных необходимы дополнительные модули охлаждения и апгрейды инфраструктуры – которые могут быть даже выше, чем инвестиции в вычислительную технику. Центры обработки данных уже потребляют 300 ТВтч в год, почти 1% от общего мирового потребления электроэнергии. Если тенденции внедрения ИИ продолжатся, то к 2030 году центры обработки данных могут потреблять до 5% мирового потребления электроэнергии. Кроме того, наблюдается беспрецедентная инвестиция в центры обработки данных генеративного ИИ. Оценивается, что центры обработки данных будут потреблять до 500 миллиардов долларов на капитальные расходы к 2027 году, в основном стимулируемые требованиями инфраструктуры ИИ.

Потребление электроэнергии центрами обработки данных, уже 300 ТВтч, значительно увеличится с внедрением генеративного ИИ.

Стоимость вычислений ИИ, а также потребление энергии будут препятствовать массовому внедрению генеративного ИИ. Проблемы масштабирования можно преодолеть, переместив вычисления ИИ на Edge и используя решения для обработки, оптимизированные для рабочих нагрузок ИИ. С таким подходом клиент также получает другие преимущества, включая задержку, конфиденциальность, надежность, а также повышенную способность.

Вычисления следуют за данными на Edge

С тех пор, как decade назад ИИ вышел из академического мира, обучение и вывод моделей ИИ происходили в облаке/центре обработки данных. Поскольку большая часть данных генерируется и потребляется на Edge – особенно видео – имело смысл переместить вывод данных на Edge, тем самым улучшая общую стоимость владения (TCO) для предприятий за счет снижения сетевых и вычислительных затрат. Хотя затраты на вывод ИИ в облаке являются постоянными, стоимость вывода на Edge является единовременной, капитальной статьей расходов. По сути, дополнение системы процессором Edge AI снижает общие операционные затраты. Как и миграция традиционных рабочих нагрузок ИИ на Edge (например, бытовой прибор, устройство), рабочие нагрузки генеративного ИИ будут следовать этому же пути. Это принесет значительную экономию предприятиям и потребителям.

Переход на Edge в сочетании с эффективным ускорителем ИИ для выполнения функций вывода обеспечивает другие преимущества. Прежде всего, это задержка. Например, в игровых приложениях неигровые персонажи (NPC) можно контролировать и дополнить с помощью генеративного ИИ. Используя модели LLM, работающие на ускорителях Edge AI в игровой консоли или ПК, игроки могут давать этим персонажам конкретные цели, чтобы они могли осмысленно участвовать в истории. Низкая задержка от локального вывода на Edge позволит речи и движениям NPC реагировать на команды и действия игроков в режиме реального времени. Это обеспечит высоко иммерсивный игровой опыт в экономичной и энергосберегающей форме.

В таких приложениях, как здравоохранение, конфиденциальность и надежность являются крайне важными (например, оценка пациентов, рекомендации лекарств). Данные и связанные с ними модели Gen AI должны находиться на месте, чтобы защитить данные пациентов (конфиденциальность), и любые сбои в сети, которые заблокируют доступ к моделям ИИ в облаке, могут быть катастрофическими. Устройство Edge AI, запускающее модель Gen AI, созданную для каждого предприятия-клиента – в данном случае поставщика медицинских услуг – может без проблем решить проблемы конфиденциальности и надежности, обеспечивая при этом более низкую задержку и стоимость.

Генеративный ИИ на устройствах Edge обеспечит низкую задержку в играх и сохранит данные пациентов, а также повысит надежность для здравоохранения.

Многие модели Gen AI, запускаемые в облаке, могут быть близки к триллиону параметров – эти модели могут эффективно решать общие запросы. Однако для приложений, специфичных для предприятий, модели должны обеспечивать результаты, соответствующие случаю использования. Возьмем пример ассистента на основе Gen AI, созданного для приема заказов в ресторане быстрого питания – для того, чтобы эта система имела бесшовное взаимодействие с клиентом, основная модель Gen AI должна быть обучена на пунктах меню ресторана, а также знать аллергены и ингредиенты. Размер модели можно оптимизировать, используя супермножество большой языковой модели (LLM), чтобы обучить относительно небольшую модель LLM с 10-30 миллиардами параметров, а затем использовать дополнительную тонкую настройку с данными, специфичными для клиента. Такая модель может обеспечить результаты с повышенной точностью и способностью. И учитывая меньший размер модели, ее можно эффективно развернуть на ускорителе ИИ на Edge.

Gen AI выиграет на Edge

Всегда будет необходимость в Gen AI, запускаемом в облаке, особенно для общих приложений, таких как ChatGPT и Claude. Но когда речь идет о приложениях, специфичных для предприятий, таких как генеративная заливка Adobe Photoshop или Github Copilot, генеративный ИИ на Edge не только будущее, но и настоящее. Специально созданные ускорители ИИ являются ключом к тому, чтобы это стало возможным. особенно для общих приложений, таких как ChatGPT и Claude. Но когда речь идет об приложениях, специфичных для предприятий, таких как генеративная заливка Adobe Photoshop или Github Copilot, Генеративный ИИ на Edge не только будущее, но и настоящее. Purpose-built AI-ускорители являются ключом к тому, чтобы это стало возможным.

Как ветеран Silicon Valley и генеральный директор Kinara Inc, Ravi Annavajjhala имеет более 20 лет опыта, охватывающего разработку бизнеса, маркетинг и инженерию, создание передовых технологических продуктов и вывод их на рынок. В своей текущей роли генерального директора Deep Vision Ravi входит в состав его совета директоров и привлек $50M, переведя процессор Ara-1 компании из предсилikonового этапа в полномасштабное производство и наращивая выпуск 2-го поколения процессора, Ara-2, в больших объемах. До прихода в Deep Vision Ravi занимал руководящие должности в Intel и SanDisk, где он сыграл ключевую роль в стимулировании роста выручки, эволюции стратегических партнерств и разработке дорожных карт продуктов, которые лидировали в отрасли с передовыми функциями и возможностями.