Лидеры мнений

Почему следующая фаза инфраструктуры ИИ требует больше, чем гипермасштабные дата-центры

mm
Добавьте Unite.AI в избранные источники в Google

Искусственный интеллект входит в период, когда стратегия инфраструктуры становится неотделимой от возможностей модели. В течение многих лет гипермасштабные дата-центры обеспечивали рост крупномасштабной тренировки, позволяя передовым моделям вырасти от миллионов до триллионов параметров. Но по мере ускорения внедрения ИИ в предприятия, отрасли и реальные системы инференция заменяет тренировку в качестве доминирующей рабочей нагрузки, и инференция имеет фундаментально разные требования.

Следующая эра ИИ не может быть поддержана только гипермасштабными объектами. Вместо этого появляется гибридная модель, в которой централизованные кампусы для тренировки дополняются распределенными, ориентированными на мощность, коммерческими дата-центрами для инференции. Этот сдвиг обусловлен ограничениями задержки, потребностями суверенитета данных, энергетическими реалиями и физическими пределами дальнейшего гипермасштабного расширения.

Расхождение тренировки и инференции

Тренировка остается централизованной деятельностью. Она требует огромных кластеров, высокоскоростных трубопроводов данных и длительных задач, которые выигрывают от экономии масштаба. Гипермасштабные кампусы оптимизированы для этого с плотным вычислением, специализированными сетевыми тканями и глобальной доступностью. Но инференция ведет себя по-другому. Она имеет короткую продолжительность, высокий объем, чувствительна к задержке и часто связана с географией или границами предприятия. Анализы из недавней работы Akamai по агентным системам показывают, что большинство организаций теперь нацеливаются на конечную задержку менее 500 миллисекунд для критических случаев использования ИИ, и многоагентные рабочие процессы часто превышают этот порог просто из-за сетевой передачи и выполнения на стороне ЦП.

Задержка не является абстрактной метрикой. В робототехнике и автономных системах контрольные циклы часто работают на 100-1000 герц каждые 1-10 миллисекунд. Любая внешняя интеллект должна уважать эти временные ограничения. 50-миллисекундный круговой путь к удаленному дата-центру полностью нарушает режим управления. В финансовой торговле и обнаружении мошенничества миллисекунды определяют экономические результаты. В промышленной автоматизации задержанная инференция может дестабилизировать процессы или поставить под угрозу безопасность. И в интерактивных опытах, таких как игры, AR/VR и реальные ко-пилоты, отзывчивость резко ухудшается выше 100-150 миллисекунд.

Современные системы ИИ все чаще полагаются на многоагентные рабочие процессы, состоящие из цепочек десятков последовательных вызовов. Анализ Akamai показывает, что выполнение на стороне ЦП может составлять большинство общей задержки, и каждый сетевой круговой путь добавляет дополнительную задержку. Рабочий процесс с 50 последовательными вызовами может понести секунды транспортной задержки, когда он маршрутизируется в удаленный гипермасштабный регион. Поместите тот же рабочий процесс в гиперлокальный дата-центр, расположенный на том же кампусе или в метро-районе, и физика меняется. Местная инференция может обеспечить круговую задержку 1-5 миллисекунд. 50-шаговый рабочий процесс, который занял бы секунды в удаленном регионе, может завершиться за 50-250 миллисекунд локально, оставаясь в пределах бюджета задержки предприятия.

Суверенитет данных и реалии сетки, стимулирующие локальные развертывания

Задержка является только частью истории. Для регулируемых отраслей, таких как здравоохранение, финансы и государственный сектор, суверенитет данных часто является основным стимулом для локальной инференции. Запуск рабочих нагрузок ИИ за брандмауэром предприятия сохраняет существующие периметры безопасности, снижает многопользовательское воздействие, упрощает соблюдение требований и сохраняет конфиденциальные данные вне общей облачной инфраструктуры. Гипермасштабные провайдеры предлагают сильную безопасность, но поверхность атаки и цепочка доверия по своей сути более широки. Предприятия все чаще предпочитают архитектуры инференции, которые соответствуют их существующему положению в области безопасности.

Помимо проблем с задержкой и безопасностью, доступность мощности становится все более важным ограничением. Большие гипермасштабные кампусы часто сталкиваются с многолетними задержками из-за ограничений передачи и очередей интерконнекта. Меньшие коммерческие дата-центры, особенно те, которые расположены недалеко от существующих нагрузок или распределенной генерации, часто могут быть энергизированы намного быстрее. Это имеет значение, потому что спрос на ИИ сталкивается с странной парадоксом.

В то время как операторы борются за получение новых сетевых подключений, огромные количества возобновляемой энергии отменяются. Глобально, отмена возобновляемой энергии теперь превышает 200 тераватт-часов в год. В Соединенных Штатах отмена оценивается примерно в 20 тераватт-часов в год. ERCOT alone отменил более 9 тераватт-часов ветровой и солнечной генерации в недавнем году. Тем временем CAISO отменил 3,4 тераватт-часа солнечной и ветровой энергии в 2024 году, при этом солнечная энергия составила 93% всех обрезанных выходов. Обследования энергетических систем последовательно показывают, что как солнечная, так и ветровая энергия сталкиваются с существенной отменой, когда генерация превышает сетевую емкость. Отмена солнечной энергии особенно распространена в регионах с сильными пиками в середине дня, в то время как отмена ветровой энергии часто происходит во время нерабочих часов или в ограниченных коридорах. Распределенные дата-центры, расположенные недалеко от генерации, особенно в регионах, богатых солнечной энергией, могут преобразовать застрявшую энергию в полезную емкость инференции.

Гипермасштабные кампусы останутся необходимыми для тренировки, но они сталкиваются с растущими физическими и экономическими пределами. Подключение к сетевой сети может быть длительным процессом, требующим новых подстанций, апгрейдов передачи, многоагентского разрешения и общественного обзора. Это процессы, которые обычно занимают годы. Гипермасштабные объекты требуют больших площадей, значительных водных выделений и сложных экологических разрешений. Сообщества все чаще сопротивляются новым разработкам дата-центров из-за шума, использования воды и воздействия на землю. И централизованные кампусы концентрируют риск таким образом, что погодные события, сетевые отключения или геополитические сбои могут повлиять на большие части глобальной вычислительной мощности. Распределенные архитектуры обеспечивают географическое резервирование и операционную устойчивость.

Будущее – это многоуровневая архитектура ИИ

Когда речь идет об обеспечении бесперебойной работы вычислений инференции, эффективность может стать такой же важной, как и сырые возможности. Инференция потребляет энергию непрерывно, и аналитики отрасли предполагают, что инференция может в конечном итоге представлять большинство потребления энергии, связанной с ИИ. Приросты эффективности от локальной интеграции возобновляемой энергии, снижения потерь передачи, правильно подобранных развертываний, улучшенных термических профилей и более высоких показателей использования будут иметь решающее значение для удовлетворения глобального спроса на ИИ устойчивым образом. Распределенные коммерческие дата-центры хорошо подходят для обеспечения этих приростов, поскольку они могут быть размещены там, где энергия изобилует, недорога или недоиспользуется.

Следующая фаза инфраструктуры ИИ будет гибридной смесью гипермасштабных кампусов, доминирующих в тренировке, распределенных коммерческих дата-центров, обслуживающих инференцию, и устройств edge, обслуживающих сверхлокальные рабочие нагрузки. Эта многоуровневая архитектура отражает физические реалии мощности, задержки, безопасности и масштаба. По мере того, как ИИ становится встроенным в реальные системы во всех отраслях, инфраструктура должна развиваться соответственно, чтобы приблизить инференцию к миру, который она обслуживает.

Джефф Траманн, доктор медицины, - изобретатель и серийный предприниматель, указанный в более чем 130 патентах, основавший и вышедший из шести компаний. Как основатель и генеральный директор LT350, он является врачом-предпринимателем и стратегом инфраструктуры ИИ, специализирующимся на распределенных вычислительных архитектурах и проектировании следующего поколения центров обработки данных, которые используют существующую инфраструктуру для минимизации воздействия на центры обработки данных.