Модели и платформы ИИ

WEKA Запускает NeuralMesh 6 и WEKApod 3, Поскольку Инфраструктура ИИ Сдвигается в Направлении Инференции

mm
Добавьте Unite.AI в избранные источники в Google

WEKA представила скоординированный программный и аппаратный комплекс, направленный на одну из самых дорогих проблем, возникающих в индустрии ИИ: поддержание производительности GPU при переходе моделей из обучения в непрерывную, масштабную инференцию.

Объявления включают NeuralMesh 6, значительное обновление платформы данных и памяти компании, а также третье поколение приборов WEKApod, разработанных для облачных ИИ, разработчиков моделей, исследовательских организаций и предприятий, эксплуатирующих инфраструктуру GPU.

Вместе эти релизы отражают более широкий сдвиг в дизайне инфраструктуры ИИ, когда хранилище эволюционирует от пассивного репозитория в активный слой памяти и доставки данных.

Единый Пуш в Продакшн ИИ

Требования к инфраструктуре ИИ-инференции существенно отличаются от требований к обучению моделей. Задачи обучения обычно обрабатывают большие наборы данных через относительно предсказуемые конвейеры. Системы агентного ИИ, генерации с помощью извлечения и длинных контекстных рассуждений должны вместо этого получать доступ к меняющимся данным, сохранять контекст на протяжении повторяющихся взаимодействий и поддерживать множество одновременных пользователей без простоя дорогих GPU в ожидании информации.

Ответ WEKA заключается в том, чтобы рассматривать хранилище, расширение памяти, доступ к файлам, доступ к объектам и перемещение данных как части одной и той же платформы. NeuralMesh предназначен для предоставления общей основы данных для обучения, инференции и высокопроизводительных вычислений в средах на месте, публичных облаках и гибридных развертываниях.

Новый релиз расширяет эту архитектуру с помощью многопользовательской поддержки, родной объектной памяти, распределенного кэширования, автоматического сокращения данных, операций Kubernetes и централизованной наблюдаемости.

РATHER, чем позиционировать программные и аппаратные объявления как не связанные между собой обновления, компания представляет их как две части одной и той же системы. NeuralMesh 6 контролирует, как данные хранятся, перемещаются, изолируются и доставляются, а WEKApod 3 обеспечивает аппаратуру, разработанную вокруг этих функций.

NeuralMesh 6 Объединяет Файловые и Объектные Нагрузки

Одним из наиболее значимых дополнений в NeuralMesh 6 является родная реализация S3, работающая на хранилище NVMe. Одни и те же базовые блоки данных могут быть доступны через протоколы объектного хранилища S3 и интерфейсы POSIX или Network File System без поддержания отдельных копий.

Это важно, потому что конвейеры ИИ часто перемещают информацию между объектным хранилищем, высокопроизводительными файловыми системами, средами обучения и кластерами инференции. Каждая копия потребляет емкость, вводит задержки и усложняет управление. Единое пространство имен может позволить данным, созданным через один протокол, стать сразу доступными через другой.

WEKA заявляет, что ее реализация поддерживает от 2 000 до 5 000 одновременных подключений S3 на узел. Она также поддерживает S3 через Remote Direct Memory Access, позволяя данным перемещаться к памяти GPU без следования традиционному пути через несколько слоев CPU и операционной системы.

Платформа вводит два уровня многопользовательской поддержки. Кластеры, составленные из отдельных ресурсов, выделяют выделенные процессорные, память и хранилищные ресурсы для отдельных пользователей, а виртуальная многопользовательская поддержка обеспечивает сетевую изоляцию, независимое шифрование, отдельную аутентификацию и контроль качества обслуживания на уровне пользователя.

Виртуальные среды могут поддерживать более 1 000 изолированных пользователей на кластер, согласно компании. Объединение физической и виртуальной моделей может позволить крупному оператору инфраструктуры поддерживать десятки тысяч логически разделенных клиентов без развертывания отдельного кластера хранилища для каждого из них.

Это особенно актуально для поставщиков услуг GPU и суверенных облаков ИИ, которым необходимо сбалансировать высокую загрузку инфраструктуры с жесткой изоляцией клиентов.

Перемещение Данных в Места, Где Доступны GPU

NeuralMesh 6 также вводит репликацию на основе метаданных и удаленное кэширование для рабочих нагрузок ИИ, распределенных по данным центрам, облакам и географическим регионам.

Традиционная репликация обычно требует копирования всего набора данных перед началом рабочей нагрузки. NeuralMesh вместо этого делает метаданные назначения сразу видимыми, а затем передает базовые данные по мере их запроса.

Это может позволить операторам перемещать задачи в направлении доступной емкости GPU без предварительного копирования каждого файла, связанного с проектом. Этот подход предназначен для поддержки облачного взрыва, распределенной инфраструктуры ИИ и сотрудничества между географически разделенными исследовательскими или инженерными командами.

Он также представляет собой ранний шаг к глобальной модели пространства имен, в которой данные могут быть адресованы последовательно независимо от того, где они были первоначально хранятся.

Еще одна новая функция применяет отпечатки, хеширование сходства, дедупликацию и сжатие непрерывно, а не рассматривает сокращение данных как необязательный фоновый процесс.

WEKA утверждает, что NeuralMesh 6 может обеспечить до шестикратной экономии емкости на данных обучения ИИ при менее чем 5% накладных расходов на запись. Фактические сокращения будут зависеть от набора данных. Точки контроля, слои контейнеров, версии моделей и итеративные данные обучения могут содержать значительную повторяемость, а другие типы данных могут сжиматься менее эффективно.

Компания планирует проанализировать представительные данные клиентов перед развертыванием и использовать полученную оценку в качестве части своих обязательств по емкости и производительности.

Преобразование Хранилища в Расширенный Слой Памяти ИИ

NeuralMesh также включает WEKA’s Augmented Memory Grid, который использует хранилище NVMe в качестве постоянного расширения памяти GPU для инференции.

Большие языковые модели создают кэш ключ-значение, содержащий информацию, рассчитанную из подсказки или разговора. Для длинных контекстов и агентных рабочих процессов этот кэш может стать чрезвычайно большим. Когда он не может остаться в памяти GPU с высокой пропускной способностью, системы могут потребовать его удаления, повторного расчета или перемещения в более медкую инфраструктуру.

Augmented Memory Grid хранит этот кэш в постоянном слое, поддерживаемом NVMe, и использует Remote Direct Memory Access и NVIDIA GPUDirect Storage для его перемещения обратно в GPU.

Цель состоит в том, чтобы сохранить повторно используемый контекст, уменьшив повторяющиеся предварительные вычисления, один из наиболее ресурсоемких этапов длинного контекстного вывода.

WEKA сообщает, что тестирование на Oracle Cloud Infrastructure с использованием GPU NVIDIA H100 дало в десять раз более высокий пропуск токенов, в десять раз больше одновременных пользователей и в семь раз больше токенов на GPU.

Эти цифры являются рабочими нагрузками, специфичными для бенчмарков, а не универсальными ожиданиями производительности, но они иллюстрируют, почему постоянное управление кэшем становится важной частью дизайна инфраструктуры инференции.

WEKApod 3 Берет Контроль над Аппаратным Слоем

Хотя предыдущие системы WEKApod объединяли программное обеспечение WEKA с предварительно проверенной инфраструктурой, третье поколение переходит дальше в вертикально интегрированный дизайн системы.

WEKA разработала новый двухъюнитный шасси, интерфейс подключения дисков, архитектуру охлаждения, домены отказов и систему обслуживания. Приборы используют внутренний PCI Express Gen 6 и сетевое подключение NVIDIA (NVDA ) ConnectX для подключения к инфраструктуре Ethernet Spectrum-X.

Семейство WEKApod теперь состоит из трех настраиваемых систем. Nitro оптимизирован для рабочих нагрузок вывода и ИИ-фабрик, требующих высокой пропускной способности. Prime объединяет три уровня ячеек и четыре уровня ячеек флэш-памяти для балансировки производительности и емкости. Prime Max отдает приоритет максимальшей плотности хранилища, размещая до 70 дисков NVMe в двухъюнитном шасси.

На полном уровне стойки WEKA говорит, что Prime Max может обеспечить 441,5 петабайт сырой емкости и 1,1 эксабайт эффективной емкости после сокращения данных NeuralMesh. Система на уровне стойки имеет пропускную способность до 10,2 терабайт в секунду и 210 миллионов операций ввода/вывода в секунду.

Различие между сырой и эффективной емкостью важно. Цифра эксабайта зависит от сокращения, достижимого в хранимых данных, и не должна интерпретироваться как более эксабайта физической флэш-памяти.

Даже так, большая плотность может иметь значительные последствия в объектах, где хранилище конкурирует с GPU за место в стойке, охлаждение и электрическую мощность.

Разработано для Ограниченных Данных Центров

Новые системы также решают физические ограничения, все чаще формирующие проекты инфраструктуры ИИ.

Кластеры GPU требуют больших количеств электроэнергии, охлаждения, сетей и места на полу. Системы хранилища, которые потребляют эти ресурсы неэффективно, могут уменьшить количество ускорителей, которые объект может поддерживать.

WEKA утверждает, что новые приборы обеспечивают на 267% большую эффективную плотность емкости и на 114% большую плотность производительности, чем лучшие публично доступные альтернативы в их соответствующих категориях.

Компания также разработала системы для работы при температурах окружающей среды до 35 градусов Цельсия. Программное управление ограничением мощности предназначено для постепенного уменьшения производительности во время теплового стресса, а не для запуска отключения.

Конструкция без задней панели создает меньшие домены отказов, а горячая замена загрузочных дисков и руководство по замене процедур предназначены для уменьшения времени обслуживания. Клиенты могут настраивать тип шасси, память, емкость дисков и количество дисков, с развертываниями от менее одного петабайта до более 100 петабайт.

Строительство Экосистемы вокруг Фабрик ИИ

Сопровождающие объявления о партнерстве предполагают, что платформа будет доступна клиентам через интеграторов инфраструктуры, поставщиков облачных услуг и поставщиков оркестровки ИИ.

Spectro Cloud позиционирует NeuralMesh как слой данных, который может быть объединен с PaletteAI для развертывания и эксплуатации фабрик ИИ предприятий. World Wide Technology и Computacenter планируют включить системы в более широкие проекты инфраструктуры, а Glocomp подчеркнул спрос клиентов на лучшую производительность ИИ и более предсказуемые затраты на инфраструктуру.

Эта стратегия экосистемы значима, поскольку большинство организаций не собирают производственные среды ИИ из единого поставщика.

Типичное развертывание может включать GPU, сети, хранилище, Kubernetes, программное обеспечение для обслуживания моделей, наблюдаемость, безопасность и средства управления от нескольких поставщиков. Совместно проверенные конфигурации могут уменьшить работу по интеграции, хотя клиентам все равно придется проверять производительность, используя свои собственные модели, наборы данных, сети и требования к одновременности.

Что Это Значит для Инфраструктуры ИИ

Самым важным аспектом объявления не является какой-либо отдельный номер емкости или пропускной способности. Это растущая конвергенция хранилища, распределенного кэширования, управления памятью, мобильности данных и изоляции пользователей.

По мере того, как агенты ИИ сохраняют более длинные истории, получают доступ к большему количеству корпоративной информации и работают непрерывно, инфраструктура, окружающая GPU, все больше будет определять стоимость каждого полезного ответа.

Добавление большего количества ускорителей не решит проблемы, вызванные повторной обработкой контекста, медленным перемещением данных, фрагментированными протоколами или неиспользуемой емкостью хранилища. Следующая фаза инфраструктуры ИИ, таким образом, будет зависеть так же много от эффективного питания и управления GPU, как и от увеличения сырой вычислительной мощности.

NeuralMesh 6 запланирован для общей доступности во второй половине 2026 года, с существующими клиентами, имеющими право на обновление через стандартный программный канал. Новые системы WEKApod Nitro, Prime и Prime Max доступны для заказа, с ожидаемыми поставками, начиная с осени 2026 года.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.