Моделі та платформи ШІ

WEKA Запускає NeuralMesh 6 та WEKApod 3, коли Інфраструктура Штучного Інтелекту Переходить до Інференсу

mm
Додайте Unite.AI до бажаних джерел у Google

WEKA розпочала координовану програмну та апаратну модернізацію, спрямовану на одну з найбільш дорогостоячих проблем, що виникають в індустрії штучного інтелекту: підтримання продуктивності графічних процесорів під час переходу моделей з навчання до безперервної великомасштабної інференції.

Оголошення включають NeuralMesh 6, суттєве оновлення платформи даних та пам’яті компанії, поряд з третім поколінням апаратних засобів WEKApod, розроблених для хмар штучного інтелекту, розробників моделей, дослідницьких організацій та підприємств, що використовують інфраструктуру графічних процесорів.

Разом ці випуски відображають ширшу зміну в дизайні інфраструктури штучного інтелекту, коли зберігання даних перетворюється з пасивного сховища на активний шар пам’яті та доставки даних.

Єднальний поштовх до виробництва штучного інтелекту

Вимоги до інфраструктури інференції штучного інтелекту суттєво відрізняються від вимог до навчання моделей. Завдання навчання зазвичай обробляють великі набори даних через відносно передбачувані канали. Системи штучного інтелекту, що підтримують довготривалу історію, пошуково-розширені генеративні системи та системи довгої контекстної логіки повинні мати доступ до змінних даних, зберігають контекст під час повторних взаємодій та підтримують багатьох одночасних користувачів без простою дорогих графічних процесорів, що очікують на інформацію.

Відповідь WEKA полягає в тому, щоб розглядати зберігання даних, розширення пам’яті, доступ до файлів, доступ до об’єктів та переміщення даних як частини однієї платформи. NeuralMesh розроблена для надання спільної основи даних для навчання, інференції та високопродуктивного обчислення в середовищах локального розміщення, публічних хмар та гібридних розгортань.

Нове оновлення розширює цю архітектуру за рахунок багатокористувацької роботи, вбудованого зберігання об’єктів, розподіленого кешування, автоматичного зменшення даних, операцій Kubernetes та централізованого спостереження.

Натомість ніж позиціонувати програмне та апаратне оголошення як несуміжні оновлення, компанія представляє їх як дві частини однієї системи. NeuralMesh 6 контролює, як дані зберігаються, переміщуються, ізолюються та доставляються, тоді як WEKApod 3 забезпечує апаратне забезпечення, розроблене навколо цих функцій.

NeuralMesh 6 об’єднує файли та об’єкти

Одним з найбільш суттєвих доповнень у NeuralMesh 6 є вбудована реалізація S3, що працює на зберіганні NVMe. Ті самі базові блоки даних можуть бути доступні через протоколи об’єктного зберігання S3 та інтерфейси POSIX або Network File System без підтримання окремих копій.

Це має значення, оскільки трубопроводи штучного інтелекту часто переміщують інформацію між об’єктним зберіганням, високопродуктивними файловими системами, середовищами навчання та кластерами інференції. Кожна копія споживає місткість, вводить затримки та ускладнює управління. Єдина простір імен могла б дозволити даним, створеним за допомогою одного протоколу, стати негайно доступними через інший.

WEKA заявляє, що її реалізація підтримує від 2000 до 5000 одночасних з’єднань S3 на вузол. Вона також підтримує S3 через Remote Direct Memory Access, що дозволяє даним рухатися до пам’яті графічного процесора без проходження звичайного шляху через кілька шарів процесора та операційної системи.

Платформа вводить два рівні багатокористувацької роботи. Кластери, що складаються з окремих ресурсів процесора, пам’яті та зберігання, виділяються окремим користувачам, тоді як віртуальна багатокористувацька робота забезпечує мережеву ізоляцію, незалежне шифрування, окрему аутентифікацію та контроль якості обслуговування на користувача.

Віртуальні середовища можуть підтримувати понад 1000 ізольованих користувачів на кластер, згідно з заявою компанії. Об’єднання фізичної та віртуальної моделей могло б дозволити великому оператору інфраструктури підтримувати десятки тисяч логічно відокремлених клієнтів без розгортання окремого кластера зберігання для кожного з них.

Це особливо актуально для постачальників послуг графічних процесорів та суверенних хмар штучного інтелекту, яким потрібно балансувати високу використання інфраструктури з суворою ізоляцією клієнтів.

Переміщення даних до місця розташування графічних процесорів

NeuralMesh 6 також вводить реплікацію на основі метаданих та віддалене кешування для робочих навантажень штучного інтелекту, розподілених по центрах даних, хмарах та географічних регіонах.

Традиційна реплікація зазвичай вимагає копіювання всього набору даних перед початком робочого процесу. NeuralMesh робить метадані місця призначення негайно видимими, а потім передає базові дані, коли вони запитуються.

Це могло б дозволити операторам переміщувати завдання до доступної потужності графічних процесорів без попередньої реплікації кожного файлу, пов’язаного з проєктом. Цей підхід призначений для підтримки хмарного розгортання, розподіленої інфраструктури штучного інтелекту та співробітництва між географічно відокремленими дослідницькими чи інженерними командами.

Це також представляє перший крок до глобальної моделі простору імен, в якій дані можуть бути адресовані послідовно незалежно від місця їхнього первинного зберігання.

Інша нова функція застосовує відбитки, хешування подібності, дедуплікацію та стиснення безперервно, а не розглядає зменшення даних як необов’язковий фоновий процес.

WEKA стверджує, що NeuralMesh 6 може забезпечити до шестикратної економії місткості на даних навчання штучного інтелекту з менше 5% накладних витрат на запис. Фактичне зменшення буде залежати від набору даних. Точки збереження, шари контейнерів, версії моделей та ітеративні дані навчання можуть містити значну повторюваність, тоді як інші типи даних можуть стискатися менш ефективно.

Компанія планує проаналізувати представницькі дані клієнтів до розгортання та використовувати отриману оцінку як частину своїх зобов’язань щодо місткості та продуктивності.

Перетворення зберігання на розширений шар пам’яті штучного інтелекту

NeuralMesh також включає WEKA’s Augmented Memory Grid, який використовує зберігання NVMe як постійне розширення пам’яті графічного процесора для інференції.

Великі мовні моделі створюють кеш пар ключ-значення, що містить інформацію, розраховану з запиту або розмови. Для довгих контекстів та агентських робочих процесів цей кеш може стати дуже великим. Коли він не може залишатися в високопродуктивній пам’яті графічного процесора, системи можуть потребувати його видалення, перерахування або переміщення в повільнішу інфраструктуру.

Augmented Memory Grid зберігає цей кеш у постійному шарі, що підтримується NVMe, та використовує Remote Direct Memory Access та NVIDIA GPUDirect Storage для переміщення його назад до графічних процесорів.

Мета полягає в збереженні повторно використовуваного контексту при зменшенні повторюваного розрахунку попередньої обробки, одного з найбільш ресурсоємних етапів довгої інференції.

WEKA повідомляє, що тестування на Oracle Cloud Infrastructure з використанням графічних процесорів NVIDIA H100 дало у десять раз більшу пропускну здатність токенів, у десять раз більше одночасних користувачів та у сім разів більше токенів на графічний процесор.

Ці цифри є робочими процесами, а не універсальними очікуваннями продуктивності, але вони ілюструють, чому постійне керування кешем стає важливою частиною дизайну інфраструктури інференції.

WEKApod 3 контролює апаратний шар

Хоча попередні системи WEKApod поєднували програмне забезпечення WEKA з апаратним забезпеченням, попередньо перевіреним на сумісність, третє покоління рухається далі у напрямку вертикально інтегрованого дизайну системи.

WEKA розробила новий двовузловий шасі, інтерконект приводу, архітектуру охолодження, домени відмов та систему обслуговування. Пристрої використовують внутрішній PCI Express Gen 6 та мережеву підтримку NVIDIA (NVDA ) ConnectX для підключення до інфраструктури Ethernet Spectrum-X.

Сім’я WEKApod тепер складається з трьох конфігурованих систем. Nitro оптимізована для інференції з високою пропускною здатністю та робочих навантажень штучного інтелекту. Prime поєднує трійковий та чотирирівневий ячейковий флеш-накопичувач для балансування продуктивності та місткості. Prime Max пріоритезує максимальну щільність зберігання, вміщуючи до 70 накопичувачів NVMe у двовузлове шасі.

На повному рівні стелажа WEKA заявляє, що Prime Max може забезпечити 441,5 петабайт сирової місткості та 1,1 ексабайта ефективної місткості після зменшення даних NeuralMesh. Система рівня стелажа має рейтинг до 10,2 терабайт на секунду пропускної здатності та 210 мільйонів операцій введення/виведення на секунду.

Відмінність між сировою та ефективною місткістю важлива. Цифра ексабайта залежить від зменшення, досяжного по всьому збереженому набору даних, і не повинна тлумачитися як більш ніж ексабайт фізичної флеш-пам’яті.

Навіть так, більша щільність може мати суттєві наслідки в об’єктах, де зберігання даних конкурує з графічними процесорами за місце на стелажі, охолодження та електричну потужність.

Розроблено для обмежених центрів даних

Нові системи також вирішують фізичні обмеження, які все частіше формують проєкти інфраструктури штучного інтелекту.

Кластери графічних процесорів вимагають великої кількості електроенергії, охолодження, мережевого та підлогового простору. Системи зберігання даних, які споживають ці ресурси неефективно, можуть зменшити кількість прискорювачів, які може підтримувати об’єкт.

WEKA стверджує, що нові пристрої забезпечують на 267% більшу ефективну щільність місткості та на 114% більшу щільність продуктивності порівняно з наступними публічно доступними альтернативами в їхніх відповідних категоріях.

Компанія також розробила системи для роботи в умовах температури до 35 градусів Цельсія. Програмне керування потужністю призначене для поступового зниження продуктивності під час теплового стресу, а не для активації аварійного відключення.

Безблоковий дизайн приводу створює менші домени відмов, тоді як гарячозамінні запускові накопичувачі та процедури заміни, керовані інструкціями, призначені для зменшення часу обслуговування. Клієнти можуть конфігурувати тип шасі, пам’ять, місткість накопичувача та кількість накопичувачів, з розгортаннями від менше одного петабайта до понад 100 петабайт.

Будування екосистеми навколо фабрик штучного інтелекту

Супутні оголошення про партнерство свідчать про те, що платформа буде доступна клієнтам через інтеграторів інфраструктури, постачальників хмарних послуг та вендорів оркестрації штучного інтелекту.

Spectro Cloud позиціонує NeuralMesh як шар даних, який можна поєднати з PaletteAI для розгортання та експлуатації підприємств-фабрик штучного інтелекту. World Wide Technology та Computacenter планують включити системи до більш широких проєктів інфраструктури, тоді як Glocomp підкреслила попит клієнтів на краще виконання штучного інтелекту та більш передбачувані витрати на інфраструктуру.

Ця стратегія екосистеми важлива, оскільки більшість організацій не збирають середовища виробництва штучного інтелекту з одного постачальника.

Типове розгортання може включати графічні процесори, мережеву інфраструктуру, зберігання даних, Kubernetes, програмне забезпечення для подачі моделей, спостереження, безпеку та засоби управління з кількох постачальників. Валідовані спільно конфігурації можуть зменшити роботу з інтеграції, хоча клієнти все одно будуть потребувати тестування продуктивності за допомогою власних моделей, наборів даних, мереж та вимог до одночасності.

Що це означає для інфраструктури штучного інтелекту

Найважливішим аспектом оголошення є не окрема місткість чи пропускна здатність. Це зростаюча конвергенція зберігання даних, розподіленого кешування, керування пам’яттю, мобільності даних та ізоляції клієнтів.

Когда агенти штучного інтелекту зберігають довшу історію, отримують доступ до більшої кількості корпоративної інформації та працюють безперервно, інфраструктура, що оточує графічні процесори, все більше буде визначати вартість кожного корисного відповіді.

Додавання更多 прискорювачів не вирішить瓶чейн, спричинені повторною обробкою контексту, повільним переміщенням даних, фрагментованими протоколами чи не повністю використаною місткістю зберігання. Наступна фаза інфраструктури штучного інтелекту буде залежати так само сильно від ефективного живлення графічних процесорів, як і від збільшення сирової обчислювальної потужності.

NeuralMesh 6 планується стати загальнодоступним у другій половині 2026 року, а існуючі клієнти будуть мати право на оновлення через стандартний програмний канал. Нові системи WEKApod Nitro, Prime та Prime Max доступні для замовлення, а доставки очікуються у другій половині 2026 року.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.