Моделі та платформи ШІ
Spectro Cloud запускає PaletteAI Inference Launchpad для допомоги підприємствам контролювати витрати на токени штучного інтелекту

Spectro Cloud запустив PaletteAI Inference Launchpad, платформу локального керування інференцією, розроблену для допомоги підприємствам зменшити залежність від зовнішніх сервісів моделей та отримати більший контроль над зростаючими витратами на штучний інтелект.
Компанія заявляє, що організації можуть зменшити зовнішні витрати на токени до 70%, залежно від їхнього поєднання робочих процесів, інфраструктури та вибору моделей. Spectro Cloud також розширив підтримку PaletteAI для інфраструктури на базі AMD, надаючи клієнтам більший вибір графічних процесорів (GPU), середовищ виконання інференції та технологій обслуговування моделей.
Ці оголошення відображають ширший зсув у сфері підприємства штучного інтелекту. Коли компанії переходять від експериментів до розгортання штучного інтелекту у сфері обслуговування клієнтів, розробки програмного забезпечення, аналітики та внутрішніх операцій, витрати на обробку входів та виходів моделей стають суттєвою інфраструктурною проблемою.
Приведення інференції штучного інтелекту ближче до даних підприємств
PaletteAI Inference Launchpad побудований навколо локального підходу до інференції. Замість автоматичної відправки кожного запиту до зовнішньої моделі, організації можуть виконувати відповідні робочі процеси на інфраструктурі, розташовані у власних центрах даних, приватних хмарах, суверенних середовищах або на краях мережі.
Підприємства все ще можуть зберігати доступ до зовнішніх моделей для завдань, які потребують їхніх можливостей. Платформа призначена для маршрутизації запитів між локальними та зовнішніми моделями на основі таких факторів, як витрати, продуктивність, вимоги до керування та складність завдання.
Ця гібридна модель може стати дедалі важливішою, оскільки організації приймають менші та спеціалізованіші моделі. Запит на підтримку клієнтів, завдання класифікації документів або внутрішнього знання може не потребувати тієї ж потужності моделі, що й складне мислення, складне кодування або багатомодальна аналітика.
Тримання відповідних робочих процесів локально також може зменшити затримку, рухаючи інференцію ближче до застосунків, користувачів та джерел даних. Для організацій, що працюють у регульованих галузях, локальна обробка може забезпечити більший контроль над тим, де обробляється конфіденційна інформація.
Витрати на токени стають інфраструктурним показником
Токени – це одиниці, на які штучні моделі ділять та обробляють текст, код та інші дані. Кожен запит та згенерований відповідь споживають токени, а багато комерційних сервісів моделей стягують плату згідно з кількістю оброблених токенів.
Це означає, що витрати на штучний інтелект можуть зростати швидко, коли системи переходять від контрольованих випробувань до застосунків, які обслуговують тисячу працівників або клієнтів. Проблема стає ще більш складною з агентами штучного інтелекту, які можуть робити повторні виклики моделей, отримувати інформацію, оцінювати результати та використовувати зовнішні інструменти перед завершенням одного завдання.
Goldman Sachs Research прогнозує, що щомісячне споживання токенів штучного інтелекту зросте у 24 рази між 2026 та 2030 роками, досягнувши приблизно 120 квадрильйонів токенів на місяць. Цей прогнозований рост спричинений зростаючою прийняттям штучного інтелекту підприємствами та появою більш автономних агентів штучного інтелекту.
Inference Launchpad вирішує цю проблему, надаючи інфраструктурним командам інструменти для вимірювання споживання токенів, встановлення квот та застосування політик використання. Ці засоби контролю можуть допомогти компаніям зрозуміти, які команди, застосунки та моделі відповідають за їхні витрати на штучний інтелект, а не вважати інференцію непередбачуваною зовнішньою платою.
Зазначене зменшення витрат на 70% повинно розглядатися як потенційний результат, а не гарантовану економію. Фактична економія буде залежати від витрат на придбання або оренду GPU, рівня використання, споживання енергії, ефективності моделі, обсягу запитів та ціни зовнішніх постачальників.
Локальні моделі без ліквідації моделей фронту
Можливості маршрутизації моделей платформи призначені для того, щоб уникнути примушення підприємств до прийняття рішення про повну локалізацію або повне використання хмари.
Організації можуть використовувати менші локальні моделі для передбачуваних або конфіденційних завдань, а також надсилати більш вимогливі запити до моделей фронту. Політики також можуть визначати, які моделі дозволені для певних департаментів, юрисдикцій або класифікацій даних.
Це вводить керування безпосередньо в шар інференції. Наприклад, фінансовий інститут міг би заборонити певній інформації залишати контрольоване середовище, а 同часно дозволяти несензитивним запитам використовувати зовнішню модель. Транснаціональна компанія могла б застосовувати різні правила маршрутизації на основі регіональних вимог до даних.
Spectro Cloud позиціонує вибір моделі та керування як частину більш широкої стратегії керування інфраструктурою PaletteAI. Платформа підтримує спільні середовища GPU, рольове керування доступом, квоти ресурсів та контроль на рівні орендарів, призначені для того, щоб дозволити кільком командам використовувати одну й ту ж інфраструктуру без отримання необмеженого доступу до основних систем.
Розширена підтримка інфраструктури штучного інтелекту AMD
Паралельно з Inference Launchpad Spectro Cloud оголосив про розширення підтримки інфраструктури штучного інтелекту на базі AMD.
Ця інтеграція охоплює GPU AMD, оператор GPU AMD, програмний стек ROCm та мікросервіси інференції AMD (AIMs), які відомі під назвою AIMs. Ці компоненти адресують різні шари інфраструктури, необхідної для експлуатації моделей штучного інтелекту у виробництві.
Оператор GPU AMD спрощує конфігурацію та керування прискорювачами AMD Instinct у кластерах Kubernetes. ROCm надає основний відкритий програмний стек, включаючи драйвери, бібліотеки, середовища виконання та інструменти розробки, використовувані для виконання завдань штучного інтелекту та високопродуктивного обчислювання на апаратному забезпеченні AMD.
AIMs забезпечують стандартизовані мікросервіси інференції для обслуговування моделей на GPU AMD Instinct. Вони призначені для пакування оптимізованих моделей та супутніх програм у розгортні служби, зменшуючи деяку інтеграційну роботу, зазвичай необхідну для переходу моделі у виробництво.
Для клієнтів підприємств це розширення підтримки може полегшити експлуатацію змішаних середовищ GPU замість побудови окремих процесів керування для інфраструктури NVIDIA (NVDA ) та AMD.
Керування стеком від апаратного забезпечення до моделей
Spectro Cloud спочатку розробив Palette як платформу керування Kubernetes для розгортання та підтримки кластерів у публічних хмарах, приватних центрах даних, голих металічних системах та на краях мережі.
PaletteAI розширює цю основу до інфраструктури штучного інтелекту. Він поєднує керування життєвим циклом Kubernetes з оркеструванням GPU, послугами моделей, засобами контролю безпеки, мережевими засобами та інструментами машинного навчання. Spectro Cloud описує платформу як засіб керування інфраструктурою від фізичного шару апаратного забезпечення до моделей та послуг інференції, що працюють на верхівці.
Платформа також включає PaletteAI Studio, який надає попередньо інтегровану інфраструктуру та стеки штучного інтелекту, побудовані з технологій, таких як Kubeflow, MLflow, ClearML, Run:ai та Hugging Face. Ці конфігурації призначені для надання командам платформи повторюваних шаблонів розгортання замість необхідності ручної інтеграції кожного компонента.
Inference Launchpad додає маршрутизацію токенів, вимірювання та локальне обслуговування моделей до цього ширшого шару інфраструктури.
Підтримка суверенних та регульованих середовищ штучного інтелекту
Spectro Cloud також націлений на neoclouds, постачальників керованих послуг та операторів суверенних хмар. Ці постачальники часто потребують надання спільної інфраструктури GPU, зберігаючи при цьому ізоляцію між клієнтами та дотримуючись юрисдикційних контролю.
Компанія працює з NexusIgnite, постачальником інфраструктури, який працює в Остіні та Дубаї, для підтримки розгортань, пов’язаних з резидентністю даних, відповідністю та операційним суверенітетом.
Резидентність даних зазвичай стосується місця зберігання інформації. Штучний інтелект суверенітету вводить додаткові питання про те, хто експлуатує інфраструктуру, які юридичні системи застосовуються, хто може отримати доступ до неї та чи може середовище бути аудитованим або відключеним від зовнішніх сервісів.
Платформа Spectro Cloud підтримує самохостовані та повітряні розгортання, а також PaletteAI VerteX додає засоби контролю безпеки, призначені для урядових та регульованих середовищ.
Ці можливості можуть бути особливо актуальними для урядів, організацій охорони здоров’я, фінансових інститутів та операторів критичної інфраструктури, які не можуть маршрутизувати кожну взаємодію штучного інтелекту через спільний публічний сервіс.
Ростуть конкуренція навколо операцій штучного інтелекту підприємств
Запуск відбувається незабаром після того, як Spectro Cloud оголосив про tròn $100 мільйонів серії D фінансування на чолі з Growth Equity у Goldman Sachs Alternatives, з участю AMD Ventures, Ericsson, LG Technology Ventures та Maximus.
Компанія заявила, що фінансування підтримає її розширення у сфері інфраструктури виробництва штучного інтелекту, суверенних хмар, послуг neocloud та розподіленої інференції. Spectro Cloud тепер зібрав приблизно $260 мільйонів.
Її стратегія відображає новий шар ринку штучного інтелекту, орієнтований на експлуатацію моделей, а не на розробку фундаментальних моделей. Коли варіанти моделей множаться, підприємства все частіше потребують інфраструктури, яка може визначити, де моделі працюють, як розподіляються GPU, які дані вони можуть отримувати, та як вимірюється використання.
PaletteAI Inference Launchpad та розширена інтеграція AMD доступні негайно. Їхня довгострокова значимість залежатиме від того, чи зможе локально керовану інференцію доставити стабільні економічні вигоди без відновлення операційної складності, яку підприємства сподівалися уникнути, використовуючи зовнішніх постачальників моделей.












