Модели и платформы ИИ
Spectro Cloud Запускает PaletteAI Inference Launchpad для Помощи Предприятиям Контролировать Затраты на AI Токены

Spectro Cloud запустила PaletteAI Inference Launchpad, платформу локального управления выводом, предназначенную для помощи предприятиям уменьшить зависимость от внешних сервисов моделей и получить больше контроля над растущими затратами на рабочие нагрузки искусственного интеллекта.
Компания заявляет, что организации могут уменьшить внешние затраты на токены до 70%, в зависимости от их смеси рабочих нагрузок, инфраструктуры и выбора моделей. Spectro Cloud также расширила поддержку PaletteAI для инфраструктуры на основе AMD, давая клиентам более широкий выбор графических процессоров (GPU), сред выполнения вывода и технологий обслуживания моделей.
Эти объявления отражают более широкий сдвиг в области корпоративного искусственного интеллекта. Когда компании переходят от экспериментов к развертыванию искусственного интеллекта в обслуживании клиентов, разработке программного обеспечения, аналитике и внутренних операциях, стоимость обработки входных и выходных данных моделей становится значительной проблемой инфраструктуры.
Привнесение Вывода AI Ближе к Данным Предприятия
PaletteAI Inference Launchpad построена вокруг локального подхода к выводу. Вместо того, чтобы автоматически отправлять каждый запрос на внешнюю модель, организации могут запускать подходящие рабочие нагрузки на инфраструктуре, расположенной в их собственных центрах данных, частных облаках, суверенных средах или на краю сети.
Предприятия все еще могут сохранить доступ к внешним моделям для задач, которые требуют их возможностей. Платформа предназначена для маршрутизации запросов между локальными и внешними моделями на основе таких факторов, как стоимость, производительность, требования управления и сложность задачи.
Эта гибридная модель может стать все более важной, когда организации принимают более мелкие и специализированные модели. Запрос на поддержку клиентов, задача классификации документов или внутренний запрос знаний может не требовать той же емкости модели, что и продвинутый рассуждение, сложное кодирование или многомодальное анализирование.
Сохранение подходящих рабочих нагрузок на местном уровне также может уменьшить задержку, переместив вывод ближе к приложениям, пользователям и источникам данных. Для организаций, работающих в регулируемых отраслях, локальная обработка может обеспечить больший контроль над тем, где обрабатывается конфиденциальная информация.
Использование Токенов Становится Метрикой Инфраструктуры
Токены – это единицы, на которые модели искусственного интеллекта делят и обрабатывают текст, код и другую информацию. Каждый запрос и сгенерированный ответ потребляет токены, и многие коммерческие сервисы моделей взимают плату в зависимости от количества обработанных токенов.
Это означает, что затраты на искусственный интеллект могут быстро расти, когда системы переходят от контролируемых испытаний к приложениям, обслуживающим тысячи сотрудников или клиентов. Проблема становится еще более сложной с агентами искусственного интеллекта, которые могут делать повторные вызовы моделей, получать информацию, оценивать результаты и использовать внешние инструменты, прежде чем завершить одну задачу.
Исследования Goldman Sachs предсказывают, что ежемесячное потребление токенов искусственного интеллекта увеличится в 24 раза между 2026 и 2030 годами, достигнув примерно 120 квадриллионов токенов в месяц. Этот прогнозируемый рост обусловлен расширением корпоративного внедрения и появлением более автономных агентов искусственного интеллекта.
Inference Launchpad решает эту проблему, предоставляя командам инфраструктуры инструменты для измерения потребления токенов, установления квот и применения политик использования. Эти контроли могут помочь компаниям понять, какие команды, приложения и модели отвечают за их расходы на искусственный интеллект, а не рассматривать вывод как непредсказуемый внешний сбор.
Указанное Spectro Cloud уменьшение на 70% должно рассматриваться как потенциальный результат, а не гарантированная экономия. Фактическая экономика будет зависеть от стоимости приобретения или аренды GPU, коэффициентов использования, энергопотребления, эффективности моделей, объема запросов и ценообразования внешних поставщиков.
Местные Модели Без Устранения Моделей Фронтира
Возможности маршрутизации моделей платформы предназначены для того, чтобы не заставлять предприятия принимать решение о всех локальных или всех облачных моделях.
Организации могут использовать более мелкие локальные модели для предсказуемых или конфиденциальных задач, а более требовательные запросы отправлять на модели фронтира. Политики также могут определять, какие модели разрешены для определенных отделов, юрисдикций или классификаций данных.
Это вводит управление直接 в слой вывода. Например, финансовое учреждение может предотвратить выход определенной информации из контролируемой среды, а также разрешить несensitive запросы использовать внешнюю модель. Многонациональная компания может применять разные правила маршрутизации на основе региональных требований к данным.
Spectro Cloud позиционирует выбор модели и управление как часть более широкой стратегии управления инфраструктурой PaletteAI. Платформа поддерживает общие среды GPU, ролевый доступ, квоты ресурсов и контроли уровня арендатора, предназначенные для того, чтобы позволить нескольким командам использовать одну и ту же инфраструктуру без получения неограниченного доступа к основным системам.
Расширенная Поддержка Инфраструктуры AI на Базе AMD
Вместе с Inference Launchpad Spectro Cloud объявила о более широкой поддержке сред AI на основе AMD.
Интеграция охватывает GPU AMD, оператор GPU AMD, программный стек ROCm и микросервисы вывода AMD, обычно известные как AIMs. Эти компоненты решают различные уровни инфраструктуры, необходимые для эксплуатации моделей AI в производстве.
Оператор GPU AMD упрощает конфигурацию и управление ускорителями AMD Instinct внутри кластеров Kubernetes. ROCm обеспечивает основной открытый программный стек, включая драйверы, библиотеки, среды выполнения и инструменты разработки, используемые для запуска рабочих нагрузок искусственного интеллекта и высокопроизводительных вычислений на оборудовании AMD.
AIMs обеспечивают стандартизированные микросервисы вывода для обслуживания моделей на GPU AMD Instinct. Они предназначены для упаковки оптимизированных моделей и поддерживающего программного обеспечения в развертываемые сервисы, уменьшая часть работы по интеграции, обычно необходимой для перемещения модели в производство.
Для корпоративных клиентов эта расширенная поддержка может сделать более простым эксплуатирование смешанных сред GPU вместо создания отдельных процессов управления для инфраструктуры NVIDIA (NVDA ) и AMD.
Управление Стеком От Аппаратуры До Моделей
Spectro Cloud изначально разработала Palette как платформу управления Kubernetes для развертывания и поддержания кластеров в общественных облаках, частных центрах данных, системах без металла и на краю сети.
PaletteAI расширяет эту основу в инфраструктуру AI. Она объединяет управление жизненным циклом Kubernetes с оркестровкой GPU, сервисами моделей, средствами безопасности, сетью и инструментами машинного обучения. Spectro Cloud описывает платформу как способ управления инфраструктурой от физического слоя аппаратуры до моделей и сервисов вывода, работающих на ее основе.
Платформа также включает PaletteAI Studio, которая обеспечивает предварительно интегрированную инфраструктуру и стеки AI, построенные из технологий, таких как Kubeflow, MLflow, ClearML, Run:ai и Hugging Face. Эти конфигурации предназначены для того, чтобы дать командам платформы повторяемые шаблоны развертывания вместо требования интегрировать каждый компонент вручную.
Inference Launchpad добавляет маршрутизацию токенов, измерение и локальное обслуживание моделей к этому более широкому слою инфраструктуры.
Поддержка Суверенных и Регулируемых Сред AI
Spectro Cloud также нацелена на neoclouds, поставщиков управляемых сервисов и операторов суверенных облаков. Эти поставщики часто нуждаются в предложении общей инфраструктуры GPU, сохраняя при этом изоляцию между клиентами и соблюдая юрисдикционные контроли.
Компания работает с NexusIgnite, поставщиком инфраструктуры, работающим из Остина и Дубая, для поддержки развертываний, связанных с резидентностью данных, соблюдением требований и оперативным суверенитетом.
Резидентность данных обычно касается того, где хранится информация. Суверенный AI вводит дополнительные вопросы о том, кто эксплуатирует инфраструктуру, какие юридические системы применяются, кто может получить к ней доступ и может ли среда быть проaudited или отключена от внешних сервисов.
Платформа Spectro Cloud поддерживает самообслуживаемые и воздушные развертывания, а также добавляет PaletteAI VerteX, средства безопасности, предназначенные для государственных и регулируемых сред.
Эти возможности могут быть особенно актуальны для правительств, организаций здравоохранения, финансовых учреждений и операторов критической инфраструктуры, которые не могут маршрутизировать каждый взаимодействие AI через общий публичный сервис.
Растущая Конкуренция Вокруг Корпоративных Операций AI
Запуск происходит вскоре после того, как Spectro Cloud объявила о раунде финансирования серии D в размере 100 миллионов долларов под руководством Growth Equity в Goldman Sachs Alternatives, с участием AMD Ventures, Ericsson, LG Technology Ventures и Maximus.
Компания заявила, что финансирование будет поддерживать ее расширение в области инфраструктуры AI для производства, суверенных облаков, сервисов neocloud и распределенного вывода. Spectro Cloud теперь привлекла примерно 260 миллионов долларов.
Ее стратегия отражает появляющийся слой рынка AI, ориентированный на эксплуатацию моделей, а не на разработку основополагающих моделей. Когда варианты моделей умножаются, предприятиям все больше нужна инфраструктура, которая может определить, где выполняются модели, как распределяются GPU, какие данные они могут получить доступ и как измеряется использование.
PaletteAI Inference Launchpad и расширенная интеграция AMD доступны сразу. Их долгосрочное значение будет зависеть от того, сможет ли локально управляемый вывод обеспечить постоянные экономические выгоды без воссоздания оперативной сложности, которую предприятия надеялись избежать, используя внешних поставщиков моделей.












