AI 模型与平台
Spectro Cloud 推出 PaletteAI 推理启动板,以帮助企业控制 AI 代币成本

Spectro Cloud 已推出 PaletteAI 推理启动板,这是一款本地管理的推理平台,旨在帮助企业减少对外部模型服务的依赖,并对人工智能工作负载的日益增长的成本有更多的控制权。
该公司表示,组织可以通过使用本地推理启动板将外部代币成本降低多达 70%,这取决于他们的工作负载混合、基础设施和模型选择。Spectro Cloud 还扩大了 PaletteAI 对 AMD 基础设施的支持,给客户提供了更广泛的图形处理单元(GPU)、推理运行时和模型服务技术选择。
这些公告反映了企业人工智能领域更广泛的转变。随着公司超越实验阶段并在客户服务、软件开发、分析和内部运营中部署人工智能,处理模型输入和输出的成本成为了一项重要的基础设施问题。
将 AI 推理带到企业数据更近
PaletteAI 推理启动板围绕本地优先的推理方法构建。组织不再需要自动将每个请求发送到外部托管的前沿模型,而可以在自己的数据中心、专有云、私有环境或边缘位置的基础设施上运行合适的工作负载。
企业仍然可以保留对外部托管前沿模型的访问权限,以执行需要这些模型能力的任务。该平台旨在根据成本、性能、治理要求和任务复杂性等因素在本地和外部模型之间路由请求。
这种混合模型可能会变得越来越重要,因为组织采用更小、更专业的模型。客户支持请求、文档分类任务或内部知识查询可能不需要与高级推理、复杂编码或多模态分析相同的模型容量。
将适当的工作负载保留在本地也可能通过将推理更接近应用程序、用户和数据源来减少延迟。对于在受监管行业运营的组织,本地处理可以提供对敏感信息处理位置的更大控制权。
代币使用成为基础设施指标
代币是人工智能模型将文本、代码和其他信息划分和处理的单位。每个提示和生成的响应都会消耗代币,许多商业模型服务根据处理的代币数量收费。
这意味着人工智能成本会随着系统从受控试验转向为数千名员工或客户提供服务而迅速增加。随着人工智能代理的出现,这个问题变得更加复杂,因为这些代理可能会重复调用模型、检索信息、评估结果并使用外部工具,然后才能完成一个任务。
高盛研究预计,2026 年至 2030 年间,每月人工智能代币消耗量将增加 24 倍,达到约每月 120 千万亿个代币。这种预测增长是由企业采用率的增加和更自治的人工智能代理的出现所驱动的。
推理启动板通过为基础设施团队提供工具来测量代币消耗、建立配额和应用使用策略来解决这个问题。这些控制可以帮助公司了解哪些团队、应用程序和模型负责他们的人工智能支出,而不是将推理视为不可预测的外部服务费用。
Spectro Cloud 引用的 70% 减少应该被视为潜在结果,而不是保证的节省。实际经济效益将取决于 GPU 采购或租赁成本、使用率、能耗、模型效率、请求量和外部提供商的定价。
本地模型而不消除前沿模型
该平台的模型路由功能旨在避免迫使企业做出全部本地或全部云端的决定。
组织可以使用较小的本地模型来处理可预测或敏感任务,同时将更苛刻的请求发送到前沿模型。策略还可以确定哪些模型对特定部门、管辖区或数据分类是允许的。
这将治理直接引入推理层。例如,金融机构可以防止某些信息离开受控环境,同时允许非敏感请求使用外部模型。跨国公司可以根据区域数据要求应用不同的路由规则。
Spectro Cloud 将模型选择和治理定位为 PaletteAI 更广泛的基础设施管理策略的一部分。该平台支持共享 GPU 环境、基于角色的访问、资源配额和租户级控制,旨在允许多个团队使用相同的基础设施而无需对底层系统进行无限制访问。
扩大对 AMD AI 基础设施的支持
与推理启动板一起,Spectro Cloud 宣布了对 AMD 驱动的 AI 环境的更广泛支持。
该集成涵盖了 AMD GPU、AMD GPU 操作员、ROCm 软件栈和 AMD 推理微服务(AIMs),这些组件解决了人工智能模型在生产环境中运行所需的不同基础设施层。
AMD GPU 操作员简化了在 Kubernetes 集群中 AMD Instinct 加速器的配置和管理。ROCm 提供了底层开源软件栈,包括驱动程序、库、运行时和开发工具,用于在 AMD 硬件上运行人工智能和高性能计算工作负载。
AIMs 提供了针对 AMD Instinct GPU 的标准化推理微服务,旨在将优化的模型和支持软件打包成可部署的服务,减少将模型移至生产环境所需的部分集成工作。
对于企业客户,这种扩大的支持可能使得在 AMD 和 NVIDIA (NVDA ) 基础设施上运行混合 GPU 环境变得更加容易,而不是为每个基础设施构建单独的管理流程。
从硬件到模型管理堆栈
Spectro Cloud最初将 Palette 开发为一个 Kubernetes 管理平台,用于在公有云、私有数据中心、裸机系统和边缘位置上部署和维护集群。
PaletteAI 扩展了这一基础,进入人工智能基础设施领域。它将 Kubernetes 生命周期管理与 GPU 编排、模型服务、安全控制、网络和机器学习操作工具相结合。Spectro Cloud 将该平台描述为一种从物理硬件层到模型和推理服务的管理方式。
该平台还包括 PaletteAI Studio,它提供了预先集成的基础设施和人工智能堆栈,构建于 Kubeflow、MLflow、ClearML、Run:ai 和 Hugging Face 等技术之上。这些配置旨在为平台团队提供可重复的部署模板,而不是要求他们手动集成每个组件。
推理启动板添加了代币路由、计量和本地管理模型服务到更广泛的基础设施层。
支持主权和监管 AI 环境
Spectro Cloud 还针对新云、托管服务提供商和主权云运营商。这些提供商通常需要提供共享的 GPU 基础设施,同时在客户之间保持隔离并执行特定于管辖区的控制。
该公司正在与 NexusIgnite 合作,NexusIgnite 是一家从奥斯汀和迪拜运营的基础设施提供商,以支持涉及数据居住地、合规性和运营主权的部署。
数据居住地通常涉及信息存储的位置。主权人工智能引入了有关谁运营基础设施、适用的法律体系、谁可以访问它以及环境是否可以被审计或与外部服务断开连接的附加问题。
Spectro Cloud 的平台支持自托管和空气隔离部署,同时 PaletteAI VerteX 添加了针对政府和监管环境的安全控制。
这些功能可能对无法将每个人工智能交互路由到共享公共服务的政府、医疗保健组织、金融机构和关键基础设施运营商尤其重要。
企业 AI 运营竞争加剧
推理启动板的发布恰逢 Spectro Cloud 宣布了一轮 1 亿美元的 D 轮融资,由高盛替代投资的增长股权领投,AMD Ventures、爱立信、LG Technology Ventures 和 Maximus 参投。
该公司表示,这笔资金将支持其在生产人工智能基础设施、主权云、neocloud 服务和分布式推理方面的扩张。Spectro Cloud 现已筹集了约 2.6 亿美元的资金。
其战略反映了人工智能市场中新出现的一层,侧重于运行模型而不是开发基础模型。随着模型选项的增加,企业越来越需要能够确定模型运行位置、GPU 分配方式、可访问数据以及使用情况测量的基础设施。
PaletteAI 推理启动板和扩大的 AMD 集成现在可用。其长期意义将取决于是否可以在不重新创建企业原本希望通过使用外部模型提供商避免的运营复杂性的情况下,提供一致的经济效益。












