合作伙伴
Crusoe签署多年协议,为Perplexity的训练和推理提供动力

Crusoe于2026年9月15日,宣布与Perplexity建立多年合作伙伴关系,根据该合作,Perplexity将在Crusoe Cloud上运行其完整的模型生命周期,在专用的NVIDIA GB300 NVL72集群上训练前沿模型,并通过Crusoe的托管推理服务进行生产部署。
该公告以旧金山为发稿地点,还承诺Crusoe为其1800名员工采用Perplexity Enterprise Pro和Max。根据发布内容,此部署旨在为员工提供网络和内部知识搜索、多步骤研究、数据分析以及对前沿AI模型的访问。
该发布将Perplexity的产品描述为面向数百万用户实时运行的环境,在此环境中,推理延迟和吞吐量本身即为产品,而非理论基准。Crusoe表示,其托管推理服务基于专有优化构建,旨在提供生产级推理,并针对流行模型在性能和成本方面进行工程化,同时Crusoe Cloud提供的运营深度和规模能够匹配Perplexity的增长。
高管声明
Crusoe联合创始人兼CEO Chase Lochmiller表示,发展最快的AI公司需要能够在整个模型生命周期中保持同步并随其增长而扩展的基础设施。Lochmiller说:”Perplexity正在构建人们获取答案的未来,而Crusoe是实现这一目标的关键合作伙伴,从第一个电子到最后一个标记。”
Perplexity联合创始人兼CEO Aravind Srinivas表示,在Perplexity的规模下运行AI意味着每毫秒的延迟都会被用户感知。他形容Crusoe是围绕这一约束构建的,称其为高吞吐、低延迟的推理,并由下一代硬件提供支持。
NVIDIA高性能计算与AI基础设施解决方案高级总监Dion Harris表示,现代AI需要从研究到部署的统一计算架构。Harris称,凭借NVIDIA GB300 NVL72和NVIDIA InfiniBand的驱动,Crusoe Cloud使Perplexity能够以代理AI所需的速度和效率,在生产环境中训练、微调并服务前沿模型。
GB300 NVL72平台
协议中提到的专用训练集群运行在NVIDIA的GB300 NVL72上,NVIDIA将其描述为一款全液冷、机架级系统,集成了72个Blackwell Ultra GPU和36个基于Arm的Grace CPU。NVIDIA公布的规格显示,NVLink带宽为130 TB/s,GPU内存为20 TB,带宽最高可达576 TB/s,快速内存为37 TB,拥有2,592个Arm Neoverse V2 CPU核心。系统中的每个GPU通过ConnectX-8 SuperNIC I/O模块获得800 Gb/s的网络连接,可配合Quantum‑X800 InfiniBand或Spectrum‑X以太网平台使用。
NVIDIA声称,基于GB300 NVL72的AI工厂相较于基于Hopper的平台可实现高达50倍的整体产能提升。公司将该数字归因于用户响应速度提升10倍(以每用户每秒令牌数计)以及每兆瓦吞吐量提升5倍,并指出这些数字为预测性能,可能会有变动。
托管推理服务与历史
协议的生产服务部分运行在Crusoe托管推理上,该公司于2025年11月20日正式向公众开放,用于Crusoe Cloud上的生产推理工作负载。该服务由Crusoe的专有推理引擎驱动,围绕MemoryAlloy构建,这是一种全集群键值缓存,通过允许GPU从本地和远程节点获取前缀缓存来消除重复的预填充。Crusoe称,该引擎在四节点部署中针对Llama-3.3-70B模型相较于vLLM实现了最高9.9倍的首令牌时间加速和5倍的吞吐提升。
根据其托管推理产品页面,Crusoe提供三种部署选项。Serverless Inference通过全托管API提供基于使用量的开放模型消费,面向早期工作负载、低流量和快速实验。页面称已正式推出的Self‑Serve Deployments运行针对吞吐量或响应速度优化的模型,包括使用Crusoe的无服务器微调定制的模型。Tailored Deployments则将客户与Crusoe团队配对,提供专用的、经过基准测试的端点,页面将此选项定位于专有模型。
开发者可通过Crusoe Intelligence Foundry访问该服务,这一中心可让他们生成API密钥、使用针对各模型调优的托管端点、监控性能指标,并为生产规模部署启用预配吞吐量。Crusoe的模型中心列出了来自DeepSeek、Google、Z.ai、OpenAI、Meta、Alibaba和NVIDIA等实验室的预配置开放模型,并提供每个模型的参数数量和上下文长度。












