访谈
Val Bercovici,WEKA 首席 AI 官 – 访谈系列

Val Bercovici,WEKA 首席 AI 官,是一位专注于推动支撑下一代人工智能技术的 AI 与数据基础设施高管。自 2025 年 1 月以首席 AI 官身份加入 WEKA 以来,他专注于构建 AI 代理基础设施、加速训练与推理工作负载,并提升 AI 计算的经济性。除了在 WEKA 的职责外,Bercovici 还担任 Home Dock 的 AI 顾问、FermiHDI 与 The Hive 的战略顾问,以及 PencilDATA 的董事长,其工作涉及 AI、网络安全、区块链、云计算和数据基础设施。他的职业生涯始终聚焦于开发和指导旨在支撑日益数据密集型 AI 系统的新兴技术。
WEKA 是一家 AI 原生数据基础设施公司,构建了一个专为人工智能、机器学习、高性能计算以及其他加速工作负载的苛刻数据需求而设计的软件定义平台。WEKA 数据平台为组织提供统一架构,可在本地、云端、混合和边缘环境中运行,帮助消除存储瓶颈、提升 GPU 利用率并加速 AI 模型的训练与推理。公司正日益围绕新兴的推理经济和代理 AI 定位其技术,其基础设施旨在提供大规模高吞吐、低延迟的数据访问,同时简化复杂的 AI 数据流水线。WEKA 为企业、云服务提供商、研究机构以及在全球最具性能密集型计算环境中运行的 AI 开发者提供服务。
您的职业生涯从塑造 NetApp 的早期云策略并在 Kubernetes 创始治理委员会任职,到在 WEKA 构建 AI 基础设施。这样的演变如何影响您对为下一阶段 AI 准备基础设施的思考方式?
我职业生涯的每个阶段都有相同的模式:瓶颈会迁移,而行业往往要多年才注意到它。早期的云和 Kubernetes 时代,我们看到计算变得弹性化,编排成为新的瓶颈。离开 NetApp(我在收购 SolidFire 后担任 CTO)时,我以为自己已经了解了“快”的意义:在生产工作负载下,真正随机的首字节读取只有低毫秒级。
我加入 WEKA 的原因其实相当极客。那是一个数据:首个未缓存的随机字节读取时间为 70 微秒,这根本不是存储级别的数字。我从未想象过这类系统能达到微秒级延迟。这时灵光一现:这项技术不仅可以服务于内存类应用、如 Redis 与 KV 缓存等 DRAM 级别的应用,而不仅仅是存储。而且恰逢推理开始超越训练,因为行业必须将这些模型商业化,代理出现后让内存成为整个游戏的核心。
这就是我看待 AI 基础设施的视角。我们以前也见过类似的情形。Cloud FinOps 之所以出现,是因为公司在没有单位经济学严谨性的情况下随意扩展基础设施,随后收到高额账单。AI 正在同一条曲线上,以更快的速度前进。随着企业因 API 消耗账单远超计划的 token 预算而被迫限制 token 使用,我们正目睹 AI FinOps 的崛起。此时组织不再把推理当作廉价公用事业,而是将 token 效率管理视为财务纪律。AI FinOps 从 token 经济学开始:优化推理堆栈每一层硬件和软件,以降低每个 token 的单位成本。目前堆栈中最大的浪费是昂贵的 GPU 与新 ASIC 处于空闲状态,等待内存和数据(即“解码”)而不是 FLOPS(即“预填充”)。谁能解决这个问题,谁就掌握了 AI 的下一阶段。
白宫对其新 AI 安全框架的细节保持保密。企业在尚未明确测试或要求内容时,如何为监管要求做好准备?
公司不应等到最终清单。具体测试会变化,但其背后的义务不会改变:你必须能够展示你的 AI 模型做了什么、触及了哪些数据以及在特定时间点的行为。而且等待在全球已经不是选项。欧盟 AI 法案本月已开始强制执行,并将大多数代理编排归类为高风险。
这意味着准备工作本质上是基础设施工作。数据血缘、可观测性、可复现性以及按需重建模型状态的能力,都是企业必须做好 的关键。最后,组织需要在输出前实现防护模型,并为语义防御层设定相应的延迟和 token 预算。如果现在就构建这些能力,任何框架都只是一种格式化练习。等到最终规则出台,你只能在从未设计为可解释的系统上事后补装问责机制,而这总是比从一开始就内建要昂贵得多。
归根结底,构建安全 AI 的解决方案仍然是更多的 AI,只是要以最优且高度刻意的方式应用。
AI 安全测试可能会产生哪些新基础设施需求?这些工作负载与传统模型训练或推理有何不同?
训练像是消防栓:你以持续、可预测的模式向模型灌输巨量数据。安全测试恰恰相反:成千上万的评估场景、反复探测、版本间行为对比以及永无止境的对抗红队演练。
这种特征很重要。安全训练与测试呈现突发、读密集且对比性强的特征。它会产生并消耗巨大的中间状态。防护模型必须本质上是异构且分层的,需要在严格的延迟预算内实现,并通过新的安全准则维度放大评估。对于此类高级或具备网络能力的模型,工作负载特征是 24/7 持续而非间歇。你不再是一次性运行测试并归档结果,而是持续运行的代理群体工作负载,它们在生产环境中与计算、内存和数据带宽竞争,以保护关键应用。除质量和速度外,今天的大多数基础设施并未为这一第三原则设计。
这里还有一个测量问题。大多数 AI 基准今天只跑 8,000 token 或更少,一次提示一次响应。我常开玩笑说它们是人工智能的人工基准。到 2026 年中期,真实的代理工作负载会在数千轮对话中处理 100,000 到 400,000 token 的上下文。如果安全评估仍沿用这些玩具基准,我们实际上是在为一个不存在的世界认证系统。监管机构已经在此方面构建更强的能力:NIST 已开源代理安全评估工具,早期发布的结果显示新型代理劫持攻击的成功率是已知基准的数倍。这正是我预期安全框架将收敛的那种持续、对抗性、成本高昂的测试。
组织是否应专门构建过剩的计算和数据容量以应对未来的合规和安全工作负载,还是有更高效的方式来设计以应对这种不确定性?
盲目采购过量 GPU 并期待利用率提升,只会让资本被困在贬值的硬件中。
更高效的答案是构建能够在生产和评估工作负载之间灵活切换的基础设施,而无需单独的堆栈。这根本是一个数据问题。如果你能够高效搬迁并复用数据,保持工作负载之间的上下文,并让加速器持续做真实工作,合规成本就会变成增量而非并行的建设。AI 的经济学日益取决于你从每个 token、每个字节、每瓦特中提取的价值。做对了,你可以用同样的基础设施产生 3–4 倍的价值,或者将机架占用率降低至 75%。合规也应遵循同样的标准。
当前框架据称聚焦于高级封闭模型,而排除开源权重模型。将这两类模型区别对待可能会带来哪些基础设施或安全挑战?
如果对封闭模型和开源权重模型采用不同的处理方式,就会出现两套针对同类技术的合规框架,而风险正潜伏在它们之间的差距。
开源权重模型可以在原供应商完全不可见的环境中进行微调和部署。对供应商进行监管在这里毫无作用。而且这种分裂已经显现:今年最新的封闭前沿模型受到了出口管制,而开源权重模型则自由跨境,并已登上公共能力排行榜的前列。然而,仅靠行政定义前沿模型并不足以治理。你需要了解模型运行的地点、访问的数据、保留的提示、响应和元数据、模型的修改情况,以及底层基础设施是否真的能够在规模上支持受治理的 AI。ISO27001 和 SOC2 的新更新将成为必需。
我的答案是“信任但要验证”。如果你的基础设施提供足够的 token 容量,你可以在任何模型输出前运行异构防护,无论是国内还是国外,开源还是封闭。客观的验证胜过基于模型来源的盲目信任或盲目不信任。随着开源模型的普及,这种验证能力将驻留在基础设施层,这也将成为企业的差异化点。政策可以决定哪些模型被允许使用,而基础设施决定这些模型是否能够以负责任且经济的方式部署。
随着 AI 代理变得更自主并在更长的上下文中运行,这将如何改变组织在监控和安全方面需要分配的数据、内存和计算资源?
聊天机器人只是一次提示和一次响应。自主代理是一个持续运行的进程。它会触及数十个系统,检索信息,做出中间决策,并在数小时甚至数天内累计状态,直至完成任务。
你无法通过抽样单个 token 或响应来监控它。必须捕获完整序列:代理知道了什么、何时知道以及随后做了什么。代理每运行一小时,其状态就会增长,随之而来的还有捕获和分析这些状态所需的内存、数据移动和基础设施。监控不再是日志功能,而是拥有自身资源预算的一流工作负载。
防御层面尤为紧迫。AI 的内存问题正转变为安全问题。编码代理可以启动、交付并关闭;而网络安全代理则不行。它必须在安全运营中心的日常轮班、频繁的模型更新以及过去需要数周才能完成的多阶段攻击活动之间保持上下文,而如今这些攻击已能以机器速度同步进行。当 AI 工作记忆每几分钟被清除并重新计算时,第一小时检测到异常行为的代理在第二小时已不记得该异常。攻击者没有这个问题,他们的代理会持续识别并利用弱点,攻击链现在以 token 经济学优化的机器速度完成,因此 AI 驱动的网络防御必须实现 24/7 的自主运行。这并非理论假设,安全厂商正为 24/7 持续的网络代理做准备,而他们首先发现的是,这类工作负载的经济模型与聊天工作负载截然不同。有些组织需要在边缘运行这些代理,在无法部署 GPU 机架甚至冷却设备的设施中。企业 AI 的真正考验是持续的上下文保留,而非瞬时推理。这将演变为 token 消耗的博弈,谁能在规模上实现持久上下文记忆,谁就能驱动企业 AI 的首个横向杀手级应用:始终在线的蓝色代理群体。
您曾谈及“上下文记忆”在 AI 工作负载从简单聊天向持久代理转变过程中的重要性。上下文记忆是否也会在审计、复现或调查 AI 行为时变得重要?
绝对会,而且这是一个重要的使用场景。多年来,记忆被视为性能问题:GPU 能多快供给数据、能保留多少上下文。一旦代理开始自主行动,同样的记忆就成为证据。如果代理基于数天累计的上下文做出决策,最终的提示和输出几乎无法解释其行为原因。解释藏在累计的状态中。
从技术角度看,大部分状态保存在 KV 缓存中,而业界仍将其视为一次性临时空间,而非持久数据。如果你能够保留并高效检索这些状态,就能在代理行动的瞬间重建系统所知的信息。团队首先会将其用于调试,随后用于安全评估,最终在调查中发挥作用。丢弃上下文记忆等同于丢失唯一能解释 AI 行为的记录。
AI 监管最终是否会迫使公司保留更多关于模型输入、输出、检查点、数据血缘和代理活动的信息?这对 AI 基础设施架构意味着什么?
方向上是肯定的。随着 AI 系统的影响力增大,可视化要求将扩展到管道的每一步。你已经可以看到早期信号:团队计划将陈旧的上下文记忆保存在更便宜的对象存储层,仅用于审计,即使尚未有监管强制要求。
监控的不可篡改性至关重要。恶意代理篡改日志和取证制品已成常态,这要求构建不易受到集中攻击目标的复杂加密验证系统。单纯的透明日志或哈希链不足以防御协同代理群的串通攻击。高度去中心化的公共区块链架构正好适用于此,凸显了在网络安全 C‑I‑A 三元组中常被忽视的完整性价值。
保留不仅是大规模的不可变存储难题。关键在于保持这些信息的可信、组织、索引,并能够足够快速检索,以在监管、事件响应或法庭期限内发挥作用。无法查询的 PB 级代理活动是一种负债,而非记录。架构的转变不再是“更多存储”,而是围绕可客观验证、持久、可查询的 AI 数据作为核心工作负载来设计基础设施。
许多组织专注于购买更多 GPU,但随着 AI 工作负载规模扩大和安全需求提升,您认为哪些不那么显眼的基础设施瓶颈会浮现?
GPU 常被拿出来讨论,因为它并非一个微不足道的预算项目。但 GPU,尤其是新型解码优化加速器(ASIC+SRAM),往往并非真正的约束。内存带宽、数据重力与移动、存储性能以及网络决定了这些加速器是进行生产性工作还是处于空闲等待状态。
随着 AI 越来越依赖上下文,内存墙成为决定性约束。你可以不断添加 GPU,但如果它们的周期都在重新计算 token 或在系统之间搬运上下文,你就在为浪费的工作付费,且这种浪费会反复出现。突破内存墙意味着让数据层表现得像共享存储,却以真实内存速度运行。这一 HBM 相近的速度标准对当前涌现的 KV 缓存卸载解决方案至关重要:任何方案都必须提供真正的内存级性能,才能让 token 经济学站得住脚。KV 缓存的保留价值是成本中心的讨论,次于利润中心。如果读取缓存上下文的速度慢于重新计算的速度,缓存对业务方程毫无价值。关键不在于你拥有多少 GPU,而在于每个 GPU 的生产力。AI 的经济学归结为你从每个 token、每个字节、每瓦特中提取的价值,而安全需求只会让这场博弈的赌注更高。
展望未来,您是否预计 AI 安全和合规会成为类似网络安全那样的独立基础设施工作负载?
我们会看到 AI 安全和合规演变为独立的工作负载,且网络安全的平行发展在两个方向上都适用。安全成为独立层是因为行业已经接受它不能只是偶发的练习。网络保险行业让这成为了非可选项。AI 安全正走在同样的强制性轨道上,随着模型变得更强大、更自主。
但我们应当从安全走错的地方吸取教训。安全曾是一个附加层:单独的堆栈、单独的预算、单独的团队,在事后才发现问题。安全基础设施不应重蹈覆辙。监控、评估、可审计性和不可变保留应内嵌于 AI 基础设施本身,从一开始就共同设计。
这里是大多数人忽视的关键点:安全的 AI 需要更多的 AI。防护模型并非免费,它们必须在代理运行的每一步持续进行训练、微调和推理。Token 延迟预算将这一点具象化:每个响应都有固定窗口,窗口内能处理的 token 越多,你就能在输出前执行更多的验证。而前沿模型的真正威胁在于其代理化应用。代理以高频推理循环运行,在长时间范围内反复调用模型。每一次循环都是观察、定位、决策、行动,每一步都消耗 token。这将 AI 安全转变为 token 消耗的战争。攻击者部署红色代理群,防御者部署蓝色代理群,能够以更低的成本生成更多 token 的一方将获胜。Token 经济学位于攻击与防御的关键路径上。这一概念在今年夏天就已不再是思辨:一次针对大型模型仓库的红色代理群攻击震动了整个行业,随即成立了专门的安全 AI 联盟。与此同时,处理量持续复利:行业的 token 处理已从万亿级跃升至千万亿级。
一旦安全成为始终在线的需求,其计算、内存和数据成本将不再是额外开销,而是运行 AI 的基本单位经济的一部分。那些早期内化这一点的公司会把安全视为设计输入,其他公司则会把它当作税负。
感谢这次精彩的访谈,想了解更多的读者请访问 WEKA。












