AI 模型与平台

Pinecone 开源 VQ-Bench 向量量化框架

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Pinecone 已发布 VQ-bench,这是一套用于构建和基准测试向量量化方法的开源框架,发布于 2026年9月17日公告,由 Ashwin Padaki、Amir Ingber 和 Edo Liberty 发布。此次发布配套了一个公开网站,提供流行量化器的实时基准测试,以及一个 MIT 许可证的 GitHub 仓库和在 VecDB@VLDB 2026 上发表的论文。

Pinecone 为什么构建量化基准测试

向量量化可以降低存储向量所需的位数,作者将其描述为维护向量数据库的关键环节,并且对 向量数据库 和大型语言模型同样重要。Pinecone 自首个原型起就使用量化,作者写道,当他们着手调研并基准测试最新研究时,发现每篇论文的性能评估方式各不相同:使用的指标、数据集以及目标硬件均不同。他们表示未能找到任何系统化的尝试,将领先方法相互比较。

作者将该项目的前提描述为,大多数已发表的量化器都是由相对少量的原始操作组合而成,因此构建量化器可以简化为选择使用哪些原语以及使用顺序的配方。伴随论文 于 2026年7月31日 向 arXiv 提交,指出该框架描述了七种概念性的量化原语,展示了如何任意组合它们,并将 25 种常见量化器重新表述为这些原语的流水线。

VQ-Bench 如何组合量化器

在 VQ-bench 中,量化器指任何能够接受向量集合、对其进行压缩并在后续恢复所需信息的工具。量化器必须实现四个方法:fit 用于从向量样本中学习模型并可选地进行查询;encode 根据模型返回每个向量的编码;reconstruct 根据模型和编码重建向量;score 用于估计查询向量与已编码向量之间的点积。

原语实现相同的四个方法,并额外提供 apply 和 apply_queries,用于指定该阶段如何将数据传递给下一个阶段。这两个方法构成了链式契约,使原语能够组合。VQ-bench 实现了三类原语:如 Center、Normalize、PCA 和 RandomRotate 的条件器;如 CastUint、CastAngular、CastNormal 和 KMeans 的取整器;以及如 Segment 的分割器。

流水线将两个或更多原语串联。fit 和 encode 方法沿链向前遍历向量,执行每个阶段的任务并将各阶段学习的模型和输出编码拼接;reconstruct 从最后一个阶段开始向后遍历,每个阶段将其贡献折回;score 则先通过 apply_queries 将查询向前传播,再执行相同的逆向过程。量化器并非必须是流水线,只要实现这四个方法即可,但作者报告称大多数已发表的量化器都可以表示为原语的流水线。

公告以 E-RaBitQ 为例,展示了由四个原语组成的流水线:Center 将每个向量减去数据集向量的平均值;Normalize 将每个向量缩放至单位范数;随机旋转应用随机正交或 Hadamard 变换;以及角度投射,通过将每个向量按角度四舍五入到最近的 b 位整数网格,将其映射到 b 位整数网格上。

基准设置与报告的发现

作者在来自 VIBE 的五个数据集上评估了 14 种量化器,并对其中两个数据集给出了详细结果:ArXiv 包含 1,344,643 条 768 维向量,Yahoo 包含 677,305 条 384 维向量。完整结果已发布在项目的基准测试网站上。

重建均方误差(MSE)是作者称之为向量量化传统指标且对诸如 LLM 权重压缩等应用重要的度量,其在 1,000 条随机抽取的数据集向量上测量,即每个向量与其重建之间的平方距离的平均值。对于向量数据库,作者将召回率视为更相关的指标,尤其用于重新排序;recall@10 的计算方式是对每个查询的 1,000 条最大点积数据向量进行检索,统计量化器估计的前 10 名中有多少落在真实的前 10 名内,并对所有查询取平均。公告中的编码时间数据是在配备 16GB 内存、使用六线程的 Apple M2 Pro 上获得的,编码采用分块方式并通过多线程加速。

作者报告称,PQ 和 OPQ 始终产生最低的重建 MSE,EDEN 与 E-RaBitQ 在召回率上相当,尤其在更高比特预算下表现相似;且 EDEN 的编码速度远快于 PQ、OPQ 和 E-RaBitQ,作者因此将其描述为大多数量化应用的良好候选方案。

代码仓库、工具与贡献

GitHub 仓库采用 MIT 许可证,并列出 Pinecone 的维护者 Amir Ingber 和 Edo Liberty,以及宾夕法尼亚大学的 Ashwin Padaki。它随附一个基于 Rust 的命令行工具 vqb,其 JSON 运行配置可选择数据集、方法及其参数、质量指标、召回的 k 值、softmax 温度、主种子、子抽样计数和线程数;dry-run 标志在计算之前验证配置。流式模式通过以块(默认 256MB)从磁盘读取基向量来处理大于内存的数据集。

根据公告,代码库接受两种类型的贡献:新的量化器,通常只需几行代码重新排列库已提供的原语;以及实现六个接口方法的新原语,这些原语随后可与目录中的所有其他原语组合。评估工具衡量 recall@k、重构和评分误差、偏差、softmax KL 与 total variation、每维比特数的大小,以及 encode、score 和 reconstruction 成本。作者将此发布描述为 VQ-bench 的首次迭代,并表示将随时间添加更多量化器;可以通过代码库的 issue tracker 提交更正,已发布的基准会定期更新并纳入新方法。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。