AI 모델 및 플랫폼

Pinecone 오픈소스 VQ-Bench 벡터 양자화 프레임워크

mm
Unite.AI를 Google의 선호 소스에 추가

Pinecone은 Ashwin Padaki, Amir Ingber, 그리고 Edo Liberty2026년 9월 17일 발표에서 벡터 양자화 방법을 구축하고 벤치마킹하기 위한 오픈소스 프레임워크인 VQ-bench를 공개했습니다. 이 릴리스는 인기 있는 양자화기들의 실시간 벤치마크를 호스팅하는 공개 웹사이트와 MIT 라이선스의 GitHub 저장소, 그리고 VecDB@VLDB 2026에서 발표된 논문을 함께 제공합니다.

Pinecone이 양자화 벤치마크를 구축한 이유

벡터 양자화는 벡터를 저장하는 데 필요한 비트 수를 줄이며, 저자들은 이를 벡터 데이터베이스를 유지하는 데 필수적인 부분이자 벡터 데이터베이스와 대형 언어 모델 모두에 중요한 요소라고 설명합니다. Pinecone은 초기 프로토타입부터 양자화를 사용해 왔으며, 저자들은 최신 연구를 조사하고 벤치마크하려는 과정에서 각 논문이 성능을 서로 다르게 평가하고 있음을 발견했습니다: 서로 다른 지표, 서로 다른 데이터셋, 그리고 서로 다른 목표 하드웨어. 그들은 주요 방법들을 서로 비교 평가하는 체계적인 시도를 찾지 못했다고 밝혔습니다.

저자들이 설명한 바와 같이, 이 프로젝트의 전제는 대부분의 공개된 양자화기들이 비교적 적은 수의 기본 연산으로 구성되어 있기 때문에, 양자화기를 구축하는 것이 어떤 기본 연산을 어떤 순서로 사용할지에 대한 레시피로 축소될 수 있다는 것입니다. 동반 논문은 2026년 7월 31일 arXiv에 제출되었으며, 프레임워크가 일곱 가지 개념적 양자화 기본 연산을 설명하고 이를 자유롭게 조합하는 방법을 보여주며, 25개의 일반적인 양자화기를 해당 기본 연산들의 파이프라인으로 재표현한다고 명시하고 있습니다.

VQ-Bench가 양자화기를 구성하는 방식

VQ-bench에서 양자화기는 벡터 집합을 받아 압축하고 나중에 원하는 정보를 복원할 수 있는 모든 것을 의미합니다. 양자화기는 네 가지 메서드를 구현해야 합니다: fit은 벡터 샘플로부터 모델을 학습하고 필요에 따라 쿼리를 수행하며, encode는 모델을 기반으로 각 벡터에 대한 코드를 반환하고, reconstruct는 모델과 코드를 사용해 벡터를 재구성하며, score는 쿼리 벡터와 코딩된 벡터 사이의 내적을 추정합니다.

기본 연산은 동일한 네 가지 메서드에 추가로 apply와 apply_queries 두 메서드를 구현하며, 이는 해당 단계가 데이터를 다음 단계에 전달하는 방식을 지정합니다. 이 두 메서드는 기본 연산을 연결할 수 있는 체인 계약을 형성합니다. VQ-bench는 세 그룹의 기본 연산을 구현합니다: Center, Normalize, PCA, RandomRotate와 같은 컨디셔너, CastUint, CastAngular, CastNormal, KMeans와 같은 라운더, 그리고 Segment와 같은 스플리터.

파이프라인은 두 개 이상의 기본 연산을 연결합니다. fit과 encode 메서드는 벡터를 체인 앞으로 이동시키면서 각 단계의 작업을 수행하고 각 단계에서 학습된 모델과 출력 코드를 연결합니다; reconstruct는 마지막 단계에서 시작해 역방향으로 이동하며 각 단계가 자신의 기여를 다시 접합합니다; score는 먼저 apply_queries를 통해 쿼리를 앞으로 전달한 뒤 동일한 역방향 과정을 실행합니다. 양자화기가 파이프라인일 필요는 없으며, 네 가지 메서드를 구현하면 어떤 형태든 가능하지만, 저자들은 대부분의 공개된 양자화기가 기본 연산의 파이프라인으로 표현될 수 있다고 보고했습니다.

발표에서는 네 가지 기본 연산으로 구성된 예시 파이프라인인 E-RaBitQ를 사용합니다: Center는 각 벡터에서 데이터셋 평균 벡터를 빼고, Normalize는 각 벡터를 단위 노름으로 스케일링하며, 랜덤 회전은 무작위 직교 변환 또는 Hadamard 변환을 적용하고, 각도 캐스트는 각 벡터를 b비트 정수 격자에 가장 가까운 각도 그리드 포인트로 반올림하여 스냅합니다.

벤치마크 설정 및 보고된 결과

저자들은 VIBE에서 제공된 다섯 개 데이터셋에 대해 14개의 양자화기 모음을 평가했으며, 그 중 두 개인 ArXiv(768 차원, 1,344,643 벡터)와 Yahoo(384 차원, 677,305 벡터)에 대한 상세 결과를 제시했습니다. 전체 결과는 프로젝트 벤치마크 웹사이트에 공개되어 있습니다.

재구성 평균 제곱 오차(MSE)는 저자들이 전통적인 벡터 양자화 지표이자 LLM 가중치 압축과 같은 응용에 중요하다고 부르는 것으로, 1,000개의 무작위 샘플링된 데이터셋 벡터에 대해 각 벡터와 재구성된 벡터 사이의 평균 제곱 거리를 측정합니다. 벡터 데이터베이스의 경우, 저자들은 재검색에 특히 중요한 지표로 recall을 강조합니다; recall@10은 각 쿼리의 상위 1,000개 최대 내적 데이터셋 벡터를 계산하고, 양자화기가 추정한 상위 10개 중 실제 상위 10개에 포함된 비율을 모든 쿼리에 대해 평균하여 측정합니다. 발표에서 인코딩 시간 수치는 16GB RAM을 갖춘 Apple M2 Pro에서 6개의 스레드를 사용해, 청크 단위로 인코딩하고 멀티스레딩으로 가속화하여 얻었습니다.

저자들은 PQ와 OPQ가 일관되게 가장 낮은 재구성 MSE를 기록했으며, EDEN과 E-RaBitQ는 특히 높은 비트 예산에서 recall이 비슷했고, EDEN은 PQ, OPQ, E-RaBitQ보다 훨씬 빠르게 인코딩되었다고 보고했습니다. 이는 EDEN이 대부분의 양자화 응용에 적합한 후보임을 의미합니다.

저장소, 도구 및 기여

GitHub repository는 MIT 라이선스를 갖고 있으며 Pinecone의 Amir Ingber와 Edo Liberty, 그리고 University of Pennsylvania의 Ashwin Padaki를 유지관리자로 명시하고 있습니다. 이 저장소는 Rust 기반 명령줄 도구인 vqb를 제공하며, JSON 실행 구성에서 데이터셋, 메서드 및 해당 매개변수, 품질 메트릭, 리콜을 위한 k값, softmax 온도, 마스터 시드, 서브샘플링 수, 스레드 수를 선택합니다; dry-run 플래그는 실제 계산이 이루어지기 전에 구성을 검증합니다. 스트리밍 모드는 기본 벡터를 디스크에서 블록 단위(기본값 256MB)로 읽어 메모리보다 큰 데이터셋을 처리합니다.

공고에 따르면 이 저장소는 두 종류의 기여를 받습니다: 기존에 라이브러리가 제공하는 프리미티브를 재배열하는 몇 줄의 코드로 이루어지는 새로운 양자화기와, 여섯 개 인터페이스 메서드를 구현하는 새로운 프리미티브로, 이는 카탈로그의 다른 모든 프리미티브와 결합됩니다. 평가 하니스는 recall@k, 재구성 및 점수 오류, 편향, softmax KL 및 총 변동, 차원당 비트 크기, 그리고 인코딩, 점수, 재구성 비용을 측정합니다. 저자들은 이번 릴리스를 VQ-bench의 첫 번째 반복이라고 설명하며 시간이 지남에 따라 더 많은 양자화기를 추가할 것이라고 밝혔습니다; 수정 사항은 저장소의 이슈 트래커를 통해 제출할 수 있으며, 공개된 벤치마크는 새로운 방법이 포함된 정기적인 주기로 업데이트됩니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.