AI-modeller og platforme
Pinecone gør VQ-Bench til open source – rammeværk for vektor‑kvantisering

Pinecone har frigivet VQ-bench, et open‑source‑rammeværk til at bygge og benchmarke vektor‑kvantiseringsmetoder, i en annoncering den 17. september 2026 af Ashwin Padaki, Amir Ingber og Edo Liberty. Udgivelsen kombinerer et offentligt websted, der hoster et løbende benchmark af populære kvantisatorer, med et MIT‑licenseret GitHub‑arkiv og et papir præsenteret ved VecDB@VLDB 2026.
Hvorfor Pinecone byggede et kvantiserings‑benchmark
Vektor‑kvantisering reducerer antallet af bits, der skal bruges til at gemme en vektor, hvilket forfatterne beskriver som en kritisk del af vedligeholdelsen af en vektordatabase og som vigtigt både for vektordatabaser og store sprogmodeller. Pinecone har brugt kvantisering siden sine første prototyper, og forfatterne skrev, at da de gik i gang med at undersøge og benchmarke nyere forskning, fandt de, at hvert papir evaluerede ydeevne forskelligt: forskellige målinger, forskellige datasæt og forskellig mål‑hardware. De sagde, at de ikke kunne finde noget systematisk forsøg på at evaluere de førende metoder mod hinanden.
Projektets grundlag, som forfatterne beskriver, er, at de fleste offentliggjorte kvantisatorer er sammensat af et relativt lille sæt primitive operationer, så konstruktionen af en kvantisator kan reduceres til en opskrift på, hvilke primitive der skal bruges og i hvilken rækkefølge. det tilhørende papir, indsendt til arXiv den 31. juli 2026, fastslår, at rammeværket beskriver syv konceptuelle kvantiserings‑primitive, viser, hvordan de kan sammensættes vilkårligt, og udtrykker 25 almindelige kvantisatorer som pipelines af disse primitive.
Hvordan VQ‑Bench sammensætter kvantisatorer
I VQ‑bench er en kvantisator alt, hvad der kan tage et sæt vektorer, komprimere dem og senere genoprette ønsket information. En kvantisator skal implementere fire metoder: fit, som lærer en model ud fra en prøve af vektorer og eventuelt forespørgsler; encode, som returnerer per‑vektor‑koder givet modellen; reconstruct, som genopbygger en vektor ud fra modellen og dens kode; og score, som estimerer prikproduktet mellem en forespørgselsvektor og en kodet vektor.
En primitive implementerer de samme fire metoder plus to yderligere, apply og apply_queries, som specificerer, hvordan trinnet overleverer data til det næste. Disse to metoder udgør den kæde‑kontrakt, der gør det muligt at sammensætte primitive. VQ‑bench implementerer tre grupper af primitive: konditionerings‑primitive såsom Center, Normalize, PCA og RandomRotate; afrundings‑primitive såsom CastUint, CastAngular, CastNormal og KMeans; og split‑primitive såsom Segment.
En pipeline kæder to eller flere primitive sammen. fit‑ og encode‑metoderne fører vektorer fremad gennem kæden, udfører hvert trins arbejde og concatenaterer hvert trins lærte model og output‑koder; reconstruct starter ved det sidste trin og går baglæns, hvor hvert trin lægger sin egen bidrag ind igen; og score først skubber forespørgslen fremad gennem apply_queries, før den udfører den samme baglæns passage. En kvantisator behøver ikke være en pipeline, da alt der implementerer de fire metoder kvalificerer, men forfatterne rapporterer, at de fleste offentliggjorte kvantisatorer kan udtrykkes som pipelines af primitive.
Meddelelsen demonstrerer E‑RaBitQ som et eksempel‑pipeline bestående af fire primitive: Center, som trækker gennemsnits‑datasætvektoren fra hver vektor; Normalize, som skalerer hver vektor til enhedsnorm; en tilfældig rotation, der anvender en tilfældig ortogonal eller Hadamard‑transform; og en vinkel‑cast, der fastlægger hver vektor på et b‑bits heltal‑gitter ved at runde til det nærmeste gitterpunkt i vinklen.
Benchmark‑opsætning og rapporterede resultater
Forfatterne evaluerede en suite af 14 kvantisatorer på fem datasæt fra VIBE og præsenterer detaljerede resultater for to af dem: ArXiv med 1.344.643 vektorer i 768 dimensioner og Yahoo med 677.305 vektorer i 384 dimensioner. Fulde resultater er offentliggjort på projektets benchmark‑websted.
Rekonstruerings‑middelkvadreret fejl (MSE), som forfatterne kalder den traditionelle måling for vektor‑kvantisering og som er vigtig for anvendelser som komprimering af LLM‑vægte, måles på 1.000 tilfældigt udvalgte datasætvektorer som den gennemsnitlige kvadrerede afstand mellem hver vektor og dens rekonstruktion. For vektordatabaser beskriver forfatterne recall som den mere relevante måling, specifikt for gen‑ranking; recall@10 måles ved at beregne hver forespørgsels 1.000 datasetvektorer med maksimal prikprodukt og kontrollere, hvilken andel af kvantisatorens estimerede top‑10 der falder inden for de faktiske top‑10, gennemsnitligt over alle forespørgsler. Encode‑tids‑tallene i meddelelsen blev indsamlet på en Apple M2 Pro med 16 GB RAM ved brug af seks tråde, hvor kodning foregik i blokke og blev accelereret gennem multitrådning.
Forfatterne rapporterer, at PQ og OPQ konsekvent leverede den laveste rekonstruktions‑MSE, at EDEN og E‑RaBitQ var sammenlignelige på recall, især ved højere bit‑budgetter, og at EDEN kodede meget hurtigere end PQ, OPQ og E‑RaBitQ, hvilket de beskriver som at gøre den til en god kandidat til de fleste kvantiserings‑applikationer.
Repository, værktøjer og bidrag
Det GitHub repository er MIT-licenseret og angiver vedligeholdere Amir Ingber og Edo Liberty fra Pinecone samt Ashwin Padaki fra University of Pennsylvania. Det leverer et Rust-baseret kommandolinjeværktøj, vqb, hvis JSON‑køringskonfigurationer vælger datasæt, metoder og deres parametre, kvalitetsmålinger, k‑værdier for recall, softmax‑temperaturer, et master‑seed, subsamplings‑tællinger og et trådtælling; et dry‑run‑flag validerer en konfiguration, før noget beregnes. En streaming‑tilstand behandler datasæt, der er større end hukommelsen, ved at læse basisvektorer fra disk i blokke på 256 MB som standard.
Repositoryet accepterer to typer af bidrag, ifølge meddelelsen: nye kvantiserere, som ofte kun er et par linjer kode, der omarrangerer primitive funktioner, som biblioteket allerede leverer, og nye primitive, der implementerer de seks interface‑metoder, som derefter sammensættes med alle andre primitive i kataloget. Evaluerings‑harnessen måler recall@k, rekonstruktion‑ og score‑fejl, bias, softmax‑KL og total variation, størrelse i bits pr. dimension samt kodnings‑, score‑ og rekonstruktionsomkostninger. Forfatterne beskriver denne udgivelse som den første iteration af VQ‑bench og siger, at de vil tilføje flere kvantiserere over tid; rettelser kan indsendes via repositoryets issue‑tracker, og det offentliggjorte benchmark opdateres regelmæssigt med nye metoder indarbejdet.












