Modely a platformy AI
Pinecone Open-Source VQ-Bench – rámec pro vektorovou kvantizaci

Pinecone vydal VQ-bench, open-source rámec pro vytváření a testování metod vektorové kvantizace, v oznámení ze 17. září 2026 od Ashwin Padaki, Amir Ingber a Edo Liberty. Vydání spojuje veřejnou webovou stránku s běžícím benchmarkem populárních kvantizérů s repozitářem na GitHubu pod licencí MIT a článkem představeným na konferenci VecDB@VLDB 2026.
Proč Pinecone vytvořil benchmark kvantizace
Vektorová kvantizace snižuje počet bitů potřebných k uložení vektoru, což autoři popisují jako klíčovou součást údržby vektorové databáze a jako důležité jak pro vektorové databáze, tak pro velké jazykové modely. Pinecone používá kvantizaci od svých prvních prototypů a autoři napsali, že když se pustili do přehledu a benchmarku novějšího výzkumu, zjistili, že každá práce hodnotí výkon odlišně: různé metriky, různé datové sady a odlišný cílový hardware. Řekli, že nenašli žádný systematický pokus o srovnání předních metod mezi sebou.
Premisa projektu, jak ji autoři popisují, spočívá v tom, že většina publikovaných kvantizérů je sestavena z relativně malého souboru primitivních operací, takže vytvoření kvantizéru lze zredukovat na recept, které primitivy použít a v jakém pořadí. doprovodný článek, odeslaný na arXiv 31. července 2026, uvádí, že rámec popisuje sedm konceptuálních kvantizačních primitiv, ukazuje, jak je lze libovolně skládati, a přeformuluje 25 běžných kvantizérů jako pipeline těchto primitiv.
Jak VQ-Bench skládá kvantizéry
V VQ-bench je kvantizér čímkoli, co dokáže přijmout sadu vektorů, komprimovat je a později obnovit požadované informace. Kvantizér musí implementovat čtyři metody: fit, která se učí model ze vzorku vektorů a volitelně dotazy; encode, která vrací kódy pro jednotlivé vektory na základě modelu; reconstruct, která z modelu a kódu znovu sestaví vektor; a score, která odhaduje skalární součin mezi dotazovacím vektorem a kódovaným vektorem.
Primitiva implementují stejných čtyři metody plus dvě další, apply a apply_queries, které určují, jak fáze předává data další. Tyto dvě metody tvoří řetězcovou smlouvu, která umožňuje skládání primitiv. VQ-bench implementuje tři skupiny primitiv: kondicionéry jako Center, Normalize, PCA a RandomRotate; zaokrouhlovače jako CastUint, CastAngular, CastNormal a KMeans; a rozdělovatele jako Segment.
Pipeline spojuje dva nebo více primitiv. Metody fit a encode posouvají vektory dopředu skrz řetězec, vykonávají úlohu každé fáze a spojují naučený model a výstupní kódy každé fáze; reconstruct začíná na poslední fázi a jde zpět, přičemž každá fáze vrací svůj příspěvek; a score nejprve posune dotaz dopředu pomocí apply_queries, než provede stejný zpětný průchod. Kvantizér nemusí být pipeline, protože jakýkoli objekt implementující čtyři metody je způsobilý, ale autoři uvádějí, že většina publikovaných kvantizérů lze vyjádřit jako pipeline primitiv.
Oznámení ukazuje E‑RaBitQ jako příklad pipeline se čtyřmi primitivy: Center, který odečítá průměrný vektor datové sady od každého vektoru; Normalize, který škáluje každý vektor na jednotkovou normu; náhodnou rotaci aplikující náhodnou ortogonální nebo Hadamardovu transformaci; a úhlový převod, který zachytí každý vektor na b‑bitovou celočíselnou mřížku zaokrouhlením na nejbližší bod v úhlu.
Nastavení benchmarku a zaznamenané výsledky
Autoři vyhodnotili sadu 14 kvantizérů na pěti datových sadách z VIBE a představili podrobné výsledky pro dvě z nich: ArXiv s 1 344 643 vektory ve 768 rozměrech a Yahoo s 677 305 vektory ve 384 rozměrech. Kompletní výsledky jsou zveřejněny na webu benchmarku projektu.
Střední kvadratická chyba rekonstrukce, kterou autoři označují za tradiční metriku pro vektorovou kvantizaci a která je důležitá pro aplikace jako komprese vah LLM, se měří na 1 000 náhodně vybraných vektorech datové sady jako průměrná čtvercová vzdálenost mezi každým vektorem a jeho rekonstrukcí. Pro vektorové databáze autoři popisují recall jako relevantnější metriku, konkrétně pro přehodnocení; recall@10 se měří tak, že se pro každý dotaz vypočítá 1 000 vektorů s maximálním skalárním součinem a zjistí, jaký podíl odhadovaných top‑10 kvantizérem spadá mezi skutečné top‑10, průměrováno přes všechny dotazy. Čas kódování uvedený v oznámení byl získán na Apple M2 Pro s 16 GB RAM při použití šesti vláken, přičemž kódování probíhalo po blocích a bylo urychleno vícevláknovým zpracováním.
Autoři uvádějí, že PQ a OPQ konzistentně dosahovaly nejnižší MSE rekonstrukce, že EDEN a E‑RaBitQ byly srovnatelné v recall, zejména při vyšších bitových rozpočtech, a že EDEN kóduje mnohem rychleji než PQ, OPQ a E‑RaBitQ, což podle nich činí EDEN dobrým kandidátem pro většinu kvantizačních aplikací.
Repozitář, nástroje a příspěvky
Repozitář GitHub má licenci MIT a uvádí správce Amira Ingbera a Edo Libertyho z Pinecone a Ashwina Padakiho z University of Pennsylvania. Obsahuje nástroj pro příkazovou řádku založený na Rustu, vqb, jehož JSON konfigurace běhu vybírají datové sady, metody a jejich parametry, metriky kvality, hodnoty k pro recall, teploty softmaxu, hlavní seed, počty podvzorkování a počet vláken; příznak dry‑run ověřuje konfiguraci před tím, než se něco vypočítá. Streamovací režim zpracovává datové sady větší než paměť čtením základních vektorů z disku po blocích, ve výchozím nastavení 256 MB.
Repozitář přijímá dva typy příspěvků, podle oznámení: nové kvantizéry, které jsou často jen několik řádků kódu přeuspořádávajících primitivy, jež knihovna již poskytuje, a nové primitivy implementující šest metod rozhraní, které se pak kombinují se všemi ostatními primitivy v katalogu. Vyhodnocovací nástroj měří recall@k, rekonstrukci a chybu skóre, zkreslení, softmax KL a celkovou variaci, velikost v bitech na dimenzi a náklady na kódování, skórování a rekonstrukci. Autoři popisují toto vydání jako první iteraci VQ‑bench a uvedli, že v průběhu času přidají další kvantizéry; opravy lze podávat prostřednictvím issue trackeru repozitáře a publikovaný benchmark se pravidelně aktualizuje s novými metodami.












