Моделі та платформи ШІ

Pinecone відкриває вихідний код VQ‑Bench – фреймворк векторної квантизації

mm
Додайте Unite.AI до бажаних джерел у Google

Pinecone випустив VQ‑bench, фреймворк з відкритим кодом для створення та тестування методів векторної квантизації, у оголошенні від 17 вересня 2026 року за участі Ашвіна Падакі, Аміра Інгбера та Edo Liberty.

Чому Pinecone створив бенчмарк квантизації

Векторна квантизація зменшує кількість біт, необхідних для зберігання вектора, що, за словами авторів, є критично важливою частиною підтримки векторної бази даних і важливою як для векторних баз даних, так і для великих мовних моделей. Pinecone використовує квантизацію з перших прототипів, і автори зазначили, що коли вони вирішили дослідити та протестувати нові дослідження, виявили, що кожна стаття оцінює продуктивність по‑різному: різні метрики, різні набори даних і різне цільове обладнання. Вони сказали, що не змогли знайти жодної систематичної спроби порівняти провідні методи між собою.

Передумова проєкту, за словами авторів, полягає в тому, що більшість опублікованих квантизаторів складаються з відносно невеликого набору примітивних операцій, тому створення квантизатора можна звести до рецепту, які примітиви використовувати і в якому порядку. Допоміжна стаття, подана до arXiv 31 липня 2026 року, стверджує, що фреймворк описує сім концептуальних примітивів квантизації, показує, як їх довільно комбінувати, і переосмислює 25 поширених квантизаторів як конвеєри цих примітивів.

Як VQ‑Bench формує квантизатори

У VQ‑bench квантизатор — це будь‑яка система, яка може приймати набір векторів, стискати їх і пізніше відновлювати потрібну інформацію. Квантизатор повинен реалізувати чотири методи: fit — навчає модель на вибірці векторів і, за потреби, запитах; encode — повертає коди для кожного вектора згідно моделі; reconstruct — відтворює вектор за допомогою моделі та його коду; та score — оцінює скалярний добуток між вектором‑запитом і закодованим вектором.

Примітив реалізує ті ж чотири методи плюс ще два — apply та apply_queries, які визначають, як етап передає дані наступному. Ці два методи формують контракт ланцюжка, що дозволяє комбінувати примітиви. VQ‑bench реалізує три групи примітивів: кондиціонери, такі як Center, Normalize, PCA та RandomRotate; округлювачі, такі як CastUint, CastAngular, CastNormal та KMeans; та розділювачі, такі як Segment.

Конвеєр з’єднує два або більше примітивів. Методи fit і encode проходять вектори вперед по ланцюжку, виконуючи роботу кожного етапу та конкатенуючи навчений модель та вихідні коди; reconstruct стартує з останнього етапу і рухається назад, при цьому кожен етап додає свій внесок; а score спочатку просуває запит вперед через apply_queries, а потім виконує той самий зворотний прохід. Квантизатор не обов’язково має бути конвеєром, оскільки будь‑яка реалізація чотирьох методів підходить, проте автори повідомляють, що більшість опублікованих квантизаторів можна виразити як конвеєри примітивів.

Оголошення демонструє E‑RaBitQ як приклад конвеєра з чотирьох примітивів: Center, який віднімає середній вектор набору даних від кожного вектора; Normalize, який масштабує кожен вектор до одиничної норми; випадкове обертання, що застосовує випадкове ортогональне або Хадамардове перетворення; та кутове кодування, яке «запікає» кожен вектор у b‑бітову цілу решітку, округляючи до найближчої точки решітки за кутом.

Налаштування бенчмарку та повідомлені результати

Автори оцінили набір з 14 квантизаторів на п’яти наборах даних з VIBE, подаючи докладні результати для двох з них: ArXiv, що містить 1 344 643 вектори у 768 вимірах, та Yahoo, що містить 677 305 векторів у 384 вимірах. Повні результати опубліковані на веб‑сайті бенчмарку проєкту.

Середньоквадратична помилка реконструкції, яку автори називають традиційною метрикою для векторної квантизації та важливою для застосувань, таких як стискання ваг LLM, вимірюється на 1 000 випадково вибраних векторів набору даних як середнє квадратичне відхилення між кожним вектором та його реконструкцією. Для векторних баз даних автори описують recall як більш релевантну метрику, зокрема для переранжирування; recall@10 вимірюється шляхом обчислення 1 000 векторів набору даних з максимальним скалярним добутком для кожного запиту та перевірки, яка частка оцінених квантизатором топ‑10 входить у справжні топ‑10, усереднено по всіх запитах. Час кодування, зазначений в оголошенні, був отриманий на Apple M2 Pro з 16 ГБ ОЗП, використовуючи шість потоків, при кодуванні блоками та прискоренні за допомогою багатопоточності.

Автори повідомляють, що PQ та OPQ послідовно забезпечували найнижчу MSE реконструкції, що EDEN та E‑RaBitQ були порівнянними за recall, особливо при вищих бітових бюджетах, і що EDEN кодував значно швидше, ніж PQ, OPQ та E‑RaBitQ, що, за їх словами, робить його хорошим кандидатом для більшості застосувань квантизації.

Репозиторій, інструменти та внески

The GitHub repository має ліцензію MIT і містить список супроводжувачів Amir Ingber і Edo Liberty з Pinecone та Ashwin Padaki з University of Pennsylvania. У комплекті є інструмент командного рядка на Rust, vqb, конфігурації запуску у форматі JSON дозволяють вибирати набори даних, методи та їх параметри, метрики якості, значення k для recall, температури softmax, головне зерно, кількість підвибірок і кількість потоків; прапорець dry‑run перевіряє конфігурацію перед обчисленнями. Режим потокової обробки обробляє набори даних, що перевищують обсяг пам’яті, читаючи базові вектори з диска блоками по 256 MB за замовчуванням.

Репозиторій приймає два типи внесків, згідно з оголошенням: нові квантизатори, які часто складаються з кількох рядків коду, що переупорядковують примітиви, вже включені в бібліотеку, та нові примітиви, що реалізують шість методів інтерфейсу, які потім комбінуються з усіма іншими примітивами в каталозі. Оцінювальний каркас вимірює recall@k, помилку реконструкції та оцінки, упередженість, softmax KL та total variation, розмір у бітах на вимір, а також вартість кодування, оцінки та реконструкції. Автори описують цей випуск як першу ітерацію VQ-bench і зазначили, що з часом додадуть більше квантизаторів; виправлення можна подавати через issue tracker репозиторію, а опублікований бенчмарк оновлюється регулярно новими методами.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.