Модели и платформы ИИ

Pinecone открывает исходный код VQ‑Bench, фреймворка векторного квантования

mm
Добавьте Unite.AI в избранные источники в Google

Pinecone выпустила VQ‑bench, открытый фреймворк для создания и тестирования методов векторного квантования, в объявлении от 17 сентября 2026 года от Ашвина Падаки, Амира Ингбера и Edo Liberty. Выпуск сопровождается публичным веб‑сайтом с работающим бенчмарком популярных квантователей, репозиторием на GitHub под лицензией MIT и статьёй, представленной на VecDB@VLDB 2026.

Почему Pinecone создал бенчмарк квантования

Векторное квантование уменьшает количество бит, необходимых для хранения вектора, что авторы описывают как критически важную часть поддержки векторных баз данных и как значимое как для векторных баз данных, так и для больших языковых моделей. Pinecone использует квантование с первых прототипов, и авторы написали, что, когда они начали исследовать и тестировать новые работы, они обнаружили, что каждая статья оценивает производительность по‑разному: разные метрики, разные наборы данных и разное целевое оборудование. Они заявили, что не смогли найти систематическую попытку сравнить ведущие методы друг с другом.

Суть проекта, по словам авторов, заключается в том, что большинство опубликованных квантователей собираются из относительно небольшого набора примитивных операций, поэтому построение квантователя можно свести к рецепту, указывающему, какие примитивы использовать и в каком порядке. Сопутствующая статья, представлена в arXiv 31 июля 2026 года, утверждает, что фреймворк описывает семь концептуальных примитивов квантования, демонстрирует их произвольную композицию и переопределяет 25 распространённых квантователей как конвейеры из этих примитивов.

Как VQ‑Bench собирает квантователи

В VQ‑bench квантователем считается любой объект, способный принимать набор векторов, сжимать их и позже восстанавливать требуемую информацию. Квантователь должен реализовать четыре метода: fit — обучает модель на выборке векторов и, при необходимости, запросах; encode — возвращает коды для каждого вектора на основе модели; reconstruct — восстанавливает вектор из модели и его кода; и score — оценивает скалярное произведение между запросным вектором и закодированным вектором.

Примитив реализует те же четыре метода, а также два дополнительных — apply и apply_queries, которые определяют, как этап передаёт данные следующему. Эти два метода образуют контракт цепочки, позволяющий комбинировать примитивы. VQ‑bench реализует три группы примитивов: условные (conditioners), такие как Center, Normalize, PCA и RandomRotate; округляющие (rounders), такие как CastUint, CastAngular, CastNormal и KMeans; и разделяющие (splitters), такие как Segment.

Конвейер соединяет два или более примитива. Методы fit и encode последовательно пропускают векторы через цепочку, выполняя работу каждого этапа и объединяя обученные модели и выходные коды; reconstruct начинается с последнего этапа и движется назад, при этом каждый этап возвращает свой вклад; а score сначала продвигает запрос вперёд через apply_queries, а затем выполняет тот же обратный проход. Квантователь не обязан быть конвейером, поскольку любой объект, реализующий четыре метода, подходит, однако авторы отмечают, что большинство опубликованных квантователей можно представить как конвейеры из примитивов.

В объявлении в качестве примера конвейера из четырёх примитивов используется E‑RaBitQ: Center, который вычитает средний вектор набора данных из каждого вектора; Normalize, масштабирующий каждый вектор до единичной нормы; случайное вращение, применяющее случайное ортогональное или преобразование Хаддамара; и угловой каст, фиксирующий каждый вектор на b‑битной целочисленной сетке путём округления до ближайшей точки сетки по углу.

Настройка бенчмарка и полученные результаты

Авторы оценили набор из 14 квантователей на пяти наборах данных VIBE, представив подробные результаты для двух из них: ArXiv, содержащий 1 344 643 вектора в 768 измерениях, и Yahoo, содержащий 677 305 векторов в 384 измерениях. Полные результаты опубликованы на веб‑сайте бенчмарка проекта.

Среднеквадратичная ошибка восстановления (MSE), которую авторы называют традиционной метрикой для векторного квантования и важной для таких применений, как сжатие весов LLM, измеряется на 1 000 случайно выбранных векторов набора данных как среднее значение квадрата расстояния между каждым вектором и его восстановлением. Для векторных баз данных авторы считают метрикой recall более значимой, особенно для переупорядочения; recall@10 измеряется путем вычисления 1 000 векторов набора данных с максимальным скалярным произведением для каждого запроса и проверки, какая доля из топ‑10, оценённых квантователем, попадает в истинный топ‑10, усреднённая по всем запросам. Показатели времени кодирования в объявлении получены на Apple M2 Pro с 16 ГБ ОЗУ, используя шесть потоков; кодирование выполняется блоками и ускоряется многопоточностью.

Авторы сообщают, что PQ и OPQ последовательно дают наименьший MSE восстановления, что EDEN и E‑RaBitQ показывают сопоставимый recall, особенно при больших битовых бюджетах, и что EDEN кодирует значительно быстрее, чем PQ, OPQ и E‑RaBitQ, что, по их словам, делает его хорошим кандидатом для большинства приложений квантования.

Репозиторий, инструменты и вклад

репозиторий GitHub имеет лицензию MIT и перечисляет поддерживающих Амир Ингер и Эдо Либерти из Pinecone и Ашвина Падаки из Университета Пенсильвании. В комплекте поставляется инструмент командной строки, написанный на Rust, vqb, чьи JSON‑конфигурации запуска позволяют выбирать наборы данных, методы и их параметры, метрики качества, значения k для отзыва, температуры softmax, главный seed, количество подвыборок и количество потоков; флаг dry‑run проверяет конфигурацию до начала вычислений. Режим потоковой обработки обрабатывает наборы данных, превышающие объём памяти, читая базовые векторы с диска блоками по умолчанию размером 256 МБ.

Согласно объявлению, репозиторий принимает два типа вклада: новые квантизаторы, которые часто представляют собой несколько строк кода, переупорядочивающих примитивы, уже поставляемые библиотекой, и новые примитивы, реализующие шесть методов интерфейса, которые затем комбинируются с каждым другим примитивом в каталоге. Оценочная система измеряет recall@k, ошибку восстановления и оценки, смещение, softmax KL и полную вариацию, размер в битах на измерение, а также стоимость кодирования, оценки и восстановления. Авторы описывают этот релиз как первую итерацию VQ-bench и заявили, что со временем добавят больше квантизаторов; исправления можно подавать через трекер проблем репозитория, а опубликованный бенчмарк регулярно обновляется новыми методами.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.