Modèles et plateformes d’IA

Pinecone rend open source le cadre de quantification vectorielle VQ-Bench

mm
Ajouter Unite.AI à vos sources préférées sur Google

Pinecone a publié VQ-bench, un cadre open source pour la création et l’évaluation de méthodes de quantification vectorielle, dans une annonce du 17 septembre 2026 par Ashwin Padaki, Amir Ingber et Edo Liberty. Cette sortie associe un site public hébergeant un benchmark en cours des quantifieurs populaires à un dépôt GitHub sous licence MIT ainsi qu’un article présenté à VecDB@VLDB 2026.

Pourquoi Pinecone a créé un benchmark de quantification

La quantification vectorielle réduit le nombre de bits nécessaires pour stocker un vecteur, ce que les auteurs décrivent comme une partie essentielle de la maintenance d’une base de vecteurs et aussi importante tant pour les bases de vecteurs que pour les grands modèles de langage. Pinecone utilise la quantification depuis ses premiers prototypes, et les auteurs ont indiqué que lorsqu’ils ont entrepris d’examiner et de benchmarker les recherches récentes, ils ont constaté que chaque article évaluait les performances différemment : métriques différentes, ensembles de données différents et matériel cible différent. Ils ont déclaré ne pas avoir trouvé d’effort systématique visant à comparer les méthodes de pointe les unes aux autres.

L’hypothèse du projet, selon les auteurs, est que la plupart des quantifieurs publiés sont construits à partir d’un ensemble relativement restreint d’opérations primitives, de sorte que la construction d’un quantifieur peut se réduire à une recette indiquant quelles primitives utiliser et dans quel ordre. L’article compagnon, soumis à arXiv le 31 juillet 2026, indique que le cadre décrit sept primitives conceptuelles de quantification, montre comment les composer de manière arbitraire et réexprime 25 quantifieurs courants comme des pipelines de ces primitives.

Comment VQ-Bench compose les quantifieurs

Dans VQ-bench, un quantifieur est tout ce qui peut prendre un ensemble de vecteurs, les compresser et récupérer les informations souhaitées ultérieurement. Un quantifieur doit implémenter quatre méthodes : fit, qui apprend un modèle à partir d’un échantillon de vecteurs et éventuellement de requêtes ; encode, qui renvoie les codes par vecteur à partir du modèle ; reconstruct, qui reconstruit un vecteur à partir du modèle et de son code ; et score, qui estime le produit scalaire entre un vecteur de requête et un vecteur codé.

Une primitive implémente les mêmes quatre méthodes plus deux supplémentaires, apply et apply_queries, qui spécifient comment l’étape transmet les données à la suivante. Ces deux méthodes constituent le contrat d’enchaînement qui permet de composer les primitives. VQ-bench implémente trois groupes de primitives : les conditionneurs tels que Center, Normalize, PCA et RandomRotate ; les arrondisseurs tels que CastUint, CastAngular, CastNormal et KMeans ; et les séparateurs tels que Segment.

Un pipeline enchaîne deux primitives ou plus. Les méthodes fit et encode font progresser les vecteurs à travers la chaîne, exécutant le travail de chaque étape et concaténant le modèle appris et les codes de sortie de chaque étape ; reconstruct commence à la dernière étape et remonte en arrière, chaque étape réintégrant sa propre contribution ; et score pousse d’abord la requête en avant via apply_queries avant d’exécuter le même passage en arrière. Un quantifieur n’a pas besoin d’être un pipeline, puisque tout ce qui implémente les quatre méthodes est admissible, mais les auteurs rapportent que la plupart des quantifieurs publiés peuvent être exprimés comme des pipelines de primitives.

L’annonce illustre E‑RaBitQ comme un pipeline d’exemple composé de quatre primitives : Center, qui soustrait le vecteur moyen du jeu de données à chaque vecteur ; Normalize, qui met chaque vecteur à l’échelle pour obtenir une norme unité ; une rotation aléatoire appliquant une transformation orthogonale ou de Hadamard aléatoire ; et un cast angulaire qui projette chaque vecteur sur une grille d’entiers à b bits en arrondissant au point de grille le plus proche en angle.

Configuration du benchmark et résultats rapportés

Les auteurs ont évalué une suite de 14 quantifieurs sur cinq ensembles de données provenant de VIBE, présentant des résultats détaillés pour deux d’entre eux : ArXiv, avec 1 344 643 vecteurs en 768 dimensions, et Yahoo, avec 677 305 vecteurs en 384 dimensions. Les résultats complets sont publiés sur le site web du benchmark du projet.

L’erreur quadratique moyenne de reconstruction, que les auteurs désignent comme la métrique traditionnelle pour la quantification vectorielle et importante pour des applications telles que la compression des poids de LLM, est mesurée sur 1 000 vecteurs du jeu de données échantillonnés aléatoirement comme la distance quadratique moyenne entre chaque vecteur et sa reconstruction. Pour les bases de vecteurs, les auteurs décrivent le rappel comme la métrique la plus pertinente, notamment pour le re‑ranking ; le rappel@10 est mesuré en calculant, pour chaque requête, les 1 000 vecteurs du jeu de données ayant le produit scalaire maximal et en vérifiant quelle fraction des 10 premiers estimés par le quantifieur se trouve parmi les vrais 10 premiers, moyenne sur toutes les requêtes. Les chiffres de temps d’encodage présentés dans l’annonce ont été obtenus sur un Apple M2 Pro avec 16 Go de RAM en utilisant six threads, l’encodage étant effectué par blocs et accéléré par le multithreading.

Les auteurs rapportent que PQ et OPQ produisent constamment le MSE de reconstruction le plus bas, que EDEN et E‑RaBitQ sont comparables en rappel, notamment avec des budgets de bits plus élevés, et que EDEN encode beaucoup plus rapidement que PQ, OPQ et E‑RaBitQ, ce qu’ils décrivent comme en faisant un bon candidat pour la plupart des applications de quantification.

Dépôt, outils et contributions

Le dépôt GitHub est sous licence MIT et indique les mainteneurs Amir Ingber et Edo Liberty de Pinecone ainsi qu’Ashwin Padaki de l’Université de Pennsylvanie. Il fournit un outil en ligne de commande basé sur Rust, vqb, dont les configurations d’exécution JSON permettent de sélectionner les jeux de données, les méthodes et leurs paramètres, les métriques de qualité, les valeurs k pour le rappel, les températures softmax, une graine maître, les comptes de sous‑échantillonnage et le nombre de threads ; un drapeau dry‑run flag valide une configuration avant que quoi que ce soit ne soit calculé. Un mode streaming traite les jeux de données plus volumineux que la mémoire en lisant les vecteurs de base depuis le disque par blocs de 256 Mo par défaut.

Le dépôt accepte deux types de contributions, selon l’annonce : de nouveaux quantiseurs, qui ne sont souvent que quelques lignes de code réordonnant des primitives déjà fournies par la bibliothèque, et de nouvelles primitives implémentant les six méthodes d’interface, qui se combinent ensuite avec chaque autre primitive du catalogue. Le dispositif d’évaluation mesure le recall@k, la reconstruction et l’erreur de score, le biais, le softmax KL et la variation totale, la taille en bits par dimension, ainsi que les coûts d’encodage, de score et de reconstruction. Les auteurs décrivent cette version comme la première itération de VQ‑bench et indiquent qu’ils ajouteront davantage de quantiseurs au fil du temps ; les corrections peuvent être soumises via le système de suivi des problèmes du dépôt, et le benchmark publié est actualisé à intervalles réguliers avec l’intégration de nouvelles méthodes.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.