Fondamentaux de l’IA

Qu’est‑ce que la recherche de similarité vectorielle et comment fonctionne‑t‑elle ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

La recherche de similarité vectorielle trouve les éléments dont les représentations numériques sont proches d’un vecteur de requête selon une fonction de distance ou de similarité choisie. Un modèle d’intégration (embedding) transforme le texte, les images, l’audio, les produits ou les utilisateurs en vecteurs afin que les éléments liés puissent occuper des régions proches de l’espace de représentation.

L’index de recherche ne comprend pas la similarité indépendamment de l’intégration et de la métrique. Si la représentation encode une mauvaise notion de pertinence, un algorithme de plus proche voisin rapide renverra efficacement les mauvais voisins.

Points clés

  • Le modèle d’intégration, le pré‑traitement et la métrique de distance définissent ce que signifie « proche ».
  • La recherche exacte des k‑plus proches voisins parcourt tous les candidats ; les index approximatifs échangent une partie du rappel contre la vitesse et la mémoire.
  • HNSW, les index à fichiers inversés et la quantification de produit offrent différents compromis de construction, de requête et de mise à jour.
  • Le filtrage des métadonnées, la récupération hybride et le re‑ranking font partie du système, et non des ajouts ultérieurs.
What is Vector Similarity Search and How Does It Work? diagram showing content, embed, index, search, filter + rerank, results
La qualité de la récupération provient de l’intégration, de la métrique, de l’index, des filtres et de l’évaluation fonctionnant comme un seul système.

Intégrations et métriques de similarité

A transformer ou tout autre encodeur convertit un élément en un vecteur de longueur fixe. La similarité cosinus compare les angles, le produit scalaire combine direction et magnitude, et la distance euclidienne mesure la séparation en ligne droite.

La normalisation peut rendre les classements basés sur la similarité cosinus et le produit scalaire équivalents. La métrique utilisée pour entraîner l’intégration doit correspondre à la récupération. Évaluez la pertinence propre au domaine, car la similarité sémantique, la substituabilité et les préférences des utilisateurs sont des objectifs différents.

Recherche exacte vs recherche approximative

La recherche exacte calcule la similarité avec chaque vecteur admissible et renvoie les véritables candidats les plus proches. Elle est simple et précise, mais devient coûteuse à mesure que la collection, la dimension ou le taux de requêtes augmente.

Les index de plus proches voisins approximatifs (ANN) examinent un ensemble de candidats plus restreint. Mesurez le rappel@k par rapport à la vérité terrain exacte ainsi que la latence, le débit et la mémoire. « Approximatif » décrit l’algorithme de recherche, pas la validité de l’intégration elle‑même.

HNSW, fichiers inversés et compression

Les graphes Hiérarchiques Navigables à Petit Monde (HNSW) relient les vecteurs en couches. Une requête descend des liens à longue portée peu denses vers des liens locaux denses. L’étendue de la recherche contrôle un compromis rappel‑latence, tandis que la construction du graphe et les mises à jour consomment de la mémoire.

Les index à fichiers inversés utilisent un regroupement grossier — souvent lié au K-means — pour rechercher des régions sélectionnées. La quantification de produit compresse les sous‑espaces vectoriels, réduisant la mémoire au prix d’une erreur de distance. Faiss combine plusieurs de ces techniques.

Filtrage, récupération hybride et re‑ranking

Les requêtes réelles nécessitent souvent des filtres de locataire, de langue, de date, d’autorisation ou de produit. Le pré‑filtrage peut laisser trop peu de candidats dans le graphe ; le post‑filtrage peut gaspiller le travail de récupération. Les plans d’index et de requête doivent être testés avec une sélectivité de filtre réaliste.

La recherche hybride combine la correspondance lexicale avec la similarité vectorielle afin que les noms exacts et le sens sémantique contribuent tous deux. Un re‑ranker peut appliquer un cross‑encodeur plus coûteux ou des règles métier aux meilleurs candidats. Conservez les contrôles d’autorisation à chaque étape.

Évaluation, mises à jour et dérive

Utilisez des jugements de pertinence étiquetés ou le succès d’une tâche en aval, pas seulement des clusters visuels. Suivez le rappel, la précision, le gain cumulé normalisé décroissant (NDCG), les percentiles de latence, la mémoire, le temps de construction de l’index et la fraîcheur.

Les mises à jour du modèle d’intégration nécessitent un nouveau calcul d’intégration et peuvent déplacer chaque point. Les vecteurs de version et les index, le support de migration à double exécution et la surveillance de la dérive des requêtes/populations sont nécessaires. La réduction de dimensionnalité peut aider à la visualisation mais peut déformer les voisinages et ne doit pas être confondue avec l’évaluation de la récupération.

Intégrations, métriques et structures d’index

La recherche de similarité vectorielle représente les éléments sous forme d’intégrations numériques et récupère les vecteurs proches d’une requête selon une métrique telle que la similarité cosinus, le produit scalaire ou la distance euclidienne. Le modèle d’intégration définit ce que signifie la proximité ; l’index ne fait qu’accélérer cette géométrie. Normalisez les vecteurs lorsque nécessaire, conservez la version du modèle et du pré‑traitement, et ne comparez pas les distances provenant d’espaces d’intégration incompatibles. Un modèle performant pour la sémantique générale peut échouer sur la compatibilité de produits, les citations juridiques, les images, le code ou la terminologie multilingue sans évaluation spécifique au domaine.

La recherche exacte compare chaque vecteur et est simple mais coûteuse à grande échelle. Les méthodes de plus proches voisins approximatifs échangent le rappel contre la vitesse et la mémoire. Les index de graphes comme HNSW naviguent parmi les voisins liés ; les méthodes à fichiers inversés partitionnent les vecteurs en cellules grossières ; la quantification de produit compresse les vecteurs ; les méthodes basées sur le disque échangent stockage et latence. Les paramètres de temps de construction, de requête et de mémoire interagissent. Effectuez des benchmarks sur un nombre de vecteurs, une dimension, des mises à jour, des filtres, une concurrence et un matériel similaires à la production.

Qualité de la récupération et recherche hybride

Créez des requêtes évaluées contenant des éléments pertinents et non pertinents, incluant des termes rares, des ambiguïtés, des textes longs, des langues et la fraîcheur. Mesurez le rappel@k, la précision@k, le rang réciproque moyen, le gain normalisé décroissant, la latence et le coût. Mesurez séparément le rappel ANN par rapport aux voisins exacts et la pertinence sémantique par rapport aux jugements humains. Un index rapide peut récupérer les éléments mathématiquement les plus proches mais erronés si l’intégration est médiocre.

La recherche par mots‑clés reste efficace pour les noms exacts, les identifiants, les dates et les tokens rares. La récupération hybride combine les classements lexicaux et vectoriels, tandis que les filtres de métadonnées imposent le locataire, l’autorisation, la langue, la date et le type. Appliquez l’autorisation avant de renvoyer ou de générer les résultats ; le filtrage après récupération peut divulguer l’existence ou le contenu. Les re‑rankers améliorent la précision avec une latence supplémentaire. Le découpage en fragments doit suivre la structure du document et conserver la source, la version et les décalages pour la citation.

Cycle de vie en production

Les mises à jour nécessitent des identifiants déterministes, la propagation des suppressions, des tombstones ou de la compaction, ainsi qu’une stratégie de ré‑intégration après les changements de modèle. Ne mélangez jamais silencieusement les anciennes et les nouvelles intégrations ; reconstruisez ou versionnez les index et comparez hors ligne avant la transition. Surveillez les distributions des requêtes et des résultats, les recherches vides ou à faible score, la latence, la santé de l’index et les retours évalués. Protégez les intégrations car elles peuvent encoder des informations sensibles et permettre des inférences. La recherche vectorielle est une infrastructure de récupération, pas une garantie de véracité ; les systèmes en aval doivent conserver les preuves et s’abstenir lorsque le soutien est insuffisant.

Exemple pratique : récupération vectorielle consciente des autorisations

Une entreprise découpe les manuels par section, les intègre avec un modèle versionné et stocke l’ID du document, les autorisations, la langue, la version et les décalages. Un ensemble de requêtes évaluées compare la récupération lexicale, vectorielle, hybride et re‑classée. L’évaluation mesure le rappel et la précision à k, la couverture des citations, la latence, le coût et les résultats pour les numéros de pièce exacts et la terminologie multilingue. Le rappel ANN est vérifié séparément par rapport aux voisins vectoriels exacts.

Au moment de la requête, les filtres d’autorisation éliminent les candidats avant que le contenu ne soit renvoyé. Les recherches à faible score s’abstiennent, et la couche de réponse cite les sections sources et indique les conflits. La ré‑intégration construit un nouvel index plutôt que de mélanger les versions de vecteurs, et les événements de suppression retirent la source, les fragments et le cache. La surveillance suit les requêtes vides, les distributions de scores et de latence, les refus d’autorisation et la pertinence examinée. Les intégrations sont protégées en tant que données dérivées sensibles. La similarité récupère des preuves ; elle n’établit pas que les preuves sont vraies ou applicables.

Preuves d’implémentation et préparation opérationnelle

Une décision de production nécessite plus qu’une démonstration réussie. Définissez les utilisateurs prévus, l’environnement d’exploitation, les entrées, les sorties, les dépendances, le propriétaire et les conséquences de chaque défaillance importante. Établissez une base reproductible et un ensemble d’évaluation versionné avant l’ajustement. Testez les cas ordinaires, les conditions limites, les entrées malformées ou manquantes, les changements de distribution, les pannes de dépendances, les usages abusifs, ainsi que les groupes ou environnements les plus susceptibles d’être sous‑servis. Mesurez la qualité de la tâche conjointement avec la calibration ou l’incertitude, la latence, le débit, le coût des ressources, l’accessibilité, la confidentialité et la sécurité. Enregistrez chaque transformation et seuil afin qu’un évaluateur indépendant puisse reproduire le résultat et distinguer les preuves d’un prototype séduisant.

Avant le lancement, attribuez l’autorité pour la mise en production, les exceptions, les changements, le retour en arrière et la retraite. Utilisez un déploiement progressif, conservez une solution de secours sûre et vérifiez la surveillance avec des pannes intentionnellement injectées. La télémétrie opérationnelle doit révéler la qualité des entrées, le comportement des sorties, la version du modèle ou de la règle, l’état des dépendances, les interventions humaines et les résultats confirmés sans collecter de données sensibles inutiles. Définissez les seuils d’alerte et un responsable de réponse, puis examinez les preuves du monde réel après le déploiement plutôt que de supposer que la performance hors ligne persistera. Réévaluez chaque fois que les sources de données, les utilisateurs, les modèles, les fournisseurs, les politiques, le matériel ou les objectifs changent. Un système maintenu nécessite également des procédures documentées de récupération, d’apprentissage d’incident, de suppression et de rétention, ainsi qu’un point clair où il doit être désactivé ou remplacé.

Foire aux questions

Une base de données vectorielle est‑elle requise pour la recherche de similarité ?

Non. Les bibliothèques et les bases de données relationnelles peuvent prendre en charge des index vectoriels. Une base de données spécialisée est utile lorsque son échelle, son filtrage, sa durabilité et ses fonctionnalités opérationnelles correspondent à la charge de travail.

Un embedding de dimension supérieure donne‑t‑il toujours de meilleurs résultats ?

Non. Un nombre de dimensions plus élevé augmente le coût et peut encoder du bruit. Comparez les modèles en fonction de la qualité de récupération représentative, de la latence et du stockage.

Références principales

Haziqa est un Data Scientist avec une expérience approfondie dans la rédaction de contenu technique pour les entreprises d'IA et de SaaS.