Fondamentaux de l’IA

Qu’est-ce que la recherche de similarité vectorielle (VSS) et comment est-elle utile ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

La recherche de données modernes est un domaine complexe. La recherche de similarité vectorielle, ou VSS, représente les données avec une profondeur contextuelle et renvoie des informations plus pertinentes aux consommateurs en réponse à une requête de recherche. Considérons un exemple simple.

Les requêtes de recherche comme « science des données » et « fiction scientifique » font référence à différents types de contenu malgré le fait qu’elles partagent un mot commun (« science »). Une technique de recherche traditionnelle correspondrait aux phrases communes pour renvoyer des résultats pertinents, ce qui serait inexact dans ce cas. La recherche de similarité vectorielle prendrait en compte l’intention réelle de recherche et le sens de ces requêtes de recherche pour renvoyer une réponse plus précise.

Cet article discutera de divers aspects de la recherche de similarité vectorielle, tels que ses composants, défis, avantages et cas d’utilisation. Commençons.

Qu’est-ce que la recherche de similarité vectorielle (VSS) ?

La recherche de similarité vectorielle trouve et récupère des informations contextuellement similaires à partir de grandes collections de données structurées ou non structurées en les transformant en représentations numériques appelées vecteurs ou embeddings.

La VSS peut gérer une variété de formats de données, notamment numériques, catégoriels, textuels, d’images et de vidéos. Elle convertit chaque objet dans un corpus de données en une représentation vectorielle à haute dimension correspondant à son format pertinent (discuté dans la section suivante).

La plupart du temps, la VSS localise des objets comparables, tels que des phrases ou des paragraphes similaires, ou trouve des images liées dans de vastes systèmes de récupération d’images. De grandes entreprises de consommation comme Amazon (AMZN ), eBay et Spotify utilisent cette technologie pour améliorer les résultats de recherche pour des millions d’utilisateurs, c’est-à-dire servir du contenu pertinent que les utilisateurs aimeraient probablement acheter, regarder ou écouter.

Trois principaux composants de la recherche de similarité vectorielle

Avant de comprendre comment fonctionne la recherche de similarité vectorielle, examinons ses principaux composants. Principalement, il existe trois composants essentiels pour mettre en œuvre une méthodologie VSS efficace :

  1. Les embeddings vectoriels : les embeddings représentent différents types de données dans un format mathématique, c’est-à-dire un tableau ordonné ou un ensemble de nombres. Ils identifient des modèles dans les données à l’aide de calculs mathématiques.
  2. Les métriques de distance ou de similarité : ce sont des fonctions mathématiques qui calculent à quel point deux vecteurs sont similaires ou étroitement liés.
  3. Les algorithmes de recherche : les algorithmes aident à trouver des vecteurs similaires à une requête de recherche donnée. Par exemple, l’algorithme K-Nearest Neighbors ou KNN est fréquemment utilisé dans les systèmes de recherche VSS pour déterminer les K vecteurs dans un ensemble de données qui sont les plus similaires à une requête d’entrée donnée.

Maintenant, discutons de la façon dont ces composants fonctionnent dans un système de recherche.

Comment fonctionne la recherche de similarité vectorielle ?

La première étape de la mise en œuvre de la recherche de similarité vectorielle consiste à représenter ou à décrire les objets dans le corpus de données sous forme d’embeddings vectoriels. Elle utilise différentes méthodes d’embedding vectoriel, telles que GloVe, Word2vec et BERT, pour mapper les objets à l’espace vectoriel.

Pour chaque format de données, comme le texte, l’audio et la vidéo, la VSS construit différents modèles d’embedding, mais le résultat final de ce processus est une représentation numérique sous forme de tableau.

L’étape suivante consiste à créer un index qui peut organiser les objets similaires ensemble en utilisant ces représentations numériques. Un algorithme comme KNN sert de base pour la mise en œuvre de la similarité de recherche. Cependant, pour indexer des termes similaires, les systèmes de recherche utilisent des approches modernes, telles que Locality Sensitive Hashing (LSH) et Approximate Nearest Neighbor (ANNOY).

De plus, les algorithmes VSS calculent une mesure de similarité ou de distance, telle que la distance euclidienne, la similarité cosinus ou la similarité de Jaccard, pour comparer toutes les représentations vectorielles dans la collection de données et renvoyer un contenu similaire en réponse à une requête utilisateur.

Principaux défis et avantages de la recherche de similarité vectorielle

Dans l’ensemble, l’objectif est de trouver des caractéristiques communes parmi les objets de données. Cependant, ce processus présente plusieurs défis potentiels.

Principaux défis de la mise en œuvre de la VSS

  • Les différentes techniques d’embedding vectoriel et les mesures de similarité présentent des résultats différents. Le choix des configurations appropriées pour les systèmes de recherche de similarité est le principal défi.
  • Pour les grands ensembles de données, la VSS est coûteuse en termes de calcul et nécessite des GPU haute performance pour créer des indexes à grande échelle.
  • Les vecteurs avec trop de dimensions peuvent ne pas représenter avec précision la structure et les connexions réelles des données. Par conséquent, le processus d’embedding vectoriel doit être sans perte, ce qui constitue un défi.

Actuellement, la technologie VSS est en constante développement et amélioration. Cependant, elle peut encore offrir de nombreux avantages pour l’expérience de recherche d’une entreprise ou d’un produit.

Avantages de la VSS

  • La VSS permet aux systèmes de recherche de localiser des objets similaires de manière incroyablement rapide sur différents types de données.
  • La VSS assure une gestion efficace de la mémoire, car elle convertit tous les objets de données en embeddings numériques que les machines peuvent traiter facilement.
  • La VSS peut classer les objets sur de nouvelles requêtes de recherche que le système n’a peut-être pas rencontrées auparavant.
  • La VSS est une excellente méthode pour traiter les données pauvres et incomplètes, car elle peut trouver des objets contextuellement similaires même s’ils ne sont pas une correspondance parfaite.
  • Le plus important, elle peut détecter et regrouper des objets liés à grande échelle (volumes de données variables).

Principaux cas d’utilisation commerciaux de la recherche de similarité vectorielle

Dans les entreprises commerciales, la technologie VSS peut révolutionner un large éventail d’industries et d’applications. Certains de ces cas d’utilisation incluent :

  • Les questions-réponses : la recherche de similarité vectorielle peut localiser des questions liées dans les forums de questions-réponses qui sont presque identiques, permettant des réponses plus précises et plus pertinentes pour les utilisateurs finals.
  • La recherche sémantique Web : la recherche de similarité vectorielle peut localiser des documents ou des pages Web liés en fonction de la « proximité » de leurs représentations vectorielles. Elle vise à augmenter la pertinence des résultats de recherche Web.
  • Les recommandations de produits : la recherche de similarité vectorielle peut faire des recommandations de produits personnalisés en fonction de l’historique de navigation ou de recherche de l’utilisateur.
  • Une meilleure prestation de soins de santé : les chercheurs et les praticiens de soins de santé utilisent la recherche de similarité vectorielle pour optimiser les essais cliniques en analysant les représentations vectorielles de la recherche médicale pertinente.

Aujourd’hui, il n’est plus viable de gérer, d’analyser et de rechercher des données à l’aide de techniques SQL traditionnelles. Les consommateurs Internet posent des requêtes complexes sur le Web – apparemment simples pour les humains mais incroyablement complexes pour les machines (moteurs de recherche) à interpréter. Il s’agit d’un défi de longue date pour les machines de déchiffrer différents types de données dans un format compréhensible par les machines.

La recherche de similarité vectorielle permet aux systèmes de recherche de mieux comprendre le contexte de l’information commerciale.

Vous souhaitez lire plus de contenu lié à l’IA ? Visitez unite.ai.

Haziqa est un Data Scientist avec une expérience approfondie dans la rédaction de contenu technique pour les entreprises d'IA et de SaaS.