Fondamenti di IA

Cos’è la Ricerca di Similarità Vettoriale (VSS) e Come è Utile?

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

La ricerca di dati moderna è un dominio complesso. La ricerca di similarità vettoriale, o VSS, rappresenta i dati con una profondità contestuale e restituisce informazioni più rilevanti ai consumatori in risposta a una query di ricerca. Prendiamo un esempio semplice.

Le query di ricerca come “scienza dei dati” e “fantascienza” si riferiscono a tipi di contenuto diversi nonostante entrambi abbiano una parola comune (“scienza”). Una tecnica di ricerca tradizionale corrisponderebbe a frasi comuni per restituire risultati rilevanti, che sarebbero inaccurati in questo caso. La ricerca di similarità vettoriale considererebbe l’intento di ricerca effettivo e il significato di queste query di ricerca per restituire una risposta più precisa.

Questo articolo discuterà vari aspetti della ricerca di similarità vettoriale, come i suoi componenti, le sfide, i benefici e i casi d’uso. Iniziamo.

Cos’è la Ricerca di Similarità Vettoriale (VSS)?

La ricerca di similarità vettoriale trova e recupera informazioni contestualmente simili da grandi raccolte di dati strutturati o non strutturati trasformandoli in rappresentazioni numeriche note come vettori o incorporamenti.

La VSS può gestire una varietà di formati di dati, inclusi numerici, categoriali, testuali, immagini e video. Converte ogni oggetto in un corpus di dati in una rappresentazione vettoriale ad alta dimensionalità corrispondente al suo formato rilevante (discusso nella prossima sezione).

Nella maggior parte dei casi, la VSS localizza oggetti confrontabili, come frasi o paragrafi simili, o trova immagini correlate in vasti sistemi di recupero di immagini. Grandi aziende di consumo come Amazon (AMZN ), eBay e Spotify utilizzano questa tecnologia per migliorare i risultati di ricerca per milioni di utenti, ovvero servire contenuti rilevanti che gli utenti probabilmente vorrebbero acquistare, guardare o ascoltare.

I Tre Principali Componenti della Ricerca di Similarità Vettoriale

Prima di capire come funziona la ricerca di similarità vettoriale, analizziamo i suoi principali componenti. In primo luogo, ci sono tre componenti essenziali per implementare una metodologia VSS efficace:

  1. Incorporamenti vettoriali: gli incorporamenti rappresentano diversi tipi di dati in un formato matematico, ovvero un array ordinato o un insieme di numeri. Identificano modelli nei dati utilizzando calcoli matematici.
  2. Misurazioni di distanza o similarità: queste sono funzioni matematiche che calcolano quanto sono simili o strettamente correlate due vettori.
  3. Algoritmi di ricerca: gli algoritmi aiutano a trovare vettori simili a una query di ricerca data. Ad esempio, l’algoritmo K-Nearest Neighbors o KNN viene frequentemente utilizzato nei sistemi di ricerca abilitati VSS per determinare K vettori in un set di dati che sono più simili a una query di input data.

Ora, discutiamo come questi componenti funzionano in un sistema di ricerca.

Come Funziona la Ricerca di Similarità Vettoriale?

Il primo passo nell’implementare la ricerca di similarità vettoriale è rappresentare o descrivere gli oggetti nel corpus di dati come incorporamenti vettoriali. Utilizza diversi metodi di incorporamento vettoriale, come GloVe, Word2vec e BERT, per mappare gli oggetti nello spazio vettoriale.

Per ogni formato di dati, come testo, audio e video, la VSS costruisce diversi modelli di incorporamento, ma il risultato finale di questo processo è una rappresentazione di array numerico.

Il passo successivo è creare un indice che possa organizzare oggetti simili insieme utilizzando queste rappresentazioni numeriche. Un algoritmo come KNN serve come fondamento per l’implementazione della similarità di ricerca. Tuttavia, per indicizzare termini simili, i sistemi di ricerca utilizzano approcci moderni, come Locality Sensitive Hashing (LSH) e Approximate Nearest Neighbor (ANNOY).

Inoltre, gli algoritmi VSS calcolano una misura di similarità o distanza, come la distanza euclidea, la similarità coseno o la similarità di Jaccard, per confrontare tutte le rappresentazioni vettoriali nel set di dati e restituire contenuti simili in risposta a una query dell’utente.

Sfide e Benefici Principali della Ricerca di Similarità Vettoriale

Nel complesso, l’obiettivo è trovare caratteristiche comuni tra gli oggetti dei dati. Tuttavia, questo processo presenta diverse sfide potenziali.

Principali Sfide dell’Implementazione della VSS

  • Diverse tecniche di incorporamento vettoriale e misure di similarità presentano risultati diversi. Scegliere le configurazioni appropriate per i sistemi di ricerca di similarità è la principale sfida.
  • Per grandi set di dati, la VSS è costosa in termini computazionali e richiede GPU ad alte prestazioni per creare indici su larga scala.
  • I vettori con troppe dimensioni potrebbero non rappresentare accuratamente la struttura e le connessioni autentiche dei dati. Pertanto, il processo di incorporamento vettoriale deve essere privo di perdite, il che è una sfida.

Attualmente, la tecnologia VSS è in continua sviluppo e miglioramento. Tuttavia, può ancora offrire molti benefici per l’esperienza di ricerca di un’azienda o di un prodotto.

Benefici della VSS

  • La VSS consente ai sistemi di ricerca di localizzare oggetti simili in modo incredibilmente veloce su diversi tipi di dati.
  • La VSS garantisce una gestione efficiente della memoria poiché converte tutti gli oggetti dei dati in incorporamenti numerici che le macchine possono elaborare facilmente.
  • La VSS può classificare oggetti su nuove query di ricerca che il sistema potrebbe non aver incontrato dagli utenti.
  • La VSS è un ottimo metodo per gestire dati scarsi e incompleti poiché può trovare oggetti contestualmente simili anche se non sono una corrispondenza perfetta.
  • Soprattutto, può rilevare e raggruppare oggetti correlati su larga scala (volumi di dati variabili).

Principali Casi d’Uso Commerciali della Ricerca di Similarità Vettoriale

Nel business commerciale, la tecnologia VSS può rivoluzionare una vasta gamma di settori e applicazioni. Alcuni di questi casi d’uso includono:

  • Risposte alle domande: la ricerca di similarità vettoriale può localizzare domande correlate in forum di domande e risposte che sono quasi identiche, consentendo risposte più precise e pertinenti per gli utenti finali.
  • Ricerca web semantica: la ricerca di similarità vettoriale può localizzare documenti o pagine web correlate in base alla “vicinanza” delle loro rappresentazioni vettoriali. Si propone di aumentare la rilevanza dei risultati di ricerca web.
  • Raccomandazioni di prodotti: la ricerca di similarità vettoriale può offrire raccomandazioni di prodotti personalizzate in base alla cronologia di navigazione o di ricerca dell’utente.
  • Miglioramento della consegna dei servizi sanitari: i ricercatori e gli operatori sanitari utilizzano la ricerca di similarità vettoriale per ottimizzare gli studi clinici analizzando le rappresentazioni vettoriali di ricerche mediche rilevanti.

Oggi, non è più possibile gestire, analizzare e cercare dati utilizzando tecniche basate su SQL tradizionali. I consumatori di Internet pongono query complesse sul web – apparentemente semplici per gli esseri umani ma incredibilmente complesse per le macchine (motori di ricerca) da interpretare. È una sfida di lunga data per le macchine decifrare diversi tipi di dati in un formato comprensibile alle macchine.

La ricerca di similarità vettoriale consente ai sistemi di ricerca di comprendere meglio il contesto delle informazioni commerciali.

Desideri leggere altri contenuti relativi all’intelligenza artificiale? Visita unite.ai.

Haziqa è uno scienziato dei dati con una vasta esperienza nella scrittura di contenuti tecnici per aziende di intelligenza artificiale e SaaS.