Základy AI

Co je Vector Similarity Search & Jak je užitečný?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Moderní vyhledávání dat je složitý obor. Vector similarity search, nebo VSS, reprezentuje data s kontextovou hloubkou a vrací více relevantní informace spotřebitelům v odpovědi na vyhledávací dotaz. Pojďme se podívat na jednoduchý příklad. 

Vyhledávací dotazy jako „data science“ a „science fiction“ se vztahují k různým typům obsahu, přestože obě mají společné slovo („science“). Tradiční vyhledávací technika by našla společné fráze, aby vrátila relevantní výsledky, což by bylo v tomto případě nepřesné. Vector similarity search by zohlednil skutečný vyhledávací záměr a význam těchto vyhledávacích dotazů, aby vrátil více přesnou odpověď.

Tento článek bude diskutovat různé aspekty vector similarity search, jako jsou jeho komponenty, výzvy, výhody a použití. Pojďme začít.

Co je Vector Similarity Search (VSS)?

Vector similarity search najde a načte kontextuálně podobné informace z velkých sbírek strukturovaných nebo nestrukturovaných dat transformací do numerických reprezentací známých jako vektory nebo embeddings.

VSS může zvládnout různé formáty dat, včetně numerických, kategoriálních, textových, obrazových a videí. Převádí každý objekt v datovém korpusu na vysokodimenzionální vektorovou reprezentaci odpovídající jeho relevantnímu formátu (diskutováno v následující sekci). 

Nejčastěji VSS nachází srovnatelné objekty, jako jsou podobné fráze nebo odstavce, nebo najde související obrázky ve velkých systémech pro vyhledávání obrázků. Velké spotřebitelské společnosti, jako jsou Amazon (AMZN ), eBay a Spotify, používají tuto technologii ke zlepšení vyhledávacích výsledků pro miliony uživatelů, tj. slouží relevantní obsah, který uživatelé pravděpodobně budou chtít koupit, sledovat nebo poslouchat.

Tři hlavní komponenty Vector Similarity Search

Než pochopíme, jak vector similarity search funguje, pojďme se podívat na jeho hlavní komponenty. Primárně existují tři základní komponenty pro implementaci efektivní metody VSS:

  1. Vector embeddings: Embeddings reprezentují různé typy dat v matematickém formátu, tj. uspořádaném poli nebo sadě čísel. Identifikují vzory v datech pomocí matematických výpočtů.
  2. Vzdálenost nebo míra podobnosti: Tyto jsou matematické funkce, které vypočítávají, jak podobné nebo úzce spojené jsou dva vektory.
  3. Vyhledávací algoritmy: Algoritmy pomáhají najít podobné vektory k danému vyhledávacímu dotazu. Například K-Nearest Neighbors nebo KNN algoritmus je často používán ve VSS-povolených vyhledávacích systémech, aby určil K vektorů v datové sadě, které jsou nejvíce podobné zadanému vstupnímu dotazu.

Teď pojďme diskutovat, jak tyto komponenty fungují ve vyhledávacím systému.

Jak Vector Similarity Search funguje?

Prvním krokem při implementaci vector similarity search je reprezentace nebo popis objektů v datovém korpusu jako vektorových embeddings. Používá různé metody vektorových embeddings, jako je GloVe, Word2vec a BERT, aby mapoval objekty do vektorového prostoru. 

Pro každý formát dat, jako je text, audio a video, VSS vytváří různé modely embeddings, ale výsledkem tohoto procesu je numerická pole reprezentace. 

Dalším krokem je vytvoření indexu, který může uspořádat podobné objekty společně pomocí těchto numerických reprezentací. Algoritmus, jako je KNN, slouží jako základ pro implementaci vyhledávací podobnosti. Nicméně, aby se indexovaly podobné termíny, vyhledávací systémy používají moderní přístupy, jako je Locality Sensitive Hashing (LSH) a Approximate Nearest Neighbor (ANNOY)

Také VSS algoritmy vypočítávají míru podobnosti nebo vzdálenosti, jako je Euclidean vzdálenost, kosinová podobnost nebo Jaccardova podobnost, aby porovnaly všechny vektorové reprezentace v datové sbírce a vrátily podobný obsah v odpovědi na uživatelský dotaz.

Hlavní výzvy a výhody Vector Similarity Search

Celkově je cílem najít společné charakteristiky mezi datovými objekty. Nicméně, tento proces představuje několik potenciálních výzev.

Hlavní výzvy implementace VSS

  • Různé techniky vektorových embeddings a míry podobnosti představují různé výsledky. Výběr vhodných konfigurací pro vyhledávací systémy podobnosti je hlavní výzvou.
  • Pro velké datové sady je VSS výpočetně nákladný a vyžaduje vysokovýkonné GPU pro vytvoření velkých indexů.
  • Vektory s příliš mnoha dimenzemi nemusí přesně reprezentovat autentickou strukturu a spojení dat. Proto musí být proces vektorového embeddings bezztrátový, což je výzvou.

V současné době je technologie VSS neustále vyvíjena a zlepšována. Nicméně, může stále poskytovat mnoho výhod pro vyhledávací zkušenost společnosti nebo produktu.

Výhody VSS

  • VSS umožňuje vyhledávacím systémům najít podobné objekty neuvěřitelně rychle na různých typech dat.
  • VSS zajišťuje efektivní správu paměti, protože převádí všechny datové objekty na numerické embeddings, které stroje mohou snadno zpracovat.
  • VSS může klasifikovat objekty na nových vyhledávacích dotazech, které systém nemusí mít dříve setkal s uživateli.
  • VSS je vynikající metodou pro řešení chudých a neúplných dat, protože může najít kontextuálně podobné objekty, i když nejsou dokonalým odpovídáním.
  • Nejvíce důležitě, může detekovat a seskupit související objekty v měřítku (proměnné datové objemy).

Hlavní obchodní případy Vector Similarity Search

V komerčním podnikání může technologie VSS revolucionalizovat širokou škálu odvětví a aplikací. Některé z těchto případů použití zahrnují:

  • Odpovědi na otázky: Vector similarity search může najít související otázky v Q&A fórech, které jsou téměř identické, umožňující více přesné a relevantní odpovědi pro koncové uživatele.
  • Semantické vyhledávání na webu: Vector similarity search může najít související dokumenty nebo webové stránky v závislosti na „blízkosti“ jejich vektorových reprezentací. Cílem je zvýšit relevanci vyhledávacích výsledků na webu.
  • Doporučení produktů: Vector similarity search může poskytovat personalizovaná doporučení produktů na základě prohlížení nebo vyhledávací historie spotřebitele.
  • Lepší poskytování zdravotní péče: Výzkumníci a praktici ve zdravotnictví využívají vector similarity search k optimalizaci klinických studií analýzou vektorových reprezentací relevantních lékařských výzkumů.

Dnes již není možné spravovat, analyzovat a vyhledávat data pomocí konvenčních SQL-založených technik. Internetoví spotřebitelé zadávají komplexní dotazy na webu – zdánlivě jednoduché pro lidi, ale neuvěřitelně složité pro stroje (vyhledávače) k interpretaci. Je to dlouhodobá výzva pro stroje, aby rozluštili různé formy dat ve formátu, který stroje mohou pochopit. 

Vector similarity search umožňuje vyhledávacím systémům lépe pochopit kontext komerčních informací.

Chcete si přečíst více přehledných článků o AI? Navštivte unite.ai.

Haziqa je Data Scientist s rozsáhlými zkušenostmi v psaní technického obsahu pro AI a SaaS společnosti.