Modely a platformy AI

Náboje grafických neuronových sítí s velkými jazykovými modely: Últimátní průvodce

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Grafy jsou datové struktury, které reprezentují komplexní vztahy napříč širokým spektrem domén, včetně sociálních sítí, znalostních bází, biologických systémů a mnoha dalších. V těchto grafech jsou entity reprezentovány jako uzly a jejich vztahy jsou znázorněny jako hrany.

Schopnost účinně reprezentovat a rozumět těmto složitým relačním strukturám je zásadní pro umožnění pokroků v oblastech, jako je věda o sítích, chemoinformatika a systémy doporučení.

Grafické neuronové sítě (GNN) se staly mocným rámcem hlubokého učení pro úkoly strojového učení na grafech. Díky začlenění topologie grafu do architektury neuronové sítě prostřednictvím agregace sousedství nebo grafových konvolucí mohou GNN učit low-rozměrové vektorové reprezentace, které kódují jak atributy uzlů, tak jejich strukturální role. To umožňuje GNN dosáhnout špičkového výkonu na úkolech, jako je klasifikace uzlů, predikce odkazů a klasifikace grafů napříč různými aplikacemi.

Zatímco GNN vedly k podstatnému pokroku, některé klíčové výzvy zůstávají. Získání vysoce kvalitních označených dat pro trénování dohlížených modelů GNN může být nákladné a časově náročné. Kromě toho GNN mohou mít potíže s heterogenními strukturami grafů a situacemi, kdy se distribuce grafu v době testování výrazně liší od trénovacích dat (generalizace mimo distribuci).

Souběžně s tím velké jazykové modely (LLM), jako je GPT-4 a LLaMA, získaly obrovský úspěch se svými úžasnými schopnostmi porozumění a generování přirozeného jazyka. Trénovány na masivních textových korporách s miliardami parametrů, LLM vykazují pozoruhodné schopnosti few-shot učení, generalizace napříč úkoly a rozumění běžnému smyslu, které byly dříve považovány za extrémně náročné pro systémy umělé inteligence.

Úspěch LLM katalyzoval zkoumání využití jejich síly pro úkoly strojového učení na grafech. Na jedné straně prezentují znalosti a rozumění LLM příležitosti ke zlepšení tradičních modelů GNN. Na druhé straně by strukturované reprezentace a faktické znalosti obsažené v grafech mohly být instrumentální při řešení některých klíčových limitací LLM, jako jsou halucinace a nedostatek interpretability.

Grafické neuronové sítě a samo-supervizované učení

Abyste poskytli nezbytný kontext, budeme nejprve stručně přehlédnout základní koncepty a metody v grafických neuronových sítích a samo-supervizovaném učení reprezentace grafů.

Architektury grafických neuronových sítí

Architektura grafické neuronové sítě – zdroj

Klíčový rozdíl mezi tradičními hlubokými neuronovými sítěmi a GNN spočívá v jejich schopnosti operovat přímo na datových strukturách grafů. GNN následují schéma agregace sousedství, kde každý uzel agreguje vektorové atributy ze svých sousedů, aby vypočítal svou vlastní reprezentaci.

Bylo navrženo několik architektur GNN s různými instantiacemi funkcí zprávy a aktualizace, jako jsou Grafické konvoluční sítě (GCN), GraphSAGE, Grafické sítě s pozorností (GAT) a Grafické izomorfické sítě (GIN) a další.

V poslední době získaly popularity grafické transformátory adaptací mechanismu samo-pozornosti z transformátorů přirozeného jazyka pro operaci na datových strukturách grafů. Některé příklady zahrnují GraphormerTransformer a GraphFormers. Tyto modely jsou schopny zachytit dlouhodobé závislosti napříč grafem lépe než čistě na základě sousedství založené GNN.

Samo-supervizované učení na grafech

Zatímco GNN jsou mocnými modely reprezentace, jejich výkon je často omezen nedostatkem velkých označených datových sad pro dohlížené trénování. Samo-supervizované učení se stalo slibným paradigmatem pro předtrénování GNN na neoznačených datech grafů pomocí pretextových úkolů, které vyžadují pouze vnitřní strukturu grafu a atributy uzlů.

Některé běžné pretextové úkoly používané pro samo-supervizované předtrénování GNN zahrnují:

  1. Predikce vlastností uzlů: Náhodné maskování nebo poškozování části atributů uzlů a zadání úkolu GNN k jejich rekonstrukci.
  2. Predikce hran/odkazů: Učení predikovat, zda existuje hrana mezi párem uzlů, často založené na náhodném maskování hran.
  3. Kontrastivní učení: Maximální podobnost mezi pohledy na stejný grafický vzorek, zatímco pohledy z různých grafů jsou odděleny.
  4. Maximalizace mutualitní informace: Maximální mutualitní informace mezi lokálními reprezentacemi uzlů a cílovou reprezentací, jako je globální reprezentace grafu.

Pretextové úkoly, jako jsou tyto, umožňují GNN extrahovat smysluplné strukturální a sémantické vzory z neoznačených dat grafů během předtrénování. Předtrénovaný GNN lze poté doladit na relativně malé označené podmnožiny pro vynikající výkon v úkolech, jako je klasifikace uzlů, predikce odkazů a klasifikace grafů.

Samo-supervizované učení umožňuje GNN lépe generalizovat, být odolnější vůči posunům distribuce a efektivnější ve srovnání s trénováním od začátku. Nicméně některé klíčové limitace tradičních samo-supervizovaných metod GNN zůstávají, které budeme řešit pomocí LLM.

Vylepšení grafického strojového učení s velkými jazykovými modely

Integrace grafů a LLM – zdroj

Úžasná schopnost LLM porozumět přirozenému jazyku, rozumět a učit se few-shot prezentuje příležitosti ke zlepšení různých aspektů pipeline grafického strojového učení. Prozkoumáme některé klíčové směry výzkumu v tomto prostoru:

Klíčová výzva při aplikaci GNN spočívá v získání vysoce kvalitních reprezentací funkcí pro uzly a hrany, zejména když obsahují bohaté textové atributy, jako jsou popisy, názvy nebo abstrakty. Tradičně se používaly jednoduché bag-of-words nebo předtrénované modely word embedding, které často nedokážou zachytit jemné sémantické souvislosti.

Nedávné práce prokázaly sílu využití velkých jazykových modelů jako textových kódérů pro konstrukci lepší reprezentace funkcí uzlů a hran před jejich předáním GNN. Například Chen et al. využívají LLM, jako je GPT-3, k zakódování textových atributů uzlů, což vede k významnému zlepšení výkonu oproti tradičním word embedding na úkolech klasifikace uzlů.

Mimo lepší textové kódéry LLM mohou být použity k generování augmentované informace z původních textových atributů polo-supervizovaným způsobem. TAPE generuje potenciální popisy/etikety pro uzly pomocí LLM a tyto jako další augmentované funkce.

KEA extrahuje termíny z textových atributů pomocí LLM a získá podrobné popisy pro tyto termíny, aby augmentoval funkce.

Zlepšením kvality a expresivnosti vstupních funkcí mohou LLM přenést své vynikající schopnosti porozumění přirozenému jazyku na GNN, což vede k lepšímu výkonu na down-stream úkolech.

Snižování závislosti na označených datech

Klíčovou výhodou LLM je jejich schopnost fungovat rozumně dobře na nových úkolech s malým nebo žádným označeným datem, díky jejich předtrénování na rozsáhlých textových korporách. Tato schopnost few-shot učení může být využita ke snížení závislosti GNN na velkých označených datech.

Jedním přístupem je použití LLM přímo k předpovědím na úkolech grafů popisováním struktury grafu a informací o uzlech v přirozených jazykových promptech. Metody, jako InstructGLM a GPT4Graph, doladí LLM, jako je LLaMA a GPT-4, pomocí pečlivě navržených promptů, které zahrnují detaily topologie grafu, jako jsou spojení uzlů, sousedství atd. Doladěný LLM může poté generovat předpovědi pro úkoly, jako je klasifikace uzlů a predikce odkazů, v zero-shot režimu během inference.

Zatímco použití LLM jako černých skříněk předpovědí ukázalo slib, jejich výkon se zhoršuje pro složitější úkoly grafů, kde je výhodné explicitní modelování struktury. Některé přístupy proto používají LLM v kombinaci s GNN – GNN kóduje strukturu grafu, zatímco LLM poskytuje vylepšené sémantické porozumění uzlům z jejich textových popisů.

Porozumění grafu s rámcem LLM – Zdroj

GraphLLM prozkoumává dvě strategie: 1) LLM jako vylepšovatelé, kde LLM kódují textové atributy uzlů před jejich předáním GNN, a 2) LLM jako prediktory, kde LLM bere intermediate reprezentace GNN jako vstup pro konečnou předpověď.

GLEM navrhuje variabilní algoritmus EM, který střídá aktualizaci komponent LLM a GNN pro vzájemné vylepšení.

Snižováním závislosti na označených datech prostřednictvím few-shot schopností a polo-supervizovaného augmentování mohou LLM vylepšené grafické modely strojového učení odemknout nové aplikace a zlepšit efektivitu dat.

Vylepšení LLM s grafy

Zatímco LLM byly enormně úspěšné, stále trpí klíčovými limitacemi, jako jsou halucinace (generování nefaktických prohlášení), nedostatek interpretability v jejich procesu rozumění a neschopnost udržet konzistentní faktické znalosti.

Grafy, zejména znalostní grafy, které reprezentují strukturované faktické informace z důvěryhodných zdrojů, představují slibné směry pro řešení těchto limitací. Prozkoumáme některé vznikající přístupy v tomto směru:

Vylepšení LLM předtrénováním na znalostních grafech

Podobně, jako jsou LLM předtrénovány na velkých textových korporách, nedávné práce prozkoumaly předtrénování LLM na znalostních grafech, aby vylepšily faktické povědomí a rozumění.

Některé přístupy modifikují vstupní data jednoduchým spojením nebo zarovnáním faktických tripletů KG s přirozeným jazykem během předtrénování. E-BERT zarovnává vektory entit KG s wordpiece embedding BERT, zatímco K-BERT konstruuje stromy obsahující původní větu a relevantní triplety KG.

Role LLM ve strojovém učení grafů:

Výzkumníci prozkoumali několik způsobů integrace LLM do pipeline grafického strojového učení, každý se svými jedinečnými výhodami a aplikacemi. Zde jsou některé prominentní role, které LLM mohou hrát:

  1. LLM jako vylepšovatel: V tomto přístupu se LLM používají k obohacení textových atributů spojených s uzly v TAG. Schopnost LLM generovat vysvětlení, znalostní entity nebo pseudo-štítky může augmentovat sémantické informace dostupné GNN, vedoucí k vylepšené reprezentaci uzlů a lepšímu výkonu na down-stream úkolech.

Například model TAPE (Text Augmented Pre-trained Encoders) využívá ChatGPT k generování vysvětlení a pseudo-štítků pro články v citační síti, které se poté používají k doladění jazykového modelu. Výsledné embedding se používají jako vstup pro GNN pro úkoly klasifikace uzlů a predikce odkazů, dosahující špičkového výkonu.

  1. LLM jako prediktor: Místo vylepšování vstupních funkcí se některé přístupy přímo používají LLM jako prediktorové komponenty pro úkoly grafů. To zahrnuje převod struktury grafu do textové reprezentace, která může být zpracována LLM, a poté generování požadované výstupu, jako jsou popisy uzlů nebo grafické předpovědi.

Jedním z pozoruhodných příkladů je model GPT4Graph, který reprezentuje grafy pomocí Graph Modelling Language (GML) a využívá mocný LLM GPT-4 pro zero-shot úkoly grafického rozumění.

  1. GNN-LLM zarovnání: Další směr výzkumu se zaměřuje na zarovnání prostorů embedding GNN a LLM, umožňující bezproblémovou integraci strukturálních a sémantických informací. Tyto přístupy trattují GNN a LLM jako samostatné modality a používají techniky, jako je kontrastivní učení nebo destilace, pro zarovnání jejich reprezentací.

Model MoleculeSTM, například, používá kontrastivní cíl pro zarovnání embedding GNN a LLM, umožňující LLM inkorporovat strukturální informace z GNN, zatímco GNN získá sémantické znalosti z LLM.

Výzvy a řešení

Zatímco integrace LLM a grafického strojového učení slibuje enormní potenciál, několik výzev musí být řešeno:

  1. Efektivita a škálovatelnost: LLM jsou notoricky náročné na zdroje, často vyžadující miliardy parametrů a enormní výpočetní sílu pro trénování a inference. To může být významnou překážkou pro nasazení LLM vylepšených grafických modelů strojového učení v reálných aplikacích, zejména na zařízení s omezenými zdroji.

Jedním slibným řešením je knowledge distilace, kde znalosti z velkého LLM (učitel) jsou přeneseny do menšího, efektivnějšího GNN (student).

  1. Únik dat a hodnocení: LLM jsou předtrénovány na enormních veřejných datech, která mohou zahrnovat testovací sady z běžných benchmarkových dat, vedoucí k potenciálnímu úniku dat a nadhodnocení výkonu. Výzkumníci začali shromažďovat nová data nebo vzorkovat testovací data z období po ukončení trénování LLM, aby tento problém zmírnili.

Kromě toho je zavedení spravedlivých a komplexních evaluačních benchmarků pro LLM vylepšené grafické modely strojového učení zásadní pro měření jejich skutečných schopností a umožnění smysluplných srovnání.

  1. Přenosnost a vysvětlení: Zatímco LLM vynikají ve few-shot a zero-shot učení, jejich schopnost přenést znalosti napříč různými doménami a strukturami grafů zůstává otevřenou výzvou. Zlepšení přenositelnosti těchto modelů je kritickým směrem výzkumu.

Kromě toho je zlepšení vysvětlení LLM založených grafických modelů strojového učení esenciální pro budování důvěry a umožnění jejich adopce v aplikacích s vysokými zárukami. Využití vrozených rozumění schopností LLM prostřednictvím technik, jako je řetězec myšlenek, může přispět ke zlepšení vysvětlení.

  1. Multimodální integrace: Grafy často obsahují více než pouze textové informace, s uzly a hranami potenciálně spojenými s různými modality, jako jsou obrázky, audio nebo numerická data. Rozšíření integrace LLM do těchto multimodálních grafických nastavení představuje vzrušující příležitost pro budoucí výzkum.

Reálné aplikace a případové studie

Integrace LLM a grafického strojového učení již ukázala slibné výsledky v různých reálných aplikacích:

  1. Predikce molekulárních vlastností: V oblasti výpočetní chemie a objevování léků se LLM používají ke zlepšení predikce molekulárních vlastností inkorporací strukturálních informací z molekulárních grafů. Model LLM4Mol, například, využívá ChatGPT k generování vysvětlení pro SMILES (Simplified Molecular-Input Line-Entry System) reprezentace molekul, které se poté používají ke zlepšení přesnosti úkolu predikce vlastností.
  2. Dokončení a rozumění znalostních grafů: Znalostní grafy jsou speciálním typem grafické struktury, která reprezentuje reálné entity a jejich vztahy. LLM byly prozkoumány pro úkoly, jako je dokončení znalostních grafů a rozumění, kde je třeba společně zohlednit strukturu grafu a textové informace (například popisy entit).
  3. Systémy doporučení: V doméně systémů doporučení se grafické struktury často používají k reprezentaci interakcí uživatelů a položek, s uzly reprezentujícími uživatele a položky, a hranami znázorňujícími interakce nebo podobnosti. LLM mohou být použity ke zlepšení těchto grafů generováním informací o uživatelích/položkách nebo posilováním interakčních hran.

Závěr

Synergie mezi velkými jazykovými modely a grafickým strojovým učením představuje vzrušující hranici výzkumu umělé inteligence. Kombinací strukturální induktivní bias GNN se silnými sémantickými porozuměním LLM můžeme odemknout nové možnosti v úkolech grafického učení, zejména pro textově atributované grafy.

Zatímco byl učiněn značný pokrok, výzvy zůstávají v oblastech, jako je efektivita, škálovatelnost, přenositelnost a vysvětlení. Techniky, jako je knowledge distilace, spravedlivé evaluační benchmarky a multimodální integrace, připravují cestu pro praktické nasazení LLM vylepšených grafických modelů strojového učení v reálných aplikacích.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.