Grafy sÄ strukturami danych, ktÃģre reprezentujÄ zÅoÅžone relacje w szerokim zakresie dziedzin, w tym sieci spoÅeczne, bazy wiedzy, systemy biologiczne i wiele innych. W tych grafach, jednostki sÄ reprezentowane jako wÄzÅy, a ich relacje sÄ przedstawiane jako krawÄdzie.
MoÅžliwoÅÄ skutecznej reprezentacji i rozumienia tych zÅoÅžonych struktur relacyjnych jest kluczowa dla umoÅžliwienia postÄpÃģw w dziedzinach takich jak nauka o sieciach, chemia informacyjna i systemy rekomendacyjne.
Sieci neuronowe grafÃģw (GNN) wyÅoniÅy siÄ jako potÄÅžna ramka gÅÄbokiego uczenia siÄ dla zadaÅ zwiÄ zanych z grafami. Poprzez wÅÄ czenie topologii grafu do architektury sieci neuronowej za pomocÄ schematu agregacji sÄ siedztwa lub konwolucji grafÃģw, GNN mogÄ uczyÄ siÄ niskowymiarowych wektorowych reprezentacji, ktÃģre kodujÄ zarÃģwno cechy wÄzÅÃģw, jak i ich role strukturalne. Pozwala to GNN na osiÄ ganie wynikÃģw na poziomie stanu sztuki w zadaniach takich jak klasyfikacja wÄzÅÃģw, predykcja poÅÄ czeÅ i klasyfikacja grafÃģw w rÃģÅžnych dziedzinach zastosowaÅ.
Podczas gdy GNN przyniosÅy znaczny postÄp, pozostajÄ pewne kluczowe wyzwania. Uzyskanie wysokiej jakoÅci danych etykietowanych do szkolenia nadzorowanego modelu GNN moÅže byÄ kosztowne i czasochÅonne. Ponadto, GNN mogÄ mieÄ trudnoÅci z heterogenicznymi strukturami grafÃģw i sytuacjami, w ktÃģrych dystrybucja grafu w czasie testowania znacznie rÃģÅžni siÄ od danych szkoleniowych (generalizacja poza dystrybucjÄ ).
RÃģwnolegle, duÅže modele jÄzykowe (LLM) takie jak GPT-4 i LLaMA zrewolucjonizowaÅy Åwiat dziÄki ich niesamowitym zdolnoÅciom zrozumienia i generowania jÄzyka naturalnego. Szkolone na ogromnych korpusach tekstowych z miliardami parametrÃģw, LLM wykazujÄ zdumiewajÄ ce zdolnoÅci do nauki w kilku przypadkach, generalizacji miÄdzy zadaniami i zdolnoÅci do rozumowania, ktÃģre wczeÅniej uwaÅžano za niezwykle trudne dla systemÃģw AI.
Olbrzymi sukces LLM spowodowaÅ zainteresowanie wykorzystaniem ich mocy do zadaÅ zwiÄ zanych z grafami. Z jednej strony, wiedza i zdolnoÅci rozumowania LLM prezentujÄ moÅžliwoÅci poprawy tradycyjnych modeli GNN. Z drugiej strony, strukturalne reprezentacje i wiedza faktograficzna wewnÄtrznie obecne w grafach mogÄ byÄ niezwykle przydatne w rozwiÄ zaniu niektÃģrych kluczowych ograniczeÅ LLM, takich jak halucynacje i brak interpretowalnoÅci.
Sieci neuronowe grafÃģw i samouczne uczenie
Aby zapewniÄ niezbÄdny kontekst, najpierw krÃģtko przypomnimy podstawowe pojÄcia i metody w sieciach neuronowych grafÃģw i samoucznym uczeniu reprezentacji grafÃģw.
Kluczowa rÃģÅžnica miÄdzy tradycyjnymi gÅÄbokimi sieciami neuronowymi a GNN polega na ich zdolnoÅci do bezpoÅredniej pracy z danymi o strukturze grafu. GNN stosujÄ schemat agregacji sÄ siedztwa, w ktÃģrym kaÅždy wÄzeÅ agreguje wektory cech z sÄ siednich wÄzÅÃģw, aby obliczyÄ wÅasnÄ reprezentacjÄ.
Niedawno graficzne transformatory zyskaÅy popularnoÅÄ, adaptujÄ c mechanizm uwagi samÄ z transformatorÃģw jÄzykowych do pracy z danymi o strukturze grafu. PrzykÅady obejmujÄ GraphormerTransformer i GraphFormers. Te modele sÄ w stanie lepiej uchwyciÄ dalekosiÄÅžne zaleÅžnoÅci w grafie w porÃģwnaniu z czysto sÄ siedzkimi GNN.
Samouczne uczenie na grafach
Podczas gdy GNN sÄ potÄÅžnymi modelami reprezentacji, ich wydajnoÅÄ jest czÄsto ograniczona przez brak duÅžych zbiorÃģw danych z etykietami wymaganych do nadzorowanego szkolenia. Samouczne uczenie siÄ wyÅoniÅo jako obiecujÄ ca para dygma do wstÄpnego szkolenia GNN na nieoznaczonych danych grafowych, wykorzystujÄ c zadania pretekstowe, ktÃģre wymagajÄ tylko wewnÄtrznej struktury grafu i cech wÄzÅÃģw.
NiektÃģre powszechne zadania pretekstowe stosowane w samoucznym wstÄpnym szkoleniu GNN obejmujÄ :
Predykcja wÅaÅciwoÅci wÄzÅÃģw: Losowe maskowanie lub uszkadzanie czÄÅci atrybutÃģw/wÅaÅciwoÅci wÄzÅÃģw i zlecenie GNN odtworzenia ich.
Predykcja krawÄdzi/ÅÄ czy: Uczenie siÄ predykcji, czy krawÄdÅš istnieje miÄdzy parÄ wÄzÅÃģw, czÄsto w oparciu o losowe maskowanie krawÄdzi.
Nauka kontrastowa: Maksymalizacja podobieÅstw miÄdzy widokami tego samego przykÅadu grafu, a jednoczeÅnie oddalanie widokÃģw z rÃģÅžnych grafÃģw.
Maksymalizacja wzajemnej informacji: Maksymalizacja wzajemnej informacji miÄdzy lokalnymi reprezentacjami wÄzÅÃģw a docelowÄ reprezentacjÄ , takÄ jak globalna reprezentacja grafu.
Zadania pretekstowe takie jak te pozwalajÄ GNN na wydobycie znaczÄ cych strukturalnych i semantycznych wzorcÃģw z nieoznaczonych danych grafowych podczas wstÄpnego szkolenia. WstÄpnie wytrenowany GNN moÅže nastÄpnie zostaÄ dostosowany do mniejszych zbiorÃģw danych z etykietami, aby osiÄ gnÄ Ä doskonaÅe wyniki w zadaniach takich jak klasyfikacja wÄzÅÃģw, predykcja poÅÄ czeÅ i klasyfikacja grafÃģw.
DziÄki wykorzystaniu samouczenia, GNN wstÄpnie szkolone na duÅžych nieoznaczonych zbiorach danych wykazujÄ lepszÄ generalizacjÄ, wytrzymaÅoÅÄ na zmiany dystrybucji i wydajnoÅÄ w porÃģwnaniu z trenowaniem od podstaw. Jednak niektÃģre kluczowe ograniczenia tradycyjnych metod samoucznego uczenia siÄ opartych na GNN pozostajÄ , ktÃģre bÄdziemy wykorzystywaÄ do dalszego rozwoju z uÅžyciem LLM.
Poprawa uczenia maszynowego grafÃģw za pomocÄ duÅžych modeli jÄzykowych
Niesamowite moÅžliwoÅci LLM w zrozumieniu jÄzyka naturalnego, rozumowaniu i nauce w kilku przypadkach prezentujÄ moÅžliwoÅci poprawy wielu aspektÃģw potokÃģw uczenia maszynowego grafÃģw. Eksplorujemy niektÃģre kluczowe kierunki badaÅ w tym obszarze:
Kluczowym wyzwaniem w stosowaniu GNN jest uzyskanie wysokiej jakoÅci reprezentacji cech dla wÄzÅÃģw i krawÄdzi, zwÅaszcza gdy zawierajÄ bogate atrybuty tekstowe, takie jak opisy, tytuÅy lub abstrakty. Tradycyjnie proste worki sÅÃģw lub wstÄpnie wytrenowane modele wektorÃģw sÅÃģw byÅy uÅžywane, ktÃģre czÄsto nie sÄ w stanie uchwyciÄ nuansÃģw semantyki.
Niedawne prace wykazaÅy potÄgÄ wykorzystania duÅžych modeli jÄzykowych jako kodera tekstÃģw do konstruowania lepszych reprezentacji cech wÄzÅÃģw/krÃģwÄdzi przed przekazaniem ich do GNN. Na przykÅad Chen et al. wykorzystujÄ LLM takie jak GPT-3 do kodowania atrybutÃģw tekstowych wÄzÅÃģw, pokazujÄ c znaczne zyski wydajnoÅci w porÃģwnaniu z tradycyjnymi wektorami sÅÃģw w zadaniach klasyfikacji wÄzÅÃģw.
Poza lepszymi kodowaniem tekstu, LLM mogÄ byÄ wykorzystane do generowania uzupeÅniajÄ cych informacji z oryginalnych atrybutÃģw tekstowych w pÃģÅnadzorowanym trybie. TAPE generuje potencjalne etykiety/wyjaÅnienia dla wÄzÅÃģw za pomocÄ LLM i wykorzystuje je jako dodatkowe uzupeÅniajÄ ce cechy. KEA wyodrÄbnia terminy z atrybutÃģw tekstowych za pomocÄ LLM i uzyskuje szczegÃģÅowe opisy tych terminÃģw, aby uzupeÅniÄ cechy.
PoprawiajÄ c jakoÅÄ i wyraÅžalnoÅÄ wejÅciowych cech, LLM mogÄ nadaÄ swoje wyÅžsze zdolnoÅci zrozumienia jÄzyka naturalnego GNN, zwiÄkszajÄ c wydajnoÅÄ w zadaniach podrzÄdnych.
Zmniejszanie zaleÅžnoÅci od danych z etykietami
KluczowÄ zaletÄ LLM jest ich zdolnoÅÄ do osiÄ gania przyzwoitych wynikÃģw w nowych zadaniach z niewielkÄ iloÅciÄ lub bez danych z etykietami, dziÄki ich wstÄpnemu szkoleniu na ogromnych korpusach tekstowych. Ta zdolnoÅÄ do nauki w kilku przypadkach moÅže byÄ wykorzystana do zmniejszenia zaleÅžnoÅci GNN od duÅžych zbiorÃģw danych z etykietami.
Jednym z podejÅÄ jest uÅžycie LLM do bezpoÅrednich predykcji na zadaniach grafowych, opisujÄ c strukturÄ grafu i informacje o wÄzÅach w naturalnych prompach jÄzykowych. Metody takie jak InstructGLM i GPT4Graph dostosowujÄ LLM takie jak LLaMA i GPT-4, wykorzystujÄ c starannie zaprojektowane prompty, ktÃģre uwzglÄdniajÄ szczegÃģÅy topologii grafu, takie jak poÅÄ czenia wÄzÅÃģw, sÄ siedztwa itp. Dostosowane LLM mogÄ nastÄpnie generowaÄ predykcje dla zadaÅ takich jak klasyfikacja wÄzÅÃģw i predykcja poÅÄ czeÅ w trybie zero-shot podczas inferencji.
Podczas gdy uÅžycie LLM jako czarnej skrzynki predykcyjnej wykazaÅo obietnice, ich wydajnoÅÄ pogarsza siÄ w przypadku bardziej zÅoÅžonych zadaÅ grafowych, w ktÃģrych korzystne jest jawne modelowanie struktury. NiektÃģre podejÅcia wykorzystujÄ wiÄc LLM w poÅÄ czeniu z GNN â GNN koduje strukturÄ grafu, podczas gdy LLM zapewnia lepsze zrozumienie semantyki wÄzÅÃģw z ich opisÃģw tekstowych.
GraphLLM eksploruje dwie strategie: 1) LLM jako wzmacniacze, gdzie LLM koduje atrybuty tekstowe wÄzÅÃģw przed przekazaniem ich do GNN, i 2) LLM jako predykatory, gdzie LLM przyjmuje poÅrednie reprezentacje GNN jako dane wejÅciowe do ostatecznych predykcji.
GLEM idzie dalej, proponujÄ c algorytm EM z variacjÄ , ktÃģry na przemian aktualizuje skÅadniki LLM i GNN dla wzajemnego wzmocnienia.
ZmniejszajÄ c zaleÅžnoÅÄ od danych z etykietami za pomocÄ zdolnoÅci do nauki w kilku przypadkach i pÃģÅnadzorowanego uzupeÅniania, metody uczenia grafÃģw z udziaÅem LLM mogÄ odblokowaÄ nowe aplikacje i poprawiÄ efektywnoÅÄ danych.
Poprawa LLM za pomocÄ grafÃģw
Podczas gdy LLM odniosÅy ogromny sukces, nadal cierpiÄ na kluczowe ograniczenia, takie jak halucynacje (generowanie niefaktualnych oÅwiadczeÅ), brak interpretowalnoÅci w procesie rozumowania i niezdolnoÅÄ do utrzymania spÃģjnej wiedzy faktograficznej.
Grafy, zwÅaszcza grafy wiedzy, ktÃģre reprezentujÄ strukturalnÄ wiedzÄ faktograficznÄ z wiarygodnych ÅšrÃģdeÅ, prezentujÄ obiecujÄ ce ÅcieÅžki do rozwiÄ zania tych ograniczeÅ. Eksplorujemy niektÃģre nowe podejÅcia w tym kierunku:
WstÄpne szkolenie LLM z uÅžyciem grafÃģw wiedzy
Podobnie jak LLM sÄ wstÄpnie szkolone na duÅžych korpusach tekstowych, niedawne prace wykorzystujÄ je do wstÄpnego szkolenia na grafach wiedzy, aby nadaÄ lepszÄ ÅwiadomoÅÄ faktograficznÄ i zdolnoÅci rozumowania.
NiektÃģre podejÅcia modyfikujÄ dane wejÅciowe, ÅÄ czÄ c prosto lub wyrÃģwnujÄ c faktograficzne trÃģjki KG z tekstem naturalnym podczas wstÄpnego szkolenia. E-BERT wyrÃģwnuje wektory encji KG z wektorami wordpiece BERT, podczas gdy K-BERT konstruuje drzewa zawierajÄ ce oryginalne zdanie i odpowiednie trÃģjki KG.
Rola LLM w uczeniu maszynowym grafÃģw:
Badacze wykorzystali kilka sposobÃģw integracji LLM w potoku uczenia grafÃģw, kaÅždy z nich ma swoje unikalne zalety i aplikacje. Oto niektÃģre z gÅÃģwnych rÃģl, ktÃģre LLM mogÄ odegraÄ:
LLM jako wzmacniacz: W tym podejÅciu LLM sÄ wykorzystywane do wzbogacenia atrybutÃģw tekstowych skojarzonych z wÄzÅami w TAG. MoÅžliwoÅÄ LLM do generowania wyjaÅnieÅ, encji wiedzy lub pseudo-etykiet moÅže uzupeÅniÄ informacje semantyczne dostÄpne dla GNN, prowadzÄ c do poprawy reprezentacji wÄzÅÃģw i wynikÃģw zadaÅ podrzÄdnych.
Na przykÅad model TAPE (Text Augmented Pre-trained Encoders) wykorzystuje ChatGPT do generowania wyjaÅnieÅ i pseudo-etykiet dla artykuÅÃģw w sieci cytowaÅ, ktÃģre sÄ nastÄpnie wykorzystywane do dalszego szkolenia modelu jÄzykowego. WynikajÄ ce z tego wektory sÄ wprowadzane do GNN do zadaÅ klasyfikacji wÄzÅÃģw i predykcji poÅÄ czeÅ, osiÄ gajÄ c wyniki na poziomie stanu sztuki.
LLM jako predykator: Zamiast wzmocnienia cech wejÅciowych, niektÃģre podejÅcia wykorzystujÄ LLM bezpoÅrednio jako skÅadnik predykcyjny dla zadaÅ zwiÄ zanych z grafami. Obejmuje to konwersjÄ struktury grafu w reprezentacjÄ tekstowÄ , ktÃģra moÅže byÄ przetworzona przez LLM, a nastÄpnie generuje poÅžÄ dany wynik, taki jak etykiety wÄzÅÃģw lub predykcje poziomu grafu.
Jednym z godnych uwagi przykÅadÃģw jest model GPT4Graph, ktÃģry reprezentuje grafy za pomocÄ jÄzyka modelowania grafÃģw (GML) i wykorzystuje potÄÅžny LLM GPT-4 do zadaÅ rozumowania grafÃģw w trybie zero-shot.
WyrÃģwnanie GNN i LLM: Inny kierunek badaÅ koncentruje siÄ na wyrÃģwnaniu przestrzeni wektorowych GNN i LLM, umoÅžliwiajÄ c bezproblemowÄ integracjÄ informacji strukturalnej i semantycznej. PodejÅcia te traktujÄ GNN i LLM jako odrÄbne modality i wykorzystujÄ techniki takie jak nauka kontrastowa lub destylacja do wyrÃģwnania ich reprezentacji.
Model MoleculeSTM, na przykÅad, wykorzystuje cel kontrastowy do wyrÃģwnania wektorÃģw GNN i LLM, umoÅžliwiajÄ c LLM uwzglÄdnienie informacji strukturalnych z GNN, podczas gdy GNN korzysta z wiedzy semantycznej LLM.
Wyzwania i rozwiÄ zania
Podczas gdy integracja LLM i uczenia grafÃģw ma ogromne obietnice, kilka wyzwaÅ musi byÄ rozwiÄ zanych:
WydajnoÅÄ i skalowalnoÅÄ: LLM sÄ notorycznie wymagajÄ ce pod wzglÄdem zasobÃģw, czÄsto wymagajÄ c miliardÃģw parametrÃģw i ogromnej mocy obliczeniowej do szkolenia i inferencji. MoÅže to byÄ znaczÄ cÄ przeszkodÄ w wdroÅženiu modeli uczenia grafÃģw z udziaÅem LLM w aplikacjach Åwiata rzeczywistego, zwÅaszcza na urzÄ dzeniach o ograniczonych zasobach.
Jednym z obiecujÄ cych rozwiÄ zaÅ jest destylacja wiedzy, w ktÃģrej wiedza z duÅžego LLM (model nauczyciela) jest przenoszona do mniejszego, bardziej wydajnego GNN (model ucznia).
Przecieki danych i ocena: LLM sÄ wstÄpnie szkolone na ogromnych iloÅciach publicznie dostÄpnych danych, ktÃģre mogÄ zawieraÄ zestawy testowe z powszechnych zbiorÃģw benchmarkowych, prowadzÄ c do potencjalnych przeciekÃģw danych i przeszacowania wynikÃģw. Badacze zaczÄli gromadziÄ nowe zbiory danych lub pobieraÄ dane testowe z okresÃģw po zakoÅczeniu szkolenia LLM, aby zÅagodziÄ ten problem.
Ponadto ustanowienie sprawiedliwych i kompleksowych benchmarkÃģw oceny dla modeli uczenia grafÃģw z udziaÅem LLM jest kluczowe do pomiaru ich prawdziwych moÅžliwoÅci i umoÅžliwienia znaczÄ cych porÃģwnaÅ.
PrzenoszalnoÅÄ i wyjaÅnialnoÅÄ: ChociaÅž LLM wyrÃģÅžniajÄ siÄ w nauce w kilku przypadkach, ich zdolnoÅÄ do przenoszenia wiedzy na rÃģÅžne dziedziny i struktury grafÃģw pozostaje otwartym wyzwaniem. Poprawa przenoszalnoÅci tych modeli jest kluczowym kierunkiem badaÅ.
Ponadto poprawa wyjaÅnialnoÅci modeli uczenia grafÃģw z udziaÅem LLM jest niezbÄdna do budowania zaufania i umoÅžliwienia ich przyjÄcia w aplikacjach o wysokich stawkach. Wykorzystanie wewnÄtrznych zdolnoÅci rozumowania LLM za pomocÄ technik takich jak wyzwania myÅlowe moÅže przyczyniÄ siÄ do lepszej wyjaÅnialnoÅci.
Integracja multimodalna: Grafy czÄsto zawierajÄ wiÄcej niÅž tylko informacje tekstowe, a wÄzÅy i krawÄdzie mogÄ byÄ skojarzone z rÃģÅžnymi modalnoÅciami, takimi jak obrazy, audio lub dane numeryczne. Rozszerzenie integracji LLM na te multimodalne ustawienia grafÃģw prezentuje ekscytujÄ cÄ moÅžliwoÅÄ przyszÅych badaÅ.
Aplikacje Åwiata rzeczywistego i studia przypadkÃģw
Integracja LLM i uczenia maszynowego grafÃģw juÅž wykazaÅa obietnice w rÃģÅžnych aplikacjach Åwiata rzeczywistego:
Predykcja wÅaÅciwoÅci molekularnych: W dziedzinie chemii obliczeniowej i odkrywania lekÃģw, LLM zostaÅy wykorzystane do poprawy predykcji wÅaÅciwoÅci molekularnych, integrujÄ c informacje strukturalne z molekularnych grafÃģw. Model LLM4Mol, na przykÅad, wykorzystuje ChatGPT do generowania wyjaÅnieÅ dla reprezentacji molekuÅ w postaci SMILES, ktÃģre sÄ nastÄpnie wykorzystywane do poprawy dokÅadnoÅci zadaÅ predykcji wÅaÅciwoÅci.
UzupeÅnianie i rozumowanie grafÃģw wiedzy: Grafy wiedzy sÄ specjalnym rodzajem struktury grafu, reprezentujÄ cym encje Åwiata rzeczywistego i ich relacje. LLM zostaÅy wykorzystane do zadaÅ takich jak uzupeÅnianie grafÃģw wiedzy i rozumowanie, gdzie struktura grafu i informacje tekstowe (np. opisy encji) muszÄ byÄ rozwaÅžane ÅÄ cznie.
Systemy rekomendacyjne: W dziedzinie systemÃģw rekomendacyjnych, struktury grafu sÄ czÄsto wykorzystywane do reprezentowania interakcji miÄdzy uÅžytkownikami i elementami, z wÄzÅami reprezentujÄ cymi uÅžytkownikÃģw i elementy, a krawÄdziami oznaczajÄ cymi interakcje lub podobieÅstwa. LLM mogÄ byÄ wykorzystane do wzmocnienia tych grafÃģw, generujÄ c informacje o uÅžytkownikach/elementach lub wzmacniajÄ c krawÄdzie interakcji.
Podsumowanie
Synergia miÄdzy duÅžymi modelami jÄzykowymi a uczeniem maszynowym grafÃģw prezentuje ekscytujÄ cÄ granicÄ badaÅ w dziedzinie sztucznej inteligencji. ÅÄ czÄ c strukturalne uprzywilejowanie indukcyjne GNN z potÄÅžnymi zdolnoÅciami zrozumienia semantyki LLM, moÅžemy odblokowaÄ nowe moÅžliwoÅci w zadaniach zwiÄ zanych z grafami, zwÅaszcza dla grafÃģw z atrybutami tekstowymi.
ChociaÅž znaczny postÄp zostaÅ juÅž dokonany, pozostajÄ wyzwania w obszarach takich jak wydajnoÅÄ, skalowalnoÅÄ, przenoszalnoÅÄ i wyjaÅnialnoÅÄ. Techniki takie jak destylacja wiedzy, sprawiedliwe benchmarki oceny i integracja multimodalna przygotowujÄ drogÄ do praktycznego wdroÅženia modeli uczenia grafÃģw z udziaÅem LLM w aplikacjach Åwiata rzeczywistego.
Przez ostatnie piÄÄ lat zanurzaÅem siÄ w fascynujÄ cym Åwiecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziÅy mnie do udziaÅu w ponad 50 rÃģÅžnorodnych projektach inÅžynierii oprogramowania, ze szczegÃģlnym uwzglÄdnieniem AI/ML. Moja nieustanna ciekawoÅÄ rÃģwnieÅž skierowaÅa mnie w stronÄ Natural Language Processing, dziedziny, ktÃģrÄ chcÄ dalej eksplorowaÄ.