Modele i platformy AI

Przyspieszanie sieci neuronowych grafÃģw za pomocą duÅžych modeli językowych: Ostateczny przewodnik

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Grafy są strukturami danych, ktÃģre reprezentują złoÅžone relacje w szerokim zakresie dziedzin, w tym sieci społeczne, bazy wiedzy, systemy biologiczne i wiele innych. W tych grafach, jednostki są reprezentowane jako węzły, a ich relacje są przedstawiane jako krawędzie.

MoÅžliwość skutecznej reprezentacji i rozumienia tych złoÅžonych struktur relacyjnych jest kluczowa dla umoÅžliwienia postępÃģw w dziedzinach takich jak nauka o sieciach, chemia informacyjna i systemy rekomendacyjne.

Sieci neuronowe grafÃģw (GNN) wyłoniły się jako potęŞna ramka głębokiego uczenia się dla zadań związanych z grafami. Poprzez włączenie topologii grafu do architektury sieci neuronowej za pomocą schematu agregacji sąsiedztwa lub konwolucji grafÃģw, GNN mogą uczyć się niskowymiarowych wektorowych reprezentacji, ktÃģre kodują zarÃģwno cechy węzłÃģw, jak i ich role strukturalne. Pozwala to GNN na osiąganie wynikÃģw na poziomie stanu sztuki w zadaniach takich jak klasyfikacja węzłÃģw, predykcja połączeń i klasyfikacja grafÃģw w rÃģÅžnych dziedzinach zastosowań.

Podczas gdy GNN przyniosły znaczny postęp, pozostają pewne kluczowe wyzwania. Uzyskanie wysokiej jakości danych etykietowanych do szkolenia nadzorowanego modelu GNN moÅže być kosztowne i czasochłonne. Ponadto, GNN mogą mieć trudności z heterogenicznymi strukturami grafÃģw i sytuacjami, w ktÃģrych dystrybucja grafu w czasie testowania znacznie rÃģÅžni się od danych szkoleniowych (generalizacja poza dystrybucją).

RÃģwnolegle, duÅže modele językowe (LLM) takie jak GPT-4 i LLaMA zrewolucjonizowały świat dzięki ich niesamowitym zdolnościom zrozumienia i generowania języka naturalnego. Szkolone na ogromnych korpusach tekstowych z miliardami parametrÃģw, LLM wykazują zdumiewające zdolności do nauki w kilku przypadkach, generalizacji między zadaniami i zdolności do rozumowania, ktÃģre wcześniej uwaÅžano za niezwykle trudne dla systemÃģw AI.

Olbrzymi sukces LLM spowodował zainteresowanie wykorzystaniem ich mocy do zadań związanych z grafami. Z jednej strony, wiedza i zdolności rozumowania LLM prezentują moÅžliwości poprawy tradycyjnych modeli GNN. Z drugiej strony, strukturalne reprezentacje i wiedza faktograficzna wewnętrznie obecne w grafach mogą być niezwykle przydatne w rozwiązaniu niektÃģrych kluczowych ograniczeń LLM, takich jak halucynacje i brak interpretowalności.

Sieci neuronowe grafÃģw i samouczne uczenie

Aby zapewnić niezbędny kontekst, najpierw krÃģtko przypomnimy podstawowe pojęcia i metody w sieciach neuronowych grafÃģw i samoucznym uczeniu reprezentacji grafÃģw.

Architektury sieci neuronowych grafÃģw

Architektura sieci neuronowej grafu – ÅšrÃģdło

Kluczowa rÃģÅžnica między tradycyjnymi głębokimi sieciami neuronowymi a GNN polega na ich zdolności do bezpośredniej pracy z danymi o strukturze grafu. GNN stosują schemat agregacji sąsiedztwa, w ktÃģrym kaÅždy węzeł agreguje wektory cech z sąsiednich węzłÃģw, aby obliczyć własną reprezentację.

Wiele architektur GNN zostało zaproponowanych z rÃģÅžnymi wariantami funkcji wiadomości i aktualizacji, takimi jak Graph Convolutional Networks (GCNs), GraphSAGE, Graph Attention Networks (GATs) i Graph Isomorphism Networks (GINs) i wiele innych.

Niedawno graficzne transformatory zyskały popularność, adaptując mechanizm uwagi samą z transformatorÃģw językowych do pracy z danymi o strukturze grafu. Przykłady obejmują GraphormerTransformer i GraphFormers. Te modele są w stanie lepiej uchwycić dalekosięŞne zaleÅžności w grafie w porÃģwnaniu z czysto sąsiedzkimi GNN.

Samouczne uczenie na grafach

Podczas gdy GNN są potęŞnymi modelami reprezentacji, ich wydajność jest często ograniczona przez brak duÅžych zbiorÃģw danych z etykietami wymaganych do nadzorowanego szkolenia. Samouczne uczenie się wyłoniło jako obiecująca para dygma do wstępnego szkolenia GNN na nieoznaczonych danych grafowych, wykorzystując zadania pretekstowe, ktÃģre wymagają tylko wewnętrznej struktury grafu i cech węzłÃģw.

Samouczne uczenie grafu – ÅšrÃģdło

NiektÃģre powszechne zadania pretekstowe stosowane w samoucznym wstępnym szkoleniu GNN obejmują:

  1. Predykcja właściwości węzłÃģw: Losowe maskowanie lub uszkadzanie części atrybutÃģw/właściwości węzłÃģw i zlecenie GNN odtworzenia ich.
  2. Predykcja krawędzi/łączy: Uczenie się predykcji, czy krawędÅš istnieje między parą węzłÃģw, często w oparciu o losowe maskowanie krawędzi.
  3. Nauka kontrastowa: Maksymalizacja podobieństw między widokami tego samego przykładu grafu, a jednocześnie oddalanie widokÃģw z rÃģÅžnych grafÃģw.
  4. Maksymalizacja wzajemnej informacji: Maksymalizacja wzajemnej informacji między lokalnymi reprezentacjami węzłÃģw a docelową reprezentacją, taką jak globalna reprezentacja grafu.

Zadania pretekstowe takie jak te pozwalają GNN na wydobycie znaczących strukturalnych i semantycznych wzorcÃģw z nieoznaczonych danych grafowych podczas wstępnego szkolenia. Wstępnie wytrenowany GNN moÅže następnie zostać dostosowany do mniejszych zbiorÃģw danych z etykietami, aby osiągnąć doskonałe wyniki w zadaniach takich jak klasyfikacja węzłÃģw, predykcja połączeń i klasyfikacja grafÃģw.

Dzięki wykorzystaniu samouczenia, GNN wstępnie szkolone na duÅžych nieoznaczonych zbiorach danych wykazują lepszą generalizację, wytrzymałość na zmiany dystrybucji i wydajność w porÃģwnaniu z trenowaniem od podstaw. Jednak niektÃģre kluczowe ograniczenia tradycyjnych metod samoucznego uczenia się opartych na GNN pozostają, ktÃģre będziemy wykorzystywać do dalszego rozwoju z uÅžyciem LLM.

Poprawa uczenia maszynowego grafÃģw za pomocą duÅžych modeli językowych

Integracja grafÃģw i LLM – ÅšrÃģdło

Niesamowite moÅžliwości LLM w zrozumieniu języka naturalnego, rozumowaniu i nauce w kilku przypadkach prezentują moÅžliwości poprawy wielu aspektÃģw potokÃģw uczenia maszynowego grafÃģw. Eksplorujemy niektÃģre kluczowe kierunki badań w tym obszarze:

Kluczowym wyzwaniem w stosowaniu GNN jest uzyskanie wysokiej jakości reprezentacji cech dla węzłÃģw i krawędzi, zwłaszcza gdy zawierają bogate atrybuty tekstowe, takie jak opisy, tytuły lub abstrakty. Tradycyjnie proste worki słÃģw lub wstępnie wytrenowane modele wektorÃģw słÃģw były uÅžywane, ktÃģre często nie są w stanie uchwycić nuansÃģw semantyki.

Niedawne prace wykazały potęgę wykorzystania duÅžych modeli językowych jako kodera tekstÃģw do konstruowania lepszych reprezentacji cech węzłÃģw/krÃģwędzi przed przekazaniem ich do GNN. Na przykład Chen et al. wykorzystują LLM takie jak GPT-3 do kodowania atrybutÃģw tekstowych węzłÃģw, pokazując znaczne zyski wydajności w porÃģwnaniu z tradycyjnymi wektorami słÃģw w zadaniach klasyfikacji węzłÃģw.

Poza lepszymi kodowaniem tekstu, LLM mogą być wykorzystane do generowania uzupełniających informacji z oryginalnych atrybutÃģw tekstowych w pÃģłnadzorowanym trybie. TAPE generuje potencjalne etykiety/wyjaśnienia dla węzłÃģw za pomocą LLM i wykorzystuje je jako dodatkowe uzupełniające cechy. KEA wyodrębnia terminy z atrybutÃģw tekstowych za pomocą LLM i uzyskuje szczegÃģłowe opisy tych terminÃģw, aby uzupełnić cechy.

Poprawiając jakość i wyraÅžalność wejściowych cech, LLM mogą nadać swoje wyÅžsze zdolności zrozumienia języka naturalnego GNN, zwiększając wydajność w zadaniach podrzędnych.

Zmniejszanie zaleÅžności od danych z etykietami

Kluczową zaletą LLM jest ich zdolność do osiągania przyzwoitych wynikÃģw w nowych zadaniach z niewielką ilością lub bez danych z etykietami, dzięki ich wstępnemu szkoleniu na ogromnych korpusach tekstowych. Ta zdolność do nauki w kilku przypadkach moÅže być wykorzystana do zmniejszenia zaleÅžności GNN od duÅžych zbiorÃģw danych z etykietami.

Jednym z podejść jest uÅžycie LLM do bezpośrednich predykcji na zadaniach grafowych, opisując strukturę grafu i informacje o węzłach w naturalnych prompach językowych. Metody takie jak InstructGLM i GPT4Graph dostosowują LLM takie jak LLaMA i GPT-4, wykorzystując starannie zaprojektowane prompty, ktÃģre uwzględniają szczegÃģły topologii grafu, takie jak połączenia węzłÃģw, sąsiedztwa itp. Dostosowane LLM mogą następnie generować predykcje dla zadań takich jak klasyfikacja węzłÃģw i predykcja połączeń w trybie zero-shot podczas inferencji.

Podczas gdy uÅžycie LLM jako czarnej skrzynki predykcyjnej wykazało obietnice, ich wydajność pogarsza się w przypadku bardziej złoÅžonych zadań grafowych, w ktÃģrych korzystne jest jawne modelowanie struktury. NiektÃģre podejścia wykorzystują więc LLM w połączeniu z GNN – GNN koduje strukturę grafu, podczas gdy LLM zapewnia lepsze zrozumienie semantyki węzłÃģw z ich opisÃģw tekstowych.

Zrozumienie grafu z ramą LLM – ÅđrÃģdło

GraphLLM eksploruje dwie strategie: 1) LLM jako wzmacniacze, gdzie LLM koduje atrybuty tekstowe węzłÃģw przed przekazaniem ich do GNN, i 2) LLM jako predykatory, gdzie LLM przyjmuje pośrednie reprezentacje GNN jako dane wejściowe do ostatecznych predykcji.

GLEM idzie dalej, proponując algorytm EM z variacją, ktÃģry na przemian aktualizuje składniki LLM i GNN dla wzajemnego wzmocnienia.

Zmniejszając zaleÅžność od danych z etykietami za pomocą zdolności do nauki w kilku przypadkach i pÃģłnadzorowanego uzupełniania, metody uczenia grafÃģw z udziałem LLM mogą odblokować nowe aplikacje i poprawić efektywność danych.

Poprawa LLM za pomocą grafÃģw

Podczas gdy LLM odniosły ogromny sukces, nadal cierpią na kluczowe ograniczenia, takie jak halucynacje (generowanie niefaktualnych oświadczeń), brak interpretowalności w procesie rozumowania i niezdolność do utrzymania spÃģjnej wiedzy faktograficznej.

Grafy, zwłaszcza grafy wiedzy, ktÃģre reprezentują strukturalną wiedzę faktograficzną z wiarygodnych ÅšrÃģdeł, prezentują obiecujące ścieÅžki do rozwiązania tych ograniczeń. Eksplorujemy niektÃģre nowe podejścia w tym kierunku:

Wstępne szkolenie LLM z uÅžyciem grafÃģw wiedzy

Podobnie jak LLM są wstępnie szkolone na duÅžych korpusach tekstowych, niedawne prace wykorzystują je do wstępnego szkolenia na grafach wiedzy, aby nadać lepszą świadomość faktograficzną i zdolności rozumowania.

NiektÃģre podejścia modyfikują dane wejściowe, łącząc prosto lub wyrÃģwnując faktograficzne trÃģjki KG z tekstem naturalnym podczas wstępnego szkolenia. E-BERT wyrÃģwnuje wektory encji KG z wektorami wordpiece BERT, podczas gdy K-BERT konstruuje drzewa zawierające oryginalne zdanie i odpowiednie trÃģjki KG.

Rola LLM w uczeniu maszynowym grafÃģw:

Badacze wykorzystali kilka sposobÃģw integracji LLM w potoku uczenia grafÃģw, kaÅždy z nich ma swoje unikalne zalety i aplikacje. Oto niektÃģre z głÃģwnych rÃģl, ktÃģre LLM mogą odegrać:

  1. LLM jako wzmacniacz: W tym podejściu LLM są wykorzystywane do wzbogacenia atrybutÃģw tekstowych skojarzonych z węzłami w TAG. MoÅžliwość LLM do generowania wyjaśnień, encji wiedzy lub pseudo-etykiet moÅže uzupełnić informacje semantyczne dostępne dla GNN, prowadząc do poprawy reprezentacji węzłÃģw i wynikÃģw zadań podrzędnych.

Na przykład model TAPE (Text Augmented Pre-trained Encoders) wykorzystuje ChatGPT do generowania wyjaśnień i pseudo-etykiet dla artykułÃģw w sieci cytowań, ktÃģre są następnie wykorzystywane do dalszego szkolenia modelu językowego. Wynikające z tego wektory są wprowadzane do GNN do zadań klasyfikacji węzłÃģw i predykcji połączeń, osiągając wyniki na poziomie stanu sztuki.

  1. LLM jako predykator: Zamiast wzmocnienia cech wejściowych, niektÃģre podejścia wykorzystują LLM bezpośrednio jako składnik predykcyjny dla zadań związanych z grafami. Obejmuje to konwersję struktury grafu w reprezentację tekstową, ktÃģra moÅže być przetworzona przez LLM, a następnie generuje poŞądany wynik, taki jak etykiety węzłÃģw lub predykcje poziomu grafu.

Jednym z godnych uwagi przykładÃģw jest model GPT4Graph, ktÃģry reprezentuje grafy za pomocą języka modelowania grafÃģw (GML) i wykorzystuje potęŞny LLM GPT-4 do zadań rozumowania grafÃģw w trybie zero-shot.

  1. WyrÃģwnanie GNN i LLM: Inny kierunek badań koncentruje się na wyrÃģwnaniu przestrzeni wektorowych GNN i LLM, umoÅžliwiając bezproblemową integrację informacji strukturalnej i semantycznej. Podejścia te traktują GNN i LLM jako odrębne modality i wykorzystują techniki takie jak nauka kontrastowa lub destylacja do wyrÃģwnania ich reprezentacji.

Model MoleculeSTM, na przykład, wykorzystuje cel kontrastowy do wyrÃģwnania wektorÃģw GNN i LLM, umoÅžliwiając LLM uwzględnienie informacji strukturalnych z GNN, podczas gdy GNN korzysta z wiedzy semantycznej LLM.

Wyzwania i rozwiązania

Podczas gdy integracja LLM i uczenia grafÃģw ma ogromne obietnice, kilka wyzwań musi być rozwiązanych:

  1. Wydajność i skalowalność: LLM są notorycznie wymagające pod względem zasobÃģw, często wymagając miliardÃģw parametrÃģw i ogromnej mocy obliczeniowej do szkolenia i inferencji. MoÅže to być znaczącą przeszkodą w wdroÅženiu modeli uczenia grafÃģw z udziałem LLM w aplikacjach świata rzeczywistego, zwłaszcza na urządzeniach o ograniczonych zasobach.

Jednym z obiecujących rozwiązań jest destylacja wiedzy, w ktÃģrej wiedza z duÅžego LLM (model nauczyciela) jest przenoszona do mniejszego, bardziej wydajnego GNN (model ucznia).

  1. Przecieki danych i ocena: LLM są wstępnie szkolone na ogromnych ilościach publicznie dostępnych danych, ktÃģre mogą zawierać zestawy testowe z powszechnych zbiorÃģw benchmarkowych, prowadząc do potencjalnych przeciekÃģw danych i przeszacowania wynikÃģw. Badacze zaczęli gromadzić nowe zbiory danych lub pobierać dane testowe z okresÃģw po zakończeniu szkolenia LLM, aby złagodzić ten problem.

Ponadto ustanowienie sprawiedliwych i kompleksowych benchmarkÃģw oceny dla modeli uczenia grafÃģw z udziałem LLM jest kluczowe do pomiaru ich prawdziwych moÅžliwości i umoÅžliwienia znaczących porÃģwnań.

  1. Przenoszalność i wyjaśnialność: ChociaÅž LLM wyrÃģÅžniają się w nauce w kilku przypadkach, ich zdolność do przenoszenia wiedzy na rÃģÅžne dziedziny i struktury grafÃģw pozostaje otwartym wyzwaniem. Poprawa przenoszalności tych modeli jest kluczowym kierunkiem badań.

Ponadto poprawa wyjaśnialności modeli uczenia grafÃģw z udziałem LLM jest niezbędna do budowania zaufania i umoÅžliwienia ich przyjęcia w aplikacjach o wysokich stawkach. Wykorzystanie wewnętrznych zdolności rozumowania LLM za pomocą technik takich jak wyzwania myślowe moÅže przyczynić się do lepszej wyjaśnialności.

  1. Integracja multimodalna: Grafy często zawierają więcej niÅž tylko informacje tekstowe, a węzły i krawędzie mogą być skojarzone z rÃģÅžnymi modalnościami, takimi jak obrazy, audio lub dane numeryczne. Rozszerzenie integracji LLM na te multimodalne ustawienia grafÃģw prezentuje ekscytującą moÅžliwość przyszłych badań.

Aplikacje świata rzeczywistego i studia przypadkÃģw

Integracja LLM i uczenia maszynowego grafÃģw juÅž wykazała obietnice w rÃģÅžnych aplikacjach świata rzeczywistego:

  1. Predykcja właściwości molekularnych: W dziedzinie chemii obliczeniowej i odkrywania lekÃģw, LLM zostały wykorzystane do poprawy predykcji właściwości molekularnych, integrując informacje strukturalne z molekularnych grafÃģw. Model LLM4Mol, na przykład, wykorzystuje ChatGPT do generowania wyjaśnień dla reprezentacji molekuł w postaci SMILES, ktÃģre są następnie wykorzystywane do poprawy dokładności zadań predykcji właściwości.
  2. Uzupełnianie i rozumowanie grafÃģw wiedzy: Grafy wiedzy są specjalnym rodzajem struktury grafu, reprezentującym encje świata rzeczywistego i ich relacje. LLM zostały wykorzystane do zadań takich jak uzupełnianie grafÃģw wiedzy i rozumowanie, gdzie struktura grafu i informacje tekstowe (np. opisy encji) muszą być rozwaÅžane łącznie.
  3. Systemy rekomendacyjne: W dziedzinie systemÃģw rekomendacyjnych, struktury grafu są często wykorzystywane do reprezentowania interakcji między uÅžytkownikami i elementami, z węzłami reprezentującymi uÅžytkownikÃģw i elementy, a krawędziami oznaczającymi interakcje lub podobieństwa. LLM mogą być wykorzystane do wzmocnienia tych grafÃģw, generując informacje o uÅžytkownikach/elementach lub wzmacniając krawędzie interakcji.

Podsumowanie

Synergia między duÅžymi modelami językowymi a uczeniem maszynowym grafÃģw prezentuje ekscytującą granicę badań w dziedzinie sztucznej inteligencji. Łącząc strukturalne uprzywilejowanie indukcyjne GNN z potęŞnymi zdolnościami zrozumienia semantyki LLM, moÅžemy odblokować nowe moÅžliwości w zadaniach związanych z grafami, zwłaszcza dla grafÃģw z atrybutami tekstowymi.

ChociaÅž znaczny postęp został juÅž dokonany, pozostają wyzwania w obszarach takich jak wydajność, skalowalność, przenoszalność i wyjaśnialność. Techniki takie jak destylacja wiedzy, sprawiedliwe benchmarki oceny i integracja multimodalna przygotowują drogę do praktycznego wdroÅženia modeli uczenia grafÃģw z udziałem LLM w aplikacjach świata rzeczywistego.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 rÃģÅžnorodnych projektach inÅžynierii oprogramowania, ze szczegÃģlnym uwzględnieniem AI/ML. Moja nieustanna ciekawość rÃģwnieÅž skierowała mnie w stronę Natural Language Processing, dziedziny, ktÃģrą chcę dalej eksplorować.