AI-modellen en platforms

Het superchargen van Graph Neural Networks met Large Language Models: De Ultieme Gids

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Graphen zijn gegevensstructuren die complexe relaties vertegenwoordigen in een breed scala aan domeinen, waaronder sociale netwerken, kennisbases, biologische systemen en veel meer. In deze graphen worden entiteiten weergegeven als knooppunten en hun relaties worden weergegeven als randen.

De mogelijkheid om deze ingewikkelde relationele structuren effectief weer te geven en te redeneren is cruciaal voor het mogelijk maken van vooruitgang in domeinen zoals netwerkwetenschap, chemische informatica en recommender systemen.

Graph Neural Networks (GNN’s) zijn opgekomen als een krachtig diep leerframework voor graph machine learning taken. Door de graph topologie op te nemen in de neurale netwerkarchitectuur via neighborhood aggregatie of graph convoluties, kunnen GNN’s lage-dimensionale vectorweergaven leren die zowel de knooppuntkenmerken als hun structurele rollen coderen. Dit stelt GNN’s in staat om state-of-the-art prestaties te bereiken op taken zoals knooppuntclassificatie, linkvoorspelling en graphclassificatie in diverse toepassingsgebieden.

Terwijl GNN’s aanzienlijke vooruitgang hebben geboekt, blijven enkele belangrijke uitdagingen bestaan. Het verkrijgen van hoogwaardige gelabelde gegevens voor het trainen van begeleide GNN-modellen kan duur en tijdrovend zijn. Bovendien kunnen GNN’s worstelen met heterogene graphstructuren en situaties waarin de graphverdeling op testtijd aanzienlijk afwijkt van de trainingsgegevens (uit-de-verdeling generalisatie).

In parallel hebben Large Language Models (LLM’s) zoals GPT-4 en LLaMA de wereld stormenderhand veroverd met hun ongelooflijke natuurlijke taalbegrip en generatiecapaciteiten. Getraind op enorme tekstcorpora met miljarden parameters, vertonen LLM’s opmerkelijke few-shot learning capaciteiten, generalisatie over taken en alledaagse redeneercapaciteiten die eerder als uiterst moeilijk voor AI-systemen werden beschouwd.

Het enorme succes van LLM’s heeft onderzoeken naar het benutten van hun kracht voor graph machine learning taken aangewakkerd. Enerzijds bieden de kennis- en redeneercapaciteiten van LLM’s kansen om traditionele GNN-modellen te verbeteren. Anderzijds kunnen de gestructureerde weergaven en feitelijke kennis die inherent zijn aan graphen, instrumenteel zijn bij het aanpakken van enkele belangrijke beperkingen van LLM’s, zoals hallucinaties en gebrek aan interpreteerbaarheid.

Graph Neural Networks en Zelf-Supervised Learning

Om de nodige context te bieden, zullen we eerst de kernconcepten en methoden in graph neural networks en zelf-supervised graphweergave learning kort bespreken.

Graph Neural Network Architectures

Graph Neural Network Architecture – bron

Het belangrijkste onderscheid tussen traditionele diepe neurale netwerken en GNN’s ligt in hun vermogen om rechtstreeks op graph-gestructureerde gegevens te werken. GNN’s volgen een neighborhood aggregatie schema, waarbij elke knoop de kenmerkvector van zijn buren agregereert om zijn eigen weergave te berekenen.

Talrijke GNN-architecturen zijn voorgesteld met verschillende instantiaties van de bericht- en updatefuncties, zoals Graph Convolutional Networks (GCN’s), GraphSAGE, Graph Attention Networks (GAT’s) en Graph Isomorphism Networks (GIN’s) onder andere.

Onlangs hebben graphtransformers populariteit verworven door de self-attention mechanisme van natuurlijke taaltransformers aan te passen om op graph-gestructureerde gegevens te werken. Enkele voorbeelden zijn GraphormerTransformer en GraphFormers. Deze modellen zijn in staat om lange-afstand afhankelijkheden over de graph beter te vangen dan zuiver neighborhood-gebaseerde GNN’s.

Zelf-Supervised Learning op Graphen

Terwijl GNN’s krachtige representatie-modellen zijn, wordt hun prestatie vaak beperkt door het gebrek aan grote gelabelde datasets die nodig zijn voor begeleide training. Zelf-supervised learning is opgekomen als een veelbelovend paradigma om GNN’s voor te trainen op ongelabelde graphgegevens door gebruik te maken van pretext taken die alleen de intrinsieke graphstructuur en knooppuntkenmerken vereisen.

Enkele veelvoorkomende pretext taken die worden gebruikt voor zelf-supervised GNN-voortraining zijn:

  1. Knooppuntkenmerkvoorspelling: Willekeurig maskeren of corrumperen van een deel van de knooppuntkenmerken en de GNN de taak geven om deze te reconstrueren.
  2. Rand/Linkvoorspelling: Leren om te voorspellen of een rand bestaat tussen een paar knooppunten, vaak op basis van willekeurig randmaskeren.
  3. Contrastief leren: Maximeren van overeenkomsten tussen graphweergaven van hetzelfde graphmonster, terwijl weergaven van verschillende graphen uit elkaar worden gedreven.
  4. Maximalisatie van wederzijdse informatie: Maximeren van de wederzijdse informatie tussen lokale knooppuntweergaven en een doelweergave, zoals de globale graphweergave.

Pretext taken zoals deze stellen de GNN in staat om betekenisvolle structurele en semantische patronen uit de ongelabelde graphgegevens te extraheren tijdens voortraining. De voorge trainde GNN kan vervolgens worden gefinetuned op relatief kleine gelabelde subsets om uit te blinken in diverse downstream taken zoals knooppuntclassificatie, linkvoorspelling en graphclassificatie.

Door zelf-supervisie te benutten, vertonen GNN’s die zijn voorge traind op grote ongelabelde datasets betere generalisatie, robuustheid tegen verdelingsverschuivingen en efficiëntie in vergelijking met training van scratch. Echter, enkele belangrijke beperkingen van traditionele GNN-gebaseerde zelf-supervised methoden blijven bestaan, die we vervolgens zullen onderzoeken met behulp van LLM’s.

Het verbeteren van Graph ML met Large Language Models

Integratie van Graphen en LLM – bron

De opmerkelijke capaciteiten van LLM’s in het begrijpen van natuurlijke taal, redeneren en few-shot learning bieden kansen om meerdere aspecten van graph machine learning pijplijnen te verbeteren. We onderzoeken enkele belangrijke onderzoeksrichtingen in deze ruimte:

Een belangrijke uitdaging bij het toepassen van GNN’s is het verkrijgen van hoogwaardige kenmerkweergaven voor knooppunten en randen, vooral wanneer deze rijke tekstuele attributen bevatten zoals beschrijvingen, titels of abstracts. Traditioneel zijn eenvoudige bag-of-words of voorge trainde woordembeddingsmodellen gebruikt, die vaak falen om de nuances van semantiek te vangen.

Recente werken hebben de kracht van het benutten van Large Language Models als tekstencoders aangetoond om betere knooppunt-/randkenmerkweergaven te construeren voordat deze worden doorgegeven aan de GNN. Bijvoorbeeld, Chen et al. gebruiken LLM’s zoals GPT-3 om tekstuele knooppuntkenmerken te encoderen, wat aanzienlijke prestatieverbeteringen toont ten opzichte van traditionele woordembeddings op knooppuntclassificatietaken.

Verder dan betere tekstencoders, kunnen LLM’s worden gebruikt om gegenereerde informatie van de oorspronkelijke tekstattributen te produceren op een semi-begeleide manier. TAPE genereert potentiële labels/verklaringen voor knooppunten met behulp van een LLM en gebruikt deze als extra gegenereerde kenmerken. KEA extrahert termen uit tekstattributen met behulp van een LLM en verkrijgt gedetailleerde beschrijvingen voor deze termen om kenmerken te verrijken.

Door de kwaliteit en expressiviteit van invoerkenmerken te verbeteren, kunnen LLM’s hun superieure natuurlijke taalbegripscapaciteiten aan GNN’s overdragen, waardoor de prestaties op downstream taken worden verbeterd.

Het verlichten van de afhankelijkheid van gelabelde gegevens

Een belangrijk voordeel van LLM’s is hun vermogen om redelijk goed te presteren op nieuwe taken met weinig tot geen gelabelde gegevens, dankzij hun voortraining op enorme tekstcorpora. Deze few-shot learning capaciteit kan worden benut om de afhankelijkheid van GNN’s van grote gelabelde datasets te verlichten.

Een benadering is het gebruik van LLM’s om rechtstreeks voorspellingen te doen op graph taken door de graphstructuur en knooppuntinformatie in natuurlijke taalprompts te beschrijven. Methoden zoals InstructGLM en GPT4Graph finetunen LLM’s zoals LLaMA en GPT-4 met zorgvuldig ontworpen prompts die graph topologie details zoals knooppuntverbindingen, buurten enz. bevatten. De getunede LLM’s kunnen vervolgens voorspellingen genereren voor taken zoals knooppuntclassificatie en linkvoorspelling in een zero-shot manier tijdens inferentie.

Terwijl het gebruik van LLM’s als black-box predictors beloften heeft getoond, neemt hun prestatie af voor complexere graph taken waar expliciete modellering van de structuur voordelig is. Enkele benaderingen gebruiken LLM’s in combinatie met GNN’s – de GNN codeert de graphstructuur terwijl de LLM verbeterde semantische begrip van knooppunten uit hun tekstuele beschrijvingen biedt.

Graph Begrip met LLM Framework – Bron

GraphLLM onderzoekt twee strategieën: 1) LLM’s als Versterkers waarbij LLM’s tekstuele knooppuntkenmerken encoderen voordat ze worden doorgegeven aan de GNN, en 2) LLM’s als Voorspellers waarbij de LLM de tussenliggende weergaven van de GNN als invoer gebruikt om finale voorspellingen te doen.

GLEM gaat verder door een variatieel EM-algoritme voor te stellen dat alterneert tussen het updaten van de LLM- en GNN-componenten voor wederzijdse verbetering.

Door de afhankelijkheid van gelabelde gegevens te verlichten via few-shot capaciteiten en semi-begeleide augmentatie, kunnen LLM-geversterkte graph learning methoden nieuwe toepassingen ontgrendelen en de gegevensefficiëntie verbeteren.

Het verbeteren van LLM’s met Graphen

Terwijl LLM’s enorm succesvol zijn geweest, lijden ze nog steeds aan belangrijke beperkingen zoals hallucinaties (het genereren van non-factuele verklaringen), gebrek aan interpreteerbaarheid in hun redeneerproces en onvermogen om consistente feitelijke kennis te behouden.

Graphen, vooral kennisgraphen die gestructureerde feitelijke informatie uit betrouwbare bronnen vertegenwoordigen, bieden veelbelovende wegen om deze tekortkomingen aan te pakken. We onderzoeken enkele opkomende benaderingen in deze richting:

Kennis Graph Versterkte LLM Voortraining

Net zoals LLM’s worden voorge traind op grote tekstcorpora, hebben recente werken onderzocht om LLM’s voor te trainen op kennisgraphen om beter feitelijk bewustzijn en redeneercapaciteiten te verwerven.

Enkele benaderingen passen de invoergegevens aan door eenvoudigweg feitelijke KG-triples te concatenaten of uit te lijnen met natuurlijke taaltekst tijdens voortraining. E-BERT lijnt KG-entity vectoren uit met BERT’s woordpiece embeddings, terwijl K-BERT bomen construeert die de oorspronkelijke zin en relevante KG-triples bevatten.

De Rol van LLM’s in Graph Machine Learning:

Onderzoekers hebben verschillende manieren onderzocht om LLM’s in de graph learning pijplijn te integreren, elk met zijn unieke voordelen en toepassingen. Hier zijn enkele van de prominente rollen die LLM’s kunnen spelen:

  1. LLM als Versterker: In deze benadering worden LLM’s gebruikt om de tekstuele attributen die zijn gekoppeld aan de knooppunten in een TAG te verrijken. De capaciteit van de LLM om verklaringen, kennisentiteiten of pseudo-labels te genereren kan de semantische informatie die beschikbaar is voor de GNN verrijken, waardoor de knooppuntweergaven en de downstream taakprestaties worden verbeterd.

Bijvoorbeeld, het TAPE (Text Augmented Pre-trained Encoders) model benut ChatGPT om verklaringen en pseudo-labels te genereren voor citatenetwerkpapers, die vervolgens worden gebruikt om een taalmodel te finetunen. De resulterende embeddings worden doorgegeven aan een GNN voor knooppuntclassificatie en linkvoorspellingtaken, waardoor state-of-the-art resultaten worden behaald.

  1. LLM als Voorspeller: In plaats van de invoerkenmerken te versterken, worden LLM’s rechtstreeks gebruikt als de voorspellercomponent voor graphgerelateerde taken. Dit omvat het omzetten van de graphstructuur in een tekstuele weergave die door de LLM kan worden verwerkt, die vervolgens de gewenste uitvoer genereert, zoals knooppuntlabels of graphniveauvoorspellingen.

Een opvallend voorbeeld is het GPT4Graph model, dat graphen weergeeft met behulp van de Graph Modelling Language (GML) en de krachtige GPT-4 LLM voor zero-shot graphredeneertaken.

  1. GNN-LLM Uitlijning: Een andere onderzoekslijn richt zich op het uitlijnen van de embeddingruimten van GNN’s en LLM’s, waardoor een naadloze integratie van structurele en semantische informatie mogelijk wordt. Deze benaderingen behandelen de GNN en LLM als afzonderlijke modaliteiten en gebruiken technieken zoals contrastief leren of distillatie om hun weergaven uit te lijnen.

Het MoleculeSTM model, bijvoorbeeld, gebruikt een contrastief doel om de embeddings van een GNN en een LLM uit te lijnen, waardoor de LLM structurele informatie van de GNN kan incorporeren, terwijl de GNN profiteert van de semantische kennis van de LLM.

Uitdagingen en Oplossingen

Terwijl de integratie van LLM’s en graph learning veelbelovend is, moeten verschillende uitdagingen worden aangepakt:

  1. Efficiëntie en Schaalbaarheid: LLM’s zijn berucht om hun hoge resourcebehoefte, vaak vereisen ze miljarden parameters en immense rekenkracht voor training en inferentie. Dit kan een aanzienlijke bottleneck zijn voor het inzetten van LLM-geversterkte graph learning modellen in real-world toepassingen, vooral op resource-beperkte apparaten.

Een veelbelovende oplossing is kennisdistillatie, waarbij de kennis van een grote LLM (leraarmodel) wordt overgedragen aan een kleinere, efficiëntere GNN (studentmodel).

  1. Gegevenslekkage en Evaluatie: LLM’s zijn voorge traind op enorme hoeveelheden openbaar beschikbare gegevens, die testsets uit gemeenschappelijke benchmarkdatasets kunnen bevatten, waardoor potentieel gegevenslekkage en overschatte prestaties ontstaan. Onderzoekers zijn begonnen met het verzamelen van nieuwe datasets of het bemonsteren van testgegevens uit tijdperken na de trainingsstop van de LLM om dit probleem te mitigeren.

Bovendien is het vaststellen van eerlijke en uitgebreide evaluatiebenchmarks voor LLM-geversterkte graph learning modellen cruciaal om hun werkelijke capaciteiten te meten en betekenisvolle vergelijkingen te ermöglichen.

  1. Overdraagbaarheid en Verklaarbaarheid: Terwijl LLM’s uitstekend presteren bij zero-shot en few-shot learning, blijft hun vermogen om kennis over te dragen over diverse graphdomeinen en -structuren een open uitdaging. Het verbeteren van de overdraagbaarheid van deze modellen is een kritische onderzoeksrichting.

Bovendien is het verbeteren van de verklaarbaarheid van LLM-gebaseerde graph learning modellen essentieel voor het opbouwen van vertrouwen en het ermöglichen van hun adoptie in high-stakes toepassingen. Het benutten van de inherente redeneercapaciteiten van LLM’s via technieken zoals chain-of-thought prompting kan bijdragen tot verbeterde verklaarbaarheid.

  1. Multimodale Integratie: Graphen bevatten vaak meer dan alleen tekstuele informatie, met knooppunten en randen die potentieel zijn gekoppeld aan verschillende modaliteiten, zoals afbeeldingen, audio of numerieke gegevens. Het uitbreiden van de integratie van LLM’s naar deze multimodale graphinstellingen biedt een spannende kans voor toekomstig onderzoek.

Real-World Toepassingen en Case Studies

De integratie van LLM’s en graph machine learning heeft al veelbelovende resultaten getoond in diverse real-world toepassingen:

  1. Moleculaire Eigenschapvoorspelling: In het domein van computationele chemie en drugontdekking zijn LLM’s gebruikt om de voorspelling van moleculaire eigenschappen te verbeteren door structurele informatie uit moleculaire graphen te incorporeren. Het LLM4Mol model, bijvoorbeeld, benut ChatGPT om verklaringen te genereren voor SMILES (Simplified Molecular-Input Line-Entry System) weergaven van moleculen, die vervolgens worden gebruikt om de nauwkeurigheid van eigenschapvoorspellingstaken te verbeteren.
  2. Kennis Graph Voltooiing en Redenering: Kennisgraphen zijn een speciaal type graphstructuur die werkelijke entiteiten en hun relaties vertegenwoordigt. LLM’s zijn onderzocht voor taken zoals kennis graph voltooiing en redenering, waarbij de graphstructuur en tekstuele informatie (bijv. entiteitsbeschrijvingen) gezamenlijk moeten worden overwogen.
  3. Recommender Systemen: In het domein van recommender systemen worden graphstructuren vaak gebruikt om gebruiker-iteminteracties weer te geven, met knooppunten die gebruikers en items vertegenwoordigen, en randen die interacties of overeenkomsten aanduiden. LLM’s kunnen worden gebruikt om deze graphen te verrijken door gebruiker/itemzijinformatie te genereren of interactieranden te versterken.

Conclusie

De synergie tussen Large Language Models en Graph Machine Learning presenteert een spannende frontier in artificial intelligence onderzoek. Door de structurele inductieve bias van GNN’s te combineren met de krachtige semantische begripscapaciteiten van LLM’s, kunnen we nieuwe mogelijkheden ontgrendelen in graph learning taken, met name voor tekst-attributie graphen.

Terwijl aanzienlijke vooruitgang is geboekt, blijven uitdagingen bestaan in domeinen zoals efficiëntie, schaalbaarheid, overdraagbaarheid en verklaarbaarheid. Technieken zoals kennisdistillatie, eerlijke evaluatiebenchmarks en multimodale integratie banen de weg voor de praktische inzet van LLM-geversterkte graph learning modellen in real-world toepassingen.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.