AI-modeller og platforme

Supercharging Graph Neural Networks med Large Language Models: Den Ultimative Guide

mm
Føj Unite.AI til dine foretrukne kilder på Google

Grapher er datastrukturer, der repræsenterer komplekse relationer på tværs af en bred vifte af domæner, herunder sociale netværk, videnbasier, biologiske systemer og mange flere. I disse grapher repræsenteres enheder som noder, og deres relationer afbildes som kanter.

Evnen til effektivt at repræsentere og resonere om disse intrikate relationelle strukturer er afgørende for at muliggøre fremskridt i fag som netværksvidenskab, kemioinformatik og anbefalingsystemer.

Graph Neural Networks (GNNs) er opstået som en kraftfuld dyb læring ramme for graph machine learning-opgaver. Ved at inkorporere graph-topologien i neural netværksarkitekturen gennem nabo-aggregations-skema eller graph-konvolutioner, kan GNNs lære lav-dimensionale vektor-repræsentationer, der koder både nodens funktioner og deres strukturelle roller. Dette giver GNNs mulighed for at opnå state-of-the-art-præstationer på opgaver som nod-klassificering, link-prædiktion og graph-klassificering på tværs af diverse anvendelsesområder.

Selvom GNNs har drevet betydelige fremskridt, er der stadig nogle nøgle-udfordringer. At opnå høj-kvalitets-labelede data til træning af overvågede GNN-modeller kan være dyrt og tidskrævende. Derudover kan GNNs have svært ved at håndtere heterogene graph-strukturer og situationer, hvor graph-distributionen på test-tidspunktet afviger betydeligt fra træningsdata (out-of-distribution generalisering).

I mellemtiden har Large Language Models (LLMs) som GPT-4 og LLaMA taget verden med storm med deres utrolige naturlige sprogforståelse og genereringskapaciteter. Trænet på massive tekstkorpusser med milliarder af parametre, viser LLMs bemærkelsesværdige few-shot-læringsfærdigheder, generalisering på tværs af opgaver og fælles-sans-forståelsesfærdigheder, som tidligere blev betragtet som ekstremt udfordrende for AI-systemer.

Den enorme succes med LLMs har katalyseret udforskninger af, hvordan man kan udnytte deres kraft til graph machine learning-opgaver. På den ene side præsenterer LLMs’ viden og resonanskapaciteter muligheder for at forbedre traditionelle GNN-modeller. Omvendt kunne de strukturerede repræsentationer og faktuelle kundskaber, der er indeholdt i grapher, være afgørende for at adresse nogle af LLMs’ nøgle-begrænsninger, såsom hallucinationer og mangel på fortolkning.

Graph Neural Networks og Selv-Supervised Learning

For at give den nødvendige kontekst vil vi først kort gennemgå de centrale begreber og metoder i graph neural networks og selv-supervised graph-repræsentationslæring.

Graph Neural Network Arkitekturer

Graph Neural Network Arkitektur – kilde

Den væsentlige forskel mellem traditionelle dybe neurale netværk og GNNs ligger i deres evne til at operere direkte på graph-struktureret data. GNNs følger et nabo-aggregations-skema, hvor hver node aggregator funktioner fra sine naboer for at beregne sin egen repræsentation.

Mange GNN-arkitekturer er blevet foreslået med forskellige instantieringer af besked- og opdateringsfunktioner, såsom Graph Convolutional Networks (GCNs), GraphSAGE, Graph Attention Networks (GATs) og Graph Isomorphism Networks (GINs) blandt andre.

Mere nyligt har graph-transformatorer vundet popularitet ved at tilpasse selv-opmærksomheds-mekanismen fra naturlige sprog-transformatorer til at operere på graph-struktureret data. Nogle eksempler inkluderer GraphormerTransformer og GraphFormers. Disse modeller kan fange lange-afstands-afhængigheder på tværs af grafen bedre end ren nabo-baseret GNNs.

Selv-Supervised Learning på Grapher

Selvom GNNs er kraftfulde repræsentationsmodeller, er deres præstation ofte begrænset af mangel på store labelede datasæt, der kræves til overvåget træning. Selv-supervised learning er opstået som en lovende paradigme til at fortræne GNNs på ulabelde graph-data ved at udnytte pretext-opgaver, der kun kræver den indre graph-struktur og node-funktioner.

Nogle almindelige pretext-opgaver, der bruges til selv-supervised GNN-fortræning, inkluderer:

  1. Node Egenskab Prædiktion: Tilfældigt maskering eller korruption af en del af node-attributter/funktioner og opgaven til GNN at genskabe dem.
  2. Kant/Link Prædiktion: Læring til at prædiktere, om en kant eksisterer mellem et par noder, ofte baseret på tilfældig kant-maskering.
  3. Kontrastiv Læring: Maksimering af ligheder mellem graph-views af samme graph-prøve, mens man skyder views fra forskellige grapher fra hinanden.
  4. Mutual Information Maksimering: Maksimering af den mutual information mellem lokale node-repræsentationer og en mål-repræsentation som den globale graph-embedding.

Pretext-opgaver som disse giver GNN mulighed for at trække meningfulde strukturelle og semantiske mønstre fra de ulabelde graph-data under fortræning. Den fortrænede GNN kan derefter finjusteres på relativt små labelede undermængder for at præstere på diverse downstream-opgaver som node-klassificering, link-prædiktion og graph-klassificering.

Ved at udnytte selv-supervision, viser GNNs, der er fortrænet på store ulabelde datasæt, bedre generalisering, robusthed over for distributions-skift og effektivitet i forhold til træning fra scratch. Dog er der stadig nogle nøgle-begrænsninger for traditionelle GNN-baserede selv-supervised metoder, som vi vil udforske ved at udnytte LLMs til at adresse herefter.

Forbedring af Graph ML med Large Language Models

Integration af Grapher og LLM – kilde

De bemærkelsesværdige evner af LLMs i at forstå naturligt sprog, resonere og lære i few-shot, præsenterer muligheder for at forbedre flere aspekter af graph machine learning-pipelines. Vi udforsker nogle nøgle-forskningsretninger i dette område:

En nøgle-udfordring i anvendelse af GNNs er at opnå høj-kvalitets-funktion-repræsentationer for noder og kanter, især når de indeholder rige tekst-egenskaber som beskrivelser, titler eller abstracts. Traditionelt er simple bag-of-words eller fortrænede word-embedding-modeller blevet brugt, som ofte ikke kan fange de nuancerede semantikker.

Nyere arbejder har demonstreret kraften af at udnytte Large Language Models som tekst-encodere til at konstruere bedre node/edge-funktion-repræsentationer før de passerer til GNN. For eksempel Chen et al. udnytter LLMs som GPT-3 til at kode tekst-egenskaber for noder, viser betydelige præstationsforbedringer over traditionelle word-embeddings på node-klassificeringsopgaver.

Ud over bedre tekst-encodere kan LLMs bruges til at generere supplerende information fra de originale tekst-egenskaber på en semi-supervised måde. TAPE genererer potentielle labels/forklaringer for noder ved at bruge en LLM og bruger disse som supplerende funktioner. KEA trækker termer fra tekst-egenskaber ved at bruge en LLM og får detaljerede beskrivelser for disse termer for at supplerer funktioner.

Ved at forbedre kvaliteten og udtrykskraften af ind-data, kan LLMs overføre deres overlegne naturlige sprogforståelses-evner til GNNs, hvilket forbedrer præstationen på downstream-opgaver.

Lettelse af Afhængighed af Labelede Data

En nøgle-fordel ved LLMs er deres evne til at præstere rimeligt godt på nye opgaver med lidt eller intet labelede data, takket være deres fortræning på massive tekstkorpusser. Denne few-shot-lærings-evne kan udnyttes til at lette GNNs’ afhængighed af store labelede datasæt.

En tilgang er at bruge LLMs til direkte at lave prædiktioner på graph-opgaver ved at beskrive graph-strukturen og node-information i naturlige sprog-prompter. Metoder som InstructGLM og GPT4Graph finjusterer LLMs som LLaMA og GPT-4 ved at bruge omhyggeligt designede prompter, der inkorporerer graph-topologi-detajler som node-forbindelser, naboer osv. De finjusterede LLMs kan derefter generere prædiktioner for opgaver som node-klassificering og link-prædiktion på en zero-shot-måde under inferens.

Selvom brugen af LLMs som sorte-boks-prædiktorer har vist lovende resultater, forringes deres præstation for mere komplekse graph-opgaver, hvor eksplizit modellering af strukturen er fordelagtig. Nogle tilgange bruger derfor LLMs i kombination med GNNs – GNN koder graph-strukturen, mens LLM giver forbedret semantisk forståelse af noder fra deres tekst-beskrivelser.

Graph Forståelse med LLM Framework – Kilde

GraphLLM udforsker to strategier: 1) LLMs-as-Enhancers, hvor LLMs koder tekst-nod-egenskaber før de passerer til GNN, og 2) LLMs-as-Predictors, hvor LLM tager GNNs intermediate-repræsentationer som input til at lave endelige prædiktioner.

GLEM går videre ved at foreslå en variational EM-algoritme, der alternerer mellem opdatering af LLM- og GNN-komponenter for gensidig forbedring.

Ved at reducere afhængigheden af labelede data gennem few-shot-kapaciteter og semi-supervised-augmentering, kan LLM-forbedrede graph-læringsmetoder låse op for nye anvendelser og forbedre data-effektivitet.

Forbedring af LLMs med Grapher

Selvom LLMs har været utroligt succesfulde, lider de stadig under nøgle-begrænsninger som hallucinationer (generering af ikke-faktuelle udsagn), mangel på fortolkning i deres resonans-proces og evnen til at opretholde konsekvent faktuel viden.

Grapher, især viden-grapher, der repræsenterer struktureret faktuel information fra pålidelige kilder, præsenterer lovende muligheder for at adresse disse begrænsninger. Vi udforsker nogle opkomende tilgange i denne retning:

Viden-Graph Forbedret LLM-Fortræning

Ligesom LLMs er fortrænet på store tekstkorpusser, har nye arbejder udforsket at fortræne dem på viden-grapher for at indbygge bedre faktuel bevidsthed og resonans-kapaciteter.

Nogle tilgange modificerer input-data ved simpelthen at konkatenerer eller alignere faktuelle KG-triplet med naturligt sprog under fortræning. E-BERT aligner KG-entity-vektorer med BERTs wordpiece-embeddings, mens K-BERT konstruerer træer, der indeholder den originale sætning og relevante KG-triplet.

Rollen af LLMs i Graph Machine Learning:

Forskere har udforsket flere måder at integrere LLMs i graph-lærings-pipeline, hver med sine unikke fordele og anvendelser. Her er nogle af de fremherskende roller, LLMs kan spille:

  1. LLM som Enhancer: I denne tilgang bruges LLMs til at berige tekst-egenskaberne tilknyttet noderne i en TAG. LLMs evne til at generere forklaringer, viden-enheder eller pseudo-mærker kan supplerer semantisk information tilgængelig for GNN, hvilket fører til forbedrede node-repræsentationer og downstream-opgave-præstation.

For eksempel udnytter TAPE (Text Augmented Pre-trained Encoders) ChatGPT til at generere forklaringer og pseudo-mærker for citation-netværk-papirer, som derefter bruges til at finjustere en sprog-model. De resulterende embedinger indsættes i en GNN til node-klassificering og link-prædiktion, opnående state-of-the-art-resultater.

  1. LLM som Prædiktor: I stedet for at forbedre input-funktioner, bruger nogle tilgange LLMs direkte som prædiktor-komponent for graph-relaterede opgaver. Dette indebærer at konvertere graph-strukturen til en tekst-repræsentation, der kan behandles af LLM, som derefter genererer den ønskede output, som node-mærker eller graph-niveau-prædiktioner.

Et bemærkelsesværdigt eksempel er GPT4Graph-modellen, der repræsenterer grapher ved hjælp af Graph Modelling Language (GML) og udnytter den kraftfulde GPT-4 LLM til zero-shot graph-resonans-opgaver.

  1. GNN-LLM Alignment: En anden forskningsretning fokuserer på at aligne embedding-rummet for GNNs og LLMs, hvilket giver mulighed for en nærmest øjeblikkelig integration af strukturel og semantisk information. Disse tilgange behandler GNN og LLM som separate modaliteter og anvender teknikker som kontrastiv læring eller destillation til at aligne deres repræsentationer.

MoleculeSTM-modellen, for eksempel, bruger en kontrastiv objekt til at aligne embedingerne af en GNN og en LLM, hvilket giver LLM mulighed for at inkorporere strukturel information fra GNN, mens GNN nyder godt af LLMs semantiske kundskaber.

Udfordringer og Løsninger

Selvom integrationen af LLMs og graph-læring har stor potentiale, skal flere udfordringer løses:

  1. Effektivitet og Skalbarhed: LLMs er berømt for at være ressource-krævende, ofte krævende milliarder af parametre og enorme computermæssige kræfter til træning og inferens. Dette kan være en betydelig bottleneck for at deployere LLM-forbedrede graph-læringsmodeller i virkelige anvendelser, især på ressource-begrænsede enheder.

En lovende løsning er viden-destillation, hvor viden fra en stor LLM (lærer-model) overføres til en mindre, mere effektiv GNN (elev-model).

  1. Data-Lækage og Evaluering: LLMs er fortrænet på massive offentligt tilgængelige data, som kan inkludere test-sæt fra almindelige benchmark-datasæt, hvilket kan føre til potentiel data-lækage og overestimeret præstation. Forskere har begyndt at samle nye datasæt eller udtage test-data fra tidsperioder efter LLMs træningsafslutning for at mildne dette problem.

Derudover er det afgørende at etablere retfærdige og omfattende evaluerings-benchmark for LLM-forbedrede graph-læringsmodeller for at måle deres sande kapaciteter og muliggøre meningsfulde sammenligninger.

  1. Overførbarhed og Fortolkning: Selvom LLMs excellerer i zero-shot og few-shot-læring, er deres evne til at overføre kundskab på tværs af diverse graph-domæner og -strukturer stadig et åbent problem. Forbedring af disse modellers overførbarhed er en kritisk forskningsretning.

Derudover er det afgørende at forbedre forklarbarheden af LLM-baserede graph-læringsmodeller for at opbygge tillid og muliggøre deres adoption i høj-risiko-anvendelser. At udnytte LLMs’ indbyggede resonans-kapaciteter gennem teknikker som kæde-af-tanknings-prompting kan bidrage til forbedret forklarbarhed.

  1. Fler-modal Integration: Grapher indeholder ofte mere end blot tekst-information, med noder og kanter, der potentielt er tilknyttet forskellige modaliteter, såsom billeder, lyd eller numeriske data. At udvide integrationen af LLMs til disse fler-modale graph-indstillinger præsenterer en spændende mulighed for fremtidig forskning.

Virkelige Anvendelser og Case-Studier

Integrationen af LLMs og graph machine learning har allerede vist lovende resultater i diverse virkelige anvendelser:

  1. Molekyl-Egenskab-Prædiktion: I området computacional kemi og lægemiddel-opdagelse er LLMs blevet anvendt til at forbedre prædiktionen af molekyl-egenskaber ved at inkorporere strukturel information fra molekyl-grapher. LLM4Mol-modellen, for eksempel, udnytter ChatGPT til at generere forklaringer for SMILES (Simplified Molecular-Input Line-Entry System)-repræsentationer af molekyler, som derefter bruges til at forbedre nøjagtigheden af egenskabs-prædiktion-opgaver.
  2. Viden-Graph Kompletion og Resonans: Viden-grapher er en specialtype af graph-struktur, der repræsenterer virkelige enheder og deres relationer. LLMs er blevet udforsket til opgaver som viden-graph-kompletion og resonans, hvor graph-strukturen og tekst-information (f.eks. enheds-beskrivelser) skal behandles samlet.
  3. Anbefalings-Systemer: I området anbefalings-systemer bruges ofte graph-strukturer til at repræsentere bruger-item-interaktioner, med noder, der repræsenterer brugere og items, og kanter, der angiver interaktioner eller ligheder. LLMs kan udnyttes til at forbedre disse grapher ved at generere bruger/item-side-information eller forstærke interaktions-kanter.

Konklusion

Synergien mellem Large Language Models og Graph Machine Learning præsenterer en spændende front i kunstig intelligens-forskning. Ved at kombinere den strukturelle induktive bias af GNNs med den kraftfulde semantiske forståelses-kapacitet af LLMs, kan vi låse op for nye muligheder i graph-lærings-opgaver, især for tekst-tilknyttede grapher.

Selvom betydelige fremskridt er gjort, forbliver udfordringer i områder som effektivitet, skalbarhed, overførbarhed og forklarbarhed. Teknikker som viden-destillation, retfærdige evaluering-benchmark og fler-modal integration baner vejen for praktisk deployment af LLM-forbedrede graph-læringsmodeller i virkelige anvendelser.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.