Modele și platforme AI

Încărcarea Grafurilor Neuronale cu Modele de Limbaj Mare: Ghidul Ultimate

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Grafurile sunt structuri de date care reprezintă relații complexe într-o varietate de domenii, inclusiv rețele sociale, baze de cunoștințe, sisteme biologice și multe altele. În aceste grafuri, entitățile sunt reprezentate ca noduri, iar relațiile lor sunt descrise ca muchii.

Capacitatea de a reprezenta și raționa eficient despre aceste structuri relationale complexe este crucială pentru a permite progrese în domenii precum știința rețelelor, chimie, sisteme de recomandare.

Rețelele Neuronale Grafice (GNN) au apărut ca un puternic cadru de învățare profundă pentru sarcinile de învățare grafică. Prin încorporarea topologiei grafice în arhitectura rețelei neuronale prin schemă de agregare a vecinătății sau convoluții grafice, GNN pot învăța reprezentări vectoriale de dimensiuni mici care codifică atât caracteristicile nodurilor, cât și rolurile structurale. Acest lucru permite GNN să atingă performanțe de top la sarcini precum clasificarea nodurilor, predicția legăturilor și clasificarea grafurilor în diverse domenii de aplicații.

În timp ce GNN au condus la progrese semnificative, unele provocări cheie rămân. Obținerea de date etichetate de înaltă calitate pentru antrenarea modelelor GNN supravegheate poate fi scumpă și consumatoare de timp. În plus, GNN pot lupta cu structuri grafice eterogene și situații în care distribuția grafică la momentul testării diferă semnificativ de datele de antrenare (generalizarea în afara distribuției).

În paralel, Modelele de Limbaj Mare (LLM) precum GPT-4 și LLaMA au cucerit lumea cu capacitățile lor incredibile de înțelegere și generare a limbajului natural. Antrenate pe corpuri de texte masive cu miliarde de parametri, LLM prezintă abilități remarcabile de învățare cu puține exemple, generalizare pe sarcini și abilități de raționament care au fost considerate anterior extrem de dificile pentru sistemele AI.

Succesul remarcabil al LLM a catalizat explorări pentru a utiliza puterea lor pentru sarcinile de învățare grafică. Pe de o parte, capacitățile de cunoaștere și raționament ale LLM prezintă oportunități de a îmbunătăți modelele GNN tradiționale. În mod invers, reprezentările structurate și cunoștințele factuale inerente în grafuri ar putea fi instrumentale în abordarea unor limitări cheie ale LLM, cum ar fi halucinațiile și lipsa de interpretare.

Rețele Neuronale Grafice și Învățarea Autosupervizată

Pentru a oferi contextul necesar, vom trece în revistă pe scurt conceptele și metodele de bază în rețelele neuronale grafice și învățarea grafică autosupervizată.

Arhitecturi de Rețele Neuronale Grafice

Arhitectură de Rețea Neuronală Grafică – sursă

Diferența cheie între rețelele neuronale tradiționale și GNN constă în capacitatea lor de a opera direct pe date structurate sub formă de graf. GNN urmează o schemă de agregare a vecinătății, unde fiecare nod agregă vectori de caracteristici de la vecinii săi pentru a-și calcula propria reprezentare.

Au fost propuse numeroase arhitecturi GNN, cu diferite instanțieri ale funcțiilor de mesaj și actualizare, cum ar fi Rețelele de Convoluție Grafică (GCN), GraphSAGE, Rețelele de Atenție Grafică (GAT) și Rețelele de Izomorfism Grafic (GIN) etc.

Mai recent, transformatorii grafici au câștigat popularitate prin adaptarea mecanismului de atenție din transformatorii de limbaj natural pentru a opera pe date structurate sub formă de graf. Exemple includ GraphormerTransformer și GraphFormers. Aceste modele pot captura dependențe pe termen lung în graf mai bine decât GNN bazate pur pe vecinătate.

Învățarea Autosupervizată pe Grafuri

Deși GNN sunt modele de reprezentare puternice, performanța lor este adesea limitată de lipsa seturilor de date etichetate de mare calitate necesare pentru antrenarea supravegheată. Învățarea autosupervizată a apărut ca un paradigma promițător pentru a pre-antrena GNN pe date grafice neetichetate, utilizând sarcini pretext care necesită doar structura intrinsică a grafurilor și caracteristicile nodurilor.

Graf Autosupervizat – sursă

Unele sarcini pretext comune utilizate pentru pre-antrenarea GNN autosupervizate includ:

  1. Predicția Proprietăților Nodurilor: Mascarea sau coruperea aleatorie a unei părți a atributelor/caracteristicilor nodurilor și solicitarea GNN să le reconstruiască.
  2. Predicția Legăturilor/Muchiilor: Învățarea să se prevadă dacă o muchie există între o pereche de noduri, adesea pe baza mascării aleatorii a muchiilor.
  3. Învățarea Contrastivă: Maximizarea similarităților între reprezentările grafurilor aceluiași exemplar de graf, în timp ce se împing reprezentările din grafuri diferite.
  4. Maximizarea Informației Mutuale: Maximizarea informației mutuale între reprezentările locale ale nodurilor și o reprezentare țintă, cum ar fi încorporarea globală a graficului.

Sarcinile pretextuale precum acestea permit GNN să extragă modele structurale și semantice semnificative din datele grafice neetichetate în timpul pre-antrenării. GNN pre-antrenat poate fi apoi reglat pe subseturi etichetate relativ mici pentru a excela în sarcini downstream precum clasificarea nodurilor, predicția legăturilor și clasificarea grafurilor.

Prin exploatarea auto-supervizării, GNN pre-antrenate pe seturi de date neetichetate mari prezintă o generalizare mai bună, robustețe la schimbări de distribuție și eficiență în comparație cu antrenarea de la zero. Cu toate acestea, unele limitări cheie ale metodelor tradiționale de învățare autosupervizată bazate pe GNN rămân, pe care le vom explora utilizând LLM pentru a le aborda în continuare.

Îmbunătățirea Învățării Grafice cu Modele de Limbaj Mare

Integrarea Grafurilor și a LLM – sursă

Capacitățile remarcabile ale LLM în înțelegerea limbajului natural, raționament și învățare cu puține exemple prezintă oportunități de a îmbunătăți multiple aspecte ale pipeline-ului de învățare grafică. Explorăm unele direcții de cercetare cheie în acest spațiu:

O provocare cheie în aplicarea GNN este obținerea reprezentărilor de caracteristici de înaltă calitate pentru noduri și muchii, în special atunci când conțin atribute textuale bogate precum descrieri, titluri sau rezumate. Tradițional, s-au utilizat modele de încorporare a cuvintelor pre-antrenate sau simple modele de pungă de cuvinte, care adesea nu reușesc să capteze semantica nuanțată.

Lucrări recente au demonstrat puterea utilizării modelelor de limbaj mare ca codificatori de text pentru a construi reprezentări de caracteristici de nod/muchie îmbunătățite înainte de a le pasa GNN. De exemplu, Chen et al. utilizează LLM precum GPT-3 pentru a încorpora atribute textuale ale nodurilor, arătând câștiguri semnificative de performanță față de încorporările tradiționale de cuvinte pe sarcini de clasificare a nodurilor.

Dincolo de îmbunătățirea codificatorilor de text, LLM pot fi utilizate pentru a genera informații augmentate din atributele textuale originale într-un mod semi-supervizat. TAPE generează etichete potențiale/explicații pentru noduri utilizând un LLM și le utilizează ca caracteristici augmentate suplimentare. KEA extrage termeni din atribute textuale utilizând un LLM și obține descrieri detaliate pentru acești termeni pentru a îmbunătăți caracteristicile.

Prin îmbunătățirea calității și expresivității caracteristicilor de intrare, LLM pot imprima capacitățile lor superioare de înțelegere a limbajului natural către GNN, îmbunătățind performanța pe sarcinile downstream.

Atenuarea Dependenței de Date Etichetate

Un avantaj cheie al LLM este capacitatea lor de a performa rezonabil de bine pe sarcini noi cu puține sau deloc date etichetate, datorită antrenării pe corpuri de texte masive. Această capacitate de învățare cu puține exemple poate fi utilizată pentru a reduce dependența GNN de seturi de date etichetate mari.

O abordare constă în utilizarea LLM pentru a face predicții directe pe sarcini grafice prin descrierea structurii grafice și a informațiilor nodurilor în prompturi de limbaj natural. Metode precum InstructGLM și GPT4Graph ajustează LLM precum LLaMA și GPT-4 utilizând prompturi atent concepute care incorporează detalii despre topologia grafică, cum ar fi conexiunile nodurilor, vecinătățile etc. LLM ajustate pot genera apoi predicții pentru sarcini precum clasificarea nodurilor și predicția legăturilor într-un mod fără exemple în timpul inferenței.

Deși utilizarea LLM ca predictor “cutie neagră” a arătat promisiune, performanța lor se deteriorează pentru sarcini grafice mai complexe unde modelarea explicită a structurii este benefică. Unele abordări utilizează astfel LLM în conjuncție cu GNN – GNN codifică structura grafică, în timp ce LLM oferă o înțelegere semantică îmbunătățită a nodurilor din descrierile textuale.

Înțelegerea Grafurilor cu Cadru LLM – Sursă

GraphLLM explorează două strategii: 1) LLM ca îmbunătățitor, unde LLM codifică atribute textuale ale nodurilor înainte de a le pasa GNN, și 2) LLM ca predictor, unde LLM ia reprezentările intermediare ale GNN ca intrare pentru a face predicții finale.

GLEM merge mai departe, propunând un algoritm de maximizare a informației mutuale care alternează între actualizarea componentelor LLM și GNN pentru îmbunătățire mutuală.

Prin reducerea dependenței de date etichetate prin capacități de învățare cu puține exemple și augmentare semi-supervizată, metodele de învățare grafică îmbunătățite cu LLM pot debloca noi aplicații și îmbunătăți eficiența datelor.

Îmbunătățirea LLM cu Grafuri

În timp ce LLM au fost extrem de de succes, ele suferă încă de limitări cheie precum halucinații (generarea de afirmații nefactuale), lipsa de interpretare în procesul de raționament și incapacitatea de a menține cunoștințe factuale consistente.

Grafurile, în special grafurile de cunoaștere care reprezintă informații factuale structurate din surse de încredere, prezintă direcții promițătoare pentru a aborda aceste limitări. Explorăm unele abordări emergente în această direcție:

Pre-antrenarea LLM Îmbunătățită cu Grafuri de Cunoaștere

Similar cu modul în care LLM sunt pre-antrenate pe corpuri de texte masive, lucrări recente au explorat pre-antrenarea lor pe grafuri de cunoaștere pentru a îmbunătăți conștientizarea factuală și capacitățile de raționament.

Unele abordări modifică datele de intrare prin simpla concatenare sau aliniere a triplelor de cunoaștere cu text în limbaj natural în timpul pre-antrenării. E-BERT aliniază vectorii de entități din grafuri de cunoaștere cu încorporările de cuvinte din BERT, în timp ce K-BERT construiește arbori care conțin propoziția originală și triple de cunoaștere relevante.

Rolul LLM în Învățarea Grafică

Cercetătorii au explorat mai multe moduri de a integra LLM în pipeline-ul de învățare grafică, fiecare cu avantaje și aplicații unice. Iată câteva dintre rolurile proeminente pe care LLM le poate juca:

  1. LLM ca Îmbunătățitor: În această abordare, LLM sunt utilizate pentru a îmbogăți atributele textuale asociate nodurilor într-un TAG. Capacitatea LLM de a genera explicații, entități de cunoaștere sau etichete pseudo poate îmbunătăți informația semantică disponibilă pentru GNN, conducând la reprezentări de noduri îmbunătățite și performanță pe sarcinile downstream.

De exemplu, modelul TAPE (Text Augmented Pre-trained Encoders) utilizează ChatGPT pentru a genera explicații și etichete pseudo pentru articole de citare, care sunt apoi utilizate pentru a ajusta un model de limbaj. Încorporările rezultate sunt ulterior introduse într-un GNN pentru sarcini de clasificare a nodurilor și predicție a legăturilor, atingând rezultate de top.

  1. LLM ca Predictor: În loc de a îmbunătăți caracteristicile de intrare, unele abordări utilizează LLM direct ca componentă de predicție pentru sarcini grafice. Acest lucru implică convertirea structurii grafice într-o reprezentare textuală care poate fi procesată de LLM, care apoi generează ieșirea dorită, cum ar fi etichete de noduri sau predicții la nivel de graf.

Un exemplu notabil este modelul GPT4Graph, care reprezintă grafuri utilizând Limbajul de Modelare Grafică (GML) și utilizează puternicul LLM GPT-4 pentru sarcini de raționament grafic fără exemple.

  1. Alinearea GNN-LLM: O altă direcție de cercetare se concentrează pe alinierea spațiilor de încorporare ale GNN și LLM, permițând o integrare fără probleme a informațiilor structurale și semantice. Aceste abordări tratează GNN și LLM ca modalități separate și utilizează tehnici precum învățarea contrastivă sau distilarea pentru a alinia reprezentările lor.

Modelul MoleculeSTM, de exemplu, utilizează un obiectiv contrastiv pentru a alinia încorporările unui GNN și un LLM, permițând LLM să incorporeze informații structurale de la GNN, în timp ce GNN beneficiază de cunoașterea semantică a LLM.

Provocări și Soluții

În timp ce integrarea LLM și a învățării grafice prezintă promisiuni imense, mai multe provocări trebuie abordate:

  1. Eficiență și Scalabilitate: LLM sunt notorii pentru necesitățile lor de resurse, adesea cerând miliarde de parametri și putere computațională imensă pentru antrenare și inferență. Acest lucru poate fi un obstacol semnificativ pentru implementarea modelelor de învățare grafică îmbunătățite cu LLM în aplicații din lumea reală, în special pe dispozitive cu resurse limitate.

O soluție promițătoare este distilarea cunoașterii, unde cunoașterea dintr-un LLM mare (model profesor) este transferată către un GNN mai mic și mai eficient (model student).

  1. Scurgerea Datelor și Evaluarea: LLM sunt antrenate pe cantități masive de date publice, care pot include seturi de test din seturi de date de referință comune, conducând la potențială scurgere de date și performanță supraestimată. Cercetătorii au început să colecteze noi seturi de date sau să eșantioneze date de test din perioade de timp după încheierea antrenării LLM pentru a mitiga această problemă.

În plus, stabilirea unor repere de evaluare corecte și cuprinzătoare pentru modelele de învățare grafică îmbunătățite cu LLM este crucială pentru a măsura capacitățile lor reale și a permite comparații semnificative.

  1. Transferabilitate și Explicabilitate: Deși LLM excelează în învățarea cu puține exemple și fără exemple, capacitatea lor de a transfera cunoașterea pe grafuri diverse și structuri rămâne o provocare deschisă. Îmbunătățirea transferabilității acestor modele este o direcție critică de cercetare.

Mai mult, îmbunătățirea explicabilității modelelor de învățare grafică bazate pe LLM este esențială pentru a construi încredere și a permite adoptarea lor în aplicații cu risc ridicat. Utilizarea capacităților de raționament inerente ale LLM prin tehnici precum promptarea în lanț poate contribui la o explicabilitate îmbunătățită.

  1. Integrarea Multimodală: Grafurile conțin adesea mai mult decât informații textuale, nodurile și muchiile putând fi asociate cu diverse modalități, cum ar fi imagini, audio sau date numerice. Extinderea integrării LLM la aceste setări grafice multimodale prezintă o oportunitate excitantă pentru cercetarea viitoare.

Aplicații și Studii de Cas din Lumea Reală

Integrarea LLM și a învățării grafice a arătat deja rezultate promițătoare în diverse aplicații din lumea reală:

  1. Predicția Proprietăților Moleculare: În domeniul chimiei computaționale și al descoperirii de medicamente, LLM au fost utilizate pentru a îmbunătăți predicția proprietăților moleculare prin încorporarea informațiilor structurale din grafuri moleculare. Modelul LLM4Mol, de exemplu, utilizează ChatGPT pentru a genera explicații pentru reprezentări SMILES (Simplified Molecular-Input Line-Entry System) ale moleculelor, care sunt apoi utilizate pentru a îmbunătăți acuratețea sarcinilor de predicție a proprietăților.
  2. Completarea și Raționamentul Grafurilor de Cunoaștere: Grafurile de cunoaștere sunt un tip special de structură grafică care reprezintă entități și relații din lumea reală. LLM au fost explorate pentru sarcini precum completarea grafurilor de cunoaștere și raționamentul, unde structura grafică și informațiile textuale (de exemplu, descrieri de entități) trebuie luate în considerare în mod conjunct.
  3. Sisteme de Recomandare: În domeniul sistemelor de recomandare, structurile grafice sunt adesea utilizate pentru a reprezenta interacțiuni utilizator-articol, nodurile reprezentând utilizatori și articole, iar muchiile reprezentând interacțiuni sau similarități. LLM pot fi utilizate pentru a îmbunătăți aceste grafuri prin generarea de informații suplimentare despre utilizatori/articole sau prin întărirea muchiilor de interacțiune.

Concluzie

Sinergia dintre Modelele de Limbaj Mare și Învățarea Grafică prezintă o frontieră excitantă în cercetarea inteligenței artificiale. Prin combinarea inducției structurale a GNN cu capacitățile de înțelegere semantică puternice ale LLM, putem debloca noi posibilități în sarcinile de învățare grafică, în special pentru grafurile atribuite cu text.

Deși s-a înregistrat progres semnificativ, provocări rămân în domenii precum eficiență, scalabilitate, transferabilitate și explicabilitate. Tehnici precum distilarea cunoașterii, reperele de evaluare corecte și integrarea multimodală deschid calea pentru implementarea practică a modelelor de învățare grafică îmbunătățite cu LLM în aplicații din lumea reală.

Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.