Графи – це структури даних, які представляють складні відносини в широкому діапазоні областей, включаючи соціальні мережі, знання, біологічні системи та багато іншого. У цих графах сутності представлені як вузли, а їх відносини зображені як ребра.
Спроможність ефективно представляти та мислити про ці складні відносні структури є важливою для забезпечення прогресу в галузях, таких як наука про мережі, хемінформатика та системи рекомендацій.
Графічні нейронні мережі (GNN) виникли як потужна глибока навчальна структура для завдань машинного навчання на графах. Інтегруючи топологію графу в архітектуру нейронної мережі через агрегацію сусідів або графові конволюції, GNN можуть вивчати низьковимірні векторні представлення, які кодують як ознаки вузлів, так і їх структуровані ролі. Це дозволяє GNN досягати найкращих результатів на завданнях, таких як класифікація вузлів, передбачення зв’язків та класифікація графів у різних застосунках.
Хоча GNN зробили суттєвий прогрес, деякі ключові виклики залишаються. Отримання високоякісних dánних для навчання наглядових моделей GNN може бути дорогим і тривалим. Крім того, GNN можуть мати труднощі з гетерогенними графічними структурами та ситуаціями, коли розподіл графу в час тестування суттєво відрізняється від навчальних даних (генералізація поза розподілом).
Паралельно великі мовні моделі (LLM), такі як GPT-4 та LLaMA, здобули великий успіх завдяки своїм неймовірним можливостям розуміння та генерації природної мови. Навчені на величезних текстових корпусах з мільярдами параметрів, LLM демонструють видатні можливості навчання з декількох прикладів, генералізації між завданнями та здравого глуоду, які раніше вважалися дуже складними для систем штучного інтелекту.
Великий успіх LLM каталізував дослідження щодо використання їхньої потужності для завдань машинного навчання на графах. З одного боку, знання та можливості розуміння LLM представляють можливості для вдосконалення традиційних моделей GNN. З іншого боку, структуровані представлення та фактичні знання, закладені в графі, можуть бути інструментальними для вирішення деяких ключових обмежень LLM, таких як галюцинації та відсутність інтерпретації.
Графічні нейронні мережі та самовчення
Щоб надати необхідний контекст, ми спочатку коротко розглянемо основні концепції та методи графічних нейронних мереж та самовчення графічних представлень.
Ключова відмінність між традиційними глибокими нейронними мережами та GNN полягає в їх здатності працювати безпосередньо з графічно-структурованими даними. GNN слідують схемі агрегації сусідів, де кожен вузол агрегує векторні ознаки від своїх сусідів для обчислення свого представлення.
Було запропоновано численні архітектури GNN з різними реалізаціїми функцій повідомлення та оновлення, таких як графічні конволюційні мережі (GCN), GraphSAGE, графічні мережі уваги (GAT) та графічні ізоморфні мережі (GIN) серед інших.
Нещодавно графічні трансформери здобули популярність, адаптуючи механізм самої уваги з природної мови трансформерів для роботи з графічно-структурованими даними. Прикладами цього є GraphormerTransformer та GraphFormers. Ці моделі здатні захоплювати довгострокові залежності по графу краще, ніж чисто сусідні GNN.
Самовчення на графах
Хоча GNN є потужними моделями представлень, їхня продуктивність часто обмежена відсутністю великих dánних для наглядового навчання. Самовчення виникло як перспективний парадигма для попереднього навчання GNN на dánних без міток, використовуючи завдання-претексти, які вимагають лише внутрішньої структури графу та ознак вузлів.
Деякі спільні завдання-претексти, які використовуються для попереднього навчання GNN, включають:
Прогнозування властивостей вузлів: випадкове маскування або пошкодження частини атрибутів вузлів та завдання GNN їх відновлення.
Прогнозування ребер/зв’язків: навчання прогнозувати існування ребра між парою вузлів, часто на основі випадкового маскування ребер.
Контрастне навчання: максимізація подібностей між графічними виглядами одного графічного зразка, одночасно відштовхуючи вигляди різних графів.
Максимізація взаємної інформації: максимізація взаємної інформації між місцевими представленнями вузлів та цільовим представленням, таким як глобальне представлення графу.
Завдання-претексти, такі як ці, дозволяють GNN витягувати значущі структуровані та семантичні закономірності з dánних без міток під час попереднього навчання. Попередньо навчений GNN можна потім донастроювати на відносно малих dánних з мітками для досягнення високих результатів на різних завданнях, таких як класифікація вузлів, передбачення зв’язків та класифікація графів.
Використовуючи самовчення, GNN, попередньо навчені на великих dánних без міток, демонструють кращу генералізацію, стійкість до зміщення розподілу та ефективність порівняно з навчанням з нуля. Однак деякі ключові обмеження традиційних методів самовчення GNN залишаються, які ми розглянемо далі, використовуючи LLM для їх вирішення.
Покращення машинного навчання графів великими мовними моделями
Видатні можливості LLM у розумінні природної мови, розумінні та навчанні з декількох прикладів представляють можливості для вдосконалення різних аспектів завдань машинного навчання графів. Ми розглянемо деякі ключові напрямки досліджень в цьому просторі:
Одним із ключових викликів застосування GNN є отримання високоякісних представлень ознак вузлів та ребер, особливо коли вони містять багаті текстові атрибути, такі як описи, назви чи абстрактні відомості. Традиційно використовувалися прості мішки слів або попередньо навчені моделі вкладення слів, які часто не спроможні захоплювати тонкі семантичні відтінки.
Останні дослідження продемонстрували силу використання великих мовних моделей як текстових кодувальників для створення кращих представлень ознак вузлів/ребер перед їх передачею в GNN. Наприклад, Chen et al. використовують LLM, такі як GPT-3, для кодування текстових атрибутів вузлів, демонструючи суттєві покращення продуктивності на завданнях класифікації вузлів порівняно з традиційними моделями вкладення слів.
Поза краще текстовими кодувальниками LLM можуть бути використані для генерації додаткової інформації з оригінальних текстових атрибутів у півнаглядовому режимі. TAPE генерує потенційні мітки/висновки для вузлів, використовуючи LLM, та використовує ці додаткові ознаки для донастроювання мови.
Покращуючи якість та виразність вхідних ознак, LLM можуть передати свої видатні можливості розуміння природної мови GNN, підвищуючи продуктивність на завданнях.
Покращення залежності від dánних з мітками
Одним із ключових переваг LLM є їх здатність працювати досить добре на нових завданнях з мінімальними dánними з мітками, завдяки попередньому навчанню на величезних текстових корпусах. Ця можливість навчання з декількох прикладів може бути використана для зниження залежності GNN від великих dánних з мітками.
Один із підходів полягає у використанні LLM для прямого прогнозування на завданнях графів, описуючи структуру графу та інформацію вузлів у природній мові. Методи, такі як InstructGLM та GPT4Graph, донастроюють LLM, такі як LLaMA та GPT-4, використовуючи ретельно розроблені промпти, які включають деталі топології графу, таких як вузлові з’єднання, сусіди тощо.
GraphLLM досліджує дві стратегії: 1) LLM як покращувачі, де LLM кодують текстові атрибути вузлів перед їх передачею в GNN, і 2) LLM як прогнозувачі, де LLM приймає проміжні представлення GNN як вхід для отримання остаточного прогнозу.
GLEM пропонує варіаційний алгоритм очікування-максимізації, який чергує оновлення компонентів LLM та GNN для взаємного покращення.
Знижуючи залежність від dánних з мітками завдяки можливостям навчання з декількох прикладів та півнаглядовому покращенню, методи машинного навчання графів, покращені LLM, можуть розблокувати нові застосування та покращити ефективність даних.
Покращення LLM графами
Хоча LLM були дуже успішними, вони все ще страждають від ключових обмежень, таких як галюцинації (генерування нефактичних тверджень), відсутність інтерпретації процесу розуміння та нездатність підтримувати послідовні фактичні знання.
Графи, особливо графічні знання, які представляють структуровані фактичні відомості з надійних джерел, представляють перспективні напрямки для вирішення цих обмежень. Ми розглянемо деякі нові підходи в цьому напрямку:
Попереднє навчання LLM графами знань
Аналогічно до того, як LLM попередньо навчаються на великих текстових корпусах, останні дослідження розглянули попереднє навчання їх на графах знань для надання кращого фактичного розуміння та можливостей розуміння.
Деякі підходи модифікують вхідні дані, просто конкатенуючи або вирівнюючи фактичні тріпли графів знань з природною мовою під час попереднього навчання. E-BERT вирівнює вектори сутностей графів знань з вкладеннями wordpiece BERT, тоді як K-BERT будує дерева, що містять оригінальний речення та відповідні тріпли графів знань.
Роль LLM у машинному навчанні графів:
Дослідники розглянули кілька способів інтеграції LLM у процес машинного навчання графів, кожний зі своїми перевагами та застосуваннями. Ось деякі видатні ролі, які можуть виконувати LLM:
LLM як покращувач: У цьому підході LLM використовуються для збагачення текстових атрибутів, пов’язаних з вузлами графу. Спроможність LLM генерувати пояснення, сутності знань чи псевдо-мітки може доповнити семантичну інформацію, доступну для GNN, що призводить до покращення представлень вузлів та продуктивності завдань.
Наприклад, модель TAPE використовує ChatGPT для генерації пояснень та псевдо-міток для документів у цитатній мережі, які потім використовуються для донастроювання мови. Отримані вкладення потім подаються в GNN для виконання завдань класифікації вузлів та передбачення зв’язків, досягнувши найкращих результатів.
LLM як прогнозувач: Натомість деякі підходи безпосередньо використовують LLM як прогнозувачі для завдань, пов’язаних з графами. Це включає в себе перетворення структури графу у текстове представлення, яке може бути оброблено LLM, який потім генерує бажаний вихід, такий як мітки вузлів або прогнози рівня графу.
Одним із видатних прикладів є модель GPT4Graph, яка представляє графи за допомогою мови моделювання графів (GML) та використовує потужний LLM GPT-4 для виконання завдань розуміння графів без прикладів під час інференсу.
Вирівнювання GNN та LLM: Інший напрямок досліджень зосереджується на вирівнюванні просторів вкладень GNN та LLM, що дозволяє безшовно інтегрувати структуровану та семантичну інформацію. Ці підходи розглядають GNN та LLM як окремі модальності та використовують техніки, такі як контрастне навчання або дистиляція, для вирівнювання їх представлень.
Модель MoleculeSTM, наприклад, використовує контрастний об’єкт для вирівнювання вкладень GNN та LLM, що дозволяє LLM включати структуровану інформацію з GNN, тоді як GNN користується семантичними знаннями LLM.
Виклики та рішення
Хоча інтеграція LLM та машинного навчання графів має великий потенціал, декілька викликів потребують вирішення:
Ефективність та масштабованість: LLM відомі своєю ресурсоємністю, часто вимагаючи мільярдів параметрів та величезної обчислювальної потужності для навчання та інференсу. Це може бути суттєвим обмеженням для розгортання моделей машинного навчання графів, покращених LLM, у реальних застосуваннях, особливо на пристроях з обмеженими ресурсами.
Одним із перспективних рішень є дистиляція знань, де знання великої LLM (вчительської моделі) передаються меншій, більш ефективній GNN (учнівській моделі).
Витік даних та оцінка: LLM попередньо навчаються на величезних публічних даних, які можуть включати тестові набори з загальних наборів даних, що призводить до потенційного витоку даних та завищеної продуктивності. Дослідники почали збирати нові набори даних або вибірково вибирати тестові дані з періодів часу після завершення навчання LLM, щоб пом’якшити цю проблему.
Крім того, встановлення справедливих та комплексних критеріїв оцінки для моделей машинного навчання графів, покращених LLM, є важливим для вимірювання їх справжніх можливостей та забезпечення значущих порівнянь.
Переносимість та інтерпретованість: Хоча LLM демонструють видатні можливості навчання з декільох прикладів, їх здатність переносити знання через різні домени та структури графів залишається відкритим викликом. Покращення переносимості цих моделей є критичним напрямком досліджень.
Крім того, підвищення інтерпретованість моделей машинного навчання графів, покращених LLM, є важливим для будівництва довіри та забезпечення їх прийняття в високих ставках застосування. Використання вбудованих можливостей розуміння LLM через техніки, такі як ланцюгове промптинг, може сприяти покращенню інтерпретованісті.
Мультимодальна інтеграція: Графи часто містять більше, ніж просто текстову інформацію, з вузлами та ребрами, які потенційно пов’язані з різними модальностями, такими як зображення, аудіо чи числові дані. Розширення інтеграції LLM до цих мультимодальних графічних середовищ представляє собою перспективний напрямок майбутніх досліджень.
Реальні застосування та випадки
Інтеграція LLM та машинного навчання графів вже показала перспективні результати в різних реальних застосуваннях:
Прогнозування властивостей молекул: У галузі обчислювальної хімії та відкриття ліків LLM були використані для покращення прогнозування властивостей молекул шляхом включення структурованої інформації з молекулярних графів. Модель LLM4Mol, наприклад, використовує ChatGPT для генерації пояснень для SMILES (спрощеного молекулярного входу лінійного редактора) представлень молекул, які потім використовуються для покращення точності прогнозування властивостей.
Завершення та розуміння графів знань: Графи знань є спеціальним типом графічної структури, яка представляє реальні сутності та їх відносини. LLM були досліджені для завдань, таких як завершення графів знань та розуміння, де структура графу та текстова інформація (наприклад, описи сутностей) потрібно розглядати спільно.
Системи рекомендацій: У галузі систем рекомендацій графічні структури часто використовуються для представлення взаємодій між користувачами та предметами, з вузлами, що представляють користувачів та предмети, та ребрами, що позначають взаємодії чи подібності. LLM можуть бути використані для покращення цих графів шляхом генерації додаткової інформації про користувачів/предмети або посилення ребер взаємодій.
Висновок
Синергія між великими мовними моделями та машинним навчанням графів представляє собою перспективний напрямок досліджень у галузі штучного інтелекту. Об’єднавши структурований індуктивний біас GNN з потужними семантичними можливостями розуміння LLM, ми можемо розблокувати нові можливості в завданнях машинного навчання графів, особливо для графів з текстовими атрибутами.
Хоча було досягнуто суттєвий прогрес, залишаються виклики в таких областях, як ефективність, масштабованість, переносимість та інтерпретованість. Техніки, такі як дистиляція знань, справедливі критерії оцінки та мультимодальна інтеграція, відкривають шлях для практичного розгортання моделей машинного навчання графів, покращених LLM, у реальних застосуваннях.
Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.