AI 모델 및 플랫폼

그래프 신경망을 대규모 언어 모델로 강화하기: 궁극의 가이드

mm
Unite.AI를 Google의 선호 소스에 추가

그래프는 다양한 도메인에서 복잡한 관계를 나타내는 데이터 구조입니다. 이러한 그래프에서 엔티티는 노드로 표현되고, 관계는 에지로 표현됩니다.

이러한 관계 구조를 효과적으로 표현하고推論하는 능력은 네트워크 과학, 화학 정보학, 생물학 시스템 등 다양한 분야에서 발전을 가능하게 하는 데 중요합니다.

그래프 신경망(GNN)은 그래프 머신 러닝 태스크를 위한 강력한 딥 러닝 프레임워크로 등장했습니다. 그래프 토폴로지를 신경망 아키텍처에 통합함으로써, GNN은 노드 특징과 구조적 역할을 모두 포함하는 저차원 벡터 표현을 학습할 수 있습니다. 이를 통해 GNN은 노드 분류, 링크 예측, 그래프 분류 등 다양한 태스크에서 최첨단 성능을 달성할 수 있습니다.

그러나 GNN에도 몇 가지 주요 도전이 남아 있습니다. 높은 품질의 레이블된 데이터를 얻는 것이 어려울 수 있으며, GNN은 이질적인 그래프 구조와 테스트 데이터가 훈련 데이터와 크게 다를 때(분포 이동) 어려움을 겪을 수 있습니다.

한편, 대규모 언어 모델(LLM)들은 자연어 이해와 생성 능력에서 놀라운 성과를 거두었습니다. 이러한 모델들은 대규모 텍스트 데이터에서 학습되어 몇몇 샷 학습 능력, 태스크 간 일반화, 상식 推論 능력을 보입니다.

LLM의驚異的な 성과는 그래프 머신 러닝 태스크를 위한 그들의 힘을 활용하는 연구를 촉발했습니다. 한편으로, LLM의 지식과 推論 능력은 전통적인 GNN 모델을 강화하는 기회를 제공합니다. 반면으로, 그래프의 구조적 표현과 사실적 지식은 LLM의 몇 가지 주요 한계를 해결하는 데 도움이 될 수 있습니다.

그래프 신경망과 자기 지도 학습

필요한 contexto를 제공하기 위해, 그래프 신경망과 그래프 자기 지도 학습의 핵심 개념과 방법을 간략하게 검토하겠습니다.

그래프 신경망 아키텍처

그래프 신경망 아키텍처 – 출처

전통적인 딥 신경망과 그래프 신경망의 주요 차이점은 그래프 구조 데이터에서 직접 작동할 수 있는 능력에 있습니다. 그래프 신경망은 이웃 집합 방식을 따르며, 각 노드는 자신의 표현을 계산하기 위해 이웃의 특징 벡터를 집합합니다.

다양한 그래프 신경망 아키텍처가 제안되었습니다. 그래프 컨볼루션 네트워크(GCN), 그래프 세이지(GraphSAGE), 그래프 어텐션 네트워크(GAT), 그래프 동형성 네트워크(GIN) 등이 있습니다.

最近, 그래프 트랜스포머가 그래프 구조 데이터에서 자기 주의 메커니즘을 적용하여 인기를 얻고 있습니다. 그래프 오르머 트랜스포머(GraphormerTransformer)와 그래프 포머(GraphFormers)가 대표적인 예입니다. 이러한 모델은 순수한 이웃 기반 그래프 신경망보다 긴 거리 의존성을 더 잘 캡처할 수 있습니다.

그래프에서 자기 지도 학습

그래프 신경망은 강력한 표현 모델이지만, 레이블된 데이터가 부족할 때 성능이 제한될 수 있습니다. 자기 지도 학습은 그래프 구조와 노드 특징만을 사용하여 그래프 신경망을 사전 훈련하는 것을 목표로 합니다.

그래프 자기 지도 학습 – 출처

일반적으로 사용되는 사전 훈련 태스크에는 노드 속성 예측, 에지/링크 예측, 대조적 학습, 상호 정보 최대화 등이 있습니다.

  1. 노드 속성 예측: 노드의 일부 속성을 무작위로 마스킹하거나 손상시키고, 그래프 신경망이 이를 재구성하도록 합니다.
  2. 에지/링크 예측: 노드 쌍 사이에 에지/링크가 존재하는지 예측하는 것을 목표로 합니다.
  3. 대조적 학습: 동일한 그래프의 다양한 뷰 사이에서 유사성을 최대화하고, 다른 그래프의 뷰 사이에서 유사성을 최소화합니다.
  4. 상호 정보 최대화: 노드의 지역적 표현과 목표 표현(전체 그래프 임베딩) 사이의 상호 정보를 최대화합니다.

이러한 사전 훈련 태스크를 통해 그래프 신경망은 레이블된 데이터 없이도 그래프 구조와 노드 특징에서 의미 있는 패턴을 추출할 수 있습니다.

사전 훈련된 그래프 신경망은 상대적으로 작은 레이블된 데이터셋에서 미세 조정되어 다양한 다운스트림 태스크에서 우수한 성능을 발휘할 수 있습니다.

그래프 머신 러닝을 대규모 언어 모델로 강화하기

그래프와 대규모 언어 모델의 통합 – 출처

대규모 언어 모델의 놀라운 능력은 그래프 머신 러닝 파이프라인의 여러 측면을 강화하는 기회를 제공합니다. 우리는 이 분야의 몇 가지 주요 연구 방향을 살펴보겠습니다.

한 가지 주요 도전은 노드와 에지의 높은 품질의 특징 표현을 얻는 것입니다. 특히 텍스트 속성이 포함된 경우, 단순한 백오브워즈 또는 사전 훈련된 워드 임베딩 모델은 세련된 의미를 캡처하지 못할 수 있습니다.

최근 연구에서는 대규모 언어 모델을 텍스트 인코더로 사용하여 노드/에지 특징 표현을 생성하는 것을 시도했습니다. 예를 들어, Chen et al.은 GPT-3를 사용하여 노드 텍스트 속성을 인코딩하여 전통적인 워드 임베딩보다 노드 분류 태스크에서 성능을 개선했습니다.

대규모 언어 모델은 또한 원래 텍스트 속성에서 추가 정보를 생성하여 반감독 학습 방식으로 사용할 수 있습니다. TAPE는 노드에 대한 설명/라벨을 생성하기 위해 대규모 언어 모델을 사용하고, KEA는 노드 텍스트 속성에서 용어를 추출하여 세부적인 설명을 얻습니다.

노드와 에지의 특징 표현을 개선함으로써, 대규모 언어 모델은 그래프 신경망의 성능을 향상시킬 수 있습니다.

레이블된 데이터에 대한 의존성 완화

대규모 언어 모델의 주요优势은 새로운 태스크에서 거의 레이블된 데이터 없이도 합리적인 성능을 발휘하는 능력입니다. 이는 사전 훈련된 대규모 텍스트 데이터 덕분에 가능합니다.

한 가지 접근 방식은 그래프 구조와 노드 정보를 자연어 프롬프트로 변환하여 대규모 언어 모델이 직접 그래프 태스크를 예측하도록 합니다. InstructGLM과 GPT4Graph는 이러한 접근 방식을 사용하여 그래프 구조를 자연어로 변환하고, 대규모 언어 모델을 미세 조정하여 노드 분류와 링크 예측 태스크에서 제로샷 학습을 수행합니다.

그러나 대규모 언어 모델을 블랙박스 예측기로 사용하는 것은 복잡한 그래프 태스크에서 구조를 명시적으로 모델링하는 것이 유리할 때 성능이 저하될 수 있습니다. 일부 접근 방식에서는 그래프 신경망과 대규모 언어 모델을 함께 사용하여, 그래프 신경망이 그래프 구조를 인코딩하고, 대규모 언어 모델이 노드의 텍스트 속성을 이해하는 방식입니다.

그래프 이해를 위한 대규모 언어 모델 프레임워크 – 출처

GraphLLM은 두 가지 전략을 탐색합니다. 1) 대규모 언어 모델을 노드 텍스트 속성을 인코딩하기 위해 사용하고, 2) 대규모 언어 모델이 그래프 신경망의 중간 표현을 입력으로 받아 최종 예측을 수행하는 방식입니다.

GLEM은 대규모 언어 모델과 그래프 신경망의 구성 요소를 교대로 업데이트하는 변분 EM 알고리즘을 제안합니다.

레이블된 데이터에 대한 의존성을 줄임으로써, 대규모 언어 모델을 사용한 그래프 학습 방법은 새로운 응용 분야를 개척하고 데이터 효율성을 개선할 수 있습니다.

대규모 언어 모델을 그래프로 강화하기

대규모 언어 모델은 아직 몇 가지 주요 한계를 가지고 있습니다. 허구(사실이 아닌 문장 생성), 해석 불가능성, 일관된 사실적 지식을 유지하지 못하는 등입니다.

그래프, 특히 지식 그래프는 이러한 한계를 해결하는 데 도움이 될 수 있습니다. 우리는 이러한 접근 방식을 탐색합니다.

지식 그래프를 사용한 대규모 언어 모델 사전 훈련

대규모 언어 모델은 대규모 텍스트 데이터에서 사전 훈련됩니다. 최근 연구에서는 지식 그래프를 사용하여 대규모 언어 모델을 사전 훈련하는 것을 시도했습니다.

일부 접근 방식에서는 입력 데이터를 수정하여 사실적 지식 그래프 트리플을 자연어 텍스트와 함께 연결합니다. E-BERT는 지식 그래프 엔티티 벡터를 BERT의 워드피스 임베딩과 정렬합니다. K-BERT는 원래 문장과 관련된 지식 그래프 트리플을 포함하는 트리를 구성합니다.

그래프 머신 러닝에서 대규모 언어 모델의 역할

연구자들은 그래프 학습 파이프라인에 대규모 언어 모델을 통합하는 여러 가지 방법을 탐색했습니다. 각 접근 방식에는 고유한 장점과 응용 분야가 있습니다.

  1. 대규모 언어 모델을 강화기로 사용: 이 접근 방식에서는 대규모 언어 모델을 노드의 텍스트 속성을 인코딩하기 위해 사용합니다. 대규모 언어 모델의 능력은 그래프 신경망의 성능을 향상시킬 수 있습니다.

예를 들어, TAPE 모델은 ChatGPT를 사용하여 논문에 대한 설명과 가짜 레이블을 생성하고, 이를 그래프 신경망의 입력으로 사용하여 노드 분류와 링크 예측 태스크에서 최첨단 성능을 달성합니다.

  1. 대규모 언어 모델을 예측기로 사용: 일부 접근 방식에서는 대규모 언어 모델을 그래프 태스크를 위한 예측기로 직접 사용합니다. 그래프 구조를 자연어로 변환하여 대규모 언어 모델이 처리할 수 있도록 합니다.

GPT4Graph 모델은 그래프를 그래프 모델링 언어(GML)로 표현하고, GPT-4를 사용하여 제로샷 그래프 推論 태스크를 수행합니다.

  1. 그래프 신경망과 대규모 언어 모델의 정렬: 또 다른 연구 방향은 그래프 신경망과 대규모 언어 모델의 임베딩 공간을 정렬하는 것입니다. 그래프 신경망과 대규모 언어 모델을 별도의 모달리티로 취급하고, 대조적 학습이나 蒸留을 사용하여 그들의 표현을 정렬합니다.

MoleculeSTM 모델은 그래프 신경망과 대규모 언어 모델의 임베딩을 대조적 목적으로 정렬하여, 그래프 신경망이 구조적 정보를 제공하고, 대규모 언어 모델이 의미적 지식을 제공하도록 합니다.

도전과 해결책

그래프 학습과 대규모 언어 모델의 통합은 많은 가능성을 가지고 있지만, 몇 가지 도전이 남아 있습니다.

  1. 효율성과 확장성: 대규모 언어 모델은 계산적으로 비용이 많이 들고, 많은 매개변수와 계산 능력이 필요합니다. 이는 실제 응용 프로그램에서 대규모 언어 모델을 사용한 그래프 학습 모델을 배포하는 데障害가 될 수 있습니다.

지식 蒸留은 하나의 해결책입니다. 이는 대규모 언어 모델(교사 모델)의 지식을 작은 그래프 신경망(학생 모델)으로 전달하는 것을 포함합니다.

  1. 데이터 누출과 평가: 대규모 언어 모델은 공개적으로 उपलब한 많은 데이터에서 사전 훈련되므로, 테스트 데이터셋에 포함된 데이터가 포함될 수 있습니다. 이는 데이터 누출과 과대 평가를 초래할 수 있습니다. 연구자들은 새로운 데이터셋을 수집하거나 대규모 언어 모델의 훈련 종료 이후의 시간대에서 테스트 데이터를 샘플링하여 이를 완화합니다.

또한, 대규모 언어 모델을 사용한 그래프 학습 모델의 실제 능력을 측정하고, 의미 있는 비교를 가능하게 하는 공정하고 포괄적인 평가 벤치마크를 설정하는 것이 중요합니다.

  1. 이전성과 설명 가능성: 대규모 언어 모델은 제로샷 학습과 몇몇 샷 학습에서 뛰어난 성능을 보이지만, 다양한 그래프 도메인과 구조에서 지식을 이전하는 능력은 여전히 도전입니다. 이러한 모델의 이전성을 개선하는 것은 중요한 연구 방향입니다.

또한, 대규모 언어 모델을 사용한 그래프 학습 모델의 설명 가능성을 향상시키는 것이 중요합니다. 이는 이러한 모델의 채택과 신뢰를 높이는 데 도움이 됩니다. 체인 오브 사고 프롬프팅과 같은 기술을 사용하여 대규모 언어 모델의 내부 推論 과정을 이해하는 데 도움이 될 수 있습니다.

  1. 다중 모달 통합: 그래프는 텍스트 외에도 이미지, 오디오, 숫자 데이터 등 다양한 모달리티를 포함할 수 있습니다. 이러한 다중 모달 그래프 설정에서 대규모 언어 모델과 그래프 학습을 통합하는 것은 흥미로운 연구 방향입니다.

실제 응용과 사례 연구

대규모 언어 모델과 그래프 학습의 통합은 이미 다양한 실제 응용 분야에서 유망한 결과를 보이고 있습니다.

  1. 분자 속성 예측: 계산 화학과 약물 발견 분야에서, 대규모 언어 모델은 분자 그래프의 구조적 정보를 통합하여 분자 속성 예측을 개선하는 데 사용되었습니다. LLM4Mol 모델은 ChatGPT를 사용하여 SMILES 표현의 설명을 생성하고, 이를 분자 속성 예측 태스크에서 사용하여 정확도를 개선합니다.
  2. 지식 그래프 완성과 推論: 지식 그래프는 실제 엔티티와 그 관계를 나타내는 특별한 그래프 구조입니다. 대규모 언어 모델은 지식 그래프 완성과 推論 태스크에서 그래프 구조와 텍스트 정보를 함께 고려하여 사용될 수 있습니다.
  3. 추천 시스템: 추천 시스템 분야에서, 그래프 구조는 사용자-아이템 상호작용을 나타내는 데 사용됩니다. 대규모 언어 모델은 이러한 그래프를 강화하기 위해 사용자/아이템 사이드 정보를 생성하거나 상호작용 에지를 강화하는 데 사용될 수 있습니다.

결론

대규모 언어 모델과 그래프 학습의 시너지는 인공 지능 연구에서 흥미로운 전선을 열어줍니다. 그래프 신경망의 구조적 인DUCTIVE 편향과 대규모 언어 모델의 강력한 의미적 이해 능력을 결합하여, 텍스트 속성이 있는 그래프에서 그래프 학습 태스크의 새로운 가능성을 열어줍니다.

다양한 도전이 남아 있지만, 효율성, 확장성, 이전성, 설명 가능성 등과 같은 분야에서 진행 중인 연구는 실제 응용 분야에서 대규모 언어 모델을 사용한 그래프 학습 모델의 실용적인 배포를 위한 길을 열어줍니다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.