Os grafos são estruturas de dados que representam relacionamentos complexos em uma ampla gama de domínios, incluindo redes sociais, bases de conhecimento, sistemas biológicos e muitos outros. Nesses grafos, as entidades são representadas como nós e suas relações são descritas como arestas.
A capacidade de representar e raciocinar efetivamente sobre essas estruturas relacionais intricadas é crucial para permitir avanços em campos como ciência de rede, quimioinformática e sistemas de recomendação.
As Redes Neurais de Grafos (GNNs) surgiram como uma poderosa estrutura de aprendizado profundo para tarefas de aprendizado de máquina em grafos. Ao incorporar a topologia do grafo na arquitetura da rede neural por meio de agregação de vizinhança ou convoluções de grafos, as GNNs podem aprender representações vetoriais de baixa dimensão que codificam tanto as características dos nós quanto seus papéis estruturais. Isso permite que as GNNs atinjam o desempenho de estado da arte em tarefas como classificação de nós, previsão de links e classificação de grafos em diversas áreas de aplicação.
Embora as GNNs tenham impulsionado um progresso significativo, alguns desafios importantes permanecem. Obter dados rotulados de alta qualidade para treinar modelos de GNN supervisionados pode ser caro e demorado. Além disso, as GNNs podem ter dificuldade em lidar com estruturas de grafos heterogêneas e situações em que a distribuição do grafo no tempo de teste difere significativamente dos dados de treinamento (generalização fora da distribuição).
Em paralelo, os Grandes Modelos de Linguagem (LLMs) como o GPT-4 e o LLaMA conquistaram o mundo com suas incríveis capacidades de compreensão e geração de linguagem natural. Treinados em vastos corpora de texto com bilhões de parâmetros, os LLMs exibem notáveis habilidades de aprendizado de poucos disparos, generalização entre tarefas e habilidades de raciocínio comum que antes eram consideradas extremamente desafiadoras para os sistemas de IA.
O sucesso tremendo dos LLMs catalisou explorações sobre como aproveitar seu poder para tarefas de aprendizado de máquina em grafos. Por um lado, as capacidades de conhecimento e raciocínio dos LLMs apresentam oportunidades para melhorar os modelos de GNN tradicionais. Por outro lado, as representações estruturadas e o conhecimento factual inerentes aos grafos poderiam ser instrumentais para abordar algumas limitações-chave dos LLMs, como alucinações e falta de interpretabilidade.
Redes Neurais de Grafos e Aprendizado Auto-Supervisionado
Para fornecer o contexto necessário, vamos primeiro revisar brevemente os conceitos e métodos centrais nas redes neurais de grafos e no aprendizado de representação de grafos auto-supervisionado.
A distinção-chave entre as redes neurais tradicionais e as GNNs reside em sua capacidade de operar diretamente em dados estruturados em grafos. As GNNs seguem um esquema de agregação de vizinhança, onde cada nó agrega vetores de características de seus vizinhos para computar sua própria representação.
Mais recentemente, os transformadores de grafos ganharam popularidade ao adaptar o mecanismo de auto-atenção dos transformadores de linguagem natural para operar em dados estruturados em grafos. Alguns exemplos incluem GraphormerTransformer e GraphFormers. Esses modelos são capazes de capturar dependências de longo alcance ao longo do grafo melhor do que as GNNs puramente baseadas em vizinhança.
Aprendizado Auto-Supervisionado em Grafos
Embora as GNNs sejam modelos de representação poderosos, seu desempenho é frequentemente limitado pela falta de grandes conjuntos de dados rotulados necessários para treinamento supervisionado. O aprendizado auto-supervisionado emergiu como um paradigma promissor para pré-treinar GNNs em dados de grafos não rotulados, aproveitando tarefas pretextuais que apenas requerem a estrutura intrínseca do grafo e as características dos nós.
Algumas tarefas pretextuais comuns usadas para pré-treinamento auto-supervisionado de GNNs incluem:
Previsão de Propriedades de Nós: Mascaramento aleatório ou corrupção de uma porção dos atributos/nós e tarefa de reconstruí-los.
Previsão de Links/Arestas: Aprender a prever se uma aresta existe entre um par de nós, frequentemente com base em mascaramento aleatório de arestas.
Aprendizado Contraste: Maximizar as similaridades entre visualizações do mesmo exemplo de grafo enquanto afasta visualizações de diferentes grafos.
Maximização de Informação Mútua: Maximizar a informação mútua entre representações locais de nós e uma representação de destino, como a incorporação global do grafo.
Tarefas pretextuais como essas permitem que a GNN extraia padrões estruturais e semânticos significativos dos dados de grafo não rotulados durante o pré-treinamento. A GNN pré-treinada pode então ser ajustada finamente em conjuntos de dados rotulados relativamente pequenos para excelar em diversas tarefas downstream, como classificação de nós, previsão de links e classificação de grafos.
Ao aproveitar a auto-supervisão, as GNNs pré-treinadas em grandes conjuntos de dados não rotulados exibem melhor generalização, robustez a mudanças de distribuição e eficiência em comparação com o treinamento a partir do zero. No entanto, algumas limitações-chave dos métodos de auto-supervisão baseados em GNNs tradicionais permanecem, que exploraremos a seguir, aproveitando os LLMs para abordá-las.
Melhorando o Aprendizado de Máquina de Grafos com Modelos de Linguagem Grande
As capacidades notáveis dos LLMs na compreensão de linguagem natural, raciocínio e aprendizado de poucos disparos apresentam oportunidades para melhorar vários aspectos dos pipelines de aprendizado de máquina em grafos. Exploramos algumas direções de pesquisa-chave nesse espaço:
Um desafio-chave na aplicação de GNNs é obter representações de características de alta qualidade para nós e arestas, especialmente quando elas contêm atributos textuais ricos, como descrições, títulos ou resumos. Tradicionalmente, modelos de word embedding simples ou pré-treinados têm sido usados, que frequentemente falham em capturar a semântica sutil.
Trabalhos recentes demonstraram o poder de aproveitar modelos de linguagem grande como codificadores de texto para construir melhores representações de características de nó/aresta antes de passá-las para a GNN. Por exemplo, Chen et al. utilizam LLMs como o GPT-3 para codificar atributos textuais de nós, mostrando ganhos de desempenho significativos sobre os embeddings de palavras tradicionais em tarefas de classificação de nós.
Além de melhores codificadores de texto, os LLMs podem ser usados para gerar informações aumentadas a partir dos atributos textuais originais de maneira semi-supervisionada. TAPE gera rótulos/explicações potenciais para nós usando um LLM e os usa como recursos adicionais aumentados. KEA extrai termos de atributos textuais usando um LLM e obtém descrições detalhadas para esses termos para aumentar os recursos.
Ao melhorar a qualidade e a expressividade das características de entrada, os LLMs podem impartir suas capacidades superiores de compreensão de linguagem natural para as GNNs, impulsionando o desempenho em tarefas downstream.
Aliviando a Dependência de Dados Rotulados
Uma vantagem-chave dos LLMs é sua capacidade de realizar tarefas com poucos dados rotulados, graças ao seu pré-treinamento em vastos corpora de texto. Essa capacidade de aprendizado de poucos disparos pode ser aproveitada para aliviar a dependência das GNNs em grandes conjuntos de dados rotulados.
Uma abordagem é usar LLMs para fazer previsões diretas em tarefas de grafos, descrevendo a estrutura do grafo e as informações dos nós em prompts de linguagem natural. Métodos como InstructGLM e GPT4Graph ajustam finamente LLMs como LLaMA e GPT-4 usando prompts cuidadosamente projetados que incorporam detalhes da topologia do grafo, como conexões de nós, vizinhanças, etc. Os LLMs ajustados podem então gerar previsões para tarefas como classificação de nós e previsão de links de forma zero-shot durante a inferência.
Embora usar LLMs como preditores de caixa-preta tenha mostrado promessa, seu desempenho degrada para tarefas de grafos mais complexas, onde o modelamento explícito da estrutura é benéfico. Algumas abordagens usam LLMs em conjunto com GNNs – a GNN codifica a estrutura do grafo, enquanto o LLM fornece uma compreensão semântica melhorada dos nós a partir de suas descrições textuais.
GraphLLM explora duas estratégias: 1) LLMs como Melhoradores, onde os LLMs codificam atributos textuais de nós antes de passá-los para a GNN, e 2) LLMs como Preditores, onde o LLM recebe as representações intermediárias da GNN como entrada para fazer previsões finais.
GLEM vai além, propondo um algoritmo de EM variacional que alterna entre a atualização do LLM e do componente GNN para melhoria mútua.
Ao reduzir a dependência de dados rotulados por meio de capacidades de poucos disparos e aumento semi-supervisionado, os métodos de aprendizado de grafos melhorados por LLMs podem desbloquear novas aplicações e melhorar a eficiência dos dados.
Melhorando os LLMs com Grafos
Embora os LLMs tenham sido extremamente bem-sucedidos, eles ainda sofrem de limitações-chave, como alucinações (geração de declarações não factuais), falta de interpretabilidade em seu processo de raciocínio e incapacidade de manter conhecimento factual consistente.
Os grafos, especialmente os grafos de conhecimento, que representam informações factuais estruturadas de fontes confiáveis, apresentam avenidas promissoras para abordar essas deficiências. Exploramos algumas abordagens emergentes nessa direção:
Pré-Treinamento de LLM com Grafos de Conhecimento
Semelhante à forma como os LLMs são pré-treinados em grandes corpora de texto, trabalhos recentes exploraram pré-treinar os LLMs em grafos de conhecimento para infundir melhor consciência factual e capacidades de raciocínio.
Algumas abordagens modificam os dados de entrada simplesmente concatenando ou alinhando triplas factuais de KG com texto de linguagem natural durante o pré-treinamento. E-BERT alinha vetores de entidades de KG com embeddings de wordpiece do BERT, enquanto K-BERT constrói árvores contendo a sentença original e triplas de KG relevantes.
O Papel dos LLMs no Aprendizado de Máquina de Grafos:
Pesquisadores exploraram várias maneiras de integrar LLMs ao pipeline de aprendizado de grafos, cada uma com suas vantagens e aplicações únicas. Aqui estão alguns dos papéis proeminentes que os LLMs podem desempenhar:
LLM como Melhorador: Nessa abordagem, os LLMs são usados para enriquecer os atributos textuais associados aos nós em um TAG. A capacidade do LLM de gerar explicações, entidades de conhecimento ou rótulos pseudo pode aumentar a informação semântica disponível para a GNN, levando a melhorias nas representações de nós e no desempenho das tarefas downstream.
Por exemplo, o modelo TAPE (Text Augmented Pre-trained Encoders) aproveita o ChatGPT para gerar explicações e rótulos pseudo para artigos de rede de citação, que são então usados para ajustar finamente um modelo de linguagem. As embeddings resultantes são alimentadas em uma GNN para tarefas de classificação de nós e previsão de links, alcançando resultados de estado da arte.
LLM como Preditores: Em vez de melhorar as características de entrada, algumas abordagens empregam LLMs diretamente como o componente de previsão para tarefas relacionadas a grafos. Isso envolve converter a estrutura do grafo em uma representação textual que possa ser processada pelo LLM, que então gera a saída desejada, como rótulos de nós ou previsões de nível de grafo.
Um exemplo notável é o modelo GPT4Graph, que representa grafos usando a Linguagem de Modelagem de Grafos (GML) e aproveita o poderoso LLM GPT-4 para tarefas de raciocínio de grafos zero-shot.
Alinhamento GNN-LLM: Outra linha de pesquisa se concentra em alinhar os espaços de incorporação das GNNs e LLMs, permitindo uma integração sem problemas de informações estruturais e semânticas. Essas abordagens tratam a GNN e o LLM como modalidades separadas e empregam técnicas como aprendizado contraste ou destilação para alinhar suas representações.
O modelo MoleculeSTM, por exemplo, usa um objetivo contraste para alinhar as incorporações de uma GNN e um LLM, permitindo que o LLM incorpore informações estruturais da GNN enquanto a GNN se beneficia do conhecimento semântico do LLM.
Desafios e Soluções
Embora a integração de LLMs e aprendizado de grafos seja promissora, vários desafios precisam ser abordados:
Eficiência e Escalabilidade: Os LLMs são notoriamente intensivos em recursos, frequentemente exigindo bilhões de parâmetros e imensa potência computacional para treinamento e inferência. Isso pode ser um gargalo significativo para o deploy de modelos de aprendizado de grafos melhorados por LLMs em aplicações do mundo real, especialmente em dispositivos com recursos limitados.
Uma solução promissora é a destilação de conhecimento, onde o conhecimento de um grande LLM (modelo de professor) é transferido para um modelo GNN menor e mais eficiente (modelo de aluno).
Vazamento de Dados e Avaliação: Os LLMs são pré-treinados em vastas quantidades de dados públicos, que podem incluir conjuntos de teste de datasets de benchmark comuns, levando a potencial vazamento de dados e superestimação do desempenho. Pesquisadores começaram a coletar novos datasets ou a amostrar dados de teste de períodos após o corte de treinamento do LLM para mitigar esse problema.
Além disso, estabelecer benchmarks de avaliação justos e abrangentes para modelos de aprendizado de grafos melhorados por LLMs é crucial para medir suas capacidades reais e permitir comparações significativas.
Transferibilidade e Explicabilidade: Embora os LLMs sejam excelentes em aprendizado de poucos disparos, sua capacidade de transferir conhecimento para diferentes domínios e estruturas de grafos permanece um desafio aberto. Melhorar a transferibilidade desses modelos é uma direção de pesquisa crítica.
Além disso, melhorar a explicabilidade dos modelos de aprendizado de grafos baseados em LLMs é essencial para construir confiança e permitir sua adoção em aplicações de alto risco. Aproveitar as capacidades inerentes de raciocínio dos LLMs por meio de técnicas como prompting de cadeia de pensamento pode contribuir para uma explicabilidade melhorada.
Integração Multimodal: Os grafos frequentemente contêm mais do que apenas informações textuais, com nós e arestas potencialmente associados a várias modalidades, como imagens, áudio ou dados numéricos. Estender a integração de LLMs a esses ambientes de grafos multimodais apresenta uma oportunidade emocionante para pesquisas futuras.
Aplicações e Estudos de Caso do Mundo Real
A integração de LLMs e aprendizado de máquina de grafos já mostrou resultados promissores em várias aplicações do mundo real:
Previsão de Propriedades Moleculares: No campo da química computacional e descoberta de drogas, os LLMs foram empregados para melhorar a previsão de propriedades moleculares, incorporando informações estruturais de grafos moleculares. O modelo LLM4Mol, por exemplo, aproveita o ChatGPT para gerar explicações para representações SMILES (Simplified Molecular-Input Line-Entry System) de moléculas, que são então usadas para melhorar a precisão de tarefas de previsão de propriedades.
Conclusão de Grafos de Conhecimento e Raciocínio: Os grafos de conhecimento são um tipo especial de estrutura de grafo que representa entidades e relações do mundo real. Os LLMs foram explorados para tarefas como conclusão de grafos de conhecimento e raciocínio, onde a estrutura do grafo e as informações textuais (por exemplo, descrições de entidades) precisam ser consideradas conjuntamente.
Sistemas de Recomendação: No domínio dos sistemas de recomendação, estruturas de grafos são frequentemente usadas para representar interações entre usuários e itens, com nós representando usuários e itens e arestas denotando interações ou similaridades. Os LLMs podem ser usados para melhorar esses grafos, gerando informações laterais de usuário/item ou reforçando arestas de interação.
Conclusão
A sinergia entre os Modelos de Linguagem Grande e o Aprendizado de Máquina de Grafos apresenta uma fronteira emocionante na pesquisa de inteligência artificial. Ao combinar o viés indutivo estrutural das GNNs com as capacidades de compreensão semântica poderosas dos LLMs, podemos desbloquear novas possibilidades em tarefas de aprendizado de grafos, particularmente para grafos com atributos textuais.
Embora tenha sido feito um progresso significativo, desafios permanecem em áreas como eficiência, escalabilidade, transferibilidade e explicabilidade. Técnicas como destilação de conhecimento, benchmarks de avaliação justos e integração multimodal estão pavimentando o caminho para o deploy prático de modelos de aprendizado de grafos melhorados por LLMs em aplicações do mundo real.
Eu passei os últimos cinco anos me imergindo no fascinante mundo de Aprendizado de Máquina e Aprendizado Profundo. Minha paixão e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua também me levou em direção ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.