Los grafos son estructuras de datos que representan relaciones complejas en una amplia gama de dominios, incluyendo redes sociales, bases de conocimiento, sistemas biológicos y muchos más. En estos grafos, las entidades se representan como nodos y sus relaciones se describen como aristas.
La capacidad de representar y razonar efectivamente sobre estas estructuras relacionales intrincadas es crucial para permitir avances en campos como la ciencia de redes, la quimioinformática y los sistemas de recomendación.
Las Redes Neuronales de Grafos (GNN) han surgido como un poderoso marco de aprendizaje profundo para tareas de aprendizaje de grafos. Al incorporar la topología del grafo en la arquitectura de la red neuronal a través de un esquema de agregación de vecindad o convoluciones de grafos, las GNN pueden aprender representaciones vectoriales de baja dimensión que codifican tanto las características de los nodos como sus roles estructurales. Esto permite que las GNN logren un rendimiento de vanguardia en tareas como la clasificación de nodos, la predicción de enlaces y la clasificación de grafos en diversas áreas de aplicación.
Aunque las GNN han impulsado un progreso sustancial, algunos desafíos clave siguen siendo. Obtener datos etiquetados de alta calidad para el entrenamiento de modelos de GNN supervisados puede ser costoso y consume mucho tiempo. Además, las GNN pueden tener dificultades con estructuras de grafos heterogéneas y situaciones en las que la distribución del grafo en el momento de la prueba difiere significativamente de los datos de entrenamiento (generalización fuera de la distribución).
En paralelo, los Modelos de Lenguaje Grande (LLM) como GPT-4 y LLaMA han revolucionado el mundo con sus increíbles capacidades de comprensión y generación de lenguaje natural. Entrenados en enormes corpus de texto con miles de millones de parámetros, los LLM exhiben habilidades de aprendizaje de pocos disparos, generalización a través de tareas y habilidades de razonamiento común que antes se consideraban extremadamente desafiantes para los sistemas de inteligencia artificial.
El éxito tremendo de los LLM ha catalizado exploraciones para aprovechar su poder para tareas de aprendizaje de grafos. Por un lado, las capacidades de conocimiento y razonamiento de los LLM presentan oportunidades para mejorar los modelos de GNN tradicionales. Por otro lado, las representaciones estructuradas y el conocimiento factual inherentes en los grafos podrían ser instrumentales para abordar algunas limitaciones clave de los LLM, como alucinaciones y falta de interpretabilidad.
Redes Neuronales de Grafos y Aprendizaje Autosupervisado
Para proporcionar el contexto necesario, primero revisaremos brevemente los conceptos y métodos básicos en redes neuronales de grafos y aprendizaje de representación de grafos autosupervisado.
La distinción clave entre las redes neuronales tradicionales y las GNN radica en su capacidad para operar directamente en datos estructurados en forma de grafo. Las GNN siguen un esquema de agregación de vecindad, donde cada nodo agrega vectores de características de sus vecinos para calcular su propia representación.
Más recientemente, los transformadores de grafos han ganado popularidad al adaptar el mecanismo de autoatención de los transformadores de lenguaje natural para operar en datos estructurados en forma de grafo. Algunos ejemplos incluyen GraphormerTransformer y GraphFormers. Estos modelos pueden capturar dependencias de largo alcance en el grafo mejor que las GNN puramente basadas en vecindad.
Aprendizaje Autosupervisado en Grafos
Aunque las GNN son modelos de representación poderosos, su rendimiento a menudo se ve limitado por la falta de grandes conjuntos de datos etiquetados para el entrenamiento supervisado. El aprendizaje autosupervisado ha surgido como un paradigma prometedor para preentrenar GNN en datos de grafo no etiquetados aprovechando tareas de pretexto que solo requieren la estructura intrínseca del grafo y las características de los nodos.
Algunas tareas de pretexto comunes utilizadas para el preentrenamiento de GNN autosupervisado incluyen:
Predicción de Propiedades de Nodos: Enmascarar o corromper aleatoriamente una parte de los atributos/nodos y pedir a la GNN que los reconstruya.
Predicción de Enlaces/Bordes: Aprender a predecir si existe un borde entre un par de nodos, a menudo basado en el enmascaramiento aleatorio de bordes.
Aprendizaje Contraste: Maximizar las similitudes entre vistas del grafo de la misma muestra de grafo mientras se alejan vistas de diferentes grafos.
Maximización de Información Mutua: Maximizar la información mutua entre representaciones locales de nodos y una representación objetivo como la incrustación global del grafo.
Tareas de pretexto como estas permiten que la GNN extraiga patrones estructurales y semánticos significativos de los datos de grafo no etiquetados durante el preentrenamiento. La GNN preentrenada luego se puede ajustar en subconjuntos etiquetados relativamente pequeños para destacar en diversas tareas posteriores como la clasificación de nodos, la predicción de enlaces y la clasificación de grafos.
Al aprovechar la autosupervisión, las GNN preentrenadas en grandes conjuntos de datos no etiquetados exhiben una mejor generalización, robustez frente a cambios en la distribución y eficiencia en comparación con el entrenamiento desde cero. Sin embargo, algunas limitaciones clave de los métodos de aprendizaje autosupervisado basados en GNN tradicionales siguen siendo, las cuales abordaremos aprovechando los LLM a continuación.
Mejorando el Aprendizaje de Grafos con Modelos de Lenguaje Grande
Las capacidades notables de los LLM en la comprensión del lenguaje natural, el razonamiento y el aprendizaje de pocos disparos presentan oportunidades para mejorar múltiples aspectos de las tuberías de aprendizaje de grafos. Exploramos algunas direcciones de investigación clave en este espacio:
Un desafío clave al aplicar GNN es obtener representaciones de características de alta calidad para nodos y bordes, especialmente cuando contienen atributos textuales ricos como descripciones, títulos o resúmenes. Tradicionalmente, se han utilizado modelos de bolsa de palabras o modelos de incrustación de palabras preentrenados, que a menudo no capturan la semántica sutil.
Trabajos recientes han demostrado el poder de aprovechar modelos de lenguaje grande como codificadores de texto para construir mejores representaciones de características de nodos/bordes antes de pasarlas a la GNN. Por ejemplo, Chen et al. utilizan LLM como GPT-3 para codificar atributos textuales de nodos, mostrando ganancias de rendimiento significativas sobre las incrustaciones de palabras tradicionales en tareas de clasificación de nodos.
Más allá de mejores codificadores de texto, los LLM pueden usarse para generar información de refuerzo a partir de los atributos textuales originales de manera semisupervisada. TAPE genera etiquetas/preguntas potenciales para nodos usando un LLM y las usa como características de refuerzo adicionales. KEA extrae términos de atributos textuales usando un LLM y obtiene descripciones detalladas para estos términos para refuerzo de características.
Al mejorar la calidad y la expresividad de las características de entrada, los LLM pueden impartir sus capacidades superiores de comprensión del lenguaje natural a las GNN, mejorando el rendimiento en tareas posteriores.
Aliviar la Dependencia de Datos Etiquetados
Una ventaja clave de los LLM es su capacidad para realizar predicciones razonables en nuevas tareas con pocos o ningún dato etiquetado, gracias a su preentrenamiento en vastos corpus de texto. Esta capacidad de aprendizaje de pocos disparos puede aprovecharse para aliviar la dependencia de las GNN en grandes conjuntos de datos etiquetados.
Un enfoque es usar LLM para hacer predicciones directas en tareas de grafos describiendo la estructura del grafo y la información del nodo en prompts de lenguaje natural. Métodos como InstructGLM y GPT4Graph ajustan LLM como LLaMA y GPT-4 usando prompts cuidadosamente diseñados que incorporan detalles de la topología del grafo como conexiones de nodos, vecindarios, etc. Los LLM ajustados pueden generar predicciones para tareas como la clasificación de nodos y la predicción de enlaces de manera cero-disparo durante la inferencia.
Aunque usar LLM como predictores de caja negra ha mostrado promesa, su rendimiento se degrada para tareas de grafos más complejas donde el modelado explícito de la estructura es beneficioso. Algunos enfoques usan LLM en conjunto con GNN: la GNN codifica la estructura del grafo mientras que el LLM proporciona una comprensión semántica mejorada de los nodos a partir de sus descripciones textuales.
GraphLLM explora dos estrategias: 1) LLM como Mejoradores donde los LLM codifican atributos textuales de nodos antes de pasarlos a la GNN, y 2) LLM como Predictores donde el LLM toma las representaciones intermedias de la GNN como entrada para hacer predicciones finales.
GLEM va más allá al proponer un algoritmo de Expectación-Máxima variacional que alterna entre la actualización de los componentes LLM y GNN para un mejoramiento mutuo.
Al reducir la dependencia de datos etiquetados a través de capacidades de pocos disparos y refuerzo semisupervisado, los métodos de aprendizaje de grafos mejorados con LLM pueden desbloquear nuevas aplicaciones y mejorar la eficiencia de los datos.
Mejorando LLM con Grafos
Aunque los LLM han sido tremendamente exitosos, todavía sufren de limitaciones clave como alucinaciones (generar afirmaciones no factuales), falta de interpretabilidad en su proceso de razonamiento y la incapacidad de mantener conocimiento factual consistente.
Los grafos, especialmente los grafos de conocimiento que representan información factual estructurada de fuentes confiables, presentan vías prometedoras para abordar estas deficiencias. Exploramos algunos enfoques emergentes en esta dirección:
Preentrenamiento de LLM Mejorado con Grafos de Conocimiento
Similar a cómo los LLM se preentrenan en grandes corpus de texto, trabajos recientes han explorado preentrenarlos en grafos de conocimiento para infundir mejor conciencia factual y capacidades de razonamiento.
Algunos enfoques modifican los datos de entrada simplemente concatenando o alineando triples de KG con texto natural durante el preentrenamiento. E-BERT alinea vectores de entidades de KG con incrustaciones de wordpiece de BERT, mientras que K-BERT construye árboles que contienen la oración original y los triples de KG relevantes.
El Papel de los LLM en el Aprendizaje de Grafos
Los investigadores han explorado varias formas de integrar LLM en la tubería de aprendizaje de grafos, cada una con sus ventajas y aplicaciones únicas. Aquí hay algunos de los papeles prominentes que los LLM pueden desempeñar:
LLM como Mejorador: En este enfoque, los LLM se utilizan para enriquecer los atributos textuales asociados con los nodos en un TAG. La capacidad del LLM para generar explicaciones, entidades de conocimiento o etiquetas pseudo puede aumentar la información semántica disponible para la GNN, lo que conduce a mejores representaciones de nodos y un mejor rendimiento en tareas posteriores.
Por ejemplo, el modelo TAPE (Text Augmented Pre-trained Encoders) aprovecha ChatGPT para generar explicaciones y etiquetas pseudo para artículos de redes de citas, que luego se utilizan para ajustar un modelo de lenguaje. Las incrustaciones resultantes se alimentan a una GNN para tareas de clasificación de nodos y predicción de enlaces, logrando resultados de vanguardia.
LLM como Predictor: En lugar de mejorar las características de entrada, algunos enfoques emplean LLM directamente como el componente predictor para tareas relacionadas con grafos. Esto implica convertir la estructura del grafo en una representación textual que pueda ser procesada por el LLM, que luego genera la salida deseada, como etiquetas de nodos o predicciones a nivel de grafo.
Un ejemplo notable es el modelo GPT4Graph, que representa grafos usando el Lenguaje de Modelado de Grafos (GML) y aprovecha el poderoso LLM GPT-4 para tareas de razonamiento de grafos de cero-disparo.
Alineación GNN-LLM: Otra línea de investigación se centra en alinear los espacios de incrustación de las GNN y los LLM, permitiendo una integración sin problemas de la información estructural y semántica. Estos enfoques tratan la GNN y el LLM como modalidades separadas y emplean técnicas como el aprendizaje contraste o la destilación para alinear sus representaciones.
El modelo MoleculeSTM, por ejemplo, utiliza un objetivo contraste para alinear las incrustaciones de una GNN y un LLM, permitiendo que el LLM incorpore información estructural de la GNN mientras la GNN se beneficia del conocimiento semántico del LLM.
Desafíos y Soluciones
Aunque la integración de LLM y aprendizaje de grafos tiene un gran potencial, varios desafíos necesitan ser abordados:
Eficiencia y Escalabilidad: Los LLM son notoriamente intensivos en recursos, a menudo requiriendo miles de millones de parámetros y una gran potencia computacional para el entrenamiento y la inferencia. Esto puede ser un cuello de botella significativo para desplegar modelos de aprendizaje de grafos mejorados con LLM en aplicaciones del mundo real, especialmente en dispositivos con recursos limitados.
Una solución prometedora es la destilación de conocimiento, donde el conocimiento de un LLM grande (modelo de maestro) se transfiere a un GNN más pequeño y eficiente (modelo de estudiante).
Filtrado de Datos y Evaluación: Los LLM se preentrenan en grandes cantidades de datos públicos, que pueden incluir conjuntos de prueba de datasets de referencia, lo que conduce a posibles fugas de datos y sobreestimación del rendimiento. Los investigadores han comenzado a recopilar nuevos conjuntos de datos o a muestrear datos de prueba de períodos de tiempo posteriores al corte de entrenamiento del LLM para mitigar este problema.
Además, establecer benchmarks de evaluación justos y exhaustivos para los modelos de aprendizaje de grafos mejorados con LLM es crucial para medir sus capacidades reales y permitir comparaciones significativas.
Transferibilidad y Explicabilidad: Aunque los LLM destacan en el aprendizaje de cero-disparo y pocos-disparos, su capacidad para transferir conocimiento a través de dominios y estructuras de grafos diversos sigue siendo un desafío abierto. Mejorar la transferibilidad de estos modelos es una dirección de investigación crítica.
Además, mejorar la explicabilidad de los modelos de aprendizaje de grafos basados en LLM es esencial para construir confianza y permitir su adopción en aplicaciones de alto riesgo. Aprovechar las capacidades de razonamiento inherentes de los LLM a través de técnicas como prompt de cadena de pensamiento puede contribuir a una mejor explicabilidad.
Integración Multimodal: Los grafos a menudo contienen más que solo información textual, con nodos y bordes potencialmente asociados con varias modalidades, como imágenes, audio o datos numéricos. Extender la integración de LLM a estos entornos de grafos multimodales presenta una oportunidad emocionante para la investigación futura.
Aplicaciones y Estudios de Casos en el Mundo Real
La integración de LLM y aprendizaje de grafos ya ha mostrado resultados prometedores en diversas aplicaciones del mundo real:
Predicción de Propiedades Moleculares: En el campo de la quimioinformática y el descubrimiento de fármacos, los LLM se han utilizado para mejorar la predicción de propiedades moleculares incorporando información estructural de grafos moleculares. El modelo LLM4Mol, por ejemplo, aprovecha ChatGPT para generar explicaciones para representaciones SMILES (Simplified Molecular-Input Line-Entry System) de moléculas, que luego se utilizan para mejorar la precisión de las tareas de predicción de propiedades.
Completado y Razonamiento de Grafos de Conocimiento: Los grafos de conocimiento son un tipo especial de estructura de grafo que representa entidades y relaciones del mundo real. Los LLM se han explorado para tareas como la completitud de grafos de conocimiento y el razonamiento, donde la estructura del grafo y la información textual (por ejemplo, descripciones de entidades) deben considerarse conjuntamente.
Sistemas de Recomendación: En el dominio de los sistemas de recomendación, las estructuras de grafo se utilizan a menudo para representar interacciones entre usuarios y artículos, con nodos que representan usuarios y artículos, y bordes que denotan interacciones o similitudes. Los LLM pueden aprovecharse para mejorar estos grafos generando información lateral de usuarios/artículos o reforzando bordes de interacción.
Conclusión
La sinergia entre Modelos de Lenguaje Grande y Aprendizaje de Grafos presenta una frontera emocionante en la investigación de inteligencia artificial. Al combinar el sesgo inductivo estructural de las GNN con las capacidades de comprensión semántica poderosas de los LLM, podemos desbloquear nuevas posibilidades en tareas de aprendizaje de grafos, particularmente para grafos con atributos textuales.
Aunque se ha logrado un progreso significativo, desafíos permanecen en áreas como la eficiencia, la escalabilidad, la transferibilidad y la explicabilidad. Técnicas como la destilación de conocimiento, los benchmarks de evaluación justos y la integración multimodal están allanando el camino para el despliegue práctico de modelos de aprendizaje de grafos mejorados con LLM en aplicaciones del mundo real.
He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.