Modelos y plataformas de IA

El Problema de la Caja Negra en LLMs: Desafíos y Soluciones Emergentes

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

El aprendizaje automÃĄtico, un subconjunto de la inteligencia artificial, implica tres componentes: algoritmos, datos de entrenamiento y el modelo resultante. Un algoritmo, esencialmente un conjunto de procedimientos, aprende a identificar patrones a partir de un gran conjunto de ejemplos (datos de entrenamiento). La culminaciÃģn de este entrenamiento es un modelo de aprendizaje automÃĄtico. Por ejemplo, un algoritmo entrenado con imÃĄgenes de perros resultaría en un modelo capaz de identificar perros en imÃĄgenes.

La Caja Negra en el Aprendizaje AutomÃĄtico

En el aprendizaje automÃĄtico, cualquiera de los tres componentes —algoritmo, datos de entrenamiento o modelo— puede ser una caja negra. Aunque los algoritmos suelen ser de conocimiento pÚblico, los desarrolladores pueden elegir mantener el modelo o los datos de entrenamiento en secreto para proteger la propiedad intelectual. Esta oscuridad hace que sea desafiante entender el proceso de toma de decisiones de la inteligencia artificial.

Las cajas negras de la inteligencia artificial son sistemas cuyos mecanismos internos permanecen opacos o invisibles para los usuarios. Los usuarios pueden ingresar datos y recibir salidas, pero la lÃģgica o el cÃģdigo que produce la salida permanece oculto. Esta es una característica comÚn en muchos sistemas de inteligencia artificial, incluidos modelos generativos avanzados como ChatGPT y DALL-E 3.

Los LLM como GPT-4 presentan un desafío significativo: sus mecanismos internos son en gran medida opacos, lo que los convierte en “cajas negras”. Esta opacidad no es solo un rompecabezas tÃĐcnico; plantea preocupaciones de seguridad y ÃĐtica en el mundo real. Por ejemplo, si no podemos discernir cÃģmo estos sistemas llegan a conclusiones, Âŋpodemos confiar en ellos en ÃĄreas críticas como diagnÃģsticos mÃĐdicos o evaluaciones financieras?

Explorando las TÃĐcnicas de LIME y SHAP

La interpretabilidad en los modelos de aprendizaje automÃĄtico (ML) y aprendizaje profundo (DL) nos permite ver en los mecanismos internos opacos de estos modelos avanzados. Explicaciones Locales Interpretativas AgnÃģsticas del Modelo (LIME) y Explicaciones Aditivas de Shapley (SHAP) son dos tÃĐcnicas de interpretabilidad de este tipo.

Interpretability

Interpretability

LIME, por ejemplo, descompone la complejidad creando modelos sustitutos mÃĄs simples y locales que aproximan el comportamiento del modelo original alrededor de una entrada específica. Al hacer esto, LIME ayuda a entender cÃģmo las características individuales influyen en las predicciones de modelos complejos, esencialmente proporcionando una ‘explicaciÃģn local’ de por quÃĐ un modelo tomÃģ una determinada decisiÃģn. Es particularmente Útil para usuarios no tÃĐcnicos, ya que traduce el intrincado proceso de toma de decisiones de los modelos en tÃĐrminos mÃĄs comprensibles.

Model-Agnostic Interpretability of Machine Learning

Model-Agnostic Interpretability of Machine Learning (LIME) Source

SHAP, por otro lado, toma inspiraciÃģn de la teoría de juegos, específicamente del concepto de valores de Shapley. Asigna un valor de ‘importancia’ a cada característica, indicando cuÃĄnto contribuye cada característica a la diferencia entre la predicciÃģn real y la predicciÃģn de referencia (la predicciÃģn promedio en todos los inputs). La fuerza de SHAP radica en su coherencia y capacidad para proporcionar una perspectiva global – no solo explica predicciones individuales, sino que tambiÃĐn ofrece insights en el modelo en su conjunto. Esto es especialmente valioso en modelos de aprendizaje profundo, donde las capas interconectadas y los numerosos parÃĄmetros a menudo hacen que el proceso de predicciÃģn parezca un viaje a travÃĐs de un laberinto. SHAP desmitifica esto cuantificando la contribuciÃģn de cada característica, ofreciendo un mapa mÃĄs claro de las vías de toma de decisiones del modelo.

SHAP

SHAP (Source)

Ambas, LIME y SHAP, han surgido como herramientas esenciales en el ÃĄmbito de la inteligencia artificial y el aprendizaje automÃĄtico, abordando la necesidad crítica de transparencia y confiabilidad. A medida que continuamos integrando la inteligencia artificial mÃĄs profundamente en varios sectores, la capacidad de interpretar y comprender estos modelos se convierte no solo en una necesidad tÃĐcnica, sino en un requisito fundamental para el desarrollo ÃĐtico y responsable de la inteligencia artificial. Estas tÃĐcnicas representan avances significativos en la comprensiÃģn de la complejidad de los modelos de aprendizaje automÃĄtico y aprendizaje profundo, transformÃĄndolos de ‘cajas negras’ inescrutables en sistemas comprensibles cuyas decisiones y comportamientos pueden ser entendidos, confiados y utilizados de manera efectiva.

La Escala y Complejidad de los LLM

La escala de estos modelos aÃąade a su complejidad. Tomemos GPT-3, por ejemplo, con sus 175 mil millones de parÃĄmetros, y modelos mÃĄs nuevos con billones. Cada parÃĄmetro interactÚa de maneras intrincadas dentro de la red neuronal, contribuyendo a capacidades emergentes que no son predecibles examinando componentes individuales por sí solos. Esta escala y complejidad hacen que sea casi imposible comprender completamente su lÃģgica interna, lo que plantea un obstÃĄculo en el diagnÃģstico de sesgos o comportamientos no deseados en estos modelos.

El Compromiso: Escala vs. Interpretabilidad

Reducir la escala de los LLM podría mejorar la interpretabilidad, pero a costa de sus capacidades avanzadas. La escala es lo que permite comportamientos que los modelos mÃĄs pequeÃąos no pueden lograr. Esto presenta un compromiso inherente entre escala, capacidad e interpretabilidad.

Impacto del Problema de la Caja Negra de los LLM

1. Toma de Decisiones Defectuosa

La opacidad en el proceso de toma de decisiones de los LLM como GPT-3 o BERT puede llevar a sesgos y errores no detectados. En campos como la salud o la justicia penal, donde las decisiones tienen consecuencias de gran alcance, la incapacidad para auditar los LLM para sondear su solidez ÃĐtica y lÃģgica es una preocupaciÃģn mayor. Por ejemplo, un modelo de diagnÃģstico mÃĐdico que confía en datos obsoletos o sesgados puede hacer recomendaciones perjudiciales. De manera similar, los LLM en procesos de contrataciÃģn pueden perpetuar involuntariamente sesgos de gÃĐnero. La naturaleza de caja negra no solo oculta defectos, sino que tambiÃĐn puede potencialmente amplificarlos, lo que requiere un enfoque proactivo para mejorar la transparencia.

2. Adaptabilidad Limitada en Contextos Diversos

La falta de visibilidad en los mecanismos internos de los LLM restringe su adaptabilidad. Por ejemplo, un LLM de contrataciÃģn podría ser ineficiente al evaluar candidatos para un rol que valora habilidades prÃĄcticas sobre calificaciones acadÃĐmicas, debido a su incapacidad para ajustar sus criterios de evaluaciÃģn. De manera similar, un LLM mÃĐdico podría luchar con diagnÃģsticos de enfermedades raras debido a desequilibrios en los datos. Esta inflexibilidad destaca la necesidad de transparencia para recalibrar los LLM para tareas y contextos específicos.

3. Sesgo y Brechas de Conocimiento

El procesamiento de grandes cantidades de datos de entrenamiento por parte de los LLM estÃĄ sujeto a las limitaciones impuestas por sus algoritmos y arquitecturas de modelo. Por ejemplo, un LLM mÃĐdico podría mostrar sesgos demogrÃĄficos si se entrena con conjuntos de datos desequilibrados. AdemÃĄs, la pericia de un LLM en temas de nicho podría ser engaÃąosa, llevando a salidas incorrectas y confiadas. Abordar estos sesgos y brechas de conocimiento requiere mÃĄs que solo datos adicionales; requiere un examen de los mecanismos de procesamiento del modelo.

4. Responsabilidad Legal y Ética

La naturaleza opaca de los LLM crea un ÃĄrea gris legal en cuanto a la responsabilidad por cualquier daÃąo causado por sus decisiones. Si un LLM en un entorno mÃĐdico proporciona consejos defectuosos que llevan a daÃąos a un paciente, determinar la responsabilidad se vuelve difícil debido a la opacidad del modelo. Esta incertidumbre legal plantea riesgos para las entidades que despliegan LLM en ÃĄreas sensibles, subrayando la necesidad de una gobernanza y transparencia claras.

5. Problemas de Confianza en Aplicaciones Sensibles

Para los LLM utilizados en ÃĄreas críticas como la salud y las finanzas, la falta de transparencia socava su confiabilidad. Los usuarios y reguladores necesitan asegurarse de que estos modelos no alberguen sesgos o tomen decisiones basadas en criterios injustos. Verificar la ausencia de sesgo en los LLM requiere una comprensiÃģn de sus procesos de toma de decisiones, enfatizando la importancia de la explicabilidad para el despliegue ÃĐtico.

6. Riesgos con Datos Personales

Los LLM requieren grandes cantidades de datos de entrenamiento, que pueden incluir informaciÃģn personal sensible. La naturaleza de caja negra de estos modelos plantea preocupaciones sobre cÃģmo se procesa y utiliza esta informaciÃģn. Por ejemplo, un LLM mÃĐdico entrenado con registros de pacientes plantea preguntas sobre privacidad y uso de datos. Asegurarse de que los datos personales no sean mal utilizados o explotados requiere procesos de manejo de datos transparentes dentro de estos modelos.

Soluciones Emergentes para la Interpretabilidad

Para abordar estos desafíos, se estÃĄn desarrollando nuevas tÃĐcnicas. Estas incluyen mÃĐtodos de aproximaciÃģn contrafactual (CF). El primer mÃĐtodo implica solicitar a un LLM que cambie un concepto de texto específico mientras mantiene constantes otros conceptos. Este enfoque, aunque efectivo, es intensivo en recursos en el momento de inferencia.

El segundo enfoque implica crear un espacio de incrustaciÃģn dedicado guiado por un LLM durante el entrenamiento. Este espacio se alinea con un grafo causal y ayuda a identificar coincidencias que aproximan CF. Este mÃĐtodo requiere menos recursos en el momento de la prueba y se ha demostrado que explica efectivamente las predicciones del modelo, incluso en LLM con miles de millones de parÃĄmetros.

Estos enfoques destacan la importancia de explicaciones causales en los sistemas de NLP para garantizar la seguridad y establecer la confianza. Las aproximaciones contrafÃĄcticas proporcionan una forma de imaginar cÃģmo cambiaría un texto determinado si un concepto específico en su proceso generativo fuera diferente, ayudando en la estimaciÃģn prÃĄctica del efecto causal de conceptos de alto nivel en los modelos de NLP.

InmersiÃģn Profunda: MÃĐtodos de ExplicaciÃģn y Causalidad en LLM

Herramientas de Sondeo y Importancia de Características

El sondeo es una tÃĐcnica utilizada para descifrar quÃĐ representaciones internas en los modelos codifican. Puede ser supervisado o no supervisado y tiene como objetivo determinar si conceptos específicos estÃĄn codificados en ciertos lugares de la red. Aunque es efectivo hasta cierto punto, las sondas no proporcionan explicaciones causales, como se destaca en Geiger et al. (2021).

Las herramientas de importancia de características, otro tipo de mÃĐtodo de explicaciÃģn, a menudo se centran en características de entrada, aunque algunos mÃĐtodos basados en gradientes se extienden a estados ocultos. Un ejemplo es el mÃĐtodo de Gradientes Integrados, que ofrece una interpretaciÃģn causal explorando entradas de referencia (contrafÃĄcticas, CF). A pesar de su utilidad, estos mÃĐtodos todavía luchan por conectar sus anÃĄlisis con conceptos del mundo real mÃĄs allÃĄ de simples propiedades de entrada.

MÃĐtodos Basados en Intervenciones

Los mÃĐtodos basados en intervenciones implican modificar entradas o representaciones internas para estudiar los efectos en el comportamiento del modelo. Estos mÃĐtodos pueden crear estados contrafÃĄcticos para estimar efectos causales, pero a menudo generan entradas o estados de red poco plausibles a menos que se controlen cuidadosamente. El Modelo de Proxy Causal (CPM), inspirado en el concepto del aprendizaje S, es un enfoque novedoso en este ÃĄmbito, imitando el comportamiento del modelo explicado bajo entradas contrafÃĄcticas. Sin embargo, la necesidad de un explicador distinto para cada modelo es una limitaciÃģn importante.

AproximaciÃģn de ContrafÃĄcticos

Los contrafÃĄcticos se utilizan ampliamente en el aprendizaje automÃĄtico para la ampliaciÃģn de datos, que implica perturbaciones en varios factores o etiquetas. Estos pueden generarse a travÃĐs de ediciÃģn manual, reemplazo de palabras clave heurístico o reescritura de texto automÃĄtica. Si bien la ediciÃģn manual es precisa, tambiÃĐn es intensiva en recursos. Los mÃĐtodos basados en palabras clave tienen sus limitaciones, y los enfoques generativos ofrecen un equilibrio entre fluidez y cobertura.

Explicaciones Fieles

La fidelidad en las explicaciones se refiere a representar con precisiÃģn la lÃģgica subyacente del modelo. No hay una definiciÃģn universalmente aceptada de fidelidad, lo que lleva a su caracterizaciÃģn a travÃĐs de varias mÃĐtricas como Sensibilidad, Coherencia, Acuerdo de Importancia de Características, Robustez y Simulabilidad. La mayoría de estos mÃĐtodos se centran en explicaciones a nivel de características y a menudo confunden correlaciÃģn con causalidad. Nuestro trabajo tiene como objetivo proporcionar explicaciones de conceptos de alto nivel, aprovechando la literatura sobre causalidad para proponer un criterio intuitivo: Orden-Fidelidad.

Hemos profundizado en las complejidades inherentes de los LLM, comprendiendo su naturaleza de ‘caja negra’ y los desafíos significativos que plantea. Desde los riesgos de toma de decisiones defectuosas en ÃĄreas sensibles como la salud y las finanzas hasta las cuandarias ÃĐticas que rodean el sesgo y la equidad, la necesidad de transparencia en los LLM nunca ha sido mÃĄs evidente.

El futuro de los LLM y su integraciÃģn en nuestra vida diaria y procesos de toma de decisiones críticos depende de nuestra capacidad para hacer que estos modelos no solo sean mÃĄs avanzados, sino tambiÃĐn mÃĄs comprensibles y responsables. La bÚsqueda de explicabilidad e interpretabilidad no es solo una empresa tÃĐcnica, sino un aspecto fundamental de la construcciÃģn de la confianza en los sistemas de inteligencia artificial. A medida que los LLM se integran mÃĄs en la sociedad, la demanda de transparencia crecerÃĄ, no solo desde los practicantes de la inteligencia artificial, sino desde cada usuario que interactÚa con estos sistemas.

He dedicado los Últimos cinco aÃąos sumergiÃĐndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasiÃģn y experiencia me han llevado a contribuir a mÃĄs de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso tambiÃĐn me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar mÃĄs a fondo.