Líderes de opinión
Abordar los problemas actuales dentro de los LLM y mirar hacia lo que está por venir
Hoy en día, hay docenas de modelos de lenguaje grande (LLM) disponibles públicamente, como GPT-3, GPT-4, LaMDA o Bard, y el número sigue creciendo constantemente a medida que se lanzan nuevos modelos. Los LLM han revolucionado la inteligencia artificial, alterando completamente la forma en que interactuamos con la tecnología en diversas industrias. Estos modelos nos permiten aprender de muchos conjuntos de datos de lenguaje humano y han abierto nuevas vías para la innovación, la creatividad y la eficiencia.
Sin embargo, con gran poder viene gran complejidad. Hay desafíos y problemas éticos inherentes a los LLM que deben ser abordados antes de que podamos utilizarlos al máximo. Por ejemplo, un estudio reciente de Stanford encontró sesgo racial y de género al observar ChatGPT-4 en cómo trata ciertas consultas que incluyen nombres y apellidos que sugieren raza o género. En este estudio, se le pidió al programa que aconsejara sobre cuánto pagar por una bicicleta usada que estaba siendo vendida por alguien llamado Jamal Washington, lo que produjo una cantidad mucho menor en comparación con cuando el vendedor se llamaba Logan Becker. A medida que siguen surgiendo estos descubrimientos, la necesidad de abordar los desafíos de los LLM solo aumenta.
Cómo mitigar las preocupaciones comunes de los LLM
Sesgo
Uno de los problemas más comúnmente discutidos entre los LLM es el sesgo y la equidad. En un estudio reciente, expertos probaron cuatro LLM publicados recientemente y encontraron que todos expresaban suposiciones sesgadas sobre hombres y mujeres, específicamente aquellas alineadas con las percepciones de las personas en lugar de aquellas basadas en hechos. En este contexto, el sesgo se refiere al trato desigual o a los resultados entre diferentes grupos sociales, probablemente debido a desequilibrios de poder históricos o estructurales.
En los LLM, el sesgo es causado por la selección de datos, la demografía de los creadores y el sesgo lingüístico o cultural. El sesgo de selección de datos ocurre cuando los textos elegidos para el entrenamiento de los LLM no representan la diversidad completa del lenguaje utilizado en la web. Los LLM entrenados en conjuntos de datos extensos pero limitados pueden heredar los sesgos ya presentes en estos textos. Con la demografía de los creadores, ciertos grupos demográficos se destacan más que otros, lo que ejemplifica la necesidad de más diversidad e inclusividad en la creación de contenido para disminuir el sesgo. Por ejemplo, Wikipedia, una fuente común de datos de entrenamiento, exhibe un desequilibrio demográfico notable entre sus editores con una mayoría masculina (84%). Esto es similar al sesgo que se encuentra en el lenguaje y la cultura también. Muchas fuentes en las que se entrenan los LLM están sesgadas, inclinadas hacia el inglés, lo que solo sometimes se traduce con precisión en otros idiomas y culturas.
Es imperativo que los LLM se entrenen con datos filtrados y que existan salvaguardas para suprimir temas que no son representaciones consistentes de los datos. Una forma de hacerlo es a través de técnicas de aumento de datos. Puedes agregar ejemplos de grupos subrepresentados a los datos de entrenamiento, ampliando así la diversidad del conjunto de datos. Otra táctica de mitigación es el filtrado y reponderación de datos, que se centra principalmente en apuntar a ejemplos específicos subrepresentados dentro de un conjunto de datos existente.
Alucinaciones
Dentro del contexto de los LLM, las alucinaciones son un fenómeno caracterizado por la producción de un texto que, aunque gramaticalmente correcto y aparentemente coherente, se desvía de la precisión factual o de la intención del material de origen. De hecho, informes recientes han encontrado que una demanda sobre una ley de Minnesota está directamente afectada por alucinaciones de LLM. Un affidavit presentado para apoyar la ley ha sido encontrado para incluir fuentes inexistentes que pueden haber sido alucinadas por ChatGPT o otro LLM. Estas alucinaciones pueden disminuir fácilmente la confiabilidad de un LLM.
Existen tres formas primarias de alucinaciones:
- Alucinación en conflicto con la entrada: Esto ocurre cuando la salida de un LLM se desvía de la entrada proporcionada por el usuario, que típicamente incluye instrucciones de tarea y el contenido real que necesita ser procesado.
- Alucinación en conflicto con el contexto: Los LLM pueden generar respuestas internamente inconsistentes en escenarios que involucran diálogos extendidos o múltiples intercambios. Esto sugiere una posible deficiencia en la capacidad del modelo para rastrear el contexto o mantener la coherencia a lo largo de varias interacciones.
- Alucinación en conflicto con los hechos: Esta forma de alucinación surge cuando un LLM produce contenido en conflicto con el conocimiento factual establecido. Los orígenes de estos errores son diversos y pueden ocurrir en varias etapas del ciclo de vida de un LLM.
Muchos factores han contribuido a este fenómeno, como deficiencias de conocimiento, que explica cómo los LLM pueden carecer del conocimiento o la capacidad para asimilar información correctamente durante el preentrenamiento. Además, el sesgo dentro de los datos de entrenamiento o una estrategia de generación secuencial de LLM, apodada “alucinación en bola de nieve”, puede crear alucinaciones.
Existen formas de mitigar las alucinaciones, aunque siempre serán una característica de los LLM. Estrategias de mitigación útiles para las alucinaciones son la mitigación durante el preentrenamiento (refinando manualmente los datos con técnicas de filtrado) o la afinación (curando los datos de entrenamiento). Sin embargo, la mitigación durante la inferencia es la mejor solución debido a su eficiencia en cuanto a costos y controlabilidad.
Privacidad
Con el auge de Internet, la accesibilidad aumentada de la información personal y otros datos privados se ha convertido en una preocupación ampliamente reconocida. Un estudio encontró que 80% de los consumidores estadounidenses están preocupados por que sus datos se estén utilizando para entrenar modelos de IA. Dado que los LLM más prominentes se obtienen de sitios web, debemos considerar cómo esto plantea riesgos para la privacidad y sigue siendo un problema en gran parte sin resolver para los LLM.
La forma más sencilla de evitar que los LLM distribuyan información personal es purgarla de los datos de entrenamiento. Sin embargo, dado el vasto volumen de datos involucrados en los LLM, es casi imposible garantizar que toda la información personal se haya erradicado. Otra alternativa común para las organizaciones que dependen de modelos desarrollados externamente es optar por un LLM de código abierto en lugar de un servicio como ChatGPT.
Con este enfoque, se puede implementar una copia del modelo internamente. Las solicitudes de los usuarios permanecen seguras dentro de la red de la organización en lugar de exponerse a servicios de terceros. Aunque esto reduce dramáticamente el riesgo de filtrar datos sensibles, también agrega complejidad significativa. Dadas las dificultades para garantizar plenamente la protección de los datos personales, es vital que los desarrolladores de aplicaciones consideren cómo estos modelos podrían poner a sus usuarios en riesgo.
La próxima frontera para los LLM
A medida que seguimos creciendo y dándole forma a las evoluciones posteriores de los LLM mediante la mitigación de los riesgos actuales, debemos esperar el surgimiento de agentes LLM, que ya vemos que empresas como H con Runner H, que comienzan a lanzarse. El cambio de modelos de lenguaje puros a arquitecturas agénticas representa un cambio en el diseño de sistemas de IA; la industria se está moviendo más allá de las limitaciones inherentes de las interfaces de chat y la generación aumentada simple. Estos nuevos marcos de agentes tendrán módulos de planificación sofisticados que descomponen objetivos complejos en subtareas atómicas, mantienen la memoria episódica para el razonamiento contextual y aprovechan herramientas especializadas a través de API bien definidas. Esto crea un enfoque más robusto para la automatización de tareas. La progresión arquitectónica ayuda a mitigar los desafíos comunes alrededor de las tareas y el razonamiento, la integración de herramientas y el monitoreo de la ejecución dentro de las implementaciones tradicionales de LLM.
Además de los LLM, habrá un mayor enfoque en el entrenamiento de modelos de lenguaje más pequeños debido a su eficiencia en cuanto a costos, accesibilidad y facilidad de implementación. Por ejemplo, los modelos de lenguaje específicos de dominio se especializan en industrias o campos particulares. Estos modelos están finamente ajustados con datos y terminología específicos del dominio, lo que los hace ideales para entornos complejos y regulados, como el campo médico o jurídico, donde la precisión es esencial. Este enfoque dirigido reduce la probabilidad de errores y alucinaciones que los modelos de propósito general pueden producir cuando se enfrentan a contenido especializado.
A medida que seguimos explorando nuevas fronteras en los LLM, es esencial empujar los límites de la innovación y abordar y mitigar los riesgos potenciales asociados con su desarrollo y despliegue. Solo identificando y abordando proactivamente los desafíos relacionados con el sesgo, las alucinaciones y la privacidad podemos crear una base más robusta para que los LLM prosperen en diversos campos.












