Modelos y plataformas de IA
Por qué los Grandes Modelos de Lenguaje Olvidan el Medio: Descubriendo el Punto Ciego Oculto de la IA

Como los Grandes Modelos de Lenguaje (LLMs) se utilizan ampliamente para tareas como la resumen de documentos, el análisis legal y la evaluación de la historia médica, es crucial reconocer las limitaciones de estos modelos. Mientras que los problemas comunes como las alucinaciones y el sesgo son bien conocidos, los investigadores han identificado recientemente otro defecto significativo: cuando procesan textos largos, los LLMs tienden a retener la información al principio y al final, pero a menudo descuidan el medio.
Este problema, denominado fenómeno “perdido en el medio“, puede afectar gravemente el rendimiento de estos modelos en aplicaciones del mundo real. Por ejemplo, si se le asigna a una IA la tarea de resumir un documento legal extenso, perder detalles críticos del medio podría llevar a resúmenes engañosos o incompletos. En entornos médicos, pasar por alto la información del medio de la historia de un paciente podría resultar en recomendaciones inexactas. Entender por qué sucede esto sigue siendo una tarea desafiante para los investigadores que intentan construir una IA más segura y confiable. Sin embargo, un estudio reciente proporciona algunas de las respuestas más claras hasta ahora, revelando que este problema está profundamente arraigado en la arquitectura de estos modelos.
El Problema “Perdido en el Medio”
El fenómeno “perdido en el medio” se refiere a la tendencia de los LLMs a prestar menos atención a la información en el medio de las secuencias de entrada largas. Es similar a cómo los humanos a menudo recuerdan mejor los primeros y últimos elementos de una lista que los del medio. Este sesgo cognitivo en los humanos se conoce comúnmente como el efecto de primacía y recencia. Para los LLMs, esto significa que funcionan mejor cuando la información clave está al principio o al final de un texto, pero luchan cuando está enterrada en el medio. Esto resulta en una curva de rendimiento en forma de “U”, donde la precisión es alta al principio, disminuye significativamente en el medio y luego aumenta nuevamente al final.
Este fenómeno no es solo un problema teórico. Ha sido observado en una amplia gama de tareas, desde la respuesta a preguntas hasta la resumen de documentos. Por ejemplo, si se le hace una pregunta a un LLM sobre la cual la respuesta se encuentra en los primeros párrafos de un artículo largo, es probable que responda correctamente. Lo mismo ocurre si la respuesta se encuentra en los últimos párrafos. Pero si la información crítica está escondida en algún lugar del medio, la precisión del modelo disminuye bruscamente. Esto es una limitación grave, ya que significa que no podemos confiar plenamente en estos modelos para tareas que requieren comprender un contexto largo y complejo. También los hace vulnerables a la manipulación. Alguien podría colocar intencionalmente información engañosa al principio o al final de un documento para influir en la salida de la IA.
Entendiendo la Arquitectura de los LLMs
Para entender por qué los LLMs olvidan el medio, debemos examinar cómo están construidos. Los LLMs modernos se basan en una arquitectura llamada Transformer. El Transformer fue un avance en la IA porque introdujo un mecanismo llamado atención propia. La atención propia permite al modelo evaluar la importancia de diferentes palabras en el texto de entrada al procesar cualquier palabra. Por ejemplo, al procesar la oración “El gato se sentó en la alfombra”, el mecanismo de atención propia podría aprender que “gato” y “se sentó” están altamente relacionados. Esto permite al modelo construir una comprensión mucho más rica de las relaciones entre las palabras que las arquitecturas anteriores.
Otro componente clave es la codificación posicional. Dado que el mecanismo de atención propia en sí no tiene un sentido inherente del orden de las palabras, se agregan codificaciones posicionales a la entrada para dar al modelo información sobre la posición de cada palabra en la secuencia. Sin esto, el modelo vería el texto de entrada como solo un “conjunto de palabras” sin estructura. Estos dos componentes, la atención propia y la codificación posicional, trabajan juntos para hacer que los LLMs sean más efectivos. Sin embargo, la nueva investigación muestra que la forma en que interactúan también es la fuente de este punto ciego oculto.
Cómo Surge el Sesgo de Posición
Un estudio reciente utiliza un enfoque astuto para explicar este fenómeno. Modela el flujo de información dentro de un Transformer como un grafo, donde cada palabra es un nodo y las conexiones de atención son los bordes. Esto permite a los investigadores rastrear matemáticamente cómo se procesa la información de diferentes posiciones a través de las muchas capas del modelo.
Descubrieron dos ideas principales. Primero, el uso de enmascaramiento causal en muchos LLMs crea inherentemente un sesgo hacia el principio de la secuencia. El enmascaramiento causal es una técnica que garantiza que cuando el modelo genera una palabra, solo puede prestar atención a las palabras que vinieron antes, no después. Esto es crucial para tareas como la generación de texto. Sin embargo, a lo largo de muchas capas, esto crea un efecto compuesto. Las primeras palabras del texto se procesan una y otra vez, y sus representaciones se vuelven cada vez más influyentes. En contraste, las palabras del medio siempre están mirando hacia atrás a este contexto ya establecido, y su propia contribución única puede quedar ahogada.
En segundo lugar, los investigadores examinaron cómo las codificaciones posicionales interactúan con este efecto de enmascaramiento causal. Los LLMs modernos a menudo utilizan codificaciones posicionales relativas, que se centran en la distancia entre las palabras en lugar de su posición absoluta. Esto ayuda al modelo a generalizar a textos de diferentes longitudes. Mientras que esto parece una buena idea, crea una presión contraria. La máscara causal empuja la atención del modelo hacia el principio, mientras que la codificación posicional relativa alienta al modelo a centrarse en las palabras cercanas. El resultado de esta lucha es que el modelo presta más atención al principio del texto y al contexto local inmediato de cualquier palabra dada. La información que está lejos y no al principio, en otras palabras, el medio, recibe la menor atención.
Las Implicaciones Más Amplias
El fenómeno “perdido en el medio” tiene consecuencias significativas para las aplicaciones que dependen del procesamiento de textos largos. La investigación muestra que el problema no es solo un efecto aleatorio, sino una consecuencia fundamental de la forma en que hemos diseñado estos modelos. Esto significa que simplemente entrenarlos con más datos es poco probable que resuelva el problema. En su lugar, es posible que debamos replantear algunos de los principios arquitectónicos básicos de los Transformers.
Para los usuarios y desarrolladores de IA, esto es una advertencia crítica. Debemos ser conscientes de esta limitación al diseñar aplicaciones que dependen de los LLMs. Para tareas que involucran documentos largos, es posible que debamos desarrollar estrategias para mitigar este sesgo. Esto podría involucrar dividir el documento en secciones más pequeñas o crear modelos que dirijan específicamente la atención del modelo a diferentes partes del texto. También destaca la importancia de las pruebas rigurosas. No podemos asumir que un LLM que funciona bien con textos cortos será confiable cuando se enfrenta a entradas más largas y complejas.
En Resumen
El desarrollo de la IA siempre se ha centrado en identificar limitaciones y encontrar formas de superarlas. El problema “perdido en el medio” es un defecto significativo en los grandes modelos de lenguaje, donde tienden a pasar por alto la información en el medio de las secuencias de texto largas. Este problema surge de los sesgos en la arquitectura del Transformer, particularmente en la interacción entre el enmascaramiento causal y la codificación posicional relativa. Mientras que los LLMs funcionan bien con la información al principio y al final de un texto, luchan cuando los detalles importantes están colocados en el medio. Esta limitación puede reducir la precisión de los LLMs en tareas como la resumen de documentos y la respuesta a preguntas, lo que puede tener implicaciones graves en campos como la ley y la medicina. Los desarrolladores y los investigadores deben resolver este problema para mejorar la confiabilidad de los LLMs en aplicaciones prácticas. Los modelos se colocan en el medio. Esta limitación puede reducir la precisión de los LLMs en tareas como la resumen de documentos y la respuesta a preguntas, lo que puede tener implicaciones graves en campos como la ley y la medicina. Los desarrolladores y los investigadores deben resolver este problema para mejorar la confiabilidad de los LLMs en aplicaciones prácticas.












