Modele i platformy AI
Dlaczego duże modele językowe zapominają środek: odkrywanie ukrytego słabego punktu AI

Jako duże modele językowe (LLM) są powszechnie stosowane w zadaniach takich jak podsumowanie dokumentów, analiza prawnicza i ocena historii medycznej, jest niezwykle ważne, aby rozpoznać ograniczenia tych modeli. Chociaż powszechne problemy, takie jak halucynacje i bias, są dobrze znane, naukowcy ostatnio zidentyfikowali kolejną znaczącą wadę: podczas przetwarzania długich tekstów, LLM tendencję do zachowania informacji na początku i końcu, ale często zaniedbywania środka.
Ten problem, określany jako zjawisko “zagubiony w środku“, może poważnie wpłynąć na działanie tych modeli w rzeczywistych aplikacjach. Na przykład, jeśli AI jest wykorzystywany do podsumowania długiego dokumentu prawniczego, brakujące informacje ze środka mogą prowadzić do mylących lub niepełnych podsumowań. W środowiskach medycznych, zaniedbanie informacji ze środka historii pacjenta może skutkować nieprecyzyjnymi zaleceniami. Zrozumienie, dlaczego tak się dzieje, pozostaje wyzwaniem dla naukowców starających się budować bezpieczniejsze i bardziej niezawodne AI. Jednak niedawno badanie dostarczyło niektórych z najbardziej klarownych odpowiedzi, ujawniając, że ten problem jest głęboko zakorzeniony w architekturze tych modeli.
Problem “zagubiony w środku”
Zjawisko “zagubiony w środku” odnosi się do tendencji LLM do przyznawania mniejszej uwagi informacjom w środku długich sekwencji wejściowych. Jest to podobne do tego, jak ludzie często lepiej zapamiętują pierwsze i ostatnie elementy na liście niż te w środku. Ten poznawczy bias u ludzi jest często znany jako efekt pierwszeństwa i świeżości. Dla LLM oznacza to, że wykonują lepiej, gdy kluczowe informacje znajdują się na początku lub końcu tekstu, ale mają trudności, gdy są one zakopane w środku. To skutkuje “U-kształtną” krzywą wydajności, gdzie dokładność jest wysoka na początku, gwałtownie spada w środku, a następnie ponownie rośnie na końcu.
To zjawisko nie jest tylko teoretycznym problemem. Zostało ono zaobserwowane w szerokim zakresie zadań, od odpowiedzi na pytania do podsumowania dokumentów. Na przykład, jeśli poprosisz LLM o odpowiedź na pytanie, gdzie odpowiedź znajduje się w pierwszych kilku akapitach długiego artykułu, najprawdopodobniej udzieli poprawnej odpowiedzi. To samo dotyczy, gdy odpowiedź znajduje się w ostatnich kilku akapitach. Ale jeśli kluczowe informacje są ukryte gdzieś w środku, dokładność modelu gwałtownie spada. To jest poważne ograniczenie, ponieważ oznacza to, że nie możemy w pełni ufać tym modelom w zadaniach, które wymagają zrozumienia długiego i złożonego kontekstu. To również sprawia, że są one podatne na manipulację. Ktoś mógłby celowo umieścić mylące informacje na początku lub końcu dokumentu, aby wpłynąć na wyjście AI.
Zrozumienie architektury LLM
Aby zrozumieć, dlaczego LLM zapominają środek, musimy przyjrzeć się, jak są one zbudowane. Współczesne LLM są oparte na architekturze zwanej Transformator. Transformator był przełomem w AI, ponieważ wprowadził mechanizm zwany uwagą samą w sobie. Uwaga sama w sobie pozwala modelowi ważyć znaczenie różnych słów w tekście wejściowym podczas przetwarzania każdego słowa. Na przykład, podczas przetwarzania zdania “Kot siedział na macie”, mechanizm uwagi samej w sobie mógłby nauczyć się, że “kot” i “siedział” są ściśle powiązane. To pozwala modelowi zbudować znacznie bogatsze zrozumienie relacji między słowami niż wcześniejsze architektury.
Innym kluczowym składnikiem jest kodowanie pozycyjne. Ponieważ mechanizm uwagi samej w sobie nie ma wrodzonego poczucia kolejności słów, kodowania pozycyjne są dodawane do wejścia, aby dać modelowi informacje o pozycji każdego słowa w sekwencji. Bez tego model widziałby tekst wejściowy jako po prostu “worki słów” bez struktury. Te dwa składniki, uwaga sama w sobie i kodowanie pozycyjne, współpracują, aby uczynić LLM bardziej skutecznymi. Jednak nowe badanie pokazuje, że sposób, w jaki współpracują, jest również źródłem tego ukrytego słabego punktu.
Jak powstaje bias pozycyjny
Niedawne badanie wykorzystuje inteligentne podejście, aby wyjaśnić to zjawisko. Modeluje przepływ informacji wewnątrz Transformatora jako graf, gdzie każde słowo jest węzłem, a połączenia uwagi są krawędziami. To pozwala naukowcom śledzić matematycznie, jak informacje z różnych pozycji są przetwarzane przez wiele warstw modelu.
Odkryli dwie główne spostrzeżenia. Po pierwsze, użycie maskowania przyczynowego w wielu LLM tworzy wrodzony bias w kierunku początku sekwencji. Maskowanie przyczynowe jest techniką, która zapewnia, że podczas generowania słowa model może zwrócić uwagę tylko na słowa, które pojawiły się przed nim, a nie po. To jest kluczowe dla zadań takich jak generowanie tekstu. Jednak po wielu warstwach tworzy to efekt kumulatywny. Pierwsze słowa w tekście są przetwarzane ponownie i ponownie, a ich reprezentacje stają się coraz bardziej wpływowe. W przeciwieństwie do tego, słowa w środku zawsze patrzą wstecz na już ustanowiony kontekst, a ich własny unikalny wkład może zostać zdominowany.
Po drugie, naukowcy przyjrzeli się, jak kodowania pozycyjne wchodzą w interakcję z efektem maskowania przyczynowego. Współczesne LLM często wykorzystują względne kodowania pozycyjne, które koncentrują się na odległości między słowami, a nie na ich absolutnej pozycji. To pomaga modelowi uogólniać do tekstów różnej długości. Chociaż wydaje się to dobrym pomysłem, tworzy to konkurencyjną presję. Maskowanie przyczynowe popycha uwagę modelu w kierunku początku, podczas gdy względne kodowanie pozycyjne zachęca do koncentrowania się na sąsiednich słowach. Wynikiem tego konfliktu jest to, że model przykłada największą wagę do samego początku tekstu i do natychmiastowego kontekstu lokalnego każdego słowa. Informacje, które są daleko i nie na początku, czyli w środku, otrzymują najmniejszą uwagę.
Szersze implikacje
Zjawisko “zagubiony w środku” ma znaczące konsekwencje dla aplikacji, które polegają na przetwarzaniu długich tekstów. Badanie pokazuje, że problem ten nie jest tylko przypadkowym efektem, ale fundamentalną konsekwencją sposobu, w jaki zbudowaliśmy te modele. To oznacza, że proste szkolenie ich na większych danych jest mało prawdopodobne, aby rozwiązać ten problem. Zamiast tego możemy musieć przemyśleć niektóre z podstawowych zasad architektury Transformatora.
Dla użytkowników i deweloperów AI jest to krytyczne ostrzeżenie. Musimy być świadomi tego ograniczenia podczas projektowania aplikacji, które polegają na LLM. Dla zadań, które obejmują długie dokumenty, możemy musieć opracować strategie, aby złagodzić ten bias. Może to obejmować podział dokumentu na mniejsze części lub tworzenie modeli, które specjalnie kierują uwagę modelu na różne części tekstu. To również podkreśla wagę rygorystycznego testowania. Nie możemy założyć, że LLM, który wykonuje dobrze na krótkich tekstach, będzie niezawodny, gdy stanie w obliczu dłuższych, bardziej złożonych wejść.
Podsumowanie
Rozwój AI zawsze koncentrował się na identyfikowaniu ograniczeń i znajdowaniu sposobów, aby je pokonać. Problem “zagubiony w środku” jest znaczącą wadą dużych modeli językowych, gdzie tendencja do zaniedbywania informacji w środku długich sekwencji tekstowych. Ten problem wynika z biasów w architekturze Transformatora, szczególnie z interakcji między maskowaniem przyczynowym a względnym kodowaniem pozycyjnym. Chociaż LLM wykonują dobrze, gdy informacje znajdują się na początku lub końcu tekstu, mają trudności, gdy ważne szczegóły są umieszczone w środku. To ograniczenie może zmniejszyć dokładność LLM w zadaniach takich jak podsumowanie dokumentów i odpowiedzi na pytania, co może mieć poważne konsekwencje w dziedzinach takich jak prawo i medycyna. Deweloperzy i naukowcy muszą rozwiązać ten problem, aby poprawić niezawodność LLM w praktycznych aplikacjach. Modeli są umieszczane w środku. To ograniczenie może zmniejszyć dokładność LLM w zadaniach takich jak podsumowanie dokumentów i odpowiedzi na pytania, co może mieć poważne konsekwencje w dziedzinach takich jak prawo i medycyna. Deweloperzy i naukowcy muszą rozwiązać ten problem, aby poprawić niezawodność LLM w praktycznych aplikacjach.












