AI-modeller og platforme
Top AI-modeller bliver tabt i lange dokumenter
En ny studie fra forskere ved LMU Munich, Munich Center for Machine Learning og Adobe (ADBE ) Research har afsløret en svaghed i AI-sprogmodeller: de kæmper med at forstå lange dokumenter på måder, der kan overraske dig. Forskerholdets resultater viser, at selv de mest avancerede AI-modeller har svært ved at tilknytte information, når de ikke kan stole på enkel ordmatchning.
Det skjulte problem med AI’s læsefærdigheder
Forestil dig, at du skal finde en bestemt detalje i en lang forskningsrapport. Du kan måske bladre igennem den, lave mentale forbindelser mellem forskellige afsnit for at samle den information, du har brug for. Mange AI-modeller fungerer ikke på den måde. I stedet er de ofte afhængige af at finde eksakte ordmatchninger, ligesom når du bruger Ctrl+F på din computer.
Forskerholdet udviklede en ny benchmark kaldet NOLIMA (No Literal Matching) til at teste forskellige AI-modeller. Resultaterne viste, at når AI-modellerne håndterer tekster længere end 2.000 ord, falder deres præstation dramatisk. Ved 32.000 ord – omtrent længden af en kort bog – udfører de fleste modeller kun halvdelen af deres normale kapacitet. Dette inkluderede test af store modeller som GPT-4o, Gemini 1.5 Pro og Llama 3.3 70B.
Overvej en medicinsk forsker, der bruger AI til at analysere patientjournaler, eller en juridisk hold, der bruger AI til at gennemgå sagsdokumenter. Hvis AI’en overser afgørende forbindelser, fordi den relevante information bruger andre ord end søgeforespørgslen, kan konsekvenserne være betydelige.
Hvorfor ordmatchning ikke er nok
Nuværende AI-modeller behandler tekst ved hjælp af noget, der kaldes en opmærksomhedsmechanisme. Denne mekanisme hjælper AI’en med at fokusere på forskellige dele af teksten for at forstå forbindelser mellem ord og ideer. Når det handler om kortere tekster, fungerer dette godt nok. Forskningen viser dog, at denne mekanisme bliver overvældet, når teksterne bliver længere, især når den ikke kan stole på eksakte ordmatchninger.
NOLIMA-testen afslørede denne begrænsning ved at bede AI-modellerne om at besvare spørgsmål, hvor svarene krævede forståelse af kontekst snarere end at finde ordmatchninger. Resultaterne var talende. Mens modellerne fungerede godt med korte tekster, faldt deres evne til at lave disse forbindelser dramatisk, da teksten blev længere. Selv specialiserede modeller, der er designet til at håndtere resonansopgaver, scorede under 50% nøjagtighed, når de håndterede længere dokumenter.
Uden ordmatchningens krølle, kæmpede AI-modellerne med at:
- Forbinde relaterede begreber, der bruger forskellig terminologi
- Følge multi-trins resonansveje
- Finde relevant information, når den optræder efter den afgørende kontekst
- Ignorere misvisende ordmatchninger i irrelevante afsnit
Tallene fortæller historien
Forskningsresultaterne tegner et dystert billede af, hvordan AI-modeller håndterer længere tekster. GPT-4o viste den stærkeste præstation, idet den opretholdt effektiviteten op til omkring 8.000 tokens (omtrent 6.000 ord). Men selv denne top-præstationer viste en betydelig nedgang med længere tekster. De fleste andre modeller, herunder Gemini 1.5 Pro og Llama 3.3 70B, oplevede skarpe præstationsfald mellem 2.000 og 8.000 tokens.
Præstationsfald blev endnu mere udtalt, når opgaverne krævede flere trin af resonans. For eksempel, hvis en model skulle lave to logiske forbindelser – som at forstå, at en karakter boede nær et vartegn, og at vartegnet var i en bestemt by – faldt succesraten betydeligt. Forskningen viste, at denne type multi-trins resonans blev særligt udfordrende i tekster længere end 16.000 tokens, selv når der blev brugt teknikker designet til at forbedre resonans, såsom Chain-of-Thought-prompting.
Hvad der gør disse resultater særligt bemærkelsesværdige, er, at de udfordrer påstande om AI-modellers evne til at håndtere lange kontekster. Mens mange modeller annoncerer support for omfattende kontekstvinduer, viser NOLIMA-benchmark, at effektiv forståelse falder langt før, man når disse teoretiske grænser.

Kilde: Modarressi et al.
Når AI mister overblikket for træerne
Disse begrænsninger har alvorlige implikationer for, hvordan vi bruger AI i virkelige anvendelser. Overvej en juridisk AI-system, der søger gennem sagslove. Den kan overse relevante præcedenser blot, fordi de bruger forskellig terminologi end søgeforespørgslen. Systemet kan i stedet fokusere på mindre relevante sager, der tilfældigvis deler ord med søgeordene.
Impakten på søgning og dokumentanalyse er særligt bekymrende. Nuværende AI-drevne søgesystemer afhænger ofte af en teknik kaldet Retrieval-Augmented Generation (RAG). Selv når disse systemer med held henter et dokument, der indeholder den rigtige information, kan AI’en svigte i at genkende dets relevans, hvis formuleringen afviger fra søgeforespørgslen. I stedet kan AI’en være tiltrukket af mindre relevante dokumenter, der deler overfladiske ligheder med søgeordene.
For AI-brugere antyder disse resultater flere vigtige overvejelser:
Først, korte søgeforespørgsler og dokumenter vil sandsynligvis give mere pålidelige resultater. Når man arbejder med længere tekster, kan det være nyttigt at opdele dem i mindre, fokuserede segmenter for at opretholde AI-præstationen.
Andet, brugere bør være særligt omhyggelige, når de beder AI om at lave forbindelser på tværs af forskellige dele af et langt dokument. Forskningen viser, at AI-modeller kæmper mest, når de skal samle information fra forskellige afsnit, især når forbindelsen ikke er åbenbar gennem fælles vokabular.
Til sidst, fremhæver disse begrænsninger den fortsat vigtige rolle for menneskelig oversigt. Mens AI kan være et kraftfuldt værktøj til at behandle og analysere tekst, bør det ikke betragtes som en fuldstændig erstatning for menneskelig analyse af komplekse dokumenter. Menneskets evne til at opretholde kontekst og lave konceptuelle forbindelser på tværs af lange tekster forbliver overlegen i forhold til nuværende AI-kapaciteter.
Forskningens resultater fungerer som en påmindelse om, at på trods af hurtige fremskridt i AI-teknologi, behandler disse systemer stadig information meget forskelligt fra mennesker. At forstå disse begrænsninger er afgørende for at bruge AI-værktøjer effektivt og vide, når menneskelig dømmekraft stadig er essentiel.
Hvad kommer herefter
At forstå begrænsningerne i nuværende AI-modellers evne til at behandle lange tekster åbner op for vigtige spørgsmål om fremtidens AI-udvikling. Forskningen bag NOLIMA-benchmark har afsløret, at vores nuværende tilgang til AI-tekstbehandling可能 kræver betydelig forfinelse, især i, hvordan modellerne håndterer information på tværs af længere passager.
Nuværende løsninger har vist kun delvis succes. Chain-of-Thought-prompting, der opmuntrer AI-modeller til at opdele deres resonans i trin, forbedrer præstationen noget. For eksempel viste Llama 3.3 70B bedre evne til at håndtere længere kontekster, når denne teknik blev brugt. Men denne tilgang falder stadig kort, når det handler om tekster længere end 16.000 tokens, hvilket antyder, at vi har brug for mere fundamentale løsninger.
Opmærksomhedsmechanismen, der danner rygmarven af, hvordan nuværende AI-modeller behandler tekst, kræver en genovervejelse. Forestil dig, at du forsøger at føre en samtale i et fyldt rum – jo længere samtalen bliver, jo sværere bliver det at holde styr på alle vigtige punkter, der er nævnt tidligere. Vore nuværende AI-modeller står over for en lignende udfordring, men i en langt større skala.
I fremtiden udforsker forskere flere lovende retninger. En tilgang indebærer udvikling af nye måder for AI at organisere og prioritere information i lange tekster, ved at gå ud over enkel ordmatchning for at forstå dybere konceptuelle forbindelser. Dette kunne fungere mere som, hvordan mennesker skaber mentale kort over information, ved at forbinde ideer baseret på mening snarere end kun fælles vokabular.
En anden udviklingsretning fokuserer på at forbedre, hvordan AI-modeller håndterer, hvad forskere kalder “latente hop” – de logiske trin, der er nødvendige for at forbinde forskellige dele af information. Nuværende modeller kæmper med disse forbindelser, især i længere tekster, men nye arkitekturer kan hjælpe med at brobygge denne kløft.
For dem, der arbejder med AI-værktøjer i dag, antyder disse resultater flere praktiske tilgange:
Overvej at opdele længere dokumenter i meningsfulde segmenter, når du arbejder med AI. Dette hjælper med at skabe logiske afsnit, der opretholder vigtig kontekst. For eksempel, hvis du analyserer en forskningsrapport, kan du holde metode- og resultatafsnittene sammen, da de ofte indeholder relateret information.
Når du beder AI om at analysere længere tekster, vær specifik omkring de forbindelser, du ønsker, den skal lave. I stedet for at stille brede spørgsmål kan du guide AI’en mod de specifikke relationer, du er interesseret i at udforske. Dette hjælper med at kompensere for modellens nuværende begrænsninger i at lave disse forbindelser uafhængigt.
Måske aller mest vigtigt, oprethold realistiske forventninger om AI’s kapaciteter med lange tekster. Mens disse værktøjer kan være utroligt nyttige til mange opgaver, bør de ikke behandles som fuldstændige erstatninger for menneskelig analyse af komplekse dokumenter. Menneskets evne til at opretholde kontekst og lave konceptuelle forbindelser på tværs af lange tekster forbliver overlegen i forhold til nuværende AI-kapaciteter.
Vejen frem for AI-udvikling i dette område er både udfordrende og spændende. Mens vi bedre forstår disse begrænsninger, kan vi arbejde mod AI-systemer, der virkelig forstår lange tekster snarere end blot behandler dem. Indtil da, betyder effektiv brug af AI at arbejde med dens nuværende begrænsninger, samtidig med at man værdsætter dens styrker.












