AI-modeller og plattformer
De beste AI-modellene blir fortapt i lange dokumenter
En ny studie fra forskere ved LMU Munich, Munich Center for Machine Learning og Adobe (ADBE ) Research har avdekket en svakhet i AI-språkmodeller: de sliter med å forstå lange dokumenter på måter som kan overraske deg. Forskningsgruppens funn viser at selv de mest avanserte AI-modellene har problemer med å koble informasjon når de ikke kan stole på enkel ordmatching.
Det skjulte problemet med AI-språkferdigheter
Forestall deg å prøve å finne en bestemt detalj i en lang forskningsrapport. Du kan bladre gjennom den, lage mentale sammenhenger mellom forskjellige seksjoner for å sette sammen informasjonen du trenger. Mange AI-modeller, det viser seg, fungerer ikke på denne måten i det hele tatt. I stedet baserer de ofte tungt på å finne eksakte ordmatcher, lignende å bruke Ctrl+F på datamaskinen din.
Forskningsgruppen utviklet en ny benchmark kalt NOLIMA (No Literal Matching) for å teste ulike AI-modeller. Resultatene viste at når AI-modellene håndterer tekster lengre enn 2 000 ord, faller deres ytelse dramatisk. Når de når 32 000 ord – omtrent lengden på en kort bok – utfører de fleste modellene på halvparten av deres vanlige evne. Dette inkluderte testing av store modeller som GPT-4o, Gemini 1.5 Pro og Llama 3.3 70B.
Tenk på en medisinsk forsker som bruker AI til å analysere pasientjournaler, eller en juridisk gruppe som bruker AI til å gjennomgå sakdokumenter. Hvis AI-en måtte overse kritiske sammenhenger fordi den relevante informasjonen bruker forskjellige ord enn søkeforespørselen, kunne konsekvensene være betydelige.
Hvorfor ordmatching ikke er nok
Gjeldende AI-modeller prosesserer tekst ved hjelp av noe som kalles en oppmerksomhetsmekanisme. Denne mekanismen hjelper AI-en å fokusere på forskjellige deler av teksten for å forstå sammenhenger mellom ord og ideer. Når de håndterer kortere tekster, fungerer dette godt nok. Imidlertid viser forskningen at denne mekanismen blir overveldet når tekstene blir lengre, spesielt når den ikke kan stole på eksakte ordmatcher.
NOLIMA-testen avdekket denne begrensningen ved å stille AI-modellene spørsmål hvor svarene krevde forståelse av kontekst i stedet for å finne ordmatcher. Resultatene var talende. Mens modellene fungerte godt med korte tekster, falt deres evne til å lage disse sammenhengene betydelig når tekstlengden økte. Selv spesialiserte modeller designet for resonneringstasks scoret under 50 % nøyaktighet når de håndterte lengre dokumenter.
Uten støtten til ordmatching, sliter AI-modellene med å:
- Koble relaterte konsepter som bruker forskjellig terminologi
- Følge multi-trinns resonneringsbaner
- Finne relevant informasjon når den dukker opp etter den viktige konteksten
- Ignorere misvisende ordmatcher i irrelevante seksjoner
Tallene forteller historien
Forskningsfunnene tegner et skarpt bilde av hvordan AI-modellene håndterer lengre tekster. GPT-4o viste den sterkeste ytelsen, og beholdt effektiviteten opp til omtrent 8 000 token (omtrent 6 000 ord). Imidlertid viste selv denne topputføreren en betydelig nedgang med lengre tekster. De fleste andre modellene, inkludert Gemini 1.5 Pro og Llama 3.3 70B, opplevde skarpe ytelsesfall mellom 2 000 og 8 000 token.
Ytelsesfall ble enda mer uttalt når oppgavene krevde flere trinn av resonnering. For eksempel, hvis en modell trengte å lage to logiske sammenhenger – som å forstå at en karakter bodde nær et landemerke, og at landemerket var i en bestemt by – falt suksessraten betydelig. Forskningen viste at denne typen multi-trinns resonnering ble spesielt utfordrende i tekster utover 16 000 token, selv når tekniker designet for å forbedre resonnering, som Chain-of-Thought prompting, ble brukt.
Hva gjør disse funnene spesielt merkbare, er at de utfordrer påstander om AI-modellenes evne til å håndtere lange kontekster. Mens mange modeller annonserer støtte for omfattende kontekstvinduer, viser NOLIMA-benchmarken at effektiv forståelse faller langt før det når disse teoretiske grensene.

Kilde: Modarressi et al.
Når AI måtte overse skogen for trærne
Disse begrensningene har alvorlige implikasjoner for hvordan vi bruker AI i virkelige anvendelser. Tenk på et juridisk AI-system som søker gjennom saklover. Det kan overse relevante presedenser bare fordi de bruker forskjellig terminologi enn søkeforespørselen. Systemet kan i stedet fokusere på mindre relevante saker som tilfeldigvis deler flere ord med søkeordene.
Impakt på søk og dokumentanalyse er spesielt bekymringsverdig. Gjeldende AI-drevne søkesystemer ofte avhenger av en teknikk kalt Retrieval-Augmented Generation (RAG). Selv når disse systemene suksessfullt henter et dokument som inneholder riktig informasjon, kan AI-en feile å gjenkjenne dens relevans hvis formuleringen avviker fra søkeforespørselen. I stedet kan AI-en trekke mot mindre relevante dokumenter som deler overfladiske likheter med søkeordene.
For AI-brukere, antyder disse funnene flere viktige overveielser:
Først, kortere søkeforespørsler og dokumenter vil sannsynligvis gi mer pålitelige resultater. Når du arbeider med lengre tekster, kan det å bryte dem inn i mindre, fokuserte segmenter hjelpe med å opprettholde AI-ytelsen.
Andre, brukerne bør være spesielt forsiktige når de ber AI om å lage sammenhenger over forskjellige deler av et langt dokument. Forskningen viser at AI-modellene sliter mest når de må sette sammen informasjon fra forskjellige seksjoner, spesielt når sammenhengen ikke er åpenbar gjennom felles vokabular.
Til slutt, understreker disse begrensningene den fortsatt viktige betydningen av menneskelig tilsyn. Mens AI kan være et kraftig verktøy for å prosessere og analysere tekst, bør det ikke betraktes som en fullstendig erstatning for menneskelig analyse av komplekse dokumenter. Menneskeevnen til å opprettholde kontekst og lage konseptuelle sammenhenger over lange tekster forblir overlegen til gjeldende AI-evner.
Funnene tjener som en påminnelse om at til tross for raske fremskritt i AI-teknologi, behandler disse systemene informasjon svært annerledes enn mennesker. Å forstå disse begrensningene er avgjørende for å bruke AI-verktøy effektivt og å vite når menneskelig dømmekraft fortsatt er essensiell.
Hva kommer neste
Å forstå begrensningene i gjeldende AI-modellers evne til å prosessere lange tekster åpner opp viktige spørsmål om fremtiden for AI-utvikling. Forskningen bak NOLIMA-benchmarken har avdekket at våre nåværende tilnærminger til AI-tekstprosessering kanskje må forbedres, spesielt i hvordan modellene håndterer informasjon over lengre passasjer.
Gjeldende løsninger har vist bare delvis suksess. Chain-of-Thought prompting, som oppmuntrer AI-modellene til å bryte ned deres resonnering i trinn, forbedrer ytelsen noe. For eksempel, når denne teknikken ble brukt, viste Llama 3.3 70B bedre evne til å håndtere lengre kontekster. Imidlertid mangler denne tilnærmingen fortsatt når det gjelder tekster utover 16 000 token, hvilket antyder at vi trenger mer grunnleggende løsninger.
Oppmerksomhetsmekanismen, som utgjør ryggraden i hvordan gjeldende AI-modeller prosesserer tekst, må omtenkes. Tenk på det som å prøve å holde en samtale i et fullt rom – jo lengre samtalen blir, jo harder blir det å holde rede på alle viktige punkter som ble nevnt tidligere. Våre nåværende AI-modeller møter en lignende utfordring, men i en mye større skala.
Ser mot fremtiden, utforsker forskere flere lovende retninger. En tilnærming involverer å utvikle nye måter for AI å organisere og prioritere informasjon i lange tekster, og gå utenfor enkel ordmatching for å forstå dypere konseptuelle sammenhenger. Dette kan fungere mer som hvordan mennesker lager mentale kart over informasjon, og koble ideer basert på mening i stedet for bare felles vokabular.
En annen utviklingsretning fokuserer på å forbedre hvordan AI-modellene håndterer det forskerne kaller “latente hopp” – de logiske trinnene som er nødvendige for å koble sammen forskjellige deler av informasjon. Gjeldende modeller sliter med disse sammenhengene, spesielt i lengre tekster, men nye arkitekturer kan hjelpe med å lukke denne gapen.
For de som arbeider med AI-verktøy i dag, antyder disse funnene flere praktiske tilnærminger:
Vurdér å bryte lengre dokumenter inn i meningsfulle segmenter når du arbeider med AI. Dette hjelper med å skape logiske seksjoner som opprettholder viktig kontekst. For eksempel, hvis du analyserer en forskningsrapport, kan du holde metode- og resultatseksjonene sammen siden de ofte inneholder relatert informasjon.
Når du ber AI om å analysere lengre tekster, vær spesifik om sammenhengene du ønsker den skal lage. I stedet for å stille brede spørsmål, guid AI-en mot de spesifikke sammenhengene du er interessert i å utforske. Dette hjelper med å kompensere for modellens nåværende begrensninger i å lage disse sammenhengene uavhengig.
Kanskje mest viktig, oppretthold realistiske forventninger om AI-s evne med lange tekster. Mens disse verktøyene kan være usedvanlig nyttige for mange oppgaver, bør de ikke behandles som fullstendige erstatninger for menneskelig analyse av komplekse dokumenter. Menneskeevnen til å opprettholde kontekst og lage konseptuelle sammenhenger over lange tekster forblir overlegen til gjeldende AI-evner.
Veien fremover for AI-utvikling i dette området er både utfordrende og spennende. Etter hvert som vi bedre forstår disse begrensningene, kan vi arbeide mot AI-systemer som virkelig forstår lange tekster i stedet for bare å prosessere dem. Inntil da, betyr å bruke AI effektivt å arbeide med dens nåværende begrensninger samtidig som man verdsetter dens styrker.












