AI-modeller og platforme
DeepMinds Michelangelo Benchmark: Afslører grænserne for lange-kontekst LLM’er
Som Kunstig Intelligens (AI) fortsætter med at udvikle sig, bliver evnen til at behandle og forstå lange sekvenser af information mere vital. AI-systemer bruges nu til komplekse opgaver som analyse af lange dokumenter, følge med i lange samtaler og behandle store mængder data. Men mange nuværende modeller kæmper med lange-kontekst resonnering. Når input bliver længere, taber de ofte overblik over vigtige detaljer, hvilket fører til mindre præcise eller sammenhængende resultater.
Dette problem er særligt problematisk i sundheds-, juridiske og finansielle brancher, hvor AI-værktøjer skal behandle detaljerede dokumenter eller lange diskussioner, samtidig med at de giver præcise og kontekst-orienterede svar. En almindelig udfordring er kontekst drift, hvor modeller taber overblik over tidligere information, når de behandler ny input, hvilket resulterer i mindre relevante resultater.
For at løse disse begrænsninger udviklede DeepMind Michelangelo Benchmark. Dette værktøj tester hvordan AI-modeller kan håndtere lange-kontekst resonnering. Inspireret af kunstneren Michelangelo, som er kendt for at afsløre komplekse skulpturer fra marmorblokke, hjælper benchmarken med at opdage, hvordan godt AI-modeller kan udtrække meningsfulde mønstre fra store datasæt. Ved at identificere, hvor nuværende modeller svigter, fører Michelangelo Benchmark til fremtidige forbedringer i AI’s evne til at resonere over lange kontekster.
Forståelse af lange-kontekst resonnering i AI
Lange-kontekst resonnering handler om en AI-modells evne til at forblive sammenhængende og præcis over lange tekst-, kode- eller samtalesekvenser. Modeller som GPT-4 og PaLM-2 fungerer godt med korte eller moderate inputlængder. Men de har svært ved at håndtere længere kontekster. Når inputlængden øges, taber disse modeller ofte overblik over essentielle detaljer fra tidligere dele. Dette fører til fejl i forståelse, sammenfatning eller beslutningstagning. Dette problem er kendt som kontekstvinduebegrænsningen. Modellens evne til at fastholde og behandle information aftager, når konteksten bliver længere.
Dette problem er betydeligt i virkelige anvendelser. For eksempel i juridiske services analyserer AI-modeller kontrakter, sagstudier eller regler, der kan være hundredvis af sider lange. Hvis disse modeller ikke kan effektivt fastholde og resonere over sådanne lange dokumenter, kan de overse essentielle klausuler eller misfortolke juridiske termer. Dette kan føre til ukorrekte råd eller analyse. I sundhedssektoren skal AI-systemer syntetisere patientjournaler, medicinske historier og behandlingsplaner, der kan strække sig over år eller endda årtier. Hvis en model ikke kan korrekt huske kritisk information fra tidligere journaler, kan den anbefale upassende behandlinger eller misdiagnosticere patienter.
Selvom der er gjort bestræbelser for at forbedre modellernes tokenbegrænsninger (som GPT-4, der kan håndtere op til 32.000 token, omkring 50 sider tekst), er lange-kontekst resonnering stadig en udfordring. Kontekstvindueproblemet begrænser mængden af input, en model kan håndtere, og påvirker dens evne til at fastholde præcis forståelse hele inputsekvensen. Dette fører til kontekstdrift, hvor modellen langsomt glemmer tidligere detaljer, når nye oplysninger introduceres. Dette reducerer dens evne til at generere sammenhængende og relevante output.
Michelangelo Benchmark: Koncept og tilgang
Michelangelo Benchmark tackler udfordringerne ved lange-kontekst resonnering ved at teste LLM’er på opgaver, der kræver, at de fastholder og behandler information over lange sekvenser. I modsætning til tidligere benchmarks, der fokuserer på korte-kontekst opgaver som sætningsslutning eller grundlæggende spørgsmål, fokuserer Michelangelo Benchmark på opgaver, der udfordrer modeller til at resonere over lange datasekvenser, ofte inklusive distraktioner eller irrelevant information.
Michelangelo Benchmark udfordrer AI-modeller ved hjælp af Latent Structure Queries (LSQ) rammeværk. Denne metode kræver, at modeller finder meningsfulde mønstre i store datasæt, samtidig med at de filtrerer irrelevant information, ligesom mennesker søger gennem komplekse data for at fokusere på, hvad der er vigtigt. Benchmarket fokuserer på to hovedområder: naturlig sprog og kode, og introducerer opgaver, der tester mere end blot datahentning.
En vigtig opgave er Latent List Task. I denne opgave får modellen en sekvens af Python-listeoperationer, som tilføjelse, fjernelse eller sortering af elementer, og derefter skal den producere den korrekte endelige liste. For at gøre det sværere inkluderer opgaven irrelevant operationer, såsom omvendning af listen eller annullering af tidligere trin. Dette tester modellens evne til at fokusere på kritiske operationer, og simulere, hvordan AI-systemer skal håndtere store datasæt med blandet relevans.
En anden kritisk opgave er Multi-Round Co-reference Resolution (MRCR). Denne opgave måler, hvor godt modellen kan spore henvisninger i lange samtaler med overlappende eller uklare emner. Udfordringen er for modellen at knytte henvisninger, der er lavet sent i samtalen, til tidligere punkter, selv når disse henvisninger er skjult under irrelevant information. Denne opgave reflekterer virkelige diskussioner, hvor emnerne ofte skifter, og AI skal nøjagtigt spore og løse henvisninger for at fastholde sammenhængende kommunikation.
Derudover indeholder Michelangelo IDK-opgaven, der tester en modells evne til at genkende, når den ikke har nok information til at besvare et spørgsmål. I denne opgave præsenteres modellen for tekst, der måske ikke indeholder relevant information til at besvare et bestemt spørgsmål. Udfordringen er for modellen at identificere tilfælde, hvor den korrekte respons er “Jeg ved det ikke“, snarere end at give et plausibelt, men forkert svar. Denne opgave reflekterer en kritisk aspekt af AI-pålidelighed – at genkende usikkerhed.
Gennem opgaver som disse flytter Michelangelo sig ud over simpel hentning til at teste en modells evne til at resonere, syntetisere og håndtere lange-kontekst input. Den introducerer en skalerbar, syntetisk og ulækaget benchmark for lange-kontekst resonnering, og giver en mere præcis måling af LLM’ers nuværende tilstand og fremtidige potentiale.
Konsekvenser for AI-forskning og udvikling
Resultaterne fra Michelangelo Benchmark har betydelige konsekvenser for, hvordan vi udvikler AI. Benchmarket viser, at nuværende LLM’er har brug for bedre arkitektur, især i opmærksomheds mekanismer og hukommelsessystemer. Lige nu afhænger de fleste LLM’er af selvopmærksomheds mekanismer. Disse er effektive til korte opgaver, men kæmper, når konteksten bliver længere. Her ser vi problemet med kontekstdrift, hvor modeller glemmer eller blander tidligere detaljer. For at løse dette udforsker forskere hukommelsesforstærkede modeller. Disse modeller kan gemme vigtig information fra tidligere dele af en samtale eller dokument, og tillade AI at huske og bruge den, når det er nødvendigt.
En anden lovende tilgang er hierarkisk processtyring. Denne metode giver AI mulighed for at bryde lange input ned i mindre, håndterbare dele, hvilket hjælper den med at fokusere på de mest relevante detaljer på hvert trin. På denne måde kan modellen håndtere komplekse opgaver bedre uden at blive overvældet af for meget information på én gang.
Forbedring af lange-kontekst resonnering vil have en betydelig indvirkning. I sundhedssektoren kunne det betyde bedre analyse af patientjournaler, hvor AI kan spore en patients historie over tid og give mere præcise behandlingsanbefalinger. I juridiske services kunne disse fremskridt føre til AI-systemer, der kan analysere lange kontrakter eller saglove med større præcision, og give mere pålidelige indsigt for advokater og juridiske fagfolk.
Men med disse fremskridt kommer kritiske etiske bekymringer. Når AI bliver bedre til at fastholde og resonere over lange kontekster, er der en risiko for at udsætte følsom eller privat information. Dette er en reel bekymring for brancher som sundhedssektoren og kundeservice, hvor fortrolighed er kritisk.
Hvis AI-modeller fastholder for meget information fra tidligere interaktioner, kan de utilsigtet afsløre personlige detaljer i fremtidige samtaler. Derudover er der en fare for, at AI kan bruges til at skabe mere avanceret misinformation eller desinformation, hvilket komplicerer udfordringerne omkring AI-regulering.
Bottom Line
Michelangelo Benchmark har afsløret indsigt i, hvordan AI-modeller håndterer komplekse, lange-kontekst opgaver, og fremhæver deres styrker og begrænsninger. Dette benchmark fremmer innovation, da AI udvikler sig, og opmuntrer til bedre modellarkitektur og forbedrede hukommelsessystemer. Potentialet for at forandre brancher som sundhedssektoren og juridiske services er spændende, men kommer med etiske ansvar.
Privatliv, misinformation og fairplay bekymringer skal være til stede, når AI bliver bedre til at håndtere store mængder information. AI’s vækst skal forblive fokuseret på at gavne samfundet omhyggeligt og ansvarligt.












