AI-modeller og platforme

Hvor godt er AI-agenter til rigtig forskning? Indenfor Deep Research Bench-rapporten

mm
Føj Unite.AI til dine foretrukne kilder på Google

Da store sprogmodeller (LLM’er) hurtigt udvikler sig, udvikler deres løfte som kraftfulde forskningsassistenter sig også. I stigende grad er de ikke kun beskæftiget med at besvare simple faktuelle spørgsmål – de tackler “dyb forskning”-opgaver, som indebærer flertrins resonnering, evaluering af modstridende information, kildeoplysninger fra hele nettet og syntese af dem i en sammenhængende udgang.

Denne opdyrkede evne markedsføres nu under forskellige varemærker af store laboratorier – OpenAI kalder det “Dyb Forskning”, Anthropic henviser til det som “Udvidet Tænkning”, Google’s Gemini tilbyder “Søg + Pro”-funktioner, og Perplexity mærker deres “Pro Søg” eller “Dyb Forskning”. Men hvor effektive er disse tilbud i praksis? En ny rapport fra FutureSearch, med titlen Deep Research Bench (DRB): Evaluering af webforskningsagenter, tilbyder den mest omfattende evaluering til dato – og resultaterne afslører både imponerende evner og kritiske svagheder.

Hvad er Deep Research Bench?

Oprettet af FutureSearch-holdet, er Deep Research Bench en omhyggeligt konstrueret benchmark designet til at vurderer AI-agenteres præstation på flertrins, webbaserede forskningsopgaver. Disse er ikke simple spørgsmål med ligetil svar – de afspejler de beskidte, åbne udfordringer, som analytikere, beslutningstagerne og forskere står overfor i virkelige situationer.

Benchmarket omfatter 89 forskellige opgaver i 8 kategorier som f.eks.

  • Find Nummer: f.eks. “Hvor mange FDA-klasse II-medicin-tilbagekald blev der?”
  • Valider Erklæring: f.eks. “Er ChatGPT 10 gange mere energi-intensiv end Google Søgning?”
  • Sammenstil Datasæt: f.eks. “Jobtendenser for US-softwareudviklere fra 2019-2023”

Hver opgavetype er omhyggeligt struktureret med menneske-verificerede svar og vurderes ved hjælp af en frosset datasæt af websider, kendt som RetroSearch. Dette sikrer konsistens på tværs af modelvurderinger og undgår den skiftende tilstand af det levende web.

Agent-arkitekturen: ReAct og RetroSearch

I hjertet af Deep Research Bench ligger ReAct-arkitekturen, kort for “Reason + Act.” Denne metode ligner, hvordan en menneskelig forsker måske ville tackle et problem – ved at tænke igennem opgaven, udføre en handling som at udføre en websøgning, observere resultaterne og derefter beslutte, om at iterere eller konkludere.

Mens tidligere modeller følger denne cirkel eksplicit, strømliner nyere “tænkende” modeller ofte processen, indlejrer resonnering mere flydende i deres handlinger. For at sikre konsistens på tværs af vurderinger, introducerer DRB RetroSearch – en brugerdefineret, statisk version af webben. I stedet for at stole på det levende internet, som konstant ændrer sig, tilgår agenterne en kurateret arkiv af websider, som er hentet ved hjælp af værktøjer som Serper, Playwright og ScraperAPI. Skalaen er imponerende: for komplekse opgaver som f.eks. “Samle Bevis”, kan RetroSearch give adgang til over 189.000 sider, alle frosset i tid, hvilket sikrer en retfærdig og reproducerbar testmiljø.

Hvilke AI-agenter performer bedst?

Blandt alle deltagere opnåede OpenAI’s o3 den bedste præstation, med en score på 0,51 ud af en mulig 1,0 på Deep Research Bench. Selvom det måske lyder beskedent, er det vigtigt at forstå benchmarkets sværhedsgrad: på grund af tvetydighed i opgave-definitioner og scoring, ville selv en fejlfri agent sandsynligvis nå op til omkring 0,8 – det, som forskerne kalder “støjloftet.” Med andre ord, selv de bedste modeller i dag falder stadig kort i forhold til velinformerede, metodiske menneskelige forskere.

Alligevel tilbyder leaderboarden afslørende indsigt. o3 ikke kun ledede pakken, men gjorde det med hastighed og konsistens, visende stærk præstation på næsten alle opgavetyper. Claude 3.7 Sonnet fra Anthropic fulgte tæt, demonstrerende fleksibilitet i både dens “tænkende” og “ikke-tænkende” tilstande. Gemini 2.5 Pro, Google’s flagskibmodel, stod ud for sin evne til at håndtere opgaver, der kræver struktureret planlægning og trin-for-trin resonnering. Imens leverede den åbne vægt-DeepSeek-R1 en behagelig overraskelse – holdt trit med GPT-4 Turbo og indsnævring af præstationsgapet mellem åbne og lukkede modeller.

På tværs af brættet opstod et tydeligt mønster: nyere, “tænkende-aktiverede” modeller præsterede konsekvent bedre end deres tidligere modeller, og lukkede modeller fastholdt en bemærkelsesværdig fordel over åbne vægt-alternativer.

Hvor kæmper agenterne?

At læse gennem fejl-mønstrene, der er fremhævet i Deep Research Bench-rapporten, føltes overraskende bekendt. En af de mest frustrerende aspekter, jeg personligt har oplevet – især under lange forsknings- eller indholdsskabende sessioner – er, når en AI-agent simpelthen glemmer, hvad vi lavede. Da kontekstvinduet strækkes, begynder modellen ofte at tabe tråden: nøgle detaljer forsvinder, mål bliver uklare, og pludselig føles svarene sammenbrudte eller målrette.

Den slags glemsomhed er ikke kun anekdotisk – det er den mest betydningsfulde forudsigelse af fiasko i Deep Research Bench-vurderingen. Men det er ikke det eneste gentagne problem. Rapporten fremhæver også, hvordan nogle modeller falder i gentagen værktøjsbrug, kørende den samme søgning igen og igen, som om de er fanget i en cirkel. Andre viser dårlig forespørgselskonstruktion, dovent nøgleord-matchende i stedet for at tænke kritisk over, hvordan man søger effektivt. Og alt for ofte falder agenterne ofre for forhastede konklusioner – leverer et halvfærdigt svar, der teknisk set tjekker af, men falder kort i forhold til rigtig indsigt.

Selv blandt de bedste modeller er forskellene markante. GPT-4 Turbo viste f.eks. en bemærkelsesværdig tendens til at glemme tidligere trin, mens DeepSeek-R1 var mere sandsynlig for at hallucinere eller opfinde plausibelt lydende – men forkerte – oplysninger. På tværs af brættet fejlede modellerne ofte at krydskontrollere kilder eller validere resultater, før de finaliserede deres udgang. For enhver, der har afhængigt af AI til seriøst arbejde, vil disse problemer føles alt for bekendte – og de understreger, hvor langt vi endnu har til at gå i opbygning af agenter, der kan rigtigt tænke og forskere som mennesker.

Hvad med hukommelsesbaseret præstation?

Interessant nok evaluerede Deep Research Bench også, hvad det kalder “værktøjsløse” agenter – sprogmodeller, der fungerer uden adgang til eksterne værktøjer, såsom websøgning eller dokumenthentning. Disse agenter afhænger udelukkende af deres interne træningsdata og hukommelse, genererer svar baseret udelukkende på, hvad de har lært under træning. I praksis betyder det, at de ikke kan søge noget op eller verificere information – de gætter baseret på, hvad de “husker”.

Overraskende nok præsterede disse værktøjsløse agenter næsten lige så godt som fulde forskningsagenter på visse opgaver. F.eks. på opgaven Valider Erklæring – hvor målet er at vurderer sandsynligheden af en udtalelse – scorede de 0,61, næsten matchende den gennemsnitlige score på 0,62 for værktøjsaktiverede agenter. Dette antyder, at modeller som o3 og Claude har stærke interne forudsigelser og ofte kan genkende sandheden i almindelige påstande uden at skulle søge på nettet.

Men på mere krævende opgaver – som f.eks. Aflede Nummer, der kræver at samle værdier fra forskellige kilder, eller Samle Bevis, der afhænger af at finde og evaluere diverse fakta i kontekst – fejlede disse værktøjsløse modeller fuldstændigt. Uden friske oplysninger eller realtids-søgefunktioner manglede de simpelthen midlerne til at producere præcise eller omfattende svar.

Denne kontrast fremhæver en vigtig nuance: selvom i dagens LLM’er kan simulere “at vide” meget, afhænger dyb forskning ikke kun af genkaldelse, men af resonnering med opdaterede, verificerbare oplysninger – noget, kun værktøjsforstærkede agenter kan rigtigt levere.

Endelige tanker

DRB-rapporten gør en ting klart: selvom i dagens bedste AI-agenter kan overgå gennemsnitlige mennesker på snævert definerede opgaver, ligger de stadig bagud i forhold til dygtige, almene forskere – især når det kommer til strategisk planlægning, tilpasning under processen og nuanceret resonnering.

Denne afstand bliver særligt tydelig under lange eller komplekse sessioner – noget, jeg har oplevet personligt, hvor en agent gradvist mister sporet af opgavens formål, hvilket fører til et frustrerende sammenbrud i kohærens og nyttighed.

Hvad gør Deep Research Bench så værdifuld, er, at den ikke kun tester overfladisk viden – den undersøger skæringen af værktøjsbrug, hukommelse, resonnering og tilpasning, og tilbyder en tættere analogi til rigtig verden-forskning end benchmarks som MMLU eller GSM8k.

Da LLM’er fortsætter med at integrere i seriøst videnarbejde, vil FutureSearch-værktøjer som DRB være essentielle for at vurderer ikke kun, hvad disse systemer ved, men hvordan de faktisk fungerer.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.