AI-modellen en platforms

Hoe goed zijn AI-agents in echt onderzoek? Binnenin het Deep Research Bench-rapport

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Terwijl grote taalmodellen (LLM’s) snel evolueren, evolueert ook hun belofte als krachtige onderzoeksassistenten. Steeds vaker zijn ze niet alleen bezig met het beantwoorden van eenvoudige feitelijke vragen, maar ook met het uitvoeren van “diep onderzoek” taken, die meerdere stappen van redenering, evaluatie van tegenstrijdige informatie, het opzoeken van gegevens van over het web en het samenvoegen ervan in een coherent resultaat omvatten.

Deze opkomende mogelijkheid wordt nu onder verschillende merknamen op de markt gebracht door grote laboratoria – OpenAI noemt het “Deep Research”, Anthropic noemt het “Extended Thinking”, Google’s Gemini biedt “Search + Pro”-functies en Perplexity noemt het “Pro Search” of “Deep Research”. Maar hoe effectief zijn deze aanbiedingen in de praktijk? Een nieuw rapport van FutureSearch, getiteld Deep Research Bench (DRB): Evaluatie van webonderzoeksagenten, biedt de meest grondige evaluatie tot nu toe – en de resultaten laten zowel indrukwekkende mogelijkheden als kritieke tekortkomingen zien.

Wat is Deep Research Bench?

Gecreëerd door het FutureSearch-team, is Deep Research Bench een zorgvuldig geconstrueerde benchmark ontworpen om de prestaties van AI-agenten te beoordelen op meerdere stappen, webgebaseerde onderzoektaken. Dit zijn geen eenvoudige vragen met rechttoe rechtaan antwoorden – ze weerspiegelen de rommelige, open-eindige uitdagingen waarmee analisten, beleidsmakers en onderzoekers in echte wereldsituaties te maken krijgen.

De benchmark omvat 89 verschillende taken in 8 categorieën, zoals:

  • Find Number: bijv. “Hoeveel FDA Class II-medische apparaatrecalls zijn er geweest?”
  • Validate Claim: bijv. “Is ChatGPT 10x meer energie-intensief dan Google Search?”
  • Compile Dataset: bijv. “Trend voor Amerikaanse softwareontwikkelaars van 2019-2023”

Elk taaktype is zorgvuldig gestructureerd met door mensen geverifieerde antwoorden en wordt beoordeeld met behulp van een bevroren dataset van webpagina’s, bekend als RetroSearch. Dit zorgt voor consistentie bij modelbeoordelingen, waardoor de veranderende staat van het live web wordt vermeden.

De agentarchitectuur: ReAct en RetroSearch

In het hart van Deep Research Bench ligt de ReAct-architectuur, een afkorting voor “Reason + Act”. Deze methode bootst de manier na waarop een menselijke onderzoeker een probleem zou aanpakken – door na te denken over de taak, een actie uit te voeren zoals het uitvoeren van een webzoekopdracht, de resultaten te observeren en vervolgens te beslissen of het moet itereren of concluderen.

Terwijl eerdere modellen deze lus expliciet volgen, stroomlijnen nieuwere “denk”-modellen het proces vaak, waarbij redenering meer vloeiend in hun acties wordt geïntegreerd. Om consistentie bij beoordelingen te garanderen, introduceert DRB RetroSearch – een aangepaste, statische versie van het web. In plaats van te vertrouwen op het live internet, dat constant verandert, tappen agenten in een gecurateerde archief van webpagina’s die zijn gescraped met behulp van tools zoals Serper, Playwright en ScraperAPI. De omvang is indrukwekkend: voor taken met hoge complexiteit, zoals “Gather Evidence”, kan RetroSearch toegang bieden tot meer dan 189.000 pagina’s, allemaal bevroren in de tijd, waardoor een eerlijke en reproduceerbare testomgeving wordt gegarandeerd.

Welke AI-agents presteren het beste?

Onder alle deelnemers kwam OpenAI’s o3 als de beste presteerder naar voren, met een score van 0,51 uit een mogelijke 1,0 op de Deep Research Bench. Hoewel dat misschien bescheiden klinkt, is het belangrijk om te begrijpen dat de benchmark moeilijk is: vanwege de ambiguïteit in taakdefinities en scoring, zou zelfs een perfecte agent waarschijnlijk niet hoger scoren dan 0,8 – wat onderzoekers de “ruisgrens” noemen. Met andere woorden, zelfs de beste modellen van vandaag de dag vallen nog steeds tekort voor goed geïnformeerde, methodische menselijke onderzoekers.

Toch biedt de ranglijst verhelderende inzichten. o3 stond niet alleen aan de top, maar deed dit ook met snelheid en consistentie, en toonde een sterke prestatie in bijna alle taaktypen. Claude 3.7 Sonnet van Anthropic volgde dicht, en toonde veelzijdigheid in zowel zijn “denk”- als “niet-denken”-modi. Gemini 2.5 Pro, Google’s vlaggenschipmodel, viel op door zijn vermogen om taken te verwerken die gestructureerde planning en stap-voor-stapredenering vereisen. Ondertussen boekte de open-gewicht DeepSeek-R1 een aangename verrassing – het hield gelijke tred met GPT-4 Turbo en verkleinde de prestatieverschillen tussen open en gesloten modellen.

Over het algemeen kwam een duidelijk patroon naar voren: nieuwere, “denk”-modellen presteerden consequent beter dan hun eerdere tegenhangers, en gesloten modellen behielden een opvallende voorsprong op open-gewichtalternatieven.

Waar worstelen agenten?

Het lezen van de falenpatronen die in het Deep Research Bench-rapport worden benadrukt, voelde opvallend vertrouwd. Een van de meest frustrerende aspecten die ik persoonlijk ben tegengekomen – vooral tijdens lange onderzoeks- of inhoudscreatiessessies – is wanneer een AI-agent gewoon vergeet wat we aan het doen waren. Naarmate het contextvenster zich uitstrekt, begint het model vaak het spoor bijster te raken: belangrijke details vervagen, doelen worden verward en plotseling voelen de antwoorden onsamengaand of doelloos. Op een gegeven moment heb ik geleerd dat het vaak beter is om de verliezen te nemen en opnieuw te beginnen, zelfs als dat betekent dat alles wat is gegenereerd wordt weggegooid.

Die vergeetachtigheid is niet alleen anekdotisch – het is de belangrijkste voorspeller van falen in de Deep Research Bench-beoordeling. Maar het is niet het enige terugkerende probleem. Het rapport benadrukt ook hoe sommige modellen vast komen te zitten in herhaalde toolgebruik, steeds dezelfde zoekopdracht uitvoeren alsof ze vastzitten in een lus. Andere modellen tonen een slechte zoekopdracht, lui keyword-matching in plaats van kritisch nadenken over hoe effectief te zoeken. En veel te vaak vallen agenten ten prooi aan premature conclusies – leveren een half gevormd antwoord dat technisch de doos aanvinkt, maar tekort schiet in echte inzicht.

Zelfs onder de topmodellen zijn de verschillen opvallend. GPT-4 Turbo toonde bijvoorbeeld een opvallende neiging om eerdere stappen te vergeten, terwijl DeepSeek-R1 vaker hallucineerde of plausibele, maar onjuiste, informatie verzon. Over het algemeen faalden modellen vaak om bronnen te controleren of bevindingen te valideren voordat ze hun uitvoer finaliseerden. Voor iedereen die ooit op AI heeft vertrouwd voor serieus werk, zullen deze problemen maar al te vertrouwd aanvoelen – en ze benadrukken hoe ver we nog moeten gaan om agenten te bouwen die echt kunnen denken en onderzoeken als mensen.

Wat is de prestatie van geheugen?

Interessant genoeg beoordeelde Deep Research Bench ook zogenaamde “toolless”-agenten – taalmodellen die zonder toegang tot externe tools, zoals webzoekopdrachten of documentopname, opereren. Deze agenten vertrouwen volledig op hun interne trainingsgegevens en geheugen, en genereren antwoorden op basis van wat ze eerder hebben geleerd tijdens de training. In de praktijk betekent dit dat ze niets kunnen opzoeken of controleren – ze gokken op basis van wat ze “onthouden”.

Tot verbazing toe presteerden deze toolless-agenten bijna even goed als volledige onderzoeksagenten op bepaalde taken. Bijvoorbeeld, op de Validate Claim-taak – waarbij het doel is om de geloofwaardigheid van een statement te beoordelen – scoorden ze 0,61, bijna gelijk aan de 0,62-gemiddelde van tool-geactiveerde agenten. Dit suggereert dat modellen zoals o3 en Claude sterke interne aannamen hebben en vaak de waarheidsgetrouwheid van veel voorkomende claims kunnen herkennen zonder dat ze het web hoeven te doorzoeken.

Maar op meer veeleisende taken – zoals Derive Number, dat het samenvoegen van meerdere waarden uit verschillende bronnen vereist, of Gather Evidence, dat afhankelijk is van het vinden en evalueren van diverse feiten in context – vielen deze toolless-modellen volledig uit elkaar. Zonder verse informatie of real-time lookup-mogelijkheden, hadden ze eenvoudigweg geen middelen om accurate of complete antwoorden te produceren.

Deze contrast benadrukt een belangrijke nuance: terwijl de LLM’s van vandaag kunnen simuleren “veel te weten”, hangt diep onderzoek niet alleen af van herinnering, maar ook van redenering met up-to-date, verifieerbare informatie – iets wat alleen tool-versterkte agenten echt kunnen bieden.

Eindgedachten

Het DRB-rapport maakt één ding duidelijk: terwijl de beste AI-agenten van vandaag de dag gemiddelde mensen kunnen inhalen op smal gedefinieerde taken, blijven ze nog steeds achter bij ervaren algemene onderzoekers – vooral als het gaat om strategisch plannen, aanpassen tijdens het proces en redeneren met nuances.

Deze kloof wordt vooral duidelijk tijdens lange of complexe sessies – iets wat ik zelf heb meegemaakt, waarbij een agent langzaam het spoor bijster raakt, wat leidt tot een frustrerende ineenstorting van coherentie en bruikbaarheid.

Wat Deep Research Bench zo waardevol maakt, is dat het niet alleen oppervlakkige kennis test – het onderzoekt de kruispunt van toolgebruik, geheugen, redenering en aanpassing, en biedt een nauwere analogie met echt onderzoek in de echte wereld dan benchmarks zoals MMLU of GSM8k.

Terwijl LLM’s steeds meer worden geïntegreerd in serieus kenniswerk, zullen FutureSearch-hulpmiddelen zoals DRB essentieel zijn om niet alleen te beoordelen wat deze systemen weten, maar ook hoe goed ze werkelijk werken.

on van toolgebruik, geheugen, redenering en aanpassing, en biedt een nauwere analogie met echt onderzoek in de echte wereld dan benchmarks zoals MMLU of GSM8k. Terwijl LLM’s steeds meer worden geïntegreerd in serieus kenniswerk, zullen FutureSearch-hulpmiddelen zoals DRB essentieel zijn om niet alleen te beoordelen wat deze systemen weten, maar ook hoe goed ze werkelijk werken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.