AI-modellen en platforms
Agent Laboratory: Een Virtueel Onderzoeksteam van AMD en Johns Hopkins

Terwijl iedereen het heeft over AI-agents en automatisering, hebben AMD en de Johns Hopkins University gewerkt aan het verbeteren van de samenwerking tussen mensen en AI in onderzoek. Hun nieuwe open-source framework, Agent Laboratory, is een complete heruitvinding van hoe wetenschappelijk onderzoek kan worden versneld door samenwerking tussen mensen en AI.
Na het bekijken van talloze AI-onderzoeksframeworks, springt Agent Laboratory eruit door zijn praktische aanpak. In plaats van het proberen te vervangen van menselijke onderzoekers (zoals veel bestaande oplossingen), richt het zich op het versterken van hun capaciteiten door het afhandelen van de tijdrovende aspecten van onderzoek, terwijl mensen aan het roer blijven.
De kerninnovatie hier is eenvoudig maar krachtig: In plaats van het nastreven van volledig autonoom onderzoek (wat vaak leidt tot twijfelachtige resultaten), creëert Agent Laboratory een virtuele laboratorium waarin meerdere gespecialiseerde AI-agents samenwerken, elk verantwoordelijk voor verschillende aspecten van het onderzoeksproces, terwijl ze vasthouden aan menselijke leiding.
Het Virtuele Laboratorium Uiteen Richten
Denk aan Agent Laboratory als een goed georganiseerd onderzoeksteam, maar met AI-agents die gespecialiseerde rollen spelen. Net als een echt laboratorium, heeft elke agent specifieke verantwoordelijkheden en expertise:
- Een PhD-agent behandelt literatuuronderzoek en onderzoeksplanning
- Postdoc-agents helpen bij het verfijnen van experimentele benaderingen
- ML Engineer-agents behandelen de technische implementatie
- Professor-agents evalueren en scoren onderzoeksresultaten
Wat dit systeem bijzonder interessant maakt, is de workflow. In tegenstelling tot traditionele AI-hulpmiddelen die in isolatie werken, creëert Agent Laboratory een samenwerkingsomgeving waarin deze agents elkaar aanvullen en op elkaars werk bouwen.
Het proces volgt een natuurlijke onderzoeksprogressie:
- Literatuuronderzoek: De PhD-agent doorzoekt academische papers met behulp van de arXiv API, verzamelt en organiseert relevante onderzoeken
- Planformulering: PhD- en postdoc-agents werken samen om gedetailleerde onderzoeksplannen te maken
- Implementatie: ML Engineer-agents schrijven en testen code
- Analyse & Documentatie: Het team werkt samen om resultaten te interpreteren en uitgebreide rapporten te genereren
Maar hier wordt het echt praktisch: Het framework is compute-flexibel, wat betekent dat onderzoekers resources kunnen toewijzen op basis van hun toegang tot rekenkracht en budgetbeperkingen. Dit maakt het een instrument dat is ontworpen voor echte onderzoeksomgevingen.

Schmidgall et al.
De Menselijke Factor: Waar AI en Expertise Samenkomen
Terwijl Agent Laboratory indrukwekkende automatiseringsmogelijkheden heeft, gebeurt de echte magie in wat ze “co-pilot-modus” noemen. In deze instelling kunnen onderzoekers feedback geven op elk stadium van het proces, waardoor een echte samenwerking tussen menselijke expertise en AI-ondersteuning ontstaat.
De co-pilot feedbackgegevens onthullen enkele interessante inzichten. In de autonome modus scoorden Agent Laboratory gegenereerde papers gemiddeld 3,8/10 in menselijke evaluaties. Maar toen onderzoekers deelnamen aan de co-pilot-modus, steeg deze score naar 4,38/10. Wat bijzonder interessant is, is waar deze verbeteringen zich voordeden – papers scoorden aanzienlijk hoger in duidelijkheid (+0,23) en presentatie (+0,33).
Maar hier is de realiteit: zelfs met menselijke betrokkenheid, scoorden deze papers nog steeds ongeveer 1,45 punten lager dan het gemiddelde geaccepteerde NeurIPS-paper (dat op 5,85 staat). Dit is geen falen, maar het is een cruciale les over hoe AI en menselijke expertise elkaar moeten aanvullen.
De evaluatie onthulde iets anders fascinerends: AI-beoordelaars scoorden papers consistent ongeveer 2,3 punten hoger dan menselijke beoordelaars. Deze kloof benadrukt waarom menselijke toezicht nog steeds cruciaal is in onderzoeksbeoordeling.

Schmidgall et al.
De Cijfers Uiteen Richten
Wat echt telt in een onderzoeksomgeving? De kosten en prestaties. Agent Laboratory’s aanpak van modelvergelijking onthult enkele verrassende efficiëntiegewinnen op dit gebied.
GPT-4o bleek de snelste, met een volledige workflow in slechts 1.165,4 seconden – dat is 3,2 keer sneller dan o1-mini en 5,3 keer sneller dan o1-preview. Maar wat nog belangrijker is, is dat het slechts $2,33 per paper kost. In vergelijking met eerdere autonome onderzoeksmethoden die ongeveer $15 kosten, zien we een reductie van 84% in de kosten.
Als we naar modelprestaties kijken:
- o1-preview scoorde het hoogst in bruikbaarheid en duidelijkheid
- o1-mini behaalde de beste experimentele kwaliteitsscores
- GPT-4o kwam achteraan in metingen, maar leidde in kostenefficiëntie
De implicaties hiervan zijn aanzienlijk.
Onderzoekers kunnen nu hun aanpak kiezen op basis van hun specifieke behoeften:
- Snelle prototyping nodig? GPT-4o biedt snelheid en kostenefficiëntie
- Experimentele kwaliteit prioriteit? o1-mini kan uw beste keuze zijn
- Op zoek naar de meest gepolijste output? o1-preview toont belofte
Deze flexibiliteit betekent dat onderzoeks teams het framework kunnen aanpassen aan hun middelen en vereisten, in plaats van vast te zitten aan een oplossing die voor iedereen werkt.
Een Nieuw Hoofdstuk in Onderzoek
Na het onderzoeken van de mogelijkheden en resultaten van Agent Laboratory, ben ik ervan overtuigd dat we een significante verschuiving zien in hoe onderzoek zal worden uitgevoerd. Maar het is niet het verhaal van vervanging dat vaak in de koppen staat – het is iets veel subtieler en krachtiger.
Terwijl de papers van Agent Laboratory nog niet aan de topconferentiestandaarden voldoen, creëren ze een nieuw paradigma voor onderzoeksversnelling. Denk aan het als een team van AI-onderzoeksassistenten die nooit slapen, elk gespecialiseerd in verschillende aspecten van het wetenschappelijke proces.
De implicaties voor onderzoekers zijn diepgaand:
- Tijd besteed aan literatuuronderzoek en basiscode kan worden omgeleid naar creatieve ideatie
- Onderzoeks ideeën die mogelijk zijn opgeschort vanwege middelenbeperkingen, worden haalbaar
- De mogelijkheid om snel prototypes en hypotheses te testen, kan leiden tot snellere doorbraken
Huidige beperkingen, zoals de kloof tussen AI- en menselijke beoordelingscores, zijn kansen. Elke iteratie van deze systemen brengt ons dichter bij meer geavanceerde onderzoeks samenwerking tussen mensen en AI.
Als we vooruitkijken, zie ik drie sleutelontwikkelingen die wetenschappelijke ontdekking kunnen herschikken:
- Meer geavanceerde menselijke-AI-samenwerkingspatronen zullen ontstaan als onderzoekers leren om deze instrumenten effectief te gebruiken
- De kosten- en tijdbesparingen kunnen onderzoek democratiseren, waardoor kleinere laboratoria en instellingen meer ambitieuze projecten kunnen nastreven
- De snelle prototypingmogelijkheden kunnen leiden tot meer experimentele benaderingen in onderzoek
De sleutel tot het maximaliseren van dit potentieel? Het begrijpen dat Agent Laboratory en soortgelijke frameworks instrumenten zijn voor versterking, niet voor automatisering. De toekomst van onderzoek gaat niet over het kiezen tussen menselijke expertise en AI-mogelijkheden – het gaat over het vinden van innovatieve manieren om ze te combineren.
experimentele benaderingen in onderzoek De sleutel tot het maximaliseren van dit potentieel? Het begrijpen dat Agent Laboratory en soortgelijke frameworks instrumenten zijn voor versterking, niet voor automatisering. De toekomst van onderzoek gaat niet over het kiezen tussen menselijke expertise en AI-mogelijkheden – het gaat over het vinden van innovatieve manieren om ze te combineren.












