AI-modeller och plattformar

Agent Laboratory: Ett Virtuellt Forskningslag av AMD och Johns Hopkins

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Medan alla har pratat om AI-agenter och automatisering, har AMD och Johns Hopkins University arbetat med att förbättra hur människor och AI samarbetar i forskning. Deras nya öppna ramverk, Agent Laboratory, är en komplett omkonstruktion av hur vetenskaplig forskning kan accelereras genom mänskligt-AI-samarbete.

Efter att ha tittat på många AI-forskningsramverk, sticker Agent Laboratory ut med sin praktiska tillvägagångssätt. Istället för att försöka ersätta mänskliga forskare (som många befintliga lösningar), fokuserar det på att förstärka deras förmågor genom att hantera de tidskrävande aspekterna av forskning medan människor förblir i förarsätet.

Kärnnovationen här är enkel men kraftfull: Istället för att sträva efter fullständigt autonom forskning (vilket ofta leder till tvivelaktiga resultat), skapar Agent Laboratory ett virtuellt laboratorium där flera specialiserade AI-agenter arbetar tillsammans, var och en hanterar olika aspekter av forskningsprocessen medan de förblir förankrade i mänsklig vägledning.

Att Bryta Ner Det Virtuella Laboratoriet

Tänk på Agent Laboratory som ett välkoordinerat forskningsteam, men med AI-agenter som spelar specialiserade roller. Liksom ett riktigt forskningslaboratorium har varje agent specifika ansvarsområden och expertis:

  • En PhD-agent hanterar litteraturgenomgångar och forskningsplanering
  • Postdoc-agenter hjälper till att förfinade experimentella tillvägagångssätt
  • ML Engineer-agenter hanterar den tekniska implementeringen
  • Professor-agenter utvärderar och poängsätter forskningsresultat

Det som gör detta system särskilt intressant är dess arbetsflöde. Till skillnad från traditionella AI-verktyg som opererar i isolering, skapar Agent Laboratory en samarbetsmiljö där dessa agenter interagerar och bygger på varandras arbete.

Processen följer en naturlig forskningsprogression:

  1. Litteraturgenomgång: PhD-agenten genomsöker akademiska artiklar med hjälp av arXiv API, samlar och organiserar relevant forskning
  2. Planformulering: PhD- och postdoc-agenter samarbetar för att skapa detaljerade forskningsplaner
  3. Implementering: ML Engineer-agenter skriver och testar kod
  4. Analys och dokumentation: Teamet arbetar tillsammans för att tolka resultaten och generera omfattande rapporter

Men här är det som blir riktigt praktiskt: Ramverket är beräkningsflexibelt, vilket innebär att forskare kan allokera resurser baserat på deras tillgång till beräkningskraft och budgetbegränsningar. Detta gör det till ett verktyg som är utformat för riktiga forskningsmiljöer.

Schmidgall et al.

Den Mänskliga Faktorn: Där AI Möter Expertis

Medan Agent Laboratory har imponerande automatiseringsförmågor, sker den riktiga magin i det som de kallar “co-pilot-läge”. I denna inställning kan forskare ge feedback vid varje steg i processen, vilket skapar ett äkta samarbete mellan mänsklig expertis och AI-stöd.

Co-pilot-feedbackdata avslöjar några intressanta insikter. I det autonoma läget fick Agent Laboratory-genererade artiklar i genomsnitt 3,8/10 i mänskliga utvärderingar. Men när forskare engagerade sig i co-pilot-läge, ökade poängen till 4,38/10. Det som är särskilt intressant är var dessa förbättringar visade sig – artiklarna fick betydligt högre poäng i tydlighet (+0,23) och presentation (+0,33).

Men här är verklighetskontrollen: även med mänskligt engagemang, fick dessa artiklar fortfarande poäng som var cirka 1,45 poäng under genomsnittet för antagna NeurIPS-artiklar (som ligger på 5,85). Detta är inte ett misslyckande, men det är en viktig läxa om hur AI och mänsklig expertis behöver komplettera varandra.

Utvärderingen avslöjade något annat fascinerande: AI-granskare gav konsekvent artiklarna betyg som var cirka 2,3 poäng högre än mänskliga granskare. Detta gap betonar varför mänsklig översyn förblir avgörande i forskningsutvärdering.

Schmidgall et al.

Att Bryta Ner Siffrorna

Vad som verkligen spelar roll i en forskningsmiljö är kostnad och prestanda. Agent Laboratorys tillvägagångssätt för modelljämförelse avslöjar några överraskande effektivitetsvinster i detta avseende.

GPT-4o framstod som hastighetsmästaren, som slutförde hela arbetsflödet på bara 1 165,4 sekunder – det är 3,2 gånger snabbare än o1-mini och 5,3 gånger snabbare än o1-preview. Men vad som är ännu viktigare är att det bara kostar 2,33 dollar per artikel. Jämfört med tidigare autonoma forskningsmetoder som kostade runt 15 dollar, ser vi en kostnadsminskning på 84 %.

Att Titta på Modellprestanda:

  • o1-preview fick högsta poängen i användbarhet och tydlighet
  • o1-mini uppnådde de bästa experimentella kvalitetspoängen
  • GPT-4o halkade efter i metriker men ledde i kostnadseffektivitet

De verkliga implikationerna här är betydande.

Forskare kan nu välja sitt tillvägagångssätt baserat på deras specifika behov:

  • Behöver snabb prototypning? GPT-4o erbjuder hastighet och kostnadseffektivitet
  • Prioriterar experimentell kvalitet? o1-mini kan vara ditt bästa val
  • Letar efter den mest polerade utmatningen? o1-preview visar löfte

Denna flexibilitet innebär att forskningsteam kan anpassa ramverket till sina resurser och krav, snarare än att vara låsta till en lösning som passar alla.

Ett Nytt Kapitel i Forskning

Efter att ha tittat på Agent Laboratorys förmågor och resultat, är jag övertygad om att vi ser en betydande förändring i hur forskning kommer att bedrivas. Men det är inte berättelsen om ersättning som ofta dominerar rubrikerna – det är något långt mer nyanserat och kraftfullt.

Medan Agent Laboratorys artiklar ännu inte når toppkonferensstandarder på egen hand, skapar de ett nytt paradigm för forskningsacceleration. Tänk på det som att ha ett team av AI-forskningsassistenter som aldrig sover, var och en specialiserad på olika aspekter av den vetenskapliga processen.

Implikationerna för forskare är djupgående:

  • Tiden som läggs på litteraturgenomgångar och grundläggande kodning kan omdirigeras till kreativ idébildning
  • Forskningsidéer som kanske har lagts på hyllan på grund av resursbegränsningar blir genomförbara
  • Förmågan att snabbt prototypa och testa hypoteser kan leda till snabbare genombrott

Nuvarande begränsningar, som gapet mellan AI- och mänskliga utvärderingspoäng, är möjligheter. Varje iteration av dessa system bringar oss närmare mer sofistikerat forskningssamarbete mellan människor och AI.

Om vi ser framåt, ser jag tre nyckelutvecklingar som kan omforma vetenskaplig upptäckt:

  1. Mer sofistikerade mänskliga-AI-samarbetsmönster kommer att uppstå när forskare lär sig att utnyttja dessa verktyg effektivt
  2. Kostnads- och tidsbesparingarna kan demokratisera forskning, vilket gör det möjligt för mindre laboratorier och institutioner att bedriva mer ambitiösa projekt
  3. Förmågan till snabb prototypning kan leda till mer experimentella tillvägagångssätt i forskning

Nyckeln till att maximera denna potential? Att förstå att Agent Laboratory och liknande ramverk är verktyg för förstärkning, inte automatisering. Framtiden för forskning handlar inte om att välja mellan mänsklig expertis och AI-förmågor – det handlar om att hitta innovativa sätt att kombinera dem.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.