Modely a platformy AI

Agent Laboratory: Virtuální výzkumný tým od AMD a Johns Hopkins

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Zatímco všichni hovoří o agenta AI a automatizaci, AMD a Johns Hopkins University pracují na zlepšení spolupráce mezi lidmi a AI ve výzkumu. Jejich nová open-source framework, Agent Laboratory, je kompletní reimagination toho, jak lze urychlit vědecký výzkum prostřednictvím spolupráce mezi lidmi a AI.

Po prozkoumání mnoha frameworků pro výzkum AI vyniká Agent Laboratory svou praktickou přístupy. Místo toho, aby se snažil nahradit lidské výzkumníky (jako mnoho stávajících řešení), se zaměřuje na posílení jejich schopností tím, že zpracovává časově náročné aspekty výzkumu, zatímco lidé zůstávají v čele.

Core inovace je jednoduchá, ale silná: Místo toho, aby se snažil plně autonomní výzkum (který často vede k pochybným výsledkům), Agent Laboratory vytváří virtuální laboratoř, kde několik specializovaných agentů AI spolupracuje, každý z nich zpracovává různé aspekty procesu výzkumu, zatímco zůstává ukotvený v lidském vedení.

Rozbor virtuální laboratoře

Myslete si na Agent Laboratory jako na dobře orchestrovaný výzkumný tým, ale s agenty AI hrajícími specializované role. Stejně jako skutečná laboratoř, každý agent má specifické odpovědnosti a odbornosti:

  • PhD agent zpracovává literární recenze a plánování výzkumu
  • Postdoc agenti pomáhají upřesnit experimentální přístupy
  • ML Engineer agenti zpracovávají technickou implementaci
  • Professor agenti hodnotí a scoreují výstupy výzkumu

Co dělá tento systém zvlášť zajímavým, je jeho workflow. Na rozdíl od tradičních nástrojů AI, které fungují v izolaci, Agent Laboratory vytváří spolupráci, kde tito agenti interagují a staví na práci ostatních.

Proces následuje přirozený postup výzkumu:

  1. Literární recenze: PhD agent prohledává akademické články pomocí arXiv API, shromažďuje a organizuje relevantní výzkum
  2. Plánování: PhD a postdoc agenti spolupracují na vytvoření podrobných plánů výzkumu
  3. Implementace: ML Engineer agenti píší a testují kód
  4. Analýza a dokumentace: Tým spolupracuje na interpretaci výsledků a generování komplexních zpráv

Ale tady je to, kde se to stává opravdu praktickým: Framework je flexibilní z hlediska výpočetních zdrojů, což umožňuje výzkumníkům alokovat zdroje na základě jejich přístupu k výpočetnímu výkonu a rozpočtových omezení. To dělá z něj nástroj navržen pro skutečné výzkumné prostředí.

Schmidgall et al.

Lidský faktor: Kde se AI setkává s odborností

Zatímco Agent Laboratory disponuje působivými automatizačními schopnostmi, skutečná magie se děje v tom, co nazývají “spolupilotním režimu”. V tomto nastavení mohou výzkumníci poskytovat zpětnou vazbu na každé fázi procesu, vytvářející skutečnou spolupráci mezi lidskou odborností a AI asistencí.

Data zpětné vazby odhalují některé přesvědčivé poznatky. V autonomním režimu získaly články vygenerované Agent Laboratory průměrný skóre 3,8/10 v hodnocení lidských recenzentů. Ale když výzkumníci spolupracovali v spolupilotním režimu, tyto skóre vzrostly na 4,38/10. Co je zvlášť zajímavé, je to, kde se tyto zlepšení objevily – články získaly významně vyšší skóre v jasnosti (+0,23) a prezentaci (+0,33).

Ale tady je realistická kontrola: i s lidskou účastí tyto články stále získaly o 1,45 bodu méně než průměrný přijatý NeurIPS článek (který má skóre 5,85). To není selhání, ale je to důležité učení o tom, jak AI a lidská odbornost potřebují doplňovat se.

Hodnocení odhalilo něco jiného fascinujícího: AI recenzenti konzistentně hodnotili články o 2,3 bodu vyšší než lidské recenzenty. Tento rozdíl zdůrazňuje, proč lidská kontrola zůstává zásadní v hodnocení výzkumu.

Schmidgall et al.

Rozbor čísel

Co skutečně záleží ve výzkumném prostředí? Náklady a výkon. Přístup Agent Laboratory k srovnání modelů odhaluje některé překvapivé zisky v tomto ohledu.

GPT-4o se ukázal jako šampion rychlosti, dokončující celý workflow za pouhých 1 165,4 sekund – to je 3,2krát rychleji než o1-mini a 5,3krát rychleji než o1-preview. Ale co je ještě důležitější, je to, že to stojí pouze 2,33 dolaru za článek. Ve srovnání s předchozími autonomními metodami výzkumu, které stály kolem 15 dolarů, se jedná o snížení nákladů o 84 %.

Pohled na výkon modelu:

  • o1-preview získal nejvyšší skóre v užitečnosti a jasnosti
  • o1-mini dosáhl nejlepších experimentálních kvalitních skórů
  • GPT-4o zaostal v metrikách, ale vedl v nákladové efektivitě

Skutečné důsledky jsou zde významné.

Výzkumníci mohou nyní zvolit svůj přístup na základě svých specifických potřeb:

  • Potřebujete rychlé prototypování? GPT-4o nabízí rychlost a nákladovou efektivitu
  • Prioritizujete experimentální kvalitu? o1-mini může být vaší nejlepší volbou
  • Hledáte nejvíce vyleštěný výstup? o1-preview ukazuje slib

Tato flexibilita znamená, že výzkumní týmy mohou přizpůsobit framework svým zdrojům a požadavkům, místo aby byli uzamčeni do jednoho univerzálního řešení.

Nová kapitola ve výzkumu

Po prozkoumání schopností a výsledků Agent Laboratory jsem přesvědčen, že se díváme na významnou změnu v tom, jak bude prováděn výzkum. Ale není to narativ nahrazení, který často dominuje titulním stránkám – je to něco mnohem nuancovanějšího a silnějšího.

Zatímco články Agent Laboratory ještě nedosahují nejvyšších konferenčních standardů, vytvářejí nový paradigm pro urychlení výzkumu. Myslete si na to jako na tým AI výzkumných asistentů, kteří nikdy nespí, každý specializovaný na různé aspekty vědeckého procesu.

Důsledky pro výzkumníky jsou hluboké:

  • Čas strávený na literárních recenzích a základním kódování by mohl být přesměrován na kreativní ideaci
  • Výzkumné nápady, které by mohly být odloženy kvůli omezením zdrojů, se stávají životaschopnými
  • Schopnost rychle prototypovat a testovat hypotézy by mohla vést k rychlejším průlomům

Aktuální omezení, jako je mezera mezi AI a lidskými skóre, jsou příležitostmi. Každá iterace těchto systémů nás přivádí blíže k více sofistikované spolupráci mezi lidmi a AI.

Pohledem do budoucnosti vidím tři klíčová rozvoje, která by mohla změnit vědecké objevy:

  1. Více sofistikované vzorce spolupráce mezi lidmi a AI se budou vyvíjet, jakmile se výzkumníci naučí efektivně využívat tyto nástroje
  2. Nákladové a časové úspory by mohly demokratizovat výzkum, umožňující menším laboratořím a institucím sledovat ambicióznější projekty
  3. Schopnosti rychlého prototypování by mohly vést k více experimentálním přístupům ve výzkumu

Klíč k maximalizaci tohoto potenciálu? Porozumění, že Agent Laboratory a podobné frameworky jsou nástroji pro amplifikaci, ne automatizaci. Budoucnost výzkumu není o volbě mezi lidskou odborností a AI schopnostmi – je o nalezení inovativních způsobů, jak je kombinovat.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.