Modely a platformy AI
OpenAgents: Otevřená platforma pro jazykové agenty v divočině
Poslední vývoj ukázal, že jazykové agenty, zejména ty postavené na velkých jazycích (LLM), mají potenciál provádět širokou škálu složitých úkolů v různých prostředích pomocí přirozeného jazyka. Nicméně, hlavní zaměření většiny rámců jazykových agentů je目前 zaměřeno na usnadnění konstrukce proof-of-concept jazykových agentů. Tento zaměření často přichází s malou nebo žádnou pozorností k návrhům na úrovni aplikací a často zanedbává přístupnost těchto agentů pro neexpertní uživatele.
Aby se překonaly současné omezení jazykových agentů, vývojáři vytvořili OpenAgents framework, otevřenou platformu pro hostování a nasazení jazykových agentů v divočině a napříč širokou škálou každodenních úkolů. OpenAgents framework je postaven kolem tří agentů
- Data Agent: Pomáhá s analýzou dat pomocí nástrojů pro data a dotazovacími jazyky, jako je SQL, nebo programovacími jazyky, jako je Python.
- Plugin Agents: Pomáhá poskytováním přístupu k více než 200 nástrojům API pro denní úkoly.
- Web Agents: Pomáhá při procházení webu, zatímco udržuje vaši anonymitu.
OpenAgents framework používá webové uživatelské rozhraní optimalizované pro běžné selhání a rychlé odpovědi, aby umožnil obecným uživatelům interagovat s funkcionalitami agentů, zatímco současně nabízí výzkumníkům a vývojářům bezproblémový zážitek z nasazení na jejich místních nastaveních. Bylo by bezpečné říci, že OpenAgents framework je pokus o poskytnutí pevného základu pro usnadnění hodnocení ve skutečném světě a vytváření inovativních, účinných a pokročilých jazykových agentů.
V dnešním článku se budeme zabývat OpenAgents frameworkem, a budeme mluvit o rámci v větší detail.
OpenAgents a jazykové agenty: Úvod
Jazykové agenty, ve své podstatě, jsou odvozeny od inteligentních agentů. Tyto inteligentní agenty jsou konceptualizovány tak, aby měly autonomní schopnosti řešení problémů, spolu se schopností vnímat své prostředí, dělat rozhodnutí a jednat podle nich. S pokrokem ve velkých jazycích, globální vývojová komunita využila konceptu inteligentních agentů a LLM k vytvoření jazykových agentů. Tyto agenty využívají přirozený jazykový program (NLP) k provádění široké škály složitých úkolů v různých prostředích a nedávno ukázaly pozoruhodný potenciál.
Current jazykové agentové rámce, jako je Gravitas a Chase, primárně poskytují konzolové rozhraní přizpůsobené pro vývojáře, spolu s implementacemi proof-of-concept. Nicméně, často omezují přístup k širšímu publiku, zejména těm, kteří nejsou zdatní v programování. Kromě toho, současné agentní benchmarky jsou konstruovány vývojáři s konkrétními požadavky pro deterministické hodnocení, zejména v scénářích, které vyžadují procházení webu, programování, využití nástrojů nebo kombinaci těchto.
V rámci vývoje LLM-powerných inteligentních a jazykových agentů pro širší uživatelskou základnu, etablovaní hráči, jako je OpenAI a Microsoft (MSFT ), nasadili řadu dobře navržených produktů, včetně pokročilé analýzy dat, také známé jako Code Interpreter, a prohlížečových pluginů. Ačkoli tyto agenty jsou efektivní ve svých funkcích, nabízejí omezenou pomoc vývojářské komunitě. Toto omezení vzniká, protože obchodní logika kódu a modelové implementace nebyly otevřeny, bránící tak možnost vývojářům a výzkumníkům dále je prozkoumat, a omezující tak bezplatný přístup pro uživatele.
Aby se tento problém vyřešil, vývojáři vytvořili OpenAgents, otevřenou platformu pro hostování a používání agentů, a je目前 postavena na základě tří interních agentů
- Data Agent: Pomáhá s analýzou dat pomocí nástrojů pro data a dotazovacími jazyky, jako je SQL, nebo programovacími jazyky, jako je Python.
- Plugin Agents: Pomáhá poskytováním přístupu k více než 200 nástrojům API pro denní úkoly.
- Web Agents: Pomáhá při procházení webu, zatímco udržuje vaši anonymitu.
Následující obrázek demonstruje OpenAgents platformu pro obecné uživatele, vývojáře a výzkumníky.

- Místo použití programátorského balíčku nebo konzolí, obecní uživatelé mohou interagovat s třemi agenty v OpenAgents rámci pomocí online webového rozhraní.
- Vývojáři mohou využít obchodní logiky a výzkumných kódů poskytnutých OpenAgents frameworkem k bezproblémovému nasazení backendu a frontendu pro další vývoj.
- Výzkumníci mají flexibilitu buď vytvářet nové jazykové agenty od začátku, nebo implementovat agentní metody pomocí sdílených komponent a příkladů, a hodnotit jejich výkon pomocí webového rozhraní.
To shrnuje, OpenAgents framework je původně určen jako holistická a realistická platforma pro hodnocení jazykových agentů s lidskou smyčkou, která umožňuje uživatelům interagovat s těmito agenty k dokončení široké škály úkolů, a tyto interakce mezi člověkem a agentem spolu s uživatelskou zpětnou vazbou jsou uloženy a analyzovány pro další vývoj a hodnocení.
Pro ty, kteří nejsou vědomi, LLM prompting je proces, který umožňuje vývojářům vytvářet instrukce, které chrání proti adversním nebo nesprávným vstupům, zlepšují estetiku výstupu a přizpůsobují se backend logice. Během fáze vývoje, vývojáři pracující na OpenAgents frameworku používají LLM prompting techniku k zdůraznění významu specifikace požadavků aplikací.
V následujícím obrázku, srovnáváme OpenAgents framework přímo s existujícími pracemi na benchmarkách agentního konceptu a vytváření prototypů.

OpenAgents: Návrh a implementace platformy
Systémový návrh nebo architektura OpenAgents platformy lze rozdělit do dvou hlavních komponent: Uživatelské rozhraní, včetně backendu a frontendu, a Jazykový agent, skládající se z nástrojů, jazykových modelů a prostředí. OpenAgents framework poskytuje rozhraní pro komunikaci mezi uživateli a agenty.
Agenty používají dostupné nástroje k plánování a provedení požadovaných akcí v prostředích, poté, co obdrží vstupy od uživatelů. Architektura nebo systematický návrh frameworku je demonstrován v následujícím obrázku.

Uživatelské rozhraní
Vývojáři OpenAgents frameworku věnovali mnoho úsilí a myšlenek vývoji nejen vysoce funkčního, ale také uživatelsky přívětivého rozhraní, poté, co zvládli řadu hostitelských agentů a opakovaně použitelné obchodní logiky. Jako výsledek, OpenAgents framework nabízí podporu pro širokou škálu technických úkolů, včetně zpracování chyb, backendových serverových operací, datového toku a mnohem více, s hlavním cílem učinit OpenAgents framework uživatelsky přívětivým, ale současně vysoce efektivní a použitelný.
Jazykový agent
V rámci OpenAgents frameworku, jazykový agent má tři základní komponenty: rozhraní nástrojů, jazykový model a prostředí. Prompting metoda implementovaná v OpenAgents frameworku vytváří sekvenční proces pro agenty, který začíná Pozorováním -> Úvahou -> Akcí. Framework také.promptuje LLM k generování parsable textu s vylepšenou efektivitou, a rozhraní nástrojů se skládá z parserů, které mohou přeložit tyto parsable texty generované LLM do vykonatelných akcí, jako je volání API nebo generování kódu. Tyto akce jsou pak vykonány frameworkem v rámci příslušného prostředí.
OpenAgents’ Agenty
V jádru OpenAgents, existují tři rozdílné agenty: Data Agent, který pomáhá s analýzou dat pomocí nástrojů pro data a dotazovacími jazyky, jako je SQL, nebo programovacími jazyky, jako je Python, Plugin Agents, který pomáhá poskytováním přístupu k více než 200 nástrojům API pro denní úkoly, a Web Agents, který pomáhá při procházení webu, zatímco udržuje vaši anonymitu. Tyto agenty mají individuální doménovou odbornost podobnou ChatGPT pluginům, nicméně na rozdíl od ChatGPT, implementace na OpenAgents je založena čistě na otevřených jazykových aplikacích API.
Data Agent
Data agent v OpenAgents frameworku byl navržen a nasazen tak, aby zvládl širokou škálu úkolů souvisejících s daty, se kterými se koncoví uživatelé setkávají pravidelně. Data agenty podporují generování a spouštění kódu ve dvou programovacích jazycích, a to SQL a Python, a agent také má k dispozici několik nástrojů pro data, včetně Data Profiling pro poskytování základních informací o datech, Kaggle Data Search pro vyhledávání dat, a ECharts Tool pro vykreslování interaktivních ECharts. Kromě toho, OpenAgents framework promptuje data agenta k proaktivnímu použití těchto nástrojů, aby účinně reagoval na požadavky koncových uživatelů.
S pomocí těchto nástrojů pro data, data agent je schopen zvládnout řadu požadavků souvisejících s daty, a provádí datové vizualizace, manipulace a dotazy efektivně, tím překračuje hranice kódu a textové generace. Následující obrázek zdůrazňuje data agenta v akci a nástroje dostupné běžným uživatelům.

Plugin Agents
Plugin agent v OpenAgents frameworku byl navržen vývojáři pečlivě, aby uspokojil multifaceted požadavky uživatelů pro denní úkoly, včetně vyhledávání na internetu, online nákupů, čtení zpráv, nebo vytváření webů a aplikací, poskytováním přístupu k více než 200 pluginům, se zvláštní pozorností na funkční rozhraní, API pingy a délky odpovědí API. Některé z prominentních pluginů zahrnují
- Google Search
- Wolfram Alpha
- Zapier
- Klarna
- Coursera
- Show Me
- Speak
- AskYourPDF
- BizTok
- Klook
Na základě svých potřeb a požadavků, uživatelé mohou zvolit počet pluginů, které chtějí plugin agenty použít, a fungování je demonstrováno v následujícím obrázku.

Kromě toho, aby uživatelé nebyli v situacích, kdy nejsou jistí, který plugin bude nejlépe vyhovovat jejich požadavkům, OpenAgents framework nabízí uživatelům funkci, která automaticky vybírá pluginy nejrelevantnější pro jejich instrukce.
Web Agents
OpenAgents framework představuje web agenta jako specializovaný nástroj, jehož úkolem je zvýšit efektivitu a schopnosti chat agenta. Ačkoli chat agent stále obsahuje hlavní interakční rozhraní, bezproblémově integruje web agenta, kdykoli je to nutné. Konečná odpověď je pak doručena koncovému uživateli web agentem, a proces je ilustrován v následujícím obrázku.

Designová strategie implementovaná v těchto web agentech se ukazuje jako velmi přínosná, protože chat agent zpracovává důležité parametry nebo iniciuje URL systematicky, předtím, než jsou přeneseny na web agenta, tím zajišťuje lepší zarovnání mezi požadavky uživatelů a generovaným výstupem, tím vedoucí k jasnější komunikaci. Kromě toho, strategie také umožňuje web agentům akomodovat vrstvené a adaptivní uživatelské dotazy, zaměstnávající dynamickou multi-obratovou web navigaci spojenou s chat dialogy. Proto, rozlišením rolí a odpovědností chat a multi-prohlížení agentů, OpenAgents framework umožňuje rafinaci a evoluci každého jednotlivého modulu.
OpenAgents: Praktické aplikace a nasazení ve skutečném světě
V této části, budeme mluvit o trajektorii OpenAgents frameworku od teoretizace po nasazení ve skutečném světě, spolu s výzvami, se kterými se vývojáři setkali, a učení, které z nich vyplynulo, spolu s komplexitami hodnocení, se kterými se vývojáři vypořádali.
Používání promptů k transformaci velkých jazykových modelů do aplikací ve skutečném světě
Když se používají LLM prompty pro stavbu aplikací ve skutečném světě pro koncové uživatele, OpenAgents framework používá prompt instrukce k specifikaci určitých požadavků. Cílem některých instrukcí je zajistit, aby výstup byl v souladu s určitým formátem, tím umožňujícím backend logice zpracovat, zatímco cílem jiných instrukcí je vylepšit estetiku výstupu, zatímco zbytek chrání framework proti potenciálním útokům.
Neovladatelné faktory ve skutečném světě
Když vývojáři nasadili OpenAgents framework ve skutečném světě, byli konfrontováni s řadou neovladatelných faktorů ve skutečném světě, spuštěných internetovou infrastrukturou, uživateli, obchodními logikami a více. Tyto neovladatelné faktory donutily vývojáře přehodnotit a upravit některé předpoklady na základě předchozích výzkumů, a mohli nakonec vést k situacím, ve kterých koncoví uživatelé nemusí být spokojeni s odpovědí, kterou framework generuje.
Komplexita hodnocení
Ačkoli agenty postavené přímo na aplikace mohou mít širší aplikaci a usnadňují hodnocení, přidávají to také ke komplexitě stavby LLM-powerných aplikací, což ztěžuje analýzu výkonu aplikací. Kromě toho, tento přístup také přidává ke stabilitě a prodlužuje systémový řetězec LLM, což ztěžuje frameworku přizpůsobit se různým komponentám. Proto, má smysl rafinovat systémový návrh a provozní logiku těchto agentů, aby se zjednodušily postupy a zajistil efektivní výstup.
Závěrečné myšlenky
V tomto článku, jsme mluvili o OpenAgents frameworku, otevřené platformě pro hostování a nasazení jazykových agentů ve skutečném světě a napříč širokou škálou každodenních úkolů. OpenAgents framework je postaven kolem tří agentů: Data Agent, který pomáhá s analýzou dat pomocí nástrojů pro data a dotazovacími jazyky, jako je SQL, nebo programovacími jazyky, jako je Python, Plugin Agents, který pomáhá poskytováním přístupu k více než 200 nástrojům API pro denní úkoly, a Web Agents, který pomáhá při procházení webu, zatímco udržuje vaši anonymitu. OpenAgents framework používá webové uživatelské rozhraní optimalizované pro běžné selhání a rychlé odpovědi, aby umožnil obecným uživatelům interagovat s funkcionalitami agentů, zatímco současně nabízí výzkumníkům a vývojářům bezproblémový zážitek z nasazení na jejich místních nastaveních. Cílem OpenAgents je poskytnout transparentní, holistickou a nasaditelnou platformu, aby se potenciál LLM stal dostupnějším širšímu spektru uživatelů, nejen výzkumníkům a vývojářům, ale také koncovým uživatelům s omezenými technickými znalostmi.












