Myslitelé

Rozkládání možností a výzev pro LLM agenty v generativní AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vidíme pokrok v aplikacích Generativní AI poháněných velkými jazykovými modely (LLM) od promptů až po retrieval augmented generation (RAG) a agenty. Agenty jsou široce diskutováni v průmyslu a výzkumných kruzích, především pro jejich schopnost transformovat podnikové aplikace a poskytovat nadřazené zákaznické zkušenosti. Existují společné vzory pro stavbu agentů, které umožňují první kroky směrem k umělé obecné inteligenci (AGI).

V mém předchozím článku jsme viděli žebřík inteligence vzorů pro stavbu aplikací poháněných LLM. Začínáme s prompty, které zachycují problémové domény a používají vnitřní paměť LLM k generování výstupu. S RAG doplňujeme prompt o externí znalosti vyhledané z vektorové databáze, abychom kontrolovali výstupy. Dalšími řetězci volání LLM můžeme stavět pracovní postupy pro realizaci komplexních aplikací. Agenty tento proces berou na další úroveň, protože automaticky určují, jak tyto řetězce LLM mají být vytvořeny. Podívejme se na detaily.

Agenty – Pod kapotou

Klíčový vzor u agentů je, že využívají jazykové pochopení LLM k vytvoření plánu, jak řešit daný problém. LLM rozumí problému a poskytuje nám sekvenci kroků k jeho řešení. Avšak to není vše. Agenty nejsou pouze systémy podpory, které vám poskytují doporučení pro řešení problému a poté předají štafetu vám, abyste provedli doporučené kroky. Agenty jsou vybaveny nástroji, aby mohli provést akci. To zní děsivě, že?!

Pokud se zeptáme agenta na základní otázku, jako je tato:

Člověk: Která společnost založil vynálezce telefonu?

Následuje vzorek myšlenkových kroků, které agent může provést.

Agent (MYŠLENÍ):

  • Myšlenka: Musím vyhledat vynálezce telefonu.
  • Akce: Vyhledat [vynálezce telefonu]
  • Pozorování: Alexander Graham Bell
  • Myšlenka: Musím vyhledat společnost, kterou založil Alexander Graham Bell
  • Akce: Vyhledat [společnost založená Alexanderem Grahamem Bellem]
  • Pozorování: Alexander Graham Bell založil společnost American Telephone and Telegraph Company (AT&T) v roce 1885
  • Myšlenka: Našel jsem odpověď. Budu ji vrátit.

Agent (ODPOVĚĎ): Alexander Graham Bell založil společnost AT&T v roce 1885

Můžete vidět, že agent postupuje systematickým způsobem, rozkládajícím problém na podproblémy, které lze řešit provedením konkrétních akcí. Tyto akce jsou doporučeny LLM a můžeme je mapovat na konkrétní nástroje, aby je provedly. Můžeme například povolit vyhledávací nástroj pro agenta, aby když zjistí, že LLM doporučuje vyhledání, zavolal tento nástroj s parametry poskytnutými LLM. Vyhledávání zde probíhá na internetu, ale může být také přesměrováno na vyhledání v interní znalostní bázi, jako je vektorová databáze. Systém se stává samoúčelným a může určit, jak řešit komplexní problémy následujícím sérií kroků. Rámcové systémy, jako je LangChain a LLaMAIndex, vám poskytují snadný způsob, jak stavět tyto agenty a připojovat je k nástrojům a API. Amazon nedávno spustil rámec Bedrock Agents, který poskytuje vizuální rozhraní pro návrh agentů.

Pod kapotou agenty následují speciální styl odesílání promptů LLM, aby generovaly akční plány. Vzor Myšlení-Akce-Pozorování je populární v typu agenta nazvaném ReAct (Reasoning and Acting). Další typy agentů zahrnují MRKL a Plan & Execute, které se liší především ve stylu promptů.

Pro složitější agenty mohou být akce vázané na nástroje, které způsobují změny v zdrojových systémech. Například můžeme agenta připojit k nástroji, který kontroluje zůstatek dovolené a žádá o dovolenou v ERP systému pro zaměstnance. Nyní můžeme postavit pěkný chatbot, který bude interagovat s uživateli a prostřednictvím chatového příkazu bude žádat o dovolenou v systému. Žádné složité obrazovky pro žádost o dovolenou, jednoduché sjednocené chatové rozhraní. To zní vzrušujícím!

Varování a potřeba zodpovědné AI

A co když máme nástroj, který vyvolává transakce na akciovém trhu pomocí předem autorizovaného API? Budeme stavět aplikaci, ve které agent studuje změny akcií (pomocí nástrojů) a činí rozhodnutí o koupi a prodeji akcií. Co když agent prodá špatnou akcii, protože měl halucinaci a učinil špatné rozhodnutí? Protože LLM jsou obrovské modely, je obtížné určit, proč činí některá rozhodnutí, a proto jsou halucinace běžné v nepřítomnosti vhodných zábran.

Ačkoli agenty jsou fascinující, pravděpodobně jste již uhádli, jak nebezpečné mohou být. Pokud mají halucinace a činí špatné akce, které mohou způsobit obrovské finanční ztráty nebo vážné problémy v podnikových systémech. Proto se zodpovědná AI stává stále důležitější v éře aplikací poháněných LLM. Zásady zodpovědné AI kolem reprodukovatelnosti, transparentnosti a odpovědnosti se snaží nastavit zábrany na rozhodnutí činění agentů a navrhnout analýzu rizik, aby se rozhodlo, které akce vyžadují lidský zásah. Čím jsou navrhovány složitější agenty, tím více vyžadují přísnější kontrolu, transparentnost a odpovědnost, aby se zajistilo, že víme, co dělají.

Závěrečné myšlenky

Schopnost agentů generovat logické kroky s akcemi je velmi blízká lidskému uvažování. Poskytnutí jim více powerfulných nástrojů jim může dát super schopnosti. Vzory, jako je ReAct, se snaží napodobit, jak lidé řeší problémy, a uvidíme lepší vzory agentů, které budou relevantní pro konkrétní kontexty a domény (bankovnictví, pojišťovnictví, zdravotnictví, průmysl atd.). Budoucnost je zde a technologie za agenty je připravena pro nás. Současně musíme udržovat blízkou pozornost na zábrany zodpovědné AI, abychom se ujistili, že nestavíme Skynet!

Dattaraj Rao, Chief Data Scientist at Persistent Systems, je autorem knihy “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” V Persistent Systems Dattaraj vede AI Research Lab, který zkoumá nejmodernější algoritmy v oblasti Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI, atd. a demonstruje jejich aplikovatelnost v oblasti zdravotnictví, bankovnictví a průmyslových odvětví. Dattaraj má 11 patentů v oblasti Machine Learning a Computer Vision.