Tankeledare
Avkodning av möjligheter och utmaningar för LLM-agenter i generativ AI

Vi ser en utveckling av generativa AI-applikationer som drivs av stora språkmodeller (LLM) från prompter till retrieval-augmenterad generation (RAG) till agenter. Agenter diskuteras flitigt i branschen och forskningskretsar, främst för den kraft som denna teknik ger för att transformera företagsapplikationer och ge överlägsna kundupplevelser. Det finns vanliga mönster för att bygga agenter som möjliggör de första stegen mot artificiell allmän intelligens (AGI).
I min tidigare artikel såg vi en steg-för-steg-utveckling av mönster för att bygga LLM-baserade applikationer. Vi börjar med prompter som fångar problemområdet och använder LLM:s interna minne för att generera utdata. Med RAG kompletterar vi prompten med extern kunskap som söks från en vektordatabas för att kontrollera utdata. Nästa steg är att bygga arbetsflöden genom att kedja LLM-samtal för att förverkliga komplexa applikationer. Agenter tar detta till en ny nivå genom att automatiskt bestämma hur dessa LLM-kedjor ska bildas. Låt oss titta närmare.

Agenter – Under huven
Ett viktigt mönster med agenter är att de använder språkförståelsen hos LLM för att skapa en plan för att lösa ett givet problem. LLM förstår problemet och ger oss en sekvens av steg för att lösa problemet. Men det slutar inte där. Agenter är inte bara ett rent stödsystem som ger rekommendationer för att lösa problemet och sedan lämnar över till dig för att genomföra de rekommenderade stegen. Agenter är utrustade med verktyg för att gå vidare och vidta åtgärder. Låter det farligt!?
Om vi frågar en agent en grundläggande fråga som denna:
Människa: Vilket företag startade uppfinnaren av telefonen?
Följande är ett exempel på tanke-steg som en agent kan ta.
Agent (TÄNKANDE):
- Tanke: Jag behöver söka efter uppfinnaren av telefonen.
- Åtgärd: Sök [uppfinnare av telefon]
- Iakttagelse: Alexander Graham Bell
- Tanke: Jag behöver söka efter ett företag som grundades av Alexander Graham Bell
- Åtgärd: Sök [företag grundat av Alexander Graham Bell]
- Iakttagelse: Alexander Graham Bell grundade American Telephone and Telegraph Company (AT&T) 1885
- Tanke: Jag har funnit svaret. Jag kommer att returnera.
Agent (SVAR): Alexander Graham Bell grundade AT&T 1885
Du kan se att agenten följer en metodisk väg för att bryta ned problemet i underproblem som kan lösas genom att vidta specifika åtgärder. Åtgärderna här rekommenderas av LLM och vi kan mappa dem till specifika verktyg för att implementera dessa åtgärder. Vi kunde aktivera ett sökverktyg för agenten så att när den inser att LLM har gett sökning som en åtgärd, den kommer att anropa detta verktyg med parametrarna som tillhandahålls av LLM. Sökningen här är på internet men kan också omdirigeras till att söka en intern kunskapsbas som en vektordatabas. Systemet blir nu självförsörjande och kan lista ut hur man löser komplexa problem genom att följa en serie steg. Ramverk som LangChain och LLaMAIndex ger dig ett enkelt sätt att bygga dessa agenter och ansluta till verktyg och API:er. Amazon lanserade nyligen sin Bedrock Agents-ramverk som ger en visuell gränssnitt för att designa agenter.
Under huven följer agenter ett särskilt mönster för att skicka prompter till LLM som gör att de genererar en åtgärdsplan. Ovanstående tanke-åtgärd-iakttagelse-mönster är populärt i en typ av agent som kallas ReAct (Reasoning and Acting). Andra typer av agenter inkluderar MRKL och Plan & Execute, som främst skiljer sig i sin prompt-stil.
För mer komplexa agenter kan åtgärderna kopplas till verktyg som orsakar förändringar i källsystem. Till exempel kunde vi ansluta agenten till ett verktyg som kontrollerar semesterbalans och ansöker om ledighet i ett ERP-system för en anställd. Nu kunde vi bygga en trevlig chatbot som skulle interagera med användare och via en chat-kommando ansöka om ledighet i systemet. Inga fler komplexa skärmar för att ansöka om ledighet, ett enkelt enhetligt chat-gränssnitt. Låter det spännande!?
Varningar och behov av Ansvarsfull AI
Vad händer om vi har ett verktyg som utlöser transaktioner på aktiehandel med en förautentiserad API? Du bygger en applikation där agenten studerar aktieförändringar (med verktyg) och fattar beslut om köp och försäljning av aktier. Vad händer om agenten säljer fel aktie för att den hallucinerat och fattat ett felaktigt beslut? Eftersom LLM är stora modeller är det svårt att peka ut varför de fattar vissa beslut, och hallucinationer är vanliga i avsaknad av ordentliga skyddsräcken.
Medan agenter är allt fascinerande har du förmodligen gissat hur farliga de kan vara. Om de hallucinerar och tar en felaktig åtgärd som kan orsaka stora ekonomiska förluster eller stora problem i företagssystem. Därför blir Ansvarsfull AI allt viktigare i tidsåldern av LLM-baserade applikationer. Principerna för Ansvarsfull AI kring reproducerbarhet, transparens och ansvar, försöker att sätta skyddsräcken på beslut som fattas av agenter och föreslår riskanalys för att bestämma vilka åtgärder som behöver en mänsklig loop. När allt mer komplexa agenter designas behöver de mer granskning, transparens och ansvar för att säkerställa att vi vet vad de gör.
Avslutande tankar
Förmågan hos agenter att generera en väg av logiska steg med åtgärder får dem att komma riktigt nära mänskligt resonemang. Att ge dem mer kraftfulla verktyg kan ge dem superkrafter. Mönster som ReAct försöker efterlikna hur människor löser problem och vi kommer att se bättre agentmönster som kommer att vara relevanta för specifika sammanhang och domäner (bank, försäkring, hälsovård, industri, etc.). Framtiden är här och tekniken bakom agenter är redo för oss att använda. Samtidigt måste vi hålla ett nära öga på Ansvarsfull AI:s skyddsräcken för att säkerställa att vi inte bygger Skynet!












