Tankeledere
Dekoding av muligheter og utfordringer for LLM-agenter i generativ AI

Vi ser en utvikling av generative AI-applikasjoner drevet av store språkmodeller (LLM) fra promter til retrieval augmented generation (RAG) til agenter. Agenter blir mye diskutert i bransjen og forskningskretsene, hovedsakelig på grunn av den kraften denne teknologien gir for å transformere bedriftsapplikasjoner og gi overlegen kundeopplevelse. Det finnes vanlige mønster for å bygge agenter som muliggjør de første steg mot kunstig generell intelligens (AGI).
I min forrige artikkel, så vi en stige av intelligens av mønster for å bygge LLM-drevne applikasjoner. Startende med promter som fanger problemområdet og bruker LLMs interne minne til å generere utdata. Med RAG, supplementerer vi prompten med eksternt kunnskap som søkes fra en vektor database for å kontrollere utdata. Neste ved å kjede LLM-oppringer, kan vi bygge arbeidsflyter for å realisere komplekse applikasjoner. Agenter tar dette til et neste nivå ved å selv bestemme hvordan disse LLM-kjedene skal dannes. La oss se nærmere.

Agenter – Under panseret
En nøkkelmønster med agenter er at de bruker språkforståelseskraften til LLM til å lage en plan for å løse et gitt problem. LLM forstår problemet og gir oss en sekvens av steg for å løse problemet. Men det stopper ikke der. Agenter er ikke et rent støttesystem som vil gi deg anbefalinger for å løse problemet og deretter overføre stafetten til deg for å ta de anbefalte stegene. Agenter er utstyrt med verktøy for å gå videre og utføre handlingen. Skremmende, ikke sant!?
Hvis vi spør en agent en enkel spørsmål som dette:
Menneske: Hvilket selskap startet oppfinneren av telefonen?
Følgende er et eksempel på tenketegn som en agent kan ta.
Agent (TENKING):
- Tanke: Jeg må søke etter oppfinneren av telefonen.
- Handling: Søk [oppfinner av telefon]
- Observasjon: Alexander Graham Bell
- Tanke: Jeg må søke etter et selskap som ble grunnlagt av Alexander Graham Bell
- Handling: Søk [selskap grunnlagt av Alexander Graham Bell]
- Observasjon: Alexander Graham Bell grunnla American Telephone and Telegraph Company (AT&T) i 1885
- Tanke: Jeg har funnet svaret. Jeg vil returnere.
Agent (SVAR): Alexander Graham Bell grunnla AT&T i 1885
Du kan se at agenten følger en metodelig måte å bryte ned problemet i underproblemer som kan løses ved å utføre bestemte handlinger. Handlingene her er anbefalt av LLM, og vi kan kartlegge disse til bestemte verktøy for å implementere disse handlingene. Vi kunne aktivere et søkeverktøy for agenten slik at når den innser at LLM har gitt søk som en handling, vil den ringe dette verktøyet med parameterne som er gitt av LLM. Søket her er på internett, men kan også bli omdirigert til å søke i en intern kunnskapsbase som en vektor database. Systemet blir nå selvstendig og kan finne ut hvordan å løse komplekse problemer ved å følge en serie av steg. Rammer som LangChain og LLaMAIndex gir deg en enkel måte å bygge disse agentene og koble dem til verktøy og API-er. Amazon lanserte nylig sin Bedrock Agents-ramme som gir en visuell grensesnitt for å designe agenter.
Under panseret, følger agenter en spesiell stil for å sende promter til LLM som får dem til å generere en handlingplan. Ovennevnte Tanke-Handling-Observasjon-mønster er populært i en type agent kalt ReAct (Reasoning and Acting). Andre typer agenter inkluderer MRKL og Plan & Execute, som hovedsakelig skiller seg i deres promptstil.
For mer komplekse agenter, kan handlingene være knyttet til verktøy som forårsaker endringer i kilde systemer. For eksempel, kunne vi koble agenten til et verktøy som sjekker for feriebalanse og søker om permisjon i et ERP-system for en ansatt. Nå kunne vi bygge en fin chatbot som ville interagere med brukere og via en chat-kommando søke om permisjon i systemet. Ingen mer komplekse skjermer for å søke om permisjon, en enkel og samlet chat-grensesnitt. Høres spennende!?
Forbehold og behov for Ansvarlig AI
Hva hvis vi har et verktøy som påkaller transaksjoner på aksjebruk ved hjelp av en forhåndsautorisert API? Du bygger en applikasjon hvor agenten studerer aksjeendringer (ved hjelp av verktøy) og tar beslutninger for deg om å kjøpe og selge aksjer. Hva hvis agenten selger feil aksje fordi den hallucinerte og tok en feil beslutning? Siden LLM er enorme modeller, er det vanskelig å fastslå hvorfor de tar noen beslutninger, og derfor er hallucinasjoner vanlige i fravær av ordentlige retningslinjer.
Mens agenter er fascinerende, har du sannsynligvis gjetting hvordan farlige de kan være. Hvis de hallucinerer og tar en feil handling som kunne forårsake store finansielle tap eller større problemer i bedriftssystemer. Derfor blir Ansvarlig AI viktigere i tiden med LLM-drevne applikasjoner. Prinsippene for Ansvarlig AI rundt reproduserbarhet, transparens og ansvar, prøver å sette retningslinjer på beslutninger tatt av agenter og foreslår risikoanalyse for å bestemme hvilke handlinger som trenger en menneskelig innvirkning. Ettersom mer komplekse agenter blir designet, trenger de mer granskning, transparens og ansvar for å sikre at vi vet hva de gjør.
Avsluttende tanker
Evnen til agenter til å generere en sti av logiske steg med handlinger bringer dem nære til menneskelig resonnering. Å gi dem mer kraftige verktøy kan gi dem superkrefter. Mønster som ReAct prøver å etterligne hvordan mennesker løser problem og vi vil se bedre agentmønster som vil være relevante for bestemte kontekster og domener (bank, forsikring, helse, industri, etc.). Fremtiden er her og teknologien bak agenter er klar for oss å bruke. Samtidig må vi holde et nært øye på Ansvarlig AI-retningslinjer for å sikre at vi ikke bygger Skynet! Bedre agentmønster som vil være relevante for bestemte kontekster og domener (bank, forsikring, helse, industri, etc.). Fremtiden er her og teknologien bak agenter er klar for oss å bruke. Samtidig må vi holde et nært øye på Ansvarlig AI-retningslinjer for å sikre at vi ikke bygger Skynet!












