Tankeledere

Dekodning af muligheder og udfordringer for LLM-agenter i generativ AI

mm
Føj Unite.AI til dine foretrukne kilder på Google

Vi ser en udvikling af generative AI-applikationer drevet af store sprogmodeller (LLM) fra prompts til retrieval-augmented generation (RAG) til agenter. Agenter diskuteres meget i industri- og forskningskredse, primært på grund af den kraft, denne teknologi giver til at transformere Enterprise-applikationer og give overlegen kundeoplevelser. Der er almindelige mønstre for opbygning af agenter, der muliggør de første skridt mod kunstig generel intelligens (AGI).

I min tidligere artikel, så vi en stige af intelligens af mønstre for opbygning af LLM-drevne applikationer. Startende med prompts, der fanger problem-domænet og bruger LLM’s interne hukommelse til at generere output. Med RAG udvider vi prompten med ekstern viden, der søges fra en vektor-database for at kontrollere output. Næste skridt er at opbygge arbejdsgange ved at kæde LLM-opkald sammen for at realisere komplekse applikationer. Agenter tager dette til et næste niveau ved at selv bestemme, hvordan disse LLM-kæder skal dannes. Lad os se nærmere på.

Agenter – Under hood

Et nøgle-mønster med agenter er, at de bruger sprogforståelseskraften i LLM til at lave en plan for, hvordan man løser et givet problem. LLM forstår problemet og giver os en sekvens af skridt til at løse problemet. Men det stopper ikke der. Agenter er ikke et rent support-system, der giver anbefalinger til at løse problemet og så overlader det til dig at følge anbefalningerne. Agenter er udstyret med værktøjer til at gå videre og udføre handlingen. Skræmmende, ikke?

Hvis vi spørger en agent en basal spørgsmål som dette:

Menneske: Hvilket firma startede opfinderne af telefonen?

Følgende er et eksempel på tankeprocesser, som en agent kan gå igennem.

Agent (TÆNKENDE):

  • Tanke: Jeg skal søge efter opfinderne af telefonen.
  • Handling: Søg [opfinder af telefon]
  • Iagttagelse: Alexander Graham Bell
  • Tanke: Jeg skal søge efter et firma, som er grundlagt af Alexander Graham Bell
  • Handling: Søg [firma grundlagt af Alexander Graham Bell]
  • Iagttagelse: Alexander Graham Bell grundlagde American Telephone and Telegraph Company (AT&T) i 1885
  • Tanke: Jeg har fundet svaret. Jeg vil returnere.

Agent (SVAR): Alexander Graham Bell grundlagde AT&T i 1885

Du kan se, at agenten følger en metode til at bryde problemet ned i under-problemer, der kan løses ved at udføre bestemte handlinger. Handlingerne her anbefales af LLM, og vi kan tilknytte disse handlinger til bestemte værktøjer for at implementere disse handlinger. Vi kunne aktivere en søgeværktøj for agenten, så når den indsætter, at LLM har anbefalet søgning som handling, vil den kalde dette værktøj med parametrene, der er angivet af LLM. Søgningen her er på internettet, men kan også omdirigeres til at søge i en intern videnbase som en vektor-database. Systemet bliver nu selvstændigt og kan selv finde ud af, hvordan man løser komplekse problemer ved at følge en række skridt. Rammer som LangChain og LLaMAIndex giver dig en nem måde at bygge disse agenter og tilknytte værktøjer og API’er. Amazon lancerede nylig deres Bedrock Agents-ramme, der giver en visuel grænseflade til at designe agenter.

Under hood følger agenter en særlig stil for at sende prompts til LLM, der får dem til at generere en handlingplan. Den ovenstående tanke-handling-iagttagelse-mønster er populært i en type agent kaldet ReAct (Reasoning and Acting). Andre typer af agenter inkluderer MRKL og Plan & Execute, der primært adskiller sig i deres prompt-stil.

For mere komplekse agenter kan handlingerne være knyttet til værktøjer, der forårsager ændringer i kilde-systemer. For eksempel kunne vi tilknytte agenten til et værktøj, der tjekker for ferie-balancen og ansøger om orlov i et ERP-system for en medarbejder. Nu kunne vi bygge en nice chatbot, der ville interagere med brugere og via en chat-kommando ansøge om orlov i systemet. Ingen mere komplekse skærme til at ansøge om orlov, en simpel samlet chat-grænseflade. Lyder spændende!?

Advarsler og behov for Ansvarlig AI

Hvad nu, hvis vi har et værktøj, der udløser transaktioner på aktiehandel ved hjælp af en forudgodkendt API? Du bygger en applikation, hvor agenten studerer aktieændringer (ved hjælp af værktøjer) og tager beslutninger om køb og salg af aktier. Hvad nu, hvis agenten sælger den forkerte aktie, fordi den hallucinerer og tager en forkert beslutning? Da LLM’er er enorme modeller, er det svært at pege på, hvorfor de tager visse beslutninger, og hallucinationer er almindelige i mangelen på ordentlige sikkerhedsforanstaltninger.

Agenter er fascinerende, men du har sandsynligvis gættet, hvor farlige de kan være. Hvis de hallucinerer og tager en forkert handling, der kan forårsage store økonomiske tab eller større problemer i Enterprise-systemer. Derfor er Ansvarlig AI blevet af største betydning i tiden med LLM-drevne applikationer. Principperne for Ansvarlig AI omkring reproducerbarhed, gennemsigtighed og ansvarlighed forsøger at sætte sikkerhedsforanstaltninger på beslutninger, der tages af agenter, og foreslår risikoanalyse for at afgøre, hvilke handlinger der kræver en menneskelig indgriben. Da mere komplekse agenter designes, kræver de mere gennemgang, gennemsigtighed og ansvarlighed for at sikre, at vi ved, hvad de gør.

Afsluttende tanker

Evnen til, at agenter kan generere en række logiske skridt med handlinger, bringer dem tæt på menneskelig tankegang. At udstyre dem med mere kraftfulde værktøjer kan give dem superkræfter. Mønstre som ReAct forsøger at efterligne, hvordan mennesker løser problemer, og vi vil se bedre agent-mønstre, der vil være relevante for bestemte sammenhænge og domæner (bank, forsikring, sundhed, industri osv.). Fremtiden er her, og teknologien bag agenter er klar til, at vi kan bruge den. Samtidig må vi holde et nøje øje på Ansvarlig AI-sikkerhedsforanstaltninger for at sikre, at vi ikke bygger Skynet!

Dattaraj Rao, Chief Data Scientist hos Persistent Systems, er forfatteren til bogen “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Hos Persistent Systems leder Dattaraj AI Research Lab, der udforsker state-of-the-art algoritmer i Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI osv. og demonstrerer anvendelighed i sundheds-, bank- og industriområder. Dattaraj har 11 patenter inden for Machine Learning og Computer Vision.