AI-verktøy 101

Beyond ChatGPT; AI Agent: En ny verden av arbeidere

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Med fremgang i dyp læring, naturlig språkbehandling (NLP) og AI, er vi i en tid hvor AI-agenter kan utgjøre en betydelig del av den globale arbeidsstyrken. Disse AI-ageneter, som går utenfor chatboter og taleassistenter, former en ny paradigme for både industrier og våre daglige liv. Men hva betyr det egentlig å leve i en verden som er forbedret av disse “arbeiderne”? Denne artikkelen dykker dypt inn i dette utviklende landskapet, og vurderer implikasjonene, potensialet og utfordringene som ligger foran.

En kort gjennomgang: Utviklingen av AI-arbeidere

Før vi forstår den forestående revolusjonen, er det avgjørende å erkjenne den AI-drevne utviklingen som allerede har funnet sted.

  • Tradisjonelle datamaskinsystemer: Fra grunnleggende datamaskinalgoritmer, begynte reisen. Disse systemene kunne løse forhåndsdefinerte oppgaver ved hjelp av en fast sett med regler.
  • Chatboter og tidlige taleassistenter: Etterhvert som teknologien utviklet seg, gjorde også våre grensesnitt det. Verktøy som Siri, Cortana og tidlige chatboter forenklet bruker-AI-interaksjon, men hadde begrensede evner og forståelse.
  • Neurale nettverk og dyp læring: Neurale nettverk markerte et vendepunkt, og etterlignet menneskelige hjernefunksjoner og utviklet seg gjennom erfaring. Dyp læringsteknikker forbedret dette ytterligere, og muliggjorde sofistikert bilde- og talegjenkjenning.
  • Transformatorer og avanserte NLP-modeller: Introduksjonen av transformatorarkitekturer revolusjonerte NLP-landskapet. Systemer som ChatGPT fra OpenAI, BERT og T5 har muliggjort gjennombrudd i menneske-AI-kommunikasjon. Med deres dype forståelse av språk og kontekst, kan disse modellene holde meningsfulle samtaler, skrive innhold og svare på komplekse spørsmål med utenforliggende nøyaktighet.

Velkommen til AI-agenet: Mer enn bare en samtale

I dagens AI-landskap antydes det noe mer omfattende enn samtaleverktøy. AI-agenter, utenom bare samtalefunksjoner, kan nå utføre oppgaver, lære av sine omgivelser, ta beslutninger og sogar vise kreativitet. De er ikke bare svarer på spørsmål; de løser problemer.

Tradisjonelle programvaremodeller arbeidet etter en klar vei. Stakeholdere uttrykte et mål til programvareledere, som deretter designet en bestemt plan. Ingeniører ville utføre denne planen gjennom kode. Denne “arveparadigmen” av programvarefunksjonalitet var klar, og involverte en mengde menneskelige inngrep.

AI-agenter, derimot, opererer annerledes. En agent:

  1. Har mål det søker å oppnå.
  2. Kan interagere med sin omgivelse.
  3. Formulerer en plan basert på disse observasjonene for å oppnå målet.
  4. Tar nødvendige handling, justerer sin tilnærming basert på omgivelsens endrede tilstand.

Hva som virkelig skiller AI-agenter fra tradisjonelle modeller, er deres evne til å autonomt skape en steg-for-steg-plan for å realisere et mål. I essensen, mens tidligere programmereren ga planen, kan dagens AI-agenter tegne sin egen kurs.

Overveur et hverdags eksempel. I tradisjonell programvaredesign, ville et program varsle brukere om forfalte oppgaver basert på forhåndsdefinerte betingelser. Utviklerne ville sette disse betingelsene basert på spesifikasjoner gitt av produktlederen.

I AI-agenet-paradigmet, bestemmer agenet selv når og hvordan det skal varsle brukeren. Det vurderer omgivelsene (brukerens vaner, applikasjonsstaten) og bestemmer den beste kursen. Prosessen blir dermed mer dynamisk, mer i øyeblikket.

ChatGPT markerte et brudd med sin tradisjonelle bruk med integreringen av plugins, og muliggjorde det å hente ut eksterne verktøy for å utføre flere forespørsler. Det ble en tidlig manifestasjon av agentkonseptet. Hvis vi betrakter et enkelt eksempel: en bruker som spør om New York Citys vær, ChatGPT, som utnytter plugins, kunne interagere med en ekstern vær-API, tolke dataene og sogar korrigere kursen basert på svarene mottatt.

Gjeldende landskap for AI-agenter

Gjeldende landskap for AI-agenter

AI-agenter, inkludert Auto-GPT, AgentGPT og BabyAGI, er begynnelsen på en ny æra i det omfattende AI-universet. Mens ChatGPT populariserte Generativ AI ved å kreve menneskelig innputt, er visjonen bak AI-agenter å muliggjøre at AI kan fungere uavhengig, styre mot mål med liten eller ingen menneskelig innblanding. Denne transformative potensialet har blitt understreket av Auto-GPTs meteoriske oppstigning, som har samlet over 107 000 stjerner på GitHub innen bare seks uker etter lanseringen, en utenforliggende vekst sammenlignet med etablerte prosjekter som data science-pakken “pandas”.

AI-agenter vs. ChatGPT

Mange avanserte AI-agenter, som Auto-GPT og BabyAGI, utnytter GPT-arkitekturen. Deres primære fokus er å minimere behovet for menneskelig innblanding i AI-oppgavefullføring. Beskrivende termer som “GPT på en løkke” karakteriserer driften av modeller som AgentGPT og BabyAGI. De opererer i iterative sykluser for bedre å forstå brukerforespørsler og finjustere utdataene. Mens Auto-GPT presser grensene videre ved å inkorporere internetttilgang og kodeksekveringsevner, utvider det betydelig sin problemløsningsevne.

Innovasjoner i AI-agenter

  1. Langsiktig minne: Tradisjonelle LLM-er har begrensede minne, og holder bare de siste segmentene av interaksjoner. For omfattende oppgaver blir det avgjørende å huske hele samtalen eller tidligere samtaler. For å overvinne dette, har AI-agenter adoptert innlemmingsarbeidsflyter, og konverterer tekstlige samtaler til numeriske arrayer, og tilbyr en løsning på minnehensyn.
  2. Nettsøkeevner: For å holde seg oppdatert med nyheter, har Auto-GPT blitt utstyrt med nettleserevner, og utnytter Google (GOOGL ) Søke-API. Dette har ført til debatter innen AI-samfunnet om omfanget av en AIs kunnskap.
  3. Kodeksekvering: Utenom å generere kode, kan Auto-GPT også kjøre både shell- og Python-koder. Denne utenforliggende evnen muliggjør at den kan grensesnitt med andre programmer, og utvider dermed sin operative domene.

AI-AGENTER ARKITEKTUR AUTOGPT, AGENTGPT, LLM, MINNE OG mer

Diagrammet visualiserer arkitekturen til et AI-system drevet av et stort språkmodell og agenter.

  • Inndata: Systemet mottar data fra diverse kilder: direkte brukerforespørsler, strukturerte databaser, nettsider og sanntidsmiljøsensorer.
  • LLM & Agenter: I kjernen, prosesserer LLM-inndataene, og samarbeider med spesialiserte agenter som Auto-GPT for tankekjeding, AgentGPT for nettspesifikke oppgaver, BabyAGI for oppgavebestemte handlinger og HuggingGPT for teambasert prosessering.
  • Utdata: Når informasjonen er prosessert, blir den omformet til en brukervennlig format og deretter sendt til enheter som kan handle eller påvirke den ytre omgivelsen.
  • Minnekompnenter: Systemet beholder informasjon, både på en midlertidig og permanent basis, gjennom kortvarige cacheminner og langvarige databaser.
  • Miljø: Dette er den ytre verden, som påvirker sensorer og blir påvirket av systemets handlinger.

Avanserte AI-agenter: Auto-GPT, BabyAGI og mer

AutoGPT og AgentGPT

AutoGPT, en nyvinning lansert på GitHub i mars 2023, er en genial Python-basert applikasjon som utnytter kraften til GPT, OpenAIs transformative generative modell. Hva skiller Auto-GPT fra sine forgjengere, er dens autonomi – det er designet for å utføre oppgaver med minimal menneskelig veiledning og har den unike evnen til å selvinitiere forespørsler. Brukere må bare definere et overordnet mål, og AutoGPT lager de nødvendige forespørsler for å oppnå dette målet, og gjør det til et potensielt revolusjonerende skritt mot sannt artificial general intelligence (AGI).

Med funksjoner som spenner over internetttilkobling, minnehåndtering og fil lagringsmuligheter med GPT-3.5, er dette verktøyet dyktig til å håndtere et bredt spekter av oppgaver, fra konvensjonelle oppgaver som e-postkomposisjon til intrikate oppgaver som ville kreve mye mer menneskelig innblanding.

På den andre siden, AgentGPT, også bygget på GPT-rammeverket, er et brukerorientert grensesnitt som ikke krever omfattende kodekunnskaper for å sette opp og bruke. AgentGPT lar brukere definere AI-mål, som deretter deles inn i håndterbare oppgaver.

AgentGPT AI-AGENT LLM

AgentGPT UI

Videre utmerker AgentGPT seg med sin fleksibilitet. Det er ikke begrenset til å lage chatboter. Plattformen utvider sine evner til å lage diverse applikasjoner som Discord-roboter og integrerer også sammen med Auto-GPT. Denne tilnærmingen sikrer at selv de uten omfattende kodekunnskaper kan utføre oppgaver som fullstendig autonom kode, tekstgenerering, språkoversettelse og problemløsning.

LangChain er et rammeverk som kobler store språkmodeller (LLM-er) med diverse verktøy og utnytter agenter, ofte oppfattet som “Bots”, for å bestemme og utføre spesifikke oppgaver ved å velge det riktige verktøyet. Disse agentene integrerer sammen med eksterne ressurser, mens en vektor database i LangChain lagrer ustrukturert data, og muliggjør rask informasjonshenting for LLM-er.

BabyAGI

Deretter finnes BabyAGI, en forenklet, men kraftfull agent. For å forstå BabyAGIs evner, forestill deg en digital prosjektleder som autonomt skaper, organiserer og utfører oppgaver med skarpt fokus på gitt mål. Mens de fleste AI-drevne plattformer er begrenset av sin forhåndsdefinerte kunnskap, skiller BabyAGI seg ut med sin evne til å tilpasse seg og lære av erfaringer. Det har en dyptgående evne til å skjønne tilbakemeldinger og, som mennesker, basere beslutninger på prøving og feil.

Det som virkelig skiller BabyAGI fra andre, er ikke bare dens tilpasningsevne, men også dens evne til å kjøre kode for bestemte mål. Det skiller seg i komplekse domener som kryptohandelsroboter, robotikk og autonom kjøring, og gjør det til et fleksibelt verktøy i en mengde applikasjoner.

BABYAGI oppgave-drevet autonom agent

https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/

Prosessen kan deles inn i tre agenter:

  1. Utførelseagent: Hjertet av systemet, denne agenten utnytter OpenAIs API for oppgavebehandling. Gitt et mål og en oppgave, sender den en forespørsel til OpenAIs API og henter oppgaveutfall.
  2. Oppgave-oppbyggingagent: Denne funksjonen skaper nye oppgaver basert på tidligere resultater og nåværende mål. En forespørsel sendes til OpenAIs API, som deretter returnerer potensielle oppgaver, organisert som en liste med ordbøker.
  3. Oppgave-prioriteringagent: Den siste fasen innebærer å sekvensere oppgavene basert på prioritet. Denne agenten utnytter OpenAIs API for å omordne oppgaver, og sikrer at de viktigste oppgavene blir utført først.

I samarbeid med OpenAIs språkmodell, utnytter BabyAGI Pinecones evner for kontekstsentriske oppgaveresultatlagring og -henting.

Nedenfor er en demonstrasjon av BabyAGI ved hjelp av denne lenken.

For å begynne, må du ha en gyldig OpenAPI-nøkkel. For å lette tilgangen, har UI-en en innstillingsside hvor OpenAPI-nøkkelen kan angis. Hvis du ønsker å kontrollere kostnadene, husk å sette en grense for antall iterasjoner.

Når jeg hadde konfigurert applikasjonen, gjorde jeg et lite eksperiment. Jeg sendte en forespørsel til BabyAGI: “Lag en konsis tweet-tråd som fokuserer på reisen mot personlig vekst, og berører milepæler, utfordringer og den transformative kraften til kontinuerlig læring”.

BabyAGI svarte med en godt gjennomtenkt plan. Det var ikke bare en generisk mal, men en omfattende veikart som indikerte at den underliggende AI virkelig hadde forstått nyansene i forespørselen.

BABYAGI oppgave-drevet autonom agent

Deepnote AI Copilot

Deepnote AI Copilot endrer dynamikken til datautforskning i notatbøker. Men hva skiller det fra andre?

I kjernen, sikter Deepnote AI på å forbedre arbeidsflyten til dataforskere. Øyeblikket du gir en rudimentær instruks, sprang AI-en til liv, og utarbeider strategier, kjører SQL-forespørsler, visualiserer data med Python og presenterer funn i en artikulert måte.

En av Deepnote AIs styrker er dens omfattende forståelse av arbeidsplassen. Ved å forstå integrasjonsskjemaer og filsystemer, justerer den sine utførelseplaner perfekt med den organisatoriske konteksten, og sikrer at dens innsikter alltid er relevante.

AIs integrasjon med notatbøker skaper en unik tilbakemeldingsløkke. Den vurderer aktivt kodeutdata, og gjør den dyktig til selvkorreksjon, og sikrer at resultater er konsistente med fastsatte mål.

Deepnote AI skiller seg ut med sin transparente drift, og gir klare innsikter i prosessene. Intertwiningen av kode og utdata sikrer at dens handlinger alltid er ansvarlige og reproduserbare.

CAMEL

CAMEL er et rammeverk som sikter på å fremme samarbeid blant AI-agenter, med mål om effektiv oppgavefullføring med minimal menneskelig tilsyn.

CAMEL AI-AGENT

https://github.com/camel-ai/camel

Det deler sine operasjoner inn i to hovedagenter:

  • AI-brukeragenten legger frem instruksjoner.
  • AI-assistentagenten utfører oppgaver basert på de gitt direktivene.

En av CAMELs aspirasjoner er å avdekke kompleksiteten i AI-tenkning, og sikte på å optimalisere synergier mellom flere agenter. Med funksjoner som rollespill og opphavsforespørsler, sikrer det at AI-oppgaver harmonerer med menneskelige mål.

Westworld-simulering: Liv i AI

Utsprunget fra inspirasjoner som Unity-programvare og tilpasset i Python, er Westworld-simuleringen et sprang mot å simulere og optimalisere miljøer hvor flere AI-agenter interagerer, nesten som en digital samfunn.

Generative agenter

Generative agenter

Disse agentene er ikke bare digitale enheter. De simulerer troverdige menneskelige atferd, fra daglige rutiner til komplekse sosiale interaksjoner. Deres arkitektur utvider en stor språkmodell for å lagre erfaringer, reflektere over dem og anvende dem for dynamisk atferdsplanlegging.

Westworlds interaktive sandkasse-miljø, lignende The Sims, bringer til live en by befolket av generative agenter. Her kan brukere interagere, se og guide disse agentene gjennom dagen, og observere emergente atferd og komplekse sosiale dynamikker.

Westworld-simuleringen eksemplifiserer den harmoniske fusjonen av beregningskraft og menneskelige nyanser. Ved å blande store språkmodeller med dynamiske agent-simuleringer, tegner den en vei mot å skape AI-erfaringer som er slående ulike fra virkeligheten.

Konklusjon

AI-agenter kan være usedvanlig fleksible og former industrier, endrer arbeidsflyter og muliggjør bedrifter som tidligere syntes umulige. Men som alle banebrytende innovasjoner, er de ikke uten feil.

Mens de har kraften til å endre det digitale livets very fabric, kjemper disse agentene med visse utfordringer, noen av dem er innately menneskelige, som å forstå kontekst i nyanserte situasjoner eller å håndtere problemer som ligger utenfor deres trente datamengder.

I den neste artikkelen, vil vi dykke dyptere inn i AutoGPT og GPT Engineer, og undersøke hvordan man setter dem opp og bruker dem. Vi vil også utforske årsakene til at disse AI-agentene av og til feiler, som å bli fanget i løkker, blant andre problemer. Så bli med!

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.