AGI og fremtidens AI

Store Handlingmodeller (LAMs): Den Neste Fronten i AI-Drevne Interaksjoner

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Nesten ett år siden forutså Mustafa Suleyman, medgrunnlegger av DeepMind, at epoken med generativ AI snart ville gi plass til noe mer interaktivt: systemer i stand til å utføre oppgaver ved å samhandle med programvareapplikasjoner og menneskelige ressurser. I dag begynner vi å se denne visjonen ta form med utviklingen av Rabbit AI’s nye AI-drevne operativsystem, R1. Dette systemet har vist en imponerende evne til å overvåke og etterligne menneskelige interaksjoner med applikasjoner. I hjertet av R1 ligger den store handlingmodellen (LAM), en avansert AI-assistent dyktig til å forstå brukerens intensjoner og utføre oppgaver på deres vegne. Mens de tidligere var kjent under andre betegnelser som interaktiv AI og store agente modeller, vinner LAM-konseptet frem som en avgjørende innovasjon i AI-drevne interaksjoner. Denne artikkelen utforsker detaljene om LAMs, hvordan de skiller seg fra tradisjonelle store språkmodeller (LLMs), presenterer Rabbit AI’s R1-system og ser på hvordan Apple (AAPL ) beveger seg mot en LAM-inspirert tilnærming. Den diskuterer også de potensielle anvendelsene av LAMs og utfordringene de møter.

Forståelse av Store Handling- eller Agente Modeller (LAMs)

En LAM er en avansert AI-agent konstruert for å fatte menneskelige intensjoner og utføre spesifikke mål. Disse modellene utmerker seg ved å forstå menneskelige behov, planlegge komplekse oppgaver og samhandle med ulike modeller, applikasjoner eller mennesker for å utføre planene. LAMs går langt utenfor enkle AI-oppgaver som å generere svar eller bilder; de er fullstendige systemer designet for å håndtere komplekse aktiviter som reiseplanlegging, timeplanlegging og e-posthåndtering. For eksempel, i reiseplanlegging, ville en LAM samhandle med en værapp for å få værvarsel, samhandle med flybillettbestillingstjenester for å finne passende fly og samhandle med hotellbestillingssystemer for å sikre overnatting. I motsetning til mange tradisjonelle AI-modeller som bare avhenger av neurale nettverk, bruker LAMs en hybridtilnærming som kombinerer neuro-symbolisk programmering. Denne integreringen av symbolisk programmering hjelper med logisk resonnering og planlegging, mens neurale nettverk bidrar til å gjenkjenne komplekse sansemønstre. Denne blandingen gjør det mulig for LAMs å håndtere et bredt spekter av oppgaver, og markerer dem som en nyansert utvikling i AI-drevne interaksjoner.

Sammenligning av LAMs med LLMs

I motsetning til LAMs er LLMs AI-agenter som utmerker seg ved å tolke brukerforespørsler og generere tekstbaserte svar, og assisterer hovedsakelig med oppgaver som involverer språkbehandling. Deres omfang er imidlertid vanligvis begrenset til tekstrelaterte aktiviter. På den andre siden, utvider LAMs AI-kapasiteten beyond språk, og gjør det mulig for dem å utføre komplekse handlinger for å oppnå spesifikke mål. For eksempel, mens en LLM effektivt kan utarbeide en e-post basert på brukerinstruksjoner, går en LAM videre ved ikke bare å utarbeide, men også å forstå konteksten, bestemme den passende responsen og håndtere leveringen av e-posten.

LAMs i Handling: Rabbit R1

Rabbit R1 står som et primært eksempel på LAMs i praktisk bruk. Dette AI-drevne enheten kan håndtere multiple applikasjoner gjennom et enkelt, brukervennlig grensesnitt. Utstyrt med en 2,88-tommers berøringsskjem, en roterende kamera og en rullehjul, er R1 huset i en strømlinjeformet, avrundet chassis konstruert i samarbeid med Teenage Engineering. Den opererer på en 2,3 GHz MediaTek-prosessor, forsterket av 4 GB minne og 128 GB lagring.

I hjertet av R1 ligger dens LAM, som intelligently overvåker app-funksjoner og forenkler komplekse oppgaver som å kontrollere musikk, bestille transport, bestille matvarer og sende meldinger, alt fra ett enkelt punkt for interaksjon. Denne måten eliminerer R1 besværet med å bytte mellom multiple applikasjoner eller multiple innlogginger for å utføre disse oppgavene.

LAM-en i R1 ble initialt trent ved å observere menneskelige interaksjoner med populære apper som Spotify og Uber. Denne treningen har gjort det mulig for LAM å navigere i brukergrensesnitt, gjenkjenne ikoner og prosessere transaksjoner. Denne omfattende treningen gjør det mulig for R1 å tilpasse seg flytende til nesten enhver applikasjon. I tillegg tillater en spesiell treningsmodus brukerne å introdusere og automatisere nye oppgaver, og kontinuerlig utvide R1s rekkevidde av funksjoner, og gjør det til et dynamisk verktøy i området AI-drevne interaksjoner.

Apples Fremgang Mot LAM-Inspirerte Kapasiteter i Siri

Apples AI-forskningsgruppe har nylig delt sine innsikter i sine bestrebelser for å forbedre Siris kapasiteter gjennom en ny initiativ, lignende de til LAMs. Initiativet, som er beskrevet i en forskningsartikkel om Reference Resolution As Language Modeling (ReALM), har som mål å forbedre Siris evne til å forstå konversasjonskontekst, prosessere visuell innhold på skjermen og detektere omgivelsesaktiviteter. Tilnærmingen som er valgt i ReALM for å håndtere brukergrensesnitt (UI)-inndata trekker paralleller til funksjonene som observeres i Rabbit AI’s R1, og viser Apples intensjon om å forbedre Siris forståelse av brukerinteraksjoner.

Dette utviklingen indikerer at Apple vurdere å adoptere LAM-teknologier for å forfine hvordan brukerne samhandler med sine enheter. Selv om det ikke er noen eksplisitte kunngjøringer om implementeringen av ReALM, antyder potensialet for å betydelig forbedre Siris interaksjon med apper en lovende fremgang i å gjøre assistenten mer intuitiv og responsiv.

Potensielle Anvendelser av LAMs

LAMs har potensialet til å utvide sin innvirkning langt beyond å forbedre interaksjoner mellom brukere og enheter; de kan gi betydelige fordeler over flere industrier.

  • Kundeservice: LAMs kan forbedre kundeservicen ved å uavhengig håndtere forespørsler og klager over forskjellige kanaler. Disse modellene kan prosessere spørsmål ved hjelp av naturlig språk, automatisere løsninger og håndtere planlegging, og gi personlig service basert på kundehistorikk for å forbedre tilfredsheten.
  • Helsevesen: I helsevesenet kan LAMs hjelpe med å håndtere pasientpleie ved å organisere møter, håndtere resepter og fasilitere kommunikasjon over tjenester. De er også nyttige for fjernovervåking, tolkning av medisinske data og å varsle ansatte i nødsituasjoner, spesielt gunstig for kronisk og eldreomsorg.
  • Finans: LAMs kan tilby personlig finansiell rådgivning og håndtere oppgaver som porteføljebalanse og investeringsforslag. De kan også overvåke transaksjoner for å detektere og forebygge svindel, og integrere sømløst med banksystemer for å raskt håndtere mistenkelige aktiviteter.

Utfordringer for LAMs

Til tross for deres betydelige potensial, møter LAMs flere utfordringer som må håndteres.

  • Data Personvern og Sikkerhet: Gitt den brede tilgangen til personlige og sensitive opplysninger LAMs trenger for å fungere, er sikring av data personvern og sikkerhet en stor utfordring. LAMs samhandler med personlige data over flere applikasjoner og plattformer, og dette gir bekymringer om sikker håndtering, lagring og prosessering av disse opplysningene.
  • Etiske og Reguleringsmessige Bekymringer: Ettersom LAMs tar på seg mer autonome roller i beslutningstaking og samhandling med menneskelige miljøer, blir etiske overveielser stadig viktigere. Spørsmål om ansvar, gjennomsiktighet og omfang av beslutningstagning delegert til maskiner er kritiske. I tillegg kan det være reguleringsmessige utfordringer ved å deployere slike avanserte AI-systemer over flere industrier.
  • Kompleksitet av Integrering: LAMs krever integrering med en rekke programvare- og maskinvarusystemer for å utføre oppgaver effektivt. Denne integreringen er kompleks og kan være vanskelig å håndtere, spesielt når koordinering av handlinger over forskjellige plattformer og tjenester, som å bestille fly, overnatting og andre logistiske detaljer i sanntid.
  • Skalbarhet og Tilpasningsevne: Mens LAMs er designet for å tilpasse seg en rekke scenarioer og applikasjoner, å skale disse løsningene for å håndtere diverse, sanntidsmiljøer jevnt og effektivt, er en utfordring. Å sikre at LAMs kan tilpasse seg endrede forhold og opprettholde ytelse over forskjellige oppgaver og brukerbehov er avgjørende for deres langsiktige suksess.

Det Endelige Punktet

Store Handlingmodeller (LAMs) er i ferd med å bli en betydelig innovasjon i AI, som påvirker ikke bare enhetsinteraksjoner, men også bredere industrielle anvendelser. Demonstrert av Rabbit AI’s R1 og utforsket i Apples fremgang med Siri, setter LAMs scenen for mer interaktive og intuitive AI-systemer. Disse modellene er i stand til å forbedre effektivitet og personlig tilpasning over sektorer som kundeservice, helsevesen og finans.

Likevel, deployeringen av LAMs kommer med utfordringer, inkludert data personvern, etiske problemer, integreringskompleksitet og skalbarhet. Å håndtere disse problemene er essensielt mens vi går mot en bredere aksept av LAM-teknologier, med mål om å utnytte deres kapasiteter ansvarlig og effektivt. Mens LAMs fortsetter å utvikle seg, er deres potensial til å transformere digitale interaksjoner betydelig, og understreker deres betydning i fremtidens AI-landskap.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.