AGI og fremtidens AI

Store Handlingmodeller (LAMs): Den Næste Frontier i AI-Drevet Interaktion

mm
Føj Unite.AI til dine foretrukne kilder på Google

Knapt et år siden forudsagde Mustafa Suleyman, medstifter af DeepMind, at æraen for generativ AI snart ville give plads til noget mere interaktivt: systemer i stand til at udføre opgaver ved at interagere med softwareapplikationer og menneskelige ressourcer. I dag begynder vi at se denne vision tage form med udviklingen af Rabbit AI’s nye AI-drevne operativsystem, R1. Dette system har demonstreret en imponerende evne til at overvåge og efterligne menneskelig interaktion med applikationer. I hjertet af R1 ligger den Store Handlingmodel (LAM), en avanceret AI-assistent, der er dygtig til at forstå brugerens intentioner og udføre opgaver på deres vegne. Mens LAMs tidligere var kendt under andre betegnelser som interaktiv AI og Store Agensmodeller, vinder LAM-konceptet momentum som en afgørende innovation i AI-drevne interaktioner. Denne artikel udforsker detaljerne om LAMs, hvordan de adskiller sig fra traditionelle sprogmodeller, introducerer Rabbit AI’s R1-system og ser på, hvordan Apple (AAPL ) bevæger sig mod en LAM-lignende tilgang. Den diskuterer også de potentielle anvendelser af LAMs og de udfordringer, de står over for.

Forståelse af Store Handling- eller Agensmodeller (LAMs)

En LAM er en avanceret AI-agent, der er designet til at forstå menneskelige intentioner og udføre specifikke mål. Disse modeller excellerer i at forstå menneskelige behov, planlægge komplekse opgaver og interagere med forskellige modeller, applikationer eller mennesker for at udføre deres planer. LAMs går ud over simple AI-opgaver som generering af svar eller billeder; de er fuldt udbyggede systemer designet til at håndtere komplekse aktiviteter som planlægning af rejser, planlægning af møder og håndtering af e-mails. For eksempel i rejseplanlægning ville en LAM koordinere med en vejrapp for vejrforskydninger, interagere med flyselskaber for at finde passende fly og engagere med hotelbookingssystemer for at sikre overnatning. I modsætning til mange traditionelle AI-modeller, der afhænger af neurale netværk, anvender LAMs en hybridtilgang, der kombinerer neuro-symbolisk programmering. Denne integration af symbolisk programmering hjælper med logisk resonnering og planlægning, mens neurale netværk bidrager til at genkende komplekse sensoriske mønstre. Denne blanding giver LAMs mulighed for at tackle et bredt spektrum af opgaver, hvilket markerer dem som en nuanceret udvikling i AI-drevne interaktioner.

Sammenligning af LAMs med LLMs

I modsætning til LAMs er LLMs AI-agenter, der excellerer i at fortolke brugerprompter og generere tekstbaserede svar, og hjælper primært med opgaver, der involverer sprogbehandling. Deres rækkevidde er dog generelt begrænset til tekstrelaterede aktiviteter. På den anden side udvider LAMs AI-kapaciteterne ud over sprog, og giver dem mulighed for at udføre komplekse handlinger for at opnå specifikke mål. For eksempel, mens en LLM effektivt kan udarbejde en e-mail baseret på brugerens instruktioner, går en LAM videre ved ikke kun at udarbejde, men også at forstå konteksten, beslutte om den passende respons og håndtere leveringen af e-mailen.

LAMs i Praksis: Rabbit R1

Rabbit R1 er et primært eksempel på LAMs i praktisk brug. Dette AI-drevne enhed kan håndtere multiple applikationer gennem en enkelt, brugervenlig interface. Udstyret med en 2,88-tommer touchscreen, en roterende kamera og en scrollhjul, er R1 indkapslet i en slank, afrundet chassis udviklet i samarbejde med Teenage Engineering. Det kører på en 2,3 GHz MediaTek processor, understøttet af 4 GB hukommelse og 128 GB lagring.

I hjertet af R1 ligger dens LAM, der intelligently overvåger app-funktionaliteter og simplificerer komplekse opgaver som kontrol af musik, booking af transport, bestilling af mad og afsendelse af beskeder, alt fra et enkelt interaktionspunkt. Dette eliminerer besværet med at skifte mellem multiple apps eller multiple logins for at udføre disse opgaver.

LAM’en i R1 blev initialt trænet ved at observere menneskelig interaktion med populære apps som Spotify og Uber. Denne træning har gjort det muligt for LAM at navigere i brugergrænseflader, genkende ikoner og behandle transaktioner. Denne omfattende træning giver R1 mulighed for at tilpasse sig flydende til næsten enhver applikation. Desuden giver en special træningsmode brugerne mulighed for at introducere og automatisere nye opgaver, hvilket kontinuerligt udvider R1’s rækkevidde af muligheder og gør det til et dynamisk værktøj i området for AI-drevne interaktioner.

Apples Fremgang mod LAM-Inspirerede Kapaciteter i Siri

Apples AI-forskningshold har nyligt delt indsigt i deres bestræbelser på at udvikle Siris kapaciteter gennem en ny initiativ, der ligner LAMs. Initiativet, der er opsummeret i en forskningsrapport om Reference Resolution As Language Modeling (ReALM), sigter mod at forbedre Siris evne til at forstå konversationskontekst, behandle visuelt indhold på skærmen og detektere omgivende aktiviteter. Tilgangen, der er valgt i ReALM til at håndtere brugergrænseflade-input, ligner funktionerne, der observeres i Rabbit AI’s R1, og viser Apples intention om at forbedre Siris forståelse af brugerinteraktioner.

Denne udvikling indikerer, at Apple overvejer at adoptere LAM-teknologier for at forfine, hvordan brugerne interagerer med deres enheder. Selv om der ikke er nogen eksplisitte meddelelser om implementeringen af ReALM, antyder potentialet for at betydeligt forbedre Siris interaktion med apps, at der er lovende fremskridt i at gøre assistenten mere intuitiv og responsiv.

Potentielle Anvendelser af LAMs

LAMs har potentialet til at udvide deres indflydelse langt ud over at forbedre interaktioner mellem brugere og enheder; de kunne give betydelige fordele på tværs af multiple industrier.   

  • Kundeservice: LAMs kan forbedre kundeservice ved at håndtere forespørgsler og klager på tværs af forskellige kanaler. Disse modeller kan behandle forespørgsler ved hjælp af naturligt sprog, automatisere løsninger og håndtere planlægning, og give personlig service baseret på kundens historie for at forbedre tilfredshed.
  • Sundhedsvesen: I sundhedsvesenet kan LAMs hjælpe med at håndtere patientpleje ved at organisere møder, håndtere recepter og faciliterer kommunikation på tværs af tjenester. De er også nyttige til fjernovervågning, fortolkning af medicinsk data og alarm til personale i nødsituationer, især til kronisk og ældrepleje.
  • Finans: LAMs kan tilbyde personlig finansielle råd og håndtere opgaver som portefølje-balancering og investeringsforslag. De kan også overvåge transaktioner for at detektere og forhindre svindel, og integrere sammen med bank-systemer for at hurtigt håndtere mistænkelige aktiviteter.

Udfordringer for LAMs

Trods deres betydelige potentiale, møder LAMs flere udfordringer, der skal løses.

  • Dataprotektion og Sikkerhed: Givet den brede adgang til personlige og følsomme oplysninger, som LAMs behøver for at fungere, er sikring af dataprotektion og sikkerhed en større udfordring. LAMs interagerer med personlige oplysninger på tværs af multiple applikationer og platforme, hvilket rejser bekymringer om den sikre håndtering, lagring og behandling af disse oplysninger.
  • Ethiske og Reguleringsmæssige Bekymringer: Da LAMs overtager mere autonome roller i beslutningstagning og interaktion med menneskelige miljøer, bliver etiske overvejelser stadig mere vigtige. Spørgsmål om ansvarlighed, gennemsigtighed og omfanget af beslutningstagning, der overdrages til maskiner, er kritiske. Der kan også være reguleringsmæssige udfordringer i at implementere sådanne avancerede AI-systemer på tværs af forskellige industrier.
  • Kompleksitet af Integration: LAMs kræver integration med en række software- og hardware-systemer for at udføre opgaver effektivt. Denne integration er kompleks og kan være svær at håndtere, især når det handler om at koordinere handlinger på tværs af forskellige platforme og tjenester, såsom booking af fly, overnatning og andre logistiske detaljer i realtid.
  • Skalbarhed og Tilpasningsevne: Mens LAMs er designet til at tilpasse sig en bred vifte af scenarier og applikationer, er det en udfordring at skale disse løsninger til at håndtere diverse, virkelige miljøer konsekvent og effektivt. Det er afgørende at sikre, at LAMs kan tilpasse sig til ændrede forhold og opretholde præstationen på tværs af forskellige opgaver og brugerbehov.

Det Er Det:

Store Handlingmodeller (LAMs) er en vigtig innovation i AI, der ikke kun påvirker enhedsinteraktioner, men også bredere industrielle anvendelser. Demonstreret af Rabbit AI’s R1 og udforsket i Apples fremgang med Siri, er LAMs ved at sætte scenen for mere interaktive og intuitive AI-systemer. Disse modeller er parat til at forbedre effektivitet og personliggørelse på tværs af sektorer som kundeservice, sundhedsvesen og finans.

Men implementeringen af LAMs kommer med udfordringer, herunder dataprotektionsbekymringer, etiske spørgsmål, integrationskompleksitet og skalbarhed. Det er essentielt at løse disse problemer, mens vi går frem mod en bredere implementering af LAM-teknologier, med det formål at udnytte deres kapaciteter ansvarligt og effektivt. Da LAMs fortsætter med at udvikle sig, er deres potentiale til at transformere digitale interaktioner betydeligt, hvilket understreger deres betydning i fremtidens AI-landskab.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.