AGI och framtidens AI
Stora åtgärdsmodeller (LAM): Nästa frontier inom AI-drivna interaktioner
För nästan ett år sedan förutspådde Mustafa Suleyman, medgrundare av DeepMind, att eran av generativ AI snart skulle ge vika för något mer interaktivt: system som kan utföra uppgifter genom att interagera med programvaruapplikationer och mänskliga resurser. Idag börjar vi se denna vision ta form med utvecklingen av Rabbit AI:s nya AI-drivna operativsystem, R1. Detta system har visat en imponerande förmåga att övervaka och imitera mänskliga interaktioner med applikationer. I hjärtat av R1 ligger den Stora åtgärdsmodellen (LAM), en avancerad AI-assistent som är skicklig på att förstå användaravsikter och utföra uppgifter på deras vägnar. Medan de tidigare var kända under andra termer som interaktiv AI och Stora agenter, vinner LAM-konceptet momentum som en viktig innovation inom AI-drivna interaktioner. Den här artikeln utforskar detaljerna i LAM, hur de skiljer sig från traditionella stora språkmodeller (LLM), introducerar Rabbit AI:s R1-system och tittar på hur Apple (AAPL ) rör sig mot en LAM-inspirerad approach. Den diskuterar också de potentiella användningarna av LAM och de utmaningar de står inför.
Att förstå Stora åtgärds- eller agentermodeller (LAM)
En LAM är en avancerad AI-agent som är utformad för att förstå mänskliga avsikter och utföra specifika mål. Dessa modeller utmärker sig i att förstå mänskliga behov, planera komplexa uppgifter och interagera med olika modeller, applikationer eller människor för att utföra sina planer. LAM går utöver enkla AI-uppgifter som att generera svar eller bilder; de är fullständiga system som är utformade för att hantera komplexa aktiviteter som att planera resor, schemalägga möten och hantera e-post. Till exempel i reseplanering skulle en LAM samordna med en väderapp för prognoser, interagera med flygbokningstjänster för att hitta lämpliga flyg och engagera sig med hotellbokningssystem för att säkra boende. Till skillnad från många traditionella AI-modeller som enbart förlitar sig på neurala nätverk, använder LAM en hybridansats som kombinerar neuro-symbolisk programmering. Denna integration av symbolisk programmering hjälper till logiskt resonemang och planering, medan neurala nätverk bidrar till att känna igen komplexa sensoriska mönster. Denna blandning gör det möjligt för LAM att hantera en bred spektrum av uppgifter, vilket markerar dem som en nyanserad utveckling inom AI-drivna interaktioner.
Jämföra LAM med LLM
I kontrast till LAM, är LLM AI-agenter som excellerar i att tolka användarprompt och generera textbaserade svar, vilket främst hjälper till med uppgifter som involverar språkbehandling. Deras omfång är vanligtvis begränsat till textrelaterade aktiviteter. Å andra sidan utvidgar LAM AI-kapaciteterna bortom språk, vilket möjliggör för dem att utföra komplexa åtgärder för att uppnå specifika mål. Till exempel, medan en LLM effektivt kan utarbeta ett e-postmeddelande baserat på användarinstruktioner, går LAM längre genom att inte bara utarbeta utan också förstå sammanhanget, fatta beslut om lämpligt svar och hantera leveransen av e-postmeddelandet.
LAM i aktion: Kaninen R1
Rabbit R1 står som ett primärt exempel på LAM i praktisk användning. Detta AI-drivna enhet kan hantera flera applikationer genom ett enda, användarvänligt gränssnitt. Utrustad med en 2,88-tums pekskärm, en roterande kamera och en scrollhjul, är R1 inrymt i ett snyggt, rundat chassi som är utformat i samarbete med Teenage Engineering. Det fungerar på en 2,3 GHz MediaTek-processor, förstärkt med 4 GB minne och 128 GB lagring.
I hjärtat av R1 ligger dess LAM, som intelligently övervakar app-funktioner och förenklar komplexa uppgifter som att kontrollera musik, boka transporter, beställa livsmedel och skicka meddelanden, allt från en enda interaktionspunkt. Detta sätt eliminerar R1 besväret med att växla mellan flera appar eller flera inloggningar för att utföra dessa uppgifter.
LAM i R1 tränades initialt genom att observera mänskliga interaktioner med populära appar som Spotify och Uber. Denna utbildning har möjliggjort för LAM att navigera användargränssnitt, känna igen ikoner och bearbeta transaktioner. Denna omfattande utbildning möjliggör för R1 att anpassa sig smidigt till i princip vilken applikation som helst. Dessutom tillåter en särskild träningsläge användare att introducera och automatisera nya uppgifter, vilket kontinuerligt utvidgar R1:s omfång av funktioner och gör det till ett dynamiskt verktyg inom AI-drivna interaktioner.
Apples framsteg mot LAM-inspirerade funktioner i Siri
Apples AI-forskningsgrupp har nyligen delat insikter om sina ansträngningar att förbättra Siris funktioner genom en ny initiativ, liknande de som observeras i LAM. Initiativet, som presenteras i en forskningsartikel om “Reference Resolution As Language Modeling” (ReALM), syftar till att förbättra Siris förmåga att förstå konversationskontext, bearbeta visuellt innehåll på skärmen och upptäcka omgivande aktiviteter. Tillvägagångssättet som ReALM antar för att hantera användargränssnittsinput (UI) liknar de funktioner som observeras i Rabbit AI:s R1, vilket visar Apples avsikt att förbättra Siris förståelse av användarinteraktioner.
Denna utveckling indikerar att Apple överväger att anta LAM-teknologier för att finslipa hur användare interagerar med sina enheter. Även om det inte finns några uttryckliga tillkännagivanden om ReALM:s distribution, antyder potentialen för att avsevärt förbättra Siris interaktion med appar en lovande utveckling mot mer intuitiva och responsiva assistenter.
Potentiella tillämpningar av LAM
LAM har potentialen att utöka sin påverkan långt bortom förbättring av interaktioner mellan användare och enheter; de kan ge betydande fördelar inom flera branscher.
- Kundtjänst: LAM kan förbättra kundtjänsten genom att oberoende hantera förfrågningar och klagomål över olika kanaler. Dessa modeller kan bearbeta frågor med hjälp av naturligt språk, automatisera lösningar och hantera schemaläggning, vilket ger personlig service baserat på kundhistorik för att förbättra tillfredsställelsen.
- Hälsovård: Inom hälsovården kan LAM hjälpa till att hantera patientvård genom att organisera möten, hantera recept och underlätta kommunikation över tjänster. De är också användbara för fjärrövervakning, tolkning av medicinska data och varning av personal i nödsituationer, särskilt fördelaktigt för kronisk och äldreomsorg.
- Finans: LAM kan erbjuda personlig finansiell rådgivning och hantera uppgifter som portföljbalansering och investeringsförslag. De kan också övervaka transaktioner för att upptäcka och förhindra bedrägeri, integrerat med banksystem för att snabbt hantera misstänkta aktiviteter.
Utmaningar för LAM
Trots deras betydande potential möter LAM flera utmaningar som måste hanteras.
- Dataskydd och säkerhet: Med tanke på den breda tillgången till personlig och känslig information som LAM behöver för att fungera, är säkerställande av dataskydd och säkerhet en stor utmaning. LAM interagerar med personlig data över flera applikationer och plattformar, vilket väcker frågor om den säkra hanteringen, lagringen och bearbetningen av denna information.
- Etiska och regulatoriska problem: När LAM tar på sig mer autonoma roller i beslutsfattande och interaktion med mänskliga miljöer, blir etiska överväganden allt viktigare. Frågor om ansvar, transparens och den utsträckning som beslutsfattandet delegeras till maskiner är kritiska. Dessutom kan det finnas regulatoriska utmaningar i att distribuera sådana avancerade AI-system över olika branscher.
- Integreringskomplexitet: LAM kräver integration med en mängd olika programvaru- och hårdvarusystem för att utföra uppgifter effektivt. Denna integration är komplex och kan vara svår att hantera, särskilt när man samordnar åtgärder över olika plattformar och tjänster, som att boka flyg, boende och andra logistiska detaljer i realtid.
- Skalbarhet och anpassningsförmåga: Medan LAM är utformade för att anpassa sig till en mängd olika scenarier och applikationer, kvarstår utmaningen att skala dessa lösningar för att hantera olika, realvärldsmiljöer konsekvent och effektivt. Att säkerställa att LAM kan anpassa sig till förändrade förhållanden och upprätthålla prestanda över olika uppgifter och användarbehov är avgörande för deras långsiktiga framgång.
Slutsatsen
Stora åtgärdsmodeller (LAM) är en betydande innovation inom AI, som påverkar inte bara enhetsinteraktioner utan också bredare branschapplikationer. Demonstrerat av Rabbit AI:s R1 och utforskat i Apples framsteg med Siri, är LAM på väg att skapa scenen för mer interaktiva och intuitiva AI-system. Dessa modeller är redo att förbättra effektivitet och personlig anpassning över sektorer som kundtjänst, hälsovård och finans.
Men distributionen av LAM kommer med utmaningar, inklusive dataskyddsproblem, etiska frågor, integreringskomplexitet och skalbarhet. Att hantera dessa frågor är avgörande när vi går vidare mot en bredare antagande av LAM-teknologier, med målet att utnyttja deras kapaciteter på ett ansvarsfullt och effektivt sätt. När LAM fortsätter att utvecklas, kvarstår deras potential att omvandla digitala interaktioner som betydande, vilket understryker deras betydelse i framtiden för AI.












