AGI en toekomstige AI

Grote Actiemodellen (LAM’s): De Volgende Frontier in AI-Gestuurde Interactie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Bijna een jaar geleden voorspelde Mustafa Suleyman, mede-oprichter van DeepMind, dat de era van generatieve AI binnenkort zou plaatsmaken voor iets interactievers: systemen die taken kunnen uitvoeren door te communiceren met softwaretoepassingen en menselijke bronnen. Vandaag zien we deze visie vorm krijgen met de ontwikkeling van Rabbit AI’s nieuwe AI-gebaseerde besturingssysteem, R1. Dit systeem heeft een indrukwekkende capaciteit aangetoond om menselijke interacties met toepassingen te monitoren en te imiteren. Aan het hart van R1 ligt de Grote Actiemodel (LAM), een geavanceerde AI-assistent die bedreven is in het begrijpen van gebruikersintenties en het uitvoeren van taken namens hen. Terwijl LAM’s eerder bekend stonden onder andere namen zoals Interactieve AI en Grote Agente Modellen, wint het concept van LAM’s aan populariteit als een cruciale innovatie in AI-gebaseerde interacties. Dit artikel verkent de details van LAM’s, hoe ze verschillen van traditionele grote taalmodellen (LLM’s), introduceert Rabbit AI’s R1-systeem en kijkt naar hoe Apple (AAPL ) een soortgelijke benadering volgt. Het bespreekt ook de potentiële toepassingen van LAM’s en de uitdagingen waar ze mee te maken krijgen.

Begrijpen van Grote Actie- of Agente Modellen (LAM’s)

Een LAM is een geavanceerde AI-agent die ontworpen is om menselijke intenties te begrijpen en specifieke doelen te bereiken. Deze modellen excelleren in het begrijpen van menselijke behoeften, complexe taken plannen en communiceren met verschillende modellen, toepassingen of mensen om hun plannen uit te voeren. LAM’s gaan verder dan eenvoudige AI-taken zoals het genereren van antwoorden of afbeeldingen; ze zijn complete systemen die ontworpen zijn om complexe activiteiten te behandelen zoals reizen plannen, afspraken inplannen en e-mails beheren. Bijvoorbeeld, bij reisplanning, zou een LAM samenwerken met een weersapp voor voorspellingen, communiceren met vluchtboekingdiensten om geschikte vluchten te vinden en interactie hebben met hotelboekingssystemen om accommodaties te garanderen. In tegenstelling tot veel traditionele AI-modellen die uitsluitend afhankelijk zijn van neurale netwerken, gebruiken LAM’s een hybride benadering die neuro-symbolische programmering combineert. Deze integratie van symbolische programmering helpt bij logisch redeneren en plannen, terwijl neurale netwerken bijdragen aan het herkennen van complexe sensorische patronen. Deze combinatie stelt LAM’s in staat om een breed spectrum van taken aan te pakken, waarmee ze een verfijnde ontwikkeling zijn in AI-gebaseerde interacties.

Vergelijking van LAM’s met LLM’s

In tegenstelling tot LAM’s, zijn LLM’s AI-agenten die excelleren in het interpreteren van gebruikersprompts en het genereren van tekstgebaseerde antwoorden, waarbij ze voornamelijk helpen bij taken die taalverwerking betreffen. Hun reikwijdte is echter over het algemeen beperkt tot tekstgerelateerde activiteiten. Aan de andere kant, breiden LAM’s de capaciteiten van AI uit voorbij taal, waardoor ze complexe acties kunnen uitvoeren om specifieke doelen te bereiken. Bijvoorbeeld, terwijl een LLM effectief een e-mail kan opstellen op basis van gebruikersinstructies, gaat een LAM verder door niet alleen te schrijven maar ook de context te begrijpen, te beslissen over het passende antwoord en de levering van de e-mail te beheren.

Bovendien zijn LLM’s meestal ontworpen om het volgende token in een reeks tekst te voorspellen en geschreven instructies uit te voeren. In tegenstelling, zijn LAM’s uitgerust met niet alleen taalbegrip maar ook met de capaciteit om te communiceren met verschillende toepassingen en echte wereldsystemen zoals IoT-apparaten. Ze kunnen fysieke acties uitvoeren, apparaten controleren en taken beheren die interactie met de externe omgeving vereisen, zoals het inplannen van afspraken of het maken van reserveringen. Deze integratie van taalvaardigheden met praktische uitvoering stelt LAM’s in staat om te opereren in meer diverse scenario’s dan LLM’s.

LAM’s in Actie: De Rabbit R1

De Rabbit R1 is een voorbeeld van LAM’s in praktisch gebruik. Dit AI-gebaseerde apparaat kan meerdere toepassingen beheren via een enkele, gebruikersvriendelijke interface. Uitgerust met een 2,88-inch touchscreen, een roterende camera en een scrollwiel, is de R1 gehuisvest in een stijlvol, afgerond chassis dat in samenwerking met Teenage Engineering is ontworpen. Het werkt op een 2,3 GHz MediaTek-processor, ondersteund door 4 GB geheugen en 128 GB opslag.

Aan het hart van de R1 ligt zijn LAM, die intelligent toezicht houdt op app-functionaliteiten en complexe taken zoals het controleren van muziek, het inplannen van transport, het bestellen van boodschappen en het verzenden van berichten, allemaal vanuit een enkel punt van interactie. Op deze manier elimineert de R1 de moeite van het schakelen tussen meerdere apps of meerdere inloggen om deze taken uit te voeren.

De LAM in de R1 werd aanvankelijk getraind door menselijke interacties met populaire apps zoals Spotify en Uber te observeren. Deze training heeft het mogelijk gemaakt voor de LAM om gebruikersinterfaces te navigeren, pictogrammen te herkennen en transacties te verwerken. Deze uitgebreide training stelt de R1 in staat om soepel aan te passen aan vrijwel elke toepassing. Bovendien biedt een speciale trainingsmodus gebruikers de mogelijkheid om nieuwe taken in te voeren en te automatiseren, waardoor de R1’s reikwijdte van capaciteiten continu wordt uitgebreid en het een dynamisch instrument maakt in het domein van AI-gebaseerde interacties.

Apple’s Vooruitgang naar LAM-Geïnspireerde Capaciteiten in Siri

Apple’s AI-onderzoeksteam heeft onlangs inzichten gedeeld in hun inspanningen om Siri’s capaciteiten te verbeteren via een nieuw initiatief, dat lijkt op die van LAM’s. Het initiatief, uiteengezet in een onderzoeksartikel over Referentie Resolutie als Taal Modellering (ReALM), heeft tot doel Siri’s vermogen te verbeteren om conversatiecontext te begrijpen, visuele inhoud op het scherm te verwerken en omgevingsactiviteiten te detecteren. De aanpak die ReALM hanteert bij het omgaan met gebruikersinterface (UI)-invoer trekt parallellen met de functionaliteiten die worden waargenomen in Rabbit AI’s R1, waaruit blijkt dat Apple van plan is om Siri’s begrip van gebruikersinteracties te verbeteren.

Deze ontwikkeling geeft aan dat Apple overweegt om LAM-technologieën te adopteren om de manier waarop gebruikers met hun apparaten communiceren te verfijnen. Hoewel er geen expliciete aankondigingen zijn over de implementatie van ReALM, suggereert het potentieel om Siri’s interactie met apps aanzienlijk te verbeteren, veelbelovende vooruitgang in het maken van de assistent meer intuïtief en responsief.

Potentiële Toepassingen van LAM’s

LAM’s hebben het potentieel om hun impact verder uit te breiden dan het verbeteren van interacties tussen gebruikers en apparaten; ze kunnen aanzienlijke voordelen bieden in meerdere industrieën.

  • Klantenservice: LAM’s kunnen klantenservice verbeteren door onafhankelijk vragen en klachten te behandelen via verschillende kanalen. Deze modellen kunnen vragen verwerken met behulp van natuurlijke taal, oplossingen automatiseren en planning beheren, waardoor ze persoonlijke service kunnen bieden op basis van klantgeschiedenis om tevredenheid te verbeteren.
  • Gezondheidszorg: In de gezondheidszorg kunnen LAM’s helpen bij het beheer van patiëntenzorg door afspraken te organiseren, recepten te beheren en communicatie tussen diensten te faciliteren. Ze zijn ook nuttig voor afstandsbewaking, medische gegevens interpreteren en personeel waarschuwen in noodgevallen, vooral gunstig voor chronische en ouderenzorgbeheer.
  • Financiën: LAM’s kunnen persoonlijk financieel advies bieden en taken zoals portefeuillebalans en beleggingsuggesties beheren. Ze kunnen ook transacties controleren om fraude te detecteren en te voorkomen, naadloos integreren met banksystemen om verdachte activiteiten snel aan te pakken.

Uitdagingen van LAM’s

Ondanks hun aanzienlijk potentieel, hebben LAM’s te maken met verschillende uitdagingen die aangepakt moeten worden.

  • Gegevensprivacy en -beveiliging: Gezien de brede toegang tot persoonlijke en gevoelige informatie die LAM’s nodig hebben om te functioneren, is het waarborgen van gegevensprivacy en -beveiliging een grote uitdaging. LAM’s communiceren met persoonlijke gegevens via meerdere toepassingen en platforms, wat zorgen baart over het veilig omgaan met, opslaan en verwerken van deze informatie.
  • Ethische en regelgevingsaspecten: Naarmate LAM’s meer autonome rollen aannemen in besluitvorming en interactie met menselijke omgevingen, worden ethische overwegingen steeds belangrijker. Vragen over verantwoordelijkheid, transparantie en de mate van besluitvorming die aan machines wordt overgedragen, zijn kritisch. Bovendien kunnen er regelgevingsuitdagingen zijn bij het implementeren van dergelijke geavanceerde AI-systemen in verschillende industrieën.
  • Complexiteit van Integratie: LAM’s vereisen integratie met een verscheidenheid aan software- en hardwaresystemen om taken effectief uit te voeren. Deze integratie is complex en kan moeilijk te beheren zijn, vooral bij het coördineren van acties over verschillende platforms en diensten, zoals het boeken van vluchten, accommodaties en andere logistieke details in real-time.
  • Schaalbaarheid en Aanpasbaarheid: Hoewel LAM’s zijn ontworpen om aan te passen aan een breed scala van scenario’s en toepassingen, blijft het schalen van deze oplossingen om consistent en efficiënt te functioneren in diverse, echte wereldomgevingen een uitdaging. Het waarborgen dat LAM’s kunnen aanpassen aan veranderende omstandigheden en hun prestaties behouden over verschillende taken en gebruikersbehoeften, is cruciaal voor hun langetermijnsucces.

De Kern

Grote Actiemodellen (LAM’s) zijn een belangrijke innovatie in AI, die niet alleen apparaatinteracties beïnvloeden maar ook bredere industrie-toepassingen. Gedemonstreerd door Rabbit AI’s R1 en onderzocht in Apple’s vooruitgang met Siri, zijn LAM’s het toneel aan het bereiden voor meer interactieve en intuïtieve AI-systemen. Deze modellen zijn klaar om efficiëntie en personalisatie te verbeteren in sectoren zoals klantenservice, gezondheidszorg en financiën.

Echter, de implementatie van LAM’s gaat gepaard met uitdagingen, waaronder gegevensprivacyzorgen, ethische kwesties, integratiecomplexiteit en schaalbaarheid. Het aanpakken van deze kwesties is essentieel terwijl we vooruitgang boeken naar bredere adoptie van LAM-technologieën, met als doel hun capaciteiten verantwoordelijk en effectief te benutten. Naarmate LAM’s verder ontwikkeld worden, blijft hun potentieel om digitale interacties te transformeren aanzienlijk, waaruit hun belangrijkheid in de toekomstige AI-landschap blijkt.

Dr. Tehseen Zia is een gewaardeerd associate professor aan de COMSATS University Islamabad, met een PhD in AI van de Vienna University of Technology, Oostenrijk. Hij specialiseert zich in Artificial Intelligence, Machine Learning, Data Science en Computer Vision, en heeft significante bijdragen geleverd met publicaties in gerenommeerde wetenschappelijke tijdschriften. Dr. Tehseen heeft ook verschillende industriële projecten geleid als hoofdonderzoeker en heeft gediend als AI-consultant.