AI-modellen en platforms

Van Intentie tot Uitvoering: Hoe Microsoft Grote Taalmodellen Transformeert in Actiegerichte AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Grote Taalmodellen (LLM’s) hebben de manier veranderd waarop we natuurlijke taalverwerking aanpakken. Ze kunnen vragen beantwoorden, code schrijven en gesprekken voeren. Toch komen ze tekort als het gaat om taken in de echte wereld. Bijvoorbeeld, een LLM kan je door het kopen van een jas leiden, maar kan de bestelling niet voor je plaatsen. Deze kloof tussen denken en doen is een grote beperking. Mensen hebben niet alleen informatie nodig; ze willen resultaten.

Om deze kloof te overbruggen, is Microsoft (MSFT ) bezig om LLM’s om te vormen tot actiegerichte AI-agenten. Door hen in staat te stellen om plannen te maken, taken te decomponeren en deel te nemen aan interacties in de echte wereld, machtigen ze LLM’s om effectief praktische taken te beheren. Deze verschuiving heeft het potentieel om te definiëren wat LLM’s kunnen doen, door hen om te vormen tot tools die complexe workflows automatiseren en alledaagse taken vereenvoudigen. Laten we kijken wat er nodig is om dit te laten gebeuren en hoe Microsoft deze uitdaging aanpakt.

Wat LLM’s Nodig Hebben om te Handelen

Om taken in de echte wereld uit te voeren, moeten LLM’s verder gaan dan alleen tekst begrijpen. Ze moeten interactie hebben met digitale en fysieke omgevingen en zich aanpassen aan veranderende omstandigheden. Hier zijn enkele van de capaciteiten die ze nodig hebben:

  1. Begrip van Gebruikersintentie

Om effectief te handelen, moeten LLM’s gebruikersverzoeken begrijpen. Invoer zoals tekst of spraakopdrachten zijn vaak vaag of onvolledig. Het systeem moet de lacunes opvullen met zijn kennis en de context van het verzoek. Meerdere gespreksronden kunnen helpen om deze intenties te verfijnen, zodat de AI begrijpt voordat het actie onderneemt.

  1. Intenties Omzetten in Acties

Nadat een taak is begrepen, moeten LLM’s deze omzetten in uitvoerbare stappen. Dit kan het klikken op knoppen, het aanroepen van API’s of het besturen van fysieke apparaten omvatten. LLM’s moeten hun acties aanpassen aan de specifieke taak, zich aanpassen aan de omgeving en problemen oplossen die zich voordoen.

  1. Aanpassen aan Veranderingen

Taken in de echte wereld verlopen niet altijd zoals gepland. LLM’s moeten problemen anticiperen, stappen aanpassen en alternatieven vinden wanneer er problemen ontstaan. Als bijvoorbeeld een benodigde resource niet beschikbaar is, moet het systeem een andere manier vinden om de taak te voltooien. Deze flexibiliteit zorgt ervoor dat het proces niet stilvalt wanneer dingen veranderen.

  1. Specialiseren in Specifieke Taken

Hoewel LLM’s zijn ontworpen voor algemeen gebruik, maakt specialisatie hen efficiënter. Door zich te concentreren op specifieke taken, kunnen deze systemen betere resultaten behalen met minder resources. Dit is vooral belangrijk voor apparaten met beperkte rekenkracht, zoals smartphones of ingebedde systemen.

Door deze vaardigheden te ontwikkelen, kunnen LLM’s verder gaan dan alleen informatie verwerken. Ze kunnen betekenisvolle acties ondernemen, waardoor AI naadloos in dagelijkse workflows kan worden geïntegreerd.

Hoe Microsoft LLM’s Transformeert

Microsoft’s aanpak voor het creëren van actiegerichte AI volgt een gestructureerd proces. Het belangrijkste doel is om LLM’s in staat te stellen om opdrachten te begrijpen, effectief te plannen en actie te ondernemen. Hier is hoe ze dit doen:

Stap 1: Gegevens Verzamelen en Voorbereiden

In de eerste fase verzamelen ze gegevens met betrekking tot hun specifieke use cases: UFO Agent (hieronder beschreven). De gegevens omvatten gebruikersverzoeken, omgevingsdetails en taakspecifieke acties. Twee soorten gegevens worden in deze fase verzameld: ten eerste verzamelen ze taakplan-gegevens die LLM’s helpen om de hoogste niveaus van stappen te schetsen die nodig zijn om een taak te voltooien. Bijvoorbeeld, “De lettergrootte in Word veranderen” kan stappen omvatten zoals tekst selecteren en de werkbalkinstellingen aanpassen. Ten tweede verzamelen ze taakactie-gegevens, waardoor LLM’s deze stappen kunnen vertalen in specifieke instructies, zoals het klikken op specifieke knoppen of het gebruik van toetsenbordshortcuts.

Deze combinatie geeft het model zowel het grote plaatje als de gedetailleerde instructies die nodig zijn om taken effectief uit te voeren.

Stap 2: Het Model Trainen

Nadat de gegevens zijn verzameld, worden LLM’s verfijnd door meerdere trainingsessies. In de eerste stap worden LLM’s getraind voor taakplanning door hen te leren hoe ze gebruikersverzoeken kunnen decomponeren in uitvoerbare stappen. Expert-gelabelde gegevens worden vervolgens gebruikt om hen te leren hoe ze deze plannen kunnen vertalen in specifieke acties. Om hun probleemoplossende capaciteiten verder te verbeteren, hebben LLM’s deelgenomen aan een zelfversterkend exploratieproces dat hen in staat stelt om onopgeloste taken aan te pakken en nieuwe voorbeelden te genereren voor continue leren. Ten slotte wordt versterking van leren toegepast, waarbij feedback van successen en mislukkingen wordt gebruikt om hun besluitvorming verder te verbeteren.

Stap 3: Offline Testen

Na het trainen wordt het model getest in gecontroleerde omgevingen om de betrouwbaarheid te waarborgen. Metrieken zoals Taak Succes Rate (TSR) en Stap Succes Rate (SSR) worden gebruikt om de prestaties te meten. Bijvoorbeeld, het testen van een kalenderbeheeragent kan het verifiëren van zijn vermogen om vergaderingen te plannen en uitnodigingen te sturen zonder fouten omvatten.

Stap 4: Integratie in Echte Systemen

Nadat het model is geverifieerd, wordt het geïntegreerd in een agentframework. Dit stelde het in staat om te interacteren met echte omgevingen, zoals het klikken op knoppen of het navigeren door menu’s. Tools zoals UI-automatisatie-API’s hielpen het systeem om gebruikersinterface-elementen dynamisch te identificeren en te manipuleren.

Bijvoorbeeld, als het systeem de taak krijgt om tekst in Word te markeren, identificeert de agent de markeringsknop, selecteert de tekst en past de opmaak toe. Een geheugenelement kan LLM’s helpen om bij te houden welke acties eerder zijn uitgevoerd, waardoor het zich kan aanpassen aan nieuwe scenario’s.

Stap 5: Testen in de Echte Wereld

De laatste stap is online evaluatie. Hier wordt het systeem getest in echte scenario’s om ervoor te zorgen dat het onverwachte veranderingen en fouten aankan. Bijvoorbeeld, een klantenservicobot kan gebruikers door het proces van het opnieuw instellen van een wachtwoord leiden, terwijl het zich aanpast aan onjuiste invoer of ontbrekende informatie. Deze test zorgt ervoor dat de AI robuust en klaar is voor dagelijks gebruik.

Een Praktisch Voorbeeld: De UFO Agent

Om te laten zien hoe actiegerichte AI werkt, heeft Microsoft de UFO Agent ontwikkeld. Dit systeem is ontworpen om taken in Windows-omgevingen uit te voeren, door gebruikersverzoeken om te zetten in voltooide acties.

De UFO Agent gebruikt een LLM om verzoeken te interpreteren en acties te plannen. Als een gebruiker zegt, “Markeer het woord ‘belangrijk’ in dit document”, interageert de agent met Word om de taak te voltooien. Het verzamelt contextuele informatie, zoals de posities van gebruikersinterface-elementen, en gebruikt deze om acties te plannen en uit te voeren.

De UFO Agent vertrouwt op tools zoals de Windows UI-automatisatie (UIA) API. Deze API scant toepassingen op controle-elementen, zoals knoppen of menu’s. Voor een taak zoals “Sla het document op als PDF”, gebruikt de agent de UIA om de “Bestand”-knop te identificeren, de “Opslaan als”-optie te vinden en de noodzakelijke stappen uit te voeren. Door gegevens consistent te structureren, zorgt het systeem voor soepele werking vanaf de training tot de toepassing in de echte wereld.

Uitdagingen Overwinnen

Hoewel dit een spannende ontwikkeling is, komt het creëren van actiegerichte AI met uitdagingen. Schaalbaarheid is een groot probleem. Het trainen en implementeren van deze modellen voor diverse taken vereist aanzienlijke resources. Het waarborgen van veiligheid en betrouwbaarheid is even belangrijk. Modellen moeten taken uitvoeren zonder onbedoelde gevolgen, vooral in gevoelige omgevingen. En aangezien deze systemen omgaan met privégegevens, is het ook cruciaal om ethische normen rondom privacy en beveiliging te handhaven.

Microsoft’s roadmap richt zich op het verbeteren van de efficiëntie, het uitbreiden van use cases en het handhaven van ethische normen. Met deze vooruitgang kunnen LLM’s opnieuw definiëren hoe AI met de wereld omgaat, waardoor ze praktischer, flexibeler en actiegerichter worden.

De Toekomst van AI

Het transformeren van LLM’s in actiegerichte agenten kan een game-changer zijn. Deze systemen kunnen taken automatiseren, workflows vereenvoudigen en technologie toegankelijker maken. Microsoft’s werk aan actiegerichte AI en tools zoals de UFO Agent is pas het begin. Naarmate AI blijft evolueren, kunnen we slimmere, capabelere systemen verwachten die niet alleen met ons communiceren, maar taken uitvoeren.

Dr. Tehseen Zia is een gewaardeerd associate professor aan de COMSATS University Islamabad, met een PhD in AI van de Vienna University of Technology, Oostenrijk. Hij specialiseert zich in Artificial Intelligence, Machine Learning, Data Science en Computer Vision, en heeft significante bijdragen geleverd met publicaties in gerenommeerde wetenschappelijke tijdschriften. Dr. Tehseen heeft ook verschillende industriële projecten geleid als hoofdonderzoeker en heeft gediend als AI-consultant.