AI-modeller och plattformar

Från avsikt till utförande: Hur Microsoft förvandlar stora språkmodeller till handlingssinriktad AI

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Stora språkmodeller (LLM) har ändrat hur vi hanterar naturlig språkbehandling. De kan svara på frågor, skriva kod och hålla samtal. Men de brister när det gäller verkliga uppgifter. Till exempel kan en LLM vägleda dig genom att köpa en jacka, men kan inte placera beställningen åt dig. Detta gap mellan tanke och handling är en stor begränsning. Människor behöver inte bara information, de vill ha resultat.

För att överbrygga detta gap förvandlar Microsoft (MSFT ) LLM till handlingssinriktade AI-agenter. Genom att möjliggöra för dem att planera, bryta ner uppgifter och engagera sig i verkliga interaktioner, ger de LLM möjlighet att effektivt hantera praktiska uppgifter. Denna förändring har potentialen att omdefiniera vad LLM kan göra, och förvandla dem till verktyg som automatiserar komplexa arbetsflöden och förenklar vardagliga uppgifter. Låt oss se vad som behövs för att göra detta möjligt och hur Microsoft närmar sig problemet.

Vad LLM behöver för att agera

För att LLM ska kunna utföra uppgifter i den verkliga världen, måste de gå utöver att förstå text. De måste interagera med digitala och fysiska miljöer och anpassa sig till förändrade förhållanden. Här är några av de förmågor de behöver:

  1. Att förstå användaravsikt

För att agera effektivt, måste LLM förstå användarbegäran. Inmatningar som text eller röstkommender är ofta otydliga eller ofullständiga. Systemet måste fylla i luckorna med hjälp av sin kunskap och kontexten för begäran. Samtal i flera steg kan hjälpa till att förfinade dessa avsikter, och säkerställa att AI förstår innan den vidtar åtgärder.

  1. Att omvandla avsikter till handlingar

Efter att ha förstått en uppgift, måste LLM omvandla den till handlingsbara steg. Detta kan innebära att klicka på knappar, anropa API:er eller kontrollera fysiska enheter. LLM måste anpassa sina handlingar till den specifika uppgiften, anpassa sig till miljön och lösa problem som uppstår.

  1. Att anpassa sig till förändringar

Verkliga uppgifter följer inte alltid planen. LLM måste förutse problem, justera steg och hitta alternativ när problem uppstår. Till exempel, om en nödvändig resurs inte är tillgänglig, bör systemet hitta ett annat sätt att slutföra uppgiften. Denna flexibilitet säkerställer att processen inte stannar när saker förändras.

  1. Att specialisera sig på specifika uppgifter

Medan LLM är utformade för allmänt bruk, gör specialisering dem mer effektiva. Genom att fokusera på specifika uppgifter, kan dessa system leverera bättre resultat med färre resurser. Detta är särskilt viktigt för enheter med begränsad beräkningskraft, som smartphones eller inbäddade system.

Genom att utveckla dessa färdigheter, kan LLM gå utöver att bara bearbeta information. De kan vidta meningsfulla handlingar, och bana väg för AI att integreras sömlöst i vardagliga arbetsflöden.

Hur Microsoft förvandlar LLM

Microsofts tillvägagångssätt för att skapa handlingssinriktad AI följer en strukturerad process. Det övergripande målet är att möjliggöra för LLM att förstå kommandon, planera effektivt och vidta åtgärder. Här är hur de gör det:

Steg 1: Insamling och förberedelse av data

I den första fasen samlade de in data relaterad till sina specifika användningsfall: UFO Agent (beskrivs nedan). Data inkluderar användarfrågor, miljödetaljer och uppgiftsspecifika åtgärder. Två olika typer av data samlas in under denna fas: först samlade de in uppgiftsplaneringsdata som hjälper LLM att skissa högnivåsteg för att slutföra en uppgift. Till exempel kan “Ändra teckenstorlek i Word” innebära steg som att välja text och justera verktygsfältet. Sedan samlade de in uppgiftsåtgärdsdata, som möjliggör för LLM att översätta dessa steg till precisa instruktioner, som att klicka på specifika knappar eller använda tangentbordsgenvägar.

Denna kombination ger modellen både den stora bilden och de detaljerade instruktionerna den behöver för att utföra uppgifter effektivt.

Steg 2: Utbildning av modellen

När data är insamlad, förfinas LLM genom flera utbildningssessioner. I det första steget utbildas LLM för uppgiftsplanering genom att lära dem hur man bryter ner användarbegäran i handlingsbara steg. Expertmärkt data används sedan för att lära dem hur man översätter dessa planer till specifika åtgärder. För att ytterligare förbättra deras problemlösningsförmåga, har LLM engagerat sig i en självförstärkande utforskning som ger dem möjlighet att hantera olösta uppgifter och generera nya exempel för kontinuerligt lärande. Slutligen tillämpas förstärkt lärande, med feedback från framgångar och misslyckanden för att ytterligare förbättra deras beslutsfattning.

Steg 3: Offline-testning

Efter utbildning, testas modellen i kontrollerade miljöer för att säkerställa tillförlitlighet. Mått som Uppgiftslyckandefrekvens (TSR) och Steglyckandefrekvens (SSR) används för att mäta prestanda. Till exempel kan testning av en kalenderhanteringsagent innebära att verifiera dess förmåga att schemalägga möten och skicka inbjudningar utan fel.

Steg 4: Integration i verkliga system

När modellen har validerats, integreras den i en agentram. Detta möjliggör för den att interagera med verkliga miljöer, som att klicka på knappar eller navigera i menyer. Verktyg som UI Automation API hjälper systemet att identifiera och manipulera användargränssnittselement dynamiskt.

Till exempel, om uppgiften är att markera text i Word, identifierar agenten markeringknappen, väljer texten och tillämpar formatering. En minneskomponent kan hjälpa LLM att spåra tidigare åtgärder, och möjliggör för den att anpassa sig till nya scenarier.

Steg 5: Testning i verkliga världen

Det sista steget är onlineutvärdering. Här testas systemet i verkliga scenarier för att säkerställa att det kan hantera oväntade förändringar och fel. Till exempel kan en kundsupportbot vägleda användare genom att återställa ett lösenord, medan den anpassar sig till felaktiga inmatningar eller saknad information. Denna testning säkerställer att AI är robust och redo för vardagligt bruk.

Praktiskt exempel: UFO Agenten

För att visa hur handlingssinriktad AI fungerar, utvecklade Microsoft UFO Agenten. Detta system är utformat för att utföra verkliga uppgifter i Windows-miljöer, och omvandlar användarbegäran till slutförda åtgärder.

I sin kärna använder UFO Agenten en LLM för att tolka begäran och planera åtgärder. Till exempel, om en användare säger “Markera ordet ‘viktigt’ i detta dokument”, interagerar agenten med Word för att slutföra uppgiften. Den samlar in kontextuell information, som positionen för användargränssnittselement, och använder den för att planera och utföra åtgärder.

UFO Agenten förlitar sig på verktyg som Windows UI Automation (UIA) API. Denna API skannar applikationer för kontroll-element, som knappar eller menyer. För en uppgift som “Spara dokumentet som PDF”, använder agenten UIA för att identifiera “Fil”-knappen, hitta “Spara som”-alternativet och utföra nödvändiga steg. Genom att strukturera data konsekvent, säkerställer systemet smidig drift från utbildning till verklig tillämpning.

Att övervinna utmaningar

Medan detta är en spännande utveckling, skapar handlingssinriktad AI utmaningar. Skalbarhet är ett stort problem. Utbildning och distribution av dessa modeller över olika uppgifter kräver betydande resurser. Att säkerställa säkerhet och tillförlitlighet är lika viktigt. Modellerna måste utföra uppgifter utan oavsiktliga konsekvenser, särskilt i känsliga miljöer. Och eftersom dessa system interagerar med privat data, är det också viktigt att upprätthålla etiska standarder kring sekretess och säkerhet.

Microsofts vägkarta fokuserar på att förbättra effektivitet, expandera användningsfall och upprätthålla etiska standarder. Med dessa framsteg kan LLM omdefiniera hur AI interagerar med världen, och göra dem mer praktiska, anpassningsbara och handlingssinriktade.

AI:s framtid

Att förvandla LLM till handlingssinriktade agenter kan vara en spelväxlare. Dessa system kan automatisera uppgifter, förenkla arbetsflöden och göra teknologi mer tillgänglig. Microsofts arbete med handlingssinriktad AI och verktyg som UFO Agenten är bara början. När AI fortsätter att utvecklas, kan vi förvänta oss smartare, mer kapabla system som inte bara interagerar med oss – de får saker gjorda.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.