AI-modeller og platforme
Fra intention til udfÃļrelse: Hvordan Microsoft forvandler store sprogmodeller til handling-orienteret AI
Store sprogmodeller (LLMâer) har ÃĶndret, hvordan vi hÃĨndterer naturlig sprogbehandling. De kan besvare spÃļrgsmÃĨl, skrive kode og fÃļre samtaler. Men de mangler evnen til at udfÃļre virkelige opgaver. For eksempel kan en LLM vejlede dig gennem kÃļb af en jakke, men kan ikke selv bestille den. Denne kÃĶde mellem tanke og handling er en stor begrÃĶnsning. Mennesker har brug for mere end bare information; de vil have resultater.
For at brokke denne kÃĶde omdanner Microsoft (MSFT ) LLMâer til handling-orienterede AI-agenter. Ved at give dem mulighed for at planlÃĶgge, opdele opgaver og interagere med den virkelige verden, giver de LLMâer mulighed for at hÃĨndtere praktiske opgaver effektivt. Denne ÃĶndring har potentialet til at omdefinere, hvad LLMâer kan gÃļre, og omdanne dem til vÃĶrktÃļjer, der kan automatisere komplekse arbejdsprocesser og simplificere hverdagsopgaver. Lad os se, hvad der er nÃļdvendigt for at gÃļre dette, og hvordan Microsoft nÃĶrmer sig problemet.
Hvad LLMâer behÃļver for at handle
For at LLMâer kan udfÃļre opgaver i den virkelige verden, mÃĨ de gÃĨ ud over at forstÃĨ tekst. De mÃĨ interagere med digitale og fysiske miljÃļer og tilpasse sig til ÃĶndringer. Her er nogle af de evner, de behÃļver:
-
At forstÃĨ brugerens intention
For at handle effektivt mÃĨ LLMâer forstÃĨ brugerens anmodninger. Inddata som tekst eller talekommandoer er ofte vagt eller ufuldstÃĶndig. Systemet mÃĨ udfylde hullerne ved hjÃĶlp af sin viden og konteksten for anmodningen. Multi-trins-samtaler kan hjÃĶlpe med at afklare disse intentioner og sikre, at AIâen forstÃĨr, fÃļr den handler.
-
At omdanne intentioner til handlinger
Efter at have forstÃĨet en opgave mÃĨ LLMâer omdanne den til handlinger. Dette kan indebÃĶre at klikke pÃĨ knapper, kalde APIâer eller styre fysiske enheder. LLMâer mÃĨ tilpasse deres handlinger til den specifikke opgave og tilpasse sig til miljÃļet og lÃļse problemer, der opstÃĨr.
-
At tilpasse sig til ÃĶndringer
Virkelige opgaver fÃļlger ikke altid planen. LLMâer mÃĨ forudse problemer, justere trin og finde alternativer, nÃĨr der opstÃĨr problemer. For eksempel, hvis en nÃļdvendig ressource ikke er tilgÃĶngelig, skal systemet finde en anden mÃĨde at fuldfÃļre opgaven pÃĨ. Denne fleksibilitet sikrer, at processen ikke stopper, nÃĨr ting ÃĶndrer sig.
-
At specialisere sig i bestemte opgaver
Selv om LLMâer er designet til generel brug, gÃļr specialisering dem mere effektive. Ved at fokusere pÃĨ bestemte opgaver kan disse systemer levere bedre resultater med fÃĶrre ressourcer. Dette er isÃĶr vigtigt for enheder med begrÃĶnsede beregningsressourcer, som smartphones eller indlejrede systemer.
Ved at udvikle disse fÃĶrdigheder kan LLMâer gÃĨ ud over at blot behandle information. De kan udfÃļre meningsfulde handlinger og baner vejen for, at AI kan integreres nÃĶrmere i hverdagsarbejdsprocesser.
Hvordan Microsoft forvandler LLMâer
Microsofts tilgang til at skabe handling-orienteret AI fÃļlger en struktureret proces. Det overordnede mÃĨl er at give LLMâer mulighed for at forstÃĨ kommandoer, planlÃĶgge effektivt og handle. Her er, hvordan de gÃļr det:
Trin 1: Indsamling og forberedning af data
I den fÃļrste fase indsamlede de data relateret til deres specifikke brugsomrÃĨder: UFO Agent (beskrevet nedenfor). Dataen omfatter brugeranmodninger, miljÃļdetaljer og opgave-specifikke handlinger. To typer data indsamles i denne fase: fÃļrst indsamles opgave-plan-data, der hjÃĶlper LLMâer med at skitsere hÃļjt niveau-trin, der er nÃļdvendige for at fuldfÃļre en opgave. For eksempel kan âÃndre fontstÃļrrelse i Wordâ indebÃĶre trin som at vÃĶlge tekst og justere vÃĶrktÃļjsindstillinger. DernÃĶst indsamles opgave-handlings-data, der giver LLMâer mulighed for at oversÃĶtte disse trin til prÃĶcise instruktioner, som at klikke pÃĨ bestemte knapper eller bruge tastaturgenveje.
Denne kombination giver modellen bÃĨde det overordnede billede og de detaljerede instruktioner, den behÃļver for at udfÃļre opgaver effektivt.
Trin 2: TrÃĶning af modellen
NÃĨr dataen er indsamlet, raffineres LLMâer gennem multiple trÃĶningssessioner. I det fÃļrste trin trÃĶnes LLMâer i opgave-planlÃĶgning ved at lÃĶre dem, hvordan de kan opdele brugeranmodninger i handlinger. Ekspertrlabelede data bruges herefter til at lÃĶre dem, hvordan de kan oversÃĶtte disse planer til specifikke handlinger. For at yderligere forbedre deres problemlÃļsnings-evner har LLMâer deltaget i en selvforbedringseksplore-proces, der giver dem mulighed for at tackle ulÃļste opgaver og generere nye eksempler til kontinuerlig lÃĶring. Til sidst anvendes forstÃĶrkning-lÃĶring, der bruger feedback fra succeser og fiaskoer til at yderligere forbedre deres beslutningstagning.
Trin 3: Offline-test
Efter trÃĶning testes modellen i kontrollerede miljÃļer for at sikre pÃĨlidelighed. Metrikker som Task Success Rate (TSR) og Step Success Rate (SSR) bruges til at mÃĨle prÃĶstationen. For eksempel kan test af en kalenderstyrings-agent indebÃĶre at verificere dens evne til at planlÃĶgge mÃļder og sende invitationer uden fejl.
Trin 4: Integration i virkelige systemer
NÃĨr modellen er valideret, integreres den i en agent-ramme. Dette giver den mulighed for at interagere med den virkelige verden, som at klikke pÃĨ knapper eller navigere i menuer. VÃĶrktÃļjer som UI Automation API hjÃĶlper systemet med at identificere og manipulere brugergrÃĶnseflade-elementer dynamisk.
For eksempel, hvis opgaven er at hÃļjligte tekst i Word, identificerer agenten hÃļjligtningsknappen, vÃĶlger teksten og anvender formatering. En hukommelseskomponent kan hjÃĶlpe LLM med at holde styr pÃĨ tidligere handlinger, hvilket giver den mulighed for at tilpasse sig til nye scenarier.
Trin 5: Virkelige tests
Det sidste trin er online-evaluering. Her testes systemet i virkelige scenarier for at sikre, at det kan hÃĨndtere uventede ÃĶndringer og fejl. For eksempel kan en kundesupport-bot vejlede brugere gennem nulstilling af en adgangskode, mens den tilpasser sig til forkerte indtastninger eller manglende information. Denne test sikrer, at AIâen er robust og klar til hverdagsbrug.
En praktisk eksempel: UFO Agenten
For at vise, hvordan handling-orienteret AI fungerer, har Microsoft udviklet UFO Agenten. Dette system er designet til at udfÃļre virkelige opgaver i Windows-miljÃļer, hvor brugeranmodninger omdannes til fuldfÃļrte handlinger.
I sin kerne bruger UFO Agenten en LLM til at fortolke anmodninger og planlÃĶgge handlinger. For eksempel, hvis en bruger siger, âHÃļjlig tekst âvigtigâ i dette dokumentâ, interagerer agenten med Word for at fuldfÃļre opgaven. Den indsamler kontekstuel information, som placeringen af brugergrÃĶnseflade-kontrolelementer, og bruger denne til at planlÃĶgge og udfÃļre handlinger.
UFO Agenten afhÃĶnger af vÃĶrktÃļjer som Windows UI Automation (UIA) API. Denne API scanner applikationer for kontrolelementer, som knapper eller menuer. For en opgave som âGem dokumentet som PDFâ, bruger agenten UIA til at identificere âFilâ-knappen, finde âGem somâ-muligheden og udfÃļre de nÃļdvendige trin. Ved at strukturere data konsekvent sikrer systemet en smidig drift fra trÃĶning til virkelig anvendelse.
At overvinde udfordringer
Selv om dette er en spÃĶndende udvikling, indebÃĶrer skabelse af handling-orienteret AI udfordringer. Skalabilitet er et stort problem. TrÃĶning og implementering af disse modeller pÃĨ tvÃĶrs af diverse opgaver krÃĶver betydelige ressourcer. Sikring af sikkerhed og pÃĨlidelighed er lige sÃĨ vigtigt. Modellerne mÃĨ udfÃļre opgaver uden uventede konsekvenser, isÃĶr i fÃļlsomme miljÃļer. Og da disse systemer interagerer med private data, er det ogsÃĨ vigtigt at fastholde etiske standarder omkring privatliv og sikkerhed.
Microsofts vejviser fokuserer pÃĨ at forbedre effektiviteten, udvide brugsomrÃĨder og fastholde etiske standarder. Med disse fremskridt kunne LLMâer omdefinere, hvordan AI interagerer med verden, og gÃļre dem mere praktiske, tilpasningsdygtige og handling-orienterede.
Fremtiden for AI
At omdanne LLMâer til handling-orienterede agenter kan vÃĶre en game-changer. Disse systemer kan automatisere opgaver, simplificere arbejdsprocesser og gÃļre teknologi mere tilgÃĶngelig. Microsofts arbejde med handling-orienteret AI og vÃĶrktÃļjer som UFO Agenten er kun begyndelsen. Da AI fortsÃĶtter med at udvikle sig, kan vi forvente smartere, mere kapable systemer, der ikke blot interagerer med os, men ogsÃĨ fÃĨr arbejdet gjort.












