AI-modeller og platforme

Fra intention til udfÃļrelse: Hvordan Microsoft forvandler store sprogmodeller til handling-orienteret AI

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Store sprogmodeller (LLM’er) har ÃĶndret, hvordan vi hÃĨndterer naturlig sprogbehandling. De kan besvare spÃļrgsmÃĨl, skrive kode og fÃļre samtaler. Men de mangler evnen til at udfÃļre virkelige opgaver. For eksempel kan en LLM vejlede dig gennem kÃļb af en jakke, men kan ikke selv bestille den. Denne kÃĶde mellem tanke og handling er en stor begrÃĶnsning. Mennesker har brug for mere end bare information; de vil have resultater.

For at brokke denne kÃĶde omdanner Microsoft (MSFT ) LLM’er til handling-orienterede AI-agenter. Ved at give dem mulighed for at planlÃĶgge, opdele opgaver og interagere med den virkelige verden, giver de LLM’er mulighed for at hÃĨndtere praktiske opgaver effektivt. Denne ÃĶndring har potentialet til at omdefinere, hvad LLM’er kan gÃļre, og omdanne dem til vÃĶrktÃļjer, der kan automatisere komplekse arbejdsprocesser og simplificere hverdagsopgaver. Lad os se, hvad der er nÃļdvendigt for at gÃļre dette, og hvordan Microsoft nÃĶrmer sig problemet.

Hvad LLM’er behÃļver for at handle

For at LLM’er kan udfÃļre opgaver i den virkelige verden, mÃĨ de gÃĨ ud over at forstÃĨ tekst. De mÃĨ interagere med digitale og fysiske miljÃļer og tilpasse sig til ÃĶndringer. Her er nogle af de evner, de behÃļver:

  1. At forstÃĨ brugerens intention

For at handle effektivt mÃĨ LLM’er forstÃĨ brugerens anmodninger. Inddata som tekst eller talekommandoer er ofte vagt eller ufuldstÃĶndig. Systemet mÃĨ udfylde hullerne ved hjÃĶlp af sin viden og konteksten for anmodningen. Multi-trins-samtaler kan hjÃĶlpe med at afklare disse intentioner og sikre, at AI’en forstÃĨr, fÃļr den handler.

  1. At omdanne intentioner til handlinger

Efter at have forstÃĨet en opgave mÃĨ LLM’er omdanne den til handlinger. Dette kan indebÃĶre at klikke pÃĨ knapper, kalde API’er eller styre fysiske enheder. LLM’er mÃĨ tilpasse deres handlinger til den specifikke opgave og tilpasse sig til miljÃļet og lÃļse problemer, der opstÃĨr.

  1. At tilpasse sig til ÃĶndringer

Virkelige opgaver fÃļlger ikke altid planen. LLM’er mÃĨ forudse problemer, justere trin og finde alternativer, nÃĨr der opstÃĨr problemer. For eksempel, hvis en nÃļdvendig ressource ikke er tilgÃĶngelig, skal systemet finde en anden mÃĨde at fuldfÃļre opgaven pÃĨ. Denne fleksibilitet sikrer, at processen ikke stopper, nÃĨr ting ÃĶndrer sig.

  1. At specialisere sig i bestemte opgaver

Selv om LLM’er er designet til generel brug, gÃļr specialisering dem mere effektive. Ved at fokusere pÃĨ bestemte opgaver kan disse systemer levere bedre resultater med fÃĶrre ressourcer. Dette er isÃĶr vigtigt for enheder med begrÃĶnsede beregningsressourcer, som smartphones eller indlejrede systemer.

Ved at udvikle disse fÃĶrdigheder kan LLM’er gÃĨ ud over at blot behandle information. De kan udfÃļre meningsfulde handlinger og baner vejen for, at AI kan integreres nÃĶrmere i hverdagsarbejdsprocesser.

Hvordan Microsoft forvandler LLM’er

Microsofts tilgang til at skabe handling-orienteret AI fÃļlger en struktureret proces. Det overordnede mÃĨl er at give LLM’er mulighed for at forstÃĨ kommandoer, planlÃĶgge effektivt og handle. Her er, hvordan de gÃļr det:

Trin 1: Indsamling og forberedning af data

I den fÃļrste fase indsamlede de data relateret til deres specifikke brugsomrÃĨder: UFO Agent (beskrevet nedenfor). Dataen omfatter brugeranmodninger, miljÃļdetaljer og opgave-specifikke handlinger. To typer data indsamles i denne fase: fÃļrst indsamles opgave-plan-data, der hjÃĶlper LLM’er med at skitsere hÃļjt niveau-trin, der er nÃļdvendige for at fuldfÃļre en opgave. For eksempel kan “Ændre fontstÃļrrelse i Word” indebÃĶre trin som at vÃĶlge tekst og justere vÃĶrktÃļjsindstillinger. DernÃĶst indsamles opgave-handlings-data, der giver LLM’er mulighed for at oversÃĶtte disse trin til prÃĶcise instruktioner, som at klikke pÃĨ bestemte knapper eller bruge tastaturgenveje.

Denne kombination giver modellen bÃĨde det overordnede billede og de detaljerede instruktioner, den behÃļver for at udfÃļre opgaver effektivt.

Trin 2: TrÃĶning af modellen

NÃĨr dataen er indsamlet, raffineres LLM’er gennem multiple trÃĶningssessioner. I det fÃļrste trin trÃĶnes LLM’er i opgave-planlÃĶgning ved at lÃĶre dem, hvordan de kan opdele brugeranmodninger i handlinger. Ekspertrlabelede data bruges herefter til at lÃĶre dem, hvordan de kan oversÃĶtte disse planer til specifikke handlinger. For at yderligere forbedre deres problemlÃļsnings-evner har LLM’er deltaget i en selvforbedringseksplore-proces, der giver dem mulighed for at tackle ulÃļste opgaver og generere nye eksempler til kontinuerlig lÃĶring. Til sidst anvendes forstÃĶrkning-lÃĶring, der bruger feedback fra succeser og fiaskoer til at yderligere forbedre deres beslutningstagning.

Trin 3: Offline-test

Efter trÃĶning testes modellen i kontrollerede miljÃļer for at sikre pÃĨlidelighed. Metrikker som Task Success Rate (TSR) og Step Success Rate (SSR) bruges til at mÃĨle prÃĶstationen. For eksempel kan test af en kalenderstyrings-agent indebÃĶre at verificere dens evne til at planlÃĶgge mÃļder og sende invitationer uden fejl.

Trin 4: Integration i virkelige systemer

NÃĨr modellen er valideret, integreres den i en agent-ramme. Dette giver den mulighed for at interagere med den virkelige verden, som at klikke pÃĨ knapper eller navigere i menuer. VÃĶrktÃļjer som UI Automation API hjÃĶlper systemet med at identificere og manipulere brugergrÃĶnseflade-elementer dynamisk.

For eksempel, hvis opgaven er at hÃļjligte tekst i Word, identificerer agenten hÃļjligtningsknappen, vÃĶlger teksten og anvender formatering. En hukommelseskomponent kan hjÃĶlpe LLM med at holde styr pÃĨ tidligere handlinger, hvilket giver den mulighed for at tilpasse sig til nye scenarier.

Trin 5: Virkelige tests

Det sidste trin er online-evaluering. Her testes systemet i virkelige scenarier for at sikre, at det kan hÃĨndtere uventede ÃĶndringer og fejl. For eksempel kan en kundesupport-bot vejlede brugere gennem nulstilling af en adgangskode, mens den tilpasser sig til forkerte indtastninger eller manglende information. Denne test sikrer, at AI’en er robust og klar til hverdagsbrug.

En praktisk eksempel: UFO Agenten

For at vise, hvordan handling-orienteret AI fungerer, har Microsoft udviklet UFO Agenten. Dette system er designet til at udfÃļre virkelige opgaver i Windows-miljÃļer, hvor brugeranmodninger omdannes til fuldfÃļrte handlinger.

I sin kerne bruger UFO Agenten en LLM til at fortolke anmodninger og planlÃĶgge handlinger. For eksempel, hvis en bruger siger, “HÃļjlig tekst ‘vigtig’ i dette dokument”, interagerer agenten med Word for at fuldfÃļre opgaven. Den indsamler kontekstuel information, som placeringen af brugergrÃĶnseflade-kontrolelementer, og bruger denne til at planlÃĶgge og udfÃļre handlinger.

UFO Agenten afhÃĶnger af vÃĶrktÃļjer som Windows UI Automation (UIA) API. Denne API scanner applikationer for kontrolelementer, som knapper eller menuer. For en opgave som “Gem dokumentet som PDF”, bruger agenten UIA til at identificere “Fil”-knappen, finde “Gem som”-muligheden og udfÃļre de nÃļdvendige trin. Ved at strukturere data konsekvent sikrer systemet en smidig drift fra trÃĶning til virkelig anvendelse.

At overvinde udfordringer

Selv om dette er en spÃĶndende udvikling, indebÃĶrer skabelse af handling-orienteret AI udfordringer. Skalabilitet er et stort problem. TrÃĶning og implementering af disse modeller pÃĨ tvÃĶrs af diverse opgaver krÃĶver betydelige ressourcer. Sikring af sikkerhed og pÃĨlidelighed er lige sÃĨ vigtigt. Modellerne mÃĨ udfÃļre opgaver uden uventede konsekvenser, isÃĶr i fÃļlsomme miljÃļer. Og da disse systemer interagerer med private data, er det ogsÃĨ vigtigt at fastholde etiske standarder omkring privatliv og sikkerhed.

Microsofts vejviser fokuserer pÃĨ at forbedre effektiviteten, udvide brugsomrÃĨder og fastholde etiske standarder. Med disse fremskridt kunne LLM’er omdefinere, hvordan AI interagerer med verden, og gÃļre dem mere praktiske, tilpasningsdygtige og handling-orienterede.

Fremtiden for AI

At omdanne LLM’er til handling-orienterede agenter kan vÃĶre en game-changer. Disse systemer kan automatisere opgaver, simplificere arbejdsprocesser og gÃļre teknologi mere tilgÃĶngelig. Microsofts arbejde med handling-orienteret AI og vÃĶrktÃļjer som UFO Agenten er kun begyndelsen. Da AI fortsÃĶtter med at udvikle sig, kan vi forvente smartere, mere kapable systemer, der ikke blot interagerer med os, men ogsÃĨ fÃĨr arbejdet gjort.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlÃĶring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har ogsÃĨ ledet forskellige industrielle projekter som hovedundersÃļger og fungeret som AI-rÃĨdgiver.