AI-modeller og platforme

Fra intention til udførelse: Hvordan Microsoft forvandler store sprogmodeller til handling-orienteret AI

mm
Føj Unite.AI til dine foretrukne kilder på Google

Store sprogmodeller (LLM’er) har ændret, hvordan vi håndterer naturlig sprogbehandling. De kan besvare spørgsmål, skrive kode og føre samtaler. Men de mangler evnen til at udføre virkelige opgaver. For eksempel kan en LLM vejlede dig gennem køb af en jakke, men kan ikke selv bestille den. Denne kæde mellem tanke og handling er en stor begrænsning. Mennesker har brug for mere end bare information; de vil have resultater.

For at brokke denne kæde omdanner Microsoft (MSFT ) LLM’er til handling-orienterede AI-agenter. Ved at give dem mulighed for at planlægge, opdele opgaver og interagere med den virkelige verden, giver de LLM’er mulighed for at håndtere praktiske opgaver effektivt. Denne ændring har potentialet til at omdefinere, hvad LLM’er kan gøre, og omdanne dem til værktøjer, der kan automatisere komplekse arbejdsprocesser og simplificere hverdagsopgaver. Lad os se, hvad der er nødvendigt for at gøre dette, og hvordan Microsoft nærmer sig problemet.

Hvad LLM’er behøver for at handle

For at LLM’er kan udføre opgaver i den virkelige verden, må de gå ud over at forstå tekst. De må interagere med digitale og fysiske miljøer og tilpasse sig til ændringer. Her er nogle af de evner, de behøver:

  1. At forstå brugerens intention

For at handle effektivt må LLM’er forstå brugerens anmodninger. Inddata som tekst eller talekommandoer er ofte vagt eller ufuldstændig. Systemet må udfylde hullerne ved hjælp af sin viden og konteksten for anmodningen. Multi-trins-samtaler kan hjælpe med at afklare disse intentioner og sikre, at AI’en forstår, før den handler.

  1. At omdanne intentioner til handlinger

Efter at have forstået en opgave må LLM’er omdanne den til handlinger. Dette kan indebære at klikke på knapper, kalde API’er eller styre fysiske enheder. LLM’er må tilpasse deres handlinger til den specifikke opgave og tilpasse sig til miljøet og løse problemer, der opstår.

  1. At tilpasse sig til ændringer

Virkelige opgaver følger ikke altid planen. LLM’er må forudse problemer, justere trin og finde alternativer, når der opstår problemer. For eksempel, hvis en nødvendig ressource ikke er tilgængelig, skal systemet finde en anden måde at fuldføre opgaven på. Denne fleksibilitet sikrer, at processen ikke stopper, når ting ændrer sig.

  1. At specialisere sig i bestemte opgaver

Selv om LLM’er er designet til generel brug, gør specialisering dem mere effektive. Ved at fokusere på bestemte opgaver kan disse systemer levere bedre resultater med færre ressourcer. Dette er især vigtigt for enheder med begrænsede beregningsressourcer, som smartphones eller indlejrede systemer.

Ved at udvikle disse færdigheder kan LLM’er gå ud over at blot behandle information. De kan udføre meningsfulde handlinger og baner vejen for, at AI kan integreres nærmere i hverdagsarbejdsprocesser.

Hvordan Microsoft forvandler LLM’er

Microsofts tilgang til at skabe handling-orienteret AI følger en struktureret proces. Det overordnede mål er at give LLM’er mulighed for at forstå kommandoer, planlægge effektivt og handle. Her er, hvordan de gør det:

Trin 1: Indsamling og forberedning af data

I den første fase indsamlede de data relateret til deres specifikke brugsområder: UFO Agent (beskrevet nedenfor). Dataen omfatter brugeranmodninger, miljødetaljer og opgave-specifikke handlinger. To typer data indsamles i denne fase: først indsamles opgave-plan-data, der hjælper LLM’er med at skitsere højt niveau-trin, der er nødvendige for at fuldføre en opgave. For eksempel kan “Ændre fontstørrelse i Word” indebære trin som at vælge tekst og justere værktøjsindstillinger. Dernæst indsamles opgave-handlings-data, der giver LLM’er mulighed for at oversætte disse trin til præcise instruktioner, som at klikke på bestemte knapper eller bruge tastaturgenveje.

Denne kombination giver modellen både det overordnede billede og de detaljerede instruktioner, den behøver for at udføre opgaver effektivt.

Trin 2: Træning af modellen

Når dataen er indsamlet, raffineres LLM’er gennem multiple træningssessioner. I det første trin trænes LLM’er i opgave-planlægning ved at lære dem, hvordan de kan opdele brugeranmodninger i handlinger. Ekspertrlabelede data bruges herefter til at lære dem, hvordan de kan oversætte disse planer til specifikke handlinger. For at yderligere forbedre deres problemløsnings-evner har LLM’er deltaget i en selvforbedringseksplore-proces, der giver dem mulighed for at tackle uløste opgaver og generere nye eksempler til kontinuerlig læring. Til sidst anvendes forstærkning-læring, der bruger feedback fra succeser og fiaskoer til at yderligere forbedre deres beslutningstagning.

Trin 3: Offline-test

Efter træning testes modellen i kontrollerede miljøer for at sikre pålidelighed. Metrikker som Task Success Rate (TSR) og Step Success Rate (SSR) bruges til at måle præstationen. For eksempel kan test af en kalenderstyrings-agent indebære at verificere dens evne til at planlægge møder og sende invitationer uden fejl.

Trin 4: Integration i virkelige systemer

Når modellen er valideret, integreres den i en agent-ramme. Dette giver den mulighed for at interagere med den virkelige verden, som at klikke på knapper eller navigere i menuer. Værktøjer som UI Automation API hjælper systemet med at identificere og manipulere brugergrænseflade-elementer dynamisk.

For eksempel, hvis opgaven er at højligte tekst i Word, identificerer agenten højligtningsknappen, vælger teksten og anvender formatering. En hukommelseskomponent kan hjælpe LLM med at holde styr på tidligere handlinger, hvilket giver den mulighed for at tilpasse sig til nye scenarier.

Trin 5: Virkelige tests

Det sidste trin er online-evaluering. Her testes systemet i virkelige scenarier for at sikre, at det kan håndtere uventede ændringer og fejl. For eksempel kan en kundesupport-bot vejlede brugere gennem nulstilling af en adgangskode, mens den tilpasser sig til forkerte indtastninger eller manglende information. Denne test sikrer, at AI’en er robust og klar til hverdagsbrug.

En praktisk eksempel: UFO Agenten

For at vise, hvordan handling-orienteret AI fungerer, har Microsoft udviklet UFO Agenten. Dette system er designet til at udføre virkelige opgaver i Windows-miljøer, hvor brugeranmodninger omdannes til fuldførte handlinger.

I sin kerne bruger UFO Agenten en LLM til at fortolke anmodninger og planlægge handlinger. For eksempel, hvis en bruger siger, “Højlig tekst ‘vigtig’ i dette dokument”, interagerer agenten med Word for at fuldføre opgaven. Den indsamler kontekstuel information, som placeringen af brugergrænseflade-kontrolelementer, og bruger denne til at planlægge og udføre handlinger.

UFO Agenten afhænger af værktøjer som Windows UI Automation (UIA) API. Denne API scanner applikationer for kontrolelementer, som knapper eller menuer. For en opgave som “Gem dokumentet som PDF”, bruger agenten UIA til at identificere “Fil”-knappen, finde “Gem som”-muligheden og udføre de nødvendige trin. Ved at strukturere data konsekvent sikrer systemet en smidig drift fra træning til virkelig anvendelse.

At overvinde udfordringer

Selv om dette er en spændende udvikling, indebærer skabelse af handling-orienteret AI udfordringer. Skalabilitet er et stort problem. Træning og implementering af disse modeller på tværs af diverse opgaver kræver betydelige ressourcer. Sikring af sikkerhed og pålidelighed er lige så vigtigt. Modellerne må udføre opgaver uden uventede konsekvenser, især i følsomme miljøer. Og da disse systemer interagerer med private data, er det også vigtigt at fastholde etiske standarder omkring privatliv og sikkerhed.

Microsofts vejviser fokuserer på at forbedre effektiviteten, udvide brugsområder og fastholde etiske standarder. Med disse fremskridt kunne LLM’er omdefinere, hvordan AI interagerer med verden, og gøre dem mere praktiske, tilpasningsdygtige og handling-orienterede.

Fremtiden for AI

At omdanne LLM’er til handling-orienterede agenter kan være en game-changer. Disse systemer kan automatisere opgaver, simplificere arbejdsprocesser og gøre teknologi mere tilgængelig. Microsofts arbejde med handling-orienteret AI og værktøjer som UFO Agenten er kun begyndelsen. Da AI fortsætter med at udvikle sig, kan vi forvente smartere, mere kapable systemer, der ikke blot interagerer med os, men også får arbejdet gjort.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.