AI-modeller og plattformer

Fra intensjon til utførelse: Hvordan Microsoft transformerer store språkmodeller til handleorientert AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Store språkmodeller (LLM) har endret måten vi håndterer naturlig språkbehandling. De kan svare på spørsmål, skrive kode og holde samtaler. Likevel, de har begrensninger når det kommer til virkelige oppgaver. For eksempel, en LLM kan guide deg gjennom å kjøpe en jakke, men kan ikke plassere bestillingen for deg. Denne gapen mellom tenkning og handling er en stor begrensning. Folk trenger ikke bare informasjon; de ønsker resultater.

For å lukke denne gapen, transformerer Microsoft (MSFT ) LLM til handleorienterte AI-agenter. Ved å aktivere dem til å planlegge, bryte ned oppgaver og engasjere i virkelige interaksjoner, gir de LLM mulighet til å effektivt håndtere praktiske oppgaver. Denne endringen har potensialet til å omdefinere hva LLM kan gjøre, og gjøre dem til verktøy som kan automatisere komplekse arbeidsflyter og forenkle hverdagsoppgaver. La oss se på hva som er nødvendig for å gjøre dette og hvordan Microsoft nærmer seg problemet.

Hva LLM trenger for å handle

For at LLM skal kunne utføre oppgaver i den virkelige verden, må de gå ut over å forstå tekst. De må interagere med digitale og fysiske miljøer og tilpasse seg til endrede forhold. Her er noen av de evnene de trenger:

  1. Forstå brukerens intensjon

For å handle effektivt, må LLM forstå brukerens forespørsler. Inndata som tekst eller talekommandoer er ofte vag eller ufullstendig. Systemet må fylle inn hullene ved hjelp av sin kunnskap og konteksten til forespørselen. Flerskrittssamtaler kan hjelpe til å finjustere disse intensjonene, slik at AI forstår før den handler.

  1. Omgjøre intensjoner til handlinger

Etter å ha forstått en oppgave, må LLM omgjøre den til handlebare skritt. Dette kan innebære å klikke på knapper, ringe til API-er eller kontrollere fysiske enheter. LLM må tilpasse sine handlinger til den spesifikke oppgaven, tilpasse seg miljøet og løse utfordringer som oppstår.

  1. Tilpasse seg endringer

Virkelige oppgaver går ikke alltid som planlagt. LLM må forutse problemer, justere skritt og finne alternativer når det oppstår problemer. For eksempel, hvis en nødvendig ressurs ikke er tilgjengelig, skal systemet finne en annen måte å fullføre oppgaven på. Denne fleksibiliteten sikrer at prosessen ikke stopper når ting endrer seg.

  1. Spesialisere seg i bestemte oppgaver

Selv om LLM er designet for generell bruk, gjør spesialisering dem mer effektive. Ved å fokusere på bestemte oppgaver, kan disse systemene levere bedre resultater med færre ressurser. Dette er spesielt viktig for enheter med begrensede beregningsressurser, som smarttelefoner eller innbygde systemer.

Ved å utvikle disse ferdighetene, kan LLM gå ut over å bare prosessere informasjon. De kan utføre meningsfulle handlinger, og baner vei for AI til å integrere sømløst i hverdagsoppgaver.

Hvordan Microsoft transformerer LLM

Microsofts tilnærming til å skape handleorientert AI følger en strukturert prosess. Det viktigste målet er å aktivere LLM til å forstå kommandoer, planlegge effektivt og utføre handlinger. Her er hvordan de gjør det:

Steg 1: Samle og forberede data

I den første fasen samlet de inn data relatert til deres spesifikke brukstilfeller: UFO Agent (beskrevet nedenfor). Dataene inkluderer brukerforespørsler, miljødetaljer og oppgave-spesifikke handlinger. To forskjellige typer data samles inn i denne fasen: først samlet de inn oppgave-plan data som hjelper LLM til å omriss high-level skritt nødvendig for å fullføre en oppgave. For eksempel, “Endre skriftstørrelse i Word” kan innebære skritt som å velge tekst og justere verktøylinjen. For det andre samlet de inn oppgave-handling data, som gjør det mulig for LLM å oversette disse skrittene til presise instruksjoner, som å klikke på bestemte knapper eller bruke tastaturkombinasjoner.

Denne kombinasjonen gir modellen både det store bildet og de detaljerte instruksjonene den trenger for å utføre oppgaver effektivt.

Steg 2: Trene modellen

Når dataene er samlet inn, blir LLM raffinert gjennom flere treningsøkter. I den første fasen blir LLM trenet for oppgave-planlegging ved å lære dem hvordan de kan bryte ned brukerforespørsler til handlebare skritt. Ekspert-merket data brukes så til å lære dem hvordan de kan oversette disse planene til spesifikke handlinger. For å ytterligere forbedre deres problemløsningsevner, har LLM engasjert i en selvforbedring utforsking prosess som gir dem mulighet til å takle uløste oppgaver og generere nye eksempler for kontinuerlig læring. Til slutt brukes forsterkingslæring, som bruker tilbakemelding fra suksesser og feil til å forbedre deres beslutningstagning.

Steg 3: Offline-testing

Etter treningsøkten, testes modellen i kontrollerte miljøer for å sikre pålitelighet. Metrikker som Oppgave-suksess-rate (TSR) og Steg-suksess-rate (SSR) brukes til å måle ytelse. For eksempel, testing av en kalenderhåndtering agent kan innebære å verifisere dens evne til å planlegge møter og sende invitasjoner uten feil.

Steg 4: Integrering i virkelige systemer

Når modellen er valideret, integreres den i et agent-rammeverk. Dette gjorde det mulig for den å interagere med virkelige miljøer, som å klikke på knapper eller navigere i menyer. Verktøy som UI-automatiserings-API hjalp systemet til å identifisere og manipulere brukergrensesnittselementer dynamisk.

For eksempel, hvis oppgaven er å highlighte tekst i Word, identifiserer agenten highlight-knappen, velger teksten og applies formatering. En minnekompoment kan hjelpe LLM til å holde styr på tidligere handlinger, og gjøre det mulig for den til å tilpasse seg nye scenarioer.

Steg 5: Virkelige testing

Det siste steget er online-evaluering. Her testes systemet i virkelige scenarioer for å sikre at det kan håndtere uventede endringer og feil. For eksempel, en kundesupport-bot kan guide brukere gjennom å tilbakestille en passord mens den tilpasser seg feilaktige inndata eller manglende informasjon. Denne testingen sikrer at AI er robust og klar for hverdagsbruk.

En praktisk eksempel: UFO Agent

For å vise hvordan handleorientert AI fungerer, utviklet Microsoft UFO Agent. Dette systemet er designet for å utføre virkelige oppgaver i Windows-miljøer, og omgjøre brukerforespørsler til fullførte handlinger.

I kjernen bruker UFO Agent en LLM til å tolke forespørsler og planlegge handlinger. For eksempel, hvis en bruker sier, “Highlight ordet ‘viktig’ i dette dokumentet,” interagerer agenten med Word for å fullføre oppgaven. Den samler inn kontekstuell informasjon, som posisjonen til brukergrensesnittselementer, og bruker denne til å planlegge og utføre handlinger.

UFO Agent bruker verktøy som Windows UI-automatisering (UIA) API. Denne API-en skanner applikasjoner for kontroll-elementer, som knapper eller menyer. For en oppgave som “Lagre dokumentet som PDF,” bruker agenten UIA til å identifisere “Fil”-knappen, finne “Lagre som”-alternativet og utføre nødvendige skritt. Ved å strukturere data på en konsistent måte, sikrer systemet en jevn drift fra treningsøkten til virkelige anvendelser.

Overvinning av utfordringer

Selv om dette er en spennende utvikling, kommer skaping av handleorientert AI med utfordringer. Skalbarhet er et stort problem. Treningsøkter og distribusjon av disse modellene over diverse oppgaver krever betydelige ressurser. Sikring av sikkerhet og pålitelighet er like viktig. Modellene må utføre oppgaver uten uventede konsekvenser, spesielt i sensitive miljøer. Og siden disse systemene interagerer med private data, er det også viktig å opprettholde etiske standarder rundt personvern og sikkerhet.

Microsofts veikart fokuserer på å forbedre effisiensen, utvide bruksområder og opprettholde etiske standarder. Med disse fremgangene kan LLM muligens omdefinere hvordan AI interagerer med verden, og gjøre dem mer praktiske, tilpassbare og handleorienterte.

Fremtiden for AI

Transformasjon av LLM til handleorienterte agenter kan være en game-changer. Disse systemene kan automatisere oppgaver, forenkle arbeidsflyter og gjøre teknologi mer tilgjengelig. Microsofts arbeid med handleorientert AI og verktøy som UFO Agent er bare begynnelsen. Etterhvert som AI utvikler seg, kan vi forvente smartere, mer kapable systemer som ikke bare interagerer med oss, men også får jobben gjort.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.