AI-mallit ja alustat
Intentionsta toimintaan: Miten Microsoft muuttaa suuria kielenmalleja toimintasuuntautuneeksi tekoälyksi
Suuret kielenmallit (LLM) ovat muuttaneet tapaa, jolla käsittelemme luonnollista kieltä. Ne voivat vastata kysymyksiin, kirjoittaa koodia ja pitää keskustelua. Kuitenkin ne eivät pysty suorittamaan todellisia tehtäviä. Esimerkiksi LLM voi opastaa sinua ostamaan takin, mutta se ei voi tehdä tilausta puolestasi. Tämä kuilu ajattelun ja tekemisen välillä on suuri rajoitus. Ihmiset eivät tarvitse vain tietoa; he haluavat tuloksia.
Microsoft (MSFT ) on muuttamassa LLM: ä toimintasuuntautuneiksi tekoälyagenneiksi. Sallimalla niiden suunnitella, hajottaa tehtäviä ja osallistua todellisiin vuorovaikutuksiin, he antavat LLM: ä pystyvyyden hallita tehokkaasti käytännön tehtäviä. Tämä muutos voi uudelleenmääritellä, mitä LLM: ä voivat tehdä, muuttaen ne työkaluiksi, jotka automatisoivat monimutkaisia työnkulkuja ja yksinkertaistavat arkipäivän tehtäviä. Tarkastellaan, mitä tarvitaan tämän toteuttamiseksi ja miten Microsoft lähestyy ongelmaa.
Mitä LLM: ä tarvitsevat toimia
LLM: ä pystyäkseen suorittamaan tehtäviä todellisessa maailmassa, ne tarvitsevat ymmärtää tekstiä. Ne tarvitsevat vuorovaikutusta sekä digitaalisen että fyysisen ympäristön kanssa ja sopeutumista muuttuviin olosuhteisiin. Tässä on joitakin kyvykkyyksiä, joita niiden tarvitsee:
-
Ymmärtäminen käyttäjän aikomusta
Toimiakseen tehokkaasti LLM: ä tarvitsevat ymmärtää käyttäjän pyynnöt. Syötteet, kuten teksti tai äänikomennot, ovat usein epätarkkoja tai puutteellisia. Järjestelmän on täytettävä aukot sen tiedon ja pyynnön kontekstin avulla. Monivaiheiset keskustelut voivat auttaa tarkentamaan näitä aikomuksia, varmistamalla, että tekoäly ymmärtää ennen toimimista.
-
Muuttaminen aikomuksista toiminnaksi
Kun tehtävä on ymmärretty, LLM: ä on muunnettava se toimiviksi askeliksi. Tämä voi vaatia painamista, API-työkalujen kutsumista tai fyysisten laitteiden ohjaamista. LLM: ä on muokattava toimiaan tehtävän mukaan, sopeutumalla ympäristöön ja ratkaisemalla ongelmia, jotka ilmenevät.
-
Soveltuminen muutoksiin
Todelliset tehtävät eivät aina suju kaiken aikaa suunnitelmien mukaan. LLM: ä on ennakoidettava ongelmia, muokattava askelia ja löydettävä vaihtoehtoja, kun ongelmia ilmenee. Esimerkiksi, jos tarvittavaa resurssia ei ole saatavilla, järjestelmän on löydettävä toinen tapa suorittaa tehtävä. Tämä joustavuus varmistaa, että prosessi ei tyrehty, kun asioita muutetaan.
-
Erikoistuminen tiettyihin tehtäviin
Vaikka LLM: ä on suunniteltu yleiseen käyttöön, erikoistuminen tekee niistä tehokkaampia. Keskitettyään tiettyihin tehtäviin, nämä järjestelmät voivat tarjota parempia tuloksia vähemmällä resursseilla. Tämä on erityisen tärkeää laitteilla, joilla on rajoitettu laskentakapasiteetti, kuten älypuhelimilla tai upotetuilla järjestelmillä.
Kehittämällä näitä taitoja LLM: ä voivat siirtyä yksinomaan tietojen prosessoinnista tarkoituksenmukaisiin toimiin, luoden tien tekoälyn sulauttamiseksi saumattomasti arkipäivän työnkulkuun.
Miten Microsoft muuttaa LLM: ä
Microsoftin lähestymistapa toimintasuuntautuneen tekoälyn luomiseen noudattaa jäsenneltyä prosessia. Tärkein tavoite on antaa LLM: ä pystyvyys ymmärtää käskyjä, suunnitella tehokkaasti ja toimia. Tässä on, miten he tekevät sitä:
Vaihe 1: Datankerääminen ja valmistelu
Ensimmäisessä vaiheessa he keräävät dataa, joka liittyy heidän tiettyihin käyttötarkoituksiin: UFO Agent (ks. alla). Data sisältää käyttäjän kysymyksiä, ympäristönsä yksityiskohtia ja tehtäväkohtaisia toimia. Kaksi eri tyyppiä dataa kerätään tässä vaiheessa: ensinnäkin, he keräävät tehtäväsuunnitelmadatan, joka auttaa LLM: ä luomaan korkean tason askelia tehtävän suorittamiseksi. Esimerkiksi “Muuta fonttikokoa Wordissa” voi vaatia askelia, kuten valitsemalla tekstin ja säätämällä työkalupalkkia. Toiseksi, he keräävät tehtävätodatan, joka mahdollistaa LLM: ä kääntää nämä askelia tarkoituksenmukaisiksi ohjeiksi, kuten napsauttamalla tiettyjä painikkeita tai käyttämällä näppäimistön pikanäppäimiä.
Tämä yhdistelmä antaa mallille sekä suuren kuvan että yksityiskohtaiset ohjeet, joita tarvitaan tehtävien suorittamiseen tehokkaasti.
Vaihe 2: Mallin koulutus
Kun data on kerätty, LLM: ä hienonnetaan useiden koulutussessioiden kautta. Ensimmäisessä vaiheessa LLM: ä koulutetaan tehtävien suunnittelulle opettamalla niitä, miten käyttäjän pyynnöt voidaan hajottaa toimiviksi askeliksi. Asiantuntijoiden merkitty dataa käytetään opettamaan niille, miten nämä suunnitelmat voidaan kääntää tarkoituksenmukaisiksi toimiksi. Lisäksi LLM: ä osallistuu itseään vahvistavaan tutkimusprosessiin, joka antaa niille mahdollisuuden ratkaista ratkaisemattomia tehtäviä ja luoda uusia esimerkkejä jatkuvaan oppimiseen. Lopuksi vahvistusoppimista sovelletaan, jossa käytetään palautetta onnistumisista ja epäonnistumisista päätöksenteon parantamiseksi.
Vaihe 3: Offline-testaus
Koulutuksen jälkeen malli testataan ohjatuissa ympäristöissä varmistamaan sen luotettavuus. Mittareita, kuten tehtävän onnistumisprosentti (TSR) ja askelten onnistumisprosentti (SSR), käytetään suorituskyvyn mittaamiseen. Esimerkiksi kalenterin hallintaa koskevan agentin testaaminen voi vaatia vahvistamista sen kyvystä aikatauluttaa tapaamisia ja lähettää kutsuja ilman virheitä.
Vaihe 4: Integrointi todellisiin järjestelmiin
Kun malli on validoituna, se integroidaan agenttirunkoon. Tämä mahdollisti sen vuorovaikutuksen todellisten ympäristöjen kanssa, kuten painikkeiden napsauttamisen tai valikoiden navigoinnin. Työkalut, kuten UI-automatiikan API, auttoivat järjestelmää tunnistamaan ja manipuloimaan käyttöliittymäelementtejä dynaamisesti.
Esimerkiksi, jos tehtävänä on korostaa tekstiä Wordissa, agentti tunnistaa korostuspainikkeen, valitsee tekstin ja soveltaa muotoilua. Muistiosakomponentti voi auttaa LLM: ä pitämään kirjaa aiemmista toimista, mahdollistaen sopeutumisen uusiin tilanteisiin.
Vaihe 5: Todellisen maailman testaus
Viimeinen vaihe on online-arviointi. Tässä vaiheessa järjestelmä testataan todellisissa skenaarioissa varmistamaan, että se pystyy hallitsemaan odottamattomia muutoksia ja virheitä. Esimerkiksi asiakastukipalvelu voi opastaa käyttäjiä salasanan resetoimisessa sopeutumalla virheellisiin syötteisiin tai puuttuviin tietoihin. Tämä testaus varmistaa, että tekoäly on luotettava ja valmis arkipäivän käyttöön.
Käytännön esimerkki: UFO Agent
Näyttääkseen, miten toimintasuuntautunut tekoäly toimii, Microsoft kehitti UFO Agentin. Tämä järjestelmä on suunniteltu suorittamaan todellisia tehtäviä Windows-ympäristöissä, muuttaen käyttäjän pyynnöt suoritetuiksi toimiksi.
Sen ytimessä UFO Agent käyttää LLM: ä pyyntöjen tulkitsemiseen ja toimien suunnitteluun. Esimerkiksi, jos käyttäjä sanoo, “Korosta sana ‘tärkeä’ tässä asiakirjassa”, agentti vuorovaikuttaa Wordin kanssa tehtävän suorittamiseksi. Se kerää kontekstuaalista tietoa, kuten käyttöliittymäelementtien sijainteja, ja käyttää tätä tietoa toimien suunnitteluun ja suorittamiseen.
UFO Agent riippuu työkaluista, kuten Windowsin UI-automatiikan (UIA) API:sta. Tämä API skannaa sovelluksia ohjaus-elementeille, kuten painikkeille tai valikoille. Tehtävän, kuten “Tallenna asiakirja PDF:nä”, agentti käyttää UIA:ta tunnistamaan “Tiedosto”-painikkeen, löytämään “Tallenna nimellä” -vaihtoehdon ja suorittamaan tarvittavat askelten. Järjestelmän rakenteen ollessa johdonmukainen, se varmistaa sulavan toiminnan koulutuksesta todelliseen soveltamiseen.
Haasteiden voittaminen
Vaikka tämä on jännittävä kehitys, toimintasuuntautuneen tekoälyn luominen tuo mukanaan haasteita. Mittakaavuus on suuri ongelma. Näiden mallien koulutus ja käyttöönotto moninaisissa tehtävissä vaativat merkittäviä resursseja. Turvallisuuden ja luotettavuuden varmistaminen on yhtä tärkeää. Malleilla on toimittava tehtävät ilman tahattomia seurauksia, erityisesti herkillä alueilla. Ja koska nämä järjestelmät vuorovaikuttavat yksityisen datan kanssa, ylläpitäminen eettisiä standardeja yksityisyyden ja turvallisuuden suhteen on myös tärkeää.
Microsoftin tiekartta keskittyy tehokkuuden parantamiseen, käyttötapausten laajentamiseen ja eettisten standardien ylläpitämiseen. Näiden edistysten myötä LLM: ä voivat uudelleenmääritellä, miten tekoäly vuorovaikuttaa maailman kanssa, tehdäkseen niistä käytännöllisempiä, sopeutuvampia ja toimintasuuntautuneita.
Tekoälyn tulevaisuus
Suurten kielenmallien muuttaminen toimintasuuntautuneiksi agenteiksi voi olla pelinmuuttaja. Nämä järjestelmät voivat automatisoida tehtäviä, yksinkertaistaa työnkulkuja ja tehdä teknologian helpommin saataville. Microsoftin työ toimintasuuntautuneen tekoälyn ja työkalujen, kuten UFO Agentin, parissa on vasta alku. Koska tekoäly jatkaa kehittymistään, voimme odottaa älykkäämpiä, kykykempiä järjestelmiä, jotka eivät vain vuorovaikuta kanssamme – ne saavuttavat tuloksia.












