Modely a platformy AI

Od záměru k provedení: Jak Microsoft transformuje velké jazykové modely na akčně orientovanou umělou inteligenci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velké jazykové modely (LLM) změnily způsob, jakým zpracováváme přirozený jazyk. Mohou odpovídat na otázky, psát kód a vést konverzace. Nicméně, selhávají, když se jedná o reálné úkoly. Například LLM může vést uživatele při nákupu saka, ale nemůže objednávku provést. Tato mezera mezi myšlením a jednáním je významným omezením. Lidé nepotřebují pouze informace; chtějí výsledky.

Aby se tato mezera překlenula, Microsoft (MSFT ) mění LLM na akčně orientované umělou inteligenci. Povolením jim plánovat, rozkládat úkoly a zapojovat se do reálných interakcí, Microsoft umožňuje LLM efektivně řídit praktické úkoly. Tento posun má potenciál předefinovat, co LLM mohou dělat, měníc je na nástroje, které automatizují složitý workflow a zjednodušují každodenní úkoly. Podívejme se, co je potřeba k tomu, aby se to stalo, a jak Microsoft přistupuje k problému.

Co LLM potřebují k akci

Aby LLM mohli provádět úkoly v reálném světě, musí jít za hranice porozumění textu. Musí interagovat s digitálními a fyzickými prostředími a přizpůsobovat se měnícím se podmínkám. Zde jsou některé z schopností, které potřebují:

  1. Porozumění uživatelskému záměru

Aby LLM mohli jednat efektivně, musí porozumět uživatelským požadavkům. Vstupy, jako je text nebo hlasové příkazy, jsou často vágní nebo neúplné. Systém musí vyplnit mezery pomocí svých znalostí a kontextu požadavku. Více krokové konverzace mohou pomoci upřesnit tyto záměry, zajišťující, že AI porozumí, než provede akci.

  1. Převod záměrů na akce

Po porozumění úkolu musí LLM převést jej na proveditelné kroky. To může zahrnovat kliknutí na tlačítka, volání API nebo ovládání fyzických zařízení. LLM musí přizpůsobit své akce konkrétnímu úkolu, přizpůsobovat se prostředí a řešit problémy, jakmile vzniknou.

  1. Přizpůsobení se změnám

Reálné úkoly se ne vždy daří podle plánu. LLM musí předvídat problémy, upravit kroky a najít alternativy, když nastanou problémy. Například, pokud není k dispozici nezbytný zdroj, systém by měl najít jiný způsob, jak úkol dokončit. Tato flexibilita zajišťuje, že proces se nezastaví, když se věci změní.

  1. Specializace na konkrétní úkoly

Zatímco LLM jsou navrženy pro obecné použití, specializace je činí efektivnějšími. Soustředěním se na konkrétní úkoly, tyto systémy mohou dosáhnout lepších výsledků s menšími zdroji. To je especialmente důležité pro zařízení s omezenou výpočetní silou, jako jsou smartphony nebo vestavěné systémy.

Rozvíjením těchto dovedností mohou LLM jít za hranice pouhého zpracování informací. Mohou provádět smysluplné akce, připravující cestu pro umělou inteligenci, aby se integrovala bezproblémově do každodenních workflow.

Jak Microsoft transformuje LLM

Microsoftův přístup ke tvorbě akčně orientované umělou inteligenci následuje strukturovaný proces. Hlavním cílem je umožnit LLM porozumět příkazům, plánovat efektivně a provádět akce. Zde je, jak to dělají:

Krok 1: Sběr a příprava dat

V první fázi shromáždili data související s jejich konkrétními použitími: UFO Agent (popisovaný níže). Data zahrnují uživatelské dotazy, environmentální podrobnosti a úkol-specifické akce. Dva různé typy dat jsou sbírány v této fázi: poprvé, shromáždili data o plánech úkolů, která pomáhají LLM navrhnout vysoké úrovně kroků požadovaných k dokončení úkolu. Například “Změnit velikost písma ve Wordu” by mohlo zahrnovat kroky, jako je výběr textu a úpravu nástrojové lišty. Za druhé, shromáždili data o akcích úkolů, která umožňují LLM přeložit tyto kroky do přesných instrukcí, jako je kliknutí na konkrétní tlačítka nebo použití klávesových zkratek.

Toto kombinace poskytuje modelu jak velký obraz, tak i podrobné instrukce, které potřebuje k provedení úkolů efektivně.

Krok 2: Školení modelu

Jakmile jsou data shromážděna, LLM jsou vylepšena prostřednictvím několika školicích sezení. V prvním kroku jsou LLM školeny pro plánování úkolů, učí se, jak rozložit uživatelské požadavky na proveditelné kroky. Odborně označená data jsou poté použita k učení, jak tyto plány přeložit do konkrétních akcí. K dalšímu vylepšení jejich problémových schopností se LLM účastní samo-zesilujícího procesu průzkumu, který jim umožňuje řešit nevyřešené úkoly a generovat nové příklady pro kontinuální učení. Nakonec je aplikováno učení s posílením, které používá zpětnou vazbu z úspěchů a selhání k dalšímu vylepšení jejich rozhodování.

Krok 3: Offline testování

Po školení je model testován v kontrolovaném prostředí, aby se zajistila spolehlivost. Metriky, jako je Úspěšnost úkolů (TSR) a Úspěšnost kroků (SSR), se používají k měření výkonu. Například testování agenta pro správu kalendáře by mohlo zahrnovat ověření jeho schopnosti naplánovat schůzky a odeslat pozvánky bez chyb.

Krok 4: Integrace do reálných systémů

Jakmile je model ověřen, je integrován do agentního frameworku. To mu umožňuje interagovat s reálnými prostředími, jako je kliknutí na tlačítka nebo navigace v menu. Nástroje, jako je UI Automation API, pomáhají systému identifikovat a manipulovat prvky uživatelského rozhraní dynamicky.

Například, pokud je úkol highlighting textu ve Wordu, agent identifikuje tlačítko pro highlighting, vybere text a aplikuje formátování. Komponenta paměti by mohla pomoci LLM sledovat minulé akce, umožňující mu přizpůsobovat se novým scénářům.

Krok 5: Reálné testování

Konečným krokem je online hodnocení. Zde je systém testován v reálných scénářích, aby se zajistilo, že může zvládnout neočekávané změny a chyby. Například, bot pro zákaznickou podporu by mohl vést uživatele při resetování hesla, zatímco se přizpůsobuje nesprávným vstupům nebo chybějícím informacím. Toto testování zajišťuje, že AI je robustní a připravená pro každodenní použití.

Praktický příklad: UFO Agent

Aby se ukázalo, jak akčně orientovaná umělá inteligence funguje, Microsoft vyvinul UFO Agent. Tento systém je navržen pro provedení reálných úkolů ve Windows prostředí, měnící uživatelské požadavky na dokončené akce.

V jádru UFO Agent používá LLM k interpretaci požadavků a plánování akcí. Například, pokud uživatel řekne, “Highlightujte slovo ‘important’ v tomto dokumentu,” agent interaguje s Wordem, aby dokončil úkol. Shromažďuje kontextuální informace, jako je poloha ovládacích prvků, a používá je k plánování a provedení akcí.

UFO Agent spoléhá na nástroje, jako je Windows UI Automation (UIA) API. Tento API skenuje aplikace pro ovládací prvky, jako jsou tlačítka nebo menu. Pro úkol, jako je “Uložit dokument jako PDF,” agent používá UIA k identifikaci tlačítka “Soubor”, najít možnost “Uložit jako” a provést nezbytné kroky. Strukturováním dat konzistentně zajišťuje systém hladký provoz od školení po reálné použití.

Překonání výzev

Zatímco je toto vývoj fascinující, vytváření akčně orientované umělou inteligenci přichází s výzvami. Škálovatelnost je významným problémem. Školení a nasazení těchto modelů napříč různými úkoly vyžaduje značné zdroje. Zajištění bezpečnosti a spolehlivosti je stejně důležité. Modely musí provádět úkoly bez neúmyslných důsledků, zejména v citlivých prostředích. A protože tyto systémy interagují s privátními daty, je také důležité udržovat etické standardy kolem ochrany soukromí a bezpečnosti.

Microsoftův roadmap se zaměřuje na zlepšení efektivity, rozšiřování použití a udržování etických standardů. S těmito pokroky by LLM mohly předefinovat, jak umělá inteligence interaguje se světem, činící je více praktickými, přizpůsobivými a akčně orientovanými.

Budoucnost AI

Transformace LLM na akčně orientované agenty by mohla být zásadním posunem. Tyto systémy mohou automatizovat úkoly, zjednodušit workflow a učinit technologie více přístupnými. Microsoftova práce na akčně orientované umělou inteligenci a nástroji, jako je UFO Agent, je teprve začátek. Jak umělá inteligence pokračuje ve vývoji, můžeme očekávat chytřejší, schopnější systémy, které neinteragují pouze s námi, ale také dokončují úkoly.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.