AGI a budoucnost AI
Velké akční modely (LAM): Nová hranice v interakcích s umělou inteligencí
Téměř před rokem Mustafa Suleyman, spoluzakladatel DeepMind, předpověděl, že éra generativní umělé inteligence brzy povede k něčemu interaktivnějšímu: systémy schopné provádět úkoly interagující se softwarovými aplikacemi a lidskými zdroji. Dnes začínáme vidět, jak se toto vidění projevuje ve vývoji Rabbit AI nového operačního systému s umělou inteligencí, R1. Tento systém prokázal působivou schopnost monitorovat a napodobovat lidské interakce s aplikacemi. V srdci R1 leží Velký akční model (LAM), pokročilý asistent umělé inteligence schopen pochopit úmysly uživatelů a vykonávat úkoly na jejich behalf. Ačkoli dříve známý pod jinými názvy, jako interaktivní umělé inteligence a Velký agentic model, koncept LAM získává momentum jako zásadní inovace v interakcích s umělou inteligencí. Tento článek zkoumá detaily LAM, jak se liší od tradičních velkých jazykových modelů (LLM), představuje systém Rabbit AI R1 a zkoumá, jak Apple (AAPL ) směřuje k LAM-inspirovanému přístupu. Dále diskutuje o potenciálních aplikacích LAM a výzvách, kterým čelí.
Pochopení velkých akčních nebo agentic modelů (LAM)
LAM je pokročilý agent umělé inteligence navržen pro pochopení lidských úmyslů a vykonávání specifických cílů. Tyto modely vynikají v pochopení lidských potřeb, plánování složitých úkolů a interakcí s různými modely, aplikacemi nebo lidmi za účelem plnění svých plánů. LAM jdou za rámec jednoduchých úkolů umělé inteligence, jako je generování odpovědí nebo obrázků; jsou plnohodnotné systémy navržené pro zpracování složitých aktivit, jako je plánování cest, plánování schůzek a správa e-mailů. Například při plánování cest by LAM koordinoval s aplikací pro počasí pro předpovědi, interagoval s službami pro rezervaci letů, aby našel vhodné lety, a zapojil se s systémy pro rezervaci hotelů, aby zajistil ubytování. Na rozdíl od mnoha tradičních modelů umělé inteligence, které závisí pouze na neuronových sítích, LAM využívají hybridní přístup kombinující neuro-symbolické programování. Toto integrované symbolické programování usnadňuje logické uvažování a plánování, zatímco neuronové sítě přispívají k rozpoznávání složitých senzorických vzorců. Tento mix umožňuje LAM řešit širokou škálu úkolů, což je jemný vývoj v interakcích s umělou inteligencí.
Srovnání LAM s LLM
Na rozdíl od LAM jsou LLM agenti umělé inteligence, kteří vynikají v interpretaci uživatelských příkazů a generování textových odpovědí, pomáhajících především s úkoly, které zahrnují zpracování jazyka. Jejich rozsah je však obecně omezen na textově související aktivity. Na druhé straně LAM rozšiřují schopnosti umělé inteligence za rámec jazyka, umožňující jim provádět komplexní akce pro dosažení specifických cílů. Například zatímco LLM by mohl účinně vypracovat e-mail na základě uživatelských instrukcí, LAM jde dále, nejen vypracovává, ale také chápe kontext, rozhoduje o vhodné odpovědi a spravuje doručování e-mailu.
Navíc jsou LLM obvykle navrženy tak, aby předpovídaly další token v sekvenci textu a vykonávaly psané instrukce. Na rozdíl od toho jsou LAM vybaveny nejen jazykovým porozuměním, ale také schopností interagovat s různými aplikacemi a skutečnými systémy, jako jsou zařízení IoT. Mohou provádět fyzické akce, ovládat zařízení a spravovat úkoly, které vyžadují interakci se skutečným prostředím, jako je rezervace schůzek nebo objednání rezervací. Toto propojení jazykových dovedností s praktickou realizací umožňuje LAM fungovat v různých scénářích než LLM.
LAM v akci: Rabbit R1
Rabbit R1 je prominentním příkladem LAM v praktickém použití. Tento zařízení s umělou inteligencí může spravovat multiple aplikace prostřednictvím jediného, uživatelsky přívětivého rozhraní. S 2,88palcovým dotykovým displejem, rotačním fotoaparátem a posuvníkem je R1 umístěn v elegantním, zaobleném pouzdru vytvořeném ve spolupráci s Teenage Engineering. Provozuje se na 2,3GHz procesoru MediaTek, posíleném 4GB paměti a 128GB úložištěm.
V srdci R1 leží jeho LAM, který inteligentně dohlíží na funkcionality aplikací a zjednodušuje složitější úkoly, jako je ovládání hudby, rezervace dopravy, objednání potravin a odesílání zpráv, vše z jednoho místa interakce. Tímto způsobem R1 eliminuje obtížnost přepínání mezi několika aplikacemi nebo několika přihlášeními k provedení těchto úkolů.
LAM uvnitř R1 byl původně vyškolen pozorováním lidských interakcí s populárními aplikacemi, jako je Spotify a Uber. Tento trénink umožnil LAM navigovat uživatelská rozhraní, rozpoznávat ikony a zpracovávat transakce. Tento rozsáhlý trénink umožňuje R1 přizpůsobit se hladce téměř jakékoli aplikaci. Kromě toho speciální tréninkový režim umožňuje uživatelům zavést a automatizovat nové úkoly, neustále rozšiřující rozsah schopností R1 a činí jej dynamickým nástrojem v oblasti interakcí s umělou inteligencí.
Appleova pokročila směrem k LAM-inspirovaným schopnostem v Siri
Appleův tým pro výzkum umělé inteligence nedávno sdílel poznatky o svých snahách pokročit v schopnostech Siri prostřednictvím nové iniciativy, podobné těm u LAM. Iniciativa, popsána v výzkumném článku o Reference Resolution As Language Modeling (ReALM), má za cíl zlepšit schopnost Siri porozumět konverzačnímu kontextu, zpracovat vizuální obsah na obrazovce a detekovat okolní aktivity. Přístup přijatý ReALM při zpracování vstupů z uživatelského rozhraní (UI) připomíná funkcionality pozorované u Rabbit AI R1, ukazující Appleův záměr vylepšit porozumění Siri uživatelům.
Tento vývoj ukazuje, že Apple zvažuje přijetí technologií LAM pro zlepšení interakce uživatelů se svými zařízeními. Ačkoli nejsou žádné explicitní oznámení o nasazení ReALM, potenciál pro podstatné zlepšení interakce Siri s aplikacemi naznačuje slibné pokroky v tom, aby se asistent stal více intuitivním a reaktivním.
Potenciální aplikace LAM
LAM mají potenciál rozšířit svůj dopad daleko za hranice zlepšování interakcí mezi uživateli a zařízeními; mohli by poskytnout významné výhody v několika odvětvích.
- Zákaznické služby: LAM mohou zlepšit zákaznické služby nezávisle zpracováváním dotazů a stížností napříč různými kanály. Tyto modely mohou zpracovat dotazy pomocí přirozeného jazyka, automatizovat řešení a spravovat plánování, poskytovat personalizovanou službu na základě historie zákazníků, aby se zlepšila spokojenost.
- Zdravotnictví: Ve zdravotnictví mohou LAM pomoci spravovat péči o pacienty organizováním schůzek, správou předpisů a usnadňováním komunikace napříč službami. Jsou také užitečné pro vzdálené monitorování, interpretaci lékařských dat a upozorňování personálu v případě nouze, zejména prospěšné pro péči o chronicky nemocné a seniory.
- Finance: LAM mohou nabízet personalizovaná finanční doporučení a spravovat úkoly, jako je vyvážení portfolia a investiční návrhy. Mohou také monitorovat transakce, aby detekovaly a zabránily podvodům, integrující se hladce s bankovními systémy, aby rychle řešily podezřelé aktivity.
Výzvy LAM
Navzdory jejich značnému potenciálu, LAM čelí několika výzvám, které je třeba řešit.
- Ochrana osobních údajů a bezpečnost: Vzhledem k širokému přístupu k osobním a citlivým informacím, které LAM potřebují k fungování, zajištění ochrany osobních údajů a bezpečnosti je velkou výzvou. LAM interagují s osobními údaji napříč několika aplikacemi a platformami, což vyvolává obavy o bezpečné zpracování, uložení a zpracování těchto informací.
- Etické a regulační problémy: Jak LAM přebírají více autonomních rolí v rozhodování a interakcích s lidským prostředím, etické úvahy se stávají stále důležitějšími. Otázky o odpovědnosti, transparentnosti a rozsahu rozhodnutí, která jsou delegována na stroje, jsou kritické. Kromě toho mohou existovat regulační výzvy při nasazení tak pokročilých systémů umělé inteligence v různých odvětvích.
- Složitost integrace: LAM vyžadují integraci s různými softwarovými a hardwarovými systémy, aby úkoly plnily efektivně. Tato integrace je složitá a může být obtížná, zejména při koordinaci akcí napříč různými platformami a službami, jako je rezervace letů, ubytování a dalších logistických detailů v reálném čase.
- Škálovatelnost a adaptabilita: Zatímco LAM jsou navrženy tak, aby se přizpůsobily širokému spektru scénářů a aplikací, škálování těchto řešení, aby zvládly rozmanité, skutečné prostředí konzistentně a efektivně, zůstává výzvou. Zajištění toho, aby LAM mohli přizpůsobit se měnícím se podmínkám a udržet výkon napříč různými úkoly a uživatelskými potřebami, je zásadní pro jejich dlouhodobý úspěch.
Závěrečné shrnutí
Velké akční modely (LAM) se objevují jako významná inovace v oblasti umělé inteligence, ovlivňující nejen interakce zařízení, ale také širší aplikace v odvětvích. Demonstrované systémem Rabbit AI R1 a prozkoumané v pokrocích Apple s Siri, LAM nastavují scénu pro více interaktivní a intuitivní systémy umělé inteligence. Tyto modely jsou připraveny zlepšit efektivitu a personalizaci v sektorech, jako je zákaznická služba, zdravotnictví a finance.
Nicméně, nasazení LAM přichází s výzvami, včetně obav o ochranu osobních údajů, etických problémů, složitosti integrace a škálovatelnosti. Řešení těchto problémů je nezbytné, zatímco postupujeme směrem k širšímu přijetí technologií LAM, snažících se využít jejich schopností odpovědně a efektivně. Jak LAM pokračují ve vývoji, jejich potenciál transformovat digitální interakce zůstává podstatný, zdůrazňující jejich důležitost v budoucím krajině umělé inteligence.












