Modely a platformy AI
Metoda umožňuje umělým inteligencím uvažovat daleko do budoucnosti
Tým výzkumníků z MIT, MIT-IBM Watson AI Lab a dalších institucí vyvinul nový přístup, který umožňuje umělým inteligencím (AI) dosáhnout dlouhodobého pohledu. Jinými slovy, AI může uvažovat daleko do budoucnosti, když zvažuje, jak jejich chování může zahrnovat chování jiných AI agentů při dokončování úkolu.
Výzkum je naplánován k prezentaci na konferenci Conference on Neural Information Processing Systems.
Umělá inteligence zvažující budoucí akce jiných agentů
Framework pro strojové učení vytvořený týmem umožňuje kooperujícím nebo soutěžícím AI agentům zvažovat, co budou dělat ostatní agenti. To není jen pro následující kroky, ale spíše jak se čas blíží nekonečnu. Agenti přizpůsobují své chování podle toho, aby ovlivnili budoucí chování ostatních agentů, a tak dosáhnout optimálních, dlouhodobých řešení.
Podle týmu by mohl být framework použit například skupinou autonomních dronů, které spolupracují na nalezení ztraceného turistu. Může být také použit samořízenými vozidly, aby předpovídaly budoucí pohyby ostatních vozidel a zlepšily bezpečnost cestujících.
Dong-Ki Kim je doktorand v MIT Laboratory for Information and Decision Systems (LIDS) a hlavní autor výzkumné práce.
„Když AI agenti spolupracují nebo soutěží, nejvíce záleží na tom, kdy jejich chování konverguje v nějakém bodě v budoucnosti,“ říká Kim. „Existuje mnoho přechodných chování po cestě, která nejsou příliš důležitá v dlouhodobém horizontu. Dosáhnout tohoto konvergujícího chování je to, co nás opravdu zajímá, a nyní máme matematický způsob, jak to umožnit.“
Problém, který řeší výzkumníci, se nazývá multi-agentní učení s posilováním, přičemž učení s posilováním je forma strojového učení, při které AI agenti učí se prostřednictvím pokusů a omylů.
Whenever existuje více kooperujících nebo soutěžících agentů, kteří se učí současně, proces se může stát mnohem složitějším. Jak agenti zvažují více budoucích kroků ostatních agentů, stejně jako své vlastní chování a jak ovlivňuje ostatní, problém vyžaduje příliš mnoho výpočetní síly.
Umělá inteligence uvažující o nekonečnu
„AI agenti opravdu chtějí uvažovat o konci hry, ale nevědí, kdy hra skončí,“ říká Kim. „Musí uvažovat o tom, jak přizpůsobit své chování do nekonečna, aby mohli vyhrát v nějakém vzdáleném bodě v budoucnosti. Naše práce navrhuje nový cíl, který umožňuje AI uvažovat o nekonečnu.“
Je nemožné integrovat nekonečno do algoritmu, takže tým navrhl systém tak, aby agenti se zaměřili na budoucí bod, kde jejich chování konverguje s ostatními agenti. To se nazývá rovnováha, a bod rovnováhy určuje dlouhodobý výkon agentů.
Je možné, aby existovalo více rovnováh v multi-agentním scénáři, a když efektivní agent aktivně ovlivňuje budoucí chování ostatních agentů, mohou dosáhnout žádoucí rovnováhy z pohledu agenta. Když všichni agenti ovlivňují jeden druhého, konvergují k obecnému pojmu nazvanému „aktivní rovnováha“.
FURTHER Framework
Týmův framework pro strojové učení se nazývá FURTHER a umožňuje agentům učit se, jak přizpůsobit své chování na základě interakcí s ostatními agenti, aby dosáhli aktivní rovnováhy.
Framework se skládá ze dvou modulů strojového učení. První je inferenční modul, který umožňuje agentovi odhadnout budoucí chování ostatních agentů a algoritmy učení, které používají, na základě předchozích akcí. Informace jsou pak předány do modulu učení s posilováním, který agent používá k přizpůsobení svého chování a ovlivnění ostatních agentů.
„Výzvou bylo uvažovat o nekonečnu. Museli jsme použít mnoho různých matematických nástrojů, aby to fungovalo, a učinit einige předpoklady, aby to fungovalo v praxi,“ říká Kim.
Tým otestoval svou metodu proti ostatním multi-agentním frameworkům pro učení s posilováním v různých scénářích, kde AI agenti pomocí FURTHER vyšli před ostatní.
Přístup je decentralizovaný, takže agenti se učí nezávisle. Navíc je lépe navržen pro škálování ve srovnání s ostatními metodami, které vyžadují centrální počítač pro kontrolu agentů.
Podle týmu by mohl být FURTHER použit v širokém rozsahu multi-agentních problémů. Kim je zvláště optimistický ohledně jeho aplikací v ekonomice, kde by mohl být použit pro vývoj sound policy v situacích, které zahrnují mnoho interagujících entit s chováním a zájmy, které se mění v čase.












