AI-modellen en platforms
AI-agents demonstreren emergente intelligentie-eigenschappen in virtueel hide and seek
Een van de interessante feiten over het onderzoeken van AI is dat het vaak acties kan uitvoeren en strategieën kan volgen die de onderzoekers die ze ontwerpen, zelf verrassen. Dit gebeurde tijdens een recent virtueel spel van hide and seek waarbij meerdere AI-agents tegen elkaar werden uitgespeeld. Onderzoekers bij OpenAI, een AI-bedrijf gevestigd in San Francisco, waren verbaasd om te zien dat hun AI-agents strategieën begonnen te exploiteren in de spelwereld die de onderzoekers niet eens wisten dat ze bestonden.
OpenAI heeft een groep AI-agents getraind om een hide and seek-spel met elkaar te spelen. De AI-programma’s worden getraind met versterking leer, een techniek waarbij het gewenste gedrag wordt geëlicitteerd uit de AI-algoritmen door de algoritmen feedback te geven. De AI begint met het nemen van willekeurige acties, en elke keer dat het een actie neemt die het dichter bij zijn doel brengt, wordt de agent beloond. De AI wil zo veel mogelijk beloning krijgen, dus het zal experimenteren om te zien welke acties het de meeste beloning opleveren. Door trial and error is de AI in staat om strategieën te onderscheiden die het naar de overwinning zullen brengen, die het de meeste beloning zullen geven.
Versterking leer heeft al indrukwekkende successen laten zien bij het leren van de regels van spellen. OpenAI heeft onlangs een team van AI getraind om het MMORPG DOTA 2 te spelen, en de AI heeft vorig jaar een wereldkampioenschapsteam van menselijke spelers verslagen. Iets soortgelijks gebeurde met het spel StarCraft toen een AI werd getraind op het spel door DeepMind. Versterking leer is ook gebruikt om AI-programma’s te leren Pictionary te spelen met mensen, waarbij ze leren om afbeeldingen te interpreteren en basisgebruik van verstand te gebruiken.
In het hide and seek-videospel dat door de onderzoekers is gemaakt, werden meerdere AI-agents tegen elkaar uitgespeeld. Het resultaat was een soort wapenwedloop, waarbij elke agent de andere probeert te overtreffen en de meeste beloningpunten probeert te verdienen. Een nieuwe strategie die door een agent wordt aangenomen, zal zijn tegenstander ertoe brengen om een nieuwe strategie te zoeken om het te counteren, en vice versa. Igor Mordatch, een onderzoeker bij OpenAI, legde aan IEEE Spectrum uit dat het experiment aantoont dat dit proces van trial and error tussen agents “voldoende is voor de agents om verrassende gedragingen te leren – het is alsof kinderen met elkaar spelen.”
Wat waren de verrassende gedragingen precies? De onderzoekers hadden vier basisstrategieën die ze verwachtten dat de AI-agents zouden leren, en ze leerden deze redelijk snel, waardoor ze na slechts 25 miljoen gesimuleerde spellen competent werden. Het spel vond plaats in een 3D-omgeving vol met ramps, blokken en muren. De AI-agents leerden elkaar te achtervolgen, blokken te verplaatsen om forten te bouwen waarin ze zich konden verstoppen, en ramps te verplaatsen. De AI-zoekers leerden ramps te slepen om binnen te komen in de forten van de verstopppers, terwijl de verstopppers leerden om de ramps naar binnen te halen zodat de zoekers ze niet konden gebruiken.
Maar rond het benchmark van 380 miljoen spellen gebeurde er iets onverwachts. De AI-agents leerden twee strategieën te gebruiken die de onderzoekers niet hadden verwacht. De zoekers leerden dat ze, door op een doos te springen en deze te kantelen/berijden naar een nabijgelegen fort, in het fort konden springen en de verstopper konden vinden. De onderzoekers hadden niet eens door dat dit mogelijk was binnen de fysica van de spelomgeving. De verstopppers leerden om dit probleem op te lossen door de dozen op hun plaats te trekken binnen hun fort.
Terwijl het onverwachte gedrag van agents getraind met versterking leer algoritmen in dit geval onschadelijk is, roept het wel enkele potentiële zorgen op over hoe versterking leer wordt toegepast in andere situaties. Een lid van het OpenAI-onderzoeksteam, Bowen Baker, legde aan IEEE Spectrum uit dat deze onverwachte gedragingen potentieel gevaarlijk konden zijn. Wat als robots onverwacht zouden gaan gedragen?
“Het bouwen van deze omgevingen is moeilijk,” legde Baker uit. “De agents zullen deze onverwachte gedragingen komen met, die een veiligheidsprobleem zullen zijn in de toekomst wanneer je ze in meer complexe omgevingen plaatst.”
Maar Baker legde ook uit dat versterkingstrategieën tot innovatieve oplossingen voor huidige problemen konden leiden. Systemen getraind met versterking leer konden een breed scala aan problemen oplossen met oplossingen die we misschien niet eens kunnen voorstellen.












