AI-modeller og plattformer

AI-agenter demonstrerer emergent intelligensegenskaper i virtuell gjemmelse og søk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

En av de interessante faktene om å forske på AI er at det ofte kan utføre handlinger og følge strategier som overrasker selv forskerne som designer dem. Dette skjedde under et nylig virtuelt spill av gjemmelse og søk hvor flere AI-agenter ble satt opp mot hverandre. Forskere ved OpenAI, et AI-selskap basert i San Francisco, ble overrasket over å finne ut at deres AI-agenter startet å utnytte strategier i spillverdenen som forskerne ikke visste eksisterte.

OpenAI har trent en gruppe AI-agenter til å spille et gjemmelse- og søkespill med hverandre. AI-programmene er trenet med forsterkningslæring, en teknikk hvor det ønskede atferden fremkalles fra AI-algoritmene ved å gi algoritmene tilbakemelding. AI-en starter med å utføre tilfeldige handlinger, og hver gang den utfører en handling som bringer den nærmere målet, belønnes agenten. AI-ens mål er å oppnå maksimalt antall belønninger, så den vil eksperimentere for å se hvilke handlinger som gir den flest belønninger. Gjennom prøving og feiling er AI-en i stand til å skille mellom strategier som vil bringe den til seier, og de som vil gi den flest belønninger.

Forsterkningslæring har allerede demonstrert imponerende suksess i å lære reglene til spill. OpenAI har nylig trenet et lag av AI til å spille MMORPG DOTA 2, og AI-en beseiret et verdensmesterlag av menneskelige spillere i fjor. En lignende ting skjedde med spillet StarCraft da en AI ble trenet på spillet av DeepMind. Forsterkningslæring har også blitt brukt til å lære AI-programmer til å spille Pictionary med mennesker, og å lære å tolke bilder og bruke grunnleggende sunn fornuft.

I det virtuelle gjemmelse- og søkespillet som forskerne lagde, ble flere AI-agenter satt opp mot hverandre. Resultatet var en våpenkappløp av en art, der hver agent ønsker å overgå den andre og oppnå flest mulig belønningspoeng. En ny strategi som en agent tar i bruk, vil føre til at motstanderen søker en ny strategi for å motvirke den, og omvendt. Igor Mordatch, en forsker ved OpenAI, forklarte til IEEE Spectrum at eksperimentet demonstrerer at denne prosessen med prøving og feiling mellom agenter “er nok til at agentene kan lære overraskende atferd på egen hånd – det er som barn som leker med hverandre”.

Hva var de overraskende atferdene egentlig? Forskerne hadde fire grunnleggende strategier som de forventet at AI-agentene skulle lære, og de lærte disse ganske raskt, og ble kompetente i dem etter bare 25 millioner simuleringspill. Spillet foregikk i en 3D-omgivelse full av ramper, blokker og vegger. AI-agentene lærte å jage hverandre rundt, flytte blokker for å bygge festninger de kunne gjemme seg i, og flytte ramper rundt. AI-søkerne lærte å dra ramper rundt for å komme inn i gjemmerfestningene, mens gjemmere lærte å prøve å ta rampene inn i sine festninger så søkerne ikke kunne bruke dem.

Men rundt 380 millioner spill, skjedde noe uventet. AI-agentene lærte å bruke to strategier som forskerne ikke hadde forventet. Søkeragentene lærte at ved å hoppe opp på en boks og vippe/riide boksen mot en nærliggende festning, kunne de hoppe inn i festningen og finne gjemmeren. Forskerne hadde ikke engang realisert at dette var mulig innenfor spillens fysikk. Gjemmerne lærte å håndtere dette problemet ved å dra boksene inn i sine festninger.

Mens den uventede atferden til agenter trenet med forsterkningslæring er harmløs i denne instansen, kan det likevel reise noen potensielle bekymringer om hvordan forsterkningslæring brukes i andre situasjoner. En medlem av OpenAI-forskingsteamet, Bowen Baker, forklarte til IEEE Spectrum at disse uventede atferdene kunne være potensielt farlige. Hva hvis roboter begynte å oppføre seg på uventede måter?

“Å bygge disse omgivelsene er hardt,” forklarte Baker. “Agentene kommer opp med disse uventede atferdene, som vil bli et sikkerhetsproblem nedover veien når du setter dem i mer komplekse omgivelser.”

Men Baker forklarte også at forsterkningsstrategier kunne føre til innovative løsninger på nåværende problemer. Systemer trenet med forsterkningslæring kunne løse en bred rekke problemer med løsninger vi kanskje ikke engang kan forestille oss.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.