AI-modeller og platforme

AI-agenter demonstrerer emergent intelligens egenskaber i virtuel gemmelseg

mm
Føj Unite.AI til dine foretrukne kilder på Google

En af de interessante ting ved at forske i AI er, at det ofte kan udføre handlinger og følge strategier, der overrasker selv de forskere, der designer dem. Dette skete under en seneste virtuel runde af gemmelseg, hvor flere AI-agenter blev sat op imod hinanden. Forskere ved OpenAI, et AI-firma baseret i San Francisco, blev overrasket over, at deres AI-agenter begyndte at udnytte strategier i spilverdenen, som forskerne ikke engang vidste eksisterede.

OpenAI har trænet en gruppe AI-agenter til at spille gemmelseg med hinanden. AI-programmerne er trænet med forstærkningslæring, en teknik, hvor det ønskede adfærd udvikles fra AI-algoritmerne ved at give algoritmerne feedback. AI’en starter med at udføre tilfældige handlinger, og hver gang den udfører en handling, der bringer den nærmere målet, belønnes agenten. AI’en ønsker at opnå den maksimale mængde belønning, så den vil eksperimentere for at se, hvilke handlinger giver den mest belønning. Gennem prøver og fejl er AI’en i stand til at skelne mellem strategier, der vil føre til sejr, og dem, der giver den mest belønning.

Forstærkningslæring har allerede demonstreret imponerende succes med at lære reglerne for spil. OpenAI trænede for nylig et hold af AI til at spille MMORPG DOTA 2, og AI’en besejrede et verdensmesterhold af menneskelige spillere sidste år. En lignende ting skete med spillet StarCraft, da en AI blev trænet på spillet af DeepMind. Forstærkningslæring er også blevet brugt til at lære AI-programmer til at spille Pictionary med mennesker, hvor de lærer at fortolke billeder og bruge grundlæggende sund fornuft.

I gemmelseg-videospillet, som forskerne skabte, blev flere AI-agenter sat op imod hinanden. Resultatet var en våbenkapløb, hvor hver agent ønskede at overgå den anden og opnå flest belønningspoint. En ny strategi, som en agent udviklede, ville få dens modstander til at søge en ny strategi for at modstå den, og vice versa. Igor Mordatch, en forsker ved OpenAI, forklarede til IEEE Spectrum, at eksperimentet demonstrerer, at denne proces af prøver og fejl mellem agenter “er nok til, at agenterne kan lære overraskende adfærd på egen hånd – det er som børn, der leger med hinanden.”

Hvad var de overraskende adfærder præcis? Forskerne havde fire grundlæggende strategier, som de forventede, at AI-agenterne ville lære, og de lærte disse ret hurtigt, og blev kompetente i dem efter kun 25 millioner simulerede spil. Spillet fandt sted i en 3D-miljø fuld af ramper, blokke og vægge. AI-agenterne lærte at jagte hinanden rundt, flytte blokke for at bygge fæstninger, de kunne gemme sig i, og flytte ramper rundt. AI-søgerne lærte at trække ramper rundt for at komme ind i gemmernes fæstninger, mens gemmernes lærte at prøve at tage rampen ind i deres fæstninger, så søgerne ikke kunne bruge den.

Men omkring benchmarket på 380 millioner spil skete noget uventet. AI-agenterne lærte at bruge to strategier, som forskerne ikke havde forventet. Søger-agenterne lærte, at ved at hoppe op på en kasse og vippe/køre kassen mod en nærliggende fæstning, kunne de hoppe ind i fæstningen og finde gemmeren. Forskerne havde ikke engang bemærket, at dette var muligt inden for spillets fysik. Gemmernes lærte at håndtere dette problem ved at trække kasserne ind i deres fæstning.

Mens den uventede adfærd hos agenter, der er trænet med forstærkningslæring, er harmløs i denne instance, rejser det dog nogle potentielle bekymringer om, hvordan forstærkningslæring anvendes i andre situationer. En medlem af OpenAI-forskningsholdet, Bowen Baker, forklarede til IEEE Spectrum, at disse uventede adfærder kunne potentielt være farlige. Hvad nu, hvis robotter begyndte at opføre sig på uventede måder?

“At bygge disse miljøer er svært,” forklarede Baker. “Agenterne vil komme op med disse uventede adfærder, som vil være et sikkerhedsproblem længere nede ad vejen, når du sætter dem i mere komplekse miljøer.”

Men Baker forklarede også, at forstærkningsstrategier kunne føre til innovative løsninger på nuværende problemer. Systemer, der er trænet med forstærkningslæring, kunne løse en bred vifte af problemer med løsninger, vi måske ikke engang kan forestille os.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.