AI-modeller og platforme

Forskningsleder for Amazon Alexa mener, at Turing-testen er forældet

mm
Føj Unite.AI til dine foretrukne kilder på Google

Rohit Prasad, vicepræsident og chefvidenskabsmand for Alexa hos Amazon (AMZN ), har nylig argumenteret for, at Turing-testen, der længe har været brugt til at måle sofistikeringen af AI-modeller, bør pensioneres som en benchmark for AI.

Datamatiker og matematiker Alan Turing introducerede oprindeligt begrebet Turing-testen for mere end 70 år siden. Formålet med Turing-testen var at hjælpe med at besvare spørgsmålet om maskinintelligens, og bestemme, om en maskine var i stand til “tanke” i menneskers forstand. For at besvare dette spørgsmål argumenterede Turing for, at hvis maskiner kunne udvise konversationsadfærd så sofistikeret, at en menneskelig iagttager ikke kunne skelne mellem computerens dialog og en menneskelig dialog, skulle maskinen anses for at være i stand til tanke.

Turing-testens begrænsninger

Prasad argumenterede for, at Turing-testen er begrænset på mange måder, og at Turing selv også havde bemærket nogle af disse begrænsninger i sin oprindelige artikel. Da AI er blevet mere og mere integreret i alle aspekter af vores liv, er det mindre vigtigt, om AI er ulæselig fra et menneske, og mere, om interaktionerne med AI er gnidningsløse, argumenterede Prasad. Af denne grund bør Turing-testen anses for at være forældet og erstattet med mere nyttige benchmarks.

Prasad bemærkede, at mange tidlige chatbots var designede med henblik på at bestå Turing-testen, og at nogle chatbots i de seneste år har konsekvent formået at narre mere end en tredjedel af de menneskelige dommere (det krævede niveau til at bestå Turing-testen). Men at kunne efterligne menneskers talemønstre betyder ikke, at en maskine kan anses for at være “intelligent”. AI-modeller kan være ekstremt dygtige i ét område og ekstremt mangelfulde i andre, uden nogen form for generel intelligens. Trods dette forbliver Turing-testen en almindelig brugt benchmark for chatbots og digitale assistenter, med Prasad bemærkende, at forretningsledere og journalister konstant spørger, hvornår Alexa vil være i stand til at bestå Turing-testen.

Ifølge Prasad er et af de primære problemer med at bruge Turing-testen til at vurderer maskinintelligens, at den næsten fuldstændigt ignorerer maskiners evne til at slå op på information og udføre lynhurtige beregninger. AI-programmer indsætter kunstige pauser i svaret på komplicerede matematik- og geografi-spørgsmål for at narre mennesker, men de har et svar på sådanne spørgsmål næsten øjeblikkeligt. Ud over dette tager Turing-testen ikke AI’s øgende evne til at bruge data indsamlet af ydre sensorer i betragtning, og ignorerer, hvordan AI kan interagere med verden omkring dem gennem vision og bevægelsesalgoritmer, og kun afhænger af tekstkommunikation.

Skabelse af nye benchmarks

Prasad argumenterede for, at nye former for at måle intelligens skal skabes, metoder der er bedre egnet til at vurderer en generel type intelligens. Disse tests skal reflektere, hvordan AI faktisk bruges i moderne samfund, og menneskers mål for at bruge det. Testene skal kunne fastslå, hvor godt en AI udvider menneskelig intelligens, og hvor godt AI forbedrer menneskers daglige liv. Yderligere skal en test kunne forstå, hvordan en AI manifestere menneskelignende træk af intelligens, herunder sprogdygtighed, selvovervågning og “sund fornuft”.

De nuværende og vigtige områder for AI-forskning, som resonnering, lighed, samtale og sanselig forståelse, vurderes ikke af Turing-testen, men kan måles på forskellige måder. Prasad forklarede, at en måde at måle disse intelligens-træk på er at bryde udfordringerne ned i mindre opgaver. En anden metode til at evaluere er at skabe en stor, virkelig udfordring for menneske-computer-interaktion.

Da Amazon skabte Alexa-prisen, skabte de en rubrik, der krævede, at sociale bots skulle tale med et menneske i 20 minutter. Botterne ville blive vurderet på deres evne til at tale sammenhængende om en bred vifte af emner som teknologi, sport, politik og underholdning. Kunderne var ansvarlige for at score botterne under udviklingsfasen, og tildelte dem score baseret på deres ønske om at tale med botten igen. Under den endelige runde var uafhængige dommere ansvarlige for at bedømme botterne ved hjælp af en 5-punkts-skala. Rubrikken, der blev brugt af dommerne, afhængige af metoder, der lod AI’er udvise vigtige menneskelige egenskaber som empati, hvor det var passende.

Til sidst argumenterede Prasad for, at den øgende udbredelse af AI-drevne enheder som Alexa repræsenterer en vigtig mulighed for at måle AI’s fremgang, men vi vil have brug for andre metrikker for at udnytte denne nye mulighed.

“Sådanne AI’er skal være eksperter i et stort, stadigt voksende antal opgaver, hvilket kun er muligt med en mere generel læringskapacitet i stedet for opgave-specifik intelligens,” forklarede Prasad. ”Derfor, for det næste årti og derefter, er nyttigheden af AI-tjenester med deres konversations- og proaktive hjælpefunktioner på omgivende enheder en værdig test.”

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.