AI-modeller och plattformar
Chefssforskare för Amazon Alexa hävdar att Turingtestet är föråldrat
Rohit Prasad, vicepresident och chefsforskare för Alexa på Amazon (AMZN ), hävdade nyligen att Turingtestet, som länge har använts för att mäta avancerade AI-modellers sofistikering, bör pensioneras som en benchmark för AI.
Datorsystemforskare och matematiker Alan Turing introducerade ursprungligen konceptet med Turingtestet för mer än 70 år sedan. Avsikten med Turingtestet var att bidra till att besvara frågan om maskinell intelligens, och avgöra om en maskin var kapabel till “tanke” i mänsklig bemärkelse. För att besvara denna fråga hävdade Turing att om maskiner kunde uppvisa konversationsbeteende som var så sofistikerat att en mänsklig observatör inte kunde skilja mellan datorns dialog och en människas dialog, borde maskinen anses vara kapabel till tanke.
Turingtestets begränsningar
Prasad hävdade att Turingtestet är begränsat på många sätt och att Turing själv också kommenterade några av dessa begränsningar i sin ursprungliga artikel. Eftersom AI har blivit alltmer integrerat i alla aspekter av våra liv, bryr sig människor mindre om att det är omöjligt att skilja från en människa och mer om att deras interaktioner med AI är smidiga, hävdar Prasad. Av denna anledning bör Turingtestet anses vara föråldrat och ersättas med mer användbara benchmarkvärden.
Prasad noterade att många tidiga chatbotar utvecklades med tanke på att klara Turingtestet, och under de senaste åren har vissa chatbotar konsekvent lyckats lura mer än en tredjedel av de mänskliga domarna (kraven för att klara Turingtestet). Men att kunna framgångsrikt imitera mänskliga talvanor betyder inte att en maskin verkligen kan anses vara “intelligent”. AI-modeller kan vara extremt skickliga inom ett område och extremt bristfälliga inom andra, utan någon form av allmän intelligens. Trots detta förblir Turingtestet en vanligt använd benchmark för chatbotar och digitala assistenter, med Prasad som noterar att företagsledare och journalister ständigt frågar när Alexa kommer att kunna klara Turingtestet.
Enligt Prasad är ett av de primära problemen med att använda Turingtestet för att bedöma maskinell intelligens att det nästan helt bortser från maskiners förmåga att söka upp information och utföra blixtsnabba beräkningar. AI-program injicerar artificiella pauser i svar på komplicerade matematik- och geografi-frågor för att lura människor, men de har ett svar på sådana frågor nästan omedelbart. Utöver detta tar Turingtestet inte AI:s ökande förmåga att använda data som samlats in av yttre sensorer i beaktande, och bortser från hur AI kan interagera med omvärlden genom syn- och rörelsealgoritmer, och enbart förlitar sig på textkommunikation.
Skapande av nya benchmarkvärden
Prasad hävdade att nya former av att mäta intelligens bör skapas, metoder som är bättre lämpade för att bedöma en allmän typ av intelligens. Dessa tester bör återspegla hur AI faktiskt används i moderna samhällen och människors mål för att använda den. Testerna bör kunna fastställa hur väl en AI förbättrar mänsklig intelligens och hur väl AI förbättrar människors dagliga liv. Dessutom bör en test förstå hur en AI uppvisar mänskliga drag av intelligens, inklusive språklig kompetens, självövervakning och “sunna vanor”.
De nuvarande och viktiga områdena för AI-forskning, som resonemang, rättvisa, konversation och sensorisk förståelse, utvärderas inte av Turingtestet, men de kan mätas på olika sätt. Prasad förklarade att ett sätt att mäta dessa drag av intelligens är att bryta ner utmaningar i mindre uppgifter. En annan metod för utvärdering är att skapa en stor, verklig utmaning för mänsklig-datorinteraktion.
När Amazon skapade Alexa Prize, skapade de en bedömningsmall som krävde att sociala botar skulle prata med en människa i 20 minuter. Botarna skulle bedömas utifrån deras förmåga att konversera sammanhängande på en mängd olika ämnen, som teknik, sport, politik och underhållning. Kunderna var ansvariga för att betygsätta botarna under utvecklingsfasen, och tilldela dem poäng baserat på deras önskan att prata med boten igen. Under den slutliga omgången var oberoende domare ansvariga för att betygsätta botarna med en 5-punkts skala. Bedömningsmallen som användes av domarna förlitade sig på metoder som tillät AI att uppvisa viktiga mänskliga attribut, som empati där det var lämpligt.
Till slut hävdade Prasad att den ökande spridningen av AI-drivna enheter som Alexa representerar en viktig möjlighet att mäta AI:s framsteg, men vi kommer att behöva olika mått för att ta till vara på denna nya möjlighet.
“Sådana AI:er behöver vara experter på ett stort, alltmer ökande antal uppgifter, vilket endast är möjligt med mer generaliserad inlärningsförmåga istället för uppgiftsspecifik intelligens”, förklarade Prasad. “Därför, för det kommande decenniet och bortom, är nyttan av AI-tjänster, med deras konversations- och proaktiva hjälpförmågor på omgivande enheter, en värdig test.”












