AI-modellen en platforms
Hoofdonderzoeker voor Amazon Alexa beweert dat de Turing-test verouderd is
Rohit Prasad, vice-president en hoofdwetenschapper van Alexa bij Amazon (AMZN ), betoogde onlangs dat de Turing-test, die lange tijd gebruikt werd om de geavanceerdheid van AI-modellen te meten, als benchmark voor AI moet worden afgeschaft.
De computerwetenschapper en wiskundige Alan Turing introduceerde het concept van de Turing-test meer dan 70 jaar geleden. Het doel van de Turing-test was om te helpen bij het beantwoorden van de vraag naar machine-intelligentie, en te bepalen of een machine “gedachten” kon hebben in de menselijke zin. Om deze vraag te beantwoorden, betoogde Turing dat als machines conversatiegedrag konden vertonen dat zo geavanceerd was dat een menselijke waarnemer het niet kon onderscheiden van het gesprek van een mens, de machine als “denkend” moest worden beschouwd.
Beperkingen van de Turing-test
Prasad betoogde dat de Turing-test op veel manieren beperkt is en dat Turing zelfs enkele van deze beperkingen in zijn oorspronkelijke artikel noemde. Aangezien AI steeds meer geïntegreerd raakt in alle aspecten van ons leven, zijn mensen minder geïnteresseerd in of het onderscheidbaar is van een mens en meer in of hun interacties met AI naadloos verlopen, betoogt Prasad. Om deze reden moet de Turing-test als verouderd worden beschouwd en vervangen worden door meer bruikbare benchmarks.
Prasad merkte op dat veel vroege chatbots waren ontworpen met het oog op het doorstaan van de Turing-test, en dat enkele chatbots in recente jaren erin geslaagd zijn om meer dan een derde van de menselijke juryleden te misleiden (de drempel die nodig was om de Turing-test te doorstaan). Echter, het feit dat een machine de spraakpatronen van mensen niet noodzakelijkerwijs betekent dat een machine werkelijk “intelligent” kan worden genoemd. AI-modellen kunnen extreem bedreven zijn in één gebied en extreem tekort schieten in andere, zonder enige vorm van algemene intelligentie. Ondanks dit blijft de Turing-test een veelgebruikte benchmark voor chatbots en digitale assistenten, waarbij Prasad opmerkt dat zakenleiders en journalisten voortdurend vragen wanneer Alexa in staat zal zijn om de Turing-test te doorstaan.
Volgens Prasad is een van de belangrijkste problemen met het gebruik van de Turing-test om machine-intelligentie te beoordelen dat het vrijwel geheel geen rekening houdt met de mogelijkheid van machines om informatie op te zoeken en berekeningen uit te voeren met een hoge snelheid. AI-programma’s injecteren kunstmatige pauzes in reactie op ingewikkelde wiskundige en geografische vragen om mensen te misleiden, maar ze hebben een antwoord op dergelijke vragen bijna onmiddellijk. Bovendien houdt de Turing-test geen rekening met de toenemende mogelijkheid van AI om gegevens te gebruiken die zijn verzameld door externe sensoren, en negeert het hoe AI met de wereld om hen heen kan communiceren via visie- en bewegingsalgoritmen, waarbij het alleen tekstcommunicatie gebruikt.
Het creëren van nieuwe benchmarks
Prasad betoogde dat nieuwe vormen van intelligentie meting moeten worden gecreëerd, methoden die beter geschikt zijn om een algemene vorm van intelligentie te beoordelen. Deze tests moeten weerspiegelen hoe AI in de moderne samenleving wordt gebruikt en wat mensen verwachten van het gebruik ervan. De tests moeten kunnen bepalen hoe goed een AI de menselijke intelligentie aanvult en hoe goed de AI het dagelijks leven van mensen verbetert. Bovendien moet een test begrijpen hoe een AI menselijke intelligentie-eigenschappen vertoont, zoals taalvaardigheid, zelfsupervisie en “gezond verstand”.
De huidige en belangrijke gebieden van AI-onderzoek, zoals redeneren, eerlijkheid, converseren en sensorische begrip, worden niet beoordeeld door de Turing-test, maar kunnen op verschillende manieren worden gemeten. Prasad legde uit dat een manier om deze kenmerken van intelligentie te meten is door uitdagingen op te breken in onderliggende taken. Een andere methode voor evaluatie is het creëren van een grote, real-world-uitdaging voor mens-computer-interactie.
Toen Amazon de Alexa Prize creëerde, creëerde het een rubriek die sociale bots verplichtte om 20 minuten met een mens te praten. De bots zouden worden beoordeeld op hun vermogen om coherent te praten over een breed scala aan onderwerpen, zoals technologie, sport, politiek en entertainment. Klanten waren verantwoordelijk voor het beoordelen van de bots tijdens de ontwikkelingsfase, waarbij ze scores toekenden op basis van hun verlangen om opnieuw met de bot te praten. Tijdens de finale ronde waren onafhankelijke juryleden verantwoordelijk voor het beoordelen van de bots met behulp van een 5-puntschaal. De rubriek die door de juryleden werd gebruikt, was gebaseerd op methoden die AI’s in staat stelden om belangrijke menselijke kenmerken te vertonen, zoals empathie waar nodig.
Uiteindelijk betoogde Prasad dat de toenemende verspreiding van AI-gestuurde apparaten zoals Alexa een belangrijke kans vertegenwoordigt om de vooruitgang van AI te meten, maar dat we andere meetmethoden nodig hebben om deze kans te benutten.
“Dergelijke AI’s moeten expert zijn in een groot, steeds groter wordend aantal taken, wat alleen mogelijk is met een meer gegeneraliseerde leerbaarheid in plaats van taak-specifieke intelligentie,” legde Prasad uit. “Daarom zijn, voor het komende decennium en daarna, de bruikbaarheid van AI-diensten, met hun converserende en proactieve assistentievaardigheden op omgevingsapparaten, een waardige test.”












