AI-modellen en platforms

AI-systemen geven mogelijk de voorkeur aan menselijke taal boven numerieke gegevens

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Nieuw onderzoek van Columbia Engineering suggereert dat kunstmatige intelligentie (AI)-systemen de voorkeur geven aan menselijke taal boven numerieke gegevens zoals 1’s en 0’s. De nieuwe studie is van Professor Hod Lipson en PhD-student Boyuan Chen, en het heeft aangetoond dat AI-systemen hogere prestatieniveaus kunnen bereiken als ze worden geprogrammeerd met menselijke taal geluidsbestanden.

In een zij-aan-zij-vergelijking vonden de onderzoekers dat een neurale netwerk dat was getraind met geluidsbestanden hogere prestatieniveaus bereikte bij het identificeren van objecten, in vergelijking met het andere netwerk dat was geprogrammeerd met eenvoudige binaire invoer.

Lipson is een James en Sally Scapa Professor of Innovation en lid van het Data Science Institute van Columbia.

“Om te begrijpen waarom deze vinding belangrijk is, is het nuttig om te begrijpen hoe neurale netwerken meestal worden geprogrammeerd, en waarom het gebruik van de klank van de menselijke stem een radicale experiment is,” zei hij.

Het gebruik van binaire nummers is compact en precies, terwijl menselijke taal complexer en niet-binair is wanneer deze wordt opgenomen in een digitale bestand. Programmeurs wijken meestal niet af van de nummers bij het ontwikkelen van een neurale netwerk, omdat het zeer efficiënt is.

Het team is op dit onderzoek gestart nadat ze dachten dat neurale netwerken niet hun volle potentieel bereiken, en ze geloofden dat ze sneller en beter konden zijn als ze werden getraind met de menselijke stem en specifieke woorden.

Training van de netwerken

Wanneer AI-onderzoekers een nieuwe machine learning-techniek testen, trainen ze vaak een neurale netwerk om specifieke objecten en dieren in een collectie van foto’s te herkennen.

Het team, dat bestond uit Chen, Lipson, Yu Li en Susan Raghupathi, zette een gecontroleerd experiment op om hun hypothese te testen, en ze creëerden twee nieuwe neurale netwerken. Ze wilden ze trainen om 10 verschillende soorten objecten te herkennen onder 50.000 foto’s, genaamd “trainingsafbeeldingen”.

Een van de AI-systemen werd getraind op een meer traditionele manier met numerieke waarden, terwijl het experimentele neurale netwerk op een heel andere manier werd getraind. Het kreeg een gegevenstabel met rijen die een foto van een dier of object bevatten, en de tweede kolom had een menselijke stem-geluidsbestand, dat het woord voor het dier of object uitsprak. Er waren geen 1’s en 0’s bij het experimentele netwerk betrokken.

Beide AI-systemen werden getraind voor een totaal van 15 uur. De resultaten toonden aan dat het oorspronkelijke netwerk antwoordde met een reeks van tien 1’s en 0’s, terwijl het experimentele neurale netwerk een stem produceerde die duidelijk probeerde te “zeggen” wat het object in de afbeelding was. Terwijl de oorspronkelijke stem niet verstaanbaar was, bereikte deze uiteindelijk een punt waarop deze grotendeels correct was.

De twee netwerken presteerden even goed, waarbij ze het dier of object correct identificeerden 92% van de tijd. De onderzoekers besloten vervolgens om het experiment voor de tweede keer uit te voeren, maar deze keer gebruikten ze minder foto’s tijdens het proces.

Het traditionele netwerk presteerde slecht vanwege de schaarste aan gegevens, zoals verwacht, en daalde tot ongeveer 35% nauwkeurigheid. Het experimentele netwerk deed echter twee keer zo goed, met 70% nauwkeurigheid, ondanks het feit dat het minder gegevens had.

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Verwonderlijke resultaten

De volgende keer gebruikte het team moeilijkere afbeeldingen, zoals een beschadigde afbeelding van een hond. Zelfs met de moeilijkere afbeeldingen was het stem-getrainde neurale netwerk correct ongeveer 50% van de tijd, terwijl het traditionele netwerk slechts 20% nauwkeurig was.

Boyuan Chen is de hoofdonderzoeker van de studie.

“Onze bevindingen gaan rechtstreeks in tegen hoe veel deskundigen zijn opgeleid om over computers en nummers te denken; het is een veel voorkomende veronderstelling dat binaire invoer een efficiëntere manier is om informatie aan een machine over te dragen dan audiostromen van vergelijkbare ‘rijkdom’,” legde Chen uit. “In feite, toen we dit onderzoek indienden bij een grote AI-conferentie, wees een anonieme reviewer ons papier af, simpelweg omdat ze voelden dat onze resultaten te verrassend en niet-intuïtief waren.”

“Als je nadenkt over het feit dat menselijke taal al tienduizenden jaren een optimalisatieproces heeft ondergaan, dan is het volkomen logisch dat onze gesproken woorden een goede balans hebben gevonden tussen ruis en signaal,” zei Lipson. “Daarom is het, wanneer bekeken door de lens van Shannon-entropie, logisch dat een neurale netwerk getraind met menselijke taal beter presteert dan een neurale netwerk getraind met eenvoudige 1’s en 0’s.”

De studie zal worden gepresenteerd op de International Conference on Learning Representations op 3 mei 2021.

“We zouden moeten nadenken over het gebruik van nieuwe en betere manieren om AI-systemen te trainen, in plaats van grotere datasets te verzamelen,” zei Chen. “Als we opnieuw nadenken over hoe we trainingsgegevens aan de machine presenteren, kunnen we een betere job doen als leraren.”

“Een van de grootste mysteries van de menselijke evolutie is hoe onze voorouders taal verworven en hoe kinderen zo moeiteloos leren spreken,” voegt Lipson toe. “Als menselijke peuters het beste leren met herhaalde gesproken instructie, dan kunnen AI-systemen dat misschien ook.”

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.