AI-modeller og plattformer

Kunstig intelligens kan foretrekke menneskespråk fremfor numeriske data

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ny forskning fra Columbia Engineering tyder på at kunstig intelligens (KI) systemer foretrekker menneskespråk fremfor numeriske data som 1er og 0er. Den nye studien er fra professor Hod Lipson og PhD-student Boyuan Chen, og den viste at KI-systemer kunne nå høyere ytelsesnivåer hvis de ble programmert med menneskespråklige lydfiler. 

I en side-ved-side-sammenligning fant forskerne ut at et neuralt nettverk som var trenet med lydfiler nådde høyere ytelsesnivåer i å identifisere objekter, sammenlignet med det andre nettverket som var programmert med enkle binære inndata.

Lipson er en James og Sally Scapa-professor i innovasjon og en medlem av Columbia’s Data Science Institute. 

“For å forstå hvorfor denne oppdagelsen er betydningsfull, er det nyttig å forstå hvordan neurale nettverk vanligvis blir programmert, og hvorfor bruk av menneskespråk er et radikalt eksperiment,” sa han. 

Bruk av binære tall er kompaktt og presist, mens menneskespråk er mer komplekst og ikke-binært når det blir fanget i en digital fil. Programmere avviker vanligvis ikke fra tallene når de utvikler et neuralt nettverk, siden det er svært effektivt.

Teamet startet denne forskningen etter å ha tenkt at neurale nettverk ikke nådde sitt fulle potensiale, og de trodde at de kunne være raskere og bedre hvis de ble trenet med menneskespråk og bestemte ord. 

Treningsnettverk

Når de tester ut en ny maskinlæringsmetode, trener KI-forskere ofte et neuralt nettverk for å gjenkjenne bestemte objekter og dyr i en samling av fotografier. 

Teamet, som inkluderte Chen, Lipson, Yu Li og Susan Raghupathi, satte opp et kontrollert eksperiment for å teste sin hypotese, og de skapte to nye neurale nettverk. De satte ut til å trenere dem til å gjenkjenne 10 forskjellige typer objekter blant 50 000 fotografier kalt “treningbilder.” 

Et av KI-systemene ble trenet på en mer tradisjonell måte med numeriske verdier, mens det eksperimentelle neurale nettverket ble trenet veldig annerledes. Det ble matet med en datatabell med rader som inneholdt et bilde av et dyr eller et objekt, og den andre kolonnen hadde en menneskespråklig lydfil, som uttalte ordet for dyret eller objektet. Det var ingen 1er eller 0er involvert med det eksperimentelle nettverket.

Begge KI-systemene ble trenet i totalt 15 timer. Resultatene viste at det originale nettverket svarte med en rekke av ti 1er og 0er, mens det eksperimentelle neurale nettverket produserte en stemme som prøvde å “si” hva objektet i bildet var. Mens den originale stemmen ikke var forståelig, nådde den til slutt et punkt der den var nesten korrekt.

De to nettverkene fungerte like godt, og identifiserte dyret eller objektet korrekt 92 prosent av tiden. Forskerne bestemte seg så for å kjøre eksperimentet en gang til, men denne gangen brukte de færre fotografier under prosessen.

Det tradisjonelle nettverket fungerte dårlig på grunn av sparsomme data, som forventet, og falt til om lag 35 prosent nøyaktighet. Imidlertid gjorde det eksperimentelle nettverket det dobbelt så bra, med 70 prosent nøyaktighet, til tross for at det hadde mindre data. 

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Overraskende resultater

Neste gang brukte teamet vanskeligere bilder, som et korrupt bilde av en hund. Selv med de vanskeligere bildene var det stemme-trente neurale nettverket korrekt om lag 50 prosent av tiden, mens det tradisjonelle nettverket bare var 20 prosent nøyaktig. 

Boyuan Chen er hovedforsker på studien.

“Våre funn går direkte imot hvordan mange eksperter har blitt trent til å tenke om datamaskiner og tall; det er en vanlig antakelse at binære inndata er en mer effektiv måte å overføre informasjon til en maskin enn lydstrømmer av lignende informasjon ‘rikdom,'” forklarte Chen. “I virkeligheten, når vi sendte denne forskningen til en stor KI-konferanse, avviste en anonym anmelder vår artikkel bare fordi de følte at våre resultater var for overraskende og u-forståelige.”

“Hvis du tenker på det faktum at menneskespråk har gått gjennom en optimeringsprosess i titusener av år, så er det fullstendig logisk at våre taleord har funnet en god balanse mellom støy og signal,” sa Lipson. “Derfor, når sett gjennom linsen av Shannon-entropi, er det logisk at et neuralt nettverk trenet med menneskespråk skulle overgå et neuralt nettverk trenet med enkle 1er og 0er.”

Studien vil bli presentert på den internasjonale konferansen om læringrepresentasjoner den 3. mai 2021. 

“Vi bør tenke på å bruke nye og bedre måter å trenere KI-systemer på, i stedet for å samle inn større datasett,” sa Chen. “Hvis vi tenker om hvordan vi presenterer treningdata til maskinen, kunne vi gjøre en bedre jobb som lærere.”

“En av de største mysteriene i menneskeutviklingen er hvordan våre forfedre tilegnet seg språk, og hvordan barn lærer å snakke så lett,” legger Lipson til. “Hvis menneskelige småbarn lærer best med gjentakende muntlig instruksjon, så kan kanskje KI-systemer også gjøre det.”

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.