AI-modeller og platforme

Kunstig intelligens-systemer kan måske foretrække menneskesprog frem for numeriske data

mm
Føj Unite.AI til dine foretrukne kilder på Google

Nyt forskning fra Columbia Engineering antyder, at kunstig intelligens (AI)-systemer foretrækker menneskesprog frem for numeriske data som 1’er og 0’er. Den nye studie er fra professor Hod Lipson og ph.d.-studerende Boyuan Chen, og den viste, at AI-systemer kunne nå højere performancesniveauer, hvis de blev programmeret med menneskesprogs lydfiler. 

I en side-om-side-sammenligning fandt forskerne, at et neuralt netværk, der var trænet med lydfiler, nåede højere performancesniveauer i at identificere objekter, sammenlignet med det andet netværk, der var programmeret med simple binære indtastninger.

Lipson er en James og Sally Scapa Professor of Innovation og medlem af Columbia’s Data Science Institute. 

“For at forstå, hvorfor denne opdagelse er betydningsfuld, er det nyttigt at forstå, hvordan neurale netværk normalt bliver programmeret, og hvorfor brugen af menneskesprogets lyd er et radikalt eksperiment,” sagde han. 

At bruge binære tal er kompakt og præcist, mens menneskesprog er mere komplekst og ikke-binært, når det bliver fanget i en digital fil. Programmører afviger normalt ikke fra tallene, når de udvikler et neuralt netværk, da det er meget effektivt.

Holdet påbegyndte denne forskning efter at have tænkt, at neurale netværk ikke når deres fulde potentiale, og de troede, at de kunne være hurtigere og bedre, hvis de blev trænet med menneskesproget og bestemte ord. 

Træning af netværkene

Når AI-forskere tester en ny maskinlæringsmetode, træner de ofte et neuralt netværk til at genkende bestemte objekter og dyr i en samling af fotografier. 

Holdet, der inkluderede Chen, Lipson, Yu Li og Susan Raghupathi, oprettede et kontrolleret eksperiment for at teste deres hypotese, og de oprettede to nye neurale netværk. De satte sig for at træne dem til at genkende 10 forskellige typer af objekter blandt 50.000 fotografier kaldet “træningsbilleder.” 

Et af AI-systemerne blev trænet på en mere traditionel måde med numeriske værdier, mens det eksperimentelle neurale netværk blev trænet meget anderledes. Det blev fødet en datatabel med rækker, der indeholdt et billede af et dyr eller et objekt, og den anden kolonne havde en menneskesprogs lydfil, der udtalte ordet for dyret eller objektet. Der var ingen 1’er eller 0’er involveret i det eksperimentelle netværk.

Begge AI-systemer blev trænet i alt 15 timer. Resultaterne viste, at det originale netværk svarede med en række af ti 1’er og 0’er, mens det eksperimentelle neurale netværk producerede en stemme, der tydeligt forsøgte at “sige”, hvad objektet på billedet var. Selv om den originale stemme ikke var forståelig, nåede den til sidst et punkt, hvor den var mest korrekt.

De to netværk opførte sig lige så godt og identificerede dyret eller objektet korrekt 92% af tiden. Forskerne besluttede derefter at køre eksperimentet for en anden gang, men denne gang brugte de færre fotografier under processen.

Det traditionelle netværk opførte sig dårligt på grund af sparsomme data, som ville være forventet, og faldt til omkring 35% nøjagtighed. Det eksperimentelle netværk gjorde dog dobbelt så godt og nåede 70% nøjagtighed, på trods af at have færre data. 

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Overraskende resultater

Næste gang brugte holdet sværere billeder, såsom et korrupt billede af en hund. Selv med de sværere billeder var det stemme-trænede neurale netværk korrekt omkring 50% af tiden, mens det traditionelle netværk kun var 20% nøjagtigt. 

Boyuan Chen er den førende forsker på studiet.

“Vore resultater løber direkte imod, hvordan mange eksperter er blevet trænet til at tænke om computere og tal; det er en almindelig antagelse, at binære indtastninger er en mere effektiv måde at overføre information til en maskine end lydstrømme af lignende informationsrigdom,” forklarede Chen. “I virkeligheden, da vi indsendte denne forskning til en stor AI-konference, afviste en anonym anmelder vores papir simpelthen, fordi de følte, at vores resultater var ‘for overraskende og ikke-intuitive’.”

“Hvis du tænker på, at menneskesprog har været gennem en optimeringsproces i titusinder af år, så giver det fuldamente mening, at vores tale har fundet en god balance mellem støj og signal,” sagde Lipson. “Derfor, når set gennem linsen af Shannon-entropi, giver det mening, at et neuralt netværk trænet med menneskesprog ville overgå et neuralt netværk trænet med simple 1’er og 0’er.”

Studiet vil blive præsenteret på den Internationale Konference om Læringsrepræsentationer den 3. maj 2021. 

“Vi burde tænke på at bruge nytænkende og bedre måder at træne AI-systemer på, i stedet for at samle større datasæt,” sagde Chen. “Hvis vi genovervejer, hvordan vi præsenterer træningsdata for maskinen, kunne vi gøre en bedre job som lærere.”

“En af de største mysterier i menneskets udvikling er, hvordan vores forfædre erhvervede sprog, og hvordan børn lærer at tale så uden besvær,” tilføjer Lipson. “Hvis menneskelige småbørn lærer bedst med gentagne mundtlige instruktioner, så kan AI-systemer måske også.”

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.