AI-modeller och plattformar
AI-system kan föredra mänskligt språk istället för numeriska data

Ny forskning från Columbia Engineering tyder på att artificiell intelligens (AI) system föredrar mänskligt språk istället för numeriska data som 1or och 0or. Den nya studien är från professor Hod Lipson och doktorand Boyuan Chen, och den visade att AI-system kunde nå högre prestandanivåer om de programmerades med mänskliga språkljudfiler.
I en jämförelse sida vid sida fann forskarna att ett neuronnätverk som tränades med ljudfiler nådde högre prestandanivåer i att identifiera objekt, jämfört med det andra nätverket som programmerades med enkla binära indata.
Lipson är en James och Sally Scapa-professor i innovation och en medlem av Columbias Data Science Institute.
“För att förstå varför denna upptäckt är betydelsefull, är det användbart att förstå hur neuronnätverk vanligtvis programmeras, och varför användningen av mänsklig röst är ett radikalt experiment,” sa han.
Användning av binära tal är kompakt och exakt, medan mänskligt språk är mer komplext och icke-binärt när det fångas i en digital fil. Programmatörer avviker vanligtvis inte från talen när de utvecklar ett neuronnätverk, eftersom det är mycket effektivt.
Teamet inledde denna forskning efter att ha tänkt att neuronnätverk inte når sin fulla potential, och att de kunde vara snabbare och bättre om de tränades med mänsklig röst och specifika ord.
Träning av nätverken
När man testar en ny maskinlärningsteknik, tränar AI-forskare ofta ett neuronnätverk för att känna igen specifika objekt och djur i en samling fotografier.
Teamet, som inkluderade Chen, Lipson, Yu Li och Susan Raghupathi, satte upp ett kontrollerat experiment för att testa sin hypotes, och de skapade två nya neuronnätverk. De satte ut att träna dem för att känna igen 10 olika typer av objekt bland 50 000 fotografier som kallades “träningsbilder.”
Ett av AI-systemen tränades på ett mer traditionellt sätt med numeriska värden, medan det experimentella neuronnätverket tränades mycket annorlunda. Det matades med en datatabell med rader som innehöll en bild av ett djur eller ett objekt, och den andra kolumnen hade en mänsklig röstljudfil, som uttalade ordet för djuret eller objektet. Det fanns inga 1or och 0or inblandade med det experimentella nätverket.
Båda AI-systemen tränades i totalt 15 timmar. Resultaten visade att det ursprungliga nätverket svarade med en serie av tio 1or och 0or, medan det experimentella neuronnätverket producerade en röst som försökte “säga” vad objektet i bilden var. Medan den ursprungliga rösten inte var begriplig, nådde den till slut en punkt där den var mestadels korrekt.
De två nätverken presterade lika bra, och identifierade djuret eller objektet korrekt 92% av tiden. Forskarna beslutade sedan att köra experimentet en andra gång, men den här gången använde de färre fotografier under processen.
Det traditionella nätverket presterade dåligt på grund av den knappa datan, som förväntat, och sjönk till cirka 35% noggrannhet. Det experimentella nätverket gjorde dubbelt så bra, med 70% noggrannhet, trots att det hade mindre data.
https://www.youtube.com/watch?v=Iq2YjHCAPRQ
Förvånansvärda resultat
Nästa gång använde teamet svårare bilder, som en korrupt bild av en hund. Även med de svårare bilderna var det rösttränade neuronnätverket korrekt cirka 50% av tiden, medan det traditionella nätverket var korrekt cirka 20% av tiden.
Boyuan Chen är den ledande forskaren i studien.
“Våra fynd går direkt emot hur många experter har blivit tränade att tänka om datorer och tal; det är ett vanligt antagande att binära indata är ett mer effektivt sätt att förmedla information till en maskin än ljudströmmar av liknande information ‘rikedom,'” förklarade Chen. “I själva verket, när vi skickade in denna forskning till en stor AI-konferens, avslog en anonym granskare vårt papper enbart för att de kände att våra resultat var ‘för förvånansvärda och ointuitiva’.”
“Om du tänker på det faktum att mänskligt språk har genomgått en optimeringsprocess under tiotusentals år, så är det fullständigt logiskt att våra talade ord har hittat en bra balans mellan brus och signal,” sa Lipson. “Därför, när man ser på det genom linsen av Shannons entropi, är det logiskt att ett neuronnätverk tränat med mänskligt språk skulle prestera bättre än ett neuronnätverk tränat med enkla 1or och 0or.”
Studien kommer att presenteras vid International Conference on Learning Representations den 3 maj 2021.
“Vi borde tänka på att använda nya och bättre sätt att träna AI-system istället för att samla in större datamängder,” sa Chen. “Om vi tänker om hur vi presenterar träningsdata för maskinen, kunde vi göra ett bättre jobb som lärare.”
“En av de största mysterierna i mänsklig evolution är hur våra förfäder förvärvade språk, och hur barn lär sig att tala så lätt,” tillägger Lipson. “Om mänskliga småbarn lär sig bäst med upprepad muntlig instruktion, så kanske AI-system också kan.”












