AI-mallit ja alustat
Tekoälyjärjestelmät saattavat suositella ihmisten kieltä numeroiden sijaan

Uusi tutkimus Columbian insinööritieteellisestä tiedekunnasta osoittaa, että tekoälyjärjestelmät suosittelevat ihmisten kieltä numeroiden sijaan. Tutkimus on tehty yhteistyössä Mechanical Engineering Professor Hod Lipsonin ja PhD-opiskelija Boyuan Chenin kanssa, ja se osoittaa, että tekoälyjärjestelmät voivat saavuttaa korkeamman suorituskyvyn, jos ne ohjelmoidaan ihmisen kielen äänitiedostojen avulla.
Vertaamalla kahden tekoälyjärjestelmän suorituskykyä, tutkijat totesivat, että äänitiedostojen avulla koulutettu tekoälyjärjestelmä saavutti korkeamman suorituskyvyn esineiden tunnistamisessa verrattuna perinteisesti binäärisillä syötteillä koulutettuun järjestelmään.
Lipson on James ja Sally Scapa -professori innovaatioista ja jäsen Columbian Data Science Instituten johtoryhmässä.
“Ymmärtääksemme, miksi tämä löytö on merkittävä, on hyvä ymmärtää, miten tekoälyjärjestelmät ohjelmoidaan yleensä, ja miksi ihmisen äänen käyttäminen on radikaali kokeilu”, hän sanoi.
Binäärimuoto on tiivis ja tarkka, kun taas ihmisen kieli on monimutkaisempi ja epäbinäärinen, kun se tallennetaan digitaaliseen tiedostoon. Ohjelmoijat eivät yleensä poikkeuta numeroista kehittäessään tekoälyjärjestelmää, koska se on erittäin tehokasta.
Tutkijaryhmä aloitti tämän tutkimuksen ajatellessaan, että tekoälyjärjestelmät eivät ole saavuttaneet täyttä potentiaaliaan, ja he uskoivat, että ne voivat olla nopeampia ja parempia, jos ne koulutetaan ihmisen äänen ja tietyn sanan avulla.
Verkkojen koulutus
Kun tekoälytutkijat testaavat uutta koneoppimismenetelmää, he usein kouluttavat tekoälyjärjestelmän tunnistamaan tiettyjä esineitä ja eläimiä valokuvakokoelmasta.
Tutkijaryhmä, johon kuului Chen, Lipson, Yu Li ja Susan Raghupathi, suoritti kontrolloidun kokeen testatakseen hypoteesiaan ja loi kaksi uutta tekoälyjärjestelmää. He aikoivat kouluttaa ne tunnistamaan 10 eri esinetyyppiä 50 000 valokuvan joukosta, jotka kutsutaan “koulutuskuvin”.
Toinen tekoälyjärjestelmistä koulutettiin perinteisemmällä tavalla numerollisilla arvoilla, kun taas kokeellinen tekoälyjärjestelmä koulutettiin eri tavalla. Sille annettiin tietotaulukko, jossa rivit sisälsivät valokuvan eläimestä tai esineestä, ja toisessa sarakkeessa oli ihmisen äänen äänitiedosto, joka puhui sanan eläimestä tai esineestä. Kokeellisessa järjestelmässä ei ollut mukana yhtään 1:itä tai 0:ia.
Molemmat tekoälyjärjestelmät koulutettiin yhteensä 15 tuntia. Tulokset osoittivat, että alkuperäinen järjestelmä vastasi sarjalla 1:itä ja 0:ia, kun taas kokeellinen tekoälyjärjestelmä tuotti äänen, joka yritti “sanoa” kuvan esineen nimen. Vaikka alkuperäinen ääni ei ollut ymmärrettävissä, se saavutti lopulta pääosin oikean tuloksen.
Molemmat järjestelmät suorittivat yhtä hyvin ja tunnistivat eläimen tai esineen oikein 92 %:ssa tapauksista. Tutkijat päättivät sitten toistaa kokeen toisen kerran, mutta tällä kertaa he käyttivät vähemmän valokuvia prosessissa.
Perinteinen järjestelmä suoritti huonosti vähäisen datan vuoksi, kuten odottaa voitiin, ja sen tarkkuus laski noin 35 %:iin. Kokeellinen järjestelmä suoritti kuitenkin kaksi kertaa paremmin, 70 %:n tarkkuudella, vaikka sillä oli vähemmän dataa.
https://www.youtube.com/watch?v=Iq2YjHCAPRQ
Yllättävät tulokset
Seuraavassa kokeessa tutkijaryhmä käytti vaikeampia kuvia, kuten vahingoittunutta koiran valokuvaa. Vaikka kuvat olivat vaikeampia, äänellä koulutettu tekoälyjärjestelmä oli oikein noin 50 %:ssa tapauksista, kun taas perinteinen järjestelmä oli oikein vain 20 %:ssa tapauksista.
Boyuan Chen on tutkimuksen vastaava tutkija.
“Havaintomme vastaavat suoraan sille, miten useat asiantuntijat on koulutettu ajattelemaan tietokoneista ja numeroista; on yleinen oletus, että binäärisyötteet ovat tehokkaampi tapa välittää tietoa koneelle kuin äänivirrat samanlaista ‘rikkautta'”, Chen selitti. “Itse asiassa, kun me lähetimme tämän tutkimuksen suureen tekoälykonferenssiin, yksi anonyymi arvostelija hylkäsi paperimme yksinkertaisesti siksi, että he kokivat tulokset liian yllättäviksi ja epäintuitiivisiksi.”
“Jos ajattelemme sitä, että ihmisen kieli on kehittynyt kymmenien tuhansien vuosien ajan, niin on järkevää, että puhuttu kieli on löytänyt hyvän tasapainon melun ja signaalin välillä”, Lipson sanoi. “Siksi, kun tarkastelemme asiaa Shannon-informaatioyhteyden kautta, on järkevää, että tekoälyjärjestelmä, joka on koulutettu ihmisen kielen avulla, suorittaa paremmin kuin tekoälyjärjestelmä, joka on koulutettu yksinkertaisilla 1:illä ja 0:illa.”
Tutkimus esitetään kansainvälisessä konferenssissa opittujen esitysten luonnehdinnasta 3. toukokuuta 2021.
“Meidän pitäisi miettiä uusia ja parempia tapoja kouluttaa tekoälyjärjestelmiä sen sijaan, että keräämme suurempia tietoja”, Chen sanoi. “Jos me muutamme, miten esitämme koulutusdataa koneelle, me voimme tehdä paremman työn opettajina.”
“Yksi ihmisen evoluution suurimmista arvoituksista on, miten esivanhempiemme hankkivat kielen ja miten lapset oppivat puhumaan niin vaivattomasti”, Lipson lisää. “Jos ihmislapset oppivat parhaiten toistuvan puhutun opetuksen avulla, niin ehkä tekoälyjärjestelmät voivat oppia samalla tavalla.”












