AI-mallit ja alustat

Speechmatics julkaisee autonomisen puheentunnistusohjelmistonsa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Johtava puheentunnistusteknologiaan erikoistunut startup-yritys Speechmatics on julkaissut ‘Autonomous Speech Recognition’ -ohjelmistonsa, joka käyttää viimeisintä syväoppimistekniikkaa ja läpimurtoja itseohjautuvissa malleissa. Järjestelmä on osoittanut pystyvänsä ylittämään Amazonin, Googleen ja Microsoftin suorituskyvyn.

Stanfordin aineistot

Speechmatics perustuu Stanfordin ‘ Rodulliset epäkohdat puheentunnistuksessa ‘ -tutkimuksessa käytettyihin aineistoihin, ja se saavutti 82,8 prosentin täsmällisyyden afrikkalais-amerikkalaisten äänien tunnistamisessa. Vertailun vuoksi Google (GOOGL ) saavutti 68,7 prosentin täsmällisyyden, kun taas Amazon (AMZN ) saavutti 68,6 prosentin täsmällisyyden.

Täsmällisyyden taso vastaa 45 prosentin vähennystä puheentunnistusvirheissä, mikä vastaa kolmea sanaa keskimääräisessä lauseessa. Uusi Speechmatics-järjestelmä on tarkka tässä suhteessa, ja se on osoittanut parantuneen täsmällisyyden myös aksenteissa, iässä, murteissa ja erilaisissa sosiodemografisissa ominaispiirteissä.

Puheentunnistuksessa on usein väärinymmärryksiä johtuen siitä, että algoritmeja voidaan kouluttaa vain rajallisella määrällä merkittyjä aineistoja. Merkityt aineistot on merkittävä manuaalisesti, mikä johtaa siihen, että näille järjestelmille on käytettävissä vähemmän aineistoja. Tämä rajoittaa myös kaikkien äänien edustusta, mikä luo uuden joukon ongelmia.

Koulutus merkittämättömällä aineistolla

Speechmatics tekee suuria edistysaskelia tässä suhteessa, koska sen teknologia on koulutettu valtavalla määrällä merkittämättömiä aineistoja, jotka ovat peräisin suoraan internetistä. Aineistot ovat esimerkiksi sosiaalisen median sisältöä ja podcasteja.

Itseohjautuva oppiminen on mahdollistanut järjestelmän kouluttamisen 1,1 miljoonan tunnin ääniaineistolla, mikä on lisäys edellisestä 30 000 tunnista. Tämä mahdollistaa laajemman äänien edustuksen ja auttaa vähentämään tekoälyvirheitä ja puheentunnistusvirheitä.

Lapsien äänien osalta Speechmatics on myös osoittanut pystyvänsä ylittämään kilpailijoidensa suorituskyvyn. Lasten äänet ovat haasteellisia tunnistettaviksi perinteisillä puheentunnistusteknologioilla, mutta Speechmatics on saavuttanut 91,8 prosentin täsmällisyyden. Google saavutti 83,4 prosentin ja Deepgram 82,3 prosentin täsmällisyyden.

Katy Wigdahl on Speechmatics Oy:n toimitusjohtaja.

“Olemme tehtävänämme toimittaa seuraavan sukupolven koneoppimismahdollisuuksia, ja tarjoamme kautta tämän enemmän inklusiivista ja saavutettavaa puheentunnistusteknologiaa. Tämä ilmoitus on valtava askel kohti tämän tehtävän toteuttamista.”

“Fokuksena on ollut tekemään edistystä tekoälyvirheiden torjunnassa, ja tämä on johtanut merkittävään edistysaskeliin puheentunnistusteollisuudessa, ja sen vaikutukset tulevat olemaan monissa eri tilanteissa”, Wigdahl jatkoi. “Ajattele väärin merkittyjä tekstityksiä sosiaalisessa mediassa, oikeudenkäynneissä, joissa sanat ovat väärin merkitty, ja verkkokoulutusalustoissa, joissa on kamppailla lasten äänien kanssa pandemian aikana. Virheet, joita ihmiset ovat joutuneet hyväksymään tähän asti, voivat vaikuttaa merkittävästi heidän päivittäiseen elämäänsä.”

Allison Zhu Koenecke on Stanfordin tutkimuksen pääkirjoittaja puheentunnistuksesta.

“On kriittinen tutkia ja parantaa reiluutta puhe-teksti -järjestelmissä, koska niillä on potentiaalinen epätasa-arvoinen haitta yksilöille eri aloilla, kuten terveydenhuollossa ja rikos-oikeudessa.”

Alex johtaa Unite.AI:n tekoälypohjaista uutistoimintaa, yhdistäen journalismia, tutkimusta ja automaatiota tukeakseen ajantasaista ja skaalautuvaa tekoälyn kattavuutta. Hänen työnsä auttaa varmistamaan, että nousevat tekoälykehitykset saadaan esiin tehokkaasti samalla kun julkaisun toimitukselliset standardit säilyvät.