AI-modeller og plattformer
Speechmatics lanserer autonomt talegjenkjenning-programvare
Ledende talegjenkjenningsteknologi-startup Speechmatics har lansert sin ‘Autonom talegjenkjenning’-programvare som bruker de nyeste dyptelæringsteknikkene og gjennombrudd i selv-overvåkede modeller. Systemet har vist evne til å overgå Amazon (AMZN ), Google (GOOGL ) og Microsoft.
Stanfords datasett
Speechmatics er basert på datasett funnet i Stanfords ‘Rasiale ulikheter i talegjenkjenning’-studie, og det oppnådde en total nøyaktighet på 82,8% for afroamerikanske stemmer. For sammenligning oppnådde Google en nøyaktighetsrate på 68,7%, mens Amazon oppnådde 68,6%.
Nivået av nøyaktighet tilsvarer en 45% reduksjon i talegjenkjenning-feil, som tilsvarer tre ord i en gjennomsnittlig setning. Ikke bare er det nye Speechmatics-systemet nøyaktig i denne henseende, men det har også vist forbedringer i nøyaktighet over aksenter, alder, dialekter og andre sosiodemografiske karakteristika.
Det er ofte misforståelse i talegjenkjenning på grunn av den begrensede mengden merket data som algoritmer kan bruke til å trene seg selv. Merket data krever å være manuelt klassifisert av mennesker, noe som resulterer i en mindre mengde data tilgjengelig for disse systemene. Dette begrenser også representasjonen av alle stemmer, noe som skaper en ny rekke med problemer.
Trening på umerket data
Speechmatics gjør store fremskritt i denne henseende, da deres teknologi er trent på massive mengder umerket data hentet direkte fra internettet. Dataene kommer fra ting som sosiale medier-innhold og podcaster.
Selv-overvåkende læring har gjort det mulig for systemet å bli trent på 1,1 millioner timer med lyd, noe som er en økning fra de tidligere 30 000 timene. Dette gjør det mulig for systemet å ha en mye bredere representasjon av stemmer, og det hjelper med å redusere AI-forvrengning og feil i talegjenkjenning.
Når det gjelder barns stemmer, har Speechmatics også vist evne til å overgå konkurrentene. Barns stemmer er vanskelige å gjenkjenne gjennom legacy talegjenkjenningsteknologi, men Speechmatics klarte å oppnå en nøyaktighetsrate på 91,8%. Google kunne bare oppnå 83,4% og Deepgram 82,3%.
Katy Wigdahl er CEO i Speechmatics.
“Vi er på en misjon for å levere neste generasjons maskinlæringsevner, og gjennom det tilby mer inkluderende og tilgjengelig taleteknologi. Denne annonseringen er et enormt skritt mot å oppnå denne misjonen.”
“Fokuset vårt på å takle AI-forvrengning har ledet til dette monumentale skrittet fremover i talegjenkjenning-industrien, og virkningen vil føre til endringer i en rekke forskjellige scenarioer,” fortsatte Wigdahl. “Tenk på de feilaktige undertekstene vi ser på sosiale medier, rettssaker hvor ord er feilaktig transkribert og e-læringsplattformer som har kjempet med barns stemmer gjennom pandemien. Feil mennesker har måttet akseptere til nå kan ha en tangibel innvirkning på deres daglige liv.”
Allison Zhu Koenecke er hovedforfatter av Stanfords studie om talegjenkjenning.
“Det er kritisk å studere og forbedre rettferdighet i tale-til-tekst-systemer gitt potensialet for ulike skader på enkeltindivider gjennom nedstrømssektorer som helsevesen til kriminalitet.”












