AI-modeller og platforme
Speechmatics Lancerer Autonomt Talegenkendelsessoftware
Ledende talegenkendelses teknologi startup Speechmatics har lanceret sin ‘Autonome Talegenkendelse’ software, der anvender de seneste dybe læringsteknikker og gennembruds selv-overvågede modeller. Systemet har demonstreret en evne til at overgå Amazon (AMZN ), Google (GOOGL ) og Microsoft.
Stanfords Datasæt
Speechmatics er baseret på datasæt fundet i Stanfords ‘Raciale Uligevægte i Talegenkendelse‘ studie, og det opnåede en samlet nøjagtighed på 82,8% for afroamerikanske stemmer. For reference opnåede Google kun en nøjagtighedsrate på 68,7%, mens Amazon opnåede 68,6%.
Niveauet af nøjagtighed svarer til en reduktion i talegenkendelsesfejl på 45%, hvilket svarer til tre ord i en gennemsnitlig sætning. Ikke kun er det nye Speechmatics-system nøjagtigt på denne måde, men det har også demonstreret forbedringer i nøjagtighed på tværs af accenter, alder, dialekter og andre sociodemografiske karakteristika.
Der er ofte misforståelser i talegenkendelse på grund af den begrænsede mængde af mærket data, som algoritmer kan bruge til at træne sig selv. Mærket data kræver at være manuelt klassificeret af mennesker, hvilket resulterer i en mindre mængde data tilgængelig for disse systemer. Dette begrænser også repræsentationen af alle stemmer, hvilket skaber en ny sæt af problemer.
Træning på Umærket Data
Speechmatics er i gang med at gøre store fremskridt på dette område, da deres teknologi er trænet på massive mængder af umærket data hentet direkte fra internettet. Data kommer fra ting som sociale medieindhold og podcasts.
Selv-overvåget læring har enablede systemet til at blive trænet på 1,1 million timer af lyd, hvilket er en stigning fra de tidligere 30.000 timer. Dette giver det en langt bredere repræsentation af stemmer og hjælper med at reducere AI-forvrængning og fejl i talegenkendelse.
Når det kommer til børns stemmer, har Speechmatics også demonstreret en evne til at overgå konkurrenterne. Børns stemmer er udfordrende at genkende gennem arvet talegenkendelsesteknologi, men Speechmatics formåede at optegne en nøjagtighedsrate på 91,8%. Google kunne kun opnå 83,4% og Deepgram 82,3%.
Katy Wigdahl er administrerende direktør for Speechmatics.
“Vi er på en mission for at levere den næste generation af maskinlæringsfunktioner, og gennem det tilbyde mere inklusiv og tilgængelig taleteknologi. Denne meddelelse er et enormt skridt mod at opnå denne mission.”
“Vores fokus på at tackle AI-forvrængning har ført til dette monumentale skridt fremad i talegenkendelsesindustrien, og rippleffekten vil føre til ændringer i en mængde af forskellige scenarier,” fortsatte Wigdahl. “Tænk på de forkerte undertekster, vi ser på sociale medier, retssager, hvor ord er forkert transskriberet, og e-læringsplatforme, der har kæmpet med børns stemmer under pandemien. Fejl, som mennesker har måttet acceptere indtil nu, kan have en konkret indvirkning på deres daglige liv.”
Allison Zhu Koenecke er hovedforfatter af Stanfords studie om talegenkendelse.
“Det er kritisk at studere og forbedre lighed i tale-til-tekst systemer, givet potentialet for forskellige skader på individer gennem downstream-sektorer, der strækker sig fra sundhedspleje til kriminalret.”












