AI-modeller och plattformar
Speechmatics Lanserar Autonom MJukvara för Taligenkänning
Ledande startup inom taligenkänningsteknologi Speechmatics har lanserat sin mjukvara för ’Autonom Taligenkänning’ som använder de senaste djupinlärningsteknikerna och banbrytande självständiga modeller. Systemet har visat sig kunna överträffa Amazon (AMZN ), Google (GOOGL ) och Microsoft.
Stanfords Datamängder
Speechmatics bygger på datamängder från Stanfords studie ’Rasrelaterade skillnader i taligenkänning’ och uppnådde en total noggrannhet på 82,8 % för afroamerikanska röster. För att jämföra uppnådde Google en noggrannhet på 68,7 %, medan Amazon uppnådde 68,6 %.
Nivån på noggrannhet motsvarar en minskning av taligenkänningsfel med 45 %, vilket motsvarar tre ord i en genomsnittlig mening. Den nya Speechmatics-systemet är inte bara noggrant på det här sättet, utan har också visat sig förbättra noggrannheten över accenter, ålder, dialekt och olika andra sociodemografiska egenskaper.
Det förekommer ofta missförstånd i taligenkänning på grund av den begränsade mängden märkt data som algoritmerna kan använda för att träna sig. Märkt data kräver manuell klassificering av människor, vilket resulterar i en mindre mängd data som är tillgänglig för dessa system. Detta begränsar också representationen av alla röster, vilket skapar en ny uppsättning problem.
Träning på Omarkerad Data
Speechmatics gör stora framsteg på det här området eftersom deras teknik tränas på stora mängder omarkerad data som hämtas direkt från internet. Data kommer från saker som sociala medier och podcaster.
Självständigt lärande har möjliggjort för systemet att tränas på 1,1 miljoner timmar av ljud, vilket är en ökning från de tidigare 30 000 timmarna. Detta möjliggör en mycket bredare representation av röster och hjälper till att minska AI-fördomar och fel i taligenkänning.
När det gäller barnröster har Speechmatics också visat sig kunna överträffa konkurrenterna. Barnröster är svåra att känna igen med hjälp av äldre taligenkänningsteknologi, men Speechmatics lyckades uppnå en noggrannhet på 91,8 %. Google kunde bara uppnå 83,4 % och Deepgram 82,3 %.
Katy Wigdahl är VD för Speechmatics.
”Vi är på en mission att leverera nästa generations maskinlärningsförmågor och genom det erbjuda mer inkluderande och tillgänglig talteknologi. Den här tillkännagivandet är ett stort steg mot att uppnå den missionen.”
”Vår fokus på att tackla AI-fördomar har lett till detta monumentala framsteg inom taligenkänning och den därpå följande effekten kommer att leda till förändringar i en mängd olika scenarier”, fortsatte Wigdahl. ”Tänk på de felaktiga undertexterna vi ser på sociala medier, rättegångar där ord är felaktigt transkriberade och e-lärandeplattformar som har kämpat med barnröster under pandemin. Fel som människor har varit tvungna att acceptera tills nu kan ha en märkbar inverkan på deras dagliga liv.”
Allison Zhu Koenecke är huvudförfattare till Stanfords studie om taligenkänning.
”Det är kritiskt att studera och förbättra rättvisan i tal-till-text-system med tanke på den potentiella skadan som kan uppstå för individer genom nedströmssektorer från hälsovård till brottsbehandling.”












