Modely a platformy AI
Spuštění autonomního softwaru pro rozpoznávání řeči Speechmatics
Vedoucí startup pro rozpoznávání řeči Speechmatics spustil svůj software „Autonomní rozpoznávání řeči“, který využívá nejnovější techniky hlubokého učení a průlomové samořízené modely. Systém prokázal schopnost překonat Amazon (AMZN ), Google (GOOGL ) a Microsoft.
Stanfordovy datové sady
Speechmatics je založen na datech z Stanfordovy studie Rasové rozdíly v rozpoznávání řeči a dosáhl celkové přesnosti 82,8 % pro africké americké hlasy. Pro srovnání, Google dosáhl přesnosti pouze 68,7 %, zatímco Amazon dosáhl 68,6 %.
Úroveň přesnosti odpovídá 45% snížení chyb v rozpoznávání řeči, což je ekvivalent tří slov v průměrné větě. Nový systém Speechmatics není pouze přesný v tomto ohledu, ale také prokázal zlepšení přesnosti napříč akcenty, věkem, dialekty a různými jinými socio-demografickými charakteristikami.
Často dochází k nedorozumění v rozpoznávání řeči kvůli omezenému množství označených dat, která algoritmy mohou použít pro sebe-vyučování. Označená data musí být ručně klasifikována lidmi, což vede k menšímu množství dostupných dat pro tyto systémy. To také omezuje reprezentaci všech hlasů, což vytváří novou sadu problémů.
Školení na neošetřených datech
Speechmatics dosahuje velkého pokroku v tomto ohledu, protože jeho technologie je školená na obrovském množství neošetřených dat získaných přímo z internetu. Data pocházejí z věcí, jako je obsah sociálních médií a podcastů.
Samořízené učení umožnilo systému být školen na 1,1 milionu hodin audio, což je nárůst z předchozích 30 000 hodin. To umožňuje mít mnohem širší rozsah reprezentace hlasů a pomáhá snižovat chyby a předějové AI v rozpoznávání řeči.
Pokud jde o děti, Speechmatics také prokázal schopnost překonat konkurenty. Děti jsou obtížné rozpoznat pomocí tradiční technologie rozpoznávání řeči, ale Speechmatics dosáhl přesnosti 91,8 %. Google dosáhl pouze 83,4 % a Deepgram 82,3 %.
Katy Wigdahl je CEO Speechmatics.
„Jsme na misi dodat další generaci schopností strojového učení a prostřednictvím toho nabídnout více inkluzivní a přístupnou technologii řeči. Toto oznámení je obrovským krokem k dosažení této mise.“
„Naše zaměření na řešení předějů AI vedlo k tomuto monumentálnímu pokroku v oboru rozpoznávání řeči a efekt bude mít dopad na mnoho různých scénářů,“ pokračoval Wigdahl. „Zamyslete se na nesprávné titulky, které vidíme na sociálních médiích, soudní jednání, kde jsou slova špatně přepisována, a eLearningové platformy, které měly potíže s dětmi během pandemie. Chyby, které lidé museli přijmout doposud, mohou mít hmatatelný dopad na jejich denní život.“
Allison Zhu Koenecke je vedoucí autorka Stanfordovy studie o rozpoznávání řeči.
„Je zásadní studovat a zlepšovat spravedlnost v systémech řeč-na-text, vzhledem k potenciálu pro rozdílnou újmu jednotlivcům prostřednictvím následujících sektorů, od zdravotnictví po trestní spravedlnost.“












