Modely a platformy AI

Spuštění autonomního softwaru pro rozpoznávání řeči Speechmatics

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vedoucí startup pro rozpoznávání řeči Speechmatics spustil svůj software „Autonomní rozpoznávání řeči“, který využívá nejnovější techniky hlubokého učení a průlomové samořízené modely. Systém prokázal schopnost překonat Amazon (AMZN ), Google (GOOGL ) a Microsoft.

Stanfordovy datové sady

Speechmatics je založen na datech z Stanfordovy studie Rasové rozdíly v rozpoznávání řeči a dosáhl celkové přesnosti 82,8 % pro africké americké hlasy. Pro srovnání, Google dosáhl přesnosti pouze 68,7 %, zatímco Amazon dosáhl 68,6 %.

Úroveň přesnosti odpovídá 45% snížení chyb v rozpoznávání řeči, což je ekvivalent tří slov v průměrné větě. Nový systém Speechmatics není pouze přesný v tomto ohledu, ale také prokázal zlepšení přesnosti napříč akcenty, věkem, dialekty a různými jinými socio-demografickými charakteristikami.

Často dochází k nedorozumění v rozpoznávání řeči kvůli omezenému množství označených dat, která algoritmy mohou použít pro sebe-vyučování. Označená data musí být ručně klasifikována lidmi, což vede k menšímu množství dostupných dat pro tyto systémy. To také omezuje reprezentaci všech hlasů, což vytváří novou sadu problémů.

Školení na neošetřených datech

Speechmatics dosahuje velkého pokroku v tomto ohledu, protože jeho technologie je školená na obrovském množství neošetřených dat získaných přímo z internetu. Data pocházejí z věcí, jako je obsah sociálních médií a podcastů.

Samořízené učení umožnilo systému být školen na 1,1 milionu hodin audio, což je nárůst z předchozích 30 000 hodin. To umožňuje mít mnohem širší rozsah reprezentace hlasů a pomáhá snižovat chyby a předějové AI v rozpoznávání řeči.

Pokud jde o děti, Speechmatics také prokázal schopnost překonat konkurenty. Děti jsou obtížné rozpoznat pomocí tradiční technologie rozpoznávání řeči, ale Speechmatics dosáhl přesnosti 91,8 %. Google dosáhl pouze 83,4 % a Deepgram 82,3 %.

Katy Wigdahl je CEO Speechmatics.

„Jsme na misi dodat další generaci schopností strojového učení a prostřednictvím toho nabídnout více inkluzivní a přístupnou technologii řeči. Toto oznámení je obrovským krokem k dosažení této mise.“

„Naše zaměření na řešení předějů AI vedlo k tomuto monumentálnímu pokroku v oboru rozpoznávání řeči a efekt bude mít dopad na mnoho různých scénářů,“ pokračoval Wigdahl. „Zamyslete se na nesprávné titulky, které vidíme na sociálních médiích, soudní jednání, kde jsou slova špatně přepisována, a eLearningové platformy, které měly potíže s dětmi během pandemie. Chyby, které lidé museli přijmout doposud, mohou mít hmatatelný dopad na jejich denní život.“

Allison Zhu Koenecke je vedoucí autorka Stanfordovy studie o rozpoznávání řeči.

„Je zásadní studovat a zlepšovat spravedlnost v systémech řeč-na-text, vzhledem k potenciálu pro rozdílnou újmu jednotlivcům prostřednictvím následujících sektorů, od zdravotnictví po trestní spravedlnost.“

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.