Modely a platformy AI

Výzkumníci vyvinuli model rozpoznávání lidské řeči pomocí hlubokých neuronových sítí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Skupina výzkumníků z Německa zkoumá nový model rozpoznávání lidské řeči založený na strojovém učení a hlubokých neuronových sítích. Tento nový model by mohl výrazně zlepšit rozpoznávání lidské řeči.

Algoritmy pro sluchadla jsou obvykle používány ke zlepšení rozpoznávání lidské řeči a jsou hodnoceny prostřednictvím různých experimentů, které určují poměr signálu a šumu, při kterém je rozpoznán určitý počet slov. Tyto experimenty jsou však často časově náročné a drahé.

Nový model byl popsán ve výzkumu publikovaném v The Journal of the Acoustical Society of America.

Předpovědi pro sluchově postižené posluchače

Jana Roßbach je jedním z autorů z Univerzity Carla von Ossietzkyho.

„Novost našeho modelu spočívá v tom, že poskytuje dobré předpovědi pro sluchově postižené posluchače pro typy šumu s velmi rozdílnou složitostí a ukazuje nízké chyby a vysoké korelace s měřenými daty,” uvedla Roßbach.

Tým výzkumníků vypočítal, kolik slov za větu může posluchač pochopit prostřednictvím automatického rozpoznávání řeči (ASR). Nástroje pro rozpoznávání řeči, jako je Alexa a Siri, spoléhají na toto ASR, které je široce dostupné.

Studie a výsledky

Studie provedená týmem zahrnovala osm osob se standardním sluchem a 20 osob se sluchovým postižením. Posluchači byli vystaveni mnoha různým komplexním šumům, které skrývaly řeč, a osoby se sluchovým postižením byly rozděleny do tří skupin podle stupně věkem podmíněného sluchového poškození.

Pomocí nového modelu mohli výzkumníci předpovědět výkon rozpoznávání lidské řeči u sluchově postižených posluchačů s rozdílnými stupni sluchového poškození. Byli schopni učinit tyto předpovědi pro různé typy šumových maskérů s rozdílnou složitostí v časové modulaci a podobnosti s skutečnou řečí. To vše umožnilo pozorovat a analyzovat každého člověka individuálně ve vztahu k možnému sluchovému poškození.

“Byli jsme nejvíce překvapeni, že předpovědi fungovaly dobře pro všechny typy šumu. Očekávali jsme, že model bude mít problémy s použitím jediného soutěžícího mluvčího. Ale tomu tak nebylo,” uvedla Roßbach.

Jelikož byl model zaměřen na sluch jedním uchem, tým se nyní bude snažit vytvořit binaurální model pro sluch dvěma ušima. Říkají také, že nový model by mohl být použit k předpovědi úsilí při poslechu nebo kvality řeči.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.