Modele și platforme AI

Lansarea software-ului de recunoaștere autonomă a vorbirii de către Speechmatics

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Startup-ul de tehnologie de recunoaștere a vorbirii Speechmatics a lansat software-ul său de „Recunoaștere Autonomă a Vorbirii” care utilizează cele mai recente tehnici de învățare profundă și modele auto-supervizate de ultimă generație. Sistemul a demonstrat capacitatea de a depăși Amazon (AMZN ), Google (GOOGL ) și Microsoft.

Seturile de date Stanford

Speechmatics se bazează pe seturile de date găsite în studiul „Disparități rasiale în recunoașterea vorbirii” al Universității Stanford, și a obținut o acuratețe generală de 82,8% pentru voci de americani afro-americani. Pentru referință, Google a obținut o rată de acuratețe de 68,7%, în timp ce Amazon a obținut 68,6%.

Nivelul de acuratețe corespunde unei reduceri de 45% a erorilor de recunoaștere a vorbirii, ceea ce este echivalentul a trei cuvinte într-o propoziție medie. Nu numai că noul sistem Speechmatics este precis în acest sens, dar a demonstrat și îmbunătățiri ale acurateței pentru accente, vârste, dialecte și alte caracteristici sociodemografice.

Există adesea neînțelegeri în recunoașterea vorbirii datorită cantității limitate de date etichetate pe care algoritmii le pot utiliza pentru a se antrena. Datele etichetate trebuie să fie clasificate manual de către oameni, ceea ce rezultă într-o cantitate mai mică de date disponibile pentru aceste sisteme. Acest lucru limitează și reprezentarea tuturor vocilor, ceea ce creează o nouă serie de probleme.

Antrenarea pe date neetichetate

Speechmatics face progrese importante în acest sens, deoarece tehnologia sa este antrenată pe cantități masive de date neetichetate, sursa directă de pe internet. Datele provin de la lucruri precum conținutul de social media și podcast-uri.

Învățarea auto-supervizată a permis sistemului să fie antrenat pe 1,1 milioane de ore de audio, ceea ce reprezintă o creștere față de cele 30.000 de ore anterioare. Acest lucru îi permite să aibă o gamă mult mai largă de reprezentare a vocilor și ajută la reducerea erorilor și a prejudecăților în recunoașterea vorbirii.

În ceea ce privește voci de copii, Speechmatics a demonstrat, de asemenea, capacitatea de a depăși concurenții. Voci de copii sunt dificil de recunoscut prin tehnologia de recunoaștere a vorbirii legacy, dar Speechmatics a reușit să înregistreze o rată de acuratețe de 91,8%. Google a putut obține doar 83,4%, iar Deepgram 82,3%.

Katy Wigdahl este directorul general al Speechmatics.

„Suntem pe o misiune de a livra următoarea generație de capacități de învățare automată și, prin aceasta, de a oferi tehnologie de vorbire mai inclusivă și mai accesibilă. Această anunțare este un pas uriaș spre atingerea acestei misiuni.”

„Focusul nostru în abordarea prejudecăților AI a condus la acest salt uriaș înainte în industria recunoașterii vorbirii și efectul de undă va duce la schimbări în multe scenarii diferite”, a continuat Wigdahl. „Gândiți-vă la subtitrările incorecte pe care le vedem pe rețelele de socializare, la ședințele de judecată în care cuvintele sunt transcrise greșit și la platformele de învățare la distanță care au luptat cu voci de copii pe tot parcursul pandemiei. Erori pe care oamenii au trebuit să le accepte până acum pot avea un impact tangibil asupra vieții lor de zi cu zi.”

Allison Zhu Koenecke este autorul principal al studiului Stanford despre recunoașterea vorbirii.

„Este esențial să studiem și să îmbunătățim echitatea în sistemele de vorbire-la-text, având în vedere potențialul de a cauza prejudicii disparate indivizilor prin sectoarele descendente, de la sănătate la justiție penală.”

Alex conduce operațiunile de știri alimentate de AI ale Unite.AI, combinând jurnalismul, cercetarea și automatizarea pentru a susține o acoperire rapidă și scalabilă a inteligenței artificiale. Munca sa contribuie la asigurarea că evoluțiile emergente în domeniul AI sunt evidențiate eficient, menținând în același timp standardele editoriale ale publicației.