Modele i platformy AI

Naukowcy starają się rozszerzyć automatyczne rozpoznawanie mowy do 2000 języków

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Zespół naukowców z Carnegie Mellon University stara się rozszerzyć automatyczne rozpoznawanie mowy do 2000 języków. Jak dotąd, tylko część z około 7000 do 8000 mówionych języków na świecie może skorzystać z nowoczesnych technologii językowych, takich jak transkrypcja głosowa lub automatyczne napisy.

Xinjian Li jest doktorantem w Szkole Nauk Komputerowych Instytutu Technologii Językowych (LTI).

“Wiele osób na świecie mówi różnymi językami, ale narzędzia technologiczne nie są rozwijane dla wszystkich z nich”, powiedział. “Rozwój technologii i dobrego modelu językowego dla wszystkich ludzi jest jednym z celów tego badania.”

Li należy do zespołu ekspertów, którzy starają się uprościć wymagania dotyczące danych językowych do opracowania modelu rozpoznawania mowy.

Zespół obejmuje również członków wykładowych LTI: Shinji Watanabe, Florian Metze, David Mortensen i Alan Black.

Badanie zatytułowane „ASR2K: Rozpoznawanie mowy dla około 2000 języków bez dźwięku” zostało przedstawione na konferencji Interspeech 2022 w Korei Południowej.

Większość istniejących modeli rozpoznawania mowy wymaga zestawów danych tekstowych i audio. Chociaż dane tekstowe istnieją dla tysięcy języków, nie jest to prawdą w przypadku danych audio. Zespół chce wyeliminować potrzebę danych audio, koncentrując się na elementach językowych, które są wspólne dla wielu języków.

Technologie rozpoznawania mowy zwykle koncentrują się na fonemach języka, które są odrębnymi dźwiękami, różniącymi się od innych języków. Są one unikalne dla każdego języka. Jednocześnie języki mają fonemy, które opisują, jak słowo brzmi fizycznie, a wiele fonemów może odpowiadać jednej fonemowi. Chociaż oddzielne języki mogą mieć różne fonemy, podstawowe fonemy mogą być takie same.

Zespół pracuje nad modelem rozpoznawania mowy, który opiera się mniej na fonemach, a bardziej na informacjach o tym, jak fonemy są wspólne między językami. To pomaga zmniejszyć wysiłek potrzebny do budowy oddzielnych modeli dla każdego języka. Poprzez połączenie modelu z drzewem filogenetycznym, które jest diagramem mapującym relacje między językami, pomaga w regułach wymowy. Model zespołu i struktura drzewa umożliwiły im przybliżenie modelu mowy dla tysięcy języków, nawet bez danych audio.

“Staramy się usunąć ten wymóg danych audio, co pozwala nam przenieść się z 100 do 200 języków do 2000”, powiedział Li. “To jest pierwsze badanie, które ma na celu tak dużą liczbę języków, a my jesteśmy pierwszym zespołem, który stara się rozszerzyć narzędzia językowe na taką skalę.”

Badanie, choć jeszcze w wczesnej fazie, poprawiło istniejące narzędzia przybliżania języka o 5%.

“Każdy język jest bardzo ważnym czynnikiem w swojej kulturze. Każdy język ma swoją własną historię, a jeśli nie będziemy starać się zachować języków, te historie mogą zostać utracone”, powiedział Li. “Rozwój tego rodzaju systemu rozpoznawania mowy i tego narzędzia jest krokiem w kierunku zachowania tych języków.”

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.