Modele i platformy AI

aiOla wprowadza QUASAR, aby zmienić sposób, w jaki rozpoznawanie mowy działa w produkcji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

aiOla przedstawiła QUASAR, platformę zaprojektowaną do rozwiązania jednego z najbardziej uporczywych problemów w przedsiębiorstwach wykorzystujących sztuczną inteligencję głosową: niespójnej wydajności rozpoznawania mowy w warunkach rzeczywistych. Zamiast zamykać klientów w jednym dostawcy automatycznego rozpoznawania mowy (ASR), QUASAR działa jako inteligentna brama, która dynamicznie kieruje każde interakcje audio do silnika ASR, który najprawdopodobniej najlepiej wykona się w tym momencie.

Ta zmiana ma znaczenie, ponieważ mowa staje się podstawowym wejściem dla procesów opartych na sztucznej inteligencji w centrach kontaktowych, zgodności, analizie, wyszukiwaniu i coraz częściej w autonomicznych agentach AI. Podczas gdy wyniki benchmarkowe często wytyczają wybór ASR, środowiska produkcyjne dominują akcenty, hałas tła, terminologia specyficzna dla danego obszaru i zmieniająca się jakość sieci — czynniki, które mogą dramatycznie zmienić dokładność rozpoznawania od jednej interakcji do kolejnej.

Dlaczego rozwiązanie ASR “jednego rozmiaru dla wszystkich” zawodzi w skali

Większość przedsiębiorstw wdrożyła ASR jako decyzję infrastrukturalną. Wybrany jest jeden dostawca na podstawie agregowanych wyników benchmarkowych, a następnie głęboko wbudowany w procesy. W praktyce tworzy to punkty ślepe. Silnik, który wyróżnia się w czytanej, czystej mowie, może mieć trudności z mówcami o akcentach lub specyficznym słownictwie branżowym. Inny może radzić sobie dobrze z hałaśliwym audio, ale mijać właściwe nazwy lub sekwencje numeryczne, które są kluczowe dla zgodności i rozliczeń.

Zmiana dostawcy w celu rozwiązania tych luk jest kosztowna i perturbująca, często wymagając ponownego szkolenia, ponownej weryfikacji i przestojów operacyjnych. Tymczasem nowe modele ASR i aktualizacje są wydawane w tempie, który przewyższa możliwości większości organizacji do testowania i wdrożenia. W efekcie jest to niższy poziom zawartości, mniej dokładne podsumowania, słabsze analiza, wyższe nakłady na zapewnienie jakości — wszystko napędzane przez błędy transkrypcji, które można było uniknąć.

Wewnętrzna architektura QUASAR: Traktowanie ASR jako dynamicznego problemu

QUASAR podchodzi do rozpoznawania mowy jako do wyzwania optymalizacji w czasie rzeczywistym. Każde przychodzące żądanie audio jest oceniane przed transkrypcją, biorąc pod uwagę czynniki takie jak cechy mówcy, warunki akustyczne i kontekst domeny. Na podstawie tej oceny system kieruje audio do silnika ASR, który najprawdopodobniej dostarczy najwyższej jakości wynik dla tej konkretnego interakcji.

Technicznie QUASAR działa jako warstwa orkiestracji, która może współpracować z komercyjnymi API chmury, samodzielnymi modelami i niestandardowymi wdrożeniami ASR. Ta abstrakcja pozwala przedsiębiorstwom na eksperymentowanie z nowymi silnikami, balansowanie kosztów i jakości oraz unikanie długoterminowego zamykania się na konkretnych dostawców — wszystko to bez zmiany aplikacji po stronie odbiorczej.

W centrum znajduje się mechanizm oceny i klasyfikacji, który w czasie rzeczywistym ocenia opcje ASR. Zamiast polegać wyłącznie na historycznych średnich, system ciągle uczy się z warunków na żywo, umożliwiając decyzje transkrypcyjne, które dostosowują się do ewoluujących środowisk, mówców i przypadków użycia.

Wydajność w rzeczywistych warunkach audio

W wewnętrznych ocenach, które objęły sześć różnorodnych zestawów danych benchmarkowych — od czytelnej mowy i profesjonalnych prezentacji po akcentowaną, hałaśliwą i specyficzną dla danego obszaru mowę finansową — QUASAR wybrał najlepszą opcję ASR z ogólną dokładnością 88,8%, lub odpowiedni wybór, gdy wyniki były skutecznie związane. Dokładność sięgała nawet 97% dla czystej mowy i utrzymywała się w zakresie 79–88% dla bardziej wymagającego audio, obejmującego akcenty, hałas i specyficzną terminologię.

Te wyniki podkreślają kluczową wiedzę: żaden pojedynczy silnik ASR nie konsekwentnie wygrywa we wszystkich scenariuszach, ale inteligentne routowanie może wykorzystać moc wielu.

Włączanie głosu jako żywej infrastruktury

Dzięki odłączeniu jakości rozpoznawania mowy od stałego dostawcy, QUASAR zmienia ASR w to, co aiOla opisuje jako „żywą infrastrukturę”. Przedsiębiorstwa zyskują szczegółową widoczność wydajności transkrypcyjnej na poziomie interakcji, wraz z możliwością optymalizacji pod kątem dokładności, kosztów lub opóźnień, w zależności od przypadku użycia.

Podejście to przyspiesza również rozwój w nowych regionach i branżach. Zamiast czekać, aż jeden dostawca wesprze język, akcent lub specyficzną terminologię branżową, organizacje mogą kierować ruch do silnika najlepiej dopasowanego do tego obszaru — i zmieniać, gdy pojawiają się lepsze opcje.

Szerokie wizje aiOla dla workflow opartych na głosie

QUASAR opiera się na szerszej misji aiOla, aby uczynić głos naturalnym interfejsem dla systemów przedsiębiorstw. Patenty firmy łączą rozpoznawanie głosu z inteligencją workflow, aby przekształcić wprowadzane dane głosowe w strukturyzowane, czasowe dane. Umożliwia to automatyzację bez udziału rąk w branżach krytycznych, gdzie ręczne wprowadzanie danych pozostaje wąskim gardłem.

Wspierana przez 58 milionów dolarów finansowania i zespołem badawczym, aiOla pozycjonuje głos nie tylko jako modalność wejściową, ale jako podstawową infrastrukturę dla operacji opartych na sztucznej inteligencji. Z QUASAR, firma rozszerza tę wizję na samą warstwę ASR — wyzywając długotrwałe założenia na temat tego, jak rozpoznawanie mowy powinno być wdrożone w skali.

Gdy głos staje się podstawowym interfejsem dla agentów AI i systemów przedsiębiorstw, dynamiczne, świadome kontekstu rozpoznawanie mowy może okazać się niezwykle istotne. Uruchomienie QUASAR sygnalizuje odejście od statycznych wyborów modeli w kierunku adaptacyjnej, napędzanej wydajnością orkiestracji — podejście, które może zmienić sposób, w jaki cały ekosystem sztucznej inteligencji głosowej korzysta z ASR.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.