Finansowanie
Modulate pozyskuje $25 mln na budowę warstwy inteligencji dla Voice AI

Modulate pozyskał $25 mln nowego finansowania, gdy firma z Bostonu chce wykorzystać rosnące wyzwanie w sztucznej inteligencji: nauczyć maszyny rozumieć nie tylko to, co ludzie mówią, ale także jak to mówią.
Future Ventures poprowadziło rundę, z udziałem Hyperplane i Lakestar. Finansowanie podnosi łączną kwotę pozyskanych środków Modulate do $60 mln i zostanie przeznaczone na rozwój badań AI, zespołów inżynieryjnych, narzędzi dla deweloperów, partnerstw oraz opcji wdrożeniowych.
Inwestycja pojawia się w momencie, gdy głos coraz częściej staje się interfejsem dla agentów AI, platform obsługi klienta, środowisk gier i systemów bezpieczeństwa. Choć technologia rozpoznawania mowy na tekst znacznie się poprawiła, Modulate stawia na to, że same transkrypcje pomijają dużą część informacji zawartych w ludzkiej mowie.
Technologia ta analizuje natomiast dźwięk źródłowy pod kątem sygnałów, takich jak emocje, ton, intencja, przerwy, syntetyczna mowa oraz zachowania konwersacyjne.
Poza rozpoznawaniem mowy na tekst
Większość współczesnych stosów Voice AI opiera się na stosunkowo prostej architekturze: konwersja mowy na tekst, a następnie przesłanie uzyskanej transkrypcji do dużego modelu językowego (LLM).
Działa to dobrze, gdy same słowa zawierają większość istotnych informacji. Staje się to ograniczające, gdy znaczenie zależy od sarkazmu, frustracji, wahania, stresu, przerw w wypowiedzi lub zmian tonu.
Modulate zbudowało swoją flagową platformę Velma wokół idei, że te sygnały powinny być analizowane bezpośrednio z dźwięku, a nie odtwarzane później na podstawie transkrypcji.
Firma opisuje Velma jako natywny system inteligencji konwersacji oparty na dźwięku, zdolny do generowania transkrypcji przy jednoczesnym rozpoznawaniu mówców, emocji, tematów rozmowy, nastroju oraz ponad 150 zachowań. Deweloperzy mogą także definiować własne zachowania przy użyciu opisów w języku naturalnym.
Otwiera to technologię na zastosowania od identyfikacji sfrustrowanego klienta zanim rozmowa się pogorszy, po wykrywanie podejrzanych zachowań podczas transakcji finansowej, aż po rozpoznawanie, kiedy agent głosowy AI zachowuje się nieoczekiwanie.
W czerwcu Modulate udostępniło Velma bezpośrednio deweloperom poprzez API, poszerzając dostęp poza wcześniejsze wdrożenia korporacyjne.
Modulate przyjmuje podejście ensemble do Audio AI
Architektura pod Velma to to, co Modulate nazywa Model Słuchowy Ensemble, czyli ELM.
Zamiast używać jednego ogromnego modelu do realizacji wszystkich zadań, ELM koordynuje ponad 100 wyspecjalizowanych modeli, a poszczególne komponenty analizują różne cechy strumienia audio.
Modele te mogą badać podstawowe właściwości, takie jak zmiany mówcy i przerwy, wraz z sygnałami wyższego poziomu, takimi jak emocje, postrzegana intencja, znaczniki syntetycznego głosu, dezorientacja czy wzorce zachowań. Warstwa orkiestracji łączy te obserwacje w szerszą interpretację rozmowy.
Jest to wyraźnie odmienna filozofia od coraz powszechniejszej strategii stosowania coraz większych multimodalnych modeli bazowych do audio.
Modulate twierdzi, że specjalizacja pozwala ich architekturze dostarczać bardziej przejrzyste wyniki przy jednoczesnym zmniejszeniu zapotrzebowania na moc obliczeniową. W zastosowaniach korporacyjnych, takich jak wykrywanie oszustw i zgodność, możliwość zrozumienia, dlaczego system wygenerował alert, może być prawie tak samo ważna jak sam alert.
Według firmy, podejście może być nawet 1 000 razy bardziej wydajne obliczeniowo niż użycie jednego dużego modelu w niektórych zadaniach analizy audio.
Voice AI tworzy nowy problem monitorowania
Termin finansowania odzwierciedla także szerszą zmianę zachodzącą w dziedzinie AI w przedsiębiorstwach.
Systemy AI są coraz bardziej zdolne do prowadzenia pełnych rozmów głosowych z klientami. Oznacza to, że firmy muszą teraz monitorować interakcje obejmujące nie tylko ludzkich pracowników, ale także autonomiczne agenty działające w tysiącach, a nawet milionach rozmów.
Agent głosowy może technicznie podążać za scenariuszem, a jednocześnie wielokrotnie przerywać klientom, nie rozpoznawać frustracji, błędnie interpretować intencję lub słabo reagować na sytuacje emocjonalne.
Modulate dostrzega możliwość stanie się niezależną warstwą nasłuchu obok tych agentów.
Technologia ich agenta głosowego jest zaprojektowana tak, aby identyfikować sygnały takie jak przerwania, pauzy, emocje, akcenty i inne cechy trudne do uchwycenia wyłącznie z tekstu, umożliwiając deweloperom dostosowanie zachowania agenta w trakcie trwania rozmowy.
Ta sama infrastruktura może być zastosowana do rozmów ludzkich, w których organizacje muszą w czasie rzeczywistym identyfikować oszustwa, ryzyka zgodności, molestowanie lub inne potencjalnie istotne zdarzenia.
Od moderacji gier do szerszej inteligencji głosowej
Obecne ambicje Modulate stanowią znaczące rozszerzenie w porównaniu z wcześniejszym skupieniem się na grach online.
Jednym z jej najbardziej znanych produktów, ToxMod, opracowano w celu analizowania komunikacji głosowej w czasie rzeczywistym na platformach gamingowych i społecznościowych oraz identyfikowania nękania, zagrożeń, groomingu i innych szkodliwych zachowań.
To nadal ważna część działalności. Modulate twierdzi, że ToxMod może integrować się bezpośrednio z istniejącą infrastrukturą głosową, jednocześnie kierując potencjalnie problematyczne interakcje do systemów moderacji lub ludzkich recenzentów.
Firma współpracowała z dużymi firmami gamingowymi, takimi jak Activision, Riot Games, Rockstar Games i Rec Room.
Jednak podstawowa technologia niezbędna do rozumienia toksyczności w grze wieloosobowej może być również dostosowana do innych środowisk, w których kontekst ma znaczenie.
Modulate obecnie pozycjonuje swoją technologię w obszarach zapobiegania oszustwom, centrom kontaktowym, nadzorowi agentów AI, wykrywaniu deepfake, doświadczeniu klienta oraz zaufaniu i bezpieczeństwu.
Obecnie jego platforma deweloperska oferuje wiele rodzin modeli obejmujących transkrypcję, wykrywanie deepfake, redakcję audio, inteligencję konwersacyjną oraz inne możliwości analizy dźwięku.
Deepfake dodają kolejny powód, by rozumieć dźwięk bezpośrednio
Synthetic speech staje się kolejną ważną częścią tej szansy.
W miarę jak coraz bardziej przekonujące klonowanie głosu staje się dostępne, organizacje obsługujące transakcje finansowe lub wrażliwe informacje muszą określić nie tylko, co rozmówca mówi, ale czy sam głos jest autentyczny.
Modulate w konsekwencji rozszerzyło się o wykrywanie deepfake, łącząc analizę syntetycznego głosu ze szerszymi informacjami kontekstowymi dostępnymi dzięki swoim modelom audio.
Firma twierdzi, że jej technologia obecnie analizuje ponad 10 milionów godzin dźwięku miesięcznie i przetworzyła ponad 600 milionów godzin łącznie.
Rozszerzenie na obszary takie jak wykrywanie muzyki generowanej przez AI również ilustruje, jak szeroko podstawowa architektura zespołowa może potencjalnie zostać zastosowana. System wykrywania muzyki Modulate, na przykład, ocenia osobno obecność muzyki, wokali generowanych przez AI oraz instrumentacji generowanej przez AI, zanim połączy sygnały w interpretowalny wynik.
Kolejnym wyzwaniem dla Voice AI jest rozumienie, a nie mówienie
Inwestycja w wysokości 25 milionów dolarów daje Modulate dodatkowe zasoby na rozwój badań, inżynierii, narzędzi deweloperskich i partnerstw. Szerszo patrząc, odzwierciedla to rosnące wyzwanie dla voice AI: naturalne mówienie to tylko połowa rozmowy.
W miarę jak agenci głosowi wchodzą do obsługi klienta, opieki zdrowotnej, usług finansowych i innych dziedzin, systemy będą musiały rozumieć sygnały, które transkrypcje często pomijają, w tym frustrację, wahanie, podkreślenie, ton oraz ewentualną syntetyczną mowę.
Może to stworzyć nową warstwę inteligencji wokół interakcji głosowych, pomagając systemom wykrywać oszustwa, rozpoznawać, kiedy klienci są niezadowoleni, lub identyfikować, kiedy agent AI nie rozumie lub niewłaściwie prowadzi rozmowę.
Jednak technologia rodzi również pytania dotyczące prywatności, dokładności i uprzedzeń. Wnioskowanie o emocjach lub intencjach z mowy jest bardziej subiektywne niż transkrypcja słów, szczególnie w kontekście różnych akcentów, języków i kultur.
W miarę jak AI staje się coraz bardziej zdolne do mówienia jak człowiek, kolejną granicą może być określenie, jak dobrze maszyny naprawdę słuchają — i jak odpowiedzialnie te możliwości są wykorzystywane.












