Financování

Modulate získala $25 M na vybudování inteligentní vrstvy pro hlasové AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Modulate získala 25 milionů dolarů nového financování, protože společnost se sídlem v Bostonu chce využít rostoucí výzvy v oblasti umělé inteligence: naučit stroje rozumět nejen tomu, co lidé říkají, ale i tomu, jak to říkají.

Future Ventures vedla kolo, s účastí Hyperplane a Lakestar. Toto financování zvyšuje celkové financování Modulate na $60 milionů a bude použito k rozšíření výzkumu AI, inženýrských týmů, vývojářských nástrojů, partnerství a možností nasazení.

Investice přichází v době, kdy se hlas stále častěji stává rozhraním pro AI agenty, platformy zákaznické podpory, herní prostředí a bezpečnostní systémy. Přestože technologie převodu řeči na text se dramaticky zlepšila, Modulate sází na to, že samotné přepisy opomíjejí velkou část informací obsažených v lidské řeči.

Jeho technologie místo toho analyzuje podkladový zvuk a hledá signály jako emoce, tón, záměr, pauzy, syntetickou řeč a konverzační chování.

Jít dál než převod řeči na text

Většina dnešních hlasových AI stacků používá poměrně jednoduchou architekturu: převést řeč na text a poté odeslat vzniklý přepis velkému jazykovému modelu (LLM).

To funguje dobře, když samotná slova obsahují většinu relevantních informací. Stává se však omezeným, pokud význam závisí na sarkasmu, frustraci, váhání, stresu, přerušení nebo změnách tónu.

Modulate postavila svou vlajkovou platformu Velma na myšlence, že tyto signály by měly být analyzovány přímo ze zvuku, místo aby byly později rekonstruovány z přepisu.

Společnost popisuje Velmu jako audio‑nativní systém pro konverzační inteligenci, který dokáže vytvářet přepisy a zároveň identifikovat mluvčí, emoce, konverzační témata, sentiment a více než 150 chování. Vývojáři mohou také definovat vlastní chování pomocí popisů v přirozeném jazyce.

To otevírá technologii pro aplikace od identifikace rozhořčeného zákazníka ještě před zhoršením hovoru až po detekci podezřelého chování během finanční transakce nebo rozpoznání, kdy se AI hlasový agent chová nečekaně.

V červnu Modulate zpřístupnila Velmu přímo vývojářům prostřednictvím API, čímž rozšířila přístup mimo své předchozí podnikového nasazení.

Modulate přistupuje k audio AI metodou ansámblu

Architektura pod Velmou je to, co Modulate nazývá Ensemble Listening Model, neboli ELM.

Místo použití jednoho obrovského modelu pro všechny úkoly ELM koordinuje více než 100 specializovaných modelů, přičemž jednotlivé komponenty analyzují různé charakteristiky audio proudu.

Tyto modely mohou zkoumat základní vlastnosti, jako jsou změny mluvčích a pauzy, spolu s vyššími signály, jako jsou emoce, vnímaný záměr, značky syntetického hlasu, zmatení nebo vzorce chování. Orchestrální vrstva pak kombinuje tyto pozorování do širší interpretace konverzace.

Jedná se o výrazně odlišnou filozofii oproti stále častěji používané strategii aplikovat stále větší multimodální základní modely na audio.

Modulate tvrdí, že specializace umožňuje jejich architektuře poskytovat transparentnější výstupy a zároveň snižovat potřebný výpočetní výkon. Pro podnikové aplikace, jako je detekce podvodů a soulad s předpisy, může být schopnost pochopit, proč systém vyvolal upozornění, téměř tak důležitá jako samotné upozornění.

Podle společnosti může být tento přístup až 1 000krát výpočetně efektivnější než použití jediného velkého modelu pro některé úlohy analýzy audia.

Hlasová AI vytváří nový monitorovací problém

Načasování financování také odráží širší posun, který probíhá v podnikovém AI.

AI systémy jsou stále schopnější vést kompletní hlasové konverzace se zákazníky. To znamená, že společnosti nyní musí monitorovat interakce zahrnující nejen lidské zaměstnance, ale i autonomní agenty, kteří operují v tisících či potenciálně milionech konverzací.

Hlasový agent může technicky dodržovat scénář, ale přesto opakovaně přerušovat zákazníky, nepoznávat frustraci, špatně chápat záměr nebo špatně reagovat na emocionální situace.

Modulate vidí příležitost stát se nezávislou poslouchací vrstvou, která bude fungovat vedle těchto agentů.

Jeho technologie hlasových agentů je navržena tak, aby identifikovala signály jako přerušení, pauzy, emoce, přízvuky a další charakteristiky, které je obtížné zachytit pouze z textu, což vývojářům umožňuje upravit chování agenta během probíhajících konverzací.

Stejná infrastruktura může být použita i pro lidské konverzace, kde organizace potřebují v reálném čase identifikovat podvody, rizika související s dodržováním předpisů, obtěžování nebo jiné potenciálně významné události.

Od moderace her po širší hlasovou inteligenci

Současné ambice společnosti Modulate představují významné rozšíření oproti jejímu dřívějšímu zaměření na online hry.

Jedním z jejích nejznámějších produktů, ToxMod, byl vyvinut k analýze živých hlasových komunikací na herních a sociálních platformách a k identifikaci obtěžování, hrozeb, groomingu a dalších škodlivých chování.

To zůstává důležitou součástí podnikání. Modulate uvádí, že ToxMod může být integrován přímo do stávající hlasové infrastruktury a zároveň směrovat potenciálně problematické interakce do moderovacích systémů nebo k lidským recenzentům.

Společnost spolupracovala s předními herními firmami, včetně Activision, Riot Games, Rockstar Games a Rec Room.

Avšak základní technologie potřebná k pochopení toxicity v multiplayerové hře může být také přizpůsobena jiným prostředím, kde je kontext důležitý.

Modulate nyní umisťuje svou technologii do oblastí prevence podvodů, kontaktních center, dohledu nad AI agenty, detekce deepfake, zákaznické zkušenosti a důvěry a bezpečnosti.

Jeho vývojářská platforma v současnosti nabízí několik rodin modelů zahrnujících transkripci, detekci deepfake, redakci audia, konverzační inteligenci a další možnosti analýzy zvuku.

Deepfakes přinášejí další důvod k přímému porozumění zvuku

syntetický hlas se stává dalším důležitým prvkem této příležitosti.

Jak se stále přesvědčivější klonování hlasu stává dostupným, organizace zpracovávající finanční transakce nebo citlivé informace musí zjistit nejen, co volající říká, ale také, zda je samotný hlas autentický.

Modulate proto rozšířila své aktivity o detekci deepfake, kombinujíc analýzu syntetického hlasu s širšími kontextovými informacemi dostupnými prostřednictvím svých audio modelů.

Společnost uvádí, že její technologie v současnosti analyzuje více než 10 milionů hodin audia za měsíc a celkově zpracovala více než 600 milionů hodin.

Jeho rozšíření do oblastí, jako je detekce hudby generované AI, také ukazuje, jak široce může být základní architektura ansámblu potenciálně použita. Například detekční systém hudby od Modulate samostatně hodnotí přítomnost hudby, vokálů generovaných AI a instrumentace generované AI, než sloučí signály do interpretovatelného výsledku.

Další výzvou pro hlasové AI je porozumění, nikoli mluvení

Investice ve výši 25 milionů dolarů poskytuje Modulate další zdroje k rozšíření výzkumu, inženýrství, vývojářských nástrojů a partnerství. Obecněji to odráží rostoucí výzvu pro hlasové AI: mluvit přirozeně je jen polovina konverzace.

Jak hlasoví agenti pronikají do zákaznických služeb, zdravotnictví, finančních služeb a dalších oblastí, systémy budou muset rozpoznávat signály, které přepisy často opomíjejí, včetně frustrace, váhání, důrazu, tónu a možného syntetického hlasu.

To by mohlo vytvořit novou vrstvu inteligence kolem hlasových interakcí, pomáhající systémům detekovat podvody, rozpoznávat, kdy jsou zákazníci nespokojeni, nebo identifikovat, kdy AI agent nerozumí nebo špatně zachází s konverzací.

Technologie však také vyvolává otázky týkající se soukromí, přesnosti a zaujatosti. Odvozování emocí nebo úmyslu ze řeči je subjektivnější než přepisování slov, zejména napříč různými přízvuky, jazyky a kulturami.

Jak se AI stává čím dál tím schopnější mluvit jako člověk, další hranice může být určení, jak dobře stroje dokážou skutečně naslouchat – a jak odpovědně jsou tyto schopnosti využívány.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.