Rahoitus
Modulate keräsi 25 miljoonaa dollaria rakentaakseen älykerroksen ääni‑AI:lle

Modulate on kerännyt 25 miljoonaa dollaria uutta rahoitusta, kun Bostonissa toimiva yritys pyrkii hyödyntämään kasvavaa haasteita tekoälyssä: opettaa koneita ymmärtämään paitsi mitä ihmiset sanovat, myös miten he sanovat sen.
Future Ventures johti kierrosta, ja mukana olivat Hyperplane sekä Lakestar. Tämä rahoitus nostaa Modulate‑yrityksen kokonaisrahoituksen 60 miljoonaan dollariin, ja sitä käytetään laajentamaan sen tekoälytutkimusta, insinööritiimejä, kehittäjätyökaluja, kumppanuuksia ja käyttöönotto‑vaihtoehtoja.
Rahoitus tulee aikana, jolloin ääni yhä useammin toimii käyttöliittymänä tekoäly‑agenteille, asiakaspalvelualustoille, pelimaailmoille ja turvajärjestelmille. Vaikka puhe‑teksti‑tekniikka on kehittynyt dramaattisesti, Modulate uskoo, että pelkät transkriptiot jättävät paljon ihmisen puheessa olevaa tietoa huomiotta.
Sen teknologia analysoi sen sijaan taustalla olevaa ääntä signaalien, kuten tunteiden, sävyn, tarkoituksen, taukojen, synteettisen puheen ja keskustelukäyttäytymisen, havaitsemiseksi.
Puhe‑teksti‑rajan ylittäminen
Nykyisen ääni‑AI‑pinon suurin osa noudattaa melko suoraviivaista arkkitehtuuria: puhe muutetaan tekstiksi ja tuloksena oleva transkriptio lähetetään suurelle kielimallille (LLM).
Tämä toimii hyvin, kun sanat itsessään sisältävät suurimman osan olennaisesta tiedosta. Se rajoittuu kuitenkin, kun merkitys riippuu sarkasmista, turhautumisesta, epäröinnistä, stressistä, keskeytyksistä tai sävyn muutoksista.
Modulate on rakentanut lippulaiva‑alustansa Velma idean ympärille, jonka mukaan nämä signaalit tulisi analysoida suoraan äänestä sen sijaan, että ne rekonstruoidaan jälkikäteen transkriptiosta.
Yritys kuvailee Velmaa äänipohjaiseksi keskustelutiedon älyjärjestelmäksi, joka pystyy tuottamaan transkriptioita samalla kun se tunnistaa puhujat, tunteet, keskustelun aiheet, sentimentin ja yli 150 käyttäytymismallia. Kehittäjät voivat myös määritellä omia käyttäytymisiä luonnollisen kielen kuvauksilla.
Tämä avaa teknologian sovelluksiin, jotka vaihtelevat turhautuneen asiakkaan tunnistamisesta ennen kuin puhelu heikkenee, epäilyttävän käyttäytymisen havaitsemiseen taloudellisen tapahtuman aikana, tai sen havaitsemiseen, milloin tekoäly‑ääni‑agentti toimii odottamattomasti.
Kesäkuussa Modulate avasi Velman suoraan kehittäjille API:n kautta, laajentaen pääsyä aiempien yrityskäyttöön tarkoitettujen toteutusten ulkopuolelle.
Modulate käyttää ensemble‑lähestymistapaa ääni‑AI:hin
Velman alla oleva arkkitehtuuri on sitä, mitä Modulate kutsuu Ensemble Listening Model -malliksi, eli ELM:ksi.
Sen sijaan, että yksi valtava malli suorittaisi kaikki tehtävät, ELM koordinoi yli 100 erikoistunutta mallia, joista yksittäiset komponentit analysoivat äänenvirran eri ominaisuuksia.
Nämä mallit voivat tarkastella perusominaisuuksia, kuten puhujan vaihtumista ja taukoja, sekä korkeamman tason signaaleja, kuten tunteita, koettua tarkoitusta, synteettisen äänen merkkejä, sekaannusta tai käyttäytymismalleja. Orkestrointikerros yhdistää nämä havainnot laajemmaksi keskustelun tulkinnaksi.
Se on selvästi erilainen filosofia kuin yhä yleisempi strategia, jossa yhä suurempia multimodaalisia perusmalleja sovelletaan ääneen.
Modulate väittää, että erikoistuminen mahdollistaa arkkitehtuurin tuottavan läpinäkyvämpiä tuloksia samalla kun se vähentää tarvittavan laskennan määrää. Yrityssovelluksissa, kuten petosten havaitsemisessa ja säädösten noudattamisessa, kyky ymmärtää, miksi järjestelmä antoi hälytyksen, voi olla lähes yhtä tärkeä kuin itse hälytys.
Yrityksen mukaan lähestymistapa voi olla jopa 1 000‑kertaisesti laskennallisesti tehokkaampi kuin yhden suuren mallin käyttö joissakin ääni‑analyysitehtävissä.
Ääni‑AI luo uuden valvontaongelman
Rahoituksen ajoitus heijastaa myös laajempaa muutosta, joka tapahtuu yritys‑AI:n kentällä.
Tekoälyjärjestelmät pystyvät yhä paremmin käymään täydellisiä puhekeskusteluja asiakkaiden kanssa. Tämä tarkoittaa, että yritysten on nyt valvottava vuorovaikutuksia, jotka eivät koske vain ihmistyöntekijöitä, vaan myös autonomisia agenteja, jotka toimivat tuhansissa tai jopa miljoonissa keskusteluissa.
Ääni‑agentti saattaa teknisesti noudattaa käsikirjoitusta, mutta silti toistuvasti keskeyttää asiakkaita, epäonnistua turhautumisen tunnistamisessa, ymmärtää tarkoituksen väärin tai vastata huonosti tunnepitoisiin tilanteisiin.
Modulate näkee mahdollisuuden toimia itsenäisenä kuuntelukerroksena, joka istuu näiden agenttien rinnalla.
Sen ääni‑agenttiteknologia on suunniteltu tunnistamaan signaaleja, kuten keskeytyksiä, taukoja, tunteita, aksentteja ja muita ominaisuuksia, joita on vaikea saada kiinni pelkän tekstin perusteella, jolloin kehittäjät voivat säätää agentin käyttäytymistä keskustelun aikana.
Samaa infrastruktuuria voidaan soveltaa ihmiskeskusteluihin, joissa organisaatioiden täytyy tunnistaa petoksia, säädösten noudattamisen riskejä, häirintää tai muita mahdollisesti merkittäviä tapahtumia reaaliaikaisesti.
Pelien moderoinnista laajempaan ääni‑älyyn
Modulate:n nykyiset tavoitteet edustavat merkittävää laajentumista aiemmasta keskittymisestään online-pelaamiseen.
Yksi sen tunnetuimmista tuotteista, ToxMod, kehitettiin analysoimaan reaaliaikaisia ääniviestintöjä pelialustoilla ja sosiaalisissa verkostoissa sekä tunnistamaan häirintä, uhkia, groomingia ja muuta haitallista käyttäytymistä.
Se on edelleen tärkeä osa liiketoimintaa. Modulate kertoo, että ToxMod voi integroitua suoraan olemassa olevaan äänijärjestelmään samalla kun se ohjaa mahdollisesti ongelmalliset vuorovaikutukset moderointijärjestelmiin tai ihmisen tarkistajille.
Yritys on tehnyt yhteistyötä suurten peliyritysten, kuten Activisionin, Riot Gamesin, Rockstar Gamesin ja Rec Roomin, kanssa.
Mutta moninpelin toksisuuden ymmärtämiseen tarvittavaa taustateknologiaa voidaan myös soveltaa muihin ympäristöihin, joissa konteksti on merkityksellinen.
Modulate asettaa teknologiansa nyt petosten ehkäisyyn, asiakaspalvelukeskuksiin, AI-agenttien valvontaan, deepfake-havaintoon, asiakaskokemukseen sekä luottamukseen ja turvallisuuteen.
Sen kehittäjäalusta tarjoaa tällä hetkellä useita malliperheitä, jotka kattavat puheentunnistuksen, deepfake-havainnon, äänen sensuroinnin, keskustelutiedon ja muut ääni-analyysin ominaisuudet.
Deepfake-teknologia lisää toisen syyn ymmärtää ääntä suoraan
Synthetic speech on nousemassa tärkeäksi osaksi tätä mahdollisuutta.
Kun yhä vakuuttavampi ääniklonaatio tulee saataville, rahoitustapahtumia tai arkaluontoista tietoa käsittelevien organisaatioiden on määritettävä paitsi, mitä soittaja sanoo, myös onko ääni itsessään aito.
Modulate on sen seurauksena laajentanut toimintaansa deepfake-havaintoon yhdistämällä synteettisen äänen analyysin laajempaan kontekstuaaliseen tietoon, joka on saatavilla sen äänimalleista.
Yritys kertoo, että sen teknologia analysoi tällä hetkellä yli 10 miljoonaa äänituntia kuukaudessa ja on käsitellyt yhteensä yli 600 miljoonaa tuntia.
Sen laajentuminen esimerkiksi AI:n tuottaman musiikin havaitsemiseen osoittaa myös, kuinka laajasti taustalla oleva ensemble-arkkitehtuuri voisi mahdollisesti soveltua. Modulate:n musiikin havaitsemisjärjestelmä esimerkiksi arvioi erikseen musiikin, AI:n tuottaman laulun ja AI:n tuottaman instrumentaation läsnäolon ennen kuin yhdistää signaalit tulkittavaksi tulokseksi.
Seuraava haaste ääni‑AI:lle on ymmärtäminen, ei puhuminen
$25 miljoonan sijoitus antaa Modulate-yritykselle lisäresursseja laajentaa tutkimusta, tekniikkaa, kehittäjätyökaluja ja kumppanuuksia. Laajemmin se heijastaa kasvavaa haastetta ääni‑AI:lle: luonnollinen puhuminen on vain puolet keskustelusta.
Kun äänibotit siirtyvät asiakaspalveluun, terveydenhuoltoon, rahoituspalveluihin ja muihin aloihin, järjestelmien on ymmärrettävä signaaleja, jotka transkriptiot usein jättävät huomiotta, kuten turhautuminen, epäröinti, painotus, sävy ja mahdollinen synteettinen puhe.
Tämä voisi luoda uuden älykkyyskerroksen äänivuorovaikutusten ympärille, auttaen järjestelmiä havaitsemaan petoksia, tunnistamaan, milloin asiakkaat ovat tyytymättömiä, tai havaitsemaan, milloin AI‑agentti ymmärtää väärin tai käsittelee keskustelua väärin.
Mutta teknologia herättää myös kysymyksiä yksityisyydestä, tarkkuudesta ja puolueellisuudesta. Tunteiden tai aikomusten päättelemisestä puheesta on subjektiivisempaa kuin sanojen transkriboimisesta, erityisesti eri aksenttien, kielten ja kulttuurien välillä.
Kun AI:n kyky puhua kuin ihminen kasvaa, seuraava raja-alue voi olla selvittää, kuinka hyvin koneet todella kuuntelevat—ja kuinka vastuullisesti näitä kykyjä käytetään.












