AI-mallit ja alustat

Modulate Esittää Ensemble-kuuntelumallit, Uudelleenmäärittelee, Miten AI Ymmärtää Ihmisen Äänen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoäly on edennyt nopeasti, mutta yksi alue on ollut jatkuvasti haasteellinen: todella ymmärtää ihmisen ääni. Ei vain sanat, jotka puhutaan, vaan tunteet, joiden takana ne ovat, aikomus, joka muotoillaan sävylle ja ajalle, ja hienot signaalit, jotka erottavat ystävällisen keskustelun vihamielisyydestä, petoksesta tai vahingosta. Tänään Modulate ilmoitti merkittävän läpimurron esittelemällä Ensemble-kuuntelumallin (ELM), uuden tekoälyarkkitehtuurin, joka on suunniteltu erityisesti todellisen maailman äänen ymmärtämiseen.

Tutkimuksen julkistamisen yhteydessä Modulate esitteli Velma 2.0:n, ensimmäisen tuotantoon otetun Ensemble-kuuntelumallin. Yritys raportoi, että Velma 2.0 ylittää johtavat perusmallit keskustelun tarkkuudessa ja toimii murto-osa kustannuksilla, merkittävä väite aikana, jolloin yritykset arvioivat uudelleen suurten tekoälyjärjestelmien kestävyyttä.

Miksi Ääni on Ollut Haasteellinen AI:lle

Useimmat äänen analysoivat tekoälyjärjestelmät seuraavat tuttua lähestymistapaa. Ääni muunnetaan tekstiksi, ja tämä käännös prosessoidaan suurella kielimallilla. Vaikka tämä on tehokasta tekstintunnistamisessa ja yhteenvetossa, tämä prosessi poistaa paljon siitä, mikä tekee äänen merkitykselliseksi.

Sävy, tunteen sävy, epäröinti, sarkasmi, päällekkäinen puhuminen ja taustamelu kantavat tärkeitä asiayhteyksiä. Kun puhuminen tasataan tekstiksi, nämä ulottuvuudet menetetään usein, mikä johtaa tarkoituksen tai mielipiteen väärään tulkintaan. Tämä muodostuu erityisen ongelmalliseksi ympäristöissä, kuten asiakastukea, petostentorjuntaa, verkkopelaamista ja tekoälyohjattuja viestintää, joissa hienostuneisuus vaikuttaa suoraan lopputuloksiin.

Modulaten mukaan tämä rajoitus on arkkitehtuuriin liittyvä, ei dataohjautuva. Suuret kielimallit on optimoitu tekstin ennustamiseen, ei useiden akustisten ja käyttäytymiseen liittyvien signaaleiden yhdistämiseen reaaliajassa. Ensemble-kuuntelumallit luotiin tämän aukon paikkaamiseksi.

Mitä on Ensemble-kuuntelumalli?

Ensemble-kuuntelumalli ei ole yksittäinen neuroverkko, joka on koulutettu tekemään kaikkea kerran. Sen sijaan se on koordinoitu järjestelmä, joka koostuu monista erikoistuneista malleista, joista jokainen on vastuussa eri ulottuvuuden analysoinnista ääni vuorovaikutuksessa.

ELM:ssä erilliset mallit tutkivat tunteita, stressiä, petosmerkintöjä, puhujan identiteettiä, ajoitusta, prosodiaa, taustamelua ja mahdollisia synteettisiä tai matkittuja ääniä. Nämä signaalit on synchronoitu aikajärjestyksessä orkesterointikerroksessa, joka tuottaa yhdenmukaisen ja selitettävissä olevan tulkinnan siitä, mitä tapahtuu keskustelussa.

Tämä eksplisiittinen työnjako on keskeinen ELM-lähestymistapa. Sen sijaan, että riippuisi yhdestä massiivisesta mallista, joka arvioi merkitystä implisiittisesti, Ensemble-kuuntelumallit yhdistävät useita kohdennettuja näkemyksiä, parantaen sekä tarkkuutta että läpinäkyvyyttä.

Velma 2.0:n Sisällä

Velma 2.0 on merkittävä kehitysaskel Modulaten aikaisempiin ensemble-pohjaisiin järjestelmiin. Se käyttää yli 100 komponenttimallia, jotka toimivat yhdessä reaaliajassa, jaoteltuna viiteen analyysikerrokseen.

Ensimmäinen kerros keskittyy perusäänenkäsittelyyn, määrittäen puhujien määrän, puhumisen ajoituksen ja tauot. Seuraavaksi tulee akustisen signaalin erottelu, joka tunnistaa emotionaaliset tilat, stressitasot, petosmerkit, synteettiset äänet ja ympäristömelun.

Kolmas kerros arvioi havaittua aikomusta, erottaa vilpittömän ylistyksen ja sarkastisen tai vihamielisen kommentin. Käyttäytymismallinnus seuraa keskusteludynamiikkaa ajan myötä, havaiten frustraatiota, sekaannusta, kirjoitettua puhetta tai yrittää sosiaalista insinööritaitoa. Viimeinen kerros, keskusteluanalyysi, kääntää nämä oivallukset yritysten kannalta merkityksellisiksi tapahtumiksi, kuten tyytymättömiin asiakkaisiin, käytäntörikkomuksiin, mahdolliseen petokseen tai vikaiseen tekoälytoimintaan.

Modulate raportoi, että Velma 2.0 ymmärtää keskustelun merkityksen ja aikomuksen noin 30 prosenttia tarkemmin kuin johtavat LLM-pohjaiset lähestymistavat, ollessaan samalla 10-100 kertaa kustannustehokkaampi suurella mittakaavalla.

Pelaamisen Moderoinnista Yritysälyyn

Ensemble-kuuntelumallien juuret ovat Modulaten varhaisessa työssä verkkopeleissä. Suositut nimet, kuten Call of Duty ja Grand Theft Auto Online, tuottavat joitain haasteellisimmista ääniympäristöistä kuviteltavissa. Keskustelut ovat nopeita, meluisia, emotionaalisia ja täynnä slangiä ja asiayhteyksiä.

Erottaminen leikkimielisestä roskapuheesta todellisesta ahdistelusta reaaliajassa vaatii paljon enemmän kuin käännös. Kun Modulate toimi äänimoderointijärjestelmäänsä, ToxMod, se kokoili asteittain yhä monimutkaisempia malleja, jotka pyrkivät kaappaamaan nämä hienostuneisuudet. Koordinoimalla kymmeniä erikoistuneita malleja tuli välttämätöntä saavuttaa vaadittu tarkkuus, mikä lopulta johti tiimin kehittämään lähestymistapaa uudeksi arkkitehtuurikehykseksi.

Velma 2.0 yleistää tämän arkkitehtuurin pelaamisen ulkopuolelle. Nykyään se ohjaa Modulaten yritysalustaa, analysoi satoja miljoonia keskusteluita eri aloilla, tunnistaa petosta, ahdistelua, asiakastyytymättömyyttä ja epätyypillistä tekoälytoimintaa.

Haaste Perusmalleille

Ilmoitus tulee hetkellä, jolloin yritykset arvioivat uudelleen tekoälystrategiaansa. Huolimatta massiivisesta investoinnista, suuri osa tekoälyhankkeista ei pääse tuotantoon tai toisi kestävää arvoa. Yleisiä esteitä ovat hallusinaatiot, kasvavat johtopäätöskustannukset, epäselvät päätöksentekoprosessit ja vaikeus integroida tekoälyoivalluksia operatiivisiin työnkulkuun.

Ensemble-kuuntelumallit vastaavat näihin ongelmiin suoraan. Luottamalla useisiin pienempiin, tarkoitukseen suunniteltuihin malleihin yhden massiivisen järjestelmän sijaan, ELM:t ovat vähemmän kalliita käyttää, helpommin tarkastettavissa ja selitettävissä. Jokainen tuloste voidaan jäljittää takaisin tiettyihin signaaleihin, mikä mahdollistaa organisaatioille ymmärtää, miksi johtopäätös tehtiin.

Tämä läpinäkyvyyden taso on erityisen tärkeää säänneltyissä tai korkean riskin ympäristöissä, joissa mustan laatikon päätökset eivät ole hyväksyttäviä. Modulate asettaa ELM:t eivät korvanne large language malleja, vaan tarjoavat enemmän soveltuvan arkkitehtuurin yritysten ääniälylle.

Äänen Ulkopuolella

Yksi Velma 2.0:n eteenpäin suuntautuvista näkymistä on sen kyky analyysia siitä, miten asia on sanottu, ei vain mitä on sanottu. Tämä sisältää synteettisten tai matkittujen äänien havaitsemisen, kasvavan huolen aiheen, kun äänen generointiteknologia tulee helpommin saataville.

Kun äänen kloonaus paranee, yritykset kohtaavat kasvavia riskejä, jotka liittyvät petokseen, identiteetin väärentämiseen ja sosiaaliseen insinööritaitoon. Sisällyttämällä synteettisen äänen havaitsemisen suoraan ensembleen, Velma 2.0 kohdellaan aitousmerkkinä, ei valinnaisena lisäominaisuutena.

Järjestelmän käyttäytymismallinnus mahdollistaa myös proaktiiviset oivallukset. Se voi tunnistaa, kun puhuja lukee käsikirjoitusta, kun frustraatio kasvaa tai kun vuorovaikutus on suuntautumassa konfliktiin. Nämä kyvyt sallivat organisaatioille puuttua asioiden kulkuun aikaisemmin ja tehokkaammin.

Uusi Suunta Yritysten Tekoälylle

Modulate kuvailee Ensemble-kuuntelumallia uutena tekoälyarkkitehtuurin luokkana, joka on erillinen sekä perinteisistä signaalinkäsittelyputkistosta että suurista perusmalleista. Taustalla oleva oivallus on, että monimutkaiset ihmisten vuorovaikutukset ymmärretään paremmin koordinoituja erikoistumista kuin voimakkaan skaalautuvuuden kautta.

Kun yritykset vaativat tekoälyjärjestelmiä, jotka ovat vastuullisia, tehokkaita ja soveltuvia todellisiin operatiivisiin tarpeisiin, Ensemble-kuuntelumallit osoittavat tulevaisuuteen, jossa älykkyys koostuu monista kohdennetuista komponenteista. Velma 2.0:n ollessa jo tuotannossa Modulate panostaa siihen, että tämä arkkitehtuuri muuttaa äänen sääntöjä.

Alalla, joka etsii vaihtoehtoja yhä suuremmille mustille laatikoille, Ensemble-kuuntelumallit viittaavat siihen, että seuraava merkittävä edistysaskel tekoälyssä voi tulla kuuntelemalla tarkemmin, ei yksinkertaisesti laskemalla aggressiivisemmin.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.