Haastattelut
Matt Hocking, WellSaid Labsin perustaja – Haastattelusarja

Matt Hocking on WellSaid Labsin perustaja, joka on johtava yritysasteen äänigeneraattori. Hänellä on yli 15 vuoden kokemus tiimien johtamisesta ja teknologisen ratkaisun toimittamisesta laajassa mittakaavassa.
Millainen on taustasi, ja miten päädyit mukaan AI:hen?
Olen aina pitänyt itseäni jonkinlaisena yrittäjänä. Valmistuttuani yliopistosta perustin ensimmäisen yritykseni, ja tuotteiden suunnittelun taustalla olen löytänyt itselleni roolin, jossa autan ihmisiä varhaisessa vaiheessa olevilla ideoilla. Urani aikana olen onnistunut työskentelemään useiden startup-yritysten kanssa, jotka ovat menestyneet erinomaisesti. Näiden kokemusten myötä olen saanut vaikutteita monilta perustajilta, ja se on inspiroinut minua kehittämään omia ideoita perustajana. AI oli minulle suhteellisen uusi asia, kun liityin AI2:een, mutta se antoi minulle mahdollisuuden soveltaa tuote- ja startup-näkökulmaani uusiin tutkimuksiin ja kuvitella, miten nämä edistyneet kehitysaskeleet voivat auttaa monia ihmisiä tulevina vuosina. Tavoitteenani on ollut kehittää oikeasti toimivia liiketoimintamalleja, ja uskon, että AI:lla on potentiaalia luoda monia jännittäviä mahdollisuuksia ja tehokkuutta tulevaisuudessa, jos sitä sovelletaan tarkoituksenmukaisesti.
Voitko kertoa tarinan siitä, miten WellSaid Labsin idea syntyi, kun olit yrittäjänä The Allen Institute for AI:ssa?
Liityin The Allen Institute for Artificial Intelligenceen (AI2) yrittäjäksi vuonna 2018. Se on maailman innovatiivisin inkubaattori, jossa on koolla älykkäimmät mieltä AI:ssa, jotka soveltavat ratkaisuja siitä, mitä on mahdollista tänään, konkreettisiin tuotteisiin, jotka ratkaisevat ongelmia ympäri maailmaa. Taustani suunnittelussa ja teknologiassa on ajanut minua luovaan suuntaan, ja AI-boomin myötä halusin tutkia tapaa yhdistää nämä kaksi asiaa. Tutustuin Michael Petrochukiin (WellSaid Labsin perustaja ja CTO) kehittäessäni interaktiivista terveydenhuollon sovellusta, joka ohjasi potilasta eri herkkien tilanteiden läpi. Sovelluksen sisällön kehittäessäni tiimini työskenteli ääninäyttelijöiden kanssa, jotka äänittivät tuhansia ääniraitoja hahmolle. Kun tutustuin Michaelin saavutuksiin tutkimuksessa, näimme nopeasti, miten ihmisen kaltaisen tekstin ääntämisen (TTS) voisi muuttaa sekä tuotetta, jolla työskentelin, että vaikuttaa moniin muihin sovelluksiin ja aloihin. Teknologia ja työkalut olivat kamppailleet pysymään tuottajien tarpeiden mukana, kun ääni oli mediumina. Näimme tien, jota kautta voisimme antaa tämän teknologian kaikkien luojien käsiin, mahdollistaen äänen oleelliseksi osaksi kaikkia tarinoita.
WellSaid Labs on yksi harvoista yrityksistä, joka tarjoaa ääninäyttelijöille väylän AI-ääniin. Miksi uskoit, että oli tärkeää integroida aitoja ääniä tuotteeseen?
Vastauksemme on kaksiosainen: ensinnäkin halusimme luoda ratkaisuja, jotka täydentävät ammattimaisen ääninäyttelijän kykyjä, laajentaen äänen mahdollisuuksia. Toiseksi pyrimme saavuttamaan korkeimman ihmisen laadun tuotteissamme. Ääninäyttelijämme ovat pitkäaikaisia yhteistyökumppaneita, ja he saavat korvausta ja osuuden tuotosta sekä heidän äänidatastaan että myöhemmästä sisällöstä, joka tuotetaan sen avulla. Jokainen ääninäyttelijä, jolle luomme älykkään äänihahmon heidän äänensä kaltaiseksi, saa palkkion siitä, kuinka paljon heidän ääntään käytetään alustallamme. Kannustamme kykyjä yhteistyöhön; reilu korvaus heidän panoksestaan on meille erittäin tärkeää.
Jotta voisimme tarjota korkeimman laadun tuotteita markkinoilla, meidän on oltava tiukkoja siitä, mistä hankimme datamme. Tämä prosessi antaa meille enemmän valvontaa laadun suhteen, kun koulutamme syvää oppimista mallimme puhumaan sekä ihmisen kaltaisella tasolla että kontekstisesti relevantilla tyylillä. Emme ainoastaan luo ääntä, joka toistaa annetun syötteen. Mallimme tarjoavat äänityylejä, jotka suorittavat sen, mitä sivulla on. Riippumatta siitä, luoko asiakkaat ääniraitaa käyttäen hahmoa kirjastostamme vai luomalla äänen heidän brändilleen, käytämme aitoja äänidataja, jotta prosessi on vaivaton ja helppokäyttöinen. Jos asiakkaiden olisi muokattava ja editoitava ääniämme jälkikäteen, prosessi saada haluttu tuloste olisi kömpelö ja pitkä. Äänimme ottaa kirjoitetun sisällön kontekstin ja tarjoaa kontekstisesti tarkan lukemisen. Tarjoamme ääniä kaikenlaisiin käyttötarkoituksiin – olipa kyse uutisten lukemisesta, äänimainonnasta, automaattisesta asiakaspalvelusta – joten yhteistyö ammattimaisen äänitalenttin kanssa kussakin käyttötarkoituksessa antaa meille sekä kontekstin että korkealaatuisen äänidatan.
Säännöllisesti päivitämme ja lisäämme uusia tyylejä ja aksenteja äänikirjastoomme, jotta voimme edustaa asiakkaidemme ääniä. WellSaid Labsin Studiossa asiakkaat ja brändit voivat kuulla eri ääniä alueen, tyylisuunnan ja käyttötarkoituksen mukaan, mikä mahdollistaa äänisisällön tuottamisen yhdenmukaisemmin ja henkilökohtaisemmin. Kun alkuperäinen äänitys on näyte, käyttäjät voivat kohdistaa tiettyjä sanoja, oikeinkirjoitusta ja ääntämistä, jotta AI puhuu heidän tarpeidensa mukaan.
WellSaid Labs on asettamassa itsensä eettisenä AI-äänialustana. Miksi AI-eetika on tärkeää sinulle?
Ai-hehkutuksen kasvaessa ja tulevaan arkipäivään, pelot haitallisista käyttötavoista ja pahantahtoisista toimijoista ovat jokaisen keskustelun keskipisteenä – ja nämä huolet ovat valitettavasti todellisia. AI-ääni ei ole poikkeus; melkein jokaisena päivänä uusi raportti julkisuuden henkilön, poliitikon tai julkkiksen äänen käytöstä mainonnassa tai poliittisissa tarkoituksissa tekee otsikkoja. Vaikka virallinen liittovaltion sääntely tällä tekniikalla on edelleen kehittymässä, haitallisten toimijoiden ja syntetisen äänen väärinkäytön havaitseminen ja torjuminen tulee olemaan yhä haasteellisempaa, kun teknologia jatkaa kehittymistään.
Tulevana AI2:sta, jossa AI-eetika on periaatteellinen lähtökohta, Michaelin ja minun kanssa keskustelimme tästä asiasta ensimmäisenä päivänä. Älykkään puheteknologian kehittäminen tuo mukanaan merkittäviä vastuuta suostumusta, yksityisyyttä ja yleistä turvallisuutta koskien. Tiedämme, että meidän on kehitettävä teknologiaamme turvallisesti, ja meidän on osoitettava, että otamme vastuun syntetisen äänen mahdollisesta väärinkäytöstä. Emme voi odottaa liittovaltion sääntelyä; meidän on priorisoitava käytäntöjä, jotka tukevat yksityisyyttä, turvallisuutta, avoimuutta ja vastuullisuutta.
Miten kehität eettistä AI-ääni-alustaa?
WellSaid Labs on sitoutunut eettiseen innovaatioon alusta alkaen. Keskitymme luottamukseen ja avoimuuteen käyttämällä sisäisiä datamalleja, eksplisiittisiä suostumusvaatimuksia, sisällön moderaatioprogrammaa ja sitoutumista brändiensuojeluun. WellSaidissa nojautumme vastuullisen AI:n periaatteisiin, joilla muotoilemme päätöksiämme ja suunnitelmiamme, ja nämä periaatteet ulottuvat myös äänien käyttöön. Eettinen koodimme edustaa näitä periaatteita: Vastuullisuus, Avoimuus, Yksityisyys ja Turvallisuus, sekä Reiluus.
Vastuullisuus: Pidämme tiukkoja standardeja sovellettavasta sisällöstä, kieltäen äänien käytön haitalliselle, vihamieliselle, petokselliselle tai väkivallan lietsontaa tarkoittavalle sisällölle. Luottamus- ja turvallisuustiimimme ylläpitävät näitä standardeja tiukalla sisällön moderaatioprogrammalla, estäen ja poistamalla käyttäjiä, jotka yrittävät rikkoa palvelun ehtoja.
Avoimuus: Vaadimme eksplisiittistä suostumusta ennen äänen luomista jonkun äänidatalla. Käyttäjät eivät voi ladata äänidataa poliitikoilta, julkkiksilta tai kenenkään muun henkilön ääntä ilman heidän kirjallista suostumustaan.
Yksityisyys ja Turvallisuus: Suojelimme ääninäyttelijöidemme identiteettejä käyttämällä varastoikuvia ja salanimiä edustamaan syntetisiä ääniä. Rohkaisemme heitä myös olemaan varovaisia siitä, miten ja kenelle he jakavat yhteytensä WellSaid Labsiin tai muihin syntetisiin ääniyhtiöihin, jotta heidän äänensä väärinkäyttömahdollisuudet vähenevät.
Reiluus: Korvaamme kaikki ääninäyttelijät, jotka tarjoavat äänidataa alustallemme, ja tarjoamme heille jatkuvan osuuden äänen käytöstä. Yhdessä näiden periaatteiden kanssa olemme sitoutuneet suojella immateriaalioikeuksia eikä vaadi omistajuutta käyttäjien tai ääninäyttelijöiden toimittamasta sisällöstä. Priorisoimme eheytensä, reiluutta ja avoimuutta kaikessa, mitä teemme, varmistaen, että syntetinen puheteknologiaamme käytetään vastuullisesti ja eettisesti. Etsimme aktiivisesti yhteistyökumppaneita monipuolisista taustoista, järjestöistä ja kokemuksista, jotta voimme tarjota äänen jokaiselle.
WellSaid Labs on kehittänyt oman sisäisen AI-mallinsa, joka mahdollistaa äänien saavuttamaan ihmisen kaltaisen laadun, ja se on saavutettu tuomalla ihmisten virheitä keskusteluihin. Mitä näissä virheissä on, mikä tekee AI:n paremmaksi, ja miten nämä virheet toteutetaan?
WellSaid Labs ei ole vain toinen TTS-generaattori. Siinä, missä varhainen TTS-teknologia ei pystynyt tunnistamaan ihmisen puhetyyliin kuuluvia piirteitä, kuten sävyä, ääntä ja murteita, jotka välittävät sanien taakse piilotetun kontekstin ja tunteen, WellSaid-äänet ovat saavuttaneet ihmisen kaltaisen laadun, tuomalla ainutlaatuisia ihmisen virheitä älykkääseen puhetta.
Pääasiallinen mittapuu lemme äänen laadun määrittelyssä on aina ollut ihmisen luonnollisuus. Tämä ohjaa uskomuksemme jokaisessa vaiheessa, alkaen käsikirjoituskirjastojemme rakentamisesta, ohjeista, joita annamme kyvyille, ja viimeaikaisista TTS-algoritmien iteroinneista. Koulutamme aidosti inhimillisiä ääni-ilmaisuja. Äänitalenttimme lukee käsikirjoituksia aidosti ja viihtyisästi, kun he äänittävät meille. Puhdas ääni on koneellinen käsite, joka johtaa epäluonnolliseen, robotiin kaltaiseen tulokseen. Kun ammattimaiset ääninäyttelijät esittävät, heidän puhetapahtumansa vaihtelevat. Heidän äänensä voimakkuus liikkuu yhteen sisällön kanssa, jota he lukevat. Heidän äänensä sävy saattaa nousta jaksossa, joka vaatii innostunutta lukemista, ja laskea jälleen vakavammassa kohdassa. Nämä dynaamiset vaihtelut muodostavat viihtyisän inhimillisen äänesityksen.
Luomalla AI-prosesseja, jotka toimivat yhteistyössä ammattimaisen kyvykkyyden dynaamisten esitysten kanssa, olemme luoneet aidosti luonnollisen TTS-alustan. Kehittämme ensimmäisen pitkän TTS-järjestelmän, jossa on ennustavat ohjaimet koko luovaa prosessia varten. Fonetiikkakirjastomme sisältää monipuolisen äänidatakokoelman, jolloin käyttäjät voivat sisällyttää tiettyjä ääni-ohjeita, kuten ääntämisen ohjausta tai hallintaa, malliin tuotantovaiheessa. Yhdessä alustassa WellSaid-käyttäjät voivat tallentaa, editoida ja tyylittää ääniohjauksensa ilman, että heidän tarvitsee tuoda ulkoista dataa.
Voitko keskustella joistakin haasteista, jotka liittyvät teksti-ääneksi (TTS) AI-yrityksen rakentamiseen?
Älykkään ääniteknologian kehittäminen on luonut uuden joukon esteitä sekä tuottajille että kuluttajille. Yksi päähaasteista on, ettei joutuisi loukkuun meteliin ja hypeen, joka tulvii AI-sektoria. Monet organisaatiot yrittävät hyötyä lyhytaikaisista AI-äänikehityksistä. Haluamme tarjota äänen kaikille, johdaten keskeisiä eettisiä periaatteita ja aidosti. Tämä sitoutuminen aidosti voi hidastaa teknologiamme kehittämistä ja käyttöönottoa, mutta vahvistaa WellSaid-äänten ja niiden datan turvallisuutta.
Toinen haaste, jonka koimme TTS-alustamme kehittäessä, oli kehittää tiettyjä suostumusohjeita, jotta voimme varmistaa, ettei organisaatiot tai yksittäiset toimijat väärinkäytä teknologiaamme. Tähän haasteeseen vastaamiseksi etsimme yhteistyökumppanuuksia ja olemme täysin mukana ääniohjauksen kehittämisessä, jotta voidaan lisätä vastuullisuutta, avoimuutta ja käyttäjien turvallisuutta. Etsimme yhteistyökumppanuuksia äänitalentista eri taustoista, jotta voimme varmistaa, että WellSaid Labsin äänikirjasto heijastaa sen luojia ja yleisöä. Nämä prosessit on suunniteltu tarkoituksenmukaisiksi ja yksityiskohtaisiksi, jotta voimme varmistaa, että teknologiaamme käytetään turvallisesti ja eettisesti, mikä voi hidastaa kehittämistä ja käyttöönottoa.
Mikä on visiosi generatiivisen AI-äänien tulevaisuudesta?
Pitkään AI-puheteknologia ei ole saavuttanut tarpeeksi korkeaa laatua, jotta yritykset voivat luoda merkityksellistä sisältöä laajassa mittakaavassa. Nyt, kun ääniteknologiaa ei enää vaadita kalliita laitteita ja laitteistoa, kaikki kirjoitettu sisältö voidaan tuottaa ja julkaista äänimuodossa, jotta voidaan luoda viihtyisiä, monimuotoisia kokemuksia.
Nykyään AI-äänet voivat tuottaa ihmisen kaltaista ääntä ja pyydystää hienostuneisuuden, jota tarvitaan, jotta digitaalinen kerronta voi olla helpommin lähestyttävissä ja luonnollisempi. Generatiivisen AI-äänien tulevaisuus tulee olemaan kaiken kattava äänikokemus, joka koskee jokaista elämän osa-aluetta. Kun teknologia jatkaa kehittymistään, näemme yhä luonnollisemmat ja ilmaisuvoimaisemmat syntetiset äänet, jotka sekoittavat rajan ihmisen ja koneen välillä – avaen uusia ovia liiketoiminnalle, viestinnälle, saavutettavuudelle ja sille, miten vuorovaikutamme maailman kanssa.
Yritykset löytävät parannettua henkilökohtaisuutta AI-äänirajapinnoissa ja käyttävät niitä tehdäkseen virtuaaliavustajien kanssa vuorovaikutuksen immersiivisemmäksi ja käyttäjäystävällisemmäksi. Nämä parannukset tapahtuvat jo, älykkäistä call-keskuksista nopeisiin ruokapaikkojen ajoramppeihin. Sisällön luominen, mukaan lukien mainonta, tuotteen markkinointi, uutisten kerronta, podcastit, äänikirjat ja muu monimedia, näkee tehokkuuden lisääntymisen käyttämällä työkaluja, joilla voidaan kehittää viihtyisiä sisältöjä – lopulta lisäämällä nostoa ja tuottoa organisaatioille, erityisesti nyt, kun monikieliset mallit voivat laajentaa yrityksen ulottuvuuden yhdestä kohdasta maailmanlaajuiseksi.
Ennen AI:n tulleen, TTS-teknologia puuttui tärkeästä inhimillisestä tunteesta, sävystä ja ääntämisen kyvystä, jotka vaaditaan kertomaan täydellisen tarinan laajassa mittakaavassa ja helposti. Nyt AI-pohjainen TTS tarjoaa immersiivisempiä ja saavutettavampia kokemuksia, mukaan lukien reaaliaikaiset puhetilat ja interaktiiviset keskusteluagentit.
Achieving human-like speech capabilities has been a journey, but now that it’s attainable, we’re witnessing the complete scope of AI voice to create real business value for organizations.
Thank you for the great interview, readers who wish to learn more should visit WellSaid Labs.












