Interviuri

Matt Hocking, Co-Fondator al WellSaid Labs – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Matt Hocking este co-fondatorul WellSaid Labs, o platformă de voce AI de nivel întreprindere. El are peste 15 ani de experiență în conducerea de echipe și livrarea de soluții tehnologice la scară largă.

Fundalul dvs. este destul de antreprenorial, cum ați fost implicat inițial în AI?

Cred că m-am considerat întotdeauna destul de antreprenorial. Am început prima mea afacere după facultate și, având o experiență în design de produs, m-am aflat gravitând spre a ajuta oamenii cu idei din stadiul incipient. De-a lungul carierei mele, am avut norocul de a lucra cu o serie de startup-uri care au avut parte de rulări incredibile. În timpul acestor experiențe, am avut ocazia de a lucra cu mulți fondatori extraordinari, ceea ce m-a inspirat să urmăresc propriile mele idei ca fondator. AI-ul era relativ nou pentru mine când m-am alăturat AI2; cu toate acestea, această experiență mi-a oferit oportunitatea de a aplica lentila mea de produs și startup la unele cercetări cu adevărat uimitoare și de a-mi imagina cum aceste noi progrese vor putea ajuta multe oameni în anii următori. Scopul meu de la început a fost să dezvolt afaceri reale pentru oameni reali, și cred că AI-ul are potențialul de a crea o mulțime de oportunități și eficiență în viitorul nostru, dacă este aplicat cu grijă.

Ne puteți împărtăși povestea despre cum a fost concepută ideea pentru WellSaid Labs când ați fost antreprenor în cadrul Institutului Allen pentru Inteligență Artificială?

M-am alăturat Institutului Allen pentru Inteligență Artificială (AI2) ca antreprenor în 2018. Fără îndoială, cel mai inovativ incubator din lume, AI2 găzduiește cele mai strălucite minți din domeniul AI care aplică soluții de la marginea a ceea ce este posibil astăzi la produse tangibile care rezolvă probleme din întreaga lume. Experiența mea în design și tehnologie a hrănit o interes de lungă durată pentru domeniile creative, și, cu boom-ul de AI pe care îl vedem astăzi, am vrut să explorez o modalitate de a conecta cele două. Am fost introdus în Michael Petrochuk (co-fondator și CTO al WellSaid Labs) în timp ce dezvoltam o aplicație interactivă de sănătate care ghida pacientul prin diverse scenarii sensibile. În timpul procesului de dezvoltare a conținutului pentru experiență, echipa mea a lucrat cu talente vocale pentru a înregistra mii de linii de voce pentru avatar. Când am fost expus la unele dintre progresele pe care le-a realizat Michael în timpul cercetărilor sale, am văzut rapid valoarea modului în care text-to-speech (TTS) de calitate umană ar putea transforma nu numai produsul pe care îl lucram, ci și impacta o serie de alte aplicații și industrii. Tehnologia și instrumentele au luptat pentru a ține pasul cu nevoile producătorilor care creează cu vocea ca mediu. Am văzut o cale de a pune această tehnologie în mâinile tuturor creatorilor, permițând vocilor să fie o parte integrantă a tuturor poveștilor.

WellSaid Labs este una dintre puținele companii care oferă actorilor vocali o cale de a intra în spațiul de voce AI. De ce ați considerat că este important să integrați voci reale în produs?

Răspunsul nostru la aceasta este dublu: în primul rând, am vrut să creăm soluții care să completeze capacitățile actorilor vocali profesioniști, extinzând oportunitățile pentru voce. Și, în al doilea rând, ne străduim să avem cel mai înalt nivel de calitate umană în produsele noastre. Actorii noștri vocali sunt parteneri de colaborare pe termen lung și primesc compensații și venituri pentru datele vocale și conținutul ulterior produs cu acestea. Fiecare actor vocal pe care îl angajăm pentru a crea un avatar vocal AI bazat pe asemănarea vocii sale este plătit în funcție de cât de mult este folosită vocea sa pe platforma noastră. Încurajăm talentele să se asocieze cu noi; compensarea corectă pentru contribuțiile lor este incredibil de importantă pentru noi.

Pentru a oferi produse de cea mai înaltă calitate umană de pe piață, trebuie să fim riguroși cu privire la locul în care obținem datele noastre. Acest proces ne oferă mai mult control asupra calității, deoarece antrenăm modelele noastre de învățare profundă pentru a vorbi atât la paritate umană, cât și la stiluri contextuale relevante. Nu creăm doar o voce care recită inputul furnizat. Modelele noastre oferă o varietate de stiluri vocale care efectuează ceea ce este pe pagină. Indiferent dacă utilizatorii creează voce prin utilizarea unui avatar din biblioteca noastră sau creează voce cu o voce personalizată pentru marca lor, folosim date vocale reale pentru a asigura un proces fără probleme și o platformă ușor de utilizat. Dacă clienții noștri ar trebui să manipuleze și să editeze voci noastre în post-producție, procesul de obținere a ieșirii dorite ar fi înțepenit și lung. Voci noastre iau în considerare contextul conținutului scris și oferă o citire contextual corectă. Oferim voci pentru toate tipurile de cazuri de utilizare – indiferent dacă este vorba de citirea știrilor, crearea unui anunț audio sau suport pentru centrele de apel automate – astfel încât parteneriatul cu talente vocale profesioniste pentru fiecare caz de utilizare ne oferă atât contextul, cât și datele vocale de înaltă calitate.

Ne actualizăm și adăugăm în mod regulat noi stiluri și accente la biblioteca noastră de avataruri pentru a ne asigura că reprezentăm voci ale clienților noștri. În Studioul WellSaid Labs, clienții și mărcile pot audiționa diferite voci în funcție de regiune, stil și caz de utilizare, permițând o producție mai fără probleme și unificată de conținut audio personalizat nevoilor creatorului. Odată ce o înregistrare inițială este eșantionată, utilizatorii pot comanda cuvinte specifice, ortografie și pronunții pentru a se asigura că AI-ul vorbește în mod constant în funcție de nevoile lor.

WellSaid Labs și-a asumat rolul de a fi prima platformă etică de voce AI. De ce sunt etica AI importante pentru dvs.?

Pe măsură ce adoptarea AI crește și devine mai mainstream, teamările de cazuri de utilizare dăunătoare și actori răi sunt în centrul fiecărei conversații – și aceste preocupări sunt, din nefericire, validate de evenimente din lumea reală. Vocea AI nu face excepție; aproape în fiecare zi, un nou raport despre o celebritate, o figură publică sau un politician care este deepfaked pentru reclame sau scopuri politice face știri. Deși reglementarea federală formală cu privire la această tehnologie este încă în evoluție, detectarea și combaterea actorilor și utilizărilor malefice ale vocii sintetice va deveni din ce în ce mai dificilă pe măsură ce tehnologia continuă să progreseze.

Veniind de la AI2, unde etica AI este un principiu de bază, Michael și eu am avut aceste conversații din prima zi. Dezvoltarea tehnologiei de vorbire AI vine cu responsabilități semnificative cu privire la consimțământ, confidențialitate și siguranță generală. Știm că, ca dezvoltatori, trebuie să construim tehnologia noastră în siguranță, să abordăm preocupările etice și să punem bazele dezvoltării viitoare a vocii sintetice. Recunoaștem potențialul tehnologiei de vorbire AI pentru utilizări abuzive și ne asumăm responsabilitatea de a reduce posibilitatea de utilizare abuzivă a produsului nostru. Trebuie să punem această fundație din prima zi, mai degrabă decât să alergăm repede și să facem greșeli pe parcurs.

De asemenea, susținem apelul pentru legislație în acest domeniu; cu toate acestea, nu vom aștepta reglementări federale să fie adoptate. Am prioritizat întotdeauna și vom continua să prioritizăm practicile care sprijină confidențialitatea, securitatea, transparența și răspunderea.

Respectăm strict codul nostru de intenție etică, care se bazează pe inovare responsabilă în fiecare decizie pe care o luăm. Acest lucru este în cel mai bun interes al clienților noștri globali – mărci enterprise.

Cum dezvoltați o platformă etică de voce AI?

WellSaid Labs s-a angajat în inovare etică de la început. Centralizăm încrederea și transparența prin utilizarea modelelor de date interne, a cerințelor de consimțământ explicit, a programului nostru de moderare a conținutului și a angajamentului nostru de a proteja mărcile. La WellSaid, ne bazăm pe principiile AI Responsabil pentru a modela deciziile și proiectele noastre, și aceste principii se extind la utilizarea vocii noastre. Codul nostru de etică reprezintă aceste principii sub formă de Răspundere, Transparență, Confidențialitate și Siguranță, și Echitate.

Răspundere: Menținem standarde stricte pentru conținutul corespunzător, interzicând utilizarea vocii noastre pentru conținut care este dăunător, urât, fraudulos sau destinat să incite la violență. Echipa noastră de Încredere și Siguranță menține aceste standarde prin intermediul unui program riguros de moderare a conținutului, blocând și înlăturând utilizatorii care încearcă să încalce Termenii și Condițiile noastre.

Transparență: Cerem consimțământ explicit înainte de a construi o voce sintetică cu datele vocale ale cuiva. Utilizatorii nu pot încărca date vocale de la politicieni, celebrități sau oricine altcineva pentru a crea o copie a vocii lor, dacă nu avem consimțământul scris al acelei persoane.

Confidențialitate și Siguranță: Protejăm identitățile actorilor noștri vocali prin utilizarea de imagini stoc și pseudonime pentru a reprezenta vocii sintetice. De asemenea, îi încurajăm să exercite prudență cu privire la modul și cu cine împărtășesc asocierea lor cu WellSaid Labs sau cu alte companii de voce sintetică pentru a reduce oportunitatea de a-și utiliza vocea în mod abuziv.

Echitate: Compensăm toți actorii vocali care ne furnizează date vocale pentru platforma noastră și le oferim o cotă de venit continuă pentru utilizarea vocii sintetice pe care o construim cu datele lor.

Împreună cu aceste principii, respectăm și proprietatea intelectuală. Nu pretindem proprietatea asupra conținutului furnizat de utilizatorii noștri sau actorii vocali. Prioritizăm integritatea, echitatea și transparența în tot ceea ce facem, asigurându-ne că tehnologia noastră de vorbire sintetică este utilizată în mod responsabil și etic. Căutăm în mod activ parteneriate cu voci din medii diverse și experiențe pentru a ne asigura că oferim o voce pentru toată lumea.

Angajamentul nostru față de inovarea responsabilă și dezvoltarea tehnologiei de voce AI cu etică în minte ne diferențiază de alții din domeniu care încearcă să capitalizeze pe o industrie nouă, neînregistrată, prin orice mijloace. Investițiile noastre timpurii în etică, siguranță și confidențialitate stabilesc încredere și loialitate în rândul actorilor noștri vocali și clienților, care caută din ce în ce mai mult produse și servicii etice de la companiile care se află în fruntea inovației.

WellSaid Labs a creat propriul model de voce AI care a permis vocii noastre AI să atingă paritatea umană, și a realizat acest lucru prin aducerea imperfecțiunilor pe care oamenii le au în conversații. Ce este atât de special despre aceste imperfecțiuni care fac ca AI-ul să fie mai bun, și cum sunt implementate aceste imperfecțiuni?

WellSaid Labs nu este doar un generator TTS oarecare. În timp ce tehnologia TTS timpurie nu a putut recunoaște calitățile vorbirii umane, cum ar fi tonul, pitch-ul și dialectul care transmit contextul și emoția din spatele cuvintelor, vocii noastre WellSaid au atins paritatea umană, aducând imperfecțiuni umane unice în vorbirea generată de AI.

Măsura noastră principală a calității vocii este și a fost întotdeauna naturalitatea umană. Această credință ghidatoare a modelat tehnologia noastră la fiecare etapă, de la bibliotecile de scripturi pe care le-am construit la instrucțiunile pe care le dăm talentelor și, mai recent, la modul în care iterăm algoritmii noștri TTS de bază.

Ne antrenăm pe vocalizări umane autentice. Talentul nostru vocal citește scripturile în mod autentic și captivant atunci când înregistrează pentru noi. Perfecțiunea vorbirii, pe de altă parte, este un concept mecanic care conduce la o ieșire robotizată, lipsită de naturalitate. Când talentul profesional se execută, rata vorbirii lor fluctuează. Volumul lor se mișcă în concordanță cu conținutul pe care îl citesc. Pitch-ul lor vocal poate crește într-un pasaj care necesită o citire entuziastă și poate scădea din nou într-un rând mai solemn. Aceste variații dinamice alcătuiesc o performanță vocală umană captivantă.

Prin construirea proceselor AI care lucrează în coordonare cu performanțele dinamice ale talentului nostru profesional, am construit o platformă TTS cu adevărat naturală. Am dezvoltat primul sistem TTS pe termen lung cu controale predictive în întregul proces creativ. Biblioteca noastră fonetică deține o colecție diversă de date audio, permițând utilizatorilor să incorporeze anumite indicii vocale, cum ar fi îndrumarea pronunției sau controlabilitatea, în modelul în timpul fazei de producție. Pe o singură platformă, utilizatorii WellSaid pot înregistra, edita și stiliza vocea lor fără a trebui să importe date externe.

Ne puteți discuta despre unele dintre provocările din spatele construirii unei companii de text-to-speech (TTS) AI?

Dezvoltarea tehnologiei de voce AI a creat un set complet nou de obstacole atât pentru producătorii, cât și pentru consumatorii acesteia. Una dintre principalele provocări este să nu te lași prins în zgomotul și hype-ul care inundează sectorul AI. Ca o tehnologie nouă și la modă, multe organizații încearcă să profite de dezvoltările pe termen scurt ale vocii AI. Vrem să oferim o voce pentru toată lumea, ghidată de principii etice centrale și autenticitate. Această aderență la autenticitate poate întârzia dezvoltarea și implementarea tehnologiilor noastre, dar consolidează siguranța și securitatea vocii noastre WellSaid și a datelor sale.

O altă provocare a dezvoltării platformei noastre TTS a fost dezvoltarea unor linii directoare de consimțământ specifice pentru a ne asigura că organizațiile sau actorii individuali nu vor abuza de tehnologia noastră. Pentru a combate această provocare, căutăm parteneriate colaborative pe termen lung și suntem pe deplin implicați în dezvoltarea vocii pentru a crește răspunderea, transparența și securitatea utilizatorului. Căutăm în mod activ parteneriate cu talente vocale din diverse medii, organizații și experiențe pentru a ne asigura că biblioteca noastră de voci reflectă creatorii și publicul nostru. Aceste procese sunt proiectate pentru a fi intenționate și atente la detalii pentru a ne asigura că tehnologia noastră este utilizată în modul cel mai sigur și etic posibil, ceea ce poate întârzia dezvoltarea și lansarea.

Care este viziunea dvs. pentru viitorul vocii generative AI?

De cea mai lungă perioadă, tehnologia de vorbire AI nu a atins o calitate suficient de ridicată pentru a permite companiilor să creeze conținut semnificativ la scară. Acum, tehnologia audio nu mai necesită echipamente și hardware scumpe, astfel încât tot conținutul scris poate fi produs și publicat într-un format audio pentru a crea experiențe captivante și multimodale.

Astăzi, vocii AI pot produce audio uman și pot capta nuanța necesară pentru a face povestirea digitală mai accesibilă și naturală. Viitorul vocii generative AI va fi o experiență auditivă cuprinzătoare care va atinge fiecare aspect al vieții noastre. Pe măsură ce tehnologia continuă să progreseze, vom vedea voci sintetice din ce în ce mai naturale și expresive care vor estompa granița dintre vorbirea umană și cea generată de mașină – deschizând noi uși pentru afaceri, comunicare, accesibilitate și modul în care interacționăm cu lumea din jurul nostru.

Companiile vor găsi o personalizare îmbunătățită în interfețele de voce AI și le vor folosi pentru a face interacțiunile cu asistenții virtuali mai imersive și mai prietenoase cu utilizatorul. Aceste îmbunătățiri se întâmplă deja, de la agenți inteligenți de call center la drive-thru-uri de fast-food. Crearea de conținut, inclusiv publicitate, marketing de produs, nararea știrilor, podcasturi, cărți audio și alte multimedia, va vedea o eficiență crescută prin utilizarea unor instrumente pentru a dezvolta conținut captivant – în cele din urmă, creșterea liftului și a veniturilor pentru organizații, mai ales acum, când modelele multilingve pot extinde prezența unei companii de la un singur punct de origine la o prezență globală. Echipele de producție vor găsi un beneficiu semnificativ în vocii sintetice pentru a crea voci personalizate în funcție de nevoile mărcii sau personalizate pentru ascultător.

Înainte de introducerea AI, tehnologia TTS lipsea de emoția umană, intonația și abilitățile de pronunțare necesare pentru a spune o poveste completă la scară și cu ușurință. Acum, TTS-ul alimentat de AI oferă experiențe mai imersive și mai accesibile, inclusiv capacități de vorbire în timp real și agenți conversaționali interactivi.

Atingerea capacităților de vorbire umană a fost o călătorie, dar acum că este atingibilă, suntem martorii întregului spectru de valoare al vocii AI pentru a crea valoare comercială reală pentru organizații.

Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre WellSaid Labs.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.