Interviuri
Phil Marshall, Fondator și CEO al Spoken – Serie de interviuri

Phil Marshall, fondator și CEO al Spoken, este medic, inventator, antreprenor în tehnologie și scriitor de science‑fiction, a cărui carieră a cuprins domeniile sănătății, media digitală, inteligența artificială și inovația de produs. Înainte de a lansa Spoken în 2024, Marshall a co‑fondat Conversa Health, o companie de implicare personalizată a pacienților și AI conversațional, care a fost achiziționată de Amwell în 2021 și a devenit parte a afacerii sale de îngrijire virtuală automatizată. În primele etape ale carierei, a petrecut peste un deceniu la WebMD ca vicepreședinte al Strategiei de Produs, apoi a ocupat funcția de vicepreședinte senior al Managementului de Produs la Press Ganey Associates și a fondat startup‑ul de tehnologie video colaborativă JumperCut. Activitatea sa se concentrează din ce în ce mai mult pe intersecția dintre AI, povestire, interfețe creier‑computer și tehnologii ale cunoașterii, combinând fundalul său de tehnician și antreprenor cu interesele în science‑fiction și formele emergente de interacțiune digitală.
Spoken este o platformă de audiobookuri alimentată de AI, concepută pentru a ajuta autorii, editorii și deținătorii de drepturi să transforme manuscrisele în audio produs profesional, fără a depinde de un studio de înregistrare tradițional. Tehnologia sa analizează limbajul, stilul, structura narativă și personajele unui manuscris înainte de a atribui voci distincte pentru narație și dialog, susținând producții cu un singur narator, cu doi naratori și cu multi‑cast. Autorii pot folosi voci generate personalizat, pot alege din peste 100 de actori vocali profesioniști plătiți sau pot clona propria voce, păstrând în același timp dreptul de proprietate asupra lucrării, master‑urilor și drepturilor de distribuție. Spoken oferă, de asemenea, un API (interfață de programare a aplicațiilor) destinat editorilor care doresc să producă audiobookuri pentru cataloage mai mari, subliniind un model etic de AI, conform căruia lucrările scrise nu sunt folosite pentru antrenarea sistemelor și actorii vocali umani participanți sunt remunerați.
Cariera ta te-a dus de la medicină și strategie de produs la WebMD la fondarea Conversa Health și acum Spoken. Ce problemă în crearea audiobookurilor te-a convins să înființezi Spoken și cum a influențat munca ta anterioară în AI conversațional platforma pe care o construiești astăzi?
Cu Conversa, misiunea noastră a fost să extindem vocea echipei de îngrijire prin automatizarea contactului personalizat, a întrebărilor de follow‑up și a ghidării pe care un departament clinic al unui mare sistem de sănătate le-ar oferi direct pacienților prin telefon, dacă ar avea timp. Inițial, am antropomorfizat botul cu o persoană, Cate, care se referă la sine în persoana întâi. În cele din urmă, am decis că simularea umanității este necinstită. Cate nu era o persoană și nu doream ca pacienții să creadă că este. Așadar, am eliminat numele de persoană și am trecut la pluralul „Noi” pentru ca acesta să fie perceput ca o extensie a echipei de îngrijire, ceea ce era. Experiența mi-a arătat că soluțiile automate pot încă să pară o extensie autentică a îngrijirii umane fără a pretinde că sunt umane.
Să trecem la Spoken, unde ne concentrăm pe expresia autentică, centrată pe om. Problema pe care o rezolvăm este evidentă – majoritatea poveștilor nu pot ajunge la cel mai rapid în creștere public (ascultători) cu întregul lor potențial audio din cauza constrângerilor de timp și cost – dar filosofia mea de lungă durată de a fi o extensie autentică a oamenilor a jucat un rol important. Spre deosebire de podcasturile AI care încearcă să fabrice discuții lejere sau agenții care simulează compasiune, narațiunea Multi‑Cast a Spoken aduce la viață cuvintele reale ale autorului. Deoarece spunem povești, nu încercăm să replicăm interacțiunile umane, nu există pretenția că AI‑ul nostru este o persoană. Acestea sunt personaje dintr-o poveste, așa că suntem norocoși să evităm orice confuzie și conflict.
În calitate de scriitor de science‑fiction dură și antreprenor în AI, cum așteptai să evolueze inteligența artificială și unde s‑a deviat realitatea dezvoltării AI cel mai pronunțat de viitorul pe care ți‑l imaginai?
Această întrebare îmi este foarte dragă. Îmi place să trăiesc la intersecția dintre artă, știință și tehnologie, iar descrierea sistemelor automate în science‑fictionul meu apropiat este un exemplu perfect. De fapt, fiecare companie viitoare despre care scriu – și sunt mai multe – are un domeniu pe care l‑am deținut, un produs pe care l‑am proiectat și un concept în care cred că ar putea deveni într‑o zi o companie reală. Chiar și sculptura din fața casei mele este modelată după forma modernistă a logo‑ului The Kite Factory, o companie pe care o imaginez că va crea într‑o zi tehnologia anti‑gravitațională ce va transforma planeta!
Concentrându‑m pe AI, am o problemă când science‑fictionul viitor nu abordează modul în care oamenii obțin, folosesc și distribuie informații. În anul 2100, vor folosi încă telefoane pentru a suna oamenii și a răspunde la întrebări de fapt? Filosofia mea în scris și în viața reală este simplă: Ce poate fi automatizat, va fi automatizat, și vom tinde mereu spre informații mai în timp real, mai colaborative și mai integrate fizic. Trebuie să adaug, totuși, că am o aversiune personală față de implanturi. De aceea, în povestea cărții mele, când Elon Musk a conectat sateliții săi Starlink la implanturile Neuralink și a început să transmită mesaje direct în creierul oamenilor, am interzis implanturile cerebrale!
La întrebarea despre divergență: deoarece cred că tot ce poate fi automatizat, va fi automatizat, automatizarea întrebărilor de fapt se întâmplă ca o inevitabilitate simplă. Totuși, când vine vorba de chestiuni ale inimii – artă, muzică și povești – există o oarecare divergență. Deoarece AI este antrenat pe modele pre‑existente, prin definiție nu va putea crea vreodată ceva cu adevărat nou. Cu toate acestea, oamenii scriu povești, creează artă și compun muzică folosind AI. Cum este posibil? Pentru că arta nu trebuie să fie cu adevărat nouă sau unică. Cred că asta va însemna că, în viitor, acele creații care rup tiparele vor fi și mai prețioase. Sper că vom putea recunoaște când se întâmplă asta.
Un recent studiu Edison Research a comparat producția multi‑cast a Spoken cu o versiune umană, cu un singur narator, produsă profesional. Cât din avantajul Spoken îl atribuiți tehnologiei AI de bază și cât provine din oferirea fiecărui personaj unei voci distincte? Cum ar putea rezultatele să difere față de un întreg cast uman?
Analiza poveștii și a fiecărui personaj pentru a determina vocea perfectă este, de fapt, o parte importantă a AI‑ului nostru. Parcurgem un proces intens agentic pentru a extrage straturile de bază ale poveștii, de la rudimente precum genul și limba, până la ritmul dictat de accente și stil, precum și coeziunea scenei cu multiple personaje care interacționează. Toate aceste straturi alimentate de AI informează narațiunea vocală a personajului. Este ceea ce numim „Mod Magic”, și poți să te gândești la el ca la amestecarea culorilor de vopsea.
Cât despre modul în care rezultatele ar putea diferi de un întreg cast uman, totul se reduce la cost și fluxul de lucru. Un singur click și sute de dolari, comparativ cu un cast complet, nu este accesibil autorilor independenți și majorității editorilor, de aceea nu a fost punctul nostru de comparație. În ceea ce privește calitatea, totuși, cred că ne apropiem deja de paritate cu un cast complet, astfel că calitatea va fi indistinguibilă.
Spoken Multi‑Cast a primit ratinguri mai mari pentru scenele conduse de personaje, în timp ce narațiunea umană a performat mai bine în secțiunile de expunere. Ce face ca pasajele fără dialog să fie deosebit de dificile pentru narațiunea AI și cum lucrați pentru a reduce această diferență?
De fapt, nu este că pasajele fără dialog sunt dificile pentru narațiunea AI; este doar că numărul de dinamici cu care AI trebuie să lucreze este încă mai mic decât cel cu care lucrează un actor vocal uman. Gândește‑te la fiecare nuanță de inflexiune și livrare pe care un singur narator o poate aduce unui pasaj. Cu multi‑cast, totuși, numărul de dinamici este mult mai mare datorită timbrului variat și personalizat al vocilor personajelor și procesului de amestecare a acestora, din nou, ca și culorile de vopsea. Aceasta înseamnă că scenele multi‑cast pot aduce realismul interacțiunilor dintre mai multe persoane într-un mod pe care un singur narator ar avea dificultăți să îl egaleze.
În ceea ce privește reducerea diferenței, numărul de dinamici utilizate în narațiunea AI cu un singur narator va continua să crească, iar diferența va continua să se micșoreze.
Înainte de a asculta mostrele, doar 31 % dintre participanți și-au exprimat interesul pentru audiobookuri narate de AI, dar această cifră a crescut la 65 % după ce au experimentat Spoken Multi‑Cast. Ce elemente ale performanței credeți că au fost cele mai responsabile pentru schimbarea percepțiilor lor?
De fapt, a fost invers, iar acel element de design al sondajului este foarte important. 65 % au spus că ar asculta un audiobook întreg cu această narație după ce au auzit fragmentele, înainte de a ști că era AI. Apoi am întrebat, în general, dacă ar fi dispuși să asculte audiobookuri narate cu AI, și doar 31 % au răspuns afirmativ. În continuare, am întrebat dacă au crezut că ceea ce au auzit era AI. Doar 39 % dintre cei care au ascultat Spoken Multi‑Cast au suspectat că ar putea fi AI, comparativ cu 35 % dintre cei care au ascultat versiunile umane și au crezut că și acestea ar putea fi AI. Acest lucru a generat următoarea întrebare: Acum că știți acest lucru, ați fi dispuși să ascultați un audiobook narat cu AI? Acea disponibilitate a crescut la 43 % după expunere, și lucrăm activ la optimizarea pentru a reduce diferența față de pragul nostru de 65 %.
Puteți să ne descrieți fluxul de lucru agentic al AI‑ului care transformă un manuscris încărcat într-un audiobook cu voci multiple, inclusiv cum sistemul identifică vorbitorii, interpretează personajele, atribuie voci și determină emoția, sincronizarea și livrarea?
Având în vedere brevetele noastre în curs de acordare pentru acest proces, îl voi rezuma la nivel înalt spunând că este un proces intens agentic care livrează multiple straturi. Este un proces pe care l‑am perfecționat în peste doi ani. Rudimentele poveștii, ritmul poveștii, coeziunea scenei și, în final, vocile precise ale personajelor, sau așa cum îmi place să le numesc, „vopseaua”, fac parte din el. Obținerea arcului de livrare emoțională și a sincronizării este esențială, și lucrăm la asta mai mult decât la orice altceva. De multe ori surprinde oamenii faptul că AI‑ul folosit pentru pregătirea narațiunii este aproximativ de 5 ori mai mare decât AI‑ul folosit în narațiunea propriu‑zise.
Cât control creativ păstrează un autor asupra producției finale și ce instrumente sunt disponibile când AI interpretează greșit un personaj, o pronunție, un ritm emoțional sau o intenție narativă?
Autorul are control absolut asupra producției finale. Fie că este vorba de inflexiuni emoționale, accente, timbrul vocii sau sincronizare, controlează totul. Scopul nostru este să le aducem cât mai aproape de perfecțiune printr-un singur click. Dacă autorul, editorul sau producătorul are nevoie de o livrare foarte specifică a unui pasaj, poate folosi „Speak It” pentru a vorbi în microfon și a demonstra cum dorește să fie livrat, iar vocea personajului va respecta perfect indicațiile.
Credem că autorii ar trebui să simtă proprietate deplină asupra lucrării lor, inclusiv vocea folosită în creditele de început și de încheiere. Chiar și „Made with Spoken” va folosi vocea aleasă de ei, inclusiv vocea lor personală dacă optează pentru aceasta.
Spoken permite autorilor să folosească voci generate personalizat, precum și clone de voce aprobate de la naratori profesioniști care sunt remunerați când vocile lor sunt utilizate. Cum sunt integrate consimțământul, proprietatea, compensarea, drepturile de revocare și protecția împotriva clonării neautorizate în acest model?
Folosim doar parteneri vocali care respectă un cod strict de etică, care include detectarea și interzicerea utilizării neautorizate a unei voci (mai ales important pentru a proteja vocile remarcabile ale celebrităților). De exemplu, avem în biblioteca noastră multe dintre vocile de top de la ElevenLabs. Acei actori vocali sunt plătiți pentru fiecare utilizare de către autorii noștri.
Considerați că narațiunea AI extinde în principal piața audiobookurilor făcând titluri anterior neeconomice viabile, sau va înlocui și părți ale producției tradiționale? Ce roluri vor rămâne în mod clar umane pe măsură ce tehnologia evoluează?
Ne imaginăm o piață de audiobookuri mult extinsă, care atrage noi cititori, în special datorită noilor noastre capabilități vivid multi‑cast. În final, această piață extinsă va fi condusă de un hibrid între tehnologie și oameni. Timpul va arăta, dar această transformare ar putea fi mai puțin despre dacă este vorba de talent vocal uman sau AI și mai mult despre fluxul de lucru al controlului autor/producer și despre obiceiurile de ascultare în continuă schimbare ale publicului.
Spoken combină producția de audiobookuri cu publicarea, descoperirea, streamingul, comunitatea și monetizarea. Cum ar putea AI să schimbe în final însăși povestirea, mai degrabă decât să facă procesul existent de producție a audiobookurilor mai rapid și mai puțin costisitor?
Ce înseamnă pentru un cititor sau ascultător să „se piardă în poveste”? Exact asta este esența: să oferim publicului o experiență audio imersivă în momentul în care cererea pentru ficțiune condusă de personaje crește și audio devine modalitatea dominantă de consum al poveștilor. În final, fie că este vorba de o povestire scurtă, o memorie personală, fan‑fic sau fantezie epică, viteza și costul scăzut al creării unei livrări vii și naturale vor avea implicații profunde pe termen lung. Piața actuală a audiobookurilor reprezintă oportunitatea pe termen scurt, dar formele scurte, verticalele, serialele, fan‑fic‑urile și numeroase alte ramificații vor prospera ca rezultat. Și când se întâmplă asta, dorim ca Spoken Multi‑CastTM să fie în inima lor.
Vă mulțumim pentru interviul excelent, cititorii care doresc să afle mai multe ar trebui să viziteze Spoken.












