Interviews

Phil Marshall, grundlægger og administrerende direktør for Spoken – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Phil Marshall, grundlægger og administrerende direktør for Spoken, er læge, opfinder, teknologientreprenør og science fiction‑forfatter, hvis karriere har spænder over sundhedspleje, digital media, kunstig intelligens og produktinnovation. Før han lancerede Spoken i 2024, medstiftede Marshall Conversa Health, et personligt patientengagement‑ og samtale‑AI‑firma, der blev opkøbt af Amwell i 2021 og blev en del af deres automatiserede virtuelle pleje‑forretning. Tidligere i hans karriere tilbragte han mere end et årti hos WebMD som vicepræsident for produktstrategi, senere som seniorvicepræsident for produktledelse hos Press Ganey Associates, og grundlagde den samarbejdende videoteknologi‑startup JumperCut. Hans arbejde fokuserer i stigende grad på krydsfeltet mellem AI, historiefortælling, hjerne‑computer‑grænseflader og videns‑teknologier, og kombinerer hans baggrund som teknolog og entreprenør med hans interesser i science fiction og nye former for digital interaktion.

Spoken er en AI‑drevet lydbogsplatform designet til at hjælpe forfattere, udgivere og rettighedshavere med at omdanne manuskripter til professionelt produceret lyd uden at skulle benytte et traditionelt indspilningsstudie. Teknologien analyserer et manuskripts sprog, stil, narrative struktur og karakterer, før den tildeler forskellige stemmer til fortælling og dialog og understøtter enkelt‑fortæller, dobbelt‑fortæller og multi‑cast‑produktioner. Forfattere kan bruge specialfremstillede stemmer, vælge blandt mere end 100 betalte professionelle stemmeskuespillere eller klone deres egen stemme, mens de bevarer ejerskabet af deres værk, mastere og distributionsrettigheder. Spoken tilbyder også et programmerings‑interface (API) rettet mod udgivere, der ønsker at producere lydbøger i større kataloger, samtidig med at de lægger vægt på en etisk AI‑model, hvorefter skrevne værker ikke bruges til at træne deres systemer, og deltagende menneskelige stemmeskuespillere kompenseres.

Din karriere har taget dig fra medicin og produktstrategi hos WebMD til at grundlægge Conversa Health og nu Spoken. Hvilket problem i lydbogsproduktion overbeviste dig om at grundlægge Spoken, og hvordan har dit tidligere arbejde med samtale‑AI påvirket den platform, du bygger i dag?

Med Conversa var vores mission at udvide plejeteamets stemme ved at automatisere personlig kontakt, opfølgende spørgsmål og vejledning, som en klinisk afdeling i et stort sundhedssystem ville give direkte til patienter via telefon, hvis de havde tid. I starten antropomorfiserede vi botten med en persona, Cate, som refererede til sig selv i første person. Til sidst besluttede jeg dog, at det at foregive menneskelighed var uærlig. Cate var ikke en person, og jeg ønskede ikke, at patienterne skulle tro, at den var. Så vi fjernede persona‑navnet og skiftede til et flertal “Vi”, så den kunne ses som en forlængelse af plejeteamet, hvilket den var. Erfaringen lærte mig, at automatiserede løsninger stadig kan føles som en autentisk forlængelse af menneskelig pleje uden at foregive at være menneskelige.

Fremskreden til Spoken, hvor vi fokuserer på autentisk, menneskecentreret udtryk. Problemet, vi hjælper med at løse, er indlysende – de fleste historier kan ikke nå det hurtigst voksende publikum (lyttere) med deres fulde lydpotentiale på grund af tids‑ og omkostningsbegrænsninger – men min mangeårige filosofi om at være en ægte forlængelse af mennesker spillede en stor rolle. I modsætning til AI‑podcasts, der forsøger at fremstille småsnak, eller agenter der simulerer medfølelse, bringer Spoken’s Multi‑Cast‑fortælling en forfatters egentlige ord til live. Da vi fortæller historier, ikke forsøger at efterligne menneskelige interaktioner, er der ingen forstillelse om, at vores AI er en person. Det er karakterer i en historie, så vi er heldige at undgå forvirring og konflikt.

Som både en hard science‑fiction‑forfatter og AI‑entreprenør, hvordan forventede du engang, at kunstig intelligens ville udvikle sig, og hvor har virkeligheden i AI‑udviklingen afveget skarpest fra den fremtid, du forestillede dig?

Denne spørgsmål ligger mig meget på sinde. Jeg elsker at leve i krydsfeltet mellem kunst, videnskab og teknologi, og at skildre automatiserede systemer i min nær‑fremtidssci‑fi er et glimrende eksempel på det. Faktisk har hver fremtidig virksomhed, jeg skriver om – og der er flere – et domæne, jeg har ejet, et produkt, jeg har designet, og et koncept, jeg tror en dag kan blive et rigtigt firma. Selv skulpturen foran mit hus er modelleret efter den modernistiske form af The Kite Factory‑logoet, et firma jeg forestiller mig en dag vil skabe anti‑tyngdekraft‑teknologien, der vil forvandle planeten!

Med fokus på AI har jeg et problem, når fremtidig sci‑fi ikke adresserer, hvordan folk udleder, bruger og deler information. I år 2100, bruger de virkelig stadig en telefon til at ringe til folk for at besvare faktuelle spørgsmål? Min filosofi i skrivning, og i virkeligheden, er enkel: Hvad der kan automatiseres, vil blive automatiseret, og vi vil altid tendere mod mere real‑time, mere samarbejdende og mere fysisk integreret information. Jeg skal dog tilføje, at jeg har en personlig modvilje mod implantater. Derfor, i baghistorien til min bog, da Elon Musk koblede sine Starlink‑satellitter til sine Neuralink‑implantater og begyndte at sende beskeder direkte ind i folks hjerner, forbød vi hjerne‑implantater!

Til spørgsmålet om afvigelse: fordi jeg tror, at hvad der kan automatiseres, vil blive automatiseret, er automatisering af faktuelle spørgsmål en simpel uundgåelighed. Men når det kommer til hjertets anliggender – kunst, musik og historier – har der været en vis afvigelse. Da AI trænes på allerede eksisterende mønstre, vil den per definition aldrig kunne skabe noget helt nyt. Alligevel skriver folk historier, skaber kunst og komponerer musik ved hjælp af AI. Hvordan kan det være? Fordi kunst ikke behøver at være helt ny eller unik. Det, tror jeg, vil betyde, at i fremtiden vil de skabelser, der bryder formen, være endnu mere værdifulde. Jeg håber, vi stadig kan genkende, når det sker.

En nylig Edison Research‑undersøgelse sammenlignede Spokens multi‑cast‑produktion med en professionelt produceret, enkelt‑fortæller menneskelig version. Hvor stor en del af Spokens fordel tilskriver du den underliggende AI‑teknologi, og hvor meget skyldes, at hver karakter får en særskilt stemme? Hvordan kan resultaterne adskille sig i forhold til et fuldt menneskeligt ensemble?

Analyse af historien og hver karakter for at udlede deres perfekte stemme er faktisk en stor del af vores AI. Vi gennemgår en intens agentbaseret proces for at udlede historiens underliggende lag, fra grundelementer som genre og sprog til den kadence, der dikteres af accenter og stil, samt scenekoherensen mellem flere interagerende karakterer. Alle disse AI‑drevne lag informerer den faktiske karakterstemme‑fortælling. Det er det, vi kalder ‘Magic Mode’, og du kan tænke på det som at blande malingsfarver.

Hvad angår hvordan resultaterne kan afvige fra et fuldt menneskeligt ensemble, handler det i bund og grund om omkostninger og arbejdsgang. Et enkelt klik og nogle hundrede dollars, sammenlignet med et fuldt ensemble, er ikke tilgængeligt for indie‑forfattere og de fleste udgivere, hvilket er grunden til, at det ikke var vores sammenligningspunkt. Hvad kvaliteten angår, tror jeg dog, at vi allerede nærmer os ligestilling med et fuldt ensemble, så kvaliteten vil være uadskillelig.

Spoken Multi‑Cast modtog højere bedømmelser for karakter‑drevne scener, mens menneskelig fortælling klarede sig bedre under exposition. Hvad gør ikke‑dialogpassager særligt vanskelige for AI‑fortælling, og hvordan arbejder du på at lukke dette hul?

Faktisk er det ikke så, at ikke‑dialogpassager er vanskelige for AI‑fortælling; det er blot, at antallet af dynamikker, AI’en skal arbejde med, stadig er mindre end hvad en menneskelig stemmeskuespiller har. Tænk på hver nuance af intonation og levering, som en enkelt fortæller kan tilføre en passage. Med multi‑cast er antallet af dynamikker dog langt større på grund af de varierede, personlige klangfarver i karakterstemmerne og den proces at blande dem, igen som malingsfarver. Det betyder, at multi‑cast‑scener kan frembringe realismen i interaktioner mellem flere personer på en måde, som en enkelt fortæller ville have svært ved at matche.

Hvad angår at lukke hullet, vil antallet af dynamikker, der bruges i enkelt‑fortæller AI‑fortælling, fortsætte med at stige, og hullet vil fortsætte med at blive mindre.

Før de hørte prøverne udtrykte kun 31 % af deltagerne interesse for AI‑fortalte lydbøger, men tallet steg til 65 % efter de oplevede Spoken Multi‑Cast. Hvilke elementer i præstationen mener du var mest ansvarlige for at ændre deres opfattelse?

Faktisk var det omvendt, og dette designelement i undersøgelsen er meget vigtigt. 65 % sagde, at de ville lytte til en hel lydbog med denne fortælling efter at have hørt uddragene, før de vidste, at den var AI. Vi spurgte derefter mere generelt, om de ville være villige til at lytte til lydbøger fortalt med AI, og kun 31 % svarede ja. Dernæst spurgte vi, om de troede, at det de havde hørt var AI. Kun 39 % af dem, der hørte Spoken Multi‑Cast, mistænkte, at det kunne være AI, sammenlignet med 35 % af dem, der hørte de menneskelige versioner og troede, at deres kunne være AI. Dette fik vores næste spørgsmål til at poppe: Nu hvor du ved dette, ville du være villig til at lytte til en lydbog fortalt med AI? Den villighed steg til 43 % efter eksponeringen, og vi optimerer aktivt for at lukke hullet mod vores benchmark på 65 %.

Kan du gennemgå den agentbaserede AI‑arbejdsgang, der omdanner et uploadet manuskript til en lydbog med flere stemmer, inklusive hvordan systemet identificerer talere, fortolker karakterer, tildeler stemmer og bestemmer følelser, timing og levering?

Da vi har forestående patenter på processen, vil jeg blot opsummere den på et højt niveau ved at sige, at det er en intens agentbaseret proces, der leverer flere lag. Det er en proces, vi har finpudset i mere end to år. Grundelementerne i historien, historiens kadence, scenekoherensen og endelig de præcise karakterstemmer, eller som jeg kan lide at kalde dem, ‘malingslaget’, er alle en del af den. At få buen af følelsesmæssig levering og timing er kritisk, og vi arbejder på det mere end noget andet. Det overrasker ofte folk, at den AI, der bruges til at forberede fortællingen, er omkring fem gange så meget som den AI, der bruges i selve fortællingen.

Hvor meget kreativ kontrol har en forfatter over den endelige produktion, og hvilke værktøjer er tilgængelige, når AI’en misfortolker en karakter, udtale, følelsesmæssigt beat eller narrativ intention?

Forfatteren har fuldstændig kontrol over den endelige produktion. Uanset om det er de følelsesmæssige inflektioner, accenter, stemmeklang eller timing, kontrollerer de det hele. Vores mål er at få dem så tæt på udsøgthed som muligt med et enkelt klik. Hvis forfatteren, udgiveren eller producenten har brug for en meget specifik levering af en passage, kan de bruge ‘Speak It’ til at tale ind i deres mikrofon og demonstrere, hvordan de vil have den leveret, og karakterstemmen vil adlyde smukt.

Vi mener, at forfattere skal føle fuld ejerskab over deres værk, ned til stemmen, der bruges i deres åbnings‑ og afslutnings‑credits. Selv ‘Made with Spoken’ vil bruge den stemme, de vælger, inklusive deres egen personlige stemme, hvis de ønsker det.

Spoken giver forfattere mulighed for at bruge specialfremstillede stemmer såvel som godkendte stemmekloner fra professionelle fortællere, der kompenseres, når deres stemmer anvendes. Hvordan er samtykke, ejerskab, kompensation, tilbagekaldelsesrettigheder og beskyttelse mod uautoriseret kloning indbygget i denne model?

Vi bruger kun stemmepartnere, der overholder en streng etisk kodeks, som omfatter opdagelse og forbud mod uautoriseret brug af en stemme (især vigtigt for at beskytte kendte stemmer fra berømtheder). For eksempel har vi mange af de førende stemmer fra ElevenLabs i vores bibliotek. Disse stemmeskuespillere får betaling for hver gang, de bruges af vores forfattere.

Ser du AI‑fortælling primært som en udvidelse af lydbogsmarkedet ved at gøre tidligere uøkonomiske titler levedygtige, eller vil den også erstatte dele af traditionel produktion? Hvilke roller vil forblive tydeligt menneskelige, når teknologien modnes?

Vi forestiller os et enormt udvidet lydbogsmarked, der tiltrækker nye læsere, især i lyset af vores nye, levende multi‑cast‑kapaciteter. Til sidst vil dette udvidede marked blive drevet af en hybrid af teknologi og mennesker. Tiden vil vise, men denne transformation kan handle mindre om, hvorvidt det er menneskelig stemmetalent eller AI, og mere om arbejdsgangen for forfatter/producent‑kontrol og de stadigt skiftende lyttevaner hos publikum.

Spoken kombinerer lydbogproduktion med udgivelse, opdagelse, streaming, fællesskab og indtægtsgenerering. Hvordan kunne AI i sidste ende ændre selve historiefortællingen, snarere end blot at gøre den eksisterende lydbogsproduktionsproces hurtigere og billigere?

Hvad betyder det for en læser eller lytter at ‘fortabe sig i historien’? Det er egentlig, hvad dette handler om: at give publikum en fordybende lydoplevelse på et tidspunkt, hvor efterspørgslen efter karakter‑drevet fiktion vokser, og lyd bliver den dominerende måde at forbruge historier på. Til sidst, uanset om det er en novelle, en personlig erindring, fanfic eller episk fantasy, vil hastigheden og de lave omkostninger ved at skabe levende, naturlig levering have dybtgående langsigtede konsekvenser. Det nuværende lydbogsmarked er den kortsigtede mulighed, men kort‑form, vertikale shorts, serier, fanfic og et utal af afledte vil blomstre som følge heraf. Og når de gør, vil vi have Spoken Multi‑CastTM til at være i deres hjerte.

Tak for det fantastiske interview, læsere der ønsker at lære mere bør besøge Spoken

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.