Intervjuer
Phil Marshall, grundare och VD för Spoken – Intervjuserie

Phil Marshall, grundare och VD för Spoken, är en läkare, uppfinnare, teknikentreprenör och science fiction‑författare vars karriär har sträckt sig över hälso‑ och sjukvård, digitala medier, artificiell intelligens och produktinnovation. Innan han lanserade Spoken 2024 medgrundade Marshall Conversa Health, ett företag för personlig patientengagemang och konversations‑AI som förvärvades av Amwell 2021 och blev en del av deras automatiserade virtuella vårdbusiness. Tidigare i sin karriär tillbringade han mer än ett decennium på WebMD som vice president för produktstrategi, senare som senior vice president för produktledning på Press Ganey Associates, och grundade startupen för samarbetsvideoteknik JumperCut. Hans arbete fokuserar i allt högre grad på skärningspunkten mellan AI, berättande, hjärn‑dator‑gränssnitt och kunskapsteknologier, och kombinerar hans bakgrund som teknolog och entreprenör med hans intresse för science fiction och framväxande former av digital interaktion.
Spoken är en AI‑driven ljudboksplattform som är utformad för att hjälpa författare, förlag och rättighetsinnehavare att omvandla manus till professionellt producerat ljud utan att behöva ett traditionellt inspelningsstudio. Dess teknik analyserar ett manus språk, stil, narrativ struktur och karaktärer innan den tilldelar distinkta röster för berättelse och dialog, och stödjer produktioner med en enda berättare, två berättare eller multi‑cast. Författare kan använda skräddarsydda genererade röster, välja bland mer än 100 betalda professionella röstskådespelare, eller klona sin egen röst, samtidigt som de behåller äganderätten till sitt verk, master‑filerna och distributionsrättigheterna. Spoken erbjuder också ett application programming interface (API) riktat mot förlag som vill producera ljudböcker för större kataloger, samtidigt som de betonar en etisk AI‑modell där de säger att skrivna verk inte används för att träna deras system och att mänskliga röstskådespelare som deltar kompenseras.
Din karriär har tagit dig från medicin och produktstrategi på WebMD till att grunda Conversa Health och nu Spoken. Vilket problem i ljudboksproduktion övertygade dig om att grunda Spoken, och hur har ditt tidigare arbete med konversations‑AI påverkat plattformen du bygger idag?
Med Conversa var vårt uppdrag att utöka vårdteamets röst genom att automatisera personlig kontakt, uppföljningsfrågor och vägledning som en klinisk avdelning på ett stort hälsosystem skulle ge direkt till patienter via telefon, om de hade tid. Inledningsvis antropomorfiserade vi boten med en persona, Cate, som refererade till sig själv i första person. Så småningom insåg jag dock att det var oärligt att låtsas vara mänsklig. Cate var ingen person, och jag ville inte att patienter skulle tro det. Därför tog vi bort personans namn och övergick till ett pluralistiskt “Vi” så att den uppfattades som en förlängning av vårdteamet, vilket den var. Erfarenheten lärde mig att automatiserade lösningar fortfarande kan kännas som en autentisk förlängning av mänsklig vård utan att låtsas vara mänskliga.
Snabbspola fram till Spoken, där vi fokuserar på autentiskt, mänskligt centrerat uttryck. Problemet vi hjälper till att lösa är uppenbart – de flesta berättelser kan inte nå den snabbast växande publiken (lyssnarna) med sin fulla ljudpotential på grund av tids- och kostnadsbegränsningar – men min långvariga filosofi att vara en genuin förlängning av människor spelade en stor roll. Till skillnad från AI‑podcaster som försöker tillverka småprat eller agenter som simulerar medkänsla, ger Spoken’s Multi‑Cast‑berättelse författarens egentliga ord liv. Eftersom vi berättar historier, inte försöker efterlikna mänskliga interaktioner, finns det ingen föreställning om att vår AI är en person. Detta är karaktärer i en berättelse, så vi har turen att undvika förvirring och konflikt.
Ett nyligen Edison Research‑studie jämförde Spoken’s multi‑cast‑produktion med en professionellt producerad, en‑berättare mänsklig version. Hur mycket av Spoken’s fördel tillskriver du den underliggande AI‑teknologin, och hur mycket beror på att varje karaktär får en distinkt röst? Hur kan resultaten skilja sig mot en komplett mänsklig ensemble?
Att analysera berättelsen och varje karaktär för att finna deras perfekta röst är faktiskt en stor del av vår AI. Vi går igenom en intensiv agentisk process för att härleda de underliggande lagren i berättelsen, från grundläggande element som genre och språk till den rytm som bestäms av accenter och stil, samt scenens sammanhållning när flera karaktärer interagerar. Alla dessa AI‑drivna lager informerar den faktiska karaktärsröstberättelsen. Det är vad vi kallar ”Magic Mode”, och du kan tänka på det som att blanda färger.
När det gäller hur resultaten kan skilja sig från en fullständig mänsklig ensemble handlar det egentligen om kostnad och arbetsflöde. En enda klickning och några hundra dollar, jämfört med en hel ensemble, är inte tillgängligt för indie‑författare och de flesta förlag, vilket är anledningen till att det inte var vår jämförelsepunkt. När det gäller kvalitet tror jag dock att vi redan närmar oss paritet med en hel ensemble, så kvaliteten kommer att vara omöjlig att skilja åt.
Spoken Multi‑Cast fick högre betyg för karaktärsdrivna scener, medan mänsklig berättelse presterade bättre under exposition. Vad gör icke‑dialogpassager särskilt svåra för AI‑berättelse, och hur arbetar du för att minska den klyftan?
Faktum är att det inte är så att icke‑dialogpassager är svåra för AI‑berättelse; det är bara att antalet dynamiker AI:n har att arbeta med fortfarande är färre än vad en mänsklig röstskådespelare har. Föreställ dig varje nyans av intonation och leverans som en ensam berättare kan tillföra en passage. Med multi‑cast är antalet dynamiker däremot mycket större på grund av de varierade, personliga klangen hos karaktärsröster och den processen att blanda dem, återigen som färgblandning. Det betyder att multi‑cast‑scener kan framhäva realismen i interaktioner mellan flera personer på ett sätt som en ensam berättare har svårt att matcha.
För att minska klyftan kommer antalet dynamiker som används i AI‑berättelse med en ensam berättare att fortsätta öka, och klyftan kommer att fortsätta krympa.
Innan de hörde exemplen uttryckte endast 31 % av deltagarna intresse för AI‑berättade ljudböcker, men den siffran steg till 65 % efter att de upplevde Spoken Multi‑Cast. Vilka element i prestationen tror du var mest ansvariga för att förändra deras uppfattning?
Faktum är att det var tvärtom, och den designaspekten av undersökningen är mycket viktig. 65 % sade att de skulle lyssna på en hel ljudbok med denna berättelse efter att ha hört utdragen, innan de visste att det var AI. Vi frågade sedan, mer allmänt, om de skulle vara villiga att lyssna på ljudböcker berättade med AI, och endast 31 % svarade ja. Därefter frågade vi om de trodde att det de hörde var AI. Endast 39 % av de som hörde Spoken Multi‑Cast misstänkte att det kunde vara AI, jämfört med 35 % av de som hörde de mänskliga versionerna och trodde att deras kunde vara AI. Detta fick vår nästa fråga att poppa upp: Nu när du vet detta, skulle du vara villig att lyssna på en ljudbok berättad med AI? Den viljan steg till 43 % efter exponeringen, och vi arbetar aktivt med att minska klyftan mot vårt mål på 65 %.
Kan du gå igenom den agentiska AI‑arbetsflödet som omvandlar ett uppladdat manus till en ljudbok med flera röster, inklusive hur systemet identifierar talare, tolkar karaktärer, tilldelar röster och bestämmer känsla, timing och leverans?
Med tanke på våra pågående patentansökningar kring processen, kommer jag helt enkelt att sammanfatta den på hög nivå genom att säga att det är en intensivt agentisk process som levererar flera lager. Det är en process vi har förfinat under mer än två år. Grundläggande element i berättelsen, berättelsens rytm, scenens sammanhållning och slutligen de precisa karaktärsrösterna, eller som jag gillar att kalla dem, ”färglagret”, ingår alla. Att få fram den emotionella leveransens båge och timing är kritiskt, och vi arbetar med det mer än något annat. Det överraskar ofta folk att AI:n som används för att förbereda berättelsen är ungefär fem gånger så mycket som den AI som används i själva berättelsen.
Hur mycket kreativ kontroll har en författare över den slutgiltiga produktionen, och vilka verktyg finns tillgängliga när AI:n misstolkar en karaktär, uttal, emotionell puls eller narrativ avsikt?
Författaren har absolut kontroll över den slutgiltiga produktionen. Oavsett om det gäller emotionella nyanser, accenter, röstens klang eller timing, så styr de allt. Vårt mål är att få dem så nära perfektion som möjligt med ett enda klick. Om författaren, förlaget eller producenten behöver en mycket specifik leverans av en passage, kan de använda ”Speak It” för att tala in i sin mikrofon och demonstrera hur de vill att den levereras, och karaktärsrösten kommer att följa vackert.
Vi tror att författare ska känna full äganderätt till sitt verk, ända ner till rösten som används i deras öppnings- och avslutningscredits. Även ”Made with Spoken” kommer att använda den röst de väljer, inklusive deras egen personliga röst om de så önskar.
Spoken låter författare att använda skräddarsydda genererade röster samt godkända röstkloner från professionella berättare som kompenseras när deras röster används. Hur är samtycke, äganderätt, ersättning, återkallningsrätt och skydd mot obehörig kloning inbyggda i den modellen?
Vi använder endast röstpartners som följer en strikt etisk kod, som inkluderar upptäckt och förbud mot obehörig användning av en röst (särskilt viktigt för att skydda kända röster hos kändisar). Till exempel har vi många av de främsta rösterna från ElevenLabs i vårt bibliotek. Dessa röstskådespelare får betalt för varje användning av våra författare.
Ser du AI‑berättelse främst som en expansion av ljudboksmarknaden genom att göra tidigare oekonomiska titlar möjliga, eller kommer den också att ersätta delar av traditionell produktion? Vilka roller kommer att förbli tydligt mänskliga när teknologin mognar?
Vi föreställer oss en kraftigt utökad ljudboksmarknad som lockar nya läsare, särskilt med våra nya, levande multi‑cast‑funktioner. I slutändan kommer den utökade marknaden att drivas av en hybrid av teknik och människor. Tiden får utvisa, men denna transformation kan handla mindre om huruvida det är mänsklig rösttalang eller AI, och mer om arbetsflödet för författar‑/producentkontroll och de ständigt föränderliga lyssningsvanorna hos publiken.
Spoken kombinerar ljudboksproduktion med publicering, upptäckt, streaming, community och intäktsgenerering. Hur kan AI i slutändan förändra själva berättandet, snarare än bara göra den befintliga ljudboksproduktionsprocessen snabbare och billigare?
Vad betyder det för en läsare eller lyssnare att ”förlora sig i berättelsen”? Det är egentligen vad detta handlar om: att ge publiken en uppslukande ljudupplevelse i en tid då efterfrågan på karaktärsdriven fiktion ökar och ljud blir den dominerande formen för att konsumera berättelser. I slutändan, oavsett om det är en novell, personlig memoar, fanfic eller episk fantasy, kommer hastigheten och låga kostnaden för att skapa levande, naturlig leverans att ha djupgående långsiktiga konsekvenser. Den nuvarande ljudboksmarknaden är den kortsiktiga möjligheten, men kortform, vertikala kort, serier, fan‑fic och ett antal avknoppningar kommer att blomstra som ett resultat. Och när de gör det vill vi att Spoken Multi‑CastTM ska vara i deras centrum.
Tack för den fantastiska intervjun, läsare som vill lära sig mer bör besöka Spoken.












