Interviews
Phil Marshall, oprichter en CEO van Spoken – Interviewreeks

Phil Marshall, oprichter en CEO van Spoken, is een arts, uitvinder, technologie‑ondernemer en science‑fiction schrijver wiens carrière zich uitstrekt over de gezondheidszorg, digitale media, kunstmatige intelligentie en productinnovatie. Voor de lancering van Spoken in 2024 heeft Marshall Conversa Health medeopgericht, een gepersonaliseerd patiëntbetrokkenheids‑ en conversationele‑AI‑bedrijf dat in 2021 werd overgenomen door Amwell en onderdeel werd van diens geautomatiseerde virtuele zorgactiviteiten. Vroeger in zijn loopbaan werkte hij meer dan tien jaar bij WebMD als Vice President Productstrategie, later als Senior Vice President Productmanagement bij Press Ganey Associates, en richtte hij de samenwerkende video‑technologiestart‑up JumperCut op. Zijn werk richt zich steeds meer op het snijvlak van AI, storytelling, hersen‑computer‑interfaces en kennistechnologieën, waarbij hij zijn achtergrond als technoloog en ondernemer combineert met zijn interesse in science‑fiction en opkomende vormen van digitale interactie.
Spoken is een AI‑aangedreven audioboekplatform dat auteurs, uitgevers en rechthebbenden helpt manuscripten om te zetten in professioneel geproduceerde audio zonder een traditioneel opname‑studio te gebruiken. De technologie analyseert de taal, stijl, narratieve structuur en personages van een manuscript voordat er verschillende stemmen worden toegewezen voor vertelling en dialoog, en ondersteunt producties met één verteller, twee vertellers of een multi‑cast. Auteurs kunnen zelf‑gegenereerde stemmen gebruiken, kiezen uit meer dan 100 betaalde professionele stemacteurs, of hun eigen stem klonen, terwijl ze eigendom behouden over hun werk, masters en distributierechten. Spoken biedt ook een application programming interface (API) voor uitgevers die audioboeken over grotere catalogi willen produceren, en benadrukt een ethisch AI‑model waarin, volgens hen, geschreven werken niet worden gebruikt om hun systemen te trainen en deelnemende menselijke stemacteurs worden gecompenseerd.
Uw carrière heeft u van de geneeskunde en productstrategie bij WebMD naar het oprichten van Conversa Health en nu Spoken geleid. Welk probleem in de creatie van audioboeken heeft u overtuigd om Spoken op te richten, en hoe heeft uw eerdere werk in conversationele AI het platform dat u vandaag bouwt beïnvloed?
Met Conversa was onze missie om de stem van het zorgteam uit te breiden door gepersonaliseerde outreach, vervolgvragen en begeleiding te automatiseren die een klinische afdeling van een groot zorgsysteem rechtstreeks aan patiënten zou geven, als ze de tijd hadden. Aanvankelijk gaven we de bot een persona, Cate, die in de eerste persoon sprak. Uiteindelijk besloot ik echter dat het nabootsen van menselijkheid oneerlijk was. Cate was geen persoon, en ik wilde niet dat patiënten dat dachten. Dus verwijderden we de persona‑naam en schakelden over naar een meervoudig “Wij” zodat het werd gezien als een uitbreiding van het zorgteam, wat het ook was. Deze ervaring leerde me dat geautomatiseerde oplossingen nog steeds kunnen aanvoelen als een authentieke uitbreiding van menselijke zorg zonder zich voor te doen als mens.
Fast forward naar Spoken, waar we ons richten op authentieke, mens‑gecentreerde expressie. Het probleem dat we helpen oplossen is duidelijk – de meeste verhalen kunnen hun volledige audio‑potentieel niet bereiken bij het snelst groeiende publiek (luisteraars) vanwege tijd‑ en kostenbeperkingen – maar mijn langdurige filosofie om een oprechte uitbreiding van mensen te zijn speelde een grote rol. In tegenstelling tot AI‑podcasts die proberen banter te fabriceren of agents die compassie simuleren, brengt Spoken’s Multi‑Cast‑vertelling de ware woorden van een auteur tot leven. Omdat we verhalen vertellen en niet proberen menselijke interacties te repliceren, doen we geen pretentie dat onze AI een persoon is. Het zijn personages in een verhaal, dus we zijn gelukkig dat we verwarring en conflicten kunnen vermijden.
Als zowel een hard‑science‑fiction schrijver als een AI‑ondernemer, hoe verwachtte u ooit dat kunstmatige intelligentie zou evolueren, en waar wijkt de realiteit van AI‑ontwikkeling het meest af van de toekomst die u zich had voorgesteld?
Deze vraag ligt me nauw aan het hart. Ik leef graag op het snijvlak van kunst, wetenschap en technologie, en het afbeelden van geautomatiseerde systemen in mijn near‑future sci‑fi is een uitstekend voorbeeld daarvan. In feite heeft elk toekomstig bedrijf waar ik over schrijf – en er zijn er verschillende – een domein dat ik bezit, een product dat ik heb ontworpen, en een concept dat ik geloof dat ooit een echt bedrijf kan worden. Zelfs het beeldhouwwerk voor mijn huis is gemodelleerd naar de modernistische vorm van het logo van The Kite Factory, een bedrijf dat ik me voorstel ooit de anti‑zwaartekrachttechnologie te creëren die de planeet zal transformeren!
Als we ons op AI richten, heb ik een probleem wanneer toekomst‑sci‑fi niet adresseert hoe mensen informatie verkrijgen, gebruiken en delen. In het jaar 2100, gebruiken ze dan nog steeds een telefoon om mensen te bellen om feitelijke vragen te beantwoorden? Mijn filosofie in schrijven, en in het echte leven, is simpel: wat geautomatiseerd kan worden, zal geautomatiseerd worden, en we zullen altijd neigen naar meer realtime, meer collaboratief en meer fysiek geïntegreerde informatie. Ik moet echter toevoegen dat ik een persoonlijke afkeer heb van implantaten. Daarom hebben we in de achtergrond van mijn boek, toen Elon Musk zijn Starlink‑satellieten koppelde aan zijn Neuralink‑implantaten en begon berichten rechtstreeks in de hersenen van mensen te broadcasten, brain‑implants verboden!
Over de divergentie: omdat ik geloof dat wat geautomatiseerd kan worden, geautomatiseerd zal worden, gebeurt het automatiseren van feitelijke vragen als een eenvoudige onvermijdelijkheid. Echter, als het gaat om zaken van het hart – kunst, muziek en verhalen – is er een zekere afwijking. Omdat AI getraind wordt op bestaande patronen, zal het per definitie nooit iets echt nieuws kunnen creëren. Toch schrijven mensen verhalen, maken kunst en componeren muziek met behulp van AI. Hoe kan dat? Omdat kunst niet per se nieuw of uniek hoeft te zijn. Dat, geloof ik, betekent dat in de toekomst die creaties die de mal doorbreken des te kostbaarder zullen zijn. Ik hoop dat we nog steeds kunnen herkennen wanneer dat gebeurt.
Een recent Edison Research‑onderzoek vergeleek Spoken’s multi‑cast‑productie met een professioneel geproduceerde, enkel‑verteller menselijke versie. Hoeveel van Spoken’s voordeel schrijft u toe aan de onderliggende AI‑technologie, en hoeveel aan het geven van elk personage een eigen stem? Hoe zouden de resultaten kunnen verschillen ten opzichte van een volledige menselijke cast?
Het analyseren van het verhaal en elk personage om hun perfecte stem te vinden, is in feite een groot deel van onze AI. We doorlopen een intensief agentisch proces om de onderliggende lagen van het verhaal af te leiden, van rudimentaire elementen zoals genre en taal tot de cadans bepaald door accenten en stijl, evenals de scène‑cohesie van meerdere personages die interageren. Al deze AI‑gedreven lagen informeren de feitelijke karakterstem‑vertelling. Het is wat wij “Magic Mode” noemen, en je kunt het zien als het mengen van verfkleuren.
Wat betreft hoe de resultaten zouden kunnen verschillen van een volledige menselijke cast, draait het echt om kosten en workflow. Eén‑klik en enkele honderden dollars, vergeleken met een volledige cast, is niet toegankelijk voor indie‑auteurs en de meeste uitgevers, daarom was dat niet ons vergelijkingspunt. Wat kwaliteit betreft, geloof ik echter dat we al in de buurt komen van gelijkwaardigheid met een volledige cast, dus de kwaliteit zal ononderscheidbaar zijn.
Spoken Multi‑Cast kreeg hogere waarderingen voor karakter‑gedreven scènes, terwijl menselijke vertelling beter presteerde tijdens expositie. Wat maakt niet‑dialoog passages bijzonder moeilijk voor AI‑vertelling, en hoe werkt u eraan om die kloof te dichten?
Eigenlijk is het niet zo dat niet‑dialoog passages moeilijk zijn voor AI‑vertelling; het is gewoon dat het aantal dynamieken waarmee de AI moet werken nog steeds minder is dan wat een menselijke stemacteur heeft. Denk aan elke nuance van inflectie en levering die een enkele verteller kan brengen in een passage. Met multi‑cast is het aantal dynamieken echter veel groter vanwege de gevarieerde, gepersonaliseerde timbres van karakterstemmen en dat mengproces, opnieuw als verfkleuren. Dat betekent dat multi‑cast‑scènes het realisme van interacties tussen meerdere personen kunnen overbrengen op een manier die een enkele verteller moeilijk kan evenaren.
Om de kloof te dichten, zal het aantal dynamieken dat in één‑verteller AI‑vertelling wordt gebruikt blijven toenemen, en de kloof zal blijven krimpen.
Voor het beluisteren van de samples gaf slechts 31 % van de deelnemers aan interesse te hebben in AI‑genarrende audioboeken, maar dat cijfer steeg naar 65 % nadat ze Spoken Multi‑Cast hadden ervaren. Welke elementen van de uitvoering waren volgens u het meest verantwoordelijk voor het veranderen van hun perceptie?
Eigenlijk was het omgekeerd, en dat ontwerp‑element van de enquête is superbelangrijk. 65 % zei dat ze een heel audioboek met deze vertelling zouden beluisteren na het horen van de fragmenten, voordat ze wisten dat het AI was. We vroegen vervolgens, algemener, of ze bereid zouden zijn audioboeken te beluisteren die met AI zijn genarrerd, en slechts 31 % zei ja. Daarna vroegen we of ze dachten dat wat ze gehoord hadden AI was. Slechts 39 % van degenen die Spoken Multi‑Cast hoorden vermoedde dat het AI kon zijn, vergeleken met 35 % van degenen die de menselijke versies hoorden en dachten dat die AI konden zijn. Dit liet onze volgende vraag opduiken: Nu je dit weet, zou je bereid zijn een audioboek te beluisteren dat met AI is genarrerd? Die bereidheid steeg naar 43 % na blootstelling, en we optimaliseren actief om de kloof te dichten richting onze 65 % benchmark.
Kunt u ons door de agentische AI‑workflow leiden die een geüpload manuscript omzet in een multi‑voice audioboek, inclusief hoe het systeem sprekers identificeert, personages interpreteert, stemmen toewijst en emotie, timing en levering bepaalt?
Gezien onze lopende patenten op het proces, vat ik het op een hoog niveau samen als een intensief agentisch proces dat meerdere lagen levert. Het is een proces dat we in meer dan twee jaar hebben verfijnd. De rudimentaire elementen van het verhaal, de cadans van het verhaal, de scène‑cohesie, en uiteindelijk de precieze karakterstemmen – of zoals ik ze noem, “de verflaag” – maken allemaal deel uit. Het verkrijgen van de boog van emotionele levering en timing is cruciaal, en we werken daar meer aan dan aan iets anders. Het verrast vaak mensen dat de AI die wordt gebruikt om zich voor te bereiden op vertelling ongeveer 5 × de hoeveelheid AI is die in de feitelijke vertelling wordt ingezet.
Hoeveel creatieve controle behoudt een auteur over de uiteindelijke productie, en welke tools zijn beschikbaar wanneer de AI een personage, uitspraak, emotionele beat of narratieve intentie verkeerd interpreteert?
De auteur heeft absolute controle over de uiteindelijke productie. Of het nu gaat om emotionele inflecties, accenten, stemtimbre of timing, zij beheersen alles. Ons doel is om ze zo dicht mogelijk bij subliem te krijgen met één klik. Als de auteur, uitgever of producent een zeer specifieke levering van een passage nodig heeft, kunnen ze “Speak It” gebruiken om in hun microfoon te spreken en te demonstreren hoe ze het willen laten leveren, en de karakterstem zal prachtig gehoorzamen.
Wij geloven dat auteurs volledig eigendom moeten voelen over hun werk, tot aan de stem die wordt gebruikt in hun opening‑ en afsluitende credits. Zelfs “Made with Spoken” zal de stem van hun keuze gebruiken, inclusief hun eigen persoonlijke stem als ze dat willen.
Spoken stelt auteurs in staat om zelf‑gegenereerde stemmen te gebruiken evenals goedgekeurde stemklonen van professionele vertellers die worden gecompenseerd wanneer hun stemmen worden gebruikt. Hoe zijn toestemming, eigendom, compensatie, intrekkingsrechten en bescherming tegen ongeautoriseerde kloning in dat model ingebouwd?
We werken alleen met stempartners die zich houden aan een strikte gedragscode, die onder meer de detectie en verbod op ongeautoriseerd gebruik van een stem omvat (vooral belangrijk om opvallende stemmen van beroemdheden te beschermen). Bijvoorbeeld, we hebben veel van de topstemmen van ElevenLabs in onze bibliotheek. Die stemacteurs krijgen betaald voor elk gebruik door onze auteurs.
Ziet u AI‑vertelling vooral als een uitbreiding van de audioboekmarkt door eerder onrendabele titels rendabel te maken, of zal het ook delen van traditionele productie vervangen? Welke rollen blijven duidelijk menselijk naarmate de technologie volwassen wordt?
We voorzien een enorm vergrote audioboekmarkt die nieuwe lezers aantrekt, vooral gezien onze nieuwe, levendige multi‑cast‑mogelijkheden. Uiteindelijk zal die vergrote markt worden aangedreven door een hybride van technologie en mensen. De tijd zal het leren, maar deze transformatie gaat wellicht minder over of het menselijke stemtalent of AI is, en meer over de workflow van auteur/producent‑controle en de steeds veranderende luistergewoonten van het publiek.
Spoken combineert audioboekproductie met publicatie, ontdekking, streaming, community en monetisatie. Hoe zou AI uiteindelijk storytelling zelf kunnen veranderen, in plaats van alleen het bestaande audioboekproductieproces sneller en goedkoper te maken?
Wat betekent het voor een lezer of luisteraar om “verloren te raken in een verhaal”? Daar draait het echt om: het publiek een meeslepende audio‑ervaring geven op een moment dat de vraag naar karakter‑gedreven fictie groeit en audio de dominante modaliteit wordt om verhalen te consumeren. Uiteindelijk, of het nu een kort verhaal, persoonlijke memoires, fan‑fic of epische fantasy is, de snelheid en lage kosten van het creëren van levendige, natuurlijke levering zullen diepgaande langetermijnimplicaties hebben. De huidige audioboekmarkt is de kortetermijnkans, maar short‑form, verticale shorts, series, fan‑fic en tal van afsplitsingen zullen daardoor floreren. En wanneer dat gebeurt, willen we dat Spoken Multi‑CastTM in hun hart zit.
Bedankt voor het geweldige interview, lezers die meer willen weten, moeten Spoken bezoeken.












