인터뷰
Phil Marshall, Spoken 설립자 겸 CEO – 인터뷰 시리즈

Phil Marshall, Spoken 설립자 겸 CEO는 의사이자 발명가, 기술 기업가, 그리고 과학 소설 작가로서 의료, 디지털 미디어, 인공지능, 제품 혁신 분야에 걸친 경력을 가지고 있습니다. 2024년에 Spoken을 시작하기 전에, Marshall은 맞춤형 환자 참여 및 대화형 AI 기업인 Conversa Health를 공동 설립했으며, 이 기업은 2021년에 Amwell에 인수되어 자동화된 가상 진료 사업의 일부가 되었습니다. 그의 초기 경력에서는 WebMD에서 제품 전략 부문 부사장으로 10년 이상 근무했으며, 이후 Press Ganey Associates에서 제품 관리 수석 부사장을 역임하고, 협업 영상 기술 스타트업 JumperCut을 설립했습니다. 그의 작업은 AI, 스토리텔링, 뇌-컴퓨터 인터페이스, 지식 기술의 교차점에 점점 더 집중하고 있으며, 기술자이자 기업가로서의 배경과 과학 소설 및 새로운 디지털 상호작용 형태에 대한 관심을 결합하고 있습니다.
Spoken은 AI 기반 오디오북 플랫폼으로, 저자, 출판사 및 권리 보유자가 전통적인 녹음 스튜디오에 의존하지 않고 원고를 전문적으로 제작된 오디오로 변환하도록 설계되었습니다. 이 기술은 원고의 언어, 스타일, 서사 구조 및 등장인물을 분석한 뒤, 내레이션과 대화를 위한 별개의 목소리를 할당하며, 단일 내레이터, 이중 내레이터 및 멀티캐스트 제작을 지원합니다. 저자는 맞춤형 생성 목소리를 사용하거나 100명 이상의 유료 전문 성우 중에서 선택하거나 자신의 목소리를 클론할 수 있으며, 작업물, 마스터 및 배포 권한을 그대로 보유합니다. Spoken은 또한 더 큰 카탈로그에 걸쳐 오디오북을 제작하려는 출판사를 위해 애플리케이션 프로그래밍 인터페이스(API)를 제공하며, 작성된 작품이 시스템 학습에 사용되지 않고 참여한 인간 성우에게 보상이 지급되는 윤리적 AI 모델을 강조합니다.
Your career has taken you from medicine and product strategy at WebMD to founding Conversa Health and now Spoken. What problem in audiobook creation convinced you to found Spoken, and how did your previous work in conversational AI influence the platform you are building today?
Conversa와 함께, 우리의 사명은 개인화된 outreach, 후속 질문 및 지침을 자동화하여 대형 의료 시스템의 임상 부서가 시간만 있다면 전화로 직접 환자에게 제공할 수 있는 돌봄 팀의 목소리를 확장하는 것이었습니다. 처음에는 봇에 ‘Cate’라는 인격을 부여해 1인칭으로 자신을 지칭하도록 했습니다. 그러나 결국 인간성을 가장하는 것이 부정직하다고 판단했습니다. Cate는 사람이 아니었으며, 환자들이 그렇게 생각하기를 원하지 않았습니다. 그래서 인격 이름을 제거하고 복수형 ‘We’로 전환해 돌봄 팀의 연장선으로 보이도록 했습니다. 이 경험을 통해 자동화 솔루션도 인간인 척하지 않으면서 인간 돌봄의 진정한 연장선처럼 느껴질 수 있음을 배웠습니다.
Spoken으로 이어가면서, 우리는 진정성 있고 인간 중심적인 표현에 집중합니다. 우리가 해결하려는 문제는 명확합니다—대부분의 이야기는 시간과 비용 제약 때문에 전체 오디오 잠재력을 발휘해 가장 빠르게 성장하는 청취자층에 도달하지 못합니다—하지만 인간의 진정한 연장선이 되겠다는 나의 오랜 철학이 큰 역할을 했습니다. 인간적인 대화를 인위적으로 만들려는 AI 팟캐스트나 연민을 흉내 내는 에이전트와 달리, Spoken의 멀티캐스트 내레이션은 저자의 진정한 말을 생생하게 전달합니다. 우리는 이야기를 전달하는 것이지 인간 상호작용을 복제하려는 것이 아니므로, 우리 AI가 사람이라고 가장하는 일은 없습니다. 이것은 이야기 속의 캐릭터이기 때문에 혼란이나 충돌을 피할 수 있습니다.
As both a hard science fiction writer and an AI entrepreneur, how did you once expect artificial intelligence to evolve, and where has the reality of AI’s development diverged most sharply from the future you imagined?
이 질문은 제게 매우 의미가 깊습니다. 저는 예술, 과학, 기술이 교차하는 지점에서 살아가는 것을 사랑하며, 가까운 미래의 SF에서 자동화 시스템을 묘사하는 것이 좋은 예시라고 생각합니다. 사실 제가 글에서 다루는 모든 미래 기업—그리고 몇몇은—은 제가 소유한 도메인, 제가 설계한 제품, 그리고 언젠가 실제 기업이 될 수 있다고 믿는 개념을 가지고 있습니다. 심지어 제 집 앞에 있는 조각상도 제가 상상하는 The Kite Factory 로고의 모던한 형태를 모델링한 것으로, 언젠가 행성을 변혁시킬 반중력 기술을 만들 기업이 될 것입니다!
AI에 초점을 맞추면, 미래 SF가 사람들이 정보를 어떻게 도출하고, 사용하고, 공유하는지를 다루지 않을 때 문제가 생깁니다. 2100년에 그들은 여전히 전화를 사용해 사실 질문에 답을 구할까요? 제 글쓰기와 실제 생활에서의 철학은 간단합니다: 자동화될 수 있는 것은 자동화될 것이며, 우리는 언제나 실시간성, 협업성, 물리적 통합성이 높은 정보로 향해 나아갈 것입니다. 다만 저는 임플란트에 개인적인 반감을 가지고 있다는 점을 덧붙이고 싶습니다. 그래서 제 책의 배경 이야기에서는 엘론 머스크가 스타링크 위성을 그의 Neuralink 임플란트에 연결해 사람들의 뇌에 직접 메시지를 전송했을 때, 우리는 뇌 임플란트를 금지했습니다!
분기점에 대한 질문에 답하자면: 자동화될 수 있는 것은 자동화될 것이므로, 사실 질문을 자동화하는 것은 단순한 불가피한 현상입니다. 그러나 감정과 관련된 영역—예술, 음악, 이야기—에서는 약간의 차이가 있습니다. AI는 기존 패턴으로 학습되기 때문에 본질적으로 완전히 새로운 것을 창조할 수 없습니다. 그럼에도 사람들은 AI를 이용해 이야기를 쓰고, 예술을 만들고, 음악을 작곡합니다. 어떻게 가능하냐고요? 예술은 반드시 완전히 새롭거나 독창적일 필요는 없습니다. 저는 이것이 미래에 틀을 깨는 창작물일수록 더욱 귀중해질 것이라고 믿습니다. 그런 순간을 우리는 여전히 인식할 수 있기를 바랍니다.
A recent Edison Research study compared Spoken’s multi-cast production with a professionally produced, single-narrator human version. How much of Spoken’s advantage do you attribute to the underlying AI technology, and how much comes from giving each character a distinct voice? How might the results differ against a full human cast?
스토리와 각 캐릭터를 분석해 완벽한 목소리를 도출하는 것은 실제로 우리 AI의 큰 부분을 차지합니다. 우리는 장르와 언어 같은 기본 요소부터 억양과 스타일이 지시하는 리듬, 그리고 여러 캐릭터가 상호작용하는 장면의 응집성까지 스토리의 근본적인 층을 파악하는 집중적인 에이전시 과정을 거칩니다. 이러한 AI 기반 층 모두가 실제 캐릭터 목소리 내레이션에 반영됩니다. 이를 우리는 ‘매직 모드’라고 부르며, 색을 혼합하는 것과 비슷하다고 생각하시면 됩니다.
전체 인간 캐스트와 결과가 어떻게 다를지는 비용과 워크플로우에 달려 있습니다. 클릭 한 번에 수백 달러는 전체 캐스트에 비해 인디 작가와 대부분의 출판사에게 접근성이 낮기 때문에 비교 대상이 되지 않았습니다. 품질 면에서는 이미 전체 캐스트와 동등에 가까워지고 있어, 품질 차이는 구별하기 어려울 것입니다.
Spoken Multi-Cast received higher ratings for character-driven scenes, while human narration performed better during exposition. What makes non-dialogue passages particularly difficult for AI narration, and how are you working to close that gap?
실제로 비대화 구절이 AI 내레이션에 어려운 것이 아니라, AI가 다루어야 할 역동성의 수가 인간 성우가 다루는 것보다 여전히 적기 때문입니다. 단일 내레이터가 구절에 부여할 수 있는 억양과 전달의 모든 뉘앙스를 생각해 보세요. 멀티캐스트에서는 캐릭터 목소리의 다양한 맞춤형 음색과 이를 혼합하는 과정 때문에 역동성의 수가 훨씬 많아집니다. 이는 색을 혼합하는 것과 마찬가지로, 멀티캐스트 장면이 여러 사람 간의 상호작용 현실감을 단일 내레이터가 구현하기 어려운 방식으로 앞당길 수 있음을 의미합니다.
격차를 해소하기 위해, 단일 내레이터 AI 내레이션에 사용되는 역동성의 수는 계속 증가할 것이며, 그 차이는 점점 좁혀질 것입니다.
Before hearing the samples, only 31% of participants expressed interest in AI-narrated audiobooks, but that figure rose to 65% after they experienced Spoken Multi-Cast. What elements of the performance do you believe were most responsible for changing their perceptions?
실제로는 반대였으며, 설문 설계의 그 요소가 매우 중요했습니다. 65%는 발췌를 듣고 this 내레이션으로 전체 오디오북을 들을 것이라고 답했으며, 이는 AI라는 사실을 알기 전이었습니다. 이후 우리는 일반적으로 AI를 사용한 오디오북을 들을 의향이 있는지를 물었고, 그때는 31%만이 긍정했습니다. 다음으로 그들이 들은 것이 AI라고 생각했는지를 물었을 때, Spoken 멀티캐스트를 들은 사람 중 39%가 AI일 수 있다고 추측했으며, 인간 버전을 들은 사람 중 35%가 AI일 수 있다고 생각했습니다. 이는 다음 질문을 촉발했습니다: 이제 이 사실을 알았으니 AI로 내레이션된 오디오북을 들을 의향이 있습니까? 이 의향은 노출 후 43%로 상승했으며, 우리는 65% 목표치에 도달하기 위해 격차를 줄이는 작업을 적극 진행하고 있습니다.
Can you walk us through the agentic AI workflow that transforms an uploaded manuscript into a multi-voice audiobook, including how the system identifies speakers, interprets characters, assigns voices, and determines emotion, timing, and delivery?
이 프로세스에 대한 특허가 진행 중이므로, 저는 고수준에서 간단히 요약하겠습니다. 이는 매우 에이전시적인 과정으로 여러 층을 제공합니다. 2년 이상 다듬어 온 과정이며, 이야기의 기본 요소, 리듬, 장면 응집성, 그리고 최종적인 정확한 캐릭터 목소리—제가 ‘페인트 코트’라고 부르는—가 모두 포함됩니다. 감정 전달과 타이밍의 아크를 잡는 것이 핵심이며, 우리는 그 부분에 가장 많은 노력을 기울입니다. 내레이션에 실제 사용되는 AI보다 약 5배 정도 더 많은 AI가 준비 과정에 사용된다는 점은 사람들을 종종 놀라게 합니다.
How much creative control does an author retain over the final production, and what tools are available when the AI misinterprets a character, pronunciation, emotional beat, or narrative intention?
저자는 최종 제작에 대해 절대적인 통제권을 가집니다. 감정 억양, 억양, 목소리 음색, 타이밍 등 모든 요소를 제어할 수 있습니다. 우리의 목표는 단 한 번의 클릭으로 가능한 한 정교하게 만드는 것입니다. 저자, 출판사 또는 프로듀서가 특정 구절의 전달 방식을 매우 구체적으로 원한다면, ‘Speak It’을 사용해 마이크에 말하여 원하는 전달 방식을 시연할 수 있으며, 캐릭터 목소리가 아름답게 따를 것입니다.
우리는 저자들이 작업물에 대한 완전한 소유권을 느껴야 한다고 믿으며, 오프닝 및 클로징 크레딧에 사용되는 목소리까지도 포함합니다. ‘Made with Spoken’ 역시 저자가 선택한 목소리를 사용할 것이며, 원한다면 자신의 개인 목소리를 사용할 수도 있습니다.
Spoken allows authors to use custom-generated voices as well as approved voice clones from professional narrators who are compensated when their voices are used. How are consent, ownership, compensation, revocation rights, and protection against unauthorized cloning built into that model?
우리는 엄격한 윤리 강령을 준수하는 음성 파트너만 사용하며, 여기에는 무단 음성 사용을 탐지하고 금지하는 조치가 포함됩니다(특히 유명인 음성을 보호하는 데 중요합니다). 예를 들어, 우리는 ElevenLabs의 상위 음성들을 라이브러리에 다수 보유하고 있으며, 해당 성우들은 저희 저자들의 사용마다 보수를 받습니다.
Do you see AI narration primarily expanding the audiobook market by making previously uneconomical titles viable, or will it also replace portions of traditional production? Which roles will remain distinctly human as the technology matures?
우리는 새로운 생생한 멀티캐스트 기능으로 새로운 독자를 끌어들이며 오디오북 시장이 크게 확대될 것으로 기대합니다. 결국 이 확대된 시장은 기술과 인간의 하이브리드에 의해 주도될 것입니다. 시간이 지나면 이는 인간 성우와 AI 중 어느 쪽이 더 중요한가보다, 저자/프로듀서의 통제 워크플로와 청취자의 변화하는 청취 습관에 더 관련될 것입니다.
Spoken combines audiobook production with publishing, discovery, streaming, community, and monetization. How could AI ultimately change storytelling itself, rather than simply making the existing audiobook production process faster and less expensive?
독자나 청취자가 ‘스토리에 빠진다’는 것은 무엇을 의미할까요? 이것이 바로 우리가 추구하는 바이며, 캐릭터 중심의 픽션에 대한 수요가 증가하고 오디오가 이야기를 소비하는 주요 방식이 되는 시점에 몰입형 오디오 경험을 제공하는 것입니다. 결국 짧은 이야기, 개인 회고록, 팬픽, 서사 판타지 등 어떤 형태든, 생생하고 자연스러운 전달을 만들기 위한 속도와 낮은 비용은 장기적으로 깊은 영향을 미칠 것입니다. 현재 오디오북 시장은 단기적인 기회이지만, 짧은 형식, 수직 쇼츠, 연재물, 팬픽 및 다양한 파생 콘텐츠가 그 결과로 번성할 것입니다. 그리고 그때 우리는 Spoken Multi-CastTM가 그 중심에 있기를 원합니다.
Thank you for the great interview, readers who wish to learn more should viist Spoken.












