Интервью
Фил Маршалл, основатель и генеральный директор Spoken — серия интервью

Phil Marshall, основатель и генеральный директор Spoken, является врачом, изобретателем, технологическим предпринимателем и писателем научной фантастики, чья карьера охватывает здравоохранение, цифровые медиа, искусственный интеллект и инновации в продуктах. До запуска Spoken в 2024 году Маршалл соучредил Conversa Health, компанию по персонализированному взаимодействию с пациентами и разговорному ИИ, которую в 2021 году приобрела Amwell и включила в свой бизнес автоматизированного виртуального ухода. Ранее он более десяти лет работал в WebMD в должности вице‑президента по стратегии продукта, затем стал старшим вице‑президентом по управлению продуктами в Press Ganey Associates и основал стартап видеотехнологий JumperCut. Его работа всё больше сосредоточена на пересечении ИИ, повествования, интерфейсов мозг‑компьютер и технологий знаний, сочетая опыт технолога и предпринимателя с интересами к научной фантастике и новым формам цифрового взаимодействия.
Spoken — это платформа аудиокниг на базе ИИ, предназначенная помочь авторам, издателям и правообладателям преобразовать рукописи в профессионально записанные аудио без необходимости традиционной звукозаписывающей студии. Технология анализирует язык, стиль, структуру повествования и персонажей рукописи, после чего назначает отдельные голоса для озвучивания и диалогов, поддерживая одноголосое, двойное и многоголосое производство. Авторы могут использовать сгенерированные на заказ голоса, выбирать из более чем 100 платных профессиональных актёров озвучивания или клонировать собственный голос, при этом сохраняют права собственности на работу, мастер‑записи и дистрибуцию. Spoken также предоставляет программный интерфейс (API) для издателей, желающих создавать аудиокниги по большим каталогам, подчёркивая этичную модель ИИ, согласно которой написанные произведения не используются для обучения её систем, а участвующие человеческие актёры получают оплату.
Ваша карьера привела вас от медицины и стратегии продукта в WebMD к основанию Conversa Health и сейчас к Spoken. Какая проблема в создании аудиокниг убедила вас основать Spoken, и как ваш предыдущий опыт в разговорном ИИ повлиял на платформу, которую вы строите сегодня?
С Conversa наша миссия заключалась в расширении голоса команды ухода, автоматизируя персонализированные сообщения, последующие вопросы и рекомендации, которые клиническое подразделение крупной системы здравоохранения предоставляло бы пациентам по телефону, если бы у него было время. Сначала мы наделили бота персоной по имени Кейт, которая говорила от первого лица. В конце концов я понял, что притворяться человеком нечестно. Кейт не была человеком, и я не хотел, чтобы пациенты так думали. Поэтому мы убрали имя персонажа и перешли к использованию множественного «Мы», чтобы восприниматься как продолжение команды ухода, чем и являлся. Этот опыт показал, что автоматизированные решения могут ощущаться как подлинное продолжение человеческой заботы, не притворяясь человеком.
Перейдя к Spoken, мы сосредоточились на подлинном, человеко‑центричном выражении. Проблема, которую мы решаем, очевидна — большинство историй не могут достичь быстрорастущей аудитории слушателей в полном аудиоформате из‑за ограничений времени и стоимости, — но моя давняя философия быть подлинным продолжением людей сыграла большую роль. В отличие от ИИ‑подкастов, пытающихся имитировать беседу, или агентов, симулирующих сочувствие, многоголосое озвучивание Spoken оживляет истинные слова автора. Поскольку мы рассказываем истории, а не пытаемся воспроизводить человеческое взаимодействие, нет притворства, что наш ИИ — человек. Это персонажи в рассказе, поэтому нам удаётся избежать любой путаницы и конфликта.
Как писатель тяжёлой научной фантастики и ИИ‑предприниматель, как вы когда‑то ожидали развитие искусственного интеллекта и где реальность разработки ИИ наиболее резко отклонилась от вашего будущего видения?
Этот вопрос мне особенно дорог. Я люблю находиться на стыке искусства, науки и технологий, и изображать автоматизированные системы в своей ближайшей фантастике — отличный пример этого. На самом деле каждая будущая компания, о которой я пишу — а их несколько — имеет домен, которым я владел, продукт, который я спроектировал, и концепцию, которую, как я считаю, однажды может стать реальной компанией. Даже скульптура перед моим домом выполнена в виде современного логотипа The Kite Factory, компании, которой я представляю, что однажды создаст анти‑гравитационную технологию, трансформирующую планету!
Говоря об ИИ, меня беспокоит, что будущая фантастика не затрагивает, как люди получают, используют и делятся информацией. В 2100 году они действительно всё ещё будут пользоваться телефоном, чтобы задавать вопросы фактического характера? Моя философия в писательстве и в реальной жизни проста: всё, что можно автоматизировать, будет автоматизировано, и мы всегда будем стремиться к более реальному времени, более совместному и более физически интегрированному обмену информацией. При этом я должен добавить, что лично я против имплантов. Поэтому в предыстории моей книги, когда Илон Маск подключил свои спутники Starlink к имплантам Neuralink и начал передавать сообщения прямо в мозг людей, мы запретили мозговые импланты!
Что касается расхождений: поскольку я верю, что всё, что может быть автоматизировано, будет автоматизировано, автоматизация вопросов фактов происходит как простая неизбежность. Однако в вопросах сердца — искусства, музыки и историй — наблюдается некоторое расхождение. Поскольку ИИ обучается на уже существующих паттернах, по определению он никогда не сможет создать нечто по‑настоящему новое. Тем не менее люди пишут истории, создают искусство и сочиняют музыку с помощью ИИ. Как так может быть? Потому что искусство не обязано быть полностью новым или уникальным. Я считаю, что в будущем те творения, которые действительно ломают шаблоны, будут ещё более ценными. Надеюсь, мы всё ещё сможем распознать такие моменты.
Недавнее исследование Edison Research сравнивало многоголосое производство Spoken с профессионально записанной, одноголосой человеческой версией. Какую часть преимущества Spoken вы связываете с базовой ИИ‑технологией, а какую — с тем, что каждому персонажу дан отдельный голос? Как бы результаты изменились при полном человеческом касте?
Анализ истории и каждого персонажа для подбора их идеального голоса, по сути, является большой частью нашего ИИ. Мы проходим интенсивный агентный процесс, чтобы выявить базовые слои истории, от простых элементов, таких как жанр и язык, до ритма, задаваемого акцентами и стилем, а также сцены с взаимодействием множества персонажей. Все эти ИИ‑управляемые слои формируют реальное озвучивание персонажей. Мы называем это «Magic Mode», и это можно сравнить со смешиванием цветов краски.
Что касается того, как результаты могут отличаться от полного человеческого касте, всё сводится к стоимости и рабочему процессу. Один клик и несколько сотен долларов, в отличие от полного касте, недоступны независимым авторам и большинству издателей, поэтому это не было нашей точкой сравнения. Что касается качества, я считаю, что мы уже приближаемся к паритету с полным касте, так что качество будет неотличимо.
Spoken Multi-Cast получил более высокие оценки за сцены с диалогами персонажей, тогда как человеческое озвучивание лучше справилось с экспозицией. Что делает нелинейные отрывки особенно сложными для ИИ‑озвучивания и как вы работаете над сокращением этого разрыва?
На самом деле дело не в том, что нелинейные отрывки сложны для ИИ‑озвучивания; просто количество динамики, с которой ИИ должен работать, всё ещё меньше, чем у человеческого актёра. Подумайте о каждой нюансе интонации и подачи, которые один диктор может привнести в отрывок. При многоголосом же количестве динамики гораздо больше благодаря разнообразию, персонализированным тембрам голосов персонажей и процессу их смешивания, опять же, как смешивание красок. Это означает, что многоголосые сцены могут передать реализм взаимодействий между несколькими людьми так, как один диктор вряд ли сможет.
Что касается закрытия разрыва, количество динамики, используемой в одноголосом ИИ‑озвучивании, будет продолжать расти, и разрыв будет постепенно сокращаться.
До прослушивания образцов лишь 31 % участников выразили интерес к аудиокнигам с ИИ‑озвучкой, но после прослушивания Spoken Multi-Cast эта цифра выросла до 65 %. Какие элементы выступления, по вашему мнению, сыграли наибольшую роль в изменении их восприятия?
На самом деле всё было наоборот, и этот элемент дизайна опроса чрезвычайно важен. 65 % сказали, что они бы прослушали полностью аудиокнигу с этой озвучкой после прослушивания отрывков, до того как узнали, что это ИИ. Затем мы спросили более общо, готовы ли они слушать аудиокниги, озвученные ИИ, и лишь 31 % ответили «да». Далее мы спросили, думали ли они, что услышанное было ИИ. Только 39 % из тех, кто слышал Spoken Multi-Cast, подозревали, что это может быть ИИ, по сравнению с 35 % тех, кто слышал человеческую версию и думал, что она могла быть ИИ. Это заставило наш следующий вопрос всплыть: «Теперь, когда вы знаете это, готовы ли вы слушать аудиокнигу, озвученную ИИ?» Желание увеличилось до 43 % после воздействия, и мы активно оптимизируем процесс, чтобы достичь нашего целевого уровня в 65 %.
Можете ли вы описать агентный ИИ‑рабочий процесс, который преобразует загруженную рукопись в многоголосую аудиокнигу, включая то, как система определяет говорящих, интерпретирует персонажей, назначает голоса и определяет эмоцию, тайминг и подачу?
Учитывая наши ожидающие патенты на процесс, я просто опишу его на высоком уровне: это интенсивный агентный процесс, который доставляет несколько слоёв. Это процесс, которым мы занимались более двух лет. Основные элементы истории, её ритм, сцена‑кохезия и, наконец, точные голоса персонажей, или, как я их называю, «слой краски», — всё это часть процесса. Получение эмоциональной арки и тайминга критически важно, и мы работаем над этим больше всего. Людям часто удивительно, что ИИ, используемый для подготовки к озвучиванию, в пять раз превышает объём ИИ, используемого в самом озвучивании.
Сколько творческого контроля сохраняет автор над финальным продуктом и какие инструменты доступны, если ИИ неверно интерпретирует персонажа, произношение, эмоциональный бит или намерение повествования?
Автор имеет абсолютный контроль над финальным продуктом. Будь то эмоциональные интонации, акценты, тембр голоса или тайминг — всё под их управлением. Наша цель — достичь максимально изысканного результата одним кликом. Если автор, издатель или продюсер нуждаются в очень конкретной подаче отрывка, они могут воспользоваться функцией «Speak It», записав свой голос в микрофон и продемонстрировав желаемую подачу, и голос персонажа выполнит её безупречно.
Мы считаем, что авторы должны полностью владеть своей работой, вплоть до голоса, используемого в их открывающих и закрывающих титрах. Даже «Made with Spoken» будет использовать выбранный ими голос, включая их собственный, если они того захотят.
Spoken позволяет авторам использовать сгенерированные на заказ голоса, а также одобренные клоны голосов профессиональных дикторов, которые получают вознаграждение за их использование. Как в эту модель встроены согласие, собственность, компенсация, право отзыва и защита от несанкционированного клонирования?
Мы работаем только с партнёрами‑голосами, которые соблюдают строгий кодекс этики, включающий обнаружение и запрет несанкционированного использования голоса (особенно важно для защиты известных голосов знаменитостей). Например, в нашей библиотеке находятся многие топ‑голоса от ElevenLabs. Эти актёры получают оплату за каждое использование их голосов нашими авторами.
Считаете ли вы, что ИИ‑озвучивание в первую очередь расширит рынок аудиокниг, делая ранее неэкономичные названия жизнеспособными, или оно также заменит части традиционного производства? Какие роли останутся исключительно человеческими по мере созревания технологии?
Мы предвидим значительно расширенный рынок аудиокниг, который привлечёт новых читателей, особенно учитывая наши новые яркие многоголосые возможности. В конечном итоге расширенный рынок будет двигаться гибридом технологий и людей. Время покажет, но эта трансформация, скорее всего, будет касаться не того, кто именно озвучивает — человек или ИИ, а рабочего процесса контроля автора/продюсера и постоянно меняющихся привычек прослушивания аудитории.
Spoken объединяет производство аудиокниг с издательством, открытием, стримингом, сообществом и монетизацией. Как ИИ в конечном итоге может изменить само повествование, а не просто ускорить и удешевить существующий процесс производства аудиокниг?
Что значит для читателя или слушателя «потеряться в истории»? Именно об этом всё и говорит: предоставить аудитории захватывающий аудио‑опыт в эпоху, когда спрос на персонаж‑ориентированную фантастику растёт, а аудио становится доминирующим способом потребления историй. В итоге, будь то короткий рассказ, личные мемуары, фан‑фик или эпическое фэнтези, скорость и низкая стоимость создания яркой, естественной подачи окажут глубокое долгосрочное влияние. Текущий рынок аудиокниг — это краткосрочная возможность, но короткие форматы, вертикальные шорты, сериалы, фан‑фик и множество ответвлений будут процветать благодаря этому. И когда они разовьются, мы хотим, чтобы Spoken Multi-CastTM был в их центре.
Спасибо за замечательное интервью, читатели, желающие узнать больше, должны посетить Spoken.












