Інтерв’ю

Філ Маршалл, засновник і генеральний директор Spoken – серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Phil Marshall, засновник і генеральний директор Spoken, є лікарем, винахідником, технологічним підприємцем та письменником наукової фантастики, чия кар’єра охоплює охорону здоров’я, цифрові медіа, штучний інтелект та інновації у продуктах. До запуску Spoken у 2024 році Маршалл співавтворив Conversa Health, компанію з персоналізованого залучення пацієнтів та розмовного ШІ, яку у 2021 році придбала Amwell і яка стала частиною її автоматизованого віртуального догляду. Раніше у своїй кар’єрі він понад десять років працював у WebMD на посаді віце‑президента зі стратегії продукту, потім був старшим віце‑президентом з управління продуктами у Press Ganey Associates і заснував стартап з колаборативних відео‑технологій JumperCut. Його робота все більше зосереджена на перетині ШІ, розповіді історій, інтерфейсах мозок‑комп’ютер та технологіях знань, поєднуючи його досвід як технолога та підприємця з інтересами у науковій фантастиці та нових формах цифрової взаємодії.

Spoken — це платформа для аудіокниг, що працює на базі ШІ, створена для допомоги авторам, видавцям та правовласникам перетворювати рукописи у професійно виготовлений аудіо без потреби у традиційній звукозаписній студії. Її технологія аналізує мову, стиль, наративну структуру та персонажів рукопису, після чого призначає окремі голоси для озвучення та діалогів, підтримуючи продукти з одним, двома або багатьма голосами. Автори можуть користуватися кастомно згенерованими голосами, обирати серед понад 100 платних професійних акторів озвучення або клонувати власний голос, зберігаючи при цьому права власності на свою роботу, майстер‑копії та розповсюдження. Spoken також пропонує інтерфейс програмування застосунків (API), орієнтований на видавців, які прагнуть створювати аудіокниги для великих каталогів, наголошуючи на етичній моделі ШІ, згідно з якою написані твори не використовуються для навчання її систем, а залучені людські актори озвучення отримують винагороду.

Ваша кар’єра привела вас від медицини та стратегії продукту у WebMD до заснування Conversa Health і тепер Spoken. Яка проблема у створенні аудіокниг переконала вас заснувати Spoken, і як ваша попередня робота в галузі розмовного ШІ вплинула на платформу, яку ви створюєте сьогодні?

З Conversa наша місія полягала в розширенні голосу команди догляду шляхом автоматизації персоналізованих звернень, уточнюючих питань та рекомендацій, які клінічний підрозділ великої медичної системи надавав би пацієнтам по телефону, якби мав час. Спочатку ми наділяли бота персонажем, Каті, який говорив у першій особі. Згодом я зрозумів, що вдавання людяності є нещирим. Каті не була людиною, і я не хотів, щоб пацієнти так думали. Тому ми прибрали ім’я персонажа і перейшли до множини «Ми», щоб його сприймали як продовження команди догляду, яким воно й було. Цей досвід навчив мене, що автоматизовані рішення можуть залишатися справжнім продовженням людської турботи, не вдаючись до імітації людини.

Перейшовши до Spoken, ми зосереджуємось на автентичному, орієнтованому на людину вираженні. Проблема, яку ми допомагаємо вирішити, очевидна — більшість історій не можуть досягти найшвидше зростаючої аудиторії (слухачів) у повному аудіо‑потенціалі через обмеження часу та вартості, — проте моя довготривала філософія бути справжнім продовженням людей зіграла важливу роль. На відміну від AI‑подкастів, які намагаються створювати балачку, або агентів, що імітують співчуття, багатоголосе озвучення Multi‑Cast від Spoken оживляє справжні слова автора. Оскільки ми розповідаємо історії, а не намагаємося відтворювати людські взаємодії, немає претензій, що наш ШІ — це людина. Це персонажі в історії, тому нам вдається уникнути будь‑якої плутанини та конфлікту.

Будучи одночасно письменником жорсткої наукової фантастики та підприємцем у сфері ШІ, як ви колись уявляли еволюцію штучного інтелекту і де реальність розвитку ШІ різко відрізняється від вашого уявного майбутнього?

Це питання мені дуже близьке. Я люблю жити на перетині мистецтва, науки та технологій, і зображення автоматизованих систем у моїй майбутній науковій фантастиці — чудовий приклад цього. Насправді, кожна майбутня компанія, про яку я пишу — і їх декілька — має домен, яким я володію, продукт, який я розробив, і концепцію, яку я вважаю потенційно реальною компанією. Навіть скульптура перед моїм будинком змодельована за модерністською формою логотипу The Kite Factory, компанії, яку я уявляю, що колись створить технологію анти‑гравітації, що трансформує планету!

Зосереджуючись на ШІ, я маю проблему, коли майбутня наукова фантастика не розглядає, як люди отримують, використовують і діляться інформацією. У 2100 році чи вони дійсно все ще користуються телефоном, щоб дзвонити людям з питаннями фактів? Моя філософія у писанні і в реальному житті проста: те, що можна автоматизувати, буде автоматизовано, і ми завжди будемо рухатися до більш реального часу, більш колаборативної та більш фізично інтегрованої інформації. Однак мушу додати, що я особисто проти імплантів. Ось чому у бекграунді моєї книги, коли Ілон Маск підключив свої супутники Starlink до імплантів Neuralink і почав транслювати повідомлення безпосередньо в мозок людей, ми заборонили мозкові імпланти!

Відповідь на питання про розбіжність: оскільки я вірю, що те, що можна автоматизувати, буде автоматизовано, автоматизація питань фактів відбувається як проста неминучість. Однак у питаннях серця — мистецтво, музика та історії — спостерігається певна розбіжність. Оскільки ШІ навчається на існуючих патернах, за визначенням, він ніколи не зможе створити щось дійсно нове. Проте люди пишуть історії, створюють мистецтво та композують музику за допомогою ШІ. Як це можливо? Тому що мистецтво не обов’язково має бути абсолютно новим чи унікальним. Я вважаю, що в майбутньому ті творіння, які порушують шаблон, будуть ще ціннішими. Сподіваюся, ми все ще зможемо розпізнати, коли це станеться.

Нещодавнє дослідження Edison Research порівняло багатоголосе виробництво Spoken з професійно створеною, одно‑голосою людською версією. Яку частину переваги Spoken ви приписуєте базовій технології ШІ, а яку — наданню кожному персонажу окремого голосу? Як можуть відрізнятися результати у порівнянні з повним людським кастом?

Аналіз історії та кожного персонажа з метою визначення їх ідеального голосу, фактично, є великою частиною нашого ШІ. Ми проходимо інтенсивний агентний процес, щоб визначити підґрунтові шари історії, від базових елементів, таких як жанр і мова, до ритму, визначеного акцентами та стилем, а також до сценної цілісності взаємодії кількох персонажів. Усі ці ШІ‑керовані шари формують фактичне озвучення голосу персонажа. Це те, що ми називаємо «Magic Mode», і це схоже на змішування кольорів фарби.

Щодо того, як результати можуть відрізнятись від повного людського касту, це в основному питання вартості та робочого процесу. Один клік і кілька сотень доларів, у порівнянні з повним кастом, недоступні інді‑авторам і більшості видавців, тому це не було нашою точкою порівняння. Щодо якості, я вважаю, що ми вже наближаємось до паритету з повним кастом, тому якість буде незрізненною.

Spoken Multi‑Cast отримав вищі оцінки за сцени, орієнтовані на персонажів, тоді як людське озвучення показало кращі результати під час викладу. Що робить неперемовні уривки особливо складними для ШІ‑озвучення і як ви працюєте над усуненням цього розриву?

Насправді, це не те, що неперемовні уривки важкі для ШІ‑озвучення; просто кількість динаміки, яку ШІ має обробляти, все ще менша, ніж у людського актора озвучення. Уявіть усі нюанси інтонації та подачі, які один диктор може внести в уривок. У багатоголосому варіанті кількість динаміки значно більша завдяки різноманітним, персоналізованим тембрам голосів персонажів і процесу їх змішування, знову ж, як фарби. Це означає, що сцени multi‑cast можуть передати реалістичність взаємодії між кількома людьми так, як одному диктору важко досягти.

Щодо усунення розриву, кількість динаміки, що використовується в ШІ‑озвученні з одним диктором, буде продовжувати зростати, і розрив буде поступово зменшуватись.

Перед прослуховуванням зразків лише 31 % учасників виявили інтерес до аудіокниг, озвучених ШІ, але цей показник зріс до 65 % після того, як вони випробували Spoken Multi‑Cast. Які елементи виконання, на вашу думку, найбільше вплинули на зміну їхнього сприйняття?

Насправді, все було навпаки, і цей елемент дизайну опитування надзвичайно важливий. 65 % сказали, що прослухають цілу аудіокнигу з таким озвученням після прослуховування уривків, до того, як дізналися, що це ШІ. Потім ми запитали більш загально, чи готові вони слухати аудіокниги, озвучені ШІ, і лише 31 % відповіли «так». Далі ми запитали, чи вважають вони, що почуте було ШІ. Лише 39 % тих, хто почув Spoken Multi‑Cast, підозрювали, що це може бути ШІ, у порівнянні з 35 % тих, хто почув людські версії і думав, що їх теж могло бути ШІ. Це спонукало наше наступне питання: «Тепер, коли ви це знаєте, чи готові ви слухати аудіокнигу, озвучену ШІ?» Після цього готовність підскочила до 43 % після впливу, і ми активно оптимізуємо, щоб наблизитися до нашого орієнтира у 65 %.

Чи можете ви розповісти про агентний робочий процес ШІ, який перетворює завантажений рукопис у багатоголосу аудіокнигу, включаючи те, як система ідентифікує спікерів, інтерпретує персонажів, призначає голоси та визначає емоції, таймінг і подачу?

З огляду на наші патентні заявки на цей процес, я коротко підсумую на високому рівні, сказавши, що це інтенсивний агентний процес, який створює кілька шарів. Це процес, який ми вдосконалювали понад два роки. Основи історії, її ритм, сцена‑кохезія та, нарешті, точні голоси персонажів, або, як я їх називаю, «фарбова покриття», — усе це частина процесу. Формування арки емоційної подачі та таймінгу є критичним, і ми працюємо над цим більше за все. Людей часто дивує, що ШІ, який використовується для підготовки до озвучення, приблизно в 5 разів більше, ніж ШІ, що використовується у самому озвученні.

Скільки творчого контролю зберігає автор над кінцевим продуктом і які інструменти доступні, коли ШІ неправильно інтерпретує персонажа, вимову, емоційну нотку або намір нарації?

Автор має абсолютний контроль над кінцевим продуктом. Будь‑то емоційні інфлексії, акценти, тембр голосу чи таймінг — все це під його контролем. Наша мета — досягти максимальної досконалості одним кліком. Якщо автор, видавець або продюсер потребує дуже конкретної подачі уривка, вони можуть скористатися функцією «Speak It», заговорити у мікрофон і продемонструвати, як саме це має звучати, і голос персонажа виконає це чудово.

Ми вважаємо, що автори мають відчувати повне право власності на свою роботу, включно з голосом, який використовується у їхніх вступних та заключних титрах. Навіть «Made with Spoken» буде використовувати обраний ними голос, включно з їхнім особистим голосом, якщо вони того захочуть.

Spoken дозволяє авторам використовувати кастомно згенеровані голоси, а також схвалені клоновані голоси професійних дикторів, які отримують винагороду, коли їхні голоси використовуються. Як у цю модель вбудовано згоду, власність, компенсацію, права відкликання та захист від несанкціонованого клонування?

Ми працюємо лише з партнерами‑голосами, які дотримуються суворого етичного кодексу, що включає виявлення та заборону несанкціонованого використання голосу (особливо важливо для захисту відомих голосів знаменитостей). Наприклад, у нашій бібліотеці є багато провідних голосів від ElevenLabs. Ці актори озвучення отримують оплату за кожне використання їхніх голосів нашими авторами.

Чи вважаєте ви, що ШІ‑озвучення головним чином розширить ринок аудіокниг, роблячи раніше економічно невигідні назви життєздатними, чи воно також замінить частини традиційного виробництва? Які ролі залишаться суто людськими, коли технологія зрілить?

Ми передбачаємо значно розширений ринок аудіокниг, який залучить нових читачів, особливо завдяки нашим новим, яскравим багатоголосим можливостям. Зрештою, цей розширений ринок буде керуватись гібридом технологій та людей. Час покаже, але ця трансформація може бути менш про те, чи це людський голосовий талант чи ШІ, а більше про робочий процес контролю автора/продюсера та постійно змінювані слухацькі звички аудиторії.

Spoken поєднує виробництво аудіокниг з видавництвом, пошуком, стрімінгом, спільнотою та монетизацією. Як ШІ в кінцевому підсумку може змінити саме розповідання історій, а не лише зробити існуючий процес виробництва аудіокниг швидшим і дешевшим?

Що означає для читача або слухача «загубитися в історії»? Ось про що йдеться по‑справжньому: надати аудиторії занурювальний аудіо‑досвід у час, коли попит на персонажно‑орієнтовану художню літературу зростає, а аудіо стає домінуючою формою споживання історій. Зрештою, будь‑то коротка історія, особиста мемуар, фан‑фік чи епічне фентезі, швидкість і низька вартість створення яскравої, природної подачі матимуть глибокі довгострокові наслідки. Поточний ринок аудіокниг — це короткострокова можливість, проте короткі формати, вертикальні короткі відео, серіали, фан‑фіки та безліч інших відгалужень процвітатимуть у результаті. І коли це станеться, ми хочемо, щоб Spoken Multi‑CastTM була в їхньому центрі.

Дякуємо за чудове інтерв’ю, читачі, які бажають дізнатися більше, повинні відвідати Spoken

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.