インタビュー

Phil Marshall、Spoken創業者兼CEO – インタビューシリーズ

mm
Unite.AI を Google の優先ソースに追加

Phil MarshallはSpokenの創業者兼CEOで、医師、発明家、テクノロジー起業家、そしてSF作家でもあり、ヘルスケア、デジタルメディア、人工知能、製品イノベーションと幅広い分野でキャリアを築いてきました。2024年にSpokenを立ち上げる前は、MarshallはConversa Healthを共同設立しました。この会社はパーソナライズド患者エンゲージメントと会話型AIを提供し、2021年にAmwellに買収され、自動化されたバーチャルケア事業の一部となりました。キャリア初期にはWebMDで10年以上にわたり製品戦略担当副社長を務め、後にPress Ganey Associatesで製品管理上級副社長を歴任し、協働型ビデオ技術スタートアップJumperCutを創業しました。彼の仕事はAI、ストーリーテリング、脳―コンピュータ・インターフェース、知識技術の交差点にますます焦点を当てており、テクノロジスト兼起業家としての背景と、SFや新興デジタルインタラクションへの関心を融合させています。

SpokenはAI搭載のオーディオブックプラットフォームで、著者、出版社、権利者が従来の録音スタジオに依存せずに原稿をプロフェッショナルな音声に変換できるよう設計されています。その技術は原稿の言語、文体、物語構造、登場人物を解析し、ナレーションと対話用に異なる声を割り当て、シングルナレーター、デュアルナレーター、マルチキャストの制作をサポートします。著者はカスタム生成音声を使用したり、100人以上の有料プロの声優から選択したり、自己の声をクローンしたりできますが、作品、マスター、配信権はすべて著者が保持します。Spokenはまた、より大規模なカタログでオーディオブックを制作したい出版社向けにアプリケーションプログラミングインターフェース(API)も提供し、書かれた作品をシステムの学習に使用せず、参加する人間の声優に報酬を支払うという倫理的AIモデルを強調しています。

あなたのキャリアは医療とWebMDでの製品戦略からConversa Healthの創業、そして現在のSpokenへと進んできました。オーディオブック制作においてどのような課題がSpoken設立の決め手となり、会話型AIでの過去の経験は現在構築中のプラットフォームにどのように影響していますか?

Conversaでは、私たちのミッションは、パーソナライズされたアウトリーチ、フォローアップ質問、ガイダンスを自動化することで、巨大医療システムの臨床部門が電話で患者に直接提供するようなケアチームの声を拡張することでした。当初はボットに「Cate」という人格を与え、一人称で話させました。しかし最終的に、人間らしさを装うことは不誠実だと判断しました。Cateは人間ではなく、患者にそう思わせたくありませんでした。そこで人格名を削除し、複数形の「We」に変更して、ケアチームの延長として認識されるようにしました。この経験から、自動化ソリューションでも人間のケアの本質的な拡張として感じられ、人間になりすます必要はないことを学びました。

Spokenに話を戻すと、私たちは本物の人間中心の表現に注力しています。私たちが解決しようとしている問題は明白です――多くのストーリーは時間とコストの制約により、完全な音声ポテンシャルを持ったまま、最も成長の速いリスナー層に届いていません――しかし、人間の真の延長であるという私の長年の哲学が大きく影響しています。AIポッドキャストが軽口を作り出したり、共感をシミュレートするエージェントを提供したりするのとは異なり、Spokenのマルチキャストナレーションは著者の真の言葉を生き生きと表現します。私たちは物語を語ることに専念しており、人間のやり取りを再現しようとするのではないため、AIが人間であるかのような見せかけはありません。これらは物語の中のキャラクターであり、混乱や対立を避けることができて幸運です。

ハードSF作家でありAI起業家でもあるあなたは、かつて人工知能がどのように進化すると予想していましたか?そして、実際のAIの発展はあなたが想像した未来と最も大きくどこで食い違っていますか?

この質問は私にとってとても身近です。私は芸術、科学、技術の交差点で生きることが好きで、近未来SFで自動化システムを描くのはその好例です。実際、私が執筆するすべての未来企業—いくつかありますが—は、私が所有していた領域、私が設計した製品、そして将来実在する可能性があると信じるコンセプトに基づいています。家の前にある彫刻さえも、私がいつか反重力技術を開発し地球を変えると想像するThe Kite Factoryのロゴのモダニスト形状をモデルにしています!

AIに焦点を当てると、未来SFが人々が情報を取得・利用・共有する方法に触れないことに問題を感じます。2100年に、事実に関する質問に答えるためにまだ電話を使って人に電話をかけているでしょうか?私の執筆と実生活における哲学はシンプルです――自動化できるものは自動化され、常にリアルタイムで、より協調的で、物理的に統合された情報へと向かうでしょう。ただし、個人的にインプラントには抵抗があります。これが、私の本の背景ストーリーで、Elon MuskがStarlink衛星をNeuralinkインプラントに接続し、直接脳にメッセージを放送し始めたときに、私たちが脳インプラントを禁止した理由です!

分岐の質問に対して――自動化できるものは自動化されると信じているため、事実に関する質問の自動化は単なる必然です。しかし、心の領域――芸術、音楽、物語――に関しては多少の分岐があります。AIは既存のパターンで学習しているため、定義上決して真に新しいものを創造できません。それでも人々はAIを使って物語を書き、芸術を創り、音楽を作曲しています。なぜでしょうか?芸術は必ずしも真に新規である必要はないからです。私は、将来的に型破りな作品ほどさらに貴重になると考えています。そのような瞬間を私たちが認識できることを願っています。

最近のEdison Researchの調査では、Spokenのマルチキャスト制作と、プロが制作した単一ナレーターの人間版を比較しました。Spokenの優位性は基盤となるAI技術にどれだけ起因し、各キャラクターに個別の声を与えることがどれだけ寄与していますか?フルヒューマンキャストと比較した場合、結果はどのように異なると考えますか?

物語とすべてのキャラクターを分析し、最適な声を導き出すことは、実際に私たちのAIの大きな要素です。ジャンルや言語といった基本的要素から、アクセントやスタイルが決めるリズム、複数キャラクターの相互作用によるシーンの統合まで、ストーリーの基礎層を抽出する集中的なエージェントプロセスを経ます。これらすべてのAI駆動層が実際のキャラクターボイスナレーションに反映されます。これを「マジックモード」と呼び、絵の具の色を混ぜ合わせるようなイメージです。

フルヒューマンキャストと結果がどのように異なるかという点では、実際にはコストとワークフローの問題です。ワンクリックで数百ドルという価格は、フルキャストに比べてインディーズ著者や多くの出版社にとって手が届かないため、比較対象にはしていませんでした。品質に関しては、すでにフルキャストと同等に近づいていると考えており、区別がつかないレベルです。

Spoken Multi-Castはキャラクター主導のシーンで高評価を受けましたが、説明部分では人間ナレーションの方が優れていました。対話以外のパッセージがAIナレーションにとって特に難しい理由は何ですか?また、そのギャップを埋めるためにどのように取り組んでいますか?

実際のところ、非対話パッセージがAIナレーションにとって難しいわけではなく、AIが扱えるダイナミクスの数が人間の声優が扱える数より少ないだけです。単一ナレーターが一つのパッセージに持ち込める抑揚や表現の微細さを考えてみてください。マルチキャストでは、キャラクターごとの個別の音色とそれらを混ぜ合わせるプロセスにより、ダイナミクスの数ははるかに増えます。まさに絵の具の色を混ぜ合わせるようなものです。その結果、マルチキャストシーンは複数人物間の相互作用のリアリティを、単一ナレーターでは実現が難しい形で前面に出すことができます。

ギャップを埋めるために、単一ナレーターAIナレーションで使用されるダイナミクスの数は今後も増加し、差は縮小し続けるでしょう。

サンプルを聞く前は、AIナレーションのオーディオブックに興味を示した参加者は31%でしたが、Spoken Multi-Castを体験した後は65%に上昇しました。どの要素が彼らの認識を変える上で最も大きく寄与したと考えますか?

実際には逆で、調査の設計要素が非常に重要です。65%は抜粋を聞いた後、このナレーションで全体のオーディオブックを聴きたいと答え、AIであることを知らずにでした。その後、一般的にAIでナレーションされたオーディオブックを聴く意向があるかを尋ねたところ、31%が「はい」と答えました。次に、聞いたものがAIかどうかを尋ねたところ、Spoken Multi-CastがAIかもしれないと疑った人は39%で、ヒューマンバージョンを聞いた人の35%が同様にAIかもしれないと考えました。これにより次の質問が浮かびました:この事実をご存知の上で、AIでナレーションされたオーディオブックを聴く意向はありますか? その意向は露出後に43%に上昇し、我々は65%というベンチマークに近づくべくギャップ縮小に積極的に取り組んでいます。

アップロードされた原稿をマルチボイスのオーディオブックに変換するエージェントAIワークフローを教えてください。システムが話者を特定し、キャラクターを解釈し、声を割り当て、感情・タイミング・表現を決定するプロセスはどのようになっていますか?

このプロセスは特許出願中のため、概要としては非常にエージェント的なプロセスで複数の層を生成することとだけ述べます。2年以上かけて磨き上げたプロセスです。物語の基礎、リズム、シーンの統合、そして最終的に正確なキャラクターボイス(私が「塗装のコート」と呼ぶ)すべてが含まれます。感情的な表現とタイミングのアークを把握することが重要で、これに最も注力しています。ナレーションの準備に使用されるAIは、実際のナレーションに使用されるAIの約5倍の量になることがしばしば驚きです。

著者は最終制作に対してどれだけのクリエイティブコントロールを保持していますか?また、AIがキャラクターや発音、感情のビート、物語の意図を誤解した場合に利用できるツールは何ですか?

著者は最終制作に対して絶対的なコントロール権を持っています。感情の抑揚、アクセント、声の音色、タイミングなど、すべてを自由に調整できます。私たちの目標は、ワンクリックでできるだけ洗練された結果を提供することです。著者、出版社、プロデューサーが特定のパッセージの配信を細かく指定したい場合は、「Speak It」機能を使ってマイクに話しかけ、希望する配信方法を示すことができ、キャラクターボイスは美しく従います。

私たちは、著者が作品の全て、オープニングやエンディングクレジットに使用される声に至るまで、完全な所有権を感じるべきだと考えています。「Made with Spoken」さえも、著者が選択すれば自分自身の声や希望する声を使用します。

Spokenは、著者がカスタム生成音声や、使用時に報酬が支払われるプロのナレーターからの承認済みボイスクローンを利用できるようにしています。このモデルでは、同意、所有権、報酬、権利の撤回、そして無断クローンからの保護はどのように組み込まれていますか?

私たちは、厳格な倫理規定を遵守するボイスパートナーのみを使用しています。この規定には、無断での声の使用を検出・禁止することが含まれます(特に有名人の声を保護することが重要です)。例えば、ElevenLabsのトップ声優を多数ライブラリに保有しており、これらの声優は著者が使用するたびに報酬が支払われます。

AIナレーションは、以前は経済的に成立しなかったタイトルを可能にすることでオーディオブック市場を主に拡大すると考えますか?それとも従来の制作の一部を置き換えるでしょうか?技術が成熟する中で、どの役割が明確に人間のままで残りますか?

私たちは、特に新しい鮮やかなマルチキャスト機能により、新たな読者層を呼び込むことで、オーディオブック市場が大幅に拡大すると考えています。最終的には、テクノロジーと人間のハイブリッドが市場を牽引するでしょう。時間が経てば明らかになるでしょうが、この変革は人間の声の才能かAIかという問題よりも、著者・プロデューサーのコントロールと、聴衆の変化し続けるリスニング習慣に関するワークフローの問題になると考えています。

Spokenはオーディオブック制作に加えて、出版、発見、ストリーミング、コミュニティ、収益化を統合しています。AIは単に既存のオーディオブック制作プロセスを高速化・低コスト化するだけでなく、ストーリーテリング自体を最終的にどのように変える可能性がありますか?

読者やリスナーが「物語に没入する」とはどういうことか?それこそが本質です――キャラクター中心のフィクションへの需要が高まる中、没入型の音声体験を提供することです。最終的に、短編、小説、個人回想録、ファンフィクション、壮大なファンタジーのいずれであっても、鮮やかで自然な配信を高速かつ低コストで作成できることは、長期的に深い影響を与えるでしょう。現在のオーディオブック市場は短期的な機会ですが、ショートフォームや縦型ショート、連載、ファンフィクなどの派生形が結果として繁栄し、私たちはSpoken Multi-CastTMがその中心になることを望んでいます。

素晴らしいインタビューをありがとうございました。詳しく知りたい読者はSpokenをご覧ください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。