インタビュー
PolyAIの共同創設者兼CEO、Nikola Mrksic – インタビューシリーズ

Nikola Mrksicは、PolyAIの共同創設者兼CEOです。PolyAIは、自動化されたカスタマーサービス向けのエンタープライズレディなボイスアシスタントを提供する先駆的なサプライヤーです。
あなたがAIに最初に惹かれたのは何ですか?
私は幼い頃から数学とコンピューターサイエンスに興味を持っていました。ケンブリッジ大学での研究期间、スティーブ・ヤングやズービン・ガハラマニなどの有名なマシンラーニング研究者と一緒に働く機会がありました。スティーブは私に、彼のスタートアップであるVocalIQに参加し、スピーチダイアログシステムの開発に取り組むよう勧めました。その後、私はスティーブの下でPh.D.を取得し、さまざまなユースケースや言語に対応できるデータドリブンの言語理解モデルを開発する研究を行いました。会話AIは非常に難しい分野であり、まだ多くの科学的および技術的なブレークスルーが必要です。それ以来、私はこの分野に従事しています。
2017年に、あなたは会話AI会社であるPolyAIを立ち上げました。PolyAIの創設ストーリーについてお話しください。
私の共同創設者であるショーン・ウェン、エディ・スーと私は、ケンブリッジ大学でPh.D.を取得しました。私たちはダイアログシステムに取り組んでいましたが、当時の私たちが開発していたような高度なシステムは、商業的な応用が非常に限られていたことを実感しました。そこで、私たちは現実世界で役立つ会話AIソリューションを開発するために協力し始めました。私たちは、真正に会話的な、マルチターン、トランザクション的なダイアログシステムを開発する機会を見出しました。これらのシステムは、日常生活で実際のユーザーと対話できるようになります。
私たちはカスタマーサービスに焦点を当てました。なぜなら、当時の技術的能力と顧客の要件が一致していたからです。
使用されている機械学習と自然言語処理技術についてお話しください。
私たちの主な特徴は、独自のエンコーダーモデルです。これらのモデルは、数十億の自然な会話で事前トレーニングされており、スラングやイディオムを使用した場合でも意図を抽出できます。これは、電話でのコミュニケーションにおいて非常に重要です。顧客はキーワードで話すのではなく、ストーリーを話し、質問をして、会話を制御しようとします。
私たちは最近、ConVExモデルを発表しました。これは、データ効率の高いエンティティ抽出モデルで、会話から値を正確に抽出できます。
私たちのASRオーケストレーションプロセスでは、スピーチ認識プラットフォームをファインチューニングして、さまざまなアクセントやコンテキストによるノイズを中和します。
私たちはまた、事前設計されたユースケースを備えたダイアログポリシーライブラリを開発しました。これにより、一般的なカスタマーサービストランザクションを迅速に実行できます。
あなたの意見では、良い会話AI製品と悪い会話AI製品を区別するのは何ですか?
良い製品は、ユーザーの意図を一貫して理解し、ユーザーに繰り返しを求めません。電話はしばしば騒々しい環境で行われるため、製品は入力の雑さに耐性を持たなければなりません。ブランドが大きな市場にリーチするにつれて、製品はさまざまなアクセントや意図の表現方法を理解できなければなりません。これらは、スピーチ認識能力、意図分類、エンティティ抽出の強固さを必要とします。
優れた製品は、ユーザーにとって積極的に関与するものです。ユーザーの思考の流れに従い、複雑な日常的なケースを処理でき、ユーザーが複数の意図や情報を同時に共有する場合に、コンテキストを管理できます。これには、ロバストなマルチラベル分類とコンテキスト管理が必要です。
魅力的な製品は、人間的な特徴を持ちながら、不気味またはロボットのようなものではありません。つまり、スナップ的なインタラクション、真正のボイス、継続的なフィードバックシグナル、ランダム性、不完全性が必要です。
最後に、優れた会話AI製品は、ユーザーがどこにいても、シームレスでプラットフォーム固有のエクスペリエンスを提供します。これは、ボイス、SMS、チャット、またはソーシャルメッセージングプラットフォームを横断します。インタラクションのパラダイムは、各コミュニケーションプラットフォームの特性を取り入れる必要があります。
企業が会話AIを使用する利点についてお話しください。
カスタマーエクスペリエンスは重要であり、リテンションの重要な要因となっています。顧客が必要なことを簡単にできるようにすることが第一の優先事項です。
電話は、顧客が会社に連絡する際の最も好まれるチャネルです。すべてのカスタマーサービスインタラクションの約65%はまだ電話で行われています。COVID-19のパンデミック期間中、コンタクトセンターは前代未聞の顧客のサポート要求に直面しました。
もちろん、優れたエクスペリエンスは、顧客が好みに応じてコミュニケーションできるようにします。非同期コミュニケーションを好むユーザーにとって、ブランドがテキストチャネルで同じレベルのエクスペリエンスを提供することを容易にします。
顧客が何を伝えようとしているのかを検出することはどのくらいの挑戦ですか?
ボイスチャネルで顧客を理解するには、いくつかの課題があります。ユーザーの意味を正確に理解するには、複数のコンポーネントがうまく機能している必要があります。
まず、スピーチ認識は難しいです。特に、ユーザーが騒々しい環境から電話をかけたり、トンネルの中を運転している場合などです。アクセントや方言が異なる地域でのスピーチ認識も難しいです。私たちは、コンテキストに応じてスピーチ認識モデルをバイアスするための効果的な方法を開発しました。
私たちのConveRTモデルは、膨大な量の会話データで事前トレーニングされているため、弱い信号からでも意図を検出できます。つまり、人間のように、言葉を1、2つ聞き逃しても、会話の内容を理解できます。
別の考慮事項は、ユーザーが複数のアクションを同時に実行したい場合です。たとえば、「私は私のカードを失いました。使用されたかどうか教えてください、それをブロックしてください。」この場合、モデルは2つの意図を認識し、論理的な順序でそれらに応じる必要があります。
モデルは、顧客が提供するエンティティを抽出して理解することも必要です。たとえば、「土曜日のランチに、妻と2人の子供と一緒にテーブルを用意できますか?」この場合、表面的な意図はテーブルの可用性を確認することですが、モデルは日付(土曜日)と人数(4人)などの情報を抽出する必要があります。
最後に、会話は常に線形ではありません。顧客は、ボイスアシスタントのプロンプトとは無関係な質問で割り込むことがあります。したがって、アシスタントは、特定の入力に「耳を傾ける」必要がありながらも、FAQやユーザーが以前提供した情報の変更などの異なるトリガーに開かれたままである必要があります。
PolyAIで会話AIボットを立ち上げるために必要なプロセスとタイムラインについてお話しください。
私たちは、顧客エクスペリエンスに有形のビジネスインパクトをもたらすボイスアシスタントを提供するためにここにいます。したがって、すべてのエンゲージメントは、顧客がCXの目標、重要なメトリック、サポートプロセスを特定して明文化するためのディスカバリーより始めます。これは、ボイスアシスタントが顧客を導く必要があるジャーニーのスコープを定義する場所です。これと私たちの事前トレーニング済みのConveRTモデルにより、顧客から膨大な量の会話データを必要としません。
そこから、ボイスアシスタントを開発できます。これには、クライアント側のITチームの入力がほとんど必要ありません。
複雑さに応じて、2週間ほどで価値証明を実現し、2ヶ月ほどで本格的なデプロイを実現できます。
素晴らしいインタビュー、ありがとうございました。詳しく知りたい読者は、PolyAIを訪問してください。












