インタビュー
ジェームズ・カプラン、MeetKaiメタバースのCEO兼共同創設者 – インタビューシリーズ

ジェームズ・カプランは、ロサンゼルス、カリフォルニアに拠点を置くMeetKaiのCEO兼共同創設者です。MeetKaiは、人工知能、VR、会話検索会社であり、現在、AIスピーチレースで前例のない機能でリードしています。会話AIは、より複雑なスピーチを理解し、自然な会話で多くのテーマについて個別の結果を提供できます。MeetKaiの技術は、iOS、Google Play、AppGalleryを通じて世界中に展開されています。
あなたは6歳のときからAIに情熱を持ちました。どうやってこの技術に最初に触れたのですか?
私のAIへの紹介は、ビデオゲームからでした。最初は、ゲーム「オレゴン・トレイル」のAIがどのように機能するかを理解しようとしていました。まだ十分な知能ではありませんでしたが、AIの一種でした。次に、MMORPGに興味を持つようになりました。オンラインゲームを楽しみましたが、アイテムを集めることは嫌でした。そこで、ボットを作成することにしました。
あなたが最初にコード化したAIアプリケーションは何でしたか?
MMO用のボットを作成することが、AI開発における最初の挑戦でした。初期のボットは非常にシンプルで、AIというよりはマクロに近いものでした。しかし、ゲーム内のボット検出が進化するにつれて、ボットはよりプレイヤーに近いものになる必要がありました。ボットを作成することは楽しかったです。学校に通っていたとき、テイラー・スウィフトのコンテストに勝つためにボットを作成しました(そして彼女は実際にパフォーマンスのために来ました!)。また、最初のポケモンゴーボットも作成しましたが、検出を避けることに興味を失ったときに、多くの人をバンにしました。
2018年にMeetKaiを立ち上げたのは、現在のAIボイスアシスタントに不満を持っていたからです。ほとんどのAIアシスタントは、不十分な体験を提供するのはなぜですか?
問題の核心は、ほとんどのAIアシスタントが外部APIに依存しすぎていることです。たとえAlexaのようなeコマース検索の場合でも、同じ問題に直面しています。単純に言えば、ボイスアシスタントが賢いと期待するのは、スピーチをテキストに変換し、テキストベースの検索エンジンにテキストを入力するだけの場合、どのようにして賢いボイスアシスタントになることができますか?MeetKaiを立ち上げたのは、ボイスアシスタントのエンドツーエンドの処理パイプラインを制御することで、「飛躍的な」AIアシスタントを提供できることを信じていたからです。会話検索エンジンを開発し、より複雑なクエリと会話をサポートしました。他のアシスタントは、多ターン会話のサポートを提供することができません。私たちの目標は、まだまだ初期段階にあり、技術をスケールアップして既存のプレイヤーと同等のドメイン数をサポートするために努力しています。
次世代のボイスアシスタント体験を構築する際の自然言語理解と自然言語処理の課題について説明してください。
次世代のNLUの1つの主要な課題は、意図とエンティティを超えて進むことです。ほとんどのNLUは、言語理解に対する非常に伝統的なアプローチを採用しています。各入力発話は、意図に分類され、トークンはエンティティにラベル付けされます。標準アプローチの問題を数十個列挙できますが、最も重要なものは次のとおりです。
- コンテキストのない意図分類は、多ターン会話を処理することができません。ほとんどのアプローチは、トランスクリプトされた生テキストだけに注目しています。コンテキスト、ユーザーのプロファイル、ユーザーの好みなどは考慮しません。特に、ユーザーが簡潔な質問をした場合に重要です。たとえば、誰かが「コスモポリタン」と言った場合、それはドリンクか雑誌のどちらかを意味する可能性があり、ユーザーによって大きく異なります。
- エンティティ認識モデルは、カテゴリ値以外のものを認識することができません。大規模言語モデルは、データセットにない新しいエンティティに迅速に適応することができません。AIは、コンテキストを考慮することでエンティティを認識するためのより洗練された方法を必要とします。たとえば、ユーザーのロケーションは、レストラン名か他のものかを判断する上で大きな影響を与えるはずです。
- エンティティ関係はよく考慮されていません。私の好きな例は、ほとんどの検索エンジンが否定を処理するときに失敗することです。他のボイスアシスタントで「ロマンスのない映画」を検索してみてください。
現在、ほとんどのボイスアシスタントは声からテキストに変換し、Google検索を実行します。MeetKai AIはどのようにしてこれと異なるように動作しますか?
MeetKaiとGoogleの検索の主な違いは、MeetKaiがより豊富な言語理解モデルを使用して、ウェブページではなくアイテム自体を検索することです。たとえば、「トム・クルーズのアクションなしの映画」と検索した場合、Googleはトム・クルーズ、映画、アクションがページに表示されるトークンを検索します。一方、MeetKaiは、トム・クルーズが俳優であること、映画がメディアのクラスであること、アクションが望ましくないジャンルであることを正しく理解します。したがって、MeetKaiはより賢い検索を実行できます。
MeetKaiは最近、最初のライフスタイルVRワールド「MeetKaiメタバース」を立ち上げました。詳細について説明してください。
メタバース空間のほとんどの会社は、人と人とのインタラクションに重点を置いています。さらに、コンテンツはほとんどがカートゥーン風または360°ビデオです。MeetKaiメタバースの目標は、人とAIのインタラクションに焦点を当てることです。会話AIで動作するキャラクターとインタラクションするメタバースを開発しています。また、環境のプロシージャル生成を実行して、他の会社よりもリアルで没入感のある体験を提供することを目指しています。メタバースで利用できる2つの初期ワールドは、瞑想と美術館の2つのユースケースです。前者では、ウィング・チン専門家をデジタル化し、革命的な瞑想テクニックでリラックス状態に入ることができるAIキャラクターを作成しました。後者では、美術館を創設し、美術についての質問に答えたりツアーを提供したりできるAIパワードのキュレーターを提供しています。
このメタバースでAIはどのように使用されていますか?
私たちはメタバースでAIを3つの場所で使用しています。
- メタバースの各キャラクターの会話機能を提供するために。
- ユーザーに提供されるコンテンツを声でガイドすることで、動的に作成します。瞑想セッションや美術館ツアーなどの初期体験の例です。
- 手作業によるレイアウトではなく、3D空間をプロシージャルに生成するために。
ボイスアシスタントの将来についてのあなたのビジョンは何ですか?
ボイスアシスタントが将来を築くには、コマンドベースのシステムから進化する必要があります。そのためには、多くの特定のドメインで深い専門知識と能力を身につける必要があります。私は、さまざまなドメイン固有のボイスアシスタントを組み合わせて、すべての知能を備えたメタアシスタントを構築することが重要であると思います。これは、ボイスアシスタントが最初に登場したときから見られた「すべてを一度に実現しよう」という試みとは対照的です。
MeetKaiまたはMeetKaiメタバースについてさらに共有したいことはありますか?
私たちはまだメタバースのロードマップの初期段階にあります。最終的な目標は、現実世界で体験できるものをメタバースで再現し、それを超えることです。そのためには、現実世界での同じ体験を制限するコストや時間の制約を排除する必要があります。メタバースは、現実世界の体験をより豊かなものにすることができます。まだ解決しなければならない技術的な課題がありますが、達成可能な一連のマイルストーンがあります。ハードウェアパートナーと密接に協力して、VR空間が迅速に進化することを保証しています。VR以外でもメタバース体験を可能にすることを目指しています。詳細については、近い将来発表予定です。
素晴らしいインタビュー、ありがとうございます。MeetKaiのメタバースの進展に注目しています。詳細について知りたい読者は、MeetKaiを訪れてください。












