Интервью
Джеймс Каплан, генеральный директор и сооснователь MeetKai Metaverse – Интервью

Джеймс Каплан – генеральный директор и сооснователь MeetKai, компании, занимающейся искусственным интеллектом, виртуальной реальностью и разговорным поиском, базирующейся в Лос-Анджелесе, Калифорния. В настоящее время компания лидирует в области речевых технологий с функциями, никогда ранее не виденными. Ее разговорный ИИ может понимать более сложные речевые конструкции и предоставлять персонализированные результаты в ходе естественного разговора на различные темы и в разных реалиях. Технология MeetKai развернута по всему миру через iOS, Google Play и AppGallery.
У вас была страсть к ИИ с раннего возраста – 6 лет. Как вы впервые познакомились с этой технологией?
Мое знакомство с ИИ началось с видеоигр. Сначала это было из-за попыток понять, как работает ИИ в игре Oregon Trail – не очень умный, но все же форма ИИ. Оттуда мой интерес к ИИ вырос, когда я начал играть в MMORPG. Мне действительно нравилось играть в онлайн-игры, но я ненавидел сбор предметов. Поэтому я начал писать ботов.
Какие были некоторые из первых приложений ИИ, которые вы написали?
Написание ботов для MMO было моим первым шагом в разработке определенной формы ИИ. Сначала мои боты были довольно простыми и больше похожими на макросы, чем на искусственный интеллект. Но когда я стал старше, и обнаружение ботов в играх стало лучше, это потребовало, чтобы боты выглядели более как игроки. Мне всегда нравилось писать ботов – я даже написал бота, чтобы выиграть конкурс Тейлор Свифт, пока был в школе (и она действительно пришла выступить!). Также я написал первый бот для Pokémon Go и, к сожалению, получил многих людей забаненных, когда я потерял интерес к избеганию обнаружения.
Вы запустили MeetKai в 2018 году после того, как стали разочарованы текущими голосовыми помощниками. Почему большинство голосовых помощников предлагают посредственный опыт?
Суть проблемы заключается в том, что большинство голосовых помощников слишком сильно полагаются на внешние API для выполнения запросов. Даже когда они контролируют выполнение, например, Alexa для поиска в электронной коммерции, они страдают от одних и тех же проблем. Просто говоря, как можно ожидать, что голосовой помощник будет умным, если все, что он делает, – это переводит речь в текст и помещает этот текст в текстовый поисковый движок? Мы начали MeetKai с идеей, что мы можем предоставить “прыжок” голосового помощника, контролируя весь конвейер обработки, который составляет голосовой помощник. Мы разработали разговорный поисковый движок, а не ключевое слово, чтобы поддержать более сложные запросы и разговоры. Другие помощники застряли в посредственном опыте, потому что они не могут построить поддержку многоповоротных разговоров на основе таких ограничительных факторов. Хотя наша цель – добиться этого, мы все еще находимся на очень ранней стадии масштабирования нашей технологии, чтобы выполнить то же количество доменов, что и существующие игроки.
Какие есть некоторые естественные языковые понимание и обработка проблемы при построении передового голосового помощника?
Одной из основных проблем с следующим поколением NLU является переход за пределы намерений и сущностей. Большинство NLU сосредоточено на традиционном подходе к пониманию языка. Каждое входное высказывание классифицируется по намерению, а затем токены внутри помечаются как сущности с помощью модели последовательной маркировки. Я мог бы перечислить десятки проблем с этим стандартным подходом. Однако наиболее важные из них:
- Классификация намерений, не зависящая от контекста, не может справиться с многоповоротным разговором. Большинство подходов заботятся только о том, что было транскрибировано. Они не заботятся о контексте – не о том, кто пользователь, не о том, что пользователь любит, только о том, что он только что спросил. Это особенно важно, когда пользователь говорит что-то краткое. Например, если кто-то говорит “космополит”, это может означать напиток или журнал и сильно зависит от человека.
- Модели распознавания сущностей делают плохую работу с чем-либо, что не является категориальным значением. Большие языковые модели не могут адаптироваться достаточно быстро к новым сущностям, которые находятся в дикой природе, потому что они не находятся в наборе данных. ИИ должен иметь гораздо более сложный способ распознавания сущностей, учитывая гораздо более глубокий контекст. Например, местоположение пользователя должно сильно влиять на то, является ли что-то названием ресторана или чем-то другим.
- Отношения между сущностями не хорошо учитываются. Мой любимый пример – это то, как часто большинство поисковых систем терпят неудачу, когда речь идет об отрицании. Попробуйте поискать фильм без романтики на других голосовых помощниках, и вы увидите, что я имею в виду.
Текущие голосовые помощники просто переводят голос в текст и проводят поиск Google. Как MeetKai AI работает по-другому?
Основное различие между MeetKai и Google при поиске заключается в том, что мы используем гораздо более богатую модель понимания языка для поиска элементов самих по себе, а не только веб-страниц. Когда вы ищете “фильмы Тома Круза без действия”, Google ищет страницы, на которых появляется этот набор токенов (Том Круз, фильмы, действие). В MeetKai мы правильно понимаем, что Том Круз – актер, фильмы – класс медиа, который они ищут, и что действие – нежелаемый жанр. С этим мы можем проводить гораздо более интеллектуальные поиски.
MeetKai недавно запустил свой первый лайфстайл-мир виртуальной реальности: MeetKai Metaverse. Можете ли вы рассказать об этом приложении?
Большинство компаний в области метаверса работают над взаимодействием человека с человеком. Помимо этого, контент также в основном либо карикатурный, либо представляет собой 360° видео. Наша цель с MeetKai Metaverse – сосредоточиться на совершенно другом угле – человек-ИИ. Мы разрабатываем метаверс, где персонажи, с которыми вы взаимодействуете, все управляются нашей передовой разговорной ИИ. Кроме того, мы работаем над процедурной генерацией окружающей среды, чтобы сделать ее гораздо более реалистичной и погружающей по сравнению с другими компаниями в этой области. Два первых мира, доступных для исследования в нашем метаверсе, – это для двух первоначальных случаев использования: медитация и музеи. В первом мы оцифровали эксперта по Винг Чун, и впервые создали ИИ-персонажа, который может инструктировать пользователей о том, как использовать революционные методы медитации, чтобы войти в состояние расслабления. Во втором мы создали постоянно растущий художественный музей и предоставили ИИ-куратора, способного отвечать на вопросы об искусстве в пространстве и предоставлять экскурсии.
Какие примеры использования ИИ в этом Метаверсе?
Мы используем ИИ в трех местах:
- Чтобы обеспечить разговорные возможности каждого персонажа в нашем метаверсе.
- Чтобы динамически создать контент, доступный пользователю через голосовое руководство. Примеры этого включают сеансы медитации и экскурсии по художественной галерее в наших первых двух опытах.
- Чтобы создать трехмерное пространство процедурно, а не требовать ручной компоновки.
Каково ваше видение будущего голосовых помощников?
Чтобы голосовые помощники имели будущее, они должны эволюционировать в нечто гораздо более сложное, чем командная система. Это означает получение глубокой экспертизы и возможностей в многих конкретных доменах. Я думаю, что сбор различных домен-специфических голосовых помощников будет ключом к построению всестороннего умного мета-помощника. Это в резком контрасте с попытками “сделать все сразу”, которые мы видели с тех пор, как голосовые помощники впервые вошли в эту область.
Есть ли что-то еще, что вы хотели бы поделиться о MeetKai или MeetKai Metaverse?
Мы все еще находимся на очень ранней стадии нашей дорожной карты метаверса. Наша конечная цель – мы хотим быть в состоянии воспроизвести любой опыт, который у вас есть в реальном мире с метаверсом, и затем пойти дальше. Это означает, что мы хотим устранить стоимость и факторы, ограничивающие время, которые ограничивают эти же опыт в реальности. Метаверс может позволить нам жить гораздо более богатой жизнью, не заменяя ее. У нас есть несколько технических проблем, которые все еще нужно решить, однако у нас есть четкий набор вех, которые достижимы, предполагая, что аппаратное обеспечение продолжит улучшаться. Мы тесно сотрудничаем с аппаратными партнерами, чтобы обеспечить быстрое продвижение в области виртуальной реальности. За пределами виртуальной реальности мы хотим сделать наш опыт метаверса возможным. Мы будем объявлять больше информации об этом в ближайшие месяцы.
Спасибо за отличное интервью, я с нетерпением жду возможности следить за вашим прогрессом в вашей версии метаверса. Читатели, которые хотят узнать больше, должны посетить MeetKai.












