Інтерв’ю

Джеймс Каплан, генеральний директор та співзасновник MeetKai Metaverse – Інтерв’ю серії

mm
Додайте Unite.AI до бажаних джерел у Google

Джеймс Каплан – генеральний директор та співзасновник MeetKai, компанії штучного інтелекту, VR та розмовного пошуку, яка базується в Лос-Анджелесі, Каліфорнія, і зараз лідирує в гонці штучного інтелекту з незрівнянними функціями. Її розмовний штучний інтелект може зрозуміти більш складну мову і надати персоналізовані результати в природній розмові про багато предметів у різних реаліях. Технологія MeetKai розгорнута по всьому світу через iOS, Google Play та AppGallery.

У вас була пристрасть до штучного інтелекту з раннього віку 6 років, як ви вперше познайомилися з цією технологією?

Моя знайомство з штучним інтелектом відбулося через відеоігри. Спочатку це було через спробу зрозуміти, як працює штучний інтелект у грі Oregon Trail – не дуже розумний, але все ж таки форма штучного інтелекту. Відтоді мій інтерес до штучного інтелекту зростав, коли я почав грати в MMORPG. Мені дуже подобалося грати в онлайн-ігри, але я ненавидів фармити предмети. Тому я почав писати боти.

Які були деякі з перших застосунків штучного інтелекту, які ви написали?

Писання ботів для MMO було справді моєю першою спробою розробити певну форму штучного інтелекту. Спочатку мої боти були досить простими і ближчими до макросів, ніж до штучного інтелекту. Але коли я став старшим і коли виявлення ботів у багатьох іграх стало краще, це почало вимагати, щоб боти виглядали більше як гравець. Мені завжди подобалося писати боти – я навіть написав бота, щоб виграти конкурс Тейлор Свіфт, коли я був у школі (і вона навіть прийшла виступити!). Так само я написав перший бот для Pokémon Go і, на жаль, багатьох людей забанили, коли я втратив інтерес до уникнення виявлення.

Ви запустили MeetKai у 2018 році після того, як стали розчарованими в поточних голосових помічниках штучного інтелекту. Чому більшість голосових помічників штучного інтелекту пропонують незадовільний досвід?

Серце проблеми полягає в тому, що більшість голосових помічників штучного інтелекту залежать надто сильно від зовнішніх API для виконання завдань. Навіть коли вони контролюють виконання, наприклад, Alexa для пошуку товарів, вони страждають від тих самих проблем. Просто кажучи, як можна очікувати, що голосовий помічник буде розумним, якщо все, що він робить, – це перетворення мови на текст і введення цього тексту в текстовий пошуковий двигун? Ми розпочали MeetKai з ідеєю про те, що ми можемо надати “стрибок” у розвитку голосових помічників штучного інтелекту, контролюючи весь процес обробки кінця в кінць, який складає голосовий помічник. Ми розробили пошуковий двигун для розмов, а не ключових слів, щоб підтримувати більш складні запити і розмови. Інші помічники застряли в незадовільному досвіді, оскільки вони не можуть побудувати підтримку багатотермінових розмов на основі таких обмежуючих факторів. Наша мета – досягти цього, але ми все ще находимося на дуже ранній стадії розгортання нашої технології для виконання такого ж числа доменів, як і існуючі гравці.

Які деякі з природних мовних розуміння і природних мовних обробок, які стоять за побудовою голосового помічника штучного інтелекту?

Одним з основних викликів для наступного покоління NLU є рух за межі намірів і сутностей. Більшість NLU зосереджена на традиційному підході до розуміння мови. Кожен вхідний вираз класифікується за наміром, а потім токени всередині позначаються як сутності за допомогою моделі послідовного маркування. Я міг би перелічити десятки проблем з цим стандартним підходом. Однак найкритичніші з них:

  1. Класифікація намірів, яка є вільною від контексту, не може обробляти багатотермінові розмови. Більшість підходів лише турбуються про сам текст, який був транскрибований. їм не важливо контекст – ні хто користувач, ні що йому подобається, лише те, про що він тільки що запитав. Це особливо важливо, коли користувач говорить щось коротке. Наприклад, якщо хтось говорить “космополіт”, це може означати як напій, так і журнал, і сильно залежить від людини.
  2. Моделі розпізнавання сутностей роблять погану роботу з будь-чим, що не є категорійною вартістю. Великі мовні моделі не можуть адаптуватися досить швидко до нових сутностей, які зустрічаються в дикій природі, оскільки вони не входять до складу набору даних. Штучний інтелект повинен мати набагато більш складний спосіб розпізнавання сутностей, розглядаючи набагато глибший контекст. Наприклад, розташування користувача повинно сильно впливати на те, чи є щось назвою ресторану чи чимось іншим.
  3. Відносини між сутностями не розглядаються достатньо добре. Мій улюблений приклад – це те, як часто більшість пошукових систем не справляються з запереченням. Спробуйте пошук фільму без романтики на інших голосових помічниках, і ви побачите, про що я говорю.

Чому MeetKai AI працює інакше, ніж це?

Основна різниця між MeetKai і Google полягає в тому, що ми використовуємо набагато багатший мовний розуміння модель для пошуку предметів самих по собі, а не просто веб-сторінок. Коли ви шукаєте “фільми Тома Круза без дії”, Google шукає сторінки, які мають цей набір токенів на сторінці (Том Круз, фільми, дія). У MeetKai ми правильно розуміємо, що Том Круз – актор, фільми – клас медіа, який вони шукають, і що дія – нежадана жанр. З цим ми можемо проводити набагато більш інтелектуальні пошуки.

Meetkai недавно запустив свій перший VR-світ: MeetKai Metaverse. Чи можете ви розповісти про цю програму?

Більшість компаній у сфері метавсесвіту працюють над взаємодією людини з людиною. Окрім того, контент також переважно або карикатурний, або просто 360° відео. Наша мета з MeetKai Metaverse – зосередитися на зовсім іншому куті – людині та штучному інтелекті. Ми розробляємо метавсесвіт, де персонажі, з якими ви взаємодієте, усі підключені до нашого передового розмовного штучного інтелекту. Крім того, ми працюємо над процедурною генерацією середовища, щоб зробити його ще більш реалістичним і зануреним порівняно з іншими компаніями в цій сфері. Два початкових світу, доступних для дослідження в нашому метавсесвіті, призначені для двох початкових випадків використання: медитації та музеїв. У першому випадку ми оцифрували експерта з Він-Чун, і вперше ми створили штучний інтелект, який може інструктувати користувачів щодо того, як використовувати революційні техніки медитації для входу в стан релаксації. У другому випадку ми створили постійно зростаючий художній музей і забезпечили штучний інтелект, який може відповідати на питання про мистецтво в просторі та надавати екскурсії.

Які деякі приклади того, як штучний інтелект використовується в цьому Метавсесвіті?

Ми використовуємо штучний інтелект у трьох місцях:

  1. Щоб забезпечити розмовні можливості кожного персонажа в нашому метавсесвіті.
  2. Щоб динамічно створювати контент, який надається користувачеві через голосове керівництво. Приклади цього включають сеанси медитації та екскурсії по художніх галереях у наших початкових двох досвідах.
  3. Щоб створювати 3D-простір процедурно, а не вимагати ручної розкладки.

Яка ваша бачення майбутнього голосових помічників?

Щоб голосові помічники мали майбутнє, їм потрібно еволюціонувати в щось набагато більше, ніж система, заснована на командах. Це означає отримання глибокої експертизи та можливостей у багатьох конкретних галузях. Я думаю, що збір різних галузевих голосових помічників буде ключем до побудови всезнаючого мета-помічника. Це в різкому контрасті з спробами “зробити все одразу”, яких ми бачили з тих пір, як голосові помічники вперше з’явилися в цій сфері.

Чи є щось ще, що ви хотіли б поділитися про MeetKai або MeetKai Metaverse?

Ми все ще находимося на дуже початку нашої дорожньої карти метавсесвіту. Наша кінцева мета полягає в тому, щоб ми могли відтворити будь-який досвід, який ви маєте у реальному світі з метавсесвітом, а потім перейти за його межі. Це означає, що ми хочемо ліквідувати витрати та обмеження часу, які обмежують ці ж досвіди в реальності. Метавсесвіт може дозволити нам жити набагато багатшим життям, а не замінювати його. У нас все ще є кілька технічних проблем, які потрібно вирішити, однак у нас є чіткий набір орієнтирів, які можна досягти, припускаючи, що апаратне забезпечення продовжить покращуватися. Ми працюємо в тісній співпраці з апаратними партнерами, щоб забезпечити швидке просування у сфері VR. Окрім VR, ми хочемо зробити наш досвід метавсесвіту можливим поза VR. Ми оголосимо більше інформації про це в найближчі місяці.

Дякую за велике інтерв’ю, я сподіваюся слідкувати за вашим прогресом у вашій версії метавсесвіту. Читачам, які бажають дізнатися більше, слід відвідати MeetKai.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.