Wywiady
James Kaplan, CEO i współzałożyciel MeetKai Metaverse – seria wywiadów

James Kaplan jest CEO i współzałożycielem MeetKai, firmy zajmującej się sztuczną inteligencją, VR i wyszukiwaniem konwersacyjnym, z siedzibą w Los Angeles, w Kalifornii, która obecnie prowadzi wyścig z AI z funkcjami, których nigdy wcześniej nie widziano. Ich AI konwersacyjna może zrozumieć bardziej złożoną mowę i dostarczyć spersonalizowane wyniki w naturalnej rozmowie na wiele tematów, w różnych rzeczywistościach. Technologia MeetKai jest wdrożona na całym świecie za pośrednictwem iOS, Google Play i AppGallery.
Miałeś pasję do AI już w wieku 6 lat, jak po raz pierwszy zostałeś wprowadzony w tę technologię?
Moje wprowadzenie do AI nastąpiło za pośrednictwem gier wideo. Najpierw było to zrozumienie, jak działa AI w grze Oregon Trail – nie była to zbyt inteligentna AI, ale nadal była to forma AI. Od tego momentu moje zainteresowanie AI rosło, gdy zacząłem grać w MMORPG. Bardzo lubiłem grać w gry online, ale nienawidziłem zbierania przedmiotów. Dlatego zacząłem pisać boty.
Jakie były pierwsze aplikacje AI, które napisałeś?
Pisanie botów dla MMO było moim pierwszym podejściem do opracowania określonej formy AI. Na początku moje boty były dość proste i bardziej przypominały makra niż sztuczną inteligencję. Ale gdy dorastałem i gdy wykrywanie botów w grach stało się lepsze, wymagało to, aby boty wyglądały bardziej jak gracze. Zawsze lubiłem pisać boty – napisałem nawet bota, który wygrał konkurs Taylor Swift, gdy byłem w szkole (i ona naprawdę przyszła wystąpić!). Podobnie, napisałem także pierwszego bota Pokémon Go i niestety, spowodowałem, że wiele osób zostało zbanowanych, gdy straciłem zainteresowanie unikaniem wykrycia.
Uruchomiłeś MeetKai w 2018 roku, po tym, jak zostałeś sfrustrowany przez obecnych asystentów głosowych AI. Dlaczego większość asystentów AI oferuje doświadczenie na niskim poziomie?
Podstawą problemu jest to, że większość asystentów AI opiera się zbyt mocno na zewnętrznych API do realizacji. Nawet gdy kontrolują realizację, tak jak Alexa dla wyszukiwania e-commerce, cierpią na te same problemy. Po prostu, jak można oczekiwać, że asystent głosowy będzie mądry, gdy wszystko, co robi, to tłumaczy mowę na tekst i umieszcza ten tekst w wyszukiwarce opartej na tekście? Zaczęliśmy MeetKai z pomysłem, że możemy zapewnić „przewagę” asystentowi AI, kontrolując cały proces przetwarzania końcowego, który tworzy asystenta głosowego. Opracowaliśmy wyszukiwarkę konwersacyjną, a nie opartą na słowach kluczowych, aby wspierać bardziej skomplikowane zapytania i rozmowy. Inni asystenci mają doświadczenia na niskim poziomie, ponieważ nie mogą zbudować wsparcia dla rozmów wieloobrotowych na podstawie tak ograniczających czynników. Naszym celem jest dotarcie tam, ale nadal jesteśmy na bardzo wczesnym etapie skalowania naszej technologii, aby zaspokoić taką samą liczbę domen, jak istniejący gracze.
Jakie są niektóre z naturalnych wyzwań zrozumienia języka i przetwarzania języka naturalnego przy budowaniu asystenta głosowego o wysokiej jakości?
Jednym z podstawowych wyzwań związanych z następną generacją NLU jest przejście poza intencje i jednostki. Większość NLU koncentruje się na tradycyjnym podejściu do zrozumienia języka. Każde wejściowe zdanie jest klasyfikowane jako intencja, a następnie tokeny wewnątrz są oznaczone jako jednostki przy użyciu modelu oznaczania sekwencji. Mogę wyliczyć dziesiątki problemów z tym standardowym podejściem. Jednak najważniejsze z nich to:
- Klasyfikacja intencji, która jest wolna od kontekstu, nie radzi sobie z rozmową wieloobrotową. Większość podejść troszczy się tylko o surowy tekst, który został przetransferowany. Nie dbają o kontekst – nie o to, kim jest użytkownik, nie o to, co użytkownik lubi, tylko o to, o co użytkownik właśnie spytał. Jest to szczególnie ważne, gdy użytkownik mówi coś krótkiego. Na przykład, jeśli ktoś mówi „kosmopolityczny”, może to oznaczać napój lub magazyn i jest silnie uzależnione od osoby.
- Modele rozpoznawania jednostek robią słabą robotę w przypadku wszystkiego, co nie jest wartością kategorialną. Duże modele językowe nie są w stanie dostosować się wystarczająco szybko do nowych jednostek, które są na zewnątrz, ponieważ nie są one w zbiorze danych. AI musi mieć o wiele bardziej zaawansowany sposób rozpoznawania jednostek, biorąc pod uwagę o wiele głębszy kontekst. Na przykład, lokalizacja użytkownika powinna silnie wpływać na to, czy coś jest nazwą restauracji, czy czymś innym.
- Relacje między jednostkami nie są dobrze rozważane. Mój ulubiony przykład to to, jak często większość wyszukiwarek nie radzi sobie, gdy chodzi o negację. Spróbuj wyszukać film bez romansu w innych asystentach głosowych, a zobaczysz, co mam na myśli.
Obecnie większość asystentów głosowych po prostu tłumaczy głos na tekst i przeprowadza wyszukiwanie Google. Jak MeetKai AI działa inaczej niż to?
Główna różnica między MeetKai a Google w zakresie wyszukiwania polega na tym, że wykorzystujemy o wiele bogatszy model zrozumienia języka, aby wyszukiwać elementy same w sobie, a nie tylko strony internetowe. Gdy wyszukujesz „filmy Toma Cruise’a bez akcji”, Google szuka stron, które mają zestaw tokenów, które pojawiają się na stronie (Tom Cruise, filmy, akcja). W MeetKai poprawnie rozumiemy, że Tom Cruise jest aktorem, filmy to klasa mediów, które szukamy, a akcja to niepożądany gatunek. Dzięki temu możemy przeprowadzać o wiele bardziej inteligentne wyszukiwania.
Meetkai niedawno uruchomił swoją pierwszą wirtualną rzeczywistość świata stylu życia: MeetKai Metaverse. Czy mógłbyś omówić, co to jest ta aplikacja?
Większość firm w przestrzeni metaverse pracuje nad interakcją osoba-osoba. Poza tym, treści są również w dużej mierze albo kreskówkowe, albo są tylko filmem 360°. Naszym celem z MeetKai Metaverse jest skoncentrowanie się na całkowicie innym kącie – osoba-AI. Rozwijamy metaverse, w którym postacie, z którymi wchodzisz w interakcję, są wszystkie napędzane przez naszą najnowocześniejszą AI konwersacyjną. Ponadto pracujemy nad proceduralną generacją środowiska, aby uczynić je o wiele bardziej realistycznym i immersyjnym w porównaniu z innymi firmami w tej przestrzeni. Dwa początkowe światy dostępne do eksploracji w naszym metaverse są dla dwóch początkowych przypadków użycia: medytacji i muzeów. W pierwszym przypadku zdigitalizowaliśmy eksperta Wing Chun, a po raz pierwszy stworzyliśmy postać AI, która jest w stanie instruować użytkowników, jak używać rewolucyjnych technik medytacji, aby wejść w stan relaksacji. W drugim przypadku stworzyliśmy stale rosnące muzeum sztuki i zapewniliśmy kuratora napędzanego przez AI, który jest w stanie odpowiedzieć na pytania o sztukę w przestrzeni i zapewnić wycieczki.
Jakie są przykłady użycia AI w tym Metaverse?
Wykorzystujemy AI w trzech miejscach:
- Aby napędzić możliwości konwersacyjne każdej postaci w naszym metaverse.
- Aby dynamicznie tworzyć treści, które są dostępne dla użytkownika za pośrednictwem prowadzenia głosowego. Przykłady obejmują sesje medytacji i wycieczki po galerii sztuki w naszych dwóch początkowych doświadczeniach.
- Aby stworzyć przestrzeń 3D proceduralnie, a nie wymagać ręcznego układu.
Jaka jest twoja wizja przyszłości asystentów głosowych?
Dla asystentów głosowych, aby mieć przyszłość, muszą one ewoluować w coś o wiele bardziej zaawansowanego niż system oparty na poleceniach. Oznacza to zdobycie głębokiej ekspertyzy i zdolności w wielu konkretnych dziedzinach. Uważam, że zbudowanie różnych asystentów głosowych specyficznych dla domeny będzie kluczem do zbudowania wszechmądrego asystenta meta. Jest to w wyraźnym kontraście do prób „zrobienia wszystkiego na raz” w momencie, gdy asystenci głosowi po raz pierwszy weszli na rynek.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat MeetKai lub MeetKai Metaverse?
Jeszcze jesteśmy na samym początku naszej mapy drogowej metaverse. Naszym ostatecznym celem jest to, abyśmy mogli odtworzyć każde doświadczenie, które masz w świecie rzeczywistym, w metaverse, a następnie pójść dalej. Oznacza to, że chcemy wyeliminować czynniki, które są kosztowne i czasochłonne, które ograniczają te same doświadczenia w rzeczywistości. Metaverse może pozwolić nam żyć o wiele bogatszym życiem, a nie zastąpić je. Mamy kilka technicznych wyzwań, które nadal muszą być rozwiązane, jednak mamy wyraźny zestaw kamieni milowych, które są osiągalne, zakładając, że sprzęt będzie się nadal poprawiać. Pracujemy ściśle z partnerami sprzętowymi, aby zapewnić, że przestrzeń VR posuwa się do przodu szybko. Poza samym VR chcemy uczynić nasze doświadczenie metaverse możliwe poza VR. Będziemy ogłaszać więcej informacji na ten temat w nadchodzących miesiącach. Dziękuję za wspaniały wywiad, czekam na śledzenie twojego postępu w twojej wersji metaverse. Czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić MeetKai.












