Interviews
James Kaplan, CEO & Co-Founder van MeetKai Metaverse – Interview Serie

James Kaplan is de CEO & Co-Founder van MeetKai, een bedrijf dat zich richt op Artificial Intelligence, VR en Conversational Search, gevestigd in Los Angeles, Californië, en momenteel leidt in de AI-spraakrace met nog nooit eerder gezien functionaliteiten. De conversational AI van het bedrijf kan complexe spraak begrijpen en persoonlijke resultaten geven in een natuurlijk gesprek over veel onderwerpen, in verschillende realiteiten. MeetKai’s technologie wordt wereldwijd ingezet via iOS, Google Play en AppGallery.
U had al een passie voor AI op de leeftijd van 6, hoe bent u voor het eerst met deze technologie in aanraking gekomen?
Mijn introductie tot AI kwam van videospellen. Eerst was het van proberen te begrijpen hoe de AI werkte in het spel Oregon Trail – niet zo intelligent, maar toch een vorm van AI. Van daaruit groeide mijn interesse in AI verder toen ik MMORPG’s ging spelen. Ik vond het echt leuk om online games te spelen, maar ik haatte het om te grinden voor items. Daarom begon ik met het schrijven van bots.
Wat waren enkele van de eerste AI-toepassingen die u heeft geschreven?
Het schrijven van bots voor MMO’s was echt mijn eerste stap in het ontwikkelen van een specifieke vorm van AI. In het begin waren mijn bots vrij eenvoudig en leken meer op macro’s dan op kunstmatige intelligentie. Maar toen ik ouder werd en bot-detectie in veel games beter werd, moesten de bots steeds meer lijken op een speler. Ik heb altijd van het schrijven van bots genoten – ik schreef zelfs een bot om een Taylor Swift-concours te winnen toen ik op school zat (en ze kwam zelfs optreden!). Ik schreef ook de eerste Pokémon Go-bot en kreeg helaas veel mensen geband toen ik mijn interesse in het ontwijken van detectie verloor.
U lanceerde MeetKai in 2018 nadat u gefrustreerd was geraakt door de huidige AI-stemassistenten. Waarom bieden de meeste AI-assistenten een matige ervaring?
Het kernprobleem is dat de meeste AI-assistenten te veel afhankelijk zijn van externe API’s voor het uitvoeren van taken. Zelfs wanneer ze de uitvoering controleren, zoals Alexa voor e-commerce-zoekopdrachten, lijden ze aan dezelfde problemen. Simpel gezegd, hoe kunt u verwachten dat een stemassistent slim is als hij alleen maar spraak naar tekst omzet en die tekst in een tekstgebaseerde zoekmachine plaatst? We zijn MeetKai begonnen met het idee dat we een “sprong” konden maken met een AI-assistent door het hele eind-tot-eind-verwerkingsproces te controleren dat een stemassistent uitmaakt. We hebben een conversational search engine ontwikkeld in plaats van een keyword-gebaseerde om meer complexe vragen en gesprekken te ondersteunen. Andere assistenten zitten vast met een matige ervaring omdat ze geen multi-turn conversatie-ondersteuning kunnen bouwen op basis van dergelijke beperkende factoren. Ons doel is om daar te komen, maar we zijn nog steeds in de allereerste fase van het opschalen van onze technologie om hetzelfde aantal domeinen te ondersteunen als bestaande spelers.
Wat zijn enkele van de natuurlijke taalbegrips- en natuurlijke taalverwerking-uitdagingen achter het bouwen van een state-of-the-art stemassistent-ervaring?
Een van de primaire uitdagingen met next-gen NLU is om verder te gaan dan intenties en entiteiten. De meeste NLU is gericht op een traditionele aanpak van taalbegrip. Elke invoer-uitspraak wordt geclassificeerd in een intentie, en vervolgens worden de tokens daarin gelabeld als entiteiten met behulp van een sequentiële label-model. Ik kan tientallen problemen met deze standaardaanpak opsommen. De meest kritieke zijn:
- Een intent-classificatie die context-vrij is, faalt om een multi-turn conversatie te behandelen. De meeste benaderingen zorgen alleen voor de ruwe tekst die is getranscribeerd. Ze zorgen niet voor context – niet wie de gebruiker is, niet wat de gebruiker leuk vindt, alleen wat ze net hebben gevraagd. Dit is vooral belangrijk wanneer de gebruiker iets kort en bondig zegt. Als iemand bijvoorbeeld “cosmopolitan” zegt, kan dit het drankje of het tijdschrift betekenen en is het sterk afhankelijk van de persoon.
- Entiteitsherkenning-modellen doen een slechte job met alles wat geen categorale waarde is. Grote taalmodellen kunnen niet snel genoeg aanpassen aan nieuwe entiteiten in de wildernis omdat ze niet in de dataset zitten. AI moet een veel meer geavanceerde manier hebben om entiteiten te herkennen door een veel diepere context te overwegen. Als voorbeeld moet de locatie van de gebruiker sterk beïnvloeden of iets een restaurantnaam is of iets anders.
- Entiteitsrelaties worden niet goed overwogen. Mijn favoriete voorbeeld is hoe vaak de meeste zoekmachines falen als het gaat om negatie. Probeer eens te zoeken naar een film zonder romantiek op andere stemassistenten, en u zult zien wat ik bedoel.
Hoe werkt MeetKai AI anders dan de huidige stemassistenten die simpelweg spraak naar tekst omzetten en een Google-zoekopdracht uitvoeren?
Het primaire verschil tussen MeetKai en Google als het gaat om zoekopdrachten is dat we een veel rijker taalbegripsmodel gebruiken om naar items zelf te zoeken in plaats van alleen naar webpagina’s. Wanneer u zoekt naar “Tom Cruise-films zonder actie”, zoekt Google naar pagina’s die die set tokens bevatten (Tom Cruise, films, actie). Bij MeetKai begrijpen we correct dat Tom Cruise een acteur is, films de klasse media zijn die ze zoeken, en dat actie het ongewenste genre is. Met dit kunnen we veel slimmere zoekopdrachten uitvoeren.
MeetKai lanceerde onlangs zijn eerste levensstijl-VR-wereld: MeetKai Metaverse. Kunt u dit toepassingsgebied specifiek bespreken?
De meeste bedrijven in de metaverse-ruimte werken aan persoon-persoon-interactie. Daarnaast is de inhoud meestal cartoon-achtig of slechts een 360°-video. Ons doel met MeetKai Metaverse is om een andere hoek te belichten – persoon-AI. We ontwikkelen een metaverse waarin de personages waarmee u interacteert, allemaal worden aangedreven door onze cutting-edge Conversational AI. Bovendien werken we aan het procedurally genereren van de omgeving om deze veel realistischer en immersiever te maken in vergelijking met andere bedrijven in de ruimte. De twee initiële werelden die beschikbaar zijn om te verkennen in onze metaverse zijn voor twee initiële use-cases: meditatie en musea. In het eerste geval hebben we een Wing Chun-expert gedigitaliseerd, en voor het eerst hebben we een AI-personage gemaakt dat gebruikers kan instrueren over hoe ze revolutionaire meditatie-technieken kunnen gebruiken om een staat van ontspanning te bereiken. In het tweede geval hebben we een altijd groeiende kunstmuseum gemaakt en een AI-gebaseerde curator die vragen over de kunst in de ruimte kan beantwoorden en rondleidingen kan geven.
Wat zijn enkele voorbeelden van hoe AI wordt gebruikt in deze Metaverse?
We gebruiken AI op drie plaatsen:
- Om de conversational capabilities van elk personage in onze metaverse te activeren.
- Om dynamisch inhoud te creëren die beschikbaar wordt gesteld aan de gebruiker via spraakbegeleiding. Voorbeelden hiervan zijn meditatie-sessies en kunstgalerij-tours in onze eerste twee ervaringen.
- Om de 3D-ruimte procedurally te creëren in plaats van een handmatige lay-out te vereisen.
Wat is uw visie voor de toekomst van stemassistenten?
Om een toekomst te hebben, moeten stemassistenten evolueren tot iets veel meer dan een opdracht-gebaseerd systeem. Dit betekent dat ze diepe expertise en capaciteiten in veel specifieke domeinen moeten hebben. Ik denk dat het assembleren van verschillende domein-specifieke stemassistenten de sleutel zal zijn om een all-intelligent meta-assistent te bouwen. Dit staat in schril contrast met de pogingen om “het allemaal tegelijk te doen” die we hebben gezien sinds stemassistenten voor het eerst de markt betraden.
Is er nog iets anders dat u wilt delen over MeetKai of de MeetKai Metaverse?
We zijn nog maar aan het begin van onze metaverse-roadmap. Ons uiteindelijke doel is dat we elke ervaring die u in de echte wereld heeft, kunnen repliceren in de metaverse, en dan verder gaan dan dat. Dit betekent dat we de kosten- en tijdbeperkende factoren willen elimineren die deze ervaringen in de realiteit beperken. De metaverse kan ons helpen om rijker te leven, niet om deze te vervangen. We hebben nog enkele technische uitdagingen die moeten worden opgelost, maar we hebben een duidelijke set van mijlpalen die haalbaar zijn, onder voorbehoud van het feit dat de hardware blijft verbeteren. We werken nauw samen met hardware-partners om ervoor te zorgen dat de VR-ruimte snel vooruitgaat. Beyond just VR, we want to make our metaverse experience possible outside of VR. We will be announcing more information about this in the coming months. Thank you for the great interview, I look forward to following your progress on your version of the metaverse. Readers who wish to learn more should visit MeetKai.












