Interviews
James Kaplan, administrerende direktør og medstifter af MeetKai Metaverse – Intervieuserie

James Kaplan er administrerende direktør og medstifter af MeetKai, et kunstig intelligens-, VR- og konversations søgefirma med hovedsæde i Los Angeles, Californien, som i øjeblikket leder AI-talsækkerracen med funktioner, der ikke er set før. Dets konversations AI kan forstå mere komplekse udtalelser og give personlige resultater i en naturlig samtale om mange emner i forskellige virkeligheder. MeetKais teknologi er globalt tilgængelig via iOS, Google Play og AppGallery.
Du havde en passion for AI allerede i en alder af 6, hvordan blev du først introduceret til denne teknologi?
Min introduktion til AI kom fra videospil. Først var det fra at forsøge at forstå, hvordan AI fungerede i spillet Oregon Trail – ikke særlig intelligent, men alligevel en form for AI. Fra der udviklede min interesse for AI sig yderligere, da jeg kom i gang med MMORPG’er. Jeg kunne virkelig lide at spille online-spil, men jeg hadede at “grinde” efter genstande. Derfor begyndte jeg at skrive bots.
Hvad var nogle af de første AI-applikationer, du kodede?
At skrive bots til MMORPG’er var virkelig min første indsats i udvikling af en specifik form for AI. I begyndelsen var mine bots ret simple og nærmere lignende makroer end kunstig intelligens. Men da jeg blev ældre, og bot-detection blev bedre i mange spil, krævede dette, at bot’ene blev mere og mere lignende en spiller. Jeg har altid nydt at skrive bots – jeg endte med at skrive en bot, der vandt en Taylor Swift-konkurrence, mens jeg var i skole (og hun kom faktisk til at optræde!). Ligeså skrev jeg den første Pokémon Go-bot og fik desværre mange mennesker bandlyst, da jeg mistede interessen for at undgå opdagelse.
Du lancerede MeetKai i 2018 efter at have været frustreret over nuværende AI-stemmeassistenter. Hvorfor tilbyder de fleste AI-assistenter en mangelfuld oplevelse?
Kernen i problemet er, at de fleste AI-assistenter afhænger for meget af eksterne API’er til opfyldelse. Selv når de kontrollerer opfyldelsen, såsom Alexa for e-commerce-søgning, lider de under de samme problemer. Det kan simpelthen ikke forventes, at en stemmeassistent kan være intelligent, når alt, den gør, er at omdanne tale til tekst og indsætte denne tekst i en tekstbaseret søgemaskine? Vi startede MeetKai med idéen om, at vi kunne levere en “spring over” AI-assistent ved at kontrollere hele den end-to-end-behandling, der udgør en stemmeassistent. Vi udviklede en konversationsbaseret søgemaskine i stedet for en nøgleordsbaseret til at understøtte mere komplekse forespørgsler og samtaler. Andre assistenter er fastlåst i en mangelfuld oplevelse, fordi de ikke kan bygge multi-turn-samtale-understøttelse oven på sådanne begrænsende faktorer. Vores mål er at nå dertil, men vi er stadig meget tidligt i udviklingen af vores teknologi til at opfylde det samme antal domæner som eksisterende spillere.
Hvad er nogle af de naturlige sprogforståelses- og sprogbehandlingsudfordringer bag opbygningen af en state-of-the-art-stemmeassistent-oplevelse?
En af de primære udfordringer med næste generations NLU er at gå ud over intentioner og enheder. De fleste NLU’er fokuserer på at have en meget traditionel tilgang til sprogforståelse. Hver input-yttring klassificeres i en intention, og derefter mærkes tokenene i enheder ved hjælp af en sekvensmærkningsmodel. Jeg kunne opregne dusinvis af problemer med denne standardtilgang. Imidlertid er de vigtigste:
- En kontekstfri intentionsklassifikation, der ikke kan håndtere en multi-turn-samtale. De fleste tilgange bekymrer sig kun om den rå tekst, der blev transkriberet. De bekymrer sig ikke om kontekst – ikke om, hvem brugeren er, ikke om, hvad brugeren kan lide, kun om, hvad de lige spurgte om. Dette er særligt vigtigt, når brugeren siger noget i en kort sætning. For eksempel, hvis nogen siger “cosmopolitan”, kan det betyde enten drikken eller magasinet og afhænger stærkt af personen.
- Enheds-genkendelsesmodeller gør en dårlig indsats, når det kommer til noget, der ikke er en kategoriværdi. Store sprogmodeller kan ikke tilpasse sig hurtigt nok til nye enheder, der er i det vilde, fordi de ikke er i datasættet. AI skal have en langt mere avanceret måde at genkende enheder på ved at overveje en langt dybere kontekst. For eksempel skal brugerens placering have en stor indvirkning på, om noget er et restaurantnavn eller noget andet.
- Enhedsrelationer er ikke godt overvejet. Mit yndlings eksempel er, hvor ofte de fleste søgemaskiner fejler, når det kommer til negation. Prøv at søge efter en film uden romance på andre stemmeassistenter, og du vil se, hvad jeg mener.
Nuværende stemmeassistenter oversætter simpelthen stemme til tekst og udfører en Google-søgning. Hvordan fungerer MeetKai AI anderledes end dette?
Forskellen mellem MeetKai og Google, når det kommer til søgning, er, at vi anvender en langt rigere sprogforståelsesmodel til at søge efter selv genstande i stedet for kun web sider. Når du søger “Tom Cruise-film uden action”, søger Google efter sider, der har denne sæt af token på siden (Tom Cruise, film, action). Hos MeetKai forstår vi korrekt, at Tom Cruise er en skuespiller, film er den type medie, de søger efter, og at action er den uønskede genre. Med dette kan vi udføre langt mere intelligente søgninger.
MeetKai lancerede for nylig sin første livsstils-VR-verden: MeetKai Metaverse. Kan du diskutere, hvad denne applikation er specifikt?
De fleste virksomheder i metaverse-rummet arbejder på person-til-person-interaktion. Ud over dette er indholdet også overvejende enten tegneserieagtigt eller blot en 360°-video. Vores mål med MeetKai Metaverse er at fokusere på en helt anden vinkel – person-til-AI. Vi udvikler en metaverse, hvor karaktererne, du interagerer med, alle er drevet af vores avancerede konversations AI. Derudover arbejder vi på at udføre procedur-generering af miljøet for at gøre det langt mere realistisk og immersivt i forhold til andre virksomheder i rummet. De to første verdener, der er tilgængelige at udforske i vores metaverse, er til to første brugs Tilfælde: meditation og museer. I den første har vi digitaliseret en Wing Chun-ekspert, og for første gang har vi skabt en AI-karakter, der kan instruere brugere om, hvordan de kan bruge revolutionerende meditationsteknikker til at indtræde i en tilstand af afslapning. I den sidste har vi skabt et stadig voksende kunstmuseum og har leveret en AI-drevet kurator, der kan besvare spørgsmål om kunsten i rummet og give ture.
Hvad er nogle eksempler på, hvordan AI anvendes i denne Metaverse?
Vi anvender AI på tre måder:
- Til at aktivere de konversationsmuligheder for hver karakter i vores metaverse.
- Til dynamisk at skabe indholdet, der er tilgængeligt for brugeren via stemmevejledning. Eksempler på dette inkluderer meditationssessioner og kunstgalleri-ture i vores to første oplevelser.
- Til at skabe det 3D-rum procedurmæssigt i stedet for at kræve en manuel layout.
Hvad er din vision for fremtidens stemmeassistenter?
Til at have en fremtid skal stemmeassistenter udvikle sig til noget langt mere end et kommando-baseret system. Dette indebærer at opnå dyb ekspertise og kapaciteter i mange specifikke domæner. Jeg tror, at opbygning af forskellige domæne-specifikke stemmeassistenter vil være nøglen til at bygge en alt-intelligent meta-assistent. Dette er i skarp kontrast til forsøgene på at “gøre det hele på én gang”, som vi har set, siden stemmeassistenter først kom ind i rummet.
Er der noget andet, du gerne vil dele om MeetKai eller MeetKai Metaverse?
Vi er stadig meget tidligt i vores metaverse-vejviser. Vores endelige mål er, at vi gerne vil kunne genskabe enhver oplevelse, du har i den virkelige verden, med metaverse, og derefter gå ud over den. Dette indebærer, at vi gerne vil eliminere de omkostninger og tidskrævende faktorer, der begrænser samme oplevelser i virkeligheden. Metaverse kan give os mulighed for at leve rigere liv, ikke erstatte dem. Vi har flere tekniske udfordringer, der stadig skal løses, men vi har en klar samling af mål, der kan opnås, under forudsætning af, at hardwaren fortsætter med at forbedre sig. Vi arbejder tæt sammen med hardware-partnere for at sikre, at VR-rummet bevæger sig hurtigt fremad. Ud over kun VR ønsker vi at gøre vores metaverse-oplevelse mulig uden for VR. Vi vil offentliggøre mere information om dette i de kommende måneder.
Tak for det gode interview, jeg ser frem til at følge jeres fremgang på jeres version af metaverse. Læsere, der ønsker at lære mere, skal besøge MeetKai.












