Intervjuer

James Kaplan, CEO og medgrunnlegger av MeetKai Metaverse – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

James Kaplan er CEO og medgrunnlegger av MeetKai, et selskap som jobber med kunstig intelligens, VR og samtalebasert søk, med hovedkontor i Los Angeles, California. De leder for øyeblikket AI-talen med helt nye funksjoner. Deres samtalebaserte AI kan forstå mer kompleks tale og gi personlige resultater i en naturlig samtale om mange emner, i forskjellige virkeligheter. MeetKais teknologi er deployert globalt gjennom iOS, Google Play og AppGallery.

Du hadde en lidenskap for AI allerede i en alder av 6 år, hvordan ble du først introdusert for denne teknologien?

Min introduksjon til AI kom fra videospill. Først var det fra å prøve å forstå hvordan AI fungerte i spillet Oregon Trail – ikke så intelligent, men likevel en form for AI. Deretter vokste min interesse for AI når jeg begynte å spille MMORPG. Jeg likte å spille online-spill, men jeg hatet å “grinde” for gjenstander. Derfor begynte jeg å skrive bots.

Hva var noen av de første AI-applikasjonene du kodet?

Å skrive bots for MMORPG var min første erfaring med å utvikle en bestemt type AI. I begynnelsen var mine bots ganske enkle og nærmere macros enn kunstig intelligens. Men når jeg ble eldre og bot-detection ble bedre i mange spill, måtte botene mine se ut som en spiller. Jeg har alltid likt å skrive bots – jeg skrev en bot for å vinne en Taylor Swift-konkurranse mens jeg var på skolen (og hun kom faktisk til å opptre!). Jeg skrev også den første Pokémon Go-bot og fikk dessverre mange mennesker bannlyst når jeg mistet interessen for å unngå å bli oppdaget.

Du lanserte MeetKai i 2018 etter å ha blitt frustrert over gjeldende AI-stemmeassistenter. Hvorfor tilbyr de fleste AI-assistentene en mangelfull opplevelse?

Kjernen i problemet er at de fleste AI-assistentene avhenger for mye av eksterne API-er for oppfyllelse. Selv når de kontrollerer oppfyllelsen, som Alexa for e-handelsøk, lider de under de samme problemene. Enkelt sagt, hvordan kan du forvente at en stemmeassistent skal være smart når alt den gjør er å konvertere tale til tekst og sette den teksten inn i en tekstbasert søkemotor? Vi startet MeetKai med ideen om at vi kunne tilby en “leapfrog”-AI-assistent ved å kontrollere hele sluttpunkt-til-sluttpunkt-prosessen som utgjør en stemmeassistent. Vi utviklet en samtalebasert søkemotor i stedet for en nøkkelordsbasert for å støtte mer kompliserte spørsmål og samtaler. Andre assistenter er fanget i en mangelfull opplevelse fordi de ikke kan bygge multi-turn conversational support på toppen av slike begrensninger. Vårt mål er å nå dit, men vi er fortsatt i en meget tidlig fase av å skalerer ut teknologien vår for å oppfylle samme antall domener som eksisterende spillere.

Hva er noen av de naturlige språkforståelses- og naturlige språkbehandlingsutfordringene bak å bygge en state-of-the-art stemmeassistent-opplevelse?

En av de primære utfordringene med next-gen NLU er å gå utenfor intensjoner og enheter. De fleste NLU er fokusert på å ha en svært tradisjonell tilnærming til språkforståelse. Hver inndatauttalelse klassifiseres som intensjon, og deretter merkes tokenene inn i enheter ved hjelp av en sekvensmerkingmodell. Jeg kunne oppliste dusinvis av problemer med denne standardtilnærmingen. Imidlertid er de viktigste:

  1. En kontekstfri intensjonsklassifisering som ikke kan håndtere en multi-turn samtale. De fleste tilnærmingene bryr seg bare om den rå teksten som ble transkribert. De bryr seg ikke om kontekst – ikke hvem brukeren er, ikke hva brukeren liker, bare hva de nettopp spurte om. Dette er spesielt viktig når brukeren sier noe veldig kort. For eksempel, hvis noen sier “cosmopolitan”, kan det bety enten drinken eller magasinet og er svært avhengig av personen.
  2. Enhetsgjenkjenningmodeller gjør en dårlig jobb med alt som ikke er en kategoriverdi. Store språkmodeller kan ikke tilpasse seg raskt nok til nye enheter som er ute i verden fordi de ikke er i datasettet. AI må ha en mye mer sofistikert måte å gjenkjenne enheter ved å vurdere en mye dypere kontekst. For eksempel, bør brukerens plassering påvirke sterkt om noe er et restaurantnavn eller noe annet.
  3. Enhetssammenhenger er ikke godt vurdert. Mitt favoritteksmpel er hvordan de fleste søkemotorer feiler når det gjelder negasjon. Prøv å søke etter en film uten romantikk på andre stemmeassistenter, og du vil se hva jeg mener.

Hvordan fungerer MeetKai AI forskjellig fra dette?

Forskjellen mellom MeetKai og Google når det gjelder søk er at vi bruker en mye rikere språkforståelsesmodell for å søke etter elementer selv i stedet for bare å søke etter nettsider. Når du søker “Tom Cruise-filmer uten action”, søker Google etter sider som har denne settet med token på siden (Tom Cruise, filmer, action). Hos MeetKai forstår vi korrekt at Tom Cruise er en skuespiller, filmer er klassen av media de søker etter, og at action er den uønskede sjangeren. Med dette kan vi utføre mye mer intelligente søk.

MeetKai lanserte nylig sin første livsstils-VR-verden: MeetKai Metaverse. Kan du diskutere hva denne applikasjonen er spesifikt?

De fleste selskaper i metaverse-rommet jobber med person-til-person-interaksjon. Ut over det er innholdet også stort sett enten tegneserieaktig eller bare en 360°-video. Vårt mål med MeetKai Metaverse er å fokusere på en helt annen vinkel – person-til-AI. Vi utvikler en metaverse hvor karakterene du interagerer med er alle drevet av vår kunstige intelligens. Vi jobber også med å generere miljøet prosedyrisk for å gjøre det mer realistisk og immersivt sammenlignet med andre selskaper i rommet. De to første verdener som er tilgjengelige for å utforske i vår metaverse er for to første bruksområder: meditasjon og museer. I den første har vi digitalisert en Wing Chun-ekspert, og for første gang har vi skapt en AI-karakter som kan instruere brukerne om hvordan de kan bruke revolusjonære meditasjonsteknikker for å komme inn i en tilstand av avslapning. I den andre har vi skapt en stadig voksende kunstmuseum og gitt en AI-drevet kurator som kan svare på spørsmål om kunsten i rommet og gi turer.

Hva er noen eksempler på hvordan AI brukes i denne Metaverse?

Vi bruker AI på tre måter:

  1. For å aktivere samtalefunksjonene til hver karakter i vår metaverse.
  2. For å dynamisk skape innholdet som er tilgjengelig for brukeren gjennom stemmeveiledning. Eksempler på dette inkluderer meditasjonsøkter og kunstgalleriturer i våre to første opplevelser.
  3. For å skape 3D-rommet prosedyrisk i stedet for å kreve en manuell utforming.

Hva er din visjon for fremtiden til stemmeassistenter?

For at stemmeassistenter skal ha en fremtid, må de utvikle seg til noe mye mer enn et kommandobasert system. Dette betyr å samle dypt ekspertise og kapasiteter i mange spesifikke domener. Jeg tror at å samle forskjellige domenespesifikke stemmeassistenter vil være nøkkelen til å bygge ut en all-intelligent meta-assistent. Dette er i skarp kontrast til forsøkene på å “gjøre alt på en gang” som vi har sett siden stemmeassistenter først kom inn i rommet.

Er det noe annet du ønsker å dele om MeetKai eller MeetKai Metaverse?

Vi er fortsatt i den meget tidlige fasen av vår metaverse-veikart. Vårt endelige mål er at vi ønsker å kunne replikere enhver opplevelse du har i den virkelige verden med metaverse, og deretter gå utenfor den. Dette betyr at vi ønsker å eliminere kostnadene og tidkrevende faktorene som begrenser de samme opplevelser i virkeligheten. Metaverse kan la oss leve rikere liv, ikke erstatte dem. Vi har flere tekniske utfordringer som fortsatt må løses, men vi har en klar sett med mål som er oppnåelige under forutsetning av at hardware fortsetter å forbedre seg. Vi jobber tett med hardware-partnere for å sikre at VR-rommet utvikler seg raskt. Ut over VR ønsker vi å gjøre vår metaverse-opplevelse mulig utenfor VR. Vi kommer til å annonse mer informasjon om dette i de kommende månedene.

Takk for det flotte intervjuet, jeg ser frem til å følge din fremgang på din versjon av metaverse. Lesere som ønsker å lære mer bør besøke MeetKai.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.