Intervjuer

Dani Cherkassky, CEO og medgrunnlegger av Kardome – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Dani Cherkassky, CEO og medgrunnlegger av Kardome, bringer mer enn to tiår med erfaring innen akustikk, signalbehandling og algoritmeutvikling til fremtredende innovasjon innen taleteknologi. Før han grunnla Kardome, var han CTO i Silentium Ltd., der han ledet FoU-samarbeid med Tier 1-selskaper og forskningsinstitusjoner. Med en Ph.D. i mikrofonarraybehandling fra Bar-Ilan University, kombinerer Cherkassky dypt teknisk ekspertise med en klar misjon — å eliminere frustrasjonene med moderne taleinteraksjon ved å skape teknologi som virkelig lytter til mennesker, ikke støyen rundt dem.

Kardome er en pionér innen AI-drevne romhørselsløsninger som leverer klare, personlige taleinteraksjoner i enhver miljø — fra biler og konferanserom til smarte hjem og offentlige rom. Deres proprietære taleklustering-teknologi skiller stemmer basert på plassering, og lar enheter forstå hver enkelt taler som om de var den eneste som snakker. Designet for å være uavhengig av hardware og klar for kant, forbedrer Kardomes plattform talegjenkjenningens nøyaktighet, sikkerhet og brukeropplevelse, og driver den neste generasjonen av menneske-maskin-kommunikasjon.

Hva inspirerte deg og Dr. Alon Slapak til å grunnlegge Kardome?

Inspirasjonen til Kardome vokste frem fra en kombinasjon av fascinasjon og frustrasjon. Med vår bakgrunn i tale og audio, både i akademia og industri, var vi begeistret for fremgangen i talegjenkjenning, særlig da dype neurale nettverk kom inn i bildet.

I et stille laboratorium var teknologien fenomenal. Men øyeblikket du trådte inn i den virkelige verden, forsvant magien. Vi observerte at i en støyende bil, et travelt kontor eller et kaotisk hjem, var avanserte systemer som var på forkant, bare marginalt bedre enn teknologien fra 1990-tallet. Dette var den store barrieren for fremgang.

Tale er den mest naturlige måten å interagere med våre enheter, den sanne etterfølgeren til berøringsskjermer. Men for at dette skal skje, må teknologien overvinne kaoset i det virkelige liv. Vi bestemte oss for å gjøre dette til vår misjon. Vi tilbrakte et år i garasjen, og kjempet med lydbølge-propagasjonsekvasjon og testet nye ideer, til vi oppnådde et gjennombrudd: den første demonstrasjonen av det som nå er kjent som Kardomes romhørselsteknologi.

Mange taleassistenter sliter og frustrerer ofte brukerne når stemmer overlapper eller bakgrunnstøy tar over. Hvorfor fungerer konvensjonelle metoder så dårlig i disse virkelige forhold?

konvensjonelle talebrukergrensesnitt fungerer dårlig i den virkelige verden fordi deres programvare avhenger av en for enkel metode for å forstå lyd. De fleste systemer bruker flere mikrofoner for å bestemme lydens ankomstretning, en tilnærming som bare fokuserer på vinkelen til en lyd og ignorerer andre viktige 3D-romlige informasjon. Denne metoden svikter umiddelbart i enhver virkelig setting — som en bil, et kontor eller et vennlig rom — fordi disse miljøene er fylt med resonans, hvor lydbølger bouncer av hver reflekterende overflate. For et system som bare forstår retning, hver av disse bouncende refleksjonene oppfattes som en ny lyd fra en annen plassering.

Dette skaper en desorienterende effekt, som om enheten var i et “akustisk speil”, hvor en enkelt stemme synes å komme fra hundrevis av retninger samtidig. Ute av stand til å skille de distinkte stemmene til talerne fra stormen av refleksjoner, kan systemet ikke korrekt dekode lydlandskapet. Dette grunnleggende begrensningen er nettopp hvorfor nåværende taleteknologier har så dårlig oppfattning av audio i virkelige, kaotiske scenarioer og til slutt ikke fungerer pålitelig.

Kardomes teknologier behandler hver person som om de er den eneste som snakker i rommet. Hva er den tekniske gjennombruddet som gjør dette mulig, og hvordan er det forskjellig fra konvensjonell fjernfelt-talegjenkjenning?

Vårt tekniske gjennombrudd er en proprietær teknologi kalt romhørsel AI, som overgår konvensjonelle metoder som bare detekterer en lyds retning, og i stedet bestemmer dens nøyaktige plassering i tredimensjonalt rom. Den fungerer ved å analysere hele refleksjonsmønsteret en stemme skaper i et rom, og behandler det komplekse måten lyd bouncer av overflater som en unik “akustisk fingeravtrykk” for den spesifikke posisjonen. Vår AI infererer umiddelbart og passivt dette fingeravtrykket for hver lydkilde, og kartlegger effektivt miljøet. Denne plasseringsbaserte tilnærmingen er grunnleggende forskjellig fra konvensjonelle retning-drevne systemer, som lett blir forvirret av de refleksjonene vi bruker som verdifull data. Mens de hører en enkelt taler som en mengde ekko, bruker vår teknologi hele refleksjonsmønsteret for å bestemme den faktiske kilden. Den praktiske resultaten er at en Kardome-aktivert enhet kan fokusere på en person i et støyende miljø og høre dem som om de snakket alene i et stille rom. I tillegg sikrer Cognition AI at systemet ikke bare hører ordene, men også forstår hvem som sa dem og hva de mener i kontekst.

Tale-AI sies å ha sin “iPhone-øyeblikk”. Hva betyr det fra din perspektiv, og hvor nærme er vi til sannt mainstream-tilpasning?

For meg betyr “iPhone-øyeblikket” at tale endelig er klar til å bli den standard måten vi interagerer med beregningsenheter.

Jeg ser på produsentene som kappler for å integrere tale-AI-teknologier over hele produktlinjene. Biler blir tale-første grensesnitt av sikkerhetsgrunner. Smarthjem trenger talebrukergrensesnitt fordi det ikke er mulig å plassere berøringsskjermer overalt. Tradisjonell elektronikk legger også til talefunksjoner fordi det ofte er raskere enn å navigere i menyer. Mens mange teknologier driver tilpasningen av tale, vil den sanne revolusjonen bli diktet av roboter. Når roboter blir integrert i hjem og arbeidsplasser, vil tale oppstå som den eneste virkelig effektive og naturlige grensesnittet for interaksjon.

I praktiske termer, hvordan ser du på at romhørsel og kognisjon AI transformerer hverdagsenheter — fra biler og smarthjem til wearables og offentlige rom?

Transformasjonen handler om å muliggjøre naturlig interaksjon hvor du enn er, uten å tilpasse ditt atferd for å akkommodere teknologien. I biler betyr dette virkelig håndfrie kontroll som fungerer mens du kjører i høy hastighet med musikk som spiller og passasjerer som snakker. Smarthjem blir virkelig intelligente når de kan forstå hvem som snakker og fra hvor, og håndtere samtidige forespørsler uten forvirring.

Privatliv er en voksende bekymring med enheter som alltid lytter. Hvordan balanserer Kardome kravet om på-enhet-behandling med behovet for ytelse og nøyaktighet?

De fleste av dagens tale-AI-løsninger opererer på en hybridmodell, bestående av en på-enhet (kant)-komponent og en skybasert komponent. Mens på-enhet-behandling ikke utgjør noen privatlivsproblemer siden data aldri forlater brukerens enhet, presenterer skybehandling en betydelig utfordring til data-privatliv.

Kardome møter denne utfordringen ved å utvide på-enhet-komponentens evner betydelig. Ved å prosessere mer data lokalt og redusere avhengigheten av skyen, sikrer Kardome at følsomme taledata aldri forlater enheten, og tilbyr dermed overlegen privatlivsbeskyttelse sammenlignet med andre systemer på markedet.

I et bredere industriperspektiv, hva er de største hindrene tale-AI fortsatt må overvinne før det blir det dominerende grensesnittet over hele forbruker-elektronikken?

Det største hindret er at tale-AI fortsatt ikke kommuniserer som mennesker gjør. Før tale-AI kan høre og forstå som mennesker, med full kontekstbevissthet og evnen til å forstå konversasjonsflyt, vil det ikke bli det primære grensesnittet folk ønsker det til å være. Et betydelig teknisk hinder på dette punktet er at de fleste tale-AI-teknologier er skybasert. Dette forhindrer i seg selv kontinuerlig lytting og blokkerer dermed konversasjonsflyt-forståelse.

Hvordan tror du forbrukerens forhold til taleassistenter vil utvikle seg når nøyaktighet og pålitelighet i støyende miljøer er løst?

Når pålitelighet og naturlig samtale er løst, vil taleassistenter gå over fra nyhetens interesse til essensielle grensesnitt som folk avhenger av gjennom dagen. Når folk vet at tale-AI vil forstå dem riktig første gang, selv i utfordrende miljøer, vil de slutte å tilpasse seg teknologien og begynne å bruke den instinktivt med naturlig språk og kontekstuell samtale.

Til slutt, hvor ser du på Kardome og tale-AI-økosystemet om fem år, og hva vil være milepælene som definerer om vi har gått inn i alderen av tale-først-datamaskiner?

Om fem år vil tale-AI være like vanlig som berøringsskjermer og tastatur er i dag, og det vil være forventet i nesten alle datamaskiner. Kardome vil være det operative systemet som vil tillate brukerne å operere enhetene sine med tale, og muliggjøre naturlig interaksjon med enhver enhet i enhver miljø — fra roboter til smarte briller, biler og smarthjem.

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Kardome.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.