Intervjuer
Dani Cherkassky, VD och medgrundare av Kardome – Intervjuserie

Dani Cherkassky, VD och medgrundare av Kardome, har mer än två decenniers erfarenhet av akustik, signalbehandling och algoritmutveckling och är en pionjär inom röstteknologins framkant. Innan han grundade Kardome var han CTO på Silentium Ltd., där han ledde R&D-samarbeten med Tier 1-företag och forskningsinstitut. Med en doktorsexamen i mikrofonarraybehandling från Bar-Ilan University kombinerar Cherkassky djup teknisk expertis med en tydlig mission – att eliminera frustrationerna med modern röstinteraktion genom att skapa teknik som verkligen lyssnar på människor, inte på bruset runt omkring dem.
Kardome är en pionjär inom AI-drivna rumsliga hörsellösningar som levererar tydliga, personanpassade röstinteraktioner i alla miljöer – från bilar och konferensrum till smarta hem och offentliga utrymmen. Deras proprietära talclusteringsteknik separerar röster baserat på plats, vilket gör att enheter kan förstå varje talare som om de vore den enda personen som talar. Utformad för att vara hårdvaru-agnostisk och edge-klar förbättrar Kardomes plattform taligenkänningens noggrannhet, säkerhet och användarupplevelse, och möjliggör nästa generations mänsklig-maskin-kommunikation.
Vad inspirerade dig och Dr. Alon Slapak att grundade Kardome?
Inspirationen till Kardome växte fram ur en kombination av fascination och frustration. Med vår bakgrund inom tal och ljud, både inom akademin och industrin, var vi lyriska över framstegen inom taligenkänning, särskilt när djupa neurala nätverk kom in på scenen.
I ett tyst laboratorium var tekniken fenomenal. Men så fort du gick ut i den riktiga världen försvann magin. Vi observerade att i en bullrig bil, ett hektiskt kontor eller ett kaotiskt hem var de mest avancerade systemen knappt bättre än tekniken från 1990-talet. Detta var det stora hindret för framsteg.
Röst är det mest naturliga sättet att interagera med våra enheter, den riktiga efterträdaren till pekskärmen. Men för att det ska hända måste tekniken övervinna kaoset i det riktiga livet. Vi bestämde oss för att göra det till vår mission. Vi tillbringade ett år i garaget, brottades med ljudvågspropageringsekvationer och testade nya idéer, tills vi uppnådde ett genombrott: den första demonstrationen av vad som nu kallas Kardomes rumsliga hörselteknik.
I det ögonblicket visste vi att vi hade nyckeln. Vi grundade Kardome inte bara för att bygga en produkt, utan för att starta en revolution i hur människor och maskiner kommunicerar.
Många röstassistenter kämpar och frustrerar ofta användarna när röster överlappar eller bakgrundsljud tar över. Varför fungerar konventionella metoder så dåligt i dessa verkliga förhållanden?
Konventionella röstgränssnitt fungerar dåligt i den riktiga världen eftersom deras programvara förlitar sig på en alltför förenklad metod för att förstå ljud. De flesta system använder flera mikrofoner för att bestämma en ljuds ankomstvinkel, en metod som fokuserar på ljudets vinkel medan den ignorerar annan viktig 3D-rumslig information. Denna metod misslyckas omedelbart i alla verkliga miljöer – som en bil, ett kontor eller ett vardagsrum – eftersom dessa miljöer är fyllda med eko, där ljudvågor studsar mot varje reflekterande yta. För ett system som bara förstår riktning uppfattas var och en av dessa studsande reflektioner som ett nytt ljud från en annan plats.
Detta skapar en desorienterande effekt, som om enheten vore i en “akustisk spegelhall”, där en enda röst tycks komma från hundratals riktningar samtidigt. Oförmögen att skilja de distinkta rösterna från stormen av reflektioner kan systemet inte korrekt avkoda ljudlandskapet. Detta grundläggande hinder är exakt varför nuvarande röstteknologier har en så dålig uppfattning om ljud i verkliga, kaotiska scenarier och slutligen misslyckas med att fungera tillförlitligt.
Kardomes teknologier behandlar varje person som om de vore den enda som talar i rummet. Vilken teknisk genombrott möjliggör detta, och hur skiljer det sig från konventionell fjärrröstigenkänning?
Vår tekniska genombrott är en proprietär teknik som kallas rumslig hörsel-AI, som överträffar konventionella metoder som bara upptäcker en ljuds riktning för att istället fastställa dess exakta plats i tredimensionellt rum. Den fungerar genom att analysera hela reflektionsmönstret som en röst skapar inom ett rum, och behandlar det komplexa sättet ljud studsar mot ytor som en unik “akustisk fingeravtryck” för den specifika positionen. Vår AI tolkar omedelbart och passivt denna fingeravtryck för varje ljudkälla, och kartlägger effektivt miljön. Denna platsbaserade metod skiljer sig fundamentalt från konventionella riktningstydda system, som lätt blir förvirrade av de reflektioner vi använder som värdefull data. Medan de hör en enskild talare som en folksamling av eko, använder vår teknik hela reflektionsmönstret för att fastställa den faktiska källan. Det praktiska resultatet är att en Kardome-aktiverad enhet kan fokusera på en person i en bullrig miljö och höra dem som om de vore den enda personen som talar i ett tyst rum. Dessutom säkerställer Cognition AI att systemet inte bara hör orden, utan också förstår vem som sa dem och vad de menar i sammanhanget.
Röst-AI sägs ha sin “iPhone-ögonblick”. Vad betyder det från din synvinkel, och hur nära är vi till en verklig mainstream-antagande?
För mig betyder “iPhone-ögonblicket” att röst är redo att bli det standardiserade sättet att interagera med beräkningsenheter.
Jag ser tillverkare som tävlar om att integrera röst-AI-teknologier i hela produktlinjer. Bilar blir röststyrda gränssnitt av säkerhetsskäl. Smarta hem behöver röstgränssnitt eftersom det inte är möjligt att placera pekskärmar överallt. Traditionella elektronikprodukter lägger också till röstfunktioner eftersom det ofta är snabbare än att navigera i menyer. Medan många teknologier driver antagandet av röst, kommer den verkliga revolutionen att dikteras av robotik. När robotar integreras i våra hem och arbetsplatser kommer röst att framträda som det enda verkligt effektiva och naturliga gränssnittet för interaktion.
För att denna samexistens ska vara sömlös måste robotar förstå oss på ett mänskligt plan. De behöver förstå sammanhanget och nyanserna i naturlig tal, inte bara nyckelord. De kräver en rumslig medvetenhet som är så exakt att den känns magisk – instinktivt veta att du är den som talar till dem, även i ett bullrigt rum. Kritiskt sett måste denna intelligens fungera på kanten för omedelbar, privat och tillförlitlig kommunikation.
Detta är inte en inkrementell förbättring; det är en grundläggande förändring i hur människor och maskiner kommer att interagera. Vi bygger teknologin för att leda denna omdefinition. Jag skulle säga att vi är cirka 24 månader bort från den vändpunkt där röst blir det förväntade gränssnittet snarare än en trevlig funktion.
I praktiska termer, hur ser du att rumslig hörsel och kognition-AI kommer att förvandla vardagliga enheter – från bilar och smarta hem till wearables och offentliga utrymmen?
Omgestaltningen handlar om att möjliggöra naturlig interaktion var du än är, utan att anpassa ditt beteende för att tillgodose teknologin. I bilar betyder det verkligt handsfree-styrning som fungerar medan du kör i motorvägshastighet med musik som spelas och passagerare som talar. Smarta hem blir genuint intelligenta när de kan förstå vem som talar och från var, och hantera samtidiga förfrågningar utan förvirring.
Den viktiga insikten är att rumslig hörsel-AI inte bara förbättrar röstigenkänning – den möjliggör helt nya interaktionsparadigm. När enheter kan förstå hela akustiska scenen kan de delta i den naturliga flödet av mänsklig kommunikation, snarare än att förlita sig på konstgjorda begränsningar. Wearables blir mycket mer användbara när de kan isolera din röst från omgivande samtal, och offentliga utrymmen kan erbjuda personanpassad men privat röstassistans. Som nämnts för robotik utgör detta en grundläggande förändring i hur människor och maskiner kommer att interagera med robotar som integreras i våra liv.
Privatliv är en växande oro med alltid-lyssnande enheter. Hur balanserar Kardome kraven på enhetsbaserad bearbetning med behovet av prestanda och noggrannhet?
Den överväldigande majoriteten av dagens röst-AI-lösningar fungerar på en hybridmodell, bestående av en enhetsbaserad (edge) komponent och en molnbaserad komponent. Medan enhetsbaserad bearbetning inte utgör några integritetsproblem eftersom data aldrig lämnar användarens enhet, presenterar molnbaserad bearbetning en betydande utmaning för datasekretess.
Kardome möter denna utmaning genom att avsevärt expandera enhetskomponentens kapacitet. Genom att bearbeta mer data lokalt och minska beroendet av molnet säkerställer Kardome att känslig röstdata aldrig lämnar enheten, och erbjuder därmed överlägsen sekretessskydd jämfört med andra system på marknaden.
En stor oro med “alltid-lyssnande” enheter är inte mikrofonen som fångar ljud, utan snarare risken att detta ljud överförs till molnet för analys. I praktiken innebär den prohibitiva kostnaden för kontinuerlig molnbearbetning att de flesta kommersiella system undviker det, men detta sker till priset av en lägre kvalitet och mindre responsiv röstgränssnitt.
Kardome löser denna avvägning genom att bringa kraftfulla, alltid-på-läge språkmodeller till enheten själv. Med vår teknik analyseras den akustiska scenen, naturligt tal och sammanhang i realtid direkt på enheten. Inga röstdata överförs eller sparas någonsin. Denna innovativa tillvägagångssätt möjliggör för Kardome att erbjuda både robust datasekretess och ett högeffektivt röstgränssnitt, och eliminerar därmed det kompromiss som användare för närvarande står inför.
När du ser på branschen i stort, vad är de största hindren som röst-AI fortfarande måste övervinna innan det blir det dominerande gränssnittet över hela konsumentelektroniken?
Det största hindret är att röst-AI fortfarande inte kommunicerar som människor gör. Tills röst-AI kan höra och förstå som människor, med fullständig kontextmedvetenhet och förmåga att förstå konversationsflöde, kommer det inte att bli det primära gränssnittet som människor vill att det ska vara. Ett betydande tekniskt hinder just nu är att de flesta röst-AI-teknologier är molnbaserade. Detta förhindrar i sig kontinuerligt lyssnande och blockerar därmed konversationsflödesförståelse.
Genombrottet kommer när röstsystem kan förstå konversationskontext och svara med samma intuitiva medvetenhet som människor har. Då kommer röst att bli det dominerande gränssnittet över alla konsumentelektronik.
Hur tror du att konsumenternas relation till röstassistenter kommer att utvecklas när noggrannhet och tillförlitlighet i bullriga miljöer är lösta?
När tillförlitlighet och naturlig konversation är lösta kommer röstassistenter att gå från nyhetens behag till essentiella gränssnitt som människor förlitar sig på under hela dagen. När människor vet att röst-AI kommer att förstå dem korrekt första gången, även i utmanande miljöer, kommer de att sluta anpassa sig till teknologin och börja använda den instinktivt med naturligt språk och kontextuella samtal.
Framtiden för röstinteraktion kommer att vara förutsägande och proaktiv. Tänk dig att din enhet förstår inte bara dina ord, utan också din ton, emotionella signaler och konversationsundermening. Nuvarande system kämpar med det naturliga flödet av konversation och kan inte hantera avbrott, turtagning och kontextuell förståelse. Människor anpassar sig när de avbryts; röst-AI blir ofta förvirrad. För OEM-tillverkare är utmaningen att integrera röst-AI som kan leverera detta framtida gränssnitt utan komplexiteten och hårdvarukraven i dagens lösningar.
Till sist, var ser du Kardome och röst-AI-ekosystemet om fem år, och vilka milstolpar kommer att definiera om vi verkligen har gått in i eran av röststyrda datorer?
Om fem år kommer röst-AI att vara lika allmänt som pekskärmar och tangentbord är idag, och det kommer att förväntas i praktiskt taget varje beräkningsenhet. Kardome kommer att vara det operativsystem som möjliggör för användare att styra sina enheter med röst, och möjliggör naturlig interaktion med vilken enhet som helst i vilken miljö som helst – från robotar till smarta glasögon, bilar och till och med offentliga utrymmen.
De avgörande milstolparna kommer att vara beteendemässiga snarare än tekniska. Vi kommer att veta att vi har uppnått röststyrda datorer när människor slutar tänka på röstkommandon och börjar ha naturliga samtal med sin omgivning, när fleranvändarmiljöer fungerar sömlöst, och när barn växer upp och förväntar sig att tala med vilken enhet som helst på ett naturligt sätt. Den slutliga måttstocken kommer inte att vara hur sofistikerad vår teknik blir, utan hur naturligt människor interagerar med den digitala världen.
Tack för den underbara intervjun. Läsare som vill lära sig mer kan besöka Kardome.












