Interviews

Dani Cherkassky, CEO en mede-oprichter van Kardome – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Dani Cherkassky, CEO en mede-oprichter van Kardome, brengt meer dan twee decennia ervaring in akoestiek, signaalverwerking en algoritme-ontwikkeling naar de voorhoede van innovatie in spraaktechnologie. Voordat hij Kardome oprichtte, was hij CTO bij Silentium Ltd., waar hij R&D-samenwerkingen leidde met Tier 1-bedrijven en onderzoeksinstellingen. Met een Ph.D. in Microfoonarray-verwerking van de Bar-Ilan Universiteit, combineert Cherkassky diepe technische expertise met een duidelijke missie — het elimineren van de frustraties van moderne spraakinteractie door technologie te creëren die echt naar mensen luistert, niet naar de ruis eromheen.

Kardome is een pionier in AI-gedreven ruimtelijke gehooroplossingen die duidelijke, gepersonaliseerde spraakinteracties leveren in elke omgeving — van auto’s en conferentiezalen tot slimme huizen en openbare ruimtes. De eigen speech-clustering-technologie scheidt stemmen op basis van locatie, waardoor apparaten elke spreker kunnen begrijpen alsof ze de enige persoon zijn die praat. Ontworpen om hardware-agnostisch en edge-ready te zijn, verhoogt Kardome’s platform de nauwkeurigheid van spraakherkenning, beveiliging en gebruikerservaring, en draagt het bij aan de volgende generatie mens-machinecommunicatie.

Wat inspireerde u en Dr. Alon Slapak om Kardome samen op te richten?

De inspiratie voor Kardome groeide uit een combinatie van fascinatie en frustratie. Met onze achtergrond in spraak en audio, zowel in de academische wereld als in de industrie, waren we enthousiast over de vooruitgang in spraakherkenning, vooral toen diepe neurale netwerken op het toneel verschenen.

In een stille laboratorium was de technologie fenomenaal. Maar zodra je de echte wereld in stapte, verdween die magie. We zagen dat in een lawaaierige auto, een druk kantoor of een chaotisch huis, state-of-the-art, geavanceerde systemen nauwelijks beter waren dan de technologie van de jaren 90. Dit was de grote barrière voor vooruitgang.

Spraak is de meest natuurlijke manier om met onze apparaten te communiceren, de ware opvolger van het touchscreen. Maar voor dat te gebeuren, moest de technologie de chaos van het echte leven overwinnen. We besloten om dat onze missie te maken. We brachten een jaar door in de garage, worstelend met geluidsgolfformules en testend van nieuwe ideeën, totdat we een doorbraak bereikten: de eerste demonstratie van wat nu bekend staat als Kardome’s Ruimtelijke Gehoor-technologie.

Op dat moment wisten we dat we de sleutel hadden. We richtten Kardome op niet alleen om een product te bouwen, maar om een revolutie te starten in hoe mensen en machines communiceren.

Veel spraakassistenten worstelen en frustreren gebruikers vaak wanneer stemmen overlappen of achtergrondruis de overhand krijgt. Waarom presteren conventionele methoden zo slecht in deze echte wereldomstandigheden?

Conventionele spraak-UI’s presteren slecht in de echte wereld omdat hun software een te simplistische methode gebruikt om geluid te begrijpen. De meeste systemen gebruiken meerdere microfoons om de richting van aankomst van een geluid te bepalen, een aanpak die alleen op de hoek van een geluid focust en andere cruciale 3D-ruimtelijke informatie negeert. Deze methode faalt onmiddellijk in elke echte wereldomgeving — zoals een auto, kantoor of woonkamer — omdat deze omgevingen vol zijn met reverberatie, waarbij geluidsgolven tegen elke reflecterende oppervlak botsen. Voor een systeem dat alleen richting begrijpt, wordt elke van deze botsende reflecties waargenomen als een nieuw geluid van een andere locatie.

Dit creëert een desoriënterend effect, alsof het apparaat in een hal van ‘akoestische spiegels’ zit, waar één stem lijkt te komen van honderden richtingen tegelijk. Omdat het systeem de afzonderlijke stemmen van de sprekers niet kan onderscheiden van de storm van reflecties, kan het de geluidssfeer niet goed decoderen. Deze fundamentele beperking is precies waarom huidige spraaktechnologieën zo’n slecht begrip hebben van audio in echte, chaotische scenario’s en uiteindelijk niet betrouwbaar presteren.

Kardome’s technologie behandelt elke persoon alsof hij de enige is die in de kamer spreekt. Wat is de technische doorbraak die dit mogelijk maakt, en hoe verschilt het van conventionele ver-afstands spraakherkenning?

Onze technische doorbraak is een eigen technologie genaamd Ruimtelijke Gehoor-AI, die conventionele methoden die alleen de richting van een geluid detecteren overtreft door in plaats daarvan de exacte locatie in driedimensionale ruimte te bepalen. Het werkt door het hele reflectiepatroon van een stem in een kamer te analyseren, de complexe manier waarop geluid tegen oppervlakken botsen als een unieke ‘akoestische vingerafdruk’ voor die specifieke positie. Onze AI leidt deze vingerafdruk onmiddellijk en passief af voor elke geluidsbron, waardoor het de omgeving effectief in kaart brengt. Deze locatie-gebaseerde aanpak is fundamenteel anders dan conventionele richting-gedreven systemen, die gemakkelijk worden verward door de reflecties die wij als waardevolle gegevens gebruiken. Terwijl zij één spreker horen als een menigte van echo’s, gebruikt onze technologie het complete reflectiepatroon om de werkelijke bron te bepalen. Het praktische resultaat is dat een Kardome-geactiveerd apparaat zich op één persoon in een lawaaierige omgeving kan richten en hem kan horen alsof hij alleen in een stille kamer spreekt. Bovendien zorgt Cognitie-AI ervoor dat het systeem niet alleen de woorden hoort, maar ook begrijpt wie ze zei en wat ze in context betekenen.

Men zegt dat Voice AI zijn “iPhone-moment” beleeft. Wat betekent dat voor u, en hoe dichtbij zijn we bij echte mainstream-adoptie?

Voor mij betekent de “iPhone-moment” dat spraak eindelijk klaar is om de standaardmanier te worden waarop we met onze apparaten communiceren.

Ik zie fabrikanten racen om spraak-AI-technologieën te integreren in hun hele productlijn. Auto’s worden stem-eerste interfaces voor veiligheidsredenen. Slimme huizen hebben stemgebruikersinterfaces nodig omdat het niet haalbaar is om overal aanraakschermen te plaatsen. Traditionele elektronica voegen ook stemmogelijkheden toe omdat het vaak sneller is dan menu’s navigeren. Terwijl veel technologieën de adoptie van spraak stimuleren, zal de ware revolutie worden bepaald door robots. Zodra robots in onze huizen en werkplekken geïntegreerd zijn, zal spraak opkomen als de enige echt effectieve en natuurlijke interface voor interactie.

Om deze co-existentie naadloos te maken, moeten robots ons op een menselijk niveau begrijpen. Zij moeten de context en nuance van natuurlijke spraak begrijpen, niet alleen sleutelwoorden. Zij vereisen een ruimtelijk bewustzijn dat zo precies is dat het magisch aanvoelt — instinctief wetend dat u degene bent die hen aanspreekt, zelfs in een lawaaierige kamer. Critisch is dat deze intelligentie op de edge moet werken voor instant, privé en betrouwbaar communiceren.

Dit is geen incrementele verbetering; het is een fundamentele verschuiving in hoe mensen en machines zullen communiceren. Wij bouwen de technologie om die herdefinitie te leiden. Ik zou zeggen dat we ongeveer 24 maanden verwijderd zijn van het kantelpunt waarop spraak de verwachte interface wordt in plaats van een leuke functie.

Hoe ziet u de toekomst van ruimtelijk gehoor en cognitie-AI in het transformeren van alledaagse apparaten — van auto’s en slimme huizen tot wearables en openbare ruimtes?

De transformatie gaat over het mogelijk maken van natuurlijke interactie waar u ook bent, zonder dat u uw gedrag hoeft aan te passen om de technologie te accommoderen. In auto’s betekent dit echt handsfree besturing dat werkt terwijl u op de snelweg rijdt met muziek aan en passagiers die praten. Slimme huizen worden echt intelligent als ze kunnen begrijpen wie er spreekt en van waar, en gelijktijdige verzoeken kunnen afhandelen zonder verwarring.

Het belangrijkste inzicht is dat ruimtelijk gehoor-AI niet alleen spraakherkenning verbetert — het maakt helemaal nieuwe interactieparadigma’s mogelijk. Wanneer apparaten de hele akoestische scène kunnen begrijpen, kunnen ze deelnemen aan de natuurlijke stroom van menselijke communicatie, in plaats van te vertrouwen op kunstmatige beperkingen. Wearables worden veel nuttiger als ze uw stem kunnen isoleren van omringende gesprekken, en openbare ruimtes kunnen gepersonaliseerde maar privé stemassistentie bieden. Zoals eerder vermeld voor robots, vormt dit een fundamentele verschuiving in hoe mensen en machines zullen communiceren met robots die in ons leven geïntegreerd zijn.

Privacy is een groeiende zorg met altijd-luisterende apparaten. Hoe balanceert Kardome de vraag naar on-device-verwerking met de behoefte aan prestaties en nauwkeurigheid?

De overgrote meerderheid van de huidige Voice AI-oplossingen werkt op een hybride model, bestaande uit een on-device (edge)-component en een cloud-gebaseerde component. Terwijl edge-verwerking geen privacyproblemen oplevert omdat gegevens nooit het apparaat van de gebruiker verlaten, stelt cloud-verwerking een aanzienlijke uitdaging voor gegevensprivacy.

Kardome adresseert deze uitdaging door de mogelijkheden van de edge-component aanzienlijk uit te breiden. Door meer gegevens lokaal te verwerken en de afhankelijkheid van de cloud te verminderen, zorgt Kardome ervoor dat gevoelige spraakgegevens nooit het apparaat van de gebruiker verlaten, waardoor het een superieure privacybescherming biedt in vergelijking met andere systemen op de markt.

Een groot probleem met “altijd-luisterende” apparaten is niet de microfoon die audio opneemt, maar het risico dat die audio naar de cloud wordt geüpload voor analyse. In de praktijk betekent de prohibitieve kosten van continue cloud-verwerking dat de meeste commerciële systemen dit vermijden, maar dit gaat ten koste van een lagere kwaliteit en minder responsieve Voice UI.

Kardome lost dit dilemma op door krachtige, altijd-aanwezige taalmodellen naar het edge-apparaat zelf te brengen. Met onze technologie worden de akoestische scène, natuurlijke spraak en context in real-time rechtstreeks op het apparaat geanalyseerd. Geen enkele spraakgegevens worden ooit geüpload of opgeslagen. Deze innovatieve aanpak stelt Kardome in staat om zowel robuuste gegevensprivacy als een hoogwaardige Voice UI te bieden, waardoor de compromis die gebruikers momenteel moeten maken, wordt geëlimineerd.

Als we naar de industrie kijken, wat zijn de grootste hindernissen waar spraak-AI nog overheen moet komen voordat het de dominante interface wordt in consumentenelektronica?

De grootste hindernis is dat spraak-AI nog niet communiceert zoals mensen doen. Totdat spraak-AI kan horen en begrijpen als mensen, met volledige contextbewustzijn en het vermogen om conversatie te begrijpen, zal het niet de primaire interface worden die mensen willen. Een significante technische hindernis op dit moment is dat de meeste spraak-AI-technologie cloud-gebaseerd is. Dit voorkomt inherent continue luisteren en blokkeert dus het begrijpen van conversatie.

De doorbraak zal komen wanneer spraaksystemen echt conversatiecontext en respons kunnen begrijpen met hetzelfde intuïtieve bewustzijn dat mensen hebben. Dat is wanneer spraak de dominante interface zal worden in alle consumentenelektronica.

Hoe denkt u dat de relatie van consumenten met spraakassistenten zal evolueren zodra nauwkeurigheid en betrouwbaarheid in lawaaierige omgevingen zijn opgelost?

Zodra betrouwbaarheid en natuurlijke conversatie zijn opgelost, zullen spraakassistenten overgaan van noviteitenfuncties naar essentiële interfaces waarop mensen de hele dag vertrouwen. Wanneer mensen weten dat spraak-AI hen correct zal begrijpen, zelfs in uitdagende omgevingen, zullen ze ophouden de technologie te accommoderen en instinctief met natuurlijke taal en contextuele conversaties gaan communiceren.

De toekomst van spraakinteractie zal predictief en proactief zijn. Stel u voor dat uw apparaat niet alleen uw woorden begrijpt, maar ook uw toon, emotionele signalen en conversatie-onderstromen. Huidige systemen worstelen met het natuurlijke ritme van conversatie en kunnen interrupties, beurten en contextuele begrip niet aan. Mensen passen zich aan als ze worden onderbroken; spraak-AI raakt vaak verward. Voor OEM’s is de uitdaging om spraak-AI te integreren die deze toekomstige interface kan bieden zonder de complexiteit en hardwarevereisten van de huidige oplossingen.

Tenslotte, waar ziet u Kardome en het spraak-AI-ecosysteem over vijf jaar, en welke mijlpalen zullen bepalen of we echt de leeftijd van spraak-eerste computing zijn binnengegaan?

Over vijf jaar zal spraak-AI even alomtegenwoordig zijn als aanraakschermen en toetsenborden vandaag, en het zal worden verwacht in vrijwel elk computertype. Kardome zal het operationele systeem zijn dat gebruikers in staat stelt om hun apparaten met spraak te bedienen, waardoor natuurlijke interactie met elk apparaat in elke omgeving mogelijk wordt — van robots tot slimme bril, tot auto’s.

De definiërende mijlpalen zullen gedragsmatig zijn in plaats van technologisch. We zullen weten dat we spraak-eerste computing hebben bereikt wanneer mensen ophouden na te denken over spraakopdrachten en natuurlijke conversaties met hun omgeving beginnen, wanneer multi-gebruikersomgevingen naadloos werken, en wanneer kinderen opgroeien met de verwachting om met elk apparaat natuurlijk te praten. De uiteindelijke maatstaf zal niet zijn hoe geavanceerd onze technologie wordt, maar hoe natuurlijk mensen met de digitale wereld communiceren.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Kardome bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.