Rozhovory

Dani Cherkassky, CEO a spoluzakladatel Kardome – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Dani Cherkassky, CEO a spoluzakladatel Kardome, přináší více než dvě desetiletí zkušeností v oblasti akustiky, zpracování signálů a vývoje algoritmů do popředí inovací ve voice technologii. Před založením Kardome působil jako technický ředitel ve společnosti Silentium Ltd., kde vedl výzkumnou a vývojovou spolupráci s předními společnostmi a výzkumnými institucemi. S doktorským titulem v oboru zpracování mikrofonových polí na Bar-Ilan University kombinuje Cherkassky hluboké technické znalosti s jasnou misí — eliminovat frustrace z moderní hlasové interakce vytvořením technologie, která skutečně naslouchá lidem, ne hluku kolem nich.

Kardome je průkopníkem v oblasti AI poháněných prostorových sluchových řešení, která poskytují jasnou, personalizovanou hlasovou interakci v jakémkoli prostředí — od automobilů a konferenčních místností po chytré domy a veřejné prostory. Jeho proprietární technologie shlukování řeči rozděluje hlasy na základě polohy, umožňující zařízením pochopit každého mluvčího, jako by byl jediným osobou, která mluví. Navrženo tak, aby bylo hardwarově nezávislé a připravené pro okraj, platforma Kardome zvyšuje přesnost rozpoznávání řeči, bezpečnost a uživatelský zážitek, pohánějící další generaci komunikace mezi lidmi a stroji.

Co vás a Dr. Alona Slapaka inspirovalo k založení Kardome?

Inspirace pro Kardome vyrostla z kombinace fascinace a frustrace. S našimi zkušenostmi v oblasti řeči a audio, både v akademii a průmyslu, byli jsme nadšeni pokrokem v rozpoznávání řeči, zejména když se na scéně objevily hluboké neuronové sítě.

V tiché laboratoři byla technologie fantastická. Ale okamžik, kdy jste vkročili do skutečného světa, ta magie zmizela. Pozorovali jsme, že v hlučném autě, busy kanceláři nebo chaotickém domě, pokročilé systémy byly stěží lepší než technologie z 90. let. To byla velká bariéra pro pokrok.

Hlas je nejvíce přirozený způsob, jak interagovat s našimi zařízeními, skutečný nástupce dotykového displeje. Ale aby se to stalo, technologie musela překonat chaos skutečného života. Rozhodli jsme se, že to bude naše mise. Strávili jsme rok v garáži, zápasíce se zvukovými vlnovými rovnicemi a testováním nových nápadů, až jsme dosáhli průlomu: první demonstraci toho, co je nyní známo jako prostorové sluchové technologie Kardome.

V tu chvíli jsme věděli, že máme klíč. Založili jsme Kardome ne pouze proto, aby postavili produkt, ale aby zahájili revoluci v tom, jak lidé a stroje komunikují.

Mnohé hlasové asistenty bojují a často frustrují uživatele, když se hlasy překrývají nebo pozadí hluku přebírá. Proč konvenční metody fungují tak špatně v těchto skutečných podmínkách?

Konvenční hlasové rozhraní fungují špatně ve skutečném světě, protože jejich software spoléhá na příliš jednoduchou metodu pro pochopení zvuku. Většina systémů používá více mikrofonů pro určení směru příjezdu zvuku, přístup, který se zaměřuje pouze na úhel zvuku, zatímco ignoruje další kritické 3D prostorové informace. Tato metoda okamžitě selhává v jakémkoli skutečném prostředí — jako je auto, kancelář nebo obývací pokoj — protože tyto prostředí jsou plné ozvěny, kde se zvukové vlny odrážejí od každé reflektivní plochy. Pro systém, který chápe pouze směr, každá z těchto odražených reflexí je vnímána jako nový zvuk z jiného místa.

To vytváří dezorientující efekt, jako by zařízení bylo v hale “akustických zrcadel”, kde jeden hlas parece pocházet z stovek směrů současně. Neschopný rozlišit rozdílné hlasy mluvčích od bouře reflexí, systém nemůže správně dekódovat zvukový scénář. Tato fundamentální omezení je přesně důvod, proč současné hlasové technologie mají tak špatné vnímání audio ve skutečných, chaotických scénářích a nakonec selhávají při spolehlivém fungování.

Technologie Kardome považují každou osobu za jedinou mluvějící osobu v místnosti. Jaký technický průlom to umožňuje a jak se liší od konvenční vzdálené hlasové rozpoznávání?

Náš technický průlom je proprietární technologie nazvaná Prostorové sluchové AI, která překonává konvenční metody, které pouze detekují směr zvuku, a místo toho přesně určuje jeho polohu v trojrozměrném prostoru. Funkční analýzou celého reflexního vzoru, který hlas vytváří v místnosti, zachází s komplexním způsobem, jakým se zvuk odráží od povrchů, jako s jedinečným “akustickým otiskem prstu” pro tu konkrétní polohu. Naše AI okamžitě a pasivně odvozuje tento otisk pro každý zdroj zvuku, efektivní mapování prostředí. Tento přístup založený na poloze je fundamentálně odlišný od konvenčních směrových systémů, které se snadno zmátí těmito reflexemi, které my používáme jako cenná data. Zatímco oni slyší jednoho mluvčího jako dav ozvěn, naše technologie využívá kompletní reflexní vzor pro určení skutečného zdroje. Praktickým výsledkem je, že zařízení s Kardome může se soustředit na jednu osobu v hlučném prostředí a slyšet ji, jako by mluvila sama v tiché místnosti. Kromě toho zajišťuje kognitivní AI, že systém nejen slyší slova, ale také chápe, kdo je řekl a co znamenají v kontextu.

Hlasová AI má své “iPhonové okamžik”. Z vašeho pohledu, co to znamená a jak blízko jsme k skutečnému mainstreamovému přijetí?

Pro mě “iPhonový okamžik” znamená, že hlas je konečně připraven stát se standardním způsobem, jak interagujeme s výpočetními zařízeními.

Vidím, jak výrobci závodí, aby integrovali hlasové AI technologie napříč celými produktovými řadami. Automobily se stávají hlasovými rozhraními z bezpečnostních důvodů. Chytré domy potřebují hlasová uživatelská rozhraní, protože není možné umístit dotykové displeje všude. Tradiční elektronika také přidává hlasové schopnosti, protože je to často rychlejší než navigace v menu. Zatímco mnoho technologií pohání přijetí hlasu, skutečná revoluce bude diktována robotikou. Jakmile se roboti integrují do našich domovů a pracovišť, hlas se stane jediným skutečně účinným a přirozeným rozhraním pro interakci.

Pro tuto bezproblémovou koexistenci musí roboti rozumět nám na lidské úrovni. Musí chápat kontext a nuance přirozené řeči, ne pouze klíčová slova. Musí mít prostorovou povědomí tak přesné, že to feels jako magie — instinktivně vědět, že vy mluvíte jim, i v hlučném pokoji. Kriticky, tato inteligence musí fungovat na okraji pro okamžitou, soukromou a spolehlivou komunikaci.

To není inkrementální zlepšení; je to fundamentální posun v tom, jak lidé a stroje budou komunikovat. Budujeme technologii, která povede tuto redefinici. Řekl bych, že jsme asi 24 měsíců od bodu inflexe, kde se hlas stane očekávaným rozhraním, nikoli pouze hezkou funkcí.

Jak prakticky vidíte prostorové sluchové a kognitivní AI transformující každodenní zařízení — od automobilů a chytrých domovů po nositelná zařízení a veřejné prostory?

Transformace spočívá v umožnění přirozené interakce, kamkoli jste, bez přizpůsobování vašeho chování technologii. V automobilech to znamená skutečně bezruční ovládání, které funguje při jízdě na dálnici s hudbou a cestujícími, kteří mluví. Chytré domy se stávají skutečně inteligentními, když mohou pochopit, kdo mluví a odkud, zpracovávají současně požadavky bez zmatku.

Klíčovým vhledem je, že prostorové sluchové AI ne pouze zlepšují rozpoznávání hlasu — umožňují zcela nové interakční paradigma. Když zařízení mohou pochopit celý akustický scénář, mohou se účastnit přirozeného toku lidské komunikace, místo aby se spoléhaly na umělé omezení. Nositelná zařízení se stávají mnohem užitečnějšími, když mohou izolovat váš hlas od okolních konverzací, a veřejné prostory mohou nabízet personalizovanou, ale soukromou hlasovou asistenci. Jak jsem zmínil pro robotiku, tato změna představuje fundamentální posun v tom, jak lidé a stroje budou interagovat s roboty, které se stanou součástí našeho života.

Je soukromí rostoucí obavou s vždy naslouchajícími zařízeními. Jak Kardome vyvažuje poptávku po zpracování na zařízení s potřebou výkonu a přesnosti?

Velká většina dnešních řešení Voice AI funguje na hybridním modelu, skládajícím se z komponenty na zařízení (okraji) a cloudové komponenty. Zatímco zpracování na okraji nepředstavuje žádné problémy s ochranou soukromí, protože data nikdy neopouštějí zařízení uživatele, cloudové zpracování představuje významnou výzvu pro ochranu dat.

Kardome řeší tuto výzvu významně rozšiřováním možností komponenty na okraji. Zpracováváním více dat místně a snižováním závislosti na cloudu zajišťuje Kardome, že citlivá hlasová data nikdy neopouštějí zařízení, nabízející tak lepší ochranu soukromí ve srovnání s jinými systémy na trhu.

Velkou obavou u “vždy naslouchajících” zařízení není mikrofon, který zachycuje audio, ale spíše riziko, že toto audio bude nahráno do cloudu pro analýzu. V praxi je prohibitivní náklad na nepřetržité cloudové zpracování důvod, proč většina komerčních systémů tuto možnost odmítá, ale to má cenu — nižší kvalitu a méně reaktivní Voice UI.

Kardome řeší tuto kompromis, přinášející silné, vždy zapnuté jazykové modely přímo na zařízení. S naší technologií je akustický scénář, přirozená řeč a kontext analyzovány v reálném čase přímo na zařízení. Žádná hlasová data nejsou nikdy nahrána nebo uložena. Tento inovativní přístup umožňuje Kardome nabízet jak robustní ochranu soukromí, tak vysoce efektivní Voice UI, eliminuje tak kompromis, se kterým se uživatelé目前 setkávají.

Pohled na širší průmysl, jaké jsou největší překážky, kterým hlasová AI stále musí čelit, než se stane dominantním rozhraním napříč spotřební elektronikou?

Největší překážkou je, že hlasová AI dosud nekomunikuje jako lidé. Dokud hlasová AI nebude schopna slyšet a rozumět jako lidé, s plným kontextovým povědomím a schopností pochopit konverzační tok, nestane se primárním rozhraním, které lidé chtějí. Značnou technickou překážkou je, že většina technologií Voice AI je založena na cloudu. To vnitřně brání nepřetržitému naslouchání a tím blokuje pochopení konverzačního toku.

Průlom nastane, až budou hlasové systémy schopny skutečně pochopit konverzační kontext a reagovat s toutéž intuitivní povědomím, které mají lidé. To je okamžik, kdy se hlas stane dominantním rozhraním napříč všemi spotřebními elektronikami.

Jak si myslíte, že se vztah spotřebitelů s hlasovými asistenty změní, až budou vyřešeny problémy s přesností a spolehlivostí v hlučném prostředí?

Jakmile budou spolehlivost a přirozená konverzace vyřešeny, hlasoví asistenti přejdou z novinek na nezbytná rozhraní, na která lidé denně spoléhají. Když lidé vědí, že hlasová AI bude rozumět jim správně poprvé, i v náročných prostředích, přestanou se přizpůsobovat technologii a začnou ji používat instinktivně s přirozeným jazykem a kontextuálními konverzacemi.

Budoucnost hlasové interakce bude prediktivní a proaktivní. Představte si, že vaše zařízení rozumí nejen vašim slovům, ale také vašemu tónu, emocionálním signálům a konverzačnímu subtextu. Současné systémy bojují s přirozeným rytmem konverzace a nemohou zvládnout přerušení, střídání a kontextuální pochopení. Lidé se přizpůsobují, když jsou přerušeni; hlasová AI se často zmátne. Pro OEM je výzvou integrovat hlasovou AI, která může dodat toto budoucí rozhraní bez složitosti a hardwarových požadavků dnešních řešení.

Nakonec, kde vidíte Kardome a ekosystém hlasové AI za pět let a jaké milníky budou určovat, zda jsme skutečně vstoupili do éry hlasově prvního počítačového zpracování?

Za pět let bude hlasová AI tak všudypřítomná jako dotykové displeje a klávesnice jsou dnes, a bude očekávána téměř ve všech výpočetních zařízeních. Kardome bude operačním systémem, který umožní uživatelům ovládat svá zařízení hlasem, umožňující přirozenou interakci s jakýmikoli zařízeními v jakémkoli prostředí, od robotů po chytré brýle, automobily.

Definující milníky budou behaviorální spíše než technologické. Budeme vědět, že jsme dosáhli hlasově prvního počítačového zpracování, až lidé přestanou myslet na hlasové příkazy a začnou mít přirozené konverzace se svým okolím, až budou multiuživatelská prostředí fungovat bezproblémově, a až děti vyrostou s očekáváním, že budou mluvit s jakýmikoli zařízeními přirozeně. Konečným měřítkem nebude, jak sofistikovaná naše technologie se stane, ale jak přirozeně lidé interagují s digitálním světem.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Kardome.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.